MiniMax Music 3.0 - MiniMaxのオープンソース音楽生成モデル
MiniMax Music 3.0は、MiniMaxの次世代オープンウェイト音楽生成モデルです。このモデルは、8BグローバルLLMと0.6BローカルLLMの階層構造を採用し、フローマッチングとフローVAEを組み合わせています。
MiniMax Music 3.0は、MiniMaxの次世代オープンウェイト音楽生成モデルです。このモデルは、8BグローバルLLMと0.6BローカルLLMの階層構造を採用し、フローマッチングとフローVAEを組み合わせています。
Wigoloは、MCPを介してClaude CodeやCursorなどのプログラミングエージェントと連携するオープンソースのローカル検索ツールです。APIキーは不要で、ローカル検索、Webスクレイピング、サイト全体のクローリング、構造化データ抽出など、あらゆる機能を無料で利用できます。
Gemini 3.7 Flashは、Google DeepMindの次世代フラッグシップAIモデルです。コーディングとエージェントワークフローに特化して設計されており、ソフトウェアエンジニアリング、Web開発、エンタープライズオートメーションなどのベンチマークにおいて、大きな飛躍を遂げています。
GLM-5.3は、Zhipuが開発した最新のオープンソース大規模基盤モデルです。GLM-5.2と同様に同じ基盤を利用し、トレーニング後の大幅なスケーリングによって知能の上限を大幅に向上させています。GLM-5.3は現在、最もプログラミング可能なオープンソースモデルです。
Grok 4.6はSpaceXAIの最新の主力大規模モデルであり、1.5Tのパラメータと50万トークンのコンテキストを誇ります。エンコードやエージェントのパフォーマンスを含むベンチマークテストにおけるその性能は、Claude Fable 5やGPT-5.6 Solに匹敵します。
LTX-2.5は、LTXが開発したオープンソースのAIビデオ生成基盤モデルで、リリース時点で22個のパラメータとオープンウェイトを備えています。このモデルは、ネイティブなマルチカメラ生成、4K HDR、RAW/EXRプロフェッショナルワークフローをサポートし、音声の同時生成も可能です。
PixelRAGは、バークレーのSkyLab/BAIRが開発したオープンソースのネイティブビジュアルRAGフレームワークです。従来のウェブページをプレーンテキストに抽出して取得するアプローチとは異なり、このフレームワークはブラウザを使用してウェブページやPDFをスクリーンショットタイルにレンダリングし、LoRAを使用して微調整します。
Grok BotはSpaceXAIが開発したAIエージェントシステムです。ユーザーのアカウントにログインし、まるで人間のようにウェブサイトやツールを操作して、クラウド上で24時間365日ユーザーのためにタスクを実行します。このシステムは複数のボットが並行して動作し、記録を行うなど、様々な機能をサポートしています。
dots.ttsは、Xiaohongshu dotsチームと上海交通大学X-LANCE Labが共同でオープンソース化した、20億個のパラメータを持つ完全連続自己回帰型音声合成基盤モデルです。このモデルは、連続潜在空間において48kHzの音声をブロックごとに直接生成します。
DeepSeek Harnessは、DeepSeekが開発したAIエージェントランタイムフレームワークであり、「モデル+ハーネス=エージェント」というコアコンセプトに基づいています。このフレームワークは、コンテキスト管理、ツール呼び出しオーケストレーション、実行サンドボックスなどのエンジニアリングモジュールを活用しています。
Nemotron 3.5 Lightningは、NVIDIAが提供する30個のパラメータを持つオープンソースのMoEモデルで、マルチエージェントシステム向けに最適化されています。類似モデルと比較して、出力速度が4倍速く、エージェントのタスク完了速度が30%向上しています。
HOMIEは、香港科技大学が開発したオープンソースのデジタルヒューマン動画生成フレームワークです。Wan2.1-T2V-14Bバックボーンネットワークをベースとし、Qwen3-VLマルチモーダル大規模モデルを統合しています。このフレームワークは、デジタルヒューマン、製品、ロゴ、テキストの4つの要素を統一的に処理できます。
PAST-Benchは、プリンストン大学のMengdi Wang氏のチームが開発したベンチマークテストで、パーソナルAIエージェントの再帰的な自己改善能力を検証することを目的としています。PAST-Benchは、記憶ありと記憶なしの条件下でのタスクパフォーマンスを比較し、…
ShotcutはFFmpegをベースにしたオープンソースの動画編集ソフトウェアです。完全無料で、ウォーターマークも表示されず、再生時間にも制限がありません。数百種類のオーディオおよびビデオフォーマットに対応しており、インポートせずに直接編集できます。また、マルチトラックタイムライン、キーフレームアニメーション、豊富な機能を備えています。
Palmier Proは、AI時代に向けてSwiftでゼロから開発されたmacOSネイティブのビデオエディターです。オープンソースであり、基本機能は無料で利用できます。この製品は生成AIをタイムラインに直接組み込み、Seedance、Klingなどをサポートしています。
GPT-5.6-Cyberは、OpenAIがサイバーセキュリティ専用に開発したAIモデルです。GPT-5.6 Solをベースに、脆弱性の悪用や権限昇格といった特殊なタスク向けに強化されています。このモデルは、Daybreak Redレベルの監査顧客のみが利用可能で、…
Muse Glimmerは、Meta社が開発したオープンソースの言語モデルで、300億個のパラメータを持ち、24時間365日稼働するローカルエージェントのワークフロー向けに高度に最適化されています。このモデルは4ビット量子化技術を採用しており、24GBのVRAMを搭載した単一のGPUでも動作可能です。
SmartSubは、音声と動画の字幕作成のためのオープンソースのオールインワンデスクトップツールです。ワークフロー全体を単一のアプリケーションに統合し、Whisper、FunASR、Qwen3-ASRなどのローカルモデルに基づいたオフライン音声テキスト変換を提供し、2...
Wan-Animate-2は、Wanxiangチームがオープンソース化した新世代のキャラクターアニメーションモデルです。Wan-Animateの大幅なアーキテクチャアップグレードとして、明示的なポーズスケルトンと補助的なポーズ抽出ネットワークへの依存を廃止し、エンドツーエンドのデュアルブランチアーキテクチャを採用しています。
Grok Imagine Image 2.0は、SpaceXAIがリリースした新世代の画像生成・編集モデルで、grokウェブプラットフォームおよびiOS/Androidアプリの「クオリティモード」で利用可能です。これは単なる「画像の再選択」以上のものです。
SALMONN-2は、清華大学、上海人工知能研究所、ケンブリッジ大学が共同でオープンソース化した汎用音声言語モデルです。ByteDanceのSPEAR統合自己教師あり音声エンコーダと多層特徴融合アダプタをベースに構築されており、...
Wan3.0は、アリババクラウド万向チームが発表した最新の動画生成モデルです。生成時間、多様な作成機能、包括的な参照機能、リアリティなど、あらゆる面で大幅にアップグレードされています。1回の実行で30秒の動画を生成でき、doc、xlsなどのフォーマットにも初めて対応しました。
Hunyuan3D-Buffalo 1.0は、Tencent Hunyuanが開発した統合型3Dマルチモーダルフレームワークです。共通のHunyuan3D-VLMバックボーンを通じて、3D質問応答、空間測位、テキストベース3D、指示編集、コンポーネント生成を単一のプロセスに統合します。
InstructAV2AVは、北京人工知能研究院と北京大学が共同開発した音声・動画共同編集モデルです。ユーザーは、エンドツーエンドの生成プロセスにおいて、たった1つの自然言語コマンドだけで、動画映像とそれに対応するコンテンツを同時に編集できます。