AI Fusion Videoは、オープンソースのエンドツーエンドAIビデオ制作プラットフォームであり、エージェントベースのアーキテクチャを使用して、脚本作成からビデオ生成までのワークフローを自動化します。
AI Fusion Videoは、オープンソースのエンドツーエンドAIビデオ制作プラットフォームであり、エージェントベースのアーキテクチャを使用して、脚本作成からビデオ生成までのワークフローを自動化します。
Fun-ASR 1.5は、アリ・トンイーチームが開発したエンドツーエンド音声認識モデルの次世代版です。単一のモデルで30言語の高精度認識をサポートし、7つの主要な中国語方言体系と20以上の地域方言を網羅しています。また、中国古典詩に特化した最適化も施されています。
LenovoのTianxi AI Clawは、OpenClawアーキテクチャをベースにした、すぐに使えるAIアシスタントです。ハイブリッドエッジクラウド展開モデルを採用し、PC、スマートフォン、タブレット間でのシームレスなコラボレーションをサポートします。このツールはローカル環境の設定を必要とせず、24時間365日稼働可能です。
HyperFramesは、HeyGenが開発したオープンソースのAIネイティブビデオレンダリングフレームワークです。「HTMLを書き込み、ビデオをレンダリングする」という原則を採用し、AIエージェントと開発者向けに特化して設計されています。このフレームワークは、data-*属性を使用してビデオをHTMLファイルとして定義します。
Audio Flamingo Nextは、NVIDIAとメリーランド大学が共同でオープンソース化した次世代オーディオ言語モデル(LALM)です。Audio Flamingoシリーズの最新バージョンとして、最大30分の長さの複雑なオーディオ入力をサポートし、…
Voiceboxは、オープンソースのネイティブ音声合成ツールであり、Tauri(Rust)とReactをベースに構築されたクロスプラットフォームのデスクトップアプリケーションです。このツールは、音声クローン、テキスト読み上げ、音声後処理、マルチトラックナレーション編集機能を提供します。
LingBot-Mapは、Antminer Lingbo Technology社が開発したオープンソースのストリーミング3D再構築モデルです。通常のRGBカメラでも、動画撮影中にリアルタイムでカメラ姿勢推定とシーンの3D構造再構築を行うことができます。
Claude Opus 4.7は、Anthropic社の最新の主力大規模モデルであり、Claude Opus 4.6からの直接的なアップグレード版です。このモデルは高度なソフトウェアエンジニアリングタスクに優れており、SWE-bench Proスコアは64.3を達成しています。
Qwen3.6-35B-A3Bは、アリババの同義千文チームが開発したオープンソースのハイブリッドエキスパート(MoE)モデルです。パラメータ総数は350億個、活性化パラメータは30億個です。このモデルは、極めて高い推論効率とエージェントプログラミング機能に重点を置いており、複数のプログラミングベンチマークで高いパフォーマンスを実現しています。
GPT-Rosalindは、OpenAIが開発した生命科学に特化した推論モデルで、DNA二重らせん構造の発見者であるロザリンド・フランクリンにちなんで名付けられました。このモデルは50種類の生物学的ワークフローに最適化されており、仮説生成や実験計画などの機能を備えています。
GPT-image-2はOpenAIの次世代ネイティブ画像生成モデルで、内部コードネームは「Spud」と噂されており、現在ChatGPT上でグレースケールテストが行われている。このモデルは「maskingtape-alpha」などのコードネームで2026年4月上旬に正式リリースされる予定だ。
Relaxは、Xiaohongshu AIプラットフォームチームが開発したオープンソースの強化学習トレーニングエンジンで、あらゆるモダリティとエージェントのシナリオにおける大規模モデル強化学習向けに設計されています。Megatron-LMとSGLangをベースに構築されており、サービス指向の耐障害性アーキテクチャ(Ray Service...)を採用しています。
Gemini 3.1 Flash TTSは、Googleの次世代テキスト読み上げモデルであり、操作性、表現力、音質が向上しています。このモデルは70以上の言語に対応し、音声タグ付け技術を組み込んでおり、自然言語コマンドで正確に制御できます。
HY-World 2.0は、Tencent Hunyuanが開発したオープンソースのマルチモーダルワールドモデルです。テキスト、単一画像、複数ビュー、またはビデオから、移動可能な3Dガウススパッタリング(3DGS)シーンの生成をサポートしています。このモデルは4つの要素を使用しています...
HappyOysterは、アリババのATHイノベーション事業部が立ち上げたオープンワールド型製品で、リアルタイムでの構築とインタラクションが可能なAI生成型体験プラットフォームとして位置づけられています。ワールドモデル技術に基づき、無限に拡張可能なリアルタイムコンテンツ生成をサポートします。
StepAudio 2.5 TTSは、StepAudioが発表したコンテキスト認識型音声合成モデル(Context-Aware Speech Synthesis Model)であり、音声生成プロセス全体に初めてコンテキスト理解機能を導入したものです。
Marble 1.1は、Fei-Fei Li氏のWorld Labsが開発した次世代ジェネレーティブワールドモデルで、主に画像品質の最適化に重点を置いています。このモデルは、単一の画像、動画、またはパノラマビューを、自由に探索できる没入型の3Dシーンに変換し、照明を大幅に改善します。
MAI-Image-2-Efficientは、マイクロソフトが独自開発したテキストから画像への変換モデルです。MAI-Image-2の軽量かつ効率的なバージョンであり、競争力のある価格で高性能な商用量産向けに設計されています。フォトリアリスティックな画像品質を維持しながら、コストを41%削減します。
SearchClawは、中国人民大学情報検索研究所(RUC-NLPIR)が開発した、自己ホスト型のAI深層研究エージェントであり、ウェブベースの対話型インターフェースを備えています。ユーザーが質問を送信すると、システムは自動的に複数回のウェブ検索を実行します。
Spark 2.0は、World Labs(Fei-Fei Li氏が設立)が開発したオープンソースのWebベースの3Dガウス・スパッタリングレンダリングエンジンで、Three.jsとWebGL2をベースに構築されています。Spark 2.0は、LoD(Level of Detail)システム、プログレッシブストリーミング、仮想メモリなどの機能を先駆けて導入しました。
ERNIE-Imageは、Baidu Wenxinチームが開発したオープンソースの8Bパラメータテキストベース画像モデルです。拡散トランスフォーマーアーキテクチャに基づいており、長文テキストの高い制御性と正確なレンダリングに重点を置いています。
OmniShowは、ByteDanceが香港中文大学、モナシュ大学、香港大学と共同でオープンソース化した、マルチモーダルな人間と物体のインタラクション動画生成モデルです。RAP2V(参照画像+音声+姿勢)をサポートする初のエンドツーエンドフレームワークとして、このモデルはテキストを均一に処理します。
Mano-P 1.0は、Minglue Technologyが開発したオープンソースのGUI-VLAインテリジェントエージェントモデルです。完全にビジョン駆動型で、APIを必要とせずにデスクトップソフトウェアやWebインターフェースを直接制御できます。このモデルは、72Bのフルバージョンと4Bの量子化バージョンを提供し、Apple M4チップ上でのローカル動作をサポートしています。
HeyGen CLIは、HeyGenがリリースした公式コマンドラインツールおよびMCPサーバーであり、モデルコンテキストプロトコルに基づいて構築されています。このツールを使用すると、開発者やAIアシスタント(ClaudeやCursorなど)は、自然言語を介してコマンドを直接呼び出すことができます。