ZipVoice - Xiaomiのゼロショット音声合成モデル
ZipVoiceは、Xiaomi AI Labがリリースした高効率ゼロショット音声合成(TTS)モデルです。このモデルはフローマッチングアーキテクチャに基づいており、ZipVoice(単一話者)とZipVoice-Dialog(対話)が含まれています。
ZipVoiceは、Xiaomi AI Labがリリースした高効率ゼロショット音声合成(TTS)モデルです。このモデルはフローマッチングアーキテクチャに基づいており、ZipVoice(単一話者)とZipVoice-Dialog(対話)が含まれています。
PP-OCRv5は、Baiduが開発した高効率かつ高精度なテキスト認識モデルです。このモデルは2段階の処理フローに基づいており、画像内のテキストを高速かつ高精度に検出・認識するために特別に設計されています。
Stable Audio 2.5は、Stability AIが開発した最新の音声生成モデルで、企業レベルのサウンド制作向けに特別に設計されています。このモデルは、高速生成(わずか2秒で3分間の音声を生成)、ダイナミックな音楽制作、および音声復元機能を備えています。
Live Interpreter API は、Azure Speech Translate の新機能で、リアルタイムの多言語音声翻訳を可能にします。ユーザーが入力言語を手動で設定する必要はなく、Live Interpreter API は使用されている言語を自動的かつ継続的に認識します。
Youtu-GraphRAGは、Tencent YouTu Labが開発したオープンソースのグラフ検索強化・生成フレームワークです。知識をグラフに整理し、それを大規模な言語モデルと組み合わせることで、検索と推論を可能にし、モデルが複雑な質問により正確に答えられるようにするとともに、不要な情報を削減します。
ERNIE-4.5-21B-A3B-Thinkingは、Baiduが開発した推論タスクに特化した大規模言語モデルです。ハイブリッドエキスパート(MoE)アーキテクチャを採用し、合計210億個のパラメータを持ち、各トークンが30億個のパラメータをアクティブ化し、最大128Kの長い文字列をサポートしています。
FunAudio-ASRは、Alibaba DAMO Academyが開発したエンドツーエンドの音声認識モデルであり、企業導入における主要な課題を解決するために設計されています。革新的なコンテキスト強化モジュールにより、「錯覚」や「言語の相互参照」を効果的に抑制します。
GPT-5-Codexは、OpenAIが開発したプログラミング向けに最適化されたモデルで、GPT-5をさらに強化したものです。このモデルは、ゼロからプロジェクトを構築する、コードのリファクタリング、デバッグ、テスト、コードなど、現実世界のソフトウェアエンジニアリングタスクに重点を置いています。
ROMA(Recursive Open Meta-Agent)は、Sentient AGIチームが開発したオープンソースのマルチエージェントシステムフレームワークです。再帰的な階層構造を用いて複雑なタスクを並列処理可能なサブタスクに分解し、親ノードから子ノードへ実行を割り当てます。
Grok 4 Fastは、xAIが開発したAIモデルの高速版です。最大の特徴は応答速度の速さで、標準版の最大10倍の速度で毎秒75トークンを生成できます。簡単なクエリ、基本的なコード生成、その他のタスクを迅速に完了できます。
Mini-o3は、ByteDanceと香港大学が共同開発したオープンソースモデルで、複雑な視覚検索問題を解決するために特別に設計されています。強化学習と画像ベースのツールを通して、このモデルは深層かつ多段階の推論を実行でき、推論ラウンド数は調整可能です。
Lumina-DiMOOは、上海人工知能研究所をはじめとする複数の機関がオープンソース化した次世代マルチモーダル生成・理解モデルです。このモデルは、テキストや画像などのマルチモーダルデータを均一に処理するために、完全離散拡散アーキテクチャを採用しており、テキストから画像への生成をサポートしています。
UnifoLM-WMA-0は、複数のロボットタイプに対応したオープンソースのワールドモデルおよびモーションアーキテクチャであり、特に汎用ロボット学習向けに設計されています。その中核となるのはワールドモデルであり、ロボットとその環境間の物理的な相互作用を理解し、シミュレーション機能を備えています。
InfiniteTalkは、美団のビジュアルインテリジェンス部門が開発した、デジタルヒューマン主導型の新しい技術です。スパースフレーム動画吹き替えパラダイムを採用することで、少数のキーフレームのみでデジタルヒューマンを駆動し、自然で滑らかな動画を生成することが可能となり、従来の技術における音声吹き替えの問題を解決します。
ReSumは、Alibaba Tongyiが発表した新しいWebAgent推論パラダイムであり、Tongyi DeepResearchファミリーに属しています。これは、WebAgentが長期的事実把握タスクで直面するコンテキスト長制限の問題を、インタラクション履歴を定期的に精緻化することで解決します。
LLaSO(大規模言語音声モデル)は、北京ディープロジックインテリジェンステクノロジー社が開発した、世界初の完全オープンソース音声モデルです。大規模言語音声モデル(LSLM)分野における長年の課題に取り組んでいます。
Nano Bananaryは、Google Gemini画像モデルに基づいて開発されたオープンソースの画像編集ツールです。中国語インターフェースと明るさ/暗さのテーマ切り替えに対応しており、複雑な操作なしで50種類以上の画像変換効果を提供します。
PromptEnhancerは、TencentのHunyuanチームが開発した、テキストから画像への変換(T2I)モデルの改善を目的としたオープンソースの提案書き換えフレームワークです。思考連鎖(CoT)提案書き換えと、AlignEvalという専用の報酬モデルを利用しています。
VLACは、上海人工知能研究所が発表した、具現化された報酬モデルです。InternVLマルチモーダルモデルをベースに、インターネット動画データとロボット動作データを統合し、現実世界におけるロボットの強化学習を提供します。
RustGPTは、Rustで記述されたTransformerアーキテクチャ言語モデルです。RustGPTはゼロから構築されており、外部の機械学習フレームワークに依存せず、行列演算にはndarrayのみを使用します。
Tongyi DeepResearchは、アリババが開発したオープンソースの深層学習エージェントで、特に長期にわたる深層情報検索タスク向けに設計されています。300億個のパラメータを誇り、セッションごとに30億個のパラメータをアクティブ化し、ReActモードと深層学習をサポートしています。
WebResearcherは、アリババ傘下のTongyi Labsが開発した反復型深層研究エージェントであり、Tongyi DeepResearchファミリーに属しています。革新的な反復型深層研究パラダイムに基づき、人間の専門家の認知ワークフローをシミュレートし、…
WebWeaverは、アリババのTongyiチームが開発した新しいデュアルエージェントフレームワークで、Tongyi DeepResearchファミリーに属し、オープンエンド型の深層研究に使用されます。WebWeaverは人間の研究プロセスをシミュレートし、タスクを計画(探索、分析、評価)に分割します。
MCP RegistryはGitHubが立ち上げた集中型プラットフォームで、開発者がMCPサーバーを一元的に検索・インストールできる仕組みを提供します。このプラットフォームは、MCPサーバーが複数のレジストリ、ランダムなリポジトリ、コミュニティの議論などに分散しているという問題を解決します。