StepAudio R1 - StepAudioのオープンソースネイティブオーディオ推論モデル
StepAudio R1は、StepAudioチームによって開発された、世界初のオープンソースのネイティブオーディオ推論モデルです。このモデルは、革新的なモーダルアンカー推論蒸留(MGRD)フレームワークにより、複雑な推論シナリオにおける従来のオーディオモデルのパフォーマンス低下に対処します。
StepAudio R1は、StepAudioチームによって開発された、世界初のオープンソースのネイティブオーディオ推論モデルです。このモデルは、革新的なモーダルアンカー推論蒸留(MGRD)フレームワークにより、複雑な推論シナリオにおける従来のオーディオモデルのパフォーマンス低下に対処します。
Itoは、独自の「VibeTyping」技術を用いてユーザーの発話意図を美しく整形されたテキストに変換するオープンソースのインテリジェント音声認識ツールです。メールクライアント、文書処理、チャットプラットフォーム、ブラウザ、コードエディタなど、様々なプラットフォームに対応しています。
GELab-Zeroは、StepFunが開発したオープンソースのGUIエージェントモデルで、モバイルデバイス上での自動化されたインタラクションとタスク実行に重点を置いています。ローカル展開が可能で、コンシューマーグレードのハードウェア上で4Bモデルを実行でき、低遅延を実現します。
Vidi2は、ByteDanceが開発したマルチモーダルな大規模言語モデルで、動画の理解と作成に特化しています。マルチモーダルな時間的検索(TR)において業界トップクラスの性能を達成しており、時空間的位置特定(STG)や動画質問応答(Video QA)においても優れた性能を発揮します。
Keling O1(Keling Video O1 Model)は、Keling AIが開発した世界初の統合型マルチモーダル動画生成モデルです。このモデルは、革新的なマルチモーダル視覚言語(MVL)アーキテクチャを通じて、動画の生成、編集、理解をシームレスに統合します。
Gen-4.5はRunWayが開発したビデオ生成モデルです。このモデルは、ビデオ生成における動きの品質、視覚的なリアリズム、キューワードの遵守において、業界の新たな基準を打ち立てます。Gen-4.5は、映画のような、極めてリアルな映像を生成できます。
PixVerse V5.5は、PixVerse Technologyが開発した大規模映像生成モデルです。独自開発のマルチモーダル認識・生成技術により、音声と映像の同時生成をサポートし、企画から最終製品までの複雑なワークフローを簡素化し、クリエイティブな効率性を向上させます。
Alpamayo-R1 (AR1) は、NVIDIA が開発したビジュアル言語アクション (VLA) モデルで、因果推論によって自動運転の意思決定能力と汎化性能を向上させます。このモデルの主要なイノベーションには、CoC (CoC) データセットの構築などが含まれます。
NEOは、SenseTimeと南洋理工大学が共同開発した革新的なマルチモーダルモデルアーキテクチャです。初のネイティブマルチモーダルアーキテクチャ(ネイティブVLM)として、NEOは基盤となるアーキテクチャの抜本的な革新により、従来のマルチモーダルモデルの限界を打ち破ります。
Mistral 3は、Mistral AIによる新世代のオープンソースAIモデルであり、小型のMinistral 3(3B、8B、14Bパラメータ)と大型のMistral Large 3(合計675Bパラメータ、41B活性化パラメータなど)が含まれます。
Amazon Nova 2 は、Amazon Web Services (AWS) が提供する、多様な企業ニーズに対応する高度な AI モデル群です。Amazon Nova 2 ファミリーには、Nova 2 Lite (コスト最適化されたテキスト生成)
MemMachineは、AIエージェント向けに特別に設計されたオープンソースのAIメモリシステムであり、短期記憶、長期記憶、およびパーソナライズされた記憶機能を提供します。MemMachineは、エピソード記憶、意味記憶、およびユーザープロファイルメモリを通じて、AIアプリケーションが情報を学習および保存するのに役立ちます。
TalkCodyは、開発者がより効率的にソフトウェアを構築できるよう支援するオープンソースのAIプログラミングアシスタントです。RustとTauriで構築されており、ネイティブなパフォーマンスと低いリソース消費を誇ります。TalkCodyは、複数のモデル間のシームレスな切り替えをサポートし、...
Seedream 4.5(Doubao-Seedream-4.5)は、ByteDanceが開発した画像生成モデルで、特に商用生産性シナリオ向けに設計されています。このモデルは、被写体の一貫性、指示の正確性、空間論理、美的表現力において優れています。
Keling 2.6は、Keling AIチームが開発した革新的なAI動画作成モデルです。音声と映像の同期生成を実現し、テキストまたは画像を入力として、自然な音声、適切な効果音、環境音を含む動画を自動生成できます。
Flowraは、ModelScopeがWuliチームと共同開発したオープンソースのAIワークフロー開発ツールです。FlowBenchの中核となるエンジンです。このツールは、グラフ実行エンジンとノードパッケージ開発ツールチェーンを提供し、豊富な型システムをサポートしています。
Gemini 3 Deep Thinkは、Google DeepMindが開発した強力な推論モデルです。並列思考が可能で、複数の仮説を同時に検討し、最適な解答経路を選択できます。
Workspace Studioは、Googleが提供するAI自動化ツールです。ユーザーは自然言語でタスクを記述し、Geminiモデルに基づいてカスタマイズされたAIエージェントを迅速に生成することで、複雑なワークフローを自動化できます。このツールは…
RoboCOINは、北京人工知能研究院が複数の大学や企業と共同で公開した、身体化された知能データセットです。家庭、ビジネス、工場など、421のタスクと16の異なるシナリオを網羅した18万を超えるデモンストレーションデータポイントが含まれています。
NewBie-image-Exp0.1は、NewBieAi Labが開発したオープンソースの実験的な画像生成モデルで、35億個のパラメータを持つNext-DiTアーキテクチャに基づいています。このモデルは、完全なdan + 1m e621データセットで事前学習されており、...
Hunyuan 2.0は、テンセントの最新の高度なAI言語モデルであり、Tencent HY 2.0 ThinkとTencent HY 2.0 Instructの2つのバージョンで構成されています。ハイブリッドエキスパート(MoE)アーキテクチャを採用し、合計4060億個のパラメータを誇ります。
LongCat-Imageは、Meituanがオープンソース化した高性能画像生成モデルであり、わずか60億個のパラメータでテキストベースの画像生成と画像編集において最高レベルのオープンソース性能を実現しています。このモデルは革新的なアーキテクチャと学習戦略を採用し、高品質な中国語テキストレンダリングをサポートしています。
GLM-4.6Vは、Zhipuが発売したマルチモーダル大型モデルで、クラウドおよび高性能クラスタシナリオ向けの基本バージョンGLM-4.6V(106B-A12B)と、ローカル展開および低遅延アプリケーション向けの軽量バージョンGLM-4.6V-Flash(9B)が含まれています。
Open-AutoGLMは、Zhipuが開発したオープンソースのモバイルインテリジェントアシスタントフレームワークで、AutoGLMをベースに構築されており、自然言語コマンドによる携帯電話の操作を自動化します。Open-AutoGLMは、電話使用機能フレームワークを利用して自然言語を統合します。