Step 3.5 Flash - Step Star社による最新のオープンソースベースモデル。
Step 3.5 Flashは、StepStarが提供する最新のオープンソース基盤モデルであり、エージェントシナリオ向けに特別に設計されています。このモデルは、合計1960億個のパラメータを持つ疎なMoEアーキテクチャを採用しており、各トークンがアクティブ化するパラメータはわずか110億個であるため、パフォーマンスと効率のバランスが取れています。
Step 3.5 Flashは、StepStarが提供する最新のオープンソース基盤モデルであり、エージェントシナリオ向けに特別に設計されています。このモデルは、合計1960億個のパラメータを持つ疎なMoEアーキテクチャを採用しており、各トークンがアクティブ化するパラメータはわずか110億個であるため、パフォーマンスと効率のバランスが取れています。
Vidu Q3は、Shengshu Technology社が発表した、音声と映像が同期した世界初の16秒AI動画モデルです。短編ドラマ、漫画、CMなどの物語性のあるシナリオ向けに特化して設計されています。たった1つの指示だけで、映像、セリフ、環境を完璧に捉えた16秒の1080p動画を制作できます。
UnifoLM-VLA-0は、Unitree Roboticsがオープンソース化した汎用的なビジョン・言語・アクション(VLA)大規模モデルであり、継続的な事前学習のためにQwen2.5-VL-7Bアーキテクチャに基づいています。
TTT-Discover(Test-Time Training to Discover)は、スタンフォード大学やNVIDIAなどの機関によって開発されたAI科学的発見手法です。TTT-Discoverは、テスト段階で強化学習を用いてモデルを訓練し、重みを固定しません。
Project Genieは、Google DeepMindが立ち上げた実験的なAIワールドモデルのプロトタイプであり、Genie 3、Nano Banana Pro、Geminiの技術を基盤としています。ユーザーはテキストプロンプトやアップロードした画像を使って仮想世界を作成できます。
LingBot-Worldは、Ant Lingbo Technologyが開発したオープンソースのインタラクティブな世界モデルです。このモデルは、スケーラブルなデータエンジンを通して大規模なゲーム環境から物理法則と因果関係を学習し、正確なアクション駆動型生成を可能にします。
Qwen3-ASRは、アリババクラウドの同義千文チームが開発したオープンソースの音声認識モデルシリーズです。1.7Bの高精度バージョンと0.6Bの高効率バージョンの2つのASRモデルに加え、専用の強制アライメントモデルであるQwen3-ForcedAligner-0.6Bが含まれています。
SenseNova-MARSは、SenseTime社が開発したオープンソースのマルチモーダル自律推論モデルで、8Bと32Bの2つのパラメータスケールを提供します。動的な視覚推論と画像/テキスト検索のディープフュージョンをサポートする初のエージェント型VLMとして、このモデルはインテリジェントエージェントのように機能します。
MOVA(MOSS Video and Audio)は、上海イノベーションアカデミーのOpenMOSSチームとMOSIが共同で発表した、中国初の高性能オープンソースのエンドツーエンド音声・映像生成モデルです。このモデルは、従来のビデオの「ミュート」の限界を打破します。
SkyReels-V3は、Kunlun Wanweiが開発したオープンソースのマルチモーダル動画生成モデルで、単一のアーキテクチャでプロレベルの動画制作を可能にします。このモデルは静止画を動的な映像に変換でき、インテリジェントな動画長の拡張や映画のようなトランジションをサポートし、…
LongCat-Flash-Liteは、美団が発表した次世代の高効率大規模言語モデルです。このモデルは、革新的なハイブリッドエキスパート(MoE)+Nグラム埋め込みアーキテクチャを採用しており、合計685億個のパラメータを持ちながら、推論ステップごとに約29億~45億個のパラメータのみを有効化します。
MiniMax-M2-herは、MiniMaxが開発した、AIとの深い関係性を想定したロールプレイングモデルであり、Hoshino/Talkieの基盤となるモデルです。このモデルは、独自のワールド体験、リズミカルなストーリー展開、そして…という3つのコア機能を活用しています。
MiniMax Music 2.5は、MiniMaxの次世代AI音楽制作モデルであり、「段落レベルでの強力な制御」と「物理レベルでの高忠実度」という2つの主要な技術的課題において画期的な成果を達成しました。このモデルは、14種類の音楽構造タグ(イントロなど)をサポートしています。
Mureka V8は、崑崙万威が開発したAI音楽ビッグモデルです。MusiCoT(音楽思考連鎖)技術アーキテクチャに基づき、音の合成から人間のような創造的な論理へと飛躍的な進化を遂げています。
DeepSpeed-MIIは、DeepSpeedチームが開発したオープンソースのPythonライブラリで、効率的なモデル推論を実現します。DeepSpeed-MIIは、ブロッキングキーバリューキャッシュ、シーケンシャルバッチ処理、動的SplitFuseなどの革新的な技術を用いて、推論パフォーマンスを大幅に向上させます。
Decart AIが開発したLucy 2.0は、リアルタイムの世界変換モデルであり、高精細なビデオ編集をオフラインレンダリングからインタラクティブなリアルタイム体験へと飛躍させることを可能にする。
NVIDIA Earth-2は、NVIDIA初の完全オープンソースAI気象予報モデルファミリーであり、Atlas、StormScope、HealDAという3つのコアアーキテクチャに基づいており、15日間の世界規模の中期予報、0~6日間の降雨量予測などを実現しています。
Kimi K2.5は、Dark Side of the Moonの最新世代のオールラウンドなフラッグシップモデルであり、約15TBのビジュアルデータとテキストデータで学習されています。最高レベルのコード生成機能とビジュアル理解機能を誇り、自律エージェントクラスタの連携をサポートします。
DeepSeek-OCR 2は、DeepSeekチームがリリースした第2世代OCRモデルです。DeepEncoder V2アーキテクチャを導入することで、固定スキャンから意味推論へのパラダイムシフトを実現しています。このモデルは、因果ストリームクエリとデュアルストリームインジェクションを採用しています。
LingBot-Depthは、Ant Lingbo Technologyが開発したオープンソースの高精度空間認識モデルであり、透明で反射性の高い物体(ガラスなど)におけるロボットの奥行き認識という課題を解決するために設計されています。
Vidu Q2 Reference Proは、世界初の「あらゆるものを参照可能」なビデオモデルであり、マルチモーダル入力(ビデオ2本と画像4枚)をサポートすることで、クリエイターに強力な機能を提供します。
White Tiger-VTouchは、世界初にして最大のクロスボディ視覚・触覚マルチモーダルデータセットであり、国立地方共同建設ヒューマノイドロボットイノベーションセンターがVTouch Roboticsと共同でオープンソース化したものです。このデータセットには、視覚・触覚センサーデータ、RGB-Dデータなどが含まれています。
TensorRT LLMは、NVIDIAが開発した、NVIDIA GPU上で大規模言語モデル(LLM)の推論パフォーマンスを向上させるフレームワークです。PyTorchアーキテクチャをベースとしたTensorRT LLMは、効率的で使いやすいPython APIを提供します。
Qwen3-Max-Thinkingは、アリババが開発した「千の質問」プラットフォーム向けの最新の主力推論モデルであり、1兆を超えるパラメータと36TBの事前学習済みトークンを誇ります。テスト時のスケーリングと強化学習により、このモデルは推論性能と効率を大幅に向上させています。