MOSS-VL-Realtime - OpenMOSS オープンソースのビジュアル言語モデル
MOSS-VL-Realtimeは、OpenMOSSが開発したオープンソースの11パラメータストリーミング視覚言語モデルで、リアルタイムビデオ理解のために特別に設計されています。このモデルは、オンザフライ応答、リアルタイム修正、アクティブミュートをサポートし、録画を見るだけのビデオ理解から、より高度なビデオ理解へと進化させます。
MOSS-VL-Realtimeは、OpenMOSSが開発したオープンソースの11パラメータストリーミング視覚言語モデルで、リアルタイムビデオ理解のために特別に設計されています。このモデルは、オンザフライ応答、リアルタイム修正、アクティブミュートをサポートし、録画を見るだけのビデオ理解から、より高度なビデオ理解へと進化させます。
StepAmooは、Step AOSが開発した新世代のパーソナルインテリジェントエージェントであり、Step AOSインテリジェントエージェントネイティブオペレーティングシステムをベースとしており、オペレーティングシステムレベルのアイデンティティを備えています。StepAmooは、知覚、記憶、計画、接続、実行という5つのコア機能を備えています。
AnySearchは、AIエージェント向けに特別に設計されたリアルタイム構造化検索エンジンで、API、MCP、およびスキルを介してアクセスできます。この製品は、コード、法律、その他20以上の業種を含む一般的なWebページとデータソースを網羅しています。
PixVerse Gameは、iSpeed Technologyが開発した初のリアルタイムビデオゲームエンジンです。PixVerse R1リアルタイムワールドモデルをベースに構築されており、単一のリアルタイムインタラクティブビデオストリーム上で完全なゲーム体験を実現し、クリエイターがゲームを自由に定義できるようにします。
HyOCR-1.5は、テンセント・フンユアンがオープンソース化した軽量エンドツーエンドOCRエキスパートモデルです。わずか10億個のパラメータで、文書解析、テキスト認識、情報抽出、画像翻訳、チャート解析、古代文字認識、動画字幕抽出など、幅広い処理を実行できます。
SenseNova-Visionは、SenseTimeがオープンソース化した統合ビジョンモデルであり、物体検出、画像セグメンテーション、深度予測、3D再構成といった従来のビジョンタスクを大規模なモデルベースにネイティブに統合しています。
Agnes-2.5-Flashは、Agnes AIが発表した次世代の高性能テキストモデルです。そのコーディング能力は世界トップクラスに位置づけられ、コード理解、コード修復、複数ステップのタスク実行、複雑な推論において大幅な改善が見られます。
Step Edgeは、StepStar社が提供するエッジモデルの包括的なスイートであり、基本モデル、オーディオ、GUI、およびGenという4つの主要コンポーネントで構成され、携帯電話、自動車、その他の端末向けに設計されています。
SeFi-Imageは、セマンティックファースト拡散に基づくテキストから画像への変換モデルであり、1B、2B、5Bの仕様を提供します。このモデルは、高レベルのセマンティック構造とテクスチャの詳細を分離することで、セマンティックストリームの事前ノイズ除去を可能にし、テクスチャ生成のための明確な構造を提供します。
DramaClawは、産業グレードのAIGCビデオ制作ツールであり、主にAI短編ドラマ、漫画、小説レビュー、ナレーションドラマなど、さまざまなビデオ制作シナリオ向けに設計されています。
LingBot-VA 2.0は、Ant Lingbo社が発表した業界初の、身体化されたネイティブワールド動作モデルです。自己回帰アーキテクチャに基づいており、ゼロから事前学習されているため、ロボットは「推論と行動を同時に行う」という汎用的な制御能力を備えています。
KAT-Coder-Pro V2.5は、Kuaishou傘下のKwaiKATが発表した主力エージェントコーディングモデルであり、長期的なエンジニアリング能力、汎用的なエージェント能力、大規模なエージェント強化学習という3つの側面で画期的な成果を上げています。
Agents-A1は、上海AIラボが開発したオープンソースの35パラメータハイブリッドエキスパート(MoE)インテリジェントエージェントモデルで、複雑な科学研究タスク向けに特別に設計されています。このモデルは、知識-行動グラフを通じて検証可能な長期軌跡インフラストラクチャを構築し、3段階の多専門化機能を備えています。
LingBot-VLA 2.0は、AntLingbo Technologyがオープンソース化した新世代の具現化されたインテリジェントベースモデルです。50,000時間の実機データと10,000時間の人間操作データを含む、60,000時間分の事前学習データに基づいており、17ブランドの20種類のロボットを網羅しています。
SensorFMは、Google Researchが開発した、ウェアラブルヘルスデータのための大規模センサー基盤モデルです。500万人の参加者から得られた1兆分を超えるラベルフリーのマルチモーダルセンサーデータを使用して事前学習されており、一般的な生物学的特性を学習します。
LingBot-Videoは、Antminerが開発した、世界初のオープンソースのMoE(Mountained Intelligence)ビデオ生成基盤モデルです。DiT(Diuntain Data)とMoEアーキテクチャをベースとしたこのモデルは、合計300億個のパラメータを持ち、そのうち約30億個のみが有効化されており、大容量と効率的な推論のバランスが取れています。
Seedream 5.0 Proは、ByteDanceのSeedチームが開発したマルチモーダル画像作成モデルで、複雑かつプロフェッショナルなシナリオ向けに特別に設計されています。このモデルは、画像とテキストのマッチング、テキストレンダリング、および全体的な美的魅力において包括的なアップグレードを特徴としており、複雑な処理を含む主要なブレークスルーを備えています。
Grok 4.5は、SpaceXAI(旧xAI)の次世代フラッグシップ大規模言語モデルであり、1.5兆パラメータのV9アーキテクチャに基づいています。補足トレーニングフェーズでは、モデルはカーソルプログラミングデータを深く統合し、コード生成とソフトウェア開発を大幅に強化します。
GPT-LiveはOpenAIが開発した次世代音声モデルで、全二重アーキテクチャを採用することで同時聴取と発話を実現し、発話、聴取、割り込み、ツール使用などに関して毎秒複数回の判断を行います。このモデルはリアルタイムの対話と深層学習タスクを分離し、複雑な問題を処理します。
RoboBrain Orcaは、人工知能アカデミーが発表した、マルチモーダルな世界表現モデルです。従来の次の単語/フレーム/アクションの予測を次の状態の予測に置き換えることで、AIが内部的に統一された世界の可能性表現を構築できるようにします。
Nemotron-Labs-Diffusionは、NVIDIAが開発した3モード言語モデルで、自己回帰、拡散、自己推論デコーディングを単一のアーキテクチャに統合しています。AR-拡散ターゲットの共同トレーニングにより、このモデルは様々な同時実行シナリオで動作可能です。
MoWorldは、Mochip Technologyが開発した世界初の高フレームレートインタラクティブワールドモデルです。完全国産のHuawei Ascend NPUフルスタック最適化に基づいており、最大50FPSのリアルタイム推論を実現し、GPUと比較してコストを70%削減しています。
LingBot-Visionは、Ant Lingbo Technologyが開発したオープンソースの汎用視覚基盤モデルです。業界で初めて境界構造を事前学習のターゲットとして使用し、幾何学的モデリングを採用することで、空間認識学習パラダイムにおける画期的な進歩を実現しました。
motion-anythingは、Open Designチームが開発したオープンソースのネイティブファーストのモーションエンジンで、Figma Motionの無料版とウォーターマークなしのモーションビデオワークショップとして位置づけられています。ご覧のように、このツールを使えば、実際のWebページ上でモーションエフェクトを直接実現できます。