SeedFoleyは、ByteDanceのDoubao Big Model Speech Teamが開発したエンドツーエンドのビデオ音声生成モデルで、ビデオ制作のためのインテリジェントな音声生成サービスを提供します。時空間ビデオの特徴を拡散生成モデルと統合することで、音声効果を実現し、…
SeedFoleyは、ByteDanceのDoubao Big Model Speech Teamが開発したエンドツーエンドのビデオ音声生成モデルで、ビデオ制作のためのインテリジェントな音声生成サービスを提供します。時空間ビデオの特徴を拡散生成モデルと統合することで、音声効果を実現し、…
R1-Omniは、アリババ同義が発表した強化学習(RLVR)に基づくマルチモーダル言語モデルで、感情認識タスクに特化しています。視覚情報と音声情報を組み合わせることで、感情認識の推論プロセスを明確に説明し、…
DeepSeek Toolboxは、DeepSeek APIをさまざまな人気ソフトウェアに統合する方法を示す、DeepSeek公式GitHubプロジェクトです。このプロジェクトでは、DeepSeekをサポートするさまざまなツールやアプリケーションがリストアップされており、以下のようなあらゆるものを網羅しています。
Anus(Autonomous Networked Utility System)は、Manusから派生したオープンソースの自律型インテリジェントエージェントプロジェクトであり、Manusの機能の一部を再現しています。Anusは、自然言語によるコマンド実行、マルチエージェント連携、ネットワークインタラクションなどをサポートしています。
MeshPadは、スケッチ入力に基づくインタラクティブなアーティスティックなメッシュ生成・編集ツールです。シンプルな2Dスケッチを高品質な3Dメッシュモデルに素早く変換でき、リアルタイム編集にも対応しています。ユーザーはスケッチ上に線を追加したり削除したりできます。
PlanGENは、Google Researchが開発したマルチエージェントフレームワークであり、マルチエージェントの協調、制約ガイダンス、適応型アルゴリズム選択を通じて複雑な計画および推論問題を解決します。これは、制約エージェント、検証エージェント、および...という3つの主要コンポーネントで構成されています。
MV-MATHは、中国科学院自動化研究所が提案した新しいベンチマークデータセットで、マルチモーダル大規模言語モデル(MLLM)のマルチビジュアルシーンにおける数学的推論能力を評価するために作成されました。このデータセットには、2009個の高品質な数学問題が含まれており、それぞれが…
MHA2MLAは、復旦大学、華東師範大学、上海AI研究所などが共同開発した、データ効率の高い微調整手法です。DeepSeekのマルチヘッド潜在アテンション(MLA)メカニズムを組み込むことで、あらゆるTransformerベースのアルゴリズムを最適化します。
GaussianAnythingは、南洋理工大学S-Labが上海AIラボおよびその他の機関と共同で開発した3D生成フレームワークです。GaussianAnythingは、インタラクティブな点群構造化潜在空間とカスケードフローマッチングモデルに基づいています。
VACE(Video Creation and Editing)は、アリババ同義研究所が開発した、動画生成と編集をワンストップで行えるフレームワークです。参照動画の生成、動画間編集、マスキングなど、様々な動画関連タスクを統合しています。
Seedream 2.0 は、ByteDance の Doubao Big Model チームによって開発された中国語と英語のネイティブバイリンガル画像生成モデルであり、テキストレンダリングと文化理解における既存モデルの欠点を克服しています。このモデルは、独自開発のバイリンガル大規模言語モデル (LL...
PP-DocBeeは、Baidu PaddlePaddleチームが開発したマルチモーダル大規模モデルで、文書画像の理解に特化しています。ViT+MLP+LLMアーキテクチャに基づいており、強力な中国語文書解析能力を備え、テキストや表などを効率的に処理できます。
BEHAVIOR Robot Suite (BRS) は、スタンフォード大学の Fei-Fei Li 氏のチームが開発したフレームワークで、ロボットが日常生活における家事を完了するための全身運動スキルを学習することを目的としています。家庭での活動の分析に基づき、ロボットが備えるべき主要な能力を特定します。これには、以下のようなものが含まれます。
MM-StoryAgentは、上海交通大学のX-LANCE Labとアリババグループが共同開発したオープンソースのマルチモーダル・マルチエージェントフレームワークです。没入型のオーディオ絵本動画を生成するために使用されます。大規模な言語モデルに基づいており…
Deep Research Web UIは、ユーザーが効率的に詳細な調査を実施できるよう支援するオープンソースのAIリサーチアシスタントツールです。AIを活用した反復検索により、指定されたトピックを段階的に掘り下げ、調査プロセスをツリー構造で視覚化します。
Gemma 3は、Googleが開発した最新のオープンソース人工知能モデルで、複数のデバイスに対応したAIアプリケーション開発を支援するために開発者向けに設計されています。35以上の言語に対応し、テキスト、画像、短い動画などを分析する機能を備えています。
Reka Flash 3は、Reka AIが開発したオープンソースの推論モデルで、21億個のパラメータを誇ります。テキスト、画像、動画、音声などのマルチモーダル入力に対応し、最大32,000トークンのコンテキスト長を処理できるため、以下のような用途に適しています。
Ziyue Translation 2.0は、NetEase Youdaoが新たに発表した大規模翻訳モデルです。このモデルは、データ、アルゴリズム、評価という3つの主要な側面において体系的なアップグレードを実施し、翻訳の品質、効率性、堅牢性において飛躍的な向上を実現しました。データレベルでは…
Motion Anythingは、オーストラリア国立大学、シドニー大学、テンセント、マギル大学、JD.comなどの機関によって開発されたマルチモーダルモーション生成フレームワークです。テキスト、音楽、またはその両方を組み合わせたものに基づいて、高品質で制御可能なモーションを生成します。
AI-Researcherは、香港大学データサイエンスラボが開発したオープンソースの自動科学研究ツールです。大規模言語モデル(LLM)エージェントをベースとし、研究アイデアから論文発表までの全プロセスを自動化します。AI-Researcherは…
Open-Sora 2.0は、Luchen Technologyが発表した最新のオープンソース最先端(SOTA)ビデオ生成モデルです。Open-Sora 2.0は、20万ドル(224個のGPU)を投じて、11個のパラメータを持つ商用グレードのモデルのトレーニングに成功しました。
Gemini Roboticsは、Google DeepMindが立ち上げたロボットプロジェクトで、Gemini 2.0をベースとしており、大規模なマルチモーダルモデルの機能を物理世界にもたらします。このプロジェクトには、Gemini Robotics-ERと...という2つの主要モデルが含まれています。
PP-TableMagicは、Baidu PaddlePaddleチームが開発した高性能な表認識ツールです。画像から構造化された表情報を抽出し、HTMLなどの形式に変換した後、さらにデータ処理と分析を行います。PP-TableMagicは…
Gemini 2.0 Flashは、テキスト理解と画像生成機能を組み合わせたGoogleのマルチモーダルAIモデルです。自然言語入力から高品質な画像を生成し、複数ターンにわたる対話型画像編集をサポートし、文脈の一貫性を維持します。