SWEET-RL - Meta社が発表した複数ラウンド強化学習フレームワーク
SWEET-RLは、Meta社が開発したマルチターン強化学習フレームワークで、特に大規模言語モデル(LLM)エージェントを協調推論タスク向けにトレーニングするように設計されています。SWEET-RLは、トレーニング中に(参照解などの)追加情報に基づいて「批評家」を最適化します。
SWEET-RLは、Meta社が開発したマルチターン強化学習フレームワークで、特に大規模言語モデル(LLM)エージェントを協調推論タスク向けにトレーニングするように設計されています。SWEET-RLは、トレーニング中に(参照解などの)追加情報に基づいて「批評家」を最適化します。
OThink-MR1は、OPPO研究所と香港科技大学(広州)が共同開発したマルチモーダル言語モデル最適化フレームワークです。Kullback-Leibler(KL)ダイバージェンスポリシー(GRPO-D)と報酬モデルを動的に調整することで、…
DeepSiteは、DeepSeek-V3モデルをベースにしたオンライン開発ツールです。ユーザーは環境設定やソフトウェアのインストールを行う必要はありません。ウェブページに直接要件を入力するだけで、ゲーム、アプリケーション、ウェブページなどのコードを迅速に生成でき、リアルタイムプレビューにも対応しています。
EasyControl Ghibliは、EasyControlフレームワークに基づいて開発されたAIモデルです。Hugging Faceプラットフォーム上で利用可能で、通常の画像をジブリ風の画像に変換することに特化しています。アジア人の顔写真100枚のみを使用して作成されました。
Dolphinは、清華大学電子工学部音声・オーディオ技術研究所と海天瑞生が共同開発した、東洋言語向けの大規模音声モデルです。中国語の22の方言(…を含む)を含む40の東洋言語の音声認識をサポートしています。
WorldScoreは、スタンフォード大学が提案した、世界生成モデルのための統一評価ベンチマークです。世界生成を次シーン生成タスクの連続に分解し、明示的なカメラ軌道に基づくレイアウト仕様によって、異なるレベルのパフォーマンスを実現します。
PaperBenchは、OpenAIが提供するオープンソースのAIエージェント評価ベンチマークであり、一流の学術論文を再現するエージェントの能力を評価するのに役立ちます。PaperBenchでは、論文の内容理解からコードの記述、実験の実行まで、エージェントがその能力を包括的に実証することが求められます。
DreamActor-M1は、ByteDanceが開発した高度なAI画像アニメーションフレームワークで、静止画のポートレート写真を鮮やかなアニメーション動画に変換できます。暗黙的な顔表現、3Dヘッドスフィア、3Dボディスケルトンなどを組み合わせたハイブリッドガイダンスメカニズムを採用しています。
MoCha AIは、Metaとウォータールー大学が共同開発した、対話ベースのエンドツーエンドのキャラクター動画生成モデルです。テキストまたは音声入力に基づいて、同期した音声と自然な動きを伴う完全なキャラクターアニメーションを生成できます。MoChaは音声ビューを採用しています...
DeepSeek-GRMは、DeepSeekと清華大学の研究者らが共同で提案した汎用的な報酬モデリングシステムです。ポイントごとの生成型報酬モデリングを利用しています。
OlympicArenaは、上海交通大学、上海AIラボ、蘇州大学、および上海交通大学生成人工知能研究所(GAIR Lab)が共同開発した、学際的な認知推論ベンチマークフレームワークです。OlympicArenaには、以下の機能が含まれています。
AbletonMCPは、モデルコンテキストプロトコル(MCP)に基づいてAbleton LiveとClaude AIを接続し、AI支援による音楽制作を可能にするオープンソースプロジェクトです。AbletonMCPは双方向通信に基づいており、ユーザーが以下のことを行うことをサポートします。
BabelDOCは、科学論文の翻訳に特化したオープンソースのインテリジェントなPDF翻訳ツールです。翻訳されたテキストを原文と並べて表示し、ウィンドウを切り替えることなく二言語比較を行うため、読みやすくなっています。数式、表、および…を完全に保持します。
Llama 4は、オープンソース開発者であるMetaによるマルチモーダルAIモデルシリーズです。ハイブリッドエキスパート(MoE)アーキテクチャを初めて採用し、トレーニングと推論時の計算効率が向上しました。Llama 4には現在、ScoutとMaverickの2つのバージョンがあります。Scout...
OmniTalkerは、アリババがリリースしたリアルタイムのテキスト駆動型音声アバター生成技術です。テキスト、画像、音声、動画などの複数の入力形式を同時に処理し、ストリーミング方式で自然な音声応答を生成します。そのコアアーキテクチャはT...に基づいています。
Seedream 3.0は、ByteDanceが開発したAI画像生成モデルです。ネイティブ2K解像度の画像出力に対応し、わずか3秒で高品質な画像を高速生成します。このモデルは、小さなテキストの生成とレイアウト、美観、そして…に優れています。
Quasar Alphaは、100万トークンという巨大なコンテキストウィンドウをサポートするプレリリース版AIモデルであり、非常に長いテキストや複雑なドキュメントを処理できます。高速な生成速度、低遅延、そして高い命令遵守率といった優れたコード生成機能を誇ります。
OmniCamは、カメラ制御によって高品質なビデオ生成を実現する高度なマルチモーダルビデオ生成フレームワークです。複数の入力モードの組み合わせをサポートしており、ユーザーはテキストによる説明、ビデオ軌跡、画像などを参照として提供できます。
AnimeGamerは、テンセントPCGと香港城市大学が共同開発した無限アニメライフシミュレーションシステムです。マルチモーダル大規模言語モデル(MLLM)に基づいており、プレイヤーは自由度の高い言語コマンドを使ってアニメの世界に没入し、アニメのキャラクターになりきることができます。
Awesome MCP Serversは、モデルコンテキストプロトコル(MCP)に基づく様々なサーバーを集約したオープンソースプロジェクトです。Awesome MCP Serversは、ブラウザの自動ナビゲーションなどを含む3000以上のMCPサーバーをコンパイルしています。
ACTalkerは、リアルな話者ヘッド動画を生成するためのエンドツーエンドの動画拡散フレームワークです。音声や表情など、単一信号または複数信号の制御をサポートします。コアアーキテクチャには、複数のブランチを利用して並列Mamba構造を採用しています。
SkyReels-A2は、Kunlun Techが開発した制御可能な動画生成フレームワークです。テキストプロンプトに基づいて、人物、物体、背景などのあらゆる視覚要素を組み合わせて合成動画を作成し、各要素の参照画像との整合性を厳密に維持します。
ChildMandarinは、北京人工知能研究院(BAAI)と南開大学コンピュータサイエンス学部人間言語技術研究所(HLT Lab)が共同開発した、3歳から5歳までの子供向け中国語音声データセットです。このデータセットには41.25時間分の音声データが含まれています。
MagicColorは、香港科技大学が開発したマルチインスタンス線画着色フレームワークであり、線画への効率的な着色をサポートします。MagicColorは、自己教師あり学習戦略とインスタンス誘導型モジュールを採用することで、マルチインスタンスデータの不足という問題を解決します。