Janus-Pro - DeepSeekのオープンソース統合マルチモーダルモデル
Janus-Proは、DeepSeekが開発したオープンソースのAIモデルで、画像理解と画像生成をサポートし、多様なアプリケーションシナリオに合わせて10億と70億のスケールを提供します。改良されたトレーニング戦略、拡張されたデータセット、そしてより大規模なスケールが特徴です。
Janus-Proは、DeepSeekが開発したオープンソースのAIモデルで、画像理解と画像生成をサポートし、多様なアプリケーションシナリオに合わせて10億と70億のスケールを提供します。改良されたトレーニング戦略、拡張されたデータセット、そしてより大規模なスケールが特徴です。
Qwen2.5-VLは、アリババ傘下のTongyi Qianwenチームがオープンソース化した主力ビジュアル言語モデルで、3B、7B、72Bの3つの異なるスケールで利用可能です。このモデルは視覚理解に優れており、一般的な物体の認識や、画像内のテキストやグラフの分析が可能です。
QVQ-72B-Previewは、Alibaba CloudのTongyi Qianwenチームが開発したオープンソースのマルチモーダル推論モデルで、視覚推論能力の向上に重点を置いています。このモデルは複数のベンチマークテストで非常に優れた性能を発揮し、マルチモーダルな理解と推論タスクにおいて強力な能力を示しています。
Qwen2.5-Maxは、Alibaba Cloudが開発した大規模なMoE(Mixture of Experts)モデルで、20兆個以上の事前学習済みトークンを使用しています。このモデルは複数のベンチマークテストで非常に優れた性能を発揮し、DeepSeek V3を凌駕しています。
MobileVD(Mobile Video Diffusion)は、Qualcomm AI Researchチームが開発した、モバイルデバイス向けに最適化された初のビデオ拡散モデルです。このモデルは、Stable Video Diffusion(SVD)の時空間UN構造に基づいています。
YuEは、香港科技大学とマルチモーダルアートプロジェクションチームが共同開発したオープンソースのAI音楽生成モデルです。歌詞を完全な楽曲に変換することができ、ポップ、メタル、ジャズなど、さまざまな音楽スタイルに対応しています。
VARGPTは、視覚理解と生成タスクに特化した革新的なマルチモーダル大規模言語モデルです。自己回帰フレームワークに基づき、単一のモデル内で視覚生成と理解を統合し、タスク切り替えの複雑さを回避します。VARGPTはLLaVAアーキテクチャに基づいて構築されています。
CityDreamer4Dは、南洋理工大学のS-Labチームが開発した、境界のない4D都市を生成するための複合生成モデルです。これは、3つのモジュールを通して、動的なオブジェクト(車両など)と静的なシーン(建物や道路など)を分離します。
SpeechGPT 2.0-previewは、復旦大学のOpenMOSSチームが開発した、人間のようなリアルタイム対話型システムです。数百万時間分の中国語音声データで学習されており、エンドツーエンドのアーキテクチャを採用し、音声とテキストのモダリティ間の高度な統合を実現しています。
LalaEvalは、香港中文大学とLalamoveデータサイエンスチームが共同開発した、ドメイン固有の大規模言語モデル(LLM)のための人間による評価フレームワークです。このフレームワークは、ドメイン仕様、標準規格などを網羅した、エンドツーエンドの完全なプロトコルを採用しています。
Alignerは、北京大学の研究チームが提案した大規模言語モデルのアライメント手法です。アライメントされた回答とアライメントされていない回答間の修正残差を学習することで、モデルのパフォーマンスを向上させます。自己回帰型のseq2seqモデルを採用し、質問と回答の修正残差の関係に基づいて動作します。
OpenAI o3-mini は、OpenAI が公式にリリースした最新の推論モデルです。科学、数学、プログラミング技術向けに最適化された、OpenAI 推論シリーズの中で最新かつ最もコスト効率の高いモデルです。3 つの推論強度 (低...
EICopilotは、Baidu Research Instituteが開発したAI搭載の企業向け情報検索・探索ツールです。大規模言語モデル(LLM)を基盤とするAIエージェントを通じて、企業ユーザーが大規模な知識グラフ内の情報を効率的に取得・解釈できるよう支援します。
Mistral Small 3は、Mistral AIがリリースしたオープンソースの大規模言語モデルで、240億個のパラメータを含み、Apache 2.0ライセンスで提供されています。低遅延タスク向けに設計されており、英語、中国語、日本語など、複数の言語をサポートしています。
CoA(Chain-of-Agents)は、Googleが開発したマルチエージェント協調フレームワークで、長文テキスト処理時に大規模言語モデル(LLM)が直面する文脈上の制約に対処することを目的としています。CoAフレームワークは、長文テキストを複数の短いテキストに分割します。
Oumiは、データ準備やモデルトレーニングから評価、展開まで、ライフサイクル全体を簡素化する完全オープンソースのAIプラットフォームです。1,000万から4,050億のパラメータを持つモデルトレーニングをサポートし、テキストモデルやマルチモーダルモデル(Lla...など)にも対応しています。
IC-Portraitは、ユーザープロファイル画像の多様性(外見や照明条件の違いなど)によって生じる課題に対処する、斬新なパーソナライズされたポートレート生成フレームワークです。ポートレート生成タスクを「光を考慮したスティッチング」と「視点の一貫性」に分解します。
SyncAnimationは、人間の姿勢や発話アバターのアニメーションを生成するための、リアルタイムかつエンドツーエンドのオーディオ駆動型フレームワークです。上半身の姿勢や表情(唇の動きを含む)をオーディオ信号とリアルタイムで同期させ、高精細なアニメーションを実現します。
BitsAI-CRは、ByteDanceが大規模言語モデル(LLM)に基づいて開発した自動コードレビューツールです。効率的なコードレビューは2段階のプロセスで実現されます。RuleCheckerは、219のルールに基づいて潜在的なコードエラーを検出する役割を担います。
DiffSplatは、テキストプロンプトと単一ビュー画像から3Dガウススプラットを高速に生成する新しい3D生成手法です。強力な2D事前分布に基づく事前学習済みのテキストから画像への拡散モデルを活用しています。
X-Promptは、マルチモーダルビデオオブジェクトセグメンテーションのための汎用フレームワークであり、極端な照明、高速な動き、背景干渉などの複雑なシナリオにおける従来の手法の限界に対処します。RGBデータに基づいてビデオオブジェクトセグメンテーションアルゴリズムを事前学習することで機能します。
VideoRewardは、香港中文大学、清華大学、快手科技が共同で作成した動画生成嗜好データセットおよび報酬モデルです。視覚品質、動きの品質、テキストの配置という3つの側面を網羅した182,000個のラベル付きデータポイントが含まれています。
MILS(Multimodal Iterative LLM Solver)は、Meta AIが提案した手法で、大規模言語モデル(LLM)にトレーニングなしでマルチモーダル機能を与えるものです。多段階推論を通じて、LLMに候補出力を生成するように促し、各出力に対して...
OpenDeepResearcherは、複雑な情報検索と分析タスクを効率的に完了させるのに役立つオープンソースのAI研究ツールです。反復的な検索と推論に基づいて、Webから関連データを自動的に取得し、包括的なレポートを生成します。