URM(Universal Recommendation Model)は、アリババのAlimamaプラットフォームが立ち上げたグローバル知識モデルです。知識注入と情報整合に基づき、LLMの一般知識とeコマース分野の専門知識を組み合わせることで、従来のLLMの問題点を解決します。
URM(Universal Recommendation Model)は、アリババのAlimamaプラットフォームが立ち上げたグローバル知識モデルです。知識注入と情報整合に基づき、LLMの一般知識とeコマース分野の専門知識を組み合わせることで、従来のLLMの問題点を解決します。
DeepSeek-Prover-V2 は、DeepSeek チームによって開発された、数学的推論に焦点を当てたオープンソースの大規模言語モデルです。DeepSeek-Prover-V2-671B と DeepSeek-Prover-V2-7B の 2 つのバージョンがあります。
Rowboatは、マルチクラウドプラットフォーム(MCP)向けのマルチエージェントアシスタント構築に特化した、オープンソースのローコードAI IDEです。ビジュアルインターフェースとAI支援開発機能により、ユーザーはインテリジェントエージェントを迅速に設計、構成、テストできます。
Qwen2.5-Omni-3Bは、アリババのQwenチームが開発した軽量マルチモーダルAIモデルです。Qwen2.5-Omni-7Bの簡易版で、特にコンシューマー向けハードウェア向けに設計されており、テキスト、音声、画像、動画など、さまざまな入力方法をサポートしています。
TesserActは、3Dシーンの動的な時間的変化を予測し、具現化されたエージェントの行動に反応する革新的な4D具現化世界モデルです。RGB-DN(RGB、深度、法線)ビデオデータで学習し、従来のモデルを凌駕します。
VoltAgentは、AIエージェントの構築とオーケストレーションに使用されるオープンソースのTypeScriptフレームワークです。VoltAgentは、AIアプリケーションの構築、大規模言語モデル(LLM)とのインタラクションの簡素化、状態管理などに必要なインフラストラクチャとツールを提供します。
Aero-1-Audioは、LMMs-Labが開発した軽量オーディオモデルで、Qwen-2.5-1.5Bをベースに構築されており、パラメータ数はわずか1億5000万個です。長時間のオーディオ処理に特化して設計されており、最大15分間の連続オーディオ入力をサポートできます。
DianJin-R1は、アリババクラウドの同義電金チームと蘇州大学が共同開発した、金融分野向けの大規模推論強化モデルです。金融業務に特化して設計されており、高度な技術と包括的なデータサポートを統合しています。このモデルは、教師あり推論を強化します...
X-Fusionは、UCLA、UCウィスコンシン・マディソン校、およびAdobe Researchが共同で提案したマルチモーダル融合フレームワークです。これは、事前学習済みの大規模言語モデル(LLM)をマルチモーダルタスクに拡張するものです。
Phi-4-reasoningは、Microsoftが開発した140億個のパラメータを持つ推論モデルで、複雑な推論タスク向けに設計されています。教師ありファインチューニング(SFT)を用いて学習され、OpenAIのo3-miniモデルによって生成された高品質な推論を活用しています。
Paper2Coderは、韓国科学技術院(KAIST)が開発したマルチエージェント大規模言語モデル(LLM)システムで、機械学習分野の科学論文を自動的にコードベースに変換します。計画、分析、コード生成の3つのフェーズに基づいて、…
HoloTimeは、北京大学深圳大学院と鵬城研究室が開発したパノラマ4Dシーン生成フレームワークです。ビデオ拡散モデルに基づいて、単一のパノラマ画像をリアルな動的効果を持つパノラマビデオに変換し、さらにそれを再構築して...
T2I-R1は、香港中文大学と上海AIラボが共同開発した新しいテキストから画像への生成モデルです。意味レベルの連鎖推論(CoT)とトークンレベルのCoTという2層推論メカニズムに基づいて、高レベルの画像プランニングと低レベルの...
Cobra(Efficient Line Art Colorization with BRoAder References)は、清華大学、香港中文大学、およびTencent ARC Labsによって開発されたコミックの線画着色フレームワークです。高精度、高効率、そして…
KeySyncは、インペリアル・カレッジ・ロンドンとヴロツワフ大学が開発した高解像度リップシンクフレームワークで、ビデオ内の入力音声と唇の動きを同期させることをサポートします。KeySyncは2段階のフレームワークに基づいており、まずキーを生成します...
Omni Referenceは、Midjourneyが導入した多機能な参照機能で、参照画像から特定の人物、物体、またはシーンを生成画像に埋め込むことができます。Omni ReferenceはMidjourney V7以降に対応しています。
3DV-TON(Textured 3D-Guided Consistent Video Try-on via Diffusion Models)は、拡散モデルに基づいたビデオ仮想試着システムであり、Alibaba DAMO Academy、Lakeside Lab、浙江大学が共同開発しました。
ACE-Stepは、ACE StudioとStepFunが共同で開発したオープンソースの音楽生成モデルです。革新的なアーキテクチャに基づき、効率的で一貫性のある、制御可能な音楽制作を実現します。ACE-Stepは、拡散モデル、ディープコンプレッションなどを組み合わせています。
ReasonIR-8Bは、Meta AIが開発した、推論を多用する検索タスク向けに特別に設計されたモデルです。LLaMA3.1-8Bで学習されており、デュアルエンコーダーアーキテクチャを採用し、クエリとドキュメントをそれぞれ埋め込みベクトルにエンコードした後、コサイン乗算を使用します。
Voilaは、音声対話専用に設計されたオープンソースのエンドツーエンド音声モデルです。高忠実度かつ低遅延のリアルタイムストリーミング音声処理機能を備え、音声入力を直接処理して音声出力を生成することで、ユーザーにスムーズで直感的な体験を提供します。
kimi-thinking-previewは、Dark Side of the Moonが開発したマルチモーダル思考モデルです。高度な推論能力を備え、コーディング、数学、仕事関連の課題など、複雑な問題の解決に優れています。このモデルは`reasoning_content`フィールドに基づいています。
UniTokは、ByteDanceが香港大学および華中科技大学と共同開発した統合型ビジュアル単語分割器です。ビジュアル生成と理解の両方のタスクをサポートします。マルチコードブック量子化技術に基づいて、ビジュアル特徴を複数の小さなブロックに分割し、各ブロックは...
D-DiT(Dual Diffusion Transformer)は、カーネギーメロン大学、イェール大学、ByteDance Seed Labsによって開発されたマルチモーダル拡散モデルです。画像生成と画像理解のタスクを統合します。このモデルは、連続的な画像拡散と…
NoteLLMは、Xiaohongshuが開発した、ノート推薦のためのマルチモーダル大規模言語モデルフレームワークです。生成されたノートの圧縮埋め込みと自動タグカテゴリ生成に基づき、NoteLLMは大規模言語モデル(LLM)の強力な意味理解を活用しています。