OpenMath-Nemotron - NVIDIAのオープンソース数学推論モデルシリーズ
OpenMath-Nemotronは、NVIDIAが提供する一連のオープンソースの数学的推論モデルであり、オリンピックレベルの問題を含む複雑な数学的問題を解決するために特別に設計されています。これらのモデルは、大規模なデータセットであるOpenMathReasoningに基づいています。
OpenMath-Nemotronは、NVIDIAが提供する一連のオープンソースの数学的推論モデルであり、オリンピックレベルの問題を含む複雑な数学的問題を解決するために特別に設計されています。これらのモデルは、大規模なデータセットであるOpenMathReasoningに基づいています。
Kimi-Audioは、Moonshot AIが開発したオープンソースの音声基盤モデルで、音声の理解、生成、対話タスクに特化しています。1300万時間以上の多様な音声データで事前学習されており、強力な音声推論機能を備えています。
Firefly Image Model 4 は、Adobe の最新の画像生成モデルです。現在、最も高速で、最も制御しやすく、最もリアルな Firefly 画像モデルであり、実物そっくりの画像の生成をサポートし、より高い解像度 (最高...) を提供します。
Step1X-Editは、Step1Xチームによって開発された汎用画像編集フレームワークです。オープンソースの画像編集モデルとクローズドソースモデル(GPT-4oやGemini2 Flashなど)のパフォーマンスギャップを縮小します。Step1X-Editは、マルチモード...
WebSSL(Webスケール自己教師あり学習)は、Metaやニューヨーク大学などの機関によって開発された一連の視覚的自己教師あり学習(SSL)モデルです。これらのモデルは、膨大な量のWebデータ(数十億枚の画像など)を用いて視覚モデルを訓練します。
Paper2Codeは、韓国科学技術院(KAIST)とDeepAuto.aiが共同で開発した、マルチエージェント型の大規模言語モデル(LLM)フレームワークです。機械学習分野の科学論文を、実行可能なコードリポジトリに自動的に変換する機能をサポートしています。
EmaFusionは、AIスタートアップ企業Emaが開発したマルチモデル融合技術であり、企業レベルのAIアプリケーション向けに効率的で柔軟性があり、低コストなソリューションを提供します。100種類以上の言語モデルをタスク要件に合わせて動的に組み合わせます。
Lyria 2は、Google DeepMindが開発した第3世代AI音楽生成モデルです。Vertex AIプラットフォームの中核コンポーネントとして、プロ仕様の48kHz/24ビットステレオサウンドを出力する高忠実度オーディオ生成機能を誇ります。
Concept Lancet (CoLan) は、ペンシルベニア大学の研究チームによって開発された、ゼロショット、プラグアンドプレイの画像編集フレームワークです。Concept Lancet は、画像を表現する潜在空間における画像のスパース分解に基づいています。
LangGraph WhatsApp Agentは、LangGraphとTwilioを基盤としたオープンソースプロジェクトで、WhatsAppユーザーと対話するAIエージェントの開発に使用されます。このプロジェクトはマルチエージェントアーキテクチャとグラフ処理をサポートし、テキストを処理できます。
UniTokenは、マルチモーダルな理解と生成タスク向けに設計された、斬新な自己回帰型生成モデルです。離散的および連続的な視覚表現を組み合わせることで、画像の高レベルな意味を同時に捉えることができる統一的な視覚符号化フレームワークを構築します。
DeepSeek-R1T-Chimeraは、TNG Technologiesが開発したオープンソースの言語モデルです。DeepSeek V3-0324とDeepSeek R1モデルの両方の利点を組み合わせ、革新的な構築方法を用いてニューラルネットワークコンポーネントを統合しています。
DreamOは、ByteDanceのクリエイティブチームと北京大学深圳大学院電子・コンピュータ工学部が共同開発した、カスタマイズ可能な画像生成のための統合フレームワークです。事前学習済みの拡散変換(DiT)モデルに基づいて、多次元画像生成を実現します。
Spatial-RAG(Spatial Retrieval-Augmented Generation)は、大規模言語モデル(LLM)の空間推論能力を向上させるために、エモリー大学とテキサス大学オースティン校によって開発されたフレームワークである。
Qafind Labsが開発したChatDLMは、世界最速の拡散言語モデルです。その主な目的は、従来のTransformerアーキテクチャにおける長文コンテキスト処理と推論効率のボトルネックを克服することです。このモデルは「ブロック拡散」を組み込んでいます。
Qwen3は、アリババが発表した次世代の大規模言語モデルです。Qwen3は「思考モード」と「非思考モード」の2つの動作モードをサポートしています。思考モードでは、モデルは段階的に推論を行い、慎重な検討の後に最終的な回答を提供するため、...
NodeRAGは、異種グラフベースの検索拡張生成(RAG)システムです。さまざまなノードタイプを含む異種グラフを構築することで、文書情報と言語モデルによって生成された知見を統合します。
Ev-DeblurVSRは、中国科学技術大学、合肥国家科学センター人工知能研究所、シンガポール国立大学が共同開発した動画強調モデルです。低解像度でぼやけた動画入力から動画画像を復元することができます。
Embodied Reasonerは、浙江大学、中国科学院ソフトウェア研究所、アリババグループなどの機関によって開発された、斬新な身体化された対話型推論モデルです。視覚探索、推論、および行動協調を活用して複雑なタスクを実行します。このモデルは…に基づいています。
Fengyuは、中国気象局、南昌大学、ファーウェイが共同で開発した世界初のフルチェーン宇宙天気モデルです。革新的なチェーンベースのトレーニング構造に基づき、衛星観測データと数値モデルデータを組み合わせて太陽風を予測します。
RepTextは、Shakker LabsとLiblib AIが開発した多言語対応のビジュアルテキストレンダリングフレームワークです。テキストの内容を理解するのではなく、グリフをコピーすることで高品質なテキストレンダリングを実現します。このフレームワークは、事前学習済みの単言語テキストから画像への変換に基づいています。
Xiaomi MiMoは、複雑な推論タスクのパフォーマンス向上を目的として設計された、Xiaomi初のオープンソース推論モデルです。このモデルは、事前学習と事後学習を組み合わせ、大量の豊富な推論コーパスを活用し、革新的な手法を採用しています。
F-Liteは、FreepikチームがFALと共同でオープンソース化した、10パラメータのテキストベース画像モデルです。Freepik独自の80Mデータセットでトレーニングされており、商用利用にも対応しています。F-Liteは、テキストエンコーダーとしてT5-XXLを使用し、17番目のテキストを抽出することに基づいています。
ACI.devは、AIエージェント向けに特別に設計されたオープンソースのインフラストラクチャプラットフォームであり、堅牢なツール呼び出しサポートを提供します。Gmail、Slack、Notionなどの一般的なアプリケーションを含む600以上の既製ツールを統合し、...