project
MiniMax M2.5 - MiniMaxの次世代フラッグシップAIモデル。ゼロからオープンソースで開発されました。
MiniMaxのM2.5は、100億のアクティベーションパラメータを備えた軽量フラッグシップモデルで、プログラミング機能とエージェント機能に重点を置いています。このモデルは、100 TPS(Claude Opusの約3倍)という超高速推論速度をサポートし、10以上の言語(Go、Rust、Koなど)に対応しています。
M2.5とは何ですか?
M2.5は、MiniMaxの軽量フラッグシップモデルで、100億のアクティベーションパラメータを備え、プログラミング機能とエージェント機能に重点を置いています。このモデルは、100 TPS(Claude Opusの約3倍)という超高速推論速度をサポートし、10以上の言語(Go、Rust、Kotlin、Python、Javaなど)でのフルスタック開発、複雑な論理推論、エンタープライズレベルのシステム構築に対応しています。SWE-Bench Verified(80.2%)やMulti-SWE-Bench(51.3%)などのベンチマークテストで最先端(SOTA)のパフォーマンスを達成し、「アーキテクトレベル」のタスク分解およびプランニング機能を備えています。ネイティブエージェントアーキテクチャを採用し、デジタルオフィスワークの次世代主流モデルとして位置づけられています。
M2.5の主な機能
-
インテリジェントプログラミング10以上の言語でのフルスタック開発をサポートし、アーキテクトレベルの計画機能を備え、システム設計からテストレビューまで、ソフトウェアライフサイクル全体を完了できます。
-
エージェントによる実行効率的なツール呼び出しとインテリジェントな検索により、複雑なタスクをトークン消費量を抑え、より高速に自律的に完了できます。
-
オフィスオートメーションWord、PowerPoint、Excelなどのプロ仕様の成果物を直接出力し、業界の暗黙知を再利用可能な標準化されたスキルへと変換します。
-
専門家が構築ドメインの標準作業手順(SOP)とコア機能を統合することで、ユーザーが独自のエキスパートを作成できるようにサポートします。このプラットフォームには、10,000人以上のエキスパートが登録されています。
-
高いコストパフォーマンス100 TPSで1時間連続稼働させた場合のコストはわずか1ドルであり、無限の数の複雑なエージェントを実行することが経済的に実現可能である。
M2.5 技術原則
- Forgeネイティブエージェント強化学習フレームワーク中間層を導入することで、基盤となるトレーニングエンジンとプッシュエンジンをエージェントから完全に分離し、あらゆるエージェントのアクセスと最適化をサポートします。非同期スケジューリングとツリー構造のマージ型トレーニングサンプル戦略を組み合わせることで、トレーニング速度を約40倍向上させ、モデルの性能が計算能力とタスク数にほぼ比例して向上することを検証しました。
- エージェント型強化学習アルゴリズムと報酬設計CISPOアルゴリズムは、大規模トレーニング中のMoEモデルの安定性を確保するために使用されます。また、長時間の処理における報酬配分の問題を解決するために、プロセス報酬メカニズムが導入されています。同時に、タスクの推定実時間を報酬として使用することで、モデル性能と応答速度の最適なバランスを実現しています。
- 効率的な推論とタスク最適化複雑なタスクを効率的に分解し、強化学習インセンティブモデルによってトークン消費を最適化することに加え、ネイティブの100 TPS推論速度と並列ツール呼び出し機能を組み合わせることで、SWE-Bench Verifiedの完了時間はM2.1と比較して37%短縮され、最高レベルのパフォーマンスを維持しています。
- 大規模な実世界トレーニング20万件以上の実環境データに基づき、プログラミング、検索、オフィスワークなどのシナリオを網羅した強化学習を実施しています。社内の研究開発、製品開発、営業といった実際の業務フローを学習データに変換することで、実世界のタスクにおけるモデルの汎化能力を継続的に向上させています。
- 極めてコストのかかる建築設計本製品はMoEアーキテクチャを採用することで高速かつ低消費電力の推論を実現し、50 TPSと100 TPSの2つのバージョンを提供します。キャッシュ機構により、出力コストは類似モデルの1/10~1/20に削減され、複雑なエージェントの経済的に実現可能な無制限動作を初めて実現しました。
M2.5のパフォーマンス
- プログラミングスキルSWE-Bench Verifiedテストでは80.2%のスコアを獲得し、Claude Opus 4.6を上回りました。また、マルチ言語プログラミングベンチマークであるMulti-SWE-Benchでは51.3%のスコアで業界トップとなり、VIBE-Pro内部ベンチマークではOpus 4.5と同等の性能を発揮しました。さらに、クロススキャフォールディングの汎用性にも優れており、Droidでは79.7%の合格率を達成し、Opus 4.6の78.9%を上回りました。OpenCodeでも76.1%の合格率を達成し、Opus 4.6の75.9%を上回りました。
- 検索とツールの使用方法Wide Searchは、BrowseCompベンチマークで業界トップクラスの76.3%というスコアを獲得し、他を圧倒する性能を誇ります。RISEの実世界インタラクティブ検索評価においても、エキスパートレベルの検索機能を発揮します。前バージョンのM2.1と比較すると、複数のタスクにわたって検索ラウンドを約20%削減し、トークン効率を大幅に向上させています。
- オフィスシーン社内コワーキングエージェント評価フレームワークであるGDPval-MMにおいて、平均勝率59.0%を達成し、Excelコンペティションに基づくMEWCベンチマークと専門家が構築した財務モデリング評価の両方で優れた結果を達成しました。
M2.5プロジェクトの住所
- プロジェクト公式サイト:https://www.minimax.io/models/text
M2.5の使い方
-
オンライン体験MiniMax Agentのウェブサイトにアクセスして、M2.5の対話機能とプログラミング機能を直接体験してください。
-
API呼び出し開発者は、API呼び出しプラットフォーム https://platform.minimaxi.com でアカウントを登録し、APIキーを作成することで、API呼び出しを行うことができます。
M2.5の応用シナリオ
-
インテリジェントプログラミングM2.5は、フルスタックコードの自動生成、プログラムのデバッグ、アルゴリズムの最適化が可能で、開発効率を大幅に向上させます。
-
オフィスオートメーションこのモデルは、複雑なExcelデータ分析タスクを処理し、プロフェッショナルなPowerPointレポートを自動的に生成できます。
-
AI Agentこのモデルは、詳細な調査、情報統合、クロスプラットフォーム自動化など、複雑な複数ステップのタスクの実行をサポートします。
-
リアルタイムのインタラクション高い並列処理能力を備えたこのモデルは、カスタマーサービスロボットやインテリジェントアシスタントなどのリアルタイム対話システムの構築に適しています。