project
Qwen3.7-Max - Ali Tongyiが発表した新世代フラッグシップ大型モデル
Qwen3.7-Maxは、アリババ傘下の同義千文チームが発表した新世代フラッグシップモデルであり、インテリジェントエージェント時代に向けて設計され、包括的なインテリジェントエージェント基盤として位置づけられています。このモデルは、最先端のプログラミング、オフィスオートメーション、長時間の自律実行、およびクロスフレームワーク互換性を特長としています。
Qwen3.7-Maxとは何ですか?
Qwen3.7-Maxは、アリババ傘下の同義千文チームが開発した新世代のフラッグシップモデルで、インテリジェントエージェント時代に向けて設計され、包括的なインテリジェントエージェント基盤として位置づけられています。このモデルは、最先端のプログラミング、オフィスオートメーション、長サイクル自律実行、クロスフレームワーク汎化という4つのコア機能を備えています。SWE-Pro、MCP-Atlas、GPQA Diamondなど、数十のプログラミング、インテリジェントエージェント、推論ベンチマークで優れた結果を達成しており、Claude Code、OpenClaw、Qwen Codeといった主流のインテリジェントエージェントフレームワークにシームレスに統合できます。
Qwen3.7-Maxの主な機能
- 最先端のプログラミングインテリジェントエージェントフロントエンドのプロトタイピングから複雑な複数ファイルソフトウェアエンジニアリングまで、コードチェーン全体の記述とデバッグをサポートし、SWE-ProやSWE-Multilingualなどのプログラミングベンチマークで優れたパフォーマンスを発揮します。
- オフィス生産性アシスタントMCPとの統合とマルチエージェント連携によりワークフローの自動化を実現し、オフィス自動化ベンチマークであるSpreadSheetBench-v1で87.0のスコアを獲得。複雑なデータ分析や文書作成タスクにも対応可能です。
- 長期的な自律実行このシステムは、超長時間にわたるタスクを継続的かつ安定的に実行する能力を備えており、最大35時間にわたり1,000回以上のツール呼び出しを伴う完全自律型のカーネル最適化実験において、一貫性のある推論を維持しました。
- フレームワーク間の一般化Claude Code、OpenClaw、Qwen Codeといった主流のインテリジェントエージェントフレームワークにネイティブに対応し、特定のフレームワークに合わせて微調整する必要なく安定した動作を実現できます。
Qwen3.7-Maxの技術的原理
- 環境普及研修Qwen3.5の環境拡張手法に基づき、エージェントの学習環境の質と多様性が大幅に向上し、モデルが多様な環境から一般化できるようになりました。
- 分離型ロールアウトインフラストラクチャトレーニングインスタンスは、タスク、実行フレームワーク、バリデーターという3つの直交するコンポーネントに分離されており、フレームワークとバリデーターを横断した強化学習トレーニングをサポートし、モデルに汎用的な問題解決戦略を学習させるように促します。
- 組み合わせ展開同じタスクを、異なる種類やバージョンのフレームワークやバリデーターと極めて低い限界費用で自由に組み合わせることができ、トレーニング環境の組み合わせによる拡張性を実現できる。
- 長距離強化学習の最適化長期にわたる自律実行中の継続的なフィードバック反復を通じて、このモデルは30時間以上経過後でも大幅な改善を見出すことができ、長期的な最適化と自己進化能力を実証している。
Qwen 3.7-Max の使い方
Qwen3.7-Max計画は、以下の方法で実施されます...アリババクラウドの100の改良サービスを提供する。
Qwen3.7-Maxの主な利点
-
インテリジェントエージェントのあらゆるベンチマークでトップMCP-Mark、MCP-Atlas、ClawEval、QwenClawBenchなどの一般的なインテリジェントエージェントベンチマークにおいて、Claude Opus-4.6 Maxを上回るか、それに匹敵する性能を発揮します。
-
一流のプログラミングスキルSWE-Pro 60.6、SWE-Multilingual 78.3、Terminal Bench 2.0 69.7:同種のモデルを総合的にリードしています。
-
深い推論力と知識GPQAダイヤモンド92.4、HMMT 2026 Feb 97.1、HLE 41.4というスコアを獲得しており、高難易度STEM推論分野においてトップクラスに位置する。
-
一流の多言語能力WMT24++ 85.8、MAXIFE 89.2、MMLU-Pro 89.6:最高レベルの翻訳および多言語理解品質。
-
真の生産性クローズドループ通常であれば1~2週間の専門チーム作業が必要となる複雑なプロジェクトを、数時間以内にエンドツーエンドで納品することが可能です。
-
ハードウェアに依存しない一般化トレーニング時には見られなかったPingtouGe Zhenwu M890ハードウェアプラットフォーム上で、独自探索によってディープカーネル最適化を完了することができた。
Qwen3.7-Maxと類似の競合製品との比較
| 比較対象寸法 | Qwen3.7-Max | Claude Opus-4.6 Max |
|---|---|---|
| プログラム可能なインテリジェントエージェント | SWE-Pro 60.6 / ターミナルベンチ 69.7 リーディング | SWE-Pro 59.0 / SWE-Verified 80.8 がわずかにリード。 |
| 汎用知能エージェント | MCP-Atlas 76.4 / ClawEval 65.2 リード | MCP-Atlas 75.8 / ClawEval 70.4 リード |
| 推論能力 | GPQA ダイヤモンド 92.4 / HLE 41.4 リーディング | GPQA Diamond 91.3 / HLE 40.0 |
| オフィスオートメーション | SpreadSheetBench 87.0 | SpreadSheetBenchのスコアは89.3で、わずかにリードしている。 |
| 多言語対応 | WMT24++ 85.8 / MAXIFE 89.2 首位 | WMT24++ 82.7 |
| 長期的な実行 | 35時間かけて1000以上のツール呼び出しを自己最適化し、30時間経過後も継続的な改善を実施。 | 長期的な状況下では安定しているが、長期的な自律最適化の事例は一般に公開されているものが少ない。 |
| フレームワーク間の一般化 | Claude Code、OpenClaw、Qwen Codeなど、複数のフレームワークとネイティブに互換性があります。 | 主にClaude Code向けに最適化されています |
| サービスの提供 | Alibaba CloudのHundred Refinements API(近日公開予定) | Anthropic API / Claudeアプリケーション |
Qwen3.7-Maxのアプリケーションシナリオ
- 複雑なソフトウェア開発AIソフトウェアエンジニアとして、要件分析、アーキテクチャ設計、複数ファイルコーディング、デバッグ、パフォーマンス最適化など、開発ライフサイクル全体を単独で完了しました。
- エンタープライズワークフロー自動化MCPは企業ツールチェーンに接続し、データ分析、レポート作成、システム間情報統合といった負荷の高いオフィス業務を自動的に実行します。
- 基盤システムの最適化馴染みのないハードウェアプラットフォーム上で、私たちは独自にGPUカーネルを記述、コンパイル、分析し、反復的に最適化することで、桁違いの高速化を実現します。
- 科学研究と数学的推論高度に複雑な数学的証明、科学計算、文献統合といったタスクを遂行し、研究者が困難な推論タスクに取り組むのを支援する。
- 多言語コンテンツ制作最高レベルの多言語対応能力を活用することで、高精度な翻訳、多言語技術文書の作成、グローバルコンテンツのローカライズを実現します。