project
Composer 2.5 - Cursor社が独自開発したエージェント型プログラミングモデル
Composer 2.5は、Cursorが独自開発したエージェント型プログラミングモデルです。特にSWE-Bench Multilingual(79.8%)やCursorBenchベンチマークにおいて、知能と動作性能の面でComposer 2を大幅に上回る性能向上を実現しています。
Composer 2.5とは何ですか?
Composer 2.5は、Cursor社が独自開発したエージェント型プログラミングモデルです。知能と動作性能の面で、Composer 2から大幅に改善されています。 SWE-Bench Multilingual(79.8%) そして CursorBench v3.1(63.2%) コアベンチマークの点では、Claude Opus 4.7やGPT-5.5と同等のレベルですが、ミッションあたりのコストは競合他社の約[不足している金額]です。 1/10これは「コスト効率の王様」として知られています。このモデルは、MoonshotのオープンソースであるKimi K2.5チェックポイントを使用した継続的なトレーニングに基づいており、現在はCursor IDEおよびSDKを通じてのみ利用可能です。
Composer 2.5の主な機能
-
長時間タスクの連続実行長時間実行されるエージェントセッション向けに徹底的に最適化されており、複数ステップのツール呼び出し中もフォーカスを維持できるため、幻覚や予期せぬ終了などの問題を大幅に軽減できます。
-
複雑な命令を確実に実行するファイル間再構築、端末コマンド実行、テスト駆動開発といった複雑な指示に従う際の信頼性は、Composer 2と比較して大幅に向上しています。
-
努力レベルの動的較正このモデルは、タスクの難易度に応じて計算負荷を自動的に割り当て、簡単なタスクは迅速に完了させ、複雑なタスクについては深く考察することで、「小さなタスクに時間を費やし、大きなタスクについて考えを怠る」ことを防ぎます。
-
コミュニケーションスタイルの最適化回答はより簡潔かつ体系的になり、不必要な長々とした説明が減り、複数のファイルが変更された場合でも、より明確な推論プロセスが示される。
-
ツール呼び出しの精度が向上しました無効な端末コマンドや重複検索を大幅に削減し、コード検索と端末操作の効率を向上させます。
-
デュアルバージョンへの柔軟な適応標準版(100万トークンあたり0.50ドル/2.50ドル)と高速版(100万トークンあたり3.00ドル/15.00ドル)があり、いずれも同じレベルのインテリジェンスを備え、それぞれバックグラウンドバッチ処理と対話型リアルタイムプログラミングに最適化されています。
Composer 2.5 の使い方
-
Cursor IDEで有効にするCursorを2026年5月時点の最新の安定版にアップデートし、Composerパネルを開きます(
Cmd+I/Ctrl+Iモデルセレクターをクリックして切り替えます Composer 2.5 -
速度ギアを選択してください対話型開発ではデフォルトの方法を使用します 高速版(高速応答、低遅延);バックグラウンドエージェントまたはバッチタスクは、「設定」>「モデル」で切り替えることができます。 標準バージョン(低コスト、同等の知能レベル)
-
SDK を介したプログラムによる呼び出し:
import { Agent } from "@cursor/sdk";
const agent = await Agent.create({
model: "composer-2.5", // Standard 版
// model: "composer-2.5-fast", // Fast 版
workspace: "./",
tools: ["edit", "shell", "search", "browser"],
});
-
長時間の作業を制限するモデルがキャッシュなどの「近道」を使って報酬を不正に得ることを防ぐため、反復回数と、無人で長時間実行されるエージェントセッションの最大時間に制限を設定します。
-
ローンチボーナスを受け取ろうリリース後最初の1週間は、ユーザーには通常の2倍の利用クレジットが付与されます。クレジットの使用状況は管理画面で確認できます。
-
マルチモデルルーティング戦略ルーチン作業の90%をComposer 2.5に委任し、アーキテクチャレビュー作業のみをClaude Opus 4.7に、重いターミナルシェル作業のみをGPT-5.5にルーティングする。
Composer 2.5の主な利点
-
究極のコスト効率標準版は入力$0.50/M、出力$2.50/M。高速版は入力$3.00/M、出力$15.00/Mで、Claude Opus 4.7より約安価です。 10~30回。
-
最先端レベルのベンチマークパフォーマンスSWE-Bench Multilingual 79.8% (Opus 4.7 は 80.5%、GPT-5.5 は 77.8%)、CursorBench v3.1 63.2% (Opus 4.7 の 64.8% および GPT-5.5 の 64.3% とほぼ同等)。
-
行動レベルでの徹底的な最適化トレーニング規模の拡大に加え、コミュニケーションスタイルやエンゲージメントレベルの調整も改善しました。これらの要素はベンチマークでは完全に反映しにくいものの、実際のユーザー体験にとって非常に重要です。
-
2つのバージョンから選択してくださいStandardはバックグラウンドエージェントやバッチタスクに適しており、Fastは対話型IDEやリアルタイムプログラミングに適しています。どちらも同じレベルのインテリジェンスを備えています。
-
初回起動特典:使用回数2倍発売後最初の1週間は、利用制限を2倍にします。
Composer 2.5と類似の競合製品との比較
| 比較対象寸法 | Composer 2.5 | Claude Opus 4.7 | GPT-5.5 |
|---|---|---|---|
| メーカー/プラットフォーム | Cursor | Anthropic | OpenAI |
| 製品ポジショニング | 独自開発のエージェントプログラミングモデル | フラッグシップ推論モデル | フラッグシップ・マルチモーダルモデル |
| 基本モデル | ムーンショットキミK2.5(オープンソースチェックポイント継続トレーニング) | クロード4シリーズ | GPT-5シリーズ |
| 発売日 | 2026.05.18 | 2026年第2四半期 | 2026年第2四半期 |
| SWE-Bench Multilingual | 79.8% | 80.5% | 77.8% |
| Terminal-Bench 2.0 | 69.3% | 69.4% | 82.7% |
| CursorBench v3.1(難易度高) | 63.2% | 64.8%(最大)/ 61.6%(デフォルトのxhigh) | 64.3%(xhigh)/ 59.2%(デフォルトのmedium) |
| 価格(百万トークン)を入力してください | $0.50(Standard)< $3.00(Fast) |
非公開(業界参考価格:約15ドル) | 非公開(業界参考価格:約3~5ドル) |
| 出力価格(百万トークンあたり) | $2.50(Standard)< $15.00(Fast) |
非公開(業界参考価格:約75ドル) | 非公開(業界参考価格:約15~30ドル) |
| タスクあたりの相対コスト | 目安(1タスクあたり約1~2ドル) | について 10~30回 | について 3~10回 |
| コンテキストウィンドウ | 約20万キロ(キミK2.5を参照) | 200K | 128K–1M |
| 重量の開放性 | クローズドソース(カーソルインフラストラクチャのみ) | 非公開ソース | 非公開ソース |
| アクセス方法 | Cursor IDE / CLI / @cursor/sdk |
API / クロードコード / サードパーティプラットフォーム | API / ChatGPT / GitHub Copilot |
Composer 2.5の応用シナリオ
-
複数ファイルレベルのリファクタリングコスト面で明確な優位性があり、精度も最先端モデルと同等であるため、大規模なコードベース移行に適している。
-
対話型ペアプログラミング高速版は応答速度が速く、リアルタイムのIDEコラボレーションに適しています。
-
バックグラウンドでスケジュールされたタスク/クラウドエージェントスタンダード版はコストパフォーマンスに優れており、一括でのコードレビューや修正に適しています。
-
テスト駆動開発長期間のミッションにおける信頼性は従来機種よりも優れており、複数回の試験・修理サイクルを安定して完了できる。
-
複合端末自動化Terminal-Bench 2.0は69.3%のスコアを記録し、Opus 4.7(69.4%)と同等の成績でしたが、Shell負荷の高いシナリオではGPT-5.5(82.7%)にわずかに劣りました。