project
Grok 4.5 - SpaceX AIの次世代フラッグシップ大規模言語モデル
Grok 4.5は、SpaceXAI(旧xAI)の次世代フラッグシップ大規模言語モデルであり、1.5兆パラメータのV9アーキテクチャに基づいています。補足トレーニングフェーズでは、モデルはカーソルプログラミングデータを深く統合し、コード生成とソフトウェア開発を大幅に強化します。
Grok 4.5とは何ですか?
Grok 4.5は、SpaceX AI(旧xAI)の次世代フラッグシップ大規模言語モデルであり、1.5兆パラメータのV9アーキテクチャに基づいて構築されています。補足トレーニングフェーズでは、モデルはCursorプログラミングデータを深く統合し、コード生成とソフトウェアエンジニアリング機能を大幅に強化します。イーロン・マスク氏は、これをOpus 4.7レベルのモデルと位置付け、推論速度の向上、トークン効率の向上、使用コストの低減を強調しています。サードパーティのベンチマークでは、Grok 4.5はGDPval-AA v2ベンチマークで世界第4位にランクインしており、既に一般公開されています。
Grok 4.5の主な機能
-
インテリジェントなコード生成Cursorプログラミングデータのディープラーニングに基づいて、コード補完、バグ修正、プロジェクトのリファクタリング、自動テスト生成をサポートします。
-
複数ステップのエンジニアリングタスク処理ファイル間の依存関係分析、アーキテクチャ設計、技術文書作成を網羅し、長期的なソフトウェアエンジニアリングプロセスに精通している。
-
インテリジェントエージェントの非同期実行長時間実行されるAIエージェントのタスクをサポートし、複雑な複数ラウンドの意思決定やオフィスオートメーションプロセスを処理できます。
-
迅速な推論出力毎秒80トークンという生成速度と低い応答遅延により、リアルタイムのインタラクティブなシナリオに適しています。
-
多言語プログラミングサポートSWE-Bench Multilingualなどのベンチマークで優れた性能を発揮し、言語間のコード理解と変換をサポートします。
-
プラットフォームネイティブ統合Grok BuildダイアログプラットフォームとCursor IDEに既に組み込まれているため、開発者は環境を切り替えることなく使用できます。
-
標準APIアクセスSpaceXAIコンソールは、OpenAI互換のインターフェースを提供し、エンタープライズレベルのシステム統合とバッチ処理をサポートします。
Grok 4.5の技術的原理
- 建築規模最新の1.5兆パラメータV9アーキテクチャをベースに、従来モデルと比較してモデル容量と表現力が大幅に向上しています。
- データエンジニアリングトレーニングデータは厳密な重複排除、品質スコアリング、ドメインフィルタリングを経て、コード理解および生成能力を特に向上させるために、カーソルプログラミングデータが補足的なトレーニングセットとして導入された。
- トレーニングインフラ大規模なトレーニングのために数万個のNVIDIA GB300 GPUを採用し、長期間にわたって中断のないトレーニングを保証する安定した運用技術を備えている。
- 強化学習の最適化これは、数十万もの多段階のソフトウェアエンジニアリングタスクを網羅し、長時間実行されるエージェントの非同期トレーニングをサポートすることで、複雑で長期にわたるタスクにおけるモデルの推論効率を向上させます。
- 推論効率デコード戦略と推論パス計画を最適化することで、SWE Bench Proタスクは平均わずか15,954トークンしか消費せず、同カテゴリーのトップモデルの約4分の1にとどまり、速度とコストの両面で圧縮を実現しています。
Grok 4.5 の使い方
- Grok Build経由で使用ユーザーはGrok Buildプラットフォームに直接ログインし、チャットインターフェースを通じてGrok 4.5モデルとやり取りできます。これは、日常的な質疑応答、コード作成、ドキュメント処理に適しています。
- カーソルコンパイラを介して使用するGrok 4.5はCursorプログラミング環境に統合され、開発者はIDE内でモデルを呼び出してコード補完、バグ修正、プロジェクトのリファクタリングを行うことが可能になり、プログラミングワークフローのシームレスな組み込みを実現しました。
- API呼び出し経由開発者はSpaceXAIコンソールにログインしてAPIキーを取得し、標準的なOpenAI互換インターフェース形式に従ってアクセスできます。
Grok 4.5の主な利点
-
トップクラスに匹敵する性能内部評価はOpus 4.7とほぼ同等であり、Terminal-Bench 2.1のスコアは83.3%で、大型モデルの中でもトップクラスに位置する。
-
究極のコストメリットGDPval-AA v2の単一タスクコストはわずか0.49ドルで、上位3つのモデルよりも約90%安く、GLM-5.2やKimi K2.6よりも低い。
-
トークン効率がリードするSWE Bench Proのタスクは平均15,954トークンを消費しますが、これはOpus 4.8の67,020トークンの4.2分の1であり、ユーザーの実際の支出を直接的に削減します。
-
極めて速い推論速度出力速度は毎秒80トークンに達し、高速モデル動作の基準を満たし、長期タスクへのより迅速な対応を可能にする。
-
卓越したエンジニアリング能力DeepSWE 1.0やSWE-Bench Proといったソフトウェアエンジニアリングベンチマークにおいて、優れた性能を発揮します。カーソルデータの強化後、コード生成機能と複数ステップのエンジニアリングタスク処理能力が大幅に向上しました。
Grok 4.5プロジェクトのアドレス
- プロジェクト公式サイト:https://x.ai/news/grok-4-5
Grok 4.5 類似製品との比較
| 比較対象寸法 | Grok 4.5 | Claude Opus 4.8 |
|---|---|---|
| Terminal-Bench 2.1 | 83.3% | 78.9% |
| SWE-Bench Multilingual | 78.0% | 84.4% |
| DeepSWE 1.0 | 62.0% (high) | 55.8% (max) |
| SWE-Bench Pro | 64.7% (high) | 69.2% (max) |
| GDPval-AA v2 Elo | 1543(世界第4位) | 1600(トップ3) |
| タスクコスト | 1タスクあたり0.49ドル | 1タスクあたり約5~10ドル |
| トークン効率 | 1タスクあたり15954トークン | 67020トークン/タスク |
| 出力速度 | 80トークン/秒 | もっとゆっくり |
| API入力価格 | 100万トークンあたり2ドル | より高い |
| API出力価格 | 100万トークンあたり6ドル | より高い |
| コアポジショニング | 高性能エンジニアリングモデル | 究極のパフォーマンスを誇るフラッグシップモデル |
Grok 4.5の応用シナリオ
- インテリジェントなソフトウェア開発これは、CursorなどのIDEにおけるコード補完、バグ診断、プロジェクトのリファクタリング、自動テスト生成を支援するため、フルスタック開発や大規模なコードベースの保守に適しています。
- 複数ステップのエンジニアリングタスクファイル間の依存関係分析、アーキテクチャ設計、技術文書の自動生成など、複雑で長期的なソフトウェアエンジニアリングプロセスを処理します。
- エンタープライズAPI統合SpaceXAIコンソールを介して社内システムに接続し、低コストで高スループットの顧客サービスロボット、データ分析ツール、およびビジネスプロセス自動化ツールを構築します。
- 端末プログラミング支援Grok Buildプラットフォームは、スクリプト、クエリコマンド、および構成ファイルを迅速に生成できるため、運用エンジニアやデータサイエンティストが日々の業務効率を向上させるのに最適です。