project
GPT-4.1 - OpenAIは、数百万のトークンコンテキストをサポートする新世代の言語モデルを発表しました。
GPT-4.1はOpenAIの最新の次世代言語モデルであり、GPT-4.1、GPT-4.1 mini、GPT-4.1 nanoの3つのバージョンで構成されています。この一連のモデルは、エンコーディング能力、命令への準拠性、長文処理において大幅な改善を示しています。
GPT-4.1とは何ですか?
GPT-4.1は、OpenAIの最新の次世代言語モデルで、GPT-4.1、GPT-4.1 mini、GPT-4.1 nanoの3つのバージョンがあります。このモデルシリーズは、エンコード機能、命令への準拠、長文処理において大幅な改善を実現し、最大100万トークンのコンテキストウィンドウをサポートしています。GPT-4.1は複数のベンチマークテストで非常に優れたパフォーマンスを発揮し、SWE-bench Verifiedテストでは54.6%のスコアを達成しました。これはGPT-4.0よりも21.4パーセントポイント向上しています。GPT-4.1シリーズはコスト効率にも優れており、現在入手可能なモデルの中で最速かつ最も安価なモデルとなっています。GPT-4.1シリーズは現在、すべての開発者が利用できるAPIを通じてのみ提供されています。
GPT-4.1の主な機能
- 長文コンテキスト処理能力GPT-4.1シリーズのモデルは、最大100万トークンのコンテキスト処理をサポートしており、書籍全体や大規模なコードベースといった長文テキストを処理することが可能です。
- マルチモーダル処理GPT-4.1シリーズのモデルは、マルチモーダル処理にも最適化されています。ビジュアルエンコーダーとテキストエンコーダーは分離されており、相互注意機構を備えています。この設計により、テキストと画像が混在するコンテンツをより適切に処理できます。
- コード生成と最適化GPT-4.1は、プログラミングタスクにおいて、従来モデルを大幅に上回る性能を発揮します。SWE-bench Verifiedテストでは、精度54.6%を達成し、GPT-40を21.4パーセントポイント上回りました。これにより、コードベースの探索、コード作成、テストケース開発の効率化が実現します。
- 多言語対応多言語コーディング能力テストにおいて、GPT-4.1は性能を2倍に向上させ、多言語プログラミングタスク、コード最適化、バージョン管理の処理においてより効率的になった。
- ツール呼び出しの効率性Windsurfの内部コーディングベンチマークテストなどの実用的なアプリケーションでは、GPT-4.1はGPT-4oよりも60%高いスコアを記録し、ツール呼び出しの効率も30%向上しています。
- 複雑な命令処理GPT-4.1は命令実行において非常に優れた性能を発揮し、複雑な命令にも確実に従います。ScaleのMultiChallengeベンチマークでは、GPT-40よりも10.5パーセントポイント高いスコアを記録しました。
- 複数ターン対話機能複数ターンにわたる対話において、GPT-4.1は文脈情報をより的確に追跡し、対話の一貫性を維持する能力に優れています。OpenAIの社内における指示遵守評価では、GPT-4.1は特に難しいプロンプトの処理において優れた性能を発揮しました。
- 特大コンテキストウィンドウGPT-4.1シリーズのモデルは、最大100万トークンのコンテキスト処理をサポートしており、これはGPT-40の8倍にあたります。これにより、8つの完全なReactソースコードや、数百ページ、数千ページに及ぶドキュメントなど、非常に長いテキストを処理することが可能になります。
- 長文読解長文理解において、GPT-4.1は重要な情報をより正確に特定し抽出することができます。OpenAIの長文コンテキスト評価では、GPT-4.1は最大100万トークンのコンテキスト内で対象テキストを正確に特定できます。
- 画像理解GPT-4.1シリーズは画像理解において優れた性能を発揮し、特にGPT-4.1 miniは画像ベンチマークにおいてGPT-4oをしばしば上回る結果を示している。
- 動画コンテンツの理解Video-MMEテストにおいて、GPT-4.1は字幕なしの30分から60分の動画に対する理解度と多肢選択式問題で72%の正答率を達成し、現在の最高性能レベルに達した。
- 高いコストパフォーマンスGPT-4.1シリーズは、より低いコストで性能向上を実現しています。GPT-4.1を使用した中規模クエリのコストはGPT-40よりも26%低く、GPT-4.1 nanoは現在OpenAIで最も安価かつ高速なモデルです。
- 低遅延と高効率GPT-4.1 miniは、レイテンシをほぼ半分に、コストを83%削減するため、低レイテンシが求められるタスクに適しています。
GPT-4.1の技術的原理
- トランスフォーマーアーキテクチャの最適化GPT-4.1はTransformerアーキテクチャをベースとしていますが、さらに最適化されています。トレーニング中に、より幅広い文脈情報を捉えることを可能にしました。大規模なコーパスから学習することで、GPT-4.1シリーズのモデルは、膨大なテキスト範囲にわたって注意を維持し、関連情報を正確に特定し、複雑なタスクを解決する能力を向上させる方法を習得しました。
- 専門家による混合チーム(教育省)計算コストとストレージ要件を削減しつつ高いパフォーマンスを維持するため、GPT-4.1はハイブリッドエキスパートモデルを採用しています。このモデルは、それぞれ1110億個のパラメータを持つ16個の独立したエキスパートモデルで構成されています。各順伝播経路は2つのエキスパートモデルを通過するため、モデルはさまざまなデータやタスクの分布をより柔軟かつ効率的に処理できます。
- トレーニングデータセットGPT-4.1は、13兆個のトークンを含むデータセットを使用して学習されました。これらのトークンは一意ではなく、反復回数に基づいて計算されます。この膨大なデータセットにより、GPT-4.1は学習中に言語知識と文脈情報をより多く学習することができ、自然言語処理タスクにおけるモデルの精度が向上します。
- 推論最適化GPT-4.1は、推論時に可変バッチサイズや逐次バッチ処理など、いくつかの最適化手法を採用しています。これにより、レイテンシが大幅に最適化され、推論コストが削減されます。
- コスト管理GPT-4.1は、ハイブリッドエキスパートモデルと最適化されたトレーニングおよび推論戦略を採用することで、高いパフォーマンスを維持しながら計算コストとストレージ要件を大幅に削減し、実用的なアプリケーションにおいてより費用対効果の高いモデルを実現しています。
GPT-4.1モデルシリーズの性能
- GPT-4.1エンコード能力に関して、GPT-4.1はSWE-bench Verifiedテストで54.6%のスコアを達成し、GPT-4oを21.4パーセントポイント上回り、現在利用可能なエンコードモデルの中でトップの成績を収めました。命令準拠性に関しては、ScaleのMultiChallengeベンチマークテストでGPT-4oを10.5パーセントポイント上回りました。長文テキスト理解に関しては、Video-MMEテストで、GPT-4.1は字幕なしの長文ビデオカテゴリで72.0%のスコアを達成し、GPT-4oを6.7パーセントポイント上回りました。
- GPT-4.1 mini小規模モデルの性能は大幅に向上し、多くのベンチマークでGPT-4oを凌駕する結果となりました。インテリジェント評価においてはGPT-4oと同等の性能を発揮しつつ、レイテンシをほぼ半減、コストを83%削減しています。
- GPT-4.1 nanoこれはOpenAI初のナノモデルであり、現時点で最速かつ最も安価なモデルです。MMLUで80.1%、GPQAで50.3%、Aider多言語エンコーディングで9.8%のスコアを記録し、GPT-4o miniを上回りました。
GPT-4.1のプロジェクトアドレス
- プロジェクト公式サイト:https://openai.com/index/gpt-4-1/
GPT-4.1モデルの価格設定
- GPT-4.1入力トークン100万個あたり2ドル、出力トークン100万個あたり8ドル。
- GPT-4.1 mini入力トークン100万個あたり0.40ドル、出力トークン100万個あたり1.60ドル。
- GPT-4.1 nano入力トークン100万個あたり0.10ドル、出力トークン100万個あたり0.40ドル。
GPT-4.1の応用シナリオ
- 法分野法律文書のレビューに関して言えば、GPT-4.1の複数文書レビュー精度はGPT-40よりも17%高く、複雑な法律文書の処理においてより効率的である。
- 財務分析金融データ分析において、GPT-4.1は大規模な文書から重要な情報をより正確に抽出することができ、アナリストにより包括的なデータサポートを提供する。
- フロントエンド開発フロントエンドプログラミングにおいて、GPT-4.1はより高性能で見た目にも美しいウェブアプリケーションを作成することができ、生成されたウェブサイトは、報酬を受け取った人間のレビュー担当者から80%のケースで高く評価されている。