AB
AiBoss
project

OpenAI o4-mini - OpenAIが発表した小型推論モデル

OpenAI o4-miniは、OpenAIが開発した小型推論モデルで、高速かつコスト効率の高い推論に最適化されています。OpenAI o4-miniは、数学、プログラミング、視覚化タスクにおいて優れた性能を発揮し、AIME 2024および2025の有力候補です。

OpenAI o4-miniとは何ですか?

OpenAI o4-miniは、OpenAIが開発した小型推論モデルで、高速かつコスト効率の高い推論に最適化されています。OpenAI o4-miniは、数学、プログラミング、およびビジュアルタスクに優れており、AIME 2024および2025ベンチマークで最高のパフォーマンスを発揮しました。OpenAI o4-miniは、大量の質問を迅速に処理するのに適した、高ボリュームかつ高スループットの推論タスクをサポートします。OpenAI o4-miniはマルチモーダルで、推論のために思考プロセスに画像を取り入れ、ツールの使用をサポートし、詳細かつ思慮深い回答を迅速に生成できます。前バージョンと比較して、OpenAI o4-miniはパフォーマンスとコスト効率が大幅に向上しています。現在、ChatGPT Plus、Pro、およびTeamユーザーは、モデルセレクターでOpenAI o4-miniとOpenAI o4-mini-highを選択でき、o1、o3-mini、およびo3-mini-highは置き換えられます。ChatGPT EnterpriseおよびEduユーザーは、1週間以内にアクセスできるようになります。開発者は、チャット完了APIと応答APIを介してこのモデルを使用できます。

OpenAI o4-miniの主な機能

  • 迅速な推論数学、プログラミング、視覚処理などのタスクを高速に処理することに優れており、高スループットが求められるシナリオに適しています。
  • マルチモーダル機能画像とテキストを組み合わせて推論を行い、画像処理をサポートする。
  • ツールの使い方問題解決には、ウェブ検索やPythonプログラミングなどのツールを活用しましょう。
  • 高いコストパフォーマンス前モデルのo3-miniと比べて性能が格段に向上し、価格も同程度であるため、アップグレードの第一候補と言えるでしょう。
  • 安全で信頼できるセキュリティ研修を受けた後、私たちは不適切な要求を拒否することを支持します。

OpenAI o4-miniのパフォーマンス

  • 数学的推論AIME 2024および2025ベンチマークテストにおいて、OpenAI o4-miniはツールを一切使用せずに93.4%の精度を達成し、Pythonを統合することで精度は98.7%にまで向上し、ほぼ満点に迫りました。複雑な数学的問題の解決においては、OpenAI o4-miniは前身のo3-miniを凌駕し、一部のタスクでは本格的なo3の性能に匹敵するレベルに達しました。
  • プログラミングスキル
    • SWE-LancerOpenAI o4-miniは非常に優れた性能を発揮し、複雑なプログラミングタスクの効率的な完了をサポートし、卓越したメリットをもたらします。
    • SWE-Bench検証済み(ソフトウェアエンジニアリング問題集)OpenAI o4-miniは、アルゴリズム、システム設計、API呼び出しといった一般的なタスクにおいて、o3-miniよりも高い精度と効率性を発揮し、非常に優れた性能を発揮します。
    • Aider 多言語コード編集(多言語コード編集ベンチマーク)OpenAI o4-miniは、完全な書き換えやパッチ修正を含むコード編集タスクにおいて非常に優れた性能を発揮し、o3-miniを凌駕する。
  • マルチモーダル機能
    • MMMU(大学レベルの視覚的数学問題集)OpenAI o4-miniは、画像と数式を組み合わせて問題を解決する機能をサポートしており、精度は87.5%に達し、前身のo1の71.8%を大きく上回っています。
    • MathVista(視覚的数学的推論)OpenAI o4-miniは、幾何学的図形や関数曲線などの視覚的な数学的推論タスクにおいて非常に優れた性能を発揮し、最大87.5%の精度を達成します。
    • CharXiv-Reasoning(科学的チャート推論)OpenAI o4-miniは、科学論文中の図表を75.4%の精度で理解することができ、これはo1の55.1%よりも大幅に優れている。
  • ツールの使い方
    • スケールマルチチャレンジ(複数ラウンドの指導フォローアップ)OpenAI o4-miniは、複雑な複数ターン命令タスクの処理をサポートし、複数ターン命令を正しく理解して実行します。
    • BrowseComp エージェントブラウジング(ブラウザタスク)仮想ブラウザの検索、クリック、ページめくり、情報統合に基づいており、その性能はO3に匹敵し、従来のAI検索能力をはるかに凌駕している。
    • Tau-bench関数呼び出し関数呼び出しタスクでは安定した動作を示し、構造化されたAPI呼び出しの正確な生成をサポートするが、複雑なシナリオではさらなる最適化が必要である。
  • 総合テスト
    • 人類最後の試験(エキスパートレベルの総合試験)ツールを使用しない場合の精度は14.3%ですが、プラグインを使用すると17.7%に向上します。これはo3の24.9%より低いものの、小規模モデルでは良好な性能を発揮します。
    • 学際的な博士課程レベルの科学問題(GPQAダイヤモンド)科学問題における正答率は81.4%で、o3の83.3%よりわずかに低いものの、小規模モデルとしては非常に優れた数値である。

OpenAI o4-miniプロジェクトのアドレス

OpenAI o4-miniの応用シナリオ

  • 教育指導生徒が数学やプログラミングの問題を解決できるよう支援する。
  • データ分析データチャートと分析結果を迅速に生成します。
  • ソフトウェア開発コードのデバッグを支援するコードスニペットを生成します。
  • コンテンツ作成画像を組み合わせることで、創造的なインスピレーションを与え、説明文を生成します。
  • デイリー・インクワイアリー検索と画像分析に基づいて質問に答えてください。