実世界テスト:Claude Opus 4.6とGPT-5.3-Codex – どちらがより優れたプログラマーか?
国内のAIバトルは、「元宝紅包」ゲームから「千問ミルクティー」コンテストまで、各世代が独自のアプローチを持っていることを如実に示している。国際的にも、AIプログラミング分野で2つの有力モデル、AnthropicのClaude Opus 4.6 O...がリリースされるなど、手をこまねいているわけではない。
みなさんこんにちは、ここは問題を解決するために...AIオレンジシスター。
毎日目が覚めると、AI世界は新しい景色に満ち溢れている。
国内AI金塊入りの赤い封筒から、千の質問が書かれたミルクティーまで、世代ごとに独自の「卵」戦略がある。
外国も手をこまねいているわけではない。AIプログラミング分野で、2つの大型モデルがリリースされました。
人間性の:Claude Opus 4.6
OpenAI の:GPT-5.3-Codex
両社はほぼ同時に衝撃的な発表を行い、私たちは千文ミルクティーを飲んでいた時に…速いそれでは、2つのモデルの利点と主な特徴を見ていきましょう。
Claude Opus 4.6
最も重要な改良点の1つは、100万トークン(長編小説数冊分に相当)を含むコンテキストウィンドウのサポートです。複雑なタスク計画や長時間のタスク処理に優れ、問題点を特定し、エラーを自動的に修正しようとします。
金融や法律などの専門分野で卓越した能力を発揮し、GDPval-AAスコアは業界トップクラスである。(追記)適応思考そして努力の4つのレベル(努力のコントロール)このシステムは、ExcelやPowerPointなどのオフィスソフトウェアとの連携機能も強化しています。
モデルの主要業績評価指標
- Terminal-Bench 2.0(評価版)知的体(プログラミング能力)最高得点は65.4%でした。
- GDPval-AA(専門分野における専門知識の評価)Eloレーティングは1606で、前作のOpus 4.5よりも190ポイント高い。GPT-5.2は144ポイント高い。
- Arena.aiの総合レビューコード、テキスト、エキスパートという3つの主要カテゴリすべてにおいて、第1位にランクインしています。
GPT-5.3-Codex
スピード前世代と比較してGPT-5.2-Codex 25%高速化同じタスクを完了する場合、トークンの使用量は半分に削減されます。自らの創造に最初に参加したAIモデル。マルチタスク並列処理をサポートし、速い反復開発。
ユーザーは、実行中にリアルタイムでタスクを中断したり、方向を調整したりできるほか、進捗状況の確認、質問、修正提案も可能です。これは、要件定義書の作成、コードの記述、デバッグ、デプロイから監視、分析に至るまでの全プロセスを網羅しています。自動変革。最初にオープンを取得するAI「高能力」サイバーセキュリティ評価のモデル。
モデルの主要業績評価指標
- Terminal-Bench 2.0(評価版)知的体(プログラミング能力)得点:77.3%
- GDPval(総合的な知識に基づく職務評価)パフォーマンスとGPT-5.2は変化なし。
- SWE-Bench Pro(実際のGitHubリポジトリの問題を解決する能力を評価します)得点:56.8%
期間限定の2機種セットを買ったので、早速試してみようと思って来ました!
パッケージのご購入はこちら:https://vipcheap.com/zh
海外のウェブサイトにとって、WeChat Payに対応できるのは本当に素晴らしいことです。私自身も試してみましたが、全く安全です。
1. ゲームのリメイク
大人気だったWeChatのお年玉の他に、「ジャンプジャンプ」というミニゲームも非常に人気があり、今でも鮮明に記憶に残っています。それを再現してみましょう。
アクセスClaude公式サイトへプロンプトワードOpus 4.6モデルを選択してください
WeChatのミニゲーム「ジャンプジャンプ」の再現版を作成するのを手伝ってください。
3分足らずで生成されました。自動3D視点とゲーム効果を提供します。
テスト後、さらに数回最適化を行いました。
フロントエンドページの最適化をお願いします。具体的には、以下の点にご留意ください。1. 着地エリアは様々な形状のオブジェクトにすることができます。2. ジャンプするオブジェクトを3Dの小さなドラゴンに調整してください。3. ページの最後にゲームエリアを中央に配置してください。4. 必要に応じてゲームエフェクトを強化してください。
「3Dリトルドラゴンキャラクター」を「カラフルなリトルポニー」に変更してください。
「パーフェクトランディング」の効果を最適化しましょう。ポイントが加算されるだけでなく、毎回異なる「午年の祝福」メッセージが表示されるようになります。
生成される効果はWeChatの「ジャンプジャンプ」ゲームに似ているが、UIはあまり高度ではない。
ゲームプレイを見てみましょう。
正直に言うと、かなりハマるゲームです。
もう一度見てみましょう。GPT-5.3-Codex
VS Codeでも同じように使ってみました。プロンプトワード入力して選択 GPT-5.3-コーデックスモデル。
完了までわずか3分しかかかりませんでした。
この効果には驚かされた。芸術的な才能は全くないのだろうか?
また、いくつかのバージョンを最適化しました。プロンプトワード
正直言って、ポニーだと全く分からなかった。画面からほとんど消えてしまっていたから…。
2. 地域サービスステーションを設置する
まずはOpus 4.6を見てみましょう。入力内容は…プロンプトワード
地域サービスステーションを設計・開発してください。このサービスは、犬の散歩、猫の餌やり、荷物の受け取りなど、地域住民の日常生活に必要なサービスを主に提供するものでなければなりません。利用者はミニプログラムを通してログインし、利用できます。以下の点に注意してください。
1. 製品は、実用性を確保しつつ、できるだけ多くの機能を備えているべきである。
2. サービスステーションの機能設計は、ユーザーとプラットフォーム間のスムーズな相互作用ロジックを確保する必要があります。
3. 対象地域には、レベル4以上の都市を含めることができます。
4.高齢者介護サービスの新たな形態を含めるべきである。
結果を見たときは少し驚きました。
それでおしまい。単純ほんの数語で、すぐに起動して使用できる完全な製品が生成され、すべてのインタラクションリンクがシームレスに機能します。
また、私が言及していなかったサービス分野についても情報が提供されました。
ねえ、Opus 4.6って実はすごくパワフルなんだよ!
同様に、もう一度見てみましょう。GPT-5.3-Codex
同じものを入力してくださいプロンプトワード完了までにかかった時間は3分で、これはOpus 4.6の速度と同程度である。
性能はどうなのか、耐久性はどうなのか見てみましょう。
これは一体何ですか?ウェブサービスを紹介するウェブサイトを生成したのですか?私が言及した製品の実際の使用例を理解していなかったのですか?ユーザーはログインしてミニプログラムを利用できます。)。
3. ミニプログラムのソースコードレビュー
私は以前、「あなたは正気ですか?」というミニプログラムを開発しました。手をこすり合わせるたった5つのステップAI「CrazyMeアプリ」 – 数千万人のユーザーを抱える次世代製品を発見しよう。 これがそのバージョンです。ただし、ユーザーエクスペリエンスに軽微なバグがあり、ダウンロード後にレポートを表示できません。
ミニプログラムのソースコードをすべてダウンロードしたので、Opus 4.6でそれを検出できるかどうかをテストしてみます。
これは、このミニプログラムのソースコードファイルの一覧です。コードにバグ、不具合、または最適化が必要な箇所がないか確認してください。
Opus 4.6は確かにそれを検出した。
影響:ログイン成功後、ユーザーはホームページにリダイレクトできません。ホームページで送信後、ユーザーはレポートページにリダイレクトできません。レポートページの「再分析」ボタンが無効になっています。3つの主要プロセスすべてが機能しなくなっています。
彼らは非常に多くのバグや問題点を検出し、それに対応する最適化の提案まで提供してくれた。
コードレビューレポートに基づいて、最適化された新しいアプリケーションソースコードを生成し、新しいアプリケーションを作成してください。
新しいアプリは、以前のUIデザインとスタイルを維持しつつ、ワークフロー上の様々な問題点を修正しています。まるでユーザーのことを真に理解しているエンジニアのように、約束通りの性能を発揮します。
GPT-5.3- Codex は結果を返しませんでした。
プロンプトワード私たちの部署には、シャオホン、シャオル、シャオバイ、シャオヘイ、シャオフアン、シャオチン、そして私の7人がいます。チームビルディング活動を計画していて、私は単語連鎖ゲームを考案しました。皆さんにシミュレーションしてゲームをプレイしていただきたいと思います。ルールは次のとおりです。各行は前の行の最後の3つの単語で始まり、最初の行と閉じたループになるまで続きます。最初の行: 毎日忙しい、毎日忙しい、天国に行くまで一生忙しい。
ちょっと地味すぎるし、全然面白くない。
文体をもっと面白くてドラマチックなものに変更してください。
このバージョンはかなり良い。働くプロフェッショナルたちの状況を完璧に捉えている。
そしてGPT-5.3-Codex: 最初はゲームのルールを完全に理解していませんでした。「次の3つの単語に従う」ということだけを覚えていました。
笑ったり泣いたり、顔を覆う。
全体的に見て、Opus 4.6 は非常に包括的で、GPT-5.3-Codex は少し分かりにくいです。プログラミングに関する内容のはずなのに、ゲームのリメイクやコミュニティサービスサイトまで含まれているのでしょうか?
私たちのような非技術者にとって、Claude Opus 4.6の方がより適しているように思われます。なぜなら、Opus 4.6はあなたのタスクに基づいてさらに一歩踏み込んだ思考ができ、不足している部分を補完し、真に人間の視点から考え、実行することができるからです。
AI今日、プログラミングはもはや「支援」ではなく「自律性」が求められるものとなっている。複雑な要件を理解し、開発プロセスを計画し、複数のステップからなるタスクを実行し、さらには自己デバッグを行うことが求められるのだ。
技術担当者にとっての強みは、実際の開発ニーズやシナリオに基づいて最適な選択肢を判断できる能力、あるいは複数の選択肢を組み合わせてそれぞれの強みを活かす能力にある。
これら2つのモデルは、異なる技術的アプローチを表している。
Opus 4.6は「広さと深さ」(大規模なコンテキスト+マルチエージェントのコラボレーション)を重視し、「エラーの回避」を強調し、長期タスクの信頼性と安定性に焦点を当てています。
GPT-5.3- Codexは「スピードと自律性」(リアルタイムのインタラクション+自己反復)に重点を置き、「まずは動作させること」を重視し、スピードとマルチタスク機能に焦点を当てています。
Opus 4.6と…についてどう思いますか? GPT以下のCodex(5.3-)のバージョンの中で、あなたにとって最適なものはどれですか?