AB
AiBoss
チュートリアル

Anthropic が Claude をリリース コンピュータ使用開発者ベストプラクティスガイド

Anthropic社は、スクリーンショットの前処理やモデル選択からセキュリティ対策までを網羅した包括的なソリューションである「Claude Computer Use Developer Best Practices Guide」をリリースしました。

Anthropic 推出 Claude Computer Use 开发者最佳实践指南

アントロピックが発売 Claude コンピュータ利用開発者向けベストプラクティスガイドは、スクリーンショットの前処理やモデル選択からセキュリティ対策まで、包括的なソリューションを網羅しています。(対象範囲…) Claude 4.6 Family および Opus 4.7 モデル: 主な推奨事項には、クリック精度を向上させるためにスクリーンショットを 1280×720 に事前にスケーリングすること、スクリーンショットよりもテキストを優先すること、従来のチュートリアル モードをより高度なものに置き換えることなどが含まれます。 Prompt このプロジェクトは、3層のインジェクション防御と長文対話のコンテキスト圧縮戦略を統合し、本番環境レベルのアプリケーション構築を支援します。 Agent 自動化学システム。

クリック精度は、コンピュータ利用統合の基盤です。クリックがターゲットから外れると、後続のすべてのワークフローが失敗します。この記事では、最も効果的な最適化は、最も...単純スクリーンショットはAPIに送信される前にダウンサンプリングされます。

API内部処理の制限

Claude 4.6ファミリーのAPIは、以下のものに限定されます...

  • 長辺の最大長さ:1568ピクセル
  • 最大総画素数:1.15MP
  • いずれかの制限を超えた場合、内部的にサイレントダウンサンプリングが行われます。

Opus 4.7はより高解像度に対応しています。

  • 長辺の最大長さ:2576ピクセル
  • 最大総画素数:3.75MP
  • 制限を超えると、サイレントダウンサンプリングも発生します。

中核的な問題

スクリーンショットがAPI制限を超えると、モデルは圧縮された画像を認識し、返される座標は圧縮されたサイズに基づきます。クライアント側のハーネスは、元の解像度でクリック処理を実行します。座標空間とモデルが認識する画像との間のこの不一致が、高解像度でのクリック精度が低下する主な原因です。

推薦する解決

  • 一般債務不履行1280×720。ピクセル予算の約80%を使用し、トレーニングデータでよく使用され、互換性も良好です。
  • Opus 4.7 推薦する1080pは、トークン消費量とパフォーマンスのバランスがより優れています。
  • API互換性を最大限に高める強制的な引き伸ばしによる比例的な歪みを避けるため、ネイティブのアスペクト比に基づいて最適な解像度を計算します。

避けるべき決議

  • ネイティブ解像度(スケーリングなし)制限値以下でない限り、これがクリックが不正確になる最も一般的な理由です。
  • 解像度が低すぎます(960×540未満)詳細情報が失われすぎており、モデルは小さなUI要素を認識できません。
  • macOSに関する注記スクリーンショットはデバイスのピクセル比が2倍になることが多いため、1440pの画面でも実際には2880pが出力され、APIの制限をはるかに超えてしまう。
  • 4.6 家族構成員は、出生率が1920×1080以上にならないようにすべきである。: ピクセル制限を超えると、自動的に圧縮されます。Opus 4.7 は制限が高く、1080p と 1440p は予算内ですが、スケーリングなしでネイティブ 4K を使用することは避けるべきです。

座標スケーリング

スクリーンショットを送信前に自動的にリサイズした後、モデルから返される座標は、送信時の display_width_px / display_height_px に基づいています。これらの座標は、実行前に実際の画面座標に比例的に復元する必要があります。

メッセージ配列の内容をソートする

メッセージ内容配列を作成する際は、テキストコマンドをスクリーンショットの前に配置してください。

content = [ {"type": "text", "text": "Click on the Submit button"}, {"type": "image", ...}, ]

いいえ推薦する注文:
content = [
 {"type": "image", ...},
 {"type": "text", "text": "Click on the Submit button"},
]

モデル選択

Anthropic社内でのテストに基づくと、各モデルにはそれぞれ独自の強みがあります。

  • Sonnet 4.6機械式クリック方式は、最高の精度、正確な空間位置決め、近距離での誤差の低減、そして高圧縮画像に対する優れた耐性を実現します。ほとんどの機械的に実行されるタスクに適しており、精度、推論、コストの最適なバランスを実現します。
  • Opus 4.7Opus 4.7は推論機能が強化され、クリック精度もSonnet 4.6に匹敵するようになりました。さらに、解像度も向上(3.75MP対1.15MP)したことで、圧縮率も低く抑えられています。推論と高精度なクリックの両方が求められるタスクであれば、Opus 4.7が現状最適なソリューションと言えるでしょう。
  • Haiku 4.5レイテンシー優先オプションは、極めて高い速度が求められるシナリオに適しています。

アドバンスモード:コマンダーモード(オーケストレーター+サブエージェント)

複雑なワークフローにおいては、強力な推論能力を持つモデル(Opusなど)を「司令塔」として計画立案と意思決定を担当させ、SonnetやHaikuは特定のクリック操作を実行することで、作業を分担し、連携を図ることができる。

大きなボタン、入力ボックス、標準メニュー項目、Claude チェックボックス、システムトレイアイコン、ドロップダウン矢印、小型スイッチなどの小さな要素については、概ね高い精度が得られます。

理由:4K画面(3840×2160)を720pに圧縮すると、元々16ピクセルだったチェックボックスが約5ピクセルに縮小され、正確にタップするのが難しくなります。

解決

  • ZoomをオンにするClaude バージョン4.6および4.7ではズーム機能がサポートされており、クリックする前にモデルの特定領域を拡大表示できます。ツール設定に「enable_zoom」: Trueを追加してください。
  • ターゲットを拡大するUIが制御可能な場合、クリック対象のサイズを大きくする(システムのDPIを下げる、ブラウザのズームを上げる、UIスケールを調整する)ことで、精度を大幅に向上させることができます。
  • キーボードの交換非常に小さな要素の場合、マウスのクリックよりもタブナビゲーションやキーボードショートカットの方が信頼性が高い。
  • ソース解像度を考慮する4K以上のモニターを720pに圧縮すると、画質が大幅に低下します。4.6モデルを使用している場合は、DPIを下げるか、スクリーンショットを該当の画面領域に絞り込んでみてください。Opus 4.7を使用している場合は、解像度の上限を高く設定することで、圧縮の必要性を軽減できます。

思考努力の最適化

Claude 適応思考をサポートし、思考パラメータで強度を設定します: 低、中、高、xhigh (Opus 4.7 のみ)、および最大。

Opus 4.7

OSWorld検証済みベンチマークテスト:

  • ハイエンド精度はほぼ最大に近いが、出力されるトークンは必要な値の約半分しかない。
  • 低価格帯スコアはOpus 4.6の最高値/最大値とほぼ同じで、トークンの使用率は約1/10です。
  • 最大ファイル最高スコアは、トークンコストの大幅な増加に対応します。
  • デフォルト:高(複雑な多段階インタラクションにおいて最高の費用対効果を発揮)
  • 高スループット/コスト重視:low
  • 単純速いタスクソネット4.6を試してみてください
  • 複雑な単発タスク:max

Claude 4.6 家族

テスト結果によると、中程度の難易度のタスクの成功率はほぼ最大値に達しており、それ以上の思考努力の増加は効果が逓減することが示されている。

  • 推薦するデフォルト:medium
  • 思考を停止するよりは、低いレベルの方がましだ。エラーや再試行の回数が減ったため、実際のトークン消費量は実際には少なくなります。
  • いいえ推薦するコンピュータ使用におけるmaxの使用テストの結果、精度は高い場合と比べて改善されず、トークンコストが増加しただけだった。

させて AI Agent コンピュータを直接操作する場合、セキュリティは最優先事項です。Anthropicの防御システムは3つの層で構成されています。

第一層:トレーニング耐性

トレーニング中、モデルは注入されたコンテンツを含む多数のウェブページやアプリケーションインターフェースに触れ、強化学習を通じて悪意のあるコマンドを識別して拒否することを学習します。

第二層:リアルタイム分類器

並列スキャンはリクエストごとに開始されます Claude 文脈情報は、テキストに隠された指示、画像に埋め込まれた指示、および欺瞞の試みを検出するために使用されます。 Agent 偽のUI要素。

公式のツールタイプ computer_20251124 を使用すると、分類器を挿入する必要があることを示すプロンプトが表示されます。自動モデル推論と並行して実行され、追加の遅延やコストは一切発生しません。公式の型を使用せず、独自のツールを実装する場合は、このレイヤーは利用できません。自動守る。

第三層:人間参加型

取り消し不可能な操作(フォームの送信、支払い、メッセージの送信、データの変更など)を実行する前に、以下のことを行ってください。 Agent ちょっと待ってください。確認させてください。原文では、最も効果的な防御策は、実は人間が関与する仕組みであると強調されています。

コンピュータ使用タスクは非常に時間がかかることが多く、スクリーンショット1枚につき1000~1800トークンを消費します。20万トークンのコンテキストウィンドウは100枚未満のスクリーンショットでいっぱいになり、100万トークンのウィンドウも不足しています。

第1層:キャッシュブレークポイント

APIは最大4つのキャッシュされたブレークポイントをサポートしています。推薦する手順: 1つをシステムプロンプトとツール定義(固定コンテンツ)に配置し、残りの3つを...最新の`tool_result`では、各ラウンドで古いタグがクリアされ、新しいタグが配置されます。これにより、APIは毎回ダイアログのプレフィックス全体を再処理する必要がなくなります。

第2層:ローリングバッファー

最新のN枚のスクリーンショットの完全なデータのみを保持し、それ以前のスクリーンショットはテキストプレースホルダーに置き換えられます[画像省略]。

主な詳細:個別の画像クリーンアップではなく、バッチ置換が使用されます。デフォルトでは最新の3枚の画像が保持され(keep_n=3)、25枚の画像ごとにクリーンアップが実行されます(interval=25)。画像を1枚ずつ置換すると、各ラウンドでダイアログのプレフィックスが変更されるため、キャッシュが無効になります。バッチ置換では、プレフィックスバイトを複数のラウンドにわたって一貫性のある状態に保つことができるため、キャッシュヒット率を維持できます。

第三層:LLM 圧縮

スクロールバッファがコンテンツを保持できなくなると、モデル自体が対話履歴を要約し、元のコンテンツを破棄します。

圧縮されたプロンプトテンプレートには、8種類の情報を保持する必要があります。完全なユーザー指示(「必須」、「禁止」、「常に」などのすべての制約を保持)、タスクテンプレート、制約ルール、実行された操作、エラーと修復の記録、進捗状況の追跡、現在のステータス、および次のステップの計画。

最も重要な原則:すべてのユーザーコマンドは一字一句そのまま保存されなければならない。ユーザーコマンドは最も重要な要素であり、それが失われると… Agent 任務から逸脱している。

サーバ自動圧縮

APIリクエストに`context_management`パラメータと`compact-2026-01-12 beta`フラグを追加してください。入力トークンの数が一定のしきい値に達すると、サーバーが応答します。自動圧縮をトリガーします。圧縮応答を受信すると、クライアントはキャッシュのアライメントを維持するために、ローカルメッセージ配列を同じ位置に切り詰めます。

従来のアプローチはタスクを言葉で記述することですが、これは面倒で、モデルの理解に誤りが生じやすいです。元の論文では新しいアプローチを提案しています。「説明しない」… Claude どうすればいいのか?直接「実演」すればいい。

レコーディングステージ

ユーザーが手動で一度タスクを実行すると、システムは操作の各ステップ(クリック座標、入力内容、ページナビゲーション)を記録し、各ステップのスクリーンショットを提供します。スクリーンショットには、クリック位置が青い円でマークされます。

リプレイステージ

Claude 操作手順のデモンストレーションが届きました。「手順1:経費タイプのドロップダウンメニューをクリックする」(スクリーンショット付き)、「手順2:出張タイプを選択する」(次のスクリーンショット付き)…Claude 現在の現実世界の環境では同じシーケンスが実行されますが、座標に従って厳密に再現されるわけではありません。UI レイアウトが変更されたり、ボタンが移動されたり、メニューが再配置されたりすると、Claude デモに基づいて、「何をすべきか」を理解し、現在の画面上の対応する要素を見つけます。

3つの再生モード

  • 厳格モード手順を正確に実行し、UIに重大な変更が生じた場合は停止して報告してください。コンプライアンスが重視される状況に適しています。
  • アダプティブモードこの例を参考にしつつ、レイアウトの軽微な変更、ボタン名の変更、メニューの再配置などに対応できるよう、柔軟に調整してください。推薦するデフォルトモード。
  • 目標指向型モデルこの方法は最終結果のみに焦点を当てており、記録手順はあくまで参考用です。UIが頻繁に変更されるものの、目標が変わらないシナリオに適しています。

コンピュータの使用は主に機械的な操作(クリック、タイピング、スクロール)を伴うため、Sonnetは低コストで高速なソリューションと言えます。しかし、時折、より深い検討が必要になります。このボタンをクリックしても良いのでしょうか?情報が間違っていたらどうなるのでしょうか?処理中に間違いがあった場合、どうすれば元に戻せるのでしょうか?

練習するSonnetはルーチン作業を自律的に実行し、戦略的な意思決定が必要な場合にOpus 4.7がアドバイザーとして呼び出されます。Opusが意思決定を行った後、プロセスはSonnetに戻され、反復的な手順の実行が継続されます。これにより、低コストかつ高効率な処理が実現されます。知的バランス。

非効率的な最適化(内部テストの結果、非効率的と判断された)

原文では、内部評価において一貫した改善が見られなかった以下の方法が明示的に列挙されている。

  • スクリーンショットはより小さなタイル(象限/領域)に分割され、それぞれ個別に送信されます。
  • スクリーンショットに座標グリッドを重ね合わせると、モデルの位置特定に役立ちます。
  • スケーリングアルゴリズム(PIL LANCZOS、sipsなど)を変更しても、結果に違いはなかった。

原文では、体系的な診断フレームワークが提供されています。

症状 考えられる理由 解決
システム的な一方向オフセットをクリックします 表示サイズが実際に送信された画像と一致しません。スクリーンショットがAPIの制限を超えているため、暗黙のうちに圧縮されています。画像はメッセージ配列の先頭にあります。 表示サイズが拡大縮小されたスクリーンショットと一致していることを確認してください。1280×720に事前に拡大縮小してください。テキストは画像より前に表示されます。
概ね正しいが、目標から逸脱している ターゲットサイズが非常に小さい。ソース画像(4K+)が過度に圧縮されている。非ネイティブのアスペクト比が強制的に適用されている。 開ける enable_zoomDPIを下げるか、領域をトリミングしてください。縦横比は維持してください。
完全に誤ってクリックされた要素 指示の曖昧さ、視覚的に類似した要素、過度に複雑な単一ステップ操作。 場所のコンテキストを追加する。より小さなステップに分解する。ページレイアウトの説明を補足する。
全体的な精度が低い スクリーンショットが制限を超えました。4K以上の高解像度ソースです。解像度が低すぎます。 事前スケーリング済み。Opus 4.7による圧縮率低減。1280×720のベースラインで実験中。

特別なシナリオドロップダウンメニューの中には、ブラウザのビューポートではキャプチャできないシステムレベルのUI要素を呼び出すものがあります。この場合、モデルはエラーを起こしているように見えますが、実際にはメニューが表示されていないだけです。このような場合は、クリックではなく、JavaScriptの実行、キーボードナビゲーション、または直接的なDOM操作を使用するようにモデルを変更する必要があります。

このガイドでは、すぐに使えるPythonコードテンプレートを提供します。内容は以下のとおりです。

  • compute_max_api_fit()APIを使用してネイティブのアスペクト比に基づいて最適な解像度を計算します。
  • prepare_screenshot()スクリーンショットを拡大して、base64形式に変換します。
  • scale_coordinates()APIから返された座標を、実際の画面座標に復元します。

そして、完全なAPI呼び出しの例:スクリーンショットのキャプチャ、事前スケーリング、メッセージの構築(画像の前にテキスト)、ツールの設定から復元実行の調整までの全プロセス。

ガイドのコアエンジニアリングロジックは次のように要約できます。事前スケーリングされたスクリーンショットで座標のずれを解消 → 理解を深めるためにテキストをスクリーンショットの前に配置 → シナリオベースの選択(ソネットの実行/オプスの推論) → 小さな目標にはズームまたはキーボード入力 → 最適な中/高レベルの思考 → セキュリティのための3層防御 → コンテキスト管理のための3層ファネル → コスト削減のために書き込みではなく記録 → トークンを節約するためのアドバイザーモード。「事前スケーリングされたスクリーンショット」は投資対効果が最も高い単一ポイント最適化を表し、「教育モード」は… Prompt 工学分野における新たなパラダイムは、デモンストレーション学習へと進化する。

  • 公式サイトアドレス:https://claude.com/blog/best-practices-for-computer-and-browser-use-with-claude