project
Doubao 2.1 - ByteDanceの新しいインテリジェントエージェントモデルシリーズ
Seed 2.1は、ByteDanceのSeedチームが開発した、現実世界の生産性向上シナリオ向けに開発された新しいインテリジェントエージェントモデルシリーズで、ProバージョンとTurboバージョンが含まれています。
Doubao 2.1とは何ですか?
Seed 2.1は、ByteDanceのSeedチームが開発した、現実世界の生産性シナリオ向けに設計された新しいインテリジェントエージェントモデルシリーズです。ProバージョンとTurboバージョンが用意されています。これらのモデルは、日常生活、業務、最先端の研究における複雑なニーズに対応することを目指しており、エージェントの汎用機能、エンドツーエンドのコードエンジニアリング配信、マルチモーダル理解という3つの主要な側面において大幅な改善を実現しています。特に、現実世界のワークフローにおける安定した配信を重視しています。
Doubao 2.1の主な機能
- 一般的なエージェントタスクの実行: プロジェクト計画、文書処理、ツールや環境にまたがる複数ステップのツール呼び出しなど、付加価値の高いオフィス業務を遂行し、実用的な成果を生み出すことができます。
- コードエンジニアリングのエンドツーエンドの提供: 要件の理解、機能の実装、バグ修正、実行環境のセットアップ、結果の検証を網羅し、リポジトリレベルでの複数ファイルの共同変更をサポートします。
- マルチモーダルコンテンツの理解: 複雑な視覚情報、ビデオコンテンツ、図表、文書、PDF、その他の資料から得られる情報を正確に認識、推論、統合することができる。
- コンピュータはエージェント(CUA)を使用します。 モバイルGUI、デスクトップOS、ブラウザ、そしてNotion/Canva/Figmaなどの生産性向上ツール間でのシームレスな切り替えと操作をサポートします。
- 長文のコンテキストとビデオ処理: これは、128KBの長文ドキュメントや1時間にも及ぶ動画の理解、検索、およびリアルタイムストリーミング分析をサポートします。
豆宝の技術原理 2.1
- ディープシンキングアーキテクチャ思考モードは思考パラメータによって制御され、reasoning_effortは最小、低、中、高の4段階で調整可能です。ツール呼び出しシナリオでは、思考チェーンの内容が後続の推論ラウンドに参加し、複数ラウンド呼び出しの精度を向上させます。また、思考の要約と暗号化された元のテキストフィードバックの出力もサポートしています。
- マルチモーダルコーディング画像認識では、`detail` パラメータを使用して詳細度を制御し、low、high、xhigh の 3 つのモードをサポートし、最大入力は 5120 トークン、903 万ピクセルです。動画認識では、`fps` を使用して詳細度を制御し、10MB を超えるファイルは Files API を介してアップロードされ、ファイル ID を使用して取得されます。
- キャッシュ再利用メカニズム暗黙的なキャッシングは、追加の設定を必要とせずにリクエスト内の共通のプレフィックスを自動的に識別します。明示的なキャッシングは、プレフィックスキャッシングとセッションキャッシングによってヒット率を高め、モデルによる同じコンテンツの重複処理を回避し、トークンコストを大幅に削減します。
Doubao 2.1の使い方
- Doubaoのクライアント: DoubaoのPC版またはアプリ版をダウンロードし、チャットインターフェースでオフィスタスクモードを選択すると、Seed 2.1シリーズのモデルが呼び出されます。
- TRAE開発ツール: TRAE Work または TRAE IDE の組み込みモデルの一覧で、
Doubao-Seed-2.1-ProまたはDoubao-Seed-2.1-Turbo現在のセッションモデルと同様です。 - Volcano Ark API: 火山エンジンアーク体験センターにログインし、モデル広場を選択してください。
Doubao-Seed-2.1-ProまたはDoubao-Seed-2.1-Turboオンラインで体験するか、APIにアクセスしてください。
Doubao 2.1の主な利点
- コーディングのエンジニアリング提供能力が飛躍的に向上SciCodeやNL2Repo-Benchなどのプログラミングベンチマークにおいて、GPT-5.5を上回るか同等の性能を発揮し、要件理解力、長期計画能力、継続的な修復能力も優れているため、実際の企業R&Dシナリオにおける複雑なエンジニアリング業務を遂行する能力を備えている。
- エージェントのロングチェーン実行優先度MobileWorld(GUIのみ)は73.1のスコアを獲得し、GPT-5.5(54.7)とClaude-Opus-4.7(57.1)を大幅に上回り、エンドツーエンドのクローズドループ配信と複雑なタスクオーケストレーションをサポートします。
- 視覚理解の分野でトップMMMU-Pro、CharXiv-RQ、GDPValなどのVLMにおいて優れたベンチマーク結果を達成し、高解像度画像や動画の理解をサポートし、より安定したクロスプラットフォームGUI操作を提供します。
Doubao 2.1のプロジェクトアドレス
- プロジェクト公式サイト:https://seed.bytedance.com/seed2_1
Doubao 2.1と類似競合製品との比較
| 寸法 | Doubao Seed 2.1 Pro | GPT-5.5 |
|---|---|---|
| Terminal Bench 2.1 | 71.0 | 73.8 |
| SWE-Pro | 57.5 | 58.6 |
| SciCode | 59.8 | 58.4 |
| NL2Repo-Bench | 47.0 | 45.1 |
| OSWorld | 78.8 | 78.7 |
| MobileWorld(GUI-only) | 73.1 | 54.7 |
| CharXiv-RQ | 85.4 | 83.2 |
| MMMU-Pro | 81.6 | 81.2 |
| GDPVal | 87.9 | 84.9 |
| MCP-Atlas | 83.8 | 81.6 |
| SeedClawBench | 66.6 | 66.4 |
| Agents’ Last Exam | 19.5 / 41.4 | 24 / 42.8 |
| Toolathion | 50.6 | 55.6 |
| Apex Agents | 33.8 | 35.4 |
| 推論入力価格 | 100万トークンあたり6元 | – |
| 推論出力価格 | 100万トークンあたり30元 | – |
Doubao 2.1の応用シナリオ
-
エンタープライズ向け複合ソフトウェア開発複数ファイルによるプロジェクト配信、コードのリファクタリング、長期保守、自動テストをサポートし、実際の研究開発シナリオにおける高付加価値の生産タスクを処理する能力を備えています。
-
AIエージェントによる自動建設これにより、長鎖タスクのオーケストレーション、クロスプラットフォームのGUI操作、および複数のツールの呼び出しをクローズドループで実行することが可能になり、企業生産から個々の従業員の効率向上まで、エンドツーエンドのシナリオを網羅します。
-
マルチモーダルコンテンツの理解これは、ビデオ分析、テキストと画像の混合推論、インテリジェントな文書処理とレビューに使用され、きめ細かな視覚的理解のニーズをサポートします。
-
大規模オンラインサービス展開高並行API呼び出し、コスト重視の運用環境、バッチ推論タスクに適しています。Turboバージョンは、大規模なオンライントラフィックをより低コストで処理できます。