project
Doubao 1.5·UI-TARS - ByteDance Doubao によって発売された GUI エージェント モデル
Doubao 1.5·UI-TARSは、ByteDanceが開発したグラフィカルユーザーインターフェース(GUI)とのインタラクションのためのエージェントモデルです。知覚、推論、行動実行といった人間のような能力に基づき、グラフィカルインターフェースとの継続的かつスムーズなインタラクションを実現します。このモデルは…
Doubao 1.5·UI-TARSとは何ですか?
Doubao 1.5·UI-TARSは、ByteDanceのDoubaoプラットフォームが開発した、グラフィカルユーザーインターフェース(GUI)操作のためのエージェントモデルです。知覚、推論、行動実行といった人間のような能力に基づき、GUIとのスムーズで連続的なインタラクションを実現します。視覚理解、論理的推論、インターフェース要素の位置特定、操作といった機能を単一のモデルに統合することで、事前定義されたワークフローや手動ルールを必要とせずに、エンドツーエンドのタスク自動化を実現します。Doubao 1.5·UI-TARSは、Volcano Arkプラットフォームで利用可能です。
Doubao 1.5・UI-TARSの主な機能
- グラフィカルインターフェースの操作機能知覚、推論、および行動実行に基づいて、グラフィカルユーザーインターフェースとの継続的かつスムーズなインタラクションを可能にし、複雑なタスクを完了させます。
- 視覚的理解と位置付け画面上の視覚情報を理解し、複数のターゲットや小さなターゲットの境界ボックスとポイントの位置特定をサポートし、位置特定回数をカウントし、位置特定内容を記述します。
- 論理的推論と意思決定視覚情報と作業指示を組み合わせて論理的推論を行い、合理的な操作手順を生成する。
- 高い実行効率Ark Bean Bunの大規模モデル推論サービスをベースとしており、初期TPMが500万、推論レイテンシが30ms TPOTと、ネットワーク全体で最高のスループットを誇ります。
- ネイティブGUIエージェントこれにより、事前定義されたプロセスや手動ルールを必要とせずに、GUI対話型タスクのエンドツーエンドの自動実行が可能になります。
Doubao 1.5・UI-TARSの技術原理
- ビジュアルラージモデル(VLM)このモデルは、画像、テキスト、アイコンなど、グラフィカルインターフェース内の視覚情報を理解し処理する強力なビジュアルビッグモデルに基づいています。
- マルチモーダル融合視覚認識、論理的推論、および行動実行能力を単一のモデルに統合することで、マルチモーダル情報の融合処理を実現します。
- エンドツーエンドの学習大量のラベル付きデータと強化学習に基づいて、このモデルは手動でルールを定義する必要なく、タスク入力から操作出力までのエンドツーエンドのマッピングを学習します。
Doubao 1.5・UI-TARSプロジェクト公式サイト
- プロジェクト公式サイト:https://www.volcengine.com/docs
Doubao 1.5・UI-TARSの応用シナリオ
- 自動化されたオフィス文書、スプレッドシート、メールなどのタスクを自動処理することで、効率を向上させます。
- ソフトウェアテストユーザー操作をシミュレーションすることで、ソフトウェアの問題を検出し、品質を向上させる。
- インテリジェントな顧客サービスユーザーからの質問にリアルタイムで回答し、操作に関するガイダンスを提供します。
- ロボットとのインタラクションこれはロボットが複雑な作業を完了できるように誘導するもので、産業や物流分野で利用されている。