project
PhoneBuddy - テンセント・フンユアンのオープンソース4Bパラメータモバイルエージェントモデル。
PhoneBuddyは、テンセントのHunyuanチームが開発したオープンソースの4Bパラメータモバイルエージェントモデルです。その中核となる研究は、現実世界のモバイル環境で実用的なAIエージェントを訓練する方法に焦点を当てています。
PhoneBuddyとは何ですか?
PhoneBuddyは、テンセントのHunyuanチームが開発したオープンソースの40億パラメータのモバイルエージェントモデルです。そのコアとなる研究は、現実世界のモバイルシナリオで実用的なAIエージェントをトレーニングすることに重点を置いています。このモデルは、実際のアプリと模擬アプリを組み合わせたハイブリッド強化学習方式を採用しています。150の実機評価タスクにおいて、単一アプリとWeChatミニプログラムの両方でGPT-5.4を上回る成功率を達成し、AndroidWorldでは83.2%に達しました。これは、この小型モデルが環境設計の最適化によって高い競争力を発揮できることを示しています。
PhoneBuddyの主な機能
-
モバイルGUIの理解と操作スマートフォンの画面のスクリーンショットを認識し、クリック、スワイプ、タイピングなどの次の動作を予測できる。
-
単一アプリのタスク実行検索、設定、コンテンツ作成などの操作を、単一のネイティブアプリケーション内で完結できます。
-
アプリ間の情報フローこれにより、複数のアプリケーション間で情報を転送し、連携を必要とする複雑なタスクを完了することが可能になります。
-
WeChatミニプログラムの操作これは、WeChatミニプログラムのエコシステム内での検索、予約、問い合わせなどのタスクをサポートします。
-
実世界のタスク検証メッセージが送信されたか、ドキュメントが保存されたかなど、タスクが実際に完了したかどうかを確認してください。
PhoneBuddyの技術的原理
- 2段階トレーニングアーキテクチャShared SFTを用いることで、モデルは実機アプリと模擬アプリの両方の動作軌跡を同時に学習し、携帯電話操作のための統一された基本機能を確立する。強化学習段階では、実機環境のみでの学習と、実機アプリと模擬アプリを組み合わせた学習の効果を比較する。
- 実機+模擬ハイブリッド強化学習リアルアプリは、実際のビジネスロジック、アカウントステータス、および副作用を提供します。一方、PhoneWorldモックアプリは、リセット可能で検証可能かつ拡張可能なトレーニング信号を提供します。この2つは互いに補完し合い、現実的だがトレーニングが難しいものと、制御可能だが非現実的なものとの間の矛盾を解消します。
- PhoneWorld環境設定実際のGUI使用構造から、ページ構造、ナビゲーション関係、インタラクティブ要素、タスク検証機能を保持した、動作するAndroidモックアプリを再構築し、強化学習が安定した報酬信号を取得できるようにします。
- タスクレベルの検証メカニズムホテルの予算がフィルタリングされているか、休暇申請が正しく貼り付けられているかなど、タスクの最終ステータスを直接確認し、エージェントがユーザーの目標を真に達成したことを確認します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
PhoneBuddyの使い方
- 環境準備PhoneBuddy-4Bモデルの重みと依存関係をダウンロードして設定し、実行環境としてAndroidの実機またはエミュレーターを準備してください。
- データ収集SFT段階のトレーニングのために、実際のアプリ操作軌跡を収集し、検証可能なインタラクションデータを取得するために、PhoneWorldモックアプリを構築または接続します。
- モデルトレーニングまず、Shared SFTトレーニングを実行して、モデルが統一された動作フォーマットを習得できるようにします。次に、RLの微調整のために、実環境のみ、または実環境と模擬環境の両方を含む環境を選択します。
- タスク展開学習済みのモデルはモバイル実行レイヤー(PhoneHarnessなど)に接続され、タスク指示はGUIまたはCLIを介して発行されます。
- 結果検証:タスクバリデーターを使用して最終実行ステータスを確認し、タスクが実際に完了したこと、そしてページが見た目だけ正しいのではないことを確認してください。
PhoneBuddyの主な利点
-
現実世界のシナリオ指向このトレーニングは、オフラインのベンチマークスコアを最適化するだけでなく、実際の携帯電話と実際のアプリに直接対応することを目的としている。
-
小型ながら高性能4Bパラメータだけでも、単一アプリおよびWeChatミニプログラムのタスクにおいてGPT-5.4を上回っており、環境設計は単にパラメータを積み重ねるよりも重要であることを証明している。
-
検証可能な強化学習トレーニングPhoneWorldの模擬環境は安定した報酬を提供するため、強化学習のトレーニングを拡張可能にすることができます。
-
フルテクノロジースタックがオープンソース環境、訓練、実施状況からセキュリティやプライバシーの評価に至るまで、あらゆる情報が公開される。
-
タスク完了保証フォローアップを制限し、情報伝達を検証することで、エージェントがユーザーの意図を真に実行することを保証します。
PhoneBuddyプロジェクトのアドレス
- プロジェクト公式サイト:https://phonebuddyai.github.io/
- GitHubリポジトリ:https://github.com/PhoneBuddyAI/phonebuddy
- ハギングフェイスモデルライブラリ:https://huggingface.co/PhoneBuddyAI/PhoneBuddy-4B
- 技術論文:https://phonebuddyai.github.io/assets/paper.pdf
PhoneBuddyの競合製品比較
| 比較対象寸法 | PhoneBuddy-4B-Real+Mock | GPT-5.4 |
|---|---|---|
| モデルサイズ | 4B(オープンソース) | 非公開の大型モデル(数百バイトと推定) |
| トレーニング方法 | 実機+模擬ハイブリッド強化学習 | 具体的な機動エージェントの訓練計画は明らかにされていない。 |
| 単一アプリの成功率 | 62.0% | 50.0% |
| WeChatミニプログラムの成功率 | 56.0% | 40.0% |
| AndroidWorld | 83.2% | 70.7% |
| クロスアプリ成功率 | 18.0% | 明示的に記載されていない(記事中で言及されていない) |
| 平均成功率 | 54.8% | 48.2% |
| 環境制御可能性 | モック環境のリセットと検証をサポートします | 実際のAPI/環境によって異なります |
PhoneBuddyのアプリケーションシナリオ
-
スマートフォンアシスタントユーザーは自然言語コマンドを使用して、荷物の確認、ホテルの予約、メッセージの送信といった日常的なタスクをエージェントに実行させることができます。
-
自動テスト実際のアプリにおけるUIテストプロセスを自動化し、機能の整合性とビジネスロジックを検証します。
-
アクセシビリティ視覚障害者やITリテラシーの高いユーザーが、複雑な複数ステップの携帯電話操作を自動的に完了できるように支援します。
-
アプリケーション間ワークフローメールから情報を自動的に抽出してフォームに入力したり、複数のオフィスアプリ間でデータを転送したりできます。
-
ミニプログラムサービスオートメーションネイティブアプリをインストールすることなく、WeChatミニプログラム内で検索、予約、注文などのタスクを完了できます。