project
TACO - 北京航空航天大学などの大学が開発した、エッジレベルのインテリジェントエージェント向けのオープンソースの自己進化型観測圧縮フレームワーク。
TACOは、マンチェスター大学、北京航空航天大学、香港科技大学、およびMAPチームによって開発された、オープンソースでプラグアンドプレイ方式のエンドユーザー向けインテリジェントエージェント自己進化型観測圧縮フレームワークです。
タコスとは何ですか?
TACOは、マンチェスター大学、北京航空航天大学、香港科技大学、およびMAPチームによって開発された、自己進化型端末エージェント向けのオープンソース、プラグアンドプレイ、トレーニング不要の観測圧縮フレームワークです。このフレームワークは、インタラクションの軌跡から圧縮ルールを自動的に発見して再利用し、冗長なログをフィルタリングしながら重要なエラーを保持することで、複数ターンのコマンドラインタスクで蓄積されたシェル出力ノイズによって引き起こされるコンテキストの肥大化に対処します。このフレームワークはプラグアンドプレイでトレーニング不要であり、すでにHarborのterminus-2に統合されています。TerminalBenchなどのベンチマークでは、DeepSeek-V3.2やQwen3などのモデルに対して1%~4%の精度向上を実現し、長時間タスクにおけるトークン消費を大幅に削減します。
TACOの主な機能
-
自己進化ルールの発見このフレームワークは、複数回の端末操作から得られる生のシェル出力を自動的にスキャンし、冗長なパターンを識別し、固定プロンプトやヒューリスティック戦略を手動で記述することなく、圧縮ルールの候補を生成します。
-
オンラインルールの改良と修復ルール境界は、タスク実行からのリアルタイムのフィードバックに基づいて繰り返し調整され、過圧縮や重要な信号の欠落といった問題を修正し、エラーメッセージやステータスフィードバックが誤って削除されないようにします。
-
グローバルルールプールとタスク間移行永続的なグローバルルール知識ベースを維持することで、新しいタスクが以前のセッションで検証されたルールを直接ロードして再利用できるようになり、リポジトリやコマンド環境全体で経験を蓄積することが可能になります。
-
プラグアンドプレイ、トレーニング不要の統合プラグインとして既存の端末エージェント(Harborフレームワークのterminus-2など)に直接組み込むことができ、モデルアーキテクチャを変更したり微調整を行ったりすることなく、コマンドラインパラメータを介して有効化できます。
-
トークンの効率とパフォーマンスを最適化低価値の端末ノイズを除去しつつ、重要な環境フィードバックを保持することで、トークンの消費を線形かつ制御可能なものにし、長期的な複数ラウンドのタスクに対応し、TerminalBenchなどのベンチマークにおいて精度を1~4%向上させます。
TACOの技術原則
-
問題の背景ターミナルエージェントは、複数のタスクラウンドでコンテキストを元のシェル出力で完全に埋め尽くし、システムログやプログレスバーなどの価値の低いノイズが各ラウンドごとに2倍に拡大し、重要なエラーシグナルをかき消し、トークンコストを大幅に増加させます。
-
3モジュール構成このフレームワークは、ルール発見器、ルール精緻化器、およびグローバルルールプールで構成されています。発見器は出力ストリームを監視し、過度に長いコンテンツや未処理コンテンツに対して構造化圧縮ルールを自動的に生成します。精緻化器は、タスクからのフィードバックに基づいてルール境界を繰り返し修復し、重要な情報の誤削除を防ぎます。グローバルルールプールは、検証済みのルールを永続化し、新しいタスクによる直接読み込みと再利用を可能にします。
-
オンライン運用メカニズム各インタラクションラウンドにおいて、グローバルルールプールとの照合によって圧縮が優先されます。カバーされていない長い出力が検出された場合、新しいルールの発見がトリガーされ、現在のタスクによる検証後、グローバルプールに組み込まれます。このプロセス全体は、外部で計画されたLLMによって駆動され、トレーニングデータやモデルの微調整は不要です。これにより、圧縮戦略は端末環境に合わせて動的に進化します。
TACOの使い方
-
環境インスタレーションGitHubリポジトリをクローンした後、プロジェクトのルートディレクトリで以下のコマンドを実行してください。
pip install -e .依存関係のインストールが完了すると、TACOはHarborフレームワークのterminus-2コンポーネントとして直接利用できるようになります。 -
クイックスタートHarborコマンドを実行し、terminus-2エージェントを指定して、モデル情報とTACO固有のパラメータを渡してプロセスを開始します。
scripts/run_taco_example.sh直接編集可能なテンプレートスクリプトを提供します。 -
コアパラメータ設定:合格
--akプレフィックス入力enable_compress=Trueメイン圧縮スイッチをオンにしてください。enable_self_evo=Trueオンラインルール進化を有効化し、同時に設定を行うcompress_base_url、compress_api_keyそしてcompress_model_nameOpenAI互換の計画済みLLMエンドポイントを指します。 -
コモンモード選択完全なエクスペリエンスを実現するには、圧縮と自己進化を同時に有効にし、外部LLMを構成する必要があります。アブレーション実験に固定ルールが必要な場合は、以下を追加してください。
freeze_rules=Trueグローバルルールプールを継承せずに単一タスクのローカル進化のみを使用する場合は、以下を追加します...disable_global_evo=True。 -
操作制御:使用
--ak max_turns=200これらのパラメータは、タスクあたりの最大ラウンド数を増やすように設定されています。model_infoJSON形式で渡してLiteLLMの入力および出力トークン制限を設定することで、長時間実行されるタスクが制御可能なコスト内で実行されるようにします。
TACOの主な利点
-
プラグアンドプレイ、トレーニング不要メインのバックボーンモデルを微調整したり、エージェントの基盤となるアーキテクチャを変更したりする必要はありません。圧縮と自己進化は、コマンドラインパラメータを介して直接有効にできます。
-
自己進化型クロスタスク移行グローバルルールプールにより、エージェントは長期にわたる複数ラウンドのタスクにおいて経験を継続的に蓄積・圧縮することができ、新しいタスクは古い知識を直接継承する。
-
パフォーマンスとコストの両面でウィンウィンの状況TerminalBench上でMiniMax-M2.5、DeepSeek-V3.2、Qwen3-Coder-480Bなどのモデルにおいて1%~4%の精度向上を実現し、さらに同じトークン予算で2%~3%の精度向上を実現します。
-
強い一般化と低い消費SWE-Bench Lite、CompileBench、DevEval、CRUST-Benchにおける成功率を維持または向上させながら、トークンの総消費量を大幅に削減します。
TACOのプロジェクト住所
- GitHubリポジトリ:https://github.com/multimodal-art-projection/TACO
- arXiv技術論文:http://arxiv.org/abs/2604.19572
TACOの類似競合製品との比較
| 寸法 | TACO | SWE-agent | OpenHands |
|---|---|---|---|
| コンテキスト処理 | 自己進化型ルール圧縮、タスク間でのグローバル知識プールの再利用 | インテリジェントな圧縮機構を使用せず、元の端末出力を完全に保持します。 | モデルの元の成長コンテキストまたはユーザー定義のヒントに依存します。 |
| トレーニング依存性 | トレーニングは一切不要、プラグアンドプレイ | 特別なトレーニングは不要ですが、Docker環境の特定の設定が必要です。 | 特別なトレーニングは不要ですが、複雑なサンドボックス環境とランタイム環境が必要です。 |
| タスク間の移行 | グローバルルールプールは、リポジトリ間/セッション間の知識蓄積をサポートします。 | 単一タスクセッションの分離、過去の知識は継承されない。 | マルチタスクには対応しているが、構造化された圧縮ルールの再利用はできない。 |
| トークン効率 | 冗長なノイズを明示的にフィルタリングすることで、長時間のタスクにおけるコストを線形的に制御することが可能になります。 | 初期出力のバックフィル処理により、トークンはラウンドごとに2倍に増加する。 | 長時間実行されるタスクは多くのトークンを消費するため、コンテキスト制限に達しやすい。 |
| オープンソース統合 | オープンソースであり、Harbor評価フレームワークと深く統合されている。 | オープンソース、成熟したコミュニティエコシステム | オープンソースの汎用エージェントプラットフォーム |
TACOアプリケーションシナリオ
-
長期ソフトウェアエンジニアリングエージェントSWE-Bench での複数ラウンドのコードデバッグおよびコンパイルテスト中に、ログとターミナル出力の爆発的な増加を抑制し、明確なコンテキストを維持します。
-
自動化された運用、保守、および展開シェルから返される大量の冗長なシステムステータス情報やプロセス情報を処理するため、DevOpsエージェントの意思決定の安定性が向上します。
-
コードレビューとテスト分析不要なコンパイル警告やテスト合格情報を除外し、重要なエラーとコードの違いを正確に保持する。
-
学術研究の再現と評価Harborフレームワークのterminus-2プラグインとして、端末エージェントのトークン効率評価および長距離通信能力ベンチマークに使用されます。