project
MemHarnessは、上海AIラボなどが開発した、インテリジェントエージェントの記憶再構築フレームワークです。
MemHarnessは、上海AIラボが浙江大学、復旦大学、上海交通大学などの大学と共同で開発したLLMエージェントの記憶再構築フレームワークです。既存の記憶強化エージェントは、多くの場合、過去の経験を直接コンテキストに注入しますが、古い経験が...
MemHarnessとは何ですか?
MemHarnessは、上海AIラボが浙江大学、復旦大学、上海交通大学などの大学と共同で開発したLLMエージェントの記憶再構築フレームワークです。既存の記憶強化エージェントは、多くの場合、取得した過去の経験を直接コンテキストに注入しますが、古い経験が現在の状態と一致しない場合、負の転移を引き起こす可能性があります。人間の記憶再構築メカニズムに着想を得て、MemHarnessは、取得と行動の間に明示的な批判と再構築のステップを挿入します。現在のコンテキストに基づいて過去の経験を保持、書き換え、または破棄し、GRPOを使用してエンドツーエンドでトレーニングされるため、追加の手動アノテーションは必要ありません。
MemHarnessの主な機能
-
記憶の想起エージェントは、現在の観測結果に基づいてクエリを生成し、Milvusベクトルメモリから関連性の高い上位k個の過去の経験とそのソース状態を取得します。
-
批判と再構築統合戦略モデルは、記憶の元となる状態と現在の状態を比較し、その適用可能性を批判的に検討し、経験を状態に合わせたガイダンス情報に書き換えるか、あるいは適用不可能として破棄する。
-
行動創出再構築されたガイダンス情報または自律的な推論に基づいて、実行可能な環境アクションを生成する。
-
執筆と剪定の経験各インタラクションラウンドの後、その軌跡は経験として要約され、記憶バンクに書き込まれる。意味的重複排除が実行され、経験の有用性に応じて価値の低い記憶が定期的に削除される。
-
エンドツーエンドのトレーニングGRPOによって検索、再構築、およびアクション生成を共同で最適化することにより、再構築段階では独立したラベル付きデータは必要ありません。
MemHarnessの技術原則
- 5段階の意思決定プロセス:MemHarnessは、記憶に基づく意思決定を、環境観察、経験想起、記憶評価、文脈記憶再構築、行動生成という5つの連続した段階に分解します。これは、記憶を直接再生する従来のエージェントの静的なパラダイムに代わり、人間の認知プロセスである想起、評価、再構築をシミュレートします。
- 文脈記憶再構築メカニズム:戦略モデルは、タスク記述、現在の履歴、取得された経験、およびそれらのソース状態を再構築コンテキストに連結します。履歴ソース状態と現在の状態を比較することで、差異を特定し、移転可能な知識を保持し、不一致なコンテンツを書き換え、または出力を行います。
<EMPTY>その記憶は拒否され、プロセスは自律的な推論に戻る。 - 統一戦略モデルアーキテクチャ: クエリ生成、メモリクリティカル再構築、アクション生成の3つの段階は同じポリシーモデルパラメータを共有するため、再構築モジュール用に値ネットワークをトレーニングしたり、データを個別に監視したりする必要がなくなり、メモリ利用と意思決定推論を同じモデル内で密接に連携させることができます。
- GRPOのエンドツーエンドトレーニング:再構築ガイダンス情報には真偽ラベルがないため、MemHarnessはGRPOを使用して検索-再構築-アクションチェーン全体をエンドツーエンドで最適化します。報酬は疎なタスク結果とフォーマット報酬で構成され、思考、再構築、およびアクション生成能力をトレーニングしながら、グループ正規化の利点を通じて軌跡レベルのクレジットがすべてのトークンに割り当てられます。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
MemHarnessの使い方
-
リポジトリをクローンして環境を作成する:埋め込む
git clone https://github.com/KnowledgeXLab/MemHarness.gitそして作成するpython==3.12Conda環境では、vLLM、Flash Attention 2、およびMemHarnessを順番にインストールしてください。 -
組み込みサービスをデプロイする:合格
vllm serve BAAI/bge-m3 --port 8001Milvusメモリ向けにベクトル符号化サービスを提供するため、BGE-M3埋め込みモデルを起動します。 -
対象環境をインストールするタスクの要件に応じてALFWorldまたはWebShopのインタラクティブ環境をインストールし、対応するゲームファイルと事前学習済みの検出器をダウンロードしてください。
-
コールドスタートSFT(オプション):走る
scripts/build_*_coldstart_data.pyコールドスタートデータを作成し、実行するscripts/cold_start_sft.shモデルを対話型フォーマットとメモリサマリーフォーマットに整合させる。 -
GRPOのエンドツーエンドトレーニング:走る
run_scripts/train_alfworld.shまたはrun_scripts/train_webshop.shこのフレームワークは、メモリベクトルデータベースを自動的に起動し、エージェントの取得を実行し、ライトバックとプルーニングを実行し、GRPOトレーニングを完了します。
MemHarnessの主な利点
-
再生よりも再構築の方が優れている静的メモリ断片をコンテキスト依存の状態アライメントガイドラインに変換するための批判および再構築ステップを明示的に挿入することで、負の転移を回避する。
-
小型モデルが大型モデルを上回る7Bパラメータサイズは、ALFWorldとWebShopにおいて、それぞれGemini-2.5-Proを23.1%と39.7%上回る性能を発揮します。
-
OODは堅牢です配布外シナリオにおける平均成功率は85.9%に達し、元のメモリ再生の76.3%を大幅に上回った。
-
暗黙的推論の強化テスト中にメモリを無効にした場合でも、トレーニング目標を再構築することで、基本ポリシーの成功率が76.4%から83.0%に向上し、エージェントの本来の推論能力が根本的に強化された。
-
追加の注釈は不要です再構築能力は、手動で作成された再構築監視データに頼ることなく、GRPOのエンドツーエンドのトレーニングを通じて自然に獲得される。
MemHarnessのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/KnowledgeXLab/MemHarness
- ハギングフェイスモデルライブラリ:https://huggingface.co/KnowledgeXLab/MemHarness
- arXiv技術論文:https://arxiv.org/pdf/2607.28272
MemHarnessの類似製品の比較
| 寸法 | MemHarness | EvolveR |
|---|---|---|
| 記憶パラダイム | 明示的メモリバンク+状態条件の再構築 | 明示的記憶バンク+経験的進化 |
| コアメカニズム | 検索後の重要な再構築:保持/書き換え/破棄 | 取得後、経験的進化と反復に基づいて直接注入を行う。 |
| トレーニング方法 | GRPOはエンドツーエンドで動作し、アノテーションのリファクタリングは不要です。 | 強化学習の訓練には、記憶経験の段階的な発展と蓄積が必要となる。 |
| OODパフォーマンス | 85.9%(ALFWorld OOD) | OODの堅牢性は強調されていない |
| 説明可能性 | リファクタリングプロセスは検査可能であり、空の拒否をサポートしています。 | メモリ注入プロセスは比較的ブラックボックスである |
| モデルサイズ | 7BはGemini-2.5-Proを上回る | 一般的には、より大規模な訓練、あるいはより多くの訓練段階が必要となる。 |
MemHarnessの応用シナリオ
-
スマートホーム管理ALFWorldのような家庭環境では、エージェントは過去に経験した物品の回収や清掃の経験を再現し、さまざまな部屋のレイアウトに適応して複雑な家事を完了することができる。
-
独立系オンラインショッピングWebShopなどのeコマースプラットフォームでは、目標指向型ショッピングの成功率を向上させるため、過去の購買経験に基づいて現在の製品検索およびフィルタリング戦略が再構築されている。
-
インテリジェントな顧客サービス対話カスタマーサービス担当者は、類似の過去の作業指示書を検索して解決策を再構築し、無関係な回答につながる古い回答をそのまま適用することを避ける。
-
コード支援開発プログラミングエージェントは、過去のバグ修正経験をリファクタリングし、現在のコードコンテキストに適合させ、古い解決策を単にコピーするのではなく、正確な修正案を提供する。
-
科学研究実験計画実験エージェントは、過去の実験パラメータと結果に基づいて、現在の実験条件に最適な構成案を再構築し、試行錯誤のコストを削減します。