project
MemHarness - 上海 AI Lab 等推出的智能体记忆重构框架
MemHarness 是上海 AI Lab 联合浙大、复旦、上海交大等高校推出的 LLM Agent 记忆重构框架。现有记忆增强 Agent 常将检索到的历史经验直接注入上下文,若旧经...
MemHarness是什么
MemHarness 是上海 AI Lab 联合浙大、复旦、上海交大等高校推出的 LLM Agent 记忆重构框架。现有记忆增强 Agent 常将检索到的历史经验直接注入上下文,若旧经验与当前状态不匹配反而导致负迁移。MemHarness 受人类记忆重构机制启发,在检索与动作之间插入显式的批判与重构环节,结合当前上下文对历史经验进行保留、改写或丢弃,通过 GRPO 端到端训练,无需额外人工标注。
MemHarness的主要功能
-
记忆检索:Agent 根据当前观测生成查询,从 Milvus 向量记忆库中召回 top-k 相关历史经验及其来源状态。
-
批判与重构:统一策略模型对比记忆来源状态与当前状态,批判其适用性,将经验改写为状态对齐的指导信息,或判定为不适用而舍弃。
-
动作生成:基于重构后的指导信息或自主推理,生成可执行的环境动作。
-
经验回写与剪枝:每轮交互后将轨迹摘要为经验写入记忆库,进行语义去重,定期按经验效用剪枝低价值记忆。
-
端到端训练:通过 GRPO 联合优化检索、重构与动作生成,无需重构阶段的独立标注数据。
MemHarness的技术原理
- 五阶段决策流程:MemHarness 将记忆引导的决策分解为环境观测、经验检索、记忆批判、上下文记忆重构与动作生成五个连续阶段,模拟人类检索—评估—重构的认知过程,取代传统 Agent 直接回放记忆的静态范式。
- 上下文记忆重构机制:策略模型将任务描述、当前历史、检索到的经验及其来源状态拼接为重构上下文,通过对比历史来源状态与当前状态识别差异,保留可迁移知识、改写不匹配内容,或输出
<EMPTY>标记拒绝该记忆并回退到自主推理。 - 统一策略模型架构: 检索查询生成、记忆批判重构与可执行动作生成三个阶段共享同一个策略模型参数,无需为重构模块单独训练价值网络或监督数据,使记忆利用与决策推理在同一模型内紧密耦合。
- GRPO 端到端训练:由于重构指导信息没有真值标注,MemHarness 采用 GRPO 对检索—重构—行动全链路进行端到端优化;奖励由稀疏任务结果与格式奖励组成,通过组归一化优势将轨迹级信用分配给所有 token,同时训练思考、重构与动作生成能力。
微信关注回复“开源”,加入AI开源项目交流群
如何使用MemHarness
-
克隆仓库并创建环境:执行
git clone https://github.com/KnowledgeXLab/MemHarness.git并创建python==3.12的 Conda 环境,依次安装 vLLM、Flash Attention 2 及 MemHarness 本体。 -
部署嵌入服务:通过
vllm serve BAAI/bge-m3 --port 8001启动 BGE-M3 嵌入模型,为 Milvus 记忆库提供向量编码服务。 -
安装目标环境:根据任务需求分别安装 ALFWorld 或 WebShop 交互环境,并下载对应的游戏文件与预训练检测器。
-
冷启动 SFT(可选):运行
scripts/build_*_coldstart_data.py构建冷启动数据,执行scripts/cold_start_sft.sh使模型对齐交互格式与记忆摘要格式。 -
GRPO 端到端训练:运行
run_scripts/train_alfworld.sh或run_scripts/train_webshop.sh,框架将自动启动记忆向量数据库、执行 Agent 检索、经验回写与剪枝,完成 GRPO 训练。
MemHarness的核心优势
-
重构优于回放:显式插入批判与重构环节,将静态记忆片段转化为上下文敏感的状态对齐指导,避免负迁移。
-
小模型超越大模型:7B 参数规模在 ALFWorld 和 WebShop 上分别超越 Gemini-2.5-Pro 23.1% 和 39.7%。
-
OOD 鲁棒性强:在分布外场景中平均成功率达 85.9%,显著高于原始记忆回放的 76.3%。
-
隐式推理增强:即使测试时关闭记忆,重构训练目标仍使基础策略成功率从 76.4% 提升至 83.0%,从根本上增强 Agent 内在推理能力。
-
无需额外标注:重构能力通过 GRPO 端到端训练自然涌现,不依赖人工编写的重构监督数据。
MemHarness的项目地址
- GitHub仓库:https://github.com/KnowledgeXLab/MemHarness
- HuggingFace模型库:https://huggingface.co/KnowledgeXLab/MemHarness
- arXiv技术论文:https://arxiv.org/pdf/2607.28272
MemHarness的同类竞品对比
| 维度 | MemHarness | EvolveR |
|---|---|---|
| 记忆范式 | 显式记忆库 + 状态条件重构 | 显式记忆库 + 经验演化 |
| 核心机制 | 检索后批判重构,保留/改写/丢弃 | 检索后直接注入,依赖经验演化迭代 |
| 训练方式 | GRPO 端到端,无需重构标注 | RL 训练,记忆经验需逐步演化积累 |
| OOD 表现 | 85.9%(ALFWorld OOD) | 未重点报告 OOD 鲁棒性 |
| 可解释性 | 重构过程可检查,支持 EMPTY 拒绝 | 记忆注入过程相对黑盒 |
| 模型规模 | 7B 即超越 Gemini-2.5-Pro | 通常需更大规模或更多训练步数 |
MemHarness的应用场景
-
具身智能家务:在 ALFWorld 等家庭环境中,Agent 可重构过往取物、清洁经验,适配不同房间布局完成复杂家务任务。
-
自主在线购物:在 WebShop 等电商平台中,根据历史购物经验重构为当前商品搜索与筛选策略,提升目标导向购物成功率。
-
智能客服对话:客服 Agent 检索历史相似工单后重构解决方案,避免直接套用旧答复导致答非所问。
-
代码辅助开发:编程 Agent 重构过往 bug 修复经验,适配当前代码上下文,提供精准的修复建议而非照搬旧方案。
-
科研实验规划:实验 Agent 根据历史实验参数与结果重构为当前实验条件的最优配置建议,减少试错成本。