AB
AiBoss站
project

MemHarness - 上海 AI Lab 等推出的智能体记忆重构框架

MemHarness 是上海 AI Lab 联合浙大、复旦、上海交大等高校推出的 LLM Agent 记忆重构框架。现有记忆增强 Agent 常将检索到的历史经验直接注入上下文,若旧经...

MemHarness是什么

MemHarness 是上海 AI Lab 联合浙大、复旦、上海交大等高校推出的 LLM Agent 记忆重构框架。现有记忆增强 Agent 常将检索到的历史经验直接注入上下文,若旧经验与当前状态不匹配反而导致负迁移。MemHarness 受人类记忆重构机制启发,在检索与动作之间插入显式的批判与重构环节,结合当前上下文对历史经验进行保留、改写或丢弃,通过 GRPO 端到端训练,无需额外人工标注。

MemHarness的主要功能

  • 记忆检索:Agent 根据当前观测生成查询,从 Milvus 向量记忆库中召回 top-k 相关历史经验及其来源状态。
  • 批判与重构:统一策略模型对比记忆来源状态与当前状态,批判其适用性,将经验改写为状态对齐的指导信息,或判定为不适用而舍弃。
  • 动作生成:基于重构后的指导信息或自主推理,生成可执行的环境动作。
  • 经验回写与剪枝:每轮交互后将轨迹摘要为经验写入记忆库,进行语义去重,定期按经验效用剪枝低价值记忆。
  • 端到端训练:通过 GRPO 联合优化检索、重构与动作生成,无需重构阶段的独立标注数据。

MemHarness的技术原理

  • 五阶段决策流程:MemHarness 将记忆引导的决策分解为环境观测、经验检索、记忆批判、上下文记忆重构与动作生成五个连续阶段,模拟人类检索—评估—重构的认知过程,取代传统 Agent 直接回放记忆的静态范式。
  • 上下文记忆重构机制:策略模型将任务描述、当前历史、检索到的经验及其来源状态拼接为重构上下文,通过对比历史来源状态与当前状态识别差异,保留可迁移知识、改写不匹配内容,或输出 <EMPTY> 标记拒绝该记忆并回退到自主推理。
  • 统一策略模型架构: 检索查询生成、记忆批判重构与可执行动作生成三个阶段共享同一个策略模型参数,无需为重构模块单独训练价值网络或监督数据,使记忆利用与决策推理在同一模型内紧密耦合。
  • GRPO 端到端训练:由于重构指导信息没有真值标注,MemHarness 采用 GRPO 对检索—重构—行动全链路进行端到端优化;奖励由稀疏任务结果与格式奖励组成,通过组归一化优势将轨迹级信用分配给所有 token,同时训练思考、重构与动作生成能力。

微信关注回复“开源”,加入AI开源项目交流群

如何使用MemHarness

  • 克隆仓库并创建环境:执行 git clone https://github.com/KnowledgeXLab/MemHarness.git 并创建 python==3.12 的 Conda 环境,依次安装 vLLM、Flash Attention 2 及 MemHarness 本体。
  • 部署嵌入服务:通过 vllm serve BAAI/bge-m3 --port 8001 启动 BGE-M3 嵌入模型,为 Milvus 记忆库提供向量编码服务。
  • 安装目标环境:根据任务需求分别安装 ALFWorld 或 WebShop 交互环境,并下载对应的游戏文件与预训练检测器。
  • 冷启动 SFT(可选):运行 scripts/build_*_coldstart_data.py 构建冷启动数据,执行 scripts/cold_start_sft.sh 使模型对齐交互格式与记忆摘要格式。
  • GRPO 端到端训练:运行 run_scripts/train_alfworld.shrun_scripts/train_webshop.sh,框架将自动启动记忆向量数据库、执行 Agent 检索、经验回写与剪枝,完成 GRPO 训练。

MemHarness的核心优势

  • 重构优于回放:显式插入批判与重构环节,将静态记忆片段转化为上下文敏感的状态对齐指导,避免负迁移。
  • 小模型超越大模型:7B 参数规模在 ALFWorld 和 WebShop 上分别超越 Gemini-2.5-Pro 23.1% 和 39.7%。
  • OOD 鲁棒性强:在分布外场景中平均成功率达 85.9%,显著高于原始记忆回放的 76.3%。
  • 隐式推理增强:即使测试时关闭记忆,重构训练目标仍使基础策略成功率从 76.4% 提升至 83.0%,从根本上增强 Agent 内在推理能力。
  • 无需额外标注:重构能力通过 GRPO 端到端训练自然涌现,不依赖人工编写的重构监督数据。

MemHarness的项目地址

  • GitHub仓库:https://github.com/KnowledgeXLab/MemHarness
  • HuggingFace模型库:https://huggingface.co/KnowledgeXLab/MemHarness
  • arXiv技术论文:https://arxiv.org/pdf/2607.28272

MemHarness的同类竞品对比

维度 MemHarness EvolveR
记忆范式 显式记忆库 + 状态条件重构 显式记忆库 + 经验演化
核心机制 检索后批判重构,保留/改写/丢弃 检索后直接注入,依赖经验演化迭代
训练方式 GRPO 端到端,无需重构标注 RL 训练,记忆经验需逐步演化积累
OOD 表现 85.9%(ALFWorld OOD) 未重点报告 OOD 鲁棒性
可解释性 重构过程可检查,支持 EMPTY 拒绝 记忆注入过程相对黑盒
模型规模 7B 即超越 Gemini-2.5-Pro 通常需更大规模或更多训练步数

MemHarness的应用场景

  • 具身智能家务:在 ALFWorld 等家庭环境中,Agent 可重构过往取物、清洁经验,适配不同房间布局完成复杂家务任务。
  • 自主在线购物:在 WebShop 等电商平台中,根据历史购物经验重构为当前商品搜索与筛选策略,提升目标导向购物成功率。
  • 智能客服对话:客服 Agent 检索历史相似工单后重构解决方案,避免直接套用旧答复导致答非所问。
  • 代码辅助开发:编程 Agent 重构过往 bug 修复经验,适配当前代码上下文,提供精准的修复建议而非照搬旧方案。
  • 科研实验规划:实验 Agent 根据历史实验参数与结果重构为当前实验条件的最优配置建议,减少试错成本。