AB
AiBoss站
快讯

谷歌研究提出 RRSI:防止自我改进型 AI 智能体背题

谷歌云 AI 研究与多所高校提出 RRSI 方法,通过收缩编辑预算与严格评审机制,抑制自我改进型 AI 智能体对测试任务的记忆化,在未见过的基准上仍取得提升。

核心事实

据 the-decoder.com 报道,Google Cloud AI Research 与多所大学的研究人员提出了一种名为 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses,智能体外壳的规范化递归自我改进)的方法,用于抑制自我改进型 AI 智能体对测试任务的记忆化倾向。相关论文称,该方法在优化循环的两端同时施加约束:在系统提出新改动时,用预算限制单个候选方案可捆绑的独立编辑数量,且该预算随时间收缩;在决定哪些改动被永久纳入外壳时,由评审机制剔除硬编码任务名称、答案或其他针对特定基准的技巧,并只接受能带来可测量性能提升的额外算力开销。

背景与影响

现代 AI 智能体通常将固定的语言模型包裹在所谓“外壳”(harness)中,由提示、工作流、工具、记忆与逻辑共同决定模型每一步看到什么。论文认为,近期智能体进展多来自外壳的改进而非新模型。较新的方法让语言模型根据测试任务反馈反复重写外壳,研究者称之为一种实用的递归自我改进形式。但论文指出,由于智能体反复面对同一组有限的测试任务,它会逐渐记住这些任务:训练任务分数上升,而在新任务上的收益缩小甚至消失。研究团队在涵盖编程、智能体办公工作与工程设计的八个基准上测试 RRSI,底层模型保持冻结。论文称,RRSI 在训练任务上最多提升 14.1 分,在五个未见过的基准上最多提升 4.7 分,运行时 token 用量比未规范化的版本少约 30%。此外,用 Gemini 3.5 Flash 优化的编程外壳,在未作修改的情况下把较弱的 Gemini 3.1 Flash Lite 的准确率从 11.2 分提升到 14.6 分。

限制与来源

作者指出,该研究仅覆盖围绕冻结模型构建的外壳,未涉及模型权重发生变化的情形。上述分数、token 用量与对比结果均来自论文自述,尚未获独立验证。代码已在 GitHub 发布。相关方法与数据以论文及官方发布信息为准。