Google Research 发布 RRSI 教程:让智能体在冻结模型上自我改进
Google Research 的 RRSI 方法让 LLM 智能体围绕冻结模型改写自身的提示、工具、记忆与控制流,并通过噪声带与成本规则筛选编辑,避免在演化任务上过拟合。
核心事实
据 MarkTechPost 报道,Google Research 公开了一份关于 RRSI(Regularized Recursive Self-Improvement,正则化递归自我改进)的教程。该方法让 LLM 智能体围绕一个冻结的模型改写自身的 harness,包括提示词、工具、记忆、控制流与子智能体,同时避免 harness 在用于演化的任务上过拟合。教程称,完整的 RRSI 循环在 Vertex AI 上用 Claude Opus 起草编辑,并在 Docker 基准中打分;而真正承载论文思路、决定保留哪些编辑的部分是纯 Python,教程直接驱动这一部分。
背景与影响
教程按论文符号与代码函数的对应关系展开,覆盖评分与成本估计、校准噪声带、选择算法的两个分支、退火编辑预算、确定性泄漏筛查以及编辑历史。其中一项细节被特别强调:当候选 harness 在最难任务上崩溃时,若估计器直接丢弃缺失试验,分数会显示为 0.750,看起来像是提升;而 RRSI 把每个缺失试验按零奖励计入完整分母,分数仍为 0.500,从而避免候选通过“毁掉”难题来显得更好。教程还给出校准结果:80 次试验时噪声带约为 0.108,3200 次试验时降至约 0.013,与论文报告的 0.004 至 0.020 区间相符;小于该噪声带的增益无法与重跑同一 harness 区分。
限制与来源
上述内容来自 MarkTechPost 对 Google Research RRSI 教程的报道,相关数值与实现细节均出自该教程及其模拟环境,尚未获官方独立确认。教程说明该包未发布在 PyPI 上,需从 google-research 仓库按指定提交安装,其唯一依赖为 Anthropic 客户端。完整循环所需的 Vertex AI 与 Docker 环境并非免费笔记本可运行。具体功能、依赖与可用性请以官方仓库及官网当前信息为准。