AB
AiBoss站
project

WikiSkill - 谷歌推出的 Agent 技能进化框架

WikiSkill 是 Google Research 推出的 Agent 技能进化框架。框架通过三层架构,存储原始轨迹的 Raw Layer、持续积累结构化知识的 Wiki Layer、以及存放可执行...

WikiSkill是什么

WikiSkill 是 Google Research 推出的 Agent 技能进化框架。框架通过三层架构,存储原始轨迹的 Raw Layer、持续积累结构化知识的 Wiki Layer、以及存放可执行技能的 Skills Layer,让 Agent 经验沉淀为持久知识,再从中生长出可复用技能。每轮迭代中,Wiki Maintainer 分析轨迹更新知识库,Skill Proposer 基于知识提出技能更新,经验证后接受或回滚。实验表明,9B 模型加 WikiSkill 可超越 27B 裸模型,且技能可跨模型迁移。

WikiSkill的主要功能

  • 三层知识分离:将原始轨迹、结构化知识与可执行技能分三层存储,各司其职。
  • 技能自主进化:通过迭代循环让 Agent 技能从经验中持续生长和优化。
  • 持久知识积累:Wiki 层跨迭代持续沉淀,拒绝的技能不丢失已积累的知识。
  • 跨模型迁移:进化后的技能可在不同模型甚至不同模型家族间复用。
  • 验证门控过滤:候选技能经验证集评估,仅接受能提升性能的更新。

WikiSkill的技术原理

  • 三层架构:Raw Layer 永久存储不可变的执行轨迹,作为事实依据;Wiki Layer 将轨迹编译为结构化模式与进化日志,持续积累且永不回滚;Skills Layer 存放当前生效的可执行技能,支持条件更新与回滚,通过 PURPOSE.md 实现技能溯源。
  • 四步进化循环:Inference Agent 用当前技能在训练集上执行并产出轨迹;Wiki Maintainer 采样轨迹做根因分析,更新 Wiki 的模式目录与日志;Skill Proposer 用 ReAct 方式读取 Wiki 和轨迹,提出单次技能创建或补丁;Gating 机制在验证集上评估候选技能,分数提升则接受,否则回滚技能(Wiki 不受影响)。
  • 知识持久化设计:Wiki 层通过 skill-impact.md 记录每次提案的 diff、验证分数与接受/拒绝结果,形成客观审计轨迹,使后续 Proposer 能避免重复失败方案,实现跨迭代的知识复利。
  • 技能发现与执行分离:实验表明技能发现(从经验中提炼策略)和技能执行(在推理时应用策略)是两种不同能力,WikiSkill 进化的技能可跨模型迁移,甚至其他模型进化的技能优于模型自身进化的技能。

如何使用WikiSkill

  • 初始化工作空间:创建 raw/wiki/skills/ 三层目录,从空技能集开始。
  • 执行训练 rollout:Inference Agent 用当前技能在训练集上运行,产出执行轨迹写入 raw/
  • 更新知识库:Wiki Maintainer 采样成功/失败轨迹做根因分析,在 wiki/patterns/ 创建或更新模式文件,并追加 logs.mdskill-impact.md
  • 提出技能更新:Skill Proposer 读取 Wiki 索引、历史影响记录和原始轨迹,用 ReAct 方式提出单次技能创建或补丁。
  • 验证与门控:候选技能在验证集上评估,分数提升则接受为新的 skills/
  • 循环迭代:重复上述步骤直到验证性能收敛或达到预设迭代次数,最终获得进化后的技能集用于推理。

WikiSkill的核心优势

  • 持久知识复利:Wiki 层跨迭代持续积累,技能被拒绝时知识不丢失,后续更新可复用全部历史洞察。
  • 知识技能解耦:将”知道什么”与”怎么做”分离,技能可回滚而知识永续,避免经验随技能补丁一同丢失。
  • 小模型逆袭大模型:Qwen-3.5-9B 加 WikiSkill 即可超越 Qwen-3.6-27B 裸模型,用知识弥补规模差距。
  • 跨模型迁移复用:进化技能可跨模型家族迁移,其他模型发现的策略有时优于模型自身进化的技能。
  • 避免重复踩坑:skill-impact.md 完整记录提案历史与拒绝原因,Proposer 不再重复已失败的方案。

WikiSkill的项目地址

  • arXiv技术论文:https://arxiv.org/pdf/2608.27454

WikiSkill的同类竞品对比

对比维度 WikiSkill (Google Research) SkillOpt (Microsoft Research)
核心思想 在经验与技能之间增加持久知识层(Wiki),知识持续积累,技能从知识中生长 将技能文档视为可训练的外部状态,用深度学习风格的优化器迭代更新
知识管理 三层架构分离:Raw → Wiki → Skills;Wiki 永不回滚,支持跨迭代知识复利 单技能文档作为训练状态,无独立持久知识层,依赖拒绝编辑缓冲区和元指导
进化机制 Wiki Maintainer 做根因分析并更新结构化知识库,Skill Proposer 从知识中提出更新 六阶段 ReflACT 流水线:Rollout → Reflect → Aggregate → Select → Update → Evaluate
编辑策略 增量补丁编辑(创建/修改技能),每次原子性提案只针对单个技能 结构化 add/delete/replace 编辑,引入编辑预算作为文本学习率
验证门控 验证集严格提升则接受,否则回滚技能(Wiki 不受影响) 验证集严格提升则接受,拒绝编辑存入缓冲区作为负反馈
跨模型迁移 明确验证:技能可跨模型家族迁移,其他模型进化的技能优于自进化 支持跨平台迁移(Codex ↔ Claude Code),无需重新训练

WikiSkill的应用场景

  • 智能办公自动化:处理复杂 Excel 公式计算、数据清洗与跨表格关联,Agent 通过进化掌握”先 recalculate 再读取”等电子表格专用工作流。
  • 长文档智能问答:在数百页 PDF/Word 文档中执行多步检索导航,进化出的搜索技能可指导 Agent 高效定位关键段落,避免长上下文迷失。
  • 数学推理与解题:将竞赛级数学题的解题经验沉淀为可复用策略,持续提升解题准确率。
  • 网络信息检索:优化多轮搜索流程,进化出”关键词扩展 → 多源交叉验证 → 信息整合”的标准操作程序,提升复杂查询的召回与准确性。
  • 交互式具身任务:在虚拟环境中执行多步骤物理操作,通过沉淀”避免重复动作循环””检查任务完成状态”等模式,提升任务成功率。