Google WikiSkill:给智能体的技能进化补上"知识管理层"
谷歌研究院最新推出的Agent技能进化框架WikiSkill,首次针对智能体技能迭代过程中经验流失的痛点,搭建了“原始轨迹-结构化知识-可执行技能”的分层管理架构,让智能体能够在任务执行中持续沉淀知识、自主优化技能,为AI Agent的长期进化提供了全新的底层逻辑。

谷歌WikiSkill重构智能体技能进化底层逻辑
此前的智能体技能进化方案如EvoSkill、Trace2Skill、SkillOpt大多采用“分析执行轨迹-直接修改技能”的单层逻辑,一次迭代用过的原始轨迹往往被丢弃,后续优化缺乏事实依据,也容易重复踩坑。WikiSkill的核心创新是将技能进化过程拆分为三层独立模块,实现经验、知识与技能的分层管理:
- 最底层的RawLayer永久存储每次迭代的不可变执行轨迹,包含智能体的完整推理过程、工具调用、环境反馈和最终输出,为后续分析提供可追溯的事实依据;
- 中间的WikiLayer是整个架构的核心,负责将原始轨迹编译为结构化的持久知识,包含记录成功/失败模式的patterns目录、迭代进化日志logs.md,以及技能影响追踪器skill-impact.md,且该层永不回滚,即使技能更新被拒绝,积累的知识也会保留;
- 最上层的SkillsLayer存放当前生效的可执行技能,每个技能配套SKILL.md(执行内容)和PURPOSE.md(创建背景与对应知识模式),确保技能修改时可追溯设计意图,避免盲目打补丁。
四步迭代循环让技能自主生长
WikiSkill通过固定的四步循环实现技能的持续自主进化,各环节权责清晰:
- 推理智能体使用当前的SkillsLayer中的技能集合,在训练任务上执行rollout生成执行轨迹,存入RawLayer;训练过程中推理智能体被禁止访问WikiLayer,避免其直接查询已有知识导致轨迹失去参考价值;
- Wiki维护者(WikiMaintainer)对采样的成功/失败轨迹做根因分析,将零散经验编译为结构化的模式,更新WikiLayer的patterns目录、logs.md和skill-impact.md;
- 技能提案者(SkillProposer)以ReAct模式自主工作:先读取Wiki索引、技能影响记录和任务结果摘要,再按需查阅具体的模式页面和原始轨迹,最终生成针对单个技能的原子性提案,可能是创建新技能,也可能是对现有技能做增量补丁;
- 门控机制在独立验证集上评估候选技能,只有验证分数严格高于历史最优分数时才会接受提案,否则SkillsLayer回滚到上一版本,但WikiLayer的所有知识积累都会被保留。
此外,skill-impact.md会完整记录每次提案的差异、验证分数和接受/拒绝结果,形成客观的审计轨迹,帮助后续提案者避免重复尝试已经被验证无效的方案,实现跨迭代的知识复利。
实测9B模型搭配技能碾压27B裸模型
谷歌在5个基准、5个不同规模的模型上开展的实验验证了WikiSkill的显著效果:Qwen家族模型搭配WikiSkill后,性能提升随模型规模递增,4B模型平均提升12.3分,9B模型提升17.5分,27B模型提升23.9分,模型能力越强,从技能进化中获得的收益越高。更具代表性的是,Qwen-9B搭配WikiSkill后的平均得分达到47.4%,超过了无技能状态的27B裸模型的39.4%,实现了小模型对大模型的性能反超。
跨模型迁移测试也展现出该框架的独特价值:Qwen-9B使用Qwen-27B进化的技能时,平均得分可达70.2%,远高于使用自身进化技能的63.4%,说明“发现优化策略”和“执行策略”是两种可分离的能力,能够跨模型分工复用。
消融实验进一步证实了Wiki层的核心价值:去掉Wiki访问权限后,智能体的平均性能从63.7%降至48.7%,回落约15个百分点,证明Wiki层积累的跨迭代知识是技能提案者解决复杂失败模式的核心前提。
知识分层架构打开智能体进化新路径
WikiSkill并非单一的算法优化,而是一套系统的架构设计,明确了经验、知识、技能在智能体进化过程中的不同定位:RawLayer负责留存原始事实,WikiLayer负责沉淀可复用的结构化知识,SkillsLayer负责落地可执行的能力,三层各司其职又相互协同。
这一设计打破了此前AI能力提升“靠堆模型规模、靠堆训练数据”的单一路径,让智能体的能力增长可以基于知识的持续深度积累实现。对于AI从业者而言,WikiSkill提供了一个可落地的知识架构设计参考,未来可在此基础上优化自动知识剪枝、长时域任务适配等能力,进一步支撑智能体在复杂环境中的自主进化。