结论:Google Research与Virginia Tech团队于上海时间2026年8月28日(对应27日17:59 UTC)在arXiv公开WikiSkill预印本,提出以持久知识库分层协同演化智能体技能。在作者覆盖5项基准与5个模型的受控实验中,WikiSkill较无技能基线与三类同期技能演化方法稳定领先,且增益随模型规模扩大,部分跨模型迁移技能甚至优于自演化;但该结论仅来自作者实验、尚未经同行评审或独立验证,局限于有限基准与模型。
研究对象与方法
研究针对现有技能演化方法将经验分散保存于优化历史、缺乏独立持久知识表征的不足,提出WikiSkill三层架构:Raw层保存不可变的训练滚动轨迹,Wiki层以模式目录、演化日志和技能影响追踪器持续归纳成功策略与失败根因,Skill层存放可执行的SKILL.md与溯源的PURPOSE.md。每轮演化由推理智能体基于当前技能滚动、Wiki Maintainer增量更新Wiki、Skill Proposer以ReAct方式按需查Wiki与轨迹提出单技能原子补丁、再经验证集门控决定接受或回滚;Wiki始终保留不回滚,以累积长期知识。
数据范围与评估条件
评估覆盖LiveMathematicianBench(数学推理)、SealQA(网页检索)、SpreadSheetBench(表格操作)、OfficeQA(长上下文问答)、ALFWorld(具身交互)5项基准;模型包含Qwen-3.5-4B/9B-Instruct、Qwen-3.6-27B、Gemma-4-31B-It与Gemini-3.5-Flash。数据集按训练/验证/测试划分,演化从空技能集启动,候选补丁在验证集上评估,仅当验证分数超越当前最优时接受,否则回滚;每种方法独立演化3次取测试平均,显著性以1,000次配对自助法p<0.05判定。对照基线含无技能及Trace2Skill、EvoSkill、SkillOpt。
主要发现(作者报告,未独立验证)
作者报告:WikiSkill在各模型平均分上取得领先,Qwen-3.5-4B/9B/27B平均分分别从26.2/29.9/39.4提升至38.5/47.4/63.3,增益随规模扩大;Gemini-3.5-Flash从49.5提升至68.1;Gemma-4-31B从41.3至54.9。小模型配技能可超越大模型无技能,如Qwen-3.5-9B配WikiSkill 47.4%超过Qwen-3.6-27B无技能39.4%。跨模型迁移中,Qwen-3.5-9B使用Qwen-3.6-27B演化技能在ALFWorld达70.2%高于自演化63.4%,提示技能发现与执行能力可分离。消融表明移除Wiki积累增益消失,而训练时向推理体开放Wiki反而劣化。
局限与同行评审状态
该工作标注为arXiv预印本(arXiv:2608.27454v1),尚未经期刊或会议正式同行评审,无独立复现。核心限制包括:仅5基准×5模型的小范围受控评估,未覆盖真实企业规模、多语言或持续部署;验证集小且Gemini在ALFWorld验证满分提前终止,可能高估;结果为作者特定提示、工具与vLLM部署下的平均表现,换模型、检索或成本约束下未必复现;Wiki与技能均由大模型生成,存在偏见、过拟合与幻觉累积风险。
潜在意义
若后续获同行评审与外部复现支持,该框架提示将经验固化为可累积的Wiki知识再驱动技能演化,可在不增参的情况下弥补模型规模差距并实现跨模型复用,对低成本部署与领域适配具参考价值;但在落地前仍需在更广基准、真实工作流与长期运维成本、安全审计下的前瞻验证。