结论
上海人工智能实验室、上海交通大学、复旦大学等团队在 2026-09-03 公开的预印本《SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment》(arXiv:2609.02786)提出 SafeEvolve 框架,核心是将智能体在环境交互中产生的轨迹级安全经验转化为框架与策略的协同进化。论文报告该方法在 AgentDojo、AgentDyn 与 AgentHarm 等智能体安全基准上实现更优的安全-可用性权衡,例如使 Qwen3.5-4B 在 AgentDojo 上的攻击成功率降低约 3 倍同时小幅提升清洁任务可用性,但全部结果仍限于仿真基准且未经同行评审,需独立验证。
研究对象与方法
研究对象为通过外部框架(harness)与环境交互的 LLM 工具智能体,其安全风险既体现在有害最终回复,也体现在多步执行轨迹中的不安全工具调用与被注入指令牵引。现有对齐多沿框架或策略单线进行:前者更新安全提示、技能与运行时护栏但易被弱策略忽略或在长程执行中衰减,后者固化在固定框架下优化策略但难以适应新出现失效模式。SafeEvolve 将二者耦合为持续循环。框架进化侧,将轨迹按成功类别、失败桶、领域与攻击类型等元数据分组,定位到单一可进化构件(主要为安全系统提示与分层技能库中的全局原则、任务/工具特定流程与常见错误修复),生成受限突变并在同一任务集上成对比较父框架与候选框架的任务型回报,仅当综合收益超过阈值且不回退安全、可用性与执行质量时才接受更新,形成带证据与回滚元数据的版本化构件。策略优化侧,采用两阶段范式:先以框架使用 SFT 冷启动,收集在进化后框架上下文中通过验证器的轨迹并仅对助手回复与工具调用计算损失,使策略学会选用相关技能;再以框架增强的 GRPO 在进化框架条件下采样多轨迹组,依清洁、恶意查询与环境注入三类任务的分解奖励(清洁侧重可用性、恶意查询侧重安全性、注入侧重二者兼顾及交互项)计算组内相对优势并优化策略,保留对固定参考策略的 KL 约束。新策略产生的轨迹又为下一轮框架进化提供证据,形成持续协同。
数据与评估范围
数据与训练环境为作者自建的轻量可验证 Python 仿真器,每个任务指定用户请求、环境状态、可用工具与验证器元数据,智能体每轮接收框架渲染的上下文后输出自然语言或结构化工具调用,终止后由验证器给出可用性、安全与工具合法性分数,进而按任务类型合成奖励。任务套件覆盖清洁任务、环境注入任务(用户目标良性但观测中含对抗指令)与恶意查询任务(用户请求本身有害)。评估基准包括 AgentDojo 与 AgentDyn(环境注入)以及 AgentHarm(恶意查询多步合规/拒答),对比基线涵盖 SFT、DPO、GRPO 及 MetaSecAlign、AgentAlign 等。对外报告的模型以 Qwen3.5-4B 为主,辅以不同骨干与消融。该套件均为离线仿真,未涉及真实开放网络。
主要结果
- AgentDojo:Qwen3.5-4B 攻击成功率从 2.37% 降至 0.79%(约 3 倍降低),同时清洁任务可用性从 59.79% 提升至 61.86%,作者称实现更强的权衡。 AgentHarm:有害分数从 56.45 降至 12.27,拒答率从 28.98% 提升至 83.83%,显示对恶意查询的内化安全行为提升。 消融显示框架与策略单线进化均不及协同;技能库进化动态、检索策略及强模型提议器等组件对最终性能有可度量贡献,跨策略框架迁移仍保留部分收益。 以上均为作者在上述仿真基准上的报告,未经独立复现,且未主张在真实互联网或生产环境中的普遍有效性。
论文未将局部基准结果表述为普遍、因果或已获同行认可的事实,相关提升仅在上述数据集、验证器与模型配置下成立。
限制与不确定性
本文与原论文均提示以下限制:第一,工作为 2026-09-03 首发的 arXiv 预印本,尚未经同行评审;第二,全部结果基于作者构建的仿真器与有限基准,未覆盖真实网站的动态内容、权限、反自动化、视觉信息与长程任务;第三,奖励与进化门控依赖规则型验证器与内部回放面板,其设计偏差与数据覆盖度直接影响信号质量;第四,框架进化与检索依赖任务元数据与预设技能结构,对未见攻击、跨域与跨模型泛化、持续进化中的遗忘与稳定性披露有限;第五,推理开销、延迟与在更大规模、不同架构模型上的泛化性尚未充分评估。
同行评审状态与潜在意义
截至 Asia/Shanghai 2026-09-03,该工作为预印本状态,未在期刊或会议完成同行评审。潜在意义在于将智能体安全对齐从单点补丁转向经验驱动的框架-策略协同持续进化,为外部可审计的运行时控制与内部策略内化提供可回滚的衔接机制,并为后续在真实工具环境中的安全演化研究提供了可复用的轨迹分组、验证器分解与协同训练接口。中方读者在参考时需注意其仿真边界,实际部署前应在目标站点、工具链与业务流程上进行独立验证与风险评估。