核心结论

上海人工智能实验室、上海交通大学、复旦大学等团队于Asia/Shanghai 9月3日公告的预印本SafeEvolve提出,智能体安全不应仅依赖外部Harness或仅优化策略,而应以轨迹经验驱动二者协同进化。作者在Qwen3.5-4B上验证,AgentDojo攻击成功率由2.37%降至0.79%(约3倍),良性可用性由59.79%升至61.86%;AgentHarm有害分数由56.45降至12.27,拒止率由28.98%升至83.83%,且优于SFT、DPO、GRPO等基线的权衡。该结论为作者实验结果,仍为预印本未同行评审,限于受控基准。

方法与数据范围

SafeEvolve将智能体执行抽象为策略- Harness二元组:Harness包含指令、工具、技能、权限与执行控制器等可编辑外部组件。框架建立持续循环:先以冻结策略在当前Harness下滚动收集轨迹证据(安全成败、攻击类型、工具族与执行质量信号),再将证据编译为对单一安全组件(安全提示或分层技能库中的通用原则、任务/工具专有流程与常见错误修复)的有界突变,并经成对验收(需在内部面板上同时满足安全与可用性不回退)与版本化存储形成可审计的进化Harness。

策略侧采用两阶段学习:在进化后Harness提供的运行时技能上下文上进行Harness-use SFT冷启动,仅训练助手回复与工具调用,使策略学会按需调用或忽略技能;随后在相同Harness上下文中开展Harness-augmented RL,以验证器分解的效用分数U(τ)与安全分数S(τ)构成任务类型相关奖励(clean用U,query用S,injection用λ_U·U+λ_S·S+λ_US·U·S),在多步探索中内化自主安全行为。新策略产生的轨迹又成为下一轮Harness演化的证据。

评估条件与主要结果

评估在三类智能体安全基准的受控环境中进行,未涉及开放网络真实部署,工具与环境接口固定,奖励权重跨所有骨干固定。

  • 1)AgentDojo(环境注入与恶意工具使用为主):Qwen3.5-4B基线ASR 2.37%、良性效用59.79%;SafeEvolve降至0.79%并升至61.86%,实现3倍安全提升且不牺牲可用性。 2)AgentHarm(恶意查询与有害执行):有害分数56.45→12.27,拒止率28.98%→83.83%。 3)对比SFT、DPO、GRPO、MetaSecAlign、AgentAlign等基线,SafeEvolve在两类威胁下均呈现更强的安全-效用权衡;消融显示Harness与策略单侧演化均不及协同,且技能库的检索与分层对效果关键。

限制与不确定性

上述提升均为局部基准结果,不能直接推广为普遍或因果结论。预印本未同行评审,数值依赖Qwen3.5-4B与特定验证器划分;在AgentDyn等其他基准上的泛化、跨模型迁移以及真实环境中注入噪声、权限变化与长时依赖的鲁棒性尚未验证。Harness的成对验收阈值δ与门控𝒢、技能召回的Top-K与成本,以及GitHub代码的复现完整性仍需外部检验,实际部署的审计与回滚开销亦待评估。

同行评审状态与潜在意义

该工作为9月3日首次公告的预印本(arXiv:2609.02786,提交时间2 Sep 2026 16:19 UTC,对应Asia/Shanghai 3 Sep 00:19;当日公告批次标题为Thu, 3 Sep 2026,属162篇cs.AI当日批次之一),尚未经期刊或会议同行评审。其意义在于为多步工具调用智能体提供了“外部可控-内部内化”持续对齐的范式,将非结构化安全经验转化为可审计的Harness制品与持久策略行为,有助于在测试时与部署后持续降低环境注入与有害执行风险,但转化为生产级安全仍需独立验证与成本评估。