结论:南方科技大学、新加坡国立大学、哈工大(威海)、华为诺亚方舟实验室与香港城市大学团队于上海时间2026年8月28日(对应27日16:48 UTC)在arXiv公开预印本arXiv:2608.27351,系统对比进化策略(ES)与组相对策略优化(GRPO)在大语言模型推理后训练中的行为差异。作者报告ES在提升单次采样准确率Pass@1的同时保持更高的重复采样覆盖度Pass@16/32,且未出现GRPO常见的熵坍缩;尽管ES导致全模型参数漂移显著,功能增益集中于稀疏的大幅值更新。该结论仅来自作者在有限模型与任务上的对照实验,尚未经同行评审或独立复现,不应视为普遍事实。
研究对象与方法
研究针对ES作为无反向传播、仅通过参数扰动与前向评估估计更新方向的后训练范式,是否与主流的GRPO具有不同探索特性、是否必然导致灾难性遗忘以及何种超参更有效三个问题展开。作者建立理论框架:ES扰动诱导的策略多样性以Fisher信息迹量化,证明种群多样性可提升至少一个成员成功的概率,且奖励加权的混合策略在权重与成功率正相关时优于均匀平均;并给出ES中心模型Pass@K超越初始模型的充分条件。方法上,ES采用标准单点估计与z-score奖励标准化,GRPO采用组内相对优势与裁剪目标,对比训练动力学、测试Pass@K与持留任务表现,并引入顺序组合训练ES→GRPO与GRPO→ES。
数据范围与评估条件
评估分两类设置。Easy设置在Qwen2.5-1.5B-Instruct、Llama-3.2-3B-Instruct、Qwen2.5-7B-Instruct上经GSM8K训练2轮,测试于GSM8K、CSQA、HotpotQA、Countdown、GPQA、MBPP;Hard设置在DeepSeek-R1-Distill-Qwen-1.5B上经DeepScaleR训练1轮,测试于AIME24/25、AMC23、MATH-500。持留任务用于检验遗忘。超参对照组固定扰动尺度与种群N,对比不同N在Qwen2.5-0.5/1.5/3B上的扩展行为。所有结果为作者在受控环境下的平均表现,评估指标为Pass@1/16/32与Maj@16/32。
主要发现(作者报告,需区分于独立验证)
- 1. ES在两类设置中平均同时提升Pass@1、Pass@16与Pass@32,而GRPO在Easy设置15/18个对比中Pass@16/32低于基线;GPQA上GRPO熵与Pass@K同步下降,ES则保持稳定并超越基线。 2. 顺序组合在Pass@1-Pass@K平面上形成新的帕累托前沿:ES→GRPO在Hard数学平均上取得最高Pass@32并保留大部分GRPO的Pass@1增益,提示二者覆盖度与精度互补。 3. ES相对L2漂移为GRPO的40-44倍,但阈值实验显示保留阈值以上少数学大幅值更新即可维持目标性能,Llama与DeepSeek模型中LayerNorm与注意力投影承载最大更新,区别于GRPO集中于词嵌入与LM头的分布。 4. 持留任务上ES平均Pass@32优于GRPO与基线,未重现此前小样本报告的灾难性遗忘;超参上z-score标准化带来稳定增益,两点估计在推理再生轨迹上无方差缩减优势,且大模型可用更小种群达到接近N=64的奖励。
局限与验证边界
该工作为预印本,未经期刊或会议同行评审,亦无独立复现。局限包括:仅覆盖上述模型与任务组合,结论外推至其他推理或非推理任务需谨慎;验证集规模小、切分固定,门控与早停可能引入噪声;理论结果依赖小扰动、有限熵与平滑支撑等条件,且以验证器正确性为前提;参数漂移与功能稀疏的解释属事后阈值分析,未证明因果;未评估长时间、多任务连续后训练下的遗忘累积与真实部署成本。
是否同行评审及潜在意义
截至上海时间2026年8月28日,该论文以arXiv预印本形式公开,尚未标注正式同行评审录用。若后续获同行评审与外部复现支持,其意义在于将ES定位为与GRPO行为不同的推理后训练范式而非仅是内存高效替代:通过保持更广推理覆盖与稀疏功能更新,可能在不牺牲多样性的前提下挖掘预训练模型的潜在推理能力,并为资源受限或需高Pass@K的场景提供并行化更高的训练选择;但落地前仍需在更广模型规模、奖励设计与安全持留评估中进一步验证。