结论:ServiceNow与特文特大学团队于上海时间2026年8月31日(对应28 Aug 17:22 UTC提交、按14:00 UTC截点公告于31 Aug 00:00 UTC即上海8时)在arXiv公开预印本DARTS,系统分析并缓解了解码器模型合并的表征偏差。作者在Llama-2-7B三任务合并的受控对比中报告,偏差随位置累积且高熵位置更关键,DARTS以熵加权L1与逐位置偏置在三基准上一致优于原位置无关手术且仅增约0.1%参数;该结论仅来自作者实验,尚未经同行评审或独立验证,不能视为普遍、可迁移的合并增益。
研究对象与方法
研究针对解码器大模型的权重空间模型合并后性能普遍低于各单任务微调的现象,聚焦“表征偏差”:合并模型末层隐藏状态与各目标微调模型对应状态的归一化L1距离。作者指出编码器ViT的偏差近似位置均匀,而自回归解码器因因果掩码使早期误差通过注意力前向传播、逐位置累积。DARTS在原低秩瓶颈内容校正 c(h)=Wup·ReLU(Wdown·h) 外,引入两项解码器感知改进:一是熵加权L1(EWL1),以目标模型在该位置的预测熵除以均值熵作权重,聚焦校正于决策关键的高熵位置;二是逐位置加性偏置表 b∈R^{512×4096},零初始化、每位置独立学习,捕获跨输入一致的系统性偏移,与输入相关的内容校正解耦,兼顾结构正则与小样本稳健性。
数据范围与评估条件
评估以共享基座Llama-2-7B(隐藏4096、词表32k)合并三公开微调:Llama-2-7B-Instruct、WizardMath-7B-v1.0与Llama-2-7B-Code。合并方法覆盖四族124配置:Task Arithmetic(λ五档)、Weight Averaging(22种权重分布)、TIES-Merging(42种权重与密度组合)、DARE(60种变体与密度),均用mergekit生成并择每族聚合分最优作基线。基准为代码HumanEval 164题(Pass@1)、数学GSM8K测试集1,319题(零样本思维链准确率)、指令AlpacaEval 805条(对GPT-3.5胜率由GPT-4.1判定),另报告校准集上的L1降低率ρ。校准与训练在512最大长度、秩16下进行,手术模块零初始化起自恒等映射,参数量约2.2M/域、三域总量约6.6M。
主要发现(作者报告,未独立验证)
作者报告:校准可视化显示各域的逐token L1偏差均呈单调递增,后段可达前段2–3倍,验证因果累积假设;同量扰动在高熵位置更易翻转argmax并级联后续生成。DARTS的熵加权与位置偏置在三基准与四族合并基线上均显著优于原手术,且优势在Task Arithmetic与TIES等强基线上仍保持;L1降低与任务分提升呈正相关,但位置校正采用直接偏置表优于网络化变体,且未增加推理分支或显存占用,产出标准单检查点即插即用。消融表明两组件互补,去任一均回退,均匀L1与位置无关手术的妥协在长序列上尤显不足。
局限与同行评审状态
该工作为arXiv:2608.28547v1预印本,已接收EMNLP 2026主会但尚未经期刊正式同行评审与独立复现。关键限制包括:仅单一基座Llama-2-7B与三领域离线基准,未覆盖其他模型族、多语言、长上下文或真实用户分布;校准集小、序列截断512,超参、种子与数据量敏感性仅附录有限检验;位置表固定512未验证外推;熵估计依赖目标模型分布,分布外或噪声校准可能失效;未评估在线人评、安全对齐、服务时延细分与多版本维护成本,结果不应直接外推为线上合并收益。
潜在意义
若后续获同行评审与多基座复现支持,DARTS为低开销、永久性合并提供了一个解码器感知的轻量校正范式:以可解释的偏差结构与重要性加权解释并缓解自回归累积误差,与需要多分支或路由的推理时方法互补。但在落地前,仍需在更多规模、架构、长序列与在线评估中验证其稳健性与可维护性。