核心结论:浙江大学与阿里巴巴集团联合团队于上海时间 8 月 28 日在 arXiv 公开预印本 TTPO: Test-Time Policy Optimization,提出一种无需真实标签的测试时训练框架。通过将多数投票伪标签的不对称可靠性分离——对与伪标签一致的轨迹做答案条件在线自蒸馏,对不一致轨迹做分组强化学习惩罚并配合 token 级选择——TTPO 在无标签条件下追平有标签 OPSD,并在纯测试时训练中将 Qwen3-1.7B 从 38.0% 提升至 45.2%,非思考模式下提升达 +25.2 至 +36.4 个百分点。研究仍为预印本,结论基于作者在 Qwen3 与竞赛数学基准上的受控实验,未获同行评审或独立验证。

研究背景与方法

现有强化学习与可验证奖励(RLVR)及在线自蒸馏(OPSD)均依赖真实答案:奖励需验证、教师需以答案为特权上下文,因而无法直接用于测试时训练。TTPO 观察到伪标签错误的不对称性——即使多数投票错误,约 79% 不一致采样本身亦错误,因此惩罚不一致性通常正确,而蒸馏需谨慎使用。方法流程为:每题采样 K=64 条轨迹并提取答案,聚类后取最大簇为伪标签,分成一致集 P 与不一致集 N;对 P 施以前向 KL 蒸馏,教师为同一模型以伪标签为提示的答案条件分布,学生为原始提示分布,并以学生熵与师生差异的 Soft-OR 权重聚焦未掌握位置;对 N 施以 GRPO,以是否命中伪标签的二值奖励计算组内优势,并以负对数概率与确定性的组合分数掩码 50% token,仅惩罚高置信错误,避免误伤局部正确推理。两分支以权重 λ=0.1 联合优化。

评估条件与数据范围

评估模型为 Qwen3-1.7B/4B/8B,均以 LoRA(r=64, α=128)微调全部线性层;训练设置分两种:OpenThoughts 有标签数据上的无标签训练(对比有标签 OPSD/GRPO)与直接在测试题上的纯测试时训练(对比 TTRL、OPSD-TTT)。评测基准为 AIME 2025、AIME 2026、HMMT 2025、HMMT 2026、BRUMO 2025 五项竞赛级数学任务,采用 Avg@12、温度 1.0、思考模式开启(非思考评估见附录),OPSD/TTPO 训练 100 步取最优,GRPO/TTRL 训练 500 步。所有结果为作者在 vLLM 0.11.0、PyTorch 2.8 环境下的单次实验报告。

主要结果

在 OpenThoughts 无标签训练中,TTPO 平均分 40.1/58.6/62.6 超过有标签 OPSD 的 39.7/58.4/61.7,且 Qwen3-4B 的 TTPO 已持平 8B 基模。在纯测试时训练中,1.7B/4B/8B 分别达 45.2/61.1/65.3,显著超过 TTRL 与 OPSD-TTT,且 4B TTPO 超过 8B 基模。关闭思考模式后,TTPO 的提升分别为 +25.2、+30.6、+36.4 个百分点,而有标签 OPSD 仅 +7.1/+5.8/+3.5,显示密集蒸馏有效将长思考行为内化。跨基准实验显示,任一基准上的训练均提升其余基准,训练动力学亦表明多数投票路由保持双分支活跃与更高熵,避免早期坍缩。

限制与同行评审状态

该工作为 2026 年 8 月 28 日(上海时间)首次公开的预印本,提交记录为 Thu 27 Aug 2026 17:58 UTC,已标注预印本 DOI 10.48550/arXiv.2608.27448,尚未经期刊或会议同行评审。作者明确标注部分对比基线使用真实标签(表中 †),TTPO 本身无标签。局限包括:仅验证 Qwen3 家族与英文竞赛数学,未测试其他架构或领域;每题 64 轨迹与 16k 上下文带来显著推理成本;伪标签在低通过率题目上可能不稳定;token 级阈值与 λ 等超参数敏感性仅在附录部分消融,复现需严格遵循环境与脚本。项目页与代码仓库已同步公开,但外部独立复现报告尚未出现。

潜在意义

TTPO 为无标签场景提供了一种鲁棒的密集与稀疏信号组合范式:在伪标签噪声普遍存在时,不再将多数投票视为可信标签,而是视为路由信号,按可靠性分配不同监督强度,并证明多数投票质量随模型提升而自增强,形成自进化循环。对中国用户的潜在意义在于,为资源有限条件下通过测试时自训练提升小模型推理能力提供了可复用思路,尤其是将思考能力蒸馏至非思考高效推理的路径,但实际部署仍需权衡采样开销、答案可验证性与领域迁移风险,不宜直接视为通用无监督提升方案。