结论:香港科技大学、中关村学院、西安交通大学、香港中文大学等9家机构团队上海时间9月1日00:48(对应UTC 2026年8月31日16:48)在arXiv首次公开72页预印本《Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence》(arXiv:2608.31075v1),提出以奖励轴与经验轴双维度及L0-L4五级阶梯刻画大推理模型在人类监督逐步退出后持续提升的路径,系统梳理可扩展奖励与自主经验生成的现有方法、假设与失效模式,并构建策略能力、反馈保真度与经验质量三维评估框架。研究仍为预印本,未经同行评审。

方法与评估条件

论文在单轮MDP与多轮POMDP统一形式化下展开,定义状态、动作(含推理轨迹与答案或工具调用)、轨迹与回报,并区分序列惊讶度与预测性token熵等不确定性度量;随后沿奖励轴划分从按实例人类监督(L0)、人类编码的可复用评估器(L1)、超越人类评估的奖励(L2),到超越人类设计的经验(L3)及策略、奖励、任务与环境协同演化的自主循环(L4)。奖励来源被细分为人类接地评估器、模型衍生信号、参考锚定信号与环境接地信号,并讨论PPO与GRPO等策略优化目标与优势估计对奖励来源的分离作用;经验部分则覆盖自生成推理与指令、提议者-求解者自博弈、可执行环境构造及第三方交互等机制。

数据范围

研究为文献综合与框架性分析,范围涵盖以强化学习可验证奖励(RLVR)为基础的数学与代码推理进展,以及向开放域写作、问答与智能体交互等缺乏确定性验证的任务扩展;引述DeepSeek-R1、OpenAI o1等系统在数学与编程上依赖答案比对或程序执行的反馈,并讨论学习型奖励模型与大模型裁判在更广任务上的代理性与脆弱性。工作整理72页正文与配套GitHub追踪仓库,未报告新的受控实验数据集或基准对比结果。

主要结果

  • - 提出L0-L4五级阶梯:明确何种学习环节仍需持续人类供给,强调分类对象是学习过程中的运行责任而非能力或对齐水平,且边界非截然,方法可在奖励与经验维度处于不同层级。 - 奖励分类:可验证任务提供直接扩展路径;人类编码评估器实现跨轨迹复用;模型衍生、参考锚定与环境接地三类超越人类评估的奖励扩大可训练经验范围,但分别面临误判共享错误、规格不完备与评估规则被利用等脆弱性。 - 经验演化:从固定任务分布与固定环境,经自生成轨迹与课程难度自适应,到可执行环境与在线接口的任务提议与信息复用,最终指向与策略协同演化的成熟循环,强调任务可解性、多样性与环境动力学保真度的约束。 - 评估框架:区分策略能力、反馈保真度与经验质量,指出反馈过度依赖校准不足的代理会导致与独立准则脱节的协同适应,并讨论可靠奖励、可持续课程、有效环境、高效学习与安全自主改进的研究方向。

限制与同行评审状态

作者在引言与结论中明确本工作的边界:本文是结构化综述与分析框架,不提供新的大规模训练或独立基准实验结果,相关提升与风险论断为对已有文献的整合与解释,需以独立复现与同行评议检验。截至上海时间9月1日,论文仅以arXiv预印本形式公开,未发表于期刊或会议,未经同行评审;72页篇幅主要为分类、讨论与引用,局部概念与等级划分不应视为已获学界共识或可直接外推为因果、普遍事实。

潜在意义

在推理轨迹显著拉长、交互步数增多的背景下,该框架为理解如何以可复用验证与自主经验持续驱动大推理模型提供了可操作的定位工具,有助于区分何种反馈与经验生成环节可安全自动化,以及何处仍需人类目标、约束与独立审计;其对奖励破解、反馈漂移与课程坍缩等耦合失效的系统提示,也为构建可自我维持且可审计的学习循环提供了设计与评估抓手,但在规模化应用前仍需实证检验与安全性评估。