核心结论
9月6日,OpenAI 在官方博客发布《Research acceleration: The view inside OpenAI》,披露以编码智能体驱动的研究加速全景。官方宣布,已实现去年提出的自动化研究实习生目标——即在人工指导下完成需熟练研究员数日的研究任务,并正向2028年3月的自动化研究员目标推进。编辑核验:该博文在 openai.com/news 新闻页首位展示并标注 Research Sep 6, 2026,于北京时间9月6日23:46(UTC 15:46)检索确认,属于 Asia/Shanghai 当日 00:00–23:59 窗口内的首次官方发布。
关键度量:智能体重塑研究日常
官方称,2026年内研究员日常工作发生显著变化。以下为官方披露的核心度量(均为内部统计,方法仍处早期):
- 年初中位数研究员仅适度使用编码智能体,至8月中旬中位数日均推理用量超600美元(按 API 价格计),90分位超7000美元;研究组织整体智能体工作量达每人力工作日3.1个智能体工作日,已超过人力总时长;同时运行4个以上智能体的高并发流程数量持续增长;活跃实验者人均实验数在2026年8月达2025年1月追踪以来的最高点,官方将其与 Codex 等智能体采用及算力增长相关联。
工作内容与能力边界变化
官方按 Epoch AI 提出的 AI R&D 生命周期分类(Decide/Design/Build/Run/Analyze/Communicate)分析智能体 Token 分布:1月以研究与基础设施代码为主,至8月各类别均增长,技术支持与运行监控类增幅尤为明显,高层规划仍占极小比例。定性反馈与数据均显示,智能体在排障等环节有效缓解瓶颈,内部技术支持频道发帖量下降即为佐证。能力方面,1月至7月各难度分桶的任务成功率普遍提升,但仍需显著人工引导——近6个月逾半成功的4–8小时任务包含至少一次人工介入。
安全加固与算力调度
进展披露亦包含对安全节奏的影响。官方称,继 Hugging Face 事件后已暂停面向部署的最新模型强化学习训练并加固研究环境与监测:7月20日临时关闭训练用容器服务并以更强限制恢复,导致 RL 算力骤降(7月20日至8月6日多数 Astra 相关运行为安全加固测试);8月7日因 Astra 可能触及 Preparedness Framework 中关键网络安全能力阈值,Astra 模型转入更高安全环境,随后一周 Astra 类 GPU 分配再降59.2%,但向其他模型类别的分流增长17.2%,约抵消85%的降幅,总体 RL 工作负载基本持平。官方据此提示,新增管控下算力具可替代性,长期需讨论受控算力的最优用途。
限制与下一步
官方强调,上述指标相对易度量但难解读——最难自动化的环节将成为新瓶颈,算力亦是关键约束;智能体相关度量仍初步,工具与系统快速演进,结论限于内部观测。编辑解释:该博文为进展快照而非同行评审论文,不构成对 RSI 时间表或产品发布的承诺。官方表示将持续完善度量并公开 RSI 进展,在保护安全与专利信息的同时推动行业形成披露与测量共识,并重申当进展带来不可接受安全风险时将放缓或暂停开发与部署。