核心结论
加州大学伯克利分校、MIT-IBM Watson AI Lab等团队于Asia/Shanghai 9月3日公告的预印本Discriminative World Models for Web Agents提出,网页智能体的世界模型不应只重建固定格式的下一状态,而应训练为可区分不同动作后果的判别式表征。作者引入预测状态匹配目标并配合分支数据集,在三项WebArena相关评测中一致优于监督式下一状态预测基线,但该结论仍为预印本作者实验结果,未经同行评审且限于受控环境。
方法与数据范围
传统做法以监督方式让模型生成HTML或AXTree快照,目标与下游排序器所需的可区分性不一致。预测状态匹配改为:给定任务、历史、当前可访问性树与待查动作,模型生成灵活的文本状态表征,判别器在不看指令与历史的前提下,仅凭该表征在真实下一状态与替代状态间做匹配,表征本身必须保留动作相关的差异。
为支撑该目标,团队将WebArena Go-Browse的2839条线性轨迹按重复浏览器状态合并为状态-动作图,每个状态保留多条可执行动作及对应真实结果,形成7730个分支决策点与30920对对比样本,每条替代动作的真实结果既是某个查询的正例,也是另一查询的难负例。训练与评估均基于该分支结构,而非单路径重建。
评估条件与主要结果
评估分三层,均在作者受控环境中进行,未作跨语言或开放网络测试。
- 1)保留分支匹配基准(以Qwen3-32B为判别器):Qwen3-8B判别式模型总体准确率80.80%(Shopping 77.78%、CMS 77.47%、Reddit 79.70%、GitLab 82.50%、Map 84.19%),高于数据对齐的监督全AXTree基线47.77%以及现有WebDreamer-7B 74.51%与WebWorld-8B 70.17%。 2)WebPRMBench动作排序(受控Qwen2.5-7B奖励模型,仅答案监督微调):加入状态匹配表征后平均成对准确率89.36%、Best-of-N 72.70%,较无状态直接排序的82.02%/55.80%显著提升,其中Best-of-N较基线提升16.90个百分点,也高于加入WebWorld状态的85.48%/67.63%。 3)WebArena-Lite端到端(同一评测 harness,Best-of-5选择):ReAct式基线13.94%,Best-of-5提升至21.82%,再加入状态匹配进一步提升至28.48%。
限制与不确定性
上述提升均为局部基准结果,不能直接推广为普遍或因果结论。除预印本未同行评审外,实验限于英语WebArena环境与特定模型骨干,判别器与奖励模型的选择会影响分数;分支数据集尚未公开,代码与数据页面显示Coming soon,外部复现条件不完整;真实网页的动态性、权限与长时依赖未纳入评估。
同行评审状态与潜在意义
该工作为9月3日首次公告的预印本(arXiv:2609.02885,提交时间2 Sep 2026 17:59 UTC,对应Asia/Shanghai 3 Sep 01:59;当日公告批次标题为Thu, 3 Sep 2026),尚未经期刊或会议同行评审。其意义在于为网页智能体提供了一种与排序目标对齐的世界模型训练思路,将训练信号从重建转向判别,有助于在测试时通过采样-预测-排序提升决策质量,但实际部署仍需独立验证与成本评估。