结论
加州大学伯克利分校等团队在 2026-09-03 公开的预印本《Discriminative World Models for Web Agents》中提出预测状态匹配(predicted-state matching)训练目标,目标是让网页世界模型生成能区分同一状态下不同候选动作后果的文本表示,而非复刻固定的 HTML 或 AXTree。论文报告该方法在 held-out 匹配基准上达到 80.80% 总体准确率,并在 WebPRMBench 动作排序与 WebArena-Lite 端到端任务上较监督式次状态预测基线取得显著提升,但结论仍限于仿真环境且未经同行评审。
研究对象与方法
研究对象为基于大语言模型的网页智能体在测试时动作选择中的世界模型。传统方法通过监督式下一状态预测训练模型生成固定格式(如文本摘要、HTML、AXTree 快照),论文认为该目标与下游排序器所需的可区分性不一致。为此作者引入预测状态匹配:给定当前任务指令、历史、当前可访问性树及候选动作,模型生成灵活的文本预测表示;随后由固定评判器(训练时为 Qwen3-32B)在仅见该表示与两个候选下一状态(真实结果与同一决策点替代动作结果)的条件下判断匹配,评判器无法看到指令、历史、当前状态或动作本身。若表示能使评判器选中真实结果则获得匹配奖励,并辅以格式奖励(λ=0.4)约束 <predicted_state> 标签。该目标不强制复刻固定目标字符串,属表示无关的判别式训练。
数据与评估范围
数据基于 WebArena 环境中 Go-Browse 轨迹构建。作者将跨轨迹重复出现的浏览器状态合并为状态-动作图,将同一状态的多条可执行动作及其观测到的下一状态聚合为分支决策点,共得到 7,730 个分支点、30,920 个成对样本,按域分层划分为训练与 held-out 集,覆盖 Shopping、CMS、Reddit、GitLab、Map 五域。下游评估在 WebPRMBench(Mind2Web、WebArena、AssistantBench、WorkArena)上进行动作排序,以及在 WebArena-Lite 上进行端到端执行,奖励模型骨干包括 Qwen2.5-7B 与冻结模型等多 setting。评估指标为双选匹配准确率、成对准确率、Best-of-N 准确率及任务成功率。
主要结果
- held-out 预测状态匹配:作者的 Qwen3-8B 模型总体准确率 80.80%,高于 WebDreamer-7B 74.51%、WebWorld-8B 70.17% 及同数据全量 AXTree 监督基线 47.77%;在 GPT-4o、Llama-3.1-70B 等不同评判器下仍保持领先。 WebPRMBench 训练式奖励模型:接入预测状态表示后,Qwen2.5-7B 平均成对准确率 89.36%、Best-of-N 72.70%,较无状态直接排序(82.02%/55.80%)提升 16.90 个 Best-of-N 点,也优于接入 WebWorld-8B 状态的 85.48%/67.63%。 WebArena-Lite 端到端:ReAct 基线 13.94%、Best-of-5 21.82%、Best-of-5+状态匹配 28.48%,论文报告加入该世界模型使成功率在同一评估框架下翻倍以上。
以上结果均为作者在受控基准上的报告,未经独立复现。论文未主张在真实互联网或生产环境中的普遍有效性,相关提升仅在上述数据集与评判器配置下成立。
限制与不确定性
论文及本文均提示以下限制:第一,工作以预印本形式发布,尚未经同行评审;第二,全部训练与评估限于 WebArena 仿真及由 Go-Browse 衍生的分支数据,未覆盖真实网站的动态内容、权限、反自动化与视觉信息;第三,分支构建依赖可访问性树合并,忽略部分页面状态与视觉细节;第四,奖励信号依赖固定评判器,评判器本身的偏差与能力会影响训练信号与评估稳定性;第五,端到端结果仅在 WebArena-Lite 小规模任务上验证,未评估长程任务、跨域泛化、计算开销与稳定性。
同行评审状态与意义
截至 2026-09-03,该工作为 arXiv 预印本(arXiv:2609.02885),尚未在期刊或会议完成同行评审。潜在意义在于将世界模型优化目标从重建转向判别,提示在测试时规划中应优先保留动作相关差异而非完整页面重构;同时提供的分支数据与表示无关的匹配基准为后续网页智能体世界模型提供了可复用的评估接口。中方读者在参考时需注意其仿真边界,真实部署前仍需在目标站点与业务流程上进行独立验证。