核心结论
华为技术有限公司联合上海交通大学、西北大学、哈尔滨工业大学(深圳)等团队于上海时间2026年8月28日首次公开预印本《What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents》,提出 Accuracy-Complexity-divErsity(ACE)视角,将智能体数据生成形式化为约束分布设计:Accuracy 决定可验证的支撑集,Complexity 按学习者能力与执行配置塑形分布,Diversity 确保非冗余覆盖。作者认为,领域已从可信度判断转向执行验证,从静态难度转向学习者相关复杂度,从表层多样性转向行为多样性。结论来自44页文献综述与框架分析,尚未经同行评审。
研究对象与方法
研究对象为 LLM 智能体在工具调用、软件工程、网页与GUI、具身、社交与科学等域的交互数据生成管线。方法上,作者定义通用对象 d=(E,q,τ,v),分别对应环境规格、任务信号、交互实现与可选验证器,以统一比较不同域的表征与验证方式。在此之上提出机制导向的分类:正向生成按 E→q→τ 依赖构造环境、任务与轨迹;反向生成则改变锚点,包括任务优先、轨迹优先与结构优先(图、规划、蓝图),并涵盖自适应与自演化系统。随后以 ACE 为评估与分配原则,分章综述 Accuracy、Complexity、Diversity 的保障机制、度量与取舍。
数据范围与评估条件
论文覆盖近年生管线典型工作,汇总正向与反向范式的代表方法与资源链接,涉及 ToolLLM、APIGen、ToolACE、EnvScaler、OS-Genesis 等数十项工作与执行环境。分析基于对公开文献中验证、难度构造与覆盖扩展机制的归纳,并以图表示范跨域实例与分布设计目标。评估条件为文献层面的定性归纳与框架对照,未设立新的受控实验或统一基准对比;复杂度与多样性的讨论亦强调模型相关与配置相关,提示需声明学习者与执行配置前提。PDF 末页标注日期为 August 28, 2026,与 arXiv 8月28日公示一致,归属为当日首次公开。
主要发现
- ACE 不对称性:无效数据无法由难度或多样性弥补,Accuracy 为前提,Complexity 与 Diversity 在可行支撑内决定学习价值。;正向生成接地性强但受环境窄化制约,反向生成对任务可控性更强但需更强一致性校验,结构优先可提升长程一致性。;Accuracy 保障正从规则/模型判断转向可执行与状态验证、约束接地构造与反馈修复;Complexity 构造涵盖结构组合、信息控制与失败驱动校准;Diversity 扩展从源扩展、组合重组、探索发现到覆盖引导的系统机制。;作者观察到数据正从固定后训练向预训练/中期训练与闭环自演化扩展,强调持续分配有效、信息性与非冗余经验,而非单纯增大轨迹数量。
局限与不确定性
作者在讨论中明确 ACE 非完整治理清单,成本、效率与安全等约束仍需单独考虑。本文为综述框架,局限包括:未开展新方法的大规模受控验证,关键判断依赖对已有工作的解读,可能受文献选择偏差影响;分类边界并非严格互斥,实际管线常混合多范式;Complexity 与 Diversity 的定量度量仍缺乏统一口径,文中以机制描述与域证据为主,难以直接转化为可复现的阈值或配比;外部独立复现与同行评审尚未完成,结论应视为作者归纳而非已获验证的普遍事实。
同行评审状态与潜在意义
截至公开时为 arXiv 预印本 v1(arXiv:2608.27260),标注 Submitted on 27 Aug 2026(对应上海时间8月28日)且 PDF 署名 August 28, 2026,尚未经期刊或会议同行评审。其意义在于为分散的智能体数据工作提供跨域可比的术语与设计目标,区分数据如何构造与应如何评估/筛选,并为后续在执行验证、学习者相关难度与行为覆盖等方面的量化研究提供路线图。对工程实践的提示是:在扩大环境与任务多样性的同时,优先建立可执行校验与失败反馈闭环,并按声明学习者校准难度分布。
原文强调:中心挑战不是单纯生成更多数据,而是在智能体与环境共同演化过程中,持续分配有效、信息性且非冗余的经验。