结论

ServiceNow团队于北京时间2026年8月11日01:59:51在arXiv首次提交v1稿件。作者的核心结论是:把TTS“自然度”拆成10个语言学维度后,常见MOS预测器和音频大模型评审都暴露出系统性盲区,没有任何一类工具在论文测试条件下稳定覆盖全部维度。这是一篇标注为“Work in progress”的预印本,而不是已获同行认可的定论。

研究对象与方法

研究先把感知语音质量划分为音素准确性、词汇重音、语调、韵律重音、韵律边界、语速适切性、情感适切性、表现力、说话人身份一致性和人类可发声性10个维度。团队从Harvard Sentences、EmergentTTS-Eval及合成文本出发,通过文本或IPA修改、TTS生成和声学操控构造样本;3名受训语言学评审者进行标注,经多数票过滤与类别平衡后形成860条语音的最终数据。

评估覆盖UTMOSv2、DNSMOS-Pro、NISQA、Audiobox-Aesthetics四类MOS预测器,以及Gemini 3 Flash、Gemini 3.5 Flash、Qwen3-Omni-30B-A3B-Instruct和Step-Audio-2-mini四个音频大模型。音频大模型在四类提示条件下测试,并比较有无参考文本;维度级对齐主要用Kendall’s τ衡量,MOS预测器另报告AUROC。

主要结果

  • 1. 论文表格显示,MOS预测器更容易响应明显的声学层面变化,但没有任何一个MOS模型在音素准确性、词汇重音和韵律边界上达到显著检测。 2. 使用笼统“自然度”提示时,音频大模型的显著相关维度稀疏且不一致;即使给出维度模式,也没有模型全面覆盖10个维度。 3. 要求模型一次为所有维度分别打分时,4个音频大模型中有2个在几乎所有单元输出相同最高分,导致相关系数无法定义。 4. 参考文本的作用没有形成跨模型、跨维度的一致方向,说明提示优化只能修复部分问题,不能等同于稳定的细粒度评估能力。

限制与证据状态

样本均为英语合成语音或人为操控语音,部分故障是为了便于检测而设置的上界案例。各维度平衡后仅有46至128条样本,采用二元标签;IPA路径还依赖单一TTS架构。论文同时披露,在741个设计为含目标错误的样本中,239个未被评审者感知为相应错误,另有7个没有形成多数票,说明错误构造与人工感知之间并非一一对应。

本次可核验材料来自作者当天公开的arXiv v1摘要、提交记录和同一稿件全文。没有当日独立资料对实验进行复现,论文也未经过同行评审。因此,文中的“首个维度级基准”及性能结论均应视为作者主张,不能写成行业普遍事实。

潜在意义

编辑解读:这项工作提示,若团队把单一MOS分数或笼统的音频大模型打分当作TTS上线门槛,可能漏掉发音、重音和韵律结构错误。更稳妥的做法是按具体维度设置测试,并在真实语音、更多语言和不同TTS架构上保留人工核验;但是否能改善实际产品质量,仍需独立、真实场景研究确认。