结论:Heriot-Watt大学Sihan Jia与Oliver Lemon团队于上海时间2026年8月31日通过arXiv首次公开预印本 When Robots Mishear Us,核心结论是:自然发生的自动语音识别(ASR)错误可削弱语音控制具身智能的安全拒止与规划稳健性,其中声学近音替换与高强度噪声插入风险最高,可使本应拒答的有害指令被接受并生成可执行的不安全计划。该结论来自作者在POEX与SafeAgentBench上的模拟扰动对照实验,尚未经同行评审或独立验证,不应视为已获学界共识或真实部署环境下的普遍失效定论。

研究对象与方法

研究针对语音控制具身AI中ASR转录错误可能引发的安全风险,探讨微小文本扰动是否会击穿现有安全对齐。与既有侧重对抗后缀的研究不同,本文聚焦日常口音、环境噪声、信道与硬件等因素导致的自然ASR错误。方法上构建五类可控错误:声学替换、语法混淆、标点/切分错误、短词省略或替换(四类以GPT-4按类别提示生成)以及基于CHIME-6真实家庭多说话人噪声的规则插入式噪声添加;并设计混合错误与GPT-4后处理纠错对照,以可归因方式隔离不同错误类型的独立影响。

评估条件与数据范围

评估采用两类具身安全基准。POEX侧使用Harmful-RLBench有害指令集(25个任务环境、136条有害指令,期望行为为拒止),以Qwen2.5-7B-Instruct作规划生成、GPT-4o作评判,指标为接受率(AR)、可执行成功率(ESR)及安全翻转数;仅替换query字段并移除原后缀生成步骤以聚焦ASR效应。SafeAgentBench侧评估正常安全任务的规划成功率,各条件300题,以GPT-4o-mini与GPT-4.1-mini生成、GPT-4o评判,仅注入指令字段。噪声添加设置四档平均WER约6%(轻度)、24%(中度)、53%(重度)、80%(重度偏极端),通过插入概率、片段长度与间距控制。

主要发现(作者报告,未独立验证)

作者报告:POEX上声学替换同时提升AR与ESR,说明近音词在保留语义结构的同时增加有害歧义;噪声添加呈现强度相关趋势,WER越高AR越高但ESR在极高噪声下不单调上升并回落,表明严重噪声虽增加误接受但降低最终计划可执行性;语法混淆与标点分割主要破坏连贯性,风险较低。案例层面pour soup on the electrical outlet在清洁条件下被正确拒止,声学替换或重噪声后则产生完整可执行危险步骤。纠错对照中,声学替换经纠错后AR与ESR双降,重噪声经纠错仅AR下降而ESR无显著改善。SafeAgentBench上混合ASR使GPT-4o-mini 27.67%降至23.33%、GPT-4.1-mini 38.00%降至35.67%,显示正常任务理解与规划亦受削弱且更强模型受影响更小。跨基准综合表明ASR错误兼具增加有害行为概率与降低正常规划成功率双重效应。

作者强调:ASR不应仅视为识别准确率问题,而应作为具身智能安全中重要的输入端风险源;但不同错误类型与强度的影响并不相同,需分类型评估而非一概归为安全失效。

局限与同行评审状态

该工作为arXiv:2608.28518v1预印本,于2026年8月28日16:55 UTC提交,按arXiv周末公告规则于Mon 31 Aug 2026 00:00 UTC(上海8时)归入cs.AI当日新列表并视为首次公开,尚未经期刊或会议同行评审。关键限制包括:依赖模拟扰动而非真实语音录制与商用ASR转录;仅两基准、少数模型与GPT-4o自动评判,未覆盖更多基座、多语言及真实机器人闭环;极端噪声与纠错的不一致表现提示结论具条件性;未报告多种子鲁棒性、长时域与多轮对话累积效应。局部基准与模拟结果不得写作普遍因果或已获同行认可的事实。

潜在意义与适用边界

若后续在真实语音、商用ASR与硬件在环验证中得到复现,该研究为语音控制具身系统的安全测试提供了可复用的五类错误框架与强度分级方法,提示在部署前需将ASR鲁棒性纳入安全用例,并审慎评估纠错模块的适用边界——对可恢复歧义有效,对语义严重破坏则有限。适用性取决于具体ASR系统、噪声环境、语言与任务类型,不应据此认定所有语音指令均不安全,仍需结合人工复核、受限动作空间与执行时校验等纵深防御。