结论
这项预印本给出一种把多模态模型自身的视觉盲点转成密集训练信号的方法。作者在Qwen3-VL-4B和8B设置下报告,CVPD在12项视觉感知与推理基准上均优于所列基线,并未出现相对基础模型的单项回退;但这仍是有限模型和标准基准上的作者实验,不能据此认定方法已在真实任务中普遍有效。
当日状态与研究对象
arXiv API记录显示,论文v1发布于2026年8月10日17:59:56 UTC,即北京时间2026年8月11日01:59:56,属于本次当日窗口。作者署名机构为Mohamed bin Zayed University of Artificial Intelligence与Aalto University。论文当前状态为预印本,未提供已获同行评审接收的信息。
方法如何工作
CVPD先让同一模型分别观察完整图像、放大后的候选区域,以及把该区域高斯模糊后的完整图像。候选区域必须同时满足三项条件:裁剪视图与完整图像的答案分布有足够差异;模糊该区域后模型的默认响应基本不变;裁剪视图让首个答案词元的不确定性下降。作者将这解释为模型具备相关局部感知能力、却没有在完整图像中稳定利用该信息。
通过筛选的裁剪视图充当正教师,区域模糊视图充当负教师,完整图像上的在线模型作为学生。训练目标同时包含向正教师靠近的逐词元分布蒸馏、远离负教师的对比排序,以及约束模型不要偏离原策略的KL锚点。所有教师与学生来自同一基础模型,不依赖外部标注器、分割系统、奖励模型或更强模型。
数据范围与评估条件
盲点发现处理15,000张无标签图像,其中10,000张为自然场景,另5,000张按40:60混合图表、科学图示、结构化文档图与自然场景;最终约2,590张形成训练元组。实验使用Qwen3-VL-4B-Instruct和Qwen3-VL-8B-Instruct,视觉编码器冻结,语言骨干以LoRA训练一个周期;评估覆盖OCRBench、InfoVQA、ScienceQA、RealWorldQA、AI2D及MMStar子项等12个基准。
主要结果
在8B模型上,作者报告OCRBench从82.80升至86.40,MMStar细粒度感知从60.25升至63.63,MMStar逻辑推理从61.69升至64.77;其余基准也维持或提高。与六种自演化基线的比较包含使用GPT-4o构造数据的方法,但这不构成独立验证,因为模型训练、基线复现和评测均由论文作者在同一研究中完成。
消融结果显示,随机区域训练和移除负教师对比目标都会明显降低重点基准成绩。这支持了三门盲点筛选与正负教师配对在当前配置中的贡献,但不能排除数据构造、超参数或基准适配等其他因素。
限制与潜在意义
结果尚未同行评审,也没有独立复现。训练数据规模、基础模型、硬件和基准均有限,基准分数不能直接代表开放环境中的可靠感知。若后续在不同模型、真实文档与复杂场景中复现,该方法可能提供一种减少外部教师依赖的视觉后训练路线;现阶段更适合作为待验证的方法提案,而非成熟部署结论。