结论
一篇于2026年7月30日提交的预印本提出ReToken,用一个可学习标记从视觉语言模型已经写入的KV缓存中寻找与问题相关的帧。作者在图像干扰检索和长视频问答基准上报告了明显增益,但这些数字是作者实验结果,不是独立复现或同行评审后的定论。
方法:在值空间做检索
ReToken将可学习标记追加到问题后,训练它与问题和视觉内容交互。推理时,模型先把视频编码为可复用的视觉KV缓存,再用该标记的投影向量与每帧视觉值向量的均值计算余弦相似度,选出前K帧,最后在选中的缓存上生成答案。默认配置只训练这个标记和一个投影矩阵,视觉语言模型本体保持冻结。
论文先比较了传统查询—键注意力分数与值空间信号。在两张图中检索一张图的受控实验里,使用目标短语时,Qwen3VL的Recall@1从查询—键分数的65.7%升至值空间的78.0%;InternVL3.5则从78.8%升至83.8%。论文同时提醒,直接平均完整问题会引入噪声,值空间优势并非对所有检索文本都成立。
评估范围与作者报告的结果
- Visual Haystacks:这是由COCO图像构成的视觉“针入草堆”基准,论文使用单针任务和不同数量的干扰图像。上下文为50张图、只取1张时,冻结Qwen3VL-8B从58.6%升至72.0%,InternVL3.5-8B从57.3%升至69.7%。
- QAEgo4DTest-MC:在长 egocentric 视频多选问答上,检索1帧时ReToken为49.6%,均匀采样为42.8%;检索16帧时分别为60.0%和53.6%。视频以0.5 FPS采样,结果依赖给定检索预算。
- LVBench:论文将其描述为包含103个公开YouTube视频、总计约117小时、平均约68分钟的极长视频基准。Qwen3VL-8B以0.5 FPS、检索100帧时,ReToken为48.6%,均匀采样为40.6%;论文称这是只用多图像问答训练后的零样本迁移。
- 按LVBench问题类型,作者报告信息检索提升15.4个百分点、实体识别提升10.5个百分点;时间定位和事件理解的收益较小,摘要任务从均匀采样的36.2%降至31.0%。这说明方法更适合证据局部且容易命名的问题,不等于长视频理解整体变强。
如何理解证据
论文和官方代码仓库能够核对方法、配置、模型检查点与作者给出的基准数字;Visual Haystacks官方工具包能够核对该图像检索基准的任务定义和数据来源。本次没有发现独立团队对这些结果的公开复现,因此“提升”应限定为作者在指定骨干、数据、采样和检索预算下的报告。
限制与研究状态
该工作当前应标注为预印本,未确认同行评审。作者明确列出的限制包括:训练只使用多图像问答而非视频数据;单帧值均值可能遗漏跨帧关系或分散证据;摘要任务表现下降;两遍推理和早期层检索会增加资源开销。后续若有视频训练、其他骨干或独立复现,才能判断这些结果能否扩展到更广泛的多模态任务。