答对了却没看图?EASE给多模态RLVR装上「视线校正器」

机器之心 2026-09-03 10:17

答对了却没看图?EASE给多模态RLVR装上「视线校正器」图1


强化学习与可验证奖励(RLVR)已成为提升视觉语言模型(VLM)推理能力的标配手段。但一个隐蔽的问题始终存在:最终答案的奖励信号,只告诉模型「答对了没有」,却从不告诉它「答案应该从图像的哪个区域得出」。答对,可能是因为真的看懂了图,也可能只是语言先验的捷径、数据集的偏差,甚至是一次幸运的瞎猜。


来自哈工大、中关村学院等机构的研究团队提出 EASE(Evidence-Anchored Spatial Attention),把标注的证据区域转化为视觉 token 上的平滑目标分布,在 RL 训练过程中直接监督「回答 token 看向图像哪里」的空间注意力,且推理阶段无需任何额外标注。在 Qwen2.5-VL-7B、Qwen3-VL-4B、Qwen3-VL-8B 三个基座上,EASE 相比最强 outcome-only 基线 DAPO,平均分分别提升 2.9、3.1、2.5 个百分点。


一句话总结 EASE 的理念:不只教模型「答什么」,更教模型「看哪里」。


答对了却没看图?EASE给多模态RLVR装上「视线校正器」图2



被忽视的盲区:答对 ≠ 看对


在数学推理等纯文本任务中,最终答案的 0/1 奖励已经足够好 —— 因为解题过程全部写在思维链里,信用分配天然清晰。但在多模态场景下,证据获取发生在「看图」这一步,而这恰恰是不可见的。


论文将其形式化为一个感知信用分配问题(perception credit assignment problem):


对于计数、小目标定位、跨区域比较、空间关系这类细粒度、多证据问题,这种歧义尤为致命:模型完全可以在「根本没看对地方」的情况下输出看似合理的文本 —— 这正是幻觉的温床。


为了验证这不是理论空想,作者先做了一个诊断实验:用一个仅经最终答案奖励 GRPO 训练的 Qwen3-VL-4B,在 HallusionBench-Image 上计算每条回答的「回答→视觉注意力分布」与「标注证据目标分布」之间的 KL 散度。结果清晰地表明:


答对了却没看图?EASE给多模态RLVR装上「视线校正器」图3


这构成了 EASE 的立论基石:outcome-only 奖励确实能提升准确率,但它系统性地遗留了注意力与证据之间的错位 —— 而这需要一个过程级的信号来修复。


EASE 方法:

把证据框变成注意力的「导航目标」


EASE 的整体思路可以用三步概括:造目标、找位置、挑时机。


答对了却没看图?EASE给多模态RLVR装上「视线校正器」图4


第一步:

证据标注流水线 —— 从 QA 对到高质量证据框


答对了却没看图?EASE给多模态RLVR装上「视线校正器」图5


训练样本被扩展为 (I, q, a, B),其中 B 是支撑答案的证据框集合,仅作为训练元数据存在,从不进入模型输入。标注分三步走:

1. 抽短语:GPT-4.1-mini 从「图 - 问 - 答」三元组中抽取验证答案所需的最小可见实体集合;

2. 做定位:用 Grounding DINO 类 grounding 模型将短语定位成 bbox;

3. 验质量:引入不同模型家族的 Gemini 2.5 Flash-Lite 做独立验证,剔除空框、错框、模糊框 —— 避免单一模型的抽取偏差自我循环。


最终构建出约 127K 标注数据(覆盖 ZwZ74K、CLEVR、Super-CLEVR、SpaCE10、ViRL39K),并按单证据 / 多证据分成两个池子,训练时 1:1 平衡采样 —— 前者教模型局部 grounding,后者教模型跨区域收集证据。


第二步:

软目标而非硬掩码 —— 高斯混合 + 背景平滑


EASE 不将证据框当成 0/1 硬掩码,而是:


第三步:

奖励门控 —— 只在「好学生」身上教方法


监督的对象是语义中间层(第 ⌊2L/3⌋ 层)上、回答 token 对视觉 token 的条件注意力分布,用「模型→目标」方向的 KL 散度将其拉向证据目标。


reward-aware gating 设计:注意力损失只施加在原始验证器奖励达标的轨迹上。错误回答的注意力模式本身就是不可靠的,把证据框强行对齐到错误轨迹上,等于在学习「误导性的对齐」。因此,EASE 只把成功轨迹当作「可靠的过程示范」来教。


消融实验印证了每一个设计:去掉高斯软目标平均分掉 2.5 分、去掉奖励门控掉 3.4 分、去掉背景平滑掉 2 分。


推理零开销


证据标注是特权训练信息(privileged information),训练完成后,模型走原生 VLM 的「图像 + 问题」通路,输出格式、解码流程完全不变。相比把 grounding 坐标写进输出文本的路线(如 Ground-R1、Point-RFT),EASE 把监督放在模型内部注意力上,更轻、也更易嵌入现有 RL 训练栈。


实验:三个基座、11 个基准、全面提升


答对了却没看图?EASE给多模态RLVR装上「视线校正器」图6



答对了却没看图?EASE给多模态RLVR装上「视线校正器」图7


总结


在视觉语言模型(VLM)的 RLVR(基于可验证奖励的强化学习)中,最终答案奖励只告诉模型「答对了没有」,却不告诉它「答案应该从图的哪个区域得出」。EASE 利用数据集中的证据标注框(evidence bbox),把它转成视觉 token 上的高斯混合目标分布,在 RL 训练时对高奖励轨迹的「回答 token → 图像 token」注意力做 KL 正则,教模型「看对地方」,而推理阶段完全不需要这些标注。


EASE 揭示了一个正在被越来越多工作确认的转向:多模态 RLVR 的奖励设计,正在从「结果验证」走向「过程监督」。在文本推理中,过程监督监督的是思维链;而在多模态推理中,EASE 表明,注意力本身就是可监督、且值得监督的过程信号。


作者介绍


胡瑞娜,哈尔滨工业大学与北京中关村学院的联培博士生,其研究成果发表于 EMNLP、ICML 等国际会议,研究兴趣集中于 AI 安全与对齐以及 AI Agent 在核聚变领域的应用。其哈工大导师为计算机学院省级青年人才王凯教授,中关村学院导师为北京中关村学院 x 中关村人工智能研究院 AI + 能源科学方向负责人、新烛时代联合创始人兼 CTO 汪跃。


答对了却没看图?EASE给多模态RLVR装上「视线校正器」图8


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
VR
more
VR翻车,苹果裁员;成都晶圆厂多枚公章被抢;三星晶圆代工涨价
飞行模拟器革命:VR技术如何重塑eVTOL飞行训练?
中国电信“VR+低空”融合,打造低空经济新基石
快讯|Evri 尝试将机器人狗用于送货;NVIDIA首款人形机器人将于11月亮相;哈佛大学团队发明柔软可穿戴外骨骼机器人
任天堂Switch 2专属VR外设Virtual Boy正式发售,复刻经典并推纸板版
工业质检神器!多视图重建框架MVR性能碾压SOTA,点级精度高达95.7%!
随手拍照片就能VR云旅游!无位姿、稀疏图像条件下实现稳定3D重建和新视角合成|港科广
苹果VR团队再遭缩减,空间计算前路迷雾重重
彻底败给AR眼镜!VR为何彻底落寞了?
“光+”应用论坛 | 紧贴机器人、智能汽车、AR/VR、微显示等众多热门领域新话题,即刻报名听会!
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号