多模态检索头首次被锁定:揭开大模型长文档内部检索真相 | EMNLP'26

量子位 2026-09-08 12:38
MMRetHeads团队 投稿 
量子位 | 公众号 QbitAI

随着Office AI和文档智能体的发展,大模型开始直接处理财报、合同、研究报告等长篇图文材料。

但能够接收一整份文档,不等于能够正确使用其中的信息。

面对上百页文字、图片、表格和图表,模型首先要回答的是:与当前问题真正相关的证据,究竟在哪里?

EMNLP 2026接收的论文新作“Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models”,从模型内部研究了这一过程。

多模态检索头首次被锁定:揭开大模型长文档内部检索真相 | EMNLP'26图1

从“装得下”到“找得到”

长上下文视觉语言模型可以同时接收大量文字和图片,但最终答案通常只依赖其中很小的一部分信息。相关证据可能是一段文字,也可能藏在表格、图片或某个版面区域中。

研究团队关注的问题是:当证据已经出现在输入中时,模型内部是否存在一组注意力头,负责将问题指向相关的文本或视觉内容?

团队将识别出的这类注意力头称为多模态检索头(MMRetHeads)。

怎么识别多模态检索头?

QRHead启发,研究团队提出了MMRetHeads检测方法。

具体来说,该方法分析每个注意力头的question-to-evidence attention,也就是问题token指向标注证据区域的注意力。证据如果是文字,就对应文字token;证据如果位于图片中,则对应视觉token。指向证据的注意力越强,该注意力头的检索得分就越高。

多模态检索头首次被锁定:揭开大模型长文档内部检索真相 | EMNLP'26图2
MMRetHeads:从问题token指向文字或视觉证据区域

研究覆盖Qwen3-VL、Gemma3等6个长上下文视觉语言模型,包括文本检索、图像检索、渲染文本检索和相同图像检索等任务,并测试8K、16K、32K、64K和128K上下文长度。

分析还发现,文本和图像检索会共享一部分注意力头,但不同上下文长度和证据形式也会调用不同的注意力头。

这些注意力头真的会影响模型回答吗?

注意力指向证据,只能说明两者存在关联。为了检验模型是否真正依赖这些头,研究团队屏蔽得高分的检索头,再与屏蔽相同数量随机注意力头的结果进行比较。

在文字和图片检索任务中,屏蔽检索头后,模型在不同上下文长度和证据位置下的表现显著下降;随机屏蔽造成的影响则小得多。

同样的差异也出现在更真实的长文档问答中:

随机屏蔽后,两项任务仍分别保留32.252.6分。屏蔽检索头造成的下降明显更大,说明这些头不只是把注意力放在证据附近,也对模型访问证据具有因果作用。

在多模态推理任务中也能观察到类似结果。检索头被屏蔽后,模型有时会在图表仍然存在于输入中的情况下回答“信息不足”,也可能读取错误内容或生成不存在的依据。

多模态检索头首次被锁定:揭开大模型长文档内部检索真相 | EMNLP'26图3
屏蔽检索头后,长文档问答性能显著下降

从内部机制到文档检索

研究团队进一步把这些注意力头中的证据信号用于多模态文档检索。

给定一个问题,MMRetHeads会为候选页面或版面区域计算相关性分数,并据此对候选项进行排序。页面级检索寻找包含证据的整页,版面级检索则进一步定位页面中的文字块、表格、图片或图表。整个过程不需要额外训练检索器。

在MMDocIR上,Qwen3-VL-8B的页面级Recall@1达到64.7,较最强的已报告基线提高7.7个百分点;版面级Recall@1达到39.0,较最强的已报告基线提高6.3个百分点。

多模态检索头首次被锁定:揭开大模型长文档内部检索真相 | EMNLP'26图4
MMRetHeads在MMDocIR页面级和版面级检索上的结果

论文链接:https://arxiv.org/abs/2605.27243

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
NLP 大模型
more
EMNLP2025 | SFT与RL的结合,vivo AI Lab提出新的后训练方法
手机本地一键成片,靠的是一个8B小模型的自我进化 | EMNLP'26
小米8篇论文入选EMNLP 2026,聚焦端侧AI落地与算力优化
多模态检索头首次被锁定:揭开大模型长文档内部检索真相 | EMNLP'26
EMNLP 2025 | CARE:无需外部工具,让大模型原生检索增强推理实现上下文高保真
LLM真能读懂报表吗?EMNLP'25首个工业级表格生成报告基准T2R-bench:最强大模型仅得62分
刚刚,NLP先驱、斯坦福教授Manning学术休假,加盟风投公司任合伙人
EMNLP2025|大模型“撒谎”的内部机制
EMNLP 2025 | 动态压缩CoT推理新方法LightThinker来了
R-HORIZON:长程推理时代来临,复旦NLP&美团LongCat重磅发布LRMs能力边界探测新范式
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号