模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案

量子位 2026-07-23 20:05
QC-MHM团队 投稿 
量子位 | 公众号 QbitAI

向ChatGPT问一个看起来挺简单的问题:“Lasha Talakhadze之前的奥运举重纪录是多少?”

结果让人哭笑不得——模型能认出这个人是谁,也说得出来他拿过金牌,但给出来的答案却是他现在的纪录,而不是“之前”的。同理,“第25届奥运会期间布达佩斯的市长是谁?”这种带时间窗口约束的问题,Google和ChatGPT都翻了车。

这不是某个模型的bug,而是所有基于知识图谱的问答系统共有的结构性问题:它们看得见实体,看不见时间。

北航、复旦、浙大联合团队在AAAI上提出的QC-MHM(Question Calibration and Multi-Hop Modeling),用一个三件套方案——问题校准+时序嵌入+多跳图推理——让模型真正拥有了“时间感”。

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图1

作者单位:北京航空航天大学·复旦大学·浙江大学

发表:AAAI(CCF-A类顶会,Pages 19332–19340)

背景

场景与痛点

时序知识图谱问答(Temporal KGQA)的任务是:给定一个带时间约束的自然语言问题,从知识图谱中找到落在正确时间窗口内的答案

听起来只是在普通KGQA上加了个时间字段?实际上差距巨大:

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图2

举个例子:(布达佩斯,市长,某人,1992)和(布达佩斯,市长,另一人,2024)在KG里是两条不同的事实。传统模型很容易把两条混在一起,问“92年谁当市长”时给出2024年的答案。

现有方法的两大硬伤

学界已经有了CronKGQA、TMA、TSQA等一系列时序KGQA模型,但这篇AAAI论文犀利地指出,它们都没绕过两个坎:

硬伤一:PLM对时间“视而不见”。Bert等预训练语言模型编码问题时,注意力天然落在实体名词上(人名、地名),对“之前/之后/期间”这类时间词汇缺乏敏感性。结果就是——模型相当于读了一道“不带时间约束”的问题。

硬伤二:图结构信息被浪费。即使用了知识图谱,多数方法也只把它当作答案查询的索引,没有真正利用其中蕴含的多跳关系结构。遇到需要“两步以上跳转”的问题就掉链子,而且推理过程完全黑箱。

论文做了什么

QC-MHM用一个端到端框架把三个模块串起来:

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图3

技术方案

模块一:让时间戳“懂顺序”的KG嵌入

KG里每条事实是(主体,关系,客体,时间)四元组。QC-MHM选择TComplEx做基础嵌入,评分函数为:

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图4

但仅靠TComplEx,时间戳之间还是“散装”的——模型不知道1992在2024之前。为此作者借鉴Transformer的sinusoidal编码,为每个时间戳叠加位置编码:

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图5

进而构造辅助任务——让模型判断“时间m是否早于时间n”:

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图6

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图7

总训练损失:模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图8。这个辅助任务就像给模型做“时间排序”的专项训练——嵌入空间里,1992的向量自然排在2024前面。

模块二:问题校准——让问题主动“找时间”

这是QC-MHM最具想象力的设计。常规做法是:问题→PLM编码→直接查询答案。QC-MHM在中间加了一步:让问题先去KG中检索与时序相关的SPO(主体-关系-客体三元组),再回来修正自己的表示。

第一步:候选SPO召回。把问题和KG中的所有SPO分别过SentenceBERT,用余弦相似度排名,保留Top-10:

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图9

第二步:三注意力多视角匹配。用三种注意力机制同时比较“问题词×SPO候选”:

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图10

三种视角各看各的:Concat看“这两个向量放一块合理吗”,Dot看“关键维度上对齐了吗”,Minus看“哪里不一样”。

第三步:门控自适应融合。让模型自己决定“原始问题语义”和“从KG检索到的时序信息”各占多大权重:

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图11

经过校准后的问题向量模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图12,从此具备了“时间感”。相当于原本的问题是“XXX是谁?”,校准后变成了“XXX在1992年是谁?”。

模块三:多跳GNN推理——一层看穿整条路径

传统GNN的问题是:一层只能看1跳邻居,要想看2跳需要堆2层,看3跳得堆3层,效率和可解释性都不好。

QC-MHM的做法是:先把子图裁剪出来,再一次性做多跳注意力聚合。

子图裁剪:以问题中的实体为起点,抽取k跳范围内的子图,把搜索空间收窄。

路径打分(注意力矩阵):

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图13

一次性多跳聚合:

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图14

核心公式在D:通过加权和把1跳、2跳、…、ℓ跳的注意力矩阵一次性合并,让单层GNN就能访问任意跳邻居。经验设置模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图15已能取得理想效果。

最终图向量:模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图16

注意力权重本身也可以直接可视化,展示模型的“思考轨迹”——哪条边被高权重激活,推理路径一目了然。

模块四:双通道答案预测

把语义向量模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图17(问题校准后的表示)和图向量模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图18(GNN聚合后的表示)拼接,过一层Transformer融合:

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图19

然后分别投影到实体空间时间戳空间,用TComplEx评分做双通道预测:

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图20

两个通道的分数拼接后softmax,交叉熵优化。这意味着——同一个模型可以同时回答“是谁”和“什么时候”两类问题。

实验结果

CronQuestions:逼近性能天花板

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图21

TimeQuestions:跨数据集泛化验证

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图22

迁移到第二个基准同样SOTA,说明方法具有可迁移性,不是针对某个数据集的特化方案。

细粒度问题类型拆解

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图23

Before-After这种典型时间排序题,QC-MHM的优势被放大得最明显——这正是“问题校准”模块的主场:只有显式建模了时间约束,模型才知道“之前”意味着什么。

消融实验:三件套缺一不可

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图24
模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图25

三个模块互相成就,不是简单的“拼盘”,去掉任何一个都会导致特定类型问题大幅退化。

可视化:“白盒”推理路径

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图26

可以清晰地看到模型如何在图中逐跳推进,哪些边被高权重激活——这是过往黑箱模型不具备的能力。

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图27

图中高亮的92%、95%等数值,正是问题对最相关时序SPO高度关注的证据,表明门控机制确实抓住了“哪些SPO该被重视”。

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案图28

梯度分析印证了问题校准模块确实把关键时序事实反映到了问题向量中。

项目价值

学术贡献

落地场景

在LLM普遍强调“事实可追溯”的当下,QC-MHM所代表的“PLM×时序KG×多跳GNN”思路,是构建可信时序推理系统的关键拼图。

论文(arXiv):https://arxiv.org/abs/2402.13188
代码(GitHub):https://github.com/zhouyan0614-sys/QC-MHM-TKGQA
会议:AAAI(CCF-A),Pages 19332–19340

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
AI
more
合见工软与燧原科技本土合作创新 破解AI芯片系统级验证挑战
从展团到生态:WAIC 2026揭示的北京AI“系统能力”
百度AI为何没有大获成功
腾讯研究院AI速递 20260724
模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案
聊聊梁文锋视野中的8家AI公司
当AI能给出所有标准答案,人如何保持独特?
AI开始"接管"康复?这些智能康复新品夯爆了,9月首发在即!
马斯克第三次喊「奇点已至」!AI三个月连破数学、安全两道墙
创维不装了!一揽子新品发布:27.9mm壁纸电视、不直吹空调,还有AI闺蜜机
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号