只靠一问一答,就能抓出大模型幻觉,准确率88% | ICML'26

量子位 2026-08-29 13:41
HCPD 团队 投稿 
量子位 | 公众号 QbitAI

随着大语言模型广泛应用于教育、医疗等决策支持场景,幻觉(LLM Hallucination)仍是其可靠部署面临的核心风险之一。

更具挑战的是,在许多实际场景中,检测者既无法访问目标模型的输出概率、中间状态等内部信息,也难以持续依赖搜索引擎、知识库或标准答案进行事实核验。

本文介绍发表于ICML 2026的文章《Zero-source LLM Hallucination Detection with Human-like Criteria Probing》。文章从人类专家多维、动态的评估过程出发,提出了类人准则探测机制(HCPD),并结合弱监督奖励对齐与多采样聚合,实现可解释、稳定且具有较强泛化能力的幻觉检测。

只靠一问一答,就能抓出大模型幻觉,准确率88% | ICML'26图1

研究背景与动机:没有“参考答案”和“内部信息”,幻觉检测的类人机制实现

现有大语言模型幻觉检测方法通常依赖目标模型的输出概率、置信度、多次生成结果,或模型内部表示等辅助信号。然而,在真实应用中,待检测文本的生成来源往往未知,检测者可能只能获得最终问答文本;与此同时,持续依赖知识库或参考答案进行事实核验,不仅带来额外计算与时间开销,其效果还受外部信息覆盖范围与可靠性的限制。

因此,本文关注一种更为严格的设定:零源(Zero-source)幻觉检测。检测器只能依据给定问题与回答本身判断其可靠性。这显著压缩了可利用信息,也更贴近部分真实部署环境。

不难观察到,人类评估回答时通常不会机械套用统一标准,而会根据问题内容动态调整关注重点。例如,历史问题更关注人物、地点和时间,科学问题更重视事实依据、概念准确性与推理逻辑;不同标准的重要性也会随具体样本变化。因此,本文将幻觉检测重新建模为一种类人化的动态评估过程。

只靠一问一答,就能抓出大模型幻觉,准确率88% | ICML'26图2

上图对HCPD的流程进行了直观展示:给定问答对,Agent首先从多个候选评估维度出发,根据当前样本自适应生成具体的评价准则及其对应权重,随后围绕各项准则进行逐维分析与评分,并综合形成最终的幻觉判断。在训练阶段,作者进一步采用GRPO对这一类人评估能力进行优化与对齐;在推理阶段,则通过并行采样聚合多次独立评估,以降低单次生成带来的随机波动,从而获得更稳定、可靠的检测结果。

HCPD:基于类人标准探索的幻觉检测框架

Human-like Criteria Probing Mechanism:自适应匹配评估标准

HCPD预先定义事实正确性、逻辑一致性、语义准确性、时间一致性和社会合规性等通用评价维度C。需要强调的是,这些通用维度并非固定不变的最终评价模板,而是为后续标准生成提供基础框架。

针对具体的(q,a),Agent会进一步结合当前问题与回答内容,生成更具针对性的细粒度标准只靠一问一答,就能抓出大模型幻觉,准确率88% | ICML'26图3,并为不同评价标准分配相应的重要性权重只靠一问一答,就能抓出大模型幻觉,准确率88% | ICML'26图4,进而按照标准为回答打出分数sₚ:

只靠一问一答,就能抓出大模型幻觉,准确率88% | ICML'26图5

据此,HCPD不仅能够给出幻觉判断,还可以输出相应的评价准则、权重及分析依据,为检测结果提供更细粒度的解释。

Reward-based Alignment Training:提升评估结果的可靠性

仅依赖Prompt难以保证Agent评分的稳定性。为此,论文采用GRPO进行奖励对齐,使Agent学习更可靠的准则生成、权重分配与评分行为。

考虑到大规模人工细粒度评分成本较高,在训练阶段,基于标准问答数据集中的参考答案â与模型生成的候选回答a⁽ⁿ⁾,利用语义相似度指标构造弱监督标签sₗ⁽ⁿ⁾,并将其映射至1–10的细粒度评分尺度:

只靠一问一答,就能抓出大模型幻觉,准确率88% | ICML'26图6

随后,根据Agent的预测评分sₚ与弱监督评分sₗ之间的偏差构造奖励函数:

只靠一问一答,就能抓出大模型幻觉,准确率88% | ICML'26图7

相比简单的二分类标签,细粒度评分能够更充分刻画回答可靠性的连续变化,并提供更具区分度的优化信号。

Multi-sampling Aggregation Strategy:降低单次评估的随机性

由于LLM生成具有随机性,同一问答对在不同采样中可能产生不同的准则、分析路径和评分。HCPD因此在推理阶段并行执行多次完整评估最终评分只靠一问一答,就能抓出大模型幻觉,准确率88% | ICML'26图8,并对结果进行聚合得到最终评分只靠一问一答,就能抓出大模型幻觉,准确率88% | ICML'26图9,以降低随机采样引入的波动,提高最终判断的稳定性。

实验验证:跨目标模型与问答场景的性能分析

论文在TriviaQA、SciQ、NQ Open和CoQA四个问答数据集上进行评测,覆盖LLaMA与Qwen两个模型家族及7个不同规模的目标模型。

标准评测

只靠一问一答,就能抓出大模型幻觉,准确率88% | ICML'26图10

在LLaMA-3.1-8B上,HCPD的平均AUROC达到88.19%,较次优方法提升10.20%。在Qwen-3-8B上,平均AUROC达到89.62%,较次优方法提升约10.15%

跨模型评测

在真实应用场景中,待检测文本的生成来源往往并不明确。因此,论文进一步评估HCPD在生成模型发生变化时的泛用性。

只靠一问一答,就能抓出大模型幻觉,准确率88% | ICML'26图11

跨目标模型实验表明,HCPD在生成模型发生变化时仍能保持稳定检测能力。由于其主要依据不同模型共享的自然语言空间,而非绑定特定模型的内部表示或概率信号,因此更适用于生成来源未知的开放环境。

总结与展望

HCPD面向目标模型黑盒、无外部知识与参考答案的零源场景,将幻觉检测从依赖固定信号的判别过程转化为类人动态评估:根据问答内容自适应生成评价准则、估计其重要性并进行细粒度评分,再通过奖励对齐提升评分可靠性,并利用多采样聚合降低推理波动。

实验结果表明,HCPD在不同数据集、不同目标模型以及跨模型、跨数据分布迁移设置下均展现出较强的检测能力与泛化性,同时能够提供细粒度的评价依据。

随着大语言模型生成文本日益流畅,仅依赖表面异常信号进行幻觉检测将愈发困难。在这一背景下,幻觉检测或许需要从简单回答“这个回答是否异常”,进一步转向理解“这个回答为什么值得相信,或为什么不值得相信”。这也正是HCPD所尝试提供的一个新的研究视角。

论文链接:https://arxiv.org/abs/2606.12900
代码链接:https://github.com/TRISKEL10N/HCPD

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
IC 大模型
more
2028:定制ASIC转型之年
引线键合设备紧缺,2027年IC设计遇封装瓶颈
Paradromics获得FDA批准,脑机接口开始接入个人设备
Anthropic,欲收购芯片公司
Hugging Face发布399美元开源机器人Microduck,具身智能平民化再进一步
推不推、何时推?抖音、北大提出Agentic推送系统STEPS,入选RecSys 2026 Oral
Anthropic盯上「训练芯片」?被爆曾想70亿美元收购AI芯片公司MatX
DIC2026丨TCL华星携多款创新成果亮相,洞见显示未来
刚刚,Anthropic发布物理MCP:Claude开始接管真实世界
《GTA6》公布26分钟实机演示/黄仁勋:AGI可能已经实现/曝Anthropic 最快9月上市
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号