告别一次性全盘推理,这套skill让每条证据都能追溯预测结果 | EMNLP'26

量子位 2026-09-05 11:06
LEAP团队 投稿 
量子位 | 公众号 QbitAI

预测系统现在很会找资料。一个agent可以搜索网页、调用工具、整理来源,再把几十条材料带回预测阶段。

但真正的麻烦从这里才开始:最后该怎样使用这些证据?

常见做法是把全部材料塞进一次LLM调用,让模型自行消化并给出答案。结果可能很自信,但使用者很难判断,究竟是哪条证据改变了预测。

EMNLP 2026 Main Conference接收的论文新作《LEAP: Likelihood Elicitation and Aggregation for LLM-based Probabilistic Forecasting》,系统地研究了这一步。

它在保留已有搜索与证据收集流程的前提下,重新设计了evidence到forecast的转换方式。

搜索结束之后,预测才刚刚开始

论文把一次性读取全部证据并直接作答的方式称为Monolithic Prediction。这种流程把证据解释、冲突处理和最终决策都交给同一次模型调用。自然语言rationale可以说明模型“声称自己为什么这么想”,却很难还原每条材料在计算中的真实影响。

LEAP将这几个动作拆开。LLM每次只读取任务和一条证据,判断这条证据对不同结果提供了多强的支持。所有局部判断完成后,显式概率模型再统一计算posterior。

告别一次性全盘推理,这套skill让每条证据都能追溯预测结果 | EMNLP'26图1
同一组证据进入两种预测流程。左侧一次性生成答案,右侧保留逐条证据的likelihood,并显式计算结果分布。

LLM负责解释,概率模型负责组合

LEAP的分工很明确。

每次调用只分析一条evidence item,并返回结构化likelihood parameters。模型看不到其他证据、累计结果或中间posterior,因此不会在局部判断时提前合并全部信息。

有可靠历史数据时,prior来自历史序列;缺少数据时,系统通过不读取当前证据的LLM调用估计基础分布。这样可以避免同一条证据在prior和likelihood中被计算两次。

当所有局部likelihood准备完毕后,确定性的闭式更新生成posterior。连续目标输出分位数,单选任务输出候选项概率,多选任务输出各选项的Bernoulli marginal。

实际证据很少完全独立。多个网页可能引用同一份报告,一次局部elicitation也可能带有噪声。LEAP因此会聚类同源证据,利用重复采样检查判断的一致性,并过滤连续目标中的明显数值异常。

告别一次性全盘推理,这套skill让每条证据都能追溯预测结果 | EMNLP'26图2
上游agent继续负责搜索和整理材料。LEAP接收固定的evidence set,完成prior estimation、逐条elicitation、safeguards和posterior aggregation。

预测结果可以追溯到具体证据

显式聚合带来一个直接好处:每条证据的影响都能重新计算。

对于进入posterior的任意evidence item,系统可以暂时移除它,再运行一次相同的闭式更新。新旧结果之间的变化就是该证据的leave-one-out contribution。整个过程不需要模型事后补写解释。

使用者由此可以查看哪些材料推动了某个候选结果,哪些来源几乎没有改变预测,以及当前置信度是否主要依赖少数证据。需要核查结果时,也可以沿着contribution回到原始evidence。

在证据完全相同的条件下比较

论文从FutureX、GAIA和BrowseComp构建预测与信息检索任务。LEAP与Monolithic Prediction在每个任务上共享同一evidence set,实验只比较最终预测方式。

在固定ReAct-style agent loop和共享证据集的设置下,实验覆盖DeepSeek-V3.2、Gemini-3.1-Flash-Lite、Claude-Haiku-4.5、GPT-5.4-mini与Grok-4.20-Fast。LEAP在五个base model上都提高了FutureX、Spherical、Accuracy和NCRPS。FutureX的绝对增益为3.618.1个点,Spherical的绝对增益为2.515.1个点。

论文还直接使用DeerFlow、Hermes、OpenClaw和MiroFlow的原始agent trace。在这四个外部CLI framework上,LEAP改善了大多数指标,macro-average在论文报告的五项指标上均有提升。

控制实验给Monolithic Prediction提供相同的prior或相近的token budget,LEAP仍然保留优势。与two-sample ensemble相比,LEAP的median latency接近,p95 latency更高,因为整次预测需要等待最慢的evidence-level call。

预测跨度变长时,两种方法的差异更加明显。在论文的诊断子集上,LEAP相对Monolithic Prediction的绝对改进从7天到30天60天持续扩大。面对更间接的证据,LEAP倾向于给出更宽的posterior,减少高置信度错误。

告别一次性全盘推理,这套skill让每条证据都能追溯预测结果 | EMNLP'26图3
诊断子集上的forecast horizon分析。横轴为距离结果揭晓的天数,纵轴为LEAP相对Monolithic Prediction的绝对改进。

以skill的形式接入现有agent

LEAP的代码已经开源。仓库包含论文提出的贝叶斯预测流程,并以可插拔skill的形式提供。已有agent可以保留自己的搜索、浏览和证据整理方式,在evidence set固定后调用LEAP完成概率预测。

论文标题:《LEAP: Likelihood Elicitation and Aggregation for LLM-based Probabilistic Forecasting》
作者:Yufei Chen,Yiran Zhao,Xiaogang Xu†,Qipeng Xie,Jiafei Wu,Zhe Liu†(†为通讯作者)
论文地址:https://layingfish.github.io/LEAP/LEAP.pdf
项目主页:https://layingfish.github.io/LEAP/
代码仓库:https://github.com/layingfish/LEAP

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
NLP
more
手机本地一键成片,靠的是一个8B小模型的自我进化 | EMNLP'26
EMNLP 2025 | AgentThink:小模型大超GPT4o! 首个融合推理与工具调用的自动驾驶 VLM 框架
小米8篇论文入选EMNLP 2026,聚焦端侧AI落地与算力优化
突破通用领域推理的瓶颈!清华NLP实验室强化学习新研究RLPR
LLM真能读懂报表吗?EMNLP'25首个工业级表格生成报告基准T2R-bench:最强大模型仅得62分
2025年中国自然语言处理(NLP)行业现状及发展趋势分析,技术创新是推动其持续发展的关键动力「图」
大模型时代下,nlp初学者需要怎么入门?
可攻可防,越狱成功率近90%!六大主流模型全中招 | EMNLP'25
EMNLP2025|大模型“撒谎”的内部机制
R-HORIZON:长程推理时代来临,复旦NLP&美团LongCat重磅发布LRMs能力边界探测新范式
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号