LEAP团队 投稿
量子位 | 公众号 QbitAI
预测系统现在很会找资料。一个agent可以搜索网页、调用工具、整理来源,再把几十条材料带回预测阶段。
但真正的麻烦从这里才开始:最后该怎样使用这些证据?
常见做法是把全部材料塞进一次LLM调用,让模型自行消化并给出答案。结果可能很自信,但使用者很难判断,究竟是哪条证据改变了预测。
EMNLP 2026 Main Conference接收的论文新作《LEAP: Likelihood Elicitation and Aggregation for LLM-based Probabilistic Forecasting》,系统地研究了这一步。
它在保留已有搜索与证据收集流程的前提下,重新设计了evidence到forecast的转换方式。
搜索结束之后,预测才刚刚开始
论文把一次性读取全部证据并直接作答的方式称为Monolithic Prediction。这种流程把证据解释、冲突处理和最终决策都交给同一次模型调用。自然语言rationale可以说明模型“声称自己为什么这么想”,却很难还原每条材料在计算中的真实影响。
LEAP将这几个动作拆开。LLM每次只读取任务和一条证据,判断这条证据对不同结果提供了多强的支持。所有局部判断完成后,显式概率模型再统一计算posterior。

△同一组证据进入两种预测流程。左侧一次性生成答案,右侧保留逐条证据的likelihood,并显式计算结果分布。
LLM负责解释,概率模型负责组合
LEAP的分工很明确。
LLM处理局部语义。
每次调用只分析一条evidence item,并返回结构化likelihood parameters。模型看不到其他证据、累计结果或中间posterior,因此不会在局部判断时提前合并全部信息。
Prior提供预测起点。
有可靠历史数据时,prior来自历史序列;缺少数据时,系统通过不读取当前证据的LLM调用估计基础分布。这样可以避免同一条证据在prior和likelihood中被计算两次。
贝叶斯更新给出最终结果。
当所有局部likelihood准备完毕后,确定性的闭式更新生成posterior。连续目标输出分位数,单选任务输出候选项概率,多选任务输出各选项的Bernoulli marginal。
实际证据很少完全独立。多个网页可能引用同一份报告,一次局部elicitation也可能带有噪声。LEAP因此会聚类同源证据,利用重复采样检查判断的一致性,并过滤连续目标中的明显数值异常。

△上游agent继续负责搜索和整理材料。LEAP接收固定的evidence set,完成prior estimation、逐条elicitation、safeguards和posterior aggregation。
预测结果可以追溯到具体证据
显式聚合带来一个直接好处:每条证据的影响都能重新计算。
对于进入posterior的任意evidence item,系统可以暂时移除它,再运行一次相同的闭式更新。新旧结果之间的变化就是该证据的leave-one-out contribution。整个过程不需要模型事后补写解释。
使用者由此可以查看哪些材料推动了某个候选结果,哪些来源几乎没有改变预测,以及当前置信度是否主要依赖少数证据。需要核查结果时,也可以沿着contribution回到原始evidence。
在证据完全相同的条件下比较
论文从FutureX、GAIA和BrowseComp构建预测与信息检索任务。LEAP与Monolithic Prediction在每个任务上共享同一evidence set,实验只比较最终预测方式。
在固定ReAct-style agent loop和共享证据集的设置下,实验覆盖DeepSeek-V3.2、Gemini-3.1-Flash-Lite、Claude-Haiku-4.5、GPT-5.4-mini与Grok-4.20-Fast。LEAP在五个base model上都提高了FutureX、Spherical、Accuracy和NCRPS。FutureX的绝对增益为3.6至18.1个点,Spherical的绝对增益为2.5至15.1个点。
论文还直接使用DeerFlow、Hermes、OpenClaw和MiroFlow的原始agent trace。在这四个外部CLI framework上,LEAP改善了大多数指标,macro-average在论文报告的五项指标上均有提升。
控制实验给Monolithic Prediction提供相同的prior或相近的token budget,LEAP仍然保留优势。与two-sample ensemble相比,LEAP的median latency接近,p95 latency更高,因为整次预测需要等待最慢的evidence-level call。
预测跨度变长时,两种方法的差异更加明显。在论文的诊断子集上,LEAP相对Monolithic Prediction的绝对改进从7天到30天、60天持续扩大。面对更间接的证据,LEAP倾向于给出更宽的posterior,减少高置信度错误。

△诊断子集上的forecast horizon分析。横轴为距离结果揭晓的天数,纵轴为LEAP相对Monolithic Prediction的绝对改进。
以skill的形式接入现有agent
LEAP的代码已经开源。仓库包含论文提出的贝叶斯预测流程,并以可插拔skill的形式提供。已有agent可以保留自己的搜索、浏览和证据整理方式,在evidence set固定后调用LEAP完成概率预测。
论文标题:《LEAP: Likelihood Elicitation and Aggregation for LLM-based Probabilistic Forecasting》
作者:Yufei Chen,Yiran Zhao,Xiaogang Xu†,Qipeng Xie,Jiafei Wu,Zhe Liu†(†为通讯作者)
论文地址:https://layingfish.github.io/LEAP/LEAP.pdf
项目主页:https://layingfish.github.io/LEAP/
代码仓库:https://github.com/layingfish/LEAP
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🌟 点亮星标 🌟