预测系统现在很会找资料。一个agent可以搜索网页、调用工具、整理来源,再把几十条材料带回预测阶段。
但真正的麻烦从这里才开始:最后该怎样使用这些证据?
常见做法是把全部材料塞进一次LLM调用,让模型自行消化并给出答案。结果可能很自信,但使用者很难判断,究竟是哪条证据改变了预测。
EMNLP 2026 Main Conference接收的论文新作《LEAP: Likelihood Elicitation and Aggregation for LLM-based Probabilistic Forecasting》,系统地研究了这一步。
它在保留已有搜索与证据收集流程的前提下,重新设计了evidence到forecast的转换方式。
搜索结束之后,预测才刚刚开始
论文把一次性读取全部证据并直接作答的方式称为Monolithic Prediction。这种流程把证据解释、冲突处理和最终决策都交给同一次模型调用。自然语言rationale可以说明模型“声称自己为什么这么想”,却很难还原每条材料在计算中的真实影响。
LEAP将这几个动作拆开。LLM每次只读取任务和一条证据,判断这条证据对不同结果提供了多强的支持。所有局部判断完成后,显式概率模型再统一计算posterior。
△同一组证据进入两种预测流程。左侧一次性生成答案,右侧保留逐条证据的likelihood,并显式计算结果分布。
0
评论 (0)