全球首个通用决策大模型,AI推演现实世界的技术揭秘

机器之心 2026-09-03 10:17
全球首个通用决策大模型,AI推演现实世界的技术揭秘图1
编辑|杜伟

生成答案正在成为 AI 的基础能力,而推演现实世界,才是下一阶段更难的命题。


真实决策不是一道静态问答。它发生在一个持续变化、多主体同时行动、信息不完备且充满不确定性的世界里。


比如一个新开源模型突然把成本打下来,头部模型公司会不会跟进降价,云厂商、开发者和应用公司又会怎样重新站队?这类决策中,一方行动会改变其他方下一步面对的条件,新的反应又会继续改写局势。就像一盘所有棋手同时落子的棋,每落下一子,棋局都会随之改变。


也正是在这一背景下,中科闻歌决策机 Decitron(简称决策机)发布后,被多家主流科技媒体称为「全球首个通用决策大模型」。该称谓所强调的,并非世界模型、多智能体或博弈求解等某项单一技术的首次出现,而是决策机首次将这些能力统一到一套面向开放世界的决策框架中,形成持续建模、推演、求解和校准的完整闭环。


所谓「通用」,是其试图将不同领域的复杂决策问题抽象为一套共同结构 —— 世界状态、参与主体、行动空间、约束关系、多轮互动和不确定结果,并在同一套框架中持续推演与求解。


全球首个通用决策大模型,AI推演现实世界的技术揭秘图2


技术报告地址:https://chinaxiv.org/abs/202608.00064


8 月 3 日,决策机 Decitron 完整技术报告正式发布,首次系统公开其三项核心技术贡献:


一是提出显式世界模型 MetaWorld,将多源信息整理成结构化、持久化和可计算的世界状态及其因果建模;二是采用 State–Action–Outcome (SAO) 形式化表示,将复杂决策转化为可计算的表达与推理形式;三是构建融合多智能体模拟、博弈推理和形式化优化的混合推理架构 AutoABM,基于多智能体决策推演系统求解博弈均衡、策略规划与约束满足等复杂决策问题。三者共同构成决策机的技术底座,目标是将 AI 系统的一次性判断,转变为一个随世界变化持续更新的计算与推演过程。



让 AI 参与真实决策,

需要怎样一套架构?



当前,围绕「决策推演」,AI 需要的几项关键能力(如世界模型、多智能体、博弈推理、概率预测)其实已经陆续出现。真正的难点在于:当 AI 从封闭任务进入开放现实世界,这些能力必须围绕同一个、持续更新的世界状态协同工作,而不能只在一次 Prompt 里给出彼此独立的分析。


先看世界模型。提到 World Model,人们很容易想到 Sora、World Labs、V-JEPA 等主要面向视觉、空间、物理或机器人环境的物理世界模型。而决策机提出的 MetaWorld 关注的则是更为复杂的决策场景:经济、政策、企业竞争、地缘等开放系统,系统建模涉及的主体、变量、关系和约束更加繁杂


MetaWorld 可以看作世界模型向社会系统的一次延伸,需要处理三类棘手的问题:规则差异、反身性(因果之间双向互动、循环影响)和无法彻底消除的不确定性。这也带来了一个直接问题:如果对当前世界的判断出现偏差,后面的推演会不会跟着跑偏?


一旦进入社会系统,只维护环境状态还不够,AI 还要判断其他参与者怎么做。Meta 的 CICERO、北大等团队提出的 Richelieu 已经展示了多个 Agent 在有限信息下进行互动与博弈的能力;而对于开放世界的真实决策,在模拟出各方行动之后,还要继续判断策略是否可行、博弈可能落在哪些均衡上以及不同未来发生的可能性和条件。


决策机的意义正在于此:其混合推理架构 AutoABM 将 LLM 的语义理解、SAO 结构化表示、多智能体建模与仿真、策略推理与优化统一在同一条实现链路上,打通了「理解世界 — 模拟推演 — 求解决策 — 评估未来」这四步。



从事实到未来,

决策机如何完成一次复杂推演?



决策机由输入与任务、数据与知识、建模与形式化、模拟与推理、预测与校准、报告与解释六个层级组成,形成从现实信息到决策输出的完整链路。


全球首个通用决策大模型,AI推演现实世界的技术揭秘图3


接下来,我们以「未来半年,某场复杂贸易冲突可能如何演化?」为案例,看决策机如何从现实信息出发,一步步建立当前世界状态、模拟各方行动、推演未来可能出现的不同路径,以及这些路径会在什么条件下发生。


第一步:先不急着推演未来,首先弄清「现在发生了什么」,以及哪些事实值得相信。


现实世界的信息很杂,可能重复或彼此冲突,也可能已经过时。决策机首先将用户的问题转成一个结构化任务,明确要回答什么、涉及哪些主体、观察多长时间,以及有哪些约束。以案例来说,系统会先锁定这场冲突涉及的主要参与方、时间范围和当前争议焦点,梳理关税、供应链、产业政策、企业行为等可能影响局势变化的条件,随后围绕这些要素从新闻报道、社交媒体、研究报告等不同来源收集信息


全球首个通用决策大模型,AI推演现实世界的技术揭秘图4

图 2:数据处理流程图


收集到的信息会先经过去重、聚类和事件抽取,整理成事件时间线和一组更细的证据单元。然后系统通过 Evidence Quality Score (EQS) 逐条判断信息质量,包括与当前问题的相关性、来源可信性、内容时效性与完整性、不同信源之间的一致性。同时根据证据的不同置信度决定它们的去向,其中置信度高的直接进入后续推演。


如果现有证据不足或者不同来源出现冲突,系统继续执行基于 ReAct 的交替推理与检索,根据当前缺少的信息调整下一轮搜索,并把新找到的信息补充进已有时间线。


全球首个通用决策大模型,AI推演现实世界的技术揭秘图5

图 3:采用基于 ReAct 的推理与检索交替机制


第二步,把筛选后的事实转化为一个持续更新的「世界状态」。事实告诉系统发生了什么,接下来还要进一步判断:这些变化叠加在一起,现在的世界究竟处于什么状态。


决策机采用 State–Action–Outcome (SAO) 表示把这个过程形式化,其中 State 描述当前世界状态,Action 记录各个 Agent 在当前状态下采取的行动,Outcome 记录行动带来的收益、损失、成本和风险等结果。值得注意的是,State 区分宏观状态和更细的可量化状态。在案例中,摩擦升级可以是宏观状态,关税水平、商品价格、供应链受影响程度等可以进入更细的状态记录。


此外,系统还单独考虑外部冲击,比如政策突变、环境变化或其他不由 Agent 控制的事件。一次行动和外部事件发生后,世界状态随之更新。更新后的状态再成为下一轮行动的起点。如此循环往复,形成了一条连续的 SAO 轨迹。


全球首个通用决策大模型,AI推演现实世界的技术揭秘图6

图 4:SAO 运行过程


负责把这些状态真正维护起来是 MetaWorld,它输出的是一套可以计算和更新的结构化世界状态。状态又可以拆成三个层次:Environment Layer 记录所有参与者共享的整体环境,例如局势阶段、资源价格等;Agent Metrics Layer 记录每个 Agent 的资源、能力和目标进展;Relationship Matrix Layer 记录不同 Agent 之间的关系变化。


MetaWorld 还使用因果 DAG (Causal Directed Acyclic Graph) 约束状态如何变化:变量之间可能的影响,在建模阶段就被组织进因果关系图。推演过程中,系统更新节点状态和因果边的权重,但不会每一轮重新生成一张因果图。


这对长程推演很重要。前一轮关税变化影响价格,价格又改变企业选择和其他参与者的回应,这些变化都需要被保留下来,才能继续往后算。MetaWorld 承担的就是这份持续更新的「世界账本」。


第三步,有了世界状态,各个 Agent 开始行动。传统的 Agent-Based Modeling (ABM) 通常需要专家提前定义好参与者、行为规则、环境变量和互动机制。换一个问题,很多东西就要重新建模。决策机提出的 AutoABM 将这一步自动化:面对自然语言问题,系统会结合外部证据,提取参与者、目标和约束、行动空间、环境变量以及因果关系,再据此构建多智能体推演环境。


一场贸易冲突可能同时存在政府、企业、行业组织、消费者等不同 Agent,每一方都有自己的目标、资源、风险偏好和不能突破的红线。这些 Agent 没有上帝视角,只能根据自己掌握的局部信息行动。


具体到一轮行动,Agent 先调取此前的互动和历史轨迹,再判断当前局势中的机会、风险和约束,生成几种可选策略并作出选择。并且每一轮都不会只往一个方向推,系统同时展开几种不同的世界状态,包括相对稳定的均衡路径、偏乐观或悲观的演化方向,以及概率较低但一旦发生就明显改变局势的高影响分支。接着再筛选和验证这些路径,更新世界状态,进入下一轮。随着各方继续行动,一些路径失去成立条件,另一些路径变得更有可能。


全球首个通用决策大模型,AI推演现实世界的技术揭秘图7

图 5:Agent 行为范式


在多智能体模拟之外,复杂决策还需要一位「数学裁判」。多智能体可以展开很多看起来合理的未来路径,但能想到不等于能做到,现实决策还受到预算、资源、时间、政策红线、各方均衡关系等硬约束。


决策机接入了一套形式化求解(Solver)能力,包括经典博弈、资源配置与优化、路径规划与调度、不确定条件下的概率推断以及约束满足等五类问题。比如,预算有限时资源怎么分配、多方博弈可能形成什么均衡、一项策略有没有突破既定红线,这些都可以进入这一层计算。在博弈问题上,系统还内置了囚徒困境、猎鹿博弈、胆小鬼博弈、零和博弈等 9 类经典原子博弈,覆盖 144 种 Robinson–Goforth 2×2 博弈拓扑,用来识别和求解不同的博弈结构。


这一层的重点,在于其把多智能体生成的候选策略放回可计算的博弈、约束和优化框架中,使「语义上合理」进一步变成「形式上可检验」。


在测试多智能体博弈能力的 TMGBench 基准上,决策机均衡准确率达到 99.4%,拓扑识别准确率为 100%,平均求解时间为 0.8 秒,可解释性评分为 4.3/5.0。


全球首个通用决策大模型,AI推演现实世界的技术揭秘图8

表 2:五种主要的求解问题类型


多智能体模拟和形式化求解的分工很清楚:前者负责把可能发生的路径展开;后者负责检查这些路径在约束和博弈结构下是否站得住。


到了推演的最后一环,还剩下一个关键问题:前面展开的多条未来路径,各有多大可能发生?为此,决策机设置了预测与校准环节(Forecasting & Calibration)


在前面得到的候选路径基础上,这一层继续处理其中的不确定性:系统结合模型推理结果和外部校准信号,为不同结果分配概率,再利用预测市场信息、历史预测表现和概率评分规则对这些概率进行校准。决策机给出的不再只是一串「可能发生什么」的情景描述,不同路径还会带上相应的概率判断,并随着新的证据和推演结果继续更新。


我们可以把它理解成一张动态变化的「未来地图」:贸易摩擦继续升级、双方暂时缓和或者出现新的突发变量,都可能成为不同分支。系统判断每条路径发生的可能性以及哪些变化会让某一条路变得更有可能。


全球首个通用决策大模型,AI推演现实世界的技术揭秘图9

图 6:概率预测模块


至此,决策机把一轮完整的决策推演串了起来。



实验验证:

这套决策框架是否有效?



报告用了几组实验来检验决策机的推演系统,最值得看的是「事件推演和概率预测」的结果。


先来看自建事件预测集,观察结构化推演能否改善事件预测。团队自建了一个包含 74 个事件、370 个二元判断问题的数据集,覆盖多个高不稳定性事件类别,并将不同预测跨度纳入评测。在团队的评测设置下,决策机整体结果为 78.41%。


另外在 LLM-NEWS 设置中,针对 3-30 天短期组,决策机结果为 72.80%,GPT-5.5 和 Claude-4.7 分别为 35.43% 和 44.62%;进入中期和长期之后,差距逐渐缩小。也就说是,结构化推演在局势快速变化、历史规律较难沿用的短期场景中,相对优势更明显。


全球首个通用决策大模型,AI推演现实世界的技术揭秘图10


然后是在公开预测市场基准 PolyBench 上的补充实验


决策机的 FFA(最终预测准确率)为 81.20%、EVPA(预期波动率预测准确率)为 73.40%、MSE(均方误差)为 0.822,三项指标均优于 Gemini-3-Flash、MiMo-V2-Flash 和 Grok-4.1-Fast。这表明,决策机对市场概率变化方向的捕捉和概率误差控制取得了更好的表现。


全球首个通用决策大模型,AI推演现实世界的技术揭秘图11



决策 AI,正在改变大模型的竞争单位



生成式 AI 以 Token 为基本计算单位,解决的是「下一段内容如何生成」;决策 AI 则以世界状态的变化为基本计算对象,解决的是「一次行动将如何改变接下来的世界」。前者关心答案是否合理,后者还必须处理因果关系、现实约束、对手反应和概率变化。两者之间并非简单的能力叠加,而是计算范式的变化


决策 AI 很难仅靠更大的参数规模和更强的语言能力自然涌现。进入开放世界后,基础模型仍然重要,但它开始从整个系统本身,转变为决策系统的组成部分。AI 竞争的单位,也由单一模型转向完整系统


决策机的技术意义正在于,它把过去分散的能力组织成一套共同的决策结构。所谓「通用」,不意味着预知所有领域的未来,而是不同领域的问题,都可以被转译为状态、行动、结果、约束和不确定性,并进入同一套推演与求解框架。


从这个角度看,全球首个通用决策大模型」的真正价值,不只是争夺一个「第一」,更在于让「通用决策大模型」有了较为完整的技术轮廓:用显式状态描述世界,用多智能体展开行动,用博弈与优化检验策略,再用概率校准不同的未来路径。相应地,AI 的评估标准也开始发生变化 —— 不仅要看回答是否准确,还要看状态能否保持一致、推演能否被检验、概率是否可靠,以及新信息出现后能否及时更新。


毕竟,一个听起来正确的答案,并不等于一个经得起现实变化的决策。


© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 大模型
more
华硕ProArt GR1X迷你主机亮相:掌中AI算力怪兽,集成RTX Spark平台
突发:OpenAI Astra模型被曝安全风险
制造业龙头,给工业AI补上了哪一块短板?
有人@你,图灵智新邀您解码AI风向标!
新品直击|全球首款全自主导盲机器人:朱葛机器人AI LOOK亮相福祉博览会
新品直击|视障人士的“第三只眼”!环视智能触晓AI导盲设备亮相福祉博览会
AI催生存储新需求,闪迪夯实技术基石
AI加速向设备端迁移,“研华AMD嵌入式平台解决方案线上研讨会”成功举办
首发!AI芯片架构创新技术研讨会议程公布
OpenAI再遭30起诉讼:从“疏忽”到“共谋”,图姆勒里奇枪击案背后的算法伦理拷问
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号