
封面图:微软 Command Line 博客的官方配图,已裁成横版
北京时间 10 月 10 日凌晨 2 点 37 分,微软 CEO 纳德拉发帖:微软有了一个新模型,叫 Microsoft-Decision-1。
它不写文章,不聊天。你给它一道选择题,它告诉你每个选项有几成把握。
官方说,它在 36 项测试里平均准确率排第一,中位延迟 85 毫秒,比 GPT-6 Sol 快 35 倍。
微软官方博客
https://commandline.microsoft.com/microsoft-decision-1-model-foundry/
@msdev 原帖(北京时间 10 月 10 日 3:14)
https://x.com/msdev/status/2108637164301119691
@msdev 帖子原文:
Introducing Microsoft-Decision-1. Our model for fast decision-making that delivers top performance in latency and quality on structured decision tasks to outperform both LLMs and other decision models.
Microsoft-Decision-1 来了。这是我们做的快速决策模型,在结构化决策任务上,延迟和质量都是顶级,表现超过大语言模型和其他决策模型。

@msdev 官方帖。帖子里的链接卡片图是空白的,我们截图时裁掉了,不影响文字内容
「决策模型」是什么
先打个比方。大模型像一个会写作文的专家,你问什么他都能洋洋洒洒写一篇。
决策模型更像医院的分诊台护士。她不给你写病历长文,只问几句,然后说:去急诊 90%,去内科 8%,去皮肤科 2%。
答案是固定选项里的一个,后面跟着一个把握程度。程序拿到这个数,就能直接往下走:把握高的自动处理,把握低的转人工。
这类活很多:给客服工单分类、判断一个搜索结果相不相关、让 AI 给另一个 AI 的回答打分、决定智能体下一步该继续还是停下。
单次不难,难在量大、链条长。官方算过一笔账:每个决策多等 100 毫秒,连着做 20 个,整个流程就多等 2 秒。
它是怎么做出来的
官方页面写得比较清楚:
• 基座:阿里的开放权重模型 Qwen3.5-9B,微软做了后训练
• 输出:给每个选项一个校准过的概率,一次调用算完,不生成文字
• 题型:是非题、多选题、打分题,也能按评分标准给 AI 的回答和智能体的动作打分
• 输入:纯文本,最长 32K token;输出是 JSON
• 训练数据:公开数据集(过了微软的开放数据审核)加团队自己合成的数据
微软还说,之后会把它换到别的基座上重做,包括微软自家的 MAI 和 OpenAI 的模型。
它有几个明确不做的事:不生成文字,不聊天,不翻译,不做总结,也不解释为什么选这个。
成绩单
官方做了一张对比图,放在纳德拉的帖子里,是个 10 秒的动画。下面是它的最后一帧:

微软官方对比图(纳德拉帖子里的视频末帧)。手机上字太小,下面把数字逐条列出
官方拿了 36 个测试集,共 147,137 道题,说这些都是训练时没见过的。里面有公开的,也有私有的,覆盖路由、排序、长上下文、多语言、推理、安全等。
准确率(36 项平均):
• Microsoft-Decision-1:83.5%
• Quyet-1.0-Large:81.9%(JevBench 榜单第 1)
• Surogate Rune 26B-A4B:79.7%
• GPT-6 Luna Decisions:79.4%
• deck-31B:77.8%
• H2O-Lightning-4B v1.1:77.2%
• Strands-Decider 2B:54.8%(只跑了 36 项里的 23 项)
中位延迟(越低越好):
• Microsoft-Decision-1:85 毫秒(p95 为 125 毫秒)
• H2O-Lightning-4B v1.1:210 毫秒
• Jev 1.13.0:240 毫秒
• GPT-6 Luna Decisions:300 毫秒
• Quyet-1.0-Large:380 毫秒
• Surogate Rune 26B-A4B:380 毫秒
• deck-31B:400 毫秒
• GPT-6 Sol:3.01 秒
官方的算法是:比 Quyet-1.0-Large(亚军)快 4.5 倍,比 GPT-6 Sol 快 35 倍。
校准度(100 分为满分,指「说有 90% 把握时,真的对九成」):
• Quyet-1.0-Large:93.1
• Microsoft-Decision-1:92.2,排第二,差 0.9 分
• Surogate Rune 26B-A4B 和 H2O-Lightning-4B:都是 91.8
• GPT-6 Luna Decisions:89.9;deck-31B:83.5
所以更准确的说法是:准确率第一、速度最快,校准度第二。
看数字时有一点要留意。图注写明,对手的延迟取自 JevBench 的校正后中位数(10 月 7 日),Microsoft-Decision-1 则是微软自己在 Foundry 同区域实测的。两边测法不完全一样。
另外两项自测:
• 稳定性:同一个请求换 8 种方式扰动(改写、换选项描述、调顺序、改字段名、加格式噪音等),决策平均只翻转 1.3%。改写选项描述、颠倒或打乱选项这两类,一次都没翻
• 安全:在 11 个测试集、5,250 个请求上测有害内容、越狱和提示词注入,官方说能拒绝有害请求,同时不误伤正常请求,没给具体数字
微软内部先用了什么
官方列了 4 个内部试用,数字都是微软自己报的:
• Xbox 研究团队:把问卷、Steam 和推特上 1 万多条玩家反馈,分进研究员定好的主题。质量和 GPT-6 Sol 相当,快 14 倍多,便宜 200 倍
• Copilot 团队:给聊天和智能体的回答打质量分。和 GPT5.6 Luna(官方原文写法)相当,快 100 倍
• 值班工程师:出故障时检索日志、工单等资料,比大模型更好也更快,没给数字
• Microsoft Discovery:科研智能体评估上一轮实验、再调整方案。评分一致性是大模型打分的 46 倍,速度 3 倍,自适应重规划整体快近 4 倍
纳德拉的帖子也提到,微软内部在各处测试它。

纳德拉(@satyanadella,约 958 万粉丝)的帖子,北京时间 10 月 10 日 2:37。帖子里的视频预览就是上面那张对比图
他的话(截图里被折叠,这里翻的是能看到的部分):
Introducing Microsoft-Decision-1, our new model for fast decision-making. It delivers top performance on structured decision tasks, outperforming both LLMs and other decision models in latency and quality.
Microsoft-Decision-1 发布,这是我们新的快速决策模型。它在结构化决策任务上表现顶级,延迟和质量都超过大语言模型和其他决策模型。
怎么用,多少钱
• 在哪用:Microsoft Foundry 已上线,目录页标的是正式可用。OpenRouter 官方说「即将」上线
• 价格:输入每百万 token 0.042 美元,输出免费
按这个价格粗算:1 万条各 500 token 的请求,一共 500 万 token,约 0.21 美元。这是我们的算术,不是官方案例。
Foundry 模型页(登录后可试用)
https://ai.azure.com/catalog/models/Microsoft-Decision-1
官方还写了一些限制:不能把它当作信贷、就业、住房、保险、教育、医疗、法律权利这类重大决定的唯一依据,也不能用来监控或给个人画像。
开源吗?官方没说
官方页面只说它基于开放权重的 Qwen3.5-9B,没说 Microsoft-Decision-1 自己的权重会不会放出来。
我们在 Hugging Face 上搜了名字,也没找到。目前能确认的用法只有上面的 Foundry。
这些官方没说
• 最终模型的参数量。只知道基座是 9B 的 Qwen3.5
• 训练方法和数据规模。只知道是后训练,数据来自公开数据集加合成数据
• 36 个测试集的完整名单
• GPT-6 Sol 的具体规格
• 支持哪些语言。测试里有多语言类,但没给分语种的成绩
以上成绩都来自微软自己的测试,我们没有独立复现。
相关链接
• 微软官方博客(Command Line)
https://commandline.microsoft.com/microsoft-decision-1-model-foundry/
• Foundry 模型页
https://ai.azure.com/catalog/models/Microsoft-Decision-1
• @msdev 原帖
https://x.com/msdev/status/2108637164301119691
• 纳德拉的帖子
https://x.com/satyanadella/status/2108627923888754862
• Quyet-1.0-Large(榜单第 1 的对比模型,Hugging Face)
https://huggingface.co/chinhnc/Quyet-1.0-Large
• JevBench 决策模型榜单
https://benchmarkheaven.com/jev-models
• OpenAI Decisions API 文档
https://developers.openai.com/api/docs/guides/decisions