微软发布 Microsoft-Decision-1:专做选择题的小模型,85 毫秒给答案

机智流 2026-10-10 07:23
微软发布 Microsoft-Decision-1:专做选择题的小模型,85 毫秒给答案图1

封面图:微软 Command Line 博客的官方配图,已裁成横版

北京时间 10 月 10 日凌晨 2 点 37 分,微软 CEO 纳德拉发帖:微软有了一个新模型,叫 Microsoft-Decision-1。

它不写文章,不聊天。你给它一道选择题,它告诉你每个选项有几成把握。

官方说,它在 36 项测试里平均准确率排第一,中位延迟 85 毫秒,比 GPT-6 Sol 快 35 倍。

微软官方博客

https://commandline.microsoft.com/microsoft-decision-1-model-foundry/

@msdev 原帖(北京时间 10 月 10 日 3:14)

https://x.com/msdev/status/2108637164301119691

@msdev 帖子原文:

Introducing Microsoft-Decision-1. Our model for fast decision-making that delivers top performance in latency and quality on structured decision tasks to outperform both LLMs and other decision models.

Microsoft-Decision-1 来了。这是我们做的快速决策模型,在结构化决策任务上,延迟和质量都是顶级,表现超过大语言模型和其他决策模型。

微软发布 Microsoft-Decision-1:专做选择题的小模型,85 毫秒给答案图2

@msdev 官方帖。帖子里的链接卡片图是空白的,我们截图时裁掉了,不影响文字内容

「决策模型」是什么

先打个比方。大模型像一个会写作文的专家,你问什么他都能洋洋洒洒写一篇。

决策模型更像医院的分诊台护士。她不给你写病历长文,只问几句,然后说:去急诊 90%,去内科 8%,去皮肤科 2%。

答案是固定选项里的一个,后面跟着一个把握程度。程序拿到这个数,就能直接往下走:把握高的自动处理,把握低的转人工。

这类活很多:给客服工单分类、判断一个搜索结果相不相关、让 AI 给另一个 AI 的回答打分、决定智能体下一步该继续还是停下。

单次不难,难在量大、链条长。官方算过一笔账:每个决策多等 100 毫秒,连着做 20 个,整个流程就多等 2 秒。

它是怎么做出来的

官方页面写得比较清楚:

• 基座:阿里的开放权重模型 Qwen3.5-9B,微软做了后训练

• 输出:给每个选项一个校准过的概率,一次调用算完,不生成文字

• 题型:是非题、多选题、打分题,也能按评分标准给 AI 的回答和智能体的动作打分

• 输入:纯文本,最长 32K token;输出是 JSON

• 训练数据:公开数据集(过了微软的开放数据审核)加团队自己合成的数据

微软还说,之后会把它换到别的基座上重做,包括微软自家的 MAI 和 OpenAI 的模型。

它有几个明确不做的事:不生成文字,不聊天,不翻译,不做总结,也不解释为什么选这个。

成绩单

官方做了一张对比图,放在纳德拉的帖子里,是个 10 秒的动画。下面是它的最后一帧:

微软发布 Microsoft-Decision-1:专做选择题的小模型,85 毫秒给答案图3

微软官方对比图(纳德拉帖子里的视频末帧)。手机上字太小,下面把数字逐条列出

官方拿了 36 个测试集,共 147,137 道题,说这些都是训练时没见过的。里面有公开的,也有私有的,覆盖路由、排序、长上下文、多语言、推理、安全等。

准确率(36 项平均):

• Microsoft-Decision-1:83.5%

• Quyet-1.0-Large:81.9%(JevBench 榜单第 1)

• Surogate Rune 26B-A4B:79.7%

• GPT-6 Luna Decisions:79.4%

• deck-31B:77.8%

• H2O-Lightning-4B v1.1:77.2%

• Strands-Decider 2B:54.8%(只跑了 36 项里的 23 项)

中位延迟(越低越好):

• Microsoft-Decision-1:85 毫秒(p95 为 125 毫秒)

• H2O-Lightning-4B v1.1:210 毫秒

• Jev 1.13.0:240 毫秒

• GPT-6 Luna Decisions:300 毫秒

• Quyet-1.0-Large:380 毫秒

• Surogate Rune 26B-A4B:380 毫秒

• deck-31B:400 毫秒

• GPT-6 Sol:3.01 秒

官方的算法是:比 Quyet-1.0-Large(亚军)快 4.5 倍,比 GPT-6 Sol 快 35 倍。

校准度(100 分为满分,指「说有 90% 把握时,真的对九成」):

• Quyet-1.0-Large:93.1

• Microsoft-Decision-1:92.2,排第二,差 0.9 分

• Surogate Rune 26B-A4B 和 H2O-Lightning-4B:都是 91.8

• GPT-6 Luna Decisions:89.9;deck-31B:83.5

所以更准确的说法是:准确率第一、速度最快,校准度第二。

看数字时有一点要留意。图注写明,对手的延迟取自 JevBench 的校正后中位数(10 月 7 日),Microsoft-Decision-1 则是微软自己在 Foundry 同区域实测的。两边测法不完全一样。

另外两项自测:

• 稳定性:同一个请求换 8 种方式扰动(改写、换选项描述、调顺序、改字段名、加格式噪音等),决策平均只翻转 1.3%。改写选项描述、颠倒或打乱选项这两类,一次都没翻

• 安全:在 11 个测试集、5,250 个请求上测有害内容、越狱和提示词注入,官方说能拒绝有害请求,同时不误伤正常请求,没给具体数字

微软内部先用了什么

官方列了 4 个内部试用,数字都是微软自己报的:

• Xbox 研究团队:把问卷、Steam 和推特上 1 万多条玩家反馈,分进研究员定好的主题。质量和 GPT-6 Sol 相当,快 14 倍多,便宜 200 倍

• Copilot 团队:给聊天和智能体的回答打质量分。和 GPT5.6 Luna(官方原文写法)相当,快 100 倍

• 值班工程师:出故障时检索日志、工单等资料,比大模型更好也更快,没给数字

• Microsoft Discovery:科研智能体评估上一轮实验、再调整方案。评分一致性是大模型打分的 46 倍,速度 3 倍,自适应重规划整体快近 4 倍

纳德拉的帖子也提到,微软内部在各处测试它。

微软发布 Microsoft-Decision-1:专做选择题的小模型,85 毫秒给答案图4

纳德拉(@satyanadella,约 958 万粉丝)的帖子,北京时间 10 月 10 日 2:37。帖子里的视频预览就是上面那张对比图

他的话(截图里被折叠,这里翻的是能看到的部分):

Introducing Microsoft-Decision-1, our new model for fast decision-making. It delivers top performance on structured decision tasks, outperforming both LLMs and other decision models in latency and quality.

Microsoft-Decision-1 发布,这是我们新的快速决策模型。它在结构化决策任务上表现顶级,延迟和质量都超过大语言模型和其他决策模型。

怎么用,多少钱

• 在哪用:Microsoft Foundry 已上线,目录页标的是正式可用。OpenRouter 官方说「即将」上线

• 价格:输入每百万 token 0.042 美元,输出免费

按这个价格粗算:1 万条各 500 token 的请求,一共 500 万 token,约 0.21 美元。这是我们的算术,不是官方案例。

Foundry 模型页(登录后可试用)

https://ai.azure.com/catalog/models/Microsoft-Decision-1

官方还写了一些限制:不能把它当作信贷、就业、住房、保险、教育、医疗、法律权利这类重大决定的唯一依据,也不能用来监控或给个人画像。

开源吗?官方没说

官方页面只说它基于开放权重的 Qwen3.5-9B,没说 Microsoft-Decision-1 自己的权重会不会放出来。

我们在 Hugging Face 上搜了名字,也没找到。目前能确认的用法只有上面的 Foundry。

这些官方没说

• 最终模型的参数量。只知道基座是 9B 的 Qwen3.5

• 训练方法和数据规模。只知道是后训练,数据来自公开数据集加合成数据

• 36 个测试集的完整名单

• GPT-6 Sol 的具体规格

• 支持哪些语言。测试里有多语言类,但没给分语种的成绩

以上成绩都来自微软自己的测试,我们没有独立复现。

相关链接

• 微软官方博客(Command Line)

https://commandline.microsoft.com/microsoft-decision-1-model-foundry/

• Foundry 模型页

https://ai.azure.com/catalog/models/Microsoft-Decision-1

• @msdev 原帖

https://x.com/msdev/status/2108637164301119691

• 纳德拉的帖子

https://x.com/satyanadella/status/2108627923888754862

• Quyet-1.0-Large(榜单第 1 的对比模型,Hugging Face)

https://huggingface.co/chinhnc/Quyet-1.0-Large

• JevBench 决策模型榜单

https://benchmarkheaven.com/jev-models

• OpenAI Decisions API 文档

https://developers.openai.com/api/docs/guides/decisions

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
IC
more
英飞凌给伊顿供 SiC打造MVSST固态变压器,一路改到电网!
菱奇半导体合封SiC反激电源方案解析
Anthropic 推出 Cyber Mission:Claude 帮守关键基础设施
微软发布 Microsoft-Decision-1:专做选择题的小模型,85 毫秒给答案
Anthropic发布Haiku 5.5:成本降七成,完善新一代模型矩阵
演讲预告 | 先进制程分岔路口,国产EDA如何破局3DIC Signoff?行芯ICCC 2026揭晓
Anthropic加码初创生态:免费赠予Claude团队版席位,意在构建“模型之上”的应用壁垒
小米18 Ultra因定价过高被砍,LOFIC大底潜望成绝唱?
PCIM展台回顾 | 解锁SiC MOSFET电机驱动新方案——Crowbar短路保护与电机集成的紧凑设计
2026 Omdia ICT 产业研讨会 | 未来五年LEO卫星宽带将成为市场主要增长动力
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号