刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness

机器之心 2026-09-10 14:27
刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness图1
机器之心编辑部

太快了。


周四上午,DeepSeek V4.1 Flash 正式在网页、App 和 API 端全面上线。


据官方披露,V4.1 Flash 在性能、响应速度、效率等核心指标上已全面超越 V4 Pro,且采用了新架构并原生支持多模态。


具体来讲,V4.1 Flash 是一款总参数规模达 552B 的 MoE 模型。它采用全新的 Causal-Encoder-Decoder 架构,并对输入与输出采用非对称计算设计:输入侧仅激活 8B 参数,输出侧激活 16B 参数,因此在保持大模型容量的同时,大幅降低了实际推理成本。


除了架构上的调整,V4.1 Flash 还引入了新的预训练方法,并进行了更大规模的强化学习后训练。最终,它在多项基准测试中实现了性能提升,整体智能水平超过大批当前旗舰模型,在性能、效率与成本之间取得了更好的平衡。



从下图官方展示的基准结果来看,V4.1 Flash 在软件工程、网络安全环境和自动化任务等测试中表现较强


在 DeepSWE v1.1、CyberGym 和 Automation-Bench 上,它均取得图中最高分,其中 DeepSWE 仅以 0.2 分小幅领先 Opus 5;但在 Terminal-Bench 3.0 上,V4.1 Flash 的 30.0 分明显低于 Opus 5 的 43.3 分和 GPT-5.6 Sol 的 34.4 分。因此,整体来看,这组结果说明 V4.1 Flash 在部分 Coding 和 Agent 类任务上具备较强竞争力,但并非所有基准都占优。


刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness图2


下图为更全面的基准测试结果,可以看到,在 Coding、软件工程和 Agent 任务上明显提升之外,V4.1 Flash 在 GPQA Diamond、Terminal-Bench 3.0/4.0、ProgramBench 等项目上仍跟 GPT-5.6 Sol 或 Claude Opus 5 等顶级闭源模型存在差距。


刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness图3


DeepSeek 对于这个 4.1 Flash 是如此有信心,以至于早早发了公告要把 V4 Pro 砍掉。


V4.1 Flash 这次更新的另一条主线是把推理成本进一步压下来。分析它的「非对称」结构:


刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness图4


Agent 类负载的 token 结构极度倾斜,经常是几万 token 的上下文、工具返回、代码仓库前缀,换几十到几百 token 的输出。V4.1 的输入 / 输出比面向这样类型的任务改进,大幅度优化了总成本。


V4.1 Flash 针对缓存进一步做了压缩。按照官方数据,新一代模型的 KV Cache 大幅缩小,相比上一代对 HBM 的需求降至 1/4,对 SSD 的需求降至 1/8(已知 V4 一代的 KV Cache 已经只有 V3.2 的约 7% 了)。这一代 KV Cache 需求的质变,让同样的任务需要占用的高速显存和存储资源更少,也让长上下文、多轮调用这类任务的运行成本进一步下降。


刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness图5


值得一提的是,一个模型 API 会关心 SSD 需求,说明它的缓存分层里本来就把 SSD 当一级存储用。这是 DeepSeek 服务栈的一贯路线。


现在,每步要读的 KV 已经小到不再主导显存带宽,权重读取才是瓶颈,这才是社区测出 400 token/s、「速度不随上下文长度衰减」的原因。


9 月 14 日中午 12 时之后, V4 Pro 的 API 将下线,所有指向 V4 Pro 的 API 请求将被自动路由至 V4.1 Flash 处理,并按 Flash 系列降价后的单价计费:空闲时段输入缓存命中单价 0.02 元、输入缓存未命中单价 1 元,输出单价 4 元;高峰时段价格为空闲时段价格的 2 倍。


刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness图6


刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness图7


同时广大 C 端用户也获得了一次重大升级:在网页和 App 端,原来的快速、专家、识图三个模式已经全部合并,接入的都是 V4.1 Flash,现在可以用最先进的大模型开深度思考 + 搜索了。


刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness图8


另外,一些第三方的 Agent 工具、AI 平台也同步上线了新模型,比如 Workbuddy。


刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness图9


此前,OpenDesign 已经对 V4.1 Flash 进行了基准测试,至少在 OpenDesign Arena 这个基准上,其已经达到了世界第二,超过了 Fable 5.1,仅次于 Astra。


刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness图10


与新模型同步的还有 DeepSeek Harness v0.1.5,Web 界面支持上传包括图片、PDF 等类型的文件。


刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness图11


新版本与 DeepSeek V4.1 Flash 模型训练深度结合,模型在 DSH 不同配置中都进行了专项训练和优化。新版也为插件作者提供了更多标准化的 UI 扩展入口,新增了文件上传、侧边栏文件预览等功能,优化了 UI 的性能与交互,并增加了与模型研究前沿深度结合的实验功能。


新模型,大家用起来感觉怎么样?欢迎在评论区讨论。


刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness图12


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AR
more
Grok Bot才是Jarvis
Gemini Spark接管相册:Google的AI“微创新”能否破解消费端落地困局?
AR眼镜:热潮之下存分歧
smart精灵#1之后,双门小钢炮“精灵2号”街头实测,续航近400km引关注
Target旗下Shipt入局AI购物助手,即时配送赛道“卷”向智能化
【IC Coder真实案例】约1小时跑通五阶段,AI自主操控Quartus完成卫星SDR下变频
Warhorse创始人回怼AI争议:用“人造垃圾”梗图激化玩家对立,是个性还是傲慢?
NVIDIA DGX Spark 黑客松即将报满,这场 Agent Skills 免费训练营别错过!
荣耀Magic9系列细节再曝,内置风扇+双2亿ARRI联名影像
解决20年数学难题!微软开源Argus用证据驱动1548小时自动研究
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号