
智东西8月13日报道,刚刚,阿里千问大模型团队开放Qwen3.8-2.4T-A95B模型权重!
Qwen3.8-Max是基于Qwen3.8-2.4T-A95B的官方版本,于,拥有更多功能,例如视觉输入功能、无需思考即可使用、默认支持1百万上下文长度处理、内置官方工具等。

▲Qwen3.8-2.4T-A95B开源主页(图源:Hugging Face)
魔搭社区模型下载地址:
https://modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B
这也是阿里千问首次将Max级别的旗舰模型对外开放权重。根据魔搭社区的官方预告,更小杯Qwen3.8-27B已在路上。
Qwen3.8-2.4T-A95B的模型总参数为2.4万亿,每个Token激活950亿参数,原生支持262144 Token上下文,可扩展至101万Token。该模型采用Qwen3.5的底层架构,在编程、办公、科研工作、长周期智能体任务上实现性能提升。
Qwen3.8-2.4T-A95B模型可以通过SGLang、vLLM和TokenSpeed推理引擎部署,正式部署时需要使用各框架针对Qwen3.8的最新Recipe,并根据权重精度、GPU型号与数量选择并行策略。
Qwen3.8模型默认以思考模式运行,在生成最终回答前,模型会先生成由<think>\n...</think>\n\n标记的思考内容。Qwen3.8-2.4T-A95B不支持关闭思考模式。

▲Unsloth AI压缩Qwen3.8-2.4T-A95B(图源:X)
预告Qwen3.8发布时,千问称该模型“可能是除了Fable 5外最强大的模型”。
基准测试结果显示,在论文复现基准PaperBench中,Qwen3.8-Max取得93.0分,高于GPT-5.6 Sol、Fable 5和Claude Opus 4.8。在评估电脑操作能力的OSWorld-Verified中,Qwen3.8-Max以86.1分位居参评模型首位;在参数化CAD基准中,其91.5分同样超过Fable 5、GPT-5.6 Sol和Gemini 3.1 Pro。
不过,Qwen3.8-Max尚未在所有测试中取得领先。
在TerminalBench 2.1中,其成绩为86.6分,略低于GPT-5.6 Sol的88.8分;在SWE-bench Pro中,Qwen3.8-Max获得67.7分,落后于Fable 5的80.0分和Claude Opus 4.8的69.2分;在长视频基准VideoMME v2中,其68.3分也低于GPT-5.6 Sol的71.1分。

▲Qwen3.8-Max基准测试结果(图源:阿里)
Qwen3.8的重点是模型能否脱离人工持续陪伴,自己把一个跨度数小时、数天甚至数周的任务做完。
千问团队让Qwen3.8-Max连续自主编程约16天、独立复现并改进一篇研究论文、参加真实算法竞赛,还让它在超过2000轮交互中经营一家虚拟电商企业。
在连续自主编程16天的任务中,Qwen3.8-Max自主构建了自进化Harness,并持续完成社区需求收集、issue派发、代码生成、验证与自我修复。

▲Qwen3.8-Max执行自主编程任务(图源:阿里)

▲API价格对比表(智东西制图)




9月20-21日,智东西主办的2026全球AI芯片峰会将在上海举行,设有开幕式,大模型AI芯片、Agent推理芯片、具身智能芯片3场高峰论坛,以及Token工厂异构混训混推、超节点、AI芯片架构创新、新型存储器、大模型KV Cache5场技术研讨会。



