Qwen3.8-27B延续Qwen3.8的技术路线,是一款带视觉编码器的原生多模态Dense模型。模型参数量为270亿,包含64层网络,隐藏维度为5120,并采用Gated DeltaNet与Gated Attention组合的混合结构,同时训练了多步Multi-Token Prediction(MTP)能力。相比传统仅处理文本的27B模型,Qwen3.8-27B原生支持图像和视频理解,可以处理STEM图表、文档、真实世界图像以及小时级长视频等内容。上下文方面,模型原生支持262144 Tokens,通过YaRN技术可以进一步扩展至100万Tokens。这也意味着,27B这一相对容易部署的参数规模已经可以同时覆盖长文档、多模态理解以及长周期Agent任务。此次千问还强化了模型的Agent执行能力,包括自主规划、环境反馈处理以及复杂任务的端到端执行。Qwen3.8-27B默认开启思考模式,同时加入reasoning_effort功能,可以根据任务复杂度调节推理深度。开发者也可以针对单次请求关闭思考模式,并通过preserve_thinking保留历史消息中的推理上下文,在效果和推理成本之间进行更细粒度的控制。在部署生态上,Qwen3.8-27B已经兼容Hugging Face Transformers、vLLM、SGLang、TokenSpeed等主流框架。 02.编程和办公能力大涨部分成绩超过Claude Opus 4.6 Max
此次Qwen3.8-27B一个比较突出的变化,是270亿参数模型的Agent能力继续向更大模型靠近。在SWE-bench Pro测试中,Qwen3.8-27B取得61.7分,高于Qwen3.6-27B的53.5分和Qwen3.7-Plus的57.6分,同时超过Claude Opus 4.6 Max官方成绩53.4分。在千问自建的两项评测中,Qwen3.8-27B同样取得较明显的领先优势。
软件工程基准QwenSWEBench上,Qwen3.8-27B达到79.0分,Qwen3.7-Plus为59.2分,Claude Opus 4.6 Max为63.8分。
面向长周期办公任务的CoWorkBench中,Qwen3.8-27B获得70.7分,超过Qwen3.7-Plus的65.1分以及Claude Opus 4.6 Max的68.2分。
Qwen3.8-27B在Computer Use上的提升同样明显。
OSWorld-Verified测试中,其成绩达到84.3分,Qwen3.6-27B、Qwen3.7-Plus和Claude Opus 4.6 Max分别为63.9分、73.3分和72.7分。
AndroidWorld手机操作测试中,Qwen3.8-27B达到81.9分,高于Qwen3.6-27B的70.3分和Claude Opus 4.6 Max的62.0分,与Qwen3.7-Plus的81.0分相比也有小幅提升。
多模态软件工程SWE-MM测试中,Qwen3.8-27B获得38.6分,Qwen3.7-Plus为30.0分,Claude Opus 4.6 Max为27.1分。此外,Qwen3.8-27B在竞技编程基准LiveCodeBench v6上拿到90.3分,也高于Claude Opus 4.6 Max的88.8分。不过,Qwen3.8-27B并非在所有测试中都领先大模型。例如Terminal Bench 2.1中,Qwen3.8-27B为73.0分,低于Claude Opus 4.6 Max的78.2分;GPQA Diamond中为89.2分,Claude Opus 4.6 Max为91.3分;HLE测试中两者分别为30.8分和40.0分。因此更准确地说,Qwen3.8-27B已经在软件工程、Computer Use、长周期办公等部分Agent任务上达到甚至超过部分前沿闭源模型成绩,但在科学推理和高难综合推理等测试中仍存在差距。27B也是目前开源社区关注度较高的模型尺寸之一。相比此前开放的Qwen3.8-2.4T-A95B,Qwen3.8-27B采用Dense架构,参数规模大幅降低,部署门槛也更低。千问将其定位为面向开发者的高效率模型,希望覆盖本地应用以及对推理成本、部署灵活性要求更高的Agent场景。 03.结语:270亿参数也在卷Agent了