阿里开源两款4B小模型:手机电脑都能用,比GPT-4.1-nano还强

智东西 2025-08-07 12:25

资讯配图资讯配图

擅长处理长文本,更能听懂你的话。
作者 |  王涵
编辑 |  漠影
智东西8月7日报道,今天上午,通义千问Qwen宣布推出两款更小尺寸的新模型:Qwen3-4B-Instruct-2507Qwen3-4B-Thinking-2507
其中,Qwen3-4B-Thinking-2507的推理能力可媲美中尺寸模型;Qwen3-4B-Instruct-2507在知识、推理、编程、对齐以及agent能力上全面超越了闭源的小尺寸模型GPT-4.1-nano。
此次发布的“2507”版本的Qwen3-4B模型对手机等端侧硬件部署较为友好,目前已在魔搭社区Hugging Face正式开源
资讯配图

▲已在Hugging Face开源(来源:Hugging Face)

魔搭社区:
https://modelscope.cn/collections/Qwen3-9743180bdc6b48
Hugging Face:
https://huggingface.co/Qwen

01.
性能比肩中尺寸模型
agent能力超越GPT-4.1-nano


Qwen3-4B-Instruct-2507与Qwen3-4B-Thinking-2507的上下文理解能力都扩展到了256K,可处理长文本,能支持更复杂的文档分析、长篇内容生成以及跨段落推理等场景。
性能方面,Qwen3-4B-Thinking-2507在复杂问题推理能力、数学能力、代码能力以及多轮函数调用能力上的表现大幅领先Qwen3同尺寸小模型。在Arena-Hard v2基准测试上,Qwen3-4B-Instruct-2507取得43.4分的成绩,更胜一筹。
资讯配图
在非推理领域,Qwen3-4B-Instruct-2507在知识、推理、编程、对齐以及agengt能力上全面超越了闭源的小尺寸模型GPT-4.1-nano,且与中等规模的Qwen3-30B-A3B(non-thinking)性能接近
该模型覆盖了更多语言的长尾知识,在主观和开放性任务中与人类偏好的对齐性增强,能够提供更符合需求的答复。
资讯配图
在推理领域,Qwen3-4B-Thinking-2507表现突出,推理能力可媲美中等模型Qwen3-30B-Thinking。特别是在聚焦数学能力的AIME25测评中,以4B参数量取得了81.3分的成绩。
其通用能力也显著提升,Agent分数超越了更大尺寸的Qwen3-30B-Thinking模型。
资讯配图

02.
结语:小尺寸模型加速AI端侧落地


通义千问此次推出的Qwen3-4B系列新模型,以更小的尺寸实现了性能上的优化,在通用能力上展现出超越同级别模型甚至逼近中大规模模型的实力,并且,小尺寸模型展现出了对端侧硬件的更高的友好度。
无论是腾讯、阿里还是OpenAI等AI老玩家,都开始推出小尺寸模型,并且在agent能力上下功夫。这在一定程度上反映出目前主流市场认为小型语言模型(SLM)对Agentic AI的发展具有重要价值。
这类高性能小模型的开源与普及,将有望加速AI技术在端侧设备的渗透,进而推动更多轻量化、场景化的智能应用落地。
资讯配图
(本文系网易新闻•网易号特色内容激励计划签约账号【智东西】原创内容,未经账号授权,禁止随意转载。)

资讯配图

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
开源 电脑
more
刚刚,智谱开源千亿参数视觉大模型,能区分麦当劳肯德基炸鸡,看图猜地点击败99%人类
Qwen紧追OpenAI开源4B端侧大模型,AIME25得分超越Claude 4 Opus
是「福尔摩斯」,也是「列文虎克」,智谱把OpenAI藏着掖着的视觉推理能力开源了
RSS'25 | CMU开源基于人类操作数据预训练的跨具身学习框架!
腾讯AI Lab开源可复现的深度研究智能体,最大限度降低外部依赖
DeepMind 没舍得开源的 Genie 3,被昆仑万维放出来了
宝马设计主管回应加入小米,英伟达声明芯片不存在后门,iOS 26增提醒回电功能,Grok2或下周开源,这就是今天的其他大新闻!
站在DeepSeek肩膀上,小红书开源首款多模态模型:看懂表情包与数学题,一手实测
[8.19 杭州]诚邀参会:芯片测试、LabVIEW+全新开源大模型、前沿射频测试等
全面优于π0 !全球首个端到端全身控制VLA模型G-0全面开源,直击七大“关键问题”
Copyright © 2025 成都科技区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号