AMD发布FastFlowLM 1.0:NPU本地大模型推理新引擎,能效提升超十倍

科技区角 2026-08-12 18:02

【区角快讯】
当我们在讨论本地AI部署时,往往陷入对独立显卡的过度依赖,而忽略了处理器内部那颗“沉睡”的专用AI核心。8月12日,AMD正式推出FastFlowLM 1.0版本,并将其整合进ROCm软件生态体系,这标志着锐龙AI NPU终于迎来了专属的高效运行时环境。早在7月17日,该项目的开发团队便已正式加入AMD,此次发布可谓水到渠成。

这款专为XDNA2架构NPU打造的推理引擎,体量极其轻盈。整个软件包仅占用17MB存储空间,安装过程耗时约20秒即可完成。对于长期闲置的锐龙AI NPU而言,FastFlowLM的出现无疑是一次彻底的唤醒。其使用逻辑与广受欢迎的Ollama高度相似,用户只需输入“flm run llama3.2:1b”即可拉取模型并开启对话;若需构建服务,执行“flm serve”命令便能启动一个兼容OpenAI API的本地服务器,极大地降低了部署门槛。

在性能表现上,FastFlowLM坚持纯NPU运算路线,CPU与核显均不参与推理任务。官方数据显示,其能效比相比同类方案高出十倍以上。值得注意的是,在Qwen3-4B-Thinking-2507等模型上,上下文窗口可扩展至惊人的256k tokens,足以应对超长文档处理需求。

1.0版本还带来了几项关键更新:新增了对SmolVLA视觉-语言-动作模型的支持,从而将机器人技术负载纳入版图;优化了flm bench基准测试工具,默认每个上下文长度仅运行2次迭代,以缩短测试时间;同时修复了qwen3vl-it模型在处理双图像请求时无法识别图像的已知缺陷。

从底层技术看,NPU加速的二进制内核经由AMD IRON和AIE-MLIR工具链手工调优,确保了极致性能。该项目采用MIT许可证,允许包括商业用途在内的免费使用。目前,Windows、Debian 13、Ubuntu 24.04/25.10/26.04及通用Linux x86_64平台的二进制包均已上线GitHub,开发者可随时获取代码与预编译文件。这一举措不仅丰富了AMD的AI生态,更为轻薄本用户提供了一条低功耗、高效率的本地AI新路径。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AMD 大模型
more
AI大厂转向效率优先,大模型商业化分配生变
小白玩转大模型开发(1):从环境搭建到API调用
黄仁勋入驻X,发文力挺开源大模型
十万亿参数大模型逼近临界点:算力军备竞赛与安全悖论的双重变奏
QQ上半年封禁涉诈账号近540万,大模型成治理新利器
我们用Qwen 3.8-Max做了一个AI大模型宇宙:效果竟然胜过GPT5.6!
中国唯一具身智能大模型重点实验室,银河通用牵头获批!
小米神秘旗舰入网,玄戒芯片+澎湃OS+自研AI大模型?
新架构・芯产品 | 智维创芯:AI赋能EDA芯片验证大模型革新
当大模型开始按Token计价,SSD正在成为AI推理核心
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号