AMD发布FastFlowLM 1.0:NPU本地大模型推理新引擎,能效提升超十倍

科技区角 2026-08-12 18:02

【区角快讯】
当我们在讨论本地AI部署时,往往陷入对独立显卡的过度依赖,而忽略了处理器内部那颗“沉睡”的专用AI核心。8月12日,AMD正式推出FastFlowLM 1.0版本,并将其整合进ROCm软件生态体系,这标志着锐龙AI NPU终于迎来了专属的高效运行时环境。早在7月17日,该项目的开发团队便已正式加入AMD,此次发布可谓水到渠成。

这款专为XDNA2架构NPU打造的推理引擎,体量极其轻盈。整个软件包仅占用17MB存储空间,安装过程耗时约20秒即可完成。对于长期闲置的锐龙AI NPU而言,FastFlowLM的出现无疑是一次彻底的唤醒。其使用逻辑与广受欢迎的Ollama高度相似,用户只需输入“flm run llama3.2:1b”即可拉取模型并开启对话;若需构建服务,执行“flm serve”命令便能启动一个兼容OpenAI API的本地服务器,极大地降低了部署门槛。

在性能表现上,FastFlowLM坚持纯NPU运算路线,CPU与核显均不参与推理任务。官方数据显示,其能效比相比同类方案高出十倍以上。值得注意的是,在Qwen3-4B-Thinking-2507等模型上,上下文窗口可扩展至惊人的256k tokens,足以应对超长文档处理需求。

1.0版本还带来了几项关键更新:新增了对SmolVLA视觉-语言-动作模型的支持,从而将机器人技术负载纳入版图;优化了flm bench基准测试工具,默认每个上下文长度仅运行2次迭代,以缩短测试时间;同时修复了qwen3vl-it模型在处理双图像请求时无法识别图像的已知缺陷。

从底层技术看,NPU加速的二进制内核经由AMD IRON和AIE-MLIR工具链手工调优,确保了极致性能。该项目采用MIT许可证,允许包括商业用途在内的免费使用。目前,Windows、Debian 13、Ubuntu 24.04/25.10/26.04及通用Linux x86_64平台的二进制包均已上线GitHub,开发者可随时获取代码与预编译文件。这一举措不仅丰富了AMD的AI生态,更为轻薄本用户提供了一条低功耗、高效率的本地AI新路径。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AMD 大模型
more
AMD驱动代码泄露天机:GDDR7显存适配落地,RDNA 5架构拼图渐全
PS5残次芯片变身Linux游戏主机,FSR 4优化让AMD矿卡性能翻倍
AMD锐龙AI Max PRO 400系列发布:端侧算力重构智能体工作流
AMD 全球副总裁、中国研发中心总经理 吉隆伟-第十二届张江高科·芯谋研究集成电路产业领袖大会 分论坛精彩分享
伦敦焊工打造“蒸汽朋克”AMD主机,铜管水路致敬工业时代
中直机关笔记本采购全面转向国产芯,Intel与AMD彻底出局
天钡预热NEX495S迷你主机,AMD锐龙AI Max+ PRO 495平台生态加速落地
AMD被指低价倾销军用级芯片,出口管制漏洞引发争议
AMD第六代EPYC引入硬件级SMT防护,Linux内核启动适配
铭凡HM80遭控拒推安全补丁,AMD修复已到位厂商却“装睡”
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号