【区角快讯】
当我们在讨论本地AI部署时,往往陷入对独立显卡的过度依赖,而忽略了处理器内部那颗“沉睡”的专用AI核心。8月12日,AMD正式推出FastFlowLM 1.0版本,并将其整合进ROCm软件生态体系,这标志着锐龙AI NPU终于迎来了专属的高效运行时环境。早在7月17日,该项目的开发团队便已正式加入AMD,此次发布可谓水到渠成。
这款专为XDNA2架构NPU打造的推理引擎,体量极其轻盈。整个软件包仅占用17MB存储空间,安装过程耗时约20秒即可完成。对于长期闲置的锐龙AI NPU而言,FastFlowLM的出现无疑是一次彻底的唤醒。其使用逻辑与广受欢迎的Ollama高度相似,用户只需输入“flm run llama3.2:1b”即可拉取模型并开启对话;若需构建服务,执行“flm serve”命令便能启动一个兼容OpenAI API的本地服务器,极大地降低了部署门槛。
在性能表现上,FastFlowLM坚持纯NPU运算路线,CPU与核显均不参与推理任务。官方数据显示,其能效比相比同类方案高出十倍以上。值得注意的是,在Qwen3-4B-Thinking-2507等模型上,上下文窗口可扩展至惊人的256k tokens,足以应对超长文档处理需求。
1.0版本还带来了几项关键更新:新增了对SmolVLA视觉-语言-动作模型的支持,从而将机器人技术负载纳入版图;优化了flm bench基准测试工具,默认每个上下文长度仅运行2次迭代,以缩短测试时间;同时修复了qwen3vl-it模型在处理双图像请求时无法识别图像的已知缺陷。
从底层技术看,NPU加速的二进制内核经由AMD IRON和AIE-MLIR工具链手工调优,确保了极致性能。该项目采用MIT许可证,允许包括商业用途在内的免费使用。目前,Windows、Debian 13、Ubuntu 24.04/25.10/26.04及通用Linux x86_64平台的二进制包均已上线GitHub,开发者可随时获取代码与预编译文件。这一举措不仅丰富了AMD的AI生态,更为轻薄本用户提供了一条低功耗、高效率的本地AI新路径。
AMD发布FastFlowLM 1.0:NPU本地大模型推理新引擎,能效提升超十倍
科技区角
2026-08-12 18:02
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。