更多精彩,请点击上方蓝字关注RVEI

9 月 9 日,达摩院玄铁正式发布端侧 AI 解决方案。这是 RISC-V 架构开放、灵活特性在端侧 AI 时代的又一次生动实践。
该方案由 AI 定制调度核、Titan 高性能向量引擎、配套算子库与编译工具链三部分构成,为 NPU 厂商提供成熟、灵活、可配的可编程底座,让厂商把研发资源集中到 Tensor Engine 与存储系统等自有差异化能力上,加速端侧 AI 在穿戴设备、智能家居、智能安防、边缘计算、AI PC、智能座舱、具身智能等场景的落地。

端侧推理进入“组合爆炸”时代
NPU 面临全新考验

三大板块接入
为端侧 NPU 打造可编程底座
一颗完整的 NPU,是控制、计算与数据供给三层协同的系统:Tensor Engine 提供峰值算力,但端到端推理时间由三层共同决定。对 NPU 厂商而言,真正的差异化在于 Tensor Engine 与存储系统;而调度、通用向量计算与配套软件,是需要长期工程积累的公共底座,自建周期长、验证成本高,往往成为产品上市节奏的瓶颈。
针对上述挑战,玄铁团队推出端侧 AI 方案,为端侧 NPU 打造可编程底座。通过提供经过验证的调度、向量与软件底座;厂商可直接接入,激活 Tensor Engine 与存储系统,各展所长。


AI 定制调度核:把可编程控制放进 NPU
基于玄铁 C 系列处理器为 NPU 调度场景深度定制。指令预取与 ITCM/DTCM 让控制程序与描述符常驻,访问延迟确定,命令生成不断供;循环分支控制、Tile/Shape/地址参数计算、宏命令封装与分发形成完整控制闭环;custom0–custom3 自定义指令直接转发,最多支持 32 个协处理器,命令语义可用寄存器操作数直接表达。模型变化的时候,改程序就行,不用改状态机。
Titan 高性能向量引擎:灵活计算、可整体选配
面向 AI、向量宽度 VLEN 可配 512 / 1024 / 4096 bit,达业界最宽档位;在 RVV 1.0 标准之上叠加 66 条玄铁 Vector 扩展指令:
特殊函数指令 9 条:直接支撑 Softmax 与激活
类型转换指令 9 条:支撑量化与反量化
二维归约指令 24 条、点积与低精度整数指令 22 条:针对大模型场景优化

177 个算子与完备工具链:交付可运行、可调、可迭代的软件栈
算子库覆盖 12 个类别、177 个算子,从数学运算、张量操作、卷积融合到量化与类型转换,贯通完整推理链路,并为客户自定义算子提供统一基础;GCC / LLVM 编译工具链、Runtime、调试器与性能分析工具随方案一同交付。
算子库、编译工具链与硬件指令三层对齐,厂商选择不同向量宽度或裁剪能力时,改动收敛在编译期——裁剪不等于重新维护一套软件。
五个维度灵活可配
按场景选配,按需求裁剪
为适配端侧多样化的场景与需求,助力客户围绕自身目标场景,定义一颗性能、面积与功耗精准匹配且更具竞争力的芯片;该方案在五个维度提供灵活的可配可裁能力。

来源:玄铁
