玄铁端侧 AI 解决方案发布,为端侧 NPU 打造可编程底座

RVEI工委会 2026-09-09 19:23

玄铁端侧 AI 解决方案发布,为端侧 NPU 打造可编程底座图1 更多精彩,请点击上方蓝字关注RVEI

玄铁端侧 AI 解决方案发布,为端侧 NPU 打造可编程底座图2


9 月 9 日,达摩院玄铁正式发布端侧 AI 解决方案。这是 RISC-V 架构开放、灵活特性在端侧 AI 时代的又一次生动实践。


该方案由 AI 定制调度核、Titan 高性能向量引擎、配套算子库与编译工具链三部分构成,为 NPU 厂商提供成熟、灵活、可配的可编程底座,让厂商把研发资源集中到 Tensor Engine 与存储系统等自有差异化能力上,加速端侧 AI 在穿戴设备、智能家居、智能安防、边缘计算、AI PC、智能座舱、具身智能等场景的落地。

玄铁端侧 AI 解决方案发布,为端侧 NPU 打造可编程底座图3

端侧推理进入“组合爆炸”时代

NPU 面临全新考验

推理正在从云端走向端侧。低时延、数据隐私、离线运行与传输成本,共同推动 AI 能力向设备侧下沉。但这个“端”并非单一形态——从穿戴设备、智能家居、智能安防,到边缘计算、AI PC、智能座舱、具身智能,功耗与算力从 mW 级到车规级,跨越多个数量级。
与此同时,端侧算法日益多样:CNN 视觉之外,LLM、VLM、语音识别、语音合成、扩散生成、全模态模型接踵而至。算子构成差异极大——Softmax、归一化、RoPE、量化与数据重排的比重明显上升,且每年都在变化。场景与算法相互叉乘,同一颗端侧 NPU 要面对的组合正在快速放大。
玄铁端侧 AI 解决方案发布,为端侧 NPU 打造可编程底座图4

三大板块接入

为端侧 NPU 打造可编程底座

一颗完整的 NPU,是控制、计算与数据供给三层协同的系统:Tensor Engine 提供峰值算力,但端到端推理时间由三层共同决定。对 NPU 厂商而言,真正的差异化在于 Tensor Engine 与存储系统;而调度、通用向量计算与配套软件,是需要长期工程积累的公共底座,自建周期长、验证成本高,往往成为产品上市节奏的瓶颈。

针对上述挑战,玄铁团队推出端侧 AI 方案,为端侧 NPU 打造可编程底座。通过提供经过验证的调度、向量与软件底座;厂商可直接接入,激活 Tensor Engine 与存储系统,各展所长。

玄铁端侧 AI 解决方案发布,为端侧 NPU 打造可编程底座图5
玄铁端侧 AI 解决方案发布,为端侧 NPU 打造可编程底座图6


AI 定制调度核:把可编程控制放进 NPU

基于玄铁 C 系列处理器为 NPU 调度场景深度定制。指令预取与 ITCM/DTCM 让控制程序与描述符常驻,访问延迟确定,命令生成不断供;循环分支控制、Tile/Shape/地址参数计算、宏命令封装与分发形成完整控制闭环;custom0–custom3 自定义指令直接转发,最多支持 32 个协处理器,命令语义可用寄存器操作数直接表达。模型变化的时候,改程序就行,不用改状态机。

    Titan 高性能向量引擎:灵活计算、可整体选配

    面向 AI、向量宽度 VLEN 可配 512 / 1024 / 4096 bit,达业界最宽档位;在 RVV 1.0 标准之上叠加 66 条玄铁 Vector 扩展指令:

    • 特殊函数指令 9 条:直接支撑 Softmax 与激活

    • 类型转换指令 9 条:支撑量化与反量化

    • 二维归约指令 24 条、点积与低精度整数指令 22 条:针对大模型场景优化

    玄铁端侧 AI 解决方案发布,为端侧 NPU 打造可编程底座图7
    理论建模数据显示(Qwen3-1.7B、FP16、序列长度 4096 条件),向量宽度从 256 bit 加宽至 4096 bit,Softmax 耗时缩短至约 1/15,端到端首字时延(TTFT)提升 2.26 倍,序列越长收益越明显。

    177 个算子与完备工具链:交付可运行、可调、可迭代的软件栈

    算子库覆盖 12 个类别、177 个算子,从数学运算、张量操作、卷积融合到量化与类型转换,贯通完整推理链路,并为客户自定义算子提供统一基础;GCC / LLVM 编译工具链、Runtime、调试器与性能分析工具随方案一同交付。

    算子库、编译工具链与硬件指令三层对齐,厂商选择不同向量宽度或裁剪能力时,改动收敛在编译期——裁剪不等于重新维护一套软件。

    五个维度灵活可配

    按场景选配,按需求裁剪

    为适配端侧多样化的场景与需求,助力客户围绕自身目标场景,定义一颗性能、面积与功耗精准匹配且更具竞争力的芯片;该方案在五个维度提供灵活的可配可裁能力。

    玄铁端侧 AI 解决方案发布,为端侧 NPU 打造可编程底座图8

    阿里巴巴达摩院玄铁 RISC-V IP 解决方案负责人黄怡皓表示:

    端侧 NPU 的差异化,很大程度来自 Tensor Engine 与存储系统,这是厂商应当牢牢握在手中的核心竞争力。玄铁推出可编程底座,是希望把需要长期工程积累的调度、通用向量计算与配套软件承担起来,授人以渔,让 NPU 厂商用得方便、改得自由,把研发资源集中到最有价值的差异化创新上。这也是 RISC-V 架构开放、灵活特性在端侧 AI 时代的又一次生动实践。

    欢迎前往玄铁官网(xrvm.cn)搜索「端侧 AI 解决方案」了解更多。




    来源:玄铁


    玄铁端侧 AI 解决方案发布,为端侧 NPU 打造可编程底座图9


    关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
    声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
    AI 玄铁
    more
    NVIDIA NIM 助力量子实验室构建本地推理与量子计算 AI Agent 工作流
    OpenAI前研究员田永龙加盟腾讯,执掌混元多模态业务
    TechCrunch Disrupt 2026:在AI重塑产业的十字路口,投资人如何穿透噪音捕获下一个独角兽?
    光宝科技1.76亿美元入股DCX布局AI智算液冷底座
    Token 之后,谁来组织 AI 计算?Arm 寻找下一代计算的答案
    小米投的AI芯片创企,融资10亿,知名大模型公司投了
    AI Agent重塑SaaS估值逻辑:从“卖席位”到“卖结果”的阵痛与重构
    陶哲轩:AI是直升机,把我空投到数学答案附近
    有人开灯丨寻找用AI回应真实问题的人
    联想来酷发布纯闪存AI NAS,起售价6999元
    Copyright © 2025-成都区角科技有限公司
    蜀ICP备2025143415号-1
      
    川公网安备51015602001305号