更多精彩,请点击上方蓝字关注RVEI

2026年8月13日,由RISC-V工委会指令集工作部、RACE委员会主办,北京开源芯片研究院、北京通明湖信息技术应用创新中心协办的"RISC-V AI扩展指令集研讨会"在北京开源芯片研究院成功举办。
AI算力需求汇聚,RISC-V AI扩展指令集布局加速
大模型与AI应用的快速发展正在驱动算力需求持续攀升,矩阵乘等核心计算已成为AI负载的算力主体。RISC-V凭借其开放、灵活、可定制的特性,为AI加速指令的标准化提供了理想载体。
与此同时,当前业界AI加速方案多为各家自研的领域专用架构,指令集与软件生态碎片化问题日益突出,产业界对统一、开放的AI扩展指令集的需求愈发迫切。
围绕AI算力需求,RISC-V工委会已在矩阵(Matrix)扩展、并行计算、GPGPU、存算一体等多个方向组建SIG组、布局标准研讨与建设工作,本次研讨会的技术报告也覆盖上述方向,呈现出多路线并进、百花齐放的发展格局。
其中,矩阵扩展是工委会的主要攻关方向,由达摩院牵头主导:
在国内,工委会指令集工作部已组织启动矩阵扩展相关行业标准的编制工作;
在国际,达摩院牵头在RISC-V国际基金会(RISC-V International)推动AME(Attached Matrix Extension)标准立项与演进,目前已牵引国内多家企业共同参与国际标准讨论,中国企业在重要AI国际标准中的影响力持续提升,形成了国内标准与国际标准相互促进的良好局面。
RISC-V Matrix架构设计与AME标准化进展
达摩院项晓燕在"RISC-V Matrix架构设计与AME标准化进展"报告中,系统分享了矩阵扩展的设计思考与AME标准的最新进展。

报告首先阐述了在向量扩展(RVV)之外引入矩阵扩展的必要性:以8×8×8矩阵乘为例,向量实现需要64条乘加指令、读取1024个元素,而一条矩阵指令即可完成计算且仅需读取128个元素,取数带宽需求降低约8倍,算力密度与能效比显著提升。
报告同时指出,当前各家自研AI加速架构导致指令集与软件生态碎片化,社区迫切需要统一的矩阵扩展以降低软件移植成本,并对比了社区讨论中的ME、VME、AME三种技术路线:
ME复用RVV向量寄存器,实现代价最小、落地最快;VME新增二维累加寄存器,适配特定推理场景;AME采用全新独立的寄存器架构,算力组合灵活、可扩展性强。
针对多路线并行可能带来的软件适配问题,报告提出可借鉴统一抽象层的思路,实现上层软件统一、底层差异化适配。
报告重点介绍了AME架构的设计细节:
AME定义独立的矩阵寄存器组与累加寄存器组,采用N×N方阵表示,通过pack机制与类型寄存器实现指令与数据类型的解耦,可灵活支持INT8、INT4、FP8、BF16、FP16等AI主流数据类型并向FP32/FP64扩展;
指令集共141条指令,覆盖矩阵乘、逐元素运算、归约、数学函数、数据重排等12类操作,提供行主序、列主序、spread等丰富访存模式,并定义了与RISC-V内存模型保持一致的内存序控制机制。
在标准化进展方面,AME规范的主体框架已基本成型,覆盖类型系统、量化指令、状态管理、访存设计等关键模块,正在推进指令编码优化、微缩放(microscaling)低比特类型支持、基础Profile定义等工作。
下一步标准工作将聚焦四个目标:
一是尽快收敛冻结基础指令集,将当前版本提交社区内部评审,力争年内完成基础版本收敛;
二是明年年初完成验证工作;
三是通过Profile机制面向云侧、端侧等不同场景标准化矩阵寄存器数量等差异化配置;
四是推动建立统一抽象层,防范多技术路线并行可能带来的软件生态碎片化风险。
与此同时,工委会正同步组织国内矩阵扩展团体标准编制,与国际AME标准形成相互促进的布局。
研讨环节,北京开源芯片研究院、清微智能等单位结合各自实践对AME指令集提出修改建议。
北京开源芯片研究院基于香山"昆明湖V2"处理器集成矩阵单元(香山AI)的实践,提出将精度能力描述从CSR迁移至设备能力描述字段、运算语义与数据类型编码解耦、引入异步执行原语实现矩阵与向量单元流水并行、访存指令剥离元素宽度信息以精简指令集等四项改进建议,并分享了矩阵核与CPU共享L2缓存的同构扩展路线。
清微智能结合数据流架构实践,提出支持INT4与MX FP4等低比特格式、对齐OCP MX等行业规范、增强内置转置操作、将结构化稀疏列为可选特性等建议。
与会专家还围绕大模型推理中的stride访存效率、矩阵单元的独立存储与部署模式等议题展开讨论,普遍认为"解耦+专用存储"是更优的设计路线,SPM、本地DMA等高级特性应在基础版本稳定后依据原型验证结果分阶段纳入。
来源:RVEI指令集工作部
