RISC-V Matrix架构设计与AME标准化进展

RVEI工委会 2026-08-14 21:30

RISC-V Matrix架构设计与AME标准化进展图1 更多精彩,请点击上方蓝字关注RVEI

RISC-V Matrix架构设计与AME标准化进展图2


2026813日,由RISC-V工委会指令集工作部、RACE委员会主办,北京开源芯片研究院、北京通明湖信息技术应用创新中心协办的"RISC-V AI扩展指令集研讨会"在北京开源芯片研究院成功举办。


AI算力需求汇聚,RISC-V AI扩展指令集布局加速


大模型与AI应用的快速发展正在驱动算力需求持续攀升,矩阵乘等核心计算已成为AI负载的算力主体。RISC-V凭借其开放、灵活、可定制的特性,为AI加速指令的标准化提供了理想载体。


与此同时,当前业界AI加速方案多为各家自研的领域专用架构,指令集与软件生态碎片化问题日益突出,产业界对统一、开放的AI扩展指令集的需求愈发迫切。


围绕AI算力需求,RISC-V工委会已在矩阵(Matrix)扩展、并行计算、GPGPU、存算一体等多个方向组建SIG组、布局标准研讨与建设工作,本次研讨会的技术报告也覆盖上述方向,呈现出多路线并进、百花齐放的发展格局。


其中,矩阵扩展是工委会的主要攻关方向,由达摩院牵头主导:


在国内,工委会指令集工作部已组织启动矩阵扩展相关行业标准的编制工作;


在国际,达摩院牵头在RISC-V国际基金会(RISC-V International)推动AMEAttached Matrix Extension)标准立项与演进,目前已牵引国内多家企业共同参与国际标准讨论,中国企业在重要AI国际标准中的影响力持续提升,形成了国内标准与国际标准相互促进的良好局面。


RISC-V Matrix架构设计与AME标准化进展


达摩院项晓燕在"RISC-V Matrix架构设计与AME标准化进展"报告中,系统分享了矩阵扩展的设计思考与AME标准的最新进展。


RISC-V Matrix架构设计与AME标准化进展图3


报告首先阐述了在向量扩展(RVV)之外引入矩阵扩展的必要性:以8×8×8矩阵乘为例,向量实现需要64条乘加指令、读取1024个元素,而一条矩阵指令即可完成计算且仅需读取128个元素,取数带宽需求降低约8倍,算力密度与能效比显著提升。


报告同时指出,当前各家自研AI加速架构导致指令集与软件生态碎片化,社区迫切需要统一的矩阵扩展以降低软件移植成本,并对比了社区讨论中的MEVMEAME三种技术路线:


ME复用RVV向量寄存器,实现代价最小、落地最快;VME新增二维累加寄存器,适配特定推理场景;AME采用全新独立的寄存器架构,算力组合灵活、可扩展性强。


针对多路线并行可能带来的软件适配问题,报告提出可借鉴统一抽象层的思路,实现上层软件统一、底层差异化适配。


报告重点介绍了AME架构的设计细节:


AME定义独立的矩阵寄存器组与累加寄存器组,采用N×N方阵表示,通过pack机制与类型寄存器实现指令与数据类型的解耦,可灵活支持INT8INT4FP8BF16FP16AI主流数据类型并向FP32/FP64扩展;


指令集共141条指令,覆盖矩阵乘、逐元素运算、归约、数学函数、数据重排等12类操作,提供行主序、列主序、spread等丰富访存模式,并定义了与RISC-V内存模型保持一致的内存序控制机制。


在标准化进展方面,AME规范的主体框架已基本成型,覆盖类型系统、量化指令、状态管理、访存设计等关键模块,正在推进指令编码优化、微缩放(microscaling)低比特类型支持、基础Profile定义等工作。


下一步标准工作将聚焦四个目标:


一是尽快收敛冻结基础指令集,将当前版本提交社区内部评审,力争年内完成基础版本收敛;


二是明年年初完成验证工作;


三是通过Profile机制面向云侧、端侧等不同场景标准化矩阵寄存器数量等差异化配置;


四是推动建立统一抽象层,防范多技术路线并行可能带来的软件生态碎片化风险。


与此同时,工委会正同步组织国内矩阵扩展团体标准编制,与国际AME标准形成相互促进的布局。


研讨环节,北京开源芯片研究院、清微智能等单位结合各自实践对AME指令集提出修改建议。


北京开源芯片研究院基于香山"昆明湖V2"处理器集成矩阵单元(香山AI)的实践,提出将精度能力描述从CSR迁移至设备能力描述字段、运算语义与数据类型编码解耦、引入异步执行原语实现矩阵与向量单元流水并行、访存指令剥离元素宽度信息以精简指令集等四项改进建议,并分享了矩阵核与CPU共享L2缓存的同构扩展路线。


清微智能结合数据流架构实践,提出支持INT4MX FP4等低比特格式、对齐OCP MX等行业规范、增强内置转置操作、将结构化稀疏列为可选特性等建议。


与会专家还围绕大模型推理中的stride访存效率、矩阵单元的独立存储与部署模式等议题展开讨论,普遍认为"解耦+专用存储"是更优的设计路线,SPM、本地DMA等高级特性应在基础版本稳定后依据原型验证结果分阶段纳入。



来源:RVEI指令集工作部


RISC-V Matrix架构设计与AME标准化进展图4


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
RISC-V
more
2026 RISC-V城市行 | 技术沙龙@长沙站【议程更新】(倒计时一周)
【RVEI】新一批RISC-V团标制修订计划公布
HKIC | 进迭时空祝贺港投公司2025年年报再创佳绩,携手共筑 RISC-V 创新生态
芯来科技发布基于RISC-V的WiFi6 IP
RISC-V产业看点:从AI融合到高性能突破,开放计算迎来加速期
清华系!芯际无限,领跑RISC-V(车规+具身智能)算力芯片
包云岗:RISC-V赛道,呼唤嘉立创模式
第六届 RISC-V 中国峰会赞助方案公布
跃昉科技:迈向高性能RISC-V计算新阶段
全球首款RISC-V消费级AI NAS Q4量产,北京RISC-V数字基础设施创新中心再添标杆成果
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号