从单芯片到十万卡集群:奕行智能业界首个RISC-V AI算力超节点的破局和野望

电子发烧友网 2026-07-24 07:00
电子发烧友网报道(文/吴子鹏)2026 世界人工智能大会(WAIC)上,行业竞争已从单纯比拼芯片峰值算力参数,转向侧重大并行能力、能效表现与 Token 生成质量的算力集群综合较量。在此行业背景下,奕行智能推出具备重磅产业意义的成果 —— 业界首个 RISC-V AI 算力超节点正式对外发布。

从单芯片到十万卡集群:奕行智能业界首个RISC-V AI算力超节点的破局和野望图1
奕行智能高级副总裁吕剑飞表示:“AI 产业发展曲线正迎来关键转折点。行业从早期基础大模型预训练,到后训练微调技术广泛普及,再到 2026 年智能体(Agent)应用集中爆发,整体已全面进入以推理为核心的新阶段。这一阶段的算力需求不再一味追求训练场景的超大规模,而是对算力密度、互联时延、部署成本与综合能效提出了更为严苛的要求。奕行智能以 RISC-V 为底层技术根基,依靠架构创新释放集群完整算力潜力,正在重构国产高端 AI 算力的产业演进范式。”

推理时代算力发展困局与RISC-V 集群的核心产业价值

传统服务器依靠 “堆叠芯片、外接线缆” 的横向扩展模式,弊端日益凸显:单颗芯片制程工艺逐步逼近物理极限,多卡互联带宽不足、数据传输时延居高不下,导致超大规模集群实际算力释放效率远低于纸面标称参数,规模化扩容的边际成本持续走高。行业已形成清晰共识:面向推理场景的最优算力方案,是通过系统级架构创新打造超节点体系,在同等单芯片硬件能力下,实现集群综合效能量级式提升。依据《超节点技术体系白皮书》测算,搭载相同芯片时,超节点架构的综合性能较传统服务器集群最高可提升 12 倍,这也是全行业布局 Token 工厂场景的核心技术路线。

与此同时,传统封闭指令集架构存在底层技术 “卡脖子” 隐患,无法满足算力基础设施自主可控的长期需求。开源开放、自主可控正是 RISC-V 最核心的特质,也是奕行智能坚定布局 RISC-V 高端算力赛道的底层逻辑。

不同于 x86、ARM等需获取商业授权才能使用的闭源指令集,RISC-V 允许企业无限制自由使用、自主扩展指令,从根源规避底层指令授权受限风险。奕行智能在此基础上创新叠加 VISA 虚拟指令集,在开源硬件指令集上层搭建屏蔽底层芯片硬件差异的抽象适配层,真正实现软硬件解耦,达成 “一次编程、多芯片通用” 的开发目标。

过往 RISC-V 技术已在中低端嵌入式设备验证了成熟生态,但云端高端 AI 算力领域长期缺少大规模集群落地案例。奕行智能本次发布的全栈式 RISC-V AI 算力超节点,首次打通 AI 加速芯片、RISC-V 主控 CPU、高速交换网络全链路全国产化,填补高端 AI 智算集群的 RISC-V 产业化空白,既契合全球开源协同的产业趋势,也为国产自主算力搭建安全可控的底层技术底座。

超节点:绝非芯片简单堆砌,而是完整计算系统重构

奕行智能 RISC-V AI 算力超节点并非单一技术单点突破,而是算力芯片、高速互联架构、配套软件栈三方深度协同的系统性创新,硬件层至软件层形成完整闭环技术体系。

该超节点的核心算力底座为奕行智能自研 Epoch 云端 AI 芯片。芯片原生基于 RISC-V 开放指令集打造,业内率先原生支持分块量化 FP8 精度。核心创新点在于内置 VISA 虚拟指令集,完成软硬件解耦,可全面适配通用大模型、垂直行业模型的训练与推理全场景需求。下一代迭代芯片将完成核心架构升级,新增 EXFP4、MXFP4 等低位宽精度格式支持,同步大幅提升单芯片算力、片上存储容量与存储带宽,实现算力利用率、集群横向扩展能力双重跃升。

架构层面,传统超节点方案依赖大量外部线缆完成设备互联,带来硬件采购成本高、高速信号衰减严重、现场部署运维复杂等痛点。奕行智能率先采用正交无背板架构,整套计算系统内部无任何外接线缆;计算托盘与交换托盘通过正交直连方式对接,互联硬件综合成本降低 80%,信号完整性提升 30%,芯片间数据传输时延稳定控制在百纳秒区间。单机柜可集成 16 层计算托盘,支持 64 至 128 张 Epoch 算力卡全对等 Scale-Up 直连互联,单位机柜计算密度较传统机架服务器提升 4 倍以上。单块计算托盘可搭载 1-2 颗国产 CPU(含RISC-V 主控 CPU),是当前业内唯一全栈 RISC-V 超节点商用方案。

从单芯片到十万卡集群:奕行智能业界首个RISC-V AI算力超节点的破局和野望图2

自研 ELink 高速互联是这套业界首个 RISC-V AI 算力超节点实现超大规模扩展的核心支撑。吕剑飞介绍,ELink 单芯片互联带宽可达 3.2T,一张 CX7 网卡是 400G,一颗 Epoch 芯片就具备接入 8 张 CX7 网卡的通信带宽,相当于一台普通 GPU 服务器全部的计算网卡容量。依托该互联技术,单台 RISC-V 算力机柜聚合总带宽可达 102.4TB/s,相较传统服务器提升百倍以上;单个 PoD 算力单元可容纳上万张算力卡,整体集群能够平滑扩容至十万卡规模,兼顾单机柜高密度本地算力、跨 PoD 横向无限扩展双重需求,支撑超大型智算集群灵活迭代、按需扩容。

从单芯片到十万卡集群:奕行智能业界首个RISC-V AI算力超节点的破局和野望图3
整套超节点配套高密度液冷散热方案,机房整体 PUE 优化幅度达 20%。方案整体具备高稳定、易部署、低运维成本等优势;依托标准化正交开放架构,超节点整机研发周期缩短 75%,线上运行可靠性大幅提升。

EVACA 软件栈:三层 AI 执行范式,大幅降低大模型落地门槛

硬件算力价值能否充分释放,高度依赖配套软件生态承接适配。奕行智能同步推出自研 EVACA Tile 原生软件栈,依托 VISA 虚拟指令集完成软硬件解耦,实现 “一次编程、多芯通用”,显著提升模型迁移开发效率。

EVACA 软件栈向上原生兼容 PyTorchvLLMSGLang 等主流 AI 开发框架,搭建由高性能算子库、Tile AI 编译器、KernelFab 算子智造中枢构成的三层递进式 AI 执行体系,打造兼顾当下业务落地与长期技术演进的完整布局。

高性能算子库覆盖上百种基础算子、融合算子、数据处理算子,充分保障主流大模型训练与推理的极致性能;依托专用 Tile AI 编译器,高效完成上层模型语义向硬件指令的转换,实现模型低成本快速迁移。

独创 KernelFab 算子智造中枢则基于Agent 智能驱动,工程师只需负责最终的需求 Review(评审)与 Sign-off(签发)。从需求下达开始,由 Agent 自动完成代码生成、自动上板运行、自动测量诊断,并基于真实硬件反馈进行闭环迭代优化。依托高度自动化的 “算力智造流水线,将传统耗时数周的算子定制开发周期压缩至单日级别,大幅降低大模型迁移适配的人力与时间成本,引领行业算子开发全新演进方向。

三年性能提升 400 倍:清晰的产品迭代路线与产业野望

奕行智能制定了行业内节奏激进、目标清晰的全栈迭代路线:芯片与超节点整机保持一年一代更新节奏,核心目标为三年内实现整套系统综合性能提升 400 倍。

具体产品迭代规划如下:
第一代超节点(现已量产):基于 Epoch 初代 AI 芯片、正交无背板整机架构、ELink 高速互联、EVACA 完整软件栈全栈方案,单柜支持 64-128 卡部署,完成系统级协同创新商用验证。
第二代超节点:升级单柜 128 卡超高密度架构,单个 PoD 算力单元最大支持 16384 卡部署,集群可扩展至十万卡规模,整套系统综合性能实现 20 倍提升。
第三代超节点:持续迭代芯片性能与集成度,完成全栈架构跨越式升级,系统综合性能再获大幅突破,达成三年 400 倍整体提升目标。

这条路线并非单纯依靠单芯片代际堆叠实现性能增长,核心逻辑是系统协同创新带来的乘数效应 —— 整机架构革新、高速互联升级、软件栈深度优化、AI 芯片迭代同步推进,每一代产品性能提升均是全链路各环节协同增益叠加的结果。吕剑飞表示:“我们每年都会推出综合性能提升 20 倍以上的新一代整机产品,三年累计实现 400 倍系统性能跃升。”

落地层面,全球首套全栈 RISC-V 万卡超节点 AI Token 工厂项目已进入落地实施阶段,一期工程计划 2026 年 8 月建成投用,建成后对外开放超节点整机测试、专业性能测评环境。整套方案面向互联网、运营商、金融、能源等重点行业客户,提供覆盖 RISC-V AI 大算力加速芯片、RISC-V 主控 CPU、高速交换网络、异构超节点整机的全链路全国产 AI 算力基础设施,推动 RISC-V 高端算力从实验室原型走向大规模产业商用。

生态共建是奕行智能长期核心布局方向。RISC-V 技术的长期生命力根植于开源社区生态,奕行智能将持续依托全球 RISC-V 开源社区资源迭代芯片与超节点核心产品,联合产业链上下游合作伙伴完善全栈算力软硬件生态,推动 RISC-V 架构在云端高端 AI 算力领域建立统一行业标准、实现规模化普及。

结语

奕行智能在 2026 世界人工智能大会发布的不只是一款硬件产品,而是一套全新国产 AI 算力基础设施发展范式。从底层 RISC-V 开放指令集到上层 VISA 虚拟指令适配层,从 Epoch 自研 AI 芯片到正交无背板整机架构,从 ELink高速互联到 EVACA 三层软件执行范式,从单机柜 128 卡高密度部署到十万卡超大型集群扩展 —— 全链条各环节并非对现有海外算力方案的简单替代,而是对下一代 AI 算力基础设施标准的重新定义。

当行业多数企业仍聚焦 “国产替代” 时,奕行智能已转向探索 “国产定义”:什么样的指令集架构能够兼顾底层开放与产业安全?何种整机架构能让百纳秒级低时延互联成为行业标配?什么样的原生软件栈可依靠 AI 智能体自动完成算子开发?怎样的全栈迭代节奏,能够在三年内实现整套算力系统 400 倍性能跨越?

正如吕剑飞所言:“关注奕行智能,就是关注中国RISC-V发展的答案。”

从单芯片到十万卡集群:奕行智能业界首个RISC-V AI算力超节点的破局和野望图4

声明:本文由电子发烧友原创,转载请注明以上来源。如需入群交流,请添加微信elecfans999,投稿爆料采访需求,请发邮箱wuzipeng@elecfans.com


更多热点文章阅读



点击关注 星标我们



将我们设为星标,不错过每一次更新!

从单芯片到十万卡集群:奕行智能业界首个RISC-V AI算力超节点的破局和野望图5喜欢就奖励一个“在看”吧!


声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
AI RISC-V 芯片
more
AI正在拉大技能鸿沟:谁在进化,谁被无情分化?
面向灵衢的超节点AI训推性能仿真 | 公开课预告
NVIDIA 培训 | 探索开源课程,加速 AI 学习培训与实践创新
WAIC2026 万字观察:具身智能告别Demo,进入系统落地“竞赛”
WAIC 2026三大热词背后,泰克如何以“测试利器”筑牢AI落地基石?
三星携手谷歌、高通推出全新AI智能眼镜
AI PPT一改就崩?MemSlides登顶抱抱脸,让Agent记住你的改稿习惯
苹果 Mac 将迎来全线换代,一种给人用,一种给 AI 用
喆塔科技:AI数据底座重塑半导体智造
酒局和After Party,撑起AI大会的「第二会场」
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号