SMT SIG 首期技术沙龙回顾|Agentic AI 时代,谁来解锁 RISC-V 的多线程算力?

7 月 16 日下午,由达摩院玄铁主办,北京开源芯片研究院、深圳市中兴微电子技术有限公司、上海开放处理器产业创新中心联合主办的开源芯片社区 "SMT SIG" 技术系列沙龙第一期在上海成功举办。本次沙龙以 "AI 时代的多线程架构创新:SMT 如何释放 RISC-V 服务器 CPU 性能" 为主题,汇聚了来自处理器 IP 设计、芯片研发、等多个领域的技术专家,围绕 RISC-V 同步多线程(SMT)的架构优化、性能演进路径与工程实践展开了深度分享与开放讨论。

SMT SIG 首期技术沙龙回顾|Agentic AI 时代,谁来解锁 RISC-V 的多线程算力?图1

为什么 RISC-V 需要 SMT?

SMT SIG 首期技术沙龙回顾|Agentic AI 时代,谁来解锁 RISC-V 的多线程算力?图2

从左至右依次是:达摩院玄铁 RISC-V 资深技术专家苏中、北京开源芯片研究院院长唐丹、深圳市中兴微电子技术有限公司技术总监刘建平

沙龙伊始,达摩院玄铁 RISC-V 资深技术专家苏中、北京开源芯片研究院院长唐丹、深圳市中兴微电子技术有限公司技术总监刘建平分别代表三方主办方致辞,围绕 AI 时代 RISC-V 服务器 CPU 面临的算力挑战与 SMT 的战略意义表达了高度一致的判断。

当前,从生成式 AI 到 Agentic AI,计算范式正在经历一次关键跃迁。智能体不再只是被动响应提示词,而是能够自主感知、推理并执行完整任务链。

在这一趋势下,CPU 的角色正在从 GPU 的 "配角" 重新回到 "系统智能中枢" 的位置——在智能体工作流总延迟中,超过 90% 发生在 CPU 端;传统大模型模式下 CPU 与 GPU 配比约为 1:4 至 1:8,而进入智能体时代后,这一比例正在向 1:1 甚至更高演进。高性能 CPU 已成为 Agentic AI 算力底座的核心瓶颈之一。

SMT 是高性能 CPU 从 "单核极致" 走向 "系统级算力释放" 的关键架构能力。在 x86 和 ARM 主导的服务器 CPU 市场中,SMT 已是数据中心和 AI 推理芯片的标配技术;而对于正在向高性能计算领域突破的 RISC-V 架构而言,SMT 的工程化水平将直接决定下一代 RISC-V 服务器 CPU 能否在单核性能已跻身国际第一梯队的基础上,实现系统级算力的进一步跃升。

特别是在 Agentic AI 时代,智能体工作流对 CPU 多线程并发能力的要求越来越高——多租户 SLA 隔离、异步工具调用、推理与规划并行执行等场景,都需要 SMT 提供底层的硬件级支撑。

这一技术判断,正是达摩院玄铁深度参与 RISC-V 开源生态建设、推动 SMT 技术攻关的核心动因。玄铁从 C910 到 C950,持续推动 RISC-V 架构从嵌入式向高性能方向突破。今年 3 月 24 日,在上海举行的 2026 玄铁 RISC-V 生态大会上,,明确将 SMT 列为联合研发的三大关键技术攻关方向之一,同时规划了 RISC-V 高性能软件生态共建与行业标杆应用孵化的合作路线。目前 SMT 已经走进了实质性的技术协作——达摩院团队深入 KMH-SMT 微架构代码分析并提交了多个 PR 合入 XS-GEM5。

达摩院玄铁:六大微架构优化方向,从分析到代码落地

SMT SIG 首期技术沙龙回顾|Agentic AI 时代,谁来解锁 RISC-V 的多线程算力?图3

达摩院玄铁 RISC-V 处理器架构团队高级技术专家郝子轶分享了达摩院 SMT 工作组加入香山昆明湖 V3 联合研发以来的技术进展。团队基于 XS-GEM5 SMT 配置快速完成双线程 SPECint2006 切片运行,经过初步分析整理出多个可优化点;目前也正推进 SPECint2017 切片准备。
在微架构优化层面,团队围绕多个关键组件展开深入分析与实验:在 IQ 发射队列方面,发现全动态共享策略存在线程饥饿风险,创新引入 WM2 水位线保留策略,有效缓解了 IQ 满载下的资源争抢问题;在 ROB 重排序缓冲区方面,对 dynamic borrowing 机制进行了 6 组对照实验,发现 donor 线程共享条目过多,提出降低共享条目,将 donor 保留条目提升至 64 时获得约 0.5% 的性能改善;在 Preg 物理寄存器方面,初步验证了从全共享向策略化分配转变的价值,为后续精细化分区奠定了基础。此外,团队还深入分析了线程取指截流策略与 stall buffer 跨线程反压问题,提出了按线程拆分 stall buffer 的优化方向。
面向后续路线图,郝子轶提出了清晰的技术目标:SPECint2006 双线程性能从当前 17% 向 20%(卓越目标 30%)推进(30% 对标 AMD Zen5 SMT2 水平),同步推进 SPECint2017 切片覆盖;中期探索 SMT 向 4/8/16 线程扩展以应对 AI 并发场景,将资源分配策略参数化构建可调优的策略矩阵;远期探索 Spatial SMT 等新型多线程架构。他强调团队以最大化开源贡献为衡量标准,在开源社区内容将分析成果转化为有效的代码合入,"Talk is cheap, show me the code"。

开芯院:5% 仿真精度对齐,三大优化已合入主线

SMT SIG 首期技术沙龙回顾|Agentic AI 时代,谁来解锁 RISC-V 的多线程算力?图4

北京开源芯片研究院工程师晏悦分享了香山昆明湖 V3 SMT 的性能优化与分析方法论。团队基于 XS-GEM5 性能模拟器开展研究,该模型与 RTL 对齐度已在 SPECint2006 各子项上达到 5% 以内,为性能分析提供了高可信的仿真平台。

在基准性能方面,当前单线程基线达 20 分/GHz,开启 SMT2 后总吞吐提升至 23.4~23.6 分/GHz,其中 astar、bzip2 等分支密集型子项收益高达 50%,而 h264 等高 IPC 子项受限于流水线利用率已接近饱和。在分析方法论层面,晏悦系统阐述了 Topdown 定位瓶颈 → Upperbound 验证空间 → Optimization 实现收益的闭环思路并以 CoreMark 为例展示 SMT 将总 IPC 从 3.5 提升至 4.5,后端瓶颈占比从 50% 降至 30%,瓶颈有效转移至 retiring。

晏悦重点分享了三项已落地的优化成果:一是 redirect-pending 机制在分支误预测冲刷期间提前切换线程填补流水线空窗,SPECint 整体提升 0.4 分/GHz,该优化已合入 XS-GEM5 主线;二是修复 AMO swap 指令过度序列化异常定位并解决了 SMT 场景下 IPC 从 2.x 骤降至 0.1 的功能缺陷;三是动态预取准入调控,通过评分机制筛选有效预取请求,降低无效预取对缓存的污染。晏悦还展望了 SMT 在 AI Agent 场景中的应用前景:当一个 Agent 等待 LLM 响应时,另一 Agent 可利用流水线空闲资源执行本地推理或 RAG 检索,有效提升 CPU 利用率与系统吞吐。

中兴微电子:SMT2 框架 17% 吞吐增益,Spatial SMT 路线探索

SMT SIG 首期技术沙龙回顾|Agentic AI 时代,谁来解锁 RISC-V 的多线程算力?图5

深圳市中兴微电子技术有限公司性能建模负责人王飞鸣分享了 SMT 在昆明湖 V3 上的调优实践与未来探索。团队已完成 SMT2 基本框架搭建,实现约 17% 的吞吐增益,为后续深度优化奠定了坚实基础。
KMH-V3 作为 13 级流水线、8 发射的高性能超标量乱序核,SMT 资源竞争复杂度远超传统设计。在线程选择机制调优方面,王飞鸣系统对比了三种 Fetch Select 调度策略:经典 ICount 调度器、延迟 ICount 调度器和多优先级调度器。实验发现以 LSQ 优先的排序可获得约 0.3% 的性能改善,其设计哲学在于 LSQ 快速响应内存阻塞、IQ 最大化执行单元利用率、ROB 保障线程公平性。
面向后续,王飞鸣提出了两项关键规划:一是构建五维评估框架——涵盖 IPC、前端效率、后端平衡、公平性、资源利用率五个维度,并呼吁共建 SMT 性能监控体系,补充多线程 PMU 计数器、扩展 Topdown 分析,实现从 "盲调" 到 "可观测调优" 的质变。二是开辟 Spatial SMT 技术路线——与传统 SMT 的动态共享和投机性资源竞争不同,Spatial SMT 将前端到后端的所有资源做静态物理隔离,彻底消除线程间干扰与尾延迟,提供更强的可预测性和安全性,特别适合 AI 场景中延迟敏感的关键负载。王飞鸣指出,最终产品形态可能是 SMT 与 Spatial SMT 的混合可配置方案,根据应用场景灵活切换。

无剑论道:从 SMT 到 AME + SME,RISC-V 的 AI 算力新路径

SMT SIG 首期技术沙龙回顾|Agentic AI 时代,谁来解锁 RISC-V 的多线程算力?图6

在沙龙最后的 "无剑论道" 开放讨论环节,与会专家围绕 SMT 与矩阵扩展标准的融合创新展开了深度技术探讨。讨论从 GPU 架构的多线程本质切入,提出在大向量、大矩阵运算场景下,SMT 能够通过隐藏内存延迟和提升指令吞吐来显著增强矩阵运算效率,SMT 与 AME 的结合构成了 RISC-V 面向 AI 负载实现差异化架构创新的关键路径。从产业格局看,当前主流矩阵扩展标准(如 Intel AMX、ARM SME)在 AI 推理与训练场景中的市场渗透仍然有限,这为 RISC-V 率先探索 SMT 与 AME/SME 的深度融合提供了时间窗口——若能在下一代 AI 算力架构中将多线程并发与矩阵加速能力有机结合,有望走出一条有别于传统 GPU 主导路线的差异化技术路径。
在大家最为关注的性能目标上,讨论认为 SPECint2006 双线程 30% 的性能提升是下一阶段的重要里程碑。围绕 AI Agent 等新兴场景,讨论形成高度共识:智能体工作流中超过 90% 的延迟发生在 CPU 端,SMT 对服务器多线程并发能力的需求尤为迫切。后续将以开源芯片社区为平台,持续推进技术攻关与标准建设。

开源协作,共推 RISC-V SMT 技术演进

本次沙龙是开源芯片社区 SMT SIG 的首次线下深度交流活动,汇聚了学术界和产业界的工程力量,目标是推动 RISC-V SMT 从架构设计走向可验证、可落地的开源实现。SMT 的工程化落地并非单一厂商能独立完成,需要微架构设计、RTL 实现、验证方法学、编译器与操作系统适配、性能调优等全链条的协同推进。
后续,SMT SIG 将持续开展系列技术沙龙和线上研讨,围绕 SMT 关键优化点、性能提升目标与演进路径深入推进技术攻关,玄铁将持续深度参与开源社区 SMT 共建工作,欢迎更多 RISC-V 产业链伙伴加入社区协作,共同定义 RISC-V 的并发未来。

关于上海开放处理器产业创新中心

上海开放处理器产业创新中心(简称:创新中心)于2024年9月在上海浦东张江正式成立,坐落于集创路52号创芯天地一号楼15楼。创新中心是由国内领先的半导体设计公司芯原股份、芯来科技,以及达摩院(上海)共同发起设立的一家民办非企业单位。

创新中心旨在协同RISC-V产业链上下游企业,包括芯片设计企业、IP供应商、系统厂商、软件开发商、终端厂商以及顶尖科研院所,共建RISC-V关键共性技术平台,用开放的硬件平台构建开源的软件生态,从而有力促进RISC-V技术的产业化应用和商业化落地。

此外,创新中心还将与国内重点高校展开深度合作,通过共建RISC-V特色课程体系、设立联合实验室、建立实训实习基地等方式,系统性地培养具备RISC-V专业技能的复合型人才,为产业发展提供持续的人才支撑。


声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
AI IC RISC-V SMT
more
对话ICRA两届比赛冠军。具身真实场景问题的解决:7分工程,3分模型
SMT SIG 首期技术沙龙回顾|Agentic AI 时代,谁来解锁 RISC-V 的多线程算力?
给机器人造一座「数据工厂」,小米 Robotics-U0 如何破解具身智能最难的一道题?
Physical AI 如何走向产业闭环?ICDIA具身智能生态专题会议报名开启!
独家 | 字节XR业务PICO创始人周宏伟将卸任,李晓凯成为新任业务负责人
字节XR业务PICO创始人周宏伟将卸任,李晓凯成为新任业务负责人丨36氪独家
Xbotics Talk| HumanoidArena:人形机器人的“LIBERO”来了?让 VLA 真正学会全身交互
谁在押注Micro LED CPO?20家企业拆解
小红书回应IPO相关传闻均不属实,Costco入驻京东,谷歌发布三款轻量新模型,曝字节PICO创始人周宏伟将卸任,这就是今天的其他大新闻!
100亿美元,Meta拟向Anthropic出租算力
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号