更多精彩,请点击上方蓝字关注RVEI


范式跃迁
Agentic AI 时代为什么需要 SMT?

达摩院首席科学家孟建熠在 WAIC 2026 发表演讲
过去两年,算力叙事几乎被 GPU 垄断。但当 AI 从"生成内容"跃迁到"自主执行完整任务链"的 Agentic AI 阶段,控制流密集型负载让 CPU 重回系统核心。智能体不再被动应答,而是持续进行任务拆解、工具调用、上下文管理与子智能体编排——全球围绕 Agentic AI 算力底座的竞争已全面展开。
7 月 17 日,世界人工智能大会(WAIC)“RISC-V 与 AI 融合发展论坛”上,阿里达摩院首席科学家孟建熠认为:在智能体的工作流总延迟中,高达 90.6% 发生在 CPU 端的工具处理环节。
这意味着,当智能体任务变得复杂,CPU 的吞吐与响应速度直接决定了整个系统的天花板,单纯堆砌 GPU 算力无法解决工具调用与逻辑协同的瓶颈。SMT(同步多线程)是高性能 CPU 从"单核极致"走向"系统级算力释放"的关键架构能力。


这套能力对三类 Agentic AI 场景至关重要。国际主流 CPU 产品(如英伟达 Vera CPU)对 Spatial SMT 的探索,已从侧面验证“确定性多线程”是智能体时代的刚需。
不同的是,玄铁正将这一能力在 RISC-V 开源架构上实现自主可控,并赋予其更灵活的生态适配性。在智能体时代,多线程的“确定性”与“隔离性”,将和绝对吞吐同等重要。
RL 沙箱:每个沙箱是一个独立线程,负责编译代码、运行测试,必须在固定时间窗口内完成,否则会拖慢 GPU 训练周期。空间多线程保证即使上百个线程全开,每个沙箱仍获得可预测的高性能。
智能体工具调用:一次用户请求可能触发多个工具调用(查数据库加执行脚本),这些任务不能因其他租户的请求而变慢。空间多线程提供强隔离,在多租户环境下依然守住 SLA。
灵活调度:运行时可在“1 线程/核(最大化单线程性能)”与“2 线程/核(提升吞吐)”之间动态切换,无需重启。

这一技术判断,正是达摩院玄铁深度参与 RISC-V 开源生态建设、推动 SMT 技术攻关的核心动因。
玄铁从 C910 到 C950,持续推动 RISC-V 架构从嵌入式向高性能方向突破。今年 3 月 24 日,在上海举行的 2026 玄铁 RISC-V 生态大会上,明确将 SMT 列为联合研发的三大关键技术攻关方向之一,同时规划了 RISC-V 高性能软件生态共建与行业标杆应用孵化的合作路线。
目前 SMT 已经走进了实质性的技术协作——达摩院团队深入 KMH-SMT 微架构代码分析并提交了多个 PR 合入 XS-GEM5。
SMT 技术深潜
从微架构代码分析到系统性的性能优化

针对 IQ 发射队列分配策略,发现全动态共享存在线程饥饿风险,引入 WM2 水位线保留策略有效缓解 IQ 满载问题; 对 ROB 重排序缓冲区的 dynamic borrowing 机制进行 6 组对照实验,发现 donor 线程判定过于灵敏,建议引入延迟滤波,将 donor 保留条目提升至 64 时获得约 0.5% 性能改善; Preg 物理寄存器分配初步验证了从全共享向策略化分配转变的价值。

郝子轶同时分析了线程取值截流策略与 store buffer 跨线程反压问题,提出按线程拆分 store buffer 的优化方向。
面向未来,提出 SPECint2006 双线程性能从 20% 向 30% 推进、同步推进 SPECint2017 切片、探索 SMT 向 4/8/16 线程扩展以应对 AI 并发场景、将资源分配策略参数化构建可调优的策略矩阵,以及空间多线程探索的路线图。他强调团队以最大化开源贡献为衡量标准,分析成果必须转化为有效的代码合入,"Talk is cheap, show me the code"。
玄铁联合中兴微电子、开芯院举办的「SMT SIG 首期技术沙龙:AI 时代的多线程架构创新」在近期成功举办,相关视频回顾已上线,欢迎前往玄铁视频号查看。
来源:玄铁
