AI Agent 设计出量产级芯片!(详细流程)

EETOP 2026-07-27 08:05

AI Agent 设计出量产级芯片!(详细流程)图1

EDA(电子设计自动化)的面貌正在发生变化。四十年来,这个行业一直专注于优化芯片设计、验证和实现的算法。这些工作带来了一些突破性的创新——逻辑综合就是一个很好的例子,类似的创新还有很多。

得益于通常被称为前沿AI(Frontier AI)的技术创新,使用EDA的工程任务现在可以实现自动化。这些变化使得EDA的影响力达到了一个新高度——持续改进决定质量、生产力和上市时间的工程工作流程。

初创公司Agentrys最近发布了一份白皮书,描述了如何使用其技术构建一款量产级芯片,结果令人瞩目。

白皮书正文:

一项关于端到端、长期运行、完全自主的多智能体系统的研究——该系统作为AI工程工作团队,设计和优化各类硅芯片,从AI加速器和网络芯片到通用CPU和GPU。

概要

四十年来,EDA(电子设计自动化)自动化的是优化和分析的工程算法。前沿AI(Frontier AI)如今使工程任务本身也可以被自动化——因此,持久的优势转移到了持续改进的工程工作流程上,这些流程决定了质量、生产力和上市时间。本文详细审视了这样一个工作流程:一个端到端、长期运行、完全自主的多智能体工作团队,将芯片从规格说明一路带到通过Sign-off的版图设计,并在过程中不断优化自身决策。

这一区分至关重要,因为全球对定制芯片的胃口已变得无法满足,且不再集中于一处。在边缘端,数十亿的传感器、手机、可穿戴设备和汽车要求在毫瓦级的功耗预算内实现设备端推理。在数据中心,训练和服务集群消耗兆瓦级电力,瓶颈不在于创意,而在于加速器、存储控制器和互连架构能以多快的速度被设计、验证和流片。在AI推理应用的爆发中——推荐、视觉、语音、生成式模型——每种工作负载都想要自己的数据路径、自己的数值格式、自己的每次推理能耗最优点。需求曲线是垂直的;而专家级设计团队的供给却是平的。

核心主张:几分钟内组建工作团队;数小时到数天内收敛到通过Sign-off的芯片。本文余下部分描述了这颗芯片。

什么使工作团队具备自主性

四个属性承担了核心工作,且它们都不是处理器特有的:

01 分层多智能体编排:一个顶层编排器将任务委派给各子系统负责人,每个负责人管理一组连贯的专业智能体。驱动以下五个子系统的同一委派架构适用于任何可以分解的流程——编排器不知道也不关心制品恰好是一个CPU。

02 受治理的迭代循环:每个优化或调试循环都在明确的、强制执行的迭代预算下运行,并保留完整的每次迭代历史记录。这正是不让长时程自主性陷入令牌消耗黑洞而是确保其收敛的关键。

03 目标函数无关性:本项目优化的是每瓦特XLOPS,但评价指标只是一个参数。换成延迟、面积、每次推理能耗或加权多目标,收敛机制完全不变。

04 溯源与不断积累的知识库:每一个声明都有带校验码的机器可读清单中的制品作为支撑,配合实时更新的设计文档和仅追加的事件日志,使信任成为内建属性而非外挂功能。其底层是一个持续维护的设计知识库——微架构配方、工具特定特性、PPA(功耗-性能-面积)收敛启发式方法、来之不易的Sign-off经验——每个智能体都从中汲取信息以做出更好更快的决策,因此每完成一个设计都会使下一个设计更加精进。

运行该流程则是另一回事:因为它将RTL编写、设计验证、物理实现和PPA收敛作为自学习反馈循环进行协同优化——验证失败会重写RTL并重新证明,物理设计瓶颈会回溯改变微架构并重新验证,功耗结果会重塑版图规划——一次完整收敛可以无人值守地运行数小时到数天,每个循环都受强制迭代预算治理,并反馈到知识库中使系统持续精进。

端到端的规格到GDS工作流程

AI Agent 设计出量产级芯片!(详细流程)图2

AgentCore的路由GDS渲染图,由自主多智能体工作流程端到端生成

工作流程产出的设计——我们称之为AgentCore——是一款紧凑的32位嵌入式处理器,基于开放、免版税的指令集架构构建。其指令集涵盖基础整数运算——算术、逻辑、加载和存储、分支和跳转——并扩展了硬件整数乘法子集和用于性能监控的控制与状态寄存器接口;设计有意省略了硬件除法、浮点运算和向量单元等较重的功能,以保持设计的小型化和可读性。

在微架构上,它是一个单发射、顺序执行的多级流水线:指令依次通过取指、译码、执行、访存和写回阶段,具备完整的转发和冒险互锁机制,使接近每周期一条指令的持续吞吐量成为可能。流水线深度本身被视为一个可调的设计约束而非固定值——流程可以将级数作为其微架构优化轴之一进行扫描,在流水线填充延迟和可达频率之间权衡以最大化每瓦有效工作量,然后 settle 在最能服务于XLOPS/W目标的深度上。架构寄存器状态存储在基于触发器的寄存器文件中,支持异步读和同步写,核心通过分离的32位指令和数据存储端口与外部通信,由单一时钟驱动并采用同步低电平有效复位。

硬约束与弹性目标:硬约束不可协商——基础整数指令集及其乘法子集、所选的流水线结构、触发器寄存器文件,以及持续的CPI(每条指令周期数)≤1.5。弹性目标是将fmax从957MHz推向1.24GHz;整数乘法子集故意排除了除法和余数运算以保持数据路径精简。

唯一全新的RTL

本项目中唯一真正全新的RTL是一个专用控制与状态寄存器模块,实现了XLOPS性能计数器ABI(应用二进制接口)。它暴露了十一个64位自由运行计数器——九个按操作类别的计数器,加上一个周期计数器和一个已退休指令计数器——每条指令退休时按操作类别递增。在整数加乘法核心上,九个工作类别中只有两个会实际激活(INT32乘加类别和用于加载/存储的内存类别),加上活跃周期分母;其余六个绑定到零但保留,以使ABI完整且向前兼容未来的浮点和向量扩展。

可定制的目标

本次运行的目标是每瓦特XLOPS。XLOPS是一个泛化的有效工作量单位,超集包含浮点FLOPS、整数TOPS和SIMD吞吐量:每次完成的操作按一个追踪其相对晶体管成本的因子加权,锚定方式为一个FP32融合乘加等于1.0(INT32 MAC为0.5,内存操作为0.1,依此类推覆盖九种操作类别)。形式化表达为:

AI Agent 设计出量产级芯片!(详细流程)图3

XLOPS将按工作量加权的已完成操作汇总并按时钟频率缩放;除以总功耗得到效率评价指标。

其中:

AI Agent 设计出量产级芯片!(详细流程)图4

贯穿始终的一条规则:始终同时报告绝对XLOPS数值和XLOPS/W比率,绝不优化一个而不展示对另一个的影响。如此精确地定义目标是整个用户侧的工作——此后,组建追求该目标的智能体就是工作流程的任务了。

五子系统分层流程

为追求该目标,工作流程被组建为顶层编排器下的五个协作子系统。每个子系统拥有设计问题中一个连贯的切片,并将经过验证的制品包传递给下一个子系统;前向路径是线性的,而自学习反馈边(重新实现、重新验证、重新收敛)将它们连接成循环。

AI Agent 设计出量产级芯片!(详细流程)图5


图:编排器及其五个子系统负责人,以及将线性流程转变为协同优化循环的反馈边。

输入与设置:接收规格说明和XLOPS/W目标,启动流程。

前端:将规格说明和目标转化为可综合的RTL代码。

设计验证:证明RTL与黄金ISA参考实现位精确一致。

后端:综合、布局布线和PPA收敛。

Sign-off与总结:DRC(设计规则检查)和天线Sign-off,以及溯源清单和总结。

每个子系统运行自己的有界自学习迭代循环,中央迭代预算账本是每个子系统消耗了多少次迭代的权威记录——这就是使长时程自主性保持收敛而非无限开放的治理机制。

RTL与设计验证

前端子系统将规格说明和XLOPS/W目标转化为可综合的RTL,设计验证子系统在综合任何逻辑门之前就证明了其相对于黄金ISA参考的正确性。此处的正确性是二元的且不容妥协的:被测器件必须逐位重现参考的完整指令退休流,而馈送目标函数的性能计数器本身也必须通过独立分类器验证。

功能测试套件在第一轮即通过位精确验证,因此根因分析修复循环从未启动——8次迭代预算中消耗了0次。

验证即服务:跨阶段反馈边是整个设计的核心——一个物理设计想法可以回溯到RTL,工作流程会自动重新编写并重新证明它——在任何收益被确认之前,位精确性已被重新建立。

物理设计、PPA收敛与Sign-off

后端子系统将经过验证的RTL通过综合、布局和布线,在12次PPA迭代预算中消耗了9次来搜索XLOPS/W最优解。

优化循环:每次迭代扰动四个轴之一——微架构、后端布局参数、标准单元阈值电压类型和时序约束——并在自洽的XLOPS/W基础上对结果重新评分(功耗在与吞吐量相同的操作点测量,绝不会在会虚高数值的低速时钟下测量)。阈值电压和约束扫描确认,标准Vt库在自然操作点是目标的真正最优点——存在更高频率的库类型,但功耗代价超过了收益。

Sign-off:路由设计以零路由DRC错误、零天线违规和100%路由完成率收敛——在15次迭代预算中0次清理DRC修复循环,并达到PASS-WITH-LIBRARY-WAIVERS Sign-off 状态。

流程后半段三个受治理循环中的两个——RCA修复和DRC修复——消耗了零次迭代。设计到达每个关卡时已经干净;预算的存在是为了吸收从未出现的麻烦。

设计验证·RCA修复:0/8次迭代。后端·PPA收敛:9/12次迭代。Sign-off·DRC修复:0/15次迭代。琥珀色表示搜索消耗的迭代次数,绿色表示因阶段首次通过而未使用的预算。

AI Agent 设计出量产级芯片!(详细流程)图6

端到端性能轨迹

AI Agent 设计出量产级芯片!(详细流程)图7

端到端性能轨迹——每次智能体提交的变更都使目标朝正确方向移动

智能体提交的每一次变更都将目标朝正确方向移动——或者在验证重跑的情况下,在重新证明正确性时保持目标不变。没有任何人引导了这次攀升。

这条轨迹所捕获的是有目的的自主性。智能体不是在遵循固定配方;在每一步,工作流程都会选择下一步改变什么——在这里做一个布局密度扫描,在那里做一个微架构编辑——测量对目标的影响,从中学习,然后决定下一步往哪里推进。关键的是,跨阶段边在做真正的工作:当物理设计循环回溯改变微架构时,工作流程会在确认收益之前自动重新编写RTL并重新运行完整的验证套件。这种闭环行为——提出、实现、验证、测量、重复——正是让自主工作团队得以协同优化一项原本需要专业团队协调的任务的能力,而且全程受强制迭代预算治理,确保搜索收敛而非漫游。

这是更深层的要点:因为这类工作流程是长期运行且反复执行的,每次运行也是一次学习的机会——一个从每次执行中学习的系统,会随着时间的推移复合增强其工程能力。

核心成果

AgentCore——在ASAP7 7.5T上的核心成果,且整个流程中未使用任何商业EDA工具:

致谢

这项工作得益于更广泛的开源硬件和EDA社区。该流程利用了——在某些地方还扩展或修改了——一系列开源工具和组件,包括但不限于:Yosys综合套件、OpenROAD物理设计流程及其flow-scripts、Verilator和Icarus Verilog仿真器、KLayout版图和DRC引擎、开源RISC-V ISA参考仿真器、GNU编译器工具链,以及ASAP7预测性标准单元库。我们对这些项目的维护者和贡献者深表感谢;这项工作建立在他们工作之上,而非替代它们。

芯片是证明,工作流程才是产品

AgentCore是一颗真实的、通过 Sign-off 的芯片,产出它的轨迹在无人驾驶的情况下单调攀升。但真正重要的结果在更高一层:产生这颗CPU的同一套编排架构、受治理循环、溯源保证和目标无关的收敛机制,可以泛化到不同的设计类别、工艺节点和目标函数。随着AI辅助工程变得司空见惯,持久的优势不会来自任何单一自动化任务——它将来自一个自主工作团队,其长期运行的工作流程每次执行都能得到可衡量的提升。

今日推荐:

IDAS 2026 IC设计自动化产业峰会


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 芯片
more
AI的尽头是能源?TechCrunch Disrupt 2026聚焦“智能系统”破局电力瓶颈
腾讯研究院AI速递 20260728
出海企业苦等的可信任AI营销产品,飞书深诺做出来了
腾讯全新QQ宠物上线,AMD将在韩国设立AI研究中心,微信输入法1.0.0鸿蒙版上线,三星升级后输错13次密码永久锁,这就是今天的其他大新闻!
爆料苹果 AI 眼镜明年 WWDC27 亮相,但可能不允许用户录像
OpenAI 和 Anthropic,正在砸钱抢这个市场
早报|长鑫科技今日科创板上市;LV回应起诉房企:涉事场所内涉嫌售假;黄仁勋称中国AI人才是“核武器”;上海交大医学院通报女童死亡事件
全球最强AI数据中心TOP60,三家中国企业上榜
物理 AI:自动驾驶技术的新范式
用舌头操作手机,把麦克风贴进皮肤,这届 AI 硬件有多离谱
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号