物理AI的真正瓶颈,不在模型,而在芯片

物理AI的真正瓶颈,不在模型,而在芯片图1

这两年,物理AI和机器人太热了。人形机器人、具身大模型、世界模型——几乎每隔一段时间就会有新的Demo、新的融资、新的发布。巨头入场,创业公司扎堆,资本疯狂下注。    

但越是在这种时候,越要看一个更底层的问题:这个行业真正的瓶颈,到底在哪里?    

物理AI的真正瓶颈,不在模型,而在芯片图2

江苏省RISC-V产业联盟理事单位,苏州睿芯最近量产了一颗数据流架构的智能芯片,叫高光D35,定位是"全球首款RISC-V数据流物理AI芯片"。


说实话,芯片公司量产一颗新芯片,在今天不算什么大新闻。但仔细研究一下这颗芯片背后的技术路线和产业逻辑,会发现,它指向的可能不只是一颗新产品,而是物理AI行业的三个新趋势

这三个趋势,决定了未来三到五年,物理AI真正的胜负手在哪里。  

趋势一:物理AI的胜负手,正从"模型大小"转向"端侧能效"    

我们都知道,AI的能力取决于三点:算法、算力和数据。    

大语言模型时代,算法的变化不快,能快速形成规模效应的,主要是算力和数据。大模型需要的数据,互联网上、图书馆里,到处都是——说白了,数据不缺。所以胜负手就成了算力。


我们看到的大模型能力跃迁,表面上是模型变强了,底层其实是算力这层地基给修好了。几千张GPU堆在一起,模型参数从十亿涨到万亿,能力就上去了。


但到了物理AI和机器人,问题变了。

机器人要学的,不是互联网上现成的文本和图片,而是手怎么抓住一个杯子、东西为什么会滑落、一个动作失败之后又怎么纠正。这些经验,互联网上根本不存在——所以大家说,物理AI的瓶颈是数据。      

对,但不全对。数据是瓶颈,但它不是唯一的瓶颈。甚至在很多已经落地的场景里,数据已经不是最大的瓶颈了。    

最大的瓶颈是——算力放不到端侧。    

什么意思?你想一下:    

• 一台工业质检机器人,它需要在几毫秒内完成缺陷检测,但它不能连着一台服务器跑;      

• 一台安防摄像头,它需要24小时不间断做AI分析,但它的供电可能只有几十瓦;      

• 一台自动驾驶汽车,它需要同时处理十几路传感器数据,但它的算力预算受限于电池和散热;      

• 一台人形机器人,它需要端侧大模型做决策,但它身上不可能背一个数据中心。      

这些场景的共同点是:AI能力必须放在端侧,而端侧的功耗、体积、成本都是硬约束。 

     

在大模型时代,你可以靠堆GPU解决问题——钱能解决的问题,都不是问题。但在物理AI时代,你堆不了——功耗卡在那里,体积卡在那里,成本卡在那里。


所以物理AI的胜负手,正在从"模型有多大",转向"同样一瓦电,能完成多少推理"。

物理AI的真正瓶颈,不在模型,而在芯片图3

换句话说,比的不是算力,而是能效比。

趋势二:能把物理AI跑通的,一定不是GPU公司,而是架构创新公司    

为什么传统的GPU路线在物理AI的端侧场景里很难跑通呢?    

因为GPU的设计原点,就不是为了端侧推理。


GPU的故事始于图形渲染——一堆像素并行处理,计算模式高度规整,数据一次性加载到显存,然后GPU全力计算。在这个场景下,GPU的利用率很高。


后来人们发现GPU也能跑AI训练,而且效率不错。因为AI训练也是类似的模式——大量数据一次性喂进去,模型参数都在显存里,GPU满负荷跑几个小时甚至几天。


但推理不一样,尤其是边端推理。

边端推理有几个跟训练完全不同的特征:      

第一,数据是"流式"的,不是"批量"的。    

训练的时候,你可以把几千张图片组成一个batch一次性喂给GPU,让它跑满。但推理的时候,数据是实时进来的——一帧视频、一张图片、一组传感器数据。你不可能等攒够了100帧再处理,因为用户要的是实时结果。


Batchsize越小,GPU的利用率就越低。行业里有个公开的秘密:在很多实际推理场景里,GPU的算力利用率不到30%。没有足够的数据填满计算单元,很多核心只能闲着。

第二,延迟是硬指标,不是"越快越好"。    

训练的时候,你只关心总训练时间。但推理不一样——自动驾驶的障碍物检测、工业产线的缺陷识别、机器人的运动控制——这些都有严格的延迟要求。


GPU的架构决定了它的延迟是"批次性"的——一批数据一起算,算完一起出结果。你想把延迟做低,就得减小batchsize,但这样利用率就下来了。

低延迟和高利用率,

在GPU架构下是一对天生的矛盾。    

第三,功耗是成本,不是"技术参数"。    

在数据中心里,一颗GPU耗电几百瓦,虽然也心疼,但数据中心本来就是建来供电散热的,功耗的边际成本相对可控。


但在边端,情况完全不同。一台边缘设备可能只有几十瓦的供电预算;一个电池供电的机器人,每多一瓦功耗,续航就少一截。更重要的是,功耗不只是电费,它还意味着散热——功耗越高,散热系统越大越重,设备的体积和成本都上去了。

所以你会发现,如果用传统GPU的思路做端侧物理AI芯片,你会陷入一个死循环:要算力→堆核心→功耗上去→散热体积变大→成本上升→端侧部署不起→只能回传云端→延迟和带宽又扛不住。      

这就是为什么我说,能把物理AI跑通的,一定不是靠堆算力的GPU公司,而是做架构创新的芯片公司。      

睿芯高光D35走的就是这条路。它用的不是GPU架构,而是数据流架构。


数据流架构的核心思想很简单:数据驱动计算,而不是指令驱动计算。数据一进来,就沿着数据依赖关系"流"过计算单元,走到哪算哪。


只要有数据,计算单元就在工作。不存在"等指令""等调度"的问题。

物理AI的真正瓶颈,不在模型,而在芯片图4

图片来源:Mythic AI — Dataflow Architecture


这个架构上的差异,在端侧推理场景中转化为三个实实在在的优势:

① 算力利用率更高。不需要凑batch,来了就处理,计算单元不闲着。同样的晶体管预算,能完成的实际推理量是GPU的数倍。      

② 延迟更低更确定。数据流架构的延迟是"路径延迟"——数据从进来到出去经过多少级计算,延迟就是多少。不需要等其他数据,不需要凑批次。      

③ 能效比更好。行业里有个数据:一颗传统AI芯片里,真正花在计算上的能量不到20%,剩下的80%都消耗在数据搬运上。数据流架构从根本上减少了数据搬运——中间结果直接进入下一级计算,不需要频繁写回主存。      

这不是10%、20%的优化,而是架构级的效率革命


具体到数字上,高光D35的综合能效比较传统方案提升数倍。你想想看——同样的功耗下,推理吞吐量极大提升;同样的推理量下,功耗大幅度降低。在边端场景,这就是能不能落地的差距。

打个比方你就更好理解了:如果说传统GPU是"集中供暖"——烧一个大锅炉,通过管道把热水送到各家各户,管道损耗大,每家想要调节温度也不方便;那数据流架构就是"分户式地暖"——每个房间自己产热自己用,热量损失小,想开就开想关就关,效率天然就高。      

物理AI的端侧场景,需要的正是这种"分户式地暖"。    

趋势三:物理AI也会有自己的"RISC-V时刻"    

如果说能效比的问题,可以通过架构创新来解决,那还有一个更深层的问题:生态。      

目前的现状是,在物理AI领域,芯片来自不同厂商,模型来自不同团队,传感器来自不同公司,场景分布在不同的工厂、仓库、农场、医院。如果大家各做各的,行业缺乏统一的标准和开放的底座,就很难形成合力,实现快速规模化。


这样的问题在别的领域也出现过。


比如当年的芯片行业,也有类似的问题——每个芯片厂商都有自己的指令集、自己的工具链、自己的生态。开发者想换个芯片,几乎等于重写一遍代码。


后来这个问题被RISC-V解决了一部分。RISC-V是一套开放的指令集架构,任何人都可以免费使用、自由修改。它把芯片设计的基础底座给标准化了,让开发者不用再为不同的指令集反复适配。


再比如AI行业,也有类似的问题——GPU厂商用CUDA把开发者锁在自己的生态里。你想用别的芯片?行,先把CUDA上的代码都迁过来再说。这就是为什么CUDA成了英伟达最宽的护城河。


但现在,风向变了。


RISC-V在AI芯片领域的渗透率正在快速提升。越来越多的AI芯片公司选择用RISC-V作为CPU内核的底座——因为它开放、免费、不受制于人。

物理AI的真正瓶颈,不在模型,而在芯片图5

图片来源:South China Morning Post — RISC-V Open-Source Chip Design


而物理AI,很可能会成为RISC-V全面爆发的下一个主战场。

 为什么这么说?三个原因:      

第一,物理AI的市场足够分散,没有垄断者。    

大模型训练市场基本被英伟达垄断了,你想挑战CUDA生态几乎不可能。但物理AI不一样——场景分散、需求多样、还没有形成绝对的霸主。这就给新的架构和新的生态留下了空间。    

第二,物理AI对供应链安全的要求更高。    

很多物理AI的落地场景——安防、工业、自动驾驶、机器人——都涉及关键基础设施和供应链安全。用国外的封闭架构,风险太高。RISC-V的开放性,天然契合这种需求。    

第三,RISC-V+数据流,是天作之合。    

RISC-V解决的是CPU指令集的开放问题,数据流解决的是AI计算的效率问题。两者结合,就是一个开放架构+高效计算的组合。既有生态的灵活性,又有架构的性能优势。


睿芯高光D35就是这个组合的产物——     


12核全自研RISC-V CPU,内核IP获Intel全球采购认可,加数据流LPU,一颗芯片搞定CPU控制+AI推理。

      

它不是一颗纯AI加速卡,它是一颗完整的物理AI系统级芯片


更重要的是,RISC-V的开放属性,意味着它可以快速适配各种场景和算法。安防场景、工业质检、自动驾驶、机器人、智能存储——不同的场景需要不同的软件栈,但芯片底座是统一的。开发者不需要为每种芯片重新学习一套工具链。

这就像当年的安卓——不是因为安卓比iOS技术上强多少,而是因为它开放,所以所有手机厂商都能用,所有开发者都愿意适配。最后生态滚起来了,市场份额也就起来了。      

物理AI也会走同样的路。封闭生态可能占据高端市场,但开放架构会吃下更大的增量市场。而RISC-V+数据流,很可能就是物理AI时代的"安卓组合"。    

拐点已经到来    

讲完这三个趋势,我们再回头看睿芯高光D35的量产。    

它的意义不只是"又多了一颗国产AI芯片",而是代表了一种技术路线的成熟——数据流架构从实验室走向量产,RISC-V从IoT走向高端AI芯片,物理AI的核心矛盾从"有没有模型"转向"能不能落地"。


很多产业的拐点发生时,看起来只是一颗芯片的量产、一次产品的发布、一笔融资的到位。但几年后回头看,你会发现那个时刻恰恰就是整个行业的拐点。


物理AI很可能正处于这个拐点。

物理AI的真正瓶颈,不在模型,而在芯片图6


答案不在云端的数据中心里。


答案在每一个摄像头里、每一条产线上、每一台机器人身上、每一辆汽车中。

答案在端侧。

答案在能效比里。

答案在开放的架构创新里。

而睿芯高光D35,就是这条路上的一个里程碑。

关于数据流技术的传承,多说一句:    

睿芯的数据流技术不是凭空冒出来的。它的源头,可以追溯到六十年前MIT的Jack Dennis教授——数据流计算模型的奠基者。


Dennis有一位中国学生,叫高光荣——新中国第一位MIT计算机博士,IEEE/ACM双Fellow。他用四十年时间,把数据流思想从一个理论模型发展成完整的体系结构,从系统模型、微架构到编译技术、运行时系统,打下了现代化的完整地基。


高光荣的学生范东睿,从龙芯1号开始,到Godson-T众核处理器,到DPU系列,再到今天的高光D35——三代人,一条路,六十年传承。

高光荣教授生前曾亲口评价睿芯的芯片:"这个芯片就是应用了原汁原味的数据流的思想。"      

他还说过一句更有远见的话:"在数据流的技术前沿方面,中国有条件也应起到主流和主导的作用,外国人将会到中国来学数据流。"      

今天,当高光D35从流水线上走下来,当它在安防、工业、机器人等一个又一个物理AI场景中落地时——我们知道,他的预言正在变成现实。

物理AI的真正瓶颈,不在模型,而在芯片图7


来源:睿芯RICORE

物理AI的真正瓶颈,不在模型,而在芯片图8

 点赞、分享、在看 

 ↓ ↓ ↓ 

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 芯片
more
专访任利锋:那个参与创立抖音的人,如今在工厂里做AI
2026世界机器人大会:从Model到Organization,AI进入「群智」时刻
DeepSeek 上线多模态,我用它做了《牛来》小游戏|AI 上新
AI智能体如何真正落地?AGNTCon + MCPCon China揭晓九大技术路径
AI洗稿黑产现形记:晋中警方斩断9000账号矩阵,涉案流水超160万
AI洗稿黑产现形:晋中警方斩断利用实名账号造谣牟利链条
【晶圆制造要闻简报】SMIC与Samsung先后提价,AI需求推动全球晶圆产能重回紧平衡
跨维智能贾奎:Physical Token经济学,物理AI落地关键
NVIDIA 培训 | Cosmos 3 自学新课上线,多模态 AI 培训班同步报名!
具身基础模型应该怎么去scale?WRC上GigaBrain-0.7给出了答案
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号