田晏林 发自 凹非寺
量子位 | 公众号 QbitAI
上周五,逐际动力线下黑客松实训大赛「创学营2026」的收官现场,选手们正在云上跑最后一轮仿真评测。
他们打开浏览器,登录一台远在云端的工作站,旋转着Isaac Sim里的机械臂场景,调整参数,生成数据。
这一幕要放在3年前很难实现。
筹办类似的比赛,光是找场地、配机器就要耗费1个月的时间。

机器人训练可不是打开电脑,写写代码这么简单。
背后需要Isaac Sim、NVIDIA Omniverse等仿真环境,需要GPU算力支撑,还涉及不同版本软件、驱动和开发工具的统一配置。
一场创学营办下来,每多一名选手,对主办方的环境部署、设备采购和资源管理都会提出更多要求。
更麻烦的是,活动结束后,这些高性能设备又可能长期闲置。买得越多,浪费越大。
逐际动力选择了一种不同的方式。
借助阿里云旗下的AI创研算力平台无影灵构的云上工作站,选手们可以快速接入统一研发环境,算力资源按照实际需求弹性调整,不需要提前采购大量固定设备。

这场演练明面上是在探索「机器人怎么变聪明」,背后的隐藏副本则是「如何让研发机器人的公司,变得更高效」。
为什么训练一个机器人,这么费机器?
大模型让机器人开始具备理解和推理能力。
但从会聊天到会干活,还需要经历一整套复杂流程:遥操作数据采集、算法调试、仿真训练、真机部署。
与数字AI不同,机器人面对的是一个高度复杂、不断变化的真实世界。
它需要理解空间,需要感知物体,需要预测动作,还需要在真实环境里不断试错。
每一个环节都离不开计算资源支撑。

△图片由AI生成
这也是为什么,具身智能的竞争从来不只是模型参数竞争,更是一场围绕算力、数据和工程效率展开的长期竞赛。
逐际动力联合创始人兼CTO谌骅告诉量子位,过去两年,粗略估算,公司研发团队对算力的需求增长了5到10倍。(吞卡兽.jpg)
而且是有多少卡就能吃掉多少卡。
算力需求暴涨,只是问题的一面。
更大的变化在于,机器人研发正在从单点实验走向复杂工程协作。
过去,一名算法工程师拥有一台高性能工作站,配置好环境,就能完成部分研发工作。
但今天,一个完整的具身智能团队,需要同时处理仿真训练、数据处理、模型迭代、多人协作和真机验证。
研发资源不再只是「一台机器」,而是一整套持续运行的基础设施。
阿里云智能集团副总裁、终端智能计算事业部总裁张献涛认为,云计算的发展已经经历了两次基础设施迁移。
第一朵云支撑了互联网,第二朵云支撑了移动互联网。
而现在,机器人时代需要第三朵云。
这一次,云需要解决的不只是计算资源的问题,而是让算力、开发环境和3D交互能力一起进入机器人研发流程。
话说回来,为什么机器人研发会逼出第三朵云?

一个机械臂抓取物体,看似只是伸手、移动、拿起几个动作,但背后需要理解物体位置、形态、重量、摩擦力以及周围环境变化。
一个人形机器人行走,也不是简单输出几个动作指令,而需要持续调整重心、处理身体平衡、关节控制和空间反馈。
尤其在人形机器人研发中,3D仿真环境需要同时处理复杂场景、机器人运动和物理交互,对图形算力提出了更高要求。
这让机器人研发天然成为高算力行业。
但过去,支撑这种研发的基础设施没有跟上产业速度。
此前,业内通常采用采购工作站-安装软件-配置GPU环境-逐台维护这套模式。
工程师想要搭建一套可用的开发环境,得登录集群,靠命令行一步步安装软件、配置依赖、下载库文件、编译程序、启动各项服务,整套流程经常耗费四五个小时。
这简直是一种「折磨」。
麻烦不说,关键是在团队规模较小时,尚且勉强可行,一旦团队扩大、任务增加,这种方式越来越难适应快速变化的研发节奏和快速扩张的团队规模。
谌骅也表示,实际工作中,团队在仿真环境的配置,训练资源的调度上总会遇到各种各样的小问题。

比如CUDA、ROS2、Isaac Sim等工具链组合复杂,依赖库、驱动之间极易出现版本冲突;
软件、仿真器迭代更新速度快,团队多台本地工作站硬件型号不一,很难做到全设备环境完全统一。
甚至新人入职,或者临时让外包人员进场,还得从零开始下载、编译、调试全套开发环境。
「单人配置耗时长达大半天,这些都是机器人研发中的隐藏成本。」
此外,外包和跨地域协作带来账号、数据权限、审计和离场的回收压力,也是具身智能公司不得不考虑的现实问题。
拥有一个可以云端灵活调用、弹性扩容、开箱即用和安全环境的工作站,迫在眉睫。
把工作站搬上云之后
在与多家具身智能公司沟通后,张献涛发现,当行业走到工程化阶段,环境、算力、数据、仿真这些事,眼下每家公司都在自己搭一遍。
「这背后不是谁愿意重复造轮子,而是这一层还没有变成标准件。」
在他看来,共性越强的部分,越应该被尽早沉淀成标准件。
无影灵构要承载的就是这些共同需求:把具身智能的研发现场搬到云上,环境按需复用,算力随任务调度。
「本体、模型、数据和真实场景,始终应该长在机器人公司自己手里。我们要做的是把基础设施带来的研发摩擦降到最低。」张献涛说。
今年3月,逐际动力与阿里云无影深聊了下。
尽管逐际动力很早就和阿里云建立长期合作,但此前双方仅依托PAI平台、通用GPU算力,完成大规模模型训练的底层算力合作。
而这一次,他们讨论的问题聚焦在具身智能研发全链路的前端工程痛点:
仿真难可信、训练难稳定、真机难规模化、数据难形成高质量闭环。
这四个问题背后,又共同受到环境碎片化、算力错配、成本和安全治理等因素影响。

过去,机器人团队往往需要自己搭建一整套研发环境。
买GPU工作站、安装CUDA和ROS2、配置Isaac Sim、管理不同版本依赖,再把数据在本地和云端之间反复搬运。
对于成熟团队,这是一笔持续投入;对于快速成长的机器人公司,这更像是一种重复建设。
无影灵构给出的思路,是把过去摆在工位上的高性能工作站搬到云端。
一些重型计算单元(GPU、仿真环境、数据盘)全部上云,工程师只用轻量设备通过网络串流画面操作云端工作站。
对工程师来说,最直观的变化首先发生在环境交付。

机器人研发环境最大的痛点之一,就是复杂。
CUDA版本、驱动版本、仿真软件版本之间存在大量依赖关系。一台机器能运行,不代表十台机器都能稳定运行。
尤其对于创学营这类需要快速接入大量开发者的场景,如果每个人都从零开始配置环境,时间成本非常高。
无影灵构提前把研发机器人要用的所有软件、驱动打包做成固定模板镜像。
想新增开发机器,一键复制模板就行;新人登录账号,点开就能用一模一样的环境,不用自己折腾安装。
谌骅表示,过去团队本地配置Isaac仿真环境时,经常会遇到各种报错,而在无影灵构AI工作站里,可直接选现成镜像启动。
「半小时就能开工,很少出故障,稳定很多。」
这不只是节省安装时间,还让机器人研发环境具备了软件行业熟悉的标准化能力。
算力弹性,是另一个关键变化。

机器人研发天然需要大量试错。
算法调优、仿真训练、模型评测,不同阶段对于算力的需求并不相同。
传统模式下,企业只能按照峰值需求采购硬件。
结果就是:忙的时候,GPU永远不够;闲的时候,高价值设备长期闲置。
更麻烦的是,显卡更新换代很快,一次性花几千万自建算力,过两年硬件升级,钱等于打了水漂。
云端工作站改变的是算力获取方式。

据无影灵构产品经理王姣阳介绍,企业可以根据不同任务灵活选择GPU规格。
日常研发保持稳定资源,高峰期遇到训练营、大规模测试等任务时,可以快速扩容,项目结束后再释放。
「算力跟着需求灵活调整。」谌骅说。
从买设备,到调用算力,机器人研发正在进入一种新的资源组织方式。
但对于具身智能而言,仅仅解决算力供给还不够。
决定云端工作站能否落地的,还得看云上的机器人研发体验,能不能接近本地。
云端工作站,先要过「像不像本地」这一关
判断一个云端工作站好不好用,还得看工程师能否感觉到GPU在哪里。
就拿机器人仿真训练来说,工程师需要实时操作3D场景,拖动机器人模型,调整环境参数,观察运动结果。
任何一个环节出现延迟,都会直接影响调试效率。
这也是无影灵构区别于普通云主机的地方。
它解决的不是单纯的计算能力,而是云端3D工作站体验。

无影灵构通过无影自研的ASP流化协议,对图形渲染、视频编码、网络传输、终端解码和输入回传进行整体优化,让云端GPU完成渲染后,将画面实时传输到本地终端。
在现有Isaac Sim对比测试中,这种差异更加明显。
在简单操作场景下,拖动坐标轴时,无影ASP与NVIDIA WebRTC streaming均可以达到30fps。
但当操作复杂度提升到模型文件拖动旋转时,WebRTC帧率下降至约22fps,而无影仍保持约29fps,高出7fps,帧率提升约32%,达到满帧水平的97%左右。
稳定帧率,对于机器人研发意味着什么?
工程师旋转机械臂模型、调整仿真场景时,不会因为云端传输产生明显迟滞。
除了画面流畅度,带宽效率也是云端工作站能否规模使用的关键。
在相同模型旋转操作中,无影ASP平均带宽约1.9Mbps,相比WebRTC等方案降低约50%。
按每天使用8小时估算,单台终端日均流量消耗约7GB。
更低的带宽占用,能够支持更多研发人员远程接入。
再看弱网环境下,无影灵构的表现也是相当稳。
在丢包率达到10%、带宽限制在5Mbps的两组独立测试中,无影仍能维持约27fps,相比其他方案帧率提升约29%。
发生断网后,系统也支持自动恢复和重新连接。
这些技术层面的量化指标,表明云端工作站正在从「远程GPU」变成「机器人研发基础设施」。

△图片由AI生成
别看把工作站搬上云,貌似只换了台机器的位置,无影灵构AI工作站实际要同时解决四件事:
环境交付——把CUDA、ROS2、Isaac Sim这套极易冲突的工具链预制成行业镜像,一键复制; 图形算力——3D仿真场景要在云端渲染、串流到本地,还要保证工程师拖动视角时的实时手感; 弹性调度——高峰期分钟级扩出上百台,项目结束即释放; 安全治理——数据不落地、权限可管、外包人员离场即回收。
这四件事里,前两件是技术门槛,后两件是工程门槛。一件都不能缺。

△图片由AI生成
目前,无影灵构与逐际动力的合作主要集中在模型训练、仿真评测和云上研发环境。
但随着机器人研发进入数据驱动和持续迭代阶段,无影灵构的价值也将从提供云上工作站,进一步延伸到承载完整的具身智能研发工作空间。
未来,灵构将逐步连接遥操作数据采集、数据处理、标注质检、模型训练和仿真评测,让任务能够从工作空间发起,让结果重新回到项目,并通过统一的权限、版本和运行记录,使研发过程更加可复现、可比较、可审计。
据悉,多家具身智能头部企业已基于无影灵构AI工作站构建云上数据采集工厂和仿真评测,加速机器人的研发周期。
算力像水电一样,还需要最后一里路
从逐际动力与无影灵构的合作可以看出,整个具身智能行业研发方式正在发生剧烈变化。
越来越多机器人团队正在从「买设备、配环境、管服务器」,转向「按需调用算力、复用研发环境、云上协同开发」。
原因很简单,机器人研发天然需要大量试错。
但真实机器人测试成本高、周期长。
这也是为何逐际动力会将与无影灵构合作的第一站,放在仿真评测上。
但仿真只是起点。当机器人进入长期研发阶段,仅有算力还不够。

机器人团队还需要解决环境配置、模型训练、数据处理、真机部署等一系列问题。
换句话说,行业需要的不只是一台更大的服务器,而是一套完整的研发基础设施。
这也是为什么,机器人企业正在尝试把自身积累的工程经验进一步标准化。
今年4月,逐际动力正式开源「FluxVLA Engine」。
这是一个标准化具身智能大模型工程底座。
目标是让拥有真实场景数据的合作伙伴、用户,也能够自主完成数据处理、模型搭建、仿真评测和真机部署,大幅降低了VLA全研发周期的工程门槛。
某种程度上,它与无影灵构探索的方向形成了呼应。
据王姣阳介绍,无影灵构也在推动具身智能研发中各类零散的基础能力实现标准化。
包括高性能3D工作站、统一开发环境、行业镜像、算力调度以及企业级安全管理,让机器人团队不必重复搭建底层研发设施,而可以将更多资源投入到模型、算法和场景验证中。
两者关注的,其实都是降低具身智能研发门槛,只是切入角度不同。
FluxVLA Engine承载的是逐际动力在机器人研发过程中的核心经验。
从数据处理到模型训练,从仿真评测到真机适配,这些环节直接连接机器人能力迭代和最终产品表现,因此需要机器人企业持续沉淀。
谌骅也说,FluxVLA Engine和无影灵构代表了具身智能基础设施中不同方向的平台能力,双方完全可以在研发环境、工具链和基础设施层面展开更深的结合。
因为无影灵构并不参与机器人本体设计,也不替代企业定义模型路线,只是提供稳定的云上工作空间,让不同技术路线的机器人团队都可以更高效地开展研发。
直白点说,机器人公司负责回答「机器人应该如何工作」;无影灵构负责解决「研发这件事如何更高效完成」。

有没有觉得这条路径,和云计算的发展非常相似?
云计算没有替互联网公司创造产品,也没有决定应用应该如何创新。
但它把服务器、存储、网络这些过去需要企业自己建设的基础能力,变成了可以按需调用的公共资源。
最终,互联网公司的竞争焦点也从「谁有更多服务器」,转向「谁能做出更好的产品」。
而现在,具身智能行业也在经历类似变化。
当算力、环境和研发工具逐渐基础设施化,机器人公司的竞争重点,也将从「谁搭建了更多底层设施」,转向「谁能让机器人更快学会新技能,并真正进入真实场景」。
One more thing
技术本质上没有壁垒,壁垒是迭代速度,技术领先只是时间红利。
这是谌骅给出的判断。
在具身智能这个技术路线尚未收敛、各家都在快速试错的阶段,时间红利就是一切。
实际上,无影灵构在具身智能之前,已经在AIGC的3D内容生成、工业设计的实时渲染、影视广告的后期制作这些高算力3D场景里跑了好几年。
那些行业同样被高端工作站的采购周期折磨,同样面临项目来了缺算力、项目走了机器闲置的窘境,同样需要在云端完成低延迟的3D交互。
只不过,具身智能对这套基础设施的要求更苛刻:
仿真场景的3D交互要更实时,ROS2和Isaac Sim的镜像要更完整,数据安全策略要更严格,算力弹性要更灵敏。
从这个角度看,具身智能更像是高算力3D云工作站的一个极限考场。
基础设施从来不抢主角的戏,它只是把已经铺好的路,往更多需要的地方多修一程。
具身智能恰好是这一程里,目前最着急赶路的那批人。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
🌟 点亮星标 🌟