点击下方卡片,关注“具身智能之心”公众号
8 月 3 日早上,DYNA Robotics 联合创始人 York Yang 在个人公众号发了一篇文章,标题叫《规模化才是充分条件》("DYNA2 要来啦")。当天晚上,这篇文章被设置成了不可见。
文章不长,倒是没说下一代模型细节,核心信息我们总结了一下:
1. Demo、融资、拿下首个客户,都只是拿到入场资格。真正淘汰玩家的,只有规模化。
2.规模化需要产品全流程能力与可复制的交付体系,技术、工程需同步推进。
3.泛化来源于海量多元物理经验数据的预训练。
一家沉寂了大半年的公司,发新东西之前先把方法论亮出来,这个动作的诚意还是很足的。
而且"规模化"的说法不是临时起意。过去一年多,York 写了五篇长文,从 2025 年解释"我们为什么去叠餐巾",到今年 4 月的泡沫、5 月的三道门、6 月的 scalable PMF,有一条线始终在收紧。
8 月 York 的分享,把前面说的东西闭环上了。
梳理完这些纵向的发展,我们想看清这家公司到底在做什么。
01
Dyna Robotics 这一年做了什么
DYNA 2024 年 9 月成立,三位联合创始人:
1)Lindon Gao 和 York Yang 是连续创业者,上一家公司 Caper AI 做超市智能购物车,后来被 Instacart 以约 3.5 亿美元现金加股票收购;
2)Jason Ma(马也骋)任首席科学家,宾夕法尼亚大学抓取实验室博士,主攻机器人基础模型和 RL,在 Google DeepMind、英伟达、Meta AI 都做过研究。
一年多融了两轮:2025 年 3 月种子轮 2350 万美元,9 月 A 轮 1.2 亿美元,投后估值超过 6 亿美元,投资方里有英伟达、亚马逊、三星、LG。

关于这一年的进展,York 在 4 月的文章里提到过,DYNA‑1 发布后团队并未拿出亮眼新成果,内部挣扎不断,外界甚至一度以为项目已经停滞。即便有人劝他低调,免得影响投资人信心,他还是选择直面事实。
这一年,主要是在做四件事。
1
一件最枯燥的事情,叠餐巾
2025 年 DYNA-1 发布的时候,别家都在秀人形跑跳,DYNA 却选择在工位上闷头叠 24 小时的餐巾。
选这么个场景,不是图省事。

Jason 在 CVPR 上算过一笔账:现阶段主流 VLA 模型成功率大多只有 70%–80%,应付论文 Demo 足够,但还达不到量产所需的 99% 。当然,目前全世界也没谁能真的做到。
这十几个百分点的差距,单靠堆数据根本做不了。所以 DYNA 的团队不再盲目追求宽泛的通用机器人能力,公司目标收缩场景、聚焦落地,锁定了重复性强、高吞吐、可连续作业的餐巾折叠任务。
餐饮门店的餐巾折叠高度依赖人工、单日作业量巨大,是非常适合机器人规模化落地的刚需场景。
技术上做了两版。
第一版能连续跑 24 小时的模型,采用奖励模型给数据打分、加权优质样本的做法,本质上是离线 RL 的变体。但那版有毛病:动作慢,而且一旦卡进错误状态,几分钟都缓不过来。

真正好用的是后面的版本。他们让奖励模型跟策略模型同步跑,专门盯那些进度曲线不正常的片段,把故障场景挖出来交给人工补数据,这套叫人机闭环主动学习。
迭代出来的 Dyna 一代,餐巾折叠成功率超过 99.4%,能连续叠 850 条以上;如今吞吐量比初代又提升了 80%,内部前后跑了四轮长时间稳定性测试。

2
把机器人铺进真实门店,所以做部署
机器人是真铺出去了。他们以折叠为锚点,进了酒店、餐饮、医院这些要靠大量服务人员的场景。
萨克拉门托一家自助洗衣店里,机器人整天叠灰色毛巾,全程无故障,叠齐了堆到一边,交给店员分发给顾客。

跟红牛的合作是在品牌活动现场,机器人用工具开饮料罐。

CoRL 2025 的展位上摆了原型机,做的是零样本演示。现场不少人故意上手打乱待折的衣物,模型都能快速恢复状态,接着把从没见过的新款衣物叠出来。
硬件上一直在控本,视频里机器人用的都是经济型量产机械臂,眼下还在自研半人形,整套系统成本在 5 万美元以下。

但铺出去和铺得开是两码事。跑得最久的一家客户,在 daily usage 的情况下已经在店里运行了大约 10 个月,可这样的客户数量暂时还不多,模式暂时还谈不上可复制。
York 自己复盘过这一段。
DYNA‑1 发完之后好一阵子没消息,其实就是卡在部署上了。按理说部署应该越做越快、越标准化、越可扩展,但用他自己的话说,这事儿 “并没有自然发生”。部署动不动就要几周,甚至按月算。
机器买回来,还要折腾好几个星期才能正常干活,这哪算什么好产品。他也不藏着掖着,有些客户一开始就是冲着新技术、搞搞品牌宣传才用上 DYNA,最后算下来不赚钱,就终止合作了。
所以他说:硬件不等于渠道。
车没智驾也能卖,机器人不行,没智能就是堆废铁。真正的渠道,是一整套包括场景评估、数据回流、现场调试、远程诊断在内的系统工程。
3
停下来,把问题重新拆了一遍
碰壁之后,他们花了几个月讨论可扩展性、数据、预训练和硬件本体。发现一个更底层的困境:整条链路上,没有一个环节的指标是真正明确的。
模型层,该看预训练用了多少小时数据,还是看 action MSE loss 有多低?渠道层和硬件层也是同样的困境。终端场景本身还没定型,终端指标就定不下来,中间每一环的指标也都无法确定。
基于这条线,York 点出三个卡点。
1)基础能力缺失。夹爪和手臂的灵巧度不够,人随手就能干的活机器人干不了;移动能力弱到得配个人在旁边辅助,那不就白做了。
2)部署的 know-how 不明确。没有一套能在生产场景里快速迭代的系统,这种经验根本不可扩展。
3)所谓数据 scaling law。行业最爱讲"多少小时数据",可这些数据能不能转化成下游生产力,今天连统一的衡量和 eval 标准都没有。
4
换掉技术底座,从 VLA 转向 VAM
六月份的时候,York 聊了内部的技术转向:从 VLA 换成内部叫 VAM(Video Action Model)的东西,其实 2025 年底就开始用了,只是不爱用 world model 这个词,嫌太 hype。
当时网上正吵"VLA 已死、world model 新王将立",他觉得跑偏了:架构漂不漂亮其实不重要,基模能覆盖更多的机器人通识本身才是目标。
论据有点反常识:他说曾有顶尖大模型公司的资深学者告诉他,预训练时把图片和视频数据全去掉,各种智能度 benchmark 的结果相差无几。
这等于说今天的 VLM 压根没把视频里的物理动态学进去,而这正是机器人最缺失的一环。视频模型不一样,生成视频本身就要求动作连贯,等于逼着模型在预训练阶段学一点物理。
VLM 也没丢,留着做推理和记忆。人记事不会把每一帧的像素都存下来,时间一长就变成"我做过某件事、结果怎样"这么一句,这种记忆压缩是视频模型干不好的。
Jason 在 CVPR 上也点过这层:在线 RL 的探索环节被砍掉了,但 RL 的思想没丢,奖励塑形、Critic 这些还是可以沿用,只是改成靠奖励模型定向挖问题来驱动。

02
DYNA的思路,
Scaling 前先解决泛化问题
York 在文章中列举了三个非常现实的问题:
为什么机器人作业,还需要专人在一旁辅助递取物料?
如果客户对现有的毛巾折叠效果不满意,能否快速调整折叠逻辑?
这台机器人日常可以完成 1000 条的折叠量,为什么今天只产出了 100 条?
三个问题分别对应移动与长程任务规划、可教性、鲁棒性与错误自纠错三大技术命题。
DYNA 最初思路是打补丁迭代:现场新增规则,或是为单个客户定制专属模型。但团队很快发现此路不通,规则是写不完的。。。
每新增一个客户,都要重复一轮繁琐修补。
他给出六个方向:泛化性、工程投入、可教性、规模落地、产品载体、端到端自主。其中变化最大的是两条。
泛化被提到了最高优先级。把泛化"当成首要的研究问题,而不是部署的副产品"。这是对之前逻辑的正面修正,原来设想是先部署、数据自然反哺模型,现在的说法是这份能力没法来自早期几个客户 site,只能靠巨量、多样的人类物理经验数据做预训练。
这等于承认纯"部署驱动"走不通,还是要回头做预训练。
Jason 也认为真实场景 RL 不是眼下的瓶颈,瓶颈在工程基础设施。以前指望用真机 RL 解决的那些问题,现在靠优化工程方案、升级预训练模型就能搞定。这和 York 说的"执行靠部署体系",是同一件事的两个切面。

可教性成了新标尺,但它建在泛化之上。York 的定义是:一台机器人的价值上限,不在于出厂那一刻会做多少件事,而在于教会它一件新事的门槛有多低、速度有多快、有资格教它的人有多少。
标准是一个完全不懂技术的现场员工,几个小时教会它一件新事。这看起来是降低用户门槛,实际上抬高的是模型要求:模型得能从极少的示范里抽出任务结构再迁移出去。所以这六件事不是并列的,泛化是地基,可教性是地基上的楼。
目前离这个标准还有距离。Jason 那边能做到的是,新任务用不到一小时的专项数据、配标准的监督微调就能跑出可用模型,但操作的仍然是工程师,不是现场员工。门槛在往下掉,只是还没掉到 York 说的那个位置。

把 DYNA 的路线放回行业里,位置其实挺微妙。眼下"泛化到底从哪来",可能至少有三种答案:
部署驱动。先让机器人在真实场景里跑起来,用数据反哺模型。代表如智元机器人,2026 年 3 月完成第 10000 台通用具身机器人下线,3C 产线作业成功率 99.99%;越疆全球部署超十万台,基于实景数据做"一脑多体"。好处是数据来自真实需求、商业闭环近;风险是泛化不够时,每进一个新场景都要重新调试,部署越多工程成本越高——DYNA 撞的正是这堵墙。
模型驱动。先靠大规模预训练让机器人具备通用能力,再推向市场。代表如 Physical Intelligence,π0.7 做到"一个模型通吃多任务";国内原力灵机推出 4B 参数的 DM0.5(这是一个拥有40亿个参数的模型,参数越多,通常意味着它能学到的技能越丰富),千寻智能强调预训练加少量场景数据微调,蚂蚁灵波发布 LingBot-VA 2.0。底气来自大模型的经验,但物理世界吃不吃这一套,还在争论。
场景驱动。从一个具体商业场景建立闭环,跑通再横向扩展。代表如酷哇科技,在全球 50 多个城市部署万台级机器人、沉淀 50PB 数据;擎朗智能提出"岗位化",全球超 10 万台机器人在酒店、商场、餐厅运行。商业验证快,难在跨场景迁移。
DYNA 现在的位置,更像是在模型驱动和部署驱动之间找一个中间点:先把预训练的泛化能力顶上去,再用可教性把部署的门槛降下来。它没有放弃部署,只是不再指望部署自己长出泛化。

03
从 DYNA 身上,我们看到了什么?
DYNA走的这些路,也不仅仅是他们一家的事情。
York 也把视角拉到了整个行业,给所有具身智能公司定了一套评判标准。

在 5 月的文章里,他复盘了无人驾驶、XR、无人零售等行业的过往,总结出行业必经的三道关卡:资本门、使用门、ROI 门。简单说就是:烧的钱能不能跑出阶段性成果、产品能不能被高频真实使用、客户能不能持续付费、真正算得过来账。
他的核心观点是:三道关卡不用完全同步推进,但差距不能长期悬殊。
很多人会问,机器人会不会迎来 ChatGPT 时刻,一把跳过这三道门?
York 的答案是否定的。纯软件行业边际成本极低,可以抹平发展断层;但机器人不一样,中间还有硬件稳定性、故障自恢复、高昂部署成本、漫长回本周期等一堆物理世界的硬核难题。

到了 6 月底的文章,他的视角更加落地。
借着美光、闪迪等存储企业的发展规律,他拆解出传统工业机器人 “四大家族” 的核心问题:受限于规模化能力,即便有市场需求,也始终做不出顶级体量,成不了行业巨头。
用这套逻辑回看当下的具身智能行业,会发现 DYNA 这一年的坎坷经历,不是特例。
目前有三件事,正在成为整个行业的普遍常态。
1
泛化路径的摇摆
DYNA 从"部署驱动"转到强调预训练,不是它一家的纠结。前面那三条路线摆在一起就能看出来:至今没有谁真正跑通过规模化,所以每条路都还有人信,也都还没人能被证伪。
而且这三条的分歧不在技术偏好,在于对"能力从哪来"的根本假设。假设不同,钱怎么花、人怎么招、节奏怎么排全都不同。它们不是三种战术,是三种赌注。DYNA 中途换过位置,恰恰说明这个赌注现在还锁不死。
2
没有统一的度量衡
York 说的"没尺子",是这个行业最难受的地方。以前看 demo 够不够炫、发布会够不够大、出货量数字够不够高,但这些跟做得好不好其实没什么关系。模型该看 loss 还是看成功率?硬件该看运动性能还是平均无故障时间?终端该看签了多少家还是有多少复购?
场景本身还没定型,标准就立不起来,最后只能各说各话。这也是为什么 Scaling Law 喊了两年,谁也画不出一条像 NLP 那样的曲线。
3
ROI 的压力是常态
DYNA 坦承有客户因为 ROI 不达标终止了合作,这种事很多厂商是不会往外说的。过去两年行业主要靠资本和 PR 撑着,不少项目带着试点和示范的性质;现在钱变谨慎了,账就得摆到桌面上。
以前是"有 demo 就有未来",现在是"进了场还得让人续约"。从"客户愿意试"到"客户愿意一直掏钱",中间的路不好走啊。这已经不是哪一家的问题了。
04
写在最后
以上就是关于 DYNA 的复盘。
对照 York 的三道门来看,资本门已经打开,使用门有零星试点落地,但 ROI 门依旧横在所有人面前。
到底哪条路径能率先跑通规模化具身智能?
欢迎在评论区聊聊你的看法。

