
编辑:吕鑫燚
出品:具身研习社
中国具身智能的创新浓度,正在发生一些值得重新打量的变化。
最近,乐享科技与 OpenAI 围绕技术理念、概念表达等产生诸多争议话题。一家中国机器人公司也走进了更广泛的视野。
这场事件中,更具有警示意义的,是对下一阶段智能的追问。
比如 OpenAI 首席科学家 Jakub Pachocki 在《An Alien Mind》中讨论递归式自我提升、泛化与对齐的概念;乐享科技则将自主认知、持续学习、自进化,落地在了机器人通用大模型以太大模型上。
这表明,具身智能正在逐步抛弃大语言模型的惯性,从单纯的数据和训练模式研究维度跳出,转而思考,如何让机器人在不断变化的环境里,既理解行动的物理后果,又能保持任务与经验的连续性,并在长期交互中形成自主判断和自适应表达?
乐享科技给出的答案,是一次更深入的架构探索。新发布的跨本体通用大模型以太大模型采用以神经元分配为核心的能量驱动架构,尝试贯通感知、记忆、推理、运动控制和物理反馈,在 VLA、WAM 之外寻找新的 Physical AI 路径。
模型发布之后,乐享科技又把验证现场搬到了户外,围绕点单、烧烤、上菜完成了一场开放环境直播,让机器人面对真实参与者和持续变化的需求。技术路线、验证方式,以及一家公司的自我定位,在这次发布中连在了一起。
现场超过30位行业媒体和科技博主亲眼见证,官方及合作媒体平台线上直播观看人数超550万。
这是一次理解以太大模型的窗口,但这背后实际上是乐享科技试图完成的三次跳跃。

“机器人的 ChatGPT 时刻,就是抛弃 ChatGPT!”
乐享科技把这句话写在了以太大模型官网。锋利的措辞,折射出背后深刻的问题,机器人期待自己的智能突破,是否必须沿着语言模型已经走通的道路继续前进?
VLA 与 WAM 为行业提供了两类重要探索。前者将视觉、语言与动作联系起来,典型方案借助预训练视觉语言模型获得知识与理解能力,再学习机器人控制;后者把世界变化的预测与动作生成联系起来,尝试让机器人在行动中利用对未来状态的判断。两条路线都在推进泛化,也都在寻找更有效的物理交互学习方式。
乐享科技希望跨过的,是动作生成与世界预测背后更深一层的障碍。当身体、环境与任务持续变化,智能系统如何把感知、判断、行动与经验积累组织成一个连续的过程?乐享科技创始人兼 CEO 郭人杰在技术阐述中,把矛头指向了语言的角色上,语言是否必须成为驱动动作学习、连接认知与控制的中间枢纽?他认为“能量是比语言更本质”,在以太大模型架构中,能量的流动贯穿大脑运转。

类比人脑的突触可塑性,以太大模型也具有在持续学习中动态自适应调整权重的能力。其通过能量函数驱动状态演化、连接调整和信息增益,免除反复Fine-tuning,在统一能量景观下,实现在线权重自适应,并通过内生的自奖励机制形成持续优化的闭环。
与此同时,以太大模型给出的架构选择,是让物理交互成为原生内核。按乐享科技的描述,语言只是众多输入输出模态之一,主要承担交互接口的作用;视觉、深度、力觉、听觉等信号可直接参与多模态理解,系统无需先把环境信息统一转写成文字,再逐层翻译为动作。它希望缩短认知与身体之间的距离,让真实执行结果持续改变后续判断。
此前流出的 Demo 中有几个细节,让这种主张有了直观的写照。据乐享科技披露,两台不同机器人只接受“收拾房间”这一高层指令,便自主分工协作,全程无遥操、无剪辑。够不到目标时,机器人寻找箱子垫高自己;擦玻璃迟迟没有效果时,它意识到污渍来自玻璃外部,把手伸到窗外,调整操作;一台机器人遇到身体能力限制,另一台则介入协助。

“仿生模型架构+能量驱动”“仿生模型架构+能量驱动”,是乐享科技对这套技术的概括。其所描述的完整神经通路,一端连接高层情景记忆与意图认知,另一端直达底层力位控制与本能反射。高层负责理解目标、调取经验和规划任务,运动层处理轨迹与误差,底层则直接响应接触、碰撞等物理变化,信息在这些层级之间双向流动。
这种设计尤其强调不同问题的响应节奏。看不清目标,需要主动转动视角、移动身体,补齐信息;物体打滑,需要根据传感器反馈及时调整动作;反复操作无效,则需要把结果交回高层,重新审视方法。底层的快速反射无需等待高层逐帧推理,上层认知也不能只下发指令,却收不到身体的反馈。
与这条通路相配合,以太大模型用流式记忆保存环境变化、任务经历和交互记录,并随现场状态更新。元认知则负责评估系统理解到了哪一步、哪些信息还不够,以及当前计划是否可行。按郭人杰的阐述,模型还会依据任务难度动态分配计算资源,通过信息增益决定是否补充观察与检索,把推理的投入同实际任务联系起来。
这些设计被乐享科技归纳为三个特质:Consist(世界一致)、Continue(持续自进化)、Character(自主人格)。放在与 VLA、WAM 的比较中,3C 体现的是以太大模型希望进一步推进的能力维度:对物理后果负责的行为、能够延续并增长的经验,以及在交互中自主形成的表达。
由此看,以太大模型所强调的架构创新,是把物理一致性、连续学习与自主交互放进同一套系统里。它要回答的,已经超出一次动作输出是否准确、一次未来状态预测是否合理,还包括任务被打断以后如何接续、经验如何积累,以及同一套智能如何适应不同的身体与交互对象。
与架构一同公布的,还有一组颇具冲击力的数字。按乐享科技披露的训练口径,以太大模型使用约 200 小时人类视频、0 小时真机训练数据,模型规模为 4B。
这组数据把讨论带向了学习效率。具身智能的进步,需要多少真实交互,又能从每一份经验里获得多少可复用能力?乐享科技希望说明,在扩大数据供给之外,改变经验被理解、组织和利用的方式,同样可能打开增长空间。
因此,所谓“第三条路线”,更适合被理解为乐享科技提出的一套新解法。通过能量驱动与仿生架构,把物理反馈、连续经验和自主判断纳入智能成长的过程。这套解法能走多远,还要把机器人放到不断变化的现实里看。

只有 Demo 远远不够。走出镜头前布置好的任务,也要走出实验室里熟悉、固定的环境。
这次约一小时的户外直播,乐享科技选择了一处路边开放空间,六位 KOL 体验者分为三组,上前与不同性格的机器人交互。点单、烧烤、上菜构成任务背景,现场使用的工具沿用人类日常使用的这一套,机器人需要进入现成环境,规划路线、理解需求,再把任务接起来。
据郭人杰现场介绍,团队下午四点多到场,五点多便开始直播。准备时间仓促,开放空间也没有提供封闭场地里反复演练的条件。现场谈不上井然有序,流程与表现都有不够顺畅之处。这些情况恰好让“真实直播”有了更具体的含义,机器人面对的是一个不会始终配合它的现场。
这场“全球首次户外开放环境机器人直播”,把技术的验证推向了实验室外。换一个场地,来一批新的交互对象,指令随时插入,物品与人的位置也在变化。机器人需要在这些条件下继续组织行动。
一个很具体的片段发生在上餐过程中。被现场称为“服从型”的机器人正在准备服务,一位体验者突然提出“帮我拿瓶水”。机器人完成取水之后,又继续执行原来的工作。这个片段体现的是“断点续做”。机器人需要记住之前做到哪里,判断临时需求如何插入,并在完成后恢复原来的任务。
协作也在现场变得具体。烧烤机器人与服务机器人围绕哪些食物已经烤熟、哪些可以送给客人发生交互,将准备与服务两个环节接起来。这里需要共享的,是不断变化的任务状态,一方的工作结果,成为另一方下一步行动的依据。跨本体通用因此进一步延伸为跨本体协同,同一套智能还要帮助不同身体理解彼此正在做什么。

把这些片段放回路边开放空间,其实就是“泛化”。陌生场地要求机器人重新理解空间、规划行进路线,临时指令要求它更新任务安排,新来客又带来新的表达方式。场景、任务与交互对象同时发生变化,模型需要把已有能力重新组织起来。现场能够观察到的,是它在这组具体变化中的适应表现。
此外,还有一点容易被忽略,即不同性格的机器人,又给直播增加了一层不确定性。同样面对客人,“服从型”机器人会响应临时请求,被称为“暴躁型”的机器人则出现了把盘子直接丢到客人桌上的行为。性格差异由此延伸到了动作选择,甚至影响了服务过程。
按现场工作人员的解释,这些行为来自模型的自主判断,性格并非逐项预设、调参后按脚本表演,团队也无法事先确定它下一步会怎样回应。这是乐享科技对 3C 特征中“Character”的现场阐释。具体行为仍需结合机制与重复验证来理解,但它已经提出了一个产品层面的问题:当机器人开始有自己的表达方式,完成任务之外,还要考虑它如何与人相处。

从产业落地看,固定环境可以帮助系统先跑通,开放环境则会追问部署的代价。每换一个地方,要不要重新布置场地?每换一种交互,要不要重新编排流程?出现插单与打断,是否总得由人接手?这些额外工作越多,机器人交付之后的使用门槛就越高。
乐享科技这次直播令众人驻足,正是因为跳出了 demo 和实验室,为行业提供了观察模型自主能力的连续窗口和范例。要知道,真实世界不会事先替机器人整理好问题,智能系统需要学会在变化里维持工作。这比把一段流程展示得漂亮,更接近具身智能进入日常生活时必须跨过的门槛。

以太大模型带来的第三次跳跃,同时发生在模型能力和公司定位上。同一套智能开始进入不同的机器人身体,乐享科技也由此走出了外界熟悉的“本体厂商”标签,成为具身大模型领域不可忽视的参与者,甚至以太大模型带来的性能颠覆和方向变革,让乐享科技极有可能成为未来具身大模型的引领者。
先看跨本体泛化。此前发布的 Demo 中,运行以太大模型的两台机器人拥有不同的身体条件,却能围绕同一个高层任务形成分工,一台遇到能力限制,另一台甚至可以介入协助。模型需要理解任务,也需要判断不同身体的运动能力、操作范围与物理约束,再决定由谁来做、怎样去做。模型能够在多少种身体上发挥作用,决定着智能系统的扩展效率。随着适配范围扩大,模型积累的价值也有机会越过单款硬件的边界,成为不同机器人共同使用的能力基础。
以太大模型的发布,把此前藏在机器人身体后面的智能能力推到了台前。乐享科技拿出的新成果,是一套希望跨本体运行、能够自主判断并在真实交互中持续学习的机器人智能基础模型。已有的硬件研发,也为这次技术延伸提供了具体支点。本体研发要面对身体的能力与限制,家庭产品要处理人与环境的变化,以太大模型则尝试把这些问题纳入统一的智能系统。硬件产品使乐享科技有机会把模型研发与产品实践接在一起,模型能力的扩展又为更多形态的机器人打开新的可能。
因此,“超级智能”正成为乐享科技建立的核心技术标签。它所指向的公司定位,已经超出了单纯设计、制造和销售机器人本体的范围。自主认知、跨本体通用、持续学习、自我进化,开始成为乐享科技定义长期技术竞争力的关键词。
不过“超级智能”仍是一个需要长期兑现的目标,据郭人杰透露,不久还将继续公开以太大模型的更多技术细节,我们期待看到乐享科技更多的技术主张与验证路径。
结语
与 OpenAI 的“同频”,让乐享科技进入了关于下一代智能的讨论。具身智能距离成熟还远,也因此更需要对底层路线的创新思考。
以太大模型官网写道:“我们的泛化,不是 VLA 换个马甲的按图索骥,靠的是对物理法则的本能敬畏,而不是对 Transformer 和 Diffusion 的盲目崇拜。”这份鲜明的技术主张,为行业增加了一个值得检验的答案。下一阶段的竞争,既发生在机器人做成了什么,也发生在它遇到不会做的事情之后,还能走出多远。
具身大模型是否真的通用,是否能实现递归式自进化,机器人规模的路在何处,这些问题,可以期待下乐享科技和以太大模型继续为我们回答。


