【科技纵览】9月14日,宇树科技正式推出G1+人形机器人,此次迭代聚焦于感知与运动硬件的全面强化。颈部自由度增至两个,视觉系统整合了双目相机、广角单目及3D激光雷达;肩部与腰部电机峰值扭矩翻倍,发热量却降低约70%。远场拾音升级为前四后二的六麦克风阵列,支持声源定位。头顶新增五个触摸点,背部增设DC 54.6V/5.7A外部供电接口,确保持续运行。这六项硬件升级含税售价定为9.5万元,身体构造愈发拟人化。
值得注意的是,此次发布并未提及内置大模型的更新,因为相关进展已在四天前公布。9月10日,宇树发布了新一代通用人形机器人基础模型UnifoLM-WLA-1.0,其中WLA代表World-Language-Action(世界-语言-动作)。该模型规模达6B参数,配套的UnifoLM-ER-1使用了超500万条具身推理样本,而WLA模型则基于约2500小时的真机数据训练。单一模型即可覆盖64项任务,涵盖10项全身操作与54项桌面操作。首批权重已于9月11日上线,形成了“一具身体挂价签,一颗脑子挂许可证”的独特商业形态。
回溯至9月7日晚,一段38秒的视频引发关注。画面中无遥控器或VR头显介入,一台G1在场地中央面对人类拳手的攻击,成功格挡并回击。视频标注“全程实拍,无加速”,宇树将其定义为全球首次由世界模型实时驱动的全自主格斗演示,背后依托的是另一套未开源的UnifoLM-X2-1.0模型。这一周内的三次动作——先展示实时决策能力,再开源新模型,最后发布升级本体——清晰勾勒出其技术推进节奏。
梳理时间线可见宇树的技术演进路径:2025年9月开源UnifoLM-WMA-0,侧重世界变化预测;2026年1月开源UnifoLM-VLA-0,转向动作生成;直至2026年9月发布WLA-1.0,实现世界建模、语言理解与动作生成的统一。这种从预测环境变化到生成具体动作,再到三者融合的路线,反映了行业对具身智能核心瓶颈的探索。
然而,识别物体不等于能执行操作,中间存在所谓的“grounding gap”。为解决此问题,宇树推出了4B参数的具身推理模型UnifoLM-ER-1,基于Qwen3-VL-4B底座,在多项空间理解基准测试中表现优异。例如在Where2Place和VSR基准中分别获得82.0和88.1的高分,显示出其在空间关系判断上的优势。但需指出,这些数据源自不同来源的非统一评测,横向比较需谨慎看待。
在架构设计上,WLA-1.0摒弃了生成完整未来画面的传统WAM思路,转而采用“以交互为中心的世界建模”。通过光流提取动态区域,并利用VQ-VAE压缩为离散token,模型仅预测发生变化的部分。这种策略大幅减少了无关背景的计算开销,使预测更精准且高效。同时,动作被拆解为末端位姿、手部关节和下半身关节三段,分别编码为离散token并对齐输入,实现了全身协同控制的统一表达。
数据层面,2500小时的真机数据构成了模型的核心壁垒。这些数据主要来自宇树自有数据集及BitRobot-HIW-500等公开资源,涵盖了真实家庭场景中的全身遥操作。相较于仿真数据,真机数据虽采集成本高、产能受限,但能确保物理交互的真实性。与之相比,利用人类第一视角视频转换的方法虽成本低廉,却面临形态差异迁移的挑战。两者各有优劣,实际训练中往往需组合使用。
尽管模型在感知跑分上表现出色,但真机任务成功率仍是检验其价值的最终标准。目前64项任务的测试均基于G1本体,跨品牌机器人的泛化能力尚未验证。此外,格斗演示虽展示了实时闭环能力,但在受控环境下进行,不足以证明其在开放环境中的长期稳定性。从可行走向可用,仍需解决长尾情况处理、跨本体泛化及长时间运行稳定性等问题。
宇树创始人王兴兴曾提出,当机器人在80%陌生场景中凭指令完成80%任务时,具身智能才迎来真正的突破时刻,预计需两三年至十年不等。当前,研究者可下载已开放的权重与数据进行验证,但更值得关注的是其在复杂开放环境中的实际表现。毕竟,感知能力的提升只是第一步,如何在物理世界中稳定、灵活地行动,才是具身智能落地的关键所在。
宇树G1+硬件升级与WLA模型开源:具身智能从“看”到“动”的跨越
科技区角
2026-09-19 15:31
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。