天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型

维科网机器人 2026-08-07 15:09
天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图1

微信改版啦!想第一时间接收机器人行业最新资讯,请点击蓝字关注维科网机器人→并点击主页右上角→将公众号设为星标


从“看懂任务”到“安全作业”:天创机器人牵头研发,联合清华大学、东南大学、视源股份、戴盟机器人以及承泰科技,正式发布面向泛工业运维和应急安全救援等场景的“基于可信安全策略的通用工业具身智能融合模型”。

今天,我们正式发布T-WAVES。这是天创机器人面向泛工业运维和应急安全救援等场景构建的基于可信安全策略的通用工业具身智能融合模型,其技术架构为T-WM-VTLA-S。

它不是一个单独的视觉语言模型,也不是一个只停留在实验室演示里的机器人策略。T-WAVES的目标,是基于 T-WM-VTLA-S 技术架构,把视觉、语言、动作、状态向量型触觉、世界模型和外置安全控制放进同一个可训练、可部署、可验证的系统里,让机器人能够在真实场景中完成更长程、更高接触、更高风险的作业任务。

在接下来的发布文章中,我们将陆续展示基于该框架完成的典型任务:

  • 充电枪 /usb等插接类任务:机器人需要完成视觉定位、姿态对准、接触搜索、插入力控制与失败恢复。

  • 柜门开关任务 :机器人需要理解长程任务流程,先开门,再定位目标按钮,并按规则执行。

  • 旋钮操作:机器人需要在受限空间内完成抓握、旋转、限位判断与力矩控制。

  • 按钮操作:机器人需要识别按钮位置,执行动作,在感受到按钮按压程度到位以后会停止按压。

  • 拓展更多场景的作业任务:电力、消防、危化巡检等场景作业

我们的判断很明确:工业机器人不是只需要“会看图说话”的模型,而是需要一个能够把任务理解、动作生成、接触感知和安全约束同时打通的具身智能系统。

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图2

图1 T-WM-VTLA-S 技术架构


T-WM-VTLA-S 由三个核心部分组成:

WM:World Model / 世界模型

不直接替代控制器,而是生成 subtask、goal image、future latent,为策略提供“下一步应该变成什么样”的目标提示,同时会生成目标位置,服务于安全层进行碰撞风险判断。

VTLA:Vision-Tactile-Language-Action

在视觉语言动作模型基础上加入触觉/接触信息,让机器人不仅能“看见”,还能在插接、拧阀、开门、按压等任务中感知接触状态。

S:Safety / 外置安全层

不完全交给神经网络内部“自觉遵守”,而是通过动作屏蔽、空间约束、力矩阈值、任务规则、急停与恢复策略形成独立的安全边界作为“硬约束”。

与从零大规模预训练不同,当前阶段我们选择一条更务实的路线:基于已有 VLM / VLA / World Model 能力进行微调,把 Ego 第一视角数据、UMI 数据和真机数据对齐到统一动作空间,在真实作业闭环中逐步扩大能力边界。



为什么工业机器人需要新的具身智能框架


过去几年,机器人基础模型快速发展。视觉语言模型让机器人具备了更强的语义理解能力,VLA 模型开始把“看见什么、听到什么、做什么动作”统一到一个策略中。

但在工业机器人场景里,问题远比桌面抓取复杂。

插枪不是简单地“把 A 放到 B”。它要求机器人在毫米级位置误差中完成接触搜索,并且在插入力异常时及时调整。

开柜门 + 按消控盘也不是一个单步任务。机器人需要理解“先开门、再识别面板、再按指定按钮”的流程,还要处理门未完全打开、按钮被遮挡、机械臂姿态受限等情况。

配电房旋钮操作更复杂。机器人不仅要识别旋钮,还要抓住、旋转、判断阻力变化,并在接近限位时停止。这里真正重要的不只是视觉识别,而是接触、力矩、时序和安全。

因此,我们认为工业机器人作业能力至少要同时满足五个维度:

1. 空间精度

能够在复杂设备、狭窄空间和非标准工装中完成高精度定位。

2. 时间编排

能够执行多阶段任务,而不是只完成单个动作片段。

3. 接触丰富度

能够处理插入、按压、旋转、拉门、推门、锁扣、旋钮等高接触任务。

4. 工具/设备交互

能够理解真实工业设备、消防设备、电力设备、化工设备的操作逻辑。

5. 安全可控

在高风险环境中,动作必须被约束、可监控、可中止、可恢复。

T-WAVES  正是围绕这五个维度设计。

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图3

图2 五维具身智能框架



T-WAVES :不只是一个模型,而是一套作业系统


T-WAVES  基于 T-WM-VTLA-S 技术架构,让不同模块各司其职,而不是把所有能力都压进一个黑盒策略里。

整体链路可以理解为:

视觉/语言/状态/触觉输入进入 VTLA 主干,World Model 生成未来目标信息,动作专家输出机器人动作,外置安全层对动作进行约束和过滤,最后再下发到真实机器人控制系统。

简单来说:

模型负责理解和生成,世界模型负责想象和规划,触觉模块负责接触判断,安全层负责兜底。

这也是我们没有把安全层完全内化到模型里的原因。对于工业机器人来说,安全不是一个“希望模型学会”的偏好,而是一个必须独立存在的系统边界。



第一层:用 Ego、UMI 和真机数据构建可微调的数据引擎


大规模预训练当然重要,但对于多数机器人公司来说,真正的现实问题是:没有办法一开始就拥有数万小时的机器人数据。

因此,T-WAVES  当前采用的是微调优先路线。

我们把数据分为三类:

  • Ego 第一视角数据

用于学习人类完成任务时的高层语义、任务顺序、目标状态和操作意图。

  • UMI 数据

用于低成本采集人类操作轨迹,并同步记录指尖力触信息,补充手眼协调、末端运动、接触状态和任务过程数据。

  • 真机数据

用于学习机器人本体上的真实动作分布、动力学、延迟、接触反馈和执行边界。

这里最关键的问题不是“数据越多越好”,而是“不同来源的数据如何对齐”。

在 T-WAVES  中,T-WM-VTLA-S 技术架构将动作统一到 TCP-local delta action 空间。也就是说,无论原始数据来自 UMI、Ego 标注,还是机器人真机遥操作,最终都会尽量转换成相对于末端执行器自身坐标系的增量动作:

[dx, dy, dz, droll, dpitch, dyaw, gripper]

对于双臂系统,则扩展为左右臂各 7 维,共 14 维,并通过 mask 处理单臂/双臂数据差异。

这样做的好处是:模型学习的是“末端应该如何相对当前接触点移动”,而不是强绑定某一个机器人 arm base 下的绝对坐标。对于插枪、阀门、柜门这类任务,这种表示更加贴近真实操作逻辑。

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图4

图3 多源数据融合感知层



第二层:World Model 不直接控制机器人,而是生成目标


T-WM-VTLA-S 技术架构中的 WM,并不是为了让机器人“看一段视频然后照着演”。它承担的是更明确的中间角色:为 VTLA 策略提供未来目标信息。

在第二阶段训练中,World Model 会根据当前观测、语言指令和动作条件,生成:

  • subtask:当前处于哪个任务阶段;

  • goal image:下一阶段希望看到的目标图像;

  • future latent:未来状态的潜在表示;

  • consistency signal:当前动作是否朝着合理未来推进。

例如,在“开柜门 + 操作消控盘”任务中,策略不应该一开始就直接去按按钮。World Model 可以提供类似这样的中间目标:

1. 找到柜门把手;

2. 打开柜门;

3. 等待门体到达可操作角度;

4. 定位消控盘目标按钮;

5. 执行按压动作。

这让 VTLA 不再只是从当前图像直接回归动作,而是多了一层“下一步世界应该变成什么样”的条件。

当前我们采用轻量化的世界模型作为 Goal-WM 基础模型,并围绕工业作业数据进行微调。


天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图5

图4 世界模型融合方案



第三层:VTLA,把触觉纳入动作生成


传统 VLA 的输入通常是视觉、语言和机器人状态。但在工业作业里,这还不够。

很多任务真正的关键发生在接触之后。

插枪时,视觉可能已经看不到插头和插座之间的细微偏差,力反馈才是判断是否卡住、偏斜、插入成功的核心信号。

拧阀门时,模型需要知道当前是空转、正常旋转、接近限位,还是遇到异常阻力。

按消控盘时,机器人需要判断是否真正按下,而不是仅仅把末端移动到按钮表面。

因此,T-WM-VTLA-S 在第三阶段引入触觉分支,将力/力矩、接触状态、末端速度变化和任务阶段共同输入动作专家。

这一阶段的目标不是让机器人“看起来动作更像”,而是让机器人在接触中更稳定、更可恢复、更接近真实作业需求。

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图6

图5 VTLA架构图



第四层:外置安全层,让模型能力进入真实现场


在真实工业作业中,模型输出永远不能被无条件信任。

T-WM-VTLA-S 的 S 是一个外置安全层,它不完全依赖模型自己解释“我觉得这个动作安全”,而是从系统外部对动作进行检查和约束。

它包括:

  • 工作空间约束

限制机械臂进入危险区域、碰撞区域或不可达区域。

  • 速度与加速度限制

防止模型输出突变动作,降低设备和人员风险。

  • 力/力矩阈值

对插接、旋转、按压等任务设置接触边界。

  • 任务规则约束

例如未完成开门前,不允许执行按按钮动作,根据子任务状态判断切换是否成功。

  • 动作屏蔽与重规划

当模型动作违反规则时,安全层可以裁剪、替换动作直到达到安全的动作。

  • 急停与人工接管

高风险状态下,系统必须允许快速中止和人工介入。

这也是我们面向工业机器人场景坚持“模型 + 控制 + 安全系统”一体化设计的原因。

具身智能最终要进入现场,而不是只停留在bfnchmark 上。

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图7

图6 系统外置安全层方案


VLSA:T-WAVES 外置安全层的早期技术来源


这里需要特别说明的是,T-WAVES 的 S 层除了增加安全规则和本体状态限制,同时保留了我们早期联合清华具身实验室发布的 VLSA 技术路线,同时进行实际结合处理。VLSA 已被 IROS 2026 接收,它的核心思想是在视觉语言动作策略之外,增加一个可插拔、可审计、可独立升级的安全屏障,对模型输出动作进行风险识别、约束过滤和最小扰动修正。


在 T-WAVES  中,VLSA-style safety被放在策略模型和机器人控制器之间。策略模型负责生成 nominal action,外置安全层负责读取任务、视觉、深度、TCP 状态、触觉和工作空间约束,并对动作块执行限幅、与障碍物碰撞距离检查和控制屏障约束,其中障碍物由世界模型提供坐标。

如果动作仍处在可修正范围内,安全层输出最小扰动后的 safe action;如果动作无法被修正到安全集合内,系统会触发拒绝执行、保持当前位置、降级恢复、人工接管或急停。这样,安全不被隐藏在神经网络黑箱内部,而是形成一个可解释、可测试、可持续升级的工业安全边界。



三位一体的可信数据采集系统:真机、UMI与Ego


T-WAVES  并不依赖单一来源的数据,而是构建了由机器人真机数据、UMI 数据和 Ego 第一视角人类数据组成的数据闭环。三类数据均来自受控采集流程,记录设备、操作者、任务、场景、标定参数及处理链路,确保数据来源可靠、过程可追溯、结果可复核。

三类数据并非简单堆叠:

  • 真机数据提供与部署平台完全一致的动作、状态向量型触觉和安全边界;

  • UMI 数据以更低成本扩展精细操作轨迹,并同步记录指尖状态向量型触觉、触觉与接触状态;

  • Ego数据负责扩展任务场景、操作语义和长时序行为多样性。

它们分别位于“高动作保真度”和“大规模任务覆盖”的不同位置,经过统一时空标定与动作表征后共同用于模型微调。在进入模型训练前,采集数据将首先导入仿真环境进行统一评估。系统复现相机观测、机器人状态和末端动作轨迹,检查动作的可执行性、连续性、碰撞风险、关节限位、速度与加速度约束,以及任务完成情况。只有通过仿真评估的数据,才会进入后续训练数据集。

这里的“可信”并不表示所有采集数据天然正确,而是指数据具备明确来源、完整标定、统一动作定义和训练前验证闭环。对于轨迹漂移、动作突变、碰撞、超限或任务失败的数据,系统会进行修正、重新标注或剔除,避免未经验证的数据直接进入训练流程。

可将整体流程概括为:

受控采集 → 来源与标定检查 → 坐标和动作空间统一 → 仿真回放评估 → 质量筛选 → 数据集入库 → 模型训练

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图8

图7 多源可信数据采集系统


机器人真机数据:带触觉反馈的VR遥操作


我们使用VR设备遥操作机器人,机器人的双臂为视源提供,末端抓夹为戴盟机器人提供,雷达传感器由承泰科技提供,并在头显操作界面中实时可视化机器人末端六维力/力矩反馈。

操作者不仅能够看到机器人第一视角、腕部视角和环境视角,还能够观察末端接触力的方向、大小和变化趋势。相比仅依赖视频的遥操作,这种方式可以帮助操作者更精细地控制:

  • 插枪过程中的位置、姿态和轴向插入力;

  • 柜门开启时的抓取力、拉力方向和门体运动;

  • 消控盘按钮的接近、接触和触发力度;

  • 旋拧按钮操作中的抓握稳定性、旋转力矩和卡阻状态。

每条轨迹同步记录:

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图9

其中包含多视角图像、机器人状态、末端位姿、动作、六维力/力矩、安全状态和语言指令。

真机原始动作虽然定义在机器人基座坐标系下,但进入训练前统一转换成以当前TCP坐标系表示的局部增量:

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图10

最终形成单臂7维、双臂14维的标准动作:

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图11

这部分数据数量最少、采集成本最高,但与实际部署分布最接近,也是状态向量型触觉学习、接触控制和安全边界学习的主要数据来源。


UMI:融合指尖力触感知与高精度 SLAM 重建的操作数据


UMI 用于快速采集人类完成任务时的精细操作轨迹。采集装置在指尖或夹爪接触端同步记录状态向量型触觉、触觉与接触状态,并通过高精度 SLAM 重建场景和夹爪运动;系统以夹爪中心点作为末端参考坐标系,恢复连续的相对位姿增量:

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图12


因此,虽然UMI轨迹和真机轨迹的原始参考系不同——UMI相对于夹爪中心,真机位姿相对于机器人基座——二者在训练前都被转换成“当前末端坐标系下的下一步增量”。

统一后的动作语义是:

从当前夹爪/TCP出发,下一步应该沿哪个方向移动、旋转多少,以及何时开合夹爪。


UMI 能够较高效率地采集插入、旋拧、开门、按键等精细轨迹,并同步保留指尖接触力、触碰状态及其变化信息。由于这类数据仍不包含机器人本体的真实动力学、控制延迟和完整碰撞约束,因此进入训练前需要经过以下质量筛选:

  • SLAM轨迹置信度与重定位检查;

  • 夹爪中心和相机外参标定;

  • 轨迹速度、加速度和旋转跳变检测;

  • 机器人运动学可达性验证;

  • 仿真或真机回放验证;

  • 指尖力触信号与视觉、位姿轨迹的时间同步、标定及接触阶段检查。

只有通过物理可执行性验证,并完成力触信号同步与质量检查的 UMI 轨迹,才进入动作专家训练。


Ego数据:用第一视角扩展任务语义


Ego数据从人类第一视角记录自然操作过程,通过高精度SLAM恢复头部在世界坐标系中的运动,同时估计双手相对于头部的六自由度位姿:

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图13

由此可以重建手部在稳定世界坐标系中的运动,并计算手部局部增量:

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图14


不过,人手并不等同于机器人TCP。Ego动作受人体结构、手指形态和物体遮挡影响,不能不加区分地作为机器人控制标签。

因此,T-WAVES  对 Ego 数据采用分层使用方式:

1. 高置信度、可重定向轨迹用于学习粗粒度末端运动先验;

2. 普通Ego数据主要监督子任务、目标图像和未来视觉Latent;

3. 低动作置信度但任务内容有效的视频,只用于视觉语义和世界模型训练;

4. 不让未经验证的人手轨迹直接监督机器人底层接触动作。

换句话说,Ego数据更擅长告诉模型“接下来要完成什么”,真机数据则负责告诉模型“机器人具体应该如何安全完成”。


三类数据的质量—数量—动作关系


天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图15


这里存在一个非常清晰的规律:

  • 数据数量越容易扩大,动作通常越不接近机器人本体;

  • 动作标签越真实,数据采集成本通常越高;

  • 真机数据决定动作落地的精度下限;

  • UMI 数据扩大可执行技能的覆盖范围,并补充精细操作中的指尖力触与接触过程信息;

  • Ego数据决定模型能够理解多少任务、场景和操作逻辑。

因此,我们不追求三类数据数量相等,也不对它们使用完全相同的损失函数,而是根据动作可信度进行分级监督:

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图16

一般满足:

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图17

而在世界模型和高层任务监督中则相反:

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图18

这套数据体系形成了一条从“人类任务经验”到“可执行机器人动作”的逐级收敛路径:

Ego任务语义→UMI操作轨迹→真机动作与力触觉→外置安全层执行


一句话总结:


Ego 数据拓展模型见过的世界,UMI 数据拓展模型学过的动作并补充指尖力触线索,而真机数据决定这些动作能否在真实机器人上精确、安全地执行。


面向下一代人机协同的数据引擎:Ego、肌电与脑机接口


未来,T-WAVES  的数据引擎将从视觉、指尖力触和机器人状态进一步扩展到人体生理信号。肌电信号用于增强手部动作和接触意图的观测,脑机接口则用于辅助识别任务阶段与子任务切换。


Ego与肌电融合:补偿视觉遮挡下的动作信息


Ego数据在真实操作中经常出现手部被物体、工具或身体遮挡的情况。此时,单纯依靠视觉跟踪容易造成手部位姿中断、抓握状态丢失或接触阶段判断错误。

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图19

图8 Ego与肌电数据融合方案


我们计划在操作者前臂布置表面肌电传感器,同步采集:

  • 手指屈伸相关肌群激活;

  • 抓握、释放和用力趋势;

  • 手腕旋转与稳定状态;

  • 动作开始、持续和结束时刻;

  • 接触前后的肌肉激活变化。

肌电数据并不能直接恢复被遮挡的图像,但可以提供视觉不可见时的运动意图约束。例如,当视觉系统无法看到手指时,肌电信号仍可判断操作者是在抓紧、释放、旋拧还是持续施力。

系统将采用遮挡感知的动态融合机制:

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图20

当手部视觉跟踪置信度下降时,提高肌电和历史运动轨迹的权重;视觉恢复后,再利用视觉观测修正累计误差。

肌电信号主要用于:

  • 补偿手部遮挡期间的动作Latent;

  • 判断抓握、释放和持续施力状态;

  • 辅助检测接触阶段;

  • 识别动作开始和结束边界;

  • 提高Ego手部轨迹重建的连续性;

  • 为Subtask和Goal-WM提供更准确的阶段标签。

这类数据不会直接替代机器人力传感器。肌电反映的是人的运动意图和肌肉激活,机器人六维力传感器反映的则是真实环境作用力,二者分别服务于“意图理解”和“物理执行”。


脑机接口与遥操作融合:用脑信号辅助Subtask Generate


人在执行复杂任务时,通常会形成自然的任务切分逻辑。例如操作化工阀门时,人会经历:

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图21


这些阶段不仅表现为外部动作变化,也会反映在注意力、运动准备、错误感知和任务切换相关的脑信号中。

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图22

图9 脑机接口与遥操作融合方案


未来的数据采集系统可将脑机接口与VR遥操作同步,联合记录:

  • EEG等非侵入式脑信号;

  • VR头部、手柄和视线状态;

  • 机器人视觉、状态与动作;

  • 末端六维力/力矩;

  • 人工接管与纠错行为;

  • 子任务语言标签和任务结果。

脑信号不直接控制机器人底层动作,而是作为高层弱监督,辅助判断:

  • 当前操作者准备执行哪个子任务;

  • 子任务何时开始、完成或切换;

  • 操作者是否发现执行错误;

  • 是否需要停止、重试或改变策略;

  • 当前目标图像是否与人的任务预期一致。

可以将潜在子任务建模为:

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图23


随后由Goal-WM生成对应的子任务文本、目标图像和未来Latent:

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图24


整体形成分层控制关系:

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图25


脑机接口在该系统中的定位不是“读脑控制机器人”,而是帮助模型理解人的任务组织方式,为Subtask Generate和长时序任务切分提供额外证据。最终动作仍由视觉—语言—状态向量型触觉—动作模型生成,并受到机器人状态、真实力反馈和外置安全层约束。



三阶段训练路线:从动作对齐,到目标条件,再到状态向量型触觉接触


T-WAVES  基于 T-WM-VTLA-S 技术架构,当前不做从零大规模预训练,而是在 VLA 和世界模型的基模之上进行分阶段微调。三阶段训练的目的,是在有限但可信的数据条件下,避免一次性全量微调造成灾难性遗忘,也避免 Ego、UMI、真机和仿真数据因为动作空间不同而相互冲突。

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图26

图10 三阶段训练总体流程


Stage 1A:动作接口适配


Stage 1A 是最保守的一步。此时冻结 VLM Backbone、视觉编码器、和 Action Expert,只训练 State Projector、Action Input Projection、Action Output Projection、Embodiment Embedding 和 Action Space Embedding。

这一阶段的目标不是追求任务成功率,而是先保证统一后的动作接口可用。UMI、真机和 RoboTwin 数据都会被转换为以抓夹中心/TCP 为参考点的 local delta action;单臂、双臂和不同末端执行器则通过 action mask 标记有效维度。Stage 1A 解决的是“模型能否读懂统一状态,并把动作解码到正确维度”的问题。

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图27

图 11 一阶段微调


Stage 1B:动作专家微调


Stage 1B 开始解冻 Action Expert / Flow Matching Head,同时引入 VLM Top LoRA,但仍然冻结视觉编码器和 VLM 大部分主干。训练参数包括 Action Expert、State Projector、Action Projection、Embodiment / Action Space Embedding 和 VLM Top LoRA。

这一阶段让动作专家真正适配 UMI、真机和仿真数据中的动作分布。模型不仅要输出正确维度的动作,还要学会合理的轨迹形状、速度节奏、接触前减速、夹爪开合时机和双臂协调。Stage 1B 解决的是“动作分布是否像专家数据”的问题。


Stage 1C:小学习率联合收敛


Stage 1C 是对 Stage 1A 和 Stage 1B 的稳定收敛。它不会突然开放全量模型,而是用更小学习率联合训练已经打开的动作相关模块:State Projector、Action Projection、Embodiment / Action Space Embedding、Action Expert 和 VLM Top LoRA。视觉编码器、VLM 主干大部分层、Goal-WM、Subtask Head 和 Tactile MoE 仍然冻结。Stage 1C 的目标是让不同来源数据在同一动作空间中稳定共存,避免模型在 UMI、真机和仿真之间来回漂移。


Stage 2:Goal-WM + Goal-conditioned VTLA


Stage 2 引入世界模型。这里的 World Model 不直接控制机器人,而是生成 subtask、subgoal image 和 goal latent,作为额外条件输入给 VTLA Backbone 与 Action Expert。训练时混合三种 goal 来源:teacher goal、generated goal 和 dropped goal。teacher goal 来自真实未来帧或阶段终点图像;generated goal 来自 Cosmos Goal-WM;dropped goal 用于防止模型过度依赖目标图像。Stage 2 主要训练 Goal Encoder、Goal Latent Adapter、Goal-to-Action Adapter、Subtask Generator、Goal-conditioned Prefix Adapter、VLM Top LoRA,以及小学习率下的 Action Expert 和 State/Action Projector。冻结视觉编码器、VLM 大部分主干和 Tactile MoE。

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图28

图 12 二阶段微调



Stage 3:Tactile-aware VTLA 微调


Stage 3 面向插枪、开柜门、按消控盘、拧化工阀门、压合和插拔等接触密集任务。此时在 Stage 2 的基础上引入力/力矩信号和 Tactile MoE 结构,训练 Tactile State Encoder、Tactile MoE Router、Tactile Experts、Tactile-to-Action Adapter、Next Wrench Head、Contact Predictor,以及小学习率下的 Action Expert 和 Action Projection。

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图29

图 13 三阶段微调


一句话总结三阶段训练:


Stage 1 解决动作空间对齐,Stage 2 解决目标条件引导,Stage 3 解决真实接触中的状态向量型触觉修正。T-WAVES  不是把所有能力一次性塞进黑盒模型,而是通过分阶段开放参数,让基础模型逐步获得可执行动作、目标条件动作和状态向量型触觉接触动作能力。



展示的任务视频


天创机器人会陆续发布基于T-WAVES模型完成的真实作业视频,特别要提到的是,在T-WAVES研发过程中,安全分层由清华具身院何潇老师团队提供支撑,东南大学宋爱国老师团队提供触觉融合方法相关支持,机器人7轴双臂为视源提供,力触觉末端抓夹为戴盟机器人提供,雷达传感器由承泰科技提供。

视频一:配电房旋钮操作

机器人需要抓握旋钮、执行旋转、判断力矩变化,并在接近限位时停止,验证 VTLA 中 force 分支的必要性。

视频:1x 速度,完全自主

视频二:配电房按钮操作

机器人需要识别按钮位置,执行动作,在感受到按钮按压程度到位以后会停止按压。

视频三:开柜门 

机器人需要完成长程任务分解,先找到门把手,抓住门把手,再拉开。

视频四:按消控盘按钮

面板识别,找到目标按钮按压,验证 World Model 对 subtask 和 goal image 的作用。

视频五:自主插枪任务

机器人需要识别目标接口,完成末端姿态对准,并在接触过程中根据力反馈修正插入路径。

视频六:USB插拔任务

机器人自主识别USB并夹取,随后插入USB口中,在接触过程中调整位姿插入。

视频七:信号读取接触任务

机器人末端工具自主识别对接口,不断调整位姿,柔性接插,读取信号。

视频待发布...
可扩展到电力巡检、消防应急、危化处理、矿山作业、无人值守站点等场景。



我们对通用工业具身智能的判断


过去的机器人智能,很多时候是在回答一个问题:机器人能不能完成某个动作?

但工业机器人真正要回答的是另一个问题:机器人能不能在复杂、危险、不可完全结构化的环境中,稳定、安全、可恢复地完成一项作业?

这要求系统同时具备四种能力:

  • 看懂现场;

  • 理解任务;

  • 生成动作;

  • 控制风险。

T-WAVES 是我们对这个问题的第一版系统化回答。

它不是终点,而是一个可以持续扩展的数据、模型和部署系统。随着更多作业视频、更多真机数据、更多 UMI 指尖力触数据和更多现场任务接入,T-WAVES  将逐步从“会执行单个任务”走向“能迁移到一类任务”。

我们的目标不是做一个只在实验室里漂亮演示的模型,而是让具身智能真正进入工业作业现场。

从插枪、开柜门、按消控盘,到化工阀门、电力设备和危险环境操作,机器人需要的不只是大模型,而是一套能够被训练、被验证、被部署、被安全约束的完整系统。

这就是 T-WAVES ——基于 T-WM-VTLA-S 技术架构构建的通用工业具身智能融合模型。

项目地址:

https://github.com/maryhh/T-WAVES.git

部分开源数据:

huggingface.co

maryhh/umi_knob_lerobot_424_data










精彩推荐





天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型图30

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
安全 工业 机器人
more
从“能移动”到“会行动”:迦智科技如何搭建工业具身智能基础能力平台
零样本迁移,降本80%!自适应时序预测Agent加持真实工业
四川工业研学旅游线路推荐(乐山—眉山篇)
IT/OT统一监控平台——全面掌控你的工业网络
攻克工业软件国产化高地,宝信iPlat-BA探索SCADA自主可控之路
苏州高新区站上新型工业化风口 | 智造高新 点“新”成金
英飞凌推出面向大批量工业自动化应用的紧凑型ISSI20BxxF系列,进一步扩展固态隔离器(SSI)产品组合
8.5-7 河内|ITWA VIETNAM 2026盛大启幕,点燃东南亚工业智造新引擎!
【工业强县 向“新”而行】遂宁市船山区产业从“制造”向“智造”跃升
全球工业缝纫机龙头子公司,拿下200台机器人采购订单!
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号