Xspark AI一篇长达37页的具身系统综述和分级,全面盘点可信赖的具身智能

具身智能之心 2026-07-29 11:42

点击下方卡片,关注“具身智能之心”公众号


机器人叠衣服、拧螺丝、端咖啡的demo已经刷屏一年多了。

但一个尴尬的问题始终没人正面回答——这些机器人,到底能不能放到真实环境里干活?

demo里95%的成功率,换个光照、换个场地、换个操作员,还剩多少?剩下那5%的失败,是"没夹起来",还是"把杯子扫到地上砸了人的脚"?

在刚刚落幕的2026世界人工智能大会(WAIC)上,"人工智能应当成为人类的可信工具"成为行业共识。大会《主席声明》明确提出,"要筑牢安全底线、防范滥用恶用,确保人工智能始终处于人类控制之下"。随着人工智能技术由数字虚拟空间向实体物理场景延伸落地,行业亟需立足技术迭代趋势、产业实际应用需求与全产业链发展现状,对具身智能"可信"的核心内涵进行系统性、科学化的重新界定。

现在,一份37页的系统性综述给出了答案框架。

Xspark AI(无界智航)研究实验室SparkLab,联合清华大学、港大MMLab、北京大学、港科广的研究团队,提出了具身智能领域的第一套可信度分级体系 T0–T5,以及支撑它的四层系统框架

一句话概括核心观点:

具身智能的可信,不是模型的属性,而是整个部署系统的端到端属性。

  • 论文主页:https://xsparkai.com/sparklab/towards-trustworthy-eai 

  • 联系方式:sparklab@xsparkai.com

Xspark AI一篇长达37页的具身系统综述和分级,全面盘点可信赖的具身智能图1


01

为什么"任务成功率"是个危险指标


先说清楚这篇论文最反直觉的一个判断。

在数字世界里,模型出错的代价是"答案不对"。在物理世界里,模型出错的代价是碰撞、损坏、伤人,而且不可逆。

更麻烦的是,任务成功率这个指标,会把两种完全不同的结果混在一起算:

  • 安全地成功:机器人规规矩矩把任务做完

  • 不安全地成功:机器人一路撞着、蹭着、超力矩地把任务做完了

在排行榜上,这两种都记一分。

论文因此提出了一个新的目标定义——持续安全成功(Sustained Safe Success):

在环境和系统发生变化的情况下,持续可靠地完成指定任务,同时把风险维持在可接受范围内。

注意这里有两个不可互相替代的属性:

任务能力(能干活)和安全性(不闯祸)。

高平均成功率可能掩盖罕见但严重的失败;而一味拒绝执行虽然绝对安全,却毫无用处。两者缺一不可。

而且论文还点出了一个容易被忽略的事实:具身智能不存在通用的安全动作。

自动驾驶还能靠"靠边停车"兜底,但试想一下,如果一个机器人正在负重、保持平衡或是与人接触,急停可能不仅无法止损,还会带来更危险的后果。


02

四层框架:错误是怎么一层层传下去的


论文把可信性的支撑机制拆成了四个相互依赖的层。

  • 模型层(PROPOSE):生成任务动作提案,同时给出校准过的不确定性和显式的安全偏好。VLA、世界模型、规划器都在这一层。

  • 系统层(EXECUTE):通过传感、计算、控制、执行、硬件防护、故障隔离和回退机制,把被授权的动作可靠地变成物理行为。

  • 证据层(SUBSTANTIATE):用形式化、统计、实证和运行数据,证明某个有边界的可信声明是成立的。

  • 部署层(GOVERN):通过运行时监控、权限管理、人工介入、事故响应和受控更新,保证这个声明在使用过程中持续有效

Xspark AI一篇长达37页的具身系统综述和分级,全面盘点可信赖的具身智能图2

关键在于,没有任何一层能单独建立端到端的可信性

  • 感知再鲁棒,也不保证规划安全

  • 控制器再稳定,也可能忠实地执行一个不安全的目标

  • 冗余部件可能共享同一套软件、通信、标定或供电依赖

  • 形式化保证只在它自己假设成立的前提下有效

论文把跨层失效归纳成三个反复出现的问题,每一个都相当扎心:

语义-物理鸿沟:高层指令里根本没有几何、动力学和接触约束的信息。

动作-后果鸿沟:同一条指令在不同状态下产生的物理后果完全不同,光看指令判断不了它安不安全。

跨层不可组合性:每个部件单独看都可靠、都验证过,组合起来却不可信——因为它们的假设和接口互相矛盾。

Xspark AI一篇长达37页的具身系统综述和分级,全面盘点可信赖的具身智能图3

03

T0-T5:给机器人的可信度上分级


前面回答了"可信靠什么支撑",接下来的问题在于——可信应该到什么程度,能不能被量化?

毕竟,在工厂里拧螺丝钉的机器人,和在手术台前做缝合的机器人,对"可信"的要求显然不在一个量级。

参照自动驾驶SAE L0–L5,论文提出了具身智能的TEI T0–T5:

Xspark AI一篇长达37页的具身系统综述和分级,全面盘点可信赖的具身智能图4

分级的判定不看模型有多强,而是看五个维度:任务能力、安全性、系统保障、证据充分性、部署治理。

并且有一条硬规则:

一个系统的TEI等级,不能超过它最薄弱的那个安全关键维度。

这条规则直接推出了两个非常反直觉的结论:

结论一:一个用着最强通用大模型的机器人,如果监控、回退、证据、变更管理不到位,它就只能停在T1或T2。

结论二:一个能力很窄的工业机器人,如果在严格约束、充分验证的场景里,它完全可以支撑T4级别的可信声明。

还有一点:TEI等级是可以被降级的。

当证据过期、监控失效、事故未闭环、配置或运行域发生变化时,等级就要往下掉。它描述的是"当前被证实的可信强度",而不是一次性拿到的资质。

论文特意强调,T0–T5 不是认证体系,落地需要各领域自己定义阈值和profile——包括任务边界、量化指标、强制安全机制、评测场景、监控与事故报告义务,以及重新评估和吊销的条件。


Xspark AI一篇长达37页的具身系统综述和分级,全面盘点可信赖的具身智能图5


04

为什么是Xspark AI来做这件事


一篇讲"可信"的综述,为什么由一家创业公司的实验室牵头?

SparkLab 是 Xspark AI(无界智航)旗下的前沿研究实验室。公司核心定位凝练为六个字:可信物理智能。创始团队融合学术研究与产业实践双重优势,对技术发展趋势具备超前判断力。早在 WAIC 发布可信 AI 顶层治理导向之前,团队便率先形成清晰判断:搭建完整可信体系,是具身智能实现大规模落地的核心前置基础。

  • CEO 熊祺,前蔚来自动驾驶核心高管,带领团队完成业内首个百万量级世界模型的规模化量产交付。自动驾驶行业"不审慎交付算法可能危及生命"的铁律,让他对可靠交付近乎执念。他带来自动驾驶的部署治理和量产验证经验,也正是论文里"工程类比"理念的源头;

  • 首席科学家 丁文伯,清华大学长聘副教授、博导,国家重点研发计划(青年)首席科学家,国内机器触觉领域领军学者,魔搭社区EAI-100具身智能年度先锋人物,在Nature、Science、Cell子刊等顶刊发表论文80余篇,引用超万次。他的研究方向是多光谱触觉感知与物理接触安全,为可信分级体系接触安全与物理感知维度提供有力支撑。

  • CTO 陈天行,港大MMLab博士生,RoboTwin与RoboDojo第一作者,开源社区Lumina创始人,曾参与字节跳动Seed团队模型训练与评测,开源项目累计近两万GitHub Stars。从RoboTwin 1.0走到RoboDojo,他的研究贯穿了具身模型从模仿学习到VLA再到WAM的完整演进,对评测体系和证据层有着丰富的洞察。

三位创始人联手攻克了论文四层框架中最难啃的三个环节:量产交付对应部署治理,触觉研究对应物理安全,评测体系对应证据验证。

技术路线上,Xspark AI 把前沿触觉感知、自研AIGC数据生成模型和具身智能评测infra能力体系结合起来,构建了 "慢脑VLM—快脑WAM—脊髓VTA" 的创新协同算法架构,目标是打通从数据采集与增广、模型训练、评测到真机部署的完整高效率迭代闭环。

换句话说,顶级评测团队来写可信性,世界模型量产交付老兵来写部署治理——这大概是这篇综述最有说服力的地方。


05

写在最后


论文的结论其实挺克制的。

它明确说:可信不意味着万能,也不意味着不会失败。它要求的是能力、物理权限、证据和运营责任在整个生命周期里持续对齐

一个可信的机器人,是一个"能力有边界、有证据支撑、被持续监控、并随配置和环境变化而被修订"的系统。

具身智能卷了三年模型能力。

现在,可能是时候补上另外三层了。


END

 推荐阅读 :

Xspark AI一篇长达37页的具身系统综述和分级,全面盘点可信赖的具身智能图6


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI AR
more
从End-to End VLA到Harness VLA,清华联合正行创新、无问芯穹发布并开源,引领具身智能范式演进
DeepSeek V4延期背后:配套编程工具Harness启动严苛内测
搜索智能体也需要「操作系统」:SearchOS 开源多智能体协作框架
华为和iPhone逆势卖爆!毫不care存储涨价潮?
刚刚,Karpathy亲自辟谣:我没走!
比亚迪“海獭”破局日本K-Car市场,本土协会称竞争促进行业发展
让动态投机解码不再局限于DSpark:LightSpec首个开源动态MTP系统实现
ARC-AGI-3近被完美攻破,这个Harness能让AI掌握物理学家思维
LiDAR与视觉SLAM的瓶颈从不是传感器,而是「任务闭环」至今缺失
保险与AI为全球通信运营商带来ARPU增长新机遇
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号