点击下方卡片,关注“具身智能之心”公众号
过去一年,用三天一个模型来形容model 侧的快速发展,毫不夸张。
各类策略不断出现,demo 也越来越丝滑。
很多模型对外都声称能完成任务;但各家又往往跑在不同环境、不同任务集和不同测试条件里。一旦到了真机上,光照、材质、相机噪声、物体接触、初始位姿稍微一变,模型表现就可能出现波动。
所以,模型爆发的同时,对那把评测的尺子要求越来越高。
目前市场上的一些框架,虽然能一定程度上解决规模化评测的难题,但依然有一些不足。
近日,常态化具身智能仿真评测平台 RoboColiseum 正式发布。它回答的是:能不能为具身模型建立一套结果可信、过程可复现,并与真机表现高度一致的仿真评测。
平台开源,全球高校和科研机构、企业研究人员都可以用了。据悉,自内测以来,RoboColiseum 目前已有海内外40多支队伍在平台开展模型训练与评测。
仿真评测平台网址:http://robocoliseum.ai/

01.
虚拟即现实,仿真评测对齐真实世界
模型在仿真环境中的优异表现,能否延续到真实物理世界?
进入现实场景后,光照、材质、相机噪声、物体接触以及机器人初始位置和姿态的变化,都可能导致模型性能下降。因此,如何通过仿真评测准确衡量模型的真实能力,仍是一个关键难题。
RoboColiseum基于高保真仿真环境构建,在环境渲染和物理交互方面高度还原真实世界。
实测上验证,仿真评测与实机部署的相关性达到89.5%,相同模型在仿真环境与真实世界中的评测差异小于10%。这也就把之前最担忧的问题解决了,仿真评测由此可以作为真机表现的可靠参考,帮助开发者在进入成本更高、周期更长的真机测试前,快速完成模型筛选与问题定位。
这一验证链路也是双向的:使用真机数据训练的模型可以直接提交仿真评测,仿真数据训练的模型也能够通过真实机器人验证迁移效果。虚拟环境与真实世界由此实现双向打通,让开发者能够以更低成本获得高置信度结论,显著缩短“训练—评测—改进—部署”的迭代周期。

仿真环境高度还原真实世界


Sim2Real实验对比
02.
维度最丰富的评测体系
发现每个模型的能力短板
传统评测往往用一套综合成功率概括模型表现,RoboColiseum则围绕不同能力维度设置多个任务集,考察模型在各个维度中的表现。
目前,平台已推出 4 类能力子榜、78个高保真仿真评测任务。未来还会结合产学研需求,持续更新任务和评测维度。
• 指令跟随(Instruction Following),考察模型能否理解颜色、数量、形状、尺寸、类别、逻辑与常识等自然语言信息,找对目标并执行正确动作。
• 空间理解(Spatial Reasoning),检验模型对绝对位置、相对关系、尺寸与序号排序、堆叠和空间对齐等信息的理解能力。
• 扰动适应(Robustness),通过改变背景、光照、材质、机器人初始状态、相机位置与图像质量,并对指令进行多样化改写,检验模型在非理想环境中的稳定性与泛化能力。
• 通用操作(General Manipulation),覆盖开门、倾倒、舀取、上货、分拣、整理桌面和双臂协作等多步骤任务,衡量模型组合运用原子操作技能的能力。
为了让失败原因可追溯,每项任务都会被进一步拆解为多个子步骤。评测平台不仅判断最终任务是否成功,也会记录模型完成了哪些步骤、在哪一步失败以及在不同场景中的泛化能力。
在评测设计上,RoboColiseum通过大规模、多样化样本降低单次测试的偶然性,并采用域随机化、训练集与测试集隔离、分布内与分布外测试等机制,减少模型依赖固定布局或数据规律“走捷径”的可能,提高评测结果的稳定性。

四维评测体系
03.
AI agent一键提交,30分钟获得评测结果
对于开发者而言,高质量评测往往伴随着复杂的环境配置、资产适配和算力成本,搭建完整评测链路耗时耗力。
RoboColiseum将这些环节封装为一套自动化服务。
开发者从注册到提交最快仅需5分钟,一键部署模型,最快30分钟即可完成仿真评测。平台将自动返回分项成绩、任务步骤结果及模型推演视频,直观呈现机器人在每个任务中的执行过程。
借助AI Agent,开发者还可通过自然语言对话完成数据下载、模型训练、本地验证和评测提交。模型代码和权重无需上传,只需在本地部署推理服务并接入标准接口,即可连接平台开展评测。

5 分钟提交注册,30 分钟获得评测结果
04.
提供主流模型基线,开发者可自行复现
RoboColiseum已提供ACoT-VLA、π0、π0.5、GR00T等国际具身基座模型的基线成绩。开发者提交自己的模型后,即可在四个维度上与主流模型进行逐项比较,快速判断自身优势与不足。
同时,RoboColiseum提供各基线模型在平台任务上的训练代码及对应权重,开发者可自行复现训练与评测过程、核验基线成绩,并在统一条件下开展模型对比与后续研究。
05.
为什么叫RoboColiseum?
Coliseum原指古罗马圆形竞技场,一个公开、中立、谁都可以登台的竞技场。RoboColiseum,既是模型同场比较的“竞技场”,也是开发者反复测试、定位短板和持续迭代的“训练场”。
平台的长期目标,是将真实世界中的复杂任务转化为标准化、可复现、可持续更新的评测体系,让评测成为具身模型研发流程中的基础工具。
当模型能够在同一把尺子下比较和改进,具身智能的发展也将从精心挑选的成功演示,走向更加可靠、透明和可验证的真实进步。平台也期待更多开发者开放模型,共建具身智能生态。
RoboColiseum现已正式开放,欢迎全球开发者入场!
仿真评测平台网址:http://robocoliseum.ai/
