上周,一家名叫Dyna Robotics的公司干了件让整个行业集体失眠的事。他们训练了一个叫做DYNA-2的模型。独特之处在于,预训练阶段一条机器人动作数据都没喂。取而代之的是,他们给模型灌进了超过 100 万个小时的人类第一视角视频。相当于一个人连续学习 170 年。结果,从 1000 小时一路到 100 万小时,每翻 10 倍机器人都在变聪明。更准确地说,是一条持续上升、没有明显撞墙的幂律趋势。可以说,物理AI终于有自己的Scaling Law!消息一出,行业炸了。因为这等于宣告:训练机器人最稀缺的资源,不是GPU、不是算法,而是高质量的人类行为视频数据。谁手里有这批数据,谁就掌握了物理AI时代的石油。但问题随之而来。这条曲线都看得见,但跑到关键拐点需要的那批数据,却都锁在各家公司自己的硬盘里。直到这家公司把锁撬开了。8月20日上午,在2026世界机器人大会(WRC 2026)上,光轮智能宣布:10万小时全模态人类行为数据,全部开源!数据集叫EgoSuite-Open100K,与Hugging Face联合发布,首批已上线Hugging Face Hub和AtomGit。学术研究能用,商业训练也能用。开源网页:https://egosuite100k.lightwheel.ai/官方新闻稿:https://lightwheel.ai/media/egosuite-open100kHF 开源仓库:https://huggingface.co/collections/LightwheelAI/egosuite-open100k迄今为止,全球规模最大的全标注开源第一人称人类数据集,具身智能最贵的资产,今天第一次被摆到了所有人都能够到的桌面上。消息发布后,X 上迅速炸了。最先炸的是 Hugging Face 自己。HF 官方账号直接转发了光轮智能的发布帖。熟悉这个全球最大开源 AI 社区的都清楚,HF 官号几乎从不单独为某一个第三方项目公开站台。翻遍 HF 官号的历史,能找到的类似操作屈指可数:IBM 和 NASA 联合发布的太阳物理模型 Surya;Databricks 的 CommonCanvas 图文数据集,官号称其为「Hub 上托管过的最大数据集」;图像生成模型 Flux.2-dev。每一个都是各自赛道的标志性开源事件。
EgoSuite-Open100K 这次拿到的待遇,跟它们一个级别。不止官号。HF 旗下的机器人项目 LeRobot 更是直接发了一条长帖力挺,明确表态:「Always great to see a dataset at this scale released openly on the Hub.」机器人领域大 v 博主 Lukas Ziegler 随后跟进,详细解读了数据集的多视角变体,称这是「训练灵巧操作不可多得的素材」。