千万级标注成本归零!清华团队的CVPR工作:解决具身的下一个难题

具身智能之心 2026-08-04 11:00

点击下方卡片,关注“具身智能之心”公众号


编辑丨具身智能之心

本文只做学术分享,如有侵权,联系删文


更多干货,欢迎加入国内首个具身智能全栈学习社区(戳我)这里包含所有你想要的。

想象一下:你站在广场中央,闭上眼睛。左边传来喷泉的水声,右边是街头艺人的琴声,身后是人群的嘈杂。即使看不见,你依然能够判断每一种声音来自哪里。这种能力,对人类来说几乎是与生俱来的;但对人工智能而言,长期以来却是一项颇具挑战性的任务。

过去,想让AI学会“听声辨位”,通常需要两种代价高昂的方法:一种是搭建由数十个麦克风组成的专业阵列,在实验环境中采集海量数据;另一种是依赖人工逐帧标注声源位置,例如标记“声音来自左侧30度”。无论是硬件成本还是数据标注成本,都使这项技术难以大规模推广。

有没有可能,让AI摆脱昂贵设备和人工标注,仅凭互联网上海量、未经处理的真实世界视频,自主学会理解声音来自哪里?

发表于CVPR 2025的一项研究给出了肯定的答案。

研究团队没有依赖专门采集的数据,而是利用了大量YouTube视频:有人在喷泉边散步,有人在公园演奏乐器,也有人在空旷的大厅里鼓掌。这些视频虽然嘈杂,却蕴含着一个长期被忽视的监督信号——当相机发生转动时,声音世界的相对方向也会随之改变。

这一观察成为整个工作的核心。相机的运动天然提供了一种无需人工标注的监督信息:每一次转动,都意味着声源与相机之间的相对方位发生了变化。研究团队据此设计了一套自监督学习框架,让模型同时观察相机如何移动、声音如何变化,并通过专门设计的损失函数约束模型,使其在“转头”之后,相应调整对声源空间位置的判断。

令人印象深刻的是,这一方法无需昂贵的声学设备,也无需知道画面中是什么物体、场景属于什么类别,仅凭真实视频中的运动信息,便能够学习声音在三维空间中的位置关系。

该研究成果发表于计算机视觉顶级会议CVPR 2025,并入选Highlight,约占全部投稿论文的前2%。论文作者包括清华大学本科生闵安娜、密歇根大学博士生陈梓阳、清华大学交叉信息研究院助理教授、上海期智研究院PI赵行,以及康奈尔大学副教授Andrew Owens。

这项工作并未彻底解决空间听觉的所有难题,却回答了一个更基础的问题:人工智能是否能够仅凭观察真实世界中的运动,自主理解声音的空间结构?

至少目前来看,答案是肯定的。

千万级标注成本归零!清华团队的CVPR工作:解决具身的下一个难题图1

论文链接:https://scholar.google.com/citations?view_op=view_citation&hl=zh-CN&user=QEMEaxwAAAAJ&citation_for_view=QEMEaxwAAAAJ:d1gkVwhDpl0C

PDF:https://openaccess.thecvf.com/content/CVPR2025/papers/Min_Supervising_Sound_Localization_by_In-the-wild_Egomotion_CVPR_2025_paper.pdf

一. 写在前面

过去十年里,科学家们走了两条截然不同的路。

一条路是“造一个完美的实验室”:用昂贵的360度麦克风阵列,在可控的房间里播放预设的声音,精确记录下每一个角度、每一次反射。这像给AI报了一个“听力集训班”——教材完美,答案明确,但代价高昂,且永远无法覆盖真实世界的混乱。

另一条路是“扔进互联网的大海”:从YouTube上百亿个普通视频里学习。这些视频大多来自一部手机、一个单声道麦克风,视角有限、音质参差。机器要做的,是从这些“残缺的碎片”里,拼凑出完整空间的声音图景——就像只给你看一张张破碎的拼图,却要求你还原整幅《星空》。

这几乎是不可能完成的任务。但有一个线索,藏在婴儿的认知里:当一个物体出现在视野中时,我们知道它应该发出什么样的声音;当一个声音响起时,我们知道应该往哪个方向转头。 这种“对应关系”是超越感官的深层规则。

于是,新的问题诞生了——如果给AI看无数个普通视频,每个视频都只记录了一个“观察者”在某个位置看到的画面和听到的单声道声音,

它能否像婴儿那样,学会推断出“如果我站在另一个位置,声音听起来会是什么样”?

甚至更进一步:能否仅凭一段手机录制的、晃动的、嘈杂的视频,就还原出整场音乐会那个“360度的空间音频”——也就是还原出那一刻,作为一个“看不见的听众”,站在现场中央所体验到的全部?

这条路一旦走通,它将不再依赖昂贵的360度设备,不再依赖人工逐帧标注。它要做的,只是“大量地看、大量地听”——从真实世界的嘈杂与混乱中,自己提炼出空间与声音之间的隐秘几何学。

千万级标注成本归零!清华团队的CVPR工作:解决具身的下一个难题图2
千万级标注成本归零!清华团队的CVPR工作:解决具身的下一个难题图3

随着技术的演进,一些工作引入了360度空间音频与视频的联合建模,通过学习两者间的空间关系,构建了具备空间感知能力的多模态数据系统。然而,这类方法普遍面临两个挑战:首先是对大量人工标注的依赖,其次是由于360度视频的采集需特殊设备与设置,导致方法本身在大规模应用中不具可扩展性。

因此,在从in-the-wild数据中进行自底向上学习的背景下,一个关键研究问题被提出:是否存在一种可扩展的方法,可以仅基于有限视角和有限录制设备,从真实世界的音视频数据中学习360度空间音频的感知能力,并适用于多种复杂场景?更具体而言,这一问题可以表述为:如何从密集视觉视角的线索中,学习具有限定传感器配置的360度空间多模态感知能力?

二.技术方案

在现实环境中采集的音视频数据通常具有高度噪声性,存在大量冗余音源以及多声源重叠等问题,这对多模态建模提出了严峻挑战。如图所示,在真实场景中,多个声源常常位于同一视觉区域,使得仅依赖视觉线索难以准确区分主导声源。因此,若缺乏人工标注,仅凭视觉信号进行空间音频建模具有显著困难。

早期研究在缺乏监督信号的情况下,主要依赖双耳音频信号中的时差估计来实现空间声源定位。而本研究提出了一种新的建模范式,利用视觉引导的自运动作为监督信号,引导声源空间位置学习。具体而言,我们采集了大量野外音视频数据,并构建了两个基准数据集:iPhone Fountain 和 iPhone Music Dataset,涵盖了不同设备(如 iPhone、RWAVS 等)下的音视频同步数据。

千万级标注成本归零!清华团队的CVPR工作:解决具身的下一个难题图4

在训练阶段,模型的输入为两个相邻时间戳的音频片段与对应的视频帧。我们首先通过视觉帧对估算相机的自运动,包括旋转方向与平移方向,从而得到相机运动的稀疏标签信号。这些标签信号被进一步编码为one-hot形式(如左/右、前/后),用于监督音频间的相对空间位移学习。

如图所示,整体框架包括两个主要模块:Spatial Sound Localization 模块对两个时间点的音频进行编码,并预测声源的相对空间运动;Ego Motion Estimation 模块则基于视觉帧估计出相机的旋转和平移方向。二者的对齐过程通过以下损失函数进行联合优化:

千万级标注成本归零!清华团队的CVPR工作:解决具身的下一个难题图5

其中,与分别对应旋转与平移方向的监督损失,为二分类的辅助监督损失,与为调节各损失项的重要性权重。

模型在训练过程中仅利用视觉运动标签即可实现对空间音频的监督学习。在推理阶段,模型输入一段空间音频片段,输出其空间方向的角度分类结果。由于我们假设声源相对于麦克风设备的运动角速度远小于设备自身的旋转速度,因此在优化过程中对旋转相关损失赋予更高权重,从而提高模型对相机旋转信息的敏感性。此外,模型还引入传统的二元交叉熵损失以增强鲁棒性与区分能力。

三.实验结果

实验结果表明,所提出的模型在多种组合场景下均表现出优越性能,无论是在我们新采集的个体化数据集上,还是在用于结果验证的 Fountain dataset 上,模型均取得了稳定且领先的表现。为进一步分析三类损失函数在整体性能中的具体贡献,以及其在不同环境条件(如相机旋转与平移幅度、声源分布模式等)下的作用差异,我们设计并实施了一系列消融实验。

实验发现,远距离声源在多个场景中表现出一致性偏差,这一现象可以被视为当前数据集的一个“行业偏差”。具体而言,模型性能在很大程度上受到声源与摄像机之间空间距离的影响。随着声源距离的增加,声音在空间定位任务中的辨别性逐渐降低,从而影响最终预测准确性。

四.项目价值

它回答了一个更根本的问题:空间音频感知,能不能走出实验室?以往,想让机器“听声辨位”,要么给它戴上昂贵的360度麦克风阵列,要么雇人手工标注海量数据。两条路都通向同一个结局——技术被锁在可控环境里,无法规模化。这也是为什么空间音频在机器人、AR/VR、自动驾驶等领域长期“叫好不叫座”。而我们的方案证明了另一条路可行:用互联网视频做老师,用相机的自运动做监督信号,无需标注、无需特制设备,模型就能从真实世界的混沌中学会三维空间听觉。实验结果表明,这套框架不仅在自采数据集上表现优异,在公开基准上也取得了具有竞争力的结果——更重要的是,我们证明了“野外数据”不是障碍,而是可规模化的训练资源。更长远地看,这项工作指向了三个方向:对具身智能:机器人不再需要“听力培训”,只要带着摄像头走一遭,就能自主理解周围的声音空间;对AR/VR:空间音频渲染可以摆脱昂贵的全景采集设备,让沉浸式体验的制造成本大幅下降;对多模态学习:我们提供了一条新思路——视觉运动是音频空间感知的“免费老师”,这种跨模态监督信号的挖掘,或许比模型架构本身更具想象力。

五. 链接

论文链接:https://scholar.google.com/citations?view_op=view_citation&hl=zh-CN&user=QEMEaxwAAAAJ&citation_for_view=QEMEaxwAAAAJ:d1gkVwhDpl0C https://openaccess.thecvf.com/content/CVPR2025/papers/Min_Supervising_Sound_Localization_by_In-the-wild_Egomotion_CVPR_2025_paper.pdf

闵安娜,清华大学本科,曾在MIT CSAIL及密歇根大学访问学生。曾获清华大学学业优秀奖学金、科技优秀奖学金、综合奖学金及星火计划奖学金等。 陈梓阳,密歇根大学博士,现任Luma AI研究科学家。 赵行,清华大学交叉信息研究院助理教授,上海期智研究院PI,星海图联合创始人及CTO。 Andrew Owens,康奈尔大学副教授。


END

 推荐阅读 :

千万级标注成本归零!清华团队的CVPR工作:解决具身的下一个难题图6



关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
深度解读植入式脑机接口审评要点:入组的“温柔悖论”、估值的“技术价签”、续命的“算法枷锁”
从“替代神经”到“重塑神经”:新型双向脑机接口登上《Nature Medicine》
首款恢复AMD患者功能性中央视觉的脑机接口 PRIMA 在欧洲上市
植入式脑机接口的数据保护问题
国内植入式脑机接口临床进展与产品组成:工程师怎么看?
资讯速递|脑机聚力向未来!第二届高新创新发展大会脑机交互与人机共融论坛在津举办
同步采集5376通道脑信号!新型神经记录-刺激一体化平台刷新脑机硬件上限
南昌大学第二附属医院 | 植入式脑机接口上肢功能重建临床试验正式启动
西湖大学周南嘉等:抗溶胀水凝胶突破植入式脑机接口长期稳定难题
这家脑机接口公司获宇树早期投资人押注,正在打造可泛化人类神经意图模型
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号