获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发

智能涌现 2026-08-10 13:51
获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发图1
获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发图2
赵芮
编辑张雨忻

高中第一次戴上耳机听陈奕迅,陈伟嘉就被歌词之外的信息吸引:音色、歌手状态、声音环境。如今,他想让音频模型处理的,也正是这些语言之外的信息。

一句“我没事”,可能是安慰、逞强,或冷漠。一个关门声,不只是关门动作本身,还包含了关门的力度、门的材质、声源距离多远、传递的情绪等信息。

在陈伟嘉看来,这些文本之外的信息更难被模型捕捉,“过去两年,⾳频AI目前在很⼤程度上被等同于语⾳AI。”行业讨论更⾃然的TTS、更准确的语⾳识别、更低延迟的⼈机交互,主要围绕“⼈在说什么”展开。⼤量⾳频模型,只重点处理了其中最易被⽂字描述的⼀层。模型理解声⾳“代表什么”,但难以“为什么会这样发⽣”。

聚焦这一方向,陈伟嘉在2025年9月创立音频智能公司Noiz,希望构建声学智能基础设施,让AI不仅能够识别和⽣成声⾳,也能够理解、模拟声⾳如何发⽣、传播并被感知。

《智能涌现》获悉,Noiz AI已完成数千万元种子轮融资。最近一次融资来自金沙江创投,此前由北极光创投、英诺天使基金投资。目前Noiz全球用户已突破200万,ARR百万美元。

Noiz团队目前正职员工10余人。创始⼈陈伟嘉曾在Meta、Tiktok任职,做视频、ASR与Agent相关工作。回国后他创办玉符科技,做身份管理类SaaS,2020年公司被腾讯收购。随后,他在腾讯参与Agent模型的⼯程化落地,又经历了语⾳克隆、多模态模型和Coding等不同技术阶段,也是语⾳克隆开源项⽬Mockingbird的作者。

联合创始⼈陈前具有北⼤、清华和MIT的教育背景,此前曾任百川智能用户增长及运营负责人。⾸席科学家Zeyue Tian最早系统研究音视频联合生成的研究员之一,他开源的全曲生成模型ChatMusician曾被杨立昆转发。

团队其他成员来⾃Meta、Dolby、TikTok等公司和实验室,覆盖声⾳模型、多模态预训练、空间⾳频、产品⼯程和商业增长等⽅向,同时大多成员兼职乐队乐手及音乐创作。

获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发图3
构建声学智能基础设施

在音频模型领域,Noiz不把⾃⼰定义为单⼀的配⾳⼯具或⾳频⽣成产品,⽽是⼀家从通⽤⾳频模型出发,逐步构建音视频智能底座的公司。在Noiz看来,新一代音频模型是对声⾳的产⽣、传播、空间响应及感知过程统⼀理解、⽣成与模拟的能⼒。

公司创立初期,Noiz自研开源音频模型底座AudioX,并以创作者⾳频产品Noiz AI进⼊市场,将技术放入产品接受付费验证。

Noiz AI⾯向短视频、内容制作和泛娱乐场景的创作者,提供语⾳、⾳乐、⾳效、视频配⾳和声⾳编辑能⼒。目前已积累约200万海外创作者,但C端用户并非Noiz主要现金来源,而是作为模型初期的数据雷达,指引AudioX不断迭代。

这一意识来自初次创业的“教训”。当时在研发身份认证Saas时,陈伟嘉带团队打磨技术,产品问世近20个月才尝试商业化,结果市场反馈不达预期。2020年正值疫情,腾讯会议用户规模大幅跃升,公司被腾讯收购,这才意外得到一个商业出口。以市场反馈指引技术也因此在陈伟嘉心里扎根。Noiz模型从第一代起就根据⽤⼾的实际制作和付费⾏为迭代。

获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发图4
Noiz AI团队参与对外交流活动

C端用户外,Noiz目前还在同时用另外两类业务验证底层模型能力。一类是API与企业集成。同⼀套模型以API和系统集成的形式,进⼊内容平台、视频⽣产⼯具和企业⼯作流。企业客⼾可以根据业务需求调⽤语⾳、⾳乐、音视频、翻译和空间⾳频等不同能⼒。主要客户来自短剧、游戏、视频生产等领域。

另一类是3D与具⾝智能合作,目前Noiz正在把通⽤声⾳底座拓展到3D世界和具⾝智能。区别于给画⾯后期贴上⼀段⾳效,Noiz对于3D场景的目标在于根据⼏何结构、材质、距离和听者位置,⽣成匹配的空间声场。

对于机器⼈而言,听觉具有全向、连续和不受视线遮挡的特征。机器⼈可能通过声⾳更早感知⾝后的脚步、周围的碰撞、设备内部异常摩擦、⼀次动作是否产⽣了合理的物理结果等。

今年6月,团队发布AudioX-Turbo进⼀步解决⽣成速度问题。在团队看来,在⽆声视频⽣成声⾳的场景中,模型需要让脚步、碰撞、运动和画⾯中的事件尽可能同步发⽣,⽽非等待长时间离线渲染。这一模型也是帮助团队从离线内容制作⾛向交互式声学系统的基础,他们认为当声⾳能够⾜够快地⽣成,才有机会进⼊实时视频、游戏、虚拟⻆⾊和⼈机交互系统。

目前,随着底层模型逐渐统⼀,公司正在从“⽣成⾳频内容”,进⼀步⾛向“实时音视频交互”。

获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发图5
寻找物理状态下的模型数据

2022年,做声音克隆和情绪模型训练时,陈伟嘉就感受到仅靠文本转语音,无法还原人说话时的真实状态。

“跳出语言,一个咳嗽声、非语言的声音、重重关门的声音,本身还有很多信息量。甚至,这些信息量代表着事件发生了,会有什么后续。”他认为,过去的声音AI完全没有捕捉到这些,声音需要连接到环境上下文,而非文本的上下文。

在他看来,目前声音模型的竞争主要集中在语音识别、TTS和实时对话上,行业普遍依赖互联网音频,再通过文本标签或多模态模型补充事件描述。但这类数据通常只告诉模型“发生了关门”,不会记录房间结构、门的材质、施力大小、声源距离、遮挡关系和听者位置。模型因此能够复现一段听起来合理的声音,却很难判断在一个全新的空间里,声音是如何发生。

在Noiz看来,这也是声⾳模型长期面临的数据问题导致。互联⽹上有⼤量⾳频,但很少有数据会系统标注声⾳背后的物理条件。例如,⼀声关门通常不会同时标注房间的⼤⼩和结构、门的材质和厚度、声源与麦克风的距离、空间中的混响和反射、施加在⻔上的力度,以及听者所在的位置和⽅向等,但它们却是训练声学智能所需要的变量。

获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发图6
△创始人陈伟嘉出席交流活动

为了构建这一核心壁垒。Noiz正在着重采集具备物理条件的训练数据,并搭建三类数据来源。

第一类是真实世界采集,通过专门设计的流程控制空间、材质、距离、方向和事件,获得未经重度后期加工的高保真声音,比如来自“杜比声”的数据采集成员会用空间音频方法,在录制时使用两个或四个麦克风,处理声道同步、设备位置统一和空间信息。

第二类是物理声学仿真,批量生成现实中难以穷举的材质、空间和声源组合,以扩大训练条件的覆盖范围。

第三类来自产品端,创作者在noiz.ai中的生成、重试、编辑、保留、导出和付费行为,会被转化为偏好信号,帮助模型判断哪些声音更匹配画面、哪些情绪更有表现力。真实采集保证真实性,仿真补足规模,用户行为提供审美反馈,三者共同形成数据闭环。

获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发图7
音频生成的蓝海在哪?

做模型这件事,陈伟嘉认为:“跟文本走得越近越卷,反之则越蓝海。”

在Noiz提出的声学智能框架下,语⾳并不是声⾳智能的全部,⽽是其中⼀个重要特例。当模型真正理解声⾳如何发⽣时,情绪、空间感和距离感就不需要作为后期效果附加上去,⽽可以成为同⼀个⽣成和理解过程中的内⽣变量。这也是Noiz与传统TTS、素材型⾳效⽣成,以及以对话为中⼼的Audio Language Model之间最主要的区别。

Noiz正在推进的下⼀代模型,希望让声⾳随着环境变化⽽变化。⼀扇⻔被打开或关闭;物体从⽊材变成⾦属;听者从房间⾛到⾛廊;声源从正前⽅移动到⾝后;空间由铺设地毯的卧室变成空旷的地下车库。在这些情况下,Noiz希望声⾳表现可以根据新的空间、材质、位置和事件状态实时产⽣变化。这意味着模型要从“⽣成⼀段看起来合理的声⾳”,进⼀步⾛向“在当前条件下推演此刻应该听见什么”,根据正在发生的事件,实时生成匹配的音效、音乐和环境声。

在单一的配音或音效工具之外,Noiz希望从通用音频模型出发,构建理解声音产生、传播和感知过程的声学智能底座,使模型从复现既有数据分布的“generator”,进一步变成能够根据空间、材质、事件和位置推演声音的“simulator”。

与之相对应,陈伟嘉正在聚焦实时交互内容平台与具身智能市场。

在他看来,传统短剧、视频或游戏,只在制作阶段调用一次模型,生成的声音可以反复使用;但在互动游戏、虚拟世界等实时交互内容平台中,用户每做一个动作,系统都要根据场景、材质、距离和方向实时生成声音。只要用户在线,平台就需要持续调用API,因此调用频率和收入上限更高。

音频模型在具身智能领域的机会,被陈伟嘉概括为“给机器人戴上耳朵”。

他认为,机器人不能只靠摄像头和语音指令,还需要持续理解环境声音。比如杯子从身后掉落、隔壁房间发生碰撞、设备出现异常摩擦,这些都可能处于视觉盲区;机器人如果能听懂声音来自哪里、发生了什么,就能主动采取行动。再往后,声音还可用于多机器人协作以及机器人与人的长期互动。

目前Noiz已与一家具身智能公司合作。Noiz以技术咨询和模型适配的方式参与,为对方提供模型,帮助识别空间声音事件。据陈伟嘉介绍,机器人已经能通过声音判断身后或旁边有杯子掉落,并主动处理,未来也将进一步拓展相关合作。

图片来源企业供图


获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发图8
获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发图9
获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发图10
获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发图13
获金沙江数千万元种子融资,音频模型Noiz要挖掘声音背后的物理信息|智能涌现融资首发图14

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
音频
more
从“听”新闻到“懂”对话:Particle转型音频智能,Radar引擎能否撬动百亿级数据金矿?
fpga实现音频预加重(pre-emphasis)滤波器
让音频信号更好听的放大器;医疗 / 成像 / 通信全胜任四通道高精度 ADC;助力新能源电动车电压向800V迈进的放大器
累计20年音频技术积淀,炬芯科技以存内计算重构端侧AI音频
2025年中国AI音频眼镜行业市场深度调查及投资前景预测报告
音频-视觉全模态的未来预测,FutureOmni给出了首份答卷
D 类功放是怎么统一汽车音频的?
小米Sound 2 Pro正式发布,1399元起售强化家庭音频体验
AI播客的未来是成为每个人的音频助手,事实性、完整性和活人感都很重要|对话ListenHub
IDC:中国智能眼镜市场2025年二季度同比增长145.5%,小米、雷鸟带动音频拍摄眼镜增长
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号