【科技24时区】当你在电话那头听到客服流畅、自然的应答时,你可能并未察觉,这背后或许并非真人,而是由ElevenLabs提供的语音模型在运作。这家成立仅四年的初创公司,正悄然构建着人工智能的“声音层”,将文本转化为极具人类特质的语音。从Klarna为3500万美国用户提供的一线电话支持,到德意志电信、思科、Adobe乃至多国政府的广泛采用,ElevenLabs的身影已渗透至商业与公共服务的毛细血管中。
尽管市场上不乏竞争者——例如曾基于ElevenLabs训练其语音产品、如今却与其正面交锋的对话式AI平台Decagon——但资本似乎对这种“既合作又竞争”的局面并不担忧。据透露,ElevenLabs目前的年度经常性收入(ARR)已达6亿美元,并在近期获得了高达220亿美元的估值。这一数字背后,是市场对AI语音交互从“可用”向“可信”跨越的巨大期待。
在多伦多的Nrth创业大会上,ElevenLabs联合创始人兼CEO马蒂·斯坦尼谢夫斯基(Mati Staniszewski)接受了采访。面对关于音频模型是否会在几年内沦为“大宗商品”的质疑,他坦言,虽然长期来看(三到五年后)模型间的质量差异会缩小,但目前仍有大量工作待完成。“我们渴望成为第一个通过图灵测试的对话式AI,”斯坦尼谢夫斯基指出,“这不仅需要智力,更需要情商——理解对方的情绪,懂得何时放慢语速或提高音量。这一点,目前尚未实现。”
业务结构上,ElevenLabs呈现出明显的多元化特征。超过55%的收入来自传统企业客户,而剩余近45%则来自中小企业、开发者及内容创作者,后者利用该平台制作有声书、配音甚至音乐。值得注意的是,随着AI产业链界限的模糊,模型公司、平台公司与应用公司之间的壁垒正在消融。正如Anthropic从单纯的模型提供商演变为涵盖广泛应用的平台一样,ElevenLabs也允许客户在其平台上选择不同的“推理层”,无论是前沿实验室模型还是开源权重模型。
对于模型选择,斯坦尼谢夫斯基认为这并非二元对立。在仅需信息传递、无需执行复杂操作的场景中,开源模型凭借知识库定义的良好体验足以胜任;而在金融等对准确性要求极高、容错率极低的领域,前沿模型仍占据主导地位。此外,面对不同国家政府客户的差异化需求——如波兰公共卫生系统中用于减少18%爽约率的预约提醒代理——ElevenLabs采取了灵活策略,根据数据驻留要求和具体用例,整合开放权重、闭源或微调模型。
关于伦理与透明度,斯坦尼谢夫斯基主张现阶段应向用户披露AI身份。“人们不希望感到被欺骗,”他说,“但当社会普遍拥有个人代理时,这种认知将会转变。”他建议,若人工等待时间过长,提供AI选项往往能带来惊喜般的用户体验。至于毛利率,他虽未透露具体数字,但明确表示愿意为了扩大市场份额和证明价值而接受利润空间的压缩。“如果能在未来五年共同创造价值,我们不介意利润率进一步降低。”
在数据安全与合规方面,ElevenLabs采取了谨慎态度。尽管拥有数百万小时的客户服务通话数据,但其训练重点不在于数据量,而在于精细标注——包括说话时机、语气及情感表达,甚至聘请语音教练以准确识别口音。针对外界对其可能像Hugging Face那样面临安全风险的担忧,斯坦尼谢夫斯基强调,ElevenLabs不部署具有自我复制或递归能力的智能体部分,且所有客户均需通过KYC(了解你的客户)审核,从而在源头上规避了代理创建代理的风险。
至于备受关注的IPO计划,斯坦尼谢夫斯基给出了一个模糊的时间表:“我们希望打造一家经得起时间考验的公司,正在为未来几年的上市奠定基础,但具体时机取决于市场与环境。”在AI技术快速迭代的当下,ElevenLabs试图在技术创新、商业扩张与伦理责任之间寻找平衡,而其能否真正通过“图灵测试”,不仅关乎技术指标,更关乎人类社会对机器声音的最终接纳程度。
估值220亿美元,ElevenLabs如何构建AI的“声音层”?
科技区角
2026-09-25 02:01
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。