【科技24时区】当AI生成的声音不再只是机械的朗读,而是能精准传递愤怒、温柔或是窃窃私语的情绪时,语音交互的边界正在被重新定义。位于帕洛阿尔托的初创公司Fish Audio,正试图通过其庞大的自然语言控制库——包含超过1.5万个指令标签——来同时满足创意领域对表现力的渴求,以及企业端对自动化客服和销售流程中“可控性”的严苛要求。
这家由前英伟达研究员廖世佳(Shijia Liao)创立的公司,故事始于一个略显极客的卧室项目。几年前,面对市场上那些呆板、毫无起伏的合成语音,廖世佳感到难以忍受,尤其是对于痴迷日本动漫的他而言,这些声音根本无法承载角色的灵魂。于是,他利用笔记本电脑上的单块GPU训练出了最初的语音模型,并将其开源为Fish Speech。如今,这个GitHub仓库已收获超过3.1万颗星标,成为独立开发者、游戏设计师和内容创作者手中的利器。
从开源社区走向商业闭环,Fish Audio的速度令人瞩目。自去年正式推出以来,其开源及托管模型的用户规模已突破800万大关,年度经常性收入(ARR)达到2100万美元。为了进一步巩固这一势头,该公司于周二宣布完成5200万美元的种子轮融资。本轮融资由Coreline Ventures和今日资本(Capital Today)领投,359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners以及HF0等机构跟投。
值得注意的是,Fish Audio在过去一年中密集推出了五款模型:四款语音生成模型和一款语音转文本(STT)模型。其中三款生成模型保持开源,而最新的S2.1 Pro专业版则仅通过付费API提供服务。这种“开源引流+高端变现”的策略,使其在竞争激烈的语音市场中找到了独特的生态位。目前,HeyGen、Sanas以及LiveKit等知名企业已成为其客户。
“每家企业的需求痛点截然不同。”Fish Audio联合创始人兼CEO曹丽莎(Rissa Cao)指出,像HeyGen这样利用AI数字人的公司,追求的是极致的真实感;游戏工作室则需要角色拥有丰富的情感张力;而对于LiveKit这类语音代理公司,低延迟且自然的通话体验才是核心诉求。Fish Audio提供的月度订阅计划及企业级API,正是为了适配这种多元化的需求光谱。
然而,随着用户规模的膨胀,版权与伦理问题也随之浮现。Fish Audio曾鼓励用户上传自己的声音样本以训练模型并给予补偿,但这引发了一些争议:部分创作者指控其声音在未获授权的情况下被上传至平台。尽管公司此前设有DMCA下架流程,但处理效率低下饱受诟病。对此,曹丽莎向TechCrunch透露,公司已将下架流程全面自动化。现在,创作者只需提交简短的声音样本或合同证明所有权,平台即可在3分钟内完成移除操作。
尽管如此,隐患并未完全消除。只要艺术家本人未察觉并提出申诉,其声音仍可能在平台上被滥用。Coreline Ventures合伙人Osuke Honda对此表示担忧,他认为社区驱动模式的核心在于信任。“只有当同意权、透明度和归属权被内置到产品中,而非作为事后补救措施时,以社区为中心的方法才能成为持久的优势。”他呼吁行业应向经过验证的声音所有权、清晰的许可条款以及最终的收入分成模式演进。
从单纯依靠开源项目的高效运营,到如今引入外部资本以开发更先进的模型并拓展企业市场,Fish Audio的战略转向清晰可见。展望未来,公司计划在今年发布音频理解模型,并正在研发语音转语音(Speech-to-Speech)技术。
当下的语音生成赛道可谓拥挤不堪,ElevenLabs、WellSaid、Cartesia、Speechify、Async(原Podcastle)以及Krisp等巨头与新秀均在争夺创作者和企业的预算。359 Capital合伙人Rico Mallozzi认为,Fish Audio之所以能在众多资金雄厚的AI实验室中脱颖而出,关键在于其对细粒度控制的打磨以及高效的模型训练能力。“他们团队所构建的最先进模型,极大地缩小了‘机器音’与‘人声’之间的差距,这展现了极高的技术敏锐度。”Mallozzi评价道。
这笔5200万美元的资金,不仅是对其过往成绩的认可,更是对其未来能否在AI语音默认界面之争中占据一席之地的押注。
Fish Audio获5200万美元种子轮融资,以“情感可控”语音切入AI交互深水区
科技区角
2026-07-29 00:01
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。