听、说、演、唱全包,StepAudio 3 有点东西!

科技狐 2026-09-26 23:22
听、说、演、唱全包,StepAudio 3 有点东西!图1

不知道大家现在打字是不是和我一样,现在打字软件的语音输入法准确率直线上升,基本日常打字,特别是手机上的打字,更多都是“用嘴打字”。

当然,这个准确率的直线上升,绝大部分的功劳都要归功于AI的出现,大模型能理解说话的意图以及识别同音字,识别率自然就大大提升。

而就在前段时间,我就刷到了阶跃星辰发了个 StepAudio 3,说把跟声音有关的活儿拆成了五个模型——ASR、TTS、Realtime、Gen、Music 分别对应听、说、聊、演、唱五个语音领域,各管一摊。

听、说、演、唱全包,StepAudio 3 有点东西!图2

而且还在 Artificial Analysis 榜单中位列全球第一。

这个就提起了我的兴趣了,要知道,我之前也给大家测试过其他的语音模型,那么这款第一的模型和之前的有什么进步呢?我就试了一下。

一、主管听的 ASR

对于 ASR,其实我本来没抱希望。

真如我开头说的,微信输入法、豆包我都玩过,现在语音转文字再叠点 AI,正确率 90% 往上都跟白给一样。

你说它比那俩强多少?我没觉得拉开代差。所以我特意上了点难度,下载了一个菜市场的白噪音,再融合说话的声音,想看看它能分辨出来多少。

结果呢?在嘈杂的环境下,它的辨识能力确实很不错。

听、说、演、唱全包,StepAudio 3 有点东西!图3

例如说原声里面的一些数字 135、8021,还有下午三点半,这些关键的数字,它全部都在杂音中听清楚了,而且语音中该做的事,也大部分都正确了。

还有一些词汇,虽然不影响理解,但也并没有完全正确,例如说"老是飘",它自动改成"很飘";"看下"变成"看一下",它自己按理解给我换同义词。

听、说、演、唱全包,StepAudio 3 有点东西!图4

这些东西确实还能理解,毕竟其他很多输入法也会有同样的错。

但却还是有一些问题,特别是一些关键的细节,它完全听错了。

例如说名字上,原本是"陈志明",它给我写成"周志明"。一个字,整段主语换人了。结尾的"回公司"变成"回去修",在行动上也完全做了改变。

当然,整体效果我还是挺满意的,毕竟这个测试本来我就给他增加了难度,能在高难度下依然识别出 95% 以上的内容,算是很不错的结果了。

二、主管说的TTS

这个模型主要管的是说话,就是能直接生成人说的话,甚至还能附带情绪的那种。

说真的,之前我测试的很多AI语音大模型,基本都是不会有语气、情绪这一栏的,这个让我觉得特别意外。

所以我做了个测试,试着同一句话,同一个声线,让AI试着用不同的语气说出来,看是不是真的有效:

“呃,就是……那个,我跟你讲啊,今天这事,唉,怎么说呢,我本来是想好好说的,结果你倒好,一句话就把我噎回来了。我当时就,哎——算了算了,我也懒得说了,反正,说了你也不听,对吧。”

这句话我特意给了很多语气词在里面,看看AI能不能根据我给的语气揣摩出来。没想到出来的结果却是很有意思,它竟然真的说出了不一样的感受出来。

当阴阳怪气的时候,确实能隐隐约约听出话语中背后的嘲讽和挖苦,特别是“你倒好”这些词汇,语调上非常能感受到情绪。

当疲惫疲劳的时候,语速确实慢下来了,像“哎”之类的叹气中,也能感受到是那种无能为力,非常疲惫的感觉。

当要她升高情绪时,确实能感受到话语从最初的平静,慢慢到情绪的抬升,特别是“结果你倒好”声调一下子提升,能感受到语气的明显变化。

有了人味之后,AI配音能比之前干更多的事,例如说视频、游戏、有声书的配音,也会有更多的选择。

三、主管演的Gen

如果说上面的TTS主要是扮演人的话语,那这里的Gen我觉得就更有意思了,它是TTS的升级版。

它不仅能生成人的话语,还能生成背景音、音效等等,简单来说,它能直接生成一个故事,只要把人物说话的顺序、音效、背景全部搭好,它就能直接给你生成一个语音故事出来。

我尝试生成了一个深夜一家三口对话的场景。

出来的音频我是觉得挺有意思的。

首先,继承了前面TTS的优势,三个人——父亲、母亲、孩子的声音都是能分开的,而且也各有情绪。

例如说孩子只剩下最后一关,想再玩一会游戏的求饶声,母亲的情绪升降,以及父亲对于孩子讨价还价时的打趣。

所有话语既没有叠在一起的鬼畜,你能明显听出来这是一家子人,而不是三个ai在读稿。

但是这个模型我自己感觉仍有缺点,例如说我是给音频设置了效果音的,但是一直抽不出来,可以看到,在这方面它并非长处。

但整体完成度确实很可以,能生成出有效果音和背景音,而且人声也非常有情绪,这样故事感就已经很足了。关键门槛还很低,全部用文字描述就能完全使用,非常简单。

四、主管唱的Music

对于音乐生成的话,我尝试生成了一个有意思的歌曲——死亡金属版《生日快乐》。

出来的歌曲也挺有意思的,失真的吉他,人声是撕裂的那种死腔,地狱感拉满。非常魔幻的是,即使这么死亡金属,但"生日快乐"四个字清清楚楚,你一听就知道是祝寿的。

当时AI还给这首歌取名《地狱贺寿》,确实魔化又离谱。

当然,歌曲生成的话,现在很多AI软件都能生成出很不错的整曲音乐,所以对此我也没有很意外。但阶跃星辰却多了两个新的功能,叫做“歌曲改编”和“清唱配乐”。

这两个功能倒是新鲜,难道这个可以根据原曲生成改编的歌曲吗?

但事实这两个功能却翻车得挺狠的。

首先是歌曲改编,我给了它一首《小兔子乖乖》,想着用儿歌来生成一首恐怖歌曲,没想到直接翻车了。

不知道是AI辨认不出原曲的歌词,还是它原本就不懂改编,生成出来的歌曲,整首只认出一个"开"字,弄出个恐怖风但一句词没有。

严重怀疑是不是在“鬼打门”一直喊“开!”

其次是“清唱配乐”,同样的问题。我试着自己哼唱,让它给我配乐,想着我这五音不全,是不是可以让AI帮我修修音,再配个好一点的配乐。

谁知道出来的还是没有歌词的音乐,八竿子打不着,跟原曲毫无关系。

所以Music这里的功能,虽然有3个,但这么看的话,其实主要还是围绕“音乐生成”这一个关键的功能。

五、主管聊的Realtime

现在实时聊天这个功能,绝大部分AI工具都有,例如说豆包,基本都在线。

所以我的计划是,不断地打断它,反复折腾它,看它会不会崩。

上来就丢一句:「帮我在网上查查公司附近那家川菜馆,评分咋样、人均多少。」

然后我开始发疯——“算了查火锅店”,“不对我要看招牌菜”,“哎营业时间也查下”,”就查个不咋起眼的那种馆子啊”。

开始了我的夺命四连问,而且我不是等它说完再改,是它刚冒出半个音我就把话堵回去,专挑它最想接话的节骨眼截胡。

有意思的来了。

第一,它收声特别快。我一张嘴,它那边立马噤声,没有那种「我这句话念完你再讲」的臭毛病。

第二,它没把整段对话推倒重来。就顺着我说「换火锅、加招牌菜、加营业时间、要低调」,前面查川菜那句它自己消化了,不啰嗦。

最关键的第三点:从头到尾,它都老老实实待在「查资料」的框里。没忽悠我说「已经帮你订好了」,也没脑补一个它根本打不了的电话。

知道自己几斤几两,这点比豆包要更聪明,不会为了讨好而骗人。

一方面是它会接话,另一方面我们把需求改了四遍,它也能接话干活,这方面,我倒觉得这个实时聊天工具非常实用。

所以说整体测下来,这五个语音模型确实是各有特色,但也并没有说非常惊艳,依然逃不出AI特有的需要抽卡的特性,而且偏科非常厉害。

本来的话,听、说、聊、演、唱五个功能齐全,但现在来看,听、说、演、聊天都算不错,特别是语音生成,自带情绪语气确实很难得。

但确实有点偏科,在音乐歌唱方面,只能说和市面上的ai并无突出优势,不过要是想一个工具解决所有声音上的内容,那这确实是个非常不错的选择。而且现在每天还有非常多的使用额度,目前来看还是很经济实惠的。

作者:ZJ

听、说、演、唱全包,StepAudio 3 有点东西!图5
听、说、演、唱全包,StepAudio 3 有点东西!图6

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
京东方发布全球最薄玻璃基P0.7 Micro LED大屏
荣耀Magic9价格提前公布!新品前瞻来了~
荣耀Magic9 Pro Max月夜样张曝光,影像旗舰蓄势待发
【Informa TechTarget 招聘】 Research Director,China Semiconductor research practice
会议回顾 | MicroLED CPO大会直击,产业进入商业化落地关键窗口期
麦沄Driver MIP显示产品发布,开启Micro LED主动发光显示新范式
每人持股约2%,却要50.1%投票权:Anthropic创始人的IPO算盘
资本变局下的创投新生态:StrictlyVC旧金山峰会聚焦AI时代的资金流向与退出机制
Anthropic生命科学重磅成果!Claude自主发现新酶系统,学者炸锅了
华为Mate90真机露出,iPad mini8配置曝光,中国8月用电破万亿度,Anthropic拟租1GW算力,这就是今天的其他大新闻!
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号