阿里甩出“配音”神器:能调整情绪,还会说方言

智东西 2026-07-20 21:16

阿里甩出“配音”神器:能调整情绪,还会说方言图1

模型在语音合成榜单中位居第一。
作者 |  杨京丽
编辑 |  李水青
智东西7月20日报道,今天,千问大模型发布语音合成大模型Qwen-Audio-3.0-TTS,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本
模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升。目前,Qwen-Audio-3.0-TTS-Plus在第三方评测机构Artificial Analysis的Speech Arena语音合成榜单中居于第一,Elo得分为1237。
阿里甩出“配音”神器:能调整情绪,还会说方言图2

▲Qwen-Audio-3.0-TTS-Plus在语音合成榜单中排名第一(图源:Artificial Analysis)

阿里还将陆续上线指令风格音色、20种方言音色、细粒度控制音色及14种以上小语种音色,供开发者直接调用。在输出规格方面,Qwen-Audio-3.0-TTS将音频采样率从24kHz提高至48kHz,单次语音合成最长可达3分钟。
目前,Qwen-Audio-3.0-TTS-Plus和Flash版本均已在阿里云百炼开放。
阿里甩出“配音”神器:能调整情绪,还会说方言图3
Qwen-Audio-3.0-TTS-Plus:
https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-plus?serviceSite=asia-pacific-china
Qwen-Audio-3.0-TTS-Flash:
https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-flash?serviceSite=asia-pacific-china

01.
文本里插入标签,
模型可调节语气、情绪、呼吸等


细粒度标签控制是Qwen-Audio-3.0-TTS此次升级的重点之一。用户可以在文本中直接插入结构化标签,嵌入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等这类标记,可以调节语气、情绪和呼吸等细节。
官方也给出了相关的案例,在一段飞船事故相关台词前加入[angry]标签后,模型会以愤怒语气合成后续内容。
合成文本:[angry]你们竟然私自切断了主控系统的能源!知不知道防护罩一旦失效,整艘飞船的人都会化为灰烬?这就是你们所谓的‘为了大局’吗!简直是不可理喻!
参考音频:
合成音频:
根据文本提示,模型在生成的音频中加入了愤怒的语气,角色的质问感和紧迫感随台词逐步增强。
此外,用户也可以通过输入指令,要求模型在说话过程中笑出声。
指令:说到一半忍不住扑哧笑出声
合成文本:你说的这个事啊,我都听过好几遍了,扑哧——还是觉得好笑。
合成音频:

02.
自由指令控制,
可直接用自然语言描述


除结构化标签外,Qwen-Audio-3.0-TTS还支持Free-style自然语言指令控制。用户可以直接用自然语言描述角色、情绪、场景和语速,不需要单独调整专业音频参数。
官方给出了下面这几个案例:
指令:你是一位年轻女性小学老师,正在课堂上耐心地给一年级学生复述拼音规则。语速很慢,每一个发音都示范一遍,语调上扬带笑意。
合成文本:我们再来读一次,j、q、x这三个声母后面如果跟着u,那个u上的两点要去掉。你跟老师一起读,j——u——ju。
参考音频:
合成音频:
模型会按照这段指令合成对应的课堂讲解录音。类似方式也可以用于旁白、角色配音、有声内容和语音助手等场景。
指令:你是悬疑剧旁白,屏住呼吸把紧张感一层层叠上去。
合成文本:那天夜里下着大雨,林晚一个人坐在书房里。窗外的雷声一阵接一阵,灯光忽明忽暗。她忽然听见楼下传来了脚步声——缓慢、沉重,像是有人在故意压低声响。她屏住呼吸,手指紧紧抓住椅子的扶手。脚步声越来越近,最终停在了书房门口。门把手轻轻地,转动了一下。
合成音频:
从合成效果来看,旁白语速较为急促,营造出明显的紧张感,让人仿佛置身故事场景之中。如果有声小说采用这种能够随情节调整节奏和情绪的配音,听众的沉浸感和代入感也会更强。

03.
覆盖16种语言,
10种语言字词错误率最低


Qwen-Audio-3.0-TTS-Plus覆盖中文、英语、日语、韩语、德语等16种语言,新增了阿拉伯语、越南语、马来语和菲律宾语。
根据官方公布的CV3-Eval多语种测试结果,目前,Qwen-Audio-3.0-TTS在16种语言的词或字错误率评测中,Qwen-Audio-3.0-TTS系列在10种语言中排名第一,其中韩语和马来语的领先幅度较大。
在16种语言的说话人相似度评测中,Qwen-Audio-3.0-TTS-Plus取得全部16项最优成绩,Flash版本取得其中15项第二。马来语、西班牙语和阿拉伯语的提升较为明显。
阿里甩出“配音”神器:能调整情绪,还会说方言图4

04.
支持20种中文方言,
强化韵律和声调训练


中文方言方面,Qwen-Audio-3.0-TTS目前支持广东话、重庆话、东北话、陕西话、上海话、四川话和云南话等20种方言。千问称,新模型使用了更多方言数据,并增加了方言强化训练阶段,让模型在韵律、声调与口语表达上接近母语者,减少通用语音强化学习过程中可能出现的方言特征减弱问题。
用户可以通过自然语言指令指定输出方言。例如,输入“输出上海话”,模型即可根据后续文本合成上海话语音。
指令:
输出上海话:屋里向装修真个是烦人,天天敲墙壁,声音响得来!灰尘落得一塌糊涂,真想快点弄清爽。
合成音频:

05.
噪声和混响环境下
仍具备较强声音复刻能力


声音复刻通常需要使用较为清晰的参考录音,但实际获得的音频中可能包含背景噪声或混响。
Qwen-Audio-3.0-TTS加入了真实声学环境仿真训练,将语音增强能力用于声音复刻流程。官方称,在参考音频存在较高噪声或混响的情况下,模型可以过滤部分环境干扰,并提取说话人的音色。
合成文本:听到这首歌的时候,突然想起很多年前的夏天。
参考音频:
合成音频:

06.
结语:语音合成
增强语气、情绪等控制能力


从此次升级来看,Qwen-Audio-3.0-TTS提高了对于语气、情绪、呼吸和角色风格的控制能力。结构化标签适合调节具体位置的表达效果,自然语言指令则能对角色、场景和语速进行整体描述,多语种、方言及复杂声学环境下的声音复刻能力也得到扩展。
随着Plus和Flash版本在阿里云百炼开放,这些能力将进入更多实际应用场景,为旁白、角色配音、有声内容和语音助手提供更多配音方案。
阿里甩出“配音”神器:能调整情绪,还会说方言图5
阿里甩出“配音”神器:能调整情绪,还会说方言图6
阿里甩出“配音”神器:能调整情绪,还会说方言图7
阿里甩出“配音”神器:能调整情绪,还会说方言图8
阿里甩出“配音”神器:能调整情绪,还会说方言图9

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
阿里
more
一天之内,Claude封堵、阿里切割
荣耀携手阿里布局具身智能,Agentic OS或成合作焦点
阿里禁用全球最强AI
募资579亿!长鑫科技申购获阿里美团等巨头加持
荣耀阿里官宣重磅合作 共推Agentic OS落地实践
47.6%,阿里Qoder拿到了比跑分 更硬的成绩
狐讯 | 上海重磅发布“星枢计划”;阿里 Token Plan 个人版发布
上交大&阿里提出LA4VLA:跳出看图做事陷阱,重塑VLA底层逻辑
苹果AI国行版更多消息传来:不止用上阿里千问,百度提供搜索功能
国内AI编程市场第一份成绩单出炉!近50%营收流向阿里,Qoder做对了什么?
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号