
智东西9月23日报道,千问今日正式发布Qwen-Audio-3.1系列语音大模型,一次性推出5款模型,对语音识别(ASR)、语音合成(TTS)和实时语音交互(Realtime)三大核心模型进行了升级,还发布了基于下一代架构的音频理解模型ASR-Next与音频创作模型TTS-Next。其中,新一代语音识别大模型Qwen-Audio-3.1-ASR 通过公开方言测试集KeSpeech和WSYue进行了测试,在11个子集其中的6个里,相比Doubao-ASR和Tencent Hy-ASR-3.0-preview两款开源模型成绩更好,平均字错误率(CER)仅为4.55%。▲公开方言测试成绩(来源:千问大模型)
此外,Qwen-Audio全线语音模型价格下调,其中TTS降价约70%、Realtime降幅约85%、ASR降幅达95%。价格方面,Qwen-Audio-3.1-ASR-Flash输入0.8元、输出2.7元/百万tokens;Qwen-Audio-3.1-TTS-Flash输入1.5元、输出12元/百万tokens;Qwen-Audio-3.1-TTS-Next输入6元、输出12元/百万tokens;Qwen-Audio-3.1-Realtime-Plus根据档位不同,输入5~40元、输出40~150元/百万tokens。▲Qwen-Audio-3.1系列语音模型价格一览表(来源:智东西制图)
该系列中,大部分模型的API已上架千问AI平台,其中ASR-Next的API还未上线。在9月22日开幕的2026云栖大会上,阿里就已预告了这次发布的几款模型,首次登场的同声传译模型Qwen3.8-LiveTranslate并不再此次发布列表之中。除此之外,千问办公今天还发布了两款智能硬件,分别是首款Agent硬件QwenNote A2和桌面机器人Eva,Qwen-Audio-3.1-Realtime会逐步接入这些硬件。其中,QwenNote A2是一款磁吸在手机背面的AI助理设备,自带4G网络,能脱离手机独立录音转写、翻译,支持AI对话、总结会议和撰写方案。桌面机器人Eva内置千问办公,能够与用户进行实时语音交互,完成用户下达的任务,并支持多端联动。https://www.qianwenai.com/models/qwen-audio-3.1-asr-flashhttps://www.qianwenai.com/models/qwen-audio-3.1-tts-flashhttps://www.qianwenai.com/models/qwen-audio-3.1-tts-nexthttps://www.qianwenai.com/models/qwen-audio-3.1-realtime-plus
Qwen-Audio-3.1-ASR具备结构化、听得广、听得准、听得快、听得清五项核心能力。其中,Qwen-Audio-3.1-ASR采用端到端方案,把说话人标签、时间戳和文本联合输出,既能处理轮流发言,也能保留短插话和重叠语音,可以为会议、访谈和对话分析提供可追溯的结构化记录。语言覆盖面上,一套模型支持30种语言和16种中文方言。词汇覆盖率方面,该模型支持行业词、专业实体和分级热词识别,能参考长音频历史上下文,保持人名、缩写和术语一致。延迟方面,该模型在低延迟流式识别下,首字响应约160毫秒。同时,Qwen-Audio-3.1-ASR在转写完成后自带润色功能,可以自动去除语气词与重复表达并仅需语义重组,能够自动区分不同说话人,实现长音频角色一致、时间对齐与结构化输出。除公开测试外,在阿里内部自建的中文方言测试集评测ASR中,Qwen-Audio-3.1-ASR在对16种中文方言的原文转写测试中,平均CER为10.38%,温州话和苏州话识别能力断层领先。▲阿里内部自建中文方言测试集评测ASR成绩(来源:千问大模型)
内部自建的中文方言测试集评测AST,用于评测将方言语音翻译为普通话、准确保留原意的能力,Qwen-Audio-3.1-ASR在11个方言子集中的10个上表现最优,平均语义句准率达到82.10%。▲阿里内部自建中文方言测试集评测AST成绩(来源:千问大模型)
Qwen-Audio-3.1-TTS升级重点是跨语言音色合成能力,同一个音色能跨语种自然迁移,官方演示中,Qwen-Audio-3.1-TTS能够用一种音色分别说出普通话、广东话、河南话、英语和日语。此外,模型合成语音的情绪、语速和表达方式可以通过指令控制,同一句话可以表现出开心、伤心等不同状态,更强调真实表达,使声音贴近具体内容与使用场景。实时语音交互模型Qwen-Audio-3.1-Realtime进一步强化了对情绪、交流意图和上下文的理解,同时支持多语言实时切换、工具调用,并强化了安全与事实可靠性。在实际多人对话场景中,全双工实时交互让Qwen-Audio-3.1-Realtime能够根据对话进程适时等待、插入和回应,面对多人连续交流,可以结合上下文判断何时应该参与对话、何时继续等待。Qwen-Audio-3.1-Realtime可以根据用户的语气和情绪调整回应方式,在对话中切换语言后继续保持上下文和交流节奏。当用户提出查询、搜索等需求时,Qwen-Audio-3.1-Realtime还能调用API、知识库等外部工具完成任务,再将结果带回对话。据发布的技术报告,Qwen-Audio-3.1-Realtime在τ-Voice半双工语音转文字适配版上的整体任务成功率从78.4%提升至82.0%;在Full-Duplex-Bench v1.5上,对背景语音的响应率从73.0%降至13.0%,意味着模型更少受到无关背景语音的干扰。▲Qwen-Audio-3.1-Realtime技术报告(来源:arXiv)
此外,Qwen-Audio-3.1-Realtime正在与Qoder、千问办公等Agent,以及QwenNote、A2、Eva、千问AI眼镜、乐奇AI眼镜等智能硬件结合。官方称,在这些场景下,用户不必始终打开电脑或手机,可以直接通过语音发起任务,并在实时对话中继续添加条件、修改需求或了解执行情况。
本次阿里还发布了两款音频方向的新模型Qwen-Audio-3.1-ASR-Next和Qwen-Audio-3.1-TTS-Next,分别用于补充ASR和TTS在语音之外的音频理解空缺。Qwen-Audio-3.1-ASR-Next把声音处理范围从语音中的文字扩展到完整音频信息,能理解人物情绪、环境声与机械声,完成声音描述、事件定位、音频问答与推理。官方举例,面对一段同时包含人物对话、背景音乐和环境声的音频,模型会输出对话文本,还会描述里面有哪些声音、相关事件在何时发生,并回答与整段内容有关的问题。在分角色ASR的评测中,Qwen-Audio-3.1-ASR-Flash-Next与Qwen-Audio-3.1-ASR-Flash版本分别拿下五项和三项最优结果,均优于此前的Fun-ASR级联系统。Qwen-Audio-3.1-TTS-Next则将能力从语音合成拓展到音频创作。基于文本、时间戳和参考音频等输入,模型可以统一生成人声、音效和环境音,组合成完整的音频内容。在多轮生成中,模型能够保持不同角色的音色一致,并呈现停顿、接话、情绪转折等自然表达。同时Qwen-Audio-3.1-TTS-Next支持细粒度时间戳控制、声音复刻和48kHz输出,可以对对话、音效和内容节奏进行更精细的编排,覆盖播客、有声书、影视、游戏、广告等场景。
Qwen-Audio-3.1系列语音模型在语音识别、语音合成和实时交互能力等方面持续优化,价格也进一步下探。与此同时,ASR-Next、TTS-Next也将能力覆盖范围向音频理解和音频创作延伸。阿里方面将语音定位为连接人、内容与AI的自然入口。接下来,AI眼镜、桌面机器人等新终端的普及,也将带来更多语音调用需求。
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。