【科技纵览】
9月23日,千问正式推出Qwen-Audio-3.1系列语音大模型,对语音识别、合成及实时交互三大核心模块实施全面迭代。此次更新不仅涵盖基础模型升级,更引入了全新的音频创作模型Qwen-Audio-3.1-TTS-Next与音频理解模型Qwen-Audio-3.1-ASR-Next。官方表示,这五款新模型共同构建起覆盖“理解-生成-交互-创作”的完整音频能力栈。值得注意的是,为降低使用门槛,Qwen-Audio全线语音模型价格大幅下调,其中TTS服务降价约70%,Realtime降幅约85%,ASR降幅更是高达95%。
在语音识别领域,Qwen-Audio-3.1-ASR强化了多语种、方言识别及上下文理解能力,新增原生转写润色功能,可自动剔除语气词与重复表达并重组语义。该模型支持30种语言和16种中文方言,具备低延迟流式识别特性,首字响应时间约为160毫秒。内部测试数据显示,其在中文方言集上的平均字符错误率(CER)为10.38%,在11个方言子集中取得最优结果,温州话等难懂方言的提升尤为显著。而基于下一代架构的Qwen-Audio-3.1-ASR-Next,则将处理对象从“语音文字”扩展至“完整音频信息”,能够解析人物情绪、环境声与机械声,完成声音描述、事件定位及音频推理。在分角色ASR评测中,该模型于四个测试集的八项指标里斩获五项第一。
语音合成方面,Qwen-Audio-3.1-TTS支持多语种及方言合成,实现同一音色跨语言的自然迁移,并允许通过指令精准控制情绪、语速及表达方式。全新推出的Qwen-Audio-3.1-TTS-Next则突破单一语音合成局限,围绕文本、时间戳和参考音频等输入,统一生成人声、音效与环境音。该模型支持多角色音色复刻与多轮对话生成,融合多种声音元素,可通过自然语言控制生成过程,支持细粒度时间戳控制和48kHz高保真输出,广泛适用于播客、有声书、影视剧、游戏及广告等专业音频创作场景。
实时交互层面,Qwen-Audio-3.1-Realtime升级了全双工能力,支持同时说听、随时插话与打断。模型能识别用户情绪与交流意图,在多语言切换中保持上下文连贯与语气一致,并可主动调用Agent工具执行搜索或查询任务。目前,该模型正与Qoder、千问办公等Agent,以及QwenNote、A2、Eva、千问AI眼镜、乐奇AI眼镜等智能硬件深度结合,推动具身智能与语音交互的进一步融合。
千问发布Qwen-Audio-3.1系列,音频模型全线降价最高95%
科技区角
2026-09-23 15:30
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。