看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。

差评X.PIN 2026-09-24 00:00
看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图1


如果你最近发现同事变得神神叨叨的,经常对着手机、电脑小声说话


那他不一定是在跟谁摸鱼聊天,也有可能是在工作。


看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图2 这么说吧,用语音和 AI 随地大小聊,在打工人的圈子里已经成了一种时髦。


以前往工位上一坐,噼里啪啦的键盘声一响,就知道这人开始干活了。


现在不一样。


越来越多的人开始尝试用动嘴来代替敲键盘,让 Agent 改个文档、写个代码就是顺嘴的事儿。

看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图3


当然,Siri都出来多少年了,跟 ChatGPT 开语音聊天也不是啥稀奇体验。


但这波有点不一样的是,Agent 帮人干活,原来那套你一句、我一句的回合制对话,就显得有点不够用了。


所以最近几个月,大模型厂商很默契地又折腾起了怎么让 AI 对话变得更实时。


OpenAI、Google接连推出实时语音交互模型 GPT-Live 和 Gemini 3.8 Live,在 GPT-Live 的演示视频里,AI 被打断了还能接着聊,聊着聊着还能顺手把活儿干了。

看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图4


差评君这两天跑了趟云栖大会,发现包括阿里,也在卷这个方向。


这次大会,阿里带来了一波模型更新,基模这边,新一代架构的 Qwen4 已经在训练中,后面的 Qwen4.5、Qwen5 也排上了日程,参数规模计划扩展到 5-10T。其他像视频、图像、语音、世界模型,也基本轮番更了一遍。


具体到语音这条线,这次发布的语音大模型系列Qwen-Audio-3.1,就一口气升级了语音转写、语音合成和实时语音交互三类模型,其中的 Qwen-Audio-3.1-Realtime,可以边听、边想、边说。


看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图5 AI 明明早就会说话了,为什么大家现在又要抢着做 Realtime?


想搞明白这个问题,咱们可能得先看看现在的这些实时语音交互模型,到底都在卷些什么。


大伙儿可以回忆一下,以前跟 AI 语音聊天是什么感觉。


话最好是一口气说完,但凡中间多停顿了几秒,话茬就让 AI 接过去了,完了你还不好打断它,没说完的话只能等下一轮。


没办法,以前的轮次式语音模型判断你的话有没有说完,一个很重要的参考是看你安静了没。


在 GPT-Live 的技术文档里有提到,以前的轮次式架构会单独放一个小模型充当轮次检测器,但这个判断的尺度不好拿捏。

看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图6


判断早了,AI 老抢话,判断晚了嘛,又怕空气突然地安静。


问题是,谁说话还没个卡壳、改口的时候?或者说到一半突然想起来另外一件事,打断、插嘴也是常有的事。


所以这一轮实时语音交互,有一个非常直观的变化,就是 AI 不需要非得等你把话全都说完,才知道下一步该干嘛。


看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图7 以 Qwen-Audio-3.1-Realtime 为例,这个语音模型的特点是可以边听、边想、边说。


注意,是同时。


你还在说话,它一边听一边理解,它说话的时候,也能分出注意力听你讲,什么时候该开口、什么时候该保持沉默,也可以自己判断。


就算你中途改口或者突然插嘴,都不需要非得把这一轮走完,再开启下一轮。


这种可以同时处理输入和输出,而不是严格按照你说完、我再说的顺序来交流的能力,就是所谓的全双工。

看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图8


所以,Realtime 模型现在卷的是怎么让听、理解、判断和回应,变成一个持续、流畅的过程。


当然,知道怎么接话是一回事,能不能把话听明白又是另外一回事。


毕竟人在说话的时候,传递出去的信息从来不只有字面意思。


同样一句“卧槽”,能表达的意思可太多了。


看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图9 刚买的 iPhone Duo 摔地上的“卧槽”,跟刮刮乐中了 5000 块的“卧槽”,显然不是同一种情绪。


语速快慢、语气轻重、情绪变化,包括一句话中间的犹豫和停顿,本身也都是信息。


OpenAI 在介绍 GPT-Live 的时候,就专门提到过传统级联语音模型的一个问题。

看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图10


过去那种先把语音转成文字,再交给大模型理解,最后再通过 TTS 转回声音的级联方案,不只是链路长,声音转手几道,像语气、节奏这些原本藏在语音里的信息,就有可能在这个过程中丢失。


这么干巴巴地硬聊不是不行,但谁还没幻想过自己也能有个贾维斯呢?


所以厂商们开始尝试,把这些原本容易在“语音转文字”这一步被压缩的信息,留给模型去理解。


像 Qwen-Audio-3.1-Realtime,就会结合语音里的情绪和意图来理解用户。


你不一定非得把“我现在很急”说出口,你着不着急,听声音就知道了。而且轮到 AI 开口,它也会根据具体情况调整语气、节奏和表达。


看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图11 在这个基础上,能玩的花样就多起来了。


就比如角色扮演。


你让 Qwen-Audio-3.1-Realtime 扮演贾宝玉,那它能一直用这个角色的声音、说话方式陪你玩 Cosplay。



聊着聊着,你突然蹦两句英语出来,它也照样能用一口流利的英语接着往下唠。


其实聊到这儿,大伙儿会发现,实时语音交互已经越来越像那么回事了。


但别忘了,现在很多人用语音跟 Agent 聊,是奔着让它干活去的。


既然是干活,就免不了来回扯皮、随时改需求,要是 Agent 每次一开工,就原地消失几十秒,期间完全不能交互,那体验不就又开倒车了嘛。。


看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图12 所以这一波 Realtime 模型,还有一个很明显的变化,就是可以边聊边干活。


Google 的 Gemini 3.8 Live 支持异步调用工具,Extended Thinking 版本还能一边在后台推理、调工具,一边告诉你活儿干到哪了。

看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图13


Qwen-Audio-3.1-Realtime 同样可以在实时对话里调用工具。


比如让它上携程看明天去北京的机票,搜到一半,你中途补一句“别看太早的,十点以后吧”,也不用等这一轮任务结束,再重新交代一遍。


但又要聊天、又要调用工具,模型要处理的事情变多了,速度还不能慢。


所以 Qwen-Audio-3.1-Realtime 这次用了一个多教师蒸馏架构,在保持低延迟的同时,进一步提升了理解、推理、表达和安全能力。


看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图14 反正看下来,实时语音交互模型已经不是单纯比谁的嘴皮子更利索,谁的反应更快了,能不能自然流畅地沟通,顺手再把活儿给干了,才是真正能拉开差距的地方。


而这些能力之所以变得抢手,是因为 Agent 在生产力场景落地之后,咱们跟 AI 打交道的整个逻辑都变了。


以前用 AI,最后交付给你的基本都是一段答案,在输入方式上,打字也好,说话也好,区别没那么大。


但现在干活的是 Agent,人要做的事情,其实就是把需求说明白。

看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图15


而且相比于反复敲键盘、来回修改 Prompt,语音输入明显更省事,唯一需要考虑的情况,可能就是 i 人在公共场合不好意思开口。


所以这也是为啥,模型厂商都抢着实时语音交互这个入口。


看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图16 不过要担起这活儿,对模型的要求可不低。


从外部榜单来看,千问在实时语音交互上拿过不错的成绩。


今年 5 月,Qwen-Audio-3.0-Realtime 的 Preview 版本,曾在 Artificial Analysis 的语音推理能力和对话流畅度两项评测中,拿过第一。

看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图17


7 月发布的 Qwen-Audio-3.0-Realtime,又围绕推理、Agent 工具调用、共情对话和双工交互流畅度这些能力做了升级。


而随着模型能力的不断成熟,实时语音交互也有了更多落地的地方。


软件这块,已经接入了 Qoder 和千问办公。


在 Qoder 里,你可以跟 Agent 口头对需求,让它跑任务。


硬件也没落下,千问办公刚发布的 Agent 硬件 QwenNote A2,可以随时把会议、采访这些信息转成文字,有后续的任务安排,说句话就能吩咐千问办公干活。

看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图18


包括 Qoder 也被塞到了眼镜里,戴着眼镜看到的东西,可以直接成为 Agent 的上下文,要是不在电脑跟前,一副眼镜就能问进度、改需求,给电脑上的 Qoder 派活也不在话下。

看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图19


从公开信息来看,这些能力之后还会往耳机、麦克风这些随身硬件里塞。


从电脑软件里的一个语音按钮,到眼镜、耳机、麦克风这些随身设备,咱们跟 Agent 打交道的方式,正在变成一种随时随地的即时沟通。


而且这次云栖大会逛下来,差评君明显观察到接了 Qwen 的 AI 硬件,有不少。


什么 AI 陪伴玩偶、AI 学习机,各种形态的 AI 智能硬件,有些可能连屏幕都没有,语音就是最直接、最主要的交互方式。


看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图20 所以可以预料到的,像 Qwen-Audio-3.1-Realtime 这种自然流畅、低延迟、边聊边干活的实时语音交互能力,在未来很可能会成为 AI 硬件的一项基础能力。


归根结底,Realtime 真正改变的,不只是语音模型的能力,还有人与 Agent 的协作方式。


或许再过一两年,我们不会再特意提起“实时语音交互”这个词,就像拿起手机滑动屏幕一样自然,随口跟身边的 Agent 交流,也成了再普通不过的日常。


撰文:西西
编辑:江江
美编:素描

图片、资料来源
Artificial Analysis、千问办公、Qoder
部分图源网络



看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图21



看了千问语音模型的更新,我开始怀疑键盘还能用多久。。。图22

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
键盘
more
WIKO Hi MateBook 14 笔记本锐龙版预售:R7 H 255、可选方 / 圆键盘,首发价 4999 元起
AI 语音输入法,正在偷偷挤走「键盘」
造物100 #02|能打游戏的「牙套」键盘、众筹 249 万美元的电子假花、能用卫星找狗的项圈
我把旧鼠标爆改成「AI 外挂」,比 Codex 键盘更适合我
重力星球V60 Ultra磁轴键盘上市,星闪技术加持RT精度达0.001mm
大疆Pocket 4P二手市场溢价超千元/Seedance 2.5七月上线/Meta暂停收集员工键盘鼠标输入
WAIC盛会福利!红包、降噪耳机、键盘免费送,快来抽奖
Zinwa Q27海外发布:黑莓风全键盘Android新机,起售价420美元
Kimi 正式发布 K3 大模型,能力进阶;12.38 万,小鹏 MONA L03 大定破 4 万台;OpenAI 推出 AI 键盘 | 极客早知道
前沿 | 模拟键盘打字的脑机接口刷新沟通速度记录
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号