
新智元报道
新智元报道

近日,Andrej Karpathy分享了一个他自己很爱用的懒办法:想让AI干活,又懒得一个字一个字把需求打清楚,怎么办?
他说,那就靠回椅背切到语音,意识流全开,说个10分钟,一团乱麻、怎么说都行。
有时开口先和AI声明一句「切语音识别了,别介意错别字」。
神奇的是,他发现AI特别擅长把这种又长又乱的碎碎念重新拼起来,回给你的版本,往往比你自己说的还干净:你脑子里那团纠缠的想法被它捋顺了,来回纠偏的次数也变少了。
这正是Andrej Karpathy自己跟AI打交道最顺手的一种方式。

用他的话说,这能改善人和模型之间的「心智融合」,人常常懒得把一件事的来龙去脉一个字一个字敲清楚,那还不如干脆开口,把整团乱麻一股脑倒出去。
语音的价值不在解放双手,而在把上下文高带宽地倒给AI。
就在这几天,OpenAI干脆把这套「用嘴指挥AI」的玩法,直接搬进了桌面。

7月23日,OpenAI把ChatGPT语音(Voice)正式送进桌面版App的Work与Codex场景。

当天起在macOS和Windows上全球分批推送,覆盖Plus、Pro、Business、Edu、Enterprise各档,Android即将跟上,iOS则通过Remote配对远程接入。
它的底层,是7月8日刚上线的新一代语音模型GPT-Live,能同时听和说:你随时打断,它接着你最新那句往下走,而不再是老式那种「先录音、再转文字、然后回你一句」的笨办法。
关键在于,这次语音不只是拿来闲聊。
在Work和Codex里,你张嘴就能启动一个任务、问它跑到哪了、看某个智能体现在什么状态,还能在同一段对话里同时协调好几个Agent,让它们各干各的。
任务在后台跑着,你随时插一句让它换方向;它卡住了或干完了,会主动开口,或在屏幕上给你提个醒。
它甚至能顺着你手头的活儿往下接:调用已有的项目上下文,连上文档、日历、联系人和通讯记录,把一件做了一半的事收尾。
官方也给出了一些日常生活实例:让它查日历有没有冲突、翻邮箱看航班改没改、顺手把会议纪要备好,「趁你泡咖啡或者忙别的」,这些活在后台自己就跑完了。
macOS上还多一手Appshots和屏幕上下文,能直接读你当前最前面那个窗口,结合本地文件和代码库一起理解,热键也能自定义。
Codex加ChatGPT Work的周活已经过了1000万。
OpenAI发的宣传片里有个画面很有意思:几名工程师站在同一个房间,对着同一个桌面会话,各说各的指令:一个AI,一屋子人围着它下命令。
这大概就是他们想象的「群体编程派对」。

OpenAI用一段居家场景演示ChatGPT Voice:开口把想做的事说给桌面版Codex,它在后台接着干。

这当然不是OpenAI一家心血来潮。
几乎同一周,三个行业大佬几乎不约而同地把票投给了「语音」。
Karpathy在X上发帖,他说上下文太多、又懒得打字的时候,就乱聊一通,让AI去整理。
一位Grok的铁粉转发了Karpathy的帖子,说自己早用惯了Grok的语音转文字,「现在打字都觉得像上刑」,还顺便吐槽了Anthropic的语音输入「其实还挺基础的」。
马斯克把这条又转了出去,补上一句:你可以像跟人说话一样,用Grok Build把任务交给Grok去干。

奥特曼也不忘推销自己新一代语音模型GPT-Live。
他自曝一向更爱打字不爱跟AI说话,但如今他跟ChatGPT「说的已经比打的多了」。

他还专门点出:当你有一大堆上下文要一次性倒给AI的时候,语音最好用。
让三位大佬兴奋的,其实不是「终于能用嘴了」这么简单。
这背后藏着这样一个逻辑:智能体越来越强,你要喂给它的意图也越来越复杂,键盘这条管道就开始拥堵了:
你打得越省事,模型拿到的信息就越干瘪。
而语音输出,则是天生的宽管道:你能一口气把前因后果、顾虑偏好全说出来,哪怕说得乱,模型也能兜住,再替你把那团意识流理清楚。
社区里已经有人实测:语音吞吐大概每分钟240个词,打字顶多70到80个词,差了三四倍。
GPT-Live把重活甩给后台的GPT-5.5、GPT-5.6去想,前台只管让对话流畅地接住你,这套解耦,恰恰是为了让人们可以随便开口。
说到底,人脑里的想法本就是并行的、跳跃的,键盘却逼你压成一行一行的字。
而语音让这道墙松动了:它正从一个「偷懒的输入法」,变成一个「高带宽的上下文入口」。
一句话,打字是AI输入的瓶颈,但语音不是。

OpenAI这次真正塞进桌面版的,是让语音去「管AI」。
按官方FAQ,在Work和Codex里,你开口能干这些事:启动一个任务,给几个任务排优先级,中途打断、掉头改方向,而活儿在后台继续跑。
更进一步,它能在多个对话和项目之间,协调好几个智能体一起干。你说一句「A先做,B先挂着,C出结果了叫我」,后台就照着重排。
它还能接着上次的活儿往下干。靠的是项目上下文,加上连接进来的工具,你的文档、日历、联系人、通讯记录。
任务卡住了或者干完了,它会用语音或者屏幕上的提示告诉你一声。
这已经不是语音输入法的活儿了,它更像一个中枢,你在上面调度一支智能体团队。
同样是开口和AI说话,以往是让AI听懂你,现在是让AI替你干活。

一个语音功能背后,藏着一条更大的路线:OpenAI想让ChatGPT做你的「AI工作操作系统」。
这几个月,OpenAI一直在重做桌面版ChatGPT,把Chat、Work、Codex放进了同一个入口,一键切换,在后台长期跑着。
Codex,也早扩成了能并行多个智能体、跑长任务、读懂整个项目的通用平台。
为什么把这套能力放桌面,而不是留在人人都在用的手机上?
主要是因为手机那块小小的聊天框干不了复杂活儿,它适合随口问两句。
真要让AI连着你的文件、代码和软件,把一件事从头做到尾,它就得待在你的电脑里:
桌面才有文件、集成开发环境(IDE)、浏览器、一整套企业办公软件,这才是智能体干活的主战场。
这背后,是一次人类与AI交互方式的翻转。
过去你用AI,是在「操作软件」:打开、输入、等待,一个回合一个回合地来。
现在你更像个带团队的经理:开口把任务分下去,你和AI的关系,从「你问它答」,悄悄变成了「你说它做」。
一位重度用户干脆说,这套东西用起来「基本就是贾维斯」。
他甚至让Codex帮自己配了个快捷键,一开口就能在三台机器、几块屏幕之间来回切换。
回到开头那个场景,真正让马斯克、奥特曼、Karpathy等大佬们兴奋的,不是可以扔掉键盘了,而是当输入不再是瓶颈,人可以把省下来的那点脑力,还给真正值得琢磨的事:决策。
所以下一个问题,其实不是「你能不能开口」,而是当你面前站着一屋子随叫随到的AI,你到底想让它们,替你做什么。
参考资料:
编辑:元宇

