斯坦福大学生给 GPT-6 准备了一只机械臂、一支画笔和一台相机,然后让它画金门大桥。这次,画笔真的落在了纸上。在他发布的演示里,机械臂带着画笔移动,逐渐留下桥的轮廓。负责安排动作的,是 OpenAI 前段时间新发布的 GPT-6 Astra。GPT-6 Astra 看着摄像头传回的画面,自己琢磨出怎么驱动机械臂,握住笔,蘸颜料,落笔,每一遍画的都比上一遍要好。这段一分钟的视频在 X 上很快获得了 200 多万次播放,连奥特曼也转发并回复说「我也想要一个。」过去几天,围绕 GPT-6 出现了不少这样的演示。有人让它在 Blender 里建模,有人让它去 Minecraft 找钻石,还有人把画肖像的任务交给它,自己看着软件里的画面慢慢成形。这些案例让 Computer Use,或者说「电脑操作能力」,成了这一轮模型讨论里最热门的话题。尽管一项任务可能需要持续执行许多轮,途中还要处理报错、改计划、换工具;GPT-6 大多数时候都能凭借 Computer Use 的能力准确无误地操作,配合工具读取界面、操作软件,并检查操作之后发生了什么。在 Blender 造飞机,在 Minecraft 找钻石Blender,这个在 GPT-6 之前用于 3D 建模的专业软件,一时间变得像是办公软件一样;只要你会用 ChatGPT,就可以用 Blender 来做 3D 建模。一个从没用过 Blender 的博主,在自己的备用 Mac 上装好软件,发提示词让 Astra 制作一架航天飞机。模型查找资料,编写脚本,开始操作 Blender。大约十分钟后,Blender 软件里就出现了一个可以旋转、缩放查看的模型,博主把这个过程形容为「像魔法」。有人让它在 Blender 里做一只照片级写实的蝙蝠。GPT-6 就一直做,一直改,直到用户的 token 耗尽才停手。日本知名 3D 艺术家 Hirokazu Yokohara 试完之后,给出的评价也很高。他给了 GPT-6 一张参考图,GPT-6 就能打开 Blender,自动完成全部的工作,在最终的视频里展示了招牌、纹理等细节的制作。他说「虽然完成度确实还不到位,但我第一次真切感到,不再由人手工制作 3DCG 的时代开始了。」还有 OpenAI 研究员 Sharif Shameem 让 GPT-6 Astra 去玩 neal.fun 上那个著名的《我不是机器人》游戏,48 关越来越刁钻的验证码式谜题,选红绿灯、数格子、分辨吉娃娃和松饼。GPT-6 一把全通,游戏原作者 Neal Agarwal 被炸出来留言说「行吧,我尽力了。祝大家好运。」更有意思的 Computer Use 玩法,还有用来操作游戏。有人睡前给 GPT-6 留了个作业:在《我的世界》里用 Computer Use 挖一颗钻石。挖钻石本来在 Minecraft 里是件麻烦事,要下矿、要躲怪、要先造出整条工具链。然后这位用户说自己一觉醒来,背包里真的有一颗钻石。还有人让 GPT-6 打开浏览器里的画图工具给自己画肖像,甚至是让它把 Google 日历的日程格当成像素画布,用一个个日程事件「画」出了一幅迈克尔·杰克逊的肖像。这种 Computer Use 的能力,也被网友拿出来作为对比,称其为「AI 模型的全新高阶基准」。知名的「威尔·史密斯吃面」作为 AI 能力进步的民间计量单位,又往前翻了一页。图|左边是 2023 年那个诡异的「威尔·史密斯吃意面」AI 视频,右边是 GPT-6 Astra 在 Mac 上用 Blender 5.1 重建的威尔·史密斯头像。早在 OpenAI 发布 GPT-6 Astra 时,官方演示视频的口号就有一句:「你在电脑上能做的任何事,Astra 都能替你做。而且快。」OpenAI 联合创始人 Greg Brockman 更是直接说,Computer Use 是这项新技术中一个尤为重要的组成部分。我认为它已经跨越了质的门槛。事实上,它已经从过去那种缓慢、令人痛苦的运行方式,发展成为如今这种非常精准、高效且可靠的技术。因此,Astra 无需 API 就能用计算机完成人类能做的一切。这一次,GPT-6 是怎么做到的所以,为什么 GPT-6 在 Computer Use 的进步如此之大,就连那些复杂的专业软件,现在它都能操作了。Browserbase 的增长工程师 Kyle Jeong 扒完了 OpenAI 官方开源的 Codex 仓库代码后,写了一篇技术拆解,他提到要理解 Astra 为什么强,得先回看 GPT-5.6 时代的 Codex / ChatGPT harness。Computer use 是一个 harness(工程)+ model(研究)的双重问题——模型决定做什么,harness 负责做。上一代的电脑操作方案,从 2024 年 Anthropic 首发的 Computer Use 到 OpenAI 自己的 Operator,走的都是「截屏 + 像素点击」路线:模型看一眼屏幕截图,算出该点哪个坐标,点下去,再截图。这条路线的脆弱之处在于,显示器换个分辨率,模型可能就认不出按钮了。Astra 换了一种方法,在针对浏览器的电脑使用里,它放弃了像素读取,直接使用「无障碍树」(Accessibility Tree)进行识别。Accessibility Tree 是操作系统给读屏软件准备的界面文字版,每个按钮、每个输入框都有名字和层级。对于大模型来说,读它比看截图更省 token,而且语义化。同时,截图仍会提供实际画面,一个输入框的名称可以写进可访问性树的清单,但画布上的笔迹、三维模型的形状却需要从图像中观察。GPT-6 Astra 可以结合两种信息决定如何操作,不必只凭屏幕上的坐标寻找每一个按钮。另一方面,更关键的是所谓「代码模式」:与其说 Astra 学会了「用电脑」,不如说它学会了写脚本替自己用电脑。任务开始后,它会拿到一个持续在线的编程环境(Node REPL,一个「写一句、跑一句、马上看结果」的交互式窗口,整个任务期间状态一直保留),然后在里面写代码,用 Playwright 控制浏览器,用 PyAutoGUI 控制桌面。每执行一段,它就重新读一遍屏幕,确认刚才的动作是否生效,不生效就改了再来,如此循环直到任务完成。操作电脑这个动作,就这样被它内化成了一次又一次的小规模编程。另外,在安全层面还有一道叫 Guardian Policy 的闸门,即后台有一个专门模型对每一步动作做风险分类,高风险操作会停下来等人类批准。这套工作流程也能很好地解释了官方基准里的数字,在 OSWorld 2.0 上 Astra 得分 72.6%,比前代的 65.7% 高出一截,而单任务平均耗时从 75 分钟降到了 40 分钟。快的原因正是模型更聪明之后,完成同一任务需要的步数变少了;步数越少,任务越快,成本也越低。专栏作者 Tae Kim 在 Substack 上认为 GPT-6 这次的发布是一个新的热潮。Computer Use 是四年里的第四波指数级需求浪潮——第一波是聊天机器人,第二波是推理模型,第三波是智能体编程,第四波,是智能体操作电脑。也有网友说,除了去年十月到今年二月,OpenAI 没能赶上 Claude Code 的低谷期,它几乎是发现「下一个热门技术」的王者。图|引用来源:https://benhylak.substack.com/p/openai-did-it-again-but-what-did1.只需增加更多计算即可(transformer)2.再把它做成聊天机器人(ChatGPT)3.让它执行操作(工具调用)4.教它如何思考(推理模型)而随着 GPT-6 的推出,他们揭示了第五点:5.Computer Use 计算机使用从操作电脑上的软件,到操作设备的确如此,回看过去四年的 AI 发展,聊天机器人教会了模型听和说,推理模型教会了它想,编程 agent 在文本的环境里教会了它做,而 Computer Use 把「做」这件事又推广到了整个数字世界。前几天,Greg Brokman 在接受 Stratechery 的专访里,回忆了一段往事:2015 年 11 月 OpenAI 创立之前,他们想做的第一件事,就是让模型看着屏幕像素、操作键盘鼠标,端到端地学会用电脑。图|https://stratechery.com/2026/an-interview-with-openai-president-greg-brockman-about-astra-and-alignment/这个初心当时没做成,于是过去两年成了他口中的「连接器时代」,即想让 AI 用什么软件,就给它写什么 API 连接器,一个软件一个接口,一家厂商一份定制。直到 GPT-6 发布,他说,「现在,我们终于有了一种几乎是万能连接器(almost this universal connector)的技术。」如果模型看屏幕、动键鼠就能操作任何软件,那么「屏幕 + 输入设备」这个组合就不再只是个人电脑的形态,而是几乎所有可以通过视觉完成的任务。今天是操作一台电脑,下一步顺理成章的就是模型成为架在所有设备之上的统一抽象层。所谓的接口变成了「看和点」这种人类级别的通用协议,让设备之间第一次有了一种共同语言。图|GPT-6 与 ENPIRE 英伟达机器人技术平台,GPT-6 Astra 能够以零样本的方式进行机器人上下文学习。不同设备上的接入条件并不相同。Google Play 明确限制应用借助 Accessibility API 自主规划和执行动作,对符合条件的残障辅助工具设有例外;iOS 则通过应用沙箱限制跨应用的数据和资源访问。手机上的系统权限和分发规则,会直接影响第三方 Agent 能采用哪些操作方式。但机器人领域的测试者已经拿到了第一批量化证据,RoboCurve 基准里,GPT-6 Astra 直接输出机械臂末端的位姿指令,在「把积木放进碗里」的任务上 20 次成功 19 次。对照之下,Claude 最新的 Fable 5.1 只有 40%。而且这些测试都是 zero-shot,一次性操作,没有示范,也没有微调。测试者 Jay Chooi 预测,大模型最早今年底、最迟 2029 年就能实时控制机械臂。当模型学会通过「看和点」操作软件、通过位姿指令操作机械臂,数字世界和物理世界之间差的似乎从来不是智能,只是需要一个驱动层。GPT-6 Astra 用机械手解开了魔方在电脑上,它是屏幕和鼠标键盘;在机器人身上,它是电机的位姿指令。驱动层两边,跑的是同一套智能回路——感知,决策,行动,观察反馈,再来一次。1979 年,MIT 做过一个著名演示叫「Put That There」:人指着屏幕说「把那个放到那里」,机器照做。OpenAI 在 GPT-6 Astra 的发布视频里特意致敬了它。四十七年后,机器不但能把屏幕上的东西放到那里,还拿起了画笔,开始学着把颜料放到画布上该在的位置。那张越画越好的金门大桥,或许就是 Computer Use 开始进入物理世界的证据。我们正在招募伙伴📮 简历投递邮箱hr@ifanr.com✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)