
「再过 2-3 个月,Codex 就是个原始工具了。」
这话不是竞争对手说的,是现任 OpenAI 产品兼平台总经理,负责 ChatGPT、Codex 的 Thibault Sottiaux 自己跑出来说的。

最近,Harness 框架已经逐渐破圈。从开发者到白领,人们纷纷用上了这种 Agent 工具,享受到了 AI 带来的自动化红利。在这其中,OpenAI 的 Codex 更是佼佼者。
然而在这个节点上,OpenAI 的高管已经看到了更远处。AI 智能体(Agent)的下一步,或许还有一个从单机小工具向「云原生基础设施」演进的范式进化。
Thibault Sottiaux 所说的「笔记本不够用了」意思很明确:我们正在用单机 Harness 去驱动有长时推理和高度自主能力的下一代模型,这种「小脚穿大鞋」的模式已经快玩不下去了。
我们知道,所谓 Harness 是指围绕大模型构建的上下文管理、工具调用、状态持久化、环境隔离和异常恢复等套件。目前很多开发者都是以在笔记本电脑上运行 Agent(如通过 CLI、Cursor、Claude Code 或轻量 Agent 逻辑)的方式来完成任务的。
当然越来越多的开发者也倾向于多工具、多模型一起用:比如用 Claude Code 上的 Fable 5 来写项目文档,再去 Codex 上用其他模型来执行。
但这在面对下一代前沿模型时会碰到三大物理瓶颈:
算力、内存局限:当智能体需要并发执行 20 个子任务(如一边跑测试、一边爬数据、一边编译大项目),本地笔记本的内存、CPU 以及并发沙箱(Docker/VM)资源会瞬间爆满。
长任务无法关机:复杂的 Agent 任务可能需要运行几小时甚至几天,要求用户的笔记本不能关机、不能断网、不能合盖,这在工程上非常反人性。
上下文与工具链的并行爆炸:下一代模型肯定将支持极长上下文和高度并发推理。本地轻量级 Harness 将会很难处理大规模并发 Agent 之间的上下文压缩、状态同步与集中式日志追踪。
面对这些挑战,Agent 工具向重型基础设施和系统设计转型的迹象,其实已经在过去几个月里逐渐出现。
比如 OpenAI 的 Codex 目前已经提供云端异步运行支持。用户在终端下达指令后,任务被丢进云端隔离的容器(Sandbox Container)里自治运行,手机或笔记本只起一个指挥控制的作用。
与此同时,云原生微沙箱正在兴起:像 E2B、Daytona、Fly.io、Modal 等专为 AI Agent 设计的云端极速沙箱基础设施,可以让 Agent 在执行任务时动态弹起数百个独立容器环境去平行跑代码和验证结果。
在包括 OpenAI、Anthropic、Cognition 等顶尖 AI 团队中间,工程师们正在开始将研发的重点从优化 Prompt 转移到「编写系统级的 Harness」。
今年 2 月,Anthropic 团队展示过用 16 个 Claude 并行运行在 2000 个云端 Session 中写出一个 C 语言编译器的案例。这是生成式 AI 在软件工程领域走向多 Agent 协同的一个里程碑。其中,不同的 Claude 实例扮演了不同角色:1 个架构师 Agent 负责设计抽象语法树(AST),4 个编码 Agent 负责不同模块,两个测试 Agent 专门写单元测试,1 个审计 Agent 负责 Review 代码流和安全性。
主导研究员 Nicholas Carlini 指出:「大部分精力都花在了为模型打造环境、测试闭环与反馈基础设施上。」
未来两到三个月,这样的智能体工作流可能会成为我们的日常。
结合 Thibault Sottiaux 的判断,「本地轻指挥,云端重执行」将会成为标配,开发者界面(如 IDE、Terminal、Web UI)将彻底变为操控板。真正的代码重构、测试跑通、浏览器自动化模拟等计算密集任务,全部会在云端动态集群中并行消化,再将最终差异(Diff)和日志流式推回本地。
而模型与 Harness 的深度结合,或许会把竞争从「比谁的模型推理能力更强」,转变成「比谁的模型潜力释放得更彻底」。那些只靠在本地电脑跑 Python 脚本和简单 API 调用的 Agent 框架,即将全面触顶。

© THE END
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com