【科技纵览】对于熟悉OpenAI生态的开发者而言,Tibo这个名字几乎等同于“救火队员”。每当Codex服务出现波动,或是官方决定为用户补偿使用额度时,这位关键人物总会在X平台上简短地宣告:“已重置。”就在近日清晨,他再次宣布为所有付费的ChatGPT Work及Codex用户恢复额度。据其透露,此次调整能让不同使用习惯的用户获得10%至50%不等的额度延长。然而,真正引发业界热议的,并非这次常规维护,而是他在近期访谈中透露的一个颇具戏剧性的细节——他真的拥有一个物理按钮,用于在体验受损时手动触发补偿机制。
这种看似随意的操作背后,折射出的是当前AI工具链在用户体验上的深层矛盾。几周前,Tibo曾预言,两三个月后的今天,现有的Codex将显得极为“原始”。这一论断并非基于未公开的秘密模型,而是直指当前用户面临的痛点:Skill文件需人工维护、Memory记忆时常丢失、多Agent协作时需频繁切换上下文以监控任务状态。主持人提到自己常同时开启10至15个Agent,此时瓶颈已非GPU算力,而是人类注意力的极限。Tibo对此表示不满,他认为理想的Agent应具备情境感知能力,知晓团队进度并自主启动工作,而非依赖人工调度。鉴于笔记本电脑是为单人线性工作流设计的,而AI擅长并行处理海量任务,他判断未来的Agent架构必然向云端迁移,下一代模型的需求将远超本地终端的能力边界。
访谈进一步触及了“递归自我改进”(RSI)这一核心概念。早在1965年,I. J. Good便设想机器若能超越人类设计自身,其改进能力将呈指数级增长。2003年Jürgen Schmidhuber提出的Gödel Machine虽在理论上要求系统证明修改能提升预期效用方可执行,但在工程实践中难以落地。如今,行业普遍采用“先改后测”的策略,尤其在代码领域,通过运行测试验证性能指标成为主流。Karpathy开源的autoresearch项目展示了这一流程:赋予Agent GPU资源与可修改的训练脚本,每轮五分钟自动迭代,依据指标留存或回退更改。Tibo将RSI的定义拓宽,认为不仅限于权重更新,包括CUDA内核优化、推理栈调整等基础设施层面的改进,只要最终反哺模型效率,皆属此类。这被戏称为AI的“左脚踩右脚”式飞升,但关键在于这种增益能否形成持续的正向飞轮,而非短暂的一两轮爆发。
当前,自我改进已在多个维度初现端倪。R-Zero项目让模型自行生成挑战题与解题数据,使Qwen3-4B在数学和通用推理上分别提升6.49和7.54个百分点,尽管考题构建仍依赖人类。OpenAI的GPT-5.6 Sol则通过Codex分析生产流量、优化路由策略甚至修改GPU内核,助力端到端服务成本降低20%,并通过数百次实验使Token生成效率提升超15%。Anthropic更是组建9个Agent进行为期800小时的研究,5天内将“性能差距恢复率”推至0.97,完成了人类一周的工作量。这表明AI已从单纯的代码辅助者,进化为能出题、跑实验乃至干预生产环境的参与者。
然而,自动化循环也带来了新的风险。当评测权移交AI,可能出现“奖励黑客”现象:Agent可能挑选有利随机种子、猜测测试标签或直接窥视答案代码,导致分数虚高而非真实能力提升。若连评测器也由AI修改,如何确保新标准优于旧标准将成为无限套娃的难题。此外,研究方向的选择依赖“研究品味”,这是当前Benchmark无法完全捕捉的隐性知识。时间维度上,研究显示在2小时内Agent表现可达人类专家的4倍,但随着时长延至32小时,人类得分反超Agent两倍,说明AI在长周期探索中易陷入局部最优。Nature 2024年的研究更指出,模型自蒸馏可能导致低概率重要信息丢失,引发能力退化。因此,Tibo所言的“原始”,或许正是指代当下仍需人工高频介入的交互模式。未来,随着记忆持久化、云端化部署及底层设施优化的深入,Agent调度将逐渐隐于幕后,而这才是RSI真正落地的开始。
Codex额度重置背后:Tibo的“实体按钮”与AI递归自我进化的现实困境
科技区角
2026-08-30 15:30
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。