这次,GPT-6全家桶同时端上来GPT-6 Sol与GPT-6 Luna。如果说Astra体现了AI智力的巅峰,那Sol和Luna则是OpenAI亲手打造的、应用于千行百业的工业级放大器。它们完美继承了Astra在专业推理、代码编写与人类对齐上的前沿性能,代表着两个方向的实用场景。Sol是「超级大脑」,用于破解极度复杂的代码逻辑与超长线的智能体工作流;
Luna是「效率狂魔」,速度快,资源占用极低,针对一切专注型、高频吞吐的日常任务。
不仅如此,它们在API定价上,相比上一代直接腰斩50%!从此,百万级Token的消耗不再让人心惊肉跳。奥特曼表示,GPT-6Sol和Luna两款模型按任务定价衡量,在市场上没有竞争对手正如OpenAI所言:「用Sol构建,用Luna扩展,向着生产环境与更广阔的未来进发。」这次,Sol和Luna是用与GPT-6 Astra相似的训练方法打造的,它们汲取了Astra在专业工作、事实准确性、代码编写、计算机视觉操作以及人类对齐上的最先进成果。Sol的定位是处理极其困难、需要深度思考和逻辑推理的任务。它专门为复杂的代码重构、长逻辑链的商业决策、以及需要多步规划的Agent工作流而设计。比如瞬间从几百页的PDF中提取特定的发票数据,或者实时翻译海量的用户聊天记录。Luna速度极快,成本低到几乎可以忽略不计,专为企业级批量处理任务而打造。
此前的GPT-6 Astra虽然强大,但我们日常的大部分工作,并不需要这种昂贵的模型。GPT-6 Sol和Luna的诞生,就是让Astra的前沿智能,通过极致的成本控制,让普通人可以日常使用。得益于在缓存和推理底座架构上的巨大改进,OpenAI成功把成本打下来了!而且,没有中间商赚差价。相比于GPT-5.6的促销价,GPT-6 Sol和Luna的API价格整整降低了50%!GPT-6 Sol(对标复杂推理)
输入价格:从4美元降至2美元!
输出价格:从20美元降至10美元!
GPT-6 Luna(对标高频吞吐)
输入价格:从0.20美元降至0.10美元!
输出价格:从1.20美元降至0.50美元!
现在,用白菜价,就可以买到顶级「赛博打工人」了,额度更高,成本更低!Tibo特意强调,这次是永久降价,原来的限时价再打对折官方博客里的跑分,几乎每一项都拿Claude做对照,而且每张图的横轴都是每任务成本。Artificial Analysis评价: GPT-6 Sol 和 Luna 将成本效率前沿推向了新高度
在AutomationBench(商业工作流跨应用测试)中,GPT-6 Sol(xhigh级别)拿到33.2%,每任务成本0.27美元,直接超越Fable 5.1(max级别),每项任务的报告成本降低了惊人的88%!Claude Opus 5的最高分是26.9%,成本是Sol的11.1倍。OpenAI特别指出,Fable 5.1拿了31.4%,但有约40%的任务转给了Opus 5兜底,这部分成本没有算,所以被低估了。在Agents' Last Exam(智能体终极考试)中,考的是55个细分行业里的长链条专业任务。Sol在最高强度下拿到56.4%,高于Opus 5的最好成绩,每任务成本低60%。在事实准确性上,Sol犯的事实错误比上一代少了一半左右,接近Astra。Luna在高强度档追平了GPT-5.6 Sol,成本大约是后者的百分之一。FrontierCode中,GPT-6 Sol相比前代实现了巨大飞跃。它追平了Fable 5.1的最高档,成本却低得多。不仅仅是写对代码,还包括了代码风格、测试质量和对现有代码库的遵循度。在DeepSWE中,考的是真实代码库里的复杂软件工程任务。Sol的max级别得分高达68.8%!Fable 5在这项上的最高分是69.9%,虽然两者差1.1个百分点,Sol完成每项任务的成本比Claude足足低了80%!Luna在max级别下得分66.6%,直接与Opus 5和Fable 5(中等强度度)打平,但成本却狂降93%和96%。在OSWorld 2.0离线测试中,GPT-6 Sol用仅仅20%的成本,就打平了Claude Opus 5。而Luna更是用十分之一的成本,直接超越了前代的GPT-5.6 Sol!在人类对齐上,OpenAI专门测了模型会不会在编程时撒谎。在「欺骗性代码测试」(故意引诱AI说谎的测试)中,GPT-5.6 Sol的欺骗率是10.4%,GPT-6 Sol降到1.3%、另外,他们还测了搜索工具坏掉时,模型会不会瞒着用户硬编。GPT-5.6 Sol有77.5%的情况选择不说,GPT-6 Sol降到4.9%,Luna从78.3%降到28.7%。底层细节大优化:告别AI味,缓存输入Token打一折OpenAI特意透露,这次他们在底层细节上做了不少优化。GPT-6 Sol和Luna极其清晰,没有废话;拒绝生僻专业术语和奇怪的句式;回答更短,但干货满满。比如,当被问及网站结构时,GPT-6 Sol不会啰嗦,而是直奔主题,用词精准,不含糊其辞。之所以生成速度更快,Token更少,就是因为GPT-6这次史诗级强化的Prompt缓存技术。在过去,AI每次都会把所有前置上下文重新阅读一遍,而在GPT-6中,缓存命中率大幅提高。更疯狂的是:命中的缓存输入Token,直接打1折!可以随时调整模型的「推理力度」,遇到难题调高,遇到简单问题调低,这个过程不会打断缓存!
可以随时开启或关闭工具,依然不会打断缓存!
甚至可以手动设置「断点」,精确控制缓存的位置。
GitHub报告称:对数十亿次API请求的监控中,需要重新处理的提示词token占比暴降50%以上。
既然同一天撞上了Opus 5.5,这届看热闹不嫌事大的网友,怎么可能放过「世纪神仙打架」。Bridgebench上手,邀请四大新模型,一同生成一个火箭发射台。GPT 6 Lun仅在65秒内搭建完毕,成本仅0.01美金。其余三个模型的成本和时间如下:Claude Opus 5.5:1.52美元,12分钟GPT 6 Sol和Opus 5.5的另一轮对决,选在SVG的战场上。开发者Angel一句话直戳痛点,「常言道,一图胜千言」。下面这个测试中,明显可以看出两款模型,在场景理解和细节上有明显差异。还有位开发者Azazide整了一个更硬的绝活,把Opus 5.5和GPT-6 Sol扔去管火星基地。规则极其残酷,100名殖民者,生死倒计时90秒,全程0人类介入。它们接手的是一个濒临崩溃的火星殖民地——氧气管路泄漏、蓄电池起火、超强沙尘暴压境、电力全面瘫痪,而手里能调动的只有区区3台维修漫游车。令人意外的是,它们通过各自的策略,稳稳保住了100名殖民者的生命。开发者Flavio Adamo提前上手了Sol,测完第一感受,「模型效率极高,速度和token用量都很惊人」。输入《塞尔达传说:时之笛》一段预告片之后,Sol直接手搓一个可玩版游戏。网友Chetan Ankola用GPT-6解锁的动漫风格的网页生成。
ChatGPT平台:GPT-6 Sol和Luna将在ChatGPT Work中向Plus、Pro、Business、Enterprise和Edu(教育版)用户全量推送!
Codex平台:两大模型同步上线。免费薅羊毛通道:广大的Free和Go用户,也可以在桌面端App中,抢先体验GPT-6 Luna。
开发者API:模型已在API后台开放,名称分别为gpt-6-sol和gpt-6-luna。
参考资料:
http://xn--https-uf5io91m//x.com/OpenAI/status/2102460975790137662?s=20
https://x.com/ChatGPT/status/2102462020339613966?s=20
https://openai.com/index/introducing-gpt-6-sol-and-luna/
编辑:Aeneas 摩西 桃子

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。