开源Top2!实测阶跃Step 5 Preview,真有点猛啊…

量子位 2026-09-21 11:39
Jay 发自 凹非寺 
量子位 | 公众号 QbitAI

谁能想到,全球旗舰模型混战打到现在,局势依旧充满变数。

昨天,阶跃星辰毫无预兆地端出了最新一代旗舰基座模型——Step 5 Preview。

MoE架构,600B总参数、激活参数仅27B,1M上下文。

Agent能力大幅提升,在Artificial Analysis的最新评测中,Step 5 Preview取得44分,直接冲到全球开源Top 2。

要知道,其他拿到这一分数的大模型,大多都是万亿参数级别

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…图1

所以相比起来,阶跃这个新模型定价蛮便宜。

可以说很有竞争力了,单个任务成本仅为Opus 5的12.5%

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…图2

下面这张图更加直观。

AA榜单中,Step 5 Preview位于Intelligence Index与单任务成本权衡的「帕累托前沿」

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…图3

说实话,看到这个消息时我有点意外。

阶跃挺久没出现在这么靠前的位置了,之前两代模型都聚焦在Flash这个档位。

但Benchmark这东西嘛,现在大家也都懂。

榜单上你追我赶,今天刷掉一个,明天又冒出来一个。真到要用的时候,模型到底行不行,完全是另外一码事。

所以我干了一件比较费钱的事:

烧了无数Token,并行跑了无数个3D资产、3D游戏……

然后,我发现——

这模型好像还真可以啊。。。

一手实测

最近Astra操控软件不是很火吗?

所以API一接上,我直接给Step 5 Preview上强度,让它操作Blender,给我建一个后室出来。

说实话,最开始我没指望它真能交付出什么东西。

结果等它自己折腾了一个多小时,我打开文件夹,再点开渲染好的MP4,直接看愣了。

不er,这啥啊,你搁哪个网站下载的视频??

建模本身就不说了,离谱的是,它居然自己给视频加了一堆后期

VHS录像质感、镜头噪点、昏黄灯光,人物走路的时候甚至还有脚步声。

给我看得有点毛骨悚然了,感觉转角会跳出一个《痴迷》女主。。。

所以咱还是做点老少皆宜的demo吧。

第二个任务,我让它照着1999年的《LEGO Racers》,直接搓一个乐高赛车游戏。

这次也挺完整。

赛道、赛车、人机车手、实时排名都有,甚至连发动机音效都给配上了。

也是给我玩得不亦乐乎。

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…图4

唯一的问题是,这赛道修得也太窄了。。。

也可能主要还是因为我车技菜,经常一脚油门直接创路障上,有时候甚至连人机都跑不过。

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…图5

不过吧,家人们,玩完两个3D Demo,我是真有点顶不住了。

你要知道,我是晕3D的。前面两个任务搓完,差点没搁工位上吐出来。。。

最后再奉上一个《花屋》建模,接下来咱还是做点简单的2D任务吧。

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…图6

先做了个霓虹跑酷小游戏。有意思的是,我专门用了和阶跃上一代官网Demo类似的Prompt。

结果差距还是挺明显的。

道路两旁加了高楼,视觉层次更完整,Game Over之后整个边框还会跟着变红,很多Prompt里没写的小细节,它自己补上了。

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…图7

然后我又让它做了个写作网站。

这里必须单独表扬一句。

终于不往东坡肉里塞番茄炒蛋了。

泪目。

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…图8

这审美真可以啊,而且覆盖面特别全,基本能直接拿来用了。

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…图9

不过,有时候还是会出现模块溢出这种小Bug,依然得review,依然得改。

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…图10

前面几个Demo也是这样。

第一轮经常有些小细节不到位,离Astra那种「我咧个,这是AI做的?」的瘫软程度,肯定还有差距。

但还是能拿来干活的。

通常指出两三轮问题,它自己修一遍,就能到可用状态。

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…图11

那么问题来了。

明明前面两代还都是Flash,怎么到Step 5 Preview,Agent能力突然猛了这么多?

把算力花在刀刃上

过去几年,大模型行业最简单粗暴的信仰一直是Scaling。

更多参数,更多数据,更多算力。

确实很猛,Fable直接给Agent堆超模了,涌现出不少新技能点。

但问题也很明显——

贵啊。。。

所以,Step 5 Preview当然也在Scaling,但它没有把「越大越好」当成唯一目标。

团队选择了一种叫Narrow but Deep的网络设计。

直译过来就是:

窄,但深。

92层的Transformer,在控制激活规模的同时,让信息经过更多层连续变换。

这对Agent尤其重要。

复杂任务里,经常会有大量multi-hop依赖,前面搜到的信息,要经过很多步之后才能真正派上用场。

网络更深,相当于给这些信息留下了更长的传播和推理路径。

但Agent还有另一个麻烦——

Context。

几十轮工具调用之后,上下文能轻松滚到上百万Token。如果每一层都把前面所有内容重新扫一遍,计算量很快就会爆炸。

所以团队做的第二件事,就是稀疏化。

Sparse MoE、Hybrid Sparse、Sparse GQA……本质上都是在解决上下文的问题。

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…图12

当然,算法层面写个Sparse,不代表GPU真的就会少干活。

索引、访存、调度这些问题处理不好,好不容易省下来的算力,全部会浪费掉。

这还稀疏个啥,稀疏不了一点。

所以Step 5 Preview在硬件上也下了不少功夫,通过底层算子和数据访问优化,让理论上的Sparse尽量真正变成实际吞吐。

有了这套软硬件基座,后面要做的事就比较清晰了,围绕Agent训一遍模型,让它能连续干活。

简单来说,如果以前模型的基本单位是「回答」,那现在就变成了「Loop」。

规划、执行、调用工具、看结果、发现不对、继续修。

然后再Loop。

最终,通过Long-horizon RL、Context Compaction等方法,团队让Step 5 Preview在几十轮工具调用之后,还能记得自己到底要干嘛

到这里,Step 5 Preview的思路就比较完整了。

踩在「性能×成本」的甜蜜点上,把有限的计算预算尽量花在真正影响Agent能力的地方。

这也算是阶跃一直以来最擅长的事情。

从Step 3.5 Flash,到Step 3.7 Flash,再到今天的Step 5 Preview,路线其实没怎么变——

尽可能让Frontier级能力,大家用得起。

阶跃,回来了

大模型竞赛打到今天,依旧天上一天地上一年,战场始终瞬息万变,唯一不变的共识是:

Frontier,远没有到终局。

毕竟,仅仅过去一年里,头部模型的王座就不知道换多少次了。。。

新的模型、新的技术路线不断把能力边界往前推,曾经足以建立巨大壁垒的领先优势,很多时候几个月就会被追平。

Stanford 2026 AI Index里有个数据很有意思。

截至2026年3月,Anthropic、xAI、Google和OpenAI四家公司最顶尖的模型,在Arena上的差距已经压缩到了25个Elo以内

你要知道,GPT刚发的时候,这个差距可远没有这么小。

大模型竞争正在进入全新阶段:

一方面,Frontier的门槛越来越高;另一方面,Frontier内部又越来越拥挤。

单纯追逐某一个Benchmark、某一次榜单第一,已经很难定义一家模型公司的长期位置。

今天一个模型需要回答的问题,是更复杂的:

能力有没有什么差异化?

成本能不能压下来?

Benchmark上的智能,又能不能真正迁移到复杂、开放、长程的真实任务里?

现在各家其实都已经开始疯狂点自己的技能树了。

K3专攻前端开发,将网页设计做到极致。

V4 Flash打爆性价比,给Flash级模型干成白菜价。

Astra同样如此,Coding其实没提升多少,但把Computer use的心智站住了。

大家都在寻找自己的那根长板。

这次,阶跃也给出了他们的答案。

向上,发布旗舰基座,杀回全球第一梯队。

向下,优化效率和成本,让Agent真正进入大众生活。

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…图13

大时代啊朋友们。

说实话,这才是AI行业最有意思的地方,要是真靠Scaling解决一切,跟制造业有啥区别啊。

我一直觉得,模型层更像是一片参差不齐的竹林。

点亮任何一个技能点,都意味着Trade-off。

更强的推理、更长的Context、更低的延迟、更少的激活、更强的多模态、更好的Agent能力……

至少在相当长的一段时间里,很难有一家模型把所有方向全部点满。

所以技术路线也不会这么快收敛。

只要能找到合适的切口,总会有新模型、新公司的市场生态位。

关于AGI的这场马拉松,远没有跑到最后一公里。

阶跃,回来了。

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —

🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源
more
又一国产MoE旗舰模型登场!跻身全球开源第三,价格对标DeepSeek-V4-Pro
清微智能开源全球首个 3D 算力软件底座
开源还是闭源?AI创业者的“生死抉择”将在TechCrunch Disrupt 2026揭晓
A社“AI末日”资本黑手被揪出,炒作焦虑为IPO圈钱!难怪仇视DeepSeek开源
阿里最新图像模型开源!视觉生成部分仅7B,能生透明图、能改图
从 Codex Harness 开源,看 AI 公司的护城河是什么?
15秒视频,54秒生成!AI视频创作的“等待焦虑”,被RunningHub这套开源方案治好了
拿下开源生图第一,千问Qwen-Image-2.1把生图卷出新高度
宇树通用人形基础模型全面升级重磅开源
刚刚,阶跃Step 5 Preview发布!一举杀进全球开源前三
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号