神秘「牛来」大模型刷屏,限时免费

机器之心 2026-08-22 18:38
神秘「牛来」大模型刷屏,限时免费图1
编辑|杨文、山辉

大模型圈流行「挂马甲」测试。


近日,一款名为 Ox Alpha 的匿名模型突然出现在 OpenRouter。Ox 本身就是「牛」的意思,国内网友很快给它起了一个更接地气的名字:


「牛来」大模型。


根据 OpenRouter 披露的信息,Ox Alpha 拥有 100 万 token 上下文,支持文本、图片和视频输入,可以调用工具,目前完全免费。


神秘「牛来」大模型刷屏,限时免费图2


上线后不久,开发者就把它接入编码 Agent,扔进真实代码仓库进行测试。


初步测试结果显示,这款来历不明的「牛来」大模型,能力已逼近当前顶级代码模型。


与此同时,有网友爆料,一款名为 korrine 的匿名模型正在 Code Arena 上进行测试。有人猜它是 Kimi K3.1,也有人将其指向 Qwen 和 MiMo,说啥的都有。


8 月的大模型圈,突然变成了一场大型猜谜游戏。


「牛来」大模型表现抢眼


Ox Alpha 真正引发关注,靠的是代码能力。


开发者 Ben Davis 从 DeepSWE 中抽取 10 项任务进行测试,Ox Alpha 完成了其中 8 项,通过率达到 80%。其公布的对比结果中,Fable 5 Max 为 65%,GLM-5.3 Max 和 Grok 4.6 xhigh 均为 62%,GPT-5.6 Sol Max 为 52%。


神秘「牛来」大模型刷屏,限时免费图3


DeepSWE 考察真实软件工程能力。模型需要阅读代码仓库,定位问题,修改代码,运行测试,再根据报错继续修复。相比单轮编程题,它更接近编码 Agent 的实际工作。


不过,10 项任务的样本很小。随后,其他开发者在另一组 DeepSWE 子集上测试,给出的结果约为 63%。两次测试的任务范围和运行配置并不完全相同,暂时无法据此确定 Ox Alpha 的准确排名。


神秘「牛来」大模型刷屏,限时免费图4


不过这些结果初步显示,这款匿名模型已经表现出很强的长程编码潜力,能力逼近当前头部模型。


「牛来」大模型到底是谁家的?


「牛来」大模型的身份,目前流传最广的说法是智谱尚未发布的 GLM-5.3 Flash,或 GLM-5.3 的多模态版本。


有人还专门写了个博客进行分析:


1. 最强证据来自视频编码器。四段不同帧率、时长和分辨率的视频中,Ox Alpha 消耗的视觉 token 与 GLM-5V-Turbo 完全一致。MiMo、Qwen 和 GLM-4.6V 都呈现出明显不同的结果。


2. 文本 tokenizer 也高度吻合。研究者测试了 25 组提示词,Ox Alpha 与 GLM-5.3 的 token 数量始终保持固定的 75 token 差值。


3. 其他特征也指向智谱。Ox Alpha 拒绝处理音频,与 GLM-5V 的路由方式相同;回答风格、Agent 执行步数和推理接口也很接近 GLM。智谱此前还曾用 Pony Alpha 匿名测试 GLM-5,具备相同操作先例。


神秘「牛来」大模型刷屏,限时免费图5

https://ox-alpha-evidence-production.up.railway.app/


还有网友从对话中寻到蛛丝马迹。


神秘「牛来」大模型刷屏,限时免费图6


Ben Davis 认为 99% 确定这就是 GLM-5.x。


神秘「牛来」大模型刷屏,限时免费图7


这些线索提高了 GLM 说的可信度,但还不足以完成身份确认。


截至目前,OpenRouter、智谱都没有公开回应。


korrine 身份更扑朔迷离


「牛来」大模型的身份还扑朔迷离,Code Arena 又出现了一个名为 korrine 的匿名模型。


最初,不少人猜测它是 Kimi K3.1,原因是 Kimi K3 发布前,曾被认为以 kivine 的代号接受测试。kivine 与 korrine 结构相近,因此引发了联想。


神秘「牛来」大模型刷屏,限时免费图8


不过,最早传播消息的爆料者随后补充称,此前获知的 Moonshot 新模型可能对应另一个代号 adamant-ananke。korrine 也可能来自 Qwen 等其他中国团队。


神秘「牛来」大模型刷屏,限时免费图9


评论区中,还有人将它指向 MiMo V3。


神秘「牛来」大模型刷屏,限时免费图10



大模型厂商为什么喜欢「挂马甲」?


匿名测试正在成为大模型正式发布前的重要环节。


在 Arena 中隐藏厂商和型号,可以尽量削弱品牌带来的先入为主。用户看不到模型身份,只能根据实际输出进行选择,最终积累的对战结果,也更接近真实用户体验。


OpenRouter 提供的是另一类测试环境。


开发者会把模型接入各种编码 Agent,让它进入真实仓库,连续调用工具,处理长达数小时的软件工程任务。上下文能否保持稳定,工具调用是否可靠,模型会不会在长程任务中循环或跑偏,都能在高强度使用中迅速暴露。


对模型厂商来说,这相当于一次公开压力测试。团队可以提前观察失败案例,验证推理服务的承载能力,也能在正式发布前积累真实口碑。


此外,「猜模型」现在也越来越成为一种营销手段了,身份悬念确实可以拉长讨论周期。


最后回到模型本身。如果 Ox Alpha 真是一款 Flash 模型,其代码能力已经逼近头部水平,那么资源投入更高、能力更完整的完整版,又会把上限推到哪里呢?


参考链接:

https://x.com/Adidotdev/status/2090833298713096241

https://x.com/davis7/status/2090669483740279155?s=20

https://x.com/davis7/status/2090655207831298095?s=20

https://x.com/MaxForAI/status/2090783750217162788


神秘「牛来」大模型刷屏,限时免费图11


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
大模型
more
大模型价格战现分歧:DeepSeek涨价之际,谷歌Gemini 3.7 Flash限时五折抢滩
AI成本焦虑下的破局:Writer发布Palmyra X6,以“架构优化”对抗大模型通胀
曝苹果已与阿里合作训练大模型
反向图灵测试!这个「纯手工大模型」,把网友聊崩了
对谈华为前大模型负责人王云鹤:如果模型吞噬一切,那什么会留下?
从大模型推理走向智能体运行:K3 RISC‑V 芯片率先跑通 DeepSeek Harness
科研算力自由 | 小金刚科研先锋版,让实验室大模型研发本地闭环
智谱唐杰:大模型只看参数的时代,结束了
471亿,全球最大的大模型中介,卖身了
471亿!全球最大的大模型中介,卖身了
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号