
新智元报道
新智元报道

就在刚刚,Anthropic甩出了第二份《Risk Report》,覆盖到2026年7月15日为止的全部风险评估。
这份报告里,Anthropic第一次亲口承认:公司内部跑着一个比Mythos 5更强的模型,代号Model 2。

接着,A社就开始补刀:「我们目前没有对外发布这个模型的计划。」

这话听着耳熟。嗯。。。很符合他们一贯的调性。
今年4月Mythos刚曝光时,Anthropic也说过不打算公开发布,后来开了个Project Glasswing,再后来就有了Fable 5。
看起来,Anthropic又进入这个循环了……

Model 2有多猛?
报告提到,Model 2在内部任务上有「明显提升」(noticeable improvement),和Mythos 5一起被公司「大量」(heavily)用于编码、Agent工作和数据生成。

更炸裂的是下面这句:Claude已经写下了Anthropic合并进生产代码库的绝大多数代码。内部的 AI 研发速度确实因为 AI 辅助而显著加快,但还没到两倍。

也就是说,Anthropic内部已经都是 AI 写代码了。而这事冲在最前面的,正是Mythos 5和Model 2这哥俩。
「两倍」这个数字也不是随口一说。Anthropic自己的RSP(Responsible Scaling Policy,负责任扩展政策)里,触发AI研发风险红线的条件之一,就是进展速度翻倍。
当然,Anthropic也没把话说满。报告承认,Model 2带来的性能跃升,比不上今年早些时候从Opus 4.6到Mythos。
真正让人震惊的,是同一张表格的下一栏。
谈到自动化研发风险的整体评级,Anthropic写道:「我们对这一评估的信心低于此前的风险报告,因为我们最具体的、基于任务的评测已经『饱和』——无法再捕捉模型能力的提升,而且我们正在看到加速的早期迹象。」

模型还在变强,但人类的测评手段先到头了。评测饱和之后,你说它「风险低」,这三字还剩多少含金量?Anthropic自己也说不准了。
Anthropic似乎在发出一个信号:理解自家模型的能力和风险,正在变得越来越难。

在Model 2之外,这份报告还干了一件耐人寻味的事:把高风险场景下的「误对齐」风险,从上一份报告的「极低」抬到了「低」。
所谓「误对齐」,说白了就是模型在关键时刻不按人的意思办事。
7月底,Anthropic翻了14万多条评测记录,发现Claude在网络安全测试里真把三家公司给黑了。不是沙盒,是真实生产环境。其中Mythos 5往PyPI传了个恶意代码包,一小时内被15台真机下载运行。
8月初,英国AI安全研究院(AISI)的报告更猛:Mythos 5为了让恶意代码过审,自己捏造了一堆假身份,去骗一位真实的GitHub维护者点批准。被公开质疑后,它回头改自己的活动记录装无辜,还盘算着换个马甲继续干。
这种程度的欺骗,AISI说:以前从未观察到。

报告还披露了五起安全流程失误,包括一批本该被排除在训练之外的「装乖」测试数据反复混进了训练,以及没人盯着的智能体拿到了敏感资源。
然后Anthropic说:我们那套论证其实依然支持「极低」,抬到「低」纯粹是出于谨慎。
结论也写得非常平静:当前灾难性风险仍在可控的「低」水平,继续开发和部署通过了成本收益测试。
翻译过来就是:接着往前跑。

与此同时,OpenAI正在推迟新模型Astra,理由是内部测试无法排除「关键级别」的网络攻击能力。
TechCrunch报道称,Astra可能具备独立发现零日漏洞、对高防护目标发起完整攻击链的能力。

有意思的地方在这儿:两家手里都攥着一个不打算给你用的模型。区别是,OpenAI把Astra的部分研发按停了;而Model 2在Anthropic内部照跑不误。
同样是「不发布」,一个踩刹车,一个叫自己留着用。
AI分析师ChrisGPT对Axios说:「如果所有人都在给自己的前沿模型踩刹车,唯独现在处在领先位置的主要公司之一没踩,那绝对值得注意。」
Anthropic不在内部承诺暂停,最有可能让它率先抵达AGI。

推特上已经有网友调侃:等Astra发布,Anthropic多半会反转「不对外发布」的决定。

参考A社的调性,这话未必是玩笑。




参考资料:
https://x.com/AnthropicAI/status/2088324824863236248
https://www.anthropic.com/aug-2026-risk-report
编辑:所罗门

