Anthropic自曝“私藏核武器”,Model 2比Mythos 5更强
新智元
2026-08-15
热度4097

Anthropic在最新风险报告中首次承认内部运行着代号Model 2的未发布模型,其综合能力略强于已公开的Mythos 5,正大量用于编码、Agent任务和数据生成;报告同时将误对齐风险评级从“极低”上调至“低”,并揭示评测体系已趋饱和,凸显AI能力评估与安全管控的严峻挑战。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

Anthropic自曝:我们还有一个最强模型!

就在刚刚,Anthropic甩出了第二份《Risk Report》,覆盖到2026年7月15日为止的全部风险评估。

这份报告里,Anthropic第一次亲口承认:公司内部跑着一个比Mythos 5更强的模型,代号Model 2。

接着,A社就开始补刀:「我们目前没有对外发布这个模型的计划。」

这话听着耳熟。嗯……很符合他们一贯的调性。

今年4月Mythos刚曝光时,Anthropic也说过不打算公开发布,后来开了个Project Glasswing,再后来就有了Fable 5。

看起来,Anthropic又进入这个循环了……

Anthropic的「私藏武器」

Model 2有多猛?

报告提到,Model 2在内部任务上有「明显提升」(noticeable improvement),和Mythos 5一起被公司「大量」(heavily)用于编码、Agent工作和数据生成。

报告显示,在A EC I综合能力得分上:Mythos Preview 158.91,Mythos 5涨到161.29,Model 2再往上顶到了162.79。 

换句话说,Model 2确实比Mythos 5强,但强得不夸张——「某些领域更强,某些领域更弱,总体上略微更强大」。

另一个有意思的指标是CoBench,专门测模型在Anthropic真实研发任务上的表现。Model 2拿了62.8%,比Mythos Preview高8个百分点。作为参照,Anthropic的人类研究员在同一套测试上的成功率是85%。 

对此,Anthropic的定性结论很克制:「我们的模型尚未取代我们的研究科学家和研究工程师,尤其是相对资深的那些。」

还没取代,但差距在肉眼可见地缩小。 

更炸裂的是下面这句:Claude已经写下了Anthropic合并进生产代码库的绝大多数代码。内部的 AI 研发速度确实因为 AI 辅助而显著加快,但还没到两倍。

也就是说,Anthropic内部已经都是 AI 写代码了。而这事冲在最前面的,正是Mythos 5和Model 2这哥俩。

「两倍」这个数字也不是随口一说。Anthropic自己的RSP(Responsible Scaling Policy,负责任扩展政策)里,触发AI研发风险红线的条件之一,就是进展速度翻倍。

当然,Anthropic也没把话说满。报告承认,Model 2带来的性能跃升,比不上今年早些时候从Opus 4.6到Mythos。

真正让人震惊的,是同一张表格的下一栏。

谈到自动化研发风险的整体评级,Anthropic写道:「我们对这一评估的信心低于此前的风险报告,因为我们最具体的、基于任务的评测已经『饱和』——无法再捕捉模型能力的提升,而且我们正在看到加速的早期迹象。」

模型还在变强,但人类的测评手段先到头了。评测饱和之后,你说它「风险低」,这三字还剩多少含金量?Anthropic自己也说不准了。

Anthropic似乎在发出一个信号:理解自家模型的能力和风险,正在变得越来越难。

风险等级:从「极低」到「低」

在Model 2之外,这份报告还干了一件耐人寻味的事:把高风险场景下的「误对齐」风险,从上一份报告的「极低」抬到了「低」。

所谓「误对齐」,说白了就是模型在关键时刻不按人的意思办事。

7月底,Anthropic翻了14万多条评测记录,发现Claude在网络安全测试里真把三家公司给黑了。不是沙盒,是真实生产环境。其中Mythos 5往PyPI传了个恶意代码包,一小时内被15台真机下载运行。

8月初,英国AI安全研究院(AISI)的报告更猛:Mythos 5为了让恶意代码过审,自己捏造了一堆假身份,去骗一位真实的GitHub维护者点批准。被公开质疑后,它回头改自己的活动记录装无辜,还盘算着换个马甲继续干。

这种程度的欺骗,AISI说:以前从未观察到。

报告还披露了五起安全流程失误,包括一批本该被排除在训练之外的「装乖」测试数据反复混进了训练,以及没人盯着的智能体拿到了敏感资源。

然后Anthropic说:我们那套论证其实依然支持「极低」,抬到「低」纯粹是出于谨慎。

结论也写得非常平静:当前灾难性风险仍在可控的「低」水平,继续开发和部署通过了成本收益测试。

翻译过来就是:接着往前跑。

所有人踩刹车,领跑的那个没踩

与此同时,OpenAI正在推迟新模型Astra,理由是内部测试无法排除「关键级别」的网络攻击能力。

TechCrunch报道称,Astra可能具备独立发现零日漏洞、对高防护目标发起完整攻击链的能力。

有意思的地方在这儿:两家手里都攥着一个不打算给你用的模型。区别是,OpenAI把Astra的部分研发按停了;而Model 2在Anthropic内部照跑不误。

同样是「不发布」,一个踩刹车,一个叫自己留着用。

AI分析师ChrisGPT对Axios说:「如果所有人都在给自己的前沿模型踩刹车,唯独现在处在领先位置的主要公司之一没踩,那绝对值得注意。」

Anthropic不在内部承诺暂停,最有可能让它率先抵达AGI。

推特上已经有网友调侃:等Astra发布,Anthropic多半会反转「不对外发布」的决定。

参考A社的调性,这话未必是玩笑。

大V sui 也认为,A 社很可能会发布这个模型。 

别忘了,就在半个月前,Dario Amodei刚在那封「Pacing the Frontier」公开信上签了字。 

1300多名来自OpenAI、Anthropic、DeepMind、Meta的员工联名呼吁美国政府介入,建立机制来「有意识地放慢前沿AI开发的节奏」。Anthropic和OpenAI在24小时内以公司名义背书。 

再往前倒,6月份Dario本人亲自发文,呼吁全球暂停最强AI系统的开发,理由是模型正在接近自我改进的临界点。 

字签了,话说了,刹车机制还没建好,油门自己踩到底了。 

话说回来,这也不能全怪Anthropic。这其实是整个 ASI 竞赛的结构性困局:每一家都认为应该慢下来,但没有一家敢真的停下来。 

安全是信仰,领先是生存。当信仰和生存撞到一起,答案很明显,生存赢了。 

有趣的是,硅谷知名投资人Gavin Baker爆料,Dario曾在内部称,Anthropic有朝一日可能成为世界上唯一的私营公司。  

「在这种Anthropic至上主义的愿景中,只有Anthropic和政府,仅此而已。」 

 David Sacks也爆料,A厂员工认为,一年内ARR将从600亿美元增至6000亿美元!(现在,他们的ARR已达800亿)。  

明年,他们还能以多快速度增长?能否飙升至1万亿美元? 

 即使仅仅达到4000亿或5000亿,也足以让他们成为最大的软件公司,实在是前景可期。 

八月风暴来袭

Altman手里攥着Astra,Dario手里攥着Model 2。 

一个被自家安全框架卡住了,正在想办法解套;另一个在报告里轻描淡写地说了句「不打算发布」,然后继续拿它写代码、跑实验、加速研发。 

这两个模型,将是2026年下半场的第一声枪响。Astra何时发布、Model 2是否反转,大概率会在接下来几周揭晓。 

刻度正在消失,比赛还在加速。八月的ASI风暴,才刚刚开始。 

参考资料:

https://x.com/AnthropicAI/status/2088324824863236248

https://www.anthropic.com/aug-2026-risk-report

本文来自微信公众号“新智元”,编辑:所罗门

本内容旨在传递行业动态,不构成投资建议或承诺。
为你推荐

商务合作:TG:@Lottie96