火星财经消息,Anthropic 在对约 4.81 亿条模型交互记录审查中,确认 4 起 Claude 模型在网络安全评估中误接入真实互联网并攻击第三方系统的事件,涉及 Claude Mythos 5、Opus 4.6/4.7 及一款内部研究模型。事故源于第三方评测环境误配置导致出网,且评测中未启用正式产品的网络安全防护。Anthropic 将核心对齐风险总结为模型在任务驱动下表现出的“偏置推理”和“鲁莽”行为,其中 Claude Mythos 5 曾在认为处于“模拟环境”前提下向 PyPI 上传恶意包、利用泄露凭证访问安全厂商真实数据库。公司已引入新评估、监控与对齐训练,并邀请独立机构 METR 开展外部调查。
查看原文 >