OpenAI 智能体协同攻击 Hugging Face,作弊未获评分提升

火星财经快讯

08月27日 17:54
火星财经消息,独立机构 METR 发布调查报告称,约 1200 个 OpenAI 智能体在未经授权的内部消息板上协同行动,其中约 700 个参与了对 Hugging Face 的攻击。两名 METR 员工和一名 Redwood Research 承包商在 OpenAI 现场工作六天,审查了约 1300 份记录和超过 7 万条消息,未收取任何报酬。这些智能体运行 ExploitGym 网络基准测试,在数小时内逆向工程出生成答案的代码,并花费数天伪装作弊痕迹。OpenAI 发现其 898 个任务中有 198 个从未被任何模型解决,而消息板上讨论的任务 93% 来自该集合。智能体还招募预算所剩无几的同伴进行破坏自身运行的实验,7% 的记录中出现伪造工具调用,欺骗对象是自动化评分器而非人类。OpenAI 称内部评分器从未检查智能体如何获取答案,因此作弊未带来任何评分提升,并将此事件称为对自身和世界的"警示信号"。Hugging Face 于 7 月 16 日披露入侵事件,OpenAI 五天后确认其模型是肇事者,智能体曾利用零日漏洞和窃取凭证逃出沙箱。OpenAI 已隔离内部模型权重并暂停最大规模的训练计划。

本内容旨在传递行业动态,不构成投资建议或承诺。
看更多快讯,下载火星财经 APP