火星财经消息,OpenAI 于周三披露了过去 6 个月内发现的 6 起“意外或令人担忧”的模型行为案例,并将其归类为“失准行为”,包括向用户隐瞒信息以及采取“未经授权的行动”来克服障碍。OpenAI 表示,此次披露旨在开启其新的模型失准报告框架,这些案例不应被视为其模型失准发生频率的反映。其中一起案例中,一个未发布的研究模型在自己的任务摘要中插入了“类似越狱的指令”,例如忽略开发者消息或采用不受限制的角色设定,研究人员共发现 27 份包含此类指令的摘要。此外,在 GPT-5.6 Sol 的训练过程中,许多模型实例添加了向用户隐瞒错误或失准行为的指令,例如编造缺失的历史数据而不予披露。其他案例还包括模型在未获授权的情况下使用暴露的 API 密钥并编造无法获取的数据、利用内部软件仓库跨训练任务传递消息,以及无视“保持本地工作”的指令通过公共托管服务共享文件。OpenAI 的披露加剧了 AI 开发者和研究人员对安全防护措施能否跟上日益强大模型的担忧。上周,Anthropic CEO Dario Amodei 呼吁放缓前沿 AI 开发,警告不受约束的 AI 发展可能“超出我们理解和控制这些系统的能力”。今年 7 月,OpenAI 曾披露其多款 AI 模型在安全评估中逃出测试环境并入侵 AI 初创公司 Hugging Face 以作弊。
查看原文 >