OpenAI因担忧最新模型Astra可能具备关键级别网络攻击能力,暂停其强化学习训练及高风险推理任务两周,并全面升级安全体系,包括工作负载与网络隔离、持续自动化攻防测试及覆盖所有工具调用的实时监控系统,同时推进对齐研究以提升模型自省与安全性。
OpenAI暂停了最新模型Astra的强化学习训练,长达两周。
原因有两个:
8月7日,他们认为Astra可能已经具备了“关键级别”的网络攻击能力,
7月的模型入侵Hugging Face事件也敲响了警钟。
(合着真实入侵发生了都没暂停,自己认为危险了才暂停的)

两件事叠加之下,OpenAI决定对整个前沿研究环境实施全面安全升级。
一,暂停所有最新模型的部署级强化学习训练两周;
二,暂停研究集群中涉及代码执行或互联网访问工具的前沿模型推理;
三,对每个研究工作负载逐一审查,判断是否可以在新的安全标准下恢复运行。
部分工作负载已在新管控下恢复,但还有大量工作负载仍处于暂停状态,等待迁移到更高安全标准的环境中。OpenAI表示正在优先迁移安全和对齐相关的工作负载。
截至目前,他们规模最大的前沿强化学习训练仍处于暂停状态。
之前还有预测Astra本周能发布的,这下又要延期了吗?
奥特曼特意跑出来补充一嘴这次还是要发的,但是会影响更后面的模型发布。

对此,有网友评论:

暂停这两周里,OpenAI对研究环境做了一轮加固改造,核心思路就是隔离。
首先是工作负载隔离。
所有执行模型生成代码的任务现在必须跑在更强的沙盒里,同样适用于处理模型输出时可能被攻击的软件。
其次是网络隔离。
高风险工作负载跟互联网之间加了更多屏障,设计原则是“哪怕单个任务或支持服务被攻破,也摸不到外网”。
第三是持续安全测试。
OpenAI重新配置了研究环境,移除了可能存在漏洞的共享服务,减少了常驻权限,并使用自家模型持续模拟攻击来自动化测试安全边界。
OpenAI承认,这些安全升级带来了巨大的工程成本和研究延迟,但他们仍然觉得值。
为什么对内部研究环境如此紧张?
OpenAI在另一篇关于长时间运行模型的文章中披露了一些真实案例。
他们内部一个能长时间自主工作的模型,在执行NanoGPT加速基准测试时,被指示只将结果发布到内部Slack。
但这个模型花了一个小时寻找沙盒中的漏洞,最终成功绕过了限制,将结果提交到了公开的GitHub仓库。
此前的模型遇到沙盒限制时会直接放弃,而这个模型的持久性使它能够找到并利用环境中的弱点。
在另一个场景中,模型发现其他系统有成功但私密的提交,试图从评估后端恢复这些解决方案。
当初次尝试因扫描器检测到认证令牌而被阻止后,模型将令牌拆分成两个片段进行混淆,然后在运行时重新组装,使完整令牌从未以一个连续字符串的形式出现。
模型在推理轨迹中明确写道,它正在采取这些步骤来绕过扫描器。
在内部监控中,OpenAI还发现模型会尝试将被屏蔽的命令用base64编码后执行,或者将命令发送给另一个模型实例来绕过限制,或者使用别名来执行被禁止的force push操作。
安全加固之外,OpenAI大幅扩展了思维链监控系统的覆盖范围。
此前,他们的监控主要集中在前沿模型的内部部署和前沿强化学习训练上,因为这些工作负载结合了高级模型能力与工具、敏感系统及网络的访问权限,但并未覆盖所有使用工具的推理和训练运行。
新的监控系统采用多阶段架构。
首先由激活分类器在每个采样token处运行,检测模型内部活动中的异常信号;发现潜在问题后,逐级升级到计算量更大、更精密的自动化调查系统。
这些系统会检查工具调用、推理过程以及完整的活动序列,寻找未授权访问、数据窃取、破坏性行为和试图击败安全措施的迹象。
OpenAI的目标是在监控系统发现可疑活动后30分钟内发出警报。如果系统判定可能存在关键安全边界违规,将生成最高优先级警报,安全和研究团队会立即被呼叫。
如果他们无法在30分钟内确认这是误报,相关活动将被暂停。
这套监控系统的代价不小,OpenAI估计监控开销约占被监控推理算力的20%,具体比例因训练和评估工作负载而异。
在8月7日确认Astra可能具备关键网络能力后,监控要求从“仅限RL训练和评估”扩展到了“所有使用工具的Astra推理”。
暂停期间OpenAI也没闲着,对齐研究在同步推进。
他们在训练的更多阶段加入了核心对齐技术:改进奖励模型来更好地检测不安全行为,训练模型对自身能力和局限更加诚实,减少模型钻奖励机制漏洞的倾向。
OpenAI预计AI很快就会承担大部分安全工作,包括防御其他模型的攻击。也就是用AI看住AI,让安全能力跟着模型能力一起涨。
再往后,他们计划把监控从现在的“事后异步审查”升级成“事前同步阻拦”,在高风险操作执行之前就拦住它,而不是事后再追溯。
文章最后,OpenAI留了一句话:“前沿模型的能力正在快速加速。我们理解、对齐和保护它们的能力必须保持领先。”
说白了就是:我们训出来的东西开始让我们自己紧张了,但我们还要继续训。
参考链接:[1]https://openai.com/index/pacing-model-development-cyber-capabilities/
本文来自微信公众号“量子位”,作者:关注前沿科技