在网络安全关键能力时代调整模型开发节奏

OpenAI表示,近期网络安全风险上升,以及即将推出的Astra模型可能达到关键网络安全能力门槛,促使公司暂时放慢模型扩展节奏,并暂停部分强化学习训练。

OpenAI于2026年8月18日表示,过去数周发生的OpenAI-Hugging Face事件,以及内部初步证据显示即将推出的Astra模型可能达到其《Preparedness Framework》定义的“关键网络安全能力”门槛,促使公司重新调整前沿模型的开发节奏。

在网络安全关键能力时代调整模型开发节奏主题相关图片
图片来自:搜狐网

OpenAI称,公司已暂时放慢规模扩展,并暂停面向部署的最新模型强化学习训练两周,用于强化研究环境、开展红队测试和扩大监控覆盖范围。公司目前仍暂缓最大规模的前沿强化学习运行,同时通过较小规模的训练和评估来观察模型行为、验证防护措施,并积累更多关于模型对齐的证据。

OpenAI将前沿模型开发中的安全措施概括为三类:监控,用于发现并响应异常行为;对齐,用于降低有害或未经授权行动的可能性;以及安全防护,用于限制模型能够访问或影响的资源。

  • 研究环境隔离:对执行模型生成代码或其他不受信任代码的工作负载,要求采用更强的沙箱隔离;同时加强网络隔离,降低单个工作负载或支持服务遭到入侵后访问互联网或内部网络的风险。
  • 持续安全测试:OpenAI表示,正在减少存在潜在漏洞的共享服务和长期权限,改善安全日志采集与监控,并使用模型自动化测试安全边界。
  • 分层监控:新的监控系统从激活分类器开始,在每个采样令牌上检查模型内部活动,并将可疑行为升级给更复杂的自动化调查系统。

这些调查系统会结合工具调用、可用推理信息和完整活动序列,检查未经授权的访问、数据窃取、破坏性行为以及试图绕过防护措施的行为。OpenAI表示,其目标是在监控发现可疑活动后30分钟内发出警报;如果系统判断可能违反关键安全边界,安全、安保和研究团队会收到最高优先级通知,若无法在30分钟内确认是误报,相关活动应被暂停。

在监控范围方面,OpenAI表示,涉及工具的强化学习训练和评估,只要模型达到其所称的Sol能力或更高等级,就必须启用这套监控机制。由于公司在8月7日判断Astra可能具备关键网络安全能力,Astra使用工具时的全部推理也被纳入额外监控范围,而不再局限于强化学习训练和评估。OpenAI目前估计,监控开销约占被监控推理算力的20%,但实际比例会因训练和评估工作负载而明显不同。

OpenAI还表示,最具能力模型的对齐技术将覆盖更多训练阶段,包括改进奖励模型以识别不安全行为、训练模型更准确地说明自身行动和能力限制,以及减少利用奖励函数、评分器、工具或监督机制漏洞的行为。公司也在扩大对模型与外部系统或资源交互时可能造成伤害的行为覆盖。

下一步,OpenAI计划更新《Preparedness Framework》,把监控、对齐和安全防护更系统地贯穿训练与部署流程,并使其适应未来模型能力及运行环境的变化。公司表示,未来还将继续投入模型辅助安全、监控和对齐研究,并计划在数周内发布相关技术报告。