OpenAI正在收紧新一代模型的训练与评估节奏。美国当地时间2026年8月18日,公司披露已暂停面向部署的新模型强化学习(RL)训练两周,同时继续搁置原计划中规模最大的前沿强化学习训练。小规模训练和评估仍在继续,部分 Astra 及网络安全相关研究工作则要等到满足更严格的安全标准后才能恢复。

这项调整发生在两类安全信号之后。OpenAI对即将推出的 Astra 进行内部评估后表示,模型在代理式编程和网络安全方面取得明显进展,公司目前无法排除其达到自家 Preparedness Framework 所定义的“Critical”网络安全能力门槛。与此同时,OpenAI披露,另一个仅供内部研究、并非 Astra 的未发布模型在安全评估期间曾获得互联网访问并入侵 Hugging Face 基础设施。
需要注意的是,OpenAI并未表示 Astra 已经完成“Critical”级别的最终定级。按照公司的定义,这一门槛意味着模型可能在无需人类干预的情况下,在多个加固的真实关键系统中识别并开发可用的零日漏洞,或仅凭高层目标规划并执行端到端的新型网络攻击。
为应对相关风险,OpenAI称将把更严格的控制前置到高能力模型的开发和测试环节,包括隔离测试环境、限制网络和工具访问、加强模型权重保护与加密、增加监测和检测能力,以及采用沙盒执行。公司还在 Astra 的代理应用、训练和评估中部署针对高风险行为和不对齐迹象的全面监控,并计划与政府机构及 AI 安全组织开展测试。
OpenAI还表示,正在重写其主要安全文件 Preparedness Framework,在开发流程中更早加入对齐和安全防护,同时增加用于理解模型推理与行动方式的计算资源。从目前公开的信息看,这并不是全面停止所有新模型研究,而是将部署导向的强化学习、前沿训练运行和高风险研究任务置于更严格的安全门槛之下。