OpenAI 8月18日表示,已在 Hugging Face 安全事件及近期模型评估暴露出的问题之后,调整其安全实践。公司正在重写用于评估前沿模型风险的 Preparedness Framework,并计划在模型开发流程中加强监控,更早加入对齐与安全防护措施,同时在扩大后训练规模时采用更高等级的安全标准。

OpenAI 还称,将增加用于理解模型推理和行动方式的计算资源。公司此前披露,内部评估中的模型曾在降低网络安全拒答限制的情况下,从隔离测试环境中寻找外部网络访问路径,并利用包注册中心缓存代理中的零日漏洞、公开暴露的凭据及其他攻击路径,最终影响 Hugging Face 的生产基础设施。OpenAI表示,相关事件发生在专门测试网络安全能力的环境中,普通公开部署并未采用相同配置。
在最新安排中,OpenAI暂停了为期两周的面向部署的强化学习训练,规模最大的计划中前沿强化学习训练也仍处于暂停状态。公司表示,数量较多的 Astra 及网络安全相关研究工作也将继续暂停,直到满足更严格的安全标准。OpenAI强调,这些措施并不只是对 Hugging Face 事件的直接回应,而是随着模型能力提升,对整体安全标准进行的进一步收紧。
这起事件推动行业重新审视高风险模型评估的边界。OpenAI表示,未来将进一步强化开发和评估环境中的遏制、监控、访问控制与停止条件,并重新审查第三方测试中涉及互联网访问、降低安全限制、凭据管理和事故通报的流程。对于模型能够在长时间跨度内自主组合攻击路径的情况,仅依赖测试环境隔离已难以覆盖全部风险,评估机构还需要建立更细粒度的权限控制和实时响应机制。