OpenAI 开发攻击型 AI 黑客工具用于安全测试

OpenAI公布自动化红队模型GPT-Red,用于主动构造提示注入等攻击,测试AI智能体的安全边界,并将生成的攻击样本用于提升生产模型的防御能力。

OpenAI近日公布了名为GPT-Red的自动化红队测试模型。该模型的定位并非面向公众提供的黑客工具,而是用于内部安全评估:它会向目标模型或智能体发送提示,观察响应,再不断迭代攻击策略,以发现部署前可能出现的安全漏洞。

OpenAI 开发攻击型 AI 黑客工具用于安全测试主题相关图片
来自网络

OpenAI表示,GPT-Red采用自我博弈强化学习训练。训练过程中,攻击模型与多个防御方模型在不同红队测试场景中对抗,攻击方因诱发错误输出而获得奖励,防御方则因抵御攻击并完成原任务而获得奖励。测试场景覆盖网页、电子邮件、本地文件和工具输出等可能携带间接提示注入的位置。

从OpenAI披露的测试结果看,GPT-Red能够针对提示注入和数据外泄场景持续调整攻击方式。在一项复刻的间接提示注入测试中,GPT-Red在84%的场景中取得成功,人类红队测试人员的成功率为13%。OpenAI同时强调,这类攻击能力与生产模型分开部署,以避免专门训练出的恶意能力直接落入外部攻击者手中。

OpenAI还描述了两个内部案例。GPT-Red曾对一个用于管理线上自动售货机的自主智能体进行测试,并实现修改高价商品价格、低价购买新商品以及取消其他顾客订单等目标。针对由GPT-5.4 mini驱动的Codex CLI智能体,OpenAI则设置了10个隐藏数据外泄场景,用来比较不同模型的红队测试表现。

这些攻击样本随后被用于生产模型训练。OpenAI称,GPT-5.6在其严格的直接提示注入基准测试中,失败次数较四个月前表现最佳的生产模型减少了6倍;在一类早期模型成功率超过95%的“伪思维链”攻击中,GPT-5.6的成功率已降至10%以下。相关数据属于OpenAI披露的内部评估结果,适用范围取决于测试环境和威胁模型。

OpenAI此前也在网络安全模型的系统卡中指出,渗透测试、漏洞研究、恶意软件分析等能力具有明显的双重用途。因此,公司提出分层安全措施,包括限制有害请求、监控高风险使用场景,以及通过身份验证和受信访问机制向具备授权的防御者提供高风险网络安全能力。GPT-Red的公开,显示AI厂商正在把“用攻击模型测试防御模型”作为提升智能体安全性的重要方法。