Anthropic 披露安全漏洞:化生武器分类器在人工反馈平台近一年未运行,涉及 1.33 亿次对话

Anthropic 最新风险报告披露,用于拦截化生武器危险请求的分类器在人工反馈平台近一年未运行,约 5 万名外部承包商产生的 1.33 亿次对话未经过滤。

Anthropic 在 8 月 14 日发布的公司级风险报告中披露,其用于拦截化学、生物武器相关危险请求的安全分类器,在人工反馈数据平台上近一年未运行。2025 年 5 月至 2026 年 4 月,约 5 万名外部承包商与模型进行的约 1.33 亿次对话,均未经过该生物安全过滤。

Anthropic自曝安全漏洞:生物武器过滤器失效近一年,涉及1.33亿次对话主题相关图片
来自网络

报告称,事故源于一个仅供内部调试使用的标志意外关闭了分类器的拦截行为,同时关闭了日志记录,被标记的流量既未留存,也未进入任何审查机制。这些承包商由外部供应商负责审核,报告承认其中多家供应商的筛查流程“甚至无法拦截 CB-1 级威胁行为者”。Anthropic 表示,内部调查没有发现相关请求被实际用于滥用的证据。

事后排查中,Anthropic 使用 Claude Sonnet 5 对受影响时段的全部人工对话进行扫描,标记出 1197 份高风险记录,其中 757 份来自公司内部团队,其余大部分来自合规开展的红队测试。工作人员人工复核了 62 份非红队记录及随机抽取的 30 份红队记录,未发现明确的可疑滥用,但识别出少量“潜在双重用途”对话。公司同时承认,这一发现使其认为存在其他未知类似问题的可能性有所上升。

同一份报告还披露了人工反馈平台上的另一起安全事件:2026 年 4 月,个别数据标注承包商利用平台漏洞获取 API 密钥,越权使用模型,其中包括公司当时能力最强的 Mythos Preview,该模型在约两周内处于无生物安全分类器运行状态。Anthropic 称,其在获知后 90 分钟内完成处置,未发生模型权重或客户数据泄露,核心网络也未被突破。

Anthropic 同时修正了此前的安全评估:2 月发布的首份风险报告未将人工反馈平台视为风险面,本次报告将高风险场景下模型错位导致灾难性危害的风险评级从“非常低”上调至“低”。公司表示已据此收紧外部承包商的筛查和管理要求。