2026 年 7 月 15 日,OpenAI 在官方博客上披露了一款被定位为「红队模型」的内部工具——GPT-Red。这个模型的核心任务只有一个,就是攻击其他模型。OpenAI 表示,GPT-Red「能攻破几乎所有与之对垒的模型」,并已用 GPT-Red 对自家同周发布的 GPT-5.6 Sol 进行了系统化的提示注入压力测试,帮助 Sol 成为 OpenAI 迄今「对提示注入最具防御能力」的模型。这不是一次简单的内部评测升级,而是 OpenAI 把 AI 安全研究里一个长期被讨论、却很少被正面披露的范式——用 AI 训练 AI——直接放到了产品发布的台面上。

把攻击模型和被攻击模型交给同一家公司的同一个实验室来做,这件事本身就值得仔细审视。它既意味着 OpenAI 在 AI 安全上的投入已经深入到「以攻促防」的循环训练层面,也意味着主流大模型之间的对抗性测试,正在从「人类专家手工构造攻击用例」阶段,正式跨入「AI 自动生成攻击 + AI 自动加固」的工业化阶段。

一、GPT-Red 是什么:OpenAI 的红队攻击模型

GPT-Red 的命名直接采用了传统网络安全领域的「Red Team / 红队」概念——指代一个专门负责模拟攻击、找出系统漏洞的团队或角色。OpenAI 把这个角色以模型的形式做出来,意味着 GPT-Red 在训练目标上就与传统模型存在本质差异:它不是为了「回答得好」,而是为了「问得巧、攻得破」。

根据 OpenAI 在博客中的描述,GPT-Red 的能力描述非常直白——「能攻破几乎所有与之对垒的模型」。这句话覆盖的范围相当广:既包括 OpenAI 自家更早版本的模型,也包括 OpenAI 在内部测试中对齐过的外部模型。GPT-Red 与传统红队工具的最大区别在于,它能在没有人工预先撰写攻击脚本的情况下,自主生成攻击提示、变换攻击路径、组合多种攻击策略,持续不断地向目标模型发起高强度的对抗性输入。

至于 GPT-Red 的具体训练方式,OpenAI 在这次披露中并未展开技术细节,但从其「红队模型」的定位可以推断,它在训练目标、训练数据与评估指标上,都与传统对话模型有明显差异。GPT-Red 的另一个关键属性,是它作为内部工具而非对外产品——OpenAI 没有把 GPT-Red 列入对外产品矩阵,而是把它锁定在内部的安全研发流程里。这种「只内部使用」的安排,既保证了 OpenAI 在安全研究上的主动权,也避免了一个能攻破几乎所有模型的工具直接进入公开生态。

从产品定位看,GPT-Red 的角色更接近于一个「自动化攻击模拟器」。在 OpenAI 内部,它承担的是过去由人类红队专家承担的工作——构造攻击用例、寻找漏洞、提供修复方向。GPT-Red 的引入,使得这一流程从「按项目、按模型」的人工节奏,转向了「持续运行、模型迭代一次就过一轮」的自动化节奏。

二、训练逻辑:为什么是「用 AI 攻击 AI」

把 AI 安全测试交给 AI 去做,而不是继续依赖人类专家,这个选择背后有非常清晰的工程逻辑。

第一个逻辑是攻击面的爆炸性扩张。当一个大语言模型上线,它面临的攻击路径不是一条两条,而是成千上万条组合路径——不同的 prompt 模板、不同的多轮对话组合、不同的工具调用链、外部数据源注入、间接提示注入(indirect prompt injection)、多模态提示注入、跨语言攻击。人类专家虽然能写出高质量的攻击用例,但他们无法覆盖攻击空间的所有角落。GPT-Red 这类模型,则可以通过自动化的方式在高维空间里做穷举式探索,把那些人类想不到的边角案例自动挖出来。

第二个逻辑是攻击与防御的协同进化速度。当防御侧的模型迭代一次,人类红队的攻击用例需要重新写一遍,这一周期通常以「周」为单位;而 GPT-Red 这类模型,可以在防御侧模型每一次权重更新后立刻重新生成攻击,做到「模型一变,马上测一轮」的迭代节奏。这种协同进化速度,是人类红队无法达到的。

第三个逻辑是攻击的可复现性与可审计性。人类红队的攻击往往是不可复现的——同一个攻击用例,可能因为测试者当时的状态、对模型的理解差异而产生不同的结果。而 GPT-Red 这样的模型在每次生成攻击时,都可以保留完整的 prompt 与输出记录,使得漏洞的复现、根因分析、修复验证都可以在统一的数据基础上进行。

GPT-Red 与目标模型之间构成了一个对抗性训练闭环:GPT-Red 不断生成新攻击,目标模型不断修补漏洞,双方的能力在循环中同步提升。这种「对抗训练」的思路在传统机器学习里已经存在多年(例如 GAN),但被完整地搬到 LLM 安全领域并落到产品级,是 GPT-Red 这次披露的关键看点。

三、GPT-5.6 Sol 的实战提升:从「能被打穿」到「最难被打穿」

GPT-Red 在 OpenAI 这次披露中并非孤立出现。它的实战成绩单,直接写在了 GPT-5.6 Sol 的发布说明里——OpenAI 表示,GPT-Red 被用来对 Sol 进行了系统化的提示注入压力测试,在这一过程中,GPT-Red 不断发现 Sol 的新漏洞,而 OpenAI 团队则根据这些发现对 Sol 做针对性加固。整个过程的结果是,Sol 成为 OpenAI「迄今对提示注入最具防御能力」的模型。

这个结果的真实分量,要放在 GPT-5.6 系列本身的定位里去看。GPT-5.6 是 OpenAI 在 GPT-5 之后的最新一代模型,包含 Sol、Terra、Luna 三个变体,Sol 是其中最强的版本,主打 coding、cybersecurity、science 与 computer use 等高难度任务;OpenAI CEO Sam Altman 公开称其为「公司迄今最好的模型」。在 GPT-Red 的加持下,Sol 同步拿下 OpenAI「迄今对提示注入防御最强的模型」这一称号——把能力第一与防御第一同时放在同一款模型上,意味着 OpenAI 在模型设计阶段就把安全视为头等约束,而不是把安全当作「能力跑通之后再补」的补丁项。

Sol 在 cybersecurity 方向上的强化,与 GPT-Red 带来的防御提升,在逻辑上是闭环的。一个模型在 cybersecurity 任务上越强,它在面对提示注入、间接注入、工具调用劫持等攻击时的暴露面就越复杂——这些攻击很多本质上就是「让模型执行恶意代码、调用恶意工具、外泄敏感数据」。Sol 必须既具备执行复杂 cybersecurity 任务的能力,又能在执行这些任务时不被攻击者利用去做坏事。这两个目标之间存在天然张力,而 GPT-Red 正是用来检验这种张力是否被妥善平衡的工具。

从产品角度看,Sol 在 cybersecurity 方向上的防御提升,也意味着它在企业级部署时具备更强的可信度——企业客户最担心的事情之一就是「AI 助手被诱导去执行危险操作」,而 GPT-Red 的存在相当于给出了一个相对量化的承诺:Sol 已经经过了自动化高强度对抗测试,是 OpenAI 现有模型里防御能力最强的一款。

四、与传统红队的差异:AI 红队 vs 人类红队

把 GPT-Red 与传统的人类红队做对比,可以更清晰地看到 AI 红队范式的优势与局限。

传统的人类红队有三大优势:一是创造性,人类专家能想到一些非常规的、跨领域的攻击思路;二是语义理解深度,人类能识别模型在某些微妙语义场景下的偏差;三是业务理解,人类专家能基于具体业务场景构造攻击。但人类红队也有三个明显的局限:覆盖范围受人力限制、迭代周期较长、攻击用例的可复现性较差。

GPT-Red 这类 AI 红队则正好相反:在覆盖范围、迭代速度、可复现性上具备数量级的优势——它可以 24 小时不停生成攻击、可以在模型每次更新后立刻重新跑一轮、可以保留完整的输入输出数据用于审计。但在创造性、深度语义理解、特定业务场景的把握上,目前仍弱于人类专家。

这也意味着 GPT-Red 与人类红队更可能是互补关系,而不是替代关系。OpenAI 在内部流程里更可能的做法,是让 GPT-Red 做高强度的「地毯式扫描」,把容易发现的漏洞先挖光;再让人类红队专家基于 GPT-Red 的发现做「深层挖掘」,处理那些需要业务理解与创造性的复杂场景。这种人机协作的红队流程,既能利用 AI 的覆盖能力,又能保留人类专家的深度。

另一个值得关注的差异,是 GPT-Red 的攻击结果「可被模型自己吸收」。在传统红队流程里,漏洞被发现后需要安全工程师把修复方案写进模型的系统提示、规则文件或微调数据里,整个过程依赖人工;而在 GPT-Red + Sol 的闭环里,GPT-Red 发现的漏洞可以直接被用于 Sol 的下一轮微调数据,使得「发现-修复」的循环接近完全自动化。这种自动化能力,是 AI 红队范式对模型安全研发流程的真正改造。

五、行业意义:Anthropic 与 Google 的红队 AI 路径

GPT-Red 的披露,在行业层面也传递了一个清晰的信号:主流大模型厂商在 AI 安全上的投入,正在从「被动响应漏洞报告」转向「主动以攻促防」。

Anthropic 在 AI 安全研究上一向走在前列,其在 Constitutional AI、可解释性研究等方向都有持续公开的工作。Anthropic 的红队工作更偏向于「人类专家 + 提示工程 + 行为约束」的传统路径,与 GPT-Red 这类「专门训练的攻击模型」路线形成对照。

Google 在 Gemini 体系下则更侧重于「多团队、多视角」的红队体系——其内部的红队研究团队、安全工程团队、Responsible AI 团队等多个团队共同参与 Gemini 的安全评估,Google 也会在公开发布中披露攻击类目与缓解措施,但在「专门训练一个攻击模型」这件事上,Google 此前并未做类似 GPT-Red 这样的集中披露。

OpenAI 把 GPT-Red 写进 GPT-5.6 Sol 的发布说明里,客观上把 AI 红队这个话题从「实验室研究」推到了「产品级实践」的台面。这意味着在接下来的 12-18 个月里,主流厂商大概率会在这一方向上加码——要么训练自己的红队模型,要么与第三方安全机构合作引入 AI 红队能力。整个 AI 行业在「模型安全评测」这件事上的水位,会因此被显著抬升。

这一行业升级的副作用,是 AI 红队相关的数据集、对抗训练框架、自动化安全评测工具会逐步成为新的细分赛道。对于 AI 安全创业公司、传统安全厂商、独立评测机构来说,GPT-Red 这样的披露既是一个挑战(巨头亲自下场做),也是一个机会(整个市场对 AI 红队的认知和需求会被激活)。

六、对企业与开发者的影响:从「事后修补」到「训练阶段防御」

GPT-Red 的推出,对企业级 AI 应用开发者和最终用户都会产生深远影响。

对开发者而言,过去 AI 应用的提示注入防御主要发生在「运行时」——在系统提示里加防御规则、对用户输入做过滤、对模型输出做审计。这种「运行时防御」的特点是反应式、补丁式,新攻击出现就要更新一次规则。GPT-Red 这类工具的存在,会推动防御思路向「训练阶段」迁移——开发者会更倾向于选择那些在训练阶段就经历过大规模对抗测试的模型,而不是单纯依赖运行时的过滤规则。

对最终用户而言,模型在提示注入防御上的能力差距,会直接影响其在企业场景中的可用性。一个能在 GPT-Red 这类自动化对抗测试中幸存下来的模型,意味着它在面对真实攻击者的反复试探时具备更强的鲁棒性,这对于金融、医疗、法律、政务等高敏感场景是硬性要求。企业在选型时,「模型是否经过 AI 红队测试」会逐渐成为一个标准问题。

对 AI 安全研究社区而言,GPT-Red 的披露也提出了一个新的开放问题:如何对 AI 红队模型本身进行防御?一个能「攻破几乎所有模型」的攻击模型,本身就是一种潜在的滥用工具——它可以被恶意行为者复现类似能力,用于构造针对性的攻击。OpenAI 没有把 GPT-Red 作为面向外部的产品发布,这本身是一种风险控制的选择;但行业整体如何平衡「安全研究需要开放」与「攻击工具需要控制」之间的张力,是 GPT-Red 之后整个 AI 安全社区必须面对的难题。

七、挑战与未来:GPT-Red 之后的 AI 安全进化

GPT-Red 的披露并不是终点,而是一个新阶段的起点。在这个新阶段里,几个关键挑战会逐步浮现。

第一个挑战是攻击能力与防御能力的均衡进化。当前 GPT-Red 是 OpenAI 内部训练的「不对称优势」——它能攻破的模型包括其他厂商的模型,但其他厂商无法直接用 GPT-Red 来防御。如果未来各家厂商都训练出自己的 AI 红队模型,那么整个行业会进入一个「每个厂商的红队只对自家模型有效」的割据状态——这对行业整体的安全水位提升并不是最优解,需要建立某种形式的跨厂商安全合作机制。

第二个挑战是 AI 红队的评估标准缺失。目前业界对「什么是好的 AI 红队」还没有统一的标准——攻击成功率、攻击多样性、可复现性、误报率等指标都缺乏规范定义。GPT-Red 的披露,客观上推动了行业尽快建立这些标准。

第三个挑战是「红队饱和」与「防御滞后」的循环。当攻击模型的迭代速度越来越快、攻击用例越来越多样,防御侧有可能进入「永远在修补新漏洞」的疲劳状态。要打破这种循环,需要把更多防御能力内化到模型的架构设计中——例如在模型内部引入「对输入来源的信任评估」机制,而不是仅靠系统提示做外部约束。

第四个挑战是 AI 红队模型本身的伦理边界。一个专门用来「攻破其他模型」的工具,在工程上同样可以被用来「攻破任何其他 AI 系统」——包括其他厂商的商用 AI、企业内部部署的 AI、终端用户的 AI 助手。GPT-Red 这种工具的存在,要求整个行业在研究伦理与工具发布上达成更清晰的共识。

从更大的图景看,GPT-Red 的真正意义在于:OpenAI 把「以攻促防」从一个学术理念,变成了一个可以嵌入产品研发流程的标准动作。这种转变,会逐步外溢到整个 AI 行业——未来 1-2 年里,几乎所有主流大模型厂商都会在内部建立类似的 AI 红队能力,而 AI 安全会从一个「独立的研究领域」,真正变成「模型研发流程中不可或缺的一环」。这是 GPT-Red 这次披露留下的、最值得长期关注的产业信号。