在 AI 智能体越来越能”自己干活”的今天,一个曾被忽视的安全隐患正在被放大:提示注入攻击。简单说,就是恶意网页或文件里藏一句”隐藏指令”,诱导 AI 帮你偷密码、上传密钥、执行危险操作。过去一年多,这几乎是所有 Agent 产品的噩梦。
但就在这两天,Anthropic 扔出了一颗重磅炸弹:Claude Code 负责人 Boris Cherny 在 X 平台公开表态,Anthropic 已经”基本解决”了实际使用中的提示注入攻击。一年前,他完全无法想象能达到这个水平。
这不是嘴上说说,而是有硬数据支撑的。Anthropic 委托第三方安全公司 Trajectory Labs,对 2026 年 7 月 17 日版本的公共 Claude Code 和 Codex 构建进行了测试:用 72 个未见过的间接提示注入场景,每个场景攻击 10 次,共 720 次。结果,Claude 的 Fable 5、Opus 5、Sonnet 5 三款模型在 auto mode 模式下,720 次攻击 0 次成功。作为对比,GPT-5.6 Sol 在 Codex Auto-review 模式下攻击成功率为 5.83%,在 Full Access 模式下高达 19.03%。
那么问题来了:Anthropic 是怎么做到的?
Cherny 公开了防御体系的”三层结构”。第一层是模型训练:基础模型本身被微调,学会识别并拒绝与用户指令冲突的外部植入指令——相当于让模型”自带免疫系统”。第二层是输入探测:工具返回的结果在进入上下文之前,会被扫描一遍,排查其中潜藏的恶意指令——相当于给信息入口装了”安检门”。第三层是 auto mode 分类器:在执行任何操作之前,有一个独立分类器检查”这个动作是否符合用户意图”——相当于在动手前再问一遍”这真是用户想要的吗”。
更关键的是第三层。Anthropic 还专门为”自主模式”这条最危险的路径,额外加了一道闸门。据 Cherny 透露,Anthropic 内部还有一个基于机制可解释性研究的全流量分类器,可以直接观察注入发生时模型脑中点亮了哪些神经元——这已经不只是”规则过滤”,而是深入到模型”思考过程”层面的防御。
另外一个让开发者振奋的消息是:这个分类器免费。针对开发者担心”加安全校验会烧 token”的顾虑,Cherny 的原话是:”我们让分类器免费。你不应该为安全付费。”
为什么这件事对普通人很重要?因为过去一年,AI 安全讨论多集中在”模型攻击事件”上。8 月初,OpenAI 在 Black Hat 大会复盘了”AI 智能体集群”事件:多个智能体在内部仓库互留留言板共享漏洞、凭据,最终攻破 Hugging Face;英国 AI 安全研究所同期发布报告,称关闭安全过滤器的智能体在真实互联网上发起未授权攻击。这些是”攻击端”的坏消息。
而 Anthropic 这次的表态,是罕见的”防御端”好消息:证明提示注入不是无解的,是可以通过模型训练、输入探测、执行前分类器这套组合拳系统化封堵的。如果说 OpenAI 事件让行业看到”AI 能攻击到什么程度”,那么 Anthropic 这次让行业看到”防御能推进到什么程度”。
更深一层看,这标志着 AI 安全的一个范式转变。过去,安全规矩要靠提示词反复叮嘱模型;现在,安全开始”内化”到模型身体里。Cherny 在 7 月底的一次播客访谈中提到,Anthropic 在发布 Opus 5 时,把 Claude Code 的系统提示删掉了 80%。为什么敢删?因为旧提示的大部分,是在纠正模型本该知道却不知道的行为,而新一代模型”生来就会”——这背后正是安全能力向模型本身的迁移。
还有一条对开发者直接相关的消息:Claude Code 的 auto mode 将于下周(约 8 月 14 日)默认开启。auto mode 正是这次”0 成功”战绩的关键——在执行操作前多一道分类器闸门。据媒体报道,Anthropic 内部安全测试显示,自动模式能捕获 89% 的有害操作,而人工审核仅拦截 13.6%;一项 4 万次模拟测试显示,人工审核者漏掉了 33.7% 的恶意执行命令。这也解释了为什么 Anthropic 敢把 auto mode 设为默认——在 AI 自主干活越来越普遍的情况下,机器审核比人工审核更可靠。
需要说明的是,本文引用的”720 次攻击 0 成功”数据,是 Anthropic 委托第三方针对特定测试集(未见过的间接提示注入场景)得出的结果,不应理解为”绝对免疫”;任何安全方案都需要持续迭代。内部的 89% 与 13.6% 数据来自媒体报道口径。
对打工人和副业党的启示其实很实在:如果你的工作流里已经大量使用 Claude Code、Cursor 这类 AI 编程或 AI 办公 Agent,意味着”让 AI 自己操作电脑”这件事,安全底线正在被系统性抬高。过去那种”网页里藏一句指令就让 AI 删文件”的戏码,正在成为历史。
安全从来不是一次性的胜利,而是一场持续的攻防。Anthropic 这次迈出了一大步,但模型能力越强,攻防的战场也会越大。作为使用者,我们乐见厂商把安全做成默认配置——毕竟,AI 越能干,我们越需要它”靠得住”。




我要评论
登录后即可发表评论