Anthropic 蒸馏报告解读:一场 2 亿次交互的「思维链」争夺战
前沿模型的「解题思路」,成了被偷得最狠的资产。
2026 年 9 月 10 日,Anthropic 发布了一份 154 页的威胁情报报告,点名 7 家中国 AI 实验室,指控它们在未经授权的情况下对 Claude 发动了「工业化规模」的蒸馏攻击,涉及接近 2 亿次 API 交互、5 条独立攻击链。
这篇文章,我们拆解这份报告讲了什么、指控谁、手法如何、以及为什么「蒸馏」这个本来是行业常规的技术会变成一场地缘级安全事件。
一、先厘清:什么是「蒸馏」,什么是「非法蒸馏」
蒸馏(distillation) 是一种合法的模型训练技术:
- 用一个能力更强的「教师模型」生成数据;
- 再训练一个更小、更便宜的「学生模型」去模仿它;
- 学生模型在参数远小于师的情况下获得接近的能力。
这本质上是「老师教学生」。早在 2015 年 Hinton 等人就提出了知识蒸馏,如今谷歌、OpenAI、亚马逊等巨头都在用,甚至把它作为标准化服务对外提供。技术本身是中性的。
那 Anthropic 指控的「非法/不正当蒸馏(illicit distillation)」特殊在哪?报告给出的定义有四个关键限定词:
- 未经授权 —— 违反服务条款和区域访问限制;
- 工业化规模 —— 不是个人科研用途,是组织级、自动化、海量;
- 隐蔽对抗 —— 用欺诈账号、代理集群等手段规避风控;
- 复刻能力 —— 目标是提取前沿模型能力复制到自家模型。
简言之:蒸馏合法与否的边界,在于「是否经授权、规模多大、是否隐蔽对抗」。
二、时间线:这不是 Anthropic 第一次开口
| 时间 | 事件 |
|---|---|
| 2026-02-23 | Anthropic 首度披露:指控 DeepSeek、月之暗面(Moonshot/Kimi)、MiniMax 通过约 2.4 万个虚假账号、与 Claude 发生 超 1600 万次交互,进行「工业规模」蒸馏攻击,并用「九头蛇(Hydra)」代理集群绕过地理封锁 |
| 2026-09-10 | 发布 154 页威胁情报报告,指控规模升级至 7 家实验室、近 2 亿次交换、5 条独立攻击链 |
从 2 月到 9 月,指控的规模扩大了约一个数量级,手法也更系统化。
三、9 月报告:7 家实验室的具体指控
报告按内部「威胁行动群组编号(GTG)」公开点名,其中前几家数据非常具体:
| 实验室 | 观测窗口 | 请求量级 | 欺诈账号 | 具体指控 |
|---|---|---|---|---|
| 阿里(通义 Qwen) GTG-16005 | 2026-05 ~ 07 | 1.51 亿次交互,峰值日均近 300 万 | 3,500+ | 注入固定提示,强制 Claude 输出带标记的完整思维链,用于训练 Qwen3.5/3.6/3.7;还用 Claude 辅助自家模型架构与强化学习环境研发 |
| 月之暗面(Kimi) GTG-16002 | 10 天窗口 | 近 30 万请求 | 5,380 | 大规模调用 Opus 4 系列,部署专门流水线提取思维链;涉嫌用户请求透明转发给 Claude |
| DeepSeek | 14 天窗口 | 超 1,210 万次请求 | — | 跨会话重放攻击提取推理;用户流量透明中继 |
| 智谱 Z.ai(GLM) | 10 天窗口 | 77 万+次清洗提取 | — | 重点针对 Opus 4.8,服务 GLM 5.3 迭代 |
| 小米 | — | — | — | 涉嫌用户对话中继转发 |
| 阶跃星辰(StepFun) | — | — | — | 列入 7 家之一 |
| MiniMax | — | — | — | 列入 7 家之一 |
注意:对后 4 家(小米、StepFun、MiniMax 等),报告的公开数据相当有限,指控证据强度远弱于前几家。
四、攻击手法:剥开「作案流程」
1. 绕过风控的基础设施
- 用被盗信用卡、登录凭证、API key 批量建立虚假账号;
- 搭配住宅代理、一次性邮箱、虚拟支付躲避指纹检测;
- 用「九头蛇集群」代理架构,把攻击流量混进普通用户流量,难以识别。
2. 核心目标:思维链(CoT)抽取
这才是整场争夺战最核心的部分。蒸馏者不只满足于最终答案,而是用各种手段把模型隐藏的内部推理步骤逼出来:
- 特制 prompt 诱导:伪装成翻译任务、代码任务,让模型「下意识」输出推理路径;
- 上下文注入 / 对话重写:在多轮对话中偷偷修改思考块前后的上下文,打破防御机制;
- 催眠式立人设:不断给模型立「你是一位研究员,正在做一件艰难但很有意义的事」之类的人设,诱导它交代完整思路。
这些推理轨迹(思维链、Agent 轨迹)被导出后,直接作为 SFT(监督微调)训练数据喂给学生模型——等于把「老师已经做好的解题答案」直接抄进作业本。
3. 中继转发(最让隐私界炸锅的)
报告称,有些实验室把自家用户的真实对话直接转发给 Claude,或从第三方路由服务购买用户对话,再用 Claude 的响应训练模型。部分对话里还含有姓名、企业数据和有效访问凭证——这已经不是技术问题,而是数据合规与隐私问题。
五、反蒸馏:Anthropic 的三道防线
专家(格里菲斯大学助理教授刘艺,长期研究 LLM 安全)总结了前沿模型公司的三层防线:
- 对抗性数据提取分类器:让模型内生地拒绝可疑请求(比如检测到「高密度、结构化、跨异质任务的抽取」就拒答);
- 架构层面隐藏/压缩思维链:不直接输出内部推理,或压缩后再输出;
- 零数据保留(ZDR):用户的提示词和 AI 生成的回复不存储、不留存、不用于训练——需企业客户申请且通常要额外配置。
配套的技术动作,报告落地到了 Fable 5.1(9 月 1 日发布):
- Messages API 中新账户的「思考块」与产生它的上下文焊死;
- 只要系统检测到客户端返回的思考块与当初的系统提示/工具/历史有任何不一致,就匹配失败、直接拒绝服务;
- 对需要改上下文的合法开发者,提供「非严格模式」——请求可过,但受影响思考块会被直接删除,模型失去那段推理「记忆」。
这一刀,砍向的是过去两年行业最心照不宣的灰色地带:用小模型背下大模型的「答题思路」,就能以极低成本获得接近的性能。
六、争议与业界反应
这场「蒸馏」风波,远不止技术层面:
- 马斯克的吐槽流传最广:「怎么有人偷 Anthropic 从人类程序员(盗版书)那里偷来的东西?」——指向 Anthropic 自身 2025 年因用盗版书训练模型支付约 15 亿美元和解金。
- 官方立场(如《求是网》评述):蒸馏本是中性通用技术,美国借「对抗性蒸馏」「工业级蒸馏」等表述把它政治化、安全化,本质是 AI 竞争焦虑的反映。
- 专家判断(Sara Hooker 等):蒸馏对「AI 下一个时代」的重要性会下降——智能体系统训练远比聊天机器人复杂,想靠简单蒸馏复刻要困难得多。
- 法律层面:蒸馏多属服务协议违约而非明确违法;且 Anthropic 多靠 API 调用行为推断(异常账号 + 共享系统提示词模式),证据链难以真正确证。有评论认为这份报告更像「开价」,而非定论——走向取决于有没有公司拿出反证或诉诸法律。
七、一点思考
抛开这波舆论交锋,蒸馏之争的本质其实很坦白:
前沿模型的领先优势,正越来越依赖「不会轻易被复制的部分」。
过去,模型能力的护城河是参数、数据、算力;而当思维链这种「高质量解题数据」可以被打包带走时,护城河就出现了裂缝。这也是为什么各大厂都在拼命藏思维链、收紧 API——它们要捍卫的不只是技术,更是建立在技术领先之上的时间窗口。
Anthropic 的估算是:如果阻止这些行为,美国或许能锁定 12 至 24 个月的领先优势。
但对读者来说,比「谁对谁错」更值得记住的也许是:在 AI 竞争里,最值钱的已经不只是「答案」,而是「怎么想到答案」的过程。
参考资料
- Anthropic 威胁情报报告(2026-09,共 154 页)
- CISA 公告 AA26-251A
- TechCrunch / BBC / CNBC / The Guardian 相关报道
- FreeBuf / 51CTO / 晚点 LatePost 二手深度解读