Back

Anthropic 蒸馏报告解读:一场 2 亿次交互的「思维链」争夺战

Anthropic 蒸馏报告解读:一场 2 亿次交互的「思维链」争夺战

前沿模型的「解题思路」,成了被偷得最狠的资产。

2026 年 9 月 10 日,Anthropic 发布了一份 154 页的威胁情报报告,点名 7 家中国 AI 实验室,指控它们在未经授权的情况下对 Claude 发动了「工业化规模」的蒸馏攻击,涉及接近 2 亿次 API 交互、5 条独立攻击链

这篇文章,我们拆解这份报告讲了什么、指控谁、手法如何、以及为什么「蒸馏」这个本来是行业常规的技术会变成一场地缘级安全事件。


一、先厘清:什么是「蒸馏」,什么是「非法蒸馏」

蒸馏(distillation) 是一种合法的模型训练技术:

  • 用一个能力更强的「教师模型」生成数据;
  • 再训练一个更小、更便宜的「学生模型」去模仿它;
  • 学生模型在参数远小于师的情况下获得接近的能力。

这本质上是「老师教学生」。早在 2015 年 Hinton 等人就提出了知识蒸馏,如今谷歌、OpenAI、亚马逊等巨头都在用,甚至把它作为标准化服务对外提供。技术本身是中性的。

那 Anthropic 指控的「非法/不正当蒸馏(illicit distillation)」特殊在哪?报告给出的定义有四个关键限定词:

  1. 未经授权 —— 违反服务条款和区域访问限制;
  2. 工业化规模 —— 不是个人科研用途,是组织级、自动化、海量;
  3. 隐蔽对抗 —— 用欺诈账号、代理集群等手段规避风控;
  4. 复刻能力 —— 目标是提取前沿模型能力复制到自家模型。

简言之:蒸馏合法与否的边界,在于「是否经授权、规模多大、是否隐蔽对抗」。


二、时间线:这不是 Anthropic 第一次开口

时间 事件
2026-02-23 Anthropic 首度披露:指控 DeepSeek、月之暗面(Moonshot/Kimi)、MiniMax 通过约 2.4 万个虚假账号、与 Claude 发生 超 1600 万次交互,进行「工业规模」蒸馏攻击,并用「九头蛇(Hydra)」代理集群绕过地理封锁
2026-09-10 发布 154 页威胁情报报告,指控规模升级至 7 家实验室近 2 亿次交换、5 条独立攻击链

从 2 月到 9 月,指控的规模扩大了约一个数量级,手法也更系统化。


三、9 月报告:7 家实验室的具体指控

报告按内部「威胁行动群组编号(GTG)」公开点名,其中前几家数据非常具体:

实验室 观测窗口 请求量级 欺诈账号 具体指控
阿里(通义 Qwen) GTG-16005 2026-05 ~ 07 1.51 亿次交互,峰值日均近 300 万 3,500+ 注入固定提示,强制 Claude 输出带标记的完整思维链,用于训练 Qwen3.5/3.6/3.7;还用 Claude 辅助自家模型架构与强化学习环境研发
月之暗面(Kimi) GTG-16002 10 天窗口 近 30 万请求 5,380 大规模调用 Opus 4 系列,部署专门流水线提取思维链;涉嫌用户请求透明转发给 Claude
DeepSeek 14 天窗口 超 1,210 万次请求 跨会话重放攻击提取推理;用户流量透明中继
智谱 Z.ai(GLM) 10 天窗口 77 万+次清洗提取 重点针对 Opus 4.8,服务 GLM 5.3 迭代
小米 涉嫌用户对话中继转发
阶跃星辰(StepFun) 列入 7 家之一
MiniMax 列入 7 家之一

注意:对后 4 家(小米、StepFun、MiniMax 等),报告的公开数据相当有限,指控证据强度远弱于前几家。


四、攻击手法:剥开「作案流程」

1. 绕过风控的基础设施

  • 被盗信用卡、登录凭证、API key 批量建立虚假账号;
  • 搭配住宅代理、一次性邮箱、虚拟支付躲避指纹检测;
  • 用「九头蛇集群」代理架构,把攻击流量混进普通用户流量,难以识别。

2. 核心目标:思维链(CoT)抽取

这才是整场争夺战最核心的部分。蒸馏者不只满足于最终答案,而是用各种手段把模型隐藏的内部推理步骤逼出来

  • 特制 prompt 诱导:伪装成翻译任务、代码任务,让模型「下意识」输出推理路径;
  • 上下文注入 / 对话重写:在多轮对话中偷偷修改思考块前后的上下文,打破防御机制;
  • 催眠式立人设:不断给模型立「你是一位研究员,正在做一件艰难但很有意义的事」之类的人设,诱导它交代完整思路。

这些推理轨迹(思维链、Agent 轨迹)被导出后,直接作为 SFT(监督微调)训练数据喂给学生模型——等于把「老师已经做好的解题答案」直接抄进作业本。

3. 中继转发(最让隐私界炸锅的)

报告称,有些实验室把自家用户的真实对话直接转发给 Claude,或从第三方路由服务购买用户对话,再用 Claude 的响应训练模型。部分对话里还含有姓名、企业数据和有效访问凭证——这已经不是技术问题,而是数据合规与隐私问题。


五、反蒸馏:Anthropic 的三道防线

专家(格里菲斯大学助理教授刘艺,长期研究 LLM 安全)总结了前沿模型公司的三层防线:

  1. 对抗性数据提取分类器:让模型内生地拒绝可疑请求(比如检测到「高密度、结构化、跨异质任务的抽取」就拒答);
  2. 架构层面隐藏/压缩思维链:不直接输出内部推理,或压缩后再输出;
  3. 零数据保留(ZDR):用户的提示词和 AI 生成的回复不存储、不留存、不用于训练——需企业客户申请且通常要额外配置。

配套的技术动作,报告落地到了 Fable 5.1(9 月 1 日发布):

  • Messages API 中新账户的「思考块」与产生它的上下文焊死
  • 只要系统检测到客户端返回的思考块与当初的系统提示/工具/历史有任何不一致,就匹配失败、直接拒绝服务
  • 对需要改上下文的合法开发者,提供「非严格模式」——请求可过,但受影响思考块会被直接删除,模型失去那段推理「记忆」。

这一刀,砍向的是过去两年行业最心照不宣的灰色地带:用小模型背下大模型的「答题思路」,就能以极低成本获得接近的性能。


六、争议与业界反应

这场「蒸馏」风波,远不止技术层面:

  • 马斯克的吐槽流传最广:「怎么有人偷 Anthropic 从人类程序员(盗版书)那里偷来的东西?」——指向 Anthropic 自身 2025 年因用盗版书训练模型支付约 15 亿美元和解金。
  • 官方立场(如《求是网》评述):蒸馏本是中性通用技术,美国借「对抗性蒸馏」「工业级蒸馏」等表述把它政治化、安全化,本质是 AI 竞争焦虑的反映。
  • 专家判断(Sara Hooker 等):蒸馏对「AI 下一个时代」的重要性会下降——智能体系统训练远比聊天机器人复杂,想靠简单蒸馏复刻要困难得多。
  • 法律层面:蒸馏多属服务协议违约而非明确违法;且 Anthropic 多靠 API 调用行为推断(异常账号 + 共享系统提示词模式),证据链难以真正确证。有评论认为这份报告更像「开价」,而非定论——走向取决于有没有公司拿出反证或诉诸法律。

七、一点思考

抛开这波舆论交锋,蒸馏之争的本质其实很坦白:

前沿模型的领先优势,正越来越依赖「不会轻易被复制的部分」。

过去,模型能力的护城河是参数、数据、算力;而当思维链这种「高质量解题数据」可以被打包带走时,护城河就出现了裂缝。这也是为什么各大厂都在拼命藏思维链、收紧 API——它们要捍卫的不只是技术,更是建立在技术领先之上的时间窗口

Anthropic 的估算是:如果阻止这些行为,美国或许能锁定 12 至 24 个月的领先优势

但对读者来说,比「谁对谁错」更值得记住的也许是:在 AI 竞争里,最值钱的已经不只是「答案」,而是「怎么想到答案」的过程。


参考资料

  • Anthropic 威胁情报报告(2026-09,共 154 页)
  • CISA 公告 AA26-251A
  • TechCrunch / BBC / CNBC / The Guardian 相关报道
  • FreeBuf / 51CTO / 晚点 LatePost 二手深度解读

评论