scripts and commands

美方点名六家中国 AI 蒸馏:$5.6M 成本叙事被改写

2026/09/13 20:16


9 月 8 日,FBI、NSA、CISA 联合发布 AA26-251A,点名 DeepSeek、Moonshot、阿里、MiniMax、StepFun、Z.AI 六家自 2024 年底起工业化蒸馏美国前沿模型,并称 DeepSeek 公开的 $5.6M 训练成本具有误导性。文件能核的部分和主张的部分要分开读;9 月 24 日习特会前,盯三个信号。

毛宁的星期三从一份她没看过的文件开始。9 月 9 日,外交部例行记者会,记者把美国联邦机构的新公告递到发言人面前。毛宁说,她还没看过这份报告,然后给出标准答案:中国 AI 发展是「高水平科技自立自强」的结果,美方应当加强合作,而非无端指责。

那份文件叫 AA26-251A,前一天由 FBI、NSA、CISA 三家机构联合发布。它点名六家中国 AI 公司:DeepSeek、Moonshot AI、阿里、MiniMax、StepFun、Z.AI。指控是「工业化规模的知识蒸馏」。时间跨度:2024 年底至今。规模:数十亿 token、数百万次请求。数据去向:训练自家模型。

文件还说,这些行动「很可能有中国政府知悉」,但没有声称中国情报机构参与。毛宁在记者会上还补了一句:各方应共同促进「开放、包容、有益、合乎伦理」的 AI 发展。

文件在网络上挂了五天,今天靠 Hacker News 重新刷屏。大多数转述把它压成一句话:美国官方证实中国 AI 是偷来的,DeepSeek 的便宜是装的。Forbes 的标题更直接:「美国点名六家中国 AI 公司蒸馏美国顶级模型」。这个读法方便,但丢掉的东西更多——谁偷了谁的什么能力,证据从哪来,为什么选在现在发。

我的判断是:这份文件同时是三样东西——一张可核的对账单、一份被偷方的叙事、一份峰会前的政策信号。混着读,它是一条口号;分开读,它给你一张表。全文最硬的一句是:「DeepSeek 公开引用的 $5.6M 训练成本具有误导性。」这句话落在特朗普与习近平 9 月 24 日会面的 12 天前,把中国 AI 产业最有说服力的叙事——便宜——划了一道问号。

六家公司蒸馏了什么,文件列得比任何报道都细

CISA 公告的正文里有一张表,六行,每行一家公司、一份蒸馏对象清单、一组能力域。第一行的 DeepSeek 最长:Claude Sonnet 3.7/4/4.5、Claude Opus 4.1、Gemini 2 与 2.5 Pro/Flash Preview、GPT-4/4o/Mini/Nano/5、Grok 3 Mini 与 Grok 4,全部用来训练 R1 和 V3。

公司 主要蒸馏对象 喂给了谁
DeepSeek Claude Sonnet 3.7/4/4.5、Opus 4.1、Gemini 2.5、GPT-4/4o/5、Grok 3 Mini/4 R1、V3
Moonshot AI Claude Fable 5、GPT-4o Kimi-K3、Kimi-K2
阿里巴巴 Claude-4、Claude Opus/Sonnet、GPT-5 Qwen 家族
MiniMax Claude Code、Claude Sonnet 4/Opus、Gemini 1/2.5 Pro/3 Pro M2
StepFun Claude Opus 4.1/4.5、Sonnet 4.5、Haiku 4.5、GPT-5 系 Step 4
Z.AI GPT-5.5、Claude Opus 4.8 未具名模型

表里有两条规律。第一,每家都优先偷 reasoning 和 agentic 能力——CoT 推理、工具调用、computer-use 开发、编码,这些能力比「知识」值钱。第二,Anthropic 的 Claude 系出现在五家公司的名单里,被点名频率最高。文件还记了一个细节:MiniMax 在新 Claude 模型发布 24 小时内就切换了蒸馏目标。实时盯着发布日历、提前备好基础设施,这是流水线作业。

能力域的粒度,文件给到了九项。DeepSeek 那一行列着:法律专项优化、API 规则任务、用 CoT 草稿写作、问答优化、教练/助手能力、功能创建优化、SFT 优化、agentic 能力、创意与职业写作优化。九项里,API 规则任务、用 CoT 草稿写作、功能创建优化、agentic 能力——四项直接指向 agent 工作流。

文件对「规模」给了具体参照:单域查询量以千到百万计,单次战役持续数天到数月。Moonshot 的数百万次请求瞄准 agentic reasoning、工具调用、编码与数据分析、computer-use agent 开发、计算机视觉——从文本蒸馏一路进化到「提取逻辑框架、工具交互和视觉处理」。蒸馏是门生意。

蒸馏的「货」不只有答案。文件专门写了一节 CoT 提取:DeepSeek 用提示词让模型「想象并逐条写出完成回答前的内部推理」,哪怕美国模型对普通用户隐藏推理过程。这批数据教会学生模型的,是「复杂 agentic 任务、编码挑战、逻辑证明的推理方法」。知识可以重训,推理方法是蒸馏的重点。这串能力域和过去一周的产业动向对得上:OpenAI 9 月 11 日刚把 Codex 的 harness 做成托管 API 公测,蒸馏方要的 agentic 能力,正从这些新接口里流出来。

证据来自被偷的一方,定性来自要管的一方

读这张表之前,先问证据从哪来。文件没有公布原始流量日志,也没有第三方取证。它依赖的是美国公司自己的遥测:订阅账户池、API 请求特征、跨提供商的路由痕迹。连「转移站」这条灰色产业链——以官方价的零头转售前沿模型访问权——都是从这些公司的账单和风控日志里拼出来的。证据链的起点,是美国公司的账单。

蒸馏在行业里是常见技术,就像抄作业在班级里也是常见行为——差别在抄的量、抄的方式、抄完还宣称自学成才。NBC 的原话更直白:蒸馏在 AI 行业里很普遍,普遍到「经常违反服务条款」。文件划的线是:违反使用条款、规模化、隐蔽化、绕地理限制。被指控的边界是违约加欺诈。「偷模型」是标题为了省事换的词。偷是形容词,违约是事实。

路由是蒸馏产业里最精细的部分。请求走原生 API、云供应商、第三方聚合器、第三方中继、厂商账户池五条路,聚合器会自动混淆元数据。封锁发生时,流量自动故障切换到另一条路。蒸馏方还自带质量评估框架,专门检测防御性对策——「微妙地改变响应」如果做得太明显,会被当场识别并绕开。绕开封锁的速度,就是蒸馏方的研发速度。

成本侧同样精细。蒸馏方批量采购美国公司的高级订阅,分摊给一整队开发者共用——文件建议「验证订阅用户身份」,堵的就是这条。账户池、转移站、聚合器,三级结构把「谁在提问」彻底打散。每一级都有专门的工程。

操作层面的剖面,文件给得比任何一篇报道都细。StepFun 用一批账户池,员工同时开多个会话,做负载分配防止配额耗尽;每个自动化 agent 的日预算从小额起步,随着运营成熟再放大。DeepSeek 的查询清单里还有「基于评分的批改任务」——它在提取美国模型评价回答质量的标准,也就是奖励模型的行为。蒸馏的不只是答案,还有裁判的标准。

文件把战术映射到 MITRE ATLAS 框架,从伪造账户一路写到数据外泄。这一层是行为描述,可核。再上一层,「很可能有中国政府知悉」——这是推断,文件自己用了 likely 这个词。再上一层,「威胁美国技术领导地位」——这是主张,写给政策制定者看。三层要分开读,读法不同,结论不同。

中国那边有自己的版本。7 月底,中方公开反指美国公司蒸馏中国模型,The Register 报道过。两边用同一个词指控对方,谁都没有公布可复现的取证报告。这份文件的价值因此落在最低的那层:它把「谁、从什么时候、拿走了什么」写成了一份可查的清单。清单是新的,指控本身两边都熟。

$5.6M 那句话,改写 DeepSeek 的便宜叙事

先把全文最重的那句放出来:DeepSeek 公开引用的 $5.6M 训练成本「具有误导性」,没算进恶意蒸馏拿到的数据成本。这个数字是 2025 年初 DeepSeek R1 发布时最出圈的卖点。560 万美元,训练出接近前沿的模型。全球算力过剩的讨论都围着它转。The Register 在报道里提醒:当时投资者恐慌,是因为担心砸进去的数十亿美元可能不需要了。

文件说那个数字不算数,理由是口径问题:账本上只记了算力,没记数据。数据是蒸馏来的,成本被转移到了美国公司的账单上——订阅池、转移站、聚合器的费用,最后都算进 Anthropic 和 OpenAI 的营收。按这个口径,DeepSeek 的「便宜」是补贴出来的。补贴方是它蒸馏的那些美国公司。

文件还给了一个结论句:靠工业蒸馏的中国公司,「训练前沿模型的时间线显著缩短、财务支出显著降低」。这句话的潜台词比 $5.6M 更大:如果蒸馏被掐断,整个「中国模型又快又便宜」的时间线都要重新算。过去两年,产业把「效率革命」和「成本革命」讲成同一件事。文件的说法是:省下的训练预算,被转移到了别家公司的账单上。

发布时间也值得对一下。CISA 文件 9 月 8 日发布,DeepSeek 9 月 14 日就要把 Pro 档流量全部路由到 V4.1 Flash 按新价计费。一周之内,官方文件说你的成本叙事不可信,你自己的发布说新模型全面超过 Pro。两条新闻撞在同一条叙事线上。

这对选型的人意味着什么。「便宜」要拆开问:便宜在算力,还是便宜在数据。一家厂商的训练数据里若混着大量别家前沿模型的输出,它的成本优势就带着别人的账。用它的模型做生产,你继承的除了便宜,还有它的合规风险。

开源生态是这一节里最微妙的部分。The Register 点了一句:Qwen 的一些模型质量很高,而且免费可下载——直接挑战靠收费还巨亏的美国公司。蒸馏指控落在开源模型头上时,社区的反应会分裂:一部分人看到「偷」,一部分人看到「免费的前沿能力」。文件替他们做了选择,但「合法蒸馏」和「恶意蒸馏」的分界画在使用条款上。条款是单方面写的。

这份文件还给了中国叙事一个两难。毛宁说「自立自强」,文件说「核心是蒸馏」。两个说法只能活一个。文件若属实,自立自强的叙事要重写;文件若夸大,美国公司的防御叙事要打折。双方都有动力拿出证据,也都有理由只喊口号。

转移站经济顺便解释了文件里那条最具体的建议:验证订阅用户身份,对疑似蒸馏请求「微妙地改变响应」。美国公司没打算关掉 API,是要让蒸馏流量的收益变薄。新账户注册后立即满负荷跑量,就是文件点名的可疑指标。

对跑 API 中转的开发者,这条同样适用。你买到的「便宜 key」,可能就来自被指控的账户池。随时会被封,账单也对不上。攻防已经落到产品层面。

蒸馏指控早就有,9 月 8 日升格成联邦文件

蒸馏指控有一条完整的时间线。2025 年初,OpenAI 说 DeepSeek「不当」使用 ChatGPT 数据。2026 年 2 月,Google 称自己的模型遭遇了 10 万次克隆尝试——这个数字来自 Google 声明,NBC 转述,没有独立核过。4 月,白宫科技政策办公室主任 Michael Kratsios 给联邦机构发备忘录,把中国蒸馏美国模型列为关键问题。7 月,白宫高官公开声称 Kimi K3 是从 Anthropic 的 Fable 模型蒸馏出来的,Kratsios 在 X 上点了名,The Register 当天跟进。

Kratsios 那条帖子里有一句官方口径的分界:「合法的蒸馏——用来做更小、更高效的模型——对开放创新生态至关重要;大规模、隐蔽的工业蒸馏,意在窃取专有技术、破坏美国研究,不可接受。」9 月 8 日的文件把这个分界从个人表态升格成三家机构的联合立场。备忘录里还有一层:蒸馏让中国公司「搭美国创新的便车,绕过美国系统内置的安全护栏」。这个角度把蒸馏从商业纠纷抬进安全议题。

文件开头先给了一个免责式的定义:「蒸馏在 AI 研究里是公认的合法且有用的技术」,紧接着才说中国公司「在以工业规模进行攻击性、恶意的、定向的蒸馏」。先立边界再指控,是官方文件的写法。边界立在哪,决定了后面所有缓解建议的方向。

升级还体现在写法上。文件从公司互喷变成六家公司的对账单,从声明变成带战术映射和缓解建议的操作手册。文件的原话更狠:「这些战役的规模和复杂程度表明,蒸馏是它们模型开发的核心,而非补充。」它给企业开了一串作业:跨提供商关联可疑行为、共享情报、给疑似蒸馏请求降质。前几轮指控是公关战,这一轮是安全运营指南。

文件没写的东西和写了的一样重要。没有具体金额,没有对「蒸馏数据占训练集多少比例」的量化,没有受害者公司之外的独立取证,也没有任何一家被点名公司的回应。指控的烈度和证据的粒度之间存在落差,这份落差就是争论继续的空间。

升级的时点同样值得看。9 月 24 日,特朗普和习近平要见面,NBC 把两件事写进了同一段。文件落在峰会前 12 天,措辞又是「很可能有中国政府知悉」。它同时是安全公告,也是给会面准备的谈判素材。中国外交部 9 月 9 日的回应是「无端指责」,两边各说各话。

9 月 24 日之前,盯三个信号

第一个信号:文件会不会变成动作。advisory 本身没有制裁、没有实体清单、没有执法行动,只有建议。峰会前后若出现出口管制或针对具体公司的执法动作,文件就是前奏;若什么都没有,它的政策权重低于预期。

第二个信号:DeepSeek 和阿里会不会正面回应。毛宁说「没看过」,文件点名的却是公司。DeepSeek 手上有 V4.1 Flash 的发布节奏,9 月 14 日就要把 Pro 档流量全部路由到 Flash 按新价计费——「便宜加更强」的叙事正被联邦文件划问号。它的回应口径,是沉默、否认,还是拿出可核的训练数据来源,本身就是信号。

第三个信号:你自己的 API 流量长什么样。跑 agent 产品的人,可以拿文件里的可疑模式对照自己的日志。新账户满负荷,多提供商路由,高频逼模型吐 CoT 的提示词——三条对照。

三条全中,你的流量特征就和文件描述的可疑模式重合了。文件给美国公司的检查清单——验证订阅用户、跨提供商关联、对可疑请求降质——你换到供应商视角也能用。合规线只认两样东西:你的账单,和你的日志经不经得起对账。

还有一层要摆出来:这份文件也可能是姿态。advisory 不需要证据标准,措辞全是 likely 和 alleged,发布方与被指控方存在直接利益关系,时点又卡在峰会前。姿态和硬证据的区别,可以用两条标准当场验证。

这个判断的作废条件有两条。其一,OpenAI 或 Anthropic 若发布可独立复现的取证报告——带原始流量样本、经第三方复核——「证据是利益相关方叙事」这一层作废,文件升级为硬证据。其二,9 月 24 日峰会后美方若没有任何管制或执法动作,「政策信号」这一层作废,姿态读法占上风。两条都没发生之前,把它当一张可核的对账单读,别当判决书。