scripts and commands

chatbot 看错一张货单,美军差点登上一艘中国船

2026/09/19 08:12

春季,一名美军分析员让聊天机器人分析一艘中国船只的货单,机器人把货物认成核武组件;分析员又用 AI 把结论包装成标准情报报告。飞机升空、准备登船,最后一刻深挖才发现报告完全虚假。CNN 独家、四个消息源,军方没有统一验证标准。读完带走三个现场问题。

春季,夏威夷,美国特种作战司令部太平洋分部,一名分析员把一份货单交给聊天机器人。货单来自一艘中东水域的中国船只,原始情报由司令部自己采集。机器人把开源情报与政府手里的机密信号情报揉在一起,给出结论:船上运的是核武器计划组件。分析员没有在这一步卡住。他把货单贴进对话框,等了几秒钟,拿到一份看起来有出处的答案。

他接着让 AI 把结论写成标准情报报告——指挥官们信任的那种格式——然后发了出去。报告沿指挥链上行,命令下行:拦截这艘船。武装人员开始准备登船,军用飞机升空。整件事从一份货单到一道拦截令,中间隔着的就是分析员两次敲击键盘。

行动开始前,官员们深挖了一轮,才发现报告由 AI 辅助生成,聊天机器人把船上的货物认错了。CNN 在 9 月 18 日的独家报道中引四个消息源,给这份报告的定性原话是「entirely false」,连带一句「almost started a war」。CNN 没能查出被误认的货物到底是什么,跟进报道也没有给出答案。

新闻标题读起来是「AI 幻觉差点引发战争」。事件本身落到三个缺口上:报告被 AI 写了两次,第一次编出结论,第二次把结论包装成权威格式;军方没有一套统一验证 AI 生成信息的标准;报告没有让接收方一眼看出 AI 参与,官员们要深挖才发现。五角大楼 1 月刚把前沿模型发到 300 万军民人员手里,验证标准没有跟着发。

AI 把这份报告写了两次,第二次最致命

第一次工作发生在分析员提问的那一刻。货单情报来自 SOCPAC,机器人把它和开源情报、机密信号情报融合,推断出核武组件。幻觉的机制并不新鲜:训练数据里没有足够上下文时,模型就编一个最像样的答案。2023 年剑桥词典把 hallucinate 选为年度词,那一年这类事故已经多到需要一个词来装。

后续研究也不乐观。Nature 刊出的综述认为,想让模型完全不产生幻觉,目前看不到可靠办法;苹果内部测试过「不许幻觉」提示词,效果有限。模型层面的防线,到今天为止没有一条是硬的。公众对幻觉的认知停留在「聊天机器人说错话」,军方的部署也把幻觉当演示事故处理。这次事故把幻觉放进了一条会下达登船命令的决策链。

还有一层细节值得注意:这次融合跨越了密级。开源情报与机密信号情报在同一轮问答里被揉在一起,结论看起来既有公开来源又有秘密来源,显得比单靠任何一边都扎实。跨密级融合让「有来源」变成了「有背书」,而 bot 并不会区分这两件事。

还有一层机制让错误一路绿灯:责任分散。分析员把 bot 输出当初稿,核对留给下游;下游默认上游已经核过;每个环节的人都以为核实在别处。bot 是第一个写字的,也是唯一一个没人要求它负责的。格式越标准,这条责任链越顺滑。

第二次工作决定了一切。分析员让 AI 把结论整理成标准报告格式——CNN 引述的原话是 the kind that is trusted by military officials。标准格式触发接收方的信任默认值:收到它,默认它经过核查。这份格式让错误穿过了指挥链,从分析员桌面一路走到登船命令。

若按收到即信的逻辑,这份报告从生成到分发,没有一个环节会拦住它。错误能过检,靠的是包装,内容反而没人看。

那位分析员用的工具是商业产品还是政府自建,CNN 没有查清。一名前高级官员给了一句概括:「内部工具大多只是涂了口红的商业货」。工具来源混杂,验证标准也混杂。报道扩散的速度倒是很快:Ars Technica 与 TechCrunch 当晚跟进,Google News 上聚合了三十多家转载。「差点开战」的标题人人都在传,被误认的货物是什么,没人传得出来。

拦截行动已经启动,拦下它的是最后一刻的深挖

报告分发,计划形成,武装人员准备登船,飞机升空,行动前深挖,发现 AI 生成,行动取消。整条链里只有一步是人主动停下来怀疑的,就是「深挖」那一下。没有自动拦截,没有格式校验,报告里也没有「AI 生成」的标记可以触发任何检查。官员们发现真相,靠的是行动前最后一轮手动核查。核查的对象是报告本身,核查的动机来自谨慎,跟流程无关。

「almost started a war」是消息源的原话。美国在中东拦截一艘中国船只,任何走火都可能升级成两个核大国之间的直接冲突。当时正值美国与伊朗的战争,目标选择领域本来就在加码:一名熟悉军方政策的消息源对 CNN 说,AI 用于目标选择正在加速,人如何在回路里防止平民伤亡和误伤,没有成文指导。这次差点出事的环节是情报,同一套压力也在推着目标选择往前走。

历史上有更著名的同类时刻。1983 年苏联早期预警系统误报美国发射洲际导弹,值班军官斯坦尼斯拉夫·彼得罗夫凭人工判断压下警报,没有上报。那一次人主动怀疑,这一次人也主动怀疑。但这一次怀疑发生在飞机升空之后、登船之前,窗口比 1983 年窄得多。彼得罗夫当年在几分钟里做决定;这一次,距离登船行动只有一步。

报道没有写深挖查了什么,只写发生在计划行动之前。能确认的是:拦下它的是一次手动多疑,来自行动之前,来自链条里有人愿意停下来。链条里的其他环节,从生成到分发到形成命令,一路顺畅。

消息源还点了一件事:年轻分析员是这些工具的原住民,更可能不加批判地信任输出。情报界的压力结构也变了——AI 让分析员更快地产出、更快地分发。一名消息源的原话是:「AI 让你更快到达一个坏主意」。速度越快,深挖的机会越少,这是这次事故和彼得罗夫那次之间的结构性差别。TechCrunch 采访的前陆军军官 Jake Steckler 说得更直接:军人必须理解 LLM 的不确定性,「把采用速度放在一切之上,只会导致让军人失去对这些系统信任的事故,最终反而拖慢采用」。

事故之后问责谁,CNN 的报道里没有答案。五角大楼和特种作战司令部太平洋分部都没有回应置评请求。分析员用错了工具还是流程缺了环节,供应商该负什么责任,这些问题在「差点开战」的标题下面,暂时没有下文。

五角大楼把模型发到三百万人手里,验证标准没跟上

1 月,国防部长 Pete Hegseth 发布「AI 加速战略」(Artificial Intelligence Acceleration Strategy),官方备忘录里的目标写得很直白:把美国最前沿的模型直接交到 300 万军民人员手里,覆盖所有密级。战略还要求「让整个部门的 AI 实验与转型民主化」,让所有合适的数据进入联邦 IT 系统供 AI 使用,涵盖各军种的任务系统。Hegseth 的解释是「AI 的好坏取决于喂给它的数据」,战略的名字里带着「加速」两个字。

这不是纸上战略。去年 12 月国防部宣布用 Google 的 Gemini for Government 做自建平台 GenAI.mil 的底座,今年 8 月又把 Grok for Government 加进选项;Anthropic 早在 2025 年 6 月就为美国情报工作提供定制版 Claude。多供应商、多工具、多密级,同时铺开。6 月,五角大楼官员向国会作证,说 150 万现役人员已经用过军方的生成式 AI 工具,还拿它写国会要求的报告。从宣布到 150 万人上手,用了不到一年。

CNN 引多个官员的话说,这套部署是分散的:不同部门用不同工具,在不同命令和安全标准下运行,没有一套统一验证 AI 生成信息的标准。150 万人在用,300 万人是目标,验证标准是零。采用速度远远跑在治理前面,这次事故就是两者之间的落差第一次现形。密级环境让缺口更深:模型直接接触机密数据,输出混着机密与编造,验证标准的缺失在情报界比在商业界贵一个数量级。

这套工具矩阵本身还在制造新的混用风险:同一个 GenAI.mil 平台里,Gemini、Grok、Claude 并排供选择,训练数据、安全边界各不相同。分析员今天用这家、明天用那家,验证标准却只有一句模糊的「谨慎使用」。多工具加零标准,等于把判断责任全部压回个人。

战略、战争、事故挤在同一段时间里。1 月发布加速战略,伊朗战争进行到春季,同一窗口里出了这起事故。战时情报量暴涨,分析员加班加点,AI 从「提效工具」变成「唯一来得及的工具」。验证标准在这种节奏里最先被牺牲。

2023 年国务院发布《负责任军事使用人工智能宣言》,要求 human in the loop、负责任的指挥链。三年后,人工环节还在,但这次轮到它上场时,飞机已经升空。更远处还有一条线:2026 年 6 月,乌克兰在实战中使用了全自主攻击无人机。人不在回路里的武器已经在战场出现;人还在回路里的流程,刚刚差点出事。

幻觉在律师、记者、医生那里都发生过,这次进了军事情报

AI 幻觉进专业报告,早有长长的前科清单。2023 年 5 月,纽约律师用 ChatGPT 找判例,提交了六个不存在的案子,法官差点引用进判决书。simonw 在 HN 讨论里说,他当时以为这件事会成为所有律师的警告,结果没有。之后是芝加哥太阳时报印出 AI 编的假书单,arXiv 封禁制造幻觉论文的投稿者,安大略审计发现医生的 AI 记录工具在编造内容,英国警察用 Copilot 起草禁赛令写进幻觉,Cursor 的客服机器人编出公司不存在的政策。非虚构作者的书里也出现过 AI 合成的引文。

每一桩的共同点:专业人员把 AI 输出直接放进自己的专业格式,格式替错误打了掩护。律师的报告、报纸的书单、医生的病历、警察的禁令、客服的回复,格式越标准,错误越难被一眼看出。幻觉本身是统计必然,把幻觉装进权威格式才是人为决定——这个决定每次都是人做的。商业界的幻觉可以事后补救,退款、撤稿、更正都来得及;军事决策没有撤销键,错误一旦执行就落地为伤亡。

专业格式之所以有效,因为它本来就是接收方处理信息时的第一道默认。法官收到带引注的备忘录,默认引注存在;指挥官收到标准格式的情报报告,默认内容经过核查。默认滤掉了大部分噪音,也滤掉了怀疑。这次事故里,怀疑是在默认之后、行动之前,由几个人手动捡回来的。

情报界的版本更贵。一名消息源对 CNN 说,这类幻觉在情报界「并非孤立事件」。HN 上有人拿伊拉克战争对比:当年的「情报」是人有意造出来的,为了给行动找理由;现在工具自动量产假结论,成本趋近于零,格式还更标准。造假成本从「需要一批人合谋」降到「需要一个人提问」,可信度从「需要层层背书」升到「标准格式即背书」。这两个变化叠加的位置,就是这次事故发生的位置。

同样的幻觉,在商业界是一张退单,在情报界是一道登船命令。代价的差距不在模型,在错误抵达的地方。

格式给错误发了一张通行证。通行证的发放与内容真假无关,只看包装是否标准。这条规律从法庭、报纸、诊室一路成立,这次搬进了军事情报——搬进了一个错误可能以导弹落地收场的地方。

盯住三件事:谁标注、谁验证、能不能追溯

谁标注。报告从头到尾没有一个「AI 参与」的标记,官员要靠深挖才能发现。标注的成本极低——一行字、一个水印、一个 provenance 字段——但这次事故里它完全缺席。

没有标注,接收方就按人工情报的标准对待它,包括它的可信度。分析员被要求更快产出,标注被当成拖慢速度的负担。省下的那点时间,差点用一场拦截行动还回去。

标注缺席还有一层动机:标注等于承认报告是 AI 写的,会压低报告的权威性,分析员没有动力主动加;接收方没有要求,链条上就没有人生成这个字段。学术界已经在这条路上:arXiv 要求投稿者声明 AI 使用,违规者会被封禁。情报界连这个最低配都没有。

谁验证。机器人融合的原始数据——货单、开源情报、机密信号情报——谁核过?CNN 连被误认的货物都没能查出,说明追溯在源头就断了一环。验证标准缺失的后果:错误不仅被生产出来,还被当作已核事实进入决策。货单上到底装了什么,至今没有答案,这条链上的所有人都基于一个没人复核的结论做动作。验证的抓手也具体:回到原始数据,逐条对来源,bot 的融合结论只当线索,不当结论。

能不能追溯。错误能不能回到生成它的那次会话?做到这一点需要三样东西:会话日志、模型版本、输入快照。那次提问的完整上下文、当时跑的是哪个模型、喂进去的货单和情报原文是什么,三样齐全,错误就能定位;缺一样,追溯就变成猜。军方没有统一标准,这次靠的是人肉深挖,下一次可能没有下一次。

产业界已经在把可追溯做成产品特性。OpenAI 9 月 17 日发布 misalignment 披露框架,要求事故可归因;Meta Muse 把凭证和模型隔开,让越权可审计;西班牙数据保护局 9 月登记了第一起由 AI agent 执行的泄露事故。监管端和产品端在往同一个方向走。军方这次事故把同一需求推到了采购层面——面向军方的 AI 供应商,标注和追溯会从加分项变成准入门槛。

三个问题对应三个可以写进制度的动作:报告模板里加一行「AI 参与声明」栏,必填;原始数据核验要求签名,bot 的融合结论只当线索;会话日志与模型版本保留策略写进采购合同。三个动作都不需要新技术,需要的是把「标注、验证、追溯」从口号变成流程里的字段。

这三个问题也适用于任何用 AI 写报告的组织。你的分析员、法务、投研同事,正在用 chatbot 写周报、尽调、评估。格式越标准,越要问。

下一次有人把一份 AI 参与的分析材料放到你桌上,当场问一句:哪部分是 AI 写的?原始数据谁核过?错了能不能追溯到那次会话?问得出,流程还在;问不出,整个组织在赌。