scripts and commands

123 名儿童死于 7 年没更新的卫星图:美军 kill chain 被压缩之后

2026/09/23 20:10

2 月 28 日两枚 Tomahawk 击中伊朗 Minab 小学,至少 123 名儿童死亡。Pentagon 内部调查(Bloomberg 9/18 披露)把事故定性为「可预防的失败链」:7 年没更新的卫星图、2017 年就建好的围墙,加上把数小时目标确认压成几分钟的 Palantir Maven。3 月官方口径还是「人类责任、非 AI」,9 月调查翻转,9/22 美军已改流程。

2026 年 2 月 28 日,美伊战争开战首日,两枚 Tomahawk 导弹落在伊朗南部 Minab 镇的 Shajarah Tayyebeh 小学。至少 123 名儿童死亡,总死亡人数超过 150(PressTV 口径为 168)。事发当晚,美军就知道打错了目标。

半年后的 9 月 18 日,Bloomberg 发布深度调查《Inside the US 'Kill Chain' That Destroyed an Iranian School》,引述参与 Pentagon 内部审查的匿名官员:这是一串「可预防的失败」(cascade of preventable failures),由三块拼成——错误情报、7 年没更新的卫星图、对 Palantir 公司 Maven Smart System 的过度依赖。Maven 是 Palantir 开发的 AI 数据整合与目标选择平台,过去一年被国防部当作军事行动的基石。

口径在半年里翻了个个。3 月,Semafor 引信源发独家报道《Humans — not AI — are to blame》,The Guardian 跟进《AI got the blame. The truth is far more worrying》,Lawfare 4 月直接下结论《Blame the Pentagon, Not AI》。9 月,同一场事故的调查结论把「AI 过度依赖」写进因果链。两边媒体都忙着站队,谁该背锅吵了半年。特朗普 3 月对记者说「那是伊朗干的」,说伊朗「打不准」;后来在 Fox 采访里改口,说「我不认为有人能说清那里发生了什么」。白宫始终没有公开认责,只有一名高级官员对 Bloomberg 说了一句「美国不针对平民」。

口水战遮住了一件可核的事:目标确认这个环节,从多个工种协作数小时,变成了一个系统几分钟。压缩掉的那几个小时里原本站着一排人——情报分析师、影像专家、目标员、律师、作战指挥官、发射组。他们消失之后,7 年前的卫星图照样进管道,2019 年有人记下的备注到不了决策者桌上。这篇文章把这条链拆开,看 AI 到底拿走了什么,留下了什么。事故已经过去半年,Pentagon 的完整调查结论至今没有公开发布,但参与审查的官员对 Bloomberg 说的细节,已经足够拼出这条链的样子。

这一周是这条新闻的高点:9 月 17 日 UN 调查团报告落地,9 月 18 日 Bloomberg 长篇调查上线,9 月 22 日 Bloomberg 跟进报道美军已经修改 AI 目标选择流程。三件事叠在五天里,把一场半年前的事故重新顶回公共视野。HN 上 Bloomberg 调查的帖子拿到 697 分,77 条评论——这个数字在技术社区说明一件事:做系统的人从这场军事事故里看到了自己项目的影子。

3 月说人类责任,9 月说 AI 过度依赖——口径翻转本身就是新闻

3 月的叙事有当时的证据。Semafor 3 月 18 日引两名知情人士说,责任在人不在机器:目标清单是人定的,发射命令是人签的,AI 只是辅助工具。The Guardian 3 月 26 日的评论更进一步,说把锅甩给 AI 反而掩盖了更糟的事实——人类指挥官在明知情报不足的情况下照样按下发射键。Lawfare 4 月 23 日的标题把这个立场钉死:要怪就怪 Pentagon,别怪 AI。三家媒体口径一致,当时没有第二份调查能反驳,这个叙事站了快半年。回头看,这三家说的都没错,但都只看到链条的一段。

9 月 18 日 Bloomberg 的报道把这块石头翻了过来。参与 Pentagon 内部审查的官员说,Maven 把 Minab 场址列为「首日主目标」(primary day-one target)。该场址多年前被数据库分类为 IRGC(伊斯兰革命卫队)海军设施,这个错误分类被原样喂进 Maven,系统按既定流程把它排进打击清单。官员还透露,部分 CENTCOM 人员「期望 Maven 会标出过时记录或矛盾」,但系统没有这么做,调查人员也不清楚这些使用者为什么认为系统会主动纠错。Bloomberg 报道的潜台词是:Maven 的设计目标是把情报分析加速,它没有义务、也没有机制去怀疑输入数据的年份。

这不是翻案。调查同时点名的还有人类环节:数据库多年不升级分类、分析师的备注没进主库、战时时间表被压缩。Pentagon 调查的完整报告「已基本完成数月」,但 Pentagon 拒绝公开,只说事件仍在审查中;CENTCOM 把涉事人员的访谈记录「锁住」,只有少数军官能看。120 多名众议院民主党人 3 月致信国防部长 Hegseth 询问 Maven 的作用,至今没有公开答复。联合国独立事实调查团(OHCHR FFMI)9 月 17 日发布报告(A/HRC/63/61),认定有合理理由相信美国犯下战争罪——攻击「超出单纯疏忽」,美国「未能尽到一切可行措施核实」学校是军事目标。Pentagon 对 UN 报告拒绝置评。

Palantir 的回应把球踢回政府:公司「不负责底层数据,也不负责识别情报缺陷」,没有证据表明软件出错;政府保留对喂给 Maven 的信息质量的主要责任。事故后 Palantir 给 Maven 加了新功能——重新审查底层情报、识别会取消目标资格的因子、标记人类审查可能漏掉的不一致,据称已经抓到一些异常。这个「事后补的校验」本身就是承认:系统原本不校验输入数据的新旧。还有一层背景值得记下:Palantir 与军方的绑定极深,多名前高级军官现在任职于 Palantir,包括在 CENTCOM 坦帕总部持高级权限的人。军官退役后进入承包商,承包商再回头给旧同僚供系统,这套旋转门在 Maven 的争议里绕不开。

卫星图 7 年没更新,学校 2017 年就建好了围墙

先把数据这一块钉死。商业卫星图显示,Minab 场址的物理状态早就变了:2017 年前后,围墙和独立入口建成,把学校与相邻的军事基地隔开;2018 年的图像里能看到彩绘的墙、一个足球场、集会队列线和操场游戏标记。这些在商业卫星图上一目了然,买图就能看,不需要什么高级侦察手段。学校有自己的网站,地址挂在 Google Maps 上——任何一次例行核对都能发现,这里住着一群小学生。

但美军的数据库里,这个场址仍是 IRGC 海军设施。NYT 6 月报道,行动官员依赖的卫星图 7 年没有更新,图上根本没有这所学校。ThePrint 转述的 Bloomberg 调查还给出一个细节:场址在多年前就被识别为军事综合体,卫星图上近十年的改造痕迹——2017 年的围墙、2018 年的彩绘——都没有触发数据库分类升级。数据库的分类停留在「这是军事设施」,物理世界早就改写了这个答案。

这里没有 AI 什么事。Maven 没有编造数据,它只是忠实地消费了一份 7 年没更新的底图和一个过时的分类标签。错误在数据层:新鲜度没有闸门,物理世界的十年变化进不了系统。学校自己有网站,出现在 Google Maps 上,伊朗南部的人力情报很稀薄——但这些信号没有任何一条被接进目标选择管道。情报界有一套术语叫「目标文件夹」(target folder),一个目标从建档到可打击,靠的就是文件夹里的材料不断更新;Minab 的文件夹停在七年前。数据新鲜度在商业系统里是常识,在目标选择管道里反而没人负责。

Maven 把数小时的目标确认压成几分钟,压掉的是多工种人肉校验

传统 kill chain 的目标确认,是一排人接力。情报分析师核对来源,影像专家读图,目标员做法律与 collateral damage 评估,律师过一遍交战规则,作战指挥官拍板,发射组执行。Bloomberg 引参与内部审查的官员说,这一套流程原本要几个小时,Maven 把它压缩到几分钟。Maven 的卖点一直是「加速」:把分散在几十个数据库里的情报拉进一个界面,用 AI 关联出候选目标,按优先级排好。商业场景里这叫效率。目标选择场景里,效率的另一面是校验环节的消失。

目标清单从数小时压到几分钟,压掉的不是工作量,是一整排人工校验环节。多工种接力的意义不在于慢,而在于每一棒都会重新看一遍原始材料——影像专家会亲眼读那张图,律师会问「这个目标合法吗」。环节被压缩后,没人重新读图,没人问「这张图是哪年的」。官员说部分使用者指望 Maven 自己发现矛盾,而系统设计上就不做这件事。Bloomberg 的报道里有一句很冷的话:官员们说不清楚这些使用者为什么会认为 Maven 会那么做。使用者期待系统自查,系统没有这个功能。两边都没说出口的事实是:这个期待从来没人验证过。

时间压力放大了这个漏洞。特朗普政府 2 月底下令压倒性空袭,前 24 小时要打 1000 多个目标。目标确认的时间窗口被极限压缩,民用保护人员(civilian-protection personnel)还在此前被裁减过。Bloomberg 引官员的话说,这份紧迫感与信息缺口叠加,为误击铺好了路。一个被压缩的流程,配上一份过期的底图,在战时节奏里交出了 123 名儿童的命。开战首日就是这套流程第一次满负荷运转,第一发就打偏了。

2019 年有人记过这个变化,备注系统没连上主库

最接近「本可避免」的证据在这里。Bloomberg 6 月的调查发现:2019 年,一名美军情报分析师注意到了 Minab 场址的变化,并把观察写进了电子备注。但这条备注所在的系统,没有连接目标选择用的主军事情报数据库。那条备注就此躺在隔离的角落里,到不了任何构建打击包的人手里。六年时间,足够任何一个中间环节把它捞起来,但没有环节做这件事。

这里没有模型幻觉的位置,管道断裂是更准的说法。信息存在、有人记录、时间点够早——提前 7 年,比空袭早得多。但组织的数据架构让这条信息永远到不了决策链。Bloomberg 的报道把这条线单独拎出来:分析师的备注「从未到达构建打击包的人」。UN 独立事实调查团 9 月 17 日的报告(A/HRC/63/61)给出了更重的定性:有合理理由相信美国犯下战争罪,攻击「超出单纯疏忽」,美军「未能尽到一切可行措施核实」学校是军事目标。注意这个措辞的落点:UN 没有说「AI 杀人」,说的是「验证义务被跳过」——而 2019 年那条备注,就是验证义务最具体的一次落空。

UN 报告是第一手可核的官方文件,Pentagon 拒绝公开调查全文。两条调查线撞在一起:一条说系统性地过度依赖 AI,一条说验证义务被系统性跳过。中间那个断裂点——2019 年的备注没进主库——两边都没正面解释。它跟 AI 无关,也难算某个人的个人失误。数据管道在设计上就没有「把新信息送进决策链」的机制,这才是需要被看见的那一层。Amnesty International 6 月 25 日发文催问责,说事发四个月「问责被拖延」;到现在九个月过去,Pentagon 连调查结论都还没公开发布。UN 报告在 9 月 17 日发布,Bloomberg 调查在次日上线,Pentagon 的完整报告却依然锁在抽屉里——最该公开的机构捂着最久。

123 名儿童对 0 伤亡:同族两起事故的失败模式分叉

9 月 19 日,也就是 Bloomberg 调查发布的第二天,CNN 独家报道了另一件事:美军特种作战分析员让 chatbot 分析中国船只货单,bot 把货物幻觉成核武组件,飞机升空、武装人员准备登船,行动前最后一刻深挖才发现报告「entirely false」,差点引发战争。Gizmodo 在报道 Minab 调查时主动把两件事并列:AI 过度依赖正在成为军事与执法工作中的反复主题。HN 上这个「几乎开战」的帖子拿了 365 分,simonw 把它类比成 2023 年律师用假判例写进诉状——格式像真的,内容没有出处。两起事故间隔只有一个月见诸媒体,美军 AI 的信任问题从「差点」走到了「真的」。

两起事故,同一个共同分母:AI 的输出进了行动链,没人做最后一道验证。分叉点在失败模式——cargo 事件是生成层幻觉,模型凭空编造了核武组件;Minab 事件是数据层过时,系统忠实执行了 7 年前的分类。前者 0 伤亡,后者 123 名儿童。幻觉容易识别,因为输出和事实对不上。过时数据更难防:输出格式正确、逻辑自洽,只是底图是旧的。对做系统的人来说,这是两种要分别设防的故障:一个要查生成内容,一个要查输入新鲜度。前者有现成的工具(RAG、溯源、交叉验证),后者要靠数据管道的元数据纪律——记录每份输入的采集时间、更新时间、置信度,让「这份数据多旧」成为一个系统内可见的字段。做 agent 的人对「context 里塞了过期文档」应该不陌生:模型不会告诉你它读到的那份文档是去年的。

美军已经动了。9 月 22 日 Bloomberg 报道:US Military Modifies AI and Lethal Targeting Process After Iran School Strike——美军修改了 AI 与致命目标选择流程。正文在付费墙后,标题可核,细节未见;Palantir 则公开了给 Maven 加校验功能的事。修正方向都指向同一处:在 AI 输出和发射命令之间,重新放回人肉校验和新鲜度检查。cargo 事件之后社区讨论过「格式即信任」——AI 产出的报告长得像正式情报,于是被当作正式情报。Minab 给这个教训加了重量:不是只有生成内容会骗人,过期的输入数据同样会。两起事故相隔半年,结论却是同一个:AI 参与决策的链路上,最后一道人工闸门被拆掉了。

把这条链翻译成商业系统的话,每一环都能找到对应物。Maven 对应你的内部知识库检索,卫星图对应你接的第三方数据源,2019 年的备注对应离职员工留下的交接文档,压缩时间表对应「这个季度必须上线」。Minab 事故的可悲之处在于它毫无新意——数据过期、管道断裂、无人复核,每一条都是工程教科书里的老问题,只是这一次的代价单位是儿童的生命。AI 没有制造这些缺陷,它只是让缺陷以更快的速度、更大的规模、更少的人手通过流水线。效率是 AI 的承诺,也是这场事故的加速器。

你下一个要上线的 agent,喂给它的最新一条数据是哪一天签发的?在它的输出进任何决策链之前,谁负责读一遍原始材料、问一句「这张图是哪年的」——还是说,你也指望系统自己发现矛盾?