两条消息 4 天换来逮捕,十个月的标记换来 8 死 27 伤
2026/10/05 08:15
佛州女子把 Claude 当日记,写下枪击治安官办公室的两条消息,分类器标记、人工复核后报警,约 4 天后她被捕,无人受伤。OpenAI 2025 年 6 月标记过同类账号却按兵不动,10 个月后枪击 8 死 27 伤,省政府起诉。画线的那句英文,写在披露条款里。
2026 年 9 月 26 日清晨 5 点 10 分,佛罗里达州 Bonita Springs,30 岁的 Carli Michelle Heller 在 Claude 里写下:她要枪击治安官办公室。第二天凌晨 1 点 07 分,第二条消息跟上来:她买了把新枪,这是「last chance」。约 4 天后,警员敲开她家 Dean Street 的门,拘捕无事故。没人受伤。她面对的指控是二级重罪。
把另一条时间线并排放着。2025 年 6 月,OpenAI 的安全系统标记了一个 ChatGPT 账号,里面是关于枪支暴力的对话。这个标记挂了 10 个月。2026 年 4 月,加拿大不列颠哥伦比亚省 Tumbler Ridge 枪响,8 死 27 伤——这是 CBC 与省政府公告口径的数字。BC 省政府与 SD59 学区 9 月 21 日在加州北区联邦法院起诉 OpenAI 和 Altman,起诉书抄了 Altman 自己的道歉原话:"we did not alert law enforcement to the account that was banned in June." 道歉发在 4 月 24 日,就在枪击之后、起诉之前;原话承认的是那个 6 月被禁的账号从未被通报。
两案并排,差异先自己显出来。Anthropic 这单:两条消息、人工复核、通报、逮捕,全程 4 天上下,伤亡清零。OpenAI 那单:标记、搁置、枪击、道歉、诉讼,横跨 10 个月。触发器几乎同款,都到了安全团队眼前。4 天对 10 个月,0 对 8,结局差着一整条命。
同一种触发——聊天框里的大规模枪击威胁——在两家管线里走出两条时间线。一家 4 天,一家 10 个月零一场枪击。分岔画在披露条款里:Anthropic 隐私政策写明,「prevent serious harm to any person or property」时可以与执法共享数据;OpenAI 对外的口径是未达 "imminent and credible risk" 门槛。读完这篇你带走三个数:通报用了几天、门槛是谁写的、伤害落在前还是后。任何一家聊天产品,这三个数当场可查。查完,你就知道自己的悄悄话签给了哪种合同。
两条消息都有目标、武器和时限,删掉这些才像「日记」
TechSpot 10 月 4 日的标题是「Florida woman used Claude as a diary, then Anthropic reported an entry」——单数的 entry,没有时间戳,没有引文。这个写法把故事推向猎奇:AI 把她的日记交给了警察,你下次跟 AI 说悄悄话前最好想清楚。MSN、Yahoo 和几家聚合站当天的转载几乎原样保留了这个标题,猎奇版本一天内在英语圈跑完了传播。
逮捕报告是另一副面孔。GCN(WBBH,Hearst 旗下地方台)拿到的报告写:9 月 26 日约 5:10 a.m.,"I'm going to shoot up the sheriff's right the [expletive] now.";9 月 27 日约 1:07 a.m.,"This is 100% last chance I'm done. I got a new [expletive] gun today. [Expletive] you."。她随后告诉警方,她把 Claude 当「diary」用。Yahoo 转述稿补了细节:第二条消息发在次日清晨,报告称用户声称已购入新枪。
拆开看这两条消息:具体目标,sheriff's office;武器声明,got a new gun;时限感,last chance;时间戳,两条都压在深夜和凌晨。每一条都在把这段话从「日记体情绪宣泄」往「威胁构成要件」推。删掉目标、武器和时限,剩下的才接近日记。补回这三样,剩下的接近一份有证据链的威胁陈述。标题里那个 diary 只剩产品用途这一层——她按日记的用法在用,管线按威胁的读法在读。
补完这些限定词再看「AI 卖了你」的流行读法,故事变了:管线没有背叛日记,管线按它预先写好的规则处理了一条被 classifier 命中的输入。她自认为在写日记的那一刻,产品条款已经写明这类输入会被标记、复核、必要时披露。Anthropic 在本案里有没有做错什么?至少流程上,它走的是条款里写好的路。条款就是边界。猎奇读法遮住的恰是这层:值得争论的从来都只有一个问题——条款把哪类话划进了「可披露」那一格。
报警依据写在隐私政策里,无需现场发明
Anthropic 官方 safeguards 博客(2025 年 8 月 12 日)写明:classifiers 是「prompted 或专门微调的 Claude 模型」,实时检测政策违规,可以同时跑多个,主对话照常进行;人工复核是 enforcement 环节的附加一道。这套系统并非为本案临时搭建——博客发布那天起,每个 Claude 会话旁边都挂着这套并行监测。高风险域(CBRNE、网络攻击)另有专项能力评估,威胁类 classifier 属于常规配置。标记到复核的时间以分钟计。
隐私政策给了披露权。本轮核对的全文写明:基于 good-faith belief 且合理必要时,Anthropic 可与政府、执法或第三方共享个人数据,情形第 (ii) 项是「prevent serious harm to any person or property」,第 (iii) 项是检测、防止欺诈或其他违法活动。没有比这更含糊的「imminent」,措辞就是 serious harm。serious 不设时间下限,credibility 不设证据等级——两个词的解释空间留给复核员,而复核员的存在本身已经写在流程里。
访问规则另一篇也在隐私中心(2026 年 3 月 16 日更新):员工默认无权查看你的对话,例外只有两个——你主动提交反馈,或执行 Usage Policy 所需的审查;后者仅限 Trust & Safety 指定成员按 need-to-know 访问。换句话说,对话并非对全体员工开放的数据库,它是一条通向特定人群的受控管道;「特定人群」的名单由岗位决定,不由你决定。这条规则的受益人和执行人是同一批流程。
三份文件串成一条线:classifier 实时标记 → Trust & Safety 人工复核 → 按条款 (ii) 披露。每一步都有预先写好的依据。TechSpot 转述公司口径时引的正是这套:「may share user information in limited emergencies if it believes disclosure is necessary to prevent death or serious physical injury.」本案没有任何环节需要现场发明规则——这正是它值得对照 OpenAI 那条线的原因。条款先于案例存在。
同一触发,OpenAI 的门槛换来 8 死 27 伤和一纸起诉
BC 案的事实此前的报道已经核过一轮(CBC、省府公告口径):2025 年 6 月,OpenAI 内部标记一个涉枪支暴力的账号;公司立场是该对话未达 "imminent and credible risk" 的执法转介门槛;枪击发生后才联系 RCMP;9 月 21 日,省政府和学区把这事带进了联邦法院。TechSpot 本篇还补了一句起诉背景:开枪者是 18 岁的前学生 Jesse Van Rootselaar。起诉文件还指控 OpenAI 拒绝向执法机构交出相关聊天记录——Sharma(BC 省总检察长)口径,本轮转引前轮已核材料。
| Anthropic / Claude(本案) | OpenAI / ChatGPT(BC 案) | |
|---|---|---|
| 触发 | 9/26–27 两条威胁消息 | 2025/6 暴力对话账号被标记 |
| 披露 | 人工复核后通报执法 | 未通报(自称未达门槛) |
| 结果 | 约 4 天后逮捕,0 伤亡 | 10 个月后枪击,8 死 27 伤 |
| 后果 | 用户被刑事指控 | 省政府+学区联邦诉讼 |
表里两列的素材几乎同源:用户、聊天框、枪击威胁、安全团队的标记。走成两条线,分岔点在复核后的那道决定。Anthropic 的复核员看完就打给了执法;OpenAI 的复核员(或流程)看完把标记留在了内部。前者的决定把风险转给了被告的自由,后者的决定把风险转给了公共场所的人群。风险不消失,只换支付方。
两家条款里那两个英文短语,决定同样的素材走哪条线。"imminent and credible risk" 的高门槛,代价由 Tumbler Ridge 的死伤者支付;"serious harm" 的低门槛,代价由被告的对话隐私支付。两个代价都写进条款,用户注册那天都点过同意。差别是只有一家的代价被量化成了死亡人数,写进了起诉书。
OpenAI 发言人对这轮辞职潮的回应(Guardian 转述)是公司在「strengthen our safety and security practices」,必要时会「pause training or hold back models」。没有一句谈威胁通报的门槛会不会改。佛州 6 月还另案起诉了 OpenAI(FSU 枪击案相关,TechSpot 转述口径),指控 ChatGPT 对现实伤害有贡献——这些案子会替用户问那个门槛问题。
执法已经在路上:FTC 9 月 30 日对 Anthropic、OpenAI、Metr 起草 CIDs,加州 AG 10 月 1 日向 OpenAI 送达调查传票。调原始记录会是第一件事。两条时间线都得交底:通报决策谁做的、依据哪条文本、标记挂了多久。传票问的就是这些。答案比任何安全博客都硬。
「他人可看」这条罪名要件,被审查管线自己满足
罪名是佛罗里达法条 836.10 下的书面暴力威胁,二级重罪。条文要求威胁「以他人可看的方式」(in a manner in which another person may view it)作出。条文经 TechSpot 和 Yahoo 两稿转引,官方文本在 leg.state.fl.us。本轮未核立法史,只核了要件措辞。二级重罪在佛罗里达最高可判 15 年(转引稿量刑口径,判决未下,仅为条文上限)。
她按私密的用法使用产品。条文要的那个「他人」,由 Anthropic 的审查员担任。管线本身补全了构成要件:报告给执法的复核,同时是罪名成立所需的传播要素。审查管线的存在,把一段私房话变成了有观众的发言。
这里有个结构性反讽。Anthropic 隐私中心说员工默认无权看你的对话——这句话在产品语境里是隐私承诺,在本案卷宗里是「有人看了」的证明。同一套访问控制,既证明平时没人看,也证明触发时一定有人看。你没法只要前一半、退掉后一半。触发条件写在 classifier 里,召回率由厂商定。隐私承诺的边界,由厂商的检测配置单方面划定。
当地分析员 Michael Raheb 对 GCN 说,这类威胁定罪「not going to be easy」——direct threat 需要具体个人加暴力行为,控方要过的关不少。他说的难度在意图证明:字面威胁摆在那里,主观意图要另证。本案偏偏给控方配了一条最完整的证据链:时间戳、原文引语、管线的每一步处置记录,外加她自己对「diary」用法的承认。
同周 Lee County 还抓了另一个人,罪名类似、管线不同——他在社交媒体发了威胁治安官 Carmine Marceno 的 AI 生成图。对照之下更清楚:聊天报告管线走通的案子,证据是平台自己产出的完整链路;社交图像案走的是传统举报。平台管线越完整,控方越省力。两条线在 836.10 面前等价,管线的差别只影响证据的成色。
这对产品方是个法律含义大于工程含义的信号:聊天产品的披露管线,在诉讼里可能被当作「传播」要件的一环来读。条款里那句披露权,既是公司的合规工具,也是案卷里的证据来源。产品法务接下来要回答的问题:披露记录的保存期限和可交出性,要不要按证据标准来设。
私密感是产品体验,管线里坐着人类读者
三件同期的事摆在一起。Anthropic 上个月请用户分享语音数据用于训练(BleepingComputer 10 月 4 日,转述,仅供参考);上月底有报道说 Microsoft Copilot 图像编辑的人工审查员能看到用户的 prompt、上传照片和生成结果(TechSpot 转述,仅供参考——审查目的是评估输出准确性,敏感内容是顺带看见的);本案里,T&S 复核员的「看见」直接变成了一次通报。三家的产品各不相同,结构是同一个:你的输入在管线里有一段人类可及的路径。这个结构没有出现在任何广告里。
隐私中心那句「员工默认无权访问」与「T&S 指定成员 need-to-know」是同一条规则的两面:访问由例外触发,例外由 classifier 触发,classifier 的召回率由厂商自己定。调高召回率,多抓威胁,多看一些无害的倾诉;调低,少打扰,漏过去的算平台外伤害。这个旋钮没有公开刻度,用户端看不到任何指示。
用户协议里「不要输入敏感信息」的条款各家都有。本案把这条抽象条款落成了一卷逮捕记录:30 岁,两条消息,4 天。条款的执行代价第一次有了具体人形。BC 案把条款的另一头也落成了人形:8 个死者,27 个伤者,一个没有发出的通报。两个具体人形摆在一起,抽象条款消失。
Claude 的宪法(constitutional AI)与模型性格团队常年讨论「模型该有什么价值观」。本案提醒的是另一层:价值观辩论再热闹,动手的是 classifier 的召回率和复核员的操作手册。模型说什么不重要,管线把它给谁看才重要。
给读的人剩一句能带走的:判定输入敏感度的单位,从「这段对话里有没有秘密」换成「这条消息单独截出来像什么」。威胁如此,商业秘密如此,病历和情绪低谷的倾诉亦如此。截出来像什么的判断标准,就按「他人可看」四个字读。这条判法免费,代价只有一次换位思考。
三个数,核对任何一家聊天产品的披露线
三个数,核对任何一家聊天产品的披露线。先摆第一个:从触发到通报,几天。本案约 4 天(9/26–27 消息,逮捕在 9/30 前后——swfl.io 转载页日期口径;报告原文未标逮捕时刻,这里的「约」不可省)。BC 案的对应数是 10 个月,外加一条没等到的通报。天数的量级告诉你这家公司把披露当流程还是当特例:流程以小时计,特例以季度计。
第二个数:门槛谁写的。Anthropic 是隐私政策里的 "prevent serious harm to any person or property";OpenAI 是 BC 起诉书口径里的 "imminent and credible risk"。你用的每家产品都有对应的那句英文,注册页和隐私中心挂着。找不到这句话,本身就是第四个数——披露决策没有成文依据,全靠临场判断。
第三个数:伤害落在前还是后。逮捕在前,0 伤亡,代价由被告支付;标记挂着,8 死 27 伤在后,代价由死伤者支付。披露线的松紧没有抽象的对错,输出只有这一个指标可看。这个指标叫伤亡,其余都叫口径。数得出来的才进判决,数不出来的只进博客。
产品侧顺带一句:会动手的 agent 产品,披露线理应比聊天产品更紧——动作的外部性大。Muse 的支付代理、Dots 的云电脑、各家 coding agent 的 shell 权限,每一样都比聊天框更能直接碰到真实世界。反过来,聊天产品拿「私密感」当卖点时,披露条款和卖点之间的张力迟早要靠诉讼来定量。本案就是第一次定量:定性是「她被自己的聊天记录送进监狱」,定量是「4 天,0 伤亡,1 条罪名」。
下次打开任何一个聊天产品,把这三个数翻出来摆在桌上。然后问一句现场的:你上个月说过的那句最不想让人看见的话,此刻躺在谁的复核队列里,离「他人可看」还有几步?