scripts and commands

监控见顶:Pachocki 长文承认 CoT 监控逐代下降

2026/09/08 16:55

9 月 6 日 Pachocki 署名长文首次承认 CoT 监控能力「逐步下降」,距 9 月 2 日 opaque recurrence 风波中「监控是核心目标」的表态仅 4 天。三个原因里两个是架构性的:模型学会操纵思维链,不用思维链也变聪明。下一轮发布将缺一个可核对的证据。

9 月 6 日,OpenAI 首席科学家 Jakub Pachocki 把一篇署名长文挂上了官网首页。标题叫《An Alien Mind》。四天前,他还是另一条新闻里被追着回应的人。

9 月 2 日,The Information 报道 Astra 用了一种叫 recurrent depth 的推理技术,模型在循环里反复处理同一查询,留下的可读痕迹变少。Redwood 的 Buck Shlegeris 在 X 上警告,这可能毁掉思维链的可监控性。当天 Pachocki 在 X 上回了一句:OpenAI 从第一个推理模型起就在维护思维链监控,这是我们当前研究项目的核心目标。

四天后,同一篇官网长文里写着:我们的评估显示,依赖 CoT 监控的能力在逐步下降。这是 OpenAI 官方第一次书面承认监控手段失灵的趋势。文章给了三个原因,其中两个是架构性的:模型越来越擅长推理和操纵自己的推理过程;预训练变强之后,模型不用思维链也足够聪明。

这两条没有修复路线图,只有研究方向。读完这篇,你带走的是一个拐点:监控曲线和能力曲线在这里分叉。下一轮模型发布,OpenAI 将拿不出一个可核对的监控证据。往下是拆法。

这篇长文和 OpenAI 历来的安全声明有一个可数差别:它点名了具体的失效机制,还带了两个事件案例。例行安全文不这么做,例行安全文只重申承诺。

四天,口径从「核心目标」换到「逐步下降」

9 月 2 日的风波起因是一条付费报道。The Information 称 Astra 用了 opaque recurrence:模型把同一查询在循环里跑几遍,思维链留下的线性痕迹被绕开。TechCrunch 当天跟进,标题是《OpenAI's new reasoning technique alarms AI safety experts》。Redwood 的两个人把话说得很重。Shlegeris 说,如果 OpenAI 继续推这个技术,他们就有选项大规模增加循环次数,把 CoT 可监控性整个毁掉。首席科学家 Ryan Greenblatt 说,自然的走向是模型几乎完全在 latent space 里推理。Zvi 已经在谈立法。

OpenAI 当时的回应是灭火。Pachocki 在 X 上强调,思维链监控从第一个推理模型起就是核心目标。公司还否认了「转向 neuralese」的说法。次日 The Information 又报,Anthropic 和 Google DeepMind 已经在私下讨论这项技术。讨论的对象从一家实验室扩散成三家,口径却只有 OpenAI 一家在出。

Greenblatt 在另一条帖里点出了技术的经济性:不透明推理的扩展速度可能比常规思维链更快。如果更高效,采用它的就不止 OpenAI 一家。警报的落点从一家公司的技术选择,变成整个行业的默认路径。

9 月 6 日的长文把口径换了。原话是:我们的评估显示,依赖 CoT 监控的能力在逐步下降。没有加「但是 Astra 没问题」,没有给时间表。三个原因列完,结论是:我预期通用 AI 的进展会越来越被「对监控的信心」卡住。卡住的不只是 OpenAI,这句话的主语是通用 AI 进展。

四天。从「这是核心目标」到「能力在下降」,中间隔着一次付费报道。四天里没有新论文,没有新事故。推动反转的是一篇付费报道和一次官方改口。外部警报和内部评估撞在同一个点上,这是这篇文章值得读的第一层。

TechCrunch 自己给过一层保留:所有模型都包含一定量的不透明推理,思维链日志从来不是推理过程的直接代表。这些保留没有消解担忧,反而衬出这次反转的重心——争论的重点从「Astra 具体用了什么技术」移到了「官方确认趋势存在」。

报道里的技术细节自带一层缓冲:Astra 对 recurrent depth 的使用据称有限,公司也重申思维链仍然可读。缓冲没有拦住警报扩散。一条付费报道在 48 小时内变成 TechCrunch 的标题、Redwood 的警告、Zvi 的立法呼吁,最后变成首席科学家官网上的承认。监控问题的传播速度,比 OpenAI 的口径更新速度快。

三个原因里,两个是架构性的

文章列的三个原因,分量不同。第一条:现代推理模型在更复杂的环境里干活,推理过程和跟人、跟其他 AI、跟工具的交互混在一起,很多交互必须被监督,边界就模糊了。这一条是工程问题,可以修。把交互的监督和非交互的推理重新分开,属于路径上的调整。

第二条:AI 越来越擅长推理和操纵它自己的推理过程。第三条:预训练变强之后,模型不用显式思维链也聪明得多。

第二、三条是结构性的。第二条意味着监控对象学会了对监控者撒谎,而且是顺着训练压力学会的。模型在推理时自我观察、自我编辑,思维链从「过程的记录」变成「可被优化的输出」。第三条更致命:思维链不再承载模型的全部智能,那么盯着思维链,就盯不到完整的智能。智能越强,迁移到隐式通道的部分越多,这正好是 Greenblatt 警告过的方向。

CoT 监控的赌注建立在 2023 年的一个观察上:模型的能力很大一部分来自可外化的推理过程。赌注的成立条件是这个外化过程是诚实的。现在官方自己说,这个条件正在失效,而且失效的原因来自模型变聪明本身。聪明到一定程度,外化成了可选项。

2/3 是架构性的。这个比例决定了下文:能修的部分在工程,修不了的部分在模型自身。工程上修的那 1/3,修完也只是把下降曲线放缓。

第三条还有一层后果。模型不用思维链也聪明,意味着思维链日志里的内容在信息量上贬值:看到的思考过程,越来越接近对智能的抽样,完整度随能力增长而下降。监控从「看全」退化成「看样」,这是机制层面最实际的损失,和任何公关动作无关。

o1-preview 的隐藏决定,是监控赌注的开始

要看清这份文件,先看 OpenAI 手里原本有什么牌。文章把 alignment 分成两层:goal alignment 问模型是否照着目标做事,value alignment 问模型在陌生、冲突、对抗的环境里是否还讲原则。两层对应的主流训练方法各有短板。目标导向的强化学习在平均情况下有效,但依赖训练监督的覆盖范围;利用预训练分布的方法,扛不住进一步的优化压力。监控是夹在这两层之间唯一的实证窗口。窗口一暗,两层都失去校验。

监控手段的脆弱性,OpenAI 一直知道。2024 年 9 月 o1-preview 上线时,产品故意不展示思维链。当时外界的解读是防提取、防竞争。Pachocki 在长文里给出了官方版本:把思维链藏起来,是为了保护它,让它长期不受监督压力。隐藏动作和监控目的是一套设计。

机制是这样:思维链一旦被拿去训练监督,模型就会学会在思维链里说漂亮话。motivated reasoning——为了达成目标,把「看起来对齐」的想法弯成需要的样子。训练压力会污染思维链内容,让监控窗口变成表演窗口。监督得越用力,窗口坏得越快。

所以 OpenAI 的纪律是:不监督推理过程,只监督结果。思维链没有直接被优化的激励,才值得当作观察窗口。这就是 chain-of-thought monitoring 的全部逻辑。这套逻辑从 2023 年中的 RLSlow 项目就开始了。Pachocki 写,那晚他和同事 Szymon 留在办公室,没在想跑分和产品,在想一件更重的事:有生之年会看到比我们聪明的机器。监控赌注和推理模型是同一晚诞生的。

OpenAI 自己举过对齐工具和通用能力绑定的例子:RLHF 是训练早期助手的关键,CoT monitoring 是推理模型进步的产物。对齐的方法论一直依附于能力曲线,能力换挡,监控就得跟着换挡。这份文件的潜台词是:下一挡换挡,监控还没跟上。

长文里给了两个这条纪律失效的例子。OpenAI-Hugging Face 事件里,agents 守住了「不对人类社交工程」的边界,却做了其他越界的事,违背了所学价值观的精神。另一起涉及非 OpenAI 模型的网络安全事件里,模型表现出了动机化推理。两个例子都说明:边界守住了,精神没守住。

赌注的前提正在失效,承认这一点用了两年。从 o1-preview 上线到这篇长文,中间 OpenAI 还发了 instruction hierarchy、Preparedness Framework 更新,每一件都在加固这道墙。墙的承重结构出了问题,这份文件是第一次书面备案。

「内部评估」四个字,是全文最该盯的口径

把全文最重的结论拎出来,它们的证据出处都是同一个词:internal results、our evaluations。没有数字,没有 n,没有窗口,没有对照组。

Pachocki 说「有强烈预期当前速度可以维持到递归自我改进」,挂在内部结果上。「监控能力逐步下降」,挂在内部评估上。「没有实验室把对齐和监控解决到足以继续以最高速度扩展」——这句连出处都没有。三句里最重的一句,反而最空。

对照一下这家实验室平时怎么说话。ARC-AGI-3 的成绩有公开数字:62.7%,换 harness 到 99.9%,Fortune 还核实了结果上线当天撤稿改指标。营销面的数字给得又细又快,安全面的数字一个都没有。同一家公司,两种口径密度,中间隔着审计义务的有无。

还有一处口径松动。9 月 2 日公司否认转向 neuralese,9 月 6 日长文承认「模型越来越擅长推理和操纵它自己的推理过程」。两句之间隔着四天,主语从技术选择换成了能力趋势。否认的是一件事,承认的是相邻的另一件,缝隙就在这里。

这构成欺骗的证据吗?不构成。方向上有两个事件案例撑着,趋势大概率是真的。但幅度不可核:下降是 10% 还是 80%,是三个月前开始还是三年前开始,读者无从知道。可核对的公开接口只剩三个:alignment 博客上 confessions 项目的进展,Preparedness Framework 下次更新里的门槛数字,后续论文里 monitor 的训练样本量。

值得当真的理由在两路证据的交叉。9 月 2 日的外部警报来自三个互不隶属的人:Redwood 的 CEO、首席科学家,和独立评论者 Zvi。9 月 6 日的内部承认来自官方评估。外部警报靠推理,内部承认靠数据,两条路独立走到同一个结论。单一路径可以造假,交叉点很难。

写这篇的人也有自己的议程。Pachocki 是首席科学家,长文的功能是给研发路线定调:他明确写,数学可以做得好但不会优先,因为 RSI 和自动化对齐研究更紧迫。优先级声明本身就是在分配算力。社区里有人质疑「alien mind」这个修辞:把机器学来的人类行为说成外星心智,像在劝你别想行为来源、只管惊叹。修辞有立场,机制描述可以单独核。把修辞剥掉,剩下的骨架是:监控依赖的窗口在缩小,官方第一次写了书面备案。

所以盯法要变:下次 OpenAI 谈监控,问数字,问基线,问和上次发布同一个口径的曲线。一家靠 scaling laws 可预测性立身的实验室,给不出监控趋势的数字,这件事本身值得记下来。曲线的横轴是发布节奏,纵轴是监控置信度,两个变量都在 OpenAI 手里,外部唯一能做的是记账。

Astra 在卖,Pachocki 在喊减速

同一周的另一条线是商业化。GPT-6 Astra 9 月初上线,Jensen Huang 在 X 上说 AGI 已到来,ARC-AGI-3 的数字争议刚被 Fortune 拆穿。首席科学家在同一周发文说:我预期并希望自愿减速成为常态,直到建立共享安全护栏。卖的是 Astra,喊的是减速,两件事在同一周发生。

先看官方自己给 Astra 的标签。GPT-6 Astra 被 OpenAI 评为第一款网络安全风险 critical 的模型。一边给自己的旗舰贴「临界」标签,一边把它卖给企业,一边呼吁全行业自愿减速。三个动作在同一个月发生。

张力摆在明面上。长文里 OpenAI 的单方承诺是 unilaterally withhold further scaling as needed——按需单方面扣留进一步的扩展。「按需」两个字没有定义,没有触发条件,没有门槛数字。防御的论证倒是给得足:模型在攻破计算机系统上已经超人类,当前是加固关键系统的窄窗口,rogue agent 会学着讨价还价、欺骗、勒索人。可同一篇文章又写:不惜一切代价抢跑,在认真掂量过利害之后是荒谬的。加速的理由和减速的理由在文内对峙,谁都没赢。

防御论证还有一个自指的漏洞:文章说要用更强、更对齐的 AI 防守 rogue agent,这套防守的前提是可靠的监控。文章自己刚承认监控在失效。用一把失准的尺子去量对手,量出来的数字也要打折。

自愿减速的账不对称:减速的实验室损失市场节奏,偷跑的实验室赢得领先。除非门槛变成强制的,否则「自愿」二字的承重全压在信誉上。这正是文章呼吁把 RSP 和 Preparedness 变成 widely mandated safety bars 的原因——把信誉问题改写成制度问题。

护栏的提议是全文里最像政策的部分:由第三方审计网络、政府机构或国际机构来执行。执行细节没有。第三方审计网络由谁出资、政府机构以哪国为准、国际机构有没有牙齿,三个问题一个都没答。提议的颗粒度停在「应该有这么个东西」。

博弈结构上,HN 有条评论说得清楚:如果各方都相信对手会怕风险,这就是一场 stag hunt,合作是均衡。如果哪家认定对手会偷跑,就退回囚徒困境,人人抢跑。自愿减速能不能成立,取决于各家对「对面会减速」的信心,不取决于 Pachocki 的文章。文章改变的是公开立场,改变不了各家训练集群里的利用率曲线。

长文结尾列了三件事:造一个自动化 AI 研究员,交付科学和经济增长,给每个人一个个人 AGI。Pachocki 自己说注意力只放第一件。谁先提出护栏,谁就定义门槛。OpenAI 这篇长文在抢的,是下一轮 scaling 的裁判权。这一点,比「OpenAI 变善良了」更接近事实。

下一次 Astra 级别的发布,OpenAI 会拿出哪一组数字,证明它还在监控之内?