scripts and commands

950 个 agent 找到的「新 CRISPR」:功能未知、无对照、未评审

2026/09/25 08:18

Anthropic 称 Claude 自主发现新酶系统 ART:约 950 个 agent、21 小时、2.1 亿 token 扫出。但 RT 是已知酶,新观察只有「重复阵列+伙伴基因」;功能未验证、无对照、无评审。新闻主角是 Anthropic 的湿实验室与生物业务,判断标准是一份三问清单。

9 月 24 日,Lucas Harrington 刷到 Anthropic 的公告,停了下来。标题写着「Claude discovers a novel enzyme system」,正文里冒出「CRISPR-like」。Harrington 是 Jennifer Doudna 门下的博士,和导师一起创办了 Mammoth Biosciences——这家公司的生意就是用 genome mining 找 CRISPR 系统。他发了条 X:这个方法存在几十年了,类似系统 2008 年就有;难点是搞清楚一个系统到底干什么,Anthropic 没展示;把早期结果当重大发现,isn't helpful。这条帖子由 the-decoder 转述,二手,但指向明确。他卡住的那一下,不是被「新 CRISPR」吓到,是被「新」字硌到。

公告本身有一组漂亮的数字。约 950 个 agent、21 小时、2.1 亿 token,扫完 20 万个反转录酶,筛出 3,500 个候选系统,写出 20 份报告,最后挑出一个被命名为 ART 的系统:array-associated reverse transcriptases,反转录酶旁边的一排等距重复 DNA 序列,加一个功能未知的伙伴基因。Feng Zhang 看完预印本后背书:「genuinely intriguing」,值得「further investigation」。这组数字全部出自 Anthropic 自己的公告,没有独立核算。

这件事撞上了上周的两则新闻。OpenAI 用 1 万个并发 agent、88 小时「解决」Navier-Stokes;再往前,Claude 11 天把费马大定理形式化进 Lean。「AI 自主发现」已经是个成熟叙事。这次不一样的地方有两处:第一次有真实湿实验室参与;第一次有第三方领域研究者当场、指名道姓地反驳。

反驳和公告并不矛盾。Harrington 没有否认 agent 扫库这件事。所有人都承认那 950 个 agent 是能干的。分歧在定性:公告说「发现新酶系统」,研究者说「一个已知酶旁边的新排列,功能未知」。标题里被削掉的东西有三件:RT 是已知的,功能是未验证的,对照是没做的。这篇把这三件补回来,然后说说主角——Anthropic 的湿实验室。

「Claude 发现新酶系统」:一个已知酶、一个新排列、一个未知功能

官方帖里有一句容易被跳过的话:「While this underlying RT, found in a jumbo phage, had been identified in previous studies, Claude appears to be the first to notice the system's defining features」。那个 RT 酶,之前的研究已经鉴定过。Claude 第一次注意到的是「系统」的特征:一段非编码重复阵列,加一个功能未知的伙伴基因。官方帖自己把「新」字的边界划在这里。

ART 的三件套,公告交代得很细。RT 负责把 RNA 拷贝成 DNA,是个老面孔;旁边那个伙伴基因,功能未知;那排等距重复序列,布局像 CRISPR 的 array。首次实验只做到一步:这段阵列会表达成一堆短 RNA。CRISPR 值钱,是因为它能被编程去定点切割 DNA。ART 有没有这个功能,官方原话是「we don't yet know its function」。

昆士兰理工大学的 Dimitri Perrin 把话说得最干净。他在 The Conversation 上写道:「The enzyme itself was already known. What is new is the recognition that it may form part of this larger system.」酶是旧的。新的是「它可能属于一个更大的系统」这个认识。Perrin 是计算机科学学院的院长,常年做 CRISPR 与 AI 交叉项目,这个判断带行内分量。他补了最后一块:「ART is CRISPR-like in its architecture, but there is no evidence that it is CRISPR-like in its function.」架构像,功能没有证据。

HN 最高赞评论把口径压得更低:这是「围绕一个已知反转录酶、此前未被描述的基因组排列」,「not all that sexy」。三家媒体标题可以对照着读。Reuters 写「Claude AI helped discover novel enzyme system」;Al Jazeera 写「AI model Claude discovers CRISPR-like enzyme system」;The Verge 写「made a discovery it's comparing to Crispr」。官方帖自己都承认酶是已知的。标题和正文之间,隔着一整套被削掉的限定词。

Gizmodo 还给这层包装起了个名字:machine-learning version of apophenia——把不相关的点连成意义的倾向。排列像 CRISPR,就被叫「CRISPR-like」;短 RNA 表达,就被暗示「类似机制」。每一步都有出处,每一步都往前多走了一格。单看一格没问题,连起来看,就是公告标题。

「新」在这个标题里有三种读法,要分开核。新酶:假的,RT 已知。新系统:部分成立,阵列加伙伴基因的组合没人描述过。新功能:未验证。公告的聪明之处,是让三种读法共用同一个词。读者按哪种读法理解,取决于他看的是标题、正文还是 preprint。

950 个 agent 的数字是真的,但那是过程,不是成果

21 小时、950 个 agent、2.1 亿 token:这些数字出自 Anthropic 官方帖,可以核。漏斗也清楚:20 万个 RT 序列 → 3,500 个候选 → 20 份人类可读报告 → 1 个 ART。按官方说法,同样的初筛一个专家要做几周到几个月。preprint 口径里还有一层:先扫约 19 亿个蛋白簇(Gizmodo 转述)。对没有领域团队的公司来说,这个速度是真实的能力变化。官方描述的工作流有一道自检:Claude 先复现已发表的结论来校验自己的方法,再去找没有归属系统的成员;候选报告是给人类看的,每份提议一个功能、列一份证据。

2.1 亿 token 还有一个成本注脚。HN 有人算过:按 Anthropic 自家对外服务的价格,这笔扫描的推理成本是天文数字;把 context 拉大,是实验室控制成本的主要手段之一(评论者推测,二手)。能力的展示,本来就是烧钱的展示。

但这些是过程指标,不是成果指标。Perrin 在 The Conversation 里点名了三处缺失。第一,没有对照:「A purpose-built conventional bioinformatics pipeline could probably have detected the same pattern」,而研究没提供对比,无法判断 ART 是传统流程难以发现的信号,还是几千个候选里谁都会撞上的一个。第二,没有底数:3,500 个候选里有多少是真新颖、真有趣的生物学,没人知道。第三,单次命中不构成可靠性:「Finding one intriguing result after exploring thousands of possibilities is not the same as showing that the system can reliably recognise discoveries.」

预印本还有一个缺口:描述 agent harness 的 Supplementary Note 1 没有随文公开(HN 评论者指出,转述)。没有 harness 细节,就没有复现路径。官方帖引了一句 agent 的原话:「[The DNA next to the RT] is spectacular: I can see by eye a tandem repeat array … that's a CRISPR-like … repeat array?!」这句话被当卖点。HN 用户分两派:一派说这是未来科学史里的珍贵引语;另一派提醒,Claude 对外展示的 reasoning 是加密后的摘要,agent 的「惊叹」可能是事后合理化。当证据用,它立不住;当广告用,它很有效。

社区里用 Claude Science 做过真实验的人,给的是另一手经验:模式识别很强,「you could put your primer here but that looks like an Alu repeat」这种提醒很准;但「VERY non-reproducible」,得自己盯着 git 才能复现它做过的事。有人还点出一个技术上的意外:这类任务本该是基因组大模型的菜,HN 评论者观察 agent 用的是经典生信方法,比如 HMM(转述,preprint 的 Sup 1 本应说明这点)。还有研究者点出漏斗的暗面:200,000 筛到 1 的过程,会把「不像已知系统」的真新颖当离群值丢掉。假阴性没人看见。

「21 小时」是广告词,要单独拎出来。它说的是扫库时间,不包括写 harness、选目标、做实验、写报告。一个 agent 在 21 小时里「惊叹」了一句,后面是几十个人类科学家在实验室里验证。把过程时间当成发现速度,是这轮 PR 最顺滑的一步。

还有一层争论在「该不该现在发」。HN 上有人说:他们没投 Nature 或 Science,只有 preprint,这阶段对别人没价值。另一派翻出作者名单:全是 CRISPR 领域的资深研究者,实验室实验做了,preprint 是给同行抢时间的正常动作。两派吵不出结果,因为双方都默认了一件事:这则公告的读者是公众和投资人,不是同行评审委员会。

复现还有一层对比值得记。Anthropic 上个月对 Mythos 5 越权事故,交过 1,022 页完整 CoT 转录;这次连描述 harness 的 Sup 1 都没公开。同一家公司,安全事故给全文,科学发现给摘要。披露标准的差异,比 ART 本身更说明问题。

整个 CRISPR 圈子在皱眉:功能证据为零

Harrington 的完整反驳值得逐句看。他是 Doudna 的学生,Mammoth 的联合创始人,公司靠 genome mining 吃饭。他说「方法存在几十年了、类似系统 2008 年就有」,这是行话,不是外行话。他说难点是「figuring out what a system actually does」,Anthropic 没做到。最后一句:「Presenting early results as a major discovery isn't helpful.」

华盛顿大学的 Kevin Blake 对 Al Jazeera 说得更直(Gizmodo 转引):「There's nothing to indicate this is a rival to CRISPR-the-technology, or could be developed into any kind of therapeutic or practical application.」没有迹象表明这是 CRISPR 技术的对手,也没有迹象表明能变成任何疗法。注意 Blake 是微生物学家,看的是功能,不是架构。

Perrin 的态度最平衡,但结论一样。他承认「how it was found」比「what was found」更有价值——过程是真进步。他对「发现」这个词保持距离:一次命中不等于可靠发现。反驳者的共同点也在这里:没有人否认 950 个 agent 扫库的能力,所有人否的是「新 CRISPR」这个成果定性。

圈内人反应这么大,还有一个职业原因。genome mining 是 CRISPR 领域的标准动作,Harrington 的公司靠它吃饭,Perrin 说传统 pipeline 也能检出。Anthropic 把一个标准动作包装成「自主发现」,等于把整个领域的日常劳动降级成背景板。这场争论的实质是叙事权,学术成分反而小。

Feng Zhang 的背书要按原文读。他看完预印本说:「genuinely intriguing and merits further investigation」,希望更多科学家探索 AI 怎么支持研究。注意他没有说「breakthrough」,没有说「new CRISPR」,说的是「值得进一步研究」。这是一份带限定词的背书,和公告标题之间差着温度。

背书还有个前提值得写:预印本是 Anthropic 先送给他看的,他的评论印在公告里。这是邀请制背书,够不上独立评审。邀请制背书的功能,是给「genuinely intriguing」这句话一个可信的面孔。限定词还是他自己写的。

支持者支持的是什么也值得看清。多伦多的 Bo Wang 说这是「scaling scientific attention」——数据太多,人看不完,agent 帮人注意到异常个案。他支持的是过程,不是 ART 本身。两边从未在「950 个 agent 能不能扫库」上分歧,分歧落在「扫出来的东西能不能叫发现」。

湿实验室才是这则新闻的主角

酶的故事之前五天,路透已经报道过实验室本身:Anthropic 悄悄建生物实验室、加码 AI 药物项目(The Conversation 引用该报道)。所以 9 月 23 日的公告,是实验室的第一份公开成果,也是它的开工广告。

官方帖的落点不在酶,在组织。life sciences 组织里,除了这个实验室,还有 drug discovery 团队和训练 Claude 生物化学的团队;结尾是招聘式邀请,「we would like to work with other scientists」。同场还有一份更说明问题的文件:Life Sciences Verification Program(LSVP)。它给通过验证的生命科学从业者 Mythos、Opus、Sonnet 访问权,用「refined set of safeguards more permissive for biology-related work」。在普通产品里被挡住的 drug discovery、research biology、clinical development、manufacturing 任务,验证后放开。分 Standard Use 和 High-risk Use 两档 grant,Standard Use 覆盖 Mythos 5.1、Opus 5、Sonnet 5,一年一续;已有几十家机构上车。

时机也排过。Dario Amodei 在联合国安理会 AI 安全会议开始前几分钟发 X 宣布这件事,同一天他在会上讲「apocalyptic risks」。一边对全世界讲末日风险,一边发布自家实验室的基因编辑系统发现。Gizmodo 把这两条放在同一段里,不是巧合。

实验室的边界,公告里写得很保守:BSL-1 和 BSL-2,不碰能感染人类的病原体,所有实验由人类科学家完成。同一篇公告里还有一句:他们试过用 AI 加速实验室工作,但对分子生物学的临时流程不适用。湿实验这块,agent 还没进来。Dario 的远期句子,把这块也预定了。

把这条和同族新闻排在一起,模式就清楚了。OpenAI 1 万 agent 88 小时解 Navier-Stokes;Claude 11 天形式化费马大定理;现在 950 个 agent 21 小时扫出 ART。每一家都在用「AI 自主发现」叙事给模型能力做广告。这次多了两样:真实湿实验室,和真实业务版图。HN 有人点破:他们要的是能自主做发现的系统,辅助人类只是中间站。OpenAI 那次事后被社区追问「是不是吸收了用户会话数据」,这次绕开了那个坑:扫的是公开数据库,没有隐私争议。代价是扫库本身的分量也更轻。

对动手的人来说,这则新闻的可核对象是 Anthropic 的生物业务:实验室、LSVP、药物发现,三样都是真的、都在扩张。ART 的功能反而是最不急的那件事。HN 还有人补了一个背景:论文一作曾在 Doudna 实验室研究 CRISPR 起源,博士毕业后加入 Anthropic(评论者转述,二手)。

HN 有人把商业逻辑摆上台面:一个给癌症研究者用的 chatbot,估值只值个位数十亿美元;Anthropic 的估值叙事建立在「能替代多数知识工作」上。生物发现、数学证明、agent 能力报告,都是这个叙事的证据链。还有一层更实际的:高风险能力模型不会放出 API,只会在内部用。实验室就是内部能力的展示窗口。

生物安全立场与内部放开之间有条裂缝

Anthropic 对外讲过最重的生物风险话术。Dario 9 月 13 日的「We Must Pace the Frontier」把生物能力列为减速理由之一;普通产品里,生物任务默认被挡——LSVP 官方页原话:「currently blocked in our generally available Fable models」。

对内是另一套。自家湿实验室用高能力模型做 drug discovery 和 research biology;LSVP 把「验证过」的第三方也放进来。HN 的梗图式总结流传最广:「Anthropic: You absolutely cannot, under any circumstances, use Claude for bio-engineering. It could literally end humanity. Also Anthropic: Claude discovers a new way to edit your genome!」辩护方的论据也站得住:对内用和对外放是两回事,一家公司信任自己、不信任陌生人,是理性行为。

硌人的是流程本身。LSVP 的验证——研究资历、安全标准、伦理审查——由 Anthropic 自己执行。谁验证「验证者」,文件里没有答案。Dario 在 X 上还留了一句远期:「eventually it may even be possible for Claude itself to safely perform the experiments by autonomously controlling lab equipment」。护栏的边界,正在从「人类科学家做实验」往「agent 自己做实验」移动。同一家公司,一边说生物能力是减速理由,一边训练模型去做药物发现。

也有用户把两件事焊在一起看:「Where did the doomsday fear go now?」上周还在谈减速、谈生物风险,这周自家实验室就在做基因编辑系统。安全立场如果只约束外部、不约束内部,它就从原则变成了公关。

这条裂缝比 ART 的功能更值得盯。当「内部高能力」和「对外护栏」焊在同一家公司里,裂缝往哪边开,就不再是科学问题,是政策问题。

三条今天能做的动作。第一,打开 preprint 的 Methods 页,找对照:有没有和传统 genome-mining pipeline 的对比实验;再翻目录,Supplementary Note 1 有没有真的公开。第二,给 ART 建一张验证清单:短 RNA 表达之外,等一个功能实验——切割、复制、粘贴,任一出现都算数。第三,下次看到「AI 发现 X」的标题,先核三件事:对象是否已知,功能是否验证,有无对照。三条都过,再谈惊喜。