Long-form

21 小时、950 个 Agent、20 万条序列:拆解 Claude 自主发现新酶系统的完整链路

4 min read ·

一个「壮观」的瞬间

9 月 23 日,Anthropic 发布了一篇分量不轻的公告:Claude 在科学家只提供高层指令的前提下,自主发现了一种新型酶系统——阵列相关逆转录酶(ART)。公告里最动人的细节是某个 Agent 的工作记录:它在梳理解一段 RT 基因旁边的原始 DNA 序列时,「凭肉眼」看到了规律排布的串联重复阵列,随后在笔记里写道:这段序列很壮观,我能直接看到串联重复阵列,这是一个 CRISPR 类的重复序列?接着它像人类科学家一样自主行动:数重复次数、测间距、对比已知 RT 系统的布局、检索文献确认没有先例,最后确信自己发现了新系统,提交报告等待人类审查。

这一段值得反复读。它展示的不是「模型答对了考题」,而是一个 Agent 在没有任何人类提示的方向上,产生了观察、假设、查证、自我确信的完整链条。

ART 的构成也值得说清楚:核心是一个在巨型噬菌体中发现的逆转录酶,辅以旁侧的伴侣基因、一长串均匀间隔的非编码 DNA 重复序列阵列,外加一个功能未知的辅助蛋白。逆转录酶本身此前就被鉴定过,但 Claude 第一次注意到这套系统级的组合特征——单独看每一个部件都不新鲜,新鲜的是它们总是一起出现,而这种「一起出现」正是可编程分子机器的典型指纹。初步实验表明 ART 阵列会表达为一组不同的短 RNA,模式与 CRISPR 阵列的表达方式相似,暗示其功能可能与 CRISPR 一样具有可编程性,具体机制还在研究中。

数字背后的流水线

先把规模摆清楚:这次发现动用了约 950 个 Claude Agent,并行工作 21 小时,消耗 2.1 亿 token。它们从公共数据库中收集了超过 20 万条逆转录酶序列,筛出 3500 个不符合任何已描述系统的新候选,最终收敛到 20 个最引人注目的候选并生成报告——ART 就在其中。

这条漏斗背后的工作流有五个环节,环环都有设计巧思:

  1. 文献复现校准:Agent 先阅读文献,用公共数据复现已知结果,验证自己的方法没有系统性偏差。这是多数 AI 科研尝试会跳过的一步,也是科学品味的起点——你得先证明自己能找到已知的东西,才有资格找未知的东西。
  2. 全库异常扫描:在 20 多万条序列里搜索不符合任何已描述系统的家族成员和基因组邻居。这一步是纯算力密度游戏,950 个并行 Agent 的价值在这里最大化。
  3. 报告即交付物:每个候选生成一份简短的人类可读报告,提出功能假设并列出证据。报告取代了传统流水线里的中间数据表,成为人类与 Agent 之间、以及 Agent 与 Agent 之间的标准接口。
  4. 自我批判淘汰:后续分析轮次对候选做批判性评估,3500 到 20 的收敛主要发生在这一步。大多数候选死于自我批判,而不是人类的否决。
  5. 人类审核门:20 份报告交给人类科学家,决定哪些值得进湿实验。

人类的位置:品味,而不是苦力

公告里有一句话值得划线:所有实验室工作由人类科学家执行。Claude 负责计算端的一切,人类负责湿实验端的一切,两者在「审查报告、决定测什么」这个接口上会合。更有意思的是反馈方向——人类会把「哪些假设值得测试」的判断反哺给 Claude 的指令,让模型模仿人类的科学品味。这不是简单的自动化替代,而是品味传递:稀缺资源不再是算力和文献阅读时间,而是「什么问题值得问」的判断力。

安全边界同样清晰:湾区实验室只做 BSL-1 和 BSL-2 级别的研究,不处理能感染人类的病原体;虽然团队尝试过用模型硬件标准加速湿实验,但判断当前分子生物学并不适配,湿实验仍完全由人类操作。模型侧的生命科学验证计划为专业人员提供带精炼防护的访问权限。

对 Agent 系统设计的三点启示

第一,报告是比数据库更好的中间表示。 3500 个候选如果存成结构化表格,下一轮批判时每个 Agent 都要重新理解上下文;而人类可读的报告天然携带假设与证据链,既方便人审,也方便 Agent 批判。Anthropic 用自研 harness 协调并行会话,接口就是这些报告。

第二,自我批判的收敛效率惊人。 从 3500 到 20 的压缩比接近百分之一,且主要发生在 Agent 互评环节。这印证了一个正在形成的共识:多 Agent 流水线的价值不在并行产量,而在批判轮次的质量。

第三,「能测量就能加速」正在从工程走向科学。 Anthropic 同期发布的另一篇博客讲的是 Claude 测量自身开发流程并加速它;这次的生命科学发现是同一原则在科研域的投影——当 Agent 能对候选质量建立可操作的度量,漏斗就能自动收敛。

ART 的具体功能还没有确定,初步实验只确认了重复阵列会表达为短 RNA。但这次发布真正的产品可能不是某个酶,而是那条流水线本身:文献复现、异常扫描、报告交付、自我批判、人类把关——五个环节,每一环都可以被其他领域的科研团队直接借用。

Frequently asked questions

Claude 发现的 ART 系统到底是什么?
ART 指阵列相关逆转录酶(array-associated reverse transcriptases)。它由三部分组成:逆转录酶本身、旁侧的伴侣基因,以及一长串均匀间隔的非编码 DNA 重复序列阵列,外加一个功能未知的辅助蛋白。初步实验表明这个重复阵列会表达为一组不同的短 RNA,模式与 CRISPR 阵列类似,暗示可能存在类似 CRISPR 的可编程机制,具体功能还在研究中。
整个发现过程中人类做了什么?
人类科学家的角色有三块:给出初始研究方向(一句让 Claude 去数据库里找有趣的逆转录酶例子的高层指令)、审查 Claude 提交的候选报告并决定哪些进入实验、执行全部湿实验(表达蛋白、做生化与结构表征)。反馈闭环里,人类还把「哪些假设值得测试」的判断反哺给 Claude 的指令,训练其模仿人类的科学品味。
这次用到的安全边界是什么?
实验室位于湾区,只开展 BSL-1 和 BSL-2 级别的研究,明确不处理能感染人类的病原体。湿实验的工作流目前完全由人类执行,AI 与实验物理隔离。模型侧另有生命科学验证计划(LSVP),为专业人员提供带精炼防护的模型访问。成果以预印本形式公开。
为什么说这次发现的方法论意义大于单点成果?
因为它完整跑通了一条可复用的 AI 科研流水线:文献复现校验方法、全库扫描找异常、逐候选写报告、自我批判淘汰、人类审核把关。ART 的具体功能还未确定,但这条流水线本身就是方法论贡献——它证明了大规模并行 Agent 加上人类品味反馈,能在真实科学数据里找到人类漏掉的系统级模式。
950 个 Agent 是怎么协作的?
Anthropic 用 Claude Science、Claude Code 加一个自研 harness 来协调大量并行 Claude 会话。每个 Agent 负责一块序列空间的挖掘与报告,产出人类可读的候选报告供后续轮次批判与筛选。报告是中间的标准交付物:可被人类审查,也可被其他 Agent 引用与自我批判,这取代了传统流水线里的中间数据表。
// next.txt ›

Some outbound links in this post are affiliate links — see disclosure.