一个「壮观」的瞬间
9 月 23 日,Anthropic 发布了一篇分量不轻的公告:Claude 在科学家只提供高层指令的前提下,自主发现了一种新型酶系统——阵列相关逆转录酶(ART)。公告里最动人的细节是某个 Agent 的工作记录:它在梳理解一段 RT 基因旁边的原始 DNA 序列时,「凭肉眼」看到了规律排布的串联重复阵列,随后在笔记里写道:这段序列很壮观,我能直接看到串联重复阵列,这是一个 CRISPR 类的重复序列?接着它像人类科学家一样自主行动:数重复次数、测间距、对比已知 RT 系统的布局、检索文献确认没有先例,最后确信自己发现了新系统,提交报告等待人类审查。
这一段值得反复读。它展示的不是「模型答对了考题」,而是一个 Agent 在没有任何人类提示的方向上,产生了观察、假设、查证、自我确信的完整链条。
ART 的构成也值得说清楚:核心是一个在巨型噬菌体中发现的逆转录酶,辅以旁侧的伴侣基因、一长串均匀间隔的非编码 DNA 重复序列阵列,外加一个功能未知的辅助蛋白。逆转录酶本身此前就被鉴定过,但 Claude 第一次注意到这套系统级的组合特征——单独看每一个部件都不新鲜,新鲜的是它们总是一起出现,而这种「一起出现」正是可编程分子机器的典型指纹。初步实验表明 ART 阵列会表达为一组不同的短 RNA,模式与 CRISPR 阵列的表达方式相似,暗示其功能可能与 CRISPR 一样具有可编程性,具体机制还在研究中。
数字背后的流水线
先把规模摆清楚:这次发现动用了约 950 个 Claude Agent,并行工作 21 小时,消耗 2.1 亿 token。它们从公共数据库中收集了超过 20 万条逆转录酶序列,筛出 3500 个不符合任何已描述系统的新候选,最终收敛到 20 个最引人注目的候选并生成报告——ART 就在其中。
这条漏斗背后的工作流有五个环节,环环都有设计巧思:
- 文献复现校准:Agent 先阅读文献,用公共数据复现已知结果,验证自己的方法没有系统性偏差。这是多数 AI 科研尝试会跳过的一步,也是科学品味的起点——你得先证明自己能找到已知的东西,才有资格找未知的东西。
- 全库异常扫描:在 20 多万条序列里搜索不符合任何已描述系统的家族成员和基因组邻居。这一步是纯算力密度游戏,950 个并行 Agent 的价值在这里最大化。
- 报告即交付物:每个候选生成一份简短的人类可读报告,提出功能假设并列出证据。报告取代了传统流水线里的中间数据表,成为人类与 Agent 之间、以及 Agent 与 Agent 之间的标准接口。
- 自我批判淘汰:后续分析轮次对候选做批判性评估,3500 到 20 的收敛主要发生在这一步。大多数候选死于自我批判,而不是人类的否决。
- 人类审核门:20 份报告交给人类科学家,决定哪些值得进湿实验。
人类的位置:品味,而不是苦力
公告里有一句话值得划线:所有实验室工作由人类科学家执行。Claude 负责计算端的一切,人类负责湿实验端的一切,两者在「审查报告、决定测什么」这个接口上会合。更有意思的是反馈方向——人类会把「哪些假设值得测试」的判断反哺给 Claude 的指令,让模型模仿人类的科学品味。这不是简单的自动化替代,而是品味传递:稀缺资源不再是算力和文献阅读时间,而是「什么问题值得问」的判断力。
安全边界同样清晰:湾区实验室只做 BSL-1 和 BSL-2 级别的研究,不处理能感染人类的病原体;虽然团队尝试过用模型硬件标准加速湿实验,但判断当前分子生物学并不适配,湿实验仍完全由人类操作。模型侧的生命科学验证计划为专业人员提供带精炼防护的访问权限。
对 Agent 系统设计的三点启示
第一,报告是比数据库更好的中间表示。 3500 个候选如果存成结构化表格,下一轮批判时每个 Agent 都要重新理解上下文;而人类可读的报告天然携带假设与证据链,既方便人审,也方便 Agent 批判。Anthropic 用自研 harness 协调并行会话,接口就是这些报告。
第二,自我批判的收敛效率惊人。 从 3500 到 20 的压缩比接近百分之一,且主要发生在 Agent 互评环节。这印证了一个正在形成的共识:多 Agent 流水线的价值不在并行产量,而在批判轮次的质量。
第三,「能测量就能加速」正在从工程走向科学。 Anthropic 同期发布的另一篇博客讲的是 Claude 测量自身开发流程并加速它;这次的生命科学发现是同一原则在科研域的投影——当 Agent 能对候选质量建立可操作的度量,漏斗就能自动收敛。
ART 的具体功能还没有确定,初步实验只确认了重复阵列会表达为短 RNA。但这次发布真正的产品可能不是某个酶,而是那条流水线本身:文献复现、异常扫描、报告交付、自我批判、人类把关——五个环节,每一环都可以被其他领域的科研团队直接借用。