想象一下:你让AI在一座堆满旧零件的仓库里寻找新机器。真正困难的往往不是认出零件,而是某次搜索时,它会不会停下来查看零件旁边那排不起眼的刻痕。Anthropic称,Claude正是在海量DNA数据中多看了一眼,找到一个与重复序列相连的逆转录酶系统。这件事值得关注,不只因为候选系统可能有新的生物学用途,也因为AI的角色正在从整理资料,变成主动筛选异常、提出假说。不过,目前成果仍是预印本和机构自述,尚无材料显示它已通过同行评审或外部实验复现。
它到底看见了什么?
这个系统的核心是一种逆转录酶(reverse transcriptase,RT)——能以RNA为模板合成DNA的酶。它存在于jumbo phage,也就是一种噬菌体;噬菌体是感染细菌的病毒。
RT本身并非Claude首次发现,先前研究已经记录过它。Anthropic主张的新意,是Claude注意到这个RT基因附近还有两样东西:一组串联排列的非编码DNA重复序列,以及一个功能未知的辅助蛋白(accessory protein)。研究团队把这类组合称为array-associated reverse transcriptases,简称ART。
Anthropic把这些重复序列形容为“CRISPR式”。这里需要踩一下刹车。CRISPR原本是细菌和古菌抵抗病毒的天然免疫系统,其成簇重复DNA后来被改造成基因编辑工具。但“CRISPR式”在这里仅指序列排列看起来相似,不代表ART已经被证明能够进行CRISPR基因编辑。
Anthropic还说,这组特征只在少数其他系统中同时出现,而那些系统可以执行切割、复制或粘贴DNA等操作。这是一条寻找方向,不是ART功能已经得到验证。Anthropic明确表示,团队还不知道ART的主要功能。
难点不是看懂,而是决定看哪里
研究人员给Claude一个高层目标:到庞大的DNA序列数据库中寻找值得研究的新RT。自主AI Agent——能够把目标拆成多步、调用数据库和分析工具并继续追查的系统——随后调查不同RT家族,自行筛选异常候选。
据Anthropic披露,这轮计算搜索持续约21小时,动用了约950个agents和2.1亿tokens。最终,一个agent没有停在数据库摘要,而是直接阅读酶基因附近的原始DNA,于是认出了重复阵列。
这个过程带有明显的偶然性。根据Anthropic技术报告及The Next Web转述的重跑结果,研究人员后来把同一流程又运行了10次。多数重跑都接触过ART相关序列,两次甚至深入调查了同一谱系,却没有一次再次读到关键的上游DNA,因此都错过了重复阵列。反过来,如果把正确序列直接交给模型,较强模型的识别率可以超过90%。
换句话说,Claude未必缺少识别图案的能力。更难的问题是:面对浩瀚数据,它会不会恰好决定把某段上下文展开来看。这也让“自主发现”显得比宣传口号复杂。AI完成了大规模搜索并挑出线索,但发现仍取决于任务设定、数据入口,以及一次不稳定的搜索路径。
AI进了实验室,但还没接管实验台
Anthropic在2026年春季组建生命科学研究团队,并在旧金山湾区运营湿实验室。湿实验室指真正处理样本、试剂和仪器的实验环境。它负责把Claude从DNA数据中提出的候选,变成可以实测的生物学问题。
这次工作的边界很清楚。Anthropic称,人类只在开始时给出提示,并负责后续实验;Claude agents承担序列搜索、家族调查和候选判断。公司因此使用了“自主发现”的说法。TechCrunch则转述CEO Dario Amodei较弱的表述:工作“主要、但并非完全”由Claude完成。两种口径并不完全相同。
实体实验也没有交给模型。Anthropic表示,所有湿实验均由人类科学家完成,实验室只开展BSL-1和BSL-2研究,不处理能够感染人类的病原体。团队尝试过让AI配合标准化实验硬件,但分子生物学研究常要临场调整,固定流程并不合适。现阶段的分工仍很传统:AI在序列空间里漫游,人类把少数可疑线索带回实验台。
为什么这件事值得盯住?
过去谈AI辅助科研,最容易展示的是读论文、归纳知识和生成候选答案。这次案例往前走了一步:模型不仅总结已有记录,还在原始DNA上下文中注意到一个此前未被系统描述的关联,把RT、重复阵列和辅助蛋白拼成了一个可检验的假说。
但这还不是“AI独立成为生物学家”。Amodei承认,Stanford团队发现过某种相似系统;RT本身也已有研究记录。真正的新意有多大,要等更广泛的研究共同体判断。比“谁先发现”更重要的问题,是这种工作流能否稳定复现:AI能否反复找到值得实验的异常,而不是靠数百个agents中偶然一次回头细看。
局限与未知
- ART的实际生物学功能尚不清楚,不能把其他相似系统的能力直接算到它头上。
- “novel”“discovered”和“autonomously”主要来自Anthropic的表述;现有材料没有外部实验复现或同行评审结果。
- 21小时、约950个agents和2.1亿tokens等运行数字也来自项目方披露,尚缺独立核验。