
早期生物医学AI的能力其实非常明确。
大约在2012-2020年,以卷积神经网络(convolutional neural network, CNN)为代表的模型主要解决的是模式识别(pattern recognition)问题。
输入一张眼底照片,判断是否存在糖尿病视网膜病变;输入测序数据,识别遗传变异;输入一个未经表征的变异,预测其致病可能性。
这类任务有一个共同特点:
|
问题由人提出,数据由人准备,评价标准也由人确定。AI负责完成其中某一个步骤。 |
随后,AlphaFold等生成式模型改变了这一模式。
AlphaFold2在2020年的CASP14竞赛中实现了接近实验水平的蛋白结构预测精度。之后,ESMFold、RFdiffusion以及AlphaFold 3等系统继续扩展AI在结构预测、蛋白设计和分子相互作用中的能力。
AI从“这个图像属于哪一类”,走到了“这个蛋白可能长什么样”。
但即便如此,一个核心环节仍然掌握在人手中:
研究人员决定要研究哪个蛋白、哪个问题,以及为什么值得研究。
今天出现的智能体AI试图再向前一步——不仅解决问题,还参与形成问题。
Co-Scientist采用的是多智能体(multi-agent)架构。
它不是让一个模型一次性给出答案,而是设置多个承担不同任务的AI智能体:有的生成假设,有的查阅文献,有的进行批判性评价,还有的负责比较不同假设。
更有意思的是,这些假设之间还要进行类似“锦标赛”的竞争。
系统一次比较两个假设,由Ranking agent判断哪一个更值得推进,并通过类似国际象棋Elo评分的方法不断更新排序。表现较好的假设进入下一轮,同时继续被修改和挑战。
计算资源因此不只是用来“再生成几个答案”,而是被用于扩大假设空间、反复评价和自我修正。
这被称为测试时计算(test-time compute)。
它与传统语言模型一个明显的差异在于:过去模型给出一个答案,计算基本结束;现在的系统可以继续问自己:
|
证据够不够? 有没有相反结果? 是否存在更合理的机制? 实验上能不能验证? |
在急性髓系白血病(acute myeloid leukemia, AML)的案例中,Co-Scientist提出了药物再利用候选KIRA6——一种IRE1α抑制剂。此前它并没有被提出用于AML药物再利用。在患者来源细胞系中,KIRA6表现出选择性肿瘤抑制作用,其杀伤白血病细胞所需浓度最低可以比杀伤对照细胞低约18倍。
系统还提出过肝纤维化相关的表观遗传靶点,并在另一个任务中独立推导出一个当时尚未发表的噬菌体相关染色体岛基因转移机制。
从形式上看,这已经和普通的“问AI一个问题”非常不同。
AI开始搜索候选解释,并主动尝试判断哪些解释更值得实验验证。
如果说Co-Scientist主要展示了AI如何生成和筛选假设,那么Robin试图把AI进一步接入实验后的分析环节。
Robin由三个分工不同的智能体组成。
Crow负责较浅层的大范围文献搜索;Falcon进行更深入的文献分析;Finch负责实验数据分析。
在针对干性年龄相关性黄斑变性(dry age-related macular degeneration, dAMD)的研究中,Robin首先检索和分析了151篇论文,提出了10个具有生物学意义的机制方向。
随后,Crow又调查了大约400篇论文,提出30个已有药物作为实验候选。
经过模型排序和人工筛选,候选药物进入实验验证。研究过程中,研究人员最终在两轮实验中检测了15个候选,并确认了两个具有相应效应的药物:ripasudil和KL001。
这还不是最值得关注的部分。
当人类实验人员完成视网膜色素上皮细胞(retinal pigment epithelium, RPE)实验之后,Robin继续分析RNA测序(RNA-seq)数据,并提出脂质转运蛋白 ABCA1上调可能是相关机制之一。
于是,一个循环开始形成:
|
文献 → 假设 → 实验 → 数据 → 新机制。 |
AI第一次不再只处在研究流程中的某一个孤立节点。
Biomni的设计思路又完全不同。
它没有让多个智能体相互竞争,而是构建一个通用型生物医学智能体(general-purpose biomedical agent),让AI能够直接调用数据库、软件包和分析工具完成任务。
为了建立Biomni-E1环境,开发者从25个bioRxiv研究领域的2500篇论文中整理资源,最终集成了:
|
150个专业生物医学工具、105个软件包和59个数据库。 |
当用户提出问题后,Biomni会先进行检索增强规划(retrieval-augmented planning),寻找可能需要的资源,再生成步骤化方案。
关键区别在于,它随后不是单纯“描述应该怎么做”,而是通过代码执行(code-as-action)直接完成这些步骤。
数据库查询、数据处理、循环分析、条件判断,都可以成为智能体行动的一部分。
这使AI开始从“告诉研究人员如何分析”转向“自己执行分析流程”。
在Biomni-Eval1中,研究团队使用433个问题、覆盖10类生物医学任务进行评价。将底层模型规模从80亿参数提高到320亿参数后,基准任务表现出现了约10个百分点的绝对提升。
但这个结果也留下了一个重要问题:
在有标准答案的任务里,模型变大可以提高得分;可在一个没人知道正确答案是什么的研究问题中,增加计算量是否仍然能够带来更好的假设?
答案目前并不明确。
智能体AI的演示结果确实令人印象深刻,但现阶段的验证仍存在一个重要方法学问题。
例如,Co-Scientist曾在34种癌症中搜索2300种已批准药物用于药物再利用,但最终只有少量候选进入体外实验;其中3个显示一定活性,1个表现尤其值得进一步研究。
Robin最初生成30个dAMD治疗候选,最终实验检测15个,并确认2个候选。
问题来了。
如果AI生成了100个候选,而人类专家从中选择最有希望的5个进行实验,其中2个成功,那么这究竟说明了什么?
是AI排序能力很强?
还是AI很擅长“大量生成”,而人类研究人员很擅长从中挑出值得验证的候选?
两者对应的技术含义完全不同。
因此,仅仅展示几个成功案例还不足以回答智能体AI最关键的问题:
|
它究竟提高了发现的准确率,还是主要提高了候选生成速度? |
文章提出了一个很重要的反问:
更多自主性(autonomy)是否一定意味着更好的研究?
2026年的另一项研究提供了一个有意思的对照。
研究人员并没有让AI控制整个CAR-T靶点发现流程,而只是让GPT-4o、Claude-3.7和Gemini-2.5-Pro参与一个严格限定的多指标评分环节。
三个模型分别进行了1000次独立模拟,最终都频繁选择GPNMB作为候选靶点。
随后,人类团队完成CAR结构构建和实验验证,并在3种异种移植模型中观察到抗肿瘤活性。
几乎同期,两个完全独立、并非依赖这种AI流程的研究团队,也通过蛋白基因组学和多组学策略分别锁定了GPNMB。
其中一个首次人体治疗病例在3个月内维持疾病稳定,肺部病灶数量下降52%,且没有出现细胞因子释放综合征或神经毒性;另一项胶质母细胞瘤研究中,动物模型的疾病控制时间超过160天。
这说明一个值得思考的问题:
AI未必必须掌控整个研究流程才有价值。
一个受到明确限制、被安置在人类设计流程中的AI模块,同样可能产生很高的研究价值。
如果把智能体AI继续向前推进一步,就会出现所谓自主实验室(autonomous laboratory)或自驱动实验室(self-driving laboratory)。
理想状态下,它形成一个闭环:
|
AI生成假设,机器人执行实验,系统自动分析结果,再根据结果调整下一轮实验。 |
化学和材料领域已经能够利用机器人连续合成和表征大量候选化合物。
生命科学也开始出现类似尝试。
一个闭环系统曾自动完成细胞衰老实验,并发现抑制TRAF2- and NCK-interacting kinase(TNIK)可能产生senomorphic效应。值得注意的是,另一个独立的AI药物研发体系也锁定了TNIK,其相关候选药物rentosertib(ISM001-055)已经报告特发性肺纤维化(idiopathic pulmonary fibrosis)的IIa期临床结果。
这提示了一个容易被忽视的问题。
生命科学研究的瓶颈很多时候并不是“没有足够多的假设”。
真正慢的是实验。
细胞培养需要时间,试剂需要准备,实验需要优化,失败后还需要重新调整。
因此,未来最有影响力的研究AI,未必是“推理最复杂”的系统,而可能是能最快完成“假设—实验—结果—再实验”循环的系统。
问题在于,生命系统本身并不像棋盘。
围棋的胜负标准非常明确,因此AlphaGo可以通过搜索更多可能性找到更好的落子。
生命科学没有这样的目标函数(objective function)。
一个假设在文献上非常合理,实验结果却可能完全不同。
同一个基因,在不同细胞、组织、疾病状态甚至培养条件下,都可能表现出不同功能。
批次效应(batch effect)、微环境变化、细胞状态、遗传漂变以及实验操作差异,都可能改变结果。
这意味着一个智能体即使能够完美总结已有文献,也不能由此推出它一定能够预测生物学现实。
文章对此给出了一句非常重要的判断:
|
忠实于科学文献,并不等于忠实于生物学现实。 |
这一点对于任何尝试把大语言模型用于生命科学研究的人,都值得反复思考。
多智能体系统还有一个非常容易被误解的问题:共识幻觉(illusion of consensus)。
如果五个“专家智能体”实际上来自同一个基础模型,只是使用了稍微不同的提示词,那么五个智能体得出相同结论,并不等于五个独立专家进行了验证。
它们可能共享相同的训练数据、偏倚和知识缺口。
AI互相同意,并不是正确性的证据。
甚至一个程序成功运行,也不能证明分析方法正确。
Biomni这类系统通过代码执行可以减少部分文本幻觉,但新的风险随之出现:统计检验可能选择错误,分析方法可能被用在不适合的数据条件下,或者程序正确执行了一个生物学上并不合理的流程。
|
“代码跑通”与“结论可靠”是两件不同的事。 |
传统医学AI有比较清楚的评价方法。
敏感度(sensitivity)、特异度(specificity)、ROC曲线下面积(area under the ROC curve, AUC),都可以和已知答案比较。
但一个AI提出“某个蛋白可能是一个此前未知的疾病靶点”时,标准答案在哪里?
没有。
只有做实验之后,答案才逐渐出现。
这也是科学发现型AI与诊断AI最大的区别之一。
目前,包括Biomni-Eval1在内的基准主要评价智能体能否完成具有标准答案的计算任务。
但“它能不能提出一个此前没人想到、而且最终被证明有价值的假设”,目前还缺少成熟的系统评价方法。
作者因此提出,未来至少应该公开:
AI一共生成多少假设,其中多少进入实验,最终多少得到验证,同时公开完整候选池以及AI原始排序。
只有这样,才能逐步判断一个系统究竟是在大量生成后依赖人工筛选,还是具备稳定的自主优先级判断能力。
如果文献检索、代码分析、数据处理甚至假设生成越来越容易自动化,那么研究能力的区分度可能逐渐发生变化。
过去,一个研究人员的重要能力之一是快速获取信息。
以后,更重要的问题可能变成:
|
你能否提出一个值得研究的问题? 你能否发现AI分析中的隐蔽错误? 当结果与预期完全相反时,你会选择忽略它,还是意识到原来的假设可能错了? |
今天的智能体AI擅长在已有知识之间建立连接,并快速扩大候选空间。
但文章同时强调,它们尚未表现出完整意义上的科学判断力(scientific judgment):例如如何权衡不同研究方向的重要性、如何理解证据的限制、如何对研究后果承担责任,以及如何判断一个统计学上显著的结果是否已经达到足够的科学可信度。
这也解释了为什么研究人员不应该把AI理解为一个“自动答案生成器”。
更准确的理解或许是:
|
AI正在让“提出一个看似合理的假设”变得越来越便宜,而判断这个假设值不值得相信、值不值得投入实验,正在变得更加重要。 |
过去,研究人员可能花数周阅读文献,才形成几个候选机制。
未来,一个智能体系统可能在几小时内生成几十甚至几百个候选,并为每个候选附上文献、机制解释和实验设计。
表面上看,研究效率大幅提高。
但这会制造一种新的稀缺资源:
不是idea,而是高质量判断。
哪个假设值得花几十万元验证?
哪个统计结果看似漂亮,却可能由批次效应造成?
哪个AI给出的解释虽然文献充分,却忽略了细胞类型差异?
哪个异常结果不应该被当作“实验失败”删除,而可能暗示整个理论框架需要重新考虑?
这些问题暂时很难通过简单扩大模型参数或增加计算量解决。
因此,这篇Cell文章所描述的未来,并不是“AI取代研究人员”。
更值得关注的是一种新的研究分工正在形成:
|
AI负责快速搜索、组合、生成和执行; 人类负责提出值得回答的问题、识别错误、理解异常结果,并决定哪些方向值得继续。 |
当AI可以生成越来越多“合理答案”时,研究工作的核心能力可能恰恰变成一件更传统的事情:
|
知道什么时候应该相信它,以及什么时候不应该相信它。 |
参考文献