首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Cell | 中南大学李敏团队联合腾讯AI for Life Sciences Lab姚建华团队推出UniPert-G2CP:连接遗传与化学筛选的统一表型建模框架

Cell | 中南大学李敏团队联合腾讯AI for Life Sciences Lab姚建华团队推出UniPert-G2CP:连接遗传与化学筛选的统一表型建模框架

作者头像
DrugOne
发布2026-07-28 14:45:34
发布2026-07-28 14:45:34
3970
举报
文章被收录于专栏:DrugOneDrugOne

人工智能虚拟细胞(Artificial Intelligence Virtual Cell,AIVC)的核心目标之一,是利用计算模型模拟不同分子扰动在复杂细胞环境中的表型变化。然而,长期以来,遗传筛选与化学筛选由于扰动对象、分子表示方式、实验体系及数据规模存在显著差异,始终缺乏统一的建模框架,限制了人工智能在药物发现、作用机制解析和精准医学中的进一步应用。针对这一挑战,中南大学李敏团队联合腾讯AI for Life Sciences Lab姚建华团队提出了UniPert-G2CP框架,通过统一遗传扰动与化学扰动的分子表征,并构建遗传筛选向化学筛选的迁移学习机制,实现了从分子扰动到细胞表型的统一因果建模。该框架首先构建UniPert多模态分子表征模型,将蛋白质和小分子映射至统一语义空间;随后提出遗传到化学扰动迁移学习模型G2CP,利用规模更大的CRISPR遗传筛选数据提升化学筛选预测能力。研究团队在大规模单细胞转录组、细胞形态学筛选和LINCS等多个公开数据集上进行了系统验证,结果表明,UniPert-G2CP能够显著提升未知扰动的预测精度和模型泛化能力,并揭示不同细胞背景下药物作用机制及耐药性的异质性,为人工智能虚拟细胞构建、药物研发和精准医学提供了统一的计算框架。

近年来,高通量遗传筛选和化学筛选已成为解析疾病机制、寻找药物靶点以及开展精准医学研究的重要技术。CRISPR筛选能够系统评估数千个基因对细胞状态的影响,而化学筛选则通过大量小分子药物寻找能够调控疾病表型的候选化合物。如果能够统一分析两类扰动产生的细胞响应,就有望建立从分子作用到细胞行为变化的完整因果模型,实现人工智能驱动的药物发现。

然而,目前遗传筛选和化学筛选之间仍存在三方面障碍。首先,两类实验的数据规模极不平衡。CRISPR筛选能够一次完成全基因组范围实验,而化学空间包含数百万乃至数十亿潜在化合物,目前实验能够覆盖的仅是极小部分。其次,两类扰动对象具有完全不同的分子结构。蛋白质通常由氨基酸序列表示,而小分子则依赖SMILES或分子图描述,缺乏统一表示方式,导致跨领域知识无法共享。最后,不同细胞类型对同一种扰动往往产生不同响应,高度异质性的细胞环境进一步增加了模型泛化难度。

近年来,蛋白质语言模型、小分子基础模型以及单细胞扰动预测模型不断发展,但大多数方法仍局限于单一扰动类型,缺乏连接遗传筛选和化学筛选的统一框架。研究人员认为,遗传扰动和化学扰动本质上都会作用于共同的生物学通路,因此完全可以建立统一分子空间,再利用遗传筛选的大规模知识提升化学筛选预测能力,从而实现跨领域迁移学习和统一因果建模。

方法

研究提出两阶段人工智能框架UniPert-G2CP。第一阶段构建UniPert多模态分子表示模型,分别利用蛋白质语言模型、序列比对、图神经网络以及扩展连接指纹等技术,对蛋白质和小分子进行编码,再结合对比学习建立统一分子语义空间,使遗传扰动和化学扰动能够映射到共同表示空间。第二阶段提出G2CP迁移学习框架,首先利用大规模CRISPR遗传筛选数据预训练细胞扰动模型,使模型学习不同细胞背景下遗传扰动产生的响应规律;随后利用有限化学筛选数据进行微调,实现从遗传筛选向化学筛选的知识迁移。研究进一步在Perturb-seq、sciPlex3、LINCS及Cell Painting等多个公开数据集上,对未知基因扰动、未知药物扰动、跨细胞泛化以及药物作用机制解析进行了全面评估。

结果

UniPert建立统一的遗传扰动与化学扰动分子表示空间

研究首先构建UniPert模型,希望解决遗传扰动与化学扰动长期缺乏统一表示的问题。对于小分子,UniPert首先利用扩展连接指纹提取分子拓扑信息,再进一步学习能够反映功能基团特征的深层表示。对于蛋白质,则综合蛋白质语言模型、序列比对以及图神经网络,既保留蛋白整体结构信息,也强化局部保守序列和功能结构域特征。

随后,研究人员利用超过5万组已知化合物—蛋白靶点相互作用数据进行跨模态对比学习,使具有真实结合关系的小分子和蛋白质在统一空间内更加接近,而无关分子则自动拉开距离。

最终得到的UniPert统一分子空间不仅能够同时表示蛋白质和小分子,而且能够直接反映它们在生物学通路中的功能关系,为后续遗传筛选与化学筛选之间建立联系奠定基础。

图1: UniPert-G2CP总体框架:统一分子表示与遗传—化学迁移学习流程。

UniPert能够学习具有生物学意义的分子表示

为了验证统一表示是否真正具有生物学意义,研究人员首先分析药物作用机制分类。

结果发现,UniPert生成的分子表示能够更加准确地区分不同药物作用机制。例如,同属于GABA受体正向变构调节剂的一组药物,在传统分子指纹中由于结构差异较大,相似性很低;而UniPert能够将这些作用于同一受体不同结合位点的药物自动聚集到一起,更好反映真实药理机制。

随后,研究进一步分析蛋白质表示能力。相比ESM等蛋白质语言模型,UniPert能够更加准确地区分蛋白质家族及药理学分类,在多个层级分类任务中均取得明显更高聚类性能。特别是在蛋白质超家族、家族及亚家族层面,UniPert均能够保持更加清晰的聚类结构。

研究人员进一步分析此前缺乏功能注释的蛋白质。结果发现,UniPert能够自动将多个未注释蛋白聚集到相应功能家族附近。例如,FOXM1被自动聚集到驱动细胞周期调控的KIF蛋白家族附近,而PD-1和PD-L1也自然形成共同聚类,与其真实蛋白互作关系高度一致。

此外,UniPert还能识别蛋白质保守功能基序。相比传统蛋白质语言模型,其学习到的表示更容易富集激酶等重要功能区域,说明模型不仅学习序列相似性,还能够学习功能相关结构特征。

这些结果说明,UniPert建立的统一表示空间不仅能够连接蛋白质和小分子,还具有较好的可解释性和生物学意义。

图2: UniPert统一分子表示空间及药物、蛋白质功能聚类结果。

UniPert显著提高未知遗传扰动和未知药物扰动预测能力

随后,研究人员进一步评估UniPert对扰动预测模型的提升效果。

首先,在单基因扰动预测任务中,研究人员将UniPert分别集成至GEARS等主流单细胞扰动预测模型。结果显示,无论采用Pearson相关系数还是差异表达基因预测准确率评价,UniPert均取得最佳结果。当预测此前从未出现过的新基因扰动时,模型依然能够准确恢复扰动后的转录组变化,明显优于原始GEARS模型。

随后,研究进一步挑战更加复杂的双基因联合扰动预测。相比已有方法,UniPert在两个基因均未出现在训练集中的情况下优势更加明显,说明统一分子表示具有更强的泛化能力。

在药物扰动预测方面,研究人员将UniPert应用于sciPlex3单细胞药物筛选数据,对从未见过的新药物进行预测。结果显示,无论K562、A549还是MCF7细胞,UniPert均能够明显提高预测精度。进一步采用HDAC抑制剂进行留一验证后发现,UniPert能够正确识别具有共同作用机制但结构并不完全相似的药物,预测性能持续优于Uni-Mol、KPGT及传统分子指纹。

这些结果说明,统一分子表示能够有效提升模型对未知基因和未知药物的泛化能力,为后续跨领域迁移学习提供了坚实基础。

图3: UniPert提高未知遗传扰动和未知化学扰动表型预测能力。

G2CP利用遗传筛选知识显著提升化学筛选预测能力

在完成统一分子表示学习后,研究人员进一步提出遗传到化学扰动迁移学习框架G2CP,希望解决化学筛选实验规模有限、数据获取成本高的问题。

G2CP首先利用大规模CRISPR遗传筛选数据进行预训练,使模型学习不同细胞背景下基因扰动产生的响应规律;随后仅利用少量化学筛选数据进行微调,实现遗传筛选知识向化学筛选的迁移。

研究人员在五个LINCS细胞系数据集上进行了系统评估,包括A375、A549、HT29、MCF7和PC3。结果显示,在不使用遗传预训练时,模型性能高度依赖化学筛选数据规模,当训练数据较少时预测能力明显下降。而引入G2CP后,即使仅利用20%的化学筛选数据,模型预测性能也大幅提升,整体相关性相比未预训练模型提高约375%。随着遗传预训练数据不断增加,模型性能持续改善,当预训练覆盖约2500个基因后,性能基本达到稳定,继续增加基因数量收益逐渐减弱。

进一步分析发现,遗传预训练对模型贡献远高于增加化学筛选样本数量。尤其对于HT29等化学筛选数据相对较少的细胞系,传统模型即使使用80%的化学筛选数据仍难以获得理想性能,而G2CP能够显著弥补这一不足。这说明CRISPR筛选积累的大量功能基因组知识能够有效迁移到药物筛选任务中,大幅降低化学实验需求。

研究还进一步比较了不同预训练策略。结果显示,采用细胞背景特异性的遗传筛选进行预训练效果优于直接混合多个细胞类型的数据;同时,根据细胞特异性基因必需性优先选择关键基因进行预训练,也进一步提高了模型性能。此外,即使采用更加严格的药物结构划分方式进行测试,G2CP仍保持较高预测准确率,说明模型真正学习到了跨分子结构的生物学规律,而不仅仅依赖化学结构相似性。

图4: G2CP利用遗传筛选知识提升化学筛选预测能力及不同预训练策略比较。

UniPert-G2CP构建统一因果空间揭示不同细胞对药物响应的异质性

在建立统一分子表示和迁移学习框架后,研究人员进一步尝试构建完整的扰动因果空间,将分子层面的扰动原因与细胞层面的表型结果统一起来分析。

研究首先利用UniPert建立包含4994个基因和7860个化合物的统一分子空间,并进一步结合PharmGKB通路信息进行功能注释。结果显示,相同生物通路中的基因和药物能够自然聚集。例如,5-羟色胺通路、伊布替尼通路以及威罗非尼相关通路均形成明显聚类,不同药物即使结构差异较大,只要作用于共同生物过程,也能够在统一空间中彼此接近。

进一步统计不同类型扰动之间的相似性发现,小分子之间具有较大的结构多样性,而蛋白质之间由于受到进化保守性限制,相似性分布更加集中。值得注意的是,基因与药物之间形成的跨模态相似性分布十分连续,说明UniPert真正建立了统一表示,而不是简单拼接两类特征。

研究随后利用独立的化合物—靶点数据集验证模型是否能够发现新的药物靶点关系。结果显示,UniPert能够在极少量候选化合物中显著富集真实靶点,相比随机筛选具有明显优势,说明统一分子空间不仅具有解释能力,还能够直接支持新药发现。

随后,研究进一步构建五个细胞系对应的表型空间,并分析不同药理类别在不同细胞中的响应一致性。结果发现,同一类药物在不同细胞中的表型响应存在明显差异。例如,雌激素受体激动剂在MCF7乳腺癌细胞中的响应最强,而PPAR激动剂则主要作用于HT29和PC3细胞。这说明药物作用不仅由自身结构决定,还受到细胞背景显著影响。

通过同时分析分子空间和表型空间,研究人员进一步提出"药理类别细胞敏感性"概念,即同一种药理机制在不同细胞环境中的响应程度。相比传统仅分析药物结构或表型的方法,这种联合分析能够更加准确揭示不同细胞类型对药物作用的异质性,为精准治疗提供新的分析工具。

图5: UniPert-G2CP构建统一扰动因果空间并揭示不同细胞对药物响应的异质性。

UniPert-G2CP揭示雌激素受体药物作用机制及耐药机制

为了进一步验证联合因果空间的生物学解释能力,研究人员选择乳腺癌雌激素受体(ESR1)作为案例进行深入分析。

ESR1是ER阳性乳腺癌最重要的驱动基因,也是目前内分泌治疗的核心靶点。然而,临床上常见Y537S、D538G等突变会导致药物耐药,因此如何解析不同突变背景下药物作用机制一直是精准治疗的重要问题。

研究首先将不同ESR1突变体及多个代表性内分泌药物共同映射到UniPert分子空间。结果发现,模型能够正确识别ESR1配体结合区和DNA结合区对药物作用的重要贡献,同时准确反映不同突变导致的细微变化。

随后,研究利用G2CP预测不同ESR1状态下药物处理后的转录组变化。结果显示,在MCF7细胞中,ESR1敲除与雌激素激动剂之间表现出明显不同的表型响应;而Y537S和D538G等耐药突变则逐渐偏离正常受体状态,并形成与DNA结合区缺失更加相似的表达模式。

进一步分析差异表达基因发现,多个已知乳腺癌相关基因,如CCNA1、NCK1、HSPB1及SRC等均表现出明显变化,与既往实验研究结果一致。同时,MYC信号、DNA修复、脂肪酸代谢、上皮—间质转化等多个耐药相关通路也发生系统性改变。

这些结果说明,UniPert-G2CP不仅能够预测药物处理后的细胞状态,还能够从统一因果空间中直接解析药物作用机制及耐药形成过程,为未来机制研究和药物重定位提供重要工具。

图6: UniPert-G2CP解析雌激素受体药物作用机制及耐药形成过程。

讨论

本研究提出了UniPert-G2CP框架,首次实现了遗传筛选与化学筛选的统一建模,为人工智能虚拟细胞的发展提供了新的基础框架。不同于传统方法分别处理基因扰动和药物扰动,UniPert首先建立统一的多模态分子表示空间,再结合G2CP实现遗传筛选向化学筛选的知识迁移,从而在统一框架下完成分子原因与细胞表型之间的因果建模。研究证明,这种"统一分子表示+跨领域迁移学习"策略能够同时提高模型预测精度、泛化能力和生物学可解释性。

研究的重要创新之一,在于突破了遗传筛选和化学筛选长期分离的局面。过去,两类数据由于分子表示方式和实验体系不同,很难直接整合分析。UniPert通过统一编码蛋白质和小分子,使两类扰动能够映射到同一语义空间,不仅能够自动识别具有共同作用机制的基因和药物,还能够帮助注释功能未知蛋白和发现新的化合物—靶点关系,为跨模态知识迁移提供了基础。

另一方面,G2CP充分利用CRISPR筛选规模大、覆盖广的优势,通过"遗传预训练+化学微调"策略,有效缓解了化学筛选样本不足的问题。研究表明,仅利用有限比例的化学数据即可获得接近完整训练的预测性能,大幅降低未来高通量药物筛选成本。这种迁移学习思想不仅适用于转录组数据,也具备推广到形态学、蛋白质组学及表观遗传组学等多组学数据的潜力。

此外,研究进一步构建了统一扰动因果空间,实现了分子原因与细胞表型之间的联合分析,并成功解析不同细胞背景下药物作用及耐药形成机制。这一框架突破了传统虚拟筛选仅关注分子结构匹配的局限,使人工智能能够同时考虑药物分子特征和细胞环境,为精准药物筛选、药物重定位、机制研究及人工智能虚拟细胞建设提供了新的技术路线。研究人员也指出,目前框架主要针对蛋白编码基因和小分子药物,未来仍可进一步扩展至非编码RNA、多组学表型以及更多细胞环境,从而逐步建立覆盖多尺度、多模态和多细胞背景的人工智能虚拟细胞系统,推动精准医学和智能药物研发的发展。

整理 | 王建民

参考资料

Li et al., UniPert-G2CP bridges genetic and chemical screens from molecular representation to phenotype

modeling, Cell (2026),

https://doi.org/10.1016/j.cell.2026.06.005

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-27,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档