作者 | 龙文韬 编辑 | 庞超
这次给大家介绍中国科学院上海药物所郑明月研究员的论文“TransformerCPI: improving compound–protein interaction prediction by sequence-based deep learning with self-attention mechanism and label reversal experiments”。化合物-蛋白质相互作用(Compound-Protein Interactions ,CPIs)的识别是药物发现和化学基因组学研究中的关键任务,而没有三维结构的蛋白质在潜在的生物学靶标中占很大一部分,这就要求开发仅使用蛋白质序列信息来预测CPI的方法。为了解决这些问题,作者提出了一个名为TransformerCPI的新型变换神经网络,并引入了更为严格的标签反转实验来测试模型是否学习了真实的交互功能。实验表明TransformerCPI性能优异,可以反卷积以突出蛋白质序列和化合物原子的重要相互作用区域,这可能有助于优化配体结构的化学生物学研究。

一、研究背景
为了提高药物研发效率,众学者已开发了许多基于深度学习的新颖模型,这些模型在各种数据集上均显示出令人满意的性能,但是很少有人来评估它们在外部测试或实际应用中的泛化能力。最近,谷歌研究人员提出了机器学习应避免的三个陷阱,包括不适当地分割数据、隐藏变量和错误地实现目标。受这警告的启发,作者探究当前CPI预测模型是否面临类似的问题并总结了以下三个独特的问题。
1.使用不合适的数据集
DUD-E,MUV,Human和BindingDB中的大多数配体只出现在一类中,并且通过可能引入不可检测的噪声的算法生成了阴性样本。这些数据集可以通过配体信息分开,并且不能保证模型学习蛋白质信息或相互作用特征。
2.隐藏的配体
基于结构的虚拟筛选,基于3D-CNN的模型以及在DUD-E数据集上训练的其他模型主要根据配体模式而不是相互作用特征进行预测。作者想知道CPI建模是否面临类似的问题,因此重新讨论了先前在Human数据集上训练的CPI-GNN典型模型,以研究隐藏的配体偏差的潜在影响。
作者通过实验,如图1A,得知CPI-GNN模型主要学习如何对不同的配体进行分类,而不是对不同的CPI对进行分类,这些结果表现出配体模式可能误导模型的可能性。

图1. 配体模式是否误导模型实验
3.不适当地分割数据集
隐性配体偏倚的风险很难消除,但可以降低。通常研究者会将数据随机分为训练集和测试集,但作者尚不清楚随机拆分后该模型是否学习真正的交互功能或其他意外的隐藏变量,这可能会产生能够回答错误问题的精确模型。因此,应根据建模的实际目标及其应用场景来设计测试集。
为了解决这些陷阱带来的问题,作者提出了一个名为TransformerCPI的新型transformer neural network变换神经网络,构建了专门用于CPI建模的新数据集,并引入了更严格的标签反转实验来评估数据驱动模型是否落入陷阱。结果表明,TransformerCPI在三个公共数据集和两个标签反转数据集上均取得了最佳性能。此外,作者还通过将注意力权重映射回蛋白质序列和化合物分子,进一步研究了TransformerCPI的可解释性,以揭示其潜在的预测机制,结果还证实了TransformerCPI的自我注意机制可用于捕获所需的交互功能。作者希望这些发现可以引起关注,以提高CPI建模的泛化和解释能力。
二、模型与方法
2.1 TransformerCPI的模型架构
作者提出的模型基于transformer架构,该架构最初是为神经机器翻译任务而设计的。transformer是一种自动回归编码器-解码器模型,结合了多头注意层和位置前馈功能来解决序列到序列任务。许多预训练模型限于seq2seq任务,但作者受其捕获两个序列之间特征的强大能力的启发,修改了转换器结构以将化合物和蛋白质视为两种序列来预测CPI。TransformerCPI的概述如图2所示,其中保留了transformer的解码器,并修改了其编码器和最终的线性层。

图2. TransformerCPI模型框架
为了将蛋白质序列转换为顺序表示,作者首先将蛋白质序列拆分为overlapping 3-gram的氨基酸序列,然后通过预训练方法word2vec将所有单词翻译为实值嵌入。Word2vec是一种无监督的技术,用于学习描述复杂的句法和语义词关系的高质量分布式矢量表示形式。集成Skip-Gram和CBOW,word2vec最终可以将单词映射到低维实值向量,其中具有相似语义的单词映射到彼此接近的向量。
然后将蛋白质的顺序特征向量传递给编码器,以了解蛋白质的更多抽象表示形式。作者用相对简单的结构替换了编码器中原始的自我注意层。考虑到传统的transformer架构通常需要庞大的训练语料库,并且容易在小型或中型数据集上过拟合,因此作者使用了带有Conv1D和线性门控的门控卷积网络。因为它在作者设计的数据集上表现出更好的性能。门控卷积网络的输入是蛋白质特征向量。
作者将为解决半监督节点分类问题而设计的GCN转移到解决分子表示问题。当获得蛋白质序列表示和原子表示。交互功能是通过transformer的解码器学习的,该解码器由自我注意层和前馈层组成。蛋白质序列是编码器的输入,原子序列是解码器的输入,解码器的输出是包含相互作用特征且与原子序列长度相同的相互作用序列。并且作者修改了解码器的掩码操作,以确保模型可访问整个序列,这是将变换体系结构从自回归任务转换为分类任务的最关键的修改之一。
最后,将最终的相互作用特征向量反馈给以下完全连接的层,并返回化合物与蛋白质相互作用概率y。
2.2 数据集
作者在之前的三个基准数据集,人类数据集,秀丽隐杆线虫数据集和BindingDB数据集上比较了作者的模型。人类数据集和秀丽隐杆线虫数据集包括DrugBank 4.1和Matador的正CPI对以及使用系统筛选框架获得的非常可信的负CPI样本。BindingDB的训练集和测试集经过精心设计,并且测试集包含在训练集中未观察到配体或蛋白质的CPI对。因此,BindingDB数据集可以评估模型对未知配体和蛋白质的泛化能力。
之前的许多研究都是通过CPI对的随机交叉组合或使用基于相似性的方法来生成负样本的,这可能会引入意想不到的噪声和不被注意的偏差。首先,作者从GLASS数据库构建了一个GPCR数据集。其次,作者基于KIBA数据集构建了Kinase(Kinase,激活酶)数据集。如图3。

图3. 数据集的相关信息
为了确认模型实际学习的交互功能并准确评估隐藏变量的影响,作者提出了更为严格的标签反转实验。其中训练集中的配体仅出现在一类样本中(正或负相互作用CPI对),而配体仅出现在测试集中的另一类样本中。通过这种方式,模型被迫利用蛋白质信息来理解相互作用模式,并对那些选择的配体做出相反的预测。如果模型仅存储配体模式,则不可能做出正确的预测,因为其存储的配体在测试集中具有错误的(相反)标签。因此,该标签逆转实验是专门设计用于评估基于化学基因组学的CPI模型,并且能够指示隐藏的配体偏向产生了多大的影响。如图4A所示。

图4. 标签反转实验的示意图
三、实验结果
3.1 公开数据集的效果
在这些数据集上评估了许多机器学习方法,例如K最近邻(KNN),随机森林(RF),L2-logistic(L2),支持向量机(SVM),新报告的基于序列的CPI-GNN模型和DrugVQA(如表4表5)。每个模型的精确召回曲线下面积(PRC)和AUC如表6所示。在三个公共数据集上,TransformerCPI的表现优于其他模型。



图5. 实验结果比较表
3.2 标签反转数据集的性能
作者选择了CPI-GNN,GraphDTA和GCN作为参考,并比较了这些模型在AUC和PRC方面的TransformerCPI性能。如图6C所示,所有模型在GPCR有效集和Kinase有效集上均达到了相似的性能,但是,在测试集上观察到这些模型之间的巨大性能差距。尽管这些模型在随机拆分的有效集上具有相似的性能,但是它们所学的知识彼此之间却存在很大差异,这在更严格的标签反转实验中得以体现。

图6. 标签反转数据集中模型性能比较图
在GPCR上,TransformerCPI在AUC和PRC方面均胜过CPI-GNN,GraphDTA和GCN,显示出更高的捕获化合物与蛋白质之间相互作用特征的能力。相比之下,transformerCPI在这两个数据集上都取得了最佳的性能,揭示了它的坚固性和泛化能力。
总体而言,这些结果表明作者提出的TransformerCPI具有学习蛋白质与配体之间相互作用的能力,并且标签逆转实验可以有效地评估隐藏的配体偏倚对模型的影响,而且更重要的是,本文提出的建模方案可用于减少通用基于化学基因组的CPI任务的风险。
3.3 模型的系统依赖性
比较GPCR集和Kinase集之间的结果时,还应注意,TransformerCPI,GraphDTA和GCN在GPCR集上的性能要比Kinase集好得多。作者认为这种性能差异可能有两个潜在原因。第一个是GPCR集和Kinase集的数据分布不同,导致两个数据集之间的性能差距。第二个是GPCR的序列特征相对容易TransformerCPI学习。
如图7B所示,GPCR组的log_ratio分布的峰位于零,这意味着GPCR组中的大多数配体具有相等数量的相互作用对和非相互作用对。相反,Kinase组的log_ratio分布的峰显着移至-1,表明Kinase组中的大多数配体具有比相互作用对多近十倍的非相互作用对。因此,正对和负对的高度不平衡分布可能会给数据集带来严重的配体偏差,这可能会增加数据驱动的模型记住配体模式的风险,从而导致Kinase组预测性能下降。

图7. GPCR和Kinase比较图
另一个潜在的原因是,GPCR的与CPI相关的序列特征比Kinase更易于学习。与GPCR家族相比,Kinase家族具有更保守的ATP结合口袋,具有更少的不同残基。想要区分模型必须学会检测和理解蛋白质序列上的微小变化。
3.4 模型切除研究
以前的基于化学基因组学的CPI模型分别和独立地提取配体和蛋白质特征,然后将这两个特征向量连接起来作为输入特征。为了验证transformer编码器-解码器体系结构的作用,作者接下来评估了TransformerCPI-ablation模型,该模型在相同的标签反转实验上用常规矢量串联代替了transformer解码器。如图8C所示,该切除后极大地损害了TransformerCPI在GPCR集和Kinase集上的性能,证明了自注意力机制与编码器-解码器体系结构的确在提取两种类型序列之间的CPI特征中起着关键作用。

图8. 模型结构重要性比较图
3.5 模型解释
由于转换器的体系结构和自我关注机制,通过蛋白质序列和复合原子的关注权重,可以轻松了解模型背后的机制。
如在图9A中,关注权重映射到化合物原子以显示TransformerCPI了解到的知识。当面对不同的化合物-蛋白质对时,TransformerCPI注意不同的原子,并将化合物-蛋白质对正确地分为相互作用和非相互作用两类。

图9. 原子注意机制图
在这里,TransformerCPI生成对应于不同蛋白质的不同配体特征,这与配体的结合模式在与不同蛋白质相互作用时不同的事实是一致的。基于特定蛋白质环境的TransformerCPI动态特征提取有助于模型提取相互作用的关键信息,同时还可以降低隐藏的配体偏移的可能性。此外,transformerCPI的解码器动态地整合蛋白质序列和复合原子的特征,形成直接的相互作用特征,这与语言翻译任务相似,与配体与蛋白质的结合过程很好地吻合。
在解释了原子级注意机制后,作者还研究了蛋白质序列的注意权重,以了解蛋白质序列的哪些部分成为关注的焦点。结果,TransformerCPI可以粗略地推测配体与GPCR家族的结合位点是在细胞外区域还是跨膜区域,并检测Kinase家族的ATP结合口袋。作者以组胺H1受体,5-HT 1B受体和丝裂原激活的蛋白Kinase8(MAPK8)及其相应的活性成分为例。

图10. 蛋白质关注焦点图
四、总结
具有自注意机制的变换体系结构被修改以解决基于序列的CPI分类任务,从而产生了一个名为TransformerCPI的模型,该模型在三个基准数据集上均显示出高性能。为了解决深度学习的潜在风险,作者构建了特定于基于化学基因组学CPI任务的新数据集,并设计了更严格的标签反转实验。与其他模型相比,在新实验中,TransformerCPI的性能优异,表明它可以学习所需的相互作用特征并降低隐藏的配体偏移的风险。最后,通过将注意力权重映射到蛋白质序列和复合原子上来研究模型的解释能力,这可以帮助作者确定预测是否可靠并且具有物理意义。总体而言,TransformerCPI提供了模型解释的途径,并为进一步实验优化提供了有用的指导。
代码
https://github.com/lifanchen-simm/transformerCPI
参考文献
Lifan Chen, Xiaoqin Tan, Dingyan Wang, Feisheng Zhong, Xiaohong Liu, Tianbiao Yang, Xiaomin Luo, Kaixian Chen, Hualiang Jiang, Mingyue Zheng,
TransformerCPI: improving compound–protein interaction prediction by sequence-based deep learning with self-attention mechanism and label reversal experiments
Bioinformatics, Volume 36, Issue 16, 15 August 2020, Pages 4406–4414,