Baker他们预印发了这么久,现在也是终于见刊了
文章配图

LigandMPNN是一种基于深度学习的蛋白质序列设计工具,主要用于蛋白质-配体结合位点的序列设计。在与小分子(LigandMPNN: 63.3% vs Rosetta: 50.4% 和 ProteinMPNN: 50.5%)、核苷酸(LigandMPNN: 50.5% vs Rosetta: 35.2% 和 ProteinMPNN: 34.0%)以及金属(LigandMPNN: 77.5% vs Rosetta: 36.0% 和 ProteinMPNN: 40.6%)相互作用的残基方面,LigandMPNN 在恢复天然主链序列上显著超越了Rosetta和ProteinMPNN。此外,LigandMPNN不仅能够生成氨基酸序列,还能预测侧链构象,从而实现对结合相互作用的精确评估。利用LigandMPNN设计的小分子和DNA结合蛋白已超过100种,并通过实验验证了它们具有高亲和力和结构准确性(如四个X射线晶体结构所展示)。值得注意的是,使用LigandMPNN重新设计的针对Rosetta小分子结合剂的方案,其结合亲和力提升了100倍。预计,LigandMPNN将在开发新的结合蛋白、传感器及酶方面得到广泛应用。


以下是其核心用途和特点:


1. 主要设计目标


  • 结合位点序列设计:
    为蛋白质中与配体(药物分子、辅因子、金属等)相互作用的区域设计最优的氨基酸序列,确保结合亲和力和特异性。

  • 功能位点优化:
    在保留蛋白质整体结构的前提下,定向改造结合口袋的化学环境(如氢键、疏水相互作用等),以增强配体结合或催化活性。





2. 技术特点


模型架构:基于消息传递神经网络(MPNN)

文章配图


LigandMPNN 的核心是一个图神经网络(GNN),专门处理蛋白质-配体复合物的3D结构信息。其架构主要包括以下组件:

(1) 输入表示

  • 蛋白质图:

    • 节点:每个氨基酸残基(Cα原子)和配体原子。

    • 边:基于空间距离(通常为10Å阈值)或共价连接。

    • 节点特征:氨基酸类型、二级结构、溶剂可及性等。

    • 边特征:距离、方向、化学键类型(如氢键、疏水接触)。

  • 配体特征:

    • 原子类型(如C、N、O)、电荷、环结构、官能团(通过RDKit等工具提取)。

(2) 消息传递机制

  • 多层图卷积:通过迭代更新节点和边的信息,捕获蛋白质-配体相互作用。

  • 注意力机制:对关键相互作用(如氢键)赋予更高权重。


(3) 序列解码器

  • 自回归生成:逐个残基预测氨基酸类型,基于上下文和配体信息。




3. 关键技术创新


(1) 配体感知的图表示

  • 配体化学指纹:将配体原子类型、环状结构等编码为特征向量。

  • 动态边构建:不仅依赖距离,还考虑配体-蛋白质的化学互补性(如氢键供体/受体匹配)。

(2) 对称性处理

  • 支持对称蛋白质复合物(如二聚体、六聚体)的设计:

    • 通过对称等价的边信息共享,确保对称位点序列一致性。

(3) 温度参数调控

  • 通过调整采样温度(Temperature):

    • 低温(T=0.1):生成保守、高概率序列。

    • 高温(T=1.0):探索多样性,用于创新设计。




4. 关键区别:ProteinMPNN vs. LigandMPNN


FeatureProteinMPNNLigandMPNN主要目标
设计稳定折叠的蛋白质序列
设计结合配体的蛋白质序列
输入
蛋白质3D结构(无配体)
蛋白质3D结构+配体
适用场景
通用蛋白质设计
蛋白质-配体相互作用优化
是否考虑小分子
❌ 不考虑
✅ 显式建模配体



5. 典型工作流程


  1. 结构准备:通过实验或AlphaFold获得蛋白-配体复合物结构

  2. 序列设计:用LigandMPNN优化结合位点

  3. 验证:使用分子对接或实验测定结合亲和力

  4. 迭代优化:结合实验反馈改进设计


LigandMPNN 通过配体感知的图神经网络架构和多任务训练策略,实现了蛋白质-配体界面序列的精准设计。其技术细节体现了深度学习与结构生物学的深度融合,为药物设计和酶工程提供了强大工具。