PepMLM是杜克大学Pranam Chatterjee团队在《Nature Biotechnology》最新报道的一种创新AI模型,它通过整合蛋白质语言模型(pLM)和掩码语言建模(MLM)技术,实现了仅需靶蛋白序列即可直接生成特异性线性肽结合剂的能力,为传统"难药靶点"的药物开发提供了全新解决方案。

文章配图

许多癌症、神经退行性疾病(如亨廷顿病)和病毒靶点缺乏稳定结构或可成药位点,传统小分子/抗体策略束手无策。PepMLM 不依赖结构输入,仅用序列即可生成高亲和力肽段,并能与 Ubiquibody(uAb)架构结合实现靶向蛋白降解(TPD)。

1. PepMLM的核心架构:掩码策略


✅ 基座模型:ESM-2(650M 参数)Transformer 编码器,通过 MLM 任务学习氨基酸序列的进化与物化特征。

✅ 掩码方式:将靶蛋白序列与肽段拼接,完全掩码肽段区域(C 端),在上下文条件下预测全部肽残基。

✅ 训练数据:来自 PepNN 和 Propedia,经筛选得 10,203 对肽–蛋白复合物(肽长 ≤50,蛋白长 ≤500),MMSeqs2 去冗余。

✅ 训练目标:交叉熵损失,仅计算掩码肽区,实现条件概率建模 P(肽|靶蛋白)。

✅ 生成方式:贪婪解码或 Top-k 采样(k=3 最优),可控长度输出。


🔧评分指标:伪困惑度(PPL),低 PPL 代表模型对生成序列“自信”,且与 AlphaFold-Multimer 的 ipTM / pLDDT 负相关(P<0.01),可零样本预测亲和力。


文章配图


2. 基准测试:PepMLM vs RFdiffusion or ESM-650M


🔁命中率:用AlphaFold-Multimer折叠,PepMLM的ipTM ≥ 真实肽的概率为38%(pLDDT>0.8时49%),RFdiffusion仅29%。

文章配图

🔁氨基酸分析:PepMLM生成的序列氨基酸频率 mirroring 真实分布(无偏向如ESM-2的丝氨酸偏好)。接触位点(8Å阈值)替换合理:疏水残基互换(如缬氨酸→亮氨酸13%),带电残基类似(赖氨酸→精氨酸11%)。

文章配图


🔁PPL分布:PepMLM生成的肽PPL接近真实分布,优于ESM-2和随机序列

文章配图


🔧技术细节扩展:RFdiffusion是扩散模型,生成蛋白骨架后用ProteinMPNN序列化。PepMLM无需结构,纯序列驱动。论文用ChimeraX可视化:如对小鼠H-2Kb MHC(PDB:2OI9),PepMLM生成PSLGSVPYV(ipTM:0.9),与真实QLSPFPFDL类似,锚点疏水残基一致。
文章配图

3. 实验验证:从体外结合到细胞降解


🎯体外结合(ELISA)

  • 针对癌症标志NCAM1和生殖靶点AMHR2设计肽。PepMLM的4个肽均在~60nM浓度结合,成功率高于RFdiffusion(见Fig. 2和Supplementary Fig. 8)。最佳肽pMLM_NCAM1_2在30nM显著优于BSA对照(P=0.0051)。
    文章配图

🎯亨廷顿病相关蛋白降解

    • uAb架构:肽融合CHIPΔTPR(E3泛素连接酶域),诱导蛋白酶体降解。
    • MSH3:6个肽中5个显著降低水平(免疫荧光,P<1e-10)。
    • mHTT(Q43重复):5个肽在诱导后显著降解(Western blot,P<0.01)。
      文章配图


🎯病毒磷蛋白降解

    • 靶点:Nipah、Hendra和HMPV病毒(高致死率,无疫苗)。
    • 20个uAb中,63%降低20-49%蛋白水平(Western blot)。HMPV uAb在感染细胞中近完全消除磷蛋白(免疫荧光)。
文章配图

🔧技术细节扩展:uAb构建用Esp3I克隆,肽序列人源密码子优化。Western用ImageJ定量,ELISA用HRP偶联抗体。病毒实验用PEI转染,HMPV感染后荧光显微。


4. 讨论与展望:PepMLM的潜力与改进

PepMLM的hit率~60%,无需结构,适用于无序靶点。但它是编码器模型,非标准生成式(如ProGen2的 autoregressive)。

未来:整合扩散模型(DPLM)、变异感知嵌入(针对修饰同工型)、高通量筛选循环优化。

论文还测试了PepMLM-3B(3B参数),但650M版性价比更高(资源友好)。


📚开源资源:

GitHub: https:https://github.com/programmablebio/pepmlm

Hugging Face :https://huggingface.co/ChatterjeeLab/PepMLM-650M