云计算百科
云计算领域专业知识百科平台

CycPeptMPDB: 环肽膜渗透性第一个综合数据库——从零搭建到本地实战

摘要:CycPeptMPDB 是首个系统整合环肽膜渗透性实验数据的公开数据库,收录 7,991 条结构独特环肽的 8,466 条测量值,覆盖 56 个数据源、4 种实验体系与 18 年跨度。数据库以 HELM 统一环肽结构表示,通过结构去重关联同一肽的多条测量,并预生成 3D 构象与约 200 个分子描述符,支持检索、浏览、统计与多粒度下载,为环肽渗透性预测模型的训练提供了开箱即用的高质量数据基础。

做环肽设计最痛苦的不是没有 AI 模型,而是没有高质量的训练数据。 CycPeptMPDB 正是为解决这个问题而生的——它收录了 7,991 条结构独特环肽的 8,466 条渗透性测量值,覆盖 56 个数据源、4 种实验体系、跨度 18 年。

论文: Li J, Yanagisawa K, Sugita M, et al. CycPeptMPDB: A Comprehensive Database of Membrane Permeability of Cyclic Peptides. J. Chem. Inf. Model. 2023, 63(7), 2240–2250. doi:10.1021/acs.jcim.2c01573

官网: http://cycpeptmpdb.com

作者单位: 东京工业大学 Akiyama 实验室(也是后来 EnsembleCycPerm 的作者团队)


一、为什么需要一个环肽专属数据库?

环肽正在成为"不可成药"靶点的突破口——它们能结合传统小分子无法触及的细胞内蛋白-蛋白相互作用界面,又比抗体便宜且可合成。

但环肽有一个致命弱点:膜渗透性差。

据统计,大约 80% 的疾病相关人类蛋白(包括胞内 PPI)不能被传统小分子或抗体药物靶向——环肽是少有的能填补这个空白的分子类型。

要预测和优化环肽的膜渗透性,就需要大量的实验数据来训练模型。但在此之前:

  • 数据分散在几十篇论文里,格式不统一
  • 环肽的结构表示没有统一标准(SMILES 不够直观,氨基酸序列无法反映环化拓扑)
  • 同一环肽在不同文献中可能有多个名称,去重困难
  • 3D 构象缺失,无法直接用于基于结构的计算

CycPeptMPDB 是第一个系统解决这些问题的公开数据库。


二、数据规模:到底有多大?

2.1 总体统计

指标数值
总条目数 8,466
结构独特环肽 7,991
数据来源 56 个(45 篇论文 + 2 项专利,部分论文含多批数据)
覆盖年份 2006–2024
单体长度范围 2–15 残基(均值 8.4)
渗透性测量总数 8,466 条
实验体系 PAMPA、Caco-2、MDCK、RRCK
分子形状 Circle (5,530) + Lariat (2,936)

2.2 渗透性分布

以 logPexp = −6.0(即 1.0×10⁻⁶ cm/s)为界:

分类数量占比
高渗透性 (≥ −6.0) 5,402 63.8%
低渗透性 (< −6.0) 3,064 36.2%
范围 −10.00 ~ −3.90
均值 −5.96

注:检测限以下的肽统一赋值为 −10.0,在肽详情页有标注。

2.3 年份分布

年份条目数里程碑事件
2006–2015 1,106 早期零星测量
2016–2019 1,287 环肽药物概念兴起
2020 3,206 Townsend 大规模数据集
2021 1,617 Kelly 数据集
2022–2024 1,250 持续补充

2020 年是一个爆发点——仅 Townsend 和 Kelly 两个数据源就贡献了总量的 54%。

2.4 主要数据源 Top 10

数据源条目数占比
2020_Townsend 3,086 36.5%
2021_Kelly 1,519 17.9%
2013_CHUGAI 878 10.4%
2016_Furukawa 688 8.1%
2023_Ohta 584 6.9%
2018_CHUGAI 374 4.4%
2024_Faris 234 2.8%
2022_Bhardwaj 136 1.6%
2018_Naylor 81 1.0%
2015_Wang 62 0.7%

三、数据库的核心设计

3.1 HELM 序列表示——环肽的"统一语言"

这是 CycPeptMPDB 最重要的设计选择之一。

问题:环肽比小分子大,SMILES 虽然精确但可读性差;传统氨基酸三字母码又无法表示非天然氨基酸和环化拓扑。

方案:采用 HELM(Hierarchical Editing Language for Macromolecules)——一种由 Pistoia Alliance 维护的大分子表示标准。

HELM 分四个层级:

Complex Polymer → 整个多组分大分子(如 ADC)
└─ Simple Polymer → 单一聚合物链
└─ Monomer → 单体残基
└─ Atom → 原子

对于环肽,HELM 用 PEPTIDE1{X.Y.Z}$$$$V2.0 的格式描述:

  • X.Y.Z 标记环化位置(如 1 号位和 12 号位之间成环)
  • 每个单体用方括号包裹,非天然氨基酸有唯一 ID(如 [dP] = D-Proline, [MeA] = N-Methyl-Alanine)

这种表示法比 SMILES 直观,比传统序列更精确,而且可直接用于序列建模(如后来的 HELM-BERT)。

3.2 去重策略——同一肽的多条测量如何关联?

同一个环肽可能在不同文献中被不同课题组测量过多次。CycPeptMPDB 做了两层去重:

字段含义
Structurally_Unique_ID 结构唯一 ID——相同 SMILES = 相同 ID
Same_Peptides_ID 指向所有重复测量的条目 ID 列表
Same_Peptides_Permeability 对应的多个测量值
Same_Peptides_Assay 对应的实验体系

例如 Cyclosporine A(CsA)在 8 篇不同文献中被测量过,但只有一个 Structurally_Unique_ID。这样用户既不会重复计数,又能追溯原始文献间的测量差异。

3.3 3D 构象预生成

每条环肽都预生成了 3D 结构:

  • RDKit ETKDG 生成 5,000 个初始构象
  • RMSD ≤ 1.0 Å 的去重
  • UFF 力场优化
  • 取能量最低构象
  • 同时在 2024 年更新中新增了:

    • 水相中的代表性构象 + 3D-PSA
    • 氯仿相中的代表性构象 + 3D-PSA(基于 GFN2-xTB 快速 QM 方法评分选取)

    这意味着用户不需要从头跑构象搜索就能直接开始基于结构的计算(如对接、MD 模拟)。

    3.4 预计算分子描述符

    数据库直接带 ~200 个 RDKit 分子描述符,涵盖:

    • 理化性质:MolWt、MolLogP、TPSA、Fsp³
    • 拓扑指数:Chi 系列、Kappa 系列、BalabanJ、BertzCT
    • 电荷相关:MaxPartialCharge、MinPartialCharge
    • EState/VSA 描述符:SlogP_VSA、SMR_VSA、PEOE_VSA、EState_VSA
    • 功能团计数:fr_amide、fr_benzene、fr_halogen 等 60+ 个
    • 主成分:PC1、PC2(来自整体描述符矩阵的 PCA 降维)

    对于机器学习用户,这意味着数据下载后基本可以直接喂模型,省去了从 SMILES 重新计算所有描述符的步骤。


    四、网站功能——不只是下载链接

    CycPeptMPDB 是一个交互式 Web 应用,不只是 FTP 下载站。

    4.1 检索面板(Home Page)

    支持多条件组合筛选:

    筛选项说明
    Publication Year 数据来源出版年份
    Permeability 渗透性数值范围
    Assay Type PAMPA / Caco-2 / MDCK / RRCK
    Original Name 文献中原始名称(如 "Cyclosporine A")
    Molecular Weight 分子量范围
    Monomer Length 单体数范围
    Molecule Shape Circle / Lariat
    Combination 上述条件自由组合

    4.2 肽浏览页(Peptide Browse)

    每条肽有独立详情页,显示:

    • CycPeptMPDB ID + 2D 结构图
    • HELM 表示(可点击跳转到 HELM 可视化工具)
    • 渗透性数值 + 测定方法
    • 分子量、LogP、TPSA 等计算属性
    • 3D 结构查看器(在线 + SDF 下载)
    • 同一结构在其他文献中的重复测量
    • 单体组成列表

    4.3 统计面板(Statistics)

    网站内建数据可视化:

    • 渗透性分布直方图
    • 单体长度 vs 渗透性散点图
    • 各来源数据量对比
    • 单体频率排名

    4.4 下载(Download)

    支持三种粒度的下载:

    下载类型内容
    All Peptides 全量数据(8,466 条,含所有描述符)
    Per Source 按数据源分文件下载(56 个 CSV)
    All Monomers 单体词典(386 种氨基酸信息)

    五、数据字段详解

    以下是完整 CSV 的关键字段(~200 列,此处列核心):

    标识字段

    字段示例说明
    ID 1 数据库内唯一 ID
    Source 2006_Rezai_1 数据来源标签
    Year 2006 来源出版年
    Structurally_Unique_ID 1 结构去重 ID
    SMILES CC(C)C[C@@H]1NC(=O)… 标准 SMILES
    HELM PEPTIDE1{…}$$$$ HELM 序列
    Sequence [MeBmt][Abu]… 单体序列

    渗透性字段

    字段说明
    Permeability 主渗透性值 (logPexp)
    PAMPA / Caco2 / MDCK / RRCK 分实验体系的渗透性
    Detection_Limit_1 / _2 检测限标注

    结构属性字段

    字段说明
    Monomer_Length 单体总数
    Monomer_Length_in_Main_Chain 主链单体数
    Molecule_Shape Circle / Lariat
    Sequence_LogP 基于序列的 LogP 预测
    Sequence_TPSA 基于序列的 TPSA

    3D 字段(2024 更新)

    字段说明
    H2O_3DPSA 水相构象的 3D-PSA
    CHCl3_3DPSA 氯仿相构象的 3D-PSA
    _3DPSA 通用 3D-PSA

    计算描述符(>150 列)

    所有 RDKit Descriptors.descList 输出 + Morgan 指纹密度 + 功能团计数 + PCA 降维前两个主成分。


    六、本地数据实战

    6.1 获取数据

    # 从官网下载全量数据
    wget http://cycpeptmpdb.com/static/download/peptides/CycPeptMPDB_Peptide_All.csv
    wget http://cycpeptmpdb.com/static/download/peptides/CycPeptMPDB_Monomer_All.csv

    或者如果你已经 clone 了 EnsembleCycPerm 仓库,数据就在 dataset/ 目录下。

    6.2 快速 EDA

    import pandas as pd
    df = pd.read_csv('CycPeptMPDB_Peptide_All.csv')
    print(f"Total: {len(df)}, Unique: {df['Structurally_Unique_ID'].nunique()}")
    渗透性分布
    df['Permeability'].hist(bins=50)
    按实验体系
    print(df['Same_Peptides_Assay'].dropna().apply(eval).explode().value_counts())
    单体长度 vs 渗透性
    df.plot.scatter(x='Monomer_Length', y='Permeability', alpha=0.3)
    分子形状差异
    df.groupby('Molecule_Shape')['Permeability'].describe()

    6.3 典型分析示例:什么决定了环肽渗透性?

    从数据可以直接看出几个趋势:

    单体长度效应:

    • 5–7 残基:渗透性中位数约 −5.5(较好)
    • 8–10 残基:中位数约 −6.0(临界)
    • 11–15 残基:中位数约 −6.3(较差)

    分子形状差异:

    • Circle 型平均渗透性略高于 Lariat 型(因为 Lariat 有侧链修饰,多数增大了极性)

    3D-PSA 比 2D-TPSA 更关键:

    • 2D TPSA 对所有环肽差异不大(因为拓扑结构高度相关)
    • 3D-PSA 能反映构象折叠后极性基团的"隐藏"情况
    • 这个发现正是后续 EnsembleCycPerm 的核心动机——ΔPSA3D 是预测环肽渗透性的最强特征

    七、局限性与注意事项

    局限说明
    UFF 构象精度有限 使用 UFF 力场优化而非 QM 方法,低能量构象可能不反映真实溶液构象
    单构象假设 每条肽只存一个 3D 结构,不反映构象系综——后续 2024 年更新部分弥补了这个缺陷
    检测限以下归为 −10.0 这些数据的实际值未知,可能引入截断偏差
    PAMPA ≠ 细胞膜 人工膜体系与真实细胞膜的脂质组成有差异
    数据不平衡 高渗透性肽占 64%,建模时需注意类别平衡
    非天然氨基酸覆盖 386 种单体种类虽多,但某些稀有修饰可能缺失

    八、CycPeptMPDB 衍生的下游应用

    这个数据库已成为环肽 AI 研究的"标准燃料":

    下游模型基于 CycPeptMPDB 做了什么
    EnsembleCycPerm (2026) 用水/氯仿两相构象系综 + Transformer + GNN 预测渗透性,R=0.845
    HELM-BERT (2025) 用 HELM 序列预训练 BERT,捕获环肽拓扑感知表示
    MultiCycPermea (2022) 多模态深度学习进行环肽渗透性预测
    CPMP (2021) 基于图卷积的环肽渗透性分类器
    Peptide-Aware CLM (2024) 化学语言模型用于环肽扩散预测

    可以说,2021 年之后几乎所有环肽渗透性计算模型的训练/测试数据都来自 CycPeptMPDB。


    九、总结

    CycPeptMPDB 是环肽渗透性领域的"ImageNet 时刻"——它不是最大的数据库,但它是第一个把碎片化实验数据统一成机器可用格式的平台。

    三个核心价值:

  • 数据标准化:HELM 表示统一了环肽的结构描述,SMILES + 描述符 + 3D 构象一站配齐
  • 去重与溯源:同一环肽的多条实验测量被关联但不合并,既方便建模也保留原始信息
  • 开箱即用:下载 CSV → pandas 加载 → 直接建模,省掉了从 SMILES 到描述符到构象的全套预处理
  • 对于做环肽设计的同学——如果你需要训练一个渗透性预测模型,或只是想快速浏览"某种长度、某种形状的环肽通常渗透性如何",CycPeptMPDB 应该在你的收藏夹里。


    参考资料

  • Li J, Yanagisawa K, Sugita M, et al. CycPeptMPDB: A Comprehensive Database of Membrane Permeability of Cyclic Peptides. J. Chem. Inf. Model. 2023, 63(7), 2240–2250.
  • Wen S, Wang Y, Qian Y. EnsembleCycPerm: Interpretable Modeling of Cyclic Peptide Permeability through Solvent-Dependent Conformational Ensembles. J. Chem. Inf. Model. 2026, 66, 8123.
  • CycPeptMPDB 官网: http://cycpeptmpdb.com
  • HELM 规范: https://www.pistoiaalliance.org/helm/

  • 我的专栏链接

    蛋白 / 多肽分子模拟 / 动力学分子对接 / CADD / 工具agent / 核酸 / 药物
    开源蛋白结构推理 分子模拟基础 UCSF DOCK系列 agent智能体系列
    开源蛋白生成实践 分子动力学模拟-Amber rDock系列教程 化学大模型介绍
    蛋白设计原理案例 分子动力学模拟-Gromacs LeDock系列教程 我胡师兄说药
    多肽设计模型实践 开源結合自由能计算 CADD中的机器学习模型 siRNA药物设计模型
    开源多肽性质预测 高效计算基本配置 小分子药物设计案例 ASO药物设计模型
    多肽设计原理案例 靶向DNA/RNA药物设计 开源小分子生成和设计实践 开源药代动力学软件教程
    赞(0)
    未经允许不得转载:网硕互联帮助中心 » CycPeptMPDB: 环肽膜渗透性第一个综合数据库——从零搭建到本地实战
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!