跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

EZSpecificity 模型解析:融合序列与结构的酶底物特异性预测实践

EZSpecificity 利用交叉注意力图神经网络实现高精度酶底物特异性预测。该模型融合蛋白质序列进化信息与三维结构特征,通过双重交叉注意力机制捕捉酶 - 底物相互作用。核心在于构建包含 32 万条数据的 ESIBank 数据库,整合旧文献挖掘与公共数据库资源。环境配置需安装 PyTorch Geometric 及依赖库,数据准备涉及 SMILES 转 3D 结构及对接文件生成。实测表明其能显著优于传统物理打分方法,为生物催化与药物研发提供高效筛选工具。

BigDataPan发布于 2026/3/24更新于 2026/7/2634 浏览
EZSpecificity 模型解析:融合序列与结构的酶底物特异性预测实践

EZSpecificity:基于交叉注意力图神经网络的酶底物特异性预测

论文信息

[1] Cui, H.; Su, Y.; Dean, T. J.; Yu, T.; Zhang, Z.; Peng, J.; Shukla, D.; Zhao, H., Enzyme specificity prediction using cross attention graph neural networks. Nature 2025. (DOI: 10.1038/s41586-025-09697-2)

核心概念回顾

在深入模型之前,我们先理清几个基础概念,这有助于理解 AI 是如何'看懂'生物分子的。

酶与底物

  • 酶(Enzyme):最初是一串氨基酸序列(如 MKFVK...),像未组装的乐高零件。通过物理法则折叠成具有固定形状的 3D 实体,形成独特的活性位点(锁孔)。只有形状和电荷完全匹配的底物才能进入并触发反应。
  • 底物(Substrate):被酶选中的小分子原料(如糖、脂肪、药物前体)。它是反应的输入端,进入酶的口袋发生化学键变化后变为产物。
  • 对接(Docking):AI 模拟底物在酶活性位点的结合过程。程序会尝试数百万种姿态(Poses),计算结合能量。能量越低,说明结合越稳定,即'对接成功'。

一句话总结:酶是把一维代码折叠成三维智能锁,而 AI 的任务就是算出哪把钥匙能插进去。

模型架构拆解

EZSpecificity 是一个酶 - 底物特异性预测模型,核心在于融合序列、结构及相互作用信息。流程分为输入预处理、双编码模块、双向交叉注意力融合、特异性预测四大部分。

第一部分:序列分析(进化变换器编码)

这部分处理酶的氨基酸序列。

  1. 输入:蛋白质序列(如 MKFVRRIIA...)。
  2. 处理器:ESM-2 蛋白质语言模型。这是一个预训练好的'语言大师',读得懂蛋白质的进化语言。
  3. 输出:将序列映射到 1,024 维的潜空间,捕捉进化信息,输出高维特征向量。

第二部分:3D 结构分析(搜身)

这部分处理底物和酶的三维结构。

  1. 输入:底物分子结构与蛋白质 3D 结构。
  2. 预处理:使用 Vina-GPU2.0 完成分子对接,模拟底物嵌入活性口袋。
  3. 编码器:
    • Internal MPNN:仅关注底物分子内部,汇聚原子特征形成'底物特征向量'。
    • Interaction MPNN:扫描接触微环境,分析原子间距离、空间位置及化学键相互作用。
  4. 输出:催化微环境的特征表示。

第三部分:双重交叉注意力融合

这是模型最聪明的地方。它没有简单拼接特征,而是让序列特征与结构特征互相提问。

  • 机制:Double Cross-Attention(双重交叉注意力)。
  • 操作:将不同输入特征分别作为 Q(查询)、K(键)、V(值),进行双向交叉计算。
  • 结果:生成'加权催化核心嵌入'与'加权序列嵌入',实现特征的深度交互。

第四部分:最终判决(预测)

  • 融合:经过交叉计算后的强化特征块。
  • 神经网络:多层感知机(MLP)作为决策区。
  • 输出:特异性评分。分数越高(越接近正数或负得越少),代表匹配度越高,结合可能性越大。

数据构建:ESIBank 数据库

模型的强大源于高质量的数据基建。作者构建了包含 32 万条数据的 ESIBank 数据库。

数据来源

  1. 旧文献挖掘:利用 OCR 技术扫描历史论文 PDF 中的化学反应图片,将分子结构自动翻译为 SMILES 代码,并与酶序列匹配。
  2. 公共数据库:从 BRENDA 和 UniProt 批量下载已知数据。

数字化流水线

  1. 备料:
    • 底物:SMILES 代码 -> RDKit -> 3D 分子模型。
    • 酶:序列 -> AlphaFold(造壳)+ AlphaFill(装辅因子)-> 完整 3D 模型。
  2. 组装与质检:
    • 使用 AutoDock-GPU 进行对接,尝试多种结合姿态。
    • 通过距离打分和亲和力打分筛选,只保留合理的结合姿态(Reasonable binding pose)作为标准答案。

环境配置与数据准备

系统要求

  • 操作系统:Ubuntu 22.04
  • Python 版本:3.10.12
  • CUDA 版本:12.1

第一步:创建虚拟环境

conda env create -f environment.yml
conda activate ezspecificity

第二步:安装图神经网络库

PyG 对版本敏感,请确保 CUDA 版本匹配。

pip install torch_geometric
pip install pyg_lib torch_scatter torch_sparse torch_cluster torch_spline_conv -f https://data.pyg.org/whl/torch-2.2.0+cu121.html

数据文件结构

跑通示例代码需要特定的目录结构和 CSV 文件。

My_Data/
├── enzymes.csv       # 酶名单(含 Protein sequence)
├── substrates.csv    # 底物名单(含 Substrate_SMILES)
├── data.csv          # 配对索引表(Dock Index, Enzyme Index, Substrate Index)
└── Structure/        # PDB 文件夹(存放对接后的 3D 复合物文件)
    ├── 0.pdb
    ├── 1.pdb
    └── ...

关键说明:

  • enzymes.csv:必须包含 Protein sequence 列。
  • substrates.csv:必须包含 Substrate_SMILES 列。
  • data.csv:核心索引表,需包含 Dock Index(对应 Structure 文件夹下的文件名)、Enzyme Index 和 Substrate Index。
  • Structure:存放 .pdb 文件,文件名应为纯数字,代表对接后的复合物结构。

推理流程实战

准备工作

模型需要的输入不是简单的字符串,而是酶和底物结合在一起的 3D 模型文件(PDB 格式)。如果不存在,需要自行生成:

  1. 造酶:运行 AlphaFold 获取序列对应的 3D 结构,如有辅因子需运行 AlphaFill。
  2. 造底物:运行 RDKit 将 SMILES 转为 3D 坐标。
  3. 强行合体:使用 AutoDock-GPU 将两者'撞'在一起,生成复合物 PDB 文件。

执行预测

准备好 PDB 文件后,参考 example.ipynb 提取特征并进行预测。

  1. 提取特征:读取 .pdb 文件,将原子坐标转换为数学矩阵(节点和边)。
  2. AI 打分:将矩阵喂给训练好的 EZSpecificity 模型。
  3. 结果解读:模型输出一个连续分数(如 -2.09)。分数越大(越接近正数),结合可能性越高。

常见问题与优化

  • 依赖冲突:如果遇到 packaging.version 报错,可尝试降级:pip install "packaging==23.2"。
  • KNN 实现:若遇到 torch_cluster 相关错误,可使用纯 PyTorch 重写 KNN 函数以移除外部依赖。
  • 单模型 vs 集成:实测中,单模型与集成模型的分数可能存在差异,通常集成模型更稳健,但单模型足以满足快速筛选需求。

结语

EZSpecificity 展示了深度学习在生物催化领域的巨大潜力。它不仅仅是一个分类器,更像是一个能够理解分子空间关系的判别器。相比传统的物理打分方法,它能有效减少假阳性,帮助科学家在海量化合物中快速锁定高潜力的酶 - 底物组合。

目录

  1. EZSpecificity:基于交叉注意力图神经网络的酶底物特异性预测
  2. 论文信息
  3. 核心概念回顾
  4. 酶与底物
  5. 模型架构拆解
  6. 第一部分:序列分析(进化变换器编码)
  7. 第二部分:3D 结构分析(搜身)
  8. 第三部分:双重交叉注意力融合
  9. 第四部分:最终判决(预测)
  10. 数据构建:ESIBank 数据库
  11. 数据来源
  12. 数字化流水线
  13. 环境配置与数据准备
  14. 系统要求
  15. 第一步:创建虚拟环境
  16. 第二步:安装图神经网络库
  17. 数据文件结构
  18. 推理流程实战
  19. 准备工作
  20. 执行预测
  21. 常见问题与优化
  22. 结语
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • Mac mini M4 部署 OpenClaw + Ollama 本地大模型接入飞书机器人
  • OpenClaw 安装与飞书机器人接入教程
  • FAIR plus 2026 机器人全产业链接会前瞻
  • 算法:滑动窗口技巧与应用
  • FPGA 中 XDMA 多通道传输架构解析
  • OpenClaw v2026.3.8 全平台部署与本地模型对接指南
  • Python 爬虫学习的四大阶段与核心技能
  • 机器人送料机械手结构与控制设计详解
  • 通达信 API 与 Python 构建量化交易系统实战
  • 元脑企智 EPAI:三步构建企业级大模型 RAG 应用
  • 机器学习常见名词汇总
  • Dart File 类用法详解
  • 零基础如何系统学习 Python:入门路径与职业发展指南
  • HarmonyOS 6.0 应用开发:V2 装饰器@Local 的使用
  • 基于 OpenClaw 与飞书构建 AI 新闻推送机器人
  • Docker 容器停止命令 docker stop 详解与优雅关机实践
  • Python+InsightFace 实战人脸识别:从零搭建落地识别系统
  • 搭建支持情感控制的二次封装 TTS 服务
  • Flutter 接入 DeepSeek API 实现鸿蒙端 AI 对话与流式渲染
  • SSH 公钥认证修复指南:解决 GitHub 连接权限拒绝问题

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online