CADD 分析

本演示围绕 EGFR 激酶的 ATP 结合口袋开展小分子筛选,最终整理出 4 个待进一步检查的候选及其筛选理由。本指南用十个对话案例演示 CADD(计算机辅助药物设计):发什么提示词、怎么看结果、下一步怎么做。计算和作图由 CADD Agent 完成,你不必先学会写代码。

先分清两个名词:靶点和配体

可以把药物作用想象成锁与钥匙。蛋白靶点是那把锁:希望被药物影响的蛋白质,本指南的靶点是 EGFR,一种激酶。小分子配体是候选钥匙:可能嵌进锁孔的小分子,这里的锁孔是 EGFR 的 ATP 结合口袋。准确地说,配体并不是要「打开」这把锁——它只是可能嵌入口袋并与蛋白接触,接触是否合理、是否稳定,要靠对接、相互作用分析和分子动力学逐步检查。

分析流程

各案例涵盖以下步骤:

步骤 这一步做什么 对应案例
数据 从公开数据库收集与靶点活性相关的小分子记录,整理成可追溯的数据集 01 · 手上的公开数据,够不够开始这项研究?
预测 把分子变成可分析的表示来预测活性,并用已知分子检验预测是否可信 02 · 一个分子,怎么变成能分析的数字、字符串和图?、03 · 相似分子怎样分组?活性预测怎样检验?
口袋 在蛋白的实验结构中找到适合比较和对接的结合口袋 04 · 蛋白上有很多凹陷,哪个口袋值得研究?
对接 把小分子逐个放进口袋,预测结合姿势并打分 05 · 对接姿势看起来合理,怎样真正检查它?
相互作用 检查姿势与蛋白的具体接触,把性质、对接和相互作用证据连成一次候选筛选 06 · 怎样把前面的步骤连成一次候选筛选?(05 已初步检查,06 深入)
MD(分子动力学) 让蛋白与小分子的复合物随时间运动,观察结合是否稳定 07 · 分子开始运动以后,我们能多知道什么?
可靠性判断 读懂模型的不确定性,整理证据、决定下一步 10 · 模型什么时候值得相信,什么时候该继续查证?

主线之外,08 换一个观察角度比较不同激酶的靶点相似性,09 用独立案例学习深度学习表示。08、09 使用独立案例,数据和分数各自解读。

演示结果

数据整理使用含 5,568 个与 EGFR 活性相关的小分子的公开分子表,并通过 ChEMBL 和 PubChem 核对活性与身份。

结构分析在不同环节使用 EGFR 的 3W32、2ITO 和 3POZ 共晶结构。候选筛选另从 PubChem 返回的 30 个相似分子出发,按性质、对接分数和相互作用证据逐步筛选。

最后得到 4 个待进一步检查的候选。这 4 个候选的证据并不相同:CID11292933 的对接分数最高,但首位姿势距 Met793 主链最近重原子仍有 7.42 Å;CID65997 的性质评分最高且对接靠前;CID214347 未通过化学感知核验,暂时不能解释其相互作用;CID11256587 仍带有结构警示和未指定立体化学。名单因此同时记录「为什么留下」和「还要查什么」。

这些结果用于确定下一步验证对象;对接分数不等于药效,候选是否具有真实活性仍需实验确认。

开始前,准备一次就够了

  1. 按安装与启动说明连接 Omicos,并选择自己的工作空间。
  2. 创建一个 CADD 项目,选择 CADD Workflow Runner。
  3. 从第一节开始,每节新建一个对话,发送页面给出的提示词。提示词会告诉 Agent 研究对象和目标;Agent 自行查询公开数据并说明来源。

计算可能需要等待;部分章节还会查询公共数据库。

十个案例,逐步完成分析

前六节以 EGFR 为主,从公开活性记录走到候选筛选;第七、八节观察分子运动并比较不同激酶;最后两节用 QM9、EGFR 和 KIBA 的独立案例学习深度学习与预测不确定性。

对话 这一节要解决的问题
01 · 手上的公开数据,够不够开始这项研究? 找到的活性记录,怎样变成可追溯的数据集?
02 · 一个分子,怎么变成能分析的数字、字符串和图? 分子怎样用数字、字符串和图来表达?
03 · 相似分子怎样分组?活性预测怎样检验? 相似分子怎样分组,预测怎样检验?
04 · 蛋白上有很多凹陷,哪个口袋值得研究? 结构中的哪个区域适合比较和对接?
05 · 对接姿势看起来合理,怎样真正检查它? 一个对接姿势合理吗,怎样亲手查看?
06 · 怎样把前面的步骤连成一次候选筛选? 怎样把前面的步骤连成一次候选筛选?
07 · 分子开始运动以后,我们能多知道什么? 从静态结构到随时间运动,能多知道什么?
08 · 两个激酶相似,究竟是哪一方面相似? 换一个观察角度,靶点相似性还一致吗?
09 · 同一个分子,字符串、图和三维坐标各学到什么? 不同分子表示怎样进入神经网络?
10 · 模型什么时候值得相信,什么时候该继续查证? 怎样读懂模型的不确定性并整理证据?

阅读与复用

  • 提示词可以直接使用,熟悉后再换成自己的数据。多数组图可点击放大。
  • 各节末尾可下载完整结果:先读 readable-report.html,需要重算时再看包内说明。
  • 页面按实际结果整理,截图保留当时的提问;分析中也经过追问和修正。

数据来源与参考文献

本指南基于 Volkamer Lab 及贡献者的 TeachOpenCADD 公开数据与教学内容改编,分析和图表在 Omicos 中完成。

从 第一节:手上的公开数据,够不够开始这项研究? 开始。

查看示例使用的模型设置

选择 DeepSeek → DeepSeek V4.1 Flash → 思考强度「高」。

正式 DeepSeek V4.1 Flash(1M ctx, vision)模型已选中,思考强度为高
在模型菜单中选择 DeepSeek V4.1 Flash,并将思考强度设为「高」。

results matching ""

    No results matching ""