09 · 同一个分子,字符串、图和三维坐标各学到什么?

前面用指纹训练过模型,本节让网络分别读取 SMILES、分子图和三维坐标,比较它们学到了什么。数据换成 QM9 小分子量子化学数据:参考值来自计算,不是药物活性实验,与前面的 EGFR 案例独立。

发什么提示词

新建对话,选择 CADD Workflow Runner。

发送:

请自行获取 QM9 数据,分别用 SMILES、分子图和三维坐标训练小规模模型,预测原教程对应的量子化学性质。比较学习曲线、测试误差和几何变换后的预测稳定性,用组图解释三种输入的差异,并说明数据来源、样本划分和计算规模。

结果出来后,可以追问:

SMILES、分子图、三维坐标这三种输入到底差在哪里?为什么有的分子预测误差特别大?

读懂结果

T034/T035 预测偶极矩大小 μ(单位 Debye),T036 预测电子空间扩展量 ⟨R²⟩(单位 Bohr²,区别于评价拟合的 R²)。

任务 预测目标 比较方式
T034 / T035 偶极矩大小 μ GRU、GCN、GIN 使用同一组分子与划分
T036 电子空间扩展量 ⟨R²⟩ 两类三维网络,并增加同一组分子上的 GRU、GCN、GIN 对照

两组教学子集各 6,000 个分子,按 4,800/600/600 分为训练、验证、测试。T036 组保留重原子数少于 9 的条件,并加入同目标的二维模型对照;输入与网络同时变化,不能把全部差异归因于三维信息。

1. 三种输入分别保留了这个分子的什么?

同一个分子的字符串、连接图与三维坐标

图 1|同一分子 gdb_91(SMILES:O=C1CCN1)依次呈现为字符、原子连接图和三维结构。点击图片可打开矢量图放大查看。

这张图看什么: 同一分子 gdb_91 的三种样子:字符 O=C1CCN1、原子连接图和三维结构。

看到什么: GRU 依次读取字符,GCN/GIN 沿原子与化学键传递信息,三维网络还使用坐标或距离。性质与坐标按 gdb_N 对应后再拼接;本次使用 QM9 原始量子优化坐标,二维图与三维坐标的原子集合、顺序也分别核对。

补充说明 SMILES 仍编码连接关系,三维输入也不等于包含全部电子或环境信息。为缩短计算时间,本次 GCN/GIN 使用两层网络,原教程使用三层;结果不能直接等同。

2. 学习曲线持续改善了吗?

两个性质任务的验证误差曲线

图 2|每轮验证 RMSE:曲线和阴影分别是 3 个种子的均值与样本标准差;右侧使用对数纵轴。

这张图看什么: 图中是每轮的验证 RMSE(均方根误差,越小越好),不是 MAE;曲线和阴影分别是 3 个种子的均值与样本标准差,右图纵轴为对数。

看到什么: 每个模型训练 3 个随机种子、各 60 轮;训练集更新权重,验证集选择保存轮次,测试集报告表现,目标标准化只用训练数据——这张图呈现的正是用来挑选保存轮次的验证误差。

补充说明 这里只画验证误差,不能单凭它判断过拟合。

3. 和简单基线相比,这些模型强多少?

测试误差与真实基线的比较

图 3|所有模型的测试误差与“预测训练均值”“仅按重原子数线性拟合”两个基线的比较。

这张图看什么: 各模型在相同目标、相同划分中比较测试误差(下表列出数值),对照“预测训练均值”“仅按重原子数线性拟合”两个基线。

看到什么: 数值为三个种子的均值 ± 样本标准差:

模型 偶极矩测试 RMSE,Debye ⟨R²⟩ 测试 RMSE,Bohr²
GRU 1.113 ± 0.013 67.12 ± 0.57
GCN 1.116 ± 0.010 94.48 ± 2.28
GIN 1.149 ± 0.010 86.91 ± 3.37
绝对坐标三维网络 本次未训练此目标 54.47 ± 3.30
距离不变三维网络 本次未训练此目标 11.25 ± 1.40

偶极矩任务中 GRU/GCN 表现接近;⟨R²⟩ 任务中距离网络误差最低。训练均值基线的两列 RMSE 约 1.508 Debye、235.24 Bohr²;仅按重原子数拟合 ⟨R²⟩ 为 214.40 Bohr²。

补充说明 只在同一列内比较:两个目标、单位与样本池不同。距离网络在 ⟨R²⟩ 任务误差最低,不能外推为所有性质都更好;也不能据重原子数基线的数字说分子大小已经足够准确。

4. 平均误差掩盖了哪些分子?

偶极矩预测与QM9参考值的散点图

图 4|seed 0 的 600 个测试分子,偶极矩预测值对 QM9 参考值。

这张图看什么: 一次运行(seed 0)的 600 个测试分子:横轴 QM9 参考值,纵轴预测值。先找对角线,再看偏离最远的分子和是否存在整体高估、低估。

看到什么: 偶极矩大小反映电荷分离程度,数值小不等于分子小。

补充说明 总体 RMSE 相近的模型,也可能在不同分子上出错。

5. 样本很少的分组能下结论吗?

空间扩展量预测与不同分子大小的误差

图 5|⟨R²⟩ 预测:左侧比较两种三维模型,右侧按重原子数分组展示误差;空心点标记样本很少的前两组。

这张图看什么: ⟨R²⟩ 预测:左侧比较两种三维模型,右侧按重原子数分组展示误差;空心点标记样本很少的前两组。

看到什么: ⟨R²⟩ 测试集中,5、6、7、8 个重原子的分子分别只有 6、14、81、499 个;前两组用空心点提示样本少。

补充说明 某个小组的平均误差低,不足以证明模型对这种大小的分子普遍可靠。这里预测的是电子空间扩展量,不是 HOMO–LUMO 能隙。

6. 转动或平移分子,预测会变吗?

平移旋转及反射后的模型预测变化

图 6|对测试分子施加平移、旋转、旋转加平移、反射后的预测变化:左侧合并 3 个种子(每模型每变换 144 条记录),右侧仅 seed 0 的逐分子变化;精确为零的变化用叉号标出,对数轴显示下限不是测量精度。

这张图看什么: 对测试分子施加平移、旋转、旋转加平移、反射后的预测变化:左侧合并 3 个种子(每模型每变换 144 条记录),右侧仅 seed 0 的逐分子变化;精确为零的变化用叉号标出,对数轴显示下限不是测量精度。

看到什么: 偶极矩大小与 ⟨R²⟩ 是本节的标量目标,整体平移或旋转后应不变。对 48 个测试分子做平移、旋转、组合变换与反射后,距离网络的变化约 10⁻⁴ Bohr²,与浮点误差量级相当;绝对坐标网络仅在指定平移下平均变化就约 1,888 Bohr²。原教程名为 EquivariantGNN 的模型在这里用距离传递信息、输出 E(3) 不变标量,不等同于逐层更新坐标的 EGNN。

补充说明 距离不能区分镜像;满足几何不变性也不保证预测准确,仍需测试误差检验。

下一步

本节训练的是小分子的量子化学性质,用来理解输入表示、学习过程和模型行为。EGFR 抑制剂的有效性需要回到 EGFR 活性数据和实验验证;更大或更陌生的分子也需要单独评估。下一节分别用 EGFR 检验预测不确定性,用 KIBA 学习蛋白与配体的联合建模:继续第十节:模型什么时候值得相信,什么时候该继续查证?。

去之前可以先发一句追问,把本节结果收拢:

距离不变网络在 ⟨R²⟩ 任务上误差最低(11.25 ± 1.40 Bohr²),这能外推到其他性质吗?请结合训练均值基线的 1.508 Debye 和 235.24 Bohr² 解释。

下载本节完整输入输出与代码,解压后先打开 readable-report.html。

想检查什么 打开哪个文件
本节各项结果与结论怎样串起来 readable-report.html

原始教学内容:T034、T035、T036。QM9 数据背景见 Ramakrishnan 等的原始数据论文,本次加载的目标索引与单位见 PyG QM9 官方说明。

返回指南首页。

results matching ""

    No results matching ""