通路富集:用 donor-aware 排序读懂 CD8 T 亚类的功能差异
1. 任务说明
完成亚类注释后,本页继续回答:某个亚类相对同一 donor 的其他亚类,哪些基因更靠前或更靠后?这些基因集中在哪些功能通路?
本案例执行两类分析:
- ORA:分别取每个亚类排序最靠前和最靠后的 200 个基因,检查 Hallmark、KEGG 和 GO BP 通路是否集中出现;
- AUCell:计算 Hallmark 和 KEGG 基因集评分,汇总到
donorID × cell_subtype。
本轮按要求没有执行 GSEA。这些结果来自 RNA 表达,只能作为功能线索,不是蛋白活性、代谢通量或机制证据。
2. 激活下游分析智能体
打开“智能体”页面,激活 Single-cell Downstream Analyst Pro V2。
界面显示名称可能随版本调整,最终以运行记录中的智能体 ID 为准。
3. 真实案例:确认输入和分析单位
输入仍是 CD8T_annotated.h5ad:
| 项目 | 本案例 |
|---|---|
| 细胞数 | 10,927 |
| 基因数 | 15,929 |
| 亚类字段 | cell_subtype(15 个亚类) |
| 生物学重复字段 | donorID(23 个 donor) |
| 比较方式 | 每个亚类 versus 同一 donor 中的其他亚类 |
确认分析对象仍是 10,927 个细胞和 15 个亚类。图中保留了 CD8T_lowqual_mito 和 CD8T_stress_HSP,后续结果也要保留质量和应激解释。
3.1 分析单位是 donor,不是 cell
先在每个 donor 内比较“目标亚类”和“该 donor 的其他亚类”,再汇总 donor 间的排序证据,避免把细胞误当成独立重复。tissue 和 sex 在同一 donor 内不变化,配对比较可消去这些因素;但 Kidney 和 Thymus 各只有 2 个 donor,所以本页只做描述性解释。
3.2 不是所有亚类都能进入 ORA
每个 donorID × cell_subtype 至少需要 10 个细胞,且一个亚类至少需要 3 个可用 donor。15 个亚类中 14 个满足要求;CD8T_naive 只有 2 个 donor 达标,未进入 ORA——这不是“naive 没有通路”,而是数据不足。
4. 发送提示词
参考提示词(可直接复制):请先把尖括号中的内容替换为自己的实际路径。
<CD8T_annotated.h5ad 的完整路径>
请比较不同 cell_subtype 的通路富集结果。
donor 字段:donorID
请输出结果表和图片。
实际流程:
检查输入和 layers['counts']
→ 在每个 donor 内构建 subtype-versus-rest pseudobulk
→ 为每个亚类生成 donor 配对的全基因排序
→ 分别取前 200 和后 200 个基因
→ 对 Hallmark、KEGG、GO BP 做上调和下调 ORA
→ 用 AUCell 计算 donor × subtype 通路评分
→ 生成阶梯状结果图并验证交付
“上调”和“下调”指相对同一 donor 其他亚类的排序方向,不是疾病和健康之间的变化。
4.1 本轮完成的 8 个目标
| 目标 | 数据范围 | 表格行数 |
|---|---|---|
| Hallmark ORA,上调 | 14 亚类 × 50 通路 | 700 |
| Hallmark ORA,下调 | 14 亚类 × 50 通路 | 700 |
| KEGG ORA,上调 | 14 亚类 × 320 通路 | 4,480 |
| KEGG ORA,下调 | 14 亚类 × 320 通路 | 4,480 |
| GO BP ORA,上调 | 14 亚类 × 5,407 通路 | 75,698 |
| GO BP ORA,下调 | 14 亚类 × 5,407 通路 | 75,698 |
| Hallmark AUCell | 109 donor × subtype × 50 通路 | 5,450 |
| KEGG AUCell | 109 donor × subtype × 316 通路 | 34,444 |
8 个目标都通过验证,交付状态为 completed。
4.2 需要保留的 warning
| 记录 | 怎样理解 |
|---|---|
| GSEA 未执行 | 本次明确约束,不是遗漏 |
CD8T_naive 未进入 ORA |
只有 2 个 donor 达到细胞数门槛 |
| AUCell 跳过 88 个稀疏组合 | 不足 10 个细胞的组合不计算 |
| KEGG AUCell 丢弃 4 个过小基因集 | 最终评分 316 条通路 |
| 图中只显示 30 条通路 | 完整结果在 CSV,图只是阅读入口 |
本轮没有生成 REPORT.md、notebook 或新的 h5ad,只列出真实存在并通过验证的文件。
5. 结果解读
5.1 Hallmark 上调 ORA
纵轴是 14 个亚类,横轴是 30 条 Hallmark 通路。行列排序仅为形成可读区块,不是发育轨迹;正式判断要回到 CSV 检查 overlap、odds_ratio 和 bh_fdr。
| 亚类 | Hallmark 通路 | overlap | odds ratio | BH FDR | 谨慎描述 |
|---|---|---|---|---|---|
CD8T_ISG |
Interferon Gamma Response | 32 | 18.30 | 5.53×10⁻²⁵ | IFN-γ 相关基因集中在该亚类排序前端 |
CD8T_ISG |
Interferon Alpha Response | 22 | 27.13 | 8.96×10⁻²¹ | IFN-α 相关程序也很突出 |
CD8T_act_IEG |
TNF-alpha Signaling via NF-kB | 31 | 17.31 | 1.37×10⁻²³ | 与即时早期激活标签方向一致 |
CD8T_stress_HSP |
TNF-alpha Signaling via NF-kB | 30 | 16.56 | 2.33×10⁻²² | 先按应激状态解释 |
这些 FDR 是 ORA 表内部的富集检验,不是 condition DE 的显著性。
5.2 Hallmark 下调 ORA
使用每个亚类排序最后 200 个基因。“下调”只表示相对靠后,不等于通路被关闭。
| 亚类 | Hallmark 通路 | overlap | odds ratio | BH FDR | 谨慎描述 |
|---|---|---|---|---|---|
CD8T_Teff_TEMRA |
TNF-alpha Signaling via NF-kB | 34 | 19.66 | 2.16×10⁻²⁷ | 该通路基因集中在 TEMRA 排序后端 |
Thymocyte_dev_SOX4 |
TNF-alpha Signaling via NF-kB | 15 | 7.09 | 1.47×10⁻⁶ | 只描述相对排序 |
Thymocyte_DP |
Interferon Alpha Response | 10 | 10.17 | 1.45×10⁻⁵ | IFN-α 相关基因相对靠后 |
同一条通路出现在一个亚类的上调列表和另一个亚类的下调列表并不矛盾,它反映的是不同亚类相对其余亚类的排序方向。
5.3 KEGG 上调 ORA
KEGG 常出现疾病或感染名称(如 “Measles”“Coronavirus disease”),它们通常来自共享的免疫基因,不能据此判断样本感染了相应病原体。必须打开 overlap_genes 查看实际重叠基因。
GO BP 也已完成上下调 ORA,但 5,407 个术语高度冗余。建议先用 Hallmark 理清主线,再把 KEGG 和 GO BP 当作补充。
5.4 AUCell:donor × subtype 表格
本轮用 AUCell 计算评分,只保留至少 10 个细胞的组合:
- Hallmark:109 个组合 × 50 条通路,共 5,450 行;
- KEGG:109 个组合 × 316 条通路,共 34,444 行。
每行是一个 cell_subtype,每列是图中选出的 30 条 Hallmark 通路。颜色是为绘图缩放后的亚类汇总分数,只用于比较相对模式;它不是显著性、蛋白活性或因果证据。
KEGG 图使用相同读法。疾病或感染名称仍可能来自共享免疫基因,不能据此作诊断。图提供亚类层面的阅读入口;跨 donor 一致性仍要回到 AUCell_hallmark.csv 和 AUCell_kegg.csv 检查 109 个 donorID × cell_subtype 组合。
复核某条 ORA 线索时,打开 AUCell 表检查它是否在多个 donor 中方向一致,而不是只由一个 donor 推高。
5.5 三类信息放在一起看
| 信息 | 回答什么 | 不能回答什么 |
|---|---|---|
| 上调 ORA | 排序前 200 个基因集中在哪些通路 | 通路蛋白是否激活 |
| 下调 ORA | 排序后 200 个基因集中在哪些通路 | 通路是否被“关闭” |
| donor × subtype AUCell | 评分是否跨多个 donor 一致 | condition 显著性或因果机制 |
例如 CD8T_ISG 的 IFN 线索:先在上调 ORA 中定位,再看 overlap_genes 的驱动基因,最后用 AUCell 表检查 donor 间一致性。三者来自同一份表达数据,是互相复核,不是独立队列验证。
5.6 主要交付文件
| 文件或目录 | 用途 |
|---|---|
tables/ora/ORA_hallmark_up.csv / down.csv |
Hallmark 上调、下调 ORA 完整表 |
tables/ora/ORA_kegg_up.csv / down.csv |
KEGG 上调、下调 ORA 完整表 |
tables/ora/ORA_go_bp_up.csv / down.csv |
GO BP 上调、下调 ORA 完整表 |
tables/aucell/AUCell_hallmark.csv |
donor × subtype 的 Hallmark AUCell 评分 |
tables/aucell/AUCell_kegg.csv |
donor × subtype 的 KEGG AUCell 评分 |
gene_lists/*_up.txt / *_down.txt |
每个亚类的前 200 和后 200 个基因 |
formal_figures/<target>/fig.png(及 pdf/svg) |
阶梯状主图 |
run_manifest.json |
输入、设计、方法、warning 和最终状态 |
result_validation.json / figure_validation.json |
表格行数、图件来源和验证状态 |
artifact_validation.json |
8 个目标是否完整交付的最终凭据 |
6. 人机职责
| 分析者负责 | 可以交给 omicOS |
|---|---|
| 明确比较的是 subtype 还是 condition | 组织 subtype-versus-rest 流程 |
| 指定 donor 和批次字段 | 建立 donor 内配对的 pseudobulk 排序 |
判断是否保留 lowqual_mito、stress_HSP |
单独输出这些群的结果和 warning |
| 判断疾病名称通路是否只是共享基因造成 | 输出 overlap_genes、odds ratio 和 FDR |
| 设计真正的 condition 对比 | 保留可复查的 donor-level 输入 |
| 决定是否需要实验或独立队列验证 | 生成候选通路、表格和图件 |
omicOS 可以把基因排序整理成通路线索,但不能替分析者决定哪条通路就是疾病机制。
7. 验收清单
- 输入仍是
CD8T_annotated.h5ad,10,927 个细胞、15 个亚类; - 运行记录写明分析单位是
donorID,比较方式是 subtype-versus-rest; CD8T_naive的排除原因已记录,不把“未分析”写成“无通路”;- 6 张 ORA 表和 2 张 AUCell 表都通过验证;
- 重要结论已回到 CSV 复核,不只看阶梯图;
- 文字中没有把 ORA/AUCell 写成 condition DE、蛋白活性或因果机制。
8. 下一步
- 打开感兴趣通路的
overlap_genes,确认结果不是由单个高表达基因或应激基因主导; - 查看 donor × subtype AUCell 表,确认方向跨多个 donor 一致;
- 去掉
lowqual_mito、stress_HSP后复算关键候选; - 如果真正的问题是疾病或治疗差异,在每个亚类内按 donor 建立 condition contrast,再做 pseudobulk DEG 和富集分析——本页的 subtype-versus-rest 不能代替这一步。
9. 操作回放
- 新建对话,提供
CD8T_annotated.h5ad的完整路径。 - 激活
Single-cell Downstream Analyst Pro V2。 - 发送第 4 节提示词,只需说明比较
cell_subtype、使用donorID,并需要结果表和图片。 - 检查运行状态:打开
run_manifest.json确认状态为completed,warning 包含CD8T_naive排除、88 个稀疏组合跳过和 4 个 KEGG 基因集丢弃;再检查artifact_validation.json中 8 个目标均完成。 - 按顺序看结果:Hallmark 上调 → Hallmark 下调 → KEGG 阶梯图 → 对应 CSV 的
overlap_genes、odds_ratio、bh_fdr→ donor × subtype AUCell 表。不要只根据亮色方块写结论。 - 记录结论和限制:输入、字段、14 个 ORA 亚类、
CD8T_naive排除、方向定义、数据库、聚合单位,以及“本轮不做 GSEA、结果仅为描述性线索”。






