通路富集:用 donor-aware 排序读懂 CD8 T 亚类的功能差异

1. 任务说明

完成亚类注释后,本页继续回答:某个亚类相对同一 donor 的其他亚类,哪些基因更靠前或更靠后?这些基因集中在哪些功能通路?

本案例执行两类分析:

  • ORA:分别取每个亚类排序最靠前和最靠后的 200 个基因,检查 Hallmark、KEGG 和 GO BP 通路是否集中出现;
  • AUCell:计算 Hallmark 和 KEGG 基因集评分,汇总到 donorID × cell_subtype

本轮按要求没有执行 GSEA。这些结果来自 RNA 表达,只能作为功能线索,不是蛋白活性、代谢通量或机制证据。

2. 激活下游分析智能体

打开“智能体”页面,激活 Single-cell Downstream Analyst Pro V2

在 omicOS 中选择单细胞下游分析智能体

界面显示名称可能随版本调整,最终以运行记录中的智能体 ID 为准。

3. 真实案例:确认输入和分析单位

输入仍是 CD8T_annotated.h5ad

项目 本案例
细胞数 10,927
基因数 15,929
亚类字段 cell_subtype(15 个亚类)
生物学重复字段 donorID(23 个 donor)
比较方式 每个亚类 versus 同一 donor 中的其他亚类

通路富集分析沿用的 CD8 T 亚类 UMAP

确认分析对象仍是 10,927 个细胞和 15 个亚类。图中保留了 CD8T_lowqual_mitoCD8T_stress_HSP,后续结果也要保留质量和应激解释。

3.1 分析单位是 donor,不是 cell

先在每个 donor 内比较“目标亚类”和“该 donor 的其他亚类”,再汇总 donor 间的排序证据,避免把细胞误当成独立重复。tissuesex 在同一 donor 内不变化,配对比较可消去这些因素;但 Kidney 和 Thymus 各只有 2 个 donor,所以本页只做描述性解释。

3.2 不是所有亚类都能进入 ORA

每个 donorID × cell_subtype 至少需要 10 个细胞,且一个亚类至少需要 3 个可用 donor。15 个亚类中 14 个满足要求;CD8T_naive 只有 2 个 donor 达标,未进入 ORA——这不是“naive 没有通路”,而是数据不足。

4. 发送提示词

参考提示词(可直接复制):请先把尖括号中的内容替换为自己的实际路径。

<CD8T_annotated.h5ad 的完整路径>

请比较不同 cell_subtype 的通路富集结果。
donor 字段:donorID
请输出结果表和图片。

实际流程:

检查输入和 layers['counts']
→ 在每个 donor 内构建 subtype-versus-rest pseudobulk
→ 为每个亚类生成 donor 配对的全基因排序
→ 分别取前 200 和后 200 个基因
→ 对 Hallmark、KEGG、GO BP 做上调和下调 ORA
→ 用 AUCell 计算 donor × subtype 通路评分
→ 生成阶梯状结果图并验证交付

“上调”和“下调”指相对同一 donor 其他亚类的排序方向,不是疾病和健康之间的变化。

4.1 本轮完成的 8 个目标

目标 数据范围 表格行数
Hallmark ORA,上调 14 亚类 × 50 通路 700
Hallmark ORA,下调 14 亚类 × 50 通路 700
KEGG ORA,上调 14 亚类 × 320 通路 4,480
KEGG ORA,下调 14 亚类 × 320 通路 4,480
GO BP ORA,上调 14 亚类 × 5,407 通路 75,698
GO BP ORA,下调 14 亚类 × 5,407 通路 75,698
Hallmark AUCell 109 donor × subtype × 50 通路 5,450
KEGG AUCell 109 donor × subtype × 316 通路 34,444

8 个目标都通过验证,交付状态为 completed

4.2 需要保留的 warning

记录 怎样理解
GSEA 未执行 本次明确约束,不是遗漏
CD8T_naive 未进入 ORA 只有 2 个 donor 达到细胞数门槛
AUCell 跳过 88 个稀疏组合 不足 10 个细胞的组合不计算
KEGG AUCell 丢弃 4 个过小基因集 最终评分 316 条通路
图中只显示 30 条通路 完整结果在 CSV,图只是阅读入口

本轮没有生成 REPORT.md、notebook 或新的 h5ad,只列出真实存在并通过验证的文件。

5. 结果解读

5.1 Hallmark 上调 ORA

Hallmark 上调基因 ORA 阶梯图

纵轴是 14 个亚类,横轴是 30 条 Hallmark 通路。行列排序仅为形成可读区块,不是发育轨迹;正式判断要回到 CSV 检查 overlapodds_ratiobh_fdr

亚类 Hallmark 通路 overlap odds ratio BH FDR 谨慎描述
CD8T_ISG Interferon Gamma Response 32 18.30 5.53×10⁻²⁵ IFN-γ 相关基因集中在该亚类排序前端
CD8T_ISG Interferon Alpha Response 22 27.13 8.96×10⁻²¹ IFN-α 相关程序也很突出
CD8T_act_IEG TNF-alpha Signaling via NF-kB 31 17.31 1.37×10⁻²³ 与即时早期激活标签方向一致
CD8T_stress_HSP TNF-alpha Signaling via NF-kB 30 16.56 2.33×10⁻²² 先按应激状态解释

这些 FDR 是 ORA 表内部的富集检验,不是 condition DE 的显著性。

5.2 Hallmark 下调 ORA

Hallmark 下调基因 ORA 阶梯图

使用每个亚类排序最后 200 个基因。“下调”只表示相对靠后,不等于通路被关闭。

亚类 Hallmark 通路 overlap odds ratio BH FDR 谨慎描述
CD8T_Teff_TEMRA TNF-alpha Signaling via NF-kB 34 19.66 2.16×10⁻²⁷ 该通路基因集中在 TEMRA 排序后端
Thymocyte_dev_SOX4 TNF-alpha Signaling via NF-kB 15 7.09 1.47×10⁻⁶ 只描述相对排序
Thymocyte_DP Interferon Alpha Response 10 10.17 1.45×10⁻⁵ IFN-α 相关基因相对靠后

同一条通路出现在一个亚类的上调列表和另一个亚类的下调列表并不矛盾,它反映的是不同亚类相对其余亚类的排序方向。

5.3 KEGG 上调 ORA

KEGG 上调基因 ORA 阶梯图

KEGG 常出现疾病或感染名称(如 “Measles”“Coronavirus disease”),它们通常来自共享的免疫基因,不能据此判断样本感染了相应病原体。必须打开 overlap_genes 查看实际重叠基因。

GO BP 也已完成上下调 ORA,但 5,407 个术语高度冗余。建议先用 Hallmark 理清主线,再把 KEGG 和 GO BP 当作补充。

5.4 AUCell:donor × subtype 表格

本轮用 AUCell 计算评分,只保留至少 10 个细胞的组合:

  • Hallmark:109 个组合 × 50 条通路,共 5,450 行;
  • KEGG:109 个组合 × 316 条通路,共 34,444 行。

Hallmark AUCell 亚类阶梯图

每行是一个 cell_subtype,每列是图中选出的 30 条 Hallmark 通路。颜色是为绘图缩放后的亚类汇总分数,只用于比较相对模式;它不是显著性、蛋白活性或因果证据。

KEGG AUCell 亚类阶梯图

KEGG 图使用相同读法。疾病或感染名称仍可能来自共享免疫基因,不能据此作诊断。图提供亚类层面的阅读入口;跨 donor 一致性仍要回到 AUCell_hallmark.csvAUCell_kegg.csv 检查 109 个 donorID × cell_subtype 组合。

复核某条 ORA 线索时,打开 AUCell 表检查它是否在多个 donor 中方向一致,而不是只由一个 donor 推高。

5.5 三类信息放在一起看

信息 回答什么 不能回答什么
上调 ORA 排序前 200 个基因集中在哪些通路 通路蛋白是否激活
下调 ORA 排序后 200 个基因集中在哪些通路 通路是否被“关闭”
donor × subtype AUCell 评分是否跨多个 donor 一致 condition 显著性或因果机制

例如 CD8T_ISG 的 IFN 线索:先在上调 ORA 中定位,再看 overlap_genes 的驱动基因,最后用 AUCell 表检查 donor 间一致性。三者来自同一份表达数据,是互相复核,不是独立队列验证。

5.6 主要交付文件

文件或目录 用途
tables/ora/ORA_hallmark_up.csv / down.csv Hallmark 上调、下调 ORA 完整表
tables/ora/ORA_kegg_up.csv / down.csv KEGG 上调、下调 ORA 完整表
tables/ora/ORA_go_bp_up.csv / down.csv GO BP 上调、下调 ORA 完整表
tables/aucell/AUCell_hallmark.csv donor × subtype 的 Hallmark AUCell 评分
tables/aucell/AUCell_kegg.csv donor × subtype 的 KEGG AUCell 评分
gene_lists/*_up.txt / *_down.txt 每个亚类的前 200 和后 200 个基因
formal_figures/<target>/fig.png(及 pdf/svg) 阶梯状主图
run_manifest.json 输入、设计、方法、warning 和最终状态
result_validation.json / figure_validation.json 表格行数、图件来源和验证状态
artifact_validation.json 8 个目标是否完整交付的最终凭据

6. 人机职责

分析者负责 可以交给 omicOS
明确比较的是 subtype 还是 condition 组织 subtype-versus-rest 流程
指定 donor 和批次字段 建立 donor 内配对的 pseudobulk 排序
判断是否保留 lowqual_mitostress_HSP 单独输出这些群的结果和 warning
判断疾病名称通路是否只是共享基因造成 输出 overlap_genes、odds ratio 和 FDR
设计真正的 condition 对比 保留可复查的 donor-level 输入
决定是否需要实验或独立队列验证 生成候选通路、表格和图件

omicOS 可以把基因排序整理成通路线索,但不能替分析者决定哪条通路就是疾病机制。

7. 验收清单

  1. 输入仍是 CD8T_annotated.h5ad,10,927 个细胞、15 个亚类;
  2. 运行记录写明分析单位是 donorID,比较方式是 subtype-versus-rest;
  3. CD8T_naive 的排除原因已记录,不把“未分析”写成“无通路”;
  4. 6 张 ORA 表和 2 张 AUCell 表都通过验证;
  5. 重要结论已回到 CSV 复核,不只看阶梯图;
  6. 文字中没有把 ORA/AUCell 写成 condition DE、蛋白活性或因果机制。

8. 下一步

  1. 打开感兴趣通路的 overlap_genes,确认结果不是由单个高表达基因或应激基因主导;
  2. 查看 donor × subtype AUCell 表,确认方向跨多个 donor 一致;
  3. 去掉 lowqual_mitostress_HSP 后复算关键候选;
  4. 如果真正的问题是疾病或治疗差异,在每个亚类内按 donor 建立 condition contrast,再做 pseudobulk DEG 和富集分析——本页的 subtype-versus-rest 不能代替这一步。

9. 操作回放

  1. 新建对话,提供 CD8T_annotated.h5ad 的完整路径。
  2. 激活 Single-cell Downstream Analyst Pro V2
  3. 发送第 4 节提示词,只需说明比较 cell_subtype、使用 donorID,并需要结果表和图片。
  4. 检查运行状态:打开 run_manifest.json 确认状态为 completed,warning 包含 CD8T_naive 排除、88 个稀疏组合跳过和 4 个 KEGG 基因集丢弃;再检查 artifact_validation.json 中 8 个目标均完成。
  5. 按顺序看结果:Hallmark 上调 → Hallmark 下调 → KEGG 阶梯图 → 对应 CSV 的 overlap_genesodds_ratiobh_fdr → donor × subtype AUCell 表。不要只根据亮色方块写结论。
  6. 记录结论和限制:输入、字段、14 个 ORA 亚类、CD8T_naive 排除、方向定义、数据库、聚合单位,以及“本轮不做 GSEA、结果仅为描述性线索”。

results matching ""

    No results matching ""