单细胞-下游分析:教程目录
这组教程从细胞大类注释完成后的数据继续向下走。细胞大类结果直接沿用上游教程;先按目标字段拆分数据,取出要继续分析的谱系,再完成谱系内预处理、聚类和亚类注释,最后进入通路富集评分、基因调控网络、代谢分析、轨迹分析和 3CA 元程序分析。
教程中所有可以发送给智能体的内容,都会用 “参考提示词(可直接复制)” 单独标出。复制后,只需把尖括号中的路径替换成自己的实际路径。
这些提示词刻意使用初学者会自然输入的短句,只保留文件路径、分析目标、必需字段和极少数必须说明的输入要求。统计单位、fallback、结果验收和证据边界会在后面的教程正文中单独检查,不需要全部塞进第一句话。
| 步骤 | 本案例使用的智能体 | 要回答的问题 | 主要交付 |
|---|---|---|---|
| 1. 亚类注释前的准备 | Vertical Agent Selector、Single-cell Preprocessor Pro |
怎样拆出目标谱系,并得到可交给亚类注释的聚类结果? | 8 个大类 h5ad、结肠 CD8T 的批次整合、12 个 cluster、marker 和 CD8T_Colon_processed.h5ad |
| 2. 细胞亚类注释 | Single-cell Annotator Pro V2 |
怎样根据 cluster marker 给结肠 CD8T 建立可复核的亚类标签,并另存清理后的 h5ad? | 12 个 cluster 的标签和证据、cell_subtype、清理前后 UMAP、2,491 细胞的 clean h5ad |
| 3. 通路富集评分 | Single-cell Downstream Analyst Pro V2 |
怎样用 donor 内配对排序得到亚类的上调/下调通路线索? | Hallmark、KEGG、GO BP 的双向 ORA,donor × subtype AUCell、阶梯图和验证记录 |
| 4. 基因调控网络 | Single-cell GRN Analyst |
怎样从 GRNBoost2 共表达候选网络继续得到 motif 支持的 SCENIC regulon? | TF-target edges、GRNBoost2 模块、SCENIC regulon、AUCell、RSS、资源和运行记录 |
| 5. 代谢分析 | Single-cell Metabolism Agent |
怎样用 scFEA 推断反应模块和代谢物 balance,并在 donor 层面谨慎比较亚类? | scFEA h5ad、模块与 balance 矩阵、donor-level 统计、图件、warning 和 scMetabolism 对照 |
| 6. 轨迹分析 | Single-cell Trajectory Pro V2 |
怎样指定 root 和批次 key,为完成亚类注释的 CD8T 建立可复核的伪时间顺序? | 轨迹 h5ad、伪时间表、亚类与样本复核图、批次诊断、marker 动态热图和候选选择说明 |
| 7. 3CA 元程序分析 | C3CA Phase Runner(Lab 订阅) |
怎样从同一谱系的逐样本 h5ad 中找到跨样本复现的肿瘤细胞转录程序? | rust-NMF 前端矩阵、稳健程序、最终 MP、细胞评分、证据图和可审计报告 |
第一篇沿用“单细胞-上游分析”的人类健康泛组织数据。上游交付的 annotated.h5ad 有 141,871 个细胞,并把 8 个大类写入 cell_type_pro_primary;拆分后选择含 10,942 个细胞的 majorCluster_CD8T.h5ad,再保留 2,693 个结肠 CD8T,按 sampleID 完成 Harmony 整合和 12 个 cluster 的聚类。第二篇继续使用 CD8T_Colon_processed.h5ad,演示怎样给 12 个 cluster 添加亚类标签,并在人工确认后得到含 2,491 个细胞和 10 个亚类的 CD8T_Colon_annotated_clean.h5ad。第三、四篇回到泛组织 CD8 T 谱系,使用包含 10,927 个细胞和 15 个亚类的 CD8T_annotated.h5ad,依次演示通路富集评分和 GRN/SCENIC。第五、六篇使用结肠 CD8T 数据,依次演示以 donor 为分析单位的 scFEA/scMetabolism 代谢分析和轨迹分析。第七篇使用 5 个 HNSCC 肿瘤细胞样本,演示 3CA 怎样从样本内 NMF 程序得到跨样本元程序;它是独立案例,不与前六篇的 CD8T 数字拼接。
从亚类注释前的准备开始。