常规画图与简单差异表达:用注释后的数据回答基础问题
1. 这一步在做什么
前三步已经得到一份完成预处理和细胞类型注释的 .h5ad。现在可以直接用它画 UMAP、统计细胞组成,并比较不同组的基因表达。
差异表达(DE)就是比较两组样本中哪些基因表达更高或更低。图可以按细胞展示,但统计时不能把几万个细胞当成几万个独立样本。
注释后的 h5ad
→ 看整体分布
→ 比较细胞组成
→ 在指定细胞类型中比较基因表达
2. 开始前:激活正确的智能体
本页使用 OmicVerse scRNA DE & Plotting。简单说,它是注释后单细胞数据的常规分析和作图助手。
你只要说清楚三件事:看哪类细胞、按什么分组、想比较谁和谁。它会先检查数据和样本设计是否够用,再做汇总、比较和作图。
打开“智能体”页面,找到 OmicVerse scRNA DE & Plotting 并点击“激活”。点击可查看原图。
它能做什么
- 检查
sample、donor、分组和细胞类型标签是否完整; - 使用数据中已有的 UMAP 或 PCA,按细胞类型、样本、批次、分组或基因表达着色;
- 汇总指定基因的表达,并寻找某类细胞的 marker,也就是标志基因;
- 比较不同样本中的细胞数量和细胞比例;
- 在指定细胞类型中做简单组间差异表达;
- 在 counts、样本信息和重复数满足要求时,把同一样本的表达汇总后再比较,也就是 pseudobulk;
- 输出结果表、作图数据、图片和简短报告。
常见能画的图
| 你想看什么 | 可以画什么 |
|---|---|
| 细胞整体分布 | UMAP、PCA、分面图、指定群体高亮图、基因表达 UMAP |
| 基因和 marker | 小提琴图、表达气泡图(dotplot)、marker 气泡图、marker 热图 |
| 样本间表达差异 | 样本级箱线散点图、火山图、样本 PCA、差异基因热图 |
| 多种细胞的差异方向 | 细胞类型 × 基因效应热图、气泡图、效应量森林图 |
| 细胞组成 | 堆叠比例图、样本级比例箱线散点图、覆盖度热图、效应量森林图、配对连线图(仅限配对设计) |
| 数据与设计检查 | 各样本细胞数、metadata 缺失情况、样本 × 细胞类型覆盖度热图 |
“样本级”表示图上的每个点代表一个 sample 或 donor,而不是一个细胞。做组间比较时,这一点很重要。
| 选择 | 适合什么情况 |
|---|---|
| OmicVerse scRNA DE & Plotting | 已经完成预处理,任务也很明确;本案例使用它 |
| Vertical Agent Selector | 不确定选谁时自动导航;它本身不执行分析 |
任务已经明确时,建议手动激活对应智能体。这样更直接,也更容易确认能力边界。
这个智能体可以汇总已有 QC 指标,但不会重新过滤细胞,也不负责去批次、聚类或细胞注释。轨迹、RNA velocity、细胞通讯、CNV、空间分析,以及复杂的多因素或纵向模型,需要交给其他智能体。代谢状态、基因模块和通路富集也不属于本页这个智能体。
最后记住:能画图,不等于能下统计结论。 如果缺少可靠的 sample / donor 标签、原始 counts 或足够的生物学重复,它只能做描述性展示。
3. 直接看一个真实案例
这个案例沿用上一页的注释结果。
| 项目 | 本案例 |
|---|---|
| 输入规模 | 141,871 个细胞 × 19,888 个基因 |
| 细胞类型列 | cell_type_pro_primary,8 个细胞大类 |
| 已有坐标 | X_umap |
| 样本信息 | 6 个组织、28 个 donor、65 个 sample |
| 表达数据 | layers/counts 中有整数 counts |
同一份数据可以继续回答三个问题。
3.1 先看整体图谱
可以直接告诉 omicOS:
<注释后 h5ad 路径>
请使用 cell_type_pro_primary 作为主要细胞类型,
展示已有 X_umap,并分别按 tissue、region、cohortName 和 donorID 着色。
统计各组织、donor 和 sample 的细胞数及细胞类型构成。
本次只做描述性汇总,不做差异推断。
按 cell_type_pro_primary 着色的真实 UMAP。UMAP 是展示图,不是统计检验;点击可查看原图。
这次运行生成了细胞类型、组织、region、cohort 和 donor UMAP,以及细胞数和组成表。最重要的是先确认:
- 图中是否包含全部 141,871 个细胞;
- 8 个细胞大类是否都出现;
- 某个区域是否被单一组织、sample 或 donor 主导。
3.2 再比较细胞组成
如果想比较不同组织中的细胞比例,可以继续问:
请比较不同 tissue 的主要细胞组成,
细胞类型列使用 cell_type_pro_primary。
先建立 donor × tissue × cell type 的完整计数和比例表。
统计时以 donorID 为独立样本,不能把单个细胞当作重复。
请报告每组 donor 数、效应量和多重检验校正结果。
每个点代表一个 donor。Thymus 的点仍展示,但不计入本次总体检验。先看组内有几个点、离散程度多大,再看检验结果;图较宽时可点击查看原图。
本案例中,Thymus 只有 2 个 donor,因此没有进入探索性总体检验。其余 26 个 donor 用于 5 个组织的总体比较。
结果显示 7 个细胞大类的总体比较通过 BH 多重校正,Mast 没有通过。BH 校正就是在同时检验多个细胞类型时减少误报。
但这里有一个关键限制:tissue、cohortName 和 datasetID 完全混杂。因此只能写成“探索性的组织 / 队列 / 数据集关联”,不能写成纯组织效应。
3.3 最后做简单表达比较
这个案例只看 Ureter 中的 TILC,并比较 Male 与 Female:
请只分析 tissue == "Ureter"
且 cell_type_pro_primary == "TILC" 的细胞。
比较 Male 与 Female,效应方向固定为 Male minus Female。
以 donorID 为生物学单位,以 sampleID 聚合 pseudobulk。
先检查 counts、每个样本的细胞数、library size、基因过滤、
样本 PCA 和相关性。本次先报告描述性 log2FC,
不要退回细胞级 Wilcoxon,也不要把结果称为显著差异基因。
pseudobulk 的意思是:先把同一个样本、同一种细胞的 counts 加起来,再以样本为单位比较。这样不会把同一个人的几千个细胞误当成几千个独立重复。
每个点代表一个 donor。图中展示的是绝对 log2FC 较大的基因和样本分布,不是“显著基因”清单;点击可查看原图。
本次筛出 6,856 个细胞、10 个 donor,Male 和 Female 各 5 个。所有样本都通过最低细胞数检查,范围为 38~3,033 个细胞。library size 就是一个样本汇总后的总 counts。
RPS4Y1、DDX3Y、USP9Y 等在 Male 中较高,XIST 在 Female 中较高,方向符合预期。但本次主分析只报告描述性效应,正式 P 值、q 值和 FDR 均为空,因此不能写“发现了显著 DE gene”。FDR 是同时检验很多基因后,对误报率进行校正的指标。
4. omicOS 实际做了什么
| 问题 | 本案例的处理 |
|---|---|
| 画整体图谱 | 使用已有 X_umap,按细胞类型、组织、cohort 和 donor 着色 |
| 汇总数量 | 统计 tissue、donor、sample 和细胞类型的计数与比例 |
| 比较组成 | 先在 donor 内合并多个 sample,再以 donor 为统计单位 |
| 比较表达 | 确认 layers/counts,按 sample 聚合 pseudobulk,并固定比较方向 |
| 检查样本 | 汇总每个 profile 的细胞数、library size、PCA 和相关性 |
| 生成交付 | 输出结果表、PNG / SVG 图片、作图数据和限制说明 |
原始 .h5ad 保持只读。分析结果写入新的运行目录。
5. 结果应该怎样看
5.1 UMAP:先看分布,不要直接下结论
UMAP 适合看细胞群是否聚在一起、不同标签落在哪里。它不能单独证明批次已经消失,也不能证明两个群在生物学上完全不同。
建议用同一套坐标分别按 cell type、sample、donor、batch 和 condition 着色。某个区域如果几乎只来自一个样本,后续比较就要更谨慎。
5.2 组成图:一个点应该是一个独立样本
只把所有细胞堆在一起算比例,容易让细胞多的样本支配结果。正式比较时,先确认:
- 一个点代表 sample 还是 donor;
- 每组到底有几个独立重复;
- 比例为 0 的组合是否保留;
- 样本量太少的组是否被排除或单独标记;
- condition 是否与批次、队列或数据集混杂。
5.3 表达比较:同时看效应、样本和不确定性
log2FC 告诉你表达变化的方向和大小。它不等于统计显著。
每个点代表一个 donor。PCA 用来检查样本结构和异常点;点击可查看原图。
先看每组样本数、样本 PCA、离群样本和基因过滤,再看 P 值和 FDR。本案例的 PCA 中,U8 和 U2 位于主体样本之外,其余男女样本仍有混合。因此不宜只根据颜色概括为“按性别清晰分开”。
6. 简单 DE 先确认四件事
| 要确认什么 | 人话解释 |
|---|---|
| 比较谁和谁 | 写清实验组、参考组和效应方向,例如 Male minus Female |
| 独立样本是谁 | 通常是 sample 或 donor,不是单个细胞 |
| counts 在哪里 | pseudobulk 需要可靠的原始计数,不能拿任意归一化矩阵代替 |
| 设计是否可比较 | 每组要有足够重复,且 condition 不能与 batch、cohort 完全重合 |
还要分清两个概念:
- marker:某个 cluster 相比其他细胞更有代表性的基因;
- condition DE:同一种细胞在两个实验组之间的表达差异。
两者不是一回事。一个好 marker,不一定在 Male 和 Female 之间有差异。
7. 谁负责什么,结果怎样检查
| 分析者负责 | 可以交给 omicOS |
|---|---|
| 明确要回答的生物学问题 | 检查输入是否已预处理、已注释 |
| 确认 sample、donor、condition 和参考组 | 盘点可用列、表达层和已有坐标 |
| 判断哪些样本是真正独立重复 | 按 sample / donor 汇总表达或细胞比例 |
| 解释 batch、cohort 和 dataset 的含义 | 生成常规图、结果表和作图数据 |
| 决定离群样本是否排除 | 标出低覆盖、混杂和能力限制 |
| 决定结论能写到什么程度 | 区分描述性、探索性和样本级推断结果 |
交付前至少检查:
- 输入文件是否确实来自前三步;
- cell type、sample、donor 和 condition 列是否选对;
- 图使用的是已有 UMAP,还是重新计算的坐标;
- 组成比较中的一个点是否真的是一个独立样本;
- DE 使用的是 counts 还是 lognorm;
- 对比方向是否与提示词一致;
- 每组样本数、离群值和混杂因素是否写清;
- 图、结果表和文字结论能否互相对上。
8. 下一步
到这里,单细胞分析的基础路线已经走完:整理数据、预处理、注释,再用注释结果回答具体问题。
如果图的数据和统计结果已经确定,但字体、配色、图例或布局还需要调整,可以继续阅读在画布中编辑图片。
如果要继续细分 TILC、Myeloid 或 Epi,可以回到细胞类型注释。通路富集、轨迹、细胞通讯和复杂统计设计需要使用其他专门智能体,不属于本页智能体的能力范围。
想回看完整路线,可以返回单细胞分析导读。
9. 案例实际回放
9.1 在同一项目中新建对话
在“我的项目A”下新建对话,命名为“4-常规画图与简单DE”。
项目用于归档同一个研究,对话用于拆分不同任务。建议把图谱总览、组成比较和表达比较分成独立对话,后面更容易核对输入、参数和结论。
9.2 激活对应智能体
打开“智能体”页面,手动激活 OmicVerse scRNA DE & Plotting。如果不确定,也可以先激活 Vertical Agent Selector 自动导航。
9.3 一次只提一个问题
先发送第 3.1 节的图谱总览提示词。确认细胞数、字段和 UMAP 都正确后,再新建对话进行组成比较或表达比较。
不要把“画十张图、做所有 DE、做富集、做轨迹”塞进同一条提示词。问题越具体,结果越容易检查。
9.4 先核对分析单位
看到计划或首轮检查时,先确认:
| 任务 | 应使用的单位 |
|---|---|
| UMAP 展示 | 细胞 |
| 细胞数和比例汇总 | sample 或 donor |
| 组成统计检验 | donor |
| pseudobulk 表达比较 | sample 聚合,donor 作为生物学重复 |
单位不对时,先停下来修正,不要等图全部画完。
9.5 打开结果文件
不要只看聊天里的缩略图。至少打开:
- 主图的 PNG 或 SVG;
- 图对应的 CSV;
- 样本数和覆盖度表;
- DE 或组成结果表;
- 报告中的限制说明。
如果图片、数据表和文字使用的分组或样本数不一致,不能直接采用结果。
9.6 记录结论边界
在项目笔记中记录:
- 输入文件和注释列;
- 使用的 sample / donor / condition 字段;
- 比较方向和参考组;
- 每组独立样本数;
- 主要图表和结果文件;
- 结果是描述性、探索性还是样本级推断;
- 混杂、离群样本和仍需人工确认的问题。
不要只记录“画图完成”或“DE 完成”。




