Moignard 等人在 2015 年研究小鼠胚胎早期造血调控网络,使用单细胞 qRT-PCR 测量一组预先选择的转录因子和谱系相关基因。Scanpy 的 moignard15 对象来自论文补充表,X 存放 normalized dCt。它不是 RNA 测序矩阵,也没有 UMI count、转录本总量或全转录组覆盖。
科学更正(2026-07-19) 早期页面曾把该对象笼统写成 targeted expression panel,沿用了 RNA 测序中的“检测基因数”“total expression”和
>0判定,还把最高 program score 转成离散状态。相关离散状态和组成比例已撤回。源文件显示 normalized dCt 的未检出下限为-14。本文现从补充 Excel 读取 3,934 个细胞和 42 个分析基因,以>-14统计 panel 内被检测靶标,以相对下限的累计信号描述 panel 可读性;程序分数采用基因标准化后的连续均值,不生成离散状态。
这份数据先看测量技术
单细胞 qRT-PCR 和转录组测序回答问题的方式不同。这里的 42 个基因由研究设计预先选定,数据能精细观察这些基因之间的组合,却看不到 panel 之外的代谢、信号通路、受体和细胞周期基因。任何分析都必须限定在被测靶标内。
补充表的 dCt_values.txt 工作表含 46 个基因列。Scanpy 按原实现移除 Eif2b1/Mrpl19/Polr2a/Ubc 四个 housekeeping genes,留下 42 个基因。矩阵中 -14 是未检出下限,其他值为 normalized dCt。本文不把负值当成异常,也不以零作为检测阈值。
论文和数据来源
- 论文:Moignard et al., Nature Biotechnology, 2015
- 题名:Decoding the regulatory network of early blood development from single-cell gene expression measurements
- DOI:10.1038/nbt.3154
- PubMed:PMID 25664528
- 公开输入:论文 Supplementary Table 7,Scanpy
moignard15所用 Excel - 测量技术:single-cell qRT-PCR
- 矩阵层级:normalized dCt
本文没有全转录组矩阵,不能做 transcriptome-wide differential expression、通路富集或完整 marker discovery。原文的网络推断、状态转换模型和实验验证也没有在本文中重建。
数据规模和作者实验组
分析对象包括 3,934 个细胞和 42 个基因。作者 exp_groups 来自分选阶段和 GFP 状态:
PS:primitive streak,624 个细胞;NP:neural plate,552 个细胞;HF:head fold,1,005 个细胞;4SG:four-somite blood/GFP-positive,983 个细胞;4SFG:four-somite endothelial/GFP-negative,770 个细胞。
公开对象没有 embryo、litter、独立实验批次或生物学重复 ID。实验组是发育和分选分层,不等于五个独立重复。后面的组间图只描述当前细胞集合。
dCt 数据怎样做可读性检查
使用 X>0 统计“检测基因数”,会把许多高于未检出下限、但 normalized dCt 仍为负的有效信号误判为未表达。本文使用两个与数据定义一致的指标:
n_targets_above_floor:每个细胞中 normalized dCt 高于-14的靶标数;panel_signal_above_floor:对每个靶标计算dCt-(-14),负值截为零后求和。
第二个指标只用于描述 panel 相对未检出下限的总信号。它不是 RNA 分子总量,也不能与 UMI library size 对应。

图 1. 作者实验组、panel 内高于 -14 下限的靶标数、Leiden 结构和相对下限的累计 panel signal。
图 1 检查每个细胞在有限 panel 中保留多少可读信号。若某些细胞大部分靶标都停在 -14,低维结构可能受测量下限影响;靶标覆盖较充分时,程序组合才有解释空间。这个 QC 只针对当前 qRT-PCR panel,不能替代测序深度或 reads 质量评估。
分析策略:先标准化基因,再计算连续程序
normalized dCt 的不同基因有各自分布范围。脚本在 PCA 和程序评分前按基因做中心化和标准化,使高方差基因不会仅凭量纲支配结果。UMAP 和 Leiden 由 42 个基因的标准化矩阵得到,原始 normalized dCt 保存在对象的 X 和 normalized_dct layer 中。
程序集合依据 panel 实际存在的基因重新定义:
- early hematoendothelial:
Etv2/Fli1/Tal1/Lmo2/Kdr; - endothelial:
Cdh5/Kdr/Pecam1/Egfl7/Sox7/Sox17; - hematopoietic emergence:
Runx1/Gfi1/Itga2b/Ikaros/Myb/Sfpi1; - erythroid:
Gata1/Gfi1b/Nfe2/HbbbH1; - stem/progenitor:
Tal1/Lmo2/Meis1/Kit/Procr/Hhex。
每个分数是对应基因 z-score 的均值。基因集合之间允许重叠,因为它们描述相互关联的发育程序。本文不要求每个细胞只能归入一个程序。
作者实验组与无监督结构

图 2. 作者 exp_groups 和 Leiden 在同一 UMAP 上的分布。实验组来自外部 metadata,Leiden 来自 42 基因标准化矩阵。
作者实验组在低维空间中呈现结构差异,说明预选 panel 保留了与发育阶段和分选设计相关的表达信息。UMAP 的分离程度不等于发育时间、转化概率或命运分支。只有 42 个靶标时,未被测量的中间状态和调控通路不会出现在图中。
Leiden 提供数据驱动的局部结构,不能自动命名为 endothelial、hematopoietic 或 erythroid 状态。本文把 Leiden、作者实验组和连续程序并列展示,避免最高分规则替代原始设计。
单基因信号如何分布

图 3. Cdh5/Kdr/Pecam1、Runx1/Gfi1/Itga2b、Gata1/Gfi1b/Sfpi1、Tal1/Lmo2/Sox17 等 panel 基因在 UMAP 上的 normalized dCt 分布。
单基因图用于定位表达方向和测量下限。Cdh5/Kdr/Pecam1 提供内皮相关信息,Runx1/Gfi1/Itga2b 连接造血出现,Gata1/Gfi1b/Nfe2/HbbbH1 反映红系方向。一个基因的局部高值仍可能来自测量波动或有限 panel 的投影,解释时需要看同一程序中的其他基因是否同向。
连续程序比离散标签更合适

图 4. 五类预设发育程序的连续分数。颜色表示相对程序强度,不提供细胞命运分类。
Early hematoendothelial、endothelial、hematopoietic emergence、erythroid 和 stem/progenitor 程序可以在同一细胞中共存。早期造血发育本来就涉及调控因子组合变化,互斥硬标签会丢掉这种连续性。早期页面曾将最高分仍不为正的 31.85% 细胞强制分配状态,该离散结果已撤回,也说明这套规则不适合当前对象。
连续分数也有边界。它们来自预先选择的有限基因,不能衡量 panel 外通路,也不等同于真实发育时间。分数高低只在当前数据、当前基因标准化方式和当前程序定义下比较。
DotPlot 展示的是同一 panel,不是独立验证

图 5. Panel 基因按作者实验组汇总。颜色表示平均 normalized dCt,点大小表示高于 -14 下限的细胞比例。
图 5 与程序分数使用同一批有限基因,因此它能拆开分数内部的基因贡献,却不能充当独立验证。作者实验组来自外部设计,可用于检查信号是否与分选阶段相容。若要验证命运关系,需要额外基因、独立测量、扰动实验或 lineage tracing。
图中的检测比例也已改用 >-14。使用 >0 会系统性低估 normalized dCt 为负但已高于未检出下限的信号,尤其会扭曲不同基因和实验组之间的比较。
实验组程序中位数

图 6. 五个作者实验组的连续 program 中位数。图中没有离散状态比例。
实验组中位数可概括当前细胞集合的表达方向。例如,某组 endothelial program 较高,只能说明该组被测 panel 中的内皮相关组合更强。由于没有独立 embryo 或实验批次 ID,不能从细胞中位数估计群体层效应,也不能报告组间显著性。
细胞层分布保留组内异质性

图 7. 每个实验组内五类 program 的细胞层分布。
中位数会压缩组内差异,图 7 补回单细胞分布。若同一实验组出现宽分布或多个峰,说明有限 panel 中仍有明显异质性。这个现象可以成为后续建模入口,但不能凭箱线图宣布新的亚群或发育分支。
与源论文的关系
源论文结合单细胞 qRT-PCR、计算模型和实验验证研究早期血液发育调控网络。本文只复查补充表中的 normalized dCt 表达层:作者实验组是否可读,预设基因组合是否形成连续方向,哪些解释受 42 基因 panel 和重复信息限制。
调控网络需要基因间关系、状态转换模型和额外证据。当前 UMAP、Leiden 和程序分数不能重建原文全部网络,也不能替代 lineage tracing。文章保留的结论是“panel 内可见哪些预设发育程序”,不扩展为完整命运树。
这类数据容易犯的错误
第一类错误是把 normalized dCt 当成 count。dCt 可以为负,-14 才是该表的未检出下限。以零做阈值、对 dCt 求传统 library size 或套用 UMI QC,都会改变数据含义。
第二类错误是把 42 基因 panel 写成全转录组图谱。未进入 panel 的基因和通路没有被测量,不能从“图上没看到”推断它们不存在。
第三类错误是把最高程序分数转成命运标签。多个程序共享调控因子,早期发育状态也会重叠。连续分数更能保留这部分信息。
第四类错误是忽略重复。细胞数达到 3,934,并不代表每个实验组有大量独立胚胎。缺少 embryo 和批次 ID 时,组间图只能描述当前细胞集合。
若要继续深入
后续分析需要先找回每个细胞对应的胚胎、实验批次和分选重复。重复结构明确后,才适合在样本层比较 program,评估不同阶段的稳定变化。
如果目标是调控网络,应回到原文模型所需的基因关系和先验约束,并使用扰动或独立数据验证关键边。若目标是连接现代图谱,可将这 42 个基因作为小型 reference panel,与全转录组胚胎数据做交叉映射;映射结果仍需报告覆盖率和不确定性。
结论边界
Moignard15 是 3,934 个细胞、42 个分析基因的单细胞 qRT-PCR normalized dCt 数据。本文以 -14 为未检出下限,计算 panel 可读性、UMAP、Leiden 和五类连续发育程序;离散状态和组成比例已撤回。
当前结果支持 panel 内的 early hematoendothelial、endothelial、hematopoietic emergence、erythroid 和 stem/progenitor 表达方向。全转录组通路、总体阶段效应、严格轨迹、调控网络和命运关系需要更完整的数据与独立证据。