跳到正文
bioinfo.zle.ee
返回

复现 Biase et al. 早期小鼠胚胎单细胞数据:从 GSE57249 到胚胎内转录差异

发布于: · 更新于:

这组早期胚胎数据提出了一个容易被写过头的问题:2-cell 和 4-cell blastomere 之间能否观察到 fate-related marker 变化。本文从公开 FPKM 矩阵出发,整理 zygote、2-cell、4-cell、ICM 和 TE 样本的阶段结构、marker 程序与胚胎内转录差异,并把表达线索和谱系证据分开。

科学修订说明(2026-07-19): 本文不再把当前结果称为 fate inclination 的复现证据。对于仅含两个 blastomere 的胚胎,两个细胞到胚胎均值的距离在数学上必然对称;dominant marker signal 也只是探索性 marker 程序显示。现有图表支持阶段结构、fate-related marker 变化和胚胎内转录差异,不能据此判定谱系方向或最终命运。

为什么选这篇文献?

早期发育数据最容易被过度解读。UMAP 上的分离并不等于命运已经不可逆,marker score 的差异也不等于谱系追踪证据。有用的复现,是把阶段结构、已知谱系 marker、同一胚胎内 blastomere 差异和 processed matrix 的边界放在一起读,帮助判断哪些信号可以作为发育倾向线索,哪些只能作为后续实验或 raw-level 重分析的入口。

这篇复现重点回答三个问题:公开 FPKM 矩阵能否恢复 zygote 到 4-cell/ICM/TE 的主要阶段结构;pluripotency、primitive endoderm 和 trophectoderm 相关 marker 是否呈现可读趋势;同一胚胎内 blastomere 的表达差异能否作为后续成对检验的入口。

这类复现文章的目标放在写成普通教程;让读者看到:公开单细胞数据重新整理后,能不能产生可审查、可复用、可继续深入的科研证据。每一张图都应回答一个具体问题,而不等于连续堆图。

论文和数据来源

论文、数据和公开矩阵信息如下。这里先把来源和矩阵层级交代清楚。

项目内容
论文Biase et al. Cell fate inclination within 2-cell and 4-cell mouse embryos revealed by single-cell RNA sequencing
发表信息Genome Research, 2014
PubMed25096407
公开数据GSE57249
公开矩阵GEO processed FPKM matrix

公开矩阵进入分析前,先确认数据层级和规模。

项目数值
公开数据GSE57249
细胞或样本56
基因25,737
矩阵层级GEO processed FPKM matrix
结果图9 张

复现边界: 本次分析使用 GEO 提供的 GSE57249_fpkm.txt.gz,并用 series matrix 对齐样本标题、sample description、developmental stage 和平台信息。由于输入是 FPKM 而不等于 raw counts/UMI,本次没有套用 10x UMI 的线粒体比例或 UMI 总数 QC;围绕 detected genes、total FPKM、log1p(FPKM)、高变基因、PCA/UMAP、marker signature 和 embryo-level blastomere variability 做复现。 因此本文的结论限定在公开矩阵和可用 metadata 层面,不把表达线索写成未经验证的机制或临床结论。

方法和分析流程

本文的处理顺序从数据层级开始:下载 GEO 公开矩阵和 series matrix,确认矩阵方向、样本名和 metadata 对齐方式;根据矩阵层级选择处理方式:FPKM/logCPM/read-count 分别采用不同的归一化和 QC 口径;构建低维图、marker panel、signature score、composition/crosswalk 等结果图,避免只依赖单一 UMAP;逐图解释每张图能支持什么、不能支持什么,并和源论文主线做边界对照。这组处理先确认公开矩阵能支撑哪些问题,再把结果图解释限制在当前证据内。

数据结构:先确认矩阵和 metadata

复现文章需要先交代数据结构。下面这张图不是装饰图;关键是判断这个公开矩阵是否适合继续分析的入口。 数据集概览:样本按 zygote、2-cell blastomere、4-cell blastomere、ICM 和 TE 分布,同时检查 detected genes、total

数据集概览:样本按 zygote、2-cell blastomere、4-cell blastomere、ICM 和 TE 分布,同时检查 detected genes、total FPKM 和 GEO platform。这个图先回答数据是否能被整理成可分析的阶段矩阵。

组成图必须和采样设计一起读。它能说明当前公开矩阵里哪些群体被观察到、样本或组织标签是否均衡,但不能直接外推成真实组织比例或临床差异。

读这部分先看数据入口是否可靠。细胞数、基因检测、样本标签和矩阵层级决定了后面所有图能解释到哪里;如果这些信息没有对齐,后续降维、marker 和组成图都只能算视觉结果,不能作为复现证据。

低维结构:先看主问题是否能被恢复

低维图不能单独证明机制,但它能快速回答公开矩阵是否仍然保留论文关注的主要结构。 UMAP 按发育阶段着色。2-cell 与 zygote、4-cell/ICM/TE 在低维空间中形成清楚差异,说明公开 FPKM 矩阵保留了主要阶段结构。

UMAP 按发育阶段着色。2-cell 与 zygote、4-cell/ICM/TE 在低维空间中形成清楚差异,说明公开 FPKM 矩阵保留了主要阶段结构。

这类图的读法是先看结构是否和 metadata 对得上,再看 marker 是否能解释这些区域。UMAP/PCA 提供入口,结论还要回到基因和样本层面确认。

低维结构只回答表达空间是否可读。颜色或区域分开说明标签、阶段或状态和表达矩阵存在对应关系;它还不能单独证明谱系方向、空间位置、机制强弱或最终命运。 pluripotency、primitive endoderm 和 trophectoderm marker program 在 UMAP 上的分布。这里看的是连续 score,而

pluripotency、primitive endoderm 和 trophectoderm marker program 在 UMAP 上的分布。这里看的是连续 score,而不能把每个细胞硬指定为最终谱系。

marker 和 score 要成组解释。单个基因高表达只能提供线索;只有 dotplot、heatmap、signature、metadata 和组成结果互相支持,才适合写成细胞身份或状态判断。

低维结构只回答表达空间是否可读。颜色或区域分开说明标签、阶段或状态和表达矩阵存在对应关系;它还不能单独证明谱系方向、空间位置、机制强弱或最终命运。

marker 证据:标签背后必须有表达支撑

复现不能停在作者标签或 cluster 名字上。这里把代表性 marker 和汇总图放在一起,检查解释是否有成组基因支持。 代表性 marker 的 UMAP 表达图。Pou5f1/Sox2/Nanog、Gata6/Gata4/Sox17、Cdx2/Gata3/Krt8/Krt18/Eomes/Id2

代表性 marker 的 UMAP 表达图。Pou5f1/Sox2/Nanog、Gata6/Gata4/Sox17、Cdx2/Gata3/Krt8/Krt18/Eomes/Id2 等 marker 用于检查不同发育方向的表达证据。

这张图把观察落到基因证据上。读的时候要看一组 marker 是否同向,而不是只挑某个显眼基因;如果证据只停留在 score 层面,结论也要保留探索性。

这类图要按成组证据来读。单个基因或局部高表达只能提供线索,只有 marker panel、signature score、metadata 和组成信息互相支持时,才适合写成细胞身份、状态或谱系倾向。 按阶段汇总 marker 的平均表达和检测比例。dotplot 用来补充 UMAP 的局部视觉印象,避免只凭单个点云区域做结论。

按阶段汇总 marker 的平均表达和检测比例。dotplot 用来补充 UMAP 的局部视觉印象,避免只凭单个点云区域做结论。

marker 和 score 要成组解释。单个基因高表达只能提供线索;只有 dotplot、heatmap、signature、metadata 和组成结果互相支持,才适合写成细胞身份或状态判断。

这类图要按成组证据来读。单个基因或局部高表达只能提供线索,只有 marker panel、signature score、metadata 和组成信息互相支持时,才适合写成细胞身份、状态或谱系倾向。 不同阶段的 marker program score 分布。它把单细胞层面的表达趋势转换成阶段层面的比较,适合解释阶段推进中的相对倾向。

不同阶段的 marker program score 分布。它把单细胞层面的表达趋势转换成阶段层面的比较,适合解释阶段推进中的相对倾向。

这张图把观察落到基因证据上。读的时候要看一组 marker 是否同向,而不是只挑某个显眼基因;如果证据只停留在 score 层面,结论也要保留探索性。

这类图要按成组证据来读。单个基因或局部高表达只能提供线索,只有 marker panel、signature score、metadata 和组成信息互相支持时,才适合写成细胞身份、状态或谱系倾向。

组成、差异和 crosswalk:把图读到项目层面

当主结构和 marker 已经确认后,才适合讨论组成、分层、同胚胎/同 protocol/同 tissue 的差异,以及无监督结构与作者注释的对应关系。 同一胚胎内 blastomere 到胚胎中心表达谱的距离。这个图用来观察 2-cell/4-cell blastomere 内部差异,但不能替代谱系追踪。

同一胚胎内 blastomere 到胚胎均值表达谱的距离。2-cell 胚胎中两枚 blastomere 的距离必然对称,因此该图只显示胚胎内转录差异的量级;它不提供方向性,也不构成谱系证据。4-cell 结果同样需要胚胎配对统计和独立 lineage evidence 才能解释。

组成图必须和采样设计一起读。它能说明当前公开矩阵里哪些群体被观察到、样本或组织标签是否均衡,但不能直接外推成真实组织比例或临床差异。

组成和交叉表需要回到采样、分选和处理流程里解释。它能说明当前公开矩阵中哪些群体被观察到、哪些标签互相吻合,但不能直接外推成组织真实比例、临床差异或完整空间生态。 阶段平均 marker expression heatmap。它提供了比单基因散点更稳定的阶段-基因对照。

阶段平均 marker expression heatmap。它提供了比单基因散点更稳定的阶段-基因对照。

这张图回答的是来源和比例问题。它适合用来发现样本不平衡、分组偏移或需要子集分析的地方;更强的生物学解释还要结合原文设计和额外证据。

组成和交叉表需要回到采样、分选和处理流程里解释。它能说明当前公开矩阵中哪些群体被观察到、哪些标签互相吻合,但不能直接外推成组织真实比例、临床差异或完整空间生态。 PCA 按阶段和 dominant marker signal 展示。PCA 与 UMAP 共同说明阶段结构不是单一可视化方法造成。

PCA 按阶段和探索性 dominant marker program 展示。该字段来自预设 marker program 的相对得分,只用于显示表达倾向;公开阶段标签和 PCA 结构承担主要证据。

组成图必须和采样设计一起读。它能说明当前公开矩阵里哪些群体被观察到、样本或组织标签是否均衡,但不能直接外推成真实组织比例或临床差异。

组成和交叉表需要回到采样、分选和处理流程里解释。它能说明当前公开矩阵中哪些群体被观察到、哪些标签互相吻合,但不能直接外推成组织真实比例、临床差异或完整空间生态。

与源论文主线的对照

与源论文主线一致的是,公开矩阵能重新观察到早期阶段之间的表达结构,也能看到 ICM/TE 方向 marker 与早期 blastomere marker program 的差异。不同之处在于,本文没有从 RAW tar 或 SRA 重新比对 reads,也没有复刻原文全部统计模型和 sister blastomere 成对检验;本文定位是公开 FPKM 层面的复现和可解释结果图整理。

这里需要把“复现到一致”与“完全复刻原文”分开。公开矩阵能支持主要结构、marker 和部分组成解释,但原文中涉及 raw reads、复杂模型、空间信息、临床变量或功能验证的部分,不能被一篇矩阵复现文章替代。

深度解读:这篇复现应该怎么读?

这篇复现回答的是:公开处理矩阵里能否读出早期发育阶段、fate-related marker 变化和胚胎内转录差异。它不能回答“某个 blastomere 最终一定走向哪个谱系”,因为缺少 lineage tracing、后续发育结局和 raw-level 误差模型。更精确的深入方向包括:回到 SRA/RAW 重新量化表达、按 embryo pair 做成对统计、把 marker trend 与原文 sister blastomere 差异表对齐,并结合更多早期胚胎参考图谱做投影。

如果继续深入,优先级应该由数据类型决定:发育数据优先补时间轴和连续性证据,神经 taxonomy 优先补分层注释和 protocol 分层,肿瘤数据优先补患者层面、CNV/恶性识别和空间/病理对照。复现不只停在“做出图”,还要把下一步应该补什么讲清楚。

不能过度解释的地方

对类似项目有什么启发?

这类项目的吸引点在于,很多旧发育数据不等于不能再用;需要把阶段、marker、同胚胎配对关系和复现边界重新整理清楚。对有早期发育、类器官分化或时间序列单细胞数据的课题,类似流程可以帮助判断状态变化是离散分群,还是连续倾向、批次结构或采样设计共同造成的图形结果。

如果手里有类似公开单细胞数据、旧 Seurat/h5ad 对象、论文结果图想重新复现,最关键的不等于机械重跑流程;应先问清楚:这个数据能解决什么痛点,哪些图能证明,哪些地方必须停在边界内。

小结

本次复现从 GSE57249 的公开矩阵和 metadata 出发,生成 9 张主要结果图,覆盖数据结构、低维图谱、marker/signature、组成或 crosswalk、源论文对照和复现边界。文章的重点放在把结果写满;关键在于把证据链写清楚:哪些结论被当前矩阵支持,哪些只是值得继续深入的线索,哪些不能在公开数据层面过度解释。


分享这篇文章:
通过邮件分享

上一篇
复现 Gokce et al. 小鼠纹状体单细胞分类:从 GSE82187 到神经元、胶质和采样协议边界
下一篇
Haber 小肠上皮单细胞深度复现:从 GSE92332 到 Stem、TA、enterocyte 和分泌谱系