这组早期胚胎数据提出了一个容易被写过头的问题:2-cell 和 4-cell blastomere 之间能否观察到 fate-related marker 变化。本文从公开 FPKM 矩阵出发,整理 zygote、2-cell、4-cell、ICM 和 TE 样本的阶段结构、marker 程序与胚胎内转录差异,并把表达线索和谱系证据分开。
科学修订说明(2026-07-19): 本文不再把当前结果称为 fate inclination 的复现证据。对于仅含两个 blastomere 的胚胎,两个细胞到胚胎均值的距离在数学上必然对称;
dominant marker signal也只是探索性 marker 程序显示。现有图表支持阶段结构、fate-related marker 变化和胚胎内转录差异,不能据此判定谱系方向或最终命运。
为什么选这篇文献?
早期发育数据最容易被过度解读。UMAP 上的分离并不等于命运已经不可逆,marker score 的差异也不等于谱系追踪证据。有用的复现,是把阶段结构、已知谱系 marker、同一胚胎内 blastomere 差异和 processed matrix 的边界放在一起读,帮助判断哪些信号可以作为发育倾向线索,哪些只能作为后续实验或 raw-level 重分析的入口。
这篇复现重点回答三个问题:公开 FPKM 矩阵能否恢复 zygote 到 4-cell/ICM/TE 的主要阶段结构;pluripotency、primitive endoderm 和 trophectoderm 相关 marker 是否呈现可读趋势;同一胚胎内 blastomere 的表达差异能否作为后续成对检验的入口。
这类复现文章的目标放在写成普通教程;让读者看到:公开单细胞数据重新整理后,能不能产生可审查、可复用、可继续深入的科研证据。每一张图都应回答一个具体问题,而不等于连续堆图。
论文和数据来源
论文、数据和公开矩阵信息如下。这里先把来源和矩阵层级交代清楚。
| 项目 | 内容 |
|---|---|
| 论文 | Biase et al. Cell fate inclination within 2-cell and 4-cell mouse embryos revealed by single-cell RNA sequencing |
| 发表信息 | Genome Research, 2014 |
| PubMed | 25096407 |
| 公开数据 | GSE57249 |
| 公开矩阵 | GEO processed FPKM matrix |
公开矩阵进入分析前,先确认数据层级和规模。
| 项目 | 数值 |
|---|---|
| 公开数据 | GSE57249 |
| 细胞或样本 | 56 |
| 基因 | 25,737 |
| 矩阵层级 | GEO processed FPKM matrix |
| 结果图 | 9 张 |
复现边界: 本次分析使用 GEO 提供的
GSE57249_fpkm.txt.gz,并用 series matrix 对齐样本标题、sample description、developmental stage 和平台信息。由于输入是 FPKM 而不等于 raw counts/UMI,本次没有套用 10x UMI 的线粒体比例或 UMI 总数 QC;围绕 detected genes、total FPKM、log1p(FPKM)、高变基因、PCA/UMAP、marker signature 和 embryo-level blastomere variability 做复现。 因此本文的结论限定在公开矩阵和可用 metadata 层面,不把表达线索写成未经验证的机制或临床结论。
方法和分析流程
本文的处理顺序从数据层级开始:下载 GEO 公开矩阵和 series matrix,确认矩阵方向、样本名和 metadata 对齐方式;根据矩阵层级选择处理方式:FPKM/logCPM/read-count 分别采用不同的归一化和 QC 口径;构建低维图、marker panel、signature score、composition/crosswalk 等结果图,避免只依赖单一 UMAP;逐图解释每张图能支持什么、不能支持什么,并和源论文主线做边界对照。这组处理先确认公开矩阵能支撑哪些问题,再把结果图解释限制在当前证据内。
数据结构:先确认矩阵和 metadata
复现文章需要先交代数据结构。下面这张图不是装饰图;关键是判断这个公开矩阵是否适合继续分析的入口。

数据集概览:样本按 zygote、2-cell blastomere、4-cell blastomere、ICM 和 TE 分布,同时检查 detected genes、total FPKM 和 GEO platform。这个图先回答数据是否能被整理成可分析的阶段矩阵。
组成图必须和采样设计一起读。它能说明当前公开矩阵里哪些群体被观察到、样本或组织标签是否均衡,但不能直接外推成真实组织比例或临床差异。
读这部分先看数据入口是否可靠。细胞数、基因检测、样本标签和矩阵层级决定了后面所有图能解释到哪里;如果这些信息没有对齐,后续降维、marker 和组成图都只能算视觉结果,不能作为复现证据。
低维结构:先看主问题是否能被恢复
低维图不能单独证明机制,但它能快速回答公开矩阵是否仍然保留论文关注的主要结构。

UMAP 按发育阶段着色。2-cell 与 zygote、4-cell/ICM/TE 在低维空间中形成清楚差异,说明公开 FPKM 矩阵保留了主要阶段结构。
这类图的读法是先看结构是否和 metadata 对得上,再看 marker 是否能解释这些区域。UMAP/PCA 提供入口,结论还要回到基因和样本层面确认。
低维结构只回答表达空间是否可读。颜色或区域分开说明标签、阶段或状态和表达矩阵存在对应关系;它还不能单独证明谱系方向、空间位置、机制强弱或最终命运。

pluripotency、primitive endoderm 和 trophectoderm marker program 在 UMAP 上的分布。这里看的是连续 score,而不能把每个细胞硬指定为最终谱系。
marker 和 score 要成组解释。单个基因高表达只能提供线索;只有 dotplot、heatmap、signature、metadata 和组成结果互相支持,才适合写成细胞身份或状态判断。
低维结构只回答表达空间是否可读。颜色或区域分开说明标签、阶段或状态和表达矩阵存在对应关系;它还不能单独证明谱系方向、空间位置、机制强弱或最终命运。
marker 证据:标签背后必须有表达支撑
复现不能停在作者标签或 cluster 名字上。这里把代表性 marker 和汇总图放在一起,检查解释是否有成组基因支持。

代表性 marker 的 UMAP 表达图。Pou5f1/Sox2/Nanog、Gata6/Gata4/Sox17、Cdx2/Gata3/Krt8/Krt18/Eomes/Id2 等 marker 用于检查不同发育方向的表达证据。
这张图把观察落到基因证据上。读的时候要看一组 marker 是否同向,而不是只挑某个显眼基因;如果证据只停留在 score 层面,结论也要保留探索性。
这类图要按成组证据来读。单个基因或局部高表达只能提供线索,只有 marker panel、signature score、metadata 和组成信息互相支持时,才适合写成细胞身份、状态或谱系倾向。

按阶段汇总 marker 的平均表达和检测比例。dotplot 用来补充 UMAP 的局部视觉印象,避免只凭单个点云区域做结论。
marker 和 score 要成组解释。单个基因高表达只能提供线索;只有 dotplot、heatmap、signature、metadata 和组成结果互相支持,才适合写成细胞身份或状态判断。
这类图要按成组证据来读。单个基因或局部高表达只能提供线索,只有 marker panel、signature score、metadata 和组成信息互相支持时,才适合写成细胞身份、状态或谱系倾向。

不同阶段的 marker program score 分布。它把单细胞层面的表达趋势转换成阶段层面的比较,适合解释阶段推进中的相对倾向。
这张图把观察落到基因证据上。读的时候要看一组 marker 是否同向,而不是只挑某个显眼基因;如果证据只停留在 score 层面,结论也要保留探索性。
这类图要按成组证据来读。单个基因或局部高表达只能提供线索,只有 marker panel、signature score、metadata 和组成信息互相支持时,才适合写成细胞身份、状态或谱系倾向。
组成、差异和 crosswalk:把图读到项目层面
当主结构和 marker 已经确认后,才适合讨论组成、分层、同胚胎/同 protocol/同 tissue 的差异,以及无监督结构与作者注释的对应关系。

同一胚胎内 blastomere 到胚胎均值表达谱的距离。2-cell 胚胎中两枚 blastomere 的距离必然对称,因此该图只显示胚胎内转录差异的量级;它不提供方向性,也不构成谱系证据。4-cell 结果同样需要胚胎配对统计和独立 lineage evidence 才能解释。
组成图必须和采样设计一起读。它能说明当前公开矩阵里哪些群体被观察到、样本或组织标签是否均衡,但不能直接外推成真实组织比例或临床差异。
组成和交叉表需要回到采样、分选和处理流程里解释。它能说明当前公开矩阵中哪些群体被观察到、哪些标签互相吻合,但不能直接外推成组织真实比例、临床差异或完整空间生态。

阶段平均 marker expression heatmap。它提供了比单基因散点更稳定的阶段-基因对照。
这张图回答的是来源和比例问题。它适合用来发现样本不平衡、分组偏移或需要子集分析的地方;更强的生物学解释还要结合原文设计和额外证据。
组成和交叉表需要回到采样、分选和处理流程里解释。它能说明当前公开矩阵中哪些群体被观察到、哪些标签互相吻合,但不能直接外推成组织真实比例、临床差异或完整空间生态。

PCA 按阶段和探索性 dominant marker program 展示。该字段来自预设 marker program 的相对得分,只用于显示表达倾向;公开阶段标签和 PCA 结构承担主要证据。
组成图必须和采样设计一起读。它能说明当前公开矩阵里哪些群体被观察到、样本或组织标签是否均衡,但不能直接外推成真实组织比例或临床差异。
组成和交叉表需要回到采样、分选和处理流程里解释。它能说明当前公开矩阵中哪些群体被观察到、哪些标签互相吻合,但不能直接外推成组织真实比例、临床差异或完整空间生态。
与源论文主线的对照
与源论文主线一致的是,公开矩阵能重新观察到早期阶段之间的表达结构,也能看到 ICM/TE 方向 marker 与早期 blastomere marker program 的差异。不同之处在于,本文没有从 RAW tar 或 SRA 重新比对 reads,也没有复刻原文全部统计模型和 sister blastomere 成对检验;本文定位是公开 FPKM 层面的复现和可解释结果图整理。
这里需要把“复现到一致”与“完全复刻原文”分开。公开矩阵能支持主要结构、marker 和部分组成解释,但原文中涉及 raw reads、复杂模型、空间信息、临床变量或功能验证的部分,不能被一篇矩阵复现文章替代。
深度解读:这篇复现应该怎么读?
这篇复现回答的是:公开处理矩阵里能否读出早期发育阶段、fate-related marker 变化和胚胎内转录差异。它不能回答“某个 blastomere 最终一定走向哪个谱系”,因为缺少 lineage tracing、后续发育结局和 raw-level 误差模型。更精确的深入方向包括:回到 SRA/RAW 重新量化表达、按 embryo pair 做成对统计、把 marker trend 与原文 sister blastomere 差异表对齐,并结合更多早期胚胎参考图谱做投影。
如果继续深入,优先级应该由数据类型决定:发育数据优先补时间轴和连续性证据,神经 taxonomy 优先补分层注释和 protocol 分层,肿瘤数据优先补患者层面、CNV/恶性识别和空间/病理对照。复现不只停在“做出图”,还要把下一步应该补什么讲清楚。
不能过度解释的地方
- 低维距离:UMAP/PCA/t-SNE 的距离只能作为结构提示,不能直接等同于谱系距离、空间距离或机制强弱。
- marker 解释:单个 marker 不足以下结论,必须结合 marker panel、signature score、metadata 和组成图。
- 项目外推:公开数据中的线索可以指导后续分析,但不能替代实验验证、临床结局或私有项目的重新质控。
对类似项目有什么启发?
这类项目的吸引点在于,很多旧发育数据不等于不能再用;需要把阶段、marker、同胚胎配对关系和复现边界重新整理清楚。对有早期发育、类器官分化或时间序列单细胞数据的课题,类似流程可以帮助判断状态变化是离散分群,还是连续倾向、批次结构或采样设计共同造成的图形结果。
如果手里有类似公开单细胞数据、旧 Seurat/h5ad 对象、论文结果图想重新复现,最关键的不等于机械重跑流程;应先问清楚:这个数据能解决什么痛点,哪些图能证明,哪些地方必须停在边界内。
小结
本次复现从 GSE57249 的公开矩阵和 metadata 出发,生成 9 张主要结果图,覆盖数据结构、低维图谱、marker/signature、组成或 crosswalk、源论文对照和复现边界。文章的重点放在把结果写满;关键在于把证据链写清楚:哪些结论被当前矩阵支持,哪些只是值得继续深入的线索,哪些不能在公开数据层面过度解释。