这篇长文复现围绕 Habermann et al. 公开肺纤维化单细胞数据展开。目标不只重画一张 UMAP;本文从 GSE135893 的公开矩阵和注释表出发,把 11.4 万个已注释肺组织单细胞整理成一个可解释的疾病图谱:哪些细胞大类构成 IPF 肺组织,哪些上皮状态值得重点看,纤维化相关 mesenchymal 信号如何呈现,以及这类复现和源论文主线之间有什么一致点和边界。
为什么选 Habermann 肺纤维化数据?
肺纤维化,尤其是 idiopathic pulmonary fibrosis(IPF),是单细胞领域非常适合做公开数据复现的疾病场景。原因有三点。第一,肺组织结构复杂,包含上皮、免疫、内皮和间质细胞,单细胞数据比 bulk RNA-seq 更适合拆解细胞来源。第二,IPF 不是单个 marker 的问题;上皮损伤、异常修复、巨噬细胞状态、成纤维细胞和细胞外基质重塑共同构成的微环境变化。第三,Habermann et al. 这篇文章提供了公开矩阵和逐细胞注释,是做可复查复现的好材料。
这类数据如果只是拿来画 UMAP,价值会被严重压缩。更合适的复现方式应该回答这些问题:
- 公开数据中到底有多少已注释细胞、多少样本、哪些诊断分组?
- Control、IPF 和其他 ILD 分组在 epithelial、immune、endothelial、mesenchymal 大类上的构成是否不同?
- IPF 中常被讨论的 AT2、Transitional AT2、KRT5-/KRT17+、MUC5B+、myofibroblast 等状态能否在公开注释中重新观察到?
- marker 和 signature 是否支持“上皮损伤 + 间质 ECM 重塑 + 巨噬细胞活化”的解释框架?
- 本次复现与源论文之间是结果对照,还是完整复刻?
把这些问题讲清楚,才是一篇适合公开展示的单细胞复现文章。
这篇数据对应的真实研究痛点
很多疾病组织单细胞项目的难点不是“能不能跑出聚类图”;跑完之后不知道怎样把图变成可信的生物学解释。以 IPF 这类慢性纤维化疾病为例,研究者关心的往往是:上皮损伤到底体现在哪些状态上,间质细胞是否真的带有 ECM 或 myofibroblast 线索,巨噬细胞和炎症微环境应该读到什么程度,以及细胞比例变化能不能上升到患者层面的结论。
Habermann 这组公开数据正好适合展示这类痛点的解决路径。本文不把 UMAP 当作最终答案;关键在于把公开 metadata、细胞组成、marker、signature score 和样本平衡放在一起看。这样能把一个常见问题拆开:哪些结论是公开矩阵和注释层面已经能支持的,哪些结论还需要 epithelial、mesenchymal 或 macrophage 子集重分析,哪些解释必须等到样本/患者聚合统计甚至空间或实验验证后才能更进一步。
所以,这篇复现的重点不是制造一个更复杂的图;关键在于把“疾病微环境是否可复查”“异常上皮状态是否有 marker 支撑”“纤维化信号来自哪个 compartment”“细胞级结果能否代表患者级差异”这些问题逐个放到证据链里。对于已有公开数据、老项目或准备汇报的疾病组织单细胞结果,这种整理方式比单独增加几张图更有实际价值。
论文和数据来源
Habermann et al. 的文章发表于 Nature Medicine,题目是 Single-cell RNA sequencing reveals profibrotic roles of distinct epithelial and mesenchymal lineages in pulmonary fibrosis。原文从肺纤维化组织中解析上皮和间质细胞谱系,强调异常上皮状态和促纤维化间质谱系在疾病中的作用。
- 论文:Habermann et al. Nature Medicine, 2020
- 论文题名:Single-cell RNA sequencing reveals profibrotic roles of distinct epithelial and mesenchymal lineages in pulmonary fibrosis
- DOI:10.1038/s41591-020-0790-1
- PubMed:PMID 32066963
- 公开数据:NCBI GEO GSE135893
- Files:matrix.mtx、barcodes、genes、IPF metadata
复现边界说明 公开矩阵包含 220,213 个 cell barcode,而逐细胞 metadata 中有 114,396 个已注释细胞。本篇文章以已注释细胞为复现主体;组成比例基于全部 114,396 个注释细胞,表达降维、marker 和 signature 检查使用固定随机种子分层抽取的 60,000 个代表性细胞。本文不声称从 FASTQ 或原始比对流程完整重跑源论文。
数据规模:11.4 万个已注释肺组织单细胞
本次整理得到 114,396 个已注释细胞,覆盖 30 个样本和 43 个测序文库。诊断分组包括 Control、IPF、NSIP、chronic hypersensitivity pneumonitis(cHP)、Sarcoidosis 和 ILD。细胞大类包括 Immune、Epithelial、Endothelial 和 Mesenchymal。
- 已注释细胞:114,396
- 样本:30
- 测序文库:43
- IPF 细胞:57,682
- Control 细胞:31,644
- 表达分析代表性子集:60,000

图 1 数据集概览。左上是不同诊断分组的注释细胞数,右上是四个主要 compartment,左下是高丰度 cell type,右下是 UMI counts 与 detected genes 的关系。这个图主要用于确认数据规模、疾病分组和 QC 分布。
从数据规模看,IPF 是最大疾病组,Control 也有三万多个注释细胞,足够支撑总体图谱复现。NSIP、cHP、Sarcoidosis 和 ILD 细胞数较少,更适合在文章里作为疾病谱背景或对照趋势,而不宜把每个小分组都解释成强结论。
分析流程:先保留注释全貌,再做代表性表达复现
这组数据的公开矩阵很大,且注释表只对应其中一部分高质量细胞。因此本次复现分成两个层次。
- 下载 GEO 公开 matrix、barcodes、genes 和 IPF metadata,确认注释细胞与矩阵 barcode 的交集。
- 用全部 114,396 个已注释细胞统计诊断分组、样本来源、cell population 和 cell type 组成。
- 按 Diagnosis、population 和 celltype 分层抽取 60,000 个代表性细胞,避免少数高丰度群体完全支配降维图。
- 从原始稀疏矩阵中抽取这些细胞对应表达值,构建可复用单细胞对象。
- 执行归一化、高变基因、PCA、邻接图、UMAP 和 Leiden 聚类。
- 使用 canonical marker 检查 epithelial、immune、endothelial 和 mesenchymal 大类是否由表达证据支持。
- 计算 epithelial injury、AT2、AT1、fibrosis ECM、myofibroblast 和 macrophage activation 等 signature score。
- 把图谱、组成比例、marker 和 score 结果合并解释,并与源论文主要结论对照。
这种处理方式的好处是清楚:全量 metadata 用于组成比例,代表性表达子集用于可解释图谱和 marker 检查。对于公开复现文章来说,它比盲目追求全量 UMAP 更稳,也更容易说明结果边界。
UMAP 总览:四个 compartment 的空间结构

图 2 60,000 个代表性细胞的 UMAP。上排按 disease status 和 diagnosis 标记,下排按 major population 和细胞类型标记。Epithelial、immune、endothelial 和 mesenchymal 在表达空间中形成清楚结构,说明公开注释与表达图谱之间整体一致。
这个 UMAP 有几个值得读的点。第一,四个主要 compartment 分得很清楚,说明 epithelial、immune、endothelial、mesenchymal 的一级注释是有表达结构支撑的。第二,disease 和 control 不是完全占据不同 UMAP 区域,这符合疾病组织数据的特点:疾病状态不是把所有细胞变成新细胞;本文在已有细胞谱系中改变比例和状态。第三,IPF 在多个区域都有覆盖,提示它既涉及上皮状态变化,也涉及免疫和间质微环境。
对于复现文章来说,UMAP 不是终点。需要解释的是:这些区域分别是什么细胞,疾病组和对照组的比例如何变化,关键 marker 和 signature 是否支持源论文中的生物学主线。
组成比例:IPF 中 epithelial 和 mesenchymal 比例更突出

图 3 按诊断分组统计 major compartment、top cell type 和 epithelial state 比例。这个图用于区分“细胞比例变化”和“细胞内表达状态变化”。
按 major compartment 看,Control 中 immune 细胞约 61.6%,epithelial 约 26.6%,mesenchymal 约 1.8%。IPF 中 epithelial 约 43.2%,mesenchymal 约 5.2%,immune 约 44.5%。也就是说,在这批已注释细胞中,IPF 组的 epithelial 和 mesenchymal 占比更高,而 immune 占比相对下降。
| Diagnosis | Endothelial | Epithelial | Immune | Mesenchymal |
|---|---|---|---|---|
| Control | 10.0% | 26.6% | 61.6% | 1.8% |
| IPF | 7.1% | 43.2% | 44.5% | 5.2% |
| NSIP | 14.9% | 9.9% | 66.0% | 9.3% |
| cHP | 10.1% | 19.1% | 63.0% | 7.8% |
| Sarcoidosis | 17.8% | 18.4% | 60.3% | 3.6% |
这个结果不能简单解释为“IPF 上皮细胞一定变多”,因为组织取样、细胞捕获、消化效率和注释策略都会影响比例。但它非常适合作为复现主线:IPF 图谱中 epithelial compartment 和 mesenchymal compartment 值得重点拆开看。
上皮状态:AT2、MUC5B+、KRT5-/KRT17+ 与 Transitional AT2
源论文最重要的方向之一是肺纤维化中的上皮细胞状态。正常肺泡结构里,AT1 和 AT2 是关键上皮细胞类型;纤维化和异常修复过程中,AT2、过渡状态、基底样或异常上皮状态常被反复讨论。
本次复现中,Control epithelial 细胞里 AT2 占比约 52.1%,AT1 约 5.6%,Ciliated 约 25.1%。IPF epithelial 中 Ciliated 约 47.6%,AT2 约 13.0%,MUC5B+ 约 7.8%,Basal 约 7.2%,SCGB3A2+ 约 11.3%,Transitional AT2 约 2.3%,KRT5-/KRT17+ 约 1.5%。
| Epithelial state | Control | IPF | 复现解读 |
|---|---|---|---|
| AT2 | 52.1% | 13.0% | IPF 上皮结构中 AT2 比例明显不同,提示肺泡上皮状态被重塑 |
| AT1 | 5.6% | 0.4% | IPF 中成熟 AT1 状态较少,需要结合取样和注释边界谨慎解释 |
| Ciliated | 25.1% | 47.6% | 气道相关上皮在 IPF 注释上皮中比例较高 |
| MUC5B+ | 3.3% | 7.8% | 与 IPF 中黏液相关上皮状态和 MUC5B 线索相符 |
| Basal | 0.8% | 7.2% | 基底样上皮相关状态在 IPF 中更突出 |
| KRT5-/KRT17+ | 0.2% | 1.5% | 与异常修复上皮状态相关,是值得重点关注的疾病相关群体 |
| Transitional AT2 | 5.3% | 2.3% | 需要结合 marker 和亚群分析进一步解释 |
这个表不应该被读成“所有 IPF 患者都有同样比例变化”。它更适合说明:公开注释中已经包含源论文所强调的若干上皮状态,且这些状态足以构成一条可复现的疾病解释线索。
marker 证据:大类注释是否站得住

图 4 经典 marker 在 UMAP 上的表达分布。EPCAM 支持 epithelial,PTPRC 支持 immune,COL1A1 支持 mesenchymal/fibroblast,PECAM1 支持 endothelial,KRT17 和 SFTPC 分别提示异常上皮修复状态与 AT2 相关状态。
单个 marker 不能完成注释,但它能帮助判断一级结构是否合理。EPCAM 点亮 epithelial 区域,PTPRC 点亮 immune 区域,PECAM1 对应 endothelial 区域,COL1A1 对应 mesenchymal/fibroblast 区域。SFTPC 与 AT2 相关,KRT17 则更偏向损伤修复或异常上皮状态。

图 5 按 major population 检查 marker。这个图用于确认四个一级 compartment 的表达证据。
marker 和 score 要成组解释。单个基因高表达只能提供线索;只有 dotplot、heatmap、signature、metadata 和组成结果互相支持,才适合写成细胞身份或状态判断。

图 6 按高丰度细胞类型检查 marker。Macrophages、AT2、Endothelial Cells、Monocytes、T Cells、Myofibroblasts 等群体的 marker 组合提供了更细层级的支持。
这张图把观察落到基因证据上。读的时候要看一组 marker 是否同向,而不是只挑某个显眼基因;如果证据只停留在 score 层面,结论也要保留探索性。
DotPlot 的价值来自同时显示表达强度和表达比例。对于一篇复现文章,marker dotplot 比只贴 UMAP 更重要,因为它告诉读者:注释不是凭图形状猜出来的;它有一组经典基因支持。
signature score:从单基因进入通路和状态层面的解释
为了减少单基因噪音,本次复现计算了几组 signature:
- epithelial injury:
KRT8, KRT17, KRT5, MUC5B, MUC5AC, SERPINB3 - AT2:
SFTPC, SFTPB, SLC34A2, ABCA3, NAPSA - AT1:
AGER, PDPN, CAV1, RTKN2 - fibrosis ECM:
COL1A1, COL1A2, COL3A1, FN1, LUM, DCN, POSTN - myofibroblast:
ACTA2, TAGLN, MYL9, TPM2, COL1A1 - macrophage activation:
MARCO, MRC1, APOE, C1QA, C1QB, SPP1

图 7 按 disease status 和 major population 比较 signature score。AT2 score 主要集中在 epithelial,fibrosis ECM 和 myofibroblast score 主要集中在 mesenchymal,macrophage activation score 主要集中在 immune。
这个结果符合肺纤维化图谱的基本预期:纤维化 ECM 和 myofibroblast 信号不应该主要来自上皮或内皮,而应该集中在 mesenchymal compartment;macrophage activation 更应该出现在 immune compartment;AT2 score 则应该在 epithelial 中更高。也就是说,signature 的 compartment 特异性本身就是一个复现质量检查。

图 8 signature score 在 UMAP 空间中的分布。不同 signature 落在不同 compartment 或 cell state 区域,说明这些分数不是全图随机升高;和细胞身份结构相关。
从 score 均值看,mesenchymal compartment 的 fibrosis ECM score 在 IPF 中约 2.21,在 Control 中约 1.45;myofibroblast score 在 Control mesenchymal 中约 1.72,在 IPF mesenchymal 中约 1.26。这个差异提醒我们:单个 score 的方向不能脱离细胞组成、样本来源和注释细分来解释。更稳妥的说法是,公开图谱中保留了清楚的 ECM 和肌成纤维细胞相关 mesenchymal 信号,但要判断每个疾病组的精确差异,需要进一步做样本层面的统计和 fibroblast 子集分析。
样本平衡:不能只看细胞数

图 9 不同样本的注释细胞数。疾病组织单细胞数据很容易出现样本贡献不均衡,解释比例和 score 时必须保留这个视角。
公共组织数据复现时,一个常见陷阱是把“细胞级别统计”误读成“患者级别统计”。如果某个样本贡献了大量细胞,那么细胞比例图会被这个样本明显影响。图 9 提醒我们:这篇文章的结果适合做公开图谱复现和生物学线索解释,但如果要得出严格的患者层面差异,还需要按样本或患者聚合后做统计。
这也是单细胞复现最容易被忽略的地方。复现不是把 cell barcode 放进软件就结束;需要持续区分 cell-level、sample-level 和 patient-level 的证据层级。
和源论文结论如何对照?
源论文的重要结论之一是,肺纤维化中存在具有促纤维化意义的上皮和间质谱系变化。本文复现到的结果与这条主线有多处一致:
- 公开注释中可以恢复 epithelial、immune、endothelial 和 mesenchymal 四个主要 compartment。
- IPF 图谱中 epithelial 和 mesenchymal compartment 值得重点关注。
- 上皮层面能观察到 AT2、MUC5B+、Basal、KRT5-/KRT17+、Transitional AT2 等疾病相关状态。
- mesenchymal 区域保留清楚的 COL1A1、ACTA2、LUM、DCN、POSTN 等 ECM 和 myofibroblast 相关线索。
- immune 区域中 macrophage/monocyte 是高丰度群体,适合与炎症和组织重塑联系起来进一步分析。
本文没有覆盖的部分同样要明确:
- 没有从 raw reads 完整重跑原文分析流程。
- 没有复现所有原文 figure panel。
- 没有对 epithelial 和 mesenchymal 子集做完整亚群重聚类。
- 没有进行严格 patient-level 差异检验。
- 没有复现空间定位、组织学或实验验证部分。
这些边界不是缺点;公开复现文章必须讲清楚的地方。一个可靠的复现记录应该同时说明“我们看到了什么”和“我们没有声称什么”。
复现这类疾病组织单细胞数据时容易出错的地方
第一,矩阵和注释表不一定是一一对应的。GSE135893 的公开矩阵包含 220,213 个 barcode,而本次使用的已注释 metadata 是 114,396 个细胞。复现前必须先确认交集,不能默认所有矩阵列都有注释。
第二,细胞比例不是患者比例。IPF 组中 epithelial 比例较高,不等于每个 IPF 患者都同样高;更不等于可以直接推出组织中真实细胞比例。组织消化、取样区域、捕获效率和样本贡献都会影响结果。
第三,疾病图谱不应只看 UMAP。UMAP 主要是结构展示,的解释需要 composition、marker、signature 和样本平衡一起看。
第四,异常上皮状态容易被过度解释。KRT5-/KRT17+、Transitional AT2、MUC5B+ 等状态需要先确认,但如果要做机制结论,需要子集分析、差异表达、通路解释和源论文结果图逐项对照。
第五,复现边界要写在文章里。公开数据复现可以非常有价值,但不能把代表性重分析包装成完整论文全部实验复刻。
主要结论 Habermann et al. 的 GSE135893 公开数据可以稳定复现肺纤维化单细胞图谱的主要结构。11.4 万个已注释细胞显示出清楚的 epithelial、immune、endothelial 和 mesenchymal compartment;IPF 相关图谱中 epithelial 和 mesenchymal 变化值得重点关注;AT2、MUC5B+、KRT5-/KRT17+、macrophage、myofibroblast 和 fibrosis ECM 信号共同构成了一个可解释的疾病微环境复现框架。
这篇复现能作为哪些项目模板?
- 公开 GEO 单细胞复现:从矩阵、barcode、gene 和 metadata 重新组织可分析对象。
- 疾病组织图谱解读:把复杂组织拆成 epithelial、immune、endothelial 和 mesenchymal 层级。
- IPF 上皮状态整理:围绕 AT2、MUC5B+、KRT5-/KRT17+ 和 Transitional AT2 组织结果。
- 纤维化微环境分析:用 ECM、myofibroblast 和 macrophage signature 建立解释框架。
- 样本贡献检查:避免把细胞级别统计误读成患者级别结论。
- 报告结果图重做:把 UMAP、composition、marker、score 和来源说明整理成可汇报材料。
如果后续继续加深,这篇数据最自然的方向是 epithelial 子集重聚类、mesenchymal/fibroblast 子集重聚类、macrophage 状态拆分、按患者聚合的差异检验,以及与源论文结果图逐项对照。对于公开复现展示来说,本文已经完成了第一层目标:把一个大型肺纤维化单细胞数据集整理成可阅读、可解释、有边界的中文复现记录。
深度解读:这篇复现应该怎么读?
Habermann 肺纤维化复现要按“疾病组织图谱”来读。本文处理了两个层级:114,396 个已注释细胞用于组成和诊断分组描述,60,000 个分层抽样代表性细胞用于表达 UMAP、marker 和 signature。这个设计决定了文章能支持的是图谱和表达状态复核,而不是直接给出患者层面的严格统计结论。
1. 这篇复现回答了什么?
它回答的是“GSE135893 的公开注释和矩阵能否重建 IPF/ILD 肺组织中的 epithelial、immune、endothelial、mesenchymal 四个主要 compartment,并复核源论文强调的上皮损伤与纤维化间质线索”。从本文结果看,IPF 相关图谱中 epithelial 和 mesenchymal compartment 值得重点关注;AT2、MUC5B+、KRT5-/KRT17+、Transitional AT2、macrophage、myofibroblast 和 fibrosis ECM 相关信号都能在公开注释和 marker/signature 中找到对应线索。
这已经支持“公开图谱层面的疾病微环境复现”。但它不是完整重做源论文所有子集、空间定位、组织学和实验验证。
2. raw / processed matrix 的边界在哪里?
GSE135893 的公开矩阵包含 220,213 个 barcode,而本文主体使用 metadata 中 114,396 个已注释细胞。这一点很关键:不是所有 barcode 都直接进入复现叙事。本文尊重注释交集,用全量注释细胞做 composition,用代表性子集做表达图谱,避免把未注释条目或少数高丰度群体硬带入解释。
本文没有从 raw reads 重跑,也没有复刻所有原文 panel。因此,AT2、KRT17、MUC5B、COL1A1、ACTA2、SPP1 等信号应写成公开矩阵表达层面的复核,而不是病理机制的最终证明。
3. 主要图应该怎么读?
图 1 先确认诊断分组、cell type 和 QC 分布;图 2 看四个 compartment 在代表性表达子集中的结构;图 3 看诊断分组下的 major compartment 和 epithelial state 组成;图 4-6 用 marker UMAP 和 dotplot 复核一级/二级注释;图 7-8 看 epithelial injury、AT2、AT1、fibrosis ECM、myofibroblast 和 macrophage activation score;图 9 再检查样本贡献是否均衡。
这里最容易被误读的是 composition 和 score。IPF 中 epithelial/mesenchymal 占比更高,是这批已注释细胞中的观察;它不等于每个 IPF 患者真实组织比例都如此。ECM score 和 myofibroblast score 也必须在 mesenchymal 子集和样本层面继续检查,不能只看总体均值。
4. 哪些地方不能过度解释?
第一,不能把细胞级统计写成患者级统计。第二,不能把 KRT5-/KRT17+、Transitional AT2 或 MUC5B+ 状态写成本文独立证明的细胞命运转换。第三,不能把 ECM 和 myofibroblast score 直接写成纤维化机制因果。第四,NSIP、cHP、Sarcoidosis 等较小分组适合作为疾病谱背景,不适合在本文中强行做强结论。第五,代表性抽样 UMAP 不是全量原文复刻。
本文能严肃支持的是:公开数据可复现 IPF 肺组织主要 compartment、异常上皮状态和纤维化微环境相关表达线索。本文不能支持的是:病理机制因果、治疗靶点验证、空间定位或完整患者层面统计。
5. 如果继续深入,下一步做什么?
继续深入时,应按 compartment 做子集分析。Epithelial 子集里重点复核 AT2、Transitional AT2、MUC5B+、KRT5-/KRT17+ 和 basal-like 状态;mesenchymal 子集里拆 myofibroblast、fibroblast 和 ECM 程序;immune 子集里检查 macrophage/monocyte 状态;所有差异都应按 sample/patient 聚合后评估稳健性。结尾处再把源论文关键图逐项对照,而不只增加 UMAP 颜色。
这篇数据对真实疾病组织项目的启发是:先分清 cell-level、sample-level 和 patient-level 的证据层级,再讨论疾病状态。这个顺序比单纯画更多图更重要。
小结
本次复现从 GSE135893 公开数据出发,以 114,396 个已注释细胞为主体,使用 60,000 个代表性细胞完成表达图谱和 marker/signature 检查。结果显示,Habermann et al. 肺纤维化单细胞数据能够清楚恢复主要细胞 compartment,并支持围绕 IPF 上皮损伤、异常修复、间质 ECM 重塑和免疫微环境的解释主线。
这类复现的价值不靠“重新画一张图”,而在于把公开数据来源、注释范围、细胞组成、marker 证据、signature 解释、源论文对照和复现边界全部放在同一篇文章里。对于经典单细胞文献和公开 GEO 数据,这样的整理往往比单独看原始代码或单张 UMAP 更接近实际科研讨论和汇报需求。