Gierahn 等人在 2017 年发表 Seq-Well 方法论文,用低成本、便携式微孔阵列完成单细胞 RNA 测序。GSE92495 同时收录物种混合、HEK、PBMC 和结核分枝杆菌暴露实验,容易让人把系列中的不同文件混在一起。本文分析的 GSE92495_MTB.txt.gz 对应单核细胞来源巨噬细胞,处理条件为 M. tuberculosis H37Rv 暴露(MOI=10)和未暴露对照。
科学更正(2026-07-19) 早期页面曾误把 MTB 矩阵带入 PBMC 细胞身份语境,并尝试从表达分数推断多个免疫细胞类别。GEO 第一方样本记录明确写明,
GSM2486334/335的材料均为 monocyte-derived macrophage。相关身份计数、比例和解释已撤回。本文现只讨论巨噬细胞内部的连续状态,作者Cluster1-5保留数字编号,不擅自翻译成细胞类型或功能亚群。
先把数据对象核准
GEO 系列页给出的实验设计包含多类样本,但每个 supplementary file 的对象不同。GSE92495_MTB.txt.gz 来自两组巨噬细胞:
GSM2486334:Monocyte-derived Macrophages,Mtb H37Rv 暴露,MOI=10;GSM2486335:Monocyte-derived Macrophages,未暴露对照;- 公开矩阵列名包含
Cluster1-5、Exposed/Unexposed和组内序号; - 列名没有 donor、individual、独立培养批次或样本重复 ID。
这个核对会改变整篇文章的分析问题。当前数据适合检查巨噬细胞状态异质性、IFN 相关表达、抗原呈递和炎症程序;它不支持 PBMC 组成分析,也无法比较不同免疫细胞类型的丰度。
论文与公开数据
- 论文:Gierahn et al., Nature Methods, 2017
- 题名:Seq-Well: portable, low-cost RNA sequencing of single cells at high throughput
- DOI:10.1038/nmeth.4179
- GEO:GSE92495
- 本文输入:
GSE92495_MTB.txt.gz - 矩阵层级:GEO processed expression matrix
本文没有从 FASTQ 重新比对,也没有复算 Seq-Well 捕获效率、barcode/UMI 处理和 read-level QC。公开矩阵适合表达层复查,不能替代完整方法学复刻。
数据规模与分母
脚本读取公开矩阵后,以基因作为行、细胞作为列构建对象。基础过滤要求每个细胞至少检测到 200 个基因,每个基因至少出现在 5 个细胞中。最终分析对象包括:
- 分析细胞:4,638;
- 分析基因:9,381;
- 处理条件:Exposed、Unexposed;
- 作者 cluster:Cluster1-5;
- 可识别生物学重复:0。
作者 cluster 来自矩阵列名,属于原始分区信息。它们不是 donor,也没有附带现代巨噬细胞状态名称。Exposed/Unexposed 是处理分层;由于缺少独立重复,后文的条件差异均停留在细胞层描述。

图 1. 两个处理条件、五个作者 cluster 和每个细胞的检测基因数。图中细胞数用于说明当前 processed matrix 的结构,不充当生物学重复数。
图 1 先确认公开文件能提供什么。条件和作者 cluster 可以从列名稳定解析,检测基因数也足以支持成组表达程序的复查。缺失的信息同样清楚:没有 donor 映射、独立培养批次、感染复孔和更细实验层级。后续结果要把这部分缺口一直带着。
分析策略:围绕巨噬细胞状态展开
本文保留常规降维步骤,但不再生成离散免疫身份:
- 读取 GEO processed matrix,记录原始文件 SHA256;
- 解析
paper_cluster和condition; - 完成基础过滤、高变基因选择、PCA、邻近图、UMAP 和 Leiden;
- 计算 macrophage、IFN/inflammatory、antigen-presentation 和 inflammatory 四类连续程序;
- 使用未进入上述程序的
MARCO/MSR1/FCGR3A/C1QA/C1QB/HLA-DQA1/HLA-DQB1/GBP1作额外检查; - 按条件输出细胞层中位数、均值和标准差,不报告样本层 P 值;
- 作者 cluster、无监督结构、连续程序和留出 marker 分开保存。
连续分数表示一组基因在当前矩阵中的相对表达方向。它没有把每个细胞塞进一个类别,也不会产出“某类巨噬细胞占多少”的精确比例。
暴露条件是否主导低维结构

图 2. 单核细胞来源巨噬细胞按 Mtb Exposed/Unexposed 着色。该图用于检查处理条件与表达结构的对应关系。
两组细胞在低维空间中的分布提示处理条件与表达状态有关,不过 UMAP 不能区分感染效应、培养差异、个体来源和技术批次。矩阵中没有这些字段,因此图 2 只能回答“条件标签是否对应表达结构”,不能回答总体处理效应有多大。
若要做推断性分析,需要恢复 donor 或独立培养批次,并在每个重复内汇总。把 4,638 个细胞直接当成 4,638 个独立观测,会明显夸大统计把握度。
作者 Cluster1-5 是原始分区,不是亚型名称

图 3. GEO 列名中的 Cluster1-5 在 UMAP 上的位置。数字编号保留作者原始含义,本文不补写未经来源支持的状态名称。
五个作者 cluster 在表达空间中形成不同区域,说明原始分区仍可复查。随后需要判断这些区域分别富集哪些巨噬细胞状态程序,避免给每个编号强行配一个现代术语。感染相关巨噬细胞常同时出现 IFN、抗原呈递、炎症、吞噬和代谢变化,单一类别很难概括这种连续异质性。

图 4. 每个作者 cluster 内 Exposed/Unexposed 细胞的描述性构成。分母是该 cluster 中的细胞,cluster 本身不属于独立重复。
图 4 能显示条件细胞在作者 cluster 中是否均匀分布。如果某个 cluster 的暴露细胞较多,可以把它当成后续查找状态基因的入口。由于独立样本数未知,这个构成差异不能写成感染导致某一状态比例升高。
留出 marker 检查额外表达特征

图 5. 未进入状态分数构建的巨噬细胞和抗原呈递相关 marker,按作者 cluster 汇总。点大小表示检测比例,颜色表示相对平均表达。
MARCO/MSR1 提供吞噬和巨噬细胞成熟方向,C1QA/C1QB 反映补体相关髓系状态,HLA-DQA1/HLA-DQB1 检查抗原呈递,GBP1 提供 IFN 相关的额外读数。这些基因与状态分数的构建集合分开,能够发现一致和冲突。
留出 marker 仍然不是功能实验。它们可以支持“某个作者 cluster 具有更明显的抗原呈递或 IFN 相关表达”,无法单独证明吞噬能力、细菌负荷、细胞因子分泌或保护性免疫功能。
四类连续状态程序

图 6. macrophage、IFN/inflammatory、antigen-presentation 和 inflammatory program 在 UMAP 上的连续分布。颜色表示相对分数,不表示离散亚型。
Macrophage program 用 LYZ/LST1/CSF1R/FCGR1A/CD68/CTSS 描述髓系基础表达。IFN/inflammatory program 包含 ISG15/IFIT1/IFIT2/IFIT3/MX1/OAS1/STAT1/IRF7。Antigen-presentation program 使用 HLA-II 和 CD74。Inflammatory program 关注 IL1B/TNF/CXCL8/NFKBIA/S100A8/S100A9。
这四组分数回答不同问题。Macrophage program 检查细胞是否保留单核细胞来源巨噬细胞的主干表达;IFN 和抗原呈递用于定位暴露相关状态;炎症程序帮助区分趋化因子、即时反应和 S100 家族信号。它们可能在同一个细胞中同时升高,分析时不需要互斥分类。
条件比较只保留描述性读法

图 7. Exposed/Unexposed 条件下四类状态分数的细胞层分布。箱线图展示当前矩阵中的分布差异,不提供总体显著性结论。
图 7 可以检查方向和重叠程度。某个分数在暴露组整体偏高,说明公开矩阵中存在与处理条件一致的表达偏移;两组大量重叠,则说明巨噬细胞内部异质性仍占较大部分。两种现象都值得记录,但都需要样本层重复才能估计稳定效应。
更严肃的统计路径应先恢复 donor 或独立培养批次,然后在每个重复内按作者 cluster 或可靠状态分层汇总。样本数足够时可做 pseudobulk、混合模型或预注册基因集检验,并报告效应量和不确定区间。
与源论文主线如何对应
Gierahn 原文主要介绍 Seq-Well 平台,并用人巨噬细胞暴露结核分枝杆菌展示低输入样本的应用。本文没有重做微孔阵列制造、膜封装、建库、barcode 校正和方法学性能比较。本文聚焦作者公开的 MTB processed matrix,检查处理分层和细胞状态能否重新读出。
第一方元数据与矩阵内容能够共同支持三点:分析对象是单核细胞来源巨噬细胞;作者保留了五个数字 cluster;IFN、抗原呈递和炎症相关表达可在公开矩阵中检查。总体感染效应、不同 donor 的一致性和具体功能结果仍需原始样本映射或额外实验。
这类老数据最容易出现的三种误读
一类误读来自系列级标题。GSE92495 含有 PBMC 样本,不代表 GSE92495_MTB.txt.gz 就是 PBMC 矩阵。文件、样本 accession 和 supplementary 内容必须逐项对应。
另一类误读来自数字 cluster。Cluster1-5 可以追溯原始分区,却没有自动携带现代巨噬细胞亚型名称。将它们直接命名为炎症型、抗原呈递型或其他功能状态,会把表达线索写成确定分类。
还有一类误读来自细胞级箱线图。细胞很多不等于生物学重复很多。缺少 donor 和独立培养批次时,细胞层分布只能描述当前矩阵,不能给出人群层或实验总体层的显著性。
如果继续深入,需要补什么
下一步优先找回 GSM2486334/335 内部的 donor、培养批次和感染复孔映射。重复结构明确后,可以在每个样本内计算 IFN、HLA-II、炎症和吞噬程序,再估计暴露效应。
第二步可在作者 cluster 内做样本层差异表达,避免 cluster 组成变化混入总体比较。若有细菌负荷、感染比例或细胞活性信息,可进一步检查表达状态与感染程度的关系。
第三步是连接现代巨噬细胞参考。参考映射需要输出置信度、top-two margin 和未分配状态;低置信度细胞保留为 unresolved。参考标签可以补充解释,不能覆盖原始实验设计。
结论边界
本文确认 GSE92495_MTB.txt.gz 对应 4,638 个单核细胞来源巨噬细胞,包含 Mtb 暴露和未暴露条件,以及作者 Cluster1-5。公开 processed matrix 可用于复查 macrophage、IFN、抗原呈递和炎症相关连续状态,也能显示条件与作者 cluster 的对应关系。
当前输入没有 donor 或独立重复 ID,所有条件比较均属于细胞层描述。文章不报告 PBMC 组成、不创建离散巨噬细胞亚型、不做总体显著性推断,也不把表达程序延伸为感染机制或免疫保护结论。