纹状体单细胞分类的难点在于判断作者 type、采样 protocol、marker 证据和无监督结构之间是否一致。把 Neuron、Astro、Oligo 等标签重新画一遍还不够。GSE82187 同时包含 microfluidic 与 FACS/Smart-seq2 相关信息,适合用来展示神经系统 taxonomy 复现中容易被忽略的 protocol 边界。
为什么选这篇文献?
神经系统图谱常见痛点是标签很多、marker 很多、protocol 也不同。只看 UMAP 颜色,很容易把作者标签当成结果本身;只看几个 marker,又容易忽略 neuron/glia 层级和捕获方式差异。本次复现把 author type、protocol、marker panel、signature score 和无监督 cluster crosswalk 放在一起,重点放在教学;重点是检查一个公开 taxonomy 数据能否被整理成可审阅的证据链。
本文关注四个问题:GSE82187 的 log10 CPM 矩阵能否恢复纹状体主要细胞类型;Neuron 与 glia/vascular/immune 小群是否有 marker 支撑;protocol 是否影响组成和读图;无监督 cluster 与作者 major type 是否一致。
这类复现文章要让读者看到:公开单细胞数据重新整理后,能否产生可审查、可复用、可继续深入的科研证据。每一张图都应回答一个具体问题,连续堆图不能替代证据审计。
论文和数据来源
论文、数据和公开矩阵信息如下。这里先把来源和矩阵层级交代清楚。
| 项目 | 内容 |
|---|---|
| 论文 | Gokce et al. Cellular Taxonomy of the Mouse Striatum as Revealed by Single-Cell RNA-Seq |
| 发表信息 | Cell Reports, 2016 |
| PubMed | 27425622 |
| 公开数据 | GSE82187 |
| 公开矩阵 | GEO log10 CPM matrix with author type/protocol metadata |
公开矩阵进入分析前,先确认数据层级和规模。
| 项目 | 数值 |
|---|---|
| 公开数据 | GSE82187 |
| 细胞或样本 | 1,208 |
| 基因 | 18,840 |
| 矩阵层级 | GEO log10 CPM matrix with author type/protocol metadata |
| 结果图 | 9 张 |
复现边界: 输入矩阵为 cells × genes,包含
cell.name、type、experiment和protocol元数据。由于矩阵已经是 log10 CPM,本次没有重新做 raw count 归一化;直接在处理矩阵上做 detected gene 检查、高变基因、PCA/UMAP、KMeans crosswalk、marker score 和 type/protocol 组成对照。 因此本文的结论限定在公开矩阵和可用 metadata 层面,不把表达线索写成未经验证的机制或临床结论。
方法和分析流程
本文的处理顺序从数据层级开始:下载 GEO 公开矩阵和 series matrix,确认矩阵方向、样本名和 metadata 对齐方式;根据矩阵层级选择处理方式:FPKM/logCPM/read-count 分别采用不同的归一化和 QC 口径;构建低维图、marker panel、signature score、composition/crosswalk 等结果图,避免只依赖单一 UMAP;逐图解释每张图能支持什么、不能支持什么,并和源论文主线做边界对照。这组处理先确认公开矩阵能支撑哪些问题,再把结果图解释限制在当前证据内。
数据结构:先确认矩阵和 metadata
复现文章需要先交代数据结构。下面这张图不是装饰图;关键是判断这个公开矩阵是否适合继续分析的入口。

数据集概览:展示 author major type、protocol、detected genes 和 protocol 层面的检测基因分布。这个图用于判断数据结构是否足够支撑 taxonomy 复现。
marker 和 score 要成组解释。单个基因高表达只能提供线索;只有 dotplot、heatmap、signature、metadata 和组成结果互相支持,才适合写成细胞身份或状态判断。
读这部分先看数据入口是否可靠。细胞数、基因检测、样本标签和矩阵层级决定了后面所有图能解释到哪里;如果这些信息没有对齐,后续降维、marker 和组成图都只能算视觉结果,不能作为复现证据。
低维结构:先看主问题是否能被恢复
低维图不能单独证明机制,但它能快速回答公开矩阵是否仍然保留论文关注的主要结构。

UMAP 按作者 major type 着色。Neuron 是主体,Astro、Oligo、OPC、Microglia、Vascular 等小群能形成相对清楚的表达空间。
这张图把观察落到基因证据上。读的时候要看一组 marker 是否同向,而不是只挑某个显眼基因;如果证据只停留在 score 层面,结论也要保留探索性。
低维结构只回答表达空间是否可读。颜色或区域分开说明标签、阶段或状态和表达矩阵存在对应关系;它还不能单独证明谱系方向、空间位置、机制强弱或最终命运。

UMAP 按 protocol 着色。这个图提醒读者,图谱结构不仅来自生物类型,也可能带有采样和建库方式的痕迹。
低维图只能说明表达空间的相似性。群体分开、阶段相邻或标签聚集,可以支持后续检查 marker 和组成,但不能单独写成谱系方向、空间位置或机制强弱。
低维结构只回答表达空间是否可读。颜色或区域分开说明标签、阶段或状态和表达矩阵存在对应关系;它还不能单独证明谱系方向、空间位置、机制强弱或最终命运。
marker 证据:标签背后必须有表达支撑
复现不能停在作者标签或 cluster 名字上。这里把代表性 marker 和汇总图放在一起,检查解释是否有成组基因支持。

Neuron、MSN、interneuron、astro、oligo、OPC、microglia 和 vascular signature 在 UMAP 上的分布,用多基因程序补充单 marker 的不稳定性。
这张图把观察落到基因证据上。读的时候要看一组 marker 是否同向,而不是只挑某个显眼基因;如果证据只停留在 score 层面,结论也要保留探索性。
这类图要按成组证据来读。单个基因或局部高表达只能提供线索,只有 marker panel、signature score、metadata 和组成信息互相支持时,才适合写成细胞身份、状态或谱系倾向。

代表性 marker UMAP:Snap25/Rbfox3、Ppp1r1b/Drd1/Drd2、Gad1/Gad2、Aqp4/Aldh1l1、Mbp/Mog、Pdgfra、Cx3cr1/C1qa、Pecam1/Cldn5 等。
marker 和 score 要成组解释。单个基因高表达只能提供线索;只有 dotplot、heatmap、signature、metadata 和组成结果互相支持,才适合写成细胞身份或状态判断。
这类图要按成组证据来读。单个基因或局部高表达只能提供线索,只有 marker panel、signature score、metadata 和组成信息互相支持时,才适合写成细胞身份、状态或谱系倾向。

按 author type 汇总 marker 的平均表达和检测比例。dotplot 用于审查每个标签是否由成组 marker 支撑。
这张图把观察落到基因证据上。读的时候要看一组 marker 是否同向,而不是只挑某个显眼基因;如果证据只停留在 score 层面,结论也要保留探索性。
这类图要按成组证据来读。单个基因或局部高表达只能提供线索,只有 marker panel、signature score、metadata 和组成信息互相支持时,才适合写成细胞身份、状态或谱系倾向。
组成、差异和 crosswalk:把图读到项目层面
当主结构和 marker 已经确认后,才适合讨论组成、分层、同胚胎/同 protocol/同 tissue 的差异,以及无监督结构与作者注释的对应关系。

不同 protocol 下 author type 的组成比例。protocol 组成差异是解释纹状体 taxonomy 时必须保留的实验背景。
组成图必须和采样设计一起读。它能说明当前公开矩阵里哪些群体被观察到、样本或组织标签是否均衡,但不能直接外推成真实组织比例或临床差异。
组成和交叉表需要回到采样、分选和处理流程里解释。它能说明当前公开矩阵中哪些群体被观察到、哪些标签互相吻合,但不能直接外推成组织真实比例、临床差异或完整空间生态。

无监督 cluster 与作者 major type 的交叉表。它用于检查低维结构和作者注释之间是否相互支持。
这张图回答的是来源和比例问题。它适合用来发现样本不平衡、分组偏移或需要子集分析的地方;更强的生物学解释还要结合原文设计和额外证据。
组成和交叉表需要回到采样、分选和处理流程里解释。它能说明当前公开矩阵中哪些群体被观察到、哪些标签互相吻合,但不能直接外推成组织真实比例、临床差异或完整空间生态。

每个 author type 的平均 marker-program score。该图帮助把复杂 marker panel 汇总为可比较的 type-level 证据。
组成图必须和采样设计一起读。它能说明当前公开矩阵里哪些群体被观察到、样本或组织标签是否均衡,但不能直接外推成真实组织比例或临床差异。
这里还要区分作者标签与派生分数。公开 type 是原研究在 2016 年技术和 taxonomy 语境下给出的作者标签;marker-program score 用于复查这些标签在当前处理矩阵中的表达一致性。score 与 dotplot 使用了重叠 marker 家族,二者不能合并成独立验证,也不能据此把历史标签直接升级为现代精细神经元 taxonomy。
组成和交叉表需要回到采样、分选和处理流程里解释。它能说明当前公开矩阵中哪些群体被观察到、哪些标签互相吻合,但不能直接外推成组织真实比例、临床差异或完整空间生态。
与源论文主线的对照
与源论文主线一致的是,公开矩阵可以重建纹状体主要细胞类型结构,Neuron 和多类非神经元细胞在 marker 与 signature 层面都能得到支持。本文没有复刻原文所有分类树、亚型命名和实验设计细节;重点是公开矩阵层面的 taxonomy 复现、protocol 边界和 marker 证据链。
这里需要把“复现到一致”与“完全复刻原文”分开。公开矩阵能支持主要结构、marker 和部分组成解释,但原文中涉及 raw reads、复杂模型、空间信息、临床变量或功能验证的部分,不能被一篇矩阵复现文章替代。
深度解读:这篇复现应该怎么读?
这篇复现回答的是:作者 major type 是否能在公开 log10 CPM 矩阵中被重新验证。它不能回答所有细小亚型的稳定性,也不能把 protocol 造成的组成差异直接解释成生物差异。更深入的方向包括:按 protocol 分层重做 embedding、将 MSN/interneuron 进一步拆分、用更严格的参考注释工具对照作者标签,并把 FACS 与 microfluidic 数据分开检查 marker 稳定性。
如果继续深入,优先级应该由数据类型决定:发育数据优先补时间轴和连续性证据,神经 taxonomy 优先补分层注释和 protocol 分层,肿瘤数据优先补患者层面、CNV/恶性识别和空间/病理对照。复现不只停在“做出图”,还要把下一步应该补什么讲清楚。
不能过度解释的地方
- 低维距离:UMAP/PCA/t-SNE 的距离只能作为结构提示,不能直接等同于谱系距离、空间距离或机制强弱。
- marker 解释:单个 marker 不足以下结论,必须结合 marker panel、signature score、metadata 和组成图。
- 项目外推:公开数据中的线索可以指导后续分析,但不能替代实验验证、临床结局或私有项目的重新质控。
对类似项目有什么启发?
很多神经系统旧项目的痛点不等于缺少 UMAP;缺少可审查的注释证据。把 author labels、marker panel、protocol 组成和 cluster crosswalk 重新整理后,读者能判断哪些标签稳,哪些小群需要谨慎,哪些差异可能来自实验设计。这对 h5ad/Seurat 对象重新注释、旧图谱补图和公共数据再分析都很实用。
如果手里有类似公开单细胞数据、旧 Seurat/h5ad 对象、论文结果图想重新复现,最关键的不等于机械重跑流程;应先问清楚:这个数据能解决什么痛点,哪些图能证明,哪些地方必须停在边界内。
小结
本次复现从 GSE82187 的公开矩阵和 metadata 出发,生成 9 张主要结果图,覆盖数据结构、低维图谱、marker/signature、组成或 crosswalk、源论文对照和复现边界。文章的重点放在把结果写满;关键在于把证据链写清楚:哪些结论被当前矩阵支持,哪些只是值得继续深入的线索,哪些不能在公开数据层面过度解释。