跳到正文
bioinfo.zle.ee
返回

复现 Usoskin 2015 DRG 单细胞数据:11 类如何放进现代感觉神经元分类

发布于: · 更新于:

科学更正(2026-07-19): 早期页面曾使用五组 marker score,并把每个细胞分给得分最高的一组。这套做法混用了神经元和胶质相关细胞,也把缺少正向 marker 支持的细胞强制赋予了功能标签。相关五类数量及其图表已撤回。本文现从公开矩阵的分母、神经元筛选、原论文 11 类和现代 DRG 分类对照展开分析,并明确保留现有材料无法确定的部分。

Usoskin 等人在 2015 年发表的 DRG 单细胞研究,长期被用来解释疼痛、瘙痒、温度、机械感觉和本体感觉相关神经元的分子异质性。十多年后再读这篇论文,困难已经发生变化:公开矩阵还能计算,经典 marker 也大多找得到,但原文的 NF、NP、PEP、TH 命名与今天常见的 marker-based taxonomy 并不完全重合。若直接把现代名称套回旧数据,容易制造一份看似精细、证据却不稳的注释表。

这类复现的起点不在 UMAP 参数。需要先确认三个问题:公开表中的一个孔位代表什么,哪些孔位有足够证据进入感觉神经元分析,原论文和现代图谱的标签能否逐一对应。只要这三步含糊,后面的亚型比例、marker 热图和功能叙述都会失去可靠分母。

本文重新分析 GSE59739 的公开 DataTable,并对照以下文献:

先把 799、622 和 591 分开

GSE59739 的公开 DataTable 在表达矩阵前保留了四行 metadata,其中 Content 标记了孔位内容。筛选 Content=cell 后得到 799 个孔位。Usoskin 原论文用于感觉神经元分类的数量是 622。两者差了 177 个,说明“公开表中标记为 cell”与“作者最终纳入分类的神经元”属于两套筛选口径。

本文没有把 799 直接当成 799 个感觉神经元。我们先计算泛神经元基因组,包括 Snap25Syt1Tubb3Rbfox3Elavl3/4PrphScn9a/10aIsl1Pou4f1;同时计算 Sox10MpzPlp1S100bMbpScn7a 等非神经元或胶质相关信号。随后在这两个分数构成的空间中拟合三分量混合模型。按最大 posterior 直接取分量时,591 个孔位进入 neuron-like,63 个进入 glial-like,145 个进入 low-information;这个口径没有 unassigned 类别。

三个分母与细胞区室筛选

图 1。左图分别列出公开 DataTable 的 799 个 cell wells、原论文报告的 622 个神经元和本文 GMM 归入 neuron-like 分量的 591 个孔位;右图展示泛神经元与胶质相关 marker 分数。三个数字来自不同口径,不能互相替代。

591 与 622 相差 31 个。这个差值不能通过调阈值“补齐”。原论文的 622 来自作者掌握的完整实验记录、质量控制和分类流程;公开 DataTable 只保留有限 metadata,本文也没有作者最终细胞清单。145 个 low-information 孔位中可能包含表达信息较弱的神经元,也可能含有其他质量不足的孔位。把其中 31 个挑出来,只会让总数接近论文,不会增加身份依据。

图 1 因此承担的是分母审计。它不提供最终细胞类型,只说明后续哪些细胞可作为较可信的神经元候选,哪些细胞需要留在不确定区。对旧的 plate-based 单细胞数据,这一步尤其重要:一个孔位被记录为 cell,只能说明孔里有细胞材料,不能自动推出该孔位满足神经元亚型分析的要求。

公开表属于 processed expression,能做什么

本文使用的是 GEO 提供的 processed normalized expression table,没有从 FASTQ 重新比对,也没有原始 UMI count。分析可以支持表达模式复查、marker 共现、无监督结构和历史分类对照;它不适合照搬 droplet scRNA-seq 的常规 QC 模板。

例如,线粒体比例阈值、Scrublet 双细胞评分和基于原始 UMI 的 library-size 建模都依赖相应输入。对已经处理过的表达表机械套用这些步骤,会给结果增加一层虚假的“标准化感”。本文保留公开表中 ContentSex 等有限 metadata,使用泛神经元与胶质 marker 分数做区室审计,并把所有低维结构视作探索性结果。

同样,当前材料无法完整复刻作者当年的聚类模型。本文引用原论文补充表中的 11 类数量,明确标记为作者报告结果;本文重新计算的无监督 cluster 只用于检查公开矩阵还保留了哪些表达轴,不会冒充原文标签。

先分离神经元、胶质相关和低信息孔位

如果把 799 个孔位一起放进感觉神经元亚型竞争,Sox10MpzPlp1 高表达的胶质相关细胞也会被迫得到某个神经元名称。早期页面曾把 Schwann/glial-like 列为五个“功能状态”之一,随后又与 nociceptor、pruriceptor 等神经元标签并列比较。细胞区室和神经元亚型属于两个层级,前者应先完成。

细胞区室在 UMAP 上的分布

图 2。左侧显示 neuron-like、glial-like 与 low-information 三个区室;右侧显示混合模型对所属分量的置信度。该图用于筛选分析对象,不用于命名感觉神经元亚型。

图 2 中,glial-like 细胞形成相对集中的区域,说明胶质相关表达信号能够被单独识别。low-information 孔位分布更散,其中一部分靠近 neuron-like 区域。我们没有把这些边缘孔位全部删除,也没有将其纳入后续亚型解释;它们保存在全细胞对象中供检查。这样做会减少可用于神经元分析的细胞数,却能避免用一个不确定孔位制造确定标签。

这套分量划分仍有局限。混合模型依赖预先选定的泛神经元和胶质 marker,并且会为每个孔位选择一个分量;表达较弱的真实神经元可能落入 low-information,受损细胞也可能改变 marker 分数。591 个孔位只作为后续 marker 分析的操作性子集,无法代替作者 QC,也不能视为新的 DRG 参考分类器。

为检查这个操作性分区对置信阈值是否敏感,我们把最大 GMM posterior 低于阈值的孔位改记为 unassigned。阈值从 0.5 提高到 0.9 时,unassigned 从 3 个增加到 119 个;在 0.8 阈值下,得到 553 个 neuron-like、53 个 glial-like、115 个 low-information 和 78 个 unassigned。这个结果说明 591 不是稳定不变的生物学数量,只是无拒绝规则下的分量计数。

GMM posterior threshold sensitivity

图 8。不同最大 posterior 阈值下三个操作性分量和 unassigned 的孔位数。阈值分析用于公开不确定性,不把任一阈值对应数量解释为经验证的感觉神经元身份。阈值越严格,进入后续 marker 分析的细胞越少,结论也应同步收窄。

GMM 的 591 个 neuron-like 分量细胞保留了怎样的结构

在 591 个 neuron-like 细胞中,我们重新选择高变基因,计算 PCA、邻近图、UMAP 和 Leiden 聚类,共得到 7 个无监督 cluster。此处的 cluster 编号只表示表达相似性,不附带功能名称。

neuron-like 细胞的无监督结构

图 3。591 个 neuron-like 细胞按 Leiden cluster 和 Sex 展示。cluster 用于组织 marker 证据;Sex 图用于检查主要结构是否被单一性别完全驱动。

这张图可以读出两点。公开 processed 矩阵仍保留较清楚的神经元内部结构,说明它有条件支持历史 marker 轴的复查。UMAP 的空间距离没有给出 NF、NP、PEP 或现代亚型名称,7 个 cluster 也没有被直接改写成感觉功能类别。低维嵌入会受到高变基因选择、邻居数、随机种子和数据处理方式影响;同一 cluster 内可能混有多个分子分支,彼此相邻的 cluster 也可能具有不同功能。后续命名必须回到成组 marker、作者分类、外部参考和映射置信度。

Sex 着色没有显示某一个大 cluster 完全由单一性别构成,但这不等于已经完成性别差异分析。GSE59739 的样本规模、实验设计和公开 metadata 都不足以在本文中建立稳健的 sex-specific subtype 结论。保留这张图只为检查明显混杂,不用于额外扩展故事。

用原文 marker 轴检查 7 个 cluster

下一步把原论文相关 marker 按生物学分支组织到 dotplot 中。这里采用的是“先看成组表达,再决定能否描述”的顺序。Nefh/Ntrk2/Ntrk3/Pvalb/Spp1 用于观察历史 NF 和有髓机械感受/本体感觉相关轴;Th/Fam19a4/Gfra2 对应 TH cLTMR 方向;Mrgprd/Lpar3/Tmem233 对应 NP1;Mrgpra3/Crip1/Trpv1 用于检查 NP2 相关信号;Nppb/Sst/Il31ra 指向 NP3/瘙痒相关分子群;Tac1/Calca/Adcyap1/Ntrk1 覆盖 PEP 相关伤害感受轴,Trpm8 单独提示冷感受方向。

原文分类轴的 marker dotplot

图 4。dotplot 按 7 个无监督 cluster 汇总历史分类相关 marker。点大小表示表达细胞比例,颜色表示标准化后的平均表达。cluster 编号没有直接转换成正式亚型名。读图时需要同时检查同一分支的多个marker,并留意旧平台表达稀疏造成的未检出现象。

cluster 0 的 Mrgprd 程序最突出,同时可见部分 Mrgpra3-related 和 Sst-pruriceptor 相关信号。它支持一个以非肽能伤害感受轴为主的群体,但内部仍可能混合 NP1、NP2、NP3 相关细胞。仅凭当前分辨率把整个 cluster 命名为 Mrgprd nociceptor,会压掉其中较小的瘙痒相关分支。

cluster 2 以 Ntrk2/Ntrk3Nefh 等有髓感觉神经元相关表达为主,cluster 5 的 Pvalb/Runx3/Etv1/Ntrk3 程序更强。两者共同说明历史 NF 大分支仍能在公开矩阵里看到,同时也解释了为什么早期页面把 mechanoreceptor 和 proprioceptor 合成一类会丢失信息:Pvalb 本体感觉神经元与 Ntrk2/Ntrk3 A-fiber LTMR 在现代分类中属于需要分开的方向。

cluster 1、3 和 4 都带有不同程度的 Th/Fam19a4/Gfra2 程序,提示 TH cLTMR 相关分支在当前无监督参数下被分散到多个 cluster。cluster 4 同时出现较高的 Trpm8 程序和部分 Sst 相关信号,说明单个 cluster 仍可能容纳多个细分亚型,或受到旧平台表达稀疏与聚类分辨率的影响。

cluster 6 的 Tac1/Calca 伤害感受程序最强,同时有 Trpm8 和 Mrgpra3-related 信号。它大致落在历史 PEP 相关方向,但 PEP1、PEP2 及现代 Calca、Trpm8 等细分群之间不能在缺少作者标签或可靠 reference mapping 的情况下直接画等号。

这段解读刻意停留在 marker 轴。dotplot 能够说明哪些基因成组出现、哪些群体值得进一步拆分;它不能给出电生理响应、皮肤支配区域、轴突投射或行为功能。Nppb/Sst/Il31ra 支持瘙痒相关分子身份,功能性 pruriceptor 仍需刺激实验和既有功能文献共同支撑。

连续 marker program 用于定位线索,不生成强制标签

为了减少单基因表达稀疏造成的误判,我们又计算了八组连续 marker program:Pvalb proprioceptor、Ntrk2/Ntrk3 LTMR、Th cLTMR、Mrgprd nociceptor、Mrgpra3-related、Sst pruriceptor、Tac1/Calca nociceptor 和 Trpm8 thermoreceptor。每组分数来自多个 marker 的标准化平均表达。

现代分类相关 marker program

图 5。八组 marker program 在 neuron-like UMAP 上的连续分布。颜色用于显示表达倾向,没有执行 winner-takes-all 赋值,也没有输出各现代亚型的细胞数。

program 图比单个 feature plot 稳定,也减少了强制分类。它显示 Mrgprd、Pvalb、Tac1/Calca 等程序占据不同区域,同时保留过渡和重叠。重叠可能来自真实共表达、细胞状态、旧平台检测限制、双细胞或程序设计不够特异,不能统一解释成“连续谱”。现代 DRG 图谱已经支持多个离散的转录组亚型,表达程序之间仍可共享部分基因,这两件事可以同时成立。

本文没有为 591 个细胞逐个分配现代亚型。可靠的 label transfer 需要明确的参考对象、同物种和组织层级匹配、可复核的特征空间,以及每个预测标签的置信度。当前工作只有文献中的 marker 和名称对照,没有获得可直接用于映射的标准 reference object。此时输出一张完整现代标签表,会让版面更丰富,却无法回答标签是否可靠。

回到 Usoskin 2015:原论文报告的是 11 类

Usoskin 原文将 622 个神经元组织为 NF1-NF5、NP1-NP3、PEP1-PEP2 和 TH,共 11 类。根据补充表,数量分别为:NF1 31、NF2 48、NF3 12、NF4 22、NF5 26;NP1 125、NP2 32、NP3 12;PEP1 64、PEP2 17;TH 233,总计 622。

Usoskin 2015 作者报告的 11 类数量

图 6。根据原论文补充表整理的 11 类数量。该图复述作者结果,不代表本文对 591 个 neuron-like 细胞重新赋予了这些标签。

这组数量也提醒我们,2015 年的命名体系有明确历史语境。NF 指 neurofilament-rich 分支,其中包含多种有髓低阈值机械感受和本体感觉相关神经元;NP 指 non-peptidergic 分支;PEP 指 peptidergic 分支;TH 群以 Th 等 marker 为特征。它们帮助早期研究把 DRG 从少数大类推进到单细胞分子分类,对后续工作影响很大。

读者留言所说“亚型太古老”,指出的是命名更新问题。今天的 DRG 注释通常会结合更多细胞、更高检测深度、跨研究整合和功能证据,将原来的大分支继续拆细。旧分类仍可作为文献史和数据来源的参照,但不宜直接作为 2026 年项目的终点标签。

从历史 11 类到现代 taxonomy,哪些关系较稳

历史命名与现代命名之间只能做保守对照,不能把整组标签批量替换。下表总结当前文献下较可辩护的方向:

历史分组代表 marker现代分类中的大致方向需要保留的边界
NF1-NF5NefhNtrk2Ntrk3PvalbSpp1Pvalb proprioceptor、Ntrk2/Ntrk3 A-fiber LTMR、部分 Calca Aδ HTMR五个 NF 类没有统一的一对一现代名称
NP1MrgprdLpar3Tmem233Mrgprd nociceptor属于相对稳定的分子对应关系,跨研究仍要核对 marker panel
NP2Mrgpra3CalcaMrgpra3-related 瘙痒感受/伤害感受方向,常需结合 Trpv1 等共表达 marker 复核Mrgprb4 指向另一支 cLTMR 相关分子方向,不能据此把 Mrgpra3 群体归入 cLTMR
NP3NppbSstIl31raSst pruriceptor分子身份支持瘙痒相关方向,功能名称仍需实验依据
PEP1-PEP2Tac1CalcaNtrk1Trpm8多个 Calca nociceptor 和 Trpm8 thermoreceptor 亚型现代图谱在历史 PEP 分支内解析出更多亚型
THThFam19a4Th cLTMR分子分类、支配靶点和生理性质需要平行核对

Bhuiyan 等在 2024 年整合多套小鼠 DRG 单细胞数据,提出协调后的分子命名框架,区分 proprioceptor、A-fiber LTMR、C-LTMR、nociceptor、pruriceptor 和 thermoreceptor 等多个亚型。这个框架也提醒我们,Mrgpra3 相关瘙痒感受方向需要结合共表达 marker 继续细分;Mrgprb4 所代表的 cLTMR 相关分支应单独处理,两者不能因为同属历史 NP/小直径感觉神经元语境就合成一个现代亚型。

现代人 DRG 研究又增加了物种边界。Nguyen 等和 Yu 等的工作显示,人类感觉神经元在保留部分大分支的同时,具体 marker 组合、亚型丰度和功能对应并不等同于小鼠。Bhuiyan 等协调六个物种后提出的 18 个共享分子类,以及 Yu 等通过人 DRG 单胞体深度 RNA 测序报告的 16 个感觉神经元类型,都不能直接套在这 591 个小鼠孔位上。跨物种映射需要同源基因、参考数据、预测置信度和功能文献共同参与。

因此,本文对现代 taxonomy 的使用方式是检查 marker program 和命名边界。我们可以说公开矩阵仍看到 Pvalb、Ntrk2/Ntrk3、Th、Mrgprd、Sst、Tac1/Calca、Trpm8 等方向;现有证据还不足以报告每个现代亚型的精确数量。

五组最高分分类为什么会产生误导

早期页面曾设置五组 signature,然后用每个细胞的最高分决定标签。这个步骤没有设置最低分、第一名与第二名的差值、神经元预筛选或 unassigned 类别。只要某个分数比另外四个略高,即使五个分数全部不高于零,细胞仍会得到一个名称。

核对早期页面所用对象后,799 个细胞中有 163 个细胞的五组最高分仍不高于零,却被强制分类。早期页面给出的 170 个 pruriceptor-like 细胞中,有 153 个细胞五组分数全部不高于零。这个数量无法支持“170 个瘙痒感受相关细胞”的公开结论。

强制标签的失败证据

图 7。早期页面标注的 170 个 pruriceptor-like 细胞中,153 个细胞的五组 signature 均无正向得分。该图说明相关数量为何撤回。

旧 panel 还有两个结构性问题。其一,mechanoreceptor/proprioceptor 组混合了 Pvalb 本体感觉、Ntrk2/Ntrk3 A-fiber LTMR 和 Th C-LTMR 等不同方向。其二,pruriceptor panel 把 NppbIl31raMrgpra3Mrgprb4 放在同一组,混合了 Mrgpra3 瘙痒感受相关方向、Sst/Nppb 相关群体和 Mrgprb4 cLTMR 相关分支。

另外,早期页面曾先用 marker score 生成标签,再用同一批 marker 的 dotplot 证明标签合理,形成了证据循环。dotplot 在这种设计里只能复述评分规则,无法提供独立验证。本文现将无监督 cluster、历史 marker 轴、连续 program、作者 11 类计数和现代文献对照分开,读者可以看到每一步各自支持什么。

公开矩阵能回答到哪里

当前结果支持以下判断:

以下结论没有被当前分析支持:旧五类的任何细胞数量;把 mechanoreceptor 与 proprioceptor 合成一个现代亚型;把全部 Mrgpra3 相关细胞都解释为 pruriceptor;把 591 个孔位强制映射到跨物种协调的 18 类或 Yu 等报告的人 DRG 16 类;根据表达矩阵推断具体疼痛、瘙痒或机械刺激功能。

若继续深挖,下一步需要哪些材料

要恢复作者逐细胞标签,需要从原始补充材料、处理脚本或可追溯的 cell ID 对照中找到 622 个神经元的最终清单,以及 NF1-NF5、NP1-NP3、PEP1-PEP2、TH 的逐细胞归属。有了这层信息,才能直接比较原文分类在本文 UMAP 和现代 marker panel 中的表现。

若目标转向现代 reference mapping,还要选定与小鼠 DRG、年龄、解剖部位和测序层级相匹配的参考对象,完成共同基因处理、标签迁移、置信度评估和 marker 复核。低置信度细胞应保留为 unassigned 或 broad class,不应为了生成完整饼图而强行分配。

涉及瘙痒、疼痛、温度或机械刺激时,还要把转录组亚型与刺激响应、电生理、皮肤支配区域、示踪或行为学研究放在一起。分子 marker 给出候选身份,功能实验决定名称能写到多具体。

对于自己的 DRG 项目,较稳妥的交付顺序通常是:先完成神经元与非神经元区室审计,再给出 broad molecular branch,随后做 reference mapping 和置信度分层,功能名称则与实验设计对齐。每一级都应保留所用 marker、参考来源和无法判断的细胞。这样得到的注释表可能不会覆盖 100% 细胞,却更适合进入论文方法、补充表和后续实验设计。

小结

Usoskin 2015 仍是理解 DRG 单细胞分类史的重要数据集。它记录了感觉神经元从少数功能大类走向分子亚型的关键阶段,也提供了 NF、NP、PEP、TH 这套后来被不断细化的框架。今天复现这组数据,需要同时尊重原论文的 11 类结果和现代 taxonomy 的更新,不能用一套粗 signature 覆盖两者。

早期页面发布的五类数量已撤回。本文用三分量 GMM 将 799 个公开孔位划为 591 个 neuron-like、63 个 glial-like 和 145 个 low-information,随后在 neuron-like 分量中展示 7 个无监督 cluster、历史 marker 轴和现代 marker program,并把原论文 622 个神经元的 11 类计数单独列出。现有公开矩阵支持感觉神经元分子异质性和若干稳定 marker 方向;现代精细亚型、跨物种名称和功能归属仍需要可靠参考与独立实验依据。


分享这篇文章:
通过邮件分享

上一篇
复现Shekhar et al.视网膜双极细胞数据:ON/OFF连续程序与注释边界
下一篇
复现 La Manno et al. 小鼠中脑发育数据:从 GSE76381 到 DA neuron 和 progenitor 状态