Macosko et al. 2015 年发表于 Cell 的 Drop-seq 论文,是单细胞转录组技术史里的经典文章之一。本文从 GEO 的 P14 mouse retina processed logDGE matrix 出发,在 49,300 个细胞中固定抽取 8,000 个代表性细胞,分开呈现无监督 cluster、7 个 GEO 实验样本、4 个采集日、连续视网膜 program 和留出 marker。
科学更正(2026-07-19) 早期页面曾按每个 Leiden cluster 的最高 marker score 赋予细胞身份,只设置了宽松绝对阈值,没有 top-two margin;随后又用同一 marker panel 作“验证”,并发布 rod 61.9% 等精确比例。相关新推导身份和比例现已撤回。早期页面还只识别
r1-r6,把抽样中的 638 个p1细胞写成unknown。GEO 七个单样本矩阵的列数核对显示:r1-r6对应 retina 1-6,p1对应 retina 7;七个样本分布在四个采集日。本文现按这一映射呈现图 3、图 4 和样本汇总。
为什么选这篇 Drop-seq 视网膜论文?
Macosko et al. 的文章题目是 Highly Parallel Genome-wide Expression Profiling of Individual Cells Using Nanoliter Droplets。这篇论文的主要贡献是 Drop-seq 技术本身:用微滴把单个细胞和带 barcode 的微珠一起捕获,从而实现大规模单细胞表达测量。P14 小鼠视网膜数据是论文中需要先确认的展示对象,因为视网膜细胞类型丰富、marker 清楚,而且适合用大规模单细胞数据展示细胞分类能力。
这类经典技术论文很适合复现,但也很容易被写错。它不是一个普通的小矩阵教学数据;它是一个 49300 个细胞的 processed logDGE matrix。复现时要同时说明三件事:
- 这篇文章的技术史意义:Drop-seq 如何推动大规模单细胞测序。
- 这组视网膜数据的生物学可解释性:rod、cone、bipolar、amacrine、Muller glia 等细胞类型是否能被 marker 支持。
- 本次复现的边界:本文使用 processed logDGE,并进行代表性抽样,不声称从 raw reads 完整重跑 Drop-seq pipeline。
这三个层次放在一起,才是一篇负责任的公开复现记录。
论文和数据来源
- 论文:Macosko et al. Cell, 2015
- 论文题名:Highly Parallel Genome-wide Expression Profiling of Individual Cells Using Nanoliter Droplets
- DOI:10.1016/j.cell.2015.05.002
- GEO series:GSE63473
- 视网膜数据:GSE63472
- 公开矩阵:P14Retina logDGE
复现边界说明 本文使用 GEO processed logDGE,全矩阵包含 49,300 个细胞,本次固定随机种子抽取 8,000 个。GEO 定义七个实验 replicate,采集安排为 day 1 一个、day 2 两个、day 3 三个、day 4 一个。公开记录未提供逐动物 ID,因此样本层 program 只作描述,不做动物层总体推断。
数据结构:49,300 个细胞的 processed logDGE 大宽表
这个文件第一列是 gene,后续每一列是一个细胞,例如 r1_GGCCGCAGTCCG。矩阵中的数值是 processed logDGE expression,不是整数 UMI count。文件压缩后约 317 MB,展开后是一个很宽的 gene × cell 表。
这类数据复现时有两个技术细节。第一,不能把它当成普通 10X 三件套;第二,不能把浮点 logDGE 数值写成 raw count。本文的处理方式是流式读取压缩矩阵,按固定随机种子抽取 8000 个细胞,保留 17089 个基因,用 processed expression 做高变基因、PCA、UMAP、Leiden 和 marker score。
- 公开矩阵细胞数:49,300
- 代表性抽样细胞:8,000
- 基因数:17,089
- Leiden clusters:15
- 连续 program:rod、cone、bipolar、amacrine、horizontal、ganglion、Muller glia、microglia
- GEO 实验样本:7;
r1-r6对应 retina 1-6,p1对应 retina 7 - 采集日:4;day 1/2/3/4 分别含 1/2/3/1 个样本
- 逐动物 ID:未提供
分析流程
- 下载 GEO processed logDGE matrix,并保留原始压缩文件。
- 解析细胞列名,使用固定随机种子抽取 8000 个代表性细胞。
- 流式读取 gene × cell 大宽表,构建 cell × gene 单细胞对象。
- 记录检测基因数和总 log expression,过滤低检出基因。
- 执行高变基因选择、PCA、邻接图、UMAP 和 Leiden 聚类。
- 根据 retina 经典 marker 计算 rod、cone、bipolar、amacrine、horizontal、ganglion、Muller glia 和 microglia signature。
- 保留每个 cluster 和 library 的连续 program score,不做最高分身份赋值。
- 用未参与 score 构建的留出 marker 按 Leiden cluster 汇总,避免同 marker 循环自证。
这套流程的重点不是追求“全量一次性跑完”;关键在于把经典大数据集整理成可解释、可复核、可写清边界的结果。
连续 program UMAP:主要视网膜表达方向是否可见?

图 1. 8,000 个代表性细胞的 rod、bipolar 和 Muller glia 连续 program score。颜色表示相对表达程序,不是逐细胞身份。
图 1 显示不同视网膜 program 在表达空间中形成集中区域,这与复杂视网膜组织应有的多种细胞程序相容。但没有作者逐细胞标签或可靠参考映射时,本文不把这些高分区域转换成精确身份,也不根据面积估计组织比例。

图 2 Leiden 无监督聚类结果。15 个 cluster 构成 marker 注释前的无监督结构,用于检查主要群体是否先在表达空间中分开。
Leiden 是无监督中间结构。本文保存每个 cluster 的多维 program 均值和留出 marker,不把 15 个 cluster 强制合并成 7 个最高分身份。某个 cluster 的 rod program 较高,只能作为表达方向,不能自动变成 Rod Photoreceptor 标签。
七个 GEO 样本:前缀映射要先核准

图 3. 七个 GEO retina 样本在 UMAP 上的分布。r1-r6 和 p1 已分别映射到 retina 1-7。
大规模早期 Drop-seq 数据里,样本与 run 前缀需要先确认。全矩阵中 p1 有 4,000 个细胞,r1-r6 分别有 6,600、9,000、6,120、7,650、7,650 和 8,280 个。逐个核对 GEO 单样本矩阵的列数后,映射关系可以唯一确定。图 3 用于检查某些表达区域是否主要来自单一样本,并帮助识别采集日或实验批次影响。
样本层描述:七个实验 replicate 的 program 是否一致

图 4. 七个 GEO 样本的连续 program 中位数。retina 1-7 来自四个采集日;该图用于检查样本一致性,不是细胞组成图。
早期页面曾发布 4,951、1,296、819 等计数和 61.89% 等比例,这些结果均来自无 margin 的最高 cluster score,现已撤回。图 4 比较七个实验 replicate 的 program 中位数,用来观察某个样本或采集日是否明显驱动局部信号。由于逐动物 ID 缺失、采集日与样本部分绑定,这些数值不进入动物层总体差异检验。
留出 marker:无监督 cluster 是否有额外表达支持?

图 5. 未参与 program score 构建的留出 marker 按 Leiden cluster 汇总。该图检查额外表达特征,不验证任何最高分标签。
留出面板包括 RCVRN/PDE6B、ARR3/THRB、PRKCA/ISL1、TFAP2A/TFAP2B、PROX1、THY1/NEFL、APOE/VIM 和 C1QB/AIF1。这些基因与 score 构建集合分开,可用于发现一致或冲突;没有作者标签时,仍不能据此发布 exact cell-type counts。
Rod photoreceptor signature:最大群体的表达证据

图 6. Rod photoreceptor 连续 program。高分只表示相关基因组合更强,不给出离散身份。
Rod photoreceptor program 是本次代表性抽样中最醒目的连续信号之一。用 program 而不是单基因,有助于降低单基因表达未检出和噪音影响;但高分区域面积不等于细胞比例。
图 6 说明 rod 相关基因组合在特定表达区域共同升高。它支持“rod program 可见”,不能在没有作者标签和拒绝规则时写成“rod 占多少”或“每个高分细胞都是 rod”。
Bipolar cell signature:中间神经元结构

图 7. Bipolar 连续 program 在 UMAP 上的分布;不据此计算双极细胞比例。
Bipolar program 由 VSX2/GRM6/TRPM1/CABP5 等基因构成,可用于定位相关表达区域。本文没有可靠离散标签,因此不据此拆 subtype 或作功能、电生理结论。
如果要把这篇数据继续做深,bipolar 子集重聚类是一个很自然的方向:把 bipolar 细胞单独取出,重新做 HVG、PCA、UMAP 和 subtype marker 检查,再和原文更细的细胞类别对照。
Muller glia:低丰度但需要先确认的胶质细胞

图 8. Muller glia 连续 program 在 UMAP 上的分布;不据此计算胶质细胞比例。
Muller glia program 集中在较小的表达区域。表达矩阵可以提示胶质相关程序,但代谢支持、损伤响应等功能不能由该 score 单独证明;相应身份比例也已撤回。
这也说明大规模单细胞数据的价值不只在“找到最多的细胞”,还在于能同时保留低丰度但功能重要的群体。不过,对于 360 个 Muller glia 代表性细胞,本文只做大类展示,不做过深亚群结论。
和源论文结论如何对照?
源论文的主要目标是提出和展示 Drop-seq 技术,并用 P14 retina 证明它可以在一个复杂组织中大规模测量单细胞转录组、识别细胞类型和发现细胞群结构。本文复现到的层级与源论文主线有以下一致之处:
- P14 retina processed matrix 包含大量单细胞,适合做大规模细胞图谱复现。
- 主要视网膜细胞大类可以通过表达结构和 marker 组合重新识别。
- Rod photoreceptor 是图谱中的主体群体,并由经典光感受器 marker 支撑。
- Bipolar、amacrine、cone、Muller glia、ganglion 和 horizontal cell 等低丰度群体仍能在代表性抽样中观察到。
本文没有覆盖的内容也要明确:
- 没有从 raw reads 或 raw molecule counts 重做完整 Drop-seq pipeline。
- 没有复现原文全部细胞亚型和分类树。
- 没有把 49300 个细胞全部用于 UMAP;固定随机种子抽取 8000 个代表性细胞。
- 没有把 UMAP 距离解释为严格发育轨迹或组织空间距离。
- 没有对每个神经元亚类继续做 subtype-level 机制分析。
这个边界对经典技术论文尤其重要。复现不应该把 processed matrix 的重分析包装成完整技术流程重跑,也不应该把大类 marker 注释写成源论文全部结果复刻。
复现这类经典大矩阵时容易出错的地方
第一,矩阵层级要说清楚:P14Retina_logDGE 是 processed log expression。第二,抽样固定随机种子 17。第三,无作者标签时只报告连续 program 和留出 marker。第四,低丰度方向需要全量或参考映射后再解释。第五,公开结果矩阵重分析不覆盖完整技术流程。
主要结论 GSE63472 的 processed logDGE 在固定 8,000 细胞抽样中保留了清楚的无监督结构和多种视网膜连续表达程序。本文不能支持新推导身份的精确计数或比例;更细 taxonomy 需要作者标签或带置信度与拒绝状态的参考映射。
这篇复现能作为哪些项目的模板?
- 经典技术论文复现:从 Drop-seq 公开矩阵恢复可解释的细胞图谱。
- 大宽表处理:处理非 10X 格式的 gene × cell processed expression matrix。
- marker 注释:在没有逐细胞标签时,用经典 marker 和 cluster score 做大类注释。
- 视网膜图谱解释:围绕 rod、cone、bipolar、amacrine、Muller glia 等主线组织结果。
- 抽样复现边界:对大数据集使用可复现代表性抽样,并清楚说明边界。
- 报告结果图整理:将 UMAP、composition、DotPlot 和 signature 图整理成汇报可用材料。
后续可以继续加深的方向
| 增强方向 | 价值 |
|---|---|
| 全量 49300 细胞的高性能稀疏分析 | 更完整地接近原始 processed matrix 图谱 |
| bipolar 子集重聚类 | 细分 bipolar subtype,并与原文分类对照 |
| amacrine 子集重聚类 | 解析 inhibitory interneuron 内部复杂性 |
| rod/cone 光感受器子集分析 | 更细地检查 photoreceptor 发育和成熟状态 |
| 与原文细胞类群逐项对照 | 将 Leiden、连续 program 和源论文分类表逐项核查 |
| 结果图重绘和中文解释 | 将经典技术论文数据转成汇报、教学或课题讨论材料 |
深度解读:这篇复现应该怎么读?
Macosko 这篇复现要同时按“技术论文”和“P14 retina 图谱”来读。源论文关键在于 Drop-seq 方法,P14 视网膜数据是展示大规模单细胞分类能力的重要案例。本文使用的是 GSE63472_P14Retina_logDGE.txt.gz processed logDGE matrix,并固定随机种子抽取 8,000 个代表性细胞,因此结论必须同时保留矩阵层级和抽样边界。
1. 这篇复现回答了什么?
它回答的是“经典 Drop-seq P14 retina processed matrix 是否能在代表性抽样下恢复主要视网膜细胞大类”。本文在 49,300 个公开细胞中抽取 8,000 个,复现出 rod photoreceptor、bipolar、amacrine、cone、Muller glia、ganglion 和 horizontal cell 等大类,并用 RHO/NRL/GNAT1、OPN1SW/OPN1MW/ARR3、VSX2/GRM6/PRKCA、PAX6/GAD1/GAD2、RLBP1/GLUL/SLC1A3 等 marker 支持。
这说明公开 processed matrix 足以支持视网膜大类图谱复现,也支持源论文“Drop-seq 能在复杂组织中大规模识别细胞类型”的方向。它不等于完整重跑 Drop-seq pipeline,也不等于复现原文全部 subtype taxonomy。
2. raw / processed matrix 的边界在哪里?
P14Retina_logDGE 是 processed log expression。本文可以做表达空间、Leiden、连续 program 和留出 marker,但不能重建微滴捕获、barcode 纠错、UMI 计数、原始过滤或方法学性能评估。本文展示固定抽取的 8,000 个细胞,分母与全量 49,300 个细胞分开记录。
早期页面曾报告 rod 61.9%,该比例来自无 top-two margin 的 cluster 最高分规则,现已撤回。更细的 bipolar、amacrine 和 photoreceptor taxonomy 需要全量分析、作者标签或可靠参考映射。
3. 主要图应该怎么读?
图 1 看连续 rod/bipolar/Muller program;图 2 看 Leiden;图 3 检查七个 GEO 样本;图 4 看样本层 program 中位数;图 5 用留出 marker 检查 cluster;图 6-8 展示连续 program,不生成细胞身份或比例。
这里最重要的是不要只看 UMAP 颜色。Rod、bipolar、amacrine、Muller glia 等身份必须由成组 marker 支持;ganglion 和 horizontal cell 细胞数较少,应作为可识别低丰度大类展示,不适合在本文中深拆功能。
4. 哪些地方不能过度解释?
第一,代表性抽样不等同于全量复刻。第二,processed logDGE 不能写成 raw UMI 重分析。第三,没有作者/参考标签时不生成 subtype 注释。第四,UMAP 距离不表示视网膜空间层级或发育时间。第五,当前工作不覆盖完整技术流程。
本文支持 P14 retina processed matrix 在固定抽样中保留多种视网膜相关连续 program 和无监督结构。完整 Drop-seq pipeline、精确细胞比例、全部亚型、空间层级和发育机制均超出当前证据。
5. 如果继续深入,下一步做什么?
继续深入时,可以先做全量 49,300 细胞的稀疏分析,检查固定抽样是否稳定;随后取得作者分类或执行带置信度和 unassigned 的参考映射,再决定是否对子集重聚类。
这篇文章对经典技术论文复现的启发是:技术意义、公开矩阵层级和生物学图谱要分开写。混在一起会夸大结论,分清楚反而更专业。
小结
这次复现从 Macosko et al. 经典 Drop-seq P14 retina processed logDGE matrix 出发,在 49300 个公开细胞中抽取 8000 个代表性细胞,复现了 rod photoreceptor、bipolar、amacrine、cone photoreceptor、Muller glia、ganglion cell 和 horizontal cell 等主要身份。结果说明,经典 Drop-seq 数据即使用 processed matrix 进行代表性复现,也能恢复清楚的视网膜细胞结构;但文章必须明确抽样、矩阵层级和注释边界。