Muraro et al. 的人胰腺单细胞数据是早期器官细胞图谱研究里很适合复核的一组公开数据。本文从 GEO 主表达矩阵出发,整理 4 位供体、32 个 CEL-seq2 library、基础 QC、无监督结构、连续胰腺 program 和供体层统计。
科学更正(2026-07-19) 早期页面曾按每个 Leiden cluster 的最高 marker score 赋予 alpha、beta、ductal、acinar 等身份,使用的 -0.25 阈值没有实际拒绝作用,也没有 top-two margin;随后又用同一 marker panel 作“验证”,并发布精确细胞数和供体组成。相关新推导身份、比例和循环验证表述已撤回。GEO 当前主矩阵未附逐细胞作者标签,本文现不补造离散身份:图 1 展示 beta/alpha/ductal/acinar 连续 program,图 4 展示 donor 层 program 中位数,图 5 使用留出 marker 按 Leiden 汇总。donor 是生物学重复,library 是嵌套技术结构;本文没有疾病或处理组,不作条件效应推断。
为什么选 Muraro 这篇人胰腺单细胞论文?
Muraro et al. 2016 年发表于 Cell Systems 的文章 A Single-Cell Transcriptome Atlas of the Human Pancreas,是人胰腺单细胞图谱中常被引用的早期工作之一。胰腺组织里既有内分泌细胞,也有外分泌和基质相关成分;如果只看 bulk 表达,很难分清 INS 来自 beta 细胞、GCG 来自 alpha 细胞、SST 来自 delta 细胞,还是不同细胞群比例变化带来的总体表达差异。
这类数据对公开复现很有代表性。它要求我们不只会读一个已经整理好的 h5ad 文件,还要能处理 GEO 附件里看起来有点“不标准”的矩阵文件:文件名是 .csv.gz,内容实际是 tab 分隔;行名是 GENE__chr 格式;列名把 donor、library 和 cell 编码在同一个字符串里。对很多旧单细胞数据来说,这种矩阵解析和 metadata 重建本身就是复现的重要部分。
论文和数据来源
- 论文:Muraro et al. Cell Systems, 2016
- 论文题名:A Single-Cell Transcriptome Atlas of the Human Pancreas
- DOI:10.1016/j.cels.2016.09.002
- PubMed:PMID 27693023
- Full text:PMC5092539
- 公开数据:NCBI GEO GSE85241
GEO 中的数据标题是 A single-cell transcriptome atlas of the human pancreas [CEL-seq2]。原始研究从人体胰腺供体中分离胰岛相关细胞,经过活细胞分选后进行自动化 CEL-seq2 / SORT-seq 单细胞转录组测序。GEO 提供的主矩阵文件是 GSE85241_cellsystems_dataset_4donors_updated.csv.gz,这个文件包含所有细胞的表达值,列名指示供体、library 和细胞编号。
**复现边界说明:**GEO 主页面没有随当前主矩阵提供逐细胞最终细胞类型注释表。本文不再用最高 marker score 替代作者标签,只报告连续 program、无监督 cluster、留出 marker 和 donor/library 结构。若后续取得可追溯作者注释或可靠参考映射,才能恢复离散身份及其不确定性统计。
数据结构和 QC:不能直接把 3072 列全部当成高质量细胞
主矩阵第一行是 3072 个细胞列名,例如 D28-1_1、D28-1_2。这个格式可以拆成三层信息:D28 表示供体,D28-1 表示某个供体下的 library,结尾处的数字是单细胞孔编号。GEO series matrix 显示共有 4 位供体,每位供体 8 个 live sorted cell library,因此整体是 4 位供体、32 个 library 的设计。
原始矩阵中存在检测基因数很低的列。公开复现时如果把这些低质量孔直接放进 UMAP,会让图谱多出很多没有生物学解释价值的离群点。本文采用一个明确的基础 QC 标准:保留检测基因数至少 3000 的细胞,再进行基因过滤、总量归一化、log1p、高变基因选择、PCA、邻接图、UMAP 和 Leiden 聚类。
- QC 后细胞数:2,194
- 过滤后基因数:16,279
- 人体胰腺供体:4
- CEL-seq2 library:32
- Leiden clusters:13
- 新推导离散细胞身份:不再生成
| 供体 | QC 后细胞数 | 解读 |
|---|---|---|
| D28 | 344 | 仍保留足够细胞用于参与整体图谱,但细胞数低于其他供体 |
| D29 | 538 | 供体层面贡献适中 |
| D30 | 668 | QC 后细胞数最多的供体 |
| D31 | 644 | 与 D30 接近,是图谱中的主要来源之一 |
这个 QC 结果和公开整理版常见的两千多细胞规模相近。这里没有硬性追求完全一致的细胞数,因为不同整理流程对低质量孔、双细胞、外部注释资源的处理会不同。这里还需要说明的是,阈值要可解释,图谱结构要能被 marker 支持。
分析流程
- 下载 GEO 主表达矩阵、series matrix 和补充说明,记录论文 DOI、PubMed、PMC、GEO、SRA 来源。
- 按 tab 分隔读取矩阵,去掉行名中的染色体后缀,将
GENE__chr转成标准基因名。 - 从细胞列名中解析 donor、library 和 well,重建逐细胞 metadata。
- 基于检测基因数做细胞 QC,再进行基因过滤、总量归一化和
log1p。 - 选择高变基因,执行 PCA、邻接图、UMAP 和 Leiden 聚类。
- 用经典胰腺 marker gene set 计算连续 program,不把 cluster 最高分写成身份。
- 按 donor 和 nested library 汇总 program;使用留出 marker 按 Leiden 检查额外表达特征。
连续 program UMAP:主要胰腺表达方向是否可见

图 1. QC 后 2,194 个细胞的 beta、alpha、ductal 和 acinar 连续 program。颜色表示相对程序强度,不是逐细胞身份。
图 1 显示多组胰腺相关 program 在不同表达区域集中,但当前输入没有可直接追溯的作者逐细胞标签。早期页面发布的 779、412、277 等身份计数均由无 margin 的 cluster 最高分产生,相关计数已撤回。这里可以说“alpha/beta/ductal/acinar program 可见”,不能据此发布细胞类型比例或真实组织构成。
供体结构:四位供体没有完全均匀混合

图 2 按供体标记的 UMAP。4 位供体都进入了 QC 后图谱,但不同供体在某些区域的贡献并不完全相同。
供体信息对这类复现需要先确认。很多器官图谱数据不是完全均衡的“教学数据”,不同供体的细胞产量、细胞组成和技术表现都可能不同。如果后续要比较某个 marker 或某个细胞状态,最好先确认这个信号是不是被某一个供体主导。

图 3. 供体层面的连续 program 中位数。donor 是生物学重复;该图描述 4 位供体,不估计人群比例。
供体图提醒我们,细胞级高分不能脱离 donor 解读。本文按 donor 汇总连续 program,并另外保留 32 个 nested library 的中位数表;没有处理组时不做显著性检验,也不把 4 位供体外推成人群分布。
无监督聚类:先看 cluster,再做 marker 解释

图 4. 13 个无监督 Leiden cluster。cluster 是表达结构,不在本文中自动转换成细胞类型。
公开复现的基本原则是:没有作者逐细胞注释或可靠参考映射,就不要补造确定标签。leiden 只作为中间层;连续 program 和留出 marker 可用于描述其表达特征,但不会被汇总成 exact identity counts。
留出 marker:cluster 的额外表达特征是否一致?

图 5. 未参与 program score 构建的留出 marker 按 Leiden cluster 汇总。该图检查额外表达特征,不验证任何最高分标签。
这张 dotplot 用来检查 cluster 是否存在额外的胰腺相关表达特征。UMAP 分得开不等于身份正确,同一 marker panel 反复展示也不构成独立验证。
留出面板包括 DLK1/PCSK2/CPE、ADCYAP1/HADH、CRYBA2/LOXL4/IRX2/GC、KRT8/KRT18、REG1A/REG3A/SPINK1/PNLIPRP1、PLVAP/EMCN、COL6A1/COL6A2 和 TYROBP。GCG/SST/PPY 已从留出集合移除,因为它们参与了 alpha、delta 和 PP program 构建。更新后的图 5 可检查额外表达特征,但没有作者标签时,仍不足以给每个 cluster 定名或发布比例。
alpha/beta 等 program:只保留连续表达方向

图 6. Beta program 在 UMAP 上的连续分布;不据此计算 beta 细胞比例。
这张图把观察落到基因证据上。读的时候要看一组 marker 是否同向,而不是只挑某个显眼基因;如果证据只停留在 score 层面,结论也要保留探索性。

图 7. Alpha program 在 UMAP 上的连续分布;不据此计算 alpha 细胞比例。
多基因 score 比单个 INS 或 GCG 更稳健,但它仍是连续表达指标,不是细胞身份分类器。要讨论 alpha/beta 精确身份、功能或糖尿病相关状态,需要作者标签或可靠参考映射、置信度和 donor 层设计。

图 8. Ductal program 的连续分布,不生成导管细胞计数。
这张图把观察落到基因证据上。读的时候要看一组 marker 是否同向,而不是只挑某个显眼基因;如果证据只停留在 score 层面,结论也要保留探索性。

图 9. Acinar program 的连续分布,不生成腺泡细胞计数。
marker 和 score 要成组解释,但在当前输入中只能支持 program 层线索。没有独立标签来源时,不把它们写成最终细胞身份或功能判断。
ductal 和 acinar 的 score 也需要先确认。很多胰腺数据如果只关注胰岛内分泌细胞,会把外分泌和导管相关细胞当作背景;但在真实公开数据里,这些群体经常存在,而且会影响总体表达、组成比例和下游解释。
与源论文结论的对照
本文结果和原文一致的地方主要有三点。
第一,公开矩阵能够分解出多种胰腺相关表达程序和无监督结构;这些方向与原文胰腺图谱背景相容,但本文不声称恢复了逐细胞作者 taxonomy。
第二,经典 marker 与连续 program 支持主要胰腺表达方向。INS/IAPP、GCG、SST、PPY、KRT19/KRT7/SOX9、PRSS1/CPA1/REG1A 等基因用于解释表达结构,但不再被转换成未经校准的身份计数。
第三,供体和技术结构需要被纳入解释。原文数据设计中有 4 位供体和多个 library,本文也保留了这些 metadata。供体组成差异提醒我们,公开数据二次分析不能只在总体层面平均。
同时,本文也保留几个边界:
- 本文没有从原始 FASTQ 重跑比对和 UMI 计数;使用 GEO 提供的处理后表达矩阵。
- 当前输入没有作者逐细胞注释;本文不再基于 cluster 最高 score 生成复核注释。
- 本文没有完整重做原文关于转录因子、REG3A 阳性 acinar 亚群、细胞表面 marker 富集等全部分析。
- 细胞比例不应被解释为人体胰腺真实组成比例,因为它受供体、分选、QC 和分析策略影响。
这些边界对文献复现很关键。复现不是把所有原文结论照抄一遍;重点说明:哪些结果可以从公开矩阵稳定重建,哪些结论需要更多原始数据、实验细节或原文分析模块支持。
**结论:**GSE85241 可以作为经典人胰腺 processed matrix 的 QC、donor/library 重建和连续 program 复核案例。当前证据支持多种胰腺相关表达方向,不支持新推导细胞身份的精确计数、比例或功能结论。
人胰腺公开数据复现里的关键检查点
Muraro 这类器官图谱复现,容易被写成“alpha、beta 细胞分出来了”。但对要使用这组数据的人来说,这里还需要说明的是每一步是否可核查。
| 检查点 | 为什么重要 | 本文中的处理 |
|---|---|---|
| 矩阵格式 | 旧 GEO 文件名和真实分隔符可能不一致 | 明确说明 .csv.gz 实际按 tab 分隔读取 |
| 基因名整理 | GENE__chr 格式会影响 marker 匹配 | 去掉染色体后缀,保留标准基因符号 |
| 供体和 library | 细胞列名中包含 donor/library/well 信息 | 从列名重建逐细胞 metadata |
| 低质量孔过滤 | 全部 3072 列直接进入分析会引入噪音 | 基于检测基因数做基础 QC,保留 2194 个细胞 |
| marker 证据 | 胰腺细胞身份依赖经典内分泌/外分泌 marker | 用 DotPlot 和 signature score 检查 alpha/beta/delta/PP/ductal/acinar |
| 供体组成 | 细胞比例可能受供体和 library 影响 | 展示 donor UMAP 和 donor composition |
这些检查点也是旧单细胞数据再整理的主要工作。很多公开矩阵不是“下载即用”的现代对象;需要先把基因名、列名、metadata 和 QC 标准重新整理。这个过程做好了,后面的 UMAP 和 marker 图才有解释基础。
这篇复现能作为哪些项目的模板?
- 旧 GEO 矩阵解析:处理文件名、分隔符、行名格式和列名 metadata 不标准的经典单细胞数据。
- 器官图谱复现:从公开矩阵重建主要细胞类型、供体结构和 marker 验证。
- h5ad/Seurat 再整理:将已有对象重新做 QC、注释检查、结果图和中文解释。
- marker 证据链:用 dotplot 和 signature score 解释细胞身份,而不只展示 UMAP。
- 供体差异检查:把细胞类型组成放回 donor/library 层面,减少过度解释。
- 复现边界说明:明确公开矩阵能支持什么,不能支持什么,避免把二次分析写成过度结论。
后续可以继续加深的方向
| 增强方向 | 价值 |
|---|---|
| 使用可追溯作者注释交叉验证 | 比较作者标签、Leiden 和连续 program 的一致性,并保留未匹配状态 |
| 内分泌细胞子集内重聚类 | 进一步观察 alpha/beta/delta/PP 细胞内部状态 |
| REG3A 阳性 acinar 亚群复核 | 对照原文提到的 acinar subpopulation |
| 供体层面 signature 汇总 | 判断某些细胞状态是否受供体结构影响 |
| 与原文结果图逐项对照 | 把公开矩阵复现图和原文关键结论并列整理成完整报告 |
本篇完成的是“从 GEO 主表达矩阵到人胰腺细胞图谱”的主体复现。对于很多经典单细胞论文和旧公共数据来说,更有用的第一步往往就是这样:把数据来源、矩阵结构、QC 逻辑、细胞注释证据和可解释边界讲清楚。
深度解读:这篇复现应该怎么读?
Muraro 这篇人胰腺复现重点在旧 GEO 主矩阵的解析和证据边界。本文处理 tab 分隔、GENE__chr 行名、donor/library/well 列名和低检测基因细胞过滤;结果只保留连续 program、Leiden、donor/library 和留出 marker。
1. 这篇复现回答了什么?
它回答的是“GSE85241 主表达矩阵能否通过 QC、无监督聚类、连续 program 和留出 marker 恢复可解释的胰腺表达结构”。本文保留 2,194 个 QC 后细胞,并在 donor 层汇总 program;不再补造逐细胞类型。
这里需要区分 score 构建基因和留出 marker。INS/IAPP、GCG、SST、PPY、KRT19/KRT7、PRSS1/CPA1 等用于连续 program;DLK1/PCSK2/CPE、CRYBA2/LOXL4/IRX2/GC、KRT8/KRT18、REG3A/SPINK1/PNLIPRP1、PLVAP/EMCN 等留出基因按 Leiden 汇总。两套集合没有重叠。
2. raw / processed matrix 的边界在哪里?
本文使用 GEO 主表达矩阵,没有从 FASTQ 重新比对,也没有可直接使用的逐细胞作者标签。这个矩阵可以支持 donor/library 结构、Leiden、连续 program 和留出 marker;不能支持精确身份比例、REG3A 亚群定量或原文全部注释模块。
因此本文的结论层级是“公开矩阵层面的连续 program 复核”。早期页面发布的 alpha/beta 精确数量来自无 margin 的最高分规则,相关数量已撤回;当前结果不外推人体胰腺生理比例。
3. 主要图应该怎么读?
图 1 看 beta/alpha/ductal/acinar 连续 program;图 2 看 donor UMAP;图 3 看 donor 层 program 中位数;图 4 看 Leiden;图 5 看留出 marker;图 6-9 展示连续 program,不生成身份计数。
这几类图要按“格式正确 -> QC 合理 -> 结构清楚 -> marker 支持 -> 供体边界”来读。旧矩阵复现里,文件解析和 metadata 重建本身就是结果可信度的一部分。
4. 哪些地方不能过度解释?
第一,不能把连续 program 写成原作者最终注释。第二,不能发布由最高分规则产生的 alpha/beta 比例,更不能写成人群生理比例。第三,单个 marker 的背景表达不足以定义新亚群。第四,任何比较都要保留 donor 层结构。
严肃的写法应该是:GSE85241 可以支持人胰腺主要细胞类型的公开矩阵复核,尤其是 alpha/beta/delta/PP、ductal 和 acinar 的 marker 证据;更细功能状态、供体层面差异和原文全部模型,需要额外注释、子集分析或原文方法支持。
5. 如果继续深入,下一步做什么?
继续深入时,第一步可以用公开整理注释表与本文 marker-based identity 做交叉验证,检查哪些 cluster 与原文/整理版标签一致。第二步在内分泌细胞子集中重聚类,分别检查 alpha、beta、delta、PP 内部状态。第三步专门对照原文提到的 REG3A 阳性 acinar 亚群。第四步按 donor 汇总 marker 和 signature,确认关键结论是否由单一供体驱动。
这篇文章对旧项目再整理的启发是:先把矩阵、基因名、列名、metadata 和 QC 讲清楚,再讨论细胞身份。这样比直接把一个 UMAP 贴出来更像的文献复现。
小结
本文从 GSE85241 主表达矩阵出发,解析 4 位供体、32 个 CEL-seq2 library 和逐细胞列名,基础 QC 后保留 2,194 个细胞和 16,279 个基因。结果只报告 Leiden、donor/library、连续胰腺 program 和留出 marker;早期页面发布的强制身份计数和供体组成比例已撤回。
这篇文章的价值不只是“画出了 alpha/beta UMAP”;展示了经典 GEO 矩阵从下载、解析、QC、metadata 重建到 marker 解释的完整过程。对于需要复现旧文献、重做 h5ad/Seurat 对象、整理公开数据结果图的项目,这种流程比单张图更有复用价值。