跳到正文
bioinfo.zle.ee
返回

复现 Xin et al. 人胰岛 T2D 单细胞数据:从 GSE81608 到 alpha、beta、delta 和 PP 细胞图谱

发布于: · 更新于:

这篇复现整理 Xin et al. 2016 年发表于 Cell Metabolism 的人胰岛单细胞数据。文章从 GEO GSE81608 的 RPKM 矩阵和 SOFT metadata 出发,恢复 1600 个单细胞样本的 donor、T2D/non-diabetic condition 和 alpha、beta、delta、PP 细胞标签,并用 UMAP、marker dotplot、signature score 和 beta cell 条件对照解释这组数据能复现什么、不能过度声称什么。

为什么选 Xin et al. 人胰岛 T2D 数据?

胰岛单细胞数据非常适合做疾病相关复现,因为细胞身份和疾病问题都很明确。alpha cell 主要看 GCG,beta cell 主要看 INS/IAPP,delta cell 看 SST,PP cell 看 PPY。同时,2 型糖尿病(T2D)的关键问题之一就是胰岛细胞功能和状态改变,尤其是 beta cell 的胰岛素分泌和应激状态。

Xin et al. 这篇文章的原始问题是:在人类 non-diabetic 和 T2D organ donor 中,单细胞 RNA-seq 是否能识别胰岛细胞类型特异基因,以及 T2D 中扰动的基因。对公开复现来说,我们先做更基础的一层:从 GEO 公开矩阵和 metadata 重新恢复 alpha、beta、delta、PP 细胞图谱,再看 condition 和 beta cell signature 是否可以被整理成可解释结果。

这篇数据对应的真实研究痛点

T2D 胰岛单细胞数据很容易被写得过满:看到 beta cell、看到 T2D/non-diabetic 分组、看到胰岛素相关 marker,就直接讨论疾病机制。但公开 RPKM 矩阵、Entrez ID 映射、donor 数量和细胞类型组成都会限制结论强度。需要先解决的问题是:alpha、beta、delta、PP 的身份是否可靠;T2D 与 non-diabetic 的差异是细胞状态线索、细胞组成差异,还是 donor/样本结构影响;beta cell signature 是否足以支持状态解释。

本文的复现重点就是把这些层级分开。先用成组 marker 和 signature 证明胰岛主要细胞身份,再把 T2D 相关结果限定在公开矩阵和 metadata 支持的范围内。这样既能展示疾病单细胞复现的价值,也避免把早期数据中的细胞级观察写成患者级或机制级结论。

论文和数据来源

复现边界说明 源论文报告1,492个高质量single-hormone-expressing islet cells;GEO补充RPKM矩阵包含1,600个样本;SOFT metadata可恢复18个donor。本文复现使用公开矩阵中的1,600个样本,不把它们与源论文1,492个作者QC细胞混写,也不声称完整复现源论文的过滤、DESeq2差异基因、WGCNA、IPA通路或mouse-human对照分析。

数据结构:RPKM 矩阵、Entrez ID 和 SOFT metadata

这个数据的一个关键细节是,补充矩阵中的 gene.id 不是 gene symbol;它是 Entrez Gene ID。例如 1 对应 A1BG2 对应 A2M。因此复现时不能直接用 INS/GCG/SST/PPY 去找 marker,必须先把 Entrez ID 映射到 gene symbol。本文使用 NCBI Homo sapiens gene_info 进行映射,然后对 RPKM 做 log1p 转换,再进入降维和 marker 分析。

SOFT metadata 提供了每个样本的 donor id、condition、age、ethnicity、gender 和 cell subtype。最终整理得到:

Xin human islet dataset overview

图 1. Xin/GSE81608数据集概览。公开矩阵1,600个样本、源论文1,492个作者QC细胞和18个donor属于不同分母;右下角展示当前公开矩阵两组中的细胞类型组成。

组成图必须和采样设计一起读。它能说明当前公开矩阵里哪些群体被观察到、样本或组织标签是否均衡,但不能直接外推成真实组织比例或临床差异。

分析流程

UMAP:alpha、beta、delta 和 PP 结构清晰

Xin human islet UMAP annotations

图 2. UMAP 总览。按 cell subtype 标记时,alpha、beta、delta 和 PP 四类细胞形成清楚结构;condition 和 donor 视角用于检查疾病分组和个体来源。

这里最重要的是,原始 cell subtype 不是随机散在 UMAP 上;它形成了清晰区域。alpha 是最大群体,beta 位于另一大片区域,delta 和 PP 细胞虽然数量较少,但仍然形成可识别区域。condition 图显示 T2D 和 non-diabetic 都分布在主要细胞类型区域内,提示疾病状态不是简单把细胞分成两个完全独立的表达空间。

marker UMAP:胰岛激素基因提供直接证据

Xin human islet marker genes on UMAP

图 3. 胰岛经典 marker 在 UMAP 上的表达分布。INS/IAPP 支持 beta cell,GCG 支持 alpha cell,SST 支持 delta cell,PPY 支持 PP cell;HSPA5/DDIT3 用于检查应激相关信号。

胰岛数据有一个优势:关键 marker 非常直接。INSIAPP 点亮 beta cell 区域,GCG 点亮 alpha cell,SST 点亮 delta cell,PPY 点亮 PP cell。这个结果说明 Entrez ID 映射、矩阵转置和 metadata 对齐都没有出现明显错位。

DotPlot:系统复核 cell subtype

Xin human islet marker dotplot

图 4. 按原始 cell subtype 检查 marker。beta、alpha、delta 和 PP 均有相应 marker 组合支持,同时也展示 ER stress、ductal/acinar 等检查基因。

DotPlot 中,beta cell 的 INS/IAPP/PCSK1/PCSK2/MAFA/PDX1 更高,alpha cell 的 GCG/TTR/ARX/IRX2 更高,delta cell 的 SST/HHEX 更高,PP cell 的 PPY/PYY 更高。这个结果与源论文使用激素表达定义细胞类型的思路一致。

signature score:把 marker 组合转成可比较指标

Xin human islet signature scores on UMAP

图 5. beta、alpha、delta、PP、ductal、acinar、ER stress 和 cell cycle signature 在 UMAP 上的分布。各 identity score 与对应细胞区域基本一致。

marker 和 score 要成组解释。单个基因高表达只能提供线索;只有 dotplot、heatmap、signature、metadata 和组成结果互相支持,才适合写成细胞身份或状态判断。

Xin human islet signature scores by subtype

图 6. 按 cell subtype 比较 signature score。beta identity 在 beta 细胞中最高,alpha identity 在 alpha 中最高,delta identity 在 delta 中最高,PP identity 在 PP 中最高。

从 score 均值看,beta cell 的 beta identity score 约 2.66,alpha cell 的 alpha identity score 约 4.33-4.46,delta cell 的 delta identity score 约 4.72-5.28,PP cell 的 PP identity score 约 4.80-4.87。这个一一对应关系,是复现可信度的重要证据。

T2D 与 non-diabetic:先看结构,再看 beta cell 状态

源论文的重点之一是寻找 T2D 中扰动的基因。本文不完整重跑 DESeq2;做一个更适合公开复现的初步检查:在 beta cell 中比较 beta identity 和 ER stress 相关 score。

Xin beta cell signatures by condition

图 7. beta cell 中按 condition 比较 beta identity 和 ER stress score。这是一个描述性复现图,不等于源论文的严格差异表达分析。

从本次 score 看,T2D beta cell 和 non-diabetic beta cell 的 beta identity score 均值非常接近;ER stress score 在 T2D beta cell 中更低一些。这个现象不能被直接写成机制结论,因为这里只是 cell-level score 描述,没有控制 donor、gender、ethnicity,也没有按源论文方法做严格差异表达。更合理的解读是:公开矩阵可以支持 T2D/non-diabetic 的分层检查,但疾病基因结论需要回到源论文级别的统计设计。

Xin/GSE81608追溯清单分别登记原始输入、可执行分析脚本、结果表和7张公开图,图内标题也明确标识Xin。该清单只用于保证每张图能回到正确论文、数据集和生成步骤;公开结论仍受上述donor和统计单位边界约束。

和源论文结论如何对照?

源论文报告了 1,492 个高质量 human alpha、beta、delta 和 PP cell,并识别细胞类型特异基因和 T2D 扰动基因。本文复现到的层级与源论文一致:

  1. alpha、beta、delta 和 PP 四类胰岛细胞可以从公开数据中重新恢复。
  2. GCG/INS/SST/PPY 等激素 marker 与 cell subtype 对应清楚。
  3. T2D 与 non-diabetic metadata 可用于分层展示。
  4. donor 信息必须保留,否则容易把个体差异误读为疾病差异。

本文没有覆盖的部分也要明确:

  1. 没有重做源论文的全部高质量细胞过滤。
  2. 没有重跑 DESeq2 寻找 245 个 T2D 扰动基因。
  3. 没有控制 gender、ethnicity 等协变量。
  4. 没有复现 mouse-human alpha/beta 对照。
  5. 没有把 cell-level boxplot 当作患者层面统计结论。

复现这类早期 C1/RPKM 单细胞数据时容易出错的地方

第一,RPKM 矩阵不是 10X raw count,不能直接照搬 10X 工作流。第二,gene id 需要映射成 gene symbol,否则 marker 检查会失败。第三,GEO 矩阵样本数和源论文最终高质量细胞数可能不完全一致,必须写清楚。第四,T2D/non-diabetic 比较要保留 donor 视角。第五,低维图和 score 只能做描述性复现,不能替代源论文的差异表达模型。

关键结论 GSE81608 可以稳定复现人胰岛 alpha、beta、delta 和 PP 四类细胞结构。通过 Entrez ID 映射、SOFT metadata 解析、UMAP、marker dotplot 和 signature score,可以把 Xin et al. 的公开 RPKM 矩阵整理成一篇可读的 T2D 胰岛单细胞复现记录;但 T2D 扰动基因结论需要更严格的样本层面统计。

这篇复现能作为哪些项目模板?

深度解读:这篇复现应该怎么读?

Xin 人胰岛 T2D 这篇复现要分两层读:第一层是 alpha、beta、delta、PP 四类胰岛细胞身份能否从 RPKM 矩阵和 SOFT metadata 中恢复;第二层才是 T2D 与 non-diabetic 的描述性分层。本文有意没有把第二层写成疾病机制结论,因为这里没有重跑源论文 DESeq2、WGCNA、IPA 或 mouse-human 对照。

1. 这篇复现回答了什么?

它回答的是“GSE81608 的 human islet RPKM matrix 和 SOFT metadata 能否恢复 1,600 个样本的 donor、condition 和 cell subtype,并用 marker 复核 alpha/beta/delta/PP 结构”。从本文结果看,Entrez ID 映射后,INS/IAPPGCGSSTPPY 等 marker 与原始 subtype 对应清楚,identity score 也和四类细胞匹配。

这已经足以支持一篇公开复现笔记:老 RPKM 数据仍可整理成可读胰岛图谱,并能展示 T2D/non-diabetic metadata 如何进入描述性分析。

2. raw / processed matrix 的边界在哪里?

这里的输入是 RPKM matrix,不是 raw count,也不是 10X UMI。gene id 还是 Entrez ID,需要先映射到 gene symbol 才能做 marker 检查。因此本文可以做 log1p(RPKM) 后的表达图谱、marker UMAP、dotplot 和 score;但不适合直接套 raw-count 模型,也不能把 cell-level boxplot 当作 donor-level 疾病统计。

源论文报告 1,492 个高质量 single-hormone-expressing cells,而 GEO 补充矩阵包含 1,600 个样本。这个差异也必须写清楚:本文使用公开矩阵中的 1,600 个样本做复现,不声称完全重建源论文高质量细胞过滤。

3. 关键图应该怎么读?

图 1 先看数据组成:T2D/non-diabetic、alpha/beta/delta/PP 和 donor metadata 是否完整;图 2 看 subtype、condition 和 donor 在 UMAP 上的分布;图 3 和图 4 复核激素 marker;图 5 和图 6 用 identity score 确认 subtype;图 7 只作为 beta cell 中 condition 分层的描述性结果。

图 7 尤其不能孤立解读。T2D beta cell 与 non-diabetic beta cell 的 score 差异,如果没有 donor、gender、ethnicity、cell subtype 和源论文统计模型控制,只能说是描述性观察,不能说成 T2D beta 细胞机制。

4. 哪些地方不能过度解释?

第一,不能把 RPKM 数据当 raw UMI count。第二,不能把 1,600 个 GEO 样本与源论文 1,492 个高质量细胞混写。第三,不能把 beta cell 的 cell-level score 写成患者层面的 T2D 差异。第四,不能重写源论文的 245 个 T2D 扰动基因结论,除非按源论文统计框架重新做。第五,ER stress score 的方向只能作为描述性线索,不是功能实验证据。

本文能严肃支持的是:GSE81608 可恢复人胰岛 alpha/beta/delta/PP 四类细胞结构,并能在公开 metadata 下做 T2D/non-diabetic 描述性分层。本文不能支持的是:完整疾病扰动基因、因果机制、胰岛功能改变或 mouse-human 对照结论。

5. 如果继续深入,下一步做什么?

继续深入时,应回到 donor-level 设计。beta cell 子集内比较 T2D 与 non-diabetic 时,需要按 donor 聚合或建模,并控制可用协变量;然后再复现源论文的差异表达、WGCNA 或通路分析。也可以把 Xin 与 Baron、Muraro 等胰腺/胰岛数据对照,检查 INS/GCG/SST/PPY marker 和 identity score 是否跨数据集稳定。

这篇文章最重要的经验是:疾病相关单细胞复现不能急着下机制结论。先把矩阵层级、gene id、metadata、细胞身份和 donor/condition 层级讲清楚,再决定是否进入差异分析。

小结

这次复现从 Xin et al. 的 GSE81608 出发,整理了 1,600 个 human islet RPKM 样本和 33,889 个映射基因。结果显示,alpha、beta、delta 和 PP 四类细胞在表达空间、marker UMAP、dotplot 和 signature score 中都有清楚证据。T2D 与 non-diabetic metadata 可以支持描述性分层结果图,但疾病扰动基因仍需要按源论文的统计框架进一步分析。


分享这篇文章:
通过邮件分享

上一篇
复现 Darmanis et al. 人脑单细胞图谱:从 GSE67835 到神经元、胶质和血管细胞谱系
下一篇
复现 Aizarani et al. 人肝脏单细胞图谱:从 GSE124395 到 hepatocyte、endothelial 和免疫微环境