科学审计更正(2026-07-19):早期页面曾把最高marker分数转换成stem-like、hypoxia、mesenchymal等离散标签,并据此报告细胞计数和患者组成。这些结果已经撤回。本文现将430个原发GBM单细胞全部保持为未赋值状态。top score和top-two margin只用于程序分离诊断。另一组marker只提供同一矩阵内的一致性检查,不称为外部证据。患者是生物重复单位,公开比较采用5位患者各自的连续程序中位数。
Patel et al.的GSE57872常被用来说明胶质母细胞瘤的患者内异质性。它也很容易被简化成一张t-SNE加几个肿瘤亚型标签。430个原发单细胞确实保留了患者结构和多条肿瘤相关表达轴,但stem-like、cell-cycle、hypoxia、mesenchymal、astro-glial和oligo/proneural程序可以在同一细胞中共存。把最大分数写成互斥身份,会把连续状态压成过于整齐的组成图。
本文围绕三个层级展开:GEO矩阵是什么表达尺度;患者来源如何进入低维结构;连续程序在细胞和患者层面能支持哪些描述。临床分型、治疗反应和机制因果不在当前processed matrix的直接证据范围内。
论文、公开矩阵与分析分母
- 论文:Patel et al., Science, 2014
- 题名:Single-cell RNA-seq highlights intratumoral heterogeneity in primary glioblastoma
- DOI:10.1126/science.1254257
- PubMed:PMID 24925914
- 公开数据:NCBI GEO GSE57872
- 输入文件:
GSE57872_GBM_data_matrix.txt.gz
GEO矩阵包含5,948个基因和543个样本列,列中混有原发GBM单细胞、细胞系单细胞以及Tumor/FCS/CSC等bulk或群体样本。主分析仅使用5位患者的430个原发GBM单细胞:MGH26为118个,MGH28为94个,MGH29为75个,MGH30为73个,MGH31为70个。
这个矩阵是processed expression,含正负连续值。它不能按10x raw UMI矩阵解释,线粒体比例、UMI总量和doublet率也不能从中重新估计。本文使用表达覆盖检查、低维嵌入和程序分数,明确不声称完成FASTQ重比对或原文全部模型复算。
矩阵结构先于肿瘤标签

图1区分原发单细胞、细胞系单细胞和群体样本,并列出5位患者的单细胞数量。MGH26的细胞数接近MGH31的两倍,任何按细胞汇总的总体比例都会受到患者贡献不均影响。430个细胞是观察单位,独立肿瘤来源只有5位患者。
矩阵中的bulk或群体样本可以用于观察平均表达趋势,不能和单细胞列混在一起计算细胞组成。细胞系也有其培养背景,不适合直接补充原发患者的生物重复。
processed expression的质量检查

图2检查430个原发单细胞的平均表达和高于阈值的基因数。它说明这些列可进入联合降维,不提供reads层测序质量。processed matrix的QC重点是样本列是否异常、表达覆盖是否偏离、矩阵尺度是否被正确识别。
若把这张图写成UMI或线粒体QC,会把数据层级说错。经典公开数据常以作者处理后的矩阵发布,复现报告需要把“可重新计算的步骤”和“已经固化在输入中的步骤”分开。
患者来源是低维结构的第一解释层

图3显示不同患者在t-SNE上形成相对集中的区域,同时保留部分混合。患者差异可能综合了肿瘤遗传背景、取样位置、局部环境和技术处理。它不能被简单当作普通批次抹去,也不能自动解释成某条肿瘤进化路径。
后续程序分析必须保留patient字段。单细胞分布可以说明患者内部有多种表达状态,患者间差异则要在5个患者摘要上表达。430个细胞不等于430个独立肿瘤。
图1:最高程序分数不生成身份

图1左侧是每个细胞最高程序分数的分布,右侧比较最高分与top-two差值。分数和margin都由当前5,948基因子集内部标准化得到。它们能提示程序信号强弱和候选程序是否接近,不能提供跨数据集可校准的身份概率。
GBM细胞可同时具有缺氧、间质样、细胞周期或胶质相关表达。top-two差值较大,只说明当前面板中某一程序更突出;它不证明其他程序缺席。当前430个细胞全部保留为探索性记录,离散身份统一留空。
图2:低维图只显示最强连续分数

图2用连续色阶显示每个细胞最高程序分数。图中若干局部区域分数较高,说明marker面板在这些细胞上给出更强信号;低分区域可能来自程序重叠、基因覆盖不足或当前面板不适配。颜色没有标出stem-like、mesenchymal等离散类别。
这一画法保留了肿瘤状态的连续性,也阻止读者从颜色面积继续推导患者组成。若需要判断哪条程序在某个区域升高,应直接查看各程序分数或患者级摘要,不能从“最高分强弱”反推身份。
图3:另一组marker提供一致性,不提供外部验证

图3显示两组marker程序分数之间的Spearman相关。astro-glial约0.65,mesenchymal约0.55,hypoxia约0.49,oligo/proneural约0.32;cell-cycle约0.24,stem-like约0.16。immune/microglia在当前矩阵中没有足够可用值,不能据此恢复稳定程序。
这些相关系数反映同一矩阵内两套预设marker是否同向。较高相关支持程序表达的一致性,较低相关暴露marker覆盖或生物定义薄弱。两套面板都没有脱离GSE57872,也没有引入作者标签、CNV、外部参考或组织学证据,因此文章只把它写成一致性检查。
图4:连续程序汇总到5位患者

患者热图给出可核查的描述性结构。MGH29的mesenchymal和astro-glial中位分数较高;MGH31的hypoxia更高;MGH26的oligo/proneural和stem-like相对偏高。每个格子代表该患者细胞的中位程序分数,不是患者内部某类细胞的比例。
5位患者只能支持小样本描述。本文不做患者间细胞级显著性,也不把某位患者的程序偏高解释成预后、分子分型或治疗敏感性。若要比较患者群体,需要更多独立肿瘤及临床协变量。
bulk平均值与单细胞状态

图5保留单细胞与群体样本的程序分数对照。群体表达可显示一个样本的总体倾向,单细胞则揭示同一肿瘤内多个程序同时存在。这里讨论的是平均化造成的信息损失,不是把群体样本当成额外患者加入统计。
bulk和单细胞结果处于不同观察尺度。群体样本的单个分数不能直接兑换成“多少细胞属于某程序”,单细胞程序分布也不能在没有细胞数校正和患者设计时外推为组织丰度。
当前证据可以支持什么
第一,GSE57872的processed matrix保留了明显的患者结构。第二,430个原发单细胞中可以观察到多条连续肿瘤相关程序。第三,程序强度在患者内部和患者之间都不均一。第四,不同程序的第二marker面板一致性差别较大,stem-like与cell-cycle的证据比astro-glial、mesenchymal更弱。
这些结果与原论文关于GBM患者内转录异质性的主线相容。当前复现没有重新建立恶性细胞判定、CNV结构、克隆关系、临床关联或功能机制。immune/microglia程序缺乏可用结果,也不能由少量相关marker替代完整微环境注释。
硬标签为什么会失真
最高分算法会给每个细胞一个名字,即使所有候选程序都很低。GBM程序可共存,强制互斥会丢掉重叠信息。随后按标签计算患者比例,又会把患者细胞数不均和程序阈值误差一起带入组成图。若再以同一marker画dotplot作为验证,证据链会形成闭环。
本文把三个问题拆开:top score和margin只诊断程序分离;分开的marker面板只检查同向程度;患者热图只汇总连续分数。这个结构不会自动生成漂亮的亚型比例,却更接近数据能够承担的解释。
与原论文的距离
原论文结合了更完整的肿瘤单细胞分析,讨论患者内异质性及相关生物学。本文使用GEO公开processed matrix,适合复核表达结构和程序方向。它没有从FASTQ开始,也没有复算所有统计模型。
若要进一步恢复现代GBM状态框架,应补充恶性细胞识别、CNV推断、外部参考映射和更完整的基因集。若要讨论治疗反应或预后,还需要临床终点和独立患者队列。当前程序分数是数据集内部描述量,不是临床概率。
项目中可直接复用的检查顺序
处理肿瘤单细胞公开矩阵时,可以按以下顺序推进:确认矩阵层;解析患者和样本来源;画patient-colored embedding;计算连续程序;检查第二marker面板的一致性;按患者汇总;完成这些检查后再判断是否具备离散注释条件。任何一步缺少作者标签或外部参考,都要保留未分配状态。
这个顺序能避免把患者差异、程序共存和细胞数不均混成一个组成结论。对于旧GEO矩阵,它也能快速判断哪些结果可以重新利用,哪些分析必须回到更完整对象。
结论审计
| 判断 | 当前证据 | 写作边界 |
|---|---|---|
| 5位患者存在明显表达结构差异 | patient-colored t-SNE | 支持描述 |
| 多条GBM相关连续程序可读 | 连续score与marker一致性 | 支持描述 |
| 某细胞属于稳定肿瘤亚型 | 无校准阈值或外部标签 | 不发布 |
| 患者程序差异具有总体显著性 | 仅5位患者 | 不支持 |
| 程序比例预测治疗或预后 | 缺少临床终点 | 不支持 |
小结
GSE57872仍然清楚展示了GBM患者内和患者间的转录异质性。本文不把最高程序分数转换成互斥身份,430个原发单细胞全部保留为探索性、未分配记录。分开的marker面板说明astro-glial、mesenchymal和hypoxia等方向具有不同程度的一致性;患者级热图显示MGH26至MGH31各有程序偏向,但样本量不足以支持总体临床推断。
公开矩阵能够可靠承担的是患者结构、连续程序和证据边界。亚型比例、治疗反应和机制解释需要新的数据层与独立证据。