首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >方法分享--ResolVI:解决空间转录组学中的噪声与偏差

方法分享--ResolVI:解决空间转录组学中的噪声与偏差

原创
作者头像
追风少年i
发布于 2026-10-01 07:57:36
发布于 2026-10-01 07:57:36
210
举报

作者,Evil Genius

祝大家国庆快乐。

今日我们分享文献

摘要

在完整组织切片中、以高空间分辨率、高通量估计RNA表达的技术(空间转录组学)为细胞如何通讯以及组织如何运作提供了新见解。分析亚细胞分辨率空间转录组技术生成的数据的一个基本步骤是定量,即分割平面内区域(每个区域近似一个细胞),然后汇总每个区域内的分子以估计细胞表达谱。尽管该领域有许多进展,一个持续存在的问题是分子到细胞的错误分配,这限制了当前许多应用只能停留在预先定义的细胞亚群水平,并使新细胞状态的发现复杂化。本研究开发了resolVI,一个在任何分割算法下游运行的模型,生成概率表示,校正分子错误分配以及批次效应和其他干扰因素。研究证明resolVI提高了区分细胞状态、识别空间中细微表达变化以及跨数据集整合分析的能力。ResolVI作为scvi-tools中的开源软件提供。


引言

空间转录组学的机遇

  • 空间转录组学(ST)为研究组织结构和功能提供了强大工具。
  • 一类快速发展的ST技术以低于细胞大小的分辨率运行,从而允许表示组成组织的单个细胞及其RNA表达谱。
  • 这些表示为研究细胞如何在其组织背景中运作以及通过细胞间相互作用塑造组织功能提供了新机会。

高分辨率ST技术的分类

  • 高分辨率ST技术大致分为两类:一类依赖于对结合到亚微米空间条形码斑点的RNA进行RNA测序(RNA-seq),另一类依赖于对单独标记的RNA分子进行成像。
  • 为了从这些测量中获得组织的细胞分辨率视图,必须进行细胞分割。即,将组织分成小区域,每个区域代表一个细胞,并计数每个区域内的分子以估计每个细胞中每个基因的表达。

分割算法的挑战

  • 用于ST分割的早期算法(包括来自显微镜的遗留方法)依赖于描绘单个细胞核或细胞膜的组织图像。
  • 尽管该领域最近有进展,正确界定细胞边界仍然困难,主要注意事项包括高细胞密度、细胞染色信号弱和不规则细胞形状。
  • 结果,推断的片段可能无法正确区分细胞的数量或形状。这导致随后的表达定量错误,产生错误的表达估计(例如,暗示来自不同细胞谱系的标记基因的共表达)。

扩散现象

  • 最近旨在解决这一问题的方法包括观察到的RNA分子作为额外信息源来帮助指导分割。
  • 尽管这种分割和定量的耦合在很大程度上提高了准确性,但上述问题仍然存在(如本文所证明)。
  • 事实上,除了分割困难外,还有一些直接与定量步骤相关的注意事项,一些分子出现在错误细胞的边界内。这种所谓的扩散现象可能由组织处理问题导致的RNA分子泄漏或细胞在第三(垂直于profiled平面)维度的重叠引起,该维度通常以低分辨率和受限(通常几十微米)宽度进行profiling。

ResolVI的开发

  • 为了解决这些挑战,研究团队开发了resolVI,一个用于表示ST数据的概率框架,同时考虑分割和定量中的错误。
  • ResolVI不是从头解决这个问题,而是在任何分割和定量算法下游运行,将细胞中基因表达的初始估计作为输入。
  • 其基础是认识到信号扩散是一种应该被表征然后控制的伪影。
  • 依赖于自编码变分贝叶斯,resolVI提供伪影校正的和概率的细胞低维表示及其基因表达谱估计。
  • 通过一系列基于图像和测序技术的测试案例,证明resolVI大幅提高了识别细胞群体的能力。
  • 此外,证明resolVI能够消除错误的共表达模式,同时保留反映细微细胞群体的意外共表达模式。
  • 概率模型使差异表达和细胞共定位的稳健假设检验成为可能。
  • ResolVI作为scvi-tools下的开源项目提供。

结果部分 1:ResolVI概述

输入与输出

  • ResolVI的输入是细胞中基因表达矩阵、它们各自的空间位置和各自的组织切片(如果有多个组织切片)。
  • 这些矩阵由任何定量算法从原始ST数据(斑点的RNA-seq或单个分子的位置)生成。
  • ResolVI的输出是每个细胞状态的伪影校正的概率低维表示,以及其表达谱的估计,校正了伪影。

模型架构

  • 为实现这一点,resolVI使用变分自编码器(VAE)推断的潜变量模型。
  • 模型将观察到的计数表示为三个组分的总和:相应细胞中的真实表达、来自邻近细胞的表达和由于非特异性背景(每个组织切片恒定)的表达。
  • 细胞中的表达(前两个组分)使用负二项分布建模。对于第三个组分(背景),假设无过度离散并使用泊松分布建模。
  • 每个细胞中的计数从反映其细胞状态的低维潜在表示生成。
  • 对细胞状态的不确定性使用高斯混合分布表示。与VAEs中使用的标准单峰方法不同,这种选择有助于更好地区分细胞类型,并为用户提供在训练期间包括预定细胞类型标签的选项。

模型估计

  • 模型通过优化证据下界(ELBO)估计,由三个神经网络组成:
    • 表达编码器:从观察到的计数估计细胞状态。
    • 表达解码器:给定细胞状态生成真实表达。
    • 扩散编码器:为每个细胞估计三个组分(真实表达、邻居和背景)的权重。
  • 解码器网络接受每个细胞的批次ID作为输入,而编码器默认不接受,有助于减轻批次效应。
  • ResolVI能够区分真实和错误计数的直觉在于其隐含期望数据可以用低维编码描述。
  • 由于定量错误,观察到的表达谱可能比真实表达谱更复杂。因此,最小化ELBO损失鼓励将"不相关"分子分配给背景组分或邻近细胞。

计算性能

  • ResolVI的实现设计使用图形处理单元(GPUs)加速训练。
  • 所有实验在配备Nvidia 3090 GPU和128 GB内存的工作站上进行。
  • 最大的测试案例包括来自52个切片的140万个细胞,训练时间不到6小时。
  • 相比之下,分割单个中等规模实验的切片需要从使用ProSeg的数小时到使用Baysor的数天。因此,将resolVI纳入工作流程仅增加很小的计算开销。

结果部分 2:ResolVI提高小鼠脑数据中的细胞类型分辨率并校正虚假共表达模式

小鼠脑数据

  • 使用荧光-based 10x Xenium技术profiled的正常小鼠脑单切片。
  • 该数据集包含248个基因面板,已被原作者分割为13万个细胞。
  • 分割和定量程序基于细胞核分割和随后的扩张;这将组织分成围绕每个细胞核的凸多边形。计数每个多边形内的分子以估计各自的表达水平。
  • 由于数据没有细胞类型标签,应用了依赖于细胞类型标记物手动curation和标签转移的注释策略。

无监督和监督模式

  • 应用resolVI于观察到的表达计数,使用两种模式:
    • 无监督模式:仅使用基因表达数据和细胞位置。
    • 监督模式:通过将高斯混合先验的模式与不同细胞类型连接,并添加一个细胞类型分类器(以潜在空间坐标为特征预测细胞类型),考虑细胞类型标签。

细胞类型区分

  • 无监督resolVI模型推断的潜在表示可视化表明其很好地捕获了细胞类型间的区分,特别是与观察到的表达计数的PCA分析相比。
  • 使用scib-metric生物保守性度量量化这一点。
  • scib-metrics还提供了评估批次效应校正程度的方法。由于在此情况下不适用(数据由单个切片组成),将细胞分为resolVI估计的低和高错误表达率。
  • 当分配给扩散或背景组分的分子比例(即α1+α2)大于20%时,定义细胞为高错误率。
  • 期望良好的整合方法将相同类型的细胞拉在一起,尽管错误分子分配率(作为数据质量的代理)存在差异。
  • 发现添加监督提高了resolVI整合低质量和高品质分割的能力。
  • 此外,resolVI无论有无监督,在生物保守性和批次校正方面均优于scANVI(后者也使用回归、scVI和PCA)。

扩散率估计

  • ResolVI估计每个细胞的扩散率,即(所有基因中)来自邻近细胞的计数比例。
  • 考虑其空间分布,发现高细胞密度区域(特别是皮层和丘脑)有高扩散率,可能是因为细胞密度使这些区域更难分割。

预测基因表达分析

  • 关注小胶质细胞,因为它们在resolVI校正前形成几个簇。
  • 这些细胞表达Trem2,支持其标记为小胶质细胞。
  • 然而,在下丘脑(高预测扩散区域),这些细胞也对Slc17a6呈阳性,这是兴奋性神经元的标记物。
  • 相比之下,运行resolVI后,小胶质细胞中Slc17a6的假阳性表达大幅减少,而这些细胞仍被预测表达Trem2。
  • 这突出resolVI可以减少虚假表达模式(可能由分割过程中细胞边界描绘错误引起),同时保留正确的表达模式。

广泛量化

  • 使用来自小鼠脑的单细胞RNA-seq数据集识别对不同细胞类型特异性的基因,因此不期望由同一细胞表达。
  • 评估每对细胞类型的错误双阳性程度,使用各自细胞类型标记基因的归一化总和的余弦相似性。
  • 发现resolVI生成的校正数据包含比原始计数显著更少的错误双阳性。
  • 使用基因对水平统计确认这些发现,发现resolVI检测为高质量的细胞显示相似的共表达模式。
  • 重要的是,resolVI不强迫数据符合细胞类型及其标记物的先入之见。
  • 例如,虽然许多错误共表达模式被移除,resolVI仍然预测内皮标记物和Lyz2的共表达,后者通常是髓系细胞的标记物。内皮细胞确实可以表达Lyz2,这在各自的单细胞RNA-seq数据集中不明显。这突出resolVI可以识别和保留意外的共表达模式,甚至那些被单细胞RNA-seq遗漏的模式。

另一验证

  • 探索每个细胞推断的虚假信号程度(即α1+α2)与同一细胞类型标记物共表达水平(真阳性对)或不同细胞类型标记物共表达水平(假阳性对)之间的关系。
  • 总体而言,考虑预期共表达的基因对,发现原始和校正计数之间的双阳性率相等,并且与估计的虚假信号率无相关性。
  • 相比之下,对于不应共表达的基因对,应用resolVI后发现共表达明显减少。
  • 最后,发现resolVI对虚假信号程度的估计(在没有细胞类型标记物知识的情况下计算)明显随着假双阳性数量的增加而增加(基于细胞类型标记物知识)。

结果部分 3:在不同分割场景下评估ResolVI

分割算法的影响

  • 分割算法的选择可以显著影响分子到细胞的错误分配程度。
  • 研究分割算法选择对resolVI下游分析质量的影响。

Baysor和ProSeg分割

  • 从图2的脑切片开始,使用Baysor和ProSeg添加了三个分割,两者都使用基因表达信息更好地描绘细胞间边界,以及使用10x分割管道无额外扩张的细胞核分割。
  • 将图2的细胞类型标签转移到每种分割生成的细胞以注释细胞,然后使用预期或不预期由同一细胞类型表达的基因对列表量化错误分配程度。
  • 发现分割算法的选择有显著影响,表达感知算法产生更低的错误双阳性率。然而,这种明显的错误分配仍然存在。
  • 将resolVI下游应用于每种分割,发现它明显减少两种情况下剩余的错误的双阳性数量。
  • 最近提出了其他算法用于校正基于图像的ST。Ovrlpy校正由于3D中重叠细胞导致的分子到细胞的错误分配,并在将分子分配给细胞之前移除这些分子,而ProSeg在学习校正的基因表达模式的同时执行分割。
  • 发现两种算法都未能移除大多数错误信号,而resolVI减少错误信号而不减少在scRNA-seq数据中共表达的分子共表达。

癌症活检数据集

  • 添加第二个更复杂的用例,聚焦于癌症活检。
  • 使用来自两名患者的两个肝癌活检数据集,使用Vizgen MERSCOPE平台profiled。
  • 该数据集包含约150万个细胞和550个基因面板。
  • 考虑六种分割算法作为处理这些数据的替代方案。四种方法不使用基因表达数据,包括Vizgen MERSCOPE的原始分割和在Vizgen后处理工具中实现的三种Cellpose设置,使用单层或三层z层的细胞分割,以及三层z层的细胞核分割。
  • 作为另外两种方法,使用表达感知的Baysor和ProSeg。
  • 发现使用这两种表达感知分割算法时分子到细胞的分配更高,Baysor膨胀了分割细胞的数量。
  • 由于该数据集未提供细胞类型标签,手动注释ProSeg分割细胞使用标记基因,然后将这些标签转移到所有其他分割。

整合和细胞类型区分

  • 无论分割算法如何,发现当比较resolVI的潜在空间与PCA或Harmony计算的嵌入时,两个组织切片之间的整合和细胞类型间的区分明显改善。
  • 这在考虑密切相关的细胞类型(如B和T淋巴细胞)之间的区分时尤其突出。
  • 此外,发现两种表达感知分割都改善细胞类型间的区分,无论是在应用resolVI之前还是之后,表明将充分的分割与resolVI结合提供了良好策略。

双阳性率估计

  • 使用来自健康肝脏的单核测序数据集作为参考,估计该数据集每个定量中的真和错误双阳性率。
  • 在添加resolVI之前,发现不同分割产生相似比例的真双阳性率,表达感知的Baysor显示最低的错误双阳性率。
  • 应用resolVI将所有情况下的双阳性率降低到可比水平。

个体基因对分析

  • 考虑Baysor和原始分割中个体基因对的双阳性率(真和错误)。
  • 在原始分割中,发现resolVI导致错误双阳性明显减少。然而,错误共表达仍然存在,例如成纤维细胞标记物与其他谱系(特别是髓系和内皮)标记物共表达。
  • 当比较观察到的表达与原始分割和Baysor分割后的估计时,发现这些共表达模式大幅减少,并在应用resolVI后变得更少。
  • 这突出resolVI的校正准确性在一定程度上取决于初始分割的质量。
  • 重要的是,并非所有根据单核参考意外的共表达模式都被resolVI消除。例如,resolVI估计VEGF(在单核数据中显示为成纤维细胞标记物)与内皮标记物共表达。VEGF是一种生长因子,在缺氧条件下特异性自分泌作用于淋巴内皮细胞。缺氧是肿瘤的常见特征,这解释了为什么在癌症中,除了成纤维细胞外,VEGF也在内皮细胞中表达。
  • 再次比较resolVI的估计与使用Ovrlpy和ProSeg校正生成的计数。ResolVI减少互斥基因对的雙阳性表达量,而两种其他方法几乎没有任何改善。
  • 结论是使用Baysor作为初始分割步骤对下游分析表现最佳,在本文其余部分提供Baysor分割的结果。

结果部分 4:ResolVI促进大型测序数据集的分析

Stereo-seq数据集

  • 基于测序的ST可能显示类似的虚假双阳性问题。由于这些测定中通常捕获大量基因,表达感知分割算法无法容易地应用(因为它们需要过多内存),分割使用更简单的方法执行。
  • 作为第三个测试案例,使用Stereo-seq2 profiled的冠状小鼠脑的基于测序数据集评估resolVI。
  • 该数据集包括超过24,000个检测基因和超过50,000个细胞。
  • 与大多数表达感知分割方法不同,resolVI可以高效应用(运行时间小于20分钟,内存使用低于30 GB),以所有基因作为输入。
  • 发现应用resolVI后错误标记基因共表达量明显减少。
  • 例如,在原始表达数据中,14.8%的对神经元细胞类型标记物Slc17a7呈阳性的细胞也对少突胶质细胞标记物Mbp呈阳性。在resolVI生成的计数中,这种模式基本消除(<0.01%的Slc17a7阳性细胞)。
  • 此外,resolVI推断的细胞嵌入和校正计数大幅提高将细胞分层为细胞类型的能力。小胶质细胞在原始数据中难以区分,而在resolVI的潜在空间中清晰区分。这在标记基因如Trem2、Csf1r、C1qa和Ctsx的表达中明显。
  • 最后,resolVI生成的计数有助于区分抑制性(Gad1和Gad2)和兴奋性神经元(Slc17a7)。

Visium HD数据集

  • 还将resolVI应用于使用10x Visium HD收集的近期数据集。该测定以2 μm的空间分辨率捕获RNA转录本。
  • 使用8 μm分箱数据而非分割细胞,如制造商推荐。这产生453,820个斑点,17,797个表达基因。
  • ResolVI在所有可用基因上训练20分钟。
  • 发现应用resolVI后错误标记基因共表达量减少。
  • 使用resolVI生成的潜在维度和PCA对该数据集进行UMAP嵌入和聚类。
  • 识别出一组表达Slc6a1和Gad1的神经元,在PCA-based UMAP嵌入后与兴奋性神经元重叠。
  • 应用resolVI后,能够区分这些神经元的多个亚群,包括皮层VIP神经元、SST抑制性神经元和NPY抑制性神经元。这些神经元表现出 distinct 的空间位置。
  • ResolVI有助于在Visium HD数据中揭示充分描述的神经元群体,并使其空间模式研究成为可能。

结果部分 5:ResolVI揭示人类肝癌中功能相关的空间域

肝癌数据集

  • 为了在实际分析场景中评估resolVI,将其应用于健康和癌性肝脏样本的比较研究,使用Nanostring CosMx2 profiled,包括1,000个基因和120万个细胞。
  • 尽管这些数据由作者使用非表达感知方法分割,选择用Baysor重新处理,因为其与resolVI的组合在之前的评估中提供了有效策略。
  • 通过转移原始数据集提供的注释(使用InSituType分配)标记新分割的细胞,如之前部分使用resolVI,并使用细胞类型监督的resolVI模型进行进一步分析。

健康肝脏分析

  • 肝细胞通常沿肝小叶表现出强区带化模式,SAA1标记门静脉周围区域,而GLUL标记中央静脉周围区域。
  • 基于这两个标记物表达水平差异的肝细胞区带化在resolVI校正和未校正数据(仅Baysor)中都清晰可见。
  • 在门静脉周围区域,进一步期望看到表达SOX4、KRT13和EPCAM标记基因的胆管细胞,这些基因通常表达水平低于GLUL和SAA1。
  • 在未校正数据中,发现这些低表达标记物也在中央静脉周围区域检测到,而运行resolVI后,它们表现出清晰的门静脉周围模式。
  • 为证实这一点,发现这三个基因在校正前在各种细胞类型中大量表达,而运行resolVI后它们的表达对胆管细胞特异性。
  • 这种校正证明了考虑背景表达的价值(图1;α2组分),因为这种错误信号不是来自空间邻近细胞的真实表达,因为这些标记物在中央静脉周围区域的任何细胞类型中都不表达。

共表达分析

  • 使用来自健康肝脏的单核测序参考,发现校正健康肝脏样本后,意外基因对(例如髓系细胞和胆管细胞的基因对)的共表达大幅减少。
  • 相比之下,考虑癌性样本时,发现髓系和胆管细胞标记物之间的共表达即使在resolVI校正后仍然存在。
  • 观察个体基因对,这种剩余信号是由于SPP1和髓系标记基因(如CD68)的共表达。
  • 进一步检查校正数据突出癌性肝脏的独特性质,其中肿瘤相关巨噬细胞表达SPP1,这是其与肿瘤细胞相互作用的关键介质。

肝癌细胞空间异质性

  • 鉴于应用resolVI后共表达模式检测改善的证据,接下来研究肝癌细胞中的空间异质性。
  • 首先应用基于自相关的热点算法使用空间坐标(评估细胞-细胞邻近性)以及resolVI校正计数来检测空间共表达基因模块。
  • 该分析揭示两个模块,由肿瘤内不同位置的癌细胞表达。
  • 为全面研究这些位置肿瘤细胞之间的差异,将lvm-DE算法(使用潜变量模型的差异表达)适配到resolVI生成模型。
  • 发现在模块2区域抗炎基因如MIF、ENO1和SPP1以及缺氧标记物如SOX4、VEGFA和VEGFB上调。这种组合突出一个缺氧区域,其中癌细胞表现出免疫抑制功能。
  • 在另一个区域,干扰素调节基因如MX1、IFI6、STAT1和OAS2上调,表明促炎功能的相反趋势。

肿瘤微环境影响

  • 为研究这些生态位对癌症微环境的影响,接下来关注健康和癌性肝脏中的巨噬细胞。
  • 这些细胞的亚聚类揭示健康肝脏中表达Kupffer细胞标记物的髓系细胞与肝癌中表达免疫抑制和促炎功能的标记物的群体之间的区分。
  • 促炎亚群表达IFI27、IFI6和CXCL9,而抗炎群体表达SPP1、ENO1和MIF。
  • 抗炎巨噬细胞还表达最高量的TGFBI,这是癌症中免疫抑制的关键细胞因子。
  • 两个巨噬细胞亚群存在于肿瘤的不同区域。抑制性群体以及中性粒细胞群体(表达S100A8和S100A9)与表达SPP1的免疫抑制肿瘤亚群共定位,而促炎巨噬细胞与促炎癌症亚群共定位。
  • 将分析扩展到T细胞,能够识别T细胞状态如Tres和CXCL13-high CD8细胞,它们在促炎区域富集,而免疫抑制区域缺乏T细胞浸润。
  • 总之,resolVI帮助揭示肝癌样本中的空间区室化,具有 distinct 的肿瘤状态、免疫微环境和浸润模式(免疫抑制区域中的中性粒细胞和促炎区域中的T细胞)。

结果部分 6:ResolVI揭示DSS结肠炎后不完全再生

DSS结肠炎数据集

  • 为了在大型研究中基准测试resolVI,使用最近关于葡聚糖硫酸钠(DSS)诱导结肠炎的研究,这是炎症性肠病的小鼠模型。
  • 作者使用MERFISH研究了急性暴露于DSS后不同时间点的小鼠,使用990个基因面板和52个样本中共140万个细胞。
  • 第3天样本指示炎症的初始迹象,而第9天样本显示最高量的组织损伤。第21天组织恢复明显,而第35天在原始论文中描述为几乎完全恢复的结肠。

无监督ResolVI模型

  • 作者已使用三个粒度级别注释了该数据集从第0天到第21天的部分,对上皮和基质群体具有特别高的粒度。
  • 为审查此注释,首先在该子集上训练无监督resolVI模型。
  • 发现resolVI推断的真计数少于20的细胞不表达大多数标记基因,并且位于意外位置。因此,从进一步分析中排除这些细胞。
  • 此外,从在无监督resolVI嵌入中邻域混合不同细胞类型的细胞中移除细胞类型标签。

半监督ResolVI模型

  • 使用每种细胞类型剩余的高置信度标记细胞,并为其他细胞不提供标签,然后训练半监督resolVI模型(即仅对某些细胞可用标签信息)。
  • 使用该模型通过resolVI的细胞类型分类器重新标记所有细胞。
  • 确认这组新标签显示与标记基因的改进匹配。
  • 为resolVI实现了类似于scArches的网络手术程序,并使用该程序将第35天样本整合到参考模型中(不影响第0-21天样本)。细胞类型标签转移使用resolVI进行。
  • 总体而言,发现每个时间点内样本的良好整合(特别是使用监督模型),而不同时间点在潜在空间中显示 distinct 分布,由于持续的结肠炎。

细胞类型频率分析

  • 根据各自的细胞类型频率表示所有时间点,发现与疾病前组织偏差最大的是DSS攻击后9天。最低偏差在恢复阶段,DSS后35天。然而,即使在这个晚期时间点,一些差异仍然存在。
  • 在上皮细胞中,观察到第3天向炎症相关上皮亚群1(IAE1)转变,第9天亚群2和3(IAE2/3),第21天修复相关上皮细胞。
  • 在第35天,发现更多goblet 2细胞但更少过渡扩增(TA)细胞。
  • 为量化这一点,执行差异细胞类型丰度测试,将Milo应用于第0天(疾病前)与第35天样本的resolVI嵌入。
  • 发现第35天干细胞、结肠细胞和TA细胞减少。此外,确认原始研究的发现,报告第35天浆细胞、成纤维细胞4和炎症相关成纤维细胞2(IAF 2)增加。

空间背景分析

  • 为研究其空间背景的变化,接下来考虑小组织区域的组成而非单个细胞。
  • 为此,用其最近30个空间邻居中预测细胞类型频率的向量表示每个细胞。
  • 这些表示在UMAP中的嵌入表明第0天和第35天之间邻域组成的显著重连,特别是围绕2型成纤维细胞,在原始研究中被解释为隐窝尖端成纤维细胞。
  • 具体而言,发现第35天2型成纤维细胞与TA细胞、结肠细胞和goblet细胞共定位减少,使用resolVI内的差异共定位测试。
  • 相比之下,发现2型成纤维细胞与基质细胞(如IAF 3、Fibro 6和2以及不同巨噬细胞)的共定位增加。
  • 考虑Fibro 2的空间组织,发现这些细胞在第0天散布在结肠隐窝之间,到达每个隐窝的顶部。相比之下,在第35天,观察到Fibro 2细胞在黏膜下层的密集聚集体。
  • 为研究基因表达变化,首先识别与结肠细胞共定位的Fibro 2细胞的标记物,通过计算与干细胞共定位和与结肠细胞共定位(隐窝尖端)的那些细胞中的差异表达基因。
  • 发现几个Bmp基因表达增加,这些基因对结肠细胞沿隐窝轴的正常发育至关重要。
  • 与失去与结肠细胞共定位的Fibro 2细胞一致,还发现第35天Fibro 2细胞中Bmp基因表达减少。证实上皮细胞成熟中断,虽然在第0天沿隐窝轴发现干细胞向结肠细胞转变的 distinct 梯度,在第35天观察到上皮层组织的整体中断。
  • 为研究这些中断,在第35天高结肠细胞密度区域和其他区域之间进行差异表达分析。发现许多结肠细胞区域中屏障促进基因如Cldn4、Cldn23、Tnfaip3和Il22ra1的高表达。
  • 这假定即使在急性DSS炎症后很长时间和宏观再生已经发生后,屏障功能仍然丧失。屏障通透性增加是炎症性肠病的已知问题,即使在急性炎症控制后也是如此。

讨论

核心贡献

  • 开发了resolVI,一种概率建模方法,用于清理ST数据分析中的噪声和偏差。
  • 在细胞水平分析ST数据集需要细胞分割。不正确的细胞分割将分子分配给邻近细胞,导致虚假共表达模式。
  • 证明在依赖图像数据或分子位置的各种分割方法中,虚假共表达存在,而resolVI在所有测试技术和分割算法中减少这种共表达模式。
  • 错误共表达模式通过使用文献curated的基因以及从scRNA-seq数据中共表达模式curated的基因建立。
  • 在真实数据中建立金标准共表达模式具有挑战性,结合两种方法作为基准分割算法的既定代理,尽管证明这些基因列表高度依赖于上下文,应用于新上下文需要审查。
  • 虽然resolVI减少所有分割中的偏差,但其性能取决于初始细胞分割的质量。发现使用Baysor分割时假共表达量最低。在实践中,推荐使用ProSeg进行初始分割,因为Baysor倾向于分割许多只有少量分子的细胞,膨胀细胞数量。

下游分析改进

  • 显示使用resolVI改进细胞类型分辨率、整合和下游分析,如不同空间生态位之间的差异表达和差异邻域组成分析。
  • ResolVI使用变分自编码器瓶颈层鼓励校正计数数据,因此对潜在空间的选择敏感。为减轻这一点,resolVI可以在监督模式下使用,其中细胞类型标签提供给算法以改进基因表达校正。
  • 在整篇论文中,执行计数的归一化处理,并将每个细胞的计数视为干扰因素;发现技术伪影是每个细胞计数的主要驱动因素。
  • 然而,resolVI还允许按细胞大小归一化,因此也可以应用于建模分子密度。这对于差异表达测试尤其关键,其中偏斜的基因面板可能偏倚差异表达基因的检测。

肝癌应用

  • 将resolVI应用于人类肝癌研究,证明具有促炎和抗炎表型的癌细胞异质空间生态位以及髓系和T细胞表型的相应变化。
  • 此外,证明resolVI生成的表达保留肿瘤和健康组织之间的基因表达差异。

DSS结肠炎应用

  • 为突出resolVI的下游能力,将resolVI应用于DSS结肠炎的纵向分析。
  • 证明resolVI可以有效地将查询样本映射到现有参考数据集。
  • 为进一步改进整合和执行标签转移,在resolVI中提供半监督模式,提供细胞类型预测的不确定性。
  • 使用这些不确定性,提供空间邻域的空间生态位嵌入和空间邻域内细胞类型差异丰度测试的框架。
  • 使用该框架,发现DSS结肠炎后35天隐窝尖端成纤维细胞位置的变化。此时,期望健康结肠的恢复。然而,这些成纤维细胞在健康小鼠中定位于隐窝尖端,并向肠上皮细胞提供Bmp信号,而DSS结肠炎后,这些细胞与其他成纤维细胞在黏膜下层聚集体中共定位。
  • 与Bmp信号减少一致,证明屏障促进上皮细胞频率减少。人类炎症性肠病样本的ST将揭示这些发现的转化相关性。

ResolVI是scvi-tools框架的一部分,目前示例在GitHub - scverse/scvi-tools: Deep probabilistic analysis of single-cell and spatial omics data。


方法

模型

  • ResolVI假设细胞n和基因g的观察表达x_ng从由细胞真实表达(z_n)、错误分割的邻近细胞N(n)的基因表达和背景基因表达bg_g定义的潜在状态采样。
  • 生成模型使用高斯混合先验、Dirichlet分布、指数分布和Gamma-Poisson公式。
  • α_n0...2是通过扩散编码器学习的混合比例,该编码器以细胞自身的基因表达x_ng为输入。
  • 背景使用Poisson分布建模,真实表达使用负二项分布。
  • f_θ是细胞n和所有邻近细胞共享的解码器函数。
  • β_nN(n)是每个邻居对扩散引起的表达的贡献。使用MAP推断这些参数,不进行摊销。
  • 使用径向基函数核将距离信息纳入Dirichlet先验。
  • 背景使用Dirichlet(1)先验,为每个批次s单独学习。

数据增强

  • 在ST中,发现大量低计数细胞。编码器倾向于不正确编码这些细胞的信息。
  • 然而,在ST中,过滤低计数细胞减少关键见解,如细胞-细胞相互作用或空间生态位嵌入。
  • 因此,选择每个细胞20个分子的低截止值进行过滤,然后运行resolVI。
  • 为增加低计数细胞的信息,在训练期间使用多项采样重新采样表达x_ng,然后将这些采样的计数输入表达编码器。

实现

  • ResolVI构建在scvi-tools内,使用Pyro作为后端,支持GPU加速计算。
  • 使用十个潜在维度用于编码器,编码器有两个隐藏层,编码器中dropout率为0.05,编码器每个隐藏层128个节点,解码器每个隐藏层32个节点。
  • 不编码协变量(既不是潜在编码器也不是混合比例编码器),而解码器使用批次ID作为协变量。
  • 使用自定义guide函数实现摊销。对于α的摊销,使用默认scVI编码器,3D输出,无dropout,使用softmax激活函数。
  • 在训练期间,不计算f_θ中x_N(n)的梯度。因此,对于邻近细胞,仅应用推断,而对于细胞n,解码器被训练。这提高稳定性和训练速度。
  • 每个resolVI模型包含五个 distinct 模型:(1) 无条件模型,(2) 通用模型,(3) 校正模型,(4) 残差模型,(5) 简化模型。

大小归一化

  • 在resolVI中执行计数归一化。作为替代建模方案,使用物理细胞大小a_n(面积或体积)并学习每个细胞的缩放因子β_n。
  • 动机是假设细胞内RNA分子密度的变化是由于细胞状态之间基因表达的生物学差异,而不是检测差异。

监督场景

  • ResolVI接受关于每个细胞细胞类型分配的先验知识的可选输入。以两种方式使用这些输入:
    • 首先,在监督场景中强制高斯混合与细胞类型注释对齐。
    • 其次,在潜在嵌入z_n上训练分类器,同时训练预测细胞类型标签的模型。

迁移学习

  • 对于迁移学习,采用scArches for Pyro模型的方法。
  • 由于一些参数是非摊销的,将细胞索引定义为分类字段,并在执行迁移学习时扩展此字段。
  • 对于迁移学习,识别scArches中需要更新的参数(批次依赖和非摊销参数),并阻止所有其他参数。

差异表达

  • 将ref.10的方法适配到Pyro。具体而言,将重要性采样的方法更改为与Pyro对齐。
  • 使用简化模型,其中损失限制在潜在空间中的KL散度、重建和混合比例对数概率。
  • 然后执行重要性采样并计算预测真实表达的经验边际。
  • 为鼓励采样低伪影细胞,基于给定生成真实基因表达的观察基因表达的概率执行加权采样。

差异生态位丰度

  • 计算类似于差异表达函数。不是执行重要性采样,而是从所有邻近细胞的潜在编码中随机采样,并使用细胞类型分类器预测细胞类型概率。
  • 为产生每个细胞长度等于细胞类型数量的向量,基于与中心细胞的空间距离对向量加权,并对所有邻近细胞求和。

生态位嵌入

  • 计算每个细胞空间邻域中细胞类型预测的加权(按空间连接性)平均值。这些细胞类型频率向量使用UMAP嵌入。

分割

  • 对于脑10x Xenium数据,使用xenium-resegment并通过将扩张距离设置为零执行细胞核分割。
  • 对于Baysor,将先验分割设置为原始细胞分割,置信水平为0.2,并在将组织子集为70个区域后运行分割。
  • 对于ProSeg,使用细胞核分割作为先验分割,并通过设置Xenium标志使用默认ProSeg设置。

指标

  • 整合指标:使用scib-metrics默认值基准整合。禁用PCR比较,因为期望大多数变异是由于不正确分割。
  • 双阳性指标:使用单细胞参考测序数据集。假设在单细胞测序中不共表达但在ST中共表达的基因可能是由于技术问题。

下游分析

  • 在分析中,使用resolVI生成的表达。执行计数归一化。执行归一化计数的平方根变换。
  • 对于所有UMAP图,首先使用RAPIDS计算20个最近邻居,然后使用UMAP包中的实现执行UMAP。

肝脏Nanostring CosMx分析

  • 在图4a中,突出SAA1减去GLUL表达的计数归一化基因表达;这突出中央静脉周围到门静脉梯度。
  • 使用空间位置作为嵌入空间计算生成表达中的热点模块。
  • 在图4h中,使用resolVI计算抗炎和促炎热点模块阳性细胞之间的差异表达。

结肠炎数据

  • 首先在第0-21天细胞中训练无监督resolVI模型。在resolVI的潜在空间中执行细胞的kNN分类。
  • 使用100个最近邻居计算k最近邻图,并使用邻域连接性作为分类器的权重。
  • 预测的确定性是具有该标签的连接性之和除以所有连接性之和。
  • 将粗标签(tier1)不确定性高于5%和细标签(tier3)不确定性高于40%或更多的所有细胞的标签设置为未知。
  • 移除这些细胞的标签后,在细标签上训练半监督resolVI模型,并预测所有细胞的标签。
  • 为整合第35天数据,使用scArches对这些细胞执行查询映射。

关键结论

ResolVI框架:一个在任何分割算法下游运行的概率模型,校正分子错误分配、批次效应和其他干扰因素,生成细胞状态的概率低维表示和校正的基因表达谱。

三组分模型:观察到的计数表示为真实表达、来自邻近细胞的扩散表达和非特异性背景的总和。真实表达和扩散使用负二项分布建模,背景使用泊松分布建模。

广泛适用性:在基于图像(Xenium、MERSCOPE、CosMx)和基于测序(Stereo-seq、Visium HD)的ST技术中验证,跨多种组织和分割算法。

改善细胞类型分辨率:ResolVI潜在空间在生物保守性和批次校正方面优于PCA、Harmony和scANVI。

消除虚假共表达:ResolVI大幅减少来自不同细胞谱系的标记基因的错误双阳性,同时保留意外的真实共表达模式。

依赖初始分割质量:ResolVI的校正准确性取决于初始分割的质量。Baysor分割结合resolVI提供最佳结果。

下游分析能力:ResolVI支持差异表达、差异生态位丰度、生态位嵌入和迁移学习。

肝癌应用:揭示具有促炎和抗炎表型的癌细胞异质空间生态位,以及髓系和T细胞表型的相应变化。

DSS结肠炎应用:揭示即使在宏观再生后,屏障功能仍然丧失,隐窝尖端成纤维细胞位置改变,Bmp信号减少。

可用性:ResolVI作为scvi-tools中的开源软件提供,支持GPU加速,可高效处理百万级细胞数据集。

生活很好,有你更好。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 作者,Evil Genius
  • 祝大家国庆快乐。
  • 今日我们分享文献
  • 摘要
  • 引言
  • 结果部分 1:ResolVI概述
  • 结果部分 2:ResolVI提高小鼠脑数据中的细胞类型分辨率并校正虚假共表达模式
  • 结果部分 3:在不同分割场景下评估ResolVI
  • 结果部分 4:ResolVI促进大型测序数据集的分析
  • 结果部分 5:ResolVI揭示人类肝癌中功能相关的空间域
  • 结果部分 6:ResolVI揭示DSS结肠炎后不完全再生
  • 讨论
    • ResolVI是scvi-tools框架的一部分,目前示例在GitHub - scverse/scvi-tools: Deep probabilistic analysis of single-cell and spatial omics data。
  • 方法
    • 关键结论
    • ResolVI框架:一个在任何分割算法下游运行的概率模型,校正分子错误分配、批次效应和其他干扰因素,生成细胞状态的概率低维表示和校正的基因表达谱。
    • 三组分模型:观察到的计数表示为真实表达、来自邻近细胞的扩散表达和非特异性背景的总和。真实表达和扩散使用负二项分布建模,背景使用泊松分布建模。
    • 广泛适用性:在基于图像(Xenium、MERSCOPE、CosMx)和基于测序(Stereo-seq、Visium HD)的ST技术中验证,跨多种组织和分割算法。
    • 改善细胞类型分辨率:ResolVI潜在空间在生物保守性和批次校正方面优于PCA、Harmony和scANVI。
    • 消除虚假共表达:ResolVI大幅减少来自不同细胞谱系的标记基因的错误双阳性,同时保留意外的真实共表达模式。
    • 依赖初始分割质量:ResolVI的校正准确性取决于初始分割的质量。Baysor分割结合resolVI提供最佳结果。
    • 下游分析能力:ResolVI支持差异表达、差异生态位丰度、生态位嵌入和迁移学习。
    • 肝癌应用:揭示具有促炎和抗炎表型的癌细胞异质空间生态位,以及髓系和T细胞表型的相应变化。
    • DSS结肠炎应用:揭示即使在宏观再生后,屏障功能仍然丧失,隐窝尖端成纤维细胞位置改变,Bmp信号减少。
    • 可用性:ResolVI作为scvi-tools中的开源软件提供,支持GPU加速,可高效处理百万级细胞数据集。
    • 生活很好,有你更好。
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档