Scanpy:Python 单细胞基因表达数据分析工具包

生命科学 2026-10-03 16 阅读

Scanpy 是与 anndata 共同构建的单细胞基因表达数据分析工具包,覆盖预处理、可视化、聚类、轨迹推断与差异表达检验。

这个工具是什么

Scanpy 是一个面向单细胞基因表达数据的可扩展分析工具包,与 anndata 联合构建,使用 Python 实现。其功能覆盖预处理、可视化、聚类、轨迹推断和差异表达检验等单细胞分析的常见环节。README 指出,该实现可高效处理超过一百万个细胞的数据集;对于无法放入内存的数据集,部分 scanpy 函数已兼容 dask,但该能力被标注为实验性。Scanpy 属于 scverse 项目,由 NumFOCUS 提供财务赞助,采用 BSD-3-Clause 许可证,源码托管于 GitHub,文档与主页位于 scanpy.scverse.org。

核心能力

  • 覆盖预处理、可视化、聚类、轨迹推断与差异表达检验等单细胞分析环节
  • 与 anndata 联合构建,围绕统一的数据结构组织分析流程
  • Python 实现,README 称可高效处理超过一百万个细胞的数据集
  • 部分函数兼容 dask,可应对无法放入内存的数据集,但属实验性

科研中的典型用法

  • 对单细胞基因表达矩阵做预处理、降维与聚类,获得细胞分群结果
  • 用内置可视化功能展示细胞在降维空间中的分布与基因表达模式
  • 进行轨迹推断与差异表达检验,比较不同细胞群体间的基因表达差异

快速上手

可通过 PyPI 安装(pip install scanpy),也可使用 conda-forge 渠道(conda install -c conda-forge scanpy)。入门建议先阅读 scanpy.scverse.org 上的文档,从 API 章节了解公开接口;注意官方仅保证公开 API 的稳定性,未文档化的内部接口不在支持范围内。使用中遇到问题可在 scverse Discourse 讨论,或通过 GitHub issue、pull request 参与贡献。

生态与相近工具

Scanpy 属于 scverse 生态,与 anndata 数据结构配套,并可与 dask 配合处理超内存数据。README 未提及其他同类工具,因此取舍需结合自身数据规模与是否已有 scverse 生态依赖来判断。若使用 scanpy 开展研究,应按 README 引用 Wolf、Angerer、Theis 发表于 Genome Biology 的论文,以及 scverse 项目论文。

项目信息


本文属于《学科研究工具知识库 · 生命科学》第 4 篇(按 GitHub 星标排序)。收录标准:该学科公开可获取的开源研究工具,星标与活跃度为主要参考,不代表对其性能或适用性的背书;选型前请结合自身场景评估。

评论 共 0 条

暂无评论

微信小程序

微信扫一扫体验

立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部