10  Snakemake与可复现分析工作流

本章提要

本章把已经理解的分析步骤组织为 Snakemake 工作流。先从输入输出的依赖关系出发,编写第一个 Snakefile,再用样本表与配置扩展到多样本,记录软件环境和参考资源,学习资源分配、日志、失败恢复与增量运行。最后通过流程验证和自动报告形成完整项目,并练习向其他任务迁移。主案例与第 5 章 RNA-seq 衔接,让你在熟悉的分析问题上学习工作流组织方式。

10.1 从命令脚本到依赖图

理解工作流为什么以文件依赖组织计算。

待完善

10.2 第一个可运行的Snakefile

掌握构成最小流程的核心语法。

待完善

10.3 样本表、配置与多样本扩展

让流程通过配置适配数据,而非复制粘贴命令。

待完善

10.4 环境与参考资源的版本管理

使他人能在可追溯的条件下重跑分析。

待完善

10.5 资源、日志、失败恢复与增量运行

能诊断失败并有效管理计算资源。

待完善

10.6 流程验证与自动报告

验证流程不仅能执行,而且输出符合分析要求。

待完善

10.7 完整项目与跨任务迁移

形成编写和改造流程的能力。

待完善