以高通量数据分析为基础的生物信息学入门
从理解数据,到独立分析
阅读指南
BIOINFOBOOK / 从入门到独立分析
先理解问题,再理解数据
生物信息学的本质,是使用信息学的手段解决生物学问题。会敲几行命令只是起点;知道数据从哪里来、每一步为什么这样处理,以及结果究竟能支持什么结论,才是我们希望一起建立的能力。
本书面向具有基础分子生物学知识、尚未系统掌握生物信息分析的读者。以短读长、有参考基因组、bulk 数据为主线,将原理讲解与真实分析中的文件、参数和判断连在一起。
第一篇 · 共同基础
第 1—5 章:研究设计、计算环境、测序与文件、质控比对、统计推断。先建立能理解后续实战的知识基础。
第二篇 · 三类核心实战
第 6—8 章:RNA-seq、ChIP-seq/ATAC-seq、WGS/WES。围绕表达、富集和变异,理解不同问题为何需要不同流程。
第三篇 · 独立分析
第 9—10 章:Snakemake 工作流与 AI 辅助分析。把分散操作组织成可复现、可审查的分析过程。
怎样使用这本书
第一次接触生物信息学时,可以按章节顺序阅读。已有命令行和编程基础的读者,可以从第 3—5 章核对基础概念,再进入自己关心的实战。附录收录现有的 1—25 道基础问题,适合配合文件格式、质控和比对章节练习。
左侧目录用于切换章节,右侧目录用于定位当前章节,搜索框可以检索全书正文。公式、图片和代码均放在对应的讲解位置;较长命令可以横向滚动,并通过右上角按钮复制。
这是按“三篇、十章、71 个小节”整理的持续修订版。已有原稿的详细讲解尽量保留,尚缺的正文、练习和来源均标为“待完善”。第 9、10 章及 ATAC-seq 等新增教学单元目前以目录和待完善标记为主。
网页构建已经与分析代码执行分离。页面中的历史实战命令保留教学上下文,但尚未逐条在统一数据和环境中运行验收。
编写团队与致谢
孟浩巍、大壮、魏官云、刘博、连明、徐煜、契卡。
感谢原编写团队、生物信息学交流群中的朋友,以及每一位关心和支持本书的读者。
尽信书不如无书。领会数据处理的方法,远比记住几个软件名称更有帮助。希望在前进的路上,我们能够共勉。
本书允许个人非商业性在线浏览和分享原站链接;下载、再分发、修改、二次创作及商业使用须事先取得书面许可。详见版权与使用条款,其中列明第三方内容、既有授权和法定使用的适用范围。