1  学习地图与研究设计

让读者先知道要解决什么问题、需要什么数据,以及学到什么程度才算能够独立分析。

1.1 本书的范围与生物信息分析全景

建立全局认识,知道本书覆盖的任务及边界。

前言

生物信息学的本质是使用信息学的手段解决生物学问题。自20世纪60年代发端以来,生物信息学对整个生物领域的发展产生了巨大的影响。2003年在多国科学家的通力合作下,科学家们完成了人类参考基因组的测序,随后越来越多模式生物的参考基因组也完成拼装,生物信息学或者说整个生物学的研究进入了一个新纪元。

随着第二代测序技术(Next Generation Sequencing,NGS)的发展和推广,一系列之前看似天方夜谭的测序技术得到应用:

  • 如可以对人的每一个基因进行表达水平测定的RNA-Seq技术;
  • 对基因组每一个突变进行鉴定的全基因组测序(Whole Genome Sequencing,WGS);
  • 对表观遗传学甲基化水平进行刻画的BS-Seq;
  • 对基因组三维结构进行详细刻画的Hi-C技术,ChIA-PET技术等等;
  • 对没有参考基因组的生物进行基因组的测序与组装
  • ……

也是因为这些技术的推广与应用,目前生物信息学一个很大的挑战就是理解和分析这些海量的数据。

在分析数据的过程中,使用R语言或者Python语言对原始的生物信息数据进行清洗,加工,分析,展示已经成为主流。不但使用便捷,而且两种编程语言都是开源语言没有版权和商业的限制,更重要的是使用人数众多,常见的问题都能过通过Google搜索到解决方案。

但是在生物信息学蓬勃发展的今天,国内鲜有一本能够将编程技术与实际生物信息学分析结合起来的参考书目,这给众多想要入门生物信息学的同学,老师及需要数据分析的临床医生带来了非常大的挑战。入门门槛较高,学习曲线比较陡峭是妨碍大家学习生信的主要问题,因此本书尝试用贴近真实数据分析的视角,为大家讲解我们认为最重要的生信相关知识点,并给出完整的测试数据及代码,方便大家进行学习。

我们不期能够大而全地介绍每一个生物信息学细节,而希望为大家提供一份较为通俗易懂的入门手册,在阅读和实践的过程中逐渐感受到生物信息学数据的处理方式,领会数据处理的原理。同时,针对生物信息学中涉及到的R语言,统计学及相关生物背景知识我也会给出相应的学习建议,方便大家更加深入地学习。

总之,学习的路上,有万千条的路径,我们的目的是为你提供一条参考的可能。尽信书不如无书,领会精神,体会数据处理的方法论,远比会敲几行代码更重要,也对以后的发展更有帮助。

种一棵树,最好的时间是十年前,其次,便是现在!

希望在前进的路上,我们能够共勉!

保留原前言的问题导向,改写为明确的读者定位与学习目标。

1.2 把生物学问题变成可分析的比较

把模糊的研究兴趣转化成可检验的问题。

待完善

1.3 实验设计、重复、对照与混杂

理解哪些问题应在测序前解决,哪些无法靠后期计算补救。

待完善

1.4 样本信息表与分析计划

让样本身份、实验分组和文件对应关系可追溯。

待完善

1.5 入门路线、阶段任务与自我评估

把阅读目录转化成可执行的学习路径。

待完善