1  AI时代,如何开始学习生物信息学

这本书写给希望开始学习生物信息分析的读者。在 AI 可以帮助我们解释概念、阅读代码和排查问题的今天,理解数据从哪里来、分析为什么这样做,以及结果能够支持什么结论,仍然是独立分析的基础。你可以从测序技术和基本操作开始,逐步进入不同类型的数据分析,在需要时回看统计学章节,并通过工作流与综合实践整理自己的学习成果。

生物信息学的本质是使用信息学的手段解决生物学问题。自20世纪60年代发端以来,生物信息学对整个生物领域的发展产生了巨大的影响。2003年在多国科学家的通力合作下,科学家们完成了人类参考基因组的测序,随后越来越多模式生物的参考基因组也完成拼装,生物信息学或者说整个生物学的研究进入了一个新纪元。

随着第二代测序技术(Next Generation Sequencing,NGS)的发展和推广,一系列之前看似天方夜谭的测序技术得到应用:

也是因为这些技术的推广与应用,目前生物信息学一个很大的挑战就是理解和分析这些海量的数据。

在分析数据的过程中,使用R语言或者Python语言对原始的生物信息数据进行清洗,加工,分析,展示已经成为主流。不但使用便捷,而且两种编程语言都是开源语言没有版权和商业的限制,更重要的是使用人数众多,常见的问题都能过通过Google搜索到解决方案。

但是在生物信息学蓬勃发展的今天,国内鲜有一本能够将编程技术与实际生物信息学分析结合起来的参考书目,这给众多想要入门生物信息学的同学,老师及需要数据分析的临床医生带来了非常大的挑战。入门门槛较高,学习曲线比较陡峭是妨碍大家学习生信的主要问题,因此本书尝试用贴近真实数据分析的视角,为大家讲解我们认为最重要的生信相关知识点,并给出完整的测试数据及代码,方便大家进行学习。

我们不期能够大而全地介绍每一个生物信息学细节,而希望为大家提供一份较为通俗易懂的入门手册,在阅读和实践的过程中逐渐感受到生物信息学数据的处理方式,领会数据处理的原理。同时,针对生物信息学中涉及到的R语言,统计学及相关生物背景知识我也会给出相应的学习建议,方便大家更加深入地学习。

总之,学习的路上,有万千条的路径,我们的目的是为你提供一条参考的可能。尽信书不如无书,领会精神,体会数据处理的方法论,远比会敲几行代码更重要,也对以后的发展更有帮助。

种一棵树,最好的时间是十年前,其次,便是现在!

希望在前进的路上,我们能够共勉!