附录 B — 基础问题 6—10

本组保留原题和原稿参考答案。题库目前收录 1—25 题;历史仪器参数和软件用法仍需逐项更新。

对应 质控与比对。

缩写说明

  1. 100 Bioinformatic Basic Questions = BBQ100
  2. 第6题的缩写 = BBQ100-06

B.1 BBQ100-06

问题描述

Hello 大家好!

通过前面的5个问题,我相信大家对Illumina测序,测序的储存文件格式,一些简单的建库原理已经有了一个初步的认识。那么接下来,我们就要用我们学到的知识去解决一些问题啦。

在实际操作和处理过程中,我们拿到的Illumina测序数据应该是.fastq.gz格式,其中gz表示的是使用gzip进行压缩,fastq表示使用fastq格式进行存储。获得数据的第一步,通常就是使用FastQC软件进行质控。

FastQC会对每一个输入的fastq.gz文件生成1个html网页和一个zip的压缩包。压缩包里是网页中包含的图片信息,因此我们只需要看网页里面整理好的内容就好。今天的问题围绕着FastQC的质控图来展开,请看下面2张图。

图 B.1: 6 图1

图1 - 1个Illumina测序结果, reads1 的 per-base quality boxplot

图 B.2: 6 图2

图2 - 1个Illumina测序结果, reads2 的 per-base quality boxplot

参考答案

1.图中的横坐标表示什么意思?

横轴是测序序列第1个碱基到第150个碱基.

2.图中的纵坐标表示什么意思?

纵坐标表示每一bp所对应的测序质量值,
前面讲过将该碱基判断错误概率值P取log10之后再乘以-10,
得到的结果再加上pherd值对应ASCII表所得到的值就是该碱基测序的质量值;
Q = -10*log10(error P)
即20表示1%的错误率,30表示0.1%的错误率;

3.图中的蓝色线是什么意思?

蓝色的细线是各个位置的质量值的平均值的连线;

4.图中的box 下面的bar , 上面的bar,箱体的下沿,箱体的上沿,箱体内部的横线分别代表什么意思?

每1个boxplot,都是该位置的所有序列的测序质量的一个统计,
上面的bar是90%分位数;
下面的bar是10%分位数;
箱子的中间的横线是50%分位数;
箱体上缘是75%分位数;
箱体下缘是25%分位数;
- - - - - - - - - - - - - -  
分位数一个简单解释是:
如果一组数的25%分位数是a,意味着a超过了这组数中25%数字的大小;

5.图1与图2最主要的区别在哪里?结合我们之前的问题,为什么会出现这种情况?

相比于reads1的测序结果,图2中reads2测序质量均匀性差,准确率低;
主要原因是:
reads2的测序是在reads150bp测序完成后,
forward strands再通过1次桥式PCR合成reverse strands;在这之后再进行荧光测序;
测序质量差的主要原因是因为长时间测序结束后,合成每的活性降低,
导致合成时加不上一些碱基,最终同步性变差,主要属于phasing错误。

B.2 BBQ100-07

原题描述

Hello 大家好!

今天我们接着昨天的话题来继续进行与FastQC结果有关的提问。

我们昨天主要是针对FastQC结果中的boxplot进行了相关的探索,boxplot一般是认为FastQC几张必看的质控图之一。一般情况下FastQC的结果会包含下面几个图,而我们主要会看下图圈出来的几个。 7 0图

接下来的几天我们就把这些图来一个一个讨论清楚。

我们昨天讨论了“Per base sequence quality”,今天先来讨论 “Per base sequence content” 7 图1

图1

图 B.3: 7 图2

图2

参考答案

1.图1与图2中横坐标是什么意思?纵坐标是什么意思?

横轴代表1到150bp;纵轴代表ATCG在该bp的百分比。

2.图1是1个正常的DNA 全基因组测序结果,为什么前面的几bp线是波动的?后面的线是平衡的?

根据Wason-Crick配对原则,A和T应该相等,G和C应该相等;
但是一般测序的时候,刚开始测序仪状态不稳定,很可能出现不平衡的情况。
像这种情况,
如果测序的得分很高,可以不进行trim开始部分的序列信息;
如果测序得分很低,需要进行trim开始部分的序列信息。

3.图2是1个特殊RNA建库的测序结果,4条线出现波动更可能是什么原因造成的?

RNA是单链核苷酸,GC或AT的含量并没有直接的关系,
4条线的波动是由于模板中ATCG的量不同导致的(就是所谓GC不平衡)。

4.在图1中你能不能看出一个恒定的量?(提示,同一物种间相同,不同物种间一般不同)如果能看出来,这个量是什么?数值大约是多少?

GC含量在同一物种中是一个恒定值。图中GC总体比例大约在42%(目测)。

B.3 BBQ100-08

原题描述

Hello 大家好! 我们又见面了!

最近总搞FastQC报告的研读,是不是都看烦了?没关系,我们再搞最后2次,就进入下一个主题啦!昨天的问题中,我们告诉大家FastQC的报告中最重要的几张图都在下面用红框框出来了。 8 图0

今天我们来研读2张图。 第1张图是:Per sequence GC content
8 图1 1

图1-1 human 全基因组测序FastQC 结果图

图 B.4: 8 图1 2

图1-2 human 全基因组测序FastQC 结果图

第2张图是:Sequence Length Distribution

图 B.5: 8 图2 1

图2-1 刚下机以后的fastq数据进行FastQC 结果图

参考答案

1.图1-1 与 图1-2 中的横坐标是什么意思?纵坐标是什么意思?

横轴是0 - 100%; 纵轴是拥有相对GC含量的序列所对应的数量.

2.图1-1中是human全基因组测序,结合昨天的问题,那么peak的中间大约应该在多少?

上一次的问题中GC总体比例大约在42%左右,所以如果这是human全基因组测序,那么peak在横坐标对应42的位置比较好。

3.图1-2与图1-1有哪些显著的不同?造成这些不同的原因有可能是什么?遇到这个问题,我们通常应该做些什么?

图1-1有一个peak,并且与理论值(蓝线)基本重合;
而图1-2有两个,并且其中一个peak与蓝线相差很多,当红色的线出现双峰,基本是混入了其他物种的DNA序列。
遇到这个问题,首先进行mapping统计有多大比例reads map到了目标参考基因组上,如果比例非常低说明污染严重,数据不可用;
如果大部分reads都map成功,剩余一部分可以通过blast检查是混入了哪些污染物,过滤掉这些reads就可以,不影响后续的分析。

4.图2-1的横坐标是什么意思?纵坐标是什么意思?

横坐标代表序列长度,纵坐标代表长度为某一bp的序列所对应的数量。

5.图2-1是刚下机的fastq数据进行FastQC 结果图,有什么特点?为什么会出现这样的结果?如果对刚下机的fastq数据进行cutadapter,图2-1还会是这样的结果吗?为什么?

测序仪成功下机的数据都是整齐的一定长度的序列,比如最常用的illumina X Ten是双端150bp;
测序过程当中产生的不足150bp的序列在下机时已经被过滤掉了;
如果进行cut adapter,序列的长度将不一致,因为reads中包含信息的insert的长度并不完全一致,
150bp的测序长度是否已经包含了adapter的序列是未知的,因此cutadapter之后的reads长度不同.

能力扩展题:

6.请想办法,计算Human genome 19(hg19)每一条染色体的GC含量。

思路1
- UCSC或Emble下载Human genome 19(hg19)染色体序列;
- 直接把下载的序列使用Fastqc检测序列“质量”,
- report中Sequence content across all bases会显示GC结果。

思路2
- UCSC或Emble下载Human genome 19(hg19)染色体序列;
- 写Python程序依次读取序列内容;
- 统计每一条染色体的GC含量;
- 具体的代码及方法可以参考知乎Live

B.4 BBQ100-09

原题描述

今天我们来详细聊聊duplicate问题。duplicate的产生主要是因为Illumina建库的过程中,一般会需要使用PCR来帮助扩增插入序列的浓度。在扩增的过程中,如果PCR扩增轮数过大,就会出现duplicate的问题,即产生一模一样的若干条序列。

FastQC中“Sequence Duplication Levels”图是用来刻画duplicate情况的。 9 图1

图1 duplicate结果图

参考答案

1.图1中的横坐标是什么意思,纵坐标是什么意思?

横坐标代表序列重复水平;纵坐标代表重复水平序列占所有序列的百分比。

2.图1中的红线和蓝线分别代表什么意思?

红线代表去duplicate之后序列理论重复性分布(服从possion distribution 或者 binomial distribution)情况,
蓝线代表全部的序列重复性分布情况。

3.图1中的duplicate是全部序列的duplicate的情况吗?还是随机筛选了一部分?为什么要这样做?

是选择的每一个文件里前100,000条序列作为样本进行的计算,因为样本本身很大,前100,000已经能够代表样本的重复性。

4.如果让你写程序,判断1个fastq文件中duplicate的比例,你的大概思路是什么?

# Python风格的伪代码:

# 第1步对序列进行排序    
sort the FASTQ file by the sequence, and names as sorted_file;

# 第2步对排序的序列统计是否为duplicate
total_num = 1
duplication_num = 0

reads_1 = sorted_file.readline()
for reads_2 in sorted_file
    if reads_1 == reads_2
        duplication_num = duplication_num +1
    else 
        reads_1 = reads_2
    total_num = total_num +1
print total_num 
print duplication_num

能力扩展题:

5.既然谈到了duplicate的问题,那就存在remove duplicate的问题,什么情况下应该去duplicate,什么情况下不去除? (仅需要思考一下,以后我们会有专题讨论这个问题)

DNA-Seq中序列如果是随机打断需要考虑deduplicaion;酶切的样本一般不需要考虑这个问题;
RNA-Seq一般不考虑remove duplication(有paper专门讨论过这个问题);
单细胞测序需要建库过程中需要添加random barcode,且必须考虑duplication。

B.5 BBQ100-10

原题描述

Hello大家好!

我们又见面了!今天是我们的FastQC中最后1次提问啦!今天,我们要聊得是adapter与kmer的问题。

我们在生物信息学100个基础问题 —— 第5题 测序建库的adapter 的时候讨论过adapter的问题,我们知道adapter的最主要的作用是为了能够与flowcell连接,方便进行桥式PCR。那么我们的fastq文件中到底含不含adapter呢?FastQC报告就能告诉我们。

同时呢,我们今天还会讨论kmer的问题,相关的报告FastQC也会输出出来。 Part I adapter部分 10 图1 1

图 1-1 1个正常的adapter报告

图 B.6: 10 图1 2

图 1-2 1个RNA-Seq的adapter报告

Part II kmer部分 10 图2 1

图 2-1 正常的RNA-Seq建库kmer统计

图 B.7: 10 图2 2

图 2-2 加入random barcode的RNA-Seq建库kmer统计

图 B.8: 10 图2 3

图 2-3 kmer的统计显著性分析

参考答案-关于adapter的问题:

1.Illumina的通用adapter序列是什么?图1-1与图1-2中的各种不同颜色的图例是什么意思?

Illumina Paired End Adapters (cannot be used for multiplexing)

Top adapter
    
    5′ ACACTCTTTCCCTACACGACGCTCTTCCGATC*T 3’

Bottom adapter
    
    
    5′ P-GATCGGAAGAGCGGTTCAGCAGGAATGCCGAG 3’

**来源**
http://bioinformatics.cvr.ac.uk/blog/illumina-adapter-and-primer-sequences/

不同颜色的图例代表不同的测序通用的adapter;
如果在当时fastqc分析的时候-a选项没有内容,则默认使用图例中的通用adapter序列进行统计。

2.图1-1与图1-2中的横坐标与纵坐标分别是什么意思?

横坐标代表reads中的位置,纵坐标代表adapter序列含量的百分比。

3.图1-1与图1-2中最显著的差异是什么?如果两者都是RNA-Seq的数据,哪个可以继续下游分析,哪个不能够进行下游分析?为什么?

图1-1的结果表明少量的序列3'端测到了少部分adapter序列,且测序时使用的是红色图例代表的adapter;
图1-2的结果表明测序时使用的是红色图例代表的adapter;除了前20bp,reads后半段序列有很高比例都是adapter,建库可能存在问题。

参考答案-关于kmer的问题:

4.kmer就是一定长度的序列,比如AATTCCGG就可以叫做8-mer。那么图2-1余图2-2中的横坐标什么意思?纵坐标什么意思?

横坐标代表短序列的长度,纵坐标代表某长度的短序列在所有reads中所出现的频率百分比。

5.图2-1与图2-2中哪个kmer问题比较严重?为什么?

图2-2的问题更严重,因为该图中kmer的出现位置集中且数量较多,可能是加入了random barcode,出现了duplication问题。

6.图2-2中是在reads的5’端加入了约10bp左右的随机序列,结合 生物信息学100个基础问题 —— 第9题 读懂FastQC报告中的duplicate问题 这样做的目的是什么?

一般在进行RNA—Seq测序时是不会进行remove duplication;
但是一些比较特殊的建库流程比如说单细胞RNA-Seq测序时PCR扩增轮数较多,可能出现大量的duplication;
对于这些建库方法,通常需要添加random barcode,然后需要根据random barcode进行remove duplication。

7.思考题:图2-3是FastQC生成的kmer是否显著的统计报告。其中的每一列是什么意思?这个统计显著性检验计算的p-value是使用什么方法计算的?

- 第一列:kmer内容
- 第二列:kmer在序列中某一位置出现的观测数量
- 第三列:二项分布统计检验P-value
- 第四列:kmer在某一位置的观察值与理论值的比值
- 第五列:观察值与理论值比值最高值出现的位置