同源性分析——BLAST
实验一利用BLAST的数据库比对分析
实验三 利用BLAST的数据库比对分析
2012454116郑俊昌
一、实验目的
1、学习BLAST序列相似性网络核酸蛋白数据库比对方法
2、进行网络核酸蛋白数据库基因相似性分析
二、实验内容
1、BLAST工具介绍
BLAST® (Basic Local Alignment Search Tool)工具是用查询的DNA或蛋白质序列与所以可能的序列数据库进行相似性搜索的多个程序。BLAST程序运行速度快,打分合理,容易辨认出真正的匹配与随机背景的不同。BLAST不仅可以进行局部亦可以进行全局搜索,易于发现一些分隔的相似区段。
BLAST的功能:
BLAST对一条或多条序列(可以是任何形式的序列)在一个或多个核酸或蛋白序列库中进行比对。BLAST还能发现具有缺口的比对上的序列。
BLAST可处理任何数量的序列, 包括蛋白序列和核算序列; 也可选择多个数据库但数据库必须是同一类型的, 即要么都是蛋白数据库要么都是核酸数据库。下面介绍5个BLAST分析的程序:
(1) BLASTP是蛋白序列到蛋白库中的一种查询。库中存在的每条已知序列将逐一地同每条所查序列作一对一的序列比对。
(2) BLASTX是核酸序列到蛋白库中的一种查询。先将核酸序列翻译成蛋白序列(一条核酸序列会被翻译成可能的六条蛋白即六框翻译),再对每一条作一对一的蛋白序列比对。
(3) BLASTN是核酸序列到核酸库中的一种查询。库中存在的每条已知序列都将同所查序列作一对一地核酸序列比对。
(4) TBLASTN是蛋白序列到核酸库中的一种查询。与BLASTX相反,它是将库中的核酸序列翻译成蛋白序列,再同所查序列作蛋白与蛋白的比对。
(5) TBLASTX是核酸序列到核酸库中的一种查询。此种查询将库中的核酸序列和所查的核酸序列都翻译成蛋白质(六框翻译),这样每次比对会产生36种比对阵列。
2、连接NCBI进行BLAST相似性分析 BLAST可以通过登录NCBI的BLAST服务器进行,也可以下载BLAST程序及相关数据库后进行本地BLAST分析。通常在网络连接正常的情况下,登录NCBI进行BLAST分析是首选。
blast参数
blast参数
1. 什么是blast参数?
BLAST(Basic Local Alignment Search Tool)是一种常用的生物信息学工具,用于比对两个或多个生物序列,以寻找相似性和同源性关系。在进行BLAST比对时,我们可以设置一些参数来调整比对的敏感性和特异性,以便更好地满足研究的需求。
2. BLAST参数的分类
BLAST参数可以分为两类:搜索参数(search parameters)和输出参数(output
parameters)。
2.1 搜索参数
搜索参数用于控制BLAST比对的敏感性和速度。常见的搜索参数包括:
• -query:指定查询序列文件或序列字符串,可以是FASTA格式或GenBank格式。
• -subject:指定被比对序列文件或序列字符串,可以是FASTA格式或GenBank格式。
• -task:指定比对任务的类型,如blastn、blastp、blastx等。
• -evalue:设置期望值(E-value)的阈值,用于筛选显著的比对结果。
• -word_size:设置比对时使用的单词大小,影响比对的敏感性和速度。
• -gapopen:设置开启一个gap的惩罚分数。
• -gapextend:设置扩展一个gap的惩罚分数。
2.2 输出参数
输出参数用于控制BLAST比对结果的格式和内容。常见的输出参数包括:
• -outfmt:设置输出格式,如0表示默认格式,5表示XML格式。
• -out:指定比对结果的输出文件。
• -max_target_seqs:设置返回的最大比对序列数目。
• -num_threads:设置线程数,用于加速比对过程。
• -num_alignments:设置返回的最大比对结果数目。
• -max_hsps:设置每个比对结果返回的最大高分片段数目。
3. 如何选择合适的blast参数?
选择合适的blast参数是进行BLAST比对的关键步骤,以下是一些选择参数的建议: 3.1 根据比对任务类型选择参数
湖南大学生物信息学实验报告-W8
1
实验1 DNA Blast(利用DNA数据库上提供的Blast功能)
1 基本信息:
姓名:程瑶 学号:201378020205
班级:医学1301 实验日期:2016-04-19
2 实验目的和要求:
1) 掌握BLAST的原理;
2) 了解如何利用Genbank数据库中提供的Blast功能完成同源性检索
3 实验仪器、设备与材料:
计算机(联网)
4 实验原理:
BLAST是一个NCBI开发的序列相似搜索程序,还可作为鉴别基因和遗传特点的手段。BLAST能够在小于15秒的时间内对整个DNA数据库执行序列搜索。BLAST(Basic
local alignment search tool),中文意思为基本的基于局部对准的搜索工具,是一种快速查找与靶序列具有连续相同片段的序列的技术。
5 实验步骤:
1)进入NCBI主页(/),点击BLAST按钮,进入了BLAST HOME界面。
A、选择blastn,在Enter Query Sequence 输入FASTA格式的序列,以枯草芽孢杆菌的葡萄糖-1-脱氢酶为例。在choose search set栏中的Database中选择“others”,注意此处的program selection选择Highly similar sequences
(megablast),再点击“BLAST”按钮,需要一定的反应时间,结果可以看到有很多非常相似的序列,打开匹配度较高的序列,查看来源、功能等。改变下面几个参数(每次只能变化一个参数),看输出结果中打分最高的10条序列是否会发生变;
B:进入blastp,在Enter Query Sequence 输入FASTA格式的序列。在choose search
set栏中的Database中选择“others”,注意此处的program selection选择Highly 2
similar sequences (megablast),再点击“BLAST”按钮,需要一定的反应时间,结果可以看到有很多非常相似的序列,打开匹配度较高的序列,查看来源、功能等。改变下面几个参数(每次只能变化一个),看输出结果中打分最高的10条序列是否会发生变化;
blast用法
blast用法
BLAST(Basic Local Alignment Search Tool)是一种常用的生物信息学工具,用于在数据库中搜索和比对生物序列(如DNA、RNA、蛋白质等)。以下是使用BLAST的基本步骤和用法:
1. 准备输入序列:首先,准备待查询的序列数据。可以是DNA序列、蛋白质序列或其他类型的生物序列。
2. 选择BLAST程序:根据要比对的序列类型,选择合适的BLAST程序。常见的BLAST程序包括blastn(用于DNA比对)、blastp(用于蛋白质比对)、blastx(用于DNA与蛋白质相互比对)等。
3. 选择数据库:确定要在哪个数据库中进行比对。BLAST提供了多个数据库选项,如NCBI提供的nr数据库(非冗余蛋白质序列数据库)。
4. 运行BLAST:使用命令行或图形界面工具,输入BLAST命令或设置相应的参数进行比对。例如,可以使用以下命令运行blastp程序进行蛋白质比对:
```
blastp -query input.fasta -db database -out output.txt ```
其中,`input.fasta`是输入序列文件,`database`是要比对的数据库,`output.txt`是输出结果文件。
5. 解析和分析结果:BLAST运行完成后,会生成比对结果文件。可以使用相应的工具或脚本来解析、过滤和分析结果,以获取所需信息(如相似性、E值、比对长度等)。
6. 结果解释和进一步分析:根据比对结果,可以进一步解释和分析序列的功能、同源性等信息。可以使用其他生物信息学工具和数据库来进一步研究和验证结果。
需要注意的是,BLAST具有多个参数和选项,可以根据具体的研究目的和需求进行调整和优化。建议参考相关的文档、教程或使用BLAST提供的帮助命令(如`blastn -help`)来了解更多详细的用法和参数设置。
blast分类及特点
blast分类及特点
BLAST是“局部相似性基本查询工具”(Basic Local Alignment Search
Tool)的缩写,是由美国国立生物技术信息中心(NCBI)开发的一个基于序列相似性的数据库搜索程序,是目前最常用的数据库搜索程序。BLAST实际上是综合在一起的一组工具的统称,它不仅可用于直接对核酸序列数据库和蛋白质序列数据库进行搜索,而且可以将带搜索的核酸序列翻译成蛋白质序列后再进行搜索,或反之,以提高搜索效率。
BLAST的分类主要有以下几种:
1. 标准BLAST:包括Blastn、Blastp、Blastx、tBlastn、tBlastx。
2. PSI-BLAST:PSI-BLAST(Position-Specific Iterated BLAST,位点特异性迭代BLAST)的特色是每次用位置特异权重矩阵(Position-Specific
Scoring Matrix,PSSM)搜索数据库后再利用搜索的结果重新构建PSSM,然后用新的PSSM再次搜索数据库,如此反复(iteration)直至没有新的结果产生为止。
3. PHI-BLAST:PHI-BLAST(Pattern-Hit Initiated BLAST,模式识别BLAST)能找到与输入序列相似的并符合某种特定模式(Pattern)的序列,这种序列特征模式可能代表某个翻译后修饰的发生位点,也可以代表一个酶的活性位点,或者一个蛋白质家族的结构域、功能域。
此外,BLAST还有以下特点:
1. BLAST基本原理很简单,它的要点是片段对的概念。所谓片段对是指两个给定序列中的一对子序列,它们的长度相等且可形成无空位的完全匹配。
2. BLAST从头至尾将两条序列扫描一遍并找出所有片段对,并在允许的阈值范围内对片段对进行延伸,最终找出高分值片段对(high-scoring pairs,
HSPs)。这样的计算复杂度是n的一次方(n是序列的长度)。如果做双序列比对话需要构建一个n乘以n的表格,计算复杂度是n的二次方。所以找高分值片段对比做双序列比对节省了大量的时间,当然,前提是牺牲了一定的准确度。另外,如今改进后的BLAST允许空位的插入。
关于分子生物学中的同源性分析
教育教学论坛EDUCATIONTEACHINGFORUM2014年12月第51期Dec.2014NO.51在分子生物学的教学及研究中,经常对核苷酸或氨基酸序列进行比对以确定基因之间或蛋白质之间的同源关系,进而根据同源性来推测物种间的亲缘关系。基因或蛋白质之间的同源关系包括直系同源和旁系同源,序列间的同源性可用相似性或一致性来进行量化,用相似性(一致性)来判断序列是否同源。一、同源性的概念在生物学中,同源性(homology)是指在进化过程中源于同一祖先的分支之间的关系。我们可以在生物学的不同层次(如形态性状、分子性状等)上进行同源性分析,形态性状由于进行上或个体发育上的共同来源而呈现出本质上的相似性,但其功能不一定相同,那么它们就是同源的,如马的前肢与鸟的翅就是同源器官。在分子水平上同源性主要是指基因的核苷酸序列或蛋白质的氨基酸序列之间的相似程度。同源基因或蛋白质(homolog)指遗传上从某一共同祖先经趋异进化而形成的具有不同序列的基因或蛋白质。同源性是一个相对的概念,在一定水平和范围内对其研究才有意义[1]。二、直系同源与旁系同源同源关系包括两种类型:直系同源(ortholog)和旁系同源(paralog)。这里我们主要以同源基因为例来进行讨论,同源蛋白质是同样的情况。同源基因是遗传上来自某一共同祖先DNA序列的基因,包括直系同源基因和旁系同源基因。直系同源基因,又称直向或垂直同源基因,指的是这样一些基因,它们起源于这些基因所在物种的最近共同祖先的一个祖先基因。这些基因通常具有相同的功能,但并不是绝对的,当我们比较直系同源基因时,可能会发现有的基因失去了原来的功能或者进化出了新的功能[2-5]。因此,直系同源基因描述在不同物种中来自于共同祖先的基因。旁系同源基因,又称横向或并行同源基因,指在一个特定的基因组中由于基因复制产生的同源基因。当我们比较旁系同源基因时,发现它们可能彼此具有了新的功能,也可能成为假基因了[2-4]。旁系同源基因描述在同一物种内由于基因复制而分离的同源基因。如图1所示,祖先球蛋白基因(globingene)经过复制后分离产生了α球蛋白和β球蛋白基因,这两类基因就是旁系同源基因。例如鼠的α球蛋白和β球蛋白基因、鼠的α球蛋白和鸡的β球蛋白基因、鼠的α球蛋白和蛙的β球蛋白基因,它们之间的关系分别是旁系同源基因。鼠、鸡、蛙的α球蛋白基因;鼠、鸡、蛙的β球蛋白基因,它们分别是直系同源基因。关于分子生物学中的同源性分析李尚伟,杜娟(贵州大学昆虫研究所,贵州山地农业病虫害点实验室,贵州贵阳550025)摘要:同源性是指在进化过程中源于同一祖先的分支之间的关系,包括直系同源和旁系同源。直系同源基因描述在不同物种中来自于共同祖先的基因,而旁系同源基因描述在同一物种内由于基因复制而分离的同源基因。同源性与相似性是两个不同的概念,前者是质的概念,后者突出量的描述,但它们之间又有一定关系,可以通过相似性来推测序列是否具有同源性。介绍了用BLAST进行序列同源性分析的方法。关键词:同源性;直系同源;旁系同源;相似性;BLAST中图分类号:G642.0文献标志码:A文章编号:1674-9324(2014)51-0184-02
基因同源算法
基因同源算法
基因同源算法(Genome-Wide Homology Search Algorithm)是一种计算生物学中用于寻找功能相似基因序列的方法。该算法通过比对已知的已注释基因组的序列,对未知的基因组进行相似性分析,从而推断其功能。本文将对基因同源算法进行详细的介绍。
1. 基因同源的定义
基因同源是指两个或多个生物体之间具有相同的基因序列和功能的基因。
基因同源算法利用不同类型的比对算法,如BLAST、Smith-Waterman、Needleman-Wunsch等,对基因组进行比对,找到相似的基因序列。从而扩展已知的基因组信息。
BLAST(Basic Local Alignment Search Tool)是目前应用最广泛的基因序列比对算法之一。BLAST通过构建碱基或氨基酸序列的预测模型,建立基因序列的数据库,然后利用这个模型对未知序列进行比对,从而推断其功能。BLAST算法的优点是速度快、准确性高。
基因同源算法在生物信息学领域有着广泛的应用。目前,基因同源算法被广泛地应用于以下方面:
(1)物种分类和进化分析:通过比对物种间基因序列的相似性,可以明确物种间的关系,透彻了解生物进化的历程。
(2)基因组注释:基因同源算法可以将未知的基因组序列通过比对已知的基因组数据库得到注释信息,为后续的基因功能研究奠定基础。
(3)基因定位和基因表达分析:通过基因同源算法可以明确未知基因序列的位置和基因表达水平,从而可以推断其功能。
(1)适用性广:基因同源算法适用于各种不同类型的物质,如DNA、RNA、蛋白质等。
(2)速度快:基因同源算法的计算速度非常快,可以快速的处理大量的基因序列数据。
(1)存在误差:用于构建数据库的基因序列可能存在错配、缺失、替换等情况,从而影响比对的准确性。
(2)对计算资源有要求:由于基因同源算法需要大量的计算资源,因此在低配置的计算机上很难快速处理大规模的基因序列数据。 (3)无法适应序列长度不同的情况:基因同源算法在处理序列长度不同的情况下,比对结果会产生一些差异。
BLAST种类及使用方法
BLAST种类及使用方法
BLAST(Basic Local Alignment Search Tool)是一种广泛使用的序列比对算法,可用于比较DNA,RNA或蛋白质序列的相似性。它是生物信息学领域中最常用的工具之一,可以帮助研究人员识别新的序列,注释基因功能,鉴定物种间的进化关系等。
1.BLASTN:BLASTN用于比对DNA序列。它可以将一个查询DNA序列与已知的DNA序列数据库进行比较,找到相似的序列。BLASTN通常用于物种鉴定、基因组注释和寻找同源基因等方面的研究。
2.BLASTP:BLASTP用于比对蛋白质序列。它可以将一个查询蛋白质序列与已知的蛋白质数据库进行比较,找到相似的蛋白质序列。BLASTP通常用于寻找同源蛋白质,预测蛋白质功能和结构,以及识别蛋白质家族等方面的研究。
3.BLASTX:BLASTX用于比对DNA序列与蛋白质数据库的比对。它通过将DNA序列翻译成蛋白质序列,然后与已知的蛋白质数据库进行比对,找到相似的蛋白质序列。BLASTX通常用于从未知的DNA序列中预测蛋白质编码区域,注释基因功能等方面的研究。
4. TBlastN:TBlastN用于比对蛋白质序列与DNA数据库的比对。与BLASTX相反,TBlastN将已知的蛋白质序列与DNA数据库进行比对,找到相似的DNA序列。TBlastN通常用于寻找蛋白质在基因组中的编码区域,确定启动子和转录因子结合位点等方面的研究。
5. TBlastX:TBlastX用于比对转录本与转录本数据库的比对。它可以将一个查询转录本序列与已知的转录本数据库进行比对,找到相似的转录本。TBlastX通常用于寻找新的转录本和预测基因表达模式等方面的研究。
使用BLAST有以下几个步骤:
1.准备查询序列:将待比对的DNA、RNA或蛋白质序列准备成文本文件,确保序列格式正确,并确保序列长度适合比对任务。
2. 选择数据库:根据研究需求,选择适当的数据库。BLAST提供了多个公共数据库,如NCBI的GenBank、RefSeq等数据库,以及其他一些专门的数据库。
blast 术语
Alignment: 序列比对。将两个或多个序列排在一起,以达到最大一致性的过程(对于氨基酸序列是比较它们的保守性),这样可以评估序列间的相似性和同源性。
Algorithm: 算法。在计算机程序中包含的一种固定过程。
Bit score: 二进制。二进制值S'源于统计性质被数量化的打分系统中产生的原始比对分数S。由于二进制值相对于打分系统已经被标准化,它们常用于比较不同搜索之间的比对分数。
BLOSUM: 模块替换矩阵。在替换矩阵中,每个位置的打分是在相关蛋白局部比对模块中观察到的替换的频率而获得的。每个矩阵被修改成一个特殊的进化距离。例如,在BLOSUM62矩阵中,是使用一致性不超过62%的序列进行配对来获得打分值的。一致性大于62%的序列在配对时用单个序列表示,以避免过于强调密切相关的家族成员。
Conservation: 保守。指氨基酸或DNA(普遍性较小)序列某个特殊位置上的改变,并不影响原始序列的物理化学性质。
Domain: 结构域。蛋白质在折叠时与其他部分相独立的一个不连续的部分,它有着自己独特的功能。
DUST: 一个低复杂性区段过滤程序。
E value: E值。期望值。在一个数据库中所搜索到的打分值等于或大于S的不同比对的个数。E值越低,表明该打分值的显著性越好。
Filtering: 过滤,也叫掩蔽(masking)。指对那么经常产生乱真的高分数的核苷酸或氨基酸序列区域进行隐藏的过程。
Gap: 空位。在两条序列比对过程中需要在检测序列或目标序列中引入空位,以表示插入或删除。为了避免在比对时出现太多的空位,可以在收入空位的同时,从比对的打分值中减去一个固定值(空位值)。在多余的核苷酸或氨基酸周围引入空位时,也要对比对的打分值进行罚分。
Global Alignment: 整体联配。对两个核苷酸或蛋白质序列的全长进行的比对。
H: 相对熵值。目标残基和底物残基频率的相对熵记作H。H可以衡量某个位置(这个位置可以通过概率来区分比对)上由于偶然因素而得到的平均信息(用字节表示)。H值越高,短的比对就越可以通过概率来区分;H值越低,需要的比对长度越长。
BLAST和FASTA
1 实习三 相似序列的数据库搜索 BLAST/FASTA
一、实习目的
掌握BLAST和FASTA数据检索方法。
二、实习内容
BLAST和FASTA程序是目前最常用的基于局部相似性的数据库搜索程序,它们都基于查找完全匹配的短小序列片段,并将它们延伸得到较长的相似性匹配。它们的优势在于可以在普通的计算机系统上运行,而不必依赖计算机硬件系统而解决运行速度问题。
(一)BLAST
BLAST (Basic Local Alignment Search Tool)是NCBI提供的进行序列相似性搜索的工具。BLAST算法得基本思路是首先找出检测序列和目标序列之间相似性程度最高得片段,并作为内核向两端延伸,以找出尽可能长得相似序列片段。BLAST程序之所以使用广泛,主要因为其运行速度比FASTA等其它数据库搜索软件要快。与ENTREZ提供的文本搜索不同,BLAST以核酸或蛋白质序列作为搜索条件(query),搜索指定数据库中与query相似度较高,甚至同源的序列。
/Blast.cgi
(二)BLASTP
PSI-Blast和PHI-Blast是在普通BLAST的基础上发展起来的两个新程序,是将双序列比对和多序列比对结合在一起的数据库搜索方法,可通过多次迭代搜索出蛋白质家族或超家族中序列相似性较低的成员,弥补了普通BLAST难于找到进化距离较远的同源序列的不足。PSI-Blast程序的主要思想是通过多次迭代找出最佳结果。第一次blast搜索后,利用结果中最相似的序列重新构建位点特异性打分矩阵(PSSM),然后再使用该矩阵进行第二轮blast搜索,再调整矩阵,搜索,如此迭代,直到找出最佳搜索结果。最终高度保守的区域就会得到比较高的分值,而不保守的区域则分数降低。这样可以提高blast搜索的灵敏度,从而有利于发现进化距离较为遥远的同源序列。
三、作业
在NCBI上搜索拟南芥(Arabidopsis thaliana)的ATP sulfurylase的核酸和蛋白质序列,用它尝试进行BLASTN和PSI-BLAST搜索,给出每一步搜索的参数设置及选择原因,分析搜索结果(找到的是其它物种中的ATP sulfurylase,还是执行其它相似功能的序列)。
