BioEdit及MEGA分析序列同源性简介
利用系统进化分析软件对序列进行同源性分析
1.0 目的
1.1 为了保持国际上各个耐药性实验室的高检验水准,进行分子进化分析是有很重要作用的。它不仅可以保证流行病学目的顺利实现,而且有利于发现检测阶段可能产生的潜在的交叉污染。
1.2 利用此软件进行分析所得的信息对于进行艾滋病毒在人群中传播的流行病学研究具有十分重要的意义。
1.3 通过对实验室之前分析的数据与当前数据进行比较,可以发现在此前实验过程中由于标本处理不当所导致的潜在的实验室污染。
1.4 对于确保得到高质量的实验结果并及时发现可能出现在实验室里的问题具有重要意义。
2.0 仪器设备
2.1 计算机一台。
2.2 Windows 95以上的操作系统。
2.3 BioEdit 以及 MEGA 4 分析软件。
2.3.1 均为免费软件,可以从互联网上下载,在计算机上进行安装。
3.0 操作过程
3.1 局限及要求
3.1.1 经过序列编辑软件拼接处理后的txt文件或fasta文件均可,例如ChromasPro软件。
3.1.2 可以在MEGA上分析的分子序列或距离矩阵数据。
3.1.3 Mega 4软件只能将长度相等的序列转换为MEGA输出文件,因此,任何多序列文件必须通过BioEdit软件进行对齐修剪,然后才能进入通过Mega软件转换成*.meg格式进行分析。
3.1.4 该数据集的大小受限于计算机上可用的物理(RAM)和虚拟内存。
3.1.5 分析的序列必须包括两个或两个以上长度相同的序列,所有序列分析之前必须用MEGA软件对齐。
3.1.6 核苷酸和氨基酸序列应该用英文字母连续书写,不区分大小写。一些特殊的特殊符号,例如表示对齐缺口,碱基缺失等的符号也可以包含在序列中。
3.1.7 空格和制表符经常用于数据文件中,因此会被MEGA忽略。
ASCII字符,如(.)( - )(?),一般都作为特殊符号来表示序列中的不同碱基,分别表示第一个序列,对齐缺口及碱基缺失。
3.1.8 BioEdit 软件进行序列比对
3.1.9 双击BioEdit 图标 打开BioEdit 序列对比编辑器窗口。
3.1.10 从工具栏上,单击new alignment图标打开一个新窗口。
3.1.11 点击 File 菜单, 选择 import and sequence alignment file
3.1.12 出现一个新窗口, 选择要导入的文件存储地址及文件名, 点击 open. 所有需要的序列都会在导入窗口中呈现。
3.1.13 点击Edit 并选择 Select All Sequences,现在可以准备对所有的序列进行比对。
3.1.14 点击 Accessory Application 并选择ClustalW Multiple
alignment ,打开一个新窗口。
3.1.15 点击窗口下方的 Run ClustalW ,将打开一个新窗口,点击下方的OK.
3.1.16 序列比对将进行,进行的时间取决于所要比对的序列的长度及数量。
3.1.17 比对结束后,经过比对的序列将呈现在一个新窗口中。
3.1.18 将模式(Mode)栏中改为edit,即可对序列进行剪切,使其长度一致。
3.2 比对及编辑结束后,点击File 并选择 Save 保存比对后的文件.
3.3 用MEGA软件分析进行距离和系统进化分析
3.3.1 双击MEGA4 图标打开 MEGA4.
3.3.2 序列比对格式转换:
3.3.2.1 从 File 菜单中, 选择 Convert To Mega Format,
打开 Text and Format Converter 窗口。
3.3.2.2 选择屏幕中间的 Format 对话框。
3.3.2.3 选择要导入的文件存储地址及文件名, 点击OK,在Text and Format Converter窗口中出现mega
格式的文件。
3.3.2.4 保存文件,关掉此页面返回MEGA4.主界面。
3.3.3 打开 mega 文件
3.3.3.1 从File 菜单中打开 mega文件, 选择 open data, 或从窗口中打开 Click me to active a data file. 3.3.3.2 打开文件后, Input Data 对话框将出现. 在左侧一栏选择Nucleotide Sequences,默认右侧当前选择,点击OK.
3.3.3.3 出现一个 Confirm 对话框, 点击Yes.
3.3.3.4 Select Genetic Code box opens被打开,通常默认所有选项,点击OK .
3.3.3.5 文件名及信息将会出现在窗口下方。
3.3.4 打开Mega文件后
3.3.4.1 File 菜单中, 进行编辑, 导出或转换文件。
3.3.5 Data 菜单中, 可以用不同形式浏览文件,例如转换成氨基酸形式。
3.3.6 距离分析
3.3.6.1 Distances 菜单中, 选择Compute Pairwise. 出现Analysis Preferences 窗口。
3.3.6.2 在Distance options 列表中, 选择 Nucleotide:
Kimura 2-parameter for Models, 选择 Distances
only for Comput, 并选择d: Transitions +
transversions for Substitutions to include.
3.3.6.3 Include Sites list, 选择 Complete Deletion for
Handling Gap/Missing Data, 选择 1st, 2nd, 3rd for
Codon Positions/Sites Included, 点击 OK.
3.3.6.4 Pairwise Distances 窗口打开,在文件中将显示每两个序列距离的矩阵。
3.3.7 File 菜单中, 选择Export/Print Distances, 在Text and
Format Converter 窗口中将出现一个名为 Distances 的文件,它显示了所有的信息及距离矩阵,保存后可以用记事本或写字板打开。
3.3.8 进化分析
3.3.8.1 Phylogeny菜单中,选择Neibour-Joining(NJ),
Analysis Preferences 框将打开。
3.3.8.2 在Distance options 列表中, 选择Nucleotide:
Kimura 2-parameter for Models, 选择 Distances
only for Comput, 选择d: Transitions +
transversions for Substitutions to include. 3.3.8.3 Include Sites list, 选择 Complete Deletion for
Handling Gap/Missing Data, 选择1st, 2nd, 3rd for
Codon Positions/Sites Included.
3.3.8.4 在Test of Phylogeny 列表中, 选择Bootstrap for
Test of Inferred Phylogeny.
3.3.8.5 屏幕的右侧将出现一个小对话框,选择1000 for
Replications, 然后点击OK, 进程框将打开。
3.3.8.6 进程结束后, Tree Explorer 窗口将显示两种进化树 。同源树Original tree 是我们所需要的。
3.3.8.7 File菜单中, you can save the tree data as可以将所做的树通过Save键保存成Tree Session File(*.mts), 或者选择Export Current Tree得到 Tree Data
File(*.tre)文件, 两种格式的文件都能被MEGA或其他软件所识别。
3.3.8.8 Image 菜单中, 选择Copy to Clipboard, 进化树即可被复制并粘贴到word文档或ppt文档中进一部编辑。
3.3.9 交叉污染的判断:
3.3.9.1 如果有两个或者更多的序列在进化树中距离非常接近或者两个分支有相同的结点且有相同的水平距离,而序列之间又没什么流行病学联系, 那么这些标本则需要从核酸提取阶段进行重复检测,以此验证它们之间的相近关系并排除交叉污染。
3.4 亚型的初步分析:
3.4.1 用NCBI 基因分型工具进行亚型的初步分析。
3.4.2 双击下面的网址
3.4.3 在相应位置填入序列的FASTA/GI /Accession 格式文件。
3.4.4 点击亚型按钮。
3.4.5 出现一个扫描窗口,如果序列是单一的亚型,记录结果,如果是复杂的重组亚型,则需要对序列进行详细的系统进化分析。
蛋白质序列分析
蛋白质序列、性质、功能和结构分析
基于网络的蛋白质序列检索与核酸类似,从NCBI或利用SRS系统从EMBL检索。
1、疏水性分析
ExPASy的ProtScale程序(/cgi-bin/protscale.pl)可用来计算蛋白质的疏水性图谱。输入的数据可为蛋白质序列或SWISS-PROT数据库的序列接受号。也可用BioEdit、DNAMAN等软件进行分析。
2、跨膜区分析
蛋白质跨膜区域分析的网络资源有:
TMPRED:/software/TMPRED_form.html
PHDhtm:
http:www.embl-heidelberg.de/Services/sander/predictprotein/predictprotein.html
MEMSAT: ftp://
3、前导肽和蛋白质定位
一般认为,蛋白质定位的信息存在于该蛋白自身结构中,并且通过与膜上特殊受体的相互作用得以 表达。这就是信号肽假说的基础。这一假说认为,穿膜蛋白质是由mRNA编码的。在起始密码子后,有一段疏水性氨基酸序列的RNA片段,这个氨基酸序列就称 为信号序列(signal sequence)。
蛋白质序列的信号肽分析可联网到http://genome.cbs.dtu.dk
/services/SignalP/或其二版网址http://genome.cbs.dtu.dk/services/SignalP-2.0/。该 服务器也提供利用e-mail进行批量蛋白质序列信号肽分析的方案(http://genome.cbs.dtu.dk/services /SignalP/mailserver.html),e-mail地址为signalp@ genome.cbs.dtu.dk。
蛋白质序列中含有的信号肽序列将有助于它们向细胞内特定区域的移动,如前导肽和面向特定细胞 器的靶向肽。在线粒体蛋白质的跨膜运输过程中,通过线粒体膜的蛋白质在转运之前大多数以前体形式存在,它由成熟蛋白质和N端延伸出的一段前导肽或引肽 (leader peptide)共同组成。迄今有40多种线粒体蛋白质前导肽的一级结构被阐明,它们约含有20~80个氨基酸残基,当前体蛋白跨膜时,前导肽被一种或两 种多肽酶所水解转变成成熟蛋白质,同时失去继续跨膜能力。前导肽一般具有如下性质:①带正电荷的碱性氨基酸(特别是精氨酸)含量较丰富,它们分散于不带电 荷的氨基酸序列中间;②缺失带负电荷的酸性氨基酸;③羟基氨基酸(特别是丝氨酸)含量较高;④有形成两亲(即有亲水又有疏水部分)α-螺旋结构的能力。和 信号肽与跨膜区结构一样,蛋白质的亚细胞定位也和其功能密切相关,蛋白质亚细胞定位分析可通过如下网址进行:http://predict. /nnpsl/nnpsl_mult.cgi。
云南鬼针草上发现鬼针草斑驳病毒
云南鬼针草上发现鬼针草斑驳病毒
王建光;陈海如;苏云松;孔宝华;范静华
【期刊名称】《中国农业科学》
【年(卷),期】2009(042)005
【摘 要】[目的]鉴定侵染鬼针草引起花叶或斑驳的病原.[方法]利用电镜技术观测病原粒子;间接ELISA方法鉴定病原与马铃薯Y病毒属病毒的血清学关系;分子生物学技术克隆了病原3'-端序列;BLAST,Clustal-x,BioEdit和MEGA 4.0等生物信息学软件用于所得序列的序列分析.[结果]在电镜下可观察到长约650-700 nm×13 nm左右的线状病毒粒子和风轮状内含体;利用Potyvirus PathoScren试剂金检测呈阳性;用马铃薯Y病毒科病毒简并引物可扩增获得一条约1 800 bp的片段;序列分析表明该序列与鬼针草斑驳病毒相应序列高度相似,外壳蛋白的氨基酸同源性及3'-UTR核苷酸同源性均达96%以上.[结论]侵染云南鬼针草引起花叶或斑驳症状的病原为鬼针草斑驳病毒,这是该病毒侵染中国鬼针草属植物的首次报道.
【总页数】5页(P1849-1853)
【作 者】王建光;陈海如;苏云松;孔宝华;范静华
【作者单位】农业生物多样性与病虫害控制教育部重点实验室,云南省植物病理重点实验室,云南农业大学,昆明,650201;农业生物多样性与病虫害控制教育部重点实验室,云南省植物病理重点实验室,云南农业大学,昆明,650201;云南省玉溪市烟草公司,云南玉溪,650201;农业生物多样性与病虫害控制教育部重点实验室,云南省植物病理重点实验室,云南农业大学,昆明,650201;农业生物多样性与病虫害控制教育部重点实验室,云南省植物病理重点实验室,云南农业大学,昆明,650201 【正文语种】中 文
【中图分类】S6
【相关文献】
1.三叶鬼针草中黄酮甙对烟草花叶病毒的抑制作用 [J], 陈启建;刘国坤;吴祖建;林奇英;谢联辉
2.巴西专家发现白花鬼针草有抗癌功效 [J],
2014—2016年河南省鼠类携带汉坦病毒的病原学分析
2014—2016年河南省鼠类携带汉坦病毒的病原学分析
杜燕华;李懿;马宏;王海峰;许汴利;黄学勇
【摘 要】目的 分析河南省鼠类携带汉坦病毒的基因型别和病原学特点.方法 选取2014—2016在驻马店市确山县捕获的600只鼠类标本,分析该地区野外和居住区优势鼠种和鼠密度.采用RT-PCR法扩增鼠肺标本中汉坦病毒的特异性片段(M和S片段),以M片段(2003~2302 nt)构建系统发生树,分析基因亚型和进化特点.结果
确山县野外优势鼠种为褐家鼠和黑线姬鼠,鼠密度在1.33%~1.83%;居住区优势鼠种为褐家鼠、小家鼠和黄胸鼠,鼠密度1.36%~1.97%.RT-PCR结果 显示2014年3只鼠携带汉坦病毒,鼠种分别为小家鼠、大仓鼠和褐家鼠.3株病毒M片段和S片段核苷酸同源性均为100%,基于M片段的系统进化分析显示属于S4亚型汉城型汉坦病毒,与韩国和我国湖北省分离的病毒亲缘关系较近.结论 河南省确山县鼠类携带的汉坦病毒为S4亚型,宿主范围广泛,有必要采取相关防控措施,预防肾综合征出血热的流行.%Objective To analyze the genotyping of hantavirus and
investigate the pathogenic features of local rats in Henan province.
Methods A total of 600 rats captured in Queshan county, Zhumadian city
from 2014-2016 were chosen to find out the major species and density.
Rat lung specimens were detected by RT-PCR using partial M and S
segment primers, then sequencing and phylogenetic analysis based on M
dnaman比对序列结果解读
dnaman比对序列结果解读
根据您提供的信息,"dnaman"应该指的是DNA比对软件"DnaMAN"。DNA比对是一种将两个或多个DNA序列进行比较的分析方法,以确定它们之间的相似性和差异性。
"DnaMAN"软件的结果解读通常包括以下几个方面:
1. 序列相似性:该软件会计算DNA序列之间的相似性分数,通常以百分比表示。较高的相似性分数表示两个序列之间更相似。
2. 序列对齐:软件会根据相似性算法将输入的DNA序列进行配对对齐,以使相同的碱基对齐在一起,从而揭示其相似性和差异性。
3. 碱基差异:比对结果可能会指示在两个序列之间存在的碱基差异,包括插入、缺失或替换等。
4. 序列特征:软件还可以鉴定序列中的重复序列、基因、启动子或其他相关特征,并提供这些信息。
总之,"DnaMAN"比对序列的结果解读将提供关于DNA序列相似性、差异、对齐和特征的相关信息,以帮助研究者进一步理解DNA序列之间的关系和功能。
生物信息学资料
1
1
生物信息学资料
生物信息学
绪论
1.HGP
通过国际合作,用15年时间(1990~2005)至少投入30亿美元,构建详细的人类基因组遗传图和物理图 ,确定人类DNA的全部核苷酸序列,定位约2.5万基因,并对其它生物进行类似研究。
2.我国自主产权的全基因组测序计划
水稻 (2002)家鸡 (2004)家蚕 (2004)家猪 (2012)大熊猫 (2009)
3.生物信息学的概念
采用信息科学技术,借助数学、生物学的理论、方法,对各种生物信息(包括核酸、蛋白质等)的收集、加工、储存、分析、解释的一门学科。
收集、加工、储存:计算机科学家
分析、解释:生物学家
4.生物信息学的发展历史
20世纪50年代,生物信息学开始孕育
20世纪60年代,生物分子信息在概念上将计算
生物学和计算机科学联系起来
20世纪70年代,生物信息学的真正开端(序列比对算法)
20世纪80年代初期,生物信息分析方法的发展
20世纪80年代以后,生物信息服务机构和数据库
20世纪90年代后 ,HGP促进生物信息学的迅速发展
1956: 美国田纳西州首次召开了“生物学中的理论研讨会”;
1962: Zucherkandl和Pauling研究了序列变化与进化的关系,开创了一个新的领域——分子进化;
1967: Dayhoff研制出蛋白质序列图集,即后来著名的蛋白质信息源PIR;
1970: Needleman和Wunsch提出了著名的序列比对算法,是生物信息学发展中最重要的贡献;
1970: Gibbs和McIntyre发表著名的矩阵打点做图法;
1978: Gingeras等人研制了核酸序列中酶切位点识别程序;
1981: Smith和Waterman提出了著名的公共子序列识别算法,同年Doolittle提出了关于序列模式的概念;
1982: GenBank第3版本正式发行;
1983: Wilbur和Lipman发表了数据库相似序列搜索算法;
生物信息论文
豌豆凝集素基因(Pisum sativum lectin ,PSL1)
的生物信息学分析
摘 要:大量的蛋白质和核酸数据的积累与理性地分析这些数据中所蕴涵的生物学意义的双重需要,产生了综合生物学研究与计算技术研究等领域最新成果的交叉性学科生物信息学。本文就是利用生物信息学手段来研究豌豆凝集素基因(Pisum sativum lectin ,PSL1)的一些基本性质,该序列全长1659bp,读码框828nt,编码275个氨基酸。该基因编码的豌豆凝集素在豌豆与根瘤菌相互作用识别过程中起到重要作用,因此,对该序列的研究与利用将对整个生物固氮领域有着重要意义。
关键词:生物信息;PSL1;序列分析
Bioinformatics Analysis on PSL 1 Gene
Abstract: A large number of proteins and nucleic acids of data accumulation and rational analysis
of these data implied the biological significance of the dual need to produce a comprehensive
biological research and calculation of latest achievements in research areas such as
cross-discipline of bioinformatics. This paper is the use of bioinformatics tools to study the pea
lectin gene (Pisum sativum lectin, PSL1) some of the basic properties,whose total-length was
1659bp,and the longest cds of PSL1 gene was 828nt, which encoded 275 amino acids.PSL1 gene
关于分子生物学中的同源性分析
龙源期刊网
关于分子生物学中的同源性分析
作者:李尚伟 杜娟
来源:《教育教学论坛》2014年第51期
摘要:同源性是指在进化过程中源于同一祖先的分支之间的关系,包括直系同源和旁系同源。直系同源基因描述在不同物种中来自于共同祖先的基因,而旁系同源基因描述在同一物种内由于基因复制而分离的同源基因。同源性与相似性是两个不同的概念,前者是质的概念,后者突出量的描述,但它们之间又有一定关系,可以通过相似性来推测序列是否具有同源性。介绍了用BLAST进行序列同源性分析的方法。
关键词:同源性;直系同源;旁系同源;相似性;BLAST
中图分类号:G642.0 文献标志码:A 文章编号:1674-9324(2014)51-0184-02
在分子生物学的教学及研究中,经常对核苷酸或氨基酸序列进行比对以确定基因之间或蛋白质之间的同源关系,进而根据同源性来推测物种间的亲缘关系。基因或蛋白质之间的同源关系包括直系同源和旁系同源,序列间的同源性可用相似性或一致性来进行量化,用相似性(一致性)来判断序列是否同源。
一、同源性的概念
在生物学中,同源性(homology)是指在进化过程中源于同一祖先的分支之间的关系。我们可以在生物学的不同层次(如形态性状、分子性状等)上进行同源性分析,形态性状由于进行上或个体发育上的共同来源而呈现出本质上的相似性,但其功能不一定相同,那么它们就是同源的,如马的前肢与鸟的翅就是同源器官。在分子水平上同源性主要是指基因的核苷酸序列或蛋白质的氨基酸序列之间的相似程度。同源基因或蛋白质(homolog)指遗传上从某一共同祖先经趋异进化而形成的具有不同序列的基因或蛋白质。同源性是一个相对的概念,在一定水平和范围内对其研究才有意义[1]。
二、直系同源与旁系同源
同源关系包括两种类型:直系同源(ortholog)和旁系同源(paralog)。这里我们主要以同源基因为例来进行讨论,同源蛋白质是同样的情况。同源基因是遗传上来自某一共同祖先DNA序列的基因,包括直系同源基因和旁系同源基因。直系同源基因,又称直向或垂直同源基因,指的是这样一些基因,它们起源于这些基因所在物种的最近共同祖先的一个祖先基因。这些基因通常具有相同的功能,但并不是绝对的,当我们比较直系同源基因时,可能会发现有的基因失去了原来的功能或者进化出了新的功能[2-5]。因此,直系同源基因描述在不同物种中来自于共同祖先的基因。 龙源期刊网
生物信息学分析方法
核酸和蛋白质序列分析
蛋白质, 核酸, 序列
关键词: 核酸序列? ? 蛋白质序列? ? 分析软件? ?? ?? ?? ?? ?? ?? ?? ?? ?? ?? ??
在获得一个基因序列后,需要对其进行生物信息学分析,从中尽量发掘信息,从而指导进一步的实验研究。通过染色体定位分析、内含子/外显子分析、ORF分析、表达谱分析等,能够阐明基因的基本信息。通过启动子预测、CpG岛分析和转录因子分析等,识别调控区的顺式作用元件,可以为基因的调控研究提供基础。通过蛋白质基本性质分析,疏水性分析,跨膜区预测,信号肽预测,亚细胞定位预测,抗原性位点预测,可以对基因编码蛋白的性质作出初步判断和预测。尤其通过疏水性分析和跨膜区预测可以预测基因是否为膜蛋白,这对确定实验研究方向有重要的参考意义。此外,通过相似性搜索、功能位点分析、结构分析、查询基因表达谱聚簇数据库、基因敲除数据库、基因组上下游邻居等,尽量挖掘网络数据库中的信息,可以对基因功能作出推论。上述技术路线可为其它类似分子的生物信息学分析提供借鉴。本路线图及推荐网址已建立超级链接,放在北京大学人类疾病基因研究中心网站( ),可以直接点击进入检索网站。
? ?下面介绍其中一些基本分析。值得注意的是,在对序列进行分析时,首先应当明确序列的性质,是mRNA序列还是基因组序列?是计算机拼接得到还是经过PCR扩增测序得到?是原核生物还是真核生物?这些决定了分析方法的选择和分析结果的解释。
(一)核酸序列分析
1、双序列比对(pairwise alignment)
? ?双序列比对是指比较两条序列的相似性和寻找相似碱基及氨基酸的对应位置,它是用计算机进行序列分析的强大工具,分为全局比对和局部比对两类,各以Needleman-Wunsch算法和Smith-Waterman算法为代表。由于这些算法都是启发式(heuristic)的算法,因此并没有最优值。根据比对的需要,选用适当的比对工具,在比对时适当调整空格罚分(gap penalty)和空格延伸罚分(gap extension penalty),以获得更优的比对。
构建系统发育树需要注意的几个问题
路漫漫其修远兮,吾将上下而求索 -
百度文库
11 构建系统发育树需要注意的几个问题
1 相似与同源的区别:只有当序列是从一个祖先进化分歧而来时,它们才是同源的。
2 序列和片段可能会彼此相似,但是有些相似却不是因为进化关系或者生物学功能相近的缘故,序列组成特异或者含有片段重复也许是最明显的例子;再就是非特异性序列相似。
3 系统发育树法:物种间的相似性和差异性可以被用来推断进化关系。
4 自然界中的分类系统是武断的,也就是说,没有一个标准的差异衡量方法来定义种、属、科或者目。
5 枝长可以用来表示类间的真实进化距离。
6 重要的是理解系统发育分析中的计算能力的限制。任何构树的实验目的基本上就是从许多不正确的树中挑选正确的树。
7 没有一种方法能够保证一颗系统发育树一定代表了真实进化途径。然而,有些方法可以检测系统发育树检测的可靠性。第一,如果用不同方法构建树能得到同样的结果,这可以很好的证明该树是可信的;第二,数据可以被重新取样(bootstrap),来检测他们统计上的重要性。
分子进化研究的基本方法
对于进化研究,主要通过构建系统发育过程有助于通过物种间隐含的种系关系揭示进化动力的实质。
表型的(phenetic)和遗传的(cladistic)数据有着明显差异。Sneath和Sokal(1973)将表型性关系定义为根据物体一组表型性状所获得的相似性,而遗传性关系含有祖先的信息,因而可用于研究进化的途径。这两种关系可用于系统进化树(phylogenetictree)或树状图(dendrogram)来表示。表型分枝图(phenogram)和进化分枝图(cladogram)两个术语已用于表示分别根据表型性的和遗传性的关系所建立的关系树。进化分枝图可以显示事件或类群间的进化时间,而表型分枝图则不需要时间概念。文献中,更多地是使用“系统进化树”一词来表示进化的途径,另外还有系统发育树、物种树(species tree)、基因树等等一些相同或含义略有差异的名称。
BioEdit及MEGA分析序列同源性简介
利用系统进化分析软件对序列进行同源性分析
1.0 目的
1.1 为了保持国际上各个耐药性实验室的高检验水准,进行分子进化分析是有很重要作用的。它不仅可以保证流行病学目的顺利实现,而且有利于发现检测阶段可能产生的潜在的交叉污染。
1.2 利用此软件进行分析所得的信息对于进行艾滋病毒在人群中传播的流行病学研究具有十分重要的意义。
1.3 通过对实验室之前分析的数据与当前数据进行比较,可以发现在此前实验过程中由于标本处理不当所导致的潜在的实验室污染。
1.4 对于确保得到高质量的实验结果并及时发现可能出现在实验室里的问题具有重要意义。
2.0 仪器设备
2.1 计算机一台。
2.2 Windows 95以上的操作系统。
2.3 BioEdit 以及 MEGA 4 分析软件。
2.3.1 均为免费软件,可以从互联网上下载,在计算机上进行安装。
3.0 操作过程
3.1 局限及要求
3.1.1 经过序列编辑软件拼接处理后的txt文件或fasta文件均可,例如ChromasPro软件。
3.1.2 可以在MEGA上分析的分子序列或距离矩阵数据。
3.1.3 Mega 4软件只能将长度相等的序列转换为MEGA输出文件,因此,任何多序列文件必须通过BioEdit软件进行对齐修剪,然后才能进入通过Mega软件转换成*.meg格式进行分析。
3.1.4 该数据集的大小受限于计算机上可用的物理(RAM)和虚拟内存。
3.1.5 分析的序列必须包括两个或两个以上长度相同的序列,所有序列分析之前必须用MEGA软件对齐。
3.1.6 核苷酸和氨基酸序列应该用英文字母连续书写,不区分大小写。一些特殊的特殊符号,例如表示对齐缺口,碱基缺失等的符号也可以包含在序列中。
3.1.7 空格和制表符经常用于数据文件中,因此会被MEGA忽略。
ASCII字符,如(.)( - )(?),一般都作为特殊符号来表示序列中的不同碱基,分别表示第一个序列,对齐缺口及碱基缺失。
