南京工业大学《生物信息学》期末复习
生工1202生物信息学考试参考资料1、生物信息学的主要应用有哪些?①生物信息学数据库:数据库建立、数据库整合和数据挖掘②序列分析:序列比对、基因序列注释③其他:比较基因组学、基因和蛋白质的表达分析、生物芯片大规模功能表达谱的分析、蛋白质结构的预测、蛋白质与蛋白质的相互作用、生物系统模拟、代谢网络建模分析、计算机进化生物学、生物多样性研究、合成生物学2、生物学数据库有哪些特点?①数据库的更新速度不断加快、数据量呈指数增长②数据库使用频率增长更快③数据库的复杂程度不断增加④数据库网络化⑤面向应用⑥先进的软硬件配置3、一级数据库和二级数据库的区别是什么?有哪些一级数据库和二级数据库?一级数据库属于档案数据库,库中的主要内容是来源于实验室操作所得到的原始数据结果;二级数据库则是在一级数据库的信息基础上进行了计算加工处理并增加了许多人为的注释而构成的一级数据库:核酸序列数据库GenBank、EMBL、DDBL及蛋白质数据库PDB二级数据库:NCBI的RefSeq数据库4、数据库的Fasta、Flat file和XML格式各有何特点?(1)FASTA序列格式包括三个部分:(书上没有PPT第二章第19-20页)1.在注释行的第一列用字符“>”标识,后面是序列的名字和来源;2.标准的单字符标记的序列;3.可选的“*”表示序列的结束,它可能出现也可能不出现,但它是许多序列分析程序正确读取序列所必须的。
提供了从一个窗口到另一个窗口非常方便的拷贝途径,序列中没有数字或其他非字符。
从第二行开始是序列本身,标准核苷酸符号(大小写均可)或氨基酸单字母符号(大写)。
(2)平面文件格式—Flat File纯文本文件、通用性好、检索复杂,冗余字段较多,大容量数据库难以处理(3)XML格式(PPT第二章第29、32页)一个XML文件代表一个嵌套的信息树。
树中的每一个节点能包含像一串子节点或者一些属性这样的数据,并且一个XML文件始于根节点。
一个XML文件有一个文本,在文本中每一个节点的内容及其子节点被一对相互封闭的标签划定。
形式上类似html。
5、GenBank数据库中的GenBank条目包含哪些内容?请结合GenBank中的具体的序列信息加以说明。
GenBank数据库(包括NCBI核酸和蛋白质序列数据库)中条目格式如下:给出描述每一个序列的信息,包括文献参考、序列的功能信息、mRNA和编码区域的位置,以及重要突变的位置。
例:这些序列信息以字段的形式进行组织,每一行最前端都有一个标识符。
在某些条目中,标识符可能缩写成两个字母(例如RF 代表reference),某些字段可能还有次级字段。
计算机程序中的序列条目位于标识符“ORIGIN”和“//”之间。
这些字段提供的信息可以参见网页/Sitemap/samplerecord.html序列每行前面标有数字,以显示片断位置。
序列计数或序列校检求和的值可被计算机程。
用来鉴定序列成分,所以除非程序本身也改变计数,序列计数是不能被改变的。
GenBank 序列格式通常需要改变以适应序列分析软件。
6、蛋白质序列数据库有哪些?SWISS-PROT、PIR7、序列比对在什么情况下选择核苷酸序列?在什么情况下选择蛋白质序列?核苷酸序列:①在确认给定DNA 序列和DNA 数据库中的序列的一致性时②在搜索多态性时③在分析所克隆的cDNA 片段的一致性时蛋白质序列:由于蛋白质序列比DNA 所含信息多,所以除以上情况外用蛋白质序列8、请比较同源性、同一性和相似性三个概念。
同源性:是指从某个共同祖先经趋异进化而形成的不同序列,也就是从一些数据中推断出的两个基因在进化上具有共同祖先的结论,是质的判断同一性:是指两序列在同一位点核苷酸或氨基酸残基完全相同的序列比例相似性:两序列间直接的数量关系,如部分相同,相似的百分比或其他一些合适的度量9、举例说明何为直系同源,何为旁系同源?LOCUS name of locus,length and type ofsequence,classification of organism,data of entryDEFINITION desicription of entryACCESSIONaccession number of original source KEYWORDSkey words for cross referencing this entry SOURCE source organism of DNA10、总结BLAST比对程序家族的主要程序,如何选择?11、解读BLAST程序的比对结果所代表的含义。
(1)该搜索的详细情况,包括BLAST搜索的类型、所搜索的数据库的描述、查询内容和分类连接(taxonomy reporter)(2)显示的是数据库中与查询序列相匹配的项的简明图形。
每一条彩色带表示数据库中与查询序列相匹配的蛋白质或核酸序列,不同颜色表示不同高低的得分。
(3)与查询序列相匹配的数据库中的序列列表。
每一条序列包括其Score(bits)、E value 及该序列在相应数据库中的链接。
(4)查询序列与目标序列之间的双序列比对情况。
Score为位记分分数;Expect为期望值;Positives为相似性分值;Identities为同一性分值;Gaps为空位。
12、如何寻找远缘相关的蛋白质?PSI-BLAST是位点特异性迭代BLAST,用来寻找远缘相关的蛋白质序列,对于蛋白质的相似序列的寻找比常规blastp更敏感。
PSI-BLAST工具的比对步骤为:(1)用blastp在目标数据库中进行比对搜索;(2)从第一步中获得的结果构建多序列对比,根据多序列比对构建一个位点特异性矩阵PSSM;(3)用第二步获得的PSSM矩阵再一次搜索目标数据库;(4)位点特异性反复比对后用缺失比对的参数检验每个匹配的统计显著性;反复执行2~4步,一般要重复5次,而当新的结果不再出现或者程序明确指出不会再有新的结果出现时,可以停止比对循环。
13、如何利用BLAST来发现新基因?(1)用一个已知序列蛋白质开始TBLAST比对,搜索一个DNA数据库;(2)检查结果:寻找与已知蛋白质,相关蛋白质的DNA序列匹配,非显著序列的匹配;(3)进行BLASTX NR或BLASTP NR比对(4)用你新发现的DNA或蛋白质搜索一个蛋白质数据库来证实是否真的发现一个新的基因或蛋白质。
14、提供了蛋白质结构的检索和查询服务的数据库主要有哪些?PDB数据库、DSSP数据库、HSSP数据库SCOP CATH15、简要说明四个层次的蛋白质结构。
(一)一级结构蛋白质的一级结构(primary structure)是指多肽链的氨基酸残基的排列顺序。
(二)二级结构蛋白质二级结构(secondary structure)是指多肽链主链原子借助于氢键沿一维方向排列成具有周期性的结构构象,是多肽链局部的空间结构(构象)主要有α螺旋、β折叠、β转角、无规卷曲等形式(三)超二级结构、结构域超二级结构(supersecondary structure)是指相邻的二级结构单元组合在一起,彼此相互作用,排列形成规则的、在空间结构上能够辨认的二级结构组合体,同时充当三级结构的构件,基本形式有αα、ββ、βαβ等。
(四)三级结构三级结构(tertiary structure)是指整条多肽链的三维结构,包括骨架和侧链在内的所有原子的空间排列。
(五)四级结构e四级结构(quat rnary structure)指在亚基和亚基之间通过疏水作用等次级键结合成为有序排列的特定的空间结构。
16、PDB数据库中蛋白质结构信息的存储格式和PDB数据库的检索方法。
PDB数据库以文本文件的方式存放数据,每个分子各用一个独立的文件。
PDB数据库允许用户用各种方式以及布尔逻辑组合(AND、OR和NOT)进行检索,可检索的字段包括功能类别、PDB代码、名称、作者、空间群、分辨率、来源、入库时间、分子式、参考文献、生物来源等项。
17、PDB收录了哪些实验类型的结构数据?X射线晶图谱法,核磁共振法,电子显微镜二维晶体三维结构18、了解蛋白质的结构有何重要意义。
有助于了解打不着如何行使其生物功能,认识蛋白质之间相互作用,对未知通过结构分析进行功能注释,确认功能单位,结构域,可以为遗传操作提供目标为设计新的蛋白质或改造已有蛋白质提供可靠依据,同时为新的药物分子设计提供合理靶分子及结构19、蛋白质结构家族分类数据库主要有哪些?SCOP,CATH,FFSP20、目前蛋白质结构可视化工具主要有哪些?Weblab viewlite,Swiss-PDBviewer,INSiGHTII,RASMOL,3D21、蛋白质结构分析主要包含哪些方面?组织层次、结构测定及预测,蛋白质折叠22、如何进行蛋白质结构比对?有哪些常用的结构比对工具?首先对两个蛋白质结构定义结构相似部分(或称共同子结构);然后通过多次迭代策略来调整共同子结构,直到找出优化的结构比对,即找到两个蛋白质空间上最大的重叠部分。
DALI方法、CE方法、STRUCTURAL方法、SSM方法、TM-align方法23、蛋白质结构预测方法有哪些?蛋白质三级结构的预测方法:同源模建、折叠识别、从头计算法蛋白质二级结构的预测方法:Chou-Fasman方法(简单的统计方法)、GORⅢ(复杂的统计方法)、PHD和PSIPRED(先进的机器学习方法)24、同源建模方法预测蛋白质结构的基本步骤有哪些?1、模板的选择2、待测序列与模板序列的比对3、同源模型的建立4、同源模型精修和评估25、为什么要进行基因组结构注释?开展依赖基因组信息的研究工作,在基因组中鉴定各类功能元件,如编码蛋白质的基因、RNA基因、重复序列和假基因,并确定这些元件的生物学功能。
包括:(1)确定蛋白质编码基因及其外显子-内含子结构,并推断其生物学功能。
(2)进行RNA基因的预测,并推断其功能和相互作用靶标分子。
(3)确定基因组中重复序列的含量和分类。
(4)进行假基因的识别和分类。
26、真核生物蛋白质编码基因中包含哪些功能位点信号和调控元件?功能位点信号:核糖体结合位点、内含子供体和受体剪接位点、内含子分支点、起始和终止密码子、CpG岛。
调控元件:顺式作用元件:其中包括启动子、上游启动元件、增强子、沉默子、Poly(A)尾巴、内在终止子等。
27、常用的编码蛋白质基因的注释方法有哪些?基于证据的注释,从头开始的基因预测,重新基因测定,整合信息,编码基因的功能注释28、什么是EST序列?如何利用EST序列预测基因?EST:完整mRNA转录物的片段。
把来自不同克隆的EST拼接起来形成完整的cDNA弥补其数量缺少的情况利用PASA程序软件将聚类的转录物片段(全长cDNA和EST)拼接成最大对比片段得到完整地或者部分的基因结构,并获得更多的可变剪切的信息29、如何识别假基因?假基因是基因组中与真基因序列相似但缺乏功能的DNA序列鉴定:获得去除重复序列的基因组序列和蛋白质序列,利用BLAST在基因组中授与蛋白质相似的序列,去除与已知基因高度重复序列,去除冗余和重复的BLAST匹配片段,合并相邻的序列,确定假基因对剩余的序列利用FASTA与基因测序比对,与以前的假基因合并,根据两种假基因特征对假基因进行筛选分类30、简述基因组注释的基本流程。
生物信息学期末复习资料(小字)
生物信息学期末复习资料(小字)名词解释或辨析。
1.生物信息学:生物信息学是包含生物信息的获取、处理、贮存、分发、分析和解释的所有方面的一门学科,它综合运用数学、计算机科学和生物学的各种工具进行研究,目的在于了解大量的生物学意义。
2.基因芯片:固定有寡核苷酸、基因组DNA或互补DNA 等的生物芯片。
利用这类芯片与标记的生物样品进行杂交,可对样品的基因表达谱生物信息进行快速定性和定量分析。
3.人类基因组计划:HGP,是一项规模宏大,跨国跨学科的科学探索工程。
其宗旨在于测定组成人类染色体(指单倍体)中所包含的30亿个碱基对组成的核苷酸序列,从而描绘人类基因组图谱,并且辨识其载有的基因及其序列,达到破译人类遗传信息的最终目的。
4.中心法则:分子生物学的基本法则,是1958年由克里克(Crick)提出的遗传信息传递的规律,包括由DNA到DNA的复制,由DNA到RNA的转录和由RNA 到蛋白质的翻译等过程。
20世纪70年代逆转录酶的发现,表明还有由RNA逆转录形成DNA的机制,是对中心法则的补充和丰富。
5.相似性和同源性:相似性(similarity)和同源性(homology)是两个完全不同的概念。
同源序列是指从某一共同祖先经过趋异进化而形成的不同序列。
相似性是指序列比对过程中检测序列和目标序列之间相同碱基或氨基酸残基序列所占比例的大小。
当两条序列同源时,他们的氨基酸或核苷酸序列通常有显著的一致性(identity)。
如果两条系列有一个共同进化的祖先,那么他们是同源的。
这里不存在同源性的程度问题,两条序列要么是同源的要么是不同源的。
1.生物信息学:综合计算机科学、信息技术和数学的理论和方法来研究生物信息的交叉学科。
包括生物学数据的研究、存档、显示、处理和模拟,基因组遗传和物理图谱的处理,核苷酸和氨基酸序列分析,新基因的发现和蛋白质结构的预测等。
2.蛋白质组:指由一个基因组,或一个细胞、组织表达的所有蛋白质。
生物信息学复习题
生物信息学复习题生物信息学是一门结合生物学、计算机科学、信息学和数学的交叉学科,它利用计算机技术来处理和分析生物数据。
以下是一些生物信息学复习题,供同学们参考:1. 生物信息学的定义和应用领域- 生物信息学是如何定义的?- 生物信息学在哪些领域有应用?2. 基因组学基础- 什么是基因组学?- 基因组测序的基本原理是什么?3. 序列比对- 序列比对的目的是什么?- 简述局部比对和全局比对的区别。
4. BLAST算法- BLAST算法的原理是什么?- 如何使用BLAST进行序列相似性搜索?5. 基因表达数据分析- 基因表达数据有哪些类型?- 描述基因表达数据的预处理步骤。
6. 蛋白质结构预测- 蛋白质结构预测的重要性是什么?- 简述几种常见的蛋白质结构预测方法。
7. 系统生物学和网络分析- 系统生物学研究的是什么?- 网络分析在系统生物学中的应用。
8. 生物信息学中的数据库- 列举几个常见的生物信息学数据库。
- 解释数据库在生物信息学研究中的作用。
9. 生物信息学中的编程语言- 哪些编程语言在生物信息学中常用?- 简述Python在生物信息学中的应用。
10. 伦理和隐私问题- 在生物信息学研究中可能遇到哪些伦理问题?- 如何保护生物信息数据的隐私?11. 案例研究- 描述一个生物信息学在医学研究中的应用案例。
- 分析该案例中使用的方法和技术。
12. 未来趋势- 预测生物信息学未来的发展趋势。
- 讨论生物信息学如何影响未来的科学研究和医疗保健。
通过这些问题的复习,同学们可以更全面地了解生物信息学的基础概念、关键技术和应用领域。
希望这些复习题能够帮助同学们更好地准备考试和理解生物信息学的重要性。
生物信息学复习题及答案
生物信息学复习题及答案1. 什么是生物信息学?生物信息学是一门交叉学科,它结合了生物学、计算机科学和信息技术,用于管理和分析生物数据。
它涉及基因组学、蛋白质组学、转录组学等多个领域,目的是从大量生物数据中提取有用的生物学信息。
2. 基因组学的主要研究内容是什么?基因组学主要研究基因组的结构、功能和相互作用,包括基因的识别、基因表达的分析以及基因组的比较研究。
3. 转录组学与基因组学有何不同?转录组学关注的是细胞在特定条件下转录产生的所有RNA分子,而基因组学研究的是整个基因组的DNA序列。
转录组学可以揭示基因表达的变化,而基因组学提供了基因存在的信息。
4. 蛋白质组学研究的是什么?蛋白质组学研究细胞或组织中所有蛋白质的组成、结构、功能和相互作用。
它涉及蛋白质的鉴定、定量和功能分析。
5. 生物信息学中常用的数据库有哪些?常用的生物信息学数据库包括GenBank、PDB(蛋白质数据银行)、UniProt和KEGG等,它们存储了大量的基因、蛋白质和生物途径信息。
6. 什么是序列比对?序列比对是将两个或多个生物序列(如DNA、RNA或蛋白质序列)进行排列,以便识别出相同或相似的区域,这是发现序列间同源性的重要方法。
7. 简述系统发育树的构建过程。
系统发育树的构建通常包括以下步骤:收集序列数据、选择适当的比对方法进行序列比对、计算序列间的同源性、选择系统发育分析方法(如最大似然法、邻接法等)构建树,并进行树的优化和验证。
8. 什么是基因表达谱分析?基因表达谱分析是一种研究基因在不同条件下表达模式变化的技术,它可以帮助我们理解基因如何响应环境变化或参与特定生物学过程。
9. 什么是高通量测序技术?高通量测序技术,也称为下一代测序技术,是一种能够快速、低成本地测定大量DNA或RNA序列的技术,它在基因组学、转录组学等领域有广泛应用。
10. 什么是生物信息学中的网络分析?网络分析在生物信息学中用于研究生物分子间的相互作用,如蛋白质-蛋白质相互作用网络、基因调控网络等,它有助于揭示生物系统的复杂性和动态性。
生物信息复习资料
生物信息复习资料生物信息复习资料生物信息学是一门综合性学科,涉及生物学、计算机科学和统计学等多个领域。
它的出现和发展,为我们深入研究生物体的基因组、蛋白质组以及其他生物大数据提供了强有力的工具和方法。
在生物信息学的学习和研究过程中,我们需要掌握一些基本的概念、技术和工具。
下面,我将为大家整理一些生物信息学的复习资料,希望能够对大家的学习有所帮助。
一、基本概念1. 生物信息学:生物信息学是一门研究生物体内信息的获取、存储、处理和分析的学科。
它通过运用计算机科学和统计学的方法,挖掘和解释生物体内的基因、蛋白质等分子信息,从而揭示生物体内的生命规律和机制。
2. 基因组学:基因组学是研究生物体基因组结构、功能和演化的学科。
它通过对生物体DNA序列的测定和分析,揭示基因组的组成、基因的定位和功能等信息。
3. 蛋白质组学:蛋白质组学是研究生物体蛋白质组成、结构和功能的学科。
它通过对生物体蛋白质的测定和分析,揭示蛋白质的组成、互作关系和功能等信息。
4. 基因表达谱:基因表达谱是指在特定条件下,生物体内基因的表达水平和模式。
通过对基因表达谱的分析,可以了解基因在不同组织、不同发育阶段或者不同环境条件下的表达情况,从而揭示基因的功能和调控机制。
二、常用技术和工具1. DNA测序技术:DNA测序技术是获取生物体基因组序列的重要方法。
常见的DNA测序技术包括Sanger测序、高通量测序和单分子测序等。
其中,高通量测序技术如Illumina测序和Ion Torrent测序,具有高通量、高准确性和低成本的特点,广泛应用于基因组学和转录组学研究。
2. 生物信息学数据库:生物信息学数据库是存储和管理生物学数据的重要资源。
常见的生物信息学数据库包括GenBank、EMBL、DDBJ、NCBI、Ensembl和Uniprot等。
这些数据库提供了丰富的生物学数据,如基因序列、蛋白质序列、基因表达数据等,为生物信息学的研究和分析提供了基础。
生物信息学复习题
生物信息学复习题### 生物信息学复习题#### 一、选择题1. 生物信息学主要研究的是什么?A. 生物学数据的收集和存储B. 生物学数据的分析和解释C. 生物学实验的设计和执行D. 生物学仪器的操作和维护2. 下列哪一项不是生物信息学中常用的数据库?A. GenBankB. PDBC. PubMedD. Google Scholar3. 序列比对的目的是什么?A. 确定序列间的同源性B. 预测蛋白质的三维结构C. 鉴定基因的功能D. 计算基因的表达量#### 二、填空题1. 生物信息学中的BLAST工具主要用于__________。
2. 基因表达分析中常用的芯片技术包括__________和__________。
3. 在蛋白质结构预测中,同源建模依赖于__________数据库中的已知结构。
4. 转录组测序(RNA-Seq)可以用于研究__________和__________。
#### 三、简答题1. 描述基因组注释的一般流程。
2. 阐述生物信息学在药物设计中的应用。
3. 解释什么是系统发育树,并说明其在进化研究中的意义。
#### 四、计算题1. 给定一段DNA序列,计算其GC含量。
(示例序列:ATCGTACGTAGCTAGCTAG)2. 如果一个蛋白质序列的分子量为12345 Da,其氨基酸的平均分子量为110 Da,计算该蛋白质序列中氨基酸的数量。
#### 五、论述题1. 讨论生物信息学在个性化医疗中的作用和挑战。
2. 分析高通量测序技术对生物信息学领域的影响。
通过以上题目的复习,可以帮助学生掌握生物信息学的基础知识和技能,包括对生物数据的分析、解释和应用。
这些知识点不仅涵盖了生物信息学的基础理论,还涉及到实际应用,如药物设计、个性化医疗等,为学生提供了一个全面的复习框架。
生物信息学复习题及答案(打印)
生物信息学复习题及答案(打印)一、名词解释:1.生物信息学:研究大量生物数据复杂关系的学科,其特征是多学科交叉,以互联网为媒介,数据库为载体。
利用数学知识建立各种数学模型; 利用计算机为工具对实验所得大量生物学数据进行储存、检索、处理及分析,并以生物学知识对结果进行解释。
2.二级数据库:在一级数据库、实验数据和理论分析的基础上针对特定目标衍生而来,是对生物学知识和信息的进一步的整理。
3.FASTA序列格式:是将DNA或者蛋白质序列表示为一个带有一些标记的核苷酸或者氨基酸字符串,大于号(>)表示一个新文件的开始,其他无特殊要求。
4.genbank序列格式:是GenBank 数据库的基本信息单位,是最为广泛的生物信息学序列格式之一。
该文件格式按域划分为4个部分:第一部分包含整个记录的信息(描述符);第二部分包含注释;第三部分是引文区,提供了这个记录的科学依据;第四部分是核苷酸序列本身,以“//”结尾。
5.Entrez检索系统:是NCBI开发的核心检索系统,集成了NCBI 的各种数据库,具有链接的数据库多,使用方便,能够进行交叉索引等特点。
6.BLAST:基本局部比对搜索工具,用于相似性搜索的工具,对需要进行检索的序列与数据库中的每个序列做相似性比较。
P947.查询序列(query sequence):也称被检索序列,用来在数据库中检索并进行相似性比较的序列。
P988.打分矩阵(scoring matrix):在相似性检索中对序列两两比对的质量评估方法。
包括基于理论(如考虑核酸和氨基酸之间的类似性)和实际进化距离(如PAM)两类方法。
P29 9.空位(gap):在序列比对时,由于序列长度不同,需要插入一个或几个位点以取得最佳比对结果,这样在其中一序列上产生中断现象,这些中断的位点称为空位。
P2910.空位罚分:空位罚分是为了补偿插入和缺失对序列相似性的影响,序列中的空位的引入不代表真正的进化事件,所以要对其进行罚分,空位罚分的多少直接影响对比的结果。
生物信息学期末考试重点
1、生物信息学(Bioinformatics)是研究生物信息的采集、处理、存储、传播,分析和解释等各方面的学科,也是随着生命科学和计算机科学的迅猛发展,生命科学和计算机科学相结合形成的一门新学科.它通过综合利用生物学,计算机科学和信息技术而揭示大量而复杂的生物数据所赋有的生物学奥秘。
2、数据库(Database)是按照数据结构来组织、存储和管理数据的仓库,它产生于距今六十多年前,随着信息技术和市场的发展,特别是二十世纪九十年代以后,数据管理不再仅仅是存储和管理数据,而转变成用户所需要的各种数据管理的方式。
数据库有很多种类型,从最简单的存储有各种数据的表格到能够进行海量数据存储的大型数据库系统都在各个方面得到了广泛的应用。
3、表达序列标签从一个随机选择的cDNA 克隆进行5'端和3’端单一次测序获得的短的cDNA 部分序列,代表一个完整基因的一小部分,在数据库中其长度一般从20 到7000bp 不等,平均长度为360 ±120bp。
EST 来源于一定环境下一个组织总mRNA 所构建的cDNA 文库,因此EST也能说明该组织中各基因的表达水平。
4、开放阅读框是基因序列中的一段无终止序列打断的碱基序列,可编码相应的蛋白.ORF识别包括检测六个阅读框架并决定哪一个包含以启动子和终止子为界限的DNA序列而其内部不包含启动子或终止子,符合这些条件的序列有可能对应一个真正的单一的基因产物。
ORF的识别是证明一个新的DNA序列为特定的蛋白质编码基因的部分或全部的先决条件。
5、蛋白质的一级结构在每种蛋白质中氨基酸按照一定的数目和组成进行排列,并进一步折叠成特定的空间结构前者我们称为蛋白质的一级结构,也叫初级结构或基本结构。
蛋白质一级结构是理解蛋白质结构、作用机制以及与其同源蛋白质生理功能的必要基础.6、基因识别是生物信息学的一个重要分支,使用生物学实验或计算机等手段识别DNA序列上的具有生物学特征的片段。
生物信息学期末复习题与答案
一、单选题1、总的来说,位于染色体内超过( )个碱基的DNA,构成了人类基因组。
A.30000000000B.3000000000C.300000000D.30000000正确答案:B2、人类镰刀型红细胞贫血症是由于血红蛋白β链N端第6个氨基酸由谷氨酸突变为( )造成的。
A.苏氨酸B.缬氨酸C.赖氨酸D.谷氨酸正确答案:B3、RefSeq数据库是由哪个组织开发和维护的?( )A.NIGB.NCBIC.EMBLD.SIB正确答案:B4、Long non-coding RNA长链非编码RNA是长度大于( )个核苷酸的非编码RNA。
A.150B.250C.300D.200正确答案:D5、tBLASTx分析是用核酸序列检索核酸序列数据库,下列说法正确的是?()A.核酸序列和核酸序列数据库都不需要翻译成蛋白质序列B.只有核酸序列数据库需要翻译成蛋白质序列C.只有核酸序列需要翻译成蛋白质序列D.核酸序列和核酸序列数据库都需要翻译成蛋白质序列正确答案:D6、要搜索编码蛋白质序列的核酸序列,适宜的分析方法是?()A.BLASTxB.BLASTnC.tBLASTnD.BLASTp正确答案:A7、下列对于PCR引物修饰的说法正确的是?()A.PCR引物的5’末端和3’末端均能进行修饰B.PCR引物的5’末端和3’末端均不能进行修饰C.只有PCR引物的5’末端能进行修饰D.只有PCR引物的3’末端能进行修饰正确答案:C8、下列哪个在线分析工具可以预测DNA的外显子-内含子?()A.AugustusB.PLACEC.ORFfinderD.Entrez正确答案:A9、Smith-Waterman动态规划算法矩阵中的每个单元格有几条路径?()A.1B.2C.3D.4正确答案:D10、下列关于Needleman-Wunsch算法和Smith-Waterman算法提出早晚的论述正确的是?()A.Needleman-Wunsch算法提出时间较早B.不确定C.Smith-Waterman算法提出时间较早D.二者提出时间相当正确答案:A11、当分类单元至少为3时,下列对“有根树与无根树的数目”判断正确的是?()A.有根树的数目要少于无根树的数目B.有根树的数目与无根树的数目一样多C.有根树的数目要多于无根树的数目D.二者数目无法判断正确答案:C12、下列哪种算法建树时,选择代价最小或者枝长最短的树?A.最大似然值法B.最大简约法C.邻接法D.UPGMA法正确答案:B二、多选题1、生物信息学是由( )等学科相互交叉而形成的一门新兴学科。
生物信息学期末期末复习
■一、选择题:1.以下哪一个是mRNA条目序列号:A.J01536■.NM_15392C.NP_52280D.AAB1345062.确定某个基因在哪些组织中表达的最直接获取相关信息方式是:■.UnigeneB.EntrezC.LocusLinkD.PCR3.一个基因可能对应两个Unigene簇吗?■可能B.不可能4.下面哪种数据库源于mRNA信息:■dbESTB.PDBC.OMIMD.HTGS5.下面哪个数据库面向人类疾病构建:A.ESTB.PDB■.OMIMD.HTGS6.Refseq和GenBank有什么区另1J:A.Refseq包括了全世界各个实验室和测序项目提交的DNA序列B.GenBank提供的是非冗余序列■.Refseq源于GenBank,提供非冗余序列信息D.GenBank源于Refseq7.如果你需要查询文献信息,下列哪个数据库是你最佳选择:A.OMIMB.Entrez■PubMedD.PROSITE8.比较从Entrez和ExPASy中提取有关蛋白质序列信息的方法,下列哪种说法正确:A.因为GenBank的数据比EMBL更多,Entrez给出的搜索结果将更多B.搜索结果很可能一样,因为GenBank和EMBL的序列数据实际一样■搜索结果应该相当,但是ExPASy中的SwissProt记录的输出格式不同9.天冬酰胺、色氨酸和酪氨酸的单字母代码分别对应于:■N/W/YB.Q/W/YC.F/W/YD.Q/N/W10.直系同源定义为:■不同物种中具有共同祖先的同源序列B.具有较小的氨基酸一致性但是有较大的结构相似性的同源序列C.同一物种中由基因复制产生的同源序列D.同一物种中具有相似的并且通常是冗余的功能的同源序列11.下列那个氨基酸最不容易突变:A.丙氨酸B.谷氨酰胺C.甲硫氨酸■半胱氨酸12.PAM250矩阵定义的进化距离为两同源序列在给定的时间有多少百分比的氨基酸发生改变:A.1%B.20%■.80%D.250%13.下列哪个句子最好的描述了两个序列全局比对和局部比对的不同:A.全局比对通常用于比对DNA序列,而局部比对通常用于比对蛋白质序列B.全局比对允许间隙,而局部比对不允许C.全局比对寻找全局最大化,而局部比对寻找局部最大化■全局比对比对整体序列,而局部比对寻找最佳匹配子序列14.假设你有两条远源相关蛋白质序列。
南京工业大学生物信息学期末考试
生工类1301-3《生物信息学》考试说明时间:第17 周周五(6 月17 日)上午3-4 节地点:厚学201题型:(开卷)名词解释5 题20 分,单项选择题10 题20 分,综合分析题4 题60 分。
重点:可参考以下课后题● 2.2 何为一级数据库?有哪些一级数据库?一级数据库属于档案数据库,库中的主要内容是来源于实验室操作所得到的原始数据结果;一级数据库:核酸序列数据库GenBank、EMBL、DDBJ及蛋白质数据库PDB(protein data bank)。
● 2.3 二级数据库、三级数据库等是指什么样的数据库?二级数据库是在一级数据库的信息基础上进行了计算加工处理并增加了许多人为的注释而构成的。
例如,NCBI的RefSeq数据库,其mRNA 序列式综合了GenBank中来源于同一物种相同基因的所有Mrna序列信息的一致性序列;而公共数据库中大多数的蛋白质序列是将核苷酸序列中的编码序列区域进行蛋白质翻译后,通过后续的一些计算分析,主观的人为地为序列加上蛋白质产物名称及功能注释。
三级数据库:参考书本P16页● 2.6 请查阅资料,了解序列信息的标准数据存放格式:FASTA、NBRF/PIR、GDE 和Raw。
书10页到11页● 2.8 GenBank 数据库中的 GenBank 条目包含哪些内容?请结合GenBank 中的一条具体的序列信息加以说明。
书17页到19页● 2.12 蛋白质序列数据库有哪些?书22页● 2.13 Uniprot 数据库分哪几个层次?书22页,分为三个层次。
一是Uniprot Knowledgebase(Uniprot KB)它涵盖大量人工注释的蛋白质信息,包括功能、分类以及数据库的交叉引用等;二是Uniprot Archive(Uniparc)力图收集最完整、最全面的蛋白质序列数据,不过数据没有加以注释整理,只给出了相关序列的来源;三是Uniprot Reference Clusters(UniRef),是将UniParc中的序列数据依据不同的参数条件去除冗余后得到的结果。
