【CN109872776A】一种基于加权基因共表达网络分析对胃癌潜在生物标志物的筛选方法及其应用【专
(19)中华人民共和国国家知识产权局(12)发明专利申请(10)申请公布号 (43)申请公布日 (21)申请号 201910114155.0(22)申请日 2019.02.14(71)申请人 辽宁省肿瘤医院地址 110042 辽宁省沈阳市大东区小河沿路44号(72)发明人 王哲 解夕黎 (74)专利代理机构 沈阳亚泰专利商标代理有限公司 21107代理人 史力伏(51)Int.Cl.G16B 25/10(2019.01)G16H 50/30(2018.01)
(54)发明名称一种基于加权基因共表达网络分析对胃癌潜在生物标志物的筛选方法及其应用(57)摘要本发明涉及生物医学领域,具体涉及一种基于加权基因共表达网络分析对胃癌潜在生物标志物的筛选方法及其应用。本发明采用加权基因共表达网络分析(WGCNA)以及KEGG通路、GO富集分析等分析方法。加权基因共表达网络分析(WGCNA)是一种高效、全面的高维数据分析方法,且其分析基因芯片数据的准确性和有效性已经得到证实。所述的应用本发明方法筛选出的潜在生物标志物为FERMT2。本发明为胃癌的诊断、治疗及预后提供了新方向,促进了“个体化治疗”的
发展。
权利要求书2页 说明书7页 附图6页CN 109872776 A2019.06.11
CN 109872776
A1.一种基于加权基因共表达网络分析对胃癌潜在生物标志物的筛选方法,其特征在于,应用此方法筛选出的潜在生物标志物为FERMT2。2.一种基于加权基因共表达网络分析对胃癌潜在生物标志物的筛选方法,具体包括以下步骤:1)GEO数据下载和预处理:从GEO数据库下载包括癌症样本以及对应的临床随访信息的胃癌芯片数据,数据的预处理如下:下载数据集为log10-transformed RMA signal intensity,对每个样本进行分位数标准化,进一步对每个样本进行聚类分析,筛选出表达谱较为一致的样本作为训练集样本;2)筛选变化较大的基因:筛选变化较大的基因,如A基因符合筛选规则如下:①A基因在所有样本中的表达水平中位数高于所有基因在各个样本中表达水平的中位数的20%;②A基因在各个样本中表达水平的方差高于所有基因在各个样本中表达水平的方差的20%;3)单因素生存分析:为进一步观察这些在样本中变化较大的基因与预后的关系,使用R软件包survival对这些基因进行单因素生存分析,筛选出预后显著性p值小于0.01的基因作为种子基因;4)基因与lncRNA共表达网络构建:WGCNA是使用基因表达数据来构建无尺度网络的系统生物学方法,首先构建基因表达相似性矩阵,即计算两两基因之间皮尔森相关系数的绝对值,使用公式1计算基因i和基因j之间的皮尔森相关系数,其中i和j分别是第i个基因和第j个基因的表达量,公式1:然后使用公式2将基因表达相似性矩阵转换成邻接矩阵,网络类型为signed,其中β为软阈值,其实就是将每对基因的皮尔森相关系数β次方,这一步能够从指数级别强化强相关性和减弱弱相关性,公式2: 下一步使用公式3将邻接矩阵转换成拓扑矩阵,拓扑重叠(topological overlap measure, TOM)用来描述基因之间的关联程度,公式3:1-TOM表示基因i和基因j之间的相异程度,使用1-TOM作为距离对基因进行层次聚类,然后使用动态剪切树的方法进行模块的识别,每个模块中最具有代表性的基因称为特征向量基因简称ME,它代表了该模块内基因表达的整体水平,它是每个模块中的第一主成分,使用公式4来计算ME,其中i表示模块q中的基因,l表示模块q中的芯片样本,公式4:
利用某个基因在所有样本中的表达谱与某个特征向量基因ME表达谱的皮尔森相关性来衡量这个基因在该模块中的身份,即模块身份简称MM,使用公式5计算MM,其中表示第i个基因的表达谱,表示模块q的特征向量基因,表示了基因i在模块q中的身份,当= 0,则说明基因i不在模块q中,越接近+1或−1,则说明基因i与模块q高度相关,正负号表示了基因i与模块q是正相关还是负相关,
公式5:权 利 要 求 书1/2页
2CN 109872776 A
胃癌相关基因的生物信息学分析及蛋白互作网络构建
现代医院2016年10月第16卷第10期专业技术篇Modern Hospital Oct 2016 Vol 16 No 10
胃癌相关基因的生物信息学分析及蛋白互作网络构建
罗远卫梁敏石波云牛秋玲刘兆宇周新科
【摘要】目的分析胃癌和癌旁组织间差异表达基因的功能及其编码蛋白的相互作用,筛选出胃癌相关的 关键基因。方法从NCBI(美国国立生物技术信息中心)公共数据平台GECKGene Expression Omnibus)下载胃癌基 因芯片数据GSE79973,采用R BioconductoB. 2. 4软件对数据进行处理和分析,输出差异表达基因,并通过生物信息 学工具DAVID、String、Cyt〇SCape对差异表达基因进行生物学功能及其编码蛋白的互作分析。结果通过分析 GSE79973芯片数据,一共获得567个表达差异明显的基因,其中表达上调的有384个,表达下调的有183个,这些基
因主要富集于细胞外区、细胞外基质、胶原蛋白、基底膜等,主要参与细胞增殖、周期以及粘附等生物学过程,并且在 细胞外基质受体、局部粘附以及细胞色素P450代谢等肿瘤相关通路明显富集。初步鉴定了 C0I4A1、IL6、IL8、 COLlA2、ITGA2、THBSl、COL5Al、COL3Al、ITGAl、COL2Al、COL4A2、BIRC5 为胃癌相关的关键基因。结论 基因芯
片结合生物信息学方法能够有效分析胃癌和癌旁组织间差异表达基因,并筛选出胃癌相关的关键基因,为进一步研 冗胃癌发病的分子机制提供指导。【关键词】胃癌;基因芯片;差异表达基因;生物信息学中图分类号:R735.2; R34 文献标识码:A doi: 10. 3969/j. issn. 1671 -332X.2016.10.004
Bioinformatics Analysis of Gastric Cancer Related Gene and Protein - Protein Interaction Network
加权基因共表达
加权基因共表达
加权基因共表达(Weighted Gene Co-expression
Network Analysis,WGCNA)是一种基于基因共表达模式分析的方法,它通过计算基因之间的相关性来构建基因共表达网络,并通过对网络的层次结构进行聚类分析,发现具有类似表达模式的基因模块。与传统的差异分析不同,WGCNA 能够更全面地揭示基因之间的相互关系,识别出基因功能模块及其在不同生物学过程中的作用。
在 WGCNA 中,基因共表达网络的构建是关键步骤之一。它通过计算基因之间的共表达模式,建立基因之间的相关性网络。不同于全基因组表达谱聚类分析,WGCNA 是针对特定生物学问题构建网络,因此,选择合适的基因表达数据集是十分重要的。WGCNA 的输入是一个基因表达矩阵,矩阵的行表示不同样本,列则为不同基因。根据基因表达矩阵中基因与基因之间的相关性计算方法不同,WGCNA
方法可分为 Pearson 相关性、Spearman 相关性、加权
Pearson 相关性、加权 Spearman 相关性等多种算法。研究者应根据实际研究问题和数据特点选择合适的相关性计算方法。
基于共表达网络,WGCNA 可以发现具有类似表达模式的基因模块。在 WGCNA 中,基因模块是指基因网络中表达模式相似的基因子集。这些基因模块不仅可以帮助研究者理解不同生物学过程中基因的调控关系,还可以为基因功能预测提供有价值的信息。聚类分析是构建基因模块的主要方法。一般来说,WGCNA 会根据基因之间的相似性将基因分入不同的聚类分析中,每一个聚类分析就代表一个基因模块。WGCNA 还可以计算不同基因模块与疾病或其他生物学性状之间的关系,从而找到关键的基因调控通路,为研究疾病发病机理和治疗靶点提供了理论依据。
WGCNA 方法有着广泛的应用领域,尤其在基因表达谱分析、生物学过程分析、疾病机理研究等方面,都具有重要的应用价值。例如,在癌症研究中,WGCNA 可以帮助发现癌症调控通路和潜在的治疗靶点。在药物筛选中,WGCNA
基于加权基因共表达网络(WGCNA)探索IgA肾病的潜在生物标志物
基于加权基因共表达网络(WGCNA)探索IgA肾病的潜在生物标志物
摘要:IgA肾病是全球范围内常见的肾小球疾病之一,但其发病机制仍不十分清楚,导致缺乏有效的治疗手段。随着生物信息学技术的不断发展,基于基因共表达网络的分析成为研究生物标志物的有效方法之一。本研究使用公共数据库中的IgA肾病样本和健康样本进行加权基因共表达网络分析,进一步筛选出与IgA肾病相关的生物标志物,包括马克维金病毒相关寡肽激酶基因(KREMEN1)和克罗恩病相关蛋白(CARD9)等基因。这些生物标志物与IgA肾病的发病机制密切相关,可能成为该病的潜在治疗靶点或诊断标志物。
关键词:IgA肾病,加权基因共表达网络(WGCNA),生物标志物,基因筛选,生物信息学分析
引言
IgA肾病是一种常见的肾小球疾病,其主要病理特征是肾小球毛细血管系膜区沉积大量免疫球蛋白A(IgA)和补体蛋白,导致炎症反应和肾小球损伤。IgA肾病的发病率在全球范围内都有不同程度的增加趋势,其中在亚洲地区尤其常见。但是,目前对IgA肾病的发病机制及治疗方法还不十分清楚,且传统的治疗方法并没有显著的疗效。因此,寻找IgA肾病的生物标志物,有助于该病的早期诊断、治疗和预后评估。
随着生物信息学技术的发展,基于基因共表达网络的分析成为了研究生物标志物的有效方法之一。基因共表达网络分析可以通过构建基因共表达的聚类,筛选出与特定生物过程或疾病发生相关的基因集。并且,加权基因共表达网络分析能够综合考虑基因的相关性和重要性,对于发现生物标志物更具有优势。
本研究旨在通过加权基因共表达网络分析,探索IgA肾病的潜在生物标志物,为该病的诊断、治疗和预后评估提供借鉴。
材料与方法
数据来源
IgA肾病相关基因表达数据来自公共数据库Gene Expression
Omnibus (GEO)。本研究选取6个IgA肾病患者样本和6个健康对照样本。所有样本均为肾脏组织标本。
预处理与加权基因共表达网络构建
【CN109872776A】一种基于加权基因共表达网络分析对胃癌潜在生物标志物的筛选方法及其应用【专
(19)中华人民共和国国家知识产权局
(12)发明专利申请
(10)申请公布号 (43)申请公布日
(21)申请号 201910114155.0
(22)申请日 2019.02.14
(71)申请人 辽宁省肿瘤医院地址 110042 辽宁省沈阳市大东区小河沿路44号
(72)发明人 王哲 解夕黎
(74)专利代理机构 沈阳亚泰专利商标代理有限公司 21107代理人 史力伏
(51)Int.Cl.G16B 25/10(2019.01)G16H 50/30(2018.01)
(54)发明名称一种基于加权基因共表达网络分析对胃癌潜在生物标志物的筛选方法及其应用(57)摘要本发明涉及生物医学领域,具体涉及一种基于加权基因共表达网络分析对胃癌潜在生物标志物的筛选方法及其应用。本发明采用加权基因共表达网络分析(WGCNA)以及KEGG通路、GO富集分析等分析方法。加权基因共表达网络分析(WGCNA)是一种高效、全面的高维数据分析方法,且其分析基因芯片数据的准确性和有效性已经得到证实。所述的应用本发明方法筛选出的潜在生物标志物为FERMT2。本发明为胃癌的诊断、治疗及预后提供了新方向,促进了“个体化治疗”的
发展。
权利要求书2页 说明书7页 附图6页CN 109872776 A2019.06.11
CN 109872776
A1.一种基于加权基因共表达网络分析对胃癌潜在生物标志物的筛选方法,其特征在
于,应用此方法筛选出的潜在生物标志物为FERMT2。
2.一种基于加权基因共表达网络分析对胃癌潜在生物标志物的筛选方法,具体包括以
下步骤:
1)GEO数据下载和预处理:从GEO数据库下载包括癌症样本以及对应的临床随访信息的
胃癌芯片数据,数据的预处理如下:下载数据集为log10-transformed RMA signal
intensity,对每个样本进行分位数标准化,进一步对每个样本进行聚类分析,筛选出表达
谱较为一致的样本作为训练集样本;
CD133^(+)与CD133^(-)人原代胃癌细胞的差异表达基因及核心基因的筛选
·专题研究·
CD133+与CD133-人原代胃癌细胞的差异表达基因
及核心基因的筛选
贾岑岑,程薇,李雷蕾,曾晓燕,廖永慧,谢渊,周建奖,赵艳
(贵州医科大学地方病与少数民族疾病教育部重点实验室&贵州省医学分子生物学重点实验室,贵州贵阳 550004)
[摘 要]目的 通过生物信息学方法筛选出CD133+与CD133-人原代胃癌细胞的差异表达基因(DEGs),寻找
可能参与胃癌发生的关键基因。方法 根据人CD133+和CD133-人原代胃癌细胞的转录组数据,以|log2FC|≥1,
P<005为标准筛选DEGs;用Metascape对DEGs进行基因本体论(GO)富集及京都基因和基因组数据库
(KEGG)通路富集分析,利用STRING数据库及Cytoscape380软件构建蛋白质-蛋白质相互作用(PPI)网络,
筛选核心基因;利用肿瘤基因组图谱(TCGA)数据库分析核心基因与胃癌患者总生存率的关系。结果 在
CD133+与CD133-人原代胃癌细胞间筛选出305个DEGs,其中下调的DEGs227个,上调的DEGs78个;这些
DEGs主要参与钙离子通道调节、DNA复制及DNA的代谢过程;KEGG通路分析提示DEGs主要富集于IL17信
号通路、RNA运输以及MAPK信号通路;PPI筛选出20个关键基因,其中趋化因子8(CXCL8)、TCP1伴侣蛋白亚
基2(CCT2)、核糖体产物因子2(RPF2)、蛋白酶体20S亚基α4(PSMA4)、胞质伴侣素6A(CCT6A)、蛋白酶体
26S亚基(PSMD12)以及凝聚素Ⅰ复合物亚基G(NCAPG)表达与胃癌患者的总生存率负相关,RUNX家族转录
因子2表达与胃癌患者的总生存率正相关(P<005)。结论 获得CD133+与CD133-人原代胃癌细胞的305
个DEGs及20个核心基因。
[关键词]原代胃癌细胞;CD133;RNAseq;差异表达基因;生物信息学;信号通路
胃癌脂代谢通路基因表达的转录组学高通量分析
胃癌脂代谢通路基因表达的转录组学高通量分析
向丽娟;汪圣毅;包楚阳;张焱;韩坤;刘虎
【摘 要】目的 探讨胃癌(GC)脂代谢(LM)通路的基因表达情况.方法 转录组测序筛选8例GC及4例癌旁组织之间的差异表达基因,京都基因与基因组百科全书(KEGG)富集分析GC脂代谢相关通路中的关键基因(KGS).结果高通量测序获得3
198个长度大于200 bp的差异表达基因.KEGG富集分析发现6个显著富集代谢通路,其中脂肪消化与吸收代谢通路有9个基因(MOGAT3、FABP2、FABP1、■显著上调,2个基因(LIPF、PLA2G1B)显著下调.结论GC脂代谢关键基因表达的异常状态为寻求胃癌诊断标志物提供了线索.%Objective To investigate the gene
expression of gastric cancer (GC) lipid metabolism (LM) pathways.
Methods Transcriptome sequencing was used to screen the differentially
expressed genes in 8 cases of gastric cancer and 4 cases of adjacent tissues,
and Kyoto Encyclopedia of Genes and Genomes (KEGG) enrichment
analysis was performed to explore the key genes in lipid metabolism
related pathways in gastric cancer.ResultsHigh-throughput sequencing
obtained 3198 differentially expressed genes with a length greater than
胃癌前病变分子标志物筛选
基因组学与应用生物学,2020年,第39卷,第丨0期,第4797-4802页
研宄报告
Research Report
胃癌前病变分子标志物筛选
王俐勇1朱圣韬”
1首都医科大学中心实验室,北京
,
100069; 2首都医科大学附属北京友谊医院,北京市消化疾病中心,国家消化系统疾病临床医学研究中心,消
化疾病癌前病变北京市重点实验室,北京
,
100050
*
通信作者,
zhushengtao@
摘要本实验旨在研究胃癌前的发生分子机制,通过建立人胃粘膜上皮细胞癌前病变细胞模型,利用高通
量测序技术在转录水平上分析胃癌前病变细胞与正常胃上皮细胞之间差异表达基因的功能及其编码蛋白的
相互作用,筛选出癌前病变相关的关键基因,将多个基因作为分子标记物,并在转录水平上检测这些基因在
胃癌细胞系的表达情况。同时结合大样本临床数据的生存曲线和这些基因在胃癌组织中蛋白水平分析,推测
这些基因与胃腺癌的生存率密切相关。研究结果表明这些基因有可能作为胃癌前病变诊疗分子标记物组合,
这对于实现胃癌前病变分子分型,建立胃癌前病变早期诊治体系提供理论基础有重要意义。
关键词胃癌前病变,分子标记物,高通量测序,早期诊治
Screening of Molecular Markers for Precancerous Lesions of Gastric Cancer
Wang
Liyong 1
Zhu
Shengtao2*
1 Core of Facility, Capital Medical University, Beijing, 100069; 2 Beijing Key Laburalury fur Precancerous Lesions of Digestive Diseases, National
Center of Clinical Medicine for Digestive Diseases, Beijing Friendship Hospital, Capital Medical University, Beijing Center of Digestive Diseases, Bei
wgcna分析
wgcna分析
WGCNA分析是一种用于基因表达数据的维度削减和模块化分析的工具。
维度削减是指通过将大量的基因表达数据转化为少数的模块来简化数据分析。WGCNA的全称是Weighted Gene Co-expression Network
Analysis,即基于基因共表达网络的加权模块化分析。它基于基因之间的共表达关系,将相似的基因聚类为不同的模块,从而揭示出基因之间的关联性。
WGCNA分析主要包括以下几个步骤:
1. 数据预处理:首先,需要对原始的基因表达数据进行预处理,包括删除掉质量低的数据点、处理缺失值和异常值等。
2. 构建基因共表达网络:在此步骤中,基于基因之间的相似性计算基因共表达关系,并建立一个基因共表达网络。
3. 模块化分析:通过对基因共表达网络进行模块化分析,将相似的基因聚类为不同的模块。聚类算法通常采用基于相似性的聚类方法,如hierarchical clustering和k-means clustering等。
4. 模块特征分析:对每个模块进行特征分析,包括模块的富集程度、显著性等,从而识别出与研究对象相关的关键基因和生物学过程。
5. 模块间关系分析:分析不同模块之间的关联性,寻找共享的调控网络和生物学通路。
通过WGCNA分析,可以帮助研究人员发现和理解基因之间的相互作用及其在生物学过程中的功能。这种分析方法可以应用于各个领域的基因表达数据分析,例如疾病研究、药物开发和生物信息学研究等。
WGCNA分析是一种非常有用的工具,它在基因表达数据分析中具有很大的潜力和应用前景。它可以帮助研究人员从大量的基因表达数据中提取有用的信息,为后续的研究提供了重要的指导和线索。
然而,需要注意的是,WGCNA分析仅仅是基因表达数据分析的一种方法,结果需要进一步的验证和解释。此外,数据预处理和模型参数选择等步骤对于分析结果的可靠性也具有重要的影响。
总而言之,WGCNA分析是一种有力的工具,可以帮助研究人员深入理解基因之间的相互作用和生物学过程。随着技术的不断发展和数据的增加,WGCNA分析在基因表达数据分析中的应用将会更加广泛。
基于TCGA和GEO数据库的胃癌lncRNA筛选与ceRNA网络构建
生物技术进展2022年第12卷第1期149~157CurrentBiotechnologyISSN2095‑2341研究论文Articles基于TCGA和GEO数据库的胃癌lncRNA筛选与ceRNA网络构建雍嘉欣1,韦权峰2,刘尚辉3*1.中国医科大学第二临床学院,沈阳110122;2.中国医科大学第一临床学院,沈阳110122;3.中国医科大学智能医学学院,沈阳110122摘要:胃癌(gastriccancer,GC)是我国最常见的恶性肿瘤之一,严重危害人类健康。胃癌发病机制复杂,缺乏特异性预后生物标志物。长链非编码RNA(longnoncodingRNA,lncRNA)可作为竞争性内源RNA(competingendogenousRNA,ceRNA),影响microRNA(miRNA)与mRNA的结合,从而影响胃癌的发生、发展。基于TCGA和GEO数据库的转录组数据,筛选GC中差异表达的lncRNAs,并构建基于6条lncRNAs(HAGLROS、TMEM92AS1、LINC01745、HOXCAS3、SEMA3BAS1、FEZF1AS1)的lncRNAmiRNAmRNA网络。网络核心基因的KEGG/GO富集和蛋白质互作分析结果显示,lncRNA可能通过miRNA海绵吸附作用,调控胃癌的发生、发展与转移。AC011352.1、AC087636.1、AC093627.1、GAS1RR与胃癌患者的预后相关性具有统计学意义(P<0.05),并可能成为胃癌患者潜在的预后生物标志物。关键词:胃癌;长链非编码RNA;竞争性内源RNA网络;预后生物标志物DOI:10.19586/j.2095‑2341.2021.0042中图分类号:R735.2文献标志码:AExpressionProfileScreeningoflncRNAandceRNANetworkConstructioninGastricCancerBasedonTCGAandGEODatabasesYONGJiaxin1,WEIQuanfeng2,LIUShanghui3*1.SecondClinicalCollege,ChinaMedicalUniversity,Shenyang110122,China;2.FirstClinicalCollege,ChinaMedicalUniversity,Shenyang110122,China;3.SchoolofIntelligentMedicine,ChinaMedicalUniversityShenyang110122,ChinaAbstract:Gastriccancer(GC)isoneofthemostmalignanttumorsinChina,whichseriouslyendangershumanhealth.ThetumorigenesisofGCiscomplicatedandlacksspecificprognosticbiomarkers.LongnoncodingRNA(lncRNA)canbeusedascompetitiveendogenousRNA(ceRNA)toaffecttheinteractionofmicroRNA(miRNA)andmRNA,therebyaffectingthecarcinogenesisanddevelopmentofGC.BasedonthetranscriptomedataoftheTCGAandGEOdatabases,thisstudyscreenedthedifferentiallyexpressedlncRNAsinGC.AlncRNAmiRNAmRNAnetworkbasedonsixlncRNAs(HAGLROS,TMEM92AS1,LINC01745,HOXCAS3,SEMA3BAS1,FEZF1AS1)wasconstructed.TheKEGG/GOenrichmentandproteininteractionanalysisshowedthatlncRNAmightregulatetheoccurrence,development,andmetastasisofGCthroughthemechanismofmicroRNAsponge.AC011352.1,AC087636.1,AC093627.1,GAS1RRweresignificantrelatedtotheprognosisofGCpatients(P<0.05),whichmaybecomepotentialprognosticbiomarkersforGCpatients.Keywords:gastriccancer;longnoncodingRNA;competingendogenousRNAnetwork;prognosticbiomarkers收稿日期:20210402;接受日期:20210601基金项目:2020年中国医科大学大学生创新创业训练计划(国家级)项目(202010159006)。联系方式:雍嘉欣E-mail:****************;*通信作者刘尚辉E-mail:**************Copyright©博看网 . All Rights Reserved.生物技术进展CurrentBiotechnology胃癌(gastriccancer,GC)是全球最常见的恶性肿瘤之一,也是导致患者死亡的第四大病因[1]。GC的发病机制复杂,且缺乏特异性的预后生物标志物。因此,阐明GC的分子机制并探寻新的治疗靶点和可能的潜在预后标记物具有重要意义。长链非编码RNA(longnocodingRNA,lncRNA)是RNA聚合酶Ⅱ从独立启动子转录的长度大于200个核苷酸的非编码转录本。研究发现,lncRNA可发挥对microRNA(miRNA)的海绵吸附作用,作为竞争性内源RNA(competingendogenousRNA,ceRNA)竞争性结合miRNA,影响miRNA与mRNA的结合,从而调控肿瘤的发生、发展与转移[2]。LncRNAmiRNAmRNA的调控网络在癌症中广泛存在,影响肿瘤相关基因的表达,发挥重要的生物学作用[3]。随着高通量测序技术的发展,越来越多的LncRNA被发现与癌症的发生、发展、转移相关[4-7]。此外,lncRNA具有分布范围广、保守性高、组织表达特异性高等特点。因此,筛选出胃癌中差异表达的lncRNA,对疾病诊断、预后等具有重要作用。TCGA(theCancerGenomeAtlas)数据库(https:///)是由美国国家人类基因研究所组织建立的癌症基因组数据库,其包括病例临床、基因突变、mRNA表达、miRNA表达、甲基化等数据,是癌症研究重要的数据来源。GEO(GeneExpressionOmnibus)数据库(https:///geo/)是一个国际公共数据库,收录了世界各国研究机构提交的高通量基因表达数据,包括测序以及其他形式的高通量功能基因组数据。本研究利用TGCA和GEO数据库,筛选胃癌中差异表达的lncRNA,构建lncRNAs介导的ceRNA网络,预测其核心基因可能涉及的信号通路和生物学功能,旨在为发现胃癌新的潜在预后相关标志物和治疗靶点提供理论依据。1材料与方法1.1数据下载在GEO数据库中,以“gastriccancer”和“lncRNA”为检索词,检索数据库中与胃癌相关的lncRNA芯片,选择物种为“homosapiens”,研究类型为“expressionprofilingbyarray”,通过筛选得到结果。筛选标准为样本数≥5且均有病例和对照组织的芯片数据集。最终,共下载4套胃癌的lncRNA芯片:GSE50710(10对胃癌组织正常组织)、GSE51308(5对胃癌组织正常组织)、GSE84787(10对胃癌组织正常组织)、GSE109476(5对胃癌组织正常组织)。从TGCA数据库中获取胃癌的RNAseq数据,共375例胃癌组织与32例癌旁组织纳入研究。1.2差异lncRNA分析与预后lncRNA筛选及预后生存曲线绘制使用R软件(Version3.6.3)的limma包对TCGA、GEO数据库中下载的数据进行差异分析,筛选差异表达的lncRNA。lncRNA筛选标准为:|log2FC|>1,FDR<0.05。同时,在TCGA数据库中,下载胃癌患者的病例信息并提取生存数据。利用survival、survminer、Cairo包对差异表达的lncRNA进行KaplanMeier法、单因素COX回归分析,筛选出coxP<0.05,且KaplanMeieP<0.05的lncRNA并绘制生存曲线。1.3ceRNA网络构建为减少由于GEO和TCGA数据库中样本差异对结果的影响,本研究在两个数据库中获取至少出现3次以上的lncRNA,进行后续ceRNA网络构建。在miRcode数据库()对筛选后的lncRNA进行lncRNAmiRNA配对。再分别在miRDB、miRTarBase、TargetScan3个miRNA基因预测数据库中同时进行mRNA预测。最后,将上述已经匹配完成的lncRNAmiRNA配对和miRNAmRNA配对导入Cytoscape(Version3.7.2)软件,构建基于ceRNA机制的lncRNAmiRNAmRNA调控网络。1.4STRING数据库的蛋白质互作分析利用STRING在线数据库(http://string)构建ceRNA网络中核心基因的蛋白质互作(proteinproteininteraction,PPI)网络,以进一步发现ceRNA网络的功能。1.5GO/KEGG富集分析为进一步预测ceRNA网络中mRNA可能涉及的信号通路和生物学功能,本研究利用DAVID数据库在线工具对ceRNA中的mRNA进行功能富集分析。同时使用KOBAS数据库进行KEGG通路富集分析,并根据P<0.05对分析结果进行汇总,最终以气泡图和圈图的方式可视化富集分析结果,具体技术路线见图1。150
