基于遗传算法的聚焦爬虫搜索策略

第36卷 

VoL36 第11期 

No.1 计算机工程 

Computer Engineering 2010年6月 

June 2010 

・人工智能及识别技术・ 文章编号:1o0o—0428(2010)1】—’o167—_03 文献标识码:A 中图分类号:TP311.13 

基于遗传算法的聚焦爬虫搜索策略 

曾广朴,范会联 

(长江师范学院数学与计算机学院,涪陵408 100) 

摘要:为了提高聚焦爬虫的搜索效率,提出一种结合内容评价和链接结构搜索策略的优点并利用小牛境遗传算法进行全局寻优的搜索策 略。改进遗传算子和小生境遗传算法,将待搜索的网页URL作为遗传个体,采用概率变迁规则和小生境淘汰运算引导搜索方向。实验结 

果证明,与聚焦爬虫的其他实现技术相比,该策略在抓取主题相关网页时具有更高的查准率和查全率。 

关键词:聚焦爬虫;遗传算法;小生境;主题相关度 

Search Strategy of Focused Crawler Based on Genetic Algorithm 

ZENG Guang—pu,FAN Hui—lian 

(School of Mathematics and Computer,Yangtze Normal UniversiW,Fuling 408 1 00) 

[Abstract]In order to improve the search efficiency of focused crawle based on Niche Genetic Algorithm(NGA),this paper proposes a global 

optimization of search strategy which combines the advantages of content evaluation and link structul e.URI search direction is guided by 

improving the genetic operators and NGA.Compared with other algorithms,experimental results indicate that this strategy has higher precision and 

recall in searching the topic pages. [Key wordsl focused crawler;genetic algorithm;niche;topic relevancy 

l概述 聚焦爬虫是专为查询某一领域或主题信息而出现的网页 

抓取工具。不同于通用搜索引擎,由于聚焦爬虫抓取的内容 

只限于特定的主题或专门领域,因此其在搜索过程中无须对 

整个Web进行遍历,只需选择与主题相关的页面进行访问。 

相对于通用网络爬虫,聚焦网络爬虫需要解决的关键问题是 

如何判断一个网页是否与主题相关以及如何根据主题相关度 决定待爬行URL的访问次序以获得更高的查全率和查准率。 

2相关研究工作现状 

2.1小生境遗传算法的基本思想 经典遗传算法的主要问题是容易产生最终并不能保证收 

敛到全局最优解、而是过早地收敛到某个局部极值点的现象。 

出现这一现象的根源在于该算法在进行粗略搜索时容易丢失 

最优解,进行精细搜索时容易陷入局部最优解。因此,需要 

引入一种既能保证种群多样性、又能保证算法高效性的机制。 

近年来人们将生物学中小生境现象引入遗传算法,其最优保 留原则使算法在保证多样性的同时能够保留最优解。 

小生境遗传算法(Niche Genetic Algorithm,NGA)的基本 思想是_】J:首先两两比较群体中各个个体之间的距离,若这 

个距离在预先指定的距离 之内(即在小生境内),再比较两 

者之间的适应度大小,并对其中适应度较低的个体施加一个 

较强的罚函数,从而极大地降低其适应度,这样,在预先指 

定的距离,J之内的2个个体中较差的个体经处理后适应度变 

得更差,它在后面的进化过程中被淘汰的概率极大,即在距 离£之内将只存在一个优良个体,从而既维护了群体的多样 

性,又使各个个体之问保持一定的距离,使个体能够在整个 

约束空间中分散开。 

2.2聚焦爬虫研究现状 不同聚焦网络爬虫之问的主要区别之一是如何决定 URL的爬行次序。目前常用的聚焦爬行策略主要有2类L2I: 

基于内容评价的搜索策略和基于Web链接结构的搜索策略。 基于内容评价的搜索策略起源于文本检索中对文本相似度的 评价,主要利用了Web网页文本内容、URL字符串、锚文字 等文字内容信息,典型的代表是BestFirst算法 J。该类算法 

的优点是具有较好的理论基础且计算简单。但由于这类方法 

忽略了链接结构信息,因此在预测链接价值的准确性方面存 在一些不足。 以文献【4—5]为代表的基-f Web链接结构的搜索策略通过 

分析Web页面之间的相互引片j关系确定网页的重要性,进而 决定链接访问顺序。其中,HITS算法通过对网络中链接的分 

析,将相关网页的链接关系作为一个网络拓扑图处理,分析 

Authority和Hub 2种页面。Authm‘ity页面的内容具有主题权 

威性,有较强的主题相关度。Hub节点肘主题相关的信息进 行汇总,提供主题及相关主题的信息目录,其本身页面内容 

的相关度不高。通常,好的Hub页是指向许多具有较高的 

Authority值的页面;好的Authority页是指由许多较高的Hub 值所指向的页面 J。该方法虽然考虑了链接结构和页面之间 

的引用关系,但忽略了页面与主题的相关性,在某些情况下, HITS会出现搜索偏离主题的“主题漂移”问题。 

3基于小生境遗传算法的聚焦爬虫设计 

3 1设计思想 

大量研究结果表明:网络上的信息是按照主题分类的, 

即假如某uRI 对应的信息与某主题相关,该URL所在的网 

基金项目:萤庆 教委科学技术研究基金资助项目“网络聚焦爬虫 

研究与设计”(KJ09 1 309) 作者筒介:曾广h ̄l,(1966-),男,讲师,主研方向:网络信息系统, 

数据挖掘;范会联,副教授、硕士 收稿日期:2009—11—15 E—mail:feiya~cq@i63.corn 

l67—

 站或目录也可能包含与此土越卡H关的信息,所以,类似生物 学中的小生境,网页链接一般总是和与自己相类似的内容链 

接在一起。因此,考虑小生境遗传算法的特点并结合基于网 页链接结构的搜索策略和基于内容评价的搜索策略的可取之 

处,本文在聚焦爬虫爬行过程中引入小生境遗传算法引导搜 索过程,将待搜索的网页URL作为遗传个体,采用基于主题 

相关度的适应度函数计算并评估个体适应度,采用概率的变 迁规则和小生境淘汰运算引导它的搜索方向。基于“从优质 

网页链接出去的URL可能还是优质网页”和“链接目标是优 

质网页的URL可能也是优质网页”的原则,从满足主题相关 

度条件的网页中包含的所有链接(即从满足主题相关度条件 

的网页链接出去的URL)中按一定规则抽取新的URL实现交 

叉操作,变异操作则通过从链接目标为满足主题相关度条件 

网页的新URL(即链接目标为满足主题相关度条件网页的 

URL)中选取。最后对完成以上操作后形成的新种群(新的 

URL集合)采用小生境淘汰运算形成下一代进化种群,从而保 证该算法不仅具有较高的局部寻优能力,而且能提高聚焦爬 虫的全局搜索性能。 

3.2主题相关性的判定 本文采用叙词表代替主题词集确立主题,叙词表中用内 

涵相同的一组词表示一个概念,并赋予相同的权值,而不同 

的概念指定不同权值。表示主题的叙词表构造和不同概念权 值的确定在领域专家的协助下结合实际情况和经验采用手工 

设置。 网页的主题相关度采用向量空间模型计算:对用户提问 

所对应的查询表达式或用户预先定义的用于搜索的模板文 件,在领域专家协助下得到检索提问式n维向量 = 

(q-,q2,…,q ),其中,g,表示第,个查询词在查询表达式中的 

权值。对网页进行中文分词处理,统计主题叙词表中特征词 

在待抓取网页中出现的频率,以出现频率最高的特征词作为 

基准,其频率用1表示,相应求出其他特征词的频率。由于 

网页是一种半结构化的文本,HTML标记对网页主题的贡献 度不同I,J,因此对不同标记修饰的特征词权值表示为Xi× f), 其中,X,为第 个特征词在该网页中出现的频率,设 )代 

表第i个特征词应赋予的权重,本算法对 )的取值定义 

如下: 

w(i): 5.0<title>标签修饰 3.0<a>标签修饰 2.0<meta>标签修饰 1.0其他 

将每一个待抓取网页转化为 维向量 = -× 1), 

× 2),…,Xn ̄ n))。这样用户主题和所有网页可以分别映射 

到向量空间口, 上,从而将网页信息与用户需求的匹配问题 

转化为向量空间中的向量匹配问题,则主题相关度的计算公 式为【81 

Similarity( , ):。。 ( , ):]三! ;. 

√∑吼 ×∑l (r) 

本算法即以主题相关度作为个体适应度函数。 

3.3聚焦爬虫爬行策略 以普通爬虫程序为基础,该搜索策略借助修改选择、交 

叉、变异3个遗传算子和小生境淘汰方法,通过选择操作抓 

取主题相关度网页,通过交叉操作实现深度爬行,通过变异 

操作完成广度爬行,通过小生境淘汰规则过滤同一小生境内 主题相关度较低的网页、避免过早局部收敛,从而优化爬行 

】68一 路径,保证该搜索策略不仅有较高的查准率,也有较高的查 

全率。具体搜索策略的算法描述如下: 输入初始化种子集合V、交叉概率P 、变异概率P 

小生境淘汰率P 、主题相关度阂值 输出主题相关度大于So的网页集合JD和对应的 downloadurl队列 

函数体: 

(1)将集合V中URL加入待处理队列wait queue中。 

(2)下载待处理队列wait 中所有 对应的网页,queue URL 

相应URL加入已访问队列visited queue。 

(3)选择操作。计算每个下载成功网页的主题相关度S, 保存主题相关度大于 的网页,加入集合P,相应的URL 

加入已下载队列download url。 (4)解析新加入集合P中的网页,抽取网页中包含的 

URL,对URL进行规范处理后,过滤已下载和重复的URL, 

结果计为 -。分析计算 -中包含的所有URL对应网页各自 

的主题相关度S,并将结果存入结构为<url, 的temp hashURL中。 (5)交叉操作。按照主题相关度大小对temp hashURL进 

行降序排列后,根据交叉概率P 从中选出前e个URL作为 

交叉结果集合,记为 ,其中, temphashURL ̄p 。 

(6)采集链接目标为 中网页的URL,过滤重复和已爬 行的URL后,结果集记为 。 

(7)变异操作。按照变异概率P 从 中提取出m个URL 记为集合 ,其中, = x 。 

(8)记 = U 。 (9)对 进行小生境淘汰运算,结果加入wait 。queue (10)清空temp hashURL和集合Vl,v2, , , 。 

(1 1)终止条件判断。根据检查wait queue是否为空或已 下载的页面数是否超过用户设定的阈值,或者遗传代数是否 

超过阈值决定是否结束爬行。 

合集下载

聚焦爬行中网页爬行算法的改进

聚焦爬行中网页爬行算法的改进

聚焦爬行中网页爬行算法的改进

谭骏珊;陈可钦

【期刊名称】《电脑知识与技术》

【年(卷),期】2008(004)035

【摘 要】因特网的迅速发展对万维网信息的查找与发现提出了巨大的挑战.对于大多用户提出的与主题或领域相关的查询需求,传统的通用搜索引擎往往不能提供令人满意的结果网页,为了克服通用搜索引擎的以上不足,提出了面向主题的聚焦爬虫的研究思路和方法.该文针对聚焦爬虫这一研究热点,对现今聚焦爬虫的爬行方法(主要是网页分析算法和网页搜索策略)做了深入分析和对比.提出了一种改进的聚焦爬行算法.这种基于类间规则的聚焦爬行方法借助baseline聚焦爬虫的架构,应用朴素的贝叶斯分类器并利用主题团间链接的统计关系构造规则找到在一定链接距离内的"未来回报"页面,并通过实验对该算法的性能进行分析、评价,证明其对聚焦爬虫的爬行收获率和覆盖率有很好的改善.

【总页数】3页(P2145-2146,2149)

【作 者】谭骏珊;陈可钦

【作者单位】中南林业科技大学,计算机科学学院,湖南,长沙,410004;中南林业科技大学,计算机科学学院,湖南,长沙,410004

【正文语种】中 文

【中图分类】TP311

【相关文献】 1.利用超链接信息改进网页爬行器的搜索策略 [J], 赫枫龄;左万利

2.爬行训练及爬行训练装置在脊椎病康复治疗中的应用 [J], 潘志超;徐秀林

3.爬行试验机的改进与爬行试验研究 [J], 高中庸

4.有效的爬行Ajax页面的网络爬行算法 [J], 李华波;吴礼发;赖海光;郑成辉;黄康宇

5.一种基于Context Graph主题爬行算法的改进 [J], 高庆芳;蒲宝卿;包蕾

因版权原因,仅展示原文概要,查看原文内容请购买

基于捕食搜索策略的遗传算法的研究及应用的开题报告

基于捕食搜索策略的遗传算法的研究及应用的开题报告

基于捕食搜索策略的遗传算法的研究及应用的开题报告

一、研究背景

遗传算法(Genetic Algorithm,GA)是一种演化计算方法,常用于解决复杂的优化问题。在 GA 中,将问题转化为遗传信息的形式,使用交叉、变异等遗传运算对信息进行交换和改变,从而搜索到优化的解。然而,传统的 GA 在搜索过程中存在着易陷入局部最优、收敛速度慢等问题,需要进一步改进。

捕食搜索策略(Predator-Prey Search,PPS)是一种以生物群体为基础的优化算法。在 PPS 中,将优化问题看作捕食和逃脱的过程,以自然界中捕食者和被捕食者的交互作用为基础,实现信息的交流和聚集。相较于传统 GA,PPS 具备更快的收敛速度和较好的全局搜索能力等优点。

因此,将 PPS 和 GA 相结合,探索基于捕食搜索策略的遗传算法(Predator-Prey Genetic Algorithm,PPGA)的研究,具有重要的理论和实际意义。

二、研究内容与目标

本研究旨在探索基于捕食搜索策略的遗传算法在优化问题上的应用。研究内容包括:

1. 设计 PPGA 的遗传算子,如选择、交叉和变异等。

2. 建立捕食者和被捕食者模型,设计模型的运动规律和行为策略。

3. 探究捕食者和被捕食者之间的交互作用,如感知相互距离、方向等信息。

4. 验证 PPGA 在函数优化、集合优化等问题上的效果,并与传统 GA、其他优化算法进行比较分析。 研究目标是提出一种全新的基于捕食搜索策略的遗传算法,并在实际应用中得到验证。

三、研究方法

本研究主要采用仿真实验的方式进行,具体方法如下:

1. 设计捕食者和被捕食者的模型,包括模型动力学方程、行为策略等。

2. 按照 PPGA 的遗传算子进行编码,设计适应度函数。

3. 针对不同的优化问题设置实验参数和限制条件,如函数类型、约束条件等。

4. 对 PPGA 算法进行仿真实验,统计优化结果、收敛速度、稳定性等指标。

一种Deep Web聚焦爬虫爬行策略

一种Deep Web聚焦爬虫爬行策略

一种Deep Web聚焦爬虫爬行策略

蔡欣宝;陈洪平;赵朋朋;崔志明

【期刊名称】《微电子学与计算机》

【年(卷),期】2009()8

【摘 要】实现大规模Deep Web数据源集成是方便用户使用Deep Web信息的一种有效途径.Deep Web爬虫是Deep Web数据源集成的关键组成部分.提出一种针对结构化Deep Web的聚焦爬虫爬行策略.通过对查询接口的特征分析来判断Deep Web数据源的主题相关性.同时,在评价链接重要性时,综合考虑了页面内容的主题相关性和链接的相关信息.实验证明该方法是有效的.

【总页数】4页(P117-120)

【关键词】结构化Deep;Web数据源;聚焦爬虫;决策树分类器

【作 者】蔡欣宝;陈洪平;赵朋朋;崔志明

【作者单位】苏州大学智能信息处理及应用研究所;江苏省现代企业信息化应用支撑软件工程技术研发中心

【正文语种】中 文

【中图分类】TP311

【相关文献】

1.一种Deep Web聚焦爬虫 [J], 黄昊晶

2.一种Deep Web爬虫爬行策略 [J], 刘徽;黄宽娜;余建桥

3.基于关键词相关度的Deep Web爬虫爬行策略 [J], 田野;丁岳伟 4.Deep Web爬虫爬行策略研究 [J], 郑冬冬;崔志明

5.一种优化路径的聚焦爬虫爬行策略 [J], 徐晨初;张燕平;刘国涛

因版权原因,仅展示原文概要,查看原文内容请购买

基于Python聚焦型网络爬虫的影评获取技术

基于Python聚焦型网络爬虫的影评获取技术

基于Python聚焦型网络爬虫的影评获取技术

在电影中国加速发展的今天,电影市场需求量不断上升,而影评作为评价电影品质和观影体验的关键指标之一,逐渐成为影迷选择电影的重要依据之一。因此,如何快速、准确获取电影影评信息变得越来越重要。本文将基于Python聚焦型网络爬虫的影评获取技术进行探讨。

一、聚焦型网络爬虫概述

聚焦型网络爬虫主要是基于搜索引擎的爬虫,通过搜索引擎的API接口获取相关网站的信息,并通过将搜索词转化为相关网站的链接,实现对于相关网站和页面的遍历和数据收集。所以,相比于其他网络爬虫,聚焦型网络爬虫具有更高的准确度和精度,更适用于与目标有关的网络爬虫数据收集。

二、Python网络爬虫的应用

Python是一种强大的编程语言,拥有许多库和框架,如Beautiful Soup、Scrapy等,可以方便快捷地进行网络爬虫的开发。其中,Beautiful Soup是一个Python库,用于从HTML和XML文件中提取结构化的数据,常用于爬虫程序中的数据解析。Scrapy则是Python的一个开源web爬虫框架,通过定制的Spider快速爬取网站并提取数据,支持分布式爬虫和基于事件驱动的异步编程,非常适合大规模的爬虫和数据挖掘。

三、影评获取技术的实现

使用Python实现基于聚焦型网络爬虫的影评获取技术,可以根据爬虫场景选择不同的框架和库。一般来说,如果目标网站较小,可以使用Beautiful Soup进行数据的抓取和解析;如果目标网站规模较大,可以使用Scrapy和Selenium进行爬虫的开发。

在实现过程中,需要注意以下几点:

1. 网站的爬取频率访问不宜过于频繁,以避免被网站封杀或造成不必要的麻烦。

2. 更换IP地址或使用代理服务器,以隐藏访问的真实IP地址,保护访问者的隐私。

3. 结构化数据的抽取,可以使用正则表达式、Beautiful Soup、XPath等一系列工具,确保数据的准确性和完整性。

《基于改进shark-search算法的主题爬虫的研究与实现》范文

《基于改进shark-search算法的主题爬虫的研究与实现》范文

《基于改进shark-search算法的主题爬虫的研究与实现》篇一

一、引言

随着互联网的飞速发展,网络信息的规模日益扩大,有效地获取和处理网络信息已成为科研领域的重要课题。主题爬虫作为网络信息检索的关键技术之一,对于获取特定主题的相关信息具有重要意义。本文将重点研究基于改进Shark-Search算法的主题爬虫的原理、实现及效果,以期为相关领域的研究和应用提供参考。

二、Shark-Search算法及主题爬虫概述

Shark-Search算法是一种启发式搜索算法,具有高效、准确的搜索能力。主题爬虫则是根据用户设定的主题,利用爬虫技术从互联网上抓取与主题相关的网页信息。将Shark-Search算法应用于主题爬虫中,可以有效地提高爬虫的搜索效率和准确性。

三、传统Shark-Search算法在主题爬虫中的局限性

尽管传统Shark-Search算法在主题爬虫中取得了一定的效果,但仍存在一些局限性。如搜索策略过于简单,易陷入局部最优解;对于复杂网络结构的适应性较差;对于海量数据的处理能力有待提高等。

四、改进Shark-Search算法的研究 针对传统Shark-Search算法在主题爬虫中的局限性,本文提出以下改进措施:

1. 优化搜索策略:引入多种启发式函数,使搜索策略更加多样化,避免陷入局部最优解。

2. 增强网络结构适应性:采用深度优先和广度优先相结合的搜索策略,以适应复杂网络结构。

3. 提高数据处理能力:利用分布式计算和并行处理技术,提高对海量数据的处理能力。

五、基于改进Shark-Search算法的主题爬虫的实现

1. 系统架构设计:采用分层架构设计,包括爬取层、存储层、处理层和接口层。

2. 爬取策略实现:根据改进的Shark-Search算法,制定相应的爬取策略,包括URL管理、网页抓取、内容解析等。

3. 数据存储与处理:将抓取的网页数据存储至分布式文件系统,并利用MapReduce等技术进行并行处理。

遗传算法的局限性及优化策略探讨

遗传算法的局限性及优化策略探讨

遗传算法的局限性及优化策略探讨

遗传算法(Genetic Algorithm,GA)是一种模拟自然选择和遗传机制的优化算法。它通过模拟生物进化的过程,逐步优化问题的解。然而,尽管遗传算法在解决一些优化问题上表现出色,但它也存在一些局限性。本文将探讨遗传算法的局限性,并提出一些优化策略。

一、局限性

1. 可能陷入局部最优解

遗传算法的基本思想是通过不断迭代,逐步优化解的质量。然而,由于遗传算法是基于概率的,存在一定的随机性,因此有时候可能会陷入局部最优解而无法找到全局最优解。这是因为遗传算法在搜索空间中进行随机探索时,有可能错过全局最优解。

2. 对问题的建模要求高

遗传算法对问题的建模要求较高,需要将问题转化为适应度函数。对于一些复杂的问题,很难找到一个合适的适应度函数来准确描述问题。这就限制了遗传算法在某些问题上的应用。

3. 运算复杂度高

遗传算法的运算复杂度较高。在每一代中,需要对种群进行选择、交叉和变异等操作,这些操作都需要消耗大量的计算资源。对于大规模问题,遗传算法的运行时间可能会非常长。

二、优化策略

1. 改进选择策略 选择策略是遗传算法中非常重要的一环。传统的选择策略是基于适应度函数的大小进行选择,但这种策略容易导致早熟收敛。为了克服这个问题,可以引入一些改进的选择策略,如锦标赛选择(Tournament Selection)和自适应选择(Adaptive

Selection)等。这些策略可以增加多样性,避免陷入局部最优解。

2. 引入多样性保持机制

为了增加种群的多样性,可以引入多样性保持机制。例如,可以通过增加交叉概率或变异概率来增加种群的多样性。另外,还可以使用多目标遗传算法(Multi-Objective Genetic Algorithm,MOGA)来解决多目标优化问题,通过维护一个帕累托前沿来保持多样性。

3. 结合其他优化算法

为了克服遗传算法的局限性,可以将其与其他优化算法相结合。例如,可以将遗传算法与模拟退火算法(Simulated Annealing)或粒子群优化算法(Particle

基于遗传算法的路径规划优化策略

基于遗传算法的路径规划优化策略

在现实世界中,路径规划是一个非常重要的问题。无论是交通运输、物流还是机器人导航,都需要找到最优的路径。而遗传算法作为一种优化算法,被广泛应用于解决路径规划问题。本文将介绍基于遗传算法的路径规划优化策略,并通过实例分析说明其效果。

1. 引言

路径规划是指在给定地图和起始点与目标点的情况下,找到最佳路径的过程。最佳路径可以是最短距离、最短时间、最少消耗等,具体取决于实际需求。传统的路径规划算法,如Dijkstra算法和A*算法,虽然能够找到较优的路径,但是对于复杂的场景或多目标优化问题来说,其求解效果有限。而基于遗传算法的路径规划优化策略能够通过模拟生物进化的方式,不断优化路径以适应复杂环境和多目标需求。

2. 遗传算法概述

遗传算法是一种基于生物进化思想的启发式优化算法。它模拟了生物进化中的遗传、变异和适应度选择等过程,通过群体的不断演化来搜索问题的解空间。遗传算法的基本流程包括初始化种群、选择、交叉、变异和适应度评估等步骤。

3. 基于遗传算法的路径规划优化策略

在基于遗传算法的路径规划优化中,首先需要将路径规划问题转化为遗传算法的解空间。一种常见的方法是将地图网格化,每个网格作为遗传算法的一个基因,通过基因组合来表示路径。接下来,需要定义适应度函数,用于评估每个个体(路径)的好坏程度。适应度函数可以根据实际需求来设计,如路径长度、时间或消耗等。然后,通过遗传算法的选择、交叉和变异操作对种群进行迭代,直到满足终止条件。

4. 实例分析

以机器人导航为例,假设我们需要将机器人从起始点A导航到目标点B。我们可以将地图网格化,并将每个网格看作遗传算法的一个基因。接下来,我们定义适应度函数为路径的长度。然后,通过选择、交叉和变异操作对种群进行迭代,直到找到最优路径。通过这样的基于遗传算法的路径规划优化策略,我们可以在复杂环境中找到最短路径,从而实现机器人的导航。

5. 结论

基于改进遗传算法的AUV_动态目标搜索算法

第45卷第3期2023年6月指挥控制与仿真CommandControl&SimulationVol􀆰45 No􀆰3Jun􀆰2023文章编号:1673⁃3819(2023)03⁃0039⁃07基于改进遗传算法的AUV动态目标搜索算法谢 锋,姚 尧,张晓霜(江苏自动化研究所,江苏连云港 222061)摘 要:针对水下动态目标搜索问题,提出一种基于改进遗传算法的AUV动态目标搜索算法。采用蒙特卡罗统计方法生成大量目标运动轨迹,作为计算适应度依据;结合水声模型提出一种新型的累积探测概率计算方式;种群选择采用灾变思想与精英主义相结合方法,保证种群的非劣性和多样性,加速跳出局部极值;采用混沌序列方式选择交叉和变异点,增加种群随机性;采用动态自适应的交叉概率与变异概率,减少经验依赖,保证后期种群多样性。仿真实验结果表明,相较于传统算法和经典遗传算法,改进遗传算法能有效避免陷入局部极值,提高搜索概率。关键词:动态目标搜索;改进遗传算法;灾变思想;混沌序列;累积探测概率中图分类号:U674􀆰941;TP23 文献标志码:A DOI:10.3969/j.issn.1673⁃3819.2023.03.006DynamictargetsearchalgorithmforAUVbasedonimprovedgeneticalgorithmXIEFeng,YAOYao,ZHANGXiaoshuang(JiangsuAutomationResearchInstitute,Lianyungang222061,China)Abstract:Fortheunderwaterdynamictargetsearchingproblem,anAUVdynamictargetsearchalgorithmbasedonim⁃provedgeneticalgorithmisproposed.TheMonteCarlomethodisusedtogeneratealargenumberoftargetmotiontrajectoriesasthebasisforcalculatingthefitness;anovelwaytocalculatethecumulativedetectionprobabilityisproposedincombina⁃tionwiththehydroacousticmodel;thepopulationselectionadoptsacombinationofcatastropheideaandelitismmethodtoensurethenon⁃inferiorityanddiversityofthepopulationandacceleratethejumpoutoflocalextremes;chaoticsequenceisusedtoselectthecrossoverpointsandvariationpointstoincreasethepopulationrandomness;adoptingdynamicadaptivecrossoverprobabilityandvariationprobabilityreduceempiricaldependenceandensurepopulationdiversityinthelaterstage.Thesimulationexperimentalresultsshowthattheimprovedgeneticalgorithmcaneffectivelyavoidfallingintolocalextremesandimprovethesearchprobabilitycomparedwiththetraditionalalgorithmandclassicalgeneticalgorithm.Keywords:dynamictargetsearch;improvedgeneticalgorithm;catastropheidea;chaoticsequence;cumulativedetectionprobability

基于遗传算法的主题爬行技术研究

总第228期 2008年第lO期 计算机与数字丁程 Computer&Digital Engineering Vo1.36 No.10 50 

基于遗传算法的主题爬行技术研究 

关慧芬师军马继红 

(陕西师范大学计算机科学学院西安710062) 

摘要针对目前主题搜索策略的不足,提出了基于遗传算法的主题爬行策略,提高了链接于内容相似度不高的网页 之后的页面被搜索的机会,扩大了相关网页的搜索范围。同时,在网页相关度分析方面,引入了基于本体语义的主题过滤策 略。实验结果表明,基于遗传算法的主题爬虫抓取网页中的主题相关网页数量多,在合理选择种子集合时,能够抓取大量的 主题相关度高的网页。 关键词 主题爬虫 遗传算法 主题相关度 本体语义 中图分类号TP393 

Focused Crawling Technology Research Based 

on Genetic Algorithm 

Guan Huifen Shi Jun Ma Jihong 

(School of Computer Science,Shaanxi Normal University,Xi’an 710062) 

Abstract In order to overcome the deficiency of topic search strategy,a focused crawling approach genetic algo- rithm was proposed.The method increases the crawling chance of the web page following the web page with low content— relevance,and broadens the relevant—searching scope of crawlers.Meanwhile,we use a topic filtering strategy based on concept for page relevance analysis.Experimental results indicate that crawler based on genetic algorithm capture more topic correlativity pages,and if we choose reasonable seed collection,crawlers can capture a large number of high topic correlativity pages. Key words focused crawlers,genetic algorithm,topic correlativity,ontology—semantic—analysis Class Number TP393 

基于遗传算法的主题爬虫搜索策略研究

湖北工业大学

硕士学位论文

基于遗传算法的主题爬虫搜索策略研究

姓名:梁云静

申请学位级别:硕士

专业:计算机应用技术

指导教师:邵雄凯

20100301湖 北 工 业 大 学 硕 士 学 位 论 文

I摘 要

传统的搜索引擎需要对互联网上的信息进行广泛的收集和分析处理,随着互

联网的急剧膨胀,传统的搜索引擎需要处理的网络信息也越来越多,同时也就不

可避免的为用户提供了或多或少的无关信息。在专业化需求日益增长的今天,主

题搜索引擎以其分类细致精确、数据全面准确的特点迅速流行起来,而主题搜索

引擎的关键技术——主题爬虫的搜索策略就成为了近几年的研究热点。

本文将遗传算法应用在主题爬虫的搜索中,引入遗传算法来改进爬虫的搜索

策略,利用遗传算法高效、并行、全局寻优的特点,提高爬虫的搜索效率。本文

的研究内容主要有以下两个方面:根据网络特点改进传统的遗传算法;通过实验

验证改进后的效果。

基于遗传算法的主题爬虫搜索策略,是将待检索的问题提交给通用搜索引

擎,对其返回的结果集进行处理,选择一定数目的URL作为初始群体;通过交

叉操作,提取初始群体中URL对应页面包含的所有超链,产生出大量新的个体,

再对所有超链进行相似度预测,选出相关度高的种子作为交叉结果;通过变异操

作,引入目录型网页,扩大搜索范围;通过选择操作,对遗传之后的结果进行处

理,选出相关度高的个体作为新一代的种子进入新一轮的遗传;通过爬虫终止搜

索条件,来结束爬虫的搜索。

本文在构造初始群时,将待检索的问题提交给通用搜索引擎Google,对其

返回的结果集选择前n个URL,再扩展、去重、计算Authority和Hub值,重点

是引入了Alexa排名,然后依据综合排名值选择初始种子集合。在交叉过程,根

据超链的锚文本有效地预测对应的页面与主题的相似度。在变异阶段,根据目录

型网页包含的大量链接和详细的分类来寻找相关网页。

本文设计了一个实验,来验证遗传算法在爬虫搜索中应用的可行性以及改进

  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档