Web页面信息抽取算法设计
Web页面的信息抽取算法设计
【摘 要】本文给出一种web页面的数据结构描述方式,比对所需信息的字符串序列,对通用型框架结构和数据域进行划分,经规则化处理后可以对web网页自动地生成模板,从而达到抽取信息的目的。
【关键词】信息抽取;通用框架;算法设计
1.引言
计算机和计算机网络的发展和普及,使得网络逐渐成为信息交流的关键平台。为了人们在海量的网络信息中更加便捷地获取所需信息,有必要对同领域信息的抽取、汇总、集成,可以建立对应领域的信息库。
web动态网页由服务器根据请求从数据库中选取数据并嵌入到通用模板而生成,缺乏结构和语义信息的描述,其中包含的信息不易被一般应用程序直接获取。因此,如何将网页中的数据抽取出来就变得非常迫切。web页面的信息抽取技术为实现这一目标提供了新的途径[1]。
2.web信息抽取的过程设计
2.1信息抽取
信息抽取(information extraction)是从文本包含中识别出用户所需的部分信息,并将其转换为结构化、有特定组织形式的数据集合的过程。
2.2 web 页面信息的数据结构的定义
web网页的基本元素用三类标签来描述,分别是开始标签、结束标签以及文本内容。web网页的数据结构是用字符串序列、标签树两种结构来描述。字符串序列是用开始标签、结束标签以及文本内容构成的一种线性数据结构;标签树用开始标签和文本内容表示网页层次结构。
2.3 web 信息抽取过程的设计
web 信息抽取方法关键环节为通用框架结构检测、模板抽取。图 1 是web 信息抽取的过程图。
web 信息抽取是将包含用户所需信息的 web 网页中的数据自动提取到一个结构化的数据集内的信息处理过程。web 信息抽取针对有价值的文本进行结构分析,其效率和质量较高,更注重工程性和可操作性,也更容易面向实际应用[2]。
3.实现web信息抽取的关键技术
3.1 抽取规则——构建通用型框架
通用型框架的建构以比对字符串序列异同的方式进行,对通用型框架结构和数据域进行划分。其中,通用型框架是指与web网页呈现的主要内容无关的部分,如导航条、头尾信息、广告信息和
flash特效等。数据域是指web网页中除了通用型框架以外的内容,将数据域的字符串序列进一步转换成标签树结构,就得到数据的样本集合。
通用型框架处理过程中检测网页间共有的且与网页实质内容无关的信息,对去除通用型框架后得到的数据域信息进行信息抽取时,准确率会有所提高。具体操作是,首先进行页面分区,将网页划分成不相交的区域的过程。然后定义区域树用树状结构对页面分区的结果进行表示。树的根结点对应于整个网页,父结点的区域由各子结点区域组成。接下来,确定结点的分区级别,得到该结点对应的区域时进行的页面分区次数。区域树的分区级别指树的深度。为区域树选定合适的分区级别将有利于检测到更佳的通用型框架结构。再定义通用型框架结构。将网页间共有的、与网页实质内容无关的头信息、尾信息、广告、浏览导向条以及 flash 等内容信息称为通用型框架结构。用双序列比对算法对网页字符串序列进行比对,将最佳的相似字符串作为通用型框架结构。算法流程如下[3,4]:
(1) 对变量max、x和y进行初始化。max 表示局部最大值,y 和x 分别表示矩阵当前行及其前一行。
(2) 计算得分矩阵。该过程由以下三步迭代完成。
(2.1)
其中p(i+1,j+1)为字符串匹配函数,当字符串匹配时取值c,否则,可取值d(d(2.2.3)若rb==null,令为设定值;
(2.3)当rjz 和rb 中有且只有一个是叶结点时,
(2.3.1) 若rb 非空,令rb 为其第一右兄弟结点,重复
(2.3.1),否则转(2.3.2);
(2.3.2) 若rb 为空,令rjz. name =,否则,转(2.1);
(2.4)若rjz 非空,令rjz 为其第一右兄弟结点,重复(2.1),否则,转(3);
(3)重新遍历pjz ,对相同的子树进行合并。
通过对网页的通用型框架结构进行定义,在信息抽取算法中引入了通用型框架结构检测阶段,采用序列比对算法对同类网页所共有的、与网页表达的实质内容无关的信息进行检测,除掉了通用型框架结构的网页信息,对信息抽取更加有利。该算法可以对数据密集的真实网页自动地生成模板、抽取信息,既不局限于人为定制的测试网页也不依赖于网页内容的先验知识[5]。
4.实验结果与分析
4.1 评价标准
实验中,我们采用召回率和查准率作为评价的指标对信息抽取系统进行评价。从直观上说,召回率可以理解为,从网页中正确抽取出来的数据项的比例,查准率可以理解为,被抽取出来的数据项中正确的比重。
当我们评价一个信息抽取系统时,为了综合评价系统的性能,应同时考虑这两个指标。为了能够直接地同时比较召回率和查准率,设定β为权重参数,其值反应在评测时侧重召回率还是查准率,由系统预设。若需要设定表明查准率更重要,就设定 β> 1,反之,
召回率更重要则设定β< 1。在信息抽取系统中,通常设定β==1,以反应召回率和查准率的重要性是等同的。
4.2 实验设计与分析
本文实验采用的网页来自于真实的站点中的动态 web 网页,其中包含的信息纷繁复杂,包括 html 页面的头信息、尾信息、广告、浏览导向条、flash 等,实验中,我们预先对网页中标签缺失的情况进行修正以便建立标签树。
在数据集合上应用带序列比对的信息抽取算法,对参数θ进行调节,根据抽取结果为算法选择合理的参数值。表 1 结果显示的是θ取不同值时的召回率和查准率。
对参数θ取不同的值分别进行实验,根据实验结果为算法选择合理的参数值,为后绪模板抽取实验做好准备。图3为表1对应的曲线图。
在实验召回率与查准率对照图即图3 中,纵坐标表示召回率和查准率,横坐标表示参数θ,如图所示,当θ的取值为 1.2时抽取信息的效果最优。实验证明了本文上述抽取算法的有效性。
5.结论
web网页的信息抽取过程中采用序列比对的方式进行通用型框架结构检测,剥离网页中的冗余信息,有利于模板抽取的精确度的提高。实验中把真实网站的数据密集型网页作为样本,对抽取算法在数据量和抽取准确率等方面进行了测试和比较,结果充分证明了
算法的有效性。
参考文献:
[1]张鹏程,李必信,李雯睿. 时间属性序列图: 语法和语义.软件学报,2010,vol.21(11): 2752-2767.
[2]刘凯鹏,方滨兴.一种基于社会性标注的网页排序算法.计算机学报,2010,vol.33(6): 1014-1023.
[3]陈传夫,唐琼,于媛,吴志强等.网络上科学信息的时效性测量.情报学报,2009, vol.28(4): 610-617.
[4]刘冬宁,汤庸.时态数据库时间轴的动态逻辑模型.软件学报, 2010, vol.21(4):694-701.
[5]寇月,李冬,申德荣,于戈,聂铁铮.d-eem: 一种基于dom
树的deep web 实体抽取机制. 计算机发展与研究,2010,vol.47(5): 858-865.
基金项目:
广西教育厅科研课题(201106lx606)。
作者简介:
杨 凤(1981-),女,湖南常德汉寿县人,硕士,讲师,主要研究方向为:数据挖掘。
视频搜索引擎中的精确文本信息抽取系统的设计与实现的开题报告
视频搜索引擎中的精确文本信息抽取系统的设计与实现的开题报告
一、选题依据
随着互联网和数字化技术的快速发展,视频成为现代社会最主流的信息媒介之一,同时,视频的产生和共享数量也呈现出爆发式增长。对于用户而言,如何高效地搜索和浏览所需的视频信息,已成为亟待解决的问题。传统的视频搜索引擎一般只能根据视频的标题、标签等元数据信息进行搜索,而无法准确捕捉视频中所涉及的真实语义内容。
当前,视频搜索引擎的发展趋势是向精准化、智能化、多元化的方向发展。而信息抽取是实现视频搜索精准化的重要手段之一,它可以帮助搜索引擎从视频中自动抽取出有意义的文本信息,从而满足用户的需求。
本文旨在研究视频搜索引擎中的精确文本信息抽取系统的设计与实现,旨在通过结合机器学习和自然语言处理技术,实现对视频中关键信息的准确抽取,提高搜索引擎的检索准确度和用户体验。
二、研究内容
1. 分析现有视频搜索引擎中信息抽取技术的研究现状,探讨基于机器学习和自然语言处理的文本信息抽取方法;
2. 设计和实现一个可用于视频搜索引擎中的精确文本信息抽取系统,该系统应具备以下特点:
(1)采用机器学习算法实现关键信息提取,包括层次化识别、预处理等模块的设计与实现;
(2)结合自然语言处理技术,实现对文本信息的语法分析、情感分析和实体识别; (3)为用户提供检索结果可视化接口,使得用户能够更加直观地感受检索结果的准确度与可靠性。
三、预期成果
通过对视频搜索引擎中的精确文本信息抽取系统的研究和开发,预期实现以下成果:
1. 实现一个能够自动从视频中抽取关键文本信息的系统,与传统视频搜索引擎相比,检索结果更加准确、精细化;
2. 拥有可视化的检索结果展示系统,方便用户更直观地了解搜索结果的精度、准确性和可靠性;
3. 提出一种基于机器学习与自然语言处理技术的新型文本信息抽取方法,该方法具有可以推广应用的实用价值。
四、研究计划
时间节点 | 研究内容
-|-
基于Web的数据挖掘及其应用
基于Web的数据挖掘及其应用
摘要:web数据挖掘,就是利用数据挖掘技术自动地从网络文档以及服务中发现和抽取信息的过程。本文笔者首先对web数据挖掘的涵义、产生原因、特点以及其特殊的要求做了具体的介绍,然后以其在网络教育和电子商务中的应用重点阐述web数据挖掘的应用价值。
关键词:web数据挖掘;信息;网络教育;电子商务
中图分类号:tp274 文献标识码:a 文章编号:1007-9599
(2012) 19-0000-02
1 引言
数据挖掘是从大量的、不完全的、有噪声的、模糊的、随机数数据中提取隐含在其中的、人们事先不知道的但又是潜在有用的信息和知识的过程。包括存储和处理数据,选择处理大数据集的算法、解释结果、使结果可视化。数据挖掘是一种新的商业信息处理技术,其主要特点是对商业数据库中的大量业务数据进行抽取、转换、分析和其他模型化处理,从中提取辅助商业决策的关键性数据。利用功能强大的数据挖掘技术,可以使企业把数据转化为有用的信息帮助决策,从而在市场竞争中获得优势地位。
随着信息技术的飞速发展,网络信息搜集的需求与收集结果低效性的矛盾迫切需要对网络资源的整序与检索。所以传统数据挖掘掘技术不断完善和应用。web挖掘就是时代发展的典型产物。web数据挖掘采用数据挖掘等信息处理技术,从web信息资源及web使
用记录中发掘对特定用户感兴趣的、有用的信息或知识的过程,其结果可以为用户决策所使用。这里所讲的web信息,从广义上讲,包括web文本,web图片,web动画(如flash广告,视频信息)等。换言之,基于web数据挖掘,就是利用数据挖掘技术自动地从网络文档以及服务中发现和抽取信息的过程。有学者认为其是在大量已知数据样本的基础上得到数据对象间的内在特性,并以此为依据在web中进行有目的的信息提取过程。同时,也有学者将网络环境下的数据挖掘归入网络信息检索与网络信息内容的开发等等。总之,基于web的数据挖掘(web mining)正是从万维网(world wide
Web数据挖掘研究与探讨
一垒!!兰生塑翌!竺
Web数据挖掘研究与探讨
ResearchanddiscussionofWebdatamining刘树超1,李永臣2,武洪萍1
LIUShu.chao。,LIYong.chen2,WUHong-pin91(1.山东信息职业技术学院,潍坊,261041;2.潍坊市社会保险事业管理中心,潍坊261061)摘要:www是一个巨大的、分布广泛的、全球性的信息服务中心,它包含了丰富的信息资源。Web数据挖掘可以快速有效地获取所需要的信息。本文重点探讨了Web挖掘的基本原理和关键技术,针对Web挖掘的分类进行了描述,论述了Web挖掘的挖掘流程、应用领域及研究发展方向。关键词:数据挖掘;Web内容挖掘;Web使用挖掘;Web结构挖掘中图分类号:TP391文献标识码:A文章编号:1009-0134(2010)09—0163-03Doi:10.3969/J.issn.1009-0134.2010.09.50
0引言
随着Internet/Web技术的快速普及和迅猛发
展,Internet已经成为人们获得信息的重要手段,
但它是巨大的、多样的和动态变化的。随着Web
站点的规模和复杂度的增加,站点设计和维护工
作变得越来越困难。作为网站经营者,希望根据用户的访问兴趣、访问频度、访问时间动态地调
整页面结构,改进服务,开展有针对性的电子商
务以更好地满足访问者的需求。而从访问者的角
度出发,他们希望用最简洁的方式得到最精确的
信息,希望得到个性化的服务。Web数据挖掘就
是为顺应这种需要而发展起来的数据处理技术,即利用数据挖掘的思想和方法,在Web上挖掘出
有用的信息。
1Web数据挖掘的含义
Web数据挖掘(WebDataMiningWDM)是
将数据挖掘技术运用于Web数据,提取人们感兴
趣的、隐藏其中的、有用的、新颖的模式或知识
的过程。也就是说,针对包括Web页面内容、页
面之间的结构、用户访问信息、电子商务信息等
在内的各种Web数据,应用数据挖掘方法以帮助
Web信息检索中信息分类技术研究
龙源期刊网
Web信息检索中信息分类技术研究
作者:马纪颖 朱力军 张 颜
来源:《现代电子技术》2008年第10期
摘 要:随着Internet/Intranet的快速发展和普及,丰富的Web资源构成一个巨大的全球信息仓库。在海量数据空间中快速、准确地获取用户所需成为Web检索系统研究的焦点。将一种全新的网页自动分类技术引入WWW信息抽取领域,解决网上信息有效获取的问题。获取网站分类体系,设计的Web信息自动归类算法,可通过Web数据抽取机制以及Web信息分类技术实现检索结果的分类和层次化展示,使用户快捷准确地从WWW上获取所需信息。
关键词:信息检索;信息归类;分类体系;层次化展示
中图分类号:TP393.092 文献标识码:A
文章编号:1004-373X(2008)10-076-
(
Abstract:As Internet/Intranet developing quickly and being popular,affluent Web resources
have composed a huge global information warehouse.It becomes more and more important in
information retrieval research that how to obtain the Web information what users need among
magnanimity data space fast and accurately.In order to improve the performance of search engine,this
paper applies a new technology of Web page classification to the existing search engine.We obtain
信息熵的计算及实现
认知实习报告
题 目 __信息熵的计算及实现_________ _
(院)系 数理系 ___________
专业 _______信息与计算科学__________________
班级_ _ 学号_ 20081001 _
学生姓名 _ _
导师姓名_ ___ ________
完成日期 ________2011年12月23日___________
信息熵的计算及实现
信息与计算科学专业:
指 导 教 师:
摘要:信息的销毁是一个不可逆过程,一般而言,当一种信息出现概率更高的时候,表明它被传播得更广泛,或者说,被引用的程度更高。我们可以认为,从信息传播的角度来看,信息熵可以表示信息的价值。这样我们就有一个衡量信息价值高低的标准,可以做出关于知识流通问题的更多推论。本文讨论了一维几种熵的计算方法:离散信源的熵、图像熵的一维熵和二维熵、基于信息熵的Web页面主题信息计算方法,并给出一定的理论分析和数值实验以及数值实验结果。
关键字:离散信源的熵、图像熵、Web页面主题信息
1 引言
信息论之父 C. E. Shannon 在 1948 年发表的论文“通信的数学理论( A
Mathematical Theory of Communication )”中, Shannon
指出,任何信息都存在冗余,冗余大小与信息中每个符号(数字、字母或单词)的出现概率或者说不确定性有关。 Shannon
借鉴了热力学的概念,把信息中排除了冗余后的平均信息量称为“信息熵”,并给出了计算信息熵的数学表达式。
2 问题提出
信源的平均不定度。在信息论中信源输出是随机量,因而其不定度可以用概率分布来度量。记 H(X)=H(P1,P2,„,Pn)=P(xi)logP(xi),这里P(xi),i=1,2,„,n为信源取第i个符号的概率。P(xi)=1,H(X)称为信源的信息熵。
基于Web页面结构和主色调的聚类算法
第36卷 VoL36 第3期 No。3 计算机工程 Computer Engineering 2010年2月 February 2010 ・博士论文・ 文章编号:1o00—3428(20l0)03—彻o1—03 文献标识码;A 中田分类号t TP391 基于Web页面结构和主色调的聚类算法 赵滑滑,陈俊杰,李元俊 (太原理工大学计算机与软件学院,太原030024) 摘要:针对目前Web聚类准确率不高的问题,提出一种基于Web页面链接结构和页面中图片主色调特征的聚类算法。通过分析Web页 面中的链接结构和Web页面中所显示图片的主色调来比较页面之间的相似度,对Web站点中的Web页面进行聚类。聚类过程兼顾Web 页面结构和页面的主要色彩特征。系统实验结果表明,该算法能有效提高聚类的准确性。 关健词:聚类;Web挖掘;链接结构;主色调 Clustering Algorithm Based on Web Pages Structure and Dominant Color ZHAO Juanduan,CHEN Jundie,LI Yuandun (College ofComputer and Software,Taiyuan University ofTechnology,Taiyuan 030024) [Abstract]Aiming at the problem that the efficiency is low in Web clustering,this paper proposes a clustering algorithm based on linkage structure and the character of the dominant color on Web pages.It compares the similarity between Web pages by analyzing the linkage and the dominant color on them.It Can cluster the Web pages on Web sites.In this procedure,the clustering has both the structure and the main character of tone. Experimental results ofthe system prove that it has made the clustering become more efficient and it has improved a lot than before. [Key words]clustering;Web mining;linkage structure;dominant color l概述 Web数据是异构的、非结构化的、动态变化的,这就需 要将Web页面分类(聚类),对不同的分类设计不同的分装器 (Wrapper),并进行信息抽取,最终得到的结构化数据进行数 据挖掘。 目前该领域的研究主要有基于文本内容的Web页面主题 聚类_J 和基于Web页面结构的聚类 ;前者仅考虑Web页面 的内容信息,聚类时间效率低,而且它不关心Web页面的结 构,不利于分装器的设计;后者虽然聚类效率较高,但是它 没有利用不同页面在页面内容方面的个性化特征(如文本内 容、色彩、样式等)致使聚类结果不是很准确。 本文设计一种兼顾Web页面结构特征和Web页面内容 的聚类方法(CABSW),该方法巧妙地利用了Web页面的超链 接结构 的规律性和Web页面的主色调特征的相似性,通过 分析Web站点中一部分(而不是全部页面)但是具有代表性的 页面得到站点分类模型,从而为设计分装器提供训练样本, 保证整个数据挖掘过程顺利进行。实验结果表明,该方法能 在聚类的效率和准确率方面达到较好的效果。 2聚类方法分析 2.1 Web页面特征胡析 根据对Web页面的深入分析,发现其具有更适合于聚类 算法的结构。 2.1.1反映Web页面的链接结构 利用Web页面解析技术可以发现,“网页链接标签路径p J (1ink-path)集合”可作为Web页面的特征项和判别Web页面 相似度和聚类的主要依据;图1是一个Web页面生成的DOM 树型结构,该页面的link—path集合为{HTML—TABLE—UL—LI, HTML—TABLE-TD—TR-TD}。 /\ l I L I LI火 /\ i f TlD了 2.1.2相同link—path下的相似性链接 如图1中的DOM树所示,该Web页面中的link—path {HTML.TABLE.TR—TD}下面包含有2个链接{urll,url2},认 为这2个链接极有可能指向同一类别的Web页面,这是因为 格式良好的Web页面的样式和布局都是很有规律的,超链接 布局如图2所示。 基金项目:国家自然科学基金资助项目(60773004);山西省自然科学 基金资助项目(2006011030,2007011050) 作者筒介:赵涓涓(1975一),女,讲师、博士研究生,主研方向:智 能信息处理,情感计算,数据挖掘;陈俊杰,教授、博士、博士生 导师;李元俊,硕士研究生 收稿日期:2009-07—03 E-mail: ̄juanjuan@126.c
基于Web挖掘的化学物质信息提取应用研究
2012年8月 第33卷第8期 计算机工程与设计
COMPUTER ENGINEERING AND DESIGN Aug.2012 VoL 33 No.8
基于Web挖掘的化学物质信息提取应用研究
冯硕,李书琴+,杨会君
(西北农林科技大学信息工程学院,陕西杨凌712100)
摘要:针对多信息源网站中化学物质信息的获取与数据库的更新查询问题,运用网络爬虫技术和包装器方法实现数据的
抽取;采用自定义XML文件的方式,提出了任务分割、动态更新检查、失败重试机制方法,实现了动态信息源网站中化
学物质信息的持续、实时抽取,并进行异常处理和监控。将抽取的数据运用正则表达式和排序算法进行预处理并构建全面
而准确的化学品环境安全数据库,最终实现了对原有数据的更新查询,在一定程度上保证了可靠性、可用性、可扩展性、
可维护性。
关键词:Web信息抽取;任务分割;重试机制;持续抽取;数据预处理
中图法分类号:TP311.52 文献标识号:A 文章编号:1000—7024(2012)08 3040—07
Application research on chemical information extraction based on
web data mining
FENG Shuo,LI Shu—qin+,YANG Hui-j un
(College of Information Engineering,Northwest Agriculture and Forestry University,Yangling 712100,China)
Abstract:To solve the problems of chemical substance information acquisition from Multi-source website,database update and
database query,the technology of web crawler and the method of the wrapper are used to extract data,and methods of task par—
【计算机系统应用】_算法设计_期刊发文热词逐年推荐_20140725
序号科研热词推荐指数序号科研热词1数据库31数据挖掘2组卷22遗传算法3算法23对等网络4校正算法24任务调度5嵌入式25鸟类6arm926频繁项目集7颜色传感器17面积补偿8随机早期丢弃18非混杂模式9问答系统19青海湖10重组110重要抽样11逻辑链路控制与适配层111逻辑判别12远程视频监控112通讯规约13身份认证113通用试题库14语义相似度114远程控制15视觉监控115过饱和度elman神经网络16蓝牙116迁徒17聚类117路由算法18耳轴轴承118超宽带19网页分类119超声红外20网页内容抽取120资源分配21网页121货物管理22网络仿真122负载均衡23算法框架123贝叶斯网络24策略124贝叶斯分类器25答案更新125谱聚类26神经网络126误报率27相关新闻127评价28相似度128触发器29目标检测129视差30潜在语义分析130蚁群算法31流媒体转发131草图32洗出算法132节点定位33注入133自维护34正方形细分算法134自组织35模糊聚类135聚类数据空间36模拟驾驶136网页排序算法37模型137网络安全38概率潜在语义分析138网格计算39树139网构软件40服务器标识140缓存机制41服务器141缓存替换42无线自组织网络142结构相似性43新闻采集143结构化44新闻搜索144结构关系模式挖掘45数据系统b+tree算法145终端适配46数据系统146组网47数据库管理147组合优化48故障诊断148组件技术49改进149线性模型50插入式排序150纺织品51拥塞控制151纹理合成52快速排序152红外光线2008年2009年53常见问题集153系统设计54带宽瓶颈154糖业专业搜索引擎55差分图像155粒子群算法56巡线156算法测试平台57嵌入式qt157算法58嵌入式linux158程序流程图59对象159稀有事件60实验床160神经网络61多征兆故障161着法顺序62在线考试系统162相关系数63图片口令163疲劳驾驶64图像目标提取164电子白板65图像合成165电子商务66图像分割166生物免疫原理67可扩展167煮糖结晶过程68单片机168灾害救助69包装器169灰度特征70加密算法170火情识别算法71分段171漏报率72分形理论172滚动字幕73光电纠偏173渐进式挖掘74光电检测174混沌75主动队列管理175汉明距离扩展76主动服务176气象观测站77三维地形177模糊核聚类78一次性口令178模糊控制器79web信息抽取179模糊c聚类算法80web180检索功能81vba181案例调整82tms320f2812特种车182案例推理83tms320c6701183栈84sql server2000184柔性作业车间调度85sql185构件组装86session186权矩阵87qt187机器视觉88p2p188有源rfid89otc189最优请求转发90md5190替代算法91linux191智能分析92gsm192景深93dsp193时间片轮转94dom194早熟95cpld195日期复杂度96cis196无线传感器网络97bp算法197新闻门户98berkeleydb数据库198数字校园99berkeleydb199教学班100b/s1100效率101b+tree算法1101改进遗传算法102atmega8l1102搜索引擎1103提取104asp1104推荐系统105access1105推荐算法106抽象语法树
Web
龙源期刊网
Web挖掘技术及在电商ERP中的应用
作者:刘刚
来源:《电子世界》2012年第04期
【摘要】数据丰富而知识贫乏导致了知识发现和数据挖掘领域的出现,基于Web的数据挖掘,是从Web海量的数据中自动、智能地抽取隐藏于这些数据中的知识。文章主要介绍了Web挖掘的概念和技术,最后阐述了Web挖掘在电子商务ERP中的应用。
【关键词】数据挖掘;Web挖掘;电子商务ERP
数字化和信息化的生存模式以及工业生产革命,使整个世界的经济面临新的机遇和挑战。电子商务ERP作为全球经济发展的最终趋势,将成为21世纪贸易活动的基本形态。据2006年7月19日CNNIC在北京发布《第十八次中国互联网络发展状况统计报告》显示,截止到2006年6月30日,我国网站数已达788,400个,目前大约2500万人经常使用网上招聘,经常使用上网购物人数达到3000万人,分别占网民总数的20%、26%。
电子商务ERP网站每天需要海量数据,但数据资源中蕴含的有用信息却至今没有得到充分的发掘和利用。为了解决这些问题,我们将传统的数据挖掘[1]同Web结合起来,进行Web挖掘[2],即从Web文挡和Web活动中抽取潜在的有用模式和隐藏的信息。
1.Web挖掘的概念
Web挖掘指使用数据挖掘技术在WWW数据中发现潜在的、有用的模式或信息的过程。Web挖掘研究覆盖了多个研究领域,包括数据库技术、信息获取技术、统计学、人工智能中的机器学习和神经网络等。
2.Web挖掘的过程
Web挖掘的处理流程如下所示:
各种数据——〉信息检索——〉信息提取——〉概括——〉分析——〉知识
2.1 信息检索IR(Information Retrieval),IR自动提取所有相关文档,同时确保不相关的文档尽量的少。当前IR的研究包括建模、文档分类、聚类、用户接口、数据可视化等。
【计算机应用与软件】_信息抽取_期刊发文热词逐年推荐_20140722
序号科研热词推荐指数序号科研热词1数据抽取31信息抽取2设计方案22特征抽取3客户关系管理23预处理4信息抽取24透视图像5规则学习15过滤器6自然语言理解16软件开发过程7自动文摘17软件复用8网页信息抽取18贝叶斯学习9结构化数据19贝叶斯分类器10用户兴趣110贝叶斯分类11特征抽取111语义相似度12特征向量112解析13特征信息提取113规则14深度114表格结构15机器学习115虚拟方法16文本抽取116自动构建17文本分类器117自动摘要18数据映射118脱机中文签名鉴定19数学表达式提取119聚类20掌纹识别120网页预处理21垂直搜索121网页浏览器22合成122网页抓取23全文检索123网页分割24光线投影124结构化异构数据25信息集成125知识获取26体绘制126电信27交互127生物测定28主分量分析128特征提取29中文分词129死锁30中文信息处理130模式匹配31专有名词识别131概念术语32postscript132检测33lucene133树自动机34hmm134树木分类35构件36条件随机场37本体38昆虫图像分割39文档对象模型40文本聚类41文本分类42文本分块43数据抽取44数据仓库45搜索引擎46指控信息网47拉普拉斯算子48抽取规则49抽取模型50局部特征51大数据量52基本体素2008年2009年53图像分类54启发式规则55启发式搜索56包装器57分类58冬态59公共仓库元模型60元数据提取61信息集成62信息检索63信息提取64互信息65主题划分66中文分词67三维重建68xml69web数据集成70web挖掘71petri网72lsvm73j2ee平台74html文档75html76etl77em算法78dom79deep'web
