数据挖掘综述
数据挖掘综述
1、产生背景
随着计算机的产生和大量数字化的存储方法的出现,我们借助计算机来收集和分类各种数据资料,但是不同存储结构存放的大量数据集合很快被淹没,便导致了结构化数据库以及DBMS的产生。
但是随着信息时代的到来,信息量远远超过了我们所能处理的范围,从商业交易数据、科学资料到卫星图片、文本报告和军事情报,以及生活中各种信息,这也就是“数据爆炸但知识贫乏”的网络时代,面对巨大的数据资料,出现了新的需求,希望能够更好的利用这些数据,进行更高层次的分析,从这些巨大的数据中提取出对我们有意义的数据,这就是知识发现(KDD,Knowledge
Discovery in Databases),数据挖掘应运而生。
2、数据库系统技术的演变
1)20世纪60年代和更早
这个时期是数据收集和数据库创建的过程,原始文件的处理
2)20世纪70年代---80年代初期
有层次性数据库、网状数据库、关系数据库系统
3)20世纪80年代中期—现在
高级数据库系统,可以应用在空间、时间的、多媒体的、主动的、流的和传感器的、科学的和工程的。
4)20世纪80年代后期—现在 高级数据分析:数据仓库和数据挖掘
5)20世纪90年代—现在
基于web的数据库,与信息检索和数据信息的集成
6) 现在---将来
新一代的集成数据域信息系统
3、 数据挖掘概念
数据挖掘(Data Mining),就是从大量数据中获取有效的、新颖的、潜在的有用的,最终可以理解的模式的非平凡过程。数据挖掘,又称为数据库中知识发现(KDD,Knowledge Discovery in
Databases),也有人把数据挖掘作为数据库中知识发现过程的一个基本步骤。
数据挖掘基于的数据库类型主要有:关系型数据库、面向对象数据库、事务数据库、演绎数据库、时态数据库、多媒体数据库、主动数据库、空间数据库、遗留数据库、异质数据库、文本型、Internet信息库以及新兴的数据仓库等。
4、 数据挖掘特点和任务
4.1数据挖掘具有以下几个特点:
1) 处理的数据规模十分庞大,达到GB,TB数量级,甚至更大
2) 查询一般是决策制定者(用户)提出的即时随机查询,往往不能形成精确的查询要求,需要靠系统本身寻找其可能感兴趣的东西。
3) 在一些应用(如商业投资等)中,由于数据变化迅速,因此要求数据挖掘能快速做出相应反应以即时提供决策支持。
4) 数据挖掘中,规则的发现基于统计规律。因此,所发现的规则不必适用于所有数据,而是当达到某一临界值时,即认为有效。因此,利用数据挖掘技术可能会发现大量的规则。
5) 数据挖掘所发现的规则是动态的,它只反映了当前状态的数据库具有的规则,随着不断地向数据库中加入新数据,需要随时对其进行更新。
4.2数据挖掘的主要任务
数据开采技术的目标是从大量数据中,发现隐藏于其后的规律或数据间的关系,从而服务于决策。数据挖掘一般有一下四类主要任务
数据总结
数据总结目的是对数据进行浓缩,给出它的总体综合描述。通过对数据的总结,数据挖掘能够将数据库中的有关数据从较低的个体层次抽象总结到较高的总体层次上,从而实现对原始基本数据的总体把握。
利用OLPA技术实现数据的多维查询也是一种广泛使用的数据总结的方法。
分类
分类的主要功能是学会一个分类函数或分类模型,该模型能够根据数据的属性将数据分派到不同的组中。即:分析数据的各种属性,并找出数据的属性模型,确定哪些数据属于哪些组。这样我们就可以利用该模型来分析已有的数据,并预测新数据将属于哪一个组。
关联分析
数据库中的数据一般都存在关联关系,也就是说,两个或多个变量的取值之间存在某种规律性。这种关联关系有简单关联和时序关联两种。简单关联,例如:购买面包的顾客中有90%的人同时购买牛奶。时序关联,例如:若AT&T股票连续上涨两天且DEC股票不下跌,则第三天IBM股票上涨的可能性为75%。它在关联中增加了时间属性。
关联分析的目的是找出数据库中隐藏的关联网,描述一组数据项目的密切度或关系。有时并不知道数据库中数据的关联是否存在精确的关联函数,,即使知道也是不确定的,因此关联分析生成的规则带有置信度,置信度级别度量了关联规则的强度。
聚类
当要分析的数据缺乏描述信息,或者是无法组织成任何分类模式时,可以采用聚类分析。聚类分析是按照某种相近程度度量方法,将用户数据分成一系列有意义的子集合。每一个集合中的数据性质相近,不同集合之间的数据性质相差较大。
统计方法中的聚类分析是实现聚类的一种手段,它主要研究基于几何距离的聚类。人工智能中的聚类是
基于概念描述的。概念描述就是对某类对象的内涵进行描述,并概括这类对象的有关特征。概念描述分为特征性描述和区别性描述,前者描述某类对象的共同特征,后者描述不同类对象之间的区别。
5、 数据挖掘系统分类
如今有很多现有的或者正在开发的数据挖掘系统,其中有些是专门用于给定或局限于有限的数据源的系统,有些相比则更加灵活和全面。根据不同标准可以将数据挖掘系统分类。
(1)根据数据源类型分类。有空间数据、多媒体数据、时间序列数据、文本数据、Web 数据等数据挖掘系统。
(2)根据数据模型分类。基于关系数据库、面向对象数据库、数据仓库、事务数据库的数据挖掘系统。
(3)根据挖掘的知识类型分类,即根据数据挖掘的功能分类,如特征化、比较、关联和相关分析、分类、预测、聚类、孤立点分析、偏差分析。一个综合的数据挖掘系统通常集成多种数据挖掘功能。
(4)根据所用的技术类型分类。这些技术可以根据用户交互程度(例如自动系统、交互探查系统、查询驱动系统)或所用的数据分析方法(例如面向数据库或面向数据仓库的技术、机器学习、统计学、可视化、模式识别、神经网络等)描述。复杂的数据挖掘系统通常采用多种数据挖掘技术。
6、数据挖掘步骤
数据库中的数据挖掘是一个多步骤的处理过程,一般分为:
问题定义,了解相关领域的有关情况,熟悉背景知识,弄清用户要求.
数据提取,根据要求从数据库中提取相关的数据. 数据预处理,主要对前一阶段产生的数据进行
再加工,检查数据的完整性及数据的一致性,对其中的噪音数据进行处理,对丢失的数据进行填补.
知识提取,运用选定的知识发现算法,从数据中提取用户所需要的知识,这些知识可以用一种特定的方式表示或使用一些常用的表示方式.
知识评估,将发现的知识以用户能理解的方式呈现,如某种规则,再根据实际情况对知识发现过程中的具体处理阶段进行优化,直到满足用户要求.
6.1数据挖掘核心步骤
7、数据挖掘方法
7.1 神经网络方法 神经网络由于本身良好的鲁棒性、自组织自适应性、并行处理、分布存储和高度容错等特性非常适合解决数据挖掘的问题,因此近年来越来越受到人们的关注。典型的神经网络模型主要分3大类:以感知机、BP反向传播模型、函数型网络为代表的,用于分类、预测和模式识别的前馈式神经网络模型;以Hopfield的离散模型和连续模型为代表的,分别用于联想记忆和优化计算的反馈式神经网络模型;以ART模型、Koholon模型为代表的,用于聚类的自组织映射方法。
7.2 遗传算法 遗传算法是一种基于生物自然选择与遗传机理的随机搜索算法,是一种仿生全局优化方法。
遗传算法具有的隐含并行性、易于和其它模型结合等性质使得它在数据挖掘中被加以应用。
7.3 决策树方法 决策树是一种常用于预测模型的算法,它通过将大量数据有目的分类,从中找到一些有价值的,潜在的信息。它的主要优点是描述简单,分类速度快,特别适合大规模的数据处理。最有影响和最早的决策树方法是由Quinlan提出的著名的基于信息熵的ID3算法。
414 粗集方法 粗集理论是一种研究不精确、不确定知识的数学工具。粗集方法有几个优点:不需要给出额外信息;简化输入信息的表达空间;算法简单,易于操作。粗集处理的对象是类似二维关系表的信息表。
目前成熟的关系数据库管理系统和新发展起来的数据仓库管理系统,为粗集的数据挖掘奠定了坚实的基础。但粗集的数学基础是集合论,难以直接处理连续的属性。而现实信息表中连续属性是普遍存在的。因此连续属性的离散化是制约粗集理论实用化的难点。
7.5 覆盖正例排斥反例方法 它是利用覆盖所有正例、排斥所有反例的思想来寻找规则。首先在正例集合中任选一个种子,到反例集合中逐个比较。与字段取值构成的选择子相容则舍去,相反则保留。按此思想循环所有正例种子,将得到正例的规则(选择子的合取式)。比较典型的算法有Michalski的AQ11方法、洪家荣改进的AQ15方法以及他的AE5方法。
7.6 统计分析方法 在数据库字段项之间存在两种关系:函数关系(能用函数公式表示的确定性关系)和相关关系(不能用函数公式表示,但仍是相关确定性关系),对它们的分析可采用统计学方法,即利用统计
学原理对数据库中的信息进行分析。可进行常用统计、回归分析、相关分析、差异分析等。
7.7 模糊集方法 即利用模糊集合理论对实际问题进行模糊评判、模糊决策、模糊模式识别和模糊聚类分析。系统的复杂性越高,模糊性越强,一般模糊集合理论是用隶属度来刻画模糊事物的亦此亦彼性的。李德毅等人在传统模糊理论和概率统计的基础上,提出了定性定量不确定性转换模型)))云模型,并形成了云理论。
8、数据挖掘现在和展望
数据挖掘技术是一个年轻且充满希望的研究领域,商业利益的强大驱动力将会不停地促进它的发展。每年都有新的数据挖掘方法和模型问世,人们对它的研究正日益广泛和深入。
总之,数据挖掘是一个很好的数据处理工具,但由于挖掘效果不能预期,受到许多诸如数据、工具、技术人员水平等因素影响。所以数据挖掘的成功要求对期望解决问题的领域有深刻的了解,理解数据,了解其过程,才能对数据挖掘的结果找出合理的释。
数据挖掘的理论基础和挖掘算法还有很大的空间有待发展和完善。 数据挖掘的个人稳私和信息安全问题也是急需关注和解决的。
参考文献:
[1]沈清,汤霖.模式识别导论.长沙:国防科技大学出版社,1993
[2]阎平凡,黄端旭,人工神经网络一模型,分析与应用.合肥:安徽
教育出版社,1993
[3]李德毅,史雪梅,孟海军.隶属云和隶属云发生器「J〕.计算机
研究和发展,1995,32(6):15一20.
[4] M. S. Chen, J. Han, and P. S. Yu. Data mining: An overview
from a database Perspective[M]. IEEE Trans. Knowledge and Data
Engineering,1996,8(06):866- 883.
[5]朱廷肋,高文.KDI]:数据库中的知识发现.计算机科学,1997,24(6):5一9
[6]孙增沂,张再兴,邓志东,智能控制理论与技术〔M〕.北京:清华大学出版社,1997.
[7]王珊,等.数据仓库技术与联机分析处理.北京:科学出版社,1998
[8]HanJ.T()wardSOn一Line lal icalMini in rgeDatabases.
数据挖掘应用案例:RFM模型分析与客户细分综述
数据挖掘应用案例:RFM模型分析与客户细分
分类:数据挖掘 | 标签: 市场研究 数据挖掘 RFM模型
2012-01-21 21:39阅读(16854)评论(9)
这里,我先给各位朋友拜年,祝大家新春快乐!
兔年就要过去了,本命年的最后一天再不更新博客有点对不住大家!正好刚帮某电信行业完成一个数据挖掘工作,其中的RFM模型还是有一定代表性,就再把数据挖掘RFM模型的建模思路细节与大家分享一下吧!手机充值业务是一项主要电信业务形式,客户的充值行为记录正好满足RFM模型的交易数据要求。
根据美国数据库营销研究所Arthur Hughes的研究,客户数据库中有三个神奇的要素,这三个要素构成了数据分析最好的指标:最近一次消费(Recency)、消费频率(Frequency)、消费金额(Monetary)。
我早期两篇博文已详述了RFM思想和IBM Modeler操作过程,有兴趣的朋友可以阅读!
RFM模型:R(Recency)表示客户最近一次购买的时间有多远,F(Frequency)表示客户在最近一段时间内购买的次数,M (Monetary)表示客户在最近一段时间内购买的金额。一般原始数据为3个字段:客户ID、购买时间(日期格式)、购买金额,用数据挖掘软件处理,加权(考虑权重)得到RFM得分,进而可以进行客户细分,客户等级分类,Customer
Level Value得分排序等,实现数据库营销! 这里再次借用@数据挖掘与数据分析的RFM客户RFM分类图。
本次分析用的的软件工具:IBM SPSS Statistics 19,IBM SPSS Modeler14.1,Tableau7.0,EXCEL和PPT
因为RFM分析仅是项目的一个小部分分析,但也面临海量数据的处理能力,这一点对计算机的内存和硬盘容量都有要求。
数据挖掘噪声数据处理综述上课讲义
数据挖掘噪声数据处理综述 噪声数据处理综述
摘要:噪声数据是指数据中存在着错误或异常(偏离期望值)的数据,不完整数据是指感兴趣的属性没有值.不一致数据则是数据内涵出现不一致的情况。
为了更好的论述什么是噪声数据处理,给出了两种噪声数据处理的算法:在属性级别上处理噪声数据的数据清洗算法和一种改进的应用于噪声数据中的KNN算法。
关键词: 噪声数据 噪声数据处理 数据清洗 KNN算法
1. 概述
噪声数据(noisy data)就是无意义的数据(meaningless data)。这个词通常作为损坏数据(corrupt data)的同义词使用。但是,现在它的意义已经扩展到包含所有难以被机器正确理解和翻译的数据,如非结构化文本。任何不可被创造它的源程序读取和运用的数据,不管是已经接收的、存储的还是改变的,都被称为噪声。
噪声数据未必增加了需要的存储空间容量,相反地,它可能会影响所有数据挖掘(data mining)分析的结果。统计分析可以运用历史数据中收集的信息来清除噪声数据从而促进数据挖掘。
引起噪声数据(noisy data)的原因可能是硬件故障、编程错误或者语音或光学字符识别程序(OCR)中的乱码。拼写错误、行业简称和俚语也会阻碍机器读取。
噪声数据处理是数据处理的一个重要环节,在对含有噪声数据进行处理的过程中,现有的方法通常是找到这些孤立于其他数据的记录并删除掉,其缺点是事实上通常只有一个属性上的数据需要删除或修正,将整条记录删除将丢失大量有用的、干净的信息。在数据仓库技术中,通常数据处理过程应用在数据仓库之前,其目的是提高数据的质量,使后继的联机处理分析(OLAP)和数据挖掘应用得到尽可能正确的结果。然而,这个过程也可以反过来,即利用数据挖掘的一些技术来进行数据处理,提高数据质量。
2.噪声数据处理
2.1在属性级别上噪声数据处理的数据清洗算法
2.1.1 数据清洗和聚类分析介绍
数据清洗包括许多的内容,文献【l】给出了详尽的介绍,其中噪声数据(包含错误或存在偏离期望的孤立点值)的处理是其中重要的一部分。数据含噪声(包含错误或存在偏离期望的孤立点值)可能有多种原因:收集数据本身难以得到精确的数据,收集数据的设备可能出现故障, 数据输入时可能出现错误,数据传输过程中可能出现错误,存储介质有可能出现损坏等。根据决策系统中“garbage
基于数据流的移动数据挖掘研究综述
第1期 邓维维等:基于数据流的移动数据挖掘研究综述 -5・ 基于数据流的移动数据挖掘研究综述 邓维维,彭宏,郑启伦 (华南理工大学计算机科学与工程学院,广东广州510641) 摘要:无线网络和移动设备的应用为我们带来巨大的便利,可以随时随地获得信息,同时它也引发了对高效 数据流分析工具的需求。移动数据挖掘是在普适环境下的数据流挖掘,从连续的数据流中发现知识。讨论了数 据流、数据流管理系统和移动数据挖掘以及它们的特点,介绍了该领域的一些研究成果,突出了面临的挑战和一 些相应的策略,并对这些策略进行了比较,最后展望了这一领域的研究前景。 关键词:移动数据挖掘;数据挖掘;数据流;普适计算 中图法分类号:TP391 文献标识码:A 文章编号:1001.3695(2007)O1.0005.05 Survey of Mobile Data Mining on Data Stream DENG Wei-wei,PENG Hong,ZHENG Qi-lun (College of Computer Science&Engineering,South China University of Technology,Guangzhou Guangdong 510641,China) Abstract:Wireless networks and mobile devices,which had brought lots of convenience to our daily life and made US much easier to get information any time and any where,now had motivates the needs for efficient tools analyzing data streams.Mo- bile data mining is concerned with data stream mining under the ubiquitous environment,discovering knowledge from eonti— nuous data streams.This paper is a survey of this new research field.The data stream and mobile data mining was introduced first,and then some analysis of the current researches and the existent problems of mobile data mining were discussed.In ad, dition,the existing challenges and the strategies addressing them were highlighted.The prospects for this field were given at the end. Key words:Mobile Data Mining;Data Mining;Data Stream;Ubiquitous Computing 1991年Weiser提出普适计算…(Ubiquitous Computing)。 普适被认为是一种特殊的环境特征,随着移动设备以及网络的 发展,这一特征越来越受到重视。Robert Grossman根据系统的 复杂性、数据与算法的结合程度、数据模型、分布程度将数据挖 掘系统划分为四代。经过十多年的发展,数据挖掘的研究重点 逐渐从发现方法转向系统应用,注熏知识发现策略和技术的集 成以及学科之间的相互渗透。数据挖掘系统也从第一、第二代 系统转向第三、第四代系统的研制。 移动数据挖掘属于第四代数据挖掘系统,它最大的特色是 将数据挖掘转移到嵌入式设备和移动环境。自2002年以来, 移动数据管理已经召开了两次国际会议,主要讨论都是围绕普 适环境这一特征,讨论如何管理在该环境下的数据,开发移动 设备上的复杂计算程序并进行移动数据挖掘。移动数据挖掘 与传统挖掘方法不同,具有很多独特的地方,它们会导致传统 的数据挖掘算法无效。这种现象主要的原因是在应用上的不 同,即移动挖掘算法和系统需要为应用量身定做。 (1)传统的数据挖掘系统面向的应用是知识发现、模式识 别、决策支持、预测预警等,它们关心挖掘结果的正确性、完整 性,导致了这类应用空间消耗大、计算密集、计算时间长。 (2)移动数据挖掘系统面向的是移动用户,这些用户需要 收稿日期:2006-01—13;修返日期:20o6—03—15 基金项目:国零自然科学基金重点项目(30230350);广东省 科学公关资助项目(2005B10101033,2004A10202001) 获得的是即时数据挖掘结果。对于一些检测和监控程序,甚至 需要处理实时数据获得实时结果和反馈。如旅行或者出差的 时候,用户无法在股票市场或Pc机前关注自己的股票信息, 但是又希望了解最新的股票动态,他们可以在智能手机等移动 设备上通过移动数据挖掘系统对股市数据流进行挖掘,利用全 局优化的方法自动筛选股票进行监视,并预测股票发展趋 势 J。再如,在交通工具上安装传感器,通过分析传感器回传 的状态数据,及时发现可能发生严重事故的状态,提前报警,阻 止事故发生 。 无线网络及移动设备带来的新基础架构和开发环境,引发 了面向数据流分析系统的研究和开发。其研究目的是如何在 普适性环境下进行挖掘,并提出一个较为通用的面向数据流的 挖掘系统的架构。本文介绍了数据流环境的特点以及数据流 管理系统,重点突出了普适环境和数据流给移动数据挖掘带来 的挑战;详细描述了移动数据挖掘所采用的几种处理数据流的 策略,着重介绍了AOG方法,并对这些策略进行了比较。 1 数据流特点与数据流管理系统 数据流与移动数据挖掘紧密相关,移动挖掘的数据大部分 是数据流,而且未来移动数据挖掘的一个发展方向是在数据流 管理系统上建立移动数据挖掘系统。 网络上的数据是以流形式传输的,网络管理软件是最早包 含了数据流处理的软件,它可以统计网络上的数据包,并可以
图像数据挖掘相关研究综述一概念和应用
第l2期 (总第111期) 2008年12月 统计教育 Statistical Thinktank No.12 (Series No.111) Dec2008 图像数据挖掘相关研究综述一概念和应用 丁冲范钧栾添 摘要:图像挖掘是数据挖掘领域中新兴的领域。随着数字照相技术的发展和在多学科中的广泛应用,对大量图 像数据的分析和研究越来越重要。由于图像挖掘的对象、内容不同于传统数据,方法上也不同于传统技术。本文旨 在介绍图像挖掘的基本概念和体系以及国际上最新的研究成果。本文回顾了图像挖掘的相关问题及建模框架,并 与模式识别、图像处理等相关领域进行了比较,在此基础上,还介绍了近年来图像挖掘领域在卫星遥感、医学影像 和生物显微照片研究的相关应用。 关键词:数据挖掘;模式识别;图像处理 Research on Image Mining-Concepts and Application Ding Chong Fan Jun Luan Tian Abstract:Image mining is an emergng field in data mining.Along with the wild use of large scale digital photo tech— nology,it becomes more and more important to devise powerful tools for analyzing tremendous image data and grasping the contents inside.But there is a large gap between traditional data mining and image mining in data formation and content,and the methods and algorithms are also different.In this paper,we focus on illustrating basic concepts and re— cent applications issues on image mining and the frameworks are reviewed,and then related technologies such as pat— tern recognition and image processing are discussed.At last,applications of such techniques as satellite photo,medical X—rays,and bio-photomicrography are introduced. Key words:data mining;pattern recognition;image processing l引言 图像获取和存贮技术的发展带来了大规模精细 图像数据库的产生。通过诸如卫星照片、医学照片和 数字照相机等设备,获得了大量的图像数据。图像挖 掘由于它潜在的巨大价值而受到广泛关注,对于那些 能够自动提取语义信息(知识)的图像挖掘系统的需 求与日俱增。然而时至今日,人们所掌握的技术还很 难对这过于巨大的数据加以利用。 Hsu,Lee和Zhangt 的一篇综述性文章指出,这一 领域中最基本的问题在于,需要对原始的象素图像和 图像序列分析到何种精确程度,才能有效的获取复杂 的空间目标以及它们之间的关系。换句话说,图像挖 掘(Image mining,简称IM)研究的对象是隐含的知识, 图像数据的间接关系,或者其他那些没有被明确地存 贮于图像数据中的模式,因此需要对其进行有效的取 舍。 2相关概念和问题 2.1数据挖掘与图像挖掘 由、于图像数据库和传统的关系型数据库存在巨 大差异,导致了很多现有的数据挖掘(Data Mining)技 术无法应用在IM领域。 第一,在关系数据库中,数据值在语义上是有意 作者简介:丁冲,1983年生,吉林长春人,南京大学商学院在读硕士,研究方向为电子商务、数据挖掘。范钧,1983年生,河北保 定人,西南财经大学在读硕士,研究方向为人力资源管理。栾添,1983年生,吉林长春人,东北师范大学在读硕士,研究方向为动物学。
基于Web的数据挖掘技术研究综述
,
・光盘数据库与信息系统・
基于Web的数据挖掘技术研究综述
王 晶
(中南林业科技大学国际学院,湖南长沙410004)
摘要:随着Intemet应用的逐渐普及,www已经发展成为一个巨大的分布式信息空间,为用户提供了一个极具价值的信息
源。但因Intemet所固有的开放性、动态性与异构性,又使得用户很难准确快捷地从www上获取所需信息。文中将数据挖掘的思想
引入www信息处理领域来解决web信息有效获取的问题,讨论了在www上进行信息挖掘所采用的技术和策略,最后简要介绍
了基于Web的信息挖掘应用前景和方向。
关键词:数据挖掘;KDW;web
中图分类号:TP274+.2 文献标识码: A
An Overview of Date Mining Technology Based on Web
WANG Jing (International College;Central South University of Forestry and Technology,Hunan Changsha 410004)
Key words:overview;date mining technology;Web
数据库中的知识发现KDD f Knowledge Discovery in
Databases 1是指从数据库中发现潜在的有意义的未知的关系模
式和趋势,并以易被理解的方式表示出来。但传统KDD技术所
涉及的主要是结构化的数据库,而网上资源却没有统一的管理
和结构,数据往往是经常变动和不规则的,因此人们需要比信息
检索层次更高的新技术,我们称之为Web中的知识发现KDW
fKnowledge Discovery in Web1,它是为了揭示文档中隐含的
知识,KDW作为KDD的一个新主题是一个很有意义的研究方
向。
1基于Web的数据挖掘
1,1基于Web的数据挖掘任务
Web信息的多样性决定了Web挖掘任务的多样性。总的来
同态加密隐私保护数据挖掘方法综述
第28卷第5期 2011年5月 计算机应用研究 Application Research of Computers V01.28 No.5 Mav 2011
同态加密隐私保护数据挖掘方法综述木
钱萍h ,吴蒙 ・
(1.南京邮电大学a.计算机学院;b.通信与信息工程学院,南京210003;2.江苏科技大学计算机科学与工程学
院,江苏镇江212003)
摘要:近年来国内外学者对隐私保护数据挖掘(priracy—preserving data mining,PPDM)进行了大量研究,适时 地对研究成果进行总结,能够明确研究方向。从分类挖掘、关联规则挖掘、聚类挖掘和安全多方计算等几个方
面,总结了现有的基于同态加密技术的算法,分析了其基本原理和特点,并在此基础上指出了PPDM技术今后发
展的方向。
关键词:隐私保护;数据挖掘;同态加密;安全多方计算
中图分类号:TP3I1 文献标志码:A 文章编号:1001—3695(2Ol1)05—1614—04
doi:10.3969/j.issn.1001.3695.2011.05.OO4
Survey of privacy preserving data mining methods
based Oil homomorphic encryption
QIAN Ping 。一.wu Meng (1.a.College ofComputer Science,b.College ofTelecommunications&lnfortru ̄tion Engineering,Nanfing University ofPosts&Telecommuni— cations,Nanjing210003,China;2.College ofComputer Science&Technology,Jiangsu UniversityofScience& ^∞fDgy,ZhenjiangJiangsu 212003,China)
隐私保护数据挖掘算法综述
隐私保护数据挖掘算法综述 ) 计算机科学2007Vo1.34NQ.6
陈晓明 李军怀 彭军 刘海玲 张瑕 (西安理工大学计算机科学与工程学院 西安710048) (重庆科技学院电子信息工程学院 重庆400050)
摘要如何保护私有信息或敏感知识在挖掘过程中不被泄露,同时能得到较为准确的挖掘结果,目前已经成为数据 挖掘研究中的一个很有意义的研究课题。本文通过对当前隐私保护数据挖掘中具有代表性的算法按照数据分布对其 中的数据更改方法、数据挖掘算法、数据或规则隐藏等进行了详细阐述,并对各自的优缺点进行了分析和比较,总结出 了各种算法的特性。此外,通过对比提出了隐私保护数据挖掘算法的评价标准,即保密性、规则效能、算法复杂性、扩 展性,以便在今后的研究中提出新的有效算法。 关键词数据挖掘,隐私保护算法,数据分布
A Survey of Privacy Preserving Data Mining Algorithms CHEN Xiao-Ming LI Jun-Huai PENG Jun LIU Hai—Ling ̄ ZHANG Jing (School of Computer Science&Enginnering,Xi’an University of Technology,Xi’an 710048) (College of Electronic Information Engineering,Chongqing University of Science and Technology,Chongqing 400050)
Abstract There has been a meaningful research problem that how to protect privacy or sensitive information from lea— king during data mining process,meanwhileobtain accurate result.This paper summarizes the features of privacy pre— serving data mining algorithms by analyzing and comparing some representative ones which include data distribution, data modification,data mining algorithms and data or rules hiding in the light of data distribution.Furthermore accord— ing to the comparison。some evaluation standards are brought forward to develop new effective algorithms for future re— search,such as secrecy,rules efficiency,complexity of the algorithm,expandability. Keywords Data mining,Privacy preserving algorithms,Data distribution
Web数据挖掘技术综述
第8卷第2期 2008年6月 南京工业职业技术学院学报
Journal of Nanjing Institute of Industry Technology Vo1.8.No.2 Jun.,2008
文章编号:1671—4644(2008)02—0055—03
Web数据挖掘技术综述
李 娟 ,董 军
(1.金陵科技学院信息技术学院,江苏 南京210001;
2.南京理工大学计算机科学与技术学院,江苏 南京210094)
摘要:基于大型数据库的不断涌现和数据挖掘的应运而生,综述了Web数据挖掘的基本概念,并提出一种基于Web
服务的数据挖掘体系。
关键词:Web数据挖掘;数据挖掘;Web服务
中图分类号:TP31 1.13 文献标识码:A
在这被称之为信息爆炸的时代,信息过量几乎成为人人
需要面对的问题。如何才能不被信息的汪洋大海所淹没,从
中及时发现有用的知识,提高信息利用率呢?要想使数据真
正成为一个公司的资源,只有充分利用它为公司自身的业务
决策和战略发展服务才行,否则大量的数据可能成为包袱,
甚至成为垃圾。因此,面对“人们被数据淹没,人们却饥饿于
知识”的挑战,从数据库中发现知识(Knowledge Discovery in
Databases)及其核心技术一一数据挖掘(Data Mining)便应运
而生,并得以蓬勃发展,越来越显示出其强大的生命力。 然而,网络在快捷、方便地带来大量信息的同时,也带来
了许多的问题。用户通常会使用搜索引擎提取自己想要的
特定的信息,但是目前的搜索引擎又存在着以下缺点:(1)搜
索范围比较小:任何一个搜索引擎所索引的网页只不过是
Web的一小部分,并且网页的增长速度在以远远大于搜索引 擎加入索引的速度增长;(2)搜索结果的不准确性:由于各搜
索引擎使用的信息搜集算法并不是完全的匹配算法从而使 得在给用户提供了有用信息的同时夹杂了大量的无用信息;
(3)不能提供多媒体搜索服务 。如何快速、准确地获得有
基于GIS的空间数据挖掘研究综述
科技售|lI o计算机与信息技术0 SCIENCE&TECHNOLOGY INFORMATION 2007年第26期 基于GIS的空问数据挖掘研究综述 杨 霞 (成都职业技术学院国际软件学院教师 四川 成都610000) 摘要:空间数据挖掘是数据挖掘的一个重要分支,它对于理解空间数据,寻找空间数据之间、空间与非空间数据之间内在关系,以简洁方式 表达空间数据规律起着重要作用。 关键宇:GIS;空间数据挖掘:空间数据 数据挖掘技术是数据量急尉膨胀的需求,有着较强的实用性,所 以尽管这项技术刚刚起步,但己经成功地应用于科学研究、市场营销、 金融投资、欺诈检测、医学、体育等方面,并在更为广泛的领域中显示 出了诱人的前景。 空间数据挖掘就是其中的一个很有发展前景的应用领域。随着大 量空间数据从遥感、地理信息系统、多媒体系统、医学和卫星图像等多 种应用中收集出来,这些数据的复杂程度和数量都远远超出人脑的分 析能力。空间数据库具有保存这些由空间数据类型和对象之间的空间 关系来表示空间对象的能力。因此,近年来数据挖掘的研究己从关系 型和事务型数据库扩展到空间数据库,即研究如何从空间数据库中去 发现隐含的知识。 1.空间数据挖掘的定义和特点 所谓空间数据挖掘(Spatial Data Mining,简称SDM)t I213141,或称从空 间数据库中发现知识.是指从空间数据库中提取用户感兴趣的空间模 式与特征、空间与非空间数据的普遍关系及其它一些隐含在数据库中 的普遍的数据特征。 空间数据挖掘作为数据挖掘的一个重要分支,其数据结构和处理 问题的方法等方面存在一些与数据挖掘的明显差异,形成了独有的特 点。Shashi shel【llar等 对空间数据挖掘和传统的数据挖掘进行了全面 的比较。得出四个方面的差异: (1)空间数据的复杂性 空间数据包括用于描述空间对象的空间属性数据,这些数据包含 空间对象位置信息以及空间对象之间拓扑关系、距离关系和方位关系 等。同时。空间数据对象之间的关系比一般的关系数据库中的数据对 象之间的关系要复杂得多、隐蔽得多,也使得空间数据挖掘的复杂性 大大增强。传统的数据挖掘方法难以有效的处理和分析空间属性数 据。 (2)统计学基础 统计分析的一个基本假设是数据样本的产生是独立的,但空间数 据集中关于样本的独立性的假设却往往不能成立。实际上,空间数据 的样本往往是自相关的.例如一个地区的经济发展水平和临近地区有 相似。这种空间依赖关系的产生源于所研究对象的内在关系,忽视了 这一特性的传统数据挖掘方法无法充分有效得发挥作用。 (3)可发现知识类型 与数据挖掘可发现广义型知识、分类型知识、关联型知识和预测 型知识相对应。空间数据挖掘发现的知识主要有四种:1、空间聚类和 分类:、空间离群点挖掘;3、空间关联规则;4、预测。 (4)算法过程 空间数据库存储的对象是大量的地理图形数据,而且空问数据库 系统的数据结构和存取方法比一般的关系数据库系统更加复杂,这使 得空间数据库系统的规模往往较大,因此运算效率问题尤为突出。另 一方面,空间数据挖掘的算法处理的是空间对象,不可避免的要用到 一些针对空间数据对象的操作,例如空间对象的联接、地图覆盖、最近 邻查询等。因此,空问数据对象的访问方式和数据结构也是一个关键 问题。 此外。空间数据挖掘的结果一般包含空间对象,往往是一些图形 信息.它不同于通常的关系数据库中的结果,很难用文字表示清楚。因 此空间数据挖掘的可视化也是一个很重要的问题。 2.空间数据 2.1空间数据的分类 GIS的操作对象是地理实体数据。地理实体是指空间地理数据库 中的实体,是一种在现实世界中不能再划分为同类现象的现象。例如 一个城市可以看成一个地理实体,因为它可以划分为若干区域如区、 街道等,但这些区域不能再被称为城市。 空间数据描述的信息包括两部分:一种是描述地理实体空间位 置、几何形状以及实体之间空间关系的空间属性信息,另一种是描述 地理实体其他属性的描述性信息。对应这两种信息,引入两个新的概 念:空间谓词与非空间谓词 。 2.2空间数据模型 为了方便地理实体在空间数据库中的存储,必须先建立空间数据 模型,即空间数据特征的抽象。数据模型分为三个层次:概念数据模 型、逻辑数据模型和物理数据模型。 GIS中最常用的概念数据模型为矢量模型和栅格模型f61: (1)矢量模型:用点、线、面表达现实世界,点用空间坐标对表示, 线由一串坐标对组成,面是由线组成的闭合多边形。矢量模型显式地 表达这些目标及部分空间关系(如相邻、包含、连通等),集中体现了地 理实体的形状特征以及不同实体之间的空间分布关系。 (2)栅格模型:把整个空间用规则或不规则的空间单元覆盖,如用 矩形、三角形或六边形等空间单元(cel1)或像元(pixe1)来表达。点是一 个像元,线由一串彼此相连的像元组成,面是相邻的像元组成,栅格模 型集中描述了地理实体的级别分布特征以及位置,并隐含地表达地理 实体间的空间关系。 3.GIS与空间数据挖掘的集成 3.1GIS与空间数据挖掘的集成模式 集成问题的关键是如何共享GIS中的数据。为解决两者之间的联 接、查询和管理的问题,解奥的方法主要有三种方式:混合式、扩展式 和开放式。在研究GIS与空间数据挖掘集成的问题时,也应分别对待。 GIS与空间数据挖掘集成的模式主要有三种: (1)松散耦合式,也称外部空间数据挖掘模式。这种模式基本上将 GIS当作一个空间数据库看待,在GIS环境外部借助其它软件或计算 机语言进行空间数据挖掘,其与GIS之间采用数据通讯的方式联系。 该方式的优点是开发费用低,风险小,易实现,保持了数据挖掘技术的 专业特色;缺点是效率低,对于非专业人员的掌握和应用有一定难度。 (2)嵌入式,又称内部空间数据挖掘模式。以GIS为主,加入空间 数据挖掘模块.即在GIS中将空问数据挖掘技术融合到空间分析功能 中去。采用现有GIS软件与分析软件包来构造空间数据挖掘模块,具 有系统稳定、开发周期短、费用低等优点。 (3)混合式,是前两种方法的结合。即尽可能利用GIS提供的功 能,最大限度的减少用户自行开发的工作量和难度,又保持外部空间 数据挖掘模式的灵活性。 3.2主要的空间数据挖掘系统 目前空间数据挖掘系统较少,国际上有代表性的原型系统主要有 以下三个m: r11加拿大Simon Fraser大学计算机科学系的Han Jiawei教授领导 的小组在Maplnfo.ESRI/Oracle SDE平台上建立了空间数据挖掘的原 型系统GeoMiner。它是该小组所研发的关系型数据挖掘系统DBMiner 的空间数据挖掘的扩展模块,包含三大功能模块:空间数据立方体构 建模块、空间联机分析处理模块和空间数据挖掘模块。该系统使用空 间数据挖掘语言GMQL,采用SAND(spatial—and—non—spatial database) 体系结构,其空间数据服务器包括Maplnfo、ESRI/Oracle SDE. Informix—Illustra等。 (2)由美国著名的ESRI公司开发的ArcView GIS(下转第69页)
基于遗传算法与神经网络混合算法的数据挖掘技术综述
基于遗传算法与神经网络混合算法的数据挖掘技术综述
摘要:数据挖掘是对大型数据库的数据进行统计分析、提取信息的方法,其基础是人工智能技术。遗传算法和神经网络是人工智能技术中最重要的技术。通过对遗传算法和神经网络的特征分析,阐述了遗传算法与神经网络混合算法在数据挖掘中的应用,指出了数据挖掘技术未来发展的方向。
关键词:数据挖掘;数据库;遗传算法;神经网络
1遗传算法基本特征
遗传算法是模拟达尔文的遗传选择和自然淘汰的生物进化过程的计算模型,是一种具有广泛适用性的通用优化搜索方法。遗传算法主要借用了生物遗传学的观点,通过自然选择、遗传和变异等作用机制来产生下一代种群,如此逐代进化,直至得到满足要求的后代即问题的解,是一种公认的全局搜索能力较强的算法。
遗传算法有良好智能性,易于并行,减少了陷于局部最优解的风险。遗传算法的处理对象不是参数本身,而是对参数集进行了编码的个体,可以直接对集合、队列、矩阵、图表等结构进行操作。同时,在标准的遗传算法中,基本上不用搜索空间的知识或其它辅助信息,而仅用适应度函数值来评估个体,并在此基础上进行遗传操作; 遗传算法不是采用确定性规则,而是采用概率的变迁规则来指导它的搜寻方向。正是这些特征和优点,使得遗传算法在数据挖掘技术中占有很重要的地位,既可以用来挖掘分类模式、聚类模式、依赖模式、层次模式,也可用于评估其它算法的适合度。
2神经网络基本特征
神经网络是人脑或自然神经网络若干基本特征的抽象和模拟,是以大量的、同时也是很简单的处理单元(神经元)广泛地互相连接形成的复杂非线性系统。人工神经网络本质上是一个分布式矩阵结构,它根据样本的输入输出对加权法进行自我调整,从而近似模拟出输入、输出内在隐含的映射关系。建模时,不必考虑各个因素之间的相互作用及各个因素对输出结果的影响机制,这恰好弥补了人们对各个因素及对输出结果的机制不清楚的缺陷,从而解决众多用以往方法很难解决的问题。
