应用空间聚类进行点数据分布研究_林冬云

2006年 8月第42卷 第4期北京师范大学学报(自然科学版)JournalofBeijingNormalUniversity(NaturalScience)Aug.2006Vol.42 No.4应用空间聚类进行点数据分布研究*林冬云1) 刘慧平1,2,3)†(1)北京师范大学地理学与遥感科学学院;2)北京师范大学遥感科学国家重点实验室;3)北京师范大学环境遥感与数字城市北京市重点实验室:100875,北京)摘要 空间数据挖掘是寻找大数据量空间分布的重要方法,应用地理信息系统(GIS)进行空间数据挖掘是目前进行海量数据分析的重要手段之一.应用空间聚类方法对北京市海淀区54325个企业点数据进行量化分析研究,通过空间位置聚类,进行属性指标量化,从而进行属性指标分层聚类,得到企业空间分布特征.研究表明,空间聚类方法是进行点数据空间分布研究的有效方法.关键词 空间聚类;企业分布;地理信息系统;量化

*国家自然科学基金资助项目(40271035);国家“十五”科技攻关课题资助项目(2003BA808A16-6)†通讯作者收稿日期:2005-11-23 随着数据获取和处理技术的迅速发展及数据库管理系统的广泛应用,人们积累的数据越来越多,但在激增的数据背后隐藏着许多重要的信息,由于缺乏有效的方法,导致了一种“数据爆炸但知识贫乏”的现象[1],面对这一挑战,数据挖掘(datamining,DM)和知识发现(knowledgediscoveryindatabases,KDD)技术应运而生并得到迅速发展,它的出现为自动和智能地把海量的数据转化成为有用的信息和知识提供了手段.作为DM技术一个新的分支,空间DM也称基于空间数据库的数据挖掘和知识发现(spatialdataminingandknowledgediscovery),是指从空间数据库中提取隐含的、用户感兴趣的空间和非空间的模式、普遍特征、规则和知识的过程[2].空间聚类方法是空间数据挖掘中的主要方法之一,是在一个比较大的多维数据集中根据距离的度量找出簇或稠密区域.聚类算法无需背景知识,能直接从空间数据库中发现有意义的空间聚类结构[3].在无先验知识的情况下,聚类分析技术是进行数据挖掘时的首选[4],因而运用空间数据聚类方法来处理海量数据,对于提取大型空间数据库中有用的信息和知识具有十分重要的现实意义.目前,对于空间聚类的研究主要集中在算法研究和应用研究上,存在2种偏向,一是从事GIS理论方法和技术工具研究的工作者大多根据空间对象的地理坐标进行聚类,即只考虑对象的空间邻近性,而不考虑对象属性特征的相似性[2,5];另一种是从事GIS应用和地学研究的工作者,直接套用传统聚类分析方法,根据属性特征集进行分析,忽视了对象的空间邻近性[6].而空间对象本质上具有地理位置和属性特征双重含义,二者结合才能完整地描述空间特征和空间差异.将地理位置和属性特征纳入统一的空间距离测度和空间聚类分析系统,将会改善空间分析和空间DM的信息质量[7-9].本文主要应用GIS分析技术,采用空间DM中的空间聚类方法,通过将空间位置与属性相结合的聚类方法,对北京市海淀区5万多个企事业单位的点分布数据进行分析,探讨对于属性是定性描述的点分布数据的量化方法.1 研究区和数据来源海淀区是北京市重要近郊区,占地面积大,人口众多,交通发达,存在着大量的居民和村民混居现象,是中心城市自上而下的扩散能力最强、城乡一体化程度最高、城乡联系最密切的地区,也是大都市空间扩展的主要地区[10].研究使用的数据来源是2001年北京市企业数据的统计表,经数字化处理生成企业单位点位分布图,按照数据文件中企业注册地址信息,结合参考北京市电子地图、北京市街道胡同地图集、北京市地图、网上北京市地图以及有关企事业单位的网站,将海淀区共计54325条记录生成5万多个企业的点分布图.2 研究方法应用GIS提取企事业单位分布空间坐标,进行按位置距离聚类分析,获得位置聚类小区,然后进行属性指标的量化,应用聚类分析进行属性聚类,分析企事业 420 北京师范大学学报(自然科学版)第42卷 分布的空间规律.此方法可以弥补将位置和属性分立的不足.为此,分别定义位置距离和属性距离.聚类分析中常用的距离有近10种,最常采用的是欧氏距离.记点状地物或区域中心Pi的平面直角坐标为(Xi,Yi),对应的属性向量为(ai1,ai2,…,ain),则点Pi和Pj之间的位置距离和属性距离可分别表示为:位置距离为:Dp=(xi-xj)2+(yi-yj)2,属性距离为:Da=(∑nk=1(aik-ajk)2.在聚类中,地理特征向量应是无量纲的,因此应进行标准化处理.2.1 空间位置聚类 聚类算法[11]的步骤如下:1)地理特征向量中的每一个元素进行无量纲化处理.2)令类别数k=2,迭代误差阈值emin=0.00001(可根据需要设置).3)置迭代次数t=0,k个初始聚类中心为:C(t)j=Sj j=1,2,…,k.4)对第t次迭代,若有|SiC(t)j0|<|SiC(t)j|, j=1,2,…,k且j≠j0;i=1,2,…,m.则把样本Si分配到第j0个聚类域D(t)j0.如此,所有的m个样本可以被划分到k个聚类域D(t)j中,j=1,2,…,k.5)计算新的聚类中心C(t+1)j=1Nj∑Sj∈D(t)jSi, j=1,2,…,k,式中Nj为第j个聚类域中包含的样本个数.6)若|C(t+1)j-C(t)j|

图1 海淀区空间位置聚类(共25类小区) 分别计算聚类结果中3大区各区行业平均百分比、经济性质平均百分比、人员数量平均百分比和营业 第4期林冬云等:应用空间聚类进行点数据分布研究421

图2 海淀区25类小区外接多边形边界显示图3 海淀区25类小区显示收入平均百分比,并对属性指标进行分层聚类.将25个小区分别进行指标计算,形成行业指标、经济性质指标、人员数量指标、营业收入指标,共64×25个指标,进行分层聚类,获得树型图,见图4.

图4 海淀区25类按64个指标分层聚类本文按树型图结果分为3大区进行研究分析.第1大区包含:Q8,Q24,Q17,Q23,Q25,Q10,Q21,Q14,Q4.第2大区包含:Q18,Q22,Q1,Q5,Q6,Q13,Q2,Q11.第3大区包含:Q15,Q19,Q7,Q12,Q9,Q20,Q3,Q16.其中“Q”为便于计算而设置的小区代号.将结果显示在图中,见图5.通过对3大区企事业单位行业特点、经济性质的进一步的分析,海淀区的企事业单位的空间分布具有较强的空间分布规律.1)行业特点分布 海淀区3大区各区行业平均百分比如图6所示.海淀区3大区的行业分布中每大区均有4个较高的峰,分别为制造业,批发和零售贸易、餐饮业,社会服务业,科学研究和综合技术服务业,说明海淀区是以这4个行业为主导行业.其分布规律是:a)制造业分布排序依次为第3区(31.26%),第2区(11.95%),第1区(3.87%);b)批发和零售贸易、餐饮业分布排序为第2区(34.75%),第1区(28.17%),第3区(18.75%);c)社会服务业分布排序为第1区(30.48%),第2区(20.49%),第3区(13.31%);d)科学研究和综合技术服务业分布排序为第1区(24.58%),第2区(16.88%),第3区(9.39%).从以上行业分布可以看出交通发达,城镇化发展较快的地区,其社会服务业、科学研究和综合技术服务业发展较快,如社会服务业中第1区比第3区高出17.17%,科学研究和综合技术服务业第1区比第3区高出15.19%.而离城区较远,城镇化发展水平较慢的地区,相对地说制造业发展较快,如制造业第3区比第1区高出27.39%.2)3大区企业的经济性质分布 3大区各区经济性质平均百分比如图7所示.从图7可以看出,从海淀区3大区企业经济性质的分布是以私营有限责任公司为主,其次是其他有限责任公司,再次是国有企业、集体企业和股份合作企业.其中,国有企业在3个大区中分布基本相同,分别占3大区各区的平均百分比为:11.07%,12.53%,12.32%.分布规律为: a)私营有限责任公司分布排序依次为第1区(48.29%),第2区(39.86%),第3区(21.41%);b)其他有限责任公司分布排序依次为第1区(19.89%),第2区(14.57%),第3区(13.83%);c)集体企业分布排序依次为第3区(22.97%),第2区(10.73%),第1区(4.59%);d)股份合作企业分布排序依次为第3区(15.62%),第2区(10.18%),第1区(5.73%). 422 北京师范大学学报(自然科学版)第42卷 

图5 海淀区分层聚类3大区结果a.25类聚类结果;b.50类聚类结果.图6 海淀区3大区行业平均百分比比较 1.农、林、牧、渔业;2.采掘业;3.制造业;4.电力、煤气及水的生产和供应业;5.建筑业;6.地质勘查业、水利管理业;7.交通运输、仓储及邮电通信业;8.批发和零售贸易、餐饮业;9.金融、保险业;10.房地产业;11.社会服务业;12.卫生、体育和社会福利业;13.教育、文化艺术及广播电影电视业;14.科学研究和综合技术服务业;15.国家机关、政党机关和社会团体;16.其他行业.图7 海淀区3大区企业经济性质平均百分比比较 1.国有企业;2.集体企业;3.股份合作企业;4.国有联营企业;5.集体联营企业;6.国有与集体联营企业;7.其他联营企业;8.国有融资公司;9.其他有限责任公司;10.股份有限公司;11.私营独资企业;12.私营合伙企业;13.私营有限责任公司;14.私营股份有限公司;15.其他内资企业;16.合资经营企业(港、澳、台);17.合作经营企业(港、澳、台);18.港、澳、台商独资企业;19.港、澳、台投资股份有限公司;20.中外合资经营企业;21.中外合作经营企业;22.外资(独资)企业;23.外商投资服从有限公司.4 结论与讨论以北京市海淀区为例,利用空间聚类结合GIS分析方法对海淀区5万多个企事业单位的点分布图进行了深入研究,得出以下主要结论:1)采用空间DM中的空间聚类分析,将空间位置信息和属性特征相结合进行北京市企业空间分析研究十分有效.提出了先按空间位置聚类进行属性指标量化和聚类,既能反映点数据空间位置的邻近性,又反映出其属性特征的相似性.

合集下载

田间作物群体三维点云柱体空间分割方法

田间作物群体三维点云柱体空间分割方法

第37卷 第7期 农 业 工 程 学 报 Vol.37 No.7 2021年 4月 Transactions of the Chinese Society of Agricultural Engineering Apr. 2021 175

田间作物群体三维点云柱体空间分割方法

林承达,韩 晶,谢良毅,胡方正

(华中农业大学资源与环境学院,武汉 430070)

摘 要:农田作物群体表型信息对于研究作物内部基因改变和培育优良品种具有重要意义。为实现田间作物群体点云数据中单个植株对象的完整提取与分割,以便于更高效地完成作物个体表型参数的自动测量,该研究提出一种田间作物柱体空间聚类分割方法。利用三维激光扫描仪获取田间油菜、玉米和棉花的三维点云数据,基于HSI(Hue-Saturation-Intensity,色调、饱和度、亮度)颜色模型进行作物群体目标提取,采用直通滤波方法获取作物茎秆点云,基于茎秆点云数据使用欧氏距离聚类分割算法提取每个植株的聚类中心点,并以聚类中心点建立柱体空间模型,使用该模型分割得到田间作物每个单体植株的点云数据。试验结果表明,该研究的方法对油菜、玉米和棉花3种作物的分割准确率分别为90.12%、96.63%和100%,与欧氏距离聚类分割结果相比,准确率分别提高了36.42,61.80和82.69个百分点,算法耗时分别缩短为后者的9.98%,16.40%和9.04%,与区域增长算法分割结果相比,该研究的方法可用于不同类型农作物,适用性更强,能够实现农田中较稠密作物植株的分割。该研究的方法能够实现农田尺度下单个植株的完整提取与分割,具有较高的适用性,可为精确测量作物个体表型信息提供参考。 关键词:作物;激光;三维点云;柱体空间模型;分割 doi:10.11975/j.issn.1002-6819.2021.07.021 中图分类号:TP391 文献标志码:A 文章编号:1002-6819(2021)-07-0175-08

一种二阶段法处理考虑约束的空间聚类问题

一种二阶段法处理考虑约束的空间聚类问题

一种二阶段法处理考虑约束的空间聚类问题

【摘要】如何在海量的、复杂的空间数据中进行聚类,而往往要考虑空间实体间约束条件的存在,又要求聚类结果的不失真,提高聚类的质量,这些是空间聚类中必然面临的挑战。在对空间聚类的研究基础上,提出一种二阶段聚类法,对空间属性和非空间属性分别进行处理,首先在非空间属性空间中进行无约束的一次聚类,而后在空间维中进行考虑实体约束的基于网格的聚类。算法一方面保持基于网格的聚类对海量数据聚类的高效性,另一方面又考虑了空间实体约束,以提高聚类的质量。

【关键词】实体约束;格网;空间聚类

1.引言

作为空间数据挖掘的一个重要分支,空间聚类,是根据某种距离或相似性准则对空间实体集进行自动分组,达到组内差异最小、组间差异最大的过程[1]。空间聚类的特征在于空间数据本身的特性(高维、多尺度、海量)及空间对象之间的复杂关系(空间拓扑关系、方位关系、度量关系),在复杂的空间对象间往往会存在诸多限制条件,如某些空间实体的存在改变了聚类对象的分布和彼此间的距离。这种限制条件称为约束条件,考虑了约束条件的空间聚类称为约束空间聚类。若忽略了约束条件,得到的聚类结果会不符合实际,或者是对实际的一种扭曲[2]。本文提出的二阶段聚类法中,第一阶段是在非空间属性空间中采用适当的方法进行聚类,并把得到的结果作为第二阶段在空间属性空间中的聚类对象,其中采用基于格网的方法,把聚类对象和约束对象映射到格网中进行聚类,而后可采用边界处理技术提取簇的边界点,以得到最终聚类结果。在第一步聚类中,可以采用适当的、传统的非约束的聚类方法,而第二步为本文提出考虑约束的基于网格的空间聚类,并作详细介绍。本文考虑二维空间实体约束(包括障碍约束和便利约束)进行研究,提出一种基于空间实体约束的格网空间聚类算法,以下章节的安排是第2部分空间约束的处理,第3部分对TPSCBGC算法进行描述分析,最后是总结。

2.相关工作

2.1 基于网格的聚类

什么是聚类分析,它有哪些应用?

什么是聚类分析,它有哪些应用?

什么是聚类分析,它有哪些应用?

一、聚类分析的实现方式

聚类分析的实现方式有很多种,如下面几种:

1. 基于距离的聚类:

这种方法将数据点之间的距离作为相似性的度量,然后将距离最近的数据点聚在一起,并逐渐地将距离较远的数据点加入到不同的簇中。

2. 基于密度的聚类:

这种方法通过计算数据点的密度来确定簇边界,而不是使用距离来度量相似性。将密度较高的数据点聚集在一起,而将密度较低的数据点单独作为一个簇。

3. 基于层次的聚类:

这种方法将数据点逐层进行聚合,每一层都是由多个子层组成的。聚类过程一直持续到所有数据点都被分配到一个簇中,或者簇的数量达到预设的值。

二、聚类分析的应用领域

聚类分析作为一种重要的数据挖掘技术,在多个领域中都有着广泛的应用,下面介绍一些主要应用领域:

1. 市场细分: 聚类分析可以帮助企业将市场分割成不同的细分市场,然后根据每个细分市场的特点定制相应的市场策略。

2. 生物分类:

聚类分析在生物学领域中应用非常广泛,例如,可以用于分类分子或组分、成本分析以及微生物学等方面。

3. 网络流量分析:

聚类分析可以帮助网络管理员对网络流量进行分类,以便更好地了解网络中流动的数据类型,从而更好地优化网络性能。

4. 风险评估:

聚类分析可以用于对风险进行分类和评估,例如,可以将客户分类成高风险、中风险和低风险客户,以快速响应某些意外事件。

结论

聚类分析是一种非常有用的技术,可以用于许多不同的领域。以上只是聚类分析的一些基本理解和应用,随着技术的不断发展,聚类分析在未来也将有着更广泛的应用。

基于微博签到数据的人群活动时空特征分析

基于微博签到数据的人群活动时空特征分析

第21期2023年11月无线互联科技WirelessInternetScienceandTechnologyNo.21November,2023

作者简介:晏王波(1989—),男,江苏高邮人,高级工程师,硕士;研究方向:自然资源信息化。基于微博签到数据的人群活动时空特征分析

晏王波(江苏省测绘研究所,江苏南京210013)

摘要:随着大数据时代的到来,对于人类行为的研究也逐渐多元化,有效地进行人群活动的监测能够

支撑政府的精细化管理。因而,文章以微博签到数据为基础,充分利用探索性空间分析方法,从时间、

空间2个角度对昆山市的人群活动特征进行分析,旨在进一步挖掘城市的热点区域,支撑城市规划与

领导决策。研究结果表明:(1)昆山市的人群活动整体性分布相对不均匀,主要集中在昆山市区及景

区附近;(2)工作日人群的空间分布相对分散,而休息日则较为集中;(3)昆山市的周庄镇和花桥镇成

为研究周期内的热点地区。

关键词:社交媒体数据;时空特征;空间分布

中图分类号:TP391 文献标志码:A

0 引言 随着城市的不断扩展,城市化进程速率加快,给

对应的生态环境、土地资源产生了一定的影响[1-2]。

一方面,制造业的发展需要越来越多的人作为生产要

素来保障,另一方面,城市的繁荣程度代表着吸引力

程度,吸引不同领域和行业的人聚集。因而,合理、有

序进行城市建设才能够使得“人与自然和谐共生”。

传统的研究更多地聚焦于城市的面积扩展、重点区域

的发展等。周期性进行城市人群的聚集监测,能够有

效地把握城市的发展,但对于城市中的人研究却不

多[3-4]。大数据、物联网等新技术的发展使得人类的

活动有了更多的记录与表征方式,区别于传统的属性

数据,这些新型数据往往同时具有时间和空间属性,

如共享单车的轨迹数据、社交媒体的签到数据、手机

信令数据等,可以用于表征连续的时空特征[5-8]。

国外学者对于社交媒体数据的研究较早,如利用Twitter数据分析人群的聚集进而分析空间集聚的规

基于空间聚类的台风轨迹提取-Final

基于空间聚类的台风轨迹提取-Final

中南大学

本科生毕业论文(设计)

题 目 基于空间聚类的台风轨迹提取

学生姓名 魏亮

指导教师 邓 敏

学 院 信息物理工程学院

专业班级 测绘06级03班

摘 要

空间聚类是空间数据挖掘与空间分析的重要手段之一,常用于揭示空间数据分布规律以及发现空间数据异常。现有的空间聚类方法多是针对空间点目标设计的,而实际应用中积累了大量的轨迹数据如台风轨迹、GPS导航数据、动物迁徙轨迹,对轨迹数据进行空间聚类分析有助于发现一些潜在的空间模式,具有重要的应用价值。本文针对台风轨迹数据,探究了一种基于分割-聚群思想的轨迹数据空间聚类方法。首先系统回顾了空间聚类以及轨迹聚类的相关研究工作;进而重点介绍了基于分割-聚群思想的空间轨迹聚类方法-TRACLUS;最后,采用台风轨迹数据验证了TRACLUS算法在实际中的应用效果,并对其应用条件进行了分析,展望了空间轨迹聚类进一步研究的若干问题。

关键词:空间数据挖掘,空间聚类,台风轨迹,TRACLUS算法

Abstract

Spatial clustering has played an important role in spatial data mining and spatial

analysis. It can be used to discover the spatial association rules and spatial outliers in

spatial datasets. Existing spatial clustering methods are mainly designed for spatial

空间点模式聚类方法研究

空间点模式聚类方法研究

空间点模式聚类方法研究

于四全;毕建涛

【摘 要】空间点模式聚类分析是指从地理数据集中发现空间实体的聚集模式.现有研究中,通过定义不同的空间簇模型,发展了大量的空间点模式聚类方法,然而对这些方法的有效性缺乏客观性评价.为此,本文从基于划分、 密度以及图论的方法中选取了5种具有代表性的方法,采用4组模拟数据集进行测试,通过准确率和召回率对5种方法聚类质量进行了定量评价,发现基于图论方法聚类质量优于基于密度以及基于划分的方法;基于密度的方法中,OP-TICS算法聚类质量优于DBSCAN算法;基于划分的方法中,Meanshift算法聚类质量优于CLUSTERDP算法.

【期刊名称】《科技创新与生产力》

【年(卷),期】2018(000)004

【总页数】4页(P49-52)

【关键词】空间点模式;数据挖掘;聚类分析;OPTICS算法;DBSCAN算法;Meanshift算法;CLUSTERDP算法

【作 者】于四全;毕建涛

【作者单位】中南大学地球科学与信息物理学院,湖南 长沙 410083;中国科学院遥感与数字地球研究所,北京 100094

【正文语种】中 文

【中图分类】TP311.13

随着数字时代的来临,数据库系统就变得尤为重要,数据中隐含着可观的信息量,但至目前用于找出隐含信息的手段却不是很多,从而导致数据爆炸。为了摆脱这个困境,科研人员研究出很多数据挖掘技术,关联模式挖掘、数据聚类、数据分类、数据立方体等概念相继被提出来[1-2]。

空间聚类在空间数据挖掘技术中占据着很重要的地位,该技术在空间数据中把众多目标划分为很多个簇,而且每个簇之间具有很大的相似度,但空间簇间的目标差别又非常大。对海量空间数据进行深层次分析,发现空间离群点,这个空间离群点也称为空间异常[3-6],传统的聚类分析对数据的空间和非空间属性一般不进行区分。在空间聚类分析方面,传统的聚类分析手段虽然被应用很多,但其明显存在不足和局限[7],且缺乏一个完善的分类体系,因此,笔者对现有的空间聚类算法进行归纳分类,并对其各自的适用性进行分析和总结,对空间聚类分析技术的实际应用具有重要意义。

空间聚类分析及应用

空间聚类分析及应用

空间聚类分析是一种分析空间数据的方法,其主要目的是将具有相似属性的空间对象聚集到一起。在空间聚类分析中,通常使用距离度量来衡量空间对象之间的相似性,并基于相似性构建聚类模型。聚类模型可以将空间数据划分为不同的群集,每个群集内的空间对象具有相似的特征。

空间聚类分析在许多领域中都有广泛的应用。以下是几个常见的应用领域:

1. 城市规划:空间聚类分析可以用于确定城市中心或商业区的位置。通过分析空间数据,能够找到具有相似特征的区域,从而帮助决策者做出最佳的规划决策。

2. 环境研究:研究人员可以使用空间聚类分析来识别环境热点区域。例如,在研究环境污染时,可以通过聚类分析找到受污染程度相似的区域,以便采取相应的对策。

3. 交通规划:空间聚类分析可以用于交通规划,例如确定最佳的公共交通线路或站点。通过聚类分析,可以识别出相对集中的人口区域,从而优化交通设施的布局。

4. 电子商务:在电子商务中,空间聚类分析可以帮助企业确定最佳的销售区域。通过分析潜在客户的空间分布,可以找到潜在市场的热点区域,以便开展精确的市场推广活动。

在实际的空间聚类分析中,通常使用不同的聚类算法来实现。以下是几个常用的算法:

1. K-means算法:K-means算法是一种常见的聚类算法,也适用于空间聚类分析。该算法通过迭代计算空间对象与聚类中心之间的距离,并将对象划分到最近的中心点所代表的聚类中。

2. DBSCAN算法:DBSCAN算法是一种密度聚类算法,它能够自动发现具有不同密度的簇。该算法通过定义邻域半径和最小对象数来确定核心对象,并将其他对象划分到核心对象的簇中。

3. 层次聚类算法:层次聚类算法通过逐步合并或分割聚类来构建聚类层次结构。该算法可以根据不同的相似性度量和连接方式来实现,例如单链接、完全链接和平均链接。

总之,空间聚类分析是一种有力的数据挖掘工具,可以帮助我们理解和利用空间数据。通过深入研究和应用空间聚类分析,我们能够更好地理解和管理空间相关的问题,并为决策提供科学依据。

空间聚类分析概念与算法

空间聚类分析概念与算法

空间聚类算法的目标是使得同一群组内的数据点之间距离尽可能小,而不同群组之间的距离尽可能大。通过这种方式,可以更好地理解和分析数据,并从数据中获取有关其内在结构的信息。

下面介绍几种常见的空间聚类算法:

1. K-means算法:K-means是一种基于距离的空间聚类算法。它将数据点划分到K个聚类中心,然后根据数据点和聚类中心之间的距离重新计算聚类中心,直到达到收敛。K-means算法简单且易于实现,但对于非球形分布的数据效果可能不佳。

2.DBSCAN算法:DBSCAN是一种基于密度的空间聚类算法。它将数据点划分为核心点、边界点和噪声点。核心点是在一个给定半径内具有足够数量的邻居点的点,边界点是在一个给定半径内具有较少数量的邻居点的点,噪声点是不满足任何条件的点。DBSCAN算法不需要预先指定聚类的数量,且对于非球形分布的数据效果较好。

3.层次聚类算法:层次聚类是一种通过构建聚类层次结构的方法。它可以通过自上而下或自下而上两种方式进行聚类。自上而下的方法将所有数据点划分为一个大的聚类,然后逐步细分为较小的聚类,直到满足一定的聚类准则。自下而上的方法则从单个数据点开始,逐步合并相似的数据点,直到形成一个大的聚类。层次聚类算法适用于数据点数量较小且聚类结构具有层次性的情况。

4. 高斯混合模型(Gaussian Mixture Model,GMM)算法:GMM是一种统计模型,用于描述数据点的分布。它假设数据点是由多个高斯分布组成的混合模型。GMM算法通过估计高斯分布的参数来确定数据点所属的聚类。GMM算法适用于特征呈现高斯分布的数据。

总结起来,空间聚类分析是一种重要的数据挖掘技术,通过计算数据点之间的相似度将它们分组。K-means、DBSCAN、层次聚类和GMM都是常见的空间聚类算法。根据不同的数据分布和应用场景,我们可以选择合适的算法来进行分析和挖掘。

空间数据挖掘中的聚类算法

1 空间数据挖掘中的聚类算法

朱屹, 刘安丰

(中南大学,软件学院,湖南 长沙,410075)

摘要:本文系统综述了文献中发表的大量空间聚类算法,依据这些算法的特点,将它们归纳为两类:划分聚类算法、层次聚类算法。针对划分聚类算法,重点分析了PAM、CLARA和CLARANS算法。针对层次聚类算法,重点综述了凝聚和分解层次聚类,分析了BIRCH、CURE、CHAMELEON算法。比较了这些算法的复杂度,并介绍了相关应用。

关键词:聚类算法;聚类分析;数据挖掘;空间数据库

1. 引言

随着数据挖掘技术的出现,学者们开始采用各种方法从大型数据库的数据中发现知识,同样也利用数据挖掘技术对空间数据进行分析。这种空间数据挖掘的方法很好地弥补了传统空间统计分析的不足,很快受到了学者的重视。空间数据挖掘,也称基于空间数据库的数据挖掘和知识发现(Spatial Data Mining and

Knowledge Discovery),作为数据挖掘的一个新的分支,是指从空间数据库中提取用户感兴趣的空间模式与特征、空间与非空间数据的普遍关系及其它一些隐含在数据库中的普遍的数据特征[1]。

目前大多数空间数据挖掘方法都是基于空间聚类与关联规则发现。空间聚类方法是空间数据挖掘中的主要方法之一,是在一个比较大的多维数据集中根据距离的度量找出簇或稠密区域. 聚类算法无需背景知识,能直接从空间数据库中发现有意义的空间聚类结构[2]。在无先验知识的情况下,聚类分析技术是进行数据挖掘时的首选[3],因而运用空间数据聚类方法来处理海量数据,对于提取大型空间数据库中有用的信息和知识具有十分重要的现实意义。

2. 概述

目前,针对聚类分析提出了许多算法,这些算法可大致分为两类:划分聚类算法、层次聚类算法。划分聚类算法依据对象相似性来分配对象,如k-means[4] 2 和k-medioid。层次聚类法是一系列连续的合并和分解过程,可以自上向下连续分解,也可以自下向上连续合并。基于格网的聚类算法也可视为层次聚类算法。基于位置的聚类算法依赖局部对象之间的关系来聚类,既可以基于密度,也可以基于随机分布聚类。对于空间数据聚类,则是基于空间数据的特点对聚类算法进行改进, 从而使之适用于空间对象的特性,如DBSCAN 算法[5] 、CLATIN算法[6]、DDSC算法[7]等。

空间聚类研究

收稿日期:2008-07-30基金项目:国家高技术研究发展计划(863)项目(2007AA01Z404)作者简介:马󰀁程(1980-),女,安徽阜阳人,硕士研究生,研究方向为数据挖掘;导师:皮德常,博士,副教授,研究方向为数据挖掘与数据库。空间聚类研究马󰀁程1,2(1.南京航空航天大学信息科学与技术学院,江苏南京210016;2.蚌埠学院计算机科学与技术系,安徽蚌埠233040)摘󰀁要:聚类算法是数据挖掘中的关键技术,聚类技术在模式识别、图像处理等领域有广泛应用,随着对聚类算法更广泛深入的研究,产生了许多不同的适用于空间数据挖掘的聚类算法。描述了数据挖掘领域中对聚类分析的典型要求,介绍了空间数据挖掘中近几年常用的聚类方法,并通过基于评价聚类算法好坏的标准,从多个方面对这些算法性能进行比较分析,方便人们较容易找到一种适用于特定问题的聚类算法,最后对未来发展进行了展望。关键词:数据挖掘;空间聚类算法;数据库中图分类号:TP18󰀁󰀁󰀁󰀁󰀁󰀁文献标识码:A󰀁󰀁󰀁󰀁󰀁󰀁󰀁文章编号:1673-629X(2009)04-0134-04ASurveyofSpatialClusteringResearchMACheng1,2(1.Coll.ofInfo.Sci.andTechn.,NanjingUniversityofAeronautics&Astronautics,Nanjing210016,China;puterSci.andTechn.DepartmentofBengbuCollege,Bengbu233040,China)Abstract:Clusteringalgorithmisthekeytechnologyindatamining.Clusteringtechnologyhaswideapplicationinpatternrecognition,im󰀁ageprocessingandotherfields.Alongwithitswideranddeeperresearch,manydifferentmethodsapplicabletothespatialdatamininghavebeenemerged.Startswithintroductiontotypicalrequestswhenusingclustering.Then,itproposessomecommonlyusedspatialclus󰀁teringalgorithmsinrecentyearsandcomparesthemfromvariousaspectsofthesealgorithmsbasedonsomeevaluatestandards,soaclus󰀁teringalgorithmfortheparticularproblemiseasytofindout.Finally,brieflypredictsthedevelopmentofthespatialdataclustering.Keywords:datamining;spatialclusteringalgorithm;database0󰀁引󰀁言空间数据库存储了大量与空间有关的数据,例如地图、遥感或医学图像数据、VLSI芯片设计数据等,空间聚类的任务是运用空间聚类来提取不同领域的分布特征,把空间数据库中的对象分成多个有意义的簇,即根据相似性对数据对象进行分组,使每一个簇中的数据是相似的,而不同簇中的数据尽可能不同。1󰀁空间聚类算法的要求空间聚类是一个富有挑战性的研究领域,有关每一个应用都提出了各自特殊的要求,以下是数据挖掘中聚类的典型要求:1)可伸缩性:在很多聚类算法中,数据对象小于200的小数据集合上鲁棒性执行多种数据模型;而对于包含几百万个数据对象的大规模数据库进行聚类时,将会导致有不同的偏差结果,这就需要聚类算法具有高度的可伸缩性。2)处理不同类型属性的能力:对于设计的很多算法用来聚类数值类型的数据,但在实际应用中可能要求聚类其它类型的数据。如分类标称类型、序数型、元类型数据,或者这些数据类型的混合。3)发现任意形状的聚类:使用Euclidean距离或者Manhattan距离的许多聚类算法来确定聚类,基于这样的距离度量的算法趋向于发现具有相近密度和尺寸的球状簇,所以提出能发现任意形状簇的算法是很重要的。4)用于决定输入参数的领域知识最小化:在聚类分析中,许多聚类算法要求用户输入一定的参数,如希望簇的数目,聚类结果对于输入参数很敏感,通常参数较难确定,尤其是对于含有高维对象的数据集更是如此,要求用人工输入参数不但加重了用户的负担,第19卷󰀁第4期2009年4月󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁计算机技术与发展COMPUTERTECHNOLOGYANDDEVELOPMENT󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁Vol.19󰀁No.4Apr.󰀁2009而且也使聚类质量难以控制。5)对于输入记录顺序不敏感:一些聚类算法对于输入数据的顺序是敏感的,如对于同一个数据集合,以不同的顺序提交给同一个算法时,可能产生差别很大的聚类结果,研究对数据输入顺序不敏感的算法具有重要的意义。6)高维性:一个数据库可能含有若干维属性。很多聚类算法擅长处理低维数据,通常最多在三维的情况下能够很好地判断聚类的质量,但是在高维空间,聚类的数据可能高度偏斜,非常稀疏。7)处理噪声数据的能力:在现实应用中绝大多数的数据都包含了孤立点,未知数据、空缺、未知数据或者错误的数据,有些聚类算法对于这样的数据敏感,将会导致质量较抵的聚类结果。8)基于约束的聚类:在实际应用中有可能需要在各种约束条件下进行聚类,既要找到满足特定的约束,又要具有良好聚类特性的数据分组是一项具有挑战性的任务。9)可解释性和可用性:通常用户希望聚类结果是可解释的、可理解的和可用的。2󰀁空间聚类的主要方法针对聚类分析,专家们提出了许多聚类算法对同一数据集进行处理以观察可能获得的有关描述。这些算法大致可分为五类:划分聚类算法、层次聚类算法、基于密度的方法、基于网格的方法和基于模型的聚类方法。2.1󰀁划分聚类算法给定一个包含n个对象或数据的集合,将数据集划分为k个子集,其中每个子集均代表一个聚类(k󰀂n),划分方法首先创建一个初始划分,然后利用循环再定位技术,即通过移动不同划分中的对象来改变划分内容,典型的划分方法包括K-means、K-medoids、PAM、CLARA、K-模、K-原型、EM和CLARANS等。Macqueen提出的K-means算法[1]是首先从n个数据对象随机地选择k个对象,每个对象初始地代表了一个簇中心,对剩余的每个对象,根据其与各个簇中心的距离,将它赋给最近的簇,然后重新计算每个簇的平均值。这个过程不断重复,直到准则函数收敛。K-medoids算法[2]不采用聚类中对象的平均值作为参照点,而选用聚类中位置最中心的对象,即中心点,仍然是基于最小化所有对象与其参照点之间的相异度之和的原则来执行的。PAM算法[3]是最初提出的K-medoids算法之一,它在初始选择k个聚类中心对象之后,不断循环对每两个对象(非中心对象和中心对象)进行分析,以选择出更好的聚类中心代表对象,并根据每组对象分析所获得的聚类质量,该方法可以聚类数值和符号属性,但效率不高。一种将PAM和采样过程结合起来的改进方法CLARA提高了其效率,CLARA[2]的主要思想是不考虑整个数据集合,只考虑实际数据的一部分。Huang提出K-modes方法[3],它扩展了K-均值方法,用模代替类的平均值,采用新的相异性度量方法来处理分类对象,并用基于频率的方法来修改聚类的模,K-prototypes方法[4]将K-均值和K-原型综合起来处理有数值类型和分类类型的混合数据。CLARANS算法[5]改进了CLARA的聚类质量,也拓展了数据处理量的伸缩范围,它与CLARA算法的本质区别在于CLARA在搜索的开始是抽取节点的样本,而CLARANS在搜索的每一步抽取邻居的样本,与PAM和CLARA相比,ClARANS算法的聚类效果明显占优,但其时间复杂度仍为O(n2),因此,低效是其缺点。2.2󰀁层次聚类算法层次聚类方法是通过将数据组织为若干组并形成一个相应的树来进行聚类的,层次聚类方法又可分为自顶向下的分裂算法和自底向上的凝聚算法两种,分裂聚类算法,首先将所有对象置于一个簇中,然后逐渐细分为越来越小的簇,直到每个对象自成一簇,或者达到了某个终结条件,而凝聚聚类算法正好相反,首先将每个对象作为一个簇,然后将相互邻近的簇合并为一个大簇,直到所有的对象都在一个簇中,或者某个终结条件被满足。AGNES和DIANA算法是早期的层次聚类方法,前者是一种凝聚聚类方法,后者是一种分裂聚类方法,两者都使用简单的准则即根据各簇间距离度量来合并或分裂簇,由于这两种方法在选择合并或分裂点时有一定困难,并且进行合并或分解后不能被撤销,聚类间对象也不能交换,就会导致发现错误的簇而降低聚类质量。同时,这种方法没有很好的可伸缩性。因此,人们在对这两种方法概括和总结的基础上,提出了一些新的层次聚类算法,如BIRCH算法、CURE算法、ROCK和CHAMELEON算法。BIRCH算法[6]是一种综合的层次聚类方法,BIRCH算法包括两个阶段,第一个阶段扫描数据库,动态建立一个初始存放于内存的CF树,它可以被看成是对数据的压缩,试图保留数据内在的聚类结构。第二个阶段,BIRCH采用某个聚类算法对CF树的叶节点进行聚类,来改善聚类质量。该算法适用于类的分布呈凸形或球形,它在内存大小、运行时间、聚类质 135 第4期󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁马󰀁程:空间聚类研究量、稳定性和伸缩性方面都胜于CLARANS和K-means,但由于CF树的节点只包含有限的子簇,所以一个CF树的节点并不总对应于用户认为的一个自然簇。CURE算法[7]解决了偏好球形和相似大小的问题,在处理孤立点上也更加健壮,它选择基于质心和基于代表对象方法之间的中间策略,不用单个质心或对象来代表一个簇,而选择数据空间中固定数目具有代表性的点。ROCK算法[8]是利用聚类间的连接进行聚类合并,该算法针对布尔和类别数据设计的,采用一种新方法来计算相似形,即基于元组之间的连接数目,如果一元组的相似形超过某一阈值,则称这一对元组为邻居,这种方法不是基于精确的数值计算,而是基于领域专家的直觉,两个元组之间的连接数目由它们共同的邻居数目来定义,其相似性度量采用的是连接数目而不是距离的度量,适用link将数据进行聚类,最后将数据库中的其余数据指派到样本数据完成的簇中,得到最终的聚类结果,ROCK的时间复杂度为O(n2+nmmma+n2logn),其中mm为最大邻居数,ma为平均邻居数,n为资料点数;空间复杂度为O(min{n2,nmmma})。CHAMELEON算法[9]是一种探索层次聚类中动态模型的聚类算法,它是针对CURE和ROCK这两个层次聚类算法所存在的不足提出的。CURE忽略了两个不同聚类间的连接累计信息;而ROCK则在强调聚类间连接信息却忽略了有关两个聚类间相接近的信息。CHEMALEON算法首先利用一个图划分算法将数据对象聚合成许多相对较小的子聚类,然后再利用聚合层次聚类方法,并通过不断合并这些子聚类来发现真正的聚类。为确定哪两个子聚类最相似,该算法不仅考虑了聚类间的连接度,而且也考虑了聚类间的接近度,特别是聚类本身的内部特征。该算法在发现高质量的任意形状的聚类方面有很强的能力。2.3󰀁基于密度法绝大多数划分方法基于对象之间的距离进行聚类,这样的方法只能发现球状的类。因此,出现了基于密度的聚类方法,其主要思想是:只要邻近区域的密度(对象或数据点的数目)超过某个阈值,就继续聚类,这样的方法可以过滤!噪声∀数据,发现任意形状的类,代表性算法有DBSCAN算法、OPTICS算法和DEN󰀁CLUE算法。Ester等提出的DBSCAN算法[10]可以有效地发现具有任意形状的类,并正确地处理噪声数据。除此之外,该算法还具有实现简单、聚类效果较好等优点。该算法对于一个类中的每个对象,在其给定半径的领域中包含的对象不能少于某一给定的最小数目,另外不进行任何的预处理而直接对整个数据集进行聚类操作。当数据量非常大时,必须有大内存量支持,I/O消耗也非常大。该算法对参数Eps和Minpts非常敏感,且这两个参数很难确定。Ankerst等提出的OPTICS算法[11]是一种基于类排序方法。它克服了DBSCAN参数设置复杂的缺点。该算法并不明确产生一个聚类,而是为自动交互的聚类分析计算出一个增强聚类顺序。这个顺序代表了数据的基于密度的聚类结构。它包含的信息,等同于从一个宽广的参数设置范围所获得的基于密度的聚类。DENCLUE算法[12]是一个基于一组密度分布函数的聚类算法。该算法主要基于下面的想法:(1)每个数据点的影响可以用一个数学函数来形式化地模拟,它描述了一个数据点在领域内的影响,被称为影响函数;(2)数据空间的整体密度可以被模型化为所有数据点的影响函数的总和;(3)聚类可以通过确定密度吸引点来得到,这里的密度吸引点是全局密度函数的局部最大。2.4󰀁基于网格法基于网格的方法采用了一个多分辨率的网格数据结构。它首先将数据空间划分成为有限个单元的网格结构,所有的处理都是以单个的单元为对象的。这样处理的一个突出的优点就是处理速度快,通常这是与目标数据库中记录的个数无关的,它只是与把数据空间分成多少个单元有关。代表算法有STING算法和STING+算法、Wavecluster算法和Wavecluster+算法、CLIQUE算法。Wang等提出的STING算法[13]和STRING+算法是基于网格的多分辨率方法。该种方法效率高,而且网格结构有利于并行处理和增量更新,但其降低了聚类的质量和精确性。Sheikholeslami等提出的Wavecluster算法[14]也是一个多分辨率的聚类方法。它首先通过在数据空间上强加一个多维网格结构来汇总数据,然后采用一种小波变换来变换原特征空间,在变换后的空间中找到密集区域。小波变换聚类的优点有:(1)小波变换聚类提供了无指导的聚类;并能够自动地排除孤立点。(2)小波变换的多分辨率特性对不同精确性层次的聚类探测是有帮助的。(3)基于小波的聚类速度很快,计算复杂度是O(n),文献提出一种改进的小波变换聚类方法Wavecluster+算法,可处理复杂的图像数据库聚类问题。Agrawal等提出的CLIQUE算法[15],综合了基于 136 󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁计算机技术与发展󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁󰀁第19卷

  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档