一种基于网格的等密度线聚类算法

第38卷第2期 兵器装备工程学报 20l7年2月 

【信息科学与控制工程】 doi:10.11809/scbgxb2017.02.020 

一种基于网格的等密度线聚类算法 

徐明钊,杨春,范健,张健,张耐民 (北京宇航系统工程研究所,北京100076) 摘要:提出了一种基于网格的等密度线聚类算法,通过对样本所在空间进行网格划分,从样本分布等密度线图的思 想出发,可自动发现任何形状的类,时间复杂度和空间复杂度较好,实现了对不同类样本空间容积的计算,具有很好 的聚类效果和容积计算能力。 关键词:聚类;网格;等密度线;容积 本文弓l用格式:徐明钊,杨春,范健,等.一种基于网格的等密度线聚类算法[J]。兵器装备工程学报,2017(2):88 —91. Citation format:XU Ming—zhao,YANG Chun,FAN Jian,et a1.A Grid—Based Density—Isoline Clustering Algorithm[J].Jour— nal of Ordnance Equipment Engineering,2017(2):88—91. 中图分类号:TP181 文献标识码:A 文章编号:2096—2304(2017)02—0088—04 

A Grid--Based Density・-Isoline Clustering Algorithm XU Ming—zhao,YANG Chun,FAN Jian,ZHANG Jian,ZHANG Nai—min (Beijing Institute of Aerospace System Engineering,Beijing 100076,China) Abstract:We proposed a grid—based density-isoline clustering algorithm.The algorithm meshes the space where the samples in,with the thought of density distribution,and it can automatically discover any kind of shape,and has great time complexity and space complexity.In addition,we achieved the calculation of the sample space of different types of volume.It has good clustering effect and volume grid—based computin‘g capabilities. Key words:clustering;g d—based;density—isoline;volume 聚类…作为数据挖掘中常用的手段,把一个没有类别标 记的样本集在无先验知识的情况下按某种准则分成若干个 子集,使相似的样本归为一类,而不相似的样本尽量划分到 不同的类中。聚类分析的方法可以分为以下几类:基于划分 的方法、基于层次的方法、基于密度的方法、基于网格的方法 和基于模型的方法 。在实际应用中,常常需要针对不同算 法的特点,结合上述多种聚类方法,才能针对具体问题收到 理想的效果。本文提出了一种基于网格的等密度线聚类算 法,实现了样本的聚类分析。 1 等密度线聚类算法 

1.1等密度线聚类算法概述 等密度线聚类算法是一种基于密度的聚类方法,密度是 衡量点的疏密程度的概念。通常把每一样本作为中心,在一 定体积内包含样本的数目作为该样本的密度。现有一些聚 类算法(如DBSCAN算法等)只关注高密度样本的部分 , 却忽视了高密度周围低密度数据集的聚类。另外,聚类过程 中无法对孤立样本进行处理,所以不能对多密度数据集进行 聚类。Chamelenon等一些算法尽管可以对多密度数据集进 行聚类,但是聚类精度不高,无法对不同的密度区间进行准 确划分。 赵艳厂等 从聚类点的样本分布等密度线图的思想出 发,找出样本分布比较集中的区域,从而发现隐含在样本集 中的类。在此基础上,本文提出了一种等密度线聚类方法, 统计出每个样本邻域内包含样本的数目作为该样本的密度 值,根据密度值实现对样本的聚类,其中每个子类可以是不 连通的集合。 1.2算法步骤 等密度线聚类算法的步骤如下: 

收稿日期:2016—09—28;修回日期:2016—10—20 作者简介:徐明钊(1986一),男,硕士,工程师,主要从事导弹总体设计和智能算法研究。

 徐明钊,等;一种基于网格的等密度线聚类算法 89 1)对于样本集中所有n个样本点 ,统计出任意两点之 间的距离,得到距离矩阵dist,dist(i, )=D( (i), ( )), i,J=1,…,n。 2)根据距离矩阵dist得到邻域大小RT,RT= meatt(dist)/n 。其中mean(dist)是任意两点间的平均距 离,coefRT是邻域调节系数,取值在0到1之间。实验发现 coefRT取0.3时往往会有比较好的聚类结果。 3)统计密度矩阵den即每个样本点在邻域RT内包含 的样本点数目。密度矩阵den的统计示意图见图1,对于其 中位于圆心处的点,在其RT邻域内的点的个数为4,那么该 点的密度为4。 

图1 密度矩阵den的统计示意图 4)根据密度矩阵确定密度阈值向量DT,即密度线向 量。DT的选择与样本的密度分布直接相关,例如当密度低 到密度高的样本的个数呈现快速增长趋势,可将DT设定为 一个等比增加的序列。具体使用过程中常常需要根据聚类 的结果调整DT的取值,以便最后达到最满意的聚类效果。 5)根据密度阈值向量DT完成子类的划分。把密度值 在两条等密度线之间的样本归为一类。如果聚类效果不好, 则调整DT的取值,重新聚类。 2基于网格的等密度线聚类算法 

2.1 基于网格的等密度线聚类算法概述 针对某些特定问题的聚类分析,除了完成已有数据样本 的聚类外,还需要对聚类样本在空间内占据的空间大小或分 布(容积)进行计算。等密度线聚类算法可以实现基于密度 的聚类,但无法计算聚类样本的“容积”。为了解决这一问 题,本文对该算法做了适当改进,提出了一种基于网格划分 的等密度线聚类算法。 基于网格的聚类方法采用网格这一数据结构对聚类空 间进行了划分,把空间量化为有限的数据单元,并以此为基 本单位进行聚类 J。经过网格划分后的空间聚类样本变成 了网格,不再是孤立的样本点,因此方便了统计样本空间,实 现了容积计算。 目前常见的基于网格的聚类算法有以下几种:STING算 法是一种基于网格的多分辨率聚类方法,网格结构利于并行 处理和数据的更新,效率高,但是聚类的精度较低;Wave— Cluster算法 在数据空间中加入了一个多维网格结构,并用 小波变换变换原来的特征空间,算法较为复杂;CLIQUE算 法 综合了基于密度和基于网格两种聚类算法,适合用于大 型数据库和高位数据的聚类,但是聚类的精度较差。以上3 种算法无法进行多密度聚类,也无法实现对聚类后容积的 计算。 2.2算法步骤 基于网格的等密度线聚类算法借鉴了基于网格的聚类 算法以及等密度线聚类算法的思想,具体步骤为: 1)对于样本集中所有n个样本点 ,计算任意两点之间 的平均距离me,an(dist),然后计算出邻域大小RT,RT= ?l'tean(dist)/n 积 ,其中coefRT是邻域调节系数,计算过程同 1.2节。 2)网格的划分。把聚类空间每个维度划分为P个区间 P=ce村( n/co )(ceil表示上取整) 其中:m是聚类空间的维度;n是样本的总数;coefM是区间划 分系数。这样,整个聚类空间被划分为(ceil(UYTgefM)) 个网格。 网格划分的大小将直接影响聚类的效果,网格太大或太 小会导致网格中包含的样本数量不合理,导致最终的聚类结 果不精确。此外如果网格太小,空间中网格数太多会导致时 间复杂度大大增加。文献[7]给出了网格划分大小的依据, 其中的区间划分系数coefM是一个正数的调节系数,其取值 范围在一般情况下为1—2。 3)邻域网格的确定。计算统计密度时,每一维的邻域 网格数rl:ceil(RT/Len P),其中,Len 是聚类空间在每一 维上的长度投影。 步骤2)对聚类空间划分网格,但是统计密度的时候不 宜直接统计每个网格中样本的个数,算法吸取了图像处理中 的相关处理方法 J,统计每个网格及其邻域中样本的数目, 作为此网格的密度,相当于对网格密度做了一次高斯平滑, 达到减少噪声的目的 j。 4)计算网格密度矩阵。统计每个网格及邻域中包含样 本点的数目,作为该网格的密度。每个网格需要统计的网格 m 数目为丌(2×rl+1)。将统计的密度除以统计的网格数,做 ‘_t 归一化处理。依次统计每一个网格的密度,就得到了网格密 度矩阵den。 算法实现时,可以通过样本点更新聚类空间中网格密度 的方式计算网格密度矩阵。每当得到一个样本点,只需增加 该样本点对应的丌(2 +1)个网格密度值即可。图2例 -_t 举了密度矩阵den的求解方法。整个矩形空间被划分为P× P个网格,对于深色阴影的网格,需要统计周围邻域为 的 阴影网格内点的个数,归一化后的密度值5/9。 5)根据网格密度矩阵确定密度阈值向量DT。算法密 度阙值矩阵DT的确定仍然沿用等密度线聚类算法的公式。 具体使用过程中常常需要根据聚类的结果调整DT的取值, 以便达到最满意的聚类效果。 6)根据密度阈值向量DT完成子类的划分。把密度值 

在两条等密度线之间的样本点归为一类。如果聚类效果不 兵器装备工程学报http://scbg.qks.cqut.edu.cn/ 好,则调整DT的取值,重新聚类。 

’i I 

图2密度矩阵den的统计 

3算法的性能分析 

3.1聚类结果比较 选取二维正态分布进行随机采样的点进行聚类,以对比 基于网格的等密度线聚类算法与等密度线聚类算法的效果 

《a)2 000点等密度线聚类 

(c)6 000点等密度线聚美 和性能。 二维正态分布的联合概率密度函数为 Ax,y):七唧一 [ 一 + 】 2wtrl 2 ̄/1一p‘ 其中: 是两个变量的期望;o-。、6r:是两个变量的方差;p 是协方差系数。 实验中二维正态分布的参数选取为 ( ) (:),c (p :p ) ( ) 实验中设定聚类的子类数目为5。对于2 oo0点、6 ooo 点的样本集,两种聚类方法得到的聚类结果如图3。 由图3所示的实验结果可以看出,基于网格的等密度线 聚类方法与等密度线聚类方法具有相当的聚类效果。两种 聚类方法都能够有效地将以二维正态分布采样的点聚类成5 个近似同心圆环的子类,在样本点较多的情况下聚类效果更 好。当样本点较少的情况下,两种聚类算法对子类边缘的样 本不能很好的处理,聚类性能有所下降。 

(b)2 000点网格等密度线聚类 

(d)6 000点网格等密度线聚粪 图3 两种聚类方法对不同样本点数的聚类效果比较 3.2复杂度分析 时间复杂度方面,两种算法的时间主要花费在计算距离 矩阵如 以及统计密度矩阵上面 。等密度线聚类算法计 算距离矩阵的时间复杂度为0(n ),统计密度矩阵的时间复 杂度也是0(/1, );基于网格的等密度线聚类算法计算距离矩 阵的时间复杂度为o(n ),而统计密度矩阵的时间复杂度为 m 0(n×丌(2× +1))<0(n ),因此时间复杂度要优于等 密度线聚类算法。 在算例中,采用Matlab编程并利用lntel i7处理器的计 算机计算,其中2 000点聚类计算中等密度线聚类算法耗时 2.548 s,基于网格的等密度线聚类算法耗时I.782 S。 空间复杂度方面,基于网格的等密度线聚类算法在计算 RT的时候并不需要保存如f矩阵,此处可以节省大量的内存 空间。在密度矩阵方面,基于网格的等密度线聚类算法需要 m 8 6 4 2 O之4 罐 8 6 4 2 O 4 增m 

合集下载

基于网格和密度的模糊C均值聚类初始化方法

基于网格和密度的模糊C均值聚类初始化方法

第25卷第3期 

2008年3月 计算机应用与软件 

Computer Applications and Software Vo1.25 No.3 

Mar.2008 

基于网格和密度的模糊C均值聚类初始化方法 

盛 莉 邹开其 邓冠男 

(重庆工学院计算机系重庆400050) 

(大连大学信息工程学院辽宁大连116622) 

摘要 模糊c均值聚类算法是目前聚类分析中最受欢迎的算法之一,但其聚类效果往往受初始参数的影响。针对这一问题,提 

出一种基于网格和密度的模糊c均值聚类初始化方法。以网格和密度为工具提取聚类样本的类聚类中心,以此来初始化模糊e均 

值聚类算法的初始参数,从而弥补原算法的不足。实验证明方法是可行的、有效的。 

关键词 模糊c均值聚类 网格 密度 

AN INITIALIZATION METHOD FOR FUZZY C.MEANS CLUSTERING 

ALGoRITHM BASED oN CRID AND DENSITY 

Sheng Li Zou Kaiqi Deng Guannan 

(Chongqing Institute of Techrtology,Chongqing 400050,China) 。(College ofInformation Engineering,Dalian University,Dalian 116622,Liaoning,China) 

Abstract Fuzzy c—means clustering algorithm is one of the most widespread clustering algorithm、Its performance strongly depends on the 

initial parameters.To solve this problem,an initialization method for fuzzy c—means clustering algorithm based on grid and density is proposed、 

一种基于密度的高性能增量聚类算法

一种基于密度的高性能增量聚类算法

第32卷 

VoL32 第2l期 

No.2l 计算机工程 

Computer Engineering 2006年l1月 

November 2006 

・软件技术与数据库・ 文章铺号l 100 __3428(2006)2l—_0o7 一J3 文献标识码t A 中圈分娄号 TP391 

一种基于密度的高性能增量聚类算法 

刘建哗 .李芳 

(1.}:海交通大学计锋机科学与工程系,上海200030;2.甲骨文公司(中国),.卜海200021) 

摘要:提出并证明了一种基于密度的高性能增量聚类算法,算法的主要工作包括:(1)利用分区和抽样技术对数据进行抽取和清理。(2) 

利用密度和网格技术对数据进行聚类 (3)改变闽值后提Ln一种增量算法,只对受影响的点重新计算聚类。(4)在动态环境下,数据增删后的 增量聚类算法。实验征明,该算法能很好地处理高维数 ,有效过滤噪声数掘,大大节省聚类时间。 

关健词:数据挖掘;聚类算法;密度;增量算法 

An Efficient Incremental Algorithm for Clustering Based 0n Density 

LIU Jianye .LI Fang 

(I.Dept.ofComputer Science andEngineering,Shanghai JiaotongUniversitY,Shanghai 200030;2.OracleChina,Shanghai 200021) 

[Abstract]An incremental algorithm of high efficiency for clustering based on density is presented.The ulain idea consists of following:(I) 

Sample data by using partition and sampling technology.(2)Clustering data based on density and grid(3)In the case for threshold adjusting,it 

一种基于网格和最小生成树的数据流聚类算法

一种基于网格和最小生成树的数据流聚类算法

计算机系统膨用 h@:llu, ̄v'a C S.a.org.cn 2011年第20卷第2期 

一种基于网格和最小生成树的数据流聚类算 

王海波 ,王宪鹏 ,王芳。,陈志固。 

(牡丹江医学院教育技术与信息中心,,{l丹江1 57011) (潍柴动力企信部,潍坊261041) 

摘要:针对CluStream算法对非球状簇聚类的不足,同时基于均匀网格划分的聚类算法多数是以降低聚类精度 

为代价来提高聚类效率,给出了一种新的数据流聚类算法一GTSClu算法,该算法是基于网格的最小生成树 

(MST)数据流聚类算法。算法分为在线处理与离线聚类两部分,并运用了列格拆分与最小生成树技术,可以 

有效排除噪声数据,发现任意形状的聚类,实验证明提高了聚类效率和质量。 

关键词:聚类:数据流;网格:最小生成树 

A Grid and MST Based Clustering Algorithm for Data Streams 

WANG Hai-Bo ,WANG Xian・Peng ,WANG Fang ,CHEN Zhi—Guo‘ 

(Center ofEducational Technology and Information,Mudanjiang Medical University,Mudanjiang 157011,China) (Department ofEnterprise Management and Information Technology,Weichai Power Co.,Ltd,Weifang 261041,China) 

Abstract:CluStream algorithm has poor quality of clustering for non-spherical clusters,at the same time,most 

grid・・based clustering algorithms improve the efficiency of clustering at the cost of reducing clustering accuracy.The 

基于网格的数据流聚类算法

基于网格的数据流聚类算法

基于网格的数据流聚类算法 ) 

刘青宝戴超凡邓苏张维明 

(国防科学技术大学信息系统与管理学院 长沙410073) 计算机科学2007Vo1.34No.3 

摘要本文提出的基于网格的数据流聚类算法,克服了算法CluStream对非球形的聚类效果不好等缺陷,不仅能在 

噪声干扰下发现任意形状的类,而且有效地解决了聚类算法参数敏感和聚类结果无法区分密度差异等问题。 

关键词聚类,数据流,聚类参数,相对密度 

Grid-based Data Stream Clustering Algorithm 

LIU Qing—Bao DAI Chao-Fan DENG Su ZHANG Wei-Ming 

(College of Information System and Management,National University of Defense Technology,Changsha 410073) 

Abstract With strong ability for discovering arbitrary shape clusters and handling noise,grid—based data stream cluste— 

ring algorithm efficiently resolves these problem of being very sensitive to the user-defined parameters and difficult to 

distinguish the density distinction of clusters. 

Keywords Clustering,Data stream,Clustering parameter,Relative density 

随着计算机和传感器技术的发展和应用,数据流挖掘技 

术在国内外得到广泛研究。它在网络监控、证券交易分析、电 

信记录分析等方面有着巨大的应用前景。特别在军事应用 

网格和密度聚类算法在入侵检测中的应用

网格和密度聚类算法在入侵检测中的应用

第3O卷第11期 2010年11月 计算机应用 Journal of Computer Applications Vo】.30 No.1l NOV.2010 

文章编号:1001—9081(2010)11—3051一O2 

网格和密度聚类算法在入侵检测中的应用 

王翠娥,于晓明 

(陕西科技大学电气与信息工程学院,西安710021) (wangcuie0510@163.COITI) 

摘要:针对现有入侵检测算法中普遍存在的对输入顺序敏感的问题,提出了将网格和密度相结合的聚类算法 

应用到入侵检测中。该算法在CLIQUE基础上进行了改进,将非密集单元向密集单元移动,克服了CLIQUE算法聚类 

结果精确性不高的缺点。该算法结合了网格聚类的低时空复杂度和密度聚类的良好抗噪性的特点。仿真实验中采 

用了KDD—CUP99的测试数据集,实验结果证实了该算法的有效性和可行性。 

关键词:聚类;网格;密度;入侵检测;数据挖掘 

中图分类号:TP393.08 文献标志码:A 

Application of clustering algorithm based on 

density and grid in intrusion detection 

WANG Cui.e.YU Xiao—ming 

(College ofElectrical and Information Engineering,Shaanxi University ofScience and Technology,Xi'an Shaanxi 710021,China) 

Abstract:After discussing some problems in the current intrusion detection techniques,an intrusion detection method 

that applies cluster algorithm based on the density and grid was proposed.This algorithm shifted from non—dense part to dense 

基于自适应网格密度聚类的雷达信号分选算法

基于自适应网格密度聚类的雷达信号分选算法

50 航天电子对抗 第29卷第2期 

0 引言 基于自适应网格密度聚类的雷达信号分选算法 

李星雨,杨承志,曲文韬,张 荣 

(空军航空大学,吉林长春130022) 

摘要: 针对现有网格聚类中网格划分方法不能较好地适应所有数据分布、网格边界处理 精度低等问题,提出基于自适应网格密度聚类的雷达信号快速分选算法。该算法首先引入了 网格均匀度的概念,然后给出了自适应网格划分技术和网格均匀度的计算方法,最后进行均匀 度可达聚类。该算法能自适应地发现不同密度的类及其边界,适合处理大规模侦察数据集。 仿真实验表明该算法能有效适用于雷达信号分选。 关键词: 雷达信号分选;预分选;网格密度聚类;自适应网格 中图分类号:TN971 .1;TN974 文献标识码: A 

A radar signal sorting algorithm based on adaptive grid density clustering 

Li Xingyu,Yang Chengzhi,Qu Wentao,Zhang Rong (Aviation University of Air Force,Changchun 130022,Jilin,China) Abstract:The methods to partition grids in existing grid clustering can’t better adapt to all of the data dis— tribution,and the grid boundary processing accuracy is low.So a radar signal sorting algorithm is proposed based on the adaptive grid density clustering radar signa1.The algorithm first introduces the concept of grid L1一 niformity,and then gives the method to partition the grids adaptively and calculate grid evenness,and finally clustering based on grid uniformity.The algorithm can find a class with different densities and its borders a— daptively,suitable for handling large—scale reconnaissance data set.Simulation results show that the algorithm can be effectively applied to radar signal sorting. Key words:radar signal sorting;pre—sorting;grid density clustering;adaptive grid 

各种密度聚类算法

各种密度聚类算法

密度聚类是一种非参数化的聚类算法,它可以根据样本之间的密度信息将数据点聚集成簇。与传统的基于距离的聚类算法(如K-means)不同,密度聚类算法可以自动识别出不同形状和大小的簇,适用于处理高维、非线性、噪声较多的数据。

以下是几种常见的密度聚类算法:

1. DBSCAN(Density-Based Spatial Clustering of Applications

with Noise):DBSCAN是一种基于密度的聚类算法,通过根据密度划分核心对象、边界对象和噪声对象来形成簇。DBSCAN使用两个参数,即邻域半径ε和最小邻域点数MinPts,可以在不同的数据集上找到具有不同形状和大小的簇。

2. OPTICS(Ordering Points to Identify the Clustering

Structure):OPTICS是对DBSCAN的改进,它针对DBSCAN需要事先设定参数的问题进行了改进。OPTICS通过计算每个点与其邻域点之间的距离来构建一个邻域距离的有序列表,从而识别出密度相似的簇。OPTICS还引入了核心距离和可达距离的概念,可以更好地识别不同密度的簇。

3. DENCLUE(DENsity-based CLUstEring):DENCLUE是一种基于密度梯度的聚类算法,它假设样本的分布在高密度区域具有概率较大,并利用样本之间的密度梯度信息来聚类。DENCLUE使用高斯核函数来估计样本的密度,并通过不断更新密度梯度来逐步聚类。DENCLUE可以处理具有多个密度峰值的数据集。

4. GDBSCAN(Generalized Density-Based Spatial Clustering of

Applications with Noise):GDBSCAN是对DBSCAN的改进,它通过在DBSCAN中引入参数来调整密度阈值来解决DBSCAN对密度参数的敏感性问题。GDBSCAN可以对密度变化较大的数据集进行聚类,并可以灵活地调整簇的形状和大小。

基于群组与密度的轨迹聚类算法

第47卷第4期Vol.

47No.4计算机工程ComputerEngineering2021年4月

April2021

基于群组与密度的轨迹聚类算法

俞庆英1,2,赵亚军1,2,叶梓彤1,2,胡凡1,2,夏芸1,2

(1.安徽师范大学计算机与信息学院,安徽芜湖241002;2.安徽师范大学网络与信息安全安徽省重点实验室,安徽芜湖241002)

摘要:现有基于密度的聚类方法主要用于点数据的聚类,不适用于大规模轨迹数据。针对该问题,提出一种利用

群组和密度的轨迹聚类算法。根据最小描述长度原则对轨迹进行分段预处理找出具有相似特征的子轨迹段,通过

两次遍历轨迹数据集获取基于子轨迹段的群组集合,并采用群组搜索代替距离计算减少聚类过程中邻域对象集合

搜索的计算量,最终结合群组和密度完成对轨迹数据集的聚类。在大西洋飓风轨迹数据集上的实验结果表明,与

基于密度的TRACLUS轨迹聚类算法相比,该算法运行时间更短,聚类结果更准确,在小数据集和大数据集上的运

行时间分别减少73.79%和84.19%,且运行时间的减幅随轨迹数据集规模的扩大而增加。关键词:群组;密度;群组可达;邻域搜索;轨迹聚类

开放科学(资源服务)标志码(OSID):

中文引用格式:俞庆英,赵亚军,叶梓彤,等.基于群组与密度的轨迹聚类算法[J].计算机工程,2021,47(4):100-107.

英文引用格式:YUQingying,ZHAOYajun,YEZitong,etal.Trajectoryclusteringalgorithmbasedongroupanddensity[J].

ComputerEngineering,2021,47(4):100-107.

TrajectoryClusteringAlgorithmBasedonGroupandDensity

YUQingying1,2,ZHAOYajun1,2,YEZitong1,2,HUFan1,2,XIAYun1,2

基于网格的高效DBSCAN算法

Computer Engineering and Applications计算机工程与应用 2007,43(17) 167 

基于网格的高效DBSCAN算法 

张枫,邱保志 ZHANG Feng,QIU Bao—zhi 

郑州大学信息工程学院,郑州450052 School of Information Engineering,Zhengzhou University,Zhengzhou 450052,China E—mail:yeyeqiuyu@tom、corn ZHANG Feng,QXU Bao-zhi.Efficient DBSCAN algorithm based on grid.Computer Engineering and Applications,2007,43 (17):167-169. Abstract:DBSCAN is an outstanding representative of clustering algorithms for its good performance in clustering spatial data、To improve its efficiency this paper proposes GbDBSCAN(Grid based DBSCAN).GbDBSCAN adopts gird and data binning technique to query density reachable objects for all objects in dataset.It Call also identify and handle border points.Experiment results show that GbDBSCAN is much more efficient than DBSCAN in low dimensional data space,without lowering the quality of DBSCAN. Key words:clustering;density;grid 摘要:DBSCAN是一种性能优越的基于密度的聚类算法。为提高它的运行效率,提出了基于网格的DBSCAN算法GbDBSCAN。 该算法使用网格划分的方法和数据分箱技术,减少了判定密度可达对象时的搜索范围,降低了算法的运行时间.而且算法还能够 识别并处理边界点。实验结果表明,GbDBSCAN在不降低DBSCAN聚类质量的前提下,大大提高了DBSCAN算法处理低维数据集 的效率。 关键词:聚类;密度;网格 文章编号:1002—8331(2007)17—0167—03 文献标识码:A 中图分类号:TP3l1;TP18 l 引言 聚类技术是数据挖掘的重要研究方向之一.其目的是把相 似的对象聚在一起而相异的对象尽可能地分离。它广泛应用于 市场分析、决策支持、商业经营和图像处理等诸多领域_l_ 。 目前已经提出很多聚类算法,这些算法可分为以下几种: 划分方法、层次方法、基于密度的方法、基于网格的方法和基于 模型的方法I ~1。基于网格的方法首先将对象空间量化为有限数 目的单元,形成网格结构.然后在网格结构上进行聚类 这种方 法的主要优点是处理速度快,其处理时间独立于对象数目.仅 依赖于量化空间中每一维上的单元数目[31 STING和CLIQUE 是基于网格技术具有代表性的方法 STING(Statistical Infor. mation Grid)把数据空间层次地划分为单元格,依赖于存储在 网格单元中的统计信息进行聚类。CUQUE(CIustering In QUEst) 综合了密度和网格的方法。尽管基于网格的聚类方法有快速的 处理速度,但可能降低聚类的质量和精确性12,31 基于密度的方法根据密度的概念来聚类对象.它或者根据 邻域对象的密度,或者根据某种密度函数来生成聚类 。DB— SCAN(Density—Based Spatial Clustering of Application with Noise)是一种重要的基于密度的算法,该算法不断地把密度足 够高的区域加入到簇里面 形成密度相连的最大集合p--- 同其 它聚类算法相比,DBSCAN可以发现任意形状、不同大小的簇 并过滤噪声,很好地完成聚类分析任务。但是,低效的时间性能 限制了它在现实中的应用。 本文提出了基于网格的DBSCAN聚类算法GbDBSCAN (Grid based DBSCAN),利用网格划分的方法和数据分箱技 术,确定数据点邻域的搜索范围,大大降低了DBSCAN的计算 时间。同时,GbDBSCAN还可以识别数据集中的边界点,并对 其做出相应的处理。算法的时间复杂度是数据规模的线性 函数 

新道云聚类算法

新道云聚类算法

基于划分的聚类算法

该类算法通常先根据给定的聚类个数k创建k个划分,然后更新聚类中心,按照某种既定的规则重新对数据进行划分,以期找到k个比较“紧凑”的类,即同一类中的数据点尽量靠近,非同类中的数据点尽量远离。以下主要介绍几种经常使用的划分聚类算法。K-means 聚类算法7关于它的详细介绍见本文21章节。PAM聚类算法[8]该算法引入代表对象概念,它将聚类中心称之为代表对象,其他数据点称之为非代表对象,为叙述方便记代表对象集合为C,非代表对象集合为UC.PAM算法首先从数据集中随机选择k个数据点构成C,然后不断地用UC中的元素替换C中的元素,希望通过这种方式来寻找好的聚类结果。与K-means 聚类算法不同的是,在 PAM 算法更新代表对象过程中新的代表对象是从数据集中选取而来,而不是由类中元素的均值产生。CLARA聚类算法它首先通过随机抽样的方式从数据集中获取多个小容量的样本集,然后对得到的每个样本集运用PAM 算法进行聚类,最后选择最好的聚类结果输出。CLARA算法能够处理规模比较大的数据集,但是聚类质量依赖于抽取样本的大小。CLARANS 聚类算法又叫基于随机选择的聚类算法,也是将PAM算法和抽样技术相结合,与CLARA算法不同的是,CLARA处理的样本不会发生变化,而 CLARANS 算法在每次迭代过程中都会随机产生新的样本集。FCM 聚类算法,运用模糊理论中的方法对数据对象进行分配,即对于每个非聚类中心点,它按一定概率属于每个聚类中心,即隶属度,选取隶属度最大的聚类中心作为其中心点。

1.2.2 基于层次的聚类算法

基于层次的聚类算法在聚类过程中引入聚类树的概念,该类算法根据数据集中对象间的相似程度构造一棵聚类树,根据构造方法的不同基于层次的聚类算法可以分为自顶向下(分解)的层次聚类算法和自底向上(合并)的层次聚类算法。自上而下的层次聚类算法在聚类过程开始时生成一个初始类,这个类包含数据集中所有对象,然后根据某种分解规则将初始类逐渐分解成多个小类,然后对得到的小类再进行分解直到每个对象独自构成一类为止。与分解层次聚类算法相反,自下而上的层次聚类算法首先将数据集中的每一个对象看成一个类,然后依据某种合并准则将它们逐渐合并数据对象并为一类。大名数层次聚类算法都是单链接算法完整的链接算法和最小方差算法的变种。其中单链接算法应用得最为广泛。代表性的层次聚类算法有:BIRCH 算法,该算法首先在遍历数据集的过程中计算聚类特征,同时构建聚类特征树,然后按照一定的规则对特征树的叶节点进行拆分或合并得到聚类结果。CURE 聚类算法6,它首先从数据集中随机抽样获得样本,然后将样本分成若干类,在每个类中选取若干代表点,对这些代表点进行聚类得到最终结果。ROCK方法,它是一种自下而上的层次聚类算法,定义相似度大于给定阈值的两个数据点互为邻居,两个数据点拥有的共同邻居的个数称为连接,通过连接和相似度构建准则函数,优化准则函数得到聚类结果。CHEMALOEN算法,它首先由数据集构造k-近邻图,然后用图划分算法将 k-近邻图分解成多个子图,最后通过自底向上的聚类算法对各个子图进行合并得到最终聚类结果。则称该对象为核心点。然后找到任意一个核心点,对该核心点利用传递性聚类方法往外扩展当前类。DBSCAN 对凸型数据和非凸型数据都能取得理想的聚类结果,为了解决DBSCAN受参数影响较大的弊端,等人设计了OPTICS聚类算法,OPTICS 算法对每个数据对象维护两个属性:核心距离和可达距离,并按可达距离对数据对象进行升序排序得到排序列表,从这个排序列表中可以得到最终的聚类结果。DENCLUE 算法,它是基于一组密度分布函数的聚类算法,每一个空间数据点通过影响函数事先对空间产生影响,影响值可以叠加,从而在空间形成一曲面,聚类中心就是曲面中的局部极大值点,该聚类中心的吸引域形成一类。

  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档