基于自适应权重的模糊C-均值聚类算法
第29卷第8期 2012年8月 计算机应用研究 Application Research of Computers Vo1.29 No.8 Aug.2012
基于自适应权重的模糊C一均值聚类算法术
任丽娜,秦永彬,许道云
(贵州大学计算机科学与信息学院,贵阳550025)
摘要:针对模糊c.均值聚类算法过度依赖初始聚类中心的选取,从而易受孤立点和样本分布不均衡的影响而
陷入局部最优状态的不足,提出一种基于自适应权重的模糊c一均值聚类算法。该算法采用高斯距离比例表示权
重,在每一次迭代过程中,根据"-3前数据的聚类划分情况,动态计算每个样本对于类的权重,降低了算法对初始
聚类中心的依赖,减弱了孤立点和样本分布不均衡的影响。实验结果表明,该算法是一种较优的聚类算法,具有
更好的健壮性和聚类效果。 关键词:模糊c.均值聚类算法;自适应权重;高斯距离;隶属矩阵
中图分类号:TP301.6 文献标志码:A 文章编号:1001—3695(2012)08—2849—03
doi:10.3969/j.issn.1001-3695.2012.08.012
Fuzzy C.-means clustering based on self--adaptive weight
REN Li—Ha,QIN Yong。bin,XU Dao‘yun
(College of Computer Science&Information,Gu ̄hou University,Guiyang 550025,China)
Abstract:Due to fuzzy C—means clustering algorithm rely heavily on randomly select C clustering centers,SO outlier and une— ven distribution of the samples easily influenced and made it easy to fall into the local optimum states.Therefore,this paper proposed an improved fuzzy C-means clustering algorithm based on serf-adaptive weights.The new method expressed weight by using the Gaussian distance ratio,it computed the weights for every data according to the current clustering state and no more did rely on the initial clustering center.weakened the influence of outlier and uneven distribution of the samples.The experi— ments indicate that the fuzzy C-means clustering algorithm based on self-adaptive weights is an effective fuzzy clustering algo— rithm,has more robust and higher clustering accuracy. Key words:fuzzy C—means clustering algorithm;self-adaptive weights;Gaussian distance;membership matrix
0引言
传统的聚类算法中每一个样本必须只属于一个类,对数据
形成精确的划分,即硬聚类…。但是现实中要处理的很多数
据具有不确定性和不精确性,因此传统算法在一些应用上无法
达到理想的效果。模糊聚类作为一种软聚类算法,利用隶属度
使得类与类之间没有明显的界限,用来处理不分明的对象是行
之有效的,使聚类效果更合乎自然,更符合客观实际 。
目前,在众多模糊聚类算法中,模糊C一均值聚类(fuzzy
C—means clustering,FCM)算法 应用最广泛且较成功,它通过
优化目标函数得到每个样本点对所有类中心的隶属度,从而决
定样本点的类属以达到自动对数据样本进行聚类的目的。然 而该算法仍存在着一些不足:a)算法的性能依赖于初始聚类
中心的选取;b)聚类的类数不能自动确定;C)对于样本中的孤 立点、噪声数据比较敏感;d)目标函数没有充分考虑到样本分
布不均衡的问题 。
国内外相关文献针对上述的不足进行了深入的研究。齐
淼等人 通过改进隶属度函数,以消除孤立点对聚类结果的
影响,为每个样本点赋予一定量的权值,以改善噪声和分布不 均衡样本集的聚类结果;朱林等人 o 提出了一般化的改进模
糊划分的GIFP—FCM算法,通过引入新的隶属度约束和模糊程
度系数,使得算法具有更好的鲁棒性和参数适应性;考虑到使 算法不受聚类中心的影响并自动确定聚类个数,魏娜等人
提出了一种无监督多尺度聚类算法;Graves等人 采用基于内 核的FCM算法明显改善了分析数据集的边际问题。
本文提出一种基于自适应权重的模糊C一均值聚类(fuzzy
C-means clustering based on self-adaptive weights,SAWFCM)算
法,根据数据样本的具体分布情况设计自适应权重计算策略以 改进聚类效果。SAWFCM算法认为在聚类过程中,同一个类
中的样本对于聚类中心的影响并不相同,对每一个样本来说不 包含样本的类也有一个产生抑制效果的权重,因此将针对每个 样本设计权重并用其改进FCM的隶属矩阵,自适应权重的模
糊C一均值聚类在每一次的迭代过程中根据当前的数据划分状 态,动态地计算样本权重,降低了FCM算法对初始聚类中心和
隶属矩阵的依赖,减弱了孤立点和样本分布不均衡的影响。此
外,算法采用高斯距离比例表示权重,从而可以有效地减弱数 据密度变化对聚类效果的影响 ’ J。如图1所示,基本的FCM
算法在聚类过程中随机选取初始聚类中心,图1(a)显示了基 本FCM算法在聚类过程中由于依赖初始聚类中心,在存在孤
收稿日期:2011.12—20;修回日期:2012-02-23 基金项目:国家自然科学基金资助项目(60863005);贵州省科学技术基金资助项目(黔
科台J字[2012]2125号);贵州大学引进人才科研资助项目(贵大人基合字[2011]14号) 作者简介:任丽娜(1987.),女,辽宁阜新人,硕士研究生,主要研究方向为数据库技术与应用系统(renlinal11@163.corn);秦永彬(1980一),男, 山东招远人,副教授,博士,主要研究方向为可计算性与计算复杂性;许道云(1959-),男,贵州安顺人,教授,博导,主要研究向为可计算性与计算复 杂性、算法设计与分析.
・2850・ 计算机应用研究 第29卷
立点时产生了局部最优的聚类结果;而SAWFCM算法中同一
个类中的每个样本点对类的影响都是不同的,对不包含该样本
点的类由于距离远而产生一个抑制权重,图l(b)则展示了
SAWFCM算法每个样本点,例如样本点1对类C 与C 具有不
同的权重W 。、W :,算法在每一次迭代中,依据当前数据划分状
态动态计算每个样本所属类别的权重,得到较好的聚类结果。
图1 FCM与SAWFCM算法的聚类
1 基本FCM算法
FCM算法将数据集X= ,i=1,…, }分为c个模糊类,
并求每个类的聚类中心,使得目标函数即非相似性指标的价值
函数达到最小。该算法采用模糊度划分,使得每个给定数据样
本点用值在[o,1]间的隶属度来确定其属于各个组的隶属度。
根据归一化规定,一个数据集的隶属度的和总等于1:
. Ulk=1,Vi=1,…,n (1)
那么,FCM的目标函数为
c n ,(u, 一,c )=,∑, um 。2 (2)
其中:u。 表示介于[0,1]间的第i个样本对于第k个类的隶属
度;c 为类C 的聚类中心;d =Il 一c Il为第k个聚类中心
与第i个数据点间的欧几里德距离;且m [1, )是一个加权 指数作为模糊因子,随着m的增大模糊度增大,通常在不作特 殊要求的情况下取m=2 11]。
聚类准则是求得适当的模糊隶属矩阵U={u }与聚类中
心c 使得目标函数.,(U,c 一,c )达到极小值,根据拉格朗日
乘数法求得 、C 分别为
c H / “ (3)
J “ 1/耋( ) 一” (4) J…
FCM算法是从一个随机的聚类中心开始,通过搜索目标
函数的最小值,不断调整聚类中心和每一个样本的模糊隶属
度,达到确定样本类别的过程。此算法也可以先用满足式(1)
的[0,1]区间的随机数初始化隶属矩阵,再执行迭代过程。
2 基于自适应权重的模糊C一均值聚类
在FCM算法里,由于初始聚类中心的随机选取,导致聚类
结果对初始聚类中心的过度依赖,在存在孤立点和样本分布不
均衡等情况时,聚类会陷入局部最优状态。SAWFCM算法针
对FCM算法的上述不足进行了改进,算法的关键在于增加了
自适应权重的计算策略。下面将介绍自适应权重的计算策略
以及SAWFCM算法。
2.1 自适应权重计算
给定具有n个样本的数据集X={ ,i=1,…,n},利用高 斯距离计算样本对于聚类的影响,样本的作用随着与类心距离
的不断增大而平滑降低,从而降低孤立点对聚类效果的影响。 样本 在聚类过程中对于第 类的影响,( , )计算如下:
. ):e一 { (5)
其中:d 为第k个聚类中心与第 个数据点间的欧氏距离;
表示第k类的有效半径,其取值为第k类中所有样本与聚类中 心的欧氏距离的平均值,即
1 巩 亩∑xi ECkd (6)
其中:C 表示属于第k类的样本集,1.I为集合的势。
根据样本的划分状态,归一化单个样本的影响可以计算出
样本 在聚类过程中对于第k类的权重 ,即单个样本对类
的影响与样本集对类的影响的比值:
Wf. =-,(i,k)/ i, ) (7)
归一化处理不仅确保属于某一类的样本权重总和为1,而
且由于采用高斯距离比例表示权重,从而可以有效地减弱数据
密度变化对聚类效果的影响,可以在一定程度上减弱样本分布
不均衡对于聚类的干扰。
2.2加权的隶属矩阵
将上述自适应权重的计算策略与隶属矩阵相结合,采用加
权的隶属矩阵来计算下一次迭代的聚类中心,使得到的聚类中
心c 更合理,从而提高FCM算法的聚类准确率和收敛速度。 加权后的隶属矩阵使得每一个样本离聚类中心距离越远
其属于该聚类中心的隶属度越小。由式(8)获得的样本权重,
可以按如下公式计算并更新隶属矩阵 :
Uik W k ̄uik (8)
其中:符号 的运算法则定义为两矩阵中对应的元素相乘所得 矩阵为最终结果。例如:
(0 b)Q(c d)=(ac 6d)
2.3改进后的FCM算法
本文从自适应权重方面着手对FCM算法进行改进,改进
算法的主要思想与FCM算法类似,需要根据更新后的隶属矩
基于快速模糊C均值聚类算法的红外图像分割
第23卷第6期 2011年6月 强 激 光 与 粒 子 束 HIGH POWER LASER AND PARTICI E BEAMS Vo1.23,NO.6 Jun.。2O11
文章编号: 1001—4322(2O11)06—1467—04
基于快速模糊C均值聚类算法的红外图像分割
黄永林, 叶玉堂, 乔闹生, 陈镇龙
(电子科技大学光电信息学院,成都610054)
摘要:针对模糊c均值(FCM)聚类图像分割需要预先知道类别数及计算量较大的问题,提出了新的 快速FCM改进方法。首先,利用边缘信息进行邻域搜索得到种子像素;通过区域生长快速获得区域分割类别 数和对应的聚类中心值,并将图像分成确定类别的区域和未确定类别的区域;最后利用所得的聚类中心值和 FCM算法对未确定类别区域进行聚类。实验证明,本文提出的改进方法大大减少了计算量,显著提高了图像 分割速度,而且由于聚类考虑了相邻像素点的关系,图像分割结果能够清晰地保留目标轮廓,提高了图像分割 的质量。 关键词: 模糊c均值聚类; 图像分割; 区域生长; 红外图像; 模式识别 中图分类号:TP391 文献标志码: A doi:10.3788/HP1 PB20112306.1467
模糊C均值聚类(FCM)算法属于无监督的分类方法,在多目标自动图像分割领域得到广泛的应用[1剐。
但是该方法需事先知道分割类别数,且目标函数迭代收敛到局部最小值的运算量较大.特别在样本数和特征数 较多时收敛速度下降非常明显_7],因此该算法不适用于实时性要求较高的应用。薛景浩等提出以特征散度取
代欧氏距离重构FCM聚类算法,降低了图像分割结果的噪声 ]。王培珍等提出先用2维阈值分割对图像进 行粗分割,并求得聚类中心,避免直接使用模糊C均值聚类算法出现的问题_g ;李明等提出将图像从像素空间
映射到1维直方图特征空间,通过灰度级隶属函数约束条件得到目标和背景的聚类中心,然后进行c均值聚
基于模糊C均值聚类的粗集理论连续属性的离散化新算法
第18卷第5期 2006年1O月 重庆邮电学院学报【自然科学版) Vo1.18 No..5 Journal of Chongqing University of Posts and Telecommunications(Natural Science) Oct.2006
文章编号:1004-5694(2006)05—0650・.03
基于模糊C均值聚类的粗集理论
连续属性的离散化新算法*
黄晓莉,曾黄麟,.王秀碧
(四川I理工学院,自贡643000)
摘要:讨论模糊C均值聚类算法在决策表条件属性对决策属性的相容程度的指导下对粗集理论中的连续属性进 行离散化的一种新算法。该算法充分考虑属性之间的相关性,将所有连续属性转化为矩阵同时处理,能明显提高 传统动态层次聚类算法离散化过程的速度。算法测试结果表明,新算法能较好地保留有效属性,提高离散化精度。
关键词:模糊C均值聚类;粗集理论}连续属性;离散属性 中图分类号:TP18 文献标识码:A
0 引 言
粗集(RS)的突出优点是具有很强的定性分析
能力,不需要预先给定属性的数量描述(如统计学中
的概率分布),直接从给定问题的描述集合出发找出
问题的内在规律。但粗集适于处理离散数据,对于
连续数据的处理能力有限,大大限制了其应用范围,
因而连续属性的离散化是粗集理论中急待解决的问
题。在保证信息系统分辨关系的条件下,采用基数
最小的断点集合对系统进行的离散化就是质量最高
的离散化[1]。目前,粗集中连续属性的离散化方法
多数是监督启发式算法,其中包括利用专家领域知
识进行简化、概念树法、基于等间隔的划分质量期望 值法[2]及传统动态层次聚类算法Is]等。前面几种算
法的缺点在于候选断点的选择缺乏统一理论指导,
没有考虑连续属性在决策中的相关性,从而产生不
合理或者多余的断点。而最后一种算法虽然利用了 决策表的相关性信息,但它寻找断点的算法使用的
是传统聚类分析方法(硬划分),在聚类过程中没有
两阶段模糊c_均值聚类算法及其应用
第36卷第11期2008年11月华中科技大学学报(自然科学版)J.HuazhongUniv.ofSci.&Tech.(NaturalScienceEdition)Vol.36No.11Nov.2008
收稿日期:20070808.作者简介:同小军(1967),男,教授,Email:tongxiaojun1998@.基金项目:湖北省自然科学基金资助项目(2005ABA233,2007ABB030);湖北省优秀中青年科技创新团队计划资助项目;湖北省教育厅重点资助项目(D20081802);武汉工业学院青年基金资助项目(06Q15,06Y23).两阶段模糊c均值聚类算法及其应用同小军曾山欧军万波(武汉工业学院数理科学系,武汉430023)摘要:针对模糊c均值算法对初始值敏感、收敛结果易陷入局部极小值的缺点,提出了两阶段模糊c均值聚类算法.首先通过恰当的贴近度(满足相似相近性)估计分类数,选取初始聚类中心;然后通过模糊c均值算法进行聚类,最后对所得的聚类中心采用逻辑斯谛型的灰色模型进行预测.由于聚类中心具有统计特征,因此较好地克服了样本间的随机误差,灰色逻辑斯谛模型较好地克服了每个样本内误差.采用上述方法对全国30个省市农村居民年收入进行了分析和比较,得出了具有参考价值的结果.关键词:模糊c均值聚类;聚类中心;灰色逻辑斯谛预测模型;随机误差;区域经济分析中图分类号:TP273.4文献标识码:A文章编号:16714512(2008)11007105TwostagefuzzycmeanclusteranditsapplicationsTongXiaojunZengShanOuJunWanBo(DepartmentofMathematicsandPhysics,WuhanPolytechnicUniversity,Wuhan430023,China)Abstract:Fuzzycmeanalgorithmissensitivetothestartingvalueanditsrestrainingresultiseasytofallintothepartialminimum.Thus,twostagefuzzycmeanclusteralgorithmisproposed.Firstthroughtheappropriatesimilarmeasure(satisfiessimilarityandnearness)toestimatetheclassifiednumber,theselectioninitialclustercenter,carriesontheclusteragainthroughthefuzzycmeanalgorithm,finallyusesthegrayLogisticmodeltotheobtainedclustercentertocarryontheforecast.Becausetheclustercenterhasthestatisticalcharacteristic,preferablyovercomerandomerrorbetweenthesamples,ingrayLogisticmodelpreferablyovercomeeachsampletheerror,edtheabovemethodtocarryontheanalysisandthecomparisontothenational30provincesandcitiescountrysideinhabitantyearlyincome.Keywords:fuzzycmeancluster;clustercenter;grayLogisticforecastmodel;randomerror;regioneconomicanalysis1问题的讨论在预测模型中,原始数据一般用观测数据或统计数据来表示,这些数据常受到随机因素的影响,加之人们在认识观测结果、判断观测现象时常使用一些含义不确切的模糊概念,因此观测值具有精确性和模糊性.聚类分析是按某一个标准来鉴别事物之间的接近程度,并把彼此接近的事物归为一类,为进行分析、决策提供依据.在众多分类方法中受到普遍欢迎的是基于目标函数的模糊聚类方法,即把聚类归结成一个带约束的非线性规划问题,通过优化求解获得数据集的模糊划分和聚类.该方法设计简单,解决问题的范围广,还可以转化为优化问题而借助经典数学的非线性规划理论求解,并易于在计算机上实现.基于目标函数的聚类算法即模糊c均值(FCM,fuzzycmeans,其中c表示聚类类别数)聚类算法是由Dunn[1]和Bezdek[2]建立的,其理论最为完善,应用最为广泛.但是该算法中需要确定分类数以及对聚类中心给出估计,关于确定分类数的算法很多[3~5],如何给出一种简单快速的算法还有待进一步探讨.对于聚类中心的估计,则直接关系到是局部最优还是全局最优的问题.由模糊聚类中心的计算可知,聚类中心是该类样本特征的加权平均值,从而具有统计特征,较好地克服了样本间的随机误差.文献[6]给出了一种新型灰色逻辑斯谛预测模型.该模型是建立在数学理论基础之上的,且依据基于数据带有扰动误差.通过该文献的计算实例可发现以下几方面的特点:a.灰色逻辑斯谛模型不仅具有很好的拟合误差和预测效果.b.灰色逻辑斯谛模型计算简单、快速,并且模型不必加权,拟合误差与预测误差均优于其他模型加权的结果.发展农村经济,提高农民收入是我国现代化建设的重要任务.由于传统的生产力布局造成各个地区发展的起点不一致,再加上资源、技术、气候等条件的差异,我国各个省市农村经济发展水平存在一定的差异,为此,本文采用模糊c均值聚类法,按各省市农村居民家庭平均每人纯收入,将那些农村经济发展实际状况相似的地区归为同类,从而克服了省市行政划分的片面性.2两阶段模糊c均值聚类算法按照模糊c划分的概念,把硬聚类的目标函数推广到模糊聚类的情况,即对每个样本与每类原型间的距离用其隶属平方加权,从而把类内误差平方和目标函数扩展为类内加权误差平方和目标函数,基于文献[2]得到了基于目标函数模糊聚类的更一般的描述Jm(U,P)=nk=1ci=1(ik)m(dik)2(m[1,)),(1)式中:m为加权指数(又称为平滑参数);U是划分矩阵[ik]cn;ik是样本k隶属于第i类的隶属度;P是c个聚类中心组成的矩阵.在上述目标函数中,样本k与第i类的聚类原型之间的距离度量的一般表达式定义为dik2=xk-piA=(xk-pi)TA(xk-pi),式中A为SS阶的对称正定矩阵.聚类的准则为取Jm(U,P)的极小值min{Jm(U,P)}.由于矩阵U中各列都是独立的,因此式(1)还可转化为min{Jm(U,P}=minnk=1ci=1ikmdik2=nk=1minci=1ikmdik2,(2)式(2)的极值约束条件为ci=1ik=1.利用拉格朗日乘数法可以求出其解为ik=1cj=1(dik/djk)2/(m-1)(当Ik=时)(3)和pi=1nk=1(ik)mnk=1(ik)mxk,(4)式中:Ik={i|1ic,dik=0},Ik={1,2,,c}-Ik;为空集;ik=0(iIk),且iIkik=1(当Ik时).若c和m值已知,则由min{Jm(U,P)}可确定最佳模糊分类矩阵和聚类中心.这类优化问题可以用迭代算法来求解.根据式(4),容易发现聚类中心的特征是一类中样本特征的加权平均值,具有消除类中各个样本特征数据误差的作用.针对模糊c均值算法对初始值敏感、收敛结果易陷入局部极小值的缺点,本文提出了两阶段模糊c均值聚类算法.2.1第一阶段聚类算法用满足相似相近性的贴近度来选取初始聚类中心及确定聚类数c.考虑到聚类的内涵既包含相近(距离等方面)又包含相似(特征的一致性)的意义,采用文献[7~10]建立贴近度minni=1|B(xi)-kA(xi)|p1/p,kR,式中:A和B为模糊集;p=2时,上述问题取得最小值时的相关度k=AB(xi)AB(xi)/2AB(xi),即为2个模糊集A与B的贴近度.该贴近度融合了2个模糊集合的相似特性.不难将其推广到2个序列的相关度为k=max{ai,bi}min{ai,bi}/(max{ai,bi})2.在计算序列的贴近度前要对数据进行无量刚化处理.本阶段确定聚类类别c(2cn)和初始化分类矩阵U(0).72华中科技大学学报(自然科学版)第36卷2.2第二阶段聚类算法a.由给定的聚类类别c(2cn)和样本数据个数n,设定迭代停止阈值,初始化分类矩阵U(0),设置迭代计数器b=0,利用式(3)计算或更新划分矩阵[ik]cn.b.利用式(4)更新聚类聚类中心矩阵P(b+1).c.若P(b)-P(b+1)<,则停止运算并输出划分矩阵U和聚类中心矩阵P,否则令b=b+1,转步骤a循环计算.由以上算法可见,整个计算过程是反复修改聚类中心和分类矩阵的过程.实例证明改进后的算法收敛性大大提高,且避免了陷入局部极小值的缺点.由此得到分类以及每类的聚类中心,基于这些聚类中心建立预测模型,一方面可使计算量小,另一方面因聚类中心是加权平均的,故对样本间误差有一定的消除作用.3逻辑斯谛型的灰色预测模型基于文献[6]给出如下灰色逻辑斯谛模型.令原始数据为y(0)(i)>0(i=1,2,,n),并对于y(0)采用倒数变换进行生成处理,即令x(0)(i)=1/y(0)(i)(i=1,2,,n).对x(0)=(x(0)(1),x(0)(2),,x(0)(n))进行如下处理x(0)(k)-2x(1)(k)=h2(x(1)(k)+x(1)(k+1))+h3k+h4,式中:系数h2=-ea,h3和h4是随具体情况待定的参数.或利用x(0)(k)-x(1)(k)=h2x(1)(k+1)+h3k+h4f(k)+h5进行处理,式中:h2=-e2a;h5是随具体情况待定的参数;f(k)=(1+(-1)k-1)/2.灰色逻辑斯谛模型的计算方法如下.A.令原始数据为y(0),并对y(0)采用上述的倒数变换处理.B.a.对于具有绝对误差的原数据序列x(0)={x(0)(1),x(0)(2),,x(0)(n)},一般利用下述方程组的最小二乘解:x(1)(2)+x(1)(3)21x(1)(3)+x(1)(4)31x(1)(n-1)+x(1)(n)n-11h2h3h4=x(0)(2)x(0)(3)x(0)(n-1)-2x(1)(2)x(1)(3)x(1)(n-1),再根据h2=-ea,解得参数a,称为型法.b.对于具有相对误差的原数据序列x(0)={x(0)(1),x(0)(2),,x(0)(n)},一般利用下述方程组的最小二乘解x(1)(3)x(1)(4)x(1)(n)23n-110f(n-1)111h2h3h4h5=x(0)(2)x(0)(3)x(0)(n-1)-x(1)(2)x(1)(3)x(1)(n-1),再根据h2=-e2a,解得参数a,称为型法.c.当原数据序列x(0)较少时,a和b中的最小二乘解方程组应考虑原数据x0(1)的影响.因为在数据较少的情况下,尽管x0(1)和x1(1)相等,但x0(1)所代表的信息不能略去.例如,对于b,其最小二乘解方程组为x(1)(2)x(1)(3)x(1)(n)12n-110f(n-1)111h2h3h4h5=x(0)(1)x(0)(2)x(0)(n-1)-x(1)(1)x(1)(2)x(1)(n-1).对于上述3种情况,解得参数a后,利用x(0)(k)=be-ak+c通过线性拟合得到参数b和c.从而,得还原模型为y^(0)(k)=1/(c+be-ak).(5)4两阶段聚类模型在农村区域经济分析中的应用对全国30个地区农村人均经济收入建立灰色逻辑斯谛预测模型.具体算法如下.依据国家统计局网站上公布的我国12a来各地区农村居民家庭平均每人每年纯收入数据(/tjsj/ndsj/2005/indexch.htm)进行分类.首先对各地区平均每人纯收入时间序列采用贴近度来初始分类及确定聚类类别c.取贴近度rij0.96,将30个地区粗分为5类.第1类:北京,上海,浙江;第2类:天津,江苏,福建,广东;第3类:山西,内蒙古,辽宁,黑龙江,江西,湖北,湖南,吉林,海南,四川,河北,山东,河南;第4类:安徽,广西,贵州,云南,陕西,甘肃,宁夏,青海,新疆;第5类:西藏.73第11期同小军等:两阶段模糊c均值聚类算法及其应用
改进的初始中心与隶属度函数的模糊C-均值算法
第13卷第1期 重庆科技学院学报(自然科学版) 2011年2月
改进的初始中心与隶属度函数的模糊C一均值算法
万 龙
(重庆大学,重庆400030)
摘要:针对模糊C一均值(FCM)算法对初始中心敏感的缺点,通过选取离均值最远的点作为初始聚类中心的方法.提 出了一种基于均值距离的初始中心选取算法,同时由于远离各类聚类中心的野值样本会影响迭代结果.通过改变隶 属度函数来克服这种缺陷。然后选取有代表性的样本作为实验数据集进行实验,通过实验得出.与传统的FCM算法 比较,改进的FCM算法可以得到更高的准确率,实验证明了改进算法的有效性和优越性。 关键词:模糊C一均值;初始中心;隶属度函数;聚类中心 中图分类号:0159 文献标识码:A 文章编号:1673—1980(2011)0l一0178—03
聚类分析作为一种非监督学习方法。是机器学
习领域中的一个重要的研究方向。在聚类分析中, 模糊C一均值(FCM)聚类算法是最重要的模糊聚类算 法之一,被广泛应用于特征分析、模式识别、图像处 理、分类器设计和聚类等等…。
FCM算法就是反复修改聚类中心和隶属度矩阵 的过程,因此也称为动态聚类。FCM算法从任意初始 点开始。沿着一个迭代子序列收敛到目标函数的局 部极小点。但该算法存在着一些不足【2I: (1)算法的性能依赖于初始聚类中心和初始隶
属度函数的选取。 (2)事先必须确定聚类的个数。 (3)模糊指标的选择。 (4)收敛到局部极值问题。 针对这些问题,很多学者进行了研究。文献采
用贪心算法选取有代表性的点作为初始中心,提出
一种基于权重的初始中心点选取算法。得出了优化 聚类初始中心的模糊C一均值方法;文献f31采用一种 改进的最大最小距离算法对原始空间中的数据进行 粗分类,将粗分类结果中每类类心作为初始聚类中
心,再运用核C一均值聚类算法进行分类;文献[4】针对 隶属度归一化可能引起结果偏差的问题。通过改进 隶属度函数。为每个样本点赋予一个定量的权值,来 构造加权的目标函数;文献f5】通过加入点密度加权 系数和特征矢量权重,提出一种具有两阶段的模糊 FCM聚类改进算法;文献[6】提出了一种将自适应策
模糊聚类实现鸢尾花(iris)分类实验报告
模糊聚类实现鸢尾花(iris)分类实验报告
实验报告:模糊聚类实现鸢尾花(iris)分类
一、实验目的
本实验旨在通过模糊聚类算法对鸢尾花(iris)数据集进行分类,并比较其分类效果与传统的硬聚类算法。
二、实验原理
模糊聚类是一种基于模糊集合理论的聚类分析方法。与传统的硬聚类算法不同,模糊聚类能够为每个样本赋予一个隶属度,表示该样本属于某个簇的程度。常用的模糊聚类算法包括模糊C-均值聚类(FCM)和概率模糊C-均值聚类(PFCM)。
三、实验步骤
1. 数据准备:加载鸢尾花数据集,将数据分为特征和标签两部分。
2. 数据预处理:对特征数据进行归一化处理,使其满足模糊聚类的要求。
3. 构建模糊矩阵:根据给定的模糊参数,构建模糊矩阵。 4. 执行模糊聚类:使用模糊聚类算法对数据进行聚类,得到每个样本的隶属度矩阵。
5. 分类结果输出:根据隶属度矩阵和阈值,将样本分为不同的类别。
6. 评估分类效果:计算分类准确率、召回率等指标,评估分类效果。
四、实验结果
以下是使用模糊C-均值聚类算法对鸢尾花数据集进行分类的结果:
样本 实际类别 预测类别 隶属度
1 setosa setosa
2 versicolor versicolor
3 virginica virginica
... ... ... ...
150 setosa setosa
151 versicolor versicolor
152 virginica virginica
通过观察上表,我们可以发现大多数样本被正确地分类到了所属的类别,且具有较高的隶属度。具体分类准确率如下:setosa: 97%,versicolor: 94%,virginica: 95%。可以看出,模糊聚类算法在鸢尾花数据集上取得了较好的分类效果。
五、实验总结
本实验通过模糊聚类算法对鸢尾花数据集进行了分类,并得到了较好的分类效果。与传统硬聚类算法相比,模糊聚类能够为每个样本赋予一个隶属度,更准确地描述样本属于各个簇的程度。因此,在某些情况下,模糊聚类算法能够更好地处理具有重叠区域的分类问题。但需要注意的是,模糊聚类算法也存在着一定的参数敏感性,例如模糊参数的选择对聚类结果影响较大。因此,在实际应用中,需要根据具体问题选择合适的参数。
一种基于自适应蚁群算法的数据关联方法
2012年第31卷第8期 传感器与微系统(Transducer and Microsystem Technologies) 27
一种基于自适应蚁群算法的数据关联方法
张波雷,许蕴山,夏海宝
(空军工程大学工程学院,陕西西安710038)
摘要:针对跟踪中多目标数据关联问题,在蚁群数据关联(ACDA)算法的基础上,提出了一种自适应蚁 群数据关联方法,通过对转移概率和信息素持续度的自适应调整,改进了全局信息素更新,有效地避免了 陷人局部最优问题。仿真实验证明:该算法在解决多目标数据关联问题上是行之有效的。 关键词:多目标跟踪;蚁群数据关联;蚁群算法 中图分类号:TP 391 文献标识码:A 文章编号:1000-9787(2012)08-0027-03
A data association method based on adaptive ant
colony algorithm
ZHANG Bo—lei,XU Yun-shan,XIA Hai—bao (Engineering College,Air Force Engineering University,Xi’an 710038,China)
Abstract:Aimed at the problem of multi—target data association in tracking,an adaptive ant colony data association(ACDA)method Oil the basis of ACDA is proposed.This algorithm improves global pheromone refreshment and avoids failing in to problem of local optimization by adaptively adjust the transition probability and the pheromone adherence.The simulation results show that this algorithm is effective on solving the data association problem of multi—target. Key words:muhi—target tracking;ant colony data association(ACDA);ant colony algorithm
一种改进的模糊C-均值聚类算法
一种改进的模糊C-均值聚类算法
曹易;张宁
【摘 要】由于现有模糊C-均值聚类算法固有的局限性,本文提出了一种改进的模糊C-均值聚类算法.首先用概率密度函数来确定初始聚类中心点和聚类数,其次用竞争学习思想提出使对手增加抑制因子来修改隶属度得到加快收敛速度的效果,最后提出用一个类内差异与类间差异兼备的新的有效性指标来作为迭代条件的目标函数.通过实验获取参数的最优取值范围,通过与经典模糊C-均值聚类算法的比较,证明了该改进算法不仅加快了收敛速度,而且在聚类结果的质量上有一定程度的提高.%The fuzzy C-means algorithm was improved to break through the
existing performance limitations. The function of probability consistency
was used to determine the original clustering center and the clustering
number. For each object an inhibitory factor was added to its opponent to
accelerate the convergence. A new validity index which takes a balance
between intra-clustering and inter-clustering variation was proposed to act
as the aim function. Experiments show that the improved algorithm
behaves comparatively higher performance in convergence speed and
clustering quality.
【国家自然科学基金】_模糊c均值聚类算法_基金支持热词逐年推荐_【万方软件创新助手】_20140802
序号科研热词推荐指数序号科研热词1模糊c均值聚类101模糊c均值2图像分割72模糊聚类3模糊聚类53模糊c均值聚类4模糊c均值44图像分割5模糊c-均值聚类35聚类分析6遗传算法26聚类7聚类有效性27聚类有效性8空间信息28模糊c均值算法9模糊c均值算法29文化算法10鲁棒性110鲁棒性11高斯混合模型111颜色空间12高斯核函数112非线性建模13隶属度113非线性14降水预报114隶属度函数15邻域灰度差115阈值16递归最小二乘算法116闻值分割17路口群落117铜闪速熔炼18距离118铁谱技术19说话人识别119配电快速仿真与模拟20语音情感识别120邻域信息21视频对象分割121遥感图像22自动文摘122遥感23聚类算法框架123遗传算法24聚类数124逆系统方法25网格125连续型属性26纹理分割126记忆效应27粒子群算法127记忆克隆28粒子群优化128视频29神经网络集成129规则提取30矢量量化130行为模型31特征加权131蚁群算法32灰度特征132色差检测33泛化能力133自适应模糊神经推理系统34模糊神经网络134自适应35模糊神经元网络135自底向上36模糊核c-均值算法136聚类算法37模糊控制137聚类有效性指标38模糊成员函数138聚类中心39模糊c均值聚类算法139网格40模糊c-均值算法140缺陷模型41核函数141线性判别分析42最小邻域算法142簇的调整43最小二乘曲面拟合143离群点44无标定显微视觉伺服144磨粒45方向分形维145电热老化46支持向量机146电容层析成像47性别规整147特征提取48径流预测148流型识别49差异化特征149洪水过程50工程管理150油纸绝缘51层次聚类151模糊颜色直方图52尖锐特征152模糊聚类分析2008年2009年53小波神经网络153模糊理论54密度154模糊关联分类55密写155模糊c均值聚类算法56基于距离的聚类156模糊c均值聚类(fcm)算法57基于密度的聚类157模糊c均值(fcm)58图象分割158模糊c-均值聚类59图像雅可比矩阵159模糊60图像的空间信息160模块化模糊神经网络61噪声估计161核方法模糊c均值聚类62变化检测162核函数的模糊c均值算法63双边滤波163核函数主元分析64去噪164权重65卫星云图分类165有监督学习66半监督fcm166最优划分67区间型数据167暴雨预报68区域粗糙度168智能电网69加权模糊c均值聚类169新的模糊c均值算法70加权170数据驱动71切比雪夫多项式算法171数据挖掘72分水岭变换172数据分类73减法聚类173数值预报产品74内容信任174敏感度分析75入侵检测175支撑向量回归76信息融合176支持向量机77信任文摘177操作模式优化78人眼视觉特性178操作模式79二型模糊系统179指纹80与文本无关180抗噪性81三维点云数据181感兴趣区域(roi)82三粒子群182微粒群算法83ⅱ型模糊逻辑系统183彩色图像84voronoi cell184异常检测85mr图像分割185并行分布计算86mri分割186嵌入式系统87laws纹理测度187属性权值88k均值算法188局部空间信息89hsi颜色空间189局部放电90fcm聚类190小波包能量熵91em算法191密度92broyden方法192子空间93bp算法193多agent系统94基于内容的图像检索95地球站行为96图像语义分类97图像灰度纠正98图像处理99因子分析100含噪数据101各向异性权重102可调节产品族103变化检测104双层机构105半监督学习106区间属性数据
fcm模糊聚类算法中加权指数
fcm模糊聚类算法中加权指数
FCM模糊聚类算法中加权指数是用来平衡不同特征或维度之间的权重,以避免某些特征或维度主导聚类结果的情况。加权指数通常表示在计算样本点之间距离或相似度时,对每个特征或维度进行加权,通过控制加权指数的大小,可以对特定维度的重要性进行调整。
FCM模糊聚类算法中加权指数通常由用户或领域专家指定,或者根据特征或维度的方差或信息熵等特征量进行自适应调整。在FCM模糊聚类算法中,加权指数通常通过将样本点之间距离或相似度的权重矩阵乘以加权指数矩阵来实现。常用的加权指数包括线性加权、指数加权、对数加权等。
通过使用加权指数,FCM模糊聚类算法可以更加精确地对不同特征或维度进行建模,从而获得更高的聚类效果。但同时,加权指数的选择也需要根据应用场景和数据特征进行谨慎选择,否则可能会导致聚类结果的偏差和不准确性。
距离修正的模糊C均值聚类算法
距离修正的模糊C均值聚类算法
摘要:经典的模糊c均值算法基于欧氏距离,存在等划分趋势的缺陷,分错率较高,只适用于球形结构的聚类。针对这一问题,利用数据的点密度信息,在数据点与聚类中心的距离度量中引入了调节因子,提出了一种基于密度的距离修正矩阵,并用其代替经典模糊c均值算法中的距离度量矩阵。通过人造数据集和uci数据集的两组聚类实验,证实了改进算法对非球形结构的数据同样适用,且相比经典的模糊c均值算法具有更高的聚类准确率。
关键词:聚类;模糊c均值;距离度量;点密度;调节因子
improved fuzzy c-means clustering algorithm based on
distance correction
英文作者名lou xiao-jun1*, li jun-ying1, liu hai-tao1,2
英文地址(1.shanghai institute of microsystem and
information technology, chinese academy of sciences,
shanghai 200050, china;
2.wuxi sensingnet industrialization research institute,
wuxi jiangsu 214135,china)
abstract: based on euclidean distance, the classic fuzzy
c-means (fcm) clustering algorithm has the limitation of
equal partition trend for data sets. and the clustering
accuracy is lower when the distribution of data points is not
