经典多属性决策算法对比分析
算法分析
1. TOPSIS(逼近理想解法):(TOPSIS方法属于经典的多属性决策方法之一,由H.wang.C.L和Yoon,K.S.1981提出).
基本原理:根据评价指标的标准化值与指标的权重共同构成规范化矩阵来确定评价指标的正、负理想解。然后,建立评价指标综合向量与正、负理想解之间距离的二维数据空间。在此基础上对评价方案与最优理想参照点之间的距离进行模糊评判。最后,依据该距离的大小对评价方案进行优劣排序. 若某方案为最优方案则此方案最接近最优解,同时又远离最劣解.
TOPSIS法最大的优点是:无严格限制数据分布及样本含量指标的多少,小样本资料、多评价单元、多指标的大系统资料都同样适用,同时也不受参考序列选择的干扰。既可用于多单位之间进行对比,也可用于不同年度之间对比分析,该法运用灵活,计算简便同时结果量化也客观[1]。
缺点:(1)规范决策矩阵的求解比较复杂,故不易求出理想解和负理想解;(2)评价缺少稳定性,当评判的环境及自身条件发生变化时,指标值也相应会发生变化,就有可能引起理想解和负理想解向量的改变,使排出的顺序随之变化,评判结果就不具有唯一性;(3)属性权重是事先确定的,其主观性较强。[2]
基本步骤:
○1建立多属性决策问题的决策矩阵
○2 决策矩阵的规范化处理
常见的标准化处理方法有:模糊数学法、标准差标准化法、极差标准化法、极大值标准化法和百分比标准法等.
○3 构建加权规范化矩阵
确定权重的方法有主观赋权法和客观赋权法。主观赋权法包括层次分析法、Delphi法等。主观权重法土要根据专家判断打分,主观性太强,其结果对多因素非线性定量关系的反映有一定影响:客观权重法人为因素干扰较小,可以较为客观地确定权重,但该方法也受样本数据数量和质量的制约。权重确定的方法:主成分分析法、变异系数法。
○4确定正理想点和负理想点
所谓正理想点是设想得到的最好的解,它的各个指标值都达到各候选方案中最好的值。而负理想点是另一设想的最坏的解,它的各个指标都达到各候选方案中最坏的值。
○5计算各方案到正负理想点的距离
○6计算各方案与理想点的相对贴近度,相对贴近度的取值越大则表示该方案越优。贴近度的计算公式为:[3]
TOPSIS方法对属性、数据没有严格要求,能充分运用原始数据,且过程简单,但该方法涉及到的理想解、负理想解是跟方案的原始数据相关的,一旦方案的原始数据或者是方案的数目发生变化,则理想解、负理想解也会发生变化,最终导致排序的不稳定[4]。
2. PROMETHEE(偏好顺序结构评估法): Brans、Vincke(1984)提出了PROMETHEE(Preference Ranking Organization Method for Enrichment
Evaluations)的方法。
其中PROMETHEE比ELECTRE更具有优势: (1)PROMETHEE它能够更好的运用函数来解释和描述每项准则的特点; (2)相对于ELECTRE, PROMETHEE的结果更具有稳定性,并且在新加入供应商时,出现倒序的几率较小。但是这两种重要的排序方法都不能对指标的权重进行计算。PROMETHEE是基于方案的两两比较的一种多目标决策方法,它是建立在级别高于关系上的排序方法。该方法不需要对指标进行无量纲化和规范处理,从而避免了处理过程中的信息偏差,但是对问题的结构化分析上不及AHP。该方法为决策者提供一组可行方案的部分优先关系((PROMETHEEⅠ)和完全优先关系(PROMETHEEⅡ)[4]。
PROMETHEE没有具体给出如何确定权重的方法,需要决策者根据实际问题自己确定产生权重的方法。这对于缺乏相关经验的决策者来说是一项比较困难的工作。
该方法的应用步骤: ○1确定每个指标的优先函数,优先函数的概念就是在某一指标下,对象Ai优于另一个对象Ar的程度。这里分为效益性指标和成本型指标。
在实际的应用中,一般使用推荐的6种类型的一般性准则来构造优先函数,决策者可以根据自身的偏好结合实际要求为每个指标选择优先函数。
○2确定指标或者准则的相对重要性Wj(权重)。
○3确定优先指数,多准则优先指数定义为:
○4确定每个对象的流出。定义为:
○5确定每个对象的流入,定义为:
言,其值越小,此对象越好。
通过计算我们可以得到方案的流出量、流入量,根据流出量越大越优、流入量越小越优我们可以得到方案的排序,但此时得到只是方案的部分优先关系,运用PROMETHEEⅡ则可以得到方案的完全优先关系。
[4].
3. ELECTRE:是法国人ROY(1971)年首先提出的,该方法构建的是一种较弱的次序关系,叫级别高于关系。
定义3.4.1(级别高于关系)给定方案集A,Ak,Al∈A,给定决策人的偏好次序和属性矩阵M=(xij)m×n,当人们有理由相信Ak≥Al,则称Ak的级别高于Al[4]。
算法应用步骤:
○1用向量规范化的方法构造规范化矩阵:
○2构造加权规范化矩阵V=(vij)m×n
○3确定属性的优势集和劣势集
○4计算优势矩阵
在计算优势矩阵时,首先需要定义一个优势指数Ckl′,亦称和谐指数。这里反映了决策者接受方案Ak的满意度的测试。
确定了优势指数后,就可以确定优势指数矩阵了:
○5计算劣势矩阵
首先定义一个劣势指数dkl,亦称不和谐指数。可与Al方案相比,选择Ak的不满意度测试。
确定了劣势指数后,就可以确定了劣势指数矩阵了
○6确定优势判定矩阵
确定优势判定矩阵即为确定满意测度的大小,首先确定阈值C_。C_的判定可以由分析人、决策人商定,也可由平均优势指标代之,
○7确定劣势判定矩阵为确定不满意测度的大小,确定阈值d_(和谐性检验,不和谐测定是在某个可允许的最大的不和谐性水平之下)。d_的判定:
○8综合优势判定矩阵
优势矩阵和劣势矩阵都确定了之后,就可以确定综合优势判定矩阵E了,E={ekl}—根据E。即可开始方案的剔除过程。
○9剔除方案
满足以下方案,则不被剔除。
注意:在应用上式时较困难,因此在具体应用时,可观察E,从E进行直观分析,剔除方案即为:若任何一列上只要有一个元素为1,则该对应方案剔除,因为这意味着该列方案为1的元素,被对应的行方案“压倒”。 ELECTRE法的优点是决策人易理解掌握,并且可将具体决策计算过程程序化。但其存在对决策矩阵所提供的信息利用不充分、参数设定过于复杂、参数值不一定具有明显的经济意义、所得部分序内容较少等缺点[5]。
三种方法都不可以计算指标权重,所以如果想组合使用的话,可以利用FAHP计算权重,然后选择这三种方法中的一种来计算方案排序。该方法没有给出如何确定权重的方法,只能部分排序,因此只适合对于方案的初步筛选。
[1]基于TOPSIS模型的城市土地集约利用评价研究--以重庆市南岸区为例 人文地理学专业硕士研究生李丽 指导教师廖和平教授
[2] 基于TOPSIS的建筑业施工安全信用评价研究
[3] 基于TOPSIS的电厂脱硫技改方案选择方法研究
[4] 李维, "基于多属性决策方法的评价及灵敏度分析,". vol. 硕士: 东华大学,
2008.
[5] 周艳春, "基于定性模拟的渠道关系分析方法研究,". vol. 博士: 哈尔滨工业大学, 2010.
CathyMacharis, Johan Springae,l KlaasDe Brucker, et a.l.
PROMETHEE and AHP: the design of operational synergies in
multicriteria analysis. strengthening PROMETHEE with ideas ofAHP[J].
European Journal ofOperationalResearch, 2004, 153(2): 307-317. :对比分析了AHP与PROMETHEE不同方面的优点
AHP 可以充分利用了专家的特长,并反映了决策者的偏好。
群组决策的权重自适应调整算法
群组决策的权重自适应调整算法
冯源;宋词
【摘 要】针对多属性群组决策问题,文章提出一种专家权重与属性权重互调的自适应调整算法。经过实验对比分析发现,不考虑属性权重的排序结果和经过自适应算法得到的排序结果有一定差异,但只在局部起作用。这充分表明了专家权重与属性权重之间相互关联又相互制约的关系。
【期刊名称】《太原学院学报:自然科学版》
【年(卷),期】2017(035)003
【总页数】7页(P30-35,39)
【关键词】群组决策;基尼系数;自适应算法;属性权重;专家权重
【作 者】冯源;宋词
【作者单位】太原师范学院,山西晋中030619
【正文语种】中 文
【中图分类】TP181
引言
随着社会进入信息爆炸时代,决策问题早已由单一发展为群组决策,所面临的决策问题也渐渐复杂。因此仅凭个人的经验和知识已经很难在众多方案中做出合理决策,必须依靠集体的智慧进行全面分析。群组决策是多学科的交叉学科,它包含管理、数学、计算科学等等。由于待决策问题的属性权重和专家权重对决策结果都起着至关重要的作用,因此合理地为专家和属性赋权是解决决策问题的关键步骤。
属性赋权法和专家赋权法都可归纳为三大类,即主观赋权法、客观赋权法和组合赋权法。近几年,有学者采用自适应调整的算法来实现属性与专家的赋权,这类算法首先给予权重的初始值以及阈值,然后自动地进行调整,并比较每次的排序结果,当结果达到一定平衡状态或收敛于足够小的邻域时算法结束。针对权重自适应调整这一类算法国内学者已做了一些工作。刘业政等人[1]首先计算个体决策,然后与群体决策结果进行比较,并由偏离程度来为专家赋权,同时采用熵权系数法产生属性权重,以属性权重为新的启动值,再计算个体与群体的决策结果。比较相邻两次的群体结果,确定是否继续调整。另外刘业政、姜元春等人又将模糊距离和神经网络运用到自适应调整中[2],并在专家赋权方案中加入了扰动策略以保证算法收敛。王俊英、李德华等人[3]运用了关联分析针对个体与群体判断序列的关联度,对专家赋权采用了自适应调整,群体决策结果趋于稳定算法结束。为了维护动态专家权重信息库,他们还提出基于TOPSIS法和灰色关联度的专家赋权算法[4],仍属于自适应算法。孙义、黄海峰等人[5]认为属性权重一旦确定就不宜更改,因此,首先对属性权重进行目标规划,确定属性权重后不再改变,一些计算个体决策与群体决策的灰色关联度,由关联度得到专家权重,并进行调整。另外他们在“多属性群决策权重调整自适应算法”[6]文章中优化算法确定属性权重,再根据个体与群体决策的灰色关联度对专家权重进行调整,比较相邻两次的二阶Minkowski距离,决定迭代是否停止。上述赋权方法都比较好地解决了专家与属性的权重分配,但其主要研究集中于个体决策与群体决策结果的差异,较少考虑权重分配对方案排序结果的影响。因此,本文提出根据基尼系数来对权重进行调整的方法。
机器学习10大经典算法详解
机器学习10⼤经典算法详解
本⽂为⼤家分享了机器学习10⼤经典算法,供⼤家参考,具体内容如下
1、C4.5
C4.5算法是机器学习算法中的⼀种分类决策树算法,其核⼼算法是ID3算法. C4.5算法继承了ID3算法的优点,并在以下⼏⽅⾯
对ID3算法进⾏了改进:
1)⽤信息增益率来选择属性,克服了⽤信息增益选择属性时偏向选择取值多的属性的不⾜;
2)在树构造过程中进⾏剪枝;
3)能够完成对连续属性的离散化处理;
4)能够对不完整数据进⾏处理。
C4.5算法有如下优点:产⽣的分类规则易于理解,准确率较⾼。其缺点是:在构造树的过程中,需要对数据集进⾏多次的顺
序扫描和排序,因⽽导致算法的低效。
2、The k-means algorithm即K-Means算法
k-means algorithm算法是⼀个聚类算法,把n的对象根据他们的属性分为k个分割,k < n。它与处理混合正态分布的最⼤期望
算法很相似,因为他们都试图找到数据中⾃然聚类的中⼼。它假设对象属性来⾃于空间向量,并且⽬标是使各个群组内部的均
⽅误差总和最⼩。
3、Support vector machines⽀持向量机
⽀持向量机(Support Vector Machine),简称SV机(论⽂中⼀般简称SVM)。它是⼀种监督式学习的⽅法,它⼴泛的应⽤
于统计分类以及回归分析中。⽀持向量机将向量映射到⼀个更⾼维的空间⾥,在这个空间⾥建⽴有⼀个最⼤间隔超平⾯。在分
开数据的超平⾯的两边建有两个互相平⾏的超平⾯。分隔超平⾯使两个平⾏超平⾯的距离最⼤化。假定平⾏超平⾯间的距离或
差距越⼤,分类器的总误差越⼩。⼀个极好的指南是C.J.C Burges的《模式识别⽀持向量机指南》。van der Walt和Barnard
将⽀持向量机和其他分类器进⾏了⽐较。
4、The Apriori algorithm
Apriori算法是⼀种最有影响的挖掘布尔关联规则频繁项集的算法。其核⼼是基于两阶段频集思想的递推算法。该关联规则在分
决策树的经典算法:ID3与C4.5
第17卷第5期 四川文理学院学报(自然科学) 2007年9月 Vo1.17 No.5 Sichuan University of Arts and Science Journal(Natural Science Edition) Sep.2007
决策树的经典算法:ID3与C4.5
黄 文
(1.西南石油大学理学院,四川成都610500;2.西南财经大学统计学院,四川成都610074)
【摘要】决策树各类算法,各有特点,其中J.R.Quinlan提出的ID3算法最具代表性,在国际上的影响 也最大,c4.5算法就是在ID3算法基础上进行改进得到的。通过对两种算法详细描述,阐明了决策树算 法步骤及其主要思想。 ’【关键词】ID3;c4.5;信息增益;信息增益率;剪枝
[中图分类号】024 [文献标识码】A [文章编号】1008—4886(2007)05—0016—03
1 ID3算法和CA.5算法的提出 决策树起源于概念学习系统CLS(concept learning system)。CLS最早由Hunt.E.B等人于1966年提出,并 首次用决策树进行概念学习,后来的许多决策树学习算法 都可以看作是CLS算法的改进与更新。CLS的主要思想 是从一个空的决策树出发,通过添加新的判定节点来完善 原有的决策树,直到新的决策树能够正确地将训练实例分 类为止。 Quinlan于1986年提出的ID3(herative Dichotomizer 3)算法是决策树算法的代表,…在此之后的多种决策树算 法都是在ID3算法的基础上加以改进而实现的。它在选 择决策树各级节点上的属性时,其选择标准是选用最大信 息增益的属性,这就使得在每一个非叶节点上进行测试 时,能获得关于被测试记录最大的类别信息。具体方法 是:检测所有的属性,选择信息增益最大的属性作为决策 树节点,由该属性的不同取值建立分支,再对各分支的子 集递归地凋用该方法建立决策树节点的分支,直到所有子 集仅包含同一类别的数据为止。最后找出属性和类别间 的关系,得到一棵决策树,用它来对新的样本进行分类。 ID3算法具有理论清晰、方法简单、学习容易、分类速度快 的优点。但ID3算法只能处理属性取值为离散的数据。 在ID3算法的基础上演变,Quinlan.J.R在1993年提 出了c4.5算法。这种算法相比ID3算法,其计算复杂度 更低,计算效率得到了提高。它对于ID3算法的重要改进 是使用信息增益率来选择节点属性 理论和实验表明,采 用信息增益率比采用信息增益更好,以信息增益最大为标 准,更倾向于选择分类较多的属性,因为分类较多的属性 对应的信息增益较大,而采用信息增益率作为选取节点的
一种多值属性和多类标数据的决策树算法
第33卷
Vo1.33 第13期
No.13 计算机工程
Computer Engineering 2007年7月
July 2007
・软件技术与数据库・ 文章编号:10o 一3428(2007)1,一J087- 3 文献标识码:A 中图分类号:TP311.5
一种多值属性和多类标数据的决策树算法
赵蕊。李宏
(中南大学信息科学与工程学院,长沙410083)
摘要:提出了一种多值属性和多类标数据的决策树算法(ssc),在MMC算法中,对用孩子结点的类标集相似度来评定结点属性分类效 果的计算方法进行了改进,综合考虑集合的同一性和一致性,提出了相似度评定方法,使类标集相似度的计算更加全面和准确。实验证明
该算法的分类效果优于MMC算法。 关翻:分类;决策树;多值属性;多类标数据;相似度
Algorithm of Multi・-valued Attribute and Multi・-labeled Data Decision Tree
ZHAo Rui.LI Hong
(School of Information Science and Engineering,Central South University,Changsha 410083)
[Abstract]This paper develops a decision tree classifier SSC(similarity of same and consistent)for multi—valued and multi—labeled data,improves on MMC’S formula for measuring the similarity of label—sets to determine the goodness of splitting attributes.It proposes a new measure approach
决策树分类算法的分析和比较
科技情报开发与经济 SCI—TECH INFORMATION DEVELOPMENT&ECONOMY 2008年第l 8卷第2期 文章编号:l005—6033(2008)02—0065—03 决策树分类算法的分析和比较 刘莺迎 (郑州大学信息管理系,河南郑州,450001) 摘要:在数据挖掘中存在多种算法,决策树分类算法是应用比较多的一种。基于决策 树分类算法的研究现状,对各种决策树分类算法的基本思想进行了阐述,并对不同的 算法进行了分析和比较。 关键词:决策树分类算法;ID3;后剪枝;GIN1系数 中图分类号:TP274:TP31 文献标识码:A 1决策树分类算法的发展 基于决策树的分类算法自提出至今,种类不下几十种。各种算法在 执行速度、可扩展性、输出结果的可理解性,分类预测的准确性等方面各 有干秋。 决策树分类算法的发展分如下几个阶段:首先,1966由Hunt.E.B等 人提出了CLS(Concept Learning system)学习算法。这是第一次提出片j决 策树进行概念学习,随后出现的ID3算法采用信息熵原理选择测试属性 收稿日期:2007—12—28
分割样本集,只能处理具有离散型属性和属性值齐全的样本,生成形如 多叉树的决策树。后来出现的c4.5算法经过改进,能够直接处理连续型 属性,也能够处理属性值空缺的训练样本。针对ID3系列算法和c4.5系 列算法生成决策树分枝较多、规模较大的问题,叉出现了根据GINI系数 来选择测试属性的决策树算法,使得生成的决策树可以是结构简单、易 于理解的二叉树。大多数决策树算法都采用后剪枝策略,但它策略明显 存在将已经生成的分枝再剪去的重复劳动,降低了决策树的生成效率, 因此出现了以PuBuc算法为代表的预剪枝决策树算法。随后,为了增 …●●● 人力资源强国,教育则是增加人力资源含金量的重要途径。 动。 我国目前农业劳动生产率与土地投入产出率的双重低下,一个不容 3.4农业部门要建立农业数字信息资源中心 掩盖的原因就是农民综合素质的先天发育不足与后天优化滞后,表现在 科技文化素质、思想心理素质、组织协调素质、市场竞争素质等多个层 面,因此,现代农民的培养是现代农业发展不可或缺的人力资本支撑。潜 在人力资源向现实人力资源的转化,一般是一定的主体对其资源性质进 行认识和作出使用的决策,这就是人力资源的发掘过程。 3-3通过教育提高人的“能力” 所谓“能力”,是指人们顺利实现某种活动的心理条件。研究人力资 源,根本目的是为了运用“人”的这种能力。从现实应用的形态看,能力要 素包括体力、智力、知识、技能4部分。体力、智力、知识、技能四者的不同 组合,形成人力资源多样化的丰富内容。人力资源拥有的体力、智力、知 识和技能,使其具有推动物质资源的各种具体能力。作为政府,对农民采 取“授人以鱼,不如授人以渔”,教其学会l~2门实用技术和技能,不断提 高其综合素质,提升就业技能增强其在就业能力和在市场巾的竞争能 力,唯有培养农民创造性的适应能力,才能够在这千变万化的市场部分 中维持自己,立于不败之地。 大力开展远程教育,提高农民接受文化、科技、信息的能力。远程教 育和培训的优势就在于不受时空限制,通过远程教育平台,可推动农业 科技成果的转化吸收,培训出有文化、懂技术、会经营的新型农民。进而 大大减轻了农民进城学习的负担,同时又推动城市教育资源向农村流 信息资源是整个农村信息服务体系的基础及核心,为了进一步提高 农村信息资源的实用性,省农业部门应牵头各涉农单位配合以整合资 源、避免重复、协调发展、实施共享为立足点和出发点,充分发挥农口部 门信息资源优势,农业部门与各级政府合作,组织实施全省农业数字信 息资源共享_T程,建立全省新农村信息资源中心,从而实现“数字化农业 科技文献资源”“专题数据库资源”“多媒体软件资源”等信息资源在全省 各乡镇、行政村和2 000多个新农村试点村共享。 参考文献 [1]樊合文.以多方合作和资源整合推进发展[N]经济日报,2007—06一 O7(13) [2]张玉番.加快农业信息化建设,助推现代农业发展[N].农民13报, 2007—10—25(6). [3]巾国社会科学院课题组.推进国民经济信息化的公共政策研究[J]. 经济研究参考,2007(14):2、 [4]姚裕群.人力资源开发与管理[M]、北京:中国人民大学出版社,2007. (责任编辑:白尚平) 第一作者简介:郝玉宾,女,1975年l1月生,1999年毕业于山西大 学,讲师,山西省委党校,山西省太原市学府街96号,030006. Speeding up the Construction of Agricultural Informatization for Promoting the Development of the Characteristic Modern Agriculture HAo Yu-bin.JIN Peng-cheng ABSTRACT:This paper expounds the important functions of the agricultural informatization in the new period,probes into the problem of how to promote the great—leap-forward development of the rural informatization with the comprehensive service of modem agricultural informatization,and points out that our country should provide the talents support for the modern agriculture by using the modern information technology. KEY WORDS:agricultural informatization;characteristic modern agriculture;human resource‘
数据挖掘十大经典算法
WORD格式整理
专业资料 值得拥有 数据挖掘十大经典算法
一、 C4.5
C4.5算法是机器学习算法中的一种分类决策树算法,其核心算法是ID3 算法. C4.5算法继承了ID3算法的优点,并在以下几方面对ID3算法进行了改进:
1) 用信息增益率来选择属性,克服了用信息增益选择属性时偏向选择取值多的属性的不足;
2) 在树构造过程中进行剪枝;
3) 能够完成对连续属性的离散化处理;
4) 能够对不完整数据进行处理。
C4.5算法有如下优点:产生的分类规则易于理解,准确率较高。其缺点是:在构造树的过程中,需要对数据集进行多次的顺序扫描和排序,因而导致算法的低效。
1、机器学习中,决策树是一个预测模型;他代表的是对象属性与对象值之间的一种映射关系。树中每个节点表示某个对象,而每个分叉路径则代表的某个可能的属性值,而每个叶结点则
对应从根节点到该叶节点所经历的路径所表示的对象的值。决策树仅有单一输出,若欲有复数输出,可以建立独立的决策树以处理不同输出。
2、 从数据产生决策树的机器学习技术叫做决策树学习, 通俗说就是决策树。
3、决策树学习也是数据挖掘中一个普通的方法。在这里,每个决策树都表述了一种树型结构,他由他的分支来对该类型的对象依靠属性进行分类。每个决策树可以依靠对源数据库的分割 WORD格式整理
专业资料 值得拥有 进行数据测试。这个过程可以递归式的对树进行修剪。当不能再进行分割或一个单独的类可以被应用于某一分支时,递归过程就完成了。另外,随机森林分类器将许多决策树结合起来
以提升分类的正确率。
决策树是如何工作的?
1、决策树一般都是自上而下的来生成的。
2、选择分割的方法有好几种,但是目的都是一致的:对目标类尝试进行最佳的分割。
基于联系数的直觉模糊多属性决策不确定分析与应用
第25卷第3期
2010年6月 天津科技大学学报
Journal of Tianjin University of Science&Technology 、b1.25 NO.3 Jnn.2O1O
基于联系数的直觉模糊多属性决策不确定分析与应用
王 霞,贾学龙
(天津科技大学理学院,天津300457)
摘要:由于已有直觉模糊多属性决策难以开展不确定性问题的分析,用集对分析中的二元联系数表示一个直觉模
糊数,利用二元联系数的普通加、乘运算进行直觉模糊多属性决策,为直觉模糊多属性决策提供一种新的简便算法,且
能借助对 的不同取值展开不确定性分析,实例应用表明该方法合理可行.
关键词:直觉模糊数;集对分析;二元联系数;多属性决策;不确定性分析
中图分类号:C934 文献标志码:A 文章编号:1672—6510(2010)03—0075.04
Uncertain Analysis and Application of Intuitionistic Fuzzy Varied Property
Decision Based on the Connection Number
WANG Xia,JIA Xue—long
(College ofScience,Tianjin University ofScience&Technology,Tianjin 300457,China)
Abstract:Since it is dificult to take uncertain analysis in previous intuitionistic fuzzy varied property decision,the
intuitionistic fuzzy number was represented by binary connection number of set pair analysis.Furthermore,intuitionistic
考虑风险偏好的区间2型模糊多属性决策方法
作者: 赵萌[1,2];马箫宇[2];魏岱玮[2];沈哲[2]作者机构: [1]东北大学工商管理学院,沈阳110819;[2]东北大学秦皇岛分校,秦皇岛066004出版物刊名: 系统工程理论与实践页码: 469-477页年卷期: 2017年 第2期主题词: 多属性决策;风险偏好;可能度;区间2型模糊集;区间2型梯形模糊集
摘要:针对区间2型梯形模糊集(IT2TrFS)的多属性决策问题,提出了一种考虑决策者风险偏好的多属性决策方法.首先根据决策者的风险偏好给决策者分类,提出了决策者风险偏好的度量方法,进而求得决策者风险偏好决策矩阵,并定义了新的可能度计算公式,最后通过计算符号距离得到方案的排序结果.实例分析表明该方法科学合理,决策者的不同风险偏好对决策结果存在影响,方法对比说明与已有算法相比该方法有更强的适用性:对风险偏好和风险保
守的决策者同样适用.The multi-attribute decision making methods forinterval type-2 fuzzy sets considering riskpreferences
决策树算法的比较研究
决策榭算法硇比较研奔 上海开放大学信息与3-程系王磊郑任儿 [摘要]本文分析与比较了两种既能处理离散数据又能处理连续数据的决策树经典算法c4 5与CART。首先论述了两种算法的思 想,并通过实例解析了c4.5算法和CART的实现过程,最后基于WEKA平台对它们进行了对比实验,利用实验结果的各项评价指标 对这两种算法进行了性能分析与比较。 [关键词]数据挖掘 决策树算法 C4.5 CART 1、前言 数据挖掘作为一种发现大量数据中潜在信息的数据分析方法和技 术,已经成为各界关注的热点。其中,决策树的构造不需要任何领域知 识,归纳学习和分类步骤简单快速并且直观易懂等特点,已经成功地应 用于许多应用领域的分类。构造决策树有多种算法,国际上最早具有 影响力的决策树是由J.RossQuinlan提出的ID3算法,是基于信息熵的 决策树分类算法,后来Quinlan又提出了ID3的改进版本c4.5算法,C4.5 算法则用信息增益率来选择决策属性,在ID3的基础上还增加了对连 续属性的离散化、对未知属性的处理和产生规则等功能。1984年IJ_ Breiman,J.Friedman,R.Olshen和C.Stone出版了CART,介绍了二叉决策 树算法。 关于ID3与C4.5算法的比较相关研究工作较多,本文主要探讨既 能处理离散属性又能处理连续属性的决策树算法C4.5与CART算法, 通过实例分析了相关决策树的构建以及通过实验分析比较两个算法的 性能。 2、G4.5算法简介 ID3使用信息增益作为属性选择度量,这倾向于选择具有大量值的 属性。c4.5使用称作增益率的信息增益扩充来克服这种偏倚。信息增 益率等于信息增益对分割信息量的比值。相关概念描述如下: 对|JII练集D中元组分类所需的期望信息Info(D)=一 :羔 P log2(p ), 基于按属性A划分对D的元组分类所需要的期望信息Info(D)= 『D ×j,27 Dj)。信息增益定义为原来的信息需求与新的需求(即 … I l 对属性A划分之后得到的)之间的差即Gain(A)=Info(D)一InfoA(D)。 C4.5使用分裂信息值将信息增益规范化, [itlnfoA(D)= lD.1 }D,f 一∑ :l logz ,它表示通过将训练数据集D J ̄I]分成对应于属性 l—f f~l A测试的v个输出的v个划分产生的信息。 C4.5使用悲观剪枝方法,使用错误率评估,对于树剪枝作出决定。 它使用训练集评估错误率。基于训练集评估准确率或错误率是过于乐 观的,因此具有较大的偏倚。因此,悲观剪枝访求通过加一个罚来调节 从训练集得到的错误率,以抵消所出现的偏倚。 3、CART算法简介 CART算法使用Gini指标作为属性选择度量,Gini指标度量数据划 分的不纯度,定义为: 1~∑m= P 。 其中pi是训练数据集中属于不同的类C.类的概率。 CART使用代价复杂度剪枝算法,也属于后剪枝方法。该方法将代 价复杂度看作树中树叶节点的个数和树的错误率的函数。它从树的底 部开始,对于每个内部节点N,计算N处的子树的代价复杂度和该子树 剪枝后N处子树(即用一个树叶节点替换)的代价复杂度。比较这两个 值,如果剪去节点N的子树导致较小的代价复杂度,则剪去该子树;否 则保留该子树。剪去类标记的元组集用来评估代价复杂度。该集合独 立于用于建立未剪枝的树的训练集和任意用于准确率评估的检验集。 算法产生渐进的剪枝树集合。一般,最小化代价复杂度的最小决策树 是首选。 4、实例解析 4:1决策树构造c4.5算法实现 通过某地收集的天气数据实例说明C4.5算法决策树的构造实现, 其样本数据见表4—1,该样本数据既有离散数据,也有连续数据。 4.I.1首先计算训练集D中元组分类所需的期望信息: Info(D)=一9/14"1ogff9/14)一5/14"1og ̄f5/14)=0.94位。 4.1.2离散属性的信息增益率求解过程如下: (1)计算每个属性的期望信息需求: Infoo... ̄(D)=5/14 (-2/5*1o&2/5—3/5"1og23/5)+4/14"(一4/4"1og ̄4/4—0/ 4 log ̄0/4)+5/14"(一3/5"1og23/5—2/5*1og ̄2/5)=0.694位 (2)计算每个属性的信息增益: 一156一 Gain(outlook)=Info(D)一InfooatlookfD)=0.246位。 (3)计算每个属性的分裂信息: Splitlnfot ̄.tt ̄(D)=-5/14 log ̄(5/14)-5/14 log ̄(5/14)一4/14 log ̄(4/1 41=1.576 (4)计算每个属性的增益率: GainRatiofouⅡ00k1=O.246/1.576=0.156 同理,求出GainRatio(windy)=0.048/0.98--0.049 表4—1天气样本数据集 ID outlook temperature humidity windy 1 overcast 54 65 TRUE 2 ralnv 65 70 TRUE 3 69 70 FALSE 4 SUnnV 75 、 70 TRUE 5 overcast 81 75 FALSE 6 ralnv 68 80 FALSE 7 ralnv 75 80 FALSE 8 Sunny 85 85 FALSE 9 OVercast 83 86 FALSE 10 overcast 72 90 TRUE 11 80 90 TRUE 12 71 91 TRUE 13 Snnnv 72 95 FALSE 14 ralnv 70 96 FALSE 4-2决策树构造CART算法实现 设D是表4—1的训练数据,其中9个元组属于类p1ay=yes,而其余5 个元组属于类play=no。首先计算D的不纯度Gini(D)=l一(9/14) 一(5/1 4) = 0.459。 为了找出D中元组的分裂准则,计算每个属性的Gini指标。离散 属性的二分划分,以属性outlook为例考虑每个可能的分裂子集。 (1)考虑子集overcast,rainy},基于该划分计算Gini指标: Ginioutlook∈fovercast,rainy}(D)=9/14 (1一(7/9)2一(2/9)2)+5/14(1一(2/5) 2-(3/5)2))-0.393 (2)考虑子集overcast,sunny},基于该划分计算Gini指标: Ginioutlook∈fovercast,sunny}(D)=9/14 (1-(6/9)2—0/9)2)+5/14(1一(2/ 5)2-(3/5)2))=O.460 (3)考虑子集{sunny,rainy},基于该划分计算Gini指标: Ginioutlook∈{sunny,rainy}(D)=10/14 (1一(5/lO)2一(5/10)2)+4/14(1一(4/ 4)2)=O.357 因此,子集{sunny,rainy}最小化Gini指标。属性outlook的最好二元 划分在{sunny,rainy}f_,具有Gini指标值0.357。 同理,属性{windy}的Gini指标值为0.43。 5、决策树算法性能分析 WEKA是新西兰Waikato大学开发的全面的数据挖掘系统,它不仅 提供了多种数据挖掘方法(分类、聚类、关联规则等)的多种常用算法进 行知识发现,还提供了适用于任意数据集的数据预处理功能,以及算法 性能评估的多种方法。针对决策树算法性能优劣的几个评定指标.本 文在WEKA平台下对上述两种算法进行性能分析实验,得出了不同角 度的实验结果。我们在标准测试数据集UCI发布的数据集中选取了9个 样本数据集来对这两种算法进行算法性能分析和比较性能分析实验。 首先简单描述一下我们选取的样本数据集,这9个样本集都是既 含有离散型属性,又包含连续型属性,实验的样本数据集的基本信息见 表5—1。分别从算法的分类准确率、算法的建模速度、算法的强壮性、算 法的可伸缩性、算法的可解释性得出了两种决策树算法的对比情况,且 这几个性能的比较实验都是采用十字交叉的方式进行建模和预测的, 实验情况分别见以下各表。
常用的三种分类算法及其比较分析
第
22卷第
5期重庆科技学院学报(自然科学版)
2020年
10月
常用的三种分类算法及其比较分析
肖铮
(四川工商职业技术学院,成都611830)
摘要:做好数据分析处理工作,必需掌握几种分类算法。介绍了决策树算法、朴素贝叶斯算法和最近
邻算法的基本思想和分类流程,给出了应用实例,比较分析了它们各自具有的优势和存在的局限。
采用数据挖掘技术进行大数据分析要选择最合适的算法,才能获得更有效的结果(
关键词:数据挖掘%决策树算法;朴素贝叶斯算法%最近邻算法
中图分类号:
TP301 文献标识码:
A 文章编号:
1673 -1980 (
2020 )
05 -0101 -06
数据挖掘就是通过算法从海量数据中搜索获取
有用知识和信息的过程。数据挖掘的任务主要表现
为预测和描述:预测性任务就是根据其他属性的值
来预测特定属性的值;描述性任务就是概括数据中
潜在的联系模式(如相关性、趋势、聚类、轨迹和异
常等)。分类属于预测任务。分类算法的目的就是
构造一个分类函数或者分类模型,然后由这个模型
把数据库中的数据映射到某一个给定的类别中⑷(
决策 法、 素 法 最 邻 法
的分类算法。下面,我们将结合实例对这
3种算法
进行比较分析。
1
决策树算法
决策树算法是数据挖掘中常见且实用的分类方
法,经常被用于规则提取和分类预测等领域。
J. R.
Quinlan于
1979年提出并在之后逐渐修正完善的
ID3算法[
2]
,是经典的决策树算法。后来有学者在
ID3的基础之上推出了效率更高、适用范围更广的
C4.5算法
,它既适用于分类问题
,又适用于回归问
题。近几年,有南京大学周志华教授提出的“选择
性集成”[
3]
概念被学术界所接受,并有基于遗传算
法的选择性集成算法
GASEN - b用于集成
C4. 5决
策树⑷(1.
〔基本思想和分类过程
决策树算法在决策分类时整个过程都非常清
晰。在判断类别时,首先通过计算选择一个属性,把
它放在决策树的顶端,称它为根节点;接下来从这个
