基于变精度粗糙集理论的知识约简方法
2004年1月系统工程理论与实践第1期 文章编号:100026788(2004)0120076207基于变精度粗糙集理论的知识约简方法米据生1,2,吴伟志1,张文修1(1.西安交通大学理学院信息与系统科学研究所,陕西西安710049;2.河北师范大学数学与信息科学学院,河北石家庄050016)摘要: 基于变精度粗糙集理论与包含度理论,引入了不协调目标信息系统的上、下分布约简的概念,并讨论了它们之间的关系.上(下)分布约简是保持每个决策类的上(下)近似不变的最小属性集,由约简系统产生的命题规则与由原系统产生的命题规则是相容的,即约简不会改变由对象所产生的规则的决策结果.通过对这两种知识约简的等价刻画,得到了上、下分布知识约简的判定定理和可辨识属性矩阵,从而提供了不协调目标信息系统知识约简的新方法.关键词: 变精度粗糙集;知识约简;信息系统;协调集中图分类号: T P18 文献标识码: A Know ledge R educts Based on V ariab le P recisi on Rough Set T heo ry M I J u2sheng1,2,W U W ei2zh i1,ZHAN G W en2x iu1(1.In stitu te fo r Info rm ati on and System Sciences,Facu lty of Science,X i’an J iao tong U n iversity,X i’an710049,Ch ina;2. Co llege of M athem ath is and Info rm ati on Science,H ebei N o rm al U n iversity,Sh ijiazhuang050016,Ch ina)Abstract: T he m ain ob jective of the paper is to in troduce som e new concep ts of know ledge reducti onbased on variab le p recisi on rough set theo ry such as upper distribu ti on reducti on and low er distribu ti onreducti on.T he decisi on ru les derived from the distribu ti on con sisten t set are compatib le w ith the onesderived from o riginal system.T heir equ ivalen t defin iti on s are studied.T he relati on sh i p s among alterna2tive reducts in incon sisten t info rm ati on system s are discu ssed.T he judgem en t theo rem s and discern ib ili2ty m atrixes w ith respect to upper and low er reducti on s are ob tained.So one can calcu lates the reductsby the discern ib ility fo rm u las.T hese resu lts are m ean ingfu l bo th in the theo ry and in app licati on s.Key words: variab le p recisi on rough set;info rm ati on system;know ledge reducti on;con sisten t set 知识发现是人工智能的核心问题之一,它是从信息系统中识别正确、新颖、有潜在应用价值并最终可为人们所理解的模式的方法.粗糙集理论提供了知识发现的一种数学方法.由于这一理论的广泛应用,它越来越引起国际学术界的关注.知识约简是知识发现的重要课题,因而也是粗糙集理论的核心问题之一.目前,信息系统的知识约简大多是在Paw lak粗糙集模型下进行的[1-7].Paw lak粗糙集模型的一个局限性是它所处理的分类必须是完全正确的或肯定的,因而它的分类是精确的,亦即只考虑完全“包含”与“不包含”,而没有某种程度上的“包含”与“属于”.Paw lak粗糙集模型的另一个局限性是它所处理的对象是已知的,且从模型中得到的结论仅适用于这些对象.但在实际应用中,往往需要把从小规模对象集中得到的结论应用于大规模对象集上去.Paw lak粗糙集模型的这些局限性限制了它的应用.近年来,许多学者从多方面推广了这一模型. Ziarko于1993年提出了变精度粗糙集模型.在这个模型中,给定一个阈值,当对象所在的等价类在某种程度上包含于集合X中时,就认为这个对象属于X.这一推广在应用上是非常重要的,因为在实际问题收稿日期:2002211218资助项目:国家自然科学基金(10271039);973项目(2002CB312206) 作者简介:张文修(1940-),男,教授,博士生导师,中国数学会常务理事.研究方向:应用概率论,人工智能的数学基础等;米据生(1966-),男,副教授,博士生.研究方向:人工智能的数学基础,粗糙集与随机集;吴伟志(1964-),男,副教授,博士生.研究方向:人工智能的数学基础,粗糙集与随机集中绝对的包含有时是不必要的.基于变精度粗糙集理论,文[8-11]给出并研究了不协调信息系统的Β下近似约简.Β下近似约简保持有决策的对象总数不变,但所产生的决策规则与原信息系统产生的规则有可能冲突.因此,这种约简定义不太适合实际需要,并且也没有文献从理论上给出这种知识约简的具体操作方法.为此,在文[12]中,我们利用可辨识属性矩阵给出并研究了不协调目标信息系统的几种知识约简方法.本文提出变精度粗糙集模型上两种知识约简的新概念,即Β上、下分布约简.它们分别是保持每个决策类的Β上、下近似不变的属性集,并且与全部属性集A 产生相容的命题规则.同时给出了Β上分布约简与Β下分布约简的判定定理和相应的可辨识属性矩阵,从而得到了变精度粗糙集模型上知识约简的新方法.这为不协调目标信息系统的知识约简提供了理论依据与算法.1 变精度粗糙集模型变精度粗糙集模型[8]是Paw lak 粗糙集模型[1]的推广.先给出有关概念和术语.定义1.1 设(U ,A ∪D ,f )是目标信息系统,其中,U 是有限对象集合,U ={x 1,…,x n };A 是有限条件属性集,A ={a 1,…,a p };D 是有限目标属性集,D ={d 1,…,d q },A ∩D = .f 是描述,f :U ×(A ∪B )→V ,V =∪c ∈A ∪DV c ,V c 是c 的有限值域.对于任意B ΑA ∪D ,记R B ={(x ,y ):f (x ,c )=f (y ,c ),c ∈B }则R B 是U 上的等价关系,称为由B 决定的不可区分关系.它产生的上的U 分划记为:U R B ={[x ]B :x ∈U }其中[x ]B ={y :(x ,y )∈R B }是x 关于B 的等价类.ΠX ΑU ,记R B (X )={x ∈U :[x ]B ΑX }=∪{[x ]B :[x ]B ΑX }R B (X )={x ∈U :[x ]B ∩X ≠ }=∪{[x ]B :[x ]B ∩X ≠ }则R B (X )与R B (X )分别称为x 关于B 的下近似和上近似.X 的下近似是按着知识B 肯定属于X 的对象全体,而上近似是按着知识B 可能属于X 的对象全体.显然R B ΑX ΑR B (X ),R B (X )ΑR B ∪{a }(X ), R B (X )ΒR B ∪{a }(X )这说明:增加属性会减少对象是否属于X 的不确定程度.称(U ,R A ,R A ,R A )为Paw lak 粗糙集模型.对Β∈(0.5,1],记R ΒB (X )={x ∈U :D (X [x ]B )ΕΒ}=∪{[x ]B :D (X [x ]B )ΕΒ}R ΒB (X )={x ∈U :D (X [x ]B )>1-Β}=∪{[x ]B :D (X [x ]B )>1-Β}则分别称R ΒB (X )与R ΒB (X )为X 关于B 的Β下近似和Β上近似.称(U ,R A ,R ΒB ,R ΒB)(B ΑA )为变精度粗糙集模型[8].其中D 为U 的幂集P (U )={X :X ΑU }上的包含度.为方便起见,本文中取D (X Y )= X ∩YY,若 Y ≠0;D (X Y )=1,若 Y =0.其中 Y 表示Y 中的元素个数.则D (X Y )+D (X cY )= X ∩Y Y=1这时R ΒB (X )与R ΒB (X )满足对偶性质:R ΒB (X )=~R ΒB (~X ).当Β=1时,R ΒB(X )=R B (X )且R ΒB (X )=R B (X ).因此,变精度粗糙集模型是Paw lak 粗糙集模型的推广.为叙述简单,以下设D ={d },V d ={1,2,…,r },D j ={x ∈U ,f (d ,x )=j }.则U R D ={[x ]D :x ∈U }={D 1,…,D r }.容易证明[8],R ΒB 与R ΒB 具有以下性质:1)R ΒB(D i )∩R ΒB (D j )= ,(i ≠j );2)∪rj =1R ΒB(D j )Α∪rj =1R ΒB (D j )ΑU ,等号未必成立;3)R ΒB (D i )∩R ΒB (D j )= 一般不成立.77第1期基于变精度粗糙集理论的知识约简方法在变精度粗糙集模型中,由x ∈R ΒA(D j )可产生如下形式的命题规则∧c ∈A(c ,f (c ,x ))→d =j 显然,基于变精度粗糙集理论,并不是每一个对象都有决策,只有当其所在等价类在某个决策类中的包含度不小于阈值时,它才能产生决策规则.定义1.2 设(U ,A ∪D ,f )是目标信息系统,若R A ΑR D ,则称目标信息系统是协调的,否则称目标信息系统是不协调的.2 变精度粗糙集模型上知识约简的概念基于变精度粗糙集理论,文[8-11]给出了Β下近似约简的概念.下面再定义几种知识约简概念.定义2.1设(U ,A ∪D ,f )是目标信息系统,B ΑA .记ΡΒB =6{ R ΒB(D k ) :k Φr } U;ΚΒB =6{ R ΒB(D k ) :k Φr } UL ΒB =(R ΒB (D 1),…,R ΒB (D r )); H ΒB=(R B(D 1),…,R B (D r )) 1)若ΡΒB =ΡΒA ,则称B 是Β下近似协调集.若B 是Β下近似协调集,但B 的任何真子集不是Β下近似协调集,则称B 是Β下近似约简[11].2)若ΚΒB =ΚΒA ,则称B 是Β上近似协调集.若B 是Β上近似协调集,但B 的任何真子集不是Β上近似协调集,则称B 是Β上近似约简.3)若L ΒB =L ΒA ,则称B 是Β下分布协调集.若B 是Β下分布协调集,但B 的任何真子集不是Β下分布协调集,则称B 是Β下分布约简.4)若H ΒB =H ΒA ,则称B 是Β上分布协调集.若B 是Β上分布协调集,但B 的任何真子集不是Β上分布协调集,则称B 是Β上分布约简.Β上(下)分布协调集是保持每个决策类的Β上(下)近似不变的属性集,它与A 产生相容的命题规则,即在原系统和约简系统中,由同一对象所产生的命题规则的决策部分相同.而Β下近似协调集保持决策类的下近似中的对象总数不变,由它产生的命题规则与由A 产生的命题规则可能冲突,但支持这些命题规则的对象个数不变.定理2.1 设(U ,A ∪D ,f )是目标信息系统,则Β下分布协调集必为Β下近似协调集,Β上分布协调集必为Β上近似协调集.表2.1U a 1a 2dx 1101x 2111x 3112x 4121x 5203x 6224x 7223x 8214证明 由定义立即可得.例2.1 Β下近似协调集未必是Β下分布协调集.给出目标信息系统(表2.1).记D 1={x 1,x 2,x 4},D 2={x 3},D 3={x 5,x 7}D 4={x 6,x 8},A ={a 1,a 2},B ={a 1}则R 0.7A (D 1)={x 1,x 4},R 0.7A (D 2)= ,R 0.7A (D 3)={x 5}R 0.7A (D 4)={x 8},R 0.7B (D 1)={x 1,x 2,x 3,x 4},R 0.7B (D 2)=R 0.7B (D 3)= ,R 0.7B (D 4)= .因此,B ={a 1}是0.7下近似协调集,但不是0.7下分布协调集.同样,Β上近似协调集也未必是Β上分布协调集.定理2.2 设(U ,A ∪D ,f )是目标信息系统,则B 为1上近似协调集的充分必要条件是B 为1上分布协调集.证明 设B 为1上近似协调集,则6{ R 1B(D j ) :j Φr }=6{ R 1A(D j ) :j Φr }.又容易证明,Πj87系统工程理论与实践2004年1月Φr ,有R 1B (D j )ΒR 1A (D j ),因此R 1B (D j )=R 1A (D j ),即B 是1上分布协调集.相反方面由定理2.1即得. 定理2.3 设(U ,A ∪D ,f )是目标信息系统,则1)1上分布协调集必为1下分布协调集;2)1上近似协调集必为1下近似协调集. 证明 1)设B 是1上分布协调集,则Πj Φr ,有R 1B (D j )=R 1A (D j ).于是对Πx ∈U ,D (D j [x ]B )>0α]D (D j [x ]A )>0,即[x ]B ∩D j ≠ α][x ]A ∩D j ≠ .由于{D j :j Φr }构成了U 的划分,故[x ]B ΑD j α][x ]A ΑD j .因此R 1B(D j )=R 1A (D j ),Πj Φr ,即B 是1下分布协调集.2)由定理2.2,定理2.1及以上(1)的证明立即可得.3 变精度粗糙集模型上的知识约简方法先给出Β上、下分布协调集的等价刻画.定理3.1 设(U ,A ∪D ,f )是目标信息系统,B ΑA ,记M ΒB (x )={D j :x ∈R ΒB (D j )},x ∈UG ΒB (x )={D j :x ∈R ΒB (D j )},x ∈U则,1)B 是Β上分布协调集,α]Πx ∈U ,M ΒB (x )=M ΒA (x ).2)B 是Β下分布协调集α]Πx ∈U ,G ΒB(x )=G ΒA (x ).证明 1)因为x ∈R ΒA (D j )α]D j ∈M ΒA (x );x ∈R ΒB (D j )α]D j ∈M ΒB (x ).则证.2)类似于1)可证.定理3.2(知识约简的判定定理) 设(U ,A ∪D ,f )是目标信息系统,B ΑA .则1)B 是Β上分布协调集α]Πx ,y ∈U ,当M ΒA (x )≠M ΒA (y )时,[x ]B ∩[y ]B = .2)B 是Β下分布协调集α]Πx ,y ∈U ,当G ΒA(x )≠G ΒA (y )时,[x ]B ∩[y ]B = .证明 记J ([x ]B )={[y ]A :[y ]A Α[x ]B }.由于B ΑA ,J ([x ]B )构成了[x ]B 的一个分划.1)设B 是Β上分布协调集.Πx ,y ∈U ,当[x ]B ∩[y ]B ≠ 时,有[x ]B =[y ]B ,于是M ΒB(x )=M ΒB (y ).由定理3.1得M ΒA(x )=M ΒB (x )且M ΒA (y )=M ΒB (y ),从而M ΒA (x )=M ΒA (y ).因而当M ΒA (x )≠M ΒA (y )时,[x ]B ∩[y ]B = .反之,Πx ∈U ,当[y ]A Α[x ]B 时,有[x ]B ∩[y ]B ≠ ,故M ΒA(x )=M ΒA (y ).Πj Φr ,若x ∈R ΒB(D j ),则[x ]B ΑR ΒB (D j ).由于[x ]B =∪{[y ]A :[y ]A ∈J ([x ]B )},故Π[y 0]A ∈J ([x ]B ),有[y 0]A ΑR ΒB (D j ),故D j ∈M ΒA (y 0).从而D j ∈M ΒA (x ).因此x ∈R ΒA (D j ).若x ∈R ΒA (D j ),则D j ∈M ΒA (x ).当[y ]A ∈J ([x ]B )时,[y ]B ∩[x ]B ≠ ,故M ΒA (x )=M ΒA (y ),从而D j∈M ΒA (y ),即D (D j[y ]A )>1-Β.于是D (D j [x ]B )=6{ [y ]A ∩D j :[y ]A ∈J ([x ]B )} [x ]B=6[y ]A ∩D j [y ]A [y ]A[x ]B:[y ]A ∈J ([x ]B )>(1-Β)6[y ]A[x ]B:[y ]A ∈J ([x ]B )=1-Β因此x ∈R ΒB(D j ).这样便证明了R B (D j )=R A (D j ),Πj Φr .即B 是Β上分布协调集.2)类似于(1)的证明可得.定理3.2给出了判断属性子集是Β上、下分布协调集的方法.由此我们可进一步得到相应的知识约简方法.先给出可辨识属性矩阵的概念.定义3.1 设(U ,A ∪D ,f )是目标信息系统,U R A ={C 1,…,C m }.记D 3Β1={([x ]A ,[y ]A ):M ΒA (x )≠M ΒA (y )};97第1期基于变精度粗糙集理论的知识约简方法D3Β2={([x]A,[y]A):GΒA(x)≠GΒA(y)}用f(C i,a k)表示属性a k关于C i中对象的取值.定义DΒl(C i,C j)={a k∈A:f(C i,a k)≠f(C j,a k)},(C i,C j)∈D3Βl.A,(C i,C j)|D3Βl,l=1,2则分别称DΒ1(C i,C j)与DΒ2(C i,C j)为C i与C j的Β上、下分布可辨识属性集,DΒ1=(DΒ1(C i,C j);i,jΦm)与DΒ2=(DΒ2(C i,C j);i,jΦm),分别称为目标信息系统的Β上、下分布可辨识属性矩阵.定理3.3 目标信息系统的Β上、下分布可辨识属性矩阵具有以下性质:1)它们都是对称矩阵,即DΒl(C i,C j)=DΒl(C j,C i),(l=1,2);2)主对角线上的元素都是A,即DΒl(C i,C i)=A,ΠiΦm,(l=1,2,);3)DΒl(C i,C j)ΑDΒl(C i,C s)∪DΒl(C s,C j),Πi,s,jΦm(l=1,2).证明 只需证3).若a k|DΒl(C i,C s)∪DΒl(C s,C j),则a k|DΒl(C s,C j)且a k|DΒl(C s,C j).于是f(C i, a k)=f(C s,a k),f(C s,a k)=f(C j,a k).从而f(C i,a k)=f(C j,a k),故a k|DΒl(C i,C j).3)得证.定理3.4 设(U,A∪D,f)是目标信息系统,BΑA,则1)B是Β上分布协调集α]Π(C i,C j)∈D3Β1,有B∩DΒ1(C i,C j)≠ .2)B是Β下分布协调集α]Π(C i,C j)∈D3Β2,有B∩DΒ2(C i,C j)≠ .证明 1)设B是Β上分布协调集,Π(C i,C j)∈D3Β1,不妨设C i=[x]A,C j=[y]A,则MΒA(x)≠MΒA (y).由定理3.21)得[x]B∩[y]B= .于是存在a k∈B,使得f(x,a k)≠f(y,a k),即f(C i,a k)≠f(C j, a k),故a k∈DΒ1(C i,C j).因此B∩DΒ1(C i,C j)≠ .反之,若存在(C i,C j)∈D3Β1,使得B∩DΒ1(C i,C j)= .记C i=[x]A,C j=[y]A,则MΒA(x)≠MΒA(y).对Πa k∈B,必有a k|DΒ1(C i,C j),于是f(C i,a k)=f(C j,a k),从而f(x,a k)=f(y,a k).这说明[x]B= [y]B.再由定理3.21)即得B不是Β上分布协调集.3)类似于(1)可证.定义3.2 设(U,A∪D,f)是目标信息系统,DΒl=(DΒl(C i,C j);i,jΦm)(l=1,2)分别为Β上、下分布可辨识属性矩阵.分别称MΒl=∧i,j (∨DΒl(C i,C j))=∧C i,C j∈D3Βl(∨DΒl(C i,C j)),l=1,2为Β上、下分布辨识公式.定理3.5 设(U,A∪D,f)是目标信息系统,辨识公式MΒl的极小析取范式为MΒl=∨tk=1(∧q ks=1a is).记B lk={a is:s=1,2,…,q k},则{B lk:k=1,2,…,t}(l=1,2)分别是所有Β上、下分布约简形成的集合.证明 仅证{B lk:k=1,2,…,t}是所有Β上分布约简的全体.ΠkΦt,Π(C i,C j)∈D3Βl,由极小析取范式的定义知B1kΒDΒ1(C i,C j)≠ ,再由定理3.41)知B1k是上Β分布协调集.表3.1 不协调目标信息系统U a1a2a3a4d x110001 x201112 x301002 x401012 x501001 x601001同时,MΒ1=∨tk=1B1k,若在B1k中去掉一个元素而形成B′1k,则必存在(C i,C j)∈D3Β1,使得B’1k∩DΒ1(C i,C j)= ,故B’1k不是Β上分布协调集,从而B1k是Β上分布约简.由于Β上分布辨识公式中包含了所有的DΒ1(C i,C j),因此不存在其他Β上分布约简.定理3.5提供了求不协调信息系统两种知识约简的方法,下面给出一个数值计算例子.例3.1 给出目标信息系统(表3.1).记D1={x1,x5,x6},D2={x2,x3,x4}08系统工程理论与实践2004年1月C 1=[x 1]A ={x 1},C 2=[x 2]A ={x 2},C 3=[x 3]A ={x 3,x 5,x 6},C 4=[x 4]A ={x 4}则有ΛA (x 1)=(1,0),ΛA (x 2)=(0,1),ΛA (x 3)=ΛA (x 5)=ΛA (x 6)=(2 3,1 3),ΛA (x 4)=(0,1)M0.7A(x 1)={D 1},M 0.7A (x 2)={D 2},M 0.7A (x 3)=M 0.7A (x 5)=M 0.7A (x 6)={D 1,D 2},M 0.7A (x 4)={D 2}故D 30.71={(C 1,C 2),(C 1,C 3),(C 1,C 4),(C 2,C 3),(C 3,C 4)}因为D 0.71(C 1,C 2)={a 1,a 2,a 3,a 4},D 0.71(C 1,C 3)={a 1,a 2},D 0.71(C 1,C 4)={a 1,a 2,a 3}D 0.71(C 2,C 3)={a 3,a 4},D 0.71(C 3,C 4)={a 3}我们有M0.71=(a 1∨a 2∨a 3∨a 4)∧(a 1∨a 2)∧(a 1∨a 2∨a 3)∧(a 3∨a 4)∧a 3=(a 1∧a 3)∨(a 2∧a 3)因此{a 1,a 3}与{a 2,a 3}是目标信息系统的两个0.7上分布约简.又因为G 0.6A (x 1)={D 1}, G 0.6A (x 2)={D 2},G 0.6A (x 3)=G 0.6A (x 5)=G 0.6A (x 6)={D 1},G 0.6A (x 4)={D 2}故D 30.62={(C 1,C 2),(C 1,C 4),(C 2,C 3),(C 3,C 4)}但D 0.62(C 1,C 2)={a 1,a 2,a 3,a 4}, D 0.62(C 1,C 4)={a 1,a 2,a 3}D 0.62(C 2,C 3)={a 3,a 4}, D 0.62=(C 3,C 4)={a 3}于是M0.62=(a 1∨a 2∨a 3∨a 4)∧(a 1∨a 2∨a 3)∧(a 3∨a 4)∧a 3=a 3因此{a 3}是目标信息系统的0.6下分布约简.4 结论知识约简能够简化信息系统,又不损失有用的信息,因此它是知识获取的重要内容.关于目标信息系统的知识约简的研究已有很多成果.这些结果大多是在P aw lak 粗糙集模型中进行的.由于P aw lak 粗糙集模型在应用上的局限性,它的各种推广形式应运而生.本文研究变精度粗糙集模型上的知识约简.这方面的大量文献讨论下近似约简的问题.由于下近似约简可能产生与原信息系统不相容的命题规则,这在具体应用时不太符合实际情况.为此,我们又引入了两种新的知识约简概念,讨论了它们之间的关系.通过等价刻画得到了上分布约简与下分布约简的判定定理和相应的可辨识属性矩阵.由此提供了这两种知识约简的具体操作方法.这在理论上与应用上都是有意义的.本文的讨论是对于完备的信息系统进行的,对于不完备信息系统的知识约简的类似讨论有待进一步研究.参考文献:[1] Paw lak Z .Rough Sets :T heo retical A spects of R eason ing abou t D ata [M ].Bo ston :K luw er A cadem ic Pub lishers ,1991.[2] 王珏,王任,苗夺谦,等.基于Rough Set 理论的“数据浓缩”[J ].计算机学报,1998,21(5):393-400.[3] 王国胤.Rough 集理论与知识获取[M ].西安:西安交通大学出版社,2001.[4] 张文修,吴伟志,梁吉业,李德玉.粗糙集理论与方法[M ].北京:科学出版社,2001.[5] 苗夺谦,胡贵荣.知识约简的一种启发式算法[J ].计算机研究与发展,1999,36(6):681-684.[6] Greco S ,M atarazzo B ,Slow in sk i R .A new rough set app roach in m u lticreteria and m u ltiattribu te classificati on [A ].LNA I 1424,R SCTC’98[C ].Sp ringer ,1998.18第1期基于变精度粗糙集理论的知识约简方法[7] Slezak D.A pp rox i m ate reducts in decisi on tab les[A].P roc of IP M U’96[C].Granada,Spain:1996,V o l.3,1159-1164.[8] Ziarko W.V ariab le p recisi on rough set model[J].Jou rnal of Compu ter and System Sciences,1993,46(1):39-59.[9] K ryszk iew parative studies of alternative type of know ledge reducti on in incon sisten t system s[J].In ter2nati onal Jou rnal of In telligen t System s,2001,16:105-120.[10] Q uafatou M.Α-R ST:a generalizati on of rough set theo ry[J].Info rm ati on Sciences,2000,124:301-316.[11] Beynon M.R educts w ith in the variab le p recisi on rough sets model:a fu rther investigati on[J].Eu ropean Jou rnal ofOperati onal R esearch,2001,134:592-605.[12] 张文修,米据生,吴伟志.不协调目标信息系统的知识约简[J].计算机学报,2002,26(1):12-18.征文通知2004年服务系统与服务管理国际学术会议2004In ternati onal Conference on Service System s and Service M anagem en t北京 2004年7月19日-21日h ttp: www.rcc ieee2sss m04会议组织:Service System s and O rgan izati on Comm ittee,IEEE System s,M an and Cybernetics Society清华大学经济管理学院会议主席:陈剑(清华大学) Jam es M.T ien(R en sselaer Po lytechn ic In stitu te,U SA)会议主题:会议主题包括(但不限于):1)In terdisci p linary R esearch of Service Concep t ・strategy and quality ・cu stom er behavi o r:cu stom er satisfacti on,cu stom er reten ti on,etc. ・service i m pact model:financial perfo rm ance,retu rn on quality,etc. ・service operati on s m anagem en t:layou t and queu ing theo ry,inven to ry models,yield m anagem en t,etc. ・agen t theo ry:agen t screen ing,agen t compen sati on,etc ・o ther related research:p rocess reengineering,supp ly chain m anagem en t,etc. 2)Service Info rm ati on T echno logy ・data m in ing ・artificial in telligence ・e2bu siness ・o ther info rm ati on techno logy 3)Study of H igh Con tact Service System s・health care・retail・p rofessi onal services・em erging service重要日程: 论文摘要提交截至日期:2004年3月10日论文录用通知:2004年4月10日论文全文提交和预注册截至日期:2004年5月20日会议时间:2004年7月19日-21日论文提交:有关服务系统与服务管理的论文都可以投稿Λ论文用英文书写,第一页要包括论文题目,作者姓名,作者联系方式,论文摘要,邮寄地址,电话,传真,电子邮箱和合著作者Λ被接受的稿件必须有一个作者出席会议,所有接受的论文将入会议论文集Λ稿件格式:稿件(用PD F或W o rd格式)交到em ail:I CSSS M04@其他要求请联系:清华大学现代管理研究中心吴利芬,邮编100084电话:86-10-62789928,传真:86-10-62784555,em ail:I CSSS M04@28系统工程理论与实践2004年1月。
基于粗糙集理论的数据挖掘方法(2006.10.16)
关于属性选择
许多学习算法处理高维数据有困难, 并且大量 无关属性的存在, 也使得数据分析受到干扰. 目的是找到满足特定标准的最小的属性子集. 搜索算法起着重要的作用. 搜索算法可以用搜 索方向(前向, 后向, 双向), 搜索方式(穷尽搜索, 启发式, 非确定式)及评价方式(精确度, 一致性, 依赖度, 信息熵等)等三个方面来分类. 约简的特点是可以保持分类/近似能力不变。
x5
x6 x7
MBA
MCE MSc
Low
Low Medium
Yes
Yes Yes
Neutral
Good Neutral
Reject
Reject Reject
x8
MCE
x1
Low
x2 x3
No
x4
Excellent
x5 x6
Reject
x7 x8
x1 x2 x3 x4 x5 x6 x7 x8 er der dr def de der e defr der der er def efr def defr der
例如,x1的决策函数 为f(x1)=(e r) (d e r) (d r) (d e f) 整个Accept类的决策 函数为f(Accept)=f(x1) f(x2) f(x3) f(x4) 化成析取范式后,各 项就是Accept类最小 决策规则
粗糙集和其他理论方法结合
和模糊集(Fuzzy set) ►模糊粗糙集(Fuzzy-Rough set) ► 应用:特征选择 聚类 ►Rough K-means ►应用: Web挖掘
粗糙集的问题
粗糙集理论应用于实际数据分析时, 会遇到 -离散化: - 噪音: 过拟合 - 数据缺失: 如何“不可区分” ? - 大数据量: 计算复杂度太高.
基于VPRS理论的一种混合分类算法
基于VPRS理论的一种混合分类算法洪智勇;秦克云;邓维斌【摘要】在文本分类领域中,KNN与SVM算法都具有较高的分类准确率,但两者都有其内在的缺点,KNN算法会因为大量的训练样本而导致计算量过大;SVM算法对于噪声数据过于敏感,对分布在分类超平面附近的数据点无法进行准确的分类,基于此提出一种基于变精度粗糙集理论的混合分类算法,该算法能够充分利用二者的优势同时又能克服二者的弱点,最后通过实验证明混合算法能够有效改善计算复杂度与分类精度.【期刊名称】《计算机工程与应用》【年(卷),期】2010(046)009【总页数】4页(P23-25,54)【关键词】文本分类;支持向量机(SVM)算法;K-近邻法(KNN);变精度粗糙集模型(VPRS)【作者】洪智勇;秦克云;邓维斌【作者单位】西南交通大学,数学学院,成都,610031;五邑大学,计算机学院,广东,江门,529020;西南交通大学,数学学院,成都,610031;西南交通大学,信息与科学技术学院,成都,610031【正文语种】中文【中图分类】TP3011 引言文本自动分类是信息检索与数据挖掘领域的研究热点与核心技术,近年来得到了快速发展,文本分类主要任务是指依据文本的内容,由计算机根据某种自动分类算法,把文本判分为预先定义好的类别。
在文本自动分类中,著名的文本分类方法有支持向量机(Support Vector Machine,SVM)、K 近邻(KNearest Neighbor,KNN)、神经网络(Neural Network,NN)、线性最小二乘估计(LLSF)、贝叶斯算法(Bayes)和决策树等[1]。
KNN是一个常用的模式识别算法,并且在许多领域(简单情况和复杂情况)都显示出良好的性能。
但是KNN是一种消极(Lazy)学习法——学习过程只是简单地存储已知的训练数据,当遇到新的查询样本时,通常要遍历训练实例空间以找到查询实例的K个最近的邻居[2]。
基于变精度粗糙集的属性约简
摘 要 : 性 约 简是 粗 糙 集 理 论 的 核 心 内容 之 一 。 对 变 精 度 粗 糙 集 理 论 的 属 性 约 简 问题 , 属 性 依 赖 度 增 量 、 信 属 针 从 互 息 增 量 角 度 对 属 性 重 要 度 进 行 分 析 , 以 这 两 个 属 性 重 要 度 的 度 量 作 为 启 发 式 信 息 。 出 变精 度 粗 糙 集 属 性 约 简 的 并 给
其中 f f 表示集合 的基数。称P X, ) ( l 为集合 于集 , 关
合 y的 相 对 错 误 分 类 率 。 即 如 果 将 集 合 中 的无 素 分 到 集 合 y
糙集模 型 中引入 了错 误分 类率 1o 3 05的概 念 , 出了变 精 3 ≤1 . ( < ) 提 度粗 糙 集 模 型 。后 来 , Ⅳ等人 将 定 义 为 正 确 分 类 率 且卢∈ ( .,1 模 型是P w a 粗 糙集模 型 的扩 充 。当 0 , 05 1。该 a lk = 时 变精 度
R u { /ห้องสมุดไป่ตู้ = ∈UR f E 1 }
B R =. E∈URl <P J 1Bj N‘ t J{ / 卢 J <- N G  ̄ =u { / P Ex) - E Rx EEUR1f, ≥1 ̄)
的 下近 似 可理 解 为将 中的 对象 以不 大 于 的分 类 误差 分 于 的集合 ; 的 区域 相应 理解 为将 中的 对象 以不 大 于J 负 B 的分类 误 差分 于 的补 集 ( ) 的集 合 。显 然 , 于任 意 ∈ ; 对 p s X= EG o- ; 3 界 域 是 由那 些 以不 大 于J的分类 误 oP N R (X) 的/ 边 B
差 既不 能分 类 于~ 又 不 能 分 类 于 ~ 的 U 对 象 所 构 成 的 集 合 。 中 如 果 B a d, l or _ⅣE = 的卢 近 似 是 由 那 些 以 NRX=p ¥p s Xt G J S J ; 上
粗糙集理论介绍
问题的提出:知识的含糊性
术语的模糊性,如高矮 数据的不确定性,如噪声 知识自身的不确定性,如规则的前后件间的 依赖关系不完全可靠 不完备性,数据缺失
由此,提出了包括
概率与统计、证据理论:理论上还难以令人信服,
不能处理模糊和不完整的数据
模糊集合理论:能处理模糊类数据,但要提供隶属
函数(先验知识)
so
例2: (表2)
R1(颜色) R2(形状) R3(体积) class
X1
红
圆形
小
1
X2
蓝
方形
大
1
X3
红
三角形
小
1
X4
蓝
三角形
小
1
X5
黄
圆形
小
2
X6
黄
方形
小
2
X7
红
三角形
大
2
X8
黄
三角形
大
2
等价类IND(R1)={{x1,x3,x7}, {x2,x4}, {x5,x6,x8}}
X={X1,X2,X3,X4}
Step2. 针对各个属性下的初等集合寻找下近似和上近似。
以“头疼+肌肉痛+体温”为例,设集合X为患流感的 人的集合,I为3个属性构成的一个等效关系: {p1},{p2,p5},{p3},{p4},{p6}, 则
X={P1,P2,P3,P6} I={{p1},{p2,p5},{p3},{p4},{p6}}
粗糙集在数据挖掘中的应用 基于粗糙集的数据约简
返回
1. 粗糙集在数据挖掘中的应用
粗糙集对不精确概念的描述是通过上、下近似这两 个精确概念来表示的。
粗糙集理论的的数学基础:假定所研 究的每一个对象都涉及到一些信息(数据、 知识),如果对象由相同的信息描述,那 么它们就是相似的或不可区分的。
一种利用属性序关系的变精度粗糙集知识约简方法
第32卷第4期2008年8月江西师范大学学报(自然科学版)J cI U R N A L0FⅡA N GⅪN O R l雌L I『r qⅣER SI TY(N A l r I瓜AI.ScI E N CE)、,01.32N o.4A I l g.2008一种利用属性序关系的变精度粗糙集知识约简方法张玉琢(云南师范大学计算机科学与技术系,云南昆明650092)摘要:变粗糙集模型主要用于包含错误信息或缺失一些重要信息的决策表的知识获取.该文引入了变粗糙集模型和卢上、下分布约简和分布约简(卢约简)的概念,并讨论了它们之间的关系;通过对约简的进一步研究,得到可辩识矩阵及其特性;在此基础上提供了利用属性序关系的约简算法,并通过含有噪声的实例验证了此方法的可行性和有效性.关键词:变粗糙集模型;知识约简;决策表;协调集中图分类号:TP18文献标识码:A自波兰数学家娜l ak提出粗糙集(R S)理论以来,它已被广泛应用于模式识别,机器学习,知识获取,人工智能等领域.但经典粗糙集理论存在一些局限[1.21;对此,研究者对经典粗糙集理论进行了不同的扩展.zi ar ko教授于1993年提出的变精度粗糙集模型心J是其中重要一分支.在该模型中,给定一个阈值,当对象所在的等价类在某种程度上包含于集合j中时,就认为这个对象属于X,这个推广在应用上是非常重要的,因为在实际应用中,绝对的包含有时是不必要的.知识约简是变精度粗糙集研究的重要内容,文献[1‘5]中对此问题有所讨论.归结所讨论的约简方法大致为两大类:一类是利用属性启发式约简算法求得属性约简集,其特点是以属性重要度作为启发式信息bo;二类是利用可辨识矩阵,通过对属性组合的合取和析取操作得到一个属性约简集u圳,但当得到的可辨识矩阵维数较高时。
该算法计算复杂度高,内存消耗量大,并且如何选取满意的特征属性组合是一个待商榷的问题怛12J.本文针对这个问题,提出了一个改进算法,在得出可辩识矩阵后,利用属性序关系求约简的算法,最后,通过具体实例验证该算法的有效性.1变精度粗糙集模型定义1【4】一个信息系统s可以表示为5=(u,C U D,y,.厂),其中u表示对象的非空有限集合,U= {石l,算2,…,‰I;C表示属性的非空有限集合,C={口I,口2,…,口。
多指标综合评价方法研究综述
·开发与创新·0引言多指标综合评价是指人们根据不同的评价目的,选择相应的评价形式,据此选择多个因素或指标,并通过一定的评价方法,将多个评价因素或指标转化为能反映评价对象总体特征的信息[1]。
其中评价指标与权重系数确定将直接影响综合评价的结果[2]。
本文由此从评价指标与权重确定两方面出发,对当前应用神经网络、遗传算法、粗糙集、熵、模糊数学与灰色关联度等相关理论的多指标评价方法作简要综述,并对多指标综合评价方法的未来研究方向作出展望。
1综合评价方法概述[3~6]按照权数产生方法的不同,多指标综合评价方法可分为主观赋权评价法和客观赋权评价法两大类。
其中主观赋权评价法采取定性的方法,由专家根据经验进行主观判断而得到权数,然后再对指标进行综合评价。
如层次分析法、综合评分法、模糊评价法、指数加权法和功效系数法等。
客观赋权评价法则根据指标之间的相关关系或各项指标的变异系数来确定权数进行综合评价。
如熵值法、神经网络分析法、TOPSIS 法、灰色关联分析法、主成分分析法、变异系数法、聚类分析法、判别分析法等。
两种赋权方法特点不同,其中主观赋权评价法依据专家经验衡量各指标的相对重要性,有一定的主观随意性,受人为因素的干扰较大,在评价指标较多时难以得到准确的评价。
客观赋权评价法综合考虑各指标间的相互关系,根据各指标所提供的初始信息量来确定权数,能够达到评价结果的精确,但是当指标较多时,计算量非常大。
由于大多数评价方法其约束条件太多,在实际应用中,经常需要在许多假定的基础上或在进行一系列的变通处理后才能应用相关评价方法。
对此,当前出现了采用神经网络、熵、粗糙集、遗传算法等多种方法集成的思想,来改进评价方法的公正性与精确性。
所谓集成的综合评价方法,就是采用综合集成的思想,将两种或两种以上的方法加以改造并结合,获得一种新的评价方法。
下面就对当前所出现的新评价方法进行比较分析。
2集成的综合评价方法综述2.1基于神经网络的综合评价法人工神经网络ANN (Artificial Neural Network )具有自组织、自学习、自适应、非线性映射等特性,能对多指标综合评价问题给出一个客观的评价。
粗糙集 (ppt)
2
一、 概述
现实生活中有许多含糊现象并不能简单 地用真、假值来表示﹐如何表示和处理这些 现象就成为一个研究领域。早在1904年谓词 逻辑的创始人G.Frege就提出了含糊(Vague) 一词,他把它归结到边界线上,也就是说在 全域上存在一些个体既不能在其某个子集上 分类,也不能在该子集的补集上分类。
12
Issues in the Decision Table
• The same or indiscernible objects may be represented several times. • Some of the attributes may be superfluous.
13
不可区分性Indiscernibility
二、 知识分类
为数学处理方便起见,在下面的定义中用等价关系 来代替分类。 一个近似空间(approximate space)(或知识库)定义 为一个关系系统(或二元组)
K=(U,R)
其中U(为空集)是一个被称为全域或论域(universe) 的所有要讨论的个体的集合,R是U上等价关系的一 个族集。
7
二、 知识分类
设PR,且P ,P中所有等价关系的交集称为P上 的一种不可区分关系(indiscernbility relation) 记作IND(P),即
[x]IND(p)= ∩[x]R RP 注意,IND(P)也是等价关系且是唯一的。
8
二、 知识分类
给定近似空间K=(U, R),子集XU称为U上的一个概念 (concept),形式上,空集也视为一个概念;非空子族集 PR所产生的不可区分关系IND(P)的所有等价类关系的集合 即U/IND(P),称为基本知识(basic knowledge),相应的等 价类称为基本概念(basic concept);特别地,若关系QR, 则关系Q就称为初等知识(elementary knowledge),相应的 等价类就称为初等概念(elementary concept)。 根据上述定义可知,概念即对象的集合,概念的族集(分类) 就是U上的知识,U上分类的族集可以认为是U上的一个知识 库,或说知识库即是分类方法的集合。
3变精度粗糙集方法
上一页
下一页
返回本章首页
粗糙集的扩展理论
β-粗糙近似
令:β=0.6,则β-粗糙近似分别为:
对论域进行划分,可得如下等价类 U/C={X1, X2, X3, X4, X5} 其中,X1={n1, n4,n6},X2={n2},X3={n3},X4={n5},X5={n7} U/D={YN,YP} 其中,YN={n1, n2,n3},YP={n4, n5,n6, n7}
上一页
U n1 n2 n3 n4 n5 n6 n7
a1
1 1 2 1 2 1 2
a3
1 2 1 1 2 1 2
d N N N P P P P
下一页
返回本章首页
粗糙集的扩展理论
由β-约简{a1 ,a3}构造的概率决策规则
表 2.6 由β-约简{a1 ,a3}构造的规则 规则 支持数 1 1 3 2
下一页
上一页 下一页 返回本章首页
粗糙集的扩展理论
β值与分类精度关系
上一页
下一页
返回本章首页
粗糙集的扩展理论
变精度粗糙集的分类质量
上一页
下一页
返回本章首页
粗糙集的扩展理论
变精度粗糙集中的近似约简
上一页
下一页
返回本章首页
粗糙集的扩展理论
概率规则获取
上一页
下一页
返回本章首页
粗糙集的扩展理论
算例 1
对论域进行划分,可得如下等价类: U/C={X1, X2, X3, X4, X5} 其中:X1={n1,n4,n6},X2={n2},X3={n3},X4={n5},X5={n7} U/D={YN,YP} 其中:YN={n1,n2,n3},YP={n4,n5,n6, n7} 求得一个β-约简为{a1,a3 }, β=0.6,则 β{a β=0.6
粗糙集综述word版
粗糙集论文题目 粗糙集综述1 粗糙集属性约简1.1 经典粗糙集属性约简对于经典粗糙集我们可以用上下近似来描述。
给定知识库()R U K ,=,对于每个子集U X ⊆和一个等价关系()K ind R ∈,定义两个上下近似:{}{}.|/,|/ U U φ≠⋂∈=⊆∈=X Y R U Y X R X Y R U Y X R 另外上下近似还可以用以下的等式表达:[]{}[]{}.|,| U U φ≠⋂∈=⊆∈=X x U x X R X x U x X R R R 当利用区分矩阵来表达知识时有许多优点,特别是他能很容易计算约简和核。
约简是满足能区别由整个属性集区别的所有对象的属性极小子集。
如果A 包含B 是满足B 交区别对象x 和y 的所有属性集合的极小子集不为空,且区别对象x 和y 的所有属性集合的极小子集不为空,则B 是A 的一个约简。
核是区分矩阵中所有单个元素组成的集合。
对于决策表,C 为条件属性集,D 为决策属性集,决策表S 的区分矩阵是一个n n ⨯矩阵,其任一元素为},x ),(),(|{),(a *)(且y a y f a x f C a y x ω≠∈=对于满足),(,,x y x U y ω∈)(y )(x D pos D pos C C ∉∈且,或者)(y )(x D pos D pos C C ∈∉且,或者).(),()(,D ind y x D pos y x C ∉∈且如果φφ≠∀≠⋂⊆),(,),(C C C **''y x a y x a 满足条件的极小子集(关于包含),则'C 是C 的D 约简(相对约简).D 核(相对核)是决策表S 的区分矩阵中所有单个元素组成的集合,即}.,},{),(a |{)(core *U y x a y x C a C D ∈=∈=其中1.2 变精度粗糙集属性约简变精度粗糙集是粗糙集的扩充,它是在基本粗糙集模型的基础上引入)5.00(<≤ββ,即允许一定程度的错误分类率存在。
基于VPRS的决策树分类算法
21 0 2年 第 7期
福 建 电
Hale Waihona Puke 脑 基于 V R P S的决策树分 类算 法
朱 一 飞 .武琳 琳 (1 郑 州 大学信 息 工程 学 院 郑 州 河 南 4 0 0 、 50 1
2、 河 水 利 职 业技 术 学 院 开 封 河 南 4 5 0 ) 黄 703
【 摘 要 】 本 文将粗 糙 集理 论 应 用到 决 策树 生成过 程 中 ,利 用 变精 度粗糙 集理 论属 性 约 简 : 的特 性在 决 策树 生成过 程 中在 保 证 分类 能 力不 变的前提 下减 少分 支数 目,并考虑 到 实际 问题 中
