集群系统中基于MPI的关联规则快速挖掘算法
3算法理论分析
(1)算法的并行性能分析 假设每个结点的DB,具有D/.个事务,咒为并 行计算结点的数量,假设需要挖掘的项目集I的大小 为忌,则最多有2‘个项集,每次对数据库的扫描时间 为t。,则串行时间为2kt。,串行的时间复杂度T。=O (2‘).每个分结点的并行运行时间为2't。/n,主结点 的运行时间为t。,最坏情况下并行运行的计算时间为 t。+咒*2kt。/n,在阶的意义下并行代价等于最坏情况 下串行的代价,具有代价最佳的并行性. (2)算法的加速比分析 并行运行的时间t。由两部分组成:计算部分£。。 和通信部分£一。,t,=tc。。+t。。。. 上述算法中,如果项集X在结点i是局部频繁 的,则其通信量的复杂度为0(n),£。。。=咒(t。。。+ wtdat。),t。。。。是消息时延,t‰是发送单位数据的时
性质1 E6] 对于Xp,X。∈J,Xp,X。有且只有志一 2个元素相同的充要条件是length(Bxp or Bx。)一忌.
由Apriori算法和性质l有,如果X,,鼍∈ LLk~l(_f),length(Bxp or Bx。)=志,则,可以组成结点
J上的局部候选是项集X,U X。.以下用m位二进制 数P代表项集X,,m位二进制数q代表项集X。.
2.3从结点的局部频繁项目集的生成与支持度计算
(1)局部频繁项目集的生成算法 输入:分发到结点i的正一1项全局频繁项目集Gk一-
(i).
输出:局部频繁女项集LL。(i)
Apriori_gen() {LL。(i)=予;
for each pEGL,一I(i) for each口∈GLI—l(i)//口≠P {夕q=P Og q}//生成新的七序列
第32卷第1期 2010年2月
三峡大学学报(自然科学版) J of China Three Gorges Univ.(Natural Sciences)
V01.32 No.1 Feb.2010
集群系统中基于MPI的关联规则快速挖掘算法
安立奎1 钱伟懿1 韩丽艳2
(1.渤海大学数学系,辽宁锦州 121003;2.渤海大学公共计算机教研部,辽宁锦州 121003)
本文参照了文献[6]的算法,给出了一种在集群 系统中用MPI实现的基于二进制的关联规则算法, 该算法具有实用性强,并行可扩展性好,实现难度低 和高效率等优点.
收稿日期:2009—09—29 基金项目:国家自然科学基金资助项目(10871033);辽宁省高等学校科研项目资助计划(2008004);辽宁省教育厅A类项目(2009A034) 通讯作者:安立奎(1978一),男。讲师.硕士。软件设计师,主要研究方向为数据挖掘。并行与分布式计算.E-mail..an_likui@163.com
(1.Department of Mathematics,Bohai Univ.,Jinzhou 121003,China;2.Department of Public Computers, Bohai Univ.,Jinzhou 12 1003,China)
Abstract Cluster is a kind of distributed storage system,which mostly adopts the method of message passing to realize the communication between every node.Through the interface for message passing of MPI,puts forword a fast parallel algorithm for mining association rules based on binary data storage and eomputating, which needs only some logic operations such as‘and’,‘or’and‘xor’,decreases the realizing difficulty,re— duees the network traffic and increases the mining efficiency.It is proved theoretically that the algorithm has the advantage of improving the effectiveness and scalability of mining association rules. Keywords cluster;parallel computation; MPI; association rules
行户口2户口’ for(i=1,Count
O;i<一优&&npq!=O;i++)//统
万方数据
第32卷第1期
安立奎等 集群系统中基于MPI的关联规则快速挖掘算法
97
计npq中1的个数 if(npq and 0x01) {count++: 订户q=npq>>1}//逻辑右移1位 } if(count==志)//p,q可以合并生成候选k项集 {for(i=1,6=0x01;i<=研;i++) n=户qXOr b;//T/是加的k一1项子集 if r/∈GL.。(i)//n不是频繁k一1项集 break; ) if(i=一研)//Pq的所有k一1项子集都是频繁k一1项
定义I r63 事务(项集)一二进制数关系.给定J= {il,i2,…,i。),称,:T×(X×D-*b。b2…b。一lb。为事 务(项集)一二进制数关系,并称b=b。bz…b。一-b。为 事务T(项目集X)所对应的二进制数,记为B,(B,), 其中6,∈{0,1},且如果项i,∈T(i,∈X),则6f=l,否 则,6,=0,_『=1,2,…,m.对项目集X∈J,B,中1的 个数成为X的长度,记为length(X).例如:X={Jt, J‘,J5),B,=10011,length(B,)=3.
集 LL^(i)一LL^(i)UPq } return LL★(i); }
(2)项集的局部支持度计算方法
输入:局部频繁k项集LL^(i) 输H{:^jI鄂频繁女项集LL·(i)每一项的支持度 Support—caculate() {for each tEDB。//DB。是局部事务数据库,由主结点分 发 for each P∈LLI(i) if(P ort一一f) P.sup++l }
发送到各个结点.(5)重复(1)~(4)直到没有新的局
部频繁项集产生. 2.2中心主结点的算法描述
输入:从结点i的局部候选矗项集LL。(i)i一1,2,…,押.
输出:全局频繁候选女项集GL。(D). 女=1}G(五(D)一垂;all=0; for(i=1;i<=行;i++)
{G6I(D)=o包(D)ULL^(i); if(LLI(i)=一中)all++I
MPI拥有一个上百个函数构成的函数库.用 MPI构建一个并行计算环境主要用到六个函数.函 数名分别为:MPI—Init,MPI—Comm—Size,MPI-comm- Rank,MPI—Send,MPI—Recv,MPI—Finalize.MPI—Init 和MPI—Finalize实现MPI环境的初始化和结束; MPI—COMM—woRLD通信因子是在MPI环境初始 化过程中创建的,MPI-Commm—Size获取缺省组 (Group)的大小;MPI—Comm—Rank获取本进程在缺 省组中的逻辑号(从0开始);MPI—Send和MPI—Recv 实现消息的传递"].MPI主要处理点对点和集合两种 通信.本文的算法采用的是主从式并行I/0调控策 略.在集群中有一个结点为主结点(通常是0结点)其 他为从结点,它们之间通过高速网络进行连接,各从 结点与主结点交互数据,不用彼此交换数据,减少了 通信量,有较好的扩展性. 1.2数据的二进制表示及其性质
关键词:集群系统; 并行计算; MPI; 关联规则
中图分类号:TP393
文献标识码:A
文章编号:1672-948X(2010)01-0095-03
Reseach on Fast Algorithm Based Oil MPI for Mining Association Rules in Cluster An Likuil Qian Weiyi Han Liyan2
性质2‘63 对于m位二进制数p和q,如果P or q=p,则X。∈Xp.
2 改进算法
2.1 算法思想 主结点首先把事务数据库DB利用定义1进行
预处理,把得到的新的事务数据库均匀地分发到从结
点i上Ⅲ,i=1,2,…,n,每个从结点有自己的事务数
据库DB;.(1)在结点J中利用GL。一-(J)产生局部候
if(all==挖)exit(0)l//没有新的局部频繁项集产生 for each pEGG(D)//计算GGk(D)中所有项集P的全 局支持度
for each q∈LLk(D)
if(P xor q==O)//P与q相同 P.sup+一q.sup; }
for each pEGGl(D)
if(p.sup<艿D)GG·(D)=GGl(D)一P,
(_f)≥艿Di,X的全局支持度X.sup=∑X.sup(j),如
果X.sup>iceD,则称X是频繁项集.在第.『个数据库 生成的惫项目候选集用CL。(J)表示,在第J个数据 库生成的是项目频繁项集为局部频繁项目集,用Lk (歹)表示,在全局数据库D中生成的是项频繁项集为 全局项集,用GL。(D)表示,发送到第J个结点上的全 局走项集用GL^(j)表示.
联规则的挖掘算法主要有[1]Agrawal等提出的基于 Apriori算法的频集方法.为了提高关联规则的挖掘 效率,研究人员又提出了并行挖掘算法,主要包 括:[2引Agrawal等人提出的CD算法,Park等人提出 的PDM算法,Chueng等人提出了FDM和DMA算 法.这些算法虽然具有速度快、容易实现等优点,但也 存在着可扩性较差、候选项集大、规则合成难度高等 缺点.
高效的基于动态数据更新的关联规则挖掘算法
高效的基于动态数据更新的关联规则挖掘算法
刘松;林海萍
【期刊名称】《计算机系统应用》
【年(卷),期】2005(000)005
【摘要】在本文中,我们针对动态关联规则挖掘问题提出两个有效的处理算法,即EIM-A和EIM-G算法.它们能根据数据库的动态变化,高效地进行关联规则的更新.通过知识数据库的维护,最多只需要扫描原始数据库一次,就能得到所需的频繁项目集,能有效地降低更新关联规则所需的成本.
【总页数】5页(P51-54,58)
【作者】刘松;林海萍
【作者单位】广州,广东商学院信息学院,510320;广州,广东商学院信息学
院,510320
【正文语种】中文
【中图分类】TP3
【相关文献】
1.基于预判筛选的高效关联规则挖掘算法 [J], 赵学健;孙知信;袁源
2.基于等价类规则树的高效关联规则挖掘算法 [J], 刘晓蔚
3.基于Apriori的高效关联规则挖掘算法在教育考试系统中的应用研究 [J], 冯璐妹;赵建宁
4.基于高效关联规则挖掘算法的智能评卷模型研究 [J], 陈艺
5.一种基于压缩矩阵的高效关联规则挖掘算法 [J], 潘俊辉; 张强; 王辉; 王浩畅
因版权原因,仅展示原文概要,查看原文内容请购买。
关联规则挖掘算法
关联规则挖掘算法关联规则挖掘算法的核心思想是寻找频繁项集和关联规则。
频繁项集是指经常同时出现的物品集合,而关联规则是指物品之间的关联关系。
关联规则通常以“如果...那么...”的形式呈现,表示不同物品之间的逻辑关系。
有多种关联规则挖掘算法可供选择,其中最常见的包括Apriori算法、FP-growth算法和Eclat算法。
Apriori算法是最早也是最著名的关联规则挖掘算法之一、它基于Apriori原理,即如果一个项集是频繁的,那么它的所有子集也一定是频繁的。
该算法首先通过扫描数据集来确定频繁项集,然后使用频繁项集生成关联规则。
FP-growth算法是一种基于分析树结构的快速关联规则挖掘算法。
它通过构建频繁模式树(FP-tree)来发现频繁项集和关联规则。
FP-growth算法相对于Apriori算法具有更高的效率,因为它不需要生成候选集,而是通过对数据集的多次扫描来构建FP-tree。
Eclat算法是一种基于垂直数据表示(vertical data representation)的关联规则挖掘算法。
它将项集表示为其在事务中的出现位置的集合,通过递归地挖掘次数递减的频繁项集来生成关联规则。
Eclat算法更适用于稠密数据集,因为它只需要对数据进行水平扫描。
关联规则挖掘算法的应用非常广泛。
在市场营销中,它可以帮助企业发现产品之间的关联关系,从而进行有针对性的推广和销售。
在电子商务中,它可以通过分析用户的购买记录来推荐相关产品。
在医疗领域中,它可以帮助发现潜在的疾病风险因素。
在社交网络分析中,它可以用于发现用户之间的关联关系和行为模式。
总结来说,关联规则挖掘算法是一种强大的数据分析工具,可以帮助分析人员发现数据中的隐藏模式和规律。
不同的算法有不同的优势和适用场景,选用合适的算法可以提高挖掘效率和准确性,从而为决策提供有价值的参考。
集群系统中基于MPI的并行GMRESm计算通信的研究及应用
1
引言
在实际应用中,方程组的求解往往计算量巨大.
GMREs(m)算法进行了并行化分析,并应用可移植 消息传递标准MPI的集群通信机制在分布式存储 并行系统上设计和实现了GMREs(m)并行算法,最 后将该算法应用于弹性边界元问题的求解中,经过 数值实验和实际应用.
1986年由Y.Saad和M.H.chltz提出的GMRES方 法就是一种求解大型稠密非对称线性方程组的 Krylov子空间投影法,目前广泛应用于计算力学、 计算数学等工程领域.于春肖、杨爱民等[1-2]提出改 进GMREs(m)算法收敛性的一种预条件方法.陈一 鸣、杨爱民等[3-4J利用分治策略对GMRES方法进行 了并行处理.除上述方法外,文中通过有效的对
Parallel
Computation Communication and Application of GMRES(m)Based on MPI in Cluster System
YANG Ai—minl,LIU Ren2,ZHAO Guang—hua3,CUI Yu—huanl (1 College of Science,Hebei Ploytechnic University,Tangshan
设有单个带空弹性体A(20m×20m×2.5m,
3mX 2.5m),其一端固定的情况下受拉力的计算模
型.其中A物体的弹性模量E=210GPa,泊松比勘 =0.3,所受到的均布载荷P=104MPa.
计算中取并行GMRES(ITI)中优=20,P=8
时,计算的误差分别为:
RKI=2.3666678562411454E一005;
stability through
has
better computing precision,better efficiency and better
集群系统中基于MPI的关联规则快速挖掘算法
wh c e d n y s m e l g c o e a i n u h a ‘ n , o ’ n ‘ o ’ e r a e h e l i g d fi u t ,r — i h n e s o l o o i p r to s s c s a d’ ‘ r a d x r ,d c e s s t e r a i n i c ly e z f d c s t e n t r r f i a d i c e s s t e m i i g e f i n y I sp o e h o e ia l h tt e a g rt m a u e h e wo k t a f n n r a e h n n fi e c . ti r v d t e r tc l t a h l o ih h s c c y
集群 系 统 (lse) 称机 群 系统 指“ cu tr也 利用 高 速通
联 规则 的挖 掘 算 法 主要 有 【 Aga l 提 出 的基 于 1 rwa 等 ] Ap ir算 法 的频 集 方 法. 了提 高关 联 规 则 的挖 掘 r i o 为 效 率 , 究 人 员 又 提 出 了 并 行 挖 掘 算 法 , 要 包 研 主 括 :- Aga l [5 rwa 等人 提 出的 C 算法 , ak等人 提 出 2] D Pr 的P DM 算法 , h e g等 人 提 出 了 F M 和 D C un D MA 算
B h iUnv o a i.,Jn h u 1 1 0 ,Ch n ) iz o 2 0 3 ia
Ab t a t Cl s e s a k nd o i ti ut d s o a e s s e ,whih mos l do s t e me h fme s g s i g sr c u t r i i fd s r b e t r g y t m c ty a pt h t od o s a epa s n t e l e t omm u c ton be we n e e y n e Th o gh t e i e f c o e s ge p s i g o PI o r a i he c z nia i t e v r od . r u h nt r a e f r m s a a s n f M ,pu s t f wor a tp r le l rt m o n n s o i to u e s d o na y da a s o a nd e m pu a i or d a f s a a l la go ih f r mi i g a s ca i n r l s ba e n bi r t t r ge a o t tng,
基于遗传算法的双向关联规则挖掘
基于遗传算法的双向关联规则挖掘
曾令明;金虎
【期刊名称】《微电子学与计算机》
【年(卷),期】2006()z1
【摘要】关联规则挖掘是数据挖掘和知识发现中一门重要技术,但基于支持度-置信度框架的关联规则挖掘存在一些问题。
文章引入了双向关联规则的概念,实现了基于遗传算法的双向关联规则挖掘算法。
实验证明,它能弥补传统关联规则挖掘算法的不足。
【总页数】3页(P35-37)
【关键词】数据挖掘;双向关联规则;遗传算法
【作者】曾令明;金虎
【作者单位】成都信息工程学院网络工程系;四川大学计算机学院
【正文语种】中文
【中图分类】TP311.13
【相关文献】
1.基于遗传算法的农产品评价信息关联规则挖掘 [J], 王玉珍;周朝进;王倩
2.基于遗传算法的关联规则挖掘技术在体质监测分析中的应用 [J], 彭中莲
3.基于自适应遗传算法的多维数据关联规则挖掘 [J], 闫磊;何志方;赵文娜;李远;姚非
4.基于信息熵与遗传算法的并行关联规则增量挖掘算法 [J], 毛伊敏;邓千虎;陈志刚
5.基于遗传算法的建筑安全事故关联规则挖掘 [J], 刘强;杨壹
因版权原因,仅展示原文概要,查看原文内容请购买。
一种快速的关联规则挖掘算法
一种快速的关联规则挖掘算法
李涛
【期刊名称】《软件导刊》
【年(卷),期】2007(000)012
【摘要】关联规则挖掘向来是数据挖掘的一个重要领域,挖掘算法也层出不穷。
本文在深入分析FP树特性的基础上,改进了FP树的构造过程,通过一次扫描事务数据库即可生成FP树。
从而缩短了关联规则挖掘时间,提高了效率,实验验证了其有效性。
【总页数】2页(P140-141)
【作者】李涛
【作者单位】南京信息工程大学电子与信息工程学院通信工程系;江苏南京210044
【正文语种】中文
【中图分类】TP301.6
【相关文献】
1.一种改进的基于关系矩阵的关联规则快速挖掘算法 [J], 王安;仇德成;安云峰;王继伟
2.一种基于决策树的快速关联规则挖掘算法 [J], 陈雪飞
3.一种基于矩阵结构的快速关联规则挖掘算法 [J], 何胜文;周绍梅;雷昌瑜;陈丽君
4.一种基于SFP树的快速关联规则挖掘算法 [J], 李龙澍;王永;魏博诚
5.一种基于MFP树的快速关联规则挖掘算法 [J], 李志云;周国祥
因版权原因,仅展示原文概要,查看原文内容请购买。
一种基于MapReduce的关联规则挖掘算法
一种基于MapReduce的关联规则挖掘算法周国军【期刊名称】《玉林师范学院学报》【年(卷),期】2014(35)5【摘要】本文从减少I/O时间的角度出发,结合云计算Hadoop平台的MapReduce模型,提出了一种基于MapReduce的关联规则挖掘算法。
算法采用幂集计算候选项集,采用MapReduce模型在多个节点上并行找出所有频繁项集,只需要扫描事务数据库1次。
实验结果表明:在事务的平均项长较小的情况下,算法具有很好的加速比和数据规模增长性。
%From the viewpoint of reducing I/O time, according to MapReduce of Hadoop platform of cloud computing, this paper presents an algorithm for mining association rules based on MapReduce. The algorithm uses power set to compute candidate itemsets, and finds all frequent itemsets in parallel with MapReduce model, which scan the transaction database only once. Experimental result shows that the algorithm can achieve a good speedup and data sizeup under the condition that the length of itemset in transaction is not very longer .【总页数】7页(P128-134)【作者】周国军【作者单位】玉林师范学院数学与信息科学学院,广西玉林 537000【正文语种】中文【中图分类】TP311【相关文献】1.一种基于MapReduce的压缩矩阵关联规则挖掘算法 [J], 安建瑞;王海鹏;张龙波;金超;怀浩2.一种基于MapReduce的压缩矩阵关联规则挖掘算法 [J], 安建瑞;王海鹏;张龙波;金超;怀浩;3.基于MapReduce的隐私保护的关联规则挖掘算法的研究 [J], 熊富蕊;桑应朋;4.基于MapReduce计算模型的并行关联规则挖掘算法研究综述 [J], 肖文;胡娟;周晓峰5.基于MapReduce的关联规则挖掘算法的研究及应用 [J], 罗海洋因版权原因,仅展示原文概要,查看原文内容请购买。
基于MapReduce计算模型的并行关联规则挖掘算法研究综述
炸性增长,人类已经进入了大数据时代,传统的关联规则挖掘 算法已经不能适应大数据挖掘的要求,主要困难是:单一计算 机无法存储所需要挖掘的所有数据及挖掘过程中产生的中间 结果;挖掘过程所需要的内存远远超过单一机器的存储量;计 算时间太长无法忍受等。需要开发分布式、并行关联规则挖掘 算法解决上述问题。
数据挖掘(datamining)又称做知识发现(knowledgedisco verindatabase,KDD),其目的在于发现大量数据集中有价值的 隐含信息。常见的数据挖掘任务有关联规则挖掘、分类、聚集、 离群点检测等。关联规则挖掘是最重要的数据挖掘任务之一, 由 Agrawal等人[1]提出,其目的是发现事务(项)之间存在的隐 含关联。关联规则挖掘一般分为两个阶段,即发现频繁项集和 根据频繁项集产生关联规则。由于根据频繁项集产生关联规 则相对容易实现,所以关联规则挖掘研究主要关注的是如何在 数据集中找到频繁出现的项集,这个过程也称为频繁项集挖掘 (frequentitemsetsmining)或 频 繁 模 式 挖 掘 (frequentpatterns mining)。传统的关联规则挖掘算法主要可以分为三类:a)产 生—测试方法,通过迭代产生候选频繁项集并进行分别计数, 统计得到频繁项集,典型的算法是 Agrawal等人[2]提出的算法 及其一系列的改进算法,如 DHP[3,4]、DIC[5]等;b)模式增长方 法,它不用产生候选项集,而是将所有频繁项压缩成一种特殊 的数据结构(一般为树结构),通过在数据结构上进行遍历直 接产 生 频 繁 项 集,典 型 的 算 法 有 FPGrowth[6]、LPtree[7]、 FIUT[8]、IFP[9]、FPL/TPL[10]等;c)垂 直 格 式 方 法,是 将 水 平 格 式的数据集转换成垂直格式,通过交运算来得到频繁项集,典 型的算法有 Eclat等。
关联挖掘算法
关联挖掘算法
关联挖掘算法是一种在大规模数据集中寻找频繁项集或关联规则的算法。
它可以帮助我们发现哪些项经常同时出现(频繁项集),或哪些项之间有着某种关系(关联规则)。
以下是一些关联挖掘算法的简介:
1. Apriori算法:Apriori算法是一种经典的关联挖掘算法,其基本思想是从单项集开始,利用迭代和尝试的方式逐步生成更大的项集。
Apriori算法的算法时间复杂度较高,但可以快速地找到频繁项集。
2. FP-Growth算法:FP-Growth算法是一种基于FP树的关联挖掘算法。
FP树是一种高效的数据结构,它可以大大降低挖掘频繁项集的时间复杂度。
与Apriori算法不同,FP-Growth算法不需要生成候选项集,因此可以大幅度提高性能。
3. Eclat算法:Eclat算法是一种基于垂直数据格式的关联挖掘算法,可以大幅度提高挖掘频繁项集的效率。
Eclat算法利用深度优先搜索算法来逐步生成频繁项集。
4. 关联规则挖掘算法:这是一种基于频繁项集的关联规则挖掘算法。
它的基本思想是根据物品的出现频率和置信度,找到一些特定的规则或关联关系。
总之,关联挖掘算法是一种帮助我们发现数据集中项之间关系的重要
1/ 2
技术,可以应用于市场营销、推荐系统、网络安全、医学诊断等领域。
2/ 2。
基于云计算的关联规则挖掘算法
关联 规则 … 挖掘 可 以发现 大量 数据 中项集 之 间有 趣 的关联 或相关 联 系 。随着 大量数 据不 停地
2 云计算 及关 键技术
据 库里 出现 的频率 , 项集 的支 持度 是 包 含 的
事 务在 数据库 D 中所 占的百分 比 , 计算式 为 : 其
sp o )= u p n( () 1
是 一种计 算模 式 , 也是 一 种 全 新 的 商业 模 式 。云
计 算 ( l dC m uig 是 分 布 式 处 理 ( i r ue Co o p t ) u n Ds i td tb C m uig 、 行 处 理 ( aa e C mp t g 和 网 格 o pt )并 n P rl l o ui ) l n
恰 当地 设 置 两 个 额 外 参 数 , 能 够 保 证 挖 掘 才
的效果 , 通 过 R d c 再 e ue函数 的程 序 将 结 果 汇整 ,
输 出要 得 到的结 果 。
笔 者 在 M p eu e框架 下 , A r r 算法进 aR d c 对 pi i o
行研究 , 效地 实现 了关 联 规则 的挖掘 。 有 3 云计 算下 的关联 规则挖 掘 3 1 关 联规则 挖 掘 的定 义 . 设 医疗信 息 活 动 中产 生 一 个 事 务数 据 库 , 记 为 D, D中 的事 务数 为 J 设 D包 含 n个 不 同 记 1 D .
其 中 D( ) 数 据 库 D 包 含 的 事 务 数 。 是
