一种基于节点分裂的重叠社区发现算法

合集下载

基于中心节点重叠社区发现的协同过滤推荐系统

基于中心节点重叠社区发现的协同过滤推荐系统

第6卷第4期 沈阳工业大学学报(社会科学版) Vo1.6 No.4 

2 0 1 3年1 0月 Journal of Shenyang University of Technology(Social Science Edition) Oct.2 0 1 3 

doi:10.7688/j.issn.1674—0823.2013.04.12 

基于中心节点重叠社区发现的协同过滤推荐系统水 

侯强,孙瑜 

(沈阳工业大学管理学院,沈阳110870) 

摘要:针对传统协同过滤中对整个用户网络进行运算的数据量较大、推荐效率不高的问题,将用 户—项目二分网转化为由用户构成的社会网络,基于中心节点重叠社区发现的思想进行加权网社区 划分以充分利用网络结构信息。在社区内部采用加权相似度与top—n算法相结合的方法进行项目推 荐,并将Movie Lens数据集作为测试数据。通过与传统协同过滤的对比可见,基于中心节点重叠社 区发现的top—n算法的个性化推荐方法在保证推荐精度的前提下,使推荐效率得到大幅度提升。 关键词:电子商务;协同过滤;推荐系统;中心节点;社区发现;社会网络;加权网;top.n算法 中图分类号:F713 文献标志码:A 文章编号:1674—0823(2013)04—0358—04 

电子商务个性化推荐系统是利用电子商务网 

站向用户提供产品信息和相关建议,帮助用户决 

定购买什么产品,通过模拟销售人员帮助用户完 

成购物过程的系统 J5 船。电子商务替代了传统 

的商业交易行为和流程,趋于向网络模式转移。 

淘宝网发布的2011年网购数据显示,2011年交 

易额达5O亿元人民币,同比增速达到150%, 

2012年预测服务市场规模将达到125亿。这种 

网络消费蓬勃发展的趋势,使电子商务系统的结 

构日趋复杂,海量信息的涌现也给用户的筛选造 

成了极大的困扰。信息过载问题使用户很难从中 

发现自己感兴趣的商品,而网络中的“暗信息”也 

一种基于完全子图与标签传播的重叠社区检测算法

一种基于完全子图与标签传播的重叠社区检测算法

一种基于完全子图与标签传播的重叠社区检测算法

桂琼;邓锐;程小辉;吕永军

【摘 要】提出了一种基于完全子图和标签传播的重叠社区检测CLPOA算法.该算法首先搜寻完全子图,并为每个子图分配唯一标签,实现快速标签预处理;然后根据每个节点的邻接节点标签来更新该节点的标签,同时提出接触频数优化标签选择策略降低标签随机传播概率;最后,通过网络标签分布情况进行社区划分.选取两个小规模标准数据集和两个大规模网络数据集进行实验,结果表明CLPOA算法能保持和COPRA算法相同社区划分质量,同时具有更好的算法稳定性和时间性能.

【期刊名称】《桂林理工大学学报》

【年(卷),期】2018(038)003

【总页数】9页(P561-569)

【关键词】复杂网络;社区发现;完全子图;标签传播

【作 者】桂琼;邓锐;程小辉;吕永军

【作者单位】桂林理工大学信息科学与工程学院,广西桂林 541004;桂林理工大学广西嵌入式技术与智能系统重点实验室,广西桂林 541004;武汉理工大学信息工程学院,武汉 430070;桂林理工大学信息科学与工程学院,广西桂林 541004;桂林理工大学信息科学与工程学院,广西桂林 541004;桂林理工大学广西嵌入式技术与智能系统重点实验室,广西桂林 541004;桂林理工大学信息科学与工程学院,广西桂林

541004

【正文语种】中 文 【中图分类】TP311

0 引 言

随着互联网和通信技术迅速发展,网络规模不断扩大,节点间关系越来越复杂,从而形成大量复杂网络。近年来,复杂网络研究引起众多学者广泛关注,涉及系统科学、统计物理学、社会科学、生物学等多个领域,大多复杂网络都存在社区结构这一特性[1]。社区结构是指网络中每个社区内部节点相互连接紧密,而不同社区间节点连接相对稀疏。社区结构发现能在一定程度上反映出真实网络的拓扑关系,同时可以挖掘网络中隐藏信息,帮助人们更好地利用和改造网络。然而,许多复杂网络社区存在重叠现象,重叠节点同时属于多个社区,重叠社区的出现对社区发现领域提出新的挑战。

基于网络中节点间紧密度的层次聚类社区发现算法

基于网络中节点间紧密度的层次聚类社区发现算法

在网络理论研究中,数量巨大的节点以及节点之间复杂的交互关系构成了复杂网络和复杂网络的网络结构。用数学语言表达,即一个图有着足够复杂的拓扑

结构特征[1]。复杂网络中的一种普遍现象就是社区现象,它表达了社区中的个体

具有某一方面共同特征的性质。社区发现在很多学科有重要应用,如在计算机学科中,增强网络销售功能、提高网络服务质量等;在社会学中,发现动物社会组

织结构、揭示政府职能构成和运行方式、发现某一领域的科学家群组等;在生物

学领域功能基因聚类等。 近年来,科学家们提出了关于社区发现的很多新方法。本文首先介绍了几种

常见的复杂网络以及其的特性。在此基础上介绍了基于迭代二分法(Iterative

Bisection)的Kernighan—Lin算法、谱二分法(Spectral bisection),基于去边方法

的G-N算法、Radicchi算法,层次聚类法(Hierarchical Clustering)和W-H算法。

分析了这些算法的时间复杂度等因素,指出了它们的优势和不足,并且还给出了

这些算法的适用范围。 本文的主要研究内容是基于网络中节点间紧密度的层次聚类社区发现算法。

在层次聚类算法中,传统的节点间紧密度的计算方法主要是基于网络的拓扑结

构,如余弦相似性(cosine similarity)、欧拉距离和皮尔逊系数(Pearson correlation coefficient)等。本文节点间相似度的计算是基于节点之间信息交流来往的频率,

即节点间边权值的大小来衡量节点的紧密度。两个节点之间交流越频繁,说明这

两个节点的紧密度就越高,同属于一个社区的可能性就越大。将计算出来的紧密度值存储与紧密度二叉堆中。同时把节点之间的相似度计算扩展到社区之间,更

新紧密度二叉堆中的值,利用二叉堆中的值,合并社区,直到社区的合并结果满

足某一条件为止。实验表明,该方法能较好且合理的发现社区结构。

关键词:社区发现;复杂网络;社区结构;层次聚类

一种基于局部拓展的并行重叠社区发现算法

一种基于局部拓展的并行重叠社区发现算法

一种基于局部拓展的并行重叠社区发现算法

张忠正;李建武

【期刊名称】《计算机科学》

【年(卷),期】2016(043)009

【摘 要】处理海量级数据的有效途径之一是将算法分解为一系列互不依赖的任务,然后利用开源工具并行地执行算法.而在重叠社区发现算法中,基于局部拓展的方法在拓展阶段往往仅需要局部社区及其相应的邻居结点的信息,因而具备可并行执行的可能性.提出了一种可并行化执行的局部拓展算法,并借助开源工具Spark将其实现.算法分为4个阶段.首先,挑选出一组不相关的中心结点并使用其对应的局部网络作为种子;其次,通过删除本身连接不是很紧密的局部网络来过滤选出的种子;然后,采用一种批量式的拓展策略来拓展种子,即一次向局部社区中添加一批邻居结点或从社区中删除一批结点;最后,融合相似的社区.在人工生成的网络以及真实世界中的网络上的实验结果显示,所提算法既准确又高效.

【总页数】5页(P61-65)

【作 者】张忠正;李建武

【作者单位】北京理工大学计算机学院 北京100081;北京理工大学计算机学院 北京100081

【正文语种】中 文

【中图分类】TP181

【相关文献】 1.基于局部语义聚类的语义重叠社区发现算法 [J], 辛宇;杨静;汤楚蘅;葛斯乔

2.基于局部扩充的社区发现算法并行化研究 [J], 龙渊;张健博

3.一种基于局部扩展优化的重叠社区发现算法 [J], 李慧;杨青泉;王慧慧

4.基于节点重要性和局部扩展的重叠社区发现算法 [J], 郭峰;尤凯丽;李昕泽

5.基于局部扩充的社区发现算法并行化研究 [J], 龙渊;张健博

因版权原因,仅展示原文概要,查看原文内容请购买

基于图嵌入和多标签传播的重叠社区检测算法

基于图嵌入和多标签传播的重叠社区检测算法

基于图嵌入和多标签传播的重叠社区检测算法

高兵;宋敏;邹启杰;秦静

【期刊名称】《计算机应用研究》

【年(卷),期】2024(41)5

【摘 要】为进一步优化重叠社区检测算法,提出了一种新的基于度和节点聚类系数的节点重要性定义,按照节点重要性降序更新节点,固定节点更新策略,提高社区检测的稳定性。在此基础上,提出了一种基于图嵌入和多标签传播的重叠社区检测算法(overlapping community detection based on graph embedding and multi-label propagation algorithm,OCD-GEMPA)。该算法结合node2vec模型对节点进行低维向量表示,构建节点之间的权重值矩阵,根据权重值计算标签归属系数,据此选择标签,避免了随机选择问题。在真实数据集和人工合成数据集上对该算法进行实验验证。实验结果表明,与其他重叠社区检测算法相比,OCD-GEMPA在EQ和NMI这两个指标都有明显提升,具有更好的准确性和稳定性。

【总页数】6页(P1428-1433)

【作 者】高兵;宋敏;邹启杰;秦静

【作者单位】大连大学信息工程学院;大连大学大连市智慧医疗与健康重点实验室;大连大学软件学院

【正文语种】中 文

【中图分类】TP391

【相关文献】 1.一种基于完全子图与标签传播的重叠社区检测算法2.基于节点亲密度的标签传播重叠社区发现算法3.一种基于标签传播的重叠社区发现算法4.基于标签传播的重叠社区检测算法5.基于标签传播与多指标的重叠社区检测算法

因版权原因,仅展示原文概要,查看原文内容请购买

louvain算法例子

louvain算法例子

louvain算法例子

Louvain算法是一种用于社区发现的基于模块度优化的算法。它通过迭代将节点划分为不同的社区,并在每次迭代中优化模块度得分,以找到最优的社区划分。下面以Louvain算法为例,讲解其原理和应用。

1. Louvain算法简介

Louvain算法是一种层次聚类算法,它通过优化网络的模块度得分来划分网络中的社区。模块度是一种衡量网络划分质量的指标,它度量了网络内部节点之间连接的紧密程度与社区之间连接的稀疏程度。Louvain算法的核心思想是在每次迭代中,将节点划分为不同的社区,并计算新的模块度得分,然后不断迭代直到模块度不再增加为止。

2. Louvain算法的步骤

Louvain算法的步骤包括两个阶段:第一阶段是将每个节点划分为单独的社区;第二阶段是优化社区划分,合并具有最大模块度增益的社区。

2.1 第一阶段:初始化

在第一阶段,每个节点被初始化为一个单独的社区。然后,对每个节点进行迭代,计算将该节点移到其邻居社区时的模块度增益,并选择增益最大的社区进行移动。重复此过程直到没有模块度增益为止。

2.2 第二阶段:合并社区

在第二阶段,将所有属于同一个社区的节点合并为一个超级节点,并根据超级节点的连接关系重新计算模块度增益。重复此过程直到没有模块度增益为止。

3. Louvain算法的应用

Louvain算法在社交网络分析、生物信息学、推荐系统等领域有着广泛的应用。在社交网络分析中,Louvain算法可以用于发现社区结构,帮助我们理解社交网络中的关系和交互模式。在生物信息学中,Louvain算法可以用于发现基因表达数据中的基因模块,从而揭示基因之间的相互作用和调控关系。在推荐系统中,Louvain算法可以用于发现用户之间的兴趣相似性,从而提供个性化的推荐。

4. Louvain算法的优缺点

Louvain算法的优点是简单、高效,可以处理大规模的网络数据。它不需要预先指定社区数量,而是自动找到最优的社区划分。然而,Louvain算法也存在一些缺点,例如对初始社区划分敏感,可能会得到局部最优解。此外,Louvain算法在处理重叠社区和处理网络中存在孤立节点时效果不佳。

基于节点拓扑结构和属性的重叠社区检测算法

基于节点拓扑结构和属性的重叠社区检测算法

许加书;韩忠愿;顾惠健

【期刊名称】《计算机应用研究》

【年(卷),期】2016(33)12

【摘 要】针对已有重叠社区检测通常只考虑节点的拓扑结构信息,忽略了节点的属性信息,导致数据间的重要结构遗漏的问题,提出了一种基于节点拓扑结构和属性相似度的重叠社区检测算法。首先,基于余弦相似度计算候选节点和局部社区之间的相似度,提高局部搜索效率;其次,改进局部模块度增量计算方法,使局部搜索模型收敛于发现潜在的真实社区;通过融合多个已检测到的局部社区计算隶属矩阵,从而获取全局重叠社区结构;最后,在真实数据集上,与已有基于拓扑结构的社区检测算法进行实验对比。结论表明,该算法在模块度和F1-measure的指标上取得了较好的表现且更适用于稀疏网络。%For overlapping community

detection usually only considering the topology information of

nodes,ignoring the node attribute information,causing the problem of

missing important data structures,this paper proposed an overlapping

community detection algorithm.The algorithm was based on the topology

and the similarity of node attribute to find overlapping communi-ties from

a seed vertex.First,it computed the similarity between candidate nodes and

the local community based on cosine similarity,improved the efficiency of

基于节点局部相似性的两阶段密度峰值重叠社区发现方法

基于节点局部相似性的两阶段密度峰值重叠社区发现方法

段小虎;曹付元

【期刊名称】《计算机科学》

【年(卷),期】2022(49)12

【摘 要】为了有效地发现复杂网络中的重叠社区结构,引入了密度峰值聚类算法,但将此算法应用于社区发现还存在如何度量节点间距离、如何产生重叠划分结果等问题。为此提出了一种基于节点局部相似性的两阶段密度峰值重叠社区发现方法(Node Local Similarity Based Two-stage Density Peaks Algorithm for

Overlapping Community Detection,LSDPC)。该方法结合大度节点有利指标和连接贡献度定义了一种新的节点局部相似性指标,首先通过节点局部相似性度量节点距离;然后通过节点的局部密度和最小距离计算节点中心值,利用切比雪夫不等式筛选出社区中心节点;最后经过初次划分与重叠划分两阶段得到最终的重叠社区划分结果。在真实网络数据集与合成网络数据集上的实验结果表明,所提算法可以有效发现重叠社区结构,且结果优于其他对比算法。

【总页数】8页(P170-177)

【作 者】段小虎;曹付元

【作者单位】山西大学计算机与信息技术学院;山西大学计算智能与中文信息处理教育部重点实验室

【正文语种】中 文

【中图分类】TP391 【相关文献】

1.基于节点重要性与相似性的重叠社区发现算法2.基于拓扑结构的密度峰值重叠社区发现算法3.一种基于粗糙集和密度峰值的重叠社区发现方法4.基于节点重要性和局部扩展的重叠社区发现算法

因版权原因,仅展示原文概要,查看原文内容请购买

基于最大团的层次化重叠社区发现算法

基于最大团的层次化重叠社区发现算法

孙成成;席景科;占文威;李懂

【摘 要】研究表明,很多真实网络具有层次结构和重叠结构.传统的层次聚类算法通常以节点为对象进行扩展形成层次树图从而得到网络的层次结构.这种做法存在两个问题,其一是算法的稳定性,主要体现在初始节点的选择上,少数情况下,初始节点的不同会导致算法最终结果的不同,即使算法的结果不依赖于初始节点,但算法的复杂度会随之变化;其二是不能发现网络中的重叠结构.针对以上问题,提出一种基于最大团的层次化重叠社区发现算法.该算法以最大团为扩展对象,然后利用最大团扩展策略生成层次树图,最后采用重叠模块度函数对层次树图进行剪枝得到社区划分结果.在真实网络以及LFR人工网络上的实验结果表明该算法能够有效地挖掘网络中的层次结构和重叠结构.

【期刊名称】《计算机工程与应用》

【年(卷),期】2018(054)018

【总页数】6页(P105-109,173)

【关键词】层次结构;重叠结构;最大团;社区发现

【作 者】孙成成;席景科;占文威;李懂

【作者单位】中国矿业大学 计算机科学与技术学院,江苏 徐州 221116;中国矿业大学 计算机科学与技术学院,江苏 徐州 221116;中国矿业大学 计算机科学与技术学院,江苏 徐州 221116;中国矿业大学 计算机科学与技术学院,江苏 徐州 221116

【正文语种】中 文 【中图分类】TP393

1 引言

早期很多传统的社区发现算法在挖掘社区结构时都是基于网络中节点的唯一性的,即每个节点都从属于某一个社区。然而,近些年研究发现,大量真实网络的社区结构并非如此泾渭分明,很多社区在某些方面彼此具有较为紧密的联系,社区之间存在交叉重叠现象,因此,社区结构通常具有重叠性和层次性。

现有的能够检测重叠结构的社区发现算法主要包括基于派系过滤的算法[1]、基于连边划分的算法[2]和基于局部挖掘的算法[3],这三类算法分别以团(最大完全子图)、边以及节点为研究对象来挖掘社区结构。以边为研究对象难以挖掘网络的层次结构,因此不予考虑。以节点为对象不断向外扩展最后形成层次树图是层次聚类算法中最为常见的做法[4-6],这种做法最大的弊端是稳定性问题,主要体现在初始节点的选择上,少数情况下,初始节点不同会导致算法最终结果不同,大多数情况下算法的结果不依赖于初始节点,但算法的复杂度会随其变化,另外,在具有重叠结构的网络中,若一开始就选择了重叠节点,那么对最终结果的影响就比较大了。因此,可以结合派系过滤算法的思想,将最大团(也称为派系、极大团、最大团等,本文统称为最大团)作为扩展对象,由于最大团本身内部结构非常紧密(任意两个节点间均有边相连),因此由最大团组成的社区也具有较高的内聚性,社区结构的质量有一定程度的保证。另外,每个最大团虽然各不相同,但同一个节点却可以出现在多个最大团中,这样就能检测出网络中的重叠节点。基于以上分析,本文提出一种基于最大团的层次化重叠社区发现算法(Hierarchical Overlapping

移动社交网络的重叠社区发现方法

移动社交网络的重叠社区发现方法

洪小龙

【摘 要】为了解决移动社交网络社区发现不精确的问题,引入移动用户的上下文信息,研究了采用移动用户社交网络的介数来剔除移动社交网络中不稳定的边,利用GN算法快速形成社区核后,采用节点与社区核之间的相似度来获得重叠社区的划分结果.实验结果证明,提出的算法能够提高社区发现的算法精度.

【期刊名称】《移动通信》

【年(卷),期】2018(042)008

【总页数】5页(P33-37)

【关键词】GN算法;社区核;时空相似度;重叠社区

【作 者】洪小龙

【作者单位】广州杰赛科技股份有限公司,广东 广州 510310

【正文语种】中 文

【中图分类】TP391.4

1 引言

随着移动互联网的快速发展,越来越多的用户通过移动终端可以随时随地与他人进行交流或者购物。移动运营商越来越关注移动用户“指尖上的消费”的行为倾向[1],采用社区发现算法来挖掘移动用户的团体结构,为精准营销提供了数据支撑。社会学的创始人柯晓华[2]认为社会团体的演变能够在一定程度上解释社会现象变化的成因。因此,移动社区的发现是研究移动社交网络的一个重要任务。社区发现算法首先用于信息科学、社会科学以及管理科学等领域,并从非重叠社区发现起步,如KL(Kernighan Lin)算法[3]、GN(Given Newman)算法[4]以及快速Newman算法[5]等。非重叠发现算法得到的社区结构是互相独立的,社区之间不存在交集。显然,这些算法并不能有效地解释现实社交网络存在的重叠社区现象。重叠的社区发现算法从实现的机制来说,可以分为两类:基于节点分裂的和基于模块度优化的。LFM算法[6]是基于模块度优化机制实现的;CPM算法[7]采用完全子图的方法构建重叠矩阵,然后将重叠矩阵变成社区社团邻接矩阵实现重叠社区的划分;CONGA算法[8]是基于节点分裂的机制实现的,该算法是采用传统的GN算法发现非重叠社区,然后通过计算节点之间的介数来决定节点的社团归属。传统的社区发现算法没有考虑移动用户之间的上下文信息,本文提出基于移动社交网络的重叠社区发现方法。首先,通过预处理的手段剔除社交网络中关系不稳定的边;其次,采用GN算法实现社交网络的划分,并确定若干个社区核;最后,通过计算离散节点与社区内每一个节点的时空相似度,结合相似度阈值判断节点的归属性,从而实现移动社交网络的重叠社区的发现。

  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档