本体相似度计算方法

2012.1252 本体相似度计算方法研究张路长江大学工程技术学院 湖北 434020摘要:MD3模型是一种系统的跨本体概念间相似度的计算方法,这种方法无需建立一个集成的共享本体。

本文在MD3 模型的基础上,充分利用本体对概念的描述信息,重点讨论了跨本体概念间非层次关系相似度的计算,把MD3 模型扩展到EMD3 模型,使得概念间相似度的计算理论上更全面、更精确。

关键词:本体;元数据模型;语义相似度;MD3模型0 引言本体映射算法以两个本体作为输入,然后为这两个本体的各个元素(概念、属性或者关系) 建立相应的语义关系。

相似性提取是本体映射的一个重要步骤,它主要是进行概念相似度的计算,提高语义相似度计算精度成为提高语义信息检索质量的关键之一。

语义相似度一般是指计算本体概念间的相似度,多数方法所考虑的概念是基于一个本体的,跨本体概念间的方法比较少。

MD3模型是一种典型的计算跨本体概念间相似度的方法。

1 MD3模型Triple Matching-Distance Model(MD3)模型是一种跨本体概念间相似度计算框架。

计算实体类a 和b 之间的相似度通过计算同义词集、特征属性和语义邻居之间的加权和,公式如下:Sim(a,b)=wS synsets (a,b)+uS features (a, b)+vS neighborhoods (a,b) 其中w, u, v 表示了各组成部分的重要性。

特征属性细化为组成部分、功能以及其他属性。

概念a 和b 的语义邻居及其特征属性(即概念的部分、功能及其他属性)也通过同义词集合描述,每一个相似度的计算都通过Tversky 公式:(,)(,)(1(,))A BS a b A B a b A B a b B Aαα=+-+--其中A, B 分别表示概念a 和b 的描述集合,A-B 表示属于A 但不属于B 的术语集(B-A 相反)。

参数(,)a b α由概念a 和b 和在各自层次结构中的深度确定。

2 EMD3模型MD3模型的不足在于没有考虑对象实例对概念的影响,同时其语义邻居只考虑语义关系中层次之间的相似度,没有考虑非层次之间的相似度。

本文在MD3模型的基础上,参考了其概念名称相似度、特征属性,对本体的结构以及概念描述两方面做了扩充,重点讨论了跨本体概念间非层次关系的相似度的比较和实例对概念相似度的影响,把MD3模型扩展到Extension of TripleMapping Distance model (EMD3)模型。

2.1 概念属性的相似度属性有属性名称、属性数据类型、属性实例数据等要素,因此判断两个属性是否相似主要从这三个要素来考虑。

属性名称、属性类型本身是文本类型,是字符串,因此可以采用字符串相似度计算方法进行判定。

例如用Humming distance 来比较两字符串。

设两字符串s 和t ,则它们之间的相似度可由下式给出:min(,)1(,)1[(())]/max(,)s t i Sim s t f i s t s t ==-+-∑其中:若s[i]=t[i],则f(i)=0;否则f(i)=1。

由于每个概念的实例对该概念的每个属性都分配了一个相应的值,对于其他类型的数据,可以采用下面介绍的方法进行计算。

设概念A 的属性为a i ,概念B 的属性为b j ,两个属性之间的相似度的计算公式为:Sim(a i ,b j )= w 1s 1(a i ,b j )+ w 2s 2(a i ,b j )+ w 3s 3(a i ,b j ) 其中w i 是权重,代表属性名称、数据类型、属性实例数据对属性相似度计算的重要程度,且和为1。

设概念A,B 之间总共计算出m 个sim(a i ,b j ),并设置相应的权值k l ,则概念之间基于属性的相似度为:11(,)/(,)m ml i j ll l k Sim a b k Sim A B ==∑∑=2012.12532.2 概念名称相似度知网中概念的语义用义原来描述,义原是描述概念语义的最小单位,一共有1500多个义原。

由于所有义原根据上下位关系构成了一个树状的层次体系,所有可以用语义距离计算相似度。

假设两个义原在该层次体系中的路径为d ,可以得到两 个义原之间的语义相似度如下:12(,)/()Sim p p d αα=+,式中α是一个可以调节大小的因子。

在知网中一个概念由多个义原描述,所以我们只要计算每个义原的相似度来考虑其重要性,就可以得到概念之间的名称相似度。

计算方法如下:121(,)(,)1mname i i j i S c c w Max Sim p p j n ==∑≤≤,其中m, n 为概念c 1, c 2的义原数,w i 为第i 个义原所占的权重。

2.3 语义关系的相似度语义关系包括层次语义关系和非层次语义关系,层次语义关系具有有向传递性,非层次关系不具有传递性(如关联关系)。

(1) 层次语义关系的计算本文借鉴参考文献[1]中的方法来计算层次语义关系,利用语义邻居的概念,以实体为中心向周围辐射,设定一个语义半径,半径取值的大小反映与实体之间的亲疏关系。

划定语义邻居的范围集合进行匹配,取集合中的最大值作为语义邻居之间的相似度。

语义邻居计算公式如下:N(a 0, r)={c i 0}∀i, d(a 0,c i 0)≤r层次语义关系相似度计算:(,)/h S a b A B A B = ,其中A ,B 分别代表实体a ,b 的语义邻居集合。

(2) 非层次语义关系的计算上位词:定义概念的上位词为概念所有父类的集合,公式如下:UC(C i , H)={C j ∈C|H(C i , C j )}基于概念上位词的定义,定义概念的匹配公式:11221122/(,;,)(,)(,)CM C O C O UC C H UC C H =1122(,)(,)UC C H UC C H与概念相关的非层次关系:如果关系的定义域或值域是概念c ,则称这些关系为与概念c 相关的非层次关系,公式如下: (){()()|,}c x x x R P dom R c range R c R P c C ===∈∈ 还可以进一步把非层次关系细化为概念的In 关系和Out 关系(可以认为非层次关系的方向是从定义域到值域,凭此来定义In 和Out 的关系),In 关系指概念c 是非层次关系的值域,公式如下:{()|,}c I x x R range R c R P c C -==∈∈。

而Out 关系指的是概念c 是非层次关系的定义域,公式如下:(){()|,}c o x x R P dom R c R P c C -==∈∈比较概念的非层次关系,首先应该找出两个本体中与这两个概念相关的同类非层次关系(无需考虑不同类的非层次关系),进而比较这些同类非层次关系的另外一项之间的相似度(如果要比较的概念是非层次关系的定义域,分别找出这个关系的值域,通过概念匹配公式对其进行比较,反之亦然)。

下面以In 关系为例描述比较的过程:P q I a I b I R R R --= 其中P a I R -表示本体p 中与概念a 相关的In 关系,而q b I R -表示本体q中与概念b 相关的In 关系,所以其交集I R 表示本体p, q 中与概念a, b 相关的公共In 关系集合。

如果概念a, b 没有公共的In 关系,则I R 为空,无需下面的计算。

对于公共In 关系集合, 公式如下:11(,)((),;(),)Inon h I I I i i i I R S a b CM dom R p dom R q R --==∑; 对In 关系和Out 关系进行加权综合,得到非层次关系相似度的公式如下:(,)(,)(,)non h non h I non h O S a b iS a b oS a b -----=+ 其中i ,o 为权值,反映的是非层次关系的值域与定义域对概念相似度的影响程度。

对层次关系和非层次关系计算结果进行综合,得到概念语义环境的相似度计算公式如下:(,)(,)(,)neighborhoods h non h S a b tS a b uS a b -=+其中t ,u 分别是层次关系和非层次关系的权重,因为在本体中层次关系要比非层次关系的重要性高,所以在计算中应该赋以较大的值,即t>0.5>u ,且t+u=1。

2.4 概念实例特征的相似度基于实例特征计算相似度的理论依据是,如果概念所具有的实例全部都相同,那么这两个概念是相同的;如果两个概念具有相同实例的比重是相同的,那么这两个概念是相似的。

对于概念A,B 的具体实例,可以用Jaccard 系数来计算相似度:()(,)(,)()(,)(,)(,)inst B A P A B P A B S A B P A B P A B P A P B ==++ 。

其中P(A,B)表示一个实例既属于概念A 又属于概念B 的概率, (,)B P A 表示一个实例属于概念A 但不属于B 的概率。

2.5 结论由上面的分析,综合了各个部分相似度的值,得到跨本体概念间相似度的综合公式如下:(,)(,)(,)(,)(,)im name attr neighborhoods inst S a b mS a b nS a b rS a b tS a b =+++其中m, n, r, t 为各个部分所占的权重,根据各个部分重要性的不同m, n, r, t 分别被赋以不同的值,并且m+n+r+t =1。

3 结语本文扩展的模型充分继承了MD3模型的优点,并对MD3模型进行了优化。

在选择了适当权重的前提下,EMD32012.1254 模型能够确保语义相似度的计算更准确,更全面。

但是在语义相似度计算过程中存在着大量权重的设定问题,对模型的性能有一定的影响。

如何准确高效地设定权重是未来值得深入研究的问题。

参考文献[1]Rodriguez M A, Egenhofer M J. Determining Semantic Similarity Among Entity Classes from Different Ontologies. IEEE Trans. on Knowledge and Data Engineering.2003.[2]徐德智,肖文芳,王怀民.本体映射过程中的概念相似度计算[J]. 计算机工程与应用.2007.[3]陈杰,蒋祖华. 领域本体的概念相似度计算[J].计算机工程与应用.2006.[4]李鹏,陶兰,王弼佐.一种改进的本体语义相似度计算及其应用[J].计算机工程与设计.2007.[5]Alexander Budanitsky,Graeme Hirst.Evaluating W ordNet-based Measures of Lexical Semantic Relatedness[J].Computational Linguis2 tics.2006.[6]Tversky A.Features of similarity.Psychological Review.1977.The MD3 model systematiclly evaluates Semantic Similarity across different Ontologies dispense with Ontology; Metadata model; Semantic Similarity; MD3 model[上接65页]Artificial Intelligence [M]. Cambridge, MA: The MIT Press.2005. [3]M E Bratman1 Intentions, Plants, and Practical Reason[M]. Cambridge,MA: Harvard University Press.1987. [4]Rao A S,Georgeff M P.BDI Agents: From Theory toPractice[A]. Proc of the 1st Int’l Conf on Multi-Agent Systems(IC2MAS295) [C].1995.Li LiAgent oriented software engineering software engineering is an important new technology. Agent oriented AOSE;Prometheus;SONIA;AUML。

合集下载

一种基于本体的句子相似度计算方法

一种基于本体的句子相似度计算方法

A b s t r a c t h i s a e r r o o s e d s e n t e n c e s i m i l a r i t c o m u t i n b a s e d o n o n t o l o . U s i n t h e r e l a t i o n s b e t w e e n t h e o n t o l T - p p p p y p g g y g o c o n c e t s a n d k e w o r d s i n t h e s e n t e n c e s t o e s t a b l i s h s e m a n t i c i n d e x t o e x t r a c t t h e d i r e c t a n d i n d i r e c t s e m a n t i c r e l a - g y p y , , t i o n o n t o l o b a s e d s e m a n t i c v e c t o r w a s r e r e s e n t e d t o c a l c u l a t e t h e s e m a n t i c s i m i l a r i t b e t w e e n s e n t e n c e s t h u s t h e g y p y s e n t e n c e s i m i l a r i t c o m u t i n m e t h o d w a s r o o s e d . T h i s m e t h o d i s a l i e d i n t h e M i c r o s o f t R e s e a r c h I n s t i t u t e o f a r a - y p g p p p p p , h r a s e c o r u s( M S R P) . E x e r i m e n t s s h o w t h a t c o m a r e d w i t h t h e r e l a t e d s i m i l a r i t c o m u t i n m e t h o d s t h i s m e t h o d p p p p y p g a c c u r a c a n d r e c a l l r a t e i n t h e i n c o m l e t e a d d i t i o n a l i n f o r m a t i o n b a c k r o u n d . o b t a i n s o o d y p g g , , K e w o r d s e n t e n c e s i m i l a r i t c o m u t i n O n t o l o W o r d N e t S y p g g y y 随时获取到。在这种情况下, 这些简短段落或句子之间的 相似度只能从 有 限 的 表 述 中 提 取。本 文 研 究 如 何 仅 通 过 本体结构所表达 出 来 的 概 念 间 的 语 义 关 系 来 计 算 句 子 的 相似度。

基于谱图理论的本体相似度计算

基于谱图理论的本体相似度计算
DO :03 7 /i n10 —3 1 0 1 8 3 文章编 号 :0 28 3 (0 12 —100 文献标识码 : I 1.7 8 .s . 28 3 . 1. 0 js 0 2 20 10 —3 12 1 )80 1.3 A 中图分类号 : P 9 T 31
随着 因特 网技 术 的发 展 , 网上信息 量 以指 数规律迅 速增
Ke r s o t l g c n e t smi rt s e ta r p h o y; p a e Beta p r t r Ga s i e e f n t n y wo d : n o o y; o c p i l i a y;p c r l g a h t e r La l c l mi o e a o ; u sa k r l u c i r n n o
LAN M e h i XU J a S iu , i n, UN ・ t l g i i r t o Yu On o o y sm l iy c mp t t n a e i pe t a g a h h o yCom put r a u a i b s d O l o s c r l r p t e r e Engne r ng i ei
摘
要: 概念 的语 义相 似度 研究 , 是知 识表 示以及信 息检 索领域 中的一 个重要 内容。将与某概念相 关的信 息表 示为一个向量 , 建
立原 本体 图的伴随 图。用 8 领域方法定 义边 , 高斯核 函数定义边的权 值。通过计算 图拉普拉斯矩 阵的次 小特征值对应 的特征 一 用 向量得 到本体相似度计 算函数 。 实验 结果表明该算法是有效的。 关键 词 : 本体 ; 概念相似度 ; 图理论 ; 谱 拉普拉斯 B la 算子; ermi t 高斯核 函数

一种改进的本体相似度计算方法

一种改进的本体相似度计算方法
a d c mp r si n ysi sr l v n . c n o a e n ma y wa fi i e e a t A ompr h n i e smia i a u i g me h d b s d o h D3 mo e spr p s d tt sst e me h d t e e sv i lrt me s rn t o a e n t e M y d l o o e I e t h t o i wi wo g o p d t n h n c mp r s t e r s l . p rme tlr s l h t t r u aaa d t e o h a e h e u t Ex e i n a e u t s ow h tt e a p o c sb t rt a h D3 mo e n r c l r t n s s t a h p r a h i e t h n t e M e d li e a l a e a d p e iinrt. r c s o a e
第 3ห้องสมุดไป่ตู้卷 第 2 期 6 4
Vl1 6 0. 3
・
计
算
机
工
程
21 0 0年 l 2月
De e b r2 1 c m e 0 0
NO.4 2
Co put rEng ne r ng m e i ei
软件技术与数据库 ・
一
文 编号 l 3 80 ) — 0 — 3 文 标 码: 章 : 0 -4 ( 12 3 _ 0 22 o 4 9 o 献 识 A
[ src]T i pp rpo oe y tei da poc fsmi ry c mp tt n I ue h rt t g e ni rl ii loi mst Abta t hs ae rp ssasnh s e p raho i l i o uai . t ssteHi — — esma t ea  ̄t ag rh O z at o s S On c t,y t

一种新的本体相似度计算方法

一种新的本体相似度计算方法
张忠平 ,田淑霞 刘洪强。 ,
(. 1 燕山大学 信 息科 学与 工程 学 院,河 北 秦皇 岛 0 60 ; . 6 0 4 2 南京邮电 大学 计 算机 学院 ,南京 2 0 0 ) 10 3 摘 要 :针 对 目前本体 映射过程 中相似度 计算存在 的 问题 , 出了一种 综合的相似度 计算 方法 。首先判 断 不 同 提
ZHANG o — ig。 Zh ng pn ,TI AN h xa S u— i ,LI Ho — a g U ngqin
( . ol eo n r tnSi c 1 C lg f mai c ne&E gnen ,Y rh nU i rt,Qnu nd oH bi 6 04, hn ;.Clg o p t ,N ni e fI o o e nier g a a nv sy ih ag a ee 0 60 C i 2 oeeo Cm ue aj g i  ̄ ei a l f r n
t e rl t iy a n ifr n o i n oo isfrt And te n t ss s h e ai t mo g dfe e td man o tlg e s. v i h n i hi ub umpin, s d o e n i e e n o c p e e , to ba e n s ma tc lv la d c n e tlv l p o s d a c mp e e sv i lrt a u ig m eh d,atrt o ul c nsdeai n a o tr ltv a tr. L sl hi pp rpo e o r h n ie smia iy me s rn to f o k a f l o i r to b u eaie fco s a ty t sa — e

改进的本体语义相似度计算方法

改进的本体语义相似度计算方法

一关系的树状结构,导致不能完整反映概念的语义。关系类型 权值计算如下所示[7]:
R(x→r
y)=Maxr-
Maxr-Minr n(r x)
(5)
其中,→r 表示关系类型。Maxr 和 Minr 是某种关系的可能最大、
最小权重,n(r x)表示从 x 出发的 r 关系有向边和。
(4)有向边强度:若一个父节点的某个子节点对该领域比
本体结构中,每个概念是对其祖先节点的细化,每一个子 节点都可以认为包含它所有祖先节点的信息内容,因此两个概 念的语义相似度可以用它们最近共同祖先节点的信息量来衡
量,即共同祖先的最大信息量[4]。Resnik 根据该理论将两个概念 C1 和 C2 的共同祖先的最大信息量作为两概念的语义相似度。 Jiang 和 Conrath 利用两概念的信息量和它们的最大信息量之 差作为语义距离进行语义相似度的计算[5],该模型将信息量融 合在语义距离计算中,具有较高的准确性。但是通过分析发现 上述模型中存在如下问题:
(1)相似度计算中使用了两个概念共同祖先中的最大信息 量。该方法对于本体树结构较合适,但实际的本体是具有多种 关系的图结构,在本体的 DAG 图中一个概念的双亲可能有多 个,并且两个概念的共同祖先可能是分离的,因此该方法会忽 略这些节点的信息。
(2)进行语义距离计算时只考虑了信息量,而在实际的本 体中,由于节点深度、密度的差异以及概念间关系的不同,都会 影响语义相似度。因此语义距离计算还要考虑其他因素。
T0:All
T1:Plant structure
T2:plant
T3:tissue
T4:guard
T5:trichoblast
图 1 某本体片段结构图
分离祖先是 DAG 图状结构特有的。一个概念具有两个分

一种改进的本体概念相似度计算算法

一种改进的本体概念相似度计算算法

1 本 体 中概 念 相似 度 的计 算
11 有 向边 权 重 的 计 算 .
在 本体 层次 网 络 中影响 有 向边 权 重 的因素 有 以下 四点阁:J 父 结点 和 子结 点之 问有 向边 的类 型 ;2 父 () ()
结 点和 子结 点构成 的有 向边 在层 次 网络 图 中的深度 ;3 父结 点 和子结 点构成 的有 向边 在层 次 网络 图 中的密 ()
第2 8卷 第 2期
21 0 1年 6月
苏 州 科 技 学 院 学 报 ( 然 科 学 版) 自
Ju a o uh u U i ri f ce c n e h oo y( aua ce c ) o r l fS z o n v s yo i ea d T c n lg N trl in e n e t S n S
度 ;4 有 向边 两端 概念 结点 的属性 对有 向边 的权重 的影 响 。 ()
[ 稿 E期】 0 0 0 - 2 收 t 2 1— 5 1 【 金 项 目】 家 自然 科 学 基 金 资 助 项 目(0 9 Q Z 0 ) 基 国 2 0 S R 2 5 [ 者 简 介] 美 辉 (9 3 )女 , 作 兰 18 ~ , 云南 宜 良人 , 士 , 究 方 向 : 息检 索 、 算 机 智 能 。 硕 研 信 计
率。
关 键 词 : 体 ; 义 亏损 ; 本 语 语义 距 离 ; 义 相 似 度 语
中图 分 类 号 : P 9 T31 文 献标 识 码 :A 文 章 编 号 :1 7 — 6 7 2 1 ) 2 0 4 — 5 6 2 0 8 (0 10 — 0 5 0
本体 (noo ) 词源 于哲学 , 来描述 事物 的本 质【 otl 一 用 ” 。在 计算 机科 学 领域 , 体被定 义 为共 享概 念模 型 本

基于本体结构的语义相似度计算

第 7期
杨方颖等 : 基 于本 体结 构的语义相似度计算
・ 5 3・
S i mi l a r i t y ( 0 , b ) =( 2×D)一L e n ( 口 , b )
( 1 )
在计算信息 量度 量值 时选用 了该算 法。D i S h l n算 法 的内容将 在下文中详细说明。
.
( 4 )
其 中信息量 I C ( c ) 为概念 C 出现概率 的负 l o g 函数 值: , c ( c ) = 一l o - g P( C ) 。 其 中P( c ) = , n ( c ) 为概念 c 所 包含的子概念
2 算法介绍
文 中将距离因子 D, 层次因子 L , 属性 因子 P和信 息量因子 通过线性加权 的方式组合起来 , 得到 了一 个新 的语义相似度算法 , 本算法形式化 表示如下 :
离。
的相似度的算法 。R o d r i g u e z等 还考 虑了概念 的 同 义词集合 , 区别特征和语 义相邻 点等特征 。 文 中结合 了基于边 的方法 和基 于顶 点 的方 法 , 同 时吸取 了 T v e r s k y 关于属性 的观点 , 综合考虑 了语义 距离 、 属性 、 共同父节点所 在层 次 、 信息量 等影 响语义
∈[ 0 , 1 ] , I F∈[ 0, 1 ] 。
的共 性所需 的信息量和完全描述两个概念所需信息量
的 比值 :
通过算法的定义可知 :
1 ) S i m i l a r i t y ( c 1 , c 2 )∈ [ 0 , 1 ] ;
S i m i l a r i t y ( ) =
( 5 )
2 ) 当c 和c : 是等价概念时 , 其相 似度取得最大值

一种基于语义的本体概念相似度的计算方法

图 1 E p ye m l e 本体与 P r n e本体的映射 o e onl s
如 图 1 示 , mpo e 和 P ro n l 同 一 个 公 司 两个 所 E lye esn e 是
不 同部 门建立 的雇员 本体 , 因此存 在一定差 异 , We h 属 即 it g 性 的度量单位不 同, 因而 可以利用 Unt n es n的映射规 iC vri o o 则来建立这两个本体之 间的映射关系 。
W U i u W AN o g b ZHU e g z o Ka— i g H n -o Zh n - h u
( ol g fC m p t r C l e o o e u e ,Ch n q n i e st Ch n q n 0 04 , i a o g i g Un v r iy, o g i g 4 0 4 Ch n )
似度的计算方法 , 主要从概念名称 、 念属 性、 概 概念关 系来计算概念相 似度 , 过 引入候 选概 念集和信 息增益 , 高了 通 提
相似度的准确率 , 简化 了相似度的计算过程 。
关键词 本 体 映 射 , 念 相 似 度 , 息增 益 概 信
A mpu a i n M eho o n e t a i l rt n Co t to t d fCo c p u lS mia iy i Ont lg s d n e n i e oo y Ba e o S ma tcW b
1 引言
语义 网采用多层次的表示 框架 , 而本体位 于从文 档描述 到知识推理转折的层次 , 因此 本体 的构建是 实现语 义网 的关 键环节 。本体就是用来描述某个领域 ( 领域本体) 甚至更广范 围( 通用本体 ) 内的概念以及概 念之 间的联系 , 使得这 些概念 和联系在共享的范围内有着 明确唯一 的定义 , 这样人 和机器 之间就可以进行交流_ 。但是 , 1 ] 由于在 网络 中可以获 取 的本 体数量越来越 多 , 并且本体的创建者不同 , 使用 的建模方法不

基于本体知识库的概念相似度计算方法

基于本体知识库的概念相似度计算方法近年来,基于本体知识库的概念相似度计算方法被广泛应用于信息检索、自然语言处理、知识管理等领域。

本体知识库是一种表示和组织知识的工具,它通过定义概念、属性和关系等元素构建语义网络,为人们理解和处理各种知识提供了便利。

基于本体知识库的概念相似度计算方法主要是通过比较两个概念之间的语义距离来确定它们的相似程度。

下面我们将从本体知识库的构建、概念相似度计算的理论基础和具体实现等方面进行探讨。

一、本体知识库的构建本体知识库的构建是基于领域知识的确定和概念元素的定义。

知识领域确定后,可以通过领域专家的指导或文献资料的收集等方式提取领域中存在的所有概念,并对这些概念进行层次化组织。

例如,对于医学领域,在确定了相关的概念(如病症、病因、病例等)后,可以通过定义它们的属性和关系,构建一个包含各种概念和它们之间关系的本体知识库。

在实际建立本体知识库时,还需要考虑一些重要的方面,如本体建模语言的选择、知识表示的精度和准确性等。

常见的本体建模语言有OWL、RDF等,它们可以规定知识元素的定义方式和语义关系,是开发本体知识库的重要工具。

二、概念相似度计算的理论基础计算概念相似度的过程涉及对概念含义的表示和比较。

为了实现概念的可比性,需要将概念转化为可计算的形式。

一般情况下,将概念表示为一组特征向量的形式,并通过相似度度量方法进行比较。

常见的相似度度量方法包括路径长度、信息内容、基于信息熵的方法等。

路径长度是比较简单和常用的相似度度量方法,它基于本体中概念之间的语义距离,即在树形结构中从一个概念到另一个概念的距离。

信息内容是一种基于信息论的度量方法,在与其他概念比较时由于当前概念的信息量越小,说明其在本体中的特异性越大,其概念相似度越高。

除此之外,还有一些基于机器学习、统计学等方法的计算方式。

例如,作者曾经采用过一种基于SVM的概念相似度计算方法,该方法利用了SVM对文本分类的有效性和泛化能力,将概念相似度的计算转化为文本分类问题,通过训练数据建立模型,实现对新的概念相似度的计算。

基于关联规则的本体相似度综合计算方法

( 重庆大学 计算机学院, 重庆 40 4 ) 00 4 ({ 通信作者 电子邮箱 csl@1 3 CB que 6 .O )
摘
要: 目前 较 为 流行 的 最 小 风 险 的本 体 映 射 ( i M) 架 通 过 采 用“多 策略 ” 思 想 虽然 取 得 了 一 定 的 效 果 , RMO 框 的
关键 词 : 体 ; 据 挖 掘 ; 本 数 关联 规 则 ; 体 映射 ; 义分 析 本 语 中 图分 类 号 :P 1 . 1T 12 T 3 1 1 ;P 8 文 献 标 志 码 : A
Co pr h nsv e h d o o p i g o o o y sm ia iy ba e n a s ca i n r l s m e e i e m t o fc m utn nt l g i l rt s d o s o i to u e
但其框 架比较臃肿庞杂 , 且采用的计 算结构相 似度 的选择策略 存在 一定的局 限性。针对 上述 问题 , 出一种基 于关 提
联规 则的本体相似度综合计算方法。首先 , 构造关联规 则的结构“ 模型 , 出相 应事务 集; 次, 树” 得 其 进行 关联规 则的
挖掘 , 根据关联规则计算概 念结构的相似性 ; 然后 , 计算概念 的实例 、 属性 、 名称的相似 度 ; 最后 , 对多个特征相似 度进 行 综合加权 处理 , 实现本体 相似 度的最优计 算。实验结果表 明 , 该方 法较 RMO i M在 查全 率、 准率方 面均有较 大提 查 高; 同时该方法省去 了策略 选择 的步骤 , 有效降低 了时间复杂度 。
C 0DE YIDU NJ I
ht: / w . c . n t / w w j a c p o
d i1. 74 S ..0 7 2 1 .2 7 o:0 3 2/ P J 18 .0 2 04 2
  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档