基于本体的语义相似度计算方法研究综述

合集下载

一种基于本体的句子相似度计算方法

Ａｂｓｔｒａｃｔｈｉｓａｅｒｒｏｏｓｅｄｓｅｎｔｅｎｃｅｓｉｍｉｌａｒｉｔｃｏｍｕｔｉｎｂａｓｅｄｏｎｏｎｔｏｌｏ．ＵｓｉｎｔｈｅｒｅｌａｔｉｏｎｓｂｅｔｗｅｅｎｔｈｅｏｎｔｏｌＴ－ｐｐｐｐｙｐｇｇｙｇｏｃｏｎｃｅｔｓａｎｄｋｅｗｏｒｄｓｉｎｔｈｅｓｅｎｔｅｎｃｅｓｔｏｅｓｔａｂｌｉｓｈｓｅｍａｎｔｉｃｉｎｄｅｘｔｏｅｘｔｒａｃｔｔｈｅｄｉｒｅｃｔａｎｄｉｎｄｉｒｅｃｔｓｅｍａｎｔｉｃｒｅｌａ－ｇｙｐｙ，，ｔｉｏｎｏｎｔｏｌｏｂａｓｅｄｓｅｍａｎｔｉｃｖｅｃｔｏｒｗａｓｒｅｒｅｓｅｎｔｅｄｔｏｃａｌｃｕｌａｔｅｔｈｅｓｅｍａｎｔｉｃｓｉｍｉｌａｒｉｔｂｅｔｗｅｅｎｓｅｎｔｅｎｃｅｓｔｈｕｓｔｈｅｇｙｐｙｓｅｎｔｅｎｃｅｓｉｍｉｌａｒｉｔｃｏｍｕｔｉｎｍｅｔｈｏｄｗａｓｒｏｏｓｅｄ．ＴｈｉｓｍｅｔｈｏｄｉｓａｌｉｅｄｉｎｔｈｅＭｉｃｒｏｓｏｆｔＲｅｓｅａｒｃｈＩｎｓｔｉｔｕｔｅｏｆａｒａ－ｙｐｇｐｐｐｐｐ，ｈｒａｓｅｃｏｒｕｓ（ＭＳＲＰ）．Ｅｘｅｒｉｍｅｎｔｓｓｈｏｗｔｈａｔｃｏｍａｒｅｄｗｉｔｈｔｈｅｒｅｌａｔｅｄｓｉｍｉｌａｒｉｔｃｏｍｕｔｉｎｍｅｔｈｏｄｓｔｈｉｓｍｅｔｈｏｄｐｐｐｐｙｐｇａｃｃｕｒａｃａｎｄｒｅｃａｌｌｒａｔｅｉｎｔｈｅｉｎｃｏｍｌｅｔｅａｄｄｉｔｉｏｎａｌｉｎｆｏｒｍａｔｉｏｎｂａｃｋｒｏｕｎｄ．ｏｂｔａｉｎｓｏｏｄｙｐｇｇ，，ＫｅｗｏｒｄｓｅｎｔｅｎｃｅｓｉｍｉｌａｒｉｔｃｏｍｕｔｉｎＯｎｔｏｌｏＷｏｒｄＮｅｔＳｙｐｇｇｙｙ随时获取到。在这种情况下，这些简短段落或句子之间的相似度只能从有限的表述中提取。本文研究如何仅通过本体结构所表达出来的概念间的语义关系来计算句子的相似度。

语义文本相似度计算方法

语义文本相似度计算方法语义文本相似度计算方法是一种用于比较两个文本之间相似程度的方法。

在自然语言处理领域中，语义文本相似度计算方法被广泛应用于文本分类、信息检索、机器翻译等任务中。

本文将介绍几种常见的语义文本相似度计算方法。

1. 余弦相似度余弦相似度是一种常见的语义文本相似度计算方法。

它通过计算两个文本向量之间的夹角余弦值来衡量它们之间的相似程度。

具体来说，假设有两个文本A和B，它们的向量表示分别为a和b，那么它们之间的余弦相似度可以表示为：cosine_similarity(a, b) = (a·b) / (||a|| * ||b||)其中，a·b表示向量a和向量b的点积，||a||和||b||分别表示向量a 和向量b的模长。

余弦相似度的取值范围在[-1, 1]之间，值越接近1表示两个文本越相似，值越接近-1表示两个文本越不相似。

2. 词向量相似度词向量相似度是一种基于词向量模型的语义文本相似度计算方法。

它通过将文本中的每个词映射到一个高维向量空间中，并计算两个文本中所有词向量之间的相似度来衡量它们之间的相似程度。

具体来说，假设有两个文本A和B，它们的词向量表示分别为a和b，那么它们之间的词向量相似度可以表示为：word_vector_similarity(a, b) = (1/n) * Σ(a[i]·b[i])其中，n表示文本中词的总数，a[i]和b[i]分别表示文本A和B中第i个词的词向量。

词向量相似度的取值范围在[0, 1]之间，值越接近1表示两个文本越相似，值越接近0表示两个文本越不相似。

3. 基于深度学习的相似度计算方法近年来，随着深度学习技术的发展，基于深度学习的语义文本相似度计算方法也得到了广泛应用。

这类方法通常使用神经网络模型来学习文本的表示，并通过比较两个文本的表示之间的距离来衡量它们之间的相似程度。

常见的深度学习模型包括卷积神经网络、循环神经网络、注意力机制等。

文本相似度计算研究进展综述

文本相似度计算研究进展综述研究文本相似度是文本挖掘和自然语言处理领域的重要课题之一、文本相似度计算的目的是通过比较两个文本的内容和语义结构，来确定它们之间的相似度程度。

文本相似度计算在许多应用中都具有重要的实际意义，如信息检索、文本聚类、文本分类、问题回答系统等。

本文将对文本相似度计算的研究进展进行综述。

传统的文本相似度计算方法主要基于词袋模型和向量空间模型。

在这些方法中，文本被表示为一个词汇表上的向量，其中每个维度代表一个词汇，向量的数值表示该词在文本中的重要性。

然后，可以使用不同的相似度度量方法（如余弦相似度）来计算两个文本之间的相似度。

这些方法的优点是简单而直观，但由于没有考虑到词汇的语义信息，所以在处理长文本或含有词汇歧义的文本时表现不佳。

近年来，随着深度学习技术的兴起，基于神经网络的文本相似度计算方法也得到了广泛关注。

这些方法通常使用循环神经网络（RNN）或卷积神经网络（CNN）来捕捉文本的上下文信息和语义结构。

其中，应用较广泛的方法是使用RNN模型，如长短时记忆网络（LSTM）和门控循环单元（GRU）。

这些模型通过学习文本的上下文信息和词汇之间的关联性，能够更好地表达文本的语义含义，从而提高文本相似度计算的准确性。

除了基于神经网络的方法，还有许多其他的文本相似度计算方法被提出。

例如，基于WordNet的方法使用词汇网络中的层次关系来计算文本之间的相似度。

这些方法可以利用WordNet中的同义词和上位词关系来衡量词汇之间的语义相似性。

此外，还有一些方法考虑了文本的结构信息，如基于树的方法和基于图的方法。

这些方法通过考虑句子的语法结构和依赖关系，来捕捉更丰富的语义信息。

尽管文本相似度计算已经取得了一些进展，但仍然存在一些挑战。

首先，文本的语义结构非常复杂，因此如何捕捉文本的语义信息仍然是一个难题。

其次，样本的数量和质量对于训练文本相似度计算模型至关重要。

如果没有足够多的样本和高质量的标注数据，模型将很难学习到准确的语义表示。

基于本体的语义搜索研究综述

基于本体的语义搜索研究综述基于本体的语义搜索研究综述随着网络信息的不断增长，传统的文本检索技术已经无法满足人们对更高效、精准的信息获取需求。

因此，语义搜索技术应运而生。

基于本体的语义搜索是一种利用先进的语义分析和本体技术实现的全新搜索方式，它能够更加全面、精准地搜索出用户所需的信息。

本文将对基于本体的语义搜索技术进行详细介绍，并对其发展现状和未来趋势进行分析。

一、基于本体的语义搜索技术简介本体(Boxies)是一个构建和维护共享概念结构的框架，它可以为不同应用程序的数据集提供定义和数据交互的通用概念模型。

本体可以看作是一个概念网络，由节点（类别）、属性和关系组成，并且可以通过Web技术进行分布式创建、访问和维护。

而基于本体的语义搜索，就是利用本体技术支持语义解析，实现更加准确、全面的搜索。

基于本体的语义搜索技术的实现过程：首先，通过本体技术建立领域本体模型，将领域的相关知识、数据和概念的定义集成到本体模型中；然后，用户查询信息时，对用户输入的查询语句进行语义解析，将其转换为本体的语义表示；最后，使用本体语义数据对信息进行检索和排名，并返回查询结果。

二、基于本体的语义搜索技术的实现方法目前，基于本体的语义搜索技术主要有三种实现方法：基于本体的全文搜索、基于表达式树的搜索和基于查询扩展的搜索。

1、基于本体的全文搜索基于本体的全文搜索是通过对文本进行语义解析并生成语义三元组的方式实现的。

通过把搜索问题转化为合理的Formal Query和SPARQL脚本，可以利用本体数据之间的关联性以及它们在语义空间中的分布来提高搜索的准确性。

例如，有一个本体模型包含汽车、发动机、轮胎等术语，用户想要搜索汽车的类型，可以输入“明年年底上市的SUV”，搜索引擎可以将其解释为“基于本体的SUV类型的搜索”，然后使用本体数据对信息进行检索和排名，并返回查询结果。

2、基于表达式树的搜索基于表达式树的搜索是通过将用户查询语句转化为一个表达式树，利用表达式树结构对本体数据进行语义匹配实现的。

基于本体的概念相似度计算研究

计算机光盘软件与应用
工程技术
ＣｍｕｅＤＳｆｗｒｎｐｌｃｔｏｓｏｐｔｒＣｏｔａｅａｄＡｐｉａｉｎ
２１第５０２年期
基于本体的概念相似度计算研究
田文英
（石家庄职业技术学院，石家庄
００８）５０１
２两个概念间的语义距离为无穷大时，其相似度为０．；３两个概念间的语义距离越大，其相似度越小。．
在本体中，如果两个概念的语义距离相同，那么概念的语义相似度由它们所处的层次决定，所处的层次越深，其所对应的语义相似度越高，反之则相反。其中，ｈ为本体有向图的最大深度，Ｌ为概念Ｃ和Ｃ之间有向边的数量。考虑到层次深度对语义相似性的影响，同时，层次深度也能判断出两个概念的上下位关系。综合考虑语义距离和层次深度，可以使用树形结构来对本体进行表示．其中，ｈ和ｈ分别表示概念Ｃ和Ｃ在本体树中的深度：ｈ表示本体树的最大深度；ｐ为调节参数，对系统所需
的相似度进行动态调节，表示本体树中深度和广度对概念相似度的影响。（）基于属性和语义距离的柔性相似度三本体概念的相似度要综合考虑概念的属性以及概念之间Ｏｔ＝Ｖ，Ｐ，Ｒｎｏ（，Ｃ，Ｈ）（）１．的关系，它们对概念的相似度具有重要的影响。综合考虑概念其中：Ｖ表示概念词汇集，Ｃ表示本体概念，Ｐ表示属性，的属性和层次关系对概念相似度的影响，对公式进行权重调Ｈ表示层次，Ｒ示概念之间的关系。表整，得到领域本体中两个概念的相似度计算模型．分析ＯＬ语言中描述元素，Ｗ对于基于语义特征的概念相似其中，是权重系数。由于概念相似度的主观性较强，度计算方法非常重要。ＯＬ语言中有四类不同的语义描述元因此对于不同的服务请求，以通过权重系数的调节来决定本Ｗ可素：体概念的属性和层次关系对相似度的影响，从而确定系统所需第类描述元素用于定义本体中实体集合，主要包括类要的相似度阂值。概念相似度的变化趋势是一种线形关系，参Ｃａｓ实例Ｉｓａｃ。ｌｓ和ｎｔｎｅ数的取值会影响相似度的大小，但是对概念的相似顺序没有影第二类描述元素用于生成一个本体的特征集合，包括描述响。本体实体的类层次描述元素和属性特征描述元素以及其他各（四）算法描述种约束的描述元素。给定相似度算法ＳｍＣ，Ｃ）ｉ（，该算法最主要的工作是计第三类是用于描述实体之间，以及特征之间的异同关系的算两个概念的相似度。相似度算法描述如下：描述元素。第一步：预处理。构建相似度矩阵Ａ，提供任意两个概念第四类是本体中的补充性的描述元素，以及现有算法尚不之间的相似度度量，其中Ａ＝ｉ（。显式定义所有的等ｓｍＣ，Ｃ）能有效支持的特征。价概念和反义概念的概念元素集合，赋值为１０和，在相似度三、基于本体的概念相似度计算矩阵Ａ中，了能被初始化的元素，除其它每个概念的取值都与（一）属性相似度中参数取值有关的，因此，对同一个概念，能得出不同的相可在现实世界中，事物可以由各种属性来进行描述和分类，似度，设定相似度的取值区问为（，１。０）属性的相似度可以通过两个概念属性集合的相似程度来进行第二步，解析本体文件，并抽取出本体中的类、实例和属计算。性，并根据其在本体树中所处位置设置参数构建特征向量，向其中，ＣｎＣ表示概念Ｃ与概念Ｃ的相同属性集合；Ｃ一Ｃ表示在概念Ｃ中存在而概念Ｃ不存在的属性集合；ｃ一ｃ表示在概念Ｃ中存在而在概念Ｃ中不存在的属性集合，ｎ，Ｙ为调节权重参数，且Ｑ＞Ｂ＝Ｙ。（）语义层次距离二本体作为一种知识表示模型，其所包含的概念、属性和关系可以通过有向图的形式进行表示，点表示概念，节边表示关系，概念之间的语义距离可以表示为概念节点之间最短路径边

基于基因本体的语义相似度计算方法研究综述

基于基因本体的语义相似度计算方法研究综述作者：彭佳杰王亚东来源：《智能计算机与应用》2016年第01期摘要：基因本体是一个被广泛使用的生物数据资源，主要用于描述基因和基因产物的属性，包括分子功能、生物过程和细胞组件三个方面。

基于基因本体的术语相似度及基因功能相似度计算对基因功能分析、比较和预测等生物学研究热门领域具有非常重要的意义。

本文综述了基于基因本体的语义相似度算法，主要包括基因本体同一分支中的术语相似度计算法和基因本体跨分支术语相似度算法两大部分内容，并对这些方法的优缺点做了一定的分析总结。

关键词：基因本体；语义相似度；术语相似度中图分类号：TP391 文献标识号：A 文章编号：2095-2163（2015）06-Abstract： Gene Ontology （GO） is a widely used resource to describe the attributes for gene and gene products， including three categories molecular function， biological process and cellular component. GO based term similarity and gene functional similarity calculation is of great benefit to gene function analysis， comparison and prediction. This article reviewes the common methods on semantic similarity based on gene ontology， including measures to calculate gene ontology term similarity in the same category and to compare gene ontology term in different categories. In the end， the paper summarizes some commonly used tools for analyzing gene ontology based semantic similarity calculation measurement.Keywords： Gene Ontology； Semantic Similarity； Term Similarity0 引言基因本体是生物医学领域最成功的本体之一，为描述基因（基因产物）的分子功能、生物过程等相关信息提供一个规范、准确的术语集，目前被广泛应用于生物医学相关研究领域[1]。

基于本体相似度计算的研究

算法，旨在解决语义异构中本体映射问题。
关键词：体；似度计算本相
中图分类号：Ｐ１Ｔ３１文献标识码：Ａ文章编号：０９３４（００１ — ４８０１０ — ０４２１）３３４ — ２
ＴｈｓａｃｆＣｏｏｉｍｐｔｇＳｍｉｒｔｅＲｅｅｒｈｏｍｐｓｅＣｏｔｕｉｉｌｉｎａｙ
２本体相似度的计算
在本体之间建立语义关联，现本体映射，键在于发现相同或者相似的元素问的映射关系。相似度计算便成为本体映射中发实关
现映射关系的重要方法。２１基于语法距离的相似度计算．
ＣｍｐｔＫｏ￣ｇｎｅｈｏｇｏｕｒｎｗｅｅａｄＴｃｎｌｙ电脑知识与技术ｅｄｏ
Ｖｏ．，．３１Ｎｏ１，Ｍａ０１，Ｐ３４－３４６ｙ２０Ｐ．４８４９
基于本体相似度计算的研究
邓李，南林，斌郑
（军航空大学计算机教研室，空吉林长春１０２）３０２
ＩＳＳＮ１０ — Ｏ４０９３４
Ｅｍａｌｅｕ＠ＣＣ．ｅ．ａ — ｉｄｆＣＣｎｔ：ｃ
ｈｐｌｗｗｄｚ．ｅ．ａｕ：ｗ．ｎｓｎｔｌｃ
Ｔ１８ — ５一６０６５９９４ｅ：６５ｌ５９９３＋６Ｏ６
Ｋｅｒｓｎｏｏｙｃｍｐｔｇｓｌｒｙｗｏｄ：ｏｔｌｇ；ｏｕｎｍｉｉｉｉａｔｙ

一种本体概念的语义相似度计算方法

一种本体概念的语义相似度计算方法李文清;孙新;张常有;冯烨【期刊名称】《自动化学报》【年(卷),期】2012(038)002【摘要】概念语义相似度已广泛应用于Web服务发现、本体映射等领域,但现有的概念语义相似度计算方法对概念间语义相似程度的区分不够细致.本文从本体结构出发,首先提出了自底向上的本体概念出现概率计算方法,并在此基础上改进了基于节点信息量的概念语义相似性度量方法；然后又设计了基于边计算的本体概念语义相似度计算方法；最后对上述两种方法线性加权,提出了一种加权的本体概念语义相似度计算方法.实验结果表明该方法能进一步正确区分本体中父子概念及兄弟概念间的相似程度.%Concept semantic similarity is wildly used in web service matchmaking, ontology mapping and so on. But the existing concepts semantic similarity measuring methods cannot distinguish the similarities further. So in this paper, we firstly propose a bottom-up concept probability computation method based on ontology structure, and based on this probability, we improve an information content based semantic similarity method. Then, we design an edge based concept semantic similarity method. Finally, we linearly combine the two previous semantic similarity methods to form a weighted one. Result shows that the weighted one can distinguish similarity between concept and its children, or between siblings.【总页数】7页(P229-235)【作者】李文清;孙新;张常有;冯烨【作者单位】北京理工大学计算机学院北京 100081;北京理工大学计算机学院北京 100081;北京理工大学计算机学院北京 100081;石家庄铁道大学信息科学技术学院石家庄 050043;北京控制工程研究所北京 100190【正文语种】中文【相关文献】1.一种改进的本体概念语义相似度计算方法 [J], 吴星同;翁燕;朱婷;陈中育2.一种改进的本体概念语义相似度计算方法 [J], 吴星同;翁燕;朱婷;陈中育3.一种综合加权的本体概念语义相似度计算方法 [J], 甘明鑫;窦雪;王道平;江瑞4.一种新的本体的概念语义相似度计算方法 [J], 孙铁利;邢元元;关煜;陈斯娅;杨凤芹;孙红光;5.一种新的本体的概念语义相似度计算方法 [J], 孙铁利;邢元元;关煜;陈斯娅;杨凤芹;孙红光因版权原因，仅展示原文概要，查看原文内容请购买。

一种综合加权的本体概念语义相似度计算方法_甘明鑫

学者所关注。分析现有基于本体的概念语义相似度计算方法的工作原理和优缺点，提出一种对概念共享路径的重合度和概念最低共同祖先节点的深度进行综合加权的概念语义相似度算法。该算法灵活简便、可扩展性强，能够应用于不同类型的本体。使用基因本体和植物本体的部分数据进行了实验并与两种现有算法进行了比较，实验结果证明了提出的计算方法的正确性和有效性。关键词：语义相似度；本体；有向无环图文章编号： 1002-8331 （2012） 17-0148-06 文献标识码： A 中图分类号： TP391 息。然而，传统的语义相似度计算方法一般从概念的外在特征入手，偏向于自然语言描述，其计算结果往往偏离了概念原本的语义。为克服这一缺点，基于本体（Ontology）计算语义相似度的方法最近在人工智能、软件工程、情报学、语义网、生物信息学等信
甘明鑫，窦雪，王道平，等：一种综合加权的本体概念语义相似度计算方法
2012，究和应用。本体是对特定领域知识的抽象化和形式化描述，通过为领域中的概念提供标准化的词汇表来实现对概念及其相互关系的结构化描述 [1]。它能够对概念及概念间的联系形成准确的表达，将概念分类层面上的词汇语境、语义等信息综合考虑进来，形成概念的语义网络。由于本体具有相对稳定的结构关系和强大的知识表述能力，因而具有比基于自然语言处理的方法更容易进行计算和分析等优势。基于本体的概念语义相似度是指本体中两个概念在语义上的相似程度，计算时除了概念的表面特征，还需考虑分类学角度的概念语境信息。本文首先对目前基于本体计算概念语义相似度的方法进行综述，分析现有方法的原理和不足，然后提出一种综合考虑在本体结构中概念共享路径的重合程度和最低共同祖先节点的深度的概念语义相似度算法，最后通过基因本体和植物本体验证了算法的有效性和可扩展性。

文本相似度计算研究进展综述

中图分类号： TP 391. 1
文献标志码： A
A survey on research progress of text similarity calculation
WANG Hanru，ZHANG Yangsen
（ Computer School，Beijing Information Science ＆ Technology University，Beijing 100101，China）
( T1，T2，…，Tn) 构成了一个文档向量空间，采用空间向量间的余弦相似度计算文本相似度。
VSM 的缺陷在于： ①对于大规模语料，VSM 会产生高维稀疏矩阵，导致计算复杂度增加； ② VSM 假设文本中的各个特征词独立存在，割裂了词与词之间的关系以及段落间的层次关系。因而用向量空间进行文本相似度计算时，通常改进 TF-IDF 的计算方法以提高精确度。例如，张奇等［4］将文本用 3 个向量（ V1，V2，V3）表示，V1 中的每一维代表特征词的 TF-IDF 值，V2 根据一个 bi-gram 是否出现取值 0 或 1，V3 使用 tri-gram 信息，取值同 V2，用回归模型将 3 对向量相似度综合得到句子的相似度；华秀丽［5］等利用 TF-IDF 选择特征项，利用知网计算文本的语义相似度。 2. 2 基于主题模型：
1）语言的多义同义问题。同一个词在不同的语境下，可以表达不同的语义，例如“苹果 ”既可以表示水果，也可以表示科技公司；同理，相同的语义也可以由不同的词表达，例如“的士”、“计程车”都可以表示出租车。
以检测出两段文本的抄袭程度；在文本聚类方面，相似度阈值可以作为聚类标准；在自动文摘中，相似度可以反映局部信息拟合主题的程度。

1、下载文档前请自行甄别文档内容的完整性，平台不提供额外的编辑、内容补充、找答案等附加服务。
2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
3、如文档侵犯您的权益，请联系客服反馈,我们会尽快为您处理(人工客服工作时间：9:00-18:30)。

form ation Con ten tM easu res)、基于属性的语义相似度计
算 ( Featu re- b ased M easu res ) 和混合式语义相似度计
算 ( H yb rid M easu res)。在不作具体说明情况下, 本文
介绍的 4 类算法都是建立在 / IS- A 0关系树状分类体
2. 1 基于本体的语义相似度计算内涵
( 1 )语义相似度与语义距离
语义相似度和语义距离之间存在着密切的关
系 [ 3] : 两个词语的语义距离越大, 其相似度越低; 反之, 两个词语的语义距离越小, 其相似度越大。对于两个
词语 w1 和 w2, 记 S mi ( w1, w2 ) 为其相似度, D is ( w1, w2 )为词语语义距离, 则 S mi ( w1, w2 )和 D is( w1, w2 )存在下列对应关系: D is( w1, w2 )和 S mi ( w1, w2 )成反向关系, 即 D is( w1, w2 ) 越大, 则 S mi ( w1, w2 ) 越小:
关键词: 相似度 AND 关键词: 本体关键词: 语义相似 AND 关键词: 本体关键词: 相似度 AND 关键词: 本体关键词: 语义相似 AND 关键词: 本体
数据库
ISIW eb o f Sc ience
CNK I 万方
结果 (篇数 )
2 10
5 46 73 56 1 25 59
2 基于本体的语义相似度计算内涵和影响因素
cock and Chodorow法等。
Shortest Path 法 [8] 认为概念词间的相似度与其在
本体分类体系树中的距离有关。计算公式为:
S im ( c1, c2 ) = 2M AX - L
( 2)
其中, MAX表示概念词 c1 和 c2 在分类体系中的
最大路径, L 表示概念词 c1 和 c2 间的最短路径。该算
¹ 当 D is( w1, w2 )为 0时, S im ( w1, w2 ) 为 1, 表示两个词语完全相似;
º当 D is( w1, w2 ) 为无穷大时, S im ( w1, w2 ) 为 0, 表示两个词语完全不相似或不相关。
两者之间的对应关系可通过下列公式来揭示:
S im (
w1,
1引言
与前些年的信息资源匮乏相比, 现在信息用户更加关注的是如何从海量的信息资源中发掘其所需要的信息。信息资源异构性的存在, 尤其是语义异构性的存在, 使得采用传统以字符串匹配为基础的信息检索系统难以满足用户对信息和知识的深层次需求, 因此, 加强基于概念匹配的信息检索系统的研究就显得尤为重要。简而言之, 概念匹配就是计算词语之间的语义相似度 [ 1]。与传统的以词形为切入点、建立在词语字面匹配基础上的检索算法相比, 语义相似度计算是对源和目标词语间在概念层面上相似程度的度量, 需要考虑词语所在的语境和语义等信息。本体 [ 2]因其能够准确描述概念含义和概念之间的内在关联, 已成为词语语义相似度研究的基础。
下位关系和同位关系来计算词语的相似度。该算法依
赖于如下的假设: 两个词语具有一定的语义相关性, 当
且仅当其在概念结构层次网络图中存在一条通路。基
于公式 ( 1 ) , 设 C 是本体中的概念词集合, 词语 w1 和 w2 在某种映射算法或映射规则下被映射成概念词 c1 和 c2 ( c1, c2 I C) , 那么, 词语 w1 和 w2 之间的语义相似度计算就可以转换成概念词 c1 和 c2 间的相似度计算,
Path法进行了扩展, 考虑到概念词在本体层次树中的
位置信息 ( 所在深度和所处区域的密度 ) 和边所表征
的关联强度, 通过将组成 c1 和 c2 连通路径的各个边的权值相加, 而不是简单统计两个概念词间边的数量, 来
计算两个概念词的距离。Fra bibliotekW u and Palmer法 [ 10] , 与 Shortest Path法和 W eighted
( 1)被比较概念词在本体层次树中所处的深度。在本体层次树中, 概念词所处层次越高, 越抽象; 所处层次越低, 越具体。高层次的概念词间的语义相似度一般小于低层次概念词间的语义相似度。因此, 路径相同的两个节点, 高层次节点所表征的语义距离要大于低层次节点所表征的语义距离。
系基础上的。
( 1) 基于距离的语义相似度计算
基于距离的语义相似度计算的基本思想是通过两
个概念词在本体树状分类体系中的路径长度量化它们
之间的语义距离 [ 7] 。代表算法有: Shortest Path 法、
W eigh ted L inks法、W u and Palm er法、L i et al法、L ea-
X IANDA I TUSHU Q INGBAO JISHU 51
知识组织与知识管理
表 1 三个数据库的检索结果
检索策略
主题 = ( O nto logy ) AND 主题 = ( Sem antic Sim ilarity)
主题 = ( O nto logy ) AND 主题 = ( Sim ilarity)
( 4)被比较概念词连通路径上各个边在本体层次树中的关联强度。在本体层次树中, 一个节点可能与多个节点相连接, 但这些节点的重要程度通常存在差异, 因此, 相应的连接边对语义相似度的影响也必然不同。
( 5)被比较概念词连通路径上各个边的两端节点概念词的属性。本体, 尤其是领域本体, 不仅会对概念及其关系进行准确定义, 还会对概念的属性进行详细描述。如果某条边两端的概念词所用的相同属性越
w2 )
=
D
is(
A w1, w2 )
+
A
( 1)
其中, A为调节因子。
( 2 )基于本体的语义相似度计算思想
词语语义距离的计算方法基本上可以分为两
类 [ 3] : 基于某种世界知识的计算方法和基于大规模语
料库的统计计算方法。
基于世界知识计算方法的基本思想是: 按照概念间结构层次关系组织的语义词典所包含的概念之间上
( 2)被比较概念词在本体层次树中所处区域的密度。在本体层次树中, 局部区域密度越大, 说明该区域对节点概念的细化程度也越大。因此, 对组成被比较概念词连接路径的各个边来说, 其在本体层次树中所处的密度越大, 对应的权重也应该越大。
( 3)被比较概念词连通路径上各个边的类型。在本体中, 不同的概念关系所表征的语义相似度是不同的。例如, / 同义关系 0所表征的语义相似度应大于 / 整体 - 部分关系 0所表征的语义相似度。
基于大规模语料进行统计, 主要将上下文信息的概率分布作为词汇语义相似度的参照。其假设前提是: 两个词汇具有某种程度的语义相似, 当且仅当它们出现在相同的上下文中。 2. 2 本体中影响语义相似度计算的主要因素
本体概念体系可用层次树来描述, 其中节点表示本体中的概念词; 边表示本体中概念词与概念词之间的关系。一般来讲, 概念范畴较广的概念词在树中的位置一般比较高, 周围节点密度相对较少; 概念范畴较为具体的概念词在树中的位置相对较低, 且周围节点密度相对较大。因此, 树中概念词间语义相似度计算主要受以下因素影响 [ 4- 6]:
总第 188期 2010年第 1期
知识组织与知识管理
基于本体的语义相似度计算方法研究综述*
孙海霞 1 钱庆 1 成颖 2 1 (中国医学科学院医学信息研究所北京 100020 ) 2 (南京大学信息管理系南京 210093) =摘要 > 在对基于本体的词语语义相似度进行界定的基础上, 对基于本体的语义相似度研究进行综述, 分别阐述基于距离的语义相似度计算、基于内容的语义相似度计算、基于属性的语义相似度计算和混合式语义相似度计算等算法模型, 最后从宏观层面指出今后本领域的研究方向。 =关键词 > 语义相似度语义相似度计算本体概念匹配 =分类号 > TP391
2 ( D epartm en t of In form ation M anagem ent, N an jing U n iversity, N an jing 210093, Ch in a)
=Abstract> Based on th e general d efin it ion and d issertat ion for seman tic smi ilarity m easuring of On tology, th is paper m akes a review of research on the O n tology- based seman tic s mi ilarity m easu res, in trodu ces edge coun ting m easu res, inform ation conten t m easures, feature- based m easu res and hyb rid measu res resp ectively. A t last, it poin ts ou t th e d irection of fu tu re work from macroscop ic perspective. =K eywo rds> Seman tic smi ilarity S em ant ic s mi ilarity m easu ring On tology Concep t- based m atch ing