lecture11-probmodel 信息检索导论 王斌 PPT 课件 第11章


20
现代信息检索
乘法公式、全概率公式和贝叶斯公式
乘法公式:
P(AB)=P(A)P(B|A) P(A1A2…An)=P(A1)P(A2|A1)...P(An|A1…An-1)
全概率公式:A1A2…An是整个样本空间的 一个划分 P( B )= P( A ) P( B | A )
n i i i 1
上一讲及向量空间模型回顾
基本概率统计知识

❹ ❺
Logistic回归模型
BIM模型 BM25模型
30
现代信息检索
回归(Regression)
回归分析:回归分析是处理变量之间相关关系的一种工具, 回归的结果可以用于预测或者分类 一元线性回归:根据观测点,拟合出一条直线,使得某种损 失 (如离差平方和)最小 ^
9
现代信息检索
基于词汇化子树表示的向量空间模型
目标: 对向量空间中的每一维都同时考虑单词及其在XML树中 的位置信息 做法: 将XML文档映射成词汇化子树
Book Microsoft Bill Gates
Title
Title Author Microsoft Microsoft Bill Gates
现代信息检索
概率检索模型
概率检索模型是通过概率的方法将查询和文档联 系起来
定义3个随机变量R、Q、D:相关度R={0,1},查询 Q={q1,q2,…},文档D={d1,d2,…},则可以通过计算条件 概率P(R=1|Q=q,D=d)来度量文档和查询的相关度。
概率模型包括一系列模型,如Logistic Regression(回归)模型及最经典的二值独立概率模 型BIM、BM25模型等等(还有贝叶斯网络模型)。 1998出现的基于统计语言建模的信息检索模型本 质上也是概率模型的一种。
28
现代信息检索
几种概率检索模型
基于Logistic回归的检索模型 经典的二值独立概率模型BIM 经典的BM25模型 (BestMatch25) 贝叶斯网络模型:本讲义不介绍,请参考有关文 献。 基于语言建模的检索模型:1998年兴起,研究界 的热点。下一讲介绍。
29
提纲
❶ ❷
Author
Bill
Author
Gates
Book
Title Microsoft
Book
Author Bill Gates
...
10
现代信息检索
INEX(Initiative for the Evaluation of XML retrieval)
INEX: XML检索研究中的首要评测平台,它通过协作产生参考文档集、查询
494 MB
1995—2002 1,532 6.9 30 30
规模
文章发表年份 平均每篇文档中的XML节点个数 平均每个节点的深度 CAS主题的数目 CO 主题的数目
11
现代信息检索
向量空间模型
文档表示成向量
查询也表示成向量 计算两个向量之间的相似度:余弦相似度、内积 相似度等等 在向量表示中的词项权重计算方法主要是tf-idf公 式,实际考虑tf、idf及文档长度3个因素
❶ ❷
将节点分组,形成多个互不重叠的伪文档 (pseudodocument ) 索引最大元素,然后自顶向下(top down)后处理


索引叶节点,然后自底向上(bottom up)进行后处理扩展
对所有元素建立索引
8
现代信息检索
挑战3:元素嵌套
针对元素嵌套所造成的冗余性,普遍的做法是对返回元素进行限 制。这些限制策略包括: 这些限制策略包括: 忽略所有的小元素 忽略用户不会浏览的所有元素类型(这需要记录当前 XML检索系统的运行日志信息 忽略通常被评估者判定为不相关性的元素类型(如果有 相关性判定的话) 只保留系统设计人员或图书馆员认定为有用的检索结果 所对应的元素类型 在大部分上述方法中,结果集中仍然包含嵌套元素。
数字图书馆、专利数据库、博客、包含已标注命名实体 (如人名、地名)的文本
例子
数字图书馆: give me a full-length article on fast fourier transforms
专利: give me patens whose claims mention RSA public key encryption and that cite US patent 4,405,829
现代信息检索
各种分布关系图
硬币朝上或朝下X=0 或者1
二值 分布
n重贝努利试验
二项 分布
n重贝努利试验 k次朝上的概率
多值 n元贝努 利分布
骰子某个面朝上 X=0,1,2,3
n次不同硬币
n 重试验, X1=x1, X2=x2,…
多项 分布
现代信息检索
贝努利
瑞士数学家家族,产生过11位数学 家 雅可比贝努利(Jacob Bernoulli) : 1654-1705 积分“integral”这一术语即由他首创
实体标记文本: give me articles about sightseeing tours of the Vatican and the Coliseum
4
现代信息检索
XML 文档
5
现代信息检索
挑战1: 返回文档的一部分
XML检索中,用户希望返回文档的一部分(即 XML元素), 而不像非结构化检索那样往往返回整个文档
贝努利试验、贝努利分布
25
现代信息检索
概率检索模型
检索系统中,给定查询,计算每个文档的相关 度 检索系统对用户查询的理解是非确定的 (uncertain),对返回结果的猜测也是非确定的 而概率理论为非确定推理提供了坚实的理论基 础 概率检索模型可以计算文档和查询相关的可能 性
26
16
现代信息检索
概率 vs. 统计
概率是统计的理论基础
概率
统计是概率的实际应用 necessity 典型问题: 已知某数 据总体满足某分布, 抽样得到某数据的概 率是多少?
统计
典型问题:已知某抽样 数据(或总体分布),判 断总体的分布(或分布 参数) 是多少?
现代信息检索
概率统计初步
随机试验与随机事件 概率和条件概率 乘法公式、全概率公式、贝叶斯公式 随机变量 随机变量的分布
12
现代信息检索
tf-idf权重计算的三要素
13
现代信息检索
向量空间模型的优缺点
优点:
简洁直观,可以应用到很多其他领域(文本分类、生 物信息学)。 支持部分匹配和近似匹配,结果可以排序 检索效果不错
缺点:
理论上不够:基于直觉的经验性公式 标引项之间的独立性假设与实际不符:实际上, term的出现之间是有关系的,不是完全独立的。如: “王励勤” “乒乓球”的出现不是独立的。

❹ ❺
Logistic回归模型
BIM模型 BM25模型
2
提纲
❶ ❷
上一讲及向量空间模型回顾
基本概率统计知识

❹ ❺
Logistic回归模型
BIM模型 BM25模型
3
现代信息检索
结构化检索(Structured retrieval)
基本配置: 结构化或非结构化查询+结构化文档
结构化检索的应用场景
14
现代信息检索
本讲内容
概率基础知识
基于概率理论的检索模型 Logistic回归模型
二值独立概率模型 BIM:不考虑词项频率和文档 长度
考虑词项频率和文档长度的BM25模型
15
提纲
❶ ❷
上一讲及向量空间模型回顾
基本概率统计知识

❹ ❺
Logistic回归模型
BIM模型 BM25模型
18
现代信息检索
随机试验和随机事件
随机试验:可在相同条件下重复进行;试验可能 结果不止一个,但能确定所有的可能结果;一次 试验之前无法确定具体是哪种结果出现。
掷一颗骰子,考虑可能出现的点数
随机事件:随机试验中可能出现或可能不出现的 情况叫“随机事件”
掷一颗骰子,4点朝上
19
现代信息检索
Introduction to Information Retrieval 中科院研究生院2011年秋季课程《现代信息检索》
更新时间: 2011/11/07
现代信息检索 Modern Information Retrieval
第11讲 概率检索模型 Probabilistic Information Retrieval
贝叶斯公式: A1A2…An是整个样本空间的 一个划分
P( Aj | B ) P( Aj ) P( B | A j )
i i
P( A ) P( B | A )
i 1
n
,( j 1,..., n )
21
现代信息检索
事件的独立性
两事件独立:事件A、B,若P(AB)=P(A)P(B), 则称A 、B独立 三事件独立:事件A B C,若满足 P(AB)=P(A)P(B), P(AC)=P(A)P(C),P(BC)=P(B)P(C), P(ABC)=P(A)P(B)P(C),则称A、B、C独立 多事件独立:两两独立、三三独立、四四独 立….
y
( xi , yi )
^
பைடு நூலகம்y a bx
( xi , yi )
多元线性回归:
x1
i
x
y 0 i xi
31
集及相关性判断。在每年一度的INEX会议上,研究人员展示并讨论交流各 自的研究结果。INEX 2002文档集包含大概12000篇来自IEEE期刊的文章。
合集下载

第2章--信息检索PPT课件

第2章--信息检索PPT课件

经济
文化、科学、教育、体育 语言、文字 文学 艺术 历史、地理
S
T U V X Z
农业科学
工业技术 交通运输 航空、航天 环境科学、安全科学 综合性图书
《中国图书馆分类法》
中国图书馆分类法分类表共分22个大类,再分17个 二级目录,医药卫生属于R大类。 《中图法》采用汉语拼音字母和阿拉伯数字组成的 混合制号码作类目标识,用一个字母标记一个基本
的问题;
另一方面是特定原始文献的查找,即在查找特定
的文献线索后,找出原始文献的过程。
第一节 信息检索基础
一、信息检索概念
(二)信息检索的意义和作用 信息检索 有助于知识更新 ,有助于同学们扩大视野 ,了解和把握有关学科中出现的新思想、新观点与 新知识。掌握信息检索技术是快速、准确地获取和 利用最新信息的有效途径。 信息检索有助于科学研究,了解和把握有关学科的 起源和发展过程。 有助于独立自主地解决自己在学习、生活和工作中 所遇到的疑难问题。 是接受终身教育的必要手段。 节省时间,提高效率。
第二节 信息检索语言
二、检索语言的种类
(一)分类检索语言 分类检索语言又称分类法,是用分类号(字母、数 字或它们的组合)来表达各种概念的,并将各种概 念按学科性质进行分类和系统排列的信息检索语言。 它以树状结构的形式,按知识门类的逻辑次序反映事物 的从属、派生关系,构成具有上位类和下位类隶属、同 位类并列的概念等级体系。 能较好体现概念的族性关系,从学科专业的角度检索资 料,比较方便,扩大、缩小检索范围方便。
(一)按信息检索的对象划分
数据信息检索 利用数据库、工具书等以数值或数据为对象的检 索,也称为数值检索。检索包含分子式、分子量 、公式 、图表等特定数据的信息。

信息检索之课件文稿演示

信息检索之课件文稿演示

省图馆藏 书目查询 系统
2021年3月6日星期六
湖北民族学院《信息检索》(Information Retrieval )系列课件
3-16
检索方法
2021年3月6日星期六
湖北民族学院《信息检索》(Information Retrieval )系列课件
3-17
普通检索界面
2021年3月6日星期六 北京交通大学出版社《信息检索教程》(Information Retrieval Textbook)系列课件 3-18
随着现代计算机技术的发展,大多数图书馆都已 建成馆藏书目数据库,并进而发展成基于计算机网络 的联机公共目录检索系统(OPAC)。读者利用OPAC系 统,在任何地方都可以方便地查询图书馆的书刊信息, 使馆藏书目走出图书馆,实现了更广泛地服务于公众 的目的。
3-2
OPAC系统一般设置题名、责任者、主题词、分 类号、索取号、ISBN/ISSN号、出版社等字段,输入 检索词即可检索。系统执行后将逐条显示命中书刊的 基本信息,单击某个题名则进一步显示详细的书目信 息和馆藏及流通信息,读者可据此前往图书馆借阅。
由于图书馆的藏书数量相当庞大,而读者不可能 尽知每本图书的准确书名,因此在使用OPAC时,可 先通过题名、责任者、主题词等途径找出若干所需图 书,然后从这些图书的分类号入手,通过分类途径浏 览、查寻,最终找到自己最需要的图书。
2021年3月6日星期六
湖北民族学院《信息检索》(Information Retrieval )系列课件
湖北民族学院《信息检索》(Information Retrieval )系列课件
ห้องสมุดไป่ตู้
3-2
1 书刊目录检索系统
书目即书刊目录的简称。它是将图书、期刊按一 定规则著录、并有序编排而成的检索工具,它记载书 刊的题名、著(译)者、版本、出版地、出版者、出版 年、文献内容等信息。

信息检索 ppt 第1章 绪论

信息检索 ppt 第1章 绪论

信息需求集合
当人们为完成某一任务时,经常觉得缺少的某些知识,即信 息需求。
匹配与选择
需要一种匹配机制。 匹配机制的主要功能:能够把信息需求集合与信息资源集合 依据某种相似性标准进行比较与判断,选择出符合用户需要 的信息。
第 1章 概
1.1 1.2 1.3 1.4 1.5 1.6
述Hale Waihona Puke 信息、知识、文献 信息的特征及类型 信息检索概念和原理 信息检索类型 信息检索的主要研究问题 信息检索的发展历史
信息检索类型
按检索内容不同
文献检索
以文摘、题录、全文 为检索对象。
数据检索
以数据为检索对象
事实检索
以事实、概念、思想、 知识等非数值信息为 检索对象
文献检索
以文献(包括文摘、题录或全文)为检索对象的 一类信息查询活动。是一种相关性检索,不直接回答 用户所提的问题本身,只是提供有关的文献供参考。 典型的文献检索
二次文献
(书目文献、索引、文摘)
是以一次文献为依据加工整理而形成的信息,是对一次信息的浓缩 或有序化产物。如:目录、文摘、索引等。 特点:为查找一次文献提供线索,具有系统性、工具性特点。
三次文献
对零次文献、一次文献、二次文献进行分析研究,加工提炼和概括 综合而形成的信息。如:综述、述评、进展报告、学科年度总结等。 特点:信息量大、综合性强、系统性好。
查找某出版社2008年出版图书的信息; 查找某公司在全球哪些地区设立了分公司、分公司地址、员工 数、主要负责人等。
数据检索
是指查找用户所需特定数据的检索。可以利用专门的数据 库进行检索。例如: 我国第五次人口普查中全国汉民族的人数。
狭义的信息检索仅指信息的查找,是指从信息集

《信息检索导论》PPT课件

《信息检索导论》PPT课件

出正确的决策。
编辑课件ppt
22
1.1 信息素养与信息检索
一、信息、信息社会与信息素养 二、信息检索教学的主要意义 三、信息检索教学的基本内容
编辑课件ppt
23
三、信息检索课程的基本内容
1、信息检索的基本知识:文献、情报、知识、信息的概念;不同文献 类型的特点;专业文献概况及主要收藏单位;情报与 Information Literacy对科学活动及个人知识增殖的作用;文献检索的意义和作用。
⑴ 信息共享实现的条件在于信息对于物质依附性的相对性,即同一信息 可以采用多种相同的或不同的物质载体及其运动形式构成。
⑵ 信息共享的基础在于信息存在的普遍性和信息价值的非对称性。信息 产品的使用价值是一个点集或面,其价值和使用价值具有非对称性; 而物质产品的使用价值在同一时刻仅为一个点,且遵循等值交换原则。
有害信息:指对社会发展和信息用户有消极和阻碍作 用的不真实或庸俗、媚俗的信息,主要有虚假信息和 色情信息等。
编辑课件ppt
21
二、信息检索教学的主要意义
1、一个平台:培养信息意识, 提高自学能力和独立研究能力。
1992年国家教委高教司在《文献检索课教学基本要求》 的通知中指出:“文献检索课是培养学生掌握利用图书 文献/情报检索,不断提高自学能力和科研能力的一门 科学方法课。”
17
1 以认识主体为依据对信息进行的划分
客观信息,是指对事物不加判断的如实 和公正的报道,即关于认识对象的信息。
主观信息,一般是依据事实和分析,阐 明个人对论题的观点和见解,是经过思 维主体加工的信息。
编辑课件ppt
18
2 以信息的生成领域对信息进行的划分
自然信息,非生命物质的自然信息,是无机界事物 属性及事物之间内在联系的表征。自然信息是融合 式的、特殊的、弥漫的。

整理版信息检索概述课件

整理版信息检索概述课件
– 第一代:卡片目录自动化系统 OPAC online public access catalogue
– 第二代:增加按主题、关键词、复杂查询 – 第三代:图形界面、数字化、超文本、开放系统框
架、基于Web
26
2023/10/2
信息检索系统开发与设计 第一章
1.3.2 信息检索发展趋势
Web对信息检索系统的巨大影响
数据库 联机信息检索与网络信息检索
– 是目前信息检索的主要方式,最为便利,使用也最广。涉及到许多计算机设 备、软件技术、存贮技术、检索技术、系统管理和经营知识、市场营销技术 等。
检索策略与方法
– 任务是利用、研究、评价和完善现有的各种检索策略和方法,研究开发新的 更有效的策略和方法。
30
2023/10/2
图 1-1 信息检索中用户任务
4
2023/10/2
信息检索系统开发与设计 第一章
1.1 .1 信息检索中用户任务
检索 retrieval
– 用户将其信息需求和问题翻译成检索系统要求的提 问式(query),系统匹配后,提交相关文献。
浏览 browsing
– 使用交互式界面翻阅整个文献集合,以找出感兴趣 的相关文献。
现代: 用文献的所有词集合以及结构来表示成为可 能,检索系统采用文献的全文本(full-text view) 视图逻辑表示。
9
2023/10/2
信息检索系统开发与设计 第一章
1. 2 信息检索系统
信息检索系统是由一定的设备和信息集合构成, 面向一定的用户,具有信息采集、组织、存贮、 选择和传播等功能的信息服务设施。
据格式转换、生成并定期更新各种文档。
19
2023/10/2

信息检索教程(第三版)PPT11

信息检索教程(第三版)PPT11
3.数据字段区 由一些可变长数据组成。数据字段区的功能块有10个,每个功能 块设立了一些相关 字段。
4.2.2 元数据
元数据的英文为 Metadata,意为关于数据的数据。在互联网中,元数据是 指描述任何 Internet数据和资源,促进互联网信息资源的组织和发现的数 据,以协助对网络资源的识 别、描述、指示其位置。
4.1 信息著录的含义和标准
4.1.1 信息著录的含义和作用
1.信息著录的含义 信息著录简称著录,是指在组织检索系统时对文献内容和形式特征进行选择和记录的
过程。信息著录是组织检索系统的基础,是信息存储过程中的一个重要环节。准确性 和规范化是信息著录的基本要求。准确性要求著录结果要全面、客观、准确地 揭示 文献或其他信息源的内容特征和形式特征。 2.信息著录的作用 信息著录的目的是为了报道和检索信息,通过著录可以浓缩文献信息的特征,起到揭 示文献、报道文献,帮助人们快速地了解文献,进而选择自己所需文献的作用。
的信息为止,经过一系列工 序、采用多种方式与手段,最终形成记载文献相关信息的款 目或记录。 (3)检索功能 作为信息著录结果的款目或记录,记载了反映文献特征的可供检索的各 个标识。
4.1.2 信息著录的标准
信息著录标准是指在描述信息过程中所要依据的规则和条例,是实现信息著录标准化 的前提和根本。信息著录标准包括国际标准和国家标准。
4.1.1 信息著录的含义和作用
信息著录 的作用具体如下: (1)揭示功能 信息著录主要反映的是文献本身 所具有的特征,在对文献全面系统分析、选出最具有代
表性的特征后,通过概括而精练地 叙述内容特征,以及简略而准确地描述形式特征。 (2)组织功能 信息著录从分析文献的内 容特征和外表特征开始,到记录下各种与文献报道和检索有关

《信息检索导论》课件2


学习网站
信息检索博客、谷歌学术、 ACM Digital Library等。
深入学习建议
参加信息检索领域的相关研 讨会和学术会议,与专家交 流并进行实践项目。
《信息检索导论》PPT课 件
欢迎来到《信息检索导论》PPT课件,本课程将介绍信息检索的基础概念、技 术和实践案例,让你深入了解该领域的关键知识和应用。
课程介绍
课程目标
掌握信息检索的基本理论和 技术,学习如何构建高效的 检索系统。
课程内容
包括信息检索的定义、流程、 模型与评价指标等重要概念。
课程安排
第一部分:信息检索基础 第二部分:信息检索技术 第三部分:实践案例分析 第四部分:进一步学习资源
信息检索基础
1 信息检索定义
信息检索是一种从大规模的信息集合中找到最相关的信息的过程。
2 信息检索流程
包括用户需求分析、查询处理、倒排索引构建和结果展示等步骤。
3 检索模型与评价指标
常用的模型包括布尔模型、向量空间模型和概率检索模型。评价指标有精确率、召回率 和F1值。
信息检索技术
文本预处理
包括分词、去除停用词和词干 提取等技术,以便更好地处理 查询和文档。
倒排索引
一种高效的索引结构,用于快 速定位包含特定词项的文档。
查询处理与展示
针对用户查询进行解析和扩展, 同时通过界面展示与查询相关 的文档。
实践案例分析
检索引擎案例
探索传统搜索引擎如Google和百 度背后的信息检索技术和算法。
社媒体搜索案例
了解如何从社交媒体平台如 Twitter和Facebook中检索有用的 信息。
电子商务搜索案例
研究电商平台如Amazon和淘宝如 何实现快速准确的商品搜索。

信息检索导论第十一章

P(AC)=P(A)P(C),P(BC)=P(B)P(C), P(ABC)=P(A)P(B)P(C),则 称A、B、C独立
多事件独立:两两独立、三三独立、四四独立….
随机变量:若随机试验的各种可能
的结果都能用一个 变量的取值(或范 围)来表示,则称这个变量为随机变 量,常用X、Y、Z来表示 (离散型随机变量): (连续型随机变量)
11.3.3 实际中的概率估计方法
一、评估不相关文档有关的量
二、评估相关文档有关的量
1、已知某些相关文档,利用这些已知相关文档中的词项出现频率来对 pt进行估计。 2、 Croft和Harper(1979)在他们的组合匹配模型(combination match model)中提出了利用常数来估计pt的方法。 3. Greiff (1998)pt会随dft的增长而增长
Lecture-11 概率检索模型
提纲
11.1 概率论基础知识
11.2 概率排序原理
11.3 二值独立模型(BIM) 11.4 概率模型的相关评论及扩展
(Okapi BM25 权重计算方法、基于贝叶斯网络的IR模型)
11.1 概率论基础知识
随机试验与随机事件 概率和条件概率 乘法公式、全概率公式、贝叶斯公式 随机变量
11.3.4 基于概率的相关反馈方法
11.4 概率模型的相关评论及扩展
11.4.1 概率模型的评论 在BIM模型中,假设:
11.4.2 词项之间的树型依赖
11.4.3 Okapi BM25:一个非二值模型
如果存在相关性判断结果
11.4.4 IR中的贝叶斯网络方法
贝叶斯网络是通过有向图来表示不同随机变量之间的概率依赖关系,对 于任意有向无环图,已经发展出多种在节点之间传递影响度的复杂算法, 可以基于任意知识在图上面进行学习和推理。Turtle和Croft利用了一 个复杂的图模型来对文档和信息需求之间的复杂依赖关系进行建模。

《信息检索模型》PPT课件


(1,1,0) (1,0,0)
(1,1,1)
精选课件ppt
19
布尔检索模型
定义:用qdnf表示查询q的析取范式,qcc表示qdnf 的任意合取分量。文献dj
与查询q的相似度为
s im (d j,q ) 1 0 io fth e q rc w ci|s (e q c c q d n f) ( k i,g i(d j) g i(q c c ))
根据布尔逻辑的运算规定,提问式q可以被表示 成由合取子项(conjunctive component)组成的 析取范式(disjunctive normal form,简称DNF) 形式。
精选课件ppt
15
离散数学相关概念
用连词∧把几个公式连接起来而构成的公 式叫做合取,而此合取式的每个组成部 分叫做合取项。p并且q,记作“p∧q”
用连词∨把几个公式连接起来所构成的公 式叫做析取,而此析取式的每一组成部 分叫做析取项。 p或q,记作“p∨q”
非p ┐p
精选课件ppt
16
离散数学相关概念
析取范式: 仅由有限个简单合取式构成的析取式
A=(p∧┐q∧r)∨(┐p∧q)∨(q∧┐q) 合取范式:
仅由有限个简单析取式构成的合取式 A=(p∨┐q∨r)∧(┐p∨q)∧(q∨┐q)
询结果
相当有效的实现方法
相当于识别包含了一个某个特定term的文档
经过某种训练的用户可以容易地写出布尔查询 式
布尔模型可以通过扩展来包含排序的功能,即 “扩展的布尔模型”
精选课件ppt
23
问题
布尔模型被认为是功能最弱的方式,其主要问题在于不支持部分 匹配,而完全匹配会导致太多或者太少的结果文档被返回
精选课件ppt

《信息检索模型》PPT课件

文档集中的索引项
精选ppt
18
索引项的选择
这些索引项是不相关的 (或者说是正交的) ,形成一个 向量空间vector space
“计算机” “科学” “商务”
计算机科学文档集
该文档集中的全部重要词项
实际上,这些词项是相互关联的
当你在一个文档中看到 “计算机”, 非常有可能同时看到“科 学”
当你在一个文档中看到 “计算机”, 有中等的可能性同时看到 “商务”
索引项t(Term):指出现在文档中能够代表文档性质
的基本语言单位(如字、词等),也就是通常所指的
检索词,这样一个文档D就可以表示为D(t1,t2,…,tn), 其中n就代表了检索字的数量。
特征项权重Wk(Term Weight):指特征项tn能够代 表文档D能力的大小,体现了特征项在文档中的重要程
精选ppt
23
由索引项构成向量空间
2个索引项构成一个二维空间,一个文档可能 包含0, 1 或2个索引项
di = 0, 0 (一个索引项也不包含) dj = 0, 0.7 (包含其中一个索引项) dk = 1, 2 (包含两个索引项)
类似的,3个索引项构成一个三维空间,n个索 引项构成n维空间
信息检索模型
哈工大信息检索研究室 2007
精选ppt
1
这一部分将讲述
布尔模型,向量空间模型,扩展的布尔 模型
概率模型和基于语言模型的信息检索模 型的区别和联系
基于本体的信息检索模型和基于隐性语 义索引的信息检索模型
精选ppt
2
信息检索模型的概述
精选ppt
3
什么是模型?
模型是采用数学工具,对现实世界某种 事物或某种运动的抽象描述
文档表示 一个文档被表示为关键词的集合
  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档