语料库常用术语解释 (1)
官方时政术语汉英语料库
官方时政术语汉英语料库嘿,你有没有想过,当你在看国际新闻或者参加一些高大上的时政讨论时,那些官方时政术语就像一个个神秘的密码?而现在,我要给你介绍一个超酷的东西——官方时政术语汉英语料库,这就像是打开时政知识宝库的一把万能钥匙。
比如说,“一带一路”(The Belt and Road Initiative)。
这可不是简单的几个字,这是一个连接各国的超级计划,就像一条神奇的纽带,把沿线国家紧紧地联系在一起。
想象一下,不同国家的人们就像一群小伙伴,大家手拉手,沿着这条“路”一起发展经济、分享文化。
当你想要跟外国朋友聊这个伟大的计划时,这个语料库就能让你轻松找到对应的英语表达,不会再支支吾吾,像个迷路的小羊羔。
再说说“人类命运共同体”(A Community with a Shared Future for Mankind)。
这简直是个超级暖心的概念,就像一个大家庭,不管你来自哪里,皮肤是什么颜色,大家都在这个共同体里,有福同享,有难同当。
在国际会议上,如果有人问你这个词的英语怎么说,你要是从这个语料库里早就学过,那就能自信满满地回答,就像一个学霸在考场上对答如流。
这个语料库可不仅仅是个简单的词汇表哦。
它里面有各种各样的时政术语,从国内的政策到国际的合作,应有尽有。
对于那些想学习时政知识的人来说,这就像是一个装满宝藏的山洞,每一个术语都是一颗闪闪发光的宝石。
你也许会问,那我怎么才能更好地利用这个语料库呢?其实很简单,就像你学新单词一样,每天看几个,试着用一用。
比如说你和同学聊天的时候,就可以把这些时政术语融入进去,就像在普通的饭菜里加了点特别的调料,让你的谈话立马变得高大上起来。
还有啊,这个语料库对那些想要从事外交工作或者国际事务相关工作的人来说,那简直就是如鱼得水。
就好比一个厨师有了一本超全的菜谱,不管面对什么样的客人,都能做出美味的菜肴。
你要是想在外交舞台上一展身手,这个语料库就能让你在语言表达上毫无压力。
语料库
近二十年大学生英语自主学习研究综述--基于语料库方法的分析一、语料库的概念语料库的使用早在几百年前就开始了(Kennedy 2000: 13-15)。
但是,过去的“语料库”是非计算机操作,人们把需要的句子抄在卡片或纸条上,然后对其检索。
所以,这种现象我们只能称之为语料库方法,而非现代意义上的语料库。
有人把语料库定义为语言材料的仓库,该定义远远不能说明语料库的特征。
语料库以计算机检索为手段。
计算机有一个强大的检索功能,这是人所不及的。
语料库中聚集了大量文本,而计算机对任意大的语料库进行检索易如反掌。
所以,有人认为术语“语料库语言学”应为“计算机语料库语言学”(Leech 1997: 1)。
语料库文本的收集是按照某些原则进行的。
英国国家语料库(British National Corpus,以下简称BNC)的书面语占总库的90%,口语占10%,整个库的结构如表1所示。
Brown语料库不包括口语,书面语的收集方法和BNC有很大不同,其结构见何安平(2004:141-143)。
BNC的文本长度参差不齐,长的达436 048个单词,短文本只有25个单词;而Brown把文本的长度固定在2 000词左右,超出则删除。
LOB(与Brown 结构相同)语料库的文件长度平均为2 013单词左右2.文献综述语料库是在随机采样的基础上收集的有代表性的真实语言材料的集合,是语言运用的样本。
[1]语料库(Corpus)也是应用计算机技术对海量的自然语言材料进行处理和存储,以供自动检索、索引以及统计的大型资料库。
[2]语料库可以帮助学习者获得包含检索词的很多鲜活例子为学习者习得二语语块提供可行之道。
[3]由此我们可以看到,语料库对于语言的习得应用帮助颇大;运用语料库的检索我们可以解决很多用词不确定的问题。
语料库语言学语汇编V20
教学语料库
Phraseology
短语学、短语
Phraseological uni t/seque nee
短语单位/序列
Phraseological profile
短语概貌
Plain text
纯文本
POSgram
赋码序列、码串
POS seque nee
赋码序列、码串
POS taggi ng/Part-of-Speech taggi ng
搭配词;搭配
Collocability
搭配强度、搭配力
Collocati on
搭配、词语搭配
Collocati onal stre ngth
搭配强度
Collocati onal framework/frame
搭配框架
Collocational profile
搭配概貌
Collocati onal n etwork
一次词
Header/Text head
文本头、头文件
Hidden Markov model (HMM)
隐马尔科夫模型、隐马模型
Historical corpus
历时语料库
HowNet
知网
ICTCLAS
中科院汉语分词系统
Idiom prin ciple
习语原则、成语原则
Idiomaticity
习语性、地道程度
多维分析、多维度分析法
Meaning by collocati on
搭配辨义
Metadata
元信息
MF/MD approach/multi-feature/multi-dime nsi onal an alysis
自然语言处理中文语料库-概述说明以及解释
自然语言处理中文语料库-概述说明以及解释1.引言1.1 概述自然语言处理(Natural Language Processing,简称NLP)是人工智能领域一项重要的研究领域,旨在使计算机能够理解和处理人类自然语言。
而中文作为全球最流行的语言之一,对于中文语料库的建设和应用具有重要意义。
中文语料库是指收集和整理的大量中文文本数据集合,可以是书籍、报纸、电子邮件、社交媒体上的文本等。
它们以结构化或非结构化的形式存在,总结和反映了中文语言的特点和使用习惯。
概括而言,中文语料库在自然语言处理中扮演着至关重要的角色。
首先,中文语料库作为研究和开发的基础,为构建和训练中文语言模型提供了必要的数据和素材。
其次,中文语料库可以用于中文文本的词法分析、句法分析、语义分析以及情感分析等一系列任务,以获取更准确、更全面的语义信息。
在过去的几十年里,中文语料库的建设方法也得到了长足的发展。
传统的构建方法包括人工标注、网络爬虫等方式,但由于人力成本和效率问题,近年来基于自动化技术的语料库构建方法逐渐兴起。
利用自然语言处理和机器学习技术,可以通过大规模文本数据的自动抽取和标注来搭建中文语料库。
纵观全球的自然语言处理研究和应用领域,可以发现中文语料库的前景广阔而且潜力巨大。
随着人工智能技术的不断发展和深入,中文语料库可以为机器翻译、智能问答、信息检索等领域提供更加准确和高效的支持。
在大数据时代,中文语料库的规模和质量不断提升,将对中文自然语言处理的研究和应用产生积极而深远的影响。
尽管中文语料库的发展已经取得了很大的成绩,但仍面临着一些挑战。
其中之一就是语料库的规模和多样性问题。
尽管中文是世界上使用最广泛的语言之一,但由于其复杂的构造和汉字的数量庞大,建设大规模且多样化的中文语料库仍具有一定的难度。
总之,中文语料库在自然语言处理的研究和应用中起着重要的作用。
它们为中文语言模型的建立提供了基础数据,为各种文本分析任务提供了实验平台,同时也为人工智能技术的发展开辟了更加广阔的空间。
语料库语言学
1959-1991年语料库研究项目统计表
语料库语言学的主要研究内容
• 语料库的建设与编纂 • 语料库的加工和管理技术 • 语言研究中语料库的使用 • 语料库在计算语言学中的应用
语料库设计和编纂中的问题
• 语料库设计和编纂的出发点是:如何使得在其基础上开展 的语言调查是合理的和可靠的。因此Kennedy(1998)指出 了语料库设计师所面临的最基本问题:这个语料库所采集 的语言数据是否真正代表了某种期望的语言或语体。在语 料库的建设和编纂过程中应考虑的问题包括:
• (1)数据的区别性特征:语料库语言学数据以其验证性、大数
量性、自动化、计量性等特征有别于其它类型的数据。
• (2)特征性分析技术:包括频数统计、词语索引分析、搭配分
析、词从、主题词等。
• (3)自下而上与自上而下兼用的精密分析过程 :经典语料
库语言学研究中的归纳与推演,数据观察与理论讨论,往往 是层层展开,步步深入,穷尽一切可能,逐渐逼近,到达结论。
语言研究中语料库的使用
1.言语研究: (1)语言学理论 。
(2)语言史研究。 (3)句法、词法及自动语法分析。
2.词汇研究: 编纂词典及工具参考书。 3.语义学 4.语用学和话语分析(很少) 4.社会语言学 5.心理语言学 6.外语教学
语料库语言学在计算语言学中的应用
• 20世纪90年代以来在自然语言处理(NLP)和计 算语言学的研究中,语料库方法和统计语言模型 迅速崛起,成为主流技术。主要用法如下: 1)汉语文本中交集型切分歧义的研究 2)汉语基本名词短语识别研究 3)基于结构词义空间的汉语词义排歧模型
语料库研究方法的局限性
• (1)语料库语言学理论尚需要体系化和简约化。 • (2)其研究思路和方法存在一定的分歧。 • (3)分析方法和技术需要进一步突破 • (4)语料库研究的应用尚需要更深入的探讨。
【VIP专享】语料库术语中英对照
Aboutness 所言之事Absolute frequency 绝对频数Alignment (of parallel texts) (平行或对应)语料的对齐Alphanumeric 字母数字类的Annotate 标注(动词)Annotation 标注(名词)Annotation scheme 标注方案ANSI/American National Standards Institute 美国国家标准学会ASCII/American Standard Code for Information Exchange 美国信息交换标准码Associate (of keywords) (主题词的)联想词AWL/Academic word list 学术词表Balanced corpus 平衡语料库Base list 底表、基础词表Bigram 二元组、二元序列、二元结构Bi-hapax 两次词Bilingual corpus 双语语料库CA/Contrastive Analysis 对比分析Case-sensitive 大小写敏感、区分大小写Chi-square (χ2) test 卡方检验Chunk 词块CIA/Contrastive Interlanguage Analysis 中介语对比分析CLAWS/Constituent Likelihood Automatic Word-tagging System CLAWS词性赋码系统Clean text policy 干净文本原则Cluster 词簇、词丛Colligation 类联接、类连接、类联结Collocate n./v. 搭配词;搭配Collocability 搭配强度、搭配力Collocation 搭配、词语搭配Collocational strength 搭配强度Collocational framework/frame 搭配框架Comparable corpora 类比语料库、可比语料库ConcGram 同现词列、框合结构Concordance (line) 索引(行)Concordance plot (索引)词图Concordancer 索引工具Concordancing 索引生成、索引分析Context 语境、上下文Context word 语境词Contingency table 连列表、联列表、列连表、列联表Co-occurrence/Co-occurring 共现Corpora 语料库(复数)Corpus Linguistics 语料库语言学Corpus 语料库Corpus-based 基于语料库的Corpus-driven 语料库驱动的Corpus-informed 语料库指导的、参考了语料库的Co-select/Co-selection/Co-selectiveness 共选(机制)Co-text 共文DDL/Data Driven Learning 数据驱动学习Diachronic corpus 历时语料库Discourse 话语、语篇Discourse prosody 话语韵律Documentation 备检文件、文检报告EAGLES/Expert Advisory Groups on Language Engineering Standards EAGLES文本规格Empirical Linguistics 实证语言学Empiricism 经验主义Encoding 字符编码Error-tagging 错误标注、错误赋码Extended unit of meaning 扩展意义单位File-based search/concordancing 批量检索Formulaic sequence 程式化序列Frequency 频数、频率General (purpose) corpus 通用语料库Granularity 颗粒度Hapax legomenon/hapax 一次词Header/Text head 文本头、头标、头文件HMM/Hidden Markov Model 隐马尔科夫模型Idiom Principle 习语原则Index/Indexing (建)索引In-line annotation 文内标注、行内标注Key keyword 关键主题词Keyness 主题性、关键性Keyword 主题词KWIC/Key Word in Context 语境中的关键词、语境共现(方式)Learner corpus 学习者语料库Lemma 词目、原形词、词元Lemma list 词形还原对应表Lemmata 词目、原形词、词元(复数)Lemmatization 词形还原、词元化Lemmatizer 词形还原(词元化)工具Lexical bundle 词束Lexical density 词汇密度Lexical item 词项、词语项目Lexical priming 词汇触发理论Lexical richness 词汇丰富度Lexico-grammar/Lexical grammar 词汇语法Lexis 词语、词项LL/Log likelihood (ratio) 对数似然比、对数似然率Longitudinal/Developmental corpus 跟踪语料库、发展语料库、历时语料库Machine-readable 机读的Markup 标记、置标MDA/Multi-dimensional approach 多维度分析法Metadata 元信息Meta-metadata 元元信息MF/MD (Multi-feature/Multi-dimensional) approach 多特征/多维度分析法Mini-text 微型文本Misuse 误用Monitor corpus (动态)监察语料库Monolingual corpus 单语语料库Multilingual corpus 多语语料库Multimodal corpus 多模态语料库MWU/Multiword unit 多词单位MWE/Multiword expression 多词单位MI/Mutual information 互信息、互现信息N-gram N元组、N元序列、N元结构、N元词、多词序列NLP/Natural Language Processing 自然语言处理Node 节点(词)Normalization 标准化Normalized frequency 标准化频率、标称频率、归一频率Observed corpus 观察语料库Ontology 知识本体、本体Open Choice Principle 开放选择原则Overuse 超用、过多使用、使用过度、过度使用Paradigmatic 纵聚合(关系)的Parallel corpus 平行语料库、对应语料库Parole linguistics 言语语言学Parsed corpus 句法标注的语料库Parser 句法分析器Parsing 句法分析Pattern/patterning 型式Pattern grammar 型式语法Pedagogic corpus 教学语料库Phraseology 短语、短语学POSgram 赋码序列、码串POS tagging/Part-of-Speech tagging 词性赋码、词性标注、词性附码POS tagger 词性赋码器、词性赋码工具Prefab 预制语块Probabilistic (基于)概率的、概率性的、盖然的Probability 概率Rationalism 理性主义Raw text/Raw corpus 生文本(语料)Reference corpus 参照语料库Regex/RE/RegExp/Regular Expressions 正则表达式Register variation 语域变异Relative frequency 相对频率Representative/Representativeness 代表性(的)Rule-based 基于规则的Sample n./v. 样本;取样、采样、抽样Sampling 取样、采样、抽样Search term 检索项Search word 检索词Segmentation 切分、分词Semantic preference 语义倾向Semantic prosody 语义韵SGML/Standard Generalized Markup Language 标准通用标记语言Skipgram 跨词序列、跨词结构Span 跨距Special purpose corpus 专用语料库、专门用途语料库、专题语料库Specialized corpus 专用语料库Standardized TTR/Standardized type-token ratio 标准化类符/形符比、标准化类/形比、标准化型次比Stand-off annotation 分离式标注Stop list 停用词表、过滤词表Stop word 停用词、过滤词Synchronic corpus 共时语料库Syntagmatic 横组合(关系)的Tag 标记、码、标注码Tagger 赋码器、赋码工具、标注工具Tagging 赋码、标注、附码Tag sequence 赋码序列、码串Tagset 赋码集、码集Text 文本TEI/Text Encoding Initiative 文本编码计划The Lexical Approach 词汇中心教学法The Lexical Syllabus 词汇大纲Token 形符、词次Token definition 形符界定、单词界定Tokenization 分词Tokenizer 分词工具Transcription 转写Translational corpus 翻译语料库Treebank 树库Trigram 三元组、三元序列、三元结构T-score T值Type 类符、词型TTR/Type-token ratio 类符/形符比、类/形比、型次比Underuse 少用、使用不足Unicode 通用码Unit of meaning 意义单位WaC/Web as Corpus 网络语料库Wildcard 通配符Word definition 单词界定Word form 词形Word family 词族Word list 词表XML/EXtensible Markup Language 可扩展标记语言Zipf's Law 齐夫定律Z-score Z值。
语料库语言学基本概念
课题进度安排 谢谢
语料库应用基本流程语料库应用基本流程转写或文本采集转写或文本采集文本清洁文本清洁标注集确定标注集确定标注标注语语料料库库入库入库软件软件建库论证建库论证采样标准采样标准软件设计与开发软件设计与开发语料库应用语料库应用外语教学外语教学外语研究外语研究语料库建设相关的几个概念语料库建设相关的几个概念取样取样sampling代表性代表性representativeness标注标注annotation语料库分析相关的几个概念语料库分析相关的几个概念频率频率frequency索引工具concordancer形符token与类符与类符type主题词keywords搭配collocation及搭配强度类联接colligation语义韵semanticprosody索引工具形符主题词搭配及搭配强度类联接语义韵课题进度安排课题进度安排谢谢谢谢
语料库及其基本类型
按照语言类型来划分 按照语料样本所代表整体的不同来划分 按照语料库中语言种类的多少来划分 按照语言产出者身份的不同来划分 按照语料库中语言所产生的年代来划分 按照语言传播媒介来划分 ……
语料库应用基本流程
建库论证
采样标准
转写或文本采集
文本清洁
标注集确定
标注
语 入库
料
软件设计与开发
语料库语言学基本概念
梁茂成 中国外语教育研究中心
主要内容
语言研究的方法种种 语料库及其基本类型 语料库应用基本流程 语料库建设相关的几个重要概念 语料库分析相关的几个重要概念
语料库研究的方法种种
Intuition: introspective data, 1st person “What do I think I say?”
方法一:依靠内省数据 方法二:依靠诱发方法 方法三:依靠真实数据
语料库的分类及其依据
语料库的分类及其依据语料库(corpus)是指用于语言学研究的大规模文本集合。
在自然语言处理(NLP)和机器学习领域,语料库起着重要的作用。
语料库的分类及其依据多种多样,下面将介绍一些常见的分类及其依据。
1. 根据语料库的来源分类语料库可以根据其来源进行分类。
常见的来源包括书面语料库、口语语料库、网络语料库等。
书面语料库是指搜集和整理的书面文本,如报纸、杂志、书籍等。
口语语料库则是指口头语言的记录,如录音、对话等。
网络语料库则是指从互联网上搜集和整理的文本,如网页、论坛帖子等。
根据来源的不同,语料库的特点和应用也会有所差异。
2. 根据语料库的用途分类语料库可以根据其用途进行分类。
常见的用途包括语言学研究、机器翻译、情感分析等。
语言学研究是指利用语料库来探索语言的结构、规律和演化等。
机器翻译是指利用语料库来训练机器翻译模型,实现自动翻译的任务。
情感分析则是指利用语料库来分析文本中的情感倾向,如判断一篇文章是正面还是负面情感。
3. 根据语料库的语言分类语料库可以根据所涉及的语言进行分类。
常见的语言包括英语、中文、法语等。
根据不同的语言,语料库的建立和应用也会有所差异。
例如,对于英语语料库,可以用于英语教学、英语学习者语言分析等方面。
4. 根据语料库的领域分类语料库可以根据所涉及的领域进行分类。
常见的领域包括新闻、医学、法律等。
根据不同的领域,语料库中的文本内容也会有所差异。
例如,医学语料库中的文本主要涉及医学知识和术语,可以用于医学研究和医学文本自动化处理等方面。
5. 根据语料库的规模分类语料库可以根据其规模进行分类。
常见的规模包括小型语料库、中型语料库、大型语料库等。
根据语料库的规模不同,可以应用于不同的研究需求和任务。
大型语料库通常包含数百万或数十亿个文本,可以用于训练深度学习模型和进行大规模文本分析。
总结起来,语料库的分类及其依据包括来源、用途、语言、领域和规模等方面。
不同的分类方式适用于不同的应用场景和研究需求。
国家语委现代汉语通用平衡语料库
国家语委现代汉语通⽤平衡语料库国家语委现代汉语通⽤平衡语料库标注语料库数据及使⽤说明1. 国家语委现代汉语通⽤平衡语料库1.1 语料库全库国家语委现代汉语通⽤平衡语料库全库约为1亿字符,其中1997年以前的语料约7000万字符,均为⼿⼯录⼊印刷版语料;1997之后的语料约为3000万字符,⼿⼯录⼊和取⾃电⼦⽂本各半。
语料库的通⽤性和平衡性通过语料样本的⼴泛分布和⽐例控制实现。
语料库类别分布如下所⽰:1.2 标注语料库标注语料库为国家语委现代汉语通⽤平衡语料库全库的⼦集,约5000万字符。
标注是指分词和词类标注,已经经过3次⼈⼯校对,准确率⼤于>98%。
语料库全库按照预先设计的选材原则进⾏平衡抽样,以期达到更好的代表性。
标注语料库在样本分布⽅⾯近似于全库,不破坏语料选材的平衡原则。
标注语料库类别分布如下所⽰:标注语料库与全库的样本分布⽐较如下所⽰:(蓝⾊曲线为语料库全库;红⾊曲线为标注语料库)2. 国家语委现代汉语通⽤平衡语料库语料选材与样本分布2.1 选材原则依据材料内容,选材⼤体作如下分类:(下⽂字数为建库时数据)2.1.1 教材⼤中⼩学教材单作⼀类,约2000万字。
2.1.2 ⼈⽂与社会科学的语⾔材料约占全库的60%,共3000万字,包括:·政法(含哲学、政治、宗教、法律等);·历史(含民族等)·社会(含社会学、⼼理、语⾔、教育、⽂艺理论、新闻学、民俗学等);·经济;·艺术(含⾳乐、美术、舞蹈、戏剧等);·⽂学(含⼝语);·军体;·⽣活(含⾐⾷住⾏等⽅⾯的普及读物)。
2.1.3 ⾃然科学(含农业、医学、⼯程与技术)的语⾔材料,应涉及其发展的各个领域。
拟从⼤、中、⼩学教材和科普读物中选取。
其中,科普读物约占6%,共300万字。
教材字数另计。
2.1.4 报刊。
以1949年以后正式出版的由国家、省、市及各个部委主办的报纸和综合性刊物为主,兼顾1949年以前的报纸和综合性刊物。
语料库课程(一)笔记129页PPT
26、要使整个人生都过得舒适、愉快,这是不可能的,因为人类必须具备一种能应付逆境的态度。上进的力量,才是成功的保证。——罗曼·罗兰
▪
28、知之者不如好之者,好之者不如乐之者。——孔子
▪
29、勇猛、大胆和坚定的决心能够抵得上武器的精良。——达·芬奇
▪
30、意志是一个强壮的盲人,倚靠在明眼的跛子肩上。——叔本华
语料库课程(一)笔记
21、静念园林好,人间良可辞。 22、步步寻往迹,有处特依依。 23、望云惭高鸟,临木愧游鱼。 24、结庐在人境,而无车马喧;问君 何能尔 ?心远 地自偏 。 25、人生归有道,衣食固其端。
▪
谢谢!
129
