语料库术语表

Absolute frequency 绝对频数

Alignment (of parallel texts) (平行或对应)语料的对齐

Alphanumeric 字母数字类的

Annotate 标注(动词)

Annotation 标注(名词)

Annotation scheme 标注方案

ANSI/American National Standards

Institute 美国国家标准学会

ASCII/American Standard Code for

Information Exchange 美国信息交换标准码

Associate (of keywords) (主题词的)联想词

AWL/Academic word list 学术词表

Balanced corpus 平衡语料库

Base list 底表、基础词表

Bigram 二元组、二元序列、二元结构

Bi-hapax 两次词

Bilingual corpus 双语语料库

CA/Contrastive Analysis 对比分析

Case-sensitive 大小写敏感、区分大小写

Chi-square (χ2) test 卡方检验

Chunk 词块

CIA/Contrastive Interlanguage Analysis 中介语对比分析

CLAWS/Constituent Likelihood Automatic

Word-tagging System CLAWS词性赋码系统

Clean text policy 干净文本原则

Cluster 词簇、词丛 Colligation 类联接、类连接、类联结

Collocate n./v. 搭配词;搭配

Collocability 搭配强度、搭配力

Collocation 搭配、词语搭配

Collocational strength 搭配强度

Collocational framework/frame 搭配框架

Comparable corpora 类比语料库、可比语料库

ConcGram 同现词列、框合结构

Concordance (line) 索引(行)

Concordance plot (索引)词图

Concordancer 索引工具

Concordancing 索引生成、索引分析

Context 语境、上下文

Context word 语境词

Contingency table 连列表、联列表、列连表、列联表

Co-occurrence/Co-occurring 共现

Corpora 语料库(复数)

Corpus Linguistics 语料库语言学

Corpus 语料库

Corpus-based 基于语料库的

Corpus-driven 语料库驱动的

Corpus-informed 语料库指导的、参考了语料库的

Co-select/Co-selection/Co-selectiveness 共选(机制)

Co-text 共文

DDL/Data Driven Learning 数据驱动学习

Diachronic corpus 历时语料库 Discourse 话语、语篇

Discourse prosody 话语韵律

Documentation 备检文件、文检报告

EAGLES/Expert Advisory Groups on Language

Engineering Standards EAGLES文本规格

Empirical Linguistics 实证语言学

Empiricism 经验主义

Encoding 字符编码

Error-tagging 错误标注、错误赋码

Extended unit of meaning 扩展意义单位

File-based search/concordancing 批量检索

Formulaic sequence 程式化序列

Frequency 频数、频率

General (purpose) corpus 通用语料库

Granularity 颗粒度

Hapax legomenon/hapax 一次词

Header/Text head 文本头、头标、头文件

HMM/Hidden Markov Model 隐马尔科夫模型

Idiom Principle 习语原则

Index/Indexing (建)索引

In-line annotation 文内标注、行内标注

Key keyword 关键主题词

Keyness 主题性、关键性

Keyword 主题词

KWIC/Key Word in Context 语境中的关键词、语境共现(方式)

Learner corpus 学习者语料库 Lemma 词目、原形词、词元

Lemma list 词形还原对应表

Lemmata 词目、原形词、词元(复数)

Lemmatization 词形还原、词元化

Lemmatizer 词形还原(词元化)工具

Lexical bundle 词束

Lexical density 词汇密度

Lexical item 词项、词语项目

Lexical priming 词汇触发理论

Lexical richness 词汇丰富度

Lexico-grammar/Lexical grammar 词汇语法

Lexis 词语、词项

LL/Log likelihood (ratio) 对数似然比、对数似然率

Longitudinal/Developmental corpus 跟踪语料库、发展语料库、历时语料库

Machine-readable 机读的

Markup 标记、置标

MDA/Multi-dimensional approach 多维度分析法

Metadata 元信息

Meta-metadata 元元信息

MF/MD (Multi-feature/Multi-dimensional)

approach 多特征/多维度分析法

Mini-text 微型文本

Misuse 误用

Monitor corpus (动态)监察语料库

Monolingual corpus 单语语料库

Multilingual corpus 多语语料库 Multimodal corpus 多模态语料库

MWU/Multiword unit 多词单位

MWE/Multiword expression 多词单位

MI/Mutual information 互信息、互现信息

N-gram N元组、N元序列、N元结构、N元词、多词序列

NLP/Natural Language Processing 自然语言处理

Node 节点(词)

Normalization 标准化

Normalized frequency 标准化频率、标称频率、归一频率

Observed corpus 观察语料库

Ontology 知识本体、本体

Open Choice Principle 开放选择原则

Overuse 超用、过多使用、使用过度、过度使用

Paradigmatic 纵聚合(关系)的

Parallel corpus 平行语料库、对应语料库

Parole linguistics 言语语言学

Parsed corpus 句法标注的语料库

Parser 句法分析器

Parsing 句法分析

Pattern/patterning 型式

Pattern grammar 型式语法

Pedagogic corpus 教学语料库

Phraseology 短语、短语学

POSgram 赋码序列、码串

POS tagging/Part-of-Speech tagging 词性赋码、词性标注、词性附码 POS tagger 词性赋码器、词性赋码工具

Prefab 预制语块

Probabilistic (基于)概率的、概率性的、盖然的

Probability 概率

Rationalism 理性主义

Raw text/Raw corpus 生文本(语料)

Reference corpus 参照语料库

Regex/RE/RegExp/Regular Expressions 正则表达式

Register variation 语域变异

Relative frequency 相对频率

Representative/Representativeness 代表性(的)

Rule-based 基于规则的

Sample n./v. 样本;取样、采样、抽样

Sampling 取样、采样、抽样

Search term 检索项

Search word 检索词

Segmentation 切分、分词

Semantic preference 语义倾向

Semantic prosody 语义韵

SGML/Standard Generalized Markup

Language 标准通用标记语言

Skipgram 跨词序列、跨词结构

Span 跨距

Special purpose corpus 专用语料库、专门用途语料库、专题语料库

Specialized corpus 专用语料库

Standardized TTR/Standardized type-token 标准化类符/形符比、标准化类/形比、标准

合集下载

自然语言处理及计算语言学相关术语中英对译表

自然语言处理及计算语言学相关术语中英对译表

自然语言处理及计算语言学相关术语中英对译表

abbreviation 缩写 [省略语]

ablative 夺格(的)

abrupt 突发音

accent 口音/{Phonetics}重音

accusative 受格(的)

acoustic phonetics 声学语音学

acquisition 习得

action verb 动作动词

active 主动语态

active chart parser 活动图句法剖析程序

active knowledge 主动知识

active verb 主动动词

actor-action-goal 施事(者)-动作-目标

actualization 实现(化)

acute 锐音

address 地址{信息科学}/称呼(语){语言学}

adequacy 妥善性

adjacency pair 邻对

adjective 形容词

adjunct 附加语 [附加修饰语]

adjunction 加接

adverb 副词

adverbial idiom 副词词组

affective 影响的

affirmative 肯定(的;式)

affix 词缀

affixation 加缀

affricate 塞擦音

agent 施事

agentive-action verb 施事动作动词

agglutinative 胶着(性)

agreement 对谐

AI (artificial intelligence) 人工智能 [人工智能]

AI language 人工智能语言 [人工智能语言]

Algebraic Linguistics 代数语言学

algorithm 算法 [算法]

alienable 可分割的

alignment 对照 [多国语言文章词;词组;句子翻译的]

allo- 同位-

allomorph 同位语素

allophone 同位音位

alpha notation alpha 标记 alphabetic writing 拼音文字

基于COCA语料库的石油科技术语近义词辨析——以debugging和commissioning为例

基于COCA语料库的石油科技术语近义词辨析——以debugging和commissioning为例

现代商贸工业ModernBusinessTradeIndustry2024年第7期

作者简介:李聪颖(1997-),女,汉族,陕西西安人,硕士,研究方向:石油科技翻译。 总之,安康市机构名称英译前后社会经济效果评

价,是在推进地方经济发展和文化交流中不可或缺的一

项工作。有了评价结果的反馈,才能更好地指导英译工

作的方向和进一步提升其社会经济效益。

3 结语

安康市位于川、陕、鄂三省交汇处,其区位优势得天

独厚。随着交通网络的完备,包括水、陆、空三大交通系

统,加上安康市的区位优势和自身资源优势,使其在国

际交流和合作中具有很大的优势和发展潜力。在此背

景下,各类机构名称的英译质量尤为重要,不仅关乎安

康市在国际间的形象,还关系到其开展国际合作的质量

和效果。

在本文的基础上,大家可以看到安康市机构名称的

英译前后的差异,如在易读性、理解度、社会认知度等方

面均得到了很好的提升。这些改进不仅使得国际交流

合作更为顺畅,还能够为安康市在国际舞台上赢得更多的资源,进而实现更好的经济和社会发展。

总之,安康市作为一个重要的区域性中心城市,其

与国际社会的交流和合作将会日益密切。因此,加强机

构名称的英译工作具有十分重要的现实意义。笔者在

此呼吁各职能部门和各机构立足本职工作,切实加强机

构名称的英译工作,为安康市在国际间的交流合作和经

济发展做出更大的贡献。同时,本文所提出的方法和思

路也可以为其他地方提供一些借鉴和参考。

参考文献

[1]吕叔湘.现代海域词典[M].北京:商务印书馆,2012.

[2]郭青,赵俊民,陈明,等.安康改革开放四十年[M].中共

安康市委党史研究室,2018:587-590.[3]Newmark,P.ATextbookofTranslation[M].ShanghaiLan-guageEducationPress,1988.

[4]ASHornby.牛津高阶英汉双解词典[M].北京:商务印书

馆,2014.London:OxfordUniversityPress,2004.基于COCA语料库的石油科技术语近义词辨析

语料库语言学:用作理论框架与用作研究方法的讨论

语料库语言学:用作理论框架与用作研究方法的讨论

语料库语言学:用作理论框架与用作研究方法的讨论

摘要:近些年,语料库语言学的相关研究突飞猛进。在过去六十多年的发展中,学界内语料库语言学主要有两种操作:一是将语料库语言学当作理论框架来指引研究;二是将语料库语言学应用于语言研究、语言教学、语言习得,是学术研究方法的一种。本文梳理学者们对语料库语言学的看法,探讨支撑语料库语言学研究的理论和方法框架,论证并提出假设。

关键字: 语料库语言学 方法 理论

1.引言

近二十年来,语料库语言学(Corpus Linguistics)飞速发展,结出累累硕果。但是,“语料库语言学作为一个系统的研究领域只有近六十年的历史。作为一个相对新兴的领域,语料库语言学的发展不可避免地伴随着争议(肖 & 郁,

2012) ”。在过去六十多年的发展中,学界内语料库语言学主要有两种操作:一是将语料库语言学当作理论框架来指引研究;二是将语料库语言学应用于语言研究、语言教学、语言习得,是学术研究方法的一种。本文梳理学者们对语料库语言学的看法,探讨支撑语料库语言学研究的理论和方法框架。

由于本文讨论的范畴和语料库语言学的本质,将不对方法/方法论做细致区分。详见第三部分3.1。

2.语料库语言学

语言学是以人类语言为研究对象的学科,探索范围包括语言的性质、功能、结构、运用和历史发展,以及其他与语言有关的问题(胡壮麟, 2021)。本质上来说,语言学家的共同目标是发现并探讨人类语言的模式。广义上的语言学包含语言基础结构,语言使用,语言分类,语言在各个社会群体中的差异,其在不同历史时期中的变化,语言如何被人的大脑处理,如何被人类习得等等(Egbert &

Baker, 2019)。

语言学和其它的科学领域一样,依据实验数据来检验假设、探究模式。语言学中的研究数据多种多样。例如,心理语言学研究中使用的反应时间、眼动追踪数据、以及神经影像; 社会语言学研究中使用的访谈、问卷以及调查;批判话语研究中使用的文本数据以及产生和接收这些文本数据的语境。“尽管语言学领域的研究资源多种多样,但有一种研究资源几乎可以应用到所有语言学的分支中:这就是语料库” (Egbert & Baker, 2019:3-4)。

NLP(一)语料库和WordNet

NLP(一)语料库和WordNet

NLP(⼀)语料库和WordNet

访问语料库

NLTK数据库的安装:

NLTK语料库列表:

内部访问(以Reuters corpus为例):

import nltk

from nltk.corpus import reuters

# 下载路透社语料库

nltk.download('reuters')

# 查看语料库的内容

files = reuters.fileids()

print(files)

# 访问其中⼀个⽂件的内容

words14826 = reuters.words(['test/14826'])

print(words14826[:20])

# 输出主题(⼀共90个)

reutersGenres = reuters.categories()

print(reutersGenres)

# 访问⼀个主题,⼀句话⼀⾏输出

for w in reuters.words(categories=['tea']):

print(w + ' ',end='')

if w is '.': print()

下载外部语料库并访问(以影评数据集为例)

下载数据集:

本例下载了1000积极和1000消极的影评

from nltk.corpus import CategorizedPlaintextCorpusReader

# 读取语料库

reader = CategorizedPlaintextCorpusReader(r'D:\PyCharm 5.0.3\WorkSpace\2.NLP\语料库\1.movie_review_data_1000\txt_sentoken',r'.*\.txt',cat_pattern=r'(\w+)/*')

print(reader.categories())

print(reader.fileids())

# 语料库分成两类

posFiles = reader.fileids(categories='pos')

negFiles = reader.fileids(categories='neg')

词典学专业术语

词典学专业术语

词典学术语

abbreviation缩略语

abbreviativenotation缩略标记

abridged删节的,未足本的

abridgeddictionary节本词典

abridgement删节,节本

absoluteequivalent绝对对应词

absolutesynonym绝对同义词

abusage滥用

abusivelanguage辱骂语

academicdictionary学术词典

academiclexicography学术词典学

academydictionary学院词典

accentmark重音号

acceptability接受性

acceptabilityrating接受等级

accessalphabet检索字母表

accesspoint检索项

accessstructure检索结构

acknowledges致谢项

acrolect上层方言

acronym首字母缩略词

activedictionary积极词典,主动性词典

activevocabulary积极词汇

adjectivalnoun形容词性名词

adjectivecomplement形容词性补语

adjectivecompound复合形容词

adjunct附加性副词

adnominal名词修饰语

advancedsearches高级搜索

affix词缀

affixation词缀法,词缀词

agglutinativelanguage黏着型语言

alienword外来词

allomorph语素变体

allophone音位变体

allusion典故

alphabeticarrangement字母顺序排列

alphabeticorder字母顺序

alphabeticsequence字母顺序

alphabeticwriting字母文字,拼音文字

alphabetization按字母顺序排列

alphanumericcombination字母数字组合词

alphapedia字顺百科

alternativelexicography另类词典学

memoq 语料库提取术语

memoq 语料库提取术语

memoq 语料库提取术语

使用memoQ进行语料库术语提取可以遵循以下步骤:

1. 创建项目并选择语言:在memoQ中创建一个新的项目,并选择与所提取的术语对应的目标语言。

2. 导入双语文件:项目创建完成后,需要导入一个双语文件,如TMX格式。这个文件通常包含平行语料,有助于提取术语。

3. 提取术语:在memoQ中,打开双语文件,找到“Preparation-Extract

Terms”路径。这里,memoQ提供了基于词长和词频的术语提取方法。

4. 筛选和增加术语:在提取出的术语基础上,译者可以对这些术语进行筛选和增加,确保术语的质量和准确性。

5. 创建术语库:在memoQ中创建一个术语库,用于存储和管理提取出的术语。在“资源”选项卡中,选择“术语库”,然后点击“新建”来创建一个新的术语库。给术语库取一个有意义的名称,并且可以根据需要添加不同语言的术语。

6. 导入术语:一旦创建了术语库,接下来需要将提取出的术语导入到该库中。可以从Excel表格或者CSV文件中导入术语,也可以手动添加术语。在“术语库”窗口中,选择“导入”选项,然后按照提示将术语导入到术语库中。

需要注意的是,memoQ的术语提取方法并没有明确的参考依据,且十分依赖双语文本。此外,提取出的术语不会自动识别目标语言,因此在后续工作中还需要手动添加目标语言。

以上步骤仅供参考,建议查阅memoQ使用说明或咨询专业人士获取更多信息。

基于术语语料库的术语词性序列研究

・语料库研究・ 2011年第1期 

基于术语语料库的术语词性序列研究 

张榕 

(北京语言大学汉语速成学院,北京100083) 

摘要:文章基于术语数据库,分别考察了包含命名实体、数词、标点符号的术语以及字母词术语,采用统计 的方法获取有效的术语内部词性序列以及高频术语内部词性序列,该研究有助于术语的语言学研究,以及 

术语识别与抽取等应用领域的研究。 关键词:术语;词性标注;词性序列 

Research on Sequence of POS in Terms 

ZHANG Rong 

(College of Intersive Chinese Training,Beijing Language and Culture University,Beijing 100083,China) 

Abstracts:The paper is based on the term database,studies the terms which include name entity,numeral, 

punctuation marks and letter.The paper gets the list of valid POS sequence from the database and the most 

frequently used POS sequence by statistics methods.It is helpful for the linguistics study of terms and for the 

term recognition and extraction. 

Keywords:term,POS tagging,sequence of POS 

1引言 

随着社会的发展与科技的进步,新概念、新事 

物不断涌现。这些新概念与新事物产生后,必定要 用一个术语来指称,因此日益增多的术语融人到语 言词汇的集合之中。统计表明,术语在语言词汇中 所占的比例逐年增长。从术语的语言学特征来看, 术语作为领域专用词汇是由词或词组构成的语言 

词典学术语(修订版)

词典学术语

abbreviation 缩略语

abbreviative notation 缩略标记

abridged 删节的,未足本的

abridged dictionary节本词典

abridgement 删节,节本

absolute equivalent 绝对对应词

absolute synonym 绝对同义词

abusage 滥用

abusive language 辱骂语

academic dictionary 学术词典

academic lexicography 学术词典学

academy dictionary 学院词典

accent mark 重音号

acceptability 接受性

acceptability rating 接受等级

access alphabet 检索字母表

access point 检索项

access structure 检索结构

acknowledges 致谢项

acrolect 上层方言

acronym 首字母缩略词

active dictionary 积极词典,主动性词典

active vocabulary 积极词汇

adjectival noun 形容词性名词

adjective complement 形容词性补语

adjective compound 复合形容词

adjunct 附加性副词

adnominal 名词修饰语

advanced searches 高级搜索

affix 词缀

affixation 词缀法,词缀词

agglutinative language 黏着型语言

alien word 外来词

allomorph 语素变体

allophone 音位变体

allusion 典故

alphabetic arrangement 字母顺序排列

alphabetic order 字母顺序

CAT详细介绍3

第三单元:语料库和语料库分析工具

3.1 电子语料库

3.1.1不同类型的电子语料库

3.2语料库分析工具

3.2.1.词频列表

3.2.1.1按词汇屈折变化进行分类的词条表

3.2.1.2 停用词表

3.2.2 检索工具

3.3.2.1单语言检索工具

3.2.2.2双语检索工具

3.2.3词语搭配

3.3注释与标注

3.4 使用语料库分析工具的利弊

3.4.1频率数据

3.4.2语境

3.4.3实用性和版权

3.4.4预处理

3.4.5速率与信息检索问题

3.4.6字符集和语言相关的问题

3.4.7经济因素

把一个单词放到一个语境中,意味着给它生命。如果你想知道那些词的行为,那么你必须要在它们的自然环境中学习它们,这里的自然环境就是语境。

最广义的说,语料库是文本或话语的集合,它们是执行语言学调查的基础。翻译学科史上用印刷版的语料库进行搜索研究的历史悠久。译者通常搜查专业术语的时候会编写和分析语料库。此外,当翻译一个文件的时候,译者典型的会收集和查询平行文本(与源语文本具有同样交际作功能,但在目的语中已被别人写过的文本)以作参考文体,格式,专业术语,措辞。-translated by 沙依巴

除了它们包含的有价值的信息,印刷版的语料库有很多缺点。首先,需要花体力和很长时间在图书馆收集资料或复印。收集好之后还组要好长时间去查询文本,这意味着在突然发现正在寻求的词语或与重点相关的内容之前需要阅读很多无关的资料。再次,只找到一两个平行文本远远不够。因为译者未必是该领域的专家,他们需要查阅大量的文本,以保证他们所选择的文体和术语能被该领域的专家接受,而不是一个作者的特质用语。此外,当它们在不同的页面,不同的文件里出现的时候,确定他们的语言学模式和文体学共性很难。因此,印刷版的语料库有两大缺点。第一,译者拿着印刷版的语料库做翻译的时候,不能收集和查阅大量的文件以保证所所有相关的概念,术语和预言模式都能找到。第二,人工分析本来就容易出错:没有依靠辅助的人类大脑显然不能发现所有重要的模式,更不用说以更有意义的方式组织语言。收集和查阅语料库花的时间越多,真正留给翻译的时间就越少。为了在截止日期之前完成任务,译者很难能平衡收集、查阅资料花的时间和做翻译画的时间。

sci英语语料库

sci英语语料库

SCI英语语料库是用于学术研究的英语文本集合,它包含了大量科学论文和文献,有助于研究人员分析和研究专业英语的使用情况。

SCI(Science Citation Index)英语语料库通常指的是那些收录了大量科学引文索引的英语语料库,这些语料库主要用于分析和研究科学技术领域的英语使用情况。以下是一些可用于研究的英语语料库:

Corpus of Contemporary American English (COCA):这是一个大型且“平衡”的美国英语语料库,可能是目前使用最广泛的英语语料库之一。

British National Corpus (BNC):这是英国国家语料库,包含了广泛的英国英语文本。

Webcorp:这是一个专业的语料库,提供了大量在线文本数据。

DEAP Corpus:这个语料库旨在收集在高影响力国际期刊上发表的英语研究文章,覆盖了20多个学科。

这些语料库对于语言学家、研究人员以及学习者来说是宝贵的资源,它们可以用来研究语言模式、词汇使用、语法结构等。此外,语料库还可以帮助翻译人员和写作者提高他们的英语水平,了解专业领域中的术语和表达方式。

  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档