语料库术语表
Absolute frequency 绝对频数
Alignment (of parallel texts) (平行或对应)语料的对齐
Alphanumeric 字母数字类的
Annotate 标注(动词)
Annotation 标注(名词)
Annotation scheme 标注方案
ANSI/American National Standards
Institute 美国国家标准学会
ASCII/American Standard Code for
Information Exchange 美国信息交换标准码
Associate (of keywords) (主题词的)联想词
AWL/Academic word list 学术词表
Balanced corpus 平衡语料库
Base list 底表、基础词表
Bigram 二元组、二元序列、二元结构
Bi-hapax 两次词
Bilingual corpus 双语语料库
CA/Contrastive Analysis 对比分析
Case-sensitive 大小写敏感、区分大小写
Chi-square (χ2) test 卡方检验
Chunk 词块
CIA/Contrastive Interlanguage Analysis 中介语对比分析
CLAWS/Constituent Likelihood Automatic
Word-tagging System CLAWS词性赋码系统
Clean text policy 干净文本原则
Cluster 词簇、词丛 Colligation 类联接、类连接、类联结
Collocate n./v. 搭配词;搭配
Collocability 搭配强度、搭配力
Collocation 搭配、词语搭配
Collocational strength 搭配强度
Collocational framework/frame 搭配框架
Comparable corpora 类比语料库、可比语料库
ConcGram 同现词列、框合结构
Concordance (line) 索引(行)
Concordance plot (索引)词图
Concordancer 索引工具
Concordancing 索引生成、索引分析
Context 语境、上下文
Context word 语境词
Contingency table 连列表、联列表、列连表、列联表
Co-occurrence/Co-occurring 共现
Corpora 语料库(复数)
Corpus Linguistics 语料库语言学
Corpus 语料库
Corpus-based 基于语料库的
Corpus-driven 语料库驱动的
Corpus-informed 语料库指导的、参考了语料库的
Co-select/Co-selection/Co-selectiveness 共选(机制)
Co-text 共文
DDL/Data Driven Learning 数据驱动学习
Diachronic corpus 历时语料库 Discourse 话语、语篇
Discourse prosody 话语韵律
Documentation 备检文件、文检报告
EAGLES/Expert Advisory Groups on Language
Engineering Standards EAGLES文本规格
Empirical Linguistics 实证语言学
Empiricism 经验主义
Encoding 字符编码
Error-tagging 错误标注、错误赋码
Extended unit of meaning 扩展意义单位
File-based search/concordancing 批量检索
Formulaic sequence 程式化序列
Frequency 频数、频率
General (purpose) corpus 通用语料库
Granularity 颗粒度
Hapax legomenon/hapax 一次词
Header/Text head 文本头、头标、头文件
HMM/Hidden Markov Model 隐马尔科夫模型
Idiom Principle 习语原则
Index/Indexing (建)索引
In-line annotation 文内标注、行内标注
Key keyword 关键主题词
Keyness 主题性、关键性
Keyword 主题词
KWIC/Key Word in Context 语境中的关键词、语境共现(方式)
Learner corpus 学习者语料库 Lemma 词目、原形词、词元
Lemma list 词形还原对应表
Lemmata 词目、原形词、词元(复数)
Lemmatization 词形还原、词元化
Lemmatizer 词形还原(词元化)工具
Lexical bundle 词束
Lexical density 词汇密度
Lexical item 词项、词语项目
Lexical priming 词汇触发理论
Lexical richness 词汇丰富度
Lexico-grammar/Lexical grammar 词汇语法
Lexis 词语、词项
LL/Log likelihood (ratio) 对数似然比、对数似然率
Longitudinal/Developmental corpus 跟踪语料库、发展语料库、历时语料库
Machine-readable 机读的
Markup 标记、置标
MDA/Multi-dimensional approach 多维度分析法
Metadata 元信息
Meta-metadata 元元信息
MF/MD (Multi-feature/Multi-dimensional)
approach 多特征/多维度分析法
Mini-text 微型文本
Misuse 误用
Monitor corpus (动态)监察语料库
Monolingual corpus 单语语料库
Multilingual corpus 多语语料库 Multimodal corpus 多模态语料库
MWU/Multiword unit 多词单位
MWE/Multiword expression 多词单位
MI/Mutual information 互信息、互现信息
N-gram N元组、N元序列、N元结构、N元词、多词序列
NLP/Natural Language Processing 自然语言处理
Node 节点(词)
Normalization 标准化
Normalized frequency 标准化频率、标称频率、归一频率
Observed corpus 观察语料库
Ontology 知识本体、本体
Open Choice Principle 开放选择原则
Overuse 超用、过多使用、使用过度、过度使用
Paradigmatic 纵聚合(关系)的
Parallel corpus 平行语料库、对应语料库
Parole linguistics 言语语言学
Parsed corpus 句法标注的语料库
Parser 句法分析器
Parsing 句法分析
Pattern/patterning 型式
Pattern grammar 型式语法
Pedagogic corpus 教学语料库
Phraseology 短语、短语学
POSgram 赋码序列、码串
POS tagging/Part-of-Speech tagging 词性赋码、词性标注、词性附码 POS tagger 词性赋码器、词性赋码工具
Prefab 预制语块
Probabilistic (基于)概率的、概率性的、盖然的
Probability 概率
Rationalism 理性主义
Raw text/Raw corpus 生文本(语料)
Reference corpus 参照语料库
Regex/RE/RegExp/Regular Expressions 正则表达式
Register variation 语域变异
Relative frequency 相对频率
Representative/Representativeness 代表性(的)
Rule-based 基于规则的
Sample n./v. 样本;取样、采样、抽样
Sampling 取样、采样、抽样
Search term 检索项
Search word 检索词
Segmentation 切分、分词
Semantic preference 语义倾向
Semantic prosody 语义韵
SGML/Standard Generalized Markup
Language 标准通用标记语言
Skipgram 跨词序列、跨词结构
Span 跨距
Special purpose corpus 专用语料库、专门用途语料库、专题语料库
Specialized corpus 专用语料库
Standardized TTR/Standardized type-token 标准化类符/形符比、标准化类/形比、标准
自然语言处理及计算语言学相关术语中英对译表
自然语言处理及计算语言学相关术语中英对译表
abbreviation 缩写 [省略语]
ablative 夺格(的)
abrupt 突发音
accent 口音/{Phonetics}重音
accusative 受格(的)
acoustic phonetics 声学语音学
acquisition 习得
action verb 动作动词
active 主动语态
active chart parser 活动图句法剖析程序
active knowledge 主动知识
active verb 主动动词
actor-action-goal 施事(者)-动作-目标
actualization 实现(化)
acute 锐音
address 地址{信息科学}/称呼(语){语言学}
adequacy 妥善性
adjacency pair 邻对
adjective 形容词
adjunct 附加语 [附加修饰语]
adjunction 加接
adverb 副词
adverbial idiom 副词词组
affective 影响的
affirmative 肯定(的;式)
affix 词缀
affixation 加缀
affricate 塞擦音
agent 施事
agentive-action verb 施事动作动词
agglutinative 胶着(性)
agreement 对谐
AI (artificial intelligence) 人工智能 [人工智能]
AI language 人工智能语言 [人工智能语言]
Algebraic Linguistics 代数语言学
algorithm 算法 [算法]
alienable 可分割的
alignment 对照 [多国语言文章词;词组;句子翻译的]
allo- 同位-
allomorph 同位语素
allophone 同位音位
alpha notation alpha 标记 alphabetic writing 拼音文字
基于COCA语料库的石油科技术语近义词辨析——以debugging和commissioning为例
现代商贸工业ModernBusinessTradeIndustry2024年第7期
作者简介:李聪颖(1997-),女,汉族,陕西西安人,硕士,研究方向:石油科技翻译。 总之,安康市机构名称英译前后社会经济效果评
价,是在推进地方经济发展和文化交流中不可或缺的一
项工作。有了评价结果的反馈,才能更好地指导英译工
作的方向和进一步提升其社会经济效益。
3 结语
安康市位于川、陕、鄂三省交汇处,其区位优势得天
独厚。随着交通网络的完备,包括水、陆、空三大交通系
统,加上安康市的区位优势和自身资源优势,使其在国
际交流和合作中具有很大的优势和发展潜力。在此背
景下,各类机构名称的英译质量尤为重要,不仅关乎安
康市在国际间的形象,还关系到其开展国际合作的质量
和效果。
在本文的基础上,大家可以看到安康市机构名称的
英译前后的差异,如在易读性、理解度、社会认知度等方
面均得到了很好的提升。这些改进不仅使得国际交流
合作更为顺畅,还能够为安康市在国际舞台上赢得更多的资源,进而实现更好的经济和社会发展。
总之,安康市作为一个重要的区域性中心城市,其
与国际社会的交流和合作将会日益密切。因此,加强机
构名称的英译工作具有十分重要的现实意义。笔者在
此呼吁各职能部门和各机构立足本职工作,切实加强机
构名称的英译工作,为安康市在国际间的交流合作和经
济发展做出更大的贡献。同时,本文所提出的方法和思
路也可以为其他地方提供一些借鉴和参考。
参考文献
[1]吕叔湘.现代海域词典[M].北京:商务印书馆,2012.
[2]郭青,赵俊民,陈明,等.安康改革开放四十年[M].中共
安康市委党史研究室,2018:587-590.[3]Newmark,P.ATextbookofTranslation[M].ShanghaiLan-guageEducationPress,1988.
[4]ASHornby.牛津高阶英汉双解词典[M].北京:商务印书
馆,2014.London:OxfordUniversityPress,2004.基于COCA语料库的石油科技术语近义词辨析
语料库语言学:用作理论框架与用作研究方法的讨论
语料库语言学:用作理论框架与用作研究方法的讨论
摘要:近些年,语料库语言学的相关研究突飞猛进。在过去六十多年的发展中,学界内语料库语言学主要有两种操作:一是将语料库语言学当作理论框架来指引研究;二是将语料库语言学应用于语言研究、语言教学、语言习得,是学术研究方法的一种。本文梳理学者们对语料库语言学的看法,探讨支撑语料库语言学研究的理论和方法框架,论证并提出假设。
关键字: 语料库语言学 方法 理论
1.引言
近二十年来,语料库语言学(Corpus Linguistics)飞速发展,结出累累硕果。但是,“语料库语言学作为一个系统的研究领域只有近六十年的历史。作为一个相对新兴的领域,语料库语言学的发展不可避免地伴随着争议(肖 & 郁,
2012) ”。在过去六十多年的发展中,学界内语料库语言学主要有两种操作:一是将语料库语言学当作理论框架来指引研究;二是将语料库语言学应用于语言研究、语言教学、语言习得,是学术研究方法的一种。本文梳理学者们对语料库语言学的看法,探讨支撑语料库语言学研究的理论和方法框架。
由于本文讨论的范畴和语料库语言学的本质,将不对方法/方法论做细致区分。详见第三部分3.1。
2.语料库语言学
语言学是以人类语言为研究对象的学科,探索范围包括语言的性质、功能、结构、运用和历史发展,以及其他与语言有关的问题(胡壮麟, 2021)。本质上来说,语言学家的共同目标是发现并探讨人类语言的模式。广义上的语言学包含语言基础结构,语言使用,语言分类,语言在各个社会群体中的差异,其在不同历史时期中的变化,语言如何被人的大脑处理,如何被人类习得等等(Egbert &
Baker, 2019)。
语言学和其它的科学领域一样,依据实验数据来检验假设、探究模式。语言学中的研究数据多种多样。例如,心理语言学研究中使用的反应时间、眼动追踪数据、以及神经影像; 社会语言学研究中使用的访谈、问卷以及调查;批判话语研究中使用的文本数据以及产生和接收这些文本数据的语境。“尽管语言学领域的研究资源多种多样,但有一种研究资源几乎可以应用到所有语言学的分支中:这就是语料库” (Egbert & Baker, 2019:3-4)。
NLP(一)语料库和WordNet
NLP(⼀)语料库和WordNet
访问语料库
NLTK数据库的安装:
NLTK语料库列表:
内部访问(以Reuters corpus为例):
import nltk
from nltk.corpus import reuters
# 下载路透社语料库
nltk.download('reuters')
# 查看语料库的内容
files = reuters.fileids()
print(files)
# 访问其中⼀个⽂件的内容
words14826 = reuters.words(['test/14826'])
print(words14826[:20])
# 输出主题(⼀共90个)
reutersGenres = reuters.categories()
print(reutersGenres)
# 访问⼀个主题,⼀句话⼀⾏输出
for w in reuters.words(categories=['tea']):
print(w + ' ',end='')
if w is '.': print()
下载外部语料库并访问(以影评数据集为例)
下载数据集:
本例下载了1000积极和1000消极的影评
from nltk.corpus import CategorizedPlaintextCorpusReader
# 读取语料库
reader = CategorizedPlaintextCorpusReader(r'D:\PyCharm 5.0.3\WorkSpace\2.NLP\语料库\1.movie_review_data_1000\txt_sentoken',r'.*\.txt',cat_pattern=r'(\w+)/*')
print(reader.categories())
print(reader.fileids())
# 语料库分成两类
posFiles = reader.fileids(categories='pos')
negFiles = reader.fileids(categories='neg')
词典学专业术语
词典学术语
abbreviation缩略语
abbreviativenotation缩略标记
abridged删节的,未足本的
abridgeddictionary节本词典
abridgement删节,节本
absoluteequivalent绝对对应词
absolutesynonym绝对同义词
abusage滥用
abusivelanguage辱骂语
academicdictionary学术词典
academiclexicography学术词典学
academydictionary学院词典
accentmark重音号
acceptability接受性
acceptabilityrating接受等级
accessalphabet检索字母表
accesspoint检索项
accessstructure检索结构
acknowledges致谢项
acrolect上层方言
acronym首字母缩略词
activedictionary积极词典,主动性词典
activevocabulary积极词汇
adjectivalnoun形容词性名词
adjectivecomplement形容词性补语
adjectivecompound复合形容词
adjunct附加性副词
adnominal名词修饰语
advancedsearches高级搜索
affix词缀
affixation词缀法,词缀词
agglutinativelanguage黏着型语言
alienword外来词
allomorph语素变体
allophone音位变体
allusion典故
alphabeticarrangement字母顺序排列
alphabeticorder字母顺序
alphabeticsequence字母顺序
alphabeticwriting字母文字,拼音文字
alphabetization按字母顺序排列
alphanumericcombination字母数字组合词
alphapedia字顺百科
alternativelexicography另类词典学
memoq 语料库提取术语
memoq 语料库提取术语
使用memoQ进行语料库术语提取可以遵循以下步骤:
1. 创建项目并选择语言:在memoQ中创建一个新的项目,并选择与所提取的术语对应的目标语言。
2. 导入双语文件:项目创建完成后,需要导入一个双语文件,如TMX格式。这个文件通常包含平行语料,有助于提取术语。
3. 提取术语:在memoQ中,打开双语文件,找到“Preparation-Extract
Terms”路径。这里,memoQ提供了基于词长和词频的术语提取方法。
4. 筛选和增加术语:在提取出的术语基础上,译者可以对这些术语进行筛选和增加,确保术语的质量和准确性。
5. 创建术语库:在memoQ中创建一个术语库,用于存储和管理提取出的术语。在“资源”选项卡中,选择“术语库”,然后点击“新建”来创建一个新的术语库。给术语库取一个有意义的名称,并且可以根据需要添加不同语言的术语。
6. 导入术语:一旦创建了术语库,接下来需要将提取出的术语导入到该库中。可以从Excel表格或者CSV文件中导入术语,也可以手动添加术语。在“术语库”窗口中,选择“导入”选项,然后按照提示将术语导入到术语库中。
需要注意的是,memoQ的术语提取方法并没有明确的参考依据,且十分依赖双语文本。此外,提取出的术语不会自动识别目标语言,因此在后续工作中还需要手动添加目标语言。
以上步骤仅供参考,建议查阅memoQ使用说明或咨询专业人士获取更多信息。
基于术语语料库的术语词性序列研究
・语料库研究・ 2011年第1期
基于术语语料库的术语词性序列研究
张榕
(北京语言大学汉语速成学院,北京100083)
摘要:文章基于术语数据库,分别考察了包含命名实体、数词、标点符号的术语以及字母词术语,采用统计 的方法获取有效的术语内部词性序列以及高频术语内部词性序列,该研究有助于术语的语言学研究,以及
术语识别与抽取等应用领域的研究。 关键词:术语;词性标注;词性序列
Research on Sequence of POS in Terms
ZHANG Rong
(College of Intersive Chinese Training,Beijing Language and Culture University,Beijing 100083,China)
Abstracts:The paper is based on the term database,studies the terms which include name entity,numeral,
punctuation marks and letter.The paper gets the list of valid POS sequence from the database and the most
frequently used POS sequence by statistics methods.It is helpful for the linguistics study of terms and for the
term recognition and extraction.
Keywords:term,POS tagging,sequence of POS
1引言
随着社会的发展与科技的进步,新概念、新事
物不断涌现。这些新概念与新事物产生后,必定要 用一个术语来指称,因此日益增多的术语融人到语 言词汇的集合之中。统计表明,术语在语言词汇中 所占的比例逐年增长。从术语的语言学特征来看, 术语作为领域专用词汇是由词或词组构成的语言
词典学术语(修订版)
词典学术语
abbreviation 缩略语
abbreviative notation 缩略标记
abridged 删节的,未足本的
abridged dictionary节本词典
abridgement 删节,节本
absolute equivalent 绝对对应词
absolute synonym 绝对同义词
abusage 滥用
abusive language 辱骂语
academic dictionary 学术词典
academic lexicography 学术词典学
academy dictionary 学院词典
accent mark 重音号
acceptability 接受性
acceptability rating 接受等级
access alphabet 检索字母表
access point 检索项
access structure 检索结构
acknowledges 致谢项
acrolect 上层方言
acronym 首字母缩略词
active dictionary 积极词典,主动性词典
active vocabulary 积极词汇
adjectival noun 形容词性名词
adjective complement 形容词性补语
adjective compound 复合形容词
adjunct 附加性副词
adnominal 名词修饰语
advanced searches 高级搜索
affix 词缀
affixation 词缀法,词缀词
agglutinative language 黏着型语言
alien word 外来词
allomorph 语素变体
allophone 音位变体
allusion 典故
alphabetic arrangement 字母顺序排列
alphabetic order 字母顺序
CAT详细介绍3
第三单元:语料库和语料库分析工具
3.1 电子语料库
3.1.1不同类型的电子语料库
3.2语料库分析工具
3.2.1.词频列表
3.2.1.1按词汇屈折变化进行分类的词条表
3.2.1.2 停用词表
3.2.2 检索工具
3.3.2.1单语言检索工具
3.2.2.2双语检索工具
3.2.3词语搭配
3.3注释与标注
3.4 使用语料库分析工具的利弊
3.4.1频率数据
3.4.2语境
3.4.3实用性和版权
3.4.4预处理
3.4.5速率与信息检索问题
3.4.6字符集和语言相关的问题
3.4.7经济因素
把一个单词放到一个语境中,意味着给它生命。如果你想知道那些词的行为,那么你必须要在它们的自然环境中学习它们,这里的自然环境就是语境。
最广义的说,语料库是文本或话语的集合,它们是执行语言学调查的基础。翻译学科史上用印刷版的语料库进行搜索研究的历史悠久。译者通常搜查专业术语的时候会编写和分析语料库。此外,当翻译一个文件的时候,译者典型的会收集和查询平行文本(与源语文本具有同样交际作功能,但在目的语中已被别人写过的文本)以作参考文体,格式,专业术语,措辞。-translated by 沙依巴
除了它们包含的有价值的信息,印刷版的语料库有很多缺点。首先,需要花体力和很长时间在图书馆收集资料或复印。收集好之后还组要好长时间去查询文本,这意味着在突然发现正在寻求的词语或与重点相关的内容之前需要阅读很多无关的资料。再次,只找到一两个平行文本远远不够。因为译者未必是该领域的专家,他们需要查阅大量的文本,以保证他们所选择的文体和术语能被该领域的专家接受,而不是一个作者的特质用语。此外,当它们在不同的页面,不同的文件里出现的时候,确定他们的语言学模式和文体学共性很难。因此,印刷版的语料库有两大缺点。第一,译者拿着印刷版的语料库做翻译的时候,不能收集和查阅大量的文件以保证所所有相关的概念,术语和预言模式都能找到。第二,人工分析本来就容易出错:没有依靠辅助的人类大脑显然不能发现所有重要的模式,更不用说以更有意义的方式组织语言。收集和查阅语料库花的时间越多,真正留给翻译的时间就越少。为了在截止日期之前完成任务,译者很难能平衡收集、查阅资料花的时间和做翻译画的时间。
sci英语语料库
sci英语语料库
SCI英语语料库是用于学术研究的英语文本集合,它包含了大量科学论文和文献,有助于研究人员分析和研究专业英语的使用情况。
SCI(Science Citation Index)英语语料库通常指的是那些收录了大量科学引文索引的英语语料库,这些语料库主要用于分析和研究科学技术领域的英语使用情况。以下是一些可用于研究的英语语料库:
Corpus of Contemporary American English (COCA):这是一个大型且“平衡”的美国英语语料库,可能是目前使用最广泛的英语语料库之一。
British National Corpus (BNC):这是英国国家语料库,包含了广泛的英国英语文本。
Webcorp:这是一个专业的语料库,提供了大量在线文本数据。
DEAP Corpus:这个语料库旨在收集在高影响力国际期刊上发表的英语研究文章,覆盖了20多个学科。
这些语料库对于语言学家、研究人员以及学习者来说是宝贵的资源,它们可以用来研究语言模式、词汇使用、语法结构等。此外,语料库还可以帮助翻译人员和写作者提高他们的英语水平,了解专业领域中的术语和表达方式。
