基于Web的双语平行语料库自动获取系统
基于Web的双语平行语料库自动获取系统1
叶莎妮吕雅娟刘群
中国科学院计算技术研究所智能信息重点实验室
{yeshani,lvyajuan,liuqun,}ict.ac.cn
摘要:利用互联网上存在的海量多语言文本资源,通过网页的内容分析和链接分析,实现了
一个双语语料挖掘的自动获取系统。首先,介绍了系统框架和主要模块;其次,详细描述了
各个模块的实现与创新技术;最后,给出下一步工作的展望。本系统为获取真实的中英平行
语料库提供了有效的途经。
关键词:双语语料;网页挖掘;平行网页
ABilingualCorpusAutomaticAcquisition
SystemBasedonWeb
Abstract:Implementedabilingualcorpusautomaticacquisitionsystembytakingadvantageofan
abundanceofmultilingualcorpusintheWorldWideWeb,andanalyzingtheircontentandlinks.
First,introducedsystemframeworkandmainmodules;second,describedeverymoduleand
technologyinnovationsindetail.Aprospectforthenextstepwasgivenatlast.Thissystem
providedaneffectivewayforachievingChinese-Englishparallelcorpus.
Keywords:BilingualText;ParallelCorpora;WebMining;
1.引言
语料库的建设是统计学习方法的重要基础,近年来,语料库资源对于自然语言处理研究
的巨大价值已经得到越来越多的认可。特别是双语语料库(BilingualCorpus),已经成为机
器翻译、机器辅助翻译以及翻译知识获取研究不可或缺的重要资源。一方面,双语语料库的
出现直接推动了机器翻译新技术的发展,像平行语料库为统计机器翻译的模型构建提供了必
不可少的训练数据(e.g.,Brownetal.1990;Melamed2000;OchandNey2002),基于统计
(Statistic-Based)和基于实例(Example-Based)等基于语料库的翻译方法为机器翻译研究
提供了新的思路,有效改善了翻译质量,在机器翻译研究领域掀起了新的高潮。另一方面,
双语语料库又是获取翻译知识的重要来源,从中可以挖掘学习各种细粒度的翻译知识,如翻
译词典(e.g.,GaleandChurch1991;Melamed1997)和翻译模板,从而改进传统的机器翻译
技术。此外,双语语料库也是跨语言信息检索(e.g.,DavisandDunning1995;Jian-YunNie,TREC8;),翻译词典编撰、双语术语自动提取以及多语言对比研究等的重要基础资源。
双语平行语料库建设与获取存在着很大的困难,各国都投入了大量的人力、物力和财力,
但是双语平行语料库的来源主要集中在政府报告、新闻法律等特定领域,不适合真实文本应
用。同时,互联网上的大规模双语文本并且具有很好的时效性和覆盖性,这为双语平行语料
库的获取提供了潜在的解决途径。
研究基于Web的大规模双语平行语料库获取技术对于解决双语语料库获取难题,推动相关技术发展和实用化具有重要的意义。本文的目标就是建设一个语料库自动获取系统。
收稿日期:2007-06-30返稿日期:2007-XX-XX基金项目:国家自然科学基金(60603095),国家自然科学基金(60573188)作者简介:叶莎妮,硕士研究生,主要研究方向为自然语言处理技术(yeshani@ict.ac.cn);吕雅娟,工学博士,主要研究方向为计算语言学与机器翻译;刘群,工学博士,主要研究方向为计算语言学与机器翻译2.背景介绍
加拿大蒙特利尔大学的研究者聂建云开发的系统PTMiner(ParallelTextMiner,1999):
通过搜索引擎查找含有特定锚文本的网站构成双语候选网站,再依赖预先定义的语言的前后
缀表,抽取出具有URL命名相似性的候选网页即如果某一URL含有一种语言的前后缀,则
将这些前后缀替换为另一种语言的,构建出一个URL,如果这样构建出来的URL存在。则
找到了一对候选网页对,最后再根据文本长度,网页的HTML标记结构,网页的语言等特
征过滤掉候选网页中不平行的网页对。PTMiner系统在中英平行网页文本挑出几百对的中
英平行网页对,经过人工的评价,有将近90%的准确率。获取到的英文文本有137M,中文
文本有117M。
美国马里兰大学的研究者Resnik开发的系统STRAND(StructuralTranslationRecognition,AcquiringNaturalData,2003)也是利用搜索引擎和定义的挑选候选网站的规则来得到双语
候选网站。同PTMiner相比,STRAND再利用URL命名相似性来查找一个网站内的候选
网页对时,采取在中、英URL中删去预先定义与语言相关的字符串的方式,如果去除语言
相关的字串后,中、英URL相等,则说明当前的中英URL是一对候选双语平行网页。此外,STRAND更加细致深入的研究了平行网页在结构上具有的相似性,采用了更多的基于网页
结构的特征来过滤掉候选平行网页中不是互为翻译的网页对。人工评估了大约400对的中英
平行网页对,取得了98%的准确率和61%的召回率。STRAND系统获取到大约3,500对中
英平行网页对。BITS(BilingualInternetTextSearch,MaandLiberman1999),下载指定域名下的所有网
站作为候选网站,定义了一种计算中英网页内容之间相似度的计算方式即互翻译词占文本总
词数的比例,来进行中英平行网页对的确定。
澳大利亚莫纳什大学陈纪淞等人开发的PTI(TheParallelTextIdentificationSystem,2004)通过网页采集器下载了大量的双语网页之后,首先通过了文件名比较模型即根据URL
命名的相似性来得到双语平行网页对,原理同PTMiner,在这一过程没有相应对齐链接的
网页再通过一个文件内容分析模型,定义了计算网页文本内容之间的相似度计算方式,从而
得到双语平行的网页对。PTI系统总共获取到193对的中英平行文本,其中180对是正确的,
正确率为93%,召回率为96%。
亚洲微软研究院的吴克等人开发的WPDE(WebParallelDataExtraction,2006)在利用
搜索引擎获取候选网站时,不仅利用了锚文本还采用了图片的ALT信息。在根据URL命名
相似性获取候选双语平行网页对时,采用将URL分成pathname和basename,pathname的
配对查找上也利用预先定义的启发式字符串,在具体的查找时定义了一些匹配规则;basename的查找配对不用于前面系统采用的基于预先定义的字符串形式,而是基于改进的
最小编辑距离算法,这样的方式经过试验证明取得了更好的效果。候选双语平行网页对的过
滤时除采用了文本长度,网页html结构等特征,还引入了一个基于网页内容的特征即候选
双语平行网页文本句子对齐的好坏。在同PTI同样的测试集合上,WPDE系统取得了97%
的正确率与94%的召回率。
3.系统框架
本系统建立了一个基于Web的双语语料自动获取平台,能够自动获取文本级双语平行
语料库和句子级的双语平行语料库。本系统主要获取中英平行网页文本,但是除了一些与具
体语言相关的配置文件以外,采用的方法是不依赖具体语言的,可以很轻松的一致到其他的语言对上。整个系统如下图所示,由四个关键部分组成。
图表1系统结构图
3.1候选网站的获取
候选网站为可能含有中英平行网页的网站,如果一个中文网页中含有以“English”、
“Englishversion”等为锚文本或图片ALT信息的链接,或者一个英文网页中含有相应的以
“中文”、“中文版”为锚文本或图片ATL信息的链接,则可以认为含有该网页的网站是一
个候选网站。可以通过搜索引擎或指定特定的域来获取候选网站。识别候选网站的目的是要
进一步将双语文本的获取限制在可能的网站上。在得到候选网站之后,利用已有的网页采集
器Wget,下载了大量的双语网页
3.2采集网页与预处理
利用现有的网页采集器Wget下载候选网站内部的所有网页,再一系列的预处理操作,
例如:进行统一中文网页编码,都转化为GB格式;网页语言识别,分为中文网页与英文网
页;统一转化为小写格式等。
3.3基于URL命名相似性获取候选中英网页
通过观察可以发现相当一部分网站作者在URL命名时有一特点:会引入一些与特定语
言相关的字符串,双语平行网页的URL只有语言相关的部分字符串不同,例如:
“www.fao.org/newsroom/zh/index.html”与“www.fao.org/newsroom/en/index.html”,并且语
言相关的部分其中大部分是常见的,可以通过预先定义的,所以已有的系统都通过预先定义
与特定语言相关的字符串集合或正则表达式。但是,同时存在着大量的双语网站,其URL
命名虽然具有语言相似性,但不是通过预先定义可以发现这种规律。此外,也存在一些网站
的在命名时,中文一侧的URL用的是完整的单词,而英文一侧对应的网页URL用的则是该
单词的简写。可见,只要URL命名的相似性不涵盖在预先定义的集合中,那么已有的系统
就无法处理。下面提出一种能够自动发现当前网站在双语网页命名时具有的特点,再进行候
选双语平行网页对的获取,完全不需要预先定义语言相关的字符串集合。3.3.1根据URL命名相似性获取候选中英网页
我们通过观察统计发现在那些具有URL命名相似性的双语网站中,URL的pathname
与basename的相似性是不同的,应该将一个URL分为pathname和basename两部分,分别
寻找当前网站中URL这两部分命名时的相似性,再进行查找候选平行网页对。
例如:www.fao.org/newsroom/zh/field/2005/index.html
其中:“www.fao.org/newsroom/zh/field/2005/”为pathname,“index.html”为basename
分别找出pathname和basename中语言相关的部分,分别生成pathname部分和basename
部分的两组替换规则,依靠生成的pathname产生式与basename产生式来将中英URL配对,
得到候选双语平行网页对。具体思想描述如下:1.pathname替换规则的生成
a)基本思想
将pathname看作由/str/组成字符串,每一个/str/是处理单元(字段),假设一个pathname
中不存在重复的处理单元。获取pathname中符合以下规则的不同部分(可能是我们要的
语言相关的部分)
简记为:cpath:f/lang_c/l/,epath:f/lang_e/lf表示两个URL相同的前端部分
l表示两个URL相同的后端部分
lang_e,lang_c表示两个pathname中不同部分,为中间部分,可能含有多个字段。
基于双语语料库的短语复述实例获取研究
基于双语语料库的短语复述实例获取研究
李维刚;刘挺;李生
【期刊名称】《中文信息学报》
【年(卷),期】2007(21)5
【摘 要】本文提出一种基于双语语料库的短语复述实例获取方法,尤其能够很好的抽取歧义短语的复述实例.该方法通过输入一个双语短语对约束短语的语义,利用词对齐的双语语料库,构造一个双向抽取模型从中抽取双语对的复述实例.双向抽取模型通过比较每一个候选复述短语和输入短语之间的语义一致性,来确定每个候选是否成为最终的复述实例.实验结果表明,本文短语复述实例获取方法的综合准确率达到了 60% ,获取了较好的性能.
【总页数】6页(P112-117)
【作 者】李维刚;刘挺;李生
【作者单位】哈尔滨工业大学,计算机学院,信息检索研究室,黑龙江,哈尔滨,150001;哈尔滨工业大学,计算机学院,信息检索研究室,黑龙江,哈尔滨,150001;哈尔滨工业大学,计算机学院,信息检索研究室,黑龙江,哈尔滨,150001
【正文语种】中 文
【中图分类】TP391
【相关文献】
1.基于汉英双语语料库的翻译等价单位自动获取研究 [J], 常宝宝
2.一种基于汉维对齐的双语语料库的获取方法 [J], 玛依拉·艾尼扎提;胡学钢 3.基于统计和词典方法相结合的韩汉双语语料库名词短语对齐 [J], 凌天斌;毕玉德
4.基于中英平行专利语料的短语复述自动抽取研究 [J], 李莉;刘知远;孙茂松
5.基于深度学习的中文短语复述抽取技术研究 [J], 颜欣;张宇;潘晓彤;刘作鹏;刘挺
因版权原因,仅展示原文概要,查看原文内容请购买
多语种Web新闻语料抓取的通用模型研究
第23卷第4期 2013年l2月 ‘ 洛阳理工学院学报(自然科学版) Journal of Luoyang Institute of Science and Techn010gy(NaturaI Science Edition) V01.23 No.4 Dee.20l3
多语种Web新闻语料抓取的通用模型研究
陈荟慧 ,舒云星 ,林丽
(1.洛阳理工学院计算机与信息工程系,河南洛阳471023;2.解放军外国语学院亚非语系,河南洛阳471003)
摘要:Web语料是外语语料库的重要组成部分,语料抓取系统要适用于不同语种、不同结构的网站。文中介绍
了针对内容管理型新闻网站设计的语料抓取软件模型,模型根据新闻网站中标题页和内容页的模版特点,采用正 则表达式和动态字符串方法定义信息抓取路径和信息块抓取规则,并通过对抓取路径的去噪和去重过滤,保证每 次Web访问均能抓取有效数据。基于该模型的语料抓取工具NPCrawler在c≠}和SOL Server2005环境下实现,通 过在不同结构的多个语种的网站中实际应用证明,Web新闻语料抓取结果命中率和准确率接近100%,且抓取效
率较高。 关键词:正则表达式;多语种;新闻语料;Web爬虫
DOh 10.3969/i.issn.1674-5043.2013.04.009 中图分类号:TP391.1 文献标志码:A 文章编号:1674.5043(2013)04-0034.06
随着互联网的发展,Web逐渐成为信息发布和获取的主要平台,Web信息抓取系统将互联网变成巨大
的知识库。近些年Web信息抓取系统(WIES:Web lnformation Extraction System)在各种研究中应用广泛,
其中外语语料库的构建是WIES的典型应用。语料库可广泛应用于自然语言处理、语言和语法、机器学习、
信息检索、语言学等研究,在语言信息处理研究中,抓取Web语料是最快速、最有效的数据获取途径。
双语平行语料库
“双语平行语料库”资料合集
目录
一、双语平行语料库在翻译教学上的用途
二、论幽默文本中本源概念的翻译模式基于汉英双语平行语料库的研究
三、基于双语平行语料库的翻译文体学探讨——以《骆驼祥子》两个英译本中人称代词主语和叙事视角转换为例
四、基于双语平行语料库的翻译文体学探讨以《骆驼祥子》两个英译本中人称代词主语和叙事视角转换为例
五、国内英汉双语平行语料库建构与研究现状及展望
六、论幽默文本中本源概念的翻译模式——基于汉英双语平行语料库的研究
双语平行语料库在翻译教学上的用途
随着全球化的不断发展,翻译行业的需求也日益增长。为了满足这一需求,许多高效的翻译工具和资源应运而生。其中,双语平行语料库作为一种重要的翻译教学资源,在翻译教学中发挥着越来越重要的作用。 双语平行语料库是一种包含两种语言对应文本的语料库,它可以是两个不同语言的单语种语料库之间进行比较和分析,也可以是某一特定领域内的两种语言之间的语料库进行比较和分析。在翻译教学中,双语平行语料库的价值主要体现在以下几个方面。
双语平行语料库可以为翻译教学提供丰富的案例和实例。传统的翻译教学方法往往侧重于理论知识的传授,而忽略了实际案例的展示。而双语平行语料库则可以提供大量的真实语境下的翻译案例,学生可以通过观察和分析这些案例,深入了解不同语言之间的差异和特点,从而更好地掌握翻译的技巧和要领。
双语平行语料库可以帮助翻译教师制定更加科学合理的教学计划。通过对语料库中的数据进行统计和分析,教师可以了解学生在翻译过程中可能遇到的问题和难点,并有针对性地制定教学方案和练习,帮助学生克服难点,提高翻译能力和水平。
再次,双语平行语料库可以促进翻译学科的研究和发展。通过语料库的研究和分析,可以对不同语言的语法、语义、语用等方面进行深入探究,从而为翻译学科的发展提供有力的支持和依据。语料库的研究也可以促进不同语言之间的交流和理解,增进不同文化之间的和友谊。
平行语料库检索软件SDAU-ParaConc设计与实现
软件导刊2019年第18卷第9期2019年9月软件导刊SoftwareGuideVol.18No.9Sep.2019
收稿日期:2019-01-03基金项目:山东农业大学研究生教育教学改革研究项目(JYYB2018027)作者简介:葛晓帅(1989-)
,男,硕士,山东农业大学外国语学院讲师,研究方向为词典学、语料库语言学;翟红华(1967-),女,山东农业
大学外国语学院教授、硕士生导师,研究方向为语音学及音系学、语篇分析。本文通讯作者:翟红华。0引言
语料库是当代语言研究与教学[1]的一项重要参考,不
论是翻译研究、词典编纂抑或是教材编写都离不开语料库
支持[2]。
语料库指在一定原则下收集的批量口头或笔头语篇
素材,以电子版本的形式存储在电脑中,用于语言的调查
和质性分析[3]。当代语料库指电子语料库,语料库的快速发展主要是依赖电子计算机的快速发展与普及。语料库
的规模从第一代电子语料库的百万词次级别发展到现在
上亿词次级别[4],如此大规模的文本是不可能依靠人工去
读取分析的,因此语料库检索软件在语料库研究中十分重
要。
平行语料库由源语文本及平行对应的译语文本构成
双语语料库[5]。平行语料库与单语语料库相比有其自身特
点:①平行语料库包含两种以上语言;②语料之间按照特
定层次平行对齐。这些特点决定了平行语料库的检索无平行语料库检索软件SDAU-ParaConc
设计与实现
葛晓帅,翟红华
(山东农业大学外国语学院,山东泰安271000)
摘要:当代语言研究离不开语料库,对语料库的检索需要计算机软件支持,但平行语料库检索软件数量极少,
且存在不符合中国国情的情况。因此,有必要开发一款符合中国国情、适应大数据检索需求、减少语言研究中
重复劳动的平行语料库检索软件。在考察现有4款平行语料库检索软件,对比分析它们各自的优势及不足后,
结合中国国情及语言研究实践经验,提出了新的平行语料库检索软件SDAU-ParaConc设计理念。介绍了SDAU-ParaConc的实现方式与特点。与之前的软件对比结果表明,SDAU-ParaConc操作步骤平均简化了
语言翻译必备:国内外23个语料库推荐
语言翻译必备:国内外23个语料库推荐
语料库通常指为语言研究收集的、用电子形式保存的语言材料,由自然出现的书面语或口语的
样本汇集而成,用来代表特定的语言或语言变体。经过科学选材和标注、具有适当规模的语料
库能够反映和记录语言的实际使用情况。下面推荐一些优质的语料库资源。
国内语料库资源
1. 国家语委现代汉语语料库
现代汉语通用平衡语料库现在重新开放网络查询了。重开后的在线检索速度更快,功能更
强,同时提供检索结果下载。现代汉语语料库在线提供免费检索的语料约2000万字,为分词和
词性标注语料。
2. 国家语委古代汉语语料库
网站现在还增加了一亿字的古代汉语生语料,研究古代汉语的也可以去查询和下载。同时,
还提供了分词、词性标注软件、词频统计、字频统计软件,基于国家语委语料库的字频词频统
计结果和发布的词表等,以供学习研究语言文字的老师同学使用。
3. 北京大学“《人民日报》标注语料库”
4. 北大语料库——北京大学中国语言学研究中心
北大语料库由“现代汉语语料库”、“古代汉语语料库”、“汉英双语语料库”三个语料库组成。其
中,北大计算语言学研究所的双语语料库,英汉对齐的句子已有5万多对,并开发了相应的对齐
工具和双语语料库管理软件。正在此基础上做汉英对照短语库,预计规模将达数十万条。(汉
英双语语料库目前仅对北大校内用户开放)
5. 北京语言大学高翻学院的“高翻记忆库”
6. 清华大学汉语均衡语料库TH-ACorpus
7. 中央研究院“现代汉语平衡语料库”
专门针对语言分析而设计的,每个文句都依词断开,并标示词类。语料的搜集也尽量做到现
代汉语分配在不同的主题和语式上,是现代汉语无穷多的语句中一个代表性的样本。现有语料
库主要针对语言分析而设计,由中央研究院信息所、语言所词库小组完成,内含有简介、使用
说明,现行的语料库是4.0的版本。
8. 中央研究院“近代汉语标记语料库”
9. 中央研究院汉籍电子文献(瀚典全文检索系统)
包含整部25史 整部阮刻13经、超过2000万字的台湾史料、1000万字的大正藏以及其他典
基于Web的藏汉双语实验室预约系统的设计与实现
墨墨 QQ!: 墨 CN 22-1323/N 长春工程学院学报(自然科学版)2011年第12卷第3期 J.Changchun last.Tech.(Nat.Sci.Edi.),2011,Vo1.12。No.3 31/38 109・112
基于Web的藏汉双语实验室预约系统的设计与实现
吴志强,于洪志,何向真
(西北民族大学中国民族语言文字信息技术重点实验室,兰州730030)
摘 要:基于web的藏汉双语实验室预约系统以项 目为载体,藏汉双语同步显示,充分调动藏族地区大 学生的学习积极性,培养学生的动手和科研能力,同
时减轻实验室管理人员的工作负担,提高实验资源
的使用和管理效率。阐述了系统的设计开发过程, 以及在设计开发过程中的藏汉双语与平台的无缝衔
接技术。 关键词:实验室预约;实验管理;实验教学;藏汉
双语 中图分类号:TP393 文献标志码:A
文章编号:1009-8984(2011)03-0109—04
1 概述
为了适应新时代对创新人才的要求,学校急需
为在校大学生提供一个良好的科研创新环境,方便
学生进行科研创新项目的申报、实验室的预约。但 由于学校实验室众多,而教师人数有限,这使得学生
预约实验室或实验设备的过程比较复杂,实验室管
理人员工作量也比较大。因此,为了方便学生的学
习,必须准确地了解学生对实验的内容和时间等的 要求,合理安排实验室和实验设备。藏汉双语实验
室预约系统通过学生网上预约实验的方式,减轻了
实验室管理人员的负担,为实验室和实验设备的妥
善安排提供可靠的依据。
2系统整体设计
2.1 系统结构
本系统的设计思路是学生登录系统,然后提交 自己的创新项目,学院项目管理员和学校管理员审
收稿日期l2011一O8—10 基金项目;国家科技支撑计划项目(2009BAH41B01) 作者简介:吴志强(1987一),男(汉),河南郑州,硕士研究生 主要研向中文信息处理。 核通过后,学生可以进行实验室和实验设备的预约。
基于双语混和网页的平行语料挖掘
基于双语混和网页的平行语料挖掘*
林政,吕雅娟,刘群,马希荣
中国科学院计算技术研究所 北京 100080
E-mail: {linzheng, lvyajuan,liuqun}@, maxirong@
摘 要:双语平行语料是统计机器翻译模型训练必不可少的基础资源,但是大规模双语平行语料库的自动获取并不容易。本文提出了一种从双语混合网页上自动挖掘大规模双语平行语料库的解决方案,研究了候选双语混合网页的获取,网页噪声过滤,双语网页确认以及平行句对抽取等关键技术,最后实现了一个基于双语混合网页的平行句对自动挖掘系统。利用该系统获取了105万双语平行句对,平均正确率为93%, 其中前20万获取的双语句对的正确率达到99%。
关键词:Web挖掘;双语混合网页;双语平行网页;平行语料库
Mining Parallel Corpora from Mixed-Language Web Pages
Lin Zheng, Lv Yajuan, Liu Qun, Ma Xirong
Institute of Computing Technology, Chinese Academy of Sciences, Beijing 100080
E-mail: {linzheng, lvyajuan,liuqun}@, maxirong@
Abstract: Bilingual parallel corpora is the indispensable resource of model training in SMT , but it’s not easy to acquire
large-scale corpora automatically. This paper proposes a solution to mine large-scale bilingual parallel corpora from
mix-languages web pages and analyses the problems of obtaining candidate mix-language web pages, filtering web noises,
基于Web语料的概念获取系统的研究与实现
计算机科学2007Vo1.34N0.2
基于Web语料的概念获取系统的研究与实现 )
余营 曹存根
(中国科学院计算技术研究所 北京10OO8O) (中国科学院研究生院 北京100080)
摘要互联网网页中存在大量的专业知识 如何从这些资源中获取知识已经成为1O多年来的一个重要的研究课
题。概念和概念问的关系是知识的基本组成部分,因此如何获取并验证概念,成为从文本到知识的过程中的重要步 骤。本文提出并实现了一种自动从Web语料中获取概念的方法,该方法利用了规则、统计、上下文信息等多种方法和
信息。实验结果表明,谊方法迭到了较好的效果。
关键词 中文信息处理,知识获取,概念获取,概念验证
Concept Extraction and Verification from Web Corpus
YU Lei , CA0 Cun-Gen
(Institute of Computing Science,Chinese Academy of Sciences,Beijing 100080) (Graduate School,Chinese Academy of Sciences,Beijing 100080)0
Abstract There is a 1arge amount of knowledge on the Web pages.How to intelligently acquire knowledge from the
massive information on Web pages has become a very important task.Concepts as well as interIc0nceptual relations and
inter-attrihute relations of concepts are the main parts of knowledge.Therefore how toacquire and verify concepts is an important step in the knowledge acquisition.This paper proposes a hybrid approach to automatically extract concepts
多语种网站平行语料采集与对齐研究
多语种网站平行语料采集与对齐研究
作者:刘佳雨 程南昌
来源:《数字技术与应用》2020年第09期
摘要:丰富的平行语料库对提升机器翻译准确度意义重大,然而目前研究中缺乏有效的平行语料获取方法,本文提出一种从多语种网站中自动获取平行语料的方法,并且通过6个多语种网站的平行语料采集和对齐研究,验证通过多语种网站获取大规模平行语料具有较高的可行性,这说明通过多语种网站获取大规模平行语料具有较高的可行性。
关键词:多语种;新闻网站;平行语料;篇章对齐;机器翻译
中图分类号:TP391.2 文献标识码:A 文章编号:1007-9416(2020)09-0214-04
0 引言
统计机器翻译通常需要大规模的平行语料来不断提高翻译的准确度,因此语料库的规模与持续扩充是提高机器翻译质量的重要因素。平行语料的人工标注难度很大,特别是小语种语料,而互联网上存在着大量多语平行语料资源,并且这些语料是持续增长的。如何通过网络爬虫技术和双语自动对齐技术从多语种网站采集并对齐语料,在机器翻译领域是一件值得研究的事。
1 相关研究
1.1 机器翻译的发展
Koehn[1]将机器翻译的过程定义为计算机自动将一种语言转化成具有相同意义的其他语言,机器翻译已经逐渐成为了互联网信息服务中不可或缺的一环。朱杰[2]指出人们普遍认为基于规则的方法和基于语料库的方法是机器翻译最常用的两大类方法。随着研究的深入,基于规则的方法逐渐暴露出质量低,成本高等缺点,基于语料库的方法开始流行。基于语料库的方法又可分为基于统计和基于实例两种,冯志伟[3]提到这两种方法都需要将语料库作为翻译训练的来源,通过大量的语料统计来进行翻译学习的数据获取。但在统计翻译模型面世很长一段时间内,语料的匮乏和缺失使得这种机器翻译的人工成本增高。之后通过基于序列的递归神经网络自动获取并记录词汇特征的方法出现,机器翻译在深度学习的发展中取得了突破性进展。
Web环境下自动获取汉、维语料库
第28卷第l2期
2011年l2月 计算机应用与软件
Computer Applications and Software VoI.28 No.12
Dec.2011
Web环境下自动获取汉、维语料库
姜子进 吐尔根・依布拉音 赛依旦・阿不力米提 田生伟
(新疆大学信息科学与工程学院新疆乌鲁木齐830046)
摘要 句子级的语料库是机器翻译的重要资源,但由于获取途径的限制,句子级的语料库不仅数量有限而且经常集中在特定领
域,很难适应真实应用的需求。根据锚文本信息通过搜索引擎在网络上找到汉维双语平行网站,并下载网站中所有的双语平行网
页。提取出有正文的网页,根据html特征,建立html树,提出一种将html树结构作为V,z54网页正文内容重要特征的网页分析方法,
并根据正文内容信息相似性提取网页正文。对提取出的正文进行句子切分,分别创建句子级的汉、维语料库,为以后创建句子级的
汉维双语平行语料库服务。
关键词 双语平行语料库 双语平行句对 正文提取
中图分类号TP391 文献标识码A
AUTOMATIC ACQUIRING CHINESE AND UIGHUR CORPUS LIBRARY
IN WEB ENVIRONMENT
Jiang Zijin Turgun Ibrahim Sayidan Abulimit Tian Shengwei
(School ofInformation Science and Engineering,Xinji ̄ng University,Urumqi 830046,Xinjiang,China)
Abstract Sentence level corpus library is all important resource for machine translation.However,since there are limited ways to acquire
