论文摘要
随着我国经济与对外交流的不断发展,翻译市场规模迅速扩大,利用计算机软件等翻译工具越来越受到用户的青睐,各类机器翻译的技术和方法层出不穷。机器翻译的方法主要分为两大类,分别是基于规则的方法和基于语料库的方法。基于规则的机器翻译最大的难题就是语言歧义的消解;基于语料库的方法是采取翻译记忆的模式,用户利用已有的原文和译文,建立起一个或多个语料库,在翻译过程中,系统自动搜索库中相同或相似的翻译资源,并给出参考译文。但是,目前大量基于翻译记忆模式的翻译软件所依赖的语料库都是人工构建的,语料库容量有限,且更新缓慢。随着因特网的发展,基于Web的全文搜索引擎越来越成为信息检索的主要手段,若能将翻译技术与Web信息搜索技术结合起来,就可以为用户提供完善的、实时的和动态的翻译服务。从研究对象的角度来看,Internet所包含的数据呈现出海量性、半结构化、多样性、动态性、分布式和异构性的特点。特别是经过多年的积累,Internet网站上存储了海量的中英文双语网页资源。双语语料库对机器翻译、机器辅助翻译、双语词典编纂、双语术语自动提取、双语对比研究以及双语教学的巨大价值已经得到越来越多的认可。对于机器翻译或机器辅助翻译而言,双语语料库主要在两方面发挥作用。一方面,双语语料库可以持续不断地为基于记忆的翻译引擎提供翻译实例,另一方面,双语语料库又是一个宝藏,可以从中挖掘学习各种细粒度翻译知识,供机器翻译、机器辅助翻译使用,这些翻译知识对翻译任务的各个环节都会起到积极作用本课题的研究目的是通过对网络搜索引擎、自动积累双语语料库、机器翻译的研究,利用网络机器人技术、网页噪音过滤技术、语句匹配入库算法、数据挖掘、分词技术、双语对齐技术、智能用户接口技术、个性化搜索技术、元搜索及结果融合与排序算法、全文检索技术以及JAVA应用等多项技术,研究基于网络大规模语料库和双语网页搜索的智能双语搜索方法和搜索引擎。这既可以为专业人员提供自动的双语网页资源,又可以为用户提供高质量的辅助翻译,避免翻译的重复劳动,提高翻译质量,具有很好的市场价值和社会效益。本文在研究过程中,主要的创新工作如下:(1)在互联网海量信息中,专门针对含有中英双语信息的单页文本和双页对照文本进行研究。根据两者不同的特点,对双页双语文本首次提出了双页双语语料挖掘算法DBWCM(Double Bilingual Wepage Corpus Mining);对单页双语文本设计了分步处理算法,提出了识别与净化单页双语文本的算法IPSBW(Identification and Purification of the Single Bilingual Webpage)和双语句对匹配与语料挖掘算法BSMCM(Bilingual Sentences Matching and Corpus Mining)。通过执行它们提取网页中大量存在的双语平行翻译语料,形成大规模的语料库,为辅助翻译搜索打下坚实基础。(2)针对当前搜索引擎的用户界面现状,利用概念检索和潜在语义分析的思想,通过建立双语同义词词典对查询关键词进行双语扩展,并为用户输入提供扩展提示,实现良好的用户界面,提高了双语辅助搜索的智能性和查全率。同时为提高查询的准确率,满足用户的个性化需求,研究了显式和隐式两种获取与更新用户个性化信息的方法,提出了双语关键词个性化扩充算法PEBK(Personalized Expansion of the Bilingual Keyword)和双语查询结果的个性化排序算法PSBR(Personalized Sort of the Bilingual Results),以便使查询结果达到因时因人因地的不同,得到用户真正想看到的结果。(3)为了扩大双语搜索的范围,将元搜索技术应用在双语翻译搜索中,通过分析元搜索的结果融合方法,针对使用PageRank算法的问题,提出了结合相关度的改进算法RSBS(Results Sort of the Bilingual Search),并对算法的效果进行验证。(4)最后,在形成双语语料库的基础上,基于Java和Lucene工具,设计网络机器人模块、网页识别与净化模块、语料匹配入库模块、索引模块、检索模块、个性化查询模块,用户接口等七个主要模块,实现双语搜索,为用户提供辅助翻译服务。智能双语辅助翻译搜索涉及的研究领域非常广泛,它涵盖了人工智能、语言学、机器翻译、搜索引擎、Web数据挖掘、数据库等多个领域知识。本文所做的工作尽管为利用网络实现辅助翻译提出了一些可行方法,但是,对于构建一个高效且智能化程度高的基于网络的辅助翻译系统还有许多问题有待进一步研究。
论文目录
相关论文文献
- [1].少数民族地区数学双语师范生信息素养现状及建议[J]. 开封教育学院学报 2019(11)
- [2].全媒体时代民族地区双语播音人才培养探析——以内蒙古地区为例[J]. 职业技术教育 2019(35)
- [3].改革开放40年我国少数民族双语教育研究热点、历史过程与展望[J]. 信阳师范学院学报(哲学社会科学版) 2020(01)
- [4].2003年-2018年广西双语教育研究统计分析——基于知网数据的[J]. 广西民族师范学院学报 2019(06)
- [5].珠海公共设施双语覆盖现状研究[J]. 文化学刊 2020(01)
- [6].秘鲁双语教育的历史与现状问题研究[J]. 江苏师范大学学报(哲学社会科学版) 2020(01)
- [7].基于国家政策导向的延边州双语教育发展改革研究[J]. 文化创新比较研究 2020(05)
- [8].论民族地区学前双语教育目标理论与实践[J]. 教育观察 2020(04)
- [9].双语经验对老年人认知能力的促进[J]. 区域治理 2020(03)
- [10].“福丫头”双语绘本读物系列出版[J]. 国际汉语教育(中英文) 2020(01)
- [11].国外双语教育理论研究及对我国双语教育的启示[J]. 民族高等教育研究 2020(01)
- [12].语言经济学视角下广西壮汉双语教育的保护与发展[J]. 知识经济 2020(06)
- [13].高校“英、韩双语”专业学生学习与就业概况分析[J]. 就业与保障 2020(02)
- [14].蒙汉双语教育发展策略研究[J]. 内蒙古财经大学学报 2020(02)
- [15].双语教育对比研究及其在中国的应用策略[J]. 教育现代化 2020(25)
- [16].国家安全视域下的民汉双语教育[J]. 贵州民族研究 2020(05)
- [17].香港理工大学人文学院中文及双语学系[J]. 公关世界 2020(12)
- [18].中英双语丛书《你好,福建》荣获中宣部地方优秀外宣作品一等奖[J]. 福州大学学报(哲学社会科学版) 2020(03)
- [19].嫩江流域少数民族基础教育双语教育研究[J]. 黑龙江民族丛刊 2020(01)
- [20].民族地区双语数字化学校资源平台的构建[J]. 延边教育学院学报 2020(02)
- [21].新时代民族地区要坚持依法稳妥推行双语教育——兼评《中国民族教育发展报告(2015—2018)·现实与前瞻:民族地区双语教育研究》[J]. 民族教育研究 2020(04)
- [22].卡明斯双语教育理论解析及其在中国语境中的再审视[J]. 民族教育研究 2020(04)
- [23].“一带一路”视域下发展少数民族地区双语教育的策略研究[J]. 科教文汇(中旬刊) 2020(07)
- [24].藏族地区双语类学校一体化办学存在的问题及对策[J]. 科学咨询(教育科研) 2020(09)
- [25].化工类少数民族双语生学业水平调查与提高对策——以新疆大学化学化工学院为例[J]. 广东化工 2020(17)
- [26].中英双语播音专业英语课程设置及教学的定位与思考[J]. 科教导刊(上旬刊) 2020(08)
- [27].延边州双语教育现状分析与对策研究[J]. 现代交际 2020(16)
- [28].新中国少数民族双语教育的主要实践和历史经验[J]. 公关世界 2020(20)
- [29].高校双语混合式教学法的“三大瓶颈”及其对策[J]. 产业与科技论坛 2019(19)
- [30].我国少数民族实现双语的两大指标[J]. 贵州民族研究 2017(12)