《電子技術(shù)應(yīng)用》
您所在的位置:首頁 > 人工智能 > 设计应用 > 融入翻译记忆库的法律领域神经机器翻译方法*
融入翻译记忆库的法律领域神经机器翻译方法*
电子技术应用
曾文颢1,2,张勇丙1,2,余正涛1,2,赖华1,2
(1.昆明理工大学 信息工程与自动化学院,云南 昆明 650500; 2.昆明理工大学 云南省人工智能重点实验室,云南 昆明 650500)
摘要: 面向法律领域的神经机器翻译对于合同文本翻译等应用场景具有重要价值。由于法律领域双语对齐语料稀缺,翻译效果还不理想。针对该问题,目前有效的方法是融入翻译记忆或翻译模版等外部信息,但法律领域的文本多具有固定的表达结构且用词准确规范,在翻译记忆库中同时利用翻译结构信息和语义信息能够进一步提升法律领域翻译性能。基于此,提出一种融入翻译记忆库的法律领域机器翻译方法。提出了一种新的法律领域翻译记忆库,首先基于语义和结构信息的相似性训练跨语言检索模型以充分利用单语数据,然后从翻译记忆库中检索与输入源句相关的一组翻译记忆和翻译模版,进而引导翻译模型生成目标句子。实验表明,在MHLAW数据集上,提出的方法可以使译文较基线模型提升1.28个BLEU点。
中圖分類號:TP391 文獻標志碼:A DOI: 10.16157/j.issn.0258-7998.233887
中文引用格式: 曾文顥,張勇丙,余正濤,等. 融入翻譯記憶庫的法律領(lǐng)域神經(jīng)機器翻譯方法[J]. 電子技術(shù)應(yīng)用,2023,49(9):39-45.
英文引用格式: Zeng Wenhao,Zhang Yongbing,Yu Zhengtao,et al. Legal neural machine translation based on translation memory[J]. Application of Electronic Technique,2023,49(9):39-45.
Legal neural machine translation based on translation memory
Zeng Wenhao1,2,Zhang Yongbing1,2,Yu Zhengtao1,2,Lai Hua1,2
(1.Faculty of Information Engineering and Automation,Kunming University of Science and Technology,Kunming 650500,China; 2.Yunnan Key Laboratory of Artificial Intelligence,Kunming University of Science and Technology,Kunming 650500,China)
Abstract: Neural machine translation for the legal domain is of great value for application scenarios such as contract text translation. Due to the scarcity of bilingual corpora in the legal domain, the machine translation performance is still not satisfactory. A practical method to address this problem is to integrate prior knowledge such as translation memory(TM) or templates. However, texts in the legal domain mostly have fixed expression structures and precise wording specifications. The performance of translation in the legal field can be further improved by using both sentence structure information and semantic information in the translation memory. Based on this, this paper proposes a new framework that uses monolingual TM and performs learnable memory retrieval in a cross-language manner. Firstly, this monolingual translation memories contain translation memory and translation template, which can provide richer external knowledge to the model. Secondly, the retrieval model and the translation model can be jointly optimized. Experiments on the MHLAW dataset show that this model surpasses baseline models up to 1.28 BLEU points.
Key words : neural machine translation;semantic information;structure information;translation memory;translation template

0 引言

近年來,隨著深度學(xué)習(xí)的發(fā)展,神經(jīng)機器翻譯(NMT)在大量翻譯任務(wù)上取得了巨大成功[1],面向法律領(lǐng)域的機器翻譯也得到了領(lǐng)域內(nèi)學(xué)者的大量關(guān)注。法律領(lǐng)域機器翻譯在法律條款、合同文本和涉外公證文書等實際場景中也具有重要的應(yīng)用價值。

目前融入外部信息是提升特定領(lǐng)域機器翻譯的有效途徑[2-5]。相較于傳統(tǒng)的生成模型,引入外部信息可以讓模型獲得訓(xùn)練數(shù)據(jù)中沒有的附加信息,降低文本生成的難度,減少對訓(xùn)練數(shù)據(jù)的依賴。現(xiàn)有的融入外部信息的方法主要分為三類:基于雙語詞典、基于翻譯記憶和基于翻譯模版

基于雙語詞典的方法[6]用于解決低頻詞和術(shù)語翻譯等問題,利用雙語詞典作為外部資源輸入神經(jīng)網(wǎng)絡(luò)結(jié)構(gòu)。Arthur等人[7]提出一種通過使用離散詞典來增強神經(jīng)機器翻譯系統(tǒng)的方法,以解決低頻次翻譯錯誤問題,這些詞典可以有效地編碼這些低頻單詞的翻譯。



本文詳細內(nèi)容請下載:http://m.tom3567.com/resource/share/2000005635




作者信息:

曾文顥1,2,張勇丙1,2,余正濤1,2,賴華1,2

(1.昆明理工大學(xué) 信息工程與自動化學(xué)院,云南 昆明 650500;2.昆明理工大學(xué) 云南省人工智能重點實驗室,云南 昆明 650500)


微信圖片_20210517164139.jpg

此內(nèi)容為AET網(wǎng)站原創(chuàng),未經(jīng)授權(quán)禁止轉(zhuǎn)載。
主站蜘蛛池模板: 欧美极品第一页| 国产成a人亚洲精v品在线观看| 色老头一区二区三区在线观看| 欧美中文在线视频| 亚洲午夜精品一区二区三区| 欧洲久久久久久| 亚洲精品蜜桃久久久久久| 国产精品福利在线观看| 精品无码久久久久久久动漫| 欧美日韩国产第一页| 亚洲精品无码久久久久久| 国产精品视频午夜| 久久久国产精彩视频美女艺术照福利| 午夜免费电影一区在线观看| 99精品视频在线看| 国产精品美女免费看| 国语自产精品视频在免费| 久久中文字幕在线视频V| 日本不卡一区二区三区在线观看| 91精品国产成人| 国产精品自拍小视频| 久久精品视频91| 久久精品久久精品亚洲人| 欧美日韩电影在线观看| 欧美一区二视频在线免费观看| 日本精品久久久久久久久久| 婷婷四房综合激情五月| 日韩视频在线免费观看| 日韩欧美亚洲日产国产| 日韩精品 欧美| 欧美激情第6页V| 欧美精品一区三区在线观看| 久久综合婷婷综合| 久久国产精品久久国产精品| 久久99久久99精品免观看粉嫩| 欧日韩一区二区三区| 欧美精品亚洲| 国产乱子伦精品视频| 国产精品丝袜一区二区三区| 国产精品久久久久高潮| 成人国产精品久久久久久亚洲|