《電子技術(shù)應(yīng)用》
您所在的位置:首頁(yè) > 其他 > 设计应用 > 基于分层信息过滤的生成式文本摘要模型
基于分层信息过滤的生成式文本摘要模型
信息技术与网络安全
符升旗,李金龙
(中国科学技术大学 计算机科学与技术学院,安徽 合肥230026)
摘要: 文本摘要模型的输入数据中通常包含被视为噪声的冗余信息,对输入数据中的噪声进行过滤可以提高摘要模型的表现。提出了基于动态路由指导的分层信息过滤(Dynamic Routing Based Hierarchical Information Filtering,DRBHIF)层,该层首先通过动态路由模块根据编码器的输出动态地计算全局向量,然后根据全局向量从词层面和语义层面对输入文本中的噪声进行过滤。具体来说,首先通过全局向量和编码器的输出从词层面上对原文中的关键字进行选择,然后通过双门语义噪声过滤算法在语义层面上进行噪声过滤。在Gigaword和CNN/Daily Mail两个数据集上的实验结果表明,DRBHIF能够有效地对输入文本中的噪声进行过滤,并且能提升摘要模型的表现。
關(guān)鍵詞: 自然語(yǔ)言處理,自動(dòng)文本摘要,噪聲過(guò)濾
中圖分類號(hào): TP391.1
文獻(xiàn)標(biāo)識(shí)碼: A
DOI: 10.19358/j.issn.2096-5133.2021.05.011
引用格式: 符升旗,李金龍. 基于分層信息過(guò)濾的生成式文本摘要模型[J].信息技術(shù)與網(wǎng)絡(luò)安全,2021,40(5):62-67.
Dynamic routing based hierarchical information filtering for abstractive text summarization
Fu Shengqi,Li Jinlong
(School of Computer Science and Technology,University of Science and Technology of China,Hefei 230026,China)
Abstract: The input data of a text summarization model usually contains redundant information that is regarded as noise, and filtering the noise in the input data can improve the performance of the summarization model. In this paper, a Dynamic Routing Based Hierarchical Information Filtering(DRBHIF) layer is proposed, which first dynamically computes a global vector based on the output of the encoder through the dynamic routing module, and then filters the noise in the input text at the word level and semantic level based on the global vector. Specifically, keywords in the original text are first selected at the word level using the global vector and the encoder output, and then noise is filtered at the semantic level using a two-gate semantic noise filtering algorithm. Experimental results on both Gigaword and CNN/Daily Mail datasets show that DRBHIF is effective in filtering noise in the input text and can improve the performance of the summarization model.
Key words : natural language processing;automatic text summarization;noise filtering

0 引言

自動(dòng)文本摘要模型旨在提取出原文中的關(guān)鍵信息并生成摘要。對(duì)自動(dòng)文本摘要的研究可以分為兩大類:抽取式文本摘要和生成式文本摘要。抽取式文本摘要直接從原文中抽取出一些句子組成摘要,而生成式文本摘要首先構(gòu)建一個(gè)模型對(duì)原文中的信息進(jìn)行理解,然后根據(jù)對(duì)原文的理解以模擬人類的方式輸出摘要。本文主要關(guān)注生成式文本摘要模型。

目前,生成式文本摘要模型主要基于序列到序列(sequence-to-sequence,seq2seq)模型構(gòu)建[1-2]。seq2seq模型包含一個(gè)編碼器和一個(gè)解碼器。編碼器對(duì)輸入的原文進(jìn)行編碼得到文本表示,解碼器對(duì)編碼器的輸出進(jìn)行解碼生成摘要。在實(shí)際中,輸入文本通常包含冗余信息,即噪聲[3],而seq2seq模型會(huì)將輸入文本的所有信息進(jìn)行編碼,包括噪聲,這會(huì)導(dǎo)致最終生成的摘要不能很好地體現(xiàn)原文中的關(guān)鍵信息[4]。最近的一些研究[4-5]表明,對(duì)輸入文本中的噪聲進(jìn)行過(guò)濾能提高摘要模型的表現(xiàn)。




本文詳細(xì)內(nèi)容請(qǐng)下載:http://m.tom3567.com/resource/share/2000003553




作者信息:

符升旗,李金龍

(中國(guó)科學(xué)技術(shù)大學(xué) 計(jì)算機(jī)科學(xué)與技術(shù)學(xué)院,安徽 合肥230026)


此內(nèi)容為AET網(wǎng)站原創(chuàng),未經(jīng)授權(quán)禁止轉(zhuǎn)載。
主站蜘蛛池模板: 中文字幕精品在线播放| 日本一区二区三区视频在线播放| 成人精品一区二区三区电影免费 | 国产免费亚洲高清| 国产精品麻豆va在线播放| www.日本久久久久com.| 91免费精品视频| 日本久久久精品视频| 久久久久久久久久久国产| 国产精品日韩在线| 在线播放 亚洲| 欧美一区二区视频在线播放| 久久精品国产欧美激情| 国产精品福利在线观看网址| 亚洲爆乳无码专区| 久久超碰亚洲| 日韩中文字幕国产| 欧美激情中文字幕在线| 免费看成人午夜电影| 国产精品久久久久久久av大片| 亚洲午夜精品一区二区三区| 欧日韩不卡在线视频| 国产在线观看不卡| 日韩人妻精品一区二区三区| 久久精品99| 天天爱天天做天天操| 国产精品久久久久久av福利 | 亚洲精品蜜桃久久久久久| 久久亚洲国产精品| 亚洲一卡二卡| 国产精品com| 国产精品久久999| 青青青在线观看视频| 97久久国产亚洲精品超碰热| 欧美大香线蕉线伊人久久| 一区二区三区在线观看www| 国产精品一区二区三区免费观看| 欧美精品aaa| 久久人人爽国产| 热久久99这里有精品| 亚洲伊人婷婷|