《電子技術應用》
您所在的位置:首頁 > 模拟设计 > 设计应用 > 基于X-Linear和语义嵌入的视频描述算法
基于X-Linear和语义嵌入的视频描述算法
信息技术与网络安全
李亚杰,关胜晓,倪长好
(中国科学技术大学 微电子学院,安徽 合肥230026)
摘要: 注意力机制和视频语义嵌入使得视频描述任务取得了显著的提升,为更好地利用时序动态特征和语义信息,提出一种基于X-Linear的语义嵌入视频描述算法(X-Linear Semantic Embedding Network,XLSNet)。该算法以基于编码解码器网络为基础,使用X-Linear注意力模块对视频特征进行编码,该模块使用双线性池化来增加视频时序特征的高阶交互,最终提取丰富的时序动态特征;为充分利用视频语义信息,使用语义嵌入的GRU和X-Linear作为解码器对视频描述进行生成。为防止过拟合现象,对解码器的GRU使用了层归一化和变分Dropout。所提出的算法仅仅使用了视频帧特征,在公开视频描述数据集MSVD上取得了很好的效果。
中圖分類號: TP183
文獻標識碼: A
DOI: 10.19358/j.issn.2096-5133.2021.02.008
引用格式: 李亞杰,關勝曉,倪長好. 基于X-Linear和語義嵌入的視頻描述算法[J].信息技術與網絡安全,2021,40(2):45-51.
Video caption algorithm based on X-Linear and semantic embedding
Li Yajie,Guan Shengxiao,Ni Changhao
(School of Microelectronics,University of Science and Technology of China,Hefei 230026,China)
Abstract: The attention mechanism and video semantic embedding have significantly improved the video description task.In order to make better use of the temporal dynamic features and semantic information of the video,a X-Linear-based semantic embedding video description algorithm(X-Linear Semantic Embedding Network,XLSNet) is proposed. The algorithm is based on a encoder-decoder network and uses the X-Linear attention block to encode video features. This block uses bilinear pooling to increase the high-order interaction of video temporal features, and finally extracts rich temporal dynamic features. In order to make full use of video semantic information, semantically embedded GRU and X-Linear are used as decoders to generate video descriptions. To prevent over-fitting, layer normalization and variational Dropout are used for the GRU of the decoder.The proposed algorithm only uses video frame features, and has achieved good results on the public video description data set MSVD.
Key words : video caption;semantic embedding;X-Linear attention;XLSNet

0 引言

         視頻描述任務是將計算機視覺信息轉換為人類能夠理解的自然語言句子的描述。將計算機視覺內容理解和自然語言處理兩個領域相結合用于解決視頻描述是一項極具挑戰性的任務。視頻描述涉及對許多實體的理解,這些實體包括場景、人物、物體、人的動作、人與物體的交互、人與人的交互、其他事件以及事件發生的順序等。所有這些信息必須使用自然語言處理(Natural Language Processing,NLP)技術,以一種可壓縮的、語法正確的文本表達出來。視頻描述任務可以應用于很多領域,如智能安防、盲人導航、視頻檢索、人機交互等。




本文詳細內容請下載:http://m.tom3567.com/resource/share/2000003378




作者信息:

李亞杰,關勝曉,倪長好

(中國科學技術大學 微電子學院,安徽 合肥230026)

此內容為AET網站原創,未經授權禁止轉載。
主站蜘蛛池模板: 久久日韩精品| 国产精品美女久久久免费| 欧美日韩福利在线观看| 久久精品久久久久| 日韩人妻一区二区三区蜜桃视频 | 亚洲国产精品女人| 久久99精品久久久久久水蜜桃| 色综合久久久久久久久五月 | 国产精品视频地址| 欧美在线日韩在线| 天天摸天天碰天天添| 亚洲专区国产精品| 亚洲欧美日韩在线综合| 在线天堂一区av电影| 91久久久在线| 亚洲成人午夜在线| 91精品国产91久久久久久久久| 国产精品久久久久久久7电影| 久久99精品国产一区二区三区 | 免费国产成人av| 久久在线免费观看视频| 欧美日韩第二页| 欧美日本精品在线| 久久久久国产精品免费| 久久综合久久网| 久久国产乱子伦免费精品| 久久精品夜夜夜夜夜久久| 久久99精品久久久久久水蜜桃 | 久久99精品国产99久久| 久久久久久久久久久久久久久久久久av| 日本高清视频一区二区三区| 日本一区二区高清视频| 欧美中日韩免费视频| 热久久这里只有精品| 热99久久精品| 久久在精品线影院精品国产| 国模吧一区二区| 国产精品免费小视频| 国产成人精品999| 真实国产乱子伦对白视频| 日韩网址在线观看|