《電子技術應用》
您所在的位置:首頁 > 人工智能 > 设计应用 > 融合多教师模型的知识蒸馏文本分类
融合多教师模型的知识蒸馏文本分类
电子技术应用 11期
苑婧1,周杨1,胡校飞1,孙姝娅2,张呈龙1,刘龙辉1
(1.战略支援部队信息工程大学, 河南 郑州 450001;2.华北水利水电大学, 河南 郑州 450000)
摘要: 针对简单文本分类模型精度不高,预训练模型结构复杂,在实际环境中难以直接使用的问题,提出多教师知识蒸馏的文本分类方法。该模型使用“教师-学生网络”的训练方法,教师模型为BERT-wwm-ext和XLNet预训练模型,将两个模型输出的概率矩阵通过权重系数融合为软标签。学生模型为BiGRU-CNN网络,使用均方差函数计算软标签误差,使用交叉熵损失函数计算硬标签误差,通过硬标签和软标签训练学生模型使损失函数值达到最小。实验结果表明,提出的方法精度较学生模型有较大的改进,接近预训练模型,在保证分类精度的前提下减少了运行时间,提高了效率。
中圖分類號:TP301
文獻標志碼:A
DOI: 10.16157/j.issn.0258-7998.233869
引用格式: 苑婧,周楊,胡校飛,等. 融合多教師模型的知識蒸餾文本分類[J]. 電子技術應用,2023,49(11):42-48.
Integrated multi-teacher model for knowledge distillation text classification
Yuan Jing1,Zhou Yang1,Hu Xiaofei1,Sun Shuya2,Zhang Chenglong1,Liu Longhui1
(1.Strategic Support Force Information Engineering University, Zhengzhou 450001, China;2.North China University of Water Resources and Electric Power, Zhengzhou 450000, China)
Abstract: Aiming at the problems of low accuracy of simple text classification model, complex structure of pre-training model and difficult to be directly used in practical environment, this paper proposes a text classification method based on multi-teacher model knowledge distillation. This model uses the training method of "teacher-student network", and the teacher model is the BERT-wwm-ext and XLNet pre-training models. The probability matrix of the output of the two models is fused into soft labels by weight coefficient. The student model is BiGRU-CNN network. The mean square error function is used to calculate the soft label error, and the cross-entropy loss function is used to calculate the hard label error. The student model is trained by hard label and soft label to minimize the value of the loss function. The test results show that the accuracy of the proposed method have great improvement compared with the student model, and it is close to the pre-training model, which can save the running time and improve the efficiency on the premise of ensuring the classification accuracy.
Key words : text classification;knowledge distillation;BERT-wwm-ext;XLNet;BiGRU-CNN

【引言】

文本分類為輿情監控、廣告推送、挖掘社交媒體用戶的時空行為、追蹤敏感信息發揮了重要作用,其主要任務是根據文本內容或主題自動識別其所屬類別。目前文本分類主要有機器學習[1]、深度學習[2]和預訓練模型,其中預訓練模型分類準確率最高。

深度學習模型通過捕捉文本的上下文特征完成文本分類任務,包括卷積神經網絡(Convolutional Neural Network,CNN)[3]、循環神經網絡(Recurrent Neural Network,RNN)[4]、長短期記憶網絡(Long and Short Term Memory,LSTM)[5]、門控循環單元(Gated Recurrent Unit GRU)[6]等。結合不同的模型可以有效提高模型的性能,例如Sandhya結合長LSTM和RNN對文本文檔進行特征提取[7],陳可嘉[8]使用BiGRU-CNN模型結合自注意力機制進行文本分類,均全面提取了文本的局部和整體特征,提高了模型的準確性。

預訓練文本分類模型模型使用大量無標注語料,在多個自然語言處理任務中有著良好的效果[9],包括Bert[10]、ELMo[11]、XLNet[12]等。翟劍峰使用Bert模型用于用戶畫像[13],王浩暢使用ELMo模型用于機器翻譯[14],李東金使用XLNet模型用于情感分析[15]。但是預訓練模型參數量大、結構復雜、運行時間長,在實際生產環境直接使用難度較大,因此需在保證準確率的前提下對模型進行壓縮。

合理的模型壓縮可以在保證準確率的前提下有效降低模型參數量和內存以提高實際應用的時間效率[16],常見的模型壓縮方法包括網絡剪枝[17]、參數量化、知識蒸餾[18]等。葉榕使用知識蒸餾的方法結合Bert和CNN模型用于新聞文本分類[19],楊澤使用知識蒸餾的方法改進網絡問答系統[20],都在不影響準確率的前提下,大大縮短了運行時間。

本文提出了一種多教師模型知識蒸餾的方法,在不顯著降低性能的前提下,減小模型了的復雜度。結合預訓練模型XLNet和BERT-wwm-ext輸出的概率分布融合作為軟標簽,在訓練過程中指導學生模型BiGRU-CNN網絡,提高了模型的泛化能力。


文章詳細內容下載請點擊:融合多教師模型的知識蒸餾文本分類AET-電子技術應用-最豐富的電子設計資源平臺 (chinaaet.com)


【作者信息】

苑婧1,周楊1,胡校飛1,孫姝婭2,張呈龍1,劉龍輝1

(1.戰略支援部隊信息工程大學, 河南 鄭州 450001;2.華北水利水電大學, 河南 鄭州 450000)




此內容為AET網站原創,未經授權禁止轉載。
主站蜘蛛池模板: 亚洲综合色av| 97欧美精品一区二区三区| 久久久精品美女| 色综合久久88| 色婷婷成人综合| 99久久99久久精品国产片| 国产在线欧美日韩| 精品中文字幕乱| 91免费精品视频| 福利视频久久| 久久久久久69| 国产精品大片wwwwww| 亚洲国产欧美一区二区三区不卡| 日韩免费av片在线观看| 中文字幕精品一区日韩| 欧美亚洲另类在线| 国产精品一区二区3区| 精品视频一区在线| 欧美亚洲视频在线看网址| 日韩在线一级片| 亚洲av综合色区| 国产精品777| 日韩视频永久免费观看| 亚洲欧洲精品一区二区三区波多野1战4| 久久精品网站视频| 亚洲午夜久久久影院伊人| www黄色在线| 114国产精品久久免费观看| 91精品国产亚洲| 亚洲 国产 欧美一区| 亚洲 中文字幕 日韩 无码| 日韩有码在线视频| 日韩av高清不卡| 日本国产欧美一区二区三区| 国产日韩一区欧美| 国产欧美日韩中文字幕| 国产精品国产亚洲伊人久久 | 国产美女搞久久| 欧美成人免费在线观看| 国产精品免费小视频| 国产精品久久久91|