《電子技術應用》
您所在的位置:首頁 > 人工智能 > 设计应用 > 一种多教师模型知识蒸馏深度神经网络模型压缩算法
一种多教师模型知识蒸馏深度神经网络模型压缩算法
2023年电子技术应用第8期
顾明珠1,2,明瑞成2,邱创一1,2,王新文1,2
(1.福州大学 先进制造学院,福建 泉州 362000;2.中国科学院海西研究院泉州装备制造研究中心,福建 泉州 362000)
摘要: 为了能将庞大的深度学习模型压缩后部署到算力和存储能力有限的设备中时尽可能减小精度损失,对知识蒸馏模型压缩方法进行研究,提出了一种改进后带筛选的多教师模型知识蒸馏压缩算法。利用多教师模型的集成优势,以各教师模型的预测交叉熵为筛选的量化标准筛选出表现更好的教师模型对学生进行指导,并让学生模型从教师模型的特征层开始提取信息,同时让表现更好的教师模型在指导中更具有话语权。在CIFAR100数据集上的VGG13等分类模型实验结果表明,与其他压缩算法相比在最终得到的学生模型大小相同的情况下,精度上有着更好的表现。
中圖分類號:TP399 文獻標志碼:A DOI: 10.16157/j.issn.0258-7998.233812
中文引用格式: 顧明珠,明瑞成,邱創(chuàng)一,等. 一種多教師模型知識蒸餾深度神經網絡模型壓縮算法[J]. 電子技術應用,2023,49(8):7-12.
英文引用格式: Gu Mingzhu,Ming Ruicheng,Qiu Chuangyi,et al. A multi-teacher knowledge distillation model compression algorithm for deep neural network[J]. Application of Electronic Technique,2023,49(8):7-12.
A multi-teacher knowledge distillation model compression algorithm for deep neural network
Gu Mingzhu1,2,Ming Ruicheng2,Qiu Chuangyi1,2,Wang Xinwen1,2
(1.School of Advanced Manufacturing, Fuzhou University, Quanzhou 362000, China; 2.Quanzhou Institute of Equipment Manufacturing,Haixi Institutes Chinese Academy of Sciences,Quanzhou 362000, China)
Abstract: In order to minimize the accuracy loss when compressing huge deep learning models and deploying them to devices with limited computing power and storage capacity, a knowledge distillation model compression method is investigated and an improved multi-teacher model knowledge distillation compression algorithm with filtering is proposed. Taking advantage of the integration of multi-teacher models, the better-performing teacher models are screened for student instruction using the predicted cross-entropy of each teacher model as the quantitative criterion for screening, and the student models are allowed to extract information starting from the feature layer of the teacher models, while the better-performing teacher models are allowed to have more say in the instruction. The experimental results of classification models such as VGG13 on the CIFAR100 dataset show that the multi-teacher model compression method in this paper has better performance in terms of accuracy compared with other compression algorithms with the same size of the final obtained student models.
Key words : model compression;distillation of knowledge;multi-teacher model;cross entropy;feature layer

0 引言

隨著人工智能技術發(fā)展,要將越來越龐大的的模型部署到實際的工業(yè)社會中時,相應硬件的算力要求和存儲要求成為了最大障礙。因此,為加快人工智能技術在社會生活和工業(yè)的廣泛使用,越來越多的學者們對深度學習模型進行輕量化壓縮進行研究[1],而知識蒸餾方法已然成為比較主流的模型輕量化方法[2]。

知識蒸餾是指利用已經訓練好的大型深度學習模型輔助訓練出一個小型模型,其中大型模型稱為教師模型,起到監(jiān)督和輔助小型模型訓練的作用。小型模型稱為學生模型,接受來自教師模型的知識,并最終用于實際部署。2015年Hinton[3]首次提出了知識蒸餾這一概念以來,研究者們開始對壓縮后如何保證學生模型精度這一問題進行研究。知識蒸餾從教師模型規(guī)模分為單教師模型的蒸餾和多教師模型知識蒸餾兩類。單教師模型即只使用一個教師模型對學生模型進行蒸餾,如Romero[4]將學生模型的網絡設計成較細且層數較深的形狀,并且將學生模型和教師模型的特征層連接,讓學生模型從教師模型的特征層提層知識。Chen[5]等在蒸餾中加入GAN結構,模擬原始數據集擴大數據量提供給新的模型進行知識蒸餾。Liu[6]等人將NAS引入知識蒸餾,根據教師模型結構從NAS中選擇最契合的學生網絡與之匹配以達到最佳蒸餾效果,但NAS需要巨大內存使該方法難以大面積推廣。Dai[7]等提出利用教師模型和學生模型預測實例的差異,提出實例差異的評估指標,并利用可區(qū)分的實例進行蒸餾。知識蒸餾中學生網絡的知識大部分來源于教師模型,因此由單個教師模型知識蒸餾得到的學生模型精度上限受限于對應的教師模型,難以有很大提升。



本文詳細內容請下載:http://m.tom3567.com/resource/share/2000005484




作者信息:

顧明珠1,2,明瑞成2,邱創(chuàng)一1,2,王新文1,2

(1.福州大學 先進制造學院,福建 泉州 362000;2.中國科學院海西研究院泉州裝備制造研究中心,福建 泉州 362000)

微信圖片_20210517164139.jpg

此內容為AET網站原創(chuàng),未經授權禁止轉載。
主站蜘蛛池模板: 久久久国产精品一区| 国产精品对白刺激久久久| 日本国产欧美一区二区三区| 欧美亚洲另类制服自拍 | 久久人人爽人人爽爽久久| 国产精品夫妻激情| 国产欧美日韩中文| 久久亚洲国产精品日日av夜夜| 国产精品毛片va一区二区三区| 欧美日韩亚洲国产成人| 日韩在线视频观看正片免费网站 | 欧美日韩视频在线一区二区观看视频| 97色伦亚洲国产| 国产精品久久久999| 国产伦理久久久| 久久亚洲a v| 久久九九国产视频| 久久精品视频va| 久久精品网站视频| 精品国产中文字幕| 国产精品自产拍在线观看中文| 国产在线一区二区三区播放| 久久久精品视频在线观看| 久久久久久久免费| 久久九九免费视频| 国产日韩av高清| 国产精品久久久久福利| 国产精品一区二区性色av| 久久久久99精品久久久久| 久久久精品欧美| 美女在线免费视频| 久久精品国产理论片免费| 久久久久成人网| 国产美女网站在线观看| 国产精品吹潮在线观看| 91久久大香伊蕉在人线| 一区二区欧美日韩| 日韩欧美一区二区视频在线播放V| 欧美亚洲另类久久综合| 九九久久九九久久| 国产精品欧美日韩久久|