《電子技術(shù)應(yīng)用》
您所在的位置:首頁 > 其他 > 设计应用 > 改进的TF-IDF算法在文本分类中的研究
改进的TF-IDF算法在文本分类中的研究
信息技术与网络安全
张 伟1,2,石 倩1,何 霄1,王 晨1,李禾香1,李骥然1
(1.中国石油工程技术研究院有限公司 北京石油机械有限公司,北京102206; 2.中国人民大学 信息学院,北京100872)
摘要: 企业数字化建设过程中,对大量日常经营活动文本的数字化处理通常是多任务的,需要对文本数据同时完成信息抽取和文本分类任。在此应用场景下,为了实现更加精准的分类效果,提出一种改进的TF-IDF算法,将文本信息抽取结果也作为文本重要类别区分特征。通过引入信息增益方法得到改进的权重计算公式,进而得到改进的文本特征向量空间表示,再构建文本分类模型。实验以石油行业中文文本为例,选取测试文本2 006条进行文本分类对比实验,实验结果表明改进的TF-IDF算法精确率P达到99.3%,召回率R达到98.7%,相比于传统TF-IDF算法文本分类效果得到显著提高。
中圖分類號: TP391
文獻標識碼: A
DOI: 10.19358/j.issn.2096-5133.2021.07.012
引用格式: 張偉,石倩,何霄,等. 改進的TF-IDF算法在文本分類中的研究[J].信息技術(shù)與網(wǎng)絡(luò)安全,2021,40(7):72-76,83.
Research on improved TF-IDF algorithm in text classification
Zhang Wei1,2,Shi Qian1,He Xiao1,Wang Chen1,Li Hexiang1,Li Jiran1
(1.Beijing Petroleum Machinery Co.,Ltd.,China Petroleum Engineering Technology Research Institute, Beijing 102206,China; 2.School of Information,Renmin University of China,Beijing 100872,China)
Abstract: In the process of digital construction of enterprises, the digital processing of a large number of daily business activity texts of enterprises is usually multi-task, and it is necessary to complete information extraction tasks and text classification tasks for text data at the same time. In this application scenario, in order to achieve a more accurate text classification effect, this paper proposes an improved TF-IDF algorithm, which uses the text information extraction result as the distinguishing feature of important text categories, and introduces the information gain method to obtain an improved weight calculation formula. Then an improved text feature vector space representation is obtained, and then a text classification model is constructed. The experiment takes the Chinese text of the petroleum industry as an example, and selects 2 006 test texts for text classification comparison experiments. The experimental results show that the improved TF-IDF algorithm has an accuracy rate P of 99.99% and a recall rate R of 99.87%. The algorithm text classification effect has been significantly improved.
Key words : text classification;VSM;TF-IDF;petroleum;support vector machine

0 引言

TF-IDF算法結(jié)構(gòu)簡單,類別區(qū)分力強,且容易實現(xiàn),被廣泛應(yīng)用于信息檢索、文本挖掘、文本分類、信息抽取等領(lǐng)域中。但是,該算法僅考慮詞頻方面的因素,沒有考慮詞語出現(xiàn)的位置、詞性、樣本分布等信息,存在一定局限性。對此很多研究者都提出過改進算法,王小林在傳統(tǒng)TF-IDF算法基礎(chǔ)上,提出利用段落標注技術(shù),對處于不同位置的詞語給予不同的位置權(quán)重,并對分詞結(jié)果中詞頻較高的同詞性詞語進行相似度計算,合并相似度較高的詞語,改進傳統(tǒng)算法中忽視特征詞位置因素和語義對相似度的問題[1]。覃世安針對傳統(tǒng)TF-IDF算法在分類文本類的數(shù)量分布不均時提取特征值效果差的問題,提出使用特征值在類間出現(xiàn)的概率比代替特征值在類間出現(xiàn)次數(shù)的改進TF-IDF算法[2]。葉雪梅認為傳統(tǒng)的特征詞權(quán)重TF-IDF算法未考慮到網(wǎng)絡(luò)新詞,針對特征項中的新詞對分類結(jié)果的影響給予不同權(quán)重值,提出基于網(wǎng)絡(luò)新詞改進文本分類TF-IDF算法[3]。這些改進算法都有效提高了模型性能,優(yōu)化分類結(jié)果,取得了不錯的實驗效果。但以往改進算法研究主要集中在通過完善算法本身的缺陷以實現(xiàn)詞條在文本中更加準確的權(quán)重賦值,忽略了其他類別區(qū)分特征因子。



本文詳細內(nèi)容請下載:http://m.tom3567.com/resource/share/2000003681




作者信息:

張  偉1,2,石  倩1,何  霄1,王  晨1,李禾香1,李驥然1

(1.中國石油工程技術(shù)研究院有限公司 北京石油機械有限公司,北京102206;

2.中國人民大學 信息學院,北京100872)


此內(nèi)容為AET網(wǎng)站原創(chuàng),未經(jīng)授權(quán)禁止轉(zhuǎn)載。
主站蜘蛛池模板: 国产成a人亚洲精v品在线观看| 国产精品1234| 国产精品91在线| 国产精品入口免费| 日韩在线国产| 国产一区二区在线免费视频v| 97国产suv精品一区二区62| 欧美日韩福利在线观看| 久久97精品久久久久久久不卡| 日韩在线免费观看视频| 91精品国产高清久久久久久久久 | 国产精品视频在线免费观看| 五月婷婷综合色| 久久久久久国产精品久久| 国产精品裸体一区二区三区| 国产一区精品在线| 精品日本一区二区三区在线观看| 欧美日韩大片一区二区三区| 日韩国产精品一区二区三区| 国产精品美女网站| 国产精品极品在线| www.日日操| 91免费欧美精品| 99热一区二区三区| 亚洲最大福利网| 国产极品尤物在线| 不卡视频一区二区三区| 亚洲av综合色区| 午夜精品美女久久久久av福利| 亚洲熟妇无码一区二区三区| 亚洲a一级视频| 日韩中文字幕视频| 热草久综合在线| 欧美日韩精品久久久免费观看| 国产精品美女久久久久av福利| 99精品视频在线看| 三区精品视频观看| 日韩资源av在线| 欧美日韩一区二区三区免费| 视频一区亚洲| 久久视频在线观看中文字幕|