CN110413774A - 一种基于遗传算法的信息分类方法 - Google Patents

一种基于遗传算法的信息分类方法 Download PDF

Info

Publication number
CN110413774A
CN110413774A CN201910542356.0A CN201910542356A CN110413774A CN 110413774 A CN110413774 A CN 110413774A CN 201910542356 A CN201910542356 A CN 201910542356A CN 110413774 A CN110413774 A CN 110413774A
Authority
CN
China
Prior art keywords
information
feature words
classification
key word
genetic algorithm
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
CN201910542356.0A
Other languages
English (en)
Inventor
肖清林
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Central Mdt Infotech Ltd Of United States Of Xiamen
Original Assignee
Central Mdt Infotech Ltd Of United States Of Xiamen
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Central Mdt Infotech Ltd Of United States Of Xiamen filed Critical Central Mdt Infotech Ltd Of United States Of Xiamen
Priority to CN201910542356.0A priority Critical patent/CN110413774A/zh
Publication of CN110413774A publication Critical patent/CN110413774A/zh
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/30Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
    • G06F16/35Clustering; Classification
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/12Computing arrangements based on biological models using genetic models
    • G06N3/126Evolutionary algorithms, e.g. genetic algorithms or genetic programming
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06QINFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR ADMINISTRATIVE, COMMERCIAL, FINANCIAL, MANAGERIAL OR SUPERVISORY PURPOSES; SYSTEMS OR METHODS SPECIALLY ADAPTED FOR ADMINISTRATIVE, COMMERCIAL, FINANCIAL, MANAGERIAL OR SUPERVISORY PURPOSES, NOT OTHERWISE PROVIDED FOR
    • G06Q50/00Systems or methods specially adapted for specific business sectors, e.g. utilities or tourism
    • G06Q50/10Services
    • G06Q50/26Government or public services

Abstract

本发明提供了一种基于遗传算法的信息分类方法,包括以下步骤:获取待分类信息;根据遗传算法训练信息分类模型,从所述待分类信息中提取关键词信息集,所述关键词信息集包括至少一个关键词信息;根据所述关键词信息集,以及预设的关键词信息集与类别信息的对应关系,匹配所述关键词信息集对应的类别信息;根据匹配出的类别信息对所述待分类信息进行分类。本发明提出一种基于遗传算法的信息分类方法,极大地提高了分类处理的效率,缩短了分析的周期。

Description

一种基于遗传算法的信息分类方法
技术领域
本发明涉及信息分类领域,尤其涉及一种基于遗传算法的信息分类方法。
背景技术
随着信息分类技术的发展,单位的信息处理部门,每天都会接收或者积累海量的信息,在一些情况下,需要从该信息中提取某一类别的信息,但是由于这些信息与类别之间并没有建立直接的对应关系,因此,无法直接用搜索引擎检索进行提取。现有的对信息归类的的方法通常是采用人工的方式进行逐条分析,这样会花费不少的人力人工。而同时随着交互信息数量的不断增加,或者每天相关工作的不断累积增加,这时,若再需要在相同的时间内将这些信息高质量地处理完,则需要提高工作人员的处理速度或者投入更多的人力资源,但是当前采用人力的方式是很难做到效率和质量的同等的要求,因为这种通过人为智慧来分类,并不能保证每个工作人员对信息的类别都有相同的认知,使得在分类时对于信息的查全率也会有一定程度的差异,导致分类的准确率较低。
发明内容
(一)发明目的
为解决背景技术中存在的技术问题,本发明提出一种基于遗传算法的信息分类方法,极大地提高了分类处理的效率,缩短了分析的周期。
(二)技术方案
为解决上述问题,本发明提供了一种基于遗传算法的信息分类方法,包括以下步骤:
S1、获取待分类信息;
S2、根据遗传算法训练信息分类模型,从所述待分类信息中提取关键词信息集,所述关键词信息集包括至少一个关键词信息;
S3、根据所述关键词信息集,以及预设的关键词信息集与类别信息的对应关系,匹配所述关键词信息集对应的类别信息;
S4、根据匹配出的类别信息对所述待分类信息进行分类。
优选的,所述预设的关键词信息集与类别信息的对应关系:
对预先获取到的多个关键词信息进行分类,并提取分类后各类别中的关键词信息,组成所述关键词信息集;
将从同一个类别的信息中提取出的关键词信息集与类别信息之间建立对应关系。
优选的,通过计算训练集合中各候选词的词频-逆文档频率和互信息,筛选出若干特征词;基于各所述特征词,根据遗传算法训练信息分类模型。
优选的,所述通过计算训练文本集合中各候选词的词频-逆文档频率和互信息,筛选出若干特征词包括:
根据所述词频-逆文档频率和所述互信息计算各所述候选词的特征值,所述特征值大于预设特征值的相应候选词将作为特征词。
优选的,根据遗传算法训练信息分类模型包括:
根据各所述特征词生成若干特征词样本;
采用所述训练集和所述特征词样本构建分类模型;
采用所述训练集和验证集计算各所述特征词样本的适应度,根据各所述适应度,通过遗传算法对各所述特征词样本进行迭代训练,生成最优的信息分类模型。
优选的,采用所述训练集和验证集计算各所述特征词样本的适应度,根据各所述适应度,通过遗传算法对各所述特征词样本进行迭代训练,生成最优的信息分类模型:
S21、将包含各所述特征词样本的群体作为第一代群体,利用所述验证集和所述训练集,分别计算各所述特征词样本的适应度;
S22、根据与所述适应度成正比的概率,确定父母本,所述父母本经交叉、变异生成各子代样本;
S23、用各所述子代样本替换适应度小于第二设定值的特征词样本,并生成第二代群体;
S24、根据每一代群体的适应度平均值,计算总体标准偏差d,所述总体标准偏差d与偏差设定值比较,当小于所述偏差设定值时,停止迭代,将最终生成的群体中适应度最大的特征词样本的分类模型作为最优分类模型输出,否则重复上述步骤的迭代,d的计算公式如下:
其中,fi为一代群体的适应度的平均值,u为m代全部群体适应度的均值, m为当前迭代次数。
本发明的上述技术方案具有如下有益的技术效果:通过计算训练文本集合中各候选词的词频-逆文档频率和互信息,筛选出若干特征词,能够解决现有技术筛选的特征词准确率低下问题;进一步的,采用训练集和验证集计算各特征词样本的适应度,根据各适应度,通过遗传算法对各特征词样本进行迭代训练,生成最优的信息分类模型,能解决现有技术的分类模型的人工干预过多的问题,获得高效的分类模型训练效果;根据所述关键词信息集,以及预设的关键词信息集与类别信息的对应关系,匹配所述关键词信息集对应的类别信息,从而实现了对待分类信息的自动识别匹配,该种匹配方式只需要进行系统自动的匹配即可,极大地提高了分类处理的效率,缩短了分析的周期,并通过与固定对应关系的样本关键词信息集进行匹配的方式进行分类,降低了人工分配的误差,提高了匹配的准确度。
附图说明
图1为本发明提出的一种基于遗传算法的信息分类方法的流程示意图。
图2为本发明提出的一种基于遗传算法的信息分类方法中的生成最优的信息分类模型的流程示意图。
具体实施方式
为使本发明的目的、技术方案和优点更加清楚明了,下面结合具体实施方式并参照附图,对本发明进一步详细说明。应该理解,这些描述只是示例性的,而并非要限制本发明的范围。此外,在以下说明中,省略了对公知结构和技术的描述,以避免不必要地混淆本发明的概念。
如图1和2所示,本发明提出的一种基于遗传算法的信息分类方法,包括以下步骤:
S1、获取待分类信息;
S2、根据遗传算法训练信息分类模型,从所述待分类信息中提取关键词信息集,所述关键词信息集包括至少一个关键词信息;
S3、根据所述关键词信息集,以及预设的关键词信息集与类别信息的对应关系,匹配所述关键词信息集对应的类别信息;
S4、根据匹配出的类别信息对所述待分类信息进行分类。
在一个可选的实施例中,所述预设的关键词信息集与类别信息的对应关系:
对预先获取到的多个关键词信息进行分类,并提取分类后各类别中的关键词信息,组成所述关键词信息集;
将从同一个类别的信息中提取出的关键词信息集与类别信息之间建立对应关系。
在一个可选的实施例中,通过计算训练集合中各候选词的词频-逆文档频率和互信息,筛选出若干特征词;基于各所述特征词,根据遗传算法训练信息分类模型。
在一个可选的实施例中,所述通过计算训练文本集合中各候选词的词频-逆文档频率和互信息,筛选出若干特征词包括:
根据所述词频-逆文档频率和所述互信息计算各所述候选词的特征值,所述特征值大于预设特征值的相应候选词将作为特征词。
在一个可选的实施例中,根据遗传算法训练信息分类模型包括:
根据各所述特征词生成若干特征词样本;
采用所述训练集和所述特征词样本构建分类模型;
采用所述训练集和验证集计算各所述特征词样本的适应度,根据各所述适应度,通过遗传算法对各所述特征词样本进行迭代训练,生成最优的信息分类模型。
在一个可选的实施例中,采用所述训练集和验证集计算各所述特征词样本的适应度,根据各所述适应度,通过遗传算法对各所述特征词样本进行迭代训练,生成最优的信息分类模型:
S21、将包含各所述特征词样本的群体作为第一代群体,利用所述验证集和所述训练集,分别计算各所述特征词样本的适应度;
S22、根据与所述适应度成正比的概率,确定父母本,所述父母本经交叉、变异生成各子代样本;
S23、用各所述子代样本替换适应度小于第二设定值的特征词样本,并生成第二代群体;
S24、根据每一代群体的适应度平均值,计算总体标准偏差d,所述总体标准偏差d与偏差设定值比较,当小于所述偏差设定值时,停止迭代,将最终生成的群体中适应度最大的特征词样本的分类模型作为最优分类模型输出,否则重复上述步骤的迭代,d的计算公式如下:
其中,fi为一代群体的适应度的平均值,u为m代全部群体适应度的均值, m为当前迭代次数。
本发明中,通过计算训练文本集合中各候选词的词频-逆文档频率和互信息,筛选出若干特征词,能够解决现有技术筛选的特征词准确率低下问题。进一步的,采用训练集和验证集计算各特征词样本的适应度,根据各适应度,通过遗传算法对各特征词样本进行迭代训练,生成最优的信息分类模型,能解决现有技术的分类模型的人工干预过多的问题,获得高效的分类模型训练效果;根据所述关键词信息集,以及预设的关键词信息集与类别信息的对应关系,匹配所述关键词信息集对应的类别信息,从而实现了对待分类信息的自动识别匹配,该种匹配方式只需要进行系统自动的匹配即可,极大地提高了分类处理的效率,缩短了分析的周期,并通过与固定对应关系的样本关键词信息集进行匹配的方式进行分类,降低了人工分配的误差,提高了匹配的准确度。
应当理解的是,本发明的上述具体实施方式仅仅用于示例性说明或解释本发明的原理,而不构成对本发明的限制。因此,在不偏离本发明的精神和范围的情况下所做的任何修改、等同替换、改进等,均应包含在本发明的保护范围之内。此外,本发明所附权利要求旨在涵盖落入所附权利要求范围和边界、或者这种范围和边界的等同形式内的全部变化和修改例。

Claims (6)

1.一种基于遗传算法的信息分类方法,其特征在于,包括以下步骤:
S1、获取待分类信息;
S2、根据遗传算法训练信息分类模型,从所述待分类信息中提取关键词信息集,所述关键词信息集包括至少一个关键词信息;
S3、根据所述关键词信息集,以及预设的关键词信息集与类别信息的对应关系,匹配所述关键词信息集对应的类别信息;
S4、根据匹配出的类别信息对所述待分类信息进行分类。
2.根据权利要求1所述的一种基于遗传算法的信息分类方法,其特征在于,所述预设的关键词信息集与类别信息的对应关系:
对预先获取到的多个关键词信息进行分类,并提取分类后各类别中的关键词信息,组成所述关键词信息集;
将从同一个类别的信息中提取出的关键词信息集与类别信息之间建立对应关系。
3.根据权利要求1所述的一种基于遗传算法的信息分类方法,其特征在于,通过计算训练集合中各候选词的词频-逆文档频率和互信息,筛选出若干特征词;基于各所述特征词,根据遗传算法训练信息分类模型。
4.根据权利要求1所述的一种基于遗传算法的信息分类方法,其特征在于,所述通过计算训练文本集合中各候选词的词频-逆文档频率和互信息,筛选出若干特征词包括:
根据所述词频-逆文档频率和所述互信息计算各所述候选词的特征值,所述特征值大于预设特征值的相应候选词将作为特征词。
5.根据权利要求1所述的一种基于遗传算法的信息分类方法,其特征在于,根据遗传算法训练信息分类模型包括:
根据各所述特征词生成若干特征词样本;
采用所述训练集和所述特征词样本构建分类模型;
采用所述训练集和验证集计算各所述特征词样本的适应度,根据各所述适应度,通过遗传算法对各所述特征词样本进行迭代训练,生成最优的信息分类模型。
6.根据权利要求1所述的一种基于遗传算法的信息分类方法,其特征在于,采用所述训练集和验证集计算各所述特征词样本的适应度,根据各所述适应度,通过遗传算法对各所述特征词样本进行迭代训练,生成最优的信息分类模型:
S21、将包含各所述特征词样本的群体作为第一代群体,利用所述验证集和所述训练集,分别计算各所述特征词样本的适应度;
S22、根据与所述适应度成正比的概率,确定父母本,所述父母本经交叉、变异生成各子代样本;
S23、用各所述子代样本替换适应度小于第二设定值的特征词样本,并生成第二代群体;
S24、根据每一代群体的适应度平均值,计算总体标准偏差d,所述总体标准偏差d与偏差设定值比较,当小于所述偏差设定值时,停止迭代,将最终生成的群体中适应度最大的特征词样本的分类模型作为最优分类模型输出,否则重复上述步骤的迭代,d的计算公式如下:
其中,fi为一代群体的适应度的平均值,u为m代全部群体适应度的均值,m为当前迭代次数。
CN201910542356.0A 2019-06-21 2019-06-21 一种基于遗传算法的信息分类方法 Pending CN110413774A (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN201910542356.0A CN110413774A (zh) 2019-06-21 2019-06-21 一种基于遗传算法的信息分类方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN201910542356.0A CN110413774A (zh) 2019-06-21 2019-06-21 一种基于遗传算法的信息分类方法

Publications (1)

Publication Number Publication Date
CN110413774A true CN110413774A (zh) 2019-11-05

Family

ID=68359503

Family Applications (1)

Application Number Title Priority Date Filing Date
CN201910542356.0A Pending CN110413774A (zh) 2019-06-21 2019-06-21 一种基于遗传算法的信息分类方法

Country Status (1)

Country Link
CN (1) CN110413774A (zh)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN111338683A (zh) * 2020-02-04 2020-06-26 北京邮电大学 一种算法类程序代码分类方法、装置、设备及介质
CN111523777A (zh) * 2020-04-09 2020-08-11 辽宁百思特达半导体科技有限公司 一种新型智慧城市系统及其应用方法

Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN107545038A (zh) * 2017-07-31 2018-01-05 中国农业大学 一种文本分类方法与设备
CN107590195A (zh) * 2017-08-14 2018-01-16 百度在线网络技术(北京)有限公司 文本分类模型训练方法、文本分类方法及其装置
CN107766371A (zh) * 2016-08-19 2018-03-06 中兴通讯股份有限公司 一种文本信息分类方法及其装置

Patent Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN107766371A (zh) * 2016-08-19 2018-03-06 中兴通讯股份有限公司 一种文本信息分类方法及其装置
CN107545038A (zh) * 2017-07-31 2018-01-05 中国农业大学 一种文本分类方法与设备
CN107590195A (zh) * 2017-08-14 2018-01-16 百度在线网络技术(北京)有限公司 文本分类模型训练方法、文本分类方法及其装置

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN111338683A (zh) * 2020-02-04 2020-06-26 北京邮电大学 一种算法类程序代码分类方法、装置、设备及介质
CN111523777A (zh) * 2020-04-09 2020-08-11 辽宁百思特达半导体科技有限公司 一种新型智慧城市系统及其应用方法

Similar Documents

Publication Publication Date Title
CN109271374B (zh) 一种基于机器学习的数据库健康度打分方法和打分系统
CN106909654B (zh) 一种基于新闻文本信息的多级分类系统及方法
CN108154134B (zh) 基于深度卷积神经网络的互联网直播色情图像检测方法
CN109952614B (zh) 生物粒子的分类系统和方法
CN108898479B (zh) 信用评价模型的构建方法及装置
CN104268599B (zh) 一种基于车辆轨迹时空特征分析的黑车智能发现方法
CN102346829A (zh) 基于集成分类的病毒检测方法
CN107480575A (zh) 模型的训练方法、跨年龄人脸识别方法和对应的装置
CN110069630B (zh) 一种改进的互信息特征选择方法
CN107818298A (zh) 用于机器学习物质识别算法的通用拉曼光谱特征提取方法
CN111186656A (zh) 一种目标垃圾分类方法及智能垃圾桶
CN110413774A (zh) 一种基于遗传算法的信息分类方法
CN106096413B (zh) 一种基于多特征融合的恶意代码检测方法及系统
CN108898225A (zh) 基于人机协同学习的数据标注方法
CN106202274B (zh) 一种基于贝叶斯网络的缺陷数据自动文摘分类方法
CN107368526A (zh) 一种数据处理方法及装置
CN109344907A (zh) 基于改进评判标准分类算法的判别方法
CN107194617A (zh) 一种app软件工程师软技能分类系统及方法
CN109166591A (zh) 一种基于音频特征信号的分类方法
CN110232415A (zh) 一种基于生物信息特征的列车转向架故障识别方法
CN116153495A (zh) 一种食管癌患者免疫治疗预后生存预测方法
CN110009005A (zh) 一种基于特征强相关的网络流量分类方法
CN109446964A (zh) 基于端到端单级多尺度检测器的面部检测分析方法及装置
CN109344248B (zh) 一种基于科技文献摘要聚类的学术主题生命周期分析方法
CN111666748B (zh) 一种自动化分类器的构造方法以及识别决策的方法

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination
RJ01 Rejection of invention patent application after publication

Application publication date: 20191105

RJ01 Rejection of invention patent application after publication