CN106295708B - 一种基于Fisher分类器组的连续型数据预处理方法 - Google Patents

一种基于Fisher分类器组的连续型数据预处理方法 Download PDF

Info

Publication number
CN106295708B
CN106295708B CN201610686502.3A CN201610686502A CN106295708B CN 106295708 B CN106295708 B CN 106295708B CN 201610686502 A CN201610686502 A CN 201610686502A CN 106295708 B CN106295708 B CN 106295708B
Authority
CN
China
Prior art keywords
fisher
training
samples
classifier group
sample
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
CN201610686502.3A
Other languages
English (en)
Other versions
CN106295708A (zh
Inventor
刘涛
李东琦
崔兴瑞
陈艳兵
武萌雅
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Chongqing University
Original Assignee
Chongqing University
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Chongqing University filed Critical Chongqing University
Priority to CN201610686502.3A priority Critical patent/CN106295708B/zh
Publication of CN106295708A publication Critical patent/CN106295708A/zh
Application granted granted Critical
Publication of CN106295708B publication Critical patent/CN106295708B/zh
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06F—ELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00—Pattern recognition
    • G06F18/20—Analysing
    • G06F18/21—Design or setup of recognition systems or techniques; Extraction of features in feature space; Blind source separation
    • G06F18/214—Generating training patterns; Bootstrap methods, e.g. bagging or boosting
    • G06F18/2155—Generating training patterns; Bootstrap methods, e.g. bagging or boosting characterised by the incorporation of unlabelled data, e.g. multiple instance learning [MIL], semi-supervised techniques using expectation-maximisation [EM] or naïve labelling
    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06F—ELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00—Pattern recognition
    • G06F18/20—Analysing
    • G06F18/24—Classification techniques
    • G06F18/241—Classification techniques relating to the classification model, e.g. parametric or non-parametric approaches
    • G06F18/2413—Classification techniques relating to the classification model, e.g. parametric or non-parametric approaches based on distances to training or reference patterns
    • G06F18/24133—Distances to prototypes
    • G06F18/24143—Distances to neighbourhood prototypes, e.g. restricted Coulomb energy networks [RCEN]

Landscapes

  • Engineering & Computer Science (AREA)
  • Data Mining & Analysis (AREA)
  • Theoretical Computer Science (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Artificial Intelligence (AREA)
  • Evolutionary Biology (AREA)
  • Evolutionary Computation (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Other Investigation Or Analysis Of Materials By Electrical Means (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

本发明公开了一种基于Fisher分类器组的连续型数据预处理方法,使用Fisher判别准则生成多个Fisher分类器,组成Fisher分类器组;将各样本原始数据输入Fisher分类器组获得输出,最后将这些输出结果通过非线性连续函数进行映射,并将映射结果作为数据预处理结果。用Fisher分类器组的输出获得一定的样本分类冗余信息,随后在“非线性连续函数”映射过程中减小奇异值和野值对后续分类器的影响,最终可在不改变分类器性能的情况下,提高分类器的准确度;本发明提出的方法正确识别率为96.83%。

Description

一种基于Fisher分类器组的连续型数据预处理方法
技术领域
本发明属于数据处理技术领域,尤其涉及一种基于Fisher分类器组的连续型数据预处理方法。
背景技术
随着人工智能技术的不断发展,模拟人类嗅觉感知过程的人工嗅觉系统应运而生,该系统由“气体传感器阵列”和“模式识别”两大部分构成。其中,“气体传感器阵列”由多种具有广谱响应的气体传感器组成,对各种气体产生不同的“响应图谱”;“模式识别”部分则利用合适的数学模型对“响应图谱”进行判别,为保证识别结果的准确性与鲁棒性,通常需要在图谱数据进入“模式识别”方法之前进行“数据预处理”。
当前的人工嗅觉系统“数据预处理”方法主要包括主成分分析(PCA)、独立分量分析(ICA)、时频变换、归一化处理等。PCA以多维信号相关性作为判断准则,在降维过程中尽可能多地保留有用信息;ICA则以信号独立性为判断依据,对信号进行分解与重组,但存在信号分解过程中会损失原始信号中的幅度信息;时频变换则适用于有效信号与干扰信号频率特性明显相异的情况;归一化处理着重于解决信号幅度差异过大对模式识别方法造成的影响。
然而,以上数据预处理方法的处理原则并不以最优分类为目标,即预处理过程中可能将有益于分类的信息剔除而保留某些对分类无用的信息,进而导致:对于同一分类器,往往数据经过预处理后的分类准确率弱于预处理前。因此需要一种以分类准确率为导向的数据预处理方法,保证在不增加分类器复杂度的情况下,获得较好的分类准确率。
发明内容
本发明的目的在于提供一种基于Fisher分类器组的连续型数据预处理方法,旨在解决背景技术中提及的问题。
本发明提供一种基于Fisher分类器的人工嗅觉系统数据预处理方法,该基于Fisher分类器的人工嗅觉系统数据预处理方法为:
使用Fisher判别准则生成多个Fisher分类器,组成Fisher分类器组:依据训练样本类别,由两类样本组成n个训练子集,利用训练子集Xn生成n个Fisher判别模型,生成n个Fisher分类器,形成Fisher分类器组;
将各样本原始数据输入Fisher分类器组获得输出,最后将这些输出结果通过非线性连续函数进行映射,并将映射结果作为数据预处理结果。
该基于Fisher分类器组的连续型数据预处理方法包括以下步骤:
步骤一、训练子集选择与生成:通过获得若干组观察数据与所属类别的信息作为算法模型建立的依据,每一条信息称为一个训练样本,若干训练样本组成训练集;若训练样本有k类,k≥2;则依据训练样本类别,由两类样本组成个训练子集,训练子集Xn表示为:
Xn={{xi},{xj}};
其中,i,j∈{1,2,…,n}且i≠j,{xi}和{xj}分别表示训练集中第i和第j类样本的集合;
步骤二、Fisher分类器组生成:
利用训练子集Xn生成Fisher判别模型yn=fn(x),步骤如下:
1)求Xn中i,j两类样本的均值和
2)求类内散度矩阵Swn:
其中是的转置矩阵;
3)求类间散度矩阵Sbn:
4)求投影方向Wn:
Wn=Swn -1·Sbn;
5)求Fisher判别阈值w0n:
则得训练子集Xn对应的判别模型:yn=fn(x)=Wn·x-w0n;
6)按照步骤1)至步骤5)的方法求出每个训练子集对应的Fisher判别模型,生成个Fisher分类器,形成Fisher分类器组,则分类器组输出可表示为:
步骤三、非线性连续型函数映射方法包括:
利用非线性连续函数对Fisher分类器组输出进行映射,令为第n个Fisher分类器输出的非线性映射且:
其中a(a>0)是为增强算法泛化性能而引入的松弛变量;若Fisher分类器组由k个分类器组成,则为数据预处理结果。
进一步,使用人工嗅觉系统对测试物质,进行分类识别,人工嗅觉系统由32个气敏传感器组成,每种测试物质进行12次采集,每次采集过程中清洁空气即基线采集时间为3分钟,被测物进样时间为3分钟,清洗时间为4分钟;
每次采集完成后,将第i个传感器的响应记为Δri:
其中为被测物进样阶段第i个传感器响应的平均值,为基线采集阶段第i个传感器响应的平均值,则每次采集可获得一个32维的样本,对于每种物质的样本,取其中3个作为训练样本,剩余为测试样本,松弛变量取a=5.76。
本发明所涉方法优势在于:
1、相较于其它数据预处理方法,利用Fisher分类器组将样本的类别信息作为先验知识,使预处理后的数据更易被正确分类;
2、利用多个简单的二分类器进行数据映射,为分类器在多分类场景下提供更多有用信息;
3、“非线性连续函数”映射可减小连续空间中奇异值和野值对后续分类器的影响;综上,本发明所涉方法可提高分类器在多分类识别中的正确率。
现有技术中,数据归一化后,不采用任何预处理方法正确识别率为92.06%,使用PCA方法并取第1和第2主成分作为预处理结果正确识别率为50.79%;本发明提出的方法正确识别率为96.83%。
附图说明
图1是本发明实施例提供的基于Fisher分类器组的连续型数据预处理方法流程图。
具体实施方式
为了使本发明的目的、技术方案及优点更加清楚明白,以下结合实施例,对本发明进行进一步详细说明。应当理解,此处所描述的具体实施例仅仅用以解释本发明,并不用于限定本发明。
下面结合附图对本发明的应用原理作详细的描述。
如图1所示:本发明实施例的基于Fisher分类器组的连续型数据预处理方法包括以下步骤:
S101:使用Fisher判别准则生成多个Fisher分类器,组成Fisher分类器组:依据训练样本类别,由两类样本组成n个训练子集,利用训练子集Xn生成n个Fisher判别模型,生成n个Fisher分类器,形成Fisher分类器组;
S102:将各样本原始数据输入Fisher分类器组获得输出,最后将这些输出结果通过非线性连续函数进行映射,并将映射结果作为数据预处理结果。
该基于Fisher分类器组的连续型数据预处理方法具体包括以下步骤:
步骤一、训练子集选择与生成:通过获得若干组观察数据与所属类别的信息作为算法模型建立的依据,每一条信息称为一个训练样本,若干训练样本组成训练集;若训练样本有k类,k≥2;则依据训练样本类别,由两类样本组成个训练子集,训练子集Xn表示为:
Xn={{xi},{xj}};
其中,i,j∈{1,2,…,n}且i≠j,{xi}和{xj}分别表示训练集中第i和第j类样本的集合;
步骤二、Fisher分类器组生成:
利用训练子集Xn生成Fisher判别模型yn=fn(x),步骤如下:
1)求Xn中i,j两类样本的均值和
2)求类内散度矩阵Swn:
其中是的转置矩阵;
3)求类间散度矩阵Sbn:
4)求投影方向Wn:
Wn=Swn -1·Sbn;
5)求Fisher判别阈值w0n:
则得训练子集Xn对应的判别模型:yn=fn(x)=Wn·x-w0n;
6)按照步骤1)至步骤5)的方法求出每个训练子集对应的Fisher判别模型,生成个Fisher分类器,形成Fisher分类器组,则分类器组输出可表示为:
步骤三、非线性连续型函数映射方法包括:
利用非线性连续函数对Fisher分类器组输出进行映射,令为第n个Fisher分类器输出的非线性映射且:
其中a(a>0)是为增强算法泛化性能而引入的松弛变量;若Fisher分类器组由k个分类器组成,则为数据预处理结果。
下面结合具体实施例对本发明的应用原理作进一步描述。
实施例1:
使用人工嗅觉系统对七种物质,包括:啤酒、白酒、葡萄酒、绿茶、红茶、乌龙茶和普洱茶,进行分类识别。人工嗅觉系统由32个气敏传感器组成,系统对传感器阵列响应的采样速率为1Hz,采样精度为16bit。
每种测试物质进行12次采集,共计84次采集。每次采集过程中清洁空气(基线)采集时间为3分钟,被测物进样时间为3分钟,清洗时间为4分钟。
每次采集完成后,将第i个传感器的响应记为Δri:
其中为被测物进样阶段第i个传感器响应的平均值,为基线采集阶段第i个传感器响应的平均值,则每次采集可获得一个32维的样本,样本共计84个。对于每种物质的样本,取其中3个作为训练样本,其余为测试样本。松弛变量取a=5.76。
数据预处理方式有3种:
①不采用任何预处理方法;
②使用PCA方法并取第1和第2主成分作为预处理结果;
③本发明提出的方法;
模式识别方法:k近邻法(k-NN)。
数据预处理方法 识别正确率
无 92.06%
PCA方法 50.79%
本专利方法 96.83%
以上所述仅为本发明的较佳实施例而已,并不用以限制本发明,凡在本发明的精神和原则之内所作的任何修改、等同替换和改进等,均应包含在本发明的保护范围之内。

Claims (1)

1.一种基于Fisher分类器组的连续型数据预处理方法,其特征在于,该基于Fisher分类器组的连续型数据预处理方法为:
使用人工嗅觉系统对七种物质,包括:啤酒、白酒、葡萄酒、绿茶、红茶、乌龙茶和普洱茶,进行分类识别;人工嗅觉系统由32个气敏传感器组成,系统对传感器阵列响应的采样速率为1Hz,采样精度为16bit;
每种测试物质进行12次采集,共计84次采集;每次采集过程中清洁空气即基线采集时间3分钟,被测物进样时间3分钟,清洗时间4分钟;
每次采集完成后,将第i个传感器的响应记为Δri:
Δri=ri gas-ri base;
其中ri gas为被测物进样阶段第i个传感器响应的平均值,ri base为基线采集阶段第i个传感器响应的平均值,则每次采集可获得一个32维的样本,样本共计84个;对于每种物质的样本,取3个作为训练样本,剩余为测试样本;松弛变量取a=5.76;
人工嗅觉系统对啤酒、白酒、葡萄酒、绿茶、红茶、乌龙茶和普洱茶进行分类识别中,使用Fisher判别准则生成n个Fisher分类器,组成Fisher分类器组:依据训练样本类别,由两类样本组成n个训练子集,利用训练子集Xn生成n个Fisher判别模型,生成n个Fisher分类器,形成Fisher分类器组;
将各样本原始数据输入Fisher分类器组获得输出,最后将输出结果通过非线性连续函数进行映射,并将映射结果作为数据预处理结果;
该基于Fisher分类器组的连续型数据预处理方法包括以下步骤:
步骤一、训练子集选择与生成:通过获得若干组观察数据与所属类别的信息作为算法模型建立的依据,每一条信息称为一个训练样本,若干训练样本组成训练集;若训练样本有k类,k≥2;则依据训练样本类别,由两类样本组成个训练子集,训练子集Xn表示为:
Xn={{xi},{xj}};
其中,i,j∈{1,2,Λ,n}且i≠j,{xi}和{xj}分别表示训练集中第i和第j类样本的集合;
步骤二、Fisher分类器组生成:
利用训练子集Xn生成Fisher判别模型yn=fn(x),步骤如下:
1)求Xn中i,j两类样本的均值和
2)求类内散度矩阵Swn:
其中是的转置矩阵;
3)求类间散度矩阵Sbn:
4)求投影方向Wn:
Wn=Swn -1·Sbn;
5)求Fisher判别阈值w0n:
则得训练子集Xn对应的判别模型:yn=fn(x)=Wn·x-w0n;
6)按照步骤1)至步骤5)的方法求出每个训练子集对应的Fisher判别模型,生成个Fisher分类器,形成Fisher分类器组,则分类器组输出表示为:
步骤三、非线性连续型函数映射方法包括:
利用非线性连续函数对Fisher分类器组输出进行映射,令为第n个Fisher分类器输出的非线性映射且:
其中a是为增强算法泛化性能而引入的松弛变量,a>0;若Fisher分类器组由k个分类器组成,则为数据预处理结果。
CN201610686502.3A 2016-08-19 2016-08-19 一种基于Fisher分类器组的连续型数据预处理方法 Active CN106295708B (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN201610686502.3A CN106295708B (zh) 2016-08-19 2016-08-19 一种基于Fisher分类器组的连续型数据预处理方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN201610686502.3A CN106295708B (zh) 2016-08-19 2016-08-19 一种基于Fisher分类器组的连续型数据预处理方法

Publications (2)

Publication Number Publication Date
CN106295708A CN106295708A (zh) 2017-01-04
CN106295708B true CN106295708B (zh) 2019-07-19

Family

ID=57679933

Family Applications (1)

Application Number Title Priority Date Filing Date
CN201610686502.3A Active CN106295708B (zh) 2016-08-19 2016-08-19 一种基于Fisher分类器组的连续型数据预处理方法

Country Status (1)

Country Link
CN (1) CN106295708B (zh)

Families Citing this family (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN107748825A (zh) * 2017-11-06 2018-03-02 四川大学 一种煤层采动裂隙场瓦斯压力测定系统
CN108054834A (zh) * 2017-12-20 2018-05-18 湖南工程学院 一种多级能源协调控制系统
CN108446718B (zh) * 2018-02-08 2021-01-26 同济大学 一种动态深度置信网络分析方法
CN108937967A (zh) * 2018-05-29 2018-12-07 智众伟业(天津)科技有限公司南宁分公司 一种基于vr技术的心理学记忆数据提升检测方法及系统
CN109033994B (zh) * 2018-07-03 2021-08-10 辽宁工程技术大学 一种基于卷积神经网络的人脸表情识别方法

Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN102507677A (zh) * 2011-11-01 2012-06-20 重庆大学 一种基于多重自组织神经网络的电子鼻漂移抑制方法
CN104504407A (zh) * 2014-12-17 2015-04-08 西南大学 基于多核Fisher判别分析的电子鼻特征选择优化方法

Patent Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN102507677A (zh) * 2011-11-01 2012-06-20 重庆大学 一种基于多重自组织神经网络的电子鼻漂移抑制方法
CN104504407A (zh) * 2014-12-17 2015-04-08 西南大学 基于多核Fisher判别分析的电子鼻特征选择优化方法

Non-Patent Citations (2)

* Cited by examiner, † Cited by third party
Title
An alternate method of hierarchical classication for E-nose:Combined fisher discriminant analysis and modified sammon mapping;Shunping Zhang;《sensors and actuators B》;20070503(第127期);第399-405页
Short communication:identification of geographical indication tea with fisher’s discriminant classification and principal components analysis;Jian Zhou等;《journal of near infrared spectroscopy》;20090101;第17卷(第3期);第159-164页

Also Published As

Publication number Publication date
CN106295708A (zh) 2017-01-04

Similar Documents

Publication Publication Date Title
Wu et al. A light CNN for deep face representation with noisy labels
CN105956560B (zh) 一种基于池化多尺度深度卷积特征的车型识别方法
CN112541524B (zh) 基于注意力机制改进的BP-Adaboost多源信息电机故障诊断方法
CN103839041A (zh) 客户端特征的识别方法和装置
CN106295708A (zh) 一种基于Fisher分类器组的连续型数据预处理方法
CN103268607B (zh) 一种弱监督条件下的共同对象检测方法
CN119919398A (zh) 一种家具材料检测与风险评估系统
CN107478418A (zh) 一种旋转机械故障特征自动提取方法
Jia et al. The facial expression recognition method of random forest based on improved PCA extracting feature
Chuchra et al. A deep learning approach for splicing detection in digital audios
Ren et al. Pulses classification based on sparse auto-encoders neural networks
Ouamane et al. Knowledge Pre-Trained CNN-Based Tensor Subspace Learning for Tomato Leaf Diseases Detection
Ferizal et al. Gender recognition using PCA and LDA with improve preprocessing and classification technique
Xin et al. Random part localization model for fine grained image classification
CN107944363A (zh) 人脸图像处理方法、系统及服务器
CN106228199B (zh) 一种基于Fisher分类器组的离散型数据预处理方法
CN117132808B (zh) 一种基于小波混合卷积的多负荷识别方法和系统
CN107085700A (zh) 一种基于稀疏表示与单隐层神经网络技术相结合的人脸识别方法
CN110647915A (zh) 一种用于高维数据一致性分析的动态模式判断方法
CN117711426A (zh) 用于环境声音分类的方法、装置、设备及存储介质
Muñoz-Romero et al. Nonnegative OPLS for supervised design of filter banks: application to image and audio feature extraction
Shareefunnisa et al. Delineating Emotions in Speech: Comparative Insights from Machine Learning and Deep Learning
CN116434785A (zh) 一种基于重构原型和生成学习的零样本语音情绪识别方法
CN109740423B (zh) 基于人脸和小波包分析的种族识别方法及系统
Luo Frame Comparison and Frame Clustering with Vision Transformer and K-Means on COVID-19 News Videos from Different Affinity Groups

Legal Events

Date Code Title Description
C06 Publication
PB01 Publication
C10 Entry into substantive examination
SE01 Entry into force of request for substantive examination
GR01 Patent grant
GR01 Patent grant