CN112308139A - 一种基于主动学习的样本标注方法 - Google Patents

一种基于主动学习的样本标注方法 Download PDF

Info

Publication number
CN112308139A
CN112308139A CN202011186817.4A CN202011186817A CN112308139A CN 112308139 A CN112308139 A CN 112308139A CN 202011186817 A CN202011186817 A CN 202011186817A CN 112308139 A CN112308139 A CN 112308139A
Authority
CN
China
Prior art keywords
sample
labeling
samples
initial
active learning
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
CN202011186817.4A
Other languages
English (en)
Other versions
CN112308139B (zh
Inventor
陈能
安竹林
徐勇军
程坦
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Xiamen Institute Of Data Intelligence Institute Of Computing Technology Chinese Academy Of Sciences
Original Assignee
Xiamen Institute Of Data Intelligence Institute Of Computing Technology Chinese Academy Of Sciences
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Xiamen Institute Of Data Intelligence Institute Of Computing Technology Chinese Academy Of Sciences filed Critical Xiamen Institute Of Data Intelligence Institute Of Computing Technology Chinese Academy Of Sciences
Priority to CN202011186817.4A priority Critical patent/CN112308139B/zh
Publication of CN112308139A publication Critical patent/CN112308139A/zh
Application granted granted Critical
Publication of CN112308139B publication Critical patent/CN112308139B/zh
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Images

Classifications

    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/21Design or setup of recognition systems or techniques; Extraction of features in feature space; Blind source separation
    • G06F18/214Generating training patterns; Bootstrap methods, e.g. bagging or boosting
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/50Information retrieval; Database structures therefor; File system structures therefor of still image data
    • G06F16/53Querying
    • G06F16/532Query formulation, e.g. graphical querying
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/50Information retrieval; Database structures therefor; File system structures therefor of still image data
    • G06F16/58Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually
    • G06F16/583Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually using metadata automatically derived from the content

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Data Mining & Analysis (AREA)
  • General Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • Library & Information Science (AREA)
  • Databases & Information Systems (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Evolutionary Computation (AREA)
  • Evolutionary Biology (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Mathematical Physics (AREA)
  • Artificial Intelligence (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Image Analysis (AREA)

Abstract

本发明公开了一种基于主动学习的样本标注方法,包括如下步骤:S1、从样本池中随机小样本抽样并标注,得到初始标注样本;S2、采用度量学习计算初始标注样本与待标注样本的特征距离,生成特征距离图,遍历特征距离图,在样本池中寻找与初始标注样本距离小于阈值的样本并抽取出来;S3、将抽取出来的样本再次进行标注并汇入初始标注样本形成样本训练库,以样本训练库为样本集训练检索模型;S4、通过检索模型从样本池中检索出更多的负样本再次进行标注,并汇入样本训练库,形成最终的训练集。本发明采用计算特征距离及图片检索的方式快速抽取样本池中的负样本,在保持模型精度的前提下,大幅度降低标注时间,节约成本,利于工业智能算法的多产线推广。

Description

一种基于主动学习的样本标注方法
技术领域
本发明涉及计算机技术领域,特别涉及一种基于主动学习的样本标注方法。
背景技术
在工业智能算法中,数据是保证模型精度的一个很重要的因素。为了保证模型具有持续稳定的性能,必须在不同产线部署的同时收集训练样本,并且持续训练模型,而随着模型的大范围部署,将产生大量的待标注样本,标注这些样本将耗费昂贵的人工成本并影响算法的上线时间。
发明内容
为解决上述问题,本发明提供了一种基于主动学习的样本标注方法。
本发明采用以下技术方案:
一种基于主动学习的样本标注方法,包括如下步骤:
S1、从样本池中随机小样本抽样,作为主动学习的初始数据集并标注,得到初始标注样本;
S2、采用度量学习计算初始标注样本与待标注样本的特征距离,生成特征距离图,遍历特征距离图,在样本池中寻找与初始标注样本距离小于阈值的样本并抽取出来;
S3、将抽取出来的样本再次进行标注并汇入初始标注样本形成样本训练库,以样本训练库为样本集训练检索模型;
S4、通过检索模型从样本池中检索出更多的负样本再次进行标注,并汇入样本训练库,形成最终的训练集。
进一步地,步骤S2采用余弦相似度来计算所述特征距离,具体如下:
Figure BDA0002751604370000021
其中,similarity表示特征距离,A为初始标注样本集,B为待标注样本集。
进一步地,所述阈值为0.95-0.98。
进一步地,所述检索模型为Re-ID模型。
进一步地,步骤S4中的所述检索过程具体为:以负样本作为检索图片,所述检索模型从样本池中挑选出与所述检索图片最相似即特征距离最近的前n张图,然后对检索出来的前n张图进行简单的清洗。
进一步地,所述n的取值为5-15。
采用上述技术方案后,本发明与背景技术相比,具有如下优点:
本发明采用计算特征距离及图片检索的方式快速抽取样本池中的负样本,在保持模型精度的前提下,大幅度降低标注时间,节约成本,有利于工业智能算法的多产线推广。
附图说明
图1为本发明的流程示意图;
图2为本发明实施例的检索示例图。
具体实施方式
为了使本发明的目的、技术方案及优点更加清楚明白,以下结合附图及实施例,对本发明进行进一步详细说明。应当理解,此处所描述的具体实施例仅仅用以解释本发明,并不用于限定本发明。
实施例
如图1所示,一种基于主动学习的样本标注方法,包括如下步骤:
S1、从样本池中随机小样本抽样,作为主动学习的初始数据集并标注,得到初始标注样本;(由于工业数据的冗余性,抽样时需要尽可能的随机让小样本数据分布和样本池尽可能相似。)
S2、采用度量学习计算初始标注样本与待标注样本的特征距离,生成特征距离图,遍历特征距离图,在样本池中寻找与初始标注样本距离小于阈值的样本并抽取出来,所述阈值为0.96;
本实施例的度量学习为非线性,以VGG网络为框架,对网络做了相应的修改,不在网络内部做两张特征图的相减操作,而是直接把每张图在不同层次的卷积层中得到的特征图进行池化并各自拼接形成特征向量,然后根据该特征向量进行特征距离的计算;
步骤S2采用余弦相似度来计算所述特征距离,具体如下:
Figure BDA0002751604370000031
其中,similarity表示特征距离,A为初始标注样本集,B为待标注样本集。NumPy是一个开源Python科学计算库,本实施例采用NumPy进行计算,同时摒弃传统的欧式距离,而采用余弦相似度来计算特征距离,支持并发计算,提高了计算的速度。
S3、将抽取出来的样本再次进行标注并汇入初始标注样本形成样本训练库,以样本训练库为样本集训练检索模型;
S4、通过检索模型从样本池中检索出更多的负样本再次进行标注,并汇入样本训练库,形成最终的训练集。
所述检索模型为Re-ID模型。
步骤S4中的所述检索过程具体为:以负样本作为检索图片,所述检索模型从样本池中挑选出与所述检索图片最相似即特征距离最近的前10张图,然后对检索出来的前10张图进行简单的清洗。
现有的主动学习的查询函数设计准则主要是不确定准则,即想方设法挑选出模型最不确定的样本,因为该样本包含的信息最丰富,对模型训练最有用。现有的主流的做法基本上是评估分类模型最后的分类权值,分类权值越均衡则表示模型对该样本越不确定。如在二分类中,如果模型最后判断正负的置信度都逼近0.5,则该样本对于模型来说是不确定的一类样本。这种做法一定程度上能筛选出不确定样本,但是忽略了一点,即模型最后的分类输出和样本的不确定性并非成严格的比例关系。
其次,在工业场景中虽然能产生大量的数据,但由于品控的因素,在所产生的大量样本中只有少量的负样本,正负样本相差悬殊,极度不平衡。因此我们的基于主动学习算法的标注方法的一个考量是尽可能的抽取出样本池中的负样本出来。
如图2所示,为了便于说明,以Query作为检索图片,Re-ID模型能够从样本池中挑选出与检索图片最相似的图片,即距离最近的前10张图,如此,以负样本作为检索图片,我们就能够从样本池中抽取出更多的负样本,即便其中包含了部分正样本,但由于这些正样本与检索图片(负样本)较为相似,对于模型来说也是易混淆的数据,因此可以作为信息量比较大的样本加入样本训练库。剩下的样本池基本可以考虑丢弃(如果考虑纳入训练样本的话,由于几乎不存在负样本,清洗起来也是特别快)。通过该方法,可以大幅度地缩减数据样本的标注时间,提高模型部署的效率。
以上所述,仅为本发明较佳的具体实施方式,但本发明的保护范围并不局限于此,任何熟悉本技术领域的技术人员在本发明揭露的技术范围内,可轻易想到的变化或替换,都应涵盖在本发明的保护范围之内。因此,本发明的保护范围应该以权利要求的保护范围为准。

Claims (6)

1.一种基于主动学习的样本标注方法,其特征在于:包括如下步骤:
S1、从样本池中随机小样本抽样,作为主动学习的初始数据集并标注,得到初始标注样本;
S2、采用度量学习计算初始标注样本与待标注样本的特征距离,生成特征距离图,遍历特征距离图,在样本池中寻找与初始标注样本距离小于阈值的样本并抽取出来;
S3、将抽取出来的样本再次进行标注并汇入初始标注样本形成样本训练库,以样本训练库为样本集训练检索模型;
S4、通过检索模型从样本池中检索出更多的负样本再次进行标注,并汇入样本训练库,形成最终的训练集。
2.如权利要求1所述的一种基于主动学习的样本标注方法,其特征在于:步骤S2采用余弦相似度来计算所述特征距离,具体如下:
Figure FDA0002751604360000011
其中,similarity表示特征距离,A为初始标注样本集,B为待标注样本集。
3.如权利要求1所述的一种基于主动学习的样本标注方法,其特征在于:所述阈值为0.95-0.98。
4.如权利要求1所述的一种基于主动学习的样本标注方法,其特征在于:所述检索模型为Re-ID模型。
5.如权利要求1所述的一种基于主动学习的样本标注方法,其特征在于:步骤S4中的所述检索过程具体为:以负样本作为检索图片,所述检索模型从样本池中挑选出与所述检索图片最相似即特征距离最近的前n张图,然后对检索出来的前n张图进行简单的清洗。
6.如权利要求5所述的一种基于主动学习的样本标注方法,其特征在于:所述n的取值为5-15。
CN202011186817.4A 2020-10-29 2020-10-29 一种基于主动学习的样本标注方法 Active CN112308139B (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN202011186817.4A CN112308139B (zh) 2020-10-29 2020-10-29 一种基于主动学习的样本标注方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN202011186817.4A CN112308139B (zh) 2020-10-29 2020-10-29 一种基于主动学习的样本标注方法

Publications (2)

Publication Number Publication Date
CN112308139A true CN112308139A (zh) 2021-02-02
CN112308139B CN112308139B (zh) 2024-03-22

Family

ID=74332291

Family Applications (1)

Application Number Title Priority Date Filing Date
CN202011186817.4A Active CN112308139B (zh) 2020-10-29 2020-10-29 一种基于主动学习的样本标注方法

Country Status (1)

Country Link
CN (1) CN112308139B (zh)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN112906817A (zh) * 2021-03-16 2021-06-04 中科海拓(无锡)科技有限公司 一种智能图像标注方法
WO2022199214A1 (zh) * 2021-03-26 2022-09-29 北京沃东天骏信息技术有限公司 样本扩展方法、训练方法和系统、及样本学习系统

Citations (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN101853400A (zh) * 2010-05-20 2010-10-06 武汉大学 基于主动学习和半监督学习的多类图像分类方法
CN108399414A (zh) * 2017-02-08 2018-08-14 南京航空航天大学 样本选择方法及装置
CN110851645A (zh) * 2019-11-08 2020-02-28 吉林大学 一种基于深度度量学习下相似性保持的图像检索方法
CN111368924A (zh) * 2020-03-05 2020-07-03 南京理工大学 基于主动学习的不平衡数据分类方法
CN111461232A (zh) * 2020-04-02 2020-07-28 大连海事大学 一种基于多策略批量式主动学习的核磁共振图像分类方法
CN111833313A (zh) * 2020-06-22 2020-10-27 广东工业大学 基于深度主动学习的工业产品表面缺陷检测方法及系统

Patent Citations (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN101853400A (zh) * 2010-05-20 2010-10-06 武汉大学 基于主动学习和半监督学习的多类图像分类方法
CN108399414A (zh) * 2017-02-08 2018-08-14 南京航空航天大学 样本选择方法及装置
CN110851645A (zh) * 2019-11-08 2020-02-28 吉林大学 一种基于深度度量学习下相似性保持的图像检索方法
CN111368924A (zh) * 2020-03-05 2020-07-03 南京理工大学 基于主动学习的不平衡数据分类方法
CN111461232A (zh) * 2020-04-02 2020-07-28 大连海事大学 一种基于多策略批量式主动学习的核磁共振图像分类方法
CN111833313A (zh) * 2020-06-22 2020-10-27 广东工业大学 基于深度主动学习的工业产品表面缺陷检测方法及系统

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN112906817A (zh) * 2021-03-16 2021-06-04 中科海拓(无锡)科技有限公司 一种智能图像标注方法
WO2022199214A1 (zh) * 2021-03-26 2022-09-29 北京沃东天骏信息技术有限公司 样本扩展方法、训练方法和系统、及样本学习系统

Also Published As

Publication number Publication date
CN112308139B (zh) 2024-03-22

Similar Documents

Publication Publication Date Title
Li et al. DXSLAM: A robust and efficient visual SLAM system with deep features
CN108038183B (zh) 结构化实体收录方法、装置、服务器和存储介质
WO2020147857A1 (zh) 海量视频特征提取以及存储和检索方法及系统
CN108986168B (zh) 一种基于深度度量学习结合词袋树模型的机器人回环检测方法和装置
JP2022023770A (ja) 文字の認識方法及び装置、電子機器、コンピュータ可読記憶媒体及びコンピュータプログラム
CN108427925B (zh) 一种基于连续拷贝帧序列的拷贝视频检测方法
CN111198964A (zh) 图像检索方法及系统
Stumm et al. Probabilistic place recognition with covisibility maps
CN111914085A (zh) 文本细粒度情感分类方法、系统、装置及存储介质
CN112308139A (zh) 一种基于主动学习的样本标注方法
CN113704531A (zh) 图像处理方法、装置、电子设备及计算机可读存储介质
Lu et al. STA-VPR: Spatio-temporal alignment for visual place recognition
CN112836068A (zh) 一种基于带噪标签学习的无监督跨模态哈希检索方法
Li et al. Multi-scale global context feature pyramid network for object detector
Yang et al. Online video text detection with markov decision process
CN112765976A (zh) 文本相似度计算方法、装置、设备及存储介质
Qi et al. DGRNet: A Dual-Level Graph Relation Network for Video Object Detection
CN113516118B (zh) 一种图像与文本联合嵌入的多模态文化资源加工方法
CN116049450A (zh) 一种基于距离聚类的支持多模态的图文检索方法及装置
WO2023273572A1 (zh) 一种特征提取模型构建方法、目标检测方法及其设备
Orhan et al. Semantic pose verification for outdoor visual localization with self-supervised contrastive learning
Qi et al. TCNet: A novel triple-cooperative network for video object detection
Li et al. Adaptive multi-prototype relation network
Xia et al. Self‐training with one‐shot stepwise learning method for person re‐identification
Fan et al. SSD-LeNet based method of mine moving target detection and recognition

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination
CB02 Change of applicant information
CB02 Change of applicant information

Address after: No. 208-3, Fengqi Road, phase III, software park, Xiamen City, Fujian Province, 361000

Applicant after: Zhongke (Xiamen) data Intelligence Research Institute

Address before: No. 208-3, Fengqi Road, phase III, software park, Xiamen City, Fujian Province, 361000

Applicant before: Xiamen Institute of data intelligence, Institute of computing technology, Chinese Academy of Sciences

GR01 Patent grant
GR01 Patent grant