CN119206552B - 基于缺失跨模态数据类增量学习的无人机巡检方法及装置 - Google Patents
基于缺失跨模态数据类增量学习的无人机巡检方法及装置Info
- Publication number
- CN119206552B CN119206552B CN202411338769.4A CN202411338769A CN119206552B CN 119206552 B CN119206552 B CN 119206552B CN 202411338769 A CN202411338769 A CN 202411338769A CN 119206552 B CN119206552 B CN 119206552B
- Authority
- CN
- China
- Prior art keywords
- unmanned aerial
- aerial vehicle
- data
- feature
- missing
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V20/00—Scenes; Scene-specific elements
- G06V20/10—Terrestrial scenes
- G06V20/17—Terrestrial scenes taken from planes or by drones
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/045—Combinations of networks
- G06N3/0455—Auto-encoder networks; Encoder-decoder networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/0464—Convolutional networks [CNN, ConvNet]
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
- G06N3/084—Backpropagation, e.g. using gradient descent
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
- G06N3/096—Transfer learning
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/10—Image acquisition
- G06V10/12—Details of acquisition arrangements; Constructional details thereof
- G06V10/14—Optical characteristics of the device performing the acquisition or on the illumination arrangements
- G06V10/143—Sensing or illuminating at different wavelengths
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/70—Arrangements for image or video recognition or understanding using pattern recognition or machine learning
- G06V10/72—Data preparation, e.g. statistical preprocessing of image or video features
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/70—Arrangements for image or video recognition or understanding using pattern recognition or machine learning
- G06V10/764—Arrangements for image or video recognition or understanding using pattern recognition or machine learning using classification, e.g. of video objects
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/70—Arrangements for image or video recognition or understanding using pattern recognition or machine learning
- G06V10/77—Processing image or video features in feature spaces; using data integration or data reduction, e.g. principal component analysis [PCA] or independent component analysis [ICA] or self-organising maps [SOM]; Blind source separation
- G06V10/774—Generating sets of training patterns; Bootstrap methods, e.g. bagging or boosting
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/70—Arrangements for image or video recognition or understanding using pattern recognition or machine learning
- G06V10/77—Processing image or video features in feature spaces; using data integration or data reduction, e.g. principal component analysis [PCA] or independent component analysis [ICA] or self-organising maps [SOM]; Blind source separation
- G06V10/80—Fusion, i.e. combining data from various sources at the sensor level, preprocessing level, feature extraction level or classification level
- G06V10/806—Fusion, i.e. combining data from various sources at the sensor level, preprocessing level, feature extraction level or classification level of extracted features
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/70—Arrangements for image or video recognition or understanding using pattern recognition or machine learning
- G06V10/82—Arrangements for image or video recognition or understanding using pattern recognition or machine learning using neural networks
-
- Y—GENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
- Y02—TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
- Y02T—CLIMATE CHANGE MITIGATION TECHNOLOGIES RELATED TO TRANSPORTATION
- Y02T10/00—Road transport of goods or passengers
- Y02T10/10—Internal combustion engine [ICE] based vehicles
- Y02T10/40—Engine management systems
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- General Physics & Mathematics (AREA)
- Evolutionary Computation (AREA)
- Computing Systems (AREA)
- Health & Medical Sciences (AREA)
- Artificial Intelligence (AREA)
- Software Systems (AREA)
- General Health & Medical Sciences (AREA)
- Multimedia (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Databases & Information Systems (AREA)
- Medical Informatics (AREA)
- Molecular Biology (AREA)
- General Engineering & Computer Science (AREA)
- Data Mining & Analysis (AREA)
- Mathematical Physics (AREA)
- Computational Linguistics (AREA)
- Biophysics (AREA)
- Biomedical Technology (AREA)
- Life Sciences & Earth Sciences (AREA)
- Remote Sensing (AREA)
- Image Analysis (AREA)
Abstract
本发明公开了一种基于缺失跨模态数据类增量学习的无人机巡检方法及装置,方法包括:对无人机收集到的缺失数据进行补全;对补全后的数据进行预处理,获取数据中隐藏的各模态的特征;对输入特征图中不同模态的特征通道进行混合;对混合后的输入特征图中的每个组分配一套卷积核,进行分组卷积后,对特征图应用自适应平均池化,得到最终的输出特征图;对输出特征图进行展平,之后将其输入全连接层,并应用激活函数以引入非线性,生成最终的分类结果,随后应用损失函数计算损失,并使用梯度下降法更新模型参数;在模型训练完成后部署到无人机上,无人机对场景和实体进行识别。装置包括:处理器和存储器。本发明提高了无人机在复杂环境中的识别和分析能力。
Description
技术领域
本发明涉及智能无人系统中的无人机巡检领域,尤其涉及一种基于缺失跨模态数据类增量学习的无人机巡检方法及装置。
背景技术
无人机巡检系统主要通过无人机实施关键基础设施,例如:电力线、油气管道、铁路和桥梁的自动化监控与检查。此类系统也广泛应用于农业、森林监测和城市管理等领域。其主要优点包括:提升作业效率、降低操作成本以及减少人员安全风险。无人机在执行巡检任务时,需收集并分析数据以做出自动化决策。在日间,无人机通过高清摄像头捕获清晰图像进行分析;而在夜间,通常依靠红外摄像头来处理因光照不足而获取的图像。
目前的自动检测模型主要处理通过高清或红外摄像头捕获的图像,这些模型在训练阶段基于已收集的数据训练深度神经网络,随后部署这些网络来分析新采集的图像以评估当前情况。但是,由于白天和夜晚条件下图像的信息和特征存在较大差异,这种单一模型往往难以同时适应这两种情况;此外,在实际操作中,一些感知模态可能因为技术故障、环境干扰或其他外部因素而无法提供数据,即使模态可用,也可能因为传感器覆盖范围的局限性,或是由于传感器本身的限制导致无法捕获到场景的全貌,造成数据的缺失。
跨模态学习关注于从不同模态之间的关联中进行学习和推理,通过不同模态的数据相互补充和共享信息来增强模型的感知和理解能力。在这一学习范畴中,模型融合不同感知模态的信息,以提高对环境的理解和决策能力。增量学习则使模型能够在吸纳新数据的同时,维持对已有数据的记忆。然而,跨模态学习依赖于不同模态之间的信息互补性,以提高模型的性能。当某一模态的数据缺失时,模型无法充分利用该模态的特征,从而导致信息不完整,降低模型的整体表现。数据缺失也可能导致模态间的数据分布不均衡,导致模型的训练完全倾向其中一个模态。增量学习中,模型需要在不断学习新数据的同时保持对旧数据的记忆。数据缺失会加剧遗忘现象,因为缺失的数据可能包含关键特征,使得模型难以在增量学习过程中保持对这些特征的记忆。
在跨模态增量学习中,模态遗忘问题是一个重要的挑战。在增量学习过程中,由于不同模态之间可能存在不同的特征分布和学习动态,模型在学习新模态时,可能会遗忘之前学到的关于不同模态的知识。此外,在跨模态学习中,各个模态通常提供不同类型的信息。理想情况下,模型应该平衡地从每种模态中提取和利用信息。然而,在实际应用中,某个模态可能会逐渐占据主导地位,出现模态竞争性遗忘的问题。这种优势可能会导致模型过分依赖某一模态的信息,而忽略其他模态提供的有用信息,进而影响整体的学习效果和决策质量。
为解决数据缺失的问题,目前已有多种策略被提出,包括:差补法、差值法、矩阵分解法等方法以填补数据,减轻数据缺失带来的影响。尽管这些策略可以在一定程度上解决问题,但它们往往采用基础统计量对数据进行填补,忽略数据之间的相关性,或计算开销大,计算复杂度高;为解决模态竞争性遗忘的问题,现有方法主要采用引入模态平衡机制、数据增强和重采样的策略。但也存在资源开销较高,各模态权重设定具有主观性的问题。因此,如何有效解决跨模态增量学习中的数据缺失问题和模态竞争性遗忘问题,同时兼顾存储和计算效率,成为了无人机巡检模型是否能够大规模安装在无人机上,进行应用的关键。
发明内容
本发明提供了一种基于缺失跨模态数据类增量学习的无人机巡检方法及装置,本发明考虑到在现实应用中,无人机在巡检过程中接收的跨模态数据可能是不完整的,这导致了传统类增量学习方法在这些场景下效果不佳的问题,设计了一种基于不完整跨模态数据类增量学习的方法,该方法整合了补全、交互性融合和遗忘预防三个策略,增强了数据的完整性,实现了不同模态间的信息最大化利用,提升了无人机巡检模型的分类精度,强化了模型对有缺失的跨模态数据的处理能力,同时在增量学习过程中有效减少无人机巡检模型的遗忘问题,能够更好地处理和利用来自不同传感器的信息,提高了无人机在复杂环境中的识别和分析能力,详见下文描述:
第一方面、一种基于缺失跨模态数据类增量学习的无人机巡检方法,所述方法包括:
对无人机收集到的缺失数据进行补全;对补全后的数据进行预处理,获取数据中隐藏的各模态的特征;对输入特征图中不同模态的特征通道进行混合;
对混合后的输入特征图中的每个组分配一套卷积核,进行分组卷积后,对特征图应用自适应平均池化,得到最终的输出特征图;
对输出特征图进行展平,之后将其输入全连接层,并应用激活函数以引入非线性,生成最终的分类结果,随后应用损失函数计算损失,并使用梯度下降法更新模型参数;在模型训练完成后部署到无人机上,无人机对场景和实体进行识别。
其中,所述对输入特征图中不同模态的特征通道进行混合具体为:
将输入特征图中来自各个模态的特征划分为不同通道,将来自每个模态的特征通道均匀分组,从每组中选择通道并与另一模态的对应组进行混合。
其中,所述损失函数由两部分组成,真实分类损失Lcls和新类预留损失Lvr,
所述真实分类损失Lcls用于衡量真实标签和模型预测输出之间的差异;
所述新类预留损失Lvr使用虚拟类别和虚拟样本在嵌入空间中为未学习的新类预先占位,调整嵌入空间的分布,帮助无人机内的巡检识别模型在学习新类别时维持对旧类别的记忆。
其中,所述对无人机收集到的缺失数据进行补全为:在训练过程中使用掩蔽自编码器来补全传感器采集到的缺失数据。
其中,所述通道混合将通道分配到不同预定义的组中,并重新组合来自不同模态的特征通道,通道混合定义为:
其中,||表示连接,和代表从两种不同模态提取的特征组,特征通道被平均地分到不同的组中t代表第t个场景,i代表不同的模态,N是组数,C是通道数,和表示对两种不同模态中提取的特征组进行通道混合操作;表示在第t个场景中第i个模态中的特征通道的第j个元素。
其中,所述虚拟样本为:
在训练集中随机选取两个样本x1和x2及其对应的标签y1和y2,将这两个样本分别输入到神经网络中,前向传播至选择的隐藏层,设选择的隐藏层对于x1和x2的输出分别为z1和z2;在隐藏层的输出z1和z2上进行插值,生成一个新的内部表示z:z=λz1+(1-λ)z2,其中λ是一个插值系数,对对应的标签进行相应的插值:y=λy1+(1-λ)y2,将插值得到的新表示z继续通过神经网络的剩余部分前向传播,得到最终的输出。
其中,所述样本对应的虚拟损失为:
其中,是虚拟类别标签,y'是现有类别中的伪标签,Limg表示通过Mask函数保留的新类别空间,Lmi和Lmc用于避免对旧类别空间的过度压缩,fi(x)表示网络对输入样本x生成的特征表示,fi(m)表示网络对混合样本生成的特征表示,Mask函数定义为:
其中,表示哈达马乘积,用于将特征向量与一个独热编码向量的逐元素补码相乘,独热编码向量OneHot(y)表示当前已知类别的标签,其余类别位置为0,当前类别位置为1,通过1-OneHot(y)操作,将已知类别的位置置0,未知类别的位置置1,目标函数最终定义为:
L(x,m,y)=Lcls(fi(x),y)+λ1Lvr(x,m,y)
其中,Lcls表示通过余弦相似度来计算的基础损失函数,λ1是一个平衡因子,用于调整Lvr的相对重要性大小,x表示模型的原始输入数据,y表示与输入x相对应的真实类别标签。
第二方面、一种基于缺失跨模态数据类增量学习的无人机巡检装置,其特征在于,所述装置包括:处理器和存储器,所述存储器中存储有程序指令,所述处理器调用存储器中存储的程序指令以使装置执行第一方面中的任一项所述的方法。
第三方面、一种计算机可读存储介质,其特征在于,所述计算机可读存储介质存储有计算机程序,所述计算机程序包括程序指令,所述程序指令被处理器执行时使所述处理器执行第一方面中的任一项所述的方法。
本发明提供的技术方案的有益效果是:
1、本发明考虑了现实应用中无人机接收的跨模态数据的缺失问题,采用掩蔽自编码器对缺失数据进行自动补全,增强数据的质量,改善数据的完整性,提供更稳定和可靠的输入数据;
2、本发明针对无人机巡检识别场景中生成的跨模态数据开发了一个跨模态信息融合模块,该模块通过建立不同数据模态之间的连接,增强了特征的多样性,有助于保留对旧知识的记忆,有效减少了灾难性遗忘问题;使得模型能够更好地处理和利用来自不同传感器的信息,提高了无人机在复杂环境中的识别和分析能力;
3、本发明有效地解决了由于某些传感器故障,无法采集数据导致的数据稀疏问题;通过整合其他模态中更为丰富的数据,本发明能够有效弥补某些模态数据的不足,从而提升数据的使用效率和模型的整体表现;这种跨模态交互性融合策略加强了模型处理不均匀数据源的能力,确保即便在数据缺乏的情况下也能保持良好的性能;
4、本发明可以在无人机识别等增量学习任务中达到最先进的性能,与对比方法相比,平均精度提升最高可达4.96%、6.53%和3.86%。
附图说明
图1为一种基于缺失跨模态数据类增量学习的无人机巡检方法的流程图;
图2为使用模态补全器对缺失跨模态数据进行补全的示意图;
图3为一大型跨模态数据集LasHeR-CIL的示意图;
图4为一大型跨模态数据集VTDV-CIL的示意图;
图5为对比示意图;
其中,三个子图分别为缺失率为0.3、0.5、0.7时的情况,该图表示应用在VTDV-CIL数据集上,跨模态融合补全策略与其他先进方法相比,准确率的提升,可以看到在不同缺失率的多个阶段后,跨模态融合补全策略的准确率有显著提升。
图6为对比示意图;
其中,两个子图分别为应用在LasHeR-CIL数据集和应用在VTDV-CIL数据集上的情况,,该图表示缺失率设置为0.3时,是否包含遗忘预防策略的性能比较,“Visible”表示可见光模态,“Thermal”表示红外光模态,“ADD”表示交互性融合策略,“-F”表示使用遗忘预防策略,可以看到遗忘预防策略时的模型表现明显优于不使用遗忘预防策略的模型。
图7为参数分析示意图;
其中,两个子图为缺失率设置为0.5时,平衡因子λ1和通道混合组数γ的参数分析结果,左图为ACC,右图为NPD。该图表示应用在LasHeR-CIL数据集上,不同参数设置下的性能比较,λ1的值从{0.0001,0.001,0.01,0.1,1}中选择,γ从{2,4,6,8,16,32}中选择,可以看到λ1设置为0.01,γ设置为8时的模型表现最优。
图8为一种基于不完整跨模态数据类增量学习的无人机巡检系统的结构示意图。
表1为不同方法在LasHeR-CIL数据集上,准确率、性能下降率、归一化性能下降率的对比;
表2为在LasHeR-CIL数据集上进行的消融实验,表明本方法的各个组件的有效性。
具体实施方式
为使本发明的目的、技术方案和优点更加清楚,下面对本发明实施方式作进一步地详细描述。
实施例1
在执行巡检任务过程中,无人机可以根据新收集的数据实时调整和优化机内模型,以适应动态变化的环境。但无人机在执行任务时,可能遇到部分传感器损坏或被遮挡的情况,导致接收到的跨模态数据不完整,且在学习过程中模态遗忘等情况十分常见,为了解决背景技术中存在的问题,无人机巡检任务中增量式学习新类别,会导致旧类别识别能力的严重退化,本发明实施例提出了一种基于不完整跨模态数据类增量学习的无人机巡检方法,旨在目标检测中减轻缺失数据影响,同时能增量式学习新类别并保持对以往旧类别的识别能力,从而通过快速高效的模型更新和持续学习,参见图1,该方法包括以下步骤:
101:无人机执行巡检任务,获取缺失数据;
按照预定的路线和区域,部署无人机,执行巡检任务。无人机在巡检过程中通过自身携带的多种传感器(摄像头、红外摄像头、激光雷达等)收集不同模态的环境信息和数据,并实时传输回地面处理中心。但是,传感器在工作时可能会被遮蔽或者损坏,导致收集到的数据不全。
102:对收集到的缺失数据进行补全;
其中,使用掩蔽自编码器对缺失数据进行自动补全。在实际应用中,掩蔽自编码器首先通过编码器将含缺失值的输入数据转换成低维的隐藏表示。这一表示捕捉了数据中未被掩蔽部分的核心特征。接着,解码器部分利用这些核心特征尝试重建原始数据的完整形态,包括缺失的部分。该步骤显著增强了数据质量,改善了数据完整性,为后续处理提供更稳定可靠的输入数据。
103:对补全后的数据进行预处理,获取数据中隐藏的各模态的特征;
使用卷积、池化等技术对补全后的跨模态数据进行特征提取,从大量数据中提取出包含不同模态关键特征的数据,而忽略掉数据中包含的噪声,压缩数据量,生成特征图作为后续处理的输入。其中,卷积层的卷积核个数决定了特征图的通道数。每个通道对应于输入数据在特定特征下的响应。
104:对输入特征图中不同模态的特征通道进行混合;
其中,将输入特征图中来自各个模态的特征划分为不同通道,将来自每个模态的特征通道均匀分组,在进行实际的卷积操作前,从每组中选择通道并与另一模态的对应组进行混合,这种操作增强了不同模态之间数据的联系。
105:对混合后的输入特征图中的每个组分配一套卷积核,进行分组卷积;
其中,经过通道混合的输入特征图分为几个独立的组,每组包含一部分特征图。同样,将卷积核也分成相应数量的组,每组卷积核只处理对应组的输入特征图。在分组完成后,每组内的卷积核将独立地与其对应的特征图进行卷积操作,每个组生成独立的输出特征图,每组的卷积核仅与其对应组的特征图互动。各个组独立进行卷积操作,独立生成输出特征图的一部分,最终通过将所有组的输出特征图在深度维度上进行拼接而形成输出特征图,使得每个输出特征图的通道都能包含来自一个特定组的信息。这样的操作确保了网络可以在减少参数的同时,还能够处理复杂的特征提取任务。
106:在分组卷积后,对特征图应用自适应平均池化,得到最终的输出特征图;
将经过分组卷积处理后的特征图数据送入自适应平均池化层中进行处理,使模型能够适应不同尺寸的输入。自适应平均池化能够自动计算池化窗口的大小和步长,以确保从任意尺寸的输入特征图中生成预定尺寸的输出特征图。具体操作如下:首先,根据输入和预期输出的尺寸比例,确定池化窗口的尺寸。然后,对输入特征图中的每个窗口计算包含元素的平均值,并将这个平均值赋给输出特征图中对应的位置。这一过程在整个输入特征图上重复执行,直到生成完整的输出特征图。该步骤通过自适应平均池化提高了模型对输入变化的不变性,降低模型的过拟合风险。
107:对输出特征图进行展平,之后将其输入全连接层,并应用激活函数以引入非线性,生成最终的分类结果,随后应用损失函数计算损失,并使用梯度下降法更新模型参数;
本发明实施例设计的损失函数由两部分组成,真实分类损失Lcls和新类预留损失Lvr。真实分类损失Lcls负责衡量真实标签和模型预测输出之间的差异,新类预留损失Lvr使用虚拟类别和虚拟样本在嵌入空间中为未学习的新类预先占位,调整嵌入空间的分布,可以帮助无人机内的巡检识别模型在学习新类别时维持对旧类别的记忆。模型在嵌入空间中预先分配一组假想原型,将它们视为虚拟类别,使模型可以在不需要真实数据的情况下练习整合和区分不同类型的信息。使用掩码确保任何单一模态或类别的影响不会主导学习过程。将两种损失函数进行加权结合,形成总损失函数,并根据总损失函数计算模型参数的梯度,使用梯度下降法逐步更新模型参数,以最小化总损失函数,迭代进行这个过程,直到达到预设的迭代次数或者模型性能没有显著提升。
108:在模型训练完成后,将模型部署到无人机上,无人机在工作过程中使用自身携带的多种传感器收集跨模态数据,提取特征,并对场景和实体进行识别。
其中,无人机在巡检过程中可以实时采集跨模态数据,并利用这些数据对机内模型进行增量学习,提高分类精度。
综上所述,本发明实施例通过上述步骤101-步骤108实现了使用不完整跨模态数据进行类增量学习,对传感器采集到的缺失数据进行补全,提高数据完整性,增强模型对现有不完全跨模态数据的挖掘能力以及对新旧类别的学习能力,提高无人机识别的准确率和无人机巡检的效率。
实施例2
下面结合图1、计算公式、表格对实施例1中的方案进行进一步地介绍,详见下文描述:
一、模型框架
模型框架由一个缺失数据补全模块、交互性融合模块、自适应平均池化层、分类器以及遗忘预防模块构成,参见图1所示。其中以下三个组成部分为方法核心:
(1)缺失数据补全模块:在训练过程中使用掩蔽自编码器来补全传感器采集到的缺失数据,提高数据质量和完整度,减轻数据不完整造成的影响。
其中,上述的掩蔽自编码器为本领域技术人员所公知,本发明实施例对此不做赘述。
(2)交互性融合模块:以往的跨模态学习策略会导致单一模态占据绝对优势地位,因此本发明实施例设计了一个交互性融合模块,使得模型能够有效整合不同模态的信息,平均学习各个模态。
(3)遗忘预防模块:由于仅使用交互性融合模块不足以解决跨模态增量学习中模态遗忘的问题,本发明实施例设计了一个遗忘预防模块,在嵌入空间中预先分配虚拟样本和虚拟类标签为未见样本和未见类别占位,有助于模型在保留旧知识的同时对新知识保持适应性。
二、数据集介绍
1、LasHeR-CIL数据集
LasHeR数据集包含1,224对空间对齐的可见光和热红外视频对,总计超过730K帧对,每一对都经过了手动标注边界框。使用这些边界框裁剪出不同类别的样本,创建了名为LasHeR-CIL的数据集,总共包括18个类别,2,324个样本。数据集在捕捉对象类别、摄像机视角、场景复杂性以及环境因素(例如:季节、天气、日夜等)方面具有极高的多样性。在LasHeR-CIL中,所有类别被分为6/1,6/2,和6/3三组,其中第一个数字表示基础会话中的类别数,第二个数字表示每个增量会话中新增的类别数。
2、VTDV-CIL数据集
VTUAV包括500个可见光-热红外序列,共1.7百万高分辨率(1920x 1080像素)帧对。本发明实施例使用边界框从VTUAV中提取了10个类别,并且使用DJI M200飞机配备的Zenmuse XT 2相机从城市道路、住宅区等不同场景中收集了5个类别,以构建跨模态CIL数据集,包含6,429个样本。在VTDV-CIL中,所有类别同样被分为3/1,3/2,和3/3三组。类似地,第一个数字表示基础会话中的类别数,第二个数字表示每个增量会话中新增的类别数。
三、缺失数据补全模块
本发明实施例使用掩蔽自编码器补全实际应用中缺失的信息,掩蔽自编码器通过掩蔽输入数据的一部分,然后训练模型预测这些被掩蔽的部分,以此来学习数据的有效表示。
在数据输入到模型之前,首先对输入数据进行部分掩蔽处理。从每个数据样本中随机选择一部分数据,并将其设置为零或替换为噪声,以模拟数据缺失或损坏的情况。接着,掩蔽的数据被送入编码器,编码器由一系列神经网络层组成,将输入数据(即部分掩蔽的数据)压缩成一个较小的、密集的内部表示,称为潜在空间表示。潜在空间表示随后被送入解码器。解码器的任务是将潜在空间的压缩表示扩展回原始数据的维度,尝试重构原始数据的完整版本。重构输出(即解码器的输出)与原始未掩蔽的输入数据进行比较,通过损失函数来量化两者之间的差异。通过反向传播来更新模型,以最小化误差。
通过补全缺失数据,提高了数据质量和完整度,减轻了数据不完整造成的影响。
四、交互性融合模块
本发明实施例设计了一个交互性融合模块,该模块包含:通道混合、分组卷积、自适应平均池化三个部分。
通道混合将通道分配到不同预定义的组中,并重新组合来自不同模态的特征通道。数学上,通道混合定义为:
其中,||表示连接,和代表从两种不同模态提取的特征组,特征通道被平均地分到不同的组中t代表第t个场景,i代表不同的模态,N是组数,C是通道数,和表示对两种不同模态中提取的特征组进行通道混合操作;表示在第t个场景中第i个模态中的特征通道的第j个元素。
在通道混合完成后,数据被输入分组卷积层,分组卷积层首先将输入的特征图分成几个独立的组,每组包含一部分特征图。同样,卷积核也被分成相应数量的组,每组卷积核只处理对应组的输入特征图。在分组完成后,每组内的卷积核将独立地与其对应的特征图进行卷积操作,每个组生成独立的输出特征图,每组的卷积核仅与其对应组的特征图互动。各个组独立进行卷积操作后,最终的输出特征图是通过将所有组的输出特征图在深度维度上进行拼接而形成的,使得每个输出特征图的通道都能包含来自一个特定组的信息。假设输入特征图X有Cin个通道,分组卷积将这些通道分为G个组,那么每组有个通道,对于每个组,都分配一个独立的卷积核W,每个卷积核仅在其对应组的通道上进行操作。将输出特征图Y分为G组,则每组有个通道。给定X是H×W×Cin维的输入特征图,K是维的卷积核,其中m×n是卷积核的空间维度大小,Y是H'×W'×Cout维的输出特征图,Cout表示输出特征图的通道数,H表示输入特征图的高度,H'表示输出特征图的高度,W'表示输出特征图的宽度。分组卷积的过程可以表示为:
对输出特征图中的每个位置(i,j),都进行如下计算:
其中,(i,j)表示输出特征图中的位置,(u,v)表示卷积核内部的空间索引,g是组索引,Xg和Yg表示输入图和输出图的第g组,Kg是第g组的卷积核。
在分组卷积完成后,将数据送入自适应平均池化层进行处理,自适应平均池化层首先根据输入和预期输出的尺寸比例,确定池化窗口的尺寸。然后,对输入特征图中的每个窗口计算其中元素的平均值,并将这个平均值赋给输出特征图中对应的位置。这一过程在整个输入特征图上重复执行,直到生成完整的输出特征图。
设输入特征图X的维度为H×W,目标输出维度为H'×W',自适应平均池化表示为:
其中,Y(i,j)是输出特征图在位置(i,j)的元素,Ri,j是输入特征图中对应于输出(i,j)的区域,Area(Ri,j)是区域Ri,j中包含的像素数,(h,w)是区域Ri,j内的像素坐标。
通过交互性融合模块,不同模态的数据特征得到整合,增强了特征表达的丰富度,使得模型能够捕捉到更多细节和信息,帮助模型避免过度依赖某单一数据源的特征。
五、遗忘预防模块
本发明实施例设计了一个遗忘预防模块,在嵌入空间预分配了一组假想原型,并将它们视为虚拟类别。然后在不同数据样本的特征表示之间进行插值,创建新的虚拟混合特征来生成虚拟样本。
过程如下:在训练集中随机选取两个样本x1和x2及其对应的标签y1和y2,将这两个样本分别输入到神经网络中,前向传播至选择的隐藏层。设选择的隐藏层对于x1和x2的输出分别为z1和z2。在隐藏层的输出z1和z2上进行插值,生成一个新的内部表示z:z=λz1+(1-λ)z2,其中λ是一个插值系数,控制插值的程度。对对应的标签也进行相应的插值:y=λy1+(1-λ)y2。将插值得到的新表示z继续通过神经网络的剩余部分前向传播,得到最终的输出,即虚拟样本。
为了给新类别预留空间,构建了一种虚拟损失:
其中,是虚拟类别标签,y'是现有类别中的伪标签,Limg表示通过Mask函数保留的新类别空间,Lmi和Lmc用于避免对旧类别空间的过度压缩,fi(x)表示网络对输入样本x生成的特征表示,fi(m)表示网络对混合样本生成的特征表示。Mask函数定义为:
其中,表示哈达马乘积(逐元素乘法),用于将特征向量与一个独热编码向量的逐元素补码相乘。独热编码向量OneHot(y)表示当前已知类别的标签,其余类别位置为0,当前类别位置为1。通过1-OneHot(y)操作,将已知类别的位置置0,未知类别的位置置1。这样,特征向量中对应已知类别的成分被清零,而保留了可能属于未知类别的成分。目标函数最终定义为:
L(x,m,y)=Lcls(fi(x),y)+λ1Lvr(x,m,y)
其中,Lcls表示通过余弦相似度来计算的基础损失函数,λ1是一个平衡因子,用来调整Lvr的相对重要性大小,x表示模型的原始输入数据,y表示与输入x相对应的真实类别标签。
六、跨模态信息融合模块
上述模态补全模块、交互性融合模块、遗忘预防模块组合,构成了本发明实施例的跨模态信息融合模块。
跨模态信息融合模块应用于该发明的工作过程如下:
首先,使用掩蔽自编码器对缺失的跨模态数据进行补全,完善数据;其次,使用交互性融合模块对补全后的数据进行通道混合、分组卷积、自适应平均池化,整合跨模态数据的特征,帮助模型捕捉到更多信息;最后,利用遗忘预防模块,在嵌入空间预分配一组被视为虚拟类别的假想原型,并创建新的虚拟混合特征来生成增强数据样本。通过计算设计好的总损失函数的值,应用梯度下降法来更新模型参数,直到模型性能不再显著改进或达到预设的迭代次数。最终得到训练好的模型。
七、分类器
分类器的结构包括一个全连接层,其输出层的神经元数目对应于迄今为止(当前阶段及所有之前的阶段)遇到的所有类别的总数。随着增量学习的推进,每当引入新的类别时,输出层的神经元数量将相应增加。
这样的设计确保了分类器能够适应不断增加的类别数量,从而持续学习和适应新的数据。
综上所述,本发明实施例通过上述部分实现了对实际应用中缺失模态数据的补全,缓解了单一模态占据绝对优势地位的问题,提高了模型对新旧类的学习能力,减轻模型的灾难性遗忘现象,提高无人机的目标检测能力,大幅度提高巡检效率。
实施例3
下面结合图2、图3,具体的实验数据对实施例1和2中的方案进行可行性验证,详见下文描述:
使用LasHeR-CIL数据集和VTDV-CIL数据集进行方法的验证。
将LasHeR-CIL数据集上的基类学习率和epoch设置为0.05和1000,新类学习率和epoch设置为0.05和500,交互性融合组数设置为8。在VTDV-CIL数据集上,将基类学习率和epoch设置为0.1和1000,新类学习率和epoch设置为0.1和300,交互性融合组数为4。最终结果采取5次实验的平均结果。为了公平比较,所有类增量学习方法都采用相加特征图的方式来实现跨模态类增量学习。
本发明实施例中的实验采用平均准确率ACC、性能下降率PD作为类增量学习的评价指标。ACC主要用于评估模型的整体性能,使用所有学习阶段的准确率的平均值来计算:
其中ACCt表示第t个阶段后Top-1精度,ACCt越高表示预测精度越好。PD主要评估模型在连续学习过程中的遗忘程度。PD可以通过第一个阶段和最后一个阶段的精度之差计算:
PD=ACC0-ACCT
其中ACC0表示第一个阶段的精度,ACCT表示最后一个阶段的精度。
此外,考虑到不同模型在第一阶段的准确性可能存在差异,这可能会影响PD的评估,提出了一个衡量遗忘程度的新指标,称为归一化性能下降率NPD,如下:
PD和NPD都是用来评估遗忘程度的指标,值越低意味着遗忘程度越小。
将实验结果和以下5种基线方法进行比较:DER、FOSTER、MEMO、PODNet、MRFA+PDF,对于所有方法,均进行5次实验,最终结果取5次实验的平均结果。
表1中展示了在LasHeR-CIL数据集上的每个增量阶段中不同新类别的准确率、性能下降率和归一化性能下降率,综合体现了本发明实施例提供模型的性能。本发明实施例考虑到跨模态类增量学习中可能存在的数据不全问题、单一模态占优问题和遗忘问题,对数据进行补全融合处理,因此可提高模型性能。
表1在LasHeR-CIL数据集上的增量学习结果(准确率、性能下降率、归一化性能下降率)
此外,本发明实施例对于自身组件的有效性进行验证,如表2所示。其中,Completion表示数据补全,Visible表示可见光模态,Thermal表示红外线模态。实验结果体现了模型各个组件设计的有效性和必要性。
表2LasHeR-CIL数据集上的消融实验结果
实施例4
一种基于缺失跨模态数据类增量学习的无人机巡检装置,该装置包括:处理器1和存储器2,存储器2中存储有程序指令,处理器1调用存储器2中存储的程序指令以使装置执行实施例1中的以下方法步骤:
对无人机收集到的缺失数据进行补全;对补全后的数据进行预处理,获取数据中隐藏的各模态的特征;对输入特征图中不同模态的特征通道进行混合;
对混合后的输入特征图中的每个组分配一套卷积核,进行分组卷积后,对特征图应用自适应平均池化,得到最终的输出特征图;
对输出特征图进行展平,之后将其输入全连接层,并应用激活函数以引入非线性,生成最终的分类结果,随后应用损失函数计算损失,并使用梯度下降法更新模型参数;在模型训练完成后部署到无人机上,无人机对场景和实体进行识别。
其中,对输入特征图中不同模态的特征通道进行混合具体为:
将输入特征图中来自各个模态的特征划分为不同通道,将来自每个模态的特征通道均匀分组,从每组中选择通道并与另一模态的对应组进行混合。
其中,损失函数由两部分组成,真实分类损失Lcls和新类预留损失Lvr,
真实分类损失Lcls用于衡量真实标签和模型预测输出之间的差异;
新类预留损失Lvr使用虚拟类别和虚拟样本在嵌入空间中为未学习的新类预先占位,调整嵌入空间的分布,帮助无人机内的巡检识别模型在学习新类别时维持对旧类别的记忆。
其中,对无人机收集到的缺失数据进行补全为:在训练过程中使用掩蔽自编码器来补全传感器采集到的缺失数据。
其中,通道混合将通道分配到不同预定义的组中,并重新组合来自不同模态的特征通道,通道混合定义为:
其中,||表示连接,和代表从两种不同模态提取的特征组,特征通道被平均地分到不同的组中t代表第t个场景,i代表不同的模态,N是组数,C是通道数,和表示对两种不同模态中提取的特征组进行通道混合操作;表示在第t个场景中第i个模态中的特征通道的第j个元素。
其中,虚拟样本为:
在训练集中随机选取两个样本x1和x2及其对应的标签y1和y2,将这两个样本分别输入到神经网络中,前向传播至选择的隐藏层,设选择的隐藏层对于x1和x2的输出分别为z1和z2;在隐藏层的输出z1和z2上进行插值,生成一个新的内部表示z:z=λz1+(1-λ)z2,其中λ是一个插值系数,对对应的标签进行相应的插值:y=λy1+(1-λ)y2,将插值得到的新表示z继续通过神经网络的剩余部分前向传播,得到最终的输出。
其中,样本对应的虚拟损失为:
其中,是虚拟类别标签,y'是现有类别中的伪标签,Limg表示通过Mask函数保留的新类别空间,Lmi和Lmc用于避免对旧类别空间的过度压缩,fi(x)表示网络对输入样本x生成的特征表示,fi(m)表示网络对混合样本生成的特征表示,Mask函数定义为:
其中,表示哈达马乘积,用于将特征向量与一个独热编码向量的逐元素补码相乘,独热编码向量OneHot(y)表示当前已知类别的标签,其余类别位置为0,当前类别位置为1,通过1-OneHot(y)操作,将已知类别的位置置0,未知类别的位置置1,目标函数最终定义为:
L(x,m,y)=Lcls(fi(x),y)+λ1Lvr(x,m,y)
其中,Lcls表示通过余弦相似度来计算的基础损失函数,λ1是一个平衡因子,用于调整Lvr的相对重要性大小,x表示模型的原始输入数据,y表示与输入x相对应的真实类别标签。
这里需要指出的是,以上实施例中的装置描述是与实施例中的方法描述相对应的,本发明实施例在此不做赘述。
上述的处理器1和存储器2的执行主体可以是计算机、单片机、微控制器等具有计算功能的器件,具体实现时,本发明实施例对执行主体不做限制,根据实际应用中的需要进行选择。
存储器2和处理器1之间通过总线3传输数据信号,本发明实施例对此不做赘述。
实施例5
基于同一发明构思,本发明实施例还提供了一种计算机可读存储介质,存储介质包括存储的程序,在程序运行时控制存储介质所在的设备执行上述实施例中的方法步骤。
该计算机可读存储介质包括但不限于快闪存储器、硬盘、固态硬盘等。
这里需要指出的是,以上实施例中的可读存储介质描述是与实施例中的方法描述相对应的,本发明实施例在此不做赘述。
在上述实施例中,可以全部或部分地通过软件、硬件、固件或者其任意组合来实现。当使用软件实现时,可以全部或部分地以计算机程序产品的形式实现。计算机程序产品包括一个或多个计算机指令。在计算机上加载和执行所述计算机程序指令时,全部或部分地产生按照本发明实施例的流程或功能。
计算机可以是通用计算机、专用计算机、计算机网络、或者其他可编程装置。计算机指令可以存储在计算机可读存储介质中,或者通过计算机可读存储介质进行传输。计算机可读存储介质可以是计算机能够存取的任何可用介质或者是包含一个或多个可用介质集成的服务器、数据中心等数据存储设备。可用介质可以是磁性介质或者半导体介质等。
本发明实施例对各器件的型号除做特殊说明的以外,其他器件的型号不做限制,只要能完成上述功能的器件均可。
本领域技术人员可以理解附图只是一个优选实施例的示意图,上述本发明实施例序号仅仅为了描述,不代表实施例的优劣。
以上所述仅为本发明的较佳实施例,并不用以限制本发明,凡在本发明的精神和原则之内,所作的任何修改、等同替换、改进等,均应包含在本发明的保护范围之内。
Claims (7)
1.一种基于缺失跨模态数据类增量学习的无人机巡检方法,其特征在于,所述方法包括:
对无人机收集到的缺失数据进行补全;对补全后的数据进行预处理,获取数据中隐藏的各模态的特征;对输入特征图中不同模态的特征通道进行混合;
对混合后的输入特征图中的每个组分配一套卷积核,进行分组卷积后,对特征图应用自适应平均池化,得到最终的输出特征图;
对输出特征图进行展平,之后将其输入全连接层,并应用激活函数以引入非线性,生成最终的分类结果,随后应用损失函数计算损失,并使用梯度下降法更新模型参数;在模型训练完成后部署到无人机上,无人机对场景和实体进行识别;
所述对输入特征图中不同模态的特征通道进行混合具体为:
将输入特征图中来自各个模态的特征划分为不同通道,将来自每个模态的特征通道均匀分组,从每组中选择通道并与另一模态的对应组进行混合;
所述通道混合将通道分配到不同预定义的组中,并重新组合来自不同模态的特征通道,通道混合定义为:
;
;
其中,表示连接,和代表从两种不同模态提取的特征组,特征通道被平均地分到不同的组中,代表第个场景,代表不同的模态,是组数,是通道数,和表示对两种不同模态中提取的特征组进行通道混合操作;表示在第个场景中第个模态中的特征通道的第个元素。
2.根据权利要求1所述的一种基于缺失跨模态数据类增量学习的无人机巡检方法,其特征在于,所述损失函数由两部分组成,真实分类损失和新类预留损失,
所述真实分类损失用于衡量真实标签和模型预测输出之间的差异;
所述新类预留损失使用虚拟类别和虚拟样本在嵌入空间中为未学习的新类预先占位,调整嵌入空间的分布,帮助无人机内的巡检识别模型在学习新类别时维持对旧类别的记忆。
3.根据权利要求2所述的一种基于缺失跨模态数据类增量学习的无人机巡检方法,其特征在于,所述对无人机收集到的缺失数据进行补全为:在训练过程中使用掩蔽自编码器来补全传感器采集到的缺失数据。
4.根据权利要求2所述的一种基于缺失跨模态数据类增量学习的无人机巡检方法,其特征在于,所述虚拟样本为:
在训练集中随机选取两个样本和及其对应的标签和,将这两个样本分别输入到神经网络中,前向传播至选择的隐藏层,设选择的隐藏层对于和的输出分别为和;在隐藏层的输出和上进行插值,生成一个新的内部表示:,其中是一个插值系数,对对应的标签进行相应的插值:,将插值得到的新表示继续通过神经网络的剩余部分前向传播,得到最终的输出。
5.根据权利要求4所述的一种基于缺失跨模态数据类增量学习的无人机巡检方法,其特征在于,所述样本对应的虚拟损失为:
;
其中,是虚拟类别标签,是现有类别中的伪标签,表示通过函数保留的新类别空间,和用于避免对旧类别空间的过度压缩,表示网络对输入样本生成的特征表示,表示网络对混合样本生成的特征表示,函数定义为:
;
其中,表示哈达马乘积,用于将特征向量与一个独热编码向量的逐元素补码相乘,独热编码向量表示当前已知类别的标签,其余类别位置为0,当前类别位置为1,通过操作,将已知类别的位置置0,未知类别的位置置1,目标函数最终定义为:
;
其中,表示通过余弦相似度来计算的基础损失函数,是一个平衡因子,用于调整的相对重要性大小,表示模型的原始输入数据,表示与输入相对应的真实类别标签。
6.一种基于缺失跨模态数据类增量学习的无人机巡检装置,其特征在于,所述装置包括:处理器和存储器,所述存储器中存储有程序指令,所述处理器调用存储器中存储的程序指令以使装置执行权利要求1-5中的任一项所述的方法。
7.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质存储有计算机程序,所述计算机程序包括程序指令,所述程序指令被处理器执行时使所述处理器执行权利要求1-5中的任一项所述的方法。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202411338769.4A CN119206552B (zh) | 2024-09-25 | 2024-09-25 | 基于缺失跨模态数据类增量学习的无人机巡检方法及装置 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202411338769.4A CN119206552B (zh) | 2024-09-25 | 2024-09-25 | 基于缺失跨模态数据类增量学习的无人机巡检方法及装置 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| CN119206552A CN119206552A (zh) | 2024-12-27 |
| CN119206552B true CN119206552B (zh) | 2026-05-08 |
Family
ID=94077837
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| CN202411338769.4A Active CN119206552B (zh) | 2024-09-25 | 2024-09-25 | 基于缺失跨模态数据类增量学习的无人机巡检方法及装置 |
Country Status (1)
| Country | Link |
|---|---|
| CN (1) | CN119206552B (zh) |
Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN115201777A (zh) * | 2022-07-26 | 2022-10-18 | 电子科技大学 | 一种基于嵌入预定的雷达一维像目标增量识别方法 |
| CN116721458A (zh) * | 2023-05-04 | 2023-09-08 | 桂林电子科技大学 | 一种基于跨模态时序对比学习的自监督动作识别方法 |
Family Cites Families (4)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN113326289B (zh) * | 2021-08-02 | 2021-11-02 | 山东大学 | 面向携带新类别的增量数据的快速跨模态检索方法及系统 |
| US12511549B2 (en) * | 2022-07-08 | 2025-12-30 | Mitsubishi Electric Research Laboratories, Inc. | System and method for cross-modal knowledge transfer without task-relevant source data |
| CN115329108A (zh) * | 2022-08-21 | 2022-11-11 | 南京理工大学 | 一种用于细粒度跨模态检索的通道混合方法 |
| CN115438755B (zh) * | 2022-11-08 | 2024-04-02 | 腾讯科技(深圳)有限公司 | 分类模型的增量训练方法、装置和计算机设备 |
-
2024
- 2024-09-25 CN CN202411338769.4A patent/CN119206552B/zh active Active
Patent Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN115201777A (zh) * | 2022-07-26 | 2022-10-18 | 电子科技大学 | 一种基于嵌入预定的雷达一维像目标增量识别方法 |
| CN116721458A (zh) * | 2023-05-04 | 2023-09-08 | 桂林电子科技大学 | 一种基于跨模态时序对比学习的自监督动作识别方法 |
Also Published As
| Publication number | Publication date |
|---|---|
| CN119206552A (zh) | 2024-12-27 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US8620026B2 (en) | Video-based detection of multiple object types under varying poses | |
| CN115861619A (zh) | 一种递归残差双注意力核点卷积网络的机载LiDAR城市点云语义分割方法与系统 | |
| CN114519819B (zh) | 一种基于全局上下文感知的遥感图像目标检测方法 | |
| CN107220603A (zh) | 基于深度学习的车辆检测方法及装置 | |
| CN120708071B (zh) | 基于无人机的道路病害检测方法、电子设备及程序产品 | |
| CN116246147B (zh) | 基于跨层特征融合和线性注意力优化的跨物种目标检测方法 | |
| CN114842434A (zh) | 计算机视觉模型的验证 | |
| CN113628206B (zh) | 一种车牌检测方法、装置、介质 | |
| CN121438142A (zh) | 一种面向无人机航拍场景的密集小目标检测方法 | |
| Cui et al. | Global context dependencies aware network for efficient semantic segmentation of fine-resolution remoted sensing images | |
| CN117437382B (zh) | 一种数据中心部件的更新方法及系统 | |
| Kovačovič et al. | Satellite-based forest stand detection using artificial intelligence | |
| CN114882490B (zh) | 一种基于点引导定位的无受限场景车牌检测分类方法 | |
| CN120766158A (zh) | 一种基于改进的YOLOv8的障碍物识别方法、装置、设备、介质及产品 | |
| CN120147608A (zh) | 一种结合YOLOv8检测算法与KCF跟踪算法的目标检测跟踪方法 | |
| CN120088756A (zh) | 基于暗通道去雾和改进YOLOv8的无人驾驶车交通锥检测方法 | |
| CN119206552A (zh) | 基于缺失跨模态数据类增量学习的无人机巡检方法及装置 | |
| CN119832211A (zh) | 一种航拍场景红外小目标检测方法、电子设备及存储介质 | |
| Baumer et al. | Automatic Image Compositing and Snow Segmentation for Alpine Snow Cover Monitoring | |
| CN118968346A (zh) | 一种航空图像目标检测方法、系统、设备及存储介质 | |
| CN119131471B (zh) | 基于跨模态数据类增量学习的无人机巡检方法及系统 | |
| CN118072163A (zh) | 基于神经网络的国土耕地违规占用高精度检测方法及系统 | |
| CN116797836A (zh) | 基于场景知识集成网络的输电线路多目标检测方法 | |
| CN116309437A (zh) | 一种灰尘检测方法、装置及存储介质 | |
| Ahmed et al. | Unmanned aerial multi-object dynamic frame detection and skipping using deep learning on the internet of drones |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PB01 | Publication | ||
| PB01 | Publication | ||
| SE01 | Entry into force of request for substantive examination | ||
| SE01 | Entry into force of request for substantive examination | ||
| GR01 | Patent grant |