WO2025148253A1 - 一种多模态图像匹配方法、系统、终端设备及存储介质 - Google Patents

一种多模态图像匹配方法、系统、终端设备及存储介质

Info

Publication number
WO2025148253A1
WO2025148253A1 PCT/CN2024/103035 CN2024103035W WO2025148253A1 WO 2025148253 A1 WO2025148253 A1 WO 2025148253A1 CN 2024103035 W CN2024103035 W CN 2024103035W WO 2025148253 A1 WO2025148253 A1 WO 2025148253A1
Authority
WO
WIPO (PCT)
Prior art keywords
image
sar
optical image
feature
matching
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
PCT/CN2024/103035
Other languages
English (en)
French (fr)
Inventor
王青松
刘逸均
林明鑫
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Sun Yat Sen University
Original Assignee
Sun Yat Sen University
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Sun Yat Sen University filed Critical Sun Yat Sen University
Priority to US18/954,565 priority Critical patent/US12354322B1/en
Publication of WO2025148253A1 publication Critical patent/WO2025148253A1/zh
Anticipated expiration legal-status Critical
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/74Image or video pattern matching; Proximity measures in feature spaces
    • G06V10/75Organisation of the matching processes, e.g. simultaneous or sequential comparisons of image or video features; Coarse-fine approaches, e.g. multi-scale approaches; using context analysis; Selection of dictionaries
    • G06V10/757Matching configurations of points or features
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/0464Convolutional networks [CNN, ConvNet]
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/0895Weakly supervised learning, e.g. semi-supervised or self-supervised learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/20Image preprocessing
    • G06V10/26Segmentation of patterns in the image field; Cutting or merging of image elements to establish the pattern region, e.g. clustering-based techniques; Detection of occlusion
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/82Arrangements for image or video recognition or understanding using pattern recognition or machine learning using neural networks

Definitions

  • the present invention relates to the field of deep learning and image technology, and in particular to a multimodal image matching method, system, terminal device and storage medium.
  • SAR-optical image matching is a key step in multimodal image information fusion.
  • Image matching methods can be divided into feature-based and region-based methods.
  • Feature-based methods include classic methods such as SIFT and SAR-SIFT, which are widely used.
  • SIFT phase consistency-based method
  • RIFT phase consistency instead of pixel intensity for feature extraction.
  • Phase consistency is based on frequency domain detection features and can better resist nonlinear radiation differences between images.
  • the LINFT method proposes that the HOG feature is robust to intensity changes and can achieve good results when applied to optical and SAR image matching tasks.
  • Feature-based methods such as SIFT and SAR-SIFT
  • SIFT and SAR-SIFT usually rely on image gradient information for feature extraction and description, and do not work well in SAR-optical image heterogeneous matching.
  • Methods such as RIFT and LINFT that adapt SAR images and optical images can combat nonlinear intensity differences to a certain extent, but they cannot capture the deep and complex feature representations shared by heterogeneous images, but rely on shallow features (such as corners and edge points) for matching. This method is easily disturbed by noise.
  • an embodiment of the present invention provides a multimodal image matching method, comprising:
  • the loss function includes a first loss function, a second loss function and a third loss function
  • the first loss function, the second loss function and the third loss function are weightedly summed to obtain the loss function.
  • the multimodal image matching method, system, terminal device and storage medium of the embodiment of the present invention have the following beneficial effects: using a neural network to autonomously learn the areas with strong matching between SAR images and optical images as feature points, which is more advantageous than traditional geometric operators in extracting repeatable feature points of heterogeneous images, and effectively improves the matching accuracy; using a dual-branch network composed of a transformer-CNN joint framework can extract richer deep features shared by SAR-optical heterogeneous images, and has stronger anti-interference ability and better robustness than traditional feature extraction methods and methods based on convolutional neural networks; using a two-stage training method of description then detection to link the mutually isolated feature detection modules and feature description modules in the traditional feature-based matching method, so that the matching relationship between images constrains the selection of feature points, and obtains feature points that are more conducive to matching.
  • FIG1 is a schematic diagram of a flow chart of a multimodal image matching method according to an embodiment of the present invention.
  • FIG. 3 is a schematic diagram of a process of constructing a loss function according to a key point score graph according to an embodiment of the present invention
  • FIG. 9 is a schematic diagram of the structure of the second branch network according to an embodiment of the present invention.
  • FIG. 10 is a schematic diagram of a process of performing feature matching on an optical image and a SAR image according to a feature description vector according to an embodiment of the present invention
  • FIG11 is a schematic diagram of feature matching results according to an embodiment of the present invention.
  • FIG. 12 is a schematic diagram of the structure of a multimodal image matching system according to an embodiment of the present invention.
  • the embodiment of the present invention regards the extraction of feature points as a self-supervised task, and learns repeatable feature points between SAR images and optical images through a neural network.
  • constructing a loss function according to the key point score graph in step S103 includes:
  • the key point score map ⁇ Score s U, Score o ⁇ is divided into a second image block sequence of size N ⁇ N.
  • the loss function includes a first loss function, a second loss function and a third loss function
  • Is represents the SAR image
  • Io represents the optical image
  • U represents the affine transformation
  • Scoreo (i) represents the i-th image block in the optical image block sequence
  • ScoresU (i) represents the i-th image block in the SAR image block sequence
  • m represents the number of image blocks in the second image block sequence.
  • I represents the SAR-optical image pair
  • Score(i) represents the i-th image block of the second image block sequence
  • the first loss function and the second loss function can learn the common repeatable features between heterogeneous images and obtain evenly distributed feature points, which is beneficial to feature matching.
  • AP ij represents the average precision of the pixel at position (i, j) of the SAR-optical image pair
  • Score ij represents the score of the pixel at position (i, j) of the SAR-optical image pair
  • ⁇ [0,1] represents a hyperparameter, which represents the minimum expected AP ij value.
  • step S1 the method includes: using a local normalization filter to convert the optical image and the SAR image into a normalized image.
  • this embodiment uses a local normalization filter to retain the relevant detail information between the two modal images, thereby improving the matching performance.
  • I(x,y) represents the original image
  • I norm (x,y) represents the normalized image
  • M(x,y,d) is a local window centered at (x,y) with a size of (2*d+1 ⁇ 2*d+1).
  • the local normalization filter is implemented by the difference between the original image and its average filtering result. The purpose of the average filtering is to remove the detail structure information in the original image. Therefore, the local normalization filter retains the image detail component and helps to extract the common structural features between heterogeneous images.
  • the filtering result of the local normalization filter can be seen in Figure 5.
  • the convolution layer consists of two 2D convolution layers ConvBR (convolution kernel is 3 ⁇ 3, step size is 2, padding size is 1) and ResNet Block.
  • ConvBR convolution kernel is 3 ⁇ 3, step size is 2, padding size is 1
  • ResNet Block ResNet Block
  • the first branch network of this embodiment includes Lite-Transformer, a fully connected layer, and a normalization layer.
  • This embodiment uses the transformer's spatial self-attention mechanism to construct the first branch network, as shown in Figure 8.
  • the self-attention mechanism the input shallow features are first flattened into a series of feature vectors A ⁇ R h*w ⁇ c - for each pixel, where c_ is the dimension of the feature vector. Then the transfer matrix ⁇ W q ,W k ,W v ⁇ is used to generate the corresponding triple (query, key, value), i.e. (Q, K, V), and the mathematical expression is expressed by the following formula:
  • the generated triples are then input into the Attention layer: the weighted inner product E of K and Q is calculated, and the corresponding weights are obtained through the softmax function. The obtained weights and V are weighted summed to obtain the final attention feature vector B.
  • E and B are specifically expressed by the following formula:
  • this embodiment uses the nearest neighbor search method (NN) and the random sampling consensus method (RANSAC) to perform feature matching and feature matching pair purification.
  • NN nearest neighbor search method
  • RANSAC random sampling consensus method
  • step S3 includes:
  • a feature description module 2 is used to segment the optical image and the SAR image into a first image block sequence according to repeatable feature points, and extract features from the first image block sequence through a dual-branch network to obtain feature description vectors of the optical image and the SAR image respectively;
  • the dual-branch network includes a first branch network for extracting global features and a second branch network for extracting local features;
  • An embodiment of the present invention further provides a terminal device, the terminal device comprising:
  • the bus is used to connect the processor and the memory
  • the processor is used to call the operation instruction, and the executable instruction enables the processor to perform the operation corresponding to the multimodal image matching method as described above in the present invention.
  • a terminal device is provided, as shown in FIG13, and the terminal device 5000 shown in FIG13 includes: a processor 5001 and a memory 5003.
  • the processor 5001 and the memory 5003 are connected, such as through a bus 5002.
  • the terminal device 5000 may also include a transceiver 5004. It should be noted that in actual applications, the transceiver 5004 is not limited to one, and the structure of the terminal device 5000 does not constitute a limitation on the embodiment of the present invention.
  • Processor 5001 may be a CPU, a general-purpose processor, a DSP, an ASIC, an FPGA or other programmable logic device, a transistor logic device, a hardware component or any combination thereof. It may implement or execute various exemplary logic blocks, modules and circuits described in conjunction with the disclosure of the present invention. Processor 5001 may also be a combination that implements computing functions, such as a combination of one or more microprocessors, a combination of a DSP and a microprocessor, etc.
  • the bus 5002 may include a path to transmit information between the above components.
  • the bus 5002 may be a PCI bus or an EISA bus, etc.
  • the bus 5002 may be divided into an address bus, a data bus, a control bus, etc. For ease of representation, only one thick line is used in FIG. 13, but it does not mean that there is only one bus or one type of bus.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Evolutionary Computation (AREA)
  • Health & Medical Sciences (AREA)
  • Artificial Intelligence (AREA)
  • Computing Systems (AREA)
  • General Health & Medical Sciences (AREA)
  • Software Systems (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Multimedia (AREA)
  • Databases & Information Systems (AREA)
  • Medical Informatics (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Biomedical Technology (AREA)
  • Biophysics (AREA)
  • Computational Linguistics (AREA)
  • Data Mining & Analysis (AREA)
  • Molecular Biology (AREA)
  • General Engineering & Computer Science (AREA)
  • Mathematical Physics (AREA)
  • Image Analysis (AREA)

Abstract

本发明公开了一种多模态图像匹配方法、系统、终端设备及存储介质,该方法包括:对光学图像和SAR图像进行自监督特征提取,得到光学图像和SAR图像之间的可重复特征点;根据可重复特征点将光学图像和SAR图像分割成第一图像块序列,并通过双分支网络对第一图像块序列进行特征提取,分别得到光学图像和SAR图像的特征描述向量;双分支网络包括用于提取全局特征的第一分支网络和用于提取局部特征的第二分支网络;根据特征描述向量对光学图像和SAR图像进行特征匹配,以得到光学图像和SAR图像之间的匹配点对。本发明采用两段式的训练方法首先训练得到稳健的SAR-光学图像特征描述向量,再结合特征描述向量学习到高匹配性能的特征点。

Description

一种多模态图像匹配方法、系统、终端设备及存储介质 技术领域
本发明涉及深度学习和图像技术领域,特别是涉及一种多模态图像匹配方法、系统、终端设备及存储介质。
背景技术
SAR-光学图像匹配是多模态图像信息融合的关键步骤,图像匹配方法可以分为基于特征和基于区域的方法。
基于特征的方法包括SIFT和SAR-SIFT等经典方法,它们被广泛使用。针对SAR图像和光学图像之间存在非线性辐射畸变和图像强度差异显著等所导致的匹配难题,Li提出了一种基于相位一致性的方法即RIFT,其利用相位一致性代替像素强度进行特征提取。相位一致性基于频域检测特征,能够较好地抵抗图像间的非线性辐射差异。类似地,LINFT方法中提出,HOG特征队强度变化具有鲁棒性,应用于光学和SAR图像匹配任务中可以获得良好的效果。
基于区域的方法是利用图像的灰度信息来度量图像之间的相似程度。常用的相似性度量包括归一化互相关(NCC)、互信息(MI)和均方误差(SSD)等。为了应对异源图像之间的非线性辐射畸变,Ye基于图像的结构相似性提出了新的相似性度量CFOG,CFOG的思想来源于HOG特征,通过计算像素的梯度方向直方图,对图像进行逐像素的特征表示。而且,CFOG还将结构特征转化到频率空间,并利用快速傅里叶变换加速匹配。
为了获得深层特征,许多研究者采用了深度神经网络进行特征提取和描述。Wu利用CNN网络逐像素生成异源图像之间具有相关性的特征图,再通过模板匹配的方式获得匹配关系。基于学习的方法无需手动设计复杂的描述符。Liao等人设计了一个深度卷积网络MatchosNet, 其中包含密集块和跨阶段局部网络,用于生成深度描述符用作SAR图像和光学图像的匹配。另外,Mihai Dusmanu则提出了一种使用单个卷积神经网络同时进行特征检测并提取密集的特征描述符的方法,通过将检测特征点放到处理的后期阶段,从而获得更稳定的关键点。这些方法都是通过深度网络获得异源图像之间相关的高级特征。
然而,上述方法都存在一些各自的缺点。基于特征的方法,如SIFT和SAR-SIFT,通常依赖于图像梯度信息进行特征提取和描述,在SAR-光学图像异源匹配中效果不佳。对SAR图像和光学图像进行适应的RIFT和LINFT等方法可以在一定程度上对抗非线性强度差异,但它们无法捕捉异源图像共有的深层复杂特征表示,而是依赖于浅层特征(如角点和边缘点等)进行匹配。这种方法容易受到噪声的干扰。
SAR图像和光学图像之间存在非线性辐射畸变,像素强度差异大。基于区域的方法依赖于图像的灰度信息,因此不适用,并且容易受到图像失真的影响,计算量较大,限制了其在多模态图像匹配中的应用。
目前使用神经网络获得异源图像之间相关的高级特征的方法一般采样单一的深度卷积网络CNN进行特征提取和描述,解释性较差,难以挖掘异源图像的全局特征信息。此外,这些方法无法获得可重复的特征点,增加了匹配正样本和相似负样本之间的不可区分性。
发明内容
本发明要解决的技术问题是基于特征的方法无法获得异源图像之间更深层的特征进行匹配;基于区域的方法对灰度变换敏感,容易受到图像失真影响且计算量大;一般基于神经网络的异源图像匹配方法采用单一的CNN网络进行特征提取且忽略可重复性特征点的提取。为了解决上述技术问题,本发明提供了一种多模态图像匹配方法、系统、终端设备及存储介质。
第一方面,本发明实施例提供了一种多模态图像匹配方法,包括:
对光学图像和SAR图像进行自监督特征提取,得到所述光学图像 和所述SAR图像之间的可重复特征点;
根据所述可重复特征点将所述光学图像和所述SAR图像分割成第一图像块序列,并通过双分支网络对所述第一图像块序列进行特征提取,分别得到所述光学图像和所述SAR图像的特征描述向量;所述双分支网络包括用于提取全局特征的第一分支网络和用于提取局部特征的第二分支网络;
根据所述特征描述向量对所述光学图像和所述SAR图像进行特征匹配,以得到所述光学图像和所述SAR图像之间的匹配点对。
优选地,在所述对光学图像和SAR图像进行自监督特征提取之前,包括:
采用局部归一化滤波器将光学图像和SAR图像转化为归一化图像。
优选地,所述对光学图像和SAR图像进行自监督特征提取,得到所述光学图像和所述SAR图像之间的可重复特征点,包括:
将光学图像和SAR图像组成SAR-光学图像对;
对所述SAR-光学图像对进行自监督学习,获得关键点得分图;
根据所述关键点得分图构建损失函数,并利用所述损失函数优化所述自监督学习,以学习到所述光学图像和所述SAR图像之间的可重复特征点。
优选地,所述根据所述关键点得分图构建损失函数,包括:
将所述关键点得分图划分为第二图像块序列;所述第二图像块序列包括SAR图像块序列和光学图像块序列;
基于所述第二图像块序列构建损失函数;所述损失函数包括第一损失函数、第二损失函数和第三损失函数;
所述第一损失函数采用如下公式表示:
其中,Is表示SAR图像,Io表示光学图像,U表示仿射变换,Scoreo(i)表示光学图像块序列的第i个图像块,ScoresU(i)表示SAR图像块序列的 第i个图像块,m表示第二图像块序列的图像块数量;
所述第二损失函数采用如下公式表示:
其中,I表示SAR-光学图像对,Score(i)表示第二图像块序列的第i个图像块;
所述第三损失函数采用如下公式表示:
L3=1-[APijScoreij+γ(1-Scoreij)]
其中,APij表示SAR-光学图像对(i,j)位置像素对应的平均精度,Scoreij表示SAR-光学图像对(i,j)位置像素对应的得分,γ表示超参数;所述平均精度表示SAR-光学图像对对应位置像素的特征描述向量之间的相似程度;
将所述第一损失函数、所述第二损失函数和所述第三损失函数进行加权求和,得到所述损失函数。
优选地,所述双分支网络还包括用于提取浅层特征的卷积层;
所述根据所述可重复特征点将所述光学图像和所述SAR图像分割成第一图像块序列,并通过双分支网络对所述第一图像块序列进行特征提取,分别得到所述光学图像和所述SAR图像的特征描述向量,包括:
以所述可重复特征点为中心,将所述光学图像和所述SAR图像分割成第一图像块序列;
将所述第一图像块序列输入至所述卷积层,以得到所述第一图像块序列的浅层特征;
将所述浅层特征分别输入至所述第一分支网络和所述第二分支网络,以得到所述第一图像块序列的全局特征和局部特征;
将所述全局特征和所述局部特征拼接并通过卷积处理,得到所述第一图像块序列的特征描述向量。
优选地,所述第一分支网络包括Lite-Transformer、全连接层和 归一化层;所述第二分支网络包括第一CSP模块、连接层和第二CSP模块。
优选地,所述根据所述特征描述向量对所述光学图像和所述SAR图像进行特征匹配,以得到所述光学图像和所述SAR图像之间的匹配点对,包括:
采用最近邻搜索法对所述光学图像和所述SAR图像进行特征匹配,得到所述光学图像和所述SAR图像之间的初始匹配点对;
采用随机抽样一致性对所述初始匹配点对进行提纯,得到所述光学图像和所述SAR图像之间的目标匹配点对。
第二方面,本发明实施例提供了一种多模态图像匹配系统,包括:
特征点提取模块,用于对光学图像和SAR图像进行自监督特征提取,得到所述光学图像和所述SAR图像之间的可重复特征点;
特征描述模块,用于根据所述可重复特征点将所述光学图像和所述SAR图像分割成第一图像块序列,并通过双分支网络对所述第一图像块序列进行特征提取,分别得到所述光学图像和所述SAR图像的特征描述向量;所述双分支网络包括用于提取全局特征的第一分支网络和用于提取局部特征的第二分支网络;
特征匹配模块,用于根据所述特征描述向量对所述光学图像和所述SAR图像进行特征匹配,以得到所述光学图像和所述SAR图像之间的匹配点对。
第三方面,本发明实施例提供了一种终端设备,包括处理器、存储器以及存储在所述存储器中且被配置为由所述处理器执行的计算机程序,所述处理器执行所述计算机程序时实现如上所述的多模态图像匹配方法。
第四方面,本发明实施例提供了一种计算机可读存储介质,所述计算机可读存储介质包括存储的计算机程序;其中,所述计算机程序在运行时控制所述计算机可读存储介质所在的设备执行如上所述的多模态图像匹配方法。
本发明实施例一种多模态图像匹配方法、系统、终端设备及存储介质与现有技术相比,其有益效果在于:利用神经网络自主学习SAR图像和光学图像可匹配性强的区域作为特征点,相较于传统几何算子在异源图像可重复特征点提取方面更有优势,有效提高了匹配精度;利用transformer-CNN联合框架组成的双分支网络可以提取更丰富的SAR-光学异源图像共有的深层特征,相较于传统的特征提取方法和基于卷积神经网络的方法,其抗干扰能力更强且鲁棒性更好;采用description then detection两段式的训练方法将传统基于特征的匹配方法中相互孤立的特征检测模块和特征描述模块联系起来,让图像之间的匹配关系约束特征点的选取,获得更有益于匹配的特征点。
附图说明
图1是本发明实施例一种多模态图像匹配方法的流程示意图;
图2是本发明实施例对光学图像和SAR图像进行自监督特征提取的流程示意图;
图3是本发明实施例根据关键点得分图构建损失函数的流程示意图;
图4是本发明实施例可重复特征点提取结果的示意图;
图5是本发明实施例局部归一化滤波结果的示意图;
图6是本发明实施例双分支网络的结构示意图;
图7是本发明实施例双分支网络特征提取的流程示意图;
图8是本发明实施例第一分支网络的结构示意图;
图9是本发明实施例第二分支网络的结构示意图;
图10是本发明实施例根据特征描述向量对光学图像和SAR图像进行特征匹配的流程示意图;
图11是本发明实施例特征匹配结果的示意图;
图12是本发明实施例一种多模态图像匹配系统的结构示意图;
图13是本发明实施例一种终端设备的结构示意图。
具体实施方式
下面结合附图和实施例,对本发明的具体实施方式作进一步详细描述。以下实施例用于说明本发明,但不用来限制本发明的范围。
如图1所示,本发明实施例提供了一种多模态图像匹配方法,包括步骤:
S1、对光学图像和SAR图像进行自监督特征提取,得到光学图像和SAR图像之间的可重复特征点;
在基于特征的异源图像匹配的任务中,特征点的可重复性是一个关键的问题。由于SAR图像和光学图像的畸变,传统的几何算子通常失效,无法提取可重复特征点。因此,本发明实施例将提取特征点视为自监督任务,通过神经网络学习SAR图像和光学图像之间具有可重复性的特征点。
进一步地,在一具体实施例中,如图2所示,步骤S1包括:
S101、将光学图像和SAR图像组成SAR-光学图像对;
S102、对SAR-光学图像对进行自监督学习,获得关键点得分图;
具体地,利用一个全卷积网络作为主干网络,对SAR-光学图像对进行自监督学习,获得关键点得分图。其中,关键点得分图中的局部极大值点选取为关键点。
S103、根据关键点得分图构建损失函数,并利用损失函数优化自监督学习,以学习到光学图像和SAR图像之间的可重复特征点。
为了学习到稀疏的可重复特征点,并且可以通过SAR图像和光学图像的匹配关系得到更为有效的特征点,本实施例提出了三个新的损失函数用以优化自监督学习。
进一步地,在一具体实施例中,如图3所示,步骤S103中的根据关键点得分图构建损失函数,包括:
S103-A、将关键点得分图划分为第二图像块序列;
具体地,在训练阶段,输入全卷积网络的是一对已知变换关系为U的SAR-光学图像对{Is,Io}。经过预处理后,通过自监督学习获得关键点 得分图{ScoresU,Scoreo}。ScoresU是Scores通过已知变换U得到的关键点得分图。本实施例的目标是获得异源图像共同的显著特征,因此希望输出的ScoresU与Scoreo一致,即Scoreo的所有局部极大值点与ScoresU的所有局部极大值点相对应。本实施例采取的措施是最大化它们之间的分块平均余弦相似性。因此,将关键点得分图{ScoresU,Scoreo}划分为N×N大小的第二图像块序列。其中,第二图像块序列包括SAR图像块序列ScoresU(i)(i=1...m)和光学图像块序列Scoreo(i)(i=1...m)。
S103-B、基于第二图像块序列构建损失函数。
具体地,损失函数包括第一损失函数、第二损失函数和第三损失函数;
第一损失函数采用如下公式表示:
其中,Is表示SAR图像,Io表示光学图像,U表示仿射变换,Scoreo(i)表示光学图像块序列的第i个图像块,ScoresU(i)表示SAR图像块序列的第i个图像块,m表示第二图像块序列的图像块数量。
同时,为了使每个子块能学习到一个局部极大值,构建第二损失函数;第二损失函数采用如下公式表示:
其中,I表示SAR-光学图像对,Score(i)表示第二图像块序列的第i个图像块。
上述第一损失函数和第二损失函数可以学习到异源图像之间共有的可重复性特征,且可以获得均匀分布的特征点,有利于特征匹配。
第三损失函数用于使神经网络学习到更易匹配的关键点。将输入的SAR-光学图像对{Is,Io}∈RW×H经过预处理后,通过训练好的双分支网络提取密集的特征描述向量{VS,VO}∈RW*H×256,接着采用全局度量平均精度(AP)表征异源图像对对应位置像素的特征描述向量之间的相似程度,获得图像逐像素对应的平均精度APij(i=1...H,j=1...W)。AP越大表示 特征描述向量相似程度越高。由此,为了获得更易于匹配的关键点而去除平坦区域或重复区域的干扰点,本实施例构建第三损失函数;第三损失函数采用如下公式表示:
L3=1-[APijScoreij+γ(1-Scoreij)]
其中,APij表示SAR-光学图像对(i,j)位置像素对应的平均精度,Scoreij表示SAR-光学图像对(i,j)位置像素对应的得分,γ∈[0,1]表示超参数,代表最小期望的APij数值。
当对应位置APij小于γ时,为了最小化L3,神经网络学习到该位置得分Scoreij应趋向于0。同理,当APij大于γ时,Scoreij应趋向于1。因此,为了使神经网络学习到易于异源图像之间正确匹配的特征,将第一损失函数、第二损失函数和第三损失函数进行加权求和,得到损失函数。利用损失函数优化自监督学习,学习到光学图像和SAR图像之间的可重复特征点可参见图4。
需要说明的是,在步骤S1之前,包括:采用局部归一化滤波器将光学图像和SAR图像转化为归一化图像。考虑到非线性辐射畸变,本实施例采用局部归一化滤波器保留两种模态图像之间相关的细节信息,从而提高匹配性能。
具体地,局部归一化滤波器的数学定义采用如下公式表示:
其中,I(x,y)表示原始图像,Inorm(x,y)表示归一化图像,M(x,y,d)是以(x,y)为中心,大小为(2*d+1×2*d+1)的局部窗口。局部归一化滤波器通过原始图像与其平均滤波结果的差值实现,平均滤波的目的是去除原始图像中的细节结构信息。因此,局部归一化滤波器保留了图像细节分量,有助于异源图像之间共有结构特征的提取。局部归一化滤波器的滤波结果可参见图5。
S2、根据可重复特征点将光学图像和SAR图像分割成第一图像块序列,并通过双分支网络对第一图像块序列进行特征提取,分别得到 光学图像和SAR图像的特征描述向量;
为了挖掘多尺度的多模态图像特征,如图6所示,本实施例提出了一个双分支网络。具体地,双分支网络包括用于提取全局特征的第一分支网络Global Transformer Branch和用于提取局部特征的第二分支网络Detail CNN Branch。进一步地,双分支网络还包括用于提取浅层特征的卷积层。
进一步地,在一具体实施例中,如图7所示,步骤S2包括:
S201、以可重复特征点为中心,将光学图像和SAR图像分割成第一图像块序列;
具体地,以提取的可重复特征点为中心,本实施例将光学图像和SAR图像分割成64×64大小的第一图像块序列。
S202、将第一图像块序列输入至卷积层,以得到第一图像块序列的浅层特征;
具体地,如图6所示,卷积层由两个2D卷积层ConvBR(卷积核为3×3,步长为2,填充的大小为1)和ResNet Block组成。将64×64大小的第一图像块序列作为输入,通过卷积层提取得到第一图像块序列的浅层特征数学表达采用如下公式表示:
ConvBR(I)=bn(relu(conv(I)),RES(I)=(bn(relu(conv(I)))+I
S203、将浅层特征分别输入至第一分支网络和第二分支网络,以得到第一图像块序列的全局特征和局部特征;
基于transformer良好的全局上下文信息提取能力,本实施例第一分支网络包括Lite-Transformer、全连接层和归一化层。本实施例采用transformer的空间自注意力机制构建第一分支网络,具体可参见图8。在自注意力机制中,首先将输入的浅层特征按每个像素展平为一系列的特征向量A∈Rh*w×c-,c_为特征向量的维数。然后利用转移矩阵{Wq,Wk,Wv}生成对应三元组(query,key,value)即(Q,K,V),数学表达采用如下公式表示:
生成的三元组接着输入Attention层:计算K与Q的加权内积E,并通过softmax函数获得相应的权重,利用获得的权重和V进行加权求和,从而得到最终的注意力特征向量B,E和B具体采用如下公式表示:
Β=attention(E,V)=V·softmax(E)
最后通过一系列全连接层和层归一化获得第一图像块序列的全局特征考虑到性能和计算效率的平衡,本实施例采用LT-Block作为第一分支网络的基本单元。
进一步地,本实施例第二分支网络包括第一CSP模块、连接层和第二CSP模块。第二分支网络以CSP-Resnet为主干网络,具体可参见图9。第一CSP模块将输入的浅层特征利用1×1卷积层沿通道维映射为两个部分,一部分通过一个常规的ResNet Block提取局部信息,另一部分直接与前者输出相拼接共同输入到Transition层。Transition层包含批量归一化层、ReLu激活层和1×1卷积层。第二分支网络包括两个CSP-ResNet Block,连接层采用一个3×3卷积扩展通道维数,输出得到尺寸为8×8×128的局部特征
可以理解的是,图9所示的第一个CSP Block即为第一CSP模块,第二个CSP Block即为第二CSP模块。由于第二CSP模块与第一CSP模块的工作原理相同,前文已有描述,在此不再赘述。
S204、将全局特征和局部特征拼接并通过卷积处理,得到第一图像块序列的特征描述向量。
具体地,将全局特征Φglobal与局部特征Φdetail拼接并通过一个3×3滤波器的卷积层和一个8×8滤波器的卷积层获得最终的特征描述向量{VS,VO}∈R1×256。其中,每个卷积层都经过批量归一化和校正线性单元 (ReLu)激活。
需要说明的是,本实施例为了优化双分支网络,设计了一个损失函数hard distance loss,旨在使SAR图像和光学图像对应匹配的图像块相应的网络输出特征描述向量,即正样本之间的相对距离尽可能小,并增大负样本之间的相对距离。对应每一对匹配的SAR-光学图像,采样n-1个负样本并计算所有正负样本对应图像之间的相对距离选取出与相对距离最小的负样本与正样本组成三元组:具体地,所采用的损失函数采用如下公式表示:
S3、根据特征描述向量对光学图像和SAR图像进行特征匹配,以得到光学图像和SAR图像之间的匹配点对。
具体地,本实施例利用最近邻搜索法(NN)和随机抽样一致性方法(RANSAC)进行特征匹配和特征匹配对提纯。
进一步地,在一具体实施例中,如图10所示,步骤S3包括:
S301、采用最近邻搜索法对光学图像和SAR图像进行特征匹配,得到光学图像和SAR图像之间的初始匹配点对;
具体地,根据特征描述向量之间的欧式距离搜索SAR图像中的特征点和光学图像中的最近邻、次近邻的特征点。通过预先设置第一阈值来对照SAR图像中的特征点和光学图像中的最近邻、次近邻的特征点对应特征描述向量之间距离的比值。如果比值大于第一阈值,则表示两个特征点不匹配,否则匹配。因此,通过控制第一阈值来调节匹配点数量,有利于实现控制关键点精确度。
S302、采用随机抽样一致性对初始匹配点对进行提纯,得到光学图像和SAR图像之间的目标匹配点对。
随机抽样一致性方法可以在一组包含“外点”的数据集中,采用 不断迭代的方法,寻找最优参数模型。具体地,本实施例从初始匹配点对中随机抽样4个样本匹配对,计算出图像之间的变换矩阵H,记为模型M。然后计算匹配点对中所有匹配点对与模型M的投影误差,若投影误差小于第二阈值,则加入内点集I。如果内点集I元素个数大于最优内点集I_best,则更新I_best=I。同时,更新迭代次数k,重复上述过程得到最优的变换矩阵进而得到提纯后的匹配点对,具体匹配结果可参见图11。
本发明实施例一种多模态图像匹配方法,其有益效果在于:利用神经网络自主学习SAR图像和光学图像可匹配性强的区域作为特征点,相较于传统几何算子在异源图像可重复特征点提取方面更有优势,有效提高了匹配精度;利用transformer-CNN联合框架组成的双分支网络可以提取更丰富的SAR-光学异源图像共有的深层特征,相较于传统的特征提取方法和基于卷积神经网络的方法,其抗干扰能力更强且鲁棒性更好;采用description then detection两段式的训练方法将传统基于特征的匹配方法中相互孤立的特征检测模块和特征描述模块联系起来,让图像之间的匹配关系约束特征点的选取,获得更有益于匹配的特征点。
基于上述多模态图像匹配方法,如图12所示,本发明实施例还提供了一种多模态图像匹配系统,包括:
特征点提取模块1,用于对光学图像和SAR图像进行自监督特征提取,得到光学图像和SAR图像之间的可重复特征点;
特征描述模块2,用于根据可重复特征点将光学图像和SAR图像分割成第一图像块序列,并通过双分支网络对第一图像块序列进行特征提取,分别得到光学图像和SAR图像的特征描述向量;双分支网络包括用于提取全局特征的第一分支网络和用于提取局部特征的第二分支网络;
特征匹配模块3,用于根据特征描述向量对光学图像和SAR图像进行特征匹配,以得到光学图像和SAR图像之间的匹配点对。
需要说明的是,上述一种多模态图像匹配系统中的各个模块可全部或部分通过软件、硬件及其组合来实现。上述各模块可以硬件形式内嵌于或独立于计算机设备中的处理器中,也可以以软件形式存储于计算机设备中的存储器中,以便于处理器调用执行以上各个模块对应的操作。关于一种多模态图像匹配系统的具体限定参见上文中对于一种多模态图像匹配方法的限定,二者具有相同的功能和作用,在此不再赘述。
本发明实施例还提供了一种终端设备,该终端设备包括:
处理器、存储器和总线;
所述总线,用于连接所述处理器和所述存储器;
所述存储器,用于存储操作指令;
所述处理器,用于通过调用所述操作指令,可执行指令使处理器执行如本发明上述一种多模态图像匹配方法对应的操作。
在一个可选实施例中提供了一种终端设备,如图13所示,图13所示的终端设备5000包括:处理器5001和存储器5003。其中,处理器5001和存储器5003相连,如通过总线5002相连。可选地,终端设备5000还可以包括收发器5004。需要说明的是,实际应用中收发器5004不限于一个,该终端设备5000的结构并不构成对本发明实施例的限定。
处理器5001可以是CPU,通用处理器,DSP,ASIC,FPGA或者其他可编程逻辑器件、晶体管逻辑器件、硬件部件或者其任意组合。其可以实现或执行结合本发明公开内容所描述的各种示例性的逻辑方框,模块和电路。处理器5001也可以是实现计算功能的组合,例如包含一个或多个微处理器组合,DSP和微处理器的组合等。
总线5002可包括一通路,在上述组件之间传送信息。总线5002可以是PCI总线或EISA总线等。总线5002可以分为地址总线、数据总线、控制总线等。为便于表示,图13中仅用一条粗线表示,但并不表示仅有一根总线或一种类型的总线。
存储器5003可以是ROM或可存储静态信息和指令的其他类型的静态存储设备,RAM或者可存储信息和指令的其他类型的动态存储设备,也可以是EEPROM、CD-ROM或其他光盘存储、光碟存储(包括压缩光碟、激光碟、光碟、数字通用光碟、蓝光光碟等)、磁盘存储介质或者其他磁存储设备、或者能够用于携带或存储具有指令或数据结构形式的期望的程序代码并能够由计算机存取的任何其他介质,但不限于此。
存储器5003用于存储执行本发明方案的应用程序代码,并由处理器5001来控制执行。处理器5001用于执行存储器5003中存储的应用程序代码,以实现前述任一方法实施例所示的内容。
其中,终端设备包括但不限于:移动电话、笔记本电脑、数字广播接收器、PDA(个人数字助理)、PAD(平板电脑)、PMP(便携式多媒体播放器)、车载终端(例如车载导航终端)等等的移动终端以及诸如数字TV、台式计算机等等的固定终端。
本发明实施例还提供了一种计算机可读存储介质,计算机可读存储介质上存储有计算机程序,该程序被处理器执行时实现本发明上述一种多模态图像匹配方法。
本发明的又一实施例提供了一种计算机可读存储介质,该计算机可读存储介质上存储有计算机程序,当其在计算机上运行时,使得计算机可以执行前述方法实施例中相应内容。
此外,本发明的实施例还提出一种计算机可读存储介质,其上存储有计算机程序,该程序被处理器执行时实现上述方法的步骤。
综上所述,本发明实施例一种多模态图像匹配方法、系统、终端设备及存储介质,利用神经网络自主学习SAR图像和光学图像可匹配性强的区域作为特征点,相较于传统几何算子在异源图像可重复特征点提取方面更有优势,有效提高了匹配精度;利用transformer-CNN联合框架组成的双分支网络可以提取更丰富的SAR-光学异源图像共有的深层特征,相较于传统的特征提取方法和基于卷积神经网络的方法, 其抗干扰能力更强且鲁棒性更好;采用description then detection两段式的训练方法将传统基于特征的匹配方法中相互孤立的特征检测模块和特征描述模块联系起来,让图像之间的匹配关系约束特征点的选取,获得更有益于匹配的特征点。
本说明书中的各个实施例均采用递进的方式描述,各个实施例直接相同或相似的部分互相参见即可,每个实施例重点说明的都是与其他实施例的不同之处。尤其,对于系统实施例而言,由于其基本相似于方法实施例,所以描述的比较简单,相关之处参见方法实施例的部分说明即可。需要说明的是,上述实施例的各技术特征可以进行任意的组合,为使描述简洁,未对上述实施例中的各个技术特征所有可能的组合都进行描述,然而,只要这些技术特征的组合不存在矛盾,都应当认为是本说明书记载的范围。
以上所述仅是本发明的优选实施方式,应当指出,对于本技术领域的普通技术人员来说,在不脱离本发明技术原理的前提下,还可以做出若干改进和替换,这些改进和替换也应视为本发明的保护范围。

Claims (10)

  1. 一种多模态图像匹配方法,其特征在于,包括:
    对光学图像和SAR图像进行自监督特征提取,得到所述光学图像和所述SAR图像之间的可重复特征点;
    根据所述可重复特征点将所述光学图像和所述SAR图像分割成第一图像块序列,并通过双分支网络对所述第一图像块序列进行特征提取,分别得到所述光学图像和所述SAR图像的特征描述向量;所述双分支网络包括用于提取全局特征的第一分支网络和用于提取局部特征的第二分支网络;
    根据所述特征描述向量对所述光学图像和所述SAR图像进行特征匹配,以得到所述光学图像和所述SAR图像之间的匹配点对。
  2. 根据权利要求1所述的多模态图像匹配方法,其特征在于,在所述对光学图像和SAR图像进行自监督特征提取之前,包括:
    采用局部归一化滤波器将光学图像和SAR图像转化为归一化图像。
  3. 根据权利要求1所述的多模态图像匹配方法,其特征在于,所述对光学图像和SAR图像进行自监督特征提取,得到所述光学图像和所述SAR图像之间的可重复特征点,包括:
    将光学图像和SAR图像组成SAR-光学图像对;
    对所述SAR-光学图像对进行自监督学习,获得关键点得分图;
    根据所述关键点得分图构建损失函数,并利用所述损失函数优化所述自监督学习,以学习到所述光学图像和所述SAR图像之间的可重复特征点。
  4. 根据权利要求3所述的多模态图像匹配方法,其特征在于,所述根据所述关键点得分图构建损失函数,包括:
    将所述关键点得分图划分为第二图像块序列;所述第二图像块序列包括SAR图像块序列和光学图像块序列;
    基于所述第二图像块序列构建损失函数;所述损失函数包括第一 损失函数、第二损失函数和第三损失函数;
    所述第一损失函数采用如下公式表示:
    其中,Is表示SAR图像,Io表示光学图像,U表示仿射变换,Scoreo(i)表示光学图像块序列的第i个图像块,ScoresU(i)表示SAR图像块序列的第i个图像块,m表示第二图像块序列的图像块数量;
    所述第二损失函数采用如下公式表示:
    其中,I表示SAR-光学图像对,Score(i)表示第二图像块序列的第i个图像块;
    所述第三损失函数采用如下公式表示:
    L3=1-[APijScoreij+γ(1-Scoreij)]
    其中,APij表示SAR-光学图像对(i,j)位置像素对应的平均精度,Scoreij表示SAR-光学图像对(i,j)位置像素对应的得分,γ表示超参数;所述平均精度表示SAR-光学图像对对应位置像素的特征描述向量之间的相似程度;
    将所述第一损失函数、所述第二损失函数和所述第三损失函数进行加权求和,得到所述损失函数。
  5. 根据权利要求1所述的多模态图像匹配方法,其特征在于,所述双分支网络还包括用于提取浅层特征的卷积层;
    所述根据所述可重复特征点将所述光学图像和所述SAR图像分割成第一图像块序列,并通过双分支网络对所述第一图像块序列进行特征提取,分别得到所述光学图像和所述SAR图像的特征描述向量,包括:
    以所述可重复特征点为中心,将所述光学图像和所述SAR图像分割成第一图像块序列;
    将所述第一图像块序列输入至所述卷积层,以得到所述第一图像 块序列的浅层特征;
    将所述浅层特征分别输入至所述第一分支网络和所述第二分支网络,以得到所述第一图像块序列的全局特征和局部特征;
    将所述全局特征和所述局部特征拼接并通过卷积处理,得到所述第一图像块序列的特征描述向量。
  6. 根据权利要求5所述的多模态图像匹配方法,其特征在于,所述第一分支网络包括Lite-Transformer、全连接层和归一化层;所述第二分支网络包括第一CSP模块、连接层和第二CSP模块。
  7. 根据权利要求1所述的多模态图像匹配方法,其特征在于,所述根据所述特征描述向量对所述光学图像和所述SAR图像进行特征匹配,以得到所述光学图像和所述SAR图像之间的匹配点对,包括:
    采用最近邻搜索法对所述光学图像和所述SAR图像进行特征匹配,得到所述光学图像和所述SAR图像之间的初始匹配点对;
    采用随机抽样一致性对所述初始匹配点对进行提纯,得到所述光学图像和所述SAR图像之间的目标匹配点对。
  8. 一种多模态图像匹配系统,其特征在于,包括:
    特征点提取模块,用于对光学图像和SAR图像进行自监督特征提取,得到所述光学图像和所述SAR图像之间的可重复特征点;
    特征描述模块,用于根据所述可重复特征点将所述光学图像和所述SAR图像分割成第一图像块序列,并通过双分支网络对所述第一图像块序列进行特征提取,分别得到所述光学图像和所述SAR图像的特征描述向量;所述双分支网络包括用于提取全局特征的第一分支网络和用于提取局部特征的第二分支网络;
    特征匹配模块,用于根据所述特征描述向量对所述光学图像和所述SAR图像进行特征匹配,以得到所述光学图像和所述SAR图像之间的匹配点对。
  9. 一种终端设备,其特征在于,包括处理器、存储器以及存储在所述存储器中且被配置为由所述处理器执行的计算机程序,所述处理 器执行所述计算机程序时实现如权利要求1至7中任一项所述的多模态图像匹配方法。
  10. 一种计算机可读存储介质,其特征在于,所述计算机可读存储介质包括存储的计算机程序;其中,所述计算机程序在运行时控制所述计算机可读存储介质所在的设备执行如权利要求1至7中任一项所述的多模态图像匹配方法。
PCT/CN2024/103035 2024-01-10 2024-07-02 一种多模态图像匹配方法、系统、终端设备及存储介质 Pending WO2025148253A1 (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
US18/954,565 US12354322B1 (en) 2024-01-10 2024-11-21 Multimodal image matching method and system, terminal device, and storage medium

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
CN202410034059.6 2024-01-10
CN202410034059.6A CN117541833B (zh) 2024-01-10 2024-01-10 一种多模态图像匹配方法、系统、终端设备及存储介质

Related Child Applications (1)

Application Number Title Priority Date Filing Date
US18/954,565 Continuation-In-Part US12354322B1 (en) 2024-01-10 2024-11-21 Multimodal image matching method and system, terminal device, and storage medium

Publications (1)

Publication Number Publication Date
WO2025148253A1 true WO2025148253A1 (zh) 2025-07-17

Family

ID=89784715

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/CN2024/103035 Pending WO2025148253A1 (zh) 2024-01-10 2024-07-02 一种多模态图像匹配方法、系统、终端设备及存储介质

Country Status (2)

Country Link
CN (1) CN117541833B (zh)
WO (1) WO2025148253A1 (zh)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN121075102A (zh) * 2025-11-10 2025-12-05 江西农业大学 基于多源遥感数据融合土地资源动态监测预警方法及系统
CN121582554A (zh) * 2026-01-20 2026-02-27 中国矿业大学 一种基于多尺度上下文感知的sar有向目标检测方法

Families Citing this family (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN117541833B (zh) * 2024-01-10 2024-04-02 中山大学 一种多模态图像匹配方法、系统、终端设备及存储介质
CN118968249B (zh) * 2024-10-16 2025-03-14 东华理工大学南昌校区 一种耦合相位结构和深度特征的多模态遥感图像匹配方法
CN120612427B (zh) * 2025-05-29 2026-03-20 中铁二十五局集团有限公司 一种施工区域的三维可视化方法和装置

Citations (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN109064502A (zh) * 2018-07-11 2018-12-21 西北工业大学 基于深度学习和人工设计特征相结合的多源图像配准方法
WO2020086217A1 (en) * 2018-10-26 2020-04-30 Siemens Aktiengesellschaft Learning keypoints and matching rgb images to cad models
CN114092531A (zh) * 2021-10-28 2022-02-25 国网山东省电力公司电力科学研究院 一种红外-可见光图像配准方法及系统
CN114612698A (zh) * 2022-02-28 2022-06-10 国网山东省电力公司电力科学研究院 一种基于层级匹配的红外与可见光图像配准方法及系统
CN117541833A (zh) * 2024-01-10 2024-02-09 中山大学 一种多模态图像匹配方法、系统、终端设备及存储介质

Family Cites Families (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN108510532B (zh) * 2018-03-30 2022-07-15 西安电子科技大学 基于深度卷积gan的光学和sar图像配准方法
CN114445640B (zh) * 2022-01-27 2024-09-06 西安电子科技大学 基于描述子一致性约束的异源遥感图像块匹配方法及系统
CN114565653B (zh) * 2022-03-02 2023-07-21 哈尔滨工业大学 一种存在旋转变化和尺度差异的异源遥感图像匹配方法
CN114359359B (zh) * 2022-03-11 2022-07-01 北京化工大学 多任务光学和sar遥感图像配准方法、设备和介质
CN116883466B (zh) * 2023-07-11 2025-08-15 中国人民解放军国防科技大学 基于位置感知的光学与sar图像配准方法、装置及设备

Patent Citations (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN109064502A (zh) * 2018-07-11 2018-12-21 西北工业大学 基于深度学习和人工设计特征相结合的多源图像配准方法
WO2020086217A1 (en) * 2018-10-26 2020-04-30 Siemens Aktiengesellschaft Learning keypoints and matching rgb images to cad models
CN114092531A (zh) * 2021-10-28 2022-02-25 国网山东省电力公司电力科学研究院 一种红外-可见光图像配准方法及系统
CN114612698A (zh) * 2022-02-28 2022-06-10 国网山东省电力公司电力科学研究院 一种基于层级匹配的红外与可见光图像配准方法及系统
CN117541833A (zh) * 2024-01-10 2024-02-09 中山大学 一种多模态图像匹配方法、系统、终端设备及存储介质

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
LI, HE; NIE, RENCAN: "Remote Sensing Image Fusion with Dual-branch Attention Network", COMPUTER SCIENCE, KEXUE JISHU WENXIAN CHUBANSHE CHONGQING FENSHE, CN, vol. 50, no. 11A, 15 November 2023 (2023-11-15), CN , pages 230200072 - 230200072-6, XP009565205, ISSN: 1002-137X, DOI: 10.11896/jsjkx.230200072 *

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN121075102A (zh) * 2025-11-10 2025-12-05 江西农业大学 基于多源遥感数据融合土地资源动态监测预警方法及系统
CN121582554A (zh) * 2026-01-20 2026-02-27 中国矿业大学 一种基于多尺度上下文感知的sar有向目标检测方法

Also Published As

Publication number Publication date
CN117541833A (zh) 2024-02-09
CN117541833B (zh) 2024-04-02

Similar Documents

Publication Publication Date Title
WO2025148253A1 (zh) 一种多模态图像匹配方法、系统、终端设备及存储介质
JP5183392B2 (ja) 画像処理装置、画像処理方法およびプログラム
US11132392B2 (en) Image retrieval method, image retrieval apparatus, image retrieval device and medium
WO2021143267A1 (zh) 基于图像检测的细粒度分类模型处理方法、及其相关设备
CN112101360B (zh) 一种目标检测方法、装置以及计算机可读存储介质
CN112270259B (zh) 基于轻量级卷积神经网络的sar图像舰船目标快速检测方法
CN115205114A (zh) 一种基于orb特征的高分辨率图像拼接改进算法
WO2020062312A1 (zh) 信号处理装置和信号处理方法
WO2025000278A1 (zh) 单目标姿态估计方法、装置以及电子设备
CN114373078A (zh) 目标检测方法、装置、终端设备及存储介质
CN116091551A (zh) 一种基于多模态融合的目标检索跟踪方法及系统
CN116012602A (zh) 一种在线定位的轻量化显著性检测方法
CN111914890A (zh) 图像之间的图像块匹配方法、图像配准方法和产品
Naouadir et al. Celestial object detection in astronomical images using mse and jacobi moments
US12354322B1 (en) Multimodal image matching method and system, terminal device, and storage medium
Luo et al. A lightweight YOLOv5-FFM model for occlusion pedestrian detection
CN109871249B (zh) 一种远程桌面操作方法、装置、可读存储介质及终端设备
CN114898104A (zh) 一种图像特征的哈希方法、装置以及处理设备
CN120388242A (zh) 基于高阶矩领域对齐的医学图像分类方法、设备、存储介质
WO2023060575A1 (zh) 图像识别方法、装置、电子设备及存储介质
CN118823837A (zh) 一种指纹图像匹配识别方法、装置、电子设备及存储介质
US12299911B2 (en) Image processing method and apparatus, and storage medium
CN114677568B (zh) 一种基于神经网络的线性目标检测方法、模块及系统
CN118897901A (zh) 电力线路航拍图像检索分析方法、系统及介质
CN112487927B (zh) 一种基于物体关联注意力的室内场景识别实现方法及系统

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 24916309

Country of ref document: EP

Kind code of ref document: A1