CN117745852A - 一种基于Transformer与大核卷积的自然图像压缩感知方法 - Google Patents
一种基于Transformer与大核卷积的自然图像压缩感知方法 Download PDFInfo
- Publication number
- CN117745852A CN117745852A CN202410078634.2A CN202410078634A CN117745852A CN 117745852 A CN117745852 A CN 117745852A CN 202410078634 A CN202410078634 A CN 202410078634A CN 117745852 A CN117745852 A CN 117745852A
- Authority
- CN
- China
- Prior art keywords
- image
- convolution
- reconstruction
- compressed sensing
- network
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Landscapes
- Image Processing (AREA)
Abstract
本发明属于信号处理和深度学习技术领域,具体涉及一种基于Transformer模型与大核卷积的自然图像压缩感知方法。针对如何实现自然图像的稀疏采样与高质量恢复这一问题,本发明提出了一种混合Vision Transformer和大核卷积的展开网络架构,实现了图像压缩感知的可解释性重构。该网络为端到端的两段式架构,一是使用数据驱动的预训练编码器完成图像信息的稀疏表示与基本特征提取;二是设计了一种基于优化启发的模块,将其迭代过程视为网络展开过程,引入双通道大核注意力机制捕获局部结构与长程依赖,逐阶段重构原始图像。实验结果显示,本发明提出的图像压缩感知方法与现有方法相比,可以在保持重构速度的同时,降低网络内存占用并提升图像的重构质量。
Description
技术领域
本发明公开了一种基于Transformer与大核卷积的自然图像压缩感知方法,属于图像处理技术领域。
背景技术
图像作为用户获取信息的重要手段,相比于一维数据,可使用户对监测对象具有更为直观的观测,蕴含信息丰富。传统的图像获取方式通常需要对视野中的每个像素点进行采样,生成原始图像,接着使用繁琐的压缩算法来消除图像中的冗余信息,以便于存储和传输。面对庞大的图像数据量,对于大规模无线物联网等能量受限的场景具有较大挑战,存在节点能耗、采集速率、存储容量、处理速度的限制,严重限制了其实际应用。
压缩感知(Compressed Sensing, CS)提供了一种新的信息采集方案,该理论表明,可以从比Nyquist采样定理规定的更少的采集测量中以高概率恢复信号,实现了低成本、高效的数据压缩,从而减轻数据存储和传输带宽负担。CS技术的应用包括但不限于无线远程监控、医学成像、单像素相机等。CS将传统的信号采样与压缩过程合二为一, CS技术利用随机矩阵进行线性采样,通过稀疏字典矩阵(稀疏基)将原始信号变换成同维的稀疏信号,然后与随机矩阵相乘即可得到压缩后的低维信号。
数学上,采样阶段,对图像进行快速采样,可以得到线性随机测量值,其中是测量矩阵,,采样率为。重构阶段是利用低维
测量值恢复原始图像,不难看出,该逆问题是欠定的,那么该问题在理论上存在无穷多
解。为了获得可靠的重建,传统的CS方法通常求解一个能量函数:
其中,表示数据保真项,衡量重构图像与原始图像之间的相似度,表示具有正则化参数的先验项。由于逆问题的欠定性,对于传统的CS方法,先验项
可以是对应于一些预先定义的变换基的稀疏算子,如小波变换和离散余弦变换。大多数情
况下,它们表现出强大的收敛性和理论分析性,但其使用通常面临着高计算复杂度和低自
适应性的限制。近年来,由于深度神经网络强大的学习能力,一系列基于深度网络的图像CS
方法被提出。这些方法放宽了对原始图像稀疏性的假设条件,并联合优化采样矩阵和非线
性恢复算子,使它们之间通过端到端训练度量、互相协调,更有效地学习图像的结构和纹理
特征,大幅提升了图像CS重构的效率和质量。其中,深度展开网络(Deep Unfolding
Network, DUN)由于其良好可解释性和强映射性受到广泛关注。然而,现有的深度展开算法
往往受模型限制,容易在迭代过程中出现特征信息丢失的问题;除了CNN捕获的图像局部特
征外,图像的全局位置信息也很重要,仅利用简单的CNN很难全面地学习图像的全局信息,
并且由于堆叠的卷积层对接受场的有效性和过度参数化的冗余滤波器问题有天然的约束,
因此这样做可能会潜在地约束图像重建性能。
与先前基于卷积的深度神经网络不同,Transformers最初是为自然语言处理(Natural Language Processing, NLP)中的序列到序列预测而设计的,由于基于自注意的架构,它非常适合建模全局上下文,将其应用于多种计算机视觉任务中均取得了成功。然而其核心模块即自注意力仍然有其缺点。自注意力将2D图像视为1D序列,这破坏了图像的关键2D结构。由于二次计算和内存开销,高分辨率图像处理也很困难。此外,自注意力是一种只考虑空间维度适应性而忽略通道维度适应性的特殊注意力,这对视觉任务也很重要。因此,将Transformer应用于自然图像的压缩感知需要进一步研究。
发明内容
本发明的目的在于将Transformer与大核卷积相结合,融合两者优势,提出一种可以兼顾局部结构信息与长程依赖性,保证网络模型空间与通道自适应性的可解释图像压缩感知方法。
DUN的思想是将传统的迭代优化算法借由神经网络级联而成。DUN对训练数据对具有良好的可解释性,通常在CS结构中被表述为双层优化问题:
考虑到简单性和可解释性,直接展开传统的近端梯度下降(Proximal GradientDescent, PGD),解决上式并将其表示为迭代函数,分别代表梯度下降与近端映射:
、和分别表示第次迭代的输出、中间变量和加权步长。迭代更新
和,直至收敛。利用DUN求解近端映射,因此,本发明中展开网络的第个迭代过
程可以简要表示为下式,,表示网络阶段数。
在网络子阶段中,将Transformer与大核卷积相结合,设计双通道大核注意力机制(Dual-Large Kernel Attention, Dual-LKA),实现对原Transformer中自注意力机制的替换,使其具有获取全局上下文信息的能力,同时,使网络更适用于图像结构,降低了计算复杂度。
本发明的目的是通过下述技术方案来实现的:
(1) 数据集获取:在自然图像数据集BSDS500中,选取train与test共400张图像作
为训练集,并通过旋转、镜像等操作进行数据增强,将图像随机划分为大小的不重
叠的图像块,记作。
(2) 自适应采样:利用卷积实现自适应采样,初始化可学习的测量矩阵,
其中,基于即得到测量值,将采样模块表述为。
(3) 初始重构:基于,利用测量矩阵的转置卷积,实现对图像的压缩感知
初始重构,得到图像的初始重构,将初始化重构模块表述为,则。
(4) 深度重构:将展开网络子阶段记作TC模块,即深度重构网络由子阶段迭代
次而来,包含了梯度下降与近端映射模块,将TC模块表述为,表示卷积操作,则,,最终重构图像为。将送入第个TC模块,
首先经过梯度下降模块得到,随后与依次经过通道Concat、卷积、特征提取模
块、注意力模块和前馈神经网络模块,得到,再通过卷积得到。
(5) 损失函数:利用重构图像与原始图像间的MSE,来衡量两者之间
的差异。
(6) 训练:使用Adam优化器对网络进行初始学习率训练,并使用余弦退火策略调节学习率。
(7) 测试:将基准数据集图像输入训练好的深度重构网络,得到重构图像,并通过计算原始图像与重构图像间的峰值信噪比(Peak Signal to Noise Ratio, PSNR)、结构相似性(Structural Similarity, SSIM)衡量重构质量。本发明的优点和积极效果
与现有技术相比,本发明具有如下优点和积极效果:
第一,本发明提出了一个完全端到端学习的、可解释的两端式自然图像压缩感知方法,前者使用数据驱动的预训练编码器完成图像信息的稀疏表示与基本特征提取,后者利用展开网络逐阶段学习测量值到原始高维空间的逆映射,实现了图像自适应稀疏采样与重构的联合优化。
第二,将Transformer与CNN相结合,创新地设计了一个的基于优化启发的TC模块,与常有DUN不同的是本发明在相邻TC模块间搭建了信息传输路径降低通道损耗,同时,在TC模块中引入了新的双通道大核注意力机制,融合了卷积和自注意力的优点,避免了它们的缺点,使本发明更适用于图像的CS重构。
第三,改进了传统Transformer编码器,采用双通道大核注意力机制替换了原有的自注意力机制,降低了计算和存储开销,经实验证明,本发明稳定性较好,在测试集上均表现出良好的重构性能。
附图说明
图1是本发明提出的基于Transformer与大核卷积的自然图像压缩感知方法流程图;图2是本发明深度重构网络的结构图;图3是Dual-LKA结构图;图4是采样率10%时,Set5中baby_GT与bird_GT重构的视觉质量比较。
具体实施方式
为使本发明的实施方案与意义优势表述得更为清楚,下面结合后文附图及实施样例,对本发明进行更为详细的说明。
(1) 输入:训练数据集,Nb=89600,图像块大小B=99。
(2) 初始化:压缩感知采样率、最大训练次数epoch=
100、一次训练所选取样本数batch_size=32、步长、初始化迭代深度,上限为重构
网络子阶段数目,除特殊外各卷积通道数channels设置为32。
(3) 自适应采样:,将重塑为个33×33大小的卷积核,
卷积核通道为1,步长P=33。
(4) 初始重构:,利用测量矩阵的转置卷积,实现对图像的压缩感知初
始重构,得到图像的初始重构。
(5) 深度重构:将展开网络子阶段记作TC模块,即深度重构网络由子阶段迭代
次而来,包含了梯度下降与近端映射模块,,。具体流
程:将送入第个TC模块,首先经过梯度下降模块得到,
随后与依次经过通道Concat操作、3×3卷积、特征提取模块、注意力模块和前
馈神经网络模块,得到,再通过3×3卷积得到。将输入深度重构网络,经Ns个
子阶段输出,得到。注意力模块中设计了Dual-LKA结构,利用大核卷积获取全局
信息,同时基于大核卷积的分解原理,将核大小为的卷积核分解为空间局部卷积(深
度卷积,)、空间远程卷积(深度膨胀卷积,)和通道卷积(1×1卷积)。
为使网络拥有更丰富的多尺度信息,设置了多通道注意力。在保证最小参数化的基础上,设
置参数分别为:①K=27,d=4,分解卷积核大小(7,7,1)②K=9,d=2,分解卷积核大小(3,5,1)。
(6) 计算损失函数:利用重构图像与原始图像间的MSE,衡量两者差
异。
(7) 训练:判断是否到达最大epoch值,未达到则进行误差反向传递,利用Adam优
化器更新权值,达到则保存网络参数,结束训练。设置初始学习率为5e-4使用余弦退火策
略调节学习率,经过100次迭代,初始学习率降至5e-5,预热周期为3次。
(8) 测试:将基准数据集图像输入训练好的深度重构网络,得到重构图像,并通过计算原始图像与重构图像间的PSNR、SSIM衡量重构性能。
本发明的仿真实验是在GPU:NVIDIA Quadro RTX 4000,Ubuntu20.04(64 bit)操作系统的仿真条件下运行的,开发平台Visual Studio Code、Pytorch1.10。
算法测试中,采用了两个广泛使用的基准数据集:Set5、McM18和General100。值得注意的是,为便于比较,彩色图像在YCbCr空间中进行处理,并在Y通道上进行评估,对其重构图像计算PSNR与SSIM。基准实验:ISTA-Net+、OPINE-Net+、AMP-Net-BM、DGU-Net+、TCS-Net。对比实验将本发明提出的算法与基准实验进行图像重构质量对比,即比较图像质量衡量指标PSNR与SSIM,PSNR值越大,SSIM值越接近于1,代表图像重构质量越精准,越接近原始图像。
我们设置采样率,本发明的参数选择具有一定的普适
性,本实验的测试集采用了同一组参数,同时这种参数页可以扩展到其他自然图像的重构
过程中。表1分别展示了数据集Set5、McM18和General100在不同测量率下的PSNR与SSIM。从
实验结果可以发现,本发明所提方法在保持重构的同时,在所有采样率下本发明所提出的
方法都能达到最优的重构效果。在说明书附图图4中展示了采样率10%时,Set5中baby_GT与
bird_GT重构的视觉质量比较,可以发现本发明所重构的图像更接近于原始图像,纹理更清
晰。表2展示了在采样率10%时,不同算法重构一张256×256大小图像的平均时间、参数量与
浮点运算次数。对于在恢复质量方面具有较大竞争力的DGU-Net+、AMP-Net-BM和TCS-Net,
本发明提出的算法实现了更小的参数量与更快的运行时间,可以节约计算成本。综上所述,
本发明提出的基于Transformer与大核卷积的自然图像压缩感知方法,计算成本低、图像重
构质量好,是一种有效的自然图像压缩感知方法。
表1 各方法重构图像的PSNR(dB)、SSIM∈[0,1]对比结果
| 数据集 | 采样率 | ISTA-Net+ | OPINE-Net+ | AMP-Net-BM | DGU-Net+ | TCS-Net | 本发明 |
| 1% | 18.5225/0.4408 | 21.8914/0.6101 | 22.4254/0.6185 | 22.4190/0.6237 | 22.7494/0.6003 | 23.0929/0.6367 | |
| 4% | 23.4528/0.6619 | 27.9457/0.8209 | 27.8246/0.8179 | 28.3861/0.8318 | 27.5483/0.8173 | 28.5561/0.8427 | |
| Set5 | 10% | 28.6065/0.8315 | 32.5102/0.9058 | 32.1392/0.9031 | 32.8441/0.9111 | 31.4809/0.9067 | 33.1097/0.9244 |
| 25% | 34.1672/0.9272 | 36.7785/0.9510 | 36.9258/0.9541 | 37.3302/0.9558 | 35.856/0.9559 | 37.6505/0.9630 | |
| 50% | 39.4886/0.9706 | 41.6234/0.9779 | 42.1352/0.9804 | 42.4728/0.9809 | / | 42.7052/0.9842 | |
| 1% | 19.9893/0.4942 | 23.4088/0.6316 | 23.7917/0.6431 | 23.0500/0.6372 | 23.6266/0.6144 | 24.0858/0.6427 | |
| 4% | 24.2732/0.6577 | 27.9489/0.7891 | 27.9164/0.7887 | 28.1609/0.7998 | 27.5373/0.7907 | 28.3934/0.8126 | |
| McM18 | 10% | 28.5360/0.8104 | 31.9249/0.8878 | 31.7231/0.8869 | 32.3243/0.8977 | 30.9669/0.8913 | 32.5369/0.9103 |
| 25% | 33.9880/0.9237 | 36.9213/0.9537 | 37.0400/0.9570 | 37.7359/0.9614 | 35.8945/0.9579 | 37.9561/0.9668 | |
| 50% | 39.5162/0.9728 | 42.2930/0.9834 | 43.0616/0.9866 | 43.6171/0.9875 | / | 43.8347/0.9894 | |
| 1% | 18.9989/0.4700 | 22.5268/0.6229 | 22.9131/0.6321 | 22.8558/0.6276 | 22.9139/0.6018 | 23.4813/0.6374 | |
| 4% | 23.7578/0.6549 | 27.6234/0.7865 | 27.4456/0.7846 | 27.9241/0.7969 | 27.2431/0.7888 | 28.2144/0.8104 | |
| General100 | 10% | 28.5443/0.8104 | 32.0279/0.8863 | 31.5631/0.8838 | 32.4102/0.8968 | 30.8719/0.8895 | 32.7478/0.9093 |
| 25% | 34.3164/0.9250 | 37.1454/0.9530 | 36.9876/0.3552 | 37.5467/0.9598 | 35.7811/0.9568 | 38.2174/0.9667 | |
| 50% | 39.9733/0.9740 | 42.5183/0.9835 | 42.8420/0.9857 | 43.2621/0.9869 | / | 43.8010/0.9891 |
表2 采样率10%时,各方法重构一张256×256图像的平均时间 (s)
| ISTA-Net+ | AMP-Net-BM | DGU-Net+ | TCS-Net | 本发明 | |
| Time(s) | 0.0071 | 0.0383 | 0.0278 | 0.0212 | 0.0128 |
| Parameters(M) | 0.34 | 0.58 | 6.92 | 0.52 | 0.37 |
| FLOPs(G) | 35.07 | 18.3 | 101.33 | 32.95 | 10.85 |
Claims (1)
1.一种基于Transformer和大核卷积的自然图像压缩感知方法,包括如下步骤:
(1) 数据集获取:在自然图像数据集BSDS500中,选取train与test共400张图像作为训练集,并通过旋转、镜像等操作进行数据增强,将图像随机划分为大小的不重叠的图像块,记作;
(2) 压缩感知采样:利用不含偏置的卷积实现压缩感知采样,初始化可学习的测量矩阵,其中。具体地,利用个大小为的卷积核与 (简化为)卷积,步长为,即可实现图像的稀疏采样,得到测量值(简化为)。在过程中,为降低参数量,逐步实现对图像块的采样,通常为的整数倍;
(3) 初始重构:利用测量矩阵的转置卷积,实现对图像的压缩感知初始重构,不需要引入额外的参数,具体地,即将转置为个大小为的卷积核,与进行卷积,步长为1,即可得到图像的初始重构;
(4) 深度重构:深度重构网络由子阶段迭代次而来,包含了梯度下降与近端映射模块。梯度下降通过学习适应性的模型参数,使网络更好地适应数据,而近端映射通过对稀疏性进行建模,更好地保留信号的重要特征。设计了双通道大核注意力机制,兼顾了获取局部结构信息与长程依赖性的能力,同时保证了网络的空间维度与通道维度的自适应性。对于第个子阶段,输入是和,输出是和,两个张量迭代更新。为第与第个子阶段之间搭建的信息传输路径,可以有效避免因通道收缩转换造成信息损耗。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202410078634.2A CN117745852A (zh) | 2024-01-19 | 2024-01-19 | 一种基于Transformer与大核卷积的自然图像压缩感知方法 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202410078634.2A CN117745852A (zh) | 2024-01-19 | 2024-01-19 | 一种基于Transformer与大核卷积的自然图像压缩感知方法 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| CN117745852A true CN117745852A (zh) | 2024-03-22 |
Family
ID=90281462
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| CN202410078634.2A Pending CN117745852A (zh) | 2024-01-19 | 2024-01-19 | 一种基于Transformer与大核卷积的自然图像压缩感知方法 |
Country Status (1)
| Country | Link |
|---|---|
| CN (1) | CN117745852A (zh) |
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN119832096A (zh) * | 2024-12-12 | 2025-04-15 | 杭州师范大学 | 一种基于引入注意力监督深度展开网络的压缩感知重建方法及其系统 |
| CN119946271A (zh) * | 2025-01-22 | 2025-05-06 | 重庆理工大学 | 一种基于混合注意力和SwinV2熵模型的端到端图像压缩方法 |
-
2024
- 2024-01-19 CN CN202410078634.2A patent/CN117745852A/zh active Pending
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN119832096A (zh) * | 2024-12-12 | 2025-04-15 | 杭州师范大学 | 一种基于引入注意力监督深度展开网络的压缩感知重建方法及其系统 |
| CN119946271A (zh) * | 2025-01-22 | 2025-05-06 | 重庆理工大学 | 一种基于混合注意力和SwinV2熵模型的端到端图像压缩方法 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN112884851B (zh) | 基于展开迭代优化算法的深度压缩感知网络的构建方法 | |
| CN109903228B (zh) | 一种基于卷积神经网络的图像超分辨率重建方法 | |
| Zhang et al. | Image restoration: From sparse and low-rank priors to deep priors [lecture notes] | |
| CN111369487B (zh) | 一种高光谱和多光谱图像融合方法、系统及介质 | |
| CN113674172A (zh) | 一种图像处理方法、系统、装置及存储介质 | |
| CN113902622B (zh) | 基于深度先验联合注意力的光谱超分辨率方法 | |
| CN112116065A (zh) | 一种rgb图像光谱重建方法、系统、存储介质及应用 | |
| CN105631807B (zh) | 基于稀疏域选取的单帧图像超分辨重建方法 | |
| CN114119393B (zh) | 一种基于特征域循环一致性的半监督图像去雨方法 | |
| CN114419392A (zh) | 高光谱快照图像恢复方法、装置、设备及介质 | |
| CN117745852A (zh) | 一种基于Transformer与大核卷积的自然图像压缩感知方法 | |
| Wang et al. | A wavelet-domain consistency-constrained compressive sensing framework based on memory-boosted guidance filtering | |
| CN114757830B (zh) | 基于通道-扩散双分支网络的图像超分辨率重建方法 | |
| CN114581539B (zh) | 一种压缩感知图像重构方法、设备、存储介质及系统 | |
| CN117422620A (zh) | 基于深度学习面向真实场景的红外图像超分辨率重建方法 | |
| CN115311187A (zh) | 基于内部和外部先验的高光谱融合成像方法、系统及介质 | |
| CN113222812A (zh) | 一种基于信息流加强深度展开网络的图像重建方法 | |
| CN114529482B (zh) | 基于小波多通道深度网络的图像压缩感知重建方法 | |
| CN117635744A (zh) | 基于l1范数和低秩技术的快照式光谱压缩成像方法 | |
| CN118628366A (zh) | 基于自学习耦合扩散后验采样的高光谱和多光谱图像融合方法及系统 | |
| CN117218011B (zh) | 基于归一化流模型的暗光图像增强方法及系统 | |
| CN114245117A (zh) | 多采样率复用重建网络方法、装置、设备及存储介质 | |
| CN113793265A (zh) | 一种基于深度特征关联性的图像超分辨率方法及系统 | |
| CN105590296A (zh) | 一种基于双字典学习的单帧图像超分辨率复原方法 | |
| CN119964003B (zh) | 一种基于迭代退化感知曼巴模型的高光谱压缩重构方法及系统 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PB01 | Publication | ||
| PB01 | Publication | ||
| SE01 | Entry into force of request for substantive examination | ||
| SE01 | Entry into force of request for substantive examination |