CN119251069B - 基于局部和全局风格学习的图片高质量任意风格迁移方法 - Google Patents
基于局部和全局风格学习的图片高质量任意风格迁移方法 Download PDFInfo
- Publication number
- CN119251069B CN119251069B CN202411769124.6A CN202411769124A CN119251069B CN 119251069 B CN119251069 B CN 119251069B CN 202411769124 A CN202411769124 A CN 202411769124A CN 119251069 B CN119251069 B CN 119251069B
- Authority
- CN
- China
- Prior art keywords
- style
- local
- patch
- stylized
- global
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06T—IMAGE DATA PROCESSING OR GENERATION, IN GENERAL
- G06T5/00—Image enhancement or restoration
- G06T5/50—Image enhancement or restoration using two or more images, e.g. averaging or subtraction
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06T—IMAGE DATA PROCESSING OR GENERATION, IN GENERAL
- G06T5/00—Image enhancement or restoration
- G06T5/60—Image enhancement or restoration using machine learning, e.g. neural networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/70—Arrangements for image or video recognition or understanding using pattern recognition or machine learning
- G06V10/77—Processing image or video features in feature spaces; using data integration or data reduction, e.g. principal component analysis [PCA] or independent component analysis [ICA] or self-organising maps [SOM]; Blind source separation
- G06V10/774—Generating sets of training patterns; Bootstrap methods, e.g. bagging or boosting
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/70—Arrangements for image or video recognition or understanding using pattern recognition or machine learning
- G06V10/77—Processing image or video features in feature spaces; using data integration or data reduction, e.g. principal component analysis [PCA] or independent component analysis [ICA] or self-organising maps [SOM]; Blind source separation
- G06V10/80—Fusion, i.e. combining data from various sources at the sensor level, preprocessing level, feature extraction level or classification level
- G06V10/806—Fusion, i.e. combining data from various sources at the sensor level, preprocessing level, feature extraction level or classification level of extracted features
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/70—Arrangements for image or video recognition or understanding using pattern recognition or machine learning
- G06V10/82—Arrangements for image or video recognition or understanding using pattern recognition or machine learning using neural networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06T—IMAGE DATA PROCESSING OR GENERATION, IN GENERAL
- G06T2207/00—Indexing scheme for image analysis or image enhancement
- G06T2207/20—Special algorithmic details
- G06T2207/20084—Artificial neural networks [ANN]
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Physics & Mathematics (AREA)
- Evolutionary Computation (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Databases & Information Systems (AREA)
- General Health & Medical Sciences (AREA)
- Medical Informatics (AREA)
- Software Systems (AREA)
- Computing Systems (AREA)
- Artificial Intelligence (AREA)
- Health & Medical Sciences (AREA)
- Multimedia (AREA)
- Image Analysis (AREA)
Abstract
本发明公开了一种基于局部和全局风格学习的图片高质量任意风格迁移方法。方法包括:获取若干内容图片和不同风格类型图片并构建为训练集;建立包含局部通道感知的注意力模块和全局风格融合模块的风格迁移网络,并构建基于补丁的风格迁移损失函数;将训练集输入风格迁移网络中进行训练直至基于补丁的风格迁移损失函数收敛;将待风格迁移的内容图片和目标风格类型图片输入训练完成的风格迁移网络中进行处理后输出风格化图片并在显示器进行显示,实现图片高质量风格迁移。本发明方法能够更好的从局部风格模式和全局风格分布的角度学习,进行任意风格迁移的同时生成高质量的风格化图片。
Description
技术领域
本发明涉及了一种图片高质量任意风格迁移方法,涉及计算机视觉和深度学习领域,具体涉及一种基于局部和全局风格学习的图片高质量任意风格迁移方法。
背景技术
风格迁移可以在给定任意的内容和风格形象的情况下创造出新的艺术形象。现有的风格迁移方法主要可分为:局部补丁交换方法和全局样式转换方法。现有的一些方法提出在特征空间中交换局部的内容补丁和其最相似的风格补丁,例如使用注意力的方式将风格特征融入到内容特征中,并且提出了在浅层空间和深层空间计算基于注意力的归一化方法,然而,基于局部补丁交换方法可能会不可避免性地从风格图片中引入一些语义信息,并且风格化图片的全局风格分布可能会偏离风格图片。基于全局样式转换方法主要在于从欧几里得距离调整内容特征的风格信息去匹配风格图片,如自适应实例归一化的方法去调整内容图片的风格分布,以及通过白化-上色的过程将风格特征迁移到内容特征上,然而简单的使用全局样式转换方法不能学习风格图片的局部细节。
发明内容
为了解决背景技术中存在的问题,本发明所提供一种基于局部和全局风格学习的图片高质量任意风格迁移方法。本发明要解决的问题是如何捕获局部细节纹理,避免从样式图像中引入不需要的语义信息,平衡局部样式模式和全局样式分布,可以同时考虑局部风格模式和全局风格分布,从而生成高质量的风格化图像。
本发明采用的技术方案是:
本发明的基于局部和全局风格学习的图片高质量任意风格迁移方法,包括:
S1:获取若干内容图片和不同风格类型图片并共同构建为训练集。
S2:建立基于局部和全局风格学习的风格迁移网络,风格迁移网络中包含局部通道感知的注意力模块LCWA(Local Channel-Wise Attention)和全局风格融合模块GSFT(Global Style Fusion Transformer),同时构建风格迁移网络的基于补丁的风格迁移损失函数;将训练集输入风格迁移网络中进行训练,直至基于补丁的风格迁移损失函数收敛,获得训练完成的风格迁移网络。
S3:将待风格迁移的内容图片和目标风格类型图片共同输入至训练完成的风格迁移网络中进行处理,处理完成后输出风格化图片并在显示器进行显示,实现图片高质量风格迁移。
所述的步骤S2中,基于局部和全局风格学习的风格迁移网络包括依次连接的视觉VGG(Visual Geometry Group)模型的编码器、局部通道感知的注意力模块LCWA、全局风格融合模块GSFT和视觉VGG模型的解码器,风格迁移网络的输入为一张内容图片I c 和一张风格类型图片I s ,依次经过编码器和局部通道感知的注意力模块LCWA处理后获得局部风格化特征F cs l ,将局部风格化特征F cs l 和风格类型图片I s 共同输入至全局风格融合模块GSFT中进行处理,依次经全局风格融合模块GSFT和解码器处理后将风格类型图片的风格转移至内容图片,输出最终的风格化图片I cs 。
所述的局部通道感知的注意力模块LCWA包括三个归一化层Norm、三个卷积层conv和Softmax激活函数,内容图片I c 和风格类型图片I s 经处理后获得内容编码结果F c 和风格编码结果F s ,将内容编码结果F c 分别输入至第一和第三归一化层Norm中进行处理,将风格编码结果F s 分别输入至第二归一化层Norm和第三卷积层conv中进行处理,第一和第二归一化层Norm处理后的结果分别输入至第一和第二卷积层conv中进行处理,将第一和第二卷积层conv处理后的结果相乘后输入Softmax激活函数中处理后输出注意力图A,第一卷积层conv处理后输出的特征中的第一列结果Xw 1 β 、第二列结果Xw 2 β 和第三列结果Xw 3 β 和第二卷积层conv处理后输出的特征中的第一行结果Xw 1 α 、第二行结果Xw 1 α 和第三行结果Xw 1 α 相乘;第三卷积层conv处理后的结果V和注意力图A相乘后获得第一相乘结果,第三卷积层conv处理后的结果V的平方V 2和注意力图A相乘后获得第二相乘结果,第二相乘结果和第一相乘结果的均值M的平方M 2相减后再开根号获得第一相乘结果的标准差S,第三归一化层Norm处理后的结果和第一相乘结果的标准差S点乘后再和第一相乘结果的均值M相加,最终输出局部风格化特征F cs l 作为局部通道感知的注意力模块LCWA的输出。
所述的全局风格融合模块GSFT为基于深度神经网络Transformer的模块,全局风格融合模块GSFT的输入为风格类型图片I s 以及由局部通道感知的注意力模块LCWA处理后获得的局部风格化特征F cs l ,风格类型图片I s 输入深度神经网络Transformer中进行处理,首先将风格类型图片I s 划分为若干个块Patch并构成风格序列Z s ,然后根据预定义的深度神经网络Transformer的索引Q、键K和值V对风格序列Z s 进行编码,然后再输入第一多头注意力模块中进行处理后输出第一注意力结果F s g ,将第一注意力结果F s g 依次输入第四归一化层Norm和第一前馈神经网络FFN(Feed Forward Neural Network)中处理后再经过键K和值V进行编码,然后再输入第二多头注意力模块中进行处理,第二多头注意力模块处理后的结果和经索引Q编码后的局部风格化特征F cs l 共同依次进行残差连接Add和第五归一化层Norm处理后分别输入第二和第三前馈神经网络FFN中进行处理后分别输出偏置b s 和权重w s 作为深度神经网络Transformer的输出结果,b s ∈R b×c×1×1,w s ∈R b×c×h×w ,b、c、h和w分别表示在训练过程中输入一个批次的数量,特征的通道数,特征的高度和宽度,权重w s 和局部风格化特征F cs l 进行点乘后再与偏置b s 相加后输出局部-全局风格化特征F cs lg 作为全局风格融合模块GSFT的输出。
所述的基于补丁的风格迁移损失函数包括视觉VGG模型的内容损失和风格损失,并构建基于补丁的Gram损失(Pctch-wise Gram Loss)算法加入风格损失中从而建立改进风格损失,使用内容损失对内容图片I c 和风格化图片I cs 的内容相似度进行约束,使用改进风格损失对风格类型图片I s 和风格化图片I cs 的风格相似度进行约束。内容损失为内容感知损失函数L c ,原始的风格损失包括由AdaIN提出的二阶的风格损失函数L gs 和对抗损失函数L adv 。
所述的基于补丁的Gram损失算法包括补丁操作和Gram矩阵损失函数L ls ,补丁操作过程中首先将风格类型图片I s 和风格化图片I cs 均进行随机裁剪,然后进行图像增强操作后获得若干风格类型补丁和风格化补丁,根据各个风格类型补丁和风格化补丁输入Gram矩阵损失函数L ls 中获得Gram矩阵损失值以进行风格迁移网络的训练。
所述的Gram矩阵损失函数L ls 如下:
L ls =(∑ i N R(l patch i ,C(I^i s ,I s ),τ))/N
R(l patch i ,C(I^i s ,I s ),τ)=l patch i ,当C(I^i s ,I s )≥τ
R(l patch i ,C(I^i s ,I s ),τ)=0,其它
C(I^i s ,I s )=G(E I (I^i s ))·G(E I (I s ))/(|G(E I (I^i s ))|·|G(E I (I s ))|)
其中,N表示补丁的总数量;R( )和τ分别表示阈值函数及其函数参数;l patch i 表示第i个风格类型补丁和风格化补丁的Gram矩阵的余弦相似度;C( )表示两个张量之间的余弦相似度;I^i s 表示风格类型图片I s 的第i个风格类型补丁,^作为区分符号用于区分原始图片及其补丁;G( )表示裁剪CLIP空间中的第三层的Gram矩阵;E I ()表示裁剪CLIP空间的图像编码器。
所述的第i个风格类型补丁和风格化补丁的Gram矩阵的余弦相似度l patch i 如下:
l patch i =‖G(E I (aug(I^i cs )))-G(E I (aug(I^i s )))‖2
其中,I^i cs 表示风格化图片I cs 的第i个风格化补丁;aug( )表示随机几何增强;‖‖2表示二范数。
本发明的电子设备,包括:相互耦接的存储器和处理器,其中,所述存储器存储有程序数据,所述处理器调用所述程序数据以执行如上述所述的方法。
本发明的计算机可读存储介质,其上存储有程序数据,所述程序数据被处理器执行时实现如上述所述的方法。
现有的基于注意力的任意风格迁移方法采用的是对全局风格信号中学习风格信息的注意机制,忽略了不同通道的内容和风格信号与全局的差异。本发明提出基于局部和全局的风格迁移方法,能够更好的从局部风格模式和全局风格分布的角度学习,方法通过局部通道感知的注意力模块LCWA去从风格图片中学习局部细节的纹理,通过基于Transformer的全局风格融合模块GSFT进一步学习全局的风格信息,去除风格图片中一些不想要的信息,最后提出基于补丁的风格迁移损失函数去平衡局部的风格模式和全局的风格分布。
本发明的有益效果是:
现有的基于注意力的任意风格迁移方法采用的是对全局风格信号中学习风格信息的注意机制,忽略了不同通道的内容和风格信号与全局的差异。本发明采用基于局部和全局风格学习的高质量任意风格迁移方法,能够更好的从局部风格模式和全局风格分布的角度学习,进行任意风格迁移的同时生成高质量的风格化图片。
附图说明
图1为本发明方法的结构框图;
图2为本发明所提出的局部通道感知的注意力模块LCWA示意图;
图3为本发明所提出的基于Transformer的全局风格融合模块GSFT示意图;
图4为本发明所提出的基于补丁的Gram损失算法示意图;
图5为本发明实施例中与现有方法在图片风格迁移上的效果对比图,其中,图5的(a)为六张不同的风格类型图片,图5的(b)为六张不同的内容图片,图5的(c)为使用本发明方法将六张不同的风格类型图片的风格分别迁移至六张不同的内容图片后获得的风格化图片,图5的(d)为使用基于扩散模型并用风格和内容表达的图像翻译DiffuselT(Diffusion-based image translation using disentangled style and contentrepresentation)方法将不同的风格类型图片的风格分别迁移至不同的内容图片后获得的六张风格化图片,图5的(e)为使用基于比对一致性保持的通用风格迁移CCPL(contrastivecoherence preserving loss for versatile style transfer)方法将六张不同的风格类型图片的风格分别迁移至六张不同的内容图片后获得的风格化图片,图5的(f)为使用带有风格注意力网络的任意风格迁移SANet(Arbitrary style transfer with style-attentional networks)方法将六张不同的风格类型图片的风格分别迁移至六张不同的内容图片后获得的风格化图片,图5的(g)为使用基于transformer的图片风格迁移StyTr2(Image style transfer with transformers)方法将六张不同的风格类型图片的风格分别迁移至六张不同的内容图片后获得的风格化图片,图5的(h)为使用重新风格迁移中的注意力机制AdaAttN(Revisit attention mechanism in arbitrary neural styletransfer)方法将六张不同的风格类型图片的风格分别迁移至六张不同的内容图片后获得的风格化图片,图5的(i)为使用基于内外部学习和比对学习的艺术风格迁移IEST(Artistic style transfer with internal-external learning and contrastivelearning)方法将六张不同的风格类型图片的风格分别迁移至六张不同的内容图片后获得的风格化图片,图5的(j)为使用学习线性转换用于快速图像和视频风格迁移Linear(Learning linear transformations for fast image and video style transfer)方法将六张不同的风格类型图片的风格分别迁移至六张不同的内容图片后获得的风格化图片,图5的(k)为使用无偏的图像风格迁移通过可逆的神经流ArtFlow(Unbiased image styletransfer via reversible neural flows)方法将六张不同的风格类型图片的风格分别迁移至六张不同的内容图片后获得的风格化图片;
图6为本发明实施例中与现有方法在视频风格迁移上的效果对比图,其中,图6的(a)为输入的内容图片和风格类型图片及其相邻两帧之间差的热力图,图6的(b)为使用本发明方法处理获得的风格化图片及其相邻两帧之间差的热力图,图6的(c)为使用基于扩散模型并用风格和内容表达的图像翻译DiffuselT方法处理获得的风格化图片及其相邻两帧之间差的热力图,图6的(d)为使用基于比对一致性保持的通用风格迁移CCPL方法处理获得的风格化图片及其相邻两帧之间差的热力图,图6的(e)为使用带有风格注意力网络的任意风格迁移SANet方法处理获得的风格化图片及其相邻两帧之间差的热力图,图6的(f)为使用基于transformer的图片风格迁移StyTr2方法处理获得的风格化图片及其相邻两帧之间差的热力图,图6的(g)为使用重新风格迁移中的注意力机制AdaAttN方法处理获得的风格化图片及其相邻两帧之间差的热力图,图6的(h)为使用基于内外部学习和比对学习的艺术风格迁移IEST方法处理获得的风格化图片及其相邻两帧之间差的热力图,图6的(i)为使用学习线性转换用于快速图像和视频风格迁移Linear方法处理获得的风格化图片及其相邻两帧之间差的热力图,图6的(j)为使用无偏的图像风格迁移通过可逆的神经流ArtFlow方法处理获得的风格化图片及其相邻两帧之间差的热力图。
具体实施方式
下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行描述,显然,所描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范围。
本发明的基于局部和全局风格学习的图片高质量任意风格迁移方法具体如下:
如图1所示,建立基于局部和全局风格学习的风格迁移网络,基于局部和全局风格学习的风格迁移网络包括依次连接的视觉VGG模型的编码器、局部通道感知的注意力模块LCWA、全局风格融合模块GSFT和视觉VGG模型的解码器,风格迁移网络的输入为一张内容图片I c 和一张风格类型图片I s ,依次经过编码器和局部通道感知的注意力模块LCWA处理后获得局部风格化特征F cs l ,将局部风格化特征F cs l 和风格类型图片I s 共同输入至全局风格融合模块GSFT中进行处理,依次经全局风格融合模块GSFT和解码器处理后将风格类型图片的风格转移至内容图片,输出最终的风格化图片I cs 。
如图2所示,局部通道感知的注意力模块LCWA包括三个归一化层Norm、三个1×1卷积层conv和Softmax激活函数,内容图片I c 和风格类型图片I s 经处理后获得内容编码结果F c 和风格编码结果F s ,将内容编码结果F c 分别输入至第一和第三归一化层Norm中进行处理,将风格编码结果F s 分别输入至第二归一化层Norm和第三1×1卷积层conv中进行处理,第一和第二归一化层Norm处理后的结果分别输入至第一和第二1×1卷积层conv中进行处理,将第一和第二1×1卷积层conv处理后的结果相乘后输入Softmax激活函数中处理后输出注意力图A,第一1×1卷积层conv处理后输出的特征中的第一列结果Xw 1 β 、第二列结果Xw 2 β 和第三列结果Xw 3 β 和第二1×1卷积层conv处理后输出的特征中的第一行结果Xw 1 α 、第二行结果Xw 1 α 和第三行结果Xw 1 α 相乘;第三1×1卷积层conv处理后的结果V和注意力图A相乘后获得第一相乘结果,第三1×1卷积层conv处理后的结果V的平方V 2和注意力图A相乘后获得第二相乘结果,第二相乘结果和第一相乘结果的均值M的平方M 2相减后再开根号获得第一相乘结果的标准差S,第三归一化层Norm处理后的结果和第一相乘结果的标准差S点乘后再和第一相乘结果的均值M相加,最终输出局部风格化特征F cs l 作为局部通道感知的注意力模块LCWA的输出。
目前的任意风格迁移中常使用视觉VGG-19模型来提取显著特征来识别的,而使用视觉VGG-19模型提取风格特征并将其融合到内容特征中是有效的,它忽略了不同渠道之间不同局部模式的多样性,视觉VGG-19模型在获取注意力图时,并不会考虑视觉VGG-19模型提取的内容特征Q和风格特征K在不同通道的重要性,会简单地为每个通道统一的分配权重;本发明利用内容和风格可学习参数W con 和W sty 进行扩展,为特征的每个通道重新分配权重,W con 、W sty ∈R B×512×512,B表示输入一次性送入网络的数量,具体实施时B=8,能够动态地给风格特征的不同通道分配不同的权重,通过通道的角度更加关注局部的风格特征。局部通道感知的注意力模块LCWA能够感知局部的风格模式,并将其融入到内容特征中,在不同的风格特征通道之间学习局部风格模式,可以关注不同的渠道,避免忽视重要的地方风格模式。
如图3所示,全局风格融合模块GSFT为基于深度神经网络Transformer的模块,全局风格融合模块GSFT的输入为风格类型图片I s 以及由局部通道感知的注意力模块LCWA处理后获得的局部风格化特征F cs l ,风格类型图片I s 输入深度神经网络Transformer中进行处理,首先将风格类型图片I s 划分为若干个块Patch并构成风格序列Z s ,然后根据预定义的深度神经网络Transformer的索引Q、键K和值V对风格序列Z s 进行编码,然后再输入第一多头注意力模块中进行处理后输出第一注意力结果F s g ,将第一注意力结果F s g 依次输入第四归一化层Norm和第一前馈神经网络FFN中处理后再经过键K和值V进行编码,然后再输入第二多头注意力模块中进行处理,第二多头注意力模块处理后的结果和经索引Q编码后的局部风格化特征F cs l 共同依次进行残差连接Add和第五归一化层Norm处理后分别输入第二和第三前馈神经网络FFN中进行处理后分别输出偏置b s 和权重w s 作为深度神经网络Transformer的输出结果,b s ∈R b×c×1×1,w s ∈R b×c×h×w ,b、c、h和w分别表示在训练过程中输入一个批次的数量,特征的通道数,特征的高度和宽度权重w s 和局部风格化特征F cs l 进行点乘后再与偏置b s 相加后输出局部-全局风格化特征F cs lg 作为全局风格融合模块GSFT的输出。
使用局部通道感知的注意力模块LCWA仅能学习到局部的风格特征,而无法学习到全局的风格特征,为此,本发明利用深度神经网络Transformer学习全局风格信息,主要是通过将风格类型图片I s 进行划分为一个风格序列Z s ,然后利用多头注意力机制学习风格信息的长范围依赖,并产生权重w s 和偏置b s ,用权重w s 和偏置b s 重新处理学习到的局部风格化特征F cs l ,最终获得局部-全局的风格化特征F cs lg 作为解码器的输入。
基于Transformer的全局风格融合模块GSFT更加专注于探索如何将全局的风格特征与局部风格化特征相融合,能够使用Transformer将学习到的全局风格特征重新将其融入到局部的风格化特征中,进一步保持风格化图片与风格图片之间的风格一致性。
如图1和图4所示,同时构建风格迁移网络的基于补丁的风格迁移损失函数,包括视觉VGG模型的内容损失和风格损失,并构建基于补丁的Gram损失算法加入风格损失中从而建立改进风格损失,使用内容损失对内容图片I c 和风格化图片I cs 的内容相似度进行约束,使用改进风格损失对风格类型图片I s 和风格化图片I cs 的风格相似度进行约束。内容损失为内容感知损失函数L c ,原始的风格损失包括由AdaIN提出的二阶的风格损失函数L gs 和对抗损失函数L adv 。
基于补丁的Gram损失算法包括补丁操作和Gram矩阵损失函数L ls ,补丁操作过程中首先将风格类型图片I s 和风格化图片I cs 均进行随机裁剪,然后进行图像增强操作后获得若干风格类型补丁和风格化补丁,根据各个风格类型补丁和风格化补丁输入Gram矩阵损失函数L ls 中获得Gram矩阵损失值以进行风格迁移网络的训练,Gram矩阵损失函数L ls 如下:
L ls =(∑ i N R(l patch i ,C(I^i s ,I s ),τ))/N
R(l patch i ,C(I^i s ,I s ),τ)=l patch i ,当C(I^i s ,I s )≥τ
R(l patch i ,C(I^i s ,I s ),τ)=0,其它
C(I^i s ,I s )=G(E I (I^i s ))·G(E I (I s ))/(|G(E I (I^i s ))|·|G(E I (I s ))|)
l patch i =‖G(E I (aug(I^i cs )))-G(E I (aug(I^i s )))‖2
其中,N表示补丁的总数量;R( )和τ分别表示阈值函数及其函数参数,具体实施时τ=0.75;l patch i 表示第i个风格类型补丁和风格化补丁的Gram矩阵的余弦相似度;C( )表示两个张量之间的余弦相似度;I^i s 表示风格类型图片I s 的第i个风格类型补丁,^作为区分符号用于区分原始图片及其补丁;G( )表示裁剪CLIP空间中的第三层的Gram矩阵;E I ()表示裁剪CLIP空间的图像编码器;I^i cs 表示风格化图片I cs 的第i个风格化补丁;aug( )表示随机几何增强;‖‖2表示二范数。
目前使用的风格损失函数是以全局的角度约束内容和风格之间的相似度,而忽略了局部的风格信息,本发明的基于补丁的Gram损失算法,通过在风格化模式之间正则化局部风格模式来提高风格化图像的质量,从风格类型图片I s 和风格化图片I cs 中随机抽取相同数量的风格补丁,然后将风格化图片I cs 中提取到的补丁和风格类型图片I s 的补丁在裁剪CLIP空间中并计算Gram矩阵,并且约束其欧几里得距离。
为了学习风格图片的局部风格信息,本发明提出了基于补丁的Gram损失算法,具体上,是通过对风格类型图片I s 和风格化图片I cs 分别随机进行裁剪,并且将裁减后的图片进行相同方式的翻转等图像增强操作,然而由于每个裁减得到的风格类型图片I s 和风格化图片I cs 并不能够完全代表本来图片的全局风格,因此去掉了一些和原图相似度低的补丁,具体是计算每个风格补丁的Gram矩阵与风格图像之间的余弦相似度l patch i 。
将内容数据集MS-COCO和风格类型数据集WikiArt共同构建为训练集,将训练集输入风格迁移网络中进行训练,在训练过程中,所有图片被调整为512×512尺寸,然后随机裁剪变成了256×256的固定分辨率,同时采用Adam优化器学习率设置为0.0005,设置了批量大小和迭代次数分别为8和160000,所有训练在NVIDIA RTX 3090 (24GB) GPU上使用Pytorch框架搭建。训练直至基于补丁的风格迁移损失函数收敛达到最小,获得训练完成的风格迁移网络。
最后将待风格迁移的内容图片和目标风格类型图片共同输入至训练完成的风格迁移网络中进行处理,处理完成后输出风格化图片并在显示器进行显示,实现图片高质量风格迁移。如图5的(a)、图5的(b)、图5的(c)、图5的(d)、图5的(e)、图5的(f)、图5的(g)、图5的(h)、图5的(i)、图5的(j)和图5的(k)所示,分别为六种不同的风格类型图片,六种不同的内容图片,以及由本发明方法、基于扩散模型并用风格和内容表达的图像翻译DiffuselT方法、基于比对一致性保持的通用风格迁移CCPL方法、带有风格注意力网络的任意风格迁移SANet方法、基于transformer的图片风格迁移StyTr2方法、重新风格迁移中的注意力机制AdaAttN方法、基于内外部学习和比对学习的艺术风格迁移IEST方法、学习线性转换用于快速图像和视频风格迁移Linear方法和无偏的图像风格迁移通过可逆的神经流ArtFlow方法将六张不同的风格类型图片的风格分别迁移至六张不同的内容图片后获得的风格化图片,本发明在具体实施时与各方法在图片风格迁移上进行效果对比。如图6的(a)、图6的(b)、图6的(c)、图6的(d)、图6的(e)、图6的(f)、图6的(g)、图6的(h)、图6的(i)和图6的(j)所示,本发明在具体实施时从视频中提取视频帧并与各方法在视频风格迁移上进行效果对比,其中,图6的(a)中的第一张图片为输入图片,其中的大图为内容图片,小图为风格类型图片,根据各图片相邻两帧之间差的热力图,从而计算获得相似度LPIPS(Learned PerceptualImage Patch Similarity)指标以评估生成图像与真实图像之间感知相似度,本发明方法和其它各方法处理获得的风格化图片和内容图像的相似度LPIPS指标依次为0.3105、0.4206、0.3679、0.3273、0.3792、0.3253、0.3485、0.3371和0.3343,本发明方法处理获得的风格化图片和内容图像的相似度LPIPS指标最低为0.3105,效果最好,可见本发明方法能够更好的从局部风格模式和全局风格分布的角度学习,进行任意风格迁移的同时生成高质量的风格化图片。
现有的大多数基于注意力的方法都是对VGG模型提取的特征进行处理。本发明提出的局部通道感知的注意力模块LCWA将局部样式模式融合到内容特征中,从而获得局部风格化特征的方法。然而,仅仅依靠局部通道感知的注意力模块LCWA来关注风格图像中局部图案的有限区域,可能会导致与全球风格分布的偏差,为此,本发明提出基于Transformer的全局风格融合模块GSFT来解决这个问题,利用一个Transformer来学习全局风格分布,并动态地生成全局风格权重和偏差,以拉出与之对齐的局部风格化特征。考虑到目前广泛使用的风格损失是基于二阶全局风格统计,这可能导致本发明提出的框架倾向于学习更多的全局风格分布,为此,本发明提出基于补丁的风格迁移损失函数,通过在风格化模式之间正则化局部风格模式来提高风格化图像的质量。
以上所述实施例的各技术特征可以进行任意的组合,为使描述简洁,未对上述实施例中的各个技术特征所有可能的组合都进行描述,然而,只要这些技术特征的组合不存在矛盾,都应当认为是本说明书记载的范围。
以上所述实施例仅表达了本发明的几种实施方式,其描述较为具体和详细,但并不能因此而理解为对发明范围的限制。应当指出的是,对于本领域的普通技术人员来说,在不脱离本发明构思的前提下,还可以做出若干变形和改进,这些都属于本发明的保护范围。因此,本发明的保护范围应以所附权利要求为准。
Claims (8)
1.一种基于局部和全局风格学习的图片高质量任意风格迁移方法,其特征在于,包括:
S1:获取若干内容图片和不同风格类型图片并共同构建为训练集;
S2:建立基于局部和全局风格学习的风格迁移网络,风格迁移网络中包含局部通道感知的注意力模块LCWA和全局风格融合模块GSFT,同时构建风格迁移网络的基于补丁的风格迁移损失函数;将训练集输入风格迁移网络中进行训练,直至基于补丁的风格迁移损失函数收敛,获得训练完成的风格迁移网络;
S3:将待风格迁移的内容图片和目标风格类型图片共同输入至训练完成的风格迁移网络中进行处理,处理完成后输出风格化图片并在显示器进行显示,实现图片高质量风格迁移;
所述的步骤S2中,基于局部和全局风格学习的风格迁移网络包括依次连接的视觉VGG模型的编码器、局部通道感知的注意力模块LCWA、全局风格融合模块GSFT和视觉VGG模型的解码器,风格迁移网络的输入为一张内容图片I c 和一张风格类型图片I s ,依次经过编码器和局部通道感知的注意力模块LCWA处理后获得局部风格化特征F cs l ,将局部风格化特征F cs l 和风格类型图片I s 共同输入至全局风格融合模块GSFT中进行处理,依次经全局风格融合模块GSFT和解码器处理后将风格类型图片的风格转移至内容图片,输出最终的风格化图片I cs ;
所述的局部通道感知的注意力模块LCWA包括三个归一化层Norm、三个卷积层conv和Softmax激活函数,内容图片I c 和风格类型图片I s 经处理后获得内容编码结果F c 和风格编码结果F s ,将内容编码结果F c 分别输入至第一和第三归一化层Norm中进行处理,将风格编码结果F s 分别输入至第二归一化层Norm和第三卷积层conv中进行处理,第一和第二归一化层Norm处理后的结果分别输入至第一和第二卷积层conv中进行处理,将第一和第二卷积层conv处理后的结果相乘后输入Softmax激活函数中处理后输出注意力图A,第三卷积层conv处理后的结果V和注意力图A相乘后获得第一相乘结果,第三卷积层conv处理后的结果V的平方V 2和注意力图A相乘后获得第二相乘结果,第二相乘结果和第一相乘结果的均值M的平方M 2相减后再开根号获得第一相乘结果的标准差S,第三归一化层Norm处理后的结果和第一相乘结果的标准差S点乘后再和第一相乘结果的均值M相加,最终输出局部风格化特征F cs l 作为局部通道感知的注意力模块LCWA的输出。
2.根据权利要求1所述的基于局部和全局风格学习的图片高质量任意风格迁移方法,其特征在于:所述的全局风格融合模块GSFT为基于深度神经网络Transformer的模块,全局风格融合模块GSFT的输入为风格类型图片I s 以及由局部通道感知的注意力模块LCWA处理后获得的局部风格化特征F cs l ,风格类型图片I s 输入深度神经网络Transformer中进行处理,首先将风格类型图片I s 划分为若干个块Patch并构成风格序列Z s ,然后根据预定义的深度神经网络Transformer的索引Q、键K和值V对风格序列Z s 进行编码,然后再输入第一多头注意力模块中进行处理后输出第一注意力结果F s g ,将第一注意力结果F s g 依次输入第四归一化层Norm和第一前馈神经网络FFN中处理后再经过键K和值V进行编码,然后再输入第二多头注意力模块中进行处理,第二多头注意力模块处理后的结果和经索引Q编码后的局部风格化特征F cs l 共同依次进行残差连接Add和第五归一化层Norm处理后分别输入第二和第三前馈神经网络FFN中进行处理后分别输出偏置b s 和权重w s 作为深度神经网络Transformer的输出结果,权重w s 和局部风格化特征F cs l 进行点乘后再与偏置b s 相加后输出局部-全局风格化特征F cs lg 作为全局风格融合模块GSFT的输出。
3.根据权利要求1所述的基于局部和全局风格学习的图片高质量任意风格迁移方法,其特征在于:所述的基于补丁的风格迁移损失函数包括视觉VGG模型的内容损失和风格损失,并构建基于补丁的Gram损失算法加入风格损失中从而建立改进风格损失,使用内容损失对内容图片I c 和风格化图片I cs 的内容相似度进行约束,使用改进风格损失对风格类型图片I s 和风格化图片I cs 的风格相似度进行约束。
4.根据权利要求3所述的基于局部和全局风格学习的图片高质量任意风格迁移方法,其特征在于:所述的基于补丁的Gram损失算法包括补丁操作和Gram矩阵损失函数L ls ,补丁操作过程中首先将风格类型图片I s 和风格化图片I cs 均进行随机裁剪,然后进行图像增强操作后获得若干风格类型补丁和风格化补丁,根据各个风格类型补丁和风格化补丁输入Gram矩阵损失函数L ls 中获得Gram矩阵损失值以进行风格迁移网络的训练。
5.根据权利要求4所述的基于局部和全局风格学习的图片高质量任意风格迁移方法,其特征在于:所述的Gram矩阵损失函数L ls 如下:
L ls =(∑ i N R(l patch i ,C(I^i s ,I s ),τ))/N
R(l patch i ,C(I^i s ,I s ),τ)=l patch i ,当C(I^i s ,I s )≥τ
R(l patch i ,C(I^i s ,I s ),τ)=0,其它
C(I^i s ,I s )=G(E I (I^i s ))·G(E I (I s ))/(|G(E I (I^i s ))|·|G(E I (I s ))|)
其中,N表示补丁的总数量;R( )和τ分别表示阈值函数及其函数参数;l patch i 表示第i个风格类型补丁和风格化补丁的Gram矩阵的余弦相似度;C( )表示两个张量之间的余弦相似度;I^i s 表示风格类型图片I s 的第i个风格类型补丁;G( )表示裁剪CLIP空间中的第三层的Gram矩阵;E I ()表示裁剪CLIP空间的图像编码器。
6.根据权利要求5所述的基于局部和全局风格学习的图片高质量任意风格迁移方法,其特征在于:所述的第i个风格类型补丁和风格化补丁的Gram矩阵的余弦相似度l patch i 如下:
l patch i =‖G(E I (aug(I^i cs )))-G(E I (aug(I^i s )))‖2
其中,I^i cs 表示风格化图片I cs 的第i个风格化补丁;aug( )表示随机几何增强;‖‖2表示二范数。
7.一种电子设备,其特征在于,包括:相互耦接的存储器和处理器,其中,所述存储器存储有程序数据,所述处理器调用所述程序数据以执行如权利要求1-6中任一项所述的方法。
8.一种计算机可读存储介质,其上存储有程序数据,其特征在于,所述程序数据被处理器执行时实现如权利要求1-6中任一项所述的方法。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202411769124.6A CN119251069B (zh) | 2024-12-04 | 2024-12-04 | 基于局部和全局风格学习的图片高质量任意风格迁移方法 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202411769124.6A CN119251069B (zh) | 2024-12-04 | 2024-12-04 | 基于局部和全局风格学习的图片高质量任意风格迁移方法 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| CN119251069A CN119251069A (zh) | 2025-01-03 |
| CN119251069B true CN119251069B (zh) | 2025-04-15 |
Family
ID=94026549
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| CN202411769124.6A Active CN119251069B (zh) | 2024-12-04 | 2024-12-04 | 基于局部和全局风格学习的图片高质量任意风格迁移方法 |
Country Status (1)
| Country | Link |
|---|---|
| CN (1) | CN119251069B (zh) |
Families Citing this family (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN119991910B (zh) * | 2025-04-11 | 2025-07-11 | 南昌大学 | 三维场景风格迁移方法、电子设备和存储介质 |
| CN120182772B (zh) * | 2025-05-21 | 2025-09-09 | 杭州高新区(滨江)区块链与数据安全研究院 | 针对图像-点云融合感知模型的对抗补丁生成方法和设备 |
| CN120807897B (zh) * | 2025-09-09 | 2025-12-26 | 合肥中科类脑智能技术有限公司 | 电力巡检的多天气鲁棒目标检测方法、装置及存储介质 |
Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN115995035A (zh) * | 2022-10-17 | 2023-04-21 | 北京航空航天大学 | 一种基于热力图与风格迁移的对抗补丁隐蔽性增强方法 |
| CN118014822A (zh) * | 2023-12-29 | 2024-05-10 | 浙江大学 | 基于对比学习和注意力机制的风格迁移方法、计算机设备、可读存储介质和程序产品 |
Family Cites Families (8)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN110880016B (zh) * | 2019-10-18 | 2022-07-15 | 平安科技(深圳)有限公司 | 图像风格迁移方法、装置、设备及存储介质 |
| CN111932445B (zh) * | 2020-07-27 | 2024-07-16 | 广州市百果园信息技术有限公司 | 对风格迁移网络的压缩方法及风格迁移方法、装置和系统 |
| CN111815509B (zh) * | 2020-09-02 | 2021-01-01 | 北京邮电大学 | 一种图像风格转换及模型训练的方法及装置 |
| US12327331B2 (en) * | 2021-12-02 | 2025-06-10 | Robert Bosch Gmbh | System and method for augmenting vision transformers |
| CN114581341B (zh) * | 2022-03-28 | 2025-06-03 | 杭州师范大学 | 一种基于深度学习的图像风格迁移方法及系统 |
| CN117475216B (zh) * | 2023-11-01 | 2024-11-29 | 哈尔滨工程大学 | 一种基于aglt网络的高光谱与激光雷达数据融合分类方法 |
| CN118279131A (zh) * | 2024-03-01 | 2024-07-02 | 安徽理工大学 | 一种基于轻量级Vision Transformer网络的图像风格迁移方法 |
| CN118172235A (zh) * | 2024-03-14 | 2024-06-11 | 浪潮云信息技术股份公司 | 基于注意力机制的浮雕风格迁移方法、系统、设备及介质 |
-
2024
- 2024-12-04 CN CN202411769124.6A patent/CN119251069B/zh active Active
Patent Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN115995035A (zh) * | 2022-10-17 | 2023-04-21 | 北京航空航天大学 | 一种基于热力图与风格迁移的对抗补丁隐蔽性增强方法 |
| CN118014822A (zh) * | 2023-12-29 | 2024-05-10 | 浙江大学 | 基于对比学习和注意力机制的风格迁移方法、计算机设备、可读存储介质和程序产品 |
Also Published As
| Publication number | Publication date |
|---|---|
| CN119251069A (zh) | 2025-01-03 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN119251069A (zh) | 基于局部和全局风格学习的图片高质量任意风格迁移方法 | |
| CN109376582B (zh) | 一种基于生成对抗网络的交互式人脸卡通方法 | |
| CN113807265B (zh) | 一种多样化的人脸图像合成方法及系统 | |
| CN111476200B (zh) | 基于生成对抗网络的人脸去识别化生成方法 | |
| CN112257815B (zh) | 模型生成方法、目标检测方法、装置、电子设备及介质 | |
| CN115147456B (zh) | 一种基于时序自适应卷积与注意力机制的目标跟踪方法 | |
| JP2022513858A (ja) | 顔画像生成用のデータ処理方法、データ処理機器、コンピュータプログラム、及びコンピュータ機器 | |
| CN110728628A (zh) | 一种基于条件生成对抗网络的人脸去遮挡方法 | |
| CN111401216A (zh) | 图像处理、模型训练方法、装置、计算机设备和存储介质 | |
| CN113724354B (zh) | 基于参考图颜色风格的灰度图像着色方法 | |
| CN114170066A (zh) | 一种基于多注意力网络的任意风格迁移方法 | |
| CN113255457A (zh) | 基于人脸表情识别的动画角色面部表情生成方法及系统 | |
| CN111292251B (zh) | 图像偏色校正方法、装置以及计算机存储介质 | |
| CN115330590B (zh) | 一种图像风格迁移方法及系统 | |
| Wu et al. | Self-driven dual-path learning for reference-based line art colorization under limited data | |
| CN116486495B (zh) | 一种基于注意力与生成对抗网络的人脸图像隐私保护方法 | |
| CN119181124B (zh) | 一种基于深度学习的表情编辑模型的训练方法 | |
| CN119402630B (zh) | 基于Transformer的多任务编码-解码器立体图像质量评估方法 | |
| Chen et al. | Gap-closing matters: Perceptual quality evaluation and optimization of low-light image enhancement | |
| Akram et al. | SARGAN: Spatial attention-based residuals for facial expression manipulation | |
| CN113658091A (zh) | 一种图像评价方法、存储介质及终端设备 | |
| CN115294424A (zh) | 一种基于生成对抗网络的样本数据增强方法 | |
| CN111612090B (zh) | 基于内容颜色交叉相关的图像情感分类方法 | |
| CN117115058A (zh) | 基于轻量特征提取和颜色恢复的弱光图像融合方法 | |
| CN117635771A (zh) | 一种基于半监督对比学习的场景文本编辑方法和装置 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PB01 | Publication | ||
| PB01 | Publication | ||
| SE01 | Entry into force of request for substantive examination | ||
| SE01 | Entry into force of request for substantive examination | ||
| GR01 | Patent grant | ||
| GR01 | Patent grant |