WO2025200895A1 - 用于图像处理的方法、装置、设备和存储介质 - Google Patents

用于图像处理的方法、装置、设备和存储介质

Info

Publication number
WO2025200895A1
WO2025200895A1 PCT/CN2025/078627 CN2025078627W WO2025200895A1 WO 2025200895 A1 WO2025200895 A1 WO 2025200895A1 CN 2025078627 W CN2025078627 W CN 2025078627W WO 2025200895 A1 WO2025200895 A1 WO 2025200895A1
Authority
WO
WIPO (PCT)
Prior art keywords
image
target
training
model
editing
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
PCT/CN2025/078627
Other languages
English (en)
French (fr)
Inventor
任玉羲
吴捷
卢彦作
匡华峰
肖学锋
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Beijing Zitiao Network Technology Co Ltd
Original Assignee
Beijing Zitiao Network Technology Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Beijing Zitiao Network Technology Co Ltd filed Critical Beijing Zitiao Network Technology Co Ltd
Publication of WO2025200895A1 publication Critical patent/WO2025200895A1/zh
Pending legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T3/00Geometric image transformations in the plane of the image
    • G06T3/04Context-preserving transformations, e.g. by using an importance map
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F3/00Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
    • G06F3/01Input arrangements or combined input and output arrangements for interaction between user and computer
    • G06F3/048Interaction techniques based on graphical user interfaces [GUI]
    • G06F3/0484Interaction techniques based on graphical user interfaces [GUI] for the control of specific functions or operations, e.g. selecting or manipulating an object, an image or a displayed text element, setting a parameter value or selecting a range
    • G06F3/04845Interaction techniques based on graphical user interfaces [GUI] for the control of specific functions or operations, e.g. selecting or manipulating an object, an image or a displayed text element, setting a parameter value or selecting a range for image manipulation, e.g. dragging, rotation, expansion or change of colour
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T11/00Two-dimensional [2D] image generation
    • G06T11/60Creating or editing images; Combining images with text

Definitions

  • Example embodiments of the present disclosure generally relate to the field of computers, and more particularly, to methods, devices, apparatuses, and computer-readable storage media for image processing.
  • Image editing tasks are important tasks in image processing tasks.
  • Applications with image editing functions can obtain the user's input image, editing area (also called the area to be edited) and text, and generate an edited image corresponding to the text based on this information.
  • the edited image Compared with the input image, the edited image only differs in the editing area, and the contents of the two in other areas outside the editing area are the same. It is expected that the quality of the edited image can be improved and the effect of image editing can be improved.
  • a method for image processing comprises: obtaining a target input image and information indicating a target editing region, the target editing region being located inside or outside the input image; determining a target input for image editing based on the target input image and the information indicating the target editing region; and generating a target output image based on the target input using an image editing model, wherein the target editing region is updated in the target output image compared to the target input image, wherein the image editing model is trained using reward information associated with a training output image generated by the image editing model from the training input image.
  • a device for image processing includes: an acquisition module configured to acquire a target input image and indication information of a target editing region, where the target editing region is located inside or outside the input image; an input determination module configured to determine a target input for image editing based on the target input image and the indication information; and an image generation module configured to generate a target output image using an image editing model based on the target input, where the target editing region is updated in the target output image compared to the target input image, wherein the image editing model is trained using reward information, and the reward information is associated with a training output image generated by the image editing model from the training input image.
  • a computer program product comprising a computer program, wherein when the computer program is executed by a processor, the method according to the first aspect of the present disclosure is implemented.
  • FIG1 shows a schematic diagram of an example environment in which embodiments of the present disclosure can be implemented
  • FIG2 shows a schematic diagram of an example architecture for training an image editing model according to some embodiments of the present disclosure
  • FIG3 shows a schematic diagram of an example according to some embodiments of the present disclosure
  • FIG4 shows a flowchart of a process for image processing according to some embodiments of the present disclosure
  • FIG5 shows a schematic structural block diagram of an apparatus for image processing according to some embodiments of the present disclosure.
  • a prompt message in response to receiving a user's active request, may be sent to the user, for example, in the form of a pop-up window, in which the prompt message may be presented in text form.
  • the pop-up window may also include a selection control for the user to select "agree” or “disagree” to provide personal information to the electronic device.
  • a “neural network” is a machine learning network based on deep learning.
  • a neural network is capable of processing inputs and providing corresponding outputs. It typically includes an input layer, an output layer, and one or more hidden layers between the input and output layers. Neural networks used in deep learning applications typically include many hidden layers, thereby increasing the depth of the network. The layers of a neural network are connected in sequence so that the output of the previous layer is provided as input to the next layer, where the input layer receives the input of the neural network and the output of the output layer serves as the final output of the neural network.
  • Each layer of a neural network includes one or more nodes (also called processing nodes or neurons), each of which processes the input from the previous layer.
  • machine learning can be roughly divided into three stages, namely the training stage, the testing stage, and the application stage (also known as the inference stage).
  • the training stage a given model can be trained using a large amount of training data, and the parameter values are continuously updated iteratively until the model can obtain consistent inferences that meet the expected goals from the training data.
  • the model can be considered to be able to learn the association between input and output (also known as input-to-output mapping) from the training data.
  • the parameter values of the trained model are determined.
  • the testing stage the test input is applied to the trained model to test whether the model can provide the correct output, thereby determining the performance of the model.
  • the model can be used to process the actual input based on the parameter values obtained through training to determine the corresponding output.
  • FIG1 shows a schematic diagram of an example environment 100 in which embodiments of the present disclosure can be implemented.
  • the environment 100 may include an electronic device 110 .
  • Electronic device 110 may obtain an input image 102 and indication information 104.
  • the input image 102 and indication information 104 may be obtained in real time or pre-acquired and stored locally.
  • the input image 102 may be an image of any appropriate type (e.g., a grayscale image, an RGB color image, etc.), in any format, and of any size.
  • the indication information 104 may at least indicate an editing area for the input image 102.
  • the indication information 104 may include an image 106 indicating the editing area, where the white area in image 106 is the editing area.
  • the electronic device 110 can generate an output image 112 based on the input image 102 and the indication information 104. Compared with the input image 102, the editing area is updated in the output image 112. That is, the input image 102 and the output image 112 are different only in the editing area. In some embodiments, the electronic device 110 can generate the output image 112 based on the input image 102 and the indication information 104 with the help of an image editing model 120.
  • the image editing model 120 can also be simply referred to as model 120.
  • the image editing model 120 can be deployed locally on the electronic device 110, or it can be deployed at other electronic devices (such as remote electronic devices).
  • the image editing model 120 can, for example, include but is not limited to any appropriate model such as a Transformer model, a convolutional neural network (CNN), a recurrent neural network (RNN), a deep neural network (DNN), etc.
  • the electronic device 110 can be any type of device with computing capabilities, including a terminal device or a server device.
  • the terminal device can be any type of mobile terminal, fixed terminal, or portable terminal, including a mobile phone, a desktop computer, a laptop computer, a notebook computer, a netbook computer, a tablet computer, a media computer, a multimedia tablet, a personal communication system (PCS) device, a personal navigation device, a personal digital assistant (PDA), an audio/video player, a digital camera/camcorder, a positioning device, a television receiver, a radio broadcast receiver, an e-book device, a gaming device, or any combination thereof, including accessories and peripherals of these devices or any combination thereof.
  • PCS personal communication system
  • PDA personal digital assistant
  • image editing is a crucial task in image processing.
  • Applications with image editing capabilities can obtain a user's input image, an editing area, and text, and based on this information, generate an edited image corresponding to the text.
  • an embodiment of the present disclosure proposes an improved scheme for image processing.
  • a target input image and indication information of a target editing area are obtained, and the target editing area is located inside or outside the input image.
  • a target input for image editing is determined.
  • an image editing model is used to generate a target output image.
  • the target editing area is updated in the target output image, wherein the image editing model is trained using reward information, and the reward information is associated with the training output image generated by the image editing model from the training input image.
  • the electronic device 110 may implement an image processing task with the aid of an image editing model.
  • the image editing model may include any appropriate model.
  • the image editing model may include a diffusion model.
  • the electronic device 110 may obtain a target input image and information indicating a target editing area.
  • the target editing area may be located inside or outside the input image. If the target editing area is located inside the input image, the electronic device 110 may modify or erase/reconstruct the content located inside the input image at the target editing area using the image editing model. If the target editing area is located outside the input image, the electronic device 110 may expand the content located outside the input image at the target editing area using the image editing model.
  • the electronic device 110 may determine the target input for image editing based on the target input image and the indication information.
  • the electronic device 110 may obtain a first input image from the target input image as part of the target input by adding noise to the target editing area (any appropriate type of noise may be added in any appropriate manner).
  • the electronic device 110 may also obtain a second input image as part of the target input by removing the target editing area from the target input image.
  • the electronic device 110 may also generate a mask for indicating the position of the target editing area as part of the target input.
  • the indication information for the target editing area may indicate the target editing area in any appropriate manner. If the indication information includes a mask for the target editing area, the electronic device 110 may directly determine the mask for indicating the position of the target editing area based on the indication information.
  • the electronic device 110 can then use the trained image editing model to generate a target output image based on the target input. Compared with the target input image, the target editing area is updated in the target output image. That is, the content at the target editing area of the target input image is different from the content at the target editing area of the target output image.
  • the electronic device 110 can also obtain target description information about the image editing target (for example, it can include descriptive text). For example, the electronic device 110 can use the trained image editing model to generate the target output image based on the target input and the target description information.
  • the image editing model can be trained using reward information.
  • the reward information is associated with the training output image generated by the image editing model from the training input image.
  • at least a portion of the reward information is generated using a reward model, and the image editing model and the reward model are trained through an adversarial training mode.
  • the reward model may include multiple different types of reward models, for example, a consistency reward model, a matching reward model, a quality reward model, and so on.
  • the image editing model can be regarded as a generator and the reward model can be regarded as a discriminator.
  • FIG2 shows a schematic diagram of an example architecture 200 for training an image editing model according to some embodiments of the present disclosure.
  • the architecture 200 may be implemented at the electronic device 110.
  • the architecture 200 is described below with reference to FIG1.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • Human Computer Interaction (AREA)
  • Processing Or Creating Images (AREA)
  • Image Analysis (AREA)

Abstract

根据本公开的实施例,提供了用于图像处理的方法、装置、设备和存储介质。该方法包括:获取目标输入图像和对目标编辑区域的指示信息,目标编辑区域位于输入图像内部或外部;基于目标输入图像和指示信息,确定用于图像编辑的目标输入;以及基于目标输入,利用图像编辑模型来生成目标输出图像,与目标输入图像相比,目标编辑区域在目标输出图像中被更新。图像编辑模型是利用奖励信息而训练的,奖励信息与图像编辑模型从训练输入图像所生成的训练输出图像相关联。由此,可以利用奖励信息来训练图像编辑模型,这有助于提升图像编辑的效率和质量。

Description

用于图像处理的方法、装置、设备和存储介质
本申请要求2024年3月25日递交的、标题为“用于图像处理的方法、装置、设备和存储介质”、申请号为202410345788.3的中国发明专利申请的优先权,该申请的全部内容通过引用结合在本申请中。
技术领域
本公开的示例实施例总体涉及计算机领域,特别地涉及用于图像处理的方法、装置、设备和计算机可读存储介质。
背景技术
随着互联网技术的发展,越来越多的应用或平台等均提供图像处理功能,给广大用户带来了诸多便利。图像编辑任务是图像处理任务中的重要任务。具有图像编辑功能的应用可以获取用户的输入图像、编辑区域(也可以称之为待编辑区域)以及文本,并基于这些信息生成对应文本的编辑后图像。编辑后图像与输入图像相比,仅在编辑区域处存在不同,二者在编辑区域之外的其他区域中的内容相同。期望可以提高编辑后图像的质量,提高图像编辑的效果。
发明内容
在本公开的第一方面,提供了一种用于图像处理的方法。该方法包括:获取目标输入图像和对目标编辑区域的指示信息,目标编辑区域位于输入图像内部或外部;基于目标输入图像和指示信息,确定用于图像编辑的目标输入;以及基于目标输入,利用图像编辑模型来生成目标输出图像,与目标输入图像相比,目标编辑区域在目标输出图像中被更新,其中图像编辑模型是利用奖励信息而训练的,奖励信息与图像编辑模型从训练输入图像所生成的训练输出图像相关联。
在本公开的第二方面,提供了一种用于图像处理的装置。该装置包括:获取模块,被配置为获取目标输入图像和对目标编辑区域的指示信息,目标编辑区域位于输入图像内部或外部;输入确定模块,被配置为基于目标输入图像和指示信息,确定用于图像编辑的目标输入;以及图像生成模块,被配置为基于目标输入,利用图像编辑模型来生成目标输出图像,与目标输入图像相比,目标编辑区域在目标输出图像中被更新,其中图像编辑模型是利用奖励信息而训练的,奖励信息与图像编辑模型从训练输入图像所生成的训练输出图像相关联。
在本公开的第三方面,提供了一种电子设备。该电子设备包括:至少一个处理单元;以及至少一个存储器,至少一个存储器被耦合到至少一个处理单元并且存储用于由至少一个处理单元执行的指令,指令在由至少一个处理单元执行时使电子设备执行根据本公开第一方面的方法。
在本公开的第四方面,提供了一种计算机可读存储介质,其上存储有计算机程序,计算机程序在被处理器执行时使处理器实现根据本公开第一方面的方法。
根据本公开的第五方面,提供了一种计算机程序产品,包括计算机程序,其中计算机程序被处理器执行时实现根据本公开的第一方面的方法。
应当理解,本内容部分中所描述的内容并非旨在限定本公开的实施例的关键特征或重要特征,也不用于限制本公开的范围。本公开的其它特征将通过以下的描述而变得容易理解。
附图说明
结合附图并参考以下详细说明,本公开各实施例的上述和其他特征、优点及方面将变得更加明显。在附图中,相同或相似的附图标记表示相同或相似的元素,其中:
图1示出了本公开的实施例能够在其中实现的示例环境的示意图;
图2示出了根据本公开的一些实施例的训练图像编辑模型的示例架构的示意图;
图3示出了根据本公开的一些实施例的示例的示意图;
图4示出了根据本公开的一些实施例的用于图像处理的过程的流程图;
图5示出了根据本公开的一些实施例的用于图像处理的装置的示意性结构框图;以及
图6示出了其中可以实现本公开的一个或多个实施例的电子设备的框图。
具体实施方式
下面将参照附图更详细地描述本公开的实施例。虽然附图中示出了本公开的一些实施例,然而应当理解的是,本公开可以通过各种形式来实现,而且不应该被解释为限于这里阐述的实施例,相反,提供这些实施例是为了更加透彻和完整地理解本公开。应当理解的是,本公开的附图及实施例仅用于示例性作用,并非用于限制本公开的保护范围。
在本公开的实施例的描述中,术语“包括”及其类似用语应当理解为开放性包含,即“包括但不限于”。术语“基于”应当理解为“至少部分地基于”。术语“一个实施例”或“该实施例”应当理解为“至少一个实施例”。术语“一些实施例”应当理解为“至少一些实施例”。下文还可能包括其它明确的和隐含的定义。
需要说明的是,本公开的技术方案中,所涉及的用户个人信息的获取,存储和应用等,均符合相关法律法规的规定,且不违背公序良俗。
可以理解的是,在使用本公开各实施例公开的技术方案之前,均应当根据相关法律法规通过适当的方式对本公开所涉及个人信息的类型、使用范围、使用场景等告知用户并获得用户的授权。
例如,在响应于接收到用户的主动请求时,向用户发送提示信息,以明确地提示用户,其请求执行的操作将需要获得和使用到用户的个人信息,从而使得用户可以根据提示信息来自主地选择是否向执行本公开技术方案的操作的电子设备、应用程序、服务器或存储介质等软件或硬件提供个人信息。
作为一种可选的但非限制性的实现方式,响应于接收到用户的主动请求,向用户发送提示信息的方式,例如可以是弹出窗口的方式,弹出窗口中可以以文字的方式呈现提示信息。此外,弹出窗口中还可以承载供用户选择“同意”或“不同意”向电子设备提供个人信息的选择控件。
可以理解的是,上述通知和获取用户授权过程仅是示意性的,不对本公开的实施例构成限定,其他满足相关法律法规的方式也可应用于本公开的实施例中。
如本文中所使用的,术语“模型”可以从训练数据中学习到相应的输入与输出之间的关联关系,从而在训练完成后可以针对给定的输入,生成对应的输出。模型的生成可以基于机器学习技术。深度学习是一种机器学习算法,通过使用多层处理单元来处理输入和提供相应输出。神经网络模型是基于深度学习的模型的一个示例。在本文中,“模型”也可以被称为“机器学习模型”、“学习模型”、“机器学习网络”或“学习网络”,这些术语在本文中可互换地使用。
“神经网络”是一种基于深度学习的机器学习网络。神经网络能够处理输入并且提供相应输出,其通常包括输入层和输出层以及在输入层与输出层之间的一个或多个隐藏层。在深度学习应用中使用的神经网络通常包括许多隐藏层,从而增加网络的深度。神经网络的各个层按顺序相连,从而前一层的输出被提供作为后一层的输入,其中输入层接收神经网络的输入,而输出层的输出作为神经网络的最终输出。神经网络的每个层包括一个或多个节点(也称为处理节点或神经元),每个节点处理来自上一层的输入。
通常,机器学习大致可以包括三个阶段,即训练阶段、测试阶段和应用阶段(也称为推理阶段)。在训练阶段,给定的模型可以使用大量的训练数据进行训练,不断迭代更新参数值,直到模型能够从训练数据中获得一致的满足预期目标的推理。通过训练,模型可以被认为能够从训练数据中学习从输入到输出之间的关联(也称为输入到输出的映射)。训练后的模型的参数值被确定。在测试阶段,将测试输入应用到训练后的模型,测试模型是否能够提供正确的输出,从而确定模型的性能。在应用阶段,模型可以被用于基于训练得到的参数值,对实际的输入进行处理,确定对应的输出。
示例环境
图1示出了本公开的实施例能够在其中实现的示例环境100的示意图。如图1所示,环境100可以包括电子设备110。
电子设备110可以获取输入图像102和指示信息104。输入图像102和指示信息104可以是实时获取的,也可以预先获取并存储在本地的。输入图像102可以是任意适当类型(例如灰度图像、RGB彩色图像等)、任意格式、任意尺寸的图像。指示信息104至少可以指示针对输入图像102的编辑区域。例如,指示信息104可以包括用于指示编辑区域的图像106,在图像106中,白色区域为编辑区域。
电子设备110可以基于输入图像102和指示信息104生成输出图像112。与输入图像102相比,编辑区域在输出图像112中被更新。也即输入图像102和输出图像112仅在编辑区域处不同。在一些实施例中,电子设备110可以借助图像编辑模型120来基于输入图像102和指示信息104生成输出图像112。图像编辑模型120也可以简称为模型120。图像编辑模型120可以被部署在电子设备110本地,也可以被部署在其他电子设备(例如远端电子设备)处。图像编辑模型120例如可以包括但不限于Transformer模型、卷积神经网络(CNN)、循环神经网络(RNN)、深度神经网络(DNN)等任意适当的模型。
在环境100中,电子设备110可以是任意类型的具有计算能力的设备,包括终端设备或服务端设备。终端设备可以是任意类型的移动终端、固定终端或便携式终端,包括移动手机、台式计算机、膝上型计算机、笔记本计算机、上网本计算机、平板计算机、媒体计算机、多媒体平板、个人通信系统(PCS)设备、个人导航设备、个人数字助理(PDA)、音频/视频播放器、数码相机/摄像机、定位设备、电视接收器、无线电广播接收器、电子书设备、游戏设备或者前述各项的任意组合,包括这些设备的配件和外设或者其任意组合。
服务端设备可以是独立的物理服务器,也可以是多个物理服务器构成的服务器集群或者分布式系统,还可以是提供云服务、云数据库、云计算、云函数、云存储、网络服务、云通信、中间件服务、域名服务、安全服务、内容分发网络、以及大数据和人工智能平台等基础云计算服务的云服务器。服务端设备例如可以包括计算系统/服务器,诸如大型机、边缘计算节点、云环境中的计算设备,等等。
应当理解,仅出于示例性的目的描述环境100的结构和功能,而不暗示对于本公开的范围的任何限制。
如前文所提及的,图像编辑任务是图像处理任务中的重要任务。具有图像编辑功能的应用可以获取用户的输入图像、编辑区域以及文本,并基于这些信息生成对应文本的编辑后图像。人们期望可以提升生成编辑后图像的速度并提升编辑后图像的质量。
有鉴于此,本公开的实施例提出了一种图像处理的改进方案。根据本公开的各种实施例,获取目标输入图像和对目标编辑区域的指示信息,目标编辑区域位于输入图像内部或外部。基于目标输入图像和指示信息,确定用于图像编辑的目标输入。基于目标输入,利用图像编辑模型来生成目标输出图像。与目标输入图像相比,目标编辑区域在目标输出图像中被更新,其中图像编辑模型是利用奖励信息而训练的,奖励信息与图像编辑模型从训练输入图像所生成的训练输出图像相关联。
以此方式,在本公开的实施例中,可以利用奖励信息来训练图像编辑模型,这有助于提升图像编辑的效率和性能。
以下将继续参考附图描述本公开的一些示例实施例。
图像处理的详细过程
在本公开的实施例中,电子设备110可以借助图像编辑模型来实现图像处理任务。图像编辑模型可以包括任意适当的模型。在一些实施例中,图像编辑模型可以包括扩散模型(Diffusion Model)。
在模型的应用阶段,电子设备110可以获取目标输入图像和对目标编辑区域的指示信息。目标编辑区域可以位于输入图像内部,也可以位于输入图像外部。如果目标编辑区域位于输入图像内部,电子设备110可以借助图像编辑模型对位于输入图像内部的、目标编辑区域处的内容进行修改或擦除-重建。如果目标编辑区域位于输入图像外部,电子设备110可以借助图像编辑模型对位于输入图像外部的目标编辑区域处的内容进行外扩。
电子设备110可以基于目标输入图像和指示信息,确定用于图像编辑的目标输入。在一些实施例中,电子设备110可以通过向目标编辑区域添加噪声(可以通过任意适当方式添加任意适当类型的噪声),从目标输入图像得到第一输入图像,作为目标输入的一部分。电子设备110还可以通过从目标输入图像移除目标编辑区域,得到第二输入图像,作为目标输入的一部分。电子设备110还可以生成用于指示目标编辑区域的位置的掩码,作为目标输入的一部分。需要注意的是,对目标编辑区域的指示信息可以以任意适当方式指示目标编辑区域,如果指示信息包括对目标编辑区域的掩码,电子设备110可以直接基于指示信息确定用于指示目标编辑区域的位置的掩码。
电子设备110进而可以基于目标输入,利用经训练的图像编辑模型来生成目标输出图像。与目标输入图像相比,目标编辑区域在目标输出图像中被更新。也即,目标输入图像的目标编辑区域处的内容和目标输出图像的目标编辑区域处的内容不同。在一些实施例中,电子设备110还可以获取关于图像编辑目标的目标描述信息(例如可以包括描述文本)。电子设备110例如可以基于目标输入和目标描述信息,利用经训练的图像编辑模型来生成目标输出图像。
关于图像编辑模型的训练过程,这个图像编辑模型可以是利用奖励信息而训练的。奖励信息与图像编辑模型从训练输入图像所生成的训练输出图像相关联。在一些实施例中,奖励信息的至少一部分是利用奖励模型生成的,并且图像编辑模型与奖励模型通过对抗训练模式被训练。奖励模型可以包括多个不同类型的奖励模型,例如可以包括一致性奖励模型,匹配度奖励模型,质量奖励模型,等等。在通过对抗训练模式训练图像编辑模型与奖励模型的情况下,可以将图像编辑模型视作生成器,将奖励模型视作判别器。
图2示出了根据本公开的一些实施例的训练图像编辑模型的示例架构200的示意图。架构200可以被实现在电子设备110处。下面参考图1描述架构200。
在模型的训练阶段,电子设备110可以获取训练输入图像212、针对训练输入图像212的训练编辑区域的训练指示信息214以及关于图像编辑目标的描述信息202。这里的训练输入图像212和训练指示信息214可以是从数据集201中获取到的,数据集201可以为包括大量训练输入图像212以及与训练输入图像212相应的训练指示信息的训练数据集。
电子设备110可以基于训练输入图像212和训练指示信息214确定用于图像编辑的训练输入220。示例性地,电子设备110可以通过向训练编辑区域添加噪声,从训练输入图像212得到第一训练输入图像,222作为训练输入220的一部分。电子设备110还可以通过从训练输入图像212移除训练编辑区域,得到第二训练输入图像224,作为训练输入220的一部分。电子设备110还可以生成用于指示训练编辑区域的位置的掩码226,作为训练输入220的一部分。在一些实施例中,如果指示信息214直接就包括掩码226,电子设备110也可以直接基于指示信息214确定掩码226。电子设备110可以将训练输入220和描述信息202提供给待训练的图像编辑模型(例如图中所示的扩散模型230)以利用图像编辑模型来生成针对训练输入图像212的训练输出图像232。扩散模型230例如可以基于训练输入220预测加入的噪声,学习到基本的图像编辑能力。
电子设备110可以基于训练输出图像232,生成用于评估训练输出图像232的至少一项奖励作为奖励信息。至少一项奖励例如可以包括匹配度奖励,其指示训练输出图像212中的训练编辑区域与描述信息202的匹配程度的(匹配度奖励越高,则匹配程度越高)。匹配度奖励的使用有利于提高图像编辑的图文匹配度,这是图像编辑性能的重要方面。奖励还可以包括一致性奖励,其指示编辑区域内部和编辑区域外部之间的视觉一致性(一致性奖励越高,则编辑区域内部和外部之间的视觉一致性越高)。也即,一致性奖励可以评估编辑区域内部与外部之间的视觉内容是否和谐。奖励还可以包括质量奖励,其指示训练输出图像232的视觉感知质量(例如美学质量、真实感、细节等)(质量奖励越高,视觉感知质量越高)。特别地,在一下实施例中,质量奖励可以是美感奖励。
在一些实施例中,这至少一项奖励中的至少一部分可以是利用至少一个奖励模型生成的。例如,架构200还可以包括用于生成一致性奖励的一致性奖励模型240、用于生成匹配度奖励的匹配度奖励模型250以及用于生成质量奖励的质量奖励模型260。这里的一致性奖励模型240例如可以是与扩散模型230一同通过对抗训练模式被训练。在通过对抗训练模式训练扩散模型230与一致性奖励模型240的情况下,可以将扩散模型230视作生成器,将一致性奖励模型240视作判别器。这里的匹配度奖励模型250和质量奖励模型260可以是预先训练好的模型。例如,匹配度奖励模型250可以是预先利用匹配度数据集251训练好的模型,质量奖励模型260可以是预先利用质量数据集261训练好的模型。在训练图像编辑模型的过程中,匹配度奖励模型250和质量奖励模型260的模型参数可以是固定不变的。
至少一项奖励例如可以被表示为具体的分数。也即至少一个奖励模型可以分别基于训练输出图像212中的训练编辑区域与描述信息202的匹配程度、训练输入图像212与训练输出图像232中除训练编辑区域之外的其余区域之间的视觉一致性以及训练输出图像232的视觉感知质量来进行打分,打分结果也即至少一个奖励。
电子设备110例如可以基于至少一项奖励,确定用于扩散模型230的目标损失。在一些实施例中,电子设备110可以直接基于至少一项奖励,来确定总损失205(也可以被表示为Lreward)。电子设备110例如可以通过对至少一项奖励进行加权求和来得到总损失205。电子设备110例如可以将总损失205确定为目标损失,并利用目标损失来训练扩散模型230以确定扩散模型230的模型参数。
备选地或者附加地,在一些实施例中,为了使得输出图像中除编辑区域之外的其余区域和输入图像保持一致,电子设备110还可以确定训练输入图像212与训练输出图像232之间的图像差异。
具体地,电子设备110可以基于训练输入图像212的像素与训练输出图像232的像素之间的差异,确定像素级别差异205(也可以被表示为Lreg)。电子设备110还可以基于训练输入图像212的特征表示与训练输出图像232的特征表示之间的差异,确定特征级别差异204(也可以被表示为Lvgg)。电子设备110例如可以利用VGG网络特征层203来确定训练输入图像212的特征表示与训练输出图像232的特征表示之间的差异,也即利用VGG网络特征层203确定特征级别差异204。
电子设备110可以基于图像差异(也即特征级别差异204和像素级别差异205)以及至少一项奖励来确定第一目标损失(也可以被称之为感知反馈学习Lpefl)。电子设备110进而可以利用第一目标损失来训练扩散模型230以确定扩散模型230的模型参数。
在一些实施例中,在利用对抗训练模式训练扩散模型230和一致性奖励模型240的情况下,生成器(也即扩散模型230)需要尽可能生成逼真的图像(也可以理解为和训练输入图像212相近的训练输出图像232)来欺骗一致性奖励模型240,判别器(也即一致性奖励模型240)需要尽可能判别输入的是真图(也即训练输入图像212)还是假图(也即训练输出图像232)。电子设备110可以将第一目标损失(也即感知反馈学习Lpefl)确定为生成器损失(可以被称之为LG),将一致性奖励模型240的判别结果和真实结果直接的差异确定为判别器损失207(也可以被称之为LD)。判别器的损失优化目标是提高真图的分数并降低假图的分数。电子设备110可以利用生成器损失和判别器损失207来采用对抗训练模式训练扩散模型230和一致性奖励模型240。
在一些实施例中,为了提高图像处理的效率,电子设备110对扩散模型230的训练可以包括多个阶段。以多个阶段包括第一阶段和第二阶段为例(可以理解,还可以包括更多阶段),第一阶段的正向扩散过程中的噪声添加粒度细于第二阶段的正向扩散过程中的噪声添加粒度。这样的多阶段训练,且靠前的阶段的噪声添加粒度细于靠后的阶段的噪声添加粒度的训练方式也可以被称之为渐进式训练。示例性地,可以将第一阶段的正向扩散过程中的噪声添加粒度(也可以称之为第一阶段的扩散模型的优化步数)确定为20(也可以称之为T=20),将第二阶段的正向扩散过程中的噪声添加粒度(也可以称之为第二阶段的扩散模型的优化步数)确定为8(也可以称之为T=8)。
优化步数越长(也即噪声添加粒度越细),输入到奖励模型的图像质量一般也就越高。图3示出了根据本公开的一些实施例的示例300的示意图。如图3所示,在采用多阶段训练方式训练模型后模型的输出效果(也即图中“加速”对应的柱形图)的采用传统一阶段训练方式训练模型后模型的输出效果(也即图中“无加速”对应的柱形图),在外扩,修改以及擦除-重建等多种图像处理场景中的图像处理效果并无太大差异。由此,采用二阶段的训练方式,在第一阶段通过较长的优化步数先初步提高生成的图像的质量,在第二阶段缩小优化步数则是促进加速效果,可以在达到不损失性能的条件下提高图像编辑的效率。
综上所述,根据本公开的实施例,可以利用奖励信息来训练图像编辑模型,这有助于提升图像处理的效率和质量。
示例过程
图4示出了根据本公开的一些实施例的用于图像处理的过程400的流程图。过程400可以被实现在电子设备110处。下面参考图1描述过程400。
在框410,电子设备110获取目标输入图像和对目标编辑区域的指示信息,目标编辑区域位于输入图像内部或外部。
在框420,电子设备110基于目标输入图像和指示信息,确定用于图像编辑的目标输入。
在框430,电子设备110基于目标输入,利用图像编辑模型来生成目标输出图像,与目标输入图像相比,目标编辑区域在目标输出图像中被更新,其中图像编辑模型是利用奖励信息而训练的,奖励信息与图像编辑模型从训练输入图像所生成的训练输出图像相关联。
在一些实施例中,图像编辑模型是如下训练的:基于训练输入图像、训练输入图像中的训练编辑区域和关于图像编辑目标的描述信息,利用图像编辑模型来生成训练输出图像;基于训练输出图像,生成用于评估训练输出图像的至少一项奖励作为奖励信息;基于至少一项奖励,确定用于图像编辑模型的目标损失;以及利用目标损失确定图像编辑模型的模型参数。
在一些实施例中,至少一项奖励包括以下一项或多项:匹配度奖励,其指示训练输出图像中的训练编辑区域与描述信息的匹配程度,一致性奖励,其指示训练输入图像与训练输出图像中除训练编辑区域之外的其余区域之间的视觉一致性,或质量奖励,其指示训练输出图像的视觉感知质量。
在一些实施例中,确定目标损失包括:确定训练输入图像与训练输出图像之间的图像差异;以及基于图像差异和至少一项奖励,得到第一目标损失。
在一些实施例中,确定图像差异包括以下至少一项:基于训练输入图像的像素与训练输出图像的像素之间的差异,确定像素级别差异,或基于训练输入图像的特征表示与训练输出图像的特征表示之间的差异,确定特征级别差异。
在一些实施例中,奖励信息的至少一部分是利用奖励模型生成的,并且图像编辑模型与奖励模型通过对抗训练模式被训练。
在一些实施例中,图像编辑模型包括扩散模型,并且扩散模型的训练包括第一阶段和第二阶段,第一阶段的正向扩散过程中的噪声添加粒度细于第二阶段的正向扩散过程中的噪声添加粒度。
在一些实施例中,基于目标输入图像和指示信息确定用于图像编辑的目标输入包括:通过向目标编辑区域添加噪声,从目标输入图像得到第一输入图像,作为目标输入的一部分;通过从目标输入图像移除目标编辑区域,得到第二输入图像,作为目标输入的一部分;以及生成用于指示目标编辑区域的位置的掩码,作为目标输入的一部分。
示例装置和设备
本公开的实施例还提供了用于实现上述方法或过程的相应装置。图5示出了根据本公开的一些实施例的用于图像处理的装置500的示意性结构框图。装置500例如可以被包括在图1中电子设备110中。装置500中的各个模块/组件可以由硬件、软件、固件或者它们的任意组合来实现。
如图所示,装置500包括获取模块510,被配置为获取目标输入图像和对目标编辑区域的指示信息,目标编辑区域位于输入图像内部或外部。装置500还包括输入确定模块520,被配置为基于目标输入图像和指示信息,确定用于图像编辑的目标输入。装置500还包括图像生成模块530,被配置为基于目标输入,利用图像编辑模型来生成目标输出图像,与目标输入图像相比,目标编辑区域在目标输出图像中被更新,其中图像编辑模型是利用奖励信息而训练的,奖励信息与图像编辑模型从训练输入图像所生成的训练输出图像相关联。
在一些实施例中,装置500还包括模型训练模块,模型训练模块被配置为训练图像编辑模型,模型训练模块包括:训练输出图像生成模块,被配置为基于训练输入图像、训练输入图像中的训练编辑区域和关于图像编辑目标的描述信息,利用图像编辑模型来生成训练输出图像;奖励信息生成模块,被配置为基于训练输出图像,生成用于评估训练输出图像的至少一项奖励作为奖励信息;目标损失确定模块,被配置为基于至少一项奖励,确定用于图像编辑模型的目标损失;以及模型参数确定模块,被配置为利用目标损失确定图像编辑模型的模型参数。
在一些实施例中,至少一项奖励包括以下一项或多项:匹配度奖励,其指示训练输出图像中的训练编辑区域与描述信息的匹配程度,一致性奖励,其指示训练输入图像与训练输出图像中除训练编辑区域之外的其余区域之间的视觉一致性,或质量奖励,其指示训练输出图像的视觉感知质量。
在一些实施例中,目标损失确定模块包括:图像差异确定模块,被配置为确定训练输入图像与训练输出图像之间的图像差异;以及第一损失确定模块,被配置为基于图像差异和至少一项奖励,得到第一目标损失。
在一些实施例中,图像差异确定模块被配置为基于训练输入图像的像素与训练输出图像的像素之间的差异,确定像素级别差异,或被配置为基于训练输入图像的特征表示与训练输出图像的特征表示之间的差异,确定特征级别差异。
在一些实施例中,奖励信息的至少一部分是利用奖励模型生成的,并且图像编辑模型与奖励模型通过对抗训练模式被训练。
在一些实施例中,图像编辑模型包括扩散模型,并且扩散模型的训练包括第一阶段和第二阶段,第一阶段的正向扩散过程中的噪声添加粒度细于第二阶段的正向扩散过程中的噪声添加粒度。
在一些实施例中,输入确定模块520包括:噪声添加模块,被配置为通过向目标编辑区域添加噪声,从目标输入图像得到第一输入图像,作为目标输入的一部分;第二图像获取模块,被配置为通过从目标输入图像移除目标编辑区域,得到第二输入图像,作为目标输入的一部分;以及掩码生成模块,被配置为生成用于指示目标编辑区域的位置的掩码,作为目标输入的一部分。
装置500中所包括的单元和/或模块可以利用各种方式来实现,包括软件、硬件、固件或其任意组合。在一些实施例中,一个或多个单元和/或模块可以使用软件和/或固件来实现,例如存储在存储介质上的机器可执行指令。除了机器可执行指令之外或者作为替代,装置500中的部分或者全部单元和/或模块可以至少部分地由一个或多个硬件逻辑组件来实现。作为示例而非限制,可以使用的示范类型的硬件逻辑组件包括现场可编程门阵列(FPGA)、专用集成电路(ASIC)、专用标准品(ASSP)、片上系统(SOC)、复杂可编程逻辑器件(CPLD),等等。
应当理解,以上方法中的一个或多个步骤可以由适当的电子设备或电子设备的组合来执行。这样的电子设备或电子设备的组合例如可以包括图1中的电子设备110。
图6示出了其中可以实施本公开的一个或多个实施例的电子设备600的框图。应当理解,图6所示出的电子设备600仅仅是示例性的,而不应当构成对本文所描述的实施例的功能和范围的任何限制。图6所示出的电子设备600可以用于实现图1的电子设备110,和/或,图5的装置500。
如图6所示,电子设备600是通用电子设备的形式。电子设备600的组件可以包括但不限于一个或多个处理器或处理单元610、存储器620、存储设备630、一个或多个通信单元640、一个或多个输入设备650以及一个或多个输出设备660。处理单元610可以是实际或虚拟处理器并且能够根据存储器620中存储的程序来执行各种处理。在多处理器系统中,多个处理单元并行执行计算机可执行指令,以提高电子设备600的并行处理能力。
电子设备600通常包括多个计算机存储介质。这样的介质可以是电子设备600可访问的任何可以获取的介质,包括但不限于易失性和非易失性介质、可拆卸和不可拆卸介质。存储器620可以是易失性存储器(例如寄存器、高速缓存、随机访问存储器(RAM))、非易失性存储器(例如,只读存储器(ROM)、电可擦除可编程只读存储器(EEPROM)、闪存)或它们的某种组合。存储设备630可以是可拆卸或不可拆卸的介质,并且可以包括机器可读介质,诸如闪存驱动、磁盘或者任何其他介质,其可以能够用于存储信息和/或数据并且可以在电子设备600内被访问。
电子设备600可以进一步包括另外的可拆卸/不可拆卸、易失性/非易失性存储介质。尽管未在图6中示出,可以提供用于从可拆卸、非易失性磁盘(例如“软盘”)进行读取或写入的磁盘驱动和用于从可拆卸、非易失性光盘进行读取或写入的光盘驱动。在这些情况中,每个驱动可以由一个或多个数据介质接口被连接至总线(未示出)。存储器620可以包括计算机程序产品625,其具有一个或多个程序模块,这些程序模块被配置为执行本公开的各种实施例的各种方法或动作。
通信单元640实现通过通信介质与其他电子设备进行通信。附加地,电子设备600的组件的功能可以以单个计算集群或多个计算机器来实现,这些计算机器能够通过通信连接进行通信。因此,电子设备600可以使用与一个或多个其他服务器、网络个人计算机(PC)或者另一个网络节点的逻辑连接来在联网环境中进行操作。
输入设备650可以是一个或多个输入设备,例如鼠标、键盘、追踪球等。输出设备660可以是一个或多个输出设备,例如显示器、扬声器、打印机等。电子设备600还可以根据需要通过通信单元640与一个或多个外部设备(未示出)进行通信,外部设备诸如存储设备、显示设备等,与一个或多个使得用户与电子设备600交互的设备进行通信,或者与使得电子设备600与一个或多个其他电子设备通信的任何设备(例如,网卡、调制解调器等)进行通信。这样的通信可以经由输入/输出(I/O)接口(未示出)来执行。
根据本公开的示例性实现方式,提供了一种计算机可读存储介质,其上存储有计算机可执行指令,其中计算机可执行指令被处理器执行以实现上文描述的方法。根据本公开的示例性实现方式,还提供了一种计算机程序产品,计算机程序产品被有形地存储在非瞬态计算机可读介质上并且包括计算机可执行指令,而计算机可执行指令被处理器执行以实现上文描述的方法。
这里参照根据本公开实现的方法、装置、设备和计算机程序产品的流程图和/或框图描述了本公开的各个方面。应当理解,流程图和/或框图的每个方框以及流程图和/或框图中各方框的组合,都可以由计算机可读程序指令实现。
这些计算机可读程序指令可以提供给通用计算机、专用计算机或其他可编程数据处理装置的处理单元,从而生产出一种机器,使得这些指令在通过计算机或其他可编程数据处理装置的处理单元执行时,产生了实现流程图和/或框图中的一个或多个方框中规定的功能/动作的装置。也可以把这些计算机可读程序指令存储在计算机可读存储介质中,这些指令使得计算机、可编程数据处理装置和/或其他设备以特定方式工作,从而,存储有指令的计算机可读介质则包括一个制造品,其包括实现流程图和/或框图中的一个或多个方框中规定的功能/动作的各个方面的指令。
可以把计算机可读程序指令加载到计算机、其他可编程数据处理装置、或其他设备上,使得在计算机、其他可编程数据处理装置或其他设备上执行一系列操作步骤,以产生计算机实现的过程,从而使得在计算机、其他可编程数据处理装置、或其他设备上执行的指令实现流程图和/或框图中的一个或多个方框中规定的功能/动作。
附图中的流程图和框图显示了根据本公开的多个实现的系统、方法和计算机程序产品的可能实现的体系架构、功能和操作。在这点上,流程图或框图中的每个方框可以代表一个模块、程序段或指令的一部分,模块、程序段或指令的一部分包含一个或多个用于实现规定的逻辑功能的可执行指令。在有些作为替换的实现中,方框中所标注的功能也可以以不同于附图中所标注的顺序发生。例如,两个连续的方框实际上可以基本并行地执行,它们有时也可以按相反的顺序执行,这依所涉及的功能而定。也要注意的是,框图和/或流程图中的每个方框、以及框图和/或流程图中的方框的组合,可以用执行规定的功能或动作的专用的基于硬件的系统来实现,或者可以用专用硬件与计算机指令的组合来实现。
以上已经描述了本公开的各实现,上述说明是示例性的,并非穷尽性的,并且也不限于所公开的各实现。在不偏离所说明的各实现的范围和精神的情况下,对于本技术领域的普通技术人员来说许多修改和变更都是显而易见的。本文中所用术语的选择,旨在最好地解释各实现的原理、实际应用或对市场中的技术的改进,或者使本技术领域的其他普通技术人员能理解本文公开的各个实现方式。

Claims (12)

  1. 一种图像处理方法,包括:
    获取目标输入图像和对目标编辑区域的指示信息,所述目标编辑区域位于所述输入图像内部或外部;
    基于所述目标输入图像和所述指示信息,确定用于图像编辑的目标输入;以及
    基于所述目标输入,利用图像编辑模型来生成目标输出图像,与所述目标输入图像相比,所述目标编辑区域在所述目标输出图像中被更新,其中所述图像编辑模型是利用奖励信息而训练的,所述奖励信息与所述图像编辑模型从训练输入图像所生成的训练输出图像相关联。
  2. 根据权利要求1所述的方法,其中所述图像编辑模型是如下训练的:
    基于所述训练输入图像、所述训练输入图像中的训练编辑区域和关于图像编辑目标的描述信息,利用所述图像编辑模型来生成所述训练输出图像;
    基于所述训练输出图像,生成用于评估所述训练输出图像的至少一项奖励作为所述奖励信息;
    基于所述至少一项奖励,确定用于所述图像编辑模型的目标损失;以及
    利用所述目标损失确定所述图像编辑模型的模型参数。
  3. 根据权利要求2所述的方法,其中所述至少一项奖励包括以下一项或多项:
    匹配度奖励,其指示所述训练输出图像中的训练编辑区域与所述描述信息的匹配程度,
    一致性奖励,其指示所述训练编辑区域的内部与外部之间的视觉一致性,或
    质量奖励,其指示所述训练输出图像的视觉感知质量。
  4. 根据权利要求2所述的方法,其中确定所述目标损失包括:
    确定所述训练输入图像与所述训练输出图像之间的图像差异;以及
    基于所述图像差异和所述至少一项奖励,得到所述第一目标损失。
  5. 根据权利要求4所述的方法,其中确定所述图像差异包括以下至少一项:
    基于所述训练输入图像的像素与所述训练输出图像的像素之间的差异,确定像素级别差异,或
    基于所述训练输入图像的特征表示与所述训练输出图像的特征表示之间的差异,确定特征级别差异。
  6. 根据权利要求1至5中任一项所述的方法,其中所述奖励信息的至少一部分是利用奖励模型生成的,并且所述图像编辑模型与所述奖励模型通过对抗训练模式被训练。
  7. 根据权利要求1至5中任一项所述的方法,其中所述图像编辑模型包括扩散模型,并且所述扩散模型的训练包括第一阶段和第二阶段,所述第一阶段的正向扩散过程中的噪声添加粒度细于所述第二阶段的正向扩散过程中的噪声添加粒度。
  8. 根据权利要求1至5中任一项所述的方法,其中基于所述目标输入图像和所述指示信息确定用于图像编辑的目标输入包括:
    通过向所述目标编辑区域添加噪声,从所述目标输入图像得到第一输入图像,作为所述目标输入的一部分;
    通过从所述目标输入图像移除所述目标编辑区域,得到第二输入图像,作为所述目标输入的一部分;以及
    生成用于指示所述目标编辑区域的位置的掩码,作为所述目标输入的一部分。
  9. 一种用于图像处理的装置,包括:
    获取模块,被配置为获取目标输入图像和对目标编辑区域的指示信息,所述目标编辑区域位于所述输入图像内部或外部;
    输入确定模块,被配置为基于所述目标输入图像和所述指示信息,确定用于图像编辑的目标输入;以及
    图像生成模块,被配置为基于所述目标输入,利用图像编辑模型来生成目标输出图像,与所述目标输入图像相比,所述目标编辑区域在所述目标输出图像中被更新,其中所述图像编辑模型是利用奖励信息而训练的,所述奖励信息与所述图像编辑模型从训练输入图像所生成的训练输出图像相关联。
  10. 一种电子设备,包括:
    至少一个处理单元;以及
    至少一个存储器,所述至少一个存储器被耦合到所述至少一个处理单元并且存储用于由所述至少一个处理单元执行的指令,所述指令在由所述至少一个处理单元执行时使所述电子设备执行根据权利要求1至8中任一项所述的方法。
  11. 一种计算机可读存储介质,其上存储有计算机程序,所述计算机程序可由处理器执行以实现根据权利要求1至8中任一项所述的方法。
  12. 一种计算机程序产品,包括计算机程序,其中所述计算机程序被处理器执行时实现根据权利要求1至8中任一项所述的方法。
PCT/CN2025/078627 2024-03-25 2025-02-21 用于图像处理的方法、装置、设备和存储介质 Pending WO2025200895A1 (zh)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
CN202410345788.3 2024-03-25
CN202410345788.3A CN120707371A (zh) 2024-03-25 2024-03-25 用于图像处理的方法、装置、设备和存储介质

Publications (1)

Publication Number Publication Date
WO2025200895A1 true WO2025200895A1 (zh) 2025-10-02

Family

ID=97116734

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/CN2025/078627 Pending WO2025200895A1 (zh) 2024-03-25 2025-02-21 用于图像处理的方法、装置、设备和存储介质

Country Status (2)

Country Link
CN (1) CN120707371A (zh)
WO (1) WO2025200895A1 (zh)

Citations (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2014064055A (ja) * 2012-09-19 2014-04-10 Tatsumi Denshi Kogyo Kk 画像編集装置、トリミング方法及びコンピュータプログラム
CN117078798A (zh) * 2023-07-03 2023-11-17 中国人民大学 一种基于强化学习的改进文本到图像生成的自动编辑提示方法
CN117274125A (zh) * 2023-09-15 2023-12-22 腾讯科技(深圳)有限公司 图像编辑方法、装置、设备及存储介质
CN117456055A (zh) * 2023-11-16 2024-01-26 山东大学 基于扩散模型的文本引导多区域场景图像编辑方法及系统
CN117611709A (zh) * 2023-11-27 2024-02-27 Oppo广东移动通信有限公司 图像编辑方法、装置、设备、存储介质及程序产品

Patent Citations (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2014064055A (ja) * 2012-09-19 2014-04-10 Tatsumi Denshi Kogyo Kk 画像編集装置、トリミング方法及びコンピュータプログラム
CN117078798A (zh) * 2023-07-03 2023-11-17 中国人民大学 一种基于强化学习的改进文本到图像生成的自动编辑提示方法
CN117274125A (zh) * 2023-09-15 2023-12-22 腾讯科技(深圳)有限公司 图像编辑方法、装置、设备及存储介质
CN117456055A (zh) * 2023-11-16 2024-01-26 山东大学 基于扩散模型的文本引导多区域场景图像编辑方法及系统
CN117611709A (zh) * 2023-11-27 2024-02-27 Oppo广东移动通信有限公司 图像编辑方法、装置、设备、存储介质及程序产品

Also Published As

Publication number Publication date
CN120707371A (zh) 2025-09-26

Similar Documents

Publication Publication Date Title
CN111832745A (zh) 数据增广的方法、装置及电子设备
CN117197292B (zh) 用于生成图像的方法、装置、设备和存储介质
CN118354164B (zh) 视频生成方法、电子设备及计算机可读存储介质
JP2022537860A (ja) 音声パケット推薦方法、装置、電子機器およびプログラム
CN119540431A (zh) 三维场景的图像风格化编辑方法、装置、设备及介质
CN116801067A (zh) 内容生成方法、装置、设备和存储介质
CN114037772B (zh) 一种图像生成器的训练方法、图像生成方法及装置
WO2025201082A1 (zh) 视频生成的方法、装置、设备和存储介质
WO2025261521A1 (zh) 生成媒体内容的方法、装置、设备和存储介质
WO2025200895A1 (zh) 用于图像处理的方法、装置、设备和存储介质
WO2025050994A1 (zh) 用于图像生成的方法、装置、设备和存储介质
WO2025026189A1 (zh) 用于提示词管理的方法、装置、设备和存储介质
CN114140619B (zh) 图像数据生成方法、模型训练方法、装置、设备及介质
WO2023240583A1 (zh) 一种跨媒体对应知识的生成方法和装置
US12548600B2 (en) Method, apparatus, device and medium for processing media item
CN120632598B (zh) 可解释的跨媒体智能体决策路径追踪方法
WO2025162201A1 (zh) 用于信息播放的方法、装置、设备和存储介质
CN119631091A (zh) 用于对话交互的方法、装置、设备和存储介质
WO2025199827A1 (zh) 用于文本作品呈现的方法、装置、设备和存储介质
WO2025199829A1 (zh) 用于插图生成的方法、装置、设备和存储介质
CN119274011A (zh) 一种图像处理方法、装置、计算机设备及存储介质
WO2026055939A1 (zh) 视频处理的方法、装置、设备、存储介质和程序产品
WO2025031408A1 (zh) 图像处理方法、装置、计算机设备及存储介质
CN121838711A (zh) 用于语音处理的方法、装置、设备、存储介质和程序产品
CN119862933A (zh) 数据处理方法、装置、设备和存储介质

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 25776630

Country of ref document: EP

Kind code of ref document: A1