CN119226992B - 多模态数据处理方法、装置、存储介质及电子设备 - Google Patents

多模态数据处理方法、装置、存储介质及电子设备

Info

Publication number
CN119226992B
CN119226992B CN202411058820.6A CN202411058820A CN119226992B CN 119226992 B CN119226992 B CN 119226992B CN 202411058820 A CN202411058820 A CN 202411058820A CN 119226992 B CN119226992 B CN 119226992B
Authority
CN
China
Prior art keywords
image
coding
vector
data
modal
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
CN202411058820.6A
Other languages
English (en)
Other versions
CN119226992A (zh
Inventor
卢宗青
张万鹏
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Peking University
Original Assignee
Peking University
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Peking University filed Critical Peking University
Priority to CN202411058820.6A priority Critical patent/CN119226992B/zh
Publication of CN119226992A publication Critical patent/CN119226992A/zh
Application granted granted Critical
Publication of CN119226992B publication Critical patent/CN119226992B/zh
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/25Fusion techniques
    • G06F18/253Fusion techniques of extracted features
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/27Regression, e.g. linear or logistic regression
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/30Semantic analysis
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/045Combinations of networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/045Combinations of networks
    • G06N3/0455Auto-encoder networks; Encoder-decoder networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/0464Convolutional networks [CNN, ConvNet]
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/0475Generative networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/084Backpropagation, e.g. using gradient descent
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/094Adversarial learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/40Extraction of image or video features
    • G06V10/44Local feature extraction by analysis of parts of the pattern, e.g. by detecting edges, contours, loops, corners, strokes or intersections; Connectivity analysis, e.g. of connected components
    • G06V10/443Local feature extraction by analysis of parts of the pattern, e.g. by detecting edges, contours, loops, corners, strokes or intersections; Connectivity analysis, e.g. of connected components by matching or filtering
    • G06V10/449Biologically inspired filters, e.g. difference of Gaussians [DoG] or Gabor filters
    • G06V10/451Biologically inspired filters, e.g. difference of Gaussians [DoG] or Gabor filters with interaction between the filter responses, e.g. cortical complex cells
    • G06V10/454Integrating the filters into a hierarchical structure, e.g. convolutional neural networks [CNN]
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/77Processing image or video features in feature spaces; using data integration or data reduction, e.g. principal component analysis [PCA] or independent component analysis [ICA] or self-organising maps [SOM]; Blind source separation
    • G06V10/7715Feature extraction, e.g. by transforming the feature space, e.g. multi-dimensional scaling [MDS]; Mappings, e.g. subspace methods
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/82Arrangements for image or video recognition or understanding using pattern recognition or machine learning using neural networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V20/00Scenes; Scene-specific elements
    • G06V20/70Labelling scene content, e.g. deriving syntactic or semantic representations
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/048Activation functions

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Artificial Intelligence (AREA)
  • Evolutionary Computation (AREA)
  • Health & Medical Sciences (AREA)
  • Data Mining & Analysis (AREA)
  • General Health & Medical Sciences (AREA)
  • General Engineering & Computer Science (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Computational Linguistics (AREA)
  • Computing Systems (AREA)
  • Software Systems (AREA)
  • Molecular Biology (AREA)
  • Biomedical Technology (AREA)
  • Biophysics (AREA)
  • Mathematical Physics (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Multimedia (AREA)
  • Databases & Information Systems (AREA)
  • Medical Informatics (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Evolutionary Biology (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Biodiversity & Conservation Biology (AREA)
  • Image Processing (AREA)

Abstract

本发明公开了一种多模态数据处理方法、装置、存储介质及电子设备。其中,所述方法包括:获取待识别的多模态数据,所述多模态数据包括图像数据和文本数据;获取所述图像数据对应的图像嵌入向量,基于预训练融合词表将所述图像嵌入向量转换为预融合编码向量;所述预训练融合词表为根据图像训练样本得到的用于减少图像特征的编码量的编码本;将所述预融合编码向量和文本数据对应的文本嵌入向量进行组合,得到目标多模态向量。本发明解决了相关技术中多模态大语言模型占用计算资源较多,难以有效地理解和融合多模态信息,整体性能不佳的技术问题。

Description

多模态数据处理方法、装置、存储介质及电子设备
技术领域
本发明涉及人工智能技术领域,具体而言,涉及一种多模态数据处理方法、装置、存储介质及电子设备。
背景技术
相关技术中的多模态大语言模型在处理图像和文本等多模态信息时,通常将图像处理为大量的独立编码,这种方式不仅占用了大量的计算资源,还难以捕捉图像中的结构化信息和语义关联,使得多模态大语言模型难以有效地理解和融合多模态信息。此外,大语言模型通常有固定的输入长度限制,在处理图像等高维信息时会导致信息的丢失,同时也会限制同时处理的多模态信息的数量,因此会导致多模态大语言模型的整体性能不佳。
发明内容
本申请实施例提供了一种多模态数据处理方法、装置、存储介质及电子设备,以至少解决相关技术中多模态大语言模型占用计算资源较多,难以有效地理解和融合多模态信息,整体性能不佳的技术问题。
根据本申请实施例的一个方面,提供了一种多模态数据处理方法,包括:获取待识别的多模态数据,所述多模态数据包括图像数据和文本数据;获取所述图像数据对应的图像嵌入向量,基于预训练融合词表将所述图像嵌入向量转换为预融合编码向量;所述预训练融合词表为根据图像训练样本得到的用于减少图像特征的编码量的编码本;将所述预融合编码向量和文本数据对应的文本嵌入向量进行组合,得到目标多模态向量。
根据本申请实施例的另一方面,还提供了一种多模态数据处理装置,包括:第一获取单元,用于获取待识别的多模态数据,所述多模态数据包括图像数据和文本数据;第二获取单元,用于获取所述图像数据对应的图像嵌入向量,基于预训练融合词表将所述图像嵌入向量转换为预融合编码向量;所述预训练融合词表为根据图像训练样本得到的用于减少图像特征的编码量的编码本;组合单元,用于将所述预融合编码向量和文本数据对应的文本嵌入向量进行组合,得到目标多模态向量。
根据本申请实施例的又一方面,还提供了一种电子设备,包括存储器和处理器,上述存储器中存储有计算机程序,上述处理器被设置为通过上述计算机程序执行上述的多模态数据处理方法。
根据本申请实施例的又一方面,还提供了一种计算机可读的存储介质,该计算机可读的存储介质中存储有计算机程序,其中,该计算机程序被设置为运行时执行上述多模态数据处理方法。
在本申请实施例中,采用了获取待识别的多模态数据,所述多模态数据包括图像数据和文本数据;获取所述图像数据对应的图像嵌入向量,基于预训练融合词表将所述图像嵌入向量转换为预融合编码向量;所述预训练融合词表为根据图像训练样本得到的用于减少图像特征的编码量的编码本;将所述预融合编码向量和文本数据对应的文本嵌入向量进行组合,得到目标多模态向量的方法;在上述方法中,基于预设预训练融合词表可以使模型更容易学习视觉特征和训练语料之间的联系,还能大幅减少表示每个图像所需的编码数量,使得模型能够在有限的上下文长度内处理更多的图像信息或更大的图像。不仅能大大节省大语言模型占用的计算资源,还能提升多模态大语言模型理解和融合多模态信息的性能;解决了相关技术中多模态大语言模型占用计算资源较多,难以有效地理解和融合多模态信息,整体性能不佳的技术问题。
附图说明
此处所说明的附图用来提供对本发明的进一步理解,构成本申请的一部分,本发明的示意性实施例及其说明用于解释本发明,并不构成对本发明的不当限定。在附图中:
图1是根据本申请实施例的一种可选的多模态数据处理方法的应用环境的示意图;
图2是根据本申请实施例的另一种可选的多模态数据处理方法的应用环境的示意图;
图3是根据本申请实施例的一种可选的多模态数据处理方法的流程示意图;
图4是根据本申请实施例的一种可选的预融合词表的多模态大语言模型框架示意图;
图5是根据本申请实施例的一种可选的VQGAN模型架构示意图;
图6是根据本申请实施例的一种可选的邻接矩阵词表的扩充训练流程图;
图7是根据本申请实施例的一种可选的基于注意力机制的Transformer网络结构示意图;
图8是根据本申请实施例的一种可选的多模态数据处理装置的结构示意图;
图9是根据本申请实施例的一种可选的电子设备的结构示意图。
具体实施方式
为了使本技术领域的人员更好地理解本发明方案,下面将结合本申请实施例中的附图,对本申请实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例仅仅是本发明一部分的实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他实施例,都应当属于本发明保护的范围。
需要说明的是,本发明的说明书和权利要求书及上述附图中的术语“第一”、“第二”等是用于区别类似的对象,而不必用于描述特定的顺序或先后次序。应该理解这样使用的数据在适当情况下可以互换,以便这里描述的本发明的实施例能够以除了在这里图示或描述的那些以外的顺序实施。此外,术语“包括”和“具有”以及他们的任何变形,意图在于覆盖不排他的包含,例如,包含了一系列步骤或单元的过程、方法、系统、产品或设备不必限于清楚地列出的那些步骤或单元,而是可包括没有清楚地列出的或对于这些过程、方法、产品或设备固有的其它步骤或单元。
根据本申请实施例的一个方面,提供了一种多模态数据处理方法,可选地,作为一种可选地实施方式,上述多模态数据处理方法可以但不限于应用于如图1所示的应用环境中。该应用环境中包括:与用户进行人机交互的终端设备102、网络104、服务器106。用户108与终端设备102之间可以进行人机交互,终端设备102中运行有多模态数据处理应用客户端。上述终端设备102中包括人机交互屏幕1022,处理器1024及存储器1026。人机交互屏幕1022用于显示图像数据和文本数据;处理器1024用于获取待识别的多模态数据。存储器1026用于存储待识别的多模态数据和所述多模态数据对应的目标多模态向量。
此外,服务器106中包括数据库1062及处理引擎1064,数据库1062中用于存储待识别的多模态数据和所述多模态数据对应的目标多模态向量。处理引擎1064用于获取待识别的多模态数据,所述多模态数据包括图像数据和文本数据;获取所述图像数据对应的图像嵌入向量,基于预训练融合词表将所述图像嵌入向量转换为预融合编码向量;所述预训练融合词表为根据图像训练样本得到的用于减少图像特征的编码量的编码本;将所述预融合编码向量和文本数据对应的文本嵌入向量进行组合,得到目标多模态向量。
在一个或多个实施例中,本申请上述多模态数据处理方法可以应用于图2所示的应用环境中。如图2所示,用户202与用户设备204之间可以进行人机交互。用户设备204中包含有存储器206和处理器208。本实施例中用户设备204可以但不限于参考执行上述终端设备102所执行的操作,获取多模态数据对应的目标多模态向量。
可选地,上述终端设备102和用户设备204包括但不限于为手机、平板电脑、笔记本电脑、PC机,车载电子设备,可穿戴设备等终端,上述网络104可以包括但不限于无线网络或有线网络。其中,该无线网络包括:WIFI及其他实现无线通信的网络。上述有线网络可以包括但不限于:广域网、城域网、局域网。上述服务器106可以包括但不限于任何可以进行计算的硬件设备。上述服务器可以是单一服务器,也可以是由多个服务器组成的服务器集群,或者是云服务器。上述仅是一种示例,本实施例中对此不作任何限定。
作为一种可选地实施方式,如图3所示,本申请实施例提供了一种多模态数据处理方法,包括如下步骤:
S302,获取待识别的多模态数据,所述多模态数据包括图像数据和文本数据。
S304,获取所述图像数据对应的图像嵌入向量,基于预训练融合词表将所述图像嵌入向量转换为预融合编码向量;所述预训练融合词表为根据图像训练样本得到的用于减少图像特征的编码量的编码本。
S306,将所述预融合编码向量和文本数据对应的文本嵌入向量进行组合,得到目标多模态向量。
具体地,在本申请实施例中,对于待识别的多模态数据中的文本数据,可以使用常见的预训练的文本编码器(例如BPE编码器)将其转换为文本向量t;对于待识别的多模态数据中的图像数据,首先使用VQGAN模型对其进行预处理得到初始编码向量z,然后使用预训练融合词表,通过查表替换的方式,将词表中存在的组合模式替换为对应的新的图像编码(token ID),从而将初始编码向量z转化得到预融合编码向量zm
将文本向量t与处理图像后得到的预融合编码向量zm拼接得到多模态数据向量(目标多模态向量)y=[t;zm]。
在本申请实施例中,采用了获取待识别的多模态数据,所述多模态数据包括图像数据和文本数据;获取所述图像数据对应的图像嵌入向量,基于预训练融合词表将所述图像嵌入向量转换为预融合编码向量;所述预训练融合词表为根据图像训练样本得到的用于减少图像特征的编码量的编码本;将所述预融合编码向量和文本数据对应的文本嵌入向量进行组合,得到目标多模态向量的方法;在上述方法中,基于预设预训练融合词表可以使模型更容易学习视觉特征和训练语料之间的联系,还能大幅减少表示每个图像所需的编码数量,使得模型能够在有限的上下文长度内处理更多的图像信息或更大的图像。不仅能大大节省大语言模型占用的计算资源,还能提升多模态大语言模型理解和融合多模态信息的性能;解决了相关技术中多模态大语言模型占用计算资源较多,难以有效地理解和融合多模态信息,整体性能不佳的技术问题。
在一个或多个实施例中,所述多模态数据处理方法还包括:
获取预设的图像处理模型对应的初始编码本,以及图像训练样本;
基于所述图像处理模型获取所述图像训练样本对应的图像嵌入向量;
基于所述图像训练样本对应的图像嵌入向量,更新所述初始编码本,得到所述预训练融合词表。
具体地,在本申请实施例中,上述图像处理模型可以为VQGAN模型;以VQGAN模型为例,结合图4和图5所示,首先使用VQGAN模型对输入图像进行量化预处理。首先将输入图像调整为h×h大小的像素,然后使用预训练的VQGAN模型对图像进行编码,通过VQGAN模型中长度为N的初始编码本(Codebook),得到一个量化的二维离散码本索引数组(图像嵌入向量),大小为N×N;其中,h和N为正整数;
在一示例中,可以将该数组展平为一个长度为N×N的一维向量。然后根据所述图像训练样本对应的长度为N×N的一维向量,更新所述初始编码本,得到所述预训练融合词表。例如将该初始编码本的长度调整为N+K,K为正整数。这里,初始编码本中的每个字符代表一种编码模式。
在一个或多个实施例中,所述预设的图像处理模型包括VQGAN模型,所述基于所述图像训练样本对应的图像嵌入向量,更新所述初始编码本,得到所述预训练融合词表,包括如下步骤:
获取基于所述VQGAN模型得到的所述图像训练样本对应的图像嵌入向量;
针对所述图像训练样本中的每个图像对应的图像嵌入向量,依次执行如下码本更新操作,直至所述初始编码本达到预设编码数量:
确定当前图像对应的图像嵌入向量的图像编码连接状态,所述图像编码连接状态包括水平方向的图像编码连接状态和垂直方向的图像编码连接状态;
根据所述图像编码连接状态,确定所述当前图像是否存在出现次数大于预设次数的第一编码对;所述第一编码对指示在水平方向或垂直方向相邻的两个图像编码;
若所述当前图像存在出现次数大于预设次数的第一编码对,则将所述第一编码对替换为第一更新编码值,得到第一图像嵌入向量,将所述第一更新编码值加入所述初始编码本;
判断更新后的图像嵌入向量中是否存在出现次数大于预设次数的第二编码对;所述第二编码对指示在水平方向或垂直方向相邻的两个图像编码;若存在,则将所述第二编码对替换为第二更新编码值,得到第二图像嵌入向量,将所述第二更新编码值加入所述初始编码本。
具体地,在本申请实施例中,先获取基于所述VQGAN模型得到的所述图像训练样本对应的图像嵌入向量;
基于所述图像嵌入向量创建第一邻接矩阵H和第二邻接矩阵V,所述第一邻接矩阵H用于记录所述图像训练样本对应的水平方向的图像编码连接状态,所述第二邻接矩阵V用于记录所述图像训练样本对应的垂直方向的图像编码连接状态;
确定所有H[i][j]大于预设次数或者V[i][j]大于所述预设次数的编码对(i,j);所述H[i][j]表示编码i在水平方向上紧邻编码j的次数;V[i][j]表示编码i在垂直方向上紧邻编码j的次数;
对于每个找到的编码对(i,j)组合,计算初始编码本的大小为N,则将编码对(i,j)作为一个整体,这里例如可以用新的编码q来代替(i,j)编码对,更新原始的图像嵌入向量,得到第一图像嵌入向量,然后将编码q加入到初始编码本中,此时初始编码本的大小变为N+1;
然后继续在垂直编码方向和竖直编码方向进行扩展搜索,确定所有H[q][m]大于预设次数或者V[q][m]大于所述预设次数的编码对(q,m);所述H[q][m]表示编码q在水平方向上紧邻编码m的次数;V[q][m]表示编码q在垂直方向上紧邻编码k的次数;若存在则组成第二编码对(q,m),m为与编码q相邻的编码;这里例如可以用新的编码n来代替(q,m)编码对,更新原始的图像嵌入向量,得到第二图像嵌入向量,然后将编码n加入到初始编码本中,此时初始编码本的大小变为N+2;若不存在H[q][m]大于预设次数或者V[q][m]大于所述预设次数的编码对(q,m),则将图像训练样本的下一图像作为当前图像继续执行所述码本更新操作。
然后,针对多个图像训练样本循环执行上述步骤,在所述初始编码本达到预设编码数量时,确定得到所述预训练融合词表。
具体地,如图6所示,在本申请实施例中,上述的第一邻接矩阵H和第二邻接矩阵V的大小可以为N×N,N为初始编码本的大小,本申请可以使用大量的图像数据集进一步地循环训练扩充上述初始编码本。例如将上述步骤设置为循环次数K,最终训练得到大小为N+K的扩充词表,该扩充词表即为上述的预训练融合词表,基于该预融合词表,可以对任何得到的长度为N×N的图片张量,将其中出现在词表中的K个扩充组合模式替换为对应的新的图像编码,从而实现对一维图片张量的空间先验信息预融合。
在一个或多个实施例中,所述多模态数据处理方法还包括:
若所述当前图像不存在出现次数大于预设次数的第一编码对,则将图像训练样本的下一图像作为当前图像继续执行所述码本更新操作;
当所述初始编码本的编码数量达到预设编码数量时,确定得到所述预训练融合词表。
例如,确定当前图像对应的所有H[i][j]均小于预设次数,或者V[i][j]小于所述预设次数的编码对(i,j),则将图像训练样本的下一图像作为当前图像继续执行所述码本更新操作,在多次执行上述码本更新操作后,当所述初始编码本的编码数量达到预设编码数量时,确定得到所述预训练融合词表。
在一个或多个实施例中,所述多模态数据处理方法还包括:
通过所述VQGAN模型的编码器将图像训练样本映射到一个潜在空间,生成所述图像训练样本对应的潜在向量;
通过所述VQGAN模型的量化器将所述潜在向量离散化为一组离散向量,通过最近邻搜索确定所述离散向量最接近的代码向量;
基于所述VQGAN模型的解码器将代码向量映射回图像空间,生成重构图像;
基于所述VQGAN模型中的生成对抗网络调整所述重构图像,得到所述图像训练样本对应的图像嵌入向量。
如图5所示,VQGAN(Vector Quantized Generative Adversarial Network)模型是一种将向量量化技术与生成对抗网络(GAN)结合起来的模型,主要用于高质量图像的生成和压缩。VQGAN模型将图像分解为一组离散的向量(或代码),然后通过GAN进行生成和重构,从而保留图像的细节和纹理。VQGAN模型由以下几个主要部分组成:
1.编码器(Encoder):将输入图像映射到一个潜在空间,生成潜在向量。
2.量化器(Quantizer):将连续的潜在向量离散化为一组有限的代码(或向量)。
3.解码器(Decoder):将离散化后的代码映射回图像空间,生成重构图像。
4.生成对抗网络(GAN):由生成器和判别器组成,用于提升图像生成的质量。
在VQGAN的编码器中,通过深度神经网络将输入图像x映射到一个潜在空间,生成潜在向量ze(x),映射公式包括公式(1):ze(x)=Encoder(x)(1)
之后,VQGAN使用向量量化(Vector Quantization,VQ)技术将连续的潜在向量ze(x)映射到一组离散的向量,通过最近邻搜索找到最近的代码向量zq(x)。具体地,配置ei为码本(Codebook)中的第i个向量,则量化公式包括公式(2):
zq(x)=ei,where i=arg minj||ze(x)-ej|| (2);
其中,zq(x)为离散化后的代码向量。
解码器通过卷积神经网络将离散化后的代码向量zq(x)映射回图像空间,生成重构图像其中,重构图像的映射公式包括公式(3):
在一个或多个实施例中,所述多模态数据处理方法还包括:
基于预设的重构损失函数、量化损失函数和对抗损失函数联合训练所述VQGAN模型,在所述VQGAN模型达到收敛条件时,确定得到预设的图像处理模型。
为了确保对图像量化离散处理后的编码能够充分包含原有图像信息,基于预设的重构损失函数、量化损失函数和对抗损失函数联合训练所述VQGAN模型;
关于重构损失,需要衡量重构图像与原始图像之间的差异,具体地,相应的重构损失函数包括公式(4):
关于量化损失,需要最小化潜在向量和其量化向量之间的差异,具体地,相应的损失函数如公式(5)所示:
其中,β是可调整的权重参数,sg表示深度学习中常用的停止梯度(Stop-Gradient)操作,用于保留其计算的梯度,确保能够顺利完成梯度回传。
关于对抗损失,需要提升图像的重建质量,配置的生成器的损失函数和判别器的损失函数如公式(6)和公式(7)所示:
其中,D(x)表示判别器对输入图像的判别结果。
在一个或多个实施例中,所述多模态数据处理方法还包括:
将所述目标多模态向量作为样本数据,训练Transformer模型;
在所述Transformer模型识别所述样本数据中的数据序列的准确率达到预设阈值时,确定得到预训练的多模态数据识别模型。
如图7所示,Transformer模型的核心为注意力机制,它允许模型在处理当前元素时,动态地关注输入序列的不同部分,其计算过程为,给定查询(Query)矩阵键(Key)矩阵和值(Value)矩阵其中n是查询的数量,m是键-值对的数量,dk和dv分别是键和值的维度。注意力权重通过公式(8)计算:
其中,是一个缩放因子,用于缓解内积值随维度增加而变大的问题。
为了进一步增强模型的表达能力,Transformer引入了多头注意力机制,包括公式(9):
MultiHead(Q,K,V)=Concat(head1,...,headh)WO (9)
每个注意力头的计算公式包括公式(10):
其中,WO均为可训练的参数矩阵。
在通过多头注意力机制计算输入序列之间的依赖关系后,对每个位置上应用前馈神经网络(Feed-Forward Neural Network Layer,FFN)处理。所使用的前馈神经网络由两个线性变换和一个ReLU激活函数组成的公式(11):
FFN(x)=max(0,xW1+b1)W2+b2 (11)
其中,是可训练的权重矩阵,b1和b2是偏置项。
每个子层之后都会进行层归一化(Layer Normalization)和残差连接(ResidualConnection),包括公式(12):
LayerNorm(x+Sublayer(x)) (12)
此外,由于Transformer不包含卷积或循环结构,无法捕捉序列中的位置信息,为此引入了位置编码,位置编码公式包括公式(13):
其中,pos表示位置,i表示维度索引。位置编码会加到输入嵌入(Embeddings)中,使模型能够利用位置信息。
Transformer模型的训练过程包括前向传播和后向传播两个步骤。使用自回归模型架构,通过多层迭代上述描述的结构来计算注意力并最终生成目标序列,并通过反向传播优化模型参数。
在所述Transformer模型识别所述样本数据中的数据序列的准确率达到预设阈值时,确定得到预训练的多模态数据识别模型。
在一个或多个实施例中,所述多模态数据处理方法还包括:
获取用户输入的图像和文本对应的目标多模态向量;
基于预训练的多模态数据识别模型识别所述目标多模态向量对应的图像特征和文本特征;
基于所述图像特征和文本特征,生成所述图像和文本对应的语义信息。
具体地,如图4所示,用户输入的图像包括图像中的草地和动物,文本可以为用户针对图像的提问,例如图中都有啥动物等文本信息,首先获取所述图像数据对应的图像嵌入向量(例如初始编码为3*3的编码矩阵),基于预训练融合词表(预训练VQGAN码本)将所述图像嵌入向量转换为预融合编码向量[111,3,22,333];将所述预融合编码向量和文本数据对应的文本嵌入向量进行组合,得到目标多模态向量。基于预训练的Transformer模型和预训练融合词表,识别出上述预融合编码向量代表的3*3大小的原始编码矩阵。基于所述图像特征和文本特征,生成所述图像和文本对应的语义信息,例如包括:该图像和该图像的语言特征(图中描绘了一条狗在草地上等)。
需要说明的是,对于前述的各方法实施例,为了简单描述,故将其都表述为一系列的动作组合,但是本领域技术人员应该知悉,本发明并不受所描述的动作顺序的限制,因为依据本发明,某些步骤可以采用其他顺序或者同时进行。其次,本领域技术人员也应该知悉,说明书中所描述的实施例均属于优选实施例,所涉及的动作和模块并不一定是本发明所必须的。
根据本申请实施例的另一个方面,还提供了一种用于实施上述多模态数据处理方法的多模态数据处理装置。如图8所示,该装置包括:
第一获取单元802,用于获取待识别的多模态数据,所述多模态数据包括图像数据和文本数据;
第二获取单元804,用于获取所述图像数据对应的图像嵌入向量,基于预训练融合词表将所述图像嵌入向量转换为预融合编码向量;所述预训练融合词表为根据图像训练样本得到的用于减少图像特征的编码量的编码本;
组合单元806,用于将所述预融合编码向量和文本数据对应的文本嵌入向量进行组合,得到目标多模态向量。
在本申请实施例中,采用了获取待识别的多模态数据,所述多模态数据包括图像数据和文本数据;获取所述图像数据对应的图像嵌入向量,基于预训练融合词表将所述图像嵌入向量转换为预融合编码向量;所述预训练融合词表为根据图像训练样本得到的用于减少图像特征的编码量的编码本;将所述预融合编码向量和文本数据对应的文本嵌入向量进行组合,得到目标多模态向量的方法;在上述方法中,基于预设预训练融合词表可以使模型更容易学习视觉特征和训练语料之间的联系,还能大幅减少表示每个图像所需的编码数量,使得模型能够在有限的上下文长度内处理更多的图像信息或更大的图像。不仅能大大节省大语言模型占用的计算资源,还能提升多模态大语言模型理解和融合多模态信息的性能;解决了相关技术中多模态大语言模型占用计算资源较多,难以有效地理解和融合多模态信息,整体性能不佳的技术问题。
在一个或多个实施例中,所述多模态数据处理装置还包括:
第三获取单元,用于获取预设的图像处理模型对应的初始编码本,以及图像训练样本;
第四获取单元,用于基于所述图像处理模型获取所述图像训练样本对应的图像嵌入向量;
更新单元,用于基于所述图像训练样本对应的图像嵌入向量,更新所述初始编码本,得到所述预训练融合词表。
在一个或多个实施例中,所述更新单元,包括:
第一获取模块,用于获取基于所述VQGAN模型得到的所述图像训练样本对应的图像嵌入向量;
第一确定模块,用于针对所述图像训练样本中的每个图像对应的图像嵌入向量,依次执行如下码本更新操作,直至所述初始编码本达到预设编码数量:
确定当前图像对应的图像嵌入向量的图像编码连接状态,所述图像编码连接状态包括水平方向的图像编码连接状态和垂直方向的图像编码连接状态;
第二确定模块,用于根据所述图像编码连接状态,确定所述当前图像是否存在出现次数大于预设次数的第一编码对;所述第一编码对指示在水平方向或垂直方向相邻的两个图像编码;
替换模块,用于若所述当前图像存在出现次数大于预设次数的第一编码对,则将所述第一编码对替换为第一更新编码值,得到第一图像嵌入向量,将所述第一更新编码值加入所述初始编码本;
判断更新模块,用于判断更新后的图像嵌入向量中是否存在出现次数大于预设次数的第二编码对;所述第二编码对指示在水平方向或垂直方向相邻的两个图像编码;若存在,则将所述第二编码对替换为第二更新编码值,得到第二图像嵌入向量,将所述第二更新编码值加入所述初始编码本。
在一个或多个实施例中,所述多模态数据处理装置还包括:
判断单元,用于若所述当前图像不存在出现次数大于预设次数的第一编码对,则将图像训练样本的下一图像作为当前图像继续执行所述码本更新操作;
第一确定单元,用于当所述初始编码本的编码数量达到预设编码数量时,确定得到所述预训练融合词表。
在一个或多个实施例中,所述多模态数据处理装置还包括:
第一生成单元,用于通过所述VQGAN模型的编码器将图像训练样本映射到一个潜在空间,生成所述图像训练样本对应的潜在向量;
离散单元,用于通过所述VQGAN模型的量化器将所述潜在向量离散化为一组离散向量,通过最近邻搜索确定所述离散向量最接近的代码向量;
映射单元,用于基于所述VQGAN模型的解码器将代码向量映射回图像空间,生成重构图像;
调整单元,用于基于所述VQGAN模型中的生成对抗网络调整所述重构图像,得到所述图像训练样本对应的图像嵌入向量。
在一个或多个实施例中,所述多模态数据处理装置还包括:
第一训练单元,用于基于预设的重构损失函数、量化损失函数和对抗损失函数联合训练所述VQGAN模型,在所述VQGAN模型达到收敛条件时,确定得到预设的图像处理模型。
在一个或多个实施例中,所述多模态数据处理装置还包括:
第二训练单元,用于将所述目标多模态向量作为样本数据,训练Transformer模型;
第二确定单元,用于在所述Transformer模型识别所述样本数据中的数据序列的准确率达到预设阈值时,确定得到预训练的多模态数据识别模型。
在一个或多个实施例中,所述多模态数据处理装置还包括:
第五获取单元,用于获取用户输入的图像和文本对应的目标多模态向量;
识别单元,用于基于预训练的多模态数据识别模型识别所述目标多模态向量对应的图像特征和文本特征;
生成单元,用于基于所述图像特征和文本特征,生成所述图像和文本对应的语义信息。
根据本申请实施例的又一个方面,还提供了一种用于实施上述多模态数据处理方法的电子设备,该电子设备可以是图9所示的终端设备或服务器。本实施例以该电子设备为服务器为例来说明。如图9所示,该电子设备包括存储器902和处理器904,该存储器902中存储有计算机程序,该处理器904被设置为通过计算机程序执行上述任一项方法实施例中的步骤。
可选地,在本实施例中,上述电子设备可以位于计算机网络的多个网络设备中的至少一个网络设备。
可选地,在本实施例中,上述处理器可以被设置为通过计算机程序执行以下步骤:
S1,获取待识别的多模态数据,所述多模态数据包括图像数据和文本数据;
S2,获取所述图像数据对应的图像嵌入向量,基于预训练融合词表将所述图像嵌入向量转换为预融合编码向量;所述预训练融合词表为根据图像训练样本得到的用于减少图像特征的编码量的编码本;
S3,将所述预融合编码向量和文本数据对应的文本嵌入向量进行组合,得到目标多模态向量。
可选地,本领域普通技术人员可以理解,图9所示的结构仅为示意,电子装置电子设备也可以是智能手机(如Android手机、iOS手机等)、平板电脑、掌上电脑以及移动互联网设备(Mobile Internet Devices,MID)、PAD等终端设备。图9其并不对上述电子装置电子设备的结构造成限定。例如,电子装置电子设备还可包括比图9中所示更多或者更少的组件(如网络接口等),或者具有与图9所示不同的配置。
其中,存储器902可用于存储软件程序以及模块,如本申请实施例中的多模态数据处理方法和装置对应的程序指令/模块,处理器904通过运行存储在存储器902内的软件程序以及模块,从而执行各种功能应用以及数据处理,即实现上述的多模态数据处理方法。存储器902可包括高速随机存储器,还可以包括非易失性存储器,如一个或者多个磁性存储装置、闪存、或者其他非易失性固态存储器。在一些实例中,存储器902可进一步包括相对于处理器904远程设置的存储器,这些远程存储器可以通过网络连接至终端。上述网络的实例包括但不限于互联网、企业内部网、局域网、移动通信网及其组合。其中,存储器902具体可以但不限于用于存储图像数据和文本数据。作为一种示例,如图9所示,上述存储器902中可以但不限于包括上述多模态数据处理装置中的第一获取单元802、第二获取单元804和组合单元806。此外,还可以包括但不限于上述多模态数据处理装置中的其他模块单元,本示例中不再赘述。
可选地,上述的传输装置906用于经由一个网络接收或者发送数据。上述的网络具体实例可包括有线网络及无线网络。在一个实例中,传输装置909包括一个网络适配器(Network Interface Controller,NIC),其可通过网线与其他网络设备与路由器相连从而可与互联网或局域网进行通讯。在一个实例中,传输装置906为射频(Radio Frequency,RF)模块,其用于通过无线方式与互联网进行通讯。
此外,上述电子设备还包括:显示器908,用于显示用户输入的图像数据和文本数据;和连接总线910,用于连接上述电子设备中的各个模块部件。
在其他实施例中,上述终端设备或者服务器可以是一个分布式系统中的一个节点,其中,该分布式系统可以为区块链系统,该区块链系统可以是由该多个节点通过网络通信的形式连接形成的分布式系统。其中,节点之间可以组成点对点(P2P,Peer To Peer)网络,任意形式的计算设备,比如服务器、终端等电子设备都可以通过加入该点对点网络而成为该区块链系统中的一个节点。
根据本申请的一个方面,提供了一种计算机程序产品或计算机程序,该计算机程序产品或计算机程序包括计算机指令,该计算机指令存储在计算机可读存储介质中。计算机设备的处理器从计算机可读存储介质读取该计算机指令,处理器执行该计算机指令,使得该计算机设备执行上述多模态数据处理方法,其中,该计算机程序被设置为运行时执行上述任一项方法实施例中的步骤。
可选地,在本实施例中,上述计算机可读的存储介质可以被设置为存储用于执行以下步骤的计算机程序:
S1,获取待识别的多模态数据,所述多模态数据包括图像数据和文本数据;
S2,获取所述图像数据对应的图像嵌入向量,基于预训练融合词表将所述图像嵌入向量转换为预融合编码向量;所述预训练融合词表为根据图像训练样本得到的用于减少图像特征的编码量的编码本;
S3,将所述预融合编码向量和文本数据对应的文本嵌入向量进行组合,得到目标多模态向量。
可选地,在本实施例中,本领域普通技术人员可以理解上述实施例的各种方法中的全部或部分步骤是可以通过程序来指令终端设备相关的硬件来完成,该程序可以存储于一计算机可读存储介质中,存储介质可以包括:闪存盘、只读存储器(Read-Only Memory,ROM)、随机存取器(Random Access Memory,RAM)、磁盘或光盘等。
上述本申请实施例序号仅仅为了描述,不代表实施例的优劣。
上述实施例中的集成的单元如果以软件功能单元的形式实现并作为独立的产品销售或使用时,可以存储在上述计算机可读取的存储介质中。基于这样的理解,本发明的技术方案本质上或者说对现有技术做出贡献的部分或者该技术方案的全部或部分可以以软件产品的形式体现出来,该计算机软件产品存储在存储介质中,包括若干指令用以使得一台或多台计算机设备(可为个人计算机、服务器或者网络设备等)执行本发明各个实施例方法的全部或部分步骤。
在本发明的上述实施例中,对各个实施例的描述都各有侧重,某个实施例中没有详述的部分,可以参见其他实施例的相关描述。
在本申请所提供的几个实施例中,应该理解到,所揭露的客户端,可通过其它的方式实现。其中,以上所描述的装置实施例仅仅是示意性的,例如单元的划分,仅仅为一种逻辑功能划分,实际实现时可以有另外的划分方式,例如多个单元或组件可以结合或者可以集成到另一个系统,或一些特征可以忽略,或不执行。另一点,所显示或讨论的相互之间的耦合或直接耦合或通信连接可以是通过一些接口,单元或模块的间接耦合或通信连接,可以是电性或其它的形式。
作为分离部件说明的单元可以是或者也可以不是物理上分开的,作为单元显示的部件可以是或者也可以不是物理单元,即可以位于一个地方,或者也可以分布到多个网络单元上。可以根据实际的需要选择其中的部分或者全部单元来实现本实施例方案的目的。
另外,在本发明各个实施例中的各功能单元可以集成在一个处理单元中,也可以是各个单元单独物理存在,也可以两个或两个以上单元集成在一个单元中。上述集成的单元既可以采用硬件的形式实现,也可以采用软件功能单元的形式实现。
以上仅是本发明的优选实施方式,应当指出,对于本技术领域的普通技术人员来说,在不脱离本发明原理的前提下,还可以做出若干改进和润饰,这些改进和润饰也应视为本发明的保护范围。

Claims (11)

1.一种多模态数据处理方法,其特征在于,包括:
获取待识别的多模态数据,所述多模态数据包括图像数据和文本数据;
获取所述图像数据对应的图像嵌入向量,以及预设的图像处理模型对应的初始编码本,以及图像训练样本;
基于所述图像训练样本对应的图像嵌入向量,更新所述初始编码本,得到预训练融合词表,包括:
获取基于所述图像处理模型得到的所述图像训练样本对应的图像嵌入向量;
针对所述图像训练样本中的每个图像对应的图像嵌入向量,依次执行如下码本更新操作,直至所述初始编码本达到预设编码数量:
确定当前图像对应的图像嵌入向量的图像编码连接状态,所述图像编码连接状态包括水平方向的图像编码连接状态和垂直方向的图像编码连接状态;
根据所述图像编码连接状态,确定所述当前图像是否存在出现次数大于预设次数的第一编码对;所述第一编码对指示在水平方向或垂直方向相邻的两个图像编码;
若所述当前图像存在出现次数大于预设次数的第一编码对,则将所述第一编码对替换为第一更新编码值,得到第一图像嵌入向量,将所述第一更新编码值加入所述初始编码本;
判断更新后的图像嵌入向量中是否存在出现次数大于预设次数的第二编码对;所述第二编码对指示在水平方向或垂直方向相邻的两个图像编码;若存在,则将所述第二编码对替换为第二更新编码值,得到第二图像嵌入向量,将所述第二更新编码值加入所述初始编码本;
基于所述预训练融合词表将所述图像嵌入向量转换为预融合编码向量;所述预训练融合词表为根据图像训练样本得到的用于减少图像特征的编码量的编码本;
将所述预融合编码向量和文本数据对应的文本嵌入向量进行组合,得到目标多模态向量。
2.根据权利要求1所述的方法,其特征在于,所述方法还包括:
基于所述图像处理模型获取所述图像训练样本对应的图像嵌入向量。
3.根据权利要求2所述的方法,其特征在于,所述预设的图像处理模型包括VQGAN模型。
4.根据权利要求3所述的方法,其特征在于,所述方法还包括:
若所述当前图像不存在出现次数大于预设次数的第一编码对,则将图像训练样本的下一图像作为当前图像继续执行所述码本更新操作;
当所述初始编码本的编码数量达到预设编码数量时,确定得到所述预训练融合词表。
5.根据权利要求3或4所述的方法,其特征在于,所述方法还包括:
通过所述VQGAN模型的编码器将图像训练样本映射到一个潜在空间,生成所述图像训练样本对应的潜在向量;
通过所述VQGAN模型的量化器将所述潜在向量离散化为一组离散向量,通过最近邻搜索确定所述离散向量最接近的代码向量;
基于所述VQGAN模型的解码器将代码向量映射回图像空间,生成重构图像;
基于所述VQGAN模型中的生成对抗网络调整所述重构图像,得到所述图像训练样本对应的图像嵌入向量。
6.根据权利要求5所述的方法,其特征在于,所述方法还包括:
基于预设的重构损失函数、量化损失函数和对抗损失函数联合训练所述VQGAN模型,在所述VQGAN模型达到收敛条件时,确定得到所述预设的图像处理模型。
7.根据权利要求1至4任一项所述的方法,其特征在于,所述方法还包括:
将所述目标多模态向量作为样本数据,训练Transformer模型;
在所述Transformer模型识别所述样本数据中的数据序列的准确率达到预设阈值时,确定得到预训练的多模态数据识别模型。
8.根据权利要求7所述的方法,其特征在于,所述方法还包括:
获取用户输入的图像和文本对应的目标多模态向量;
基于预训练的多模态数据识别模型识别所述目标多模态向量对应的图像特征和文本特征;
基于所述图像特征和文本特征,生成所述图像和文本对应的语义信息。
9.一种多模态数据处理装置,其特征在于,包括:
第一获取单元,用于获取待识别的多模态数据,所述多模态数据包括图像数据和文本数据;
第二获取单元,用于获取所述图像数据对应的图像嵌入向量,以及预设的图像处理模型对应的初始编码本,以及图像训练样本;
基于所述图像训练样本对应的图像嵌入向量,更新所述初始编码本,得到预训练融合词表,包括:
获取基于所述图像处理模型得到的所述图像训练样本对应的图像嵌入向量;
针对所述图像训练样本中的每个图像对应的图像嵌入向量,依次执行如下码本更新操作,直至所述初始编码本达到预设编码数量:
确定当前图像对应的图像嵌入向量的图像编码连接状态,所述图像编码连接状态包括水平方向的图像编码连接状态和垂直方向的图像编码连接状态;
根据所述图像编码连接状态,确定所述当前图像是否存在出现次数大于预设次数的第一编码对;所述第一编码对指示在水平方向或垂直方向相邻的两个图像编码;
若所述当前图像存在出现次数大于预设次数的第一编码对,则将所述第一编码对替换为第一更新编码值,得到第一图像嵌入向量,将所述第一更新编码值加入所述初始编码本;
判断更新后的图像嵌入向量中是否存在出现次数大于预设次数的第二编码对;所述第二编码对指示在水平方向或垂直方向相邻的两个图像编码;若存在,则将所述第二编码对替换为第二更新编码值,得到第二图像嵌入向量,将所述第二更新编码值加入所述初始编码本;
基于所述预训练融合词表将所述图像嵌入向量转换为预融合编码向量;所述预训练融合词表为根据图像训练样本得到的用于减少图像特征的编码量的编码本;
组合单元,用于将所述预融合编码向量和文本数据对应的文本嵌入向量进行组合,得到目标多模态向量。
10.一种电子设备,包括存储器和处理器,其特征在于,所述存储器中存储有计算机程序,所述处理器被设置为通过所述计算机程序执行所述权利要求1至8任一项中所述的方法。
11.一种计算机可读的存储介质,其特征在于,所述计算机可读的存储介质包括存储的程序,其中,所述程序运行时执行所述权利要求1至8任一项中所述的方法。
CN202411058820.6A 2024-08-02 2024-08-02 多模态数据处理方法、装置、存储介质及电子设备 Active CN119226992B (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN202411058820.6A CN119226992B (zh) 2024-08-02 2024-08-02 多模态数据处理方法、装置、存储介质及电子设备

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN202411058820.6A CN119226992B (zh) 2024-08-02 2024-08-02 多模态数据处理方法、装置、存储介质及电子设备

Publications (2)

Publication Number Publication Date
CN119226992A CN119226992A (zh) 2024-12-31
CN119226992B true CN119226992B (zh) 2025-07-18

Family

ID=93946101

Family Applications (1)

Application Number Title Priority Date Filing Date
CN202411058820.6A Active CN119226992B (zh) 2024-08-02 2024-08-02 多模态数据处理方法、装置、存储介质及电子设备

Country Status (1)

Country Link
CN (1) CN119226992B (zh)

Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN115759062A (zh) * 2022-10-09 2023-03-07 阿里巴巴(中国)有限公司 基于知识注入的文图预训练模型处理方法和文图检索系统
CN116796287A (zh) * 2023-06-16 2023-09-22 平安科技(深圳)有限公司 图文理解模型的预训练方法、装置、设备及存储介质

Family Cites Families (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN114723843B (zh) * 2022-06-01 2022-12-06 广东时谛智能科技有限公司 多模态融合生成虚拟服装方法、装置、设备及存储介质
CN117437516A (zh) * 2022-07-11 2024-01-23 北京字跳网络技术有限公司 语义分割模型训练方法、装置、电子设备及存储介质
CN117875395A (zh) * 2023-12-14 2024-04-12 深圳须弥云图空间科技有限公司 多模态预训练模型的训练方法、装置及存储介质

Patent Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN115759062A (zh) * 2022-10-09 2023-03-07 阿里巴巴(中国)有限公司 基于知识注入的文图预训练模型处理方法和文图检索系统
CN116796287A (zh) * 2023-06-16 2023-09-22 平安科技(深圳)有限公司 图文理解模型的预训练方法、装置、设备及存储介质

Also Published As

Publication number Publication date
CN119226992A (zh) 2024-12-31

Similar Documents

Publication Publication Date Title
CN116580257B (zh) 特征融合模型训练及样本检索方法、装置和计算机设备
CN111079532B (zh) 一种基于文本自编码器的视频内容描述方法
Tomei et al. Art2real: Unfolding the reality of artworks via semantically-aware image-to-image translation
CN115271093B (zh) 用于多任务用户界面建模的基于神经网络的多模态变换器
JP2023533907A (ja) 自己注意ベースのニューラルネットワークを使用した画像処理
BR112020022270A2 (pt) sistemas e métodos para unificar modelos estatísticos para diferentes modalidades de dados
JP2017220222A (ja) データグラフを比較する方法、プログラム、及び装置
WO2008073366A2 (en) Target object recognition in images and video
CN111091010A (zh) 相似度确定、网络训练、查找方法及装置和存储介质
WO2016142285A1 (en) Method and apparatus for image search using sparsifying analysis operators
CN116189265B (zh) 基于轻量化语义Transformer模型的素描人脸识别方法、装置及设备
CN115292439A (zh) 一种数据处理方法及相关设备
US12386873B2 (en) Apparatus and method for sharing and pruning weights for vision and language models
CN119646691B (zh) 一种基于双向翻译交互的超多模态情感分析方法及系统
CN115619903A (zh) 文本图像合成模型的训练、合成方法、装置、设备及介质
CN112668608B (zh) 一种图像识别方法、装置、电子设备及存储介质
WO2025031067A1 (zh) 图像处理方法、装置、设备和计算机可读存储介质
CN116796038A (zh) 遥感数据检索方法、装置、边缘处理设备及存储介质
CN120823470B (zh) 多模态与视觉大模型耦合的遥感语义分割方法及产品
CN120913221A (zh) 文本识别方法、装置、计算机设备、存储介质和计算机程序产品
CN114386562B (zh) 减少神经模型的资源需求的方法、系统和存储介质
CN119226992B (zh) 多模态数据处理方法、装置、存储介质及电子设备
CN117938951B (zh) 信息推送方法、装置、计算机设备和存储介质
CN115080699B (zh) 基于模态特异自适应缩放与注意力网络的跨模态检索方法
CN120658789A (zh) 信息推送方法、装置、计算机设备和存储介质

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination
GR01 Patent grant
GR01 Patent grant