WO2024255056A1 - 一种基于掩码图自编码器的骨架序列识别方法及系统 - Google Patents

一种基于掩码图自编码器的骨架序列识别方法及系统 Download PDF

Info

Publication number
WO2024255056A1
WO2024255056A1 PCT/CN2023/126489 CN2023126489W WO2024255056A1 WO 2024255056 A1 WO2024255056 A1 WO 2024255056A1 CN 2023126489 W CN2023126489 W CN 2023126489W WO 2024255056 A1 WO2024255056 A1 WO 2024255056A1
Authority
WO
WIPO (PCT)
Prior art keywords
skeleton
autoencoder
joint
sequence
mask image
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
PCT/CN2023/126489
Other languages
English (en)
French (fr)
Inventor
刘阳
严鸿
李冠彬
王青
林倞
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Sun Yat Sen University
Original Assignee
Sun Yat Sen University
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Sun Yat Sen University filed Critical Sun Yat Sen University
Publication of WO2024255056A1 publication Critical patent/WO2024255056A1/zh
Anticipated expiration legal-status Critical
Ceased legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V40/00Recognition of biometric, human-related or animal-related patterns in image or video data
    • G06V40/20Movements or behaviour, e.g. gesture recognition
    • G06V40/23Recognition of whole body movements, e.g. for sport training
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/045Combinations of networks
    • G06N3/0455Auto-encoder networks; Encoder-decoder networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/0464Convolutional networks [CNN, ConvNet]
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/048Activation functions
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/20Image preprocessing
    • G06V10/34Smoothing or thinning of the pattern; Morphological operations; Skeletonisation
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/40Extraction of image or video features
    • G06V10/44Local feature extraction by analysis of parts of the pattern, e.g. by detecting edges, contours, loops, corners, strokes or intersections; Connectivity analysis, e.g. of connected components
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/77Processing image or video features in feature spaces; using data integration or data reduction, e.g. principal component analysis [PCA] or independent component analysis [ICA] or self-organising maps [SOM]; Blind source separation
    • G06V10/80Fusion, i.e. combining data from various sources at the sensor level, preprocessing level, feature extraction level or classification level
    • G06V10/806Fusion, i.e. combining data from various sources at the sensor level, preprocessing level, feature extraction level or classification level of extracted features
    • YGENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
    • Y02TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
    • Y02TCLIMATE CHANGE MITIGATION TECHNOLOGIES RELATED TO TRANSPORTATION
    • Y02T10/00Road transport of goods or passengers
    • Y02T10/10Internal combustion engine [ICE] based vehicles
    • Y02T10/40Engine management systems

Definitions

  • the present invention relates to the technical field of video action representation learning, and more specifically, to a skeleton sequence recognition method and system based on a mask image autoencoder.
  • skeleton sequences are more suitable for distinguishing similar actions with subtle differences due to the huge potential and rapid development of the ability to model fine-grained and large variations of human motion.
  • existing skeleton-based action recognition methods are all fully supervised, which usually requires a large amount of labeled data to train carefully designed models, which is time-consuming and laborious.
  • self-supervised skeleton-based action recognition methods have recently attracted increasing attention.
  • Some contrastive learning methods adopt data augmentation methods to generate positive and negative sample pairs, but they rely heavily on the number of contrast pairs.
  • a skeleton sequence recognition method based on a mask image autoencoder comprising the following steps:
  • the goal of the mask image autoencoder is to minimize the difference between H and Y.
  • FIG. 2 is a principle framework diagram of the mask image autoencoder of the present invention.
  • FIG3 is a schematic diagram of training the mask image autoencoder of the present invention.
  • a skeleton sequence recognition method based on a mask image autoencoder comprises the following steps:
  • N human skeleton joints and T skeleton sequences are preprocessed.
  • a graph structure about skeleton joints and topological structures of skeleton joints is established.
  • the topological structure and features of the skeleton joints are fused to obtain a skeleton sequence matrix S ⁇ R N ⁇ T ⁇ 2 , where N represents the number of skeleton joints and T represents the number of skeleton sequences; the skeleton sequence matrix S is transformed into S ⁇ R N ⁇ T ⁇ D with learnable parameters, where D represents the dimension increase of the original skeleton sequence matrix S.
  • T and D are set to 64 based on experience.
  • masked skeleton joint features are used to train a mask image autoencoder to reconstruct a skeleton sequence.
  • the mask image autoencoder is trained to reconstruct the masked skeleton joint features based on an established skeleton joint masking strategy and a reweighted loss function.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • General Health & Medical Sciences (AREA)
  • Health & Medical Sciences (AREA)
  • Artificial Intelligence (AREA)
  • Software Systems (AREA)
  • Computing Systems (AREA)
  • Evolutionary Computation (AREA)
  • Biophysics (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Data Mining & Analysis (AREA)
  • General Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Mathematical Physics (AREA)
  • Biomedical Technology (AREA)
  • Molecular Biology (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Multimedia (AREA)
  • Medical Informatics (AREA)
  • Databases & Information Systems (AREA)
  • Psychiatry (AREA)
  • Social Psychology (AREA)
  • Human Computer Interaction (AREA)
  • Image Analysis (AREA)

Abstract

本发明公开了一种基于掩码图自编码器的骨架序列识别方法及系统,包括步骤如下:建立骨架动作识别模型,利用骨架动作识别模型识别骨架序列,实现预测动作类别;所述的骨架动作识别模型包括一个M层的空间-时间表示学习模型和一层分类器;所述的空间-时间表示学习模型包括两个并联连接的掩码图自编码器,且掩码图自编码器的输出端通过1×1卷积与输入端进行残差连接。本发明将一个M层的空间-时间表示学习模型和一层分类器构建骨架动作识别模型,其利用不同骨架关节之间的细粒度依赖关系来训练学习,是一个高效的骨架序列学习模型,在不同的数据集上很好地泛化。

Description

一种基于掩码图自编码器的骨架序列识别方法及系统 技术领域
本发明涉及视频动作表示学习技术领域,更具体的,涉及一种基于掩码图自编码器的骨架序列识别方法及系统。
背景技术
人类动作识别在视频理解中引起了越来越多的关注,由于人类动作识别在人机交互、智能监控安全、虚拟现实等方面的广泛应用。在视觉感知方面,即使没有外观信息,人类也可以只通过观察关节的运动来识别动作类别。与RGB视频不同,骨架序列只包含人体关键关节的坐标信息,具有高层次、轻量级、对复杂背景和各种条件(包括视点、比例和运动速度)的鲁棒性。此外,随着人体姿态估计算法的发展,人体关节(即关键点)的定位方法有了很大的进步,获得准确的骨架序列是可行的。由于对人体运动的细粒度和大变化进行建模的能力潜力巨大且迅速发展,与RGB数据相比,骨架序列更适合区分具有细微差别的类似动作。为了捕捉具有鉴别力的时空运动模式,现有的基于骨架的动作识别方法都是完全监督的,通常需要大量的标记数据来训练精心设计的模型,这既费时又费力。为了缓解有限的标记训练数据的问题,基于自监督的骨架动作识别方法最近引起了越来越多的关注。一些对比性学习方法采用了数据增强的方法来产生正负样本对,但它们在很大程度上依赖于对比对的数量。随着编码器-解码器的普及,一些方法按照图编码器-解码器的范式,通过链接重构掩盖的骨架序列来鼓励拓扑的接近性。然而,这些方法通常在链接预测和节点聚类方面表现良好,但在节点和图的分类方面却不尽人意。
对于准确的动作识别,不同骨架关节之间的细粒度依赖关系(即图分类)是至关重要的。但是,以前基于自监督学习的方法往往忽略了不同骨架关节之间的细粒度依赖关系,这限制了自监督骨架表示的通用性。
发明内容
本发明为了解决以上现有技术忽略了不同骨架关节之间的细粒度依赖关系,限制了自监督骨架表示的通用性的问题,提供了一种基于掩码图自编码器的骨架 序列识别方法及系统。
为实现上述本发明目的,采用的技术方案如下:
一种基于掩码图自编码器的骨架序列识别方法,所述的方法包括步骤如下:
建立骨架动作识别模型,利用骨架动作识别模型识别骨架序列,实现预测动作类别;
所述的骨架动作识别模型包括一个M层的空间-时间表示学习模型和一层分类器;
所述的空间-时间表示学习模型包括两个并联连接的掩码图自编码器,且掩码图自编码器的输出端通过1×1卷积与掩码图自编码器的输入端进行残差连接。
优选地,所述掩码图自编码器包括一个编码器GE和一个解码器GD,其中,编码器GE包括三层GIN,解码器GD包括一层GIN。
优选地,建立关于骨架关节和骨架关节的拓扑结构的图结构将骨架关节的拓扑结构和骨架关节特征进行融合,得到骨架序列矩阵S∈RN×T×2,N表示骨架关节的数量,T表示骨架序列的数量;将骨架序列矩阵S转化为具有可学习参数的S∈RN×T×D,D表示对原始骨架序列矩阵S进行升维;
对于每个骨架关节特征矩阵X∈RN×D,图结构表示一个骨架,其中,是包含所有骨架关节的节点集;A∈{0,1}N×N是一个邻接矩阵,如果i和j是物理连接的,则Ai,j=1,否则为0;节点vi的骨架关节特征表示为xi∈R1×D,i=1,…,N。
进一步地,利用被遮蔽的骨架关节特征训练掩码图自编码器重建骨架序列,具体地,所述掩码图自编码器基于建立的骨架关节掩码策略、重加权损失函数对被遮蔽的骨架关节特征进行重建训练。
再进一步地,建立骨架关节掩码策略,具体如下:
按身体部位进行划分,每个部位对应一个第一关节子集,随机选择一个或多个第一关节子集,由一个或多个第一关节子集组成一个第二关节子集用于掩盖。然后,用一个可学习的掩码令牌向量[MASK]=x[M]∈RD对人体骨架序列的每个骨架关节特征进行掩码;因此,被屏蔽的骨架关节特征在被屏蔽的关节特征矩阵定义为:如果否则
将骨架关节特征矩阵作为掩码图自编码器的输入,骨架关节特征矩 阵中的每个骨架关节特征定义为
因此,被遮蔽的骨架被表述为
再进一步地,所述的掩码图自编码器重建被遮蔽的骨架关节特征,定义为:
其中,H表示编码器输出的中间层特征矩阵,Y表示解码器输出的骨架关节特征矩阵;
所述的掩码图自编码器的目标是最小化H和Y之间的差异。
再进一步地,所述重加权损失函数表示在所有被掩码的节点上,重建的骨架与输入的原始关节点之间的相似性差距的平均值,具体如下:
给定原始骨架关节特征矩阵X∈RN×D和重建后的解码器输出的骨架关节特征Y∈RN×D,重加权损失函数定义为:
式中,xi表示原始骨架关节特征,包含在X∈RN×D中;zi表示重建的骨架关节特征,包含在Y∈RN×D中,β表示缩放系数。
再进一步地,所述的骨架动作识别模型识别骨架序列,实现预测动作类别,具体如下:输入的骨架序列矩阵S∈RN×T×D首先与可学习的时间位置嵌入PE相加,得到骨架序列特征矩阵
中得到两个人的单独特征
将节点表示和节点的先验知识送入一个掩码图自编码器,
其中,GE是掩码图自编码器;SP(·)表示求和池化;Repeat(·;N)表示求和后将单个节点重复成N个节点表示,然后与残差连接,得到全局节点表示掩码图自编码器通过单个节点表征获得全局信息,并通过所有节点表征约束一些节点特征;同样,获得
得到的节点特征包含第0个人和第1个人之间的动作交互;根据图卷积的更新规则,从多层GCN中的得到最终的骨架序列特征矩阵表示定义如下:
其中W(l)表示第l层的可训练权重矩阵,σ(·)表示ReLU激活函数。
然后,采用多尺度时空集合来得到最终的骨架序列特征矩阵;
最后,分类器根据最终的骨架序列预测动作类别。
优选地,在利用骨架动作识别模型识别骨架序列之前,将骨架动作识别数据集输入骨架动作识别模型,使用交叉熵损失对骨架动作识别模型进行微调。
一种计算机系统,包括存储器、处理器以及存储在存储器上并可在处理器上运行的计算机程序,所述的处理器执行所述的计算机程序时,实现如上所述的方法的步骤。
本发明的有益效果如下:
本发明将一个M层的空间-时间表示学习模型和一层分类器构建骨架动作识别模型,其利用不同骨架关节之间的细粒度依赖关系来训练学习,是一个高效的骨架序列学习模型,可以在不同的数据集上很好地泛化。
本发明骨架动作识别模型引入基于骨架掩码的掩码图自编码器,掩码图自编码器可以进行无监督训练。
本发明构建的掩码图自编码器,将骨架关节序列嵌入到图卷积网络中,并基于人体先验拓扑知识重构隐藏的骨骼关节和边缘,为了可靠地进行特征重建,引入了重加权余弦误差(RCE)。
附图说明
图1为本发明骨架动作识别模型的原理框架图。
图2为本发明掩码图自编码器的原理框架图。
图3为本发明掩码图自编码器的训练示意图。
图4为本发明与现有技术随机选择节点进行掩码的对比示意图。
具体实施方式
下面结合附图和具体实施方式对本发明做详细描述。
实施例1
如图1所示,一种基于掩码图自编码器的骨架序列识别方法,所述的方法包括步骤如下:
建立骨架动作识别模型,利用骨架动作识别模型识别骨架序列,实现预测动作类别;
所述的骨架动作识别模型(SSL)包括一个M层的空间-时间表示学习模型(STRL)和一层分类器;
所述的空间-时间表示学习模型(STRL)包括两个并联连接的掩码图自编码器(SkeletonMAE,SM),且掩码图自编码器(SkeletonMAE,SM)的输出端通过1×1卷积与掩码图自编码器(SkeletonMAE)的输入端进行残差连接。
本发明将一个M层的空间-时间表示学习模型(STRL)和一层分类器构建骨架动作识别模型,其利用不同骨架关节之间的细粒度依赖关系来训练学习,是一个高效的骨架序列学习模型,可以在不同的数据集上很好地泛化。
本发明骨架动作识别模型引入基于骨架掩码的掩码图自编码器,掩码图自编码器可以进行无监督训练。
在一个具体的实施例中,所述掩码图自编码器包括一个编码器GE和一个解码器GD,其中,编码器GE包括三层GIN,解码器GD包括一层GIN。
在一个具体的实施例中,对N个人体骨架关节和T个骨架序列进行预处理。建立关于骨架关节和骨架关节的拓扑结构的图结构将骨架关节的拓扑结构和骨架关节特征进行融合,得到骨架序列矩阵S∈RN×T×2,N表示骨架关节的数量,T表示骨架序列的数量;将骨架序列矩阵S转化为具有可学习参数的S∈RN×T×D,D表示对原始骨架序列矩阵S进行升维。本实施例根据经验将T和D设置为64。
对于每个骨架关节特征矩阵X∈RN×D,图结构表示一个骨架,其中,是包含所有骨架关节的节点集;A∈{0,1}N×N是一个邻接矩阵,如果i和j是物理连接的,则Ai,j=1,否则为0;节点vi的骨架关节特征表示为xi∈R1×D,i=1,…,N。本实施例骨架关节的数量为N=17。
在一个具体的实施例中,利用被遮蔽的骨架关节特征训练掩码图自编码器重建骨架序列,具体地,所述掩码图自编码器基于建立的骨架关节掩码策略、重加权损失函数对被遮蔽的骨架关节特征进行重建训练。
再进一步地,建立骨架关节掩码策略,具体如下:
为了掩盖骨架关节特征,将按身体部位进行划分,划分为头部、四肢、躯干这6个部位对应V0,…,V5的第一关节子集,随机选择一个或多个第一关节子集,由一个或多个第一关节子集组成一个第二关节子集用于掩盖。对于人体骨架序列,每个关节都与该关节的一些相邻的关节进行交流, 以代表特定的动作类别。因此,对所有动作类别的所有关节集进行屏蔽是不可行的。
然后,用一个可学习的掩码令牌向量[MASK]=x[M]∈RD对人体骨架序列的每个骨架关节特征进行掩码;因此,被屏蔽的骨架关节特征在被屏蔽的骨架关节特征矩阵定义为:如果否则
将骨架关节特征矩阵作为掩码图自编码器的输入,骨架关节特征矩阵中的每个关节特征定义为
因此,被遮蔽的骨架被表述为
所述的掩码图自编码器,在给定的被屏蔽的骨架关节特征矩阵和邻接矩阵A的情况下,重建第二关节子集中被遮蔽的骨架关节特征。
其中,所述的掩码图自编码器重建被遮蔽的骨架关节特征,定义为:
其中,H表示编码器输出的中间层特征矩阵,Y表示解码器输出的骨架关节特征矩阵;
所述的掩码图自编码器的目标是最小化H和Y之间的差异。
在一个具体的实施例中,在图像和视频任务中,掩码图自编码器的常见重建损失是平均平方误差(MSE)。对于骨架序列,节点特征的多维和连续性质使得平均平方误差难以进行可靠的特征重建,因为平均平方误差对特征的维度和矢量范式很敏感。余弦误差中的l2归一化将向量映射到一个单位超球面上,并极大改善了训练的稳定性,我们利用余弦误差作为重建的依据。
为了使重建标准在不平衡的简单和困难样本上倾向于较难的样本,为掩码图自编码器引入了重加权余弦误差函数(RCE)。重加权余弦误差函数是基于这样的方式:可以通过将余弦误差以β≥1的幂数进行缩放,来减轻简单样本在训练中的占比贡献。对于具有高置信度的预测,其相应的余弦误差通常小于1,并且当缩放系数β>1时,会更快地衰减到零。
在本实施中,所述重加权损失函数表示在所有被掩码的节点上,重建的骨架关节特征与输入的原始骨架关节特征之间的相似性差距的平均值,具体如下:
给定原始骨架关节特征矩阵X∈RN×D和重建后的解码器输出的骨架关节特征矩阵Y∈RN×D,重加权损失函数定义为:
式中,xi表示原始关键点特征,包含在X∈RN×D中;zi表示重建的关键点特征,包含在Y∈RN×D中,β表示缩放系数;
重加权损失函数通过将余弦误差以β≥1的幂数进行缩放,来减轻简单样本在训练中的占比贡献;对于具有高置信度的预测,其相应的余弦误差通常小于1,并且当缩放系数β>1时,会更快地衰减到零。
本实施例β设定为2。通过训练掩码图自编码器来重建骨架序列,预训练的掩码图自编码器可以全面感知人体骨架结构并获得具有判断力的动作表示。经过预训练后,所述的掩码图自编码器可以嵌入到骨架动作识别模型中进行微调。
在一个具体的实施例中,为了评估掩码图自编码器对骨架动作识别的泛化能力,我们在预先训练好的掩码图自编码器的基础上,建立了一个完整的骨架动作识别模型,即骨架序列学习框架(SSL)。为了捕捉多人互动,我们整合了两个预先训练好的掩码图自编码器来建立空间-时间表示学习(STRL)模块,如图2(b)-(c)所示。整个骨架动作识别模型由一个N层的STRL模型和一个分类器组成。最后,输入骨架动作识别数据集到骨架动作识别模型中,使用交叉熵损失来对骨架动作识别模型进行微调。
在本实施例中,所述的骨架动作识别模型识别骨架序列,实现预测动作类别,具体如下:输入的骨架序列矩阵S∈RN×T×D首先与可学习的时间位置嵌入PE相加,得到骨架序列特征矩阵
中得到两个人(P=2)的单独特征
这里,我们以第0个人的节点特征为例,第1个人的操作是类似实现的。将节点表示和节点的先验知识送入一个掩码图自编码器;
其中,GE是掩码图自编码器;SP(·)表示求和池化;Repeat(·;N)表示求和后将单个节点重复成N个节点表示,然后与残差连接,得到全局节点表示掩码图自编码器通过单个节点表征获得全局信息,并通过所有节点表征约束一些节点特征;
类似地,以同样的方式获得的。
得到的节点特征包含第0个人和第1个人之间的动作交互;根据图卷积的更新规则,从多层GCN中的得到最终的骨架序列特征矩阵表示定义如下:
其中W(l)表示第l层的可训练权重矩阵,σ(·)表示ReLU激活函数。
然后,采用多尺度时空集合来得到最终的骨架序列特征矩阵;
最后,分类器根据最终的骨架序列预测动作类别。
在一个具体的实施例中,在利用骨架动作识别模型识别骨架序列之前,在利用骨架动作识别模型识别骨架序列之前,将骨架动作识别数据集输入掩码图自编码器中进行无监督预训练,然后将掩码图自编码器在骨架动作识别模型上微调并用交叉熵损失对骨架动作识别模型来识别动作。
如图4所示,本发明与现有技术随机选择节点进行掩码的对比示意图首先本发明是对应的skeleton MAE,现有技术的是MAE,在图4中举例了两个细粒度的动作标签,上图的动作是后空翻,下图的动作是身体扭动的后空翻。本发明是对身体部位的掩码,因为我们将人体的17个关键点即关节点按身体部位划分,分成6个部分,分别是头部,四肢和躯干。本发明的掩码策略是对部位掩码。而现有的MAE是从人体的17个关键点中随机选取一些关键点进行掩码。本发明可以按照先验知识有选择的去掩码身体的哪个部位,从而能提升模型的性能。
实施例2
本实施例还提供了一种计算机系统,包括存储器、处理器以及存储在存储器上并可在处理器上运行的计算机程序,所述的处理器执行所述的计算机程序时,实现如实施例1所述的方法的步骤。
其中,存储器和处理器采用总线方式连接,总线可以包括任意数量的互联的总线和桥,总线将一个或多个处理器和存储器的各种电路连接在一起。总线还可以将诸如外围设备、稳压器和功率管理电路等之类的各种其他电路连接在一起,这些都是本领域所公知的,因此,本文不再对其进行进一步描述。总线接口在总线和收发机之间提供接口。收发机可以是一个元件,也可以是多个元件,比如多个接收器和发送器,提供用于在传输介质上与各种其他装置通信的单元。经处理 器处理的数据通过天线在无线介质上进行传输,进一步,天线还接收数据并将数据传送给处理器。
实施例3
一种计算机可读存储介质,其上存储有计算机程序,所述的计算机程序被处理器执行时,实现如实施例1所述的方法的步骤。
即,本领域技术人员可以理解,实现上述实施例方法中的全部或部分步骤是可以通过程序来指令相关的硬件来完成,该程序存储在一个存储介质中,包括若干指令用以使得一个设备(可以是单片机,芯片等)或处理器(processor)执行本申请各个实施例所述方法的全部或部分步骤。而前述的存储介质包括:U盘、移动硬盘、只读存储器(ROM,Read-OnlyMemory)、随机存取存储器(RAM,Random Access Memory)、磁碟或者光盘等各种可以存储程序代码的介质。
显然,本发明的上述实施例仅仅是为清楚地说明本发明所作的举例,而并非是对本发明的实施方式的限定。凡在本发明的精神和原则之内所作的任何修改、等同替换和改进等,均应包含在本发明权利要求的保护范围之内。

Claims (10)

  1. 一种基于掩码图自编码器的骨架序列识别方法,其特征在于:所述的方法包括步骤如下:
    建立骨架动作识别模型,利用骨架动作识别模型识别骨架序列,实现预测动作类别;
    所述的骨架动作识别模型包括一个M层的空间-时间表示学习模型和一层分类器;
    所述的空间-时间表示学习模型包括两个并联连接的掩码图自编码器,且掩码图自编码器的输出端通过1×1卷积与掩码图自编码器的输入端进行残差连接。
  2. 根据权利要求1所述的基于掩码图自编码器的骨架序列识别方法,其特征在于:所述掩码图自编码器包括一个编码器GE和一个解码器GD,其中,编码器GE包括三层GIN,解码器GD包括一层GIN。
  3. 根据权利要求1所述的基于掩码图自编码器的骨架序列识别方法,其特征在于:建立关于骨架关节和骨架关节的拓扑结构的图结构将骨架关节的拓扑结构和骨架关节特征进行融合,得到骨架序列矩阵S∈RN×T×2,N表示骨架关节的数量,T表示骨架序列的数量;将骨架序列矩阵S转化为具有可学习参数的S∈RN×T×D,D表示对原始骨架序列矩阵S进行升维;
    对于每个骨架关节特征矩阵X∈RN×D,图结构表示一个骨架,其中,是包含所有骨架关节的节点集;A∈{0,1}N×N是一个邻接矩阵,如果i和j是物理连接的,则Ai,j=1,否则为0;节点vi的骨架关节特征表示为xi∈R1×D,i=1,…,N。
  4. 根据权利要求2所述的基于掩码图自编码器的骨架序列识别方法,其特征在于:利用被遮蔽的骨架关节特征训练掩码图自编码器重建骨架序列,具体地,所述掩码图自编码器基于建立的骨架关节掩码策略、重加权损失函数对被遮蔽的骨架关节特征进行重建训练。
  5. 根据权利要求4所述的基于掩码图自编码器的骨架序列识别方法,其特征在于:建立骨架关节掩码策略,具体如下:
    按身体部位进行划分,每个部位对应一个第一关节子集,随机选择一个或多个第一关节子集,由一个或多个第一关节子集组成一个第 二关节子集
    然后,用一个可学习的掩码令牌向量[MASK]=x[M]∈RD对人体骨架序列的每个骨架关节特征进行掩码;因此,被屏蔽的骨架关节特征在被屏蔽的关节特征矩阵定义为:如果否则
    将骨架关节特征矩阵作为掩码图自编码器的输入,骨架关节特征矩阵中的每个骨架关节特征定义为
    因此,被遮蔽的骨架被表述为
  6. 根据权利要求5所述的基于掩码图自编码器的骨架序列识别方法,其特征在于:所述的掩码图自编码器重建被遮蔽的骨架关节特征,定义为:
    其中,H表示编码器输出的中间层特征矩阵,Y表示解码器输出的骨架关节特征矩阵;
    所述的掩码图自编码器的目标是最小化H和Y之间的差异。
  7. 根据权利要求6所述的基于掩码图自编码器的骨架序列识别方法,其特征在于:所述重加权损失函数表示在所有被掩码的节点上,重建的骨架关节特征与输入的原始骨架关节特征之间的相似性差距的平均值,具体如下:
    给定原始骨架关节特征矩阵X∈RN×D和重建后的解码器输出的骨架关节特征矩阵Y∈RN×D,重加权损失函数定义为:
    式中,xi表示原始骨架关节特征,包含在X∈RN×D中;zi表示重建的骨架关节特征,包含在Y∈RN×D中,β表示缩放系数。
  8. 根据权利要求3所述的基于掩码图自编码器的骨架序列识别方法,其特征在于:所述的骨架动作识别模型识别骨架序列,实现预测动作类别,具体如下:输入的骨架序列矩阵S∈RN×T×D首先与可学习的时间位置嵌入PE相加,得到骨架序列特征矩阵
    中得到两个人的单独特征
    将节点表示和节点的先验知识送入一个掩码图自编码器,
    其中,GE是掩码图自编码器;SP(·)表示求和池化;Repeat(·;N)表示求和后将单个节点重复成N个节点表示,然后与残差连接,得到全局节点表示掩码图自编码器通过单个节点表征获得全局信息,并通过所有节点表征约束一些节点特征;同样,获得
    得到的节点特征包含第0个人和第1个人之间的动作交互;根据图卷积的更新规则,从多层GCN中的得到最终的骨架序列特征矩阵表示定义如下:
    其中W(l)表示第l层的可训练权重矩阵,σ(·)表示ReLU激活函数。
    然后,采用多尺度时空集合来得到最终的骨架序列特征矩阵;
    最后,分类器根据最终的骨架序列预测动作类别。
  9. 根据权利要求1所述的基于掩码图自编码器的骨架序列识别方法,其特征在于:在利用骨架动作识别模型识别骨架序列之前,将骨架动作识别数据集输入骨架动作识别模型,使用交叉熵损失对骨架动作识别模型进行微调。
  10. 一种计算机系统,包括存储器、处理器以及存储在存储器上并可在处理器上运行的计算机程序,其特征在于:所述的处理器执行所述的计算机程序时,实现如权利要求1~9任一项所述的方法的步骤。
PCT/CN2023/126489 2023-06-12 2023-10-25 一种基于掩码图自编码器的骨架序列识别方法及系统 Ceased WO2024255056A1 (zh)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
CN202310688179.3 2023-06-12
CN202310688179.3A CN116434347B (zh) 2023-06-12 2023-06-12 一种基于掩码图自编码器的骨架序列识别方法及系统

Publications (1)

Publication Number Publication Date
WO2024255056A1 true WO2024255056A1 (zh) 2024-12-19

Family

ID=87087573

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/CN2023/126489 Ceased WO2024255056A1 (zh) 2023-06-12 2023-10-25 一种基于掩码图自编码器的骨架序列识别方法及系统

Country Status (2)

Country Link
CN (1) CN116434347B (zh)
WO (1) WO2024255056A1 (zh)

Cited By (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN120148063A (zh) * 2025-05-13 2025-06-13 西安星讯智能通信科技有限公司 基于机器学习的图纸智能识别方法
US20250217481A1 (en) * 2023-12-29 2025-07-03 Fortinet, Inc. Insider threat reporting mechanism
CN120336796A (zh) * 2025-06-16 2025-07-18 山东第二医科大学 一种用于脑机接口的运动意图识别方法和系统
CN121479525A (zh) * 2025-11-27 2026-02-06 北京兰云科技有限公司 一种面向卫星互联网的Tor网站指纹识别方法

Families Citing this family (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN116434347B (zh) * 2023-06-12 2023-10-13 中山大学 一种基于掩码图自编码器的骨架序列识别方法及系统
CN117217237B (zh) * 2023-09-12 2024-07-23 内蒙古工业大学 意图识别与槽值填充联合预测方法及系统
CN117474764B (zh) * 2023-12-27 2024-04-16 电子科技大学 一种针对复杂退化模型下遥感图像的高分辨率重建方法
CN118334740B (zh) * 2024-04-09 2025-04-04 深圳大学 一种基于无监督掩膜算法的3d人体动作识别方法和装置
CN118917378B (zh) * 2024-10-09 2025-02-07 北京智源人工智能研究院 一种视觉大模型的预训练方法、装置和电子设备
CN119559699B (zh) * 2024-11-20 2025-09-30 中国科学院自动化研究所 人体行为识别方法及装置
CN120877365A (zh) * 2025-06-24 2025-10-31 西安电子科技大学广州研究院 数据集生成方法、模型训练方法以及行为识别方法
CN120374814B (zh) * 2025-06-26 2025-08-22 南京邮电大学 一种面向操控感知的整体人体动作生成方法

Citations (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN111325099A (zh) * 2020-01-21 2020-06-23 南京邮电大学 一种基于双流时空图卷积神经网络的手语识别方法及系统
CN113762082A (zh) * 2021-08-09 2021-12-07 同济大学 基于循环图卷积自动编码器的无监督骨架动作识别方法
CN114511924A (zh) * 2021-12-31 2022-05-17 南京理工大学 基于自适应增广与表示学习的半监督骨骼动作识别方法
WO2022237383A1 (en) * 2021-05-09 2022-11-17 International Business Machines Corporation Skeleton-based action recognition using bi-directional spatial-temporal transformer
CN115461785A (zh) * 2020-04-30 2022-12-09 谷歌有限责任公司 生成非线性人类形状模型
CN116434347A (zh) * 2023-06-12 2023-07-14 中山大学 一种基于掩码图自编码器的骨架序列识别方法及系统

Family Cites Families (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN110084863B (zh) * 2019-04-25 2020-12-25 中山大学 一种基于生成对抗网络的多域图像转换方法与系统
CN110348330B (zh) * 2019-06-24 2022-06-14 电子科技大学 基于vae-acgan的人脸姿态虚拟视图生成方法
CN116965029A (zh) * 2021-02-25 2023-10-27 华为技术有限公司 使用卷积神经网络对图像进行译码的装置和方法
US12175384B2 (en) * 2021-07-21 2024-12-24 International Business Machines Corporation Neural-symbolic action transformers for video question answering
EP4148691A1 (en) * 2021-09-10 2023-03-15 Milestone Systems A/S A method of training a machine learning algorithm to identify objects or activities in video surveillance data
CN113838041B (zh) * 2021-09-29 2023-09-08 西安工程大学 一种基于自编码器的彩色纹理织物缺陷区域的检测方法

Patent Citations (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN111325099A (zh) * 2020-01-21 2020-06-23 南京邮电大学 一种基于双流时空图卷积神经网络的手语识别方法及系统
CN115461785A (zh) * 2020-04-30 2022-12-09 谷歌有限责任公司 生成非线性人类形状模型
WO2022237383A1 (en) * 2021-05-09 2022-11-17 International Business Machines Corporation Skeleton-based action recognition using bi-directional spatial-temporal transformer
CN113762082A (zh) * 2021-08-09 2021-12-07 同济大学 基于循环图卷积自动编码器的无监督骨架动作识别方法
CN114511924A (zh) * 2021-12-31 2022-05-17 南京理工大学 基于自适应增广与表示学习的半监督骨骼动作识别方法
CN116434347A (zh) * 2023-06-12 2023-07-14 中山大学 一种基于掩码图自编码器的骨架序列识别方法及系统

Cited By (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20250217481A1 (en) * 2023-12-29 2025-07-03 Fortinet, Inc. Insider threat reporting mechanism
CN120148063A (zh) * 2025-05-13 2025-06-13 西安星讯智能通信科技有限公司 基于机器学习的图纸智能识别方法
CN120336796A (zh) * 2025-06-16 2025-07-18 山东第二医科大学 一种用于脑机接口的运动意图识别方法和系统
CN121479525A (zh) * 2025-11-27 2026-02-06 北京兰云科技有限公司 一种面向卫星互联网的Tor网站指纹识别方法
CN121479525B (zh) * 2025-11-27 2026-04-17 北京兰云科技有限公司 一种面向卫星互联网的Tor网站指纹识别方法

Also Published As

Publication number Publication date
CN116434347A (zh) 2023-07-14
CN116434347B (zh) 2023-10-13

Similar Documents

Publication Publication Date Title
WO2024255056A1 (zh) 一种基于掩码图自编码器的骨架序列识别方法及系统
CN110287800B (zh) 一种基于sgse-gan的遥感图像场景分类方法
CN110163258B (zh) 一种基于语义属性注意力重分配机制的零样本学习方法及系统
CN110309732B (zh) 基于骨架视频的行为识别方法
CN115830707B (zh) 一种基于超图学习的多视角人体行为识别方法
Fu et al. Continual image deraining with hypergraph convolutional networks
CN110796110A (zh) 一种基于图卷积网络的人体行为识别方法及系统
CN115221369A (zh) 视觉问答的实现方法和基于视觉问答检验模型的方法
CN111401132B (zh) 监控场景下高层语义指导的行人属性识别方法
CN108549844A (zh) 一种基于多层分形网络和关节亲属模式的多人姿态估计方法
CN115546888B (zh) 一种基于身体部位分组的对称语义图卷积姿态估计方法
Chao et al. Global graph propagation with hierarchical information transfer for incomplete contrastive multi-view clustering
CN111461063A (zh) 一种基于图卷积和胶囊神经网络的行为识别方法
CN114373224B (zh) 基于自监督学习的模糊3d骨架动作识别方法及装置
CN116740527A (zh) U型网络与自注意力机制结合的遥感图像变化检测方法
CN118674778A (zh) 基于多尺度时空编码器网络的三维人体姿态估计方法
CN111079851B (zh) 基于强化学习和双线性卷积网络的车型识别方法
CN117935362A (zh) 基于异构骨架图的人体行为识别方法及系统
CN112801138A (zh) 基于人体拓扑结构对齐的多人姿态估计方法
CN118506452A (zh) 一种基于时空重聚合图卷积网络的骨架行为识别方法
Zhao et al. Human action recognition based on improved fusion attention CNN and RNN
CN116343338A (zh) 基于层次时空注意力网络的人体骨架动作识别方法
Ahsan et al. HRNetO: Human action recognition using unified deep features optimization framework
CN111339888A (zh) 基于关节点运动图的双人交互行为识别方法
CN111738074A (zh) 基于弱监督学习的行人属性识别方法、系统及装置

Legal Events

Date Code Title Description
WWE Wipo information: entry into national phase

Ref document number: 18715746

Country of ref document: US

121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 23941280

Country of ref document: EP

Kind code of ref document: A1

NENP Non-entry into the national phase

Ref country code: DE