WO2022126902A1 - 模型压缩方法、装置、电子设备及介质 - Google Patents

模型压缩方法、装置、电子设备及介质 Download PDF

Info

Publication number
WO2022126902A1
WO2022126902A1 PCT/CN2021/083080 CN2021083080W WO2022126902A1 WO 2022126902 A1 WO2022126902 A1 WO 2022126902A1 CN 2021083080 W CN2021083080 W CN 2021083080W WO 2022126902 A1 WO2022126902 A1 WO 2022126902A1
Authority
WO
WIPO (PCT)
Prior art keywords
data
compressed
model
preset
loss value
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
PCT/CN2021/083080
Other languages
English (en)
French (fr)
Inventor
成冠举
李葛
曾婵
高鹏
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Ping An Technology Shenzhen Co Ltd
Original Assignee
Ping An Technology Shenzhen Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Ping An Technology Shenzhen Co Ltd filed Critical Ping An Technology Shenzhen Co Ltd
Publication of WO2022126902A1 publication Critical patent/WO2022126902A1/zh
Anticipated expiration legal-status Critical
Ceased legal-status Critical Current

Links

Images

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/082Learning methods modifying the architecture, e.g. adding, deleting or silencing nodes or connections
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/045Combinations of networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/049Temporal neural networks, e.g. delay elements, oscillating neurons or pulsed inputs
    • YGENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
    • Y02TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
    • Y02TCLIMATE CHANGE MITIGATION TECHNOLOGIES RELATED TO TRANSPORTATION
    • Y02T90/00Enabling technologies or technologies with a potential or indirect contribution to GHG emissions mitigation

Definitions

  • the long short-term memory network can train the mapping of the random noise from Gaussian distribution to fitting distribution, and at the same time, in order to prevent the occurrence of over-fitting, a dropout mechanism is added to each layer of neural network of the long short-term memory network.
  • the activation function may be a tanh function, and the tanh function is used to compress the data in the fitting data set between -1 and 1, so that the vectorization operation can be performed subsequently.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Data Mining & Analysis (AREA)
  • General Health & Medical Sciences (AREA)
  • Biomedical Technology (AREA)
  • Biophysics (AREA)
  • Computational Linguistics (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Evolutionary Computation (AREA)
  • Artificial Intelligence (AREA)
  • Molecular Biology (AREA)
  • Computing Systems (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Mathematical Physics (AREA)
  • Software Systems (AREA)
  • Health & Medical Sciences (AREA)
  • Management, Administration, Business Operations System, And Electronic Commerce (AREA)

Abstract

一种模型压缩方法、装置、电子设备及存储介质,涉及数据处理技术,所述方法包括:利用预先构建的拟合器对随机噪声数据进行数据拟合,得到仿真数据并计算仿真数据和噪声数据的激活损失值,在激活损失值大于预设的激活阈值时,调整所述拟合器的参数,直到激活损失值小于或等于预设的激活阈值,将仿真数据输入至待压缩模型中得到输出数据;计算输出数据和仿真数据的稀疏损失值,在稀疏损失值大于预设的稀疏阈值时,调整拟合器的内部参数,直到稀疏损失值小于或者等于预设的稀疏阈值,输出仿真数据并对待压缩模型进行压缩,得到压缩后的模型。所述方法、装置、电子设备及存储介质不需要获取训练数据、网络结构和参数等,就能实现模型的压缩。

Description

模型压缩方法、装置、电子设备及介质
本申请要求于2020年12月18日提交中国专利局、申请号为202011501677.5,发明名称为“模型压缩方法、装置、电子设备及介质”的中国专利申请的优先权,其全部内容通过引用结合在本申请中。
技术领域
本申请涉及数据处理领域,尤其涉及一种模型压缩方法、装置、电子设备及计算机可读存储介质。
背景技术
大数据时代深度学习模型运用的越来越频繁,为了将深度学习模型应用到移动设备、传感器等小型设备,有时必须将深度学习模型进行压缩裁剪才能部署到小型设备。
发明人意识到,目前主流的深度学习压缩方法都要基于原始训练数据集、网络结构、参数等进行模型的压缩,如知识蒸馏方法和基于元数据的方法,前者需要大量的原始训练数据,而后者需要模型的网络结构和参数,但由于法律、隐私等原因,训练数据、网络结构和参数通常很难获取到。
发明内容
本申请提供的一种模型压缩方法,包括:
利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据;
利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值,在所述激活损失值大于预设的激活阈值时,调整所述拟合器的参数并返回利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据,直到所述激活损失值小于或等于预设的激活阈值时,将所述仿真数据输入至待压缩模型中,得到输出数据;
利用预设的第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值,在所述稀疏损失值大于预设的稀疏阈值时,调整所述拟合器的内部参数并返回利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据,直到所述稀疏损失值小于或者等于预设的稀疏阈值时,输出所述仿真数据;
根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型。
本申请还提供一种模型压缩装置,所述装置包括:
数据拟合模块,用于利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据;
激活损失模块,用于利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值,在所述激活损失值大于预设的激活阈值时,调整所述拟合器的参数,直到所述激活损失值小于或等于预设的激活阈值时,将所述仿真数据输入至待压缩模型中,得到输出数据;
稀疏损失模块,用于利用预设的第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值,在所述稀疏损失值大于预设的稀疏阈值时,调整所述拟合器的内部参数,直到所述稀疏损失值小于或者等于预设的稀疏阈值时,输出所述仿真数据;
模型压缩模块,用于根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型。
本申请还提供一种电子设备,所述电子设备包括:
至少一个处理器;以及,
与所述至少一个处理器通信连接的存储器;其中,
所述存储器存储有可被所述至少一个处理器执行的指令,所述指令被所述至少一个处理器执行,以使所述至少一个处理器能够执行如下所述的模型压缩方法:
利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据;
利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值,在所述激活损失值大于预设的激活阈值时,调整所述拟合器的参数并返回利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据,直到所述激活损失值小于或等于预设的激活阈值时,将所述仿真数据输入至待压缩模型中,得到输出数据;
利用预设的第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值,在所述稀疏损失值大于预设的稀疏阈值时,调整所述拟合器的内部参数并返回利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据,直到所述稀疏损失值小于或者等于预设的稀疏阈值时,输出所述仿真数据;
根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型。
本申请还提供一种计算机可读存储介质,存储有计算机程序,所述计算机程序被处理器执行时实现如下所述的模型压缩方法:
利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据;
利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值,在所述激活损失值大于预设的激活阈值时,调整所述拟合器的参数并返回利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据,直到所述激活损失值小于或等于预设的激活阈值时,将所述仿真数据输入至待压缩模型中,得到输出数据;
利用预设的第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值,在所述稀疏损失值大于预设的稀疏阈值时,调整所述拟合器的内部参数并返回利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据,直到所述稀疏损失值小于或者等于预设的稀疏阈值时,输出所述仿真数据;
根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型。
附图说明
图1为本申请一实施例提供的模型压缩方法的流程示意图;
图2为本申请一实施例提供的模型压缩装置的模块示意图;
图3为本申请一实施例提供的实现模型压缩方法的电子设备的内部结构示意图;
本申请目的的实现、功能特点及优点将结合实施例,参照附图做进一步说明。
具体实施方式
应当理解,此处所描述的具体实施例仅仅用以解释本申请,并不用于限定本申请。
本申请实施例提供一种模型压缩方法。所述模型压缩方法的执行主体包括但不限于服务端、终端等能够被配置为执行本申请实施例提供的该方法的电子设备中的至少一种。换言之,所述模型压缩方法可以由安装在终端设备或服务端设备的软件或硬件来执行,所述软件可以是区块链平台。所述服务端包括但不限于:单台服务器、服务器集群、云端服务器或云端服务器集群等。
参照图1所示,为本申请实施例提供的一种模型压缩方法的流程示意图。在本实施例中,所述模型压缩方法包括:
S1、利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据。
本申请实施例中,所述随机噪声数据是从高斯分布中采样得到的随机高斯噪音。所述拟合器是将噪声数据不断进行线性拟合处理,生成逼近于真实数据的仿真数据。
具体地,所述利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据,包括:
利用所述拟合器中的长短期记忆网络对所述噪声数据进行预测,得到拟合数据集;
利用激活函数对所述拟合数据集进行压缩,得到压缩数据集;
对所述压缩数据集进行向量化处理,得到仿真数据。
其中,所述长短期记忆网络可以训练所述随机噪音从高斯分布到拟合分布的映射,同时为了防止过拟合的发生,所述长短期记忆网络的每一层神经网络会增加dropout机制。所述激活函数可以是tanh函数,利用所述tanh函数将所述拟合数据集中的数据压缩到-1到1之间,以便后续进行向量化操作。
进一步地,所述对所述压缩数据集进行向量化处理,得到仿真数据,包括:
利用Word2Vec算法将所述压缩数据集中的压缩数据映射为特征向量;
按照所述特征向量的序列对所述特征向量进行拼接,得到所述仿真数据。
其中,所述Word2Vec算法可以将数据映射为统一维度的向量,所述Word2Vec算法适用于在对于一个序列的数据且序列局部数据间存在着很强的关联的情况,可以用来对数据进行更泛化的分析。
详细地,利用预先构建的拟合器对随机噪声数据进行数据拟合操作,可以得到一个与所述随机噪声数据接近的仿真数据,用于代替所述随机噪声数据进行后续的模型压缩。
S2、利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值。
本申请实施例中,所述第一损失函数:
Figure PCTCN2021083080-appb-000001
其中,
Figure PCTCN2021083080-appb-000002
为所述激活损失值,n为所述噪声数据的样本数,
Figure PCTCN2021083080-appb-000003
为所述仿真数据中的第m个数据,|| ||1是L1范数。L1范数主要是为了获得稀疏性,加上负号是为了尽量不稀疏,让
Figure PCTCN2021083080-appb-000004
尽可能多的被激活。
在所述激活损失值大于预设的激活阈值时,本申请实施例调整所述拟合器的参数并返回上述的S1,重新利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据。
优选地,所述拟合器的参数可以是拟合器的权重、梯度等。
在所述激活损失值小于或等于预设的激活阈值时,执行S3、将所述仿真数据输入至待压缩模型中,得到输出数据。
其中,所述第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值,将所述激活损失值和预设的激活阈值进行比较,进而调整所述拟合器的参数,直至所述仿真数据和所述噪声数据之间的激活损失值收敛,此时调整得到的拟合器符合标准,无需再调整其参数。
S4、利用预设的第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值。
本申请实施例中,所述第二损失函数可以是
Figure PCTCN2021083080-appb-000005
其中,
Figure PCTCN2021083080-appb-000006
为所述稀疏损失值,x为所述仿真数据的样本数,
Figure PCTCN2021083080-appb-000007
是所述输出数据中的第m个数据,t m为预设的参数,
Figure PCTCN2021083080-appb-000008
为softmax损失函数。
在所述稀疏损失值大于预设的稀疏阈值时,本申请实施例调整所述拟合器的内部参数并返回上述的S1,利用预先构建的拟合器重新对随机噪声数据进行数据拟合操作,得到仿真数据。
在所述稀疏损失值小于或者等于预设的稀疏阈值时,执行S5,输出所述仿真数据,并根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型。
本申请实施例中,所述根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型,包括:
将所述仿真数据输入至预设的标准压缩模型中进行向量运算,得到所述标准压缩模型输出的第一特征,将所述仿真数据输入至所述待压缩模型中进行向量运算,得到所述待压缩模型输出的第二特征;
根据所述第一特征和所述第二特征确定所述待压缩模型的损失函数;
根据所述损失函数对所述待压缩模型进行反向传播,得到压缩后的模型。
具体地,所述根据所述第一特征和所述第二特征确定所述待压缩模型的损失函数,包括:
根据所述第一特征和所述第二特征进行求差计算,得到差值函数;
将所述差值函数进行范数转换处理并求其平方,得到损失函数。
如图2所示,是本申请模型压缩装置的模块示意图。
本申请所述模型压缩装置100可以安装于电子设备中。根据实现的功能,所述模型压缩装置100可以包括数据拟合模块101、激活损失模块102、稀疏损失模块103、模型压缩模块104。本申请所述模块也可以称之为单元,是指一种能够被电子设备处理器所执行,并且能够完成固定功能的一系列计算机程序段,其存储在电子设备的存储器中。
在本实施例中,关于各模块/单元的功能如下:
所述数据拟合模块101,用于利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据;
所述激活损失模块102,用于利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值,在所述激活损失值大于预设的激活阈值时,调整所述拟合器的参数,直到所述激活损失值小于或等于预设的激活阈值时,将所述仿真数据输入至待压缩模型中,得到输出数据;
所述稀疏损失模块103,用于利用预设的第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值,在所述稀疏损失值大于预设的稀疏阈值时,调整所述拟合器的内部参数,直到所述稀疏损失值小于或者等于预设的稀疏阈值时,输出所述仿真数据;
所述模型压缩模块104,用于根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型。
详细地,所述模型压缩装置100中的各模块由电子设备的处理器所执行时,可以实现一种模型压缩方法,所述模型压缩方法的具体实施步骤如下:
步骤一、所述数据拟合模块101利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据。
本申请实施例中,所述随机噪声数据是从高斯分布中采样得到的随机高斯噪音。所述拟合器是将噪声数据不断进行线性拟合处理,生成逼近于真实数据的仿真数据。
具体地,所述数据拟合模块101利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据,包括:
利用所述拟合器中的长短期记忆网络对所述噪声数据进行预测,得到拟合数据集;
利用激活函数对所述拟合数据集进行压缩,得到压缩数据集;
对所述压缩数据集进行向量化处理,得到仿真数据。
其中,所述长短期记忆网络可以训练所述随机噪音从高斯分布到拟合分布的映射,同时为了防止过拟合的发生,所述长短期记忆网络的每一层神经网络会增加dropout机制。所述激活函数可以是tanh函数,利用所述tanh函数将所述拟合数据集中的数据压缩到-1到1之间,以便后续进行向量化操作。
进一步地,所述对所述压缩数据集进行向量化处理,得到仿真数据,包括:
利用Word2Vec算法将所述压缩数据集中的压缩数据映射为特征向量;
按照所述特征向量的序列对所述特征向量进行拼接,得到所述仿真数据。
步骤二、所述激活损失模块102利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值。
本申请实施例中,所述第一损失函数:
Figure PCTCN2021083080-appb-000009
其中,
Figure PCTCN2021083080-appb-000010
为所述激活损失值,n为所述噪声数据的样本数,
Figure PCTCN2021083080-appb-000011
为所述仿真数据中的第m个数据,|| ||1是L1范数。L1范数主要是为了获得稀疏性,加上负号是为了尽量不稀疏,让
Figure PCTCN2021083080-appb-000012
尽可能多的被激活。
在所述激活损失值大于预设的激活阈值时,本申请实施例调整所述拟合器的参数并返回上述的步骤一,重新利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据。
优选地,所述拟合器的参数可以是拟合器的权重、梯度等。
在所述激活损失值小于或等于预设的激活阈值时,执行步骤三、将所述仿真数据输入至待压缩模型中,得到输出数据。
步骤四、所述稀疏损失模块103利用预设的第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值。
本申请实施例中,所述第二损失函数可以是
Figure PCTCN2021083080-appb-000013
其中,
Figure PCTCN2021083080-appb-000014
为所述稀疏损失值,x为所述仿真数据的样本数,
Figure PCTCN2021083080-appb-000015
是所述输出数据中的第m个数据,t m为预设的参数,
Figure PCTCN2021083080-appb-000016
为softmax损失函数。
在所述稀疏损失值大于预设的稀疏阈值时,本申请实施例调整所述拟合器的内部参数并返回上述的步骤一,利用预先构建的拟合器重新对随机噪声数据进行数据拟合操作,得到仿真数据。
在所述稀疏损失值小于或者等于预设的稀疏阈值时,执行步骤五,输出所述仿真数据,并根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型。
本申请实施例中,所述根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型,包括:
将所述仿真数据输入至预设的标准压缩模型中进行向量运算,得到所述标准压缩模型输出的第一特征,将所述仿真数据输入至所述待压缩模型中进行向量运算,得到所述待压缩模型输出的第二特征;
根据所述第一特征和所述第二特征确定所述待压缩模型的损失函数;
根据所述损失函数对所述待压缩模型进行反向传播,得到压缩后的模型。
具体地,所述根据所述第一特征和所述第二特征确定所述待压缩模型的损失函数,包括:
根据所述第一特征和所述第二特征进行求差计算,得到差值函数;
将所述差值函数进行范数转换处理并求其平方,得到损失函数。
如图3所示,是本申请实现模型压缩方法的电子设备的结构示意图。
所述电子设备1可以包括处理器10、存储器11和总线,还可以包括存储在所述存储器11中并可在所述处理器10上运行的计算机程序,如模型压缩程序12。
其中,所述存储器11至少包括一种类型的可读存储介质,所述可读存储介质可以是易失性的,也可以是非易失性的。具体的,所述可读存储介质包括闪存、移动硬盘、多媒体卡、卡型存储器(例如:SD或DX存储器等)、磁性存储器、磁盘、光盘等。所述存储器11在一些实施例中可以是电子设备1的内部存储单元,例如该电子设备1的移动硬盘。所述存储器11在另一些实施例中也可以是电子设备1的外部存储设备,例如电子设备1上配备的插接式移动硬盘、智能存储卡(SmartMediaCard,SMC)、安全数字(SecureDigital,SD)卡、闪存卡(FlashCard)等。进一步地,所述存储器11还可以既包括电子设备1的内部存储单元也包括外部存储设备。所述存储器11不仅可以用于存储安装于电子设备1的应用软件及各类数据,例如模型压缩程序12的代码等,还可以用于暂时地存储已经输出或者将要输出的数据。
所述处理器10在一些实施例中可以由集成电路组成,例如可以由单个封装的集成电路所组成,也可以是由多个相同功能或不同功能封装的集成电路所组成,包括一个或者多个中央处理器(CentralProcessingunit,CPU)、微处理器、数字处理芯片、图形处理器及各种控制芯片的组合等。所述处理器10是所述电子设备的控制核心(ControlUnit),利用各种接口和线路连接整个电子设备的各个部件,通过运行或执行存储在所述存储器11内的程序或者模块(例如执行模型压缩程序等),以及调用存储在所述存储器11内的数据,以执行电子设备1的各种功能和处理数据。
所述总线可以是外设部件互连标准(peripheralcomponentinterconnect,简称PCI)总线或扩展工业标准结构(extendedindustrystandardarchitecture,简称EISA)总线等。该总线可以分为地址总线、数据总线、控制总线等。所述总线被设置为实现所述存储器11以及至少一个处理器10等之间的连接通信。
图3仅示出了具有部件的电子设备,本领域技术人员可以理解的是,图3示出的结构并不构成对所述电子设备1的限定,可以包括比图示更少或者更多的部件,或者组合某些部件,或者不同的部件布置。
例如,尽管未示出,所述电子设备1还可以包括给各个部件供电的电源(比如电池),优选地,电源可以通过电源管理装置与所述至少一个处理器10逻辑相连,从而通过电源管理装置实现充电管理、放电管理、以及功耗管理等功能。电源还可以包括一个或一个以上的直流或交流电源、再充电装置、电源故障检测电路、电源转换器或者逆变器、电源状态指示器等任意组件。所述电子设备1还可以包括多种传感器、蓝牙模块、Wi-Fi模块等,在此不再赘述。
进一步地,所述电子设备1还可以包括网络接口,可选地,所述网络接口可以包括有线接口和/或无线接口(如WI-FI接口、蓝牙接口等),通常用于在该电子设备1与其他电子设备之间建立通信连接。
可选地,该电子设备1还可以包括用户接口,用户接口可以是显示器(Display)、输入单元(比如键盘(Keyboard)),可选地,用户接口还可以是标准的有线接口、无线接口。可选地,在一些实施例中,显示器可以是LED显示器、液晶显示器、触控式液晶显示器以及OLED(OrganicLight-EmittingDiode,有机发光二极管)触摸器等。其中,显示器也可以适当的称为显示屏或显示单元,用于显示在电子设备1中处理的信息以及用于显示可视化的用户界面。
应该了解,所述实施例仅为说明之用,在专利申请范围上并不受此结构的限制。
所述电子设备1中的所述存储器11存储的模型压缩程序12是多个指令的组合,在所述处理器10中运行时,可以实现:
利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据;
利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值,在所述激活损失值大于预设的激活阈值时,调整所述拟合器的参数并返回利用预先构建的拟合 器对随机噪声数据进行数据拟合操作,得到仿真数据,直到所述激活损失值小于或等于预设的激活阈值时,将所述仿真数据输入至待压缩模型中,得到输出数据;
利用预设的第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值,在所述稀疏损失值大于预设的稀疏阈值时,调整所述拟合器的内部参数并返回利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据,直到所述稀疏损失值小于或者等于预设的稀疏阈值时,输出所述仿真数据;
根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型。
进一步地,所述电子设备1集成的模块/单元如果以软件功能单元的形式实现并作为独立的产品销售或使用时,可以存储在一个计算机可读存储介质中。所述计算机可读存储介质可以是易失性的,也可以是非易失性的,例如,所述计算机可读介质可以包括:能够携带所述计算机程序代码的任何实体或装置、记录介质、U盘、移动硬盘、磁碟、光盘、计算机存储器、只读存储器(ROM,Read-OnlyMemory)。
本申请还提供一种计算机可读存储介质,所述可读存储介质,所述可读存储介质存储有计算机程序,所述计算机程序在被电子设备的处理器所执行时,可以实现:
利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据;
利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值,在所述激活损失值大于预设的激活阈值时,调整所述拟合器的参数并返回利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据,直到所述激活损失值小于或等于预设的激活阈值时,将所述仿真数据输入至待压缩模型中,得到输出数据;
利用预设的第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值,在所述稀疏损失值大于预设的稀疏阈值时,调整所述拟合器的内部参数并返回利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据,直到所述稀疏损失值小于或者等于预设的稀疏阈值时,输出所述仿真数据;
根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型。
进一步地,所述计算机可用存储介质可主要包括存储程序区和存储数据区,其中,存储程序区可存储操作系统、至少一个功能所需的应用程序等;存储数据区可存储根据区块链节点的使用所创建的数据等。
在本申请所提供的几个实施例中,应该理解到,所揭露的设备,装置和方法,可以通过其它的方式实现。例如,以上所描述的装置实施例仅仅是示意性的,例如,所述模块的划分,仅仅为一种逻辑功能划分,实际实现时可以有另外的划分方式。
所述作为分离部件说明的模块可以是或者也可以不是物理上分开的,作为模块显示的部件可以是或者也可以不是物理单元,即可以位于一个地方,或者也可以分布到多个网络单元上。可以根据实际的需要选择其中的部分或者全部模块来实现本实施例方案的目的。
另外,在本申请各个实施例中的各功能模块可以集成在一个处理单元中,也可以是各个单元单独物理存在,也可以两个或两个以上单元集成在一个单元中。上述集成的单元既可以采用硬件的形式实现,也可以采用硬件加软件功能模块的形式实现。
对于本领域技术人员而言,显然本申请不限于上述示范性实施例的细节,而且在不背离本申请的精神或基本特征的情况下,能够以其他的具体形式实现本申请。
因此,无论从哪一点来看,均应将实施例看作是示范性的,而且是非限制性的,本申请的范围由所附权利要求而不是上述说明限定,因此旨在将落在权利要求的等同要件的含义和范围内的所有变化涵括在本申请内。不应将权利要求中的任何附关联图表记视为限制所涉及的权利要求。
此外,显然“包括”一词不排除其他单元或步骤,单数不排除复数。系统权利要求中陈述的多个单元或装置也可以由一个单元或装置通过软件或者硬件来实现。第二等词语用来表示名称,而并不表示任何特定的顺序。
最后应说明的是,以上实施例仅用以说明本申请的技术方案而非限制,尽管参照较佳实施例对本申请进行了详细说明,本领域的普通技术人员应当理解,可以对本申请的技术方案进行修改或等同替换,而不脱离本申请技术方案的精神和范围。

Claims (20)

  1. 一种模型压缩方法,其中,所述方法包括:
    步骤A:利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据;
    步骤B:利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值,在所述激活损失值大于预设的激活阈值时,调整所述拟合器的参数并返回上述的步骤A,直到所述激活损失值小于或等于预设的激活阈值时,将所述仿真数据输入至待压缩模型中,得到输出数据;
    步骤C:利用预设的第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值,在所述稀疏损失值大于预设的稀疏阈值时,调整所述拟合器的内部参数并返回上述的步骤A,直到所述稀疏损失值小于或者等于预设的稀疏阈值时,输出所述仿真数据;
    步骤D:根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型。
  2. 如权利要求1所述的模型压缩方法,其中,所述利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据,包括:
    利用所述拟合器中的长短期记忆网络对所述噪声数据进行预测,得到拟合数据集;
    利用激活函数对所述拟合数据集进行压缩,得到压缩数据集;
    对所述压缩数据集进行向量化处理,得到仿真数据。
  3. 如权利要求2所述的模型压缩方法,其中,所述对所述压缩数据集进行向量化处理,得到仿真数据,包括:
    利用Word2Vec算法将所述压缩数据集中的压缩数据映射为特征向量;
    按照所述特征向量的序列对所述特征向量进行拼接,得到所述仿真数据。
  4. 如权利要求1所述的模型压缩方法,其中,所述利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值,包括:
    利用下述第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值:
    Figure PCTCN2021083080-appb-100001
    其中,
    Figure PCTCN2021083080-appb-100002
    为所述激活损失值,n为所述噪声数据的样本数,
    Figure PCTCN2021083080-appb-100003
    为所述仿真数据中的第m个数据,||||1是L1范数。
  5. 如权利要求1所述的模型压缩方法,其中,所述利用预设的第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值,包括:
    利用下述第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值:
    Figure PCTCN2021083080-appb-100004
    其中,
    Figure PCTCN2021083080-appb-100005
    为所述稀疏损失值,x为所述仿真数据的样本数,
    Figure PCTCN2021083080-appb-100006
    是所述输出数据中的第m个数据,t m为预设的参数,
    Figure PCTCN2021083080-appb-100007
    为softmax损失函数。
  6. 如权利要求1至5中任意一项所述的模型压缩方法,其中,所述根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型,包括:
    将所述仿真数据输入至预设的标准压缩模型中进行向量运算,得到所述标准压缩模型输出的第一特征,将所述仿真数据输入至所述待压缩模型中进行向量运算,得到所述待压缩模型输出的第二特征;
    根据所述第一特征和所述第二特征确定所述待压缩模型的损失函数;
    根据所述损失函数对所述待压缩模型进行反向传播,得到压缩后的模型。
  7. 如权利要求6所述的模型压缩方法,其中,所述根据所述第一特征和所述第二特征确定所述待压缩模型的损失函数,包括:
    根据所述第一特征和所述第二特征进行求差计算,得到差值函数;
    将所述差值函数进行范数转换处理并求其平方,得到损失函数。
  8. 一种模型压缩装置,其中,所述装置包括:
    数据拟合模块,用于利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据;
    激活损失模块,用于利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值,在所述激活损失值大于预设的激活阈值时,调整所述拟合器的参数,直到所述激活损失值小于或等于预设的激活阈值时,将所述仿真数据输入至待压缩模型中,得到输出数据;
    稀疏损失模块,用于利用预设的第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值,在所述稀疏损失值大于预设的稀疏阈值时,调整所述拟合器的内部参数,直到所述稀疏损失值小于或者等于预设的稀疏阈值时,输出所述仿真数据;
    模型压缩模块,用于根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型。
  9. 一种电子设备,其中,所述电子设备包括:
    至少一个处理器;以及,
    与所述至少一个处理器通信连接的存储器;其中,
    所述存储器存储有可被所述至少一个处理器执行的指令,所述指令被所述至少一个处理器执行,以使所述至少一个处理器能够执行如下所述的模型压缩方法:
    步骤A:利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据;
    步骤B:利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值,在所述激活损失值大于预设的激活阈值时,调整所述拟合器的参数并返回上述的步骤A,直到所述激活损失值小于或等于预设的激活阈值时,将所述仿真数据输入至待压缩模型中,得到输出数据;
    步骤C:利用预设的第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值,在所述稀疏损失值大于预设的稀疏阈值时,调整所述拟合器的内部参数并返回上述的步骤A,直到所述稀疏损失值小于或者等于预设的稀疏阈值时,输出所述仿真数据;
    步骤D:根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型。
  10. 如权利要求9所述的电子设备,其中,所述利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据,包括:
    利用所述拟合器中的长短期记忆网络对所述噪声数据进行预测,得到拟合数据集;
    利用激活函数对所述拟合数据集进行压缩,得到压缩数据集;
    对所述压缩数据集进行向量化处理,得到仿真数据。
  11. 如权利要求10所述的电子设备,其中,所述对所述压缩数据集进行向量化处理,得到仿真数据,包括:
    利用Word2Vec算法将所述压缩数据集中的压缩数据映射为特征向量;
    按照所述特征向量的序列对所述特征向量进行拼接,得到所述仿真数据。
  12. 如权利要求9所述的电子设备,其中,所述利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值,包括:
    利用下述第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值:
    Figure PCTCN2021083080-appb-100008
    其中,
    Figure PCTCN2021083080-appb-100009
    为所述激活损失值,n为所述噪声数据的样本数,
    Figure PCTCN2021083080-appb-100010
    为所述仿真数据中的第m个数据,||||1是L1范数。
  13. 如权利要求9所述的电子设备,其中,所述利用预设的第二损失函数计算所述输 出数据和所述仿真数据之间的稀疏损失值,包括:
    利用下述第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值:
    Figure PCTCN2021083080-appb-100011
    其中,
    Figure PCTCN2021083080-appb-100012
    为所述稀疏损失值,x为所述仿真数据的样本数,
    Figure PCTCN2021083080-appb-100013
    是所述输出数据中的第m个数据,t m为预设的参数,
    Figure PCTCN2021083080-appb-100014
    为softmax损失函数。
  14. 如权利要求9至13中任意一项所述的电子设备,其中,所述根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型,包括:
    将所述仿真数据输入至预设的标准压缩模型中进行向量运算,得到所述标准压缩模型输出的第一特征,将所述仿真数据输入至所述待压缩模型中进行向量运算,得到所述待压缩模型输出的第二特征;
    根据所述第一特征和所述第二特征确定所述待压缩模型的损失函数;
    根据所述损失函数对所述待压缩模型进行反向传播,得到压缩后的模型。
  15. 一种计算机可读存储介质,存储有计算机程序,其中,所述计算机程序被处理器执行时实现如下所述的模型压缩方法:
    步骤A:利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据;
    步骤B:利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值,在所述激活损失值大于预设的激活阈值时,调整所述拟合器的参数并返回上述的步骤A,直到所述激活损失值小于或等于预设的激活阈值时,将所述仿真数据输入至待压缩模型中,得到输出数据;
    步骤C:利用预设的第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值,在所述稀疏损失值大于预设的稀疏阈值时,调整所述拟合器的内部参数并返回上述的步骤A,直到所述稀疏损失值小于或者等于预设的稀疏阈值时,输出所述仿真数据;
    步骤D:根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型。
  16. 如权利要求15所述的计算机可读存储介质,其中,所述利用预先构建的拟合器对随机噪声数据进行数据拟合操作,得到仿真数据,包括:
    利用所述拟合器中的长短期记忆网络对所述噪声数据进行预测,得到拟合数据集;
    利用激活函数对所述拟合数据集进行压缩,得到压缩数据集;
    对所述压缩数据集进行向量化处理,得到仿真数据。
  17. 如权利要求16所述的计算机可读存储介质,其中,所述对所述压缩数据集进行向量化处理,得到仿真数据,包括:
    利用Word2Vec算法将所述压缩数据集中的压缩数据映射为特征向量;
    按照所述特征向量的序列对所述特征向量进行拼接,得到所述仿真数据。
  18. 如权利要求15所述的计算机可读存储介质,其中,所述利用预设的第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值,包括:
    利用下述第一损失函数计算所述仿真数据和所述噪声数据之间的激活损失值:
    Figure PCTCN2021083080-appb-100015
    其中,
    Figure PCTCN2021083080-appb-100016
    为所述激活损失值,n为所述噪声数据的样本数,
    Figure PCTCN2021083080-appb-100017
    为所述仿真数据中的第m个数据,||||1是L1范数。
  19. 如权利要求15所述的计算机可读存储介质,其中,所述利用预设的第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值,包括:
    利用下述第二损失函数计算所述输出数据和所述仿真数据之间的稀疏损失值:
    Figure PCTCN2021083080-appb-100018
    其中,
    Figure PCTCN2021083080-appb-100019
    为所述稀疏损失值,x为所述仿真数据的样本数,
    Figure PCTCN2021083080-appb-100020
    是所述输出数据中的第m个数据,t m为预设的参数,
    Figure PCTCN2021083080-appb-100021
    为softmax损失函数。
  20. 如权利要求15至19中任意一项所述的计算机可读存储介质,其中,所述根据所述仿真数据对所述待压缩模型进行压缩处理,得到压缩后的模型,包括:
    将所述仿真数据输入至预设的标准压缩模型中进行向量运算,得到所述标准压缩模型输出的第一特征,将所述仿真数据输入至所述待压缩模型中进行向量运算,得到所述待压缩模型输出的第二特征;
    根据所述第一特征和所述第二特征确定所述待压缩模型的损失函数;
    根据所述损失函数对所述待压缩模型进行反向传播,得到压缩后的模型。
PCT/CN2021/083080 2020-12-18 2021-03-25 模型压缩方法、装置、电子设备及介质 Ceased WO2022126902A1 (zh)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
CN202011501677.5 2020-12-18
CN202011501677.5A CN112465141B (zh) 2020-12-18 2020-12-18 模型压缩方法、装置、电子设备及介质

Publications (1)

Publication Number Publication Date
WO2022126902A1 true WO2022126902A1 (zh) 2022-06-23

Family

ID=74803596

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/CN2021/083080 Ceased WO2022126902A1 (zh) 2020-12-18 2021-03-25 模型压缩方法、装置、电子设备及介质

Country Status (2)

Country Link
CN (1) CN112465141B (zh)
WO (1) WO2022126902A1 (zh)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN115269940A (zh) * 2022-09-30 2022-11-01 佳卓智能科技(南通)有限责任公司 一种erp管理系统的数据压缩方法

Families Citing this family (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN112465141B (zh) * 2020-12-18 2024-06-28 平安科技(深圳)有限公司 模型压缩方法、装置、电子设备及介质
CN112508194B (zh) * 2021-02-02 2022-03-18 支付宝(杭州)信息技术有限公司 模型压缩方法、系统和计算设备

Citations (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20190392323A1 (en) * 2018-06-22 2019-12-26 Moffett AI, Inc. Neural network acceleration and embedding compression systems and methods with activation sparsification
CN110874550A (zh) * 2018-08-31 2020-03-10 华为技术有限公司 数据处理方法、装置、设备和系统
CN111612143A (zh) * 2020-05-22 2020-09-01 中国科学院自动化研究所 深度卷积神经网络的压缩方法及系统
CN112465141A (zh) * 2020-12-18 2021-03-09 平安科技(深圳)有限公司 模型压缩方法、装置、电子设备及介质

Family Cites Families (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN108564129B (zh) * 2018-04-24 2020-09-08 电子科技大学 一种基于生成对抗网络的轨迹数据分类方法
CN109063742B (zh) * 2018-07-06 2023-04-18 平安科技(深圳)有限公司 蝴蝶识别网络构建方法、装置、计算机设备及存储介质
CN109784474B (zh) * 2018-12-24 2020-12-11 宜通世纪物联网研究院(广州)有限公司 一种深度学习模型压缩方法、装置、存储介质及终端设备
CN109919864A (zh) * 2019-02-20 2019-06-21 重庆邮电大学 一种基于稀疏去噪自编码网络的图像压缩感知方法
EP3716158A3 (en) * 2019-03-25 2020-11-25 Nokia Technologies Oy Compressing weight updates for decoder-side neural networks
CN111814962B (zh) * 2020-07-09 2024-05-10 平安科技(深圳)有限公司 识别模型的参数获取方法、装置、电子设备及存储介质

Patent Citations (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20190392323A1 (en) * 2018-06-22 2019-12-26 Moffett AI, Inc. Neural network acceleration and embedding compression systems and methods with activation sparsification
CN110874550A (zh) * 2018-08-31 2020-03-10 华为技术有限公司 数据处理方法、装置、设备和系统
CN111612143A (zh) * 2020-05-22 2020-09-01 中国科学院自动化研究所 深度卷积神经网络的压缩方法及系统
CN112465141A (zh) * 2020-12-18 2021-03-09 平安科技(深圳)有限公司 模型压缩方法、装置、电子设备及介质

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN115269940A (zh) * 2022-09-30 2022-11-01 佳卓智能科技(南通)有限责任公司 一种erp管理系统的数据压缩方法

Also Published As

Publication number Publication date
CN112465141A (zh) 2021-03-09
CN112465141B (zh) 2024-06-28

Similar Documents

Publication Publication Date Title
CN108520220B (zh) 模型生成方法和装置
CN111523640B (zh) 神经网络模型的训练方法和装置
WO2022007823A1 (zh) 一种文本数据处理方法及装置
WO2022116420A1 (zh) 语音事件检测方法、装置、电子设备及计算机存储介质
WO2022228425A1 (zh) 一种模型训练方法及装置
CN115269767B (zh) 模型训练方法、装置和存储介质
WO2022126902A1 (zh) 模型压缩方法、装置、电子设备及介质
CN113434683B (zh) 文本分类方法、装置、介质及电子设备
CN113228056B (zh) 运行时硬件模拟仿真方法、装置、设备及存储介质
CN113159284A (zh) 一种模型训练方法及装置
CN115146792A (zh) 多任务学习模型训练方法、装置、电子设备及存储介质
CN112784102A (zh) 视频检索方法、装置和电子设备
CN112949433B (zh) 视频分类模型的生成方法、装置、设备和存储介质
WO2022141867A1 (zh) 语音识别方法、装置、电子设备及可读存储介质
CN111859985B (zh) Ai客服模型测试方法、装置、电子设备及存储介质
CN113742069A (zh) 基于人工智能的容量预测方法、装置及存储介质
CN114385829A (zh) 知识图谱创建方法、装置、设备以及存储介质
CN116645554A (zh) 多模态医学报告检索方法、装置、电子设备及存储介质
CN115795025A (zh) 一种摘要生成方法及其相关设备
CN112269875B (zh) 文本分类方法、装置、电子设备及存储介质
CN112561500B (zh) 基于用户数据的薪酬数据生成方法、装置、设备及介质
CN116564322B (zh) 语音转换方法、装置、设备及存储介质
CN108154239A (zh) 一种机器学习方法及其装置
CN116362301A (zh) 一种模型的量化方法以及相关设备
CN115457451A (zh) 基于物联网的恒温恒湿试验箱的监控方法及装置

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 21904842

Country of ref document: EP

Kind code of ref document: A1

NENP Non-entry into the national phase

Ref country code: DE

122 Ep: pct application non-entry in european phase

Ref document number: 21904842

Country of ref document: EP

Kind code of ref document: A1