WO2015180368A1 - 一种半监督语音特征可变因素分解方法 - Google Patents

一种半监督语音特征可变因素分解方法 Download PDF

Info

Publication number
WO2015180368A1
WO2015180368A1 PCT/CN2014/088539 CN2014088539W WO2015180368A1 WO 2015180368 A1 WO2015180368 A1 WO 2015180368A1 CN 2014088539 W CN2014088539 W CN 2014088539W WO 2015180368 A1 WO2015180368 A1 WO 2015180368A1
Authority
WO
WIPO (PCT)
Prior art keywords
features
feature
loss function
speech
semi
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
PCT/CN2014/088539
Other languages
English (en)
French (fr)
Inventor
毛启容
黄正伟
薛文韬
詹永照
苟建平
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Jiangsu University
Original Assignee
Jiangsu University
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Jiangsu University filed Critical Jiangsu University
Publication of WO2015180368A1 publication Critical patent/WO2015180368A1/zh
Anticipated expiration legal-status Critical
Ceased legal-status Critical Current

Links

Images

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/08Speech classification or search
    • G10L15/16Speech classification or search using artificial neural networks

Definitions

  • Step 3 Semi-supervised feature learning based on convolutional neural network: using the locally invariant feature y as input to a semi-supervised learning algorithm, using a semi-supervised learning method based on convolutional neural networks, through four different loss functions
  • the local invariant feature y will be decomposed into four types of features; the four types of features include emotion-related features, gender-related features, age-related features, and other factor-related features including noise and language; the loss function of the semi-supervised learning It consists of four parts: reconstruction error function, discriminant loss function, orthogonal loss function and significant loss function.
  • Step one first convert the time domain signal into a spectral map, the window size is 20ms, with 10ms overlap; then using PCA dimensionality reduction and whitening, PCA has 60 principal components, and finally produces a 60 ⁇ n spectral map. A number of non-overlapping 60 ⁇ 15 patterns are extracted therefrom. For each 60 ⁇ 15 language spectrum, two sizes of spectral blocks are extracted therefrom, which are 60 ⁇ 6 and 60 ⁇ 10, respectively.

Landscapes

  • Engineering & Computer Science (AREA)
  • Artificial Intelligence (AREA)
  • Evolutionary Computation (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

本发明公开了一种半监督语音特征可变因素分解方法,把语音特征分成四类:情感相关特征、性别相关特征、年龄相关特征、包括噪声和语种的其他因素相关特征。首先,对语音进行预处理得到语谱图,不同尺寸的语谱块输入无监督特征学习网络SAE,预训练得到不同尺寸的卷积核,然后分别用不同尺寸的卷积核对整个语谱图进行卷积,得到若干特征映射图,再对特征映射图进行最大池化,最终把特征堆叠起来形成局部不变特征y。y作为半监督卷积神经网络的输入,通过最小化四个不同的损失函数项将y分解成四类特征。本发明解决了情感、性别、年龄语音特征相互混杂导致识别准确率不高的问题,可分别用于基于语音信号的不同识别需求,还可以用于分解更多因素。

Description

一种半监督语音特征可变因素分解方法 技术领域
本发明属于语音识别领域,具体涉及一种语音特征分解的方法。
背景技术
随着计算机渗透到生活的各个角落,各种类型的计算平台都需要更简便的输入媒体,语音当仁不让成为用户最佳的选择之一。一般来说,语音中包括了说话人、说话内容、说话人的情感、性别、年龄等多种信息。近年来,随着一些应用的不断完善,促进了对人的情感、性别、年龄、说话内容等方面的基于语音信号的识别技术的发展。比如传统的呼叫中心通常都会随机的接通服务生来为客户提供电话咨询,而不能够根据用户的情感、性别和年龄提供个性化的服务,这就促使了是否可以通过客户的声音来判断其情感、性别和年龄,并以此为依据提供更加个性化的语音服务。但是在现有的基于语音信号的情感、性别和年龄识别相关任务中,传统的特征提取方法所提取的特征往往掺杂了情感、性别、年龄、说话内容、语言等因素,彼此之间很难区分,从而导致识别效果不佳。
在Dong Yu等、名称为Feature Learning in Deep Neural Networks—Studies on Speech Recognition Tasks的论文中,利用深度神经网络学到一个深层特征,但这个特征可能混杂了很多因素,如情感、性别、年龄等因素,如果把这个特征用于语音情感识别,识别率可能会受特征中其他因素的影响。目前还未出现一种特征提取方法能分别提取语音信号中不同类型的特征。本发明为了克服现有技术的缺陷,通过基于卷积神经网络的半监督特征学习,将语音特征分解成四类:情感相关特征、性别相关特征、年龄相关特征、其他因素相关特征,可分别用于基于语音信号的不同识别需求。本发明进一步拓展以后还可以用于分解更多因素。
发明内容
本发明的目的在于提供一种半监督语音特征可变因素分解方法,使得分解出的特征不受与识别任务无关的因素的干扰,且更显著地体现识别目标类别之间的差异,从而提高识别的准确度。
为了解决以上技术问题,本发明首先对语音进行预处理得到语谱图,然后通过基于卷积神经网络的无监督学习得到局部不变特征,再采用一种半监督学习方法,通过重构误差函数、判别损失函数、正交损失函数、显著性损失函数四个损失函数的约束将无监督学习得到的局部不变特征,分解成四类:情感相关特征、 性别相关特征、年龄相关特征和其他因素相关特征,可分别用于情感识别、性别识别、年龄识别,能有效提高识别准确率。具体技术方案如下:
一种半监督语音特征可变因素分解方法,其特征在于包括下列步骤:
步骤一,预处理:对语音样本进行预处理得到语谱图,再采用PCA进行主成份分析降维以及白化,从中提取出不同尺寸的语谱块;
步骤二,无监督的局部不变特征学习:将所述语谱块作为无监督特征学习SAE的输入,通过输入不同尺寸的语谱块,预训练得到不同尺寸的卷积核,然后分别用所述不同尺寸的卷积核对整个语谱图进行卷积,得到若干特征映射图,再对所述特征映射图进行最大池化,最终把特征堆叠起来形成局部不变特征y;
步骤三,基于卷积神经网络的半监督特征学习:将所述局部不变特征y作为半监督学习算法的输入,利用基于卷积神经网络的半监督学习的方法,通过四个不同的损失函数将将局部不变特征y分解成四类特征;所述四类特征包括情感相关特征、性别相关特征、年龄相关特征、以及包括噪声和语种的其他因素相关特征;所述半监督学习的损失函数由重构误差函数、判别损失函数、正交损失函数、显著性损失函数四部分组成;
对于所述重构误差函数,所述四类特征都要参与重构局部不变特征y,误差采用均方误差;对于所述判别损失函数,先对有标签的数据进行类别预测,然后计算预测标签和真实标签之间的差异作为判别损失函数的值;对于所述正交损失函数,目的是使所述四类特征相互正交,表示输入局部不变特征y的不同的方向;对于所述显著性损失函数,目的是学习到仅体现识别目标类别之间的差异且更具有类别区分性的特征;通过最小化所述损失函数来获得四个损失函数的参数包括偏置和权重,从而得到所述四类特征。
本发明具有有益效果。本发明的半监督特征学习,通过将局部不变特征分解成情感相关特征、性别相关特征、年龄相关特征、其他因素相关特征共四类特征,使得不同类型的特征用于不同的识别需求,避免了不同类型特征之间相互干扰的缺点。特别是半监督学习的损失函数由重构误差函数、判别损失函数、正交损失函数、显著性损失函数四部分组成,使得所学习到的特征能更好地描述识别目标类别之间的差异,不受无关因素的干扰。本发明解决了不同的语音特征混杂在一起从而带来的识别率不高的问题,能有效地提高识别准确率。
附图说明
图1是语音特征分解流程图。
图2是无监督特征学习流程图。
图3是半监督语音特征分解结构图。
具体实施方式
图1给出了本发明方法的总体思路,首先,对语音进行预处理得到语谱图,不同尺寸的语谱块输入无监督特征学习网络SAE,预训练得到不同尺寸的卷积核,然后经过卷积、池化操作,形成局部不变特征y。y作为半监督卷积神经网络的输入,通过最小化四个不同的损失函数项将y分解成四类特征。
预处理后的语音信号被划分成li×hi大小的语谱块,i表示语谱块的个数,不同尺寸的语谱块输入无监督特征学习网络SAE,预训练得到不同尺寸的卷积核,然后分别用不同尺寸的卷积核对整个语谱图进行卷积,得到若干特征映射图,再对特征映射图进行最大池化,最终把特征堆叠起来形成局部不变特征y,如图2所示。y作为半监督卷积神经网络的输入,通过四个不同的损失函数项将y分解成四类特征。半监督的损失函数由重构误差函数、判别损失函数、正交损失函数、显著性损失函数四部分组成。通过最小化损失函数来获得四个损失函数项的参数,从而分解得到四类特征,分别用于不同的识别需求,如图3所示。所有特征均要参加重构,而不同类型的特征参与对应的判别损失函数的约束。
本发明首先对语音进行预处理,利用基于卷积神经网络的无监督学习算法得到一组局部不变特征,然后利用基于卷积神经网络的半监督学习算法把局部不变特征分解成四类特征:情感相关特征、性别相关特征、年龄相关特征、其他因素相关特征。具体的步骤如下:
步骤一,首先把时域信号转化成语谱图,窗尺寸为20ms,有10ms的重叠;然后利用PCA降维以及白化,PCA有60个主成分,最终产生60×n的语谱图。从中提取若干个不重叠的60×15的语谱。对于每个60×15的语谱,从中提取两个尺寸的语谱块,分别为60×6和60×10。
步骤二,将60×6和60×10两种尺寸的语谱块分别输入到SAE,分别学习得到120个和输入尺寸一样大的60×6和60×10的卷积核。然后利用这两个卷积核分别对整个语谱60×15进行卷积,得到120个1×10和120个1×6的特征 映射图,然后每两帧进行最大池化,得到120个1×5和120个1×3的特征。即对于60×6的卷积核得到600个特征,对于60×10的卷积核得到360个特征。这总的960个特征作为半监督的输入。接下来介绍一下无监督特征学习的一般步骤。
自动编码器AE(Auto-Encoder)的目标函数如下:
Figure PCTCN2014088539-appb-000001
其中x是输入的语谱块,此处的x是不带标签的。h(x)是编码函数,h(x)=s(ωx+α),其中ω是权重矩阵,α是偏置,
Figure PCTCN2014088539-appb-000002
g(x)是解码函数,x′=g(x)=s(ωTh(x)+δ),其中ωT是ω的转置,δ是偏置。L(x,x′)是损失函数,L(x,x′)=||x-x′||2,表示均方误差。
而稀疏自编码SAE就是在AE的目标函数上加一项稀疏性损失项。SAE的目标函数如下:
Figure PCTCN2014088539-appb-000003
其中,
Figure PCTCN2014088539-appb-000004
是一个以ρ为均值和一个以ρ′j为均值的两个伯努利随机变量之间的相对熵,用来控制稀疏性。
Figure PCTCN2014088539-appb-000005
ρ是稀疏性参数,
Figure PCTCN2014088539-appb-000006
是隐藏神经元j的平均激活度,n2是隐藏结点个数,m是输入结点个数。λ是控制稀疏项的参数。
假定有n种不同的输入尺寸,记成li×hi(i=1,2,…,n)。通过最小化
Figure PCTCN2014088539-appb-000007
得到不同的卷积核(ωii)。用卷积核(ωii)对整个语谱图的所有语谱块li×hi进行卷积:
fi(x)=s(conv(ωi,x)+αi)  (3)
然后把卷积得到的特征映射图分成不重叠的区域,P={p1,p2,…,pq},对每个区域进行最大池化:
Figure PCTCN2014088539-appb-000008
对于第i个卷积核,把池化的特征堆叠起来:
Figure PCTCN2014088539-appb-000009
把所有卷积核的池化特征堆叠起来,形成局部不变特征y:
y=F(x)=[F1(x),F2(x),…,Fn(x)]  (6)
局部不变特征y作为下面无监督学习的输入。
步骤三,通过上述的无监督学习,获得了局部不变特征y。然后通过基于卷积神经网络的半监督学习(部分输入带有类别标签),将y分解成四类特征:情感相关特征、性别相关特征、年龄相关特征、其他因素相关特征。无监督学习的损失函数由四个部分构成。
首先,通过四个编码函数h(e)(y)、h(s)(y)、h(a)(y)、h(o)(y)将y映射成四类特征,分别和情感、性别、年龄、其他因素相关。四个编码函数如下:
h(e)(y)=s(Ey+e)  (7)
h(s)(y)=s(Sy+s)  (8)
h(a)(y)=s(Ay+a)  (9)
h(o)(y)=s(Oy+o)  (10)
这四类特征都要参与重构y:
y′=g([h(e)(y),h(s)(y),h(a)(y),h(o)(y)])=s(ETh(e)(y)+STh(s)(y)+ATh(a)(y)+OTh(o)(y)+γ)  (11)
其中,γ是为了靠近y均值的一个补偿参数。
所以,重构误差函数为:
LRECON(y,y′)=||y-y′||2  (12)
然后,利用有标签数据来进行类别的预测,输入数据(x,z),其中x是语谱块,z={z1,z2,z3}分别表示情感标签、性别标签、年龄标签。z′={z′1,z′2,z′3}分别表示预测的情感标签、性别标签、年龄标签。例如下面公式(13)就是通过U1j映射h(e)(y),来预测情感标签的第j个特征z′1j
z′1j=s(U1jh(e)(y)+b1j)  (13)
z′2j=s(U2jh(s)(y)+b2j)  (14)
z′3j=s(U3jh(a)(y)+b3j)  (15)
所以,情感标签、性别标签、年龄标签的判别损失函数分别为:
Figure PCTCN2014088539-appb-000010
Figure PCTCN2014088539-appb-000011
Figure PCTCN2014088539-appb-000012
总的判别损失函数为:
LDISC(z,z′)=LDISCE(z1,z′1)+LDISCS(z2,z′2)+LDISCA(z3,z′3)  (19)
其中C1、C2、C3分别表示情感标签、性别标签、年龄标签的类别个数。特别要说明的是这一步情感相关特征受式(14)情感判别惩罚函数的约束,性别相关特征受式(15)性别判别惩罚函数的约束,年龄相关特征受式(16)年龄判别惩罚函数的约束。
此外,为了让h(e)(y)、h(s)(y)、h(a)(y)、h(o)(y)尽可能地表示y变化的不同方向,比如说要让h(e)(y)和h(s)(y)表示不同方向,可以通过让
Figure PCTCN2014088539-appb-000013
Figure PCTCN2014088539-appb-000014
尽可能地正交。正交损失函数为:
Figure PCTCN2014088539-appb-000015
最后,可以利用显著性损失函数,使得学习到的四类特征更体现识别目标不同类别之间的可鉴别性且比较稳定。。对于每个输入i的显著性,我们用它的权重的显著性总和来衡量。具体的,对于输入i的显著性如下:
Figure PCTCN2014088539-appb-000016
其中φ(i)是和输入i相关的权重集,ωk是第k个权重,MSE是均方误差。对于h(e)(y)、h(s)(y)、h(a)(y)这三类特征,重构误差和判别损失都要考虑进显著性损失函数,而对于h(o)(y),只要考虑重构误差。所以显著性损失函数如下:
Figure PCTCN2014088539-appb-000017
Figure PCTCN2014088539-appb-000018
所以,重构误差函数、判别损失函数、正交损失函数、显著性损失函数这四部分就构成了总的损失函数。总的损失函数为:
LLOSS(θ)=∑x∈D,y=F(x)LRECON(y,y′)+βJORTH(y)+∑(x,z)∈∈LDISC(z,z′)+ηJSAL(y)  (23)
其中D是整个数据集(包括无标签数据和有标签数据),S是有标签数据集。β调整垂直损失函数的贡献程度,β∈[0,1]。η调整敏感性损失函数的贡献程度,η∈[0,1]。贡献权值参数β,η采用步长为0.1的网格搜索的方法设定。参数θ={E,S,A,O,U,e,s,a,o,γ,b}。
通过最小化损失函数来获得四个损失函数的参数权重和偏置,从而分解得到四类特征。

Claims (1)

  1. 一种半监督语音特征可变因素分解方法,其特征在于包括下列步骤:
    步骤一,预处理:对语音样本进行预处理得到语谱图,再采用PCA进行主成份分析降维以及白化,从中提取出不同尺寸的语谱块;
    步骤二,无监督的局部不变特征学习:将所述语谱块作为无监督特征学习SAE的输入,通过输入不同尺寸的语谱块,预训练得到不同尺寸的卷积核,然后分别用所述不同尺寸的卷积核对整个语谱图进行卷积,得到若干特征映射图,再对所述特征映射图进行最大池化,最终把特征堆叠起来形成局部不变特征y;
    步骤三,基于卷积神经网络的半监督特征学习:将所述局部不变特征y作为半监督学习算法的输入,利用基于卷积神经网络的半监督学习的方法,通过四个不同的损失函数将将局部不变特征y分解成四类特征;所述四类特征包括情感相关特征、性别相关特征、年龄相关特征、以及包括噪声和语种的其他因素相关特征;所述半监督学习的损失函数由重构误差函数、判别损失函数、正交损失函数、显著性损失函数四部分组成;
    对于所述重构误差函数,所述四类特征都要参与重构局部不变特征y,误差采用均方误差;对于所述判别损失函数,先对有标签的数据进行类别预测,然后计算预测标签和真实标签之间的差异作为判别损失函数的值;对于所述正交损失函数,目的是使所述四类特征相互正交,表示输入局部不变特征y的不同的方向;对于所述显著性损失函数,目的是学习到仅体现识别目标类别之间的差异且更具有类别区分性的特征;通过最小化所述损失函数来获得四个损失函数的参数包括偏置和权重,从而得到所述四类特征。
PCT/CN2014/088539 2014-05-27 2014-10-14 一种半监督语音特征可变因素分解方法 Ceased WO2015180368A1 (zh)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
CN201410229537.5A CN104021373B (zh) 2014-05-27 2014-05-27 一种半监督语音特征可变因素分解方法
CN201410229537.5 2014-05-27

Publications (1)

Publication Number Publication Date
WO2015180368A1 true WO2015180368A1 (zh) 2015-12-03

Family

ID=51438118

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/CN2014/088539 Ceased WO2015180368A1 (zh) 2014-05-27 2014-10-14 一种半监督语音特征可变因素分解方法

Country Status (2)

Country Link
CN (1) CN104021373B (zh)
WO (1) WO2015180368A1 (zh)

Cited By (19)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN106803069A (zh) * 2016-12-29 2017-06-06 南京邮电大学 基于深度学习的人群高兴程度识别方法
CN106919710A (zh) * 2017-03-13 2017-07-04 东南大学 一种基于卷积神经网络的方言分类方法
CN108021910A (zh) * 2018-01-04 2018-05-11 青岛农业大学 基于图谱识别和深度学习的果实分类的分析方法
CN108899075A (zh) * 2018-06-28 2018-11-27 众安信息技术服务有限公司 一种基于深度学习的dsa图像检测方法、装置及设备
CN109065021A (zh) * 2018-10-18 2018-12-21 江苏师范大学 基于条件深度卷积生成对抗网络的端到端方言辨识方法
CN109117943A (zh) * 2018-07-24 2019-01-01 中国科学技术大学 利用多属性信息增强网络表征学习的方法
CN109543727A (zh) * 2018-11-07 2019-03-29 复旦大学 一种基于竞争重构学习的半监督异常检测方法
CN109559736A (zh) * 2018-12-05 2019-04-02 中国计量大学 一种基于对抗网络的电影演员自动配音方法
CN110009025A (zh) * 2019-03-27 2019-07-12 河南工业大学 一种用于语音测谎的半监督加性噪声自编码器
CN110084850A (zh) * 2019-04-04 2019-08-02 东南大学 一种基于图像语义分割的动态场景视觉定位方法
CN110363139A (zh) * 2019-07-15 2019-10-22 上海点积实业有限公司 一种数字信号处理方法和系统
CN110503128A (zh) * 2018-05-18 2019-11-26 百度(美国)有限责任公司 使用卷积生成对抗网络进行波形合成的谱图
CN110738168A (zh) * 2019-10-14 2020-01-31 长安大学 一种基于堆叠卷积自编码器的分布式应变微小裂缝检测系统及方法
CN111179941A (zh) * 2020-01-06 2020-05-19 科大讯飞股份有限公司 智能设备唤醒方法、注册方法及装置
CN111832650A (zh) * 2020-07-14 2020-10-27 西安电子科技大学 基于生成对抗网络局部聚合编码半监督的图像分类方法
CN112735478A (zh) * 2021-01-29 2021-04-30 华南理工大学 一种基于加性角惩罚焦点损失的语音情感识别方法
US11093818B2 (en) 2016-04-11 2021-08-17 International Business Machines Corporation Customer profile learning based on semi-supervised recurrent neural network using partially labeled sequence data
CN113963228A (zh) * 2021-09-14 2022-01-21 电信科学技术第五研究所有限公司 一种基于深度学习特征连接分析的语音事件提取方法
CN116386646A (zh) * 2023-04-28 2023-07-04 南京邮电大学 一种基于不确定度的集成自监督说话人识别方法

Families Citing this family (21)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN104021373B (zh) * 2014-05-27 2017-02-15 江苏大学 一种半监督语音特征可变因素分解方法
CN104408470B (zh) * 2014-12-01 2017-07-25 中科创达软件股份有限公司 基于平均脸预学习的性别检测方法
CN105989368A (zh) * 2015-02-13 2016-10-05 展讯通信(天津)有限公司 一种目标检测方法及装置以及移动终端
CN105070288B (zh) * 2015-07-02 2018-08-07 百度在线网络技术(北京)有限公司 车载语音指令识别方法和装置
CN105321525B (zh) * 2015-09-30 2019-02-22 北京邮电大学 一种降低voip通信资源开销的系统和方法
CN105550679B (zh) * 2016-02-29 2019-02-15 深圳前海勇艺达机器人有限公司 一种机器人循环监听录音的判断方法
US10579860B2 (en) * 2016-06-06 2020-03-03 Samsung Electronics Co., Ltd. Learning model for salient facial region detection
WO2018073759A1 (en) 2016-10-19 2018-04-26 Audible Reality Inc. System for and method of generating an audio image
CN106847309A (zh) * 2017-01-09 2017-06-13 华南理工大学 一种语音情感识别方法
CN108461092B (zh) * 2018-03-07 2022-03-08 燕山大学 一种对帕金森病语音分析的方法
CN110148400B (zh) * 2018-07-18 2023-03-17 腾讯科技(深圳)有限公司 发音类型的识别方法、模型的训练方法、装置及设备
US11606663B2 (en) 2018-08-29 2023-03-14 Audible Reality Inc. System for and method of controlling a three-dimensional audio engine
CN109767790A (zh) * 2019-02-28 2019-05-17 中国传媒大学 一种语音情感识别方法及系统
CN110070895B (zh) * 2019-03-11 2021-06-22 江苏大学 一种基于监督变分编码器因素分解的混合声音事件检测方法
CN110705339A (zh) * 2019-04-15 2020-01-17 中国石油大学(华东) 一种基于c-c3d的手语识别方法
CN110297928A (zh) * 2019-07-02 2019-10-01 百度在线网络技术(北京)有限公司 表情图片的推荐方法、装置、设备和存储介质
CN111009262A (zh) * 2019-12-24 2020-04-14 携程计算机技术(上海)有限公司 语音性别识别的方法及系统
CN113889121B (zh) * 2021-09-28 2024-10-15 平安科技(深圳)有限公司 基于语音的年龄识别方法、装置、设备及存储介质
CN114037059A (zh) * 2021-11-05 2022-02-11 北京百度网讯科技有限公司 预训练模型、模型的生成方法、数据处理方法及装置
CN115240649B (zh) * 2022-07-19 2023-04-18 于振华 一种基于深度学习的语音识别方法和系统
CN115273861B (zh) * 2022-07-21 2025-04-11 深圳市腾讯计算机系统有限公司 音频处理方法、装置、计算机设备、存储介质及程序产品

Citations (7)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN1150852A (zh) * 1994-06-06 1997-05-28 摩托罗拉公司 采用神经网络的语音识别系统和方法
CN1151218A (zh) * 1994-06-03 1997-06-04 摩托罗拉公司 用于语音识别的神经网络的训练方法
CN1275746A (zh) * 1994-04-28 2000-12-06 摩托罗拉公司 使用神经网络变换文本为声频信号的设备
CN1280697A (zh) * 1998-02-03 2001-01-17 西门子公司 传输语音数据的方法
CN1975856A (zh) * 2006-10-30 2007-06-06 邹采荣 一种基于支持向量机的语音情感识别方法
CN103400145A (zh) * 2013-07-19 2013-11-20 北京理工大学 基于线索神经网络的语音-视觉融合情感识别方法
CN104021373A (zh) * 2014-05-27 2014-09-03 江苏大学 一种半监督语音特征可变因素分解方法

Family Cites Families (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US8582807B2 (en) * 2010-03-15 2013-11-12 Nec Laboratories America, Inc. Systems and methods for determining personal characteristics
CN102222500A (zh) * 2011-05-11 2011-10-19 北京航空航天大学 结合情感点的汉语语音情感提取及建模方法

Patent Citations (7)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN1275746A (zh) * 1994-04-28 2000-12-06 摩托罗拉公司 使用神经网络变换文本为声频信号的设备
CN1151218A (zh) * 1994-06-03 1997-06-04 摩托罗拉公司 用于语音识别的神经网络的训练方法
CN1150852A (zh) * 1994-06-06 1997-05-28 摩托罗拉公司 采用神经网络的语音识别系统和方法
CN1280697A (zh) * 1998-02-03 2001-01-17 西门子公司 传输语音数据的方法
CN1975856A (zh) * 2006-10-30 2007-06-06 邹采荣 一种基于支持向量机的语音情感识别方法
CN103400145A (zh) * 2013-07-19 2013-11-20 北京理工大学 基于线索神经网络的语音-视觉融合情感识别方法
CN104021373A (zh) * 2014-05-27 2014-09-03 江苏大学 一种半监督语音特征可变因素分解方法

Cited By (25)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US11093818B2 (en) 2016-04-11 2021-08-17 International Business Machines Corporation Customer profile learning based on semi-supervised recurrent neural network using partially labeled sequence data
CN106803069B (zh) * 2016-12-29 2021-02-09 南京邮电大学 基于深度学习的人群高兴程度识别方法
CN106803069A (zh) * 2016-12-29 2017-06-06 南京邮电大学 基于深度学习的人群高兴程度识别方法
CN106919710A (zh) * 2017-03-13 2017-07-04 东南大学 一种基于卷积神经网络的方言分类方法
CN108021910A (zh) * 2018-01-04 2018-05-11 青岛农业大学 基于图谱识别和深度学习的果实分类的分析方法
CN110503128A (zh) * 2018-05-18 2019-11-26 百度(美国)有限责任公司 使用卷积生成对抗网络进行波形合成的谱图
CN108899075A (zh) * 2018-06-28 2018-11-27 众安信息技术服务有限公司 一种基于深度学习的dsa图像检测方法、装置及设备
CN109117943A (zh) * 2018-07-24 2019-01-01 中国科学技术大学 利用多属性信息增强网络表征学习的方法
CN109117943B (zh) * 2018-07-24 2022-09-30 中国科学技术大学 利用多属性信息增强网络表征学习的方法
CN109065021A (zh) * 2018-10-18 2018-12-21 江苏师范大学 基于条件深度卷积生成对抗网络的端到端方言辨识方法
CN109543727A (zh) * 2018-11-07 2019-03-29 复旦大学 一种基于竞争重构学习的半监督异常检测方法
CN109559736A (zh) * 2018-12-05 2019-04-02 中国计量大学 一种基于对抗网络的电影演员自动配音方法
CN109559736B (zh) * 2018-12-05 2022-03-08 中国计量大学 一种基于对抗网络的电影演员自动配音方法
CN110009025A (zh) * 2019-03-27 2019-07-12 河南工业大学 一种用于语音测谎的半监督加性噪声自编码器
CN110009025B (zh) * 2019-03-27 2023-03-24 河南工业大学 一种用于语音测谎的半监督加性噪声自编码器
CN110084850A (zh) * 2019-04-04 2019-08-02 东南大学 一种基于图像语义分割的动态场景视觉定位方法
CN110363139A (zh) * 2019-07-15 2019-10-22 上海点积实业有限公司 一种数字信号处理方法和系统
CN110738168A (zh) * 2019-10-14 2020-01-31 长安大学 一种基于堆叠卷积自编码器的分布式应变微小裂缝检测系统及方法
CN111179941B (zh) * 2020-01-06 2022-10-04 科大讯飞股份有限公司 智能设备唤醒方法、注册方法及装置
CN111179941A (zh) * 2020-01-06 2020-05-19 科大讯飞股份有限公司 智能设备唤醒方法、注册方法及装置
CN111832650A (zh) * 2020-07-14 2020-10-27 西安电子科技大学 基于生成对抗网络局部聚合编码半监督的图像分类方法
CN111832650B (zh) * 2020-07-14 2023-08-01 西安电子科技大学 基于生成对抗网络局部聚合编码半监督的图像分类方法
CN112735478A (zh) * 2021-01-29 2021-04-30 华南理工大学 一种基于加性角惩罚焦点损失的语音情感识别方法
CN113963228A (zh) * 2021-09-14 2022-01-21 电信科学技术第五研究所有限公司 一种基于深度学习特征连接分析的语音事件提取方法
CN116386646A (zh) * 2023-04-28 2023-07-04 南京邮电大学 一种基于不确定度的集成自监督说话人识别方法

Also Published As

Publication number Publication date
CN104021373B (zh) 2017-02-15
CN104021373A (zh) 2014-09-03

Similar Documents

Publication Publication Date Title
CN104021373B (zh) 一种半监督语音特征可变因素分解方法
Hsu et al. Unsupervised learning of disentangled and interpretable representations from sequential data
Mao et al. Learning salient features for speech emotion recognition using convolutional neural networks
WO2021208287A1 (zh) 用于情绪识别的语音端点检测方法、装置、电子设备及存储介质
CN111461176A (zh) 基于归一化互信息的多模态融合方法、装置、介质及设备
CN110136690A (zh) 语音合成方法、装置及计算机可读存储介质
CN115393933A (zh) 一种基于帧注意力机制的视频人脸情绪识别方法
CN111243572B (zh) 基于说话人博弈的多人语音转换方法与系统
Bandela et al. Unsupervised feature selection and NMF de-noising for robust Speech Emotion Recognition
CN106847309A (zh) 一种语音情感识别方法
Cetin Accent recognition using a spectrogram image feature-based convolutional neural network
CN103996155A (zh) 智能交互及心理慰藉机器人服务系统
Xia et al. Audiovisual speech recognition: A review and forecast
Wei et al. A novel speech emotion recognition algorithm based on wavelet kernel sparse classifier in stacked deep auto-encoder model
JP2015175859A (ja) パターン認識装置、パターン認識方法及びパターン認識プログラム
Tong Automatic assessment of dysarthric severity level using audio-video cross-modal approach in deep learning
CN110136726A (zh) 一种语音性别的估计方法、装置、系统及存储介质
CN114913871B (zh) 目标对象分类方法、系统、电子设备及存储介质
CN117976006A (zh) 音频处理方法、装置、计算机设备和存储介质
CN116434759B (zh) 一种基于srs-cl网络的说话人识别方法
Ke Study on recognition and classification of English accents using deep learning algorithms
CN118072749A (zh) 一种语音转换方法、装置、设备及介质
Sun Digital audio scene recognition method based on machine learning technology
CN120220693A (zh) 声纹识别方法、装置、电子设备及存储介质
CN118038887A (zh) 一种混合语音的处理方法、装置、计算机设备及存储介质

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 14893660

Country of ref document: EP

Kind code of ref document: A1

NENP Non-entry into the national phase

Ref country code: DE

122 Ep: pct application non-entry in european phase

Ref document number: 14893660

Country of ref document: EP

Kind code of ref document: A1