WO2015180368A1 - 一种半监督语音特征可变因素分解方法 - Google Patents
一种半监督语音特征可变因素分解方法 Download PDFInfo
- Publication number
- WO2015180368A1 WO2015180368A1 PCT/CN2014/088539 CN2014088539W WO2015180368A1 WO 2015180368 A1 WO2015180368 A1 WO 2015180368A1 CN 2014088539 W CN2014088539 W CN 2014088539W WO 2015180368 A1 WO2015180368 A1 WO 2015180368A1
- Authority
- WO
- WIPO (PCT)
- Prior art keywords
- features
- feature
- loss function
- speech
- semi
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Ceased
Links
Images
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/16—Speech classification or search using artificial neural networks
Definitions
- Step 3 Semi-supervised feature learning based on convolutional neural network: using the locally invariant feature y as input to a semi-supervised learning algorithm, using a semi-supervised learning method based on convolutional neural networks, through four different loss functions
- the local invariant feature y will be decomposed into four types of features; the four types of features include emotion-related features, gender-related features, age-related features, and other factor-related features including noise and language; the loss function of the semi-supervised learning It consists of four parts: reconstruction error function, discriminant loss function, orthogonal loss function and significant loss function.
- Step one first convert the time domain signal into a spectral map, the window size is 20ms, with 10ms overlap; then using PCA dimensionality reduction and whitening, PCA has 60 principal components, and finally produces a 60 ⁇ n spectral map. A number of non-overlapping 60 ⁇ 15 patterns are extracted therefrom. For each 60 ⁇ 15 language spectrum, two sizes of spectral blocks are extracted therefrom, which are 60 ⁇ 6 and 60 ⁇ 10, respectively.
Landscapes
- Engineering & Computer Science (AREA)
- Artificial Intelligence (AREA)
- Evolutionary Computation (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
Abstract
本发明公开了一种半监督语音特征可变因素分解方法,把语音特征分成四类:情感相关特征、性别相关特征、年龄相关特征、包括噪声和语种的其他因素相关特征。首先,对语音进行预处理得到语谱图,不同尺寸的语谱块输入无监督特征学习网络SAE,预训练得到不同尺寸的卷积核,然后分别用不同尺寸的卷积核对整个语谱图进行卷积,得到若干特征映射图,再对特征映射图进行最大池化,最终把特征堆叠起来形成局部不变特征y。y作为半监督卷积神经网络的输入,通过最小化四个不同的损失函数项将y分解成四类特征。本发明解决了情感、性别、年龄语音特征相互混杂导致识别准确率不高的问题,可分别用于基于语音信号的不同识别需求,还可以用于分解更多因素。
Description
本发明属于语音识别领域,具体涉及一种语音特征分解的方法。
随着计算机渗透到生活的各个角落,各种类型的计算平台都需要更简便的输入媒体,语音当仁不让成为用户最佳的选择之一。一般来说,语音中包括了说话人、说话内容、说话人的情感、性别、年龄等多种信息。近年来,随着一些应用的不断完善,促进了对人的情感、性别、年龄、说话内容等方面的基于语音信号的识别技术的发展。比如传统的呼叫中心通常都会随机的接通服务生来为客户提供电话咨询,而不能够根据用户的情感、性别和年龄提供个性化的服务,这就促使了是否可以通过客户的声音来判断其情感、性别和年龄,并以此为依据提供更加个性化的语音服务。但是在现有的基于语音信号的情感、性别和年龄识别相关任务中,传统的特征提取方法所提取的特征往往掺杂了情感、性别、年龄、说话内容、语言等因素,彼此之间很难区分,从而导致识别效果不佳。
在Dong Yu等、名称为Feature Learning in Deep Neural Networks—Studies on Speech Recognition Tasks的论文中,利用深度神经网络学到一个深层特征,但这个特征可能混杂了很多因素,如情感、性别、年龄等因素,如果把这个特征用于语音情感识别,识别率可能会受特征中其他因素的影响。目前还未出现一种特征提取方法能分别提取语音信号中不同类型的特征。本发明为了克服现有技术的缺陷,通过基于卷积神经网络的半监督特征学习,将语音特征分解成四类:情感相关特征、性别相关特征、年龄相关特征、其他因素相关特征,可分别用于基于语音信号的不同识别需求。本发明进一步拓展以后还可以用于分解更多因素。
发明内容
本发明的目的在于提供一种半监督语音特征可变因素分解方法,使得分解出的特征不受与识别任务无关的因素的干扰,且更显著地体现识别目标类别之间的差异,从而提高识别的准确度。
为了解决以上技术问题,本发明首先对语音进行预处理得到语谱图,然后通过基于卷积神经网络的无监督学习得到局部不变特征,再采用一种半监督学习方法,通过重构误差函数、判别损失函数、正交损失函数、显著性损失函数四个损失函数的约束将无监督学习得到的局部不变特征,分解成四类:情感相关特征、
性别相关特征、年龄相关特征和其他因素相关特征,可分别用于情感识别、性别识别、年龄识别,能有效提高识别准确率。具体技术方案如下:
一种半监督语音特征可变因素分解方法,其特征在于包括下列步骤:
步骤一,预处理:对语音样本进行预处理得到语谱图,再采用PCA进行主成份分析降维以及白化,从中提取出不同尺寸的语谱块;
步骤二,无监督的局部不变特征学习:将所述语谱块作为无监督特征学习SAE的输入,通过输入不同尺寸的语谱块,预训练得到不同尺寸的卷积核,然后分别用所述不同尺寸的卷积核对整个语谱图进行卷积,得到若干特征映射图,再对所述特征映射图进行最大池化,最终把特征堆叠起来形成局部不变特征y;
步骤三,基于卷积神经网络的半监督特征学习:将所述局部不变特征y作为半监督学习算法的输入,利用基于卷积神经网络的半监督学习的方法,通过四个不同的损失函数将将局部不变特征y分解成四类特征;所述四类特征包括情感相关特征、性别相关特征、年龄相关特征、以及包括噪声和语种的其他因素相关特征;所述半监督学习的损失函数由重构误差函数、判别损失函数、正交损失函数、显著性损失函数四部分组成;
对于所述重构误差函数,所述四类特征都要参与重构局部不变特征y,误差采用均方误差;对于所述判别损失函数,先对有标签的数据进行类别预测,然后计算预测标签和真实标签之间的差异作为判别损失函数的值;对于所述正交损失函数,目的是使所述四类特征相互正交,表示输入局部不变特征y的不同的方向;对于所述显著性损失函数,目的是学习到仅体现识别目标类别之间的差异且更具有类别区分性的特征;通过最小化所述损失函数来获得四个损失函数的参数包括偏置和权重,从而得到所述四类特征。
本发明具有有益效果。本发明的半监督特征学习,通过将局部不变特征分解成情感相关特征、性别相关特征、年龄相关特征、其他因素相关特征共四类特征,使得不同类型的特征用于不同的识别需求,避免了不同类型特征之间相互干扰的缺点。特别是半监督学习的损失函数由重构误差函数、判别损失函数、正交损失函数、显著性损失函数四部分组成,使得所学习到的特征能更好地描述识别目标类别之间的差异,不受无关因素的干扰。本发明解决了不同的语音特征混杂在一起从而带来的识别率不高的问题,能有效地提高识别准确率。
图1是语音特征分解流程图。
图2是无监督特征学习流程图。
图3是半监督语音特征分解结构图。
图1给出了本发明方法的总体思路,首先,对语音进行预处理得到语谱图,不同尺寸的语谱块输入无监督特征学习网络SAE,预训练得到不同尺寸的卷积核,然后经过卷积、池化操作,形成局部不变特征y。y作为半监督卷积神经网络的输入,通过最小化四个不同的损失函数项将y分解成四类特征。
预处理后的语音信号被划分成li×hi大小的语谱块,i表示语谱块的个数,不同尺寸的语谱块输入无监督特征学习网络SAE,预训练得到不同尺寸的卷积核,然后分别用不同尺寸的卷积核对整个语谱图进行卷积,得到若干特征映射图,再对特征映射图进行最大池化,最终把特征堆叠起来形成局部不变特征y,如图2所示。y作为半监督卷积神经网络的输入,通过四个不同的损失函数项将y分解成四类特征。半监督的损失函数由重构误差函数、判别损失函数、正交损失函数、显著性损失函数四部分组成。通过最小化损失函数来获得四个损失函数项的参数,从而分解得到四类特征,分别用于不同的识别需求,如图3所示。所有特征均要参加重构,而不同类型的特征参与对应的判别损失函数的约束。
本发明首先对语音进行预处理,利用基于卷积神经网络的无监督学习算法得到一组局部不变特征,然后利用基于卷积神经网络的半监督学习算法把局部不变特征分解成四类特征:情感相关特征、性别相关特征、年龄相关特征、其他因素相关特征。具体的步骤如下:
步骤一,首先把时域信号转化成语谱图,窗尺寸为20ms,有10ms的重叠;然后利用PCA降维以及白化,PCA有60个主成分,最终产生60×n的语谱图。从中提取若干个不重叠的60×15的语谱。对于每个60×15的语谱,从中提取两个尺寸的语谱块,分别为60×6和60×10。
步骤二,将60×6和60×10两种尺寸的语谱块分别输入到SAE,分别学习得到120个和输入尺寸一样大的60×6和60×10的卷积核。然后利用这两个卷积核分别对整个语谱60×15进行卷积,得到120个1×10和120个1×6的特征
映射图,然后每两帧进行最大池化,得到120个1×5和120个1×3的特征。即对于60×6的卷积核得到600个特征,对于60×10的卷积核得到360个特征。这总的960个特征作为半监督的输入。接下来介绍一下无监督特征学习的一般步骤。
自动编码器AE(Auto-Encoder)的目标函数如下:
其中x是输入的语谱块,此处的x是不带标签的。h(x)是编码函数,h(x)=s(ωx+α),其中ω是权重矩阵,α是偏置,g(x)是解码函数,x′=g(x)=s(ωTh(x)+δ),其中ωT是ω的转置,δ是偏置。L(x,x′)是损失函数,L(x,x′)=||x-x′||2,表示均方误差。
而稀疏自编码SAE就是在AE的目标函数上加一项稀疏性损失项。SAE的目标函数如下:
fi(x)=s(conv(ωi,x)+αi) (3)
然后把卷积得到的特征映射图分成不重叠的区域,P={p1,p2,…,pq},对每个区域进行最大池化:
对于第i个卷积核,把池化的特征堆叠起来:
把所有卷积核的池化特征堆叠起来,形成局部不变特征y:
y=F(x)=[F1(x),F2(x),…,Fn(x)] (6)
局部不变特征y作为下面无监督学习的输入。
步骤三,通过上述的无监督学习,获得了局部不变特征y。然后通过基于卷积神经网络的半监督学习(部分输入带有类别标签),将y分解成四类特征:情感相关特征、性别相关特征、年龄相关特征、其他因素相关特征。无监督学习的损失函数由四个部分构成。
首先,通过四个编码函数h(e)(y)、h(s)(y)、h(a)(y)、h(o)(y)将y映射成四类特征,分别和情感、性别、年龄、其他因素相关。四个编码函数如下:
h(e)(y)=s(Ey+e) (7)
h(s)(y)=s(Sy+s) (8)
h(a)(y)=s(Ay+a) (9)
h(o)(y)=s(Oy+o) (10)
这四类特征都要参与重构y:
y′=g([h(e)(y),h(s)(y),h(a)(y),h(o)(y)])=s(ETh(e)(y)+STh(s)(y)+ATh(a)(y)+OTh(o)(y)+γ) (11)
其中,γ是为了靠近y均值的一个补偿参数。
所以,重构误差函数为:
LRECON(y,y′)=||y-y′||2 (12)
然后,利用有标签数据来进行类别的预测,输入数据(x,z),其中x是语谱块,z={z1,z2,z3}分别表示情感标签、性别标签、年龄标签。z′={z′1,z′2,z′3}分别表示预测的情感标签、性别标签、年龄标签。例如下面公式(13)就是通过U1j映射h(e)(y),来预测情感标签的第j个特征z′1j。
z′1j=s(U1jh(e)(y)+b1j) (13)
z′2j=s(U2jh(s)(y)+b2j) (14)
z′3j=s(U3jh(a)(y)+b3j) (15)
所以,情感标签、性别标签、年龄标签的判别损失函数分别为:
总的判别损失函数为:
LDISC(z,z′)=LDISCE(z1,z′1)+LDISCS(z2,z′2)+LDISCA(z3,z′3) (19)
其中C1、C2、C3分别表示情感标签、性别标签、年龄标签的类别个数。特别要说明的是这一步情感相关特征受式(14)情感判别惩罚函数的约束,性别相关特征受式(15)性别判别惩罚函数的约束,年龄相关特征受式(16)年龄判别惩罚函数的约束。
此外,为了让h(e)(y)、h(s)(y)、h(a)(y)、h(o)(y)尽可能地表示y变化的不同方向,比如说要让h(e)(y)和h(s)(y)表示不同方向,可以通过让和尽可能地正交。正交损失函数为:
最后,可以利用显著性损失函数,使得学习到的四类特征更体现识别目标不同类别之间的可鉴别性且比较稳定。。对于每个输入i的显著性,我们用它的权重的显著性总和来衡量。具体的,对于输入i的显著性如下:
其中φ(i)是和输入i相关的权重集,ωk是第k个权重,MSE是均方误差。对于h(e)(y)、h(s)(y)、h(a)(y)这三类特征,重构误差和判别损失都要考虑进显著性损失函数,而对于h(o)(y),只要考虑重构误差。所以显著性损失函数如下:
所以,重构误差函数、判别损失函数、正交损失函数、显著性损失函数这四部分就构成了总的损失函数。总的损失函数为:
LLOSS(θ)=∑x∈D,y=F(x)LRECON(y,y′)+βJORTH(y)+∑(x,z)∈∈LDISC(z,z′)+ηJSAL(y) (23)
其中D是整个数据集(包括无标签数据和有标签数据),S是有标签数据集。β调整垂直损失函数的贡献程度,β∈[0,1]。η调整敏感性损失函数的贡献程度,η∈[0,1]。贡献权值参数β,η采用步长为0.1的网格搜索的方法设定。参数θ={E,S,A,O,U,e,s,a,o,γ,b}。
通过最小化损失函数来获得四个损失函数的参数权重和偏置,从而分解得到四类特征。
Claims (1)
- 一种半监督语音特征可变因素分解方法,其特征在于包括下列步骤:步骤一,预处理:对语音样本进行预处理得到语谱图,再采用PCA进行主成份分析降维以及白化,从中提取出不同尺寸的语谱块;步骤二,无监督的局部不变特征学习:将所述语谱块作为无监督特征学习SAE的输入,通过输入不同尺寸的语谱块,预训练得到不同尺寸的卷积核,然后分别用所述不同尺寸的卷积核对整个语谱图进行卷积,得到若干特征映射图,再对所述特征映射图进行最大池化,最终把特征堆叠起来形成局部不变特征y;步骤三,基于卷积神经网络的半监督特征学习:将所述局部不变特征y作为半监督学习算法的输入,利用基于卷积神经网络的半监督学习的方法,通过四个不同的损失函数将将局部不变特征y分解成四类特征;所述四类特征包括情感相关特征、性别相关特征、年龄相关特征、以及包括噪声和语种的其他因素相关特征;所述半监督学习的损失函数由重构误差函数、判别损失函数、正交损失函数、显著性损失函数四部分组成;对于所述重构误差函数,所述四类特征都要参与重构局部不变特征y,误差采用均方误差;对于所述判别损失函数,先对有标签的数据进行类别预测,然后计算预测标签和真实标签之间的差异作为判别损失函数的值;对于所述正交损失函数,目的是使所述四类特征相互正交,表示输入局部不变特征y的不同的方向;对于所述显著性损失函数,目的是学习到仅体现识别目标类别之间的差异且更具有类别区分性的特征;通过最小化所述损失函数来获得四个损失函数的参数包括偏置和权重,从而得到所述四类特征。
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN201410229537.5A CN104021373B (zh) | 2014-05-27 | 2014-05-27 | 一种半监督语音特征可变因素分解方法 |
| CN201410229537.5 | 2014-05-27 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| WO2015180368A1 true WO2015180368A1 (zh) | 2015-12-03 |
Family
ID=51438118
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| PCT/CN2014/088539 Ceased WO2015180368A1 (zh) | 2014-05-27 | 2014-10-14 | 一种半监督语音特征可变因素分解方法 |
Country Status (2)
| Country | Link |
|---|---|
| CN (1) | CN104021373B (zh) |
| WO (1) | WO2015180368A1 (zh) |
Cited By (19)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN106803069A (zh) * | 2016-12-29 | 2017-06-06 | 南京邮电大学 | 基于深度学习的人群高兴程度识别方法 |
| CN106919710A (zh) * | 2017-03-13 | 2017-07-04 | 东南大学 | 一种基于卷积神经网络的方言分类方法 |
| CN108021910A (zh) * | 2018-01-04 | 2018-05-11 | 青岛农业大学 | 基于图谱识别和深度学习的果实分类的分析方法 |
| CN108899075A (zh) * | 2018-06-28 | 2018-11-27 | 众安信息技术服务有限公司 | 一种基于深度学习的dsa图像检测方法、装置及设备 |
| CN109065021A (zh) * | 2018-10-18 | 2018-12-21 | 江苏师范大学 | 基于条件深度卷积生成对抗网络的端到端方言辨识方法 |
| CN109117943A (zh) * | 2018-07-24 | 2019-01-01 | 中国科学技术大学 | 利用多属性信息增强网络表征学习的方法 |
| CN109543727A (zh) * | 2018-11-07 | 2019-03-29 | 复旦大学 | 一种基于竞争重构学习的半监督异常检测方法 |
| CN109559736A (zh) * | 2018-12-05 | 2019-04-02 | 中国计量大学 | 一种基于对抗网络的电影演员自动配音方法 |
| CN110009025A (zh) * | 2019-03-27 | 2019-07-12 | 河南工业大学 | 一种用于语音测谎的半监督加性噪声自编码器 |
| CN110084850A (zh) * | 2019-04-04 | 2019-08-02 | 东南大学 | 一种基于图像语义分割的动态场景视觉定位方法 |
| CN110363139A (zh) * | 2019-07-15 | 2019-10-22 | 上海点积实业有限公司 | 一种数字信号处理方法和系统 |
| CN110503128A (zh) * | 2018-05-18 | 2019-11-26 | 百度(美国)有限责任公司 | 使用卷积生成对抗网络进行波形合成的谱图 |
| CN110738168A (zh) * | 2019-10-14 | 2020-01-31 | 长安大学 | 一种基于堆叠卷积自编码器的分布式应变微小裂缝检测系统及方法 |
| CN111179941A (zh) * | 2020-01-06 | 2020-05-19 | 科大讯飞股份有限公司 | 智能设备唤醒方法、注册方法及装置 |
| CN111832650A (zh) * | 2020-07-14 | 2020-10-27 | 西安电子科技大学 | 基于生成对抗网络局部聚合编码半监督的图像分类方法 |
| CN112735478A (zh) * | 2021-01-29 | 2021-04-30 | 华南理工大学 | 一种基于加性角惩罚焦点损失的语音情感识别方法 |
| US11093818B2 (en) | 2016-04-11 | 2021-08-17 | International Business Machines Corporation | Customer profile learning based on semi-supervised recurrent neural network using partially labeled sequence data |
| CN113963228A (zh) * | 2021-09-14 | 2022-01-21 | 电信科学技术第五研究所有限公司 | 一种基于深度学习特征连接分析的语音事件提取方法 |
| CN116386646A (zh) * | 2023-04-28 | 2023-07-04 | 南京邮电大学 | 一种基于不确定度的集成自监督说话人识别方法 |
Families Citing this family (21)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN104021373B (zh) * | 2014-05-27 | 2017-02-15 | 江苏大学 | 一种半监督语音特征可变因素分解方法 |
| CN104408470B (zh) * | 2014-12-01 | 2017-07-25 | 中科创达软件股份有限公司 | 基于平均脸预学习的性别检测方法 |
| CN105989368A (zh) * | 2015-02-13 | 2016-10-05 | 展讯通信(天津)有限公司 | 一种目标检测方法及装置以及移动终端 |
| CN105070288B (zh) * | 2015-07-02 | 2018-08-07 | 百度在线网络技术(北京)有限公司 | 车载语音指令识别方法和装置 |
| CN105321525B (zh) * | 2015-09-30 | 2019-02-22 | 北京邮电大学 | 一种降低voip通信资源开销的系统和方法 |
| CN105550679B (zh) * | 2016-02-29 | 2019-02-15 | 深圳前海勇艺达机器人有限公司 | 一种机器人循环监听录音的判断方法 |
| US10579860B2 (en) * | 2016-06-06 | 2020-03-03 | Samsung Electronics Co., Ltd. | Learning model for salient facial region detection |
| WO2018073759A1 (en) | 2016-10-19 | 2018-04-26 | Audible Reality Inc. | System for and method of generating an audio image |
| CN106847309A (zh) * | 2017-01-09 | 2017-06-13 | 华南理工大学 | 一种语音情感识别方法 |
| CN108461092B (zh) * | 2018-03-07 | 2022-03-08 | 燕山大学 | 一种对帕金森病语音分析的方法 |
| CN110148400B (zh) * | 2018-07-18 | 2023-03-17 | 腾讯科技(深圳)有限公司 | 发音类型的识别方法、模型的训练方法、装置及设备 |
| US11606663B2 (en) | 2018-08-29 | 2023-03-14 | Audible Reality Inc. | System for and method of controlling a three-dimensional audio engine |
| CN109767790A (zh) * | 2019-02-28 | 2019-05-17 | 中国传媒大学 | 一种语音情感识别方法及系统 |
| CN110070895B (zh) * | 2019-03-11 | 2021-06-22 | 江苏大学 | 一种基于监督变分编码器因素分解的混合声音事件检测方法 |
| CN110705339A (zh) * | 2019-04-15 | 2020-01-17 | 中国石油大学(华东) | 一种基于c-c3d的手语识别方法 |
| CN110297928A (zh) * | 2019-07-02 | 2019-10-01 | 百度在线网络技术(北京)有限公司 | 表情图片的推荐方法、装置、设备和存储介质 |
| CN111009262A (zh) * | 2019-12-24 | 2020-04-14 | 携程计算机技术(上海)有限公司 | 语音性别识别的方法及系统 |
| CN113889121B (zh) * | 2021-09-28 | 2024-10-15 | 平安科技(深圳)有限公司 | 基于语音的年龄识别方法、装置、设备及存储介质 |
| CN114037059A (zh) * | 2021-11-05 | 2022-02-11 | 北京百度网讯科技有限公司 | 预训练模型、模型的生成方法、数据处理方法及装置 |
| CN115240649B (zh) * | 2022-07-19 | 2023-04-18 | 于振华 | 一种基于深度学习的语音识别方法和系统 |
| CN115273861B (zh) * | 2022-07-21 | 2025-04-11 | 深圳市腾讯计算机系统有限公司 | 音频处理方法、装置、计算机设备、存储介质及程序产品 |
Citations (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN1150852A (zh) * | 1994-06-06 | 1997-05-28 | 摩托罗拉公司 | 采用神经网络的语音识别系统和方法 |
| CN1151218A (zh) * | 1994-06-03 | 1997-06-04 | 摩托罗拉公司 | 用于语音识别的神经网络的训练方法 |
| CN1275746A (zh) * | 1994-04-28 | 2000-12-06 | 摩托罗拉公司 | 使用神经网络变换文本为声频信号的设备 |
| CN1280697A (zh) * | 1998-02-03 | 2001-01-17 | 西门子公司 | 传输语音数据的方法 |
| CN1975856A (zh) * | 2006-10-30 | 2007-06-06 | 邹采荣 | 一种基于支持向量机的语音情感识别方法 |
| CN103400145A (zh) * | 2013-07-19 | 2013-11-20 | 北京理工大学 | 基于线索神经网络的语音-视觉融合情感识别方法 |
| CN104021373A (zh) * | 2014-05-27 | 2014-09-03 | 江苏大学 | 一种半监督语音特征可变因素分解方法 |
Family Cites Families (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US8582807B2 (en) * | 2010-03-15 | 2013-11-12 | Nec Laboratories America, Inc. | Systems and methods for determining personal characteristics |
| CN102222500A (zh) * | 2011-05-11 | 2011-10-19 | 北京航空航天大学 | 结合情感点的汉语语音情感提取及建模方法 |
-
2014
- 2014-05-27 CN CN201410229537.5A patent/CN104021373B/zh active Active
- 2014-10-14 WO PCT/CN2014/088539 patent/WO2015180368A1/zh not_active Ceased
Patent Citations (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN1275746A (zh) * | 1994-04-28 | 2000-12-06 | 摩托罗拉公司 | 使用神经网络变换文本为声频信号的设备 |
| CN1151218A (zh) * | 1994-06-03 | 1997-06-04 | 摩托罗拉公司 | 用于语音识别的神经网络的训练方法 |
| CN1150852A (zh) * | 1994-06-06 | 1997-05-28 | 摩托罗拉公司 | 采用神经网络的语音识别系统和方法 |
| CN1280697A (zh) * | 1998-02-03 | 2001-01-17 | 西门子公司 | 传输语音数据的方法 |
| CN1975856A (zh) * | 2006-10-30 | 2007-06-06 | 邹采荣 | 一种基于支持向量机的语音情感识别方法 |
| CN103400145A (zh) * | 2013-07-19 | 2013-11-20 | 北京理工大学 | 基于线索神经网络的语音-视觉融合情感识别方法 |
| CN104021373A (zh) * | 2014-05-27 | 2014-09-03 | 江苏大学 | 一种半监督语音特征可变因素分解方法 |
Cited By (25)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US11093818B2 (en) | 2016-04-11 | 2021-08-17 | International Business Machines Corporation | Customer profile learning based on semi-supervised recurrent neural network using partially labeled sequence data |
| CN106803069B (zh) * | 2016-12-29 | 2021-02-09 | 南京邮电大学 | 基于深度学习的人群高兴程度识别方法 |
| CN106803069A (zh) * | 2016-12-29 | 2017-06-06 | 南京邮电大学 | 基于深度学习的人群高兴程度识别方法 |
| CN106919710A (zh) * | 2017-03-13 | 2017-07-04 | 东南大学 | 一种基于卷积神经网络的方言分类方法 |
| CN108021910A (zh) * | 2018-01-04 | 2018-05-11 | 青岛农业大学 | 基于图谱识别和深度学习的果实分类的分析方法 |
| CN110503128A (zh) * | 2018-05-18 | 2019-11-26 | 百度(美国)有限责任公司 | 使用卷积生成对抗网络进行波形合成的谱图 |
| CN108899075A (zh) * | 2018-06-28 | 2018-11-27 | 众安信息技术服务有限公司 | 一种基于深度学习的dsa图像检测方法、装置及设备 |
| CN109117943A (zh) * | 2018-07-24 | 2019-01-01 | 中国科学技术大学 | 利用多属性信息增强网络表征学习的方法 |
| CN109117943B (zh) * | 2018-07-24 | 2022-09-30 | 中国科学技术大学 | 利用多属性信息增强网络表征学习的方法 |
| CN109065021A (zh) * | 2018-10-18 | 2018-12-21 | 江苏师范大学 | 基于条件深度卷积生成对抗网络的端到端方言辨识方法 |
| CN109543727A (zh) * | 2018-11-07 | 2019-03-29 | 复旦大学 | 一种基于竞争重构学习的半监督异常检测方法 |
| CN109559736A (zh) * | 2018-12-05 | 2019-04-02 | 中国计量大学 | 一种基于对抗网络的电影演员自动配音方法 |
| CN109559736B (zh) * | 2018-12-05 | 2022-03-08 | 中国计量大学 | 一种基于对抗网络的电影演员自动配音方法 |
| CN110009025A (zh) * | 2019-03-27 | 2019-07-12 | 河南工业大学 | 一种用于语音测谎的半监督加性噪声自编码器 |
| CN110009025B (zh) * | 2019-03-27 | 2023-03-24 | 河南工业大学 | 一种用于语音测谎的半监督加性噪声自编码器 |
| CN110084850A (zh) * | 2019-04-04 | 2019-08-02 | 东南大学 | 一种基于图像语义分割的动态场景视觉定位方法 |
| CN110363139A (zh) * | 2019-07-15 | 2019-10-22 | 上海点积实业有限公司 | 一种数字信号处理方法和系统 |
| CN110738168A (zh) * | 2019-10-14 | 2020-01-31 | 长安大学 | 一种基于堆叠卷积自编码器的分布式应变微小裂缝检测系统及方法 |
| CN111179941B (zh) * | 2020-01-06 | 2022-10-04 | 科大讯飞股份有限公司 | 智能设备唤醒方法、注册方法及装置 |
| CN111179941A (zh) * | 2020-01-06 | 2020-05-19 | 科大讯飞股份有限公司 | 智能设备唤醒方法、注册方法及装置 |
| CN111832650A (zh) * | 2020-07-14 | 2020-10-27 | 西安电子科技大学 | 基于生成对抗网络局部聚合编码半监督的图像分类方法 |
| CN111832650B (zh) * | 2020-07-14 | 2023-08-01 | 西安电子科技大学 | 基于生成对抗网络局部聚合编码半监督的图像分类方法 |
| CN112735478A (zh) * | 2021-01-29 | 2021-04-30 | 华南理工大学 | 一种基于加性角惩罚焦点损失的语音情感识别方法 |
| CN113963228A (zh) * | 2021-09-14 | 2022-01-21 | 电信科学技术第五研究所有限公司 | 一种基于深度学习特征连接分析的语音事件提取方法 |
| CN116386646A (zh) * | 2023-04-28 | 2023-07-04 | 南京邮电大学 | 一种基于不确定度的集成自监督说话人识别方法 |
Also Published As
| Publication number | Publication date |
|---|---|
| CN104021373B (zh) | 2017-02-15 |
| CN104021373A (zh) | 2014-09-03 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN104021373B (zh) | 一种半监督语音特征可变因素分解方法 | |
| Hsu et al. | Unsupervised learning of disentangled and interpretable representations from sequential data | |
| Mao et al. | Learning salient features for speech emotion recognition using convolutional neural networks | |
| WO2021208287A1 (zh) | 用于情绪识别的语音端点检测方法、装置、电子设备及存储介质 | |
| CN111461176A (zh) | 基于归一化互信息的多模态融合方法、装置、介质及设备 | |
| CN110136690A (zh) | 语音合成方法、装置及计算机可读存储介质 | |
| CN115393933A (zh) | 一种基于帧注意力机制的视频人脸情绪识别方法 | |
| CN111243572B (zh) | 基于说话人博弈的多人语音转换方法与系统 | |
| Bandela et al. | Unsupervised feature selection and NMF de-noising for robust Speech Emotion Recognition | |
| CN106847309A (zh) | 一种语音情感识别方法 | |
| Cetin | Accent recognition using a spectrogram image feature-based convolutional neural network | |
| CN103996155A (zh) | 智能交互及心理慰藉机器人服务系统 | |
| Xia et al. | Audiovisual speech recognition: A review and forecast | |
| Wei et al. | A novel speech emotion recognition algorithm based on wavelet kernel sparse classifier in stacked deep auto-encoder model | |
| JP2015175859A (ja) | パターン認識装置、パターン認識方法及びパターン認識プログラム | |
| Tong | Automatic assessment of dysarthric severity level using audio-video cross-modal approach in deep learning | |
| CN110136726A (zh) | 一种语音性别的估计方法、装置、系统及存储介质 | |
| CN114913871B (zh) | 目标对象分类方法、系统、电子设备及存储介质 | |
| CN117976006A (zh) | 音频处理方法、装置、计算机设备和存储介质 | |
| CN116434759B (zh) | 一种基于srs-cl网络的说话人识别方法 | |
| Ke | Study on recognition and classification of English accents using deep learning algorithms | |
| CN118072749A (zh) | 一种语音转换方法、装置、设备及介质 | |
| Sun | Digital audio scene recognition method based on machine learning technology | |
| CN120220693A (zh) | 声纹识别方法、装置、电子设备及存储介质 | |
| CN118038887A (zh) | 一种混合语音的处理方法、装置、计算机设备及存储介质 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| 121 | Ep: the epo has been informed by wipo that ep was designated in this application |
Ref document number: 14893660 Country of ref document: EP Kind code of ref document: A1 |
|
| NENP | Non-entry into the national phase |
Ref country code: DE |
|
| 122 | Ep: pct application non-entry in european phase |
Ref document number: 14893660 Country of ref document: EP Kind code of ref document: A1 |
