CN119274591B - 基于人工智能的语音情感分析方法及系统 - Google Patents

基于人工智能的语音情感分析方法及系统 Download PDF

Info

Publication number
CN119274591B
CN119274591B CN202411732447.8A CN202411732447A CN119274591B CN 119274591 B CN119274591 B CN 119274591B CN 202411732447 A CN202411732447 A CN 202411732447A CN 119274591 B CN119274591 B CN 119274591B
Authority
CN
China
Prior art keywords
audio
data
target user
collection
preset
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
CN202411732447.8A
Other languages
English (en)
Other versions
CN119274591A (zh
Inventor
林钦松
韩耀华
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Xinzhi Technology Jiangsu Co ltd
Original Assignee
Xinzhi Technology Jiangsu Co ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Xinzhi Technology Jiangsu Co ltd filed Critical Xinzhi Technology Jiangsu Co ltd
Priority to CN202411732447.8A priority Critical patent/CN119274591B/zh
Publication of CN119274591A publication Critical patent/CN119274591A/zh
Application granted granted Critical
Publication of CN119274591B publication Critical patent/CN119274591B/zh
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/48Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
    • G10L25/51Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination
    • G10L25/63Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination for estimating an emotional state
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/02Feature extraction for speech recognition; Selection of recognition unit
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/06Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
    • G10L15/063Training
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/06Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
    • G10L15/065Adaptation
    • G10L15/07Adaptation to the speaker
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/08Speech classification or search
    • G10L15/16Speech classification or search using artificial neural networks
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0208Noise filtering
    • G10L21/0216Noise filtering characterised by the method used for estimating noise
    • G10L21/0232Processing in the frequency domain
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • G10L2015/223Execution procedure of a spoken command

Landscapes

  • Engineering & Computer Science (AREA)
  • Health & Medical Sciences (AREA)
  • Acoustics & Sound (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Computational Linguistics (AREA)
  • Multimedia (AREA)
  • Artificial Intelligence (AREA)
  • Signal Processing (AREA)
  • Evolutionary Computation (AREA)
  • Quality & Reliability (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Child & Adolescent Psychology (AREA)
  • General Health & Medical Sciences (AREA)
  • Hospice & Palliative Care (AREA)
  • Psychiatry (AREA)
  • Measurement Of The Respiration, Hearing Ability, Form, And Blood Characteristics Of Living Organisms (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

本发明提供一种基于人工智能的语音情感分析方法及系统,其中,所述方法包括以下步骤:响应于在任一触发时刻接收到采集触发指令,建立音频采集任务,以基于所述音频采集任务进行对应目标用户的音频采集,得到音频采集数据;对所述音频采集数据进行预处理,得到音频优化数据;基于预设情感分析策略对所述音频优化数据进行情感分析,得到与所述音频优化数据对应的情感信息;基于所述情感信息确定与所述目标用户对应的情感状态,并基于所述情感状态确定是否需要对所述目标用户进行情感干预。本发明至少提高了客户满意度。

Description

基于人工智能的语音情感分析方法及系统
技术领域
本发明涉及数据处理技术,尤其涉及一种基于人工智能的语音情感分析方法及系统。
背景技术
在现代客户服务和心理健康评估中,了解用户的情绪状态对于提供个性化服务和及时干预至关重要。目前,情感分析主要依赖于文本数据,但忽视了语音中的情感信息。随着人工智能和深度学习技术的发展,语音情感分析成为可能,但现有系统在实时性和准确性上仍存在许多不足。
发明内容
基于上述问题,提出了本发明以便提供一种克服上述问题或者至少部分地解决上述问题的一种基于人工智能的语音情感分析方法及系统。
根据本发明的一个方面,提供一种基于人工智能的语音情感分析方法,包括以下步骤:
响应于在任一触发时刻接收到采集触发指令,建立音频采集任务,以基于所述音频采集任务进行对应目标用户的音频采集,得到音频采集数据;
对所述音频采集数据进行预处理,得到音频优化数据;
基于预设情感分析策略对所述音频优化数据进行情感分析,得到与所述音频优化数据对应的情感信息;
基于所述情感信息确定与所述目标用户对应的情感状态,并基于所述情感状态确定是否需要对所述目标用户进行情感干预。
可选地,在根据本发明的方法中,响应于在任一触发时刻接收到采集触发指令,建立音频采集任务,以基于所述音频采集任务进行对应目标用户的音频采集,得到音频采集数据,包括:
响应于在任一触发时刻接收到采集触发指令,建立音频采集任务,并调取与所述音频采集任务对应的预设采集指示音频进行输出;
响应于完成对所述预设采集指示音频的输出,触发预设音频采集面进行对应目标用户的音频采集,得到与所述目标用户对应的测试音频数据;
基于所述测试音频数据对所述目标用户进行测试评分,并基于得到的音频测试分值确定与所述目标用户对应的音频属性;
响应于所述目标用户的音频属性为正向评价属性,调取与所述音频采集任务对应的预设采集确定音频进行输出;
响应于完成对所述预设采集指示音频的输出,触发预设音频采集面进行对应目标用户的音频采集,得到与所述目标用户对应的音频采集数据;
或者,
响应于所述目标用户的音频属性为负向评价属性,基于所述测试音频数据创建当前调整音频,以作为更新后的预设采集指示音频再次进行输出。
可选地,在根据本发明的方法中,基于所述测试音频数据对所述目标用户进行测试评分,并基于得到的音频测试分值确定与所述目标用户对应的音频属性,包括:
基于所述测试音频数据确定所述目标用户与所述预设音频采集面之间的音频输出夹角,并基于音频输出夹角确定与所述目标用户对应的偏移评分;
基于所述测试音频数据确定与所述目标用户对应的音频输出分贝,并基于所述音频输出分贝确定与所述目标用户对应的音量评分;
对所述偏移评分以及音量评分进行融合计算,并将得到的与所述目标用户对应的音频测试分值与基准音频分值进行比较;
当所述音频测试分值小于所述基准音频分值时,将所述目标用户的输出属性确定为负向评价属性;
当所述音频测试分值大于等于所述基准音频分值时,将所述目标用户的输出属性确定为正向评价属性。
可选地,在根据本发明的方法中,响应于所述目标用户的音频属性为负向评价属性,基于所述测试音频数据创建当前调整音频,以作为更新后的预设采集指示音频再次进行输出,包括:
响应于所述目标用户的音频属性为负向评价属性,获取与所述目标用户对应的音频输出夹角以及音频输出分贝;
将所述音频输出夹角、音频输出分贝分别与调取的基准音频夹角、基准音频分贝进行差值计算,得到音频夹角差值以及音频分贝差值;
调取初始调整音频,其中,所述初始调整音频包括基准音频段以及穿插于所述基准音频段中的夹角填充槽位、分贝填充槽位;
基于所述音频夹角差值、音频分贝差值分别对所述夹角填充槽位、分贝填充槽位进行填充,得到当前调整音频;
将当前调整音频作为更新后的预设采集指示音频,并将所述预设采集指示音频基于所述预设音频采集面进行对应所述基准音频分贝的输出。
可选地,在根据本发明的方法中,对所述音频采集数据进行预处理,得到音频优化数据,包括:
基于预设频域滤波策略对所述音频采集数据进行噪声去除;
对经过噪声去除后的音频采集数据进行归一化处理;
响应于完成对所述音频采集数据的归一化处理,对完成归一化处理后的音频采集数据进行特征提取,得到与所述音频采集数据对应的音频优化数据。
可选地,在根据本发明的方法中,基于预设频域滤波策略对所述音频采集数据进行噪声去除,包括:
基于语音活动检测对所述音频采集数据进行噪声类型的确定,得到与所述音频采集数据对应的噪声特性;
对所述音频采集数据分别进行包括数据分割、信号加窗的信号预处理,得到对应时域的音频采集数据;
对经过信号预处理的音频采集数据进行频域转换,得到对应所述频域的音频采集数据;
对对应所述频域的音频采集数据进行滤波处理,并将经过所述滤波处理后的音频采集数据进行时域转换,得到对应所述时域的音频采集数据;
对对应所述时域的音频采集数据进行性能评估,得到域所述音频采集数据对应的感知质量,并响应于所述感知质量满足预设输出条件,完成对所述音频采集数据的噪声去除。
可选地,在根据本发明的方法中,对经过噪声去除后的音频采集数据进行归一化处理,包括:
对经过噪声去除后的音频采集数据进行分帧处理,并将经过分帧处理后的音频采集数据进行加窗处理;
对经过加窗处理后的音频采集数据进行均值、标准差的计算,并将得到的对应所述音频采集数据的均值、标准差代入以下公式对所述音频采集数据进行归一化处理:
其中,( X ) 为经过加窗处理的音频采集数据,( \mu ) 为均值,( \sigma ) 为标准差,( X_{\text{norm}} ) 为经过归一化处理后的音频采集数据。
可选地,在根据本发明的方法中,响应于完成对所述音频采集数据的归一化处理,对完成归一化处理后的音频采集数据进行特征提取,得到与所述音频采集数据对应的音频优化数据,包括:
响应于完成对所述音频采集数据的归一化处理,对经过归一化处理后的音频采集数据进行分帧处理,并将经过分帧处理后的音频采集数据进行加窗处理;
对经过所述加窗处理后的音频采集数据进行快速傅立叶变换,以将对应时域的音频采集数据转换为对应频域的音频采集数据;
对对应频域的音频采集数据进行特征提取,得到对应多维特征矩阵的音频优化数据。
可选地,在根据本发明的方法中,基于预设情感分析策略对所述音频优化数据进行情感分析,得到与所述音频优化数据对应的情感信息,包括:
基于循环神经网络以及卷积神经网络构建初始情感分析模型;
获取训练数据集,其中,所述训练数据集中包括各标注了不同情感类别的语音数据;
基于所述训练数据集对所述初始情感分析模型进行训练,得到训练后的当前情感分析模型;
将所述音频优化数据输入至所述当前情感分析模型中进行情感分析,得到对应不同情感类别的各置信度;
将对应置信度最高的情感状态确定为与所述音频优化数据对应的情感信息。
根据本发明的又一个方面,提供一种基于人工智能的语音情感分析系统,包括:
音频采集模块,被配置为响应于在任一触发时刻接收到采集触发指令,建立音频采集任务,以基于所述音频采集任务进行对应目标用户的音频采集,得到音频采集数据;
数据优化模块,被配置为对所述音频采集数据进行预处理,得到音频优化数据;
情感分析模块,被配置为基于预设情感分析策略对所述音频优化数据进行情感分析,得到与所述音频优化数据对应的情感信息;
情感干预模块,被配置为基于所述情感信息确定与所述目标用户对应的情感状态,并基于所述情感状态确定是否需要对所述目标用户进行情感干预。
根据本发明的方案,本发明可以通过获取目标用户的音频采集数据,并进一步对音频采集数据进行后续的预处理,以根据得到的音频优化数据来进行对目标用户的情感分析,从而对目标用户的情感状态进行确定,同时,根据获取的情感状态还能够确定是否需要进行相应的情感干预,以帮助目标用户能够处于正面情绪,提高对于目标用户的心理纠正效果;另外,对于客户服务方面来说,本发明能够实时监控客户情绪,优化客服沟通策略,提升客户满意度;对于心理健康方面来说,本发明能够监控和分析用户的情绪变化,辅助心理健康诊断和干预;对于教育领域来说,本发明能够通过分析学生的情感状态,优化教学方法,提高教学效果;对于智能家居来说,本发明能够通过理解和响应用户的情感,提高人机交互的自然性和亲和力;而对于市场调研来说,本发明则可以通过分析消费者的情感反应,改进产品和服务。
附图说明
图1示出了根据本发明一个实施例的基于人工智能的语音情感分析方法的流程图;
图2示出了本实施例的应用场景图;
图3示出了根据本发明另一个实施例的基于人工智能的语音情感分析系统的结构框图。
具体实施方式
下面将参照附图更详细地描述本公开的示例性实施例。虽然附图中显示了本公开的示例性实施例,然而应当理解,可以以各种形式实现本公开而不应被这里阐述的实施例所限制。相反,提供这些实施例是为了能够更透彻地理解本公开,并且能够将本公开的范围完整的传达给本领域的技术人员。
在现代客户服务和心理健康评估中,了解用户的情绪状态对于提供个性化服务和及时干预至关重要。目前,情感分析主要依赖于文本数据,但忽视了语音中的情感信息。随着人工智能和深度学习技术的发展,语音情感分析成为可能,但现有系统在实时性和准确性上仍存在许多不足。
为解决上述现有技术中存在的问题,发明人提出本发明的方案。本发明的一个实施例提供了一种基于人工智能的语音情感分析方法,该方法可以在计算设备中执行,其中,计算设备可以被理解为具有数据处理功能的终端,例如手机或者电脑。
如图1所示,本实施例提出的基于人工智能的语音情感分析方法始于步骤S102,在步骤S102中,包括以下内容:
响应于在任一触发时刻接收到采集触发指令,建立音频采集任务,以基于所述音频采集任务进行对应目标用户的音频采集,得到音频采集数据。
例如,在本实施例中,对于任一目标用户进行情感分析主要是依据目标用户的语音来进行的,因此,在需要进行相应情感分析时,需要对目标用户的语音进行相应采集,而为了保证语音采集的准确性在进行采集前,目标用户可以发送相应的采集触发指令来建立相应的音频采集任务,从而使得能够进一步的基于该音频采集任务来进行音频采集,从而得到对应的音频采集数据。
可以理解的是,在本实施例中,本实施例的语音情感分析方法可被烧结于相应的处理芯片中,并集成在对应的装置单元内,装置单元可具体为便携式音响,从而便于使用及收纳;上述的发送相应的采集触发指令可以具体为语音指令或者按键指令,当采集触发指令为语音指令时,可预先设置响应于的语音唤醒词,从而便于对处理芯片进行唤醒并进行相应的语音采集;而采集触发指令为按键指令时,则可以通过设置相应的物理按键来对处理芯片进行唤醒并进行相应的语音采集。
例如,图2示出了本实施例的应用场景图,基于图2内容可以看出用户输出的音频被装置单元进行接收。
进一步,在本实施例中,上述的“响应于在任一触发时刻接收到采集触发指令,建立音频采集任务,以基于所述音频采集任务进行对应目标用户的音频采集,得到音频采集数据”,还可以包括以下步骤:
响应于在任一触发时刻接收到采集触发指令,建立音频采集任务,并调取与所述音频采集任务对应的预设采集指示音频进行输出;
响应于完成对所述预设采集指示音频的输出,触发预设音频采集面进行对应目标用户的音频采集,得到与所述目标用户对应的测试音频数据;
基于所述测试音频数据对所述目标用户进行测试评分,并基于得到的音频测试分值确定与所述目标用户对应的音频属性;
响应于所述目标用户的音频属性为正向评价属性,调取与所述音频采集任务对应的预设采集确定音频进行输出;
响应于完成对所述预设采集指示音频的输出,触发预设音频采集面进行对应目标用户的音频采集,得到与所述目标用户对应的音频采集数据;
或者,
响应于所述目标用户的音频属性为负向评价属性,基于所述测试音频数据创建当前调整音频,以作为更新后的预设采集指示音频再次进行输出。
例如,在本实施例中,在进行相应情感分析时,处理芯片会持续处于工作状态,而当在任一触发时刻接收到对应的采集触发指令后,处理芯片会相应的建立音频采集任务,这时,也即表明开始准备进行相应的情感分析工作;在完成对于音频采集任务的建立后,则可以基于音频采集任务来调取对应的预设采集指示音频进行输出,在这里,预设采集指示音频可以被理解为用于指示目标用户发出相应声音以确定当前环境或者用户当前位置是否适合进行 相应的情感评价,因此预设采集指示音频可以包括对应“请进行测试讲话”的音频内容;
在完成对预设采集指示音频的输出后,对应的预设音频采集面即可开始进行音频采集,从而得到与目标用户对应的测试音频数据,由上述内容可知,处理芯片可以被集成在对应的装置单元内,因此,预设音频采集面可以被理解为对应装置单元的采集面;
在得到与目标用户对应的测试音频数据后,则可以基于该内容进行相应的测试评分,在这里,测试音频数据可以被理解为目标用户随意讲话而形成的语音内容,其主要是用于测试获取的音频数据是否清楚或者准确,可以说明的是,由于声音的传播是具有方向性的,因此,当目标用户距离预设音频采集面过远,或者过于偏离时,都会影响相应的音频采集效果;
在完成对应的测试评分后,则可以根据得到的音频测试分值来确定与目标用户对应的音频属性,其中,音频属性可以包括正向评价属性以及负向评价属性,正向评价属性可以被理解为清楚或者准确,而负向评价属性则可以被理解为不清楚或不准确的音频数据;
当对应的音频属性为正向评价属性时,则表明目标用户输出的测试音频数据已经达标,可以开始正式的音频采集,这时,则可以触发预设音频采集面来进行对应目标用户的音频采集,得到用于进行情感评价的音频采集数据;
而当对应的音频属性为负向评价属性时。则表明目标用户输出的测试音频数据的对应音频质量没有达标,这时,因可以基于该测试音频数据来创建当前调整音频,以作为更新后的预设采集指示音频再次进行输出,帮助目标用户进行再次的音频测试。
更进一步的,在本实施例中,上述的“基于所述测试音频数据对所述目标用户进行测试评分,并基于得到的音频测试分值确定与所述目标用户对应的音频属性”,还可以包括以下步骤:
基于所述测试音频数据确定所述目标用户与所述预设音频采集面之间的音频输出夹角,并基于音频输出夹角确定与所述目标用户对应的偏移评分;
基于所述测试音频数据确定与所述目标用户对应的音频输出分贝,并基于所述音频输出分贝确定与所述目标用户对应的音量评分;
对所述偏移评分以及音量评分进行融合计算,并将得到的与所述目标用户对应的音频测试分值与基准音频分值进行比较;
当所述音频测试分值小于所述基准音频分值时,将所述目标用户的输出属性确定为负向评价属性;
当所述音频测试分值大于等于所述基准音频分值时,将所述目标用户的输出属性确定为正向评价属性。
例如,在本实施例中,可以说明的是,音频质量的影响条件包括音频距离以及音频偏移,其中,音频距离会影响对应的音频分贝,而音频偏移则会影响音频的立体感,基于此,则在目标用户的音频属性为负向评价属性时,可以获取与目标用户对应的音频输出夹角以及音频输出分贝,在这里,对应的音频输出夹角以及音频输出分贝都可以基于前述获取的测试音频数据进行获取;
在得到对应的音频输出夹角以及音频输出分贝后,则可以基于音频输出夹角以及音频输出分贝来分别进行偏移、音量的评分,从而得到对应的偏移评分以及音量评分,并经一步的进行融合计算,以此得到与目标用户对应的音量评分,在这里,对于偏移评分以及音量评分过程可基于随着偏移量变大、随着音量变大、而导致对应的评分变大的规律来进行评分;
完成对于音频测试分值的获取后,通过调取预先存储的基准音频分值,并将音频测试分值与基准音频分值进行分值比较,从而来确定与目标用户对应的输出属性。
更进一步的,在本实施例中,上述的“响应于所述目标用户的音频属性为负向评价属性,基于所述测试音频数据创建当前调整音频,以作为更新后的预设采集指示音频再次进行输出”,还可以包括以下步骤:
响应于所述目标用户的音频属性为负向评价属性,获取与所述目标用户对应的音频输出夹角以及音频输出分贝;
将所述音频输出夹角、音频输出分贝分别与调取的基准音频夹角、基准音频分贝进行差值计算,得到音频夹角差值以及音频分贝差值;
调取初始调整音频,其中,所述初始调整音频包括基准音频段以及穿插于所述基准音频段中的夹角填充槽位、分贝填充槽位;
基于所述音频夹角差值、音频分贝差值分别对所述夹角填充槽位、分贝填充槽位进行填充,得到当前调整音频;
将当前调整音频作为更新后的预设采集指示音频,并将所述预设采集指示音频基于所述预设音频采集面进行对应所述基准音频分贝的输出。
例如,在本实施例中,当目标用户对应的输出属性为负向评价属性时,则表明目标用户输出的测试音频数据是不达标的,这时,则需要对该目标用户进行相应的指示,以确保后续的情感分析具有较高的精准性,而对应的指示方式来如下所述:
首先,可以基于前述得到的音频输出夹角、音频输出分贝来分别与调取的基准音频夹角、基准音频分贝进行差值,从而得到对应的音频夹角差值以及音频分贝差值,需要说明的是,在正常情况下,当目标用户正对于预设音频采集面进行音频输出时,所获取的音频数据的立体感是最优的,因此,可以基于此来设置相应的基准音频夹角;同理,对应的基准音频分贝可设置为正常水平下的音频数值即可,例如为50分贝;
接着,在得到对应的音频夹角差值以及音频分贝差值后,则可以确定需要目标用户进行调整的音频范围,从而可以调取对应的初始调整音频,其中,初始调整音频主要包括基准音频段以及穿插于基准音频段中的夹角填充槽位以及分贝填充槽位,例如,初始调整音频可以为“尊敬的用户,您好,请将您的音频位置调整至「槽位A」、以及将音频分贝调整至「槽位B」”,槽位A即代表夹角填充槽位,槽位B即代表分贝填充槽位,通过将音频夹角差值以及音频分贝差值填充至对应的槽位中,从而可以实现对于音频的定制化处理,得到当前调整音频;
最后,通过经过定制化的处理来获取到对应的当前调整音频后则可以将该当前调整音频进行基于预设音频采集面的输出,并且在输出过程中对应的音量可基于基准音频分贝,以供目标用户进行参考,从而便于目标用户进行相应的测试调整,以快速获取相应的音频采集数据。
另外,对于上述提到的处理芯片可以基于以下的方式来进行配置:
(1)硬件配置
选择合适的麦克风和声卡,确保采集设备能够高质量捕获用户的语音信号。
麦克风:选择高灵敏度的麦克风,如电容麦克风或动态麦克风。
声卡:选择高性能的声卡,确保低延迟和高精度的模数转换。
(2)软件准备
安装和配置相关的音频采集库,例如Python中的PyAudio库,提供对音频设备的接口。
安装PyAudio:
在Python环境中安装PyAudio库
(3)实现实时音频采集
初始化音频流:
使用PyAudio库初始化音频流,设置采样率、通道数和缓冲区大小等参数。
(4)数据存储和管理
实时存储与处理:
实时存储采集到的音频数据,并进行简单的预处理,如降噪、分帧和加窗。
保存到文件:
将采集到的音频数据保存为音频文件,供后续处理和分析。
在步骤S104中,包括以下内容:
对所述音频采集数据进行预处理,得到音频优化数据。
例如,在本实施例中,由于需要基于采集得到的音频采集数据来进行相应的情感分析,因此,需要对音频采集数据进行预处理操作,从而得到相应的音频优化数据。
例如,在本实施例中,上述的“对所述音频采集数据进行预处理,得到音频优化数据”,可以包括以下内容:
基于预设频域滤波策略对所述音频采集数据进行噪声去除;
对经过噪声去除后的音频采集数据进行归一化处理;
响应于完成对所述音频采集数据的归一化处理,对完成归一化处理后的音频采集数据进行特征提取,得到与所述音频采集数据对应的音频优化数据。
下面,针对上述的预处理过程可作如下的详细介绍:
首先,针对上述的“基于预设频域滤波策略对所述音频采集数据进行噪声去除”,可采用以下方式进行:
基于语音活动检测对所述音频采集数据进行噪声类型的确定,得到与所述音频采集数据对应的噪声特性;
对所述音频采集数据分别进行包括数据分割、信号加窗的信号预处理,得到对应时域的音频采集数据;
对经过信号预处理的音频采集数据进行频域转换,得到对应所述频域的音频采集数据;
对对应所述频域的音频采集数据进行滤波处理,并将经过所述滤波处理后的音频采集数据进行时域转换,得到对应所述时域的音频采集数据;
对对应所述时域的音频采集数据进行性能评估,得到域所述音频采集数据对应的感知质量,并响应于所述感知质量满足预设输出条件,完成对所述音频采集数据的噪声去除。
例如,上述的过程可通过以下方法步骤来实现:
(1)噪声类型的识别
在处理语音信号时,不同类型的噪声会对信号的质量产生不同的影响。常见的噪声包括:
环境噪声:如背景讲话声、交通噪声等。
设备噪声:如录音设备自身产生的噪声。
电源噪声:如50Hz或60Hz的电源噪声(工频噪声)。
瞬态噪声:如咳嗽声、键盘敲击声等。
识别具体的噪声类型有助于选择合适的去噪方法。同时,也可以通过噪声估计方法,如基于语音活动检测(VAD)的噪声估计技术,来获取噪声特性。
(2)信号预处理
在进行频域处理之前,通常需要对语音信号进行一些基本的预处理操作,如分帧和加窗:
分帧:将长时间的语音信号分割成若干帧,每帧大小通常为20-40 ms,帧移为10-20 ms。这样可以减少动态范围并便于短时傅里叶变换(STFT)的计算。
加窗:在每一帧信号上应用一个窗函数(如Hamming窗或Hanning窗),减小频谱泄漏现象。窗口函数的公式为:
(3)频域变换
将时域信号转换到频域,以便更有效地识别和处理噪声:
短时傅里叶变换(STFT):
其中,为输入信号,为窗函数,为FFT点数,为帧移量,分别为频率和时间索引。
(4)滤波器设计及应用
根据噪声的频率特性,设计并应用适当的滤波器来去除噪声:
带通滤波器:用于保留语音信号的主要频段(通常为300Hz至3400Hz),并去除低频(<300Hz)和高频(>3400Hz)噪声。带通滤波器的传递函数为:
其中,分别为带通滤波器的低频和高频截止频率。
自适应滤波器:如维纳滤波器,根据噪声和信号的统计特性自适应调整滤波器的系数。维纳滤波器的频域表达式为:
其中,分别为信号和噪声的功率谱密度。
(5)时域还原
将经过滤波处理的频域信号转换回时域信号:
逆短时傅里叶变换(ISTFT):
加窗和重叠相加:在逆变换过程中,每帧加窗,重叠部分相加,以还原完整的时域信号。
(6)性能评估
对去噪后的信号进行性能评估,以确保信号的质量:
信噪比(SNR):衡量去噪效果的一种常用量度。定义为去噪后信号的功率与残留噪声的功率之比:
语音质量评估(如PESQ):客观语音质量评估法,用于评估语音信号的感知质量。
用户听觉评估:通过主观听觉测试,确保去噪后的语音信号满足用户的感知质量。
通过上述几个步骤,可以有效地减少语音信号中的各种类型的噪声,确保语音信号的清晰度和准确性,为后续的特征提取和情感识别提供高质量的输入数据。
其次,针对上述的“对经过噪声去除后的音频采集数据进行归一化处理”,可采用以下方式进行:
对经过噪声去除后的音频采集数据进行分帧处理,并将经过分帧处理后的音频采集数据进行加窗处理;
对经过加窗处理后的音频采集数据进行均值、标准差的计算,并将得到的对应所述音频采集数据的均值、标准差代入以下公式对所述音频采集数据进行归一化处理:
其中,( X ) 为经过加窗处理的音频采集数据,( \mu ) 为均值,( \sigma ) 为标准差,( X_{\text{norm}} ) 为经过归一化处理后的音频采集数据。
例如,上述的过程可通过以下方法步骤来实现:
(1)数据准备
在进行归一化处理之前,需要确保输入的数据是适合处理和分析的。具体步骤如下:
分帧:将长时间的语音信号分割成若干帧。每帧的长度通常为20-40毫秒,帧移为10-20毫秒。这一步可以避免处理过长的信号片段。
加窗:在每一帧信号上应用窗函数(如Hamming窗或Hanning窗),减少频谱泄漏现象。窗口函数的公式为:
(2)均值和标准差计算
计算语音信号的均值和标准差是进行归一化处理的基础步骤。
计算均值:均值是信号样本的平均值,表示信号的集体中心位置。计算公式为:
其中,为第个样本,(N)为样本总数。
计算标准差:标准差表示信号样本的离散程度,计算公式为:
(3)归一化公式应用
使用先前计算的均值和标准差,将每个语音样本进行归一化处理。归一化将信号的振幅调整到一个标准范围,通常为零均值和单位方差。
归一化处理:针对每一个样本应用如下公式进行归一化处理:
为原始语音信号样本。
为均值。
为标准差。
( X_{\text{norm}} ) 为归一化后的样本。
归一化处理后的信号将具有零均值和单位方差,这有助于后续特征的提取和模型的高效训练。
(4)验证和性能评估
在归一化处理后,需要对处理结果进行验证和性能评估,以确保信号质量满足要求。
信号还原验证:检查归一化后的信号是否能通过反归一化处理还原到原始信号。
性能评估指标:使用偏度和峰度等统计指标评估信号的分布特性是否符合预期。
偏度(Skewness):评估信号分布的对称性,计算公式为:
峰度(Kurtosis):评估信号分布的平坦度,计算公式为:
归一化能够提高信号处理和分析的稳定性和一致性,确保语音特征在特征提取和模型训练中具有良好的表现。
最后,针对上述的“响应于完成对所述音频采集数据的归一化处理,对完成归一化处理后的音频采集数据进行特征提取,得到与所述音频采集数据对应的音频优化数据”,可采用以下方式进行:
响应于完成对所述音频采集数据的归一化处理,对经过归一化处理后的音频采集数据进行分帧处理,并将经过分帧处理后的音频采集数据进行加窗处理;
对经过所述加窗处理后的音频采集数据进行快速傅立叶变换,以将对应时域的音频采集数据转换为对应频域的音频采集数据;
对对应频域的音频采集数据进行特征提取,得到对应多维特征矩阵的音频优化数据。
例如,上述的过程可通过以下方法步骤来实现:
提取MFCC(梅尔频率倒谱系数)和其他有效的语音特征。
可以分为以下几个关键点:
分帧和加窗(Framing and Windowing)
快速傅里叶变换(FFT)(Fast Fourier Transform)
梅尔频率倒谱系数(MFCC) (Mel-Frequency Cepstral Coefficients)
Chroma特征 (Chroma Features)
调谐频率振荡系数(Tonnetz) (Tonnetz Features)
其他特征提取(如ZCR、STFT等)
特征提取详细介绍
(1)分帧和加窗(Framing and Windowing)
分帧和加窗是特征提取的第一步,用于将长时间的语音信号分割成小段,以便进一步处理。
分帧:将语音信号分割成若干帧,每帧的长度通常为20-40毫秒,帧移为10-20毫秒。每帧信号包含足够的信息,但又不会太长,避免处理复杂。
其中,(s[n])是原始信号,(M)是帧移量,(N)是窗口长度。
加窗:在每帧信号上应用窗函数(如Hamming窗或Hanning窗),减少频谱泄漏现象。窗口函数的公式为:
(2)快速傅里叶变换(FFT)(Fast Fourier Transform)
FFT将时域信号转换为频域信号,用于分析信号的频率成分。
计算FFT:对每帧应用快速傅里叶变换,得出频谱。
其中,是频谱,是输入信号,是FFT点数。
频谱计算:得到的频谱用于进一步的特征提取。
3. 梅尔频率倒谱系数(MFCC)(Mel-Frequency Cepstral Coefficients)
MFCC是捕捉人类听觉特性的主要特征,步骤如下:
Mel频率变换:将频谱转换为Mel尺度,Mel尺度更符合人耳的听觉特性。
Mel滤波器组:将Mel频率范围内的频谱能量通过一组三角滤波器进行加权求和,得到滤波后的频谱能量。
对数压缩:对滤波后的频谱能量取对数压缩,增强小信号,并减少动态范围。
其中,是滤波后的频谱能量,是对数压缩后的能量。
离散余弦变换(DCT):对对数压缩后的能量应用DCT,得到MFCC特征。
(4)Chroma特征(Chroma Features)
Chroma特征反映了音符的能量分布,有助于捕捉和声信息。
计算Chroma频谱:将频谱转换为12个等音高类能量值。
其中,是第个音高类的能量,是频谱,是属于第个音高类的频率索引集合。
归一化:将12维Chroma特征归一化,使得所有音高类的能量总和为1。
(5)调谐频率振荡系数(Tonnetz)(Tonnetz Features)
Tonnetz特征通过捕捉调谐频率关系,用于分析音调感知。
计算简谐振荡频率:通过频谱分析得到简谐振荡频率。
映射到时间序列:将简谐振荡频率映射到时间序列特征,用于捕捉音调变化信息。
(6)其他特征提取(如ZCR、STFT等)
过零率(ZCR, Zero-Crossing Rate):用于描述信号变化的速率,计算信号在零水平线上的过零次数。
短时傅里叶变换(STFT, Short-Time Fourier Transform):用于分析信号的时频特性。
在步骤S106中,包括以下内容:
基于预设情感分析策略对所述音频优化数据进行情感分析,得到与所述音频优化数据对应的情感信息。
例如,在本实施例中,在完成对于音频采集数据的预处理而得到对应的音频优化数据后,则可以基于预存的预设情感分析策略来对应音频优化数据进行相应的情感分析,从而得到与音频优化数据对应的情感信息。
进一步的,在本实施例中,上述的“基于预设情感分析策略对所述音频优化数据进行情感分析,得到与所述音频优化数据对应的情感信息”,可以包括以下步骤:
基于循环神经网络以及卷积神经网络构建初始情感分析模型;
获取训练数据集,其中,所述训练数据集中包括各标注了不同情感类别的语音数据;
基于所述训练数据集对所述初始情感分析模型进行训练,得到训练后的当前情感分析模型;
将所述音频优化数据输入至所述当前情感分析模型中进行情感分析,得到对应不同情感类别的各置信度;
将对应置信度最高的情感状态确定为与所述音频优化数据对应的情感信息。
例如,上述的过程可通过以下方法步骤来实现:
基于上述内容,在提取了MFCC、Chroma、Tonnetz等特征后,我们得到的是一个多维的特征矩阵。这个特征矩阵通常包含以下维度:
时间帧数:信号被分割成的帧数。
特征维度:每个特征向量的维度,如MFCC的维度。
假设我们提取了 N 帧,每帧的特征向量维度为 D,那么输入到神经网络模型的特征矩阵的形状为 (N, D)。
接下来,我们将特征矩阵输入到构建好的深度学习模型中。我们这里以一个包含CNN和RNN的混合模型为例。
循环神经网络层(LSTM Layer)
输入:池化后的特征图。
LSTM操作:处理时间序列特征,捕获长期依赖关系。
输出:时间序列的隐藏状态向量,形状为 (num_lstm_units)。
(1)模型处理过程
卷积层(Conv1D Layer)
输入:特征矩阵 (N, D)。
卷积操作:使用多个卷积核扫描输入特征矩阵,提取局部特征。卷积核的大小和数量可以调整。
激活函数:对卷积结果应用ReLU激活函数,增加非线性。
输出:卷积后的特征图,形状为 (N, num_filters)。
池化层(Pooling Layer)
输入:卷积后的特征图。
池化操作:下采样操作通常用最大池化(MaxPooling),减小特征图尺寸,提高计算效率。
输出:池化后的特征图,形状为 (N//2, num_filters)(如果池化窗口大小为2)。
全连接层(Dense Layer)
输入:LSTM的输出向量。
全连接操作:将输入特征映射到高维空间。
激活函数:应用ReLU激活函数。
输出:全连接层的输出向量。
输出层(Output Layer)
输入:全连接层的输出向量。
Softmax函数:将输出映射到情感类别的概率分布。
输出:每个情感类别的概率,形状为 (num_classes)。
(2)输出与情感识别结果
概率分布与情感类别
模型的输出是一个概率分布,表示每个情感类别的概率。通过选择概率最大的类别来确定当前的情感状态。
置信度计算
置信度是最高概率值,表示模型对预测结果的信心。
(3)情感判断逻辑
通过输出的情感类别和置信度,可以判断用户的情感状态。例如下示的表1(置信度确定表):
表1 置信度确定表
通过置信度的高低,可以了解模型对当前预测结果的信心,置信度高则说明模型对当前情感判断较为确定。
进一步,针对对于初始情感分析模型的构建以及训练过程可如下述:
针对循环神经网络来说,包括:
(1)RNN的基本结构
循环神经网络(RNN)是一种能够处理序列数据的神经网络,因为它们保留了先前输入的信息并使用这些信息来影响当前输入的处理结果。其基本结构包括:
输入层:接收输入序列数据。
隐藏层:RNN的核心部件,包含多个神经元,每个神经元都具有内部状态(记忆),并使用重复连接在时间步上共享参数。
输出层:生成当前时间步的输出。
RNN的核心部分是其隐藏层,隐藏层的状态通过以下公式进行更新:
其中:
是当前时间步的隐藏状态,
是当前时间步的输入,
是前一时间步的隐藏状态,
是需要学习的权重矩阵,
是偏置,
是激活函数,如tanh或ReLU。
(2)长短期记忆(LSTM)单元
LSTM单元是RNN的扩展版本,能够更好地捕捉长时间的依赖关系,通过引入门机制来控制信息流。
LSTM的结构包括以下几个主要部件:
遗忘门(Forget Gate):控制前一状态信息的保留或丢弃。
输入门(Input Gate):控制当前输入信息的写入。
候选状态(Cell State Candidate):生成新的候选记忆细胞状态。
输出门(Output Gate):控制输出到隐藏状态的信息。
LSTM单元的更新公式为:
更新细胞状态:
更新隐藏状态:
(3)门控循环单元(GRU)
GRU是另一种改进的RNN单元,与LSTM类似但结构更简单,包含两个门:
更新门(Update Gate):控制信息的更新。
重置门(Reset Gate):控制前一状态信息的重置程度。
GRU的更新公式为:
当前隐状态的候选版本:
更新隐藏状态:
(4)数据输入和处理步骤
RNN部分处理的数据是一系列的序列数据,每个时间步输入一个数据点。
输入数据:通常是由预处理模块提取的特征,如MFCC。每个时间步的输入表示为
初始化隐藏状态:RNN需要初始化隐藏状态,通常初始化为全零矢量。
前向传播:对每个时间步,计算隐藏状态和输出
具体步骤如下:
初始化:初始隐藏状态
时间步1:计算 ,得到输出
时间步2:计算 ,得到输出
...
时间步T:计算,得到最终输出
(5)模型训练和优化过程
损失函数:使用交叉熵损失函数衡量模型预测与实际标签之间的差异。
其中,是实际标签(one-hot编码),是模型预测概率。
梯度计算:使用反向传播算法,通过时间反向传播(Backpropagation ThroughTime,BPTT)计算损失对各参数的梯度。
优化算法:常用如Adam或RMSProp优化算法来更新模型参数。
其中, 是学习率,是在第t步的参数。
正则化技术:为了防止过拟合,常用Dropout等正则化技术。
其中, ( p ) 是保留激活单元的概率。
针对卷积神经网络,包括:
(1)CNN的基本概念与结构
卷积神经网络(CNN)是一种专为处理数据的空间结构而设计的神经网络,主要包括卷积层(Convolutional Layer)、池化层(Pooling Layer)和全连接层(Fully ConnectedLayer)。
卷积层:通过卷积操作提取局部特征,权重共享和稀疏连接使得卷积层适合处理高维数据。
池化层:减少特征维度,提高计算效率,同时具备一定的抗噪能力。
全连接层:将卷积和池化后的特征映射到目标空间,如情感分类任务中的情感标签。
(2)CNN各部分的详细流程
卷积层(Convolutional Layer)
卷积层通过卷积运算提取输入数据的局部特征,其公式为:
其中:
是卷积输出。
是输入特征。
是输入特征。
是偏置。
特征图的生成过程包括:
卷积操作:使用多个卷积核扫描输入数据,生成一组特征图(Feature Maps)。
激活函数:对卷积结果应用激活函数(如ReLU)引入非线性:
池化层(Pooling Layer)
池化层用于下采样特征图,提高特征表示的计算效率和抗噪能力。
常见的池化操作有最大池化(Max Pooling)和平均池化(Average Pooling)。
最大池化:
其中, 是池化窗口内的元素。
平均池化:
其中,( Z ) 是池化窗口的元素个数。
全连接层(Fully Connected Layer)
全连接层将卷积和池化后的特征映射到目标空间。
线性变换:
其中, 是权重,是池化输出,是偏置。
激活函数:
对线性变换后的结果应用激活函数(如ReLU或Softmax)。
(3)数据输入和处理步骤
为了使CNN能够处理语音数据,输入数据通常需要预处理和格式转换。
输入数据:通常是由预处理和特征提取模块得到的特征,如MFCC、Chroma等。这些特征通常以二维矩阵表示(如时间和频率维度)。
输入格式转换:将输入特征转化为适合卷积处理的数据格式。对于语音数据,输入维度通常是(通道数,高度,宽度),如单通道二维矩阵。
具体步骤如下:
数据预处理:将原始语音信号转换为特征矩阵。
卷积层处理:对输入特征矩阵进行卷积操作,提取局部特征。
池化层处理:对卷积后的特征进行下采样,提高计算效率。
全连接层输出:将池化后的特征映射到情感分类输出。
(4)模型训练和优化过程
损失函数
常用的损失函数为交叉熵损失函数,用于衡量预测结果与实际标签之间的差异:
其中,是实际标签(one-hot编码),是模型预测概率。
梯度计算和反向传播
CNN模型训练依赖于反向传播算法,通过计算损失对各参数的梯度来更新模型参数。
前向传播:计算输入经过每一层的输出。
反向传播:计算损失对每一层参数的梯度,并更新参数。
优化算法
常用的优化算法包括SGD(随机梯度下降)、Adam等,通过调整学习率来更新模型参数。
SGD:
其中,是学习率,是第t步的参数。
Adam:自适应学习率优化算法:
正则化技术
为了防止过拟合,常用的正则化技术包括Dropout、L2正则化等。
Dropout:在训练过程中随机丢弃一部分神经元,防止过拟合。
其中,( p ) 是保留激活单元的概率。
L2正则化:在损失函数中加入权重的L2范数,以防止模型过拟合。
其中,(\lambda) 是正则化系数。
在步骤S108中,包括以下内容:
基于所述情感信息确定与所述目标用户对应的情感状态,并基于所述情感状态确定是否需要对所述目标用户进行情感干预。
例如,在本实施例中,在获取上述的情感信息后,则可以该情感信息来对目标用户的情感状态进行确定,其中 ,情感状态可以包括正面情感、负面情感以及中性情感,正面情感可以包括快乐,负面情感可以包括悲伤、愤怒,而中性情感则可以包括平静;一般来说,当目标用户的情感状态为负面状态时,则需要基于该不良状态对目标用户的情感进行情感干预,以帮助改善目标用户的情感状态。
综上所述,根据本发明的方案,本发明可以通过获取目标用户的音频采集数据,并进一步对音频采集数据进行后续的预处理,以根据得到的音频优化数据来进行对目标用户的情感分析,从而对目标用户的情感状态进行确定,同时,根据获取的情感状态还能够确定是否需要进行相应的情感干预,以帮助目标用户能够处于正面情绪,提高对于目标用户的心理纠正效果;另外,对于客户服务方面来说,本发明能够实时监控客户情绪,优化客服沟通策略,提升客户满意度;对于心理健康方面来说,本发明能够监控和分析用户的情绪变化,辅助心理健康诊断和干预;对于教育领域来说,本发明能够通过分析学生的情感状态,优化教学方法,提高教学效果;对于智能家居来说,本发明能够通过理解和响应用户的情感,提高人机交互的自然性和亲和力;而对于市场调研来说,本发明则可以通过分析消费者的情感反应,改进产品和服务。
本发明的另一个实施例提供了一种基于人工智能的语音情感分析系统,图3为其对应系统框图,该系统包括:
音频采集模块,被配置为响应于在任一触发时刻接收到采集触发指令,建立音频采集任务,以基于所述音频采集任务进行对应目标用户的音频采集,得到音频采集数据;
数据优化模块,被配置为对所述音频采集数据进行预处理,得到音频优化数据;
情感分析模块,被配置为基于预设情感分析策略对所述音频优化数据进行情感分析,得到与所述音频优化数据对应的情感信息;
情感干预模块,被配置为基于所述情感信息确定与所述目标用户对应的情感状态,并基于所述情感状态确定是否需要对所述目标用户进行情感干预。
在此处所提供的说明书中,算法和显示不与任何特定计算机、虚拟系统或者其它设备固有相关。各种通用系统也可以与本发明的示例一起使用。根据上面的描述,构造这类系统所要求的结构是显而易见的。此外,本发明也不针对任何特定编程语言。应当明白,可以利用各种编程语言实现在此描述的本发明的内容,并且上面对特定语言所做的描述是为了披露本发明的较佳实施方式。
在此处所提供的说明书中,说明了大量具体细节。然而,能够理解,本发明的实施例可以在没有这些具体细节的情况下被实践。在一些实例中,并未详细示出公知的方法、结构和技术,以便不模糊对本说明书的理解。
类似地,应当理解,为了精简本公开并帮助理解各个发明方面中的一个或多个,在上面对本发明的示例性实施例的描述中,本发明的各个特征有时被一起分组到单个实施例、图、或者对其的描述中。
本领域那些技术人员应当理解在本文所公开的示例中的设备的模块或单元或组件可以布置在如该实施例中所描述的设备中,或者可替换地可以定位在与该示例中的设备不同的一个或多个设备中。前述示例中的模块可以组合为一个模块或者此外可以分成多个子模块。
本领域那些技术人员可以理解,可以对实施例中的设备中的模块进行自适应性地改变并且把它们设置在与该实施例不同的一个或多个设备中。可以把实施例中的模块或单元或组件组合成一个模块或单元或组件,以及此外可以把它们分成多个子模块或子单元或子组件。
此外,本领域的技术人员能够理解,尽管在此所述的一些实施例包括其它实施例中所包括的某些特征而不是其它特征,但是不同实施例的特征的组合意味着处于本发明的范围之内并且形成不同的实施例。
此外,所述实施例中的一些在此被描述成可以由计算机系统的处理器或者由执行所述功能的其它装置实施的方法或方法元素的组合。因此,具有用于实施所述方法或方法元素的必要指令的处理器形成用于实施该方法或方法元素的装置。此外,装置实施例的在此所述的元素是如下装置的例子:该装置用于实施由为了实施该发明的目的的元素所执行的功能。
如在此所使用的那样,除非另行规定,使用序数词“第一”、“第二”、“第三”等等来描述普通对象仅仅表示涉及类似对象的不同实例,并且并不意图暗示这样被描述的对象必须具有时间上、空间上、排序方面或者以任意其它方式的给定顺序。
尽管根据有限数量的实施例描述了本发明,但是受益于上面的描述,本技术领域内的技术人员明白,在由此描述的本发明的范围内,可以设想其它实施例。此外,应当注意,本说明书中使用的语言主要是为了可读性和教导的目的而选择的,而不是为了解释或者限定本发明的主题而选择的。

Claims (8)

1.一种基于人工智能的语音情感分析方法,其特征在于,包括以下步骤:
响应于在任一触发时刻接收到采集触发指令,建立音频采集任务,以基于所述语音采集任务进行对应目标用户的音频采集,得到音频采集数据,包括:
响应于在任一触发时刻接收到采集触发指令,建立音频采集任务,并调取与所述音频采集任务对应的预设采集指示音频进行输出;
响应于完成对所述预设采集指示音频的输出,触发预设音频采集面进行对应目标用户的音频采集,得到与所述目标用户对应的测试音频数据;
基于所述测试音频数据对所述目标用户进行测试评分,并基于得到的音频测试分值确定与所述目标用户对应的音频属性;
基于所述测试音频数据确定所述目标用户与所述预设音频采集面之间的音频输出夹角,并基于音频输出夹角确定与所述目标用户对应的偏移评分;
基于所述测试音频数据确定与所述目标用户对应的音频输出分贝,并基于所述音频输出分贝确定与所述目标用户对应的音量评分;
对所述偏移评分以及音量评分进行融合计算,并将得到的与所述目标用户对应的音频测试分值与基准音频分值进行比较;
当所述音频测试分值小于所述基准音频分值时,将所述目标用户的输出属性确定为负向评价属性;
当所述音频测试分值大于等于所述基准音频分值时,将所述目标用户的输出属性确定为正向评价属性;
响应于所述目标用户的音频属性为正向评价属性,调取与所述音频采集任务对应的预设采集确定音频进行输出;
响应于完成对所述预设采集指示音频的输出,触发预设音频采集面进行对应目标用户的音频采集,得到与所述目标用户对应的音频采集数据;
或者,
响应于所述目标用户的音频属性为负向评价属性,基于所述测试音频数据创建当前调整音频,以作为更新后的预设采集指示音频再次进行输出;
对所述音频采集数据进行预处理,得到音频优化数据;
基于预设情感分析策略对所述音频优化数据进行情感分析,得到与所述音频优化数据对应的情感信息;
基于所述情感信息确定与所述目标用户对应的情感状态,并基于所述情感状态确定是否需要对所述目标用户进行情感干预。
2.根据权利要求1所述的基于人工智能的语音情感分析方法,其特征在于,
响应于所述目标用户的音频属性为负向评价属性,基于所述测试音频数据创建当前调整音频,以作为更新后的预设采集指示音频再次进行输出,包括:
响应于所述目标用户的音频属性为负向评价属性,获取与所述目标用户对应的音频输出夹角以及音频输出分贝;
将所述音频输出夹角、音频输出分贝分别与调取的基准音频夹角、基准音频分贝进行差值计算,得到音频夹角差值以及音频分贝差值;
调取初始调整音频,其中,所述初始调整音频包括基准音频段以及穿插于所述基准音频段中的夹角填充槽位、分贝填充槽位;
基于所述音频夹角差值、音频分贝差值分别对所述夹角填充槽位、分贝填充槽位进行填充,得到当前调整音频;
将当前调整音频作为更新后的预设采集指示音频,并将所述预设采集指示音频基于所述预设音频采集面进行对应所述基准音频分贝的输出。
3.根据权利要求1所述的基于人工智能的语音情感分析方法,其特征在于,
对所述音频采集数据进行预处理,得到音频优化数据,包括:
基于预设频域滤波策略对所述音频采集数据进行噪声去除;
对经过噪声去除后的音频采集数据进行归一化处理;
响应于完成对所述音频采集数据的归一化处理,对完成归一化处理后的音频采集数据进行特征提取,得到与所述音频采集数据对应的音频优化数据。
4.根据权利要求3所述的基于人工智能的语音情感分析方法,其特征在于,
基于预设频域滤波策略对所述音频采集数据进行噪声去除,包括:
基于语音活动检测对所述音频采集数据进行噪声类型的确定,得到与所述音频采集数据对应的噪声特性;
对所述音频采集数据分别进行包括数据分割、信号加窗的信号预处理,得到对应时域的音频采集数据;
对经过信号预处理的音频采集数据进行频域转换,得到对应所述频域的音频采集数据;
对对应所述频域的音频采集数据进行滤波处理,并将经过所述滤波处理后的音频采集数据进行时域转换,得到对应所述时域的音频采集数据;
对对应所述时域的音频采集数据进行性能评估,得到域所述音频采集数据对应的感知质量,并响应于所述感知质量满足预设输出条件,完成对所述音频采集数据的噪声去除。
5.根据权利要求3所述的基于人工智能的语音情感分析方法,其特征在于,
对经过噪声去除后的音频采集数据进行归一化处理,包括:
对经过噪声去除后的音频采集数据进行分帧处理,并将经过分帧处理后的音频采集数据进行加窗处理;
对经过加窗处理后的音频采集数据进行均值、标准差的计算,并将得到的对应所述音频采集数据的均值、标准差代入公式对所述音频采集数据进行归一化处理。
6.根据权利要求3所述的基于人工智能的语音情感分析方法,其特征在于,
响应于完成对所述音频采集数据的归一化处理,对完成归一化处理后的音频采集数据进行特征提取,得到与所述音频采集数据对应的音频优化数据,包括:
响应于完成对所述音频采集数据的归一化处理,对经过归一化处理后的音频采集数据进行分帧处理,并将经过分帧处理后的音频采集数据进行加窗处理;
对经过所述加窗处理后的音频采集数据进行快速傅立叶变换,以将对应时域的音频采集数据转换为对应频域的音频采集数据;
对对应频域的音频采集数据进行特征提取,得到对应多维特征矩阵的音频优化数据。
7.根据权利要求1所述的基于人工智能的语音情感分析方法,其特征在于,
基于预设情感分析策略对所述音频优化数据进行情感分析,得到与所述音频优化数据对应的情感信息,包括:
基于循环神经网络以及卷积神经网络构建初始情感分析模型;
获取训练数据集,其中,所述训练数据集中包括各标注了不同情感类别的语音数据;
基于所述训练数据集对所述初始情感分析模型进行训练,得到训练后的当前情感分析模型;
将所述音频优化数据输入至所述当前情感分析模型中进行情感分析,得到对应不同情感类别的各置信度;
将对应置信度最高的情感状态确定为与所述音频优化数据对应的情感信息。
8.一种基于人工智能的语音情感分析系统,其特征在于,包括:
音频采集模块,被配置为响应于在任一触发时刻接收到采集触发指令,建立音频采集任务,以基于所述语音采集任务进行对应目标用户的音频采集,得到音频采集数据,包括:
响应于在任一触发时刻接收到采集触发指令,建立音频采集任务,并调取与所述音频采集任务对应的预设采集指示音频进行输出;
响应于完成对所述预设采集指示音频的输出,触发预设音频采集面进行对应目标用户的音频采集,得到与所述目标用户对应的测试音频数据;
基于所述测试音频数据对所述目标用户进行测试评分,并基于得到的音频测试分值确定与所述目标用户对应的音频属性;
基于所述测试音频数据确定所述目标用户与所述预设音频采集面之间的音频输出夹角,并基于音频输出夹角确定与所述目标用户对应的偏移评分;
基于所述测试音频数据确定与所述目标用户对应的音频输出分贝,并基于所述音频输出分贝确定与所述目标用户对应的音量评分;
对所述偏移评分以及音量评分进行融合计算,并将得到的与所述目标用户对应的音频测试分值与基准音频分值进行比较;
当所述音频测试分值小于所述基准音频分值时,将所述目标用户的输出属性确定为负向评价属性;
当所述音频测试分值大于等于所述基准音频分值时,将所述目标用户的输出属性确定为正向评价属性;
响应于所述目标用户的音频属性为正向评价属性,调取与所述音频采集任务对应的预设采集确定音频进行输出;
响应于完成对所述预设采集指示音频的输出,触发预设音频采集面进行对应目标用户的音频采集,得到与所述目标用户对应的音频采集数据;
或者,
响应于所述目标用户的音频属性为负向评价属性,基于所述测试音频数据创建当前调整音频,以作为更新后的预设采集指示音频再次进行输出;
数据优化模块,被配置为对所述音频采集数据进行预处理,得到音频优化数据;
情感分析模块,被配置为基于预设情感分析策略对所述音频优化数据进行情感分析,得到与所述音频优化数据对应的情感信息;
情感干预模块,被配置为基于所述情感信息确定与所述目标用户对应的情感状态,并基于所述情感状态确定是否需要对所述目标用户进行情感干预。
CN202411732447.8A 2024-11-29 2024-11-29 基于人工智能的语音情感分析方法及系统 Active CN119274591B (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN202411732447.8A CN119274591B (zh) 2024-11-29 2024-11-29 基于人工智能的语音情感分析方法及系统

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN202411732447.8A CN119274591B (zh) 2024-11-29 2024-11-29 基于人工智能的语音情感分析方法及系统

Publications (2)

Publication Number Publication Date
CN119274591A CN119274591A (zh) 2025-01-07
CN119274591B true CN119274591B (zh) 2025-05-02

Family

ID=94105952

Family Applications (1)

Application Number Title Priority Date Filing Date
CN202411732447.8A Active CN119274591B (zh) 2024-11-29 2024-11-29 基于人工智能的语音情感分析方法及系统

Country Status (1)

Country Link
CN (1) CN119274591B (zh)

Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN113611286A (zh) * 2021-10-08 2021-11-05 之江实验室 一种基于共性特征提取的跨语种语音情感识别方法和系统
CN114299995A (zh) * 2021-12-29 2022-04-08 上海理工大学 一种用于情绪评估的语言情感识别方法

Family Cites Families (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN108346436B (zh) * 2017-08-22 2020-06-23 腾讯科技(深圳)有限公司 语音情感检测方法、装置、计算机设备及存储介质
US10481858B2 (en) * 2017-12-06 2019-11-19 Harman International Industries, Incorporated Generating personalized audio content based on mood
CN111489522A (zh) * 2020-05-29 2020-08-04 北京百度网讯科技有限公司 用于输出信息的方法、装置和系统
CN118197303B (zh) * 2024-01-18 2024-08-23 无锡职业技术学院 一种智能语音识别与情感分析系统及方法
CN118675501B (zh) * 2024-08-21 2024-11-12 深圳市贝铂智能科技有限公司 基于情感感知ai模型的多语言语音识别方法、装置以及设备

Patent Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN113611286A (zh) * 2021-10-08 2021-11-05 之江实验室 一种基于共性特征提取的跨语种语音情感识别方法和系统
CN114299995A (zh) * 2021-12-29 2022-04-08 上海理工大学 一种用于情绪评估的语言情感识别方法

Also Published As

Publication number Publication date
CN119274591A (zh) 2025-01-07

Similar Documents

Publication Publication Date Title
CN112259106B (zh) 声纹识别方法、装置、存储介质及计算机设备
CN110491416B (zh) 一种基于lstm和sae的电话语音情感分析与识别方法
WO2021208287A1 (zh) 用于情绪识别的语音端点检测方法、装置、电子设备及存储介质
CN113223536B (zh) 声纹识别方法、装置及终端设备
CN111933185A (zh) 基于知识蒸馏的肺音分类方法、系统、终端及存储介质
CN109243490A (zh) 司机情绪识别方法及终端设备
CN118351881A (zh) 一种基于降噪水声信号的融合特征分类识别方法
CN108962231B (zh) 一种语音分类方法、装置、服务器及存储介质
CN110047510A (zh) 音频识别方法、装置、计算机设备及存储介质
CN111932056A (zh) 客服质量评分方法、装置、计算机设备和存储介质
CN117762372A (zh) 一种多模态人机交互系统
CN116741148A (zh) 一种基于数字孪生的语音识别系统
CN114302301B (zh) 频响校正方法及相关产品
CN115064175A (zh) 一种说话人识别方法
CN116230017B (zh) 语音评估方法、装置、计算机设备和存储介质
Sun et al. A novel convolutional neural network voiceprint recognition method based on improved pooling method and dropout idea
CN112951270A (zh) 语音流利度检测的方法、装置和电子设备
Cheng et al. DNN-based speech enhancement with self-attention on feature dimension
CN121331146A (zh) 一种小样本注册的区域性鸟类鸣声分类方法和相关设备
CN120656488A (zh) 情绪识别方法、装置、电子设备、存储介质及程序产品
CN120356488A (zh) 一种语音情绪识别方法、装置、设备及可读存储介质
CN120544612A (zh) 一种无监督学习的语音质量评价方法、装置、设备及介质
CN120220693A (zh) 声纹识别方法、装置、电子设备及存储介质
CN117393000B (zh) 一种基于神经网络和特征融合的合成语音检测方法
CN119811428A (zh) 一种无人机声音识别方法及装置

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination
GR01 Patent grant
GR01 Patent grant