WO2020151155A1 - 建立阿兹海默症检测模型的方法和装置 - Google Patents
建立阿兹海默症检测模型的方法和装置 Download PDFInfo
- Publication number
- WO2020151155A1 WO2020151155A1 PCT/CN2019/089829 CN2019089829W WO2020151155A1 WO 2020151155 A1 WO2020151155 A1 WO 2020151155A1 CN 2019089829 W CN2019089829 W CN 2019089829W WO 2020151155 A1 WO2020151155 A1 WO 2020151155A1
- Authority
- WO
- WIPO (PCT)
- Prior art keywords
- speech
- sample
- alzheimer
- segment
- disease detection
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Ceased
Links
Images
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/02—Feature extraction for speech recognition; Selection of recognition unit
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/27—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the analysis technique
- G10L25/30—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the analysis technique using neural networks
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/48—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
- G10L25/51—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination
- G10L25/66—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination for extracting parameters related to health condition
-
- G—PHYSICS
- G16—INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
- G16H—HEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
- G16H50/00—ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics
- G16H50/20—ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics for computer-aided diagnosis, e.g. based on medical expert systems
Definitions
- the most common diagnosis method is to monitor the patient's medical history and perform cognitive tests (such as picture description tasks), mental state tests, and emotional tests on the patient. In medicine, this diagnosis process can last for several weeks and is very difficult to carry out. This method of diagnosing patients based on the experience of medical experts is inefficient in predicting symptoms.
- the method further includes: acquiring a target speech speech segment of the target user, the target speech speech segment including a speech description of the target image by the target user; and a speech segment for the target speech Perform feature extraction to obtain audio features of the target speech speech segment; determine the Alzheimer's disease detection result of the target user according to the audio feature of the target speech speech segment and the Alzheimer's disease detection model.
- the first extraction unit is configured to perform feature extraction on each sample speech speech segment to obtain the audio characteristics of each sample speech speech segment;
- the establishing unit is specifically configured to determine the audio characteristics of each sample speech segment, the Alzheimer's disease detection result of the sample user, the linear threshold, and the convolutional neural network.
- a network model to establish the Alzheimer's disease detection model is specifically configured to determine the audio characteristics of each sample speech segment, the Alzheimer's disease detection result of the sample user, the linear threshold, and the convolutional neural network.
- the Alzheimer’s disease detection model is established according to the audio characteristics of each sample speech segment, the Alzheimer’s disease detection result of the sample user, and the convolutional neural network model, and the Alzheimer’s disease
- the detection model is used to represent the mapping relationship between audio features and Alzheimer's detection results.
- multiple sample speech speech segments in S110 can be obtained through steps (1) to (4):
- the normalized result of the audio data is divided into the multiple sample speech speech segments.
- the sample speech speech segment may be a speech speech segment that has undergone fade-in and/or fade-out processing.
- OpenSMILE can be used to extract features, and OpenSMILE provides different configuration files to extract different features. Because patients with Alzheimer's disease are prone to depression, anxiety and sadness, it is difficult for them to express their emotions in rhythm, so the following feature groups (OpenSMILE profile names) are selected: IS09, IS10, IS11, IS12.
- LLDs are low-level descriptors, including pcm_RMSenergy (root mean square signal frame energy), mfcc (mel frequency cepstrum coefficient 1-12), PCM_zcr (time signal zero-crossing rate (based on frame)), voiceProb (calculated from ACF) Probability of utterance), F0 (fundamental frequency calculated from cepstrum), etc.
- the Murk disease detection model is used to represent the mapping relationship between audio features and Alzheimer's disease detection results.
- the Alzheimer's disease detection model is based on a model obtained by convolutional neural network training on sample data, and this model can be used to predict whether the sound in the audio data has Alzheimer's disease.
- a maximum pooling layer can be added.
- the output of the last convolutional layer changes from a two-dimensional array to a one-dimensional feature vector array
- a fully connected layer can be added after the pooling layer, and the one-dimensional feature vector vector output by the pooling layer will be used as the input of the fully connected layer with the linear rectification function as the activation equation.
- This fully connected layer contains 256 neurons.
- batch normalization and random initial values of weights are also used for one layer.
- the output layer consists of 1 sigmoid function
- the hidden neuron composition as the activation equation.
- the loss function is cross entropy, and the optimization algorithm is Adam. When training the network, the maximum number of iterations is set to 200.
- V c, d represents the (c, d) element of V
- V ⁇ R K ⁇ F is the weight matrix of the convolution kernel of the linear threshold
- e ⁇ R is the deviation of the linear threshold.
- the method for establishing the Alzheimer’s disease detection model and the method for detecting Alzheimer’s disease provided by the embodiments of the present application are described above with reference to FIGS. 1 and 2. The following will describe the methods provided by the embodiments of the present application in conjunction with FIGS. 3 to 6 A device for establishing an Alzheimer's disease detection model and an Alzheimer's disease detection device.
- the first acquiring unit is further configured to acquire a target speech speech segment of the target user, the target speech speech segment including a speech description of the target image by the target user; the first The extraction unit is also used to perform feature extraction on the target speech utterance segment to obtain the audio characteristics of the target speech utterance segment; the first determining unit is used to determine the audio characteristics of the target speech utterance segment and the The Alzheimer's disease detection model determines the Alzheimer's disease detection result of the target user.
- the establishing unit is specifically configured to determine the audio characteristics of each sample speech segment, the Alzheimer's disease detection result of the sample user, the linear threshold, and the convolutional neural network.
- a network model to establish the Alzheimer's disease detection model is specifically configured to determine the audio characteristics of each sample speech segment, the Alzheimer's disease detection result of the sample user, the linear threshold, and the convolutional neural network.
- FIG. 5 only shows a simplified design of the device 500.
- the device 500 may also include other necessary components, including but not limited to any number of communication interfaces, processors, controllers, memories, etc., and all devices that can implement the application are protected by the application. Within range.
- FIG. 6 only shows a simplified design of the device 600.
- the device 600 may also include other necessary elements, including but not limited to any number of communication interfaces, processors, controllers, memories, etc., and all devices that can implement the application are protected by the application. Within range.
Landscapes
- Engineering & Computer Science (AREA)
- Health & Medical Sciences (AREA)
- Public Health (AREA)
- Computational Linguistics (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Epidemiology (AREA)
- Biomedical Technology (AREA)
- Signal Processing (AREA)
- Medical Informatics (AREA)
- General Health & Medical Sciences (AREA)
- Pathology (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Data Mining & Analysis (AREA)
- Primary Health Care (AREA)
- Databases & Information Systems (AREA)
- Artificial Intelligence (AREA)
- Evolutionary Computation (AREA)
- Image Analysis (AREA)
- Measurement Of The Respiration, Hearing Ability, Form, And Blood Characteristics Of Living Organisms (AREA)
Abstract
一种建立阿兹海默症检测模型的方法和装置,包括:获取样本用户的多个样本语音说话段和样本用户的阿兹海默症检测结果,多个样本语音说话段中的每个样本语音说话段包括样本用户对样本图像的一段语音描述,阿兹海默症检测结果包括患病或未患病(S110);对每个样本语音说话段进行特征提取,得到每个样本语音说话段的音频特征(S120);根据每个样本语音说话段的音频特征、样本用户的阿兹海默症检测结果和卷积神经网络模型,建立阿兹海默症检测模型,阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系(S130)。
Description
相关申请的交叉引用
本申请申明享有2019年01月22日递交的申请号为CN201910059489.2、名称为“建立阿兹海默症检测模型的方法和装置”的中国专利申请的优先权,该中国专利申请的整体内容以参考的方式结合在本申请中。
本申请涉及智能决策领域,并且更具体地,涉及智能决策领域中建立阿兹海默症检测模型的方法和装置。
阿兹海默症是引起痴呆最常见的一种原因,它是一种由中枢神经系统中的神经元退化甚至死亡而引起的神经退化性疾病。患有阿兹海默症的病人最显著的特征是记忆丢失,他们很容易变得情感淡漠和抑郁。
老年人中得阿兹海默症的人越来愈多,最常见诊断方法是监测病人的病史,给病人做认知型的测试(例如图片描述任务),心理状态测试,情绪测试等。在医学上这种诊断过程会持续几周,进行起来非常困难。这种依赖医学专家的经验诊断病患的方法预测病症的效率较低。
因此,需要提供一种能够得到有效检测人是否患有阿兹海默症的检测模型。
发明内容
本申请提供一种建立阿兹海默症检测模型的方法和装置,能够得到有效检测人是否患有阿兹海默症的检测模型。
为实现上述目的,本申请提供一种建立阿兹海默症检测模型的方法,包括以下内容:
获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果,所述多个样本语音说话段中的每个样本语音说话段包括所述样本用户对样本图像的一段语音描述,所述阿兹海默症检测结果包括患病或未患病;
对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征;
根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷 积神经网络模型,建立所述阿兹海默症检测模型,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
在一种可能的实现方式中,在获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果之前,所述方法还包括:获取所述样本用户的音频数据、所述音频数据的采样位数和所述音频数据的字幕信息,所述音频数据包括所述样本用户对所述样本图像的多段语音描述;根据所述音频数据的采样位数,确定所述音频数据中每个样本点的dBFS值;根据所述音频数据中所有样本点的dBFS值的均值,对所述音频数据中每个样本点的dBFS值进行归一化处理,得到所述音频数据的归一化结果;根据所述音频数据的字幕信息,将音频数据的归一化结果分割成所述多个样本语音说话段。
在一种可能的实现方式中,所述每个样本语音说话段为经过淡入和/或淡出处理后的语音说话段。
在一种可能的实现方式中,对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征,包括:根据预设的配置文件对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征。
在一种可能的实现方式中,所述方法还包括:获取目标用户的目标语音说话段,所述目标语音说话段包括所述目标用户对目标图像的一段语音描述;对所述目标语音说话段进行特征提取,得到所述目标语音说话段的音频特征;根据所述目标语音说话段的音频特征和所述阿兹海默症检测模型,确定所述目标用户的阿兹海默症检测结果。
在一种可能的实现方式中,根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,包括:根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果、线性门限和所述卷积神经网络模型,建立所述阿兹海默症检测模型。
为实现上述目的,本申请还提供一种建立阿兹海默症检测模型的装置,该装置具体包括:
第一获取单元,用于获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果,所述多个样本语音说话段中的每个样本语音说话段包括所述样本用户对样本图像的一段语音描述,所述阿兹海默症检测结果包括患病或未患病;
第一提取单元,用于对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征;
建立单元,用于根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,所述阿兹海默症检测模 型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
在一种可能的实现方式中,所述装置还包括第一确定单元和第一处理单元;所述第一获取单元还用于在获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果之前,获取所述样本用户的音频数据、所述音频数据的采样位数和所述音频数据的字幕信息,所述音频数据包括所述样本用户对所述样本图像的多段语音描述;所述第一确定单元用于根据所述音频数据的采样位数,确定所述音频数据中每个样本点的dBFS值;所述第一处理单元用于根据所述音频数据中所有样本点的dBFS值的均值,对所述音频数据中每个样本点的dBFS值进行归一化处理,得到所述音频数据的归一化结果;根据所述音频数据的字幕信息,将音频数据的归一化结果分割成所述多个样本语音说话段。
在一种可能的实现方式中,所述每个样本语音说话段为经过淡入和/或淡出处理后的语音说话段。
在一种可能的实现方式中,所述第一提取单元具体用于根据预设的配置文件对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征。
在一种可能的实现方式中,所述第一获取单元还用于获取目标用户的目标语音说话段,所述目标语音说话段包括所述目标用户对目标图像的一段语音描述;所述第一提取单元还用于对所述目标语音说话段进行特征提取,得到所述目标语音说话段的音频特征;所述第一确定单元用于根据所述目标语音说话段的音频特征和所述阿兹海默症检测模型,确定所述目标用户的阿兹海默症检测结果。
在一种可能的实现方式中,所述建立单元具体用于根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果、线性门限和所述卷积神经网络模型,建立所述阿兹海默症检测模型。
为实现上述目的,本申请还提供一种阿兹海默症的检测装置,该装置具体包括:
第二获取单元,用于获取目标用户的目标语音说话段,所述目标语音说话段包括所述目标用户对目标图像的一段语音描述;
第二提取单元,用于对所述目标语音说话段进行特征提取,得到所述目标语音说话段的音频特征;
确定单元,用于根据所述目标语音说话段的音频特征和阿兹海默症检测模型,确定所述目标用户的阿兹海默症检测结果,所述阿兹海默症检测结果包括患病或未患病,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
在一种可能的实现方式中,该装置还包括建立单元;所述第二获取单元还用于获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果,所述多个样本语音 说话段中的每个样本语音说话段包括所述样本用户对样本图像的一段语音描述,所述阿兹海默症检测结果包括患病或未患病;所述第二提取单元还用于对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征;所述建立单元用于根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
在一种可能的实现方式中,所述装置还包括第二确定单元和第二处理单元;所述第二获取单元还用于在获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果之前,获取所述样本用户的音频数据、所述音频数据的采样位数和所述音频数据的字幕信息,所述音频数据包括所述样本用户对所述样本图像的多段语音描述;所述第二确定单元用于根据所述音频数据的采样位数,确定所述音频数据中每个样本点的dBFS值;所述第二处理单元用于根据所述音频数据中所有样本点的dBFS值的均值,对所述音频数据中每个样本点的dBFS值进行归一化处理,得到所述音频数据的归一化结果;根据所述音频数据的字幕信息,将音频数据的归一化结果分割成所述多个样本语音说话段。
在一种可能的实现方式中,所述每个样本语音说话段为经过淡入和/或淡出处理后的语音说话段。
在一种可能的实现方式中,所述第二提取单元具体用于用于根据预设的配置文件对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征。
在一种可能的实现方式中,所述建立单元具体用于根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果、线性门限和所述卷积神经网络模型,建立所述阿兹海默症检测模型。
为实现上述目的,本申请还提供一种计算机设备,包括存储器、处理器、通信接口以及存储在所述存储器上并可在所述处理器上运行的计算机程序,其中,所述存储器、所述处理器以及所述通信接口之间通过内部连接通路互相通信,所述处理器执行所述计算机程序时实现上述方法的以下步骤:
获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果,所述多个样本语音说话段中的每个样本语音说话段包括所述样本用户对样本图像的一段语音描述,所述阿兹海默症检测结果包括患病或未患病;
对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征;
根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,所述阿兹海默症检测模型用于表示音频 特征和阿兹海默症检测结果之间的映射关系。
为实现上述目的,本申请还提供另一种计算机设备,包括存储器、处理器、通信接口以及存储在所述存储器上并可在所述处理器上运行的计算机程序,其中,所述存储器、所述处理器以及所述通信接口之间通过内部连接通路互相通信,所述处理器执行所述计算机程序时实现上述方法的以下步骤:
获取目标用户的目标语音说话段,所述目标语音说话段包括所述目标用户对目标图像的一段语音描述;
对所述目标语音说话段进行特征提取,得到所述目标语音说话段的音频特征;
根据所述目标语音说话段的音频特征和阿兹海默症检测模型,确定所述目标用户的阿兹海默症检测结果,所述阿兹海默症检测结果包括患病或未患病,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
为实现上述目的,本申请还提供计算机可读存储介质,其上存储有计算机程序,所述计算机程序被处理器执行时实现上述方法的以下步骤:
获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果,所述多个样本语音说话段中的每个样本语音说话段包括所述样本用户对样本图像的一段语音描述,所述阿兹海默症检测结果包括患病或未患病;
对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征;
根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
为实现上述目的,本申请还提供另一计算机可读存储介质,其上存储有计算机程序,所述计算机程序被处理器执行时实现上述方法的以下步骤:
获取目标用户的目标语音说话段,所述目标语音说话段包括所述目标用户对目标图像的一段语音描述;对所述目标语音说话段进行特征提取,得到所述目标语音说话段的音频特征;根据所述目标语音说话段的音频特征和阿兹海默症检测模型,确定所述目标用户的阿兹海默症检测结果,所述阿兹海默症检测结果包括患病或未患病,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
采用本申请提供的建立阿兹海默症检测模型的方法、装置、计算机可读存储介质和计 算机设备,通过获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果;对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征;并根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,能够得到有效检测人是否患有阿兹海默症的检测模型。
此外,采用本申请建立的阿兹海默症检测模型能够有效监测人是否患有阿兹海默症。
图1是本申请实施例提供的建立阿兹海默症检测模型的方法的示意性流程图;
图2是本申请实施例提供的阿兹海默症的检测方法的示意性流程图;
图3是本申请实施例提供的建立阿兹海默症检测模型的装置的示意性框图;
图4是本申请实施例提供的阿兹海默症的检测装置的示意性框图;
图5是本申请实施例提供的另一建立阿兹海默症检测模型的装置的示意性框图;
图6是本申请实施例提供的另一阿兹海默症的检测装置的示意性框图。
为了使本申请的目的、技术方案及优点更加清楚明白,以下结合附图及实施例,对本申请进行进一步详细说明。应当理解,此处所描述的具体实施例仅用以解释本申请,并不用于限定本申请。基于本申请中的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他实施例,都属于本申请保护的范围。
图1示出了本申请实施例提供的建立阿兹海默症检测模型的方法100的示意性流程图。应理解,该方法100可以由建立阿兹海默症检测模型的装置执行。
可选地,该装置可以为计算机,或者可以为计算机中的功能模块,本申请实施例对此不作限定。
S110,获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果,所述多个样本语音说话段中的每个样本语音说话段包括所述样本用户对样本图像的一段语音描述,所述阿兹海默症检测结果包括患病或未患病。
具体地,S110中的多个样本语音说话段可以通过步骤(1)至(4)获取到:
获取所述样本用户的音频数据、所述音频数据的采样位数和所述音频数据的字幕信息,所述音频数据包括所述样本用户对所述样本图像的多段语音描述。
应理解,采样位数可以理解为声卡处理声音的解析度。这个数值越大,解析度就越高, 录制和回放的声音就越真实。电脑中的声音文件是用数字0和1来表示的。所以在电脑上录音的本质就是把模拟声音信号转换成数字信号。反之,在播放时则是把数字信号还原成模拟声音信号输出。
还应理解,声卡的位是指声卡在采集和播放声音文件时所使用数字声音信号的二进制位数。声卡的位客观地反映了数字声音信号对输入声音信号描述的准确程度。8位代表2的8次方——256,16位则代表2的16次方——64K。一段相同的音乐信息,16位声卡能把它分为64K个精度单位进行处理,而8位声卡只能处理256个精度单位,造成了较大的信号损失,最终的采样效果自然是无法相提并论的。
(2)根据所述音频数据的采样位数,确定所述音频数据中每个样本点的dBFS(decibels full scale,满量程分贝)值。
(3)根据所述音频数据中所有样本点的dBFS值的均值,对所述音频数据中每个样本点的dBFS值进行归一化处理,得到所述音频数据的归一化结果。
也就是说,在步骤(2)至(3)中,将音频数据转成dBFS为单位的数值(dBFS是数字音频信号的电平,简称满度相对电平,以系统所能处理的最大量为基准定为0dBFS),然后计算所有dBFS值的均值,最后将所有dBFS值减去这个均值得到归一化结果。
例如:一个样本点的dBFS可以由以下公式得来:
dBFS=20*log10(样本点的绝对值/样本点的最大值)
其中,如果音频文件是16bit,那么最大值就是215=32768。
假设一个音频文件的dBFS值为-5,-10,-6,-5,-8,计算他们的平均值为-6.8,通过均值归一化后,得到该音频文件的dBFS值的归一化结果为1.8,-3.2,0.8,1.8,-1.2。
(4)根据所述音频数据的字幕信息,将音频数据的归一化结果分割成所述多个样本语音说话段。
在一种可能的实现方式中,可以通过开源语音处理工具webrtc中的静音检测功能来对音频数据的归一化结果做静音检测,输入是该音频数据的归一化结果,输出是二进制的列表,比如列表是[0111101000],其中每一个数代表这一帧是否是静音,0是静音,1是非静音。设定一个阈值10,代表如果有连续的10帧为0的话,我们就把他分成两段,前面的那一段就作为一个说话段。
可选地,还可以给所述多个样本语音说话段中的每个样本语音说话段加入预设时长的淡入处理和/或淡出处理,得到处理后的多个样本语音说话段。也就是说,所述样本语音说话段可以为经过淡入和/或淡出处理后的语音说话段。
应理解,淡入和淡出不是加入静音片段,而是使一段音频的最开始和最后变得更平滑,而不是突然的开始或结束。这个操作可以用已有的音频处理工具sox实现。
S120,对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征;
具体地,可以根据预设的配置文件对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征。
例如,可以采用OpenSMILE提取特征,OpenSMILE提供了不同的配置文件以用来提取不同的特征。因为阿兹海默症患者很容易抑郁、焦虑和悲伤,所以他们很难用韵律去表达他们的情感,所以选了以下特征组(OpenSMILE的配置文件名称):IS09,IS10,IS11,IS12。
以ISO9中的特征来举例说明,IS09包含对LLDs应用统计函数得到的384个特征。LLDs为低级描述符,他包括pcm_RMSenergy(均方根信号帧能量),mfcc(梅尔频率倒谱系数1-12),PCM_zcr(时间信号的过零率(基于帧)),voiceProb(从ACF计算的发声概率),F0(从倒频谱计算的基频)等。对LLDs应用的统计函数包括max(轮廓的最大值),min(轮廓的最小值),range(轮廓的最大值-轮廓的最小值),maxPos(最大值的绝对位置(以帧为单位)),minPos(最小值的绝对位置(以帧为单位)),amean(轮廓的算术平均值),linregc1(轮廓线性逼近的斜率),linregc2(轮廓线性逼近的偏移量),linregerrQ(计算的二次误差作为线性近似值和实际轮廓的差值),stddev(轮廓上的值的标准偏差),skewness(偏度)和kurtosis(峰度)。
S130,根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
可选地,可以通过一个二进制值0/1表示阿兹海默症检测结果,0代表并未患有阿兹海默症,1代表检测出患有阿兹海默症。
可选地,在S120中提取得到的所述每个样本语音说话段的音频特征和获取得到的所述样本用户的阿兹海默症检测结果会用做卷积神经网络模型的输入,经过卷积神经网络的计算和训练得到阿兹海默症检测模型。
应理解,该阿兹海默症检测模型是基于卷积神经网络通过对样本数据的训练得到的一个模型,用这个模型就可以预测音频数据中的声音是否患有阿兹海默症。
下面将详细介绍建立基于卷积神经网络的阿兹海默症检测模型的过程:
(a)获取样本用户的多个样本语音说话段,并得到所述每个样本语音说话段的音频特征X∈R
F×T,所述多个样本语音说话段中的每个样本语音说话段包括所述样本用户对样本图像的一段语音描述。
(b)将所述每个样本语音说话段的音频特征X∈R
F×T输入CNN,其中F代表特征向 量的维度,T代表每个样本语音说话段包括的帧数量。滑动窗口的维度是R
F×T,其中N是在时间轴上卷积核的窗口长度。卷积核和输入之间卷积的操作会有一个标量的输出。在时间i时,i=n+1,…,T,卷积层的输出(即每个样本语音说话段的样本用户的阿兹海默症检测结果)如公式(1)所示:
其中,b是偏差,g(.)是激活方程。x
c,d是输入X的第(c,d)个元素,w
c,d是权值矩阵W的第(c,d)个元素。W和b都是通过训练网络可以学习到。在时域,当卷积核滑过输入矩阵的时候,像上述公式一样,将两个矩阵的重叠元素相对应乘起来。利用线性整流函数(ReLU)作为激活方程g。这个网络同时也叫做延迟神经网路。
应理解,因为CNN的输入的维度需要是固定值,所以片段长度被设为数据库中最长的样本语音说话段的长度。对剩下的样本语音说话段,用零补齐。我们用K=64作为卷积核的数量,窗口长度设为N=3。最后得到的输出Y∈R
M×K,其中M是帧的个数,等于T-N+1。我们在激活函数前加批标准化,对每个卷积层使用随机的权重初始值。
可选地,在步骤(b)中的每个卷积层后,还可以加上一个最大池化层。最后一个卷积层的输出从二维数组变成一维特征向量数组,
例如,输出Y∈R
M×N将会变成一个向量Z∈R
O,其中O=M×N。
可选地,在池化层之后还可以加上一个全连接层,池化层输出的这个一维特征向量向量会作为以线性整流函数作为激活方程的全连接层的输入。这个全连接层含有256个神经元。同样,对着一层也用批标准化和随机的权重初始值。此外,在输出层之前用dropout=0.5(随机去掉50%的神经元)。输出层由1个用sigmoid函数
作为激活方程的隐含神经元组成。损失函数是交叉熵,优化算法是Adam。训练网络时,最大迭代次数设为200。
综上所述,经过公式(1)之后可以得到该基于卷及神经网络的阿兹海默症检测模型。
可选地,S130可以包括:根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果、线性门限和所述卷积神经网络模型,建立所述阿兹海默症检测模型。
也就是说,将门限机制应用到卷积神经网络模型中,其核心在于为卷积的激活值添加一个门限开关,来决定其有多大的概率传到下一层去。门限的作用是有一些卷积的神经元输出的值没有什么作用甚至会起到反作用,所以要把他们删掉。
应理解,建立基于添加门限开关的卷积神经网络的阿兹海默症检测模型的具体训练方 法与上述基于卷积神经网络的阿兹海默症检测模型的训练的方法类似,区别在于:我们将每个样本语音说话段X∈R
T×F的LLD特征作为输入,用sigmoid函数作为激活方程g,同时乘上了一个线性门限。因此之前的公式(1)可以改进为公式(2):
其中,V
c,d表示V的第(c,d)个元素,V∈R
K×F是线性门限的卷积核权重矩阵,e∈R是线性门限的偏差。对于门限卷积神经网路,我们用N=2。
综上所述,经过公式(2)之后可以得到该基于添加门限开关的卷积神经网络的阿兹海默症检测模型。
可选地,所述方法还包括:获取目标用户的目标语音说话段,所述目标语音说话段包括所述目标用户对目标图像的一段语音描述;对所述目标语音说话段进行特征提取,得到所述目标语音说话段的音频特征;根据所述目标语音说话段的音频特征和所述阿兹海默症检测模型,确定所述目标用户的阿兹海默症检测结果。
图2示出了本申请实施例提供的阿兹海默症的检测方法200的示意性流程图。应理解,该方法200可以由阿兹海默症的检测装置执行。
可选地,该检测装置可以为具有计算机,或者可以为计算机中的功能模块,本申请实施例对此不作限定。
S210,获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果,所述多个样本语音说话段中的每个样本语音说话段包括所述样本用户对样本图像的一段语音描述,所述阿兹海默症检测结果包括患病或未患病;
S220,对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征;
S230,根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。;
S240,获取目标用户的目标语音说话段,所述目标语音说话段包括所述目标用户对目标图像的一段语音描述;
S250,对所述目标语音说话段进行特征提取,得到所述目标语音说话段的音频特征;
S260,根据所述目标语音说话段的音频特征和所述阿兹海默症检测模型,确定所述目标用户的阿兹海默症检测结果。
上面结合图1和图2介绍了本申请实施例提供的建立阿兹海默症检测模型的方法和阿兹海默症的检测方法,下面将结合图3至图6介绍本申请实施例提供的建立阿兹海默症检测模型的装置和阿兹海默症的检测装置。
图3示出了本申请实施例提供的建立阿兹海默症检测模型的装置300的示意性框图。该装置300包括:
第一获取单元310,用于获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果,所述多个样本语音说话段中的每个样本语音说话段包括所述样本用户对样本图像的一段语音描述,所述阿兹海默症检测结果包括患病或未患病;
第一提取单元320,用于对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征;
建立单元330,用于根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
在一种可能的实现方式中,所述装置还包括第一确定单元和第一处理单元;所述第一获取单元还用于在获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果之前,获取所述样本用户的音频数据、所述音频数据的采样位数和所述音频数据的字幕信息,所述音频数据包括所述样本用户对所述样本图像的多段语音描述;所述第一确定单元用于根据所述音频数据的采样位数,确定所述音频数据中每个样本点的dBFS值;所述第一处理单元用于根据所述音频数据中所有样本点的dBFS值的均值,对所述音频数据中每个样本点的dBFS值进行归一化处理,得到所述音频数据的归一化结果;根据所述音频数据的字幕信息,将音频数据的归一化结果分割成所述多个样本语音说话段。
在一种可能的实现方式中,所述每个样本语音说话段为经过淡入和/或淡出处理后的语音说话段。
在一种可能的实现方式中,所述第一提取单元具体用于根据预设的配置文件对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征。
在一种可能的实现方式中,所述第一获取单元还用于获取目标用户的目标语音说话段,所述目标语音说话段包括所述目标用户对目标图像的一段语音描述;所述第一提取单元还用于对所述目标语音说话段进行特征提取,得到所述目标语音说话段的音频特征;所述第一确定单元用于根据所述目标语音说话段的音频特征和所述阿兹海默症检测模型,确定所述目标用户的阿兹海默症检测结果。
在一种可能的实现方式中,所述建立单元具体用于根据所述每个样本语音说话段的音 频特征、所述样本用户的阿兹海默症检测结果、线性门限和所述卷积神经网络模型,建立所述阿兹海默症检测模型。
图4示出了本申请实施例提供的阿兹海默症的检测装置400的示意性框图。该装置400包括:
第二获取单元410,用于获取目标用户的目标语音说话段,所述目标语音说话段包括所述目标用户对目标图像的一段语音描述;
第二提取单元420,用于对所述目标语音说话段进行特征提取,得到所述目标语音说话段的音频特征;
确定单元430,用于根据所述目标语音说话段的音频特征和阿兹海默症检测模型,确定所述目标用户的阿兹海默症检测结果,所述阿兹海默症检测结果包括患病或未患病,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
在一种可能的实现方式中,该装置还包括建立单元;所述第二获取单元还用于获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果,所述多个样本语音说话段中的每个样本语音说话段包括所述样本用户对样本图像的一段语音描述,所述阿兹海默症检测结果包括患病或未患病;所述第二提取单元还用于对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征;所述建立单元用于根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
在一种可能的实现方式中,所述装置还包括第二确定单元和第二处理单元;所述第二获取单元还用于在获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果之前,获取所述样本用户的音频数据、所述音频数据的采样位数和所述音频数据的字幕信息,所述音频数据包括所述样本用户对所述样本图像的多段语音描述;所述第二确定单元用于根据所述音频数据的采样位数,确定所述音频数据中每个样本点的dBFS值;所述第二处理单元用于根据所述音频数据中所有样本点的dBFS值的均值,对所述音频数据中每个样本点的dBFS值进行归一化处理,得到所述音频数据的归一化结果;根据所述音频数据的字幕信息,将音频数据的归一化结果分割成所述多个样本语音说话段。
在一种可能的实现方式中,所述每个样本语音说话段为经过淡入和/或淡出处理后的语音说话段。
在一种可能的实现方式中,所述第二提取单元具体用于用于根据预设的配置文件对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征。
在一种可能的实现方式中,所述建立单元具体用于根据所述每个样本语音说话段的音 频特征、所述样本用户的阿兹海默症检测结果、线性门限和所述卷积神经网络模型,建立所述阿兹海默症检测模型。
图5示出了本申请实施例提供的建立阿兹海默症检测模型的装置500的示意性框图。该装置500可以为图3中所述的装置300,该装置500可以采用如图5所示的硬件架构。该装置500可以包括处理器510、通信接口520和存储器530,该处理器510、通信接口520和存储器530通过内部连接通路互相通信。图3中的第一提取单元320和建立单元330所实现的相关功能可以由图5中的处理器510来实现。图3中的第一获取单元310所实现的相关功能可以由图5中的处理器510控制通信接口520来实现。
该处理器510可以包括是一个或多个处理器,例如包括一个或多个中央处理单元(central processing unit,CPU),在处理器是一个CPU的情况下,该CPU可以是单核CPU,也可以是多核CPU。
该通信接口520用于输入和/或输出数据。该通信接口可以包括发送接口和接收接口,发送接口用于输出数据,接收接口用于输入数据。
该存储器530包括但不限于是随机存取存储器(random access memory,RAM)、只读存储器(read-only memory,ROM)、可擦除可编程存储器(erasable programmable read only memory,EPROM)、只读光盘(compact disc read-only memory,CD-ROM),该存储器530用于存储相关指令及数据。
存储器530用于存储该装置的程序代码和数据,可以为单独的器件或集成在处理器510中。
具体地,所述处理器510用于控制通信接口520调用存储器530中存储的代码指令并执行该代码指令。具体可参见方法实施例中的描述,在此不再赘述。
可以理解的是,图5仅仅示出了装置500的简化设计。在实际应用中,该装置500还可以分别包含必要的其他元件,包含但不限于任意数量的通信接口、处理器、控制器、存储器等,而所有可以实现本申请的装置都在本申请的保护范围之内。
在一种可能的设计中,该装置500可以被替换为芯片装置,例如可以为可用于该装置中的芯片,用于实现该装置中处理器510的相关功能。该芯片装置可以为实现相关功能的现场可编程门阵列,专用集成芯片,系统芯片,中央处理器,网络处理器,数字信号处理电路,微控制器,还可以采用可编程控制器或其他集成芯片。该芯片中,可选的可以包括一个或多个存储器,用于存储程序代码,当所述代码被执行时,使得处理器实现相应的功能。
图6示出了本申请实施例提供的阿兹海默症的检测装置600的示意性框图。该装置600可以为图4中所述的装置400,该装置600可以采用如图6所示的硬件架构。该装置600 可以包括处理器610、通信接口620和存储器630,该处理器610、通信接口620和存储器630通过内部连接通路互相通信。图4中的第二提取单元420和确定单元430所实现的相关功能可以由图6中的处理器610来实现。图4中的第二获取单元410所实现的相关功能可以由图6中的处理器610控制通信接口620来实现。
该处理器610可以包括是一个或多个处理器,例如包括一个或多个中央处理单元(central processing unit,CPU),在处理器是一个CPU的情况下,该CPU可以是单核CPU,也可以是多核CPU。
该通信接口620用于输入和/或输出数据。该通信接口可以包括发送接口和接收接口,发送接口用于输出数据,接收接口用于输入数据。
该存储器630包括但不限于是随机存取存储器(random access memory,RAM)、只读存储器(read-only memory,ROM)、可擦除可编程存储器(erasable programmable read only memory,EPROM)、只读光盘(compact disc read-only memory,CD-ROM),该存储器630用于存储相关指令及数据。
存储器630用于存储该装置的程序代码和数据,可以为单独的器件或集成在处理器610中。
具体地,所述处理器610用于控制通信接口620调用存储器630中存储的代码指令并执行该代码指令。具体可参见方法实施例中的描述,在此不再赘述。
可以理解的是,图6仅仅示出了装置600的简化设计。在实际应用中,该装置600还可以分别包含必要的其他元件,包含但不限于任意数量的通信接口、处理器、控制器、存储器等,而所有可以实现本申请的装置都在本申请的保护范围之内。
在一种可能的设计中,该装置600可以被替换为芯片装置,例如可以为可用于该装置中的芯片,用于实现该装置中处理器610的相关功能。该芯片装置可以为实现相关功能的现场可编程门阵列,专用集成芯片,系统芯片,中央处理器,网络处理器,数字信号处理电路,微控制器,还可以采用可编程控制器或其他集成芯片。该芯片中,可选的可以包括一个或多个存储器,用于存储程序代码,当所述代码被执行时,使得处理器实现相应的功能。
本领域普通技术人员可以意识到,结合本文中所公开的实施例描述的各示例的单元及算法步骤,能够以电子硬件、或者计算机软件和电子硬件的结合来实现。这些功能究竟以硬件还是软件方式来执行,取决于技术方案的特定应用和设计约束条件。专业技术人员可以对每个特定的应用来使用不同方法来实现所描述的功能,但是这种实现不应认为超出本申请的范围。
所属领域的技术人员可以清楚地了解到,为描述的方便和简洁,上述描述的系统、装 置和单元的具体工作过程,可以参考前述方法实施例中的对应过程,在此不再赘述。
在本申请所提供的几个实施例中,应该理解到,所揭露的系统、装置和方法,可以通过其它的方式实现。例如,以上所描述的装置实施例仅仅是示意性的,例如,所述单元的划分,仅仅为一种逻辑功能划分,实际实现时可以有另外的划分方式,例如多个单元或组件可以结合或者可以集成到另一个系统,或一些特征可以忽略,或不执行。另一点,所显示或讨论的相互之间的耦合或直接耦合或通信连接可以是通过一些接口,装置或单元的间接耦合或通信连接,可以是电性,机械或其它的形式。
所述作为分离部件说明的单元可以是或者也可以不是物理上分开的,作为单元显示的部件可以是或者也可以不是物理单元,即可以位于一个地方,或者也可以分布到多个网络单元上。可以根据实际的需要选择其中的部分或者全部单元来实现本实施例方案的目的。
另外,在本申请各个实施例中的各功能单元可以集成在一个处理单元中,也可以是各个单元单独物理存在,也可以两个或两个以上单元集成在一个单元中。
所述功能如果以软件功能单元的形式实现并作为独立的产品销售或使用时,可以存储在一个计算机可读取存储介质中。基于这样的理解,本申请的技术方案本质上或者说对现有技术做出贡献的部分或者该技术方案的部分可以以软件产品的形式体现出来,该计算机软件产品存储在一个存储介质中,包括若干指令用以使得一台计算机设备(可以是个人计算机,服务器,或者网络设备等)执行本申请各个实施例所述方法的全部或部分步骤。而前述的存储介质包括:U盘、移动硬盘、ROM、RAM、磁碟或者光盘等各种可以存储程序代码的介质。
以上所述,仅为本申请的具体实施方式,但本申请的保护范围并不局限于此,任何熟悉本技术领域的技术人员在本申请揭露的技术范围内,可轻易想到变化或替换,都应涵盖在本申请的保护范围之内。因此,本申请的保护范围应以所述权利要求的保护范围为准。
Claims (20)
- 一种建立阿兹海默症检测模型的方法,其特征在于,包括:获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果,所述多个样本语音说话段中的每个样本语音说话段包括所述样本用户对样本图像的一段语音描述,所述阿兹海默症检测结果包括患病或未患病;对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征;根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
- 根据权利要求1所述的方法,其特征在于,在获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果之前,所述方法还包括:获取所述样本用户的音频数据、所述音频数据的采样位数和所述音频数据的字幕信息,所述音频数据包括所述样本用户对所述样本图像的多段语音描述;根据所述音频数据的采样位数,确定所述音频数据中每个样本点的dBFS值;根据所述音频数据中所有样本点的dBFS值的均值,对所述音频数据中每个样本点的dBFS值进行归一化处理,得到所述音频数据的归一化结果;根据所述音频数据的字幕信息,将音频数据的归一化结果分割成所述多个样本语音说话段。
- 根据权利要求1所述的方法,其特征在于,所述每个样本语音说话段为经过淡入和/或淡出处理后的语音说话段。
- 根据权利要求1至3中任一项所述的方法,其特征在于,对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征,包括:根据预设的配置文件对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征。
- 根据权利要求1至3中任一项所述的方法,其特征在于,所述方法还包括:获取目标用户的目标语音说话段,所述目标语音说话段包括所述目标用户对目标图像的一段语音描述;对所述目标语音说话段进行特征提取,得到所述目标语音说话段的音频特征;根据所述目标语音说话段的音频特征和所述阿兹海默症检测模型,确定所述目标用户的阿兹海默症检测结果。
- 根据权利要求1至3中任一项所述的方法,其特征在于,根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,包括:根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果、线性门限和所述卷积神经网络模型,建立所述阿兹海默症检测模型。
- 一种建立阿兹海默症检测模型的装置,其特征在于,包括:第一获取单元,用于获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果,所述多个样本语音说话段中的每个样本语音说话段包括所述样本用户对样本图像的一段语音描述,所述阿兹海默症检测结果包括患病或未患病;第一提取单元,用于对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征;建立单元,用于根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
- 一种阿兹海默症的检测装置,其特征在于,包括:第二获取单元,获取目标用户的目标语音说话段,所述目标语音说话段包括所述目标用户对目标图像的一段语音描述;第二提取单元,用于对所述目标语音说话段进行特征提取,得到所述目标语音说话段的音频特征;确定单元,用于根据所述目标语音说话段的音频特征和阿兹海默症检测模型,确定所述目标用户的阿兹海默症检测结果,所述阿兹海默症检测结果包括患病或未患病,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
- 一种计算机设备,包括存储器、处理器、通信接口以及存储在所述存储器上并可在所述处理器上运行的计算机程序,其中,所述存储器、所述处理器以及所述通信接口之间通过内部连接通路互相通信,其特征在于,所述处理器执行所述计算机程序时实现建立阿兹海默症检测模型的方法的以下步骤:获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果,所述多个样本语音说话段中的每个样本语音说话段包括所述样本用户对样本图像的一段语音描述,所述阿兹海默症检测结果包括患病或未患病;对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征;根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
- 根据权利要求9所述的计算机设备,其特征在于,在获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果之前,所述方法还包括:获取所述样本用户的音频数据、所述音频数据的采样位数和所述音频数据的字幕信息,所述音频数据包括所述样本用户对所述样本图像的多段语音描述;根据所述音频数据的采样位数,确定所述音频数据中每个样本点的dBFS值;根据所述音频数据中所有样本点的dBFS值的均值,对所述音频数据中每个样本点的dBFS值进行归一化处理,得到所述音频数据的归一化结果;根据所述音频数据的字幕信息,将音频数据的归一化结果分割成所述多个样本语音说话段。
- 根据权利要求9所述的计算机设备,其特征在于,所述每个样本语音说话段为经过淡入和/或淡出处理后的语音说话段。
- 根据权利要求9至11中任一项所述的计算机设备,其特征在于,对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征,包括:根据预设的配置文件对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征。
- 根据权利要求9至11中任一项所述的计算机设备,其特征在于,所述方法还包括:获取目标用户的目标语音说话段,所述目标语音说话段包括所述目标用户对目标图像的一段语音描述;对所述目标语音说话段进行特征提取,得到所述目标语音说话段的音频特征;根据所述目标语音说话段的音频特征和所述阿兹海默症检测模型,确定所述目标用户的阿兹海默症检测结果。
- 根据权利要求9至11中任一项所述的计算机设备,其特征在于,根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,包括:根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果、线性门限和所述卷积神经网络模型,建立所述阿兹海默症检测模型。
- 一种计算机可读存储介质,用于存储计算机程序,其特征在于,所述计算 机程序被处理器执行时实现建立阿兹海默症检测模型的方法的以下步骤:获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果,所述多个样本语音说话段中的每个样本语音说话段包括所述样本用户对样本图像的一段语音描述,所述阿兹海默症检测结果包括患病或未患病;对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征;根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,所述阿兹海默症检测模型用于表示音频特征和阿兹海默症检测结果之间的映射关系。
- 根据权利要求15所述的计算机可读存储介质,其特征在于,在获取样本用户的多个样本语音说话段和所述样本用户的阿兹海默症检测结果之前,所述方法还包括:获取所述样本用户的音频数据、所述音频数据的采样位数和所述音频数据的字幕信息,所述音频数据包括所述样本用户对所述样本图像的多段语音描述;根据所述音频数据的采样位数,确定所述音频数据中每个样本点的dBFS值;根据所述音频数据中所有样本点的dBFS值的均值,对所述音频数据中每个样本点的dBFS值进行归一化处理,得到所述音频数据的归一化结果;根据所述音频数据的字幕信息,将音频数据的归一化结果分割成所述多个样本语音说话段。
- 根据权利要求15所述的计算机可读存储介质,其特征在于,所述每个样本语音说话段为经过淡入和/或淡出处理后的语音说话段。
- 根据权利要求15至17中任一项所述的计算机可读存储介质,其特征在于,对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征,包括:根据预设的配置文件对所述每个样本语音说话段进行特征提取,得到所述每个样本语音说话段的音频特征。
- 根据权利要求15至17中任一项所述的计算机可读存储介质,其特征在于,所述计算机设备还实现以下步骤:获取目标用户的目标语音说话段,所述目标语音说话段包括所述目标用户对目标图像的一段语音描述;对所述目标语音说话段进行特征提取,得到所述目标语音说话段的音频特征;根据所述目标语音说话段的音频特征和所述阿兹海默症检测模型,确定所述目 标用户的阿兹海默症检测结果。
- 根据权利要求15至17中任一项所述的计算机可读存储介质,其特征在于,根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果和卷积神经网络模型,建立所述阿兹海默症检测模型,包括:根据所述每个样本语音说话段的音频特征、所述样本用户的阿兹海默症检测结果、线性门限和所述卷积神经网络模型,建立所述阿兹海默症检测模型。
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN201910059489.2 | 2019-01-22 | ||
| CN201910059489.2A CN109754822A (zh) | 2019-01-22 | 2019-01-22 | 建立阿兹海默症检测模型的方法和装置 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| WO2020151155A1 true WO2020151155A1 (zh) | 2020-07-30 |
Family
ID=66406096
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| PCT/CN2019/089829 Ceased WO2020151155A1 (zh) | 2019-01-22 | 2019-06-03 | 建立阿兹海默症检测模型的方法和装置 |
Country Status (2)
| Country | Link |
|---|---|
| CN (1) | CN109754822A (zh) |
| WO (1) | WO2020151155A1 (zh) |
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| TWI811097B (zh) * | 2021-09-09 | 2023-08-01 | 南韓商智聰醫治股份有限公司 | 用於確定用戶癡呆程度的方法及裝置 |
Families Citing this family (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN109754822A (zh) * | 2019-01-22 | 2019-05-14 | 平安科技(深圳)有限公司 | 建立阿兹海默症检测模型的方法和装置 |
| CN110674773A (zh) * | 2019-09-29 | 2020-01-10 | 燧人(上海)医疗科技有限公司 | 一种痴呆症的识别系统、装置及存储介质 |
| CN114596960B (zh) * | 2022-03-01 | 2023-08-08 | 中山大学 | 基于神经网络和自然对话的阿尔兹海默症风险预估方法 |
Citations (5)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20100174533A1 (en) * | 2009-01-06 | 2010-07-08 | Regents Of The University Of Minnesota | Automatic measurement of speech fluency |
| JP2017156402A (ja) * | 2016-02-29 | 2017-09-07 | 国立大学法人 奈良先端科学技術大学院大学 | 診断装置、診断方法、及び診断プログラム |
| JP6263308B1 (ja) * | 2017-11-09 | 2018-01-17 | パナソニックヘルスケアホールディングス株式会社 | 認知症診断装置、認知症診断方法、及び認知症診断プログラム |
| CN108320734A (zh) * | 2017-12-29 | 2018-07-24 | 安徽科大讯飞医疗信息技术有限公司 | 语音信号处理方法及装置、存储介质、电子设备 |
| CN109754822A (zh) * | 2019-01-22 | 2019-05-14 | 平安科技(深圳)有限公司 | 建立阿兹海默症检测模型的方法和装置 |
Family Cites Families (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN101751919B (zh) * | 2008-12-03 | 2012-05-23 | 中国科学院自动化研究所 | 一种汉语口语重音自动检测方法 |
| CN108073576A (zh) * | 2016-11-09 | 2018-05-25 | 上海诺悦智能科技有限公司 | 智能搜索方法、搜索装置以及搜索引擎系统 |
| CN107578775B (zh) * | 2017-09-07 | 2021-02-12 | 四川大学 | 一种基于深度神经网络的多分类语音方法 |
| CN108109633A (zh) * | 2017-12-20 | 2018-06-01 | 北京声智科技有限公司 | 无人值守的云端语音库采集与智能产品测试的系统与方法 |
| CN108460334A (zh) * | 2018-01-23 | 2018-08-28 | 北京易智能科技有限公司 | 一种基于声纹和人脸图像特征融合的年龄预测系统及方法 |
| CN108198576A (zh) * | 2018-02-11 | 2018-06-22 | 华南理工大学 | 一种基于语音特征非负矩阵分解的阿尔茨海默症初筛方法 |
-
2019
- 2019-01-22 CN CN201910059489.2A patent/CN109754822A/zh active Pending
- 2019-06-03 WO PCT/CN2019/089829 patent/WO2020151155A1/zh not_active Ceased
Patent Citations (5)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20100174533A1 (en) * | 2009-01-06 | 2010-07-08 | Regents Of The University Of Minnesota | Automatic measurement of speech fluency |
| JP2017156402A (ja) * | 2016-02-29 | 2017-09-07 | 国立大学法人 奈良先端科学技術大学院大学 | 診断装置、診断方法、及び診断プログラム |
| JP6263308B1 (ja) * | 2017-11-09 | 2018-01-17 | パナソニックヘルスケアホールディングス株式会社 | 認知症診断装置、認知症診断方法、及び認知症診断プログラム |
| CN108320734A (zh) * | 2017-12-29 | 2018-07-24 | 安徽科大讯飞医疗信息技术有限公司 | 语音信号处理方法及装置、存储介质、电子设备 |
| CN109754822A (zh) * | 2019-01-22 | 2019-05-14 | 平安科技(深圳)有限公司 | 建立阿兹海默症检测模型的方法和装置 |
Non-Patent Citations (1)
| Title |
|---|
| CHIEN YI-WEI; HONG SHENG-YI; CHEAH WEN-TING; FU LI-CHEN; CHANG YU-LING: "An Assessment System for Alzheimer's Disease Based on Speech Using a Novel Feature Sequence Design and Recurrent Neural Network", 2018 IEEE INTERNATIONAL CONFERENCE ON SYSTEMS, MAN, AND CYBERNETICS (SMC), 10 October 2018 (2018-10-10), pages 3289 - 3294, XP033503128, DOI: 10.1109/SMC.2018.00557 * |
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| TWI811097B (zh) * | 2021-09-09 | 2023-08-01 | 南韓商智聰醫治股份有限公司 | 用於確定用戶癡呆程度的方法及裝置 |
Also Published As
| Publication number | Publication date |
|---|---|
| CN109754822A (zh) | 2019-05-14 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JP7804736B2 (ja) | 病状を検出するモデルを構築するための音声特徴の選択 | |
| US11545173B2 (en) | Automatic speech-based longitudinal emotion and mood recognition for mental health treatment | |
| WO2020151155A1 (zh) | 建立阿兹海默症检测模型的方法和装置 | |
| WO2021073263A1 (zh) | 一种患病风险的预测方法及装置 | |
| JP7268711B2 (ja) | 信号処理システム、信号処理装置、信号処理方法、およびプログラム | |
| WO2021177730A1 (ko) | 음성 및 연하 장애를 유발하는 질환 진단 장치 및 그 진단 방법 | |
| CN109147826B (zh) | 音乐情感识别方法、装置、计算机设备及计算机存储介质 | |
| JPH0361959B2 (zh) | ||
| CN111149172B (zh) | 情绪管理方法、设备及计算机可读存储介质 | |
| CN113223485A (zh) | 节拍检测模型的训练方法、节拍检测方法及装置 | |
| Usman et al. | Heart rate detection and classification from speech spectral features using machine learning | |
| Yan et al. | Optimizing MFCC parameters for the automatic detection of respiratory diseases | |
| CN110767238B (zh) | 基于地址信息的黑名单识别方法、装置、设备及存储介质 | |
| CN113539243A (zh) | 语音分类模型的训练方法、语音分类方法及相关装置 | |
| Cebola et al. | Speech-Based Supervised Learning Towards the Diagnosis of Amyotrophic Lateral Sclerosis. | |
| WO2021132289A1 (ja) | 病態解析システム、病態解析装置、病態解析方法、及び病態解析プログラム | |
| CN107195312A (zh) | 情绪宣泄模式的确定方法、装置、终端设备和存储介质 | |
| CN108847251B (zh) | 一种语音去重方法、装置、服务器及存储介质 | |
| US20250077530A1 (en) | System and method for managing collection of data by a data management system | |
| JP7062966B2 (ja) | 音声解析装置、音声解析システム、及びプログラム | |
| CN116269226B (zh) | 一种检测预警方法、装置、计算机设备及存储介质 | |
| CN119153063A (zh) | 一种抑郁症识别方法、装置和人形机器人 | |
| WO2024196613A1 (en) | System and method for generating synthetic profiles for training biometric verification systems | |
| CN114023349B (zh) | 语音处理方法、装置、电子设备及存储介质 | |
| CN116779137A (zh) | 一种基于医疗知识图谱的数据处理方法及系统 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| 121 | Ep: the epo has been informed by wipo that ep was designated in this application |
Ref document number: 19911045 Country of ref document: EP Kind code of ref document: A1 |
|
| NENP | Non-entry into the national phase |
Ref country code: DE |
|
| 122 | Ep: pct application non-entry in european phase |
Ref document number: 19911045 Country of ref document: EP Kind code of ref document: A1 |

