发明内容
本申请的目的在于针对上述提到的技术问题提出一种基于深度学习和代谢组学数据的脑年龄预测方法及装置。
第一方面,本发明提供了一种基于深度学习和代谢组学数据的脑年龄预测方法,包括以下步骤:
获取健康人群和患有老年脑部疾病人群的血液样本并进行代谢物提取和色谱-质谱分析,得到健康人群和患有老年脑部疾病人群对应的若干个代谢组中的每个代谢物的质谱数据,对每个代谢组中的每个代谢物的质谱数据进行数据清洗和归一化处理,得到若干个代谢物特征,代谢物特征由代谢物的质谱数据中的色谱保留时间和质荷比拼接而成,对健康人群和患有老年脑部疾病人群对应的若干个代谢物特征进行特征筛选,确定与脑年龄相关的关键代谢物;
构建脑年龄预测模型并采用健康人群对应的关键代谢物的代谢物特征所构成的训练数据对其进行训练,得到经训练的脑年龄预测模型,经训练的脑年龄预测模型包括代谢组学特征表示学习模块和预测模块,代谢组学特征表示学习模块包括依次连接的第一全连接层、第一残差模块、第二残差模块、第三残差模块、第四残差模块、第五残差模块、第六残差模块和多头自注意力层,预测模块采用深度神经网络;
获取待检测人员的血液样本并得到由对应的关键代谢物的代谢物特征构成的代谢组学数据矩阵,将代谢组学数据矩阵输入经训练的脑年龄预测模型中的代谢组学特征表示学习模块,得到代谢物特征表示,将代谢物特征表示输入到预测模块,预测得到待检测人员的脑年龄,并计算得到脑年龄加速度。
作为优选,第一残差模块、第二残差模块、第三残差模块、第四残差模块、第五残差模块和第六残差模块均采用残差结构,残差结构包括依次连接的第二全连接层和第三全连接层,残差结构的输入特征依次经过第二全连接层和第三全连接层,得到中间特征,中间特征与残差结构的输入特征相加,形成残差连接并得到残差结构的输出特征。
作为优选,第一全连接层、第二全连接层和第三全连接层中的神经元均为128个,且均采用ReLU激活函数。
作为优选,多头自注意力层中包括4个注意力头,第六残差模块的输出特征经过三个线性变换层,分别得到查询向量、键向量和值向量,将查询向量、键向量和值向量分别划分为4个查询子向量、4个键子向量和4个值子向量,每个查询子向量、键子向量和值子向量在每个注意力头中执行一次缩放点积注意力运算,得到每个注意力头的输出向量,4个注意力头的输出向量经过拼接再通过一个线性层进行线性变换,得到代谢物特征表示。
作为优选,预测模块包括依次连接的输入层、三个隐藏层和输出层,输入层用于接收代谢物特征表示,三个隐藏层分别为第四全连接层、第五全连接层和第六全连接层,第四全连接层、第五全连接层和第六全连接层中的神经元个数分别为256、128和64,且均采用ReLU激活函数,输出层为1个神经元,且采用线性激活函数。
作为优选,对健康人群和患有老年脑部疾病人群对应的若干个代谢物特征进行特征筛选,确定与脑年龄相关的关键代谢物,具体包括:
对若干个代谢物特征进行差异分析特征筛选,将健康人群的代谢物特征与患有老年脑部疾病人群的代谢物特征进行双样本t检验,得到t值和p值,采用BH方法对p值进行校正,得到校正后的p值,将满足校正后的p值小于0.05,同时差异倍数大于2或小于1/2的代谢物特征所对应的代谢物构成差异代谢物集合,差异倍数为每种代谢物的患有老年脑部疾病人群中的代谢物特征的中位值与健康人群的代谢物特征的中位值的倍数比;
构建随机森林模型,基于健康人群的代谢物特征与患有老年脑部疾病人群的代谢物特征构建训练数据,采用训练数据对随机森林模型进行训练,将训练数据中的代谢物特征输入随机森林模型,得到分类结果,分类结果为健康人群或患有老年脑部疾病人群,在训练过程中计算每个代谢物特征在每个决策树中每个节点上引起的基尼指数的减少量并进行累加,得到每个决策树的基尼指数的减少总量,对所有决策树的基尼指数的减少总量取平均值,计算得到基尼指数平均减少量并且从大到小进行排序,选择基尼指数平均减少量排序前500的代谢物特征对应的代谢物构成重要性代谢物集合;
将差异代谢物集合和重要性代谢物集合取交集,得到与脑年龄相关的关键代谢物特征。
第二方面,本发明提供了一种基于深度学习和代谢组学数据的脑年龄预测装置,包括:
特征筛选模块,被配置为获取健康人群和患有老年脑部疾病人群的血液样本并进行代谢物提取和色谱-质谱分析,得到健康人群和患有老年脑部疾病人群对应的若干个代谢组中的每个代谢物的质谱数据,对每个代谢组中的每个代谢物的质谱数据进行数据清洗和归一化处理,得到若干个代谢物特征,代谢物特征由代谢物的质谱数据中的色谱保留时间和质荷比拼接而成,对健康人群和患有老年脑部疾病人群对应的若干个代谢物特征进行特征筛选,确定与脑年龄相关的关键代谢物;
模型构建模块,被配置为构建脑年龄预测模型并采用健康人群对应的关键代谢物的代谢物特征所构成的训练数据对其进行训练,得到经训练的脑年龄预测模型,经训练的脑年龄预测模型包括代谢组学特征表示学习模块和预测模块,代谢组学特征表示学习模块包括依次连接的第一全连接层、第一残差模块、第二残差模块、第三残差模块、第四残差模块、第五残差模块、第六残差模块和多头自注意力层,预测模块采用深度神经网络;
推理模块,被配置为获取待检测人员的血液样本并得到由对应的关键代谢物的代谢物特征构成的代谢组学数据矩阵,将代谢组学数据矩阵输入经训练的脑年龄预测模型中的代谢组学特征表示学习模块,得到代谢物特征表示,将代谢物特征表示输入到预测模块,预测得到待检测人员的脑年龄,并计算得到脑年龄加速度。
第三方面,本发明提供了一种电子设备,包括一个或多个处理器;存储装置,用于存储一个或多个程序,当一个或多个程序被一个或多个处理器执行,使得一个或多个处理器实现如第一方面中任一实现方式描述的方法。
第四方面,本发明提供了一种计算机可读存储介质,其上存储有计算机程序,该计算机程序被处理器执行时实现如第一方面中任一实现方式描述的方法。
第五方面,本发明提供了一种计算机程序产品,包括计算机程序,计算机程序被处理器执行时实现如第一方面中任一实现方式描述的方法。
相比于现有技术,本发明具有以下有益效果:
(1)本发明提出的基于深度学习和代谢组学数据的脑年龄预测方法具有检测全面性和高灵敏度,利用非靶向代谢组学技术,能够同时检测和分析成千上万种代谢物,包括小分子、中间代谢产物和复杂的生化路径。非靶向代谢组学具有极高的灵敏度和精确度,能够检测到低丰度的代谢物。这种特性使得脑年龄预测模型可以捕捉到与脑年龄相关的微小但显著的多种生理和病理变化,提供更为全面的脑年龄评估。
(2)本发明提出的基于深度学习和代谢组学数据的脑年龄预测方法能够提供多维度的生物信息,代谢组学数据直接反映了细胞内和细胞间的生化活动和物质交换,因此能够更真实地反映机体的生理状态和代谢健康。相比之下,基因组或转录组数据只能间接反映潜在的生物过程。
(3)本发明提出的基于深度学习和代谢组学数据的脑年龄预测方法更加方便动态监测,且减少偏差,精准预测。由于个体的基因、环境、饮食和生活方式等因素的不同,代谢物谱也会有所不同。个人的代谢物水平可以随着时间、环境和生理状态的变化而动态改变。脑年龄预测模型利用非靶向代谢组学能够通过多次采样和纵向研究,监测脑年龄随时间的变化和干预措施的效果,从而为个性化健康管理提供动态监测手段。结合改进的残差连接和自注意力机制,有效地从代谢物特征中学习特征表示,准确捕捉与脑年龄相关的代谢特征。通过多次迭代和优化算法,脑年龄预测模型能够减少预测偏差,提高整体预测性能,最终实现高精度的脑年龄预测。
具体实施方式
为了使本发明的目的、技术方案和优点更加清楚,下面将结合附图对本发明作进一步地详细描述,显然,所描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其它实施例,都属于本发明保护的范围。
图1示出了本申请的实施例提供的一种基于深度学习和代谢组学数据的脑年龄预测方法,包括以下步骤:
S1,获取健康人群和患有老年脑部疾病人群的血液样本并进行代谢物提取和色谱-质谱分析,得到健康人群和患有老年脑部疾病人群对应的若干个代谢组中的每个代谢物的质谱数据,对每个代谢组中的每个代谢物的质谱数据进行数据清洗和归一化处理,得到若干个代谢物特征,代谢物特征由代谢物的质谱数据中的色谱保留时间和质荷比拼接而成,对健康人群和患有老年脑部疾病人群对应的若干个代谢物特征进行特征筛选,确定与脑年龄相关的关键代谢物。
在具体的实施例中,对健康人群和患有老年脑部疾病人群对应的若干个代谢物特征进行特征筛选,确定与脑年龄相关的关键代谢物,具体包括:
对若干个代谢物特征进行差异分析特征筛选,将健康人群的代谢物特征与患有老年脑部疾病人群的代谢物特征进行双样本t检验,得到t值和p值,采用BH方法对p值进行校正,得到校正后的p值,将满足校正后的p值小于0.05,同时差异倍数大于2或小于1/2的代谢物特征所对应的代谢物构成差异代谢物集合,差异倍数为每种代谢物的患有老年脑部疾病人群中的代谢物特征的中位值与健康人群的代谢物特征的中位值的倍数比;
构建随机森林模型,基于健康人群的代谢物特征与患有老年脑部疾病人群的代谢物特征构建训练数据,采用训练数据对随机森林模型进行训练,将训练数据中的代谢物特征输入随机森林模型,得到分类结果,分类结果为健康人群或患有老年脑部疾病人群,在训练过程中计算每个代谢物特征在每个决策树中每个节点上引起的基尼指数的减少量并进行累加,得到每个决策树的基尼指数的减少总量,对所有决策树的基尼指数的减少总量取平均值,计算得到基尼指数平均减少量并且从大到小进行排序,选择基尼指数平均减少量排序前500的代谢物特征对应的代谢物构成重要性代谢物集合;
将差异代谢物集合和重要性代谢物集合取交集,得到与脑年龄相关的关键代谢物特征。
具体的,首先进行样品收集和代谢物提取,实验流程包括样品收集、代谢物提取、LC-MS质谱分析和数据分析。本发明采用了先进的数据处理和分析技术,基于8,000多名成年人血液的超高效液相色谱-质谱(UPLC-MS)分析结果。分析过程中先将血液样品在低温环境下解冻并充分混匀,然后加入预冷的甲醇进行处理,通过超声波处理提取代谢物,接着在超低温下静置沉淀杂质,并通过高速离心分离出上清液。上清液在高速真空浓缩离心机中挥干,以便质谱检测时使用。质谱检测阶段,使用预冷的甲醇-水溶液对干燥的样品复溶,再次离心处理以确保纯净均匀。随后,样品被引入超高效液相色谱系统(UHPLC)中分离,使用高效色谱柱和精确梯度洗脱程序,实现代谢物的最佳分离和检测。整个分析过程在严格控制的温度和流速条件下进行,以保证数据的准确性和重复性。原始数据分析阶段,利用MSDIAL软件处理原始质谱数据,包括峰对齐、保留时间校正和峰面积提取。代谢物的结构鉴定通过精确质量数匹配和二级谱图匹配进行,并检索公共数据库如HMDB、MassBank和GNPS确定代谢物名称。
接下来进行数据清洗和归一化: 在上述数据基础上,对代谢组数据进行清洗和归一化,这是代谢组学分析的关键步骤,旨在确保数据的质量和一致性,以便于后续的分析和解释。采用KNN填补插值方法对代谢组中的每个代谢物的质谱数据中的缺失值进行处理,若代谢组中的某个代谢物的质谱数据中的缺失值的数量大于阈值,则剔除该代谢物,得到数据清洗后的每个代谢物的质谱数据,以避免对分析结果造成偏差。将数据清洗后的每个代谢物的质谱数据进行对数转化并对每个值进行单位相加,以允许零值转换,然后以平均值为中心并按比例缩放到单位方差,以减少数据的偏态分布,使得每个特征均值为0,标准差为1。归一化的公式为:
;
其中,和分别是每个特征的均值和标准差,表示原始的数据值,表示归
一化后的数值。
最终提取每个代谢物的质谱数据中的色谱保留时间和质荷比以构造得到代谢物特征。
为了找到提供最佳脑年龄预测性能的代谢物特征,本申请的实施例采用两种不同类型的人群的血液样本,两种不同类型的人群包括无明显重大疾病的健康人群与确诊为随年龄增长患病概率增大的患有老年脑部疾病(阿尔兹海默症、帕金森病)的患者人群。并且合并了三个代谢组学数据集,包括:血清中的MS HPOS(亲水相互作用色谱HILIC可增强对在正极模式下电离的高极性小分子的分离)、血清中的MS LNEG(脂质靶向反相色谱法可提供以负模式电离的脂肪酸、甘油三酯和磷脂的最大分辨率)、血清中的MS LPOS(脂质靶向反相色谱,以正模式电离),下机数据经过峰对齐、保留时间校正和峰面积提取,后经过数据清洗和归一化后,总共得到 14549 个代谢物特征用于模型构建的特征筛选。
特征筛选是构建高效预测模型的重要步骤,能够显著提升模型的性能和解释性,因此针对特征筛选阶段分别进行了差异分析特征筛选与机器学习特征筛选,得到特征结果取交集,即为输入模型的特征集合。
(1)差异分析特征筛选:通过统计分析,比较健康人群与患有老年脑部疾病人群之间的代谢物浓度差异。具体方法包括:将健康人群的所有代谢物特征与患有老年脑部疾病人群的所有代谢物特征作为两组样本集合,每个样本为代谢物特征,对两组样本集合进行双样本t检验,t检验统计量(通常记作t值)是t检验计算中的一个核心数值,用于衡量两组样本集合的均值之间的差异相对于样本集合内部变异的大小,t检验统计量的计算公式为:
;
其中,和分别为健康人群和患有老年脑部疾病人群的样本均值,和分
别为两组样本集合的样本方差,n1和n2为样本数量。t检验统计量衡量的是均值差异与组内
变异的比例。较大的t值表示组间均值差异相对于组内变异较大,反之亦然。p值是在 t 检
验中得到的一个概率值,它表示在零假设成立(即假设两组均值相等)的情况下,观察到当
前数据或更极端数据的概率。p值用于帮助判断t值是否足够大,以至于可以认为两组数据
之间存在显著差异。通过Benjamini-Hochberg (BH)方法校正对p值进行调整,得到校正后
的p值,以控制假阳性率。设置判别标准校正后的p值小于0.05,同时差异倍数(每种代谢物
的患有老年脑部疾病人群的样本的中位值/健康人群的样本的中位值的倍数比)大于2或差
异倍数小于1/2,以筛选出差异代谢物,并构成差异代谢物集合。差异倍数大于1:表示相对
于健康人群的样本,某代谢物在患有老年脑部疾病人群的样本中含量增加,差异倍数等于2
表示患有老年脑部疾病人群的样本的某代谢物含量是健康人群的样本的2倍。满足此条件
的代谢物视为随年龄增长发生重大变化的代谢物,即差异代谢物,共有366种差异代谢物。
通过这种详细的差异分析过程,能够识别出随年龄增长发生显著变化的代谢物,为后续的
脑年龄预测模型提供重要的生物标志物。这一方法不仅提高了代谢组学数据分析的准确
性,还为理解脑老化过程中的代谢变化提供了新的见解。
(2)机器学习特征筛选:
通过对健康人群和患有老年脑部疾病人群的代谢组学数据进行分组,使用随机森林模型进行特征筛选,将健康人群标注为0,患有老年脑部疾病人群标注为1,构建训练数据。
首先,采用训练数据训练一个随机森林模型,使随机森林模型能够区分健康人群和患有老年脑部疾病人群。为了通过随机森林方法进行特征选择,首先需要计算在随机森林模型训练过程中每个代谢物特征对随机森林模型的不纯度减少量的贡献。随机森林的特征重要性是通过考察在随机森林模型训练过程中代谢物特征在树中的分裂节点对模型的不纯度减少量的贡献来计算的。这个过程涉及多个步骤,并最终帮助筛选出最具代表性的代谢物。具体来说,将每个代谢物特征输入随机森林模型,计算在所有决策树的所有节点上使用该代谢物特征进行分裂前后的基尼指数,得到基尼指数的减少量(即不纯度减少量),这些不纯度减少量在整棵决策树中被累加,然后在整个随机森林模型中进行平均,得到该代谢物特征的基尼指数平均减少量,对所有的代谢物特征的基尼指数平均减少量从大到小排序,排序越靠前的代谢物特征越重要,选取基尼指数平均减少量排名前500的代谢物特征所对应的代谢物作为重要性代谢物,并构成重要性代谢物集合。
最后,整合所有分析结果,确定一组与脑年龄高度相关的代谢物,并将其应用于脑年龄预测模型的构建和优化。根据差异分析显著性和机器学习筛选选择最终的代谢物集,将两个集合取交集,共获得304个与脑年龄相关的关键代谢物,优化并应用于脑年龄预测模型中,以提供更准确的脑年龄估计。这一过程不仅有助于理解代谢变化在脑部老化中的作用,还为个体化健康管理和疾病干预提供了潜在的生物标志物。
S2,构建脑年龄预测模型并采用健康人群对应的关键代谢物的代谢物特征所构成的训练数据对其进行训练,得到经训练的脑年龄预测模型,经训练的脑年龄预测模型包括代谢组学特征表示学习模块和预测模块,代谢组学特征表示学习模块包括依次连接的第一全连接层、第一残差模块、第二残差模块、第三残差模块、第四残差模块、第五残差模块、第六残差模块和多头自注意力层,预测模块采用深度神经网络。
在具体的实施例中,第一残差模块、第二残差模块、第三残差模块、第四残差模块、第五残差模块和第六残差模块均采用残差结构,残差结构包括依次连接的第二全连接层和第三全连接层,残差结构的输入特征依次经过第二全连接层和第三全连接层,得到中间特征,中间特征与残差结构的输入特征相加,形成残差连接并得到残差结构的输出特征。
在具体的实施例中,第一全连接层、第二全连接层和第三全连接层中的神经元均为128个,且均采用ReLU激活函数。
在具体的实施例中,多头自注意力层中包括4个注意力头,第六残差模块的输出特征经过三个线性变换层,分别得到查询向量、键向量和值向量,将查询向量、键向量和值向量分别划分为4个查询子向量、4个键子向量和4个值子向量,每个查询子向量、键子向量和值子向量在每个注意力头中执行一次缩放点积注意力运算,得到每个注意力头的输出向量,4个注意力头的输出向量经过拼接再通过一个线性层进行线性变换,得到代谢物特征表示。
在具体的实施例中,预测模块包括依次连接的输入层、三个隐藏层和输出层,输入层用于接收代谢物特征表示,三个隐藏层分别为第四全连接层、第五全连接层和第六全连接层,第四全连接层、第五全连接层和第六全连接层中的神经元个数分别为256、128和64,且均采用ReLU激活函数,输出层为1个神经元,且采用线性激活函数。
具体的,脑年龄预测模型结合了深度学习技术和代谢组学数据分析,旨在通过高效的特征学习和预测算法提供准确的生物学年龄估计。该模型由两个主要模块组成:(1)代谢组学特征表示学习模块,使用改进的深度残差网络对代谢组学数据进行特征表示学习;(2)预测模块,根据从代谢组学特征表示学习模块中获得的代谢物特征表示预测个体的脑年龄。
代谢组学特征表示学习模块:在脑年龄预测模型的代谢组学特征表示学习模块中,通过残差连接和自注意力机制构成改进的深度残差网络,能够高效地从代谢物特征中学习代谢物特征表示。该模型的核心在于构建一个深度残差网络,并结合注意力机制来捕捉特征间的复杂关系。整个训练过程包括输入数据的准备、模型架构的设计、模型训练和优化等步骤。
首先,获取代谢组学训练数据,通过代谢组学训练数据对脑年龄预测模型进行训练。将代谢组学训练数据中实际年龄已知的健康人群的血液样本经过数据处理后得到的304个关键代谢物对应的关键代谢物特征构成的代谢组学数据矩阵作为脑年龄预测模型的输入数据,该代谢组学数据矩阵为大小为n×304的矩阵,n表示样本数,在训练数据中样本数为健康人群的总人数,健康人群的实际年龄作为标签,本申请的实施例中,实际年龄以身份证上的年龄为准。在其中一个实施例中,将代谢组学训练数据分为训练集和验证集=7:3,训练集用于模型训练,验证集用于评估模型性能和防止过拟合。在其他实施例中,训练集和验证集的比例可根据需求确定。本申请的实施例选择了健康人群对应的关键代谢物特征构建代谢组学训练数据,以避免患有老年脑部疾病人群的关键代谢物特征影响脑年龄预测模型预测的准确性。
接下来,参考图2,构建代谢组学特征表示学习模块,代谢组学特征表示学习模块中的深度残差网络包括1个第一全连接层、6个残差模块和1个多头自注意力层,每个残差模块包含两个全连接层和一个跳跃连接(skip connection),将残差模块的输入直接传递到输出,与经过两个全连接层后的输出相加,形成残差连接。两个全连接层即为第二全连接层和第三全连接层,每个全连接层的神经元数量设置为128。跳跃连接的引入是为了缓解深度残差网络中的梯度消失问题,这种设计使得信息可以更有效地流经网络,促进更深层次的网络训练。在残差模块中,每个全连接层使用非线性激活函数——ReLU激活函数(Rectified Linear Unit)来引入非线性变换,从而捕捉复杂的特征关系。每个残差模块的输出是输入和经过两层全连接变换的结果相加的形式。这种残差连接的设计使得网络能够更好地学习和传递信息,同时减少了梯度消失的风险。
为了进一步增强特征学习能力,代谢组学特征表示学习模块引入1层多头自注意力层,通过4头注意力机制捕捉特征间的复杂关系。注意力机制的核心思想是通过赋予不同特征不同的权重,来突出重要特征之间的相互作用。在多头自注意力层中,首先计算输入特征的查询矩阵、键矩阵和值矩阵,通过这些矩阵的相互作用来确定每个特征的重要性。具体来说,特征间的相似性用于计算权重,这些权重用于加权求和输入特征,生成新的特征表示。自注意力机制能够捕捉代谢物之间的复杂相互作用,这在代谢组学数据中尤为重要,因为不同代谢物之间可能存在高度关联和互相影响的关系。多头自注意力层的输出的维度与多头自注意力层的输入一致。多头自注意力层的输入来自于最后一个残差模块的输出。最后一个残差模块的输出的维度是128,多头自注意力层的输出的维度也是128。
通过这些步骤,代谢组学特征表示学习模块能够从304个关键代谢物对应的代谢物特征所构成的代谢组学数据矩阵中学习到高质量的特征表示。这些特征表示被输入到预测模块中,利用深度神经网络(DNN)进一步预测个体的脑年龄。
首先,从代谢组学特征表示学习模块输出的代谢物特征表示作为预测模块的输入。这些代谢物特征表示经过优化,能够准确捕捉与脑年龄相关的代谢物特征,具有很高的表征能力。预测模块的核心是一个深度神经网络(DNN),该深度神经网络由多层全连接层(fully connected layers)组成。具体的模型架构设计如下:
输入层:接收从代谢组学特征表示学习模块输出的代谢物特征表示,表示为n×k矩阵,n表示样本数,输入维度k为代谢组学特征表示学习模块最后一层的输出维度128。
三个隐藏层:这些隐藏层的设计是为了进一步处理输入特征,提取更高层次的特征表示,每层使用ReLU激活函数。第一个隐藏层为第四全连接层,包含256个神经元,使用ReLU激活函数,用于捕捉复杂的特征关系;第二个隐藏层为第五全连接层,包含128个神经元,使用ReLU激活函数,进一步提取和精炼特征;第三个隐藏层为第六全连接层,包含64个神经元,使用ReLU激活函数,压缩特征维度,提高模型的泛化能力。
输出层:包含一个神经元,通过线性激活函数输出预测每个人对应的脑年龄。单一神经元的设计是为了直接回归预测目标,即每个人的脑年龄。
在脑年龄预测模型的训练过程中,使用平均绝对误差(MSE)作为损失函数,通过梯度下降法和优化算法来调整模型参数。将训练集划分为32个小批量,每次迭代时使用一个批量数据进行参数更新,以减少内存使用和提高训练速度。对于每个训练批次,计算预测出的脑年龄与实际年龄之间的平均绝对误差(MSE),通过反向传播算法计算梯度,并使用优化算法更新模型参数,在每个epoch结束时,使用验证集评估模型性能,计算验证集的MSE。同时引入早停机制,当验证集的损失在若干个epoch内不再降低时,提前终止训练,防止模型过拟合。
最终结果显示,脑年龄预测模型在预测脑年龄方面具有显著优势,其Pearson相关系数为0.73,决定系数为0.73,MSE为13.55。如图3所示,预测出的脑年龄与实际年龄的Pearson相关系数(0.73)和决定系数(R²=0.73)都表明,脑年龄与实际年龄之间有强烈的线性关系,而平均绝对误差为13.55反映了预测值与实际值之间的平均偏差较小。MSE的低值说明脑年龄预测模型的预测精度较高,误差较小,能够提供可靠的脑年龄估计。这一结果说明,脑年龄预测模型不仅能够准确预测个体的脑年龄,还能够有效捕捉到与脑老化相关的代谢特征,从而为个体化健康管理和疾病干预提供了重要的生物标志物。
参考图4,为了定义每个参与者的稳定代谢脑年龄评分,再次使用了数据集的重采样训练集和测试集的bootstrap程序进行100次BrainAgingNet模型构建。独立训练集中的年龄预测在所有重采样中都非常准确和稳定,测试集中预测脑年龄与实际年龄的平均相关系数为0 .74(95%置信区间为0.72至0.76)。
S3,获取待检测人员的血液样本并得到由对应的关键代谢物的代谢物特征构成的代谢组学数据矩阵,将代谢组学数据矩阵输入经训练的脑年龄预测模型中的代谢组学特征表示学习模块,得到代谢物特征表示,将代谢物特征表示输入到预测模块,预测得到待检测人员的脑年龄,并计算得到脑年龄加速度。
具体的,经过步骤S1确定了与脑年龄相关的关键代谢物之后,对获取到的待检测人员的血液样本进行代谢物提取和色谱-质谱分析,得到待检测人员对应的若干个代谢组中的每个代谢物的质谱数据,对每个代谢组中的每个代谢物的质谱数据进行数据清洗和归一化处理,得到若干个代谢物特征,从若干个代谢物特征中选择与关键代谢物相对应的代谢物特征,并构造成大小为1×304的代谢组学数据矩阵,将待检测人员对应的代谢组学数据矩阵输入经训练的脑年龄预测模型,即可预测出脑年龄。
基于脑年龄预测模型,可以对待检测人员进行脑年龄的预测,从而评估个体的生理状态和健康风险。通过对预测结果的进一步分析,可以识别出关键的代谢物标志物,为后续的生物学研究和临床应用提供重要线索。同时,本申请的实施例采用了脑年龄加速度(Brain Age Acceleration, BAA)的概念,脑年龄加速度是指个体的预测的脑年龄与其实际年龄之间的差异,即预测的脑年龄超出或低于实际年龄的部分。具体定义如下:
脑年龄加速度 = 预测的脑年龄 - 时序年龄;
如果预测的脑年龄高于时序年龄,则脑年龄加速度为正,表明个体的脑部生理状态可能比实际年龄更“老”;反之,如果预测的脑年龄低于时序年龄,则加速度为负,表明个体的脑部生理状态可能比实际年龄更“年轻”。BAA可以作为一个重要指标,用于评估个体的健康状况和脑部衰老速度。
这一指标的应用为临床提供了新的工具,帮助早期识别潜在的健康风险,并为个体化的健康管理提供参考依据。通过脑年龄预测模型对脑年龄加速度的评估,能够更加准确地判断个体的脑部健康状态,推动脑老化相关疾病的早期预防和干预。
参考图5,图中数据显示,脑年龄加速度(BAA)的分布大致呈正态分布,大部分个体的BAA值在-8到8之间。这意味着大多数人的脑年龄与其实际年龄较为接近,但也有少数人的BAA值较大,表示他们的脑年龄显著偏离其实际年龄。这个结果有助于识别那些脑年龄显著加速或减缓的人群,为个性化健康管理和早期干预提供了重要参考。
基于此建立完成的模型,将待检测人员的代谢组学数据矩阵输入到脑年龄预测模型中,得到预测的脑年龄与BAA值,能够更全面、准确地评估个体的脑年龄,可以实现对个体脑生理状态的综合评估,从而提高脑健康风险预测的准确性,并为个性化脑健康管理和早期干预提供科学依据。
进一步参考图6,作为对上述各图所示方法的实现,本申请提供了一种基于深度学习和代谢组学数据的脑年龄预测装置的一个实施例,该装置实施例与图1所示的方法实施例相对应,该装置具体可以应用于各种电子设备中。
本申请实施例提供了一种基于深度学习和代谢组学数据的脑年龄预测装置,包括:
特征筛选模块1,被配置为获取健康人群和患有老年脑部疾病人群的血液样本并进行代谢物提取和色谱-质谱分析,得到健康人群和患有老年脑部疾病人群对应的若干个代谢组中的每个代谢物的质谱数据,对每个代谢组中的每个代谢物的质谱数据进行数据清洗和归一化处理,得到若干个代谢物特征,代谢物特征由代谢物的质谱数据中的色谱保留时间和质荷比拼接而成,对健康人群和患有老年脑部疾病人群对应的若干个代谢物特征进行特征筛选,确定与脑年龄相关的关键代谢物;
模型构建模块2,被配置为构建脑年龄预测模型并采用健康人群对应的关键代谢物的代谢物特征所构成的训练数据对其进行训练,得到经训练的脑年龄预测模型,经训练的脑年龄预测模型包括代谢组学特征表示学习模块和预测模块,代谢组学特征表示学习模块包括依次连接的第一全连接层、第一残差模块、第二残差模块、第三残差模块、第四残差模块、第五残差模块、第六残差模块和多头自注意力层,预测模块采用深度神经网络;
推理模块3,被配置为获取待检测人员的血液样本并得到由对应的关键代谢物的代谢物特征构成的代谢组学数据矩阵,将代谢组学数据矩阵输入经训练的脑年龄预测模型中的代谢组学特征表示学习模块,得到代谢物特征表示,将代谢物特征表示输入到预测模块,预测得到待检测人员的脑年龄,并计算得到脑年龄加速度。
图7为本发明实施例提供的电子设备的硬件结构示意图。如图7所示,本实施例的电子设备包括:处理器701以及存储器702;其中存储器702,用于存储计算机执行指令;处理器701,用于执行存储器存储的计算机执行指令,以实现上述实施例中电子设备所执行的各个步骤。具体可以参见前述方法实施例中的相关描述。
可选地,存储器702既可以是独立的,也可以跟处理器701集成在一起。
当存储器702独立设置时,该电子设备还包括总线703,用于连接存储器702和处理器701。
本发明实施例还提供一种计算机存储介质,计算机存储介质中存储有计算机执行指令,当处理器701执行计算机执行指令时,实现如上的方法。
本发明实施例还提供一种计算机程序产品,包括计算机程序,计算机程序被处理器701执行时,实现如上的方法。
在本发明所提供的实施例中,应该理解到,所揭露的设备和方法,可以通过其它的方式实现。例如,以上所描述的设备实施例仅仅是示意性的,例如,模块的划分,仅仅为一种逻辑功能划分,实际实现时可以有另外的划分方式,例如多个模块可以结合或者可以集成到另一个系统,或一些特征可以忽略,或不执行。另一点,所显示或讨论的相互之间的耦合或直接耦合或通信连接可以是通过一些接口,装置或模块的间接耦合或通信连接,可以是电性,机械或其它的形式。
作为分离部件说明的模块可以是或者也可以不是物理上分开的,作为模块显示的部件可以是或者也可以不是物理单元,即可以位于一个地方,或者也可以分布到多个网络单元上。可以根据实际的需要选择其中的部分或者全部模块来实现本实施例方案。
另外,在本发明各个实施例中的各功能模块可以集成在一个处理单元中,也可以是各个模块单独物理存在,也可以两个或两个以上模块集成在一个单元中。上述模块成的单元既可以采用硬件的形式实现,也可以采用硬件加软件功能单元的形式实现。
上述以软件功能模块的形式实现的集成的模块,可以存储在一个计算机可读取存储介质中。上述软件功能模块存储在一个存储介质中,包括若干指令用以使得一台计算机设备(可以是个人计算机,服务器,或者网络设备等)或处理器701执行本申请各个实施例方法的部分步骤。
应理解,上述处理器701可以是中央处理单元(Central Processing Unit,简称CPU),还可以是其他通用处理器、数字信号处理器(Digital Signal Processor,简称DSP)、专用集成电路(Application Specific Integrated Circuit,简称ASIC)等。通用处理器可以是微处理器或者该处理器701也可以是任何常规的处理器701等。结合发明所公开的方法的步骤可以直接体现为硬件的处理器701执行完成,或者用处理器701中的硬件及软件模块组合执行完成。
存储器702可能包含高速RAM存储器,也可能还包括非易失性存储NVM,例如至少一个磁盘存储器,还可以为U盘、移动硬盘、只读存储器、磁盘或光盘等。
总线703可以是工业标准体系结构(Industry Standard Architecture,简称ISA)、外部设备互连(Peripheral Component Interconnect,简称PCI)总线或扩展工业标准体系结构(Extended Industry Standard Architecture,简称EISA)总线等。总线703可以分为地址总线、数据总线、控制总线等。为便于表示,本申请附图中的总线703并不限定仅有一根总线703或一种类型的总线703。
上述存储介质可以是由任何类型的易失性或非易失性存储设备或者它们的组合实现,如静态随机存取存储器(SRAM),电可擦除可编程只读存储器(EEPROM),可擦除可编程只读存储器(EPROM),可编程只读存储器(PROM),只读存储器(ROM),磁存储器,快闪存储器,磁盘或光盘。存储介质可以是通用或专用计算机能够存取的任何可用介质。
一种示例性的存储介质耦合至处理器701,从而使处理器701能够从该存储介质读取信息,且可向该存储介质写入信息。当然,存储介质也可以是处理器701的组成部分。处理器701和存储介质可以位于专用集成电路(Application Specific Integrated Circuits,简称ASIC)中。当然,处理器701和存储介质也可以作为分立组件存在于电子设备或主控设备中。
本领域普通技术人员可以理解:实现上述各方法实施例的全部或部分步骤可以通过程序指令相关的硬件来完成。前述的程序可以存储于一计算机可读取存储介质中。该程序在执行时,执行包括上述各方法实施例的步骤;而前述的存储介质包括:ROM、RAM、磁碟或者光盘等各种可以存储程序代码的介质。
最后应说明的是:以上各实施例仅用以说明本发明的技术方案,而非对其限制;尽管参照前述各实施例对本发明进行了详细的说明,本领域的普通技术人员应当理解:其依然可以对前述各实施例所记载的技术方案进行修改,或者对其中部分或者全部技术特征进行等同替换;而这些修改或者替换,并不使相应技术方案的本质脱离本发明各实施例技术方案的范围。