CN116541594B - 一种基于多粒度异质属性图对比学习的期刊推荐方法 - Google Patents

一种基于多粒度异质属性图对比学习的期刊推荐方法 Download PDF

Info

Publication number
CN116541594B
CN116541594B CN202310482963.9A CN202310482963A CN116541594B CN 116541594 B CN116541594 B CN 116541594B CN 202310482963 A CN202310482963 A CN 202310482963A CN 116541594 B CN116541594 B CN 116541594B
Authority
CN
China
Prior art keywords
granularity
graph
heterogeneous
learning
attribute
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
CN202310482963.9A
Other languages
English (en)
Other versions
CN116541594A (zh
Inventor
李瑛�
梁钰
张洁琳
杜伟
张晓�
孙睿涵
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Jilin University
Original Assignee
Jilin University
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Jilin University filed Critical Jilin University
Priority to CN202310482963.9A priority Critical patent/CN116541594B/zh
Publication of CN116541594A publication Critical patent/CN116541594A/zh
Application granted granted Critical
Publication of CN116541594B publication Critical patent/CN116541594B/zh
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06F—ELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00—Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/90—Details of database functions independent of the retrieved data types
    • G06F16/95—Retrieval from the web
    • G06F16/953—Querying, e.g. by the use of web search engines
    • G06F16/9535—Search customisation based on user profiles and personalisation
    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06F—ELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00—Pattern recognition
    • G06F18/20—Analysing
    • G06F18/24—Classification techniques
    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06F—ELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00—Pattern recognition
    • G06F18/20—Analysing
    • G06F18/25—Fusion techniques
    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06F—ELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00—Handling natural language data
    • G06F40/20—Natural language analysis
    • G06F40/279—Recognition of textual entities
    • G06F40/284—Lexical analysis, e.g. tokenisation or collocates
    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06F—ELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00—Handling natural language data
    • G06F40/20—Natural language analysis
    • G06F40/279—Recognition of textual entities
    • G06F40/289—Phrasal analysis, e.g. finite state techniques or chunking
    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00—Computing arrangements based on biological models
    • G06N3/02—Neural networks
    • G06N3/04—Architecture, e.g. interconnection topology
    • G06N3/0464—Convolutional networks [CNN, ConvNet]
    • G—PHYSICS
    • G06—COMPUTING OR CALCULATING; COUNTING
    • G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00—Computing arrangements based on biological models
    • G06N3/02—Neural networks
    • G06N3/08—Learning methods
    • Y—GENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
    • Y02—TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
    • Y02D—CLIMATE CHANGE MITIGATION TECHNOLOGIES IN INFORMATION AND COMMUNICATION TECHNOLOGIES [ICT], I.E. INFORMATION AND COMMUNICATION TECHNOLOGIES AIMING AT THE REDUCTION OF THEIR OWN ENERGY USE
    • Y02D10/00—Energy efficient computing, e.g. low power processors, power management or thermal management

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Data Mining & Analysis (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Artificial Intelligence (AREA)
  • General Health & Medical Sciences (AREA)
  • Evolutionary Computation (AREA)
  • Computational Linguistics (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Health & Medical Sciences (AREA)
  • Databases & Information Systems (AREA)
  • Biophysics (AREA)
  • Evolutionary Biology (AREA)
  • Biomedical Technology (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Molecular Biology (AREA)
  • Computing Systems (AREA)
  • Mathematical Physics (AREA)
  • Software Systems (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

本发明公开了一种基于多粒度异质属性图对比学习的期刊推荐方法,涉及数据分析技术领域,该期刊推荐方法包括以下步骤:数据处理、多粒度语义特征提取、基于异质图神经网络对比学习的多粒度结构特征提取和自适应学习。本发明基于异质图神经网络、对比学习、卷积神经网络和文本预处理方法,将文本处理为多粒度并从语义和结构方向下分别进行处理,使用分层自适应学习来将这些处理后的特征整合成一个最终的最优文本特征,使用softmax来得到最终的分类结果;并在考虑到论文和期刊的特殊性下整合了多个损失函数来训练模型。最终达到了只基于论文内容的针对特定研究领域的期刊推荐高质量效果。

Description

一种基于多粒度异质属性图对比学习的期刊推荐方法
技术领域
本发明涉及数据分析技术领域,具体是一种基于多粒度异质属性图对比学习的期刊推荐方法。
背景技术
近年来学术研究中出现了许多新兴的交叉研究领域,这些领域通常跨多个学科,其内容跨度较大,可发表的期刊选择也更广泛,这使得科研人员尤其是一些新关注、新领域的科研人员在选择合适的发表期刊时经常遇到困难。
当前的期刊推荐方法大致可以分为两大类,不基于内容的与基于内容的方法。不基于内容的方法一般是通过发表历史和社交网络等信息进行期刊推荐,不适用于新学者。现存的基于内容的期刊推荐方法大多只针对特定的学术论文平台或期刊类型,目前基本没有针对特定研究领域尤其是新兴交叉研究领域的期刊推荐方法。基于内容的期刊推荐方法,本质上可以视为是一个文本分类问题,目前的文本分类方法可以分为以下四类:
基于传统机器学习方法的文本分类:传统的机器学习方法,如SVM,需要一个特征工程步骤将文本转换为嵌入。方法的分类性能往往与嵌入的质量直接相关,由于高质量的特征工程依赖于专业的领域知识,这些方法难以获得良好的性能。
基于深度神经网络的文本分类:基于深度学习模型将文本表示为嵌入。深度神经网络在文本分类领域得到了相当广泛的应用。比如TextCNN,LSTM,Transformer等,这些方法往往对数据集要求很高。
基于对比学习的文本分类:对比学习最主要应用于自监督和无监督的研究任务中,在有监督的研究任务中的效果算不上很有竞争性,但与文本分类等需要额外训练成本的监督任务相比,对比学习成本较低,可以作为辅助方法。
基于图神经网络(GNN)的文本分类:图神经网络与上述方法的最大区别在于,GNN不仅可以处理欧氏空间数据,还可以处理非欧氏空间数据,即图结构化数据。GNN已成功应用于文本分类并取得了很好的效果。然而,由于图结构的复杂性和多样性,基于GNN的文本分类方法在不同数据上的表现差异很大,但这也同时意味着基于GNN的方法往往有很高的提升空间。
发明内容
本发明的目的在于提供一种基于多粒度异质属性图对比学习的期刊推荐方法,以解决背景技术中提出的问题。
为实现上述目的,本发明提供如下技术方案:
一种基于多粒度异质属性图对比学习的期刊推荐方法,包括以下步骤:
步骤1)数据处理,收集论文的摘要和标题,并从中提取论文的文档粒度、句子粒度、单词粒度、主题粒度和标题粒度的信息;
步骤2)多粒度语义特征提取,将文档粒度、句子粒度、单词粒度的信息输入进多粒度语义特征提取模块,通过预训练和由卷积层与全连接层组成的特征加强网络得到三种粒度下的语义特征Xword、Xabs和Xtitle;
步骤3)基于异质图神经网络对比学习的多粒度结构特征提取,将文档粒度、句子粒度、单词粒度、主题粒度和标题粒度的信息输入进基于异质图神经网络对比学习的多粒度结构特征提取模块,构建全局异质属性图,根据全局异质属性图构建全局异质拓扑图,然后构建四个局部子图,使用基于双层注意力机制的异质图卷积对构建好的全局异质属性图、全局异质拓扑图和四个局部子图进行预训练,使用交叉回路图对比学习随机选取好正负对,然后将预训练好的图分别通过-一个全连接网络来进一步增强特征,得到六种视角的结构特征Xgraphs;
步骤4)自适应学习,使用分层自适应学习来将三种语义特征和六种结构特征融合为一个最优的文本特征Xfin,其中,整合多种损失函数训练模型;
步骤5),使用softmax对Xfin进行分类,得到期刊推荐结果。
在上述技术方案的基础上,本发明还提供以下可选技术方案:
在一种可选方案中:在所述步骤1)中,摘要分解为以下三个粒度:将整个摘要当成一段话的文档粒度、将摘要分解成若干句子的句子粒度和将摘要分解成若干单词的单词粒度,采用BTM方法挖掘出摘要的潜在主题形成主题粒度,论文的标题形成标题粒度。
在一种可选方案中:在步骤2)中,对于单词粒度,使用Word2vec方法初步训练初始的单词嵌入,再通过一个由卷积层和全连接层组成的特征增强网络模块来对初始的单词嵌入进行特征增强以得到单词粒度的语义特征:
Xword=g(C(Xini)*Wfc+bfc)
其中,Xini代表初始单词嵌入,C(*)代表卷积操作,Wfc代表全连接层,bfc代表全连接层的偏置项,g(*)代表非线性激活函数。
在一种可选方案中:在步骤2)中,对于摘要和标题粒度的信息,先使用Doc2vec和BERT训练他们的初始嵌入,再通过特征增强网络模块分别得到相应粒度的语义特征Xabs和Xtitle。
在一种可选方案中:所述步骤3)基于异质图神经网络对比学习的多粒度结构特征提取的具体步骤如下:
步骤S1:结构角度下,输入文本的文档、句子、单词、标题和主题五个粒度的信息来构建全局异质属性图Gatt,Gatt具有D、S、T、W四种节点,D-W,D-S,D-T,T-W,S-W五种连接;
步骤S2:通过将全局异质属性图Gatt中的D和S节点的属性向量替换为无语义信息的TFIDF向量以及节点W的属性向量替换为无语义信息的one-hot向量,构成为全局异质拓扑图Gtop;
步骤S3:从全局异质拓扑图Gtop中分离出三个局部子图,由除D以外的每种类型的节点和节点D组成:D-W,D-T,D-S,局部子图包含全局异质拓扑图Gtop中两种类型的节点和对应的连接关系,将D-S局部图中S节点的属性向量替换为Sent2vec向量得到第四个局部子图D-Sv;
步骤S4:基于双层注意力机制的异质图卷积来对以上构建的六个图进行预训练,得到预训练后的向量Xpre;提取全局异质拓扑图Gtop、全局异质属性图Gatt和四个局部子图中多维节点信息和结构,通过交叉回路图对比学习随机选取好正负对;
步骤S5:将预训练过的全局异质拓扑图Gtop、全局异质属性图Gatt和四个局部子图的D节点的属性向量分别输入到全连接层中进行进一步的特征增强,并将这些全连接层的输出,获得六种视角的结构特征Xgraphs。
在一种可选方案中:所述全局异质属性图Gatt的构造过程如下:
(6)将预处理过后的论文摘要作为D节点,将摘要分句和分词得到的句子和单词作为S节点和W节点,将每个D与其分句得到的S节点连接起来;
(7)将使用BTM挖掘出的摘要的潜在主题作为T节点,T节点的属性向量用单词的概率分布表示,对于每个D节点,为其分配概率最高的Top5个主题T并将他们连接起来;
(8)使用Doc2vec训练文档得到D节点的属性向量,使用基于BERT的Sent2vec训练句子得到S节点的属性向量,使用Word2vec训练单词得到W节点的属性向量;
(9)如果一个文档D包含一个单词W,在对应的D和W之间构建连接,同理,如果一个句子S包含一个单词W,则在对应的S和W之间构建连接,T-W的连接是基于每个主题的单词概率分布构建的;
针对每个论文的标题,考虑到标题的特殊性,使用BERT将其训练为嵌入后拼接在对应的D节点属性向量后,得到全局异质属性图Gatt。
在一种可选方案中:所述步骤4)自适应学习的具体步骤如下:步骤D1:将三种语义特征Xword、Xabs和Xtitle通过自适应学习融合成一个文本语义特征Xsem:
Xsem=∑αiXi
其中,Xi为Xword、Xabs和Xtitle;
步骤D2:将六种视角的结构特征Xgraphs通过自适应学习融合成一个文本结构特征Xstr:
Xstr=∑βiXi
其中,Xi为Xgraphs;
步骤D3:分别将这两个特征通过全连接层再通过自适应学习融合成最终的最优文本特征Xfin:
Xfin=∑γiXiWi
其中,Xi为Xstr,Xsem;Wi代表全连接层。
在一种可选方案中:在步骤4)中,损失函数是在交叉熵的基础之上引入人脸识别领域的Asoftmax损失和对比学习领域的infoNCE损失,其中,模型的损失包括预训练损失、语义损失、结构损失和预测损失。
在一种可选方案中:所述预训练损失为交叉熵,其中,图预训练损失LHGCN:
使用文本语义特征的Asoftmax作为语义损失,其中,语义损失Lsem:
其中,x∈Xsem,m≥1代表控制边角距大小的整数,m=1时,Asoftmax就会退化为普通的Softmax;
对比学习领域的infoNCE损失Lconst:
其中,H和H′表示图对中两个图,d表示H中一个D节点,d+表示H′中的一个同类D节点,d-表示H′中的一个不同类D节点,t是一个超参数,在softmax中称为温度系数;
将其与使用结构特征Xstr计算的Asoftmax损失Lgraph结合起来作为结构损失Lstr:
Lstr=δLconst+Lgraph+η||Θ||
最终的文本特征Xfin通过Asoftmax计算预测损失Lpred:
模型整体损失函数为:
L=λHGCNLHGCN+λsemLsem+λgraphLgraph+λconstLconst+λpredLpred。
相较于现有技术,本发明的有益效果如下:
本发明基于论文的内容进行期刊推荐,从多粒度、语义结构双方向出发,充分提取了文本中的各种信息;通过多粒度和特征加强网络充分提取了文本在各个粒度下的语义信息。通过构建全局异质图和局部异质图,配合提出的交叉回路图对比学习,充分提取并挖掘了文本在各种视角下的结构信息;并考虑到了以期刊作为标签的特殊性整合了多种损失函数以达到同时挖掘文本信息间的差异性和共性、全局性和局部性,类内差异过大,标签含有噪声等性质和问题。完成了针对特定领域的论文期刊推荐工作;并已经通过实验证明了模型的效果优于现有的文本分类方法。
附图说明
图1为本发明一种基于多粒度异质属性图对比学习的期刊推荐方法的整体流程图。
图2为本发明中的数据预处理示意图。
图3为本发明中的多粒度语义特征提取示意图。
图4为本发明中的基于异质图神经网络对比学习的多粒度结构特征提取示意图。
图5为本发明中的自适应学习示意图。
图6为本发明中的LncRNA数据集上的推荐实例示意图。
图7为本发明中的MicroRNA数据集上的推荐实例示意图。
具体实施方式
为了使本发明的目的、技术方案及优点更加清楚明白,以下结合附图及实施例,对本发明进行进一步详细说明。本发明所列举的各实施例仅用以说明本发明,并非用以限制本发明的范围。对本发明所作的任何显而易知的修饰或变更都不脱离本发明的精神与范围。
在一个实施例中,如图1-图5所示,提供了一种基于多粒度异质属性图对比学习的期刊推荐方法,该方法包括以下步骤:
一、数据预处理
提取出论文的摘要和标题,将摘要分解为以下三个粒度:1)将整个摘要当成一段话的文档粒度。2)将摘要分解成若干句子的句子粒度。3)将摘要分解成若干单词的单词粒度。
然后使用BTM方法挖掘出摘要的潜在主题,再加上论文的标题,得到了论文文档、句子、单词、主题、标题五种粒度的信息。将预处理后数据分别从语义和结构两个角度进行处理。
二、多粒度语义特征提取
在语义角度下,处理文本的文档、单词、标题粒度信息以充分挖掘文本的语义信息。具体来说,对于单词粒度,首先使用Word2vec方法初步训练初始的单词嵌入,然后通过一个由卷积层和全连接层组成的特征增强网络模块来对初始的单词嵌入进行特征增强以得到单词粒度的语义特征Xword:
Xword=g(C(Xini)*Wfc+bfc)
其中,Xini代表初始单词嵌入,C(*)代表卷积操作,Wfc代表全连接层,bfc代表全连接层的偏置项,g(*)代表非线性激活函数。
对于摘要和标题粒度的信息,分别先使用Doc2vec和BERT训练他们的初始嵌入,然后通过类似的特征增强网络模块分别得到相应粒度的语义特征Xabs和Xtitle。
三、基于异质图神经网络对比学习的多粒度结构特征提取
结构角度下,首先,输入文本的文档、句子、单词、标题和主题五个粒度的信息来构建全局异质属性图Gatt,它有D、S、T、W四种节点,D-W,D-S,D-T,T-W,S-W五种连接。构造过程详细描述如下:
1)将预处理过后的论文摘要作为D(Document)节点,将摘要分句和分词得到的句子和单词作为S(Sentence)节点和W(Word)节点,将每个D与其分句得到的S节点连接起来。
2)将使用BTM挖掘出的摘要的潜在主题作为T(Topic)节点,T节点的属性向量用单词的概率分布表示,对于每个D节点,为其分配概率最高的Top5个主题T并将他们连接起来,在实验中挖掘了200个主题T。
3)使用Doc2vec训练文档得到D节点的属性向量,使用基于BERT的Sent2vec训练句子得到S节点的属性向量,使用Word2vec训练单词得到W节点的属性向量。
4)如果一个文档D包含一个单词W,在对应的D和W之间构建连接,同理,如果一个句子S包含一个单词W,则在对应的S和W之间构建连接,T-W的连接是基于每个主题的单词概率分布构建的。
5)除了以上信息,还有每个论文的标题,考虑到标题的特殊性,使用BERT将其训练为嵌入后拼接在对应的D节点属性向量后,将这样构造出的全局异质属性图定义为Gatt。
为了更好地捕捉图的拓扑结构,构造了全局异质拓扑图Gtop,他是没有语义属性的图Gatt的拓扑版本,具体来说,将图Galt的D和S节点的属性向量替换为无语义信息的TFIDF向量,将节点W的属性向量替换为无语义信息的one-hot向量,其他结构不变,将这样构造出的图定义为全局异质拓扑图Gtop。
局部结构比全局图更能代表单一类型节点对文本的影响;为了进一步捕获图的局部结构,构造了四个局部图。
具体来说,从全局异质拓扑图Gtop中分离出三个局部子图,由除D以外的每种类型的节点和节点D组成:D-W,D-T,D-S,这些局部图只包含全局异质拓扑图Gtop中两种类型的节点和对应的连接关系。将D-S局部图中S节点的属性向量替换为Sent2vec向量得到第四个局部图D-Sv。
众所周知,GCN是图神经网络最常用的方法。对于任意图G=(V,E),设X为图G的节点及其特征向量矩阵,设A’=A+I为图G添加了自连接的邻接矩阵,设M为度矩阵,其中Mii=∑jA′ij,则GCN的传播规则如下:
其中W(l)是一个可训练的变换矩阵,σ(·)是一个非线性激活函数H(l)表示第l层节点的隐藏表示,H(0)=X。
然而,由于异质性,GCN不能简单的应用于异质图神经网络。我们使用异质图卷积(HGCN),为异质图中的每一类节点都设置一个变换矩阵,通过各类变化矩阵将图中不同类型的节点投射到同一隐式公共空间中,HGCN的传播规则如下:
其中是的子矩阵,表示相邻的类型为r的节点,为将r类型的节点投射到隐式公共空间的可训练矩阵。
双层注意力机制的异质图卷积使用类型级和节点级注意力计算不同类型节点之间的重要性权重,传播规则如下:
其中βr代表双层注意力矩阵。
我们使用基于双层注意力机制的异质图卷积来对以上构建的六个图进行预训练来得到预训练后的向量Xpre:
Xpre=H(L)
双层注意力机制只捕获了不同类型节点信息之间的差异性,而没有考虑他们之间的共性,这些共性反映了文本对不同类型信息和结构的共同依赖,也是需要捕获的重要信息。通过构建上述图提取了多维节点信息和结构,接下来通过引入对比学习来捕获多维信息和结构的共性。
提出了交叉回路图对比学习,这是一种同时包含属性--拓扑两种结构,全局--全局,全局--局部,局部--局部三种连接的对比学习方法。
具体地说,将上述六个图中的每两个连接为一对,将图对中同类的D节点视为正样本对,不同类的D节点视为负样本对。在这一步基于交叉回路图对比学习随机选择好正样本对和负样本对。然后将这六个预训练过的图的D节点的属性向量分别输入到全连接层中进行进一步的特征增强,并将这些全连接层的输出记录为Xgraphs。
四、自适应学习
至此,获得了三种粒度的语义特征Xword、Xabs和Xtitle和六种视角的结构特征Xgraphs。使用分层自适应学习来将其融合为一个最优的文本特征。
具体地说,首先将三种粒度的语义特征通过自适应学习融合成一个文本语义特征Xsem:
Xsem=∑αiXi
其中,Xi为Xword、Xabs和Xtitle。
同时将六种视角的结构特征Xgraphs通过自适应学习融合成一个文本结构特征Xstr:
Xstr=∑βiXi
其中,Xi为Xgraphs;
然后分别将这两个特征通过全连接层再通过自适应学习融合成最终的最优文本特征Xstr:
Xstr=∑βiXi
其中,Xi为Xgraphs;
然后分别将这两个特征通过全连接层再通过自适应学习融合成最终的最优文本特征Xfin:
Xfin=∑γiXiWx
其中,Xi为Xstr,Xsem;Wi代表全连接层;
使用softmax对Xfin进行分类,得到期刊推荐结果。
五、损失函数
没有依赖于以往文本分类方法使用的交叉熵损失函数。而是在交叉熵的基础之上引入了人脸识别领域的Asoftmax损失和对比学习领域的infoNCE损失。将模型的损失分为四部分:
图预训练损失,语义损失,结构损失,预测损失。
(1)图预训练损失:
发现虽然Asoftmax更适配于的研究问题,但随着模型的参数变多、层数变深,Asoftmax损失函数的效果下降的要比传统交叉熵更快,所以在图预训练这一步仍然沿用交叉熵作为图预训练损失LHGCN:
(2)语义损失:
相比传统的交叉熵损失,Asoftmax可以在扩大类间差距的同时显著减小类内差距,很适合于这种标签类内差距大于类间差距的研究问题。所以使用语义特征Xsem的Asoftmax作为语义损失Lsem:
其中,x∈Xsem,m≥1代表控制边角距大小的整数,m=1时,Asoftmax就会退化为普通的Softmax。
(3)结构损失:
在结构角度下,使用前文交叉回路对比学习选定好的正负对,引入对比学习领域的infoNCE损失计算对比学习损失Lconst:
其中,H和H′表示图对中两个图,d表示H中一个D节点,d+表示H′中的一个同类D节点,d一表示H′中的一个不同类D节点,t是一个超参数,在softmax中称为温度系数。
将其与使用结构特征Xstr计算得的Asoftmax损失Lgraph结合起来作为结构损失Lstr:
Lstr=δLGonst+Lgraph+η||Θ||
(4)预测损失:
得到了最终的文本特征Xfin之后,同样使用Asoftmax计算得预测损失Lpred:
模型整体损失函数为:
L=λHGCNLHGCN+λsemLsem+λgraphLgraph+λconstLconst+λpredLpred。
1.LncRNA相关论文数据集实验结果
从Pubmed上获取了近五年来的LncRNA相关文章,这是一个典型的新兴交叉研究热点领域。经过分析与筛选,选择了其中发表文章最多的前50个期刊及其论文作为数据集,共含有LncRNA相关论文15114篇。
模型的效果如表1所示,模型的期刊推荐实例如图6所示。
表1.LncRNA数据集上的Top1-Top10分类正确率结果
2.MicroRNA相关论文数据集实验结果
MicroRNA也是近年来新兴的交叉研究领域,关于其研究也是科研人员的热点,从Pubmed上获取了近五年来的MicroRNA相关文章。经过分析与筛选,选择其中发表文章最多的前50个期刊及其论文作为的数据集,共含有MicroRNA相关论文29094篇。
模型的效果如表2所示,模型的期刊推荐实例如图7所示。
表2.MicroRNA数据集上的Top1-Top10分类正确率结果
以上所述,仅为本公开的具体实施方式,但本公开的保护范围并不局限于此,任何熟悉本技术领域的技术人员在本公开揭露的技术范围内,可轻易想到变化或替换,都应涵盖在本公开的保护范围之内。因此,本公开的保护范围应以权利要求的保护范围为准。

Claims (8)

1.一种基于多粒度异质属性图对比学习的期刊推荐方法,其特征在于,包括以下步骤:
步骤1)数据处理,收集论文的摘要和标题,并从中提取论文的文档粒度、句子粒度、单词粒度、主题粒度和标题粒度的信息;
步骤2)多粒度语义特征提取,将文档粒度、句子粒度、单词粒度的信息输入进多粒度语义特征提取模块,通过预训练和由卷积层与全连接层组成的特征加强网络得到三种粒度下的语义特征、和;
步骤3)基于异质图神经网络对比学习的多粒度结构特征提取,将文档粒度、句子粒度、单词粒度、主题粒度和标题粒度的信息输入进基于异质图神经网络对比学习的多粒度结构特征提取模块,构建全局异质属性图,根据全局异质属性图构建全局异质拓扑图,然后构建四个局部子图,使用基于双层注意力机制的异质图卷积对构建好的全局异质属性图、全局异质拓扑图和四个局部子图进行预训练,使用交叉回路图对比学习随机选取好正负对,然后将预训练好的图分别通过-一个全连接网络来进一步增强特征,得到六种视角的结构特征;
基于异质图神经网络对比学习的多粒度结构特征提取的具体步骤如下:
步骤S1:结构角度下,输入文本的文档、句子、单词、标题和主题五个粒度的信息来构建全局异质属性图,具有D、S、T、W四种节点,D-W,D-S,D-T,T-W,S-W五种连接;
步骤S2:通过将全局异质属性图中的D和S节点的属性向量替换为无语义信息的TFIDF向量以及节点W的属性向量替换为无语义信息的one-hot向量,构成为全局异质拓扑图;
步骤S3:从全局异质拓扑图中分离出三个局部子图,由除D以外的每种类型的节点和节点D组成:D-W,D-T,D-S,局部子图包含全局异质拓扑图中两种类型的节点和对应的连接关系,将D-S局部图中S节点的属性向量替换为Sent2vec向量得到第四个局部子图D-Sv;
步骤S4:使用基于双层注意力机制的异质图卷积来对以上构建的六个图进行预训练,得到预训练后的向量;提取全局异质拓扑图、全局异质属性图和四个局部子图中多维节点信息和结构,使用交叉回路图对比学习随机选取好正负对;
步骤S5:将预训练过的全局异质拓扑图、全局异质属性图和四个局部子图的D节点的属性向量分别输入到全连接层中进行进一步的特征增强,并将这些全连接层的输出,获得六种视角的结构特征;
步骤4)自适应学习,使用分层自适应学习来将三种语义特征和六种结构特征融合为一个最优的文本特征,其中,整合多种损失函数训练模型;
步骤5),使用softmax对进行分类,得到期刊推荐结果。
2.根据权利要求1所述的基于多粒度异质属性图对比学习的期刊推荐方法,其特征在于,在所述步骤1)中,将论文分解为以下五种粒度:将整个摘要当成一段话的文档粒度、将摘要分解成若干句子的句子粒度、将摘要分解成若干单词的单词粒度,然后采用BTM方法挖掘出摘要的潜在主题形成主题粒度,再加上由论文的标题形成的标题粒度。
3.根据权利要求1所述的基于多粒度异质属性图对比学习的期刊推荐方法,其特征在于,在步骤2)中,对于单词粒度,使用Word2vec方法初步训练初始的单词嵌入,再通过一个由卷积层和全连接层组成的特征增强网络模块来对初始的单词嵌入进行特征增强以得到单词粒度的语义特征:;
其中,代表初始单词嵌入,代表卷积操作,代表全连接层,代表全连接层的偏置项,代表非线性激活函数。
4.根据权利要求3所述的基于多粒度异质属性图对比学习的期刊推荐方法,其特征在于,在步骤2)中,对于摘要和标题粒度的信息,先使用Doc2vec和BERT训练他们的初始嵌入,再通过特征增强网络模块分别得到相应粒度的语义特征和。
5.根据权利要求1所述的基于多粒度异质属性图对比学习的期刊推荐方法,所述全局异质属性图的构造过程如下:
(1)将预处理过后的论文摘要作为D节点,将摘要分句和分词得到的句子和单词作为S节点和W节点,将每个D与其分句得到的S节点连接起来;
(2)将使用BTM挖掘出摘要的潜在主题作为T节点,T节点的属性向量用单词的概率分布表示,对于每个D节点,为其分配概率最高的Top5个主题T并将他们连接起来;
(3)使用Doc2vec训练文档得到D节点的属性向量,使用基于BERT的Sent2vec训练句子得到S节点的属性向量,使用Word2vec训练单词得到W节点的属性向量;
(4)如果一个文档D包含一个单词W,在对应的D和W之间构建连接,同理,如果一个句子S包含一个单词W,则在对应的S和W之间构建连接,T-W的连接是基于每个主题的单词概率分布构建的;
(5)针对每个论文的标题,考虑到标题的特殊性,使用BERT将其训练为嵌入后拼接在对应的D节点属性向量后,得到全局异质属性图。
6.根据权利要求1所述的基于多粒度异质属性图对比学习的期刊推荐方法,其特征在于,所述步骤4)自适应学习的具体步骤如下:步骤D1:将三种语义特征、和通过自适应学习融合成一个文本语义特征;
;
其中,为、和;
步骤D2:将六种视角的结构特征通过自适应学习融合成一个文本结构特征;
;
其中,为;
步骤D3:分别将这两个特征通过全连接层再通过自适应学习融合成最终的最优文本特征;
;
其中,为,;代表全连接层。
7.根据权利要求6所述的基于多粒度异质属性图对比学习的期刊推荐方法,其特征在于,在步骤4)中,损失函数是在交叉熵的基础之上引入人脸识别领域的Asoftmax损失和对比学习领域的infoNCE损失,其中,模型的损失包括预训练损失、语义损失、结构损失和预测损失。
8.根据权利要求7所述的基于多粒度异质属性图对比学习的期刊推荐方法,其特征在于,所述预训练损失为交叉熵,其中,图预训练损失:
;
使用文本语义特征的Asoftmax作为语义损失,其中,语义损失:
;
其中,,代表控制边角距大小的整数,时Asoftmax就会退化为普通的Softmax;
对比学习领域的infoNCE损失;
;
其中,H和H´表示图对中的两个图,d表示H中的一个D节点,d+表示H´中的一个同类D节点,d-表示H´中的一个不同类D节点,t是一个超参数,在softmax中称为温度系数;
将其与使用结构特征计算的Asoftmax损失结合起来作为结构损失;
;
最终的文本特征通过Asoftmax计算预测损失;
;
模型整体损失函数为:
。
CN202310482963.9A 2023-04-28 2023-04-28 一种基于多粒度异质属性图对比学习的期刊推荐方法 Active CN116541594B (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN202310482963.9A CN116541594B (zh) 2023-04-28 2023-04-28 一种基于多粒度异质属性图对比学习的期刊推荐方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN202310482963.9A CN116541594B (zh) 2023-04-28 2023-04-28 一种基于多粒度异质属性图对比学习的期刊推荐方法

Publications (2)

Publication Number Publication Date
CN116541594A CN116541594A (zh) 2023-08-04
CN116541594B true CN116541594B (zh) 2025-06-20

Family

ID=87449925

Family Applications (1)

Application Number Title Priority Date Filing Date
CN202310482963.9A Active CN116541594B (zh) 2023-04-28 2023-04-28 一种基于多粒度异质属性图对比学习的期刊推荐方法

Country Status (1)

Country Link
CN (1) CN116541594B (zh)

Families Citing this family (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN118069828B (zh) * 2024-04-22 2024-06-28 曲阜师范大学 一种基于异质图和语义融合的文章推荐方法
CN120565113B (zh) * 2025-05-26 2026-05-08 深圳市大数据研究院 多模态分类模型的训练方法、分类方法及多模态分类模型

Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN114020928A (zh) * 2021-11-02 2022-02-08 上海交通大学 一种基于异质图对比学习的虚假新闻识别方法
CN114626369A (zh) * 2022-03-18 2022-06-14 太原理工大学 融合标题摘要语义关系的学术文献推荐方法

Family Cites Families (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN115169529A (zh) * 2022-06-23 2022-10-11 西北工业大学 一种基于对比学习的通用无监督异构图表示学习方法

Patent Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN114020928A (zh) * 2021-11-02 2022-02-08 上海交通大学 一种基于异质图对比学习的虚假新闻识别方法
CN114626369A (zh) * 2022-03-18 2022-06-14 太原理工大学 融合标题摘要语义关系的学术文献推荐方法

Also Published As

Publication number Publication date
CN116541594A (zh) 2023-08-04

Similar Documents

Publication Publication Date Title
Tao et al. Self-supervised learning for multimedia recommendation
Liu et al. A survey of sentiment analysis based on transfer learning
CN115221325A (zh) 一种基于标签语义学习和注意力调整机制的文本分类方法
CN110866117A (zh) 一种基于语义增强与多层次标签嵌入的短文本分类方法
CN115659234B (zh) 一种融合文本属性的异质图表示学习方法
Mutanga et al. Detecting hate speech on twitter network using ensemble machine learning
CN104462253A (zh) 一种面向网络文本大数据的话题检测或跟踪方法
CN114265936A (zh) 一种科技项目文本挖掘的实现方法
CN113516198A (zh) 一种基于记忆网络和图神经网络的文化资源文本分类方法
CN116821371A (zh) 一种主题知识图联合增强的多文档科学摘要生成方法
CN116719900A (zh) 基于超图建模文档级因果结构的事件因果关系识别方法
CN116541594A (zh) 一种基于多粒度异质属性图对比学习的期刊推荐方法
CN115329085A (zh) 一种社交机器人分类方法及系统
Al Imran et al. Bnnet: A deep neural network for the identification of satire and fake bangla news
Yadav et al. A comparative study on clickbait detection using machine learning based methods
Yang et al. Graph-CAT: graph co-attention networks via local and global attribute augmentations
CN115952425B (zh) 一种融合语义增强与异质关联的Web服务聚类方法
CN116562286A (zh) 一种基于混合图注意力的智能配置事件抽取方法
Zhao et al. Entropy-aware self-training for graph convolutional networks
CN114298022A (zh) 一种用于大规模复杂语义网络的子图匹配的方法
CN110377845B (zh) 基于区间半监督lda的协同过滤推荐方法
CN113111288A (zh) 一种融合非结构化和结构化信息的Web服务分类方法
CN116775868B (zh) 一种新闻文本分类方法、系统、存储介质及设备
CN116992025B (zh) 一种基于图神经网络的多视角文本分类方法
CN112948581A (zh) 专利自动分类方法、装置、电子设备及存储介质

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination
GR01 Patent grant
GR01 Patent grant