CN116541569B - 一种社交网络图的处理方法 - Google Patents

一种社交网络图的处理方法

Info

Publication number
CN116541569B
CN116541569B CN202310539720.4A CN202310539720A CN116541569B CN 116541569 B CN116541569 B CN 116541569B CN 202310539720 A CN202310539720 A CN 202310539720A CN 116541569 B CN116541569 B CN 116541569B
Authority
CN
China
Prior art keywords
social network
node
anchor point
graph
similarity
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
CN202310539720.4A
Other languages
English (en)
Other versions
CN116541569A (zh
Inventor
程学旗
郭嘉丰
范意兴
张儒清
廉涛
咸宁
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Institute of Computing Technology of CAS
Original Assignee
Institute of Computing Technology of CAS
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Institute of Computing Technology of CAS filed Critical Institute of Computing Technology of CAS
Priority to CN202310539720.4A priority Critical patent/CN116541569B/zh
Publication of CN116541569A publication Critical patent/CN116541569A/zh
Application granted granted Critical
Publication of CN116541569B publication Critical patent/CN116541569B/zh
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/90Details of database functions independent of the retrieved data types
    • G06F16/903Querying
    • G06F16/9035Filtering based on additional data, e.g. user or group profiles
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/90Details of database functions independent of the retrieved data types
    • G06F16/901Indexing; Data structures therefor; Storage structures
    • G06F16/9024Graphs; Linked lists
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06QINFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR ADMINISTRATIVE, COMMERCIAL, FINANCIAL, MANAGERIAL OR SUPERVISORY PURPOSES; SYSTEMS OR METHODS SPECIALLY ADAPTED FOR ADMINISTRATIVE, COMMERCIAL, FINANCIAL, MANAGERIAL OR SUPERVISORY PURPOSES, NOT OTHERWISE PROVIDED FOR
    • G06Q10/00Administration; Management
    • G06Q10/40Business processes related to social networking or social networking services
    • YGENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
    • Y02TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
    • Y02DCLIMATE CHANGE MITIGATION TECHNOLOGIES IN INFORMATION AND COMMUNICATION TECHNOLOGIES [ICT], I.E. INFORMATION AND COMMUNICATION TECHNOLOGIES AIMING AT THE REDUCTION OF THEIR OWN ENERGY USE
    • Y02D30/00Reducing energy consumption in communication networks
    • Y02D30/70Reducing energy consumption in communication networks in wireless communication networks

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Databases & Information Systems (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Data Mining & Analysis (AREA)
  • Business, Economics & Management (AREA)
  • General Engineering & Computer Science (AREA)
  • Economics (AREA)
  • Tourism & Hospitality (AREA)
  • Strategic Management (AREA)
  • Operations Research (AREA)
  • Entrepreneurship & Innovation (AREA)
  • General Business, Economics & Management (AREA)
  • Computational Linguistics (AREA)
  • Marketing (AREA)
  • Human Resources & Organizations (AREA)
  • Quality & Reliability (AREA)
  • Software Systems (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

本发明提供了一种社交网络图的处理方法,包括:获取包括第一社交网络图和第二社交网络图的待处理网络图,以及两个图对应的初始锚点对集合;针对所述第一社交网络图和所述第二社交网络图分别提取两个图的节点结构信息;根据所述两个图的节点结构信息采用启发式的过滤规则基于多种相似度计算方式从所述初始锚点对集合中筛选出满足预设相似性要求的初始锚点对,得到经过滤的初始锚点对集合,其中,至少部分相似度计算方式依据两个图中能表征邻居结构的相关特征来计算相似度;基于所述节点结构信息和所述经过滤的初始锚点对集合确定所述第一社交网络图和所述第二社交网络图中节点间的关联关系。

Description

一种社交网络图的处理方法
技术领域
本发明涉及数据挖掘技术领域方法,具体来说涉及神经网络模型计算的硬件加速领域,更具体地说,涉及一种社交网络图的处理方法。
背景技术
随着互联网技术的发展,出现了各种社交平台。同一个人(用户)往往会在多个不同的社交平台上进行注册并建立对应的社交网络,从而产生了多样的异构社交网络。
为了能够更好地挖掘这些异构社交网络中的潜在信息,通常会在不同的社交网络中寻找节点的对应关系,一般也称网络对齐,用来发掘多个社交网络中属于同一个自然人的不同账户,以挖掘潜在的社交关系;从而实现各种跨网络的应用,例如好友推荐和内容传播(例如广告/新闻推送等)。
网络对齐需要利用到一些锚点对(或者称对齐节点对,即两个社交网络中已经关联的节点对)来进行有监督的网络对齐。现有的有监督网络对齐方法普遍可分为两步,第一步利用已知的一小部分对齐节点对(称为锚点对),建立网络之间的映射,通过谱方法或神经网络等网络表示学习方法,将不同网络的结构和属性信息等编码为同一个嵌入空间中的节点向量;第二步根据相似度函数和对齐策略对映射空间里的节点向量进行对齐,将相似度最高的节点对视为对齐结果。
然而,在真实场景中,社交网络之间的网络结构差异和已知锚点对中的噪声给对齐任务带来了巨大的挑战。网络结构差异使得相同节点在不同网络中可能会有不同的表现,导致出现网络结构噪声,破坏了网络对齐预设的结构一致性假设;锚点对噪声则影响了两个网络之间的映射,导致难以准确判断嵌入空间中距离最接近的节点是否是相同节点,网络对齐的正确性有待提高。
发明内容
因此,本发明的目的在于克服上述现有技术的缺陷,提供一种社交网络图的处理方法。
本发明的目的是通过以下技术方案实现的:
根据本发明的第一方面,提供一种社交网络图的处理方法,包括:获取待处理的两个图,分别为第一社交网络图和第二社交网络图,以及所述两个图数据对应的锚点对集合;根据所述两个图,采用启发式的过滤规则基于多种相似度计算方式从所述锚点对集合中筛选出满足预设相似性要求的锚点对,得到经过滤的锚点对集合,该经过滤的锚点对集合用于确定第一社交网络图中节点与第二社交网络图中节点之间的对应关系。
根据本发明的一个实施例,所述启发式的过滤规则包括:根据每种预设的相似度计算方式分别为两个图间的每两个节点构成的节点对确定一个表征相似度的参考值,任一节点对是锚点对或者非锚点对;针对各节点对,利用每种预设的相似度计算方式得到的参考值进行对应种类的相似度排名,得到多个种类的相似度排名;根据锚点对集合中的各锚点对在多个种类的相似度排名中的表现进行筛选,得到经过滤的锚点对集合。
根据本发明的一个实施例,每次筛选时,将在所述多个种类的相似度排名中名次均符合预设名次要求的锚点对作为满足预设相似性要求的锚点对。
根据本发明的一个实施例,每个节点对包括属于所述第一社交网络图的第一节点和属于所述第二社交网络图的第二节点,所述多种预设的相似度计算方式包括以下方式或者以下方式的组合:
方式1:利用PageRank算法,确定第一节点在所述第一社交网络图中的第一PageRank值以及第二节点在所述第二社交网络图中的第二PageRank值,确定所述第一PageRank值和所述第二PageRank值的相似性以作为参考值1;
方式2:获取第一节点在所述第一社交网络图中的度Ds和第二节点在所述第二社交网络图中的度Dt,将作为参考值2;
方式3:获取第一节点在所述第一社交网络图中的度Ds和第二节点在所述第二社交网络图中的度Dt,将作为参考值3;
方式4:获取第一节点在所述第一社交网络图中的第一聚集系数和第二节点在所述第二社交网络图中的第二聚集系数,确定所述第一聚集系数和所述第二聚集系数的相似度作为参考值4;
方式5:获取第一节点在所述第一社交网络图中的第一邻居度向量,第二节点在所述第二社交网络中的第二邻居度向量,确定所述第一邻居度向量与所述第二邻居度向量的相似度作为参考值5;
方式6:获取第一节点在所述第一社交网络图的异构子图的不同编号位置出现的次数作为第一图元频度向量以及第二节点在所述第二社交网络图的异构子图的不同编号位置出现的次数作为第二图元频度向量,确定所述第一图元频度向量与所述第二图元频度向量的相似度作为参考值6;
方式7:获取根据当前的锚点对集合将第一节点的预设跳数范围内的邻居集合映射至所述第二社交网络图的形成第一节点在第二社交网络图中的映射邻居集合,以及第二节点在所述第二社交网络图的邻居集合,确定所述映射邻居集合与所述邻居集合的相似度作为参考值7。
根据本发明的一个实施例,第一邻居度向量和第二邻居度向量中的任意邻居度向量是利用对应的社交网络图中预设跳数范围内的每种跳数下满足预设条件的邻居节点的数量与每种跳数预设的距离衰减系数相乘得到,其中,预设条件是该种跳数下对相应邻居节点的度取对数后得到的值处于预设的筛选范围值中。
根据本发明的一个实施例,参考值6按照以下方式确定:
参考值
其中,gls表示第一图元频度向量,glt表示第二图元频度向量,max(gls,glt)表示从gls和gls中取最大值。
根据本发明的第二方面,提供一种社交网络图的节点对齐方法,包括:S1、进行初始的对齐操作,包括:获取要待处理的两个图和初始锚点对集合,利用第一方面所述的方法从中得到经过滤的初始锚点对集合;利用经过滤的初始锚点对集合和带重启的随机游走模型分别对第一社交网络图和第二社交网络图进行图嵌入处理,得到每个图中节点的特征向量并基于两个图中每两个节点的特征向量的距离进行对齐,得到对齐结果;S2、进行一次或者多次中间对齐操作,包括:将最新的对齐结果作为中间锚点对集合,利用第一方面所述的方法从中得到经过滤的中间锚点对集合;利用经过滤的中间锚点对集合和带重启的随机游走模型分别对第一社交网络图和第二社交网络图进行图嵌入处理,更新每个图中节点的特征向量并基于两个图中每两个节点更新后的特征向量的距离进行对齐,得到更新后的对齐结果。
根据本发明的第二方面,提供一种社交网络图的节点对齐方法,包括:S1、进行初始的对齐操作,包括:获取要待处理的两个图和初始锚点对集合,利用第一方面所述的方法从中得到经过滤的初始锚点对集合;利用经过滤的初始锚点对集合和带重启的随机游走模型分别对第一社交网络图和第二社交网络图进行图嵌入处理,得到每个图中节点的特征向量并基于两个图中每两个节点的特征向量的距离进行对齐,得到对齐结果;S2、进行一次或者多次中间对齐操作,包括:将最新的对齐结果作为中间锚点对集合,利用第一方面所述的方法从中得到经过滤的中间锚点对集合;利用经过滤的中间锚点对集合和带重启的随机游走模型分别对第一社交网络图和第二社交网络图进行图嵌入处理,更新每个图中节点的特征向量并基于两个图中每两个节点更新后的特征向量的距离进行对齐,得到更新后的对齐结果;S3、对最后一次的对齐结果及其经过滤的对齐结果的差集进行二部图的最小权重匹配以删除重复的对应关系,得到匹配结果,其中,经过滤的对齐结果是采用启发式的过滤规则处理最后一次的对齐结果得到的;S4、将所述匹配结果与最后一次得到的经过滤的对齐结果的并集作为最终的对齐结果。
根据本发明的第四方面,提供一种电子设备,包括:一个或多个处理器;以及存储器,其中存储器用于存储可执行指令;所述一个或多个处理器被配置为经由执行所述可执行指令以实现第一方面所述方法的步骤。
与现有技术相比,本发明的优点在于:
本发明采用启发式的过滤规则基于多种相似度计算方式从所述初始锚点对集合中筛选出满足预设相似性要求的初始锚点对,得到经过滤的初始锚点对集合,通过利用经过滤的初始锚点对集合确定所述第一社交网络图和所述第二社交网络图中至少部分节点间的对应关系。由此,可以依据多种相似度计算方式消除初始锚点对集合中的一部分锚点对噪声,以在对齐时消除一部分网络结构噪声的影响,提升社交网络图对齐的正确率。
附图说明
以下参照附图对本发明实施例作进一步说明,其中:
图1为根据本发明实施例的社交网络图的节点对齐方法的流程示意图;
图2为根据本发明实施例的社交网络图的处理方法的流程示意图;
图3为根据本发明实施例的用于解释子图和图元频度向量的示意图。
具体实施方式
为了使本发明的目的,技术方案及优点更加清楚明白,以下结合附图通过具体实施例对本发明进一步详细说明。应当理解,此处所描述的具体实施例仅用以解释本发明,并不用于限定本发明。
如在背景技术部分提到的,网络结构噪声和锚点对噪声的存在,导致网络对齐的正确性有待提高。发明人在进行网络结构(即社交网络图的结构)对齐研究时,反复研究并确定现有技术的问题是由对齐过程中难以区分噪声和真实对齐节点对导致的。对此,发明人经过对网络结构噪声和锚点对噪声的进一步研究发现,在对齐过程中优先过滤出高置信度的锚点对有利于纠正网络的结构噪声,即降低锚点对噪声有助于纠正网络的结构噪声,以在对齐时进一步提高对齐正确率。对此,本发明采用启发式的过滤规则基于多种相似度计算方式从所述初始锚点对集合中筛选出满足预设相似性要求的初始锚点对,得到经过滤的初始锚点对集合,通过利用经过滤的初始锚点对集合确定所述第一社交网络图和所述第二社交网络图中至少部分节点间的对应关系。由此,可以依据多种相似度计算方式消除初始锚点对集合中的一部分锚点对噪声,以在对齐时消除一部分网络结构噪声的影响,提升社交网络图对齐的正确率。
根据本发明的一个实施例,参见图1,提供一种社交网络图的节点对齐方法,包括步骤A1、A2、A3、A4,下面结合具体的实施例针对每一个步骤分别进行详细说明。
步骤A1:进行初始的对齐操作,初始的对齐操作包括:获取要待处理的两个图和初始锚点对集合,利用社交网络图的处理方法从中得到经过滤的初始锚点对集合;利用经过滤的初始锚点对集合和带重启的随机游走模型分别对第一社交网络图和第二社交网络图进行图嵌入处理,得到每个图中节点的特征向量并基于两个图中每两个节点的特征向量的距离进行对齐,得到对齐结果。
根据本发明的一个实施例,示意性的,社交网络图的处理方法包括步骤A111和步骤A112,下面分别进行说明:
步骤A111:获取待处理的两个图(Graph),分别为第一社交网络图和第二社交网络图,以及所述两个图数据对应的初始锚点对集合;
根据本发明的一个实施例,社交网络图是以图数据结构(Graph)表示的社交网络,图数据结构中以节点表示用户并以边来定义用户之间的关系。第一社交网络图和第二社交网络图可以是有向图,也可以是无向图,本发明实施例在此不作具体限定。所述第一社交网络图和所述第二社交网络图可以是分别从不同的社交平台获取的社交网络图。举例来说,所述第一社交网络图可以是新浪微博平台上的用户之间形成的社交网络图,而所述第二社交网络图可以是QQ平台上的用户之间形成的社交网络图。当然也可以是其他类型的社交平台,本发明实施例在此不作具体限定。
根据本发明的一个实施例,锚点对集合是指所述第一社交网络图和所述第二社交网络图中建立了对应关系的节点对。本申请中,锚点对集合分为初始锚点对集合、中间锚点对集合。其中,初始锚点对集合是预先为所述第一社交网络图和所述第二社交网络图标定的锚点对。中间锚点对集合是经节点对齐后在所述第一社交网络图和所述第二社交网络图中建立了对应关系的节点对,即对齐结果,后文会进行说明,此处不作赘述。
步骤A112:根据所述两个图,采用启发式的过滤规则基于多种相似度计算方式从初始锚点对集合中筛选出满足预设相似性要求的锚点对,得到经过滤的初始锚点对集合。
根据本发明的一个实施例,步骤A112中,是利用启发式的过滤规则过滤初始锚点对集合,得到经过滤的初始锚点对集合。
参见图2,对任意的一个锚点对集合,启发式的过滤规则的处理过程包括:Q1、获取待处理的两个图,分别为第一社交网络图和第二社交网络图,以及所述两个图数据对应的锚点对集合;Q2、根据所述两个图,采用启发式的过滤规则基于多种相似度计算方式从所述锚点对集合中筛选出满足预设相似性要求的锚点对,得到经过滤的锚点对集合。在步骤A112中,利用启发式的过滤规则根据每种预设的相似度计算方式分别为两个图间的每两个节点构成的节点对确定一个表征相似度的参考值,任一节点对是锚点对或者非锚点对;针对各节点对,利用每种预设的相似度计算方式得到的参考值进行对应种类的相似度排名,得到多个种类的相似度排名;根据初始锚点对集合中的各锚点对在多个种类的相似度排名中的表现进行筛选,得到经过滤的初始锚点对集合。应当理解,相似度排名中的表现可以有多种方式来评价。优选的,每次筛选时,将在所述多个种类的相似度排名中名次均符合预设名次要求的锚点对作为满足预设相似性要求的锚点对。比如:设置一个名次阈值,该名次阈值是总名次乘以预定比例(如60%、65%、70%、75%或者80%等)得到的值,如果按照相似度由高到低得到相似度排名,则相应锚点对在一个种类的相似度排名的名次小于等于该名次阈值时,则该锚点对在该种类的相似度排名的名次符合预设名次要求;如果该锚点对在所有种类的相似度排名的名次均符合对应种类的预设名次要求,则该锚点对为满足预设相似性要求的锚点对。应当理解,除此之外,本领域技术人员也可以采用其他方式评价,比如,设置为每个种类的相似度排名设置权重,基于该权重对多个种类的相似度排名进行加权,得到加权的相似度排名,将加权的相似度排名小于等于名次阈值的锚点对视为满足预设相似性要求的锚点对。
根据本发明的一个实施例,每个节点对包括属于所述第一社交网络图的第一节点和属于所述第二社交网络图的第二节点,所述多种预设的相似度计算方式包括以下方式或者以下方式的组合(即方式1-方式7的组合):
方式1:利用PageRank算法,确定第一节点在所述第一社交网络图中的第一PageRank值以及第二节点在所述第二社交网络图中的第二PageRank值,确定所述第一PageRank值和所述第二PageRank值的相似性以作为参考值1。应当理解,PageRank算法原用于计算网页排名(即网页的PageRank值),但是,可将图数据的节点视为网页,节点间的连接(即边)视为网页的链接(即网页间的跳转链接),则可以利用PageRank算法确定节点在社交网络图中的PageRank值。另外,PageRank算法也有多种计算版本,可根据实施者需要使用,本实施例对此不作任何限定。通过方式1,有助于从节点的PageRank值的相似性的角度,来筛选置信度高的锚点对,以降低锚点对噪声。
方式2:获取第一节点在所述第一社交网络图中的度Ds和第二节点在所述第二社交网络图中的度Dt,将作为参考值2。节点在图中的度(Degree),简称节点的度,又称关联度,是图结构的基本概念,是指和该节点相关联的边的条数。通过方式2,有助于从节点的度的相对相似性的角度,来筛选置信度高的锚点对,以降低锚点对噪声。
方式3:获取第一节点在所述第一社交网络图中的度Ds和第二节点在所述第二社交网络图中的度Dt,将作为参考值3。通过方式3,有助于从节点的度的绝对相似性的角度,来筛选置信度高的锚点对,以降低锚点对噪声。
方式4:获取第一节点在所述第一社交网络图中的第一聚集系数和第二节点在所述第二社交网络图中的第二聚集系数,确定所述第一聚集系数和所述第二聚集系数的相似度作为参考值4。在图论中,节点的聚集系数Clustering coefficient)是指图中该节点的邻居的聚集程度(即局部的聚集系数)。通过方式4,有助于从局部的聚集系数的相似性的角度,来筛选置信度高的锚点对,以降低锚点对噪声。
方式5:获取第一节点在所述第一社交网络图中的第一邻居度向量,第二节点在所述第二社交网络中的第二邻居度向量,确定所述第一邻居度向量与所述第二邻居度向量的相似度作为参考值5。通过方式5,有助于从邻居度向量的相似性的角度,来筛选置信度高的锚点对,以降低锚点对噪声。优选的,第一邻居度向量和第二邻居度向量中的任意邻居度向量是利用对应的社交网络图中预设跳数范围内的每种跳数下满足预设条件的邻居节点的数量与每种跳数预设的距离衰减系数相乘得到,其中,预设条件是该种跳数下对相应邻居节点的度取对数后得到的值处于预设的筛选范围值中。例如,以节点s为例,对于距离节点s为i跳的所有邻居节点,将它们的度D计算log2D值后上取整得到整数值作为这个邻居节点的度信息,将度信息分别为0~m的i跳邻居节点数量作为i跳邻居的度向量;对于距离s在3跳以内节点,得到3个不同的度向量,对于k跳的度向量,乘0.5k-1作为距离衰减系数,然后将加权后的度向量累加作为节点s的邻居度向量的值。邻居度向量的相似性可使用现有的算法,例如使用径向基函数(Radial Basis Function,RBF)核计算节点对中两个节点的邻居度向量(即第一邻居度向量和第二邻居度向量)的相似度,得到参考值5。利用距离衰减系数可以更加关注距离节点更近的邻居的度向量的值的影响,提升基于参考值5进行过滤的准确性。应当理解,不设置距离衰减系数原理上也是可行的,以产生其他的实施方式。
方式6:获取第一节点在所述第一社交网络图的异构子图的不同编号位置出现的次数作为第一图元频度向量以及第二节点在所述第二社交网络图的异构子图的不同编号位置出现的次数作为第二图元频度向量,确定所述第一图元频度向量与所述第二图元频度向量的相似度作为参考值6。图元上每个带有编号节点其拓扑结构都是独一无二的。统计第一节点s和第二节点t出现在图元不同编号位置的次数,将其转换为图元频度向量gls和glt。为便于理解,参见图3,通过一个简化的图结构说明子图和图元频度向量。假设一个图由a、b、c、d四个节点构成,连接关系如图3的图结构所示。对应的,该图结构的异构子图共有3种,分别为子图x、子图y和子图z。右侧列出了关于节点a,b的节点数在3以内的图元分布:最上方一行是节点数在3以内不同构子图,灰色和白色用于区分不同位置的节点,拓扑结构相同的节点使用同一种颜色表示;每个子图下方是节点a和b的图元分布,子图之间用灰色虚线分隔;每个图元示意图中加粗圆圈突出显示节点a和节点b,实线表示与当前节点和图元相关的结构,虚线表示不相关的结构,节点旁边的数字表示图元编号。对于图元0,节点a在(a,b),(a,d),(a,c)3种结构中重复出现了3次,因此a的图元频度向量第0维是3;对于图元2,节点b在结构(a,b,d)中出现了1次,因此b的图元频度向量第2维是1。根据此规则,可以得到,对于节点a和节点b,节点数在3以内的图元度向量分别为(3,2,3,1)和(2,2,1,1),见图3左侧的表格,节点c和节点d的类似,此处不作赘述。优选的,参考值6按照以下方式确定:
参考值
其中,gls表示第一图元频度向量,glt表示第二图元频度向量,max(gls,glt)表示从gls和gls中取最大值。通过方式5,有助于从图元频度向量的相似性的角度,来筛选置信度高的锚点对,以降低锚点对噪声。
方式7:获取根据当前的锚点对集合将第一节点的预设跳数范围内的邻居集合映射至所述第二社交网络图的形成第一节点在第二社交网络图中的映射邻居集合,以及第二节点在所述第二社交网络图的邻居集合,确定所述映射邻居集合与所述邻居集合的相似度作为参考值7。邻居集合,可用节点的邻居节点的编号来表示。通过方式7,有助于从节点的邻居集合的相似性的角度,来筛选置信度高的锚点对,以降低锚点对噪声。应当理解,基于本发明的启发,实施者也可以添加、删除或者调整部分相似度计算方式,以得到其他类似的实施方式。
根据本发明的一个实施例,利用经过滤的初始锚点对集合和带重启的随机游走模型分别对第一社交网络图和第二社交网络图进行图嵌入处理,得到每个图中节点的特征向量并基于两个图中每两个节点的特征向量的距离进行对齐,得到对齐结果的步骤通过以下A121和A122的示意性实施例来说明。
A121:利用经过滤的初始锚点对集合和带重启的随机游走模型分别对第一社交网络图和第二社交网络图进行图嵌入处理,得到每个图中节点的特征向量。
根据本发明的一个实施例,可以利用随机游走模型对社交网络图进行图嵌入处理的步骤。但为了提高抗干扰性,进一步减轻结构噪声带来的影响,提高对齐正确率,本实施例采用带重启的随机游走模型对社交网络图进行图嵌入处理。示意性的,对任一图进行嵌入处理,得到该图中节点的特征向量的示意性过程包括:输入要对齐的图G的邻接矩阵A;对A做(或者称执行)行L1归一化后,得到转移概率矩阵W;对于输入的重启概率c,可以得到带重启的随机游走概率矩阵R=(1-c)(I-cW)-1,其中I为单位矩阵;R的每一行都是图G中一个节点到其他所有节点的转移概率向量(也可称为带重启的随机游走向量,可以用来表示该节点在图G中的结构信息);对网络Gs和Gt进行节点对齐时,使用锚点对集合A={(s,t)|s∈S,t∈T}在两个不同图之间建立映射(即对应关系),其中S和T分别是Gs和Gt网络的锚节点集合;对于Gs中的节点,将节点到锚节点集合S中所有节点的转移概率向量作为节点的特征向量;对Gt中节点采取同样操作,以得到相应节点的特征向量,此处不作赘述。该实施例的技术方案至少能够实现以下有益技术效果:带重启的随机游走相比一般的谱方法,有较强的抗干扰性,可以减轻结构噪声带来的影响,其高对齐正确率。
A122:基于两个图中每两个节点的特征向量的距离进行对齐,得到对齐结果。
根据本发明的一个实施例,对于第一社交网络图中的每个节点,将第二社交网络图中与特征向量的距离最小的节点作为第一社交网络图中的该节点所对应的节点,得到对齐结果。示意性的,对齐时,例如使用曼哈顿距离(Cityblock Distance)度量两个特征向量之间的距离,作为两节点特征向量的相似度;对于每个Gs中的节点,将Gt中与之相似度最高(即曼哈顿距离最小)的节点作为它的对齐结果。
步骤A2:进行一次或者多次中间对齐操作,每次中间对齐操作包括:将最新的对齐结果作为中间锚点对集合,利用社交网络图的处理方法从中得到经过滤的中间锚点对集合;利用经过滤的中间锚点对集合和带重启的随机游走模型分别对第一社交网络图和第二社交网络图进行图嵌入处理,更新每个图中节点的特征向量并基于两个图中每两个节点更新后的特征向量的距离进行对齐,得到更新后的对齐结果。
根据本发明的一个实施例,中间对齐操作与初始的对齐操作的不同之处在于,将初始的对齐操作中的初始锚点对集合换成了中间锚点对集合,故此处不作赘述。中间对齐操作的次数可以由实施者根据需要设置,比如设定为某个数值,或者,采取预定的评价指标(如多次对齐结果的差异小于预定差异阈值)来判断是否应当停止中间对齐操作。该实施例的技术方案至少能够实现以下有益技术效果:经过一次或者多次中间对齐操作后,可以进一步过滤出较高置信度的锚点对,有利于纠正网络的结构噪声,提升对齐结果的准确率。
步骤A3:对最后一次的对齐结果及其经过滤的对齐结果的差集进行二部图最小权重匹配以删除重复的对应关系,得到匹配结果,其中,经过滤的对齐结果是采用启发式的过滤规则处理最后一次的对齐结果得到的。
根据本发明的一个实施例,差集中的结果置信度较低,因此,经过多轮对齐和过滤后,针对对齐结果中置信度较低的一部分节点进行重新对齐。对此,可采用二部图的最小权重匹配算法(例如采用Karp论文中的方法,参见Richard Manning Karp:An algorithm toSolve the m x n Assignment Problem in Expected Time O(mn log n).Networks,10(2):143–152,1980.)来删除重复的对应关系,以提升最终对齐结果的准确性。示意性的,输入低置信度节点对集合(即所述差集)L={(u,v)|u∈U,v∈V},构建二部图G={U,V,E},其中U和V分别是两个不同图的节点集合,u、v代表其中的节点,E是带权重的二部图的边,通过以下方法构建:对于节点集合U中每个节点u,选择前k个相似度最高的节点,在u与这些节点之间添加边,节点之间的特征向量的距离作为边的权重加入到E中。对V中每个节点v采取相同操作。构建完二部图后,在二部图G上采取二部图的最小权重匹配算法,删减二部图G上的边以最小化所有边的权重和,得到匹配结果。该实施例的技术方案至少能够实现以下有益技术效果:对齐过程中,高置信度节点对之间的对齐是比较可靠的,而低置信度的节点对之间,特别是重复节点的对齐很可能是错误的,因此专门使用一对一对齐的二部图最小权重匹配方法进行处理,保证不会有重复对齐的结果出现。由于减少了重复节点的数量,对齐正确率会进一步上升。
步骤A4:将所述匹配结果与最后一次对齐结果所对应的经过滤的对齐结果的并集作为最终的对齐结果。
根据本发明的一个实施例,即将匹配结果附加到最后一次对齐结果所对应的经过滤的对齐结果,输出最终的对齐结果。
为了验证,申请人就上述实施例进行了实验,在Arenas邮件网络对齐任务中,经过步骤A1-A4的处理,针对最大20%的结构差异和40%的锚节点噪声的情况,可以达到98.59%的正确率。
另外,应当理解,除了前述实施例外,本领域技术人员也可以采用其他方式来利用经过滤的锚点对集合确定第一社交网络图中节点与第二社交网络图中节点之间的对应关系。
根据本发明的另一个实施例,提供一种社交网络图的节点对齐方法,包括步骤:A1、A2、A3’,其中,步骤A1、A2与前述实施例的步骤A1、A2一致,此处不作赘述。步骤A3’包括:将最后一次的对齐结果作为最终的对齐结果。即:不采用二部图的最小权重匹配算法去重,但是,在基于用启发式的过滤规则进行初始的对齐操作和一次或者多次中间对齐操作的情况下,仍可提升对齐结果的准确率。
又或者,根据本发明的又一个实施例,提供一种社交网络图的节点对齐方法,包括步骤:A1’、A2、A3’,其中,步骤A1’与前述实施例的A1的不同之处在于,不采用启发式的过滤规则对初始锚点对集合进行过滤,即直接基于初始锚点对集合进行初始的对齐操作。仅在步骤A2中,采用启发式的过滤规则对中间锚点对集合进行过滤。
需要说明的是,虽然上文按照特定顺序描述了各个步骤,但是并不意味着必须按照上述特定顺序来执行各个步骤,实际上,这些步骤中的一些可以并发执行,甚至改变顺序,只要能够实现所需要的功能即可。
本发明可以是系统、方法和/或计算机程序产品。计算机程序产品可以包括计算机可读存储介质,其上载有用于使处理器实现本发明的各个方面的计算机可读程序指令。
计算机可读存储介质可以是保持和存储由指令执行设备使用的指令的有形设备。计算机可读存储介质例如可以包括但不限于电存储设备、磁存储设备、光存储设备、电磁存储设备、半导体存储设备或者上述的任意合适的组合。计算机可读存储介质的更具体的例子(非穷举的列表)包括:便携式计算机盘、硬盘、随机存取存储器(RAM)、只读存储器(ROM)、可擦式可编程只读存储器(EPROM或闪存)、静态随机存取存储器(SRAM)、便携式压缩盘只读存储器(CD-ROM)、数字多功能盘(DVD)、记忆棒、软盘、机械编码设备、例如其上存储有指令的打孔卡或凹槽内凸起结构、以及上述的任意合适的组合。
以上已经描述了本发明的各实施例,上述说明是示例性的,并非穷尽性的,并且也不限于所披露的各实施例。在不偏离所说明的各实施例的范围和精神的情况下,对于本技术领域的普通技术人员来说许多修改和变更都是显而易见的。本文中所用术语的选择,旨在最好地解释各实施例的原理、实际应用或对市场中的技术改进,或者使本技术领域的其它普通技术人员能理解本文披露的各实施例。

Claims (9)

1.一种社交网络图的处理方法,其特征在于,包括:
获取待处理的两个图,分别为第一社交网络图和第二社交网络图,以及所述两个图数据对应的锚点对集合;
根据所述两个图,采用启发式的过滤规则基于多种相似度计算方式从所述锚点对集合中筛选出满足预设相似性要求的锚点对,得到经过滤的锚点对集合,该经过滤的锚点对集合用于确定第一社交网络图中节点与第二社交网络图中节点之间的对应关系,其中,所述启发式的过滤规则包括:
根据每种预设的相似度计算方式分别为两个图间的每两个节点构成的节点对确定一个表征相似度的参考值,任一节点对是锚点对或者非锚点对;
针对各节点对,利用每种预设的相似度计算方式得到的参考值进行对应种类的相似度排名,得到多个种类的相似度排名;以及
根据锚点对集合中的各锚点对在多个种类的相似度排名中的表现进行筛选,得到经过滤的锚点对集合。
2.根据权利要求1所述的方法,其特征在于,每次筛选时,将在所述多个种类的相似度排名中名次均符合预设名次要求的锚点对作为满足预设相似性要求的锚点对;或者,每次筛选时,基于每个种类的相似度排名的权重对多个种类的相似度排名进行加权,得到加权的相似度排名,将加权的相似度排名小于等于名次阈值的锚点对视为满足预设相似性要求的锚点对。
3.根据权利要求1所述的方法,其特征在于,每个节点对包括属于所述第一社交网络图的第一节点和属于所述第二社交网络图的第二节点,所述多种预设的相似度计算方式包括以下方式或者以下方式的组合:
方式1:利用PageRank算法,确定第一节点在所述第一社交网络图中的第一PageRank值以及第二节点在所述第二社交网络图中的第二PageRank值,确定所述第一PageRank值和所述第二PageRank值的相似性以作为参考值1;
方式2:获取第一节点在所述第一社交网络图中的度和第二节点在所述第二社交网 络图中的度,将作为参考值2;
方式3:获取第一节点在所述第一社交网络图中的度和第二节点在所述第二社交网 络图中的度,将作为参考值3;
方式4:获取第一节点在所述第一社交网络图中的第一聚集系数和第二节点在所述第二社交网络图中的第二聚集系数,确定所述第一聚集系数和所述第二聚集系数的相似度作为参考值4;
方式5:获取第一节点在所述第一社交网络图中的第一邻居度向量,第二节点在所述第二社交网络中的第二邻居度向量,确定所述第一邻居度向量与所述第二邻居度向量的相似度作为参考值5;
方式6:获取第一节点在所述第一社交网络图的异构子图的不同编号位置出现的次数作为第一图元频度向量以及第二节点在所述第二社交网络图的异构子图的不同编号位置出现的次数作为第二图元频度向量,确定所述第一图元频度向量与所述第二图元频度向量的相似度作为参考值6;
方式7:获取根据当前的锚点对集合将第一节点的预设跳数范围内的邻居集合映射至所述第二社交网络图的形成第一节点在第二社交网络图中的映射邻居集合,以及第二节点在所述第二社交网络图的邻居集合,确定所述映射邻居集合与所述邻居集合的相似度作为参考值7。
4.根据权利要求3所述的方法,其特征在于,第一邻居度向量和第二邻居度向量中的任意邻居度向量是利用对应的社交网络图中预设跳数范围内的每种跳数下满足预设条件的邻居节点的数量与每种跳数预设的距离衰减系数相乘得到,其中,预设条件是该种跳数下对相应邻居节点的度取对数后得到的值处于预设的筛选范围值中。
5.根据权利要求3所述的方法,其特征在于,参考值6按照以下方式确定:
其中,表示第一图元频度向量,表示第二图元频度向量,表示从中取最大值。
6.一种社交网络图的节点对齐方法,其特征在于,包括:
S1、进行初始的对齐操作,包括:
获取要待处理的两个图和初始锚点对集合,利用权利要求1-5任一项所述的方法从中得到经过滤的初始锚点对集合;
利用经过滤的初始锚点对集合和带重启的随机游走模型分别对第一社交网络图和第二社交网络图进行图嵌入处理,得到每个图中节点的特征向量并基于两个图中每两个节点的特征向量的距离进行对齐,得到对齐结果;
S2、进行一次或者多次中间对齐操作,包括:
将最新的对齐结果作为中间锚点对集合,利用权利要求1-5任一项所述的方法从中得到经过滤的中间锚点对集合;
利用经过滤的中间锚点对集合和带重启的随机游走模型分别对第一社交网络图和第二社交网络图进行图嵌入处理,更新每个图中节点的特征向量并基于两个图中每两个节点更新后的特征向量的距离进行对齐,得到更新后的对齐结果。
7.一种社交网络图的节点对齐方法,其特征在于,包括:
S1、进行初始的对齐操作,包括:
获取要待处理的两个图和初始锚点对集合,利用权利要求1-5任一项所述的方法从中得到经过滤的初始锚点对集合;
利用经过滤的初始锚点对集合和带重启的随机游走模型分别对第一社交网络图和第二社交网络图进行图嵌入处理,得到每个图中节点的特征向量并基于两个图中每两个节点的特征向量的距离进行对齐,得到对齐结果;
S2、进行一次或者多次中间对齐操作,包括:
将最新的对齐结果作为中间锚点对集合,利用权利要求1-5任一项所述的方法从中得到经过滤的中间锚点对集合;
利用经过滤的中间锚点对集合和带重启的随机游走模型分别对第一社交网络图和第二社交网络图进行图嵌入处理,更新每个图中节点的特征向量并基于两个图中每两个节点更新后的特征向量的距离进行对齐,得到更新后的对齐结果;
S3、对最后一次的对齐结果及其经过滤的对齐结果的差集进行二部图的最小权重匹配以删除重复的对应关系,得到匹配结果,其中,经过滤的对齐结果是采用启发式的过滤规则处理最后一次的对齐结果得到的;
S4、将所述匹配结果与最后一次得到的经过滤的对齐结果的并集作为最终的对齐结果。
8.一种计算机可读存储介质,其特征在于,其上存储有计算机程序,所述计算机程序可被处理器执行以实现权利要求1至7中任一项所述方法的步骤。
9.一种电子设备,其特征在于,包括:
一个或多个处理器;以及
存储器,其中存储器用于存储可执行指令;
所述一个或多个处理器被配置为经由执行所述可执行指令以实现权利要求1至7中任一项所述方法的步骤。
CN202310539720.4A 2023-05-15 2023-05-15 一种社交网络图的处理方法 Active CN116541569B (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN202310539720.4A CN116541569B (zh) 2023-05-15 2023-05-15 一种社交网络图的处理方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN202310539720.4A CN116541569B (zh) 2023-05-15 2023-05-15 一种社交网络图的处理方法

Publications (2)

Publication Number Publication Date
CN116541569A CN116541569A (zh) 2023-08-04
CN116541569B true CN116541569B (zh) 2025-07-29

Family

ID=87453896

Family Applications (1)

Application Number Title Priority Date Filing Date
CN202310539720.4A Active CN116541569B (zh) 2023-05-15 2023-05-15 一种社交网络图的处理方法

Country Status (1)

Country Link
CN (1) CN116541569B (zh)

Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN113590938A (zh) * 2021-07-06 2021-11-02 清华大学 一种针对社交网络选取锚定用户的方法及装置
CN116029855A (zh) * 2023-01-17 2023-04-28 北京工业大学 一种面向并行运算的基于节点相似性的社区发现方法

Family Cites Families (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US8880521B2 (en) * 2004-09-15 2014-11-04 3Degrees Llc Collections of linked databases
US8688595B2 (en) * 2008-03-31 2014-04-01 Pursway Ltd. Analyzing transactional data
US9026581B2 (en) * 2009-09-10 2015-05-05 Google Technology Holdings LLC Mobile device and method of operating same to interface content provider website

Patent Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN113590938A (zh) * 2021-07-06 2021-11-02 清华大学 一种针对社交网络选取锚定用户的方法及装置
CN116029855A (zh) * 2023-01-17 2023-04-28 北京工业大学 一种面向并行运算的基于节点相似性的社区发现方法

Also Published As

Publication number Publication date
CN116541569A (zh) 2023-08-04

Similar Documents

Publication Publication Date Title
CN109859054B (zh) 网络社团挖掘方法、装置、计算机设备及存储介质
CN107895038B (zh) 一种链路预测关系推荐方法及装置
CN110719106B (zh) 一种基于节点分类排序的社交网络图压缩方法及系统
JP2019056960A (ja) 探索方法、探索プログラムおよび探索装置
US9892532B2 (en) Apparatus and method for generating a shortest-path tree in a graph
US7536064B2 (en) Image comparison by metric embeddings
CN115022067A (zh) 基于博弈的不对称信息下的网络安全防御方法及装置
CN115080850B (zh) 一种谣言传播模型的构建方法、设备和存储介质
CN112733136A (zh) 一种基于网络节点拓扑结构的对抗攻击检测方法和系统
CN113422695A (zh) 一种提高物联网拓扑结构鲁棒性能的优化方法
CN116992307B (zh) 基于图网络特征快速聚合的社交网络用户匹配方法及装置
CN119047541A (zh) 一种联邦学习方法、装置、电子设备及存储介质
CN116541569A (zh) 一种社交网络图的处理方法
JP7752379B2 (ja) ハイパーパラメータ探索システムおよびそのプログラム
CN109993338B (zh) 一种链路预测方法及装置
CN110149234B (zh) 图数据压缩方法、装置、服务器及存储介质
CN107622449A (zh) 一种基于加权模块度的社区发现方法
CN115982415A (zh) 增量图划分方法、装置、设备、介质及产品
CN115408617A (zh) 基于人工智能的互联网用户整合方法及大数据服务系统
CN113672751A (zh) 一种背景相似图片的聚类方法、装置及电子设备、存储介质
CN110610433A (zh) 基于模式识别的社区搜索方法
Sowjanya et al. A cluster feature-based incremental clustering approach to mixed data
CN112737857B (zh) P2p网络节点结构的优化方法、装置和电子设备
CN118964345B (zh) 数据属性补充方法、装置、设备及介质
CN114676294B (zh) 关系分析方法、装置、计算机设备及存储介质

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination
GR01 Patent grant
GR01 Patent grant