CN120012759B - 复杂文档的全局语境分析方法及系统 - Google Patents

复杂文档的全局语境分析方法及系统

Info

Publication number
CN120012759B
CN120012759B CN202510486491.3A CN202510486491A CN120012759B CN 120012759 B CN120012759 B CN 120012759B CN 202510486491 A CN202510486491 A CN 202510486491A CN 120012759 B CN120012759 B CN 120012759B
Authority
CN
China
Prior art keywords
global
knowledge graph
entities
graph
document
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
CN202510486491.3A
Other languages
English (en)
Other versions
CN120012759A (zh
Inventor
赵瑞
聂志锋
沈泮
王祎童
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Beijing Big Data Center
Original Assignee
Beijing Big Data Center
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Beijing Big Data Center filed Critical Beijing Big Data Center
Priority to CN202510486491.3A priority Critical patent/CN120012759B/zh
Publication of CN120012759A publication Critical patent/CN120012759A/zh
Application granted granted Critical
Publication of CN120012759B publication Critical patent/CN120012759B/zh
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/20Natural language analysis
    • G06F40/205Parsing
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/30Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
    • G06F16/36Creation of semantic tools, e.g. ontology or thesauri
    • G06F16/367Ontology
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/22Matching criteria, e.g. proximity measures
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/20Natural language analysis
    • G06F40/258Heading extraction; Automatic titling; Numbering
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/30Semantic analysis
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/042Knowledge-based neural networks; Logical representations of neural networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/045Combinations of networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/084Backpropagation, e.g. using gradient descent
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N5/00Computing arrangements using knowledge-based models
    • G06N5/02Knowledge representation; Symbolic representation
    • G06N5/022Knowledge engineering; Knowledge acquisition

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Artificial Intelligence (AREA)
  • Computational Linguistics (AREA)
  • Data Mining & Analysis (AREA)
  • Health & Medical Sciences (AREA)
  • General Health & Medical Sciences (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Evolutionary Computation (AREA)
  • Mathematical Physics (AREA)
  • Software Systems (AREA)
  • Computing Systems (AREA)
  • Biophysics (AREA)
  • Molecular Biology (AREA)
  • Biomedical Technology (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Animal Behavior & Ethology (AREA)
  • Databases & Information Systems (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Evolutionary Biology (AREA)
  • Machine Translation (AREA)

Abstract

本发明涉及人工智能技术领域,具体提供一种复杂文档的全局语境分析方法及系统,包括:为所述目标文档生成目录;建立图片与文字内容的关联关系;基于所述目录的标题构建基础知识图谱,并逐步对标题对应的段落进行语义分析,为基础知识图谱添加实体和关系,得到全局知识图谱;利用知识图谱嵌入方法将全局知识图谱中的实体和关系映射为低维向量,并利用图注意力网络模型对嵌入后的全局知识图谱进行全局关系提取;基于所述全局关系构建全局语境链条,并基于所述全局语境链条对全局知识图谱的关系进行更新。本发明不仅降低了用户在文档管理方面的负担,还提高了文档信息的利用效率和价值。

Description

复杂文档的全局语境分析方法及系统
技术领域
本发明属于人工智能技术领域,具体涉及一种复杂文档的全局语境分析方法及系统。
背景技术
随着信息技术的飞速发展,电子文档已成为人们获取信息、交流思想的重要工具。然而,面对海量的文档数据,如何高效地提取、组织和利用其中的信息,成为了一个亟待解决的问题。传统的文档处理方法往往局限于简单的文本提取和关键词检索,无法深入挖掘文档内在的语义结构和知识关联,从而限制了信息的有效利用。
为文档构建知识图谱作为一种前沿的文档分析策略应运而生,它不仅能够助力生成精炼的摘要内容,还能实现高效的内容检索功能。但值得注意的是,从文档中抽取实体与关系以构建知识图谱的过程,时常面临实体关系错综复杂、易于混淆的挑战。
发明内容
针对现有技术的上述不足,本发明提供一种复杂文档的全局语境分析方法及系统,以解决上述技术问题。
第一方面,本发明提供一种复杂文档的全局语境分析方法,包括:
通过对目标文档进行版面分析,为所述目标文档生成目录;
识别目标文档中的图片的文字信息,并通过对所述文字信息和相邻文字内容进行语义分析,建立图片与文字内容的关联关系;
基于所述目录的标题构建基础知识图谱,并逐步对标题对应的段落进行语义分析,为基础知识图谱添加实体和关系,得到全局知识图谱;
利用知识图谱嵌入方法将全局知识图谱中的实体和关系映射为低维向量,并利用图注意力网络模型对嵌入后的全局知识图谱进行全局关系提取;
基于所述全局关系构建全局语境链条,并基于所述全局语境链条对全局知识图谱的关系进行更新。
在一个可选的实施方式中,通过对目标文档进行版面分析,为所述目标文档生成目录,包括:
利用版面分析模型解析所述目标文档的版面特征,所述版面特征包括段落分布、标题格式参数、标题内容、段落格式参数;
利用规则算法,基于所述版面特征构建标题层级体系;
基于所述标题层级体系构建标题与段落的对应关系,并基于所述对应关系生成目录;
监控目标文档的更新内容,基于所述更新内容同步更新所述目录。
在一个可选的实施方式中,识别目标文档中的图片的文字信息,并通过对所述文字信息和相邻文字内容进行语义分析,建立图片与文字内容的关联关系,包括:
利用光学字符识别技术从图片中提取文字信息;
根据所述图片在目标文档中的位置,提取所述图片的相邻文字段落;
利用关键词匹配技术从相邻文字段落中筛选出与所述文字信息匹配的目标段落,并为所述图片和所述目标段落设置关联标签;
对所述文字信息和所述目标段落进行语义分析,从目标段落中筛选出与所述文字信息的语义匹配的一个或多个句子;
为所述文字信息与语义匹配的句子添加独立标识,所述独立标识用于指示所述文字信息与语义匹配的句子为不可分割的综合内容体;
在生成文档层次结构时,为图片确定相对于其关联文本的具体层次位置,使图文内容作为一个层次单元一同展示。
在一个可选的实施方式中,基于所述目录的标题构建基础知识图谱,并逐步对标题对应的段落进行语义分析,为基础知识图谱添加实体和关系,得到全局知识图谱,包括:
从目录的标题中抽取实体和实体关系,并基于抽取的实体和实体关系构建基础知识图谱;
获取目录中的最下级标题,获取最下级标题对应的局部知识图谱,所述局部知识图谱包含所述最下级标题对应的实体;
基于目录获取最下级标题对应的目标段落,从所述目标段落抽取实体和关系,并基于抽取的实体和关系更新所述局部知识图谱;
遍历所有最下级标题,得到全局知识图谱。
在一个可选的实施方式中,利用知识图谱嵌入方法将全局知识图谱中的实体和关系映射为低维向量,并利用图注意力网络模型对嵌入后的全局知识图谱进行全局关系提取,包括:
采用翻译模型将全局知识图谱中的实体和关系映射为低维向量,设置所述翻译模型的损失函数为负对数似然损失;
将实体和关系的低维向量作为图注意力网络模型的输入,所述图注意力网络模型通过计算实体之间的注意力系数和聚合邻居节点的信息提取全局知识图谱中实体之间的关系;
利用图注意力网络模型对不同局部知识图谱中的实体进行相似度计算,并基于计算结果构建不同局部知识图谱中的实体的关联关系;
将全局知识图谱中的实体之间的关系和不同局部知识图谱中的实体的关联关系整合为全局关系。
在一个可选的实施方式中,所述图注意力网络模型的训练方法包括:
从文档中提取语义相似或相关的句子、段落,构成正样本对,从文档中选择语义不相关的句子或段落,构成负样本对;
使用预训练的分层注意力网络模型,对正样本对及负样本对中的句子或段落进行编码,生成高维度的语义向量;
采用对比损失函数,以使模型在语义空间中拉近正样本对的距离,拉远负样本对的距离;
利用编码后的正样本对及负样本对训练图注意力网络模型。
在一个可选的实施方式中,基于所述全局关系构建全局语境链条,基于所述全局语境链条对全局知识图谱的关系进行更新,包括:
利用图轮算法基于所述全局关系构建全局语境链条;
将全局语境链条涉及的实体和关系与全局知识图谱进行匹配,以基于匹配结果为所述全局知识图谱补全缺失的实体关系。
第二方面,本发明提供一种复杂文档的全局语境分析系统,包括:
目录生成模块,用于通过对目标文档进行版面分析,为所述目标文档生成目录;
图片关联模块,用于识别目标文档中的图片的文字信息,并通过对所述文字信息和相邻文字内容进行语义分析,建立图片与文字内容的关联关系;
图谱构建模块,用于基于所述目录的标题构建基础知识图谱,并逐步对标题对应的段落进行语义分析,为基础知识图谱添加实体和关系,得到全局知识图谱;
全局分析模块,用于利用知识图谱嵌入方法将全局知识图谱中的实体和关系映射为低维向量,并利用图注意力网络模型对嵌入后的全局知识图谱进行全局关系提取;
语境增强模块,用于基于所述全局关系构建全局语境链条,并基于所述全局语境链条对全局知识图谱的关系进行更新。
本发明的有益效果在于,本发明提供的复杂文档的全局语境分析方法及系统,通过整合自动化目录生成、图片与文字关联、知识图谱构建与关系提取以及全局语境链条与关系更新等技术手段,显著提升了知识图谱与文档全局语境的一致性。这不仅降低了用户在文档管理方面的负担,还提高了文档信息的利用效率和价值。
此外,本发明设计原理可靠,结构简单,具有非常广泛的应用前景。
附图说明
为了更清楚地说明本发明实施例或现有技术中的技术方案,下面将对实施例或现有技术描述中所需要使用的附图作简单地介绍,显而易见地,对于本领域普通技术人员而言,在不付出创造性劳动的前提下,还可以根据这些附图获得其他的附图。
图1是本发明一个实施例的方法的示意性流程图。
图2是本发明一个实施例的系统的示意性框图。
具体实施方式
为了使本技术领域的人员更好地理解本发明中的技术方案,下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他实施例,都应当属于本发明保护的范围。
除非另有定义,本文所使用的所有的技术和科学术语与属于本发明的技术领域的技术人员通常理解的含义相同。本文中在本发明的说明书中所使用的术语只是为了描述具体的实施例的目的,不是旨在于限制本发明。
本发明实施例提供的复杂文档的全局语境分析方法由计算机设备执行,相应地,复杂文档的全局语境分析系统运行于计算机设备中。
图1是本发明一个实施例的方法的示意性流程图。其中,图1执行主体可以为一种复杂文档的全局语境分析系统。根据不同的需求,该流程图中步骤的顺序可以改变,某些可以省略。
如图1所示,该方法包括:
S1.通过对目标文档进行版面分析,为所述目标文档生成目录。
对目标文档执行详尽的版面分析步骤。此过程涉及识别文档的布局结构,如标题、段落、页眉页脚等,以精准分割文档内容。随后,根据识别结果,为目标文档自动生成一个包含各级标题及其对应段落索引的目录。这一目录不仅便于用户快速浏览文档结构,也为后续的信息检索与处理提供了便利的索引框架。
S2.识别目标文档中的图片的文字信息,并通过对所述文字信息和相邻文字内容进行语义分析,建立图片与文字内容的关联关系。
利用先进的OCR(光学字符识别)技术,识别目标文档中嵌入的图片中的文字信息。在此基础上,结合图片附近或相关的文字内容,进行深入的语义分析。通过对比、联想等策略,建立起图片与周围文字内容之间的关联关系,这有助于更好地理解图片在文档中的意义和作用。
S3.基于所述目录的标题构建基础知识图谱,并逐步对标题对应的段落进行语义分析,为基础知识图谱添加实体和关系,得到全局知识图谱。
依据生成的目录,首先以各级标题为节点构建初始的基础知识图谱框架。随后,按照目录中段落的索引顺序,逐一进行语义分析。这一过程包括实体识别、关系抽取等,旨在将段落中的关键信息转化为图谱中的实体和关系,从而逐步丰富和完善基础知识图谱,最终形成全局知识图谱。全局知识图谱不仅涵盖了文档的核心内容,还揭示了信息之间的内在联系。
S4.利用知识图谱嵌入方法将全局知识图谱中的实体和关系映射为低维向量,并利用图注意力网络模型对嵌入后的全局知识图谱进行全局关系提取。
为了更有效地利用全局知识图谱中的信息,采用知识图谱嵌入技术,将实体和关系映射到低维向量空间中。这一步骤降低了数据处理的复杂度,同时保留了图谱中的关键结构和语义信息。随后,利用图注意力网络模型(Graph Attention Network, GAN)对嵌入后的全局知识图谱进行全局关系提取。GAN模型能够关注图谱中不同节点和关系的重要性,从而更准确地捕捉全局范围内的关联模式。
S5.基于所述全局关系构建全局语境链条,并基于所述全局语境链条对全局知识图谱的关系进行更新。
基于提取的全局关系,构建全局语境链条。这一链条不仅反映了文档中信息的流动路径,还揭示了信息之间的深层次联系。在此基础上,对全局知识图谱中的关系进行重新审视和更新,确保图谱中的每一条关系都符合全局语境链条的逻辑,进一步提升了知识图谱的准确性和实用性。通过这一系列步骤,最终得到一个既全面又精准地反映了目标文档内容的全局知识图谱。
在本发明的一种实施例中,基于步骤S1,以下将给出一种可能的实施例对其具体的实施方案进行非限制性阐述。
S101.版面特征解析:首先,利用经过训练的 LayoutLMv3版面分析模型对目标文档进行深入解析,旨在提取其版面特征。这些特征不仅涵盖了直观的段落分布,还包括了更为细致的标题格式参数(如字体大小、加粗、居中对齐等)、标题内容(即具体的文字信息)、以及段落格式参数(如段落缩进、行距等)。这一过程是构建后续所有步骤的基础,确保了后续处理能够精准地反映文档的原始结构和内容。
S102.标题层级体系构建:在获取了详尽的版面特征后,接下来利用一套精心设计的规则算法,基于这些特征来构建标题层级体系。该体系旨在清晰地反映文档中各级标题之间的层级关系,如主标题、副标题、小节标题等。这一步骤对于理解文档的结构、内容层次以及逻辑关系至关重要。
以下是一个简化的规则算法示例,旨在说明这一过程的基本原理和步骤:
1.输入数据准备
版面特征数据:包括段落分布、标题格式参数(如字体大小、加粗、颜色、居中对齐等)、标题内容、段落格式参数等。
文档内容:完整的文档文本,包括所有标题和正文内容。
2.标题识别
基于格式参数的标题识别:首先,根据预设的格式参数阈值(如字体大小阈值、加粗标志等),识别出所有可能的标题。
内容分析辅助识别:对于格式特征不明显的标题,可以通过内容分析(如关键词匹配、句子结构分析)来辅助识别。
3.层级关系确定
标题层级判断:根据标题的格式参数(如字体大小递减规律、加粗程度等)和内容重要性(如标题中包含的关键词级别),判断每个标题所属的层级。
层级关系构建:通过逻辑分析,确定各级标题之间的层级关系,如主标题与副标题、副标题与小节标题等。
4.错误处理与校验
冲突检测:检测是否存在层级关系冲突(如一个标题同时被识别为两个不同层级的标题)。
修正与调整:对于检测到的冲突,通过人工干预或自动调整算法进行修正。
一致性校验:确保整个文档的标题层级体系在逻辑上是一致的。
5.输出标题层级体系
结构化输出:将构建好的标题层级体系以结构化的方式输出,如树状结构、列表结构等。
假设有一个简单的文档,其标题层级体系如下:
主标题:文档的主要标题
副标题1:主标题下的第一个副标题
小节标题1:副标题1下的第一个小节标题
小节标题2:副标题1下的第二个小节标题
副标题2:主标题下的第二个副标题
小节标题3:副标题2下的第一个小节标题
根据上述规则算法,可以自动识别并构建出这样的标题层级体系。
S103.标题与段落对应关系建立及目录生成:基于已经构建的标题层级体系,进一步建立标题与段落之间的对应关系。随后,根据这些对应关系,自动生成一个详尽的目录。该目录不仅列出了各级标题,还提供了对应的页码或段落位置,极大地便利了文档的浏览和检索。
目录生成方法包括:
在识别完标题层级关系后,利用目录生成工具自动生成目录。目录可以包括各级标题的名称、页码或段落位置等信息。
S104.目录同步更新机制:考虑到目标文档可能会随着时间的推移而不断更新,为了确保目录的准确性和时效性,设计了一套监控和同步更新机制。该机制能够实时监控文档的更新内容,包括但不限于新增的段落、修改的标题或段落内容等。一旦检测到更新,该机制将自动触发目录的同步更新过程,确保目录与文档内容始终保持一致。
在本发明的一种实施例中,基于步骤S2,以下将给出一种可能的实施例对其具体的实施方案进行非限制性阐述。
S201. 利用光学字符识别技术从图片中提取文字信息
技术细节:首先,通过高精度的光学字符识别(OCR)技术,对文档中的图片进行逐像素扫描,识别并提取出图片中嵌入或附带的文字信息。这一过程需要确保OCR技术的准确性和鲁棒性,以应对不同字体、大小和背景的图片文字。
S202. 根据所述图片在目标文档中的位置,提取所述图片的相邻文字段落
1.文档格式识别
PDF解析:如果文档是PDF格式,利用PDF解析库(如PyMuPDF、PDFMiner等)读取文档的页面内容、字体、大小、位置等详细信息。
Word文档解析:对于Word文档,可以使用python-docx等库来解析文档的段落、表格、图片等元素的位置和属性。
2.相邻文字段落提取
基于位置的邻近搜索:在确定了图片的位置后,利用文档的布局信息,在图片的上方、下方或左右两侧进行邻近搜索,找到与图片相邻的文字段落。
S203. 利用关键词匹配技术从相邻文字段落中筛选出与所述文字信息匹配的目标段落,并为所述图片和所述目标段落设置关联标签
关键词匹配:提取出的图片文字信息与相邻文字段落进行关键词匹配,寻找含有相关或相似信息的段落。匹配算法可以基于词频、TF-IDF权重、语义相似度等策略进行。
关联标签:一旦找到匹配的目标段落,为图片和目标段落设置唯一的关联标签,用于在后续处理中标识它们的关联关系。
S204. 对所述文字信息和所述目标段落进行语义分析,从目标段落中筛选出与所述文字信息的语义匹配的一个或多个句子
语义分析:利用自然语言处理(NLP)技术,对提取出的文字信息和目标段落进行深度语义分析,识别它们之间的语义联系。这可能涉及句法分析、实体识别、语义角色标注等高级NLP任务。
句子筛选:基于语义分析的结果,从目标段落中筛选出与图片文字信息语义最为匹配的一个或多个句子。这些句子应该能够准确反映图片与文字之间的关联内容。
S205. 为所述文字信息与语义匹配的句子添加独立标识,所述独立标识用于指示所述文字信息与语义匹配的句子为不可分割的综合内容体
独立标识:为筛选出的语义匹配句子和文字信息添加独特的标识符或标签,这些标识符在文档中应具有唯一性,用于标识它们作为一个不可分割的综合内容体。
内容整合:在添加独立标识后,可以进一步将文字信息和语义匹配的句子整合为一个综合内容单元,便于后续处理和展示。
S206. 在生成文档层次结构时,为图片确定相对于其关联文本的具体层次位置,使图文内容作为一个层次单元一同展示
层次结构生成:在构建文档的层次结构时,根据图片与其关联文本(包括语义匹配的句子)之间的逻辑关系,为图片确定一个具体的层次位置。
图文一体化展示:确保在最终文档中,图片与其关联文本被作为一个整体层次单元进行展示,以体现它们之间的紧密关联。这可能需要调整文档的布局和格式,以适应图文一体化的需求。
将关联后的图片文字信息与文档中对应的文本内容进行结构化处理,便于后续的数据管理和信息提取。具体操作包括:图片文字标签化:为每张图片添加标签信息,包括图片编号、标题、关联文本段落等,以便追溯。关联段落的同步:将OCR识别出的文本内容与文档中对应的段落同步标记,确保图片信息被整合为文档结构的一部分。分层存储:系统将结构化后的图文数据存储在文档的层次结构中,并在文档结构中指定图片内容的层次位置,确保文档结构的完整性。
通过对图片的文字信息进行两次匹配,即基于关键词的段落匹配和基于语义分析的句子匹配,为图片精准筛选出关联的文字内容,且相较于直接的语义分析,降低了数据处理量;此外,通过为图片和关联的文字内容设置独立标签,实现了图片与文字内容的绑定,确保了后续分析中图片与文字内容不被割裂,避免了后续语义分析出现严重的偏差。
在本发明的一种实施例中,基于步骤S3,以下将给出一种可能的实施例对其具体的实施方案进行非限制性阐述。
S301. 从目录的标题中抽取实体和实体关系,并基于抽取的实体和实体关系构建基础知识图谱
实体与关系抽取:首先,对目录中的各级标题进行细致分析,利用自然语言处理(NLP)技术,如命名实体识别(NER)和关系抽取算法,从标题文本中识别出关键的实体(如人名、地名、组织名等)以及这些实体之间的潜在关系(如上下级关系、包含关系等)。
基础知识图谱构建:基于抽取的实体和关系,利用图谱构建技术,如Neo4j等图谱数据库,构建出一个包含基础实体和关系的知识图谱。这个图谱将作为后续局部知识图谱构建和全局知识图谱整合的基础框架。
S302. 获取目录中的最下级标题,获取最下级标题对应的局部知识图谱,所述局部知识图谱包含所述最下级标题对应的实体
最下级标题识别:根据目录的层级结构,识别出最下级的标题,这些标题通常对应着文档中最具体、最详细的内容。
局部知识图谱生成:对于每个最下级标题,根据其在基础知识图谱中的位置和相关实体,生成一个包含该标题对应实体的局部知识图谱。这个局部图谱将专注于展示与最下级标题内容紧密相关的实体和关系。
S303. 基于目录获取最下级标题对应的目标段落,从所述目标段落抽取实体和关系,并基于抽取的实体和关系更新所述局部知识图谱
目标段落获取:利用目录快速定位到每个最下级标题对应的目标段落。
段落内容分析:对目标段落进行详细的文本分析,利用NLP技术抽取段落中的实体和关系。
局部知识图谱更新:将抽取的实体和关系与现有的局部知识图谱进行比对和整合,更新图谱中的信息,确保图谱的准确性和完整性。
S304. 遍历所有最下级标题,得到全局知识图谱
遍历过程:按照目录的顺序,依次遍历所有的最下级标题,对每个标题执行S302和S303中的步骤,更新局部知识图谱。
全局知识图谱整合:在遍历过程中,将每个局部知识图谱中的实体和关系逐步整合到全局知识图谱中。通过图谱合并技术,确保全局图谱中的实体和关系保持一致性,并形成一个完整、连贯的知识体系。
验证与优化:最后,对全局知识图谱进行验证和优化,检查图谱中的实体和关系是否正确无误,确保图谱的质量和可用性。
通过上述步骤,通过从文档的目录中抽取实体和关系,构建基础知识图谱,并基于最下级标题生成和更新局部知识图谱,最终整合得到全局知识图谱。这个过程不仅提高了文档内容的理解和分析效率,还为后续的知识挖掘和应用提供了有力的支持。
在本发明的一种实施例中,基于步骤S4,以下将给出一种可能的实施例对其具体的实施方案进行非限制性阐述。
S401.采用翻译模型将全局知识图谱中的实体和关系映射为低维向量,设置所述翻译模型的损失函数为负对数似然损失。
步骤描述:首先,利用翻译模型(如TransE、TransR等)将全局知识图谱中的实体和关系嵌入到低维向量空间中。这些低维向量能够捕捉实体和关系之间的语义信息,并便于后续的图注意力网络模型处理。
损失函数设置:为了优化翻译模型的参数,设置损失函数为负对数似然损失(Negative Log Likelihood Loss),该损失函数旨在最小化正样本的得分与负样本得分之间的差异,从而确保嵌入向量的准确性和鲁棒性。
S402.将实体和关系的低维向量作为图注意力网络模型的输入,所述图注意力网络模型通过计算实体之间的注意力系数和聚合邻居节点的信息提取全局知识图谱中实体之间的关系;
其中图注意力网络模型包括:
输入层:将实体的初始嵌入向量作为GAT模型的输入。这些向量将作为节点的特征表示。
注意力机制层:构建GAT层,其中每个节点通过注意力机制聚合其邻居节点的信息。注意力系数由节点之间的相似度或相关性决定,可以使用点积、双线性变换或神经网络来计算。
多头注意力:为了增强模型的稳定性和表达能力,可以引入多头注意力机制。这意味着每个GAT层将包含多个独立的注意力头,每个头都会独立地计算注意力系数并聚合邻居信息。最后,这些头的输出将被拼接或平均以形成最终的节点表示。
多层GAT:为了捕捉全局语境信息,可以堆叠多个GAT层。每一层都会基于前一层的输出更新节点的表示。随着层数的增加,节点将能够聚合来自更远邻居的信息,从而实现跨实体、跨关系的语义信息传播和整合。
图注意力网络模型的训练方法包括:
1. 数据准备阶段
文档预处理:首先,对输入的文档进行预处理,包括去除停用词、标点符号、进行词干提取或词形还原等,以减少噪声并标准化文本数据。
正样本对构建:从预处理后的文档中,利用语义分析或句法分析技术,提取出语义相似或相关的句子、段落,将它们组成正样本对。正样本对中的句子或段落应在内容、主题或情感等方面具有较高的相似性或相关性。
负样本对构建:同样地,从文档中随机选择或基于某种策略(如随机选择、主题不相关等)选择语义不相关的句子或段落,组成负样本对。负样本对中的句子或段落应在内容上具有显著差异。
2. 特征提取阶段
预训练分层注意力网络模型应用:使用已经预训练的分层注意力网络模型对正样本对和负样本对中的句子或段落进行编码。分层注意力网络模型能够捕捉句子内部和句子之间的注意力信息,从而生成高维度的、富含语义信息的向量表示。
向量表示优化:在编码过程中,可能需要对生成的向量表示进行进一步优化,如通过降维技术(如PCA、t-SNE等)来减少冗余信息,或通过归一化处理来确保向量之间的可比性。
3. 模型训练阶段
对比损失函数设计:采用NT-Xent对比损失函数,该函数旨在衡量正样本对和负样本对在语义空间中的距离。对于正样本对,损失函数应鼓励模型拉近它们的距离;而对于负样本对,损失函数则应鼓励模型拉远它们的距离。
模型参数优化:利用梯度下降等优化算法,结合对比损失函数,对图注意力网络模型的参数进行迭代更新。在每次迭代中,都需要计算当前参数下模型的损失值,并根据损失值的梯度来更新参数。
早停与验证:在训练过程中,设置验证集来监控模型的性能。当验证集上的性能不再提升时,采用早停策略来防止过拟合。同时,也可以利用验证集来调整模型的超参数(如学习率、批次大小等)。
4. 模型评估与优化
性能评估:在训练完成后,使用测试集来评估模型的性能。评估指标可以包括准确率、召回率、F1分数等,这些指标能够反映模型在处理语义相似性和相关性任务上的能力。
模型优化:根据评估结果,对模型进行进一步的优化。这可能包括调整模型结构、增加注意力机制、引入外部知识等。
S403.利用图注意力网络模型对不同局部知识图谱中的实体进行相似度计算,并基于计算结果构建不同局部知识图谱中的实体的关联关系;
在得到全局知识图谱的嵌入向量后,利用训练好的图注意力网络模型对不同局部知识图谱中的实体进行相似度计算。通过计算实体之间的余弦相似度或欧氏距离等指标,可以评估实体之间的相似性和关联性。
关联关系构建:基于相似度计算结果,构建不同局部知识图谱中实体的关联关系。这些关联关系可以表示为实体之间的边或链接,用于后续的全局关系整合。
S404.将全局知识图谱中的实体之间的关系和不同局部知识图谱中的实体的关联关系整合为全局关系。
将全局知识图谱中的实体之间的关系和不同局部知识图谱中的实体的关联关系进行整合,形成一个更加完整和全面的全局知识图谱。这个全局知识图谱将包含全局知识图谱中的直接关系和局部知识图谱中通过相似度计算得到的间接关系。
整合方法可以采用图合并算法或图融合算法等,将不同来源的关系进行合并和整合。同时,为直接关系和间接关系设置不同的权重以做区分,确保整合后的全局知识图谱的准确性和可靠性。
在本发明的一种实施例中,基于步骤S5,以下将给出一种可能的实施例对其具体的实施方案进行非限制性阐述。
S501.利用图轮算法基于所述全局关系构建全局语境链条。
在得到整合后的全局知识图谱后,进一步利用图轮算法(Graph WheelAlgorithm)来构建全局语境链条。图轮算法是一种基于图结构的算法,它通过分析图中的节点(实体)和边(关系)来构建一系列相互关联、具有逻辑顺序的语境链条。这些语境链条能够捕捉实体之间的复杂关系,并揭示它们在全局语境中的动态变化。
具体实现:
节点选择与排序:首先,从全局知识图谱中选择一组核心节点作为起点。这些核心节点可以是全局知识图谱中的关键实体,也可以是局部知识图谱中通过相似度计算得到的具有代表性的实体。然后,根据实体之间的关联关系和权重,对节点进行排序,以形成一条逻辑上连贯的语境链条。
关系链接:在节点排序的基础上,利用全局关系中的关系链接将这些节点连接起来。这些关系链接可以是全局知识图谱中的直接关系,也可以是局部知识图谱中通过相似度计算得到的间接关系。通过关系链接,构建了一个完整的语境链条,该链条能够反映实体之间的复杂关系和动态变化。
语境链条优化:为了提高语境链条的准确性和可靠性,对构建好的语境链条进行优化。这包括去除冗余的节点和关系、调整节点的顺序、合并相似的语境链条等。通过优化,得到一个更加简洁、清晰的全局语境链条。
S502.将全局语境链条涉及的实体和关系与全局知识图谱进行匹配,以基于匹配结果为所述全局知识图谱补全缺失的实体关系。
匹配算法选择:首先,选择合适的匹配算法来进行全局语境链条与全局知识图谱的匹配。这些算法可以是基于相似度的匹配算法、基于规则的匹配算法或基于机器学习的匹配算法等。通过选择合适的匹配算法,可以提高匹配的准确性和效率。
匹配过程:在匹配过程中,将全局语境链条中的实体和关系与全局知识图谱中的实体和关系进行逐一比较。对于匹配的实体和关系,跳过即可。对于不匹配的实体和关系,则需要分析其原因,作为补全的对象,例如全局语境链条中存在的实体关系,全局知识图谱中不存在,则在全局知识图谱中补充相应的实体关系。
补全缺失关系:在匹配完成后,根据匹配结果为全局知识图谱补全缺失的实体关系。这包括添加新的实体关系、更新现有的实体关系等。通过补全缺失关系,可以进一步完善全局知识图谱的结构和内容,提高其在实际应用中的效果和价值。
验证与优化:最后,还需要对补全后的全局知识图谱进行验证和优化。这包括检查补全关系的准确性和合理性、调整关系权重和重要性等。通过验证和优化,可以确保全局知识图谱的准确性和可靠性,并为其后续的应用提供有力的支持。
通过以上步骤,利用图轮算法构建全局语境链条,并将这些链条中的实体和关系与全局知识图谱进行匹配,以补全缺失的实体关系,实现了跨段落内容的关系建立。这有助于进一步完善全局知识图谱的结构和内容,提高其在实际应用中的效果和价值。
在完成全局语境追踪和语义增强后,系统进入内容归纳与信息提取阶段。本步骤旨在从文档中提取并归纳多层次的关键信息,为用户提供简洁、准确的内容概要。
具体实现过程如下:
层级结构识别:利用之前建立的文档层次结构和知识图谱,系统识别文档中的不同层级内容,如问题、需求、目标、任务、解决方案等。
关键内容定位:通过语义表示和实体关系,系统精准定位每个层级的关键内容。在知识图谱中,节点代表实体(如问题、需求),边代表关系(如“导致”、“满足”、“实现”),从而明确各层级内容的语义位置。
摘要模型应用:采用预训练的摘要生成模型(如基于Transformer的文本摘要模型),针对每个层级的内容生成简洁的摘要。上下文信息融合:在生成摘要时,结合全局语境信息,确保摘要内容与文档整体语义一致。模型在生成摘要时会考虑上下文和关联内容,避免信息片面或失真。
层次化内容组织:将提取的内容按照层级关系组织起来,形成从高层到低层的结构。例如,从问题到需求,再到任务,逐级展开,构建清晰的内容架构。结构化数据存储:将归纳后的内容以结构化的形式存储,便于后续检索和分析。可采用JSON、XML等数据格式,反映内容的层次和关联关系。
逻辑链条构建:基于知识图谱和全局语境追踪,系统构建不同层级内容之间的逻辑链条。例如,某个问题引出哪些需求,这些需求又对应哪些任务和解决方案。关联关系展示:在内容呈现时,突出不同层级内容之间的关联,帮助用户理解内容的逻辑关系。通过可视化的方式,如流程图或树状图,展示各层级内容的相互关联。
冗余检测:通过语义相似度计算,识别内容中的冗余信息,避免重复描述。对语义相似或重复的内容,系统会进行合并处理。信息整合:对相似或相关的内容进行整合,形成更全面、统一的表达,确保信息的完整性和一致性。
可视化呈现:将归纳后的内容通过图表、树状结构等方式直观展示,体现内容的层次和关联。用户可以通过交互界面,快速浏览和定位感兴趣的内容。
语言流畅性:在生成摘要和归纳内容时,利用自然语言生成技术,确保输出的文字表达清晰、流畅,易于理解。
用户定制化:允许用户设置摘要的长度、详细程度等参数,生成符合用户需求的内容。用户可以选择关注的层级或主题,获得个性化的内容归纳。
内容质量评估:系统对生成的摘要和归纳内容进行质量评估,检测信息完整性、准确性和语言质量,确保输出内容的高品质。
本实施例提供一种复杂文档的全局语境分析方法,包括以下流程:
1.生成文档目录
利用版面分析模型解析文档的版面特征,通过规则算法构建标题层级体系来生成目录。版面分析模型基于机器学习算法,对文档的段落分布、标题格式参数等特征进行学习和分类。
流程:
设文档的版面特征向量为x=(x1,x2,⋯,xn),其中xi表示第i个版面特征,如段落间距、标题字号等。
利用版面分析模型(如支持向量机)对特征向量进行分类,得到标题的初步分类结果。支持向量机的决策函数为:其中,αi是拉格朗日乘子,yi是样本标签,K(xi,x)是核函数(如径向基核函数K(xi,x)=exp(−γ∥xi−x∥2)),b是偏置项。
根据分类结果,使用规则算法(如基于标题的层级关系规则)构建标题层级体系。设标题Ti的层级为li,通过以下规则确定:
基于标题层级体系构建标题与段落的对应关系,生成目录。
2.建立图片与文字内容的关联关系
利用光学字符识别(OCR)技术提取图片中的文字信息,通过关键词匹配和语义分析建立图片与相邻文字内容的关联。
利用 OCR 技术从图片中提取文字信息Wimage
根据图片在文档中的位置,提取相邻文字段落Padjacent
利用关键词匹配技术(如TF-IDF算法)计算文字信息与相邻文字段落的匹配度。设t为一个关键词,Wimage中t的词频为tft,image,文档中t的逆文档频率为idft,则t在Wimage中的TF-IDF值为:同理可得t在Padjacent中的TF-IDF值tf−idft,adjacent。则Wimage与Padjacent的匹配度Smatch定义为:
对文字信息和目标段落进行语义分析(如使用词向量的余弦相似度)。设Wimage和Padjacent的词向量分别为vimage和vadjacent,则它们的语义相似度Ssemantic为:
根据匹配度和相似度筛选出目标段落,并为图片和目标段落设置关联标签。
3. 构建全局知识图谱
从目录标题中抽取实体和关系构建基础知识图谱,逐步对标题对应的段落进行语义分析,添加实体和关系,得到全局知识图谱。
从目录的标题中抽取实体和实体关系,设抽取的实体集合为E={e1,e2,⋯,em},关系集合为R={r1,r2,⋯,rn}。基础知识图谱表示为一个三元组集合G0={(ei,rj,ek)∣ei,ek∈E,rj∈R}。
获取目录中的最下级标题,获取最下级标题对应的局部知识图谱Glocal
基于目录获取最下级标题对应的目标段落,从目标段落抽取实体和关系,设新抽取的实体集合为E′,关系集合为R′。更新局部知识图谱:Glocal=Glocal∪{(ei,rj,ek)∣ei,ek∈E∪E′,rj∈R∪R′}
遍历所有最下级标题,将所有局部知识图谱整合为全局知识图谱Gglobal
4. 全局关系提取
运用知识图谱嵌入方法将全局知识图谱中的实体和关系映射为低维向量,利用图注意力网络模型提取全局关系。
采用翻译模型(如 TransE)将全局知识图谱中的实体和关系映射为低维向量。设实体e的向量表示为e,关系r的向量表示为r,对于一个三元组(ei,r,ej),TransE 的目标是使ei+r≈ej。损失函数为负对数似然损失:
其中,σ是sigmoid函数,是负样本集合。
将实体和关系的低维向量作为图注意力网络模型的输入。设节点i的特征向量为hi,图注意力网络计算节点i对节点j的注意力系数αij为:其中,W是可学习的权重矩阵,a是注意力向量,Ni是节点i的邻居节点集合。
聚合邻居节点的信息得到节点i的更新特征hi′:
利用图注意力网络模型对不同局部知识图谱中的实体进行相似度计算,设实体ei和ej的特征向量分别为hei和hej,则它们的相似度Sentity为:
根据相似度构建不同局部知识图谱中的实体的关联关系,将全局知识图谱中的实体之间的关系和不同局部知识图谱中的实体的关联关系整合为全局关系。
5.训练图注意力网络模型
通过正样本对和负样本对训练图注意力网络模型,使其能够在语义空间中区分相关和不相关的内容。
从文档中提取语义相似或相关的句子、段落,构成正样本对(p1 +,p2 +),从文档中选择语义不相关的句子或段落,构成负样本对(p1 ,p2 )。
使用预训练的分层注意力网络模型对正样本对及负样本对中的句子或段落进行编码,生成高维度的语义向量v1 +,v2 +,v1 ,v2
采用对比损失函数(如 Triplet Loss):
其中,m是边距参数。
利用编码后的正样本对及负样本对训练图注意力网络模型,通过最小化损失函数更新模型参数。
6. 更新全局知识图谱关系
基于全局关系构建全局语境链条,通过匹配全局语境链条和全局知识图谱,补全缺失的实体关系。
利用图轮算法基于全局关系构建全局语境链条C。
将全局语境链条涉及的实体和关系与全局知识图谱进行匹配,设全局知识图谱中的三元组集合为Gglobal,全局语境链条中的三元组集合为C,则更新后的全局知识图谱Gupdated为:
其中图轮算法(Graph Wheel Algorithm)是一种用于构建图结构中循环关联路径的算法,其核心在于通过轮状结构(由中心节点和多个辐条节点构成的闭环)发现实体间的多跳关联关系。该算法在知识图谱补全、关系推理等场景中具有重要应用价值。将知识图谱表示为有向图G=(V,E),其中:
V={v1,v2,...,vn}为实体节点集合;
E={(vi,vj,rij)}为边集合,rij表示实体vi到vj的关系类型。
图轮算法通过以下步骤构建轮状结构:
中心节点选择:选择一个核心实体c作为轮轴;
辐条节点筛选:筛选与c直接相连的实体s1,s2,...,sk作为辐条;
闭环形成:通过多跳路径连接辐条节点,形成以c为中心的轮状循环路径。
路径权重计算的流程包括:每条路径的权重通过关系置信度和路径长度动态调整:
其中,m为路径长度;αri为关系ri的置信度;β∈(0,1)为路径衰减系数。
在一些实施例中,所述复杂文档的全局语境分析系统可以包括多个由计算机程序段所组成的功能模块。所述复杂文档的全局语境分析系统中的各个程序段的计算机程序可以存储于计算机设备的存储器中,并由至少一个处理器所执行,以执行(详见图1描述)复杂文档的全局语境分析的功能。
本实施例中,所述复杂文档的全局语境分析系统根据其所执行的功能,可以被划分为多个功能模块,如图2所示。系统200的功能模块可以包括:目录生成模块210、图片关联模块220、图谱构建模块230、全局分析模块240和语境增强模块250。本发明所称的模块是指一种能够被至少一个处理器所执行并且能够完成固定功能的一系列计算机程序段,其存储在存储器中。在本实施例中,关于各模块的功能将在后续的实施例中详述。
目录生成模块,用于通过对目标文档进行版面分析,为所述目标文档生成目录;
图片关联模块,用于识别目标文档中的图片的文字信息,并通过对所述文字信息和相邻文字内容进行语义分析,建立图片与文字内容的关联关系;
图谱构建模块,用于基于所述目录的标题构建基础知识图谱,并逐步对标题对应的段落进行语义分析,为基础知识图谱添加实体和关系,得到全局知识图谱;
全局分析模块,用于利用知识图谱嵌入方法将全局知识图谱中的实体和关系映射为低维向量,并利用图注意力网络模型对嵌入后的全局知识图谱进行全局关系提取;
语境增强模块,用于基于所述全局关系构建全局语境链条,并基于所述全局语境链条对全局知识图谱的关系进行更新。
可选地,作为本发明一个实施例,所述目录生成模块包括:
版面分析单元,用于利用版面分析模型解析所述目标文档的版面特征,所述版面特征包括段落分布、标题格式参数、标题内容、段落格式参数;
体系构建单元,用于利用规则算法,基于所述版面特征构建标题层级体系;
目录生成单元,用于基于所述标题层级体系构建标题与段落的对应关系,并基于所述对应关系生成目录;
目录更新单元,用于监控目标文档的更新内容,基于所述更新内容同步更新所述目录。
可选地,作为本发明一个实施例,所述图片关联模块包括:
文字提取单元,用于利用光学字符识别技术从图片中提取文字信息;
段落提取单元,用于根据所述图片在目标文档中的位置,提取所述图片的相邻文字段落;
标签关联单元,用于利用关键词匹配技术从相邻文字段落中筛选出与所述文字信息匹配的目标段落,并为所述图片和所述目标段落设置关联标签;
语义匹配单元,用于对所述文字信息和所述目标段落进行语义分析,从目标段落中筛选出与所述文字信息的语义匹配的一个或多个句子;
语句标记单元,用于为所述文字信息与语义匹配的句子添加独立标识,所述独立标识用于指示所述文字信息与语义匹配的句子为不可分割的综合内容体;
位置确定单元,用于在生成文档层次结构时,为图片确定相对于其关联文本的具体层次位置,使图文内容作为一个层次单元一同展示。
可选地,作为本发明一个实施例,基于所述目录的标题构建基础知识图谱,并逐步对标题对应的段落进行语义分析,为基础知识图谱添加实体和关系,得到全局知识图谱,包括:
从目录的标题中抽取实体和实体关系,并基于抽取的实体和实体关系构建基础知识图谱;
获取目录中的最下级标题,获取最下级标题对应的局部知识图谱,所述局部知识图谱包含所述最下级标题对应的实体;
基于目录获取最下级标题对应的目标段落,从所述目标段落抽取实体和关系,并基于抽取的实体和关系更新所述局部知识图谱;
遍历所有最下级标题,得到全局知识图谱。
可选地,作为本发明一个实施例,利用知识图谱嵌入方法将全局知识图谱中的实体和关系映射为低维向量,并利用图注意力网络模型对嵌入后的全局知识图谱进行全局关系提取,包括:
采用翻译模型将全局知识图谱中的实体和关系映射为低维向量,设置所述翻译模型的损失函数为负对数似然损失;
将实体和关系的低维向量作为图注意力网络模型的输入,所述图注意力网络模型通过计算实体之间的注意力系数和聚合邻居节点的信息提取全局知识图谱中实体之间的关系;
利用图注意力网络模型对不同局部知识图谱中的实体进行相似度计算,并基于计算结果构建不同局部知识图谱中的实体的关联关系;
将全局知识图谱中的实体之间的关系和不同局部知识图谱中的实体的关联关系整合为全局关系。
可选地,作为本发明一个实施例,所述图注意力网络模型的训练方法包括:
从文档中提取语义相似或相关的句子、段落,构成正样本对,从文档中选择语义不相关的句子或段落,构成负样本对;
使用预训练的分层注意力网络模型,对正样本对及负样本对中的句子或段落进行编码,生成高维度的语义向量;
采用对比损失函数,以使模型在语义空间中拉近正样本对的距离,拉远负样本对的距离;
利用编码后的正样本对及负样本对训练图注意力网络模型。
可选地,作为本发明一个实施例,基于所述全局关系构建全局语境链条,基于所述全局语境链条对全局知识图谱的关系进行更新,包括:
利用图轮算法基于所述全局关系构建全局语境链条;
将全局语境链条涉及的实体和关系与全局知识图谱进行匹配,以基于匹配结果为所述全局知识图谱补全缺失的实体关系。
尽管通过参考附图并结合优选实施例的方式对本发明进行了详细描述,但本发明并不限于此。在不脱离本发明的精神和实质的前提下,本领域普通技术人员可以对本发明的实施例进行各种等效的修改或替换,而这些修改或替换都应在本发明的涵盖范围内/任何熟悉本技术领域的技术人员在本发明揭露的技术范围内,可轻易想到变化或替换,都应涵盖在本发明的保护范围之内。

Claims (8)

1.一种复杂文档的全局语境分析方法,其特征在于,包括:
通过对目标文档进行版面分析,为所述目标文档生成目录;
识别目标文档中的图片的文字信息,并通过对所述文字信息和相邻文字内容进行语义分析,建立图片与文字内容的关联关系;
基于所述目录的标题构建基础知识图谱,并逐步对标题对应的段落进行语义分析,为基础知识图谱添加实体和关系,得到全局知识图谱;
利用知识图谱嵌入方法将全局知识图谱中的实体和关系映射为低维向量,并利用图注意力网络模型对嵌入后的全局知识图谱进行全局关系提取;
基于所述全局关系构建全局语境链条,并基于所述全局语境链条对全局知识图谱的关系进行更新;
利用知识图谱嵌入方法将全局知识图谱中的实体和关系映射为低维向量,并利用图注意力网络模型对嵌入后的全局知识图谱进行全局关系提取,包括:
采用翻译模型将全局知识图谱中的实体和关系映射为低维向量,设置所述翻译模型的损失函数为负对数似然损失;
将实体和关系的低维向量作为图注意力网络模型的输入,所述图注意力网络模型通过计算实体之间的注意力系数和聚合邻居节点的信息提取全局知识图谱中实体之间的关系;
利用图注意力网络模型对不同局部知识图谱中的实体进行相似度计算,并基于计算结果构建不同局部知识图谱中的实体的关联关系;
将全局知识图谱中的实体之间的关系和不同局部知识图谱中的实体的关联关系整合为全局关系;
基于所述全局关系构建全局语境链条,基于所述全局语境链条对全局知识图谱的关系进行更新,包括:
利用图轮算法基于所述全局关系构建全局语境链条;
将全局语境链条涉及的实体和关系与全局知识图谱进行匹配,以基于匹配结果为所述全局知识图谱补全缺失的实体关系。
2.根据权利要求1所述的方法,其特征在于,通过对目标文档进行版面分析,为所述目标文档生成目录,包括:
利用版面分析模型解析所述目标文档的版面特征,所述版面特征包括段落分布、标题格式参数、标题内容、段落格式参数;
利用规则算法,基于所述版面特征构建标题层级体系;
基于所述标题层级体系构建标题与段落的对应关系,并基于所述对应关系生成目录;
监控目标文档的更新内容,基于所述更新内容同步更新所述目录。
3.根据权利要求1所述的方法,其特征在于,识别目标文档中的图片的文字信息,并通过对所述文字信息和相邻文字内容进行语义分析,建立图片与文字内容的关联关系,包括:
利用光学字符识别技术从图片中提取文字信息;
根据所述图片在目标文档中的位置,提取所述图片的相邻文字段落;
利用关键词匹配技术从相邻文字段落中筛选出与所述文字信息匹配的目标段落,并为所述图片和所述目标段落设置关联标签;
对所述文字信息和所述目标段落进行语义分析,从目标段落中筛选出与所述文字信息的语义匹配的一个或多个句子;
为所述文字信息与语义匹配的句子添加独立标识,所述独立标识用于指示所述文字信息与语义匹配的句子为不可分割的综合内容体;
在生成文档层次结构时,为图片确定相对于其关联文本的具体层次位置,使图文内容作为一个层次单元一同展示。
4.根据权利要求1所述的方法,其特征在于,基于所述目录的标题构建基础知识图谱,并逐步对标题对应的段落进行语义分析,为基础知识图谱添加实体和关系,得到全局知识图谱,包括:
从目录的标题中抽取实体和实体关系,并基于抽取的实体和实体关系构建基础知识图谱;
获取目录中的最下级标题,获取最下级标题对应的局部知识图谱,所述局部知识图谱包含所述最下级标题对应的实体;
基于目录获取最下级标题对应的目标段落,从所述目标段落抽取实体和关系,并基于抽取的实体和关系更新所述局部知识图谱;
遍历所有最下级标题,得到全局知识图谱。
5.根据权利要求4所述的方法,其特征在于,所述图注意力网络模型的训练方法包括:
从文档中提取语义相似或相关的句子、段落,构成正样本对,从文档中选择语义不相关的句子或段落,构成负样本对;
使用预训练的分层注意力网络模型,对正样本对及负样本对中的句子或段落进行编码,生成高维度的语义向量;
采用对比损失函数,以使模型在语义空间中拉近正样本对的距离,拉远负样本对的距离;
利用编码后的正样本对及负样本对训练图注意力网络模型。
6.一种复杂文档的全局语境分析系统,其特征在于,包括:
目录生成模块,用于通过对目标文档进行版面分析,为所述目标文档生成目录;
图片关联模块,用于识别目标文档中的图片的文字信息,并通过对所述文字信息和相邻文字内容进行语义分析,建立图片与文字内容的关联关系;
图谱构建模块,用于基于所述目录的标题构建基础知识图谱,并逐步对标题对应的段落进行语义分析,为基础知识图谱添加实体和关系,得到全局知识图谱;
全局分析模块,用于利用知识图谱嵌入方法将全局知识图谱中的实体和关系映射为低维向量,并利用图注意力网络模型对嵌入后的全局知识图谱进行全局关系提取;
语境增强模块,用于基于所述全局关系构建全局语境链条,并基于所述全局语境链条对全局知识图谱的关系进行更新;
利用知识图谱嵌入方法将全局知识图谱中的实体和关系映射为低维向量,并利用图注意力网络模型对嵌入后的全局知识图谱进行全局关系提取,包括:
采用翻译模型将全局知识图谱中的实体和关系映射为低维向量,设置所述翻译模型的损失函数为负对数似然损失;
将实体和关系的低维向量作为图注意力网络模型的输入,所述图注意力网络模型通过计算实体之间的注意力系数和聚合邻居节点的信息提取全局知识图谱中实体之间的关系;
利用图注意力网络模型对不同局部知识图谱中的实体进行相似度计算,并基于计算结果构建不同局部知识图谱中的实体的关联关系;
将全局知识图谱中的实体之间的关系和不同局部知识图谱中的实体的关联关系整合为全局关系;
基于所述全局关系构建全局语境链条,基于所述全局语境链条对全局知识图谱的关系进行更新,包括:
利用图轮算法基于所述全局关系构建全局语境链条;
将全局语境链条涉及的实体和关系与全局知识图谱进行匹配,以基于匹配结果为所述全局知识图谱补全缺失的实体关系。
7.根据权利要求6所述的系统,其特征在于,所述目录生成模块包括:
版面分析单元,用于利用版面分析模型解析所述目标文档的版面特征,所述版面特征包括段落分布、标题格式参数、标题内容、段落格式参数;
体系构建单元,用于利用规则算法,基于所述版面特征构建标题层级体系;
目录生成单元,用于基于所述标题层级体系构建标题与段落的对应关系,并基于所述对应关系生成目录;
目录更新单元,用于监控目标文档的更新内容,基于所述更新内容同步更新所述目录。
8.根据权利要求6所述的系统,其特征在于,所述图片关联模块包括:
文字提取单元,用于利用光学字符识别技术从图片中提取文字信息;
段落提取单元,用于根据所述图片在目标文档中的位置,提取所述图片的相邻文字段落;
标签关联单元,用于利用关键词匹配技术从相邻文字段落中筛选出与所述文字信息匹配的目标段落,并为所述图片和所述目标段落设置关联标签;
语义匹配单元,用于对所述文字信息和所述目标段落进行语义分析,从目标段落中筛选出与所述文字信息的语义匹配的一个或多个句子;
语句标记单元,用于为所述文字信息与语义匹配的句子添加独立标识,所述独立标识用于指示所述文字信息与语义匹配的句子为不可分割的综合内容体;
位置确定单元,用于在生成文档层次结构时,为图片确定相对于其关联文本的具体层次位置,使图文内容作为一个层次单元一同展示。
CN202510486491.3A 2025-04-18 2025-04-18 复杂文档的全局语境分析方法及系统 Active CN120012759B (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN202510486491.3A CN120012759B (zh) 2025-04-18 2025-04-18 复杂文档的全局语境分析方法及系统

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN202510486491.3A CN120012759B (zh) 2025-04-18 2025-04-18 复杂文档的全局语境分析方法及系统

Publications (2)

Publication Number Publication Date
CN120012759A CN120012759A (zh) 2025-05-16
CN120012759B true CN120012759B (zh) 2025-08-05

Family

ID=95672001

Family Applications (1)

Application Number Title Priority Date Filing Date
CN202510486491.3A Active CN120012759B (zh) 2025-04-18 2025-04-18 复杂文档的全局语境分析方法及系统

Country Status (1)

Country Link
CN (1) CN120012759B (zh)

Families Citing this family (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN121033854B (zh) * 2025-08-13 2026-03-20 北京欣博友数据科技有限公司 基于框坐标的pdf文本提取方法和装置
CN120780849B (zh) * 2025-09-04 2026-01-09 齐鲁空天信息研究院 基于文档知识库和知识图谱的检索增强生成方法

Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN114564596A (zh) * 2022-03-03 2022-05-31 上海工程技术大学 一种基于图注意力机制的跨语言知识图谱链接预测方法
CN117574904A (zh) * 2023-12-02 2024-02-20 嵩山实验室 基于对比学习和多模态语义交互的命名实体识别方法

Family Cites Families (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN113641826B (zh) * 2021-06-29 2024-03-26 北京邮电大学 面向多源知识图谱融合的实体对齐方法、装置与系统
CN115828931B (zh) * 2023-02-09 2023-05-02 中南大学 面向段落级文本的中英文语义相似度计算方法
CN119646178B (zh) * 2024-11-26 2025-08-05 湖北邮电规划设计有限公司 基于知识图谱的增强文档生成和检索方法

Patent Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN114564596A (zh) * 2022-03-03 2022-05-31 上海工程技术大学 一种基于图注意力机制的跨语言知识图谱链接预测方法
CN117574904A (zh) * 2023-12-02 2024-02-20 嵩山实验室 基于对比学习和多模态语义交互的命名实体识别方法

Also Published As

Publication number Publication date
CN120012759A (zh) 2025-05-16

Similar Documents

Publication Publication Date Title
US12536377B2 (en) Extracting definitions from documents utilizing definition-labeling-dependent machine learning background
US12032605B2 (en) Searchable data structure for electronic documents
CN112632223B (zh) 案事件知识图谱构建方法及相关设备
CN115390806B (zh) 基于双模态联合建模的软件设计模式推荐方法
CN114637846A (zh) 视频数据处理方法、装置、计算机设备和存储介质
CN118379754B (zh) 一种基于云计算和人工智能的练习册检测方法及系统
CN114840685A (zh) 一种应急预案知识图谱构建方法
CN120012759A (zh) 复杂文档的全局语境分析方法及系统
CN120874852B (zh) 一种基于知识图谱推理的政务文本审核方法及系统
CN117933249A (zh) 一种装备故障知识的智能交互方法及系统
CN120832418B (zh) 面向行业标准文档的深度语义实体与关系自动抽取方法
CN119396997A (zh) 大数据环境下的实时数据分析与可视化方法及系统
CN118839008B (zh) 一种基于语言大模型的军事问答方法与系统
CN118522017B (zh) 文本提取方法、装置及电子设备
CN120564202A (zh) 一种基于ocr的公文自动识别智能管理系统
CN120296275B (zh) 基于多LoRA级联策略的HTML信息提取方法、装置、设备和介质
CN120197623A (zh) 一种基于规则库的司法文书向量化分段和段落标注方法
CN119622364A (zh) 新闻稿件敏感词识别方法、系统、电子设备及存储介质
CN120876908B (zh) 一种用于复杂图文混合文件的方案检测方法及装置
CN119783672B (zh) 语料扩展方法、设备及存储介质
CN120671678A (zh) 基于大语言模型智能体的文档语义比对方法及系统
Xu et al. Estimating similarity of rich internet pages using visual information
CN119600632B (zh) 一种试卷智能化切题方法、装置、计算机设备及可读存储介质
CN119399778B (zh) 基于多规则库的文档智能审核方法及系统
CN121478949A (zh) 面向知识库的多模态检索增强生成方法及装置

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination
GR01 Patent grant
GR01 Patent grant