CN115062862B - 一种基于多个地址信息的行政区域预测方法与设备 - Google Patents

一种基于多个地址信息的行政区域预测方法与设备

Info

Publication number
CN115062862B
CN115062862B CN202210798246.2A CN202210798246A CN115062862B CN 115062862 B CN115062862 B CN 115062862B CN 202210798246 A CN202210798246 A CN 202210798246A CN 115062862 B CN115062862 B CN 115062862B
Authority
CN
China
Prior art keywords
address
address information
information
administrative region
preset
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
CN202210798246.2A
Other languages
English (en)
Other versions
CN115062862A (zh
Inventor
向桥梁
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Liantong Hangzhou Technology Service Co ltd
Original Assignee
Liantong Hangzhou Technology Service Co ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Liantong Hangzhou Technology Service Co ltd filed Critical Liantong Hangzhou Technology Service Co ltd
Priority to CN202210798246.2A priority Critical patent/CN115062862B/zh
Publication of CN115062862A publication Critical patent/CN115062862A/zh
Application granted granted Critical
Publication of CN115062862B publication Critical patent/CN115062862B/zh
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06QINFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR ADMINISTRATIVE, COMMERCIAL, FINANCIAL, MANAGERIAL OR SUPERVISORY PURPOSES; SYSTEMS OR METHODS SPECIALLY ADAPTED FOR ADMINISTRATIVE, COMMERCIAL, FINANCIAL, MANAGERIAL OR SUPERVISORY PURPOSES, NOT OTHERWISE PROVIDED FOR
    • G06Q10/00Administration; Management
    • G06Q10/04Forecasting or optimisation specially adapted for administrative or management purposes, e.g. linear programming or "cutting stock problem"
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/20Information retrieval; Database structures therefor; File system structures therefor of structured data, e.g. relational data
    • G06F16/21Design, administration or maintenance of databases
    • G06F16/215Improving data quality; Data cleansing, e.g. de-duplication, removing invalid entries or correcting typographical errors
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/90Details of database functions independent of the retrieved data types
    • G06F16/903Querying
    • G06F16/9035Filtering based on additional data, e.g. user or group profiles
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06QINFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR ADMINISTRATIVE, COMMERCIAL, FINANCIAL, MANAGERIAL OR SUPERVISORY PURPOSES; SYSTEMS OR METHODS SPECIALLY ADAPTED FOR ADMINISTRATIVE, COMMERCIAL, FINANCIAL, MANAGERIAL OR SUPERVISORY PURPOSES, NOT OTHERWISE PROVIDED FOR
    • G06Q50/00Information and communication technology [ICT] specially adapted for implementation of business processes of specific business sectors, e.g. utilities or tourism
    • G06Q50/10Services
    • G06Q50/26Government or public services

Landscapes

  • Engineering & Computer Science (AREA)
  • Business, Economics & Management (AREA)
  • Theoretical Computer Science (AREA)
  • Databases & Information Systems (AREA)
  • General Physics & Mathematics (AREA)
  • Physics & Mathematics (AREA)
  • Strategic Management (AREA)
  • Tourism & Hospitality (AREA)
  • Economics (AREA)
  • Human Resources & Organizations (AREA)
  • Data Mining & Analysis (AREA)
  • Development Economics (AREA)
  • General Business, Economics & Management (AREA)
  • Marketing (AREA)
  • Quality & Reliability (AREA)
  • General Engineering & Computer Science (AREA)
  • General Health & Medical Sciences (AREA)
  • Educational Administration (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Primary Health Care (AREA)
  • Game Theory and Decision Science (AREA)
  • Entrepreneurship & Innovation (AREA)
  • Operations Research (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

本申请的目的是提供一种基于多个地址信息的行政区域预测方法与设备。与现有技术相比,本申请通过获取多个地址信息;根据预设的相似度阈值对所述多个地址信息进行相似度筛选,并将所述预设的相似度阈值范围内的若干个地址信息确定为预测地址集合;根据预设的地址关键词库将所述预测地址集合中的各个地址信息拆分成多个地址词;基于所述多个地址词、预设的级别词库及预设的行政区域库确定对应的行政区域。通过对多个地址信息进行有条件的融合,从而在融合尽可能多的地址信息的前提下,实现了低信息冲突的行政区域预测,大大提高了预测结果的准确性。

Description

一种基于多个地址信息的行政区域预测方法与设备
技术领域
本申请涉及计算机技术领域,尤其涉及一种基于多个地址信息的行政区域预测技术。
背景技术
2021年10月13日,中国人民银行官网发布《中国人民银行关于加强支付受理终端及相关业务管理的通知(银发〔2021〕259号)》,加强对支付受理终端及相关业务的管理,其中,该文要求收单机构和清算机构合作利用技术手段核验实体特约商户受理终端的实际位置与登记布放地理位置的一致性。
在此,受理终端的实际位置可以通过交易发生时采集的GPS等信息来获得,而受理终端登记的布放位置则需要根据终端和商户管理平台里的地址信息来推断预测,地址信息主要包含终端安装地址、商户经营地址及商户经营名字等。因此,基于以上需求,需要一种能根据实体特约商户的多个地址信息预测其所在的行政区域的方法。
申请号为202210602770.8的在先专利公开了一种基于地址信息确定行政区域的方法与设备,可实现基于实体特约商户的多个地址信息的行政区域预测。但该申请是将各个地址信息中的分地址进行提取,再将若干个分地址直接作为总地址,进而基于总地址进行行政区域的确定,即采用了直接的地址融合方法。
直接地址融合方法预先假定了所有地址信息之间均具有一致性,即默认这些地址信息是从不同的角度描述同一个地址。但在实际场景中,地址信息可能相似也可能完全不同。例如,同一个商户的注册地址和经营地址均为该商户的地址信息,但注册地址和经营地址可能完全不同。在此情况下,若直接将注册地址和经营地址进行融合,就会导致信息冲突,降低确定的行政区域的准确性。
发明内容
本申请的目的是提供一种基于多个地址信息的行政区域预测方法与设备,以解决多个地址信息可能存在的信息冲突对预测结果的不利影响,同时,在融合尽可能多的地址信息的前提下,提高预测结果的准确性。
根据本申请的一个方面,提供了一种基于多个地址信息的行政区域预测方法,其中,所述方法包括:
获取多个地址信息;
根据预设的相似度阈值对所述多个地址信息进行相似度筛选,并将所述预设的相似度阈值范围内的若干个地址信息确定为预测地址集合;
根据预设的地址关键词库将所述预测地址集合中的各个地址信息拆分成多个地址词;
基于所述多个地址词、预设的级别词库及预设的行政区域库确定对应的行政区域。
进一步地,其中,所述将所述预设的相似度阈值范围内的若干个地址信息确定为预测地址集合之后还包括:
清洗所述预测地址集合中的冗余信息;
所述根据预设的地址关键词库将所述预测地址集合中的各个地址信息拆分成多个地址词包括:
根据预设的地址关键词库将清洗后的预测地址集合中的各个地址信息拆分成多个地址词;
进一步地,其中,所述获取多个地址信息包括:
获取多个包含等级标记的地址信息,其中,所述等级标记用以表征所述地址信息的可靠性;
其中,所述根据预设的相似度阈值对所述多个地址信息进行相似度筛选,并将所述预设的相似度阈值范围内的若干个地址信息确定为预测地址集合包括:
将各个地址信息按照等级标记表征的可靠性顺序由高至低排序,由第二位地址信息开始遍历该排序并将遍历到的地址信息与可靠性更高一级的地址信息进行相似度比较;
若相似度比较结果在预设的相似度阈值范围内,则将该遍历到的地址信息加入到预测地址集合中,并继续遍历;
若相似度比较结果为完全一致,则删除该遍历到的地址信息并继续遍历;
若不在预设的相似度阈值范围内且不完全一致,则删除该遍历到的地址信息并结束遍历。
进一步地,其中,各个等级标记具有对应的相似度阈值,所述等级标记表征的可靠性越高,其对应的所述相似度阈值越低。
进一步地,其中,所述清洗所述预测地址集合中的冗余信息之前还包括:
通过正则表达式的方式设置若干个清洗规则;
其中,所述清洗所述预测地址集合中的冗余信息包括:
通过各个所述清洗规则遍历所述预测地址集合;
当遍历到的地址信息满足该清洗规则时,按照该清洗规则的正则表达式内容对该地址信息进行冗余信息的删除。
进一步地,所述冗余信息包括邮政编码、定位点信息、非中文字符及用途信息中的至少任一项,其中,所述清洗规则与不同类型的冗余信息一一对应;
其中,当冗余信息中至少包括邮政编码及非中文字符时,所述通过各个所述清洗规则遍历所述预测地址集合包括:
通过邮政编码对应的清洗规则遍历所述预测地址集合的次序先于通过非中文字符对应的清洗规则遍历所述预测地址集合的次序。
进一步地,其中,所述根据预设的地址关键词库将所述预测地址集合中的各个地址信息拆分成多个地址词之前还包括:
确定所述地址关键词库中所有字符长度为1的关键词;
对所有字符长度为1的关键词进行两两组合得到组合词;
将所述组合词加入到地址关键词库中。
进一步地,预设筛选阈值,其中,所述将所述组合词加入到地址关键词库中之前还包括:
在行政区域词库中统计各个组合词出现的次数;
所述将所述组合词加入到地址关键词库中包括:
当所述组合词的出现次数超过所述筛选阈值时,将该组合词加入到所述地址关键词库中。
进一步地,其中,所述根据预设的地址关键词库将所述预测地址集合中的各个地址信息拆分成多个地址词之后还包括:
人工排查拆分结果,若拆分结果出错,则将该拆分结果对应的地址信息加入到特殊地点库中。
进一步地,根据所述行政区域库建立地省映射库,其中,所述地省映射库包括各个地级行政区域词与其所属的省级行政区域词之间的映射关系,其中,所述基于所述多个地址词、预设的级别词库及预设的行政区域库确定对应的行政区域包括:
基于预设的级别词库及所述多个地址词确定包含各级行政区域词的词组集;
所述词组集在预设的行政区域库中进行匹配,确定所述词组集对应的匹配集;
将所述匹配集所对应的行政区域确定为该地址信息对应的行政区域;
其中,所述基于预设的级别词库及所述多个地址词确定包含各级行政区域词的词组集之后还包括:
在所述词组集中获取各个地址词中确定的地级行政区域词及省级行政区域词;
根据所述地省映射库判断所述地级行政区域词和省级行政区域词之间是否存在映射关系;
若不存在映射关系,则在所述词组集中将所述地级行政区域词及省级行政区域词替换为该地级行政区域词及省级行政区域词对应的原始组合字段。
根据本申请的另一方面,还提供了一种计算机可读介质,其上存储有计算机可读指令,所述计算机可读指令可被处理器执行以实现如前述方法的操作。
根据本申请的再一方面,还提供了一种基于多个地址信息的行政区域预测设备,其中,该设备包括:
一个或多个处理器;以及
存储有计算机可读指令的存储器,所述计算机可读指令在被执行时使所述处理器执行上述方法的操作。
与现有技术相比,本申请通过获取多个地址信息;根据预设的相似度阈值对所述多个地址信息进行相似度筛选,并将所述预设的相似度阈值范围内的若干个地址信息确定为预测地址集合;根据预设的地址关键词库将所述预测地址集合中的各个地址信息拆分成多个地址词;基于所述多个地址词、预设的级别词库及预设的行政区域库确定对应的行政区域。通过对多个地址信息进行有条件的融合,从而在融合尽可能多的地址信息的前提下,实现了低信息冲突的行政区域预测,大大提高了预测结果的准确性。
附图说明
通过阅读参照以下附图所作的对非限制性实施例所作的详细描述,本发明的其它特征、目的和优点将会变得更明显:
图1示出根据本申请一个方面的一种基于多个地址信息的行政区域预测方法流程图;
图2示出根据本申请一个优选实施例的一种基于多个地址信息的行政区域预测方法流程图。
附图中相同或相似的附图标记代表相同或相似的部件。
具体实施方式
下面结合附图对本发明作进一步详细描述。
在本申请一个典型的配置中,终端、服务网络的设备和可信方均包括一个或多个处理器(CPU)、输入/输出接口、网络接口和内存。
内存可能包括计算机可读介质中的非永久性存储器,随机存取存储器(RAM)和/或非易失性内存等形式,如只读存储器(ROM)或闪存(flash RAM)。内存是计算机可读介质的示例。
计算机可读介质包括永久性和非永久性、可移动和非可移动媒体可以由任何方法或技术来实现信息存储。信息可以是计算机可读指令、数据结构、程序的模块或其他数据。计算机的存储介质的例子包括,但不限于相变内存(PRAM)、静态随机存取存储器(SRAM)、动态随机存取存储器(DRAM)、其他类型的随机存取存储器(RAM)、只读存储器(ROM)、电可擦除可编程只读存储器(EEPROM)、快闪记忆体或其他内存技术、只读光盘只读存储器(CD-ROM)、数字多功能光盘(DVD)或其他光学存储、磁盒式磁带,磁带磁盘存储或其他磁性存储设备或任何其他非传输介质,可用于存储可以被计算设备访问的信息。按照本文中的界定,计算机可读介质不包括非暂存电脑可读媒体(transitory media),如调制的数据信号和载波。
为更进一步阐述本申请所采取的技术手段及取得的效果,下面结合附图及较佳实施例,对本申请的技术方案,进行清楚和完整的描述。
图1示出本申请一个方面提供的一种基于多个地址信息的行政区域预测方法,其中,该方法包括:
S11获取多个地址信息;
S12根据预设的相似度阈值对所述多个地址信息进行相似度筛选,并将所述预设的相似度阈值范围内的若干个地址信息确定为预测地址集合;
S13根据预设的地址关键词库将所述预测地址集合中的各个地址信息拆分成多个地址词;
S14基于所述多个地址词、预设的级别词库及预设的行政区域库确定对应的行政区域。
在该实施例中,在所述步骤S11中,获取多个地址信息。
在此,可从商户管理平台和/或商户受理终端获取多个地址信息,获取的地址信息包括但不限于终端安装地址、商户经营地址及商户经营名字。在此应明确,本申请的方法可应用于非法移机预防的场景中,也可应用与商户或客户分布统计的场景中,同样地,其他需要通过多个地址信息推断预测行政区域的场景均在本申请的应用范围中。应明确,在此根据不同应用场景的需求,预测出的行政区域可以为具体的地址,也可以为一个区域。例如,当将本申请的方法应用于非法移机预防、商户或客户分布统计的场景中,由于此类场景不需获取详细的地址,例如,非法移机预防需要确定受理终端是否进行了跨市或跨省经营等,商户或客户分布统计需要判断商户或客户在各个省、市或区等区域范围内的分布情况,因此,需要通过本申请的方法根据多个地址信息预测出一个区域范围;而在其他需要预测具体地址的情况下,也可通过本申请的方法根据多个地址信息预测出一个具体的地址。
在该实施例中,在所述步骤S12中,根据预设的相似度阈值对所述多个地址信息进行相似度筛选,并将所述预设的相似度阈值范围内的若干个地址信息确定为预测地址集合。
在此,获取的多个地址信息中存在一个可信度较高的基准地址,该基准地址可预先由人工选定或由信息提供方指定,其他地址信息为对该基准地址进行补充的候选地址,在确定相似度时,可将候选地址逐个与基准地址进行两两比较从而确定相似度,在此不对确定文本相似度的方法进行限制性说明,任何文本相似度的计算方法均可应用于此,包括Jaro-Walker相似度、Jacard相似度、simhash算法、LSI模型及匹配矩阵模型等,根据预设的相似度阈值将满足该阈值范围内的若干个候选地址与基准地址确定为预测地址集合。在此,由于当候选地址与基准地址完全相同时,若进行融合将额外增加后续地址拆分、清洗及匹配的工作量;当候选地址与基准地址差异较大时,若进行融合将存在信息冲突的风险,因此,相似度阈值应根据实际需求确定,使得筛选出的候选地址与基准地址存在重合字段但不完全相同,以此达到最优的融合效果。
优选地,获取多个包含等级标记的地址信息,其中,所述等级标记用以表征所述地址信息的可靠性;各个地址信息均根据所述等级标记与可靠性高一级的地址信息按照预设的相似度阈值进行相似度比较;将所述预设的相似度阈值范围内的若干个地址信息确定为预测地址集合。
在此,从信息提供方处获取多个包含等级标记的地址信息,将各个地址信息按照等级标记表征的可靠性顺序由高至低排序,由第二位地址信息开始(因第一位的地址信息无更高一级的比较对象)遍历该排序并与可靠性更高一级的地址信息进行相似度比较,若在预设的相似度阈值范围内,则将其加入到预测地址集合中,并继续遍历;若相似度比较结果为完全一致,则舍弃该地址信息并继续遍历;若不在预设的相似度阈值范围内且不完全一致,则舍弃该地址信息并结束遍历。在此,为减少不必要的融合,通过相似度阈值筛选出相似度较高且不完全一致的地址信息,并通过顺序逐个单次比较将相似度比较的次数最小化。当某地址信息的相似度不在相似度阈值范围且不完全一致时,说明该地址信息存在信息冲突的风险,为不可靠的信息,从而等级标记表征的可靠性低于该地址信息的其他地址信息也必然不可靠,因此,可终结遍历比较的进程。通过这种方式在实现可靠信息筛选的同时,大大减少了相似度比较的次数,节约资源开销,减少时间成本。
进一步地,各个等级标记具有对应的相似度阈值,所述等级标记表征的可靠性越高,其对应的所述相似度阈值越低。相应地,地址信息越不可靠,其相似度阈值越高,使得不可靠的信息只有在相似度较高的情况下才能加入到地址集合中,作为预测的依据。提高了地址信息的整体一致性,进一步降低了信息冲突的可能性。
在一种优选实施例中,参见图2,其中,图2中的步骤S21及S22与图1实施例中的步骤S11及S12相同或基本相同,故在此不再赘述,仅以引用的方式包含于此。其中,所述步骤S23包括:清洗所述预测地址集合中的冗余信息;根据预设的地址关键词库将清洗后的预测地址集合中的各个地址信息拆分成多个地址词。
在此,确定的预测地址集合即为预测行政区域的依据,对该预测地址集合进行冗余信息的清洗,提高预测结果的准确性。
继续在该步骤中,具体地,通过正则表达式的方式设置若干个清洗规则;通过各个所述清洗规则遍历所述预测地址集合;当遍历到的地址信息满足该清洗规则时,按照该清洗规则的正则表达式内容对该地址信息进行冗余信息的删除。
在此,通过正则表达式的方式设置清洗规则,使得每个清洗规则都能对一类冗余信息进行统一的清洗,相较于通过枚举的方式建立冗余特征库的方案,该方案对各类冗余信息的特征进行总结,减少了清洗环节的前期准备工作量,同时,仅将预测地址集合与多个清洗规则进行匹配,相比于与枚举的冗余特征库匹配而言,大大减轻了清洗环节中的工作量。
进一步地,冗余信息包括邮政编码、定位点信息、非中文字符及用途信息中的至少任一项,其中,所述清洗规则与不同类型的冗余信息一一对应;其中,当冗余信息中至少包括邮政编码及非中文字符时,所述通过各个所述清洗规则遍历所述预测地址集合包括:通过邮政编码对应的清洗规则遍历所述预测地址集合的次序先于通过非中文字符对应的清洗规则遍历所述预测地址集合的次序。
在此,用途信息指不必要的方位或场所描述,例如“商住楼”“办公楼”“门店”“西侧”等,定位点信息指明确到具体地址的细节信息,例如第X院、栋、层、室等,如前所述,当将本方法应用于非法移机预防、商户或客户分布统计的场景中,定位点信息为冗余信息,而在预测具体地址的场景中不将定位点信息作为冗余信息。
以python语言为例,根据上述冗余信息通过正则表达式的方式设置的清洗规则可为:
非中文字符清洗规则:[^\u4e00-\u9fff]+;
邮政编码清洗规则:(?:邮政编码|邮编|编码)[:0-9]+;
用途信息清洗规则:\s*(?:门脸房|门脸东|南广场|商业楼|门诊部|摊位号|以南地块|商住楼|办公楼|商业用房|商住小区|百货地下|地下车库|地下商城)\s*$;
定位点清洗规则:第?[-0-9a-zA-Z/\\\\&,、#首负一二三四五六七八九十及至和]+号?(?:号店铺|门店|临街楼|号柜台|号门面|门面房|号门市|号院|号路|号房|号铺|卡铺|铺面|柜位|号商铺|商铺|铺位|店面|号|幢|房间|门市|铺|馆|房|层|室|楼|座|弄|栋|单元|店|区|段|轴|期)。
继续在该步骤中,在实际的应用场景中,地址信息可能存在邮政编码信息,例如地址信息中包含“上海市黄浦区五里桥街道邮编:200023”字段,在此,“邮编:200023”为冗余信息,若先通过非中文字符清洗规则对该冗余信息进行了清洗,则无法清洗“邮编”字段,因此,通过邮政编码对应的清洗规则遍历所述预测地址集合的次序先于通过非中文字符对应的清洗规则遍历所述预测地址集合的次序,以此避免特定字段无法清洗的情况。
进一步地,根据预设的地址关键词库将清洗后的预测地址集合中的各个地址信息拆分成多个地址词。在此,延续申请号为202210602770.8专利名称为一种基于地址信息确定行政区域的方法与设备的在先专利进行地址词拆分,具体地,“根据预设的地址关键词库将所有分地址拆分成多个地址词。优选地,所述地址关键词库中的关键词按照字符串长度降序排列,其中,所述根据预设的地址关键词库将所有分地址拆分成多个地址词包括:顺序遍历所述地址关键词库;将遍历到的关键词与所述分地址进行顺序匹配;若匹配到,则将所述分地址中位于该关键词之前的字段拆分为一个地址词;将位于该关键词之后的字段确定为所述分地址,并重复上述操作”。
基于以上内容,本申请相应地,在本申请中根据预设的地址关键词库将所有分地址拆分成多个地址词,所述地址关键词库中的关键词按照字符串长度降序排列,顺序遍历所述地址关键词库,将遍历到的关键词与所述预测地址集合中的各个地址信息进行顺序匹配;若匹配到,则将该地址信息中位于该关键词之前的字段拆分为一个地址词;将位于该关键词之后的字段确定为所述地址信息,并重复上述操作。
优选地,确定所述地址关键词库中所有字符长度为1的关键词;对所有字符长度为1的关键词进行两两组合得到组合词;将所述组合词加入到地址关键词库中。从而根据扩充关键词后的地址关键词库进行上述地址词拆分过程。
在此,在实际应用场景中,存在部分特殊的行政区域,例如“沙市区”、“宁乡市”及“清镇市”等,其名称中带有地址关键词库中的地址关键词,若以原本的地址关键词库进行拆分,将会出现误拆分的情况。因此,针对这种情景,将地址关键词库中的关键词进行组合,对原有的地址关键词库进行扩充,从而减少对此类特殊行政区域的误拆分。同时,由于此类特殊行政区域绝大多数情况下只会包含单字符的地址关键词,如“镇”“乡”“市”“区”等,因此,仅对所有字符长度为1的关键词进行两两组合,通过此方式在覆盖绝大多数特殊行政区域的同时,减少额外的工作量。
优选地,继承在先专利中的行政区域库,在行政区域词库中统计上述组合词出现的次数;当所述组合词的出现次数超过所述筛选阈值时,将该组合词加入到所述地址关键词库中。
在此,若对所有单字符的地址关键词进行两两组合,可能会增加多个无匹配行政区域的地址关键词,从而将在地址词拆分的过程中增加不必要的匹配遍历环节,因此,为进一步减少对不必要地址关键词的遍历及匹配,设置筛选阈值,并在行政区域库中进行统计及筛选,避免将不必要的组合词扩充进地址关键词库中。该筛选阈值根据需求设置,例如,若需要达到最高的拆分准确率且计算资源充足,则可将筛选阈值设置为最小值,使得只要存在组合词的可匹配行政区域,就将该组合词加入到关键地址词库中,以此保证拆分的准确率;相应地,当需要节约计算资源及时间成本时,则可适度提高该筛选阈值。
进一步地,所述根据预设的地址关键词库将所述预测地址集合中的各个地址信息拆分成多个地址词之后还包括:人工排查拆分结果,若拆分结果出错,则将该拆分结果对应的地址信息加入到特殊地点库中。
在此,继承在先专利中的特殊地点库,由于存在部分较为复杂的行政区域名,例如“积石山保安族东乡族撒拉族自治县”及“布依鲁克塔吉克族乡奎依巴格区公所”等,对其拆分的难度较大,因此,可在业务进行的过程中,捕获地址拆分异常的结果,并将对应的原地址信息加入到特殊地点库中,从而提高地址拆分的准确率。应明确,此类复杂行政区域名出现在业务过程中的可能性较低,因此,仅在需对此类行政区域名进行处理的特殊情景下,进行人工排查拆分结果的操作。
基于所述多个地址词、预设的级别词库及预设的行政区域库确定对应的行政区域的过程沿用在先专利的方法,即:基于预设的级别词库及所述多个地址词确定包含各级行政区域词的词组集;所述词组集在预设的行政区域库中进行匹配,确定所述词组集对应的匹配集;将所述匹配集所对应的行政区域确定为该地址信息对应的行政区域。具体地,其中,所述基于预设的级别词库及所述多个地址词确定包含各级行政区域词的词组集包括:根据所述级别词库顺序遍历所述地址词;若遍历到的地址词中存在国家级行政区域的全称字段或简写字段,则将该国家级行政区域在所述级别词库中的全称确定为国家级行政区域词;仅保留该地址词中位于该国家级行政区域的全称字段或简写字段之后的字段,并将该保留字段更新为所述遍历到的地址词,按上述方法依次进行省级及地级行政区域词的确定;将国家级、省级及地级行政区域词确定后的保留字段确定为所述尾词;将所述国家级、省级、地级行政区域词及所述尾词确定为所述词组集。
进一步地,基于上述在先专利的计算内容在本申请中根据所述行政区域库建立地省映射库,所述基于预设的级别词库及所述多个地址词确定包含各级行政区域词的词组集之后还包括:在所述词组集中获取各个地址词中确定的地级行政区域词及省级行政区域词;根据所述地省映射库判断所述地级行政区域词和省级行政区域词之间是否存在映射关系;若不存在映射关系,则在所述词组集中将所述地级行政区域词及省级行政区域词替换为该地级行政区域词及省级行政区域词对应的原始组合字段。
在此,建立地省映射库的过程即为将行政区域库中保存的地级行政区域与其所属的省级行政区域建立映射关系,并将该映射关系保存到地省映射库中。在实际应用场景中,可能会存在一些以行政区域命名的街道,例如中山路、南京路等,在先专利将此类特殊地点加入到特殊地点库中,在根据级别词库确定词组集之前,先根据地址词遍历该特殊地点库,从而判断该地址词中是否存在此类特殊地点。通过枚举法建立特殊地点库存在以下缺陷,首先,此方法难以穷举所有的特殊地点,可能出现漏检测的现象,导致预测结果有误;其次,若在特殊地点库中穷举所有特殊地点,对该特殊地点库进行遍历时,将会造成较大的时间及资源损耗。因此,本申请对其进行改进,通过建立地省映射库的方式,仅在地省映射库中保存映射关系,例如以编码的方式保存编码之间的映射关系,例如,在行政区域库中,“北京市”对应编码为01;“北京市朝阳区”对应编码为12,“北京市昌平区”对应编码为13,则在反向索引库中建立01与{12,13}之间的映射关系,该映射关系的建立形式包括但不限于队列、链表、树结构等。在另一种实施例中,地省映射库中以如下方式建立:每一个下级行政区域的编码均保留上一级行政区域的编码,并在上一级行政区域编码后补充附加位编码,且各级编码为固定长度。仍以北京市为例,“北京市”对应编码为01001;“北京市朝阳区”对应编码为0100101,“北京市昌平区”对应编码为0100102,则在确定地级行政区域词与省级行政区域词是否存在映射关系时,只需根据省级编码的固定长度获取地级行政区域词的部分编码字段,将该编码字段作为省级编码,并确定该省级编码对应的省级行政区域是否为该省级行政区域词即可。本申请建立地省映射库的方式在完全避免对特殊地点误识别的同时,大大减少了对特殊地点识别所需的时间成本。
与现有技术相比,本申请通过获取多个地址信息;根据预设的相似度阈值对所述多个地址信息进行相似度筛选,并将所述预设的相似度阈值范围内的若干个地址信息确定为预测地址集合;根据预设的地址关键词库将所述预测地址集合中的各个地址信息拆分成多个地址词;基于所述多个地址词、预设的级别词库及预设的行政区域库确定对应的行政区域。通过对多个地址信息进行有条件的融合,从而在融合尽可能多的地址信息的前提下,实现了低信息冲突的行政区域预测,大大提高了预测结果的准确性。
此外,本申请实施例还提供了一种计算机可读介质,其上存储有计算机可读指令,所述计算机可读指令可被处理器执行以实现前述方法。
本申请实施例还提供了一种基于多个地址信息的行政区域预测设备,其中,该设备包括:
一个或多个处理器;以及
存储有计算机可读指令的存储器,所述计算机可读指令在被执行时使所述处理器执行前述方法的操作。
例如,计算机可读指令在被执行时使所述一个或多个处理器:获取多个地址信息;根据预设的相似度阈值对所述多个地址信息进行相似度筛选,并将所述预设的相似度阈值范围内的若干个地址信息确定为预测地址集合;根据预设的地址关键词库将所述预测地址集合中的各个地址信息拆分成多个地址词;基于所述多个地址词、预设的级别词库及预设的行政区域库确定对应的行政区域。
对于本领域技术人员而言,显然本发明不限于上述示范性实施例的细节,而且在不背离本发明的精神或基本特征的情况下,能够以其他的具体形式实现本发明。因此,无论从哪一点来看,均应将实施例看作是示范性的,而且是非限制性的,本发明的范围由所附权利要求而不是上述说明限定,因此旨在将落在权利要求的等同要件的含义和范围内的所有变化涵括在本发明内。不应将权利要求中的任何附图标记视为限制所涉及的权利要求。此外,显然“包括”一词不排除其他单元或步骤,单数不排除复数。装置权利要求中陈述的多个单元或装置也可以由一个单元或装置通过软件或者硬件来实现。第一,第二等词语用来表示名称,而并不表示任何特定的顺序。

Claims (11)

1.一种基于多个地址信息的行政区域预测方法,其中,所述方法包括:
获取多个包含等级标记的地址信息,其中,所述等级标记用以表征所述地址信息的可靠性;
根据预设的相似度阈值对所述多个地址信息进行相似度筛选,并将所述预设的相似度阈值范围内的若干个地址信息确定为预测地址集合;
根据预设的地址关键词库将所述预测地址集合中的各个地址信息拆分成多个地址词;
基于所述多个地址词、预设的级别词库及预设的行政区域库确定对应的行政区域;
其中,所述根据预设的相似度阈值对所述多个地址信息进行相似度筛选,并将所述预设的相似度阈值范围内的若干个地址信息确定为预测地址集合包括:
将各个地址信息按照等级标记表征的可靠性顺序由高至低排序,由第二位地址信息开始遍历该排序并将遍历到的地址信息与可靠性更高一级的地址信息进行相似度比较;
若相似度比较结果在预设的相似度阈值范围内,则将该遍历到的地址信息加入到预测地址集合中,并继续遍历;
若相似度比较结果为完全一致,则删除该遍历到的地址信息并继续遍历;
若不在预设的相似度阈值范围内且不完全一致,则删除该遍历到的地址信息并结束遍历。
2.根据权利要求1所述的方法,其中,所述将所述预设的相似度阈值范围内的若干个地址信息确定为预测地址集合之后还包括:
清洗所述预测地址集合中的冗余信息;
所述根据预设的地址关键词库将所述预测地址集合中的各个地址信息拆分成多个地址词包括:
根据预设的地址关键词库将清洗后的预测地址集合中的各个地址信息拆分成多个地址词。
3.根据权利要求1所述的方法,其中,各个等级标记具有对应的相似度阈值,所述等级标记表征的可靠性越高,其对应的所述相似度阈值越低。
4.根据权利要求2所述的方法,其中,所述清洗所述预测地址集合中的冗余信息之前还包括:
通过正则表达式的方式设置若干个清洗规则;
其中,所述清洗所述预测地址集合中的冗余信息包括:
通过各个所述清洗规则遍历所述预测地址集合;
当遍历到的地址信息满足该清洗规则时,按照该清洗规则的正则表达式内容对该地址信息进行冗余信息的删除。
5.根据权利要求4所述的方法,所述冗余信息包括邮政编码、定位点信息、非中文字符及用途信息中的至少任一项,其中,所述清洗规则与不同类型的冗余信息一一对应;
其中,当冗余信息中至少包括邮政编码及非中文字符时,所述通过各个所述清洗规则遍历所述预测地址集合包括:
通过邮政编码对应的清洗规则遍历所述预测地址集合的次序先于通过非中文字符对应的清洗规则遍历所述预测地址集合的次序。
6.根据权利要求1所述的方法,其中,所述根据预设的地址关键词库将所述预测地址集合中的各个地址信息拆分成多个地址词之前还包括:
确定所述地址关键词库中所有字符长度为1的关键词;
对所有字符长度为1的关键词进行两两组合得到组合词;
将所述组合词加入到地址关键词库中。
7.根据权利要求6所述的方法,预设筛选阈值,其中,所述将所述组合词加入到地址关键词库中之前还包括:
在行政区域词库中统计各个组合词出现的次数;
所述将所述组合词加入到地址关键词库中包括:
当所述组合词的出现次数超过所述筛选阈值时,将该组合词加入到所述地址关键词库中。
8.根据权利要求1所述的方法,其中,所述根据预设的地址关键词库将所述预测地址集合中的各个地址信息拆分成多个地址词之后还包括:
人工排查拆分结果,若拆分结果出错,则将该拆分结果对应的地址信息加入到特殊地点库中。
9.根据权利要求1至8中任一项所述的方法,根据所述行政区域库建立地省映射库,其中,所述地省映射库包括各个地级行政区域词与其所属的省级行政区域词之间的映射关系,其中,所述基于所述多个地址词、预设的级别词库及预设的行政区域库确定对应的行政区域包括:
基于预设的级别词库及所述多个地址词确定包含各级行政区域词的词组集;
所述词组集在预设的行政区域库中进行匹配,确定所述词组集对应的匹配集;
将所述匹配集所对应的行政区域确定为该地址信息对应的行政区域;
其中,所述基于预设的级别词库及所述多个地址词确定包含各级行政区域词的词组集之后还包括:
在所述词组集中获取各个地址词中确定的地级行政区域词及省级行政区域词;
根据所述地省映射库判断所述地级行政区域词和省级行政区域词之间是否存在映射关系;
若不存在映射关系,则在所述词组集中将所述地级行政区域词及省级行政区域词替换为该地级行政区域词及省级行政区域词对应的原始组合字段。
10.一种计算机可读介质,其上存储有计算机可读指令,所述计算机可读指令可被处理器执行以实现如权利要求1至9中任一项所述的方法。
11.一种基于多个地址信息的行政区域预测设备,其中,该设备包括:
一个或多个处理器;以及
存储有计算机可读指令的存储器,所述计算机可读指令可被处理器执行以实现如权利要求1至9中任一项所述的方法。
CN202210798246.2A 2022-07-08 2022-07-08 一种基于多个地址信息的行政区域预测方法与设备 Active CN115062862B (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN202210798246.2A CN115062862B (zh) 2022-07-08 2022-07-08 一种基于多个地址信息的行政区域预测方法与设备

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN202210798246.2A CN115062862B (zh) 2022-07-08 2022-07-08 一种基于多个地址信息的行政区域预测方法与设备

Publications (2)

Publication Number Publication Date
CN115062862A CN115062862A (zh) 2022-09-16
CN115062862B true CN115062862B (zh) 2026-01-09

Family

ID=83204048

Family Applications (1)

Application Number Title Priority Date Filing Date
CN202210798246.2A Active CN115062862B (zh) 2022-07-08 2022-07-08 一种基于多个地址信息的行政区域预测方法与设备

Country Status (1)

Country Link
CN (1) CN115062862B (zh)

Families Citing this family (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN115859938A (zh) * 2022-12-14 2023-03-28 北京易华录信息技术股份有限公司 小区信息的处理方法、装置、电子设备和存储介质

Citations (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN108959244A (zh) * 2018-06-07 2018-12-07 北京京东尚科信息技术有限公司 地址分词的方法和装置
CN112364114A (zh) * 2020-11-16 2021-02-12 深圳壹账通智能科技有限公司 地址标准化方法、装置、计算机设备和存储介质
CN113515548A (zh) * 2021-07-29 2021-10-19 快宝(上海)网络技术有限公司 地址信息处理方法、装置、电子设备及存储介质
CN114637812A (zh) * 2020-12-15 2022-06-17 顺丰恒通支付有限公司 基于物流信息的物流主体匹配方法、装置和计算机设备

Family Cites Families (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2685862B2 (ja) * 1988-12-27 1997-12-03 株式会社東芝 住所認識方法
WO2015024059A1 (en) * 2013-08-22 2015-02-26 The University Of Sydney Localisation system and method
CN108804398A (zh) * 2017-05-03 2018-11-13 阿里巴巴集团控股有限公司 地址文本的相似度计算方法及装置

Patent Citations (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN108959244A (zh) * 2018-06-07 2018-12-07 北京京东尚科信息技术有限公司 地址分词的方法和装置
CN112364114A (zh) * 2020-11-16 2021-02-12 深圳壹账通智能科技有限公司 地址标准化方法、装置、计算机设备和存储介质
CN114637812A (zh) * 2020-12-15 2022-06-17 顺丰恒通支付有限公司 基于物流信息的物流主体匹配方法、装置和计算机设备
CN113515548A (zh) * 2021-07-29 2021-10-19 快宝(上海)网络技术有限公司 地址信息处理方法、装置、电子设备及存储介质

Also Published As

Publication number Publication date
CN115062862A (zh) 2022-09-16

Similar Documents

Publication Publication Date Title
CN108628811B (zh) 地址文本的匹配方法和装置
Moosavi et al. Short and long-term pattern discovery over large-scale geo-spatiotemporal data
CN110990520B (zh) 一种地址编码方法、装置、电子设备和存储介质
CN110738558B (zh) 信息修复方法、装置、电子设备及计算机可读介质
CN108959244A (zh) 地址分词的方法和装置
WO2021232585A1 (zh) 基于人工智能的定位数据处理方法及相关设备
CN108804398A (zh) 地址文本的相似度计算方法及装置
CN111950155A (zh) 一种城市公共交通系统脆弱性评估方法
CN113434708B (zh) 地址信息检测方法、装置、电子设备和存储介质
CN113569564B (zh) 一种地址信息的处理、显示方法和装置
CN106846166A (zh) 一种基于地址大数据分析的电力营销客户档案完善方法
CN115062862B (zh) 一种基于多个地址信息的行政区域预测方法与设备
CN111414490A (zh) 确定失联修复信息的方法、装置、电子设备和存储介质
CN110472797A (zh) 一种基于web的城市公交复杂网络自动化生成方法
CN113761909A (zh) 一种识别地址的方法及装置
CN115204167A (zh) 一种基于地址信息确定行政区域的方法与设备
CN113535883B (zh) 商业场所实体链接方法、系统、电子设备及存储介质
CN116824868B (zh) 车辆非法停驻点识别及拥堵预测方法、装置、设备及介质
CN116501897B (zh) 基于模糊匹配构建知识图谱的方法
CN113743952B (zh) 空壳企业识别方法及装置
CN111598714A (zh) 一种基于二阶段无监督的团伙识别方法、装置及电子设备
CN110362646A (zh) 地址信息的处理方法及装置、存储介质和电子装置
CN113672703B (zh) 一种用户信息的更新方法、装置、设备及存储介质
CN115481294A (zh) 场关系识别方法和系统
CN117765650B (zh) 热票卡黑名单生成方法、装置及介质

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination
GR01 Patent grant
GR01 Patent grant