CN103778162A - 一种互联网人物搜索信息整合分析方法 - Google Patents

一种互联网人物搜索信息整合分析方法 Download PDF

Info

Publication number
CN103778162A
CN103778162A CN201210414936.XA CN201210414936A CN103778162A CN 103778162 A CN103778162 A CN 103778162A CN 201210414936 A CN201210414936 A CN 201210414936A CN 103778162 A CN103778162 A CN 103778162A
Authority
CN
China
Prior art keywords
information
internet
search
analysis method
identity
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
CN201210414936.XA
Other languages
English (en)
Inventor
李旭日
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
GUANGZHOU BANGFU SOFTWARE Co Ltd
Original Assignee
GUANGZHOU BANGFU SOFTWARE Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by GUANGZHOU BANGFU SOFTWARE Co Ltd filed Critical GUANGZHOU BANGFU SOFTWARE Co Ltd
Priority to CN201210414936.XA priority Critical patent/CN103778162A/zh
Publication of CN103778162A publication Critical patent/CN103778162A/zh
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/90Details of database functions independent of the retrieved data types
    • G06F16/95Retrieval from the web
    • G06F16/951Indexing; Web crawling techniques

Landscapes

  • Engineering & Computer Science (AREA)
  • Databases & Information Systems (AREA)
  • Theoretical Computer Science (AREA)
  • Data Mining & Analysis (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Information Transfer Between Computers (AREA)

Abstract

本发明公开了一种互联网人物搜索信息整合分析方法,该分析方法主要描述了完整的互联网人物搜索信息整合思路及步骤。通过原始的信息在互联网中查找相关的网页,并对网页进行人物身份信息和帐号信息的二次提取。再与原始信息进行关联进行迭代查找,最后到有相应真实身份信息的网站中提取进一步的身份轨迹,本方法能够极大的提高身份信息收集的效率,并防止人工搜索的疏漏。对情报工作的收集带来便利。

Description

一种互联网人物搜索信息整合分析方法
技术领域
本发明涉及互联网技术领域,特别是一种互联网人物搜索信息整合分析方法。
背景技术
互联网的信息蓬勃发展也带来了与传统媒体的不同之处,传统媒体通常由于其专业性,文章以及新闻的发布带有系统以及知识的全部性和完备性。而互联网的信息通常是零散的,分布的,需要进行多次关联整合。
本分析方法主要针对信息的整合尤其是互联网人物信息的整合,有利于改善目前分散的人物信息状况。有利的改善用户体验,提高人物信息的查询效率。
发明内容
本发明的目的是解决上问题,提供一种分析方法,使得通过有限的人物原始输入信息,搜索整合互联网的零散人物信息为完整的身份及轨迹信息。提高人物情报工作的效率,并为系统的研发提供有利依据。
为达到上述目的,本发明所采用的技术方案是:一种互联网人物搜索信息整合分析方法,该分析方法主要描述了完整的互联网人物搜索信息整合思路及步骤。通过原始的信息在互联网中查找相关的网页,并对网页进行人物身份信息和帐号信息的二次提取。再与原始信息进行关联进行迭代查找,最后到有相应真实身份信息的网站中提取进一步的身份轨迹。
原始的信息是提供输入界面给用户输入不完整的身份信息。
在互联网中查找相关的网页为系统根据当前身份信息在搜索引擎中进行检索,获取到原始的网页信息集合;系统遍历网页信息集合,对每篇网页进行邮箱、即时通讯、身份证、手机、电话等基本身份信息及帐号信息进行提取。
二次提取为提取方式可采用正则表达式或者其它方式。并对每个提取出来的信息记录下在网页中的位置。
方法对出现邻近的身份信息进行关联。并记录出现次数以及上下文做为备注。
方法将所有身份信息展示在界面上,提示给用户进行标注。有效信息则标注为有效,并跟原始信息进行关联,保存相应的分析结果以备下次跟踪分析。
本方法能够极大的提高身份信息收集的效率,并防止人工搜索的疏漏。对情报工作的收集带来便利。
具体实施方式:
为使本发明的技术方案便于理解,以下结合具体实施方式对本发明作进一步的说明。
实施例:一种互联网人物搜索信息整合分析方法,该分析方法主要描述了完整的互联网人物搜索信息整合思路及步骤。通过原始的信息在互联网中查找相关的网页,并对网页进行人物身份信息和帐号信息的二次提取。再与原始信息进行关联进行迭代查找,最后到有相应真实身份信息的网站中提取进一步的身份轨迹。
原始的信息是提供输入界面给用户输入不完整的身份信息。
在互联网中查找相关的网页为系统根据当前身份信息在搜索引擎中进行检索,获取到原始的网页信息集合;系统遍历网页信息集合,对每篇网页进行邮箱、即时通讯、身份证、手机、电话等基本身份信息及帐号信息进行提取。
二次提取为提取方式可采用正则表达式或者其它方式。并对每个提取出来的信息记录下在网页中的位置。
方法对出现邻近的身份信息进行关联。并记录出现次数以及上下文做为备注。
方法将所有身份信息展示在界面上,提示给用户进行标注。有效信息则标注为有效,并跟原始信息进行关联,保存相应的分析结果以备下次跟踪分析。
本方法能够极大的提高身份信息收集的效率,并防止人工搜索的疏漏。对情报工作的收集带来便利。
以上所述,仅为本发明的较佳实施例,并非对本发明作任何形式上和实质上的限制,凡熟悉本专业的技术人员,在不脱离本发明技术方案范围内,当可利用以上所揭示的技术内容,而作出的些许更动、修饰与演变的等同变化,均为本发明的等效实施例;同时,凡依据本发明的实质技术对以上实施例所作的任何等同变化的更动、修饰与演变,均仍属于本发明的技术方案的范围内。

Claims (6)

1.一种互联网人物搜索信息整合分析方法,其特征在于:该分析方法主要描述了完整的互联网人物搜索信息整合思路及步骤。通过原始的信息在互联网中查找相关的网页,并对网页进行人物身份信息和帐号信息的二次提取。再与原始信息进行关联进行迭代查找,最后到有相应真实身份信息的网站中提取进一步的身份轨迹。
2.根据权利要求1所述的互联网人物搜索信息整合分析方法,其特征在于:所述原始的信息是提供输入界面给用户输入不完整的身份信息。
3.根据权利要求1所述的互联网人物搜索信息整合分析方法,其特征在于:所述在互联网中查找相关的网页为系统根据当前身份信息在搜索引擎中进行检索,获取到原始的网页信息集合;系统遍历网页信息集合,对每篇网页进行邮箱、即时通讯、身份证、手机、电话等基本身份信息及帐号信息进行提取。
4.根据权利要求1所述的互联网人物搜索信息整合分析方法,其特征在于:所述二次提取为提取方式可采用正则表达式或者其它方式。并对每个提取出来的信息记录下在网页中的位置。
5.根据权利要求1所述的互联网人物搜索信息整合分析方法,其特征在于:所述的方法对出现邻近的身份信息进行关联。并记录出现次数以及上下文做为备注
6.根据权利要求5所述的互联网人物搜索信息整合分析方法,其特征在于:所述的方法将所有身份信息展示在界面上,提示给用户进行标注。有效信息则标注为有效,并跟原始信息进行关联,保存相应的分析结果以备下次跟踪分析。
CN201210414936.XA 2012-10-26 2012-10-26 一种互联网人物搜索信息整合分析方法 Pending CN103778162A (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN201210414936.XA CN103778162A (zh) 2012-10-26 2012-10-26 一种互联网人物搜索信息整合分析方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN201210414936.XA CN103778162A (zh) 2012-10-26 2012-10-26 一种互联网人物搜索信息整合分析方法

Publications (1)

Publication Number Publication Date
CN103778162A true CN103778162A (zh) 2014-05-07

Family

ID=50570404

Family Applications (1)

Application Number Title Priority Date Filing Date
CN201210414936.XA Pending CN103778162A (zh) 2012-10-26 2012-10-26 一种互联网人物搜索信息整合分析方法

Country Status (1)

Country Link
CN (1) CN103778162A (zh)

Cited By (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN105630978A (zh) * 2015-12-25 2016-06-01 曙光信息产业(北京)有限公司 信息收集方法和装置
CN108009298A (zh) * 2017-12-27 2018-05-08 海口经济学院 一种互联网人物搜索信息整合分析控制方法
CN108984767A (zh) * 2018-07-20 2018-12-11 珠海宏桥高科技有限公司 一种虚拟身份核实的方法
WO2019184120A1 (zh) * 2018-03-29 2019-10-03 平安科技(深圳)有限公司 一种账户管理方法、装置、终端设备及存储介质

Citations (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN1687924A (zh) * 2005-04-28 2005-10-26 中国科学院计算技术研究所 互联网人物信息搜索引擎的生成方法
US20080016040A1 (en) * 2006-07-14 2008-01-17 Chacha Search Inc. Method and system for qualifying keywords in query strings
US20080021884A1 (en) * 2006-07-18 2008-01-24 Chacha Search, Inc Anonymous search system using human searchers
CN101493818A (zh) * 2008-01-24 2009-07-29 徐蔚 基于人际关系网络的网络信息搜索方法

Patent Citations (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN1687924A (zh) * 2005-04-28 2005-10-26 中国科学院计算技术研究所 互联网人物信息搜索引擎的生成方法
US20080016040A1 (en) * 2006-07-14 2008-01-17 Chacha Search Inc. Method and system for qualifying keywords in query strings
US20080021884A1 (en) * 2006-07-18 2008-01-24 Chacha Search, Inc Anonymous search system using human searchers
CN101493818A (zh) * 2008-01-24 2009-07-29 徐蔚 基于人际关系网络的网络信息搜索方法

Non-Patent Citations (2)

* Cited by examiner, † Cited by third party
Title
于满泉: "面向人物追踪的知识挖掘研究", 《中国博士学位论文全文数据库》 *
沈阳等: "社会性人物搜索研究", 《图书情报工作》 *

Cited By (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN105630978A (zh) * 2015-12-25 2016-06-01 曙光信息产业(北京)有限公司 信息收集方法和装置
CN108009298A (zh) * 2017-12-27 2018-05-08 海口经济学院 一种互联网人物搜索信息整合分析控制方法
CN108009298B (zh) * 2017-12-27 2021-08-31 海口经济学院 一种互联网人物搜索信息整合分析控制方法
WO2019184120A1 (zh) * 2018-03-29 2019-10-03 平安科技(深圳)有限公司 一种账户管理方法、装置、终端设备及存储介质
CN108984767A (zh) * 2018-07-20 2018-12-11 珠海宏桥高科技有限公司 一种虚拟身份核实的方法

Similar Documents

Publication Publication Date Title
CN102831220B (zh) 一种面向主题定制的新闻情报提取系统
CN102542061B (zh) 一种产品的智能分类方法
CN102779174B (zh) 一种舆情信息展示系统及方法
CN104462213A (zh) 一种基于大数据的用户行为分析方法及系统
CN105468744B (zh) 一种实现税务舆情分析和全文检索的大数据平台
CN103077190A (zh) 基于排序学习技术的热门事件排名方法
CN103778162A (zh) 一种互联网人物搜索信息整合分析方法
CN103150335A (zh) 一种基于联合聚类的煤矿舆情监测系统
CN103838796A (zh) 一种网页结构化信息抽取方法
CN103177076A (zh) 一种基于定点网站的舆情监测系统及方法
CN103838754A (zh) 信息搜索装置及方法
CN103744954A (zh) 一种词关联网模型的构建方法及其构建器
CN106372118A (zh) 面向大规模媒体文本数据的在线语义理解搜索系统及方法
CN102646124A (zh) 一种自动识别地址信息的方法
CN103778259A (zh) 基于Sqlite3实现智能手机数据恢复的方法
CN105528432A (zh) 一种数字资源热点生成方法及装置
CN103853746A (zh) 词库生成方法及其系统、输入法及输入系统
CN106529492A (zh) 面向网络查询基于多图融合视频主题分类与描述方法
CN104765823A (zh) 一种网站数据采集的方法及装置
Penedones et al. Improving object classification using pose information
Song The Sensitivity Analysis for Customer Feedback on Social Media
Furche et al. Automatically learning gazetteers from the deep Web
CN104239346A (zh) 一种基于搜索引擎的网站优化建设系统
CN106227746A (zh) 网络信息处理方法及系统
CN108228786A (zh) 一种整合分析互联网人物搜索信息的方法

Legal Events

Date Code Title Description
C06 Publication
PB01 Publication
C10 Entry into substantive examination
SE01 Entry into force of request for substantive examination
WD01 Invention patent application deemed withdrawn after publication
WD01 Invention patent application deemed withdrawn after publication

Application publication date: 20140507