CN111538886A - 一种基于人工智能的大数据采集存储系统及方法 - Google Patents

一种基于人工智能的大数据采集存储系统及方法 Download PDF

Info

Publication number
CN111538886A
CN111538886A CN202010361774.2A CN202010361774A CN111538886A CN 111538886 A CN111538886 A CN 111538886A CN 202010361774 A CN202010361774 A CN 202010361774A CN 111538886 A CN111538886 A CN 111538886A
Authority
CN
China
Prior art keywords
data
big data
capturing
grabbing
storage
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
CN202010361774.2A
Other languages
English (en)
Other versions
CN111538886B (zh
Inventor
不公告发明人
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Pingxiang Anyuan Digital Investment Co ltd
Original Assignee
Guangdong Suneng Network Co ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Guangdong Suneng Network Co ltd filed Critical Guangdong Suneng Network Co ltd
Priority to CN202010361774.2A priority Critical patent/CN111538886B/zh
Publication of CN111538886A publication Critical patent/CN111538886A/zh
Application granted granted Critical
Publication of CN111538886B publication Critical patent/CN111538886B/zh
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Images

Classifications

    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/90Details of database functions independent of the retrieved data types
    • G06F16/95Retrieval from the web
    • G06F16/951Indexing; Web crawling techniques
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/90Details of database functions independent of the retrieved data types
    • G06F16/95Retrieval from the web
    • G06F16/953Querying, e.g. by the use of web search engines
    • G06F16/9536Search customisation based on social or collaborative filtering
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/90Details of database functions independent of the retrieved data types
    • G06F16/95Retrieval from the web
    • G06F16/955Retrieval from the web using information identifiers, e.g. uniform resource locators [URL]
    • YGENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
    • Y02TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
    • Y02DCLIMATE CHANGE MITIGATION TECHNOLOGIES IN INFORMATION AND COMMUNICATION TECHNOLOGIES [ICT], I.E. INFORMATION AND COMMUNICATION TECHNOLOGIES AIMING AT THE REDUCTION OF THEIR OWN ENERGY USE
    • Y02D10/00Energy efficient computing, e.g. low power processors, power management or thermal management

Abstract

本发明属于大数据技术领域,公开了一种基于人工智能的大数据采集存储系统及方法,包括以下步骤:利用所能大数据管理平台获取指定公开全网站的网络公开资源,利用大数据抓取网络信息,具备分布式抓取,意外断开后智能抓取,反抓取,智能判断时间,智能防重,定期抓取及持续抓取等方法,精准完整得获取网络信息,最后把抓取的数据都分布式存储到hbase、MongoDB、elasticsearch中以此解决千万级的数据处理,大大提升了大数据采集效率以及减少大数据采集过程中技术人员的工作量。

Description

一种基于人工智能的大数据采集存储系统及方法
技术领域
本发明属于大数据技术领域,公开了一种基于人工智能的大数据采集存储系统及方法。
背景技术
随着信息化时代的到来,云计算技术、数字技术、互联网技术等获得了进一步的发展和应用,信息产业的竞争力也在不断的加剧,对大企业而言,大数据的兴起部分是因为计算能力可用更低的成本获得,且各类系统如今已能够执行多任务处理。其次,内存的成本也在直线下降,企业可以在内存中处理比以往更多的数据,还有就是把计算机聚合成服务器集群越来越简单,把那些具有潜在价值,可以给商业带来巨大利润,但是需要经过复杂处理的数据信息,因此本申请提出所能人工智能大数据采集存储系统及方法,充分利用数据信息进行分析及利用。
发明内容
针对上述的传统管理平台缺陷,本发明的目的是提供一种基于人工智能的大数据采集存储系统及方法,其包括大数据管理平台、大数据抓取及方法、大数据存储及方法。
大数据管理平台对大数据抓取和大数据存储进行数据管理及方法管理;
所述的大数据抓取用于公开全网站抓取,分别通过百度、搜狗、360、微博、微信及其他公开全网站的公开数据进行抓取;
进一步的,所述大数据存储基于大数据抓取的数据进行数据存储,用分布式进行数据存储;
本发明提供一种大数据抓取方法,包括步骤如下:
①分布式抓取:利用分布式原理搭建分布式方法进行分布式智能抓取;
②意外断开后接着抓取:因特殊原因导致系统意外断开,当重新连接后能有效的接着上次抓取的数据继续抓取剩余的信息,防止特殊情况带来的损失;
③能反抓取:具有了自我管理和学习进步的能力,能够针对现有的知识进行快速的学习并且进行后续改进防止别人进行抓取;
④时间判断:每天抓取的内容都不一样,通过时间判断能有效的抓取当前的数据,过滤掉昨天以前的数据;
⑤防止重复抓取:各个公开全网站及各个页面的数据有可能是完全一样的,为了避免重复数据的的出现,需对数据标题及内容进行分析再抓取,避免出现重复抓取,减少资源消耗;
⑥关键词抓取:通过关键词进行数据抓取,能精准有效的抓取网络公开数据;
⑦定期和持续抓取:定期抓取就是在一定的时间内进行数据抓取,过了这段时间将不再进行抓取,持续抓取将一直保持数据抓取;
⑧记忆采集点:人工智能记忆法,只要采集过的公开全网站,就像人的记忆一样能智能识别并且准确的进行采集所需数据,智能过滤没用的数据,只保留图文信息,在采集过程中因意外导致停止工作时,能有效的记住采集进度,当重新工作时能接着完成未完成的工作。
⑨自动分析归类:自动分析过滤广告等没用的信息,存储所需的图文信息;自动分析生产采集规则,智能抓取各个公开全网站的图文信息;自动分析纠正,能够智能学习人工纠错的内容,使准确率越来越精准。
本发明提供一种数据存储的方法,包括步骤如下:
①利用分布式文件系统:hdfs为管理大数据资源池和支撑相关大数据分析应用提供了一个具有高可靠性的工具,为分布式数据库做好铺垫;
②分布式数据库:hbase、mongodb、elasticsearch充分利用它们的存储原理将抓取过滤过的数据进行存储;
③分布式内存存储:redis缓存,使平台保证访问速度的同时减少数据库的访问;
与现有技术相比,本发明具有的明显优点与效果:本发明属于大数据技术领域,公开了一种基于人工智能的大数据采集存储系统及方法,包括以下步骤:利用所能大数据管理平台获取指定公开全网站的网络公开资源,利用大数据抓取网络信息,具备分布式抓取,意外断开后智能抓取,反抓取,智能判断时间,智能防重,定期抓取及持续抓取等方法,精准完整得获取网络信息,最后把抓取的数据都分布式存储到hbase、MongoDB、elasticsearch中以此解决千万级的数据处理,大大提升了大数据采集效率以及减少大数据采集过程中技术人员的工作量。
附图说明
下面结合附图和具体实施例对本发明作进一步详细描述。
图1是本发明的所能人工智能大数据采集存储系统构成图;
其中,附图标记为:大数据管理平台模块1、大数据抓取模块2及大数据存储模块3;
图2是流程图
具体实施方式
下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有作出创造性劳动前提下所获得的所有其它实施例,都属于本发明保护的范围。
如图1所示,实现本发明技术方案如下:一种基于人工智能的大数据采集存储系统及方法,其包括大数据管理平台、大数据抓取及方法、大数据存储及方法;
大数据管理平台对大数据抓取和大数据存储进行数据管理及方法管理;
所述的大数据抓取用于公开全网站抓取,分别通过百度、搜狗、360、微博、微信及其他公开全网站的公开数据进行抓取;
进一步的,所述大数据存储基于大数据抓取的数据进行数据存储,用分布式进行数据存储;
本发明提供一种大数据抓取方法,包括步骤如下:
①分布式抓取:利用分布式原理搭建分布式方法进行分布式抓取;
②意外断开后接着抓取:因特殊原因导致系统意外断开,当重新连接后能有效的接着上次抓取的数据继续抓取剩余的信息,防止特殊情况带来的损失;
③能反抓取:具有了自我管理和学习进步的能力,能够针对现有的知识进行快速的学习并且进行后续改进防止别人进行抓取;
④时间判断:每天抓取的内容都不一样,通过时间判断能有效的抓取当前的数据,过滤掉昨天以前的数据;
⑤防止重复抓取:各个公开全网站及各个页面的数据有可能是完全一样的,为了避免重复数据的的出现,需对数据标题及内容进行分析再抓取,避免出现重复抓取,减少资源消耗;
⑥关键词抓取:通过关键词进行数据抓取,能精准有效的抓取网络公开数据;
⑦定期和持续抓取:定期抓取就是在一定的时间内进行数据抓取,过了这段时间将不再进行抓取,持续抓取将一直保持数据抓取;
⑧记忆采集点:人工智能记忆法,只要采集过的公开全网站,就像人的记忆一样能智能识别并且准确的进行采集所需数据,智能过滤没用的数据,只保留图文信息,在采集过程中因意外导致停止工作时,能有效的记住采集进度,当重新工作时能接着完成未完成的工作。
⑨自动分析归类:自动分析过滤广告等没用的信息,存储所需的图文信息;自动分析生产采集规则,智能抓取各个公开全网站的图文信息;自动分析纠正,能够智能学习人工纠错的内容,使准确率越来越精准。
本发明提供一种数据存储的方法,包括步骤如下:
①利用分布式文件系统:hdfs为管理大数据资源池和支撑相关大数据分析应用提供了一个具有高可靠性的工具,为分布式数据库做好铺垫;
②分布式数据库:hbase、mongodb、elasticsearch充分利用它们的存储原理将抓取过滤过的数据进行存储;
③分布式内存存储:redis缓存,使平台保证访问速度的同时减少数据库的访问;
与现有技术相比,本发明具有的明显优点与效果:本发明属于大数据技术领域,公开了一种基于人工智能的大数据采集存储系统及方法,包括以下步骤:利用所能大数据管理平台获取指定公开全网站的网络公开资源,利用大数据抓取网络信息,具备分布式抓取,意外断开后智能抓取,反抓取,智能判断时间,智能防重,定期抓取及持续抓取等方法,精准完整得获取网络信息,最后把抓取的数据都分布式存储到hbase、MongoDB、elasticsearch中以此解决千万级的数据处理,大大提升了大数据采集效率以及减少大数据采集过程中技术人员的工作量。
为了描述的方便,描述以上装置时以功能分为各种单元、模块分别描述。当然,在实施本申请时可以把各单元、模块的功能在同一个或多个软件和/或硬件中实现。通过以上的实施方式的描述可知,本领域的技术人员可以清楚地了解到本申请可借助软件加必需的通用硬件平台的方式来实现。基于这样的理解,本申请的技术方案本质上或者说对现有技术做出贡献的部分可以以软件产品的形式体现出来,该计算机软件产可以存储在存储介质中,如 ROM/RAM、磁碟、光盘等,包括若干指令用以使得一台计算机设备 (可以是个人计算机,服务器,或者网络设备等)执行本申请各个实施方式或者实施方式的某些部分所述的方法。
以上所描述的装置实施方式仅仅是示意性的,其中所述作为分离部件说明的单元可以是或者也可以不是物理上分开的,作为单元显示的部件可以是或者也可以不是物理单元,即可以位于一个地方,或者也可以分布到多个网络单元上。可以根据实际的需要选择其中的部分或者全部模块来实现本实施方式方案的目的。本领域普通技术人员在不付出创造性劳动的情况下,即可以理解并实施。
本申请可用于众多通用或专用的计算系统环境或配置中。例如:个人计算机、服务器计算机、手持设备或便携式设备、平板型设备、多处理器系统、基于微处理器的系统、置顶盒、可编程的消费电子设备、网络 PC、小型计算机、大型计算机、包括以上任何系统或设备的分布式计算环境等等。本申请可以在由计算机执行的计算机可执行指令的一般上下文中描述,例如程序模块。一般地,程序模块包括执行特定任务或实现特定抽象数据类型的例程、程序、对象、组件、数据结构等等。也可以在分布式计算环境中实践本申请,在这些分布式计算环境中,由通过通信网络而被连接的远程处理设备来执行任务。在分布式计算环境中,程序模块可以位于包括存储设备在内的本地和远程计算机存储介质中。在本说明书的描述中,参考术语“一个实施例”、“示例”、“具体示例”等的描述意指结合该实施例或示例描述的具体特征、结构、材料或者特点包含于本发明的至少一个实施例或示例中。在本说明书中,对上述术语的示意性表述不一定指的是相同的实施例或示例。而且,描述的具体特征、结构、材料或者特点可以在任何的一个或多个实施例或示例中以合适的方式结合。
以上内容仅仅是对本发明结构所作的举例和说明,所属本技术领域的技术人员对所描述的具体实施例做各种各样的修改或补充或采用类似的方式替代,只要不偏离发明的结构或者超越本权利要求书所定义的范围,均应属于本发明的保护范围。

Claims (4)

1.一种基于人工智能的大数据采集存储系统及方法,其包括大数据管理平台、大数据抓取及方法、大数据存储及方法;
大数据管理平台对大数据抓取和大数据存储进行数据管理及方法管理;
所述的大数据抓取用于全网抓取公开数据,包括但不限于百度、搜狗、360、微博、微信及其他网站的公开数据进行抓取;
进一步的,所述大数据存储基于大数据抓取的数据进行数据存储,用分布式进行数据存储;
本发明提供一种大数据抓取方法,包括步骤如下:
①分布式抓取:利用分布式原理搭建分布式方法进行分布式抓取;
②意外断开后从断点续抓:因特殊原因导致系统意外断开,当重新连接后能有效的接着上次抓取的数据继续抓取剩余的信息,防止特殊情况带来的损失;
③能反抓取:具有了自我管理和学习进步的能力,能够针对现有的知识进行快速的学习并且进行后续改进防止别人进行抓取;
④时间判断:每天抓取的内容都不一样,通过时间判断能有效的抓取当前的数据,过滤掉昨天以前的数据;
⑤防止重复抓取:各个公开全网站及各个页面的数据有可能是完全一样的,为了避免重复数据的的出现,需对数据标题及内容进行分析再抓取,避免出现重复抓取,减少资源消耗;
⑥关键词抓取:通过关键词进行数据抓取,能精准有效的抓取网络公开数据;
⑦定期和持续抓取:定期抓取就是在一定的时间内进行数据抓取,过了这段时间将不再进行抓取,持续抓取将一直保持数据抓取;
⑧记忆采集点:人工智能记忆法,只要采集过的网站,就像人的记忆一样能智能识别并且准确的进行采集所需数据,智能过滤没用的数据,只保留图文信息,在采集过程中因意外导致停止工作时,能有效的记住采集进度,当重新工作时能接着完成未完成的工作;
⑨自动分析归类:自动分析过滤广告等没用的信息,存储所需的图文信息;自动分析生产采集规则,智能抓取各个公开全网站的图文信息;自动分析纠正,能够智能学习人工纠错的内容,使准确率越来越精准;
本发明提供一种数据存储的方法,包括步骤如下:
①利用分布式文件系统:hdfs为管理大数据资源池和支撑相关大数据分析应用提供了一个具有高可靠性的工具,为分布式数据库做好铺垫;
②分布式数据库:hbase、mongodb、elasticsearch充分利用它们的存储原理将抓取过滤过的数据进行存储;
③分布式内存存储:redis缓存,使平台保证访问速度的同时减少数据库的访问;
与现有技术相比,本发明具有的明显优点与效果:本发明属于大数据技术领域,公开了一种基于人工智能的大数据采集存储系统及方法,包括以下步骤:利用所能大数据管理平台获取指定公开全网站的网络公开资源,利用大数据抓取网络信息,具备分布式抓取,意外断开后智能抓取,反抓取,智能判断时间,智能防重,定期抓取及持续抓取等方法,精准完整得获取网络信息,最后把抓取的数据都分布式存储到hbase、MongoDB、elasticsearch中以此解决千万级的数据处理,大大提升了大数据采集效率以及减少大数据采集过程中技术人员的工作量。
2.根据权利需求1所述的一种基于人工智能的大数据采集存储系统及方法,其特征在于:所述大数据管理模块用于对用户操作管理过程中存在异常行为进行判定,以识别异常用户,并将异常用户的账号进行安全控制。
3.根据权利要求2所述的一种基于人工智能的大数据采集存储系统及方法,其特征在于:所述的大数据抓取过程中存在并发中出现的异常进行判定,以识别出异常数据,并将异常数据进行安全控制。
4.根据权利需求3所述的一种基于人工智能的大数据采集存储系统及方法,其特征在于:所述的数据存储模块,用于对数据存储过程中出现的异常数据进行判定,以识别出异常存储数据,并将异常存储数据进行安全控制。
CN202010361774.2A 2020-04-30 2020-04-30 一种基于人工智能的大数据采集存储系统及方法 Active CN111538886B (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN202010361774.2A CN111538886B (zh) 2020-04-30 2020-04-30 一种基于人工智能的大数据采集存储系统及方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN202010361774.2A CN111538886B (zh) 2020-04-30 2020-04-30 一种基于人工智能的大数据采集存储系统及方法

Publications (2)

Publication Number Publication Date
CN111538886A true CN111538886A (zh) 2020-08-14
CN111538886B CN111538886B (zh) 2024-04-19

Family

ID=71979020

Family Applications (1)

Application Number Title Priority Date Filing Date
CN202010361774.2A Active CN111538886B (zh) 2020-04-30 2020-04-30 一种基于人工智能的大数据采集存储系统及方法

Country Status (1)

Country Link
CN (1) CN111538886B (zh)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN112445958A (zh) * 2020-11-18 2021-03-05 厦门物之联智能科技有限公司 一种基于人工智能的大数据采集存储系统及方法

Citations (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN103248625A (zh) * 2013-04-27 2013-08-14 北京京东尚科信息技术有限公司 一种网络爬虫运行异常监控方法和系统
CN104077402A (zh) * 2014-07-04 2014-10-01 用友软件股份有限公司 数据处理方法和数据处理系统
CN106886518A (zh) * 2015-12-15 2017-06-23 国家计算机网络与信息安全管理中心 一种微博账号分类的方法
WO2017117595A1 (en) * 2015-12-31 2017-07-06 Fractal Industries, Inc. Distributed system for large volume deep web data extraction

Patent Citations (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN103248625A (zh) * 2013-04-27 2013-08-14 北京京东尚科信息技术有限公司 一种网络爬虫运行异常监控方法和系统
CN104077402A (zh) * 2014-07-04 2014-10-01 用友软件股份有限公司 数据处理方法和数据处理系统
CN106886518A (zh) * 2015-12-15 2017-06-23 国家计算机网络与信息安全管理中心 一种微博账号分类的方法
WO2017117595A1 (en) * 2015-12-31 2017-07-06 Fractal Industries, Inc. Distributed system for large volume deep web data extraction

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
王仕艳: "云环境中Web信息抓取技术的研究及应用", 《通信电源技术》 *

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN112445958A (zh) * 2020-11-18 2021-03-05 厦门物之联智能科技有限公司 一种基于人工智能的大数据采集存储系统及方法

Also Published As

Publication number Publication date
CN111538886B (zh) 2024-04-19

Similar Documents

Publication Publication Date Title
US9009850B2 (en) Database management by analyzing usage of database fields
CN205247194U (zh) 一种自动控制智能专家故障诊断系统
CN107748782A (zh) 查询语句处理方法及装置
CN113836131A (zh) 一种大数据清洗方法、装置、计算机设备及存储介质
CN114648393A (zh) 一种应用于招投标的数据挖掘方法、系统及设备
CN113468159A (zh) 一种数据应用全链路管控方法及系统
CN114021156A (zh) 漏洞自动化聚合的整理方法、装置、设备以及存储介质
CN112287275A (zh) 一种城市级数据中台
CN114968727A (zh) 基于人工智能运维的数据库贯穿基础设施的故障定位方法
CN111538886B (zh) 一种基于人工智能的大数据采集存储系统及方法
CN106817262A (zh) 一种日志分析装置
CN106649034B (zh) 一种可视化智能运维方法及平台
CN115686280A (zh) 深度学习模型管理系统、方法、计算机设备及存储介质
CN109150603A (zh) 云服务端自动扩容方法及装置
CN113065580A (zh) 一种基于多信息融合的电厂设备管理方法及系统
CN111046059B (zh) 基于分布式数据库集群的低效sql语句分析方法及系统
CN109886434B (zh) 一种智能钻井平台维护保养系统及方法
CN116644136A (zh) 一种增量和全量数据的数据采集方法、装置、设备及介质
CN111538887B (zh) 一种基于人工智能的大数据图文识别系统及方法
Nashivochnikov et al. The system for operational monitoring and analytics of industry cyber-physical systems security in fuel and energy domains based on anomaly detection and prediction methods
CN109977700A (zh) 一种基于网络安全的大数据处理系统
CN112711508A (zh) 面向大规模客户端系统的智能运维服务系统
CN113505167A (zh) 一种链路预测关系推荐的用户数据预处理系统
Wu et al. Cluster based detection and analysis of internet topics
Fang et al. Research on computer information processing technology in the “big data” era

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination
TA01 Transfer of patent application right
TA01 Transfer of patent application right

Effective date of registration: 20240325

Address after: Room 902, Anyuan Building, No. 217 Ping'an Middle Avenue, Anyuan District, Pingxiang City, Jiangxi Province, 337000

Applicant after: Pingxiang Anyuan Digital Investment Co.,Ltd.

Country or region after: China

Address before: B410, Building 9, Foshan New Media Industrial Park, No. 5-13 Wuhua Road, Zhangcha Street, Chancheng District, Foshan City, Guangdong Province, 528000

Applicant before: Guangdong suneng Network Co.,Ltd.

Country or region before: China

GR01 Patent grant
GR01 Patent grant