CN104281697A - 一种基于语义的大数据分析系统 - Google Patents

一种基于语义的大数据分析系统 Download PDF

Info

Publication number
CN104281697A
CN104281697A CN201410545306.5A CN201410545306A CN104281697A CN 104281697 A CN104281697 A CN 104281697A CN 201410545306 A CN201410545306 A CN 201410545306A CN 104281697 A CN104281697 A CN 104281697A
Authority
CN
China
Prior art keywords
data
semantic
text
real
component
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
CN201410545306.5A
Other languages
English (en)
Inventor
贾岩
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
ANHUI HUAZHEN INFORMATION SCIENCE & TECHNOLOGY Co Ltd
Original Assignee
ANHUI HUAZHEN INFORMATION SCIENCE & TECHNOLOGY Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by ANHUI HUAZHEN INFORMATION SCIENCE & TECHNOLOGY Co Ltd filed Critical ANHUI HUAZHEN INFORMATION SCIENCE & TECHNOLOGY Co Ltd
Priority to CN201410545306.5A priority Critical patent/CN104281697A/zh
Publication of CN104281697A publication Critical patent/CN104281697A/zh
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/90Details of database functions independent of the retrieved data types
    • G06F16/95Retrieval from the web
    • G06F16/951Indexing; Web crawling techniques
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/30Semantic analysis

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Databases & Information Systems (AREA)
  • Data Mining & Analysis (AREA)
  • Health & Medical Sciences (AREA)
  • Artificial Intelligence (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Computational Linguistics (AREA)
  • General Health & Medical Sciences (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

本发明公开了一种基于语义的大数据分析系统,包括:数据采集入库部件,用于数据源头侦测、互联网数据采集和HTML预处理,并将第三方数据资源接入;实时数据流处理部件,用于数据流的实时处理;存储体系部件,用于存储Hadoop集群和mysql集群;底层支持部件,用于从文本中抽取语义信息,支持其他需要语义抽取、语义分析块,处理与文本检索、文本处理与语义搜索、文本处理相关的事务;业务层部件,用于具体业务执行、调度、展现的,与具体应用密切相关的应用集合。本发明实现基于web的大数据分析,不但精准度高、提供语义信息丰富,而且极具实用性和可产业化。

Description

一种基于语义的大数据分析系统
技术领域
本发明涉及数据网络技术领域,尤其涉及一种基于语义的大数据分析系统。
背景技术
在2012年早些时候,包括软件、硬件以及服务在内的大数据市场规模约为50亿美元。随着时间的推移,大数据的能量将逐步引起更多的关注,企业需要相关的分析能力以取得竞争优势进而改善运营效率,而相关的技术以及服务会相继部署,大数据市场规模将大幅壮大。目前市场上类似产品提供的系统的重心在于对企业的内部数据得分析,对于海量的来自web一些文本等非结构数据由于获取难度相对较大、单位价值相对较低等难点,其价值目前尚未被业充分开发和利用。
发明内容
为了解决背景技术中存在的技术问题,本发明提出了一种基于语义的大数据分析系统,实现基于web的大数据分析,不但精准度高、提供语义信息丰富,而且极具实用性和可产业化。
本发明提出的一种基于语义的大数据分析系统,包括:
数据采集入库部件,用于数据源头侦测、互联网数据采集和HTML预处理,并将第三方数据资源接入;
实时数据流处理部件,用于数据流的实时处理;
存储体系部件,用于存储Hadoop集群和mysql集群;
底层支持部件,用于从文本中抽取语义信息,支持其他需要语义抽取、语义分析块,处理与文本检索、文本处理与语义搜索、文本处理相关的事务;
业务层部件,用于具体业务执行、调度、展现的,与具体应用密切相关的应用集合。
优选地,所述数据采集入库部件包括:
分布式爬虫模块,用于数据源头侦测、互联网数据采集和HTML预处理;
数据源适配器,用于将第三方数据资源接入。
优选地,所述实时数据流处理部件包括:
临时存储模块,以集群的内存作为缓存环境,将实时采集到的数据临时存储起来,供有实时性要求的模块读取;
流数据钩子模块,提供实时数据处理模块挂载的钩子,基本机制为订阅-消费模型,当有数据到达,将数据的基本描述挂载起来,以便挂载到钩子系统的模块取阅。
优选地,所述实时数据流处理模块不保证数据的永久可读,超过一定时限后,数据将被清空,较老数据将不再可读,只能在永久存储体系中取阅。
优选地,
所述Hadoop集群用于大量网页数据的永久性存储和没有随机读写需求的分析结果;
所述mysql集群,用于存储运营数据、数据挖掘结果、语义分析结果。
优选地,所述底层支持部件包括:
语义信息提取模块,用于从文本中抽取语义信息,支持其他需要语义抽取、语义分析块;
语义搜索引擎,用于处理与文本检索、语义搜索引擎文本处理与语义搜索、文本处理相关的事务;
优选地,所述业务层部件具体用于报告生成、商业情报分析、舆情分析和数据业务。
本发明中,基于组合理论的类自然语言规则的文本语义处理系统,有效的解决了基于web的大数据分析问题,不但精准度高、提供语义信息丰富,而且极具实用性和可产业化等特点,因此市场前景非常广阔。本发明,通过研究中小型企业的特点及信息需求,从互联网大数据中提取、分析满足其需求的个性化的商机信息和情报分析服务,帮助其实现精准营销、洞察行业内及上下游产业的动态趋势、把握商机和规避风险、迅速做出科学的决策等方面的商业智能服务,产业化应用前景广阔。
附图说明
图1为本发明实施例提出的一种基于语义的大数据分析系统结构图。
具体实施方式
如图1所示,本发明实施例提出了一种基于语义的大数据分析系统,包括:数据采集入库部件10、实时数据流处理部件20、存储体系部件30、底层支持部件40和业务输出部件50。
数据采集入库部件10,包括:分布式爬虫模块11,用于数据源头侦测、互联网数据采集和HTML(HyperText Mark-up Language,超文本标记语言)预处理等方面的工作;数据源适配器12,用于将第三方数据资源的接入工作,例如客户指定的需要分析的数据,可通过数据源适配器介入到系统的处理流程。
实时数据流处理部件20,用于数据流的实时处理;包括临时存储模块21,以集群的内存作为缓存环境,将实时采集到的数据临时存储起来,供有实时性要求的模块读取;流数据钩子模块22,提供实时数据处理模块挂载的钩子,基本机制为订阅-消费模型,当有数据到达,钩子系统将数据的基本描述挂载起来,以便挂载到钩子系统的模块取阅。挂载到钩子系统的基本要求是数据处理速度够快,以免数据堵塞。另外,实时数据流处理模块不保证数据的永久可读,超过一定时限后(例如5分钟),数据将被清空,较老数据将不再可读,只能在永久存储体系中取阅。
存储体系部件30,包括Hadoop集群和mysql集群;其中,Hadoop集群负责大量网页数据的永久性存储,某些没有随机读写需求的分析结果也被存储于Hadoop;而mysql集群则存储运营数据、数据挖掘结果、语义分析结果等体积较小、需要经常随机读写的数据。
底层支持部件40,由语义信息提取模块41和42构成。其中,语义信息提取模块41,用于从文本中抽取语义信息,支持其他需要语义抽取、语义分析;语义搜索引擎42,用于处理与文本检索、文本处理等各类与语义搜索、文本处理等相关的事务;并且API模块均被集成至语义搜索引擎模块下,所以语义搜索引擎也被架构在此层。
业务层部件50,用于具体业务执行、调度、展现的,与具体应用密切相关的应用集合。其中,基本功能包括报告生成、商业情报分析、舆情分析和数据业务等。其中,精准营销是为精准营销所提供的数据搜集、分析和营销手段的技术支持等业务;数据业务,是为满足客户特定数据需求而开展的数据搜集和语义分析等方面业务;报告生成,是为客户生成简短的、概要性的、图文结合的概要的模块,支持定期自动生成和报告汇总和撰写;商业情报分析,包括招投标等商机信息、竞争对手分析,产业上下游动态和数据分析等具体业务。舆情分析主要包括话题跟踪、事件和人物的相关跟踪分析,也包括网评等网络舆情类数据搜集和集成分析。
本发明中,基于组合理论的类自然语言规则的文本语义处理系统,有效的解决了基于web的大数据分析问题,不但精准度高、提供语义信息丰富,而且极具实用性和可产业化等特点,因此市场前景非常广阔。本发明,通过研究中小型企业的特点及信息需求,从互联网大数据中提取、分析满足其需求的个性化的商机信息和情报分析服务,帮助其实现精准营销、洞察行业内及上下游产业的动态趋势、把握商机和规避风险、迅速做出科学的决策等方面的商业智能服务,产业化应用前景广阔。
以上所述,仅为本发明较佳的具体实施方式,但本发明的保护范围并不局限于此,任何熟悉本技术领域的技术人员在本发明揭露的技术范围内,根据本发明的技术方案及其发明构思加以等同替换或改变,都应涵盖在本发明的保护范围之内。

Claims (7)

1.一种基于语义的大数据分析系统,其特征在于,包括: 
数据采集入库部件,用于数据源头侦测、互联网数据采集和HTML预处理,并将第三方数据资源接入; 
实时数据流处理部件,用于数据流的实时处理; 
存储体系部件,用于存储Hadoop集群和mysql集群; 
底层支持部件,用于从文本中抽取语义信息,支持其他需要语义抽取、语义分析块,处理与文本检索、文本处理与语义搜索、文本处理相关的事务; 
业务层部件,用于具体业务执行、调度、展现的,与具体应用密切相关的应用集合。 
2.根据权利要求1所述的基于语义的大数据分析系统,其特征在于,所述数据采集入库部件包括: 
分布式爬虫模块,用于数据源头侦测、互联网数据采集和HTML预处理; 
数据源适配器,用于将第三方数据资源接入。 
3.根据权利要求1所述的基于语义的大数据分析系统,其特征在于,所述实时数据流处理部件包括: 
临时存储模块,以集群的内存作为缓存环境,将实时采集到的数据临时存储起来,供有实时性要求的模块读取; 
流数据钩子模块,提供实时数据处理模块挂载的钩子,基本机制为订阅-消费模型,当有数据到达,将数据的基本描述挂载起来,以便挂载到钩子系统的模块取阅。 
4.根据权利要求1或3所述的基于语义的大数据分析系统,其特征在于,所述实时数据流处理模块不保证数据的永久可读,超过一定时限后,数据将被清空,较老数据将不再可读,只能在永久存储体系中取阅。 
5.根据权利要求1所述的基于语义的大数据分析系统,其特征在于, 
所述Hadoop集群用于大量网页数据的永久性存储和没有随机读写需求的分析结果; 
所述mysql集群,用于存储运营数据、数据挖掘结果、语义分析结果。 
6.根据权利要求1所述的基于语义的大数据分析系统,其特征在于,所述底层支持部件包括: 
语义信息提取模块,用于从文本中抽取语义信息,支持其他需要语义抽取、语义分析块; 
语义搜索引擎,用于处理与文本检索、语义搜索引擎文本处理与语义搜索、文本处理相关的事务。 
7.根据权利要求1所述的基于语义的大数据分析系统,其特征在于,所述业务层部件具体用于报告生成、商业情报分析、舆情分析和数据业务。 
CN201410545306.5A 2014-10-15 2014-10-15 一种基于语义的大数据分析系统 Pending CN104281697A (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN201410545306.5A CN104281697A (zh) 2014-10-15 2014-10-15 一种基于语义的大数据分析系统

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN201410545306.5A CN104281697A (zh) 2014-10-15 2014-10-15 一种基于语义的大数据分析系统

Publications (1)

Publication Number Publication Date
CN104281697A true CN104281697A (zh) 2015-01-14

Family

ID=52256570

Family Applications (1)

Application Number Title Priority Date Filing Date
CN201410545306.5A Pending CN104281697A (zh) 2014-10-15 2014-10-15 一种基于语义的大数据分析系统

Country Status (1)

Country Link
CN (1) CN104281697A (zh)

Cited By (7)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN105320757A (zh) * 2015-10-19 2016-02-10 杭州华量软件有限公司 一种快速处理数据的商业智能分析方法
CN106777124A (zh) * 2016-05-26 2017-05-31 中科鼎富(北京)科技发展有限公司 语义认知方法、装置及系统
CN106934014A (zh) * 2017-03-10 2017-07-07 山东省科学院情报研究所 一种基于Hadoop的网络数据挖掘与分析平台及其方法
CN107220367A (zh) * 2017-06-09 2017-09-29 成都布林特信息技术有限公司 互联网数据全文搜索方法
CN107357905A (zh) * 2017-07-14 2017-11-17 郑州云海信息技术有限公司 一种数据处理方法及装置
CN107704622A (zh) * 2017-10-27 2018-02-16 成都艾薇尼尔信息技术有限公司 一种基于大数据分析的智能商业服务系统
CN112507227A (zh) * 2020-12-15 2021-03-16 北京中科智营科技发展有限公司 一种智能感知搜索平台

Citations (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN103399963A (zh) * 2013-08-26 2013-11-20 苏州国云数据科技有限公司 基于Hive的优化器优化方法
CN103473696A (zh) * 2013-09-03 2013-12-25 周吉 一种收集、分析和分发网络商业信息的方法和系统
CN103744854A (zh) * 2013-11-15 2014-04-23 北京正图数创信息技术有限公司 一种基于大数据仓储、挖掘技术的地址数据匹配挖掘平台
CN104182389A (zh) * 2014-07-21 2014-12-03 安徽华贞信息科技有限公司 一种基于语义的大数据分析商业智能服务系统

Patent Citations (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN103399963A (zh) * 2013-08-26 2013-11-20 苏州国云数据科技有限公司 基于Hive的优化器优化方法
CN103473696A (zh) * 2013-09-03 2013-12-25 周吉 一种收集、分析和分发网络商业信息的方法和系统
CN103744854A (zh) * 2013-11-15 2014-04-23 北京正图数创信息技术有限公司 一种基于大数据仓储、挖掘技术的地址数据匹配挖掘平台
CN104182389A (zh) * 2014-07-21 2014-12-03 安徽华贞信息科技有限公司 一种基于语义的大数据分析商业智能服务系统

Cited By (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN105320757A (zh) * 2015-10-19 2016-02-10 杭州华量软件有限公司 一种快速处理数据的商业智能分析方法
CN106777124A (zh) * 2016-05-26 2017-05-31 中科鼎富(北京)科技发展有限公司 语义认知方法、装置及系统
CN106934014A (zh) * 2017-03-10 2017-07-07 山东省科学院情报研究所 一种基于Hadoop的网络数据挖掘与分析平台及其方法
CN107220367A (zh) * 2017-06-09 2017-09-29 成都布林特信息技术有限公司 互联网数据全文搜索方法
CN107357905A (zh) * 2017-07-14 2017-11-17 郑州云海信息技术有限公司 一种数据处理方法及装置
CN107704622A (zh) * 2017-10-27 2018-02-16 成都艾薇尼尔信息技术有限公司 一种基于大数据分析的智能商业服务系统
CN112507227A (zh) * 2020-12-15 2021-03-16 北京中科智营科技发展有限公司 一种智能感知搜索平台
CN112507227B (zh) * 2020-12-15 2024-03-01 北京中科智营科技发展有限公司 一种智能感知搜索平台

Similar Documents

Publication Publication Date Title
CN104281697A (zh) 一种基于语义的大数据分析系统
Khan et al. The 51 v's of big data: survey, technologies, characteristics, opportunities, issues and challenges
Das et al. Big data analytics: A framework for unstructured data analysis
CN104182389B (zh) 一种基于语义的大数据分析商业智能服务系统
CN104036025A (zh) 一种基于分布式的海量日志采集系统
KR102593171B1 (ko) 정보 처리 방법, 장치, 전자 기기 및 저장 매체
CN103440288A (zh) 一种大数据存储方法及装置
CN103699611A (zh) 一种基于动态摘要技术的微博流信息提取方法
CN103235811A (zh) 一种数据存储方法及装置
CN109190025A (zh) 信息监控方法、装置、系统和计算机可读存储介质
Suriarachchi et al. Big provenance stream processing for data intensive computations
CN110727700A (zh) 多源流式数据整合成事务型流数据的方法及系统
Kim et al. Customer preference analysis based on SNS data
Nazeer et al. Real-time text analytics pipeline using open-source big data tools
Chowdhury et al. Crime monitoring from newspaper data based on sentiment analysis
CN111049898A (zh) 一种实现计算集群资源跨域架构的方法及系统
Arshi Saloot et al. Real-time Text Stream Processing: A Dynamic and Distributed NLP Pipeline
CN102567803B (zh) 基于赋优先级事件图的复杂事件调度系统及方法
Lv et al. A real-time log analyzer based on MongoDB
CN103218210B (zh) 适于大数据高并发访问的文件级分条系统
Thiyagarajan et al. Isolating values from big data with the help of four V’S
Dawei et al. Exploration on big data oriented data analyzing and processing technology
Fen et al. Research on internet hot topic detection based on MapReduce architecture
Deshmukh et al. DESIGN AND DEVELOPMENT OF AN EFFICIENT XML PARSING ALGORITHM: A REVIEW
Dani et al. A Novel Approach for Classification of Real Time Data Stream to Reduce Query Processing Time

Legal Events

Date Code Title Description
C06 Publication
PB01 Publication
EXSB Decision made by sipo to initiate substantive examination
SE01 Entry into force of request for substantive examination
RJ01 Rejection of invention patent application after publication
RJ01 Rejection of invention patent application after publication

Application publication date: 20150114