CN113312416B - 一种跨数据中心的etl工具 - Google Patents

一种跨数据中心的etl工具 Download PDF

Info

Publication number
CN113312416B
CN113312416B CN202110552855.5A CN202110552855A CN113312416B CN 113312416 B CN113312416 B CN 113312416B CN 202110552855 A CN202110552855 A CN 202110552855A CN 113312416 B CN113312416 B CN 113312416B
Authority
CN
China
Prior art keywords
data
cleaning
module
task
data center
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
CN202110552855.5A
Other languages
English (en)
Other versions
CN113312416A (zh
Inventor
兰波
莫加龙
万乐园
张鼎浩
张�杰
龚连胜
杜在乾
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Chengdu Meierbei Technology Co ltd
Original Assignee
Chengdu Meierbei Technology Co ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Chengdu Meierbei Technology Co ltd filed Critical Chengdu Meierbei Technology Co ltd
Priority to CN202110552855.5A priority Critical patent/CN113312416B/zh
Publication of CN113312416A publication Critical patent/CN113312416A/zh
Application granted granted Critical
Publication of CN113312416B publication Critical patent/CN113312416B/zh
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Images

Classifications

    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/20Information retrieval; Database structures therefor; File system structures therefor of structured data, e.g. relational data
    • G06F16/25Integrating or interfacing systems involving database management systems
    • G06F16/254Extract, transform and load [ETL] procedures, e.g. ETL data flows in data warehouses
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/20Information retrieval; Database structures therefor; File system structures therefor of structured data, e.g. relational data
    • G06F16/21Design, administration or maintenance of databases
    • G06F16/215Improving data quality; Data cleansing, e.g. de-duplication, removing invalid entries or correcting typographical errors
    • YGENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
    • Y02TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
    • Y02DCLIMATE CHANGE MITIGATION TECHNOLOGIES IN INFORMATION AND COMMUNICATION TECHNOLOGIES [ICT], I.E. INFORMATION AND COMMUNICATION TECHNOLOGIES AIMING AT THE REDUCTION OF THEIR OWN ENERGY USE
    • Y02D10/00Energy efficient computing, e.g. low power processors, power management or thermal management

Landscapes

  • Engineering & Computer Science (AREA)
  • Databases & Information Systems (AREA)
  • Theoretical Computer Science (AREA)
  • Data Mining & Analysis (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Quality & Reliability (AREA)
  • Management, Administration, Business Operations System, And Electronic Commerce (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

本发明公开了一种跨数据中心的ETL工具,包括任务调度模块、数据清洗模块、上传模块和存储模块,其中:所述任务调度模块,用于创建需要清洗的任务,并将任务存储在第一数据中心的数据库中;所述数据清洗模块,获取第一数据中心的数据库中需要清洗的任务的计划,拆分任务中的结构化数据和非结构化数据;所述上传模块,用于获取任务中结构化数据推送到第一数据中心的redis队列中进行清洗和入库,用于获取任务中的非结构化数据推送到第二数据中心的redis队列中进行清洗;所述存储模块,用于获取第二数据中心清洗的数据存储到第三数据中心的数据库;提高清洗的效率和稳定性,根据不同的数据中心的产品价格优势,降低使用成本。

Description

一种跨数据中心的ETL工具
技术领域
本发明属于数据的抽取、转换和加载技术领域,涉及一种跨数据中心的ETL工具。
背景技术
通常ETL的整个流程中都是在同一个数据中心(如一个公有云服务商)完成对数据的抽取(extract)、转换(transform)和加载(load)。不同的数据中心优缺点存在差异,有的公有云服务商的带宽下行流量和上行流量都将收费,有的公有云服务商的宽带仅收取上线流量费用,带宽无大小上限限制,有的公有云服务商存储价格相对较低。
目前,数据的抽取、转换和加载通常在一个数据中心完成,在价格和效率之间不能进行有效平衡。
发明内容
本发明的目的在于:提供了一种跨数据中心的ETL工具,解决了数据的抽取、转换和加载通常在一个数据中心完成,在价格和效率之间不能进行有效平衡的问题。
本发明采用的技术方案如下:
一种跨数据中心的ETL工具,包括任务调度模块、数据清洗模块、上传模块和存储模块,其中:
所述任务调度模块,用于创建需要清洗的任务,并将任务存储在第一数据中心的数据库中;
所述数据清洗模块,获取第一数据中心的数据库中需要清洗的任务的计划,拆分任务中的结构化数据和非结构化数据;
所述上传模块,用于获取任务中结构化数据推送到第一数据中心的redis队列中进行清洗和入库,用于获取任务中的非结构化数据推送到第二数据中心的redis队列中进行清洗;
所述存储模块,用于获取第二数据中心清洗的数据存储到第三数据中心的数据库。
进一步地,所述任务调度模块为定时或固定间隔时间创建需要清洗的任务。
进一步地,所述非结构化数据包括图片或/和视频或/和音频。
综上所述,由于采用了上述技术方案,本发明的有益效果是:
本发明一种跨数据中心的ETL工具,充分利用不同数据中心的特性和价格,将非结构化数据和结构化数据分拆再分别清洗,通过在不同的数据中心上联合作用,提高清洗的效率和稳定性,根据不同的数据中心的产品价格优势,降低使用成本。
附图说明
为了更清楚地说明本发明实施例的技术方案,下面将对实施例中所需要使用的附图作简单地介绍,应当理解,以下附图仅示出了本发明的某些实施例,因此不应被看作是对范围的限定,对于本领域普通技术人员来讲,在不付出创造性劳动的前提下,还可以根据这些附图获得其他相关的附图,其中:
图1是本发明的框架示意图;
图2是本发明的流程示意图。
具体实施方式
为了使本发明的目的、技术方案及优点更加清楚明白,以下结合附图及实施例,对本发明进行进一步详细说明。应当理解,此处所描述的具体实施例仅用以解释本发明,并不用于限定本发明,即所描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。通常在此处附图中描述和示出的本发明实施例的组件可以以各种不同的配置来布置和设计。
因此,以下对在附图中提供的本发明的实施例的详细描述并非旨在限制要求保护的本发明的范围,而是仅仅表示本发明的选定实施例。基于本发明的实施例,本领域技术人员在没有做出创造性劳动的前提下所获得的所有其他实施例,都属于本发明保护的范围。
需要说明的是,术语“第一”和“第二”等之类的关系术语仅仅用来将一个实体或者操作与另一个实体或操作区分开来,而不一定要求或者暗示这些实体或操作之间存在任何这种实际的关系或者顺序。而且,术语“包括”、“包含”或者其任何其他变体意在涵盖非排他性的包含,从而使得包括一系列要素的过程、方法、物品或者设备不仅包括那些要素,而且还包括没有明确列出的其他要素,或者是还包括为这种过程、方法、物品或者设备所固有的要素。在没有更多限制的情况下,由语句“包括一个……”限定的要素,并不排除在包括所述要素的过程、方法、物品或者设备中还存在另外的相同要素。
实施例
如图1所示,本发明实施例提供的一种跨数据中心的ETL工具,包括任务调度模块、数据清洗模块、上传模块和存储模块,其中:
所述任务调度模块,用于创建需要清洗的任务,并将任务存储在第一数据中心的数据库中;
所述数据清洗模块,获取第一数据中心的数据库中需要清洗的任务的计划,拆分任务中的结构化数据和非结构化数据;
所述上传模块,用于获取任务中结构化数据推送到第一数据中心的redis队列中进行清洗和入库,用于获取任务中的非结构化数据推送到第二数据中心的redis队列中进行清洗;
所述存储模块,用于获取第二数据中心清洗的数据存储到第三数据中心的数据库。
本发明:第一数据中心为用户常用,迁移的成本相对来说比较高,不适合迁移。第一数据中心处理非结构化数据的效率不理想,此时,可以通过任务调度模块创建需要清洗的任务,并将任务存储在第一数据中心的数据库中,清洗模块获取需要清洗的任务并拉取原数据,然后将元数据拆分为结构化数据和非结构化数据,结构化数据的处理对带宽要求不高,因此在第一数据中心进行清洗和入库即可,非结构化数据对带宽的要求较高,因此通过上传模块将非结构化数据上传到第二数据中心的edis队列中进行清洗,清洗完成后通过存储模块将非结构化数据存储到第三数据中心的数据库进行存储,第三数据中心相较于第一数据中心和第二数据中心存储的费用最低。第一数据中心处理非结构化数据的效率较为理想,带宽费用也不是很高时,则可以省略第二数据中心,可以通过任务调度模块创建需要清洗的任务,并将任务存储在第一数据中心的数据库中,清洗模块获取需要清洗的任务并拉取原数据,然后将元数据拆分为结构化数据和非结构化数据后通过第一数据中心进行清洗,结构化数据进行清洗和入库即可,非结构化数据进行清洗后通过存储模块存储到第三数据中心的数据库。需要说明的是,存储到第三数据中心的非结构化数据与存储到第一数据中心的结构化数据之间相互关联。充分利用不同数据中心的特性和价格,将非结构化数据和结构化数据分拆再分别清洗,通过在不同的数据中心上联合作用,提高清洗的效率和稳定性,根据不同的数据中心的产品价格优势,降低使用成本。
优选地,所述任务调度模块为定时或固定间隔时间创建需要清洗的任务。实施时,便于根据需要实际需求创建需要清洗的任务。
其中,所述非结构化数据包括图片或/和视频或/和音频。
本实施例中,如图2所示,以图片为例,调度任务模块即图中的调度任务器发起清洗的任务,Master节点建任务记录在公有云服务商3(第一数据中心)的数据库。清洗模块即图中的清洗Job获取需要清洗的任务计划,对爬虫更新入库的数据进行数据拆分,将图片单独从数据库中分离出来,并推送到其公有云服务商1(第二数据中心)的redis队列中。上传模块即图中的图片上传程序获取redis队列imgUploadTask中的任务,开始上传图片,上传完成后将图片缓存起来,避免下次遇到相同图片而重复上传,与此同时将图片上传完成的任务推送到redis待数据清洗的队列dataCleanTask中,对已经上传完成图片任务进行数据清洗。任务清洗Job从redis队列dataCleanTask中获取图片已经上传完毕的任务,进行清洗和入库。
以上所述仅为本发明的较佳实施例而已,并不用以限制本发明的保护范围,任何熟悉本领域的技术人员在本发明的精神和原则之内所作的任何修改、等同替换和改进等,均应包含在本发明的保护范围之内。

Claims (3)

1.一种跨数据中心的ETL工具,其特征在于:包括任务调度模块、数据清洗模块、上传模块和存储模块,其中:
所述任务调度模块,用于创建需要清洗的任务,并将任务存储在第一数据中心的数据库中;
所述数据清洗模块,获取第一数据中心的数据库中需要清洗的任务的计划,拆分任务中的结构化数据和非结构化数据;
所述上传模块,用于获取任务中结构化数据推送到第一数据中心的redis队列中进行清洗和入库,用于获取任务中的非结构化数据推送到第二数据中心的redis队列中进行清洗;
所述存储模块,用于获取第二数据中心清洗的数据存储到第三数据中心的数据库。
2.根据权利要求1所述的一种跨数据中心的ETL工具,其特征在于:所述任务调度模块为定时或固定间隔时间创建需要清洗的任务。
3.根据权利要求1所述的一种跨数据中心的ETL工具,其特征在于:所述非结构化数据包括图片或/和视频或/和音频。
CN202110552855.5A 2021-05-20 2021-05-20 一种跨数据中心的etl工具 Active CN113312416B (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN202110552855.5A CN113312416B (zh) 2021-05-20 2021-05-20 一种跨数据中心的etl工具

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN202110552855.5A CN113312416B (zh) 2021-05-20 2021-05-20 一种跨数据中心的etl工具

Publications (2)

Publication Number Publication Date
CN113312416A CN113312416A (zh) 2021-08-27
CN113312416B true CN113312416B (zh) 2022-09-09

Family

ID=77373891

Family Applications (1)

Application Number Title Priority Date Filing Date
CN202110552855.5A Active CN113312416B (zh) 2021-05-20 2021-05-20 一种跨数据中心的etl工具

Country Status (1)

Country Link
CN (1) CN113312416B (zh)

Citations (7)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN104850635A (zh) * 2015-05-24 2015-08-19 华东电网有限公司 一种多数据源环境下数据缺失自动检查及集中监控方法
CN107895032A (zh) * 2017-11-23 2018-04-10 安徽科创智慧知识产权服务有限公司 进行数据初步清洗的网络数据采集方法
CN108595480A (zh) * 2018-03-13 2018-09-28 广州市优普科技有限公司 一种基于云计算的大数据etl工具系统及应用方法
CN110334081A (zh) * 2019-06-28 2019-10-15 北京天眼查科技有限公司 海量数据的清洗方法及装置
CN111400382A (zh) * 2020-03-03 2020-07-10 湖南长信畅中科技股份有限公司 一种模型驱动的数据集成中间件及实现方法
CN112199425A (zh) * 2020-09-16 2021-01-08 北京好医生云医院管理技术有限公司 基于混合数据库结构的医疗大数据中心及其建设方法
CN112699175A (zh) * 2021-01-15 2021-04-23 广州汇智通信技术有限公司 一种数据治理系统及其方法

Family Cites Families (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20120102007A1 (en) * 2010-10-22 2012-04-26 Alpine Consulting, Inc. Managing etl jobs

Patent Citations (7)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN104850635A (zh) * 2015-05-24 2015-08-19 华东电网有限公司 一种多数据源环境下数据缺失自动检查及集中监控方法
CN107895032A (zh) * 2017-11-23 2018-04-10 安徽科创智慧知识产权服务有限公司 进行数据初步清洗的网络数据采集方法
CN108595480A (zh) * 2018-03-13 2018-09-28 广州市优普科技有限公司 一种基于云计算的大数据etl工具系统及应用方法
CN110334081A (zh) * 2019-06-28 2019-10-15 北京天眼查科技有限公司 海量数据的清洗方法及装置
CN111400382A (zh) * 2020-03-03 2020-07-10 湖南长信畅中科技股份有限公司 一种模型驱动的数据集成中间件及实现方法
CN112199425A (zh) * 2020-09-16 2021-01-08 北京好医生云医院管理技术有限公司 基于混合数据库结构的医疗大数据中心及其建设方法
CN112699175A (zh) * 2021-01-15 2021-04-23 广州汇智通信技术有限公司 一种数据治理系统及其方法

Non-Patent Citations (2)

* Cited by examiner, † Cited by third party
Title
A Complete Reference for Informatica Power Center ETL Tool;Abhishek Gupta;《Journal of Trend in Scientific Research and Development》;20190210;第3卷(第2期);1063-1070 *
一种ETL与数据清洗相结合的分布式数据集成工具的研究与实现;陈雪峰;《中国优秀硕士学位论文全文数据库 信息科技辑》;20150615;I138-368 *

Also Published As

Publication number Publication date
CN113312416A (zh) 2021-08-27

Similar Documents

Publication Publication Date Title
CN106933724B (zh) 一种分布式信息追踪系统、信息处理方法及装置
CN106982150B (zh) 一种基于Hadoop的移动互联网用户行为分析方法
CN102780768B (zh) 一种大并发量请求的处理方法及处理系统
CN103678339B (zh) 数据回流、关系型数据库中的数据访问方法及系统
CN102880503A (zh) 数据分析系统及数据分析方法
CN103838867A (zh) 日志处理方法和装置
CN110837409B (zh) 一种定时执行任务的方法和系统
CN102906751A (zh) 一种数据存储、数据查询的方法及装置
CN109739818A (zh) 一种便捷式高吞吐量大数据采集方法及系统
CN106815254A (zh) 一种数据处理方法和装置
CN107798046B (zh) 客户身份信息处理方法、装置、存储介质和计算机设备
CN106156037B (zh) 数据处理方法、装置及系统
CN101562664A (zh) 一种话单处理方法和系统
CN110858192A (zh) 一种日志查询方法和系统、日志排查系统和查询终端
CN115033646B (zh) 一种基于Flink&Doris构建实时数仓系统的方法
CN104333573A (zh) 一种大并发量请求的处理方法及处理系统
CN109542917B (zh) 数据读取方法及计算机可读介质
CN108763323A (zh) 基于资源集和大数据技术的气象格点文件应用方法
CN113312416B (zh) 一种跨数据中心的etl工具
CN104881475A (zh) 一种用于大数据随机抽样的方法和系统
CN110866052A (zh) 一种数据分析方法、装置及设备
CN107329832B (zh) 一种数据接收方法及装置
CN105095224A (zh) 一种在移动通信网络中进行olap分析的方法、装置和系统
CN113190558A (zh) 一种数据加工方法和系统
KR101736382B1 (ko) 이엠에스 서버 및 이의 로그 데이터 관리 방법

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination
GR01 Patent grant
GR01 Patent grant