CN110674122B - 一种基于数据交易的数据清洗系统 - Google Patents

一种基于数据交易的数据清洗系统 Download PDF

Info

Publication number
CN110674122B
CN110674122B CN201910833341.XA CN201910833341A CN110674122B CN 110674122 B CN110674122 B CN 110674122B CN 201910833341 A CN201910833341 A CN 201910833341A CN 110674122 B CN110674122 B CN 110674122B
Authority
CN
China
Prior art keywords
data
processing
information
source data
cleaning
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
CN201910833341.XA
Other languages
English (en)
Other versions
CN110674122A (zh
Inventor
汤寒林
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
East China Jiangsu Big Data Trading Center Co ltd
Original Assignee
East China Jiangsu Big Data Trading Center Co ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by East China Jiangsu Big Data Trading Center Co ltd filed Critical East China Jiangsu Big Data Trading Center Co ltd
Priority to CN201910833341.XA priority Critical patent/CN110674122B/zh
Publication of CN110674122A publication Critical patent/CN110674122A/zh
Application granted granted Critical
Publication of CN110674122B publication Critical patent/CN110674122B/zh
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/20Information retrieval; Database structures therefor; File system structures therefor of structured data, e.g. relational data
    • G06F16/21Design, administration or maintenance of databases
    • G06F16/215Improving data quality; Data cleansing, e.g. de-duplication, removing invalid entries or correcting typographical errors

Landscapes

  • Engineering & Computer Science (AREA)
  • Databases & Information Systems (AREA)
  • Theoretical Computer Science (AREA)
  • Quality & Reliability (AREA)
  • Data Mining & Analysis (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Management, Administration, Business Operations System, And Electronic Commerce (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

本发明提供一种基于数据交易的数据清洗系统,属于数据交易领域,包括处理模块,在清洗处理时生产日志;信息获取模块,用于从所述多个客户端获取预处理相关信息,根据预设的分类策略对所述预处理相关信息进行分类处理得到分组信息;分配模块,获取所述分组信息和相应的清洗策略信息,根据所述分组信息将同一组的所述源数据分配给同一所述处理单元,多个所述处理单元对所述源数据并行并行处理,每个所述处理单元分别根据所述清洗策略信息对相应的所述源数据进行排序依次进行所述清洗处理;跟踪模块,获取所述日志进行故障处理。本发明的有益效果:提高数据处理效率。

Description

一种基于数据交易的数据清洗系统
技术领域
本发明涉及数据交易技术领域,尤其涉及一种基于数据交易的数据清洗系统。
背景技术
目前,大数据交易过程中产生大量的需要进行清洗处理的源数据,当数据中心服务端从客户端获取到源数据后,需要对源数据进行同一的清洗处理,数据传输和处理量很大,数据清理效率较低。
发明内容
针对现有技术中存在的问题,本发明涉及一种基于数据交易的数据清洗系统。
本发明采用如下技术方案:
一种基于数据交易的数据清洗系统,包括:
处理模块,连接所述分配模块,包括多个处理单元,所述处理模块用于对多个客户端的源数据进行清洗处理得到目标数据,每个所述处理单元在进行所述清洗处理时生产日志并输出;
信息获取模块,用于从所述多个客户端获取预处理相关信息,所述预处理相关信息包括所述客户端的第一相关信息和所述客户端中待处理的所述源数据的第二相关信息,根据预设的分类策略对所述预处理相关信息进行分类处理得到分组信息;
分配模块,连接所述处理模块和所述信息获取模块,用于获取所述分组信息和相应的清洗策略信息,根据所述分组信息将同一组的所述源数据分配给同一所述处理单元,多个所述处理单元对所述源数据并行并行处理,每个所述处理单元分别根据所述清洗策略信息对相应的所述源数据进行排序依次进行所述清洗处理;
跟踪模块,连接所述处理模块和所述分配模块,用于获取所述日志,根据所述日志在判断任意一所述处理单元出现清洗故障时和/或任意一源数据出现清洗故障时,向所述分配模块发送报警信息,所述分配模块根据所述报警信息重新进行相关源数据的分配。
优选的,所述第一相关信息包括所述客户端的第一标识信息,所述第一标识信息包括所述客户端的客户端数据、操作员数据、所属的机构数据以及历史合作数据。
优选的,所述第二相关信息包括所述源数据的第二标识信息,所述第二标识信息包括所述源数据的格式数据、所属的领域数据、所适用的处理策略数据以及历史处理数据。
优选的,所述历史处理数据包括历史处理速率数据和历史修改数据。
优选的,所述信息获取模块将适用同一清洗策略的所述源数据划分为同一组并发送至同一所述处理单元进行所述清洗处理。
优选的,所述信息获取模块将适用同一处理速率的数据划分为同一组并发送至同一所述处理单元进行所述清洗处理。
优选的,所述信息获取模块将适用同一数据来源类别的数据划分为同一组并发送至同一所述处理单元进行所述清洗处理。
优选的,所述处理单元包括客户端处理器和服务端处理器。
优选的,所述处理单元分别根据所述清洗策略信息对相应的所述源数据进行排序依次进行所述清洗处理具体包括:
所述处理单元根据每个所述源数据所需的处理时长从大到小依次对所有所述源数据进行排序并依次进行所述清洗处理。
优选的,所述处理单元分别根据所述清洗策略信息对相应的所述源数据进行排序依次进行所述清洗处理具体包括:
所述处理单元根据每个所述源数据历史所需的处理时长和客户不满意度从大到小依次对所有所述源数据进行排序并依次进行所述清洗处理。
本发明的有益效果:信息获取模块,用于从所述多个客户端获取预处理相关信息;在获取源数据前,先获取预处理相关信息并对源数据进行分组,提高数据分配效率;
对不同客户端和不同类型的源数据进行分组,多个处理单元并行处理所有源数据,每个处理单元对本组源数据进行排序过后依次进行清洗处理,有效提高清洗处理的效率;
由跟踪模块实时监控所有处理单元的处理日志,故障时由跟踪模块配合分配模块进行源数据的重新分配,避免处理模块进行过多故障处理,提高处理模块的清洗处理的效率。
附图说明
图1为本发明一种优选的实施例中,基于数据交易的数据清洗系统的功能模块示意图。
具体实施方式
需要说明的是,在不冲突的情况下,下述技术方案,技术特征之间可以相互组合。
下面结合附图对本发明的具体实施方式作进一步的说明:
如图1所示,一种基于数据交易的数据清洗系统,包括:
处理模块,连接所述分配模块,包括多个处理单元,所述处理模块用于对多个客户端的源数据进行清洗处理得到目标数据,每个所述处理单元在进行所述清洗处理时生产日志并输出;
信息获取模块,用于从所述多个客户端获取预处理相关信息,所述预处理相关信息包括所述客户端的第一相关信息和所述客户端中待处理的所述源数据的第二相关信息,根据预设的分类策略对所述预处理相关信息进行分类处理得到分组信息;
分配模块,连接所述处理模块和所述信息获取模块,用于获取所述分组信息和相应的清洗策略信息,根据所述分组信息将同一组的所述源数据分配给同一所述处理单元,多个所述处理单元对所述源数据并行并行处理,每个所述处理单元分别根据所述清洗策略信息对相应的所述源数据进行排序依次进行所述清洗处理;
跟踪模块,连接所述处理模块和所述分配模块,用于获取所述日志,根据所述日志在判断任意一所述处理单元出现清洗故障时和/或任意一源数据出现清洗故障时,向所述分配模块发送报警信息,所述分配模块根据所述报警信息重新进行相关源数据的分配。
在本实施例中,信息获取模块,用于从所述多个客户端获取预处理相关信息;在获取源数据前,先获取预处理相关信息并对源数据进行分组,提高数据分配效率;
对不同客户端和不同类型的源数据进行分组,多个处理单元并行处理所有源数据,每个处理单元对本组源数据进行排序过后依次进行清洗处理,有效提高清洗处理的效率;
由跟踪模块实时监控所有处理单元的处理日志,故障时由跟踪模块配合分配模块进行源数据的重新分配,避免处理模块进行过多故障处理,提高处理模块的清洗处理的效率。
较佳的实施例中,所述第一相关信息包括所述客户端的第一标识信息,所述第一标识信息包括所述客户端的客户端数据、操作员数据、所属的机构数据以及历史合作数据。
较佳的实施例中,所述第二相关信息包括所述源数据的第二标识信息,所述第二标识信息包括所述源数据的格式数据、所属的领域数据、所适用的处理策略数据以及历史处理数据。
较佳的实施例中,所述历史处理数据包括历史处理速率数据和历史修改数据。
较佳的实施例中,所述信息获取模块将适用同一清洗策略的所述源数据划分为同一组并发送至同一所述处理单元进行所述清洗处理。
较佳的实施例中,所述信息获取模块将适用同一处理速率的数据划分为同一组并发送至同一所述处理单元进行所述清洗处理。
较佳的实施例中,所述信息获取模块将适用同一数据来源类别的数据划分为同一组并发送至同一所述处理单元进行所述清洗处理。
较佳的实施例中,所述处理单元包括客户端处理器和服务端处理器。
较佳的实施例中,所述处理单元分别根据所述清洗策略信息对相应的所述源数据进行排序依次进行所述清洗处理具体包括:
所述处理单元根据每个所述源数据所需的处理时长从大到小依次对所有所述源数据进行排序并依次进行所述清洗处理。
较佳的实施例中,所述处理单元分别根据所述清洗策略信息对相应的所述源数据进行排序依次进行所述清洗处理具体包括:
所述处理单元根据每个所述源数据历史所需的处理时长和客户不满意度从大到小依次对所有所述源数据进行排序并依次进行所述清洗处理。
通过说明和附图,给出了具体实施方式的特定结构的典型实施例,基于本发明精神,还可作其他的转换。尽管上述发明提出了现有的较佳实施例,然而,这些内容并不作为局限。
对于本领域的技术人员而言,阅读上述说明后,各种变化和修正无疑将显而易见。因此,所附的权利要求书应看作是涵盖本发明的真实意图和范围的全部变化和修正。在权利要求书范围内任何和所有等价的范围与内容,都应认为仍属本发明的意图和范围内。

Claims (10)

1.一种基于数据交易的数据清洗系统,其特征在于,包括:
处理模块,连接分配模块,包括多个处理单元,所述处理模块用于对多个客户端的源数据进行清洗处理得到目标数据,每个所述处理单元在进行所述清洗处理时生产日志并输出;
信息获取模块,用于从所述多个客户端获取预处理相关信息,所述预处理相关信息包括所述客户端的第一相关信息和所述客户端中待处理的所述源数据的第二相关信息,根据预设的分类策略对所述预处理相关信息进行分类处理得到分组信息;
分配模块,连接所述处理模块和所述信息获取模块,用于获取所述分组信息和相应的清洗策略信息,根据所述分组信息将同一组的所述源数据分配给同一所述处理单元,多个所述处理单元对所述源数据并行处理,每个所述处理单元分别根据所述清洗策略信息对相应的所述源数据进行排序依次进行所述清洗处理;
跟踪模块,连接所述处理模块和所述分配模块,用于获取所述日志,根据所述日志在判断任意一所述处理单元出现清洗故障时或任意一源数据出现清洗故障时,向所述分配模块发送报警信息,所述分配模块根据所述报警信息重新进行相关源数据的分配;
所述第一相关信息包括所述客户端的第一标识信息,所述第一标识信息包括所述客户端的客户端数据、操作员数据、所属的机构数据以及历史合作数据;
所述第二相关信息包括所述源数据的第二标识信息,所述第二标识信息包括所述源数据的格式数据、所属的领域数据、所适用的处理策略数据以及历史处理数据。
2.根据权利要求1所述的基于数据交易的数据清洗系统,其特征在于,所述第一相关信息包括所述客户端的第一标识信息,所述第一标识信息包括所述客户端的客户端数据、操作员数据、所属的机构数据以及历史合作数据。
3.根据权利要求2所述的基于数据交易的数据清洗系统,其特征在于,所述第二相关信息包括所述源数据的第二标识信息,所述第二标识信息包括所述源数据的格式数据、所属的领域数据、所适用的处理策略数据以及历史处理数据。
4.根据权利要求3所述的基于数据交易的数据清洗系统,其特征在于,所述历史处理数据包括历史处理速率数据和历史修改数据。
5.根据权利要求4所述的基于数据交易的数据清洗系统,其特征在于,所述信息获取模块将适用同一清洗策略的所述源数据划分为同一组并发送至同一所述处理单元进行所述清洗处理。
6.根据权利要求4所述的基于数据交易的数据清洗系统,其特征在于,所述信息获取模块将适用同一处理速率的数据划分为同一组并发送至同一所述处理单元进行所述清洗处理。
7.根据权利要求4所述的基于数据交易的数据清洗系统,其特征在于,所述信息获取模块将适用同一数据来源类别的数据划分为同一组并发送至同一所述处理单元进行所述清洗处理。
8.根据权利要求1所述的基于数据交易的数据清洗系统,其特征在于,所述处理单元包括客户端处理器和服务端处理器。
9.根据权利要求4所述的基于数据交易的数据清洗系统,其特征在于,所述处理单元分别根据所述清洗策略信息对相应的所述源数据进行排序依次进行所述清洗处理具体包括:
所述处理单元根据每个所述源数据所需的处理时长从大到小依次对所有所述源数据进行排序并依次进行所述清洗处理。
10.根据权利要求4所述的基于数据交易的数据清洗系统,其特征在于,所述处理单元分别根据所述清洗策略信息对相应的所述源数据进行排序依次进行所述清洗处理具体包括:
所述处理单元根据每个所述源数据历史所需的处理时长和客户不满意度从大到小依次对所有所述源数据进行排序并依次进行所述清洗处理。
CN201910833341.XA 2019-09-04 2019-09-04 一种基于数据交易的数据清洗系统 Active CN110674122B (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN201910833341.XA CN110674122B (zh) 2019-09-04 2019-09-04 一种基于数据交易的数据清洗系统

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN201910833341.XA CN110674122B (zh) 2019-09-04 2019-09-04 一种基于数据交易的数据清洗系统

Publications (2)

Publication Number Publication Date
CN110674122A CN110674122A (zh) 2020-01-10
CN110674122B true CN110674122B (zh) 2023-09-12

Family

ID=69075945

Family Applications (1)

Application Number Title Priority Date Filing Date
CN201910833341.XA Active CN110674122B (zh) 2019-09-04 2019-09-04 一种基于数据交易的数据清洗系统

Country Status (1)

Country Link
CN (1) CN110674122B (zh)

Families Citing this family (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN111831637A (zh) * 2020-07-30 2020-10-27 海南中金德航科技股份有限公司 数据自动清洗系统

Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN106528840A (zh) * 2016-11-11 2017-03-22 中国银行股份有限公司 基于银行系统的业务数据的清理方法以及系统
CN108153744A (zh) * 2016-12-02 2018-06-12 上海中兴软件有限责任公司 一种数据存储维护方法及装置
CN109582667A (zh) * 2018-10-16 2019-04-05 中国电力科学研究院有限公司 一种基于电力调控大数据的多数据库混合存储方法及系统

Family Cites Families (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
GB0414291D0 (en) * 2004-06-25 2004-07-28 Ibm Methods, apparatus and computer programs for data replication

Patent Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN106528840A (zh) * 2016-11-11 2017-03-22 中国银行股份有限公司 基于银行系统的业务数据的清理方法以及系统
CN108153744A (zh) * 2016-12-02 2018-06-12 上海中兴软件有限责任公司 一种数据存储维护方法及装置
CN109582667A (zh) * 2018-10-16 2019-04-05 中国电力科学研究院有限公司 一种基于电力调控大数据的多数据库混合存储方法及系统

Also Published As

Publication number Publication date
CN110674122A (zh) 2020-01-10

Similar Documents

Publication Publication Date Title
CN107918864B (zh) 电子保单生成方法、装置、计算机设备及存储介质
CN102456031B (zh) 一种MapReduce系统和处理数据流的方法
HUP0301769A2 (en) Rapid valuation of portfolios of assets such as financial instruments
SG132684A1 (en) Latency-aware asset trading system
EP0845748A3 (en) A method and apparatus for performing computer-based on-line commerce using an intelligent agent
CN106874135B (zh) 用于检测机房故障的方法、装置及设备
CN110674122B (zh) 一种基于数据交易的数据清洗系统
CN101661484A (zh) 一种查询方法及系统
CN107045459A (zh) 一种基于ansible的运维请求处理方法及装置
CN105243499A (zh) 订单分配方法及系统
CN111339108A (zh) 一种交易并行执行方法、设备及存储介质
CN106685853A (zh) 处理数据的方法及装置
CN111461630B (zh) 派送快递包裹的监控方法、装置、设备及存储介质
CN106790258B (zh) 一种服务器筛选网络请求的方法及系统
CN113626495A (zh) 一种能源管理系统的运行数据采集方法
CN111709769B (zh) 一种数据处理方法及装置
CN104866493A (zh) 一种提升信息的曝光率的方法和装置
CN111475554B (zh) 基于快递状态的数据展示方法、装置、设备及存储介质
CN115146191A (zh) 基于ai进行视频监控资产识别的方法、装置及电子设备
CN112540906B (zh) 基于探针的业务与数据关系智能解析方法及系统
CN115034704A (zh) 物流跟踪方法、装置、设备及存储介质
CN112116452B (zh) 交易处理方法及装置
CN105335362A (zh) 实时数据的处理方法及系统、即时处理系统
CN107909481B (zh) 一种投资共建展示与认股信息分析系统及方法
CN112800140A (zh) 一种基于区块链预言机的高可信数据获取方法

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination
GR01 Patent grant
GR01 Patent grant