CN108133043A - 一种基于大数据的服务器运行日志结构化存储方法 - Google Patents

一种基于大数据的服务器运行日志结构化存储方法 Download PDF

Info

Publication number
CN108133043A
CN108133043A CN201810029045.XA CN201810029045A CN108133043A CN 108133043 A CN108133043 A CN 108133043A CN 201810029045 A CN201810029045 A CN 201810029045A CN 108133043 A CN108133043 A CN 108133043A
Authority
CN
China
Prior art keywords
data
time
big data
server
log file
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
CN201810029045.XA
Other languages
English (en)
Other versions
CN108133043B (zh
Inventor
黄桥藩
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Fujian Star Software Co Ltd
Original Assignee
Fujian Star Software Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Fujian Star Software Co Ltd filed Critical Fujian Star Software Co Ltd
Priority to CN201810029045.XA priority Critical patent/CN108133043B/zh
Publication of CN108133043A publication Critical patent/CN108133043A/zh
Application granted granted Critical
Publication of CN108133043B publication Critical patent/CN108133043B/zh
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/20Information retrieval; Database structures therefor; File system structures therefor of structured data, e.g. relational data
    • G06F16/24Querying
    • G06F16/245Query processing
    • G06F16/2458Special types of queries, e.g. statistical queries, fuzzy queries or distributed queries
    • G06F16/2471Distributed queries
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/20Information retrieval; Database structures therefor; File system structures therefor of structured data, e.g. relational data
    • G06F16/24Querying
    • G06F16/245Query processing
    • G06F16/2455Query execution
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F11/00Error detection; Error correction; Monitoring
    • G06F11/30Monitoring
    • G06F11/3065Monitoring arrangements determined by the means or processing involved in reporting the monitored data

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Data Mining & Analysis (AREA)
  • Databases & Information Systems (AREA)
  • General Physics & Mathematics (AREA)
  • Probability & Statistics with Applications (AREA)
  • Software Systems (AREA)
  • Mathematical Physics (AREA)
  • Fuzzy Systems (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

本发明提供一种基于大数据的服务器运行日志结构化存储方法,按照统一的时间点和时间间隔采集集群服务器的日志文件数据并发送给大数据平台,采集的同时制作时间戳;根据时间戳制作集群服务器数据的时间维度表;大数据平台将接收到的日志文件数据后经MAP处理成Key‑Value格式;然后进行多维度的多层嵌套,并将时间标签作为最外层维度,最后再进行分布式存储;查询时通过大数据分布式计算引擎先根据时间标签和时间维度表在时间维度上查询以获得满足条件的集群服务器的日志文件数据。本发明基于大数据平台实现分布式存储和计算,通过MAP操作实现数据的结构化,从而有效解决服务器集群日志文件不断膨胀的海量数据的存储问题,且支持SQL、NoSQL查询方式。

Description

一种基于大数据的服务器运行日志结构化存储方法
技术领域
本发明涉及一种服务器运行日志的存储方法,特别涉及一种基于大数据的服务器运行日志的存储方法。
背景技术
服务器的环境中存在日志文件数据存储的问题,如果每秒钟采集服务器性能指标,一台服务器一天日志量约为260MB,一台服务器一年的日志量约为100GB,如果有50台服务器,则一年的日志量将是个海量数据。而现有服务器日志的存储方法是通过部署运维监控软件收集服务器的运行日志数据以纯文本格式存储到本地文件系统或者关系型数据库系统,都难以解决日志文件存储数据量庞大的问题,传统的方案只能定时删除日志文件,并且海量数据的访问效率极慢,无法实现数据的访问和分析。
发明内容
本发明要解决的技术问题,在于提供一种基于大数据的服务器运行日志结构化存储方法,基于大数据平台实现分布式存储和分布式计算存储,通过MAP操作实现服务器运维日志数据的结构化,可以实现SQL、NoSQL等常用查询方式。
本发明是这样实现的:一种基于大数据的服务器运行日志结构化存储方法,
按照统一的时间点和时间间隔采集集群服务器的日志文件数据并发送给大数据平台,采集的同时制作时间戳;根据时间戳制作集群服务器数据的时间维度表;
大数据平台将接收到的日志文件数据后经MAP处理成Key-Value格式;
通过大数据平台将Key-Value格式的日志文件数据进行多维度的多层嵌套,并将时间标签作为最外层维度,最后再进行分布式存储;
查询时通过大数据分布式计算引擎先根据时间标签和时间维度表在时间维度上查询以获得满足条件的集群服务器的日志文件数据。
进一步的,所述集群服务器上部署有时间同步器,实现每台服务器的数据采集器按照统一的时间点和时间间隔采集数据。
进一步的,所述日志文件数据经多维度的多层嵌套后具有以下特点:数据多层嵌套存储了集群所有服务器的性能指标数据、并且实现时间序列的数据流Streaming Data、便于机器学习使用时间序列。
进一步的,所述查询包括SQL查询和NO-SQL查询;
所述SQL查询是:通过SQL直接查询分析数据,通过Key-value和SQL的表列字段和行数据实现映射关系;
所述NO-SQL查询是:通过NoSQL数据分析查询,通过多层嵌套关系和NoSQL的行键、列簇、列信息实现映射关系。
本发明具有如下优点:
1、通过大数据平台进行分布式存储和分布式计算,从而有效解决服务器集群日志文件不断膨胀的海量数据的存储问题;
2、将数据进行特定格式化存储,转换为的Key-Value数据的特定结构化的存储格式,并且按照特定规范进行数据的嵌套,实现数据的结构化存储,便于兼容多个其他数据引擎数据SQL查询或者NoSQL的查询,为后续的数据分析访问和机器学习提供了数据可用性。
具体实施方式
本发明的基于大数据的服务器运行日志结构化存储方法,包括:
按照统一的时间点和时间间隔采集集群服务器的日志文件数据并发送给大数据平台,采集的同时制作时间戳;根据时间戳制作集群服务器数据的时间维度表,从而在查询时可实现在时间维度上获取所有服务器的运维数据的目的,运维数据主要包括服务器CPU使用率、内存使用率、硬盘使用率、IO消耗、网络带宽资源使用率等参数;具体可以在所述集群服务器上部署时间同步器,从而实现每台服务器的数据采集器按照统一的时间点和时间间隔采集数据。
大数据平台将接收到的日志文件数据后进行MAP处理,使用Key-Value(服务器指标项-指标值,例如:CpuUsed:80%表示CPU使用了80%)的格式存放到大数据平台;
通过大数据平台将Key-Value格式的日志文件数据进行多维度的多层嵌套,并将时间标签作为最外层维度,最后再进行分布式存储,从而在查询时可以通过时间标签快速搜索到某个时间的所有集群服务器的信息;所述日志文件数据经多维度的多层嵌套后具有以下特点:数据多层嵌套间点的所有集群的性能指标数据、并且可以轻易实现时间序列的数据流Streaming Data、机器学习使用时间序列,这样一方面可实现日志存储文件的海量存储,另一方而可通过大数据分布式计算引擎实现海量数据的秒级查询分析。
查询时通过大数据分布式计算引擎先根据时间标签和时间维度表在时间维度上查询以获得满足条件的集群服务器的日志文件数据。由于采用了Key-Value结构存储,使查询支持SQL查询和NO-SQL查询两种方式,使数据的访问兼容性得到扩展。其中:
所述SQL查询是:通过SQL直接查询分析数据,通过Key-value和SQL的表列字段和行数据实现映射关系;
所述NO-SQL查询是:通过NoSQL数据分析查询,通过多层嵌套关系和NoSQL的行键、列簇、列信息实现映射关系。
综上,本发明通过大数据平台进行分布式存储和分布式计算;将数据进行特定格式化存储,转换为的Key-Value数据的特定结构化的存储格式,并且按照特定规范进行数据的嵌套,实现数据的结构化存储,便于兼容多个其他数据引擎数据SQL查询或者NoSQL的查询,为后续的数据分析访问和机器学习提供了数据可用性,从而有效解决服务器集群日志文件不断膨胀的海量数据的存储问题。
虽然以上描述了本发明的具体实施方式,但是熟悉本技术领域的技术人员应当理解,我们所描述的具体的实施例只是说明性的,而不是用于对本发明的范围的限定,熟悉本领域的技术人员在依照本发明的精神所作的等效的修饰以及变化,都应当涵盖在本发明的权利要求所保护的范围内。

Claims (4)

1.一种基于大数据的服务器运行日志结构化存储方法,其特征在于:
按照统一的时间点和时间间隔采集集群服务器的日志文件数据并发送给大数据平台,采集的同时制作时间戳;根据时间戳制作集群服务器数据的时间维度表;
大数据平台将接收到的日志文件数据后经MAP处理成Key-Value格式;
通过大数据平台将Key-Value格式的日志文件数据进行多维度的多层嵌套,并将时间标签作为最外层维度,最后再进行分布式存储;
查询时通过大数据分布式计算引擎先根据时间标签和时间维度表在时间维度上查询以获得满足条件的集群服务器的日志文件数据。
2.根据权利要求1所述的一种基于进化算法的交互式本体匹配方法,其特征在于:所述集群服务器上部署有时间同步器,实现每台服务器的数据采集器按照统一的时间点和时间间隔采集数据。
3.根据权利要求1所述的一种基于进化算法的交互式本体匹配方法,其特征在于:所述日志文件数据经多维度的多层嵌套后具有以下特点:数据多层嵌套存储了集群所有服务器的性能指标数据、并且实现时间序列的数据流Streaming Data、便于机器学习使用时间序列。
4.根据权利要求1所述的一种基于进化算法的交互式本体匹配方法,其特征在于:所述查询包括SQL查询和NO-SQL查询;
所述SQL查询是:通过SQL直接查询分析数据,通过Key-value和SQL的表列字段和行数据实现映射关系;
所述NO-SQL查询是:通过NoSQL数据分析查询,通过多层嵌套关系和NoSQL的行键、列簇、列信息实现映射关系。
CN201810029045.XA 2018-01-12 2018-01-12 一种基于大数据的服务器运行日志结构化存储方法 Active CN108133043B (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN201810029045.XA CN108133043B (zh) 2018-01-12 2018-01-12 一种基于大数据的服务器运行日志结构化存储方法

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN201810029045.XA CN108133043B (zh) 2018-01-12 2018-01-12 一种基于大数据的服务器运行日志结构化存储方法

Publications (2)

Publication Number Publication Date
CN108133043A true CN108133043A (zh) 2018-06-08
CN108133043B CN108133043B (zh) 2022-07-29

Family

ID=62400526

Family Applications (1)

Application Number Title Priority Date Filing Date
CN201810029045.XA Active CN108133043B (zh) 2018-01-12 2018-01-12 一种基于大数据的服务器运行日志结构化存储方法

Country Status (1)

Country Link
CN (1) CN108133043B (zh)

Cited By (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN110309110A (zh) * 2019-05-24 2019-10-08 深圳壹账通智能科技有限公司 一种大数据日志监控方法及装置、存储介质和计算机设备
CN111198853A (zh) * 2018-11-16 2020-05-26 北京微播视界科技有限公司 数据处理方法、装置、电子设备及计算机可读存储介质
CN111427964A (zh) * 2020-04-15 2020-07-17 南京核新数码科技有限公司 一种面向运行时间戳的工业云数据存储模型
CN114461490A (zh) * 2021-12-31 2022-05-10 广东航宇卫星科技有限公司 一种运维数据聚合系统

Citations (14)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7257690B1 (en) * 2004-10-15 2007-08-14 Veritas Operating Corporation Log-structured temporal shadow store
CN102831214A (zh) * 2006-10-05 2012-12-19 斯普兰克公司 时间序列搜索引擎
CN103262062A (zh) * 2010-12-03 2013-08-21 惠普发展公司,有限责任合伙企业 用于执行嵌套连接操作的系统和方法
CN103838867A (zh) * 2014-03-20 2014-06-04 网宿科技股份有限公司 日志处理方法和装置
CN104298771A (zh) * 2014-10-30 2015-01-21 南京信息工程大学 一种海量web日志数据查询与分析方法
CN104616205A (zh) * 2014-11-24 2015-05-13 北京科东电力控制系统有限责任公司 一种基于分布式日志分析的电力系统运行状态监视方法
CN104794123A (zh) * 2014-01-20 2015-07-22 阿里巴巴集团控股有限公司 一种为半结构化数据构建NoSQL数据库索引的方法及装置
CN105009111A (zh) * 2012-12-13 2015-10-28 微软技术许可有限责任公司 使用键值存储系统的分布式sql查询处理
CN105138592A (zh) * 2015-07-31 2015-12-09 武汉虹信技术服务有限责任公司 一种基于分布式架构的日志数据存储和检索方法
CN105138661A (zh) * 2015-09-02 2015-12-09 西北大学 一种基于Hadoop的网络安全日志k-means聚类分析系统及方法
CN105357311A (zh) * 2015-11-23 2016-02-24 中国南方电网有限责任公司 一种云计算技术的二次设备大数据存储与处理方法
US9400816B1 (en) * 2013-02-28 2016-07-26 Google Inc. System for indexing collections of structured objects that provides strong multiversioning semantics
CN106372176A (zh) * 2016-08-30 2017-02-01 东华大学 一种支持对嵌套文档进行统一sql查询的方法
CN107343021A (zh) * 2017-05-22 2017-11-10 国网安徽省电力公司信息通信分公司 国网云中应用的一种基于大数据的日志管理系统

Patent Citations (14)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7257690B1 (en) * 2004-10-15 2007-08-14 Veritas Operating Corporation Log-structured temporal shadow store
CN102831214A (zh) * 2006-10-05 2012-12-19 斯普兰克公司 时间序列搜索引擎
CN103262062A (zh) * 2010-12-03 2013-08-21 惠普发展公司,有限责任合伙企业 用于执行嵌套连接操作的系统和方法
CN105009111A (zh) * 2012-12-13 2015-10-28 微软技术许可有限责任公司 使用键值存储系统的分布式sql查询处理
US9400816B1 (en) * 2013-02-28 2016-07-26 Google Inc. System for indexing collections of structured objects that provides strong multiversioning semantics
CN104794123A (zh) * 2014-01-20 2015-07-22 阿里巴巴集团控股有限公司 一种为半结构化数据构建NoSQL数据库索引的方法及装置
CN103838867A (zh) * 2014-03-20 2014-06-04 网宿科技股份有限公司 日志处理方法和装置
CN104298771A (zh) * 2014-10-30 2015-01-21 南京信息工程大学 一种海量web日志数据查询与分析方法
CN104616205A (zh) * 2014-11-24 2015-05-13 北京科东电力控制系统有限责任公司 一种基于分布式日志分析的电力系统运行状态监视方法
CN105138592A (zh) * 2015-07-31 2015-12-09 武汉虹信技术服务有限责任公司 一种基于分布式架构的日志数据存储和检索方法
CN105138661A (zh) * 2015-09-02 2015-12-09 西北大学 一种基于Hadoop的网络安全日志k-means聚类分析系统及方法
CN105357311A (zh) * 2015-11-23 2016-02-24 中国南方电网有限责任公司 一种云计算技术的二次设备大数据存储与处理方法
CN106372176A (zh) * 2016-08-30 2017-02-01 东华大学 一种支持对嵌套文档进行统一sql查询的方法
CN107343021A (zh) * 2017-05-22 2017-11-10 国网安徽省电力公司信息通信分公司 国网云中应用的一种基于大数据的日志管理系统

Non-Patent Citations (4)

* Cited by examiner, † Cited by third party
Title
YUZHE TANG ET AL.: "Deferred Lightweight Indexing for Log-Structured Key-Value Stores", 《2015 15TH IEEE/ACM INTERNATIONAL SYMPOSIUM ON CLUSTER, CLOUD AND GRID COMPUTING》 *
YUZHE TANG ET AL.: "Deferred Lightweight Indexing for Log-Structured Key-Value Stores", 《2015 15TH IEEE/ACM INTERNATIONAL SYMPOSIUM ON CLUSTER, CLOUD AND GRID COMPUTING》, 9 July 2015 (2015-07-09), pages 11 - 20 *
申德荣 等: "支持大数据管理的NoSQL系统研究综述", 《软件学报》 *
申德荣 等: "支持大数据管理的NoSQL系统研究综述", 《软件学报》, vol. 24, no. 8, 23 May 2013 (2013-05-23), pages 1786 - 1803 *

Cited By (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN111198853A (zh) * 2018-11-16 2020-05-26 北京微播视界科技有限公司 数据处理方法、装置、电子设备及计算机可读存储介质
CN111198853B (zh) * 2018-11-16 2023-08-22 北京微播视界科技有限公司 数据处理方法、装置、电子设备及计算机可读存储介质
CN110309110A (zh) * 2019-05-24 2019-10-08 深圳壹账通智能科技有限公司 一种大数据日志监控方法及装置、存储介质和计算机设备
CN111427964A (zh) * 2020-04-15 2020-07-17 南京核新数码科技有限公司 一种面向运行时间戳的工业云数据存储模型
CN114461490A (zh) * 2021-12-31 2022-05-10 广东航宇卫星科技有限公司 一种运维数据聚合系统

Also Published As

Publication number Publication date
CN108133043B (zh) 2022-07-29

Similar Documents

Publication Publication Date Title
CN108133043A (zh) 一种基于大数据的服务器运行日志结构化存储方法
CN103365929B (zh) 一种数据库连接的管理方法及系统
CN107423422B (zh) 基于网格的空间数据分布式存储及检索方法和系统
CN103020204B (zh) 一种对分布式顺序表进行多维区间查询的方法及其系统
CN104794123B (zh) 一种为半结构化数据构建NoSQL数据库索引的方法及装置
CN103020315B (zh) 一种基于主从分布式文件系统的海量小文件存储方法
CN104820714B (zh) 基于hadoop的海量瓦片小文件存储管理方法
CN104850572A (zh) HBase非主键索引构建与查询方法及其系统
CN107133342A (zh) 一种IndexR实时数据分析库
Han et al. Hgrid: A data model for large geospatial data sets in hbase
CN104933112A (zh) 分布式互联网交易信息存储处理方法
CN100426300C (zh) 一种管理日志的方法及系统
CN105608188A (zh) 数据处理方法和数据处理装置
CN103793493B (zh) 一种处理车载终端海量数据的方法和系统
CN106503276A (zh) 一种用于实时监控系统的时间序列数据库的方法与装置
CN103020078B (zh) 分布式实时数据库数据层次索引方法
CN103678665A (zh) 一种基于数据仓库的异构大数据整合方法和系统
CN100458784C (zh) 在数字图书馆中所采用的检索系统和检索方法
CN107807787B (zh) 一种分布式数据存储方法和系统
CN104750681A (zh) 一种海量数据的处理方法及装置
CN102521386A (zh) 基于集群存储的空间元数据分组方法
CN102541985A (zh) 一种分布式文件系统中客户端目录缓存的组织方法
CN103714134A (zh) 一种网络流量数据索引方法及系统
CN104035956A (zh) 一种基于分布式列存储的时间序列数据存储方法
CN104239377A (zh) 跨平台的数据检索方法及装置

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination
CB02 Change of applicant information
CB02 Change of applicant information

Address after: 350000 21 / F, building 5, f District, Fuzhou Software Park, 89 software Avenue, Gulou District, Fuzhou City, Fujian Province

Applicant after: FUJIAN SINOREGAL SOFTWARE CO.,LTD.

Address before: Floor 20-21, building 5, area F, Fuzhou Software Park, 89 software Avenue, Gulou District, Fuzhou City, Fujian Province 350000

Applicant before: FUJIAN SINOREGAL SOFTWARE CO.,LTD.

GR01 Patent grant
GR01 Patent grant