CN116842320B - 一种贸易实物量数据清洗方法、装置、设备及介质 - Google Patents
一种贸易实物量数据清洗方法、装置、设备及介质 Download PDFInfo
- Publication number
- CN116842320B CN116842320B CN202310821997.6A CN202310821997A CN116842320B CN 116842320 B CN116842320 B CN 116842320B CN 202310821997 A CN202310821997 A CN 202310821997A CN 116842320 B CN116842320 B CN 116842320B
- Authority
- CN
- China
- Prior art keywords
- trade
- data
- product
- value
- preset
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F18/00—Pattern recognition
- G06F18/10—Pre-processing; Data cleansing
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F18/00—Pattern recognition
- G06F18/10—Pre-processing; Data cleansing
- G06F18/15—Statistical pre-processing, e.g. techniques for normalisation or restoring missing data
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F18/00—Pattern recognition
- G06F18/20—Analysing
- G06F18/24—Classification techniques
- G06F18/243—Classification techniques relating to the number of classes
- G06F18/2433—Single-class perspective, e.g. one-against-all classification; Novelty detection; Outlier detection
-
- Y—GENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
- Y02—TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
- Y02P—CLIMATE CHANGE MITIGATION TECHNOLOGIES IN THE PRODUCTION OR PROCESSING OF GOODS
- Y02P90/00—Enabling technologies with a potential contribution to greenhouse gas [GHG] emissions mitigation
- Y02P90/30—Computing systems specially adapted for manufacturing
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- Data Mining & Analysis (AREA)
- Artificial Intelligence (AREA)
- Bioinformatics & Computational Biology (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Evolutionary Biology (AREA)
- Evolutionary Computation (AREA)
- Bioinformatics & Cheminformatics (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Life Sciences & Earth Sciences (AREA)
- Probability & Statistics with Applications (AREA)
- Management, Administration, Business Operations System, And Electronic Commerce (AREA)
Abstract
本发明涉及数据清洗技术领域,公开了一种贸易实物量数据清洗方法、装置、设备及介质,其中方法包括:按照预设数据格式获取预设类型的产品贸易数据,并对产品贸易数据进行初始化处理;按照预设统一规则对初始化后产品贸易数据进行统一,并按照预设筛选原则对统一后的产品贸易数据进行筛选,识别出缺失值数据及异常值数据;对缺失值数据及异常值数据进行分项,根据分项结果选取对应预设清洗算法,并对不同项的缺失值数据或异常值数据进行数据修正。本发明通过对缺失值数据及异常值数据进行分项,选取对应的清洗算法进行数据清洗,能够提高清洗过程的灵活性,提升清洗效率,保证最小修改的清洗结果接近真实值,满足后续数据分析的多元化需求。
Description
技术领域
本发明涉及数据清洗技术领域,具体涉及一种贸易实物量数据清洗方法、装置、设备及介质。
背景技术
近年来,人们越来越关注评估贸易对人们生活和地球的影响。贸易在国家和地区之间重新分配资源和财富方面发挥着至关重要的作用。在过去的几十年里,资源贸易在全球资源开采中所占的份额越来越大,2017年达到24.8%。因此,有必要量化伴随贸易而来的物质流,这涉及到不同的过程。
联合国商品贸易信息数据库(UN Comtrade)成立于1960年代初期,是最广泛、最准确的国际贸易统计数据库之一。然而,早期的多种研究表明,联合国商品贸易统计中的缺失值会导致统计问题,从而导致严重的贸易误解和随着缺失值比例的增加,情况的严重性会恶化。所有商品、国家和年份都存在这个问题。缺乏数据将导致对物质流动和环境影响的低估,也会导致净流量逆转(例如,从净进口国转向净出口国)。因此,迫切需要解决缺失值和异常值相关的问题。其中,实物价值缺失主要存在于高附加值商品中,一些政府可能要求对这些物品的数量保密,并且只记录价值数量而不是确切数量。同时,实物价值缺失在未以千克报告的商品中更为常见。因此,未能正确分析这些数据可能导致严重低估这些商品对环境和资源使用的影响。
目前,针对平台大数据源的数据清洗工作,通常采用预设或者固定的清洗规则,将大数据平台中抽取到的全部数据或者部分数据进行优化和清洗,在清洗的过程中,针对预设的清洗优化策略来执行相应数据内容的变换和处理。但是现有技术中的大数据平台数据清洗工作仅仅是通过固定的清洗规则或者清洗算法对大数据平台获取到的数据进行计算和处理,无法在多元化需求的情况之下灵活利用清洗规则,导致清洗过程过于死板,不灵活,降低了清洗效率。
发明内容
有鉴于此,本发明提供了一种贸易实物量数据清洗方法、装置、设备及介质,以解决贸易数据清洗灵活性不足、运行效率低的问题。
第一方面,本发明提供了一种贸易实物量数据清洗方法,方法包括:
按照预设数据格式获取预设类型的产品贸易数据,并通过对所述产品贸易数据进行初始化处理,来删除与预设类型无关的数据;
按照预设统一规则对初始化后产品贸易数据进行统一,并按照预设筛选原则对统一后的产品贸易数据进行筛选,识别出缺失值数据及异常值数据;
对缺失值数据及异常值数据进行分项,根据分项结果选取对应预设清洗算法,并对不同项的缺失值数据或异常值数据进行数据修正。
本发明实施例提供的贸易实物量数据清洗方法,通过对获取的产品贸易数据进行初始化处理及统一处理,并按照预设筛选原则对统一后的产品贸易数据进行筛选,识别出缺失值数据及异常值数据,对缺失值数据及异常值数据进行分项,并根据分项结果选取对应的预设清洗算法,对不同项的缺失值数据或异常值数据进行数据修正。本发明通过对缺失值数据及异常值数据进行分项,选取对应清洗算法进行数据清洗,能够提高清洗过程的灵活性,提升清洗效率,保证最小修改的清洗结果接近真实值,满足后续数据分析的多元化需求。
在一种可选的实施方式中,预设数据格式,包括:xlsx格式、xls格式及csv格式;预设类型,包括:贸易产品名称、产品海关代码、贸易国家、贸易年份、贸易数量、贸易净重量、贸易流向、贸易金额及产品单位。
本发明按照预设格式获取不同类型的产品贸易数据,其中产品贸易数据包含多形态、长时序、跨区域流向数据,其贸易数据不限,各组数据收集差异不限,将多形式大规模贸易数据规范统一,具有较好的灵活性、普适性。
在一种可选的实施方式中,预设统一规则包括:商品代码统一规则、贸易量数据单元统一规则;商品代码统一规则,为按照预设标准验证各年份各国家的产品海关代码是否存在变化,若存在变化则基于贸易产品名称重新划分该年份该国家的产品贸易数据;贸易量数据单元统一规则,为按照预设单位标准对贸易数量或产品单位进行筛选,若与预设单位标准不一致则进行单位转换。
本发明获取的产品贸易数据由于各国海关报告以价值为主,不以重量或数量为主,存在错误的单位、错误的分类及错误的报告,且缺乏单位换算,因此在获取产品贸易数据后需要对数据进行统一处理,按照统一标准对数据进行重新划分及单位转换,能够提高数据清洗效率。
在一种可选的实施方式中,按照预设筛选原则对统一后的产品贸易数据进行筛选,识别出缺失值数据及异常值数据的过程包括:若产品贸易数据中的贸易数量、贸易金额及贸易净重量均为零或者空白,则为缺失值数据;若产品贸易数据中的贸易数量、贸易金额及贸易净重量部分缺失,或贸易数量或贸易金额存在异常情况,则为异常值数据,其中,若产品贸易数据具有贸易金额但缺失贸易数量或贸易净重量则为第一类异常值数据,若产品贸易数据具有贸易数量或贸易净重量但缺失贸易金额则为第二类异常值数据,若存在异常情况则为第三类异常值数据。
本发明根据数据缺失及异常情况将其分为缺失值数据及异常值数据,能够通过不同的清洗算法对数据进行分项清洗,保证最小修改的清洗结果接近真实值,进而在跨行业双边产品贸易统计中获得与真实值最相近的最优清洗结果,实现对含有多重错误的贸易数据中的异常值修正。
在一种可选的实施方式中,异常情况,包括:第一异常情况:相同国家间的贸易中,同一个双边产品的贸易数量高于其他年份中位数的预设倍数;第二异常情况:相同国家间的贸易中,同一个双边产品的贸易单位价值高于其他年份中位数的预设倍数,贸易单位价值表征单位产品贸易价值,为贸易金额与贸易数量的比值;第三异常情况:不同国家间的贸易中,同一双边产品的贸易单位价值高于同一年内贸易单位价值中位数的预设倍数;若同时满足以上三种异常情况,则为第三类异常值数据,否则视为正常数据。
本发明通过对同一对贸易伙伴不同年份间的数据及不同贸易伙伴同一年份的数据进行多方面比较,满足所有异常情况时则将数据视为异常值数据,能够避免将实际存在差异但不存在异常的数据筛选出来,保证数据筛选的准确性与可靠性。
在一种可选的实施方式中,预设清洗算法包括:单位价值法及回归模型法;单位价值法为基于贸易金额与贸易数量或贸易净重量之间的函数关系,对所缺失数据进行修正;回归模型法为通过构建回归模型获取贸易数量或贸易金额与贸易年份之间的函数关系,并根据函数关系计算与当前贸易年份对应的贸易数量或贸易金额。
本发明在对缺失值数据及异常值数据进行数据清洗时,以两种清洗算法作为选择,根据数据缺失及异常情况选取不同的清洗算法进行处理,能够在保证数据清洗准确性的基础上,简化数据清洗过程,从而提高数据清洗效率。
在一种可选的实施方式中,对缺失值数据及异常值数据进行分项,根据分项结果选取对应预设清洗算法的过程包括:根据缺失值数据及异常值数据的数据缺失和异常情况,将第一类异常值数据及第二类异常值数据作为第一项数据,将缺失值异常数据及第三类异常值数据作为第二项数据;对于第一项数据,采用单位价值法进行修正,其过程为:获取对应第一类异常值数据或第二类异常值数据相对应两个贸易伙伴国家前一年的第一单位价值及后一年的第二单位价值,并获取该条数据报告国当年相同贸易流向的单位价值平均值,选取第一单位价值、第二单位价值及单位价值平均值之间的中位数作为该国与伙伴国家贸易的单位价值,基于单位价值计算与第一类异常值数据的贸易金额所对应的贸易数量或贸易净重量,或与第二类异常值数据的贸易数量或贸易净重量所对应的贸易金额;对于第二项数据,采用单位价值法及回归模型进行修正,其过程为:构建贸易数量或贸易金额与贸易年份之间的函数拟合模型,并通过预设回归模型计算函数拟合模型的模型参数,通过将模型参数带入函数拟合模型来获得与贸易年份相对应的贸易数量或贸易金额,并基于所获得的贸易数量或贸易金额,采用单位价值法对产品贸易数据中除贸易数量或贸易金额之外的其他数据进行修正。
本发明根据缺失值数据及异常值数据的数据缺失和异常情况,将缺失值数据及异常值数据进行分项,其中第一项数据只缺失部分实物价值数据,因此能够通过单位价值法进行恢复和修正。而第二项数据缺失所有的实物价值数据:贸易数量、贸易金额及贸易净重量,或者数据存在异常情况,因此只通过简单的单位价值法无法进行准确的数据恢复和修正,因此引入机器学习算法,通过历史数据获取所缺失贸易数量或贸易价值与贸易年份之间的函数关系,进而根据当前贸易年份获取对应缺失的贸易数量或贸易价值,进一步通过单位价值将其他数据进行恢复和修正,保证最小修改的清洗结果接近真实值,进而在跨行业双边产品贸易统计中获得与真实值最相近的最优清洗结果,实现对含有多重错误的贸易数据中的异常值修正,为跨区域贸易分析和决策评估提供可用数据支撑,提升了评估分析的准确性、有效性。
第二方面,本发明提供了一种贸易实物量数据清洗装置,包括:
数据获取模块,用于按照预设数据格式获取预设类型的产品贸易数据,并通过对所述产品贸易数据进行初始化处理,来删除与预设类型无关的数据;
数据筛选模块,用于按照预设统一规则对初始化后产品贸易数据进行统一,并按照预设筛选原则对统一后的产品贸易数据进行筛选,识别出缺失值数据及异常值数据;
数据清洗模块,用于对缺失值数据及异常值数据进行分项,根据分项结果选取对应预设清洗算法,并对不同项的缺失值数据或异常值数据进行数据修正。
本发明实施例提供的贸易实物量数据清洗装置,通过对获取的产品贸易数据进行初始化处理及统一处理,并按照预设筛选原则对统一后的产品贸易数据进行筛选,识别出缺失值数据及异常值数据,对缺失值数据及异常值数据进行分项,并根据分项结果选取对应的预设清洗算法,对不同项的缺失值数据或异常值数据进行数据修正。本发明通过对缺失值数据及异常值数据进行分项,选取对应清洗算法进行数据清洗,能够提高清洗过程的灵活性,提升清洗效率,保证最小修改的清洗结果接近真实值,满足后续数据分析的多元化需求。
第三方面,本发明提供了一种计算机设备,包括:存储器和处理器,存储器和处理器之间互相通信连接,存储器中存储有计算机指令,处理器通过执行计算机指令,从而执行上述第一方面或其对应的任一实施方式的贸易实物量数据清洗方法。
第四方面,本发明提供了一种计算机可读存储介质,该计算机可读存储介质上存储有计算机指令,计算机指令用于使计算机执行上述第一方面或其对应的任一实施方式的贸易实物量数据清洗方法。
附图说明
为了更清楚地说明本发明具体实施方式或现有技术中的技术方案,下面将对具体实施方式或现有技术描述中所需要使用的附图作简单地介绍,显而易见地,下面描述中的附图是本发明的一些实施方式,对于本领域普通技术人员来讲,在不付出创造性劳动的前提下,还可以根据这些附图获得其他的附图。
图1是根据本发明实施例的贸易实物量数据清洗方法的流程示意图;
图2是根据本发明实施例的贸易实物量数据清洗装置的结构框图;
图3是本发明实施例的计算机设备的硬件结构示意图。
具体实施方式
为使本发明实施例的目的、技术方案和优点更加清楚,下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域技术人员在没有做出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范围。
本发明实施例适用于对双边产品贸易数据进行数据清洗的场景。近年来,缺失值(即缺失货币值、缺失数量值以及两者都缺失)的比例有所增加。丢失的重量数据是最常见的,以下原因可能会导致数量值缺失:1)各国海关报告以价值为主,不以重量或者数量为主;2)错误的单位,部分国家对商品进出口量的衡量单位并不以重量为单位(例如以体积或者个数为单位),因此,在进行数据汇总和分析时,单位转换可能导致误差;3)缺乏单位换算,自定义数据以“数量”给出;联合国商品贸易统计数据以“净重”形式发布。UN Comtrade在填写“净重”时可能会遗漏一些数据,导致“数据丢失”;4)错误的分类,产品海关代码每五年将会更新,部分国家报告时仍使用旧的海关代码报告,因此将导致同样的产品“数量”出现在不同产品类型或代码下;5)错误的报告,部分国家在报告数据时可能存在报告错误,多报告或者少报告产品“数量”,因此将导致贸易实物量数据在某一年出现过高或者过低值。本发明实施例提供了一种贸易实物量数据清洗方法,通过双边产品贸易实物量数据分项清洗以达到清洗过程灵活、精准、高效的效果。
本发明提供了一种贸易实物量数据清洗方法的实施例,需要说明的是,在附图的流程图示出的步骤可以在诸如一组计算机可执行指令的计算机系统中执行,并且,虽然在流程图中示出了逻辑顺序,但是在某些情况下,可以以不同于此处的顺序执行所示出或描述的步骤。
在本实施例中提供了一种贸易实物量数据清洗方法,可用于上述的移动终端,如电脑等,图1是根据本发明实施例的贸易实物量数据清洗方法的流程图,如图1所示,该流程包括如下步骤:
步骤S101,按照预设数据格式获取预设类型的产品贸易数据,并通过对所述产品贸易数据进行初始化处理,来删除与预设类型无关的数据。
具体地,在本发明实施例中,通过UN Comtrade官方网站下载产品贸易数据或根据相关筛选项下载所需产品贸易数据,保存为预设数据格式。UN Comtrade官方网站下载源数据包括其他列变量数据,如贸易流代码等。因此对所得产品贸易数据进行初始化处理,删除不相关的列数据,保留所需的数据列。其中,预设数据格式包括xlsx格式、xls格式及csv格式,产品贸易数据包括贸易产品名称、产品海关代码、贸易国家(报告国和伙伴国家)、贸易年份、贸易数量、贸易净重量、贸易流向、贸易金额及产品单位,仅作为举例,不以此为限。一般情况下,贸易净重量与贸易数量一致,若单位不是重量单位时,贸易净重量则与贸易数量不一致。
步骤S102,按照预设统一规则对初始化后产品贸易数据进行统一,并按照预设筛选原则对统一后的产品贸易数据进行筛选,识别出缺失值数据及异常值数据。
具体地,在本发明实施例中,对获取的产品贸易数据按照预设统一规则进行数据统一,包括:商品代码统一规则、贸易量数据单元统一规则。
1)商品代码统一规则为按照预设标准验证各年份各国家的产品海关代码是否存在变化,若存在变化则基于贸易产品名称重新划分该年份该国家的产品贸易数据。在本发明实施例中,以UN comtrade数据平台提供的HS代码变更报告为标准,但不以此为限,验证各年份各国家报告的产品海关代码是否存在变化;若存在变化,则以贸易产品名称为依据重新划分该年份该国家的产品贸易数据;若不存在变化,无需调整。
2)贸易量数据单元统一规则为按照预设单位标准对贸易数量或产品单位进行筛选,若与预设单位标准不一致则进行单位转换。在本发明实施例中,以千克kg为单位标准,但不以此为限。筛选贸易数量或产品单位不是千克kg的数据,进行数量替换。若贸易数量为个、件、立方米、米、双等,则利用产品密度数据将其转化为单位为kg的重量数据;若产品单位不是千克kg,则利用产品单位转换参数统一为一致单位的数据。
在一些可选的实施方式中,按照预设筛选原则对统一后的产品贸易数据进行筛选,识别出缺失值数据及异常值数据,若产品贸易数据中的贸易数量、贸易金额及贸易净重量均为零或者空白,则为缺失值数据;若产品贸易数据中的贸易数量、贸易金额及贸易净重量部分缺失,或贸易数量或贸易金额存在异常情况,则为异常值数据,其中,若产品贸易数据具有贸易金额但缺失贸易数量或贸易净重量则为第一类异常值数据,若产品贸易数据具有贸易数量或贸易净重量但缺失贸易金额则为第二类异常值数据,若存在异常情况则为第三类异常值数据。
其中,异常情况,包括:第一异常情况:相同国家间的贸易中,同一个双边产品的贸易数量高于其他年份中位数的预设倍数。在本发明实施例中,预设倍数为3~8倍,但不以此为限;第二异常情况:相同国家间的贸易中,同一个双边产品的贸易单位价值高于其他年份中位数的预设倍数,即高于其他年份贸易单位价值中位数的3~8倍,贸易单位价值表征单位产品贸易价值,为贸易金额与贸易数量的比值;第三异常情况:不同国家间的贸易中,同一双边产品的贸易单位价值高于同一年内贸易单位价值中位数的预设倍数,即高于同一年份贸易单位价值中位数的3~8倍。其中,第一异常情况与第二异常情况是对同一对贸易伙伴不同年份间的数据进行比较,第三异常情况是不同贸易伙伴同一年份的数据进行比较,若同时满足以上三种异常情况,则为第三类异常值数据,否则视为正常数据。
步骤S103,对缺失值数据及异常值数据进行分项,根据分项结果选取对应预设清洗算法,并对不同项的缺失值数据或异常值数据进行数据修正。
具体地,在本发明实施例中,所采用的预设清洗算法包括单位价值法及回归模型法,单位价值法为基于贸易金额与贸易数量或贸易净重量之间的函数关系,对所缺失数据进行修正,回归模型法为通过构建回归模型获取贸易数量或贸易金额与贸易年份之间的函数关系,并根据函数关系计算与当前贸易年份对应的贸易数量或贸易金额。
在一些可选的实施方式中,数据缺失情况会影响数据清洗的难易度,如果数据缺失少只需要根据现有数据之间的关系即可进行恢复与修正,如果数据全部缺失则引入机器学习算法对其中一个数据进行预测,然后将其他数据进行补充。因此本发明实施例根据缺失值数据及异常值数据的数据缺失和异常情况,将第一类异常值数据及第二类异常值数据作为第一项数据,将缺失值异常数据及第三类异常值数据作为第二项数据,根据分项数据分别进行数据清洗。
在一些可选的实施方式中,对于第一项数据,采用单位价值法进行修正,其过程为:获取对应第一类异常值数据或第二类异常值数据相对应两个贸易伙伴国家前一年的第一单位价值及后一年的第二单位价值,并获取该条数据报告国当年相同贸易流向的单位价值平均值,选取第一单位价值、第二单位价值及单位价值平均值之间的中位数作为该国与伙伴国家贸易的单位价值,基于单位价值计算与第一类异常值数据的贸易金额所对应的贸易数量或贸易净重量,或与第二类异常值数据的贸易数量或贸易净重量所对应的贸易金额。例如,针对第一类异常值数据a和第二类异常值数据b,获取相应两个贸易伙伴国家前一年(d)或者后一年的单位价值(e),以及该条数据报告国当年相同贸易流向的单位价值平均值(f),选取三者的中位数作为该国与伙伴国家贸易的单位价值(g),第一类异常值数据a除以单位价值(g)得到贸易数量,第二类异常值数据b乘以单位价值(g)得到贸易金额。其中,中位数是指将两个贸易伙伴国家前一年的单位价值(d)或者后一年(e),以及报告国当年相同贸易流向的单位价值平均值(f)数据进行排序,假设d<f<e,排序在中间的单位价值平均值f为中位数,也就是作为该国与贸易伙伴国家的单位价值(g),以上仅作为举例,不以此为限。此外,目标贸易年份以前的数据不纳入清洗和计算范围。
在一些可选的实施方式中,对于第二项数据,采用单位价值法及回归模型进行修正,其过程为:构建贸易数量或贸易金额与贸易年份之间的函数拟合模型,并通过预设回归模型计算函数拟合模型的模型参数,通过将模型参数带入函数拟合模型来获得与贸易年份相对应的贸易数量或贸易金额,并基于所获得的贸易数量或贸易金额,采用单位价值法对产品贸易数据中除贸易数量或贸易金额之外的其他数据进行修正。例如,构建i国与伙伴国家历史年份贸易数量yi与贸易年份t的函数拟合模型,具体表达式如下所示:
yi=c+βi·t+εi
其中,c是常数项,βi为函数需要估计的参数,εi被假设为平均数等于0,标准差为σ的随机误差值,且σ被假设为对于任何t都不变。
在一些可选的实施方式中,引入支持向量机回归模型,这是一种机器学习算法,其基本思想是寻找一个从输入空间到输出空间的非线性映射函数,通过该函数将训练样本集映射到高维特征空间,并在该高维特征空间中对原始问题进行线性回归。获取历史贸易数量yi与历史贸易年份t作为训练样本{ti,yi},t为输入变量,y∈R为响应输出,n为训练样本数目,因此得到下式:
其中,w与b为待估计的参数,使得f(t)与y尽可能接近。假定f(t)与y之间的偏差最大为δ,那么当训练样本落入2δ的间隔带时,被认为是预测正确的。因此,支持向量机回归模型的数学表达式为:
其中,δ(·)为不敏感损失函数,将其定义为下式所示:
支持向量机SVR实质是在约束下,对下式优化问题进行求解:
在一些可选的实施方式中,利用拉格朗日乘子法进行参数求解,但不以此为限。引入拉格朗日乘子:依次获得拉格朗日函数:
令对求偏导并令其为0,可得:
将上式带入拉格朗日函数表达式得到:
结合函数理论求解得到:
通过优化求解得到参数后,通过输入时间变量贸易年份t,得到预测的贸易数量。进一步通过单位价值法,补齐贸易金额、贸易净重量等数据。
本发明实施例提供的贸易实物量数据清洗方法,通过对获取的产品贸易数据进行初始化处理及统一处理,并按照预设筛选原则对统一后的产品贸易数据进行筛选,识别出缺失值数据及异常值数据,对缺失值数据及异常值数据进行分项,并根据分项结果选取对应的预设清洗算法,对不同项的缺失值数据或异常值数据进行数据修正。本发明通过对缺失值数据及异常值数据进行分项,选取对应清洗算法进行数据清洗,能够提高清洗过程的灵活性,提升清洗效率,保证最小修改的清洗结果接近真实值,满足后续数据分析的多元化需求。
本实施例提供一种贸易实物量数据清洗装置,如图2所示,包括:
数据获取模块201,用于按照预设数据格式获取预设类型的产品贸易数据,并通过对所述产品贸易数据进行初始化处理,来删除与预设类型无关的数据。
数据筛选模块202,用于按照预设统一规则对初始化后产品贸易数据进行统一,并按照预设筛选原则对统一后的产品贸易数据进行筛选,识别出缺失值数据及异常值数据。
数据清洗模块203,用于对缺失值数据及异常值数据进行分项,根据分项结果选取对应预设清洗算法,并对不同项的缺失值数据或异常值数据进行数据修正。
上述各个模块和单元的更进一步的功能描述与上述对应实施例相同,在此不再赘述。
本实施例中的贸易实物量数据清洗装置是以功能单元的形式来呈现,这里的单元是指ASIC(Application Specific Integrated Circuit,专用集成电路)电路,执行一个或多个软件或固定程序的处理器和存储器,和/或其他可以提供上述功能的器件。
本发明实施例还提供一种计算机设备,具有上述图2所示的贸易实物量数据清洗装置。
请参阅图3,图3是本发明可选实施例提供的一种计算机设备的结构示意图,如图3所示,该计算机设备包括:一个或多个处理器10、存储器20,以及用于连接各部件的接口,包括高速接口和低速接口。各个部件利用不同的总线互相通信连接,并且可以被安装在公共主板上或者根据需要以其它方式安装。处理器可以对在计算机设备内执行的指令进行处理,包括存储在存储器中或者存储器上以在外部输入/输出装置(诸如,耦合至接口的显示设备)上显示GUI的图形信息的指令。在一些可选的实施方式中,若需要,可以将多个处理器和/或多条总线与多个存储器和多个存储器一起使用。同样,可以连接多个计算机设备,各个设备提供部分必要的操作(例如,作为服务器阵列、一组刀片式服务器、或者多处理器系统)。图3中以一个处理器10为例。
处理器10可以是中央处理器,网络处理器或其组合。其中,处理器10还可以进一步包括硬件芯片。上述硬件芯片可以是专用集成电路,可编程逻辑器件或其组合。上述可编程逻辑器件可以是复杂可编程逻辑器件,现场可编程逻辑门阵列,通用阵列逻辑或其任意组合。
其中,存储器20存储有可由至少一个处理器10执行的指令,以使至少一个处理器10执行实现上述实施例示出的方法。
存储器20可以包括存储程序区和存储数据区,其中,存储程序区可存储操作系统、至少一个功能所需要的应用程序;存储数据区可存储根据计算机设备的使用所创建的数据等。此外,存储器20可以包括高速随机存取存储器,还可以包括非瞬时存储器,例如至少一个磁盘存储器件、闪存器件、或其他非瞬时固态存储器件。在一些可选的实施方式中,存储器20可选包括相对于处理器10远程设置的存储器,这些远程存储器可以通过网络连接至该计算机设备。上述网络的实例包括但不限于互联网、企业内部网、局域网、移动通信网及其组合。
存储器20可以包括易失性存储器,例如,随机存取存储器;存储器也可以包括非易失性存储器,例如,快闪存储器,硬盘或固态硬盘;存储器20还可以包括上述种类的存储器的组合。
该计算机设备还包括通信接口30,用于该计算机设备与其他设备或通信网络通信。
本发明实施例还提供了一种计算机可读存储介质,上述根据本发明实施例的方法可在硬件、固件中实现,或者被实现为可记录在存储介质,或者被实现通过网络下载的原始存储在远程存储介质或非暂时机器可读存储介质中并将被存储在本地存储介质中的计算机代码,从而在此描述的方法可被存储在使用通用计算机、专用处理器或者可编程或专用硬件的存储介质上的这样的软件处理。其中,存储介质可为磁碟、光盘、只读存储记忆体、随机存储记忆体、快闪存储器、硬盘或固态硬盘等;进一步地,存储介质还可以包括上述种类的存储器的组合。可以理解,计算机、处理器、微处理器控制器或可编程硬件包括可存储或接收软件或计算机代码的存储组件,当软件或计算机代码被计算机、处理器或硬件访问且执行时,实现上述实施例示出的方法。
虽然结合附图描述了本发明的实施例,但是本领域技术人员可以在不脱离本发明的精神和范围的情况下做出各种修改和变型,这样的修改和变型均落入由所附权利要求所限定的范围之内。
Claims (6)
1.一种贸易实物量数据清洗方法,其特征在于,所述方法包括:
按照预设数据格式获取预设类型的产品贸易数据,并通过对所述产品贸易数据进行初始化处理,来删除与预设类型无关的数据;
按照预设统一规则对初始化后产品贸易数据进行统一,并按照预设筛选原则对统一后的产品贸易数据进行筛选,若所述产品贸易数据中的贸易数量、贸易金额及贸易净重量均为零或者空白,则为缺失值数据;若所述产品贸易数据中的贸易数量、贸易金额及贸易净重量部分缺失,或贸易数量或贸易金额存在异常情况,则为异常值数据,其中,若所述产品贸易数据具有贸易金额但缺失贸易数量或贸易净重量则为第一类异常值数据,若所述产品贸易数据具有贸易数量或贸易净重量但缺失贸易金额则为第二类异常值数据,若存在异常情况则为第三类异常值数据,所述异常情况,包括:第一异常情况:相同国家间的贸易中,同一个双边产品的贸易数量高于其他年份中位数的预设倍数;第二异常情况:相同国家间的贸易中,同一个双边产品的贸易单位价值高于其他年份中位数的预设倍数,所述贸易单位价值表征单位产品贸易价值,为所述贸易金额与所述贸易数量的比值;第三异常情况:不同国家间的贸易中,同一双边产品的贸易单位价值高于同一年内贸易单位价值中位数的预设倍数;若同时满足以上三种异常情况,则为第三类异常值数据,否则视为正常数据;
对所述缺失值数据及异常值数据进行分项,根据分项结果选取对应预设清洗算法,并对不同项的缺失值数据或异常值数据进行数据修正;
所述对所述缺失值数据及异常值数据进行分项,根据分项结果选取对应预设清洗算法的过程包括:
根据缺失值数据及异常值数据的数据缺失和异常情况,将第一类异常值数据及第二类异常值数据作为第一项数据,将所述缺失值数据及第三类异常值数据作为第二项数据;
对于第一项数据,采用单位价值法进行修正,其过程为:获取对应第一类异常值数据或第二类异常值数据相对应两个贸易伙伴国家前一年的第一单位价值及后一年的第二单位价值,并获取该条数据报告国当年相同贸易流向的单位价值平均值,选取所述第一单位价值、第二单位价值及单位价值平均值之间的中位数作为该国与伙伴国家贸易的单位价值,基于所述单位价值计算与所述第一类异常值数据的贸易金额所对应的贸易数量或贸易净重量,或与所述第二类异常值数据的贸易数量或贸易净重量所对应的贸易金额;
对于第二项数据,采用单位价值法及回归模型进行修正,其过程为:构建所述贸易数量或贸易金额与贸易年份之间的函数拟合模型,并通过预设回归模型计算所述函数拟合模型的模型参数,通过将所述模型参数带入所述函数拟合模型来获得与贸易年份相对应的贸易数量或贸易金额,并基于所获得的贸易数量或贸易金额,采用单位价值法对所述产品贸易数据中除贸易数量或贸易金额之外的其他数据进行修正。
2.根据权利要求1所述的方法,其特征在于,
所述预设数据格式,包括:xlsx格式、xls格式及csv格式;
所述预设类型,包括:贸易产品名称、产品海关代码、贸易国家、贸易年份、贸易数量、贸易净重量、贸易流向、贸易金额及产品单位。
3.根据权利要求2所述的方法,其特征在于,所述预设统一规则包括:商品代码统一规则、贸易量数据单元统一规则;
所述商品代码统一规则,为按照预设标准验证各年份各国家的所述产品海关代码是否存在变化,若存在变化则基于所述贸易产品名称重新划分该年份该国家的产品贸易数据;
所述贸易量数据单元统一规则,为按照预设单位标准对所述贸易数量或产品单位进行筛选,若与所述预设单位标准不一致则进行单位转换。
4.一种贸易实物量数据清洗装置,其特征在于,所述装置包括:
数据获取模块,用于按照预设数据格式获取预设类型的产品贸易数据,并通过对所述产品贸易数据进行初始化处理,来删除与预设类型无关的数据;
数据筛选模块,用于按照预设统一规则对初始化后产品贸易数据进行统一,并按照预设筛选原则对统一后的产品贸易数据进行筛选,若所述产品贸易数据中的贸易数量、贸易金额及贸易净重量均为零或者空白,则为缺失值数据;若所述产品贸易数据中的贸易数量、贸易金额及贸易净重量部分缺失,或贸易数量或贸易金额存在异常情况,则为异常值数据,其中,若所述产品贸易数据具有贸易金额但缺失贸易数量或贸易净重量则为第一类异常值数据,若所述产品贸易数据具有贸易数量或贸易净重量但缺失贸易金额则为第二类异常值数据,若存在异常情况则为第三类异常值数据,所述异常情况,包括:第一异常情况:相同国家间的贸易中,同一个双边产品的贸易数量高于其他年份中位数的预设倍数;第二异常情况:相同国家间的贸易中,同一个双边产品的贸易单位价值高于其他年份中位数的预设倍数,所述贸易单位价值表征单位产品贸易价值,为所述贸易金额与所述贸易数量的比值;第三异常情况:不同国家间的贸易中,同一双边产品的贸易单位价值高于同一年内贸易单位价值中位数的预设倍数;若同时满足以上三种异常情况,则为第三类异常值数据,否则视为正常数据;
数据清洗模块,用于对所述缺失值数据及异常值数据进行分项,根据分项结果选取对应预设清洗算法,并对不同项的缺失值数据或异常值数据进行数据修正;
所述对所述缺失值数据及异常值数据进行分项,根据分项结果选取对应预设清洗算法的过程包括:
根据缺失值数据及异常值数据的数据缺失和异常情况,将第一类异常值数据及第二类异常值数据作为第一项数据,将所述缺失值数据及第三类异常值数据作为第二项数据;
对于第一项数据,采用单位价值法进行修正,其过程为:获取对应第一类异常值数据或第二类异常值数据相对应两个贸易伙伴国家前一年的第一单位价值及后一年的第二单位价值,并获取该条数据报告国当年相同贸易流向的单位价值平均值,选取所述第一单位价值、第二单位价值及单位价值平均值之间的中位数作为该国与伙伴国家贸易的单位价值,基于所述单位价值计算与所述第一类异常值数据的贸易金额所对应的贸易数量或贸易净重量,或与所述第二类异常值数据的贸易数量或贸易净重量所对应的贸易金额;
对于第二项数据,采用单位价值法及回归模型进行修正,其过程为:构建所述贸易数量或贸易金额与贸易年份之间的函数拟合模型,并通过预设回归模型计算所述函数拟合模型的模型参数,通过将所述模型参数带入所述函数拟合模型来获得与贸易年份相对应的贸易数量或贸易金额,并基于所获得的贸易数量或贸易金额,采用单位价值法对所述产品贸易数据中除贸易数量或贸易金额之外的其他数据进行修正。
5.一种计算机设备,其特征在于,包括:
存储器和处理器,所述存储器和所述处理器之间互相通信连接,所述存储器中存储有计算机指令,所述处理器通过执行所述计算机指令,从而执行权利要求1至3中任一项所述的贸易实物量数据清洗方法。
6.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质上存储有计算机指令,所述计算机指令用于使计算机执行权利要求1至3中任一项所述的贸易实物量数据清洗方法。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202310821997.6A CN116842320B (zh) | 2023-07-05 | 2023-07-05 | 一种贸易实物量数据清洗方法、装置、设备及介质 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202310821997.6A CN116842320B (zh) | 2023-07-05 | 2023-07-05 | 一种贸易实物量数据清洗方法、装置、设备及介质 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| CN116842320A CN116842320A (zh) | 2023-10-03 |
| CN116842320B true CN116842320B (zh) | 2024-10-29 |
Family
ID=88168552
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| CN202310821997.6A Active CN116842320B (zh) | 2023-07-05 | 2023-07-05 | 一种贸易实物量数据清洗方法、装置、设备及介质 |
Country Status (1)
| Country | Link |
|---|---|
| CN (1) | CN116842320B (zh) |
Families Citing this family (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN118484451B (zh) * | 2024-07-16 | 2024-11-12 | 大连瀚闻资讯有限公司 | 一种用于国际贸易统计数据大规模运算的数据预处理方法 |
| CN119247238A (zh) * | 2024-09-11 | 2025-01-03 | 广东电网有限责任公司 | 一种计量自动化系统的异常值识别方法及装置 |
Citations (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN109800220A (zh) * | 2019-01-29 | 2019-05-24 | 浙江国贸云商企业服务有限公司 | 一种大数据清洗方法、系统及相关装置 |
Family Cites Families (5)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20020143604A1 (en) * | 2001-02-02 | 2002-10-03 | Wisconsin Alumni Research Foundation | Method for forecasting the effects of trade policies and supply and demand conditions on the world dairy sector |
| CN110348647B (zh) * | 2019-01-21 | 2020-11-03 | 罗斌 | 一种全球贸易大数据智能分析系统及方法 |
| CN110543903B (zh) * | 2019-08-23 | 2022-02-15 | 国网江苏省电力有限公司电力科学研究院 | 一种gis局部放电大数据系统的数据清洗方法及系统 |
| CN112988725A (zh) * | 2021-03-15 | 2021-06-18 | 广东电网有限责任公司清远供电局 | 一种输电线路数据清洗方法、系统、电子设备和存储介质 |
| CN115145900B (zh) * | 2022-06-30 | 2026-03-20 | 南京林业大学 | 一种电动汽车动力电池大数据清洗方法 |
-
2023
- 2023-07-05 CN CN202310821997.6A patent/CN116842320B/zh active Active
Patent Citations (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN109800220A (zh) * | 2019-01-29 | 2019-05-24 | 浙江国贸云商企业服务有限公司 | 一种大数据清洗方法、系统及相关装置 |
Also Published As
| Publication number | Publication date |
|---|---|
| CN116842320A (zh) | 2023-10-03 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US20230410135A1 (en) | System and method for selecting promotional products for retail | |
| CN111797928B (zh) | 生成机器学习样本的组合特征的方法及系统 | |
| CN111367961A (zh) | 基于图卷积神经网络的时序数据事件预测方法、系统及其应用 | |
| EP2290594A1 (en) | Adaptative analytics multidimensional processing system | |
| KR20240008374A (ko) | 머신 러닝 시계열 이상 검출 | |
| CN116842320A (zh) | 一种贸易实物量数据清洗方法、装置、设备及介质 | |
| CN118643467B (zh) | 基于多特征融合和二维时间卷积网络的日径流预测方法 | |
| AU2020321734A1 (en) | Indiagnostics framework for large scale hierarchical time-series forecasting models | |
| CN117764638B (zh) | 一种供电企业售电数据预测方法、系统、设备及存储介质 | |
| CN108876458A (zh) | 一种基于网络爬虫的商品动态预测方法及系统 | |
| CN110874640A (zh) | 使用机器学习(ml)的间歇数据的分布选择和模拟 | |
| CN120931323A (zh) | 一种基于信息监控的药品销售管理的方法及系统 | |
| CN111177132B (zh) | 关系型数据的标签清洗方法、装置、设备及存储介质 | |
| CN115860273B (zh) | 用电负荷预测方法、装置、计算机设备和存储介质 | |
| CN115759885B (zh) | 一种基于分布式物资供应下的物资抽检方法和装置 | |
| US20240005259A1 (en) | Index modeling | |
| CN114168642A (zh) | 产品需求异常数据的检测方法、设备和存储介质 | |
| CN113554223A (zh) | 一种获得税收预测结果的方法、装置及电子设备 | |
| Archana et al. | Actual rate prediction: extension in real estate prediction using machine learning | |
| CN117036008B (zh) | 一种多源数据的自动化建模方法及系统 | |
| CN111984636B (zh) | 数据建模方法和装置、设备及存储介质 | |
| US11768673B2 (en) | Identifying protocol recommendations for application data objects | |
| US20240337486A1 (en) | Sensor reading correction | |
| CN115455019B (zh) | 一种针对用户行为的分类模型更新方法、装置及设备 | |
| US20240337487A1 (en) | Sensor reading correction |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PB01 | Publication | ||
| PB01 | Publication | ||
| SE01 | Entry into force of request for substantive examination | ||
| SE01 | Entry into force of request for substantive examination | ||
| GR01 | Patent grant | ||
| GR01 | Patent grant |