CN117528552B - 一种基于5g的手机数据传输方法和系统 - Google Patents
一种基于5g的手机数据传输方法和系统 Download PDFInfo
- Publication number
- CN117528552B CN117528552B CN202410022968.8A CN202410022968A CN117528552B CN 117528552 B CN117528552 B CN 117528552B CN 202410022968 A CN202410022968 A CN 202410022968A CN 117528552 B CN117528552 B CN 117528552B
- Authority
- CN
- China
- Prior art keywords
- data
- base station
- sequence
- time
- service
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Classifications
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04W—WIRELESS COMMUNICATION NETWORKS
- H04W16/00—Network planning, e.g. coverage or traffic planning tools; Network deployment, e.g. resource partitioning or cells structures
- H04W16/22—Traffic simulation tools or models
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
- G06N3/092—Reinforcement learning
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04L—TRANSMISSION OF DIGITAL INFORMATION, e.g. TELEGRAPHIC COMMUNICATION
- H04L41/00—Arrangements for maintenance, administration or management of data switching networks, e.g. of packet switching networks
- H04L41/16—Arrangements for maintenance, administration or management of data switching networks, e.g. of packet switching networks using machine learning or artificial intelligence
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04W—WIRELESS COMMUNICATION NETWORKS
- H04W24/00—Supervisory, monitoring or testing arrangements
- H04W24/02—Arrangements for optimising operational condition
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04W—WIRELESS COMMUNICATION NETWORKS
- H04W24/00—Supervisory, monitoring or testing arrangements
- H04W24/06—Testing, supervising or monitoring using simulated traffic
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04W—WIRELESS COMMUNICATION NETWORKS
- H04W36/00—Hand-off or reselection arrangements
- H04W36/08—Reselecting an access point
-
- Y—GENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
- Y02—TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
- Y02D—CLIMATE CHANGE MITIGATION TECHNOLOGIES IN INFORMATION AND COMMUNICATION TECHNOLOGIES [ICT], I.E. INFORMATION AND COMMUNICATION TECHNOLOGIES AIMING AT THE REDUCTION OF THEIR OWN ENERGY USE
- Y02D30/00—Reducing energy consumption in communication networks
- Y02D30/70—Reducing energy consumption in communication networks in wireless communication networks
Landscapes
- Engineering & Computer Science (AREA)
- Computer Networks & Wireless Communication (AREA)
- Signal Processing (AREA)
- Software Systems (AREA)
- Artificial Intelligence (AREA)
- Theoretical Computer Science (AREA)
- Evolutionary Computation (AREA)
- Physics & Mathematics (AREA)
- Biomedical Technology (AREA)
- Data Mining & Analysis (AREA)
- Health & Medical Sciences (AREA)
- Life Sciences & Earth Sciences (AREA)
- Databases & Information Systems (AREA)
- Biophysics (AREA)
- Computational Linguistics (AREA)
- Medical Informatics (AREA)
- General Health & Medical Sciences (AREA)
- Molecular Biology (AREA)
- Computing Systems (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Mathematical Physics (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Mobile Radio Communication Systems (AREA)
Abstract
本发明属于数据传输技术领域,本发明公开了一种基于5G的手机数据传输方法和系统;包括接收规划数据;构建移动设备与n个5G基站之间的博弈资源对抗模型;利用Q学习方法对博弈资源对抗模型迭代计算求解;得到值矩阵;采集历史移动设备数据;根据历史移动设备数据建立用于预测联合状态的深度序列学习模型,根据预测的联合状态构建移动设备时间序列状态;联立值矩阵和移动设备时间序列状态,构建时序值矩阵;将时序值矩阵采用深度强化学习方法获取最优切换决策序列,根据所述最优切换决策序列分时段发起移动设备的切换请求,融合个体建模、业务感知和全局优化为一体实现了稳定的5G网络运维。
Description
技术领域
本发明涉及数据传输技术领域,更具体地说,本发明涉及一种基于5G的手机数据传输方法和系统。
背景技术
申请公开号为CN116527572A的专利公开了一种基于5G的多路径数据传输系统,包括:主控模块:作为整个系统的核心,控制系统的运行;5G模组:搭载至少两个5G模块,与主控模块进行通信,通过多路径传输控制协议,聚合两条5G链路,实现5G多路径数据的传输;数据交互模块:与外部设备构成局域网,并与主控模块进行通信,实现数据的采集;人机交互模块:与主控模块进行通信,实现系统的控制和交流。本发明实现了MPTCP和5G技术的融合,成功将不同运营商的5G通信链路聚合,解决了现有5G网络目前覆盖性能较差、上行速率受限以及基站分布不均匀,导致不能满足日益增长的高速通信和基于物联网的应用需求问题。
申请公开号为CN115551093A的专利公开了一种5G基站的低时延数据传输方法,包括步骤:S1、将5G基站与用户终端建立连;S2、在5G基站侧配置与用户终端对应的多个实体;S3、配置允许的最大传输时延参数T;S4、根据最大传输时延参数T进行数据传输。本发明通过设置最大时延参数来控制数据传输的时间,如果发现超时,则立即删除该超时数据,并统计超时传输的次数,重新配置资源调度的优先等级,这样,可以有效减少空口资源的浪费,提高数据传输的时效性,进一步降低时延。
目前,随着5G网络的快速建设,大量新业务和应用涌现,这给网络的稳定运维带来了前所未有的挑战,现有的网络切换机制存在明显的缺陷,主要体现为:在移动性预测上,仍停留在传统的静态分析,无法实现设备个体精确建模,预测结果存在大量偏差,在业务感知上,现网络对新业务理解不够,无法根据业务场景实时调整手段,另外,各类网络调度措施之间缺乏协同,无法做到统筹兼顾,难以实现用户体验和网络收益的双赢;例如,在高铁场景中,因线路骤变,若无法准确预测旅客移动轨迹,将导致频繁错切、信令大量耗费的严重问题,再如针对新兴的AR/VR超高清视频业务,若网络无法感知识别业务形式,仍将其作为普通数据流对待,继而导致抖动大、延时长的失败体验,此外,在城市商圈区域,各类网络主体(运营商/第三方服务商等)可能针对自己侧采取本地优化,这将造成区域网络整体效率大幅下降的局面这些问题的存在,严重制约了运营商提升5G网络运维水平的能力,也无法满足用户日益增长的网络体验需求。
鉴于此,本发明提出一种基于5G的手机数据传输方法和系统以解决上述问题。
发明内容
为了克服现有技术的上述缺陷,为实现上述目的,本发明提供如下技术方案:一种基于5G的手机数据传输方法,包括:
S1、采集设备业务参数、设备数据和基站数据;
S2、根据设备业务参数计算收益值,根据设备数据和收益值构建设备加权函数;根据基站数据构建基站加权函数;根据设备加权函数和基站加权函数构建移动设备与n个5G基站之间的博弈资源对抗模型;
S3、利用强化学习中的Q学习方法对博弈资源对抗模型迭代计算求解;得到值矩阵;
S4、采集历史移动设备数据;根据历史移动设备数据建立用于预测联合状态的深度序列学习模型,根据预测的联合状态构建移动设备时间序列状态;
S5、联立值矩阵和移动设备时间序列状态,构建时序值矩阵;将时序值矩阵采用深度强化学习方法获取最优切换决策序列,根据所述最优切换决策序列分时段发起移动设备的切换请求。
进一步地,所述设备业务参数包括数据业务平均吞吐量、单位数据吞吐量收入、语音业务平均持续时间、单位时间语音收入、视频业务平均码率和单位视频码率收入;
所述设备数据包括平均时延和移动性开销;所述基站数据包括基站负载提升值和平均传输功率;
所述收益值的计算方式包括:
收益值;
其中,为数据业务平均吞吐量;为单位数据吞吐量收入;为语音业务平均持续时间;为单位时间语音收入;为视频业务平均码率;为单位视频码率收入;
所述平均时延是一个预定义的业务质量统计参数,由网络侧的质量监控系统实时统计汇总,直接调用;
测算移动设备切换前后的位置变化,即为移动性开销;
获取移动设备在切换前后的位置坐标;通过移动设备自身的GPS或定位模块获取切换前后的位置坐标,并上报网络侧;网络侧收到位置坐标后,按照坐标系的计算方法获得两位置之间的距离ds;查询移动设备的类型参数,获取其平均移动速度V;移动时间开销=距离ds/平均速度V;移动时间开销即为移动性开销;
构建设备加权函数;
其中,、和为设备权重参数;
所述博弈资源对抗模型的构建方式包括:
获取参与博弈决策的每个移动设备,确定移动设备的唯一标识ID;获取每个移动设备当前所运行的业务类型;将每个移动设备定义设备动作空间,设备动作空间包括移动设备可申请切换的L个相邻基站;
获取移动设备周边参与博弈决策的每个基站,确定基站的唯一标识ID;获取每个基站的网络频谱资源信息和基站参数;将每个基站定义基站动作空间,基站动作空间包括接受切换请求和拒绝切换请求;
移动设备接入后,计算基站负载提升值;
基站负载提升值的计算过程包括:
获取基站的当前业务数N和移动设备的业务类型;根据业务类型查询对应类业务的平均占用带宽BW_语音、BW_数据和BW_视频;
计算基站当前总占用带宽BW_总=N×BW_语音+N×BW_数据+N×BW_视频;
移动设备接入后,总业务数变为N+1,则总占用带宽为BW_新总=(N+1)×BW_语音+(N+1)×BW_数据+(N+1)×BW_视频;带宽提升量BW_提升=BW_新总-BW_总;
带宽提升量与基站总带宽计算负载提升=BW_提升/基站总带宽;
查表获取移动设备的平均传输功率;
构建基站加权函数;
其中,和为基站权重参数;
结合设备加权函数和基站加权函数获取博弈资源对抗模型;
博弈资源对抗模型。
进一步地,所述Q值矩阵的获取过程包括:
S301、定义博弈资源对抗模型中的状态空间和动作空间;其中,状态空间表示场景数量;动作空间表示每种状态下可供移动设备或基站选择执行的不同行为数量;初始化一个存储状态-动作值函数的矩阵,其中矩阵的大小为,矩阵的行表示状态,列表示动作;矩阵中的每个元素表示在状态下选择执行动作对应的价值,初始化全部矩阵元素为0;
S302、设定迭代终止条件,迭代终止条件为最大迭代数M或矩阵元素值变化小于设置阈值p;设定Q学习算法的参数,参数包括学习率,折扣因子,在ε贪婪策略中探索概率ε;
S303、基于ε贪婪策略以固定概率ε选择当前值最大的动作,同时以1-ε概率随机选择一个动作;执行所选择的动作后,环境状态从转移到,并产生一个即时收益;收集执行动作后环境的反馈,反馈包括新的状态和即时收益;
S304、更新;
更新公式为;
式中,为环境状态;为在状态下可选择执行的动作;为即时收益;为执行完动作后的新的环境状态;为学习率;为折扣因子;为下一状态下所有可能的动作对应的值最大值;为更新符号;
S305、判断是否满足终止条件,若不满足则继续更新;若满足则得到状态空间下的值矩阵。
进一步地,所述历史移动设备数据包括历史定位轨迹数据和历史业务数据;
历史定位轨迹数据包括设备经纬度坐标及其对应的设备定位时间戳;
历史业务数据包括业务类型、业务流量和网络连接数及其对应的时间戳;
联合状态为未来f天的定位轨迹数据和业务数据;
深度序列学习模型为联立定位预测模型和参数预测模型获取;
定位预测模型获取方式包括:
将历史定位轨迹数据作为测试数据集,并进行曲线拟合;
曲线拟合过程包括:
用线性多项式拟合曲线、二次多项式拟合曲线和三次多项式分别进行拟合曲线;线性多项式拟合曲线为;二次多项式拟合曲线;三次多项式拟合曲线;式中,为设备定位时间戳;为设备经纬度坐标;、、和为待求的参数,均通过曲线拟合得出;
计算线性多项式、二次多项式和三次多项式拟合曲线的预测点位误差;预测点位误差;
其中,实际值为测试数据集中的真实值;预测值为拟合曲线计算的预测值;为测试数据集大小;
选取多项式拟合曲线、二次多项式拟合曲线和三次多项式拟合曲线中预测点位误差最小的拟合曲线,即最佳拟合的曲线;最佳拟合的曲线即为定位预测模型。
进一步地,参数预测模型为ARIMA时间序列预测模型,其获取方式包括:
采集最近r天内的历史业务数据作为历史样本,历史样本中包括4个字段;4个字段分别为时间戳、业务类型、业务流量和网络连接数;将历史样本按照时间顺序构建输入样本矩阵,每一行代表一个采样点位;
将输入样本矩阵的数据进行预处理;将24小时的全天数据依照分时段划分为g个时段区间,统计计算每个时段区间内各类业务数据所占比重,得到不同业务类别在各个时间段内的分布统计量;用于相应调整预测结果;
将网络连接数的时间序列数据建立ARIMA自回归滑动平均模型;进行平稳性检验,对不满足稳定条件的序列进行差分处理,直至达到稳定条件;
确定时间序列的AR和MA阶数,配置ARIMA(p,d,q)模型的参数;
利用配置好的参数将ARIMA自回归滑动平均模型训练和优化,输入训练数据为预处理的输入样本矩阵,训练目标为预测未来f天内每小时的网络连接数;获得未来f天内网络连接数的时间序列;训练完成的ARIMA自回归滑动平均模型即为参数预测模型。
进一步地,所述联立定位预测模型和参数预测模型获取深度序列学习模型的方式包括:
将过去r天的历史定位轨迹数据和历史业务数据作为历史训练集;将预测得到的未来f天内设备经纬度坐标及其对应的定位时间戳、业务类型、业务流量和网络连接数及其对应的时间戳;利用时间戳进行时间对齐,并作为未来数据集;
构建卷积神经网络LSTM模型;输入层为历史训练集和未来数据集拼接而成的三维矩阵;
卷积神经网络LSTM模型包括卷积层、池化层、LSTM层和全连接层;编译卷积神经网络LSTM模型,配置优化器和损失函数;
优化器选用Adam算法;Adam算法基于优化随机梯度下降,自适应地对学习率进行调整;
损失函数选用均方误差;
其中,为样本数量;为模型预测得到的第个样本输出;为第个样本真实的标签输出;
函数计算预测值和真实值之间的均方差,惩罚得到的损失数值越小模型效果越好;以历史训练集为卷积神经网络LSTM模型输入,训练目标是预测出未来数据集;
将历史训练集按照批大小分批输入卷积神经网络LSTM模型,卷积神经网络LSTM模型输出一批预测结果;计算这一批预测结果和未来数据集批之间的均方误差函数值;利用反向传播算法,将损失误差沿着模型计算图反方向回传,更新每层的卷积神经网络LSTM模型的参数;
当训练达到预定的迭代轮数后,获得最终训练好的深度序列学习模型;使用训练好的深度序列学习模型进行预测;输入给定的过去r天历史数据,深度序列学习模型预测输出未来f天的联合状态。
进一步地,所述移动设备时间序列状态的构建方式包括:
根据预测的联合状态,提取未来f天内的时间戳、经纬度坐标、业务类型、业务流量和网络连接数;将提取的数据重新组织成v个时间序列,时间序列状态包括时间戳序列、经纬度坐标时间序列、业务类型时间序列、业务流量时间序列和网络连接数时间序列;即构建出移动设备在未来f天内的移动设备时间序列状态;
所述时序值矩阵的构建方式包括:
从移动设备时间序列状态中,提取所有时刻的状态参数,构成状态空间S,状态参数包括移动设备当前所运行的业务类型、移动设备的位置坐标和运动速度;业务类型包括语音业务、视频业务和数据业务;
从值矩阵中,提取移动设备所有可选择的基站切换动作,构成动作空间A;初始化存储状态-动作值的时序矩阵;时序矩阵的行表示不同时刻的设备状态,时序矩阵表示L个相邻基站作为基站切换动作;矩阵元素表示在状态下选择动作的价值,初始化为0。
进一步地,所述时序值矩阵采用深度强化学习方法获取最优切换决策序列的过程包括:
构建深度强化学习模型为端到端的深度神经网络,输入为设备的状态,输出为当前状态下各个基站切换动作的值;
深度强化学习模型内部结构包括卷积层、LSTM循环层和全连接层,卷积层负责提取输入状态的时空特征表示,LSTM层负责挖掘状态序列的时序关联特征,全连接层完成状态动作值函数的估计;
令马尔可夫决策过程(MDP)的五元组中即时奖励为;通过采取时序上的折扣累积方法定义总奖励,公式为:;
其中,是数值为0-1的折扣因子;为决策序列终止时刻;表示的是当前的时间点,从该时刻开始计算一个序列中的累积折扣收益;模型的目标是配置参数使得总奖励最大化;
深度强化学习模型训练目标是逼近状态-动作值函数,在每一训练步,输入一个采样状态,模型预测输出当前状态下各个基站切换动作对应的值;执行动作后环境给出反馈的实际即时奖励;计算预测值和实际奖励的误差,通过损失函数反向传播更新模型参数;
在训练完成深度强化学习模型后,输入需要决策的时序状态,模型输出该状态下,不同基站切换动作对应的值,根据值最大选择基站,推演形成整个序列,计算序列总奖励,输出总奖励最大的最终序列,作为最优切换决策。
进一步地,所述根据所述最优切换决策序列分时段发起移动设备的切换请求的过程包括:
S501、最优切换决策序列按照时间顺序给出了从时刻t1到tN,移动设备在每个时间点需要切换到的目标基站;网络侧得到最优切换序列后,转换为信令交互过程;
S502、在时刻t1,网络侧向移动设备发送切换命令,通知设备切换到对应目标基站;移动设备收到切换命令后,向网络发送切换准备就绪信令;网络侧向源基站发送资源释放信令,向目标基站发送资源准备信令;
S503、源基站响应,释放移动设备占用资源;目标基站响应,预留资源;网络侧向移动设备发送确认信令,授权其执行切换资源重配置流程;移动设备与目标基站进行随机接入,完成切换;
S504、按照时间顺序,每到最优切换序列给出的时刻,重复执行S501-S503,完成切换,到时刻tN全部切换完成。
一种基于5G的手机数据传输系统,其基于所述的一种基于5G的手机数据传输方法实现,包括:收集接收模块,用于采集设备业务参数、设备数据和基站数据;
对抗模型构造模块,用于根据设备业务参数计算收益值,根据设备数据和收益值构建设备加权函数;根据基站数据构建基站加权函数;根据设备加权函数和基站加权函数构建移动设备与n个5G基站之间的博弈资源对抗模型;
求解模块,用于利用强化学习中的Q学习方法对博弈资源对抗模型迭代计算求解;得到值矩阵;
状态构建模块,用于采集历史移动设备数据;根据历史移动设备数据建立用于预测联合状态的深度序列学习模型,根据预测的联合状态构建移动设备时间序列状态;
决策实施模块,用于联立值矩阵和移动设备时间序列状态,构建时序值矩阵;将时序值矩阵采用深度强化学习方法获取最优切换决策序列,根据所述最优切换决策序列分时段发起移动设备的切换请求。
本发明一种基于5G的手机数据传输方法和系统的技术效果和优点:
实现了智能感知和业务关联的移动网络切换新机制;通过构建序列学习模型,实现移动设备个体级别的高精度移动性预测,准确得到用户未来的服务需求和网络连接趋势,大幅减少预测偏差;通过建立移动设备与网络资源之间的关联认知模型,进行面向业务场景的切换控制,按照业务优先级进行基站动态切换,极大提升用户感知体验;本实施例利用强化学习算法,在保证单个用户效果提升的同时,实现了整个网络全局收益的最大化,获得考虑各方博弈的最优网络切换均衡解;融合个体建模、业务感知和全局优化为一体实现了稳定的5G网络运维。
附图说明
图1为本发明的一种基于5G的手机数据传输方法示意图;
图2为本发明的一种基于5G的手机数据传输系统示意图;
图3为本发明的电子设备示意图;
图4为本发明的存储介质示意图。
具体实施方式
下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范围。
实施例1
请参阅图1所示,本实施例所述一种基于5G的手机数据传输方法,包括:
S1、采集设备业务参数、设备数据和基站数据;
S2、根据设备业务参数计算收益值,根据设备数据和收益值构建设备加权函数;根据基站数据构建基站加权函数;根据设备加权函数和基站加权函数构建移动设备与n个5G基站之间的博弈资源对抗模型;
S3、利用强化学习中的Q学习方法对博弈资源对抗模型迭代计算求解;得到值矩阵;
S4、采集历史移动设备数据;根据历史移动设备数据建立用于预测联合状态的深度序列学习模型,根据预测的联合状态构建移动设备时间序列状态;
S5、联立值矩阵和移动设备时间序列状态,构建时序值矩阵;将时序值矩阵采用深度强化学习方法获取最优切换决策序列,根据所述最优切换决策序列分时段发起移动设备的切换请求;
所述设备业务参数包括数据业务平均吞吐量、单位数据吞吐量收入、语音业务平均持续时间、单位时间语音收入、视频业务平均码率和单位视频码率收入;
所述设备数据包括平均时延和移动性开销;所述基站数据包括基站负载提升值和平均传输功率;
所述收益值的计算方式包括:
收益值;
其中,为数据业务平均吞吐量;为单位数据吞吐量收入;为语音业务平均持续时间;为单位时间语音收入;为视频业务平均码率;为单位视频码率收入;
所述平均时延是一个预定义的业务质量统计参数,由网络侧的质量监控系统实时统计汇总,直接调用;
测算移动设备切换前后的位置变化,即为移动性开销;
获取移动设备在切换前后的位置坐标;通过移动设备自身的GPS或定位模块获取切换前后的位置坐标,并上报网络侧;网络侧收到位置坐标后,按照坐标系的计算方法获得两位置之间的距离ds;查询移动设备的类型参数,获取其平均移动速度V;移动时间开销=距离ds/平均速度V;移动时间开销即为移动性开销;
构建设备加权函数;
其中,、和为设备权重参数;其中,、和的获取是通过回归分析和最小二乘法来拟合历史数据实现的;
进一步的,所述博弈资源对抗模型的构建方式包括:
获取参与博弈决策的每个移动设备,确定移动设备的唯一标识ID;获取每个移动设备当前所运行的业务类型,确定移动设备当前所运行是语音/视频/数据业务;将每个移动设备定义设备动作空间,设备动作空间包括移动设备可申请切换的L个相邻基站;
需要说明的是,数据业务平均吞吐量的获取方式为收集移动设备在各基站的历史业务数据;统计计算数据业务流量时间占比;数据吞吐量=数据流量/数据业务占比时间;
单位数据吞吐量收入的获取方式为查阅运营商计费政策;数据业务收费按流量计费,即1KB流量的收费价格;单位数据吞吐量收入=每KB流量收费价格/1024;
语音业务平均持续时间的获取方式为收集语音业务建立时长数据,统计计算全部语音业务的平均持续时间;
单位时间语音收入的获取方式为查阅运营商计费政策;语音业务按时间计费,即每分钟通话时间的收费价格;
视频业务平均码率的获取方式为收集移动设备视频业务的码率大小数据;统计计算全部视频业务的平均码率;
单位视频码率收入的获取方式为查阅运营商计费政策,视频业务按流量计费,即每MB视频流量的收费价格;单位码率收入=视频收费价格/码率大小;
需要解释的是,所述坐标系的计算方法包括:
假设移动设备切换前坐标为,切换后坐标为;则两坐标之间的距离计算公式为;就是基于笛卡尔坐标系的两点间距离计算公式,网络侧获取到设备的两位置坐标后,可据此计算直线距离;
获取移动设备周边参与博弈决策的每个基站,确定基站的唯一标识ID;获取每个基站的网络频谱资源信息和基站参数;将每个基站定义基站动作空间,基站动作空间包括接受切换请求和拒绝切换请求;
移动设备接入后,计算基站负载提升值;
基站负载提升值的计算过程包括:
获取基站的当前业务数N和移动设备的业务类型;根据业务类型查询对应类业务的平均占用带宽BW_语音、BW_数据和BW_视频;
计算基站当前总占用带宽BW_总=N×BW_语音+N×BW_数据+N×BW_视频;
移动设备接入后,总业务数变为N+1,则总占用带宽为BW_新总=(N+1)×BW_语音+(N+1)×BW_数据+(N+1)×BW_视频;带宽提升量BW_提升=BW_新总-BW_总;
带宽提升量与基站总带宽计算负载提升=BW_提升/基站总带宽;
查表获取移动设备的平均传输功率;
构建基站加权函数;
其中,和为基站权重参数;
结合设备加权函数和基站加权函数获取博弈资源对抗模型;
博弈资源对抗模型;
博弈资源对抗模型即为最大化所有移动设备的加权函数之和减去所有基站的加权函数之和;
进一步的,所述Q值矩阵的获取过程包括:
S301、定义博弈资源对抗模型中的状态空间和动作空间;其中,状态空间表示场景数量;动作空间表示每种状态下可供移动设备或基站选择执行的不同行为数量;初始化一个存储状态-动作值函数的矩阵,其中矩阵的大小为,矩阵的行表示状态,列表示动作;矩阵中的每个元素表示在状态下选择执行动作对应的价值,初始化全部矩阵元素为0;
S302、设定迭代终止条件,迭代终止条件为最大迭代数M或矩阵元素值变化小于设置阈值p;同时设定Q学习算法需要的参数,参数包括学习率,折扣因子,ε贪婪策略中探索概率ε;其中,学习率表示更新矩阵时当前信息和历史信息的权重比例;折扣因子表示评估当前收益和未来收益的重要性;ε贪婪策略以ε概率随机选择动作,以1-ε概率选择Q值最大动作;
需要说明的是,最大迭代数M可根据实际情况设定;
阈值p的设置方式包括:
先使用较大p值,快速预训练,确定训练次数级别;然后从中选择一定比例,如设置为预训练次数的10%左右;以上次数作为阈值下限;上限可以设置的更大一些;在上下限范围中试验,选取一个较优的p;
S303、基于ε贪婪策略以固定概率ε选择当前值最大的动作,同时以1-ε概率随机选择一个动作;执行所选择的动作后,环境状态从转移到,并产生一个即时收益;收集执行动作后环境的反馈,反馈包括新的状态和即时收益;
S304、更新;
更新公式为;
式中,为环境状态;对博弈问题来说,指博弈场景中参与博弈各方(移动用户、基站)的状态参数的总体描述;为在状态下可选择执行的动作;博弈问题中指参与博弈各方的不同决策选择;为即时收益,选择某动作后环境产生的立即的收益;对博弈问题,指执行一决策的直接结果;为执行完动作后的新的环境状态,一个动作会改变博弈场景,带来新的状态;为学习率,更新时当前值和历史值的权重比例;越大,越重视新信息;一般取0-1区间数值;为折扣因子,考虑当前收益和未来收益的重要性程度;取值越大,表明未来收益更重要,一般取0-1区间数值;为下一状态下所有可能的动作对应的值最大值;为更新符号;
S305、判断是否满足终止条件,若不满足则继续更新;若满足则得到状态空间下的值矩阵;
需要说明的是,Q学习是一个值函数逼近算法,其基本思想是通过试错学习一个行为价值函数(Q函数),用于评估在给定状态下采取动作的长期收益价值;其目标是找到一个策略π,该策略可以最大化长期收益;
进一步的,所述历史移动设备数据包括历史定位轨迹数据和历史业务数据;
历史定位轨迹数据包括设备经纬度坐标及其对应的设备定位时间戳;
历史业务数据包括业务类型、业务流量和网络连接数及其对应的时间戳;
需要说明的是,移动设备通过自身的GPS模块或基站定位模块,周期性获取设备在基站覆盖区域内的精确经纬度坐标;同时通过设备本地时钟,获取坐标采集时所对应的时间戳;将采集到的经纬度坐标数据和对应时间戳在本地存储,并定期上报到网络侧数据库;
利用网络侧核心网网元,例如,HSS存储每台移动设备的业务控制信息;可统计提取每台设备在服务期内的语音/视频/数据业务开通和关闭的业务类型、持续时长、流量大小等参数;同时绑定业务发生时间的时间戳;最终形成设备级别的业务类型、流量大小、网络连接数与时间戳的对应历史业务数据
联合状态为未来f天的定位轨迹数据和业务数据;
深度序列学习模型为联立定位预测模型和参数预测模型获取;
定位预测模型获取方式包括:
将历史定位轨迹数据作为测试数据集,并进行曲线拟合;
曲线拟合过程包括:
用线性多项式拟合曲线、二次多项式拟合曲线和三次多项式分别进行拟合曲线;线性多项式拟合曲线为;二次多项式拟合曲线;三次多项式拟合曲线;式中,为设备定位时间戳;为设备经纬度坐标;、、和为待求的参数,均通过曲线拟合得出;
计算线性多项式、二次多项式和三次多项式拟合曲线的预测点位误差;预测点位误差;
其中,实际值为测试数据集中的真实值;预测值为拟合曲线计算的预测值;为测试数据集大小;
选取多项式拟合曲线、二次多项式拟合曲线和三次多项式拟合曲线中预测点位误差最小的拟合曲线,即最佳拟合的曲线;最佳拟合的曲线即为定位预测模型,利用定位预测模型预测未来f天内的设备经纬度坐标及其对应的定位时间戳;
参数预测模型为ARIMA时间序列预测模型,其获取方式包括:
采集最近r天内的历史业务数据作为历史样本,历史样本中包括4个字段;4个字段分别为时间戳、业务类型、业务流量和网络连接数;将历史样本按照时间顺序构建输入样本矩阵,每一行代表一个采样点位;
将输入样本矩阵的数据进行预处理;将24小时的全天数据依照分时段划分为g个时段区间,例如,将24小时划分为6个时间段,统计计算每个时段区间内各类业务数据所占比重,得到不同业务类别在各个时间段内的分布统计量;用于相应调整预测结果;
将网络连接数的时间序列数据建立ARIMA自回归滑动平均模型;进行平稳性检验,对不满足稳定条件的序列进行差分处理,直至达到稳定条件;
确定时间序列的AR和MA阶数,配置ARIMA(p,d,q)模型的参数;
需要说明的是,将网络连接数的时间序列数据建立ARIMA自回归滑动平均模型的过程包括:
对网络连接数的时间序列数据进行平稳性检验,判断是否满足平稳条件。检验方法可以采用ADF单位根检验法;当原始时间序列不满足平稳条件时,需要进行差分处理,目的是去除时间序列中的随机性和非平稳性;进行差分操作直至时间序列满足平稳条件,得到平稳序列确定时间序列的自回归参数的阶数p和滑动平均参数的阶数q;可以通过部分自相关图PACF和自相关图ACF的尾部情况来确定p和q的值;
配置ARIMA(p,d,q)模型的参数;模型的参数包括p阶自回归参数,q阶滑动平均参数,d为进行了几次差分后的结果;利用最大似然估计法估计模型的参数;这样就建立了ARIMA(p,d,q)模型,可以用于时间序列分析和预测;
利用配置好的参数将ARIMA自回归滑动平均模型训练和优化,输入训练数据为预处理的输入样本矩阵,训练目标为预测未来f天内每小时的网络连接数;获得未来f天内网络连接数的时间序列;训练完成的ARIMA自回归滑动平均模型即为参数预测模型;
利用参数预测模型预测得到的未来f天网络连接数的时间序列,依据不同业务类别在各个时间段内的分布统计量进行校正;即对每一时段的网络连接数预测值乘以该时段内各业务比例,获得未来f天内各类业务分布预测结果;各类业务分布预测结果包括业务类型、业务流量和网络连接数及其对应的时间戳;
进一步的,所述联立定位预测模型和参数预测模型获取深度序列学习模型的方式包括:
将过去r天的历史定位轨迹数据和历史业务数据作为历史训练集;将预测得到的未来f天内设备经纬度坐标及其对应的定位时间戳、业务类型、业务流量和网络连接数及其对应的时间戳;利用时间戳进行时间对齐,并作为未来数据集;
构建卷积神经网络LSTM模型;输入层为历史训练集和未来数据集拼接而成的三维矩阵,第一维和第二维表示样本id和时间步,第三维表示特征维度;
卷积神经网络LSTM模型包括卷积层、池化层、LSTM层和全连接层;卷积层用于自动提取输入数据的局部特征;池化层用于减少特征维度;LSTM层用于提取时间序列数据的长短期特征;全连接层输出预测结果;
编译卷积神经网络LSTM模型,配置优化器和损失函数;优化器选用Adam算法;Adam算法基于优化随机梯度下降,自适应地对学习率进行调整;
损失函数选用均方误差函数;
;
其中,为样本数量;为模型预测得到的第个样本输出;为第个样本真实的标签输出;
函数计算预测值和真实值之间的均方差,惩罚得到的损失数值越小模型效果越好;
以历史训练集为卷积神经网络LSTM模型输入,训练目标是预测出未来数据集;
将历史训练集按照批大小分批输入卷积神经网络LSTM模型,卷积神经网络LSTM模型输出一批预测结果;计算这一批预测结果和未来数据集批之间的均方误差函数值;
利用反向传播算法,将损失误差沿着模型计算图反方向回传,更新每层的卷积神经网络LSTM模型的参数;
当训练达到预定的迭代轮数后,获得最终训练好的模型;预定的迭代轮数可以根据实际情况设定;
使用训练好的深度序列学习模型进行预测;输入给定的过去r天历史数据,深度序列学习模型预测输出未来f天的联合状态;
进一步的,所述移动设备时间序列状态的构建方式包括:
根据预测的联合状态,提取未来f天内的时间戳、经纬度坐标、业务类型、业务流量和网络连接数;将提取的数据重新组织成v个时间序列,时间序列状态包括时间戳序列、经纬度坐标时间序列、业务类型时间序列、业务流量时间序列和网络连接数时间序列;即构建出移动设备在未来f天内的移动设备时间序列状态;
进一步的,所述时序值矩阵的构建方式包括:
从移动设备时间序列状态中,提取所有时刻的状态参数,构成状态空间S,状态参数包括移动设备当前所运行的业务类型、移动设备的位置坐标和运动速度;业务类型包括语音业务、视频业务和数据业务;
从值矩阵中,提取移动设备所有可选择的基站切换动作,构成动作空间A;初始化存储状态-动作值的时序矩阵;时序矩阵的行表示不同时刻的设备状态,时序矩阵表示L个相邻基站作为基站切换动作;矩阵元素表示在状态下选择动作的价值,初始化为0;
进一步的,所述时序值矩阵采用深度强化学习方法获取最优切换决策序列的过程包括:
构建深度强化学习模型为端到端的深度神经网络,输入为设备的状态,输出为当前状态下各个基站切换动作的值;
深度强化学习模型内部结构包括卷积层、LSTM循环层和全连接层,卷积层负责提取输入状态的时空特征表示,LSTM层负责挖掘状态序列的时序关联特征,全连接层完成状态动作值函数的估计;
令马尔可夫决策过程(MDP)的五元组中即时奖励为;通过采取时序上的折扣累积方法定义总奖励,公式为:;
其中,是数值为0-1的折扣因子;为决策序列终止时刻;表示的是当前的时间点,从该时刻开始计算一个序列中的累积折扣收益;模型的目标是配置参数使得总奖励最大化;
深度强化学习模型训练目标是逼近状态-动作值函数,在每一训练步,输入一个采样状态,模型预测输出当前状态下各个基站切换动作对应的值;执行动作后环境给出反馈的实际即时奖励;计算预测值和实际奖励的误差,通过损失函数反向传播更新模型参数;
在训练完成深度强化学习模型后,输入需要决策的时序状态,模型输出该状态下,不同基站切换动作对应的值,根据值最大选择基站,推演形成整个序列,计算序列总奖励,输出总奖励最大的最终序列,作为最优切换决策;
进一步的,所述根据所述最优切换决策序列分时段发起移动设备的切换请求的过程包括:
S501、最优切换决策序列按照时间顺序给出了从时刻t1到tN,移动设备在每个时间点需要切换到的目标基站;网络侧得到最优切换序列后,转换为信令交互过程;
S502、在时刻t1,网络侧向移动设备发送切换命令,通知设备切换到对应目标基站;移动设备收到切换命令后,向网络发送切换准备就绪信令;网络侧向源基站发送资源释放信令,向目标基站发送资源准备信令;
S503、源基站响应,释放移动设备占用资源;目标基站响应,预留资源;网络侧向移动设备发送确认信令,授权其执行切换资源重配置流程;移动设备与目标基站进行随机接入,完成切换;
S504、按照时间顺序,每到最优切换序列给出的时刻,重复执行S501-S503,完成切换,到时刻tN全部切换完成;
本实施例,实现了智能感知和业务关联的移动网络切换新机制;通过构建序列学习模型,实现移动设备个体级别的高精度移动性预测,准确得到用户未来的服务需求和网络连接趋势,大幅减少预测偏差;同时,通过建立移动设备与网络资源之间的关联认知模型,进行面向业务场景的切换控制,按照业务优先级进行基站动态切换,极大提升用户感知体验;本实施例利用强化学习算法,在保证单个用户效果提升的同时,实现了整个网络全局收益的最大化,获得考虑各方博弈的最优网络切换均衡解;融合个体建模、业务感知和全局优化为一体实现了稳定的5G网络运维。
实施例2
请参阅图2所示,本实施例未详细叙述部分见实施例1描述内容,提供一种基于5G的手机数据传输系统,包括:收集接收模块,用于采集设备业务参数、设备数据和基站数据;
对抗模型构造模块,用于根据设备业务参数计算收益值,根据设备数据和收益值构建设备加权函数;根据基站数据构建基站加权函数;根据设备加权函数和基站加权函数构建移动设备与n个5G基站之间的博弈资源对抗模型;
求解模块,用于利用强化学习中的Q学习方法对博弈资源对抗模型迭代计算求解;得到值矩阵;
状态构建模块,用于采集历史移动设备数据;根据历史移动设备数据建立用于预测联合状态的深度序列学习模型,根据预测的联合状态构建移动设备时间序列状态;
决策实施模块,用于联立值矩阵和移动设备时间序列状态,构建时序值矩阵;将时序值矩阵采用深度强化学习方法获取最优切换决策序列,根据所述最优切换决策序列分时段发起移动设备的切换请求;各个模块之间通过有线和/或无线的方式进行连接,实现模块间的数据传输。
实施例3
请参阅图3所示,根据本申请的又一方面还提供了电子设备。该电子设备可包括一个或多个处理器以及一个或多个存储器。其中,存储器中存储有计算机可读代码,计算机可读代码当由一个或多个处理器运行时,可以执行如上所述的一种基于5G的手机数据传输方法。
根据本申请实施方式的方法或系统也可以借助于图3所示的电子设备的架构来实现。如图3所示,电子设备可包括输入设备、一个或多个运算器、一个或多个存储器、一个或多个控制器和输出设备等。电子设备中的存储器,可存储本申请提供的一种基于5G的手机数据传输方法。当然,图3所示的架构只是示例性的,在实现不同的设备时,根据实际需要,可以省略图3示出的电子设备中的一个或多个组件。
实施例4
请参阅图4所示,是根据本申请一个实施方式的计算机可读存储介质600。计算机可读存储介质600上存储有计算机可读指令。当计算机可读指令由处理器运行时,可执行参照以上附图描述的根据本申请实施方式的一种。存储介质600包括但不限于例如易失性存储器和/或非易失性存储器。易失性存储器例如可包括随机存取存储器(RAM)和高速缓冲存储器(cache)等。非易失性存储器例如可包括只读存储器(ROM)、硬盘、闪存等。
另外,根据本申请的实施方式,上文参考流程图描述的过程可以被实现为计算机软件程序。例如,本申请提供了非暂时性机器可读存储介质,所述非暂时性机器可读存储介质存储有机器可读指令,所述机器可读指令能够由处理器运行以执行与本申请提供的方法步骤对应的指令,一种基于5G的手机数据传输方法。在该计算机程序被中央处理单元(CPU)执行时,执行本申请的方法中限定的上述功能。
上述实施例,可以全部或部分地通过软件、硬件、固件或其他任意组合来实现。当使用软件实现时,上述实施例可以全部或部分地以计算机程序产品的形式实现。所述计算机程序产品包括一个或多个计算机指令或计算机程序。在计算机上加载或执行所述计算机指令或计算机程序时,全部或部分地产生按照本发明实施例所述的流程或功能。所述计算机可以为通用计算机、专用计算机、计算机网络、或者其他可编程装置。所述计算机指令可以存储在计算机可读存储介质中,或者从一个计算机可读存储介质向另一个计算机可读存储介质传输,例如,所述计算机指令可以从一个网站站点、计算机、服务器或数据中心通过有线网络或无线网络方式向另一个网站站点、计算机、服务器或数据中心进行传输。所述计算机可读存储介质可以是计算机能够存取的任何可用介质或者是包含一个或多个可用介质集合的服务器、数据中心等数据存储设备。所述可用介质可以是磁性介质(例如,软盘、硬盘、磁带)、光介质(例如,DVD)、或者半导体介质。半导体介质可以是固态硬盘。
Claims (2)
1.一种基于5G的手机数据传输方法,其特征在于,包括:
S1、采集设备业务参数、设备数据和基站数据;
S2、根据设备业务参数计算收益值,根据设备数据和收益值构建设备加权函数;根据基站数据构建基站加权函数;根据设备加权函数和基站加权函数构建移动设备与n个5G基站之间的博弈资源对抗模型;
S3、利用强化学习中的Q学习方法对博弈资源对抗模型迭代计算求解;得到Q值矩阵;
S4、采集历史移动设备数据;根据历史移动设备数据建立用于预测联合状态的深度序列学习模型,根据预测的联合状态构建移动设备时间序列状态;
S5、联立Q值矩阵和移动设备时间序列状态,构建时序Q值矩阵;将时序Q值矩阵采用深度强化学习方法获取最优切换决策序列,根据所述最优切换决策序列分时段发起移动设备的切换请求;
所述设备业务参数包括数据业务平均吞吐量、单位数据吞吐量收入、语音业务平均持续时间、单位时间语音收入、视频业务平均码率和单位视频码率收入;
所述设备数据包括平均时延和移动性开销;所述基站数据包括基站负载提升值和平均传输功率;
所述收益值的计算方式包括:
收益值R=T_data×R_T+T_voice×R_V+B_video×R_B;
其中,T_data为数据业务平均吞吐量;R_T为单位数据吞吐量收入;T_voice为语音业务平均持续时间;R_V为单位时间语音收入;B_video为视频业务平均码率;R_B为单位视频码率收入;
所述平均时延D是一个预定义的业务质量统计参数,由网络侧的质量监控系统实时统计汇总,直接调用;
测算移动设备切换前后的位置变化,即为移动性开销C;
获取移动设备在切换前后的位置坐标;通过移动设备自身的GPS或定位模块获取切换前后的位置坐标,并上报网络侧;网络侧收到位置坐标后,按照坐标系的计算方法获得两位置之间的距离ds;查询移动设备的类型参数,获取其平均移动速度V;移动时间开销=距离ds/平均速度V;移动时间开销即为移动性开销C;
构建设备加权函数U=ω1×R+ω2×D+ω3×C;
其中,ω1、ω2和ω3为设备权重参数;
所述博弈资源对抗模型的构建方式包括:
获取参与博弈决策的每个移动设备,确定移动设备的唯一标识ID;获取每个移动设备当前所运行的业务类型;将每个移动设备定义设备动作空间,设备动作空间包括移动设备可申请切换的L个相邻基站;
获取移动设备周边参与博弈决策的每个基站,确定基站的唯一标识ID;获取每个基站的网络频谱资源信息和基站参数;将每个基站定义基站动作空间,基站动作空间包括接受切换请求和拒绝切换请求;
移动设备接入后,计算基站负载提升值ΔL;
基站负载提升值ΔL的计算过程包括:
获取基站的当前业务数N和移动设备的业务类型;根据业务类型查询对应类业务的平均占用带宽BW_语音、BW_数据和BW_视频;
计算基站当前总占用带宽BW_总=N×BW_语音+N×BW_数据+N×BW_视频;
移动设备接入后,总业务数变为N+1,则总占用带宽为BW_新总=(N+1)×BW_语音+(N+1)×BW_数据+(N+1)×BW_视频;带宽提升量BW_提升=BW_新总-BW_总;
带宽提升量与基站总带宽计算负载提升ΔL=BW_提升/基站总带宽;
查表获取移动设备的平均传输功率P;
构建基站加权函数V=α1×ΔL+α2×P;
其中,α1和α2为基站权重参数;
结合设备加权函数和基站加权函数获取博弈资源对抗模型;
博弈资源对抗模型J=max∑U-∑V;
所述Q值矩阵的获取过程包括:
S301、定义博弈资源对抗模型中的状态空间S和动作空间A;其中,状态空间S表示场景数量;动作空间A表示每种状态下可供移动设备或基站选择执行的不同行为数量;初始化一个存储状态-动作值函数的Q(s,a)矩阵,其中Q(s,a)矩阵的大小为|S|×|A|,Q(s,a)矩阵的行表示状态s,列表示动作a;矩阵中的每个元素Q(s,a)表示在状态s下选择执行动作a对应的价值,初始化全部矩阵元素为0;
S302、设定迭代终止条件,迭代终止条件为最大迭代数M或Q矩阵元素值变化小于设置阈值p;设定Q学习算法的参数,参数包括学习率α,折扣因子γ,在ε贪婪策略中探索概率ε;
S303、基于ε贪婪策略以固定概率ε选择当前Q值最大的动作a,同时以1-ε概率随机选择一个动作a;执行所选择的动作a后,环境状态从s转移到s',并产生一个即时收益r;收集执行动作a后环境的反馈,反馈包括新的状态s'和即时收益r;
S304、更新Q(s,a);
更新公式为Q(s,a)←Q(s,a)+α×(r+γ×Max(Qs')-Q(s,a));
式中,s为环境状态;a为在状态s下可选择执行的动作;r为即时收益;s'为执行完动作后的新的环境状态;α为学习率;γ为折扣因子;Max(Qs')为下一状态s'下所有可能的动作对应的Q值最大值;←为更新符号;
S305、判断是否满足终止条件,若不满足则继续更新Q(s,a);若满足则得到状态空间下的Q值矩阵;
所述历史移动设备数据包括历史定位轨迹数据和历史业务数据;
历史定位轨迹数据包括设备经纬度坐标及其对应的设备定位时间戳;
历史业务数据包括业务类型、业务流量和网络连接数及其对应的时间戳;
联合状态为未来f天的定位轨迹数据和业务数据;
深度序列学习模型为联立定位预测模型和参数预测模型获取;
定位预测模型获取方式包括:
将历史定位轨迹数据作为测试数据集,并进行曲线拟合;
曲线拟合过程包括:
用线性多项式拟合曲线、二次多项式拟合曲线和三次多项式分别进行拟合曲线;线性多项式拟合曲线为y=ax+b;二次多项式拟合曲线y=ax2+bx+c;三次多项式拟合曲线y=ax3+bx2+cx+d;式中,x为设备定位时间戳;y为设备经纬度坐标;a、b、c和d为待求的参数,均通过曲线拟合得出;
计算线性多项式、二次多项式和三次多项式拟合曲线的预测点位误差;预测点位误差
其中,实际值为测试数据集中的真实值;预测值为拟合曲线计算的预测值;h为测试数据集大小;
选取多项式拟合曲线、二次多项式拟合曲线和三次多项式拟合曲线中预测点位误差最小的拟合曲线,即最佳拟合的曲线;最佳拟合的曲线即为定位预测模型;
参数预测模型为ARIMA时间序列预测模型,其获取方式包括:
采集最近r天内的历史业务数据作为历史样本,历史样本中包括4个字段;4个字段分别为时间戳、业务类型、业务流量和网络连接数;将历史样本按照时间顺序构建输入样本矩阵,每一行代表一个采样点位;
将输入样本矩阵的数据进行预处理;将24小时的全天数据依照分时段划分为g个时段区间,统计计算每个时段区间内各类业务数据所占比重,得到不同业务类别在各个时间段内的分布统计量;用于相应调整预测结果;
将网络连接数的时间序列数据建立ARIMA自回归滑动平均模型;进行平稳性检验,对不满足稳定条件的序列进行差分处理,直至达到稳定条件;
确定时间序列的AR和MA阶数,配置ARIMA(p,d,q)模型的参数;
利用配置好的参数将ARIMA自回归滑动平均模型训练和优化,输入训练数据为预处理的输入样本矩阵,训练目标为预测未来f天内每小时的网络连接数;获得未来f天内网络连接数的时间序列;训练完成的ARIMA自回归滑动平均模型即为参数预测模型;
所述联立定位预测模型和参数预测模型获取深度序列学习模型的方式包括:
将过去r天的历史定位轨迹数据和历史业务数据作为历史训练集;将预测得到的未来f天内设备经纬度坐标及其对应的定位时间戳、业务类型、业务流量和网络连接数及其对应的时间戳;利用时间戳进行时间对齐,并作为未来数据集;
构建卷积神经网络LSTM模型;输入层为历史训练集和未来数据集拼接而成的三维矩阵;
卷积神经网络LSTM模型包括卷积层、池化层、LSTM层和全连接层;编译卷积神经网络LSTM模型,配置优化器和损失函数;
优化器选用Adam算法;Adam算法基于优化随机梯度下降,自适应地对学习率进行调整;
损失函数选用均方误差
其中,z为样本数量;Ypred,i为模型预测得到的第i个样本输出;Ytrue,i为第i个样本真实的标签输出;
MSE函数计算预测值和真实值之间的均方差,惩罚得到的损失数值越小模型效果越好;以历史训练集为卷积神经网络LSTM模型输入,训练目标是预测出未来数据集;
将历史训练集按照批大小分批输入卷积神经网络LSTM模型,卷积神经网络LSTM模型输出一批预测结果;计算这一批预测结果和未来数据集批之间的均方误差MSE函数值;利用反向传播算法,将MSE损失误差沿着模型计算图反方向回传,更新每层的卷积神经网络LSTM模型的参数;
当训练达到预定的迭代轮数后,获得最终训练好的深度序列学习模型;使用训练好的深度序列学习模型进行预测;输入给定的过去r天历史数据,深度序列学习模型预测输出未来f天的联合状态;
所述移动设备时间序列状态的构建方式包括:
根据预测的联合状态,提取未来f天内的时间戳、经纬度坐标、业务类型、业务流量和网络连接数;将提取的数据重新组织成v个时间序列,时间序列状态包括时间戳序列、经纬度坐标时间序列、业务类型时间序列、业务流量时间序列和网络连接数时间序列;即构建出移动设备在未来f天内的移动设备时间序列状态;
所述时序Q值矩阵的构建方式包括:
从移动设备时间序列状态中,提取所有时刻的状态参数,构成状态空间S,状态参数包括移动设备当前所运行的业务类型、移动设备的位置坐标和运动速度;业务类型包括语音业务、视频业务和数据业务;
从Q值矩阵中,提取移动设备所有可选择的基站切换动作,构成动作空间A;初始化存储状态-动作值的时序Q(St,At)矩阵;时序Q(St,At)矩阵的行表示不同时刻t的设备状态St,时序Q(St,At)矩阵表示L个相邻基站作为基站切换动作At;矩阵元素Q(St,At)表示在状态St下选择动作At的价值,初始化为0;
所述时序Q值矩阵采用深度强化学习方法获取最优切换决策序列的过程包括:
构建深度强化学习模型为端到端的深度神经网络,输入为设备的状态St,输出为当前状态下各个基站切换动作的Q值;
深度强化学习模型内部结构包括卷积层、LSTM循环层和全连接层,卷积层负责提取输入状态的时空特征表示,LSTM层负责挖掘状态序列的时序关联特征,全连接层完成状态动作值函数Q(St,At)的估计;
令马尔可夫决策过程(MDP)的五元组中即时奖励为rt;通过采取时序上的折扣累积方法定义总奖励TY,公式为:
其中,γ是数值为0-1的折扣因子;tr为决策序列终止时刻;t表示的是当前的时间点,从该时刻t开始计算一个序列中的累积折扣收益;模型的目标是配置参数使得总奖励TY最大化;
深度强化学习模型训练目标是逼近状态-动作值函数Q(St,At),在每一训练步,输入一个采样状态St,模型预测输出当前状态下各个基站切换动作a对应的Q值;执行动作后环境给出反馈的实际即时奖励;计算Q(St,At)预测值和实际奖励的误差,通过损失函数反向传播更新模型参数;
在训练完成深度强化学习模型后,输入需要决策的时序状态,模型输出该状态下,不同基站切换动作对应的Q值,根据Q值最大选择基站,推演形成整个序列,计算序列总奖励,输出总奖励最大的最终序列,作为最优切换决策;
所述根据所述最优切换决策序列分时段发起移动设备的切换请求的过程包括:
S501、最优切换决策序列按照时间顺序给出了从时刻t1到tN,移动设备在每个时间点需要切换到的目标基站;网络侧得到最优切换序列后,转换为信令交互过程;
S502、在时刻t1,网络侧向移动设备发送切换命令,通知设备切换到对应目标基站;移动设备收到切换命令后,向网络发送切换准备就绪信令;网络侧向源基站发送资源释放信令,向目标基站发送资源准备信令;
S503、源基站响应,释放移动设备占用资源;目标基站响应,预留资源;网络侧向移动设备发送确认信令,授权其执行切换资源重配置流程;移动设备与目标基站进行随机接入,完成切换;
S504、按照时间顺序,每到最优切换序列给出的时刻,重复执行S501-S503,完成切换,到时刻tN全部切换完成。
2.一种基于5G的手机数据传输系统,其基于权利要求1所述的一种基于5G的手机数据传输方法实现,其特征在于,包括:收集接收模块,用于采集设备业务参数、设备数据和基站数据;
对抗模型构造模块,用于根据设备业务参数计算收益值,根据设备数据和收益值构建设备加权函数;根据基站数据构建基站加权函数;根据设备加权函数和基站加权函数构建移动设备与n个5G基站之间的博弈资源对抗模型;
求解模块,用于利用强化学习中的Q学习方法对博弈资源对抗模型迭代计算求解;得到Q值矩阵;
状态构建模块,用于采集历史移动设备数据;根据历史移动设备数据建立用于预测联合状态的深度序列学习模型,根据预测的联合状态构建移动设备时间序列状态;
决策实施模块,用于联立Q值矩阵和移动设备时间序列状态,构建时序Q值矩阵;将时序Q值矩阵采用深度强化学习方法获取最优切换决策序列,根据所述最优切换决策序列分时段发起移动设备的切换请求。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202410022968.8A CN117528552B (zh) | 2024-01-08 | 2024-01-08 | 一种基于5g的手机数据传输方法和系统 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202410022968.8A CN117528552B (zh) | 2024-01-08 | 2024-01-08 | 一种基于5g的手机数据传输方法和系统 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| CN117528552A CN117528552A (zh) | 2024-02-06 |
| CN117528552B true CN117528552B (zh) | 2024-03-22 |
Family
ID=89749852
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| CN202410022968.8A Active CN117528552B (zh) | 2024-01-08 | 2024-01-08 | 一种基于5g的手机数据传输方法和系统 |
Country Status (1)
| Country | Link |
|---|---|
| CN (1) | CN117528552B (zh) |
Families Citing this family (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN118802734B (zh) * | 2024-07-25 | 2025-02-11 | 杭州合众数据技术有限公司 | 一种数据动态融合迭代训练建模及应用方法 |
Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN114707664A (zh) * | 2022-04-18 | 2022-07-05 | 清华大学 | 一种基于图演化博弈模型的案件规模预测方法及系统 |
| CN116846592A (zh) * | 2023-05-25 | 2023-10-03 | 北京计算机技术及应用研究所 | 一种基于攻防博弈模型的智能化决策系统及方法 |
-
2024
- 2024-01-08 CN CN202410022968.8A patent/CN117528552B/zh active Active
Patent Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN114707664A (zh) * | 2022-04-18 | 2022-07-05 | 清华大学 | 一种基于图演化博弈模型的案件规模预测方法及系统 |
| CN116846592A (zh) * | 2023-05-25 | 2023-10-03 | 北京计算机技术及应用研究所 | 一种基于攻防博弈模型的智能化决策系统及方法 |
Also Published As
| Publication number | Publication date |
|---|---|
| CN117528552A (zh) | 2024-02-06 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US11514543B2 (en) | System and method for ride order dispatching | |
| WO2021169577A1 (zh) | 一种基于加权联邦学习的无线业务流量预测方法 | |
| US11507894B2 (en) | System and method for ride order dispatching | |
| CN110267292B (zh) | 基于三维卷积神经网络的蜂窝网络流量预测方法 | |
| Le et al. | A practical model for traffic forecasting based on big data, machine-learning, and network KPIs | |
| CN103747523A (zh) | 一种基于无线网络的用户位置预测系统和方法 | |
| Hsieh et al. | Deep reinforcement learning-based task assignment for cooperative mobile edge computing | |
| CN103731916A (zh) | 一种基于无线网络的用户位置预测系统和方法 | |
| CN114039870A (zh) | 基于深度学习的蜂窝网络中视频流应用实时带宽预测方法 | |
| CN108829766A (zh) | 一种兴趣点推荐方法、系统、设备及计算机可读存储介质 | |
| CN119854813B (zh) | 一种结合深度学习和统计学方法的基站负载预测方法、装置及电子设备 | |
| CN117528552B (zh) | 一种基于5g的手机数据传输方法和系统 | |
| WO2022203597A1 (en) | Method and system for taxi demand prediction using a neural network model | |
| Peng et al. | HMM-LSTM for proactive traffic prediction in 6G wireless networks | |
| CN120601949A (zh) | 基于时空图注意力网络的异构任务低轨卫星任务卸载方法 | |
| Ma et al. | MetaSTNet: Multimodal Meta-learning for cellular traffic conformal prediction | |
| CN114339967B (zh) | 基站业务量的预测方法及装置 | |
| CN114021695B (zh) | 一种基于深度强化学习的群智感知激励机制方法 | |
| CN115906630A (zh) | 一种基于联邦学习的5g基站能耗优化方法 | |
| CN119907047B (zh) | 一种基于分块流量预测的无人机辅助任务卸载方法 | |
| CN118486163A (zh) | 基于车辆路径预测的任务切分卸载与资源分配方法及装置 | |
| Zhu et al. | Prediction of cellular network channel utilization based on graph convolutional networks | |
| CN121078473B (zh) | 一种基于增量学习的实时通信流量预测方法及系统 | |
| CN119152684B (zh) | 基于持续学习的跨域交通流量预测方法 | |
| CN110366106B (zh) | 一种移动终端的定位方法和定位系统 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PB01 | Publication | ||
| PB01 | Publication | ||
| SE01 | Entry into force of request for substantive examination | ||
| SE01 | Entry into force of request for substantive examination | ||
| GR01 | Patent grant | ||
| GR01 | Patent grant |