WO2025210401A1 - 视频流生成方法、电子设备及计算机可读存储介质 - Google Patents

视频流生成方法、电子设备及计算机可读存储介质

Info

Publication number
WO2025210401A1
WO2025210401A1 PCT/IB2024/062687 IB2024062687W WO2025210401A1 WO 2025210401 A1 WO2025210401 A1 WO 2025210401A1 IB 2024062687 W IB2024062687 W IB 2024062687W WO 2025210401 A1 WO2025210401 A1 WO 2025210401A1
Authority
WO
WIPO (PCT)
Prior art keywords
video stream
target
image
image sample
simulated
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
PCT/IB2024/062687
Other languages
English (en)
French (fr)
Inventor
郭鑫
金仲明
叶杰平
潘成路
余正旭
童潘榕
刘洋
魏振勇
马康炜
张露露
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Cloud Intelligence Singapore Holding Pvt Ltd
Original Assignee
Cloud Intelligence Singapore Holding Pvt Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Cloud Intelligence Singapore Holding Pvt Ltd filed Critical Cloud Intelligence Singapore Holding Pvt Ltd
Publication of WO2025210401A1 publication Critical patent/WO2025210401A1/zh
Pending legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04NPICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N21/00Selective content distribution, e.g. interactive television or video on demand [VOD]
    • H04N21/40Client devices specifically adapted for the reception of or interaction with content, e.g. set-top-box [STB]; Operations thereof
    • H04N21/43Processing of content or additional data, e.g. demultiplexing additional data from a digital video stream; Elementary client operations, e.g. monitoring of home network or synchronising decoder's clock; Client middleware
    • H04N21/44Processing of video elementary streams, e.g. splicing a video clip retrieved from local storage with an incoming video stream or rendering scenes according to encoded video stream scene graphs
    • H04N21/44012Processing of video elementary streams, e.g. splicing a video clip retrieved from local storage with an incoming video stream or rendering scenes according to encoded video stream scene graphs involving rendering scenes according to scene graphs, e.g. MPEG-4 scene graphs
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T13/00Animation
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T5/00Image enhancement or restoration
    • G06T5/50Image enhancement or restoration using two or more images, e.g. averaging or subtraction
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T5/00Image enhancement or restoration
    • G06T5/60Image enhancement or restoration using machine learning, e.g. neural networks
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04NPICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N21/00Selective content distribution, e.g. interactive television or video on demand [VOD]
    • H04N21/40Client devices specifically adapted for the reception of or interaction with content, e.g. set-top-box [STB]; Operations thereof
    • H04N21/43Processing of content or additional data, e.g. demultiplexing additional data from a digital video stream; Elementary client operations, e.g. monitoring of home network or synchronising decoder's clock; Client middleware
    • H04N21/44Processing of video elementary streams, e.g. splicing a video clip retrieved from local storage with an incoming video stream or rendering scenes according to encoded video stream scene graphs
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04NPICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N21/00Selective content distribution, e.g. interactive television or video on demand [VOD]
    • H04N21/40Client devices specifically adapted for the reception of or interaction with content, e.g. set-top-box [STB]; Operations thereof
    • H04N21/43Processing of content or additional data, e.g. demultiplexing additional data from a digital video stream; Elementary client operations, e.g. monitoring of home network or synchronising decoder's clock; Client middleware
    • H04N21/44Processing of video elementary streams, e.g. splicing a video clip retrieved from local storage with an incoming video stream or rendering scenes according to encoded video stream scene graphs
    • H04N21/44008Processing of video elementary streams, e.g. splicing a video clip retrieved from local storage with an incoming video stream or rendering scenes according to encoded video stream scene graphs involving operations for analysing video streams, e.g. detecting features or characteristics in the video stream
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04NPICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N21/00Selective content distribution, e.g. interactive television or video on demand [VOD]
    • H04N21/40Client devices specifically adapted for the reception of or interaction with content, e.g. set-top-box [STB]; Operations thereof
    • H04N21/47End-user applications
    • H04N21/472End-user interface for requesting content, additional data or services; End-user interface for interacting with content, e.g. for content reservation or setting reminders, for requesting event notification, for manipulating displayed content
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04NPICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N21/00Selective content distribution, e.g. interactive television or video on demand [VOD]
    • H04N21/40Client devices specifically adapted for the reception of or interaction with content, e.g. set-top-box [STB]; Operations thereof
    • H04N21/47End-user applications
    • H04N21/472End-user interface for requesting content, additional data or services; End-user interface for interacting with content, e.g. for content reservation or setting reminders, for requesting event notification, for manipulating displayed content
    • H04N21/47205End-user interface for requesting content, additional data or services; End-user interface for interacting with content, e.g. for content reservation or setting reminders, for requesting event notification, for manipulating displayed content for manipulating displayed content, e.g. interacting with MPEG-4 objects, editing locally
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/045Combinations of networks
    • G06N3/0455Auto-encoder networks; Encoder-decoder networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods

Definitions

  • a program instructing the hardware related to the terminal device may be completed by a program instructing the hardware related to the terminal device.
  • the program may be stored in a computer-readable storage medium, which may include a flash drive, a read-only memory (ROM), a random access memory (RAM), a magnetic disk, or an optical disk, etc.
  • a computer-readable storage medium which may include a flash drive, a read-only memory (ROM), a random access memory (RAM), a magnetic disk, or an optical disk, etc.
  • Example 7 Embodiments of the present disclosure also provide a computer-readable storage medium.
  • the computer-readable storage medium can be used to store program code executed by the video stream generation method provided in the first embodiment.
  • the technical solution of the present disclosure can be embodied in the form of a software product.
  • This computer software product is stored in a storage medium and includes several instructions for enabling a computer device (which can be a personal computer, server, or network device, etc.) to execute all or part of the steps of the method described in each embodiment of the present disclosure.
  • the aforementioned storage medium includes: USB flash drives, read-only memories (ROM), random access memories (RAM), removable hard drives, magnetic disks, or optical disks, and other media capable of storing program code.

Landscapes

  • Engineering & Computer Science (AREA)
  • Multimedia (AREA)
  • Signal Processing (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Theoretical Computer Science (AREA)
  • Databases & Information Systems (AREA)
  • Human Computer Interaction (AREA)
  • Processing Or Creating Images (AREA)

Abstract

本公开公开了一种视频流生成方法、电子设备及计算机可读存储介质,涉及大模型技术、视频处理技术领域。该方法包括:获取虚拟相机的设置信息,其中,虚拟相机用于在数字孪生世界中录制虚拟视频流,数字孪生世界为模拟真实世界的虚拟世界,设置信息用于调整虚拟相机的拍摄角度;确定待生成的目标仿真视频流中的画面信息;基于设置信息和画面信息,生成初始仿真视频流;基于目标视频生成模型和目标风格图像对初始仿真视频流进行转换,生成目标仿真视频流,其中,目标风格图像为真实世界中的真实图像,目标仿真视频流的画面风格与目标风格图像的画面风格相对应。本公开解决了虚拟视频流的画面逼真程度低的技术问题。

Description

视频流生成方法、 电子设备及计算机可读存储介质 技术领域 本公 开涉及大模型技术、 视频处理技术领域, 具体而言, 涉及一种视频流生成方 法、 电子设备及计算机可读存储介质。 背景技术 数 字挛生系统是一种基于数字化模型的虚拟仿真系统, 用于将真实世界中的实体 或系统与数字化模型相结合, 从而构建出与真实世界相对应的虚拟的数字挛生世界。 数字挛生系统能够使用渲染引擎生成用于模拟真实世界的虚拟视频流, 从对真实世界 进行模拟和分析。 目前, 针对自动驾驶领域提出了卡拉 ( CARLA )仿真器, CARLA仿真器通过借 助强大的渲染引擎的能力能够生成用于模拟真实场景的虚拟视频流。 但是 CARLA仿 真器仅针对 自动驾驶场景, 并不适用于一般应用场景, 其应用场景十分受限。 此外, CARLA 仿真器依赖渲染引擎的能力, 其所生成的虚拟视频流的画面逼真程度有待提 高。 针对上述 的问题, 目前尚未提出有效的解决方案。 发 明内容 本公 开实施例提供了一种视频流生成方法、 电子设备及计算机可读存储介质, 以 至少解决虚拟视频流的画面逼真程度低的技术问题。 根据本公 开实施例的一个方面, 提供了一种视频流生成方法, 包括: 获取虚拟相 机的设置信息, 其中, 虚拟相机用于在数字挛生世界中录制虚拟视频流, 数字挛生世 界为模拟真实世界的虚拟世界, 设置信息用于调整虚拟相机的拍摄角度; 确定待生成 的目标仿真视频流中的画面信息, 其中, 画面信息用于记载待生成的目标仿真视频流 中需要生产的仿真画面元素; 基于设置信息和画面信息, 生成初始仿真视频流; 基于 目标视频生成模型和目标风格图像对初始仿真视频流进行转换,生成目标仿真视频流, 其中, 目标风格图像为真实世界中的真实图像, 目标仿真视频流的画面风格与目标风 格图像的画面风格相对应。 根据本公 开实施例的另一方面, 还提供了一种视频流生成方法, 包括: 响应作用 于操作界面上的调整指令, 在操作界面上显示虚拟相机的设置信息, 其中, 虚拟相机 用于在数字挛生世界中录制虚拟视频流, 数字挛生世界为模拟真实世界的虚拟世界, 设置信息用于调整虚拟相机的拍摄角度; 响应作用于操作界面上的输入指令, 在操作 界面上显示待生成的目标仿真视频流中的画面信息, 其中, 画面信息用于记载待生成 的目标仿真视频流中需要生产的仿真画面元素; 响应作用于操作界面上的仿真指令, 在操作界面上显示目标仿真视频流, 其中, 目标仿真视频流基于目标视频生成模型和 目标风格图像对初始仿真视频流进行转换而生成, 目标风格图像为真实世界中的真实 图像, 目标仿真视频流的画面风格与目标风格图像的画面风格相对应, 初始仿真视频 流基于设置信息和画面信息生成而得到。 根据本公 开实施例的另一方面, 还提供了一种视频流生成方法, 包括: 通过第一 应用程序编程接口获取仿真视频流生成请求; 通过第二应用程序编程接口返回仿真视 频流生成响应; 其中, 仿真视频流生成请求中包括: 虚拟相机的设置信息和待生成的 目标仿真视频流中的画面信息, 仿真视频流生成响应中包括: 目标仿真视频流, 虚拟 相机用于在数字挛生世界中录制虚拟视频流, 数字挛生世界为模拟真实世界的虚拟世 界, 设置信息用于调整虚拟相机的拍摄角度, 画面信息用于记载待生成的目标仿真视 频流中需要生产的仿真画面元素, 目标仿真视频流基于目标视频生成模型和目标风格 图像对初始仿真视频流进行转换而生成, 目标风格图像为真实世界中的真实图像, 目 标仿真视频流的画面风格与目标风格图像的画面风格相对应, 初始仿真视频流基于设 置信息和画面信息生成而得到。 根据本公 开实施例的另一方面, 还提供了一种视频流生成方法, 包括: 获取输入 的仿真视频流生成对话请求; 响应于仿真视频流生成对话请求, 返回仿真视频流生成 对话回复; 其中, 仿真视频流生成对话请求中包括: 虚拟相机的设置信息和待生成的 目标仿真视频流中的画面信息, 仿真视频流生成对话回复中包括: 目标仿真视频流, 虚拟相机用于在数字挛生世界中录制虚拟视频流, 数字挛生世界为模拟真实世界的虚 拟世界, 设置信息用于调整虚拟相机的拍摄角度; 画面信息用于记载待生成的目标仿 真视频流中需要生产的仿真画面元素; 目标仿真视频流基于目标视频生成模型和目标 风格图像对初始仿真视频流进行转换而生成,目标风格图像为真实世界中的真实图像, 目标仿真视频流的画面风格与目标风格图像的画面风格相对应, 初始仿真视频流基于 设置信息和画面信息生成而得到; 在图形用户界面内展示目标仿真视频流。 根据本公 开实施例的另一方面, 还提供了一种电子设备, 包括: 存储器, 存储有 可执行程序; 处理器, 用于运行程序, 其中, 程序运行时执行任意一项上述的视频流 生成方法。 根据本公 开实施例的另一方面, 还提供了一种计算机可读存储介质, 计算机可读 存储介质包括存储的可执行程序, 其中, 在可执行程序运行时控制计算机可读存储介 质所在设备执行任意一项上述的视频流生成方法。 根据本公开 实施例的另一方面,还提供了一种计算机程序产品,包括计算机程序, 计算机程序在被处理器执行时实现任意一项上述的视频流生成方法。 在本公 开实施例中, 通过调整虚拟相机的设置信息, 从而调整虚拟相机在数字挛 生世界中录制虚拟视频流的拍摄角度, 以及确定用于记载待生成的目标视频流中需要 生产的画面信息, 然后基于设置信息和画面信息, 生成初始仿真视频流, 在将真实世 界中的目标风格图像和初始仿真视频流输入至 目标视频生成模型, 基于目标视频生成 模型和目标风格图像对初始仿真视频流进行转换, 最终生成目标仿真视频流, 使得目 标仿真视频流的画面风格与目标风格图像的画面风格相对应, 由此达到了生成指定画 面内容与指定画面风格的目标仿真视频流的 目的, 从而实现了生成画面内容更加真实 可靠、 画面风格更加逼真且能够应用于任意场景的目标仿真视频流, 同时丰富了数字 挛生世界中的应用场景的技术效果, 进而解决了虚拟视频流的画面逼真程度低的技术 问题。 容 易注意到的是, 上面的通用描述和后面的详细描述仅仅是为了对本公开进行举 例和解释, 并不构成对本公开的限定。 附图说明 此处 所说明的附图用来提供对本公开的进一步理解, 构成本公开的一部分, 本公 开的示意性实施例及其说明用于解释本公开, 并不构成对本公开的不当限定。 在附图 中: 图 1是根据本公开实施例 1的一种视频流生成方法的应用场景示意图; 图 2是根据本公开实施例 1的一种视频流生成方法的流程图; 图 3是根据本公开实施例 1的训练编码器的流程图; 图 4是根据本公开实施例 1的训练解码器的流程图; 图 5是根据本公开实施例 1的目标视频生成模型的推断过程流程图; 图 6是根据本公开实施例 1的另一种视频流生成方法流程图; 图 7是根据本公开实施例 2的一种视频流生成方法的流程图; 图 8是根据本公开实施例 3的一种视频流生成方法的流程图; 图 9是根据本公开实施例 4的一种视频流生成方法的流程图; 图 10是根据本公开实施例 5的一种视频流生成装置的结构示意图; 图 11是根据本公开实施例 5的另一种视频流生成装置的结构示意图; 图 12是根据本公开实施例 5的再一种视频流生成装置的结构示意图; 图 13是根据本公开实施例 5的又一种视频流生成装置的结构示意图; 图 14是根据本公开实施例的一种电子设备的结构框图。 具体 实施方式 为了使本技术领域的人员更好地理解本公开方案, 下面将结合本公开实施例中的 附图, 对本公开实施例中的技术方案进行清楚、 完整地描述, 显然, 所描述的实施例 仅仅是本公开一部分的实施例, 而不是全部的实施例。 基于本公开中的实施例, 本领 域普通技术人员在没有做出创造性劳动前提下所获得的所有其他实施例, 都应当属于 本公开保护的范围。 需要说明的是,本公开的说明书和权利要求书及上述附图中的术语 “第一”、 “第二” 等是用于区别类似的对象, 而不必用于描述特定的顺序或先后次序。 应该理解这样使 用的数据在适当情况下可以互换, 以便这里描述的本公开的实施例能够以除了在这里 图示或描述的那些以外的顺序实施。此外,术语 “包括 ”和“具有 ”以及他们的任何变形, 意图在于覆盖不排他的包含, 例如, 包含了一系列步骤或单元的过程、 方法、 系统、 产品或设备不必限于清楚地列出的那些步骤或单元, 而是可包括没有清楚地列出的或 对于这些过程、 方法、 产品或设备固有的其它步骤或单元。 本公 开提供的技术方案主要采用大模型技术实现, 此处的大模型是指具有大规模 模型参数的深度学习模型, 通常可以包含上亿、 上百亿、 上千亿、 上万亿甚至十万亿 以上的模型参数。 大模型又可以称为基石模型 /基础模型 ( Foundation Model ), 通过大 规模无标注的语料进行大模型的预训练, 产出亿级以上参数的预训练模型, 这种模型 能适应广泛 的下游任务, 模型具有较好的泛化能力, 例如大规模语言模型 ( Large Language Model, LLM )、 多模态预训练模型 ( multi-modal pre-training model )等。 需要说明的是,大模型在实际应用时,可以通过少量样本对预训练模型进行微调, 使得大模型可 以应用于不同的任务中。 例如, 大模型可以广泛应用于自然语言处理 ( Natural Language Processing, 简称 NLP )、 计算机视觉、 语音处理等领域, 具体可以 应用于如视觉问答 ( Visual Question Answering ,简称 VQA )、图像描述( Image Caption, 简称 IC )、图像生成等计算机视觉领域任务,也可以广泛应用于基于文本的情感分类、 文本摘要生成、 机器翻译等自然语言处理领域任务。 因此, 大模型主要的应用场景包 括但不限于数字助理、 智能机器人、 搜索、 在线教育、 办公软件、 电子商务、 智能设 计等。 首先, 在对本公开实施例进行描述的过程中出现的部分名词或术语适用于如下解 释: 数 字挛生系统:指利用数字化技术,通过对现实世界的物理系统进行模拟和仿真, 实现对实际物理系统的数字化镜像。 数字挛生系统通过传感器和数据采集技术, 将现 实世界中的物理系统的状态和行为实时地转化为数字化的数据, 然后利用计算机模拟 和仿真技术, 将这些数据重新构建成数字挛生模型, 实现对物理系统的准确描述和预 测。 数 字挛生世界: 是数字挛生系统所构建的虚拟环境, 通过数字挛生技术, 将现实 世界中的物理系统数字化, 并在虚拟环境中进行模拟和仿真, 实现对现实世界的实时 监测、 预测和调控。 数字挛生世界可以帮助人们更好地理解和分析现实世界中的复杂 系统, 提高决策的准确性和效率, 同时也可以为科学研究、 工程设计和生产制造等领 域提供强大的工具和支持。 白化和颜色转换 ( whitening and coloring transform, 简称为 WCT ) 方法: 一种图 像风格迁移算法, 用于将一个图像的风格转移到另一个图像上。 该算法首先对输入图 像进行白化处理, 将图像的颜色和对比度信息去除, 然后再根据目标图像的风格进行 重新着色, 从而实现图像风格的迁移。 真 实视频流是通过真实相机对真实世界进行光学成像产生的, 真实视频流虽然能 够源源不断的产生, 但由于其是对真实世界的刻画, 并不能满足数字挛生世界对虚拟 视频流的特殊需求。例如,人们期望能够在数字挛生世界中模拟各种意外事故的发生, 从而探索可能的解决方案, 但真实世界中能够准确记录意外事故的真实视频流极其稀 有, 且真实视频流中无法记录仅存在于人们设想却从未发生过的事件。 并且, 真实视 频流需要人工进行标注, 因此会耗费大量人力成本以及时间成本, 这极大的限制了利 用海量有标签的视频流数据进行模型训练的可能性。 此外, 真实视频流的标签分布往 往存在误差, 这种存在误差的标签分布数据也不利于模型的训练。 目前, 针对自动驾驶领域提出了卡拉 ( CARLA )仿真器, CARLA仿真器通过借 助强大的渲染 引擎的能力能够生成用于模拟真实自动驾驶场景 的虚拟视频流。 但是 CARLA 仿真器仅针对自动驾驶场景, 并不适用于一般应用场景, 其应用场景十分受 限。 此外, CARLA仿真器依赖渲染引擎的能力, 其所生成的虚拟视频流的画面逼真 程度有待提高。 依赖渲染 引擎的能力生成虚拟视频流存在如下缺陷。 缺 陷 1: 应用场景受限, 目前提出的 CARLA仿真器仅能适用于自动驾驶场景, 不适用于一般应用场景, 也不符合数字挛生任务需求。 缺 陷 2: 依赖渲染引擎的能力所生成的虚拟视频流的画面逼真程度欠佳。 针对上述缺 陷, 在本公开之前尚未提出有效的解决方案。 实施例 1 根据本公 开实施例, 提供了一种视频流生成方法, 需要说明的是, 在附图的流程 图示出的步骤可以在诸如一组计算机可执行指令的计算机系统中执行, 并且, 虽然在 流程图中示出了逻辑顺序, 但是在某些情况下, 可以以不同于此处的顺序执行所示出 或描述的步骤。 考虑 到大模型的模型参数量庞大, 且移动终端的运算资源有限, 本公开实施例提 供的上述视频流生成方法可以应用于如图 1所示的应用场景, 但不仅限于此。 在如图 1 所示的应用场景中, 大模型部署在服务器 10中, 服务器 10可以通过局域网连接、 广域网连接、因特网连接,或者其他类型的数据网络,连接一个或多个客户端设备 20, 此处的客户端设备 20可以包括但不限于: 智能手机、 平板电脑、 笔记本电脑、 掌上电 脑、 个人计算机、 智能家居设备、 车载设备等。 客户端设备 20可以通过图形用户界面 与用户进行交互, 实现对大模型的调用, 进而实现本公开实施例所提供的方法。 在本公 开实施例中, 客户端设备和服务器构成的系统可以执行如下步骤: 客户端 设备执行发送用于生成目标仿真视频流的仿真视频流生成请求的步骤, 服务器执行调 整虚拟相机的设置信息, 确定待生成的目标仿真视频流中的画面信息, 基于设置信息 和画面信息生成初始仿真视频流, 基于目标视频生成模型和目标风格图像对初始仿真 视频流进行转换, 生成目标仿真视频流的步骤, 需要说明的是, 在客户端设备的运行 资源能够满足大模型的部署和运行条件的情况下, 本公开实施例可以在客户端设备中 进行。 在上述运行环境下 , 本公开提供了如图 2所示的视频流生成方法。 图 2是根据本 公开实施例 1的一种视频流生成方法的流程图。 如图 2所示, 该方法可以包括如下步 骤: 步骤 S21 , 获取虚拟相机的设置信息, 其中, 虚拟相机用于在数字挛生世界中录 制虚拟视频流, 数字挛生世界为模拟真实世界的虚拟世界, 设置信息用于调整虚拟相 机的拍摄角度; 步骤 S22, 确定待生成的目标仿真视频流中的画面信息, 其中, 画面信息用于记 载待生成的目标仿真视频流中需要生产的仿真画面元素; 步骤 S23, 基于设置信息和画面信息, 生成初始仿真视频流。 该步骤中的设置信 息可以为动态调整的设置信息, 即在虚拟相机中, 该将设置信息进行动态调整, 得到 调整后的设置信息。 步骤 S24, 基于目标视频生成模型和目标风格图像对初始仿真视频流进行转换, 生成目标仿真视频流, 其中, 目标风格图像为真实世界中的真实图像, 目标仿真视频 流的画面风格与目标风格图像的画面风格相对应。 在本公 开实施例中, 数字挛生世界是指通过数字化技术和模拟仿真技术创建的与 真实世界相对应的虚拟世界, 数字挛生世界用于模拟真实世界, 从而能够基于数字挛 生世界对真实世界进行实时监测、 分析和预测。 虚拟相机是数 字挛生世界中的一个重要工具, 是一种可以模拟真实世界中的真实 相机功能的虚拟设备。 虚拟相机用于在数字挛生世界中录制虚拟视频流, 通过虚拟相 机能够捕捉得到数字挛生世界中的场景和数据, 从而录制得到虚拟视频流。 虚拟视 频流可以理解为由仿真画面构成的虚拟视频数据, 基于虚拟视频流可以更 直观地了解数字挛生世界中的各种情况, 为对真实世界的监测、 分析和预测提供重要 的数据支持。 设置信 息可以理解为虚拟相机的设置参数, 用于调整虚拟相机的拍摄角度, 也即 能够改变通过该虚拟相机所录制得到的虚拟视频流的画面拍摄角度。 示例性地, 设置 信息包括如下至少之一: 于虚拟相机的位置、 姿态、 视场角、 焦距、 光圈、 曝光时间 等参数, 此处不予限制。 目标仿真视频流可以理解为通过本公开提供的视频流生成方法最终生成的仿真视 频流。 画面信息用于记载待生成的目标仿真视频流中需要生产的仿真画面元素, 仿真 画面元素可以理解为用户期望在最终生成的目标仿真视频流中出现的仿真元素。 示例性地, 仿真画面元素可以包括但不限于虚拟视频流中的对象元素、 对象元素 的行动路径以及虚拟视频流所描述的事件类型等元素, 此处不予限制。 其中, 虚拟视 频流中的对象元素可以为行人、 车辆、 动物等。 对象元素的行动路径可以为行人的行 动路径、 车辆的行动路径、 动物的行动路径等。 虚拟视频流所描述的事件类型可以为 行人过马路、 车辆左转、 动物奔跑等真实世界中经常发生的事件类型, 还可以为真实 世界中发生概率极小的事件类型, 还可以为真实世界中从未发生过的事件类型, 即真 实世界中无法感知即感知失败的事件类型, 此处不予限制。 通过确定待生成 的目标仿真视频流中的画面信息, 能够确定出目标仿真视频流中 待出现的仿真画面内容。 可以理解的是, 画面信息能够根据用户的实际需求个性化设 置, 可以应用于任意场景, 此处不予限制, 从而使最终生成的目标仿真视频流中能够 出现用户所需要的仿真画面内容。 基 于虚拟相机设置信息和所确定的画面信息能够生成初始仿真视频流,示例性地, 可以利用基础渲染引擎根据设置信息和画面信息生成的初始仿真视频流, 无需借助强 大的渲染引擎, 能够节约成本。 初始仿真视频流可以理解为用于模拟真实世界的真实 视频流的基础虚拟视频流, 其画质较为粗糙、 画面风格单调、 画面逼真程度欠佳, 因 此需要对初始仿真视频流进行进一步处理。 目标风格图像为真实世界中的真实图像, 可以理解为能够通过真实世界中的真实 相机拍摄得到的真实图像。 目标风格图像可以为根据用户的实际需求个性化选择的图 像, 此处不予限制。 目标视频生成模型可以为大模型或其他深度学习模型, 此处不予限制。 目标视频 生成模型能够根据输入的目标风格图像对初始仿真视频进行转换, 即对初始仿真视频 的画面风格进行转换, 使画面风格按照指定的画面风格类型进行定向生成, 使其与目 标风格图像的画面风格保持一致, 从而输出得到目标仿真视频流。 该目标仿真视频流 的画面风格与目标风格图像的画面风格相对应, 即画面风格保持一致, 从而能够使输 出的目标仿真视频流的逼真程度更高, 模拟真实视频流的效果更好, 进而也能够避免 在目标仿真视频流中出现真实世界中不存在的画面内容。 在本公 开实施例中, 通过调整虚拟相机的设置信息, 从而调整虚拟相机在数字挛 生世界中录制虚拟视频流的拍摄角度, 以及确定用于记载待生成的目标仿真视频流中 需要生产的画面信息, 然后基于设置信息和画面信息, 生成初始仿真视频流, 在将真 实世界中的目标风格图像和初始仿真视频流输入至 目标视频生成模型, 基于目标视频 生成模型和目标风格图像对初始仿真视频流进行转换, 最终生成目标仿真视频流, 使 得目标仿真视频流的画面风格与目标风格图像的画面风格相对应。 可 以看出, 本公开能够个性化设置目标仿真视频流中的仿真画面内容, 使目标仿 真视频流中包括画面信息所记载的仿真画面元素, 从而应用场景十分广泛。 还能够使 目标仿真视频流的画面风格与真实世界中的 目标风格图像的画面风格一致, 从而使目 标仿真视频流的逼真程度更高, 更趋近于现实, 进而也能够让用户感受到真实性、 多 样性。 同时, 本公开能够在数字挛生世界中生成任意场景下画面内容指定且画面风格 趋近于真实的目标仿真视频流, 能够模拟出符合数字挛生任务需求的感知视频流, 极 大丰富了数字挛生任务的应用场景。 本公 开实施例提供的上述视频流生成方法可以但不限于应用于电商服务、 教育服 务、 法律服务、 医疗服务、 会议服务、 社交网络服务、 金融产品服务、 物流服务和导 航服务等领域中涉及仿真视频流生成的应用场景中, 例如: 电商服务的仿真视频流生 成、 教育服务的仿真视频流生成、 法律服务的仿真视频流生成等, 此处不予限制。 采用本公 开实施例, 通过识别虚拟相机的设置信息, 从而调整虚拟相机在数字挛 生世界中录制虚拟视频流的拍摄角度, 以及确定用于记载待生成的目标仿真视频流中 需要生产的画面信息, 然后基于设置信息和画面信息, 生成初始仿真视频流, 在将真 实世界中的目标风格图像和初始仿真视频流输入至 目标视频生成模型, 基于目标视频 生成模型和目标风格图像对初始仿真视频流进行转换, 最终生成目标仿真视频流, 使 得目标仿真视频流的画面风格与目标风格图像的画面风格相对应, 由此达到了生成指 定画面内容与指定画面风格的目标仿真视频流的 目的, 从而实现了生成画面内容更加 真实可靠、 画面风格更加逼真且能够应用于任意场景的目标仿真视频流, 同时丰富了 数字挛生世界中的应用场景的技术效果, 进而解决了虚拟视频流的画面逼真程度低的 技术问题。 在一种可选 的实施例中, 在步骤 S23中, 基于设置信息和画面信息, 生成初始仿 真视频流, 包括如下方法步骤: 基 于设置信息和画面信息生成目标标签, 其中, 目标标签用于标识待生成的目标 仿真视频流的视频属性; 利用数 字挛生系统对设置信息和画面信息进行渲染,得到第一仿真视频流,其中, 数字挛生系统用于构建数字挛生世界; 采用 目标标签对第一仿真视频流进行标记, 得到初始仿真视频流。 在本公 开实施例中, 目标标签用于标识待生成的目标仿真视频流的视频属性, 目 标仿真视频流的视频属性可以包括但不限于 目标仿真视频流的画面大小、 画面方向、 画面风格、 画面内容以及目标仿真视频流所描述的事件类型等, 此处不予限制。 数 字挛生系统可以理解为构建数字挛生世界的数字化系统。 在数字挛生系统中采 用基础的渲染引擎对虚拟相机设置信息和所确定的画面信息进行渲染, 能够得到第一 仿真视频流。 可以理解的是, 该第一仿真视频流的画质较为粗糙, 画面风格单调。 在本公 开实施例中, 在基于设置信息和画面信息, 生成初始仿真视频流时, 可以 基于设置信息和画面信息先生成用于标识待生成的 目标仿真视频流的视频属性的目标 标签,同时利用数字挛生系统对设置信息和画面信息进行渲染,得到第一仿真视频流, 然后再采用目标标签对第一仿真视频流进行标记, 得到初始仿真视频流, 从而实现自 动对初始仿真视频流标注目标标签的技术效果。 可 以理解的是, 在一种实施方式中, 视频流通常需要人工标注标签, 导致人力成 本和时间成本较高。 本公开实施例中, 基于设置信息和画面信息能够自动生成用于标 识待生成的目标仿真视频流的视频属性的 目标标签, 并采用该目标标签对第一仿真视 频流进行标记,从而得到初始仿真视频流,使得生成的初始仿真视频流携带目标标签, 因此无需人工标注视频流的标签, 有效降低了人力成本和时间成本。 在一种可选 的实施例中, 该视频流生成方法还包括如下方法步骤: 获取 第一图像样本和第二图像样本, 其中, 第一图像样本为真实世界中的真实图 像样本, 第二图像样本为与第一图像样本的画面内容对应的虚拟图像样本; 基 于第一图像样本和第二图像样本对初始视频生成模型进行训练, 得到目标视频 生成模型。 在本公 开实施例中, 第一图像样本可以理解为真实世界中通过真实相机拍摄得到 的真实图像样本, 第二图像样本可以理解为虚拟世界中的虚拟图像样本, 第二图像样 本为与第一图像样本的画面内容对应。 示例性地, 第一图像样本可以为真实的小狗图 像样本, 第二图像样本则为与第一图像样本的画面内容对应的虚拟的小狗图像样本, 此处需要说明的是, 本公开上述真实图像样本和虚拟图像样本的样本数量级满足训练 视频生成模型, 此处不予限制。 初始视 频生成模型即为目标视频生成模型训练前的模型, 可以为大模型或其他深 度学习模型, 此处不予限制。 在本公 开实施例中, 在训练得到目标视频生成模型时, 可以通过获取真实世界中 拍摄得到的第一图像样本, 以及与第一图像样本的画面内容对应的第二图像样本, 然 后基于第一图像样本和第二图像样本对初始视频生成模型进行训练, 从而得到目标视 频生成模型。 在一种可选 的实施例中, 获取第二图像样本, 包括如下方法步骤: 对 第一图像样本进行图像检测, 得到第一检测结果, 其中, 第一检测结果用于表 示第一图像样本中的真实画面元素; 对 第一检测结果进行图像仿真处理, 生成第二图像样本, 其中, 第二图像样本中 的仿真画面元素与第一图像样本中的真实画面元素相对应。 在本公 开实施例中, 对第一图像样本进行图像检测, 可以理解为对第一图像样本 进行图像画面内容检测, 检测得到第一图像样本中所包括的真实画面元素, 从而得到 第一检测结果, 该第一检测结果即用于表示第一图像样本中的真实画面元素。 对 第一检测结果进行图像仿真处理, 可以理解为对第一检测结果中所表示的真实 画面元素进行图像仿真处理, 仿真得到与该真实画面元素对应的仿真画面元素, 进而 生成包括该仿真画面元素的第二图像样本, 该第二图像样本中的仿真画面元素与第一 图像样本中的真实画面元素相对应, 即保持一致。 在本公 开实施例中, 在获取第二图像样本时, 可以通过对第一图像样本进行图像 检测, 得到用于表示第一图像样本中的真实画面元素的第一检测结果, 然后对该第一 检测结果进行图像仿真处理, 生成第二图像样本, 使得第二图像样本中的仿真画面元 素与第一图像样本中的真实画面元素相对应, 也即尽量使第二图像样本中的仿真画面 元素与第一图像样本中的真实画面元素保持一致。 在一种可选 的实施例中, 获取第二图像样本, 包括如下方法步骤: 对 第一图像样本进行图像检测, 得到第二检测结果, 其中, 第二检测结果用于表 示第一图像样本所描述的真实事件内容; 对 第二检测结果进行图像仿真处理, 生成第二图像样本, 其中, 第二图像样本所 描述的仿真事件内容与第一图像样本所描述的真实事件内容相对应。 在本公 开实施例中, 对第一图像样本进行图像检测, 可以理解为对第一图像样本 进行事件内容检测, 检测得到第一图像样本所描述的真实事件内容, 从而得到第二检 测结果, 该第二检测结果即用于表示第一图像样本所描述的真实事件内容。 对 第二检测结果进行图像仿真处理, 可以理解为对第二检测结果中所表示的真实 事件内容进行图像仿真处理, 仿真得到与该真实事件内容对应的仿真事件内容, 进而 生成描述该仿真事件内容的第二图像样本, 该第二图像样本所描述的仿真事件内容与 第一图像样本所描述的真实事件内容相对应, 即保持一致。 在本公 开实施例中, 在获取第二图像样本时, 可以通过对第一图像样本进行图像 检测, 得到用于表示第一图像样本所描述的真实事件内容的第二检测结果, 然后对该 第二检测结果进行图像仿真处理, 生成第二图像样本, 使得第二图像样本所描述的仿 真事件内容与第一图像样本所描述的真实事件内容相对应, 也即尽量使第二图像样本 所描述的仿真事件内容与第一图像样本所描述的真实事件内容保持一致。 在一种可选 的实施例中, 基于第一图像样本和第二图像样本对初始视频生成模型 进行训练, 得到目标视频生成模型, 包括如下方法步骤: 对 第一图像样本进行图像视角转换, 生成第三图像样本, 其中, 第三图像样本为 第一图像样本在不同视角下的图像; 对 第二图像样本进行图像视角转换, 生成第四图像样本, 其中, 第四图像样本为 第二图像样本在不同视角下的图像; 基于 第一图像样本、 第二图像样本、 第三图像样本和第四图像样本对初始视频生 成模型进行训练, 得到目标视频生成模型。 在本公开 实施例中, 获取到第一图像样本与第二图像样本后, 还可以对第一图像 样本进行图像视角转换, 生成第三图像样本, 该第三图像样本即为第一图像样本在不 同视角下的图像。 同时, 还可以对第二图像样本进行图像视角转换, 生成第四图像样 本, 该第四图像样本即为第二图像样本在不同视角下的图像, 从而在训练目标视频生 成模型时可以基于多视角下的真实图像样本与对应的多视角下的虚拟图像样本进行训 练, 提高训练得到的目标视频生成模型的输出准确性。 示例性地 , 在对第一图像样本进行图像视角转换时, 可以通过对第一图像样本进 行旋转、 扣取、 增加高斯噪声等操作进行视角转换, 从而得到不同视角下的第三图像 样本, 此处不予限制。 在本公开 实施例中, 在基于第一图像样本和第二图像样本对初始视频生成模型进 行训练, 得到目标视频生成模型时, 可以对第一图像样本进行图像视角转换, 生成第 — 图像样本在不同视角下的第三图像样本, 以及对第二图像样本进行图像视角转换, 生成第二图像样本在不同视角下的第四图像样本, 然后基于第一图像样本、 第二图像 样本、 第三图像样本和第四图像样本对初始视频生成模型进行训练, 从而得到目标视 频生成模型。 在一种可选 的实施例中, 基于第一图像样本、 第二图像样本、 第三图像样本和第 四图像样本对初始视频生成模型进行训练, 得到目标视频生成模型, 包括如下方法步 骤: 基于 第一图像样本、 第二图像样本、 第三图像样本和第四图像样本对初始编码器 进行训练, 得到目标编码器; 基于第一 图像样本和第三图像样本对初始解码器进行训练, 得到目标解码器; 基于 目标编码器和目标解码器确定目标视频生成模型。 在本公开 实施例中, 在基于第一图像样本和第二图像样本对初始视频生成模型进 行训练, 得到目标视频生成模型时, 可以基于第一图像样本、 第二图像样本、 第三图 像样本和第四图像样本对初始编码器进行训练, 即基于不同视角下的真实图像样本和 对应的虚拟图像样本对初始编码器进行训练, 从而得到目标编码器。 同时, 基于第一 图像样本和第三图像样本对初始解码器进行训练, 即基于不同视角下的真是图像样本 作为输入及输出的监督信号对初始解码器进行训练, 从而得到目标解码器。 最后基于 目标编码器和目标解码器确定目标视频生成模型, 即将训练得到的目标编码器和训练 得到的目标解码器的参数冻结, 并将目标编码器和目标解码器连接起来, 使目标编码 器的输出作为目标解码器的输入, 从而构成一个完整的模型, 即得到目标视频生成模 型 在一种可选 的实施例中, 基于第一图像样本、 第二图像样本、 第三图像样本和第 四图像样本对初始编码器进行训练, 得到目标编码器, 包括如下方法步骤: 将 第一图像样本和第三图像样本, 确定为第一样本组合; 将 第二图像样本和第四图像样本, 确定为第二样本组合; 将 第一图像样本和第二图像样本, 确定为第三样本组合; 基 于对比损失函数、 第一样本组合、 第二样本组合和第三样本组合对初始编码器 进行对比学习训练, 得到目标编码器。 在本公 开实施例中, 在基于第一图像样本、 第二图像样本、 第三图像样本和第四 图像样本对初始编码器进行训练, 得到目标编码器时, 可以将不同视角下的真实图像 样本与虚拟图像样本进行配对组合, 得到第一样本组合、 第二样本组合和第三样本组 合。 然后基于对比损失函数、 第一样本组合、 第二样本组合和第三样本组合对初始编 码器进行对比学习训练, 得到目标编码器。 其 中, 根据第一图像样本和第三图像样本确定第一样本组合, 第一样本组合即为 不同视角下的真实图像样本的组合, 根据第二图像样本和第四图像样本确定第二样本 组合, 第二样本组合即为不同视角下的虚拟图像样本的组合, 根据第一图像样本和第 二图像样本确定第三样本组合, 第三样本组合即为相同视角下真实图像样本与对应的 虚拟图像样本的组合。 示例性地, 以第一样本组合中包括某一图像样本在第一视角下的图像样本和在第 二视角下的图像样本为例, 基于对比损失函数、 第一样本组合、 第二样本组合和第三 样本组合对初始编码器进行对比学习训练时, 可以利用初始编码器分别对第一视角下 的图像样本进行编码, 得到第一特征, 以及对第二视角下的图像样本进行编码, 得到 第二特征。 由于第一视角下的图像样本和第二视角下的图像样本的图像内容接近, 因 此利用对比学习损失函数, 拉近第一特征和第二特征的特征距离, 拉远第一特征与其 他样本特征的距离, 从而对初始编码器进行对比学习训练。 同理, 对第二样本组合和 第三样本组合执行相似过程, 此处不予赘述, 进而使图像内容接近的真实图像样本和 对应的虚拟图像样本的特征的距离也更为接近, 从而训练得到目标编码器。 图 3是根据本公开实施例 1的训练编码器的流程图, 如图 3所示, 在训练编码器 时, 将真实图像样本与虚拟图像样本的混合集根据视角进行划分, 得到视角 1和视角 2。 在本公开实施例中, 该视角 1和视角 2的配对有三种组合, 即上述第一样本组合、 第二样本组合和第三样本组合。 然后基于对比损失函数、 视角 1和视角 2对编码器进 行对比学习训练。 在一种可选 的实施例中, 基于第一图像样本和第三图像样本对初始解码器进行训 练, 得到目标解码器, 包括如下方法步骤: 基于 第一图像样本和第三图像样本对初始解码器进行自回归训练, 得到目标解码 器。 在本公开 实施例中,在基于第一图像样本和第三图像样本对初始解码器进行训练 , 得到目标解码器时, 可以基于第一图像样本和第三图像样本对初始解码器进行自回归 训练,得到目标解码器,即采用多视角下的真实图像样本作为输入及输出的监督信号, 对初始解码器进行自回归训练, 从而得到目标解码器。 图 4是根据本公开实施例 1的训练解码器的流程图, 如图 4所示, 可以将训练好 的编码器进行参数冻结, 然后将真实图像样本输入至编码器进行特征编码, 将得到的 编码结果输入至解码器中, 使解码器对该编码结果进行解码并输出目标图像。 之后将 输出的目标图像将与输入的真实图像样本进行比较, 计算两者之间的差异, 并基于差 异调整解码器的参数, 对解码器进行自回归训练, 直到解码器能够输出满足要求的目 标图像。 在一种可选 的实施例中, 在步骤 S24中, 基于目标视频生成模型和目标风格图像 对初始仿真视频流进行转换, 生成目标仿真视频流, 包括如下方法步骤: 采用 目标编码器对目标风格图像进行特征编码, 得到第一编码结果, 以及采用目 标编码器对初始仿真视频流的视频帧图像进行特征编码, 得到第二编码结果; 对第一编码结果和第二编码结果进行特征融合 , 得到融合结果; 采用 目标解码器对融合结果进行解码, 得到目标图像; 基于 目标图像生成目标仿真视频流。 在本公开 实施例中, 在基于目标视频生成模型和目标风格图像对初始仿真视频流 进行转换, 生成目标仿真视频流时, 可以将目标风格图像和初始仿真视频流输入至目 标视频生成模型, 然后采用目标视频生成模型中的目标编码器对目标风格图像进行特 征编码, 得到第一编码结果, 以及采用目标编码器对初始仿真视频流的视频帧图像进 行特征编码, 得到第二编码结果, 也即对初始仿真视频流进行逐帧处理, 对每一视频 帧图像都进行特征编码, 从而得到第二编码结果。 得到 第一编码结果和第二编码结果之后, 对第一编码结果和第二编码结果进行特 征融合, 得到融合结果, 即得到具有初始仿真视频流中的仿真画面内容和目标风格图 像的画面风格的新特征编码。 之后 , 采用目标视频生成模型中的目标解码器对融合结 果进行解码, 得到目标图像。 最后, 基于该目标图像生成目标仿真视频流, 使得该目 标仿真视频流拥有指定仿真画面内容以及指定画面风格。 图 5是根据本公开实施例 1的目标视频生成模型的推断过程流程图,如图 5所示, 输入至目标视频生成模型中的初始仿真视频流的虚拟视频帧图像以及真实的 目标风格 图像首先通过目标编码器进行特征编码, 得到两者的编码结果。 然后将两者的编码结 果基于融合模块进行特征融合, 示例性地, 可以采用白化和颜色转换( whitening and coloring transform, 简称为 WCT) 方法对两者的编码结果进行特征融合, 得到融合结 果。 之后将融合结果通过目标解码器进行解码, 从而将具有虚拟视频帧图像的画面内 容和目标风格图像的画面风格的目标图像进行输出, 最后基于输出的目标图像构成目 标仿真视频流。 在一种可选 的实施例中, 在步骤 S21中, 获取虚拟相机的设置信息, 包括如下方 法步骤: 确定虚拟相机 的位置信息、 姿态信息和视场角信息; 基 于位置信息、 姿态信息和视场角信息获取设置信息。 在本公 开实施例中, 虚拟相机的位置信息可以理解为虚拟相机在数字挛生世界中 的位置坐标, 记为 (x, y, z), 其中, x可以理解为虚拟相机所在的经度, y可以理解 为虚拟相机所在的维度, z可以理解为虚拟相机所在的海拔高度。 虚拟相机 的姿态信息可以理解为虚拟相机在数字挛生世界中的朝向,记为(h, p, r), 其中, h可以理解为虚拟相机的偏航角, p可以理解为虚拟相机的俯仰角, r可以 理解为虚拟相机的横滚角。 虚拟相机 的视场角 (Field of View, 简称为 FOV)信息可以理解为虚拟相机能够 观察到的视野范围, 可以用角度来表示。 可以理解的是, 较大的视场角表示虚拟相机 可以观察到更广阔的范围, 而较小的视场角则表示虚拟相机的视野范围更窄。 在本公 开实施例中, 在获取虚拟相机的设置信息时, 可以根据实际需求确定虚拟 相机的位置信息、 姿态信息和视场角信息, 然后基于位置信息、 姿态信息和视场角信 息获取虚拟相机的设置信息, 使虚拟相机的拍摄角度符合实际需求。 在一种可选 的实施例中, 画面信息包括待生成的目标仿真视频流所描述的目标事 件的目标事件类型和目标事件的事件时长, 目标事件类型包括在真实世界中感知失败 的事件类型, 事件时长用于表示目标事件从发生至结束的时间长度, 利用数字挛生系 统对设置信息和画面信息进行渲染, 得到第一仿真视频流, 包括如下方法步骤: 首先, 基于事件时长确定第一仿真视频的视频时长, 其中, 视频时长用于表示第 一仿真视频从开始播放至结束播放的时间长度, 视频时长大于等于事件时长; 然后, 利用数字挛生系统对视频时长、 设置信息和画面信息进行渲染, 得到初始 仿真视频流。 在本公 开实施例中, 画面信息可以包括但不限于待生成的目标仿真视频流所描述 的目标事件的目标事件类型、 目标事件的事件时长、 目标仿真视频流中的对象元素、 对象元素的行动路径等, 此处不予限制。 其中, 目标事件的事件时长可以理解为目标 事件从发生至结束的时间长度。 目标事件类型可以包括但不限于在真实世界中无法感知即感知失败的事件类型、 在真实世界中经常发生的事件类型以及在真实世界中发生概率极小的事件类型, 此处 不予限制。 在本公开 实施例中, 在利用数字挛生系统对设置信息和画面信息进行渲染, 得到 第一仿真视频流时, 可以基于画面信息中所记载的目标事件的事件时长先确定第一仿 真视频的视频时长, 该视频时长需要大于等于事件时长。 然后利用数字挛生系统对视 频时长、 设置信息和画面信息进行渲染, 从而得到初始仿真视频流。 图 6是根据本公开实施例 1的另一种视频流生成方法流程图, 如图 6所示, 首先 通过确定数字挛生世界中的虚拟相机的相机位置、 姿态、 视场角等信息, 并在数字挛 生系统中进行设定。 然后按照用户需求, 设定待生成的仿真视频流中待出现的画面内 容, 例如设定行人、 车辆行驶轨迹, 发生的事件类型等。 同时可以根据设定的画面内 容以及确定的虚拟相机参数, 生成仿真的标签。 接着根据画面内容中所设定的目标事 件的事件时长, 利用数字挛生引擎录制基础视频流。 最后将录制得到的基础视频流和 指定的风格图像输入至目标视频生成模型, 从而将基础视频流转化为用户指定的真实 风格的逼真视频流。 可 以看出,本公开实施例基于数字挛生世界,研发并搭建了视频流感知模拟系统。 该系统利用基础渲染引擎生成基础的虚拟视频流, 并进一步利用图像生成技术, 将基 础虚拟视频流转化为具有指定风格的逼真视频流。 该生成视频流的内容能够根据任务 需求定制化模拟各种情形, 并自带属性标注结果。 该视频流感知模拟系统能够模拟出 符合数字挛生功能需求的感知视频流, 极大的丰富了数字挛生的应用场景, 并减少了 人力和时间成本。 相 比于一种实施方式中依赖于强大的渲染引擎仅能生成画面风格单一且逼真程度 欠佳的虚拟视频流, 本公开基于基础的渲染引擎和目标视频生成模型能够按照用户指 定的风格类型进行定向生成, 使得所生成的目标仿真视频流的画面风格多样化, 且更 加逼真。再者,一种实施方式中利用渲染器的能力无法改变虚拟视频流的不真实内容, 本公开能够生成指定画面内容的目标仿真视频流, 做到画面内容更为真实可靠, 且不 仅能够生成真实世界中经常发生的事件对应的仿真视频流, 还能够生成真实世界中极 不容易发生的事件以及未发生过的事件对应的仿真视频流, 极大丰富了数字挛生世界 的场景。 此外, 一种实施方式中需要人工对视频流进行标签标注, 本公开生成的目标 仿真视频流自带目标标签, 能够标记目标仿真视频流的视频属性, 从而降低了人力成 本和时间成札 使得基于海量有标签视频数据进行模型训练具有可能性。 容 易理解的是, 本公开提供的视频流生成方法的有益效果包括以下几点。 本公开仅 需使用基础的渲染器生成基础视频流, 然后利用目标仿真视频生成模型 和指定的目标图像风格对该基础视频流进行定向转化, 使得到的目标仿真视频流更加 逼真, 且画面内容更为真实可靠。 本公开生成 的目标仿真视频流的画面内容能够根据任务需求定制化模拟各种情形 , 应用场景广泛, 不仅能够生成真实世界中经常发生的事件对应的目标仿真视频流, 还 能够生成真实世界中极不容易发生的事件以及未发生过的事件对应的目标仿真视频流, 极大丰富了数字挛生世界的场景。 本公 开生成的目标仿真视频流自带目标标签, 能够标记目标仿真视频流的视频属 性, 从而降低了人力成本和时间成本, 使得基于海量有标签视频数据进行模型训练具 有可能性。 需要说明的是, 本公开所涉及的用户信息 (包括但不限于用户设备信息、 用户个 人信息等 )和数据(包括但不限于用于分析的数据、 存储的数据、 展示的数据等), 均 为经用户授权或者经过各方充分授权的信息和数据, 并且相关数据的收集、 使用和处 理需要遵守相关国家和地区的相关法律法规和标准, 并提供有相应的操作入口, 供用 户选择授权或者拒绝。 另外, 还需要说明的是, 对于前述的各方法实施例, 为了简单描述, 故将其都表 述为一系列的动作组合, 但是本领域技术人员应该知悉, 本公开并不受所描述的动作 顺序的限制, 因为依据本公开, 某些步骤可以采用其他顺序或者同时进行。 其次, 本 领域技术人员也应该知悉, 说明书中所描述的实施例均属于优选实施例, 所涉及的动 作和模块并不一定是本公开所必须的。 通过 以上的实施方式的描述, 本领域的技术人员可以清楚地了解到根据上述实施 例的方法可借助软件加必需的通用硬件平台的方式来实现, 当然也可以通过硬件。 基 于这样的理解, 本公开的技术方案本质上或者说对现有技术做出贡献的部分可以以软 件产品的形式体现出来, 该计算机软件产品存储在一个存储介质 (如 ROM/RAM、 磁 碟、 光盘)中, 包括若干指令用以使得一台终端设备(可以是手机, 计算机, 服务器, 或者网络设备等)执行本公开各个实施例所述的方法。 实施例 2 在如 实施例 1中的运行环境下,本公开提供了如图 7所示的一种视频流生成方法, 图 7是根据本公开实施例 2的一种视频流生成方法的流程图, 如图 7所示, 该方法包 括: 步骤 S71 , 响应作用于操作界面上的调整指令, 在操作界面上显示虚拟相机的设 置信息, 其中, 虚拟相机用于在数字挛生世界中录制虚拟视频流, 数字挛生世界为模 拟真实世界的虚拟世界, 设置信息用于调整虚拟相机的拍摄角度; 步骤 S72, 响应作用于操作界面上的输入指令, 在操作界面上显示待生成的目标 仿真视频流中的画面信息, 其中, 画面信息用于记载待生成的目标仿真视频流中需要 生产的仿真画面元素; 步骤 S73, 响应作用于操作界面上的仿真指令, 在操作界面上显示目标仿真视频 流, 其中, 目标仿真视频流基于目标视频生成模型和目标风格图像对初始仿真视频流 进行转换而生成, 目标风格图像为真实世界中的真实图像, 目标仿真视频流的画面风 格与目标风格图像的画面风格相对应, 初始仿真视频流基于设置信息和画面信息生成 而得到。 在本公 开实施例中, 调整指令可以理解为用户在操作界面上进行调整操作所触发 生成的用于对虚拟相机的设置参数进行调整的指令。 输入指令可以理解为用户在操作 界面上进行输入操作所触发生成的用于显示待生成的 目标仿真视频流中的画面信息的 指令。 仿真指令可以理解为用户在操作界面上进行仿真操作所触发生成的用于显示目 标仿真视频流的指令。 在本公 开实施例中, 在接收到作用于操作界面上的调整指令时, 可以在操作界面 上显示虚拟相机的设置信息, 从而对虚拟相机的设置参数进行调整, 其中, 虚拟相机 用于在数字挛生世界中录制虚拟视频流, 数字挛生世界为模拟真实世界的虚拟世界, 设置信息用于调整虚拟相机的拍摄角度。 在接收到作用于操作界面上的输入指令时, 可以在操作界面上显示待生成的目标仿真视频流中的画面信息, 其中, 画面信息用于 记载待生成的目标仿真视频流中需要生产的仿真画面元素。 在接收到作用于操作界面 上的仿真指令时, 可以在操作界面上显示目标仿真视频流, 其中, 目标仿真视频流基 于目标视频生成模型和目标风格图像对初始仿真视频流进行转换而生成, 目标风格图 像为真实世界中的真实图像, 目标仿真视频流的画面风格与目标风格图像的画面风格 相对应, 初始仿真视频流基于设置信息和画面信息生成而得到。 可 以看出, 本公开能够个性化设置目标仿真视频流中的仿真画面内容, 使目标仿 真视频流中包括画面信息所记载的仿真画面元素, 从而应用场景十分广泛。 还能够使 目标仿真视频流的画面风格与真实世界中的 目标风格图像的画面风格一致, 从而使目 标仿真视频流的逼真程度更高, 更趋近于现实, 进而也能够让用户感受到真实性、 多 样性。 同时, 本公开能够在数字挛生世界中生成任意场景下画面内容指定且画面风格 趋近于真实的目标仿真视频流, 能够模拟出符合数字挛生任务需求的感知视频流, 极 大丰富了数字挛生任务的应用场景。 本公 开实施例提供的上述视频流生成方法可以但不限于应用于电商服务、 教育服 务、 法律服务、 医疗服务、 会议服务、 社交网络服务、 金融产品服务、 物流服务和导 航服务等领域中涉及仿真视频流生成的应用场景中, 例如: 电商服务的仿真视频流生 成、 教育服务的仿真视频流生成、 法律服务的仿真视频流生成等, 此处不予限制。 采用本公 开实施例, 通过在接收到作用于操作界面上的调整指令时, 可以在操作 界面上显示虚拟相机的设置信息, 从而对虚拟相机的设置参数进行调整, 其中, 虚拟 相机用于在数字挛生世界中录制虚拟视频流, 数字挛生世界为模拟真实世界的虚拟世 界, 设置信息用于调整虚拟相机的拍摄角度, 在接收到作用于操作界面上的输入指令 时, 可以在操作界面上显示待生成的目标仿真视频流中的画面信息, 其中, 画面信息 用于记载待生成的目标仿真视频流中需要生产的仿真画面元素, 在接收到作用于操作 界面上的仿真指令时, 可以在操作界面上显示目标仿真视频流, 其中, 目标仿真视频 流基于目标视频生成模型和目标风格图像对初始仿真视频流进行转换而生成, 目标风 格图像为真实世界中的真实图像, 目标仿真视频流的画面风格与目标风格图像的画面 风格相对应, 初始仿真视频流基于设置信息和画面信息生成而得到, 由此达到了生成 指定画面内容与指定画面风格的目标仿真视频流的目的, 从而实现了生成画面内容更 加真实可靠、 画面风格更加逼真且能够应用于任意场景的目标仿真视频流, 同时丰富 了数字挛生世界中的应用场景的技术效果, 进而解决了虚拟视频流的画面逼真程度低 的技术问题。 需要说 明的是, 本实施例的优选实施方式可以参见实施例 1中的相关描述, 此处 不再赘述。 实施例 3 在如 实施例 1中的运行环境下,本公开提供了如图 8所示的一种视频流生成方法。 图 8是根据本公开实施例 3的一种视频流生成方法的流程图, 如图 8所示, 该方法包 括: 步骤 S81 , 通过第一应用程序编程接口获取仿真视频流生成请求; 步骤 S82, 通过第二应用程序编程接口返回仿真视频流生成响应; 其中, 仿真视 频流生成请求中包括:虚拟相机的设置信息和待生成的目标仿真视频流中的画面信息, 仿真视频流生成响应中包括: 目标仿真视频流, 虚拟相机用于在数字挛生世界中录制 虚拟视频流, 数字挛生世界为模拟真实世界的虚拟世界, 设置信息用于调整虚拟相机 的拍摄角度,画面信息用于记载待生成的目标仿真视频流中需要生产的仿真画面元素, 目标仿真视频流基于目标视频生成模型和目标风格图像对初始仿真视频流进行转换而 生成, 目标风格图像为真实世界中的真实图像, 目标仿真视频流的画面风格与目标风 格图像的画面风格相对应, 初始仿真视频流基于设置信息和画面信息生成而得到。 在本公开 实施例中,仿真视频流生成请求可以理解为用于生成仿真视频流的请求, 仿真视频流生成请求中包括: 虚拟相机的设置信息和待生成的目标仿真视频流中的画 面信息。 仿真视频流生成响应为仿真视频流生成请求对应的回复响应, 仿真视频流生 成响应中包括: 目标仿真视频流。 在本公开 实施例中,通过第一应用程序编程接口获取仿真视频流生成请求,其中, 仿真视频流生成请求中包括: 虚拟相机的设置信息和待生成的目标仿真视频流中的画 面信息, 虚拟相机用于在数字挛生世界中录制虚拟视频流, 数字挛生世界为模拟真实 世界的虚拟世界, 设置信息用于调整虚拟相机的拍摄角度, 画面信息用于记载待生成 的目标仿真视频流中需要生产的仿真画面元素。 然后可以通过第二应用程序编程接口 返回仿真视频流生成响应, 其中, 仿真视频流生成响应中包括: 目标仿真视频流, 目 标仿真视频流基于目标视频生成模型和 目标风格图像对初始仿真视频流进行转换而生 成, 目标风格图像为真实世界中的真实图像, 目标仿真视频流的画面风格与目标风格 图像的画面风格相对应, 初始仿真视频流基于设置信息和画面信息生成而得到。 可 以看出, 本公开能够个性化设置目标仿真视频流中的仿真画面内容, 使目标仿 真视频流中包括画面信息所记载的仿真画面元素, 从而应用场景十分广泛。 还能够使 目标仿真视频流的画面风格与真实世界中的 目标风格图像的画面风格一致, 从而使目 标仿真视频流的逼真程度更高, 更趋近于现实, 进而也能够让用户感受到真实性、 多 样性。 同时, 本公开能够在数字挛生世界中生成任意场景下画面内容指定且画面风格 趋近于真实的目标仿真视频流, 能够模拟出符合数字挛生任务需求的感知视频流, 极 大丰富了数字挛生任务的应用场景。 本公 开实施例提供的上述视频流生成方法可以但不限于应用于电商服务、 教育月艮 务、 法律服务、 医疗服务、 会议服务、 社交网络服务、 金融产品服务、 物流服务和导 航服务等领域中涉及仿真视频流生成的应用场景中, 例如: 电商服务的仿真视频流生 成、 教育服务的仿真视频流生成、 法律服务的仿真视频流生成等, 此处不予限制。 采用本公开 实施例,通过第一应用程序编程接口获取仿真视频流生成请求,其中, 仿真视频流生成请求中包括: 虚拟相机的设置信息和待生成的目标仿真视频流中的画 面信息, 虚拟相机用于在数字挛生世界中录制虚拟视频流, 数字挛生世界为模拟真实 世界的虚拟世界, 设置信息用于调整虚拟相机的拍摄角度, 画面信息用于记载待生成 的目标仿真视频流中需要生产的仿真画面元素, 然后可以通过第二应用程序编程接口 返回仿真视频流生成响应, 其中, 仿真视频流生成响应中包括: 目标仿真视频流, 目 标仿真视频流基于目标视频生成模型和 目标风格图像对初始仿真视频流进行转换而生 成, 目标风格图像为真实世界中的真实图像, 目标仿真视频流的画面风格与目标风格 图像的画面风格相对应, 初始仿真视频流基于设置信息和画面信息生成而得到, 由此 达到了生成指定画面内容与指定画面风格的 目标仿真视频流的目的, 从而实现了生成 画面内容更加真实可靠、画面风格更加逼真且能够应用于任意场景的目标仿真视频流, 同时丰富了数字挛生世界中的应用场景的技术效果, 进而解决了虚拟视频流的画面逼 真程度低的技术问题。 需要说明的是, 本实施例的优选实施方式可以参见实施例 1中的相关描述, 此处 不再赘述。 实施例 4 在如 实施例 1中的运行环境下,本公开提供了如图 9所示的一种视频流生成方法。 图 9是根据本公开实施例 4的一种视频流生成方法的流程图, 如图 9所示, 该方法包 括: 步骤 S91 , 获取输入的仿真视频流生成对话请求; 步骤 S92, 响应于仿真视频流生成对话请求, 返回仿真视频流生成对话回复; 仿 真视频流生成对话请求中包括: 虚拟相机的设置信息和待生成的目标仿真视频流中的 画面信息, 仿真视频流生成对话回复中包括: 目标仿真视频流, 虚拟相机用于在数字 挛生世界中录制虚拟视频流, 数字挛生世界为模拟真实世界的虚拟世界, 设置信息用 于调整虚拟相机的拍摄角度; 画面信息用于记载待生成的目标仿真视频流中需要生产 的仿真画面元素; 目标仿真视频流基于目标视频生成模型和目标风格图像对初始仿真 视频流进行转换而生成, 目标风格图像为真实世界中的真实图像, 目标仿真视频流的 画面风格与目标风格图像的画面风格相对应, 初始仿真视频流基于设置信息和画面信 息生成而得到; 步骤 S93, 在图形用户界面内展示目标仿真视频流。 在本公 开实施例中, 仿真视频流生成对话请求可以理解为用户与智能机器进行对 话时的对话请求, 仿真视频流生成对话请求中包括: 虚拟相机的设置信息和待生成的 目标仿真视频流中的画面信息。 仿真视频流生成对话回复可以理解为对仿真视频流生 成对话请求进行的对话回复, 仿真视频流生成对话回复中包括: 目标仿真视频流。 在本公 开实施例中, 通过获取输入的仿真视频流生成对话请求, 其中, 仿真视频 流生成对话请求中包括: 虚拟相机的设置信息和待生成的目标仿真视频流中的画面信 息, 然后响应于仿真视频流生成对话请求, 返回仿真视频流生成对话回复, 其中, 仿 真视频流生成对话回复中包括: 目标仿真视频流, 虚拟相机用于在数字挛生世界中录 制虚拟视频流, 数字挛生世界为模拟真实世界的虚拟世界, 设置信息用于调整虚拟相 机的拍摄角度, 画面信息用于记载待生成的目标仿真视频流中需要生产的仿真画面元 素, 目标仿真视频流基于目标视频生成模型和目标风格图像对初始仿真视频流进行转 换而生成, 目标风格图像为真实世界中的真实图像, 目标仿真视频流的画面风格与目 标风格图像的画面风格相对应,初始仿真视频流基于设置信息和画面信息生成而得到, 最后在图形用户界面内展示目标仿真视频流, 以向用户进行反馈。 可 以看出, 本公开能够个性化设置目标仿真视频流中的仿真画面内容, 使目标仿 真视频流中包括画面信息所记载的仿真画面元素, 从而应用场景十分广泛。 还能够使 目标仿真视频流的画面风格与真实世界中的 目标风格图像的画面风格一致, 从而使目 标仿真视频流的逼真程度更高, 更趋近于现实, 进而也能够让用户感受到真实性、 多 样性。 同时, 本公开能够在数字挛生世界中生成任意场景下画面内容指定且画面风格 趋近于真实的目标仿真视频流, 能够模拟出符合数字挛生任务需求的感知视频流, 极 大丰富了数字挛生任务的应用场景。 本公 开实施例提供的上述视频流生成方法可以但不限于应用于电商服务、 教育服 务、 法律服务、 医疗服务、 会议服务、 社交网络服务、 金融产品服务、 物流服务和导 航服务等领域中涉及仿真视频流生成的应用场景中, 例如: 电商服务的仿真视频流生 成、 教育服务的仿真视频流生成、 法律服务的仿真视频流生成等, 此处不予限制。 采用本公 开实施例, 通过获取输入的仿真视频流生成对话请求, 其中, 仿真视频 流生成对话请求中包括: 虚拟相机的设置信息和待生成的目标仿真视频流中的画面信 息, 然后响应于仿真视频流生成对话请求, 返回仿真视频流生成对话回复, 其中, 仿 真视频流生成对话回复中包括: 目标仿真视频流, 虚拟相机用于在数字挛生世界中录 制虚拟视频流, 数字挛生世界为模拟真实世界的虚拟世界, 设置信息用于调整虚拟相 机的拍摄角度; 画面信息用于记载待生成的目标仿真视频流中需要生产的仿真画面元 素; 目标仿真视频流基于目标视频生成模型和目标风格图像对初始仿真视频流进行转 换而生成, 目标风格图像为真实世界中的真实图像, 目标仿真视频流的画面风格与目 标风格图像的画面风格相对应,初始仿真视频流基于设置信息和画面信息生成而得到, 最后在图形用户界面内展示目标仿真视频流, 以向用户进行反馈, 由此达到了生成指 定画面内容与指定画面风格的目标仿真视频流的 目的, 从而实现了生成画面内容更加 真实可靠、 画面风格更加逼真且能够应用于任意场景的目标仿真视频流, 同时丰富了 数字挛生世界中的应用场景的技术效果, 进而解决了虚拟视频流的画面逼真程度低的 技术问题。 需要说明的是, 本实施例的优选实施方式可以参见实施例 1中的相关描述, 此处 不再赘述。 实施例 5 根据本公 开实施例, 还提供了一种用于实施上述视频流生成方法的装置实施例。 图 10是根据本公开实施例 5的一种视频流生成装置的结构示意图, 如图 10所示, 该 视频流生成装置 1000包括: 第一获取模块 1001 , 被设置为获取虚拟相机的设置信息, 其中, 虚拟相机用于在 数字挛生世界中录制虚拟视频流, 数字挛生世界为模拟真实世界的虚拟世界, 设置信 息用于调整虚拟相机的拍摄角度; 确定模块 1002, 被设置为确定待生成的目标仿真视频流中的画面信息, 其中, 画 面信息用于记载待生成的目标仿真视频流中需要生产的仿真画面元素; 第一生成模块 1003 , 被设置为基于设置信息和画面信息, 生成初始仿真视频流; 第二生成模块 1004, 被设置为基于目标视频生成模型和目标风格图像对初始仿真 视频流进行转换, 生成目标仿真视频流, 其中, 目标风格图像为真实世界中的真实图 像, 目标仿真视频流的画面风格与目标风格图像的画面风格相对应。 可选地 ,上述第一生成模块 1003还被设置为:基于设置信息和画面信息生成目标 标签, 其中, 目标标签用于标识待生成的目标仿真视频流的视频属性; 利用数字挛生 系统对设置信息和画面信息进行渲染, 得到第一仿真视频流, 其中, 数字挛生系统用 于构建数字挛生世界; 采用目标标签对第一仿真视频流进行标记, 得到初始仿真视频 流。 可选地 ,该装置还包括:训练模块,被设置为获取第一图像样本和第二图像样本, 其中, 第一图像样本为真实世界中的真实图像样本, 第二图像样本为与第一图像样本 的画面内容对应的虚拟图像样本; 基于第一图像样本和第二图像样本对初始视频生成 模型进行训练, 得到目标视频生成模型。 可选地 , 上述训练模块还被设置为: 对第一图像样本进行图像检测, 得到第一检 测结果, 其中, 第一检测结果用于表示第一图像样本中的真实画面元素; 对第一检测 结果进行图像仿真处理, 生成第二图像样本, 其中, 第二图像样本中的仿真画面元素 与第一图像样本中的真实画面元素相对应。 可选地 , 上述训练模块还被设置为: 对第一图像样本进行图像检测, 得到第二检 测结果, 其中, 第二检测结果用于表示第一图像样本所描述的真实事件内容; 对第二 检测结果进行图像仿真处理, 生成第二图像样本, 其中, 第二图像样本所描述的仿真 事件内容与第一图像样本所描述的真实事件内容相对应。 可选地 ,该装置还包括:转换模块,被设置为对第一图像样本进行图像视角转换, 生成第三图像样本, 其中, 第三图像样本为第一图像样本在不同视角下的图像; 对第 二图像样本进行图像视角转换, 生成第四图像样本, 其中, 第四图像样本为第二图像 样本在不同视角下的图像; 基于第一图像样本、 第二图像样本、 第三图像样本和第四 图像样本对初始视频生成模型进行训练, 得到目标视频生成模型。 可选地 , 上述训练模块还被设置为: 基于第一图像样本、 第二图像样本、 第三图 像样本和第四图像样本对初始编码器进行训练, 得到目标编码器; 基于第一图像样本 和第三图像样本对初始解码器进行训练, 得到目标解码器; 基于目标编码器和目标解 码器确定目标视频生成模型。 可选地 , 上述训练模块还被设置为: 将第一图像样本和第三图像样本, 确定为第 一样本组合; 将第二图像样本和第四图像样本, 确定为第二样本组合; 将第一图像样 本和第二图像样本, 确定为第三样本组合; 基于对比损失函数、 第一样本组合、 第二 样本组合和第三样本组合对初始编码器进行对比学习训练, 得到目标编码器。 可选地 , 上述训练模块还被设置为: 基于第一图像样本和第三图像样本对初始解 码器进行自回归训练, 得到目标解码器。 可选地 ,上述第二生成模块 1004还被设置为: 采用目标编码器对目标风格图像进 行特征编码, 得到第一编码结果, 以及采用目标编码器对初始仿真视频流的视频帧图 像进行特征编码,得到第二编码结果;对第一编码结果和第二编码结果进行特征融合, 得到融合结果; 采用目标解码器对融合结果进行解码, 得到目标图像; 基于目标图像 生成目标仿真视频流。 可选地 , 上述第一获取模块 1001还被设置为: 确定虚拟相机的位置信息、姿态信 息和视场角信息; 基于位置信息、 姿态信息和视场角信息获取设置信息。 可选地 , 画面信息包括待生成的目标仿真视频流所描述的目标事件的目标事件类 型和目标事件的事件时长, 目标事件类型包括在真实世界中感知失败的事件类型, 事 件时长用于表示目标事件从发生至结束的时间长度, 上述第一生成模块 903还被设置 为: 基于事件时长确定第一仿真视频的视频时长, 其中, 视频时长用于表示第一仿真 视频从开始播放至结束播放的时间长度, 视频时长大于等于事件时长; 利用数字挛生 系统对视频时长、 设置信息和画面信息进行渲染, 得到初始仿真视频流。 采用本公 开实施例, 通过调整虚拟相机的设置信息, 从而调整虚拟相机在数字挛 生世界中录制虚拟视频流的拍摄角度, 以及确定用于记载待生成的目标仿真视频流中 需要生产的画面信息, 然后基于设置信息和画面信息, 生成初始仿真视频流, 在将真 实世界中的目标风格图像和初始仿真视频流输入至 目标视频生成模型, 基于目标视频 生成模型和目标风格图像对初始仿真视频流进行转换, 最终生成目标仿真视频流, 使 得目标仿真视频流的画面风格与目标风格图像的画面风格相对应, 由此达到了生成指 定画面内容与指定画面风格的目标仿真视频流的 目的, 从而实现了生成画面内容更加 真实可靠、 画面风格更加逼真且能够应用于任意场景的目标仿真视频流, 同时丰富了 数字挛生世界中的应用场景的技术效果, 进而解决了虚拟视频流的画面逼真程度低的 技术问题。 此处 需要说明的是,上述第一获取模块 1001、确定模块 1002、第一生成模块 1003 和第二生成模块 1004对应于实施例 1中的步骤 S21至步骤 S24,四个模块与对应的步 骤所实现的实例和应用场景相同, 但不限于上述实施例 1所公开的内容。 需要说明的 是, 上述模块可以是存储在存储器中并由一个或多个处理器处理的硬件组件或软件组 件, 上述模块也可以运行在实施例 1提供的服务器 10中。 根据本公开 实施例,还提供了另一种用于实施上述视频流生成方法的装置实施例。 图 11是根据本公开实施例 5的另一种视频流生成装置的结构示意图, 如图 11所示, 该视频流生成装置 1100包括: 第一响应模块 1101 , 被设置为响应作用于操作界面上的调整指令, 在操作界面上 显示虚拟相机的设置信息, 其中, 虚拟相机用于在数字挛生世界中录制虚拟视频流, 数字挛生世界为模拟真实世界的虚拟世界, 设置信息用于调整虚拟相机的拍摄角度; 第二响应模块 1102, 被设置为响应作用于操作界面上的输入指令, 在操作界面上 显示待生成的目标仿真视频流中的画面信息, 其中, 画面信息用于记载待生成的目标 仿真视频流中需要生产的仿真画面元素; 第三响应模块 1103 , 被设置为响应作用于操作界面上的仿真指令, 在操作界面上 显示目标仿真视频流, 其中, 目标仿真视频流基于目标视频生成模型和目标风格图像 对初始仿真视频流进行转换而生成, 目标风格图像为真实世界中的真实图像, 目标仿 真视频流的画面风格与目标风格图像的画面风格相对应, 初始仿真视频流基于设置信 息和画面信息生成而得到。 采用本公开 实施例, 通过在接收到作用于操作界面上的调整指令时, 可以在操作 界面上显示虚拟相机的设置信息, 从而对虚拟相机的设置参数进行调整, 其中, 虚拟 相机用于在数字挛生世界中录制虚拟视频流, 数字挛生世界为模拟真实世界的虚拟世 界, 设置信息用于调整虚拟相机的拍摄角度, 在接收到作用于操作界面上的输入指令 时, 可以在操作界面上显示待生成的目标仿真视频流中的画面信息, 其中, 画面信息 用于记载待生成的目标仿真视频流中需要生产的仿真画面元素, 在接收到作用于操作 界面上的仿真指令时, 可以在操作界面上显示目标仿真视频流, 其中, 目标仿真视频 流基于目标视频生成模型和目标风格图像对初始仿真视频流进行转换而生成, 目标风 格图像为真实世界中的真实图像, 目标仿真视频流的画面风格与目标风格图像的画面 风格相对应, 初始仿真视频流基于设置信息和画面信息生成而得到, 由此达到了生成 指定画面内容与指定画面风格的目标仿真视频流的目的, 从而实现了生成画面内容更 加真实可靠、 画面风格更加逼真且能够应用于任意场景的目标仿真视频流, 同时丰富 了数字挛生世界中的应用场景的技术效果, 进而解决了虚拟视频流的画面逼真程度低 的技术问题。 此处需要说 明的是, 上述第一响应模块 1101、 第二响应模块 1102和第三响应模 块 1103对应于实施例 2中的步骤 S71至步骤 S73 ,三个模块与对应的步骤所实现的实 例和应用场景相同, 但不限于上述实施例 1所公开的内容。 需要说明的是, 上述模块 可以是存储在存储器中并由一个或多个处理器处理的硬件组件或软件组件, 上述模块 也可以运行在实施例 1提供的服务器 10中。 根据本公开 实施例,还提供了再一种用于实施上述视频流生成方法的装置实施例。 图 12是根据本公开实施例 5的再一种视频流生成装置的结构示意图, 如图 12所示, 该视频流生成装置 1200包括: 第二获取模块 1201 , 被设置为通过第一应用程序编程接口获取仿真视频流生成请 求; 第一返 回模块 1202, 被设置为通过第二应用程序编程接口返回仿真视频流生成响 应; 其中, 仿真视频流生成请求中包括: 虚拟相机的设置信息和待生成的目标仿真视 频流中的画面信息, 仿真视频流生成响应中包括: 目标仿真视频流, 虚拟相机用于在 数字挛生世界中录制虚拟视频流, 数字挛生世界为模拟真实世界的虚拟世界, 设置信 息用于调整虚拟相机的拍摄角度, 画面信息用于记载待生成的目标仿真视频流中需要 生产的仿真画面元素, 目标仿真视频流基于目标视频生成模型和目标风格图像对初始 仿真视频流进行转换而生成, 目标风格图像为真实世界中的真实图像, 目标仿真视频 流的画面风格与目标风格图像的画面风格相对应, 初始仿真视频流基于设置信息和画 面信息生成而得到。 采用本公开 实施例,通过第一应用程序编程接口获取仿真视频流生成请求,其中, 仿真视频流生成请求中包括: 虚拟相机的设置信息和待生成的目标仿真视频流中的画 面信息, 虚拟相机用于在数字挛生世界中录制虚拟视频流, 数字挛生世界为模拟真实 世界的虚拟世界, 设置信息用于调整虚拟相机的拍摄角度, 画面信息用于记载待生成 的目标仿真视频流中需要生产的仿真画面元素, 然后可以通过第二应用程序编程接口 返回仿真视频流生成响应, 其中, 仿真视频流生成响应中包括: 目标仿真视频流, 目 标仿真视频流基于目标视频生成模型和目标风格图像对初始仿真视频流进行转换而生 成, 目标风格图像为真实世界中的真实图像, 目标仿真视频流的画面风格与目标风格 图像的画面风格相对应, 初始仿真视频流基于设置信息和画面信息生成而得到, 由此 达到了生成指定画面内容与指定画面风格的目标仿真视频流的 目的, 从而实现了生成 画面内容更加真实可靠、画面风格更加逼真且能够应用于任意场景的目标仿真视频流, 同时丰富了数字挛生世界中的应用场景的技术效果, 进而解决了虚拟视频流的画面逼 真程度低的技术问题。 此处需要说 明的是, 上述第二获取模块 1201和第一返回模块 1202对应于实施例 3 中的步骤 S81和步骤 S82, 两个模块与对应的步骤所实现的实例和应用场景相同, 但不限于上述实施例 1所公开的内容。 需要说明的是, 上述模块可以是存储在存储器 中并由一个或多个处理器处理的硬件组件或软件组件, 上述模块也可以运行在实施例 1提供的服务器 10中。 根据本公开 实施例,还提供了又一种用于实施上述视频流生成方法的装置实施例。 图 13是才艮据本公开实施例 5的又一种视频流生成装置的结构示意图, 如图 13所示, 该视频流生成装置 1300包括: 第三获取模块 1301 , 被设置为获取输入的仿真视频流生成对话请求; 第二返 回模块 1302, 被设置为响应于仿真视频流生成对话请求, 返回仿真视频流 生成对话回复; 其中, 仿真视频流生成对话请求中包括: 虚拟相机的设置信息和待生 成的目标仿真视频流中的画面信息, 仿真视频流生成对话回复中包括: 目标仿真视频 流, 虚拟相机用于在数字挛生世界中录制虚拟视频流, 数字挛生世界为模拟真实世界 的虚拟世界, 设置信息用于调整虚拟相机的拍摄角度; 画面信息用于记载待生成的目 标仿真视频流中需要生产的仿真画面元素; 目标仿真视频流基于目标视频生成模型和 目标风格图像对初始仿真视频流进行转换而生成, 目标风格图像为真实世界中的真实 图像, 目标仿真视频流的画面风格与目标风格图像的画面风格相对应, 初始仿真视频 流基于设置信息和画面信息生成而得到; 展示模块 1303 , 被设置为在图形用户界面内展示目标仿真视频流。 采用本公开 实施例, 通过获取输入的仿真视频流生成对话请求, 其中, 仿真视频 流生成对话请求中包括: 虚拟相机的设置信息和待生成的目标仿真视频流中的画面信 息, 然后响应于仿真视频流生成对话请求, 返回仿真视频流生成对话回复, 其中, 仿 真视频流生成对话回复中包括: 目标仿真视频流, 虚拟相机用于在数字挛生世界中录 制虚拟视频流, 数字挛生世界为模拟真实世界的虚拟世界, 设置信息用于调整虚拟相 机的拍摄角度; 画面信息用于记载待生成的目标仿真视频流中需要生产的仿真画面元 素; 目标仿真视频流基于目标视频生成模型和目标风格图像对初始仿真视频流进行转 换而生成, 目标风格图像为真实世界中的真实图像, 目标仿真视频流的画面风格与目 标风格图像的画面风格相对应,初始仿真视频流基于设置信息和画面信息生成而得到, 最后在图形用户界面内展示目标仿真视频流, 以向用户进行反馈, 由此达到了生成指 定画面内容与指定画面风格的目标仿真视频流的 目的, 从而实现了生成画面内容更加 真实可靠、 画面风格更加逼真且能够应用于任意场景的目标仿真视频流, 同时丰富了 数字挛生世界中的应用场景的技术效果, 进而解决了虚拟视频流的画面逼真程度低的 技术问题。 此处 需要说明的是,上述第三获取模块 1301、第二返回模块 1302和展示模块 1303 对应于实施例 4中的步骤 S91至步骤 S93 , 三个模块与对应的步骤所实现的实例和应 用场景相同, 但不限于上述实施例 1所公开的内容。 需要说明的是, 上述模块可以是 存储在存储器中并由一个或多个处理器处理的硬件组件或软件组件, 上述模块也可以 运行在实施例 1提供的服务器 10中。 需要说明的是, 本公开上述实施例中涉及到的优选实施方案与实施例 1提供的方 案以及应用场景、 实施过程相同, 但不仅限于实施例 1所提供的方案。 实施例 6 本公 开的实施例可以提供一种电子设备, 该电子设备可以是电子设备群中的任意 一个电子设备。 可选地, 在本实施例中, 上述电子设备也可以替换为移动终端等终端 设备。 可选地 , 在本实施例中, 上述电子设备可以位于计算机网络的多个网络设备中的 至少一个网络设备。 在本 实施例中, 上述电子设备可以执行实施例 1中提供的视频流生成方法中所保 护的程序代码的执行步骤, 但不仅限于此。 可选地 , 图 14是根据本公开实施例的一种电子设备的结构框图。 如图 14所示, 该电子设备 A可以包括: 一个或多个(图中仅示出一个)处理器 1402、存储器 1404、 存储控制器、 以及外设接口, 其中, 外设接口与射频模块、 音频模块和显示器连接。 其 中, 存储器可用于存储软件程序以及模块, 如本公开实施例中的视频流生成方 法和装置对应的程序指令 /模块, 处理器通过运行存储在内的软件程序以及模块, 从而 执行各种功能应用以及数据处理, 即实现上述的视频流生成方法。 存储器可包括高速 随机存储器, 还可以包括非易失性存储器, 如一个或者多个磁性存储装置、 闪存、 或 者其他非易失性固态存储器。 在一些实例中, 存储器可进一步包括相对于处理器远程 设置的存储器, 这些远程存储器可以通过网络连接至电子设备 A。 上述网络的实例包 括但不限于互联网、 企业内部网、 局域网、 移动通信网及其组合。 处理 器可以通过传输装置调用存储器存储的信息及应用程序, 以执行下述步骤: 调整虚拟相机的设置信息, 其中, 虚拟相机用于在数字挛生世界中录制虚拟视频流, 数字挛生世界为模拟真实世界的虚拟世界, 设置信息用于调整虚拟相机的拍摄角度; 确定待生成的目标仿真视频流中的画面信息, 其中, 画面信息用于记载待生成的目标 仿真视频流中需要生产的仿真画面元素; 基于设置信息和画面信息, 生成初始仿真视 频流; 基于目标视频生成模型和目标风格图像对初始仿真视频流进行转换, 生成目标 仿真视频流, 其中, 目标风格图像为真实世界中的真实图像, 目标仿真视频流的画面 风格与目标风格图像的画面风格相对应。 可选地 , 上述处理器还可以执行实施例 1中各个可选实施例中执行每个程序代码 所运行的步骤, 但不仅限于此。 由此可知, 采用本公开实施例, 通过调整虚拟相机的设置信息, 从而调整虚拟相 机在数字挛生世界中录制虚拟视频流的拍摄角度, 以及确定用于记载待生成的目标仿 真视频流中需要生产的画面信息, 然后基于设置信息和画面信息, 生成初始仿真视频 流, 在将真实世界中的目标风格图像和初始仿真视频流输入至目标视频生成模型, 基 于目标视频生成模型和目标风格图像对初始仿真视频流进行转换, 最终生成目标仿真 视频流, 使得目标仿真视频流的画面风格与目标风格图像的画面风格相对应, 由此达 到了生成指定画面内容与指定画面风格的 目标仿真视频流的目的, 从而实现了生成画 面内容更加真实可靠、 画面风格更加逼真且能够应用于任意场景的目标仿真视频流, 同时丰富了数字挛生世界中的应用场景的技术效果, 进而解决了虚拟视频流的画面逼 真程度低的技术问题。 本领域普通技术人 员可以理解, 图 14所示的结构仅为示意, 电子设备 A也可以 是智能手机 (如 Android手机、 iOS手机等)、 平板电脑、 掌上电脑以及移动互联网设 备 ( MobilelntemetDevices, MID )、 PAD等终端设备。 图 14其并不对上述电子装置的 结构造成限定。 例如, 电子设备 A还可包括比图 14中所示更多或者更少的组件 (如 网络接口、 显示装置等), 或者具有与图 14所示不同的配置。 本领域普通技 术人员可以理解上述实施例的各种方法中的全部或部分步骤是可以 通过程序来指令终端设备相关的硬件来完成, 该程序可以存储于一计算机可读存储介 质中, 存储介质可以包括: 闪存盘、 只读存储器 ( Read-Only Memory , ROM )、 随机 存取器 ( Random Access Memory, RAM )、 磁盘或光盘等。 实施例 7 本公 开的实施例还提供了一种计算机可读存储介质。 可选地, 在本实施例中, 上 述计算机可读存储介质可以用于保存上述实施例一所提供的视频流生成方法所执行的 程序代码。 可选地 , 在本实施例中, 上述计算机可读存储介质可以位于计算机网络中电子设 备群中的任意一个电子设备中, 或者位于移动终端群中的任意一个移动终端中。 可选地 , 在本实施例中, 计算机可读存储介质被设置为存储用于执行实施例 1中 包含的实施步骤的程序代码, 但不限于此。 本公 开的实施例还提供了一种计算机程序产品, 该计算机程序产品包括计算机程 序, 计算机程序在被处理器执行时实现任意一项上述的视频流生成方法。 上述本公开 实施例序号仅仅为了描述, 不代表实施例的优劣。 在本公 开的上述实施例中, 对各个实施例的描述都各有例重, 某个实施例中没有 详述的部分, 可以参见其他实施例的相关描述。 在本公 开所提供的几个实施例中, 应该理解到, 所揭露的技术内容, 可通过其它 的方式实现。其中,以上所描述的装置实施例仅仅是示意性的,例如所述单元的划分, 仅仅为一种逻辑功能划分, 实际实现时可以有另外的划分方式, 例如多个单元或组件 可以结合或者可以集成到另一个系统, 或一些特征可以忽略, 或不执行。 另一点, 所 显示或讨论的相互之间的耦合或直接耦合或通信连接可以是通过一些接口, 单元或模 块的间接耦合或通信连接, 可以是电性或其它的形式。 所述作 为分离部件说明的单元可以是或者也可以不是物理上分开的, 作为单元显 示的部件可以是或者也可以不是物理单元, 即可以位于一个地方, 或者也可以分布到 多个网络单元上。 可以根据实际的需要选择其中的部分或者全部单元来实现本实施例 方案的目的。 另外, 在本公开各个实施例中的各功能单元可以集成在一个处理单元中, 也可以 是各个单元单独物理存在, 也可以两个或两个以上单元集成在一个单元中。 上述集成 的单元既可以采用硬件的形式实现, 也可以采用软件功能单元的形式实现。 所述 集成的单元如果以软件功能单元的形式实现并作为独立的产品销售或使用时 , 可以存储在一个计算机可读取存储介质中。 基于这样的理解, 本公开的技术方案本质 上或者说对现有技术做出贡献的部分或者该技术方案的全部或部分可以以软件产品的 形式体现出来, 该计算机软件产品存储在一个存储介质中, 包括若干指令用以使得一 台计算机设备 (可为个人计算机、 服务器或者网络设备等)执行本公开各个实施例所 述方法的全部或部分步骤。而前述的存储介质包括: U盘、只读存储器 ( ROM, Read-Only Memory )> 随机存取存储器 ( RAM, Random Access Memory )> 移动硬盘、 磁碟或者 光盘等各种可以存储程序代码的介质。 以上所述仅是本公开的优选实施方式, 应当指出, 对于本技术领域的普通技术人 员来说, 在不脱离本公开原理的前提下, 还可以做出若干改进和润饰, 这些改进和润 饰也应视为本公开的保护范围。

Claims

权 利 要 求 书
1. 一种视频流生成方法, 包括: 获取虚拟相机 的设置信息, 其中, 所述虚拟相机用于在数字挛生世界中录制虚拟 视频流, 所述数字挛生世界为模拟真实世界的虚拟世界, 所述设置信息用于调整所述 虚拟相机的拍摄角度; 确定待生成 的目标仿真视频流中的画面信息, 其中, 所述画面信息用于记载所述 待生成的目标仿真视频流中需要生产的仿真画面元素; 基 于所述设置信息和所述画面信息, 生成初始仿真视频流; 基 于目标视频生成模型和目标风格图像对所述初始仿真视频流进行转换, 生成所 述目标仿真视频流, 其中, 所述目标风格图像为所述真实世界中的真实图像, 所述目 标仿真视频流的画面风格与所述目标风格图像的画面风格相对应。
2. 根据权利要求 1所述的视频流生成方法,其中,所述基于所述设置信息和所述 画面信息, 生成初始仿真视频流包括: 基 于所述设置信息和所述画面信息生成目标标签, 其中, 所述目标标签用于标识 所述待生成的目标仿真视频流的视频属性; 利用数 字挛生系统对所述设置信息和所述画面信息进行渲染, 得到第一仿真视频 流, 其中, 所述数字挛生系统用于构建所述数字挛生世界; 采用所述 目标标签对所述第一仿真视频流进行标记, 得到所述初始仿真视频流。
3. 根据权利要求 1所述的视频流生成方法, 其中, 所述方法还包括: 获取 第一图像样本和第二图像样本, 其中, 所述第一图像样本为所述真实世界中 的真实图像样本, 所述第二图像样本为与所述第一图像样本的画面内容对应的虚拟图 像样本; 基 于所述第一图像样本和所述第二图像样本对初始视频生成模型进行训练, 得到 所述目标视频生成模型。
4. 根据权利要求 3所述的视频流生成方法, 其中, 获取所述第二图像样本包括: 对所 述第一图像样本进行图像检测, 得到第一检测结果, 其中, 所述第一检测结 果用于表示所述第一图像样本中的真实画面元素; 对所 述第一检测结果进行图像仿真处理, 生成所述第二图像样本, 其中, 所述第 二图像样本中的仿真画面元素与所述第一图像样本中的真实画面元素相对应。
5. 根据权利要求 3所述的视频流生成方法, 其中, 获取所述第二图像样本包括: 对所 述第一图像样本进行图像检测, 得到第二检测结果, 其中, 所述第二检测结 果用于表示所述第一图像样本所描述的真实事件内容; 对所 述第二检测结果进行图像仿真处理, 生成所述第二图像样本, 其中, 所述第 二图像样本所描述的仿真事件内容与所述第一图像样本所描述的真实事件内容相对应。
6. 根据权利要求 3所述的视频流生成方法,其中,所述基于所述第一图像样本和 所述第二图像样本对初始视频生成模型进行训练, 得到所述目标视频生成模型包括: 对所 述第一图像样本进行图像视角转换, 生成第三图像样本, 其中, 所述第三图 像样本为所述第 —图像样本在不同视角下的图像; 对所 述第二图像样本进行图像视角转换, 生成第四图像样本, 其中, 所述第四图 像样本为所述第二图像样本在不同视角下的图像; 基 于所述第一图像样本、 所述第二图像样本、 所述第三图像样本和所述第四图像 样本对所述初始视频生成模型进行训练, 得到所述目标视频生成模型。
7. 根据权利要求 6所述的视频流生成方法, 其中, 所述基于所述第一图像样本、 所述第二图像样本、 所述第三图像样本和所述第四图像样本对所述初始视频生成模型 进行训练, 得到所述目标视频生成模型包括: 基 于所述第一图像样本、 所述第二图像样本、 所述第三图像样本和所述第四图像 样本对初始编码器进行训练, 得到目标编码器; 基 于所述第一图像样本和所述第三图像样本对初始解码器进行训练, 得到目标解 码器; 基 于所述目标编码器和所述目标解码器确定所述目标视频生成模型。
8. 根据权利要求 7所述的视频流生成方法, 其中, 所述基于所述第一图像样本、 所述第二图像样本、 所述第三图像样本和所述第四图像样本对初始编码器进行训练, 得到目标编码器包括: 将所述 第一图像样本和所述第三图像样本, 确定为第一样本组合; 将所述 第二图像样本和所述第四图像样本, 确定为第二样本组合; 将所述第一 图像样本和所述第二图像样本, 确定为第三样本组合; 基于对 比损失函数、 所述第一样本组合、 所述第二样本组合和所述第三样本组合 对所述初始编码器进行对比学习训练, 得到所述目标编码器。
9. 根据权利要求 7所述的视频流生成方法,其中,所述基于所述第一图像样本和 所述第三图像样本对初始解码器进行训练, 得到目标解码器包括: 基于所述 第一图像样本和所述第三图像样本对所述初始解码器进行自回归训练, 得到所述目标解码器。
10.根据权利要求 7所述的视频流生成方法,其中,所述基于目标视频生成模型和 目标风格图像对所述初始仿真视频流进行转换, 生成所述目标仿真视频流包括: 采用所述 目标编码器对所述目标风格图像进行特征编码, 得到第 ~ ■编码结果, 以 及采用所述目标编码器对所述初始仿真视频流的视频帧图像进行特征编码, 得到第二 编码结果; 对所述第一编码结果和所述第二编码结果进行特征融合 , 得到融合结果; 采用所述 目标解码器对所述融合结果进行解码, 得到目标图像; 基于所述 目标图像生成所述目标仿真视频流。
11.根据权利要求 1所述的视频流生成方法,其中,所述虚拟相机的设置信息包括: 确定所述虚拟相机的位置信息 、 姿态信息和视场角信息; 基于所述位置信 息、 所述姿态信息和所述视场角信息获取所述设置信息。
12.根据权利要求 2所述的视频流生成方法,其中,所述画面信息包括所述待生成 的目标仿真视频流所描述的目标事件的目标事件类型和所述 目标事件的事件时长, 所 述目标事件类型包括在所述真实世界中感知失败的事件类型, 所述事件时长用于表示 所述目标事件从发生至结束的时间长度, 所述利用数字挛生系统对所述设置信息和所 述画面信息进行渲染, 得到第一仿真视频流包括: 基于所述 事件时长确定所述第一仿真视频的视频时长, 其中, 所述视频时长用于 表示所述第一仿真视频从开始播放至结束播放的时间长度, 所述视频时长大于等于所 述事件时长; 利用所述数字 挛生系统对所述视频时长、所述设置信息和所述画面信息进行渲染, 得到所述初始仿真视频流。
13. —种视频流生成方法, 包括: 通过第一应用程序编程接 口获取仿真视频流生成请求; 通过第二应用程序编程接 口返回仿真视频流生成响应; 其 中, 所述仿真视频流生成请求中包括: 虚拟相机的设置信息和待生成的目标仿 真视频流中的画面信息, 所述仿真视频流生成响应中包括: 目标仿真视频流, 所述虚 拟相机用于在数字挛生世界中录制虚拟视频流, 所述数字挛生世界为模拟真实世界的 虚拟世界, 所述设置信息用于调整所述虚拟相机的拍摄角度, 所述画面信息用于记载 所述待生成的目标仿真视频流中需要生产的仿真画面元素, 所述目标仿真视频流基于 目标视频生成模型和目标风格图像对初始仿真视频流进行转换而生成, 所述目标风格 图像为所述真实世界中的真实图像, 所述目标仿真视频流的画面风格与所述目标风格 图像的画面风格相对应, 所述初始仿真视频流基于所述设置信息和所述画面信息生成 而得到。
14.一种电子设备, 包括: 存储 器, 存储有可执行程序; 处理 器, 用于运行所述程序, 其中, 所述程序运行时执行权利要求 1至 13中任意 一项所述的视频流生成方法。
15.一种计算机可读存储介质, 所述计算机可读存储介质包括存储的可执行程序 , 其中, 在所述可执行程序运行时控制所述计算机可读存储介质所在设备执行权利要求 1至 13中任意一项所述的视频流生成方法。
16. —种计算机程序产品, 包括计算机程序,所述计算机程序在被处理器执行时实 现权利要求 1至 13中任意一项所述的视频流生成方法。
PCT/IB2024/062687 2024-03-30 2024-12-16 视频流生成方法、电子设备及计算机可读存储介质 Pending WO2025210401A1 (zh)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
CN202410384231.0A CN120730122A (zh) 2024-03-30 2024-03-30 视频流生成方法、电子设备及计算机可读存储介质
CN202410384231.0 2024-03-30

Publications (1)

Publication Number Publication Date
WO2025210401A1 true WO2025210401A1 (zh) 2025-10-09

Family

ID=97165923

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/IB2024/062687 Pending WO2025210401A1 (zh) 2024-03-30 2024-12-16 视频流生成方法、电子设备及计算机可读存储介质

Country Status (2)

Country Link
CN (1) CN120730122A (zh)
WO (1) WO2025210401A1 (zh)

Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20170243083A1 (en) * 2016-02-23 2017-08-24 Xerox Corporation Generating a virtual world to assess real-world video analysis performance
CN113177429A (zh) * 2020-01-24 2021-07-27 福特全球技术公司 车辆神经网络训练
CN115761064A (zh) * 2022-11-10 2023-03-07 抖音视界有限公司 一种视频生成方法、装置、计算机设备及存储介质

Patent Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20170243083A1 (en) * 2016-02-23 2017-08-24 Xerox Corporation Generating a virtual world to assess real-world video analysis performance
CN113177429A (zh) * 2020-01-24 2021-07-27 福特全球技术公司 车辆神经网络训练
CN115761064A (zh) * 2022-11-10 2023-03-07 抖音视界有限公司 一种视频生成方法、装置、计算机设备及存储介质

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
JIANG HONGDA JIANGHD@PKU.EDU.CN; WANG BIN BINWANGBUAA@GMAIL.COM; WANG XI XI.WANG@INRIA.FR; CHRISTIE MARC MARC.CHRISTIE@IRISA.FR; C: "Example-driven virtual cinematography by learning camera behaviors", ACM TRANSACTIONS ON GRAPHICS, ACM, NY, US, vol. 39, no. 4, 8 July 2020 (2020-07-08), US , pages 45:1 - 45:14, XP058458622, ISSN: 0730-0301, DOI: 10.1145/3386569.3392427 *

Also Published As

Publication number Publication date
CN120730122A (zh) 2025-09-30

Similar Documents

Publication Publication Date Title
EP3889912B1 (en) Method and apparatus for generating video
CN113870395B (zh) 动画视频生成方法、装置、设备及存储介质
US12231868B2 (en) Sound effect adjustment
EP4722982A1 (en) Video generation method and apparatus, and method and apparatus for training video generation model
US20230215068A1 (en) Method for outputting blend shape value, storage medium, and electronic device
CN111523413B (zh) 生成人脸图像的方法和装置
CN118737121B (zh) 伴随音频生成方法、相关装置和介质
JP2020149680A (ja) 非テキスト入力による感覚媒体間の関連付けを学習するためのシステム、プログラム及び方法
CN116310975B (zh) 一种基于一致片段选择的视听事件定位方法
CN111629222B (zh) 一种视频处理方法、设备及存储介质
CN114339197A (zh) 视频播放的测试方法、装置及设备
CN120017929A (zh) 视频生成方法及装置、计算机程序产品和电子设备
CN120568108A (zh) 处理音频数据的方法和装置
CN113762056A (zh) 演唱视频识别方法、装置、设备及存储介质
CN113766295A (zh) 一种播放处理方法、装置、设备及存储介质
KR102575820B1 (ko) 운동트레이너 디지털액터 운용시스템
CN117579889A (zh) 图像生成方法、装置、电子设备以及存储介质
CN118865990A (zh) 音频处理方法、装置、设备、存储介质及程序产品
CN116962600A (zh) 字幕内容的显示方法、装置、设备、介质及程序产品
CN120730122A (zh) 视频流生成方法、电子设备及计算机可读存储介质
CN113537162B (zh) 一种视频处理方法、装置及电子设备
CN119814951B (zh) 监控平台视频异常存储的补充存储方法及装置
CN116263788B (zh) 文本内容的识别方法、装置、设备、存储介质及程序产品
CN116994185A (zh) 一种屏摄图像识别方法和相关装置
CN121788676A (zh) 模型训练方法、视频生成方法、电子设备及存储介质

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 24933917

Country of ref document: EP

Kind code of ref document: A1