WO2025199759A1 - 一种音频信号处理方法、装置及存储介质 - Google Patents
一种音频信号处理方法、装置及存储介质Info
- Publication number
- WO2025199759A1 WO2025199759A1 PCT/CN2024/083889 CN2024083889W WO2025199759A1 WO 2025199759 A1 WO2025199759 A1 WO 2025199759A1 CN 2024083889 W CN2024083889 W CN 2024083889W WO 2025199759 A1 WO2025199759 A1 WO 2025199759A1
- Authority
- WO
- WIPO (PCT)
- Prior art keywords
- parameter
- audio signal
- processing mode
- target
- processing
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04R—LOUDSPEAKERS, MICROPHONES, GRAMOPHONE PICK-UPS OR LIKE ACOUSTIC ELECTROMECHANICAL TRANSDUCERS; ELECTRIC HEARING AIDS; PUBLIC ADDRESS SYSTEMS
- H04R3/00—Circuits for transducers
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S7/00—Indicating arrangements; Control arrangements, e.g. balance control
Definitions
- a second device including a transceiver module for receiving a target audio signal sent by a first device, where the target audio signal is obtained by the first device processing the audio signal in a target processing mode, where the target processing mode is determined from multiple processing modes based on decision indication information; a processing module for processing the target audio signal in the target processing mode; the multiple processing modes are different processing functions performed based on the first device as a carrier.
- a communication device which includes: a transceiver; a memory; and a processor, which is connected to the transceiver and the memory respectively, and is configured to control the wireless signal reception and transmission of the transceiver by executing computer-executable instructions on the memory, and is capable of executing the method of any embodiment of the first aspect or the second aspect.
- a storage medium which stores instructions.
- the instructions When the instructions are executed on a communication device, the communication device executes a method as in any one of the first and second aspects.
- a communication system including a first device and a second device, wherein the first device is configured to implement the method of the embodiment of the first aspect, and the second device is configured to implement the method of the embodiment of the second aspect.
- FIG1 is a schematic diagram of the architecture of a communication system provided by an embodiment of the present disclosure.
- the embodiments of the present disclosure provide an audio signal processing method and apparatus, a communication device, a communication system, and a storage medium.
- an embodiment of the present disclosure proposes an audio signal processing method, which is executed by a first device, and the method includes: determining a target processing mode from multiple processing modes based on decision indication information; processing the audio signal in the target processing mode to obtain a target audio signal; and sending the target audio signal to a second device; the multiple processing modes are different processing functions performed based on the first device as a carrier.
- the method further includes: determining decision indication information based on first information, where the first information is used to represent at least one of the delay requirements, accuracy characteristics, and listener freedom characteristics of the audio signal.
- the current application scenario can be determined by determining the first information, so as to facilitate determining a processing mode suitable for the current scenario based on the first information.
- the target processing mode includes at least one of the following: a first processing mode, in which the first device performs bitstream decoding, rendering processing, and stereo encoding on the audio signal, and after the first device sends the target audio signal to the second device, the second device performs stereo decoding and playback on the target audio signal; a second processing mode, in which the first device performs bitstream decoding, downmixing and/or format conversion, and bitstream encoding on the audio signal, and after the first device sends the target audio signal to the second device, the second device performs bitstream decoding, rendering, and playback on the target audio signal; a third processing mode, in which the first device performs bitstream decoding, first rendering processing, and intermediate variable encoding on the audio signal, and after the first device sends the target audio signal to the second device, the second device performs intermediate variable decoding, second rendering processing, and playback on the target audio signal.
- a first processing mode in which the first device performs bitstream decoding, rendering processing, and stereo encoding on the audio signal
- determining the target processing mode based on the decision indication information includes: determining the processing mode in which the decision indication information satisfies preset conditions as the target processing mode; or, receiving indication information, and determining the target processing mode based on the indication information, the indication information including the target processing mode determined by the user of the first device based on the decision indication information.
- the decision instruction information can be determined by the first information, and the target processing mode can be determined according to the decision instruction information. In order to select the appropriate working mode according to the effective instruction information.
- prefixes such as “first” and “second” in the embodiments of the present disclosure are only used to distinguish different description objects and do not constitute any restriction on the position, order, priority, quantity or content of the description objects.
- the description object please refer to the description in the context of the claims or embodiments, and no unnecessary restriction should be constituted due to the use of prefixes.
- the description object is a "field”
- the ordinal number before the "field” in the "first field” and the "second field” does not limit the position or order between the "fields”.
- “First” and “second” do not limit whether the "fields” they modify are in the same message, nor do they limit the order of the "first field” and the "second field”.
- a "synchronization signal (SS)”, a “synchronization signal block (SS)” or a “synchronization signal block (SS)” may be used to generate a synchronization signal.
- the terms “SSB),””reference signal (RS)”, “pilot”, and “pilot signal” are interchangeable.
- obtain can be interchangeable, and can be interpreted as receiving from other entities, obtaining from a protocol, obtaining by self-processing, autonomous implementation, etc.
- predetermined and preset can be interpreted as pre-specified in a protocol, etc., or can be interpreted as a pre-set action performed by a device, etc.
- determining may be interpreted as judging, calculating, computing, processing, deriving, investigating, searching, looking up, searching, inquiry, ascertaining, receiving, transmitting, inputting, outputting, accessing, resolving, selecting, choosing, establishing, comparing, “assuming,” “expecting,” “considering,” broadcasting, notifying, communicating, forwarding, configuring, reconfiguring, allocating, mapping, assigning, and the like, but is not limited thereto.
- obtaining data, information, etc. may comply with the laws and regulations of the country where the data is obtained.
- the immersive audio service provided by XR devices is a new audio experience.
- typical XR devices such as AR glasses are strictly restricted in appearance, structure, and weight. Therefore, in order to complete the rendering and playback of audio on the XR device side, it is necessary to reasonably distribute the received audio code stream signal from decoding to binaural rendering to each processing unit.
- AR glasses can be divided into the following types according to the functional allocation structure: 5G independent networking AR user equipment (5G Standalone AR UE), 5G edge-dependent AR user equipment (5G EDGe-Dependent AR UE), 5G wireless tethered AR user equipment (5G WireLess Tethered AR UE), and 5G wired tethered AR user equipment (5G Wired Tethered AR UE).
- 5G independent networking AR user equipment (5G Standalone AR UE
- 5G EDGe-Dependent AR UE 5G edge-dependent AR user equipment
- 5G wireless tethered AR user equipment 5G WireLess Tethered AR UE
- 5G Wired Tethered AR UE 5G Wired Tethered AR UE
- 5G edge-dependent AR user equipment and 5G wireless-constrained AR user equipment are the two target devices to be studied in the technology of this invention.
- audio processing is appropriately distributed between the Cloud/Edge Device and the XR device, ultimately outputting rendered binaural signals to the user on the XR device.
- Related technologies include the following audio processing distribution methods.
- Solution 1 Existing technology Solution 1 uses a terminal device (such as a smartphone) to perform decoding and rendering processing.
- the rendering processing is to render the decoded output signal based on the head rotation information (3 degrees of freedom) output by the head tracking device or the head rotation information and the user's latest position information (6 degrees of freedom).
- the rendered binaural signal is encoded and sent to the playback device (such as headphones).
- the playback device After receiving the code stream signal, the playback device decodes and outputs the binaural signal. The user obtains an immersive audio experience service through the played binaural signal.
- the problem with the method proposed in the above-mentioned solution 1 is that it takes a certain delay for the information output by the head tracking device to be transmitted to the terminal device.
- the delay exceeding the threshold makes it impossible for the binaural rendering signal to track the user's head rotation and/or position information in real time, resulting in the binaural rendering signal received by the user not being completely consistent with the signal that the user should hear at the current moment.
- Solution 2 Existing technology Solution 2 directly transmits the code stream signal to the playback device (such as headphones) after the cloud terminal device (such as a smartphone) receives it.
- the playback device renders the decoded output signal based on the head rotation information (3 degrees of freedom) or the head rotation information and the user's latest position information (6 degrees of freedom) output by the head tracking device.
- the rendered binaural signal is played through a speaker to obtain an immersive audio experience service.
- the problem with the method proposed in the above-mentioned solution 2 is that the playback device (such as headphones) is responsible for decoding and rendering processing, which requires the playback device to have powerful computing power and storage resources, that is, it has high requirements on the battery capacity of the playback device.
- Solution 3 Existing technology Solution 3 uses a terminal device (such as a smart phone) to first decode the received bit stream signal and then perform a first-level rendering process (such as rendering process 1 in the figure).
- the first-level rendering process is based on the information output by the head tracking device that changes slowly over time to render the decoded signal.
- the signal after the first-level rendering process is encoded to obtain a bit stream signal and sent to the playback device (such as headphones).
- the playback device receives the bit stream signal and first decodes it and then performs a second-level rendering process on the output signal based on the real-time information output by the head tracking device.
- the rendered binaural signal is played back through the speaker to obtain an immersive audio service experience.
- the problem with the method proposed in Solution 3 above is that the two-stage rendering processing method increases the overall complexity of the system solution from the received bitstream signal to the binaural signal. How to balance the computing power sharing ratio of the two-stage rendering also has a significant impact on the performance of the end-to-end solution.
- this solution proposes an audio signal processing method, which can select a suitable working mode according to the indication information.
- the specific content of the method is as follows.
- FIG1 is a schematic diagram illustrating an architecture of a communication system according to an embodiment of the present disclosure.
- a communication system 100 may include a first device 101 and a second device 102 .
- the first device may be a device that receives an audio signal.
- the first device may be a terminal, including but not limited to a mobile phone, a computer, a tablet, a conference system device, an AR/VR device, an automobile, etc.
- the first device may receive an audio signal from a network device.
- the audio signal from an incoming call on a mobile phone may be received from a network device.
- the first device may process the received audio signal.
- the first device may provide the processed audio signal or the unprocessed audio signal to the second device.
- the second device may be a device that outputs a target audio signal.
- the second device may be a terminal, such as an XR device, specifically, augmented reality (AR) glasses.
- the second device may receive an audio signal from the first device.
- the audio signal may be an audio signal processed by the first device, or may be an unprocessed audio signal from the first device.
- the second device may process the audio signal received from the first device.
- the terminal includes, for example, a mobile phone, a wearable device, an Internet of Things device, a car with communication function, a smart car, a tablet computer, a computer with wireless transceiver function, a virtual reality (VR) terminal device, an augmented reality (AR) terminal device, a wireless terminal device in industrial control, a wireless terminal device in self-driving, a wireless terminal device in remote medical surgery, a wireless terminal device in a smart grid, a wireless terminal device in transportation safety, a wireless terminal device in a smart city, and at least one of a wireless terminal device in a smart home, but is not limited thereto.
- a mobile phone a wearable device, an Internet of Things device, a car with communication function, a smart car, a tablet computer, a computer with wireless transceiver function, a virtual reality (VR) terminal device, an augmented reality (AR) terminal device, a wireless terminal device in industrial control, a wireless terminal device in self-driving, a wireless terminal device in remote medical surgery,
- the "network device” may be an access network device, such as a base station.
- the network device may also be a broad network device including a core network device.
- the access network device is, for example, a node or device that connects a terminal to a wireless network.
- the access network device may include an evolved NodeB (eNB), a next generation eNB (ng-eNB), a next generation NodeB (gNB), a node B (NB), a home node B (HNB), a home evolved node B (HeNB), a wireless backhaul device, a radio network controller (radio) in a 5G communication system.
- eNB evolved NodeB
- ng-eNB next generation NodeB
- gNB next generation NodeB
- NB node B
- HNB home node B
- HeNB home evolved node B
- wireless backhaul device a radio network controller (radio) in a 5G communication system.
- the target processing mode is the first processing mode, performing code stream decoding, rendering processing, and stereo encoding on the audio signal to obtain a binaural audio signal as the target audio signal;
- the second device processing the target audio signal in the target processing mode includes:
- the target processing mode is the first processing mode, stereo decoding and playing the target audio signal
- step 3102 For optional implementations of step 3102, reference may be made to the optional implementations of step 2103 in FIG. 2 and other related parts of the embodiments involved in the steps of FIG. 2 .
- Step 3103 Send the target audio signal to the second device.
- step 3103 For optional implementations of step 3103 , reference may be made to the optional implementations of step 2104 in FIG. 2 and other related parts of the embodiments involved in the steps of FIG. 2 .
- the first device may send the target audio signal to the second device, but is not limited thereto.
- the first device may also send the target audio signal to the second device.
- the other subject sends a target audio signal.
- the communication method involved in the embodiment of the present disclosure may include at least one of steps 3101 to 3103.
- step 3101 may be implemented as an independent embodiment
- steps 3101+3102+3103 may be implemented as independent embodiments, but are not limited thereto.
- each step can be independent, arbitrarily combined or exchanged in order, the optional methods or optional examples can be arbitrarily combined, and can be arbitrarily combined with any steps of other embodiments or other examples.
- FIG4 is a flow chart of an audio signal processing method according to an embodiment of the present disclosure. As shown in FIG4 , the embodiment of the present disclosure relates to an audio signal processing method for a second device 102, the method comprising:
- Step 4101 Receive a target audio signal.
- step 4101 For optional implementations of step 4101 , reference may be made to the optional implementations of step 2104 in FIG. 2 , step 3103 in FIG. 3 , and other related parts in the embodiments involved in the steps of FIG. 2 and FIG. 3 .
- the first device receives the target audio signal sent by the second device, but is not limited thereto and may also receive the target audio signal sent by other entities.
- the first device obtains a target audio signal specified by a protocol.
- the first device obtains the target audio signal from an upper layer(s).
- the first device performs processing to obtain the target audio signal.
- Step 4102 Process the target audio signal in a target processing mode.
- the communication method involved in the embodiment of the present disclosure may include at least one of steps 4101 to 4102.
- step 4102 may be implemented as an independent embodiment
- steps 4101+4102 may be implemented as independent embodiments, but are not limited thereto.
- each step can be independent, arbitrarily combined or exchanged in order, and the optional methods or optional examples can be arbitrarily combined and can be arbitrarily combined with other embodiments or examples.
- FIG5 is a flow chart of an audio signal processing method according to an embodiment of the present disclosure. As shown in FIG5 , the embodiment of the present disclosure relates to an audio signal processing method for a communication system including a first device and a second device. The method includes:
- Step 5101 The first device determines a target processing mode for processing an audio signal based on decision indication information.
- step 5102 For optional implementations of step 5102, reference may be made to the optional implementations of step 2103 in FIG. 2 , step 3102 in FIG. 3 , and other related parts in the embodiments involved in the steps of FIG. 2 and FIG. 3 .
- Step 5104 The second device processes the target audio signal in the target processing mode.
- step 5104 For optional implementations of step 5104, reference may be made to the optional implementations of step 2105 in FIG. 2 , step 4102 in FIG. 4 , and other related parts in the embodiments involved in the steps of FIG. 2 and FIG. 4 .
- the method shown in the embodiment of the present disclosure relates to a method for processing audio signals of a terminal device.
- This example provides three audio processing modes to choose from on the receiving end:
- Mode 1 The terminal device completes decoding, rendering, and stereo encoding, and the playback device completes stereo decoding and playback.
- Mode 2 The terminal device completes decoding, (downmixing) and encoding, and the playback device completes decoding, rendering and playback.
- Decision indication information is output based on the degree of freedom (DOF), image precision, ambience fidelity and other information selected by the terminal device user.
- the terminal device (automatic selection mode) or the user (manual selection mode) selects one of the three modes as a solution based on the "decision indication information”.
- the number of degrees of freedom determines the latency requirement for the solution. Latency here refers to the time between the end device and playback device receiving sensor-generated user posture, rotation, and other information and outputting rendered binaural signals. Generally, the greater the degree of freedom, the lower the latency requirement. For example, in a 6-DOF scenario, the lowest possible latency is required to ensure that users receive an audio experience that matches their posture and rotation information.
- the decision input information also includes audio and video accuracy.
- the audio and video accuracy can be divided into: the first dimension is: single audio and video scene and multiple audio and video scenes; the second dimension is: high accuracy, medium accuracy, and low accuracy.
- the decoding and rendering solutions are relatively simple, so the second mode solution can be preferred.
- Mode 3 solution For multi-sound image scenes with fewer (such as 2 or 3) sound images (such as using MASA format to collect sound), the decoding and rendering complexity is moderate, so Mode 3 solution can be selected.
- the mode 2 solution when the required accuracy is low, the mode 2 solution can be selected, when the accuracy is high, the mode 1 solution can be selected, and when the accuracy is medium, the mode 3 solution can be selected.
- the judgment input information also includes background clarity, which can be divided into: clean background, noisy background, and medium background.
- the mode 2 solution can be selected.
- the mode 1 solution can be selected.
- the mode 3 solution can be selected.
- the above examples of the present disclosure can determine the decision indication information based on the indication information decision maker, and based on the decision indication information, the terminal device or user selects one of the three modes to form a solution, thereby determining the appropriate working mode based on the indication information.
Landscapes
- Physics & Mathematics (AREA)
- Engineering & Computer Science (AREA)
- Acoustics & Sound (AREA)
- Signal Processing (AREA)
- Stereophonic System (AREA)
Abstract
本公开提出一种音频信号处理方法、装置、设备及存储介质,由第一设备执行,方法包括:根据决策指示信息,从多个处理模式中确定目标处理模式;以目标处理模式,处理音频信号,以得到目标音频信号;将目标音频信号发送至第二设备;多个处理模式为基于第一设备为载体所完成的处理功能不同。可以实现根据决策指示信息选择满足音频体验服务需求的最优工作模式。
Description
本公开涉及通信技术领域,尤其涉及一种音频信号处理方法、装置及存储介质。
为了完成音频在终端设备尤其是扩展现实(Extended Reality,XR)设备端的接收渲染回放,需要确定具体的工作模式,即如何将接收到的音频码流信号从解码到双耳渲染的解码渲染处理全过程合理的分配到各处理单元中,相关技术提出的工作模式存在时延较大、复杂度较高的问题。
发明内容
本公开提出一种音频信号处理方法、装置、通信设备、通信系统、存储介质。
根据本公开实施例的第一方面,提出了一种音频信号处理方法,由第一设备执行,方法包括:根据决策指示信息,从多个处理模式中确定目标处理模式;以目标处理模式,处理音频信号,以得到目标音频信号;将目标音频信号发送至第二设备;多个处理模式为基于第一设备为载体所完成的处理功能不同。
在上述方法中,第一设备可以根据第一信息确定音频信号的目标处理模式,可以实现根据指示信息确定音频信号合适的处理模式,通过对音频信号进行处理并发送到第二设备,可以实现满足音频体验服务需求最优工作模式。
根据本公开实施例的第二方面,提出了一种音频信号处理方法,方法由第二设备执行,方法包括:接收第一设备发送的目标音频信号,目标音频信号为第一设备以目标处理模式处理音频信号得到的,目标处理模式为根据决策指示信息从多个处理模式中确定的;以目标处理模式,处理目标音频信号;多个处理模式为基于第一设备为载体所完成的处理功能不同。
在上述方法中,第二设备可以接收目标音频信号并对目标音频信号进行处理,可以实现满足音频体验服务需求最优工作模式。
根据本公开实施例的第三方面,提出了一种第一设备,包括处理模块,用于根据决策指示信息,从多个处理模式中确定目标处理模式;处理模块还用于以目标处理模式,处理音频信号,以得到目标音频信号;收发模块,用于将目标音频信号发送至第二设备。其中,多个处理模式为基于第一设备为载体所完成的处理功能不同。
根据本公开实施例的第四方面,提出了一种第二设备,包括收发模块,用于接收第一设备发送的目标音频信号,目标音频信号为第一设备以目标处理模式处理音频信号得到的,目标处理模式为根据决策指示信息从多个处理模式中确定的;处理模块,用于以目标处理模式,处理目标音频信号;多个处理模式为基于第一设备为载体所完成的处理功能不同。
根据本公开实施例的第五方面,提出了一种通信设备,其中,包括:收发器;存储器;处理器,分别与收发器及存储器连接,配置为通过执行存储器上的计算机可执行指令,控制收发器的无线信号收发,并能够执行第一方面、第二方面中任一方面实施例的方法。
根据本公开实施例的第六方面,提出了一种存储介质,该存储介质存储有指令,当该指令在通信设备上运行时,使得通信设备执行如第一方面、第二方面中任一方面实施例的方法。
根据本公开实施例的第七方面,提出了一种通信系统,包括第一设备和第二设备,其中,第一设备被配置为实现第一方面实施例的方法,第二设备被配置为实现第二方面实施例的方法。
本公开上述的和/或附加的方面和优点从下面结合附图对实施例的描述中将变得明显和容易理解,其中:
图1为本公开实施例提供的通信系统的架构示意图;
图2为本公开实施例所提供的一种音频信号处理方法的交互示意图;
图3为本公开实施例所提供的一些音频信号处理方法的流程示意图;
图4为本公开实施例所提供的另一些音频信号处理方法的流程示意图;
图5为本公开实施例所提供的音频信号处理方法的交互示意图;
图6为本公开实施例提供的一种判决流程示意图;
图7为本公开是实施例提供的一种工作模式确定方法的流程示意图;
图8a为本公开一个实施例所提供的第一设备的结构示意图;
图8b为本公开一个实施例所提供的第二设备的结构示意图;
图9a是本公开一个实施例所提供的一种通信设备的结构示意图;
图9b为本公开一个实施例所提供的一种芯片的结构示意图。
本公开实施例提出了一种音频信号处理方法及装置、通信设备、通信系统、存储介质。
第一方面,本公开实施例提出了一种音频信号处理方法,该方法由第一设备执行,方法包括:根据决策指示信息,从多个处理模式中确定目标处理模式;;以目标处理模式,处理音频信号,以得到目标音频信号;将目标音频信号发送至第二设备;多个处理模式为基于第一设备为载体所完成的处理功能不同。
在上述实施例中,第一设备可以根据决策指示信息确定音频信号的目标处理模式,可以实现根据指示信息确定音频信号合适的处理模式,通过对音频信号进行处理并发送到第二设备,可以实现满足音频体验服务需求最优工作模式。
结合第一方面的一些实施例,在一些实施例中,方法还包括:基于第一信息,确定决策指示信息,第一信息用于表示音频信号的时延要求、精度特性、收听者自由度特性中的至少一项。
结合第一方面的一些实施例,在一些实施例中,第一信息包括以下至少一项:第一参数,第一参数用于标识自由度,自由度为第一设备和/或第二设备所配置的传感器接收到的收听者位置移动和/或姿态变化的信息;第二参数,第二参数用于标识声像场景和/或渲染精度,声像场景为音频信号所包括的声像数,渲染精度为对音频信号进行渲染处理所需的精度;第三参数,第三参数用于标识音频信号的背景清晰度;第四参数,第四参数用于标识时延,时延为第二设备向第一设备发送第一参数到第二设备接收到第一设备发送的目标音频信号之间的时间。
在上述实施例中,可以通过确定第一信息来确定当前应用场景,便于基于第一信息确定适用于当前场景的处理模式。
结合第一方面的一些实施例,在一些实施例中,目标处理模式包括以下至少一项:第一处理模式,第一处理模式为第一设备对音频信号进行码流解码、渲染处理以及立体声编码,第一设备将目标音频信号发送至第二设备后,由第二设备对目标音频信号进行立体声解码以及播放;第二处理模式,第二处理模式为第一设备对音频信号进行码流解码、下混和/或格式转换,和码流编码,第一设备将目标音频信号发送至第二设备后,由第二设备对目标音频信号进行码流解码、渲染以及播放;第三处理模式,第三处理模式为第一设备对音频信号进行码流解码、第一渲染处理以及中间变量编码,第一设备将目标音频信号发送至第二设备后,由第二设备对目标音频信号进行中间变量解码、第二渲染处理以及播放。
在上述实施例中,通过确定处理模式,可以实现第一设备与第二设备的音频处理的合理分工,确保第一设备与第二设备的算力分担保持均衡。
结合第一方面的一些实施例,在一些实施例中,根据决策指示信息,确定目标处理模式包括:将决策指示信息满足预设条件的处理模式,确定为目标处理模式;或者,接收指示信息,根据指示信息确定目标处理模式,指示信息包括第一设备的用户根据决策指示信息确定的目标处理模式。
在上述实施例中,可以通过第一信息确定决策指示信息,并根据决策指示信息确定目标处理模式,可
以实现根据有效指示信息,选择合适的工作模式。
结合第一方面的一些实施例,在一些实施例中,将决策指示信息满足预设条件的处理模式,确定为目标处理模式包括:在决策指示信息满足第一条件时,确定目标处理模式为第一处理模式;在决策指示信息满足第二条件时,确定目标处理模式为第二处理模式;在决策指示信息满足第三条件时,确定目标处理模式为第三处理模式。
在上述实施例中,可以实现根据决策指示信息,确定合适的目标处理模式。
结合第一方面的一些实施例,在一些实施例中,基于第一信息,确定决策指示信息包括:在第一信息中的第一参数指示自由度为0和/或第四参数指示时延为低时延时,确定第一参数为第一预设值;在第一参数指示自由度为大于等于3小于6和/或第四参数指示时延为中时延时,确定第一参数为第二预设值;在第一参数指示自由度为6和/或第四参数指示时延为高时延时,确定第一参数值为第三预设值;在第一信息中的第二参数指示声像场景为单声像场景且渲染精度为高精度时,确定第二参数为第四预设值;在第二参数指示声像场景为单声像场景且渲染精度为中精度时,确定第二参数为第五预设值;在第二参数指示声像场景为单声像场景且渲染精度为低精度时,确定第二参数为第六预设值;在第二参数指示声像场景为多声像场景且渲染精度为高精度时,确定第二参数为第七预设值;在第二参数指示声像场景为多声像场景且渲染精度为中精度时,确定第二参数为第八预设值;在第二参数指示声像场景为多声像场景且渲染精度为低精度时,确定第二参数为第九预设值;在第一信息中的第三参数指示背景清晰度为纯净背景时,确定第三参数为第十预设值;在第三参数指示背景清晰度为嘈杂背景时,确定第三参数为第十一预设值;在第三参数指示背景清晰度为中等背景时,确定第三参数为第十二预设值;基于预设函数,以第一参数、第二参数、第三参数为自变量,确定预设函数的函数值作为决策指示信息。
在上述实施例中,通过确定参数的值,可以将参数指标量化,便于根据参数的值确定决策指示信息。
结合第一方面的一些实施例,在一些实施例中,基于预设函数,以第一参数、第二参数、第三参数为自变量,确定预设函数的函数值作为决策指示信息包括:对第一参数、第二参数、第三参数分别设置权重因子;对第一参数、第二参数、第三参数与权重因子进行加权求和,得到决策指示信息。
在上述实施例中,可以根据参数的权重以及参数的值确定决策指标信息。
结合第一方面的一些实施例,在一些实施例中,以目标处理模式,处理音频信号,以得到目标音频信号包括:在目标处理模式为第一处理模式时,对音频信号进行码流解码、渲染处理以及立体声编码,得到双耳音频信号,作为目标音频信号;在目标处理模式为第二处理模式时,对音频信号进行码流解码、下混和码流编码,得到编码音频信号,作为目标音频信号;在目标处理模式为第三处理模式时,对音频信号进行码流解码、第一渲染处理以及中间变量编码,得到预渲染音频信号,作为目标音频信号。
在上述实施例中,可以根据目标处理模式对音频信号进行处理,得到目标音频信号,可以实现选择适合的工作模式对音频信号进行处理,确保第一设备与第二设备的算力分担保持均衡。
第二方面,本公开实施例提出了一种音频信号处理方法,方法由第二设备执行,方法包括接收第一设备发送的目标音频信号,目标音频信号为第一设备以目标处理模式处理音频信号得到的,目标处理模式为根据决策指示信息从多个处理模式中确定的;以目标处理模式,处理目标音频信号;多个处理模式为基于第一设备为载体所完成的处理功能不同。
在上述实施例中,第二设备可以接收目标音频信号并对目标音频信号进行处理,可以实现满足音频体验服务需求最优工作模式。
结合第二方面的一些实施例,在一些实施例中,第一信息包括以下至少一项:第一参数,第一参数用于标识自由度,自由度为第一设备和/或第二设备所配置的传感器接收到的收听者位置移动和/或姿态变化的信息;第二参数,第二参数用于标识声像场景和/或渲染精度,声像场景为音频信号所包括的声像数,渲染精度为对音频信号进行渲染处理所需的精度;第三参数,第三参数用于标识音频信号的背景清晰度;第四参数,第四参数用于标识时延,时延为第二设备向第一设备发送第一参数到第二设备接收到第一设备发送的目标音频信号之间的时间。
在上述实施例中,可以通过确定第一信息来确定当前应用场景,便于基于第一信息确定适用于当前场景的处理模式。
结合第二方面的一些实施例,在一些实施例中,目标处理模式包括以下至少一项:第一处理模式,第
一处理模式为第一设备对音频信号进行码流解码、渲染处理以及立体声编码,第一设备将目标音频信号发送至第二设备后,由第二设备对目标音频信号进行立体声解码以及播放;第二处理模式,第二处理模式为第一设备对音频信号进行码流解码、下混和/或格式转换,和码流编码,第一设备将目标音频信号发送至第二设备后,由第二设备对目标音频信号进行码流解码、渲染以及播放;第三处理模式,第三处理模式为第一设备对音频信号进行码流解码、第一渲染处理以及中间变量编码,第一设备将目标音频信号发送至第二设备后,由第二设备对目标音频信号进行中间变量解码、第二渲染处理以及播放。
在上述实施例中,通过确定处理模式,可以实现第一设备与第二设备的音频处理的合理分工,确保第一设备与第二设备的算力任务保持均衡。
结合第二方面的一些实施例,在一些实施例中,在决策指示信息满足第一条件时,目标处理模式为第一处理模式;在决策指示信息满足第二条件时,目标处理模式为第二处理模式;在决策指示信息满足第三条件时,目标处理模式为第三处理模式,决策指示信息为基于第一信息确定的。
在上述实施例中,可以实现根据决策指示信息,确定合适的目标处理模式。
结合第二方面的一些实施例,在一些实施例中,决策指示信息为预设函数的函数值,预设函数的自变量为第一信息中的第一参数、第二参数、第三参数,其中,在第一参数指示自由度为0和/或第四参数指示时延为低时延时,第一参数为第一预设值;在第一参数指示自由度为大于等于3小于6和/或第四参数指示时延为中时延时,第一参数为第二预设值;在第一参数指示自由度为6和/或第四参数指示时延为高时延时,第一参数值为第三预设值;在第二参数指示声像场景为单声像场景且渲染精度为高精度时,第二参数为第四预设值;在第二参数指示声像场景为单声像场景且渲染精度为中精度时,第二参数为第五预设值;在第二参数指示声像场景为单声像场景且渲染精度为低精度时,第二参数为第六预设值;在第二参数指示声像场景为多声像场景且渲染精度为高精度时,第二参数为第七预设值;在第二参数指示声像场景为多声像场景且渲染精度为中精度时,第二参数为第八预设值;在第二参数指示声像场景为多声像场景且渲染精度为低精度时,第二参数为第九预设值;在第三参数指示背景清晰度为纯净背景时,第三参数为第十预设值;在第三参数指示背景清晰度为嘈杂背景时,第三参数为第十一预设值;在第三参数指示背景清晰度为中等背景时,第三参数为第十二预设值。
在上述实施例中,通过确定参数的值,可以将参数指标量化,便于根据参数的值确定决策指示信息。
结合第二方面的一些实施例,在一些实施例中,以目标处理模式,处理目标音频信号包括:在目标处理模式为第一处理模式时,对目标音频信号进行立体声解码以及播放;在目标处理模式为第二处理模式时,对目标音频信号进行码流解码、渲染以及播放;在目标处理模式为第三处理模式时,对目标音频信号进行中间变量解码、第二渲染处理以及播放。
在上述实施例中,可以根据目标处理模式对音频信号进行处理,得到目标音频信号,可以实现选择适合的工作模式对音频信号进行处理,确保第一设备与第二设备的算力分担保持均衡。
第三方面,本公开实施例提出了一种第一设备,包括处理模块,用于根据决策指示信息,从多个处理模式中确定目标处理模式;处理模块还用于以目标处理模式,处理音频信号,以得到目标音频信号;收发模块,用于将目标音频信号发送至第二设备。其中,多个处理模式为基于第一设备为载体所完成的处理功能不同。
第四方面,本公开实施例提出了一种第二设备,包括收发模块,用于接收第一设备发送的目标音频信号,目标音频信号为第一设备以目标处理模式处理音频信号得到的,目标处理模式为根据决策指示信息从所述多个处理模式中确定的;处理模块,用于以目标处理模式,处理目标音频信号;多个处理模式为基于第一设备为载体所完成的处理功能不同。
第五方面,本公开实施例提出了通信设备,上述包括:其中,处理器用于调用指令以使得通信设备执行本公开实施例第一方面、第二方面的可选实现方式所描述的方法。
第六方面,本公开实施例提出了通信系统,上述通信系统包括:第一设备、第二设备;其中,上述第一设备被配置为执行如第一方面和第一方面的可选实现方式所描述的方法,上述第二设备被配置为执行如第二方面和第二方面的可选实现方式所描述的方法。
第七方面,本公开实施例提出了存储介质,计算机存储介质存储有计算机可执行指令;计算机可执行指令被处理器执行后,能够执行如第一方面、第一方面的可选实现方式、第二方面、第二方面的可选实现
方式所描述的方法。
第八方面,本公开实施例提出了一种计算机程序产品,其特征在于,包括计算机程序,计算机程序在被处理器执行时实现本公开第一方面、第二方面实施例中任一项的方法。
可以理解地,上述第一设备、第二设备、通信设备、通信系统、存储介质均用于执行本公开实施例所提出的方法。因此,其所能达到的有益效果可以参考对应方法中的有益效果,此处不再赘述。
本公开实施例提出了通信方法及装置、通信设备、通信系统、存储介质。在一些实施例中,通信方法与信息处理方法、通信方法等术语可以相互替换,装置与终端、网络设备、通信装置等术语可以相互替换,信息处理系统、通信系统等术语可以相互替换。
本公开实施例并非穷举,仅为部分实施例的示意,不作为对本公开保护范围的具体限制。在不矛盾的情况下,某一实施例中的每个步骤均可以作为独立实施例来实施,且各步骤之间可以任意组合,例如,在某一实施例中去除部分步骤后的方案也可以作为独立实施例来实施,且在某一实施例中各步骤的顺序可以任意交换,另外,某一实施例中的可选实现方式可以任意组合;此外,各实施例之间可以任意组合,例如,不同实施例的部分或全部步骤可以任意组合,某一实施例可以与其他实施例的可选实现方式任意组合。
在各本公开实施例中,如果没有特殊说明以及逻辑冲突,各实施例之间的术语和/或描述具有一致性,且可以互相引用,不同实施例中的技术特征根据其内在的逻辑关系可以组合形成新的实施例。
本公开实施例中所使用的术语只是为了描述特定实施例的目的,而并非作为对本公开的限制。
在本公开实施例中,除非另有说明,以单数形式表示的元素,如“一个”、“一种”、“该”、“上述”、“所述”、“前述”、“这一”等,可以表示“一个且只有一个”,也可以表示“一个或多个”、“至少一个”等。例如,在翻译中使用如英语中的“a”、“an”、“the”等冠词(article)的情况下,冠词之后的名词可以理解为单数表达形式,也可以理解为复数表达形式。
在本公开实施例中,“多个”是指两个或两个以上。
在一些实施例中,“至少一者(at least one of)”、“至少一项(at least one of)”、“至少一个(at least one of)”、“一个或多个(one or more)”、“多个(a plurality of)”、“多个(multiple)等术语可以相互替换。
本公开实施例中的如“A、B、C……中的至少一者”、“A和/或B和/或C……”等描述方式,包括了A、B、C……中任意一个单独存在的情况,也包括了A、B、C……中任意多个的任意组合情况,每种情况可以单独存在;例如,“A、B、C中的至少一者”包括单独A、单独B、单独C、A和B组合、A和C组合、B和C组合、A和B和C组合的情况;例如,A和/或B包括单独A、单独B、A和B的组合的情况。
在一些实施例中,“在一情况下A,在另一情况下B”、“响应于一情况A,响应于另一情况B”等记载方式,根据情况可以包括以下技术方案:与B无关地执行A,即,在一些实施例中A;与A无关地执行B,即,在一些实施例中B;A和B被选择性执行,即,在一些实施例中从A与B中选择执行;A和B都被执行,即,在一些实施例中A和B。当有A、B、C等更多分支时也类似上述。
本公开实施例中的“第一”、“第二”等前缀词,仅仅为了区分不同的描述对象,不对描述对象的位置、顺序、优先级、数量或内容等构成限制,对描述对象的陈述参见权利要求或实施例中上下文的描述,不应因为使用前缀词而构成多余的限制。例如,描述对象为“字段”,则“第一字段”和“第二字段”中“字段”之前的序数词并不限制“字段”之间的位置或顺序,“第一”和“第二”并不限制其修饰的“字段”是否在同一个消息中,也不限制“第一字段”和“第二字段”的先后顺序。再如,描述对象为“等级”,则“第一等级”和“第二等级”中“等级”之前的序数词并不限制“等级”之间的优先级。再如,描述对象的数量并不受序数词的限制,可以是一个或者多个,以“第一装置”为例,其中“装置”的数量可以是一个或者多个。此外,不同前缀词修饰的对象可以相同或不同,例如,描述对象为“装置”,则“第一装置”和“第二装置”可以是相同的装置或者不同的装置,其类型可以相同或不同;再如,描述对象为“信息”,则“第一信息”和“第二信息”可以是相同的信息或者不同的信息,其内容可以相同或不同。
在一些实施例中,“包括A”、“包含A”、“用于指示A”、“携带A”,可以解释为直接携带A,也可以解释为间接指示A。
在一些实施例中,“响应于……”、“响应于确定……”、“在……的情况下”、“在……时”、“当……时”、“若……”、“如果……”等术语可以相互替换。
在一些实施例中,“大于”、“大于或等于”、“不小于”、“多于”、“多于或等于”、“不少于”、“高于”、“高
于或等于”、“不低于”、“以上”等术语可以相互替换,“小于”、“小于或等于”、“不大于”、“少于”、“少于或等于”、“不多于”、“低于”、“低于或等于”、“不高于”、“以下”等术语可以相互替换。
在一些实施例中,装置等可以解释为实体的、也可以解释为虚拟的,其名称不限定于实施例中所记载的名称,“装置”、“设备(equipment)”、“设备(device)”、“电路”、“网元”、“节点”、“功能”、“单元”、“部件(section)”、“系统”、“网络”、“芯片”、“芯片系统”、“实体”、“主体”等术语可以相互替换。
在一些实施例中,“接入网设备(access network device,AN device)”、“无线接入网设备(radio access network device,RAN device)”、“基站(base station,BS)”、“无线基站(radio base station)”、“固定台(fixed station)”、“节点(node)”、“接入点(access point)”、“发送点(transmission point,TP)”、“接收点(reception point,RP)”、“发送接收点(transmission/reception point,TRP)”、“面板(panel)”、“天线面板(antenna panel)”、“天线阵列(antenna array)”、“小区(cell)”、“宏小区(macro cell)”、“小型小区(small cell)”、“毫微微小区(femto cell)”、“微微小区(pico cell)”、“扇区(sector)”、“小区组(cell group)”、“载波(carrier)”、“分量载波(component carrier)”、“带宽部分(bandwidth part,BWP)”等术语可以相互替换。
在一些实施例中,“终端(terminal)”、“终端设备(terminal device)”、“用户设备(user equipment,UE)”、“用户终端(user terminal)”、“移动台(mobile station,MS)”、“移动终端(mobile terminal,MT)”、订户站(subscriber station)、移动单元(mobile unit)、订户单元(subscriber unit)、无线单元(wireless unit)、远程单元(remote unit)、移动设备(mobiledevice)、无线设备(wireless device)、无线通信设备(wireless communication device)、远程设备(remote device)、移动订户站(mobile subscriber station)、接入终端(access terminal)、移动终端(mobile terminal)、无线终端(wireless terminal)、远程终端(remote terminal)、手持设备(handset)、用户代理(user agent)、移动客户端(mobile client)、客户端(client)等术语可以相互替换。
在一些实施例中,接入网设备、核心网设备、或网络设备可以被替换为终端。例如,针对将接入网设备、核心网设备、或网络设备以及终端间的通信置换为多个终端间的通信(例如,也可以被称为设备对设备(device-to-device,D2D)、车联网(vehicle-to-everything,V2X)等)的结构,也可以应用本公开的各实施例。在该情况下,也可以设为终端具有接入网设备所具有的全部或部分功能的结构。此外,“上行”、“下行”等语言也可以被替换为与终端间通信对应的语言(例如,“侧行(side)”)。例如,上行信道、下行信道等可以被替换为侧行信道,上行链路、下行链路等可以被替换为侧行链路。
在一些实施例中,终端可以被替换为接入网设备、核心网设备、或网络设备。在该情况下,也可以设为接入网设备、核心网设备、或网络设备具有终端所具有的全部或部分功能的结构。
在一些实施例中,信息等的名称不限定于实施例中所记载的名称,“信息(information)”、“消息(message)”、“信号(signal)”、“信令(signaling)”、“报告(report)”、“配置(configuration)”、“指示(indication)”、“指令(instruction)”、“命令(command)”、“信道”、“参数(parameter)”、“域”、“字段”、“符号(symbol)”、“码元(symbol)”、“码本(codebook)”、“码字(codeword)”、“码点(codepoint)”、“比特(bit)”、“数据(data)”、“程序(program)”、“码片(chip)”等术语可以相互替换。
在一些实施例中,“上行”、“上行链路”、“物理上行链路”等术语可以相互替换,“下行”、“下行链路”、“物理下行链路”等术语可以相互替换,“侧行(side)”、“侧行链路(sidelink)”、“侧行通信”、“侧行链路通信”、“直连”、“直连链路”、“直连通信”、“直连链路通信”等术语可以相互替换。
在一些实施例中,“下行链路控制信息(downlink control information,DCI)”、“下行链路(downlink,DL)分配(assignment)”、“DL DCI”、“上行链路(uplink,UL)许可(grant)”、“UL DCI”等术语可以相互替换。
在一些实施例中,“物理下行链路共享信道(physical downlink shared channel,PDSCH)”、“DL数据”等术语可以相互替换,“物理上行链路共享信道(physical uplink shared channel,PUSCH)”、“UL数据”等术语可以相互替换。
在一些实施例中,“无线(radio)”、“无线(wireless)”、“无线接入网(radio access network,RAN)”、“接入网(access network,AN)”、“基于RAN的(RAN-based)”等术语可以相互替换。
在一些实施例中,“同步信号(synchronization signal,SS)”、“同步信号块(synchronization signal block,
SSB)”、“参考信号(reference signal,RS)”、“导频(pilot)”、“导频信号(pilot signal)”等术语可以相互替换。
在一些实施例中,“时刻”、“时间点”、“时间”、“时间位置”等术语可以相互替换,“时长”、“时段”、“时间窗口”、“窗口”、“时间”等术语可以相互替换。
在一些实施例中,“获取”、“获得”、“得到”、“接收”、“传输”、“双向传输”、“发送和/或接收”可以相互替换,其可以解释为从其他主体接收,从协议中获取,自身处理得到、自主实现等多种含义。
在一些实施例中,“发送”、“发射”、“上报”、“下发”、“传输”、“双向传输”、“发送和/或接收”等术语可以相互替换。
在一些实施例中,“预定”、“预设”可以解释为在协议等中预先规定,也可以解释为装置等进行预先设定动作。
在一些实施例中,确定(determining)可以解释为判断、决定、判定(judging)、计算(calculating)、算出(computing)、处理(processing)、导出(deriving)、调查(investigating)、搜索、查找(looking up)、检索(search)、查询(inquiry)、确认(ascertaining)、接收(receiving)、发送(transmitting)、输入(input)、输出(output)、访问(accessing)、解决(resolving)、选择(selecting)、选定(choosing)、建立(establishing)、比较(comparing)、“设想(assuming)”、“期待(expecting)”、“视为(considering)、广播(broadcasting)、通知(notifying)、通信(communicating)、转发(forwarding)、配置(configuring)、重配(reconfiguring)、分配(allocating)、映射(mapping)、分派(assigning)等,但不限于此。
在一些实施例中,判定或判断可以通过以1比特表示的值(0或1)来进行,也可以通过以真(true)或者假(false)表示的真假值(布尔值(boolean))来进行,也可以通过数值的比较(例如,与预定值的比较)来进行,但不限于此。
在一些实施例中,“网络”可以解释为网络中包含的装置(例如,接入网设备、核心网设备等)。
在一些实施例中,“不期待接收”可以解释为不在时域资源和/或频域资源上接收,也可以解释为在接收到数据等后,不对该数据等执行后续处理;“不期待发送”可以解释为不发送,也可以解释为发送但是不期待接收方对发送的内容做出响应。
在一些实施例中,获取数据、信息等可以遵照所在地国家的法律法规。
在一些实施例中,可以在得到用户同意后获取数据、信息等。为了解决上述问题,本公开提出一种通信方法及装置、通信设备、通信系统、存储介质。
第一代移动通信技术(1G)开始于20世纪80年代,1G是第一代无线蜂窝技术,是属于模拟移动通信网。1G升级到2G时将手机从模拟通信转移到数字通信,我国采用全球移动通讯系统(Global System for Mobile Communications,GSM)网络制式,语音编码器采用:自适应多速率编解码器(Adaptive Multi-Rate,AMR)、增强型全速率编解码器(Enhanced Full Rate,EFR)、全速率编解码器(Full Rate,FR)、半速率编解码器(Half Rate,HR)提供单通道窄带语音服务。
3G移动通信系统是国际电信联盟(International Telecommunication Union,ITU)为2000年国际移动通信而提出的,其语音编码器采用AMR-WB提供单通道宽带语音服务。4G是在3G技术上的一次更好的改良,数据和话音都采用全IP的方式,提供语音音频的实时HD/HD+Voice服务,采用的EVS编解码器能够兼顾语音和音频的高质量压缩重建。
伴随着4G/5G以及AR/VR/MR技术的发展,XR设备提供的沉浸式音频服务是一种全新的音频体验,典型的XR设备如AR眼镜,为了消费者佩戴方便,其外型结构,重量等会受到严格限制,因此为了完成音频在XR设备端的渲染回放,需要将接收到的音频码流信号从解码到双耳渲染的解码渲染处理全过程合理的分配到各处理单元中,AR眼镜按照功能分配结构可以划分为如下几种类型:5G独立组网AR用户设备(5G Standalone AR UE)、5G边缘依赖AR用户设备(5G EDGe-Dependent AR UE)、5G无线拘束AR用户设备(5G WireLess Tethered AR UE)、5G有线拘束AR用户设备(5G Wired Tethered AR UE)。
其中5G边缘依赖AR用户设备和5G无线拘束AR用户设备两种AR设备是本发明技术要研究的两种对象设备。
上述两种XR设备其音频处理在Cloud/Edge Device和XR设备间进行合理的分配,最终在XR设备侧输出渲染后的双耳信号给用户。相关技术中可以包括以下几种音频处理分配方式。
方案一:现有技术方案一利用终端设备(如:智能手机)来进行解码处理和渲染处理,渲染处理的是根据头跟踪设备输出头部旋转信息(3自由度)或者头部旋转信息和用户最新的位置信息(6自由度)来对解码输出信号进行渲染,渲染后的双耳信号进行编码后发送到播放设备(如:耳机),播放设备接收码流信号后进行解码输出双耳信号,用户通过播放的双耳信号获得沉浸式音频体验服务。
上述方案一提出的方法存在的问题是头跟踪设备输出的信息传送到终端设备需要一定时间的时延,超过阈值的时延使得双耳渲染信号无法实时跟踪用户的头旋转和/或者位置信息,从而导致用户接收到的双耳渲染信号无法与用户当前时刻应该听到的信号完全一致。
方案二:现有技术方案二在云终端设备(如:智能手机)接收到码流信号后直接透传给播放设备(如:耳机),播放设备根据头跟踪设备输出头部旋转信息(3自由度)或者头部旋转信息和用户最新的位置信息(6自由度)来对解码输出信号进行渲染处理,渲染后的双耳信号通过扬声器(speaker)进行播放获得沉浸式音频体验服务。
上述方案二提出的方法存在的问题是播放设备(如:耳机)承担解码和渲染处理,要求播放设备有强大的算力和存储资源,也即对播放设备的电池容量有较高的要求。
方案三:现有技术方案三利用终端设备(如:智能手机)接收到码流信号后先进行解码处理,然后进行第一级渲染处理(如图中渲染处理一),第一级渲染处理是基于头跟踪设备输出的信息中随时间变化缓慢的信息对解码信号进行渲染处理,第一级渲染处理后的信号进行编码获得码流信号发送播放设备(如:耳机),播放设备接收到码流信号先进行解码再根据头跟踪设备输出的实时信息来对输出信号第二级渲染处理,渲染后的双耳信号通过speaker回放获得沉浸式音频服务体验。
上述方案三提出的方法存在的问题是,两级渲染处理的方式增加了从接收到的码流信号到获得双耳信号的系统解决方案的整体复杂,如何平衡两级渲染的算力分担比例也对端到端解决方案的性能有较大的影响。
为了解决上述问题,本方案提出了一种音频信号处理方法,可以实现根据指示信息选择合适的工作模式,该方法具体内容如下。
图1是根据本公开实施例示出的通信系统的架构示意图。如图1所示,通信系统100可以包括第一设备101和第二设备102。
在一些实施例中,第一设备可以是接收音频信号的设备,例如第一设备可以是终端,包括但不限于手机,电脑,平板,会议系统设备,AR/VR设备,汽车等。示例地,第一设备可以从网络设备接收音频信号,例如手机接听电话的音频信号可以是从网络设备接收的。可选地,第一设备可以对接收的音频信号进行处理。可选地,第一设备可以将处理后的音频信号或者未处理的音频信号提供给第二设备。
在一些实施例中,第二设备可以是输出目标音频信号的设备,示例地,第二设备可以是终端,例如XR设备等,具体例如增强现实(Augmented Reality,AR)眼镜等,第二设备可以从第一设备接收音频信号,该音频信号可以是被第一设备处理后的音频信号,或者可以是第一设备未经处理的音频信号。可选地,第二设备可以对从第一设备接收到的音频信号进行处理。在一些实施例中,终端例如包括手机(mobile phone)、可穿戴设备、物联网设备、具备通信功能的汽车、智能汽车、平板电脑(Pad)、带无线收发功能的电脑、虚拟现实(virtual reality,VR)终端设备、增强现实(augmented reality,AR)终端设备、工业控制(industrial control)中的无线终端设备、无人驾驶(self-driving)中的无线终端设备、远程手术(remote medical surgery)中的无线终端设备、智能电网(smart grid)中的无线终端设备、运输安全(transportation safety)中的无线终端设备、智慧城市(smart city)中的无线终端设备、智慧家庭(smart home)中的无线终端设备中的至少一者,但不限于此。
在一些实施例中,通信系统还可以包括第三设备,可选地,第三设备可以是向第一设备提供音频信号的设备,例如网络设备。
在一些实施例中,“网络设备”可以是接入网设备,例如基站。可选地,网络设备也可以是包括核心网设备在内的广义的网络设备。在一些实施例中,接入网设备例如是将终端接入到无线网络的节点或设备,接入网设备可以包括5G通信系统中的演进节点B(evolved NodeB,eNB)、下一代演进节点B(next generation eNB,ng-eNB)、下一代节点B(next generation NodeB,gNB)、节点B(node B,NB)、家庭节点B(home node B,HNB)、家庭演进节点B(home evolved nodeB,HeNB)、无线回传设备、无线网络控制器(radio
network controller,RNC)、基站控制器(base station controller,BSC)、基站收发台(base transceiver station,BTS)、基带单元(base band unit,BBU)、移动交换中心、6G通信系统中的基站、开放型基站(Open RAN)、云基站(Cloud RAN)、其他通信系统中的基站、无线保真(wireless fidelity,WiFi)系统中的接入节点中的至少一者,但不限于此。
在一些实施例中,本公开的技术方案可适用于Open RAN架构,此时,本公开实施例所涉及的接入网设备间或者接入网设备内的接口可变为Open RAN的内部接口,这些内部接口之间的流程和信息交互可以通过软件或者程序实现。
在一些实施例中,接入网设备可以由集中单元(central unit,CU)与分布式单元(distributed unit,DU)组成的,其中,CU也可以称为控制单元(control unit),采用CU-DU的结构可以将接入网设备的协议层拆分开,部分协议层的功能放在CU集中控制,剩下部分或全部协议层的功能分布在DU中,由CU集中控制DU,但不限于此。
在一些实施例中,核心网设备可以是一个设备,包括一个或多个网元,也可以是多个设备或设备群,分别包括一个或多个网元中的全部或部分。网元可以是虚拟的,也可以是实体的。核心网例如包括演进分组核心(Evolved Packet Core,EPC)、5G核心网络(5G Core Network,5GCN)、下一代核心(Next Generation Core,NGC)中的至少一者。
在一些实施例中,上述一个或多个网元例如可以包括AMF、UPF、MME等,还可能包括其他网元,例如策略控制功能(Policy Control Function,PCF)、应用功能(Application Function,AF)、网络应用功能(network application function,NAF)、应用层认证与密钥管理锚点功能(Authentication and Key management for Applications Anchor Function,AAnF)、引导服务器功能(Bootstrapping Server Functionality,BSF)、会话管理功能(Session Management Function,SMF)等。
可以理解的是,本公开实施例描述的通信系统是为了更加清楚的说明本公开实施例的技术方案,并不构成对于本公开实施例提出的技术方案的限定,本领域普通技术人员可知,随着系统架构的演变和新业务场景的出现,本公开实施例提出的技术方案对于类似的技术问题同样适用。
下述本公开实施例可以应用于图1所示的通信系统100、或部分主体,但不限于此。图1所示的各主体是例示,通信系统可以包括图1中的全部或部分主体,也可以包括图1以外的其他主体,各主体数量和形态为任意,各主体之间的连接关系是例示,各主体之间可以不连接也可以连接,其连接可以是任意方式,可以是直接连接也可以是间接连接,可以是有线连接也可以是无线连接。
本公开各实施例可以应用于长期演进(Long Term Evolution,LTE)、LTE-Advanced(LTE-A)、LTE-Beyond(LTE-B)、SUPER 3G、IMT-Advanced、第四代移动通信系统(4th generation mobile communication system,4G)、)、第五代移动通信系统(5th generation mobile communication system,5G)、5G新空口(new radio,NR)、未来无线接入(Future Radio Access,FRA)、新无线接入技术(New-Radio Access Technology,RAT)、新无线(New Radio,NR)、新无线接入(New radio access,NX)、未来一代无线接入(Future generation radio access,FX)、Global System for Mobile communications(GSM(注册商标))、CDMA2000、超移动宽带(Ultra Mobile Broadband,UMB)、IEEE 802.11(Wi-Fi(注册商标))、IEEE 802.16(WiMAX(注册商标))、IEEE 802.20、超宽带(Ultra-WideBand,UWB)、蓝牙(Bluetooth(注册商标))、陆上公用移动通信网(Public Land Mobile Network,PLMN)网络、设备到设备(Device-to-Device,D2D)系统、机器到机器(Machine to Machine,M2M)系统、物联网(Internet of Things,IoT)系统、车联网(Vehicle-to-Everything,V2X)、利用其他通信方法的系统、基于它们而扩展的下一代系统等。此外,也可以将多个系统组合(例如,LTE或者LTE-A与5G的组合等)应用。
图2是根据本公开实施例示出的音频信号处理方法方法的交互示意图。如图2所示,本公开实施例涉及通信方法,用于通信系统100,通信系统100可以包括第一设备101,第二设备102,在一些实施例中,上述方法包括:
步骤2101、第一设备基于第一信息,确定决策指示信息。
在一些实施例中,第一信息用于表示音频信号的时延要求、精度特性、收听者自由度特性中的至少一项。
在一些实施例中,第一信息包括以下至少一项:
第一参数,第一参数用于标识自由度,自由度为第一设备和/或第二设备所配置的传感器接收到的收听者位置移动和/或姿态变化的信息;
第二参数,第二参数用于标识声像场景和/或渲染精度,声像场景为音频信号所包括的声像数,渲染精度为对音频信号进行渲染处理所需的精度;
第三参数,第三参数用于标识音频信号的背景清晰度;
第四参数,第四参数用于标识时延,时延为第二设备向第一设备发送第一参数到第二设备接收到第一设备发送的目标音频信号之间的时间。
在上述实施例中,示例地,第一参数可以包括0自由度、3自由度、3+自由度、6自由度等等,第一参数的数值大小可以决定对延时的要求,通常自由度越大要求时延越低,例如6自由度场景下要求尽可能低的时延,从而使得用户能够在获得与自身姿态和旋转信息相匹配音频服务体验。
在上述实施例中,第四参数用于标识时延,其中时延是指第一设备和第二设备接收到第一参数的用户姿态、旋转等信息到输出渲染后的双耳信号之间所需要的时间,其中上述第一处理模式的时延最大,第二处理模式的时延最小,第三处理模式的时延居中。
在上述实施例中,第二参数可以是声像精度,示例地,声像精度可以划分为两个维度,其中第一维度为声像场景,例如单声像场景和多声像场景;第二维度为渲染精度,例如高精度、中精度和低精度。
在一些实施例中,决策指示信息可以是用于标识不同处理模式被选择的推荐参数。可选地,决策指示参数可以是用于被第一设备通过第一信息确定得到的综合指标。
在一些实施例中,基于第一信息,确定决策指示信息包括:
在第一信息中的第一参数指示自由度为0和/或第四参数指示时延为低时延时,确定第一参数为第一预设值;在第一参数指示自由度为大于等于3小于6和/或第四参数指示时延为中时延时,确定第一参数为第二预设值;在第一参数指示自由度为6和/或第四参数指示时延为高时延时,确定第一参数值为第三预设值;在第一信息中的第二参数指示声像场景为单声像场景且渲染精度为高精度时,确定第二参数为第四预设值;在第二参数指示声像场景为单声像场景且渲染精度为中精度时,确定第二参数为第五预设值;在第二参数指示声像场景为单声像场景且渲染精度为低精度时,确定第二参数为第六预设值;在第二参数指示声像场景为多声像场景且渲染精度为高精度时,确定第二参数为第七预设值;在第二参数指示声像场景为多声像场景且渲染精度为中精度时,确定第二参数为第八预设值;在第二参数指示声像场景为多声像场景且渲染精度为低精度时,确定第二参数为第九预设值;在第一信息中的第三参数指示背景清晰度为纯净背景时,确定第三参数为第十预设值;在第三参数指示背景清晰度为嘈杂背景时,确定第三参数为第十一预设值;在第三参数指示背景清晰度为中等背景时,确定第三参数为第十二预设值;
基于预设函数,以第一参数、第二参数、第三参数为自变量,确定预设函数的函数值作为决策指示信息。
换言之,决策指示信息可以是以第一参数、第二参数、第三参数为自变量,通过预设函数得到的,示例地,预设函数可以是加权求和函数,例如,当用Y表示决策指示信息时,可以表示为Y=Function(X1,X2,X3)=aX1+bX2+cX3,其中a、b、c分别为第一参数、第二参数和第三参数的权重因子,X1、X2、X3为第一参数、第二参数和第三参数的参数值,其参数值可以是上述第一预设值至第十二预设值中的一项。
在上述实施例中,第一预设值至第十二预设值的具体数值,可以根据实际情况进行确定,对此本公开不予限制。
在一些实施例中,基于预设函数,以第一参数、第二参数、第三参数为自变量,确定预设函数的函数值作为决策指示信息包括:
对第一参数、第二参数、第三参数分别设置权重因子,示例地,第一参数、第二参数和第三参数的权重因子可以基于实际情况进行设置,对此本公开不予限制;
对第一参数、第二参数、第三参数与权重因子进行加权求和,得到决策指示信息,例如Y=aX1+bX2+cX3。
步骤2102、第一设备确定目标处理模式。
在一些实施例中,第一设备可以根据决策指示信息,从多个处理模式中确定目标处理模式。
在一些实施例中,多个处理模式为基于第一设备为载体所完成的处理功能不同。换言之,在多个处理模式下,第一设备为载体时所完成的处理功能不同。换言之,第一设备在不同的处理模式下所完成的处理功能不同。换言之,第一设备和/或第二设备为音频信号的处理载体,在不同处理模式下,第一设备所完成的处理功能不同,相应地,第二设备所完成的处理功能不同。
在一些实施例中,目标处理模式可以是从多种处理模式中选择出的一种或多种,多种处理模式可以包括以下至少一项,即,目标处理模式可以包括以下至少一项:
第一处理模式,第一处理模式为第一设备对音频信号进行码流解码、渲染处理以及立体声编码,第一设备将目标音频信号发送至第二设备后,由第二设备对目标音频信号进行立体声解码以及播放;
第二处理模式,第二处理模式为第一设备对音频信号进行码流解码、下混和/或格式转换,和码流编码,第一设备将目标音频信号发送至第二设备后,由第二设备对目标音频信号进行码流解码、渲染以及播放;
第三处理模式,第三处理模式为第一设备对音频信号进行码流解码、第一渲染处理以及中间变量编码,第一设备将目标音频信号发送至第二设备后,由第二设备对目标音频信号进行中间变量解码、第二渲染处理以及播放。
在一些实施例中,单声像场景例如可以是基于对象信号采集声音,此时一个对象对应一个声像,一个对象对应一个声道。在单声像场景下由于声道数较少,其解码和渲染的方案较为简单,优选的,此时可以采用第二处理模式。
在一些实施例中,多声像场景可以是声像数量大于3的场景,多声像场景例如可以是基于声道信号采集声音,此时一个声像可以对应多个声道。多声像场景下由于其声道数较多,所以其解码和渲染方案相对复杂,优选的,此时可以选择采用第一处理模式。
在一些实施例中,对于拥有较少声像的多声像场景,例如声像数量为2或者3,如采用MASA格式采集声音时,其解码和渲染复杂度适中,由此可以选择采用第三处理模式。
在一些实施例中,示例地,当渲染精度为低精度时,可以采用第二处理模式,当渲染精度为高精度时,可以采用第一处理模式,当渲染精度为中精度时,可以采用第三处理模式。
在上述实施例中,背景清晰度可以包括纯净背景、嘈杂背景、中等背景等,示例地,可以通过信噪比确定背景清晰度,例如信噪比的值越大时,表示背景清晰度越高,当信噪比的值超过一定阈值时,可以确定当前背景为纯净背景。
示例地,当背景清晰度为纯净背景时,采用的输入声道较少,此时可以采用第二处理模式;当背景清晰度为嘈杂背景时,采用的输入声道数较多,此时可以采用第一处理模式;当背景清晰度为中等背景时,可以采用第三处理模式。
在一些实施例中,第一设备可以基于决策指示信息,确定处理音频信号的目标处理模式,包括自动确定模式和半自动确定模式(或言之非自动确定模式或手动确定模式),下面详细介绍两种模式下第一设备确定目标处理模式的方法:
1、自动确定模式(或言之,第一级处理模式)
在自动确定模式下,第一设备可以自动根据决策指示信息确定目标处理模式。
例如,第一设备可以确定出各个处理模式的决策指示信息,即Y值,从多个Y值中确定出最大的Y值,该最大Y值对应的处理模式即目标处理模式。本公开不限制其他自动确定目标处理模式的方法。
在上述实施例中,目标处理模式可以是第一设备基于决策指示信息直接确定的,即第一设备可以直接确定目标处理模式,例如,当Y小于等于3时,选择第一处理模式,当Y大于3且小于8时,选择第三处理模式,当Y大于等于8时,选择第二处理模式。
2、半自动确定模式(或言之,第二级处理模式、非自动确定模式或手动确定模式):
在半自动确定模式下,第一设备可以接收指示信息,根据指示信息确定目标处理模式,指示信息包括第一设备的用户根据决策指示信息确定的目标处理模式。
例如,第一设备将部分或全部处理模式及其Y值提供给用户,或者也可以第一设备根据Y值选出至少一个候选处理模式提供给用户,用户根据第一设备提供的信息进行决策之后,向第一设备反馈指示信息,该指示信息包括了用户决策出的处理模式,第一设备根据用户的反馈确定目标处理模式。
在上述实施例中,目标处理模式可以是用户手动确定的,例如,第一设备可以根据决策指示信息确定
出至少一种候选处理模式,并向用户展示候选处理模式以及候选处理模式各自对应的决策指示信息,即Y值,用户可以根据推送的信息进行选择,此时可以确定用户选择的处理模式为目标处理模式。
在一些实施例中,根据决策指示信息确定目标处理模式包括:
在决策指示信息满足第一条件时,确定目标处理模式为第一处理模式;
在决策指示信息满足第二条件时,确定目标处理模式为第二处理模式;
在决策指示信息满足第三条件时,确定目标处理模式为第三处理模式。
示例地,第一条件可以是Y指小于或者等于第一阈值,当决策指示信息Y值小于或者等于第一阈值时,可以确定目标处理模式为第一处理模式,当Y值较小时,表示当前解码和渲染的方案相对复杂,此时可以选择第一处理模式,用于满足方案要求。
再例如,第二条件可以是Y指大于或者等于第二阈值,当决策指示信息大于或者等于第二阈值时,可以确定目标处理模式为第二处理模式,当Y值较大时,表示解码和渲染方案相对简单,可以采用第二处理模式在满足方案要求的同时降低时延。
再例如,第三条件可以是Y指大于第一阈值,小于第二阈值,其中第一阈值和第二阈值可以基于实际情况进行指定,对此本公开不予限制。
步骤2103、第一设备以目标处理模式,处理音频信号,得到目标音频信号。
在一些实施例中,以目标处理模式,处理音频信号,以得到目标音频信号包括:
在目标处理模式为第一处理模式时,对音频信号进行码流解码、渲染处理以及立体声编码,得到双耳音频信号,作为目标音频信号;
在目标处理模式为第二处理模式时,对音频信号进行码流解码、下混和码流编码,得到编码音频信号,作为目标音频信号;
在目标处理模式为第三处理模式时,对音频信号进行码流解码、第一渲染处理以及中间变量编码,得到预渲染音频信号,作为目标音频信号。
步骤2104、第一设备将目标音频信号发送至第二设备。
在一些实施例中,可以由第一设备与第二设备共同完成音频信号处理,第一设备可以在完成自身处理的流程后,将处理得到的目标音频信号发送至第二设备。
步骤2105、第二设备以目标处理模式,处理目标音频信号。
在一些实施例中,第二设备以目标处理模式,处理目标音频信号包括:
在目标处理模式为第一处理模式时,对目标音频信号进行立体声解码以及播放;
在目标处理模式为第二处理模式时,对目标音频信号进行码流解码、渲染以及播放;
在目标处理模式为第三处理模式时,对目标音频信号进行中间变量解码、第二渲染处理以及播放。
本公开实施例所涉及的通信方法可以包括步骤2101~步骤2105中的至少一者。例如,步骤2102可以作为独立实施例来实施,步骤2101+2102+2103+2104+2105可以作为独立实施例来实施,但不限于此。
在本实施方式或实施例中,在不矛盾的情况下,各步骤可以独立、任意组合或交换顺序,可选方式或可选例可以任意组合,且可以与其他实施方式或其他实施例的任意步骤之间进行任意组合。
图3是根据本公开实施例示出的一种音频信号处理方法的流程示意图。如图3所示,本公开实施例涉及音频信号处理方法,用于第一设备101,上述方法包括:
步骤3101、基于决策指示信息,确定处理音频信号的目标处理模式。
步骤3101的可选实现方式可以参见图2的步骤2101、步骤2102的可选实现方式及图2的步骤所涉及的实施例中其他关联部分。
步骤3102、以目标处理模式,处理音频信号,得到目标音频信号。
步骤3102的可选实现方式可以参见图2的步骤2103的可选实现方式及图2的步骤所涉及的实施例中其他关联部分。
步骤3103、将目标音频信号发送至第二设备。
步骤3103的可选实现方式可以参见图2的步骤2104的可选实现方式及图2的步骤所涉及的实施例中其他关联部分。
在一些实施例中,第一设备可以将目标音频信号发送至第二设备,但不限于此,第一设备也可以向其
他主体发送目标音频信号。
本公开实施例所涉及的通信方法可以包括步骤3101~步骤3103中的至少一者。例如,步骤3101可以作为独立实施例来实施,步骤3101+3102+3103可以作为独立实施例来实施,但不限于此。
在本实施方式或实施例中,在不矛盾的情况下,各步骤可以独立、任意组合或交换顺序,可选方式或可选例可以任意组合,且可以与其他实施方式或其他实施例的任意步骤之间进行任意组合。
图4是根据本公开实施例示出的音频信号处理方法的流程示意图。如图4所示,本公开实施例涉及音频信号处理方法,用于第二设备102,上述方法包括:
步骤4101、接收目标音频信号。
步骤4101的可选实现方式可以参见图2的步骤2104、图3的步骤3103的可选实现方式及图2、图3的步骤所涉及的实施例中其他关联部分。
在一些实施例中,第一设备接收由第二设备发送的目标音频信号,但不限于此,也可以接收由其他主体发送的目标音频信号。
在一些实施例中,第一设备获取由协议规定的目标音频信号。
在一些实施例中,第一设备从高层(upper layer(s))获取目标音频信号。
在一些实施例中,第一设备进行处理从而得到目标音频信号。
步骤4102、以目标处理模式,处理目标音频信号。
步骤4102的可选实现方式可以参见图2的步骤2105的可选实现方式及图2的步骤所涉及的实施例中其他关联部分。
本公开实施例所涉及的通信方法可以包括步骤4101~步骤4102中的至少一者。例如,步骤4102可以作为独立实施例来实施,步骤4101+4102可以作为独立实施例来实施,但不限于此。
在本实施方式或实施例中,在不矛盾的情况下,各步骤可以独立、任意组合或交换顺序,可选方式或可选例可以任意组合,且可以与其他实施方式或实施例任意组合。
图5是根据本公开实施例示出的音频信号处理方法的流程示意图。如图5所示,本公开实施例涉及音频信号处理方法,用于通信系统,该通信系统包括第一设备、第二设备,上述方法包括:
步骤5101、第一设备基于决策指示信息,确定处理音频信号的目标处理模式。
步骤5101的可选实现方式可以参见图2的步骤2101、步骤2102、图3的步骤3101的可选实现方式及图2、图3的步骤所涉及的实施例中其他关联部分。
步骤5102、第一设备以目标处理模式,处理音频信号,得到目标音频信号。
步骤5102的可选实现方式可以参见图2的步骤2103、图3的步骤3102的可选实现方式及图2、图3的步骤所涉及的实施例中其他关联部分。
步骤5103、第一设备将目标音频信号发送至第二设备。
步骤5103的可选实现方式可以参见图2的步骤2104、图3的步骤3103、图4的步骤4101的可选实现方式及图2、图3、图4的步骤所涉及的实施例中其他关联部分。
步骤5104、第二设备以目标处理模式,处理目标音频信号。
步骤5104的可选实现方式可以参见图2的步骤2105、图4的步骤4102的可选实现方式及图2、图4的步骤所涉及的实施例中其他关联部分。
本公开实施例示出的方法涉及一种终端设备音频信号处理方法。
该方法具体内容如下。
本示例在接收端提供三种音频处理工作模式可供选择:
模式一:终端设备完成解码、渲染以及立体声(stereo)编码,播放设备完成立体声(stereo)解码以及播放。
模式二:终端设备完成解码、(下混)和编码,播放设备完成解码和渲染以及播放。
模式三:终端设备完成解码、预渲染以及中间变量编码,播放设备完成中间变量解码和渲染以及播放。
根据终端设备用户选择的自由度(Degree of Freedom,DOF),声像精度(Image precision),背景清晰度(Ambience fidelity)等信息输出“决策指示信息”,终端设备(自动选择模式)或者用户(手动选择模式)根据“决策指示信息”从三种模式中选择一种模式作为解决方案。
该方法的完整内容如下。
本示例中在接收端根据“决策指示信息”确定解码渲染模式,决策指示信息的判决输入信息和判决依据原则如下:
判决输入信息包括自由度,自由度包括0自由度,3自由度,3+自由度,6自由度。
自由度的大小决定了对解决方案延时的要求,此处所描述的延时是指终端设备和播放设备接收到传感器采集的用户姿态、旋转等信息到输出渲染后的双耳信号之间所需要的时间。通常自由度越大要求解决方案的时延越低,比如6自由度场景下要求尽可能低的时延,从而使得用户能够在获得与自身姿态和旋转信息相匹配音频服务体验。
其中模式一解决方案时延最大,模式二解决方案延时最小,模式三解决方案延时居中。
判决输入信息还包括声像精度,例如声像精度可以划分成:第一维度是:单声像场景和多声像场景,第二维度是:高精度,中精度,低精度。
单声像场景下因为其声道数较少(如,采用基于对象信号采集声音),所以解码和渲染方案相对简单,由此可以首选模式二解决方案。
多声像场景下因为其声道数较多(如,采用基于声道信号(5.1.4)采集声音),所以解码和渲染方案相对复杂,由此可以首选模式一解决方案。
对于拥有较少(如2个或者3个)声像的多声像场景(如,采用MASA格式采集声音),则其解码和渲染复杂度适中,由此可以选择模式三解决方案。
第二维度中,当所需的精度时,如低精度,可以选用模式二解决方案,高精度时可以选用模式一解决方案,中精度时选用模式三解决方案。
判决输入信息还包括背景清晰度,可以划分为:纯净背景,嘈杂背景,中等背景。
纯净背景时采用的输入声道数较少可以选用模式二解决方案,嘈杂背景时采用的输入声道数较多可以选用模式一解决方案,中等背景下可以选用模式三解决方案。
当依据单一参数为决策依据时,所采用的判决原则总结如下:
判决流程图如图6所示,其中决策指示信息为所指定的模式X。
终端设备和播放设备提供的三种可供使用的模式如下:
模式一:终端设备完成对输入的码流信号进行解码、渲染以及立体声(stereo)编码,播放设备完成双
耳信号码流立体声(stereo)解码以及播放。
模式二:终端设备完成解码、(下混)和编码,播放设备完成解码+渲染以及播放。
模式三:终端设备完成解码、预渲染以及中间变量编码,播放设备完成间变量解码和渲染以及播放。
下面通过实施例来具体描述本示例提出的方法。
终端设备中的指示信息决策器的三个参数(自由度,声像精度,背景清晰度)分别设置权重因子,指示信息决策器输出的决策指示信息为权重因子的加和值,然后根据权重因子的加和值选择模式组成模式X解决方案。示例地,其权重可以设置如下。
则最终的权重值为Y=Function(X1,X2,X3);
其中,X1是指自由度参数的参数值,X2是指声像精度参数的参数值,X3是指背景清晰度参数的参数值,Y是指决策指示信息。
示例地,如果Y小于等于3,则选择模式一解决方案;如果Y大3且小于8时,则选择模式三解决方案;如果Y大于等于8,则选择模式二解决方案。
例如,用户当前持有终端设备所处的场景是坐在公益培训教室中面向讲台听培训老师讲述公益培训内容,与此同时给另一端的坐在家中的远端用户打电话来分享公益培训的讲话内容,另一端远端用户的使用需求即是能够清晰听懂培训老师的培训内容,如图7所示,此时远端用户给指示信息决策器的输入为:0自由度,单声像场景的高精度,纯净背景。
此时决策指示信息显示选择模式一解决方案。
综上,本公开的上述示例,可以根据指示信息决策器确定决策指示信息,并根据决策指示信息,终端设备或者用户选择三种模式中的1种模式形成解决方案,实现根据指示信息确定合适的工作模式。
图8a是本公开实施例提出的第一设备101的结构示意图。如图8a所示,第一设备101包括:处理模块8101,用于根据决策指示信息,从多个处理模式中确定目标处理模式;;处理模块还用于以目标处理模式,处理音频信号,以得到目标音频信号;可选地,上述处理模块用于执行以上任一方法中第一设备101执行的处理步骤(例如步骤2101、步骤2102等,但不限于此)中的至少一者,此处不再赘述。其中,多个处理模式为基于第一设备为载体所完成的处理功能不同。
第一设备101还包括:收发模块8102,用于将目标音频信号发送至第二设备;可选地,上述收发模块
用于执行以上任一方法中第一设备101执行的发送和/或接收等步骤(例如步骤2103)中的至少一者,此处不再赘述。
图8b是本公开实施例提出的第二设备102的结构示意图。如图8b所示,第二设备102包括:收发模块8201,用于接收第一设备发送的目标音频信号,目标音频信号为第一设备以目标处理模式处理音频信号得到的,目标处理模式为根据决策指示信息从多个处理模式中确定的;可选地,上述收发模块可以用于执行以上任一方法中第二设备102执行的发送和/或接收等步骤(例如步骤2103)中的至少一者,此处不再赘述。其中,多个处理模式为基于第一设备为载体所完成的处理功能不同。
第二设备102还包括:处理模块8202,用于以目标处理模式,处理目标音频信号;可选地,上述处理模块可以用于执行以上任一方法中第二设备102执行的处理步骤(例如步骤2104)中的至少一者,此处不再赘述。
如图9a所示,通信设备9100包括一个或多个处理器9101。处理器9101可以是通用处理器或者专用处理器等,例如可以是基带处理器或中央处理器。基带处理器可以用于对通信协议以及通信数据进行处理,中央处理器可以用于对通信装置(如,基站、基带芯片,终端设备、终端设备芯片,DU或CU等)进行控制,执行程序,处理程序的数据。处理器9101用于调用指令以使得通信设备9100执行以上任一方法。
在一些实施例中,通信设备9100还包括用于存储指令的一个或多个存储器9102。可选地,全部或部分存储器9102也可以处于通信设备9100之外。
在一些实施例中,通信设备9100还包括一个或多个收发器9103。在通信设备9100包括一个或多个收发器9103时,上述方法中的发送接收等通信步骤由收发器9103执行,其他步骤由处理器9101执行。
在一些实施例中,收发器可以包括接收器和发送器,接收器和发送器可以是分离的,也可以集成在一起。可选地,收发器、收发单元、收发机、收发电路等术语可以相互替换,发送器、发送单元、发送机、发送电路等术语可以相互替换,接收器、接收单元、接收机、接收电路等术语可以相互替换。
可选地,通信设备9100还包括一个或多个接口电路9104,接口电路9104与存储器9102连接,接口电路9104可用于从存储器9102或其他装置接收信号,可用于向存储器9102或其他装置发送信号。例如,接口电路9104可读取存储器9102中存储的指令,并将该指令发送给处理器9101。
以上实施例描述中的通信设备9100可以是网络设备或者终端,但本公开中描述的通信设备9100的范围并不限于此,通信设备9100的结构可以不受图9a的限制。通信设备可以是独立的设备或者可以是较大设备的一部分。例如通信设备可以是:1)独立的集成电路IC,或芯片,或,芯片系统或子系统;(2)具有一个或多个IC的集合,可选地,上述IC集合也可以包括用于存储数据,程序的存储部件;(3)ASIC,例如调制解调器(Modem);(4)可嵌入在其他设备内的模块;(5)接收机、终端设备、智能终端设备、蜂窝电话、无线设备、手持机、移动单元、车载设备、网络设备、云设备、人工智能设备等等;(6)其他等等。
图9b是本公开实施例提出的芯片9200的结构示意图。对于通信设备9100可以是芯片或芯片系统的情况,可以参见图9b所示的芯片9200的结构示意图,但不限于此。
芯片9200包括一个或多个处理器9201,处理器9201用于调用指令以使得芯片9200执行以上任一方法。
在一些实施例中,芯片9200还包括一个或多个接口电路9202,接口电路9202与存储器9203连接,接口电路9202可以用于从存储器9203或其他装置接收信号,接口电路9202可用于向存储器9203或其他装置发送信号。例如,接口电路9202可读取存储器9203中存储的指令,并将该指令发送给处理器9201。可选地,接口电路、接口、收发管脚、收发器等术语可以相互替换。
在一些实施例中,芯片9200还包括用于存储指令的一个或多个存储器9203。可选地,全部或部分存储器9203可以处于芯片9200之外。
本公开还提出存储介质,上述存储介质上存储有指令,当上述指令在通信设备9100上运行时,使得通信设备9100执行以上任一方法。可选地,上述存储介质是电子存储介质。可选地,上述存储介质是计算机可读存储介质,但不限于此,其也可以是其他装置可读的存储介质。可选地,上述存储介质可以是非暂时性(non-transitory)存储介质,但不限于此,其也可以是暂时性存储介质。
本公开还提出程序产品,上述程序产品被通信设备9100执行时,使得通信设备9100执行以上任一方
法。可选地,上述程序产品是计算机程序产品。
本公开还提出计算机程序,当其在计算机上运行时,使得计算机执行以上任一方法。
在上述实施例中,可以全部或部分地通过软件、硬件、固件或者其任意组合来实现。当使用软件实现时,可以全部或部分地以计算机程序产品的形式实现。所述计算机程序产品包括一个或多个计算机程序。在计算机上加载和执行所述计算机程序时,全部或部分地产生按照本公开实施例所述的流程或功能。所述计算机可以是通用计算机、专用计算机、计算机网络、或者其他可编程装置。所述计算机程序可以存储在计算机可读存储介质中,或者从一个计算机可读存储介质向另一个计算机可读存储介质传输,例如,所述计算机程序可以从一个网站站点、计算机、服务器或数据中心通过有线(例如同轴电缆、光纤、数字用户线(digital subscriber line,DSL))或无线(例如红外、无线、微波等)方式向另一个网站站点、计算机、服务器或数据中心进行传输。所述计算机可读存储介质可以是计算机能够存取的任何可用介质或者是包含一个或多个可用介质集成的服务器、数据中心等数据存储设备。所述可用介质可以是磁性介质(例如,软盘、硬盘、磁带)、光介质(例如,高密度数字视频光盘(digital video disc,DVD))、或者半导体介质(例如,固态硬盘(solid state disk,SSD))等。
本公开中各表所示的对应关系可以被配置,也可以是预定义的。各表中的信息的取值仅仅是举例,可以配置为其他值,本公开并不限定。在配置信息与各参数的对应关系时,并不一定要求必须配置各表中示意出的所有对应关系。例如,本公开中的表格中,某些行示出的对应关系也可以不配置。又例如,可以基于上述表格做适当的变形调整,例如,拆分,合并等等。上述各表中标题示出参数的名称也可以采用通信装置可理解的其他名称,其参数的取值或表示方式也可以通信装置可理解的其他取值或表示方式。上述各表在实现时,也可以采用其他的数据结构,例如可以采用数组、队列、容器、栈、线性表、指针、链表、树、图、结构体、类、堆、散列表或哈希表等。
本公开中的预定义可以理解为定义、预先定义、存储、预存储、预协商、预配置、固化、或预烧制。
本领域普通技术人员可以意识到,结合本文中所公开的实施例描述的各示例的单元及算法步骤,能够以电子硬件、或者计算机软件和电子硬件的结合来实现。这些功能究竟以硬件还是软件方式来执行,取决于技术方案的特定应用和设计约束条件。专业技术人员可以对每个特定的应用来使用不同方法来实现所描述的功能,但是这种实现不应认为超出本公开的范围。
所属领域的技术人员可以清楚地了解到,为描述的方便和简洁,上述描述的系统、装置和单元的具体工作过程,可以参考前述方法实施例中的对应过程,在此不再赘述。
以上所述,仅为本公开的具体实施方式,但本公开的保护范围并不局限于此,任何熟悉本技术领域的技术人员在本公开揭露的技术范围内,可轻易想到变化或替换,都应涵盖在本公开的保护范围之内。因此,本公开的保护范围应以所述权利要求的保护范围为准。
Claims (20)
- 一种音频信号处理方法,其特征在于,所述方法由第一设备执行,所述方法包括:根据决策指示信息,从多个处理模式中确定目标处理模式;以所述目标处理模式,处理所述音频信号,以得到目标音频信号;将所述目标音频信号发送至第二设备;所述多个处理模式为基于所述第一设备为载体所完成的处理功能不同。
- 根据权利要求1所述的方法,其特征在于,所述方法还包括:基于第一信息,确定所述决策指示信息,所述第一信息用于表示所述音频信号的时延要求、精度特性、收听者自由度特性中的至少一项。
- 根据权利要求2所述的方法,其特征在于,所述第一信息包括以下至少一项:第一参数,所述第一参数用于标识自由度,所述自由度为所述第一设备和/或所述第二设备所配置的传感器接收到的收听者位置移动和/或姿态变化的信息;第二参数,所述第二参数用于标识声像场景和/或渲染精度,所述声像场景为所述音频信号所包括的声像数,所述渲染精度为对所述音频信号进行渲染处理所需的精度;第三参数,所述第三参数用于标识所述音频信号的背景清晰度;第四参数,所述第四参数用于标识时延,所述时延为所述第二设备向所述第一设备发送所述第一参数到所述第二设备接收到所述第一设备发送的所述目标音频信号之间的时间。
- 根据权利要求1至3中任一项所述的方法,其特征在于,所述目标处理模式包括以下至少一项:第一处理模式,所述第一处理模式为所述第一设备对所述音频信号进行码流解码、渲染处理以及立体声编码,所述第一设备将所述目标音频信号发送至所述第二设备后,由所述第二设备对所述目标音频信号进行立体声解码以及播放;第二处理模式,所述第二处理模式为所述第一设备对所述音频信号进行码流解码、下混和/或格式转换,和码流编码,所述第一设备将所述目标音频信号发送至所述第二设备后,由所述第二设备对所述目标音频信号进行码流解码、渲染以及播放;第三处理模式,所述第三处理模式为所述第一设备对所述音频信号进行码流解码、第一渲染处理以及中间变量编码,所述第一设备将所述目标音频信号发送至所述第二设备后,由所述第二设备对所述目标音频信号进行中间变量解码、第二渲染处理以及播放。
- 根据权利要求1至4中任一项所述的方法,其特征在于,所述根据决策指示信息,确定目标处理模式包括:将所述决策指示信息满足预设条件的处理模式,确定为所述目标处理模式;或者,接收指示信息,根据所述指示信息确定所述目标处理模式,所述指示信息包括所述第一设备的用户根据所述决策指示信息确定的所述目标处理模式。
- 根据权利要求5所述的方法,其特征在于,所述将所述决策指示信息满足预设条件的处理模式,确定为所述目标处理模式包括:在所述决策指示信息满足第一条件时,确定所述目标处理模式为第一处理模式;在所述决策指示信息满足第二条件时,确定所述目标处理模式为第二处理模式;在所述决策指示信息满足第三条件时,确定所述目标处理模式为第三处理模式。
- 根据权利要求2至5中任一项所述的方法,其特征在于,所述基于第一信息,确定所述决策指示信息包括:在所述第一信息中的第一参数指示自由度为0和/或第四参数指示时延为低时延时,确定所述第一参数为第一预设值;在所述第一参数指示自由度为大于等于3小于6和/或所述第四参数指示时延为中时延时,确定所述第一参数为第二预设值;在所述第一参数指示自由度为6和/或所述第四参数指示时延为高时延时,确定所述第一参数值为第三预设值;在所述第一信息中的第二参数指示声像场景为单声像场景且渲染精度为高精度时,确定所述第二参数为第四预设值;在所述第二参数指示声像场景为单声像场景且渲染精度为中精度时,确定所述第二参数为第五预设值;在所述第二参数指示声像场景为单声像场景且渲染精度为低精度时,确定所述第二参数为第 六预设值;在所述第二参数指示声像场景为多声像场景且渲染精度为高精度时,确定所述第二参数为第七预设值;在所述第二参数指示声像场景为多声像场景且渲染精度为中精度时,确定所述第二参数为第八预设值;在所述第二参数指示声像场景为多声像场景且渲染精度为低精度时,确定所述第二参数为第九预设值;在所述第一信息中的第三参数指示背景清晰度为纯净背景时,确定所述第三参数为第十预设值;在所述第三参数指示背景清晰度为嘈杂背景时,确定所述第三参数为第十一预设值;在所述第三参数指示背景清晰度为中等背景时,确定所述第三参数为第十二预设值;基于预设函数,以所述第一参数、所述第二参数、所述第三参数为自变量,确定所述预设函数的函数值作为所述决策指示信息。
- 根据权利要求7所述的方法,其特征在于,所述基于预设函数,以所述第一参数、所述第二参数、所述第三参数为自变量,确定所述预设函数的函数值作为所述决策指示信息包括:对所述第一参数、所述第二参数、所述第三参数分别设置权重因子;对所述第一参数、所述第二参数、所述第三参数与所述权重因子进行加权求和,得到所述决策指示信息。
- 根据权利要求1至8中任一项所述的方法,其特征在于,所述以所述目标处理模式,处理所述音频信号,以得到目标音频信号包括:在所述目标处理模式为第一处理模式时,对所述音频信号进行码流解码、渲染处理以及立体声编码,得到双耳音频信号,作为所述目标音频信号;在所述目标处理模式为第二处理模式时,对所述音频信号进行码流解码、下混和码流编码,得到编码音频信号,作为所述目标音频信号;在所述目标处理模式为第三处理模式时,对所述音频信号进行码流解码、第一渲染处理以及中间变量编码,得到预渲染音频信号,作为所述目标音频信号。
- 一种音频信号处理方法,其特征在于,所述方法由第二设备执行,所述方法包括:接收第一设备发送的目标音频信号,所述目标音频信号为所述第一设备以目标处理模式处理音频信号得到的,所述目标处理模式为根据决策指示信息从多个处理模式中确定的;以所述目标处理模式,处理所述目标音频信号;所述多个处理模式为基于所述第一设备为载体所完成的处理功能不同。
- 根据权利要求10所述的方法,其特征在于,所述第一信息包括以下至少一项:第一参数,所述第一参数用于标识自由度,所述自由度为所述第一设备和/或所述第二设备所配置的传感器接收到的收听者位置移动和/或姿态变化的信息;第二参数,所述第二参数用于标识声像场景和/或渲染精度,所述声像场景为所述音频信号所包括的声像数,所述渲染精度为对所述音频信号进行渲染处理所需的精度;第三参数,所述第三参数用于标识所述音频信号的背景清晰度;第四参数,所述第四参数用于标识时延,所述时延为所述第一设备从所述第二设备接收所述第一参数到所述第一设备向所述第二设备发送所述目标音频信号之间的时间。
- 根据权利要求10或11所述的方法,其特征在于,所述目标处理模式包括以下至少一项:第一处理模式,所述第一处理模式为所述第一设备对所述音频信号进行码流解码、渲染处理以及立体声编码,所述第一设备将所述目标音频信号发送至所述第二设备后,由所述第二设备对所述目标音频信号进行立体声解码以及播放;第二处理模式,所述第二处理模式为所述第一设备对所述音频信号进行码流解码、下混或格式转换,和码流编码,所述第一设备将所述目标音频信号发送至所述第二设备后,由所述第二设备对所述目标音频信号进行码流解码、渲染以及播放;第三处理模式,所述第三处理模式为所述第一设备对所述音频信号进行码流解码、第一渲染处理以及中间变量编码,所述第一设备将所述目标音频信号发送至所述第二设备后,由所述第二设备对所述目标音频信号进行中间变量解码、第二渲染处理以及播放。
- 根据权利要求10至12中任一项所述的方法,其特征在于,在所述决策指示信息满足第一条件时,所述目标处理模式为第一处理模式;在所述决策指示信息满足第二条件时,所述目标处理模式为第二处理模式;在所述决策指示信息满足第三条件时,所述目标处理模式为第三处理模式,所述决策指示信息为基于所述第一信息确定的。
- 根据权利要求13所述的方法,其特征在于,所述决策指示信息为预设函数的函数值,所述预设函数的自变量为所述第一信息中的第一参数、第二参数、第三参数,其中,在所述第一参数指示自由度为0和/或所述第四参数指示时延为低时延时,所述第一参数为第一预设值;在所述第一参数指示自由度为大于等于3小于6和/或所述第四参数指示时延为中时延时,所述第一参数为第二预设值;在所述第一参数指示自由度为6和/或所述第四参数指示时延为高时延时,所述第一参数值为第三预设值;在所述第二参数指示声像场景为单声像场景且渲染精度为高精度时,所述第二参数为第四预设值;在所述第二参数指示声像场景为单声像场景且渲染精度为中精度时,所述第二参数为第五预设值;在所述第二参数指示声像场景为单声像场景且渲染精度为低精度时,所述第二参数为第六预设值;在所述第二参数指示声像场景为多声像场景且渲染精度为高精度时,所述第二参数为第七预设值;在所述第二参数指示声像场景为多声像场景且渲染精度为中精度时,所述第二参数为第八预设值;在所述第二参数指示声像场景为多声像场景且渲染精度为低精度时,所述第二参数为第九预设值;在所述第三参数指示背景清晰度为纯净背景时,所述第三参数为第十预设值;在所述第三参数指示背景清晰度为嘈杂背景时,所述第三参数为第十一预设值;在所述第三参数指示背景清晰度为中等背景时,所述第三参数为第十二预设值。
- 根据权利要求10至14中任一项所述的方法,其特征在于,所述以所述目标处理模式,处理所述目标音频信号包括:在所述目标处理模式为第一处理模式时,对所述目标音频信号进行立体声解码以及播放;在所述目标处理模式为第二处理模式时,对所述目标音频信号进行码流解码、渲染以及播放;在所述目标处理模式为第三处理模式时,对所述目标音频信号进行中间变量解码、第二渲染处理以及播放。
- 一种第一设备,其特征在于,包括:处理模块,用于根据决策指示信息,从多个处理模式中确定目标处理模式;所述处理模块还用于以所述目标处理模式,处理所述音频信号,以得到目标音频信号;收发模块,用于将所述目标音频信号发送至第二设备;所述多个处理模式为基于所述第一设备为载体所完成的处理功能不同。
- 一种第二设备,其特征在于,包括:收发模块,用于接收第一设备发送的目标音频信号,所述目标音频信号为所述第一设备以目标处理模式处理音频信号得到的,所述目标处理模式为根据决策指示信息,从多个处理模式中确定的;处理模块,用于以所述目标处理模式,处理所述目标音频信号;所述多个处理模式为基于所述第一设备为载体所完成的处理功能不同。
- 一种通信设备,其中,包括:收发器;存储器;处理器,分别与所述收发器及所述存储器连接,配置为通过执行所述存储器上的计算机可执行指令,控制所述收发器的无线信号收发,并能够实现权利要求1-15中任一项所述的方法。
- 一种计算机存储介质,其中,所述计算机存储介质存储有计算机可执行指令;所述计算机可执行指令被处理器执行后,能够实现权利要求1-15中任一项所述的方法。
- 一种通信系统,其特征在于,包括第一设备和第二设备,所述第一设备用于执行如权利要求1-9中任一项所述的方法,所述第二设备用于执行如权利要求10-15中任一项所述的方法。
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| PCT/CN2024/083889 WO2025199759A1 (zh) | 2024-03-26 | 2024-03-26 | 一种音频信号处理方法、装置及存储介质 |
| CN202480000826.XA CN118435625A (zh) | 2024-03-26 | 2024-03-26 | 一种音频信号处理方法、装置及存储介质 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| PCT/CN2024/083889 WO2025199759A1 (zh) | 2024-03-26 | 2024-03-26 | 一种音频信号处理方法、装置及存储介质 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| WO2025199759A1 true WO2025199759A1 (zh) | 2025-10-02 |
Family
ID=92307503
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| PCT/CN2024/083889 Pending WO2025199759A1 (zh) | 2024-03-26 | 2024-03-26 | 一种音频信号处理方法、装置及存储介质 |
Country Status (2)
| Country | Link |
|---|---|
| CN (1) | CN118435625A (zh) |
| WO (1) | WO2025199759A1 (zh) |
Citations (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20220028172A1 (en) * | 2020-07-23 | 2022-01-27 | Samsung Electronics Co., Ltd. | Method and apparatus for transmitting 3d xr media data |
| CN114067810A (zh) * | 2020-07-31 | 2022-02-18 | 华为技术有限公司 | 音频信号渲染方法和装置 |
| CN115701777A (zh) * | 2021-06-02 | 2023-02-10 | 腾讯美国有限责任公司 | 自适应音频传输和渲染 |
| US20230090246A1 (en) * | 2021-09-17 | 2023-03-23 | Nokia Technologies Oy | Method and Apparatus for Communication Audio Handling in Immersive Audio Scene Rendering |
| CN116830600A (zh) * | 2023-04-10 | 2023-09-29 | 北京小米移动软件有限公司 | 音频信号处理方法及装置 |
| CN117411944A (zh) * | 2022-07-06 | 2024-01-16 | 华为技术有限公司 | Xr对象渲染的方法、通信装置及系统 |
Family Cites Families (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US12236959B2 (en) * | 2021-05-27 | 2025-02-25 | Qualcomm Incorporated | Audio encoding based on link data |
| WO2022268733A1 (en) * | 2021-06-21 | 2022-12-29 | Sound Dimension Ab | Method and system for reproducing sound |
| EP4578190A4 (en) * | 2022-08-26 | 2026-02-25 | Qualcomm Inc | DELAY OPTIMIZATION FOR MULTIPLE AUDIO STREAMS |
-
2024
- 2024-03-26 CN CN202480000826.XA patent/CN118435625A/zh active Pending
- 2024-03-26 WO PCT/CN2024/083889 patent/WO2025199759A1/zh active Pending
Patent Citations (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20220028172A1 (en) * | 2020-07-23 | 2022-01-27 | Samsung Electronics Co., Ltd. | Method and apparatus for transmitting 3d xr media data |
| CN114067810A (zh) * | 2020-07-31 | 2022-02-18 | 华为技术有限公司 | 音频信号渲染方法和装置 |
| CN115701777A (zh) * | 2021-06-02 | 2023-02-10 | 腾讯美国有限责任公司 | 自适应音频传输和渲染 |
| US20230090246A1 (en) * | 2021-09-17 | 2023-03-23 | Nokia Technologies Oy | Method and Apparatus for Communication Audio Handling in Immersive Audio Scene Rendering |
| CN117411944A (zh) * | 2022-07-06 | 2024-01-16 | 华为技术有限公司 | Xr对象渲染的方法、通信装置及系统 |
| CN116830600A (zh) * | 2023-04-10 | 2023-09-29 | 北京小米移动软件有限公司 | 音频信号处理方法及装置 |
Also Published As
| Publication number | Publication date |
|---|---|
| CN118435625A (zh) | 2024-08-02 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN115552518B (zh) | 一种信号编解码方法、装置、用户设备、网络侧设备及存储介质 | |
| KR20230027295A (ko) | 오디오 인코딩 방법 및 코딩 디바이스 | |
| WO2024164284A1 (zh) | 一种音频信号处理、装置、设备及存储介质 | |
| KR20150026405A (ko) | 음성 패킷 송수신 방법 및 이를 구현하는 전자 장치 | |
| WO2025194348A1 (zh) | 模型训练方法、终端设备及网络设备 | |
| CN119946705A (zh) | 数据传输方法及通信装置 | |
| WO2025076828A1 (zh) | 音频信号处理方法及装置、通信设备、通信系统、存储介质 | |
| CN118435625A (zh) | 一种音频信号处理方法、装置及存储介质 | |
| WO2025091515A1 (zh) | 侧行链路通信方法及装置 | |
| WO2024061093A1 (zh) | 一种上行预编码的指示方法及通信装置 | |
| CN105872732A (zh) | 音视频播放系统中音源设备的接入方法、装置及播放设备 | |
| WO2026060718A1 (zh) | 解码、编码方法及通信设备和存储介质 | |
| WO2018170863A1 (zh) | 一种波束避让方法及基站 | |
| WO2025091294A1 (zh) | 编解码方法、终端、网络设备以及存储介质 | |
| WO2026076720A1 (zh) | 语义通信方法、通信设备、通信系统及存储介质 | |
| WO2025236192A1 (zh) | 信号传输方法及装置、存储介质 | |
| WO2026050946A1 (zh) | 语义通信方法及装置、存储介质 | |
| CN120034977A (zh) | 信息确定、传输方法、装置及通信设备 | |
| WO2024197541A1 (zh) | 一种量化编码方法、装置、设备及存储介质 | |
| WO2026065061A1 (zh) | 通信方法、第一设备、第二设备、通信系统及存储介质 | |
| WO2026025375A1 (zh) | 确定资源的方法及终端、网络设备、系统和存储介质 | |
| WO2026044757A1 (zh) | 语义通信方法及装置、存储介质 | |
| WO2026016179A1 (zh) | 处理方法、设备及存储介质 | |
| WO2025015478A1 (zh) | 信号处理方法及其装置 | |
| WO2025054767A1 (zh) | 通信切换方法、终端、网络设备以及存储介质 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| 121 | Ep: the epo has been informed by wipo that ep was designated in this application |
Ref document number: 24931753 Country of ref document: EP Kind code of ref document: A1 |