EP4639494A1 - Système de détection d'objets dans des trames de données radar utilisant un réseau de neurones convolutionnel récurrent - Google Patents

Système de détection d'objets dans des trames de données radar utilisant un réseau de neurones convolutionnel récurrent

Info

Publication number
EP4639494A1
EP4639494A1 EP23841024.5A EP23841024A EP4639494A1 EP 4639494 A1 EP4639494 A1 EP 4639494A1 EP 23841024 A EP23841024 A EP 23841024A EP 4639494 A1 EP4639494 A1 EP 4639494A1
Authority
EP
European Patent Office
Prior art keywords
encoder
stage
scene
network
decoder
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP23841024.5A
Other languages
German (de)
English (en)
Inventor
Colin DECOURT
Ruffin VAN RULLEN
Thomas OBERLIN
Didier Salle
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Centre National de la Recherche Scientifique CNRS
Institut Superieur de lAeronautique et de lEspace
Universite de Toulouse
Original Assignee
Centre National de la Recherche Scientifique CNRS
Universite Toulouse III Paul Sabatier
Institut Superieur de lAeronautique et de lEspace
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Centre National de la Recherche Scientifique CNRS, Universite Toulouse III Paul Sabatier, Institut Superieur de lAeronautique et de lEspace filed Critical Centre National de la Recherche Scientifique CNRS
Publication of EP4639494A1 publication Critical patent/EP4639494A1/fr
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V20/00Scenes; Scene-specific elements
    • G06V20/50Context or environment of the image
    • G06V20/56Context or environment of the image exterior to a vehicle by using sensors mounted on the vehicle
    • G06V20/58Recognition of moving objects or obstacles, e.g. vehicles or pedestrians; Recognition of traffic objects, e.g. traffic signs, traffic lights or roads
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/82Arrangements for image or video recognition or understanding using pattern recognition or machine learning using neural networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V20/00Scenes; Scene-specific elements
    • G06V20/70Labelling scene content, e.g. deriving syntactic or semantic representations

Definitions

  • the present invention generally relates to the field of radar detection as well as that of recurrent convolutional neural networks. It finds particular application in automobile driving assistance devices and even in autonomous driving systems.
  • ADAS Advanced Driver Assistance System
  • ADAS systems typically use different types of sensors such as cameras, lidars, and on-vehicle radars.
  • Cameras provide rich semantic information about the vehicle's environment and lidars provide a high-resolution representation of the objects present in this environment.
  • lidars are sensitive to bad weather conditions (fog, rain, snow) as well as poor light conditions (darkness) which can alter perception of the environment.
  • radars can overcome these conditions due to the millimeter electromagnetic wavelength range in which they operate, the radar beam being able to pass through drops of rain or fog.
  • Radar detection devices can accurately calculate distances to obstacles as well as their speeds.
  • the use of 1D or 2D antenna arrays also makes it possible to determine the direction of arrival of the reflected signal and therefore the angle at which an obstacle is seen from the vehicle.
  • radar systems do not provide raw data (which would typically be power spectra representing the environment in distance and angle or in distance and speed) but directly carry out additional signal processing steps themselves. applied to power spectra in order to detect target potentials. These additional steps are for example adaptive thresholding operations (CFAR), calculations of distance, angle of arrival, relative speed (Doppler speed), for target potentials and/or target tracking.
  • CFAR adaptive thresholding operations
  • Doppler speed relative speed
  • Radar systems can thus generate a list of targets (each target being associated for example with a cloud of points) and associate with each of them low-level information such as its position, its azimuth, its relative speed, its section effective radar or SER.
  • these target lists do not include classification information (pedestrian, obstacle, vehicle for example) and are therefore difficult to use for the purposes of driving assistance.
  • the radars used in the field of driving assistance or autonomous driving are generally of the FMCW (Frequency Modulated Continuous Wave) type. It is recalled that this type of radar emits chirps with a repetition period P, a chirp, 110, being a wave function linearly modulated in frequency, as shown in Fig. 1.
  • the received signal is mixed at 120 with the transmitted signal, subjected to low-pass filtering, 130, before being converted to digital at 140 and subject to an FFT at 150.
  • FFT can be performed with a short time step (fast time FFT or range FFT), 151, corresponding to a sampling frequency of the chirp, to carry out a distance analysis (range spectrum), and for each distance, with a long time step corresponds the period of recurrence T (slow time FFT) to carry out a speed analysis (range-Doppler spectrum), 152.
  • fast time FFT or range FFT range FFT
  • range-Doppler spectrum range-Doppler spectrum
  • the radar data output from FFT can be subject to post-processing, 160, to provide target lists, 170.
  • object detection is often non-causal, in other words it is necessary to acquire frames after the occurrence of an event to be able to detect this event.
  • These constraints do not allow real-time detection in an embedded system.
  • the real-time nature of detection is a determining criterion in driver assistance systems or autonomous driving systems.
  • the object of the present invention is therefore to propose a system for detecting objects in a scene, from radar data frames of this scene, by means of an artificial neural network, which does not present the disadvantages mentioned in particular which does not require storing a plurality of successive frames, which is causal and allows detection of objects in real time.
  • This system is a system for detecting objects in a scene from radar data frames of this scene, said frames succeeding one another temporally, said radar data frames giving two pieces of information, or three pieces of information, among distance information, d angle of arrival and Doppler velocity, characterized in that said system comprises at least one spatio-temporal encoder and at least one decoder, the spatio-temporal encoder being intended receiving said frames and comprising a plurality of cascaded stages, each stage comprising a convolutional neural network, CNN, and a recurrent neural network, RNN, arranged in series, the encoder being configured to provide, depending on its internal state , and with each new data frame r k received at a time k, a set F k of spatial characteristics and to update its internal state according to this new frame, said internal state being formed by the internal states of the RNN networks stages of the encoder, the decoder using the set F k of spatial characteristics at time k, as well as optionally the internal state updated by the encoder, H k
  • the frames received by the spatio-temporal encoder(s) can be of different types.
  • These radar data frames are typically obtained by projection of a radar measurement tensor into a 2-dimensional space or constitute 3-dimensional tensors.
  • the radar data frames give (in particular, only give) two pieces of information, or three pieces of information, among distance, angle of arrival and Doppler speed information.
  • the output information may include one or more elementary pieces of information, which are of different types.
  • the output information is very simple, and includes for example only one or more binary information, and/or one or more information in the form of digital quantities (real numbers).
  • the output information can indicate, for example, whether a moving object has been detected in the scene (binary information), and possibly the distance at which the detected object is located (information in the form of a digital quantity).
  • the output information includes at least one map, in particular a map giving a probability of presence of objects at each point of the scene.
  • the output information includes a map constituting a semantic segmentation of the scene in the form of an image and giving for each pixel of the image a class to which it belongs, among a plurality of possible classes.
  • the convolutional network of a stage or of each stage of the cascade of stages of the encoder is a network with separable convolutions, for example an Inverted Residual Bottleneck type network.
  • a separable convolution network is a network comprising at least one convolutional layer in which the convolution operations are of the 'depthwise separable convolutions' type, in which the convolution operations in the depth direction ('depthwise convolution') are carried out separately from the convolution operations following lateral directions ('pointwise convolution').
  • the recurrent network of a stage or of each stage of the cascade of stages of the encoder is a network with separable convolutions, for example a ConvLSTM network, in particular a Bottleneck LSTM type network.
  • the encoder comprises, downstream of the cascade of stages, a final stage consisting of a convolutional network with separable convolutions, for example an Inverted Residual Bottleneck type network.
  • the decoder includes a plurality of cascaded stages, with each stage of the decoder configured to perform a transpose convolution.
  • the transmission of certain information from the encoder to the decoder also makes it possible to improve the performance of the network.
  • At least one stage of the decoder receives, via a jump-layer connection, a spatial characteristic provided by a corresponding stage of the encoder as well as optionally the internal state of the recurrent neural network belonging to this floor.
  • the object detection system is configured to best exploit the information acquired by the radar.
  • the object detection system comprises a plurality of encoders, each encoder being intended to receive frames of radar data obtained by projection of a radar measurement tensor (T RAD ) onto a distinct space of dimension 2, each encoder being configured to provide, according to its internal state, and with each new data frame r k received at a time k, a set of spatial characteristics and to update its internal state according to this new weft; and said at least one decoder being configured to use said set of spatial characteristics at time k, as well as optionally the internal states updated by said encoders to provide the output information.
  • T RAD radar measurement tensor
  • At least one stage of the decoder receives, via a jump-layer connection, a composite spatial characteristic resulting from the concatenation of spatial characteristics provided by corresponding stages of the same rank of the different encoders as well as optionally a composite internal state obtained from internal states recurrent neural networks belonging to the corresponding stages of the same rank of the different encoders.
  • FIG. 1 already described schematically represents a radar system known from the state of the art capable of generating radar data frames
  • FIG. 2 schematically represents the progress over time of the operation of a recurrent and convolutional neural network equipping an object detection system according to one embodiment of the invention
  • FIG. 3 schematically represents the encoder-decoder architecture of an object detection system according to a first embodiment of the invention
  • FIG. 4A illustrates a learning phase of a recurrent and convolutional neural network according to an example of the first embodiment of the invention
  • FIG. 4B illustrates an inference phase of a recurrent and convolutional neural network according to an example of the first embodiment of the invention
  • FIG. 5 schematically represents the architecture of an object detection system according to an example of the first embodiment of the invention
  • FIG. 6 schematically represents the encoder-decoder architecture of an object detection system according to a second embodiment of the invention
  • FIG. 7 schematically represents a jump-layer connection between the encoder and the decoder of the object detection system of FIG. 6.
  • raw radar data frames also called in the following more simply radar data frames (or radar spectra)
  • the measurement tensor could be a RAD (distance, angle, Doppler speed) tensor defined above and the radar data frames can be RD (distance, Doppler speed), AD (angle, Doppler speed) or RA frames. (distance, angle).
  • the raw radar data may be provided by a frequency modulated continuous wave (FMCW) radar as described in the introductory part or another type, for example a pulse radar.
  • FMCW frequency modulated continuous wave
  • the detection system is intended to provide, at each recurrence period and for a given scene, output information relating to the objects present in this scene, in particular in the form of mapping.
  • this mapping could be in the form of a confidence map, giving for each point in the scene the probability of the presence of an object, or even a semantic segmentation mask, giving for each pixel of an image representative of the scene, the class to which it belongs among a plurality of available classes.
  • other formats, in particular other types of mapping of the objects present in the scene could be considered by those skilled in the art without departing from the scope of the present invention.
  • the object detection system uses a prediction model, M, comprising a spatio-temporal encoder, E, and a decoder, D.
  • M a spatio-temporal encoder
  • D a decoder
  • R k (r k-N+1 , r k-N+2+i , ⁇ ⁇ , r k ⁇ ) a sequence of N consecutive radar data frames where k is a time step index (by example an RA or RD radar spectrum, the prediction model is broken down as follows:
  • the spatio-temporal encoder, E can be considered as a state machine: it provides, at each instant k, a set F k of spatial features, from the last frame of radar data received r k and of its current internal state, (its memory) and updates its internal state, which translates as: [Math.2]
  • Fig. 2 schematically represents the operation over time of the prediction model.
  • the space-time encoder E receives the radar data frame and, from its internal state H k-2 (its memory), provides the decoder D with a set of spatial characteristics Ffc-i. In addition, it updates its internal state from the radar data frame r fc-x and its current state H k-2 • The updated internal state is also provided to the decoder D. This predicts from the spatial characteristics F k- and the state of the updated encoder, H k-lr a map of the objects present in the scene, P k-1 . The process continues iteratively as shown at the next time, k.
  • the idea underlying the present invention is to combine in the spatio-temporal encoder at least one convolutional neural network or CNN and a recurrent neural network or RNN.
  • the purpose of the convolutional neural network is to extract “spatial” information in radar data frames, the term “spatial” here referring to the variables represented in these frames (e.g. RA, AD, RD for the first layer ) and the recurrent neural network operating on the spatial information thus extracted.
  • the spatio-temporal encoder will be able to present a plurality of CNN and RNN networks alternating in series.
  • a CNN network makes it possible to reduce the dimension of its input so that only a relevant and condensed representation of it is kept, whereas an RNN network makes it possible to jointly manage spatial and temporal information while preserving its state internal memory of past entries.
  • the RNN network makes it possible to analyze the temporal dependence between radar data frames.
  • the encoder-decoder architecture of an object detection system equipped with such a spatio-temporal encoder is shown schematically in Fig. 3.
  • the space-time encoder E comprises [Q > 2 cascaded stage(s), each stage consisting of a CNN network and an RNN network, arranged in series.
  • the state of the spatio-temporal encoder at the given instant is then defined by the respective internal states, at this instant, of the RNN networks of the different stages, in other words:
  • h k , h k , . . . , h are the respective internal states of the RNN networks belonging to the Q stages of the spatio-temporal encoder.
  • CNN neural networks could advantageously be separable convolutional networks.
  • the CNN neural networks could advantageously be chosen of the Inverted Residual Bottleneck type, hereinafter referred to as IR.
  • IR Inverted Residual Bottleneck
  • the use of IR networks makes it possible to reduce the number of parameters compared to a classic CNN network as well as the number of MAC (Mutiple-ACcumulate) operations to the extent that an IT network uses a separable convolution, i.e. -say a convolution which decomposes separately into a depthwise convolution, that is to say on a single channel at a time, and a pointwise convolution, that is to say on all channels at once.
  • RNN neural networks could advantageously be separable convolutional networks.
  • the RNN networks can be chosen of the LSTM (Long Short Term Memory) type and advantageously of the Bottleneck LSTM type.
  • LSTM Long Short Term Memory
  • Bottleneck LSTM A detailed description of such a neural network can be found in the article by M. Liu et al. entitled “Mobile video object detection with temporally-aware feature maps” published in Proc, of the IEEE Conf, on computer vision and pattern recognition, 2018, pp. 5686-5695.
  • a normalization layer could be provided before activation (sigmoid function) at the level of the input, forgetting and output gates. of each LSTM network, the normalization being carried out on all the spatial characteristics.
  • the first layer of the spatio-temporal encoder comprises, as shown in FIG. 3 a classic convolutional neural network to increase the number of channels, each channel corresponding to a block convolution kernel.
  • the CNN-RNN network stages operate on the radar data frames which have previously undergone this block convolution step.
  • the object detection system is sequentially presented with N frames of data input to the spatio-temporal encoder and associated prediction results, that is to say maps of objects actually present in the scene.
  • the model is thus trained to encode a sequence of N data frames to predict at each time t the corresponding mapping, P t , i.e. for the decoder:
  • F t and H t are respectively the set of characteristics provided by the space-time encoder and its internal state after updating at time t.
  • Fig. 4A represents a step of the training phase of an example of an object detection system according to FIG. 3.
  • a block convolutional network is provided upstream of the CNN-RNN stages, and an IR network is arranged downstream of the cascade of CNN-RNN stages.
  • the parameters of the different neural networks IR and RNN are updated after calculating the loss function and backpropagation of the gradient aimed at minimizing the prediction error.
  • the detection system can be used in an inference phase to predict information relating to the objects present in the scene.
  • Fig. 4B represents a step of the inference phase of the previously trained object detection system.
  • Fig. 5 schematically represents the encoder-decoder architecture of an object detection system according to an example of the first embodiment of the present invention.
  • This architecture includes a contraction branch, formed by the spatio-temporal encoder E, and an expansion branch, formed by the decoder D.
  • the RNN network of the first stage, 520 provides, at each instant k, its internal state h k to the decoder, via a first temporal skip connection and, likewise, the RNN network of the second pair, 530 , provides its internal state h k to the decoder, via a second layer-jumping temporal connection.
  • the spatio-temporal encoder E comprises, upstream of the first stage, at least one block convolutional neural network, 510, providing as output blocks of size C x H x W where C is the number of channels (i.e. say the number of convolution kernels and therefore spatio-temporal characteristics), H and W are respectively the height and width of the radar data frames.
  • the spatio-temporal encoder includes, downstream of stage 530, a third and final stage, a CNN network (of the Inverted Residual Bottleneck type), 540.
  • the decoder includes three stages of transposed 2D convolution, 550, 560, 570, followed by a convolution stage, 580, making it possible to obtain the mapping of the objects which is the output information (for example confidence map or semantic segmentation of the scene image).
  • Each stage of the encoder corresponds to a transposed convolution stage of the decoder: stage 550 corresponds to the CNN network 540, stage 560 corresponds to the CNN-RNN stage, 530, and stage 560 corresponds to the CNN stage -RNN, 520.
  • Each stage of the decoder receives the spatial characteristics from the corresponding stage (520,530, 540) of the encoder via a skip-layer connection (skip connection) and, where applicable, the internal state of the RNN belonging to this stage (520,530) via a temporal skip connection or TSC (temporal skip connection).
  • This TSC connection avoids the loss of temporal information along the decoding path.
  • the internal state (h ⁇ ,h ⁇ ) of the RNN belonging to a stage of the encoder is concatenated to the result of the transposed convolution provided by the stage preceding the corresponding stage of the decoder.
  • the internal state of the RNN network of the second stage, 530, of the encoder is concatenated or added to the result of the transposed convolution of the first stage, 550, of the decoder.
  • the internal state of the CNN network of first stage, 520, of the encoder is concatenated or added to the result of the transposed convolution of the second stage, 560 of the decoder.
  • Fig. 6 schematically represents the architecture of an object detection system according to a second embodiment of the present invention.
  • This second embodiment differs from the first in that it makes it possible to detect objects present in the scene using different dimensions of distance, speed and azimuth/angle). This embodiment therefore makes it possible to exploit all of the information present in the radar signal.
  • successive radar frames rk are received at each time interval by a spatio-temporal encoder ERAD.
  • the radar frames rk integrate three pieces of information: distance, speed and angle (R,D,A).
  • These radar frames can for example take the form of a tensor, in which two of the three information of distance, speed and angle (R,D,A) are coded according to the lateral dimensions (height and width) of the tensor, and the third of this information is coded according to the depth dimension (the 'channels') of the tensor.
  • a second variant is illustrated by Figure 6.
  • This variant is distinguished from the first variant in that different views (or projections) of the radar measurement tensor, for example frames RA, RD and AD in the sense defined above are used to detect the objects present in the scene.
  • This variant therefore uses the distance, speed and azimuth/angle dimensions separately two by two, using a plurality of spatio-temporal encoders.
  • the object detection system comprises as many encoders as there are views of the measurement tensor, namely, in the example illustrated three encoders E RA , E RD , E AD each having the structure of the first embodiment. More precisely, each of these encoders comprises the same number Q of stages, each stage consisting of a CNN network in series with an RNN network. At each time k, the spatial characteristics, F ⁇ A , F ⁇ D , F AD from the different encoders are concatenated in a multi-view latent variable space to form a composite spatial characteristic F ⁇ AD , provided to one or more decoders, here the decoders D RA and D RD .
  • each of the decoders D RA , D RD can benefit from temporal information coming not only from the corresponding encoder (E RA , E RD ) but from the three encoders associated with the 3 views of the measurement tensor .
  • the decoder allows D RA to predict the position of objects in the scene in an RA space (distance, azimuth) while the decoder D RD makes it possible to predict the positions of these objects, otherwise representing them in a RD space (distance, speed).
  • Fig. 7 represents in more detail the operation of concatenation of the composite internal states carried out by the TMVSC connection of FIG. 6.
  • the internal states h ⁇ D,q ,h AD,q , h R A,q of the RNN networks forming part of the stages of rank q of the respective encoders E RD ,E AD ,E RA are concatenated, if necessary after a step of undersampling or oversampling allowing their dimensions to be harmonized to C x H x W, resulting in a concatenation result of size 3C x H x V/which is then subject to a 2D convolution lxl (channelwise pooling) making it possible to reduce the number of channels from 3C to C and therefore to use them within the stages of the decoder as in the first embodiment, as a composite internal state.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Multimedia (AREA)
  • Evolutionary Computation (AREA)
  • Artificial Intelligence (AREA)
  • Health & Medical Sciences (AREA)
  • Computational Linguistics (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Computing Systems (AREA)
  • Databases & Information Systems (AREA)
  • General Health & Medical Sciences (AREA)
  • Medical Informatics (AREA)
  • Software Systems (AREA)
  • Image Analysis (AREA)

Abstract

La présente invention concerne un système de détection d'objets dans un scène à partir de trames de données radar de cette scène, lesdites trames se succédant temporellement. Le système de détection d'objets possède une architecture codeur-décodeur, le codeur, E, comprenant un étage ou plusieurs (Q) étages en cascade, chaque étage comprenant un réseau de neurones convolutionnel, CNN, et un réseau de neurones récurrent, RNN, arrangés en série. A chaque nouvelle trame de données reçue, rk, le codeur fournit, en fonction de son état interne courant (sa mémoire), un ensemble Fk de caractéristiques spatiales et met à jour son état interne, ledit état interne étant formé par les états internes des réseaux RNN des étages du codeur. Le décodeur D utilise l'ensemble des caractéristiques spatiales fournies à instant k, Fk, pour fournir une information de sortie relative aux objets présents dans la scène.

Description

Titre : SYSTÈME DE DÉTECTION D'OBJETS DANS DES TRAMES DE DONNÉES RADAR UTILISANT UN RÉSEAU DE NEURONES CONVOLUTIONNEL RÉCURRENT DESCRIPTION
DOMAINE TECHNIQUE
La présente invention concerne de manière générale le domaine de la détection radar ainsi que celui des réseaux de neurones convolutionnels récurrents. Elle trouve notamment application dans les dispositifs d'aide à la conduite automobile voire dans les systèmes de conduite autonome.
ÉTAT DE LA TECHNIQUE ANTÉRIEURE
Les systèmes avancés d'aide à la conduite ou ADAS (Advanced Driver Assistance System) ont connu un essor important ces dernières années. Ces systèmes permettent d'assister le conducteur d'un véhicule automobile dans sa perception de son environnement (obstacles, autres véhicules, piétons etc.) voire de permettre au véhicule de réagir de manière automatique et anticipée par rapport aux réflexes du conducteur.
Les systèmes ADAS utilisent généralement différents types de capteurs tels que des caméras, des lidars et des radars embarqués sur le véhicule. Les caméras fournissent une information sémantique riche de l'environnement du véhicule et les lidars permettent d'obtenir une représentation à haute résolution des objets présents dans cet environnement. Toutefois, les caméras et les lidars sont sensibles aux mauvaises conditions météorologiques (brouillard, pluie, neige) ainsi qu'aux mauvais conditions de luminosité (obscurité) pouvant altérer la perception de l'environnement. A contrario, les radars peuvent s'affranchir de ces conditions en raison de la gamme de longueur d'onde électromagnétique millimétrique dans laquelle ils opèrent, le faisceau radar pouvant traverser les gouttes de pluie ou de brouillard. Les dispositifs de détection radar peuvent calculer avec précision les distances aux obstacles ainsi que leurs vitesses. L'utilisation de réseaux d'antennes 1D ou 2D permet également de déterminer la direction d'arrivée du signal réfléchi et donc l'angle sous lequel un obstacle est vu du véhicule.
En règle générale, les systèmes radar ne fournissent pas des données brutes (qui seraient typiquement des spectres de puissance représentant l'environnement en distance et en angle ou en distance et en vitesse) mais effectuent eux-mêmes directement des étapes de traitements de signal additionnelles appliquées aux spectres de puissance afin de détecter des potentiels cibles. Ces étapes additionnelles sont par exemple des opérations de seuillage adaptatif (CFAR), des calculs de distance, d'angle d'arrivée, de vitesse relative (vitesse Doppler), pour les potentiels cibles et/ou la poursuite de cibles.
Les systèmes radars peuvent ainsi générer une liste de cibles (chaque cible étant associée par exemple à un nuage de points) et associer à chacune d'entre elles une information de bas niveau telle que sa position, son azimut, sa vitesse relative, sa section efficace radar ou SER. Toutefois, ces listes de cibles ne comportent pas d'information de classification (piéton, obstacle, véhicule par ex.) et sont donc difficilement exploitables pour les besoins d'une aide à la conduite. En outre, il est impossible de déterminer si plusieurs points d'un même nuage de points, détectés par un tel système radar appartiennent effectivement à un même objet ou si une cible détectée est effectivement une cible à surveiller et non pas un élément sans importance (par exemple un élément fixe tel qu'un arbre, une interférence, etc.).
Les radars utilisés dans le domaine de l'aide à la conduite ou de la conduite autonome sont généralement de type FMCW (Frequency Modulated Continuous Wave). On rappelle que ce type de radar émet des chirps avec une période de répétition P, un chirp, 110, étant une fonction d'onde modulée linéairement en fréquence, comme représenté Fig. 1. A la réception, le signal reçu est mélangé en 120 avec le signal émis, soumis à un filtrage passe-bas, 130, avant d'être converti en numérique en 140 et de faire l'objet d'une FFT en 150. La FFT peut être réalisée avec un pas temporel court (fast time FFT ou range FFT), 151, correspondant à une fréquence d'échantillonnage du chirp, pour effectuer une analyse en distance (range spectrum), et pour chaque distance, avec un pas temporel long correspond la période de récurrence T (slow time FFT) pour effectuer une analyse en vitesse (range-Doppler spectrum), 152. Lorsque le système radar utilise un réseau d'antennes en émission et en réception, dit encore radar MIMO (Multiple Input Multiple Output) les signaux reçus par les différentes antennes permettent d'obtenir une direction d'arrivée du signal (DoA) en fonction de la distance (rangeangle spectrum), 153. On obtient ainsi un tenseur d'ordre 3 de données radar dites de bas niveau (ou de données radar brutes), ce tenseur dit RAD, pouvant être projeté sur des espaces de dimension 2 (ou vues) pour donner des trames RD (distance, vitesse), RA (distance, angle) ou AD (angle, vitesse), les trames se succédant à la période de récurrence ou à une multiple de celle-ci.
Par ailleurs, comme indiqué précédemment, les données radar en sortie de FFT peuvent faire l'objet d'un post-traitement, 160, pour fournir des listes de cibles, 170.
Différentes approches ont été proposées dans l'état de la technique pour détecter des objets, à partir des données radar brutes (RD, RA, AD, voire RAD), quelquefois encore dénommées pre-CFAR dans la littérature, au moyen de réseaux de neurones profonds. La plupart de ces approches font appel à des réseaux de neurones convolutionnels 2D, opérant sur une seule trame de données (2D CNNs).
Cependant, ces méthodes échouent à correctement détecter des objets similaires (comme des piétons ou des cyclistes). Ainsi, des méthodes utilisant des réseaux de neurones convolutionnels 3D (3D CNNs), opérant sur une pluralité de trames consécutives ont été proposé dans la littérature. Dans ces réseaux, les convolution sont réalisées à la fois sur les dimensions temporelle et spatiales afin de réduire la taille des blocs selon ces dimensions et ne conserver que les informations les plus pertinentes. On trouvera par exemple une description d'un tel réseau de neurones convolutionnels opérant sur les données brutes dans l'article de Y. Wang et al. intitulé « RODNet : a real-time radar object detection network cross-supervised by camera-radar fused object 3D localization » publié dans IEEE Journal of Selected Topics in Signal Processing, Vol. 15, No. 4, pp. 954-967.
Toutefois, ces approches présentent l'inconvénient de nécessiter une mémoire de taille importante pour stocker une pluralité N de trames successives.
En outre, la détection d'objets est souvent non causale, autrement dit il est nécessaire d'acquérir des trames postérieures à la survenance d'un évènement pour pouvoir détecter cet évènement. Ces contraintes n'autorisent pas une détection temps réel dans un système embarqué. Or, le caractère temps réel de la détection est un critère déterminant dans les systèmes d'aide à la conduite ou ceux de conduite autonome.
L'objet de la présente invention est par conséquent de proposer un système de détection d'objets dans une scène, à partir de trames de données radar de cette scène, au moyen d'un réseau de neurones artificiels, qui ne présente pas les inconvénients précités à savoir notamment qui ne nécessite pas de stocker une pluralité de trames successives, qui soit causal et permette une détection d'objets en temps réel.
EXPOSÉ DE L'INVENTION
Pour répondre à l'objectif indiqué ci-dessus, suivant la présente invention le système de détection d'objets suivant est proposé.
Ce système est un système de détection d'objets dans une scène à partir de trames de données radar de cette scène, lesdites trames se succédant temporellement, lesdites trames de données radar donnant deux informations, ou trois informations, parmi des informations de distance, d'angle d'arrivée et de vitesse Doppler, caractérisé en ce que ledit système comprend au moins un codeur spatio-temporel et au moins un décodeur, le codeur spatio-temporel étant destiné à recevoir lesdites trames et comprenant une pluralité d'étages en cascade, chaque étage comprenant un réseau de neurones convolutionnel, CNN, et un réseau de neurones récurrent, RNN, arrangés en série, le codeur étant configuré pourfournir, en fonction de son état interne, et à chaque nouvelle trame de données rk reçue à un instant k, un ensemble Fk de caractéristiques spatiales et à mettre à jour son état interne en fonction de cette nouvelle trame, ledit état interne étant formé par les états internes des réseaux RNN des étages du codeur, le décodeur utilisant l'ensemble Fkdes caractéristiques spatiales à instant k, ainsi optionnellement que l'état interne mis à jour par le codeur, Hk, pour fournir une information de sortie relative aux objets présents dans la scène.
Les trames reçues par le ou les codeur(s) spatio-temporels peuvent être de différents types.
Ces trames de données radar sont typiquement obtenues par projection d'un tenseur de mesures radar dans un espace de dimension 2 ou constituent des tenseurs de dimension 3.
Dans le système de détection d'objets selon la présente divulgation, les trames de données radar donnent (notamment, donnent seulement) deux informations, ou trois informations, parmi des informations de distance, d'angle d'arrivée et de vitesse Doppler.
Par ailleurs, l'information de sortie peut comporter une ou plusieurs informations élémentaires, qui sont de différentes natures.
Ainsi dans certains modes de réalisation, l'information de sortie est très simple, et comporte par exemple seulement une ou plusieurs informations binaires, et/ou une ou plusieurs informations sous forme de grandeurs numériques (nombres réels).
L'information de sortie peut indiquer par exemple si un objet mobile a été détecté dans la scène (information binaire), et éventuellement la distance à laquelle se trouve l'objet détecté (information sous forme de grandeur numérique). Dans certains modes de réalisation, l'information de sortie comporte au moins une cartographie, notamment une cartographie donnant une probabilité de présence des objets en chaque point de la scène.
Dans certains modes de réalisation, l'information de sortie comporte une cartographie constituant une segmentation sémantique de la scène sous forme d'image et donnant pour chaque pixel de l'image une classe à laquelle il appartient, parmi une pluralité de classes possibles.
Par ailleurs, différentes architectures peuvent être utilisées pour le(s) codeur(s) spatio-temporel(s) et le(s) décodeur(s).
Dans certains modes de réalisation, le réseau convolutionnel d'un étage ou de chaque étage de la cascade d'étages du codeur est un réseau à convolutions séparables, par exemple un réseau de type Inverted Residual Bottleneck.
Un réseau à convolutions séparables est un réseau comprenant au moins une couche convolutionnelle dans laquelle les opérations de convolution sont de type 'depthwise separable convolutions', dans lequel les opérations de convolution dans la direction de profondeur ('depthwise convolution') sont effectuées séparément des opérations de convolution suivant les directions latérales ('pointwise convolution').
Les opérations de convolution de type 'depthwise separable convolutions' sont décrites en détail dans le document : Howard, A. G., Zhu, M., Chen, B., Kalenichenko, D., Wang, W., Weyand, T., ... & Adam, H. (2017). Mobilenets: Efficient convolutional neural networks for mobile vision applications. arXiv preprint arXiv:1704.04861.
Dans certains modes de réalisation, le réseau récurrent d'un étage ou de chaque étage de la cascade d'étages du codeur est un réseau à convolutions séparables, par exemple un réseau ConvLSTM, en particulier un réseau de type Bottleneck LSTM.
Dans certains modes de réalisation, le codeur comprend en aval de la cascade d'étages un dernier étage constitué d'un réseau convolutionnel à convolutions séparables, par exemple un réseau de type Inverted Residual Bottleneck.
Dans certains modes de réalisation, le décodeur comprend une pluralité d'étages en cascade, chaque étage du décodeur étant configuré pour effectuer une convolution transposée.
La transmission de certaines informations de l'encodeur au décodeur permet par ailleurs d'améliorer la performance du réseau.
Pour cette raison dans certains modes de réalisation, au moins un étage du décodeur reçoit, via une connexion saute-couche, une caractéristique spatiale fournie par un étage correspondant du codeur ainsi qu'optionnellement l'état interne du réseau de neurones récurrent appartenant à cet étage.
Par ailleurs, dans certains modes de réalisation, le système de détection d'objet est configuré de manière à exploiter au mieux les informations acquises par le radar.
Ainsi dans certains modes de réalisation, le système de détection d'objet comprend une pluralité de codeurs, chaque codeur étant destiné à recevoir des trames de données radar obtenues par projection d'un tenseur de mesures radar (TRAD) sur u n espace distinct de dimension 2, chaque codeur étant configuré pour fournir, en fonction de son état interne, et à chaque nouvelle trame de données rk reçue à un instant k, un ensemble de caractéristiques spatiales et à mettre à jour son état interne en fonction de cette nouvelle trame ; et ledit au moins un décodeur étant configuré pour utiliser lesdits ensemble des caractéristiques spatiales à instant k, ainsi optionnellement que les états internes mis à jour par lesdits codeurs pour fournir l'information de sortie.
Dans certains variantes de ces modes de réalisation, au moins un étage du décodeur reçoit, via une connexion saute-couche, une caractéristique spatiale composite résultant de la concaténation de caractéristiques spatiales fournies par des étages correspondants de même rang des différents codeurs ainsi qu'optionnellement un état interne composite obtenu à partir des états internes des réseaux de neurones récurrents appartenant aux étages correspondants de même rang des différents codeurs.
BRÈVE DESCRIPTION DES DESSINS
D'autres caractéristiques et avantages de l'invention apparaîtront à la lecture d'un mode de réalisation préférentiel de l'invention, fait en référence aux figures jointes parmi lesquelles :
[Fig. 1] déjà décrite représente de manière schématique un système radar connu de l'état de la technique capable de générer des trames de données radar;
[Fig. 2] représente de manière schématique le déroulement dans le temps du fonctionnement d'un réseau de neurones récurrent et convolutionnel équipant un système de détection d'objets selon un mode de réalisation de l'invention ;
[Fig. 3] représente de manière schématique l'architecture codeur-décodeur d'un système de détection d'objets selon un premier mode de réalisation de l'invention ;
[Fig. 4A] illustre une phase d'apprentissage d'un réseau de neurones récurrent et convolutionnel selon un exemple du premier mode réalisation de l'invention ;
[Fig. 4B] illustre une phase d'inférence d'un réseau de neurones récurrent et convolutionnel selon un exemple du premier mode de réalisation de l'invention
[Fig. 5] représente de manière schématique l'architecture d'un système de détection d'objets selon un exemple du premier mode de réalisation de l'invention ;
[Fig. 6] représente de manière schématique l'architecture codeur-décodeur d'un système de détection d'objets selon un second mode de réalisation de l'invention ; [Fig. 7] représente de manière schématique une connexion saute-couche entre le codeur et le décodeur du système de détection d'objets de la Fig. 6. EXPOSÉ DÉTAILLÉ DE MODES DE RÉALISATION PARTICULIERS
Nous considérons dans la suite un système de détection d'objets dans des trames de données radar brutes se succédant à une période de récurrence prédéterminée, T . Par trames de données radar brutes encore appelées dans la suite plus simplement trames de données radar (ou spectres radar), on entend ici la projection dans un espace de dimension 2 d'un tenseur de mesures radar dont les composantes sont des coordonnées géométriques ou des valeurs de vitesse. Par exemple, le tenseur de mesures pourra être un tenseur RAD (distance, angle, vitesse Doppler) défini plus haut et les trames de données radar peuvent être des trames RD (distance, vitesse Doppler), AD (angle, vitesse Doppler) ou RA (distance, angle). Les données radar brutes pourront être fournies par un radar à onde continue modulée en fréquence (FMCW) comme décrit dans la partie introductive ou d'un autre type, par exemple un radar impulsionnel.
Le système de détection est destiné à fournir à chaque période de récurrence et pour une scène donnée une information de sortie relative aux objets présents dans cette scène, notamment sous forme de cartographie. Selon le type d'application envisagée, cette cartographie pourra se présenter sous la forme d'une carte de confiance, donnant pour chaque point de la scène la probabilité de présence d'un objet, ou encore d'un masque de segmentation sémantique, donnant pour chaque pixel d'une image représentative de la scène, la classe à laquelle il appartient parmi une pluralité de classes disponibles. Pour l'information de sortie, d'autres formats, notamment d'autres types de cartographie des objets présents dans la scène pourront être envisagés par l'homme du métier sans sortir du cadre de la présente invention.
Le système de détection d'objets selon la présente invention utilise un modèle de prédiction, M, comprenant un codeur spatio-temporel, E, et un décodeur, D. Si l'on note Rk = (rk-N+1, rk-N+2+i, ■ ■ , rk~) une séquence de N trames de données radar consécutives où k est un indice de pas temporel (par exemple un spectre radar RA ou RD, le modèle de prédiction se décompose comme suit :
[Math. 1]
W ) - ( « K)(^) ( 1) où ° est le symbole de composition fonctionnelle.
Le codeur spatio-temporel, E, peut être considéré comme une machine d'état : il fournit, à chaque instant k, un ensemble Fk de caractéristiques (features) spatiales, à partir de la dernière trame de données radar reçue rk et de son état interne courant, (sa mémoire) et met à jour son état interne, ce que l'on traduire par : [Math.2]
Le décodeur D utilise l'état interne mis à jour par le codeur spatio- temporel, Hk , et l'ensemble des caractéristiques spatiales fournies à instant k, Fk, pour fournir, sous forme de cartographie, une information relative aux objets présents dans la scène (par exemple une carte de confiance), Pk, soit : [Math. 3] o0W -) = A (3)
La Fig. 2 représente schématiquement le fonctionnement dans le temps du modèle de prédiction.
Plus précisément, ont été représentés dans cette figure deux instants consécutifs d'indices k — 1 et k. A l'instant k — 1, le codeur spatio-temporel E reçoit la trame de données radar et, à partir de son état interne Hk-2 (sa mémoire ) , fournit au décodeur D un ensemble de caractéristiques spatiales Ffc-i . En outre, il met à jour son état interne à partir de la trame de données radar rfc-x et de son état courant Hk-2 • L'état interne mis à jour est également fourni au décodeur D . Celui-ci prédit à partir des caractéristiques spatiales Fk- et de l'état de l'encodeur mis à jour, Hk-lr une cartographie des objets présents dans la scène, Pk-1. Le processus se poursuit de manière itérative comme illustré à l'instant suivant, k.
L'idée à la base de la présente invention est de combiner dans le codeur spatio-temporel au moins un réseau de neurones convolutionnel ou CNN et un réseau de neurones récurrent ou RNN. Le réseau de neurones convolutionnel a pour objet d'extraire des informations « spatiales » dans les trames de données radar, le terme « spatial » se référant ici aux variables représentées dans ces trames (par ex. RA, AD, RD pour la première couche) et le réseau de neurones récurrent opérant sur les informations spatiales ainsi extraites.
Avantageusement, le codeur spatio-temporel pourra présenter une pluralité de réseaux CNN et RNN alternés en série. En effet, un réseau CNN permet de réduire la dimension de son entrée afin que ne garder qu'une représentation pertinente et condensée de celle-ci alors qu'un réseau RNN permet de gérer conjointement l'information spatiale et temporelle en conservant dans son état interne la mémoire des entrées passées. Dans le cas présent, le réseau RNN permet d'analyser la dépendance temporelle entre les trames de données radar.
L'architecture codeur-décodeur d'un système de détection d'objet équipé d'un tel codeur spatio-temporel est représentée schématiquement en Fig. 3.
Le codeur spatio-temporel E comporte [Q > 2 étage(s) en cascade, chaque étage étant constitué d'un réseau CNN et d'un réseau RNN, arrangés en série. L'état du codeur spatio-temporel à l'instant donné est alors défini par les états internes respectifs, à cet instant, des réseaux RNN des différents étages, autrement dit :
[Math.4] où hk, hk, . . . , h sont les états internes respectifs des réseaux RNN appartenant aux Q étages du codeur spatio-temporel.
L'ensemble des caractéristiques spatiales Fk et l'état du codeur spatio- temporel Hk (autrement dit des états des réseaux RNN qu'il comprend, sa mémoire) sont fournis au décodeur D.
Les réseaux de neurones CNN pourront être avantageusement des réseaux à convolutions séparables.
En particulier, les réseaux de neurones CNN pourront être avantageusement choisis du type Inverted Residual Bottleneck, désignés dans la suite par IR. On pourra trouver une description détaillée d'un tel réseau de neurones dans l'article de M. Sandler et al. intitulé « MobileNetV2 : Inverted residuals and linear bottlenecks » publié dans Proc, of the IEEE Conf, on computer vision and pattern recognition, 2018, pp. 4510-4520. L'utilisation de réseaux IR permet de réduire le nombre de paramètres par rapport à un réseau CNN classique ainsi que le nombre d'opérations MAC (Mutiple-ACcumulate) dans la mesure où un réseau IT utilise une convolution séparable, c'est-à-dire une convolution qui se décompose de manière séparée en une convolution en profondeur (depthwise), c'est-à-dire sur un seul canal à la fois, et une convolution ponctuelle (pointwise), c'est-à-dire sur l'ensemble des canaux à la fois.
De même, les réseaux de neurones RNN pourront être avantageusement des réseaux à convolutions séparables.
En particulier, les réseaux RNN pourront être choisis de type LSTM (Long Short Term Memory) et avantageusement de type Bottleneck LSTM. On pourra trouver une description détaillée d'un tel réseau de neurones dans l'article de M. Liu et al. intitulé « Mobile video object detection with temporally-aware feature maps » publié dans Proc, of the IEEE Conf, on computer vision and pattern recognition, 2018, pp. 5686-5695.
Avantageusement, une couche de normalisation pourra être prévue avant l'activation (fonction sigmoïde) au niveau des portes d'entrée, d'oubli et de sortie de chaque réseau LSTM, la normalisation étant effectuée sur l'ensemble des caractéristiques spatiales.
Enfin, la première couche du codeur spatio-temporel comporte, comme représenté, en Fig. 3 un réseau de neurones convolutionnel classique pour augmenter le nombre de canaux, chaque canal correspondant à un noyau de convolution par blocs. Les étages de réseaux CNN-RNN opèrent sur les trames de données radar ayant préalablement subi cette étape de convolution par blocs.
Lors de l'entraînement, le système de détection d'objets se voit présenter séquentiellement N trames de données en entrée du codeur spatio-temporel et des résultats de prédiction associés, c'est-à-dire des cartographies d'objets effectivement présents dans la scène. Le modèle est ainsi entraîné à coder une séquence de N trames de données pour prédire à chaque instant t la cartographie correspondante, Pt, soit pour le décodeur :
[Math.5] où Ft et Ht sont respectivement l'ensemble des caractéristiques fournies par le codeur spatio-temporel et son état interne après mise à jour à l'instant t.
La Fig. 4A représente une étape de la phase d'entrainement d'un exemple de système de détection d'objets selon la Fig. 3. Dans l'exemple représenté, le codeur spatio-temporel comprend Q = 2 étages en cascade, chaque étage comprenant un réseau CNN (réseau IR) et un réseau RNN, arrangés en série. L'état du codeur spatio-temporel à l'instant k, après mise à jour, est par conséquent donné par Hk = (hk, hk~) . Un réseau convolutionnel par blocs est prévu en amont étages CNN-RNN, et un réseau IR est disposé en aval de la cascade d'étages CNN- RNN. Le codeur spatio-temporel reçoit séquentiellement en entrée des trames de données radar et le décodeur effectue une prédiction Pk sur la base des N = 3 dernières trames reçues, cette prédiction étant confrontée à une cartographie des objets existants dans la scène. Les paramètres des différents réseaux de neurones IR et RNN sont mis à jour après calcul de la fonction de perte et une rétropropagation du gradient visant minimiser l'erreur de prédiction.
Une fois entraîné le système de détection peut être utilisé dans une phase d'inférence pour prédire une information relative aux objets présents dans la scène.
La Fig. 4B représente une étape de la phase d'inférence du système de détection d'objets préalablement entraîné. A chaque instant k, le codeur fournit à partir de son état avant mise à jour, et de la trame de données radar qu'il reçoit, rk, un ensemble de caractéristiques spatiales ainsi que l'état mis à jour Hk = (Jik, hk~) , au décodeur D qui en déduit une cartographie des objets détectés dans la scène.
La Fig. 5 représente de manière schématique l'architecture codeur- décodeur d'un système de détection d'objets selon un exemple du premier mode de réalisation de la présente invention.
L'architecture de cet exemple de réalisation est de type U-net dont on trouvera une description dans l'article de 0. Ronneberger et al. intitulé « U-Net : convolutional networks for biomedical image segmentation » publié dans Proc, of Medical Image Computing and Computer-Assisted Intervention, MICCAI 2015, pp. 234-241,
Cette architecture comprend une branche de contraction, formée par le codeur spatio-temporel E, et une branche d'expansion, formée par le décodeur D.
Le codeur spatio-temporel E comprend deux étages 520, 530 en cascade (autrement dit Q = 2), chaque étage comprenant un réseau CNN (de type Inverted Residual Bottleneck) et un réseau RNN (de type Bottleneck LSTM), en série. Le réseau RNN du premier étage, 520, fournit, à chaque instant k, son état interne hk au décodeur, via une première connexion temporelle saute-couche (temporal skip connection) et, de même, le réseau RNN du second couple, 530, fournit son état interne hk au décodeur, via une seconde connexion temporelle saute-couche. Le codeur spatio-temporel E comprend en amont du premier étage au moins un réseau de neurones convolutionnels par blocs, 510, fournissant en sortie des blocs de taille C x H x W où C est le nombre de canaux (c'est-à-dire le nombre de noyaux de convolution et donc de caractéristiques spatio-temporelles), H et W sont respectivement la hauteur et la largeur des trames de données radar.
Enfin, le codeur spatio-temporel comprend en aval de l'étage 530, un troisième et dernier étage un réseau CNN (de type Inverted Residual Bottleneck), 540.
Le nombre de canaux est doublé entre réseaux CNN d'étages successifs et la largeur ainsi que la largeur des blocs sont divisés par 2. Autrement dit, C = 2C± = 4C2 = 8C3 .
Le décodeur comprend trois étages de convolution 2D transposée, 550, 560, 570, suivi d'un étage de convolution, 580, permettant d'obtenir la cartographie des objets qui est l'information de sortie (par exemple carte de confiance ou segmentation sémantique de l'image de la scène). A chaque étage du codeur correspond un étage de convolution transposée du décodeur : l'étage 550 correspond au réseau CNN 540, l'étage 560 correspond à l'étage CNN-RNN, 530, et l'étage 560 correspond à l'étage CNN-RNN, 520.
Chaque étage du décodeur reçoit les caractéristiques spatiales issues de l'étage correspondant (520,530, 540) du codeur via une connexion saute-couche (skip connection) et, le cas échéant, l'état interne du RNN appartenant à cet étage (520,530) via une connexion temporelle saute-couche ou TSC (temporal skip connection). Cette connexion TSC permet d'éviter la perte d'information temporelle le long du chemin de décodage. L'état interne (h^,h^) du RNN appartenant à un étage du codeur est concaténé au résultat de la convolution transposée fourni par l'étage précédent l'étage correspondant du décodeur.
Ainsi par exemple, l'état interne du réseau RNN du second étage, 530, du codeur est concaténé ou additionné au résultat de la convolution transposée du premier étage, 550, du décodeur. De même, l'état interne du réseau CNN du premier étage, 520, du codeur est concaténé ou additionné au résultat de la convolution transposée du second étage, 560 du décodeur.
La Fig. 6 représente de manière schématique l'architecture d'un système de détection d'objet selon un second mode de réalisation de la présente invention.
Ce second mode de réalisation se distingue du premier en ce qu'il permet de détecter les objets présents dans la scène en utilisant es différentes dimensions de distance, vitesse et azimuth/angle). Ce mode de réalisation permet donc d'exploiter l'ensemble des informations présente dans le signal radar.
Suivant une première variante (non illustrée par les figures), des trames radar rk successives sont reçues à chaque intervalle de temps par un codeur spatio- temporel ERAD.
Dans cette variante, les trames radar rk, intègrent trois informations de distance, vitesse et angle (R,D,A). Ces trames radars peuvent par exemple prendre la forme d'un tenseur, dans lequel deux des trois informations de distance, vitesse et angle (R,D,A) sont codées suivant les dimensions latérales (hauteur et largeur) du tenseur, et la troisième de ces informations est codée suivant la dimension de profondeur (les 'canaux') du tenseur.
Une deuxième variante est illustrée par la figure 6. Cette variante se distingue de la première variante en ce que différentes vues (ou projections) du tenseur de mesures radar, par exemple des trames RA, RD et AD au sens défini précédemment sont utilisées pour détecter les objets présents dans la scène. Cette variante exploite donc de manière séparée deux à deux les dimensions de distance, vitesse et azimuth/angle, en utilisant une pluralité de codeurs spatio-temporels.
Le système de détection d'objets selon cette variante comprend autant de codeurs que de vues du tenseur de mesures, à savoir, dans l'exemple illustré trois codeurs ERA,ERD,EAD ayant chacun la structure du premier mode de réalisation. Plus précisément, chacun de ces codeurs comporte le même nombre Q d'étages, chaque étage étant constitué d'un réseau CNN en série avec un réseau RNN. A chaque instant k, les caractéristiques spatiales, F^A, F^D,FAD issues des différents codeurs sont concaténées dans un espace de variables latentes multi-vue pour former une caractéristique spatiale composite F^AD, fournie à un ou plusieurs décodeurs, ici les décodeurs DRA et DRD. De manière similaire, les états internes des réseaux RNN des différents étages q = 1, , . , Q des codeurs ERA,ERD,EAD, sont concatenes pour former un état interne composite transmis à l'étage correspondant de chacun des décodeurs, comme en Fig. 5. Ainsi, dans l'exemple représenté, chacun des décodeurs DRA,DRD peut bénéficier d'une information temporelle provenant non seulement du codeur correspondant (ERA,ERD) mais des trois codeurs ssociés aux 3 vues du tenseur de mesure. Les états internes q = 1, . . , Q sont transmis aux décodeurs par une connexion temporelle saute-couche commune à l'ensemble des vues, désignée sur la figure par TMVSC (Temporal Multi-View Skip Connection).
Dans l'exemple représenté, le décodeur permet DRA de prédire la position des objets dans la scène dans un espace RA (distance, azimut) alors que le décodeur DRD permet de prédire les positions de ces objets, autrement de les représenter dans un espace RD (distance, vitesse).
La Fig. 7 représente de manière plus détaillée l'opération de concaténation des états internes composites réalisée par la connexion TMVSC de la Fig. 6.
Les états internes h^D,q ,hAD,q , hR A,q des réseaux RNN faisant partie des étages de rang q des codeurs respectifs ERD,EAD,ERA sont concaténés, le cas échéant après une étape de sous-échantillonnage ou de sur-échantillonnage permettant d'harmoniser leurs dimensions à C x H x W, d'où un résultat de concaténation de taille 3C x H x V/qui fait ensuite l'objet d'une convolution 2D l x l (channelwise pooling) permettant de réduire le nombre de canaux de 3Cà C et donc de les utiliser au sein des étages du décodeur comme dans le premier mode de réalisation, en tant qu'état interne composite.

Claims

REVENDICATIONS
1 . Système de détection d'objets dans une scène à partir de trames de données radar de cette scène, lesdites trames (rfe) se succédant temporellement, lesdites trames (rfe) de données radar donnant deux informations (RA, RD, AD), ou trois informations (RAD), parmi des informations de distance (R), d'angle d'arrivée (A) et de vitesse Doppler (D), caractérisé en ce que ledit système comprend au moins un codeur spatio-temporel (E , ERD,EAD,ERA) et au moins un décodeur ( , DRA,DRD), le codeur spatio-temporel étant destiné à recevoir lesdites trames et comprenant une (Q) pluralité d'étages en cascade (520,530), chaque étage comprenant un réseau de neurones convolutionnel, CNN, et un réseau de neurones récurrent, RNN, arrangés en série, le codeur étant configuré pourfournir, en fonction de son état interne, et à chaque nouvelle trame de données rk reçue à un instant k, un ensemble Ek de caractéristiques spatiales et à mettre à jour son état interne en fonction de cette nouvelle trame, ledit état interne étant formé par les états internes des réseaux RNN des étages du codeur, le décodeur ( , DRA,DRD) utilisant l'ensemble Ffedes caractéristiques spatiales à instant k, ainsi optionnellement que l'état interne mis à jour par le codeur, Hk, pour fournir une information de sortie (Pk) relative aux objets présents dans la scène.
2. Système de détection d'objets dans une scène selon la revendication 1, caractérisé en ce que les trames (rfe) de données radar sont obtenues par projection d'un tenseur de mesures radar dans un espace de dimension 2 ou constituent des tenseurs de dimension 3.
3. Système de détection d'objets dans une scène selon la revendication 1 ou 2, caractérisé en ce que ladite information de sortie (Pk) comporte au moins une cartographie, notamment une cartographie donnant une probabilité de présence des objets en chaque point de la scène.
4. Système de détection d'objets dans une scène selon l'une quelconque des revendications 1 à 3, caractérisé en ce que ladite information de sortie comporte une cartographie constituant une segmentation sémantique de la scène sous forme d'image et donnant pour chaque pixel de l'image une classe à laquelle il appartient, parmi une pluralité de classes possibles.
5. Système de détection d'objets dans une scène selon l'une des revendications précédentes, caractérisé en ce que le réseau convolutionnel d'un étage ou de chaque étage de la cascade d'étages du codeur est un réseau à convolutions séparables, par exemple un réseau de type Inverted Residual Bottleneck.
6. Système de détection d'objets dans une scène selon l'une des revendications précédentes, caractérisé en ce que le réseau récurrent d'un étage ou de chaque étage de la cascade d'étages du codeur est un réseau à convolutions séparables, par exemple un réseau ConvLSTM, en particulier un réseau de type Bottleneck LSTM.
7. Système de détection d'objets dans une scène selon la revendication 5 ou 6, caractérisé en ce que le codeur comprend en aval de la cascade d'étages un dernier étage (540) constitué d'un réseau convolutionnel à convolutions séparables, par exemple un réseau de type Inverted Residual Bottleneck.
8. Système de détection d'objets dans une scène selon l'une des revendications précédentes, caractérisé en ce que le décodeur comprend une pluralité d'étages en cascade (550,560,570), chaque étage du décodeur étant configuré pour effectuer une convolution transposée.
9. Système de détection d'objets dans une scène selon l'une quelconque des revendications précédentes, caractérisé en ce qu'au moins un étage du décodeur (550,560,570) reçoit, via une connexion saute-couche, une caractéristique spatiale fournie par un étage correspondant du codeur ainsi qu'optionnellement l'état interne du réseau de neurones récurrent appartenant à cet étage.
10. Système de détection d'objets dans une scène selon l'une des revendications 1 à 9, caractérisé en ce qu'il comprend une pluralité de codeurs (ERD,EAD,ERA), chaque codeur étant destiné à recevoir des trames de données radar obtenues par projection d'un tenseur de mesures radar (TRAD) sur un espace distinct de dimension 2, chaque codeur étant configuré pour fournir, en fonction de son état interne, et à chaque nouvelle trame de données rk reçue à un instant k, un ensemble (Fk,RA ;Fk,RD ;Fk,AD ) de caractéristiques spatiales et à mettre à jour son état interne en fonction de cette nouvelle trame ; et ledit au moins un décodeur étant configuré pour utiliser lesdits ensemble des caractéristiques spatiales (FkRA;FkRD ;FkAD ) à instant k, ainsi optionnellement que les états internes mis à jour par lesdits codeurs pour fournir l'information de sortie (Pk).
11. Système de détection d'objets dans une scène selon la revendication 10, caractérisé en ce qu'au moins un étage du décodeur reçoit, via une connexion saute-couche, une caractéristique spatiale composite (FkRAD) résultant de la concaténation de caractéristiques spatiales (FkRA ;FkRD ;FkAD ) fournies par des étages correspondants de même rang des différents codeurs ainsi qu'optionnellement un état interne composite obtenu à partir des états internes
(hk , hk f hk ) des reseaux de neurones récurrents appartenant aux etages correspondants de même rang (q) des différents codeurs.
EP23841024.5A 2022-12-19 2023-12-19 Système de détection d'objets dans des trames de données radar utilisant un réseau de neurones convolutionnel récurrent Pending EP4639494A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR2213880A FR3143810B1 (fr) 2022-12-19 2022-12-19 Système de détection d’objets dans des trames de données radar utilisant un réseau de neurones convolutionnel récurrent
PCT/FR2023/052056 WO2024134090A1 (fr) 2022-12-19 2023-12-19 Système de détection d'objets dans des trames de données radar utilisant un réseau de neurones convolutionnel récurrent

Publications (1)

Publication Number Publication Date
EP4639494A1 true EP4639494A1 (fr) 2025-10-29

Family

ID=86007641

Family Applications (1)

Application Number Title Priority Date Filing Date
EP23841024.5A Pending EP4639494A1 (fr) 2022-12-19 2023-12-19 Système de détection d'objets dans des trames de données radar utilisant un réseau de neurones convolutionnel récurrent

Country Status (4)

Country Link
EP (1) EP4639494A1 (fr)
CN (1) CN120883256A (fr)
FR (1) FR3143810B1 (fr)
WO (1) WO2024134090A1 (fr)

Family Cites Families (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US11827214B2 (en) * 2020-03-05 2023-11-28 Huawei Technologies Co., Ltd. Machine-learning based system for path and/or motion planning and method of training the same

Also Published As

Publication number Publication date
WO2024134090A1 (fr) 2024-06-27
FR3143810A1 (fr) 2024-06-21
FR3143810B1 (fr) 2025-03-21
CN120883256A (zh) 2025-10-31

Similar Documents

Publication Publication Date Title
KR102933653B1 (ko) 레이더 딥 러닝
EP2100161B1 (fr) Procede de traitement radar passif multivoies d'un signal d'opportunite en fm
CN111712828A (zh) 物体检测方法、电子设备和可移动平台
FR2718874A1 (fr) Procédé de surveillance de trafic pour la détection automatique d'incident de véhicules.
CA2621980A1 (fr) Procede d'assistance a la conduite d'un vehicule et dispositif associe ameliore
CA2106115A1 (fr) Systeme de calcul d'au moins un parametre de controle de trafic de vehicules
WO1995007473A1 (fr) Procede et dispositif pour la detection et la localisation d'obstacles dans l'environnement d'un vehicule
FR3011085A1 (fr) Procede de detection de cibles et radar multifonction associee
EP3252423A1 (fr) Procede de detection adaptative d'une cible par un dispositif radar en presence d'interferences stationnaires, et radar et autodirecteur de missile mettant en oeuvre un tel procede
EP2544020B1 (fr) Procédé et dispositif de détection d'une cible masquée par des réflecteurs de forte énergie
FR3134363A1 (fr) Procédé de prédiction de trajectoires de piétons pour le renforcement de la sécurité de la conduite autonome d’un véhicule, véhicule muni de moyens pour la mise en œuvre de ce procédé
EP0588815B1 (fr) Procede et dispositif d'analyse de sequences d'images routieres pour la detection d'obstacles
WO2021219398A1 (fr) Procédé d'imagerie radar, et radar mettant en œuvre un tel procédé
EP3828866A1 (fr) Procede et dispositif pour la determination de trajectoires d'elements mobiles
EP4639494A1 (fr) Système de détection d'objets dans des trames de données radar utilisant un réseau de neurones convolutionnel récurrent
FR2704668A1 (fr) Appareil de poursuite de véhicules routiers à partir d'une plate-forme aérienne.
WO2021191148A1 (fr) Procédé de génération d'un flux de fouillis de mer, dispositif programmable et programme d'ordinateur associés
EP4439478A1 (fr) Procédé de suivi d'objets multiples
FR3152600A1 (fr) Procédé de segmentation d’image(s) et de localisation d’éléments caractéristiques prédéterminés d’un environnement d’atterrissage d’un aéronef
EP3757943B1 (fr) Procédé et dispositif de télémétrie passive par traitement d'image et utilisation de modeles en trois dimensions
FR2748572A1 (fr) Procede de detection et d'estimation de la vitesse d'objets en mouvement dans des images sar
Decourt Multiple target extraction and identification for automotive radar with AI
FR3137478A1 (fr) Procédé et dispositif de classification et de localisation d’objets dans des séquences d’images, système, programme d’ordinateur et support d’informations associés
EP4150362B1 (fr) Méthode et système de génération d'une carte de probabilité de présence d'un émetteur
EP3757942B1 (fr) Procédé et dispositif de télémétrie passive par traitement d'image

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20250701

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)