WO2019002236A1 - Traitement des donnees issues d'un detecteur d'obstacles - Google Patents

Traitement des donnees issues d'un detecteur d'obstacles Download PDF

Info

Publication number
WO2019002236A1
WO2019002236A1 PCT/EP2018/067014 EP2018067014W WO2019002236A1 WO 2019002236 A1 WO2019002236 A1 WO 2019002236A1 EP 2018067014 W EP2018067014 W EP 2018067014W WO 2019002236 A1 WO2019002236 A1 WO 2019002236A1
Authority
WO
WIPO (PCT)
Prior art keywords
bounding box
image
vector
sequence
regressions
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
PCT/EP2018/067014
Other languages
English (en)
Inventor
Achraf BEN HAMADOU
Philipe LAFON
Hani HAMDI
Tirui WU
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Valeo Schalter und Sensoren GmbH
Original Assignee
Valeo Schalter und Sensoren GmbH
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Valeo Schalter und Sensoren GmbH filed Critical Valeo Schalter und Sensoren GmbH
Publication of WO2019002236A1 publication Critical patent/WO2019002236A1/fr
Anticipated expiration legal-status Critical
Ceased legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V20/00Scenes; Scene-specific elements
    • G06V20/50Context or environment of the image
    • G06V20/56Context or environment of the image exterior to a vehicle by using sensors mounted on the vehicle
    • G06V20/58Recognition of moving objects or obstacles, e.g. vehicles or pedestrians; Recognition of traffic objects, e.g. traffic signs, traffic lights or roads
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/74Image or video pattern matching; Proximity measures in feature spaces
    • G06V10/75Organisation of the matching processes, e.g. simultaneous or sequential comparisons of image or video features; Coarse-fine approaches, e.g. multi-scale approaches; using context analysis; Selection of dictionaries
    • G06V10/751Comparing pixel values or logical combinations thereof, or feature values having positional relevance, e.g. template matching
    • G06V10/7515Shifting the patterns to accommodate for positional errors

Definitions

  • the present invention relates generally to motor vehicles, and more specifically to a method of processing data from an obstacle detector in the environment of a motor vehicle, from images captured by at least one on-board camera. on said motor vehicle.
  • Obstacle detection in the immediate environment of a motor vehicle with autonomous driving or equipped with driver assistance systems is crucial to prevent dangerous situations .
  • Obstacles may include other motorized vehicles, static or mobile, which may present a particular hazard, or pedestrians. It is easy to understand that the detection of these obstacles, including the determination of their positions, or even their relative speeds in the case of third-party vehicles, must not only be precise but also carried out in real time so that the assistance systems can react. quickly in a suitable way.
  • Boosting Adaptive Boosting
  • SVM Support Vector machine
  • Adaboost form abbreviated Adaptive Boosting
  • the approach used in the recognition is to learn and then to find in the image, the general appearance of a specific object, for example a pedestrian.
  • shape recognition algorithms are used whose purpose is to discriminate the shape of pedestrians from the rest.
  • a first phase involves the construction of a training base to capture the diversity of pedestrian appearance.
  • the training base should be the largest and most varied possible to best match the large number of situations that can be encountered by the pedestrian detector.
  • a learning algorithm will study and release properties of this database to create a model representing a boundary allowing the pedestrian / rest classification.
  • a classifier uses this model to differentiate the elements of the two groups.
  • the detection phase consists of scanning the image over overlapping scan areas and then comparing their contents with the model. If at a given point, the image is sufficiently close to the model, then the detector indicates the presence of a pedestrian.
  • the result is delivered by the detector in the form of a bounding box, generally of rectangular shape, by pedestrian detected.
  • the dimensions and / or the vertical position of the bounding box relating to a detected pedestrian are then used to estimate the distance to which the pedestrian is in relation to the vehicle.
  • Such a method is for example implemented by Adaboost type rapid detectors.
  • the results of rapid detection are then generally refined and validated by more efficient classifiers.
  • the previous algorithm described in the context of pedestrian detection, can also be used for the detection of other types of obstacles such as third-party vehicles.
  • Object detection algorithms in detections generally suffer from inaccuracy in the size and / or position of the bounding boxes. This results, on the one hand, in the risk of false detection or non-detection, and, on the other hand, an erroneous estimation of the real distance separating a detected object from the vehicle.
  • Improvements have been proposed to train a specific classifier, for example of the SVM type, to assign a better score or confidence index to a bounding box correctly centered on an object.
  • a corrected position of a given bounding box can thus be obtained by applying the classifier to a large number of areas of the image around the bounding box. Learning the specific classifier is performed prior to the installation of the detection system on a given vehicle.
  • Another improvement proposes to detect the feet of the pedestrian inside the bounding box, then to change the position of the lower limit of the bounding box into function of this feet detection.
  • the present invention aims to overcome the disadvantages of known solutions by proposing a solution for better refining the position in an image of a bounding box delivered by an object detector.
  • the object of the invention is a method for processing data from an object detector fitted to a motor vehicle, the object detector being capable of taking pictures taken by a camera on the vehicle. automotive, to deliver a bounding box of size and initial position Pinit determined in an image, said bounding box delimiting an area of the image representative of a detected object, the method comprising a step of determining a final position ⁇ ⁇ improved accuracy of said bounding box in the image comprising the steps of:
  • each linear regression delivering an elementary vector displacement to a new improved precision position
  • the improved precision end position for said bounding box is determined by applying from the initial position Pinit of the box emitting a total displacement equal to the sum of the elementary vector displacements delivered by the regitations of this sequence.
  • the improved end position of the emitting box emitted by the object detector is obtained by applying to the initial position a total displacement which is decomposed into a sum of elementary displacements, each elementary displacement being obtained by a regression of the regression sequence aiming to improve accuracy each time.
  • the method according to the invention may have one or more additional characteristics among the following:
  • the search area corresponds to the entire image image; nevertheless, to reduce the processing time, the search area is preferably smaller and corresponds to a portion of the image, substantially centered around said engobante box;
  • the glissante window is advantageously substantially of the same size as the engobante box
  • the predetermined sequence comprises, for example, an integer number K of reg ressions, and the final position ⁇ ⁇ of improved precision for the said emitting box is obtained by the relation
  • the predefined regions of the predetermined sequence of regions may be in linear and / or non-linear regression models
  • the starting position from which the first regression of the sequence is applied can be chosen as being the initial position of the engobant box; alternatively, the starting position is selected distinct from the initial position ⁇
  • the predefined predetermined regression sequence is applied to a plurality of selected possible start positions, thereby generating a plurality of possible final positions of improved accuracy for said bounding box, and the method further comprises a step of verifying that the bounding box corresponds to false object detection or true object detection based on the plurality of possible end positions generated;
  • the verification step comprises, for example, the calculation of the standard deviation on the plurality of possible end positions and the comparison of the calculated standard deviation with a predefined validation threshold, a calculation standard deviation lower than said predefined threshold of validation corresponding to a true object detection;
  • a final position of the bounding box corresponding to a true detection can then be calculated, for example by averaging the plurality of possible end positions.
  • FIG. 1 illustrates various steps of a processing method according to the invention for improving the accuracy in position of an object detected from images captured by a camera;
  • FIG. 2 schematically illustrates an example of result obtained after a first processing step of the method of FIG. 1;
  • FIG. 3 schematically illustrates the principle of applying a sliding window according to a second step of the method of Figure 1;
  • FIGS. 4 (a) and 4 (b) show a representation of a set of descriptor vectors obtained at the end of the second step of the method of FIG. 1;
  • FIGS. 5 (a) to 5 (d) schematically illustrate the principle of applying a sequence of regressions
  • FIG. 6 schematically represents an example of result obtained at the end of the last processing step of the method of FIG. 1;
  • FIG. 7 illustrates different steps of a variant of a treatment method according to the invention.
  • FIG. 1 For the sake of clarity, reference will be made at the same time to FIGS. 3 to 6 which illustrate examples of intermediate results obtained during this process.
  • a preliminary step So corresponds to the generation of the input data on which the processing method according to the invention is applied, namely objects detected by an object detector (not shown) from Im images captured by an onboard camera on a motor vehicle.
  • an object detector applies a pattern recognition algorithm and delivers, in case of detection, an object in the form of a bounding box.
  • a bounding box is indicated under the expression 0 (H, L, P ini t), where H represents the height of the bounding box, L represents the width of the bounding box, and Pinit represents the position in the image of the bounding box, as estimated by the object detector.
  • FIG. 2 gives an example of an image 1 captured by the onboard camera, in which a pedestrian 2 is present.
  • step S0 the pedestrian detector on board the motor vehicle has delivered a bounding box 3 of height H and length L, this bounding box being at a position Pinit in image 1
  • this bounding box 3 as output from the detector is not correctly positioned relative to the pedestrian 2, and the various steps of the method according to the invention which will now be described have for the purpose of calculating an improved position
  • Pfin - The method according to the invention preferably begins with the determination of a search area in the image 1 (step Si in Figure 1).
  • This search area can theoretically correspond to image 1 in its entirety.
  • a restricted zone is preferably defined, corresponding only to a portion of the image 1, this portion being of greater size and covering the bounding box 3.
  • FIG. 2 represents an example of a zone 4, preferably substantially centered around the bounding box 3 starting.
  • N is the number of pixels in width and M is the number of pixels in height of this search zone 4.
  • FIG. 3 illustrates by way of example lines interrupted three positions occupied by such a sliding window, namely:
  • a first position for example starting from the sliding window in the scanning process, in the upper left of the search zone 4,
  • any intermediate position the index i varying from 1 to N and the index j varying from 1 to M.
  • the scanning can be performed by moving the window from left to right and from top to bottom of a given step, preferably constant (for example equal to one pixel).
  • Other scanning sequencing can be performed, since the sliding window could occupy all the possible positions in the search area 4, in other words, a number equal to N ⁇ M of possible positions if the displacement step of the sliding window is chosen equal to one pixel.
  • an associated image descriptor vector is generated, c ' that is to say a real vector comprising Q visual characteristics capable of describing the image in a synthetic manner (for example according to the principle of gradient histograms) which will be noted in the following V Pi j.
  • the set of N x M vector descriptors obtained at the end of step S 2 can be modeled mathematically by a tensor T whose schematic representation is given respectively in perspective and in front view in FIGS. 4 (a) and 4 (b).
  • P (i, i) represents the Q-size descriptor vector obtained for the sliding window 5 P (i, i) at the P (1, 1) position of FIG. 3;
  • P (M, N) represents the Q-size descriptor vector obtained for the sliding window 5P (M, N) at the P (M, N) position of FIG. 3;
  • Vp (ij) represents the Q-size descriptor vector obtained for the sliding window 5p (ij) at the position P (i, j) of FIG. 3.
  • step S3 of FIG. 1 which consists in determining an improved end position ⁇ ⁇ for the starting bounding box 3, is carried out solely from this set of descriptor vectors.
  • Vpi descriptor vector, denoted convention Vpi in the following, associated with a starting position Pi selected from all possible positions P (i, j) (Step S 30 in Figure 1).
  • the starting position Pi is selected as being the initial position ⁇
  • the starting position Pi can also be selected distinct from the initial position ⁇
  • This processing part (S31 to S34 in FIG. 1) can be expressed in mathematical form as follows:
  • Vpk the descriptor vector associated with the position P K , on which the k-th regression is applied
  • the final position P end of improved precision for the bounding box of initial position Pinit is thus obtained by applying, from the initial position ⁇ ⁇ a total displacement equal to the sum of the elementary vector displacements delivered by the regressions of the sequence. Otherwise expressed, the improved precision end position is calculated, in a step S 4 , by the following relation:
  • FIGS. 5 (a) to 5 (d) illustrate an example of a predefined sequence composed of three predetermined regressions:
  • FIG. 4 (a) corresponds to the selection, in the tensor T, of a departure descriptor vector V P i associated with the starting position Pi, assumed here confused with the initial position Pinit of the bounding box.
  • FIG. 4 (b) illustrates the first elementary vector displacement yi obtained by applying the first regression Ri of the sequence to the initial vector V P i.
  • V P2 is the descriptor vector of the tensor associated with the new position resulting from this first vector displacement yi.
  • FIG. 4 (c) illustrates the second elementary vector displacement y 2 obtained by applying the second regression R 2 of the sequence to the vector descriptor V P2 .
  • Vp3 is the descriptor vector of the tensor associated with the new position resulting from this second vector displacement y 2 .
  • Figure 4 (d) illustrates the third and last elementary vector displacement y3 obtained by applying the third and last regression R3 of the sequence to the vector.
  • descriptor V P3 and V P4 is the descriptor vector of the tensor associated with the new position resulting from this last vector displacement V3.
  • FIG. 6 schematically illustrates the result obtained for the image given by way of example in FIG. 2. It can be seen in this figure that the bounding box 6 at the final position Pfin is much better positioned relative to the pedestrian than the bounding box. 3 at initial position Pinit- This improved position reduces the error in estimating the actual distance separating the pedestrian from the vehicle.
  • the invention thus proposes to apply directly to the set of descriptor vectors a sequence of regressions.
  • the regressions can be linear regressions, for example SVM (acronym for Support Vector Machine), or any other type of linear and / or non-linear regression models.
  • the regression sequence is determined offline using a plurality of samples whose error distribution is known and causing the regressors to improve the position of the samples by reducing this error. The number of regressions of the sequence depends on the expectations that one has in terms of precision.
  • step S3 (comprising the steps S30 to S3 4 ) of Figure 1 is applied either from a single starting position Pi, but from a plurality of selected possible starting positions.
  • the regression sequence is thus applied to a plurality of descriptor vectors of the tensor T, associated with this plurality of starting positions.
  • the treatment can be done in parallel or successively. In this way, a plurality of possible end positions of improved accuracy are generated for the same starting bounding box.
  • the steps S0 to S 2 are unchanged with respect to those explained with reference to FIG. 1.
  • step S3 is applied to a predefined number U of possible starting positions denoted P ", u being an integer varying between 1 and the predefined number U.
  • U is thus obtained U possible final positions of improved accuracy, denoted P ⁇ n , with u varying from 1 to U.
  • step S5 it is verified that the different possible final positions are coherent with each other, for example by calculating a standard deviation according to the relation
  • step S6 comparing this standard deviation to a predefined threshold S of validation (step S6). If the standard deviation is less than the validation threshold, the positions are considered likely and therefore the bounding box is retained as corresponding to true detection. Its final position of improved precision can then be calculated by averaging the different final positions obtained according to the relation:
  • the bounding box delivered by the object detector is considered to correspond to a false detection, and can be eliminated from the subsequent processes.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Multimedia (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Computing Systems (AREA)
  • Artificial Intelligence (AREA)
  • Health & Medical Sciences (AREA)
  • Databases & Information Systems (AREA)
  • Evolutionary Computation (AREA)
  • General Health & Medical Sciences (AREA)
  • Medical Informatics (AREA)
  • Software Systems (AREA)
  • Image Analysis (AREA)
  • Traffic Control Systems (AREA)

Abstract

L'invention concerne le traitement de données issues d'un détecteur d'objets équipant un véhicule automobile, et délivrant une boîte englobante de taille et de position initiale Pinit déterminées dans une image, représentative d'un objet détecté. Selon l'invention, une position finale Ρfin de précision améliorée de la boîte englobante dans l'image est déterminée en : effectuant (S1, S2) un balayage d'une zone de recherche de l'image par une fenêtre glissante, et en générant, pour chaque position possible de la fenêtre glissante, un vecteur descripteur d'image associé; puis en appliquant (S3), à partir d'au moins un vecteur descripteur associé à une position de départ sélectionnée (S30), une séquence prédéterminée de régressions prédéfinies, chaque régression linéaire délivrant un déplacement vectoriel élémentaire vers une nouvelle position de précision améliorée. On détermine (S4) la position finale Pfin de précision améliorée pour la boîte englobante en appliquant depuis la position initiale Pinit de la boîte englobante un déplacement total égal à la somme des déplacements vectoriels élémentaires délivrés par les régressions de la séquence.

Description

TRAITEMENT DES DONNEES ISSUES D'UN DETECTEUR D'OBSTACLES
La présente invention concerne de manière générale les véhicules automobiles, et plus précisément un procédé de traitement de données issues d'un détecteur d'obstacles dans l'environnement d'un véhicule automobile, à partir d'images capturées par au moins une caméra embarquée sur ledit véhicule automobile.
La détection d'obstacles dans l'environnement immédiat d'un véhicule automobile à conduite autonome ou équipé de systèmes d'assistance à la conduite (ou ADAS, initiales anglo-saxonnes mises pour Advanced Driver Assistance System) est cruciale pour prévenir des situations dangereuses. Les obstacles peuvent être notamment d'autres véhicules motorisés, statiques ou mobiles, pouvant présenter un danger particulier, ou bien des piétons. On comprend aisément que la détection de ces obstacles, incluant la détermination de leurs positions, voire de leurs vitesses relatives dans le cas de véhicules tiers, doit être non seulement précise mais menée en outre en temps réel pour que les systèmes d'assistance puissent réagir rapidement de façon adaptée.
On connaît déjà de nombreux systèmes réalisant des détections et classifications d'obstacles, tels que des véhicules motorisés ou des piétons, à partir d'images capturées par au moins une caméra embarquée sur le véhicule automobile, en particulier une caméra frontale, une caméra arrière, ou une caméra latérale.
Parmi les algorithmes de vision connus permettant de détecter des objets dans des images, on connaît notamment ceux reposant sur la reconnaissance d'objets par apprentissage automatique, telles que les méthodes SVM (initales anglo-saxonnes mises pour Support Vector machine) ou Adaboost (forme abrégée d'Adaptive Boosting). L'approche utilisée dans la reconnaissance consiste à apprendre puis à retrouver dans l'image, l'allure générale d'un objet déterminé, par exemple un piéton. Pour réaliser par exemple détecteur de piéton, on utilise des algorithmes de reconnaissance de formes dont le but est de discriminer la forme des piétons par rapport au reste. Concrètement, une première phase consiste à la construction d'une base d'entraînement pour capturer la diversité d'apparence des piétons. La base d'entraînement doit être la plus grande et la plus variée possible pour correspondre au mieux au grand nombre de situations pouvant être rencontrées par le détecteur de piétons. Puis, un algorithme d'apprentissage va étudier et dégager des propriétés de cette base pour créer un modèle représentant une frontière permettant la classification piéton/reste. Un classifieur s'appuie ensuite sur ce modèle pour différencier les éléments des deux groupes. Une fois le classifieur construit, la phase de détection consiste à balayer l'image sur des zones de scan qui se recouvrent, puis à comparer leur contenu avec le modèle. Si en un point donné, l'image est suffisamment proche du modèle, alors le détecteur indique la présence d'un piéton.
Le résultat est délivré par le détecteur sous forme d'une boîte englobante, généralement de forme rectangulaire, par piéton détecté. Les dimensions et/ou la position verticale de la boîte englobante relative à un piéton détecté sont alors utilisées pour estimer la distance à laquelle se situe le piéton par rapport au véhicule. Une telle méthode est par exemple implémentée par des détecteurs rapides de type Adaboost. Les résultats de la détection rapide sont ensuite généralement affinés et validés par des classifieurs plus performants.
L'algorithme précédent, décrit dans le cadre de la détection de piétons, peut également être utilisé dans le cadre de la détection d'autres types d'obstacles tels que des véhicules tiers.
Les algorithmes de détection d'objets dans les détections souffrent en général d'imprécision dans les dimensions et/ou la position des boîtes englobantes. Il en résulte d'une part, des risques de fausses détections ou de non détection, et d'autre part, une estimation erronée de la distance réelle séparant un objet détecté du véhicule.
Des améliorations ont été proposées consistant à entraîner un classifieur spécifique, par exemple de type SVM, pour qu'il attribue un meilleur score ou indice de confiance à une boîte englobante correctement centrée sur un objet. Une position corrigée d'une boîte englobante donnée peut ainsi être obtenue en appliquant le classifieur sur un nombre important de zones de l'image autour de la boite englobante. L'apprentissage du classifieur spécifique s'effectue antérieurement à l'installation du système de détection sur un véhicule donné.
Une autre amélioration, proposée dans le document FR 3, 027, 432 au nom de la Demanderesse, propose de détecter les pieds du piéton à l'intérieur de la boîte englobante, puis de modifier la position de la limite inférieure de la boîte englobante en fonction de cette détection de pieds.
Ces solutions offrent de bons résultats mais leurs performances restent intimement liées à la qualité des bases d'apprentissage des classifieurs nécessaires à leur implémentation.
La présente invention vise à pallier les inconvénients des solutions connues en proposant une solution permettant de mieux affiner la position dans une image d'une boîte englobante délivrée par un détecteur d'objets.
Pour ce faire, l'invention a pour objet un procédé de traitement de données issues d'un détecteur d'objets équipant un véhicule automobile, le détecteur d'objets étant apte, à partir d'images capturées par une caméra embarquée sur le véhicule automobile, à délivrer une boîte englobante de taille et de position initiale Pinit déterminées dans une image, ladite boîte englobante délimitant une zone de l'image représentative d'un objet détecté, le procédé comportant une étape de détermination d'une position finale Ρρη de précision améliorée de ladite boîte englobante dans l'image comprenant les étapes suivantes :
- on effectue un balayage d'une zone de recherche de l'image recouvrant ladite boîte englobante par une fenêtre glissante, et on génère, pour chaque position d'une pluralité de positions possibles de la fenêtre glissante, un vecteur descripteur d'image associé ;
- à partir d'au moins un vecteur descripteur associé à une position de départ sélectionnée parmi la pluralité de positions possibles, on applique une séquence prédéterminée de régressions prédéfinies, chaque régression linéaire délivrant un déplacement vectoriel élémentaire vers une nouvelle position de précision améliorée, et on détermine la position finale de précision améliorée pour ladite boîte englobante en appliquant depuis la position initiale Pinit de la boîte eng lobante un déplacement total égal à la somme des déplacements vectoriels élémentaires délivrés par les rég ressions de lad ite séquence.
En d 'autres termes, la position finale améliorée de la boîte eng lobante délivrée par le détecteur d 'objet est obtenue en appliquant à la position in itiale un déplacement total q ui se décompose en une somme de déplacements élémentaires, chaq ue déplacement élémentaire étant obtenu par une régression de la séquence de rég ression visant à améliorer à chaq ue fois la précision .
Outre les caractéristiques principales q ui viennent d'être mentionnées dans le paragraphe précédent, le procédé selon l'invention peut présenter une ou plusieurs caractéristiques complémentaires parmi les suivantes :
- lad ite zone de recherche correspond à la totalité de l'image d'images ; néanmoins, pour réduire le temps de traitement, la zone de recherche est de préférence plus réduite et correspond à une portion de l'image, sensiblement centrée autour de ladite boîte eng lobante ;
- la fenêtre gl issante est avantageusement sensiblement de même taille que la boîte eng lobante ;
- la séquence prédéterminée comporte par exemple un nombre entier K de rég ressions, et la position finale Ρηη de précision amél iorée pour lad ite boîte eng lobante est obtenue par la relation
Figure imgf000006_0001
dans laquel le Pi correspond à la position de départ et yi< correspond au déplacement vectoriel élémentaire calcu lé par la k-ième rég ression de la séquence ; - les rég ressions prédéfin ies de la séquence prédéterminée de rég ressions peuvent être selon des modèles de régression linéaires et/ou non l inéaires ;
- la position de départ à partir de laquel le la première régression de la séquence est appliquée peut être choisie comme étant la position in itiale de la boite eng lobante ; - en variante, la position de départ est sélectionnée distincte de la position initiale Ρ|η|ΐ de la boîte englobante ;
- dans une implémentation particulièrement intéressante, la séquence prédéfinie de régressions prédéterminée est appliquée sur une pluralité de positions de départ possibles sélectionnées, générant ainsi une pluralité de positions finales possibles de précision améliorée pour ladite boîte englobante, et le procédé comporte en outre une étape de vérification que la boîte englobante correspond à une fausse détection d'objet ou à une vraie détection d'objet sur la base de la pluralité de positions finales possibles générées ;
- l'étape de vérification comprend par exemple le calcul de l'écart type sur la pluralité de positions finales possibles et la comparaison de l'écart-type calculé à un seuil prédéfini de validation, un écart-type calcul inférieur audit seuil prédéfini de validation correspondant à une vraie détection d'objet ;
- une position finale de la boîte englobante correspondant à une vraie détection peut alors être calculée, par exemple en effectuant une moyenne sur la pluralité de positions finales possibles.
L'invention sera mieux comprise à la lecture de la description qui suit, faite en référence aux figures annexées, dans lesquelles :
- la figure 1 illustre différentes étapes d'un procédé de traitement selon l'invention pour l'amélioration de la précision en position d'un objet détecté à partir d'images capturées par une caméra;
- la figure 2 illustre schématiquement un exemple de résultat obtenu à l'issue d'une première étape de traitement du procédé de la figure 1 ;
- la figure 3 illustre schématiquement le principe de l'application d'une fenêtre glissante selon une deuxième étape du procédé de la figure 1 ;
- les figures 4(a) et 4(b) donnent une représentation d'un ensemble de vecteurs descripteurs obtenus à l'issue de la deuxième étape du procédé de la figure 1 ;
- les figures 5(a) à 5(d) illustrent schématiquement le principe de l'application d'une séquence de régressions ;
- la figure 6 représente schématiquement un exemple de résultat obtenu à l'issue de la dernière étape de traitement du procédé de la figure 1 ; - la figure 7 illustre différentes étapes d'une variante d'un procédé de traitement selon l'invention.
Différentes étapes d'un procédé de traitement visant à améliorer la position dans une image d'une boîte englobante représentative d'un objet détecté, par exemple un piéton, délivrée en sortie d'un détecteur d'objets, vont à présent être décrites en référence à la figure 1. Pour fixer les idées, on se reportera dans le même temps aux figures 3 à 6 qui illustrent des exemples de résultats intermédiaires obtenus au cours de ce procédé.
Sur la figure 1, une étape préliminaire So correspond à la génération des données d'entrée sur lesquelles le procédé de traitement selon l'invention est appliqué, à savoir des objets détectés par un détecteur d'objets (non représenté) à partir d'images Im capturées par une caméra embarquée sur un véhicule automobile. Comme indiqué précédemment, un détecteur d'objets applique un algorithme de reconnaissance de formes et délivre, en cas de détection, un objet sous forme d'une boîte englobante. Sur la figure 1, une boîte englobante est indiquée sous l'expression 0(H, L, Pinit), dans laquelle H représente la hauteur de la boîte englobante, L représente la largeur de la boîte englobante, et Pinit représente la position dans l'image de la boîte englobante, telle qu'estimée par le détecteur d'objets. La figure 2 donne un exemple d'une image 1 capturée par la caméra embarquée, dans laquelle un piéton 2 est présent. On suppose qu'à l'issue de l'étape So, le détecteur de piétons embarqué sur le véhicule automobile a délivré une boîte englobante 3 de hauteur H et de longueur L, cette boîte englobante étant à une position Pinit dans l'image 1. Comme on le voit sur la figure 2, cette boîte englobante 3 telle que délivrée en sortie du détecteur n'est pas correctement positionnée par rapport au piéton 2, et les différentes étapes du procédé selon l'invention qui vont à présent être décrites ont pour but de calculer une position améliorée
Pfin - Le procédé selon l'invention débute de préférence par la détermination d'une zone de recherche dans l'image 1 (étape Si sur la figure 1). Cette zone de recherche peut théoriquement correspondre à l'image 1 dans son intégralité. Néanmoins, afin de réduire le nombre de calculs, on définit de préférence une zone restreinte, correspondant seulement à une portion de l'image 1, cette portion étant de taille supérieure et recouvrant la boîte englobante 3. La figure 2 représente un exemple de zone 4 de recherche, avantageusement sensiblement centrée autour de la boîte englobante 3 de départ. On note par la suite N le nombre de pixels en largeur et M le nombre de pixels en hauteur de cette zone 4 de recherche.
Le traitement se poursuit par une étape S2 au cours de laquelle on effectue un balayage de la zone 4 de recherche par une fenêtre glissante, de préférence sensiblement de même taille que la boîte englobante 3. La figure 3 illustre à titre d'exemple en traits interrompus trois positions occupées par une telle fenêtre glissante, à savoir :
- sous la référence 5p(i,i), une première position, par exemple de départ de la fenêtre glissante dans le processus de balayage, en haut à gauche de la zone 4 de recherche,
- sous la référence 5P(M,N), une deuxième position, par exemple finale dans le processus de balayage, en bas à droite de la zone 4 de recherche ; et
- sous la référence 5p(ij), toute position intermédiaire, l'indice i variant de 1 à N et l'indice j variant de 1 à M .
Le balayage peut être effectué en déplaçant la fenêtre de gauche à droite et de haut en bas d'un pas donné, de préférence constant (par exemple égal à un pixel). D'autres séquencement de balayage peuvent être effectués, à partir du moment où la fenêtre glissante a pu occuper l'ensemble des positions possibles dans la zone 4 de recherche, en d'autres termes, un nombre égal à N x M de positions possibles si le pas de déplacement de la fenêtre glissante est choisi égal à un pixel.
En outre, lors du balayage de la zone 4 de recherche par la fenêtre glissante, on génère, pour chaque position P(i,j) de la fenêtre glissante 5p(i,j), un vecteur descripteur d'image associé, c'est-à-dire un vecteur réel comprenant Q caractéristiques visuelles aptes à décrire l'image de façon synthétique (par exemple selon le principe des histogrammes de gradient) que l'on notera dans la suite VPij. L'ensemble des N x M vecteurs descripteurs obtenus à l'issue de l'étape S2 peut être modélisé mathématiquement par un tenseur T dont une représentation schématique est donnée respectivement en perspective et en vue de face sur les figures 4(a) et 4(b) . Sur ces figures :
- P(i,i) représente le vecteur descripteur de dimension Q obtenu pour la fenêtre glissante 5P(i,i) à la position P( l, l) de la figure 3 ;
- P(M,N) représente le vecteur descripteur de dimension Q obtenu pour la fenêtre glissante 5P(M,N) à la position P(M,N) de la figure 3 ;
- Vp(ij) représente le vecteur descripteur de dimension Q obtenu pour la fenêtre glissante 5p(ij) à la position P(i,j) de la figure 3.
La suite du traitement, et en particulier l'étape S3 de la figure 1 qui consiste à déterminer une position finale améliorée Ρρη pour la boîte englobante 3 de départ, s'effectue uniquement à partir de cet ensemble de vecteurs descripteurs.
Plus précisément, on commence par choisir dans l'ensemble ou tenseur
T un vecteur descripteur, noté par convention Vpi dans la suite, associé à une position de départ Pi sélectionnée parmi toutes les positions possibles P(i,j) (Etape S30 sur la figure 1) .
De préférence, la position de départ Pi est sélectionnée comme étant la position initiale Ρ|η|ΐ de la boite englobante 3 dans l'image 1, telle que déterminée par le détecteur d'objets. Néanmoins, la position de départ Pi peut être également sélectionnée distincte de la position initiale Ρ|η|ΐ de la boîte englobante 3, et correspondre par exemple à une position au voisinage de la position initiale Pinit- Puis, on applique, en partant du vecteur descripteur VPi associé à cette position de départ Pi, une séquence prédéterminée d'un nombre entier K, au moins égal à deux, de régressions prédéfinies, chaque régression délivrant un déplacement vectoriel élémentaire vers une nouvelle position de précision améliorée. Cette partie de traitement (S31 à S34 sur figure 1) peut être exprimée sous forme mathématique de la façon suivante :
Pk+i = Pk + Yk avec yk= Rk(VPk), k étant un entier variant de 1 à K avec :
- Rk, la k-ième régression de la séquence ;
- Vpk, le vecteur descripteur associé à la position PK, sur lequel on applique la k-ième régression ;
- yi<, le déplacement vectoriel élémentaire délivré à l'issue de la k- ième régression de la séquence ; et
- PK+ I, la nouvelle position de précision améliorée obtenue après application de la k-ième régression de la séquence.
La position finale Pfin de précision améliorée pour la boîte englobante de position initiale Pinit est donc obtenue en appliquant, à partir de la position initiale Ρίηίΐ un déplacement total égal à la somme des déplacements vectoriels élémentaires délivrés par les régressions de la séquence. Autrement exprimé, la position finale de précision améliorée est calculée, lors d'une étape S4, par la relation suivante :
K
Pfin = Pinit+X Yk
k=l
Les figures 5(a) à 5(d) illustrent un exemple d'une séquence prédéfinie composées de trois régressions prédéterminées : la figure 4(a) correspond à la sélection, dans le tenseur T, d'un vecteur descripteur de départ VPi associé à la position de départ Pi, supposée ici confondue avec à la position initiale Pinit de la boîte englobante. La figure 4(b) illustre le premier déplacement vectoriel élémentaire yi obtenu en appliquant la première régression Ri de la séquence au vecteur de départ VPi . VP2 est le vecteur descripteur du tenseur associé à la nouvelle position découlant de ce premier déplacement vectoriel yi . La figure 4(c) illustre le deuxième déplacement vectoriel élémentaire y2 obtenu en appliquant la deuxième régression R2 de la séquence au vecteur descripteur VP2. Vp3 est le vecteur descripteur du tenseur associé à la nouvelle position découlant de ce deuxième déplacement vectoriel y2. Enfin, la figure 4(d) illustre le troisième et dernier déplacement vectoriel élémentaire y3 obtenu en appliquant la troisième et dernière régression R3 de la séquence au vecteur descripteur VP3 et VP4 est le vecteur descripteur du tenseur associé à la nouvelle position découlant de ce dernier déplacement vectoriel V3.
La position finale Pfm de précision améliorée est dans cet exemple obtenue par la relation suivante :
Pfin = Pi + Yi + V2 + V3
La figure 6 illustre schématiquement le résultat obtenu pour l'image donnée à titre d'exemple sur la figure 2. On voit sur cette figure que la boîte englobante 6 à la position finale Pfin est bien mieux positionnée par rapport au piéton que la boîte englobante 3 à la position initiale Pinit- Cette position améliorée réduit l'erreur dans l'estimation de la distance réelle séparant le piéton du véhicule.
Contrairement aux solutions de l'art antérieur basées sur des classifications dont le résultat est fortement dépendant des bases d'apprentissage, l'invention propose ainsi de directement appliquer sur l'ensemble de vecteurs descripteurs une séquence de régressions. Les régressions peuvent être des régressions linéaires, par exemple de type SVM (acronyme pour Support Vector Machine), ou tout autre type de modèles de régressions linéaires et/ou non linéaires. La séquence de régressions est déterminée hors ligne en utilisant une pluralité d'échantillons dont on connaît la distribution d'erreurs et en entraînant les régresseurs pour qu'ils améliorent la position des échantillons en réduisant cette erreur. Le nombre de régressions de la séquence dépend des attentes que l'on a en termes de précision. Un autre intérêt du procédé selon l'invention, dans une variante qui va à présent être décrite en référence à la figure 7, est qu'il peut facilement être utilisé pour vérifier si une boîte englobante délivrée par le détecteur d'objets constitue une fausse détection ou une vraie détection. Dans cette variante, l'étape S3 (comprenant les étapes S30 à S34) de la figure 1 est appliquée non plus à partir d'une seule position de départ Pi, mais à partir d'une pluralité de positions de départ possibles sélectionnées. La séquence de régressions est ainsi appliquée sur une pluralité de vecteurs descripteurs du tenseur T, associés à cette pluralité de positions de départ. Le traitement peut se faire en parallèle ou successivement. On génère de la sorte une pluralité de positions finales possibles de précision améliorée pour une même boîte englobante de départ. Sur la figure 7, les étapes So à S2 sont inchangées par rapport à celles expliquées en référence à la figure 1. L'étape S3 est en revanche appliquée sur un nombre prédéfini U de positions de départ possibles, notées P" , u étant un entier variant entre 1 et le nombre prédéfini U . En appliquant la séquence de régressions en partant de chaque vecteur descripteur V^1 associé à chaque position de départ possible P" , on obtient ainsi U positions finales possibles de précision améliorée, notées P^n , avec u variant de 1 à U .
Lors d'une étape S5, on vérifie que les différentes positions finales possibles sont cohérentes entre elles, par exemple en calculant un écart-type selon la relation
Figure imgf000013_0001
puis en comparant cet écart-type à un seuil prédéfini S de validation (étape S6). Si l'écart-type est inférieur au seuil de validation, les positions sont considérées comme vraisemblables et par suite, la boîte englobante est retenue comme correspondant à une vraie détection. Sa position finale de précision améliorée peut alors être calculée en moyennant les différentes positions finales obtenues selon la relation :
Figure imgf000013_0002
Si en revanche l'écart-type est supérieur au seuil S de validation, la boîte englobante délivrée par le détecteur d'objets est considérée comme correspondant à une fausse détection, et peut être éliminée des traitements ultérieurs.

Claims

REVENDICATIONS
1. Procédé de traitement de données issues d'un détecteur d'objets équipant un véhicule automobile, le détecteur d'objets étant apte, à partir d'images (Im) capturées par une caméra embarquée sur le véhicule automobile, à délivrer une boîte englobante (3) de taille et de position initiale Pinit déterminées dans une image (1), ladite boîte englobante (3) délimitant une zone de l'image représentative d'un objet détecté, le procédé comportant une étape de détermination d'une position finale Pfin de précision améliorée de ladite boîte englobante dans l'image (1) comprenant les étapes suivantes : - on effectue (S2) un balayage d'une zone (4) de recherche de l'image
(1) recouvrant ladite boîte englobante (3) par une fenêtre glissante (5Ρ{Δ)), et on génère, pour chaque position d'une pluralité de positions possibles (P(i,j)) de la fenêtre glissante (5P(i,j)), un vecteur (VPi,j) descripteur d'image associé ;
- à partir d'au moins un vecteur descripteur (Vpi) associé à une position de départ (Pi) sélectionnée (S30) parmi la pluralité de positions possibles (P(i,j)), on applique (S3) une séquence prédéterminée de régressions prédéfinies, chaque régression délivrant un déplacement vectoriel élémentaire (yi, y2, y3) vers une nouvelle position de précision améliorée, et on détermine (S4) la position finale Ρρη de précision améliorée pour ladite boîte englobante en appliquant depuis la position initiale Pinit de la boîte englobante (3) un déplacement total égal à la somme des déplacements vectoriels élémentaires (yi, y2, y3) délivrés par les régressions de ladite séquence.
2. Procédé selon la revendication 1, caractérisé en ce que ladite zone (4) de recherche correspond à la totalité de l'image (1).
3. Procédé selon la revendication 1, caractérisé en ce que ladite zone (4) de recherche correspond à une portion de l'image (1), sensiblement centrée autour de ladite boîte englobante (3).
4. Procédé selon l'une quelconque des revendications précédentes, caractérisé en ce que la fenêtre glissante (5P(i,j)) est sensiblement de même taille que la boîte englobante (3).
5. Procédé selon l'une quelconque des revendications précédentes, caractérisé en ce que la séquence prédéterminée comporte un nombre entier K de régressions, et en ce que la position finale Ρρη de précision améliorée pour ladite boîte englobante est obtenue par la relation
K
Pfin = Pl+∑ Yk
k=l
dans laquelle Pi correspond à la position de départ et yi< correspond au déplacement vectoriel élémentaire calculé par la k-ième régression de la séquence.
6. Procédé selon l'une quelconque des revendications précédentes, caractérisé en ce que les régressions prédéfinies de la séquence prédéterminée de régressions sont selon des modèles de régression linéaires et/ou non linéaires.
7. Procédé selon l'une quelconque des revendications précédentes, caractérisé en ce que la position de départ (Pi) est sélectionnée comme étant la position initiale Pjnit de la boite englobante (3).
8. Procédé selon l'une quelconque des revendications 1 à 7, caractérisé en ce que la position de départ (Pi) est sélectionnée distincte de la position initiale Pinit de la boîte englobante (3).
9. Procédé selon l'une quelconque des revendications précédentes, caractérisé en ce que la séquence prédéfinie de régressions prédéterminée est appliquée sur une pluralité de positions de départ possibles sélectionnées, générant ainsi une pluralité de positions finales possibles de précision améliorée pour ladite boîte englobante, et ce que le procédé comporte en outre une étape (S5, Se) de vérification que la boîte englobante correspond à une fausse détection d'objet ou à une vraie détection d'objet sur la base de la pluralité de positions finales possibles générées.
10. Procédé selon la revendication 1, caractérisé en ce que l'étape de vérification comprend le calcul (S5) de l'écart type sur la pluralité de positions finales possibles et la comparaison (Se) de l'écart-type calculé à un seuil prédéfini de validation, un écart-type calcul inférieur audit seuil prédéfini de validation correspondant à une vraie détection d'objet.
11. Procédé selon l'une quelconque des revendications 9 ou 10, caractérisé en ce que une position finale de la boîte englobante correspondant à une vraie détection est calculée (S7) par une moyenne sur la pluralité de positions finales possibles.
PCT/EP2018/067014 2017-06-27 2018-06-26 Traitement des donnees issues d'un detecteur d'obstacles Ceased WO2019002236A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR1755912 2017-06-27
FR1755912A FR3068156B1 (fr) 2017-06-27 2017-06-27 Traitement des donnees issues d'un detecteur d'obstacles

Publications (1)

Publication Number Publication Date
WO2019002236A1 true WO2019002236A1 (fr) 2019-01-03

Family

ID=61599222

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/EP2018/067014 Ceased WO2019002236A1 (fr) 2017-06-27 2018-06-26 Traitement des donnees issues d'un detecteur d'obstacles

Country Status (2)

Country Link
FR (1) FR3068156B1 (fr)
WO (1) WO2019002236A1 (fr)

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
FR3027432A1 (fr) 2014-10-16 2016-04-22 Valeo Schalter & Sensoren Gmbh Estimation de distance d'un pieton par un systeme d'imagerie embarque sur un vehicule automobile

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
FR3027432A1 (fr) 2014-10-16 2016-04-22 Valeo Schalter & Sensoren Gmbh Estimation de distance d'un pieton par un systeme d'imagerie embarque sur un vehicule automobile

Non-Patent Citations (6)

* Cited by examiner, † Cited by third party
Title
ANTHONY D RHODES ET AL: "Bayesian optimization for refining object proposals", ARXIV REPOSITORY, 6 April 2017 (2017-04-06), pages 1 - 8, XP055468280, Retrieved from the Internet <URL:https://arxiv.org/vc/arxiv/papers/1703/1703.08653v2.pdf> [retrieved on 20180418] *
JIANAN LI ET AL: "Multi-stage Object Detection with Group Recursive Learning", ARXIV.ORG, CORNELL UNIVERSITY LIBRARY, 201 OLIN LIBRARY CORNELL UNIVERSITY ITHACA, NY 14853, 18 August 2016 (2016-08-18), XP080720611 *
NAJIBI MAHYAR ET AL: "G-CNN: An Iterative Grid Based Object Detector", 2016 IEEE CONFERENCE ON COMPUTER VISION AND PATTERN RECOGNITION (CVPR), IEEE, 27 June 2016 (2016-06-27), pages 2369 - 2377, XP033021416, DOI: 10.1109/CVPR.2016.260 *
RAJARAM RAKESH N ET AL: "RefineNet: Iterative refinement for accurate object localization", 2016 IEEE 19TH INTERNATIONAL CONFERENCE ON INTELLIGENT TRANSPORTATION SYSTEMS (ITSC), IEEE, 1 November 2016 (2016-11-01), pages 1528 - 1533, XP033028542, DOI: 10.1109/ITSC.2016.7795760 *
SPYROS GIDARIS ET AL: "Attend Refine Repeat: Active Box Proposal Generation via In-Out Localization", ARXIV.ORG, CORNELL UNIVERSITY LIBRARY, 201 OLIN LIBRARY CORNELL UNIVERSITY ITHACA, NY 14853, 14 June 2016 (2016-06-14), XP080708398 *
YOO DONGGEUN ET AL: "AttentionNet: Aggregating Weak Directions for Accurate Object Detection", 2015 IEEE INTERNATIONAL CONFERENCE ON COMPUTER VISION (ICCV), IEEE, 7 December 2015 (2015-12-07), pages 2659 - 2667, XP032866610, DOI: 10.1109/ICCV.2015.305 *

Also Published As

Publication number Publication date
FR3068156B1 (fr) 2020-08-28
FR3068156A1 (fr) 2018-12-28

Similar Documents

Publication Publication Date Title
EP2275971B1 (fr) Procédé de détection d&#39;un obstacle pour véhicule automobile
US9697430B2 (en) Method and apparatus for identifying road signs
KR102043089B1 (ko) 차선 검출 방법, 이를 수행하기 위한 장치 및 기록매체
WO2019169532A1 (fr) Procédé de reconnaissance de plaque d&#39;immatriculation et système en nuage
EP2593907B1 (fr) Procédé de détection d&#39;une cible dans des images stéréoscopiques par apprentissage et classification statistique à partir d&#39;une loi de probabilité
FR2914761A1 (fr) Dispositif pour reconnaitre un objet sur une image
EP2275970A1 (fr) Procédé de détection d&#39;un obstacle pour véhicule automobile
WO2018138064A1 (fr) Detection d&#39;obstacles dans l&#39;environnement d&#39;un vehicule automobile par traitement d&#39;images
EP3570213A1 (fr) Procédé de reconnaissance de caractères
EP3614306B1 (fr) Procédé de localisation et d&#39;identification de visage et de détermination de pose, à partir d&#39;une vue tridimensionnelle
EP2975553A1 (fr) Procédé et système d&#39;autodétermination des valeurs des paramètres intrinsèques et des paramètres extrinsèques d&#39;une caméra placée au bord d&#39;une chaussée
CN111191482A (zh) 一种刹车灯识别方法、装置及电子设备
KR101080375B1 (ko) 객체 학습 방법, 객체 학습 방법을 이용한 객체 추적 방법, 객체 학습 및 추적 시스템
FR3027432A1 (fr) Estimation de distance d&#39;un pieton par un systeme d&#39;imagerie embarque sur un vehicule automobile
FR3083352A1 (fr) Procede et dispositif de detection rapide de structures repetitives dans l&#39;image d&#39;une scene routiere
FR3068156A1 (fr) Traitement des donnees issues d&#39;un detecteur d&#39;obstacles
EP3830741B1 (fr) Assistance à la conduite pour le controle d&#39;un vehicule automobile comprenant des étappes parallèles de traitement des images transformées.
FR3038760A1 (fr) Detection d&#39;objets par traitement d&#39;images
EP2988250A1 (fr) Système de vision et procédé pour véhicule à moteur
FR3058247B1 (fr) Detection d&#39;obstacles autour d&#39;un vehicule automobile
FR3128562A1 (fr) Procédé d’optimisation de la détection d’un élément dans une image
Kou et al. A lane boundary detection method based on high dynamic range image
FR3080702A1 (fr) Estimation de la distance separant un vehicule automobile d&#39;objets detectes par traitement d&#39;images capturees depuis le vehicule automobile
WO2018185398A1 (fr) Procédé et dispositif de traitement d&#39;images acquises par une caméra d&#39;un véhicule automobile
WO2023066790A1 (fr) Procédé d&#39;optimisation de la détection d&#39;un élément dans une image

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 18733609

Country of ref document: EP

Kind code of ref document: A1

NENP Non-entry into the national phase

Ref country code: DE

122 Ep: pct application non-entry in european phase

Ref document number: 18733609

Country of ref document: EP

Kind code of ref document: A1