EP4649461A1 - Verfahren zum evaluieren eines tiefen neuronalen netzes - Google Patents
Verfahren zum evaluieren eines tiefen neuronalen netzesInfo
- Publication number
- EP4649461A1 EP4649461A1 EP23832682.1A EP23832682A EP4649461A1 EP 4649461 A1 EP4649461 A1 EP 4649461A1 EP 23832682 A EP23832682 A EP 23832682A EP 4649461 A1 EP4649461 A1 EP 4649461A1
- Authority
- EP
- European Patent Office
- Prior art keywords
- image data
- new image
- neural network
- deep neural
- ground truth
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/70—Arrangements for image or video recognition or understanding using pattern recognition or machine learning
- G06V10/77—Processing image or video features in feature spaces; using data integration or data reduction, e.g. principal component analysis [PCA] or independent component analysis [ICA] or self-organising maps [SOM]; Blind source separation
- G06V10/774—Generating sets of training patterns; Bootstrap methods, e.g. bagging or boosting
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/70—Arrangements for image or video recognition or understanding using pattern recognition or machine learning
- G06V10/82—Arrangements for image or video recognition or understanding using pattern recognition or machine learning using neural networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V20/00—Scenes; Scene-specific elements
- G06V20/50—Context or environment of the image
- G06V20/56—Context or environment of the image exterior to a vehicle by using sensors mounted on the vehicle
Definitions
- the invention relates to a method for evaluating a deep neural network that has been trained for object recognition in image data from the environment of a motor vehicle.
- Deep neural networks for object recognition in image data which are intended for use in advanced driver assistance systems (ADAS) or in systems for autonomous or automated driving, are trained as a component of an object recognition device at a specific point in time on the basis of existing image data sets.
- ADAS advanced driver assistance systems
- corner cases can occur when recording a vehicle's surroundings using a vehicle camera and object recognition, in which objects of an object class on which the deep neural network was originally trained are incorrectly recognized or not recognized at all.
- image data can be recorded by an associated vehicle camera so that existing evaluation and/or training data sets that are used to evaluate or train deep neural networks for object recognition can be expanded to include new image data sets.
- new image data sets that were acquired during critical environmental conditions or critical traffic scenarios can be specifically selected.
- the object of the invention is to provide an improved method for evaluating a deep neural network trained for object recognition in image data.
- the object is achieved by a method for evaluating a deep neural network that has been trained for object recognition in image data from an environment of a motor vehicle.
- image data of at least one new image is provided, wherein for each new image ground truth object data about objects to be recognized in the image are generated and wherein the image data of each image are combined with the generated ground truth object data to form a new image data set.
- the new images can, for example, have been captured by a vehicle front camera during a ferry operation and saved as image data.
- the new images can contain moving images of a traffic situation that have been recorded as image data from a vehicle perspective under real environmental conditions (e.g. light and visibility conditions).
- the objects to be recognized by the deep neural network are marked manually or with automated tools in the new images or image sequences of the image data, for example by drawing a two-dimensional bounding box (2DBB) around a number of pixels that belong to an object of an object class to be recognized.
- a 2DBB can also be annotated as an object of a corresponding class.
- an output data set with object data about recognized objects is created for each new image data set by means of inference by the deep neural network.
- the object data generated by the deep neural network is compared with the ground truth object data for each new image dataset.
- the object detection quality of the neural network is then evaluated based on the comparisons and based on predefined metrics.
- the ground truth object data are extended by an attribute for all new image data sets for which a threshold value of a first metric was not met.
- the object data generated by the deep neural network is again compared with the ground truth object data.
- the object recognition quality of the neural network is then re-evaluated based on the renewed comparison and based on the specified metrics, with existing attributes being incorporated into the specified metrics.
- the deep neural network is evaluated positively if a number of assigned thresholds have been met by a second metric.
- a positive evaluation means that the object recognition quality of the trained deep neural network at least meets the requirements of an application, i.e. a respective assistance or driving function. If at least one threshold value of the second metric is not met, the object recognition quality does not meet the requirements for a respective target application, so that the deep neural network is evaluated negatively.
- One idea behind the method according to the invention is to add an attribute to the ground truth object data, which can be used to evaluate or determine the criticality of each relevant object in an image data set. Whether an individual relevant object is critical or less critical or non-critical in an object detection depends on a respective downstream application that receives the respective output data sets with object data about detected objects and processes them as input parameters for an assistance or automated driving function.
- the attribute flows via the ground truth object data into a respective metric for evaluating the object recognition quality of the deep neural network, so that the objects defined as less or non-critical are less strongly or not included in an evaluation.
- the metrics evaluate the ground truth object data of all extended image datasets, thus annotation-specific.
- the deep neural network can be evaluated positively after the third step, provided that all assigned threshold values have been met by the second metric. Accordingly, steps four to five can then be skipped.
- the question of whether an individual relevant object in a new image is critical or less critical is based, among other things, on expert knowledge of the respective application with which the output data sets of the object recognition are used. Additional annotation of the 2DBB with a corresponding attribute is therefore usually done manually. If the conditions for a positive evaluation are already met, time-consuming annotation of critical objects in individual image data sets can be saved.
- values for an average selectivity and/or an average accuracy with regard to the detection of objects in the image data sets can be determined using the second metric across all new image data sets. Furthermore, a threshold value can be set for the average selectivity and/or for the average accuracy.
- a value for a selectivity and/or an accuracy with regard to the detection of objects in the respective image data set can be determined by means of the first metric for each of the new image data sets.
- a threshold value for the selectivity and/or the accuracy can be set in each case.
- the selectivity and/or the accuracy as well as the corresponding threshold values can be used to filter the number of image data that must be taken into account by an expert during subsequent annotation with the additional attribute. Remaining image data, however, do not need to be assessed manually, thus increasing the efficiency of the evaluation process.
- object data of incorrectly recognized objects of an output data set which were generated by the deep neural network by means of inference from such new image data sets for which the threshold value of the first metric was not met, can be extended by an attribute.
- an output data set contains object data from incorrectly detected objects.
- corresponding incorrectly detected objects can be identified. If the threshold value for the first metric was not met for an image data set, the corresponding object data of incorrectly detected objects in the output data sets can be assigned the attribute and evaluated as critical and/or less critical false detections.
- the attributes can be determined based on a third metric and object information from the ground truth object data and/or object information from the object data.
- One metric could be, for example, a time to collision (TTC), whereby distance information between relevant objects and a vehicle can be used as object information.
- TTC time to collision
- the distance information can, for example, be contained as annotations in the ground truth object data or in the object data.
- a vehicle speed could be included in the new image data sets. Objects that are within a braking distance for the vehicle or have a TTC below a corresponding threshold are assessed as critical. Objects further away can be annotated as less critical or non-critical.
- the object is achieved by a Computer program which, when executed on a computing unit within a computer system, instructs the respective computing unit to carry out the method.
- the object is achieved by a computer program product with a program code for carrying out the method, which is stored on a computer-readable medium.
- Figure 1 shows a block diagram of a system for evaluating and/or training a deep neural network
- Figure 2 shows a flow chart for a method according to the invention for evaluating a deep neural network
- Figure 3 shows an image dataset with an image of a vehicle environment and bounding boxes for pedestrians to be detected
- Figure 4 shows an evaluation dataset with the image and bounding boxes of detected and non-detected pedestrians
- Figure 5 shows the evaluation dataset after attribute assignment
- Figure 6 shows the evaluation dataset with bounding boxes of detected pedestrians and one critical non-detected pedestrian as well as one non-critical non-detected pedestrian.
- Figure 1 contains a block diagram of a deep neural network 10 (DNN) that has been trained to detect pedestrians in camera-based 2D image data from a vehicle environment.
- the DNN 10 has a number of feature extraction levels 11 and a number of perception levels 12.
- the feature extraction levels 11 are designed to generate a latent representation data set Z for current image data at an input 13 of the DNN 10 and to pass it on to the perception levels 12.
- the perception levels 12 are designed to generate latent representations from a to compare the current latent representation data set Z with a number of learned prototypes for different classes of objects (here: pedestrians) for similarity, so that objects in the 2D image data can be recognized, i.e. classified and localized based on this.
- the DNN 10 can, for example, be designed as a convolutional neural network (CNN), the architecture of which provides special convolution and pooling layers in the feature extraction layers 11.
- CNN convolutional neural network
- the feature extraction levels 11 map current image data of an image at an input 13 of the DNN 10, which have a number of pixels encoded in the three-dimensional RGB space (e.g. 2048 x 1024 pixels), into an n-dimensional latent space.
- Each latent representation encodes in n features (e.g. 256 features) semantic relationships between neighboring pixels of a receptive field that has been incorporated into the respective latent representation.
- How respective image data is mapped onto the latent representation data set Z is determined on the one hand by the network architecture of the feature extraction levels 11 of the DNN 10, and on the other hand by a number of associated weighting parameters that have been learned by machine learning using training data.
- the perception levels 12 of the DNN 10 have a number of prototypes that can be represented by a vector in the n-dimensional latent space. This means that all latent representations can be compared with a number of prototypes. The prototypes were also learned using machine learning from the training data. From the comparison, the DNN 10 generates object data that contains classes and positions of objects and that have been recognized based on the learned prototypes. The object data is output via an output 14 of the DNN 10 as an output data set for a downstream application.
- the DNN 10 can be implemented in a software module.
- the software module can be embedded in a vehicle control unit during a ferry operation, which comprises further hardware and software for an object recognition system.
- the software module can be executed on a computer system 2, which comprises a control algorithm 20.
- the control algorithm 20 With the control algorithm 20, the weighting parameters and prototypes can be gradually optimized during training of the DNN 10 through a sequence of training iteration steps and by minimizing an internal cost function.
- a training data set is required which includes image data of an image 30 with objects 31-36 to be recognized as well as ground truth object data 41-46 which contain the position and classification of the objects 31-36.
- the control algorithm 20 can be designed to compare the output data sets 60 generated by an already trained DNN 10 by means of inference with the associated ground truth object data 41-46, so that a comparison result can be evaluated using predetermined metrics.
- FIG 2 shows a flow chart for an exemplary embodiment of an evaluation method according to the invention for a deep neural network for object recognition.
- the DNN 10 has been trained to recognize pedestrians in 2D image data of an image from the front of a vehicle.
- Figures 3 to 6 also show enlarged representations of the image 30, which was recorded with a vehicle front camera, for example, during a development process for a pedestrian warning and emergency braking assistance system.
- the image 30 has not yet been included in an evaluation or training of the DNN 10 and thus represents a new image in the sense of the method.
- a front hood of a vehicle 1 is indicated, with whose front camera the traffic scene shown was recorded.
- the vehicle 1 is driving along a road that ends with a road junction with a road with right of way.
- a pedestrian crossing which is marked by corresponding wide lines on the road.
- a camera-based pedestrian detection system should at least be able to reliably detect all pedestrians who could enter the roadway of vehicle 1, either expectedly or unexpectedly, or cross a path of travel ahead of the vehicle, so that a warning and/or an emergency braking maneuver can be triggered in good time.
- new image data sets 50 are generated, with which existing image data sets are supplemented for training or evaluating pedestrian detection systems.
- a number of new image data are provided, which can contain many other new images of different traffic scenes in addition to the outlined new image 30.
- ground truth object data about the pedestrians to be recognized in the respective image are required. Therefore, for each new image, all pedestrians are marked using a bounding box, ie with a two-dimensional bounding box.
- each 2D bounding box is assigned a Object class information (here: pedestrian) and, if applicable, further information is included, which may, for example, contain distance information for a distance between the respective pedestrian and the vehicle.
- Figure 3 shows that six pedestrians 31-36 can be seen in the new image 30.
- the 2D bounding boxes can be drawn manually or with computer support around the respective pedestrian 31-36.
- the bounding box marks the position of a pixel in the image data that roughly corresponds to the center of a pedestrian shown in the image. Furthermore, the dimensions of the pedestrian are marked in the vertical and horizontal image directions.
- corresponding image data and the associated ground truth data sets 40 are combined to form a corresponding number of new image data sets 50.
- the new image data sets 50 are provided in a database of the computer system 2.
- the image data are fed to an input 13 of the DNN 10, which generates an output data set 60 for each of the image data sets 50 in the database of the computer system 2 by means of inference based on its current learning or training status.
- the output data set 60 for the new image 30 contains a number of four object data 62, 63, 65 and 66 with four pedestrians 32, 33, 35 and 36 that have been recognized by the DNN 10.
- the control algorithm 20 compares the initial data set 60 with the corresponding ground truth data set 40 for each of the new image data sets 50.
- the DNN 10 detects objects using an existing DNN 10.
- a sensitivity (recall) and precision are used as metrics, each of which must meet a threshold (recall threshold, RT; precision threshold, PT) for positive evaluation.
- RT recall threshold
- PT precision threshold
- the sensitivity or true positive rate is defined as the number of relevant objects found in the image data divided by the number of all relevant objects in the image.
- the accuracy is defined as the number of correctly recognized objects divided by the number of all objects found in the image data.
- Figure 4 shows the result of comparing the ground truth object data (41-46) of the ground truth data set 40 with the object data 62, 63, 65 and 66 of the initial data set 60 for the new image 30.
- Two bounding boxes with dotted lines each mark a false negative, i.e. unrecognized pedestrian 31 and 34.
- the four bounding boxes with continuous lines mark the pedestrians 32, 33, 35 and 36 that were correctly recognized positively by the DNN 10.
- average values for sensitivity log average recall, LAR
- accuracy log average precision, LAP
- log average recall threshold and log average precision threshold LART and LAPT
- the DNN 10 is positively evaluated for the new image data sets 50 in step 150. Retraining or additional training of the DNN 10 is not necessary.
- all of the evaluation data sets 70 for which the limit values of sensitivity and/or accuracy have not been met are output by the computer system 2 in the fifth step 130.
- the output evaluation data sets 70 are checked by an expert. Based on an expert assessment, the ground truth object data 41-46 of a respective image data set 50, ie, each annotated bounding box, is assigned a supplementary attribute 47 with which an application-specific criticality is determined for a pedestrian to be recognized.
- Figure 5 illustrates an assignment of attributes 47 to the ground truth object data 41-46 of an evaluation data set 70 output by the computer system 2 to the new image 30.
- the dotted bounding boxes visualize that the object recognition by the DNN 10 in the second step 105 did not recognize two pedestrians 31 and 34 (false negative recognition). For the remaining pedestrians 32, 33, 35 and 36, the inference of the DNN 10 matches the corresponding ground truth object data 42, 43, 45 and 46. All correctly recognized pedestrians are shown in the figure by a bounding box with a continuous line.
- those pedestrians in Figure 30 that are critical are those that are moving in the direction of travel within a certain distance from vehicle 1, which can correlate, for example, with a braking distance or with a time until a (possible) collision (time to collision, TTC).
- a lateral distance for critical pedestrians can be estimated, for example, based on a predicted travel path for vehicle 1.
- pedestrians 33 and 34 are assessed as non-critical for the application of a pedestrian warning and emergency braking assistance system.
- the two pedestrians 33 and 34 are therefore given an attribute 47 with the value "0" for non-critical.
- the remaining pedestrians 31, 32, 35 and 36 who are walking on the pedestrian crossing or moving in the direction of travel of vehicle 1 in front of the pedestrian crossing, are classified as critical and therefore each receive an attribute 47 with the value "1".
- the criticality of the pedestrians to be detected is therefore binary encoded in the present example.
- the assigned attributes 47 can be saved as extended ground truth object data 4T-46' in extended ground truth data sets 40' for each new image.
- the Initial data sets 60 are compared with the corresponding extended ground truth data sets 40' and correspondingly supplemented image data sets 50' and evaluated so that the corresponding evaluation data sets 70 can be replaced by supplemented evaluation data sets 70' in the database of the computer system 2.
- An annotation-specific sensitivity R' is determined based on the number of critically relevant objects found in the image data divided by the number of all critically relevant objects in the image.
- the pedestrian 31, which is marked by the bounding box with a dotted line, is assessed as an unrecognized critically relevant object.
- the unrecognized pedestrian 34 is assessed as a non-critical unrecognized object, which is marked in the figure by a bounding box with a dash-dotted line.
- the correctly recognized pedestrian 33 is marked by a bounding box with a dashed line.
- the correctly recognized pedestrians 32, 25 and 36, which are annotated as critically relevant objects, are marked in the figure by a bounding box with a solid line.
- no false-positive objects have been taken into account.
- the annotation with a supplementary attribute can, for example, be added to the respective output data set 60 and saved for each image data set 50 or 50'.
- missing or unreliable distance information for an object incorrectly recognized in the 2D image data can mean for an expert that it is difficult to classify objects into critical and non-critical in individual cases.
- average values for an annotation-specific sensitivity LAR' and annotation-specific accuracy LAP' are again determined from all, ie from the non-supplemented and the supplemented stored evaluation data sets 70 and 70' and compared with the corresponding threshold value LAPT and LART.
- the DNN 10 is positively evaluated for the new image data sets 50 and 50' in step 150. Retraining or additional training of the DNN 10 is not necessary.
- the DNN 10 is negatively evaluated for the new image data sets 50 or 50' in step 155.
- a negatively evaluated DNN 10 can then be subjected to an extension training, in which the supplemented image data sets 50' with the ground truth object data 40' supplemented by the attribute 27 can be incorporated as new training data sets.
- the control algorithm 20 can then be used to define areas in the image data of a training data set based on the attributes 27, which are ignored by the internal cost function for optimizing weighting parameters and prototypes.
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- General Physics & Mathematics (AREA)
- Multimedia (AREA)
- Evolutionary Computation (AREA)
- Health & Medical Sciences (AREA)
- Artificial Intelligence (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Computing Systems (AREA)
- Databases & Information Systems (AREA)
- General Health & Medical Sciences (AREA)
- Medical Informatics (AREA)
- Software Systems (AREA)
- Image Analysis (AREA)
Abstract
Die vorliegende Offenbarung betrifft ein Verfahren zum Evaluieren eines tiefen neuronalen Netzes (10), das auf eine Objekterkennung in Bilddaten aus einem Fahrzeugumfeld trainiert worden ist, mit folgenden Schritten: a) Bereitstellen (100) von neuen Bilddatensätzen (50), die jeweils Bilddaten eines neuen Bildes (30) und erzeugte Ground-Truth-Objektdaten (41-46) zusammenfassen; b) Erzeugen (105) eines Ausgabedatensatzes (60) mit Objektdaten (62-66) über erkannte Objekte zu jedem neuen Bilddatensatz (50) mittels Inferenz durch das tiefe neuronale Netz; c) Vergleichen (110) für jeden neuen Bilddatensatz (50) der erzeugten Objektdaten (62-66) mit den Ground-Truth-Objektdaten (41-46) und Bewerten (120) einer Objekterkennungsqualität basierend auf den Vergleichen und basierend auf ausgewählten Metriken; d) Erweiterten (130) der Ground-Truth-Objektdaten (41-46) um ein Attribut (47) für alle die neuen Bilddatensätze (50), bei denen ein Schwellwert einer ersten Metrik nicht eingehalten wurde; e) erneutes Vergleichen (135) für jeden neuen Bilddatensatz (50) der erzeugten Objektdaten (62-66) mit den Ground-Truth-Objektdaten (41-46; 41'-46'), und erneutes Bewerten (140) der Objekterkennungsqualität basierend auf den erneuten Vergleichen und basierend auf den ausgewählten Metriken und eingeflossenen Attributen (47), wobei das tiefe neuronale Netz (10) positiv evaluiert (150) wird, sofern von einer zweiten Metrik eine Anzahl zugeordneter Schwellwerte (LAPT, LAR) eingehalten worden sind.
Description
Beschreibung
Verfahren zum Evaluieren eines tiefen neuronalen Netzes
Technisches Gebiet
Die Erfindung betrifft ein Verfahren zum Evaluieren eines tiefen neuronalen Netzes, das auf eine Objekterkennung in Bilddaten aus einem Umfeld eines Kraftfahrzeuges trainiert worden ist.
Stand der Technik
Tiefe neuronale Netze zur Objekterkennung in Bilddaten, die für den Einsatz in fortgeschrittenen Fahrerassistenzsystemen (engl. advanced driver assistance systems, ADAS) oder in Systemen für das autonome bzw. automatisierte Fahren vorgesehen sind, werden als eine Komponente eine Objekterkennungseinrichtung zu einem bestimmten Zeitpunkt auf Basis vorhandener Bilddatensätze trainiert. Während eines nachfolgenden Entwicklungsprozesses entsprechender Assistenz- bzw. automatisierten Fahrfunktionen aber auch im späteren Serieneinsatz entsprechender Systeme können bei einer Erfassung eines Fahrzeugumfeldes mittels einer Fahrzeugkamera und Objekterkennung Eckfälle (engl. corner cases) auftreten, in denen Objekte einer Objektklasse, auf die das tiefe neuronale Netz ursprünglich trainiert worden ist, falsch oder nicht erkannt werden.
Während eines Entwicklungsprozesses oder auch während eines späteren Praxisbetriebes entsprechender Fahrzeugsysteme können Bilddaten von einer zugehörigen Fahrzeugkamera aufgezeichnet werden, so dass vorhandene Evaluierungs- und/oder Trainingsdatensätze, die zum Evaluieren oder Trainieren von tiefen neuronalen Netzen zur Objekterkennung dienen, um neue Bilddatensätze erweitert werden. Insbesondere können gezielt neue Bilddatensätze ausgewählt werden, die während kritischen Umgebungsbedingungen oder kritischen Verkehrsszenarien angefallen sind.
Eine übliche Vorgehensweise ist, die gewonnenen neuen Bilddatensätze für eine Evaluierung eines tiefen neuronalen Netzes heranzuziehen, um eine Objekterkennungsqualität eines trainierten neuronalen Netzes auch unter den neuen Corner-Case-Bedingungen zu Evaluieren. Als eine Metrik zur Bewertung der Objekterkennungsqualität kann beispielsweise eine protokollierte durchschnittliche Fehlerdetektionsrate (engl. Log-Average Miss Rate, LAMR) herangezogen werden, die bei einer Inferenzbildung zu einer Anzahl von neuen Bilddatensätze durch das tiefe neuronale Netz ermittelt wurden. Abhängig von einem Evaluierungsergebnis kann entscheiden werden, ob ein aktueller Trainingsstand zur Objekterkennung auch in Corner-Oases ausreicht oder nicht. Bei Identifizierung neuer
kritischer Fälle besteht Handlungsbedarf, so dass gegebenenfalls ein Ergänzungstraining in Form eines Neutrainings oder eines gezielten Nachtrainings des tiefen neuronalen Netzes für entsprechende Eckfälle erforderlich werden kann.
Ein gezieltes Nachtrainieren eines tiefen neuronalen Netzes auf eine Erkennung von Objekten unter entsprechenden Corner-Case-Bedingungen birgt jedoch stets das Risiko einer Überanpassung (engl. overfitting), wobei bisher unter Basisbedingungen robust erkannte Objekte, die für eine von der Objekterkennung abhängige Assistenz- oder Fahrfunktion ebenso kritisch sind, nicht mehr zuverlässig detektiert werden können.
Kurzbeschreibung der Erfindung
Vor diesem Hintergrund liegt der Erfindung die Aufgabe zugrunde, ein verbessertes Verfahren zum Evaluieren eines auf eine Objekterkennung in Bilddaten trainierten tiefen neuronalen Netzes bereitzustellen.
Vorgeschlagen wird dementsprechend ein Verfahren gemäß dem Hauptanspruch sowie ein Computerprogramm und ein Computerprogrammprodukt gemäß den Nebenansprüchen. Weiterführende Ausgestaltungen sind Gegenstand der jeweils abhängigen Ansprüche.
Gemäß einem ersten Aspekt der Erfindung wird die Aufgabe gelöst durch ein Verfahren zum Evaluieren eines tiefen neuronalen Netzes, das auf eine Objekterkennung in Bilddaten aus einem Umfeld eines Kraftfahrzeuges trainiert worden ist.
In einem ersten Schritt werden Bilddaten wenigstens eines neuen Bildes bereitgestellt, wobei für jedes neue Bild Ground-Truth-Objektdaten über in dem Bild zu erkennende Objekte erzeugt werden und wobei die Bilddaten jedes Bildes mit den erzeugten Ground- Truth-Objektdaten zu einem neuen Bilddatensatz zusammengefasst werden.
Die neuen Bilder können beispielsweise während eines Fährbetriebes von einer Fahrzeug-Frontkamera erfasst und als Bilddaten gespeichert worden sein. Die neuen Bilder können Bewegtbilder einer Verkehrssituation enthalten, die aus einer Fahrzeugperspektive unter realen Umgebungsbedingungen (z.B. Licht- und Sichtbedingungen) als Bilddaten aufgezeichnet worden sind. Die von dem tiefen neuronalen Netz zu erkennenden Objekte werden manuell oder mit automatisierten Werkzeugen in den neuen Bildern bzw. Bildsequenzen der Bilddaten markiert, indem beispielsweise ein zweidimensionaler Begrenzungsrahmen (engl. two-dimensional bounding-box, 2DBB) um eine Anzahl von Bildpunkten gezogen werden, die zu einem Objekt einer zuerkennenden Objektklassen gehören. Eine 2DBB kann ferner als Objekt einer entsprechenden Klasse annotiert werden.
In einem nachfolgenden zweiten Verfahrensschritt wird zu jedem neuen Bilddatensatz ein Ausgabedatensatz mit Objektdaten über erkannte Objekte mittels Inferenz durch das tiefe neuronale Netz gebildet.
In einem dritten Schritt werden die durch das tiefe neuronale Netz erzeugten Objektdaten mit den Ground-Truth-Objektdaten für jeden neuen Bilddatensatz verglichen. Einer Objekterkennungsqualität des neuronalen Netzes wird anschließend basierend auf den Vergleichen und basierend auf vorgegebenen Metriken bewertet.
Die Ground-Truth-Objektdaten werden in einem nachfolgenden vierten Schritt für alle die neuen Bilddatensätze, bei denen ein Schwellwert von einer ersten Metrik nicht eingehalten wurde, um ein Attribut erweitert.
In einem fünften Schritt werden für jeden neuen Bilddatensatz die, durch das tiefe neuronale Netz erzeugten Objektdaten erneut mit den Ground-Truth-Objektdaten verglichen. Anschließend wird die Objekterkennungsqualität des neuronalen Netzes basierend auf dem erneuten Vergleichen und basierend auf den vorgegebenen Metriken erneut bewertet, wobei vorhandene Attribute in die vorgegebenen Metriken einfließen.
Abschließend wird das tiefe neuronale Netz positiv evaluiert, sofern von einer zweiten Metrik eine Anzahl zugeordneter Schwellwerte eingehalten worden sind.
Eine positive Evaluierung bedeutet, dass die Objekterkennungsqualität des trainierten tiefen neuronalen Netzes zumindest den Anforderungen einer Applikation, d.h. eine jeweilige Assistenz bzw. Fahrfunktion, entspricht. Wird zumindest ein Schwellwert von der zweiten Metrik nicht eigehaltem, erfüllt die Objekterkennungsqualität die Anforderungen für eine jeweilige Zielapplikation nicht, so dass das tiefe neuronale Netz entsprechend negativ evaluiert wird.
Eine Idee hinter dem erfindungsgemäßen Verfahren ist, den Ground-Truth-Objektdaten zusätzlich um ein Attribut zu erweitern, mit dem eine Kritikalität jedes einzelnen aller relevanten Objekte in einem Bilddatensatz bewertet bzw. festgelegt werden kann. Ob ein einzelnes relevantes Objekt bei einer Objekterkennung kritisch oder weniger kritisch bzw. unkritisch ist, ist von einer jeweiligen nachgelagerten Applikation abhängig, die die jeweiligen Ausgabedatensätze mit Objektdaten über erkannte Objekte empfängt und als Eingangsparameter für eine Assistenz- bzw. automatisierte Fahrfunktion verarbeitet.
Das Attribut fließt über die Ground-Truth-Objektdaten in eine jeweilige Metrik zur Bewertung der Objekterkennungsqualität des tiefen neuronalen Netzes ein, so dass die als weniger bzw. unkritische festgelegten Objekte weniger stark bzw. nicht in eine Bewertung
einfließen. Die Metriken bewerten die Ground-Truth-Objektdaten aller erweiterten Bilddatensätze, somit annotationsspezifisch.
Gemäß einer Weiterbildung des Verfahrens kann das tiefe neuronale Netz bereits nach dem dritten Schritt positiv evaluiert werden, sofern von der zweiten Metrik alle zugeordneten Schwellwerte eingehalten worden sind. Entsprechend können dann die Schritte vier bis fünf übersprungen werden.
Die Frage, ob ein einzelnes relevantes Objekt in einem neuen Bild kritisch oder weniger kritisch ist, beruht unter anderem auf Expertenwissen in Bezug auf die jeweilige Applikation, mit der die Ausgabedatensätze der Objekterkennung genutzt werden. Ein zusätzliches Annotieren der 2DBB mit einem entsprechenden Attribut erfolgt daher in der Regel manuell. Sind die Bedingungen für eine positive Evaluierung bereits erfüllt, kann eine zeitaufwendiges Annotieren kritischer Objekte in einzelnen Bilddatensätzen eingespart werden.
Gemäß einer Weiterbildung des Verfahrens können mittels der zweiten Metrik über alle neuen Bilddatensätze Werte für eine durchschnittliche Selektivität und/oder eine durchschnittliche Genauigkeit hinsichtlich einer Erkennung von Objekten in den Bilddatensätzen ermittelt werden. Ferner kann jeweils ein Schwellwert für die durchschnittliche Selektivität und/oder für die durchschnittliche Genauigkeit festgelegt werden.
Bei einer Objekterkennung in Bilddaten kommen hautsächlich zwei mögliche Fehlerkategorien in Betracht. Zum einem können in einem Bild vorhandene Objekte von dem tiefen neuronalen Netz in den Bilddaten nicht erkannt werden (Falsch-Negativ-Erkennung). Zum anderen können in den Bilddaten durch das tiefe neuronale Netz Objekte erkannt werden, die im Bild nicht vorhanden sind (Falsch-Positiv-Erkennung). Die Fehlerarten können auf eine nachgelagerte Applikation unterschiedliche Auswirkungen haben. Eine Bewertung mittels durchschnittlicher Selektivität und Genauigkeit kann applikationsspezifisch aussagekräftiger sein als eine Fehlerdetektionsrate pro Bild bzw. eine durchschnittliche Fehlerdetektionsrate über eine Anzahl neuer Bilder. Die entsprechenden Schwellwerte für die durchschnittliche Selektivität und/oder Genauigkeit basieren auf Expertenwissen und werden entsprechend festgelegt.
Gemäß einer Weiterbildung des Verfahrens kann mittels der ersten Metrik für jeden der neuen Bilddatensätze jeweils ein Wert für eine Selektivität und/oder eine Genauigkeit hinsichtlich einer Erkennung von Objekten in dem jeweiligen Bilddatensatz ermittelt werden. Ferner kann jeweils ein Schwellwert für die Selektivität und/oder für die Genauigkeit festgelegt werden.
Durch die Selektivität und/oder die Genauigkeit sowie durch die korrespondierenden Schwellwerte kann die Anzahl der Bilddaten gefiltert werden, die bei einem nachträglichen Annotieren mit dem zusätzlichen Attribut durch einen Experten berücksichtigt werden müssen. Verbleibenden Bilddaten brauchen hingegen nicht manuell begutachtet werden, so dass sich die Effizienz des Evaluierungsverfahrens erhöht.
Gemäß einer Weiterbildung des Verfahrens können in dem vierten Schritt ferner Objektdaten von falsch-erkannten Objekten eines Ausgabedatensatzes, die mittels Inferenz aus solchen neuen Bilddatensätzen durch das tiefe neuronale Netz erzeugt wurden, bei denen der Schwellwert der ersten Metrik nicht eingehalten wurde, um ein Attribut erweitert werden.
Werden in den Bilddaten durch das tiefe neuronale Netz Objekte erkannt, die im Bild nicht vor-handen sind (Falsch-Positiv-Erkennung), so enthält ein Ausgangsdatensatz entsprechend Objektdaten von falsch-erkannte Objekten. Bei dem Vergleich zwischen Bilddatensätzen und Ausgabedatensätzen können entsprechende falsch-erkannten Objekte identifiziert werden. Wurde für eine Bilddatensatz der Schwellwert für die erste Metrik nicht eingehalten, können die entsprechenden Objektdaten falsch-erkannter Objekte betreffender Ausgangsdatensätze mit dem Attribut versehen werden und als kritische und/oder weniger kritische Falscherkennungen bewertet werden.
Gemäß einer Weiterbildung des Verfahrens können die Attribute basierend auf einer dritten Metrik und einer Objektinformation aus den Ground-Truth-Objektdaten und/oder einer Objektinformation aus den Objektdaten bestimmt werden.
Damit kann eine automatisierte Kritikalitätsbewertung durch ein Computersystem von nicht-erkannten und/oder falsch erkannten Objektdaten ermöglicht werden, so dass eine Expertentätigkeit unterstütz oder ersetzt werden kann. Als eine Metrik könnte beispielsweise eine Zeit bis zu einer (möglichen) Kollision (engl. time to collision, TTC) dienen, wobei als Objektinformationen zum Beispiel Abstandsinformationen zwischen relevanten Objekten und einem Fahrzeug herangezogen werden können. Die Abstandsinformationen können zum Beispiel als Annotationen in den Ground-Truth-Objektdaten bzw. in den Objektdaten enthalten sein. Ferner könnte eine Fahrzeuggeschwindigkeit in den neuen Bilddatensätzen enthalten sein. Objekte, die innerhalb eines Bremsweges für das Fahrzeug bzw. eine TTC unter einen entsprechenden Schwellwert haben, werden als kritisch bewertet. Weiter entfernte Objekte können als weniger kritisch bzw. als unkritisch annotiert werden.
Nach einem weiteren Aspekt der Erfindung wird die Aufgabe gelöst durch ein
Computerprogramm, das, wenn es auf einer Recheneinheit innerhalb eines Computersystems ausgeführt wird, die jeweilige Recheneinheit anleitet, das Verfahren auszuführen.
Nach einem weiteren Aspekt der Erfindung wird die Aufgabe gelöst durch ein Computerprogrammprodukt mit einem Programmcode zur Durchführung des Verfahrens, der auf einem von einem Computer lesbaren Medium gespeichert ist.
Kurze Beschreibung der Zeichnungsfiguren
Weitere Merkmale und Einzelheiten ergeben sich aus der nachfolgenden Beschreibung, in der - gegebenenfalls unter Bezug auf die Zeichnung - zumindest ein Ausführungsbeispiel im Einzelnen beschrieben ist. Beschriebene und/oder bildlich dargestellte Merkmale bilden für sich oder in beliebiger, sinnvoller Kombination den Gegenstand, gegebenenfalls auch unabhängig von den Ansprüchen, und können insbesondere zusätzlich auch Gegenstand einer oder mehrerer separater Anmeldungen sein. Gleiche, ähnliche und/oder funktionsgleiche Teile sind mit gleichen Bezugszeichen versehen. Dabei zeigen:
Figur 1 zeigt ein Blockdiagramm eines Systems zum Evaluieren und/oder trainieren eines tiefen neuronalen Netzes;
Figur 2 zeigt Flussdiagramm für ein erfindungsgemäßen Verfahrens zum Evaluieren eines tiefen neuronalen Netzes;
Figur 3 zeigt einen Bilddatensatz mit einem Bild einer Fahrzeugumgebung und Begrenzungsrahmen für zu erkennende Fußgänger;
Figur 4 zeigt einen Evaluierungsdatensatz mit dem Bild sowie mit Begrenzungsrahmen von erkannten und nicht-erkannten Fußgänger;
Figur 5 zeigt den Evaluierungsdatensatz nach einer Zuordnung von Attributen;
Figur 6 zeigt den Evaluierungsdatensatz mit Begrenzungsrahmen von erkannten Fußgängern und einem kritischen nicht-erkannten Fußgänger sowie einem unkritischen nicht-erkannten Fußgänger.
Beschreibung der Ausführungsarten
In der Figur 1 ist ein Blockdiagramm eines tiefen neuronalen Netzes 10 (engl. deep neural network, DNN) enthalten, das auf eine Erkennung von Fußgänger, in kamerabasierten 2D-Bilddaten aus einem Fahrzeugumfeld trainiert worden ist. Das DNN 10 besitzt eine Anzahl von Merkmalsextrationsebenen 11 und eine Anzahl von Perzeptionsebenen 12.
Die Merkmalsextrationsebenen 11 sind ausgebildet, für aktuelle Bilddaten an einem Eingang 13 des DNN 10 jeweils einen latenten Repräsentationsdatensatz Z zu erzeugen und an die Perzeptionsebenen 12 weiterzugeben.
Die Perzeptionsebenen 12 sind ausgebildet, latente Repräsentationen aus einem
aktuellen latenten Repräsentationsdatensatz Z mit einer Anzahl von gelernten Prototypen für verschiedene Klassen von Objekten (hier: Fußgänger) auf Ähnlichkeit hin zu vergleichen, so dass darauf basierend Objekte in den 2D-Bilddaten erkannt, d.h. klassifiziert und lokalisiert werden können.
Das DNN 10 kann zum Beispiel als ein faltendes neuronales Netzwerk (engl. convolutional neural network, CNN) ausgebildet sein, dessen Architektur in den Merkmalsextrationsebenen 11 spezielle Faltungs- und Bündelungsebenen (engl. convolution and pooling layers) vorsieht.
Die Merkmalsextrationsebenen 11 bilden aktuelle Bilddaten eines Bildes an einem Eingang 13 des DNN 10, die eine im dreidimensionalen RGB-Fahrraum kodierte Anzahl von Bildpunkten (z.B. 2048 x 1024 Pixel) besitzen, in einen n-Dimensionalen latenten Raum (engl. latent space) ab. Jede latente Repräsentation kodiert in n Merkmalen (z.B. 256 Merkmale) semantische Beziehungen zwischen benachbarten Bildpunkten eines rezeptiven Feldes (engl. receptive field), das in die jeweilige latente Repräsentation eingeflossen ist. Wie jeweilige Bilddaten auf den latenten Repräsentationsdatensatz Z abgebildet werden, bestimmt sich einerseits durch die Netzarchitektur der Merkmalsextrationsebenen 11 des DNN 10, andererseits durch eine Anzahl zugehöriger Gewichtungsparameter, die mittels maschinellen Lernens anhand von Trainingsdaten gelernt worden sind.
Die Perzeptionsebenen 12 des DNN 10 besitzen eine Anzahl Prototypen, die durch einen Vektor in dem n-dimensionalen latenten Raum darstellbar sind. Somit können alle latenten Repräsentationen jeweils mit einer Anzahl von Prototypen verglichen werden. Auch die Prototypen sind mittels maschinellen Lernens anhand der Trainingsdaten gelernt worden. Aus dem Vergleich werden durch das DNN 10 Objektdaten erzeugt, die Klassen und Positionen von Objekten enthalten und die basierend auf den gelernten Prototypen erkannt worden sind. Die Objektdaten werden über einen Ausgang 14 des DNN 10 als Ausgangsdatensatz für eine nachgelagerte Applikation ausgegeben.
Das DNN 10 kann in einem Softwaremodul implementiert sein. Das Softwaremodul kann währen eines Fährbetriebs in einem Fahrzeugsteuergerät eingebettet sein, dass weitere Hard- und Software für ein Objekterkennungssystems umfasst. Zu Trainings- oder Evaluierungszwecken kann das Softwaremodul auf einem Computersystem 2 ausgeführt werden, das einen Steueralgorithmus 20 umfasst. Mit dem Steueralgorithmus 20 können während eines Trainings des DNN 10 die Gewichtungsparameter und Prototypen durch eine Folge von Trainingsiterationsschritten und durch Minimieren einer internen Kostenfunktion schrittweise optimiert werden. Für jeden Trainingsiterationsschritt eines Trainings
wird jeweils ein Trainingsdatensatz benötigt, der Bilddaten eines Bildes 30 mit zu erkennenden Objekten 31-36 sowie Ground-Truth-Objektdaten 41-46 umfasst, die Position und Klassifizierung der Objekte 31-36 enthalten. Ferner kann der Steueralgorithmus 20 ausgebildet sein, die von einem bereits trainierten DNN 10 mittels Inferenz erzeugten Aus- gangsdatensäte 60 mit den zugehörigen Ground-Truth-Objektdaten 41-46 zu Vergleichen, so dass ein Vergleichsergebnis mittels vorbestimmter Metriken bewertet werden kann.
Die Figur 2 zeigt ein Flussdiagramm für eine beispielhafte Ausgestaltung eines erfindungsgemäßen Evaluierungsverfahrens für ein tiefes neuronales Netz zur Objekterkennung dargestellt. Das DNN 10 ist gemäß dem dargestellten Beispiel auf die Erkennung von Fußgängern in 2D-Bilddaten eines Bildes aus einem vorderen Umfeld eines Fahrzeuges trainiert worden. In den Figuren 3 bis 6 sind ergänzend vergrößerte Darstellung des Bildes 30 gezeigt, das beispielsweise während eines Entwicklungsprozesses eines Fuß- gängerwarn- und Notbrems-Assistenzsystems mit einer Fahrzeugfrontkamera aufgenommen worden ist. Das Bild 30 ist noch nicht in eine Evaluierung oder in ein Training des DNN 10 eingeflossen und stellt somit ein neues Bild im Sinne des Verfahrens dar. Am unteren Rand des neuen Bildes 30 ist ein Fronthaube eines Fahrzeuges 1 angedeutet, mit dessen Frontkamera die dargestellte Verkehrsszene aufgenommen worden ist. Das Fahrzeug 1 fährt in einem Moment der Aufnahme eine Straße entlang, die mit einer Straßeneinmündung in eine vorfahrtsberechtigte Straße endet. Unmittelbar vor der Straßeneinmündung befindet sich ein Fußgängerüberweg, der durch entsprechende breite Linien auf der Fahrbahn markiert ist. In der dargestellten Szene ist eine Anzahl von Fußgängern 31- 36 zu erkennen, die zumindest teilweise in einen vorausliegenden Fahrweg des Fahrzeuges eingetreten sind oder in diesen eintreten können. Eine kamerabasierte Fußgängererkennung soll zumindest alle die Fußgänger zuverlässig erkennen können, die erwartet oder unerwartet die Fahrbahn des Fahrzeugs 1 betreten bzw. einen vorausliegenden Fahrweg bzw. Fahrschlauch des Fahrzeugs queren könnten, so dass rechtzeitig eine Warnung und/oder ein Notbremsmanöver ausgelöst werden kann.
In einem ersten Schritt 100 des Verfahrens werden neue Bilddatensätze 50 erzeugt, mit den vorhandene Bilddatensätze zum Trainieren bzw. Evaluieren von Systemen zur Fußgängererkennung ergänzt werden. Dazu wird eine Anzahl neuer Bilddaten bereitgestellt, die neben dem skizzierten neuen Bild 30 viele weitere neue Bilder von unterschiedlichen Verkehrsszenen enthalten können. Für jedes neue Bild werden Ground-Truth-Objektdaten, über die im jeweiligen Bild zu erkennenden Fußgänger benötigt. Daher werden für jedes neue Bild alle Fußgänger jeweils mittels eines Begrenzungsrahmens, d.h. mit einer zweidimensionalen Bounding-Box markiert. Ferner wird jeder 2D-Bounding-Box eine
Objektklasseninformation (hier: Fußgänger) und ggf. weitere Informationen beigefügt, die beispielsweise eine Abstandsinformation für eine Entfernung zwischen dem jeweiligen Fußgänger und dem Fahrzeug enthalten können.
Der Figur 3 ist zu entnehmen, dass in dem neuen Bild 30 sechs Fußgänger 31-36 zu erkennen sind. Die 2D-Bounding-Boxen können manuell bzw. computerunterstütz um den jeweiligen Fußgänger 31-36 gezeichnet werden. Durch den Begrenzungsrahmen wird die Position eines Bildpunktes in den Bilddaten gekennzeichnet, der etwa mit einem Mittelpunkt eines im Bild abgebildeten Fußgängers übereinstimmt. Ferner werden die Dimensionen des Fußgängers in vertikaler und horizontaler Bildrichtung gekennzeichnet. Die 2D- Bounding-Boxen bilden zusammen mit den beigefügten Annotationen einen Ground- Truth-Datensatz 40, der sechs Ground-Truth-Objektdaten 41-46 für die in dem neuen Bild 30 sechs zu erkennenden Fußgänger 31-36 umfasst.
Für das neue Bild 30 und für jedes weitere neue Bild werden entsprechende Bilddaten und die zugehörigen Ground-Truth-Datensätze 40 zu einer entsprechenden Anzahl neuer Bilddatensätze 50 kombiniert.
In einem zweiten Schritt 105 werden die neuen Bilddatensätze 50 in einer Datenbank des Computersystems 2 bereitgestellt. Für jeden neuen Bilddatensatz 50 werden die Bilddaten auf einen Eingang 13 des DNN 10 gegeben, das mittels Inferenz, basierend auf seinem aktuellen Lern- bzw. Trainingsstandes, für jeden der Bilddatensätze 50 in der Datenbank des Computersystems 2 einen Ausgangsdatensatz 60 erzeugt.
Der Ausgangsdatensatz 60 für das neue Bild 30 enthält eine Anzahl von vier Objektdaten 62, 63, 65 und 66 mit vier Fußgängern 32, 33, 35 und 36, die vom DNN 10 erkannt worden sind.
Durch den Steueralgorithmus 20 wird in einem anschließenden dritten Schritt 110 der Ausgangsdatensatz 60 mit dem entsprechenden Ground-Truth-Datensatz 40 für jeden der neuen Bilddatensätze 50 verglichen. Bei einer Objekterkennung mittels eines vorliegenden DNN 10 gibt es im Wesentlichem zwei mögliche Fehlerarten. Zum einen können Fußgänger, die in einem neuen Bild zu erkennen sind und im Grund-Truth-Datensatz mittels einer annotierten Bounding-Box gekennzeichnet worden sind, von dem DNN 10 in den Bilddaten nicht erkannt werden (Falsch-Negativ-Erkennung). Andererseits können Fußgänger in Bilddaten von dem DNN 10 erkannt werden, die in dem Bild nicht vorhanden sind (Falsch-Positiv-Erkennung).
Für die Bewertung einer Objekterkennung eines DNN kann eine Sensitivität (engl. recall)
und eine Genauigkeit (engl. precision) als Metrik herangezogen werden, die jeweils einen Schwellwert (engl. recall threshold, RT; precision threshold, PT) für positiven Evaluierung einhalten müssen.
Die Sensitivität bzw. Richtig-Positiv-Rate definiert sich aus der Anzahl von den in den Bilddaten gefundenen relevanten Objekte dividiert durch die Anzahl aller relevanter Objekte in dem Bild. Die Genauigkeit ist definiert durch die Anzahl der korrekt erkannten Objekte dividiert durch die Anzahl aller in den Bilddaten gefundenen Objekte.
In der Figur 4 wird das Ergebnis aus dem Verglich der Ground-Truth-Objektdaten (41-46) des Ground-Truth-Datensatz 40 mit den Objektdaten 62, 63, 65 und 66 des Ausgangsdatensatz 60 für das neue Bild 30 dargestellt. Durch zwei Begrenzungsrahmen mit Punktlinien wird jeweils ein falsch-negativ, d.h. ein nicht erkannter Fußgänger 31 und 34 gekennzeichnet. Die vier Begrenzungsrahmen mit durchgehendem Linienzug kennzeichnen die durch das DNN 10 richtig-positiv erkannten Fußgänger 32, 33, 35 und 36. Das DNN 10 hat in dem vorliegenden Beispiel keinen Fußgänger falsch-positiv erkannt. Daraus ergibt sich eine Sensitivität von %, d.h. R = 0,66, und eine Genauigkeit von 1 , d.h. P = 1. Wurde für die Sensitivität ein unterer Schwellwert von z.B. RT = 0,70 vorgegeben, wird das DNN 10 für den neuen Bilddatensatz 50 des Bildes 30 negativ evaluiert. Das Ergebnis wird als ein Evaluierungsdatensatz 70 von dem Steueralgorithmus 20 ausgegeben und in der Datenbank des Computersystem 2 gespeichert.
Sobald der Vergleich in dem dritten Schritt 110 für alle neuen Bilddatensätze 50 abgeschlossen wurde, können aus den gespeicherten Evaluierungsdatensätzen 70 Durchschnittswerte für Sensitivität (engl. log average recall, LAR) und Genauigkeit (log average precision, LAP) ermittelt und mit einem zugehörigen Schwellwert (log average recall threshold und log average precision threshold, LART und LAPT) verglichen werden.
Wird in dem vierten Schritt 120 festgestellt, dass die Durchschnittswerte von Sensitivität LAR und Genauigkeit LAP der gespeicherten Evaluierungsdatensätze 70 ihre jeweiligen Schwellwerte einhalten (LAP > LAPT A LAR > LART), wird das DNN 10 für die neuen Bilddatensätze 50 in dem Schritt 150 positiv evaluiert. Ein Neutraining oder Nach- bzw. Ergänzungstraining des DNN 10 ist nicht erforderlich.
Wird in dem vierten Schritt 120 hingegen festgestellt, dass die Durchschnittswerte von Sensitivität und/oder Genauigkeit ihre Schwellwerte nicht einhalten (LAP < LAPT v LAR < LART), werden in dem fünften Schritt 130 alle die Evaluierungsdatensätze 70 von dem Computersystem 2 ausgegeben, für die die Grenzwerte von Sensitivität und/oder Genauigkeit nicht eingehalten worden sind.
Die ausgegebenen Evaluierungsdatensätze 70 wenden von einem Experten geprüft. Auf Basis einer Experteneinschätzung wird den Ground-Truth-Objektdaten 41-46 eines jeweiligen Bilddatensatzes 50, d.h. zu jeder annotierten Bounding Box wird ein ergänzendes Attribut 47 zugeordnet, mit dem eine applikationsspezifische Kritikalität für einen zu erkennenden Fußgänger festgelegt wird.
Die Figur 5 veranschaulicht eine Zuordnung von Attributen 47 zu den Ground-Truth-Ob- jektdaten 41-46 eines von dem Computersystem 2 ausgegebenen Evaluierungsdatensatz 70 zu dem neuen Bild 30. Durch die gepunkteten Begrenzungsrahmen wird visualisiert, dass das die Objekterkennung durch das DNN 10 im zweiten Schritt 105 zwei Fußgänger 31 und 34 nicht erkannt hat (Falsch-Negativ-Erkennung). Für die verbleibenden Fußgänger 32, 33, 35 und 36 stimmt die Inferenz des DNN 10 mit den korrespondierenden Ground-Truth-Objektdaten 42, 43, 45 und 46 überein. Alle richtig erkannten Fußgänger werden in der Figur durch einen Begrenzungsrahmen mit durchgehendem Linienzug dargestellt.
Für ein Fußgängerwarn- und Notbrems-Assistenzsystem sind solche Fußgänger im Bild 30 kritisch, die sich in Fahrtrichtung innerhalb eines bestimmten Abstandes zum Fahrzeug 1 bewegen, der beispielsweise mit einem Bremsweg oder mit einer Zeit bis zu einer (möglichen) Kollision (engl. time to collision, TTC) korrelieren kann. Ein seitlicher Abstand für kritischer Fußgänger kann zum Beispiel anhand eines prognostizierten Fahrschlauchs für das Fahrzeuges 1 abgeschätzt werden.
Basierend auf einer Experteneinschätzung werden die Fußgänger 33 und 34, die sich auf einer gegenüberliegenden Straßenseite der Straßeneinmündung befinden, als unkritisch für die Applikation eines Fußgängerwarn- und Notbrems-Assistenzsystems eingeschätzt. Die zwei Fußgänger 33 und 34 erhalten somit ein Attribut 47 mit dem Wert „0“ für unkritisch. Die verbleibenden Fußgänger 31 , 32, 35 und 36, die auf dem Fußgängerüberweg laufen oder sich in Fahrtrichtung des Fahrzeuges 1 vor dem Fußgängerüberweg bewegen, werden als kritisch eingestuft und erhalten folglich jeweils ein Attribut 47 mit dem Wert „1“. Die Kritikalität von den zu erkennenden Fußgängern wird im vorliegenden Beispiel also binär kodiert. Die zugewiesenen Attribute 47 können als erweiterte Grund-Truth- Objektdaten 4T-46' in erweiterten Ground-Truth-Datensätzen 40‘ zu jedem neuen Bild gespeichert werden.
Sobald die Ground-Truth-Objektdaten aller Evaluierungsdatensätzen 70, die von dem Computersystem 2 ausgewählt und ausgegebenen wurden, mit dem Attribut 47 ergänzt worden sind, werden in einem nachfolgenden sechsten Schritt 135 erneut die
Ausgangsdatensätze 60 mit den entsprechenden erweiterten Ground-Truth-Datensätzen 40‘ entsprechend ergänzter Bilddatensätze 50‘ verglichen und bewertet, so dass die entsprechenden Evaluierungsdatensätze 70 durch ergänzte Evaluierungsdatensätze 70‘ in der Datenbank des Computersystems 2 ersetzt werden können.
Für die Bewertung der Objekterkennung wird erneut eine Sensitivität und eine Genauigkeit als Metrik mit den Schwellwerten herangezogen, wobei die in den Bilddaten gefundenen bzw. nicht gefundenen Fußgängerobjekte abhängig von dem jeweiligen Attribut der erweiterten Ground-Truth-Objektdaten nunmehr in eine annotationsspezifische Metrik einfließen.
Eine annotationsspezifische Sensitivität R‘ wird bestimmt basierend auf der Anzahl von den in den Bilddaten gefundenen kritisch relevanten Objekte dividiert durch die Anzahl aller kritisch relevanter Objekte in dem Bild.
In der Figur 6 ist zu erkennen, dass der Fußgänger 31 , der durch den Begrenzungsrahmen mit einer Punktlinie gekennzeichnet ist, als nicht-erkanntes kritisch relevantes Objekt gewertet wird. Der nicht-erkannte Fußgänger 34 wird als ein unkritisches nicht-erkanntes Objekt gewertet, der in der Figur durch einen Begrenzungsrahmen mit einer Strichpunktlinie gekennzeichnet ist. Der korrekt erkannte Fußgänger 33 ist durch einen Begrenzungsrahmen mit einer Strichlinie gekennzeichnet. Die korrekt erkannten und als kritisch relevante Objekte annotierten Fußgänger 32, 25 und 36 sind in der Figur durch einen Begrenzungsrahmens mit einer durchgehenden Linie gekennzeichnet.
Von insgesamt vier in dem Bild 30 als kritisch relevant annotierten Fußgänger 31 , 32, 35 und 36 wurden von dem DNN 10 drei kritisch relevante Fußgänger 32, 35 und 36 in den Bilddaten mittels Inferenz gefunden. Die annotationsspezifische Sensitivität R‘ beträgt somit % (R‘ = 0,75), die sich gegenüber der nicht-annotationsspezifische Sensitivität R = 0,66 für das neue Bild 30 erhöht hat.
In dem vorliegenden Beispiel sind keine falsch-positiv erkannte Objekte berücksichtigt worden. Grundsätzlich ist es aber auch hier möglich, ausgehend von entsprechend ausgegebenen Evaluierungsdatensätze 70 eine ergänzende Annotation vorzunehmen. Die Annotation mit einem ergänzenden Attribut kann beispielsweise dem jeweiligen Ausgangsdatensatz 60 hinzugefügt und für jeden Bilddatensatz 50 bzw. 50‘ gespeichert werden. Jedoch kann eine fehlende oder unzuverlässige Abstandinformation eines in den 2D- Bilddaten falsch erkannten Objektes für einen Experten bedeuten, dass eine Einteilung in kritische und unkritische Objekte im Einzelfall schwierig einzuschätzen ist.
In dem sechsten Schritt 135 wird ferner erneut aus allen, d.h. aus den nicht-ergänzten und den ergänzten gespeicherten Evaluierungsdatensätzen 70 und 70‘ Durchschnittswerte für eine annotationsspezifische Sensitivität LAR‘ und annotationsspezifische Genauigkeit LAP' ermittelt und mit dem entsprechenden Schwellwert LAPT und LART verglichen.
Wird anschließend in dem siebten Schritt 140 festgestellt, dass die annotationsspezifischen Metriken LAR‘ und LAP' ihre Schwellwerte LAPT und LART nun einhalten (LAP' > LAPT A LAR‘ > LART), wird das DNN 10 für die neuen Bilddatensätze 50 bzw. 50‘ in dem Schritt 150 positiv evaluiert. Ein Neutraining oder Nach- bzw. Ergänzungstraining des DNN 10 ist nicht erforderlich.
Wird in dem sechsten Schritt 135 hingegen festgestellt, dass die annotationsspezifischen Metriken LAR‘ und/oder LAP' ihre Schwellwerte LAPT bzw. LART weiterhin nicht einhalten (LAP‘ < LAPT v LAR‘ < LART), wird das DNN 10 für die neuen Bilddatensätze 50 bzw. 50‘ in dem Schritt 155 negativ evaluiert.
Ein negativ evaluiertes DNN 10 kann nachfolgend einem Erweiterungstraining unterzogen werden, in die ergänzten Bilddatensätze 50‘ mit den, um das Attribut 27 ergänzten Ground-Truth-Objektdaten 40‘ als neue Trainingsdatensätze einfließen können. Mit dem Steueralgorithmus 20 können dann basierend auf den Attributen 27 Bereiche in den Bilddaten eines Trainingsdatensatzes definiert werden, die von der internen Kostenfunktion zur Optimierung von Gewichtungsparameter und Prototypen ignoriert werden.
Obwohl der Gegenstand im Detail durch Ausführungsbeispiele näher illustriert und erläutert wurde, so ist die Erfindung nicht durch die offenbarten Beispiele eingeschränkt und andere Variationen können vom Fachmann hieraus abgeleitet werden. Es ist daher klar, dass eine Vielzahl von Variationsmöglichkeiten existiert. Es ist ebenfalls klar, dass beispielhaft genannte Ausführungsformen nur Beispiele darstellen, die nicht in irgendeiner Weise als Begrenzung etwa des Schutzbereichs, der Anwendungsmöglichkeiten oder der Konfiguration der Erfindung aufzufassen sind. Vielmehr versetzen die vorhergehende Beschreibung und die Figurenbeschreibung den Fachmann in die Lage, die beispielhaften Ausführungsformen konkret umzusetzen, wobei der Fachmann in Kenntnis des offenbarten Erfindungsgedankens vielfältige Änderungen beispielsweise hinsichtlich der Funktion oder der Anordnung einzelner, in einer beispielhaften Ausführungsform genannter Elemente vornehmen kann, ohne den Schutzbereich zu verlassen, der durch die Ansprüche und deren rechtliche Entsprechungen, wie etwa weitergehenden Erläuterungen in der Beschreibung, definiert wird.
Liste der Bezugszeichen
1 Fahrzeug
2 Computersystem
10 Tiefes neuronales Netz
11 Merkmalsextraktionsebenen
12 Perzeptionsebenen
13 Eingang
14 Ausgang
20 Steueralgorithmus
21 erster Eingang
22 zweiter Eingang
30 Bild
31 Fußgänger
40 Ground-T ruth-Datensatz
41-46 Ground-T ruth-Objektdaten
41‘-46‘ erweiterte Grund-T ruth-Objektdaten
50 Bilddatensatz
60 Ausgangsdatensatz
70 Evaluierungsdatensatz
100-155 Schritte
P Genauigkeit
P‘ annotationsspezifische Genauigkeit
R Sensitivität
R‘ annotationsspezifische Sensitivität
LAP Durchschnittswerte für Genauigkeit
LAP' Durchschnittswerte für annotationsspezifische Genauigkeit
LAR Durchschnittswerte für Sensitivität
LAR' Durchschnittswerte für annotationsspezifische Sensitivität
LA PT Schwellwert für durchschnittliche Genauigkeit
LART Schwellwert für durchschnittliche Sensitivität
Claims
1. Verfahren zum Evaluieren eines tiefen neuronalen Netzes (10), das auf eine Objekterkennung in Bilddaten aus einem Umfeld eines Kraftfahrzeuges (1) trainiert worden ist, umfassen folgende Schritte: a) Bereitstellen (100) von Bilddaten wenigstens eines neuen Bildes (30), wobei für jedes neue Bild (30) Ground-Truth-Objektdaten (41-46) über in dem Bild (30) zu erkennende Objekte (31-36) erzeugt werden und wobei die Bilddaten jedes Bildes (30) mit den erzeugten Ground-Truth-Objektdaten (41-46) zu einem neuen Bilddatensatz (50) zusammengefasst werden; b) Erzeugen (105) eines Ausgabedatensatzes (60) mit Objektdaten (62-66) über erkannte Objekte zu jedem neuen Bilddatensatz (50) mittels Inferenz durch das tiefe neuronale Netz; c) Vergleichen (110) für jeden neuen Bilddatensatz (50) der durch das tiefe neuronale Netz (10) erzeugten Objektdaten (62-66) mit den Ground-Truth-Objektdaten (41-46) und Bewerten (120) einer Objekterkennungsqualität des neuronalen Netzes (10) basierend auf dem Vergleichen und basierend auf ausgewählten Metriken; d) Erweiterten (130) der Ground-Truth-Objektdaten (41-46) um ein Attribut (47) für alle die neuen Bilddatensätze (50), bei denen ein Schwellwert einer ersten Metrik nicht eingehalten wurde; e) erneutes Vergleichen (135) für jeden neuen Bilddatensatz (50) der durch das tiefe neuronale Netz (10) erzeugten Objektdaten (62-66) mit den Ground-Truth- Objektdaten (41-46; 4T-46‘), und erneutes Bewerten (140) der Objekterkennungsqualität des neuronalen Netzes (10) basierend auf den erneuten Vergleichen und basierend auf den ausgewählten Metriken, wobei vorhandene Attribute (47) in die ausgewählten Metriken einfließen, wobei das tiefe neuronale Netz (10) positiv evaluiert (150) wird, sofern von einer zweiten Metrik eine Anzahl zugeordneter Schwellwerte (LAPT, LAR) eingehalten worden sind.
2. Verfahren gemäß vorstehendem Anspruch, wobei das tiefe neuronale Netz (10) bereits nach dem Schritt c) positiv Evaluiert (150) wird, sofern von der zweiten Metrik alle zugeordneten Schwellwerte (LAPT, LAR) eingehalten worden sind.
3. Verfahren gemäß einem der vorstehenden Ansprüche, wobei mittels der zweiten Metrik über alle neuen Bilddatensätze (50) Werte für eine durchschnittliche Selektivität (LAP; LAP‘) und/oder eine durchschnittliche Genauigkeit (LAR; LAR‘) hinsichtlich einer Erkennung von Objekten (31-36) in den Bilddatensätzen (50) ermittelt werden und wobei jeweils ein Schwellwert für die durchschnittliche Selektivität (LART) und/oder für die durchschnittliche Genauigkeit (LAPT) festgelegt wird.
4. Verfahren gemäß einem der vorstehenden Ansprüche, wobei mittels der ersten Metrik für jeden der neuen Bilddatensätze (50) jeweils ein Wert für eine Selektivität (P) und/oder eine Genauigkeit (P) hinsichtlich einer Erkennung von Objekten in dem jeweiligen Bilddatensatz (50) ermittelt werden und wobei jeweils ein Schwellwert für die Selektivität (RT) und/oder für die Genauigkeit (PT) festgelegt wird.
5. Verfahren gemäß einem der vorstehenden Ansprüche, wobei in dem Schritt d) ferner Objektdaten von falsch-erkannten Objekten eines Ausgabedatensatzes (60), die mittels Inferenz aus solchen neuen Bilddatensätzen (50) durch das tiefe neuronale Netz (10) erzeugt wurden, bei denen der Schwellwert der ersten Metrik nicht eingehalten wurde, um ein Attribut erweitert werden.
6. Verfahren gemäß einem der vorstehenden Ansprüche, wobei mit den Attributen (47) entsprechende Ground-Truth-Objektdaten (41-46) neuer Bilddatensätzen (50) und/oder entsprechende Objektdaten von Ausgabedatensätzen als kritische oder als unkritische Objekte annotiert werden.
7. Verfahren gemäß einem der vorstehenden Ansprüche, wobei die Attribute basierend auf einer dritten Metrik und einer Objektinformation aus den Ground-Truth-Objektdaten (41- 46) und/oder einer Objektinformation aus den Objektdaten bestimmt wird.
8. Verfahren gemäß einem der vorstehenden Ansprüche, wobei alle die neuen Bilddatensätze (50), bei denen ein Schwellwert von der ersten Metrik nicht eingehalten wurde, für ein Erweiterungstraining des tiefen neuronalen Netzes (10) ausgegeben werden.
9. Computerprogramm, das, wenn es auf einer Recheneinheit innerhalb eines Computersystems (2) ausgeführt wird, die jeweilige Recheneinheit anleitet, ein Verfahren nach einem der vorstehenden Ansprüche 1 bis 8 auszuführen.
10. Computerprogrammprodukt mit einem Programmcode, der auf einem von einem Computer lesbaren Medium gespeichert ist zur Durchführung des Verfahrens nach einem der Ansprüche 1 bis 8.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| DE102023200110.1A DE102023200110A1 (de) | 2023-01-10 | 2023-01-10 | Verfahren zum Evaluieren eines tiefen neuronalen Netzes |
| PCT/EP2023/085030 WO2024149540A1 (de) | 2023-01-10 | 2023-12-11 | Verfahren zum evaluieren eines tiefen neuronalen netzes |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| EP4649461A1 true EP4649461A1 (de) | 2025-11-19 |
Family
ID=89426636
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP23832682.1A Pending EP4649461A1 (de) | 2023-01-10 | 2023-12-11 | Verfahren zum evaluieren eines tiefen neuronalen netzes |
Country Status (3)
| Country | Link |
|---|---|
| EP (1) | EP4649461A1 (de) |
| DE (1) | DE102023200110A1 (de) |
| WO (1) | WO2024149540A1 (de) |
Families Citing this family (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| DE102024206881A1 (de) | 2024-07-22 | 2026-01-22 | Robert Bosch Gesellschaft mit beschränkter Haftung | Bewertung der Leistung eines Objektdetektionssystems für Fahrzeuge und Roboter |
Family Cites Families (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US11270438B2 (en) * | 2020-06-12 | 2022-03-08 | Samasource Impact Sourcing, Inc. | System and method for triggering machine learning (ML) annotation model retraining |
-
2023
- 2023-01-10 DE DE102023200110.1A patent/DE102023200110A1/de active Pending
- 2023-12-11 EP EP23832682.1A patent/EP4649461A1/de active Pending
- 2023-12-11 WO PCT/EP2023/085030 patent/WO2024149540A1/de not_active Ceased
Also Published As
| Publication number | Publication date |
|---|---|
| WO2024149540A1 (de) | 2024-07-18 |
| DE102023200110A1 (de) | 2024-07-11 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| DE102006057552B4 (de) | System und Verfahren zur Messung des Abstands eines vorausfahrenden Fahrzeugs | |
| EP3292510B1 (de) | Verfahren und vorrichtung zur erkennung und bewertung von fahrbahnreflexionen | |
| DE102013207575A1 (de) | Objekterkennungsvorrichtung | |
| EP2629243A1 (de) | Verfahren zum Erkennen und Verfolgen von Fahrspurmarkierungen | |
| DE102021002798A1 (de) | Verfahren zur kamerabasierten Umgebungserfassung | |
| DE102018215055A1 (de) | Verfahren zum Bestimmen einer Spurwechselangabe eines Fahrzeugs, ein computerlesbares Speichermedium und ein Fahrzeug | |
| DE102017203276B4 (de) | Verfahren und Vorrichtung zur Ermittlung einer Trajektorie in Off-road-Szenarien | |
| DE102011001037A1 (de) | Fahrzeuginterne Vorrichtung zur Weiß-Linien-Erkennung | |
| DE102017216802A1 (de) | Verfahren und vorrichtung zum erkennen von fahrspuren, fahrerassistenzsystem und fahrzeug | |
| DE102019214558A1 (de) | Projektionsinformations-erkennungsvorrichtung auf basis eines künstlichen neuronalen netzwerks und verfahren derselben | |
| DE102015206546A1 (de) | Fahrbahnmarkierungserkennungsvorrichtung | |
| DE102020112825A1 (de) | Verfahren zum Erfassen von relevanten statischen Objekten innerhalb einer Fahrspur sowie Recheneinrichtung für ein Fahrerassistenzsystem eines Fahrzeugs | |
| DE102017215138A1 (de) | Verfahren und Vorrichtung zum Erkennen ergänzender Verkehrszeichen | |
| WO2024149540A1 (de) | Verfahren zum evaluieren eines tiefen neuronalen netzes | |
| DE102024100521A1 (de) | Bildgestützte generierung von beschreibenden und wahrnehmungs-nachrichten von automobilszenen | |
| DE102021206475A1 (de) | Hindernisdetektion im Gleisbereich auf Basis von Tiefendaten | |
| DE102018205539A1 (de) | Erkennung von Objekten und Situationen in Messdaten mit verbesserter Unterdrückung nicht-repräsentativer Korrelationen | |
| DE102018109680A1 (de) | Verfahren zum Unterscheiden von Fahrbahnmarkierungen und Bordsteinen durch parallele zweidimensionale und dreidimensionale Auswertung; Steuereinrichtung; Fahrassistenzsystem; sowie Computerprogrammprodukt | |
| DE102021117386B4 (de) | System und verfahren zur steuerung eines autonomen parkens von fahrzeugen | |
| DE102019204187A1 (de) | Klassifizierung und temporale Erkennung taktischer Fahrmanöver von Verkehrsteilnehmern | |
| DE102022206131A1 (de) | Klassifikator und Verfahren für die Erkennung von Objekten aus Sensordaten auf der Basis einer vorgegebenen Klassenhierarchie | |
| WO2023247356A1 (de) | Verfahren und assistenzsystem zum unterstützen einer fahrzeugführung basierend auf einem fahrschlauch und einer begrenzungsschätzung und kraftfahrzeug | |
| DE102018114912A1 (de) | Verfahren zum Klassifizieren einer Farbe einer Fahrbahnmarkierung mittels eines statistischen Fahrbahnmarkierungsbestimmungsmodells, elektronische Recheneinrichtung sowie Fahrerassistenzsystem | |
| DE102022126904A1 (de) | Nachbarfahrspurdetektion auf der Basis von Fahrspurmodellen | |
| DE102024208093A1 (de) | Verfahren zum Trainieren einer Objekterkennung zur Lokalisierung und Klassifizierung von Objekten in einem Fahrzeugumfeld |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: UNKNOWN |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE |
|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE |
|
| 17P | Request for examination filed |
Effective date: 20250723 |
|
| AK | Designated contracting states |
Kind code of ref document: A1 Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR |
|
| DAV | Request for validation of the european patent (deleted) | ||
| DAX | Request for extension of the european patent (deleted) |