EP4320600A1 - Computerimplementiertes verfahren und system zum trainieren eines maschinellen lernverfahrens - Google Patents

Computerimplementiertes verfahren und system zum trainieren eines maschinellen lernverfahrens

Info

Publication number
EP4320600A1
EP4320600A1 EP22720432.8A EP22720432A EP4320600A1 EP 4320600 A1 EP4320600 A1 EP 4320600A1 EP 22720432 A EP22720432 A EP 22720432A EP 4320600 A1 EP4320600 A1 EP 4320600A1
Authority
EP
European Patent Office
Prior art keywords
frames
future
machine learning
objects
ego vehicle
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Withdrawn
Application number
EP22720432.8A
Other languages
English (en)
French (fr)
Inventor
Saikiran Kannaiah
Jonas Riebel
Benjamin Wagner
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
ZF Friedrichshafen AG
Original Assignee
ZF Friedrichshafen AG
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by ZF Friedrichshafen AG filed Critical ZF Friedrichshafen AG
Publication of EP4320600A1 publication Critical patent/EP4320600A1/de
Withdrawn legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T7/00Image analysis
    • G06T7/20Analysis of motion
    • G06T7/246Analysis of motion using feature-based methods, e.g. the tracking of corners or segments
    • G06T7/248Analysis of motion using feature-based methods, e.g. the tracking of corners or segments involving reference images or patches
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V20/00Scenes; Scene-specific elements
    • G06V20/50Context or environment of the image
    • G06V20/56Context or environment of the image exterior to a vehicle by using sensors mounted on the vehicle
    • G06V20/58Recognition of moving objects or obstacles, e.g. vehicles or pedestrians; Recognition of traffic objects, e.g. traffic signs, traffic lights or roads
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T7/00Image analysis
    • G06T7/70Determining position or orientation of objects or cameras
    • G06T7/73Determining position or orientation of objects or cameras using feature-based methods
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/20Image preprocessing
    • G06V10/24Aligning, centring, orientation detection or correction of the image
    • G06V10/242Aligning, centring, orientation detection or correction of the image by image rotation, e.g. by 90 degrees
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/766Arrangements for image or video recognition or understanding using pattern recognition or machine learning using regression, e.g. by projecting features on hyperplanes
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/77Processing image or video features in feature spaces; using data integration or data reduction, e.g. principal component analysis [PCA] or independent component analysis [ICA] or self-organising maps [SOM]; Blind source separation
    • G06V10/774Generating sets of training patterns; Bootstrap methods, e.g. bagging or boosting
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/77Processing image or video features in feature spaces; using data integration or data reduction, e.g. principal component analysis [PCA] or independent component analysis [ICA] or self-organising maps [SOM]; Blind source separation
    • G06V10/776Validation; Performance evaluation
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/82Arrangements for image or video recognition or understanding using pattern recognition or machine learning using neural networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2207/00Indexing scheme for image analysis or image enhancement
    • G06T2207/10Image acquisition modality
    • G06T2207/10016Video; Image sequence
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2207/00Indexing scheme for image analysis or image enhancement
    • G06T2207/20Special algorithmic details
    • G06T2207/20081Training; Learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2207/00Indexing scheme for image analysis or image enhancement
    • G06T2207/30Subject of image; Context of image processing
    • G06T2207/30204Marker
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2207/00Indexing scheme for image analysis or image enhancement
    • G06T2207/30Subject of image; Context of image processing
    • G06T2207/30241Trajectory
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2207/00Indexing scheme for image analysis or image enhancement
    • G06T2207/30Subject of image; Context of image processing
    • G06T2207/30248Vehicle exterior or interior
    • G06T2207/30252Vehicle exterior; Vicinity of vehicle
    • G06T2207/30261Obstacle

Definitions

  • the invention relates to a computer-implemented method for training a machine learning method for recognizing future trajectories of objects in relation to an ego vehicle.
  • the invention also relates to a system.
  • An autonomous or fully autonomous vehicle is a vehicle capable of sensing its surroundings and navigating with little or no user input. This is done through the use of sensor devices such as radar, lidar systems, cameras, ultrasound and the like.
  • the vehicle analyzes the sensor data with regard to the course of the road, other road users and their trajectory. Furthermore, the vehicle must react appropriately to the recorded data and calculate control commands based on the recorded data and forward these to actuators in the vehicle.
  • an autonomous vehicle In order for an autonomous vehicle to reach its destination, it not only has to perceive and interpret its surroundings, but also predict what could happen in the future. These predictions are on the order of one to three seconds, for example when a road user turns off or a pedestrian crosses the street, so that the autonomous vehicle can plan/replan its future route safely and without colliding.
  • DE 10 2018222 542 A1 discloses a method for predicting the trajectory of at least one controlled object, using a physical measurement determined current position of the object is provided, at least one anticipated destination of the movement of the object is provided; using physical observations of the object, and/or the environment in which the object is moving. At least one anticipated preference is determined which occurs when the object is steered towards the at least one anticipated destination.
  • the object is achieved by a computer-implemented method for training a machine learning method for recognizing future trajectories of objects in relation to an ego vehicle with the features of claim 1.
  • the object is also achieved by a system with the features of claim 12.
  • the object is achieved by a computer-implemented method for training a machine learning method for recognizing future trajectories of objects in relation to an ego vehicle, comprising the steps:
  • Frames are, so to speak, traffic scenarios (a single traffic scenario) at a certain point in time.
  • the frames can be viewed as individual images of the traffic scenarios that follow one another over time. Traffic scenarios can therefore be constructed from frames of traffic scenarios that follow one another in time.
  • the ego pose is essentially at least the orientation of the ego vehicle.
  • Ground truth traffic scenarios are the traffic scenarios that actually occur; i.e. the traffic scenarios that really occur after the first point in time up to the second point in time with the trajectories actually driven by the road users after the first point in time.
  • a traffic scenario can consist of a number/amount of different moving objects (bicycles/cars/pedestrians) and/or stationary objects (traffic lights/road signs) in the vicinity of the ego vehicle.
  • Fixed objects such as traffic signs, road markings, traffic lights, pedestrian crossings and obstacles are in a precisely defined position.
  • Moving objects such as bicycles, cars, etc. exhibit dynamic behavior (trajectory) such as speed, acceleration/deceleration, distance from the center line of the road, etc.
  • the term “ego vehicle” can be understood as the vehicle whose surroundings are to be monitored.
  • the ego vehicle can in particular be a fully or partially autonomously driving motor vehicle for traffic on roads, which is intended to steer at least partially independently.
  • sensors etc. are usually arranged on the ego vehicle, which can detect the surroundings using sensors.
  • a trajectory designates a set of positions and orientations linked in time and space, i.e. a route taken by a road user along or in the frame.
  • all frames are oriented based on the ego pose, so that the ego movement and ego rotation is only depicted because the ego vehicle itself is not specified.
  • the last two seconds of the traffic scenarios are selected as historical frames and represent the input training data with the ground truth frames.
  • the machine learning method trained using the method according to the invention makes it possible to create a prediction of the object trajectories on the basis of the complete frame as input.
  • a machine learning method for example an artificial neural network, is also trained in a simplified manner by the method according to the invention.
  • the machine learning method is trained using the complete knowledge about, for example, the lanes and traffic rules (static objects) as training data.
  • the learning process learned in this way can now include this knowledge in the prediction.
  • the entire previous knowledge about road users is used in the machine learning method trained according to the invention.
  • the learned machine learning process can also include this in the later predictions.
  • the past movements of road users and the category to which this road user belongs such as e.g. B. pedestrians, cars, trucks, bicycles, etc., by input of the complete frames into the learning process trained with it. Based on this, it is possible for the machine learning method trained with it to later take all road users into account without affecting the computing time.
  • the social interactions can be taken into account. Based on this, it is possible for the machine learning method trained with it to later take these social interactions into account when predicting the future movement of road users.
  • a machine learning method for generating anticipatory traffic scenarios can be trained using historical frames and ground truth frames.
  • an improved machine learning method can be generated, which provides an improved prediction of the trajectories of moving objects in its environment.
  • a machine learning method is trained using the complete frames and thus the entire map information and the entire social interactions as well as the history of the historical trajectory as input and can accordingly achieve better results after training.
  • the machine learning method trained using the method is thus able to determine all trajectories in the traffic scenarios around the ego vehicle at once in advance.
  • only a constant time is required for the prediction, which is independent of the number of road users, for example by including the social interaction of the respective road users in the prediction and, for example, the prior historical knowledge about the road users in the future traffic scenarios to be determined be included.
  • the objects are in the form of both static objects and moving objects, with the static objects and the moving objects be identified as markers at least by their size and shape. Each object is preferably represented by its original size and length and width. Furthermore, static objects and moving objects can be identified as markers using different colors. For this purpose, an RGB color palette is used that displays all available map information such as lane centers and lane boundaries. For example, road users can be displayed in gray.
  • the historical frames as well as the ground truth frames and the future frames generated by the machine learning method have a time stamp.
  • each moving gray object represents a point in time when the frame was created. This allows the time steps in connection with the objects to be displayed together in one frame. The decoding of the objects in relation to their history and the associated time step is therefore given in the data structure itself.
  • the frames are designed as an image section from a respective traffic scenario, with each image section being formed by a specified radius around the coordinates of the ego vehicle, so that the ego vehicle is centered in the middle of the image section.
  • This enables better tracking of the moving objects from the perspective of the ego vehicle and faster processing. Since all frames contain the tracking of all objects and their poses, only those objects that can be perceived from the perspective of the ego vehicle are required to determine relevant trajectories.
  • the individually generated frames reduced by the image detail thus only contain objects that are visible to this specific ego vehicle in its field of vision.
  • the radius can be chosen freely. In particular, one can be selected as 50 m.
  • All frames are based on the Ego coordinates, ie the coordinates of the ego vehicle and the direction centered and oriented so that the ego movement and ego rotation is only represented by this and the ego vehicle itself is not indicated.
  • the ego vehicle is always in the middle of a frame as the coordinate origin.
  • the historical trajectory of moving objects i.e. road users
  • the expected future trajectories generated by the machine learning method are determined on the basis of the future frames.
  • the future trajectories are extracted from the future frames generated by the machine learning process and assigned to the associated object (road users).
  • the future frames are preferably rotated according to the ego pose in order to obtain the same orientation as the ego vehicle or the historical frames; i.e. the historical and future frames are aligned to each other.
  • Ego pose means the position and orientation of the ego vehicle.
  • the contours and thus the objects (road users) and their trajectories are preferably further recognized and their pose, i.e. orientation and coordinates, determined and compared with the pose of the individual road users in the historical frames. This allows an assignment to be made. If the assignment has been obtained as a result, the future trajectories can be assigned to the known road users.
  • the future trajectories of moving objects are determined on the basis of the ground truth frames.
  • the machine learning method can then be trained using the historical trajectories from the historical frames and the future trajectories determined by the machine learning method.
  • a machine learning method can be taught in a targeted manner, for example by means of iterative gradient methods.
  • a quality of the machine learning method is determined by determining the difference between the ground truth trajectories and the expected future trajectories generated by the machine learning method as the mean absolute error MAE:
  • the traffic scenarios can be simulated in virtual space in a bird's-eye view. This makes it easy to generate the historical frames as well as the ground truth frames.
  • the machine learning method is a deep learning method, which is trained using a gradient method.
  • This learning process can be designed as a deep neural network, for example. Based on the trajectories or the frames, the network can be learned iteratively using gradient descent.
  • a decoder-encoder structure can be used as the architecture of the artificial neural network.
  • the artificial neural network can be a convolutional network, in particular a deep convolutional neural network.
  • the encoder is responsible for compressing the input signal using convolution and transforming the input into a low-dimensional vector.
  • the decoder is responsible for the restoration. The decoder then transforms the low-dimensional vector into the desired output.
  • the object is also achieved by a system for training a machine learning method for recognizing future trajectories of objects in relation to an ego vehicle, comprising:
  • - a storage unit for providing chronologically consecutive global traffic scenarios as chronologically consecutive frames in a global coordinate system, the global traffic scenarios having objects and all objects in the global traffic scenarios being marked with different markers,
  • a processor for determining the ego pose of the ego vehicle in the chronologically consecutive frames and for transforming the frames with the marked objects based on the determined ego pose in a local coordinate system as a local traffic scenario, so that the respective frame has the same orientation how the ego vehicle has, the transformed frames being used as historical frames up to a first point in time and the transformed frames being used as ground truth frames from the first point in time to a second point in time,
  • the processor for training the machine learning method using the historical frames, for determining future local traffic scenarios up to a second point in time as future frames and comparing the future frames generated by the machine learning method with the corresponding ground truth frames.
  • FIG 1 different historical frames
  • FIG 2 immovable objects in a frame
  • FIG 3 the ground truth frames
  • FIG 4 the historical frames and ground truth frames as a table
  • FIG 5 stacked frames as a single frame
  • FIG 6 encoder and decoder of the neural network
  • FIG 7 a calculated future trajectory.
  • sensors with which the autonomous vehicle is equipped are used, which record the environment. The recorded sensor data must be processed and interpreted.
  • a machine learning method can, for example, be a neural one network are used. However, this must be reliably trained in order to correctly interpret the sensor data received.
  • the computer-implemented method for training the machine learning method for recognizing future trajectories of objects in relation to an ego vehicle can be used.
  • the current and previous positions of a road user in Cartesian coordinates can be used.
  • the trajectories or trajectory data are therefore inherent time series data.
  • the traffic scenarios are preferably represented by objects.
  • the objects can essentially be divided into static and moving objects (road users).
  • Static objects are, for example, roadways and roadway borders, traffic lights, traffic signs, etc.
  • Movable objects here are primarily road users such as cars, pedestrians and cyclists. These generate a so-called trajectory. Trajectory denotes a set of temporally and spatially linked positions and orientations, i.e. the travel route of the moving object.
  • traffic scenarios are preferably created/simulated using a data set based on simulation data. Furthermore, the traffic scenarios are preferably simulated in relation to different cities in order to ensure that the simulation data is of sufficient quality. In this way, large amounts of different traffic scenarios can be generated, which can be used to train the machine learning process.
  • Each traffic scenario is represented as a frame.
  • the historical frames indicate the history, i.e. in the case of moving objects, the trajectory that has already been driven.
  • Each object is preferably represented by its original size and length and width.
  • static objects and moving objects can be identified by different colors as markers (RGB color palette) in the simulation.
  • RGB color palette is used to display all available map information such as lane centers and lane boundaries.
  • Road users or their historical trajectories 3 can thus be displayed in gray in each of the simulated historical frames 1a, . . . , 1e and ground truth frames 2a, . . . , 2e.
  • 1 shows various historical frames 1a, .., 1e, which contain the trajectories 3 of all objects.
  • the frames and thus the objects are rotated around the ego pose so that they correspond to the view from the ego vehicle.
  • the trajectory 3, here of an individual object, is recognized as it were by the fact that the historical frames 1a, 1e can be displayed/perceived as an image sequence.
  • the frames 1a, . . . are displayed which can be perceived from the perspective of the ego vehicle, i.e. which would be perceived from the "ego perspective".
  • the ego vehicle or its coordinates are thus centered in the middle of the image section (origin of coordinates). This enables better tracking of the objects from the perspective of the ego vehicle and faster processing. Since all frames include the tracking of all objects and their poses, the ego vehicle itself does not need to be shown in the frames.
  • the individually generated frames with a reduced image section then only contain objects that are visible to this specific ego vehicle in its field of vision.
  • the radius can be chosen freely. In particular, one can be selected as 50 m. This ensures that all moving and immobile objects are detected, which are necessary to autonomously control the ego vehicle for the next few seconds / minutes.
  • the objects are centered in the direction of the ego vehicle, so that the ego vehicle with the ego coordinates is in the center, i.e. the origin of the coordinates is here, so that the ego movement and ego rotation is only mapped through and that Ego vehicle itself is not specified.
  • the ego vehicle is always in the middle of the respective frame 1a, 1e, and is not shown.
  • immovable objects can be displayed, which are also displayed rotated around the pose of the ego vehicle.
  • the various lanes 5 are shown in green (dashed here) as an example of immovable objects.
  • FIG 4 shows the representation of the historical frames 1a, .1, e and ground truth frames 2a, 2e as a table.
  • FIG. 5 shows such an image, in which individual frames have been placed one on top of the other as an image sequence, so to speak, for recognizing different objects and object trajectories, shown here as an example of an object trajectory 6 .
  • a machine learning method is then trained, preferably using the historical frames 1a, . . . , 1e and the ground truth frames 2a, . . . , 2e.
  • Such a learning method is preferably designed as an artificial deep neural network, which is described in more detail in FIG.
  • This is preferably designed as an encoder and decoder, which are trained iteratively using a gradient method.
  • the artificial neural network can use the trajectories 3, 4 from the historical frames 1a, . . . 1e and the ground truth frames 2a, . . . 2e and/or the frames 1a, . . . 1e, 2a, ... 2e itself can be learned iteratively by means of the gradient descent.
  • the neural network can be a convolutional network, in particular a deep convolutional neural network.
  • the encoder is responsible for compressing the input signal using convolution.
  • the decoder is responsible for recovering inputs.
  • the encoder transforms the input into a low-dimensional vector.
  • the decoder then transforms the low-dimensional vector into the desired output.
  • GNA network Geneative Adversarial Networks
  • the neural network uses the historical frames 1a, . . . 1e to calculate the future frames.
  • the trajectories can then be extracted from the future frames calculated by the neural network and assigned to the associated object (road users).
  • the future frames are preferably first rotated according to the ego pose in order to obtain the same orientation as the ego vehicle or the historical frames; i.e. the historical frames 1a, .. , 1e and future frames are aligned in the same way. Then, in the rotated future frames, the contours and thus the objects (road users) are preferably still recognized and their pose, i.e. orientation and coordinates, are determined and compared with the pose of the individual known objects at time tO. If an assignment has been obtained as a result, the future trajectories can be assigned to the known road users or objects.
  • FIG. 7 shows a calculated future trajectory, with the last six steps in FIG. 7 being summarized as “prediction (right) trajectory” and a ground truth trajectory (left).
  • the machine learning method can be evaluated using the soft-dice-loss method (similarity measure function). This indicates the degree of overlap between the future bird's-eye view frames and the ground truth bird's-eye view frames in relation to the original object size.
  • a quality of the machine learning method can be determined by determining the difference between the ground truth trajectories 4 and the expected future trajectories generated by the machine learning method as the mean absolute error MAE: (ground truth trajectories) ; — (future trajectories) ;
  • the neural network can be trained using the method according to the invention in such a way that it uses map information and driving context when predicting the future trajectories of road users, as well as prior knowledge about the road users when predicting the future trajectories of road users, as well as social interactions when prediction of future trajectories between road users.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Multimedia (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Evolutionary Computation (AREA)
  • Health & Medical Sciences (AREA)
  • Artificial Intelligence (AREA)
  • Computing Systems (AREA)
  • Databases & Information Systems (AREA)
  • General Health & Medical Sciences (AREA)
  • Medical Informatics (AREA)
  • Software Systems (AREA)
  • Traffic Control Systems (AREA)
  • Image Analysis (AREA)

Abstract

Die Erfindung betrifft ein computerimplementiertes Verfahren zum Trainieren eines maschinellen Lernverfahrens zur Erkennung zukünftiger Trajektorien von Objekten in Bezug auf ein Ego-Fahrzeug gekennzeichnet, umfassend der Schritte: − Bereitstellen von zeitlich aufeinanderfolgenden globalen Verkehrsszenarien als zeitlich aufeinanderfolgenden Frames in einem globalen Koordinatensystem, − Kennzeichnen aller Objekte in den globalen Verkehrsszenarien mit verschiedenen Markern, − Bestimmen der Ego-Pose des Ego-Fahrzeugs in den zeitlich aufeinanderfolgenden Frames, − Transformieren der Frames mit den markierten Objekten anhand der bestimmten Ego-Pose jeweils in ein lokales Koordinatensystem als lokales Verkehrsszenario, so dass der jeweilige Frame die gleiche Orientierung wie das Ego- Fahrzeug im jeweiligen Frame aufweist und die Koordinaten des Ego-Fahrzeuges der Koordinatenursprung sind, so dass die lokalen Verkehrsszenarien die gleiche Orientierung wie das Ego-Fahrzeug aufweisen, wobei die transformierten Frames bis zu einem ersten Zeitpunkt als historische Frames verwendet werden und die transformierten Frames von dem ersten Zeitpunkt bis zu einem zweiten Zeitpunkt als Ground Truth Frames verwendet werden, − Trainieren des maschinellen Lernverfahrens anhand der historischen Frames (1a,..,1e), zur Bestimmung von zukünftigen lokalen Verkehrsszenarien bis zu einem zweiten Zeitpunkt als zukünftige Frames und Abgleich der durch das maschinelle Lernverfahren erzeugten zukünftigen Frames mit den korrespondierenden Ground Truth Frames (2a,..,2e). Ferner betrifft die Erfindung ein entsprechendes System.

Description

Computerimplementiertes Verfahren und System zum Trainieren eines maschinellen
Lernverfahrens
Die Erfindung betrifft ein computerimplementiertes Verfahren zum Trainieren eines maschinellen Lernverfahrens zur Erkennung zukünftiger Trajektorien von Objekten in Bezug auf ein Ego-Fahrzeug. Ferner betrifft die Erfindung ein System.
Ein autonomes oder vollautonomes Fahrzeug ist ein Fahrzeug, das in der Lage ist, seine Umgebung zu erfassen und mit wenig oder keiner Benutzereingabe zu navigie ren. Dies geschieht durch den Einsatz von Sensorvorrichtungen wie Radar, Lidarsys- teme, Kamera, Ultraschall und dergleichen.
Das Fahrzeug analysiert die Sensordaten hinsichtlich Straßenverlauf, anderen Ver kehrsteilnehmer sowie deren Trajektorie. Ferner muss das Fahrzeug entsprechend auf die erfassten Daten reagieren und entsprechend den erfassten Daten Steuerbe fehle berechnen und diese an Aktuatoren im Fahrzeug weiterleiten.
Damit ein autonomes Fahrzeug sein Ziel erreichen kann, muss es seine Umgebung d.h. sein Umfeld jedoch nicht nur wahrnehmen und interpretieren, sondern auch Vor hersagen, was in der Zukunft passieren könnte. Diese Vorhersagen liegen dabei etwa in der Größenordnung von ein bis drei Sekunden, beispielsweise wenn ein Ver kehrsteilnehmer abbiegt oder ein Fußgänger die Straße überquert, damit das auto nome Fahrzeug sicher und kollisionsfrei seinen zukünftigen Weg planen/umplanen kann.
Den zukünftigen Weg oder die Trajektorie von Verkehrsteilnehmern in der Umgebung des autonomen Fahrzeugs Vorhersagen zu können, stellt derzeit eine Herausforde rung für den Betrieb autonomer Fahrzeuge dar. Dies stellt insbesondere bei immer steigenden Verkehr und einer immer größeren Sensordatendichte eine besondere Schwierigkeit dar.
Die DE 10 2018222 542 A1 offenbart ein Verfahren zur Vorhersage der Trajektorie mindestens eines gesteuerten Objekts, wobei eine durch physikalische Messung ermittelte aktuelle Position des Objekts bereitgestellt wird, mindestens ein voraus sichtliches Ziel der Bewegung des Objekts bereitgestellt wird; unter Heranziehung von physikalischen Beobachtungen des Objekts, und/oder der Umgebung, in der sich das Objekt bewegt. Es wird mindestens eine voraussichtliche Präferenz ermittelt, die bei der Steuerung des Objekts in Richtung auf das mindestens eine voraussichtliche Ziel erfolgt.
Es ist daher eine Aufgabe der Erfindung ein Verfahren und ein System anzugeben, mit welchem die Trajektorie von Verkehrsteilnehmern besser vorhergesagt werden kann.
Die Aufgabe wird gelöst durch ein computerimplementiertes Verfahren zum Trainie ren eines maschinellen Lernverfahrens zur Erkennung zukünftiger Trajektorien von Objekten in Bezug auf ein Ego-Fahrzeug mit den Merkmalen des Anspruchs 1. Fer ner wird die Aufgabe gelöst durch ein System mit den Merkmalen des Anspruchs 12.
Vorteilhafte Weiterbildungen, welche einzeln oder in Kombination miteinander einge setzt werden können, sind in den abhängigen Ansprüchen sowie in der Beschreibung angegeben.
Die Aufgabe wird gelöst durch ein computerimplementiertes Verfahren zum Trainie ren eines maschinellen Lernverfahrens zur Erkennung zukünftiger Trajektorien von Objekten in Bezug auf ein Ego-Fahrzeug umfassend der Schritte:
- Bereitstellen von zeitlich aufeinanderfolgenden globalen Verkehrsszenarien als zeitlich aufeinanderfolgende Frames in einem globalen Koordinatensys tem,
- Kennzeichnen aller Objekte in den globalen Verkehrsszenarien mit verschie denen Markern,
- Bestimmen der Ego-Pose des Ego-Fahrzeugs in den zeitlich aufeinanderfol genden Frames,
- Transformieren der Frames mit den markierten Objekten anhand der bestimm ten Ego-Pose jeweils in ein lokales Koordinatensystem als lokales Verkehrs szenario, so dass der jeweilige Frame die gleiche Orientierung wie das Ego- Fahrzeug im jeweiligen Frame aufweist und die Koordinaten des Ego-Fahr zeuges der Koordinatenursprung sind, so dass die lokalen Verkehrsszenarien die gleiche Orientierung wie das Ego-Fahrzeug aufweisen, wobei die transfor mierten Frames bis zu einem ersten Zeitpunkt als historische Frames verwen det werden und die transformierten Frames von dem ersten Zeitpunkt bis zu einem zweiten Zeitpunkt als Ground Truth Frames verwendet werden,
- Trainieren des maschinellen Lernverfahrens anhand der historischen Frames, zur Bestimmung von zukünftigen lokalen Verkehrsszenarien bis zu einem zweiten Zeitpunkt als zukünftige Frames und Abgleich der durch das maschi nelle Lernverfahren erzeugten zukünftigen Frames mit den korrespondieren den Ground Truth Frames.
Frames sind sozusagen Verkehrsszenarien (ein einzelnes Verkehrsszenario) zu ei nem gewissen Zeitpunkt. Die Frames können als Einzelbilder der zeitlich aufeinan derfolgenden Verkehrsszenarien betrachtet werden. Verkehrsszenarien können da her aus zeitlich aufeinanderfolgenden Frames von Verkehrsszenarios aufgebaut sein.
Die Ego-Pose ist dabei im Wesentlichen zumindest die Orientierung des Ego-Fahr zeugs.
Ground Truth Verkehrsszenarien (Frames) sind die sich tatsächlich einstellenden Verkehrsszenarien; d.h. die Verkehrsszenarien die sich nach dem ersten Zeitpunkt bis zu dem zweiten Zeitpunkt real einstellen mit den tatsächlich gefahrenen Trajekto- rien durch die Verkehrsteilnehmer nach dem ersten Zeitpunkt.
Ein Verkehrsszenario kann dabei aus einer Anzahl / Menge unterschiedlicher beweg ter (Fahrrad/PKW/Fußgänger) und/oder feststehender Objekte (AmpelA/erkehrs- schild) in der Umgebung des Ego-Fahrzeugs sein. Feststehende Objekte wie Ver kehrszeichen, Straßenmarkierungen, Lichtzeichenanlagen, Fußgänger-Überwege, Hindernisse sind an einer genau bestimmten Position. Bewegliche Objekte wie Fahr rad, PKWs etc. weisen ein dynamisches Verhalten (Trajektorie) wie Geschwindigkeit, BeschleunigungA/erzögerung, Abstand zur Straßenmittellinie etc. auf. Der Begriff „Ego-Fahrzeug“ kann als dasjenige Fahrzeug verstanden werden, dessen Umfeld zu überwachen ist. Das Ego-Fahrzeug kann insbesondere ein voll- oder teil autonom fahrendes Kraftfahrzeug für den Verkehr auf Straßen sein, welches zumin dest teilweise unabhängig lenken soll. Hierfür sind zumeist Sensoren etc. an dem Ego-Fahrzeug angeordnet, welche das Umfeld sensorisch erfassen können.
Eine Trajektorie bezeichnet eine Menge aus zeitlich und räumlich miteinander ver knüpften Positionen und Orientierungen, d.h. eine Fahrstrecke eines Verkehrsteil nehmers entlang bzw. in der Frames.
Erfindungsgemäß werden alle Frames anhand der Ego-Pose orientiert, so dass die Ego-Bewegung und Ego-Drehung nur dadurch abgebildet wird das Ego-Fahrzeug selber nicht angegeben ist. Vorzugsweise werden die letzten zwei Sekunden der Ver kehrsszenarien als historische Frames ausgewählt und stellen die Eingabetrainings daten mit den Ground Truth Frames dar.
Durch das mittels des erfindungsgemäßen Verfahrens antrainierte maschinelle Lern verfahren ist es möglich, eine Vorhersage der Objekttrajektorien aufgrund des kom pletten Frames als Eingabe zu erstellen.
Durch das erfindungsgemäße Verfahren wird ferner ein maschinelles Lernverfahren, beispielsweise ein künstliches neuronales Netz vereinfacht antrainiert. Das maschi nelle Lernverfahren wird unter Verwendung des kompletten Wissens über beispiels weise die Fahrspuren und Verkehrsregeln (statische Objekte) als Trainingsdaten an trainiert. Das so angelernte Lernverfahren kann dieses Wissen nun in die Vorhersage miteinbeziehen.
In dem so erfindungsgemäß trainierten maschinellen Lernverfahren wird zudem das gesamte Vorwissen über Verkehrsteilnehmer verwendet. Dadurch kann das ange lernte maschinelle Lernverfahren auch dieses in die späteren Vorhersagen miteinbe ziehen. Weiterhin können in dem so erfindungsgemäß angelernten Lernverfahren die vergangenen Bewegungen der Verkehrsteilnehmer und die Kategorie, zu der dieser Verkehrsteilnehmer gehört, wie z. B. Fußgänger, Pkw, Lkw, Fahrräder, etc., durch Eingabe der kompletten Frames in das damit antrainierte Lernverfahren berücksich tigt werden. Basierend darauf ist es dem damit trainierten maschinellen Lernverfah ren möglich, später alle Verkehrsteilnehmer zu berücksichtigen, ohne dass die Re chenzeit davon beeinflusst wird.
Durch Eingabe der erfindungsgemäß ausgestalteten Frames in dem durch das erfin dungsgemäße Verfahren so antrainierte maschinelle Lernverfahren können die sozi alen Interaktionen berücksichtigt werden. Basierend darauf ist es dem damit trainier ten maschinellen Lernverfahren möglich, später diese sozialen Interaktionen bei der Vorhersage der zukünftigen Bewegung der Verkehrsteilnehmer zu berücksichtigen.
Durch das erfindungsgemäße Verfahren kann ein maschinelles Lernverfahren zum Erzeugen vorausschauender Verkehrsszenarien anhand von historischen Frames und Ground Truth Frames trainiert, werden. Dadurch kann ein verbessertes maschi nelles Lernverfahren generiert werden, welches eine verbesserte Vorhersage der Trajektorien beweglicher Objekte in seinem Umfeld liefert.
Durch das erfindungsgemäße Verfahren wird ein maschinelles Lernverfahren anhand der kompletten Frames und damit der gesamten Karteninformationen und der ge samten sozialen Interaktionen als auch durch die Historie der historischen Trajektorie als Eingabe angelernt und kann dementsprechend nach anlernen bessere Ergeb nisse erzielen.
Das mittels des Verfahrens trainierte maschinelle Lernverfahren ist somit in der Lage alle Trajektorien in den Verkehrsszenarien um das Ego- Fahrzeug auf einmal im Vo raus zu bestimmen. Dadurch wird lediglich eine konstante Zeit für die Vorhersage be nötigt, welche unabhängig von der Anzahl der Verkehrsteilnehmer ist, indem bei spielsweise die soziale Interaktion der jeweiligen Verkehrsteilnehmer in die Vorher sage als auch beispielsweise das historische Vorwissen über die Verkehrsteilnehmer mit in die zu bestimmenden zukünftigen Verkehrsszenarien mit einbezogen werden.
In einer Ausführungsform sind die Objekte als statische Objekte als auch bewegte Objekte ausgebildet, wobei die statischen Objekte als auch die bewegten Objekte zumindest durch ihre Größe und Form als Marker gekennzeichnet werden. Jedes Objekt wird vorzugsweise durch seine originale Größe und Länge und Breite darge stellt. Weiterhin können statische Objekte und bewegte Objekte durch unterschiedli che Farben als Marker gekennzeichnet werden. Dazu wird eine RGB-Farbpalette ge nutzt, die alle verfügbaren Karteninformationen wie Fahrspurmitten und Fahrspur grenzen darstellt. So können Verkehrsteilnehmer beispielsweise in grau dargestellt werden.
In weiterer Ausführungsform weisen die historischen Frames als auch die Ground Truth Frames und die durch das maschinelle Lernverfahren erzeugten zukünftigen Frames einen Zeitstempel auf. Bei Transformation der historischen Frames in einen einzelnen Frame stellt jedes bewegte graue Objekt (Verkehrsteilnehmer) einen Zeit punkt dar zu dem der Frame erstellt wurde. Dadurch können die Zeitschritte in Zu sammenhang mit den Objekten zusammen in einem Frame dargestellt werden. Die Dekodierung der Objekte in Bezug auf ihre Historie und des dazu gehöhrendes Zeit schrittes ist also in der Datenstruktur selbst gegeben.
In weiterer Ausführung sind die Frames als ein Bildausschnitt aus einem jeweiligen Verkehrsszenario ausgestaltet, wobei jeweils ein Bildausschnitt durch einen vorgege benen Radius um die Koordinaten des Ego-Fahrzeugs ausgebildet wird, so dass sich das Ego-Fahrzeug zentriert in der Mitte des Bildausschnitts befindet. Dadurch ist eine bessere Verfolgung der beweglichen Objekte aus Sicht des Ego-Fahrzeuges möglich sowie eine schnellere Verarbeitung. Da alle Frames die Verfolgung aller Objekte so wie deren Posen beinhalten, sind zur Bestimmung relevanter Trajektorien lediglich diejenigen Objekte notwendig, welche aus der Sicht des Ego-Fahrzeuges wahrge nommen werden können. Die individuell generierten, durch den Bildausschnitt redu zierten Frames enthalten somit nur noch Objekte, die für dieses spezifische Ego- Fahrzeug in seinem Sichtfeld sichtbar sind. Dabei kann der Radius frei gewählt wer den. Insbesondere kann ein solcher als 50 m gewählt werden.
Durch Wahl dieses Radius wird sichergestellt, dass alle beweglichen und unbewegli chen Objekte erfasst werden, welche notwendig sind, um das Ego-Fahrzeug für die nächsten Sekunden / Minuten autonom zu steuern. Alle Frames sind anhand der Ego-Koordinaten, d.h. der Koordinaten des Ego-Fahrzeuges und der Richtung zentriert und orientiert, so dass die Ego-Bewegung und Ego-Drehung nur dadurch abgebildet wird und das Ego-Fahrzeug selber nicht angegeben ist. Dabei befindet sich das Ego-Fahrzeug immer in der Mitte eines Frames als Koordinatenursprung.
In weiterer Ausgestaltung wird anhand der historischen Frames die historische Trajektorie von sich bewegender Objekte, d.h. Verkehrsteilnehmer bestimmt und an hand der zukünftigen Frames die zu erwartenden durch das maschinelle Lernverfah ren erzeugten zukünftigen Trajektorien bestimmt.
Hierzu werden die zukünftigen Trajektorien aus den, durch das maschinelle Lernver fahren, erzeugten zukünftigen Frames extrahiert und dem dazugehörigen Objekt (Verkehrsteilnehmer) zugeordnet.
Zunächst werden dazu vorzugsweise die zukünftigen Frames entsprechend der Ego- Pose rotiert, um dieselbe Orientierung wie das Ego-Fahrzeug bzw. der historischen Frames zu erhalten; d.h. die historischen und zukünftigen Frames sind zueinander gleich ausgerichtet. Dabei bedeutet Ego-Pose die Position und die Orientierung des Ego-Fahrzeugs. Anschließend werden in den gedrehten zukünftigen Frames bevor zugt weiter die Konturen und damit die Objekte (Verkehrsteilnehmer) und deren Trajektorien erkannt und deren Pose, d.h. Orientierung und Koordinaten, bestimmt und mit der Pose der einzelnen Verkehrsteilnehmer in den historischen Frames ver glichen. Dadurch kann eine Zuordnung erfolgen. Ist dadurch die Zuordnung erhalten worden, können die zukünftigen Trajektorien zu den bekannten Verkehrsteilnehmern zugeordnet werden.
In weiterer Ausführungsform werden anhand der Ground Truth Frames die zukünfti gen Trajektorien von sich bewegender Objekte (Verkehrsteilnehmer) bestimmt. Das maschinelle Lernverfahren kann anschließend anhand der historischen Trajektorien aus den historischen Frames und der durch das maschinelle Lernverfahren ermittel ten zukünftigen Trajektorien angelernt werden. Dadurch kann ein gezieltes Anlernen eines maschinellen Lernverfahrens, beispielsweise mittels iterativen Gradientenver fahren, bewerkstelligt werden. In weiterer Ausgestaltung wird eine Güte des maschinellen Lernverfahrens bestimmt durch Bestimmung der Differenz zwischen den Ground Truth Trajektorien und den zu erwartenden durch das maschinelle Lernverfahren erzeugten zukünftigen Trajekto rien als mittlerer absoluter Fehler MAE:
MAE (Ground Truth Trajektorien); — (zukünftigen Trajektorien); | wobei n die Anzahl der Frames ist.
Dies bedeutet, dass dadurch die Differenz zwischen Ground Truth Trajektorien und den zukünftigen Trajektorien berechnet wird. Dadurch kann die Güte des maschinel len Lernverfahrens sehr schnell erkannt werden.
In weiterer Ausgestaltung können die Verkehrsszenarien im virtuellen Raum in Vo gelperspektive simuliert werden. Dadurch sind die historischen Frames als auch die Ground Truth Frames einfach zu erzeugen.
In weiterer Ausgestaltung ist das maschinelle Lernverfahren ein Deep Learning Ver fahren, welches mittels eines Gradientenverfahren trainiert wird. Dieses Lernverfah ren kann beispielsweise als tiefes neuronales Netz ausgestaltet sein. Anhand der Trajektorien oder der Frames kann das Netz iterativ mittels Gradientenabstiegs ange lernt werden. Als Architektur des künstlichen neuronalen Netzes kann eine Decoder- Encoder Struktur verwendet werden.
Das künstliche neuronale Netz kann ein Faltungsnetz, insbesondere ein Deep Con- volutional Neural Network sein. Der Encoder ist für die Komprimierung des Eingangs signals mittels Faltung verantwortlich und transformiert die Eingabe in einen niedrig dimensionalen Vektor. Der Decoder ist für die Wiederherstellung zuständig. Der De coder transformiert anschließend den niedrigdimensionalen Vektor in die gewünschte Ausgabe. Ferner wird die Aufgabe gelöst durch ein System zum Trainieren eines maschinellen Lernverfahrens zur Erkennung zukünftiger Trajektorien von Objekten in Bezug auf ein Ego-Fahrzeug umfassend:
- eine Speichereinheit zum Bereitstellen von zeitlich aufeinanderfolgenden glo balen Verkehrsszenarien als zeitlich aufeinanderfolgenden Frames in einem globalen Koordinatensystem, wobei die globalen Verkehrsszenarien Objekte aufweisen und alle Objekte in den globalen Verkehrsszenarien mit verschiede nen Markern gekennzeichnet sind,
- einen Prozessor zum Bestimmen der Ego-Pose des Ego-Fahrzeugs in den zeitlich aufeinanderfolgenden Frames und zum Transformieren der Frames mit den markierten Objekten anhand der bestimmten Ego-Pose jeweils in ein lokales Koordinatensystem als lokales Verkehrsszenario, so dass der jeweilige Frame die gleiche Orientierung wie das Ego-Fahrzeug aufweist, wobei die transformierten Frames bis zu einem ersten Zeitpunkt als historische Frames verwendet werden und die transformierten Frames von dem ersten Zeitpunkt bis zu einem zweiten Zeitpunkt als Ground Truth Frames verwendet werden,
- den Prozessor zum Trainieren des maschinellen Lernverfahrens anhand der historischen Frames, zur Bestimmung von zukünftigen lokalen Verkehrsszena rien bis zu einem zweiten Zeitpunkt als zukünftige Frames und Abgleich der durch das maschinelle Lernverfahren erzeugten zukünftigen Frames mit den korrespondierenden Ground Truth Frames.
Die Vorteile des Verfahrens können auch auf das System übertragen werden.
Die einzelnen Ausführungsformen des Verfahrens können ebenfalls auf das System angewendet werden.
Weitere bevorzugte Ausführungsformen beziehen sich auf ein Computerprogramm produkt, umfassend Befehle, die bei der Ausführung des Programms durch den Computer diesen veranlassen, die Schritte des Verfahrens gemäß den Ausführungs formen auszuführen.
Weitere bevorzugte Ausführungsformen beziehen sich auf ein computerlesbares Speichermedium, umfassend Befehle, z.B. in Form des Computerprogrammprodukts, die bei der Ausführung durch den Computer diesen veranlassen, die Schritte des Verfahrens gemäß den Ausführungsformen auszuführen.
Weitere bevorzugte Ausführungsformen beziehen sich auf ein Datenträgersignal, dass das Computerprogramm gemäß den Ausführungsformen überträgt und/oder charakterisiert. Mittels des Datenträgersignals kann das Computerprogramm bei spielsweise von einer externen Einheit an das System übertragen werden. Das Sys tem kann z.B. eine bevorzugt bidirektionale Datenschnittstelle u.a. zum Empfang des Datenträgersignals aufweisen.
Weitere Eigenschaften und Vorteile der vorliegenden Erfindung ergeben sich aus der nachfolgenden Beschreibung unter Bezugnahme auf die beiliegenden Figuren. Darin zeigen schematisch:
FIG 1: verschiedene historische Frames,
FIG 2: unbewegliche Objekte in einem Frame,
FIG 3: die Ground Truth Frames,
FIG 4: die historischen Frames und Ground Truth Frames als Tabelle,
FIG 5: gestapelte Frames als einen einzigen Frame,
FIG 6: Encoder und Decoder des neuronalen Netzes,
FIG 7: eine berechnete zukünftige Trajektorie.
Damit ein autonomes Fahrzeug sein Ziel erreichen kann, muss es seine Umgebung wahrnehmen, sie interpretieren und Vorhersagen, was in der Zukunft passieren könnte. Dazu werden Sensoren, mit denen das autonome Fahrzeug ausgestattet ist, verwendet, welche die Umgebung erfassen. Die erfassten Sensordaten müssen ver arbeitet und interpretiert werden.
Dabei ist es eine wesentliche Voraussetzung für den Betrieb eines autonomen Fahr zeugs (Ego-Fahrzeug) für jeden Verkehrsteilnehmer die zukünftigen Positionen (Trajektorien) der Verkehrsteilnehmer aus solchen Sensordaten zuverlässig zu be stimmen. Dazu kann ein maschinelles Lernverfahren beispielsweise ein neuronales Netz herangezogen werden. Dieses muss jedoch zuverlässig angelernt werden, um die erhaltenden Sensordaten richtig zu interpretieren.
Erfindungsgemäß kann das computerimplementierte Verfahren zum Trainieren des maschinellen Lernverfahrens zur Erkennung zukünftiger Trajektorien von Objekten in Bezug auf ein Ego-Fahrzeug herangezogen werden. Hierfür können die aktuellen und vorherigen Positionen eines Verkehrsteilnehmers in kartesischen Koordinaten herangezogen werden.
Zunächst werden zeitlich aufeinanderfolgende globale Verkehrsszenarien als zeitlich aufeinanderfolgenden Frames in einem globalen Koordinatensystem bereitgestellt. Die Trajektorien bzw. Trajektoriedaten sind daher inhärente Zeitreihendaten. Die Ver kehrsszenarien werden dabei vorzugsweise durch Objekte dargestellt. Die Objekte können im Wesentlichen in statische und bewegliche Objekte (Verkehrsteilnehmer) unterteilt werden.
Statische Objekte sind beispielsweise Fahrbahnen und Fahrbahnberandungen, Am peln, Verkehrsschilder etc. Bewegliche Objekte sind hier vor allem die Verkehrsteil nehmer wie PKW, Fußgänger, Fahrradfahrer. Diese erzeugen eine sogenannte Trajektorie. Trajektorie bezeichnet eine Menge auszeitlich und räumlich miteinander verknüpften Positionen und Orientierungen, d.h. die Fahrtstrecke des beweglichen Objektes.
Diese Verkehrsszenarien werden vorzugsweise anhand eines Datensatzes auf Basis von Simulationsdaten erstellt/simuliert. Ferner werden die Verkehrsszenarien vor zugsweise in Bezug auf verschiedene Städte simuliert um eine ausreichende Güte der Simulationsdaten sicherzustellen. Somit können große Mengen an verschiede nen Verkehrsszenarien erzeugt werden, anhand dessen das maschinelle Lernverfah ren angelernt werden kann.
Die Verkehrsteilnehmer, insbesondere deren Trajektorien werden in Draufsicht, das heißt Vogelperspektive ( Bird-eye-view manner) dargestellt. Jedes Verkehrsszenario wird dabei als ein Frame dargestellt.
Dabei werden sogenannte historische Frames 1 a, .1e(FIG 1 ) erzeugt, welche sich von einem in der Vergangenheit liegenden Zeitpunkt t=-2 Sekunden bis zu einem ak tuellen ersten Zeitpunkt t=0 erstrecken, sowie Ground Truth Frames 2a . 2e (FIG
3), welche sich von dem ersten Zeitpunkt bis zu einem zukünftigen zweiten Zeitpunkt erstrecken. Diese können als Eingabedaten in das maschinelle Lernverfahren die nen.
Die historischen Frames geben dabei die Historie an, das heißt bei bewegten Objek ten die bereits gefahrene Trajektorie.
Jedes Objekt wird vorzugsweise durch seine originale Größe und Länge und Breite dargestellt. Ferner können statische Objekte und bewegte Objekte durch unter schiedliche Farben als Marker (RGB-Farbpalette) in der Simulation gekennzeichnet werden. Dabei wird die RGB-Farbpalette genutzt, alle verfügbaren Karteninformatio nen wie Fahrspurmitten und Fahrspurgrenzen darzustellen.
So können Verkehrsteilnehmer bzw. deren historische Trajektorien 3 in grau in jedem der simulierten historischen Frames 1a,..,1e und Ground Truth Frames 2a,..., 2e dargestellt werden.
Die Dekodierung der Historie und des Zeitschrittes ist daher durch diese Darstellung selbst gegeben.
FIG 1 zeigt verschiedene historische Frames 1 a, .. , 1 e, die die Trajektorien 3 aller Ob jekte beinhalten. Zur Eingabe in das maschinelle Lernverfahren werden die Frames und damit die Objekte um die Ego-Pose gedreht, so dass sie der Sichtweise aus dem Ego-Fahrzeug heraus entsprechen.
Die Trajektorie 3, hier eines einzelnen Objektes, wird quasi dadurch erkannt, indem die historische Frames 1 a, , 1 e als Bildsequenz dargestellt /wahrgenommen werden können. Dabei sind die historischen Frames bis zu einem ersten Zeitpunkt tO aufgenommen, ausgehend von einem dem Zeitpunkt tO vorangegangenen Zeitpunkt t=-2. Dies be deutet, dass die letzten 2 Sekunden als historische Frames für einen Eingabeinput zum Anlernen für das maschinelle Lernverfahren herangezogen werden.
Ferner vorzugsweise sind die Frames 1a, ... ,1e als ein Bildausschnitt aus einem je weiligen Verkehrsszenario ausgestaltet, wobei jeweils ein Bildausschnitt durch einen vorgegebenen Radius um die Koordinaten des Ego-Fahrzeugs ausgebildet wird. So mit werden lediglich diejenigen Objekte dargestellt, welche aus der Sicht des Ego- Fahrzeuges wahrgenommen werden können, d.h. welche aus der "Ego-Sicht" wahr genommen werden würden.
Das Ego-Fahrzeug bzw. dessen Koordinaten befinden sich somit zentriert in der Mitte des Bildausschnitts (Koordinatenursprung). Dadurch ist eine bessere Verfol gung der Objekte aus Sicht des Ego-Fahrzeuges möglich sowie eine schnellere Ver arbeitung. Da alle Frames die Verfolgung aller Objekte sowie deren Posen beinhal ten kann auf die Darstellung des Ego-Fahrzeugs selber in den Frames verzichtet werden.
Die individuell generierten im Bildausschnitt reduzierten Frames enthalten dann nur noch Objekte, die für dieses spezifische Ego-Fahrzeug in seinem Sichtfeld sichtbar sind. Dabei kann der Radius frei gewählt werden. Insbesondere kann ein solcher als 50 m gewählt werden. Dadurch wird sichergestellt, dass alle beweglichen und unbe weglichen Objekte erfasst werden, welche notwendig sind, um das Ego-Fahrzeug für die nächsten Sekunden / Minuten autonom zu steuern. Ferner werden die Objekte in Richtung Ego-Fahrzeug zentriert, so dass sich das Ego-Fahrzeug mit den Ego-Koor dinaten im Zentrum, d.h. hier der Koordinatenursprung befindet, so dass die Ego-Be wegung und Ego-Drehung lediglich dadurch abgebildet wird und das Ego-Fahrzeug selber nicht angegeben ist. Dadurch befindet sich das Ego-Fahrzeug immer in der Mitte des jeweiligen Frames 1 a, , 1 e, und wird nicht dargestellt.
Ferner können unbewegliche Objekte dargestellt werden, welche ebenfalls um die Pose des Ego-Fahrzeugs gedreht, dargestellt sind. In FIG 2 sind als unbewegliche Objekte beispielhaft die verschiedenen Fahrbahnen 5 in Grün (hier gestrichelt) dargestellt.
Zudem werden durch die Simulation noch die Ground Truth Frames 2a . 2e (FIG
3) mit den dazugehörigen Ground Truth Trajektorien 4 erzeugt. FIG 3 zeigt die Ground Truth Frames 2a .... ,2e mit den dazugehörigen Ground Truth Trajektorien 4. FIG 4 zeigt die Darstellung der historischen Frames 1 a, .1 ,e und Ground Truth Fra mes 2a ,2e als Tabelle.
Die historischen Frames 1a,..,1e können dabei aufeinander abgebildet (gemappt) und jeweils in einem einzelnen Frame angezeigt werden. FIG 5 zeigt eine solche Ab bildung, in der einzelne Frames quasi als Bildsequenz aufeinander gelegt worden sind, zur Erkennung verschiedener Objekte und Objekttrajektorien, hier beispiels weise an einer Objekttrajektorie 6 gezeigt.
Anschließend wird bevorzugt mithilfe der historischen Frames 1a,..., 1e und der Ground Truth Frames 2a,..., 2e ein maschinelles Lernverfahren antrainiert.
Ein solches Lernverfahren ist vorzugsweise als künstliches tiefes neuronales Netz ausgestaltet, welches in FIG 6 näher beschrieben wird. Dieses ist vorzugsweise als Encoder und Decoder ausgestaltet, welche iterativ mittels eines Gradientenverfah rens trainiert werden. Dabei kann das künstliche neuronale Netz anhand der Trajek torien 3,4, aus den historischen Frames 1a,... 1e, und den Ground Truth Frames 2a,... 2e und/oder der Frames 1a,... 1e, 2a,... 2e selber iterativ mittels des Gradien tenabstiegs angelernt werden.
Das neuronale Netz kann ein Faltungsnetz, insbesondere ein Deep Convolutional Neural Network sein. Der Encoder ist für die Komprimierung des Eingangssignals mittels Faltung verantwortlich. Der Decoder ist für die Wiederherstellung von Einga ben verantwortlich. Der Encoder transformiert die Eingabe in einen niedrigdimensio nalen Vektor. Der Decoder transformiert dann den niedrigdimensionalen Vektor in die gewünschte Ausgabe. Ferner kann auch ein GNA Netz (Generative Adversarial Networks) Verwendung fin den.
Das neuronale Netz errechnet anhand den historischen Frames 1a, ...1e die zukünftigen Frames.
Anschließend können die Trajektorien aus den, durch das neuronale Netz errechne- ten, zukünftigen Frames extrahiert werden und dem dazugehörigen Objekt (Ver kehrsteilnehmer) zugeordnet werden.
Dazu werden zunächst vorzugsweise die zukünftigen Frames entsprechend der Ego- Pose rotiert, um dieselbe Orientierung wie das Ego-Fahrzeug bzw. der historischen Frames zu erhalten; d.h. die historischen Frames 1 a, .. , 1 e und zukünftigen Frames sind zueinander gleich ausgerichtet. Anschließend werden in den gedrehten zukünfti gen Frames bevorzugt weiter die Konturen und damit die Objekte (Verkehrsteilneh mer) erkannt und deren Pose, d.h. Orientierung und Koordinaten bestimmt und mit der Pose der einzelnen bekannten Objekte zum Zeitpunkt tO verglichen. Ist dadurch eine Zuordnung erhalten worden, können die zukünftigen Trajektorien zu den be kannten Verkehrsteilnehmer bzw. Objekte zugeordnet werden.
FIG 7 zeigt eine berechnete zukünftige Trajektorie, wobei die letzten sechs Schritte in der FIG 7 zusammengefasst sind als „Prediction (rechts) Trajektorie“ und eine Ground Truth Trajektorie (links).
Das maschinelle Lernverfahren kann anhand der Methode des soft-dice-loss (Ähn lichkeitsmaßfunktion) bewertet werden. Dieses gibt den Grad der Überlappung zwi schen den zukünftigen Frames in Vogelperspektive und den Ground Truth Frames in Vogelperspektive in Bezug auf die ursprüngliche Objektgröße an.
Ferner kann eine Güte des maschinellen Lernverfahrens bestimmt werden durch Be stimmung der Differenz zwischen der Ground Truth Trajektorien 4 und die zu erwar tenden durch das maschinelle Lernverfahren erzeugten zukünftigen Trajektorien als mittlerer absoluter Fehler MAE: (Ground Truth Trajektorien); — (zukünftigen Trajektorien); | wobei n die Anzahl der Frames ist.
Das neuronale Netz kann durch das erfindungsgemäße Verfahren so angelernt wer den, dass es somit Karteninformationen und Fahrkontext bei der Vorhersage der zu künftigen Trajektorien der Verkehrsteilnehmer sowie das Vorwissen über die Ver kehrsteilnehmer bei der Vorhersage der zukünftigen Trajektorien der Verkehrsteil nehmer als auch soziale Interaktionen bei der Vorhersage der zukünftigen Trajekto rien zwischen den Verkehrsteilnehmern berücksichtigt.
Bezuqszeichen a,..,1e historischen Frames a . 2e Ground Truth Frames historische Trajektorien Ground Truth Trajektorien Fahrbahnen Objekttrajektorie

Claims

Patentansprüche
1. Computerimplementiertes Verfahren zum Trainieren eines maschinellen Lernver fahrens zur Erkennung zukünftiger Trajektorien von Objekten in Bezug auf ein Ego- Fahrzeug gekennzeichnet, durch die Schritte:
- Bereitstellen von zeitlich aufeinanderfolgenden globalen Verkehrsszenarien als zeitlich aufeinanderfolgenden Frames in einem globalen Koordinatensys tem,
- Kennzeichnen aller Objekte in den globalen Verkehrsszenarien mit verschie denen Markern,
- Bestimmen der Ego-Pose des Ego-Fahrzeugs in den zeitlich aufeinanderfol genden Frames,
- Transformieren der Frames mit den markierten Objekten anhand der bestimm ten Ego-Pose jeweils in ein lokales Koordinatensystem als lokales Verkehrs szenario, so dass der jeweilige Frame die gleiche Orientierung wie das Ego- Fahrzeug im jeweiligen Frame aufweist und die Koordinaten des Ego-Fahr zeuges der Koordinatenursprung sind, so dass die lokalen Verkehrsszenarien die gleiche Orientierung wie das Ego-Fahrzeug aufweisen, wobei die transfor mierten Frames bis zu einem ersten Zeitpunkt als historische Frames
(1 a, .. , 1 e) verwendet werden und die transformierten Frames von dem ersten Zeitpunkt bis zu einem zweiten Zeitpunkt als Ground Truth Frames (2a,..,2e) verwendet werden,
- Trainieren des maschinellen Lernverfahrens anhand der historischen Frames (1a,.., 1 e), zur Bestimmung von zukünftigen lokalen Verkehrsszenarien bis zu einem zweiten Zeitpunkt als zukünftige Frames und Abgleich der durch das maschinelle Lernverfahren erzeugten zukünftigen Frames mit den korrespon dierenden Ground Truth Frames (2a,..,2e).
2. Verfahren nach Anspruch 1 , dadurch gekennzeichnet, dass die Objekte als statische Objekte als auch bewegte Objekte ausgebildet sind und zu mindest durch ihre Größe und Form als Marker gekennzeichnet werden.
3. Verfahren nach Anspruch 2, dadurch gekennzeichnet, dass die statischen Objekte und die bewegten Objekte durch unterschiedliche Farben als Marker gekennzeichnet werden.
4. Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass die historischen Frames (1a,.., 1 e) als auch die Ground Truth Frames (2a,..,2e) und die durch das maschinelle Lernverfahren erzeugten zukünftigen Frames einen Zeit stempel aufweisen.
5. Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass die Frames als ein Bildausschnitt aus einem jeweiligen Verkehrsszenario ausgestal tet sind, wobei jeweils ein Bildausschnitt durch einen vorgegebenen Radius um die Koordinaten des Ego-Fahrzeugs ausgebildet werden, so dass sich das Ego-Fahr zeug zentriert in der Mitte des Bildausschnitts befindet.
6. Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass anhand der historischen Frames (1a,..,1e) eine historische Trajektorie von sich bewe gender Objekte bestimmt werden und anhand der zukünftigen Frames die zu erwar tenden durch das maschinelle Lernverfahren erzeugten zukünftigen Trajektorien be stimmt werden.
7. Verfahren nach Anspruch 6, dadurch gekennzeichnet, dass anhand der Ground Truth Frames (2a,.., 2e) eine Ground Truth Trajektorie (4) von sich bewegender Objekte bestimmt wird und das maschinelle Lernverfahren anhand der historischen Trajektorie (3) und der Ground Truth Trajektorie (4) angelernt wird.
8. Verfahren nach Anspruch 7, dadurch gekennzeichnet, dass eine Güte des maschinellen Lernverfahrens bestimmt wird durch Bestimmung der Differenz zwischen den Ground Truth Trajektorien (4) und die zu erwartenden durch das maschinelle Lernverfahren erzeugten zukünftigen Trajektorien als mittlerer abso luter Fehler MAE: (Ground Truth Trajektorien); — (zukünftigen Trajektorien); | wobei n die Anzahl der Frames ist.
9. Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass die Verkehrsszenarien im virtuellen Raum in Vogelperspektive simuliert werden.
10. Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass das maschinelle Lernverfahren ein deep learning Verfahren ist, welches mittels eines Gradientenverfahrens trainiert wird.
11 . Verfahren nach Anspruch 10, dadurch gekennzeichnet, dass das deep learning Verfahren einen Encoder und einen Decoder aufweist.
12. System zum Trainieren eines maschinellen Lernverfahrens zur Erkennung zu künftiger Trajektorien von Objekten in Bezug auf ein Ego-Fahrzeug umfassend:
- eine Speichereinheit zum Bereitstellen von zeitlich aufeinanderfolgenden glo balen Verkehrsszenarien als zeitlich aufeinanderfolgenden Frames in einem globalen Koordinatensystem, wobei die globalen Verkehrsszenarien Objekte aufweisen und alle Objekte in den globalen Verkehrsszenarien mit verschiede nen Markern gekennzeichnet sind,
- einen Prozessor zum Bestimmen der Ego-Pose des Ego-Fahrzeugs in den zeitlich aufeinanderfolgenden Frames und zum Transformieren der Frames mit den markierten Objekten anhand der bestimmten Ego-Pose jeweils in ein lokales Koordinatensystem als lokales Verkehrsszenario, so dass der jeweilige Frame die gleiche Orientierung wie das Ego-Fahrzeug im jeweiligen Frame aufweist und die Koordinaten des Ego-Fahrzeuges der Koordinatenursprung sind, so dass die lokalen Verkehrsszenarien die gleiche Orientierung wie das Ego-Fahrzeug aufweisen, wobei die transformierten Frames bis zu einem ersten Zeitpunkt als historisches Frame (1 a, . 1 e) verwendet werden und die transformierten Frames von dem ersten Zeitpunkt bis zu einem zweiten Zeit punkt als Ground Truth Frames (2a,..,2e) verwendet werden,
- den Prozessor zum Trainieren des maschinellen Lernverfahrens anhand der historischen Frames (1 a, , 1 e), zur Bestimmung von zukünftigen lokalen Ver kehrsszenarien bis zu einem zweiten Zeitpunkt als zukünftige Frames und Ab gleich der durch das maschinelle Lernverfahren erzeugten zukünftigen Fra mes mit den korrespondierenden Ground Truth Frames (2a,..,2e).
13. Computerprogrammprodukt, umfassend Befehle, die bei der Ausführung des Pro gramms durch einen Computer diesen veranlassen, das Verfahren nach Anspruch 1 auszuführen.
14. Computerlesbares Medium, umfassend Befehle, die bei der Ausführung durch ei nen Computer diesen veranlassen, die Schritte des Verfahrens nach Anspruch 1 auszuführen.
15. Datenträgersignal, das das Computerprogrammprodukt nach Anspruch 13 über trägt.
EP22720432.8A 2021-04-08 2022-04-04 Computerimplementiertes verfahren und system zum trainieren eines maschinellen lernverfahrens Withdrawn EP4320600A1 (de)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
DE102021203492.6A DE102021203492B3 (de) 2021-04-08 2021-04-08 Computerimplementiertes Verfahren und System zum Trainieren eines maschinellen Lernverfahrens
PCT/EP2022/058835 WO2022214416A1 (de) 2021-04-08 2022-04-04 Computerimplementiertes verfahren und system zum trainieren eines maschinellen lernverfahrens

Publications (1)

Publication Number Publication Date
EP4320600A1 true EP4320600A1 (de) 2024-02-14

Family

ID=81256440

Family Applications (1)

Application Number Title Priority Date Filing Date
EP22720432.8A Withdrawn EP4320600A1 (de) 2021-04-08 2022-04-04 Computerimplementiertes verfahren und system zum trainieren eines maschinellen lernverfahrens

Country Status (5)

Country Link
US (1) US20240185437A1 (de)
EP (1) EP4320600A1 (de)
CN (1) CN117121060A (de)
DE (1) DE102021203492B3 (de)
WO (1) WO2022214416A1 (de)

Families Citing this family (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2024019849A (ja) * 2022-08-01 2024-02-14 株式会社Subaru 車両の走行制御装置

Family Cites Families (14)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
DE102017204404B3 (de) 2017-03-16 2018-06-28 Audi Ag Verfahren und Vorhersagevorrichtung zum Vorhersagen eines Verhaltens eines Objekts in einer Umgebung eines Kraftfahrzeugs und Kraftfahrzeug
US10788830B2 (en) * 2017-07-28 2020-09-29 Qualcomm Incorporated Systems and methods for determining a vehicle position
US10782693B2 (en) * 2017-09-07 2020-09-22 Tusimple, Inc. Prediction-based system and method for trajectory planning of autonomous vehicles
US11282389B2 (en) * 2018-02-20 2022-03-22 Nortek Security & Control Llc Pedestrian detection for vehicle driving assistance
US11966838B2 (en) * 2018-06-19 2024-04-23 Nvidia Corporation Behavior-guided path planning in autonomous machine applications
DE102018222542A1 (de) 2018-12-20 2020-06-25 Robert Bosch Gmbh Bewegungsvorhersage für gesteuerte Objekte
DE102020100685A1 (de) * 2019-03-15 2020-09-17 Nvidia Corporation Vorhersage zeitlicher informationen in autonomenmaschinenanwendungen
US11579629B2 (en) * 2019-03-15 2023-02-14 Nvidia Corporation Temporal information prediction in autonomous machine applications
US11131993B2 (en) * 2019-05-29 2021-09-28 Argo AI, LLC Methods and systems for trajectory forecasting with recurrent neural networks using inertial behavioral rollout
US11520037B2 (en) * 2019-09-30 2022-12-06 Zoox, Inc. Perception system
CN111002980B (zh) * 2019-12-10 2021-04-30 苏州智加科技有限公司 基于深度学习的道路障碍物轨迹预测方法和系统
CN111626097A (zh) * 2020-04-09 2020-09-04 吉利汽车研究院(宁波)有限公司 一种障碍物未来轨迹的预测方法、装置、电子设备及存储介质
US11919545B2 (en) * 2020-05-15 2024-03-05 Perceptive Automata, Inc. Scenario identification for validation and training of machine learning based models for autonomous vehicles
US12485889B2 (en) * 2020-11-19 2025-12-02 Nvidia Corporation Object detection and collision avoidance using a neural network

Also Published As

Publication number Publication date
CN117121060A (zh) 2023-11-24
WO2022214416A1 (de) 2022-10-13
DE102021203492B3 (de) 2022-05-12
US20240185437A1 (en) 2024-06-06

Similar Documents

Publication Publication Date Title
EP3380811B1 (de) Verfahren und system zum erstellen einer digitalen karte
DE102015203016B4 (de) Verfahren und Vorrichtung zur optischen Selbstlokalisation eines Kraftfahrzeugs in einem Umfeld
DE102020127043A1 (de) Sicherheitssystem für ein fahrzeug
DE102018203583B4 (de) Verfahren, Fahrerassistenzsystem sowie Kraftfahrzeug zur Prädiktion einer Position oder einer Trajektorie mittels eines graphbasierten Umgebungsmodells
DE102019101938A1 (de) Erstellung kognitiver Karten für Fahrzeuge
DE102020113848A1 (de) Ekzentrizitätsbildfusion
DE102019122826A1 (de) Adaptives fahrzeuglernen
DE102016211182A1 (de) Verfahren, Vorrichtung und System zum Durchführen einer automatisierten Fahrt eines Fahrzeugs entlang einer aus einer Karte bereitgestellten Trajektorie
DE102019108644A1 (de) Verfahren und vorrichtung zum automatischen lernen von regeln für autonomes fahren
DE102017201665A1 (de) Verfahren zur Einbindung eines dynamischen Objektes in eine digitale Karte eines hochautomatisierten Fahrzeugs (HAF)
DE102021119871B4 (de) Verfahren und Prozessorschaltung zum Betreiben einer automatisierten Fahrfunktion mit Objektklassifikator in einem Kraftfahrzeug, sowie Kraftfahrzeug
DE102018213378B4 (de) Fahrassistenzsystem für ein Fahrzeug, Fahrzeug mit demselben und Fahrassistenzverfahren für ein Fahrzeug
DE102021114724A1 (de) Verbesserter fahrzeugbetrieb
DE102015206546A1 (de) Fahrbahnmarkierungserkennungsvorrichtung
DE102019122536A1 (de) Exzentrizitätskarten
DE102020200876B4 (de) Verfahren zum Verarbeiten von Sensordaten einer Sensorik eines Fahrzeugs
WO2022043203A1 (de) Training eines generators zur erzeugung realistischer bilder mit einem semantisch segmentierenden diskriminator
DE102023114645A1 (de) Systeme und Verfahren zur Bildklassifizierung unter Verwendung eines neuronalen Netzwerks in Kombinaiton mit einer Korrelationsstruktur
DE102020122610A1 (de) Neuronales fahrzeugnetzwerk
WO2022106336A1 (de) Verfahren zum steuern eines kraftfahrzeugs und steuergerät
DE102024201831A1 (de) Verfahren zum Erstellen von hochaufgelösten Umgebungskarten für ein Fahrzeug mit einer autonomen Fahrfunktion
EP4320600A1 (de) Computerimplementiertes verfahren und system zum trainieren eines maschinellen lernverfahrens
DE102017215844A1 (de) Verfahren zum Betreiben eines Fahrzeugs
DE102022210504B4 (de) System und Verfahren zur Prädiktion einer zukünftigen Position eines Verkehrsteilnehmers
DE102020208421A1 (de) Verfahren sowie Steuergerät zum Steuern eines Kraftfahrzeugs

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20231031

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN

18D Application deemed to be withdrawn

Effective date: 20240516