WO2022033746A1 - Trainieren eines reinforcement learning agenten zur steuerung eines autonomen systems - Google Patents
Trainieren eines reinforcement learning agenten zur steuerung eines autonomen systems Download PDFInfo
- Publication number
- WO2022033746A1 WO2022033746A1 PCT/EP2021/065919 EP2021065919W WO2022033746A1 WO 2022033746 A1 WO2022033746 A1 WO 2022033746A1 EP 2021065919 W EP2021065919 W EP 2021065919W WO 2022033746 A1 WO2022033746 A1 WO 2022033746A1
- Authority
- WO
- WIPO (PCT)
- Prior art keywords
- autonomous system
- ego
- comparable
- reinforcement learning
- learning agent
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Ceased
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N20/00—Machine learning
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/004—Artificial life, i.e. computing arrangements simulating life
- G06N3/008—Artificial life, i.e. computing arrangements simulating life based on physical entities controlled by simulated intelligence so as to replicate intelligent life forms, e.g. based on robots replicating pets or humans in their appearance or behaviour
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W60/00—Drive control systems specially adapted for autonomous road vehicles
- B60W60/001—Planning or execution of driving tasks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
- G06N3/092—Reinforcement learning
Definitions
- the invention relates to a device and a method for training a reinforcement learning agent for controlling an autonomous system.
- automated driving can be understood as driving with automated longitudinal or lateral guidance or autonomous driving with automated longitudinal and lateral guidance.
- automated driving includes automated driving with any degree of automation. Exemplary degrees of automation are assisted, partially automated, highly automated or fully automated driving. These degrees of automation were defined by the Federal Highway Research Institute (BASt) (see BASt publication “Research compact”, edition 11/2012).
- assisted driving the driver constantly performs longitudinal or lateral guidance, while the system takes over the other function within certain limits.
- TAF semi-automated driving
- the system takes over longitudinal and lateral guidance for a certain period of time and/or in specific situations, whereby the driver has to constantly monitor the system, as with assisted driving.
- HAD highly automated driving
- VAF fully automated driving
- highly automated driving (HAF) corresponds to level 3 of the SAE J3016 standard.
- SAE J3016 also provides SAE Level 5 as the highest degree of automation, which is not included in the BASt definition.
- SAE Level 5 corresponds to driverless driving, in which the system can automatically handle all situations like a human driver throughout the journey; a driver is generally no longer required.
- Reinforcement learning is known as a set of machine learning methods in which an agent autonomously learns a strategy to maximize rewards received.
- the agent is not shown which action is best in which situation, but receives a reward at certain times, which can also be negative. Using these rewards, he approximates a utility function that describes the value of a particular state or action.
- a large number of training data sets are required to train the agent. Collecting the training datasets is very complex, especially in the context of using reinforcement learning for automated driving, since a test vehicle that is set up to collect training datasets only experiences a very limited number of relevant traffic situations in a given time.
- a first aspect of the invention relates to a device for training a reinforcement learning agent for controlling an autonomous system.
- the autonomous system which is often also referred to as an autonomous robot, is a technical system that carries out its behavior or its tasks with a high degree of autonomy, i.e. without external control.
- the autonomous system is a technical system that moves autonomously, for example an autonomous air, land or water vehicle.
- the device is set up to record the surroundings of the autonomous system, in particular using sensors such as cameras, radar and/or lidar. Sensor data from these sensors can be merged, for example, in order to generate an environment model of the environment of the autonomous system in order to record the environment of the autonomous system as a whole.
- the device is set up to recognize at least one object that is comparable to the autonomous system in the area surrounding the autonomous system.
- the at least one object comparable to the autonomous system is comparable to the autonomous system in particular when it has comparable properties and/or a comparable influence on its environment.
- the at least one object comparable to the autonomous system can itself be an autonomous system or else a manual or non-autonomous system, ie a system controlled by a human.
- the device is set up to record a behavior of the at least one object that is comparable to the autonomous system and to train the reinforcement learning agent as a function of the recorded behavior of the at least one object that is comparable to the autonomous system.
- the invention is based on the idea that the reinforcement learning agent is not, as is known in the prior art, based on the behavior of the autonomous system that the reinforcement learning agent controls itself or should control learns, but on the basis of the behavior of at least one object comparable to the autonomous system.
- the reinforcement learning agent is not, as is known in the prior art, based on the behavior of the autonomous system that the reinforcement learning agent controls itself or should control learns, but on the basis of the behavior of at least one object comparable to the autonomous system.
- training data records can be used to train the reinforcement learning agent, which originate from the autonomous system itself, but also training data records from the at least one object in the environment of the autonomous system that is comparable to the autonomous system.
- the autonomous system is an automated motor vehicle.
- the at least one object in the environment of the automated motor vehicle that is comparable to the automated motor vehicle has comparable properties and/or a comparable influence on its surroundings as the automated motor vehicle.
- the properties of the motor vehicle are, for example, the dimensions, the acceleration potential, the speed potential and/or the options for communicating with the surroundings of the automated motor vehicle.
- the influence of the automated motor vehicle on its surroundings can be seen, for example, in how far away other road users keep from the automated motor vehicle.
- the at least one object in the area surrounding the automated motor vehicle that is comparable to the automated motor vehicle is, in particular, another motor vehicle, for example another motor vehicle from the same motor vehicle class.
- the device is set up to train reinforcement learning as a function of the detected behavior of the at least one object comparable to the autonomous system, and a target function (reward function) for the control of the autonomous system.
- the invention is based on the finding that it is not necessary to determine a possible target function of the at least one object that is comparable to the autonomous system, but rather that the known target function for controlling the autonomous system can be used to train the reinforcement learning agent .
- the target function for controlling the autonomous system can be, for example, maintaining a predefined speed of the automated motor vehicle.
- the target function of the can also include comfort aspects, such as limiting the maximum acceleration of the automated motor vehicle in the longitudinal and/or transverse direction.
- the target function can also include safety aspects such as maintaining a safe distance from other road users.
- the target function of the automated motor vehicle is aimed at maintaining a speed of 50 km/h and the actual target function of another road user as an object comparable to the automated motor vehicle is maintaining a different speed, e.g. 70 km/h, nevertheless, it is not necessary to determine or approximate this target function of the other road user.
- the device is set up to detect a state of the at least one object that is comparable to the autonomous system.
- the state of the at least one object is described, for example, by its position, speed and/or direction of movement. If the at least one object is a motor vehicle, then the state is alternatively or additionally also described by its lane and/or the distance of the at least one object to possible other road users.
- the device is set up to detect an action of the at least one object comparable to the autonomous system that changes the state of the at least one object comparable to the autonomous system.
- the action is, for example, a change in the position, speed and/or direction of movement of the object. If the object is a motor vehicle, the action is, for example, changing lanes, merging in or turning off the object.
- the device is set up to detect a subsequent state of the at least one object that is comparable to the autonomous system and that is triggered by the action of the at least one object that is comparable to the autonomous system, and the reinforcement learning agent depending on the state of the at least one object that is comparable to the autonomous system comparable object, the action of the at least one object comparable to the autonomous system, the subsequent state of the at least one object comparable to the autonomous system and a target function for the control of the autonomous system.
- the device is set up to transform a representation of the at least one object comparable to the autonomous system in the environment of the autonomous system in such a way that the transformed representation of the at least one object comparable to the autonomous system is a possible representation of the autonomous Systems corresponds, and the reinforcement learning agents depending on the detected To train behavior of at least one object comparable to the autonomous system.
- This transformation is, for example, a coordinate transformation in which the representation of the at least one object that is comparable to the autonomous system is substituted in a coordinate system for the autonomous system.
- the device is set up to recognize at least two objects in the environment of the autonomous system that are comparable to the autonomous system, to detect a behavior of the at least two objects that are comparable to the autonomous system, and to depend on the reinforcement learning agent to train on the respective detected behavior of the at least two objects that are comparable to the autonomous system.
- the device is set up to train the reinforcement learning agent at the same time as a function of the respective detected behavior of the at least two objects that are comparable to the autonomous system.
- the invention is based on the finding that if the reinforcement learning agent is trained at the same time as a function of the respective detected behavior of the at least two objects that are comparable to the autonomous system, a possibly complex pre-processing of a representation of the at least two objects that are comparable to the autonomous system can be omitted .
- the device is set up, in each case a representation of the at least two objects in the environment of the autonomous system that are comparable to the autonomous system
- a second aspect of the invention is a method for training a reinforcement learning agent to control an autonomous system.
- One step of the method is capturing the environment of the autonomous system.
- a further step of the method is the identification of at least one object in the environment of the autonomous system that is comparable to the autonomous system.
- a further step of the method is the detection of a behavior of the at least one object that is comparable to the autonomous system.
- a further step of the method is the training of the reinforcement learning agent depending on the recorded behavior of the at least one object that is comparable to the autonomous system.
- Fig. 2 shows a schematic embodiment of the invention
- Fig. 3 shows another schematic embodiment of the invention.
- FIG. 1 shows an autonomous system EGO in the form of a motor vehicle equipped with a device for training a reinforcement learning agent for controlling an autonomous system EGO.
- the device is set up to detect the surroundings of the autonomous system EGO and to recognize at least one object V1, V2, V3 in the surroundings of the autonomous system EGO that is comparable to the autonomous system EGO.
- the at least one object V1, V2, V3 that is comparable to the autonomous system EGO is, in particular, other road users, for example other motor vehicles in the vicinity of the autonomous system EGO.
- the device is set up to detect a behavior of the at least one object V1, V2, V3 that is comparable to the autonomous system EGO, and the reinforcement learning agent depending on the detected behavior of the at least one object V1, V2 that is comparable to the autonomous system EGO , V3 to train.
- motor vehicle V1 can overtake motor vehicle V2 only by taking motor vehicle V3 into account.
- the device in the motor vehicle EGO can record this non-trivial overtaking maneuver as behavior of the motor vehicle V1 and use it to train the reinforcement learning agent.
- the device is set up in particular to train the reinforcement learning as a function of the recorded behavior of the at least one object V1, V2, V3 that is comparable to the autonomous system EGO and a target function for the control of the autonomous system EGO.
- the behavior of the at least one object V1, V2, V3 that is comparable to the autonomous system EGO is, for example, due to a state of the at least one object V1, V2, V3 that is comparable to the autonomous system EGO, a state of the at least one object that is comparable to the autonomous system EGO Object V1, V2, V3 changing action of the at least one object V1, V2, V3 comparable to the autonomous system EGO and/or a subsequent state of the at least one triggered by the action of the at least one object V1, V2, V3 comparable to the autonomous system EGO object V1, V2, V3 comparable to the autonomous system EGO.
- the device shown therein is set up to recognize at least two objects V1, V2, V3 comparable to the autonomous system EGO in the environment of the autonomous system EGO, to detect a behavior of the at least two objects V1, V2, V3 comparable to the autonomous system EGO , and to train the reinforcement learning agent depending on the respectively detected behavior of the at least two objects V1, V2, V3 that are comparable to the autonomous system EGO.
- the device is set up to train the reinforcement learning agent at the same time as a function of the respective recorded behavior of the at least two objects V1, V2, V3 that are comparable to the autonomous system EGO.
- the device is set up, for example, to transform a representation of the at least one object V1, V2, V3 that is comparable to the autonomous system EGO in the environment of the autonomous system EGO in such a way that the transformed representation of the at least one object that is comparable to the autonomous system EGO V1, V2, V3 corresponds to a possible representation of the autonomous system EGO, and to train the reinforcement learning agent depending on the recorded behavior of the at least one object V1, V2, V3 that is comparable to the autonomous system EGO.
- the device shown therein is set up to recognize at least two objects V1, V2, V3 comparable to the autonomous system EGO in the environment of the autonomous system EGO, to detect a behavior of the at least two objects V1, V2, V3 comparable to the autonomous system EGO , and to train the reinforcement learning agent depending on the respectively detected behavior of the at least two objects V1, V2, V3 that are comparable to the autonomous system EGO.
- the device is set up to merge a representation of the at least two objects V1, V2, V3 in the environment of the autonomous system EGO that are comparable to the autonomous system EGO by means of a permutation invariant or by means of a permutation-equivariant mapping MAP to form a common representation REP, and to train the reinforcement learning agent depending on the common representation REP.
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- Software Systems (AREA)
- Computing Systems (AREA)
- Artificial Intelligence (AREA)
- Mathematical Physics (AREA)
- General Physics & Mathematics (AREA)
- Data Mining & Analysis (AREA)
- Evolutionary Computation (AREA)
- General Engineering & Computer Science (AREA)
- Biophysics (AREA)
- General Health & Medical Sciences (AREA)
- Computational Linguistics (AREA)
- Biomedical Technology (AREA)
- Life Sciences & Earth Sciences (AREA)
- Health & Medical Sciences (AREA)
- Molecular Biology (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Medical Informatics (AREA)
- Automation & Control Theory (AREA)
- Mechanical Engineering (AREA)
- Robotics (AREA)
- Transportation (AREA)
- Human Computer Interaction (AREA)
- Traffic Control Systems (AREA)
- Control Of Position, Course, Altitude, Or Attitude Of Moving Bodies (AREA)
Abstract
Ein Aspekt der Erfindung betrifft eine Vorrichtung zum Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems, wobei die Vorrichtung eingerichtet ist, das Umfeld des autonomen Systems zu erfassen, zumindest ein zu dem autonomen System vergleichbares Objekt im Umfeld des autonomen Systems zu erkennen, ein Verhalten des zumindest einen zu dem autonomen System vergleichbaren Objekts zu erfassen, und den Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System vergleichbaren Objekts zu trainieren.
Description
Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems
Die Erfindung betrifft eine Vorrichtung und ein Verfahren zum Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems.
Unter dem Begriff „automatisiertes Fahren“ kann im Rahmen des Dokuments ein Fahren mit automatisierter Längs- oder Querführung oder ein autonomes Fahren mit automatisierter Längs- und Querführung verstanden werden. Der Begriff „automatisiertes Fahren“ umfasst ein automatisiertes Fahren mit einem beliebigen Automatisierungsgrad. Beispielhafte Automatisierungsgrade sind ein assistiertes, teilautomatisiertes, hochautomatisiertes oder vollautomatisiertes Fahren. Diese Automatisierungsgrade wurden von der Bundesanstalt für Straßenwesen (BASt) definiert (siehe BASt-Publikation „Forschung kompakt“, Ausgabe
11/2012). Beim assistierten Fahren führt der Fahrer dauerhaft die Längs- oder Querführung aus, während das System die jeweils andere Funktion in gewissen Grenzen übernimmt. Beim teilautomatisierten Fahren (TAF) übernimmt das System die Längs- und Querführung für einen gewissen Zeitraum und/oder in spezifischen Situationen, wobei der Fahrer das System wie beim assistierten Fahren dauerhaft überwachen muss. Beim hochautomatisierten Fahren (HAF) übernimmt das System die Längs- und Querführung für einen gewissen Zeitraum, ohne dass der Fahrer das System dauerhaft überwachen muss; der Fahrer muss aber in einer gewissen Zeit in der Lage sein, die Fahrzeugführung zu übernehmen. Beim vollautomatisierten Fahren (VAF) kann das System für einen spezifischen Anwendungsfall das Fahren in allen Situationen automatisch bewältigen; für diesen Anwendungsfall ist kein Fahrer mehr erforderlich. Die vorstehend genannten vier Automatisierungsgrade gemäß der Definition der BASt entsprechen den SAE-Level 1 bis 4 der Norm SAE J3016 (SAE - Society of Automotive Engineering). Beispielsweise entspricht das hochautomatisierte Fahren (HAF) gemäß der BASt dem Level 3 der Norm SAE J3016. Ferner ist in der SAE J3016 noch der SAE-Level 5 als höchster Automatisierungsgrad vorgesehen, der in der Definition der BASt nicht enthalten ist. Der SAE- Level 5 entspricht einem fahrerlosen Fahren, bei dem das System während der ganzen Fahrt alle Situationen wie ein menschlicher Fahrer automatisch bewältigen kann; ein Fahrer ist generell nicht mehr erforderlich.
Reinforcement Learning (deutsch: bestärkendes oder verstärkendes Lernen) ist bekannt als eine Reihe von Methoden des maschinellen Lernens, bei denen ein Agent selbstständig eine Strategie erlernt, um erhaltene Belohnungen zu maximieren. Dabei wird dem Agenten nicht vorgezeigt, welche Aktion in welcher Situation die beste ist, sondern er erhält zu bestimmten Zeitpunkten eine Belohnung, die auch negativ sein kann. Anhand dieser Belohnungen approximiert er eine Nutzenfunktion, die beschreibt, welchen Wert ein bestimmter Zustand oder Aktion hat.
Zum Trainieren des Agenten ist eine große Anzahl von Trainingsdatensätzen notwendig. Das Sammeln der Trainingsdatensätze ist insbesondere im Umfeld des Einsatzes von Reinforcement Learning für automatisiertes Fahren sehr aufwändig, da ein Testfahrzeug, das zum Sammeln von Trainingsdatensätzen eingerichtet ist, nur eine sehr begrenzte Anzahl von relevanten Verkehrssituationen in einer vorgegebenen Zeit erlebt.
Es ist Aufgabe der Erfindung, die Anzahl der zum Training des Reinforcement Learning Agenten verfügbaren Trainingsdatensätze zu erhöhen.
Die Aufgabe wird durch die Merkmale der unabhängigen Patentansprüche gelöst. Vorteilhafte Ausführungsformen sind in den abhängigen Ansprüchen beschrieben. Es wird darauf hingewiesen, dass zusätzliche Merkmale eines von einem unabhängigen Patentanspruch abhängigen Patentanspruchs ohne die Merkmale des unabhängigen Patentanspruchs oder nur in Kombination mit einer Teilmenge der Merkmale des unabhängigen Patentanspruchs eine eigene und von der Kombination sämtlicher Merkmale des unabhängigen Patentanspruchs unabhängige Erfindung bilden können, die zum Gegenstand eines unabhängigen Anspruchs, einer Teilungsanmeldung oder einer Nachanmeldung gemacht werden kann. Dies gilt in gleicher Weise für in der Beschreibung beschriebene technische Lehren, die eine von den Merkmalen der unabhängigen Patentansprüche unabhängige Erfindung bilden können.
Ein erster Aspekt der Erfindung betrifft Vorrichtung zum Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems.
Das autonome System, das oft auch als autonomer Roboter bezeichnet wird, ist ein technisches System, das sein Verhalten oder seine Aufgaben mit einem hohen Grad an Autonomie, also ohne externe Steuerung, ausführt. Insbesondere handelt es sich bei dem autonomen System um ein
technisches System, das sich autonom bewegt, also beispielsweise ein autonomes Luft-, Land- oder Wasserfahrzeug.
Die Vorrichtung ist eingerichtet, das Umfeld des autonomen Systems zu erfassen, insbesondere mittels Sensoren wie beispielsweise Kameras, Radar und/oder Lidar. Sensordaten dieser Sensoren können beispielsweise fusioniert werden, um ein Umfeldmodell des Umfelds des autonomen Systems zu erzeugen, um das Umfeld des autonomen Systems gesamthaft zu erfassen.
Außerdem ist die Vorrichtung eingerichtet, zumindest ein zu dem autonomen System vergleichbares Objekt im Umfeld des autonomen Systems zu erkennen.
Das zumindest eine zu dem autonomen System vergleichbare Objekt ist insbesondere dann zu dem autonomen System vergleichbar, wenn es vergleichbare Eigenschaften und/oder einen vergleichbaren Einfluss auf sein Umfeld hat.
Das zumindest eine zu dem autonomen System vergleichbare Objekt kann selbst ein autonomes System oder aber auch ein manuelles, bzw. nichtautonomes, also ein von einem Menschen gesteuertes System sein.
Außerdem ist die Vorrichtung eingerichtet, ein Verhalten des zumindest einen zu dem autonomen System vergleichbaren Objekts zu erfassen, und den Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System vergleichbaren Objekts zu trainieren.
Hierbei liegt der Erfindung der Gedanke zugrunde, dass der Reinforcement Learning Agent nicht, wie im Stand der Technik bekannt, an Hand des Verhaltens des autonomen Systems, das der Reinforcement Learning Agent
selbst steuert oder steuern soll, lernt, sondern an Hand des Verhaltens des zumindest einem zu dem autonomen System vergleichbaren Objekts. Mit anderen Worten können somit zum Training des Reinforcement Learning Agenten nicht nur Trainingsdatensätze verwendet werden, die von dem autonomen System selbst stammen, sondern auch Trainingsdatensätze von dem zumindest einen zu dem autonomen System vergleichbaren Objekt im Umfeld des autonomen Systems.
In einer vorteilhaften Ausführungsform der Erfindung ist das autonome System ein automatisiertes Kraftfahrzeug.
Das zumindest eine zu dem automatisierten Kraftfahrzeug vergleichbares Objekt im Umfeld des automatisierten Kraftfahrzeugs hat vergleichbare Eigenschaften und/oder einen vergleichbaren Einfluss auf sein Umfeld wie das automatisierte Kraftfahrzeug. Die Eigenschaften des Kraftfahrzeugs sind dabei beispielsweise die Abmessungen, das Beschleunigungspotential, das Geschwindigkeitspotential und/oder die Umfeldkommunikationsmöglichkeiten des automatisierten Kraftfahrzeugs. Der Einfluss des automatisierten Kraftfahrtzeugs auf sein Umfeld zeigt sich beispielsweise darin, wie viel Abstand andere Verkehrsteilnehmer zu dem automatisierten Kraftfahrzeug halten.
Das zumindest eine zu dem automatisierten Kraftfahrzeugs vergleichbare Objekt im Umfeld des automatisierten Kraftfahrzeugs ist insbesondere ein anderes Kraftfahrzeug, beispielsweise ein anderes Kraftfahrzeug aus der gleichen Kraftfahrzeugklasse.
In einer weiteren vorteilhaften Ausführungsform der Erfindung ist die Vorrichtung eingerichtet, den Reinforcement Learning in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System vergleichbaren Objekts, und einer Zielfunktion (englisch: reward function) für die Steuerung des autonomen Systems zu trainieren.
Hierbei liegt der Erfindung die Erkenntnis zugrunde, dass es nicht notwendig ist, eine mögliche Zielfunktion des zumindest einen zu dem autonomen System vergleichbaren Objekts zu ermitteln, sondern dass stattdessen die bekannte Zielfunktion für die Steuerung des autonomen Systems zum Trainieren des Reinforcement Learning Agenten genutzt werden kann.
Die Zielfunktion für die Steuerung des autonomen System kann, wenn es sich bei dem autonomen System um ein automatisiertes Kraftfahrzeug handelt, beispielsweise das Einhalten einer vorgegebenen Geschwindigkeit des automatisierten Kraftfahrzeugs. Alternativ oder zusätzlich kann die Zielfunktion des auch Komfortaspekte umfassen wie z.B. eine Begrenzung der maximalen Beschleunigung des automatisierten Kraftfahrzeugs in Längs- und/oder Querrichtung. Außerdem kann die Zielfunktion auch Sicherheitsaspekte umfassen wie z.B. das Einhalten von Sicherheitsabständen zu anderen Verkehrsteilnehmern.
Es ist zwar beispielsweise möglich, dass die Zielfunktion des automatisierten Kraftfahrzeugs auf ein Einhalten einer Geschwindigkeit von 50 km/h abzielt und die tatsächliche Zielfunktion eines weiteren Verkehrsteilnehmers als zu dem automatisierten Kraftfahrzeug vergleichbaren Objekts das Einhalten einer anderen Geschwindigkeit, z.B. 70 km/h ist, dennoch ist es nicht notwendig diese Zielfunktion des weiteren Verkehrsteilnehmers zu ermitteln oder anzunähern.
In einer weiteren vorteilhaften Ausführungsform der Erfindung ist die Vorrichtung eingerichtet, einen Zustand des zumindest einen zu dem autonomen System vergleichbaren Objekts zu erfassen.
Der Zustand des zumindest einen Objekts wird beispielsweise durch dessen Position, Geschwindigkeit und/oder Bewegungsrichtung beschrieben. Wenn es sich bei dem zumindest einen Objekt um ein Kraftfahrzeug handelt, so
wird der Zustand alternativ oder zusätzlich auch durch dessen Fahrspur und/oder den Abstand des zumindest einen Objekts zu möglichen weiteren Verkehrsteilnehmern beschrieben.
Außerdem ist die Vorrichtung eingerichtet, eine den Zustand des zumindest einen zu dem autonomen System vergleichbaren Objekts verändernde Aktion des zumindest einen zu dem autonomen System vergleichbaren Objekts zu erfassen.
Die Aktion ist beispielsweise eine Änderung der Position, der Geschwindigkeit und/oder der Bewegungsrichtung des Objekts. Wenn es sich bei dem Objekt um ein Kraftfahrzeug handelt, so ist die Aktion beispielsweise auch ein Spurwechsel, ein Einfädeln oder ein Abbiegen des Objekts.
Außerdem ist die Vorrichtung eingerichtet, einen durch die Aktion des zumindest einen zu dem autonomen System vergleichbaren Objekts ausgelösten Folgezustand des zumindest einen zu dem autonomen System vergleichbaren Objekts zu erfassen, und den Reinforcement Learning Agenten in Abhängigkeit von dem Zustand des zumindest einen zu dem autonomen System vergleichbaren Objekts, der Aktion des zumindest einen zu dem autonomen System vergleichbaren Objekts, dem Folgezustand des zumindest einen zu dem autonomen System vergleichbaren Objekts und einer Zielfunktion für die Steuerung des autonomen Systems zu trainieren.
In einer weiteren vorteilhaften Ausführungsform der Erfindung ist die Vorrichtung eingerichtet, eine Repräsentation des zumindest einen zu dem autonomen System vergleichbaren Objekts im Umfeld des autonomen Systems derart zu transformieren, dass die transformierte Repräsentation des zumindest einen zu dem autonomen System vergleichbaren Objekts einer möglichen Repräsentation des autonomen Systems entspricht, und den Reinforcement Learning Agenten in Abhängigkeit von dem erfassten
Verhalten des zumindest einen zu dem autonomen System vergleichbaren Objekts zu trainieren.
Diese Transformation ist beispielsweise eine Koordinatentransformation, bei der die Repräsentation des zumindest einen zu dem autonomen System vergleichbare Objekt in einem Koordinatensystem an die Stelle des autonomen Systems gesetzt wird.
In einer weiteren vorteilhaften Ausführungsform der Erfindung ist die Vorrichtung eingerichtet, zumindest zwei zu dem autonomen System vergleichbare Objekte im Umfeld des autonomen Systems zu erkennen, jeweils ein Verhalten der zumindest zwei zu dem autonomen System vergleichbaren Objekte zu erfassen, und den Reinforcement Learning Agenten in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System vergleichbaren Objekte zu trainieren.
In einer weiteren vorteilhaften Ausführungsform der Erfindung ist die Vorrichtung eingerichtet, den Reinforcement Learning Agenten gleichzeitig in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System vergleichbaren Objekte zu trainieren.
Hierbei liegt der Erfindung die Erkenntnis zugrunde, dass bei einem gleichzeitigen Trainieren des Reinforcement Learning Agenten in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System vergleichbaren Objekte eine möglicherweise aufwändige Vorverarbeitung einer Repräsentation der zumindest zwei zu dem autonomen System vergleichbaren Objekte entfallen kann.
In einer weiteren vorteilhaften Ausführungsform der Erfindung ist die Vorrichtung eingerichtet, jeweils eine Repräsentation der zumindest zwei zu dem autonomen System vergleichbaren Objekte im Umfeld des autonomen
Systems mittels einer Permutations-invarianten oder mittels einer Permutations-äquivarianten Abbildung zu einer gemeinsamen Repräsentation zu fusionieren, und den Reinforcement Learning Agenten in Abhängigkeit von der gemeinsamen Repräsentation zu trainieren.
Ein zweiter Aspekt der Erfindung ist ein Verfahren zum Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems.
Ein Schritt des Verfahrens ist das Erfassen des Umfelds des autonomen Systems.
Ein weiterer Schritt des Verfahrens ist das Erkennen von zumindest einem zu dem autonomen System vergleichbaren Objekt im Umfeld des autonomen Systems.
Ein weiterer Schritt des Verfahrens ist das Erfassen eines Verhaltens des zumindest einem zu dem autonomen System vergleichbaren Objekts.
Ein weiterer Schritt des Verfahrens ist das Trainieren des Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System vergleichbaren Objekts.
Die vorstehenden Ausführungen zur erfindungsgemäßen Vorrichtung nach dem ersten Aspekt der Erfindung gelten in entsprechender Weise auch für das erfindungsgemäße Verfahren nach dem zweiten Aspekt der Erfindung. An dieser Stelle und in den Patentansprüchen nicht explizit beschriebene vorteilhafte Ausführungsbeispiele des erfindungsgemäßen Verfahrens entsprechen den vorstehend beschriebenen oder in den Patentansprüchen beschriebenen vorteilhaften Ausführungsbeispielen der erfindungsgemäßen Vorrichtung.
Die Erfindung wird nachfolgend anhand eines Ausführungsbeispiels unter Zuhilfenahme der beigefügten Zeichnungen beschrieben. In diesen zeigen:
Fig. 1 eine Fahrsituation zur Illustration der Erfindung,
Fig. 2 eine schematische Ausführungsform der Erfindung, und Fig. 3 eine weitere schematische Ausführungsform der Erfindung.
Fig. 1 zeigt ein mit einer Vorrichtung zum Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems EGO ausgestattetes autonomes System EGO in Form eines Kraftfahrzeugs.
Die Vorrichtung ist eingerichtet das Umfeld des autonomen Systems EGO zu erfassen und zumindest ein zu dem autonomen System EGO vergleichbares Objekt V1 , V2, V3 im Umfeld des autonomen Systems EGO zu erkennen.
Bei dem zumindest einem zu dem autonomen System EGO vergleichbaren Objekt V1 , V2, V3 handelt es sich insbesondere um weitere Verkehrsteilnehmer, beispielsweise um weitere Kraftfahrzeuge im Umfeld des autonomen Systems EGO.
Des Weiteren ist die Vorrichtung eingerichtet ein Verhalten des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 zu erfassen, und den Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 zu trainieren.
Im vorliegenden Beispiel kann das Kraftfahrzeug V1 das Kraftfahrzeug V2 nur unter Berücksichtigung des Kraftfahrzeugs V3 überholen. Diesen nicht trivialen Überholvorgang kann die Vorrichtung im Kraftfahrzeug EGO als Verhalten des Kraftfahrzeugs V1 erfassen und zum Trainieren des Reinforcement Learning Agenten verwenden.
Die Vorrichtung ist dabei insbesondere eingerichtet, den Reinforcement Learning in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 und einer Zielfunktion für die Steuerung des autonomen Systems EGO zu trainieren.
Das Verhalten des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 ist beispielsweise durch einen Zustand des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3, eine den Zustand des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 verändernde Aktion des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 und/oder einen durch die Aktion des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 ausgelösten Folgezustand des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 definiert.
Fig. 2 zeigt eine schematische Ausführungsform der Erfindung.
Die darin gezeigte Vorrichtung ist eingerichtet, zumindest zwei zu dem autonomen System EGO vergleichbare Objekte V1 , V2, V3 im Umfeld des autonomen Systems EGO zu erkennen, jeweils ein Verhalten der zumindest zwei zu dem autonomen System EGO vergleichbaren Objekte V1 , V2, V3 zu erfassen, und den Reinforcement Learning Agenten in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System EGO vergleichbaren Objekte V1 , V2, V3 zu trainieren.
Dabei ist die Vorrichtung eingerichtet, den Reinforcement Learning Agenten gleichzeitig in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System EGO vergleichbaren Objekte V1 , V2, V3 zu trainieren.
Hierzu ist die Vorrichtung beispielsweise eingerichtet, eine Repräsentation des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 im Umfeld des autonomen Systems EGO derart zu transformieren, dass die transformierte Repräsentation des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 einer möglichen Repräsentation des autonomen Systems EGO entspricht, und den Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 zu trainieren.
Fig. 3 zeigt eine weitere schematische Ausführungsform der Erfindung.
Die darin gezeigte Vorrichtung ist eingerichtet, zumindest zwei zu dem autonomen System EGO vergleichbare Objekte V1 , V2, V3 im Umfeld des autonomen Systems EGO zu erkennen, jeweils ein Verhalten der zumindest zwei zu dem autonomen System EGO vergleichbaren Objekte V1 , V2, V3 zu erfassen, und den Reinforcement Learning Agenten in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System EGO vergleichbaren Objekte V1 , V2, V3 zu trainieren.
Außerdem ist die Vorrichtung eingerichtet, jeweils eine Repräsentation der zumindest zwei zu dem autonomen System EGO vergleichbaren Objekte V1 , V2, V3 im Umfeld des autonomen Systems EGO mittels einer Permutationsinvarianten oder mittels einer Permutations-äquivarianten Abbildung MAP zu einer gemeinsamen Repräsentation REP zu fusionieren, und den Reinforcement Learning Agenten in Abhängigkeit von der gemeinsamen Repräsentation REP zu trainieren.
Claims
1 . Vorrichtung zum Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems (EGO), wobei die Vorrichtung eingerichtet ist,
• das Umfeld des autonomen Systems (EGO) zu erfassen,
• zumindest ein zu dem autonomen System (EGO) vergleichbares Objekt (V1 , V2, V3) im Umfeld des autonomen Systems (EGO) zu erkennen,
• ein Verhalten des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) zu erfassen, und
• den Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) zu trainieren.
2. Vorrichtung nach Anspruch 1 , wobei das autonome System (EGO) ein automatisiertes Kraftfahrzeug ist.
3. Vorrichtung nach einem der vorherigen Ansprüche, wobei die Vorrichtung eingerichtet ist, den Reinforcement Learning in Abhängigkeit von
• dem erfassten Verhalten des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3), und
• einer Zielfunktion für die Steuerung des autonomen Systems (EGO) zu trainieren.
Vorrichtung nach einem der vorherigen Ansprüche, wobei die Vorrichtung eingerichtet ist,
• einen Zustand des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) zu erfassen,
• eine den Zustand des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) verändernde Aktion des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) zu erfassen,
• einen durch die Aktion des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) ausgelösten Folgezustand des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) zu erfassen, und
• den Reinforcement Learning Agenten in Abhängigkeit von
• dem Zustand des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3), der Aktion des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3), dem Folgezustand des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3), und
• einer Zielfunktion für die Steuerung des autonomen Systems (EGO) zu trainieren. Vorrichtung nach einem der vorherigen Ansprüche, wobei die Vorrichtung eingerichtet ist,
• eine Repräsentation des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) im Umfeld des autonomen Systems (EGO) derart zu transformieren, dass die transformierte Repräsentation des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3)
15 einer möglichen Repräsentation des autonomen Systems (EGO) entspricht, und
• den Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) zu trainieren. Vorrichtung nach einem der vorherigen Ansprüche, wobei die Vorrichtung eingerichtet ist,
• zumindest zwei zu dem autonomen System (EGO) vergleichbare Objekte (V1 , V2, V3) im Umfeld des autonomen Systems (EGO) zu erkennen,
• jeweils ein Verhalten der zumindest zwei zu dem autonomen System (EGO) vergleichbaren Objekte (V1 , V2, V3) zu erfassen, und
• den Reinforcement Learning Agenten in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System (EGO) vergleichbaren Objekte (V1 , V2, V3) zu trainieren. Vorrichtung nach Anspruch 5, wobei die Vorrichtung eingerichtet ist, den Reinforcement Learning Agenten gleichzeitig in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System (EGO) vergleichbaren Objekte (V1 , V2, V3) zu trainieren. Vorrichtung nach Anspruch 5 oder 6, wobei die Vorrichtung eingerichtet ist,
• jeweils eine Repräsentation der zumindest zwei zu dem autonomen System (EGO) vergleichbaren Objekte (V1 , V2, V3) im Umfeld des autonomen Systems (EGO) mittels einer
16
Permutations-invarianten oder mittels einer Permutations- äquivarianten Abbildung (MAP) zu einer gemeinsamen Repräsentation (REP) zu fusionieren, und
• den Reinforcement Learning Agenten in Abhängigkeit von der gemeinsamen Repräsentation (REP) zu trainieren. Verfahren zum Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems (EGO), wobei das Verfahren die folgenden Schritte umfasst:
• Erfassen des Umfelds des autonomen Systems (EGO),
• Erkennen von zumindest einem zu dem autonomen System (EGO) vergleichbaren Objekt (V1 , V2, V3) im Umfeld des autonomen Systems (EGO),
• Erfassen eines Verhaltens des zumindest einem zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3), und
• Trainieren des Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3).
Priority Applications (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202180056057.1A CN116057540A (zh) | 2020-08-11 | 2021-06-14 | 训练强化学习代理以控制自治系统 |
| US18/020,688 US20240037447A1 (en) | 2020-08-11 | 2021-06-14 | Training a Reinforcement Learning Agent to Control an Autonomous System |
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| DE102020121150.3 | 2020-08-11 | ||
| DE102020121150.3A DE102020121150A1 (de) | 2020-08-11 | 2020-08-11 | Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| WO2022033746A1 true WO2022033746A1 (de) | 2022-02-17 |
Family
ID=76584474
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| PCT/EP2021/065919 Ceased WO2022033746A1 (de) | 2020-08-11 | 2021-06-14 | Trainieren eines reinforcement learning agenten zur steuerung eines autonomen systems |
Country Status (4)
| Country | Link |
|---|---|
| US (1) | US20240037447A1 (de) |
| CN (1) | CN116057540A (de) |
| DE (1) | DE102020121150A1 (de) |
| WO (1) | WO2022033746A1 (de) |
Families Citing this family (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20230237805A1 (en) * | 2022-01-24 | 2023-07-27 | Nec Laboratories America, Inc. | Video classifier |
Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US10627823B1 (en) * | 2019-01-30 | 2020-04-21 | StradVision, Inc. | Method and device for performing multiple agent sensor fusion in cooperative driving based on reinforcement learning |
| US20200189597A1 (en) * | 2018-12-12 | 2020-06-18 | Visteon Global Technologies, Inc. | Reinforcement learning based approach for sae level-4 automated lane change |
Family Cites Families (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| DE102017209347A1 (de) | 2017-06-01 | 2018-12-06 | Robert Bosch Gmbh | Verfahren und Vorrichtung zum Steuern eines Fahrzeugs |
| DE102019202090A1 (de) | 2018-03-14 | 2019-09-19 | Robert Bosch Gmbh | Verfahren zum Erzeugen eines Trainingsdatensatzes zum Trainieren eines Künstlichen-Intelligenz-Moduls für eine Steuervorrichtung eines Roboters |
| CN110322017A (zh) * | 2019-08-13 | 2019-10-11 | 吉林大学 | 基于深度强化学习的自动驾驶智能车轨迹跟踪控制策略 |
-
2020
- 2020-08-11 DE DE102020121150.3A patent/DE102020121150A1/de active Pending
-
2021
- 2021-06-14 CN CN202180056057.1A patent/CN116057540A/zh active Pending
- 2021-06-14 WO PCT/EP2021/065919 patent/WO2022033746A1/de not_active Ceased
- 2021-06-14 US US18/020,688 patent/US20240037447A1/en active Pending
Patent Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20200189597A1 (en) * | 2018-12-12 | 2020-06-18 | Visteon Global Technologies, Inc. | Reinforcement learning based approach for sae level-4 automated lane change |
| US10627823B1 (en) * | 2019-01-30 | 2020-04-21 | StradVision, Inc. | Method and device for performing multiple agent sensor fusion in cooperative driving based on reinforcement learning |
Non-Patent Citations (2)
| Title |
|---|
| MICHEL DEUDON ET AL: "HighRes-net: Recursive Fusion for Multi-Frame Super-Resolution of Satellite Imagery", ARXIV.ORG, CORNELL UNIVERSITY LIBRARY, 201 OLIN LIBRARY CORNELL UNIVERSITY ITHACA, NY 14853, 15 February 2020 (2020-02-15), XP081600852 * |
| WANG PIN ET AL: "A Reinforcement Learning Based Approach for Automated Lane Change Maneuvers", 2018 IEEE INTELLIGENT VEHICLES SYMPOSIUM (IV), IEEE, 26 June 2018 (2018-06-26), pages 1379 - 1384, XP033423455, DOI: 10.1109/IVS.2018.8500556 * |
Also Published As
| Publication number | Publication date |
|---|---|
| US20240037447A1 (en) | 2024-02-01 |
| CN116057540A (zh) | 2023-05-02 |
| DE102020121150A1 (de) | 2022-02-17 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| DE102016220945A1 (de) | Verfahren und Vorrichtung zum Unterstützen eines Manövriervorganges eines Kraftfahrzeuges | |
| EP3356203B1 (de) | Verfahren zum bestimmen einer parkfläche zum parken eines kraftfahrzeugs, fahrerassistenzsystem sowie kraftfahrzeug | |
| DE102014216577A1 (de) | Verfahren und Vorrichtung zur Unterstützung eines Fahrers eines Kraftfahrzeugs | |
| DE102019219534A1 (de) | Verfahren zum Bestimmen von Regelparametern für ein Regelsystem | |
| DE102014220144A1 (de) | Verfahren und Vorrichtung zur Unterstützung eines Fahrers eines Kraftfahrzeugs | |
| DE102010028109A1 (de) | Verfahren zur Verbesserung der Fahrstabilität eines Fahrzeugs | |
| DE102017205508A1 (de) | Verfahren zur automatischen Bewegungssteuerung eines Fahrzeugs | |
| DE102019216147B3 (de) | Verfahren zur Bestimmung einer Befahrbarkeit eines Bereichs eines Geländes für ein Fahrzeug | |
| DE102020105434A1 (de) | Verfahren zum betreiben eines fahrzeugs, parkassistenzsystem und fahrzeug | |
| DE102017111054A1 (de) | Verfahren zum Betreiben eines Federungssystems eines Kraftfahrzeugs, Steuergerät, Federungssystem sowie Kraftfahrzeug | |
| DE102015112311A1 (de) | Verfahren zum zumindest semi-autonomen Manövrieren eines Kraftfahrzeugs mit Erkennung eines Bordsteinkontakts, Fahrerassistenzsystem sowie Kraftfahrzeug | |
| DE102015005364A1 (de) | Vorrichtung und Verfahren zum Verzögern eines Fahrzeugs | |
| DE102020202757A1 (de) | Verfahren zur Steuerung eines Fahrzeuges | |
| DE102015112313A1 (de) | Verfahren zum zumindest semi-autonomen Manövrieren eines Kraftfahrzeugs mit Lagekorrektur, Fahrerassistenzsystem sowie Kraftfahrzeug | |
| DE102016122759A1 (de) | Verfahren zum Betreiben eines Fahrerassistenzsystems zum zumindest semi-autonomen Manövrieren eines Kraftfahrzeugs unter Berücksichtigung eines geographischen Bereichs, Fahrerassistenzsystem sowie Kraftfahrzeug | |
| EP3599115B1 (de) | Verfahren und system zum automatischen erkennen eines ankuppelmanövers eines kraftfahrzeugs an einen anhänger | |
| DE102016003231A1 (de) | Verfahren zum Steuern eines zumindest teilautonom betriebenen Kraftfahrzeugs und Kraftfahrzeug | |
| DE102020107941A1 (de) | Verfahren zum Bereitstellen von unterschiedlichen Fahrerassistenzfunktionen für ein Fahrzeug zum automatisierten Abfahren von zuvor aufgezeichneten Wegstrecken, Recheneinrichtung sowie Fahrerassistenzvorrichtung | |
| WO2020193490A1 (de) | Verfahren und fahrerassistenzsystem zur unterstützung eines fahrers eines fahrzeugs bei einem einparkmanöver in eine längsparklücke | |
| DE102016122760A1 (de) | Verfahren zum Betreiben eines Fahrerassistenzsystems eines Kraftfahrzeugs zum Manövrieren des Kraftfahrzeugs zu verschiedenen Zielpunkten, Fahrerassistenzsystem sowie Kraftfahrzeug | |
| DE102016103899A1 (de) | Verfahren zum autonomen Einparken eines Kraftfahrzeugs in eine Parklücke mit Vorgabe eines Geschwindigkeitsprofils, Fahrerassistenzsystems sowie Kraftfahrzeug | |
| DE102018119834A1 (de) | Verfahren zum Betrieb eines autonom fahrenden Fahrzeuges | |
| WO2022033746A1 (de) | Trainieren eines reinforcement learning agenten zur steuerung eines autonomen systems | |
| WO2019196986A1 (de) | Fusionssystem zur fusion von umfeldinformation für ein kraftfahrzeug | |
| DE102016003116A1 (de) | Verfahren zum Betreiben eines Fahrwerks eines Kraftfahrzeugs |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| 121 | Ep: the epo has been informed by wipo that ep was designated in this application |
Ref document number: 21734063 Country of ref document: EP Kind code of ref document: A1 |
|
| WWE | Wipo information: entry into national phase |
Ref document number: 18020688 Country of ref document: US |
|
| NENP | Non-entry into the national phase |
Ref country code: DE |
|
| 122 | Ep: pct application non-entry in european phase |
Ref document number: 21734063 Country of ref document: EP Kind code of ref document: A1 |