WO2022033746A1 - Trainieren eines reinforcement learning agenten zur steuerung eines autonomen systems - Google Patents

Trainieren eines reinforcement learning agenten zur steuerung eines autonomen systems Download PDF

Info

Publication number
WO2022033746A1
WO2022033746A1 PCT/EP2021/065919 EP2021065919W WO2022033746A1 WO 2022033746 A1 WO2022033746 A1 WO 2022033746A1 EP 2021065919 W EP2021065919 W EP 2021065919W WO 2022033746 A1 WO2022033746 A1 WO 2022033746A1
Authority
WO
WIPO (PCT)
Prior art keywords
autonomous system
ego
comparable
reinforcement learning
learning agent
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
PCT/EP2021/065919
Other languages
English (en)
French (fr)
Inventor
Moritz Werling
Gabriel Kalweit
Maria Hügle
Joschka Bödecker
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Bayerische Motoren Werke AG
Original Assignee
Bayerische Motoren Werke AG
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Bayerische Motoren Werke AG filed Critical Bayerische Motoren Werke AG
Priority to CN202180056057.1A priority Critical patent/CN116057540A/zh
Priority to US18/020,688 priority patent/US20240037447A1/en
Publication of WO2022033746A1 publication Critical patent/WO2022033746A1/de
Anticipated expiration legal-status Critical
Ceased legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N20/00Machine learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/004Artificial life, i.e. computing arrangements simulating life
    • G06N3/008Artificial life, i.e. computing arrangements simulating life based on physical entities controlled by simulated intelligence so as to replicate intelligent life forms, e.g. based on robots replicating pets or humans in their appearance or behaviour
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B60VEHICLES IN GENERAL
    • B60WCONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
    • B60W60/00Drive control systems specially adapted for autonomous road vehicles
    • B60W60/001Planning or execution of driving tasks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/092Reinforcement learning

Definitions

  • the invention relates to a device and a method for training a reinforcement learning agent for controlling an autonomous system.
  • automated driving can be understood as driving with automated longitudinal or lateral guidance or autonomous driving with automated longitudinal and lateral guidance.
  • automated driving includes automated driving with any degree of automation. Exemplary degrees of automation are assisted, partially automated, highly automated or fully automated driving. These degrees of automation were defined by the Federal Highway Research Institute (BASt) (see BASt publication “Research compact”, edition 11/2012).
  • assisted driving the driver constantly performs longitudinal or lateral guidance, while the system takes over the other function within certain limits.
  • TAF semi-automated driving
  • the system takes over longitudinal and lateral guidance for a certain period of time and/or in specific situations, whereby the driver has to constantly monitor the system, as with assisted driving.
  • HAD highly automated driving
  • VAF fully automated driving
  • highly automated driving (HAF) corresponds to level 3 of the SAE J3016 standard.
  • SAE J3016 also provides SAE Level 5 as the highest degree of automation, which is not included in the BASt definition.
  • SAE Level 5 corresponds to driverless driving, in which the system can automatically handle all situations like a human driver throughout the journey; a driver is generally no longer required.
  • Reinforcement learning is known as a set of machine learning methods in which an agent autonomously learns a strategy to maximize rewards received.
  • the agent is not shown which action is best in which situation, but receives a reward at certain times, which can also be negative. Using these rewards, he approximates a utility function that describes the value of a particular state or action.
  • a large number of training data sets are required to train the agent. Collecting the training datasets is very complex, especially in the context of using reinforcement learning for automated driving, since a test vehicle that is set up to collect training datasets only experiences a very limited number of relevant traffic situations in a given time.
  • a first aspect of the invention relates to a device for training a reinforcement learning agent for controlling an autonomous system.
  • the autonomous system which is often also referred to as an autonomous robot, is a technical system that carries out its behavior or its tasks with a high degree of autonomy, i.e. without external control.
  • the autonomous system is a technical system that moves autonomously, for example an autonomous air, land or water vehicle.
  • the device is set up to record the surroundings of the autonomous system, in particular using sensors such as cameras, radar and/or lidar. Sensor data from these sensors can be merged, for example, in order to generate an environment model of the environment of the autonomous system in order to record the environment of the autonomous system as a whole.
  • the device is set up to recognize at least one object that is comparable to the autonomous system in the area surrounding the autonomous system.
  • the at least one object comparable to the autonomous system is comparable to the autonomous system in particular when it has comparable properties and/or a comparable influence on its environment.
  • the at least one object comparable to the autonomous system can itself be an autonomous system or else a manual or non-autonomous system, ie a system controlled by a human.
  • the device is set up to record a behavior of the at least one object that is comparable to the autonomous system and to train the reinforcement learning agent as a function of the recorded behavior of the at least one object that is comparable to the autonomous system.
  • the invention is based on the idea that the reinforcement learning agent is not, as is known in the prior art, based on the behavior of the autonomous system that the reinforcement learning agent controls itself or should control learns, but on the basis of the behavior of at least one object comparable to the autonomous system.
  • the reinforcement learning agent is not, as is known in the prior art, based on the behavior of the autonomous system that the reinforcement learning agent controls itself or should control learns, but on the basis of the behavior of at least one object comparable to the autonomous system.
  • training data records can be used to train the reinforcement learning agent, which originate from the autonomous system itself, but also training data records from the at least one object in the environment of the autonomous system that is comparable to the autonomous system.
  • the autonomous system is an automated motor vehicle.
  • the at least one object in the environment of the automated motor vehicle that is comparable to the automated motor vehicle has comparable properties and/or a comparable influence on its surroundings as the automated motor vehicle.
  • the properties of the motor vehicle are, for example, the dimensions, the acceleration potential, the speed potential and/or the options for communicating with the surroundings of the automated motor vehicle.
  • the influence of the automated motor vehicle on its surroundings can be seen, for example, in how far away other road users keep from the automated motor vehicle.
  • the at least one object in the area surrounding the automated motor vehicle that is comparable to the automated motor vehicle is, in particular, another motor vehicle, for example another motor vehicle from the same motor vehicle class.
  • the device is set up to train reinforcement learning as a function of the detected behavior of the at least one object comparable to the autonomous system, and a target function (reward function) for the control of the autonomous system.
  • the invention is based on the finding that it is not necessary to determine a possible target function of the at least one object that is comparable to the autonomous system, but rather that the known target function for controlling the autonomous system can be used to train the reinforcement learning agent .
  • the target function for controlling the autonomous system can be, for example, maintaining a predefined speed of the automated motor vehicle.
  • the target function of the can also include comfort aspects, such as limiting the maximum acceleration of the automated motor vehicle in the longitudinal and/or transverse direction.
  • the target function can also include safety aspects such as maintaining a safe distance from other road users.
  • the target function of the automated motor vehicle is aimed at maintaining a speed of 50 km/h and the actual target function of another road user as an object comparable to the automated motor vehicle is maintaining a different speed, e.g. 70 km/h, nevertheless, it is not necessary to determine or approximate this target function of the other road user.
  • the device is set up to detect a state of the at least one object that is comparable to the autonomous system.
  • the state of the at least one object is described, for example, by its position, speed and/or direction of movement. If the at least one object is a motor vehicle, then the state is alternatively or additionally also described by its lane and/or the distance of the at least one object to possible other road users.
  • the device is set up to detect an action of the at least one object comparable to the autonomous system that changes the state of the at least one object comparable to the autonomous system.
  • the action is, for example, a change in the position, speed and/or direction of movement of the object. If the object is a motor vehicle, the action is, for example, changing lanes, merging in or turning off the object.
  • the device is set up to detect a subsequent state of the at least one object that is comparable to the autonomous system and that is triggered by the action of the at least one object that is comparable to the autonomous system, and the reinforcement learning agent depending on the state of the at least one object that is comparable to the autonomous system comparable object, the action of the at least one object comparable to the autonomous system, the subsequent state of the at least one object comparable to the autonomous system and a target function for the control of the autonomous system.
  • the device is set up to transform a representation of the at least one object comparable to the autonomous system in the environment of the autonomous system in such a way that the transformed representation of the at least one object comparable to the autonomous system is a possible representation of the autonomous Systems corresponds, and the reinforcement learning agents depending on the detected To train behavior of at least one object comparable to the autonomous system.
  • This transformation is, for example, a coordinate transformation in which the representation of the at least one object that is comparable to the autonomous system is substituted in a coordinate system for the autonomous system.
  • the device is set up to recognize at least two objects in the environment of the autonomous system that are comparable to the autonomous system, to detect a behavior of the at least two objects that are comparable to the autonomous system, and to depend on the reinforcement learning agent to train on the respective detected behavior of the at least two objects that are comparable to the autonomous system.
  • the device is set up to train the reinforcement learning agent at the same time as a function of the respective detected behavior of the at least two objects that are comparable to the autonomous system.
  • the invention is based on the finding that if the reinforcement learning agent is trained at the same time as a function of the respective detected behavior of the at least two objects that are comparable to the autonomous system, a possibly complex pre-processing of a representation of the at least two objects that are comparable to the autonomous system can be omitted .
  • the device is set up, in each case a representation of the at least two objects in the environment of the autonomous system that are comparable to the autonomous system
  • a second aspect of the invention is a method for training a reinforcement learning agent to control an autonomous system.
  • One step of the method is capturing the environment of the autonomous system.
  • a further step of the method is the identification of at least one object in the environment of the autonomous system that is comparable to the autonomous system.
  • a further step of the method is the detection of a behavior of the at least one object that is comparable to the autonomous system.
  • a further step of the method is the training of the reinforcement learning agent depending on the recorded behavior of the at least one object that is comparable to the autonomous system.
  • Fig. 2 shows a schematic embodiment of the invention
  • Fig. 3 shows another schematic embodiment of the invention.
  • FIG. 1 shows an autonomous system EGO in the form of a motor vehicle equipped with a device for training a reinforcement learning agent for controlling an autonomous system EGO.
  • the device is set up to detect the surroundings of the autonomous system EGO and to recognize at least one object V1, V2, V3 in the surroundings of the autonomous system EGO that is comparable to the autonomous system EGO.
  • the at least one object V1, V2, V3 that is comparable to the autonomous system EGO is, in particular, other road users, for example other motor vehicles in the vicinity of the autonomous system EGO.
  • the device is set up to detect a behavior of the at least one object V1, V2, V3 that is comparable to the autonomous system EGO, and the reinforcement learning agent depending on the detected behavior of the at least one object V1, V2 that is comparable to the autonomous system EGO , V3 to train.
  • motor vehicle V1 can overtake motor vehicle V2 only by taking motor vehicle V3 into account.
  • the device in the motor vehicle EGO can record this non-trivial overtaking maneuver as behavior of the motor vehicle V1 and use it to train the reinforcement learning agent.
  • the device is set up in particular to train the reinforcement learning as a function of the recorded behavior of the at least one object V1, V2, V3 that is comparable to the autonomous system EGO and a target function for the control of the autonomous system EGO.
  • the behavior of the at least one object V1, V2, V3 that is comparable to the autonomous system EGO is, for example, due to a state of the at least one object V1, V2, V3 that is comparable to the autonomous system EGO, a state of the at least one object that is comparable to the autonomous system EGO Object V1, V2, V3 changing action of the at least one object V1, V2, V3 comparable to the autonomous system EGO and/or a subsequent state of the at least one triggered by the action of the at least one object V1, V2, V3 comparable to the autonomous system EGO object V1, V2, V3 comparable to the autonomous system EGO.
  • the device shown therein is set up to recognize at least two objects V1, V2, V3 comparable to the autonomous system EGO in the environment of the autonomous system EGO, to detect a behavior of the at least two objects V1, V2, V3 comparable to the autonomous system EGO , and to train the reinforcement learning agent depending on the respectively detected behavior of the at least two objects V1, V2, V3 that are comparable to the autonomous system EGO.
  • the device is set up to train the reinforcement learning agent at the same time as a function of the respective recorded behavior of the at least two objects V1, V2, V3 that are comparable to the autonomous system EGO.
  • the device is set up, for example, to transform a representation of the at least one object V1, V2, V3 that is comparable to the autonomous system EGO in the environment of the autonomous system EGO in such a way that the transformed representation of the at least one object that is comparable to the autonomous system EGO V1, V2, V3 corresponds to a possible representation of the autonomous system EGO, and to train the reinforcement learning agent depending on the recorded behavior of the at least one object V1, V2, V3 that is comparable to the autonomous system EGO.
  • the device shown therein is set up to recognize at least two objects V1, V2, V3 comparable to the autonomous system EGO in the environment of the autonomous system EGO, to detect a behavior of the at least two objects V1, V2, V3 comparable to the autonomous system EGO , and to train the reinforcement learning agent depending on the respectively detected behavior of the at least two objects V1, V2, V3 that are comparable to the autonomous system EGO.
  • the device is set up to merge a representation of the at least two objects V1, V2, V3 in the environment of the autonomous system EGO that are comparable to the autonomous system EGO by means of a permutation invariant or by means of a permutation-equivariant mapping MAP to form a common representation REP, and to train the reinforcement learning agent depending on the common representation REP.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Software Systems (AREA)
  • Computing Systems (AREA)
  • Artificial Intelligence (AREA)
  • Mathematical Physics (AREA)
  • General Physics & Mathematics (AREA)
  • Data Mining & Analysis (AREA)
  • Evolutionary Computation (AREA)
  • General Engineering & Computer Science (AREA)
  • Biophysics (AREA)
  • General Health & Medical Sciences (AREA)
  • Computational Linguistics (AREA)
  • Biomedical Technology (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Health & Medical Sciences (AREA)
  • Molecular Biology (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Medical Informatics (AREA)
  • Automation & Control Theory (AREA)
  • Mechanical Engineering (AREA)
  • Robotics (AREA)
  • Transportation (AREA)
  • Human Computer Interaction (AREA)
  • Traffic Control Systems (AREA)
  • Control Of Position, Course, Altitude, Or Attitude Of Moving Bodies (AREA)

Abstract

Ein Aspekt der Erfindung betrifft eine Vorrichtung zum Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems, wobei die Vorrichtung eingerichtet ist, das Umfeld des autonomen Systems zu erfassen, zumindest ein zu dem autonomen System vergleichbares Objekt im Umfeld des autonomen Systems zu erkennen, ein Verhalten des zumindest einen zu dem autonomen System vergleichbaren Objekts zu erfassen, und den Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System vergleichbaren Objekts zu trainieren.

Description

Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems
Die Erfindung betrifft eine Vorrichtung und ein Verfahren zum Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems.
Unter dem Begriff „automatisiertes Fahren“ kann im Rahmen des Dokuments ein Fahren mit automatisierter Längs- oder Querführung oder ein autonomes Fahren mit automatisierter Längs- und Querführung verstanden werden. Der Begriff „automatisiertes Fahren“ umfasst ein automatisiertes Fahren mit einem beliebigen Automatisierungsgrad. Beispielhafte Automatisierungsgrade sind ein assistiertes, teilautomatisiertes, hochautomatisiertes oder vollautomatisiertes Fahren. Diese Automatisierungsgrade wurden von der Bundesanstalt für Straßenwesen (BASt) definiert (siehe BASt-Publikation „Forschung kompakt“, Ausgabe 11/2012). Beim assistierten Fahren führt der Fahrer dauerhaft die Längs- oder Querführung aus, während das System die jeweils andere Funktion in gewissen Grenzen übernimmt. Beim teilautomatisierten Fahren (TAF) übernimmt das System die Längs- und Querführung für einen gewissen Zeitraum und/oder in spezifischen Situationen, wobei der Fahrer das System wie beim assistierten Fahren dauerhaft überwachen muss. Beim hochautomatisierten Fahren (HAF) übernimmt das System die Längs- und Querführung für einen gewissen Zeitraum, ohne dass der Fahrer das System dauerhaft überwachen muss; der Fahrer muss aber in einer gewissen Zeit in der Lage sein, die Fahrzeugführung zu übernehmen. Beim vollautomatisierten Fahren (VAF) kann das System für einen spezifischen Anwendungsfall das Fahren in allen Situationen automatisch bewältigen; für diesen Anwendungsfall ist kein Fahrer mehr erforderlich. Die vorstehend genannten vier Automatisierungsgrade gemäß der Definition der BASt entsprechen den SAE-Level 1 bis 4 der Norm SAE J3016 (SAE - Society of Automotive Engineering). Beispielsweise entspricht das hochautomatisierte Fahren (HAF) gemäß der BASt dem Level 3 der Norm SAE J3016. Ferner ist in der SAE J3016 noch der SAE-Level 5 als höchster Automatisierungsgrad vorgesehen, der in der Definition der BASt nicht enthalten ist. Der SAE- Level 5 entspricht einem fahrerlosen Fahren, bei dem das System während der ganzen Fahrt alle Situationen wie ein menschlicher Fahrer automatisch bewältigen kann; ein Fahrer ist generell nicht mehr erforderlich.
Reinforcement Learning (deutsch: bestärkendes oder verstärkendes Lernen) ist bekannt als eine Reihe von Methoden des maschinellen Lernens, bei denen ein Agent selbstständig eine Strategie erlernt, um erhaltene Belohnungen zu maximieren. Dabei wird dem Agenten nicht vorgezeigt, welche Aktion in welcher Situation die beste ist, sondern er erhält zu bestimmten Zeitpunkten eine Belohnung, die auch negativ sein kann. Anhand dieser Belohnungen approximiert er eine Nutzenfunktion, die beschreibt, welchen Wert ein bestimmter Zustand oder Aktion hat. Zum Trainieren des Agenten ist eine große Anzahl von Trainingsdatensätzen notwendig. Das Sammeln der Trainingsdatensätze ist insbesondere im Umfeld des Einsatzes von Reinforcement Learning für automatisiertes Fahren sehr aufwändig, da ein Testfahrzeug, das zum Sammeln von Trainingsdatensätzen eingerichtet ist, nur eine sehr begrenzte Anzahl von relevanten Verkehrssituationen in einer vorgegebenen Zeit erlebt.
Es ist Aufgabe der Erfindung, die Anzahl der zum Training des Reinforcement Learning Agenten verfügbaren Trainingsdatensätze zu erhöhen.
Die Aufgabe wird durch die Merkmale der unabhängigen Patentansprüche gelöst. Vorteilhafte Ausführungsformen sind in den abhängigen Ansprüchen beschrieben. Es wird darauf hingewiesen, dass zusätzliche Merkmale eines von einem unabhängigen Patentanspruch abhängigen Patentanspruchs ohne die Merkmale des unabhängigen Patentanspruchs oder nur in Kombination mit einer Teilmenge der Merkmale des unabhängigen Patentanspruchs eine eigene und von der Kombination sämtlicher Merkmale des unabhängigen Patentanspruchs unabhängige Erfindung bilden können, die zum Gegenstand eines unabhängigen Anspruchs, einer Teilungsanmeldung oder einer Nachanmeldung gemacht werden kann. Dies gilt in gleicher Weise für in der Beschreibung beschriebene technische Lehren, die eine von den Merkmalen der unabhängigen Patentansprüche unabhängige Erfindung bilden können.
Ein erster Aspekt der Erfindung betrifft Vorrichtung zum Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems.
Das autonome System, das oft auch als autonomer Roboter bezeichnet wird, ist ein technisches System, das sein Verhalten oder seine Aufgaben mit einem hohen Grad an Autonomie, also ohne externe Steuerung, ausführt. Insbesondere handelt es sich bei dem autonomen System um ein technisches System, das sich autonom bewegt, also beispielsweise ein autonomes Luft-, Land- oder Wasserfahrzeug.
Die Vorrichtung ist eingerichtet, das Umfeld des autonomen Systems zu erfassen, insbesondere mittels Sensoren wie beispielsweise Kameras, Radar und/oder Lidar. Sensordaten dieser Sensoren können beispielsweise fusioniert werden, um ein Umfeldmodell des Umfelds des autonomen Systems zu erzeugen, um das Umfeld des autonomen Systems gesamthaft zu erfassen.
Außerdem ist die Vorrichtung eingerichtet, zumindest ein zu dem autonomen System vergleichbares Objekt im Umfeld des autonomen Systems zu erkennen.
Das zumindest eine zu dem autonomen System vergleichbare Objekt ist insbesondere dann zu dem autonomen System vergleichbar, wenn es vergleichbare Eigenschaften und/oder einen vergleichbaren Einfluss auf sein Umfeld hat.
Das zumindest eine zu dem autonomen System vergleichbare Objekt kann selbst ein autonomes System oder aber auch ein manuelles, bzw. nichtautonomes, also ein von einem Menschen gesteuertes System sein.
Außerdem ist die Vorrichtung eingerichtet, ein Verhalten des zumindest einen zu dem autonomen System vergleichbaren Objekts zu erfassen, und den Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System vergleichbaren Objekts zu trainieren.
Hierbei liegt der Erfindung der Gedanke zugrunde, dass der Reinforcement Learning Agent nicht, wie im Stand der Technik bekannt, an Hand des Verhaltens des autonomen Systems, das der Reinforcement Learning Agent selbst steuert oder steuern soll, lernt, sondern an Hand des Verhaltens des zumindest einem zu dem autonomen System vergleichbaren Objekts. Mit anderen Worten können somit zum Training des Reinforcement Learning Agenten nicht nur Trainingsdatensätze verwendet werden, die von dem autonomen System selbst stammen, sondern auch Trainingsdatensätze von dem zumindest einen zu dem autonomen System vergleichbaren Objekt im Umfeld des autonomen Systems.
In einer vorteilhaften Ausführungsform der Erfindung ist das autonome System ein automatisiertes Kraftfahrzeug.
Das zumindest eine zu dem automatisierten Kraftfahrzeug vergleichbares Objekt im Umfeld des automatisierten Kraftfahrzeugs hat vergleichbare Eigenschaften und/oder einen vergleichbaren Einfluss auf sein Umfeld wie das automatisierte Kraftfahrzeug. Die Eigenschaften des Kraftfahrzeugs sind dabei beispielsweise die Abmessungen, das Beschleunigungspotential, das Geschwindigkeitspotential und/oder die Umfeldkommunikationsmöglichkeiten des automatisierten Kraftfahrzeugs. Der Einfluss des automatisierten Kraftfahrtzeugs auf sein Umfeld zeigt sich beispielsweise darin, wie viel Abstand andere Verkehrsteilnehmer zu dem automatisierten Kraftfahrzeug halten.
Das zumindest eine zu dem automatisierten Kraftfahrzeugs vergleichbare Objekt im Umfeld des automatisierten Kraftfahrzeugs ist insbesondere ein anderes Kraftfahrzeug, beispielsweise ein anderes Kraftfahrzeug aus der gleichen Kraftfahrzeugklasse.
In einer weiteren vorteilhaften Ausführungsform der Erfindung ist die Vorrichtung eingerichtet, den Reinforcement Learning in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System vergleichbaren Objekts, und einer Zielfunktion (englisch: reward function) für die Steuerung des autonomen Systems zu trainieren. Hierbei liegt der Erfindung die Erkenntnis zugrunde, dass es nicht notwendig ist, eine mögliche Zielfunktion des zumindest einen zu dem autonomen System vergleichbaren Objekts zu ermitteln, sondern dass stattdessen die bekannte Zielfunktion für die Steuerung des autonomen Systems zum Trainieren des Reinforcement Learning Agenten genutzt werden kann.
Die Zielfunktion für die Steuerung des autonomen System kann, wenn es sich bei dem autonomen System um ein automatisiertes Kraftfahrzeug handelt, beispielsweise das Einhalten einer vorgegebenen Geschwindigkeit des automatisierten Kraftfahrzeugs. Alternativ oder zusätzlich kann die Zielfunktion des auch Komfortaspekte umfassen wie z.B. eine Begrenzung der maximalen Beschleunigung des automatisierten Kraftfahrzeugs in Längs- und/oder Querrichtung. Außerdem kann die Zielfunktion auch Sicherheitsaspekte umfassen wie z.B. das Einhalten von Sicherheitsabständen zu anderen Verkehrsteilnehmern.
Es ist zwar beispielsweise möglich, dass die Zielfunktion des automatisierten Kraftfahrzeugs auf ein Einhalten einer Geschwindigkeit von 50 km/h abzielt und die tatsächliche Zielfunktion eines weiteren Verkehrsteilnehmers als zu dem automatisierten Kraftfahrzeug vergleichbaren Objekts das Einhalten einer anderen Geschwindigkeit, z.B. 70 km/h ist, dennoch ist es nicht notwendig diese Zielfunktion des weiteren Verkehrsteilnehmers zu ermitteln oder anzunähern.
In einer weiteren vorteilhaften Ausführungsform der Erfindung ist die Vorrichtung eingerichtet, einen Zustand des zumindest einen zu dem autonomen System vergleichbaren Objekts zu erfassen.
Der Zustand des zumindest einen Objekts wird beispielsweise durch dessen Position, Geschwindigkeit und/oder Bewegungsrichtung beschrieben. Wenn es sich bei dem zumindest einen Objekt um ein Kraftfahrzeug handelt, so wird der Zustand alternativ oder zusätzlich auch durch dessen Fahrspur und/oder den Abstand des zumindest einen Objekts zu möglichen weiteren Verkehrsteilnehmern beschrieben.
Außerdem ist die Vorrichtung eingerichtet, eine den Zustand des zumindest einen zu dem autonomen System vergleichbaren Objekts verändernde Aktion des zumindest einen zu dem autonomen System vergleichbaren Objekts zu erfassen.
Die Aktion ist beispielsweise eine Änderung der Position, der Geschwindigkeit und/oder der Bewegungsrichtung des Objekts. Wenn es sich bei dem Objekt um ein Kraftfahrzeug handelt, so ist die Aktion beispielsweise auch ein Spurwechsel, ein Einfädeln oder ein Abbiegen des Objekts.
Außerdem ist die Vorrichtung eingerichtet, einen durch die Aktion des zumindest einen zu dem autonomen System vergleichbaren Objekts ausgelösten Folgezustand des zumindest einen zu dem autonomen System vergleichbaren Objekts zu erfassen, und den Reinforcement Learning Agenten in Abhängigkeit von dem Zustand des zumindest einen zu dem autonomen System vergleichbaren Objekts, der Aktion des zumindest einen zu dem autonomen System vergleichbaren Objekts, dem Folgezustand des zumindest einen zu dem autonomen System vergleichbaren Objekts und einer Zielfunktion für die Steuerung des autonomen Systems zu trainieren.
In einer weiteren vorteilhaften Ausführungsform der Erfindung ist die Vorrichtung eingerichtet, eine Repräsentation des zumindest einen zu dem autonomen System vergleichbaren Objekts im Umfeld des autonomen Systems derart zu transformieren, dass die transformierte Repräsentation des zumindest einen zu dem autonomen System vergleichbaren Objekts einer möglichen Repräsentation des autonomen Systems entspricht, und den Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System vergleichbaren Objekts zu trainieren.
Diese Transformation ist beispielsweise eine Koordinatentransformation, bei der die Repräsentation des zumindest einen zu dem autonomen System vergleichbare Objekt in einem Koordinatensystem an die Stelle des autonomen Systems gesetzt wird.
In einer weiteren vorteilhaften Ausführungsform der Erfindung ist die Vorrichtung eingerichtet, zumindest zwei zu dem autonomen System vergleichbare Objekte im Umfeld des autonomen Systems zu erkennen, jeweils ein Verhalten der zumindest zwei zu dem autonomen System vergleichbaren Objekte zu erfassen, und den Reinforcement Learning Agenten in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System vergleichbaren Objekte zu trainieren.
In einer weiteren vorteilhaften Ausführungsform der Erfindung ist die Vorrichtung eingerichtet, den Reinforcement Learning Agenten gleichzeitig in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System vergleichbaren Objekte zu trainieren.
Hierbei liegt der Erfindung die Erkenntnis zugrunde, dass bei einem gleichzeitigen Trainieren des Reinforcement Learning Agenten in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System vergleichbaren Objekte eine möglicherweise aufwändige Vorverarbeitung einer Repräsentation der zumindest zwei zu dem autonomen System vergleichbaren Objekte entfallen kann.
In einer weiteren vorteilhaften Ausführungsform der Erfindung ist die Vorrichtung eingerichtet, jeweils eine Repräsentation der zumindest zwei zu dem autonomen System vergleichbaren Objekte im Umfeld des autonomen Systems mittels einer Permutations-invarianten oder mittels einer Permutations-äquivarianten Abbildung zu einer gemeinsamen Repräsentation zu fusionieren, und den Reinforcement Learning Agenten in Abhängigkeit von der gemeinsamen Repräsentation zu trainieren.
Ein zweiter Aspekt der Erfindung ist ein Verfahren zum Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems.
Ein Schritt des Verfahrens ist das Erfassen des Umfelds des autonomen Systems.
Ein weiterer Schritt des Verfahrens ist das Erkennen von zumindest einem zu dem autonomen System vergleichbaren Objekt im Umfeld des autonomen Systems.
Ein weiterer Schritt des Verfahrens ist das Erfassen eines Verhaltens des zumindest einem zu dem autonomen System vergleichbaren Objekts.
Ein weiterer Schritt des Verfahrens ist das Trainieren des Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System vergleichbaren Objekts.
Die vorstehenden Ausführungen zur erfindungsgemäßen Vorrichtung nach dem ersten Aspekt der Erfindung gelten in entsprechender Weise auch für das erfindungsgemäße Verfahren nach dem zweiten Aspekt der Erfindung. An dieser Stelle und in den Patentansprüchen nicht explizit beschriebene vorteilhafte Ausführungsbeispiele des erfindungsgemäßen Verfahrens entsprechen den vorstehend beschriebenen oder in den Patentansprüchen beschriebenen vorteilhaften Ausführungsbeispielen der erfindungsgemäßen Vorrichtung. Die Erfindung wird nachfolgend anhand eines Ausführungsbeispiels unter Zuhilfenahme der beigefügten Zeichnungen beschrieben. In diesen zeigen:
Fig. 1 eine Fahrsituation zur Illustration der Erfindung,
Fig. 2 eine schematische Ausführungsform der Erfindung, und Fig. 3 eine weitere schematische Ausführungsform der Erfindung.
Fig. 1 zeigt ein mit einer Vorrichtung zum Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems EGO ausgestattetes autonomes System EGO in Form eines Kraftfahrzeugs.
Die Vorrichtung ist eingerichtet das Umfeld des autonomen Systems EGO zu erfassen und zumindest ein zu dem autonomen System EGO vergleichbares Objekt V1 , V2, V3 im Umfeld des autonomen Systems EGO zu erkennen.
Bei dem zumindest einem zu dem autonomen System EGO vergleichbaren Objekt V1 , V2, V3 handelt es sich insbesondere um weitere Verkehrsteilnehmer, beispielsweise um weitere Kraftfahrzeuge im Umfeld des autonomen Systems EGO.
Des Weiteren ist die Vorrichtung eingerichtet ein Verhalten des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 zu erfassen, und den Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 zu trainieren.
Im vorliegenden Beispiel kann das Kraftfahrzeug V1 das Kraftfahrzeug V2 nur unter Berücksichtigung des Kraftfahrzeugs V3 überholen. Diesen nicht trivialen Überholvorgang kann die Vorrichtung im Kraftfahrzeug EGO als Verhalten des Kraftfahrzeugs V1 erfassen und zum Trainieren des Reinforcement Learning Agenten verwenden. Die Vorrichtung ist dabei insbesondere eingerichtet, den Reinforcement Learning in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 und einer Zielfunktion für die Steuerung des autonomen Systems EGO zu trainieren.
Das Verhalten des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 ist beispielsweise durch einen Zustand des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3, eine den Zustand des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 verändernde Aktion des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 und/oder einen durch die Aktion des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 ausgelösten Folgezustand des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 definiert.
Fig. 2 zeigt eine schematische Ausführungsform der Erfindung.
Die darin gezeigte Vorrichtung ist eingerichtet, zumindest zwei zu dem autonomen System EGO vergleichbare Objekte V1 , V2, V3 im Umfeld des autonomen Systems EGO zu erkennen, jeweils ein Verhalten der zumindest zwei zu dem autonomen System EGO vergleichbaren Objekte V1 , V2, V3 zu erfassen, und den Reinforcement Learning Agenten in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System EGO vergleichbaren Objekte V1 , V2, V3 zu trainieren.
Dabei ist die Vorrichtung eingerichtet, den Reinforcement Learning Agenten gleichzeitig in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System EGO vergleichbaren Objekte V1 , V2, V3 zu trainieren. Hierzu ist die Vorrichtung beispielsweise eingerichtet, eine Repräsentation des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 im Umfeld des autonomen Systems EGO derart zu transformieren, dass die transformierte Repräsentation des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 einer möglichen Repräsentation des autonomen Systems EGO entspricht, und den Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System EGO vergleichbaren Objekts V1 , V2, V3 zu trainieren.
Fig. 3 zeigt eine weitere schematische Ausführungsform der Erfindung.
Die darin gezeigte Vorrichtung ist eingerichtet, zumindest zwei zu dem autonomen System EGO vergleichbare Objekte V1 , V2, V3 im Umfeld des autonomen Systems EGO zu erkennen, jeweils ein Verhalten der zumindest zwei zu dem autonomen System EGO vergleichbaren Objekte V1 , V2, V3 zu erfassen, und den Reinforcement Learning Agenten in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System EGO vergleichbaren Objekte V1 , V2, V3 zu trainieren.
Außerdem ist die Vorrichtung eingerichtet, jeweils eine Repräsentation der zumindest zwei zu dem autonomen System EGO vergleichbaren Objekte V1 , V2, V3 im Umfeld des autonomen Systems EGO mittels einer Permutationsinvarianten oder mittels einer Permutations-äquivarianten Abbildung MAP zu einer gemeinsamen Repräsentation REP zu fusionieren, und den Reinforcement Learning Agenten in Abhängigkeit von der gemeinsamen Repräsentation REP zu trainieren.

Claims

Patentansprüche
1 . Vorrichtung zum Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems (EGO), wobei die Vorrichtung eingerichtet ist,
• das Umfeld des autonomen Systems (EGO) zu erfassen,
• zumindest ein zu dem autonomen System (EGO) vergleichbares Objekt (V1 , V2, V3) im Umfeld des autonomen Systems (EGO) zu erkennen,
• ein Verhalten des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) zu erfassen, und
• den Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) zu trainieren.
2. Vorrichtung nach Anspruch 1 , wobei das autonome System (EGO) ein automatisiertes Kraftfahrzeug ist.
3. Vorrichtung nach einem der vorherigen Ansprüche, wobei die Vorrichtung eingerichtet ist, den Reinforcement Learning in Abhängigkeit von
• dem erfassten Verhalten des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3), und
• einer Zielfunktion für die Steuerung des autonomen Systems (EGO) zu trainieren. Vorrichtung nach einem der vorherigen Ansprüche, wobei die Vorrichtung eingerichtet ist,
• einen Zustand des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) zu erfassen,
• eine den Zustand des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) verändernde Aktion des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) zu erfassen,
• einen durch die Aktion des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) ausgelösten Folgezustand des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) zu erfassen, und
• den Reinforcement Learning Agenten in Abhängigkeit von
• dem Zustand des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3), der Aktion des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3), dem Folgezustand des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3), und
• einer Zielfunktion für die Steuerung des autonomen Systems (EGO) zu trainieren. Vorrichtung nach einem der vorherigen Ansprüche, wobei die Vorrichtung eingerichtet ist,
• eine Repräsentation des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) im Umfeld des autonomen Systems (EGO) derart zu transformieren, dass die transformierte Repräsentation des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) 15 einer möglichen Repräsentation des autonomen Systems (EGO) entspricht, und
• den Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3) zu trainieren. Vorrichtung nach einem der vorherigen Ansprüche, wobei die Vorrichtung eingerichtet ist,
• zumindest zwei zu dem autonomen System (EGO) vergleichbare Objekte (V1 , V2, V3) im Umfeld des autonomen Systems (EGO) zu erkennen,
• jeweils ein Verhalten der zumindest zwei zu dem autonomen System (EGO) vergleichbaren Objekte (V1 , V2, V3) zu erfassen, und
• den Reinforcement Learning Agenten in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System (EGO) vergleichbaren Objekte (V1 , V2, V3) zu trainieren. Vorrichtung nach Anspruch 5, wobei die Vorrichtung eingerichtet ist, den Reinforcement Learning Agenten gleichzeitig in Abhängigkeit von dem jeweiligen erfassten Verhalten der zumindest zwei zu dem autonomen System (EGO) vergleichbaren Objekte (V1 , V2, V3) zu trainieren. Vorrichtung nach Anspruch 5 oder 6, wobei die Vorrichtung eingerichtet ist,
• jeweils eine Repräsentation der zumindest zwei zu dem autonomen System (EGO) vergleichbaren Objekte (V1 , V2, V3) im Umfeld des autonomen Systems (EGO) mittels einer 16
Permutations-invarianten oder mittels einer Permutations- äquivarianten Abbildung (MAP) zu einer gemeinsamen Repräsentation (REP) zu fusionieren, und
• den Reinforcement Learning Agenten in Abhängigkeit von der gemeinsamen Repräsentation (REP) zu trainieren. Verfahren zum Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems (EGO), wobei das Verfahren die folgenden Schritte umfasst:
• Erfassen des Umfelds des autonomen Systems (EGO),
• Erkennen von zumindest einem zu dem autonomen System (EGO) vergleichbaren Objekt (V1 , V2, V3) im Umfeld des autonomen Systems (EGO),
• Erfassen eines Verhaltens des zumindest einem zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3), und
• Trainieren des Reinforcement Learning Agenten in Abhängigkeit von dem erfassten Verhalten des zumindest einen zu dem autonomen System (EGO) vergleichbaren Objekts (V1 , V2, V3).
PCT/EP2021/065919 2020-08-11 2021-06-14 Trainieren eines reinforcement learning agenten zur steuerung eines autonomen systems Ceased WO2022033746A1 (de)

Priority Applications (2)

Application Number Priority Date Filing Date Title
CN202180056057.1A CN116057540A (zh) 2020-08-11 2021-06-14 训练强化学习代理以控制自治系统
US18/020,688 US20240037447A1 (en) 2020-08-11 2021-06-14 Training a Reinforcement Learning Agent to Control an Autonomous System

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
DE102020121150.3 2020-08-11
DE102020121150.3A DE102020121150A1 (de) 2020-08-11 2020-08-11 Trainieren eines Reinforcement Learning Agenten zur Steuerung eines autonomen Systems

Publications (1)

Publication Number Publication Date
WO2022033746A1 true WO2022033746A1 (de) 2022-02-17

Family

ID=76584474

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/EP2021/065919 Ceased WO2022033746A1 (de) 2020-08-11 2021-06-14 Trainieren eines reinforcement learning agenten zur steuerung eines autonomen systems

Country Status (4)

Country Link
US (1) US20240037447A1 (de)
CN (1) CN116057540A (de)
DE (1) DE102020121150A1 (de)
WO (1) WO2022033746A1 (de)

Families Citing this family (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20230237805A1 (en) * 2022-01-24 2023-07-27 Nec Laboratories America, Inc. Video classifier

Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US10627823B1 (en) * 2019-01-30 2020-04-21 StradVision, Inc. Method and device for performing multiple agent sensor fusion in cooperative driving based on reinforcement learning
US20200189597A1 (en) * 2018-12-12 2020-06-18 Visteon Global Technologies, Inc. Reinforcement learning based approach for sae level-4 automated lane change

Family Cites Families (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
DE102017209347A1 (de) 2017-06-01 2018-12-06 Robert Bosch Gmbh Verfahren und Vorrichtung zum Steuern eines Fahrzeugs
DE102019202090A1 (de) 2018-03-14 2019-09-19 Robert Bosch Gmbh Verfahren zum Erzeugen eines Trainingsdatensatzes zum Trainieren eines Künstlichen-Intelligenz-Moduls für eine Steuervorrichtung eines Roboters
CN110322017A (zh) * 2019-08-13 2019-10-11 吉林大学 基于深度强化学习的自动驾驶智能车轨迹跟踪控制策略

Patent Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20200189597A1 (en) * 2018-12-12 2020-06-18 Visteon Global Technologies, Inc. Reinforcement learning based approach for sae level-4 automated lane change
US10627823B1 (en) * 2019-01-30 2020-04-21 StradVision, Inc. Method and device for performing multiple agent sensor fusion in cooperative driving based on reinforcement learning

Non-Patent Citations (2)

* Cited by examiner, † Cited by third party
Title
MICHEL DEUDON ET AL: "HighRes-net: Recursive Fusion for Multi-Frame Super-Resolution of Satellite Imagery", ARXIV.ORG, CORNELL UNIVERSITY LIBRARY, 201 OLIN LIBRARY CORNELL UNIVERSITY ITHACA, NY 14853, 15 February 2020 (2020-02-15), XP081600852 *
WANG PIN ET AL: "A Reinforcement Learning Based Approach for Automated Lane Change Maneuvers", 2018 IEEE INTELLIGENT VEHICLES SYMPOSIUM (IV), IEEE, 26 June 2018 (2018-06-26), pages 1379 - 1384, XP033423455, DOI: 10.1109/IVS.2018.8500556 *

Also Published As

Publication number Publication date
US20240037447A1 (en) 2024-02-01
CN116057540A (zh) 2023-05-02
DE102020121150A1 (de) 2022-02-17

Similar Documents

Publication Publication Date Title
DE102016220945A1 (de) Verfahren und Vorrichtung zum Unterstützen eines Manövriervorganges eines Kraftfahrzeuges
EP3356203B1 (de) Verfahren zum bestimmen einer parkfläche zum parken eines kraftfahrzeugs, fahrerassistenzsystem sowie kraftfahrzeug
DE102014216577A1 (de) Verfahren und Vorrichtung zur Unterstützung eines Fahrers eines Kraftfahrzeugs
DE102019219534A1 (de) Verfahren zum Bestimmen von Regelparametern für ein Regelsystem
DE102014220144A1 (de) Verfahren und Vorrichtung zur Unterstützung eines Fahrers eines Kraftfahrzeugs
DE102010028109A1 (de) Verfahren zur Verbesserung der Fahrstabilität eines Fahrzeugs
DE102017205508A1 (de) Verfahren zur automatischen Bewegungssteuerung eines Fahrzeugs
DE102019216147B3 (de) Verfahren zur Bestimmung einer Befahrbarkeit eines Bereichs eines Geländes für ein Fahrzeug
DE102020105434A1 (de) Verfahren zum betreiben eines fahrzeugs, parkassistenzsystem und fahrzeug
DE102017111054A1 (de) Verfahren zum Betreiben eines Federungssystems eines Kraftfahrzeugs, Steuergerät, Federungssystem sowie Kraftfahrzeug
DE102015112311A1 (de) Verfahren zum zumindest semi-autonomen Manövrieren eines Kraftfahrzeugs mit Erkennung eines Bordsteinkontakts, Fahrerassistenzsystem sowie Kraftfahrzeug
DE102015005364A1 (de) Vorrichtung und Verfahren zum Verzögern eines Fahrzeugs
DE102020202757A1 (de) Verfahren zur Steuerung eines Fahrzeuges
DE102015112313A1 (de) Verfahren zum zumindest semi-autonomen Manövrieren eines Kraftfahrzeugs mit Lagekorrektur, Fahrerassistenzsystem sowie Kraftfahrzeug
DE102016122759A1 (de) Verfahren zum Betreiben eines Fahrerassistenzsystems zum zumindest semi-autonomen Manövrieren eines Kraftfahrzeugs unter Berücksichtigung eines geographischen Bereichs, Fahrerassistenzsystem sowie Kraftfahrzeug
EP3599115B1 (de) Verfahren und system zum automatischen erkennen eines ankuppelmanövers eines kraftfahrzeugs an einen anhänger
DE102016003231A1 (de) Verfahren zum Steuern eines zumindest teilautonom betriebenen Kraftfahrzeugs und Kraftfahrzeug
DE102020107941A1 (de) Verfahren zum Bereitstellen von unterschiedlichen Fahrerassistenzfunktionen für ein Fahrzeug zum automatisierten Abfahren von zuvor aufgezeichneten Wegstrecken, Recheneinrichtung sowie Fahrerassistenzvorrichtung
WO2020193490A1 (de) Verfahren und fahrerassistenzsystem zur unterstützung eines fahrers eines fahrzeugs bei einem einparkmanöver in eine längsparklücke
DE102016122760A1 (de) Verfahren zum Betreiben eines Fahrerassistenzsystems eines Kraftfahrzeugs zum Manövrieren des Kraftfahrzeugs zu verschiedenen Zielpunkten, Fahrerassistenzsystem sowie Kraftfahrzeug
DE102016103899A1 (de) Verfahren zum autonomen Einparken eines Kraftfahrzeugs in eine Parklücke mit Vorgabe eines Geschwindigkeitsprofils, Fahrerassistenzsystems sowie Kraftfahrzeug
DE102018119834A1 (de) Verfahren zum Betrieb eines autonom fahrenden Fahrzeuges
WO2022033746A1 (de) Trainieren eines reinforcement learning agenten zur steuerung eines autonomen systems
WO2019196986A1 (de) Fusionssystem zur fusion von umfeldinformation für ein kraftfahrzeug
DE102016003116A1 (de) Verfahren zum Betreiben eines Fahrwerks eines Kraftfahrzeugs

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 21734063

Country of ref document: EP

Kind code of ref document: A1

WWE Wipo information: entry into national phase

Ref document number: 18020688

Country of ref document: US

NENP Non-entry into the national phase

Ref country code: DE

122 Ep: pct application non-entry in european phase

Ref document number: 21734063

Country of ref document: EP

Kind code of ref document: A1