WO2025190877A1 - Betrieb einer regelungseinrichtung für ein fortbewegungsmittel - Google Patents
Betrieb einer regelungseinrichtung für ein fortbewegungsmittelInfo
- Publication number
- WO2025190877A1 WO2025190877A1 PCT/EP2025/056488 EP2025056488W WO2025190877A1 WO 2025190877 A1 WO2025190877 A1 WO 2025190877A1 EP 2025056488 W EP2025056488 W EP 2025056488W WO 2025190877 A1 WO2025190877 A1 WO 2025190877A1
- Authority
- WO
- WIPO (PCT)
- Prior art keywords
- control device
- agent
- control
- inference
- data
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
- G06N3/092—Reinforcement learning
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W30/00—Purposes of road vehicle drive control systems not related to the control of a particular sub-unit, e.g. of systems using conjoint control of vehicle sub-units
- B60W30/10—Path keeping
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W30/00—Purposes of road vehicle drive control systems not related to the control of a particular sub-unit, e.g. of systems using conjoint control of vehicle sub-units
- B60W30/14—Adaptive cruise control
- B60W30/143—Speed control
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W30/00—Purposes of road vehicle drive control systems not related to the control of a particular sub-unit, e.g. of systems using conjoint control of vehicle sub-units
- B60W30/18—Propelling the vehicle
- B60W30/18009—Propelling the vehicle related to particular drive situations
- B60W30/18145—Cornering
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W50/00—Details of control systems for road vehicle drive control not related to the control of a particular sub-unit, e.g. process diagnostic or vehicle driver interfaces
- B60W50/06—Improving the dynamic response of the control system, e.g. improving the speed of regulation or avoiding hunting or overshoot
-
- G—PHYSICS
- G05—CONTROLLING; REGULATING
- G05B—CONTROL OR REGULATING SYSTEMS IN GENERAL; FUNCTIONAL ELEMENTS OF SUCH SYSTEMS; MONITORING OR TESTING ARRANGEMENTS FOR SUCH SYSTEMS OR ELEMENTS
- G05B13/00—Adaptive control systems, i.e. systems automatically adjusting themselves to have a performance which is optimum according to some preassigned criterion
- G05B13/02—Adaptive control systems, i.e. systems automatically adjusting themselves to have a performance which is optimum according to some preassigned criterion electric
- G05B13/0265—Adaptive control systems, i.e. systems automatically adjusting themselves to have a performance which is optimum according to some preassigned criterion electric the criterion being a learning criterion
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W50/00—Details of control systems for road vehicle drive control not related to the control of a particular sub-unit, e.g. process diagnostic or vehicle driver interfaces
- B60W2050/0001—Details of the control system
- B60W2050/0002—Automatic control, details of type of controller or control system architecture
- B60W2050/0008—Feedback, closed loop systems or details of feedback error signal
- B60W2050/0011—Proportional Integral Differential [PID] controller
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W50/00—Details of control systems for road vehicle drive control not related to the control of a particular sub-unit, e.g. process diagnostic or vehicle driver interfaces
- B60W2050/0001—Details of the control system
- B60W2050/0002—Automatic control, details of type of controller or control system architecture
- B60W2050/0014—Adaptive controllers
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W50/00—Details of control systems for road vehicle drive control not related to the control of a particular sub-unit, e.g. process diagnostic or vehicle driver interfaces
- B60W2050/0062—Adapting control system settings
- B60W2050/0075—Automatic parameter input, automatic initialising or calibrating means
- B60W2050/0083—Setting, resetting, calibration
- B60W2050/0088—Adaptive recalibration
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W2520/00—Input parameters relating to overall vehicle dynamics
- B60W2520/10—Longitudinal speed
- B60W2520/105—Longitudinal acceleration
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W2520/00—Input parameters relating to overall vehicle dynamics
- B60W2520/12—Lateral speed
- B60W2520/125—Lateral acceleration
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W2520/00—Input parameters relating to overall vehicle dynamics
- B60W2520/14—Yaw
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W2552/00—Input parameters relating to infrastructure
- B60W2552/15—Road slope, i.e. the inclination of a road segment in the longitudinal direction
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W2552/00—Input parameters relating to infrastructure
- B60W2552/30—Road curve radius
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W2554/00—Input parameters relating to objects
- B60W2554/40—Dynamic objects, e.g. animals, windblown objects
- B60W2554/404—Characteristics
- B60W2554/4042—Longitudinal speed
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W2556/00—Input parameters relating to data
- B60W2556/45—External transmission of data to or from the vehicle
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W2710/00—Output or target parameters relating to a particular sub-units
- B60W2710/06—Combustion engines, Gas turbines
- B60W2710/0666—Engine torque
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W2710/00—Output or target parameters relating to a particular sub-units
- B60W2710/08—Electric propulsion units
- B60W2710/083—Torque
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W2710/00—Output or target parameters relating to a particular sub-units
- B60W2710/18—Braking system
- B60W2710/182—Brake pressure, e.g. of fluid or between pad and disc
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W2710/00—Output or target parameters relating to a particular sub-units
- B60W2710/20—Steering systems
- B60W2710/207—Steering angle of wheels
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W2720/00—Output or target parameters relating to overall vehicle dynamics
- B60W2720/12—Lateral speed
- B60W2720/125—Lateral acceleration
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W2756/00—Output or target parameters relating to data
- B60W2756/10—Involving external transmission of data to or from the vehicle
Definitions
- the present invention relates to a control device for a means of transport, as well as to a method and a computer program with instructions for operating a control device for a means of transport.
- the invention also relates to a means of transport that uses a control device according to the invention.
- Automated driving also known as autonomous driving, automated driving, or guided driving, is the movement of vehicles, mobile robots, and driverless transport systems that are largely autonomous. There are different degrees of automated driving. In Europe, various transport ceremonies, such as the Federal Highway Research Institute in Germany, have defined the following levels of automation:
- Level 0 “Driver only”, the driver drives, steers, accelerates, brakes, etc.
- Level 1 Certain assistance systems help with vehicle operation, including a cruise control system such as ACC (Automatic Cruise Control).
- ACC Automatic Cruise Control
- Level 2 Partial automation. Automatic parking, lane guidance, general longitudinal guidance, acceleration, deceleration, etc., including collision avoidance, are handled by the assistance systems.
- Level 3 High automation. The driver does not need to constantly monitor the system. The vehicle performs functions such as activating the turn signal, changing lanes, and maintaining lane guidance independently. The driver can attend to other tasks but must assume control upon request within a certain warning period.
- Level 4 Full automation. The system permanently assumes control of the vehicle. If the system is no longer able to handle the tasks, the driver can be asked to take over.
- Level 5 No driver required. Aside from setting the destination and starting the system, no human intervention is required.
- SAE Society of Automotive Engineers
- trajectory following controllers are used to implement vehicle control for the specified target profile.
- Vehicle models are used to derive the necessary control signals based on the calculated vehicle responses.
- the system's parameters require adjustment for different environmental conditions, such as high or low friction coefficients.
- model predictive control An advantage of this approach is the consideration of future system states and constraints, such as the physical limits of the actuators, when determining the control strategy.
- model predictive control an optimal control problem is solved using the current state as the initial state. A control signal is then applied from the resulting optimal control sequence, and the optimization process begins again with the current state.
- a disadvantage is the dependence of the optimization on the accuracy of the model used.
- an initially parameterized model can lose accuracy, e.g., due to wear and tear on the vehicle.
- parameterizing the model can be very time-consuming.
- reinforcement learning methods can be used to integrate an automatically adapting agent into an already functioning control system to achieve improved vehicle response.
- DE 10 2019214 931 A1 describes a control system for a vehicle, comprising a device for determining a desired trajectory of the vehicle, a first controller for providing a first manipulated variable for controlling the vehicle on the basis of the desired trajectory, an unsupervised learning-capable second controller for providing a second manipulated variable for controlling the vehicle on the basis of the desired trajectory, a mixing element configured to determine a combined manipulated variable for controlling the vehicle on the basis of the first and second manipulated variables, and a monitoring device configured to determine a current immediate reward and an expected immediate reward for the second controller, and to reduce an influence of the second manipulated variable on the combined manipulated variable if the determined rewards deviate from one another by more than a predetermined amount.
- US 2023 / 0 281 277 A1 describes a reinforcement learning method.
- two or more training iterations are performed to update a strategy.
- experiences are obtained through a training process executed on a training computer device.
- the experiences represent reactions of an environment to actions performed by a plurality of remote agent processes according to the strategy.
- the remote agent processes execute the strategy on remote agent computer devices.
- the experiences are obtained from the remote Agent computing devices over a network.
- the strategy is updated through the training process to obtain an updated strategy.
- the updated strategy is then distributed to the multitude of remote agent processes over the network by the training process.
- a control device for a means of transport uses a reinforcement learning agent, which is divided into an inference process configured to determine actions using an inference strategy, and a training process executed parallel to the inference process, which is configured to adapt the parameters of a training strategy based on provided data.
- the reinforcement learning agent is also configured to update the inference strategy during ferry operation based on the adapted parameters.
- a method for operating a control device for a means of transport using a reinforcement learning agent comprises the steps:
- a computer program contains instructions which, when executed by a computer, cause the computer to perform the following steps for operating a control device for a means of transport which uses a reinforcement learning agent: - Receiving a state vector and a reward by the agent;
- the term "computer” should be understood broadly. In particular, it also includes control units, embedded systems, and other processor-based data processing devices. The execution of these steps can be performed directly by the computer or involve the computer controlling a component intended to execute a step.
- the computer program may, for example, be made available for electronic retrieval or stored on a computer-readable storage medium.
- a proven control architecture is supplemented with a machine learning component to achieve autonomous adaptability of the system.
- algorithms from the field of reinforcement learning are used to provide a self-learning system which, thanks to its integration into the existing control concept, can simultaneously access a priori knowledge and thus enable functional driving functions right from the start.
- the agent is divided into different processes. Using "multiprocessing," the agent's training process can be decoupled from the continuous inference process, the calculation of the action. Continuous training enables faster adaptation to accumulated experience and can thus also significantly accelerate the training process.
- the resulting inference strategy is independent of the route traveled when a suitable observation space is selected for the agent and can therefore be applied to similarly known situations. Furthermore, due to the choice of a model-free learning approach, Application to different vehicles can be easily implemented without having to explicitly map any system dynamics.
- the provided data includes state vectors, rewards, and actions.
- the training process is immediately able to continuously adapt the parameters of the training strategy.
- the state vectors and the rewards are determined by a real-time computing unit, and the agent is executed on an external computing unit.
- the framework of the reinforcement learning agent is partially outsourced to an external computing unit, which, for example, includes additional hardware for the required calculations.
- the agent's environment with the associated evaluation function is located on the real-time computing system, e.g., a robust system for rapid function prototyping for vehicle use. This has the advantage that the reward function can be continuously executed on the real-time computing unit, thus enabling further manipulation of the reward signal, which is not guaranteed due to potentially lossless communication between the real-time computing system and the additional computing unit.
- data is exchanged between the real-time capable computing unit and the external computing unit via a data distribution service (DDS).
- DDS data distribution service
- Communication between the individual components is preferably implemented by a data distribution service.
- This service enables data-centric communication in highly dynamic distributed systems via a data bus.
- it is a publisher-subscriber concept, in which the publisher is a participant that provides data that can be read by multiple recipients, the subscribers.
- This makes it a virtual data bus that is easily expandable. Since no explicit bilateral connections are established between system components or system parts, the system can be easily expanded with additional functions or applications. This allows different applications to access a publisher's data as subscribers, and new publishers can be integrated into the existing structure.
- the User Datagram Protocol is used for data exchange. Since the control architecture requires fast signal transmission in order to integrate them into the control system, the User Datagram Protocol is used. This is a minimal, connectionless network protocol that enables fast and simple communication. Although UDP is an unreliable, unsecured, and unprotected transmission protocol that does not guarantee data transmission, its speed makes it suitable for use in data exchange.
- the inference process is configured to output explorations and timestamps to an actuator in addition to actions. Furthermore, status information can be transmitted. For exploring the state space, exploration is an essential component of optimization in reinforcement learning. If the reward is calculated on the real-time computing system, the necessary data tuple consisting of the state at a given point in time, the associated action, the reward, and the subsequent state can be formed based on the transmitted timestamps. If data packets are lost, only these data packets become unusable, since, for example, the calculation of a discounted reward can be performed independently.
- the state vectors, rewards, and actions are provided for the agent's training process via a queue. Communication between the individual processes takes place using queues. Queues allow, for example, using the multiprocessing library in Python, to create a separate process that can perform optimization independently of the inference strategy.
- control device is configured to subject the state vectors to scaling before determining the action.
- Scaling of the state vectors is preferably performed as part of a preprocessing step. Normalizing the state vectors can accelerate the training of neural networks. Furthermore, scaling can contribute to reducing the prediction error. Normalizing the input variables prevents initial weighting due to different value ranges of the measured variables.
- the control device uses a basic controller in addition to the agent, and the actions determined by the agent are additive control signals.
- the basic controller is supplemented by a further
- the reinforcement learning agent's additive control signal is added. This control signal is calculated based on driving state data, existing control signals, and, if necessary, other information, and integrated into the control system. Smooth transmission allows the agent signal to be activated and deactivated while driving. Furthermore, the sum of all control signals is saturated to the actuator limits to prevent hardware damage caused by faulty requests.
- the control system is a lateral dynamics control system.
- the actions determined by the agent are steering angle signals.
- the described learning approach improves trajectory tracking by reducing the lateral deviation and reducing the control activity of the trajectory tracking controller for steering control.
- the control system is a longitudinal dynamics control system.
- the actions determined by the agent are brake pedal signals or accelerator pedal signals.
- the described learning approach improves trajectory tracking by reducing the error magnitudes of speed and acceleration. This results in a reduction in control activity for accelerator and brake control.
- a means of transport comprises a control device according to the invention.
- the means of transport can be, in particular, a passenger car, a bus, or a commercial vehicle, e.g., a truck, an agricultural machine, or a construction machine.
- the solution according to the invention is particularly advantageous for autonomous or semi-autonomous means of transport.
- the solution according to the invention can also be used for manually controlled means of transport, e.g., to provide data for an assistance system.
- the control device according to the invention can be a component of a trajectory tracking controller.
- Fig. 1 shows an exemplary system architecture of a control device 20 for a means of transportation.
- the system architecture is a distributed system in which the vehicle control is implemented on a real-time capable computing unit 1, but the machine learning method with agent A is executed on another computing unit 2. Both together form the control device 20.
- Agent A is divided into an inference process IP, which is configured to determine actions A t using an inference strategy, and a training process TP, which is executed parallel to the inference process IP and is continuously trained.
- Fig. 1 the motion planning, which provides a trajectory TR, is also executed on a separate processing unit 3.
- the various processing units 1, 2, 3 are connected to the measuring system 4. Networking of the individual modules via a data bus 5 is therefore of great importance.
- the communication between the individual components is preferably implemented by a data distribution service.
- This service enables data-centric communication in highly dynamic distributed Systems via a data bus.
- it's a publisher-subscriber model where the publisher is a participant that provides data that can be read by multiple receivers, the subscribers. This makes it a virtual data bus that's easily expandable.
- Fig. 4 illustrates a control concept for lateral guidance.
- the control concept for lateral guidance comprises a basic controller B supplemented by a reinforcement learning agent A.
- the basic controller B of the lateral guidance consists of a model-based feedforward control V and a trajectory following control T, in this case an angle and deviation control.
- the input variables for the lateral guidance include the reference variables of the trajectory, x ref , which, in addition to a target curve curvature, can also contain information on the route profile, for example the inclination and gradient of the road profile.
- measured state variables x ist for example the current longitudinal speed, the yaw rate and position information, are taken into account, as well as processed measured variables x beo of the acceleration in the lateral and longitudinal directions.
- model-based feedforward control V is used.
- the target curve curvature specified by the trajectory is converted into a desired lateral acceleration within the feedforward control V in combination with the current longitudinal speed.
- the slip angles and thus the pre-controlled wheel steering angle can be calculated using the derived lateral forces on the front and rear axles.
- the wheel steering angle is then converted into a steering wheel angle, which is transmitted to the interface of the electromechanical steering. Due to the use of the current longitudinal speed, a partial decoupling of the lateral and longitudinal guidance is possible. On the one hand, this has the advantage that driving scenarios with automatic lateral guidance but manual longitudinal guidance can be carried out.
- a PID controller proportional-integral-derivative controller
- V 8 V feedforward control
- T 8 T trajectory tracking control
- the basic controller B is now extended by another additive control signal from the reinforcement learning agent A 8 RL .
- This control signal is calculated based on driving state data as well as applied control signals ⁇ x ist , x beo ) and trajectory information x ref , and integrated into the control system. Thanks to smooth transmission, the agent signal can be activated and deactivated while driving. In addition, the sum of all control signals is saturated to the actuator limits to prevent damage to the hardware due to faulty requests.
- the implementation of the control signal 8 SOÜ for the lateral control then takes place in an actuator control system not shown in Fig. 4.
- Fig. 5 illustrates a control concept for longitudinal guidance.
- the input variables for longitudinal guidance are the reference variables of the trajectory, x ref , the measured state variables x ist , and the processed measured variables x beo of the acceleration.
- Both components generally use a model-based feedforward control V, preferably based on a traction force equation, but convert the required traction force into different control variables.
- both components use a trajectory following control T.
- a necessary longitudinal or braking force is calculated in the feedforward control V, which is converted into an acceleration BP V.
- the trajectory following control T provides an acceleration BP T .
- the driving force GP V is calculated for the pre-control V of the accelerator pedal control GR in the case of acceleration.
- the trajectory following control T provides an acceleration GP T .
- agent A For both brake and accelerator pedal control, agent A extends basic controller B by requesting an additional accelerator pedal position GP RL or braking acceleration BP RL . Similar to lateral control, the control signal from agent A is transmitted smoothly. In both cases, when agent A is active, the respective control signal results from the sum of all signals.
- the implementation of the summed control signal GP so u of the accelerator pedal control GR and the summed control signal BP so u of the brake pedal control BR then takes place in an actuator control (not shown in Fig. 5).
- Fig. 6 shows an example of the interaction of agent A with its environment U.
- environment U includes the controlled system, the real vehicle F or the simulation model of the vehicle, as well as the sensors FS and actuators FA and the control concept.
- the latter serves, as can be seen in Fig. 4 and Fig. 5, as the interface between agent A and its environment U.
- the control rules for feedforward control and follow-up control are outside the sphere of influence of agent A and are thus part of environment U.
- agent A transmits the corresponding exploration, status information, and a timestamp for the respective actor, in addition to the action A t .
- the inference process IP with the inference strategy PIP is integrated in the closed control loop.
- this calculates the corresponding action A t and transmits it back to the environment interface.
- the decoupling of the complex algorithm for training agent A from the inference strategy PIP executed in parallel, as shown in Fig. 6, enables agent A to be integrated into the real-time control system.
- the inference strategy PIP only the received information needs to be read out, shared with the training process TP via the queues, the action A t calculated, and then combined with the exploration signal.
- the signals shown in the following table are generated for transmission to the interface of the environment U.
- the interface between agent and environment U is preferably adaptable.
- the encoded status signals can be used to transmit adaptations to the environment U, for example, the selection by considering the discount factor or the functionality of agent A.
- This metadata can also be used to implement security functions on the real-time capable computing unit.
- the state space is represented by a signal vector, which provides agent A with information about the current driving state and the desired trajectory, thus representing the observable system state of agent A.
- the signal vector is compiled on the real-time computing unit based on measurement signals from the vehicle bus system and the central measurement system, as well as trajectory information from the path planning, and distributed via DDS.
- the data packet contains additional system information, such as the reward, as well as other metadata, such as a status for encoding commands between the frameworks or averaged error values for implementing convergence criteria.
- Fig. 7 illustrates an example signal curve within the agent's inference strategy.
- the UDP packets are received 30 and read out.
- the next step in preprocessing 31 is the extraction 310 of the state vector, the extraction 311 of the reward, and other metadata.
- the temporal change of the signals can also be transferred as a history.
- the course of a driving maneuver and thus indirectly sensed system states, such as the friction coefficient can be taken into account.
- Another advantage of transmitting the time series and using a multi-layer perceptron, in contrast to recurrent networks is the robustness against lost data packets when using the User Datagram Protocol.
- different subsets can be extracted, depending on the task of additive lateral and longitudinal control. For example, when considering lateral control exclusively, the extracted state vector can only use a subset of the possible information available in order to reduce the network configuration and thus the complexity.
- the final step of preprocessing 31 is scaling 312 of the state vector. Normalizing the state vector can accelerate the training of neural networks. Furthermore, this can contribute to reducing the prediction error. Normalizing the input variables prevents initial weighting due to different value ranges of the measured variables. This is also advantageous when considering driving state variables.
- the scaled state vector is now used in the inference process IP to calculate the agent's action 32.
- this can be a one-dimensional action space and thus a single signal, for example, the additive control signal of the steering angle controller from Fig. 4.
- the network output can also be multidimensional.
- an additional exploration signal is determined 330 during postprocessing 33 and combined with the network output.
- the action is scaling 331 to the respective system size of the actuator control.
- the scaling 331 depends on the selected activation function of the network output, since this represents a mathematical restriction of the action.
- the information is also passed to the training process 35.
- the reward is extracted from the received message packet and transmitted, together with the scaled state vector, the action, and the associated timestamps, to the parallel training process via queues Q.
- the so-called replay buffer which stores the collected data, is used to assign the collected data based on the timestamps into complete data tuples, which are then used for the training algorithms.
Landscapes
- Engineering & Computer Science (AREA)
- Automation & Control Theory (AREA)
- Transportation (AREA)
- Mechanical Engineering (AREA)
- Physics & Mathematics (AREA)
- Artificial Intelligence (AREA)
- General Physics & Mathematics (AREA)
- Health & Medical Sciences (AREA)
- Evolutionary Computation (AREA)
- Theoretical Computer Science (AREA)
- Software Systems (AREA)
- Biophysics (AREA)
- General Health & Medical Sciences (AREA)
- Life Sciences & Earth Sciences (AREA)
- Biomedical Technology (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Computational Linguistics (AREA)
- Data Mining & Analysis (AREA)
- Human Computer Interaction (AREA)
- Molecular Biology (AREA)
- Computing Systems (AREA)
- General Engineering & Computer Science (AREA)
- Mathematical Physics (AREA)
- Medical Informatics (AREA)
- Feedback Control In General (AREA)
Abstract
Die vorliegende Erfindung betrifft eine Regelungseinrichtung (20) für ein Fortbewegungsmittel sowie ein Verfahren und ein Computerprogramm mit Instruktionen zum Betreiben einer Regelungseinrichtung (20) für ein Fortbewegungsmittel. Die Regelungseinrichtung (20) verwendet einen Reinforcement Learning Agenten (A), der aufgeteilt ist in einen Inferenzprozess (IP), der eingerichtet ist, Aktionen mittels einer Inferenzstrategie zu bestimmen, und einen Trainingsprozess (TP), der eingerichtet ist, auf Basis von bereitgestellten Daten eine Parametrierung einer Trainingsstrategie anzupassen. Der Reinforcement Learning Agent (A) ist zudem eingerichtet, die Inferenzstrategie im Fahrbetrieb auf Basis der angepassten Parametrierung zu aktualisieren. Die Erfindung betrifft zudem ein Fortbewegungsmittel, das eine erfindungsgemäße Regelungseinrichtung verwendet.
Description
Beschreibung
Betrieb einer Regelungseinrichtung für ein Fortbewegungsmittel
Die vorliegende Erfindung betrifft eine Regelungseinrichtung für ein Fortbewegungsmittel sowie ein Verfahren und ein Computerprogramm mit Instruktionen zum Betreiben einer Regelungseinrichtung für ein Fortbewegungsmittel. Die Erfindung betrifft zudem ein Fortbewegungsmittel, das eine erfindungsgemäße Regelungseinrichtung verwendet.
In der nachfolgenden Beschreibung werden teils englischsprachige Begriffe verwendet, da sich im Bereich des maschinellen Lernens teilweise keine deutschsprachigen Fachbegriffe etabliert haben. Die verwendeten englischsprachigen Begriffe sind dem Fachmann geläufig.
Automatisiertes Fahren, auch als autonomes Fahren, automatisches Fahren oder gesteuertes Fahren bezeichnet, ist die Bewegung von Fahrzeugen, mobilen Robotern und fahrerlosen Transportsystemen, die weitgehend autonom sind. Es gibt verschiedene Grade des automatisierten Fahrens. In Europa haben verschiedene Verkehrsministerien, z.B. in Deutschland die Bundesanstalt für Straßenwesen, die folgenden Automatisierungsstufen definiert:
• Level 0: "Nur Fahrer", der Fahrer fährt selbst, lenkt, beschleunigt, bremst usw.
• Level 1 : Bestimmte Assistenzsysteme helfen bei der Fahrzeugbedienung, darunter ein Geschwindigkeitsregelungssystem wie ACC (engl. Automatic Cruise Control).
• Level 2: Teilweise Automatisierung. Dabei werden automatisches Einparken, Spurführung, allgemeine Längsführung, Beschleunigung, Verzögerung usw. von den Assistenzsystemen übernommen, einschließlich der Kollisionsvermeidung.
• Level 3: Hohe Automatisierung. Der Fahrer muss das System nicht ständig überwachen. Das Fahrzeug führt selbständig Funktionen wie das Auslösen des Blinkers, den Fahrstreifenwechsel und die Spurführung aus. Der Fahrer kann sich anderen Dingen zuwenden, muss aber auf Anforderung innerhalb einer Vorwarnzeit die Kontrolle übernehmen.
• Level 4: Vollständige Automatisierung. Die Führung des Fahrzeugs wird permanent vom System übernommen. Ist das System nicht mehr in der Lage, die Aufgaben zu bewältigen, kann der Fahrer aufgefordert werden, die Steuerung zu übernehmen.
• Level 5: Kein Fahrer erforderlich. Abgesehen vom Setzen des Ziels und Starten des Systems ist kein menschliches Eingreifen erforderlich.
Eine etwas andere Definition von Stufen ist von der Society of Automotive Engineers (SAE) bekannt. In diesem Zusammenhang wird auf die Norm SAE J3016 verwiesen. Solche Definitionen können alternativ anstelle der oben gegebenen Definitionen verwendet werden.
Beim Folgen einer vorgegebenen Trajektorie werden einerseits Trajektorienfolgeregler eingesetzt, um die Fahrzeugregelung für das vorgegebene Soll-Profil umzusetzen. Hierbei werden Fahrzeugmodelle genutzt, um anhand der berechneten Fahrzeugreaktionen die notwendigen Steuersignale abzuleiten. Trotz des bereits guten Folgeverhaltens der verwendeten Regelung bedarf es einer Anpassung der Parametrierung des Systems bei unterschiedlichen Umgebungsbedingung, wie beispielsweise Hoch- oder Niedrigreibwert.
Ein alternatives Konzept stellt die modellprädiktive Regelung dar. Ein Vorteil bei diesem Ansatz ist die Berücksichtigung zukünftiger Systemzustände sowie Nebenbedingungen, wie beispielsweise physikalische Grenzen der Aktorik während der Bestimmung der Regelstrategie. Dabei wird bei der modellprädiktiven Regelung mit dem aktuellen Zustand als Initialzustand ein Optimalsteuerungsproblem gelöst. Aus der sich ergebenden optimalen Steuersequenz wird anschließend ein Stellsignal angewendet und die Optimierung beginnt mit dem aktuellen Zustand erneut. Ein Nachteil dabei ist jedoch die Abhängigkeit der Optimierung von der Genauigkeit des genutzten Modells. Weiterhin kann ein initial parametriertes Modell an Genauigkeit verlieren, z.B. aufgrund von Abnutzungserscheinungen des Fahrzeugs. Zudem kann das Parametrieren des Modells sehr zeitaufwendig sein.
Diese Herausforderungen können durch adaptive Regelungsverfahren adressiert werden. Beispielsweise kann mithilfe der Methoden des Reinforcement Learning (deutsch: bestärkendes Lernen) ein sich automatisch adaptierender Agent in einem bereits funktionsfähigen Regelungssystem genutzt werden, um eine bessere Systemantwort des Fahrzeuges zu erreichen.
Beispielsweise beschreibt DE 10 2019214 931 A1 eine Steuerung für ein Fahrzeug, umfassend eine Einrichtung zur Bestimmung einer gewünschten Trajektorie des Fahrzeugs, einen ersten Regler zur Bereitstellung einer ersten Stellgröße zur Steuerung des Fahrzeugs auf der Basis der gewünschten Trajektorie, einen unbeaufsichtigt lernfähigen zweiten Regler zur Bereitstellung einer zweiten Stellgröße zur Steuerung des Fahrzeugs auf der Basis der
gewünschten Trajektorie, ein Mischglied, das dazu eingerichtet ist, eine kombinierte Stellgröße zur Steuerung des Fahrzeugs auf der Basis der ersten und zweiten Stellgröße zu bestimmen, und eine Überwachungseinrichtung, die dazu eingerichtet ist, eine aktuelle unmittelbare Belohnung und eine erwartete unmittelbare Belohnung für den zweiten Regler zu bestimmen, und einen Einfluss der zweiten Stellgröße auf die kombinierte Stellgröße zu verringern, falls die bestimmten Belohnungen um mehr als ein vorbestimmtes Maß voneinander abweichen.
Für die Umsetzung von Reinforcement Learning Algorithmen im Bereich der Fahrzeugregelung ist das Sammeln von Daten sowie das Nutzen dieser Daten zur Verbesserung des Agenten wichtig. Um eine Integration des Agenten in der Fahrzeugregelung zu ermöglichen, muss je nach Zeitkonstante in der jeweils gewählten Regelkaskade die Evaluation des Agenten sichergestellt werden. Eine Verzögerung der Evaluation kann sich dabei einerseits negativ auf den Lernprozess auswirken sowie andererseits auch als unerwünschte Störgröße in das Regelsystem wahrgenommen werden.
Bisherige Lösungen formulieren das Reinforcement Learning als ein episodisches Problem. Somit wird die Strategie (engl. Policy) eines Agenten innerhalb der Episode evaluiert und während dieser die Daten aufgezeichnet. Erst nach Abschluss der Episode wird der Agent anhand der gesammelten Daten trainiert bzw. optimiert. Die nachgelagerte Optimierung im Falle der episodischen Formulierung findet somit erst nach manueller Übernahme oder im Stillstand des Fahrzeuges statt.
Durch die Aufteilung des Problems in ein episodisches Lernproblem, welches einen separaten Trainingszeitraum benötigt, kann kein kontinuierlicher Lernprozess umgesetzt werden. Für eine potentielle Kundenfunktion wäre somit eine Anpassung der Systemausgabe durch den Reinforcement Learning Agenten während der Fahrt basierend auf soeben gesammelten Erkenntnissen nicht möglich.
In diesem Zusammenhang beschreibt US 2023 / 0 281 277 A1 ein Verfahren zum Reinforcement Learning. Bei dem Verfahren werden zwei oder mehr Trainingsiterationen durchgeführt, um eine Strategie zu aktualisieren. Bei den einzelnen Trainingsiterationen werden durch einen Trainingsprozess, der auf einem Trainingscomputergerät ausgeführt wird, Erfahrungen erhalten. Die Erfahrungen stellen Reaktionen einer Umgebung auf Aktionen dar, die von einer Vielzahl von entfernten Agentenprozessen gemäß der Strategie ausgeführt werden. Die entfernten Agentenprozesse führen dabei die Strategie auf entfernten Agentencomputergeräten aus. Die Erfahrungen werden von den entfernten
Agentencomputergeräten über ein Netzwerk erhalten. Basierend auf den Reaktionen der Umgebung wird die Strategie durch den Trainingsprozess aktualisiert, um eine aktualisierte Strategie zu erhalten. Die aktualisierte Strategie wird durch den Trainingsprozess über das Netzwerk an die Vielzahl der entfernten Agentenprozesse verteilt.
Es ist eine Aufgabe der Erfindung, verbesserte Lösungen für den Betrieb einer Regelungseinrichtung für ein Fortbewegungsmittel bereitzustellen.
Diese Aufgabe wird von den Merkmalen der unabhängigen Ansprüche gelöst. Bevorzugte Ausgestaltungen der Erfindung sind Gegenstand der abhängigen Ansprüche.
Gemäß einem ersten Aspekt der Erfindung verwendet eine Regelungseinrichtung für ein Fortbewegungsmittel einen Reinforcement Learning Agenten, der aufgeteilt ist in einen Inferenzprozess, der eingerichtet ist, Aktionen mittels einer Inferenzstrategie zu bestimmen, und einen parallel zum Inferenzprozess ausgeführten Trainingsprozess, der eingerichtet ist, auf Basis von bereitgestellten Daten eine Parametrierung einer Trainingsstrategie anzupassen. Der Reinforcement Learning Agent ist zudem eingerichtet, die Inferenzstrategie im Fährbetrieb auf Basis der angepassten Parametrierung zu aktualisieren.
Gemäß einem Aspekt der Erfindung umfasst ein Verfahren zum Betreiben einer Regelungseinrichtung für ein Fortbewegungsmittel, die einen Reinforcement Learning Agenten verwendet, die Schritte:
- Empfangen eines Zustandsvektors und einer Belohnung durch den Agenten;
- Bestimmen einer Aktion für den Zustandsvektor durch einen Inferenzprozess des Agenten mittels einer Inferenzstrategie;
- Ausgeben der Aktion an einen Aktor;
- Bereitstellen von Daten für einen parallel zum Inferenzprozess ausgeführten Trainingsprozess des Agenten;
- Anpassen einer Parametrierung einer Trainingsstrategie auf Basis der bereitgestellten Daten;
- Übermitteln der angepassten Parametrierung an den Inferenzprozess; und
- Aktualisieren der Inferenzstrategie im Fährbetrieb.
Gemäß einem weiteren Aspekt der Erfindung enthält ein Computerprogramm Instruktionen, die bei Ausführung durch einen Computer den Computer zur Ausführung der folgenden Schritte zum Betreiben einer Regelungseinrichtung für ein Fortbewegungsmittel, die einen Reinforcement Learning Agenten verwendet, veranlassen:
- Empfangen eines Zustandsvektors und einer Belohnung durch den Agenten;
- Bestimmen einer Aktion für den Zustandsvektor durch einen Inferenzprozess des Agenten mittels einer Inferenzstrategie;
- Ausgeben der Aktion an einen Aktor;
- Bereitstellen von Daten für einen parallel zum Inferenzprozess ausgeführten Trainingsprozess des Agenten;
- Anpassen einer Parametrierung einer Trainingsstrategie auf Basis der bereitgestellten Daten;
- Übermitteln der angepassten Parametrierung an den Inferenzprozess; und
- Aktualisieren der Inferenzstrategie im Fährbetrieb.
Der Begriff Computer ist dabei breit zu verstehen. Insbesondere umfasst er auch Steuergeräte, eingebettete Systeme und andere prozessorbasierte Datenverarbeitungsvorrichtungen. Die Ausführung der genannten Schritte kann direkt durch den Computer erfolgen oder darin bestehen, dass der Computer eine zur Ausführung eines Schrittes vorgesehene Komponente entsprechend ansteuert.
Das Computerprogramm kann beispielsweise für einen elektronischen Abruf bereitgestellt werden oder auf einem computerlesbaren Speichermedium gespeichert sein.
Bei der erfindungsgemäßen Lösung wird eine erprobte Regelarchitektur um eine maschinelle Lernkomponente ergänzt, um eine selbstständige Adaptionsfähigkeit des Systems zu erreichen. Dazu werden Algorithmen aus dem Bereich des Reinforcement Learnings genutzt, um ein selbstlernendes System bereitzustellen, welches aufgrund der Integration in das bestehende Regelungskonzept gleichzeitig zugleich auf a priori Wissen zugreifen kann und somit von Beginn eine funktionsfähige Fahrfunktion ermöglicht. Um ein kontinuierliches Training ohne Unterbrechung der Fahrt zu ermöglichen und dennoch den Agenten in das Echtzeitregelsystem einzubinden, wird der Agent in verschiedene Prozesse aufgeteilt. Über „Multiprocessing“ kann dabei der Trainingsprozess des Agenten von dem kontinuierlichen Inferenzprozess, der Berechnung der Aktion, abgekoppelt werden. Ein kontinuierliches Training ermöglicht eine schnellere Adaption auf gesammelte Erfahrungen und kann somit auch den Trainingsprozess wesentlich beschleunigen.
Im Anwendungsfall einer Trajektorienfolgeregelung ist die resultierende Inferenzstrategie bei Auswahl eines geeigneten Beobachtungsraumes für den Agenten unabhängig von der jeweils gefahrenen Strecke und kann somit auf ähnlich bekannte Situationen angewendet werden. Darüber hinaus ist aufgrund der Wahl eines modellfreien Lernansatzes eine
Anwendung auf unterschiedliche Fahrzeuge problemlos umsetzbar, ohne jedwede Systemdynamiken zusätzlich explizit abbilden zu müssen.
Gemäß einem Aspekt der Erfindung umfassen die bereitgestellten Daten Zustandsvektoren, Belohnungen und Aktionen. Mit diesen Daten ist der Trainingsprozess unmittelbar in der Lage, die Parametrierung der Trainingsstrategie kontinuierlich anzupassen.
Gemäß einem Aspekt der Erfindung werden die Zustandsvektoren und die Belohnungen durch eine echtzeitfähige Recheneinheit bestimmt und der Agent wird auf einer externen Recheneinheit ausgeführt. Vorteilhafterweise wird das Framework des Reinforcement Learning Agenten zum Teil auf eine externe Recheneinheit ausgelagert, die z.B. zusätzliche Hardware für die erforderlichen Berechnungen beinhaltet. Die Umwelt des Agenten mit der verknüpften Bewertungsfunktion befindet sich jedoch auf dem echtzeitfähigen Rechensystem, z.B. einem robusten System für schnelles Funktionsprototyping für den Fahrzeugeinsatz. Dies hat den Vorteil, dass die Belohnungsfunktion kontinuierlich auf der echtzeitfähigen Recheneinheit ausgeführt werden kann und somit weitere Manipulationen des Belohnungssignals möglich sind, welches aufgrund einer gegebenenfalls nicht verlustfreien Kommunikation zwischen dem echtzeitfähigen Rechensystem sowie der zusätzlichen Recheneinheit nicht gewährleistet ist.
Gemäß einem Aspekt der Erfindung erfolgt ein Datenaustausch zwischen der echtzeitfähigen Recheneinheit und der externen Recheneinheit über einen Data Distribution Service (DDS). Die Kommunikation der einzelnen Komponenten wird vorzugsweise durch einen Data Distribution Service umgesetzt. Dieser Service ermöglicht eine datenzentrierte Kommunikation in hochdynamischen verteilten Systemen über einen Datenbus. Konzeptionell handelt es sich um ein Publisher-Subscriber-Konzept, bei welchem der Publisher ein Teilnehmer ist, der Daten zur Verfügung stellt, welche von mehreren Empfängern, den Subscribern, gelesen werden können. Somit handelt es sich um einen virtuellen Datenbus, welcher einfach erweiterbar ist. Da keine expliziten bilateralen Verbindungen zwischen Systemkomponenten bzw. Systembestandteilen aufgebaut werden, ist eine einfache Erweiterung des Systems mit zusätzlichen Funktionen bzw. Applikationen möglich. So können unterschiedliche Applikationen als Subscriber auf die Daten eines Publishers zugreifen sowie neue Publisher in die bestehende Struktur integriert werden.
Gemäß einem Aspekt der Erfindung wird für den Datenaustausch das User Datagram Protocol (UDP) verwendet. Da die Regelungsarchitektur eine schnelle Übertragung von Signalen erfordert, um diese in die Regelung mit zu integrieren, wird bevorzugt das User
Datagramm Protocol genutzt. Hierbei handelt es sich um ein minimales und verbindungsloses Netzwerkprotokoll, welches eine schnelle und einfache Kommunikation ermöglicht. Obwohl UDP ein nicht-zuverlässiges, ungesichertes sowie ungeschütztes Übertragungsprotokoll ist, welches keine Garantie der Datenübertragung gewährleistet, eignet es sich dennoch aufgrund der Schnelligkeit zur Anwendung im Bereich des Datenaustausches.
Gemäß einem Aspekt der Erfindung ist der Inferenzprozess eingerichtet, zusätzlich zu Aktionen auch Explorationen und Zeitstempel an einen Aktor ausgegeben. Darüber hinaus können Statusinformationen übermittelt werden. Zur Erkundung des Zustandsraumes ist beim Reinforcement Learning die Exploration ein wesentlicher Bestandteil der Optimierung. Wird die Belohnung auf dem echtzeitfähigen Rechensystem berechnet, so kann anhand der Übermittlung von Zeitstempeln das notwendige Datentupel aus Zustand zu einem Zeitpunkt, der dazugehörigen Aktion, der Belohnung sowie dem darauffolgenden Zustand gebildet werden. Gehen Datenpakete verloren, so werden lediglich diese Datenpakete unbrauchbar, da beispielsweise die Berechnung einer diskontierten Belohnung hiervon unabhängig durchgeführt werden kann.
Gemäß einem Aspekt der Erfindung werden die Zustandsvektoren, die Belohnungen und die Aktionen mittels einer Warteschlange für den Trainingsprozess des Agenten bereitgestellt. Die Kommunikation zwischen den einzelnen Prozessen erfolgt mit Hilfe von Warteschlangen, sogenannten „Queues“. Queues erlauben es, z.B. mit Hilfe der Multiprocessing-Bibliothek in Python, einen separaten Prozess aufzubauen, der unabhängig von der Inferenzstrategie eine Optimierung durchführen kann.
Gemäß einem Aspekt der Erfindung ist die Regelungseinrichtung eingerichtet, die Zustandsvektoren vor dem Bestimmen der Aktion einer Skalierung zu unterziehen. Vorzugsweise erfolgt im Rahmen einer Vorverarbeitung eine Skalierung der Zustandsvektoren. Durch die Normalisierung der Zustandsvektoren kann das Training von neuronalen Netzwerken beschleunigt werden. Zudem kann die Skalierung zu einer Reduzierung des Prädiktionsfehlers beitragen. Dabei wird mit Hilfe der Normalisierung der Eingangsgrößen eine initiale Gewichtung aufgrund unterschiedlicher Wertebereiche der Messgrößen verhindert.
Gemäß einem Aspekt der Erfindung verwendet die Regelungseinrichtung zusätzlich zum Agenten einen Basisregler und die vom Agenten bestimmten Aktionen sind additive Stellsignale. In einer solchen hybriden Architektur wird der Basisregler um ein weiteres
additives Stellsignal des Reinforcement Learning Agenten erweitert. Dieses Stellsignal wird, basierend auf Fahrzustandsdaten sowie anliegender Stellsignale und gegebenenfalls weiterer Informationen berechnet und in die Regelung integriert. Durch eine ruckfreie Übertragung kann das Agentensignal während der Fahrt aktiviert und deaktiviert werden. Außerdem findet eine Saturierung der Summe aller Stellsignale auf die Grenzen der Aktuatoren statt, um Beschädigungen der Hardware durch fehlerhafte Anforderungen zu vermeiden.
Gemäß einem Aspekt der Erfindung ist die Regelungseinrichtung eine Querdynamikregelung. Die vom Agenten bestimmten Aktionen sind in diesem Fall Lenkwinkelsignale. Im Bereich der Querführung wird durch den beschriebenen Lernansatz die Trajektorienfolge verbessert, indem die Querablage reduziert wird und die Regelaktivität des Trajektorienfolgereglers für die Lenkungsansteuerung reduziert wird.
Gemäß einem Aspekt der Erfindung ist die Regelungseinrichtung eine Längsdynamikregelung. Die vom Agenten bestimmten Aktionen sind in diesem Fall Bremspedalsignale oder Gaspedalsignale. Im Bereich der Längsregelung wird durch den beschriebenen Lernansatz die Trajektorienfolge verbessert, indem die Fehlergrößen der Geschwindigkeit und der Beschleunigung reduziert werden. Daraus ergibt sich eine Reduzierung der Regelaktivität für die Gas- und Bremsregelung.
Vorteilhafterweise weist ein Fortbewegungsmittel eine erfindungsgemäße Regelungseinrichtung auf. Bei dem Fortbewegungsmittel kann es sich insbesondere um einen Pkw, einen Bus oder ein Nutzfahrzeug handeln, z.B. einen Lkw, eine Landmaschine oder eine Baumaschine. Besonders vorteilhaft ist die erfindungsgemäße Lösung bei autonomen oder teilautonomen Fortbewegungsmitteln einsetzbar. Aber auch bei manuell gesteuerten Fortbewegungsmitteln kann die erfindungsgemäße Lösung genutzt werden, z.B. um Daten für ein Assistenzsystem zur Verfügung zu stellen. Beispielsweise kann die erfindungsgemäße Regelungseinrichtung Bestandteil eines Trajektorienfolgereglers sein.
Weitere Merkmale der vorliegenden Erfindung werden aus der nachfolgenden Beschreibung und den angehängten Ansprüchen in Verbindung mit den Figuren ersichtlich.
Fig. 1 zeigt eine beispielhafte Systemarchitektur einer Regelungseinrichtung für ein Fortbewegungsmittel;
Fig. 2 zeigt schematisch ein Verfahren zum Betreiben einer Regelungseinrichtung für ein Fortbewegungsmittel;
Fig. 3 stellt schematisch ein Fortbewegungsmittel dar, in dem eine erfindungsgemäße Lösung realisiert ist;
Fig. 4 veranschaulicht ein Regelungskonzept für die Querführung;
Fig. 5 veranschaulicht ein Regelungskonzept für die Längsführung;
Fig. 6 stellt exemplarisch die Interaktion eines Agenten mit seiner Umwelt dar; und
Fig. 7 veranschaulicht einen beispielhaften Signalverlauf innerhalb der Inferenzstrategie des Agenten.
Zum besseren Verständnis der Prinzipien der vorliegenden Erfindung werden nachfolgend Ausführungsformen der Erfindung anhand der Figuren detaillierter erläutert. Es versteht sich, dass sich die Erfindung nicht auf diese Ausführungsformen beschränkt und dass die beschriebenen Merkmale auch kombiniert oder modifiziert werden können, ohne den Schutzbereich der Erfindung zu verlassen, wie er in den angehängten Ansprüchen definiert ist.
Fig. 1 zeigt eine beispielhafte Systemarchitektur einer Regelungseinrichtung 20 für ein Fortbewegungsmittel. Bei der Systemarchitektur handelt es sich um ein verteiltes System, bei dem die Fahrzeugregelung auf einer echtzeitfähige Recheneinheit 1 umgesetzt ist, die maschinelle Lernmethode mit dem Agenten A jedoch auf einer weiteren Recheneinheit 2 ausgeführt wird. Beide zusammen bilden die Regelungseinrichtung 20. Der Agent A ist aufgeteilt in einen Inferenzprozess IP, der eingerichtet ist, Aktionen At mittels einer Inferenzstrategie zu bestimmen, und einen parallel zum Inferenzprozess IP ausgeführten Trainingsprozess TP, der kontinuierlich trainiert wird.
In Fig. 1 wird auch die Bewegungsplanung, die eine Trajektorie TR bereitstellt, auf einer separaten Recheneinheit 3 ausgeführt. Die verschiedenen Recheneinheiten 1 , 2, 3 sind an das Messsystem 4 angeschlossen. Eine Vernetzung der einzelnen Module über einen Datenbus 5 ist daher von großer Bedeutung. Die Kommunikation der einzelnen Komponenten wird vorzugsweise durch einen Data Distribution Service umgesetzt. Dieser Service ermöglicht eine datenzentrierte Kommunikation in hochdynamischen verteilten
Systemen über einen Datenbus. Konzeptionell handelt es sich um ein Publisher-Subscriber- Konzept, bei welchem der Publisher ein Teilnehmer ist, der Daten zur Verfügung stellt, welche von mehreren Empfängern, den Subscribern, gelesen werden können. Somit handelt es sich um einen virtuellen Datenbus, welcher einfach erweiterbar ist.
Das zentrale Messsystem 4, welches neben der Nutzung von GPS-Empfängern (GPS: Globales Positionierungssystem) durch zahlreiche Sensoren eine hochgenaue Positionsund Richtungsmessung durchführt, stellt Messdaten M bereit, welche von den Funktionen der Bahnplanung sowie der Fahrzeugregelung auf unterschiedlichen Hardwarekomponenten genutzt werden können. Über den virtuellen Bus teilt ebenfalls das System der Fahrzeugregelung auf der echtzeitfähigen Recheneinheit 1 Informationen zur Umwelt sowie der Bewertung der Umwelt mit dem Agenten A, d.h. Zustandsvektoren St, und Belohnungen Rt.
Da die Regelungsarchitektur eine schnelle Übertragung von Signalen erfordert, um diese in die Regelung mit zu integrieren, wird das User Datagramm Protocol genutzt. Hierbei handelt es sich um ein minimales und verbindungsloses Netzwerkprotokoll, welches eine schnelle und einfache Kommunikation ermöglicht. Obwohl das User Datagramm Protocol ein nichtzuverlässiges, ungesichertes sowie ungeschütztes Übertragungsprotokoll ist, welches keine Garantie der Datenübertragung gewährleistet, eignet es sich dennoch aufgrund der Schnelligkeit zur Anwendung im Bereich des Datenaustausches.
Fig. 2 schematisch ein Verfahren zum Betreiben einer Regelungseinrichtung für ein Fortbewegungsmittel. Bei dem Verfahren werden ein Zustandsvektor und eine Belohnung durch den Agenten empfangen 10. Durch einen Inferenzprozess des Agenten wird mittels einer Inferenzstrategie für den Zustandsvektor eine Aktion bestimmt 11. Die Aktion wird an einen Aktor ausgegeben 12. Zudem werden Daten für einen parallel zum Inferenzprozess ausgeführten Trainingsprozess des Agenten bereitgestellt 13. Dabei kann es sich insbesondere um Zustandsvektoren, Belohnungen und Aktionen handeln. Auf Basis der bereitgestellten Daten wird eine Parametrierung einer Trainingsstrategie angepasst 14. Die angepasste Parametrierung wird an die Inferenzstrategie übermittelt 15, die daraufhin im Fährbetrieb aktualisiert wird 16.
Fig. 3 stellt schematisch ein Fortbewegungsmittel 40 dar, in dem eine erfindungsgemäße Lösung realisiert ist. Bei dem Fortbewegungsmittel 40 handelt es sich im dargestellten Beispiel um ein Kraftfahrzeug. Das Kraftfahrzeug weist eine Sensorik 41 zum Erfassen von Umgebungsinformationen und Fahrzeugzuständen auf. Eine erfindungsgemäße
Regelungseinrichtung 20, die beispielsweise teilweise auf einem Rechner 42 des Kraftfahrzeugs implementiert sein kann, ist eingerichtet, aus den von der Sensorik 41 erfassten Informationen Regelungsgrößen abzuleiten. Eine Ausgabe der Regelungseinrichtung 20 kann als Eingangsgröße einem Assistenzsystem 43 zur Verfügung gestellt werden, z.B. als Grundlage für eine Fahrfunktion. Mittels einer Datenübertragungseinheit 44 kann eine Verbindung zu einem Backend aufgebaut werden, z.B. zum Abrufen aktualisierter Software für Komponenten des Kraftfahrzeugs. Zur Speicherung von Daten ist ein Speicher 45 vorhanden. Der Datenaustausch zwischen den verschiedenen Komponenten des Kraftfahrzeugs erfolgt über ein Netzwerk 46.
Nachfolgend soll eine bevorzugte Ausführungsform der Erfindung anhand von Fig. 4 bis Fig. 7 beschrieben werden.
Fig. 4 veranschaulicht ein Regelungskonzept für die Querführung. Das Regelungskonzept für die Querführung umfasst einen Basisregler B, der um einen Reinforcement Learning Agenten A ergänzt ist. Der Basisregler B der Querführung besteht aus einer modellbasierten Vorsteuerung V sowie einer Trajektorienfolgeregelung T, hier einer Winkel- und Ablageregelung. Die Eingangsgrößen der Querführung sind unter anderem die Referenzgrößen der Trajektorie, xref, welche neben einer Sollkurvenkrümmung ebenfalls Informationen zum Streckenprofil, beispielsweise die Neigung und Steigung des Fahrbahnprofils, beinhalten können. Hinzukommend werden gemessene Zustandsgrößen xist, beispielsweise die aktuelle Längsgeschwindigkeit, die Gierrate sowie Positionsinformationen berücksichtigt, sowie aufbereitete Messgrößen xbeo der Beschleunigung in Quer- und Längsrichtung.
Zur Verbesserung des Führungsverhaltens wird die modellbasierte Vorsteuerung V verwendet. Die von der Trajektorie vorgegebene Sollkurvenkrümmung wird innerhalb der Vorsteuerung V in Kombination mit der aktuellen Längsgeschwindigkeit zu einer gewünschten Querbeschleunigung umgerechnet. Anhand der Querbeschleunigung können über die abgeleiteten Seitenkräfte an Vorder- sowie Hinterachse die Schräglaufwinkel und somit anschließend der vorgesteuerte Radlenkwinkel berechnet werden. Mit Hilfe der Lenkungsübersetzung wird anschließend der Radlenkwinkel in einen Lenkradwinkel überführt, welcher an die Schnittstelle der elektromechanischen Lenkung übermittelt wird. Aufgrund der Nutzung der aktuellen Längsgeschwindigkeit wird eine teilweise Entkopplung der Quer- von der Längsführung ermöglicht. Dies hat einerseits den Vorteil, dass Fahrszenarien mit automatischer Querführung aber manueller Längsführung durchgeführt werden können. Andererseits ist die Entkopplung aufgrund des geschwindigkeitsabhängigen
Einflusses des Lenkwinkels auf die Querführung von Vorteil, so dass zur Lenkwinkelberechnung die aktuelle Ist-Geschwindigkeit herangezogen wird. Im Falle der vollautomatischen Trajektorienfolge handelt es sich jedoch nicht um eine vollständige Entkopplung, da die von der Bewegungsplanung bereitgestellte zeitoptimale Trajektorie Längs- und Querführung vereint und somit das genutzte Kurvenkrümmungsprofil auf das vorgegebene Beschleunigungs- sowie Geschwindigkeitsprofil abgestimmt ist. Dies hat im Umkehrschluss zur Folge, dass eine verbesserte Längsregelung ebenfalls zu einer Verbesserung der Querführung beitragen kann.
Bei Betrachtung der Querregelung kann ein PID-Regler (Proportional-Integral-Differential- Regler) zur Reduzierung auftretender Störgrößen eingesetzt werden, indem ein Ablagefehler sowie ein Gierwinkelfehler berechnet und ausgeregelt werden. Das Stellsignal des PID- Reglers kann anschließend über eine aufbereitete Querbeschleunigung skaliert werden, welche zu einer Verstärkung des Stellsignals bei höheren Querbeschleunigungen führt. Die Stellsignale der Vorsteuerung V 8V sowie der Trajektorienfolgeregelung T 8T werden addiert.
In der hybriden Architektur wird nun der Basisregler B um ein weiteres additives Stellsignal des Reinforcement Learning Agenten A 8RL erweitert. Dieses Stellsignal wird, basierend auf Fahrzustandsdaten sowie anliegender Stellsignale {xist, xbeo) sowie Trajektorieninformationen xref, berechnet und in die Regelung integriert. Durch eine ruckfreie Übertragung kann das Agentensignal während der Fahrt aktiviert und deaktiviert werden. Außerdem findet eine Saturierung der Summe aller Stellsignale auf die Aktuatorgrenzen statt, um Beschädigungen der Hardware durch fehlerhafte Anforderungen zu vermeiden. Die Umsetzung des Stellsignals 8SOÜ für die Querregelung erfolgt anschließend in einer in Fig. 4 nicht dargestellten Aktorregelung.
Fig. 5 veranschaulicht ein Regelungskonzept für die Längsführung. Die Eingangsgrößen der Längsführung sind wiederum die Referenzgrößen der Trajektorie, xref, die gemessenen Zustandsgrößen xist sowie aufbereitete Messgrößen xbeo der Beschleunigung. Im Falle der Längsführungsregelung wird unterschiedlicher Schnittstellen zwischen Gaspedalregelung GR sowie Bremspedalregelung BR unterschieden. Grundsätzlich nutzen beide Komponenten eine modellbasierte Vorsteuerung V, vorzugsweise basierend auf einer Zugkraftgleichung, rechnen jedoch die notwendige Zugkraft in unterschiedliche Stellgrößen um. Zudem nutzen beide Komponenten eine Trajektorienfolgeregelung T.
Im Falle des Basisreglers B der Bremspedalregelung BR wird in der Vorsteuerung V eine notwendige Längs- bzw. Bremskraft berechnet, die in eine Beschleunigung BPV umgerechnet wird. Zudem liefert die Trajektorienfolgeregelung T eine Beschleunigung BPT.
Äquivalent zur Berechnung der Bremskraft wird im Beschleunigungsfalle für die Vorsteuerung V der Gaspedalregelung GR die Antriebskraft GPV berechnet. Zudem liefert die Trajektorienfolgeregelung T eine Beschleunigung GPT.
Sowohl bei der Brems- sowie Gaspedal Regelung erweitert der Agent A den Basisregler B, indem eine zusätzliche Gaspedalstellung GPRL oder Bremsbeschleunigung BPRL angefordert wird. Dabei findet ähnlich zur Querführung eine ruckfreie Übertragung des Stellsignals des Agenten A statt. In beiden Fällen ergibt sich bei aktivem Agenten A das jeweilige Stellsignal aus der Summe aller Signale. Die Umsetzung des aufsummierten Stellsignals GPsou der Gaspedalregelung GR sowie des aufsummierten Stellsignals BPsou der Bremspedalregelung BR erfolgt anschließend in einer in Fig. 5 nicht dargestellten Aktorregelung.
Grundsätzlich bestimmt die Interaktion zwischen Agent und seiner Umwelt den Optimierungsprozess des Reinforcement Learnings. Deshalb ist es wichtig, sich vorab die Grenzen der Umwelt sowie des Einflussbereiches des Agenten vor Augen zu führen. Fig. 6 stellt exemplarisch die Interaktion des Agenten A mit seiner Umwelt U dar. Hierbei umfasst die Umwelt U neben der Regelstrecke, dem Realfahrzeug F bzw. dem Simulationsmodell des Fahrzeugs, ebenfalls die Sensorik FS sowie Aktorik FA und das Regelungskonzept. Letzteres dient, wie in Fig. 4 und Fig. 5 ersichtlich, als Schnittstelle des Agenten A mit seiner Umwelt U. Somit befinden sich die Regelvorschriften zur Vorsteuerung sowie Folgeregelung außerhalb des Einflussbereiches des Agenten A und sind somit Teil der Umwelt U.
Aufgrund der eventuell eingeschränkten Rechen- sowie Speicherkapazität der echtzeitfähigen Recheneinheit als Plattform zur Umsetzung der Trajektorienfolgeregelung ist das Reinforcement Learning Framework zu einem Großteil auf einer externen Recheneinheit mit zusätzlicher Grafikkarte ausgelagert. Somit kann auch hierbei analog zu Fig. 6 eine getrennte Betrachtung von Agent A (externe Recheneinheit) sowie seiner Umwelt U (restliche Hardwarekomponenten) stattfinden. Die Berechnung der Belohnung Rt des aktuellen Zustands St, eine Information bereitgestellt durch die Umwelt U des Agenten A, wird somit auf der echtzeitfähigen Recheneinheit umgesetzt. Dies hat ebenfalls Vorteile bei der Verwendung des nichtzuverlässigen Netzwerkprotokolls UDP. Mit der Ausführung der Berechnung auf der echtzeitfähigen Recheneinheit kann garantiert werden, dass zu den
jeweiligen Aktionen At des Agenten A, welche mit Zeitstempel versehen sind, die zugehörige Belohnung Rt berechnet wird. Aufgrund der Kontinuität der Fahraufgabe sowie der Bewertung der Trajektorienfolgeregelung, die einen fortlaufenden Prozess darstellen, kann eine Betrachtung von diskontierten Belohnungen sinnvoll sein. Eine fehlerhafte Berechnung der Belohnung Rt innerhalb des Reinforcement Learning Frameworks aufgrund des Verlusts von Datenpaketen kann einen direkten Einfluss auf das Training des Agenten A haben. Wird die Belohnung Rt auf der echtzeitfähigen Recheneinheit berechnet, so kann anhand der Übermittlung von Zeitstempeln das notwendige Datentupel «St, At, Rt, St+i» zwischen dem Zustand St zum Zeitpunkt t, der dazugehörigen Aktion At, der Belohnung Rt sowie dem darauffolgenden Zustand St+i gebildet werden. Gehen Datenpakete verloren, so werden lediglich diese Datenpakete unbrauchbar, da die Berechnung einer diskontierten Belohnung hiervon unabhängig durchgeführt werden kann.
Im Gegenzug werden von dem Agenten A neben der für den Aktor jeweiligen Aktion At die dazugehörige Exploration sowie Statusinformationen und ein Zeitstempel übermittelt. In dem geschlossenen Regelkreis ist somit lediglich der Inferenzprozess IP mit der Inferenzstrategie PIP eingebunden. Diese berechnet bei Erhalt des Zustandsvektors St die dazugehörige Aktion At und übermittelt diese zurück an die Umweltschnittstelle. Die in Fig. 6 dargestellte Entkopplung der komplexen Algorithmik zum Training des Agenten A von der parallel hierzu ausgeführten Inferenzstrategie PIP ermöglicht die Einbindung des Agenten A in die Echtzeitregelung. Somit muss in der Inferenzstrategie PIP lediglich die erhaltene Information ausgelesen, über die Warteschlangen mit dem Trainingsprozess TP geteilt sowie die Aktion At berechnet und anschließend mit dem Explorationssignal kombiniert werden. In Verbindungen mit dem zusätzlichen Explorationsprozess ergeben sich beispielsweise die in der folgenden Tabelle dargestellten Signale zur Übertragung an die Schnittstelle der Umwelt U. Die Schnittstelle zwischen Agent und Umwelt U ist vorzugsweise anpassbar.
Aufgrund der Aufteilung des Frameworks auf ein verteiltes Rechnersystem können mit Hilfe der enkodierten Statussignale Anpassungen an die Umwelt U, beispielsweise die Auswahl über Berücksichtigung des Diskontierungsfaktors oder die Funktionsfähigkeit des Agenten A, übertragen werden. Mit diesen Metadaten können ebenfalls Sicherheitsfunktionen auf der echtzeitfähigen Recheneinheit umgesetzt werden.
Der Zustandsraum wird dargestellt durch einen Signalvektor, welcher dem Agenten A Informationen über den aktuellen Fahrzustand sowie die gewünschte Trajektorie liefert, wodurch der beobachtbare Systemzustand des Agenten A dargestellt wird. Der Signalvektor wird, basierend auf Messsignalen des Fahrzeugbussystems und des zentralen Messsystems sowie Trajektorieninformationen aus der Bahnplanung, auf der echtzeitfähigen Recheneinheit zusammengestellt und mittels DDS verteilt. Neben den Zustandsinformationen beinhaltet das Datenpaket zusätzliche Systeminformationen, wie die Belohnung, sowie weitere Metadaten, beispielsweise einen Status zur Enkodierung von Befehlen zwischen den Frameworks oder gemittelte Fehlergrößen zur Umsetzung von Konvergenzkriterien.
Fig. 7 veranschaulicht einen beispielhaften Signalverlauf innerhalb der Inferenzstrategie des Agenten. Zu Beginn werden die UDP Pakete empfangen 30 und ausgelesen. Als nächster Schritt erfolgt in der Vorverarbeitung 31 die Extraktion 310 des Zustandsvektors, die Extraktion 311 der Belohnung sowie weiterer Metadaten. Hierbei kann ebenfalls die zeitliche Veränderung der Signale als Historie übergeben werden. Durch Berücksichtigung des Signalverlaufs können der Verlauf eines Fahrmanövers und damit indirekt sensierte Systemzustände, wie beispielsweise der Reibwert, berücksichtigt werden. Ein Vorteil der Übermittlung der Zeitreihe und Nutzung eines mehrlagigen Perzeptrons, im Gegensatz zu rekurrenten Netzwerken, ist außerdem die Robustheit gegenüber verlorenen Datenpaketen im Zuge der Nutzung des User Datagramm Protocol. Bei der Extraktion des Zustandsraumes können, je nach Konfiguration, verschiedene Untermengen extrahiert werden, in Abhängigkeit von der Aufgabe der additiven Quer- und Längsregelung. Beispielsweise kann bei der ausschließlichen Betrachtung der Querregelung der extrahierte Zustandsvektor nur
eine Teilmenge der möglichen zur Verfügung stehenden Informationen nutzen, um somit die Netzwerkkonfiguration und demnach die Komplexität zu reduzieren.
Als abschließender Schritt der Vorverarbeitung 31 erfolgt die Skalierung 312 des Zustandsvektors. Durch die Normalisierung des Zustandsvektors kann das Training von Neuronalen Netzwerken beschleunigt werden. Darüber hinaus kann dies zu einer Reduzierung des Prädiktionsfehlers beitragen. Dabei wird mit Hilfe der Normalisierung der Eingangsgrößen eine initiale Gewichtung aufgrund unterschiedlicher Wertebereiche der Messgrößen verhindert. In dem Fall der Betrachtung von Fahrzustandsgrößen ist dies ebenfalls vorteilhaft.
Nach der Vorverarbeitung 31 wird nun der skalierte Zustandsvektor im Inferenzprozess IP genutzt, um die Aktion des Agenten zu berechnen 32. Dabei kann es sich, je nach Unterstützungsaufgabe des Agenten, um einen eindimensionalen Aktionsraum und somit ein einziges Signal handeln, beispielsweise das additive Stellsignal des Lenkwinkelreglers aus Fig. 4. Andererseits kann bei der kombinierten Unterstützung von Längs- und Querführung die Netzausgabe ebenfalls mehrdimensional sein. Ist die Netzausgabe berechnet, so wird, abhängig von der gewählten Explorationsstrategie, im Rahmen einer Nachverarbeitung 33 ein zusätzliches Explorationssignal bestimmt 330 und mit der Netzausgabe kombiniert. Anschließend findet die Skalierung 331 der Aktion in die jeweilige Systemgröße der Ansteuerung der Aktorik statt. Die Skalierung 331 ist dabei einerseits abhängig von der gewählten Aktivierungsfunktion der Netzausgabe, da diese eine mathematische Beschränkung der Aktion darstellt. Andererseits besteht eine direkte Abhängigkeit zu dem geforderten additiven Stellsignal. Beispielsweise handelt es sich im Falle der Gaspedalregelung um eine Pseudogröße zur Ausnutzung der verfügbaren Motorleistung bzw. der Gaspedalstellung, welche einen prozentualen Wert annimmt. Nach erfolgter Skalierung 331 wird anschließend die berechnete Aktion des Agenten für das Versenden 34 innerhalb des DDS-Busses mit zusätzlichen Metadaten verpackt.
Neben der Berechnung 32 sowie dem Versenden 34 der Aktion werden ebenfalls die Informationen an den Trainingsprozess übergeben 35. Hierzu wird aus dem empfangenen Nachrichtenpaket die Belohnung extrahiert und gemeinsam mit dem skalierten Zustandsvektor, der Aktion sowie der zugehörigen Zeitstempel mittels Warteschlangen Q an den parallel ausgeführten Trainingsprozess übermittelt. Auf Seiten des Trainingsprozesses findet im sogenannten Replay Buffer als Speicher der gesammelten Daten, basierend auf den Zeitstempeln, die Zuordnung in vollständige Datentupel statt, welche anschließend für die Trainingsalgorithmen verwendet werden.
Bezugszeichenliste
1 Echtzeitfähige Recheneinheit
2 Recheneinheit
3 Recheneinheit
4 Messsystem
5 Datenbus
10 Empfangen eines Zustandsvektors und einer Belohnung
11 Bestimmen einer Aktion durch einen Inferenzprozess
12 Ausgeben der Aktion
13 Bereitstellen von Daten für einen Trainingsprozess
14 Anpassen einer Parametrierung einer Trainingsstrategie
15 Übermitteln der angepassten Parametrierung an den Inferenzprozess
16 Aktualisieren der Inferenzstrategie
20 Regelungseinrichtung
30 Empfang eines Datenpakets
31 Vorverarbeitung
310 Extraktion Zustand
311 Extraktion Belohnung
312 Skalierung
32 Berechnung der Aktion
33 Nachverarbeitung
330 Bestimmen eines Explorationssignals
331 Skalierung
34 Versand eines Datenpakets
35 Datenaustausch mit dem Trainingsprozess
40 Fortbewegungsmittel
41 Sensorik
42 Rechner
43 Assistenzsystem
44 Datenübertragungseinheit
45 Speicher
46 Netzwerk
A Agent
At Aktion
B Basisregler
BR Bremspedalregelung
F Fahrzeug
FA Aktorik
FS Sensorik
GR Gaspedalregelung
IP Inferenzprozess
M Messdaten
PIP Inferenzstrategie
Q Warteschlange
Rt Belohnung
St, St+i Zustandsvektor
T Trajektorienfolgeregelung
TP Trainingsprozess
TR Trajektorie
U Umwelt
V Vorsteuerung
Claims
1. Regelungseinrichtung (20) für ein Fortbewegungsmittel (40), wobei die Regelungseinrichtung (20) einen Reinforcement Learning Agenten (A) verwendet, der aufgeteilt ist in einen Inferenzprozess (IP), der eingerichtet ist, Aktionen (At) mittels einer Inferenzstrategie (PIP) ZU bestimmen (11), und einen parallel zum Inferenzprozess (IP) ausgeführten Trainingsprozess (TP), der eingerichtet ist, auf Basis von bereitgestellten Daten eine Parametrierung einer Trainingsstrategie anzupassen (14), und wobei der Reinforcement Learning Agent (A) eingerichtet ist, die Inferenzstrategie (P|P) im Fährbetrieb auf Basis der angepassten Parametrierung zu aktualisieren (16).
2. Regelungseinrichtung (20) gemäß Anspruch 1 , wobei die bereitgestellten Daten Zustandsvektoren (St, St+i), Belohnungen (Rt) und Aktionen (At) umfassen.
3. Regelungseinrichtung (20) gemäß Anspruch 2, wobei die Zustandsvektoren (St, St+i) und die Belohnungen (Rt) durch eine echtzeitfähige Recheneinheit (1) bestimmt werden und der Agent (A) auf einer externen Recheneinheit (2) ausgeführt wird.
4. Regelungseinrichtung (20) gemäß Anspruch 3, wobei ein Datenaustausch zwischen der echtzeitfähigen Recheneinheit (1) und der externen Recheneinheit (2) über einen Data Distribution Service erfolgt.
5. Regelungseinrichtung (20) gemäß einem der vorherigen Ansprüche, wobei der Inferenzprozess (IP) eingerichtet ist, zusätzlich zu Aktionen (At) auch Explorationen und Zeitstempel zu bestimmen (11) und an einen Aktor auszugeben (12).
6. Regelungseinrichtung (20) gemäß einem der vorherigen Ansprüche, wobei die Zustandsvektoren (St, St+i), die Belohnungen (Rt) und die Aktionen (At) mittels einer Warteschlange (Q) für den Trainingsprozess (TP) des Agenten (A) bereitgestellt werden (13).
7. Regelungseinrichtung (20) gemäß einem der vorherigen Ansprüche, wobei die Regelungseinrichtung (20) eingerichtet ist, die Zustandsvektoren (St, St+i) vor dem Bestimmen (11) einer Aktion (At) einer Skalierung zu unterziehen.
8. Regelungseinrichtung (20) gemäß einem der vorherigen Ansprüche, wobei die Regelungseinrichtung (20) zusätzlich zum Agenten (A) einen Basisregler (B) verwendet und die vom Agenten (A) bestimmten Aktionen (At) additive Stellsignale sind.
9. Regelungseinrichtung (20) gemäß einem der Ansprüche 1 bis 8, wobei die Regelungseinrichtung (20) eine Querdynamikregelung ist.
10. Regelungseinrichtung (20) gemäß Anspruch 9, wobei die vom Agenten (A) bestimmten Aktionen (At) ein Lenkwinkelsignale sind.
11. Regelungseinrichtung (20) gemäß einem der Ansprüche 1 bis 8, wobei die Regelungseinrichtung (20) eine Längsdynamikregelung ist.
12. Regelungseinrichtung (20) gemäß Anspruch 11, wobei die vom Agenten (A) bestimmte Aktion (At) ein Bremspedalsignal oder ein Gaspedalsignal ist.
13. Fortbewegungsmittel (40) mit einer Regelungseinrichtung (20) gemäß einem der Ansprüche 1 bis 12.
14. Verfahren zum Betreiben einer Regelungseinrichtung (20) für ein Fortbewegungsmittel (40), wobei die Regelungseinrichtung (20) einen Reinforcement Learning Agenten (A) verwendet, mit den Schritten:
- Empfangen (10) eines Zustandsvektors (St) und einer Belohnung (Rt) durch den Agenten (A);
- Bestimmen (11) einer Aktion (At) für den Zustandsvektor (St) durch einen Inferenzprozess (IP) des Agenten (A) mittels einer Inferenzstrategie (P|P);
- Ausgeben (12) der Aktion (At) an einen Aktor;
- Bereitstellen (13) von Daten für einen parallel zum Inferenzprozess (IP) ausgeführten Trainingsprozess (TP) des Agenten (A);
- Anpassen (14) einer Parametrierung einer Trainingsstrategie auf Basis der bereitgestellten Daten;
- Übermitteln (15) der angepassten Parametrierung an den Inferenzprozess (IP); und
- Aktualisieren (16) der Inferenzstrategie (PIP) im Fährbetrieb.
15. Computerprogramm mit Instruktionen, die bei Ausführung durch einen Computer den Computer zur Ausführung der Schritte eines Verfahrens gemäß Anspruch 14 zum Betreiben einer Regelungseinrichtung (20) für ein Fortbewegungsmittel (40) veranlassen.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| DE102024202401.5A DE102024202401A1 (de) | 2024-03-14 | 2024-03-14 | Betrieb einer Regelungseinrichtung für ein Fortbewegungsmittel |
| DE102024202401.5 | 2024-03-14 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| WO2025190877A1 true WO2025190877A1 (de) | 2025-09-18 |
Family
ID=94974557
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| PCT/EP2025/056488 Pending WO2025190877A1 (de) | 2024-03-14 | 2025-03-10 | Betrieb einer regelungseinrichtung für ein fortbewegungsmittel |
Country Status (2)
| Country | Link |
|---|---|
| DE (1) | DE102024202401A1 (de) |
| WO (1) | WO2025190877A1 (de) |
Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| DE102019214931A1 (de) | 2019-09-27 | 2021-04-01 | Zf Friedrichshafen Ag | Steuerung eines Fahrzeugs |
| US20230281277A1 (en) | 2022-03-07 | 2023-09-07 | Microsoft Technology Licensing, Llc | Remote agent implementation of reinforcement learning policies |
-
2024
- 2024-03-14 DE DE102024202401.5A patent/DE102024202401A1/de active Pending
-
2025
- 2025-03-10 WO PCT/EP2025/056488 patent/WO2025190877A1/de active Pending
Patent Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| DE102019214931A1 (de) | 2019-09-27 | 2021-04-01 | Zf Friedrichshafen Ag | Steuerung eines Fahrzeugs |
| US20230281277A1 (en) | 2022-03-07 | 2023-09-07 | Microsoft Technology Licensing, Llc | Remote agent implementation of reinforcement learning policies |
Non-Patent Citations (3)
| Title |
|---|
| BANERJEE SUVADEEP SBANERJEE49@GATECH EDU ET AL: "ALERA", ACM TRANSACTIONS ON INTELLIGENT SYSTEMS AND TECHNOLOGY, ASSOCIATION FOR COMPUTING MACHINERY CORPORATION, 2 PENN PLAZA, SUITE 701 NEW YORK NY 10121-0701 USA, vol. 10, no. 4, 24 July 2019 (2019-07-24), pages 1 - 25, XP058458512, ISSN: 2157-6904, DOI: 10.1145/3338123 * |
| HESTER TODD ET AL: "The Open-Source TEXPLORE Code Release for Reinforcement Learning on Robots", part 536 1 January 2014, SPRINGER INTERNATIONAL PUBLISHING, ISBN: 978-3-319-10403-4, pages: - 543, XP047503853 * |
| POUDEL BIBEK ET AL: "Learning to Control DC Motor for Micromobility in Real Time With Reinforcement Learning", 2022 IEEE 25TH INTERNATIONAL CONFERENCE ON INTELLIGENT TRANSPORTATION SYSTEMS (ITSC), IEEE, 8 October 2022 (2022-10-08), pages 1248 - 1254, XP034216803, [retrieved on 20221101], DOI: 10.1109/ITSC55140.2022.9921919 * |
Also Published As
| Publication number | Publication date |
|---|---|
| DE102024202401A1 (de) | 2025-09-18 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| DE112017003517B4 (de) | Steuergerät und Verfahren zur Steuerung eines Fahrzeugs und nichtflüchtiger computerlesbarer Speicher | |
| EP3512744B1 (de) | Verfahren und vorrichtung zum steuern einer bewegung eines fahrzeugs und fahrzeugbewegungssteuersystem | |
| CN114761895B (zh) | 混合自动驾驶车队的直接和间接控制 | |
| DE102018125250B4 (de) | Verfahren und Steuereinheit zur Führung eines Fahrzeugs | |
| EP4038463B1 (de) | Technik zur totzeitkompensation bei quer- und längsführung eines kraftfahrzeugs | |
| Na et al. | Experimental evaluation of a game-theoretic human driver steering control model | |
| DE102021110868B4 (de) | Fahrzeugsteuerungssysteme und -verfahren | |
| DE102019129232A1 (de) | Sprachverarbeitung für ein fahrzeug | |
| DE102020102962A1 (de) | Fahrzeugzielverfolgung | |
| DE102020106936A1 (de) | Steuern des betriebs eines fahrzeugs mit einem übergeordneten steuer-modul mit fehlertoleranter steuerung | |
| WO2007031578A1 (de) | Verfahren und vorrichtung zum lenken eines kraftfahrzeugs | |
| DE102020129369A1 (de) | Verbesserter fahrzeugbetrieb | |
| DE102021114768A1 (de) | Fahrzeugsteuerung unter Verwendung eines Controllers eines neuronalen Netzes in Kombination mit einem modellbasierten Controller | |
| DE102022121602A1 (de) | Objektbewegungsbahnprognose | |
| WO2020212020A1 (de) | ERMITTLUNG EINER EINGANGSGRÖßE EINES FAHRZEUG-AKTUATORS MITTELS MODELLGESTÜTZTER PRÄDIKTIVER REGELUNG | |
| DE102017200580A1 (de) | Verfahren zur Optimierung einer Manöverplanung für autonom fahrende Fahrzeuge | |
| DE102018220510A1 (de) | Situationsabhängige Berechnung einer Soll-Fahrzeuggeschwindigkeit | |
| DE102022125915A1 (de) | Verfahren zur Arbitrierung multipler automatisierter Fahrspurwechselanfragen in der Nähe von Routenverzweigungen | |
| DE102023100983A1 (de) | Autonomer rennstreckenfahrertrainer und demonstrator | |
| WO2024002777A1 (de) | Verfahren zur handdetektion, computerprogramm, und vorrichtung | |
| DE102021112119A1 (de) | Verfahren und Vorrichtung zur Trajektorienplanung für ein Fahrzeug | |
| DE102020127051A1 (de) | Verfahren zur Bestimmung von sicherheitskritischen Ausgabewerten mittels einer Datenanalyseeinrichtung für eine technische Entität | |
| DE102023122793A1 (de) | Fahrzeugdatenanalysesystem für eine mehrschichtige steuersoftware-architektur | |
| DE102020111953A1 (de) | Trajektorienplanungsmodul für automatisiertes fahren | |
| WO2022090040A1 (de) | Verfahren und vorrichtung zum steuern eines fahrzeugs entlang einer fahrttrajektorie |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| 121 | Ep: the epo has been informed by wipo that ep was designated in this application |
Ref document number: 25711672 Country of ref document: EP Kind code of ref document: A1 |