EP4449391A2 - Procédé d'aide au pilotage d'un aéronef, dispositif électronique d'aide au pilotage et système d'assistance associés - Google Patents

Procédé d'aide au pilotage d'un aéronef, dispositif électronique d'aide au pilotage et système d'assistance associés

Info

Publication number
EP4449391A2
EP4449391A2 EP22835436.1A EP22835436A EP4449391A2 EP 4449391 A2 EP4449391 A2 EP 4449391A2 EP 22835436 A EP22835436 A EP 22835436A EP 4449391 A2 EP4449391 A2 EP 4449391A2
Authority
EP
European Patent Office
Prior art keywords
aircraft
piloting
reception
commands
vei
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP22835436.1A
Other languages
German (de)
English (en)
Inventor
Jaime DIAZ-PINEDA
Thomas DE LARD
Baptiste IDIART
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Thales SA
Original Assignee
Thales SA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Thales SA filed Critical Thales SA
Publication of EP4449391A2 publication Critical patent/EP4449391A2/fr
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G08SIGNALLING
    • G08GTRAFFIC CONTROL SYSTEMS
    • G08G5/00Traffic control systems for aircraft
    • G08G5/20Arrangements for acquiring, generating, sharing or displaying traffic information
    • G08G5/21Arrangements for acquiring, generating, sharing or displaying traffic information located onboard the aircraft
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/092Reinforcement learning
    • GPHYSICS
    • G08SIGNALLING
    • G08GTRAFFIC CONTROL SYSTEMS
    • G08G5/00Traffic control systems for aircraft
    • G08G5/50Navigation or guidance aids
    • G08G5/53Navigation or guidance aids for cruising
    • GPHYSICS
    • G08SIGNALLING
    • G08GTRAFFIC CONTROL SYSTEMS
    • G08G5/00Traffic control systems for aircraft
    • G08G5/50Navigation or guidance aids
    • G08G5/55Navigation or guidance aids for a single aircraft

Definitions

  • TITLE Process for aiding the piloting of an aircraft, electronic device for aiding piloting and associated assistance system
  • the present invention relates to a method for aiding the piloting of an aircraft.
  • the present invention also relates to an electronic device for aiding the piloting of the aircraft and a system for assisting the piloting of the aircraft comprising such an electronic device for aiding the piloting.
  • the invention relates to the field of assistance to a pilot of an aircraft.
  • a driving model comprising a neural network, to which a reinforcement learning algorithm is applied.
  • a reinforcement learning algorithm allows the model to learn by itself to determine the steering commands from the state variables and a reward function quantifying the effect of the determined commands on the steering of the vehicle .
  • the aim of the invention is therefore to propose a method for aiding the piloting of an aircraft, an electronic device for aiding piloting and an associated piloting assistance system, capable of providing certifiable piloting rules.
  • the subject of the invention is a method for aiding the piloting of an aircraft, the method being implemented by an electronic piloting aid device and comprising the following steps: - acquisition of a piloting model of the aircraft and of a reward function comprising a piloting constraint,
  • the application step comprising the following sub-steps:
  • Each piloting rule generated by the process is certifiable since it respects a formalism allowing certification, namely to associate with at least one state of the aircraft, a piloting action to be implemented.
  • the piloting aid method comprises one or more of the following characteristics, taken in isolation or in all technically possible combinations:
  • each group of data also comprises the values of the control constraint associated with the state variables and with the commands, during the assignment step, for the or each group, at least one effect on the constraint is assigned to the values the group steering constraint, each rule further comprising the at least one effect on the constraint;
  • the method further comprising between the step of assigning and the step of providing, a step of identifying main rule(s) among the plurality of steering rules generated by applying a variable frequency analysis algorithm, during the transmission step, only the main rule(s) being transmitted;
  • the identification step further comprises comparing the effect(s) on the constraint of each main rule with a predetermined threshold to obtain at least one filtered rule, each filtered rule being a respective main rule comprising at least one effect on the constraint greater than or equal to the threshold, during the transmission step, only the filtered rule(s) being preferably provided with a view to their display intended for the pilot of the aircraft;
  • the assignment step includes for each group of data:
  • the training stage includes:
  • a preliminary reward function is acquired, the method further comprising, between the acquisition step and the application step, a step of training the model by applying a preliminary algorithm learning by reinforcement on the piloting model from the preliminary reward function, the training step comprising a modification of the model from an evaluation of the preliminary reward function;
  • the state variables are chosen from the group consisting of: an aircraft roll angle, an aircraft pitch angle, an aircraft yaw angle, an aircraft speed, an acceleration of the aircraft, a wind speed in contact with the aircraft, an orientation of the wind with respect to the aircraft, and a position of the aircraft.
  • the invention also relates to a computer program product comprising software instructions which, when implemented by a computer, implement a method according to any one of the preceding claims.
  • the invention also relates to an electronic device for aiding the piloting of an aircraft, comprising:
  • an acquisition module configured to acquire a piloting model of the aircraft and a reward function comprising a piloting constraint
  • an application module configured to apply to the control model, a reinforcement learning algorithm from the reward function, the application module comprising:
  • a reception unit configured to receive at least one state variable from the aircraft at times of reception
  • a modification unit configured to modify, for each reception instant, the model from an evaluation of the reward function from the state variable(s),
  • a determination unit configured to determine, for each instant of reception, piloting commands from the modified piloting model and the state variables received at said instant of reception,
  • a training module configured to form at least one group of data from the state variables received and the determined commands, each group of data comprising the state variables and the determined commands corresponding to a plurality of reception instants successive,
  • an assignment module configured to assign, for the or each group of data, at least one state of the aircraft to the state variables received and at least one piloting action to the determined commands, and to generate a piloting rule comprising the at least one state and the at least one control action
  • a transmission module configured to transmit, to a display device, at least one piloting rule with a view to its display intended for a pilot of the aircraft.
  • the subject of the invention is an aircraft piloting assistance system comprising such an electronic piloting assistance device and a display device configured to receive at least one piloting rule from the piloting aid and for displaying said rule intended for the pilot of the aircraft.
  • FIG. 1 is a schematic view of an aircraft piloting assistance system according to the invention, comprising an electronic piloting assistance device according to the invention;
  • Figure 2 is a representation of a classification of piloting commands determined by the electronic piloting aid device of Figure 1;
  • FIG. 3 is a view of a trajectory of the aircraft calculated by the pilot assistance system of FIG. 1;
  • Figure 4 is a flowchart of a piloting assistance method according to the invention, implemented by the piloting assistance device of the piloting assistance system of Figure 1.
  • the assistance system 10 is configured to provide piloting rules to a pilot 15 of the aircraft.
  • the assistance system 10 is connected to a device 20 for generating state variables VEi of the aircraft which will be described below.
  • the term "aircraft” means a flying machine capable of being piloted by the pilot 15, such as an airplane, a helicopter, or a drone.
  • the pilot 15 of the aircraft is either on board within the aircraft, in particular in the case of an airplane or a helicopter, or deported from said aircraft, in particular in the case of a drone.
  • the assistance system 10 comprises an electronic piloting aid device 25 and a display device 30.
  • the device 20 for generating state variables is for example an aircraft simulation environment.
  • the generation device 20 is configured to simulate the behavior of the aircraft along a trajectory comprising waypoints. More specifically, the Generation 20 device is configured to simulating the behavior of the aircraft between an initial position and a final position. The final position preferably corresponds to the last waypoint of the trajectory. If the aircraft has reached the final position or following the expiry of a predefined maximum delay, the generation device 20 restarts the simulation by repositioning the aircraft at the initial position.
  • the generation device 20 is then configured to receive, from the electronic piloting aid device 25, piloting commands Ci of the aircraft.
  • the generation device 20 is configured to then simulate, for a predefined period, the behavior of the aircraft following the implementation of the piloting commands Ci received.
  • the generation device 20 is configured to provide the piloting aid device 25 with the state variables VEi of the aircraft following the simulation of the behavior of the aircraft for the predefined duration.
  • the predefined duration is for example equal to 200 ms.
  • the piloting commands Ci are instructions, or commands, intended to be received by actuators of the aircraft and allowing piloting of the aircraft.
  • piloting commands Ci are for example chosen from the group consisting of:
  • the piloting commands Ci are for example the speeds of rotation of each rotor of the drone.
  • the state variables VEi of the aircraft are the variables making it possible to define the state of the aircraft in its environment.
  • the state variables VEi are for example chosen from the group consisting of:
  • a position of the aircraft such as a relative position of the aircraft with respect to the next waypoint or to the next two waypoints, and optionally
  • the generation device 20 is included in the aircraft and comprises a set of sensors and actuators of the aircraft.
  • the generation device 20 comprises the actuators capable of implementing the received piloting commands Ci and the sensors capable of measuring the state variables VEi of the aircraft after the predefined duration.
  • the electronic piloting assistance device 25 is connected to the generation device 20 and to the display device 30.
  • the assistance device 25 is configured to generate, from the generation device 20, piloting rules and for the provide to the display device 30, as will be detailed below.
  • the aid device 25 comprises an acquisition module 45, an application module 50, a training module 55, an assignment module 60, a transmission module 65 and optionally a training module 70 and a module ID 75.
  • the acquisition module 45, the application module 50, the training module 55, the assignment module 60, the supply module 65, and optionally the drive 70 and the identification module 75 are each produced in the form of software, or a software brick, executable by a processor 77.
  • a memory 76 of the aid device 25 is then able to store software for acquisition, application software, training software, delivery software, and optionally training software, and identification software.
  • the acquisition module 45, the application module 50, the training module 55, the assignment module 60, the supply module 65, and optionally the training module 70 and the module identification 75 are each made in the form of a programmable logic component, such as an FPGA (English Field Programmable Gate Array), or even an integrated circuit, such as an ASIC (of the English Application Specific Integrated Circuit).
  • a programmable logic component such as an FPGA (English Field Programmable Gate Array)
  • an ASIC of the English Application Specific Integrated Circuit
  • the aid device 25 When the aid device 25 is produced in the form of one or more software programs, that is to say in the form of a computer program, it is also able to be recorded on a medium, not shown, computer readable.
  • the computer-readable medium is, for example, a medium capable of storing electronic instructions and of being coupled to a bus of a computer system.
  • the readable medium is an optical disc, a magneto-optical disc, a ROM memory, a RAM memory, any type of non-volatile memory (for example EPROM, EEPROM, FLASH, NVRAM), a magnetic card or an optical card.
  • On the readable medium is then stored a computer program comprising software instructions.
  • the acquisition module 45 is configured to acquire a piloting model of the aircraft, a reward function FR comprising a piloting constraint, and optionally a command correspondence table, a state correspondence table, and a function Preliminary FRP reward not including the steering constraint and a correspondence table of effects on the steering constraint.
  • the piloting model is suitable for receiving as input the state variables VEi of the aircraft and for providing as output, the commands Ci for piloting the aircraft.
  • the control model is for example an artificial neural network comprising an input layer comprising a number of neurons equal to the number of state variables VEi.
  • the model further comprises one or more hidden layers (English hidden layer(s)) comprising respectively a plurality of neurons, and an output layer (English output layer) comprising a number of neurons equal to the number of control commands Ci.
  • the model further comprises connections between the neurons of the different successive layers, each connection having an adjustable weight, also called synaptic weight.
  • the reward function is a function taking the state variables VEi as input, and providing a numerical value as output.
  • the reward function includes the steering constraint representative of a steering intention imposing compliance with constraint(s).
  • the piloting intention is a flight responsible for the environment.
  • the control constraint is an environmental constraint.
  • the piloting intention is a shortest flight, the associated constraint then being a flight time constraint.
  • RT is a trajectory reward, for example equal to 0 if the position of the aircraft is not on a waypoint, 10 if the position of the aircraft is on a waypoint , and -2 if the aircraft missed the waypoint, i.e. the position of the aircraft is in an environment of a waypoint without being on the waypoint
  • ROA is the acceleration orientation reward, for example equal to 1 - ABS( accelerationX + l) -3 ), where ABS() denotes the absolute value function and accelerationX denotes the norm of the acceleration of the aircraft in taking gravity into account, and
  • CP is the control constraint
  • the magnitude accelerationX designates the norm of the acceleration along the axis connecting the tips of two wings of the aircraft.
  • ROA is therefore a constraint making it possible to prevent the passengers of the aircraft from being thrown onto the side of the aircraft during a turn.
  • ROA therefore allows the aircraft to behave more or less realistically.
  • control constraint is for example equal to:
  • CP projection. 10 -14 where projection is the scalar product between the speed of the plane and the speed of the wind.
  • This piloting constraint therefore makes it possible to increase the value of the reward function when the aircraft is carried by the wind and its fuel consumption is reduced.
  • control constraint is for example equal to:
  • CP y where y is a positive constant.
  • the reward function FR is incremented by the value y.
  • the path that minimizes the reward function is the one that minimizes the number of iterations, i.e. the one that leads to the shortest flight.
  • the command correspondence table comprises intervals of values for the piloting commands Ci, and associates a piloting action with each interval.
  • the state correspondence table comprises intervals of values for the state variables VEi and associates with each of said intervals, a state of the aircraft.
  • the correspondence table of effects on the control constraint comprises intervals of values, for the values of the control constraint CPi and associates with each of said intervals, a short-term effect on the control constraint and a long-term effect on steering stress.
  • the preliminary reward function FRP is a function taking the state variables VEi as input and providing a numerical value as output. For example, the preliminary reward function FRP is incremented at each iteration by the following magnitude: [Math 4]
  • RT is the trajectory reward defined above
  • ROA is the Acceleration Orientation Reward defined above
  • RA is an alignment reward, for example equal to 1 + (alignment + 2)“ 3 , where alignment is the scalar product between the speed of the aircraft and the direction between the aircraft and the next waypoint.
  • the application module 50 is configured to apply to the piloting model, a learning algorithm by reinforcement from the reward function.
  • the application module 50 is configured to receive the state variables VEi of the aircraft and to determine the piloting commands Ci at a plurality of successive instants of reception T.
  • the application module 50 comprises a first reception unit 81, a first modification unit 82, and a first determination unit 83.
  • the first reception unit 81 is configured to receive, from the generation device 20, the state variables VEi of the aircraft at successive reception instants T.
  • the first modification unit 82 is configured to modify, for each instant of reception T, the model based on an evaluation of the reward function from the state variables VEi. To evaluate the reward function, the first modification unit 82 is configured to calculate the piloting constraint value from the state variables VEi, for example according to one of the equations (2) or (3).
  • the first modification unit 82 is further configured to modify the weights of the connections of the model based on the evaluation of the reward function. Such a modification is known to those skilled in the art as being a classic technique for applying the reinforcement learning algorithm.
  • the first determination unit 83 is configured to determine, for each instant of reception T i; the steering commands Ci from the modified steering model and the received state variables VEi at said time of reception For this, the first determination unit 83 is configured to apply the modified model, to the received state variables VEi and to each instant of reception T i; and to determine the control commands Ci of said reception time T as being equal to the output values of the modified model.
  • the application module 50 is configured to perform a predetermined number of iterations, each iteration comprising the reception of the state variables VEi of the aircraft by the first reception unit 81, the modification of the model by the first modification unit 82, and the determination of the control commands Ci by the first determination unit 83.
  • the application module 50 is configured not to apply learning by reinforcement of the control model for a predefined number of iterations. Thus, at the end of the predefined number of iterations, the convergence weights have generally not reached convergence.
  • the application module 50 is preferably configured to carry out an exploration of the possible trajectories of the aircraft by taking into account modifications of the model based on the reward function, and in particular the piloting constraint included in the reward function.
  • the application module 50 is further configured to store, in a database and for each instant of reception Ti, the received state variables VEi, the determined steering commands Ci, and preferably the values of the steering constraint CPi calculated during the evaluation of the reward function.
  • the training module 55 is configured to form at least one group of data from the received state variables VEi, the determined commands Ci and optionally the values of the calculated control constraint CPi.
  • Each data group includes the state variables VEi, the control commands Ci, and optionally the values of the control constraint CPi corresponding to successive reception instants Ti.
  • the training module 55 is for example configured to form a plurality of data groups.
  • the application module is configured to apply to the control commands Ci determined by the application module 50, a classification algorithm, in order to classify, in predefined classes CL, said determined control commands Ci for each instant of reception Ti.
  • the predefined classes CL are for example included in the command correspondence table.
  • the training module 55 is for example configured to compare, for each instant of reception T, the piloting commands Ci with the intervals of values of the command correspondence table, in order to determine to which class CL correspond the commands of control Ci of said instant T.
  • the training module 55 is for example configured to group together the piloting commands Ci belonging to the same respective class CL and whose times of reception Ti form a sequence of consecutive times of reception T that is as long as possible.
  • the training module 55 is configured to then group together, firstly the following piloting commands: Ci, C2, C3, C 4 , C5, secondly the following piloting commands: C22, C23, C2 4 , and thirdly the commands of controls: C 4 s, C 4 6, C 47 .
  • the training module 55 is further configured to form each group of data as comprising a plurality of respective grouped commands Ci, the corresponding state variables VEi and optionally the values of the corresponding control constraint CPi.
  • corresponding state variables VEi means the state variables VEi received at the times of reception T corresponding to the grouped commands G.
  • corresponding control constraint values CPi means the values of the control constraint CPi calculated for the reception instants T corresponding to the grouped commands Ci.
  • a first group of data comprises the following commands: Ci, C2, C3, C 4 , C5, the corresponding state variables VEi: VEi, VE 2 , VE 3 , VE 4 , VE 5 , and optionally the values of the corresponding control stress: CPi, CP2, CP3, CP 4 , CP5.
  • a second group of data includes the following commands: C22, C23, C2 4 , the corresponding VEi state variables: VE22, VE23, VE2 4 , and optionally the values of the corresponding control constraint: CP22, CP23 , CP2 4 .
  • a third group includes the following commands: C 4 s, C 4 6, C 47 , the corresponding VEi state variables: VE 45 , VE 46 , VE 47 , and optionally the values of the corresponding control constraint: CP 4 s , CP 4 6, CP 47 .
  • the assignment module 60 is configured to assign, for the or each group of data: at least one state of the aircraft to the state variables VEi, at least one piloting action to the piloting commands Ci and optionally at least one effect on the control constraint at the values of the control constraint CPi.
  • the assignment module 60 is for example configured to assign to the commands Ci of each group, the at least one action from the command correspondence table.
  • the command correspondence table comprises for example for each predefined class CL at least one action.
  • the assignment module 60 is preferably configured to assign to the commands Ci of each group, the action(s) corresponding to the class CL of these commands Ci in the command correspondence table.
  • Each action is for example a textual label describing the piloting action performed by respective piloting commands Ci.
  • the actions are chosen from the group consisting of:
  • assignment module 60 is for example configured to assign several actions to the commands Ci of a data group.
  • FIG. 3 is represented a course of the aircraft along a trajectory comprising a first PPi, a second PP2, a third PP3, and a fourth PP4 waypoints.
  • a dotted line portion 85 of the route corresponds to a group of data.
  • the assignment module 60 is for example configured to assign to the commands Ci of the group corresponding to the portion 85, the following actions: a turn to the left of the aircraft, a descent of the aircraft, and deceleration of the aircraft.
  • the assignment module 60 is for example configured to assign to the state variables VEi, the at least one state from the state correspondence table.
  • Each state is for example a textual label describing the state of the aircraft as a function of the state variables VEi of said aircraft.
  • the states are chosen from the group consisting of:
  • the aircraft has the side wind from the left.
  • the assignment module 60 is for example further configured to calculate, for each group, a temporal average of the value of each state variable VEi of the group.
  • “Time average” means the average calculated between all the instants of reception Ti of the state variables VEi of the group.
  • the assignment module 60 is configured to then assign to the state variables VEi of each group, the at least one state by comparing the average values of the state variables VEi to the intervals corresponding to each state in the correspondence table d states.
  • assignment module 60 is for example configured to assign several states to the state variables VEi of a data group.
  • the assignment module 60 is for example configured to assign to the state variables VEi of the group corresponding to the portion 85, the following states: the aircraft is close to the next waypoint, the aircraft is slightly above the next waypoint, the aircraft is slightly to the right of the next waypoint, the aircraft is far from the previous waypoint, the aircraft is far above the previous waypoint crossing, the aircraft is very to the right of the previous crossing point, the sine of the roll angle is strongly negative, the wind in contact with the aircraft is weak, and the aircraft is facing the wind.
  • the assignment module 60 is further configured to generate, for each group, a steering rule comprising the at least one state and the at least one steering action, assigned to the group.
  • the control rule generated for the portion 85 is for example: - when the aircraft is close to the next waypoint, the aircraft is slightly above the next waypoint, the aircraft is slightly to the right of the next waypoint, the aircraft is far from the previous waypoint , the aircraft is very above the previous waypoint, the aircraft is very to the right of the previous waypoint, the sine of the roll angle is strongly negative, the wind in contact with the aircraft is weak , and the aircraft is headwind,
  • the assignment module 60 is furthermore configured to calculate, for each group, a first difference between the value of the control constraint CPd at the last time of reception T d among the times of reception T of the variables of state VEi of the group of data and the value of the control constraint CP p at the first instant of reception T p among the instants of reception T of the state variables VEi of the group of data.
  • the first instant of reception T p is the first, ie the oldest of the instants of reception T of the state variables VEi of the group.
  • the last time of reception T d is the last, ie the most recent of the times of reception T i of the state variables VEi of the group.
  • the assignment module 60 is configured to then assign to the values of the control constraint CPi, a short-term effect on the control constraint, from the first difference and the control constraint correspondence table.
  • Each short-term effect is for example a textual description describing whether the action or actions implemented, when the aircraft is in the state or states, is positive or not on the piloting constraint within a short time.
  • the short-term effects are chosen from a group consisting of:
  • the assignment module 60 is further configured to calculate, for each group, a second difference between the value of the CPM control constraint at a reception time T fi nai after the last reception time T d among the reception times T of the state variables VEi of the data group and the value of the control constraint CP p at the first reception time T p among the reception times T of the state variables VEi of the data group .
  • the subsequent reception time T fi nai to said last reception time T d is for example the last time of reception T of the trajectory simulation.
  • said instant T fi nai is the last reception instant Ti before the aircraft is repositioned at the initial point by the generation module 20. In FIG. 3, this instant Ti is the one for which the aircraft has reached the fourth waypoint PP4, or final position of the trajectory.
  • the assignment module 60 is then configured to assign, to the values of the control constraint CPi, a long-term effect on the control constraint, from the second difference and the control constraint correspondence table.
  • each long-term effect is for example a textual label describing whether the action or actions implemented, when the aircraft is in the state or states, is positive or not on the piloting constraint , in a long time.
  • the long-term effects are chosen from the group consisting of:
  • the assignment module 60 is configured to generate, when generating the steering rule, the rule further comprising the short-term effect on the steering constraint and the long-term effect on the steering constraint.
  • the rule generated for portion 85 is for example:
  • the transmission module 65 is configured to transmit, to the display device 30, the piloting rules with a view to their display intended for the pilot 15 of the aircraft.
  • the training module 70 is configured to train the piloting model to follow the trajectory by applying a preliminary reinforcement learning algorithm to the model, based on the preliminary reward function.
  • the training module 70 includes a second reception unit 91, a second modification unit 92, and a second determination unit 93.
  • the second reception unit 91 is analogous to the first reception unit 81 .
  • the state variables received by the second reception unit 91 are called preliminary state variables in the present description.
  • the second reception unit 91 is then configured to receive the preliminary state variables at preliminary reception instants.
  • the second modification unit 92 is substantially similar to the first modification unit 82 except that the second modification unit 92 is configured to modify the model based on an evaluation of the preliminary reward function instead of the reward function.
  • the second determination unit 93 is analogous to the first determination unit 83.
  • the steering commands determined by the second determination unit 93 is configured to determine are called preliminary commands in the present description.
  • the second determination unit 93 is then configured to determine said preliminary commands.
  • the training module 70 is configured to receive the preliminary state variables, modify the model and determine the preliminary commands at several successive preliminary instants until the preliminary learning algorithm by reinforcement converges, that is to say until the weights of the model are no longer substantially modified by the second modification unit 92.
  • the model is then said to be trained.
  • the training module 70 is further configured to transmit, to the application module 50, the trained model.
  • the application module 50 is then configured to apply the reinforcement learning algorithm to the trained model rather than to the model acquired by the acquisition module 45.
  • the identification module 75 is optionally configured to, if the rules include the at least one effect on the constraint, identify at least one main rule among the plurality of rules generated.
  • the identification module 75 is advantageously configured to apply a variable frequency analysis algorithm, known per se, from a predefined support threshold and a predefined confidence threshold.
  • the support quantifies the frequency of appearance of a triplet “state(s), action(s), effect(s) on the constraint” among the set of rules.
  • the support is included in 0 and 1. For example, if the support threshold is equal to 0.5, then each triplet "state(s), action(s), effect(s) on the constraint" of the main rules appear in at least 50% of the control rules. Confidence quantifies the frequency of appearance of a triplet “state(s), action(s), effect(s) on the constraint” among the rules comprising the said state(s) and the said action(s). The confidence is between 0 and 1.
  • the identification module 75 is configured to identify, among the control rules, the main rule or rules whose support and confidence are greater than the respective thresholds.
  • the identification module 75 is further configured to, if the rules include the at least effect on the constraint, compare the effects on the constraint of each main rule with a respective predetermined threshold, to obtain at least one filtered rule .
  • the predetermined threshold is for example equal to: very positive effect, positive effect or negative effect. More specifically, the identification module 75 is optionally configured to select only the main rules for which at least one of the effects on the control constraint is greater than or equal to the predetermined threshold. It is considered in this description that "very positive is greater than or equal to: very positive, positive, negative, and very negative”, "positive is greater than or equal to: positive, negative, and very negative” and "negative is greater or equal to: negative, and very negative”.
  • the transmission module 65 is configured to transmit, to the display device 30, only each main rule or each filtered rule.
  • the display device 30 is for example embedded in the aircraft if the aircraft is an airplane, or remote from the aircraft if the aircraft is a drone.
  • the display device 30 comprises for example a display screen 95 and optionally a processing unit 97 connected to the display screen 95.
  • the display screen 95 is for example suitable for displaying content transmitted by the processing unit 97.
  • the processing unit 97 is configured to receive, from the aid device 25, at least one control rule.
  • the processing unit 97 is for example configured to implement a chatbot capable of interacting with the pilot 15.
  • the processing unit 97 is configured to display, on the display screen 95 , the piloting rule(s) received, for example following an interaction with the pilot 15.
  • the acquisition module 45 acquires the piloting model of the aircraft, the reward function; as well as optionally the command correspondence table, the state correspondence table, the preliminary reward function and the correspondence table of effects on the piloting constraint.
  • the training module 70 applies the preliminary reinforcement learning algorithm to the model, in order to train it to follow the trajectory.
  • the second reception unit 91 receives, from the generation device 20 and at the preliminary reception instants, the preliminary state variables of the aircraft.
  • the second modification unit 92 evaluates the preliminary reward function from the preliminary state variables received, for example using the previous equation (4). The second modification unit 92 then modifies the weights of the model, according to the value of the preliminary reward function, according to a technique known per se.
  • the second determination unit 93 determines the preliminary commands, for example by applying the modified model to the preliminary state variables received.
  • the training module 70 For each instant of preliminary reception, the training module 70 transmits to the generation device 20 the determined preliminary commands. The training module 70 then waits to receive, from the generation device 20, the preliminary state variables of the aircraft at the next preliminary reception instant. Then, the training module 70 repeats the first reception 122, modification 124 and determination 126 sub-steps.
  • the reception 122, modification 124 and determination 126 sub-steps are repeated until convergence of the model is reached.
  • the model is trained to follow the trajectory.
  • the application module 50 applies the reinforcement learning algorithm to the trained model.
  • the first reception unit 81 receives, from the generation device 20 and at successive reception times T, the state variables VEi of the aircraft. Then, for each instant of reception Ti, during a second modification sub-step 134, the first modification unit 82 evaluates the reward function from the state variables VEi received, for example according to equation (1 ). For this purpose, the first modification unit 82 calculates the value of the control constraint CPi, for example according to one of the equations (2) or (3). Then, analogously to the first modification sub-step 124, the first modification unit 82 modifies the weights of the trained model according to a technique known per se.
  • the first determination unit 83 determines the piloting commands Ci by applying the modified model to the state variables VE i; for example in a manner analogous to what is carried out during the first determination sub-step 126.
  • the application module 50 transmits to the generation device 20, the determined control commands Ci.
  • the application module 50 then waits to receive, from the generation device 20, the state variables VEi of the aircraft at the next reception time T. Then, the application module 50 repeats the second reception 132, modification 134 and determination 136 sub-steps.
  • the state variables VEi received, the control commands Ci determined, and advantageously the value of the control constraint CPi calculated, are stored in the database.
  • the second reception 132, modification 134 and determination 136 sub-steps are repeated until the predefined number of iterations is reached.
  • the application module 50 applies, during the application step 130, the reinforcement learning algorithm to the model acquired during the acquisition step 110.
  • the training module 55 forms at least one group comprising, for consecutive reception instants T, the received state variables VEi, the determined control commands Ci; and optionally the calculated values of the control constraint CPi.
  • the training module 55 compares, for example, the piloting commands Ci determined for each instant of reception T i; to the intervals of values of the command correspondence table, in order to determine to which class CL correspond the piloting commands Ci determined at said instant Ti. Then, the training module 55 groups together the piloting commands Ci belonging to the same respective class CL and determined for the reception instants Ti forming the longest possible sequence of consecutive reception instants Ti.
  • the training module 55 forms each group by including the grouped control commands Ci, the corresponding state variables VEi; and optionally the corresponding control constraint values CPi.
  • the assignment module 60 assigns, for each group, at least one action to the control commands Ci of the group, for example by comparing the control commands Ci to the intervals of values of the table of stock matching.
  • the assignment module 60 also assigns, for each group, at least one state to the state variables VEi of the group. For this, the assignment module calculates for example the temporal average of the value of each state variable VEi of the group and compares each temporal average with the intervals of values of the state correspondence table.
  • the assignment module 60 calculates, for each group, the first and the second difference as described above. The assignment module 60 then assigns to the values of the control constraint CPi, the short-term effect on the constraint and the long-term effect on the constraint, by comparing the first and second differences with the intervals of values of the table correspondence of effects on the constraint.
  • the assignment module 60 then generates, for each group, a rule by including therein the state or states of the group, the action or actions of the group; and optionally the short-term effect on the constraint and the long-term effect on the group constraint.
  • the identification module 75 identifies, during an identification step 160, the at least one main rule among the rules generated.
  • the identification module 75 applies to the rules generated the variable frequency analysis algorithm, defined above.
  • the identification module 75 optionally compares the effects on the control constraint included in each main rule with the predetermined threshold, to obtain at least one filtered rule.
  • the main rules having a very positive, at least positive or at least negative effect on the constraint are for example part of the filtered rules.
  • the transmission module 65 transmits to the display device 30 the generated rules; or, where appropriate, the at least one main rule or the at least one filtered rule.
  • the display device 30 displays, intended for the pilot 15, the rules which have been transmitted to him by the transmission module 65.
  • the pilot 15 interacts with the dialoguer implemented by the processing unit 97, to know the effect(s) on the piloting constraint of the implementation of one or more several respective piloting actions in the state or states in which the aircraft is located.
  • the processing unit 97 controls the display on the display screen 95, of all or part of the control rule comprising the said action(s) and the said state(s).
  • the generated control rules are then certifiable.
  • the process is able to generate a large number of control rules without human intervention being necessary.
  • the risk that the pilot 15 is confronted with a state of the aircraft absent from the piloting rules Ci is limited.
  • control commands Ci are determined according to the reinforcement learning algorithm.
  • the determination of the control commands Ci according to the reinforcement learning algorithm makes it possible to determine control commands which would not have been taken into consideration by a human operator, leading to the generation of additional rules that a human operator would not have considered.
  • the training step 140 makes it possible to form sufficiently small groups of data, i.e. reduced, so that each group can correspond to one action or several actions performed simultaneously.
  • the training step 140 makes it possible to form sufficiently large groups of data, i.e. large, for the action or actions assigned to the commands Ci of said group to have a quantifiable effect on the piloting constraint.
  • the optional training step 120 makes it possible to provide, as input to the application step 130, the piloting model trained in following the trajectory.
  • following the trajectory is the main mission of the aircraft.
  • the model will continue to substantially follow the trajectory, while introducing slight variations in direction having a substantially positive effect on the piloting constraint.
  • the optional identification step 160 makes it possible to extract from the generated rules, only the most representative actions and states, that is to say, those which have been encountered most often, ie the most frequent, and in which the pilot 15 can have trust. Moreover, this step 160 makes it possible to limit the number of rules to be transmitted to the display device 30, while preserving the main elements of the rules generated.

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Aviation & Aerospace Engineering (AREA)
  • Theoretical Computer Science (AREA)
  • General Health & Medical Sciences (AREA)
  • Artificial Intelligence (AREA)
  • Computational Linguistics (AREA)
  • Data Mining & Analysis (AREA)
  • Evolutionary Computation (AREA)
  • Biomedical Technology (AREA)
  • Molecular Biology (AREA)
  • Computing Systems (AREA)
  • General Engineering & Computer Science (AREA)
  • Biophysics (AREA)
  • Mathematical Physics (AREA)
  • Software Systems (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Health & Medical Sciences (AREA)
  • Control Of Position, Course, Altitude, Or Attitude Of Moving Bodies (AREA)
  • Radar Systems Or Details Thereof (AREA)
  • User Interface Of Digital Computer (AREA)

Abstract

La présente invention concerne un procédé d'aide au pilotage d'un aéronef. Le procédé comprend une acquisition (1 10) d'un modèle de pilotage de l'aéronef et d'une fonction de récompense comportant une contrainte de pilotage, et une application (130), au modèle de pilotage, d'un algorithme d'apprentissage par renforcement pour obtenir des variables d'état, et des commandes de pilotage. Le procédé comprend en outre une formation de groupe(s) (140) de données à partir des variables d'état et des commandes. Pour le ou chaque groupe, le procédé comprend une affectation (150) d'au moins un état de l'aéronef aux variables d'état et d'au moins une action de pilotage aux commandes, pour générer une règle de pilotage comportant les état(s) et action(s) de pilotage. Le procédé comprend également une transmission (170) d'au moins une règle de pilotage à un dispositif d'affichage en vue de son affichage à destination d'un pilote de l'aéronef.

Description

DESCRIPTION
TITRE : Procédé d’aide au pilotage d’un aéronef, dispositif électronique d’aide au pilotage et système d’assistance associés
La présente invention concerne un procédé d’aide au pilotage d’un aéronef.
La présente invention concerne également un dispositif électronique d’aide au pilotage de l’aéronef et un système d’assistance au pilotage de l’aéronef comprenant un tel dispositif électronique d’aide au pilotage.
L’invention concerne le domaine de l’assistance à un pilote d’un aéronef.
Pour le pilotage d’un véhicule automobile, il est connu d’avoir recours à des pilotes automatiques configurés pour déterminer des commandes de pilotage à partir de variables d’état mesurées par des capteurs du véhicule. Les commandes sont ensuite implémentées dans le véhicule pour son pilotage.
A cet effet, il est connu d’utiliser un modèle de pilotage comprenant un réseau de neurones, auquel est appliqué un algorithme d’apprentissage par renforcement (de l’anglais reinforcement learning). Un tel algorithme d’apprentissage par renforcement permet au modèle d’apprendre par lui-même à déterminer les commandes de pilotage à partir des variables d’état et d’une fonction de récompense quantifiant l’effet des commandes déterminées sur le pilotage du véhicule.
Toutefois, dans le contexte aéronautique, il est généralement recommandé, voir nécessaire, d’obtenir une certification pour le système de pilotage. La certification permet alors de garantir que le système de pilotage ne déterminera pas de commande de pilotage incohérente risquant de mettre en péril l’intégrité de l’aéronef et de ses potentiels passagers. Or, les systèmes de pilotage comprenant un modèle du type précité ne sont pas certifiables en l’état.
L’invention a donc pour but de proposer un procédé d’aide au pilotage d’un aéronef, un dispositif électronique d’aide au pilotage et un système d’assistance au pilotage associés, propres à fournir des règles de pilotage certifiables.
A cet effet, l’invention a pour objet un procédé d’aide au pilotage d’un aéronef, le procédé étant mis en œuvre par un dispositif électronique d’aide au pilotage et comprenant les étapes suivantes : - acquisition d’un modèle de pilotage de l’aéronef et d’une fonction de récompense comportant une contrainte de pilotage,
- application, au modèle de pilotage, d’un algorithme d’apprentissage par renforcement à partir de la fonction de récompense, l’étape d’application comportant les sous-étapes suivantes :
+ une réception de variable(s) d’état de l’aéronef à des instants de réception,
+ pour chaque instant de réception, une modification du modèle à partir d’une évaluation de la fonction de récompense à partir de la ou des variables d’état reçues audit instant de réception, et
+ pour chaque instant de réception, une détermination de commandes de pilotage à partir du modèle de pilotage modifié et des variables d’état reçues audit instant,
- formation de groupe(s) de données à partir des variables d’état reçues et des commandes déterminées, chaque groupe de données comprenant les variables d’état et les commandes correspondant à une pluralité d’instants de réception successifs,
- pour le ou chaque groupe de données, affectation d’au moins un état de l’aéronef aux variables d’état et d’au moins une action de pilotage aux commandes, pour générer une règle de pilotage comportant l’au moins un état et l’au moins une action de pilotage,
- transmission d’au moins une règle de pilotage à un dispositif d’affichage en vue de son affichage à destination d’un pilote de l’aéronef.
Chaque règle de pilotage générée par le procédé est certifiable puisqu’elle respecte un formalisme permettant la certification, à savoir d’associer à au moins un état de l’aéronef, une action de pilotage à mettre en œuvre.
Suivant d’autres aspects avantageux de l’invention, le procédé d’aide au pilotage comprend une ou plusieurs des caractéristiques suivantes, prises isolément ou suivant toutes les combinaisons techniquement possibles :
- lors de l’étape d’application, pour chaque instant de réception, une valeur de la contrainte de pilotage est calculée au cours de l’évaluation de la fonction de récompense, lors de l’étape de formation de groupe(s), chaque groupe de données comprend en outre les valeurs de la contrainte de pilotage associées aux variables d’état et aux commandes, lors de l’étape d’affectation, pour le ou chaque groupe, au moins un effet sur la contrainte est affecté aux valeurs de la contrainte de pilotage du groupe, chaque règle comprenant en outre l’au moins un effet sur la contrainte ;
- lors de l’étape d’affectation une pluralité de règles est formée, le procédé comprenant en outre entre l’étape d’affectation et l’étape de fourniture, une étape d’identification de règle(s) principale(s) parmi la pluralité de règles de pilotage générées par application d’un algorithme d’analyse de fréquences de variables, lors de l’étape de transmission, seule(s) la ou les règles principales étant transmises ;
- l’étape d’identification comprend en outre la comparaison du ou des effets sur la contrainte de chaque règle principale à un seuil prédéterminé pour obtenir au moins une règle filtrée, chaque règle filtrée étant une règle principale respective comprenant au moins un effet sur la contrainte supérieur ou égal au seuil, lors de l’étape de transmission, seule(s) la ou les règles filtrées étant de préférence fournies en vue de leur affichage à destination du pilote de l’aéronef ;
- l’étape d’affectation comprend pour chaque groupe de données :
- un calcul d’une première différence entre la valeur de la contrainte de pilotage au dernier instant de réception parmi les instants de réception des variables d’état du groupe de données, et la valeur de contrainte de pilotage au premier instant de réception parmi les instants de réception des variables d’état du groupe de données,
- un calcul d’une deuxième différence entre la valeur de la contrainte de pilotage à un instant de réception postérieur au dernier instant de réception parmi les instants de réception des variables d’état du groupe de données, et la valeur de contrainte de pilotage au premier instant de réception parmi les instants de réception des variables d’état du groupe de données,
- une affectation, aux valeurs de la contrainte de pilotage, d’un effet à court terme sur la contrainte de pilotage, à partir de la première différence et d’un tableau de correspondance de contraintes de pilotage, et
- une affectation, aux valeurs de la contrainte de pilotage, d’un effet à long terme sur la contrainte de pilotage, à partir de la deuxième différence et du tableau de correspondance de contraintes de pilotage ;
- l’étape de formation comprend :
- classification des commandes de pilotage déterminées parmi une pluralité de classes prédéfinies et via un tableau de correspondance de commandes,
- pour chaque classe, regroupement des commandes de pilotage appartenant à ladite classe et déterminées pour les instants de réception formant une suite d’instants de réception consécutifs la plus longue possible, pour former au moins un ensemble de commandes regroupées, et
- pour chaque ensemble de commandes regroupées, formation d’un groupe respectif comprenant les commandes dudit ensemble et les variables d’état reçues aux instants de réception pour lesquels lesdites commandes ont été déterminées ;
- lors de l’étape d’acquisition, une fonction de récompense préliminaire est acquise, le procédé comprenant en outre, entre l’étape d’acquisition et l’étape d’application, une étape d’entrainement du modèle par application d’un algorithme préliminaire d’apprentissage par renforcement sur le modèle de pilotage à partir de la fonction de récompense préliminaire, l’étape d’entrainement comportant une modification du modèle à partir d’une évaluation de la fonction de récompense préliminaire ;
- les variables d’état sont choisies parmi le groupe consistant en : un angle de roulis de l’aéronef, un angle de tangage de l’aéronef, un angle de lacet de l’aéronef, une vitesse de l’aéronef, une accélération de l’aéronef, une vitesse du vent au contact de l’aéronef, une orientation du vent par rapport à l’aéronef, et une position de l’aéronef.
L’invention a également pour objet un produit programme d’ordinateur comprenant des instructions logicielles qui, lorsqu’elles sont mises en œuvre par un ordinateur, mettent en œuvre un procédé selon l’une quelconque des revendications précédentes.
L’invention a également pour objet un dispositif électronique d’aide au pilotage d’un aéronef, comprenant :
- un module d’acquisition configuré pour acquérir un modèle de pilotage de l’aéronef et une fonction de récompense comprenant une contrainte de pilotage,
- un module d’application configuré pour appliquer au modèle de pilotage, un algorithme d’apprentissage par renforcement à partir de la fonction de récompense, le module d’application comportant :
+ une unité de réception configurée pour recevoir au moins une variable d’état de l’aéronef à des instants de réception,
+ une unité de modification configurée pour modifier, pour chaque instant de réception, le modèle à partir d’une évaluation de la fonction de récompense à partir de la ou des variables d’état, et
+ une unité de détermination configurée pour déterminer, pour chaque instant de réception, des commandes de pilotage à partir du modèle de pilotage modifié et des variables d’état reçues audit instant de réception,
- un module de formation configuré pour former au moins un groupe de données à partir des variables d’état reçues et des commandes déterminées, chaque groupe de données comprenant les variables d’état et les commandes déterminée correspondant à une pluralité d’instants de réceptions successifs,
- un module d’affectation configuré pour affecter, pour le ou chaque groupe de données, au moins un état de l’aéronef aux variables d’état reçues et au moins une action de pilotage aux commandes déterminées, et pour générer une règle de pilotage comportant l’au moins un état et l’au moins une action de pilotage, et - un module de transmission configuré pour transmettre, à un dispositif d’affichage, au moins une règle de pilotage en vue de son affichage à destination d’un pilote de l’aéronef.
En outre, l’invention a pour objet un système d’assistance au pilotage d’un aéronef comprenant un tel dispositif électronique d’aide au pilotage et un dispositif d’affichage configuré pour recevoir au moins une règle de pilotage depuis le dispositif d’aide au pilotage et pour afficher ladite règle à destination du pilote de l’aéronef.
Ces caractéristiques et avantages de l’invention apparaîtront plus clairement à la lecture de la description qui va suivre, donnée uniquement à titre d’exemple non limitatif et faite en référence aux dessins annexés, sur lesquels :
[Fig. 1] la figure 1 est une vue schématique d’un système d’assistance au pilotage d’un aéronef selon l’invention, comprenant un dispositif électronique d’aide au pilotage selon l’invention ;
[Fig. 2] la figure 2 est une représentation d’une classification de commandes de pilotage déterminées par le dispositif électronique d’aide au pilotage de la figure 1 ;
[Fig. 3] la figure 3 est une vue d’une trajectoire de l’aéronef calculée par le système d’assistance au pilotage de la figure 1 ; et
[Fig. 4] la figure 4 est un organigramme d’un procédé d’aide au pilotage selon l’invention, mis en œuvre par le dispositif d’aide au pilotage du système d’assistance au pilotage de la figure 1.
En référence à la figure 1 , on décrit un système 10 d’assistance au pilotage d’un aéronef. Le système d’assistance 10 est configuré pour fournir, à un pilote 15 de l’aéronef, des règles de pilotage. Le système d’assistance 10 est connecté à un dispositif 20 de génération de variables d’état VEi de l’aéronef qui sera décrit ci-après.
Dans la suite de cette description, on entend par « aéronef » un engin volant propre à être piloté par le pilote 15, tel qu’un avion, un hélicoptère, ou un drone. En particulier, le pilote 15 de l’aéronef est soit embarqué au sein de l’aéronef, notamment dans le cas d’un avion ou d’un hélicoptère, soit déporté dudit aéronef, notamment dans le cas d’un drone.
Le système d’assistance 10 comprend un dispositif électronique d’aide au pilotage 25 et un dispositif d’affichage 30.
Le dispositif 20 de génération de variables d’état est par exemple un environnement de simulation de l’aéronef. Le dispositif de génération 20 est configuré pour simuler le comportement de l’aéronef le long d’une trajectoire comportant des points de passage (de l’anglais waypoint). Plus spécifiquement, le dispositif de génération 20 est configuré pour simuler le comportement de l’aéronef entre une position initiale et une position finale. La position finale correspond de préférence au dernier point de passage de la trajectoire. Si l’aéronef a atteint la position finale ou suite à l’expiration d’un délai maximal prédéfini, le dispositif de génération 20 recommence la simulation en repositionnant l’aéronef à la position initiale.
Le dispositif de génération 20 est alors configuré pour recevoir, depuis le dispositif électronique d’aide au pilotage 25, des commandes de pilotage Ci de l’aéronef. Le dispositif de génération 20 est configuré pour ensuite simuler, pendant une durée prédéfinie, le comportement de l’aéronef suite à la mise en œuvre des commandes de pilotage Ci reçues. Le dispositif de génération 20 est configuré pour fournir au dispositif d’aide au pilotage 25, les variables d’état VEi de l’aéronef suite à la simulation du comportement de l’aéronef pendant la durée prédéfinie. La durée prédéfinie est par exemple égale à 200 ms.
Les commandes de pilotage Ci sont des instructions, ou commandes, destinées à être reçues par des actionneurs de l’aéronef et permettant le pilotage de l’aéronef.
Dans le mode de réalisation dans lequel l’aéronef est un avion, les commandes de pilotage Ci sont par exemple choisies parmi le groupe consistant en :
- une position de la gouverne de lacet de l’avion,
- une position de la gouverne de tangage de l’avion,
- une position des volets de l’avion,
- une position des ailerons de l’avion, et
- un débit de carburant dans des réacteurs de l’avion.
Dans le mode de réalisation dans lequel l’aéronef est un drone, les commandes de pilotage Ci sont par exemple les vitesses de rotation de chaque rotor du drone.
Les variables d’état VEi de l’aéronef sont les variables permettant de définir l’état de l’aéronef dans son environnement. Les variables d’état VEi sont par exemple choisies parmi le groupe consistant en :
- un angle de roulis de l’aéronef,
- un angle de tangage de l’aéronef,
- un angle de lacet de l’aéronef,
- une accélération de l’aéronef,
- une vitesse de l’aéronef,
- une position de l’aéronef, telle qu’une position relative de l’aéronef par rapport au prochain point de passage ou aux deux prochains points de passage, et optionnellement
- une vitesse du vent au contact de l’aéronef, et
- une orientation du vent par rapport à l’aéronef. On comprend alors que la mise en œuvre de commandes de pilotage Ci, par le dispositif de génération 20, et la simulation du comportement de l’aéronef pendant la durée prédéfinie conduisent à une variation des variables d’état VEi.
Selon une variante de réalisation, le dispositif de génération 20 est inclus dans l’aéronef et comprend un ensemble de capteurs et d’actionneurs de l’aéronef. Ainsi, le dispositif de génération 20 comprend les actionneurs propres à mettre en œuvre les commandes de pilotage reçues Ci et les capteurs propres à mesurer les variables d’état VEi de l’aéronef après la durée prédéfinie.
Le dispositif 25 électronique d’aide au pilotage est connecté au dispositif de génération 20 et au dispositif d’affichage 30. Le dispositif d’aide 25 est configuré pour générer, à partir du dispositif de génération 20, des règles de pilotage et pour les fournir au dispositif d’affichage 30, comme cela sera détaillé ci-après.
Le dispositif d’aide 25 comprend un module d’acquisition 45, un module d’application 50, un module de formation 55, un module d’affectation 60, un module de transmission 65 et optionnellement un module d’entrainement 70 et un module d’identification 75.
Dans l’exemple de réalisation de la figure 1 , le module d’acquisition 45, le module d’application 50, le module de formation 55, le module d’affectation 60, le module de fourniture 65, et optionnellement le module d’entraînement 70 et le module d’identification 75, sont réalisés chacun sous forme d’un logiciel, ou d’une brique logicielle, exécutables par un processeur 77. Une mémoire 76 du dispositif d’aide 25 est alors apte à stocker un logiciel d’acquisition, un logiciel d’application, un logiciel de formation, un logiciel de fourniture, et optionnellement un logiciel d’entrainement, et un logiciel d’identification.
En variante non-représentée, le module d’acquisition 45, le module d’application 50, le module de formation 55, le module d’affectation 60, le module de fourniture 65, et optionnellement le module d’entraînement 70 et le module d’identification 75, sont réalisés chacun sous forme d’un composant logique programmable, tel qu’un FPGA (de l’anglais Field Programmable Gate Array), ou encore d’un circuit intégré, tel qu’un ASIC (de l’anglais Application Specific Integrated Circuit).
Lorsque le dispositif d’aide 25 est réalisé sous forme d’un ou plusieurs logiciel(s), c’est-à-dire sous forme d’un programme d’ordinateur, il est en outre apte à être enregistré sur un support, non représenté, lisible par ordinateur. Le support lisible par ordinateur est par exemple, un médium apte à mémoriser les instructions électroniques et à être couplé à un bus d’un système informatique. A titre d’exemple, le support lisible est un disque optique, un disque magnéto-optique, une mémoire ROM, une mémoire RAM, tout type de mémoire non volatile (par exemple EPROM, EEPROM, FLASH, NVRAM), une carte magnétique ou une carte optique. Sur le support lisible est alors mémorisé un programme d’ordinateur comprenant des instructions logicielles.
Le module d’acquisition 45 est configuré pour acquérir un modèle de pilotage de l’aéronef, une fonction de récompense FR comprenant une contrainte de pilotage, et optionnellement un tableau de correspondance de commandes, un tableau de correspondance d’états, et une fonction de récompense préliminaire FRP ne comprenant pas la contrainte de pilotage et un tableau de correspondance d’effets sur la contrainte de pilotage.
Le modèle de pilotage est propre à recevoir en entrée les variables d’état VEi de l’aéronef et à fournir en sortie, les commandes Ci de pilotage de l’aéronef. Le modèle de pilotage est par exemple un réseau de neurones artificiels comprenant une couche d’entrée (de l’anglais input layer) comportant un nombre de neurones égal au nombre de variables d’état VEi. Le modèle comprend en outre une ou plusieurs couches cachées (de l’anglais hidden layer(s)) comportant respectivement une pluralité de neurones, et une couche de sortie (de l’anglais output layer) comportant un nombre de neurones égal au nombre de commandes de pilotage Ci. Le modèle comprend en outre des connexions entre les neurones des différentes couches successives, chaque connexion ayant un poids réglable, également appelé poids synaptique.
La fonction de récompense est une fonction prenant en entrée les variables d’état VEi, et fournissant en sortie une valeur numérique. La fonction de récompense comprend la contrainte de pilotage représentative d’une intention de pilotage imposant le respect de contrainte(s).
Selon un premier exemple, l’intention de pilotage est un vol responsable de l’environnement. Dans cet exemple, la contrainte de pilotage est une contrainte environnementale.
Selon une deuxième exemple, l’intention de pilotage est un vol au plus court, la contrainte associée étant alors une contrainte de temps de vol.
La fonction de récompense FR s’incrémente, à chacune d’une pluralité d’itérations, d’une grandeur suivante :
[Math 1 ]
RT + RO A + CP où RT est une récompense de trajectoire, par exemple égale à 0 si la position de l’aéronef n’est pas sur un point de passage, 10 si la position de l’aéronef est sur un point de passage, et -2 si l’aéronef a raté le point de passage, c’est-à-dire si la position de l’aéronef est dans un environnement d’un point de passage sans être sur le point de passage, et ROA est la récompense d’orientation d’accélération, par exemple égale à 1 - ABS( accélérationX + l)-3), où ABS() désigne la fonction valeur absolue et accélérationX désigne la norme de l’accélération de l’aéronef en prenant en compte la gravité, et
CP est la contrainte de pilotage.
Par exemple, la grandeur accélérationX désigne la norme de l’accélération selon l’axe reliant le bout de deux ailes de l’aéronef. ROA est donc une contrainte permettant d’éviter des passagers de l’aéronef ne soient pas projetés sur le côté de l’aéronef lors d’un virage. ROA permet donc que l’aéronef ait un comportement plus ou moins réaliste.
Selon le premier exemple, la contrainte de pilotage est par exemple égale à :
[Math 2]
CP = projection . 10-14 où projection est le produit scalaire entre la vitesse de l’avion et la vitesse du vent.
Cette contrainte de pilotage permet donc d’accroitre la valeur de la fonction de récompense lorsque l’aéronef est porté par le vent et que sa consommation de carburant est réduite.
Selon le deuxième exemple, la contrainte de pilotage est par exemple égale à :
[Math 3]
CP = y où y est une constante positive.
Selon le deuxième exemple, à chaque itération, la fonction de récompense FR est incrémentée de la valeur y. Ainsi, le parcours qui minimise la fonction de récompense est celui qui minimise le nombre d’itérations, i.e. celui qui conduit au vol le plus court.
Le tableau de correspondance de commandes comprend des intervalles de valeurs pour les commandes de pilotage Ci, et associe à chaque intervalle une action de pilotage.
De manière analogue, le tableau de correspondance d’états comprend des intervalles de valeurs pour les variables d’état VEi et associe à chacun desdits intervalles, un état de l’aéronef.
De manière analogue également, le tableau de correspondance d’effets sur la contrainte de pilotage comprend des intervalles de valeurs, pour les valeurs de la contrainte de pilotage CPi et associe à chacun desdits intervalles, un effet à court terme sur la contrainte de pilotage et un effet à long terme sur la contrainte de pilotage.
La fonction de récompense préliminaire FRP est une fonction prenant en entrée les variables d’état VEi et fournissant en sortie une valeur numérique. A titre d’exemple, la fonction de récompense préliminaire FRP s’incrémente elle à chaque itération de la grandeur suivante : [Math 4]
RT + ROA + RA où RT est la récompense de trajectoire définie ci-dessus,
ROA est la récompense d’orientation d’accélération définie ci-dessus, et
RA est une récompense d’alignement, par exemple égale à 1 + (alignement + 2)“3, où alignement est le produit scalaire entre la vitesse de l’aéronef et la direction entre l’aéronef et le prochain point de passage.
Le module d’application 50 est configuré pour appliquer au modèle de pilotage, un algorithme d’apprentissage par renforcement à partir de la fonction de récompense. En particulier, le module d’application 50 est configuré pour recevoir les variables d’état VEi de l’aéronef et déterminer les commandes de pilotage Ci à une pluralité d’instants de réception successifs T.
A cet effet, le module d’application 50 comprend une première unité de réception 81 , une première unité de modification 82, et une première unité de détermination 83.
La première unité de réception 81 est configurée pour recevoir, depuis le dispositif de génération 20, les variables d’état VEi de l’aéronef à des instants de réception successifs T.
La première unité de modification 82 est configurée pour modifier, pour chaque instant de réception T, le modèle à partir d’une évaluation de la fonction de récompense à partir des variables d’état VEi. Pour évaluer la fonction de récompense, la première unité de modification 82 est configurée pour calculer la valeur de contrainte de pilotage à partir des variables d’état VEi, par exemple selon l’une des équations (2) ou (3).
La première unité de modification 82 est en outre configurée pour modifier les poids des connexions du modèle à partir de l’évaluation de la fonction de récompense. Une telle modification est connue de l’homme du métier comme étant une technique classique d’application de l’algorithme d’apprentissage par renforcement.
La première unité de détermination 83 est configurée pour déterminer, pour chaque instant de réception T i; les commandes de pilotage Ci à partir du modèle de pilotage modifié et des variables d’état VEi reçues audit instant de réception Pour cela, la première unité de détermination 83 est configurée pour appliquer le modèle modifié, aux variables d’état reçues VEi et à chaque instant de réception Ti; et pour déterminer les commandes de pilotage Ci dudit instant de réception T comme étant égales aux valeurs en sortie du modèle modifié.
Optionnellement, le module d’application 50 est configuré pour effectuer un nombre prédéterminé d’itérations, chaque itération comprenant la réception des variables d’état VEi de l’aéronef par la première unité de réception 81 , la modification du modèle par la première unité de modification 82, et la détermination des commandes de pilotage Ci par la première unité de détermination 83.
Avantageusement, le module d’application 50 est configuré pour ne pas appliquer l’apprentissage par renforcement du modèle de pilotage pour un nombre prédéfini d’itérations. Ainsi, à l’issu du nombre prédéfini d’itérations, les poids de convergence n’ont généralement pas atteint une convergence. Le module d’application 50 est préférentiellement configuré pour effectuer une exploration des trajectoires possibles de l’aéronef en prenant en compte des modifications du modèle à partir de la fonction de récompense, et notamment de la contrainte de pilotage comprise dans la fonction de récompense.
Le module d’application 50 est en outre configuré pour stocker, dans une base de données et pour chaque instant de réception Ti, les variables d’état reçues VEi, les commandes de pilotage déterminées Ci, et préférentiellement les valeurs de la contrainte de pilotage CPi calculées au cours de l’évaluation de la fonction de récompense.
Le module de formation 55 est configuré pour former au moins un groupe de données à partir des variables d’état reçues VEi, des commandes déterminées Ci et optionnellement des valeurs de la contrainte de pilotage calculées CPi. Chaque groupe de données comprend les variables d’état VEi, les commandes de pilotage Ci, et optionnellement les valeurs de la contrainte de pilotage CPi correspondant à des instants de réception successifs Ti.
Le module de formation 55 est par exemple configuré pour former une pluralité de groupes de données. A titre d’exemple, le module d’application est configuré pour appliquer aux commandes de pilotage déterminées Ci par le module d’application 50, un algorithme de classification, afin de classer, dans des classes prédéfinies CL, lesdites commandes de pilotage déterminées Ci pour chaque instant de réception Ti. Les classes prédéfinies CL sont par exemple comprises dans le tableau de correspondance de commandes.
A cet effet, le module de formation 55 est par exemple configuré pour comparer, pour chaque instant de réception T, les commandes de pilotage Ci aux intervalles de valeurs du tableau de correspondance de commandes, afin de déterminer à quelle classe CL correspondent les commandes de pilotage Ci dudit instant T.
Le module de formation 55 est par exemple configuré pour regrouper les commandes de pilotage Ci appartenant à une même classe respective CL et dont les instants de réception Ti forment une suite d’instants de réception T consécutifs la plus longue possible.
En référence à la figure 2, plusieurs commandes de pilotages Ci, C2, C3, C4, C5, C22, C23, C24, C45, C46, C47 appartiennent à une première classe CL1. Ces commandes Ci, C2, C3, C4, C5, C22, C23, C24, C45, C46, C47 correspondent respectivement aux instants de réception T suivants : Ti, T2, T3, T4, T5, T22, T23, T24, T45, T46, T47. Le module de formation 55 est configuré pour alors regrouper entre elles, premièrement les commandes de pilotages suivantes: Ci, C2, C3, C4, C5, deuxièmement les commandes de pilotage suivantes : C22, C23, C24, et troisièmement les commandes de pilotage suivantes : C4s, C46, C47.
Le module de formation 55 est en outre configuré pour former chaque groupe de données comme comprenant une pluralité de commandes Ci regroupées respectives, les variables d’état VEi correspondantes et optionnellement les valeurs de la contrainte de pilotage correspondantes CPi. On entend par « variables d’état VEi correspondantes », les variables d’état VEi reçues aux instants de réception T correspondant aux commandes G regroupées. De manière analogue, on entend par « valeurs de la contrainte de pilotage correspondantes CPi » les valeurs de la contrainte de pilotage CPi calculées pour les instants de réception T correspondant aux commandes Ci regroupées.
Ainsi, dans l’exemple précédent de la figure 2, un premier groupe de données comprend les commandes suivantes : Ci, C2, C3, C4, C5, les variables d’état VEi correspondantes : VEi, VE2, VE3, VE4, VE5, et optionnellement les valeurs de la contrainte de pilotage correspondantes : CPi, CP2, CP3, CP4, CP5.
De manière analogue, un deuxième groupe de données comprend les commandes suivantes : C22, C23, C24, les variables d’état VEi correspondantes : VE22, VE23, VE24, et optionnellement les valeurs de la contrainte de pilotage correspondantes : CP22, CP23, CP24. Un troisième groupe comprend les commandes suivantes : C4s, C46, C47, les variables d’état VEi correspondantes : VE45, VE46, VE47, et optionnellement les valeurs de la contrainte de pilotage correspondantes : CP4s, CP46, CP47.
Le module d’affectation 60 est configuré pour affecter, pour le ou chaque groupe de données : au moins un état de l’aéronef aux variables d’état VEi, au moins une action de pilotage aux commandes de pilotage Ci et optionnellement au moins un effet sur la contrainte de pilotage aux valeurs de la contrainte de pilotage CPi.
Le module d’affectation 60 est par exemple configuré pour affecter aux commandes Ci de chaque groupe, l’au moins une action à partir du tableau de correspondance de commandes. Le tableau de correspondance de commandes comprend par exemple pour chaque classe prédéfinie CL au moins une action. Le module d’affectation 60 est préférentiellement configuré pour affecter aux commandes Ci de chaque groupe, la ou les actions correspondant à la classe CL de ces commandes Ci dans le tableau de correspondance de commandes. Chaque action est par exemple un libellé textuel décrivant l’action de pilotage effectuée par des commandes de pilotage respectives Ci. A titre d’exemple, les actions sont choisies parmi le groupe consistant en :
- un virage vers la droite de l’aéronef,
- un virage vers la gauche de l’aéronef,
- une trajectoire rectiligne de l’aéronef,
- une ascension de l’aéronef,
- une descente de l’aéronef,
- une accélération de l’aéronef,
- une décélération de l’aéronef, et
- un maintien de la vitesse de l’aéronef.
Il est clair que le module d’affectation 60 est par exemple configuré pour affecter plusieurs actions aux commandes Ci d’un groupe de données.
Sur la figure 3 est représenté un parcours de l’aéronef selon une trajectoire comprenant un premier PPi, un deuxième PP2, un troisième PP3, et un quatrième PP4 points de passage. Dans l’exemple de la figure 3, une portion 85 en trait pointillé du parcours correspond à un groupe de données.
Dans l’exemple de la figure 3, le module d’affectation 60 est par exemple configuré pour affecter aux commandes Ci du groupe correspondant à la portion 85, les actions suivantes: un virage vers la gauche de l’aéronef, une descente de l’aéronef, et une décélération de l’aéronef.
Le module d’affectation 60 est par exemple configuré pour affecter aux variables d’état VEi, l’au moins un état à partir du tableau de correspondance d’états. Chaque état est par exemple un libellé textuel décrivant l’état de l’aéronef en fonction des variables d’état VEi dudit aéronef. A titre d’exemple, les états sont choisis parmi le groupe consistant en :
- l’aéronef est très proche du prochain point de passage,
- l’aéronef est proche du prochain point de passage,
- l’aéronef est loin du prochain point de passage,
- l’aéronef est très loin du prochain point de passage,
- l’aéronef est très à gauche du prochain point de passage,
- l’aéronef est légèrement à gauche du prochain point de passage,
- l’aéronef est légèrement à droite du prochain point de passage,
- l’aéronef est très à droite du prochain point de passage,
- l’aéronef est très haut-dessus du prochain point de passage,
- l’aéronef est légèrement au-dessus du prochain point de passage,
- l’aéronef est légèrement en dessous du prochain point de passage, - l’aéronef est très en dessous du prochain point de passage,
- l’aéronef est très proche du point de passage suivant le prochain point de passage,
- l’aéronef est proche du point de passage suivant le prochain point de passage,
- l’aéronef est loin du point de passage suivant le prochain point de passage,
- l’aéronef est très loin du point de passage suivant le prochain point de passage,
- l’aéronef est très à gauche du point de passage suivant le prochain point de passage,
- l’aéronef est légèrement à gauche du point de passage suivant le prochain point de passage,
- l’aéronef est légèrement à droite du point de passage suivant le prochain point de passage,
- l’aéronef est très à droite du point de passage suivant le prochain point de passage,
- l’aéronef est très haut-dessus du point de passage suivant le prochain point de passage,
- l’aéronef est légèrement au-dessus du point de passage suivant le prochain point de passage,
- l’aéronef est légèrement en dessous du point de passage suivant le prochain point de passage,
- l’aéronef est très en dessous du point de passage suivant le prochain point de passage,
- l’aéronef est très proche du précédent point de passage,
- l’aéronef est proche du précédent point de passage,
- l’aéronef est loin du précédent point de passage,
- l’aéronef est très loin du précédent point de passage,
- l’aéronef est très à gauche du précédent point de passage,
- l’aéronef est légèrement à gauche du précédent point de passage,
- l’aéronef est légèrement à droite du précédent point de passage,
- l’aéronef est très à droite du précédent point de passage,
- l’aéronef est très au-dessus du précédent point de passage,
- l’aéronef est légèrement au-dessus du précédent point de passage,
- l’aéronef est légèrement en dessous du précédent point de passage,
- l’aéronef est très en dessous du précédent point de passage,
- l’angle de roulis est fortement négatif,
- l’angle de roulis est faiblement négatif,
- l’angle de roulis est faiblement positif,
- l’angle de roulis est fortement positif, - l’angle de tangage est fortement négatif,
- l’angle de tangage est faiblement négatif,
- l’angle de tangage est faiblement positif,
- l’angle de tangage est fortement positif,
- le vent au contact de l’aéronef est très fort,
- le vent au contact de l’aéronef est fort,
- le vent au contact de l’aéronef est faible,
- le vent au contact de l’aéronef est très faible,
- l’aéronef a le vent de face,
- l’aéronef a le vent de derrière,
- l’aéronef a le vent de côté par la droite, et
- l’aéronef a le vent de côté par la gauche.
Le module d’affectation 60 est par exemple configuré en outre pour calculer, pour chaque groupe, une moyenne temporelle de la valeur de chaque variable d’état VEi du groupe. On entend par « moyenne temporelle », la moyenne calculée entre tous les instants de réception Ti des variables d’état VEi du groupe.
Le module d’affectation 60 est configuré pour ensuite affecter aux variables d’état VEi de chaque groupe, l’au moins un état par comparaison des valeurs moyennes des variables d’état VEi aux intervalles correspondant à chaque état dans le tableau de correspondance d’états.
Il est clair que le module d’affectation 60 est par exemple configuré pour affecter plusieurs états aux variables d’état VEi d’un groupe de données.
Dans l’exemple de la figure 3, le module d’affectation 60 est par exemple configuré pour affecter aux variables d’état VEi du groupe correspondant à la portion 85, les états suivants: l’aéronef est proche du prochain point de passage, l’aéronef est légèrement au- dessus du prochain point de passage, l’aéronef est légèrement à droite du prochain point de passage, l’aéronef est loin du précédent point de passage, l’aéronef est très au-dessus du précédent point de passage, l’aéronef est très à droite du précédent point de passage, le sinus de l’angle de roulis est fortement négatif, le vent au contact de l’aéronef est faible, et l’aéronef a le vent de face.
Le module d’affectation 60 est en outre configuré pour générer, pour chaque groupe, une règle de pilotage comportant l’au moins un état et l’au moins une action de pilotage, affectés au groupe.
Dans l’exemple de la figure 3, la règle de pilotage générée pour la portion 85, est par exemple : - lorsque l’aéronef est proche du prochain point de passage, l’aéronef est légèrement au-dessus du prochain point de passage, l’aéronef est légèrement à droite du prochain point de passage, l’aéronef est loin du précédent point de passage, l’aéronef est très au- dessus du précédent point de passage, l’aéronef est très à droite du précédent point de passage, le sinus de l’angle de roulis est fortement négatif, le vent au contact de l’aéronef est faible, et l’aéronef a le vent de face,
- effectuer : un virage vers la gauche de l’aéronef, une descente de l’aéronef, et une décélération de l’aéronef.
En complément facultatif, le module d’affectation 60 est en outre configuré pour calculer, pour chaque groupe, une première différence entre la valeur de la contrainte de pilotage CPd au dernier instant de réception Td parmi les instants de réception T des variables d’état VEi du groupe de données et la valeur de la contrainte de pilotage CPp au premier instant de réception Tp parmi les instants de réception T des variables d’état VEi du groupe de données.
Le premier instant de réception Tp est le premier, i.e. le plus ancien des instants de réception T des variables d’état VEi du groupe. De manière analogue, le denier instant de réception Td est le dernier, i.e. le plus récent des instants de réception T i des variables d’état VEi du groupe.
Le module d’affectation 60 est configuré pour alors affecter aux valeurs de la contrainte de pilotage CPi, un effet à court terme sur la contrainte de pilotage, à partir de la première différence et du tableau de correspondance de contraintes de pilotage. Chaque effet à court terme est par exemple un libellé textuel décrivant si la ou les actions mises en œuvre, lorsque l’aéronef est dans le ou les états, est positif ou non sur la contrainte de pilotage dans un délai bref. A titre d’exemple, les effets à court terme sont choisis parmi un groupe consistant en :
- un effet à court terme très négatif sur la contrainte de pilotage,
- un effet à court terme négatif sur la contrainte de pilotage,
- un effet à court terme positif sur la contrainte de pilotage, et
- un effet à court terme très positif sur la contrainte de pilotage.
Selon ce même complément facultatif, le module d’affectation 60 est en outre configuré pour calculer, pour chaque groupe, une deuxième différence entre la valeur de la contrainte de pilotage CPM à un instant de réception Tfinai postérieur au dernier instant de réception Td parmi les instants de réception T des variables d’état VEi du groupe de données et la valeur de la contrainte de pilotage CPp au premier instant de réception Tp parmi les instants de réception T des variables d’état VEi du groupe de données. L’instant de réception postérieur Tfinai audit dernier instant de réception Td est par exemple le dernier instant de réception T de la simulation de trajectoire. Autrement dit, ledit instant Tfinai est le dernier instant de réception Ti avant que l’aéronef ne soit repositionné au point initial par le module de génération 20. Sur la figure 3, cet instant Ti est celui pour lequel l’aéronef a atteint le quatrième point de passage PP4, ou position finale de la trajectoire.
Le module d’affectation 60 est configuré alors pour affecter, aux valeurs de la contrainte de pilotage CPi, un effet à long terme sur la contrainte de pilotage, à partir de la deuxième différence et du tableau de correspondance de contraintes de pilotage. De manière analogue aux effets à court terme, chaque effet à long terme est par exemple un libellé textuel décrivant si la ou les actions mises en œuvre, lorsque l’aéronef est dans le ou les états, est positif ou non sur la contrainte de pilotage, dans un délai long. A titre d’exemple, les effets à long terme sont choisis parmi le groupe consistant en :
- un effet à long terme très négatif sur la contrainte de pilotage,
- un effet à long terme négatif sur la contrainte de pilotage,
- un effet à long terme positif sur la contrainte de pilotage, et
- un effet à long terme très positif sur la contrainte de pilotage.
Selon ce complément facultatif, le module d’affectation 60 est configuré pour générer, lors de la génération de la règle de pilotage, la règle comprenant en outre l’effet à court terme sur la contrainte de pilotage et l’effet à long terme sur la contrainte de pilotage. Ainsi, dans l’exemple de la figure 3, la règle générée pour la portion 85 est par exemple :
- lorsque l’aéronef est proche du prochain point de passage, l’aéronef est légèrement au-dessus du prochain point de passage, l’aéronef est légèrement à droite du prochain point de passage, l’aéronef est loin du précédent point de passage, l’aéronef est très au- dessus du précédent point de passage, l’aéronef est très à droite du précédent point de passage, le sinus de l’angle de roulis est fortement négatif, le vent au contact de l’aéronef est faible, et l’aéronef a le vent de face,
- effectuer : un virage vers la gauche de l’aéronef, une descente de l’aéronef, et une décélération de l’aéronef,
- a un effet sur la contrainte pilotage : très positif à court terme, et négatif à long terme.
Le module de transmission 65 est configuré pour transmettre, au dispositif d’affichage 30, les règles de pilotage en vue de leur affichage à destination du pilote 15 de l’aéronef.
Le module d’entraînement 70 est configuré pour entraîner le modèle de pilotage au suivi de la trajectoire par application d’un algorithme préliminaire d’apprentissage par renforcement au modèle, à partir de la fonction préliminaire de récompense. Le module d’entraînement 70 comprend une deuxième unité de réception 91 , une deuxième unité de modification 92, et une deuxième unité de détermination 93. La deuxième unité de réception 91 est analogue à la première unité de réception 81 . Les variables d’état reçues par la deuxième unité de réception 91 sont appelées variables d’état préliminaires dans la présente description. La deuxième unité de réception 91 est alors configurée pour recevoir les variables d’état préliminaires à des instants de réception préliminaires.
La deuxième unité de modification 92 est sensiblement analogue à la première unité de modification 82 à l’exception que la deuxième unité de modification 92 est configurée pour modifier le modèle à partir d’une évaluation de la fonction de récompense préliminaire à la place de la fonction de récompense.
La deuxième unité de détermination 93 est analogue à la première unité de détermination 83. Les commandes de pilotage déterminées par la deuxième unité de détermination 93 est configurée pour déterminer sont appelées commandes préliminaires dans la présente description. La deuxième unité de détermination 93 est alors configurée pour déterminer lesdites commandes préliminaires.
Contrairement au module d’application 50, le module d’entrainement 70 est configuré pour recevoir les variables d’état préliminaires, modifier le modèle et déterminer les commandes préliminaires à plusieurs instants préliminaires successifs jusqu’à ce que l’algorithme préliminaire d’apprentissage par renforcement converge, c’est-à-dire jusqu’à ce que les poids du modèle ne soient plus sensiblement modifiés par la deuxième unité de modification 92. Le modèle est alors dit entraîné.
Le module d’entrainement 70 est en outre configuré pour transmettre, au module d’application 50, le modèle entrainé. Le module d’application 50 est alors configuré pour appliquer l’algorithme d’apprentissage par renforcement au modèle entrainé plutôt qu’au modèle acquis par le module d’acquisition 45.
Le module d’identification 75 est optionnellement configuré pour, si les règles comprennent l’au moins un effet sur la contrainte, identifier au moins une règle principale parmi la pluralité de règles générées. A cet effet, le module d’identification 75 est avantageusement configuré pour appliquer un algorithme d’analyse de fréquence de variables, connu en soi, à partir d’un seuil de support prédéfini et d’un seuil de confiance prédéfini.
Le support quantifie la fréquence d’apparition d’un triplet « état(s), action(s), effet(s) sur la contrainte » parmi l’ensemble des règles. Le support est compris en 0 et 1. Par exemple, si le seuil de support est égal à 0,5, alors chaque triplet « état(s), action(s), effet(s) sur la contrainte » de la ou des règles principales apparait au moins dans 50% des règles de pilotage. La confiance quantifie la fréquence d’apparition d’un triplet « état(s), action(s), effet(s) sur la contrainte » parmi les règles comprenant le ou lesdits états et la ou lesdites actions. La confiance est comprise entre 0 et 1. Par exemple, si le seuil de confiance est égal à 0,9, alors pour chaque règle principale « état(s), action(s), effet(s) sur la contrainte », la ou les effets sur la contrainte apparaissent dans au moins 90% des règles de pilotage comprenant le ou lesdits états et la ou lesdites actions.
Ainsi, le module d’identification 75 est configuré pour identifier, parmi les règles de pilotage, la ou les règles principales dont le support et la confiance sont supérieurs aux seuils respectifs.
Optionnellement, le module d’identification 75 est en outre configuré pour, si les règles comprennent l’au moins effet sur la contrainte, comparer les effets sur la contrainte de chaque règle principale à un seuil prédéterminé respectif, pour obtenir au moins une règle filtrée. Le seuil prédéterminé est par exemple égal à : effet très positif, effet positif ou effet négatif. Plus spécifiquement, le module d’identification 75 est optionnellement configuré pour sélectionner uniquement les règles principales dont au moins un des effets sur la contrainte de pilotage est supérieur ou égal au seuil prédéterminé. Il est considéré dans la présente description que « très positif est supérieur ou égal à : très positif, positif, négatif, et très négatif », « positif est supérieur ou égal à : positif, négatif, et très négatif » et « négatif est supérieur ou égal à : négatif, et très négatif ».
Si le dispositif d’aide 25 comprend le module d’identification 75, le module de transmission 65 est configuré pour transmettre, au dispositif d’affichage 30, uniquement chaque règle principale ou chaque règle filtrée.
Le dispositif d’affichage 30 est par exemple embarqué dans l’aéronef si l’aéronef est un avion, ou déporté de l’aéronef si l’aéronef est un drone.
Le dispositif d’affichage 30 comprend par exemple un écran d’affichage 95 et optionnellement une unité de traitement 97 connectée à l’écran d’affichage 95.
L’écran d’affichage 95 est par exemple propre à afficher un contenu transmis par l’unité de traitement 97.
L’unité de traitement 97 est configurée pour recevoir, depuis le dispositif d’aide 25, au moins une règle de pilotage. L’unité de traitement 97 est par exemple configurée pour mettre en œuvre un dialogueur (de l’anglais chatbot) propre à interagir avec le pilote 15. L’unité de traitement 97 est configurée pour afficher, sur l’écran d’affichage 95, la ou les règles de pilotage reçues, par exemple suite à une interaction avec le pilote 15.
Le fonctionnement du système d’assistance 10, et plus particulièrement du dispositif d’aide 25, va maintenant être décrit en référence à la figure 4 représentant un organigramme d’un procédé d’aide au pilotage selon l’invention. Lors d’une étape d’acquisition 110, le module d’acquisition 45 acquiert le modèle de pilotage de l’aéronef, la fonction de récompense ; ainsi qu’optionnellement le tableau de correspondance de commandes, le tableau de correspondance d’états, la fonction de récompense préliminaire et le tableau de correspondance d’effets sur la contrainte de pilotage.
Optionnellement, lors d’une étape 120 d’entrainement du modèle, le module d’entrainement 70 applique au modèle l’algorithme préliminaire d’apprentissage par renforcement, afin de l’entrainer au suivi de la trajectoire.
Pour cela, lors d’une première sous-étape de réception 122, la deuxième unité de réception 91 reçoit, depuis le dispositif de génération 20 et aux instants de réception préliminaires, les variables d’état préliminaires de l’aéronef.
Pour chaque instant de réception préliminaire, lors d’une première sous-étape de modification 124, la deuxième unité de modification 92 évalue la fonction de récompense préliminaire à partir des variables d’état préliminaires reçues, par exemple à l’aide de l’équation (4) précédente. La deuxième unité de modification 92 modifie ensuite les poids du modèle, en fonction de la valeur de la fonction de récompense préliminaire, selon une technique connue en soi.
Pour chaque instant de réception préliminaire, lors d’une première sous-étape de détermination 126, la deuxième unité de détermination 93 détermine les commandes préliminaires, par exemple en appliquant le modèle modifié aux variables d’état préliminaires reçues.
Pour chaque instant de réception préliminaire, le module d’entrainement 70 transmet au dispositif de génération 20, les commandes préliminaires déterminées. Le module d’entrainement 70 attend ensuite de recevoir, depuis le dispositif de génération 20, les variables d’état préliminaires de l’aéronef à l’instant de réception préliminaire suivant. Puis, le module d’entrainement 70 réitère les premières sous-étapes de réception 122, de modification 124 et de détermination 126.
Lors de l’étape d’entrainement 120, les sous-étapes de réception 122, de modification 124 et de détermination 126 sont réitérées jusqu’à atteindre la convergence du modèle.
A l’issue de l’étape d’entrainement 120, le modèle est entrainé pour le suivi de la trajectoire.
Puis, lors d’une étape d’application 130, le module d’application 50 applique au modèle entrainé l’algorithme d’apprentissage par renforcement.
Pour cela, lors d’une deuxième sous-étape de réception 132, la première unité de réception 81 reçoit, depuis le dispositif de génération 20 et aux instants T de réception successifs, les variables d’état VEi de l’aéronef. Puis, pour chaque instant de réception Ti, lors d’une deuxième sous-étape de modification 134, la première unité de modification 82 évalue la fonction de récompense à partir des variables d’états VEi reçues, par exemple selon l’équation (1 ). A cet effet, la première unité de modification 82 calcule la valeur de la contrainte de pilotage CPi, par exemple selon l’une des équations (2) ou (3). Ensuite, de manière analogue à la première sous-étape de modification 124, la première unité de modification 82 modifie les poids du modèle entraîné selon une technique connue en soi.
Pour chaque instant de réception Ti, lors d’une deuxième sous-étape de détermination 136, la première unité de détermination 83 détermine les commandes de pilotage Ci en appliquant le modèle modifié aux variables d’état VEi; par exemple de manière analogue à ce qui est effectué lors de la première sous-étape de détermination 126.
Lors de l’étape d’application 130, pour chaque instant de réception Ti, le module d’application 50 transmet au dispositif de génération 20, les commandes de pilotage Ci déterminées. Le module d’application 50 attend ensuite de recevoir, depuis le dispositif de génération 20, les variables d’état VEi de l’aéronef à l’instant de réception T suivant. Puis, le module d’application 50 réitère les deuxièmes sous-étapes de réception 132, de modification 134 et de détermination 136.
Pour chaque instant de réception T, les variables d’état VEi reçues, les commandes de pilotages Ci déterminées, et avantageusement la valeur de la contrainte de pilotage CPi calculée, sont stockées dans la base de données.
Lors de l’étape d’application 130, les deuxièmes sous-étapes de réception 132, de modification 134 et de détermination 136 sont réitérées jusqu’à atteindre le nombre prédéfini d’itérations.
Alternativement, si le procédé ne comprend pas l’étape facultative d’entrainement 120, le module d’application 50 applique, lors de l’étape d’application 130, l’algorithme d’apprentissage par renforcement au modèle acquis lors de l’étape d’acquisition 110.
Lors d’une étape de formation 140, le module de formation 55 forme au moins un groupe comprenant, pour des instants de réception T consécutifs, les variables d’état VEi reçues, les commandes de pilotage Ci déterminées ; et optionnellement les valeurs calculées de la contrainte de pilotage CPi.
A cet effet, le module de formation 55 compare par exemple, les commandes de pilotage Ci déterminées pour chaque instant de réception Ti; aux intervalles de valeurs du tableau de correspondance de commandes, afin de déterminer à quelle classe CL correspondent les commandes de pilotage Ci déterminées audit instant Ti. Puis, le module de formation 55 regroupe les commandes de pilotage Ci appartenant à une même classe respective CL et déterminées pour les instants de réception Ti formant la suite la plus longue possible d’instants de réception Ti consécutifs.
Puis, le module de formation 55 forme chaque groupe en incluant les commandes de pilotages Ci regroupées, les variables d’état VEi correspondantes ; et optionnellement les valeurs de contrainte de pilotage CPi correspondantes.
Lors d’une étape d’affectation 150, le module d’affectation 60 affecte, pour chaque groupe, au moins une action aux commandes de pilotage Ci du groupe, par exemple en comparant les commandes de pilotage Ci aux intervalles de valeurs du tableau de correspondance d’actions.
Le module d’affectation 60 affecte également, pour chaque groupe, au moins un état aux variables d’état VEi du groupe. Pour cela, le module d’affectation calcule par exemple la moyenne temporelle de la valeur de chaque variable d’état VEi du groupe et compare chaque moyenne temporelle aux intervalles de valeurs du tableau de correspondance d’états.
Si chaque groupe comprend en outre les valeurs de la contrainte de pilotage CPi, le module d’affectation 60 calcule, pour chaque groupe, la première et la deuxième différence comme décrit précédemment. Le module d’affectation 60 affecte ensuite aux valeurs de la contrainte de pilotage CPi, l’effet à court terme sur la contrainte et l’effet à long terme sur la contrainte, en comparant les première et deuxième différences aux intervalles de valeurs du tableau de correspondance d’effets sur la contrainte.
Le module d’affectation 60 génère alors, pour chaque groupe, une règle en y incluant le ou les états du groupe, la ou les actions du groupe ; et optionnellement l’effet à court terme sur la contrainte et l’effet à long terme sur la contrainte du groupe.
En complément facultatif, si les règles comprennent au moins un effet respectif sur la contrainte de pilotage, le module d’identification 75 identifie, lors d’une étape d’identification 160, l’au moins une règle principale parmi les règles générées. Par exemple, le module d’identification 75 applique aux règles générées l’algorithme d’analyse de fréquence de variables, défini ci-dessus.
Lors de l’étape d’identification 160, le module d’identification 75 compare facultativement les effets sur la contrainte de pilotage compris dans chaque règle principale au seuil prédéterminé, pour obtenir au moins une règle filtrée. Ainsi, seules les règles principales ayant un effet sur la contrainte très positif, au moins positif ou au moins négatif font par exemple partie des règles filtrées. Lors d’une étape de transmission 170, le module de transmission 65 transmet au dispositif d’affichage 30 les règles générées ; ou le cas échéant l’au moins une règle principale ou l’au moins une règle filtrée.
Puis, le dispositif d’affichage 30 affiche, à destination du pilote 15, les règles qui lui ont été transmises par le module de transmission 65.
Par exemple, au cours du vol de l’aéronef, le pilote 15 interagit avec le dialogueur mis en œuvre par l’unité de traitement 97, pour connaître le ou les effets sur la contrainte de pilotage de la mise en œuvre d’une ou plusieurs actions de pilotage respectives dans le ou les états dans lesquels se trouve l’aéronef. L’unité de traitement 97 commande alors l’affichage sur l’écran d’affichage 95, de tout ou partie de la règle de pilotage comprenant la ou lesdites actions et le ou lesdits états.
Avec le procédé d’aide selon l’invention, les règles de pilotage générées sont alors certifiables.
En outre, grâce à l’algorithme d’apprentissage par renforcement, le procédé est capable de générer un grand nombre de règles de pilotage sans qu’une intervention humaine ne soit nécessaire. Ainsi, le risque que le pilote 15 soit confronté à un état de l’aéronef absent des règles de pilotage Ci est limité.
De plus, la détermination des commandes de pilotage Ci selon l’algorithme d’apprentissage par renforcement permet de déterminer des commandes de pilotage qui n’auraient pas été prises en considération par un opérateur humain, conduisant à la génération de règles supplémentaires qu’un opérateur humain n’aurait pas envisagées.
L’étape de formation 140 permet de former des groupes de données suffisamment petits, i.e. réduits, pour qu’à chaque groupe puisse correspondre une action ou plusieurs actions réalisées simultanément. En outre, l’étape de formation 140 permet de former des groupes de données suffisamment grands, i.e. importants, pour que la ou les actions affectées aux commandes Ci dudit groupe aient un effet quantifiable sur la contrainte de pilotage.
En outre, l’étape facultative d’entrainement 120 permet de fournir en entrée de l’étape d’application 130, le modèle de pilotage entraîné au suivi de la trajectoire. Or, le suivi de la trajectoire est la mission principale de l’aéronef. Ainsi, lors de l’étape d’application 130, le modèle continuera à suivre sensiblement la trajectoire, tout en introduisant de légères variations de direction ayant un effet sensiblement positif sur la contrainte de pilotage.
L’étape facultative d’identification 160 permet d’extraire depuis les règles générées, uniquement les actions et états les plus représentatifs, c’est-à-dire, ceux qui ont été le plus souvent rencontrés, i.e. les plus fréquents, et dans lesquels le pilote 15 peut avoir confiance. De plus, cette étape 160 permet de limiter le nombre de règles à transmettre au dispositif d’affichage 30, tout en conservant les éléments principaux des règles générées.

Claims

25 REVENDICATIONS
1. Procédé d’aide au pilotage d’un aéronef, le procédé étant mis en œuvre par un dispositif électronique d’aide au pilotage et comprenant les étapes suivantes :
- acquisition (1 10) d’un modèle de pilotage de l’aéronef et d’une fonction de récompense (FR) comportant une contrainte de pilotage (CP),
- application (130), au modèle de pilotage, d’un algorithme d’apprentissage par renforcement à partir de la fonction de récompense (FR), l’étape d’application (130) comportant les sous-étapes suivantes :
+ une réception (122) de variable(s) d’état (VEi) de l’aéronef à des instants de réception (Ti),
+ pour chaque instant de réception (Ti), une modification (124) du modèle à partir d’une évaluation de la fonction de récompense (FR) à partir de la ou des variables d’état (VEi) reçues audit instant de réception (Ti), et
+ pour chaque instant de réception (Ti), une détermination (126) de commandes de pilotage (Ci) à partir du modèle de pilotage modifié et des variables d’état (VEi) reçues audit instant (T),
- formation (140) de groupe(s) de données à partir des variables d’état reçues (VEi) et des commandes déterminées (Ci), chaque groupe de données comprenant les variables d’état (VEi) et les commandes (Ci) correspondant à une pluralité d’instants de réception successifs (Ti),
- pour le ou chaque groupe de données, affectation (150) d’au moins un état de l’aéronef aux variables d’état (VEi) et d’au moins une action de pilotage aux commandes (Ci), pour générer une règle de pilotage comportant l’au moins un état et l’au moins une action de pilotage,
- transmission (170) d’au moins une règle de pilotage à un dispositif d’affichage en vue de son affichage à destination d’un pilote (15) de l’aéronef.
2. Procédé selon la revendication 1 , dans lequel, lors de l’étape d’application (130), pour chaque instant de réception (T), une valeur de la contrainte de pilotage (CPi) est calculée au cours de l’évaluation de la fonction de récompense, lors de l’étape de formation de groupe(s), chaque groupe de données comprend en outre les valeurs de la contrainte de pilotage (CPi) associées aux variables d’état (VEi) et aux commandes (Ci), lors de l’étape d’affectation, pour le ou chaque groupe, au moins un effet sur la contrainte est affecté aux valeurs de la contrainte de pilotage (CPi) du groupe, chaque règle comprenant en outre l’au moins un effet sur la contrainte.
3. Procédé selon la revendication précédente, dans lequel lors de l’étape d’affectation (150) une pluralité de règles est formée, le procédé comprenant en outre entre l’étape d’affectation (150) et l’étape de fourniture, une étape d’identification (160) de règle(s) principale(s) parmi la pluralité de règles de pilotage générées par application d’un algorithme d’analyse de fréquences de variables, lors de l’étape de transmission (170), seule(s) la ou les règles principales étant transmises.
4. Procédé selon les revendication 2 et 3, dans lequel l’étape d’identification (160) comprend en outre la comparaison du ou des effets sur la contrainte de chaque règle principale à un seuil prédéterminé pour obtenir au moins une règle filtrée, chaque règle filtrée étant une règle principale respective comprenant au moins un effet sur la contrainte supérieur ou égal au seuil, lors de l’étape de transmission (170), seule(s) la ou les règles filtrées étant de préférence fournies en vue de leur affichage à destination du pilote (15) de l’aéronef.
5. Procédé selon l’une quelconque des revendications 2 à 4, dans lequel l’étape d’affectation (150) comprend pour chaque groupe de données :
- un calcul d’une première différence entre la valeur de la contrainte de pilotage (CPd) au dernier instant de réception (Td) parmi les instants de réception (Ti) des variables d’état (VEi) du groupe de données, et la valeur de contrainte de pilotage (CPp) au premier instant de réception (Tp) parmi les instants de réception (Ti) des variables d’état (VEi) du groupe de données,
- un calcul d’une deuxième différence entre la valeur de la contrainte de pilotage (CPfinai) à un instant de réception (Tfinai) postérieur au dernier instant de réception (Td) parmi les instants de réception (T) des variables d’état (VEi) du groupe de données, et la valeur de contrainte de pilotage (CPp) au premier instant de réception (Tp) parmi les instants de réception (Ti) des variables d’état (VEi) du groupe de données,
- une affectation, aux valeurs de la contrainte de pilotage (CPi), d’un effet à court terme sur la contrainte de pilotage, à partir de la première différence et d’un tableau de correspondance de contraintes de pilotage, et - une affectation, aux valeurs de la contrainte de pilotage (CPi), d’un effet à long terme sur la contrainte de pilotage, à partir de la deuxième différence et du tableau de correspondance de contraintes de pilotage.
6. Procédé selon l’une quelconque des revendications précédentes, dans lequel l’étape de formation (140) comprend :
- classification des commandes de pilotage déterminées (Ci) parmi une pluralité de classes (CL) prédéfinies et via un tableau de correspondance de commandes,
- pour chaque classe (CL), regroupement des commandes de pilotage (Ci) appartenant à ladite classe (CL) et déterminées pour les instants de réception (Ti) formant une suite d’instants de réception (Ti) consécutifs la plus longue possible, pour former au moins un ensemble de commandes (Ci) regroupées, et
- pour chaque ensemble de commandes (Ci) regroupées, formation d’un groupe respectif comprenant les commandes (Ci) dudit ensemble et les variables d’état (VEi) reçues aux instants de réception (Ti) pour lesquels lesdites commandes (Ci) ont été déterminées.
7. Procédé selon l’une quelconque des revendications précédentes, dans lequel lors de l’étape d’acquisition (110), une fonction de récompense préliminaire (FRP) est acquise, le procédé comprenant en outre, entre l’étape d’acquisition (1 10) et l’étape d’application (130), une étape d’entrainement (120) du modèle par application d’un algorithme préliminaire d’apprentissage par renforcement sur le modèle de pilotage à partir de la fonction de récompense préliminaire (FRP), l’étape d’entrainement (130) comportant une modification (134) du modèle à partir d’une évaluation de la fonction de récompense préliminaire (FRP).
8. Procédé selon l’une quelconque des revendications précédentes, dans lequel les variables d’état (VEi) sont choisies parmi le groupe consistant en : un angle de roulis de l’aéronef, un angle de tangage de l’aéronef, un angle de lacet de l’aéronef, une vitesse de l’aéronef, une accélération de l’aéronef, une vitesse du vent au contact de l’aéronef, une orientation du vent par rapport à l’aéronef, et une position de l’aéronef.
9. Produit programme d’ordinateur comprenant des instructions logicielles qui, lorsqu’elles sont mises en œuvre par un ordinateur, mettent en œuvre un procédé selon l’une quelconque des revendications précédentes. 28
10. Dispositif électronique (25) d’aide au pilotage d’un aéronef, comprenant :
- un module d’acquisition (45) configuré pour acquérir un modèle de pilotage de l’aéronef et une fonction de récompense comprenant une contrainte de pilotage,
- un module d’application (50) configuré pour appliquer au modèle de pilotage, un algorithme d’apprentissage par renforcement à partir de la fonction de récompense, le module d’application comportant :
+ une unité de réception (81 ) configurée pour recevoir au moins une variable d’état (VEi) de l’aéronef à des instants de réception (Ti),
+ une unité de modification (82) configurée pour modifier, pour chaque instant de réception (Ti), le modèle à partir d’une évaluation de la fonction de récompense à partir de la ou des variables d’état (VEi), et
+ une unité de détermination (83) configurée pour déterminer, pour chaque instant de réception (T), des commandes de pilotage (Ci) à partir du modèle de pilotage modifié et des variables d’état (VEi) reçues audit instant de réception (T),
- un module de formation (55) configuré pour former au moins un groupe de données à partir des variables d’état reçues (VEi) et des commandes déterminées (Ci), chaque groupe de données comprenant les variables d’état (V) et les commandes déterminée (Ci) correspondant à une pluralité d’instants de réceptions successifs (T),
- un module d’affectation (60) configuré pour affecter, pour le ou chaque groupe de données, au moins un état de l’aéronef aux variables d’état reçues (VEi) et au moins une action de pilotage aux commandes déterminées (Ci), et pour générer une règle de pilotage comportant l’au moins un état et l’au moins une action de pilotage, et
- un module de transmission (65) configuré pour transmettre, à un dispositif d’affichage (30), au moins une règle de pilotage en vue de son affichage à destination d’un pilote (15) de l’aéronef.
11. Système (10) d’assistance au pilotage d’un aéronef comprenant un dispositif électronique d’aide au pilotage (25) selon la revendication précédente et un dispositif d’affichage (30) configuré pour recevoir au moins une règle de pilotage depuis le dispositif d’aide au pilotage (25) et pour afficher ladite règle à destination du pilote (15) de l’aéronef.
EP22835436.1A 2021-12-17 2022-12-15 Procédé d'aide au pilotage d'un aéronef, dispositif électronique d'aide au pilotage et système d'assistance associés Pending EP4449391A2 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR2113848A FR3130956B1 (fr) 2021-12-17 2021-12-17 Procédé d’aide au pilotage d’un aéronef, dispositif électronique d’aide au pilotage et système d’assistance associés
PCT/EP2022/086202 WO2023111205A2 (fr) 2021-12-17 2022-12-15 Procédé d'aide au pilotage d'un aéronef, dispositif électronique d'aide au pilotage et système d'assistance associés

Publications (1)

Publication Number Publication Date
EP4449391A2 true EP4449391A2 (fr) 2024-10-23

Family

ID=81345944

Family Applications (1)

Application Number Title Priority Date Filing Date
EP22835436.1A Pending EP4449391A2 (fr) 2021-12-17 2022-12-15 Procédé d'aide au pilotage d'un aéronef, dispositif électronique d'aide au pilotage et système d'assistance associés

Country Status (4)

Country Link
US (1) US20250037587A1 (fr)
EP (1) EP4449391A2 (fr)
FR (1) FR3130956B1 (fr)
WO (1) WO2023111205A2 (fr)

Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US11107001B1 (en) * 2018-09-26 2021-08-31 Rockwell Collins, Inc. Systems and methods for practical autonomy decision controller
US20210269171A1 (en) * 2020-03-02 2021-09-02 Nabtesco Corporation Aircraft vibration detecting device, aircraft vibration detecting method, and non-transitory computer-readable storage medium storing thereon program for aircraft vibration detection

Family Cites Families (9)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
FR3055433B1 (fr) * 2016-08-26 2018-09-21 Thales Procede d'aide au pilotage d'un aeronef, produit programme d'ordinateur et dispositif d'aide au pilotage associes
EP3422130B8 (fr) * 2017-06-29 2023-03-22 The Boeing Company Procédé et système de fonctionnement autonome d'un aéronef
JP6884685B2 (ja) * 2017-12-08 2021-06-09 三菱重工業株式会社 制御装置、無人システム、制御方法及びプログラム
WO2020079702A1 (fr) * 2018-10-18 2020-04-23 Telefonaktiebolaget Lm Ericsson (Publ) Vol en formation de véhicules aériens sans pilote
US11984038B2 (en) * 2019-03-26 2024-05-14 Sony Corporation Concept for designing and using an UAV controller model for controlling an UAV
US20210124352A1 (en) * 2019-10-29 2021-04-29 Loon Llc Systems and Methods for Navigating Aerial Vehicles Using Deep Reinforcement Learning
FR3103615B1 (fr) * 2019-11-25 2021-11-26 Thales Sa Dispositif et procede d'aide a la decision pour la gestion de conflits aeriens
US20210383706A1 (en) * 2020-06-05 2021-12-09 Apijet Llc System and methods for improving aircraft flight planning
US12094349B2 (en) * 2020-10-21 2024-09-17 The Boeing Company Optimizing flights of a fleet of aircraft using a reinforcement learning model

Patent Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US11107001B1 (en) * 2018-09-26 2021-08-31 Rockwell Collins, Inc. Systems and methods for practical autonomy decision controller
US20210269171A1 (en) * 2020-03-02 2021-09-02 Nabtesco Corporation Aircraft vibration detecting device, aircraft vibration detecting method, and non-transitory computer-readable storage medium storing thereon program for aircraft vibration detection

Also Published As

Publication number Publication date
WO2023111205A3 (fr) 2023-08-10
FR3130956A1 (fr) 2023-06-23
WO2023111205A2 (fr) 2023-06-22
FR3130956B1 (fr) 2025-05-02
US20250037587A1 (en) 2025-01-30

Similar Documents

Publication Publication Date Title
EP3873786B1 (fr) Procédé d'élaboration d'une consigne de pilotage d'un véhicule automobile
EP3671392A1 (fr) Apprentissage automatique en avionique
EP4256412A1 (fr) Système et procédé de contrôle de véhicule à base d'apprentissage machine
FR2935521A1 (fr) Procede de verification de la coherence des parametres de decollage d'un aeronef avec une longueur de piste disponible
FR3018364A1 (fr) Procede de determination d'une loi de guidage d'evitement d'obstacle par un aeronef, produit programme d'ordinateur, systeme electronique et aeronef associes
CN110879602A (zh) 基于深度学习的无人机控制律参数调节方法及系统
EP4293469B1 (fr) Procédé de gestion de la position longitudinale d'un aéronef suiveur par rapport a un aéronef meneur
WO2024218118A1 (fr) Procédé et dispositif électronique d'aide au pilotage d'un aéronef via la surveillance d'au moins un critère opérationnel, programme d'ordinateur et aéronef associés
EP3853087B1 (fr) Procede de fabrication d'un système de freinage d'un vehicule ayant recours a de la logique floue
EP3661827B1 (fr) Procédé d'élaboration d'une consigne de pilotage d'un organe de conduite d'un véhicule automobile
EP4449391A2 (fr) Procédé d'aide au pilotage d'un aéronef, dispositif électronique d'aide au pilotage et système d'assistance associés
EP3722830B1 (fr) Dispositif d'identification d'un type d'aéronef, procédé d'identification et programme d'ordinateur associés
EP4147106A1 (fr) Procédé de contrôle d'un robot-aéronef et système de contrôle correspondant
CA2935753C (fr) Systeme de pilotage automatique d'aeronef et procede associe
EP0282372B1 (fr) Système autonome de mesure cinématique pour hélicoptère
EP2038613B1 (fr) Convertisseur de commande de facteur de charge en consigne d'ecart d'assiette longitudinale
US20240303978A1 (en) Measuring the generalization ability of a trained machine learning model with respect to given measurement data
WO2022049135A1 (fr) Système électronique pour la mise en œuvre d'une fonction critique et procédé associé
EP2534642B1 (fr) Dispositif pour mettre a jour un modele photometrique
FR2985237A1 (fr) Procede et dispositif d'adaptation d'un parametre dans l'algorithme de fin de roulage d'un vehicule
FR3127616A1 (fr) Procédé de gestion d’évitement aérien
CN114026574A (zh) 在监控是否离开训练的应用范围的情况下运行可训练模块
EP3730401A1 (fr) Systeme de freinage automatique d'un aeronef
EP0500403A1 (fr) Procédé et dispositif de régulation du glissement de traction des roues motrices d'un véhicule
WO2024078965A1 (fr) Procédé de gestion automatisée de la vitesse longitudinale d'un véhicule automobile

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20240617

AK Designated contracting states

Kind code of ref document: A2

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: EXAMINATION IS IN PROGRESS

17Q First examination report despatched

Effective date: 20260323