EP4364057A1 - Procédé d'apprentissage d'un algorithme de prédiction et dispositifs associés - Google Patents

Procédé d'apprentissage d'un algorithme de prédiction et dispositifs associés

Info

Publication number
EP4364057A1
EP4364057A1 EP22744415.5A EP22744415A EP4364057A1 EP 4364057 A1 EP4364057 A1 EP 4364057A1 EP 22744415 A EP22744415 A EP 22744415A EP 4364057 A1 EP4364057 A1 EP 4364057A1
Authority
EP
European Patent Office
Prior art keywords
learning
subgroup
data
initial
algorithm
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP22744415.5A
Other languages
German (de)
English (en)
Inventor
Pierre-Yves LAGRAVE
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Thales SA
Original Assignee
Thales SA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Thales SA filed Critical Thales SA
Publication of EP4364057A1 publication Critical patent/EP4364057A1/fr
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N20/00Machine learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F17/00Digital computing or data processing equipment or methods, specially adapted for specific functions
    • G06F17/10Complex mathematical operations
    • G06F17/11Complex mathematical operations for solving equations, e.g. nonlinear equations, general mathematical optimization problems
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/0895Weakly supervised learning, e.g. semi-supervised or self-supervised learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/09Supervised learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods

Definitions

  • the present invention relates to a method for learning a prediction algorithm. It relates to a computer program product and a readable medium of information.
  • the present invention is in the field of the development of prediction algorithms that have been learned by using a machine learning technique.
  • Machine learning is referred to by many different terms such as the term “machine learning”, the term “automatic learning”, the term “artificial learning” or the term “statistical learning”. Machine learning involves using data to learn a prediction algorithm.
  • transformations can be considered for the construction of an augmented dataset, such as geometric transformations or changes of colors and/or sizes in the frame of images.
  • Applying a suite of transformations to the elements of a data set is an augmentation strategy.
  • applying random angle rotations to the elements of a set made up of images constitutes a strategy, just like applying color changes to each of the elements of the considered set.
  • the description describes a method of learning a prediction algorithm, the prediction algorithm predicting for given inputs the value of one or more outputs, the learning being implemented by using a machine learning technique, the learning method comprising the steps of:
  • initial symmetry group a symmetry group, called initial symmetry group, said group of symmetry being provided with an initial law of probability
  • the subgroup probability law a probability law, called the subgroup probability law
  • the subgroup corresponding to transformations of the inputs given to the prediction algorithm the subgroup being intended to be used to generate training data by applying the corresponding transformations to the current training dataset according to the subgroup probability law
  • the subgroup and the law subgroup probability being determined according to an optimization technique under at least one optimization constraint, the optimization technique using the initial learning data set, the initial symmetry group and the initial probability law, the at least one optimization constraint being deduced from at least one predetermined learning constraint,
  • the learning being:
  • each iteration comprising the generation step, the implementation step being carried out with only the generated data, the current learning data set used then being the set of data generated at the current iteration,
  • the learning method has one or more of the following characteristics, taken in isolation or according to all the technically possible combinations:
  • the input(s) and/or the output(s) are physical quantities corresponding to measurements from one or more sensors
  • the prediction algorithm is an image processing algorithm
  • he prediction algorithm is a pattern recognition algorithm or an image classification algorithm.
  • the at least one predetermined learning constraint is chosen from the list consisting of:
  • the optimization technique consists in minimizing under optimization constraint the difference in prediction error between the prediction algorithm obtained using data d training comprising data generated from the initial symmetry group and the initial probability law, and the prediction algorithm obtained using training data comprising data generated from the determined subgroup and from the subgroup probability distribution.
  • the optimization technique is an optimization of a quadratic target function under quadratic optimization constraints.
  • the subgroup has a dimension, at least one constraint being a limitation of at least one moment of the subgroup probability law with a bound, in particular an upper bound on the dimension of the subgroup or an upper bound on the variance of the subgroup probability distribution.
  • the initial probability law is obtained from the likelihood of the transformations associated with the initial symmetry group measured for a set of inputs corresponding to the inputs expected within the framework of a specific use of the prediction algorithm considered.
  • the initial probability law is a uniform distribution or a Gaussian distribution.
  • the initial symmetry group is a Lie group, in particular the initial symmetry group is the group of roto-translations of the plane.
  • the description also describes a computer program product comprising program instructions forming a computer program stored on a readable information medium, the computer program being loadable on a data processing unit and implementing a method learning as previously described.
  • the description also relates to a readable information medium comprising program instructions forming a computer program, the computer program being loadable on a data processing unit and implementing a learning method as previously describes when the computer program is implemented on the data processing unit.
  • FIG. 1 is a schematic representation of a system and a computer program product
  • FIG. 2 is a schematic representation of the elements of a group and of two sub-groups of the group
  • FIG. 3 is a schematic representation of the results obtained for an example of implementation of a learning process.
  • FIG. 1 A system 10 and a computer program product 12 are shown in Figure 1.
  • the interaction between the system 10 and the computer program product 12 allows the implementation of a method for learning a prediction algorithm.
  • the learning method is thus a computer-implemented method. According to the example described, it is assumed that the system 10 also implements the learned prediction algorithm.
  • System 10 is a desktop computer.
  • system 10 is a rack-mounted computer, laptop, tablet, personal digital assistant (PDA), or smartphone.
  • PDA personal digital assistant
  • the computer is adapted to operate in real time and/or is in an on-board system, in particular in a vehicle such as an airplane.
  • the system 10 comprises a calculation unit 14, a user interface 16 and a communication device 18.
  • the calculation unit 14 is an electronic circuit designed to manipulate and/or transform data represented by electronic or physical quantities in registers of the system 10 and/or memories into other similar data corresponding to physical data in the register memories or other types of display devices, transmission devices or storage devices.
  • the computing unit 14 includes a single-core or multi-core processor (such as a central processing unit (CPU), a graphics processing unit (GPU), a microcontroller, and a digital signal processor ( DSP)), a programmable logic circuit (such as an application-specific integrated circuit (ASIC), field-programmable gate array (FPGA), programmable logic device (PLD), and programmable logic arrays (PLA)), a state machine, a logic gate and discrete hardware components.
  • a single-core or multi-core processor such as a central processing unit (CPU), a graphics processing unit (GPU), a microcontroller, and a digital signal processor ( DSP)
  • a programmable logic circuit such as an application-specific integrated circuit (ASIC), field-programmable gate array (FPGA), programmable logic device (PLD), and programmable logic arrays (PLA)
  • ASIC application-specific integrated circuit
  • FPGA field-programmable gate array
  • PLD programmable logic device
  • PLA programmable logic array
  • the calculation unit 14 comprises a data processing unit 20 adapted to process data, in particular by performing calculations, memories 22 adapted to store data and a reader 24 adapted to read a computer-readable medium.
  • the user interface 16 includes an input device 26 and an output device 28.
  • the input device 26 is a device allowing the user of the system 10 to enter information or commands on the system 10.
  • input device 26 is a keyboard.
  • input device 26 is a pointing device (such as a mouse, touchpad, and tablet). graph), a voice recognition device, an eye tracker or a haptic (motion analysis) device.
  • the output device 28 is a graphical user interface, i.e. a display unit designed to provide information to the user of the system 10.
  • the output device 28 is a display screen allowing visual presentation of the output.
  • the output device is a printer, an augmented and/or virtual display unit, a speaker or other sound generating device for presenting the output in sound form, a unit producing vibrations and/or odors or a unit adapted to produce an electrical signal.
  • the input device 26 and the output device 28 are the same component forming human-machine interfaces, such as an interactive screen.
  • the communication device 18 allows unidirectional or bidirectional communication between the components of the system 10.
  • the communication device 18 is a bus communication system or an input/output interface.
  • the presence of the communication device 18 allows that, in certain embodiments, the components of the system 10 are remote from each other.
  • the computer program product 12 comprises a computer-readable medium 32.
  • the computer-readable medium 32 is a tangible device readable by the reader 24 of the calculation unit 14.
  • the computer-readable medium 32 is not a transient signal per se, such as radio waves or other freely propagating electromagnetic waves, such as light pulses or electronic signals.
  • Such a computer-readable storage medium 32 is, for example, an electronic storage device, a magnetic storage device, an optical storage device, an electromagnetic storage device, a semiconductor storage device, or any combination thereof. these.
  • computer-readable storage medium 32 is a mechanically encoded device, such as punched cards or grooved relief structures, floppy disk, hard disk, ROM (ROM), Random Access Memory (RAM), Erasable Programmable Read Only Memory (EROM), Electrically Erasable Readable Memory (EEPROM), Magneto-Optical Disk, Static Random Access Memory (SRAM), Compact Disc ( CD-ROM), a digital versatile disc (DVD), USB memory stick, floppy disk, flash memory, solid-state drive (SSD), or PC card such as a PCMCIA memory card.
  • ROM Read Only Memory
  • EROM Erasable Programmable Read Only Memory
  • EEPROM Electrically Erasable Readable Memory
  • SRAM Static Random Access Memory
  • CD-ROM Compact Disc
  • DVD digital versatile disc
  • USB memory stick floppy disk
  • SSD solid-state drive
  • PCMCIA memory card such as a PCMCIA memory card.
  • a computer program is stored on computer-readable storage medium 32.
  • the computer program includes one or more stored program instruction sequences.
  • Such program instructions when executed by data processing unit 20, cause steps of the learning process to be executed.
  • the form of program instructions is source code form, computer executable form, or any intermediate form between source code and computer executable form, such as the form resulting from source code conversion through an interpreter , assembler, compiler, linker, or locator.
  • the program instructions are microcode, firmware instructions, state definition data, integrated circuit configuration data (eg VHDL) or object code.
  • Program instructions are written in any combination of one or more languages, for example an object-oriented programming language (FORTRAN, C++, JAVA, HTML), a procedural programming language (C language for example).
  • object-oriented programming language for example
  • C++ JAVA
  • HTML JAVA
  • C language for example
  • program instructions are downloaded from an external source via a network, as is notably the case for applications.
  • the computer program product comprises a data carrier signal on which the program instructions are encoded.
  • the computer program product 12 comprises instructions which can be loaded into the data processing unit 20 and adapted to cause the execution of the method of learning a prediction algorithm when they are executed. by the data processing unit 20.
  • the execution is entirely or partially carried out either on the system 10, that is to say a single computer, or in a system distributed between several computers (including through the use of cloud computing).
  • the prediction algorithm is able to predict for given inputs the value of one or more outputs.
  • the algorithm was learned by using a machine learning technique and a training dataset.
  • the algorithm is a supervised statistical learning algorithm.
  • the prediction algorithm is, for example, a support vector machine (better known under the English name of “Support Vectors Machine”), a neural network (better known under the English name of “Neural Network”) or a tree random (better known as “Random Forest”). More generally, any type of supervised prediction algorithm is possible for the present context.
  • Such a prediction algorithm can be used for very diverse contexts such as image classification, recognition of three-dimensional shapes or decision support in the context of piloting autonomous drones.
  • the prediction algorithm takes as input and/or gives as output physical quantities corresponding to measurements from one or more sensors.
  • the algorithm is an image processing algorithm, such as a shape recognition algorithm or an image classification algorithm.
  • a statistical learning algorithm (prediction algorithm) is represented by a parametric prediction function f ⁇ :X ⁇ Y , where ⁇ e represents a set of real parameters. This corresponds, for example, to the value of the weights in a neural network with a given topology.
  • the mean risk R(f ⁇ ,X, Y) is defined as the mean of the evaluation of the relative l-differences, i.e. as follows: where E is the expectation operator and the function is a given precision metric, also called a loss function.
  • the goal of supervised statistical learning is, given the learning set, to find a solution parameter of the optimization problem following
  • quantity is called error of e and its minimization thus aims to minimize the generalization error is a set of realizations of the random variable (X, Y) the training set that allowed the derivation of the parameter
  • a group is a set G, endowed with a composition law *: G x G ⁇ G which is associative and which has a neutral element usually denoted e e G.
  • a locally compact group (G,*) is a group endowed with a locally compact topology such that the group law * and the inversion are continuous.
  • a subgroup is a subset of the group G containing the neutral element e and which is stable by the law of composition * restricted to the elements of H.
  • the quotient group G/H is also.
  • G /H is not necessarily a group and we then speak of quotient space.
  • the groups are locally compact groups, whose action on a given set S is assumed to be continuous.
  • the present method uses distributions of transformations which are represented as indicated above by elements of groups. It is therefore useful to introduce notions relating to measure theory on compact groups.
  • Haar's theorem states that, modulo a normalization constant, there exists a unique probability measure defined on the tribe B(G) of Borelians of group G and denoted ⁇ , which is non-trivial, ⁇ -additive, and invariant to left in the sense that the property is verified.
  • the Haar measure ⁇ associates an invariant volume with the subset of the group G so that the invariant volume makes it possible to define an integral for functions operating on locally compact groups using Lebesgue's theory of integration.
  • the Haar measure re-normalized to 1 which is denoted ⁇ G , defines a probability measure associated with a probability distribution called the uniform law on the group G. It should be noted that the process applies for other distributions on a given group G. By way of example, however, the following description is restricted to the case of distributions represented by measures v G absolutely continuous with respect to the Haar measure in the sense that there exists a density function p v G such that the following condition is verified:
  • the random variable (X, Y ) has symmetry properties corresponding to an invariance with respect to a given group G.
  • the fact that the image has performed a rotation does not change the fact that the image includes the given animal or not.
  • the labeling is invariant under a rotation of angle Q in the plane
  • the learning is a supervised learning and the considered learning set satisfies a symmetry property corresponding to a conditional invariance to the action of a group G as described previously.
  • the goal of a data augmentation technique is to improve the performance and robustness of a supervised statistical learning algorithm.
  • the data augmentation technique consists in adding to the initial training set samples of the form for g ⁇ G distributed according to the distribution associated with the measure v G .
  • the learning phase corresponding to a prediction function f ⁇ aims to minimize an empirical risk taking into account a weighting by the probability measure v G and allows the calculation of an estimator which is a solution to the following minimization problem:
  • the data augmentation technique can be implemented differently and in particular integrated into a stochastic gradient descent.
  • the parameter update rule in this case is given by the following formula, where is the learning rate, B t the set of indices considered for the estimation of the gradient (minibatch) and where the g i,t ⁇ G correspond to realizations of the random variable g.
  • the learning process comprises a first reception step, a second reception step, a determination step, a generation step and a learning implementation step.
  • the system 10 receives a current training data set.
  • this common training dataset depends on how the implementation step of a training is actually performed.
  • the system 10 receives at least one property of invariance of the prediction of the prediction algorithm to be learned with respect to the inputs that the prediction algorithm can take as input according to a symmetry group G .
  • Such a symmetry group G is called an initial symmetry group G.
  • the initial symmetry group G is a Lie group, in particular the initial symmetry group G is the group of roto-translations of the plane.
  • the initial symmetry group G is provided with a probability law v G , the probability law is called initial probability law v G .
  • the initial probability law v G is a uniform distribution or a Gaussian distribution.
  • the initial probability law v G is obtained from the likelihood of the transformations associated with the initial symmetry group G measured for a set of inputs corresponding to the expected inputs within the framework of a specific use of the prediction algorithm considered.
  • the initial probability law v G can be obtained from expert knowledge as to the properties to be satisfied by the prediction algorithm considered.
  • the system 10 determines a subgroup H of the initial symmetry group G.
  • the subgroup H is endowed with a probability law, called the subgroup probability law
  • the subgroup H also has a dimension (a size when it is finished)
  • the subgroup H corresponds to transformations of the inputs given to the prediction algorithm.
  • the subgroup H is, furthermore, intended to be used to generate training data by applying the corresponding transformations to the initial training dataset according to the subgroup probability law
  • the system 10 determines the subgroup H and the subgroup probability law F H according to an optimization technique under at least one optimization constraint.
  • the optimization technique uses the initial training dataset, the initial symmetry group G and the initial probability distribution
  • Each optimization constraint is the mathematical translation of at least one constraint on the practical implementation of learning or learning constraint, as well as on the deployment of the trained algorithm on a target architecture.
  • the system on which the trained algorithm is deployed (possibly confused with the system 10) being a physical system
  • its capacities are limited, in particular in terms of memory and quantity of operations which can be carried out in a given time.
  • constraints to be taken into account during the learning of the first example are exogenous since the constraints are linked to the hardware capabilities of the deployment architecture.
  • the data augmentation method translates in practice into an increase in the learning time and/or a deterioration in the convergence of the training process.
  • the time required for learning and its convergence can be relevant constraints.
  • At least one predetermined learning constraint is chosen from the list consisting of the memory footprint of the learned algorithm, the execution time of the learned algorithm on a predetermined system, the amount of calculation that can be carried out on a system predetermines on which the learned algorithm is intended to be used, a confidentiality constraint of certain data, a security constraint, the degree of robustness of the learned algorithm to modifications of the inputs and the training time of the prediction algorithm.
  • the learning constraints are supplied during a supply step.
  • the optimization constraints deduced from the learning conditions are known and simply used in the formulation of the optimization technique.
  • the optimization technique consists in minimizing under constraints the difference in theoretical prediction error between a first prediction algorithm and a second prediction algorithm.
  • the first prediction algorithm is obtained using training data comprising data generated from the initial symmetry group G and the initial probability law
  • the second prediction algorithm is using training data including data generated from the determined subgroup H and the subgroup probability law and not the initial probability law like the first algorithm.
  • the optimization technique is an optimization of a quadratic target function under quadratic constraints.
  • the optimization technique uses a constraint which is a limitation of at least one moment of the subgroup probability law with a terminal.
  • the bound is an upper bound on the variance of the subgroup probability distribution H.
  • the previous constraint can be replaced by using an upper bound on the size (or dimension) of the subgroup H.
  • the system 10 generates data using the determined subgroup H, the subgroup probability law and the entire current training dataset.
  • the system 10 thus obtains generated data. During the step of implementing learning, the system 10 learns the prediction algorithm by implementing learning using the data generated.
  • learning uses an iterative data generation technique.
  • each iteration includes the build step.
  • the implementation step is carried out with only the generated data.
  • the current training dataset used is then the set of data generated at the current iteration.
  • the first example corresponds to training the algorithm by generating data on the fly at each iteration of the gradient descent.
  • System 10 uses the generation step for this at each iteration, without dependency on the previous iteration.
  • the term “stochastic gradient descent” is sometimes used.
  • learning uses a data set formed by the set of generated data and an initial data set.
  • the initial dataset is used as the current training dataset.
  • the capacity of the learning algorithm must be increased in order to avoid under-learning phenomena, this dimension also leading to an increase training time, inference running time, as well as the memory footprint of the algorithm.
  • the intelligent choice of the subgroup H and of the measurement of the subgroup v H is to allow a minimization of the risk of error generated by the under-increase.
  • C( f ⁇ ) is a vector function associating several performance indicators with the prediction function f ⁇ , such as the training and inference times, or the memory footprint of the corresponding trained algorithm
  • C 0 a vector of associated values representing the operational constraints considered.
  • constraints represented by C 0 can contain restrictions on the form of the measurement of the subgroup v H , such as for example a limit in terms of variance for questions of convergence.
  • an intelligent choice of the subgroup H and the measure of the subgroup v H consists in solving in an optimal way the following condition:
  • the learning process is a tooled data sub-augmentation process for training supervised statistical learning algorithms.
  • the learning process is based on the use of a data augmentation technique consisting of adding samples to the initial learning set in order to improve the accuracy and robustness of the prediction algorithm to be learned.
  • the present method allows the calculation of a data under-augmenting strategy aimed at maximizing the robustness of a supervised statistical learning algorithm with respect to a given group of symmetries, within the framework of the compliance with previously established operational constraints.
  • the process uses a formalism from group theory.
  • the method uses the notions of subgroups and distributions on these sets in order to build, via the resolution of an under-constrained optimization problem, a data under-increase strategy making it possible to obtain a compromise between the incorporation of symmetries within an algorithm and the various operational constraints associated with the targeted application.
  • the method makes it possible to implement a data augmentation technique involving a certain number of algorithmic prerequisites (learning capacity of the algorithm envisaged, number of iterations in the optimization) by determining them and intelligently reducing to make them compatible with the exogenous constraints associated with a given operational application (such as the memory footprint of the trained algorithm or the computation time).
  • the proposed process allows a simple formalization of the considered problem and its resolution then becomes easily achievable by the usual numerical optimization tools.
  • the learning method is a method of learning a prediction algorithm able to be implemented by a real system on a data set of restricted size .
  • the goal is to build a prediction algorithm f ⁇ robust to rotations of its inputs.
  • the group G is that of plane rotations, denoted SO( 2), which can be represented by the matrix group recalled below, where the group law * corresponds to matrix multiplication and is the angle rotation matrix Q given by:
  • FIG. 2 proposes a representation of examples of subgroups H k as defined above.
  • the circle corresponds to the set of elements of the group of plane rotations denoted SO( 2)
  • the dotted points correspond to the set of elements of the subgroup H 18
  • the hatched points correspond to the set of elements of subgroup H 7 .
  • the size of the augmentation set is constrained. This translates into the existence of an upper bound K 0 for the cardinality (size) of the subgroups H k .
  • the convergence must be fast enough. It is possible to translate this constraint as an upper bound ⁇ 0 for the variance of the distribution associated with the measure v Hk which is to be determined.
  • V denotes the variance operator
  • the previous problems are nonlinear problems, whose target function and constraints are quadratic, and can be solved via numerical optimization techniques such as quadratic optimization .
  • the solution obtained is thus a solution making it possible to obtain a good convergence and a size of the subgroup compatible with the computing capacities of the system 10 while ensuring a relatively good uniform robustness.
  • the learning process thus makes it possible to build a data augmentation technique compatible with exogenous operational constraints, such as for example the memory footprint of the trained algorithm, its execution time on the targeted architecture or its degree robustness to modifications of these inputs and to use this data augmentation technique for training prediction algorithms by a machine learning technique.
  • the learning method is compatible with any type of learning or use thereof and is particularly suitable for the design and training of algorithms integrated in embedded systems, for which a certain number operational constraints must be taken into account right from the algorithmic design phase.

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Theoretical Computer Science (AREA)
  • Mathematical Physics (AREA)
  • General Physics & Mathematics (AREA)
  • Data Mining & Analysis (AREA)
  • Software Systems (AREA)
  • General Engineering & Computer Science (AREA)
  • Artificial Intelligence (AREA)
  • Evolutionary Computation (AREA)
  • Computing Systems (AREA)
  • Mathematical Analysis (AREA)
  • Mathematical Optimization (AREA)
  • Computational Mathematics (AREA)
  • Pure & Applied Mathematics (AREA)
  • Computational Linguistics (AREA)
  • General Health & Medical Sciences (AREA)
  • Molecular Biology (AREA)
  • Biophysics (AREA)
  • Biomedical Technology (AREA)
  • Health & Medical Sciences (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Databases & Information Systems (AREA)
  • Algebra (AREA)
  • Operations Research (AREA)
  • Medical Informatics (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Management, Administration, Business Operations System, And Electronic Commerce (AREA)
  • Data Exchanges In Wide-Area Networks (AREA)

Abstract

Procédé d'apprentissage d'un algorithme de prédiction et dispositifs associés La présente invention concerne un procédé d'apprentissage d'un algorithme de prédiction, l'apprentissage étant mis en œuvre par une technique d'apprentissage machine, le procédé comportant les étapes de: - réception d'un jeu de données d'apprentissage courant, - réception d'une propriété d'invariance de la prédiction de l'algorithme par rapport aux entrées selon un groupe de symétrie initiale muni d'une loi de probabilité initiale, - détermination d'un sous-groupe du groupe initial muni d'une loi de probabilité de sous-groupe et destiné à appliquer des transformations au jeu courant, selon une technique d'optimisation utilisant le jeu courant, le groupe initial et la loi initiale sous une contrainte d'optimisation déduite de contraintes prédéterminées, - génération de données à l'aide du sous-groupe déterminé, de la loi du sous-groupe et de l'ensemble du jeu courant, et - mise en œuvre d'un apprentissage de l'algorithme utilisant les données générées.

Description

Procédé d’apprentissage d’un algorithme de prédiction et dispositifs associés
DOMAINE DE L’INVENTION
La présente invention concerne un procédé d’apprentissage d’un algorithme de prédiction. Elle se rapporte à un produit programme d’ordinateur et un support lisible d’informations.
ARRIERE-PLAN TECHNOLOGIQUE DE L’INVENTION
La présente invention se situe dans le domaine de la mise au point d’algorithmes de prédiction ayant été appris par utilisation d’une technique d’apprentissage machine.
L’apprentissage machine est désigné par de nombreux termes différents comme le terme anglais de « machine learning », le terme « apprentissage automatique », le terme « apprentissage artificiel » ou encore le terme « apprentissage statistique ». L’apprentissage machine consiste à utiliser des données pour apprendre un algorithme de prédiction.
Toutefois, cela implique de disposer d’un jeu de données très important, ce qui est difficile en pratique.
Pour cela, il est connu des techniques d’augmentation des données d’un ensemble de données.
Selon le type de données, différentes transformations peuvent être envisagées pour la construction d’un jeu de données augmenté, comme par exemple des transformations géométriques ou encore des changements de couleurs et/ ou de tailles dans le cadre d’images.
L’application d’une suite de transformations aux éléments d’un ensemble de données constitue une stratégie d’augmentation. Ainsi, appliquer des rotations d’angles aléatoires aux éléments d’un ensemble constitué d’images constitue une stratégie, tout comme celle consistant à appliquer des changements de couleur à chacun des éléments de l’ensemble considéré.
Cependant, une telle approche n’est souvent pas viable en pratique du fait de la présence de contraintes exogènes, comme par exemple des restrictions sur l’empreinte mémoire de l’algorithme entraîné, sur son temps d’exécution sur l’architecture cible ou encore sur son degré de robustesse à des modifications de ses entrées.
RESUME DE L’INVENTION Il existe donc un besoin pour un procédé d’apprentissage d’un algorithme de prédiction apte à être mis en œuvre par un système réel sur un jeu de données de taille restreinte.
A cet effet, la description décrit un procédé d’apprentissage d’un algorithme de prédiction, l’algorithme de prédiction prédisant pour des entrées données la valeur d’une ou plusieurs sorties, l’apprentissage étant mis en œuvre par utilisation d’une technique d’apprentissage machine, le procédé d’apprentissage comportant les étapes de :
- réception d’un jeu de données d’apprentissage courant,
- réception d’au moins une propriété d’invariance de la prédiction de l’algorithme de prédiction à apprendre par rapport aux entrées que l’algorithme de prédiction peut prendre en entrée selon un groupe de symétrie, dit groupe de symétrie initial, ledit groupe de symétrie étant muni d’une loi de probabilité initiale,
- détermination d’un sous-groupe du groupe de symétrie initial, le sous-groupe étant muni d’une loi de probabilité, dite loi de probabilité de sous-groupe, le sous-groupe correspondant à des transformations des entrées données à l’algorithme de prédiction, le sous-groupe étant destiné à être utilisé pour générer des données d’apprentissage par application des transformations correspondantes au jeu de données d’apprentissage courant selon la loi de probabilité de sous-groupe, le sous- groupe et la loi de probabilité de sous-groupe étant déterminés selon une technique d’optimisation sous au moins une contrainte d’optimisation, la technique d’optimisation utilisant le jeu de données d’apprentissage initial, le groupe de symétrie initial et la loi de probabilité initiale, l’au moins une contrainte d’optimisation étant déduite d’au moins une contrainte d’apprentissage prédéterminée,
- génération de données à l’aide du sous-groupe déterminé, de la loi de probabilité de sous-groupe et de l’ensemble du jeu de données d’apprentissage courant, pour obtenir des données générées, et
- mise en œuvre d’un apprentissage de l’algorithme de prédiction utilisant les données générées, l’apprentissage étant :
- soit un apprentissage utilisant une technique de génération de données itérative, chaque itération comprenant l’étape de génération, l’étape de mise en œuvre étant réalisée avec uniquement les données générées, le jeu de données d’apprentissage courant utilisé étant alors l’ensemble des données générées à l’itération courante,
- soit un apprentissage utilisant un jeu de données formé par l’ensemble des données générées et d’un jeu de données initial, le jeu de données initial étant utilisé comme jeu de données d’apprentissage courant. Selon des modes de réalisation particuliers, le procédé d’apprentissage présente une ou plusieurs des caractéristiques suivantes, prise(s) isolément ou selon toutes les combinaisons techniquement possibles :
- la ou les entrée(s) et/ou la ou les sortie(s) sont des grandeurs physiques correspondant à des mesures issues d’un ou de plusieurs capteurs, l’algorithme de prédiction est un algorithme de traitement d’images, l’algorithme de prédiction est un algorithme de reconnaissance de forme ou un algorithme de classification d’images. l’au moins une contrainte d’apprentissage prédéterminée est choisie dans la liste constituée de :
- l’empreinte mémoire de l’algorithme appris,
- le temps d’exécution de l’algorithme appris sur un système prédéterminé,
- la quantité de calcul réalisable sur un système prédétermine sur lequel l’algorithme appris est destiné à être utilisé,
- une contrainte de confidentialité de certaines données,
- une contrainte de sécurité, le degré de robustesse de l’algorithme appris à des modifications des entrées, et
- le temps d’entraînement de l’algorithme de prédiction. au moins contrainte est le temps d’entraînement de l’algorithme de prédiction, la technique d’optimisation consiste à minimiser sous contrainte d’optimisation la différence d’erreur de prédiction entre l’algorithme de prédiction obtenu à l’aide de données d’apprentissage comprenant des données générées à partir du groupe de symétrie initial et de la loi de probabilité initiale, et l’algorithme de prédiction obtenu à l’aide de données d’apprentissage comprenant des données générées à partir du sous-groupe déterminé et de la loi de probabilité de sous- groupe. plusieurs contraintes d’optimisation sont prises en compte dans la technique d’optimisation. la technique d’optimisation est une optimisation d’une fonction cible quadratique sous des contraintes d’optimisation quadratiques.
- le sous-groupe présente une dimension, au moins une contrainte étant une limitation d’au moins un moment de la loi de probabilité de sous-groupe avec une borne, notamment une borne supérieure sur la dimension du sous-groupe ou une borne supérieure sur la variance de la loi de probabilité de sous-groupe.
- la loi de probabilité initiale est obtenue à partir de la vraisemblance des transformations associées au groupe de symétrie initial mesurée pour un ensemble d’entrées correspondant aux entrées attendues dans le cadre d’une utilisation spécifique de l’algorithme de prédiction considéré.
- la loi de probabilité initiale est une distribution uniforme ou une distribution gaussienne.
- le groupe de symétrie initial est un groupe de Lie, notamment le groupe de symétrie initial est le groupe des roto-translations du plan.
La description décrit aussi un produit programme d’ordinateur comportant des instructions de programme formant un programme d’ordinateur mémorisé sur un support lisible d’informations, le programme d’ordinateur étant chargeable sur une unité de traitement de données et mettant en œuvre un procédé d’apprentissage tel que précédemment décrit.
La description se rapporte aussi à un support lisible d’informations comportant des instructions de programme formant un programme d’ordinateur, le programme d’ordinateur étant chargeable sur une unité de traitement de données et mettant en œuvre un procédé d’apprentissage tel que précédemment décrit lorsque le programme d’ordinateur est mis en œuvre sur l’unité de traitement de données.
BREVE DESCRIPTION DES FIGURES
Des caractéristiques et avantages de l’invention apparaîtront à la lecture de la description qui va suivre, donnée uniquement à titre d’exemple non limitatif, et faite en référence aux dessins annexés, sur lesquels :
- la figure 1 est une représentation schématique d’un système et d’un produit programme d’ordinateur,
- la figure 2 est une représentation schématique des éléments d’un groupe et de deux sous-groupes du groupe, et
- la figure 3 est une représentation schématique des résultats obtenus pour un exemple de mise en œuvre d’un procédé d’apprentissage.
DESCRIPTION DETAILLEE DE MODES DE REALISATION PREFERES
DESCRIPTION DU SYSTEME
Un système 10 et un produit programme d’ordinateur 12 sont représentés sur la figure 1.
L’interaction entre le système 10 et le produit programme d’ordinateur 12 permet la mise en œuvre d’un procédé d’apprentissage d’un algorithme de prédiction. Le procédé d’apprentissage est ainsi un procédé mis en œuvre par ordinateur. Selon l’exemple décrit, on suppose que le système 10 implémente aussi l’algorithme de prédiction appris.
Toutefois, dans de multiples applications, ce système d’implémentation sera différent du système qui met en œuvre le procédé d’apprentissage. Ceci pourra amener des contraintes spécifiques à prendre en compte.
Dans chacun des cas, le système d’implémentation confondu ou non avec le système 10 présente des caractéristiques similaires à ce qui va maintenant être décrit.
Le système 10 est un ordinateur de bureau. En variante, le système 10 est un ordinateur monté sur un rack, un ordinateur portable, une tablette, un assistant numérique personnel (PDA) ou un smartphone.
Dans des modes de réalisation spécifiques, l'ordinateur est adapté pour fonctionner en temps réel et/ou est dans un système embarqué, notamment dans un véhicule tel qu'un avion.
Dans le cas de la figure 1 , le système 10 comprend une unité de calcul 14, une interface utilisateur 16 et un dispositif de communication 18.
L’unité de calcul 14 est un circuit électronique conçu pour manipuler et/ou transformer des données représentées par des quantités électroniques ou physiques dans des registres du système 10 et/ou des mémoires en d'autres données similaires correspondant à des données physiques dans les mémoires de registres ou d'autres types de dispositifs d'affichage, de dispositifs de transmission ou de dispositifs de mémorisation.
En tant qu’exemples spécifiques, l’unité de calcul 14 comprend un processeur monocœur ou multicœurs (tel qu’une unité de traitement centrale (CPU), une unité de traitement graphique (GPU), un microcontrôleur et un processeur de signal numérique (DSP)), un circuit logique programmable (comme un circuit intégré spécifique à une application (ASIC), un réseau de portes programmables in situ (FPGA), un dispositif logique programmable (PLD) et des réseaux logiques programmables (PLA)), une machine à états, une porte logique et des composants matériels discrets.
L’unité de calcul 14 comprend une unité de traitement de données 20 adaptée pour traiter des données, notamment en effectuant des calculs, des mémoires 22 adaptées à stocker des données et un lecteur 24 adapté à lire un support lisible par ordinateur.
L'interface utilisateur 16 comprend un dispositif d'entrée 26 et un dispositif de sortie 28.
Le dispositif d’entrée 26 est un dispositif permettant à l'utilisateur du système 10 de saisir sur le système 10 des informations ou des commandes.
Sur la figure 1, le dispositif d’entrée 26 est un clavier. En variante, le dispositif d’entrée 26 est un périphérique de pointage (tel qu'une souris, un pavé tactile et une tablette graphique), un dispositif de reconnaissance vocale, un oculomètre ou un dispositif haptique (analyse des mouvements).
Le dispositif de sortie 28 est une interface utilisateur graphique, c’est-à-dire une unité d’affichage conçue pour fournir des informations à l’utilisateur du système 10.
Sur la figure 1, le dispositif de sortie 28 est un écran d’affichage permettant une présentation visuelle de la sortie. Dans d'autres modes de réalisation, le dispositif de sortie est une imprimante, une unité d'affichage augmenté et/ou virtuel, un haut-parleur ou un autre dispositif générateur de son pour présenter la sortie sous forme sonore, une unité produisant des vibrations et/ou des odeurs ou une unité adaptée à produire un signal électrique.
Dans un mode de réalisation spécifique, le dispositif d'entrée 26 et le dispositif de sortie 28 sont le même composant formant des interfaces homme-machine, tel qu'un écran interactif.
Le dispositif de communication 18 permet une communication unidirectionnelle ou bidirectionnelle entre les composants du système 10. Par exemple, le dispositif de communication 18 est un système de communication par bus ou une interface d'entrée / sortie.
La présence du dispositif de communication 18 permet que, dans certains modes de réalisation, les composants du système 10 soient distants les uns des autres.
Selon l’exemple de la figure 1, le produit programme informatique 12 comprend un support lisible par ordinateur 32.
Le support lisible par ordinateur 32 est un dispositif tangible lisible par le lecteur 24 de l’unité de calcul 14.
Notamment, le support lisible par ordinateur 32 n'est pas un signal transitoire en soi, tels que des ondes radio ou d'autres ondes électromagnétiques à propagation libre, telles que des impulsions lumineuses ou des signaux électroniques.
Un tel support de stockage lisible par ordinateur 32 est, par exemple, un dispositif de stockage électronique, un dispositif de stockage magnétique, un dispositif de stockage optique, un dispositif de stockage électromagnétique, un dispositif de stockage à semi- conducteur ou toute combinaison de ceux-ci.
En tant que liste non exhaustive d'exemples plus spécifiques, le support de stockage lisible par ordinateur 32 est un dispositif codé mécaniquement, tel que des cartes perforées ou des structures en relief dans une gorge, une disquette, un disque dur, une mémoire morte (ROM), une mémoire vive (RAM), une mémoire effaçable programmable en lecture seule (EROM), une mémoire effaçable électriquement et lisible (EEPROM), un disque magnéto-optique, une mémoire vive statique (SRAM), un disque compact (CD-ROM), un disque numérique polyvalent (DVD), une clé USB, un disque souple, une mémoire flash, un disque à semi-conducteur (SSD) ou une carte PC telle qu'une carte mémoire PCMCIA.
Un programme d'ordinateur est stocké sur le support de stockage lisible par ordinateur 32. Le programme d'ordinateur comprend une ou plusieurs séquences d'instructions de programme mémorisées.
De telles instructions de programme, lorsqu'elles sont exécutées par l'unité de traitement de données 20, entraînent l'exécution d'étapes du procédé d’apprentissage.
Par exemple, la forme des instructions de programme est une forme de code source, une forme exécutable par ordinateur ou toute forme intermédiaire entre un code source et une forme exécutable par ordinateur, telle que la forme résultant de la conversion du code source via un interpréteur, un assembleur, un compilateur, un éditeur de liens ou un localisateur. En variante, les instructions de programme sont un microcode, des instructions firmware, des données de définition d’état, des données de configuration pour circuit intégré (par exemple du VHDL) ou un code objet.
Les instructions de programme sont écrites dans n’importe quelle combinaison d’un ou de plusieurs langages, par exemple un langage de programmation orienté objet (FORTRAN, C++, JAVA, HTML), un langage de programmation procédural (langage C par exemple).
Alternativement, les instructions du programme sont téléchargées depuis une source externe via un réseau, comme c'est notamment le cas pour les applications. Dans ce cas, le produit programme d'ordinateur comprend un signal de support de données sur lequel sont codées les instructions de programme.
Dans chaque cas, le produit programme d'ordinateur 12 comprend des instructions qui peuvent être chargées dans l'unité de traitement de données 20 et adaptées pour provoquer l'exécution du procédé d’apprentissage d’un algorithme de prédiction lorsqu'elles sont exécutées par l'unité de traitement de données 20. Selon les modes de réalisation, l'exécution est entièrement ou partiellement réalisée soit sur le système 10, c'est-à-dire un ordinateur unique, soit dans un système distribué entre plusieurs ordinateurs (notamment via l’utilisation de l’informatique en nuage).
OBJECTIF DU PROCEDE D’APPRENTISSAGE
Le fonctionnement du système 10 est maintenant décrit en référence à un exemple de mise en œuvre du procédé d’apprentissage d’un algorithme de prédiction.
L’algorithme de prédiction est propre à prédire pour des entrées données la valeur d’une ou plusieurs sorties. L’algorithme a été appris par utilisation d’une technique d’apprentissage machine et d’un jeu de données d’apprentissage.
Plus précisément, dans l’exemple qui va être décrit, l’algorithme est un algorithme d’apprentissage statistique supervisé.
Dans la suite, un tel algorithme est noté par une fonction f:X → Y où l’ensemble X désigne l’ensemble des entrées de l’algorithme et Y l’ensemble des sorties de l’algorithme.
L’algorithme de prédiction est, par exemple, une machine à vecteurs supports (plus connue sous la dénomination anglaise de « Support Vectors Machine »), un réseau de neurones (plus connu sous la dénomination anglaise de «Neural Network») ou un arbre aléatoire (plus connu sous la dénomination anglaise de « Random Forest »). Plus généralement, tout type d’algorithme de prédiction supervisé est envisageable pour le présent contexte.
Un tel algorithme de prédiction peut être utilisé pour des contextes très divers comme la classification d’images, la reconnaissance de formes tridimensionnelles ou l’aide à la décision dans le cadre du pilotage de drones autonomes.
De préférence, l’algorithme de prédiction prend en entrée et/ou donne en sortie des grandeurs physiques correspondant à des mesures issues d’un ou plusieurs capteurs.
A titre d’exemple particulier, l’algorithme est un algorithme de traitement d’images, tel un algorithme de reconnaissance de forme ou un algorithme de classification d’images.
Avant de décrire plus en détail le procédé d’apprentissage, il est intéressant d’introduire un certain nombre de notations et notions permettant de mieux comprendre ce qui va suivre.
PRESENTATION DE NOTIONS UTILES POUR LA SUITE DE LA DESCRIPTION
Apprentissage supervisé et hypothèse PAC
Soit un jeu de n données , appelé par la suite ensemble d’apprentissage. Un tel jeu de données peut être vu comme n réalisations d’une variable aléatoire (X, Y) de distribution et à valeurs dans un espace produit X x Y, où X et y sont, par exemple, deux sous espaces avec k un nombre entier positif.
Dans la suite, un algorithme d’apprentissage statistique (algorithme de prédiction) est représenté par une fonction de prédiction paramétrique fθ:X → Y , où θ e représente un ensemble de paramètres réels. Cela correspond, par exemple, à la valeur des poids dans un réseau de neurones à topologie donnée.
Dans le contexte de l’apprentissage supervisé, la qualité d’une fonction de prédiction fθ donnée est évaluée vis-à-vis de la distribution IP par utilisation du risque moyen. Le risque moyen R(fθ,X, Y) est défini moyenne d’évaluation des l-différences relatives, c’est-à-dire comme suit : où E est l’opérateur d’espérance et la fonction est une métrique de précision donnée, aussi appelée fonction de perte.
L’objectif de l’apprentissage statistique supervisé est, étant donné l’ensemble d’apprentissage, de trouver un paramètre solution du problème d’optimisation suivant
En pratique, la distribution est inconnue et ne peut être facilement inférée à partir de l’ensemble d’apprentissage. Pour pallier cette difficulté, pour l’ensemble d’apprentissage considéré, il peut être utilisé la notion de risque empirique définie comme suit :
Il convient de noter que est un estimateur sans biais R(fθ,X, Y) au sens de l’égalité suivante :
La minimisation du risque conduit ainsi à un estim paramètre θ0, qui est également convergent pour n → ∞. Cette approche est l’hypothèse PAC (renvoyant à la dénomination anglaise de « Probably Ap Correct » qui signifie littéralement « Probablement Approximativement Co stipule que les échantillons futurs pour lequel l’algorithme considéré eff prédictions sont également distribués selon la distribution
Dans ce contexte, la quantité est appelée erreur d’e et sa minimisation vise ainsi à minimiser l’erreur de généralisation est un ensemble de réalisations de la variable aléatoire (X, Y) l’ensemble d’entraînement ayant permis la dérivation du paramètre
Les notions d’erreurs d’entraînement et de généralisation se généralisen en considérant que la phase d’apprentissage s’effectue vis-à-vis d’une distri que l’algorithme entraîné sera par la suite utilisé sur des échantillons suiva distribution
En considérant tout d’abord que n → ∞ et en introduisant les notations avec l’opérateur d’espérance sous la mesure de probabilité il vient que la phase d’entraînement vise à trouver tel que : conduisant ainsi à une erreur d’entraînement
L’erreur de généralisation est quant à elle définie par
Pour n fixé, les deux erreurs sont définies à partir d’estimateurs sans biais des quantités précédentes.
Par ailleurs, le cas usuel de l’hypothèse PAC se retrouve simplement en considérant le cas
Modélisation de transformations
Dans la suite, il sera utilisé des transformations représentées par des éléments de groupes agissant sur un ensemble donné.
Ainsi, les rotations des images vues comme des éléments de seront représentées par des éléments du groupe de Lie SO( 2) opérant sur
De ce fait, il est utile de préciser les concepts mathématiques provenant de la théorie des groupes pour mieux comprendre ce qui va suivre.
Tout d’abord, un groupe est un ensemble G, muni d’une loi de composition *: G x G → G qui est associative et qui possède un élément neutre usuellement noté e e G.
De plus, chaque élément g G est inversible dans le groupe G au sens où il existe un unique élément noté g -1 tel que g * g -1 = g -1 * g = e.
Un groupe localement compact (G,*) est un groupe muni d’une topologie localement compacte telle que la loi de groupe * et l’inversion sont continues.
Un sous-groupe est un sous-ensemble du groupe G contenant l’élément neutre e et qui est stable par la loi de composition * restreinte aux éléments de H.
Parmi l’ensemble des sous-groupes du groupe G, il existe les sous-groupes normaux qui sont stables par conjugaison, au sens où
Pour un sous-groupe normal fermé H du groupe G, pour g ∈ G, l’ensemble des classes à gauche gH est défini par l’égalité suivante : g H = {g * h, h ∈ H} L’ensemble des classes d’équivalence forme lui-même un groupe, appelé groupe quotient du groupe G par H et noté G/H.
Dans le cas où le groupe G est localement compact, le groupe quotient G/H l’est également.
Lorsque H est un sous-groupe quelconque, G /H n’est pas nécessairement un groupe et on parle alors d’espace quotient.
Par ailleurs, est la projection canonique associant à un élément du groupe G sa classe dans l’espace quotient G/H.
Avec les notations précédentes, la propriété est vérifiée et l’élément est noté hg.
Enfin, un groupe G agit sur un ensemble S s’il existe un opérateur °: G x S → S compatible avec la loi de groupe * au sens où la propriété g1 ° (, g2 ° S) = (g1* g2) ° S est vérifiée.
Dans la suite, à titre d’exemple, les groupes sont des groupes localement compacts, dont l’action sur un ensemble S donné est supposée continue.
Distributions sur un groupe de transformations
Le présent procédé utilise des distributions de transformations qui sont représentées comme indiqué précédemment par des éléments de groupes. Aussi est-il utile d’introduire des notions relatives à la théorie de la mesure sur les groupes compacts.
Le Théorème de Haar stipule que, modulo une constante de normalisation, il existe une unique mesure de probabilité définie sur la tribu B(G) des boréliens du groupe G et notée μ, qui soit non-triviale, σ-additive, et invariante à gauche au sens où la propriété est vérifiée.
La mesure de Haar μ associe un volume invariant au sous-ensemble du groupe G si bien que le volume invariant permet de définir une intégrale pour les fonctions opérant sur les groupes localement compacts en utilisant la théorie de l’intégration de Lebesgue.
Une mesure de probabilité sur un groupe G est une mesure v non-négative, à valeurs réelles, s-finie et telle que v(G) = 1.
Ainsi, la mesure de Haar re-normalisée à 1 , qui est notée μG, définit une mesure de probabilité associée à une distribution de probabilité appelée loi uniforme sur le groupe G. Il convient de noter que le procédé s’applique pour d’autres distributions sur un groupe G donné. A titre d’exemple, néanmoins, la description qui suit est restreinte au cas de distributions représentées par des mesures vG absolument continues par rapport à la mesure de Haar au sens où il existe une fonction de densité pvG telle que la condition suivante est vérifiée :
Notion d’invariance
Dans la suite, il est supposé que la variable aléatoire (X, Y ) possède des propriétés de symétries correspondant à une invariance vis-à-vis d’un groupe G donné.
Par exemple, dans le cas de la classification d’une image il peut être supposé que le label y est le même pour les échantillons pour désigne la rotation d’angle θ dans le plan
De fait, s’il s’agit de déterminer si l’image représente ou non un animal donné, le fait que l’image ait effectué une rotation ne change pas le fait que l’image comporte l’animal donné ou non. Dans cet exemple particulier, la labellisation est invariante par une rotation d’angle Q dans le plan
Pour la suite, il est introduit une variable aléatoire g sur le groupe G de distribution vG, la distribution de probabilité associée à la variable aléatoire (X, Y, g) et la mesure associée.
Il vient alors :
Du fait de la modélisation par action de groupe, les variables aléatoires X et g peuvent être considérées comme indépendantes.
De même, les symétries mentionnées précédemment se traduisent par une propriété d’invariance conditionnelle de la variable aléatoire Y vis-à-vis de la variable aléatoire g.
Pour l’équation précédente, cela se traduit mathématiquement par les équations suivantes: où représente la distribution marginale de est la mesure produit de et vG. Augmentation de données
Ce paragraphe vise à expliquer ce qu’est une technique d’augmentation de données d’apprentissage, plus simplement dénommée technique d’augmentation de données dans la suite.
Pour cela, les hypothèses suivantes sont effectuées : l’apprentissage est un apprentissage supervisé et l’ensemble d’apprentissage considéré satisfait une propriété de symétrie correspondant à une invariance conditionnelle à l’action d’un groupe G telle que décrit précédemment.
Le but d’une technique d’augmentation de données est d’améliorer les performances et la robustesse d’un algorithme d’apprentissage statistique supervisé.
La technique d’augmentation de données consiste à rajouter à l’ensemble d’apprentissage initial des échantillons de la forme pour g ∈ G distribué selon la distribution associée à la mesure vG.
Dans ce contexte, la phase d’apprentissage correspondant à une fonction de prédiction fθ vise à minimiser un risque empirique prenant en compte une pondération par la mesure de probabilité vG et permet le calcul d’un estimateur qui est une solution au problème de minimisation suivant :
En pratique, la technique d’augmentation de données peut être implémentée différemment et en particulier intégrée dans une descente de gradient stochastique.
Plus précisément, la règle de mise à jour du paramètre est dans ce cas donnée par la formule suivante, où est le taux d’apprentissage (learning rate), Bt l’ensemble des indices considéré pour l’estimation du gradient (minibatch) et où les gi,t ∈ G correspondent à des réalisations de la variable aléatoire g.
En considérant n → ∞, il vient alors que les deux implémentations envisagées visent à minimiser la fonctionnelle suivante: avec l’o pérateur d’espérance sous la mesure DESCRIPTION D’UN EXEMPLE DE PROCEDE D’APPRENTISSAGE
Dans le présent exemple, le procédé d’apprentissage comporte une première étape de réception, une deuxième étape de réception, une étape de détermination, une étape de génération et une étape de mise en œuvre d’un apprentissage.
Lors de la première étape de réception, le système 10 reçoit un jeu de données d’apprentissage courant.
Comme cela sera illustré ultérieurement, ce jeu de données d’apprentissage courant dépend de la manière dont est effectivement réalisée l’étape de mise en œuvre d’un apprentissage.
Lors de la deuxième étape de réception, le système 10 reçoit au moins une propriété d’invariance de la prédiction de l’algorithme de prédiction à apprendre par rapport aux entrées que l’algorithme de prédiction peut prendre en entrée selon un groupe de symétrie G.
Un tel groupe de symétrie G est appelé groupe de symétrie initial G.
A titre d’exemple, le groupe de symétrie initial G est un groupe de Lie, notamment le groupe de symétrie initial G est le groupe des roto-translations du plan.
Le groupe de symétrie initial G est muni d’une loi de probabilité vG, la loi de probabilité est appelée loi de probabilité initiale vG.
A titre d’exemple, la loi de probabilité initiale vG est une distribution uniforme ou une distribution gaussienne.
Selon l’exemple décrit, la loi de probabilité initiale vG est obtenue à partir de la vraisemblance des transformations associées au groupe de symétrie initial G mesurée pour un ensemble d’entrées correspondant aux entrées attendues dans le cadre d’une utilisation spécifique de l’algorithme de prédiction considéré.
Selon un autre exemple, la loi de probabilité initiale vG peut être obtenue à partir de connaissance experte quant aux propriétés à satisfaire par l’algorithme de prédiction considéré.
Lors de l’étape de détermination, le système 10 détermine un sous-groupe H du groupe de symétrie initial G.
Le sous-groupe H est muni d’une loi de probabilité, dite loi de probabilité de sous- groupe
Le sous-groupe H présente également une dimension (une taille lorsque celui-ci est fini)
Le sous-groupe H correspond à des transformations des entrées données à l’algorithme de prédiction. Le sous-groupe H est, en outre, destiné à être utilisé pour générer des données d’apprentissage par application des transformations correspondantes au jeu de données d’apprentissage initial selon la loi de probabilité de sous-groupe
L’emploi d’un sous-groupe H permet ici de garantir l’existence d’une solution. Ce ne serait pas le cas si un choix aléatoire de données du groupe de symétrie initial G était effectué.
Le système 10 détermine le sous-groupe H et la loi de probabilité de sous-groupe FH selon une technique d’optimisation sous au moins une contrainte d’optimisation.
La technique d’optimisation utilise le jeu de données d’apprentissage initial, le groupe de symétrie initial G et la loi de probabilité initiale
Avantageusement, plusieurs contraintes d’optimisation sont prises en compte dans la technique d’optimisation.
Chaque contrainte d’optimisation est la traduction mathématique d’au moins une contrainte sur la mise en œuvre pratique de l’apprentissage ou contrainte d’apprentissage, ainsi que sur le déploiement de l’algorithme entraîné sur une architecture cible.
Selon un premier exemple, le système sur lequel est déployé l’algorithme entraîné (éventuellement confondu avec le système 10) étant un système physique, ses capacités sont limitées, notamment en terme de mémoire et de quantité d’opérations qui peuvent être réalisées dans un temps donné.
En ce sens, les contraintes à prendre en compte durant l’apprentissage du premier exemple sont exogènes puisque les contraintes sont liées aux capacités matérielles de l’architecture de déploiement.
A titre d’exemple de telles contraintes d’apprentissage, il peut être cité la capacité de mémorisation, la quantité de calcul réalisable par le système sur lequel est déployé l’algorithme entraîné, le temps de réponse souhaité ou encore des contraintes de liées à la confidentialité des données ou de sécurité.
Selon un deuxième exemple, le procédé d’augmentation de données se traduit en pratique par une augmentation du temps d’apprentissage et/ou une détérioration de la convergence du processus d’entraînement. Ainsi, le temps nécessaire à l’apprentissage et à la convergence de celui-ci peuvent être des contraintes pertinentes.
Des exemples de conversions de telles contraintes d’apprentissage en contraintes d’optimisation utilisables pour la technique d’optimisation sont données dans la section exemple.
En particulier, au moins une contrainte d’apprentissage prédéterminée est choisie dans la liste constituée de l’empreinte mémoire de l’algorithme appris, le temps d’exécution de l’algorithme appris sur un système prédéterminé, la quantité de calcul réalisable sur un système prédétermine sur lequel l’algorithme appris est destiné à être utilisé, une contrainte de confidentialité de certaines données, une contrainte de sécurité, le degré de robustesse de l’algorithme appris à des modifications des entrées et le temps d’entraînement de l’algorithme de prédiction.
Il convient de noter que les contraintes d’apprentissage sont prédéterminées.
Selon un exemple, les contraintes d’apprentissage sont fournies lors d’une étape de fourniture.
Selon un autre exemple, les contraintes d’optimisation déduites des conditions d’apprentissage sont connues et simplement utilisées dans la formulation de la technique d’optimisation.
Plusieurs techniques pouvant être utilisées en combinaison sont envisageables pour la technique d’optimisation.
De manière générale, la technique d’optimisation consiste à minimiser sous contraintes la différence d’erreur de prédiction théorique entre un premier algorithme de prédiction et un deuxième algorithme de prédiction.
Le premier algorithme de prédiction est obtenu à l’aide de données d’apprentissage comprenant des données générées à partir du groupe de symétrie initial G et de la loi de probabilité initiale
Le deuxième algorithme de prédiction est à l’aide de données d’apprentissage comprenant des données générées à partir du sous-groupe H déterminé et de la loi de probabilité de sous-groupe et non la loi de probabilité initiale comme le premier algorithme.
Selon un premier exemple, la technique d’optimisation est une optimisation d’une fonction cible quadratique sous contraintes quadratiques.
Selon un deuxième exemple, la technique d’optimisation utilise une contrainte qui est une limitation d’au moins un moment de la loi de probabilité de sous-groupe avec une borne.
En particulier, la borne est une borne supérieure sur la variance de la loi de probabilité de sous-groupe H.
En variante, la contrainte précédente peut être remplacée par l’utilisation d’ une borne supérieure sur la taille (ou la dimension) du sous-groupe H.
Le système 10 obtient ainsi un sous-groupe H du groupe de symétrie initial G.
Lors de l’étape de génération, le système 10 génère des données à l’aide du sous- groupe H déterminé, de la loi de probabilité de sous-groupe et de l’ensemble du jeu de données d’apprentissage courant.
Le système 10 obtient ainsi des données générées. Lors de l’étape de mise en œuvre d’un apprentissage, le système 10 apprend l’algorithme de prédiction en mettant en œuvre un apprentissage utilisant les données générées.
Selon un premier exemple, l’apprentissage utilise une technique de génération de données itérative.
Dans un tel exemple, chaque itération comprend l’étape de génération.
L’étape de mise en œuvre est réalisée avec uniquement les données générées.
Dans cet exemple, le jeu de données d’apprentissage courant utilisé est alors l’ensemble des données générées à l’itération courante.
Le premier exemple correspond à un entraînement de l’algorithme en générant des données à la volée à chaque itération de la descente de gradient. Le système 10 fait appel pour cela à l’étape de génération à chaque itération, et cela, sans dépendance par rapport à l’itération précédente. L’expression « descente de gradient stochastique » est parfois utilisée.
Selon un deuxième exemple, l’apprentissage utilise un jeu de données formé par l’ensemble des données générées et d’un jeu de données initial.
Dans un tel exemple, le jeu de données initial est utilisé comme jeu de données d’apprentissage courant.
JUSTIFICATIONS DU BON FONCTIONNEMENT DU PROCEDE DECRIT
Dans ce qui suit, il est interprété mathématiquement le procédé qui vient d’être décrit.
Il est intéressant d’observer d’abord que pour un apprentissage donné ayant des propriétés de symétrie, ce qui est représenté par le groupe G donné muni d’une loi de probabilité vG caractérisant la robustesse visée, il n’est pas toujours possible d’implémenter la stratégie d’augmentation de données présentée précédemment et cela, principalement pour des raisons de contraintes de temps de calculs et de stockage.
Tout d’abord, l’augmentation de l’ensemble d’apprentissage conduit à une augmentation du temps d’entrainement et des problématiques de convergence peuvent alors se poser.
Par ailleurs, afin de pouvoir capturer de manière adéquate les informations apportées par le jeu de données augmenté, la capacité de l’algorithme d’apprentissage doit être augmentée afin d’éviter les phénomènes de sous-apprentissage, cette dimension conduisant également à une augmentation du temps d’entraînement, du temps d’exécution de l’inférence, ainsi que de l’empreinte mémoire de l’algorithme. Ainsi, afin de pouvoir être adaptée aux contraintes opérationnelles, il peut être judicieux en pratique d’avoir une stratégie d’augmentation réduite et ceci correspond à cela l’utilisation d’un sous-groupe H du groupe G, tel que défini dans le paragraphe précédent, et d’une distribution vH sur celui-ci.
Par exemple, si G = SE( 2) est le groupe des isométries du plan et vG la distribution uniforme sur celui-ci, une stratégie réduite pourrait être de considérer un échantillonnage uniforme de H = SO( 2), c’est à dire de n’augmenter les données que par applications de rotations.
Dans ce contexte, il convient de choisir le sous-groupe H (ainsi que sa loi de probabilité associée) de manière intelligente, ce choix devant permettre notamment de réduire le biais introduit par l’utilisation d’un sous-groupe H au lieu du groupe G.
Aussi, dans un premier temps, il est utile de calculer mathématiquement le biais introduit par l’utilisation d’un sous-groupe H au lieu du groupe G.
Il est en outre fait l’hypothèse n → ∞, hypothèse qui, comme expliqué précédemment, n’implique pas de perte de généralité.
En effet, dans un tel cas, l’hypothèse PAC n’est pas satisfaite puisque seules le égalités suivantes sont considérées comme vraie.
Ainsi, il est étudié un algorithme de fonction de prédiction fθ0,H ayant été entraîné et tel que : avec une variable aléatoire à valeurs dans le sous-groupe H et associée à la mesure de probabilité l’erreur d’entraînement obtenue.
L’erreur de généralisation associée est quant à elle donnée par R La quantité peut être réécrite comme suit:
De manière similaire, il vient:
Pour ne pas surcharger les notations, il est posé θ = θ0,H dans le développement qui suit.
Evaluer le biais introduit par l’utilisation du sous-groupe H revient à comparer les erreurs d’entraînement et de généralisation ci-dessus en définissant comme suit:
Il vient ensuite : où les quantités sont définies ainsi :
Avec cette formulation mathématique, le choix intelligent du sous-groupe H et de la mesure du sous-groupe vH est de permettre une minimisation du risque d’erreur engendrée par la sous-augmentation.
Plus précisément, il convient de choisir le sous-groupe H et la mesure du sous- groupe vH en minimisant tout en respectant les contraintes opérationnelles fixées. De manière plus formelle, cela revient à résoudre le problème d’optimisation suivant: où C( fθ) est une fonction vectorielle associant plusieurs indicateurs de performance à la fonction de prédiction fθ, comme par exemple les temps d’entraînement et d’inférence, ou encore l’empreinte mémoire de l’algorithme entraîné correspondant, et C0 un vecteur de valeurs associées représentant les contraintes opérationnelles considérées.
Étant donné que l’inégalité est vérifiée, il est intéressant de s’intéresser à la minimisation du terme d’une part et du terme d’autre part.
Pour le premier terme, il est possible de dériver les formules suivantes :
En supposant dans un premier temps que la fonction de prédiction sont continues, l’inégalité suivante est obtenue: où || ||x est une norme sur l’espace X.
En utilisant la continuité de l’action de groupe et le fait que , il vient : avec Mye t My, x, G des constantes indépendantes du sous-groupe H.
Ainsi: si bien que le problème précédent revient à la minimisation du terme ∫G ce qui revient donc à chercher à minimiser l’action des éléments de l’espace quotient G /H, pondérée par la mesure vG.
Dans le cas trivial où H = G, l’espace quotient vérifie G/H = {e} et ce terme est nul.
Un tel raisonnement peut être étendu en relaxant les contraintes de continuité afin de couvrir en particulier le cas de classification pour lequel Plus précisément, il vient ici:
Il est possible de se ramener au cas précédent en supposant une continuité à droite de la fonction de prédiction fθ et en appliquant le raisonnement ci-dessus sur chacun des segments de continuité.
Du point de vue des actions de groupes considérées, les deux termes qui définissent ne font intervenir que les éléments hg et h, qui sont des éléments du sous- groupe H.
Afin de simplifier l’expression de la différence, il est possible d’écrire le premier terme comme une intégrale sur le sous-groupe H\ avec
L’inégalité utilisée plus haut devient ainsi :
Cette expression montre qu’en l’absence de contrainte particulière sur le choix d’un sous-groupe donné H, ce terme peut être annulé en choisissant la mesure du sous- groupe vH de manière adéquate. Cette manière adéquate correspond à vérifier la condition suivante :
Il convient cependant de noter que les contraintes représentées par C0 peuvent contenir des restrictions sur la forme de la mesure du sous-groupe vH, comme par exemple une limite en terme de variance pour des questions de convergence.
Ainsi, un choix intelligent du sous-groupe H et de la mesure du sous-groupe vH consiste à résoudre de manière optimale la condition suivante:
Les normes quadratiques utilisées dans l’équation précédente sont données à titre indicatif et peuvent être en pratique remplacées par d’autres normes.
Selon la forme de G et de ses sous-groupes éventuels, différentes techniques d’optimisation peuvent être envisagées.
D’où le fait que plusieurs techniques d’optimisation sont utilisées.
En outre, comme indiqué précédemment, ce choix intelligent rend possible l’emploi de formes paramétriques ce qui permet l’utilisation d’une descente de gradient classique.
AVANTAGES DU PROCEDE DAPPRENTISSAGE
Dans chacun des cas, le procédé d’apprentissage est un procédé outillé de sous- augmentation de données pour l’entraînement d’algorithmes d’apprentissage statistique supervisé. Le procédé d’apprentissage repose sur l’emploi d’une technique d’augmentation de données consistant à rajouter des échantillons à l’ensemble d’apprentissage initial afin d’améliorer la précision et la robustesse de l’algorithme de prédiction à apprendre.
Autrement formulé, le présent procédé permet le calcul d’une stratégie de sous- augmentation de données visant à maximiser la robustesse d’un algorithme d’apprentissage statistique supervisé vis-à-vis d’un groupe de symétries donné, dans le cadre du respect de contraintes opérationnelles préalablement fixées.
Dans le procédé décrit, il est proposé une stratégie d’augmentation de données compatible avec la dimension opérationnelle de l’utilisation des algorithmes de prédiction.
Pour cela, le procédé utilise un formalisme issu de la théorie des groupes. Dans ce cadre, le procédé utilise les notions de sous-groupes et de distributions sur ces ensembles afin de construire, via la résolution d’un problème d’optimisation sous-contraintes, une stratégie de sous-augmentation de données permettant d’obtenir un compromis entre l’incorporation des symétries au sein d’un algorithme et les différentes contraintes opérationnelles associées à l’application visée. Autrement formulé, le procédé permet de mettre en œuvre une technique d’augmentation des données impliquant un certain nombre de prérequis algorithmique (capacité d’apprentissage de l’algorithme envisagé, nombre d’itérations dans l’optimisation) en les déterminant et en les réduisant intelligemment pour les rendre compatibles avec les contraintes exogènes associées à une application opérationnelle donnée (comme par exemple l’empreinte mémoire de l’algorithme entraîné ou le temps de calcul).
Le procédé proposé permet une formalisation simple du problème considéré et sa résolution devient alors aisément réalisable par les outils d’optimisation numériques usuels.
Enfin, du fait que le procédé est capable de gérer des contraintes opérationnelles, le procédé d’apprentissage est un procédé d’apprentissage d’un algorithme de prédiction apte à être mis en œuvre par un système réel sur un jeu de données de taille restreinte.
EXEMPLE : CAS DE LA SYMETRIE ROTATIONNELLE
Un exemple mis en œuvre par la demanderesse est maintenant décrit en référence aux figures 2 et 3.
Afin d’illustrer le procédé d’apprentissage précédent, il est choisi un groupe de symétrie rotationnelle, qui intervient en particulier dans les problèmes de classification d’images.
Dans ce contexte, le but est de construire un algorithme de prédiction fθ robuste à des rotations de ses entrées.
Il est supposé qu’il est recherché une robustesse uniforme. Plus précisément, il convient de rendre l’algorithme de prédiction robuste à des rotations aléatoires de ses entrées, les angles de ces rotations étant distribués uniformément sur [0,2π],
Ainsi, le groupe G est celui des rotations plan, noté SO( 2), qui peut être représenté par le groupe matriciel rappelé ci-dessous, où la loi de groupe * correspond à la multiplication matricielle et est la matrice de rotation d’angle Q donnée par :
Pour l’exemple mis en œuvre, il est considéré les sous-groupes Hk suivants : ainsi que les groupes quotients correspondants où [. ]y est l’opérateur modulo y et k est un entier naturel différent de 0.
La figure 2 propose une représentation d’exemples de sous-groupes Hk tels que définis précédemment.
Dans cette figure, le cercle correspond à l’ensemble des éléments du groupe des rotations plan noté SO( 2), les points pointés correspondent à l’ensemble des éléments du sous-groupe H18 et les points hachurés correspondent à l’ensemble des éléments du sous- groupe H7.
Comme visible sur la figure 2, dans l’hypothèse une distribution uniforme sur le sous-groupe G, la mesure de Lebesgue est une mesure sur le cercle unité, i.e. vG = dθ .
En raisonnant en terme d’angles, il est possible d’écrire, pour l’expression mathématique suivante :
En ce qui concerne la mesure du sous-groupe, il vient alors :
D’un point de vue opérationnel, dans le présent exemple, la demanderesse a supposé que deux contraintes étaient à remplir.
Selon une première contrainte, la taille de l’ensemble d’augmentation est contrainte. Cela se traduit en l’existence d’une borne supérieure K0 pour la cardinalité (taille) des sous- groupes Hk.
Selon une deuxième contrainte, la convergence doit être suffisamment rapide. Il est possible de traduire cette contrainte comme une borne supérieure ∑0 pour la variance de la distribution associée à la mesure vHk qui est à déterminer.
Ainsi, dans cet exemple particulier, la quantité à optimiser s’écrit de la manière suivante :
Par ailleurs, il est possible de déterminer la valeur de l’intégrale selon le calcul suivant :
L’expression à optimiser devient ainsi :
Par ailleurs, en notant il vient :
Où V désigne l’opérateur de variance.
Avec ces notations, l’expression à optimiser devient alors :
Cette expression monter qu’il convient de résoudre les différents problèmes ci- dessous pour k ∈ {1,...,K0}, K0 étant la borne supérieure sur la taille du sous-groupe considéré, et de garder la solution permettant d’atteindre la valeur minimale de la fonction cible:
Pour k ∈ {1,...,K0}, \es problèmes précédents sont des problèmes non-linéaires, dont la fonction cible et les contraintes sont quadratiques, et peuvent être résolus via les techniques d’optimisation numériques comme une optimisation quadratique. La figure 3 montre la distribution vHk obtenue pour pour K0 = 10 par résolution des problèmes précédents.
Pour le cas considéré, la solution optimale est obtenue pour k = K0, comme attendu, et il est observé une déviation par rapport à la distribution uniforme en raison des différentes contraintes considérées, ce qui était également attendu.
La solution obtenue est ainsi une solution permettant d’obtenir une bonne convergence et une taille du sous-groupe compatible avec les capacités calculatoires du système 10 tout en assurant une relativement bonne robustesse uniforme.
Cela permet d’obtenir un bon apprentissage de l’algorithme de prédiction. II peut être noté que quelques secondes de calcul numérique ont été suffisantes pour obtenir cet exemple de symétrie rotationnelle modélisé comme un problème d’optimisation quadratique sous contraintes quadratiques.
Le procédé d’apprentissage permet ainsi de construire une technique d’augmentation de données compatible avec des contraintes opérationnelles exogènes, comme par exemple l’empreinte mémoire de l’algorithme entraîné, son temps d’exécution sur l’architecture visée ou encore son degré de robustesse à des modifications de ces entrées et d’utiliser cette technique d’augmentation de données pour l’entraînement d’algorithmes de prédiction par une technique d’apprentissage machine.
En outre, le procédé d’apprentissage est compatible avec tout type d’apprentissage ou d’utilisation de celui-ci et est particulièrement adapté à la conception et à l’entraînement d’algorithmes intégrés dans des systèmes embarqués, pour lesquels un certain nombre de contraintes opérationnelles doivent être prises en compte dès la phase de conception algorithmique.
Enfin, il sera bien compris que l’ordre des étapes dans le procédé d’apprentissage qui vient d’être décrit peut être différent et notamment que certaines étapes peuvent être réalisées de manière simultanée.
Plus généralement, toute combinaison techniquement possible des modes de réalisation précédents permettant d’obtenir un procédé d’apprentissage d’un algorithme de prédiction est envisagé.

Claims

REVENDICATIONS
1. Procédé d’apprentissage d’un algorithme de prédiction, l’algorithme de prédiction prédisant pour des entrées données la valeur d’une ou plusieurs sorties, l’apprentissage étant mis en œuvre par ordinateur en utilisant une technique d’apprentissage machine, le procédé d’apprentissage comportant les étapes de :
- réception d’un jeu de données d’apprentissage courant,
- réception d’au moins une propriété d’invariance de la prédiction de l’algorithme de prédiction à apprendre par rapport aux entrées que l’algorithme de prédiction peut prendre en entrée selon un groupe de symétrie, dit groupe de symétrie initial, ledit groupe de symétrie étant muni d’une loi de probabilité initiale,
- détermination d’un sous-groupe du groupe de symétrie initial, le sous-groupe étant muni d’une loi de probabilité, dite loi de probabilité de sous-groupe, le sous-groupe correspondant à des transformations des entrées données à l’algorithme de prédiction, le sous-groupe étant destiné à être utilisé pour générer des données d’apprentissage par application des transformations correspondantes au jeu de données d’apprentissage courant selon la loi de probabilité de sous-groupe, le sous- groupe et la loi de probabilité de sous-groupe étant déterminés selon une technique d’optimisation sous au moins une contrainte d’optimisation, la technique d’optimisation utilisant le jeu de données d’apprentissage initial, le groupe de symétrie initial et la loi de probabilité initiale, l’au moins une contrainte d’optimisation étant déduite d’au moins une contrainte d’apprentissage prédéterminée,
- génération de données à l’aide du sous-groupe déterminé, de la loi de probabilité de sous-groupe et de l’ensemble du jeu de données d’apprentissage courant, pour obtenir des données générées, et
- mise en œuvre d’un apprentissage de l’algorithme de prédiction utilisant les données générées, l’apprentissage étant :
- soit un apprentissage utilisant une technique de génération de données itérative, chaque itération comprenant l’étape de génération, l’étape de mise en œuvre étant réalisée avec uniquement les données générées, le jeu de données d’apprentissage courant utilisé étant alors l’ensemble des données générées à l’itération courante,
- soit un apprentissage utilisant un jeu de données formé par l’ensemble des données générées et d’un jeu de données initial, le jeu de données initial étant utilisé comme jeu de données d’apprentissage courant.
2. Procédé d’apprentissage selon la revendication 1 , dans lequel la ou les entrée(s) et/ou la ou les sortie(s) sont des grandeurs physiques correspondant à des mesures issues d’un ou de plusieurs capteurs,
3. Procédé d’apprentissage selon la revendication 1 ou 2, dans lequel l’algorithme de prédiction est un algorithme de traitement d’images.
4. Procédé d’apprentissage selon la revendication 3, dans lequel l’algorithme de prédiction est un algorithme de reconnaissance de forme ou un algorithme de classification d’images.
5. Procédé d’apprentissage selon l’une quelconque des revendications 1 à 4, dans lequel l’au moins une contrainte d’apprentissage prédéterminée est choisie dans la liste constituée de :
- l’empreinte mémoire de l’algorithme appris,
- le temps d’exécution de l’algorithme appris sur un système prédéterminé,
- la quantité de calcul réalisable sur un système prédétermine sur lequel l’algorithme appris est destiné à être utilisé,
- une contrainte de confidentialité de certaines données,
- une contrainte de sécurité, le degré de robustesse de l’algorithme appris à des modifications des entrées, et
- le temps d’entraînement de l’algorithme de prédiction.
6. Procédé d’apprentissage selon la revendication 5, dans lequel au moins contrainte est le temps d’entraînement de l’algorithme de prédiction.
7. Procédé d’apprentissage selon l’une quelconque des revendications 1 à 6, dans lequel la technique d’optimisation consiste à minimiser sous contrainte d’optimisation la différence d’erreur de prédiction entre l’algorithme de prédiction obtenu à l’aide de données d’apprentissage comprenant des données générées à partir du groupe de symétrie initial et de la loi de probabilité initiale, et l’algorithme de prédiction obtenu à l’aide de données d’apprentissage comprenant des données générées à partir du sous-groupe déterminé et de la loi de probabilité de sous-groupe.
8. Procédé d’apprentissage selon l’une quelconque des revendications 1 à 7, dans lequel plusieurs contraintes d’optimisation sont prises en compte dans la technique d’optimisation.
9. Procédé d’apprentissage selon l’une quelconque des revendications 1 à 8, dans lequel la technique d’optimisation est une optimisation d’une fonction cible quadratique sous des contraintes d’optimisation quadratiques.
10. Procédé d’apprentissage selon l’une quelconque des revendications 1 à 9, dans lequel, le sous-groupe présente une dimension, au moins une contrainte étant une limitation d’au moins un moment de la loi de probabilité de sous-groupe avec une borne, notamment une borne supérieure sur la dimension du sous-groupe ou une borne supérieure sur la variance de la loi de probabilité de sous-groupe.
11. Procédé d’apprentissage selon l’une des revendications 1 à 10, dans lequel la loi de probabilité initiale est obtenue à partir de la vraisemblance des transformations associées au groupe de symétrie initial mesurée pour un ensemble d’entrées correspondant aux entrées attendues dans le cadre d’une utilisation spécifique de l’algorithme de prédiction considéré.
12. Procédé d’apprentissage selon l’une des revendications 1 à 11 , dans lequel la loi de probabilité initiale est une distribution uniforme ou une distribution gaussienne.
13. Procédé d’apprentissage selon l’une des revendications 1 à 12, dans lequel le groupe de symétrie initial est un groupe de Lie, notamment le groupe de symétrie initial est le groupe des roto-translations du plan.
14. Produit programme d’ordinateur (12) comportant des instructions de programme formant un programme d’ordinateur mémorisé sur un support lisible d’informations (32), le programme d’ordinateur étant chargeable sur une unité de traitement de données (20) et mettant en œuvre un procédé d’apprentissage selon l’une quelconque des revendications 1 à 13.
15. Support lisible d’informations (32) comportant des instructions de programme formant un programme d’ordinateur, le programme d’ordinateur étant chargeable sur une unité de traitement de données (20) et mettant en œuvre un procédé d’apprentissage selon l’une quelconque des revendications 1 à 14 lorsque le programme d’ordinateur est mis en œuvre sur l’unité de traitement de données (20).
EP22744415.5A 2021-06-30 2022-06-30 Procédé d'apprentissage d'un algorithme de prédiction et dispositifs associés Pending EP4364057A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR2107019A FR3124874A1 (fr) 2021-06-30 2021-06-30 Procede d'apprentissage d'un algorithme de prediction et dispositifs associes
PCT/EP2022/068153 WO2023275295A1 (fr) 2021-06-30 2022-06-30 Procédé d'apprentissage d'un algorithme de prédiction et dispositifs associés

Publications (1)

Publication Number Publication Date
EP4364057A1 true EP4364057A1 (fr) 2024-05-08

Family

ID=80122936

Family Applications (1)

Application Number Title Priority Date Filing Date
EP22744415.5A Pending EP4364057A1 (fr) 2021-06-30 2022-06-30 Procédé d'apprentissage d'un algorithme de prédiction et dispositifs associés

Country Status (4)

Country Link
US (1) US20240320290A1 (fr)
EP (1) EP4364057A1 (fr)
FR (1) FR3124874A1 (fr)
WO (1) WO2023275295A1 (fr)

Also Published As

Publication number Publication date
US20240320290A1 (en) 2024-09-26
WO2023275295A1 (fr) 2023-01-05
FR3124874A1 (fr) 2023-01-06

Similar Documents

Publication Publication Date Title
US10657436B2 (en) Generative neural networks
US20260087603A1 (en) Synthesizing content using diffusion models in content generation systems and applications
CN110383299B (zh) 记忆增强的生成时间模型
CN111727441B (zh) 实现用于高效学习的条件神经过程的神经网络系统
US20190370647A1 (en) Artificial intelligence analysis and explanation utilizing hardware measures of attention
US12505229B2 (en) Machine learning models with multi-budget differential privacy
CN111247532A (zh) 利用多任务学习进行特征提取
JP7188856B2 (ja) 動的な画像解像度評価
WO2022112583A1 (fr) Procédé d'évaluation de la performance d'un algorithme de prédiction et dispositifs associés
US20250005370A1 (en) Multitask prompt tuning for parameter-efficient transfer learning
US12333379B2 (en) Optimized selection of data for quantum circuits
EP4364057A1 (fr) Procédé d'apprentissage d'un algorithme de prédiction et dispositifs associés
EP4639291A1 (fr) Procédé de contrôle d'un actionneur par un système de contrôle et système de contrôle d'un actionneur
US20260050815A1 (en) Validation and Optimization of Quantum Error Mitigation Workflows
WO2025252868A1 (fr) Procédé de conception des blocs matériels et dispositifs associés
US20240211727A1 (en) Local interpretability architecture for a neural network
US12619866B2 (en) Methods and apparatus to facilitate continuous learning
US20250005340A1 (en) Neural network with time and space connections
US20250225384A1 (en) Integration of learned differentiable loss functions in deep learning models
FR3158572A1 (fr) Méthode de détermination d’une prédiction robuste et d’un intervalle de certification associé à une tâche de régression
US20210117792A1 (en) Methods and apparatus to facilitate continuous learning
CN121889807A (zh) 用于深度学习中的经校准的不确定性的层归一化
WO2024165531A1 (fr) Réglage fin de réseau neuronal de diffusion privé différentiel
WO2023118548A1 (fr) Procédé de détection d'un tourbillon dans une étendue d'eau et système associé

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20231228

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)