EP4690001A1 - Procédé de génération d'une séquence temporelle d'évaluations d'une situation et dispositif associé - Google Patents
Procédé de génération d'une séquence temporelle d'évaluations d'une situation et dispositif associéInfo
- Publication number
- EP4690001A1 EP4690001A1 EP24712077.7A EP24712077A EP4690001A1 EP 4690001 A1 EP4690001 A1 EP 4690001A1 EP 24712077 A EP24712077 A EP 24712077A EP 4690001 A1 EP4690001 A1 EP 4690001A1
- Authority
- EP
- European Patent Office
- Prior art keywords
- data
- sequence
- temporal
- modality
- model
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/045—Combinations of networks
- G06N3/0455—Auto-encoder networks; Encoder-decoder networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/0499—Feedforward networks
Definitions
- the present invention belongs to the general field of data analysis, and more particularly to data processing to assess the extent to which a particular situation occurs. It relates more particularly to a method for generating a time sequence of evaluations of a situation by a robust evaluation model in the event of missing input data. It also relates to an electronic device configured to implement such a method.
- the invention finds a particularly advantageous application, although in no way limiting, in the case where the model is used to evaluate the emotional state of a person or the evolution of the autonomy of a fragile person at home, for example with a view to determining a suitable measure to provide to them as part of a teleassistance service.
- the invention also applies in the case where the model is used as part of a video surveillance service, for example with a view to determining a suitable protection measure for an environment equipped with sensors and actuators.
- multimodal learning is enjoying growing success since it offers much better performances than methods that only consider a single modality.
- the objective of multimodal learning is to build models adapted to process information from different modalities.
- Multimodal learning has notably been successfully used for many applications, such as emotion recognition from multimodal data and event detection from multimedia data.
- a relatively classic solution consists simply of not considering the input data (or samples) for which at least one of the modalities is missing.
- this solution has the disadvantage of reducing the time periods during which the model is trained or validated, which leads to a significant drop in model performance.
- imputation methods aim to infer missing data based on heuristics, so as to be able to provide input data as input to the model whose modalities correspond to all those expected by this model.
- these imputation methods fail to restore the original distribution of missing data, and therefore have the disadvantage of introducing statistical biases.
- these imputation methods make data processing and analysis more laborious.
- the present invention aims to remedy all or part of the drawbacks of the prior art, in particular those set out above, by proposing a model which is robust to missing data, both during the model training phase and during the model validation or exploitation phase.
- the present invention proposes a model considering the complementarity of the information included in the input data through their different modalities, while also taking into account the previous evaluations carried out by this model. In this way, even if at least one of the modalities expected by the model is not available, the latter will still be able to evaluate a situation reliably.
- the notion of modality is defined as a type of data captured by an electronic data capture device (i.e., a sensor), this type of data being expected as input to the evaluation model according to the invention.
- a method for generating a temporal sequence of evaluations of a situation, implemented by (at least one) neural network having an architecture consisting of an encoder and a decoder.
- the encoder is composed of a set of layers of neurons, which process the data in order to construct representations called "encoded” in the sense that the dimensions of these representations are smaller than those of the input data (or samples).
- the decoder is also composed of layers of neurons which receive these representations and process them.
- machine learning any technique implementing a learning algorithm (“machine learning") and providing, as output, a representative evaluation of the probability that a certain situation occurs given observations (corresponding to input data), can be considered in the context of the invention (e.g., support vector machine, logistic regression, etc.).
- the evaluation model is independent of the training method considered to train this model.
- any training criterion known to those skilled in the art may be considered during the training phase of the evaluation model, such as the least squares method or the minimization of cross entropy.
- the input samples to the model include images (or features extracted from raw images), sound data (or features extracted from raw sound data) synchronized with the images, and physiological signals (or features extracted from physiological signals) also synchronized with the other input data.
- the inputs of the evaluation model correspond to Internet resources (e.g., web pages, tweets) or documents (audio, video, text, images), and the outputs of the model then correspond to the probability that an event occurs.
- Internet resources e.g., web pages, tweets
- documents audio, video, text, images
- an encoder that includes an autoregressive self-attention model is advantageous in that it forces the evaluation model to focus its attention on evaluations previously made by this same model, for a situation that is assumed not to change abruptly over time.
- cross-attention model offers the advantage of constraining the evaluation model to focus on the different representations at a certain moment (and consequently on the different modalities processed by the model), without temporal consideration.
- the generation method may further comprise one or more of the following characteristics, taken in isolation or in all technically possible combinations.
- the self-attention model is autoregressive in that, at a current time , the self-attention model takes as input the intermediate evaluations previously determined by the evaluation model from input data associated with past instants .
- the positional encoding data represents, for each temporal sequence of input data, the importance of the position of at least one of said elements in said sequence.
- the modality encoding data represents the importance of a modality among the modalities of the plurality of temporal sequences of input data.
- the generation method further comprises a step of determining the temporal data by applying at least one temporal convolution network to the plurality of temporal sequences of input data.
- a separate temporal convolutional network is applied to each of the input data temporal sequences.
- the encoding step comprises a sub-step of filtering the input data of the multimodal encoding model "Transformer”, so as to encode only the data included in a sliding time window relative to a current instant. .
- This filtering sub-step is advantageous in that it forces the evaluation model to focus on recent information, which is more likely to influence the current situation than information associated with the distant past.
- the temporal sequence of intermediate evaluations comprises a plurality of multidimensional elements
- the conversion step comprises applying a layer of a fully-connected neural network to the temporal sequence of intermediate evaluations, so as to convert each multidimensional element into an evaluation value of a situation.
- the method further comprises a step of determining positional encoding data , and of combining the intermediate evaluations. previously determined by said evaluation model from input data associated with instants with the determined positional encoding data, so as to obtain the intermediate evaluations.
- the cross-attention model takes as input encoded representations and associated with a current moment , with the number of time sequences of input data.
- the situation corresponds to an emotional state of a user.
- the invention relates to a computer program comprising instructions for implementing a generation method according to the invention, when said program is executed by a processor.
- the invention relates to a computer-readable information or recording medium on which the computer program according to the invention is recorded.
- the information or recording medium may be any entity or device capable of storing the program.
- the medium may include a storage medium, such as a ROM, for example a CD ROM or a microelectronic circuit ROM, or a magnetic recording medium, for example a floppy disk or a hard disk.
- the information or recording medium may be a transmissible medium such as an electrical or optical signal, which may be conveyed via an electrical or optical cable, by radio or by other means.
- the program according to the invention may in particular be downloaded from a network such as the Internet.
- the information or recording medium may be an integrated circuit in which the program is incorporated (or embedded), the circuit being adapted to execute or to be used in the execution of the method in question.
- the evaluation model expects as input data samples (or elements) associated with two different modalities And .
- the modality corresponds to the visual modality, and the input data associated with this modality correspond to features from images of a person's face.
- the modality corresponds to the so-called physiological modality, and the input data associated with this modality correspond to signals representative of the respiratory, cardiac and/or cerebral activity of this same person.
- Figure 1A illustrates a first example where all observations are complete, that is, at each instant , the model processes as input samples including data associated with all expected modalities.
- Figure 1B illustrates the case of missing data. More precisely, at the time the model receives as input a sample corresponding to a complete observation since it includes data from both modalities And . Then right now the model receives as input a sample including data from the modality only. At this moment , the model therefore receives missing data as input. This situation is for example the consequence of a problem on the telecommunications network linking the capture device (eg, the video camera) and the electronic device in which the evaluation model is incorporated or embedded. At the moment the model receives again as input a sample corresponding to a complete observation. Then from the moment the model receives as input a sample including only data from the modality
- the capture device eg, the video camera
- an assessment system comprising an electronic assessment device (10) as provided.
- the electronic device (10) comprises an assessment model used to assess the emotional state of a fragile person (e.g.: senior, person suffering from a disability, isolated person, etc.) at home, in order to determine an appropriate measure to provide to him/her as part of a teleassistance service.
- a fragile person e.g.: senior, person suffering from a disability, isolated person, etc.
- Such a system is particularly advantageous for keeping vulnerable people at home. Indeed, in this context, it appears necessary to have a better understanding of the emotions of these people, in order to provide a measure of autonomy and services adapted to the situation.
- This assessment of the emotional state is one of the strong indicators for assessing the good physical, social and moral health of vulnerable people by the medical profession through teleassistance services.
- a person's emotions can also reveal changes in their autonomy.
- the evaluation model is configured to process raw data emitted by multimodal sensors equipping the environment (e.g., the home) in which a person is located, to determine an emotion score representative of an emotional state, then to trigger (or not) a certain service in order to influence this emotional state.
- the assessment model is configured to assess "negative” emotional situations of people from raw data from sensors equipping a connected home, and, in the event of an assessment of such a situation, to trigger services encouraging these people to have "more positive” emotions.
- a person skilled in the art can refer to the following work for more details concerning the classification of emotions: "Emotions in Social Psychology", Key Readings in Social Psychology, W. Gerrod Parrott, Psychology Press, 2000.
- fifteen emotion classes are defined: neutral (1), disgusted (2), panicked (3), anxious (4), angry (5), cold anger (6), desperate (7), sad (8), enthusiastic (9), happy (10), interested (11), bored (12), ashamed (13), proud (14), and contemptuous (15).
- the classes disgusted (2), panicked (3), anxious (4), angry (5), cold anger (6), desperate (7), sad (8), bored (12), and ashamed (13) can be considered negative and the emotion classes enthusiastic (9), happy (10), interested (11), can be considered positive.
- the services that can be provided by the evaluation model in response to an evaluation of a situation are for example identified by links (e.g., web addresses) and stored in a correspondence table associating said services with predetermined values of respective scores.
- a threshold value is exceeded, at least one link to a corresponding digital service is accessed and then its activation is offered to this person via a human-machine interface (not shown). Alternatively, this service is triggered automatically.
- the evaluation system comprises an electronic evaluation device (10) configured to continuously obtain or receive a set of signals.
- Each signal of the set carries data of at least one modality.
- the connected sensors comprise an image sequence device (e.g., a video camera or a photo camera) (10) configured to capture images of a person detected in a capture zone of this camera.
- an image sequence device e.g., a video camera or a photo camera
- a video recording of the person is then obtained (visual modality).
- This recording is analyzed by an analysis module ("Video Content Analysis” according to the English terminology) of the video camera (20) or alternatively of the electronic evaluation device (10), so as to collect different characteristics relating to the face or facial expressions, to the different gestures or postures, to the movements of the person, to the ambient brightness, etc.
- Video Content Analysis according to the English terminology
- the electronic evaluation device (10) is also configured to simultaneously receive other signals emitted by other sensors equipping the environment or the fragile person.
- the evaluation system of the further comprises an audio capture device (40) configured to collect an audio recording.
- the processing of this audio recording is for example implemented by said audio capture device (40), in order to extract therefrom signals representative of speech emitted by the person and/or of the prosody of this person, of an ambient sound level, of an estimation of the position of the person, etc.
- the audio capture device (40) is configured to transmit a plurality of different signals (but associated with the same sound modality) to the electronic evaluation device (10).
- these processing operations on the raw signals are carried out by an analysis module of the electronic evaluation device (10).
- the evaluation system of the comprises a physiological signal capture device (30) taking in this example the form of a connected watch.
- This physiological signal capture device (30) is configured to capture and process signals representative of the heart rate, breathing rate and/or brain electrical activity of this person.
- the processing on the different physiological signals is implemented by an analysis module of the electronic evaluation device (20).
- the encoder takes as input temporal sequences of input data from sensors equipping an environment and/or a user.
- Each sequence is associated with a modality , and includes a series of elements .
- Each of these elements is representative of a state, at an instant , of the modality associated with the sequence.
- This encoder includes temporal convolutional networks (TCNs) which take as input the temporal sequences of input data.
- TCNs temporal convolutional networks
- a temporal convolution network is dedicated to each of the modalities expected as input to the model.
- each of the Temporal convolutional networks (TCN) are used to extract temporal data .
- the evaluation model includes only a single temporal convolutional network (TCN) that takes as input the time sequences of data.
- the outputs have the same size .
- This encoder further includes positional encoding modules taking the form of neural networks (or corresponding to one or more layers of a neural network), each positional encoding module generating weighted temporal data from the elements .
- These weights represent, for each time sequence of input data, the importance of the position of at least one of said elements in said sequence .
- the encoder further includes modal encoding modules also taking the form of a neural network (or corresponding to one or more layers of a neural network), each modal encoding module taking as input the outputs of one of the positional encoding modules, and generating weighted temporal data .
- weights or modality encoding data ( ) represent the importance of a modality among the terms of the time sequences of input data.
- a modality encoding data is determined and then added to each input of the associated modal encoding module.
- the output of this modal encoding module is then expressed in the form
- the elements And are combined by a combination module, so as to obtain only a sequence of "simple" elements. More formally, either , and M the number of modalities expected by the evaluation model, then the combined sequence is expressed in the form:
- THE combined sequences are processed by a multimodal "Transformer” encoder (MMTE). More precisely, this multimodal "Transformer” encoder is configured to encode data resulting from a combination, at each instant, of positional encoding data , modality encoding data and temporal data determined from the time sequences of input data, so as to obtain temporal sequences of encoded multimodal representations .
- MMTE multimodal "Transformer” encoder
- MMTE Multimodal Transformer Encoder
- the self-attention module of an encoder is configured to take as input an element (eg, a data vector), and generate as output an intermediate representation , which is itself transmitted to the module based on a forward propagation neural network of this encoder , so as to generate a representation .
- an element eg, a data vector
- an intermediate representation which is itself transmitted to the module based on a forward propagation neural network of this encoder , so as to generate a representation .
- This representation is then passed to the encoder's self-attention module of the stack which generates an intermediate representation as output , which is itself transmitted to the module based on a forward propagation neural network of this encoder , so as to generate a representation .
- Transformer "Transformer Encoder With MultiModal Multi-Head Attention for Continuous Affect Recognition", H. Chen & Al., IEEE Transactions on Multimedia, vol. 23, pp. 4171-4183, 2021.
- the decoder of the evaluation model as proposed comprises a multimodal "Transformer” TDL decoder, this multimodal "Transformer” TDL decoder comprising an auto-regressive multi-head self-attention module MHSA, a multi-head cross-attention module MHCA, and a first FFN conversion module taking the form of a "fully-connected" neural network.
- this multimodal "Transformer” TDL decoder comprising an auto-regressive multi-head self-attention module MHSA, a multi-head cross-attention module MHCA, and a first FFN conversion module taking the form of a "fully-connected" neural network.
- the MHSA is connected to the MHCA which is itself connected to the FFN.
- the TDL is itself connected to a second conversion module (FC) taking the form of a layer of a "fully-connected" neural network.
- FC second conversion module
- the TDL outputs a time sequence of intermediate evaluations .
- the MHSA is said to be autoregressive in the sense that it takes as input the intermediate evaluations previously generated by the TDL. More precisely, in the case where the decoder seeks to evaluate a situation at the current time , the TDL MHSA takes as input a plurality of previously generated intermediate evaluations ( ) and having been weighted.
- the decoder further comprises a positional encoding module referenced and taking the form of a neural network (or corresponding to one or more layers of a neural network).
- This positional encoding module is configured to weight these previously generated intermediate evaluations, and operates in a similar manner to those previously mentioned in reference to the .
- the multi-head attention mechanism of MHSA and MHCA projects a query vector at a first position to a key vector to a second position in order to determine the attention (i.e., weighting) to give to a vector of values associated with the position of the key vector .
- the final value corresponds to the weighted sum of the vectors of values at different positions.
- This input is weighted by the positional encoding module which generates the sequence next
- the sequence is first processed by the MHSA. It is important to recall at this point that the MHSA uses a self-attention mechanism aimed at focusing its attention on evaluations previously performed by this same evaluation model. Consequently, the query, key and value vectors are all three determined from the input sequence .
- the sequence of characteristics at the output of the MHSA is then expressed in the form:
- the MHCA takes as input the sequence of encoded representations .
- the key and value vectors are determined from this sequence of encoded representations, and the query vector corresponds to the output of the MHSA. More formally, the output of the MHCA is expressed as
- the MHCA takes as input the encoded representations associated with this instant only, so as to force the evaluation model to focus on the different representations, without temporal consideration.
- the TDL further includes a first conversion module (FFN) taking the form of a "fully-connected" neural network.
- FNN first conversion module
- the decoder comprises only one TDL.
- These developments can however be generalized without difficulty by those skilled in the art to the case where the decoder comprises a stack of TDLs.
- the developments previously mentioned apply to the first TDL (to be entered into the stack), and the sequence corresponds to the entry of the second TDL (to be entered into the stack).
- the last TDL determines the sequence of intermediate data [ ] such as with .
- the decoder further comprises the second conversion module (FC) which takes this sequence as input , and converts each element of the sequence into a value representative of a situation (or into a vector of values representative of one or more different situations), so as to obtain a temporal sequence where each element corresponds, at a certain instant, to an evaluation of a particular situation.
- this second conversion module takes the form of a layer of a "fully-connected" neural network applied to each of the elements of the sequence sequence .
- the same second conversion module is applied to each element.
- the electronic evaluation device 10 has the hardware architecture of a computer.
- the electronic evaluation device 10 comprises, in particular, a processor 1, a random access memory 2, a read-only memory 3 and a non-volatile memory 4. It further comprises a communication module 5.
- the wireless communication device 10 may also comprise other modules, in particular for implementing particular modes of the full-duplex communication method, as described in more detail later.
- the general method for evaluating a situation comprises a first phase S1000 of training an evaluation model comprising steps S110 to S140, and a second phase S2000 of validating or exploiting the evaluation model and comprising steps S210 to S360, this second phase corresponding to an example of a generation method as proposed.
- the method comprises a first step S110 of obtaining a plurality ( ) of temporal sequences of labeled training data, each sequence being associated with a modality , each element of a sequence being representative of a state, at an instant , of the modality associated with the sequence.
- This step S110 is implemented by the module for obtaining a plurality of time sequences previously mentioned.
- training data are provided as input to the model in the form of data vectors.
- raw data emitted by different types of sensors – each sensor being associated with a particular modality – are continuously recorded in a database. Samples of this raw data are labeled using a value representative of one or more categories or classes. This representative value is for example included in the interval [-1;1].
- signals associated with a visual modality (and corresponding for example to image sequences captured by an image capture device such as a camera or a photo camera), with a sound modality (and corresponding for example to sound samples captured by a microphone) and with a physiological modality (and corresponding for example to signals representative of a respiratory rate, heart rate and/or to a cerebral electrical activity captured by a connected watch) are considered.
- the appraisal model is an emotional state appraisal model
- fifteen emotion classes are defined: neutral (1), disgusted (2), panicked (3), anxious (4), angry (5), cold anger (6), desperate (7), sad (8), enthusiastic (9), happy (10), interested (11), bored (12), ashamed (13), proud (14), and contemptuous (15).
- the classes disgusted (2), panicked (3), anxious (4), angry (5), cold anger (6), desperate (7), sad (8), bored (12), and ashamed (13) can be considered negative, and the emotion classes enthusiastic (9), happy (10), interested (11), can be considered positive.
- This database is accessible by a raw data analysis module, for example embedded in the electronic evaluation device 10, and which is then configured to generate new signals on the basis of the raw data.
- This analysis module is further configured to segment the raw data into data sections of a predetermined time interval (for example 30 seconds), and this without overlapping the sections.
- Temporal segmentation makes it possible to have chronologically synchronized time series of interest. For example, a temporal segmentation into 30-second time intervals has the effect that all time series of interest have, for each 30-second time interval, an associated value of a quantity of interest.
- This temporal synchronization makes it possible, for example, to establish multimodal correlations between the values of different quantities of interest during the same time interval, or during consecutive time intervals.
- it is possible to structure in the model for example, a correlation between the user's speech rate during a given time interval and a facial expression during a following time interval.
- the analysis module identifies features of interest (e.g., a face, words of the individual, etc.) from the raw data, and generates signals of interest. These signals of interest are finally processed by the analysis module so as to generate learning data that will be used during the S1000 training phase of the evaluation model.
- features of interest e.g., a face, words of the individual, etc.
- This processing generally allows the signals of interest to be shaped with a view to evaluating the situation (e.g., the emotional state of the person).
- the targeted processing includes the calculation of facial characteristics ("Facial Action Units” according to English terminology), eGeMAPS sound characteristics ("extended Geneva Minimalistic Acoustic Parameter Set” according to English terminology), and/or a concatenation of BPM data ("Beat Per Minutes” according to English terminology), an electrocardiogram, and a respiratory rate).
- the targeted treatments include at least one of: applying low-pass filtering, normalization, or resampling.
- Low-pass filtering offers the advantage of denoising the information, normalization allows for standardizing the data, and resampling the data allows for synchronizing the sources.
- the training phase further comprises a step S120 during which the evaluation model is trained, by processing the training data obtained during step S110.
- the evaluation model is trained by applying a cost function defined such that with the concordance correlation coefficient.
- phase S1000 further comprises steps S130 and S140.
- step S130 the modality(ies) having a significant impact on the evaluation of a given situation are identified.
- the evaluation model is first trained by applying step S120, then this same evaluation model, once trained, is evaluated by processing data from a single modality at a time. In other words, this evaluation model evaluates the same situation iteratively, considering at each iteration input data from the same modality.
- each of the modalities is ranked according to its impact on the performance of the prediction model.
- the training phase S1000 then comprises a step S140 during which the evaluation model is re-trained, but this time by excluding, from the input data, those associated with the modalities determined during step S130 as having a significant impact on the evaluation performance.
- the data associated with the modalities having a significant impact with a probability are excluded from relearning, with a probability that the data is missing or present, and only the modalities having a probability are considered as input to the evaluation model during this step S140.
- these steps S130 and S140 make it possible to obtain an evaluation model of a situation which is more robust in the event of missing data for at least one of the modalities classically expected as input to the evaluation model, and having a significant impact on performance.
- This S2000 phase corresponds to a process for generating a temporal sequence of evaluations (or predictions) of a situation by an evaluation model (based on a neural network and) robust in the event of missing input data.
- Phase S2000 includes steps S210 to S250 implemented by the encoder as represented by the , and steps S310 to S360 implemented by the decoder as represented by the .
- the method of generating a sequence comprises a first step of obtaining input data from a plurality ( ) of temporal sequences of input data from sensors equipping an environment and/or a user, each sequence being associated with a modality ( ), each element ( ) of a sequence being representative of a state, at an instant ( ), of the modality ( ) associated with the sequence.
- step S210 is distinguished from step S110 by the fact that the input data are of course not labeled.
- This step is implemented by the module for obtaining a plurality of time sequences previously mentioned.
- the method for generating a sequence further comprises a step S220 during which temporal data are determined by applying at least the temporal convolution network TCN of the encoder to the plurality ( ) of time sequences of input data.
- positional encoding data are determined by one or more positional encoding modules of the encoder, these encoding data representing, for each temporal sequence of input data, the importance of the position of at least one of said elements in said sequence.
- the positional encoding data are then combined with the temporal data, so that the output of this positional encoding module is then expressed for example in the form
- modal encoding data are determined by the modal encoding module of the encoder, these encoding data representing, for each temporal sequence of input data, the importance of a modality among the modalities of the input data.
- the modal encoding data is then combined with the outputs of the encoder's positional encoding module, so that the output of this modal encoding module is then expressed for example in the form
- the method further comprises a step S250 of encoding, according to a multimodal “Transformer” encoding model, the output , so as to obtain a plurality ( ) of temporal sequences of encoded multimodal representations ( ).
- This step is implemented by the previously mentioned MMTE "Transformer" multimodal encoder.
- the encoding step S250 comprises a sub-step of filtering the input data of the multimodal encoding model "Transformer", so as to encode only the data included in a sliding time window relative to a current instant. .
- the decoder obtains as input the intermediate evaluations previously generated by the TDL.
- the TDL MHSA takes as input a plurality (eg, ) of previously generated intermediate evaluations ([ ]) and having been weighted.
- the generation method further comprises a step S320 during which positional encoding data ( ) are determined by a positional encoding module ( ) of the decoder.
- the positional encoding data is then combined with the plurality of previously generated intermediate evaluations, so that when evaluating the situation at the instant , the entrance of the multimodal decoder "Transformer" is expressed for example in the form
- the generation method further comprises a step S330 in which a self-attention mechanism is applied to the input by the MHSA.
- the generation method further comprises a step S340 during which a cross-attention mechanism is applied by the MHCA. It is important at this stage to recall that the application of a cross-attention mechanism offers the advantage of forcing the evaluation model to focus on the different representations at a certain time (and consequently on the different modalities processed by the model), without temporal consideration.
- the output of the MHCA is expressed in the form
- the generation method further comprises a step S350 during which the first FFN conversion module generates the time sequence of intermediate evaluations [ ] such as:
- each element of this sequence is converted into a value representative of a situation (or into a vector of values representative of one or more different situations), so as to obtain a time sequence [ ] where each element corresponds, at a certain moment, to an evaluation of a particular situation.
- this temporal sequence of evaluations of a situation [ ] is used to determine whether a service, a service appropriate to the environment and/or the user, should be triggered or not.
- a plurality of digital services that can be suggested to a person and defined by respective links are stored in a correspondence table, in association with respective score thresholds.
- at least one link of a corresponding digital service is read to suggest said corresponding digital service to the user via a human-machine interface.
- the assessed situation corresponds for example to the emotional state of the person.
- a service is only recommended to the person if the intensity of an assessment of a predetermined situation is sufficiently high. This has the effect of reserving the suggestion of services to this person at times when the execution of these services would be most useful to him.
- an animation routine of a human-machine interface of any communicating equipment of the environment in which a person is located is triggered.
- the service recommendation is for example carried out on the best broadcast channel for the person, such as the living room TV, a communicating speaker, a smartphone, etc.
- the communicating equipment most suited to this purpose can be selected for example on the basis of the functionalities offered by the different communicating equipment of the installation.
- Another criterion may be an estimate of the distance, at the current time, between the different communicating devices and the person, making it possible to choose, among the different communicating devices in the installation capable of triggering the services offered, the one closest to the person at the current time.
- the assessed situation corresponds to an assessment of a person's emotional state
- the animation routine is configured to suggest to the person at least one predefined digital service associated with the assessment of their emotional state. For example, if the predicted situation is "panicked", the associated services in a preference model may be in order of preference "an incentive to call a friend", “an incentive to call the teleassistance service” or "an increase in home comfort by automatically adjusting the brightness”.
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- General Health & Medical Sciences (AREA)
- Computing Systems (AREA)
- Biomedical Technology (AREA)
- Biophysics (AREA)
- Computational Linguistics (AREA)
- Data Mining & Analysis (AREA)
- Evolutionary Computation (AREA)
- Life Sciences & Earth Sciences (AREA)
- Molecular Biology (AREA)
- Artificial Intelligence (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Mathematical Physics (AREA)
- Software Systems (AREA)
- Health & Medical Sciences (AREA)
- Machine Translation (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Testing, Inspecting, Measuring Of Stereoscopic Televisions And Televisions (AREA)
Abstract
L'invention concerne un procédé de génération d'une séquence temporelle dévaluations d'une situation par un modèle d'évaluation robuste en cas de données d'entrée manquantes. Le procédé comprend : une étape d'encodage, selon un modèle d'encodage multimodal "Transformer", de données issues d'une combinaison de données d'encodage positionnel, de données d'encodage de modalité et de données temporelles, de sorte à obtenir une pluralité de séquences temporelles de représentations multimodales encodées; une étape de décodage de sorte à obtenir une séquence temporelle d'évaluations, l'étape de décodage comprenant une sous-étape d'application d'un modèle d'auto-attention; et une sous-étape de mise en œuvre d'un modèle d'attention croisée.
Description
- La présente invention appartient au domaine général de l'analyse des données, et plus particulièrement le traitement des données pour évaluer la mesure dans laquelle une situation particulière se produit. Elle concerne plus particulièrement un procédé de génération d’une séquence temporelle d’évaluations d’une situation par un modèle d’évaluation robuste en cas de données d’entrée manquantes. Elle concerne également un dispositif électronique configuré pour mettre en œuvre un tel procédé.
- L'invention trouve une application particulièrement avantageuse, bien que nullement limitative, dans le cas où le modèle est utilisé pour évaluer l’état émotionnel d’une personne ou l’évolution de l’autonomie d’une personne fragile à son domicile, par exemple en vue de déterminer une mesure adaptée à lui fournir dans le cadre d’un service de téléassistance. L’invention s’applique également dans le cas où le modèle est utilisé dans le cadre d’un service de vidéo-surveillance, par exemple en vue de déterminer une mesure de protection adaptée d’un environnement équipé de capteurs et d’actionneurs.
- Afin de s'adapter à la croissance continue et toujours plus rapide des données émises, différentes technologies sont aujourd’hui mises en œuvre, et font l’objet de recherches et de perfectionnements en vue d’une exploitation optimale dans les années à venir.
- Parmi ces technologies, l’apprentissage multimodal connait un succès grandissant puisqu’il offre des performances bien meilleures que les méthodes qui ne considèrent qu’une unique modalité. L’objectif de l’apprentissage multimodal est de construire des modèles adaptés pour traiter des informations de différentes modalités. L’apprentissage multimodal a notamment été utilisé avec succès pour de nombreuses applications, telle que la reconnaissance d’émotions à partir de données multimodales et la détection d’évènements à partir de données multimédia.
- Les premiers travaux dans le domaine ont principalement considéré le cas où des observations complètes sont fournies en entrée du modèle, que ce soit lors de son entraînement, de sa validation ou de son exploitation. Cependant, en pratique, il est fréquent que certaines modalités soient manquantes (e.g., que les données d’entrée soient affectées par des valeurs manquantes à certains instants), qui perturbent l’apprentissage du modèle et a fortiori son exploitation. L’absence, au moins temporaire, de données pour au moins une des modalités classiquement attendue en entrée du modèle peut être causée par différentes raisons, telle qu’un problème de communication entre un capteur et un dispositif électronique dans lequel est embarqué le modèle précédemment évoqué, un problème dans la capture de données par un des capteurs, un déplacement d’un capteur dans l’environnement entraînant l’absence de capture de données pendant une certaine période, un déplacement d’une personne au sein de son environnement, etc.
- Récemment, différentes approches ont été proposées pour traiter ces modalités manquantes. Une solution relativement classique consiste tout simplement à ne pas considérer les données d’entrées (ou échantillons) pour lesquelles au moins une des modalités est manquante. Cette solution présente cependant l’inconvénient de réduire les périodes de temps au cours desquelles le modèle est entraîné ou validé, ce qui engendre une baisse significative des performances du modèle.
- D’autres méthodes dites d’imputation visent à inférer les données manquantes sur la base d’heuristiques, de sorte à pouvoir fournir en entrée du modèle des données d’entrée dont les modalités correspondent à toutes celles attendues par ce modèle. Cependant, ces méthodes d’imputation ne parviennent pas à restaurer la distribution d’origine des données manquantes, et présentent donc l’inconvénient d’introduire des biais statistiques. Par ailleurs, ces méthodes d’imputation rendent le traitement et l’analyse de données plus laborieux.
- Enfin, d’autres méthodes visent à traiter toutes les données d’entrée, même si certaines modalités sont manquantes à certains instants. Cependant, les performances de ces méthodes sont significativement réduites.
- La présente invention a pour objectif de remédier à tout ou partie des inconvénients de l’art antérieur, notamment ceux exposés ci-avant, en proposant un modèle qui soit robuste aux données manquantes, et ce, aussi bien lors de la phase d’entraînement du modèle, que lors de la phase de validation ou d’exploitation du modèle.
- Plus particulièrement, la présente invention propose un modèle considérant la complémentarité de l’information incluse dans les données d’entrée au travers de leurs différentes modalités, tout en prenant également en compte les évaluations précédentes réalisées par ce modèle. De cette manière, même si au moins une des modalités attendues par le modèle n’est pas disponible, ce dernier sera tout de même en mesure d’évaluer une situation de façon fiable.
- À cet effet, et selon un premier aspect, l’invention concerne un procédé de génération d’une séquence temporelle d’évaluations (ou de prédictions) d’une situation par un modèle d’évaluation (s’appuyant sur un réseau de neurones et) robuste en cas de données d’entrée manquantes, le procédé étant mis en œuvre par un dispositif électronique et comprenant :
- une étape d’obtention d’une pluralité de séquences temporelles de données d’entrée issues de capteurs équipant un environnement et/un utilisateur, chaque séquence étant associé à une modalité, chaque élément d’une séquence étant représentatif d’un état, à un instant, de la modalité associée à la séquence ;
- une étape d’encodage, selon un modèle d’encodage multimodal "Transformer", de données issues d’une combinaison, à chaque instant, de données d’encodage positionnel, de données d’encodage de modalité et de données temporelles déterminées à partir de la pluralité de séquences temporelles de données d’entrée, de sorte à obtenir une pluralité de séquences temporelles de représentations multimodales encodées ;
- une étape de décodage comprenant une sous-étape d’application d’un modèle d’auto-attention auto-régressif ; et une sous-étape de mise en œuvre d’un modèle d’attention croisée prenant en entrée la pluralité de séquences temporelles de représentations multimodales encodées, de sorte à générer une séquence temporelle d’évaluations intermédiaires ; et,
- une étape de conversion de la séquence temporelle d’évaluations intermédiaires en la séquence temporelle d’évaluations d’une situation, ladite séquence temporelle d’évaluations d’une situation permettant de contrôler un déclenchement d’un service adapté à l’environnement et/ou à l’utilisateur.
- Au sens de l’invention, la notion de modalité est définie comme un type de donné capturé par un dispositif électronique de capture de données (i.e., un capteur), ce type de donnée étant attendu en entrée du modèle d’évaluation selon l’invention.
- Ainsi, il est proposé un procédé de génération d’une séquence temporelle d’évaluations d’une situation, mis en œuvre par (au moins un) un réseau de neurones présentant une architecture constituée d’un encodeur et d’un décodeur.
- De façon connue en soi, l’encodeur est composé d’un ensemble de couches de neurones, qui traitent les données afin de construire des représentations dites "encodées" dans le sens où les dimensions de ces représentations sont inférieures à celles des données d’entrée (ou échantillons). Le décodeur est également composé de couches de neurones qui reçoivent ces représentations et les traitent.
- L’utilisation d’un modèle d’encodage multimodal "Transformer" offre l’avantage de combiner l’information issue de différentes modalités. D'une manière générale, l'homme du métier peut se référer au document suivant pour plus de détails concernant l'implémentation d’un modèle d’encodage "Transformer" : "Attention Is All You Need", Ashish Vaswani & Al., Advances in Neural Information Processing Systems, volume 30, NIPS, 2017.
- La suite de la description concerne plus spécifiquement un modèle d’évaluation ayant une architecture de type encodeur-décodeur. L’invention n’en reste pas moins applicable quelle que soit la nature du réseau de neurones considérée (convolution, perceptron, auto-encodeur, récurrent, etc.).
- Par ailleurs, il importe de noter qu’aucune limitation n’est attachée au type de technique d’entraînement utilisée pour obtenir le modèle d’évaluation. N’importe quelle technique implémentant un algorithme d’apprentissage ("machine learning") et fournissant, en sortie, une évaluation représentative de la probabilité qu’une certaine situation se produise compte tenu d’observations (correspondant à des données d’entrée), peut être considérée dans le contexte de l’invention (e.g., machine à vecteurs de support, régression logistique, etc.). Autrement dit, le modèle d’évaluation est indépendant de la méthode d’entraînement considérée pour entraîner ce modèle.
- En outre, n’importe quel critère d’entraînement connu de l’homme du métier peut être considéré lors de la phase d’entraînement du modèle d’évaluation, tel que la méthode des moindres carrés ou la minimisation de l'entropie croisée.
- Par ailleurs, aucune limitation n’est attachée au type ou à la modalité des données traitées par le modèle d’évaluation. De manière similaire, aucune limitation n’est attachée à la nature de la situation évaluée (i.e., la nature de la ou des situations évaluées n’est pas un facteur limitant de l’invention).
- Ainsi, dans un exemple particulier d’implémentation, les échantillons en entrée du modèle incluent des images (ou des caractéristiques extraites à partir d’images brutes), des données sonores (ou des caractéristiques extraites à partir de données sonores brutes) synchronisées avec les images, et des signaux physiologiques (ou des caractéristiques extraites à partir de signaux physiologiques) également synchronisés avec les autres données d’entrée.
- Selon un autre exemple particulier d’implémentation, les entrées du modèle d’évaluation correspondent à des ressources Internet (e.g., des pages Web, des tweets (ou "gazouillis")) ou à des documents (audio, vidéo, texte, images), et les sorties du modèle correspondent alors à la probabilité qu’un évènement se produise.
- L’utilisation d’un encodeur comprenant modèle d’auto-attention auto-régressif est avantageuse en ce qu’elle contraint le modèle d’évaluation à focaliser son attention sur des évaluations précédemment réalisées par ce même modèle, pour une situation que l’on suppose comme n’évoluant pas de manière brutale dans le temps.
- Enfin, l’utilisation d’un modèle d’attention croisée offre l’avantage de contraindre le modèle d’évaluation à se focaliser sur les différentes représentations à un certain instant (et par conséquent sur les différentes modalités traitées par le modèle), sans considération temporelle.
- De manière générale, on considère que les étapes d’un procédé ne doivent pas être interprétées comme étant liées à une notion de succession temporelle.
- Dans des modes particuliers de mise en œuvre, le procédé de génération peut comporter en outre l’une ou plusieurs des caractéristiques suivantes, prises isolément ou selon toutes les combinaisons techniquement possibles.
- Dans des modes particuliers de mise en œuvre, le modèle d’auto-attention est auto-régressif en ce que, à un instant courant
, le modèle d’auto-attention prend en entrée les évaluations intermédiaires précédemment déterminées par le modèle d’évaluation à partir de données d’entrées associées à des instants passés . - Dans des modes particuliers de mise en œuvre, les données d’encodage positionnel représentent, pour chaque séquence temporelle de données d’entrée, l’importance de la position d’au moins un desdits éléments dans ladite séquence.
- Dans des modes particuliers de mise en œuvre, les données d’encodage de modalité représentent l’importance d’une modalité parmi les modalités de la pluralité de séquences temporelles de données d’entrée.
- Dans des modes particuliers de mise en œuvre, le procédé de génération comprend en outre une étape de détermination des données temporelles par application d’au moins un réseau de convolution temporel sur la pluralité de séquences temporelles de données d’entrée.
- Dans des modes particuliers de mise en œuvre, un réseau de convolution temporel distinct est appliqué à chacune des séquences temporelles de données d’entrée.
- Dans des modes particuliers de mise en œuvre, l’étape d’encodage comprend une sous-étape de filtrage des données en entrée du modèle d’encodage multimodal "Transformer", de sorte à n’encoder que les données comprises dans une fenêtre de temps glissante par rapport à un instant courant
. - Cette sous-étape de filtrage est avantageuse en ce qu’elle contraint le modèle d’évaluation à se focaliser sur une information récente, qui a plus de probabilité d’influencer la situation courante qu’une information associée à un passé lointain.
- Dans des modes particuliers de mise en œuvre, la séquence temporelle d’évaluations intermédiaires comprend une pluralité d’éléments multidimensionnels, et l’étape de conversion comprend l’application d’une couche d’un réseau de neurones "fully-connected" (entièrement connecté) sur la séquence temporelle d’évaluations intermédiaires, de sorte à convertir chaque élément multidimensionnel en une valeur d‘évaluation d’une situation.
- Dans des modes particuliers de mise en œuvre, le procédé comprend en outre une étape de détermination de données d’encodage positionnel, et de combinaison des évaluations intermédiaires
précédemment déterminées par ledit modèle d’évaluation à partir de données d’entrées associées à des instants avec les données d’encodage positionnel déterminées, de sorte à obtenir les évaluations intermédiaires. - Dans des modes particuliers de mise en œuvre, le modèle d’attention croisée prend en entrée
représentations encodées et associées à un instant courant , avec le nombre de séquences temporelles de données d’entrée. - Dans des modes particuliers de mise en œuvre, le procédé de génération selon l’invention comprend en outre :
- une étape d’obtention d’une pluralité de séquences temporelles de données d’apprentissage étiquetées, chaque séquence étant associé à une modalité, chaque élément d’une séquence étant représentatif d’un état, à un instant, de la modalité associée à la séquence ;
- une étape d’entraînement du modèle d’évaluation en minimisant une fonction coût définie telle que
avec le coefficient de corrélation de concordance. - Dans des modes particuliers de mise en œuvre, le procédé de génération selon l’invention comprend en outre :
- une étape de génération itérative d’évaluations de la situation, par le modèle d’évaluation, en traitant des données d’entrée d’une même modalité à chaque itération, de sorte à classer les modalités en fonction de leur impact sur les performances du modèle d’évaluation ;
- une étape de réentraînement du modèle d’évaluation, en prenant en entrée des données d’apprentissage dont la modalité à un impact sur les performances du modèle d’évaluation inférieur à un seuil prédéterminé.
- Dans des modes particuliers de mise en œuvre, la situation correspond à un état émotionnel d’un utilisateur.
- Dans des modes particuliers de mise en œuvre,
- les capteurs comprennent un dispositif de capture de son et la séquence temporelle de données d’entrée associée comprend des éléments représentatifs de paroles émises par l’utilisateur et/ou de la prosodie de l’utilisateur (modalité sonore) ; et/ou
- les capteurs comprennent un capteur physiologique, et la séquence temporelle de données d’entrée associée comprend des éléments (
) représentatifs du rythme cardiaque, respiratoire et/ou de l’activité électrique cérébrale de l’utilisateur (modalité physiologique) ; - les capteurs comprennent un dispositif de capture d’image, et la séquence temporelle de données d’entrée associée comprend des éléments représentatifs de l’expression faciale et/ou corporelle de l’utilisateur (modalité visuelle).
- Selon un deuxième aspect, l’invention concerne un programme d’ordinateur comportant des instructions pour la mise en œuvre d’un procédé de génération selon l’invention, lorsque ledit programme est exécuté par un processeur.
- Selon un troisième aspect, l’invention concerne un support d'informations ou d’enregistrement lisible par un ordinateur sur lequel est enregistré le programme d’ordinateur selon l’invention.
- Le support d'informations ou d'enregistrement peut être n'importe quelle entité ou dispositif capable de stocker le programme. Par exemple, le support peut comporter un moyen de stockage, tel qu'une ROM, par exemple un CD ROM ou une ROM de circuit microélectronique, ou encore un moyen d'enregistrement magnétique, par exemple une disquette (floppy disk) ou un disque dur.
- D'autre part, le support d'informations ou d'enregistrement peut être un support transmissible tel qu'un signal électrique ou optique, qui peut être acheminé via un câble électrique ou optique, par radio ou par d'autres moyens. Le programme selon l'invention peut être en particulier téléchargé sur un réseau de type Internet.
- Alternativement, le support d'informations ou d'enregistrement peut être un circuit intégré dans lequel le programme est incorporé (ou embarqué), le circuit étant adapté pour exécuter ou pour être utilisé dans l'exécution du procédé en question.
- Selon un quatrième aspect, l’invention concerne un dispositif électronique comprenant un modèle d’évaluation configuré pour déterminer une séquence temporelle d’évaluations d’une situation, le modèle étant robuste en cas de données d’entrée manquantes, le dispositif comprenant :
- un module d’obtention d’une pluralité de séquences temporelles de données d’entrée issues de capteurs équipant un environnement et/un utilisateur, chaque séquence étant associé à une modalité, chaque élément d’une séquence étant représentatif d’un état, à un instant, de la modalité associée à la séquence ;
- un encodeur multimodal "Transformer" configuré pour encoder des données issues d’une combinaison, à chaque instant, de données d’encodage positionnel, de données d’encodage de modalité et de données temporelles déterminées à partir de la pluralité de séquences temporelles de données d’entrée, de sorte à obtenir une pluralité de séquences temporelles de représentations multimodales encodées ;
- un décodeur multimodal "Transformer" configuré pour générer une séquence temporelle d’évaluations intermédiaires, le décodeur multimodal comprenant un sous-module d’auto-attention multi-tête auto-régressif ; et un sous-module d’attention croisée multi-tête prenant en entrée la pluralité de séquences temporelles de représentations multimodales encodées ;
- un module de conversion de la séquence temporelle d'évaluations intermédiaires en la séquence temporelle d’évaluations d’une situation ; et,
- un module de contrôle d’un déclenchement d’un service adapté à l’environnement et/ou à l’utilisateur, en fonction de la séquence temporelle d’évaluations d’une situation.
- D’autres caractéristiques et avantages de la présente invention ressortiront de la description faite ci-dessous, en référence aux dessins annexés qui en illustrent un exemple de réalisation dépourvu de tout caractère limitatif. Sur les figures :
-
la est une illustration de données d’entrée d’un modèle d’évaluation, lors d’observations complètes, et la est une illustration de données d’entrée du modèle d’évaluation, lorsque des données sont manquantes. -
La représente un exemple de système d’évaluation comprenant un dispositif électronique tel que proposé ; -
La représente schématiquement un exemple d’architecture d’un encodeur du modèle d’évaluation tel que proposé ; -
La représente schématiquement un exemple d’architecture d’un décodeur du modèle d’évaluation tel que proposé ; -
La représente schématiquement un exemple d’architecture matérielle d’un dispositif électronique d’évaluation tel que proposé ; -
La illustre, sous forme d’ordinogramme, les principales étapes d’un procédé général d’évaluation d’une situation, selon un exemple de mise en œuvre de l’invention. - La
est une illustration de données d’entrée du modèle d’évaluation, lors d’observations complètes, et la est une illustration de données d’entrée du modèle d’évaluation, lorsque des données sont manquantes. - Dans cet exemple, à chaque instant
, le modèle d’évaluation attend en entrée des échantillons de données (ou éléments) associées à deux modalités différentes et . La modalité correspond à la modalité visuelle, et les données d’entrées associées à cette modalité correspondent à des caractéristiques issues d’images du visage d’une personne. La modalité correspond à la modalité dite physiologique, et les données d’entrées associées à cette modalité correspondent à des signaux représentatifs de l’activité respiratoire, cardiaque et/ou cérébrale de cette même personne. - La figure 1A illustre un premier exemple où toutes les observations sont complètes, c’est-à-dire qu’à chaque instant
, le modèle traite en entrée des échantillons incluant des données associées à toutes les modalités attendues. - La figure 1B illustre quant-à-elle le cas de données manquantes. Plus précisément, à l’instant
le modèle reçoit en entrée un échantillon correspondant à une observation complète puisqu’il inclue des données des deux modalités et . Puis à l’instant le modèle reçoit en entrée un échantillon incluant des données de la modalité uniquement. À cet instant , le modèle reçoit donc en entrée des données manquantes. Cette situation est par exemple la conséquence d’un problème sur le réseau de télécommunications liant le dispositif de capture (e.g., la caméra vidéo) et le dispositif électronique dans lequel est incorporé ou embarqué le modèle d’évaluation. À l’instant le modèle reçoit de nouveau en entrée un échantillon correspondant à une observation complète. Puis à partir de l’instant le modèle reçoit en entrée un échantillon incluant uniquement des données de la modalité - La
représente un exemple de système d’évaluation comprenant un dispositif électronique d’évaluation (10) tel que proposé. Dans cet exemple, le dispositif électronique (10) comprend un modèle d’évaluation utilisé pour évaluer l’état émotionnel d’une personne fragile (ex : sénior, personne souffrant de déficience, personne isolée, etc.) à son domicile, en vue de déterminer une mesure adaptée à lui fournir dans le cadre d’un service de téléassistance. - Un tel système est particulièrement avantageux pour le maintien à domicile des personnes fragiles. En effet, dans ce cadre, il apparaît nécessaire d’avoir une meilleure compréhension des émotions de ces personnes, afin de fournir une mesure d’autonomie et des services adaptés à la situation. Cette évaluation de l’état émotionnel est un des indicateurs forts pour évaluer la bonne santé physique, sociale et morale de personnes fragiles par le corps médical au travers de services de téléassistance. Par ailleurs, les émotions d’une personne peuvent également révéler des évolutions de son autonomie.
- Aussi, le modèle d’évaluation est configuré pour traiter des données brutes émises par des capteurs multimodaux équipant l’environnement (e.g., le domicile) dans lequel se situe une personne, pour déterminer un score d’émotion représentatif d’un état émotionnel, puis pour déclencher (ou pas) un certain service afin d’influencer cet état émotionnel.
- Plus précisément, dans un exemple particulier de mise en œuvre, le modèle d’évaluation est configuré pour évaluer des situations émotionnelles "négatives" de personnes à partir de données brutes issues de capteurs équipant un habitat connecté, et, en cas d’évaluation d’une telle situation, pour déclencher des services incitant ces personnes à avoir des émotions "plus positives". D'une manière générale, l'homme du métier peut se référer à l’ouvrage suivant pour plus de détails concernant la classification d’émotions : "Emotions in Social Psychology", Key Readings in Social Psychology, W. Gerrod Parrott, Psychology Press, 2000.
- Dans un exemple particulier de mise en œuvre, quinze classes d’émotions sont définies : neutre (1), dégoûté (2), paniqué (3), anxieux (4), en colère (5), colère froide (6), désespéré (7), triste (8), enthousiaste (9), content (10), intéressé (11), ennuyé (12), honteux (13), fier (14) et méprisant (15). Les classes dégoûté (2), paniqué (3), anxieux (4), en colère (5), colère froide (6), désespéré (7), triste (8), ennuyé (12), et honteux (13) peuvent être considérées comme négatives et les classes d’émotions enthousiaste (9), content (10), intéressé (11), peuvent être considérées comme positives.
- Les services pouvant être fournis par le modèle d’évaluation en réponse à une évaluation d’une situation (e.g., une émotion négative) sont par exemple identifiés par des liens (e.g., des adresses Web) et stockés dans une table de correspondance associant lesdits services avec des valeurs prédéterminées de scores respectifs.
- En cas de dépassement d’une valeur seuil, au moins un lien vers un service numérique correspondant est accédé, puis son activation est proposée à cette personne via une interface homme-machine (non représentée). En variante, ce service est automatiquement déclenché.
- Tel qu’illustré en
, le système d’évaluation comprend un dispositif électronique d’évaluation (10) configuré pour obtenir ou recevoir de manière continue un ensemble de signaux. Chaque signal de l’ensemble transporte des données d’au moins une modalité. - Ces signaux sont générés par des capteurs connectés, puis transmis à destination du dispositif électronique d’évaluation (10) au travers d’un réseau de télécommunication (non représenté). Dans cet exemple, les capteurs connectés comprennent un dispositif de séquences d’images (e.g., une caméra-vidéo ou un appareil photo) (10) configuré pour capturer des images d’une personne détectée dans une zone de capture de cette caméra.
- Un enregistrement vidéo de la personne est alors obtenu (modalité visuelle). Cet enregistrement est analysé par un module d’analyse ("Video Content Analysis" selon la terminologie anglo-saxonne) de la caméra vidéo (20) ou alternativement du dispositif électronique d’évaluation (10), de sorte à recueillir différentes caractéristiques relatives au visage ou aux expressions faciales, aux différents gestes ou postures, aux déplacements de la personne, à la luminosité ambiante, etc.
- Le dispositif électronique d’évaluation (10) est également configuré pour recevoir de manière simultanée d’autres signaux émis par d’autres capteurs équipant l’environnement ou la personne fragile.
- Ainsi, le système d’évaluation de la
comprend en outre un dispositif de capture audio (40) configuré pour recueillir un enregistrement audio. Le traitement de cet enregistrement audio est par exemple mis en œuvre par ledit dispositif de capture audio (40), afin d’en extraire des signaux représentatifs de paroles émises par la personne et/ou de la prosodie de cette personne, d’un niveau sonore ambiant, d’une estimation de position de la personne, etc. Ainsi, dans cet exemple, le dispositif de capture audio (40) est configuré pour transmettre une pluralité de signaux différents (mais associés à une même modalité sonore) à destination du dispositif électronique d’évaluation (10). En variante, ces traitements sur les signaux bruts sont réalisés par un module d’analyse du dispositif électronique d’évaluation (10). - Enfin, le système d’évaluation de la
comprend un dispositif de capture de signaux physiologiques (30) prenant dans cet exemple la forme d’une montre connectée. Ce dispositif de capture de signaux physiologiques (30) est configuré pour capturer et traiter des signaux représentatifs du rythme cardiaque, du rythme respiratoire et/ou de l’activité électrique cérébrale de cette personne. En variante, les traitements sur les différents signaux physiologiques (mais associés à une même modalité physiologique) sont mis en œuvre par un module d’analyse du dispositif électronique d’évaluation (20). - La
représente schématiquement un exemple d’architecture d’un encodeur du modèle d’évaluation tel que proposé. - Tel qu’illustré en figure 3, l’encodeur prend en entrée
séquences temporelles de données d’entrée issues de capteurs équipant un environnement et/un utilisateur. Chaque séquence est associée à une modalité , et comprend une série d’éléments . Chacun de ces éléments est représentatif d’un état, à un instant , de la modalité associée à la séquence. - Cet encodeur comprend
réseaux de convolution temporels (TCN) qui prennent en entrée les séquences temporelles de données d’entrée. Autrement dit, un réseau de convolution temporel est dédié à chacune des modalités attendues en entrée du modèle. De façon connue en soi, chacun des réseaux de convolution temporels (TCN) permet d’extraire données temporelles . En variante, le modèle d’évaluation ne comprend qu’un unique réseau de convolution temporel (TCN) qui prend en entrée les séquences temporelles de données. - De manière plus formelle, soit
un élément représentatif d’un état, à un instant , de la modalité , de dimension . Soit la séquence de longueur d’états associés à la modalité m, alors -
- avec
la séquence en sortie du TCN. Pour chacune des modalités, les sorties ont une même taille . - Cet encodeur comprend en outre
modules d’encodage positionnel prenant la forme de réseaux de neurones (ou correspondant à une ou plusieurs couches d’un réseau de neurones), chaque module d’encodage positionnel générant données temporelles pondérées à partir des éléments . Ces poids (ou données d’encodage positionnel ( )) représentent, pour chaque séquence temporelle de données d’entrée, l’importance de la position d’au moins un desdits éléments dans ladite séquence . - De manière plus formelle, pour une modalité donnée, soit
la séquence de données d’encodage positionnel avec , alors la sortie d’un des modules d’encodage positionnel s’exprime sous la forme -
- L’encodeur comprend en outre
modules d’encodage modal prenant également la forme d’un réseau de neurones (ou correspondant à une ou plusieurs couches d’un réseau de neurones), chaque module d’encodage modal prenant en entrée les sorties d’un des modules d’encodage positionnel, et générant données temporelles pondérées . Ces poids (ou données d’encodage de modalité) ( ) représentent l’importance d’une modalité parmi les modalités des séquences temporelles de données d’entrée. - Pour chaque modalité
donnée, une donnée d’encodage de modalité est déterminée puis ajoutée à chaque entrée du module d’encodage modal associé. La sortie de ce module d’encodage modal s’exprime alors sous la forme -
- De manière plus précise, les éléments
et sont combinés par un module de combinaison, de sorte à n’obtenir qu’une séquence d’éléments "simples". De manière plus formelle, soit , et M le nombre de modalités attendues par le modèle d’évaluation, alors la séquence combinée s’exprime sous la forme: -
- Les
séquences combinées sont traitées par un encodeur multimodal "Transformer" (MMTE). Plus précisément, cet encodeur multimodal "Transformer" est configuré pour encoder des données issues d’une combinaison, à chaque instant, de données d’encodage positionnel , de données d’encodage de modalité et de données temporelles déterminées à partir des séquences temporelles de données d’entrée, de sorte à obtenir séquences temporelles de représentations multimodales encodées . - De manière plus formelle, les représentations encodées
en sortie de l’encodeur multimodal Transformer s’expriment sous la forme : -
- avec
une fonction mise en œuvre par l’encodeur multimodal "Transformer" (MMTE). - De façon connue en soi, un encodeur "Transformer" comprend une pile d’encodeurs identiques mais qui ne partagent pas leurs poids. Chaque encodeur
de la pile est typiquement divisé en deux modules : - un module d’auto-attention qui contraint l’encodeur à considérer les autres éléments d’une même séquence de données d’entrée lorsqu’il encode un élément en particulier (mode "mono-modal") ; et,
- un module s’appuyant sur un réseau de neurones à propagation avant ("feed forward neural network" selon la terminologie anglo-saxonne).
- Le module d’auto-attention d’un encodeur
est configuré pour prendre en entrée un élément (e.g., un vecteur de données), et générer en sortie une représentation intermédiaire , qui est elle-même transmise au module s’appuyant sur un réseau de neurones à propagation avant de cet encodeur , de sorte à générer une représentation . - Cette représentation
est ensuite transmise au module d’auto-attention de l’encodeur de la pile qui génère en sortie une représentation intermédiaire , qui est elle-même transmise au module s’appuyant sur un réseau de neurones à propagation avant de cet encodeur , de sorte à générer une représentation . Etc. - D'une manière générale, l'homme du métier peut se référer au document suivant pour plus de détails concernant l'implémentation d’un encodeur multimodal "Transformer" : "Transformer Encoder With MultiModal Multi-Head Attention for Continuous Affect Recognition", H. Chen & Al., IEEE Transactions on Multimedia, vol. 23, pp. 4171-4183, 2021.
- La
représente schématiquement un exemple d’architecture d’un décodeur du modèle d’évaluation tel que proposé. - Tel qu’illustré en
, le décodeur du modèle d’évaluation tel que proposé comprend un décodeur multimodal "Transformer" TDL, ce décodeur multimodal "Transformer" TDL comprenant un module d’auto-attention multi-tête MHSA auto-régressif, un module d’attention croisée multi-tête MHCA, et un premier module de conversion FFN prenant la forme d’un réseau de neurones "fully-connected" (entièrement connecté). - Le MHSA est connecté au MHCA qui est lui-même connecté au FFN. Le TDL est lui-même connecté à un deuxième module de conversion (FC) prenant la forme d’une couche d’un réseau de neurones "fully-connected" (entièrement connecté).
- Le TDL génère en sortie une séquence temporelle d’évaluations intermédiaires
. - Le MHSA est dit auto-régressif dans le sens où il prend en entrée les évaluations intermédiaires précédemment générées par le TDL. De manière plus précise, dans le cas où le décodeur cherche à évaluer une situation à l’instant courant
, le MHSA du TDL prend en entrée une pluralité d’évaluations intermédiaires précédemment générées ( ) et ayant été pondérées. - Il importe à ce stade de rappeler que l’utilisation d’un MHSA auto-régressif est avantageuse en ce qu’elle contraint le modèle d’évaluation à focaliser son attention sur des évaluations précédemment réalisées par ce même modèle, pour une situation que l’on suppose comme n’évoluant pas de manière brutale dans le temps.
- Le décodeur comprend en outre un module d’encodage positionnel référencé
et prenant la forme d’un réseau de neurones (ou correspondant à une ou plusieurs couches d’un réseau de neurones). Ce module d’encodage positionnel est configuré pour pondérer ces évaluations intermédiaires précédemment générées, et fonctionne de manière similaire à ceux précédemment évoqués en référence à la . - De manière plus formelle, le mécanisme d’attention multi-têtes du MHSA et du MHCA projette un vecteur de requête ("query" selon la terminologie anglo-saxonne) à une première position vers un vecteur de clef
à une deuxième position afin de déterminer l’attention (i.e., la pondération) à donner à un vecteur de valeurs associée à la position du vecteur de clef . La valeur finale correspond à la somme pondérée des vecteurs de valeurs aux différentes positions. Le mécanisme d’attention multi-têtes s’exprime alors de la manière suivante : -
- avec Q, K et V les séquences utilisées comme requête ("query"), clef et valeur.
- Dans le cas où une situation à l’instant
est évaluée, le TDL a préalablement généré la séquence avec . L’entrée du décodeur s’exprime alors de la manière suivante : -
- avec
un vecteur initialisé à l’aide de valeurs aléatoires ou prédéterminées. - Cette entrée est pondérée par le module d’encodage positionnel
qui génère la séquence suivante -
- Au sein du TDL, la séquence
est tout d’abord traitée par le MHSA. Il importe à ce stade de rappeler que le MHSA utilise un mécanisme d’auto-attention visant à focaliser son attention sur des évaluations précédemment réalisées par ce même modèle d’évaluation. Par conséquent, les vecteurs requête, clef et valeur sont tous les trois déterminés à partir de la séquence d’entrée . La séquence de caractéristiques en sortie du MHSA s’exprime alors sous la forme : -
- Ces séquences de caractéristiques sont ensuite traitées par le module MHCA qui offre l’avantage de contraindre le modèle d’évaluation à se focaliser sur les différentes représentations à un certain instant (et par conséquent sur les différentes modalités traitées par le modèle), sans considération temporelle.
- De manière plus précise, le MHCA prend en entrée la séquence de représentations encodées
. Autrement dit, les vecteurs clefs et valeurs sont déterminés à partir de cette séquence de représentations encodées, et le vecteur requête correspond à la sortie du MHSA. De manière plus formelle, la sortie du MHCA s’exprime sous la forme -
- Ainsi, dans le cas où une situation à l’instant
est évaluée, le MHCA prend en entrée les représentations encodées associés à cet instant uniquement, de sorte à contraindre le modèle d’évaluation à se focaliser sur les différentes représentations, sans considération temporelle. - Le TDL comprend en outre un premier module de conversion (FFN) prenant la forme d’un réseau de neurones "fully-connected" (entièrement connecté). Soit
, avec . Alors, la séquence temporelle d’évaluations intermédiaires [ ] en sortie de ce premier module de conversion s’exprime de la manière suivante : -
- et
avec . - L’invention à jusqu’à présent été décrite dans le cas où le décodeur ne comprend qu’un seul TDL. Ces développements sont cependant généralisables sans difficulté par l'homme du métier au cas où le décodeur comprend une pile de TDLs. Dans ce cas particulier, les développements précédemment évoqués s’appliquent au premier TDL (à être entré dans la pile), et la séquence
correspond à l’entrée du deuxième TDL (à être entré dans la pile). Le dernier TDL (à être entré dans la pile) détermine la séquence de données intermédiaires [ ] telle que avec . - Le décodeur comprend en outre le deuxième module de conversion (FC) qui prend en entrée cette séquence
, et convertit chaque élément de la séquence en une valeur représentative d’une situation (ou en un vecteur de valeurs représentatif d’une ou plusieurs situations différentes), de sorte à obtenir une séquence temporelle où chaque élément correspond, à un certain instant, à une évaluation d’une situation particulière. Comme évoqué précédemment, ce deuxième module de conversion prend la forme d’une couche d’un réseau de neurones "fully-connected" (entièrement connecté) appliqué à chacun des éléments de la séquence séquence . - Dans un mode de mise en œuvre particulier, le même deuxième module de conversion est appliqué à chaque élément.
- La
représente schématiquement un exemple d’architecture matérielle d’un dispositif électronique d’évaluation (10) tel que proposé. - Tel qu’illustré par la
, le dispositif électronique d’évaluation 10 dispose de l’architecture matérielle d’un ordinateur. Ainsi, le dispositif électronique d’évaluation 10 comporte, notamment, un processeur 1, une mémoire vive 2, une mémoire morte 3 et une mémoire non volatile 4. Il comporte en outre un module de communication 5. - La mémoire morte 3 du dispositif de communication sans fil 10 constitue un support d’enregistrement tel que proposé, lisible par le processeur 1 et sur lequel est enregistré un programme d’ordinateur PROG conforme à l’invention, comportant des instructions pour l’exécution d’étapes du procédé de génération tel que proposé ci-après. Le programme PROG définit un ou plusieurs modules fonctionnels du dispositif électronique d’évaluation, qui s’appuient ou commandent les éléments matériels 1 à 5 cités précédemment, et qui comprennent notamment:
- un module d’obtention d’une pluralité (
) de séquences temporelles de données d’entrée issues de capteurs équipant un environnement et/un utilisateur, chaque séquence étant associé à une modalité ( ), chaque élément ( ) d’une séquence étant représentatif d’un état, à un instant ( ), de la modalité ( ) associée à la séquence ; - un encodeur multimodal "Transformer" (MMTE) configuré pour encoder des données issues d’une combinaison, à chaque instant, de données d’encodage positionnel (
), de données d’encodage de modalité ( ) et de données temporelles déterminées à partir de la pluralité ( ) de séquences temporelles de données d’entrée, de sorte à obtenir une pluralité ( ) de séquences temporelles de représentations multimodales encodées ( ) ; - un décodeur multimodal "Transformer" (TDL) configuré pour générer une séquence temporelle d’évaluations intermédiaires (
), le décodeur multimodal comprenant un sous-module d’auto-attention multi-tête (MHSA) auto-régressif ; et un sous-module d’attention croisée multi-tête (MHCA) prenant en entrée la pluralité ( ) de séquences temporelles de représentations multimodales encodées ( ) ; - un module de conversion (FC) de la séquence temporelle d'évaluations intermédiaires en la séquence temporelle d’évaluations d’une situation ; et,
- un module de contrôle (non représenté) d’un déclenchement d’un service adapté à l’environnement et/ou à l’utilisateur, en fonction de la séquence temporelle d’évaluations d’une situation.
- Par ailleurs, le dispositif de communication sans fil 10 peut encore comporter d’autres modules, notamment pour mettre en œuvre des modes particuliers du procédé de communication en full-duplex, comme cela est décrit plus en détail ultérieurement.
- ] La
illustre, sous forme d’ordinogramme, les principales étapes d’un procédé général d’évaluation d’une situation, selon un exemple de mise en œuvre de l’invention ; - Tel qu’illustré par la
, le procédé général d’évaluation d’une situation comprend une première phase S1000 d’entraînement d’un modèle d’évaluation comprenant les étapes S110 à S140, et une deuxième phase S2000 de validation ou d’exploitation du modèle d’évaluation et comprenant les étapes S210 à S360, cette deuxième phase correspondant à un exemple de procédé de génération tel que proposé. - Phase S1000 d’entraînement
- Le procédé comprend une première étape S110 d’obtention d’une pluralité (
) de séquences temporelles de données d’apprentissage étiquetées, chaque séquence étant associé à une modalité , chaque élément d’une séquence étant représentatif d’un état, à un instant , de la modalité associée à la séquence. Cette étape S110 est mise en œuvre par le module d’obtention d’une pluralité de séquences temporelles précédemment évoqué. - De manière plus concrète, ces données d’apprentissage sont fournies en entrée du modèle sous la forme de vecteurs de données.
- Dans un exemple particulier de mise en œuvre, des données brutes émises par différents types de capteurs – chaque capteur étant associé à une modalité particulière – sont enregistrées en continu dans une base de données. Les échantillons de ces données brutes sont étiquetés à l’aide d’une valeur représentative d’une ou de plusieurs catégories ou classes. Cette valeur représentative est par exemple comprise dans l’intervalle [-1 ;1].
- Dans un exemple particulier de mise en œuvre, des signaux associés à une modalité visuelle (et correspondant par exemple à des séquences images capturées par un dispositif de capture d’images tel qu’une caméra ou un appareil photo), à une modalité sonore (et correspondant par exemple à des échantillons sonores capturés par un microphone) et à une modalité physiologique (et correspondant par exemple à des signaux représentatifs d’une fréquence respiratoire, cardiaque et/ou à une activité électrique cérébrale capturés par une montre connectée) sont considérés.
- Dans un exemple particulier de mise en œuvre, le modèle d’évaluation est un modèle d’évaluation d’un état émotionnel, et quinze classes d’émotions sont définies : neutre (1), dégoûté (2), paniqué (3), anxieux (4), en colère (5), colère froide (6), désespéré (7), triste (8), enthousiaste (9), content (10), intéressé (11), ennuyé (12), honteux (13), fier (14) et méprisant (15). Les classes dégoûté (2), paniqué (3), anxieux (4), en colère (5), colère froide (6), désespéré (7), triste (8), ennuyé (12), et honteux (13) peuvent être considérées comme négatives et les classes d’émotions enthousiaste (9), content (10), intéressé (11), peuvent être considérées comme positives.
- Cette base de données est accessible par un module d’analyse des données brutes, par exemple embarqué dans le dispositif électronique d’évaluation 10, et qui est alors configuré pour générer de nouveaux signaux sur la base des données brutes. Ce module d’analyse est par ailleurs configuré pour segmenter les données brutes en tronçons de données d’un intervalle de temps prédéterminé (par exemple 30 secondes), et ce sans recouvrement des tronçons.
- La segmentation temporelle permet de disposer de séries temporelles d’intérêt chronologiquement synchronisées. Par exemple, une segmentation temporelle en intervalles de temps de 30 secondes a pour effet que toutes les séries temporelles d’intérêt comportent, pour chaque intervalle de temps de 30 secondes, une valeur de grandeur d’intérêt associée. Cette synchronisation temporelle permet par exemple d’établir des corrélations multimodales entre les valeurs de différentes grandeurs d’intérêt au cours d’un même intervalle de temps, ou au cours d’intervalles de temps consécutifs. Ainsi, il est possible de structurer dans le modèle, par exemple, une corrélation entre le débit de parole de l’utilisateur au cours d’un intervalle de temps donné et une expression faciale au cours d’un intervalle de temps suivant.
- Puis le module d’analyse identifie des caractéristiques d’intérêt (e.g., un visage, des paroles de l’individu, etc.) à partir des données brutes, et génère des signaux d’intérêt. Ces signaux d’intérêt sont enfin traités par le module d’analyse de sorte à générer des données d’apprentissage qui seront utilisées lors de la phase d’entraînement S1000 du modèle d’évaluation.
- Ce traitement permet, de manière générale, de mettre en forme les signaux d’intérêt en vue de l’évaluation de la situation (e.g., de l’état émotionnel de la personne).
- Dans un exemple particulier de mise en œuvre, les traitements visés incluent le calcul des caractéristiques faciales ("Facial Action Units" selon la terminologie anglo-saxone), des caractéristiques sonores eGeMAPS ("extended Geneva Minimalistic Acoustic Parameter Set" selon la terminologie anglo-saxone), et/ou une concaténation de données BPM ("Beat Per Minutes" selon la terminologie anglo-saxonne), d’un électrocardiogramme, et d’une fréquence respiratoire).
- Dans un exemple particulier de mise en œuvre, les traitements visés incluent au moins un parmi : l’application d’un filtrage passe-bas, une normalisation, ou un ré-échantillonnage. Le filtrage passe-bas offre l’avantage de débruiter l’information, la normalisation permet d’uniformiser les données et le ré-échantillonnage de données permet de synchroniser les sources.
- La phase d’entraînement comprend en outre une étape S120 au cours de laquelle le modèle d’évaluation est entraîné, en traitant les données d’apprentissage obtenues lors de l’étape S110.
- Dans un mode particulier de mise en œuvre, le modèle d’évaluation est entraîné par application d’une fonction coût définie telle que
avec le coefficient de corrélation de concordance. - On rappelle à ce stade que le coefficient de corrélation de concordance s’exprime sous la forme
-
- avec
le coefficient de corrélation entre les valeurs prédites et les valeurs exactes ("ground-truth values"), la déviation standard et la moyenne soit des valeurs prédites, soit des valeurs exactes. - Dans un mode particulier de mise en œuvre, la phase S1000 comprend en outre les étapes S130 et S140. Lors de l’étape S130, la ou les modalités ayant un impact significatif sur l’évaluation d’une situation donnée sont identifiées. Pour ce faire, le modèle d’évaluation est tout d’abord entraîné par application de l’étape S120, puis ce même modèle d’évaluation, une fois entraîné, est évalué en traitant des données d’une seule modalité à la fois. Autrement dit, ce modèle d’évaluation évalue une même situation de manière itérative, en considérant à chaque itération des données d’entrées issues d’une même modalité.
- Puis les itérations au cours desquelles la performance de l’évaluation est faible (e.g, la ou les plus faibles ou, en variantes, celles inférieures à une valeur seuil prédéterminée) sont déterminées, qui correspondent aux modalités ayant un impact significatif sur les performances d’évaluation du modèle. De cette manière, chacune des modalité est classée selon son impact sur les performances du modèle de prédiction.
- La phase d’entraînement S1000 comprend alors une étape S140 au cours de laquelle le modèle d’évaluation est ré-entraîné, mais cette fois en excluant, des données d’entrée, celles associées aux modalités déterminés lors de l’étape S130 comme ayant un impact significatif sur les performances d’évaluation.
- Selon un exemple particulier, pour chaque séquence de données d’entrée, les données associées aux modalités ayant un impact significatif avec une probabilité
sont exclues du réapprentissage, avec une probabilité que la donnée soit manquante ou présente, et seules les modalités ayant une probabilité sont considérées en entrée du modèle d’évaluation lors de cette étape S140. - Ainsi, en cachant au modèle d’évaluation les modalités ayant un impact significatif sur les performances, cela contraint ce modèle à évaluer les corrélations entre les modalités ayant un impact moins significatif. Ainsi, ces étapes S130 et S140 permettent d’obtenir un modèle d’évaluation d’une situation qui soit plus robuste en cas de données manquantes pour au moins une des modalités classiquement attendues en entrée du modèle d’évaluation, et ayant un impact significatif sur les performances.
- Phase S2000 de validation ou d’exploitation du modèle préalablement entraîné
- Cette phase S2000 correspond à un procédé de génération d’une séquence temporelle d’évaluations (ou prédictions) d’une situation par un modèle d’évaluation (s’appuyant sur un réseau de neurones et) robuste en cas de données d’entrée manquantes.
- La phase S2000 comprend les étapes S210 à S250 mises en œuvre par l’encodeur tel que représenté par la
, et les étapes S310 à S360 mises en œuvre par de décodeur tel que représenté par la . - Tel qu’illustré en figure 6, le procédé de génération d’une séquence comprend une première étape d’obtention de données d’entrée d’une pluralité (
) de séquences temporelles de données d’entrée issues de capteurs équipant un environnement et/un utilisateur, chaque séquence étant associé à une modalité ( ), chaque élément ( ) d’une séquence étant représentatif d’un état, à un instant ( ), de la modalité ( ) associée à la séquence. - L’étape d’obtention de ces données d’entrée est similaire à l’étape S110, et n’est pas ré-détaillée par soucis de concision. Puisqu’il s’agit d’une phase de validation ou d’exploitation, cette étape S210 se distingue de l’étape S110 par le fait que les données d’entrées ne sont bien entendu pas étiquetées. Cette étape est mise en œuvre par le module d’obtention d’une pluralité de séquences temporelles précédemment évoqué.
- Le procédé de génération d’une séquence comprend en outre une étape S220 au cours de laquelle des données temporelles sont déterminées par application d’au moins du réseau de convolution temporel TCN de l’encodeur sur la pluralité (
) de séquences temporelles de données d’entrée. - Lors d’une étape S230, des données d’encodage positionnel (
) sont déterminées par un ou un des modules d’encodage positionnel de l’encodeur, ces données d’encodage représentant, pour chaque séquence temporelle de données d’entrée, l’importance de la position d’au moins un desdits éléments dans ladite séquence. Les données d’encodage positionnel sont ensuite combinées avec les données temporelles, de sorte que la sortie de ce module d’encodage positionnel s’exprime alors par exemple sous la forme -
- Puis, lors d’une étape S240, des données d’encodage modal (
) sont déterminées par le module d’encodage modal de l’encodeur, ces données d’encodage représentant, pour chaque séquence temporelle de données d’entrée, l’importance d’une modalité parmi les modalités des données d’entrée. Les données d’encodage modal sont ensuite combinées avec les sorties du module d’encodage positionnel de l’encodeur, de sorte que la sortie de ce module d’encodage modal s’exprime alors par exemple sous la forme -
- Le procédé comprend en outre une étape S250 d’encodage, selon un modèle d’encodage multimodal "Transformer", de la sortie
, de sorte à obtenir une pluralité ( ) de séquences temporelles de représentations multimodales encodées ( ). Cette étape est mise en œuvre par le l’encodeur multimodal "Transformer" MMTE précédemment évoqué. - Dans un mode particulier de mise en œuvre, l’étape S250 d’encodage comprend une sous-étape de filtrage des données en entrée du modèle d’encodage multimodal "Transformer", de sorte à n’encoder que les données comprises dans une fenêtre de temps glissante par rapport à un instant courant
. - Puis, lors d’une étape S310, le décodeur obtient en entrée les évaluations intermédiaires précédemment générées par le TDL. Ainsi, dans le cas où le décodeur cherche à évaluer une situation à l’instant
, le MHSA du TDL prend en entrée une pluralité (e.g., ) d’évaluations intermédiaires précédemment générées ([ ])et ayant été pondérées. - Le procédé de génération comprend en outre une étape S320 au cours de laquelle des données d’encodage positionnel (
) sont déterminées par un module d’encodage positionnel ( ) du décodeur. Les données d’encodage positionnel sont ensuite combinées avec la pluralité d’évaluations intermédiaires précédemment générées, de sorte qu’à l’évaluation de la situation à l’instant , l’entrée du décodeur multimodal "Transformer" s’exprime par exemple sous la forme -
- Le procédé de génération comprend en outre une étape S330 au cours de laquelle un mécanisme d’auto-attention est appliqué à l’entrée
par le MHSA. - Il importe à ce stade de rappeler que l’application d’un mécanisme d’auto-attention offre l’avantage de contraindre le modèle d’évaluation à focaliser son attention sur des évaluations précédemment réalisées par ce même modèle d’évaluation.
- Le procédé de génération comprend en outre une étape S340 au cours de laquelle un mécanisme d’attention croisé est appliqué par le MHCA. Il importe à ce stade de rappeler que l’application d’un mécanisme d’attention croisée offre l’avantage de contraindre le modèle d’évaluation à se focaliser sur les différentes représentations à un certain instant (et par conséquent sur les différentes modalités traitées par le modèle), sans considération temporelle. La sortie du MHCA s’exprime sous la forme
-
- Le procédé de génération comprend en outre une étape S350 au cours de laquelle le premier module de conversion FFN génère la séquence temporelle d’évaluations intermédiaires [
] telle que: -
- et
avec . - Puis, lors d’une étape S360, chaque élément de cette séquence
est convertit en une valeur représentative d’une situation (ou en un vecteur de valeurs représentatif d’une ou plusieurs situations différentes), de sorte à obtenir une séquence temporelle [ ] où chaque élément correspond, à un certain instant, à une évaluation d’une situation particulière. - L’invention à jusqu’à présent été décrite dans le cas où le décodeur ne comprend qu’un seul TDL. Ces développements sont cependant généralisables sans difficulté par l'homme du métier au cas où le décodeur comprend une pile de TDLs. Dans ce cas particulier, les étapes S330, S340 et S350 sont réitérées.
- Enfin, cette séquence temporelle d’évaluations d’une situation [
] est utilisée pour déterminer si un service un service adapté à l’environnement et/ou à l’utilisateur doit être déclenché ou pas. - À cet effet, selon un exemple particulier d’implémentation, une pluralité de services numériques pouvant être suggérés à une personne et définis par des liens respectifs sont stockés dans une table de correspondance, en association avec des seuils de scores respectifs. En en cas de dépassement d’un seuil par un ou plusieurs éléments de la séquence temporelle [
], au moins un lien d’un service numérique correspondant est lu pour suggérer ledit service numérique correspondant à l’utilisateur via une interface homme-machine. La situation évaluée correspond par exemple à l’état émotionnel de la personne. - Ainsi, un service n’est recommandé à la personne que si l’intensité d’une évaluation d’une situation prédéterminée est suffisamment importante. Ceci a pour effet de réserver la suggestion de services à cette personne aux moments où l’exécution de ces services lui seraient les plus utiles.
- Selon un exemple particulier d’implémentation, une routine d’animation d’une interface homme-machine de tout équipement communicant de l’environnement dans lequel se situe une personne (e.g., un habitat connecté) est déclenchée.
- La recommandation du service est par exemple exécutée sur le meilleur canal de diffusion pour la personne, telle que la TV du salon, une enceinte communicante, un smartphone, etc. L’équipement communicant le plus adapté à cet effet peut être sélectionné par exemple sur la base des fonctionnalités offertes par les différents équipements communicants de l’installation.
- Un autre critère peut être une estimation de distance, à l’instant courant, entre les différents équipements communicants et la personne, permettant de choisir, parmi les différents équipements communicants de l’installation aptes à déclencher les services proposés, celui étant le plus proche de la personne à l’instant courant.
- Selon un exemple non-limitatif, la situation évaluée correspond à une évaluation de l’état émotionnel d’une personne, et la routine d’animation est configurée pour suggérer, à la personne, au moins un service numérique prédéfini associé à l’évaluation de son état émotionnel. Par exemple, si la situation prédite est "paniqué", les services associés dans un modèle de préférences peuvent être dans un ordre de préférence "une incitation à appeler un ami", "une incitation à appeler le service de téléassistance" ou "une augmentation du confort de la maison par le réglage automatique de la luminosité".
- D’autres exemples de services peuvent être décrits pour chaque situation émotionnelle "négative" selon les préférences et les habitudes des personnes. Ces préférences peuvent être définies par les personnes elles-mêmes ou par un tiers de confiance, telle que la famille, un proche, ou le corps médical. Ces préférences peuvent être définies, réorganisées ou mises à jour automatiquement par apprentissage des services utilisés dans le passé, en corrélation avec les situations évaluées.
- L’invention a jusqu’à présent été décrite dans le cas où l’opérateur de combinaison
correspond à une addition. L’invention n’en reste pas moins applicable dans le cas où d’autres opérateurs de combinaison sont considérés, tel que .
Claims (15)
- Procédé de génération d’une séquence temporelle d’évaluations d’une situation par un modèle d’évaluation robuste en cas de données d’entrée manquantes, le procédé étant mis en œuvre par un dispositif électronique (10) et comprenant :
- une étape d’obtention (S210) d’une pluralité (
) de séquences temporelles de données d’entrée issues de capteurs équipant un environnement et/un utilisateur, chaque séquence étant associé à une modalité ( ), chaque élément ( ) d’une séquence étant représentatif d’un état, à un instant ( ), de la modalité ( ) associée à la séquence ;
- une étape d’encodage (S250), selon un modèle d’encodage multimodal "Transformer" (MMTE), de données issues d’une combinaison, à chaque instant, de données d’encodage positionnel (
), de données d’encodage de modalité ( ) et de données temporelles déterminées à partir de la pluralité ( ) de séquences temporelles de données d’entrée, de sorte à obtenir une pluralité ( ) de séquences temporelles de représentations multimodales encodées ( ) ; - une étape de décodage (S300) comprenant une sous-étape (S330) d’application d’un modèle d’auto-attention (MHSA) auto-régressif ; et une sous-étape (S340) de mise en œuvre d’un modèle d’attention croisée (MHCA) prenant en entrée la pluralité (
) de séquences temporelles de représentations multimodales encodées ( ), de sorte à générer une séquence temporelle d’évaluations intermédiaires ( ) ; et, - une étape de conversion (S360) de la séquence temporelle d’évaluations intermédiaires en la séquence temporelle d’évaluations d’une situation, ladite séquence temporelle d’évaluations d’une situation permettant de contrôler un déclenchement d’un service adapté à l’environnement et/ou à l’utilisateur.
- une étape d’obtention (S210) d’une pluralité (
- Procédé de génération selon la revendication 1, le modèle d’auto-attention (MHSA) étant auto-régressif en ce que, à un instant courant
, ledit modèle d’auto-attention prend en entrée les évaluations intermédiaires précédemment déterminées par ledit modèle d’évaluation à partir de données d’entrées associées à des instants passés . - Procédé de génération selon la revendication 1 ou 2, dans lequel les données d’encodage positionnel (
) représentent, pour chaque séquence temporelle de données d’entrée, l’importance de la position d’au moins un desdits éléments dans ladite séquence. - Procédé de génération selon l’une des revendications 1 à 3, dans lequel les données d’encodage de modalité (
) représentent l’importance d’une modalité parmi les ( ) modalités de la pluralité ( ) de séquences temporelles de données d’entrée. - Procédé de génération selon l’une des revendications 1 à 4, comprenant en outre une étape de détermination des données temporelles par application (S220) d’au moins un réseau de convolution temporel (TCN) sur la pluralité (
) de séquences temporelles de données d’entrée. - Procédé de génération selon l’une des revendications 1 à 5, dans lequel l’étape d’encodage (S250) comprend une sous-étape de filtrage des données en entrée du modèle d’encodage multimodal "Transformer" (MMTE), de sorte à n’encoder que les données comprises dans une fenêtre de temps glissante par rapport à un instant courant
. - Procédé de génération selon l’une des revendications 1 à 6, comprenant en outre, une étape de détermination de données d’encodage positionnel (
), et de combinaison (S320) des évaluations intermédiaires précédemment déterminées par ledit modèle d’évaluation à partir de données d’entrées associées à des instants avec les données d’encodage positionnel ( ) déterminées, de sorte à obtenir les évaluations intermédiaires. - Procédé de génération selon l’une des revendications 1 à 7, dans lequel le modèle d’attention croisée prend en entrée
représentations encodées et associées à un instant courant , avec le nombre de séquences temporelles de données d’entrée. - Procédé de génération selon l’une des revendications 1 à 8, comprenant en outre :
- une étape d’obtention (S110) d’une pluralité (
) de séquences temporelles de données d’apprentissage étiquetées, chaque séquence étant associé à une modalité ( ), chaque élément ( ) d’une séquence étant représentatif d’un état, à un instant ( ), de la modalité ( ) associée à la séquence ; - une étape d’entraînement (S120) du modèle d’évaluation en minimisant une fonction coût (
) définie telle que avec le coefficient de corrélation de concordance.
- une étape d’obtention (S110) d’une pluralité (
- Procédé de génération selon la revendication 9, comprenant en outre :
- une étape de génération (S130) itérative d’évaluations de la situation, par le modèle d’évaluation, en traitant des données d’entrée d’une même modalité à chaque itération, de sorte à classer les modalités en fonction de leur impact sur les performances du modèle d’évaluation ;
- une étape de réentraînement (S140) du modèle d’évaluation, en prenant en entrée des données d’apprentissage dont la modalité à un impact sur les performances du modèle d’évaluation inférieur à un seuil prédéterminé.
- Procédé de génération selon l’une des revendications 1 à 10, dans lequel la situation correspond à un état émotionnel d’un utilisateur.
- Procédé de génération selon l’une des revendications 1 à 11, dans lequel :
- les capteurs comprennent un dispositif de capture de son et la séquence temporelle de données d’entrée associée comprend des éléments (
) représentatifs de paroles émises par l’utilisateur et/ou de la prosodie de l’utilisateur ; et/ou - les capteurs comprennent un capteur physiologique, et la séquence temporelle de données d’entrée associée comprend des éléments (
) représentatifs du rythme cardiaque, respiratoire et/ou de l’activité électrique cérébrale de l’utilisateur ; - les capteurs comprennent un dispositif de capture d’image, et la séquence temporelle de données d’entrée associée comprend des éléments (
) représentatifs de l’expression faciale et/ou corporelle de l’utilisateur.
- les capteurs comprennent un dispositif de capture de son et la séquence temporelle de données d’entrée associée comprend des éléments (
- Programme d’ordinateur comportant des instructions pour la mise en œuvre d’un procédé de détermination selon l’une quelconque des revendications 1 à 12, lorsque ledit programme est exécuté par un ordinateur.
- Support d’enregistrement lisible par un ordinateur sur lequel est enregistré un programme d’ordinateur selon la revendication 13.
- Dispositif électronique (10) comprenant un modèle d’évaluation configuré pour déterminer une séquence temporelle d’évaluations d’une situation, le modèle étant robuste en cas de données d’entrée manquantes, le dispositif comprenant :
- un module d’obtention d’une pluralité (
) de séquences temporelles de données d’entrée issues de capteurs équipant un environnement et/un utilisateur, chaque séquence étant associé à une modalité ( ), chaque élément ( ) d’une séquence étant représentatif d’un état, à un instant ( ), de la modalité ( ) associée à la séquence ;
- un encodeur multimodal "Transformer" (MMTE) configuré pour encoder des données issues d’une combinaison, à chaque instant, de données d’encodage positionnel (
), de données d’encodage de modalité ( ) et de données temporelles déterminées à partir de la pluralité ( ) de séquences temporelles de données d’entrée, de sorte à obtenir une pluralité ( ) de séquences temporelles de représentations multimodales encodées ( ) ; - un décodeur multimodal "Transformer" (TDL) configuré pour générer une séquence temporelle d’évaluations intermédiaires (
), le décodeur multimodal comprenant un sous-module d’auto-attention multi-tête (MHSA) auto-régressif ; et un sous-module d’attention croisée multi-tête (MHCA) prenant en entrée la pluralité ( ) de séquences temporelles de représentations multimodales encodées ( ) ; - un module de conversion (FC) de la séquence temporelle d'évaluations intermédiaires en la séquence temporelle d’évaluations d’une situation ; et,
- un module de contrôle d’un déclenchement d’un service adapté à l’environnement et/ou à l’utilisateur, en fonction de la séquence temporelle d’évaluations d’une situation.
- un module d’obtention d’une pluralité (
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR2303404A FR3147641A1 (fr) | 2023-04-05 | 2023-04-05 | Procédé de génération d’une séquence temporelle d’évaluations d’une situation et dispositif associé |
| PCT/EP2024/057494 WO2024208593A1 (fr) | 2023-04-05 | 2024-03-20 | Procédé de génération d'une séquence temporelle d'évaluations d'une situation et dispositif associé |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| EP4690001A1 true EP4690001A1 (fr) | 2026-02-11 |
Family
ID=87554928
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP24712077.7A Pending EP4690001A1 (fr) | 2023-04-05 | 2024-03-20 | Procédé de génération d'une séquence temporelle d'évaluations d'une situation et dispositif associé |
Country Status (3)
| Country | Link |
|---|---|
| EP (1) | EP4690001A1 (fr) |
| FR (1) | FR3147641A1 (fr) |
| WO (1) | WO2024208593A1 (fr) |
Family Cites Families (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US12087446B2 (en) * | 2021-06-02 | 2024-09-10 | Neumora Therapeutics, Inc. | Multimodal dynamic attention fusion |
-
2023
- 2023-04-05 FR FR2303404A patent/FR3147641A1/fr not_active Withdrawn
-
2024
- 2024-03-20 EP EP24712077.7A patent/EP4690001A1/fr active Pending
- 2024-03-20 WO PCT/EP2024/057494 patent/WO2024208593A1/fr not_active Ceased
Also Published As
| Publication number | Publication date |
|---|---|
| WO2024208593A1 (fr) | 2024-10-10 |
| FR3147641A1 (fr) | 2024-10-11 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US10960173B2 (en) | Recommendation based on dominant emotion using user-specific baseline emotion and emotion analysis | |
| US10083397B2 (en) | Personalized intelligent wake-up system and method based on multimodal deep neural network | |
| AU2021256467A1 (en) | Multimodal analysis combining monitoring modalities to elicit cognitive states and perform screening for mental disorders | |
| US20160358085A1 (en) | System and method for multimodal human state recognition | |
| CN113764099A (zh) | 基于人工智能的心理状态分析方法、装置、设备及介质 | |
| CN113948076B (zh) | 语音交互方法、设备和系统 | |
| WO2018042133A1 (fr) | Prédiction de l'attention d'un auditoire lors d'une présentation | |
| EP2402839A2 (fr) | Système et procédé d'indexation de contenu affiché sur un dispositif électronique | |
| JP2010224715A (ja) | 画像表示システム、デジタルフォトフレーム、情報処理システム、プログラム及び情報記憶媒体 | |
| CN118885766A (zh) | 一种跨模态数据融合的用户心理画像获取方法及系统 | |
| Shanthi et al. | An integrated approach for mental health assessment using emotion analysis and scales | |
| CN121285841A (zh) | 在共享视频上训练的ai亮点检测 | |
| Alvarez et al. | Multimodal monitoring of Parkinson's and Alzheimer's patients using the ICT4LIFE platform | |
| Song et al. | Screening for obstructive sleep apnea hypopnea using sleep breathing sounds based on the PSG-audio dataset | |
| WO2024208593A1 (fr) | Procédé de génération d'une séquence temporelle d'évaluations d'une situation et dispositif associé | |
| WO2015062991A1 (fr) | Procédé d'analyse sémantique d'un flux vidéo en cours d'acquisition, terminal, produit programme d'ordinateur et medium correspondant | |
| Gowda et al. | Emotion based Music Recommendation System using Machine Learning | |
| WO2021240092A1 (fr) | Prédiction d'un état émotionnel d'un utilisateur dans un environnement et déclenchement d'un service numérique en fonction de l'état émotionnel prédit | |
| WO2024146998A1 (fr) | Procédé pour déterminer un état émotionnel d'un sujet et dispositif associé | |
| Yebda et al. | Detection of semantic risk situations in lifelog data for improving life of frail people | |
| CN116830586A (zh) | 用于问题回答的设备和方法 | |
| FR3118235A1 (fr) | Reconnaissance de mode de déplacement par capteur de mouvement | |
| de Gevigney | Machine Learning Models for Multimodal Detection of Anomalous Behaviors | |
| JP7572200B2 (ja) | キーワード抽出装置、キーワード抽出プログラム及び発話生成装置 | |
| Deng et al. | Predicting habitual activities for reducing perceived latency |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: UNKNOWN |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE |
|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE |
|
| 17P | Request for examination filed |
Effective date: 20251015 |
|
| AK | Designated contracting states |
Kind code of ref document: A1 Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR |