EP3506829A1 - Prédiction de l'attention d'un auditoire lors d'une présentation - Google Patents

Prédiction de l'attention d'un auditoire lors d'une présentation

Info

Publication number
EP3506829A1
EP3506829A1 EP17772084.4A EP17772084A EP3506829A1 EP 3506829 A1 EP3506829 A1 EP 3506829A1 EP 17772084 A EP17772084 A EP 17772084A EP 3506829 A1 EP3506829 A1 EP 3506829A1
Authority
EP
European Patent Office
Prior art keywords
attention
level
presentation
speaker
evolution
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP17772084.4A
Other languages
German (de)
English (en)
Inventor
Ghislain Moncomble
Patrick RONDET
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Orange SA
Original Assignee
Orange SA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Orange SA filed Critical Orange SA
Publication of EP3506829A1 publication Critical patent/EP3506829A1/fr
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F3/00Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
    • G06F3/01Input arrangements or combined input and output arrangements for interaction between user and computer
    • G06F3/011Arrangements for interaction with the human body, e.g. for user immersion in virtual reality
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/48Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
    • G10L25/51Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination
    • G10L25/63Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination for estimating an emotional state
    • AHUMAN NECESSITIES
    • A61MEDICAL OR VETERINARY SCIENCE; HYGIENE
    • A61BDIAGNOSIS; SURGERY; IDENTIFICATION
    • A61B5/00Measuring for diagnostic purposes; Identification of persons
    • A61B5/103Measuring devices for testing the shape, pattern, colour, size or movement of the body or parts thereof, for diagnostic purposes
    • A61B5/11Measuring movement of the entire body or parts thereof, e.g. head or hand tremor or mobility of a limb
    • A61B5/1126Measuring movement of the entire body or parts thereof, e.g. head or hand tremor or mobility of a limb using a particular sensing technique
    • A61B5/1128Measuring movement of the entire body or parts thereof, e.g. head or hand tremor or mobility of a limb using a particular sensing technique using image analysis
    • AHUMAN NECESSITIES
    • A61MEDICAL OR VETERINARY SCIENCE; HYGIENE
    • A61BDIAGNOSIS; SURGERY; IDENTIFICATION
    • A61B5/00Measuring for diagnostic purposes; Identification of persons
    • A61B5/16Devices for psychotechnics; Testing reaction times ; Devices for evaluating the psychological state
    • A61B5/168Evaluating attention deficit, hyperactivity
    • AHUMAN NECESSITIES
    • A61MEDICAL OR VETERINARY SCIENCE; HYGIENE
    • A61BDIAGNOSIS; SURGERY; IDENTIFICATION
    • A61B5/00Measuring for diagnostic purposes; Identification of persons
    • A61B5/48Other medical applications
    • A61B5/4803Speech analysis specially adapted for diagnostic purposes
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F3/00Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
    • G06F3/01Input arrangements or combined input and output arrangements for interaction between user and computer
    • G06F3/017Gesture based interaction, e.g. based on a set of recognized hand gestures
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N20/00Machine learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V20/00Scenes; Scene-specific elements
    • G06V20/50Context or environment of the image
    • G06V20/52Surveillance or monitoring of activities, e.g. for recognising suspicious objects
    • GPHYSICS
    • G09EDUCATION; CRYPTOGRAPHY; DISPLAY; ADVERTISING; SEALS
    • G09BEDUCATIONAL OR DEMONSTRATION APPLIANCES; APPLIANCES FOR TEACHING, OR COMMUNICATING WITH, THE BLIND, DEAF OR MUTE; MODELS; PLANETARIA; GLOBES; MAPS; DIAGRAMS
    • G09B19/00Teaching not covered by other main groups of this subclass
    • G09B19/04Speaking
    • GPHYSICS
    • G09EDUCATION; CRYPTOGRAPHY; DISPLAY; ADVERTISING; SEALS
    • G09BEDUCATIONAL OR DEMONSTRATION APPLIANCES; APPLIANCES FOR TEACHING, OR COMMUNICATING WITH, THE BLIND, DEAF OR MUTE; MODELS; PLANETARIA; GLOBES; MAPS; DIAGRAMS
    • G09B5/00Electrically-operated educational appliances
    • G09B5/06Electrically-operated educational appliances with both visual and audible presentation of the material to be studied
    • G09B5/062Combinations of audio and printed presentations, e.g. magnetically striped cards, talking books, magnetic tapes with printed texts thereon
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/48Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
    • AHUMAN NECESSITIES
    • A61MEDICAL OR VETERINARY SCIENCE; HYGIENE
    • A61BDIAGNOSIS; SURGERY; IDENTIFICATION
    • A61B2503/00Evaluating a particular growth phase or type of persons or animals
    • A61B2503/12Healthy persons not otherwise provided for, e.g. subjects of a marketing survey
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F2203/00Indexing scheme relating to G06F3/00 - G06F3/048
    • G06F2203/01Indexing scheme relating to G06F3/01
    • G06F2203/011Emotion or mood input determined on the basis of sensed human body parameters such as pulse, heart rate or beat, temperature of skin, facial expressions, iris, voice pitch, brain activity patterns
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V40/00Recognition of biometric, human-related or animal-related patterns in image or video data
    • G06V40/10Human or animal bodies, e.g. vehicle occupants or pedestrians; Body parts, e.g. hands
    • G06V40/16Human faces, e.g. facial parts, sketches or expressions
    • G06V40/174Facial expression recognition
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16HHEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
    • G16H50/00ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics
    • G16H50/30ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics for calculating health indices; for individual health risk assessment

Definitions

  • the present invention relates to the field of systems and methods for predicting the attention of an audience and more particularly to a presentation by at least one speaker after a learning phase on a set of presentations already made.
  • the purpose of these measures is to detect a decrease in the person's attention in order to intervene either to stimulate the person or to change the visualized content or the context in which the person is.
  • the present invention improves the situation.
  • the method is such that it comprises the following steps:
  • the speaker of the presentation has a prediction information on the attention that the audience will or will carry to the presentation he is performing. For this, it is not necessary with this method to make real-time measurements of the attention of the audience. Similarly, if a presentation is recorded for later distribution, the process allows to be informed on an estimate of the evolution of the level of attention that an audience can have so as to adapt the rest of the presentation as necessary. .
  • the information relating to the evolution of the level of attention includes a probability on the evolution of the level of attention and this probability is presented to the at least one speaker.
  • the probability thus presented allows the speaker to know to what extent he has to rely on the prediction of the evolution of the level of attention he has received. It can thus best adapt its future actions.
  • the information relating to the evolution of the level of attention is corrected based on context information of the audience.
  • the attention of the audience may differ depending on whether the audience includes one or more people, depending on the location in which the presentation is made or broadcast, according to the presentation schedule, the temperature of the location of an audience, depending on the type of audience present in the audience, whether or not the members of that audience made a substantial meal, etc., the attention of the audience may differ .
  • the context information thus makes it possible to improve or modify the estimate of the level of attention that has been measured.
  • the information relating to the evolution of the level of attention is corrected according to measurements of emotion associated with the characteristics measured.
  • the attention of the audience can evolve significantly depending on the content of the presentation, especially key words or phrases, or as a variant of particular images that can generate emotion, which has to refocus the attention of the audience.
  • Keywords and / or keyphrases, or images generating emotion are determined by analyzing the audio and video signals of the presentation, for example by means of voice recognition and / or image recognition.
  • the database includes information to link these keywords with a measure of emotion.
  • the attention of the audience may also differ depending on whether or not the characteristic elements are related to an additional emotion measure.
  • the information relating to the content of the presentation coupled with an associated emotion measurement therefore makes it possible to improve or modify the estimate of the level of attention that has been measured.
  • This measure of emotion can also be different depending on the type of audience present or the context of the audience. The two emotion and context information can then be taken into account to improve or modify the estimate of the level of attention.
  • the method further comprises a step of determining recommendations for actions to be performed by the speaker to change the level of attention of the at least one audience according to the information relating to the evolution of the level of attention recovered and a step of presentation to the at least one speaker of the recommendations determined.
  • the speaker knows how to adapt his presentation to increase the level of attention of his present or future audience. It can best optimize the current presentation.
  • a learning phase is implemented.
  • the invention thus relates to a method of learning information of evolution of the level of attention of at least one audience of presentations.
  • the learning phase is such that it comprises the following steps:
  • determining changes in attention levels by analyzing associations determined for a set of characteristics or groups of characteristics and according to at least one parameter of duration or occurrence of these characteristics;
  • This learning method can be implemented on a plurality of presentations made by the same speaker or by different speakers so as to have a panel representative of the possible characteristics of presentations and speakers.
  • the resulting database can be enriched as new measurements are made for new presentations, so it can evolve.
  • This learning process therefore makes it possible to associate information on the evolution of the level of attention with characteristics related to the presentation in progress.
  • the resulting database can be saved in the terminal implementing the prediction method, for example the presenter's terminal so that it has the attention level evolution information in a simple manner and without it. it is necessary to have measuring devices or even network access.
  • the information relating to the level of attention comprises a probability of evolution calculated from the analysis of a repeatability rate of the evolutions determined on all the presentations.
  • the learning method also takes into account the characteristics of the contexts of the audiences, which will make it possible, when using said database, to select audience contexts corresponding to those expected for a presentation on which the method will be used. applied.
  • the same context characteristics may also be taken into account if we also apply emotion measures, these measures may also differ from one context to another.
  • the invention provides a device for predicting the attention of at least one audience of a presentation made by at least one speaker.
  • the device is such that it comprises:
  • a measurement and detection module for detecting vocal or gestural characteristics of the at least one speaker of the current presentation and / or the content characteristics of the current presentation and for measuring at least one parameter of duration or of occurrence detected characteristics
  • a database consultation module for determining information relating to the evolution of the level of attention, the database comprising a correspondence between voice or gestural characteristics of the speaker and / or presentation content characteristics. duration or occurrence parameters related to these characteristics and information relating to changes in the level of attention for these characteristics and parameters;
  • a user interface for presenting to the at least one speaker of the presentation a prediction of level of attention from the information relating to the evolution of the level of attention retrieved.
  • the invention relates to a terminal which comprises a prediction device as described.
  • This terminal and this device have the same advantages as the method described above.
  • the invention is aimed at a prediction system such that it comprises a prediction device described above and a learning device comprising:
  • an indexing module for indexing, on the one hand, audience level of attention measurements, presentations of the set and, on the other hand, indexing by measures of voice or gestural characteristics of the speakers and / or measures of content characteristics of presentations, presentations of the set;
  • a synchronization module for synchronizing the respective indexings to determine associations between characteristics and attention level measures for the presentations of the set;
  • an analysis module for determining changes in attention levels by analyzing associations determined for a set of characteristics or groups of characteristics and according to a parameter of duration or occurrence of these characteristics;
  • a database recording module for recording matches between speaker speech or gesture characteristics and / or presentation content characteristics, duration or time parameters related to these characteristics and information relating to the evolution of the level of attention for these characteristics and these parameters.
  • This learning device can advantageously be inserted into a server of a communication network. It can also be inserted into a terminal.
  • This device has the same advantages as the learning method described above, which it implements.
  • the invention finally relates to a prediction system such that it comprises a learning device as described and a prediction device as described.
  • the invention also relates to a computer program comprising code instructions for implementing the steps of the prediction method as described and / or the learning method as described above, when these instructions are executed by a processor.
  • It also relates to a processor readable information medium on which is recorded such a computer program comprising instructions for performing the steps of the prediction method and / or the learning method as described.
  • FIGS. 1a and 1b illustrate examples of a system for predicting the attention of an audience in presentation or conference contexts in real time or recorded, animated by a speaker, face-to-face in a room with an audience or in line through a network communication;
  • FIG. 2a illustrates, in flowchart form, the main steps of a learning process of attention level evolution information, prior to the prediction phase, in one embodiment of the invention;
  • FIG. 2b illustrates in flowchart form the main steps of a prediction method according to an embodiment of the invention
  • FIG. 3 illustrates a hardware configuration of a learning device able to implement the learning method according to one embodiment of the invention.
  • FIG. 4 illustrates a hardware configuration of a prediction device according to one embodiment of the invention.
  • Figure la represents an example of a system and context in which the prediction method according to the invention can be implemented.
  • An Ul speaker is presenting to an AU audience. It realizes its presentation using an El screen and a terminal, here a computer Tl.
  • the computer Tl is for example connected to an R network of the internet type and can thus be connected to a server S on which a learning method has been implemented to constitute a database DB2.
  • the learning method may also in another exemplary embodiment be implemented in the terminal T1. It will be described in more detail with reference to FIG. 2a.
  • the terminal T1 or the server S implements a prediction method according to the invention. This will be described later with reference to Figure 2b.
  • the terminal T1 To implement the prediction method and / or learning in the terminal T1, it is associated with at least one unrepresented microphone capable of capturing the oral presentation of the speaker. The captured sound will then be analyzed to determine speaker sound characteristics.
  • the terminal T1 is also associated with a not shown camera that films and detects the movements of the speaker. These movements can also be analyzed to determine other characteristics of the speaker during the current presentation.
  • Figure lb describes another context of a prediction system according to the invention.
  • the speaker Ul performing a presentation or online training type MOOC for "Massive Open Online Course” in English
  • MOOC for "Massive Open Online Course” in English
  • a server S may in one embodiment implement the learning method and / or the prediction method according to the invention.
  • the prediction method is implemented in the terminal T1 and the learning method in the server S or both the prediction method and the learning method are implemented in the terminal Tl.
  • the terminal T1 is associated for example with a microphone and a camera to detect both the speaker's sound characteristics and the movement characteristics.
  • the DB2 database is fed as a result of the learning phase and includes correspondences between speaker characteristic elements such as voice or gestural characteristics of the speaker and / or presentation as content characteristics of the presentation, duration or occurrence parameters related to these characteristics or elements and information relating to the evolution of the level of attention for these characteristics and these parameters.
  • MOOC type presentation may be recorded by the presenter of that MOOC for later online broadcast or to be recorded on the network for viewing at any time.
  • the audience consists of a single person who consults the presentation in isolation and when he wishes.
  • This learning method constitutes a learning phase implemented prior to the steps of the prediction method
  • a set of already recorded presentations is available for example on the network or in a database of either the network or the equipment implementing this learning phase.
  • a server of the network or a terminal of a user for example, of the speaker of the presentation can implement this phase.
  • an analysis is performed on each of the presentations P, of the set of presentations Pi to P N which will be called a reference set or set of reference presentations.
  • An analysis is performed on the characteristics of the presenter, speaker of the presentation.
  • an audio measurement sensor measures during the course of the presentation, the speaker's sound level, the prosody characteristics over time, that is to say the phenomena of accentuation and intonation (variation height, duration and intensity) of the speaker's voice.
  • Another video-type sensor can measure the gestures made by the speaker during his recorded presentation and the breaks he can perform.
  • Other analysis elements make it possible to measure, for example, the possible sound effects during the presentation.
  • the analysis performed also determines the characteristics of the content itself, such as the way the presentation was filmed, the evolution of the framing, the presence of keywords, images or keyframe sequences. , for example using an image analysis algorithm. All these analysis elements are indexed and indexed, in step E21b, on the timeline of the flow of the reference presentation. From this same reference set, a step E20a is implemented to measure the attention of an audience.
  • the learning device measuring this level of attention is for example equipped with a camera capable of detecting the movements of the face, the blinking of the eyes, the frequency of yawning, etc.
  • the attention level measurements thus obtained are then indexed, in step E20b, on the time line of the progress of the reference presentation.
  • a technique for measuring the level of attention is for example a technique based on the analysis of the faces of the audience. For example, when the audience consists of people consulting their computer to attend a conference or online training, the capture of the image of the face of the viewer can see when it turns away from its screen, if it moves away, moves or is replaced by another face. In all these cases, it means that the attention of the user has decreased.
  • Another possible measure is based on measuring the frequency of blinking of audience members. When the number of blinks exceeds a certain threshold or when the eyelids of the user are too long closed, it means that the user is in the beginning phase of sleepiness, and therefore loss of attention.
  • Yawning is a typical reaction induced by fatigue. This results in a prolonged and uncontrolled opening of the mouth very different from other deformations of the lips and which can be measured by image analysis techniques. The opening of the mouth during a yawn is more important than the opening of the mouth during speech.
  • Such a technique is for example described in the article entitled "Yawning detection for fatigue driver monitoring of the authors Xiao Fan, Bao-Cai Yin, Yan- Feng Sun in" Proceedings of the Sixth International Conference on Machine Learning and Cybernetics "in Hong Kong , 19-22 August 2007.
  • An orientation change detection of an auditor's head can also reveal a decrease in attention. Indeed a head fall forward is indicative of the fatigue of the person. If this detection is further correlated with other detections described above, then that person's loss of attention is revealed.
  • the level of ambient chatter noise can also be detected and thus can reveal that the audience is not attentive to the presentation that is offered to them.
  • an individual measure may be preferred over a global approach.
  • the attention measure is performed for each of the people in the audience, the overall level of attention being then determined by the aggregate of the unit attention levels.
  • context information of the audience is associated with the level of attention measurement. Indeed, depending on the context of the audience, the measure of attention may vary.
  • the level of attention of a user may be different for the same presentation. It is indeed known that a state of drowsiness can be promoted early digestion within one hour after a meal while alertness reaches its maximum two to three hours after a meal. If one measures the level of attention of the same presentation at different times and for a similar audience, one can determine the correction to be made to the level of attention measured according to the time.
  • a date, a duration of sunshine, the heat in a room, or the number of people attending the presentation may be background information to correct the level of attention being measured.
  • the type of audience present in the audience can also cause the level of attention to be different, for example if the audience is old, young, of different culture, speaking a different language, etc.
  • This type of measurement is for example performed by known techniques of facial analysis detecting for example a smile, a particular grimace, crying, etc.
  • This indexing of emotion of the reference presentations is compared with indexings of the characteristics of the content of the presentations, for example the existence of key words, images or sequences of key images.
  • step E22 a reconciliation of the different indexings performed in steps E20b and E21b is performed.
  • a synchronization of the two types of indexing is implemented so that the audience attention measure, indexed at a time instant of the presentation, is associated with the characteristics of the speaker and / or presentation for this same temporal moment of the presentation.
  • the synchronization will be limited to coincide the beginnings of said time lines.
  • the resynchronizations can be periodic based on sequences detected as common (for example by analysis of the soundtrack and comparison) .
  • step E23 the different synchronizations performed for each presentation between speaker characteristics, presentation characteristics and attention level measurements, are used by an analysis module to determine the evolution of the level of attention. .
  • This module determines probabilities of correlation between a decrease or a rise observed on the attention measure and different groups of characteristic elements of the presentation and / or the speaker.
  • a cause-and-effect duration parameter between groups of speaker and / or presentation characteristic elements is also determined, as are changes in attention measurements to distinguish, for example, the groups of elements that generate either immediately after a period of repetition of these elements, a rate of loss of attention or a rate of increase of attention.
  • At this step is also determined the influence of an occurrence parameter of appearance of a group of characteristic elements in a presentation.
  • step E23 makes it possible to determine an evolution of the level of attention according to a group of speaker characteristic elements or of the content of the presentation or both and according to at least one duration parameter. or occurrence of these characteristic elements.
  • a monotone of a speaker of a presentation lasting several minutes progressively changes the level of attention downward while the pronunciation of key words or projection of key images (eg violence or beautiful landscape) can change the level of attention brutally upward.
  • thresholds of increase and decrease of attention are defined so as to retain only significant characteristics of the speaker and / or the presentation.
  • the threshold may for example be 1 or 2%.
  • the step E23 also implements a verification of the repeatability of the evolutions determined for each of the reference representations.
  • this correspondence is recorded in a database of DB2 data, also called learning base.
  • a calculation of the probability of evolution of the level of attention can be carried out from this analysis of the rate of repeatability of the evolutions of level of attention determined on the set of reference. This probability can then be recorded in the database DB2, in association with the correspondence evolution / characteristics which corresponds to it.
  • step E24 is recorded in a database DB2, a set of information relating to the evolution of the level of attention (evolution of the level up or down, rate of evolution, ie a progressive progressivity index, for example abrupt or progressive, a probability of evolution, for example the repeatability rate in the reference set, etc.) in correspondence with elements or groups of characteristic elements speaker and / or presentation and at least one parameter of duration or occurrence of these elements.
  • a set of information relating to the evolution of the level of attention evolution of the level up or down, rate of evolution, ie a progressive progressivity index, for example abrupt or progressive, a probability of evolution, for example the repeatability rate in the reference set, etc.
  • Said database DB2 can in its simplified version be limited to separate backup files, or a retention of information in a relational database table separate from other tables constituting DB1.
  • An advantage of said distinction DB2 base is of course that it can subsequently be used distinctly from the DB1 database as part of the prediction process described with reference to Figure 2b. Rather than having to use the very large DB1 database with the different indexing of presentations, only the results of the analyzes contained in the DB2 database, namely the list of groups of characteristic elements and the associated duration or occurrence parameters causing a probability of evolution of attention and the associated evolution information (as described above) is necessary.
  • the small potential size of the DB2 database thus allows autonomous uses in embedded mode, without the need for a network connection to a server dedicated to the DB1 database.
  • several reference sets can be provided. The different sets are for example created according to the themes of the presentations or depending on the type of audience.
  • An example of a record in the database DB2 may be, for a silence characteristic of the speaker with a duration parameter of a few seconds, a correspondence with information relating to the evolution of the level of attention which is an immediate increase attention.
  • Another example is a correspondence between a sound level of the speaker's voice that remains invariant for several minutes and a gradual decrease in the level of attention.
  • the change of speaker may for example be associated with an immediate increase in the level of attention, so the change of framing of the display of the presentation may be associated with an immediate increase in attention.
  • a rate of rise or fall in the level of attention that is to say a progressivity index of the evolution can also be associated with the triggering characteristic elements.
  • the database DB2 is enriched by a set of information relating to the evolution of the level of attention in correspondence with elements or groups of presentation and presentation characteristic elements. / or speakers and parameters of duration or occurrence of these elements.
  • the attention level evolution information is characterized by a trend of evolution, decrease or increase, if necessary, a rate of evolution, that is to say an index linked to the progressiveness of the evolution. of attention, to distinguish the immediate effects and the effects smoothed over a longer period of time and the likelihood that this trend will apply. Information about the average time of occurrence of the evolution of attention can also be recorded.
  • FIG. 2b illustrates the steps implemented during the prediction method according to the invention. This method is implemented for example in the terminal T1 of the presenter or in a server S of the communication network R. It applies to a presentation in progress, animated by at least one speaker. We will talk about current presentation Pc.
  • a first step E25 performs an analysis of this presentation. This analysis concerns, for example, speaker characteristics, voice, sound level, gestures, pause or breathing time, etc.
  • a voice analysis module is provided in the prediction device, on the sound picked up by a microphone associated with the equipment of the presentation.
  • the analysis can also include the content of the presentation, what is presented on the screen, the frequency of page change, the framing of what is shown, the colors used, the detection of keywords, images keys, etc.
  • This type of analysis can be performed for example by detecting an action of the presenter for the page change, by an image analyzer to detect colors or movements or keyframes, etc.
  • a search in the DB2 database of these speaker and / or presentation features and associated parameters is performed in E27 to find information on the evolution of the corresponding probable attention level.
  • This information therefore makes it possible to obtain a prediction of the level of attention that the presentation will have if the corresponding characteristic elements persist during the associated duration or are repeated according to the associated occurrence and if the speaker does not change his presentation or characteristics.
  • This attention level prediction information is presented to the speaker of the presentation in E28 so that he can react in real time to his presentation.
  • the prediction of the level of attention is associated with a determination of recommendations of actions to be performed on the presentation to change the level of attention in the desired direction, followed by the presentation of these recommendations to speaker.
  • An example of a recommendation is to ask to increase the sound level of the speaker's voice if it has been detected that the level of the voice decreases over time and that the time for which the level of attention falls, is exceeded.
  • an interface to select the desired direction of change in the level of attention to lower the attention (if for example the presenter must absolutely evoke such a subject, but he prefers that nobody remembers) or the increase.
  • a default mode simplifying the interface from the point of view of the speaker would be to improve the attention with respect to a given relevant level, fixed for example with reference to the beginning of the presentation, phase where the attention is classically considered to be its maximum.
  • the recommendation could consist in proposing to disseminate an image, for example of a beautiful landscape, whose impact on the probability of evolution of attention is known.
  • This suggestion could also consist of proposing groups of key words to be pronounced.
  • the presenter can modify his presentation according to the recommendations and thus improve the level of attention of his audience.
  • the presenter is thus informed of potential changes in audience attention even if there is no ongoing measure of audience attention or even if there is no audience .
  • the presentation may be simply being recorded without anyone in front for subsequent broadcast before an audience.
  • the presenter may simply be rehearsing the presentation that he will make later, in order to be more efficient at the appropriate time.
  • attention-measuring equipment it is not necessary to have attention-measuring equipment to be informed of the evolution of the level of attention in real time.
  • this information on the evolution of the level of attention can be corrected according to context information related to the present or planned audience.
  • This information can be for example the schedule of the presentation or that scheduled to be broadcast, the number of people in the audience, the temperature of the room in which the presentation is made, etc.
  • the correction to be made is for example recorded in the DB1 and DB2 databases in association with the characteristics of the speaker and / or the presentation.
  • a weighting of the level of attention can be provided and recorded in the database DB2. This weighting is then applied to the information relating to the evolution of the level of attention obtained during the prediction process when the triggering characteristic elements are associated with emotion measurements as previously described.
  • the presentation of the level of attention prediction can be made in different forms. In an exemplary embodiment it can be presented to the speaker by a symbol of different color. For example, the color intensity may correspond to the rate of change of the level of attention. This presentation can be made on the personal screen of the presenter or, if it is light, on the microphone of it.
  • the evolution of the level of attention can also be represented by an arrow pointing upwards in the event of a rise and downwards in the event of a fall, of a greater or lesser height depending on the rate of change associated.
  • Another way to display the result of this prediction is, for example, to display at the beginning of the sequence an average value of the level of attention and then as the presentation progresses, to represent the level predictions.
  • the prediction on the evolution of the level is then well readable by the presenter.
  • a% representing the accuracy rate found on the basis of training data for the current forecast may be presented.
  • the delay in which the prediction of the evolution of the attention is expected can also be presented in seconds for example.
  • such a prediction method may allow the presenter of a training or presentation to improve it by taking into account the changes in level of attention that are presented to him. He can for example train before a real presentation in order to optimize his intervention and to avoid the declines of level of attention. It can also provide different presentations based on different audience context information. For example, depending on the presentation's broadcast schedule, it can make the more dynamic presentation with changes in speaker or tone, if the presentation is broadcast at a time of digestion and predict less dynamic otherwise.
  • the prediction and suggestion process could lead to the diffusion of 3 different variants of the same MOOC video, one of which is both shorter and more dynamized because the session is planned at the beginning of afternoon on an area and period for which a high temperature is expected.
  • FIG. 3 represents a simplified hardware architecture of an embodiment of a learning device implementing the learning method described with reference to FIG. 2a.
  • module and/or entity
  • This device is equipped with a measurement collection interface 320 able to collect the measurements captured by the C1 to CN sensors represented here at 310 1 , 310 2 , 310 3 and 310 N.
  • These sensors are provided on the one hand to measure the vocal characteristics of the speaker or speakers, for example by means of one or more microphones, for measuring the speaker's movement characteristics, for example by means of a camera and on the other hand for measuring the level. of audience attention.
  • a camera can be provided for this also a camera.
  • the device comprises a processing unit 330 equipped with a processor and driven by a computer program Pg 345 stored in a memory 340 and implementing the learning phase according to the invention.
  • the code instructions of the computer program Pg are for example loaded into a RAM not shown and executed by the processor of the processing unit 330.
  • the processor of the processing unit 330 implements the steps of the learning method described above with reference to Figure 2a, according to the instructions of the computer program Pg.
  • the device 300 thus comprises an input interface for receiving already recorded presentations of a DB database comprising one or more sets of reference presentations.
  • the indexing module receives measurements collected by the interface 320 and made by the sensors C1 to CN to determine the loudness level of the presenter, its tone, its silences or the level of surrounding loudness. It also receives information about the changes in the content presented, for example a change in the framing, a change of presentation page, a zoom on the image, a keyword, a keyframe, coming from the interface 320 .
  • the learning device also includes a module for indexing attention level measurements. These attention measurement levels are obtained by the interface 320 which collects the measurements carried out by the sensors C1 to CN and in particular the data measured by one or more cameras from which algorithms for detecting blinking or yawning or Still head positioning is implemented to obtain a level of attention measurement.
  • This attention level measure is indexed to the current presentation of the set of reference presentations.
  • a synchronization module 370 is also provided to synchronize the two types of indexing and to obtain an association between the speaker and / or presentation features of the module 350 and the attention level measurements of the indexing module 360.
  • This combination of elements can be stored in a DB1 database integrated in the device or available via a communication network via a communication module 390.
  • An analysis module 380 driven by the processor 330, analyzes the associations of measured and characteristic levels of attention for the reference presentations and determines an evolution of the level of attention according to at least one parameter of duration or a parameter of occurrence of characteristics.
  • the analysis makes it possible to associate a characteristic or a succession of characteristics with a change in level of attention. It also makes it possible to determine a duration or number of occurrences for which the measured characteristic changes the level of attention.
  • a correspondence is made between characteristic elements or groups of characteristic elements of the speaker and / or presentation, duration or occurrence parameters associated with these elements with information relating to the changing level of attention of the audience.
  • the analysis module determines in a particular embodiment, the repeatability rate of the defined associations. Only matches with sufficient repeatability can be stored in the DB2 database.
  • This database can be stored on a remote server accessible via a communication network via the communication module 390 of the device.
  • the communication network is for example an IP network.
  • this database DB2 is integrated in the learning device. It can also be sent or downloaded to a terminal, for example that of a presentation speaker.
  • This learning device is either a network server communicating with the presenter's terminal or the presenter's terminal itself.
  • FIG. 4 represents a simplified hardware architecture of an embodiment of a prediction device 400 implementing the prediction method described with reference to FIG. 2b.
  • module and/or hardware components, capable of implementing the or the functions described for the module or entity concerned.
  • This device is equipped with an input interface able to consult a DB2 database internal to the device or available on a communication network and including correspondences between speaker and / or presentation features, duration or time parameters. occurrence related to these elements and information relating to the evolution of the level of audience attention for these elements and parameters and as learned during a learning phase as described with reference to Figure 2a.
  • the device comprises a processing unit 430 equipped with a processor and driven by a computer program Pg 445 stored in a memory 440 and implementing the prediction method according to the invention.
  • the code instructions of the computer program Pg are for example loaded into a RAM not shown and executed by the processor of the processing unit 430.
  • the processor of the processing unit 430 implements the steps of the prediction method described above, according to the instructions of the computer program Pg.
  • the device 400 therefore comprises an input interface for receiving the data stream of the current presentation Pc.
  • This interface can also receive context information from the audience of this presentation (Inf.Ctx).
  • the processor 430 implements the module for determining information relating to the evolution of the level of attention by searching in the database DB2, via the interface 420 or via the memory 440, whether a correspondence with the detected element and the associated parameter is saved. If necessary, a prediction on the evolution of the level of attention resulting from the information relating to the evolution of the level of attention thus determined is sent to the user interface 470 so that a presentation of this prediction of evolution is made to the speaker of the current presentation. Recommendations for actions to be performed by the speaker can also be sent on this user interface so that it changes the level of attention of its presentation.
  • This prediction device can be included in the speaker terminal of the presentation.
  • the prediction is directly displayed on the screen of its terminal via the user interface or on an accessory connected to its terminal, such as a microphone.
  • the device can also be integrated into a server of a communication network, for example an IP network; in this case, the prediction is presented to the speaker of the presentation via a communication module 490 which transmits the information to the presenter's terminal.
  • a server of a communication network for example an IP network
  • the context information of the audience can be used by the determination module 460 to correct the determined evolution if necessary.
  • both the learning device and the prediction device are included in the same equipment, either the speaker's terminal or a server of the network. In another embodiment, these two devices are remote, the learning method and the prediction method being implemented in a system comprising the two devices communicating with each other via a network.

Landscapes

  • Engineering & Computer Science (AREA)
  • Health & Medical Sciences (AREA)
  • Physics & Mathematics (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Theoretical Computer Science (AREA)
  • General Health & Medical Sciences (AREA)
  • General Physics & Mathematics (AREA)
  • Medical Informatics (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Multimedia (AREA)
  • General Engineering & Computer Science (AREA)
  • Surgery (AREA)
  • Molecular Biology (AREA)
  • Business, Economics & Management (AREA)
  • Educational Technology (AREA)
  • Veterinary Medicine (AREA)
  • Public Health (AREA)
  • Biophysics (AREA)
  • Pathology (AREA)
  • Biomedical Technology (AREA)
  • Heart & Thoracic Surgery (AREA)
  • Animal Behavior & Ethology (AREA)
  • Human Computer Interaction (AREA)
  • Educational Administration (AREA)
  • Hospice & Palliative Care (AREA)
  • Child & Adolescent Psychology (AREA)
  • Developmental Disabilities (AREA)
  • Psychiatry (AREA)
  • Signal Processing (AREA)
  • Computational Linguistics (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Acoustics & Sound (AREA)
  • Software Systems (AREA)
  • Psychology (AREA)
  • Entrepreneurship & Innovation (AREA)
  • Radiology & Medical Imaging (AREA)
  • Physiology (AREA)
  • Dentistry (AREA)
  • Oral & Maxillofacial Surgery (AREA)
  • Nuclear Medicine, Radiotherapy & Molecular Imaging (AREA)

Abstract

L'invention se rapporte à un procédé de prédiction de l'attention d'au moins un auditoire lors d'une présentation par au moins un locuteur. Le procédé est tel qu'il comporte les étapes de mesures (E25) de caractéristiques vocales ou gestuelles du au moins un locuteur de la présentation en cours et/ou de mesures de caractéristiques de contenu de la présentation en cours, mesure (E26) d'au moins un paramètre de durée ou d'occurrence des caractéristiques mesurées, consultation (E27) d'une base de données comportant une correspondance entre des caractéristiques vocales ou gestuelles de locuteur et/ou des caractéristiques de contenu de présentation, des paramètres de durée ou d'occurrence liés à ces caractéristiques et des informations relatives à l'évolution du niveau d'attention pour ces caractéristiques et ces paramètres et récupération des informations relatives à l'évolution du niveau d'attention correspondant aux mesures effectuées, de présentation (E28) à l'au moins un locuteur de la présentation, d'une prédiction de niveau d'attention à partir des informations relatives à l'évolution du niveau d'attention récupérées. L'invention se rapporte aussi à une phase d'apprentissage pour obtenir les correspondances de la base de données, à un dispositif de prédiction mettant en œuvre le procédé décrit ainsi qu'à un dispositif d'apprentissage mettant en œuvre la phase d'apprentissage.

Description

Prédiction de l'attention d'un auditoire lors d'une présentation
La présente invention se rapporte au domaine des systèmes et méthodes de prédiction de l'attention d'un auditoire et plus particulièrement lors d'une présentation par au moins un locuteur après une phase d'apprentissage sur un ensemble de présentations déjà effectuées.
De nombreuses méthodes permettent de mesurer en temps réel l'attention d'une personne dans diverses situations, par exemple au volant d'une voiture, lors d'une écoute à une conférence ou bien lors d'une visualisation d'un contenu vidéo.
Ces méthodes reposent par exemple sur des détections de mouvement de corps, de mouvement des yeux, de changement de rythme de respiration, du bavardage, etc. Cette liste n'est pas exhaustive.
L'objectif de ces mesures est de déceler une diminution de l'attention de la personne afin d'intervenir soit pour stimuler la personne soit pour changer le contenu visualisé ou le contexte dans lequel se trouve la personne.
Dans le cas de présentations faites par un locuteur ou plusieurs locuteurs, par exemple dans le cas de formations de type « e-learning », diffusées en ligne, on constate qu'il peut être difficile de garder l'attention de l'apprenant qui est derrière son écran et qui ne bénéficie pas d'une ambiance de groupe ou du contexte de la formation. Le formateur ne peut pas non plus se rendre compte d'une baisse d'attention lors de l'enregistrement de sa présentation, en particulier si cette présentation est proposée en différé.
Dans le domaine radiophonique, on constate également que des discours homogènes sans changement de rythme ou de locuteurs font perdre l'attention des auditeurs avec pour conséquence une perte d'audience pour la chaîne radiophonique. C'est pourquoi, que ce soit dans le domaine radiophonique ou le domaine audiovisuel, des relances ou changements de rythme sont souvent prévus, des annonces publicitaires sont insérées, des reformulations par d'autres locuteurs sont effectuées afin de conserver l'attention et l'audience sur des périodes de temps plus longues.
Cependant, ces astuces sont mises en œuvre la plupart du temps de façon empirique sans savoir si cela a un impact réel sur l'attention et sans savoir si leurs mises en œuvre sont nécessaires.
De même, d'autres mesures plus efficaces pourraient être effectuées pour garder l'attention de l'auditoire.
II existe donc un besoin de prédire l'attention d'un auditoire de façon à adapter une présentation en cours pour la rendre plus attractive devant un auditoire présent ou non encore présent, sans prendre de mesures de l'attention en temps réel. La présente invention vient améliorer la situation.
Elle propose à cet effet, un procédé de prédiction du niveau d'attention d'au moins un auditoire lors d'une présentation par au moins un locuteur. Le procédé est tel qu'il comporte les étapes suivantes :
- mesures de caractéristiques vocales ou gestuelles du au moins un locuteur de la présentation en cours et/ou mesures de caractéristiques de contenu de la présentation en cours;
- mesure d'au moins un paramètre de durée ou d'occurrence des caractéristiques mesurées ;
-consultation d'une base de données comportant une correspondance entre des caractéristiques vocales ou gestuelles de locuteur et/ou des caractéristiques de contenu de présentation, des paramètres de durée ou d'occurrence liés à ces caractéristiques et des informations relatives à l'évolution du niveau d'attention pour ces caractéristiques et ces paramètres et récupération des informations relatives à l'évolution du niveau d'attention correspondant aux mesures effectuées;
- présentation à l'au moins un locuteur de la présentation, d'une prédiction de niveau d'attention à partir des informations relatives à l'évolution du niveau d'attention récupérées.
Ainsi, le locuteur de la présentation a une information de prédiction sur l'attention que porte ou va porter l'auditoire à la présentation qu'il est en train d'effectuer. Pour cela, il n'est pas nécessaire avec ce procédé de faire des mesures en temps réel de l'attention de l'auditoire. De même, si une présentation est enregistrée pour être diffusée plus tard, le procédé permet d'être informé sur une estimation de l'évolution du niveau d'attention qu'un auditoire peut avoir de façon à adapter au besoin la suite de la présentation.
Les différents modes particuliers de réalisation mentionnés ci-après peuvent être ajoutés indépendamment ou en combinaison les uns avec les autres, aux étapes du procédé de prédiction défini ci-dessus.
Dans un mode de réalisation particulier, les informations relatives à l'évolution du niveau d'attention comprennent une probabilité sur l'évolution du niveau d'attention et cette probabilité est présentée à l'au moins un locuteur.
La probabilité ainsi présentée permet au locuteur de savoir dans quelle mesure il doit se fier à la prédiction de l'évolution du niveau d'attention qu'il a reçu. Il peut ainsi adapter au mieux ses actions futures.
Dans un mode de réalisation, les informations relatives à l'évolution du niveau d'attention sont corrigées en fonction d'une information de contexte de l'auditoire.
En effet, selon que l'auditoire comporte une ou plusieurs personnes, selon le lieu dans lequel la présentation est faite ou diffusée, selon l'horaire de présentation, la température du lieu dans lequel se trouve un auditoire, selon le type de public présent dans l'auditoire, selon que les membres de cet auditoire ont fait ou non un repas conséquent, etc ... , l'attention de l'auditoire peut différer. L'information de contexte permet donc d'améliorer ou de modifier l'estimation du niveau d'attention qui a été mesurée.
Dans un mode de réalisation particulier, les informations relatives à l'évolution du niveau d'attention sont corrigées en fonction de mesures d'émotion associées aux caractéristiques mesurées.
En effet, l'attention de l'auditoire peut évoluer de façon significative en fonction du contenu de la présentation, et plus particulièrement de mots ou phrases clés, ou en variante d'images particulières susceptibles de générer de l'émotion, ce qui a pour effet de recentrer l'attention de l'auditoire. Les mots clés et ou phrases clés, ou les images générant de l'émotion, sont déterminées par analyse des signaux audio et ou vidéo de la présentation, par exemple par le biais d'une reconnaissance vocale et ou d'une reconnaissance d'images, et la base de données comporte des informations permettant de relier ces mots clés avec une mesure d'émotion. Ainsi, selon ces éléments clés, l'attention de l'auditoire peut également différer selon que les éléments caractéristiques sont liés ou non à une mesure d'émotion additionnelle.
L'information relative au contenu de la présentation couplée à une mesure d'émotion associée permet donc d'améliorer ou de modifier l'estimation du niveau d'attention qui a été mesurée. Cette mesure d'émotion peut également être différente selon le type d'auditoire présent ou le contexte de l'auditoire. Les deux informations d'émotion et de contexte peuvent alors être prises en compte pour améliorer ou modifier l'estimation du niveau d'attention.
Dans un mode de réalisation le procédé comporte en outre une étape de détermination de recommandations d'actions à effectuer par le locuteur pour faire évoluer le niveau d'attention du au moins un auditoire en fonction des informations relatives à l'évolution du niveau d'attention récupérées et une étape de présentation à l'au moins un locuteur des recommandations déterminées.
Ainsi, le locuteur sait comment adapter sa présentation pour augmenter le niveau d'attention de son auditoire présent ou futur. Il peut optimiser au mieux la présentation en cours.
Dans une phase préalable au procédé de prédiction, une phase d'apprentissage est mise en œuvre. L'invention se rapporte ainsi à un procédé d'apprentissage d'informations d'évolution du niveau d'attention d'au moins un auditoire de présentations. La phase d'apprentissage est telle qu'elle comporte les étapes suivantes :
- collecte de mesures de niveau d'attention d'au moins un auditoire pour un ensemble de présentations, une présentation étant effectuée par au moins un locuteur ; - indexation des présentations de l'ensemble, par les mesures de niveau d'attention collectées ;
- indexation des présentations de l'ensemble par des mesures de caractéristiques vocales ou gestuelles des locuteurs et/ou des mesures de caractéristiques de contenu des présentations ;
- synchronisation des indexations respectives pour déterminer des associations entre des caractéristiques et des mesures de niveau d'attention pour les présentations de l'ensemble;
- détermination d'évolution des niveaux d'attention par analyse des associations déterminés pour un ensemble de caractéristiques ou groupes de caractéristiques et selon au moins un paramètre de durée ou d'occurrence de ces caractéristiques ;
- enregistrement dans une base de données, de correspondances entre les caractéristiques vocales ou gestuelles de locuteur et/ou les caractéristiques de contenu de présentation, les paramètres de durée ou d'occurrence liés à ces caractéristiques et des informations relatives à l'évolution du niveau d'attention pour ces caractéristiques et ces paramètres.
Ce procédé d'apprentissage peut être mis en œuvre sur une pluralité de présentations faites par le même locuteur ou par des locuteurs différents de façon à avoir un panel représentatif des caractéristiques possibles de présentations et de locuteurs. La base de données résultante peut être enrichie au fur et à mesure par des mesures effectuées pour de nouvelles présentations, elle peut donc évoluer.
Ce procédé d'apprentissage permet donc d'associer des informations sur l'évolution du niveau d'attention à des caractéristiques liées à la présentation en cours. La base de données résultante peut être sauvegardée dans le terminal mettant en œuvre le procédé de prédiction par exemple le terminal du présentateur de façon à ce qu'il ait les informations d'évolution de niveau d'attention de façon simple et sans qu'il soit nécessaire d'avoir des dispositifs de mesures ni même un accès réseau.
Dans un mode de réalisation particulier, l'information relative au niveau d'attention comprend une probabilité d'évolution calculée à partir de l'analyse d'un taux de répétabilité des évolutions déterminées sur l'ensemble des présentations.
Ceci apporte donc une mesure de confiance sur les informations d'évolution du niveau d'attention qui sont déterminés et présentés lors du procédé de prédiction au locuteur.
De façon à améliorer les correspondances entre caractéristiques et informations d'évolution de niveau d'attention enregistrées dans la base de données, les informations relatives à l'évolution du niveau d'attention enregistrées dans la base de données sont corrigées en fonction d'une information associée de contexte de l'auditoire ou en fonction de mesures d'émotion associées aux éléments caractéristiques correspondants. Ainsi, la méthode d'apprentissage prend aussi en compte les caractéristiques des contextes des auditoires, ce qui permettra lors de l'utilisation de ladite base de données de sélectionner des contextes d'auditoire correspondant à ceux attendus pour une présentation sur laquelle le procédé sera appliqué. Les mêmes caractéristiques de contexte pourront également être prises en compte si on applique également des mesures d'émotion, ces mesures pouvant également différer d'un contexte à l'autre.
Corrélativement, l'invention vise un dispositif de prédiction de l'attention d'au moins un auditoire d'une présentation effectuée par au moins un locuteur. Le dispositif est tel qu'il comporte :
- un module de mesure et de détection pour détecter des caractéristiques vocales ou gestuelles du au moins un locuteur de la présentation en cours et/ou des caractéristiques de contenu de la présentation en cours et pour mesurer au moins un paramètre de durée ou d'occurrence des caractéristiques détectés ;
- un module de consultation d'une base de données pour déterminer des informations relatives à l'évolution du niveau d'attention, la base de données comportant une correspondance entre des caractéristiques vocales ou gestuelles de locuteur et/ou des caractéristiques de contenu de présentation, des paramètres de durée ou d'occurrence liés à ces caractéristiques et des informations relatives à l'évolution du niveau d'attention pour ces caractéristiques et ces paramètres ;
- une interface utilisateur pour présenter à l'au moins un locuteur de la présentation, une prédiction de niveau d'attention à partir des informations relatives à l'évolution du niveau d'attention récupérées.
L'invention se rapporte à un terminal qui comporte un dispositif de prédiction tel que décrit.
Ce terminal et ce dispositif présentent les mêmes avantages que le procédé décrit précédemment.
Selon un autre aspect, l'invention vise un système de prédiction tel qu'il comporte un dispositif de prédiction décrit ci-dessus et un dispositif d'apprentissage comportant :
un module de collecte de mesures de niveau d'attention d'un auditoire prises sur un ensemble de présentations, une présentation étant effectuée par au moins un locuteur ;
un module d'indexation pour d'une part indexer par des mesures de niveau d'attention d'un auditoire, des présentations de l'ensemble et d'autre part indexer par des mesures de caractéristiques vocales ou gestuelles des locuteurs et/ou des mesures de caractéristiques de contenu des présentations, des présentations de l'ensemble; un module de synchronisation pour synchroniser les indexations respectives pour déterminer des associations entre des caractéristiques et des mesures de niveau d'attention pour les présentations de l'ensemble;
un module d'analyse pour déterminer des évolutions des niveaux d'attention par analyse des associations déterminés pour un ensemble de caractéristiques ou groupes de caractéristiques et selon un paramètre de durée ou d'occurrence de ces caractéristiques ;
un module d'enregistrement dans une base de données pour enregistrer des correspondances entre les caractéristiques vocales ou gestuelles de locuteur et/ou les caractéristiques de contenu de présentation, les paramètres de durée ou de temps liés à ces caractéristiques et des informations relatives à l'évolution du niveau d'attention pour ces caractéristiques et ces paramètres.
Ce dispositif d'apprentissage peut être avantageusement inséré dans un serveur d'un réseau de communication. Il peut également être inséré dans un terminal.
Ce dispositif présente les mêmes avantages que le procédé d'apprentissage décrit précédemment, qu'il met en œuvre.
L'invention vise enfin un système de prédiction tel qu'il comporte un dispositif d'apprentissage tel que décrit et un dispositif de prédiction tel que décrit.
L'invention vise également un programme informatique comportant des instructions de code pour la mise en œuvre des étapes du procédé de prédiction tel que décrit et/ou du procédé d'apprentissage tels que décrits précédemment, lorsque ces instructions sont exécutées par un processeur.
Elle vise aussi un support d'informations lisible par un processeur sur lequel est enregistré un tel programme informatique comprenant des instructions pour l'exécution des étapes du procédé de prédiction et/ou du procédé d'apprentissage tels que décrits.
D'autres caractéristiques et avantages de l'invention apparaîtront plus clairement à la lecture de la description suivante, donnée uniquement à titre d'exemple non limitatif, et faite en référence aux dessins annexés, sur lesquels :
- les figures la et lb illustrent des exemples de système de prédiction de l'attention d'un auditoire dans des contextes de présentation ou de conférence en temps réel ou enregistrée, animée par un locuteur, en présentielle dans une salle avec un auditoire ou en ligne à travers une communication par réseau ; la figure 2a illustre sous forme d'organigramme, les étapes principales d'un procédé d'apprentissage d'informations d'évolution du niveau d'attention, préalable à la phase de prédiction, dans un mode de réalisation de l'invention ; la figure 2b illustre sous forme d'organigramme les étapes principales d'un procédé de prédiction selon un mode de réalisation de l'invention la figure 3 illustre une configuration matérielle d'un dispositif d'apprentissage apte à mettre en œuvre le procédé d'apprentissage selon un mode de réalisation de l'invention ; et
la figure 4 illustre une configuration matérielle d'un dispositif de prédiction selon un mode de réalisation de l'invention.
La figure la représente un exemple de système et de contexte dans lequel le procédé de prédiction selon l'invention peut-être mis en œuvre. Un locuteur Ul est en train d'effectuer une présentation devant un auditoire AU. Il réalise sa présentation à l'aide d'un écran El et d'un terminal, ici un ordinateur Tl. L'ordinateur Tl est par exemple relié à un réseau R de type internet et peut être ainsi connecté à un serveur S sur lequel un procédé d'apprentissage a été mis en œuvre pour constituer une base de données DB2.
Le procédé d'apprentissage peut aussi dans un autre exemple de réalisation être mis en œuvre dans le terminal Tl. Il sera décrit plus en détails en référence à la figure 2a.
Le terminal Tl ou le serveur S met en œuvre un procédé de prédiction selon l'invention. Celui-ci sera décrit ultérieurement en référence à la figure 2b.
Pour mettre en œuvre le procédé de prédiction et/ou d'apprentissage dans le terminal Tl, celui-ci est associé à au moins un microphone non représenté apte à capter la présentation orale du locuteur. Le son ainsi capturé sera ensuite analysé pour déterminer des caractéristiques sonores du locuteur. Dans un exemple de réalisation, le terminal Tl est aussi associé à une caméra non représentée qui filme et détecte les mouvements du locuteur. Ces mouvements pourront aussi être analysés pour déterminer d'autres caractéristiques du locuteur lors de la présentation en cours.
La figure lb décrit un autre contexte d'un système de prédiction selon l'invention. Dans ce contexte, le locuteur Ul effectuant une présentation ou formation en ligne de type MOOC (pour «Massive Open Online Course » en anglais), est devant son ordinateur ou terminal Tl et diffuse sa présentation à travers le réseau R à un ensemble d'utilisateurs U2, U3 et U4, chaque utilisateur étant devant leur terminal respectif T2, T3 et T4. Ces utilisateurs représentent ainsi l'auditoire de la présentation en cours. De la même façon que pour la figure la, un serveur S peut dans un mode de réalisation mettre en œuvre le procédé d'apprentissage et/ou le procédé de prédiction selon l'invention. Dans un autre mode de réalisation, le procédé de prédiction est mis en œuvre dans le terminal Tl et le procédé d'apprentissage dans le serveur S ou bien à la fois le procédé de prédiction et le procédé d'apprentissage sont mis en œuvre dans le terminal Tl.
De la même façon que pour la figure la, le terminal Tl est associé par exemple à un microphone et à une caméra pour détecter à la fois les caractéristiques sonores du locuteur et les caractéristiques de mouvement.
La base de données DB2 est alimentée suite à la phase d'apprentissage et comporte des correspondances entre des éléments caractéristiques de locuteur comme des caractéristiques vocales ou gestuelles du locuteur et/ou de présentation comme des caractéristiques de contenu de la présentation, des paramètres de durée ou d'occurrence liés à ces caractéristiques ou éléments et des informations relatives à l'évolution du niveau d'attention pour ces caractéristiques et ces paramètres.
Ces systèmes de prédiction sont décrits ici comme exemples mais d'autres systèmes de présentation peuvent être possibles. Par exemple, une présentation de type MOOC peut être enregistrée par le présentateur de ce MOOC pour être diffusée ultérieurement en ligne ou pour être enregistrée sur le réseau afin d'être consultable à n'importe quel moment. Dans ce cas, l'auditoire est composé d'une seule personne qui consulte la présentation de façon isolée et quand il le souhaite.
En référence à la figure 2a, on décrit à présent les étapes mises en œuvre lors du procédé d'apprentissage dans un mode de réalisation de l'invention. Ce procédé d'apprentissage constitue une phase d'apprentissage mise en œuvre préalablement aux étapes du procédé de prédiction,
Pour ce procédé d'apprentissage, un ensemble de présentations déjà enregistrées est disponible par exemple sur le réseau ou dans une base de données soit du réseau soit de l'équipement mettant en œuvre cette phase d'apprentissage. Ainsi, un serveur du réseau ou bien un terminal d'un utilisateur par exemple, du locuteur de la présentation, peuvent mettre en œuvre cette phase.
A partir de cet ensemble de présentation Pi à PN, une étape E21a de détection de caractéristiques issues du locuteur de la présentation et/ou du contenu de la présentation est mise en œuvre.
Pour cela, une analyse est effectuée sur chacune des présentations P, de l'ensemble de présentations Pi à PN que l'on dénommera ensemble de référence ou ensemble de présentations de référence. Une analyse est effectuée sur des caractéristiques du présentateur, locuteur de la présentation. Par exemple, un capteur de mesure audio mesure au cours du déroulement de la présentation, le niveau sonore du locuteur, les caractéristiques de prosodie au cours du temps, c'est-à-dire les phénomènes d'accentuation et d'intonation (variation de hauteur, de durée et d'intensité) de la voix du locuteur. Un autre capteur de type vidéo, peut mesurer les gestes effectués par le locuteur lors de sa présentation enregistrée et les pauses qu'il peut effectuer. D'autres éléments d'analyse permettent de mesurer par exemple les bruitages éventuels lors de la présentation. L'analyse effectuée permet également de déterminer les caractéristiques propres au contenu lui-même, par exemple la façon dont la présentation a été filmée, l'évolution du cadrage, la présence de mots clés, d'images ou de séquences d'images clés, à l'aide par exemple d'un algorithme d'analyse d'images. Tous ces éléments d'analyse sont répertoriés et indexés, à l'étape E21b, sur la ligne de temps du déroulement de la présentation de référence. A partir de ce même ensemble de référence, une étape E20a est mise en œuvre pour mesurer l'attention d'un auditoire.
Pour cela, le dispositif d'apprentissage mesurant ce niveau d'attention est par exemple équipé d'une caméra apte à détecter les mouvements du visage, le clignement des yeux, la fréquence de bâillement, etc..
Plusieurs techniques de mesure du niveau d'attention peuvent être utilisées pour cette étape E20a. Les techniques décrites ci-après ne sont pas exhaustives. Le procédé mis en œuvre ici peut utiliser une seule de ces techniques ou bien plusieurs d'entre elles ; la combinaison de plusieurs techniques apportant alors une précision supplémentaire à la mesure de l'attention finalement obtenue.
Les mesures du niveau d'attention ainsi obtenues sont alors indexées, à l'étape E20b, sur la ligne de temps du déroulement de la présentation de référence.
Une technique de mesure du niveau d'attention est par exemple une technique basée sur l'analyse des visages de l'auditoire. Par exemple, lorsque l'auditoire est constituée de personnes consultant leur ordinateur pour suivre une conférence ou formation en ligne, la capture de l'image du visage du spectateur permet de voir quand celui-ci se détourne de son écran, s'il s'éloigne, se déplace ou est remplacé par un autre visage. Dans tous ces cas, cela veut dire que l'attention de l'utilisateur a diminué.
Une autre mesure possible est basée sur la mesure de la fréquence du clignement des yeux des personnes de l'auditoire. Lorsque le nombre de clignement dépasse un certain seuil ou lorsque les paupières de l'utilisateur sont trop longtemps fermées, cela veut dire que l'utilisateur est en phase de début de somnolence, et donc de perte d'attention.
Ces techniques sont bien connues dans le domaine des mesures de la vigilance des conducteurs. Elles peuvent être utilisées ici pour mesurer l'attention d'un participant à la présentation. Un exemple d'une telle technique est décrit dans le document intitulé « A PERCLOS-based Driver Fatigue Récognition Application for Smart Vehicle Space » des auteurs Wu Qing, Sun BingXi, Xie Bin and Zhao Junjie, dans « Third International Symposium on Information Processing (ISIP), pages 437-441 en 2010.
Une autre technique de mesure est basée sur la fréquence de bâillement des personnes de l'auditoire. Le bâillement est une réaction typique induite par la fatigue. Cela se traduit par une ouverture prolongée et incontrôlée de la bouche bien différente des autres déformations des lèvres et qui peut être mesurée par des techniques d'analyse de l'image. L'ouverture de la bouche lors d'un bâillement étant plus importante que l'ouverture de la bouche lors de la parole. Une telle technique est par exemple décrite dans l'article intitulé « Yawning détection for monitoring driver fatigue des auteurs Xiao Fan, Bao-Cai Yin, Yan- Feng Sun dnas « Proceedings of the Sixth International Conférence on Machine Learning and Cybernetics » à Hong Kong, 19-22 Août 2007. Une détection de changement d'orientation de la tête d'un auditeur peut également révéler une baisse d'attention. En effet une chute de tête vers l'avant est révélatrice de la fatigue de la personne. Si cette détection est de plus corrélée à d'autres détections décrites ci-dessus, alors la perte d'attention de cette personne est révélée.
Dans encore d'autres technologies, le niveau de bruit de bavardage ambiant peut également être détecté et peut ainsi révéler que l'auditoire n'est pas attentif à la présentation qui lui est proposée.
Ces différentes techniques de mesure du niveau d'attention peuvent être appliquées à plusieurs personnes formant l'auditoire. Dans ce cas, les niveaux d'attention déterminés, ainsi que l'évolution de ces niveaux d'attention au cours de la présentation analysée sont conservés en association avec l'auditoire concernée. Pour une même présentation et à un instant donné, plusieurs niveaux d'attention pourront ainsi être déterminés pour des groupes différents de personnes dans l'auditoire.
Pour une approche plus précise de la mesure du niveau d'attention, une mesure individuelle peut être privilégiée par rapport à une approche globale. Dans ce cas, la mesure d'attention est effectuée pour chacune des personnes de l'auditoire, le niveau global d'attention étant alors déterminé par le cumul des niveaux d'attention unitaires.
Dans un mode de réalisation particulier, une information de contexte de l'auditoire est associée à la mesure du niveau d'attention. En effet, selon le contexte de l'auditoire, la mesure de l'attention peut varier.
Par exemple, selon l'horaire de la présentation, le niveau d'attention d'un utilisateur peut être différent pour une même présentation. Il est en effet connu qu'un état de somnolence peut être favorisé en début de digestion dans l'heure suivant un repas alors que la vigilance atteint son maximum deux à trois heures après un repas. Si l'on mesure le niveau d'attention d'une même présentation à différentes heures et pour un public similaire, on peut déterminer la correction à apporter au niveau d'attention mesuré en fonction de l'heure.
De même, d'autres paramètres de contexte peuvent demander une correction du niveau d'attention. Par exemple, une date, une durée d'ensoleillement, la chaleur dans une pièce ou le nombre de personnes assistant à la présentation peuvent être des informations de contexte à apporter pour corriger le niveau d'attention mesuré.
Le type de public présent dans l'auditoire peut également faire différer le niveau d'attention, par exemple si le public est âgé, jeune, de culture différente, parlant une langue différente, etc..
Une fois ces mesures d'attention déterminées et le cas échéant associées à un paramètre de correction, elles sont indexées sur la ligne de temps de la présentation de référence en cours d'analyse. Dans une variante de réalisation, il est également possible de mesurer un niveau d'émotion de l'auditoire selon le contenu de la présentation. Dans ce cas, une mesure de niveau d'émotion est indexée en plus des autres indexations décrites ci-avant.
Ce type de mesure est par exemple effectuée par des techniques connues d'analyse du visage détectant par exemple un sourire, une grimace particulière, des pleurs, etc..
Ces niveaux d'émotion sont liés à des niveaux d'attention. En effet, un sourire par exemple peut caractériser un regain d'attention sur le contenu présenté.
Cette indexation d'émotion des présentations de référence est rapprochée à des indexations de caractéristiques du contenu des présentations, par exemple à l'existence de mots clés, d'images ou de séquences d'images clés.
A l'étape E22, un rapprochement des différentes indexations effectuées aux étapes E20b et E21b est effectué. Pour cela une synchronisation des deux types d'indexation est mise en œuvre pour que la mesure d'attention de l'auditoire, indexée à un instant temporel de la présentation soit associée à la ou les caractéristiques du locuteur et/ou de la présentation pour ce même instant temporel de la présentation.
Ainsi, on obtient en E22, suite à cette synchronisation, une association entre des éléments de mesure du niveau d'attention et des éléments de caractéristiques de la présentation et du locuteur. Cette association peut être enregistrée dans une base de données DB1. Pour la variante comportant des mesures d'émotion, une association est effectuée entre des éléments caractéristiques du contenu, les émotions mesurées et le niveau d'attention mesuré.
Dans le cas simplifié où les durées des lignes de temps des présentations diffusés à différents moments et indexés selon différentes caractéristiques sont identiques, la synchronisation se limitera à faire coïncider les débuts des dites lignes de temps.
Dans le cas où ces durées sont différentes, par exemple lors d'un fractionnement d'une présentation lors de questions réponses, les resynchronisations peuvent être périodiques sur la base de séquences détectées comme communes (par exemple par analyse de la bande son et comparaison).
A l'étape E23, les différentes synchronisations effectuées pour chaque présentation entre caractéristiques du locuteur, caractéristiques de la présentation et les mesures de niveau d'attention, sont utilisées par un module d'analyse pour déterminer l'évolution du niveau de l'attention. Ce module détermine des probabilités de corrélation entre une baisse ou une hausse observée sur la mesure d'attention et différents groupes d'éléments caractéristiques de la présentation et/ou du locuteur. A cette étape, on détermine également un paramètre de durée de cause à effet entre des groupes d'éléments caractéristiques du locuteur et/ou de la présentation et les évolutions de mesures d'attention pour distinguer par exemple les groupes d'éléments qui engendrent soit immédiatement soit après une durée de répétition de ces éléments, un taux de perte d'attention ou un taux de hausse d'attention. A cette étape est également déterminée l'influence d'un paramètre d'occurrence d'apparition d'un groupe d'éléments caractéristiques dans une présentation.
La liste n'est pas exhaustive, et d'autres déterminations seraient possibles, comme par exemple les interactions entre groupes d'éléments caractéristiques.
Ainsi, l'étape E23 permet de déterminer une évolution du niveau d'attention en fonction d'un groupe d'éléments caractéristiques du locuteur ou bien du contenu de la présentation ou encore des deux et en fonction d'au moins un paramètre de durée ou d'occurrence de ces éléments caractéristiques.
Par exemple, un ton monocorde d'un locuteur d'une présentation pendant une durée de plusieurs minutes fait évoluer progressivement le niveau d'attention à la baisse alors que la prononciation de mots clés ou la projection d'images clés (par exemple de violence ou de beau paysage) peut faire évoluer le niveau d'attention brutalement à la hausse.
Dans un mode de réalisation avantageux, des seuils de hausse et de baisse d'attention sont définis de façon à ne garder que des caractéristiques significatives du locuteur et/ou de la présentation. Le seuil peut par exemple être de 1 ou 2%.
Ces analyses de corrélation étant effectuées à l'ensemble de présentations de référence, l'étape E23 met également en œuvre une vérification de la répétabilité des évolutions déterminées pour chacune des représentations de référence. Dans le cas où une correspondance entre éléments caractéristiques ou groupes d'éléments caractéristiques et taux de baisse de niveau d'attention ou hausse de niveau d'attention se retrouve dans plusieurs présentations de l'ensemble, alors cette correspondance est enregistrée dans une base de données DB2, dite aussi base d'apprentissage.
Un calcul de probabilité d'évolution du niveau d'attention peut être effectué à partir de cette analyse du taux de répétabilité des évolutions de niveau d'attention déterminées sur l'ensemble de référence. Cette probabilité peut alors être enregistrée dans la base de données DB2, en association avec la correspondance évolution/caractéristiques qui lui correspond.
Ainsi, à l'étape E24, est enregistré dans une base de données DB2, un ensemble d'informations relatives à l'évolution du niveau d'attention (évolution du niveau à la hausse ou à la baisse, taux d'évolution, i.e un indice de progressivité de l'évolution, par exemple brusque ou progressive, une probabilité de l'évolution, par exemple le taux de répétabilité dans l'ensemble de référence , ...) en correspondance avec des éléments ou groupes d'éléments caractéristiques du locuteur et/ou de la présentation et au moins un paramètre de durée ou d'occurrence de ces éléments.
Ladite base DB2 peut dans sa version simplifiée se limiter à des fichiers de sauvegarde séparée, ou à une conservation des informations dans une table de base de données relationnelle distincte des autres tables constituant DB1. Un avantage de ladite distinction de la base DB2 est bien entendu que celle-ci pourra par la suite être utilisée de façon distincte de la base DB1 dans le cadre du processus de prédiction décrit en référence à la figure 2b. Plutôt donc que de devoir utiliser la très conséquente base DB1 avec les différentes indexations de présentations, seuls les résultats des analyses contenus dans la base DB2, à savoir la liste des groupes d'éléments caractéristiques et les paramètres de durée ou d'occurrence associés provoquant une probabilité d'évolution de l'attention et les informations d'évolution associées (tels que décrits ci-dessus), est nécessaire. La faible taille potentielle de la base DB2 permet donc des usages autonomes en mode embarqué, sans nécessiter de connexion réseau vers un serveur dédié à la base de données DB1. Dans une variante de réalisation, plusieurs ensembles de référence peuvent être prévus. Les différents ensembles étant par exemple créés en fonction des thèmes des présentations ou encore en fonction du type d'auditoire.
Ainsi, le fait de classer les présentations de référence en plusieurs groupes permet de trouver plus de points communs entre les présentations et ainsi plus de répétabilité des évolutions déterminées.
Un exemple d'enregistrement dans la base de données DB2 peut être, pour une caractéristique de silence du locuteur avec un paramètre de durée de quelques secondes, une correspondance avec une information relative à l'évolution du niveau d'attention qui est une hausse immédiate de l'attention.
Un autre exemple est une correspondance entre le un niveau sonore de la voix du locuteur qui reste invariant pendant plusieurs minutes et une baisse progressive du niveau d'attention.
Le changement de locuteur peut par exemple être associé à une hausse immédiate du niveau d'attention, de même le changement de cadrage de l'affichage de la présentation peut être associé à une hausse immédiate de l'attention.
Un taux de hausse ou de baisse de niveau d'attention, c'est-à-dire un indice de progressivité de l'évolution peut également être associé aux éléments caractéristiques déclencheurs.
Ainsi, à l'issue de cette phase d'apprentissage, la base de données DB2 est enrichie par un ensemble d'informations relatives à l'évolution du niveau d'attention en correspondance avec des éléments ou groupes d'éléments caractéristiques de présentation et/ou de locuteurs et des paramètres de durée ou d'occurrence de ces éléments.
Il est aussi possible d'y inclure le délai moyen et sa variance entre un événement déclencheur, c'est-à-dire un élément caractéristique, et son effet en termes d'évolution du niveau d'attention.
Les informations d'évolution de niveau d'attention sont caractérisées par une tendance d'évolution, baisse ou hausse, le cas échéant, un taux d'évolution, c'est-à-dire un indice lié à la progressivité de l'évolution de l'attention, pour distinguer les effets immédiats et les effets lissés sur une plus longue durée et une probabilité que cette tendance s'applique. Une information relative au délai moyen de survenue de l'évolution de l'attention peut également être enregistrée.
La figure 2b illustre les étapes mises en œuvre lors du procédé de prédiction selon l'invention. Ce procédé est mis en œuvre par exemple dans le terminal Tl du présentateur ou bien dans un serveur S du réseau de communication R. Il s'applique sur une présentation en cours, animée par au moins un locuteur. On parlera de présentation courante Pc.
Une première étape E25 effectue une analyse de cette présentation. Cette analyse porte par exemple sur les caractéristiques du locuteur, sa voix, son niveau sonore, ses gestes, ses temps de pause ou de respiration, etc..
Pour mesurer les caractéristiques de la voix du ou des locuteurs, un module d'analyse vocale est prévue dans le dispositif de prédiction, sur le son capté par un microphone associé aux équipements de la présentation.
L'analyse peut porter aussi sur le contenu de la présentation, ce qui est présenté à l'écran, la fréquence de changement de page, le cadrage de ce qui est montré, les couleurs utilisées, la détection de mots clés, d'images clés, etc..
Ce type d'analyse peut être effectué par exemple par une détection d'une action du présentateur pour le changement de page, par un analyseur d'image pour en détecter des couleurs ou des mouvements ou des images clés, etc..
A cette détection d'éléments caractéristiques de la présentation et/ou du locuteur est associée en E26 une détermination d'au moins un paramètre de durée de ces éléments caractéristiques ou de répétition dans le temps de ces éléments caractéristiques.
Une recherche dans la base de données DB2 de ces éléments caractéristiques du locuteur et/ou de la présentation et des paramètres associés est effectuée en E27 pour y retrouver les informations relatives à l'évolution du niveau d'attention probable correspondantes.
Ces informations permettent donc d'obtenir une prédiction du niveau d'attention que va avoir la présentation si les éléments caractéristiques correspondants perdurent pendant la durée associée ou sont répétés selon l'occurrence associée et si le locuteur ne change pas sa présentation ou ses caractéristiques.
Cette information de prédiction du niveau d'attention est présentée au locuteur de la présentation en E28 afin qu'il puisse réagir en temps réel sur sa présentation.
Une probabilité de cette prédiction de niveau d'attention et du taux d'évolution peut également être présentée.
Dans un mode de réalisation particulier, la prédiction du niveau d'attention est associée à une détermination de recommandations d'actions à effectuer sur la présentation pour faire évoluer le niveau d'attention dans le sens voulu, suivi de la présentation de ces recommandations au locuteur. Un exemple de recommandation est de demander d'augmenter le niveau sonore de la voix du locuteur si il a été détecté que le niveau de la voix diminue au cours du temps et que le temps pour lequel le niveau d'attention baisse, est dépassé.
Pour cela, la détermination de recommandations peut être mise en œuvre par:
* une interface de sélection du sens souhaité d'évolution du niveau d'attention : faire baisser l'attention (si par exemple le présentateur doit absolument évoquer tel sujet, mais qu'il préfère que personne ne s'en souvienne) ou l'augmenter. Un mode par défaut simplifiant l'interface du point de vue du locuteur serait d'améliorer l'attention par rapport à un niveau pertinent donné, fixé par exemple en référence au début de la présentation, phase où l'attention est classiquement considérée comme à son maximum.
* un moyen de détermination des caractéristiques permettant de faire évoluer avec une probabilité acceptable le niveau d'attention du ou des auditoires. Cette détermination peut s'effectuer selon les étapes suivantes:
a) sélection d'un premier ensemble de groupes de caractéristiques dans la base DB2 qui influent sur l'attention dans le sens voulu,
b) filtrage de l'ensemble en fonction du nombre d'occurrences de chacun de ces groupes de caractéristiques déjà mis en œuvre (déterminés) lors des phases antérieures de la présentation en cours, et en fonction du délai depuis la dernière occurrence rencontrée pour chaque groupe de caractéristiques (si la dernière occurrence est lointaine, on peut logiquement considérer qu'elle n'a plus d'impact sur l'efficacité du groupe de caractéristiques concerné)
c) et enfin sélection dans le sous ensemble résultant du filtrage, du groupe de caractéristiques dont la probabilité d'impact est la plus élevée. En variante, en cas d'égalité, différentes possibilités seraient présentées, et ou une serait choisie aléatoirement parmi le sous ensemble restant.
Par exemple, la recommandation pourrait consister à proposer de diffuser une image, par exemple d'un beau paysage, dont l'impact sur la probabilité d'évolution de l'attention est connu. Cette suggestion pourrait aussi consister en la proposition de groupes de mots clés à prononcer.
Ainsi le présentateur peut modifier sa présentation en fonction des recommandations et ainsi améliorer le niveau d'attention de son auditoire.
Le présentateur est ainsi informé des évolutions potentielles d'attention de son auditoire et ce même s'il n'y a pas de mesure en cours de l'attention de l'auditoire ou même s'il n'y a pas d'auditoire. En effet, la présentation peut être simplement en cours d'enregistrement sans personne devant pour une diffusion ultérieure devant un auditoire. En variante, le présentateur peut être simplement en train de répéter la présentation qu'il fera ultérieurement, et ce afin d'être plus efficace au moment opportun. Ainsi, il n'est pas nécessaire d'avoir des équipements de mesure de l'attention pour être informé de l'évolution du niveau d'attention en temps réel.
Dans un mode de réalisation particulier, ces informations sur l'évolution du niveau d'attention peuvent être corrigées en fonction d'informations de contexte liées à l'auditoire présent ou prévu. Ces informations peuvent être par exemple l'horaire de la présentation ou celle prévue pour être diffusée, le nombre de personnes de l'auditoire, la température de la pièce dans laquelle la présentation est faite, etc..
La correction à apporter est par exemple enregistrée dans les bases de données DB1 et DB2 en association avec les caractéristiques du locuteur et/ou de la présentation.
Dans une autre variante liée à la mesure d'émotion qui a pu être faite lors de la phase d'apprentissage, une pondération du niveau d'attention peut être prévue et enregistrée dans la base de données DB2. Cette pondération est alors appliquée aux informations relatives à l'évolution du niveau d'attention obtenues lors du procédé de prédiction lorsque les éléments caractéristiques déclencheurs sont associés à des mesures d'émotions comme décrit précédemment.
Cette pondération peut ainsi corriger la prédiction d'évolution présentée au locuteur. La présentation de la prédiction de niveau d'attention peut être faite sous différentes formes. Dans un exemple de réalisation elle peut être présentée au locuteur par un symbole de différente couleur. L'intensité de couleur peut par exemple correspondre au taux d'évolution du niveau d'attention. Cette présentation peut être faite sur l'écran personnel du présentateur ou, s'il s'agit de lumière, sur le micro de celui-ci. L'évolution du niveau d'attention peut également être représentée par une flèche pointant vers le haut en cas de hausse et vers le bas en cas de baisse, de hauteur plus ou moins grande selon le taux d'évolution associé. Une autre façon d'afficher le résultat de cette prédiction est par exemple d'afficher en début de séquence une valeur moyenne du niveau d'attention puis au fur et à mesure de l'avancement de la présentation de représenter les prévisions de niveau d'attention par une courbe pouvant passer en dessous ou au-dessus de cette valeur moyenne. La prédiction sur l'évolution du niveau est alors bien lisible par le présentateur. En variante un % représentant le taux d'exactitude constaté sur la base de données d'apprentissage pour la prévision en cours peut être présenté. Le délai dans lequel la prédiction d'évolution de l'attention est attendue peut aussi être présenté en secondes par exemple.
Ainsi, un tel procédé de prédiction peut permettre au présentateur d'une formation ou d'une présentation de l'améliorer en tenant compte des évolutions de niveau d'attention qui lui sont présentées. Il peut par exemple s'entraîner avant une présentation réelle afin d'optimiser son intervention et éviter les baisses de niveau d'attention. Il peut également prévoir des présentations différentes en fonction d'informations différentes de contexte d'auditoire. Par exemple, suivant l'horaire de diffusion de la présentation, il peut rendre la présentation plus dynamique avec des changements de locuteur ou de tonalité, si la présentation est diffusée à une heure de digestion et la prévoir moins dynamique sinon.
En variante encore, si les présentations sont diffusées à l'auditoire en différé (par exemple un MOOC peut être diffusé non pas en direct, mais peut être réalisé à un temps T, puis diffusés en 3 sessions plus tard aux temps Tl, T2 et T3), le procédé de prédiction et celui de suggestion pourrait conduire à diffuser 3 variantes différentes de la même vidéo de MOOC, l'une de ces dernières étant à la fois plus courte et plus dynamisée du fait que la session est planifiée en début d'après-midi sur une zone et période pour lesquelles une température élevée est prévue.
La figure 3 représente une architecture matérielle simplifiée d'un mode de réalisation d'un dispositif d'apprentissage mettant en œuvre le procédé d'apprentissage décrit en référence à la figure 2a.
On notera que l'invention qui est décrite ici peut être mise en œuvre au moyen de composants logiciels et/ou matériels. Dans cette optique, les termes « module » et « entité » utilisés dans ce document peuvent correspondre soit à un composant logiciel, soit à un composant matériel, soit encore à un ensemble de composants matériels et/ou logiciels, aptes à mettre en œuvre la ou les fonctions décrites pour le module ou l'entité concerné(e). Ce dispositif est équipé d'une interface de collecte de mesures 320 apte à collecter les mesures capturées par les capteurs Cl à CN représentés ici en 310i, 3102, 3103 et 310N.
Ces capteurs sont prévus d'une part pour mesurer les caractéristiques vocales du ou des locuteurs, par exemple grâce à un ou plusieurs microphones, pour mesurer les caractéristiques de mouvement du locuteur par exemple grâce à une caméra et d'autre part pour mesurer le niveau d'attention de l'auditoire. Pour cela aussi une caméra peut être prévue.
Le dispositif comprend une unité de traitement 330 équipée d'un processeur et pilotée par un programme informatique Pg 345 stocké dans une mémoire 340 et mettant en œuvre la phase d'apprentissage selon l'invention.
A l'initialisation, les instructions de code du programme informatique Pg sont par exemple chargées dans une mémoire RAM non représentée et exécutées par le processeur de l'unité de traitement 330. Le processeur de l'unité de traitement 330 met en œuvre les étapes du procédé d'apprentissage décrit précédemment en référence à la figure 2a, selon les instructions du programme informatique Pg.
Dans l'exemple de réalisation de l'invention considéré, le dispositif 300 comprend donc une interface d'entrée permettant de recevoir des présentations déjà enregistrées d'une base de données DB comportant un ou plusieurs ensembles de présentations de référence.
Il comprend un module d'indexation de caractéristiques propres au locuteur de la présentation et/ou de caractéristiques propres au contenu de la présentation. Pour cela, le module d'indexation reçoit des mesures collectées par l'interface 320 et effectuées par les capteurs Cl à CN pour déterminer le niveau d'intensité sonore du présentateur, sa tonalité, ses silences ou bien le niveau d'intensité sonore environnant. Il reçoit aussi des informations sur les changements dans le contenu présenté, par exemple un changement dans le cadrage, un changement de page de présentation, un zoom sur l'image, un mot clé, une image clé, en provenance de l'interface 320.
Le dispositif d'apprentissage comporte également un module d'indexation de mesures de niveau d'attention. Ces niveaux de mesure d'attention sont obtenus par l'interface 320 qui collecte les mesures effectuées par les capteurs Cl à CN et notamment les données mesurer par une ou plusieurs caméras à partir desquelles des algorithmes de détection de clignement des yeux ou de bâillement ou encore de positionnement de la tête sont mis en œuvre pour obtenir une mesure de niveau d'attention.
Cette mesure de niveau d'attention est indexée sur la présentation en cours de traitement de l'ensemble de présentations de référence. Un module de synchronisation 370 est également prévu pour synchroniser les deux types d'indexation et obtenir une association entre les éléments caractéristiques du locuteur et/ou de la présentation du module 350 et les mesures de niveau d'attention du module d'indexation 360.
Cette association d'éléments peut être enregistrée dans une base de données DB1 intégrée au dispositif ou disponible par un réseau de communication via un module de communication 390.
Un module d'analyse 380, piloté par le processeur 330, analyse les associations de niveaux d'attention mesurées et caractéristiques pour les présentations de référence et détermine une évolution du niveau d'attention selon au moins un paramètre de durée ou un paramètre d'occurrence des caractéristiques.
L'analyse permet d'associer une caractéristique ou une succession de caractéristiques à une évolution de niveau d'attention. Elle permet aussi de déterminer une durée ou nombre d'occurrence pour laquelle la caractéristique mesurée fait évoluer le niveau d'attention.
A la sortie du module d'analyse 380, une correspondance est faite entre des éléments caractéristiques ou groupes d'éléments caractéristiques du locuteur et /ou de la présentation, des paramètres de durée ou d'occurrence associés à ces éléments avec des informations relatives à l'évolution du niveau d'attention de l'auditoire.
Ces correspondances étant effectuées pour l'ensemble ou les ensembles de présentation de la base de données DB, le module d'analyse détermine dans un mode de réalisation particulier, le taux de répétabilité des associations définies. Seules les correspondances ayant un taux de répétabilité suffisant peuvent être enregistrées dans la base de données DB2. Cette base de données peut être stockée sur un serveur distant accessible par un réseau de communication via le module de communication 390 du dispositif. Le réseau de communication est par exemple un réseau IP. Dans un autre mode de réalisation, cette base de données DB2 est intégrée au dispositif d'apprentissage. Elle peut aussi être envoyée ou téléchargée sur un terminal, par exemple celui d'un locuteur de présentation.
Ce dispositif d'apprentissage est soit un serveur du réseau communiquant avec le terminal du présentateur soit le terminal du présentateur lui-même.
La figure 4 représente une architecture matérielle simplifiée d'un mode de réalisation d'un dispositif 400 de prédiction mettant en œuvre le procédé de prédiction décrit en référence à la figure 2b.
On notera que l'invention qui est décrite ici peut être mise en œuvre au moyen de composants logiciels et/ou matériels. Dans cette optique, les termes « module » et « entité » utilisés dans ce document peuvent correspondre soit à un composant logiciel, soit à un composant matériel, soit encore à un ensemble de composants matériels et/ou logiciels, aptes à mettre en œuvre la ou les fonctions décrites pour le module ou l'entité concerné(e). Ce dispositif est équipé d'une interface d'entrée apte à consulter une base de données DB2 interne au dispositif ou disponible sur un réseau de communication et comportant des correspondances entre éléments caractéristiques de locuteur et / ou de présentations, des paramètres de durée ou d'occurrence liés à ces éléments et des informations relatives à l'évolution du niveau d'attention d'auditoire pour ces éléments et paramètres et telles que apprises lors d'une phase d'apprentissage telle que décrite en référence à la figure 2a.
Le dispositif comprend une unité de traitement 430 équipée d'un processeur et pilotée par un programme informatique Pg 445 stocké dans une mémoire 440 et mettant en œuvre le procédé de prédiction selon l'invention.
A l'initialisation, les instructions de code du programme informatique Pg sont par exemple chargées dans une mémoire RAM non représentée et exécutées par le processeur de l'unité de traitement 430. Le processeur de l'unité de traitement 430 met en œuvre les étapes du procédé de prédiction décrit précédemment, selon les instructions du programme informatique Pg.
Dans l'exemple de réalisation de l'invention considéré, le dispositif 400 comprend donc une interface d'entrée permettant de recevoir le flux de données de la présentation en cours Pc. Cette interface peut également recevoir des informations de contexte de l'auditoire de cette présentation (Inf.Ctx).
Il comprend un module de détection 450 de caractéristiques du ou des locuteurs de la présentation et/ou de la présentation en cours. Un paramètre de durée de la caractéristique détectée ou de répétition (d'occurrence) de cette caractéristique est également détecté par le module 450. Ainsi, à la sortie de ce module de détection, des éléments caractéristiques sont obtenus. Le processeur 430 met en œuvre le module de détermination d'informations relatives à l'évolution du niveau d'attention en recherchant dans la base de données DB2, via l'interface 420 ou via la mémoire 440, si une correspondance comportant l'élément détecté et le paramètre associé est enregistrée. Le cas échéant, une prédiction sur l'évolution du niveau d'attention issue des informations relatives à l'évolution du niveau d'attention ainsi déterminées est envoyée à l'interface utilisateur 470 pour qu'une présentation de cette prédiction d'évolution soit effectuée au locuteur de la présentation en cours. Des recommandations d'actions à effectuer par le locuteur peuvent également être envoyées sur cette interface utilisateur pour qu'il fasse évoluer le niveau d'attention de sa présentation.
Ce dispositif de prédiction peut être compris dans le terminal du locuteur de la présentation. Dans ce cas, la prédiction est directement affichée sur l'écran de son terminal via l'interface utilisateur ou bien sur un accessoire branché sur son terminal, comme par exemple un microphone.
Le dispositif peut également être intégré à un serveur d'un réseau de communication, par exemple un réseau IP ; dans ce cas, la prédiction est présentée au locuteur de la présentation via un module de communication 490 qui transmet l'information au terminal du présentateur.
L'information de contexte de l'auditoire peut être utilisée par le module de détermination 460 pour corriger le cas échéant l'évolution déterminée.
Dans un mode de réalisation de l'invention, à la fois le dispositif d'apprentissage et le dispositif de prédiction sont inclus dans un même équipement, soit le terminal du locuteur, soit un serveur du réseau. Dans un autre mode réalisation, ces deux dispositifs sont distants, le procédé d'apprentissage et le procédé de prédiction étant mis en œuvre dans un système comprenant les deux dispositifs communiquant entre eux via un réseau.

Claims

REVENDICATIONS
Procédé de prédiction du niveau d'attention d'au moins un auditoire lors d'une présentation par au moins un locuteur, caractérisé en ce qu'il comporte les étapes suivantes :
- mesures (E25) de caractéristiques vocales ou gestuelles du au moins un locuteur de la présentation en cours et/ou mesures de caractéristiques de contenu de la présentation en cours;
- mesure (E26) d'au moins un paramètre de durée ou d'occurrence des caractéristiques mesurées ;
-consultation (E27) d'une base de données comportant une correspondance entre des caractéristiques vocales ou gestuelles de locuteur et/ou des caractéristiques de contenu de présentation, des paramètres de durée ou d'occurrence liés à ces caractéristiques et des informations relatives à l'évolution du niveau d'attention pour ces caractéristiques et ces paramètres, et récupération des informations relatives à l'évolution du niveau d'attention correspondant aux mesures effectuées;
- présentation (E28) à l'au moins un locuteur de la présentation, d'une prédiction de niveau d'attention à partir des informations relatives à l'évolution du niveau d'attention récupérées.
Procédé selon la revendication 1, caractérisé en ce que les informations relatives à l'évolution du niveau d'attention comprennent une probabilité sur l'évolution du niveau d'attention et en ce que cette probabilité est présentée à l'au moins un locuteur.
Procédé selon l'une des revendications 1 à 2, caractérisé en ce que les informations relatives à l'évolution du niveau d'attention sont corrigées en fonction d'une information de contexte de l'auditoire.
Procédé selon l'une des revendications 1 à 3, caractérisé en ce que les informations relatives à l'évolution du niveau d'attention sont corrigées en fonction de mesures d'émotion associées aux caractéristiques mesurées.
Procédé selon l'une des revendications 1 à 4, caractérisé en ce qu'il comporte en outre une étape de détermination de recommandations d'actions à effectuer par le locuteur pour faire évoluer le niveau d'attention du au moins un auditoire en fonction des informations relatives à l'évolution du niveau d'attention récupérées et une étape de présentation à l'au moins un locuteur des recommandations déterminées.
Procédé selon la revendication 1, caractérisé en ce qu'il comporte en outre une phase d'apprentissage d'informations d'évolution du niveau d'attention d'au moins un auditoire de présentations, la phase d'apprentissage comportant les étapes suivantes :
- collecte (E20a) de mesures de niveau d'attention d'au moins un auditoire pour un ensemble de présentations, une présentation étant effectuée par au moins un locuteur ;
- indexation (E20b) des présentations de l'ensemble, par les mesures de niveau d'attention collectées ;
- indexation (E21) des présentations de l'ensemble par des mesures de caractéristiques vocales ou gestuelles des locuteurs et/ou des mesures de caractéristiques de contenu des présentations ;
- synchronisation (E22) des indexations respectives pour déterminer des associations entre des caractéristiques et des mesures de niveau d'attention pour les présentations de l'ensemble;
- détermination (E23) d'évolution des niveaux d'attention par analyse des associations déterminés pour un ensemble de caractéristiques ou groupes de caractéristiques et selon au moins un paramètre de durée ou d'occurrence de ces caractéristiques ;
- enregistrement (E24) dans une base de données, de correspondances entre les caractéristiques vocales ou gestuelles de locuteur et/ou les caractéristiques de contenu de présentation, les paramètres de durée ou d'occurrence liés à ces caractéristiques et des informations relatives à l'évolution du niveau d'attention pour ces caractéristiques et ces paramètres.
Procédé selon la revendication 6, caractérisé en ce que l'information relative à l'évolution du niveau d'attention comprend une probabilité d'évolution calculée à partir de l'analyse d'un taux de répétabilité des évolutions déterminées sur l'ensemble des présentations.
Procédé selon l'une des revendications 6 à 7, caractérisé en ce que les informations relatives à l'évolution du niveau d'attention enregistrées dans la base de données sont corrigées en fonction d'une information associée de contexte de l'auditoire ou en fonction de mesures d'émotion associées aux caractéristiques correspondantes.
9. Dispositif de prédiction de l'attention d'au moins un auditoire d'une présentation effectuée par au moins un locuteur, caractérisé en ce qu'il comporte :
- un module de mesure et de détection (450) pour détecter des mesures de caractéristiques locales ou gestuelles du au moins un locuteur de la présentation en cours et/ou des caractéristiques de contenu de la présentation en cours et pour mesurer au moins un paramètre de durée ou d'occurrence des caractéristiques détectés ;
- un module de consultation (460) d'une base de données pour récupérer des informations relatives à l'évolution du niveau d'attention correspondant aux mesures détectées, la base de données comportant une correspondance entre des caractéristiques vocales ou gestuelles de locuteur et/ou des caractéristiques de contenu de présentation, des paramètres de durée ou d'occurrence liés à ces caractéristiques et des informations relatives à l'évolution du niveau d'attention pour ces caractéristiques et ces paramètres ;
- une interface utilisateur (470) pour présenter à l'au moins un locuteur de la présentation, une prédiction de niveau d'attention à partir des informations relatives à l'évolution du niveau d'attention récupérées.
10. Terminal caractérisé en ce qu'il comporte un dispositif selon la revendication 9.
11. Système de prédiction caractérisé en ce qu'il comporte un dispositif de prédiction selon la revendication 9 et un dispositif d'apprentissage comportant :
un module (320) de collecte de mesures de niveau d'attention d'un auditoire prises sur un ensemble de présentations, une présentation étant effectuée par au moins un locuteur ;
un module d'indexation (350, 360) pour d'une part indexer par des mesures de niveau d'attention d'un auditoire, des présentations de l'ensemble et d'autre part indexer par des mesures de caractéristiques vocales ou gestuelles des locuteurs et/ou par des mesures de caractéristiques de contenu des présentations, des présentations de l'ensemble;
un module de synchronisation (370) pour synchroniser les indexations respectives pour déterminer des associations entre des caractéristiques et des mesures de niveau d'attention pour les présentations de l'ensemble;
un module d'analyse (380) pour déterminer des évolutions des niveaux d'attention par analyse des associations déterminés pour un ensemble de caractéristiques ou groupes de caractéristiques et selon un paramètre de durée ou d'occurrence de ces caractéristiques ; un module d'enregistrement (340, 390) dans une base de données pour enregistrer des correspondances entre les caractéristiques vocales ou gestuelles de locuteur et/ou les caractéristiques de contenu de présentation, les paramètres de durée ou de temps liés à ces caractéristiques et des informations relatives à l'évolution du niveau d'attention pour ces caractéristiques et ces paramètres.
12. Système de prédiction selon la revendication 11, caractérisé en ce que le dispositif d'apprentissage est un serveur.
13. Programme informatique comportant des instructions de code pour la mise en œuvre des étapes du procédé de prédiction selon l'une des revendications 1 à 8, lorsque ces instructions sont exécutées par un processeur.
14. Support d'informations lisible par un processeur sur lequel est enregistré un programme informatique comprenant des instructions pour l'exécution des étapes du procédé de prédiction selon l'une des revendications 1 à 8.
EP17772084.4A 2016-09-01 2017-08-31 Prédiction de l'attention d'un auditoire lors d'une présentation Pending EP3506829A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR1658105A FR3055203A1 (fr) 2016-09-01 2016-09-01 Prediction de l'attention d'un auditoire lors d'une presentation
PCT/FR2017/052314 WO2018042133A1 (fr) 2016-09-01 2017-08-31 Prédiction de l'attention d'un auditoire lors d'une présentation

Publications (1)

Publication Number Publication Date
EP3506829A1 true EP3506829A1 (fr) 2019-07-10

Family

ID=59381310

Family Applications (1)

Application Number Title Priority Date Filing Date
EP17772084.4A Pending EP3506829A1 (fr) 2016-09-01 2017-08-31 Prédiction de l'attention d'un auditoire lors d'une présentation

Country Status (4)

Country Link
US (1) US10942563B2 (fr)
EP (1) EP3506829A1 (fr)
FR (1) FR3055203A1 (fr)
WO (1) WO2018042133A1 (fr)

Families Citing this family (11)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN108882480B (zh) * 2018-06-20 2020-06-05 新华网股份有限公司 舞台灯光和装置调节方法和系统
US20200092339A1 (en) * 2018-09-17 2020-03-19 International Business Machines Corporation Providing device control instructions for increasing conference participant interest based on contextual data analysis
US11514805B2 (en) * 2019-03-12 2022-11-29 International Business Machines Corporation Education and training sessions
TWI780333B (zh) * 2019-06-03 2022-10-11 緯創資通股份有限公司 動態處理並播放多媒體內容的方法及多媒體播放裝置
JP7410557B2 (ja) * 2020-02-04 2024-01-10 株式会社Agama-X 情報処理装置及びプログラム
US11514924B2 (en) * 2020-02-21 2022-11-29 International Business Machines Corporation Dynamic creation and insertion of content
EP3975181B1 (fr) * 2020-09-29 2023-02-22 Bull Sas Évaluation de la qualité d'une session de communication dans un réseau de télécommunication
US12026948B2 (en) * 2020-10-30 2024-07-02 Microsoft Technology Licensing, Llc Techniques for presentation analysis based on audience feedback, reactions, and gestures
JP7513534B2 (ja) * 2021-01-12 2024-07-09 株式会社Nttドコモ 情報処理装置及び情報処理システム
WO2023002496A1 (fr) * 2021-07-18 2023-01-26 Doshi Payal Système d'apprentissage en ligne intelligent utilisant la distribution adaptative de cours vidéo en fonction de l'attention du spectateur
CN114358135B (zh) * 2021-12-10 2024-02-09 西北大学 一种利用数据增强和特征加权实现的mooc辍学预测方法

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20140006326A1 (en) * 2012-06-28 2014-01-02 Nokia Corporation Method and apparatus for providing rapport management

Family Cites Families (9)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US8392503B2 (en) * 2007-06-19 2013-03-05 Cisco Technology, Inc. Reporting participant attention level to presenter during a web-based rich-media conference
US20090138332A1 (en) * 2007-11-23 2009-05-28 Dimitri Kanevsky System and method for dynamically adapting a user slide show presentation to audience behavior
US20110263946A1 (en) * 2010-04-22 2011-10-27 Mit Media Lab Method and system for real-time and offline analysis, inference, tagging of and responding to person(s) experiences
US8670018B2 (en) * 2010-05-27 2014-03-11 Microsoft Corporation Detecting reactions and providing feedback to an interaction
US8965822B2 (en) * 2011-05-11 2015-02-24 Ari M. Frank Discovering and classifying situations that influence affective response
US9525952B2 (en) * 2013-06-10 2016-12-20 International Business Machines Corporation Real-time audience attention measurement and dashboard display
US20150332166A1 (en) * 2013-09-20 2015-11-19 Intel Corporation Machine learning-based user behavior characterization
US10446055B2 (en) * 2014-08-13 2019-10-15 Pitchvantage Llc Public speaking trainer with 3-D simulation and real-time feedback
US10187694B2 (en) * 2016-04-07 2019-01-22 At&T Intellectual Property I, L.P. Method and apparatus for enhancing audience engagement via a communication network

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20140006326A1 (en) * 2012-06-28 2014-01-02 Nokia Corporation Method and apparatus for providing rapport management

Non-Patent Citations (3)

* Cited by examiner, † Cited by third party
Title
GAN TIAN GANTIAN@COMP NUS EDU SG ET AL: "Multi-sensor Self-Quantification of Presentations", MULTIMEDIA, ACM, 2 PENN PLAZA, SUITE 701 NEW YORK NY 10121-0701 USA, 13 October 2015 (2015-10-13), pages 601 - 610, XP058509717, ISBN: 978-1-4503-3459-4, DOI: 10.1145/2733373.2806252 *
JOHN R ZHANG ET AL: "Correlating Speaker Gestures in Political Debates with Audience Engagement Measured via EEG", MULTIMEDIA, ACM, 2 PENN PLAZA, SUITE 701 NEW YORK NY 10121-0701 USA, 3 November 2014 (2014-11-03), pages 387 - 396, XP058058674, ISBN: 978-1-4503-3063-3, DOI: 10.1145/2647868.2654909 *
See also references of WO2018042133A1 *

Also Published As

Publication number Publication date
FR3055203A1 (fr) 2018-03-02
US20190212811A1 (en) 2019-07-11
US10942563B2 (en) 2021-03-09
WO2018042133A1 (fr) 2018-03-08

Similar Documents

Publication Publication Date Title
EP3506829A1 (fr) Prédiction de l'attention d'un auditoire lors d'une présentation
US20260010560A1 (en) Responding to remote media classification queries using classifier models and context parameters
US9058384B2 (en) System and method for identification of highly-variable vocalizations
JP2011253374A (ja) 情報処理装置、および情報処理方法、並びにプログラム
EP3140786A1 (fr) Liaison d'activités utilisateur courantes à des collections de contenus multimédias stockées associées
CN102244788A (zh) 信息处理方法、信息处理装置、场景元数据提取装置、丢失恢复信息生成装置和程序
CN107493501B (zh) 一种音视频内容过滤系统及方法
Ramsay et al. The intrinsic memorability of everyday sounds
US11157549B2 (en) Emotional experience metadata on recorded images
CN115866339A (zh) 电视节目推荐方法、装置、智能设备及可读存储介质
Wu et al. Cold start problem for automated live video comments
CN105284121A (zh) 多媒体流和社交网络线程之间的同步
EP3556102B1 (fr) Procede d'enregistrement d'un programme telediffuse a venir
EP3107302B1 (fr) Procédé et dispositif de substitution d'une partie d'une sequence video
CA2592994A1 (fr) Procede de recherche d'informations dans une base de donnees
EP4198971A1 (fr) Method for selecting voice contents recorded in a database, according to their veracity factor
FR3130422A1 (fr) Procédé de sélection de contenus vocaux en- registrés dans une base de données, en fonction de leur facteur de véracité.
JP7572200B2 (ja) キーワード抽出装置、キーワード抽出プログラム及び発話生成装置
CN120689477B (zh) 一种基于数据驱动的数字人优质视频生成方法及系统
WO2024208593A1 (fr) Procédé de génération d'une séquence temporelle d'évaluations d'une situation et dispositif associé
WO2018077987A1 (fr) Procédé de traitement de données audio issues d'un échange vocal, système et programme d'ordinateur correspondant
JP6852191B2 (ja) フィンガープリントを変換して不正なメディアコンテンツアイテムを検出するための方法、システムおよび媒体
JP2026074997A (ja) システム
EP4375899A1 (fr) Procede et dispositif de recommandation d'activites a au moins un utilisateur
WO2023007061A1 (fr) Procédé de traitement d'informations, terminal de télécommunication et programme d'ordinateur

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20190122

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR

AX Request for extension of the european patent

Extension state: BA ME

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)
RAP1 Party data changed (applicant data changed or rights of an application transferred)

Owner name: ORANGE

RAP3 Party data changed (applicant data changed or rights of an application transferred)

Owner name: ORANGE

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: EXAMINATION IS IN PROGRESS

17Q First examination report despatched

Effective date: 20221104