EP4659199A1 - Procédé de génération de données d'enrichissement d'une vue d'un environnement, dispositif de rendu, équipement serveur, système et programme d'ordinateur correspondants - Google Patents

Procédé de génération de données d'enrichissement d'une vue d'un environnement, dispositif de rendu, équipement serveur, système et programme d'ordinateur correspondants

Info

Publication number
EP4659199A1
EP4659199A1 EP24703325.1A EP24703325A EP4659199A1 EP 4659199 A1 EP4659199 A1 EP 4659199A1 EP 24703325 A EP24703325 A EP 24703325A EP 4659199 A1 EP4659199 A1 EP 4659199A1
Authority
EP
European Patent Office
Prior art keywords
environment
view
interest
data
env
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP24703325.1A
Other languages
German (de)
English (en)
Inventor
Yoann HAMON
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Orange SA
Original Assignee
Orange SA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Orange SA filed Critical Orange SA
Publication of EP4659199A1 publication Critical patent/EP4659199A1/fr
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T7/00Image analysis
    • G06T7/70Determining position or orientation of objects or cameras
    • G06T7/73Determining position or orientation of objects or cameras using feature-based methods
    • G06T7/75Determining position or orientation of objects or cameras using feature-based methods involving models
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T19/00Manipulating three-dimensional [3D] models or images for computer graphics
    • G06T19/006Mixed reality

Definitions

  • This application concerns the field of virtual and/or augmented reality.
  • the present application proposes a method for generating data for enriching at least one view of at least part of an environment from at least a first point of view, said view being intended to be rendered to the less partially by at least one rendering device, said method comprising:
  • enrichment data (of said view, at least from the location information obtained, said enrichment data comprising at least data representative of a position of said object of interest relative to said first point of view and data representative of an obscured part of said object of interest.
  • the present application thus proposes a completely new and inventive approach allowing enriched visualization of part of a real environment in which there is at least one object of interest.
  • This approach enriches the view of the part of the environment by adding in particular position information of the object of interest and information on the obscured part of this object.
  • the present application proposes to improve the visibility of a real environment for a user equipped with a rendering device mounted on his head and through which he visualizes this environment, which is not possible, for example, from solutions based solely on voice.
  • the view thus enriched can, for example, help a user of the rendering device to monitor the movement of one or more objects of interest in the environment and to prevent risky situations in terms of accidents.
  • the present application can contribute to helping a user of a rendering device to become aware, on the part of the enriched environment rendered by the rendering device, of the presence and position of objects of interest present in the real environment, even if they are not visible, or partially, in reality from one's own point of view (they can be hidden by a physical object such as a partition, furniture, a machine, a pallet of stacked boxes, etc.).
  • the term environment here refers to a real place, closed or open, for example a factory, a warehouse, a residential building, a shopping center, etc., in which all types of objects of interest in the broad sense may be found.
  • the term view of the environment rendered by the rendering device is used for any representation of this real environment displayed on the screen of the user's rendering device, whether virtual, mixed or augmented.
  • object of interest here refers to any type of object likely to be of interest to a user of the rendering device, i.e. construction machinery, a robot, an animal or an individual. In this context, a human being or an animal is considered an "object" of detection or localization by an appropriate technique using sensors.
  • the object of interest is likely to move, for example to move in the environment and/or to perform movements, for example rotation and/or twisting on itself, that is to say without necessarily changing position. It may be at least partially visible from the first point of view, or even totally obscured by physical obstacles (furniture, machines, partitions, etc.) and/or by lack of light.
  • the location information is obtained multiple times, e.g. periodically, e.g. once per second, and the portion of the environment rendered by the rendering device is updated when new location information is provided. location are available, so as to present at an instant to a user of the rendering device an enriched view consistent with the reality on the ground.
  • the rendering device can correspond to any type of user terminal equipped with suitable communication and rendering means.
  • a virtual view of the environment comprising enrichment data generated by the invention is superimposed as an additional layer on that of the view of the part of the real environment displayed by the rendering device, which can itself be real, virtual or mixed.
  • the rendering device is a fixed terminal, of the workstation or surveillance type from which a user, or supervisor, can monitor at least part of the real environment and/or the activity which is taking place. takes place there. It can be understood in the environment or distant.
  • the view of the part of the real environment rendered by the device is obtained from images captured by one or more cameras arranged in different positions of the real environment. The point of view is for example that of one of the cameras in question.
  • the at least one rendering device is a device for monitoring said environment, and/or a plurality of mobile rendering devices.
  • the rendering device may for example be a device for global supervision of said environment, for example terminal equipment such as a fixed or mobile computer, which is not necessarily located in the environment and may be remote.
  • the user is, for example, a supervisor in charge of monitoring activity within the environment and in particular ensuring the safety of the individuals present there.
  • the point of view can be the point of view of a camera whose video data was used to produce the view produced by the rendering device or more generally the origin of an environmental reference frame.
  • the enriched view(s) may be rendered by a plurality of mobile rendering devices.
  • At least one rendering device among the plurality of mobile rendering devices is mobile terminal equipment of said environment and comprises at least one camera configured to capture video data from the first point of view, the view rendered being generated at least partially from video data from said camera.
  • the rendering device is mobile equipment such as a rendering device worn on the head or HMD (from English, “Head Mounted Device”), of the glasses or virtual reality headset type. and/or increased).
  • a rendering device worn on the head or HMD from English, “Head Mounted Device”
  • the user of this device is inside the real environment and can move around there.
  • this is a maintenance operator responsible for working on machine tools present in the environment.
  • the renderer is present in the environment and the viewpoint is that of the user's renderer.
  • the method of generating enrichment data further comprises generating enrichment data of a virtual graphic representation of said environment, intended to be rendered by said device for supervising said environment, thus allowing for example to a user, for example a supervisor, to carry out global supervision of said environment.
  • the method comprises:
  • the object of interest is a physical object at least partially visible on the view. This is for example a part of a machine tool, certain faces of which are not visible because they are masked by other constituent parts of the machine tool.
  • description information such as information on shape, dimension, structure, material, etc. is for example obtained and used to enrich the view.
  • the enrichment data may contribute, in at least some embodiments, to enhancing the physical object in the view displayed to the user. For example, its contours appear highlighted, a noise produced by the object of interest is amplified, textual description information (name, reference, etc.) or graphics is superimposed on the real view, indicating where it is precisely located. the piece he has in front of him and which piece it is.
  • This description information is for example stored in a memory.
  • video data of the portion of the environment captured by cameras of the environment from distinct viewpoints may be used to detect and recognize the object of interest.
  • the object of interest is an individual present in the environment. It is assumed that at least part of his body is detectable on view or other video footage captured by other cameras. When this body part has been detected and recognized as such, information describing the human body (anatomy data, positions of key points such as knees, ankles, head, hands, etc.) can be used to enrich the view. displayed by the rendering device at the position of the individual.
  • the object of interest is a part of the user's body, such as his or her arms.
  • the object of interest is an electromechanical device, or part of this device, for example an articulated handling arm.
  • the method comprises: obtaining a graphic representation of the obscured part of the object of interest in the view of the part of the environment rendered by the rendering device at least depending on the position of the object of interest relative to the point of view and the description information, the enrichment data of the obscured part includes the graphic representation obtained.
  • the description information includes a manipulable 3D graphical representation model of the object of interest, which can be displayed with the view (such as at the margin of the view).
  • the 3D graphic representation of the object of interest has been constructed beforehand and stored in memory. The user can view it from different angles or even obtain additional information on this object and for example visualize hidden parts of this room. If it is a part of a machine, he could also access information relating to the interactions of this part with other parts of the machine, for example included in a description manual accessible via his device rendering.
  • An advantage in at least certain embodiments, is that the rendering of this graphical representation can help the user of the rendering device to visualize the obscured part of the object of interest and therefore to have a more complete perception of this object of interest.
  • enriching the view can, for example, help a maintenance operator understand how a part is arranged with one or more other parts of a machine tool.
  • the determined obscured part comprises a part of the body of the individual and the graphic representation of this obscured part can include, at least in certain embodiments, an avatar of that individual’s body part.
  • an advantage perhaps of helping the user of the rendering device to realize the posture and/or movement of this individual and therefore to perceive possible risks of collision or even an accident.
  • this avatar is obtained from positions of the hidden part and an inverse kinematics technique which defines the members as non-deformable solids of given length linked together by joints and subjected to given maximum constraints.
  • An advantage at least in certain embodiments, may be to help produce an avatar relatively faithful to reality in the sense that the body of the individual will adopt realistic postures.
  • the view can be enriched, at least in some embodiments, from the arms of an avatar to the positions of the arms in the view. In this way, the user can see for example where his arms are located even if they are partly obscured by parts of the machine tool he is repairing.
  • the object of interest can also be a robot or an articulated handling arm, part of which is obscured.
  • a graphical representation of the hidden part of this robot can be, as previously described, inserted into the enrichment data generated to increase the perception of the part of the environment seen by the user.
  • the location information of said at least one object of interest is obtained from at least one position sensor placed nearby and/or on said at least one object.
  • Such an embodiment can help locate the object of interest, whether or not it is visible in the view, for example when it is outside the field of view of the camera(s) which captured the video data. from which the view was generated.
  • such a position sensor can also help identify the object of interest.
  • it is a radio frequency identification device or RFID (from the English, “Radio-frequency Identification”) configured to emit a radio signal in response to a radio signal received from at least one monitoring device. reading tags placed in the environment, the latter being configured to read at least one identification information contained in the tag and determine a relative position of the object of interest relative to the reading device placed in the environment.
  • the object of interest when the object of interest is a physical object, typically a part of a machine tool, a robot, a cart, an element of furniture, etc., it can generally be equipped with means of identification, in particular for inventory purposes.
  • the object of interest is another rendering device, for example the HMD device of a user which is in the environment, it can also be equipped with at least one position sensor, as well as other sensors, for example cameras, an inertial system etc.
  • the location of an object of interest can also be obtained by other means (in particular in the case where the object of interest is not equipped with a position sensor), for example by image processing from video sequences captured by cameras placed in the environment and/or carried by the rendering device. This is the case, for example, of an individual who does not wear an HMD rendering device or of physical objects which are not part of the inventory (unlike those listed above) but which could constitute dangerous obstacles.
  • the method further comprises:
  • this mapping of the environment provides information on the positions of physical objects, for example stationary, present in the environment which may constitute potential obstacles to the visibility of other users. They correspond, for example, to partitions, doors, furniture, machines, tools, boxes, carts, and more generally any type of physical object. They do not necessarily correspond to a point of interest for a user. In at least certain embodiments, this mapping can also indicate at least one danger zone.
  • geolocation solutions are possible to locate (for example precisely) objects of interest and people which can be equipped with location devices, based on a satellite positioning solution, for example of the GPS type.
  • a satellite positioning solution for example of the GPS type.
  • a geolocation solution using ultra-wideband or UWB radio technology from English, "Ultra Wide Band”
  • BDF from English, "Bluetooth Direction Finding” for indoors, or not being equipped with such devices.
  • geolocation is implemented works using sensors present in the environment such as RGB-D cameras for example, and whose position is known in an environmental reference frame.
  • a map can be constructed from in particular 3D video data captured by one or more users when they survey the premises, in a systematic and exhaustive (initial construction) or according to their interventions (construction as it goes).
  • a matching of video frames acquired by different users at different times can help detect areas that are found in different frames and then label them using a set of labels depending on the type of environment considered (for example the set of labels can be adapted to a site and be different for a machine maintenance site, for a production line, for a goods storage warehouse, etc).
  • the enrichment data includes, in addition to the positions of the physical objects, identification information for this physical object obtained from the mapping or image matching previously mentioned.
  • Knowledge of this mapping can for example be used to help obtain (for example determine) the obscured part of an object of interest in the view displayed by the rendering device.
  • the detection of said at least one object of interest implements an artificial intelligence module configured to use at least one previously learned model and associating said 3D video data with position and position information. classification of said object of interest.
  • An advantage of using an artificial intelligence module can be, at least in certain embodiments, to take advantage of its processing power and integration of a quantity of data which can be very large and of its capacity, once trained, to help produce reliable, accurate and reproducible results.
  • such an artificial intelligence module can make it possible to obtain position information of one or more key points of the object in the view and at least one class or type of the object. This can be particularly interesting, at least in certain embodiments, in particular for objects of interest which are not equipped with position sensors (such as RFID sensors).
  • position sensors such as RFID sensors
  • the artificial intelligence module can output the class of the room and its position in the environment. From the class obtained, it is possible, for example, to fetch the corresponding description information from memory.
  • the artificial intelligence module can produce, at least in certain embodiments, the position of key anatomical points and recognize that it is a human being.
  • the method comprises learning (for example prior) of said model from a learning database comprising a plurality of data pairs, said pair associating 3D video data with at least position information of an object of interest and object class information.
  • a learning base can be constituted by manually labeling video sequences of elements from a list of objects of interest that the user is likely to encounter when present in the environment. For example, this is a parts catalog for an industrial machine.
  • the learning base can be a database, for example public data, presenting labeled images or videos of individuals in different positions.
  • the labels indicate, for example, the different parts of the body (limbs, head, trunk).
  • the learning is “continuously” updated using data collected over time and user evaluations of the quality and accuracy of the generated enrichment data (and in particular location and identification of objects/users/individuals).
  • the present application also relates to a data device for enriching at least one view of at least part of an environment from at least a first point of view, said view being intended to be rendered at least partially by at least a rendering device, said device being configured to implement:
  • said enrichment data comprising at least data representative of a position of said object of interest relative to said first point of view and data representative of an obscured part of said object of interest.
  • the device according to the present application can generate enrichment data for several rendering devices, including the rendering devices (for example of the HMD type) of several users present in the environment and/or for a device for rendering a supervising user, called a supervision device, which is not necessarily present in the environment.
  • the rendering devices for example of the HMD type
  • a supervision device for a device for rendering a supervising user
  • a supervisor can for example visualize an enriched global view of the environment on which the positions of the users present are indicated. In this way, the supervisor can for example easily locate them (for example locate them all at a glance). In the event of an accident, such embodiments can help the supervisor to understand the situation more quickly and therefore to manage the emergency.
  • the position of an injured user can for example be reported very quickly (or even immediately) to other users located nearby. Knowing and visualizing his position, they can for example intervene without delay.
  • the rendering devices can in certain embodiments be equipped with at least one vital signs sensor (cardiac, fall, etc.) to automate the detection of accidents.
  • the enrichment data generation device is configured to generate enrichment data of a virtual graphical representation of said environment, intended to be rendered by said supervision device (ET, DISP) of said environment.
  • said device is configured to implement the steps of the method for generating data for enriching at least one view of at least part of an environment as described previously.
  • said device is integrated into server equipment connected via a communication network to at least one rendering device adapted to produce at least partial rendering of a view of at least one environment from at least a first point of view.
  • said server equipment comprises a module configured to generate a virtual graphical representation of the environment intended to be rendered by said device for monitoring said environment.
  • this virtual graphical representation can be enriched with enrichment data generated by said enrichment data generation device.
  • the server equipment and the device have at least the same advantages as those conferred by the aforementioned generation method.
  • the communication network can be adapted to allow communications between the server equipment and the rendering device(s) having a reasonable latency (for example without latency), that is to say in quasi real time.
  • the invention makes it possible to generate enrichment data for several renderings of the real environment, for example those of the users of HMD devices who evolve (move, work, etc.) in the real environment and that of the supervisor.
  • the aforementioned server equipment can itself be integrated into a system for supervising an environment comprising at least one rendering device adapted to produce at least partial rendering of a view of the environment from at least a first point of view and at least one sensor configured to collect at least one location information of at least one object of interest present in the environment.
  • said system may include several rendering devices:
  • a fixed rendering device intended to be used by a supervisor in charge of the activity and safety of the environment, to visualize one or more views of parts of the environment according to one or more points of view corresponding to video cameras placed in the environment;
  • one or more mobile rendering devices for user(s) present in the environment through which everyone can, for example, visualize the part of the environment visible from their own point of view.
  • said supervision system comprises at least one mobile rendering device provided with an electronic label and at least one location device configured to implement the reception of a signal comprising identification information coming from said electronic tag, determining a location of said electronic tag based on the identification information received, and transmitting said location to said enrichment data generation device.
  • the location device provides the enrichment data generation device with the location(s) of the mobile rendering devices provided with electronic labels, which can contribute to a reduction in the computational load of said enrichment data generation device .
  • said locating device is configured to transmit, prior to receiving the signal comprising identification information from said electronic label, a request signal intended for said electronic label, such an embodiment allows the use of passive RFID (Radio Frequency Identification) type electronic labels.
  • passive RFID Radio Frequency Identification
  • electronic labels can emit (for example regularly) their respective identification data.
  • the invention also relates to a computer program product comprising program code instructions for implementing the enrichment data generation method as described above, in any of its embodiments, when it is executed by a processor.
  • a program may use any programming language, and may be in the form of source code, object code, or intermediate code between source code and object code, such as in a partially compiled form, or in any other desirable form.
  • the invention finally aims at a recording medium readable by a computer on which is recorded the computer program comprising program code instructions for the execution of the steps of the method according to the invention as described above in the any of its embodiments.
  • Such a recording medium can be any entity or device capable of storing the program.
  • the medium may comprise a storage means, such as a ROM, for example a CD ROM or a microelectronic circuit ROM, or even a magnetic recording means, for example a mobile medium (memory card) or a hard drive or SSD.
  • such a recording medium may be a transmissible medium such as an electrical or optical signal, which can be conveyed via an electrical or optical cable, by radio or by other means, so that the computer program contained therein is remotely executable.
  • the program according to the invention may in particular be downloaded over a network, for example the Internet.
  • the recording medium may be an integrated circuit in which the program is incorporated, the circuit being adapted to execute or to be used in the execution of the aforementioned method.
  • the present technique is implemented by means of software and/or hardware components.
  • module can correspond in this document to a software component as well as to a hardware component or to a set of hardware and software components.
  • a software component corresponds to one or more computer programs, one or more subprograms of a program, or more generally to any element of a program or software capable of implementing a function or a set of functions, as described below for the module concerned.
  • Such a software component is executed by a data processor of a physical entity (terminal, server, gateway, set-top-box, router, etc.) and is capable of accessing the hardware resources of this physical entity (memories, recording media, communication bus, electronic cards inputs/outputs, user interfaces, etc.). Subsequently, by resources we mean all sets of hardware and/or software elements supporting a function or service, whether unitary or combined.
  • a hardware component corresponds to any element of a hardware assembly capable of implementing a function or a set of functions, according to what is described below for the module concerned. It may be a programmable hardware component or one with an integrated processor for executing software, for example an integrated circuit, a smart card, a memory card, an electronic card for executing firmware ( “firmware” in English), etc.
  • FIG. 1 schematically illustrates an example of architecture of an environment supervision system, comprising at least one device for generating data for enriching at least one view of the environment, according to at least one mode of carrying out the invention
  • FIG. 2 describes in flowchart form the steps of a method of generating data for enriching a view of an environment implemented by the device according to at least one embodiment of the invention
  • FIG. 3 schematically illustrates a graphic representation of a body of an individual of which at least part has been detected on view, according to at least one embodiment of the invention
  • FIG. 4A and [Fig. 4B] schematically illustrate artificial intelligence modules each implementing a previously learned model to detect objects of interest, according to at least one embodiment of the invention
  • FIG. 5 schematically illustrates a view enriched with images of a scene in which the parts of the body of an individual, obscured by a wall, are represented by the corresponding parts of an avatar of this individual, according to at least one embodiment of the invention
  • FIG. 6 schematically illustrates the data flows between the equipment and devices of the system according to at least one embodiment of the invention
  • FIG. 7 illustrates an example of hardware structure of a device for generating data for enriching a view of an environment according to at least one embodiment of the invention.
  • the present application relates to a device for generating data for enrichment of a part of a real environment rendered by an augmented reality rendering device AR (from English, “Augmented Reality”) and/or virtual VR (from English, “Virtual Reality”) and/or mixed MR (from English, “Mixed Reality”).
  • AR from English, “Augmented Reality”
  • VR from English, “Virtual Reality”
  • mixed MR from English, “Mixed Reality
  • HMD type rendering device from English, “Head Mounted Display” intended to be mounted on the head of a user, and through which the user can visualize an environment real, increased.
  • This could be, for example, augmented reality glasses or a virtual reality headset.
  • Haptic effects e.g. vibrations
  • audio can also be rendered
  • the invention is not limited to HMD devices, but applies to any terminal equipment, for example a smart phone (from English, “smartphone”), a computer, a tablet etc., provided that it is suitable for producing a virtual, augmented or mixed reality rendering.
  • AR augmented reality is a technology that makes it possible to integrate virtual elements (for example in 3D and/or in real time) into a real environment.
  • the principle is to combine the virtual and the real and give the illusion of perfect integration to the user.
  • augmented reality glasses are equipped with transparent lenses that allow the user to see with their own eyes a view of the part of the environment located in their field of vision (real view). Virtual elements are superimposed on this real view and enrich the user experience.
  • Virtual reality VR is a technology allowing a virtual scene to be digitally simulated by computer, for example at least by sight. For example, it allows the user of a virtual reality headset to experience an immersion experience in an artificial world.
  • a 3D video of the part of the real environment located in the user's field of vision is captured in real time by at least one camera placed on the headset and displayed on the screen of the headset instead of what the user would see with their own eyes.
  • Mixed reality MR is a technology that captures the environment around a user, transcribes it in 3D and allows 3D objects to be inserted and manipulated as in the case of VR. According to these principles, additional virtual elements are integrated into the 3D video to enrich the view of the environment.
  • the principle of the invention consists in particular of obtaining location information of at least one object of interest capable of moving in the real environment and of exploiting it to generate enrichment data, for example audio, haptic and /or visual, of a portion of the environment rendered by the rendering device.
  • enrichment data may in particular include, in the case of an HMD type rendering device, visual indicators of relative positions of the object(s) of interest in relation to the rendering device (or its user) in the real environment, whether they are visible from the point of view of this user or masked (ie obscured) by the presence of objects.
  • this individual may or may not be equipped with a rendering device, different from or similar to the rendering device of the present application.
  • This other rendering device can for example be an HMD type rendering device worn by this individual. If so, this second rendering device allows you to display a view of part of the environment from your own point of view on a screen of your HMD device placed in front of your eyes.
  • This application applies to both an indoor and outdoor environment. It can be particularly interesting for a work environment, in which several operators work on potentially dangerous physical objects, for example machine tools. It can indeed help, at least in certain embodiments, to signal at any time to the user of the rendering device, the position of objects of interest located near him, such as individuals, users or not. rendering devices or robots and can thus help prevent (or limit) the occurrence of work accidents.
  • FIG. 1 we present by way of illustration a simplified example of architecture of a supervision system S of an ENV environment according to one embodiment of the invention. It is assumed here that this is an indoor environment, for example a factory building or a warehouse or any type of premises.
  • This rendering device is an HMD1 rendering device of the HMD type mounted on its head in the example illustrated. The user is viewing a view of the ENV environment on the screen of the HMD1 rendering device placed in front of his eyes. For example, it was obtained from one or more video cameras attached to the HMD device and corresponds to its field of vision.
  • At least one object of interest is likely to be present and mobile in the ENV environment.
  • this concerns a plurality of individuals OP2 to OP4.
  • at least one of these individuals can also be equipped with a rendering device identical to or different from the rendering device of the user OP1.
  • individuals are also equipped with rendering devices HMD2 to HMD4, for example HMD type devices mounted on their heads.
  • the environment ENV also includes a plurality of physical objects, arranged in different locations, which can reduce the visibility of the user OP1 depending on his position, his size and/or his orientation in particular.
  • These are, for example, generally immobile physical objects, participating in an arrangement of the environment, for example an OBJ1 partition, a door, large furniture such as the OBJ2 machine tool, a cabinet, a production line (not shown), generally fixed.
  • These can also be physical objects, for example smaller in size, capable of being moved, such as an OBJ3 cart, an OBJ4 box, a chair or a table (not shown), etc.
  • These may also be objects of interest (not shown) that the user has in sight on their screen and that they wish to manipulate, for example to carry out a maintenance operation.
  • the system S comprises the rendering device HMD1 to HMD4 of the user OP1 and of the individuals OP2 to OP4.
  • the system S may also include at least one sensor, for example a plurality of sensors, SNS_ENV1 to SNS_ENV4, placed(s) in the environment ENV and configured(s) to collect measurement data comprising at least location information of the HDM device 1 (and/or its user OP1), HDM devices 2 to HDM4 (and/or individuals OP2, OP3, OP4 using these devices) and more generally objects of interest present in the environment.
  • at least one sensor for example a plurality of sensors, SNS_ENV1 to SNS_ENV4, placed(s) in the environment ENV and configured(s) to collect measurement data comprising at least location information of the HDM device 1 (and/or its user OP1), HDM devices 2 to HDM4 (and/or individuals OP2, OP3, OP4 using these devices) and more generally objects of interest present in the environment.
  • the at least one sensor comprises for example at least one RFID location and identification device (from English, “Radio Frequency Identification”) configured to communicate by a radio link with at least one electronic TAG label placed on at least one object of interest, when it is in its field of action (for example approximately 1 cm to 50 m), recover the identification information contained in this label and locate it precisely by triangulation.
  • the wireless communication technology used belongs to a group including radio technologies such as UWB, BLE (from English, “Bluetooth Low Energy, Wi-Fi, 5G etc.
  • the system may comprise at least one camera, here a plurality of video cameras placed according to different points of view and configured to capture 3D video sequences of the ENV environment.
  • the 3D video sequences provided by these cameras may be used to detect and locate objects of interest (physical objects or living beings) present in the ENV environment but not equipped with electronic tags TAG.
  • the system S may also include temperature sensors, smoke detectors, or more generally any other type of sensor capable of collecting measurement data relating to a state of the environment or the elements which constitute it at a given moment.
  • the system S comprises a device 100 for generating data enriching a view of a part of the environment ENV, for example displayed on a screen of the rendering device (for example HMD1) d 'at least one user (for example OP1).
  • a device is configured to obtain information relating to its own location (or that of its user), from data collected by sensors coupled to the rendering device HMD1 worn by the user and location information of at least one object of interest likely to move in said environment.
  • This location information may be collected by sensors placed in the environment or on and/or in the user's rendering device and/or on and/or in objects of interest.
  • the device 100 for generating enrichment data is configured, at least from the location information obtained, to determine a relative position of the object of interest from the point of view of the device 100 (or in other words its reference frame) then generate enrichment data for said view, at least from the determined relative position.
  • Said enrichment data includes at least visual, audio, haptic indications, etc. of the position of said at least one object of interest in relation to the user OP1 and/or to his rendering device.
  • the device 100 is configured to transmit said enrichment data to the device for rendering the view concerned, for example to the device HMD1 for rendering the user OP1 for their display.
  • the device 100 thus implements the method of generating data for enriching at least one view of a part of the environment rendered by a rendering device according to the invention which will be detailed below in relation to the figure 2.
  • each of the operators OP1 to OP4 is a user of a rendering device HM1 to HMD4 and the device 100 is configured to generate data enriching the views viewed by each of them.
  • it can generate enrichment data rendered on a single rendering device of the system S.
  • the device 100 can also generate enrichment data of a rendering global view of the ENV environment for an SV supervisor user in charge of the security of the ENV environment and equipped with a rendering device, for example the ET terminal equipment.
  • This supervisor SV and its terminal equipment ET can be present in the environment ENV or remote and connected to the other elements of the supervision system S by a communication network (not shown).
  • the system S includes server equipment S which integrates the device 100.
  • the device 100 can be independent of the server equipment S, but connected to it by a wired or wireless link.
  • the ES server equipment can be placed outside the ENV environment, in a remote communications network, for example organized according to a cloud architecture, provided that the communications between the server equipment and the monitoring devices rendering can be done with limited latency (for example without latency), that is to say in near real time.
  • the device 100 can be integrated into a rendering device, for example the rendering device HMD1 of the user OP1 or the rendering device ET of the supervisor SV.
  • the server equipment ES comprises an E/R transmission reception module configured for example to receive the measurement data collected by at least one sensor (for example the plurality of sensors SNS_ENV1 to SNS_ENV4) placed in the ENV environment and/or at least one sensor of at least one rendering device (for example sensors of the users' rendering devices SNS_OP1 to SNS_OP4).
  • at least one sensor for example the plurality of sensors SNS_ENV1 to SNS_ENV4 placed in the ENV environment and/or at least one sensor of at least one rendering device (for example sensors of the users' rendering devices SNS_OP1 to SNS_OP4).
  • the server equipment ES may also include a transmission/reception module (confused with or distinct from the module below) configured to transmit and receive data to or from other elements of the system S, for example to receive the measurement data from the sensors and/or transmit the enrichment data provided by the device 100 to the rendering device HMD1, comprising at least one rendering indication of at least one relative position (with respect to OP1) of at least one object of interest present in the environment, such as for example at least one of the other users OP2-OP4.
  • the server equipment ES may also include a memory M configured to store at least the measurement data received from the sensors and the rendering enrichment data.
  • the server equipment ES may further comprise an artificial intelligence module MIA1 configured to detect and/or recognize objects of interest present in the environment and visible at least partially in acquired 3D video sequences by cameras placed in the environment and/or on and/or in the rendering devices HMD1 to HMD4 of users OP1 to OP4.
  • MIA1 module can also be configured to detect and/or recognize obstacles present on the route of one of these users (cash register, forklift, etc.).
  • the MIA1 module is configured to analyze the images of the video sequences to determine in which context the object(s) of interest that it has detected are used.
  • the MIA1 module detects that the user has an identifiable object of interest in front of him and that his hands are close to it, it can decide that the user wishes to intervene or is in the process of intervening on this object and producing this information as output so that enrichment data is generated to increase the view of this object of interest to the user.
  • it can also be configured to produce as output information according to which another user is already in the process of intervening on this object of interest, so that specific enrichment data is generated to signal this to the user. 'user.
  • the server equipment ES may also include an artificial intelligence module MIA2, possibly distinct from the previous module MIA1, configured to detect and/or recognize parts (for example limbs) of the body of individuals at least partially visible in the sequences video (or other parts of non-human objects of interest in certain embodiments).
  • MIA2 artificial intelligence module
  • the transmission/reception module, the memory, the artificial intelligence module(s) can be integrated into the device 100 itself.
  • the ES server equipment comprises a JUM module configured to generate a virtual graphical representation of the ENV environment, called a digital twin, which a user, for example the SV supervisor, can view on a DISP display device for its ET terminal equipment and in which it can navigate as it wishes to carry out monitoring.
  • the device 100 can, in certain embodiments, be configured to generate enrichment data from one or more views of this digital twin and transmit them to the ET rendering device.
  • Figure 2 we now describe a method for generating data for enriching the rendering of at least one rendering device according to at least one embodiment of the invention.
  • this involves the enrichment of a view of at least part of the environment ENV displayed on a screen of a rendering device HMD1 of at least one user OP1.
  • a method is for example implemented by the device 100, integrated for example in the server equipment ES of FIG. 1.
  • the method can include obtaining 21 location information LOC of the device rendering HMD1 and/or the user OP1, obtaining 22 location information LOC_OI of at least one object of interest present in the ENV environment and capable of moving there, such as at least one other users OP2 to OP4 or a robot.
  • This location information can be obtained, for example from data received from the sensors SNS_HMD1 of the rendering devices HMD1 to HMD4 carried by the user OP1 and the other users OP2 to OP4 and/or by other sensors SNS_ENV1 to SNS_ENV4 placed in the environment.
  • this location information can be obtained from RFID location and identification devices placed in the environment, as previously described in relation to Figure 1.
  • they can be obtained multiple times, for example periodically, for example once per second. They can be associated with temporal information representative of the current temporal instant of the measurement. They can also be obtained non-periodically, for example depending on the movements of the user and/or objects of interest (when passing near a sensor such as an RFID reader for example).
  • the method can then comprise a determination 23 of the positions of the user OP1 (and/or of his rendering device) and of the objects of interest Ol such as the other users OP2 to OP4 in the reference frame Ref of the environment ENV, from the location information obtained. They are for example stored in memory, for example in memory M of the server equipment ES. This determination 23 can for example be triggered by obtaining new location information at 21 and 22. Relative positions of the objects of interest, relative to the user OP1 (in a reference frame of the user centered on his rendering device HMD1) can also be determined in at least certain embodiments.
  • enrichment data can be generated at least from these relative positions.
  • They include for example coordinates and description information of a rendering indicator, such as a visual indicator to be inserted in the view displayed on the screen of the rendering device HMD1.
  • a rendering indicator such as a visual indicator to be inserted in the view displayed on the screen of the rendering device HMD1.
  • They can also be visual indicators representing danger zones, the presence of colleagues, critical information (breakdown, danger, etc.).
  • lateral vibrations can also be introduced to indicate to the user in which direction the danger zone is located, the colleague, etc., characteristic sound signals or simply a voice message from a supervisor.
  • the user's FOV field of view can, for example, be determined from the orientation of their head and general knowledge of the human visual system.
  • the orientation of the head can for its part be obtained for example from inertial data collected by at least one sensor of the IMU inertial measurement module type (from English, “Inertial Measurement Unit”) placed on the rendering device HMD1 and configured to measure acceleration, angular velocity and/or orientation using accelerometers, gyroscopes and/or magnetometers.
  • the presence of another user or an object of interest moving in the ENV environment may be signaled even if it is outside the user's field of view FOV OP1, for example behind their back.
  • the method can finally include the transmission of the enrichment data generated at least to the rendered HMDI device of the user OP1 with a view to rendering them.
  • the enrichment data generated (or more precisely the elements that they describe) will be superimposed on the real view of the environment that the user OP1 perceives through spectacle lenses.
  • the HMD1 device is of the virtual reality headset type, they will be integrated by/during the update of the virtual view generated by the headset. This transmission may be optional in certain embodiments, for example when the generation device is also the rendering device.
  • the method comprises obtaining a 3D MAP map of the ENV environment.
  • this is a map that locates and identifies physical objects present in the ENV environment, such as partitions, doors, windows, rooms, aisles, furniture, etc. These physical objects are generally fixed and participate in the layout of the place. They are likely to constitute obstacles to the visibility of other users OP2 to OP4.
  • This MAP mapping can take into account data from a building plan, if applicable.
  • this MAP mapping can be obtained using a location and matching technique, for example of the SLAM type (from English, “Simultaneous Location and Mapping”), for example a technique described in the article by Ruan et al., entitled “GP-SLAM+: real-time 3D lidar SLAM based on improved regionalized Gaussian process map reconstruction”, published in August 2020 by arXiv, according to which one or more operators, for example users OP1 to OP4 , survey the ENV environment and capture 3D video sequences of this environment. The video sequences obtained are used to reconstruct a 3D view or map of the building, in particular by detecting common regions between the different sequences.
  • SLAM type from English, “Simultaneous Location and Mapping”
  • GP-SLAM+ real-time 3D lidar SLAM based on improved regionalized Gaussian process map reconstruction
  • This operation can be carried out, in an initialization phase, prior to the implementation of the method according to the invention, on the basis of a systematic and exhaustive survey of the operators, so as to obtain an initial version of the MAP map. of the environment. In certain embodiments, it can be supplemented over time by taking into account 3D video sequences acquired by users OP1 to OP4 during their interventions in the ENV environment.
  • such a 3D MAP mapping includes location and identification information of physical objects OP that includes the environment ENV (for example the physical objects which constitute it).
  • this location and identification information can be taken into account when generating the ENH enrichment data (at 29).
  • the visual indications of other users OP2 to OP4 can specify whether, from the point of view of the user OP1, they are placed in front of or behind one or more of the physical objects OP located and identified by the mapping, therefore they are visible or at least partially hidden.
  • the method also comprises obtaining 24, from at least one CAM camera of said rendering device HMD1 of the operator OP1, 3D 3DV video data representative of the part of the environment perceived by the user OP1 from his position and according to his point of view.
  • obtaining 24 from at least one CAM camera of said rendering device HMD1 of the operator OP1, 3D 3DV video data representative of the part of the environment perceived by the user OP1 from his position and according to his point of view.
  • the method can implement the detection 26 of at least one object of interest present in the view, at least using the 3D video data obtained.
  • This is for example a physical object, such as a particular part of a machine tool which the user OP1 has approached and towards which he directs at least his gaze, or even his hands and on which he must intervene. It can also be a fixed physical object, which has for example not been mapped, or even a living being such as an individual who is not equipped with an HMD rendering device (and therefore 'a TAG tag) or an animal.
  • the user could blink to designate an object of interest placed in front of him for which he wishes to enrich the view being viewed.
  • a relative position of said at least one object of interest relative to the user OP1 is determined, from the 3D video data obtained.
  • the detection can be configured so as to characterize the objects of interest sought. For example, we can define, using a radius centered on the rendering device, an area in which the detected objects of interest are taken into consideration and presented to the user of the rendering device. Too close, some of the information would be missing, too far, it would be overloaded.
  • the step of detecting at least one object of interest can be carried out by an artificial intelligence module MIA1 implementing a previously learned model.
  • MIA1 an artificial intelligence module
  • Such a module is trained to produce position and classification information, or even identification of the object of interest. It will be detailed further in relation to Figure 4 A.
  • the method comprises in 28 obtaining description information DESC of the object of interest Ol detected.
  • This is, for example, a technical sheet or even a 3D virtual representation that can be manipulated of the object of interest.
  • this description information DESC is stored in the memory M of the server equipment ES, for example within a virtual catalog of objects of interest present in the environment ENV.
  • This DESC description information can be taken into account at 29 to generate additional enrichment data relating to the detected object of interest.
  • this additional enrichment data may define a visual contour indicator of the object of interest to be superimposed on the displayed view and/or a command for inserting the virtual 3D graphic representation of this manipulable object of interest. in a corner of the HMD1 renderer's screen.
  • This additional enrichment data is aggregated at 29 with the other enrichment data (including the relative position of at least one object(s) of interest (for example at least one of the other users) relative to the user) , before their transmission in 30 to the rendering device HMD1 of this user for display.
  • the object of interest detection information is also stored in memory. They can thus be used to enrich the views of the environment of other users and/or that of the digital twin, and/or for the purpose of creating a history.
  • the 3DV video data captured in 24 are further used to detect and/or recognize in 25 one or more parts of the body of the user OP1 and/or one or more parts of an individual who is not equipped with an HMD rendering device or even another OP2-OP4 user of an HMD rendering device. They can also in certain embodiments be exploited to detect and/or recognize one or more parts of an object of interest, such as a device having a body and/or rigid portions, possibly articulated and/or interconnected , of shape and/or possible movements known for example, such as an electromechanical device (such as a robot) referenced in a knowledge base).
  • an object of interest such as a device having a body and/or rigid portions, possibly articulated and/or interconnected , of shape and/or possible movements known for example, such as an electromechanical device (such as a robot) referenced in a knowledge base).
  • individuals such as other users OP2 to OP4
  • these are for example those who are at least partially visible on the video data captured by the camera of the rendering device HMD1 and possibly other cameras placed in the ENV environment over the time period considered.
  • the detection of objects of interest in the environment and near the rendering device can be carried out using input data other than one or more video sequences.
  • data acquired by other types of sensors than a video camera such as a laser (LIDAR), sonar, microphone, pressure sensor, motion detector, can be exploited instead or in addition to the video sequence(s).
  • LIDAR laser
  • sonar sonar
  • microphone pressure sensor
  • motion detector motion detector
  • this detection step can be performed by an artificial intelligence module MIA2 implementing a previously learned MOD2 model. It will be detailed further in relation to FIG. 4B.
  • the part of an object of interest (for example the part of the body of the user OP1 and/or of at least one other individual, for example other users OP2-OP4, or the part of an object of interest other than human), is positioned in a reference frame of the user OP1 and, in certain embodiments in a reference frame of the environment ENV.
  • the location and possibly identification information obtained can be stored in memory in association with the current time instant (associated with the captured video sequence) and the identification of the user concerned.
  • the method comprises at 27 obtaining, at least from the detection information obtained, a virtual 3D graphic representation of the part(s) of the body of the user OP1 identified and/or parts of other possible objects of interest (such as parts of the body of other individuals).
  • it involves generating an avatar of a point of interest such as the user OP1 (and/or the other possible individual(s)) which can be inserted and animated in one or more views of the environment ENV intended to be viewed by the user himself/herself and/or others. users of other near-real-time rendering devices.
  • This 3D graphic representation or avatar may include, for example, at least some of the following information:
  • each part of a point of interest can be defined independently of the others.
  • an arm is made up of an elbow, a forearm, a wrist, a palm of the hand, fingers, themselves made up of phalanges. It is therefore necessary to precisely position and animate each of these elements.
  • the relative positions of the elements which make up a part of the body of an individual can be determined using a technique called inverse kinematics, by example described in the document by Ramadoss et al., entitled “Whole-Body Human Kinematics Estimation using Dynamical Inverse
  • the members are non-deformable solids, of a given length, linked together by joints. Joints support a certain maximum twist, which varies depending on direction or speed. The movements are supposed to be regular enough to appear natural. Such a technique can help produce an avatar relatively faithful to reality in the sense that the individual's body will only adopt realistic postures.
  • the 3DV video data obtained from the user's HMD1 rendering device OP1 and/or other cameras placed in the ENV environment do not necessarily provide an image of the body, in its entirety, of the user OP1 or of another user OP2-OP4 present in its field of vision.
  • the inverse kinematics technique makes it possible to extrapolate the invisible parts of the video data.
  • the relative positions of the user OP1 and the other users OP2-OP4 determined in 22 are used in 23 to determine which avatars are to be inserted in the ENH enrichment data intended for the 'user OP1.
  • the knowledge of the layout of the environment provided by the MAP mapping obtained in 20 optionally the location information and/or identification of the objects of interest OOI and/or the location information and /or the identification and/or location information of at least one part of the body of one or more other users present in the part of the environment rendered by the rendering device, obtained in 25, is used in 29 to determine the parts of the objects of interest obscured in the view rendered by the user's rendering device OP1.
  • Knowledge of this hidden part of the object of interest can then be used to generate specific enrichment data, intended to complete the rendering of this object of interest. For example, in the case of an individual for whom it has been determined that at least one of its limbs is obscured from view, the corresponding limb of the avatar generated for that individual can be selected for insertion into the data enrichment intended for the rendering device HDM1 of the user OP1. In this way, the enrichment data makes it possible to represent the obscured part of the body of the other user in the view displayed on the rendering device HMD1 of the user OP1.
  • the 3D video sequence(s) captured by the camera(s) of the rendering device HMD1 of the user OP1 are provided as input to an artificial intelligence module MIA1 implementing a data analysis model MOD1 obtained by machine learning and intended to locate and identify one or more objects of interest Ol from input video data.
  • this MIA1 module is a neural network or any other artificial intelligence module capable of performing the same functions, based for example on one of the following techniques
  • this learning or training may have been implemented during a prior step (not shown in Figure 2), which made it possible to construct the analysis model MOD1 of the MAI1 module from a set of training data.
  • the analysis model MOD1 thus constructed is used in 25 by the module MAI to identify and locate one or more objects of interest OOI present in the field of vision of the user OP1, and in particular those at least partially obscured.
  • the learning can include a learning phase, "upstream" (initial and prior to the analysis phase) to learn to analyze 3D video data captured by one or more cameras from the point of view of the rendering device and define parameters (or weights) to then allow, from any other 3D video data captured by other cameras of other rendering devices, presented as input to the MD1 module, to identify and locate the object(s) of interest present.
  • the upstream learning phase is therefore based on a set or learning base comprising a plurality of labeled video data (i.e. labeled).
  • a label may include the key point positions of the object of interest in the video data and an identifier of the object of interest.
  • the learning base may include labeled video data of each of the parts in a machine tool parts catalog, from several distinct points of view.
  • the learning phase may also include on-the-fly learning from the data collected by at least one device for rendering a view of at least part of the ENV environment, in order to refine the configuration of the artificial intelligence module MIA resulting from the upstream learning (field reality).
  • the two learnings may be carried out on the same equipment (for example by the device 100, by the server equipment ES, and/or by different equipment (for example the upstream learning and/or the on-the-fly learning may be carried out on another equipment, for example remote, dedicated to this task, I and having suitable computing and memory capacities).
  • the artificial intelligence module MIA1 receives as input in the form of an input vector V1 IN, the 3D video data transmitted by the rendering device HMD1 to the device 100.
  • a such vector V1 IN comprises a temporal sequence of these video data of given duration, for example equal to 1s.
  • the V1 IN vector may include additional information relating to a pose of the user's head for example, so as to take into account the direction of their gaze.
  • the prediction module MIA1 can be configured to produce as output a vector V1 OUT comprising location and identification information of one or more objects of interest, associated with one or more time instants.
  • a vector V1 OUT comprising location and identification information of one or more objects of interest, associated with one or more time instants.
  • no object of interest is detected, for example when the user OP1 is walking around in the environment ENV and is not working on a given machine tool.
  • the output vector V1 OUT is used at 27 to obtain description information DESC, comprising for example a model of 3D representation of the object of interest identified, for example from a local or remote memory, for example structured as a database indexed by identifiers of the objects of interest.
  • the description data obtained are then used to generate additional enrichment data of the user's view in 29, aggregate them with other enrichment data previously generated, in particular position information and transmit them in 30 to the user OP1.
  • the location and identification information of the object of interest determined by the MIA1 module are stored in memory in association with the current time instant.
  • the 3D video sequence(s) captured by the camera(s) of the rendering device HMD1 of the user OP1 as well as video sequences captured by other cameras placed in the ENV environment are provided in input to an MIA2 artificial intelligence module implementing a MOD2 data analysis model obtained by machine learning and intended to locate and identify parts of an object of interest (such as parts of the body of a or several other users).
  • an MIA2 artificial intelligence module implementing a MOD2 data analysis model obtained by machine learning and intended to locate and identify parts of an object of interest (such as parts of the body of a or several other users).
  • the learning base may comprise, in certain embodiments, a plurality of video sequences of objects of interest labeled with location information and identification of key points of these objects (for example for of individuals their head, trunk, limbs).
  • the base covers a plurality of possible postures or positions of the objects of interest and the training video sequences have been captured in the ENV environment.
  • two images 11, I2 are shown of a view of a scene captured by a camera.
  • image 11 the upper body of an individual is visible through a window F and the lower body is hidden by a wall MR.
  • image I2 it is completely hidden by the MR wall.
  • the view of the scene was enriched by embedding in images 11 and I2, in place of the parts of the body obscured by the MR wall, the corresponding parts of a virtual graphic representation or avatar of this individual.
  • the insertion of the avatar of the individual can help a user of a rendering device which would display this scene, to know at any time the position and posture of this individual and therefore help him to follow his movements and actions more easily.
  • a system S comprising a plurality of rendering devices HMD1-HMD4 carried by a plurality of users OP1-OP4 present in an ENV environment.
  • the server equipment ES of the system S is configured to enrich simultaneously and in real time the views displayed on the rendering devices HMD1 to HMD4 of each of the users OP1 to OP4.
  • it is configured to implement the method of generating enrichment data for each of the views displayed on the rendering devices HMD1 to HMD4 of the users OP1 to OP4.
  • it comprises a device 100 according to the invention.
  • it is further configured to enrich the view of the digital twin of the ENV environment displayed on the DISP rendering device intended for overall supervision of this ENV environment, for example by a supervisor responsible for the security of the environment and its users.
  • EMT RFID location and identification devices placed in the ENV environment emit several times, for example periodically, for example once per second, a “ping” type request signal, to which electronic tags of TAG type placed on the rendering devices HMD1 to HMD4 of the users OP1 to OP4 and present in the field of action of the EMT devices respond by transmitting the identification information they contain.
  • the EMT devices determine a location of each of the TAG labels by triangulation and transmit it to the device 100.
  • Such EMT location devices can emit signals intended for electronic labels of the TAG type (for example labels that one wishes to locate in environment ENV) and/or receive signals from such electronic tags.
  • the electronic labels can be passive (with reference to their use), for example in the case of RFID type labels.
  • said EMT location device can be configured to transmit, to the TAG electronic labels placed on the rendering devices HMD1 to HMD4, a request signal, receive a signal comprising identification information coming from said electronic labels, determining the locations of said electronic labels, based on the identification information received, and transmitting said locations to said enrichment data generation device.
  • the electronic labels can be active (with reference to their use), for example in the case of RFID type labels.
  • the electronic TAG labels placed on the rendering devices HMD1 to HMD4 can emit (for example regularly) their respective identification data. This broadcast can be made on their initiative (and not in response to a request).
  • the EMT location device can determine the locations of the labels without performing a prior step of transmitting the request signal.
  • the device 100 can in turn determine in 22 position information of at least some (for example of each) of the devices HMD1 to HMD4 in a reference frame Ref of the environment, depending on the locations transmitted by said EMT locating device . It can also obtain MES measurement data collected by at least one sensor.
  • MES measurement data collected by at least one sensor can be of various types and include for example one or more video cameras placed for example at different points in the ENV environment, one or more temperature sensors, one or more smoke detectors, one or more several motion detectors, for example laser-based, one or more LIDAR-type volumetric sensors to measure a distance, etc.
  • the device 100 is also configured to collect data transmitted by programmable logic controllers PLC (English: Programmable Logic Controller) which are components programmed and used for the control or regulation of machines or equipment. 'facilities. Such controls can be implemented in very different sectors, for example to control production installations, injection presses. Such data can help the device 100 to know the status of machines and more generally of equipment present in the environment. It can also, in certain embodiments, control them remotely.
  • PLC Programmable Logic Controller
  • the device 100 receives data at 24 from the sensor(s), such as sensors SNS_HMD1 to SNS_HMD4 embedded on the rendering devices HMD1 to HMD4, comprising for example inertial data (acceleration, speed, and/or orientation ) and/or captured 3D video data captured by at least one camera placed in the upper and front part of the corresponding rendering device and configured to film the part of the environment located in the field of vision of the user OP1 to OP4.
  • the sensor(s) such as sensors SNS_HMD1 to SNS_HMD4 embedded on the rendering devices HMD1 to HMD4, comprising for example inertial data (acceleration, speed, and/or orientation ) and/or captured 3D video data captured by at least one camera placed in the upper and front part of the corresponding rendering device and configured to film the part of the environment located in the field of vision of the user OP1 to OP4.
  • the device 100 has previously obtained, for example from a memory M, a MAP map of the environment ENV, which includes position and identification information for physical elements or objects arranged in the environment ENV (partitions , machines, mobilize, doors, windows, aisles, etc.).
  • This mapping can make it possible, in certain embodiments, to determine using the position of another user present in the user's field of vision, whether he is actually visible or whether he is is obscured by an environmental design element (such as a partition for example).
  • This MAP mapping can also, in certain embodiments, be used to create a virtual 3D representation of the ENV environment, called a JUM digital twin.
  • This digital twin can in some embodiments be rendered (e.g. displayed) on the rendering device AND placed or not in the ENV environment.
  • a user of this ET device for example an SV operator responsible for the supervision and security of the ENV environment, can navigate in this digital twin, as during a virtual tour. It can also display specific information about certain machines, such as their status.
  • the device 100 may be configured to predict a trajectory of at least one object of interest that is moving in the environment. This prediction can for example take into account sensor data, such as for example speed and acceleration data, relating to this or these object(s) of interest. For example, from the position information obtained for each of the rendering devices HMD1 to HMD4, other sensor data, such as for example the speed and acceleration data of at least some (for example each) of the rendering devices HMD1 to HMD4, the device 100 can be configured to predict a trajectory of an object of interest. According to another example, it is configured to take into account previous movements of this object of interest, its current trajectory and the view of the part of the environment to predict where it will go. Next.
  • the data collected by all the sensors for all the moving objects of interest are used to predict the trajectories of each of these objects of interest and avoid collisions, by generating alert signals and enriching the views of the different users with these signals.
  • the device 100 can thus help prevent possible collisions, the device 100 can be configured to transmit, in the event of an established risk of collision, an alert message to at least one of the users concerned.
  • this message is a voice message sent to their mobile devices. It may also be a visual alert indicator or transmitted as data enriching the view displayed on the screens of their respective rendering devices.
  • the device 100 may be configured to locate and/or identify objects of interest viewed by at least some of the users OP1 to OP4 of the rendering devices HMD1 to HMD4.
  • This location/identification can take into account, for example, video data received from the cameras of the rendering devices HMD1 to HMD4 of these users for a given time period (between two successive temporal instants of obtaining location information, for example duration of the of the order of a few seconds (for example 1 second, 2 seconds, 5 seconds, etc.)
  • it can use (in addition to video data for example) orientation data obtained from inertial sensors (gyroscope).
  • the device 100 can call upon the artificial intelligence module MIA1 integrated for example into the server equipment ES which implements a previously learned MOD1 model to carry out these identification and location operations from the video data captured, as previously described in relation to Figure 4A.
  • the identification information of the objects of interest detected for at least one user is associated with position information of these objects of interest in the Ref repository of the environment and stored in memory. In some embodiments, this information is associated with a manipulative virtual 3D graphic representation of the corresponding object of interest available in memory, for example in the catalog.
  • the video data received from the cameras of the rendering devices HMD1 to HMD4, and in certain embodiments the video data of other cameras (SNS_ENV1 to SNS_ENV4) placed in the environment can also be used to locate and identify in 24 at least certain body parts of the user of the rendering device and/or other individuals visible in the video.
  • the device 100 can call on the artificial intelligence module MIA2 (of the ES server equipment for example), configured to recognize parts of the body of an individual which appear in one or more video sequences which are provided as input, as described in relation to Figure 4B.
  • the identified and located body parts can in certain embodiments be associated with a user by exploiting the position information previously obtained in 21 (in particular the TAG label received from the position sensor of its rendering device) and stored in memory M.
  • a virtual graphic representation or avatar of at least one object of interest can be generated from identification information and positions of the parts of the object of interest. interest detected (therefore visible) on the video data.
  • This virtual graphic representation can for example, in certain embodiments, be based at least partially on an anatomical model independently defining each part of the object of interest as a solid, for example according to an inverse kinematics technique, as previously described. in relation to Figure 3. We understand that this technique can help extrapolate the positions of parts (such as limbs of a user) not visible on the video sequences.
  • At least one user OP1 to OP4 their position information and that of at least one object of interest (such as one of the other rendering device users), MAP mapping information, and identification and location information parts of the user's own body and/or parts of other objects of interest (such as individuals visible in the view displayed on the screen of their rendering device HMD1 to HMD4) and other video collected in the environment, can be aggregated, in some embodiments, to determine (e.g. using depth information) whether other parts of the user's own body or parts of at least one object of interest (such as one or more other individuals) are obscured. If necessary, corresponding parts of their avatars can be obtained (e.g. from M memory) and inserted as ENH enrichment data of the view displayed on the user's rendering device.
  • the enrichment data thus generated for a user of a rendering device can be aggregated then transmitted to the rendering device, when the device 100 is not integrated into the rendering device.
  • specific enrichment data may be generated for the JUM digital twin view of the ENV environment displayed on the DISP supervisory device.
  • a device 100 for generating data for enrichment of at least one view of at least one part of an environment (ENV) from at least a first point of view Said view is intended to be rendered at least partially by at least one rendering device.
  • Said device comprises at least one module for obtaining location information about at least one object of interest in said environment and a module for generating data for enriching said view, at least from the location information obtained.
  • Said enrichment data comprises at least data representative of a position of said object of interest with respect to said first point of view and data representative of an obscured part of said object of interest.
  • the device 100 may comprise a module for detecting said at least one object of interest at least in said view, a module for obtaining description information for said at least one detected object of interest, and the module for generating the enrichment data is configured to use description information to generate at least some of the view's enrichment data.
  • the device may comprise a module for obtaining a graphic representation of the obscured part of the object of interest in the view of the part of the environment rendered by the rendering device at least in function of the position of the object of interest relative to the point of view and description information and the generation module is configured to generate enrichment data for the obscured part including the graphic representation obtained.
  • the device 100 may comprise a module for obtaining a virtual graphic representation of the identified object of interest, the enrichment data generation module being configured to insert said virtual graphic representation of the 'object of interest identified in the view of the environment displayed by the user.
  • the detection module of said at least one object of interest is configured to implement an artificial intelligence module configured to use at least one previously learned model and associating said 3D video data with at least one piece of information. position and optionally classification and/or identification of said object of interest.
  • module can correspond as well to a software component as to a hardware component or a set of hardware and software components, a software component itself corresponding to one or more computer programs or subprograms or in a manner more general to any element of a program capable of implementing a function or a set of functions.
  • the device 100 may comprise a random access memory 103 (for example a RAM memory), a processing unit 102 equipped for example with a processor, and controlled by a computer program Pg1, representative of the previously mentioned modules, stored in a read only memory 101 (for example a ROM memory or a hard disk).
  • a computer program Pg1 representative of the previously mentioned modules, stored in a read only memory 101 (for example a ROM memory or a hard disk).
  • the code instructions of the computer program are for example loaded into the RAM 103 before being executed by the processor of the processing unit 102.
  • the RAM 103 can also contain, for example, the information determined position, location and identification information of objects of interest, location and identification information of parts of the body of the user of the device and/or parts of objects of interest (such as those of individuals, for example other users), virtual graphical representations of objects of interest, virtual graphical representations of users' body parts, mapping of the environment, etc.
  • Figure 7 illustrates only one particular way, among several possible, of producing the device 100 so that it carries out the steps of the method of generating data for enriching a view of an environment of at least one user of a rendering device as detailed above, in relation to Figure 2, in its different embodiments. Indeed, these steps can be carried out indifferently on a reprogrammable calculation machine (a PC computer, a DSP processor or a microcontroller) executing a program comprising a sequence of instructions, or on a dedicated calculation machine (for example a set of logic gates such as an FPGA or an ASIC, or any other hardware module) included in the device 100.
  • a reprogrammable calculation machine a PC computer, a DSP processor or a microcontroller
  • a dedicated calculation machine for example a set of logic gates such as an FPGA or an ASIC, or any other hardware module
  • the corresponding program (that is to say the sequence of instructions) can be stored in a removable storage medium (such as for example an SD card , a USB key, a CD-ROM or a DVD-ROM) or not, this storage medium being partially or totally readable by a computer or a processor.
  • a removable storage medium such as for example an SD card , a USB key, a CD-ROM or a DVD-ROM
  • the server equipment can be remote, for example in a cloud network (from English, “Cloud Computing”), provided that reduced latency conditions are guaranteed.
  • the invention that has just been presented provides certain advantages in at least some embodiments. It can help to enrich the view of an environment displayed to a user of a rendering device. According to at least one embodiment, it can provide the user with a view of the part of the environment rendered through obstacles, which can help to better understand the environment by the user and can help to limit the risks of collision and more generally of accident.

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Theoretical Computer Science (AREA)
  • Computer Graphics (AREA)
  • Computer Hardware Design (AREA)
  • General Engineering & Computer Science (AREA)
  • Software Systems (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Processing Or Creating Images (AREA)
  • Image Generation (AREA)

Abstract

L'invention concerne un procédé de génération de données d'enrichissement d'au moins une vue d'au moins une partie d'un environnement depuis au moins un premier point de vue, ladite vue étant destinée à être rendue au moins partiellement par au moins un dispositif de rendu, ledit procédé comprenant : - l'obtention (22) d'informations de localisation d'au moins un objet d'intérêt (OI) dans ledit environnement, - la génération (29) de données d'enrichissement (ENH) de ladite vue, au moins à partir des informations de localisation obtenues, lesdites données d'enrichissement comprenant au moins des données représentatives d'une position dudit objet d'intérêt par rapport audit premier point de vue et des données représentatives d'une partie occultée dudit objet d'intérêt.

Description

Description
Titre de l’invention : Procédé de génération de données d’enrichissement d’une vue d’un environnement, dispositif de rendu, équipement serveur, système et programme d’ordinateur correspondants
Domaine technique de l’invention
La présente demande concerne le domaine de la réalité virtuelle et/ou augmentée.
Elle concerne en particulier la génération de données d’enrichissement d’un rendu d’un environnement réel dans lequel se trouve au moins un utilisateur équipé d’un dispositif de rendu monté sur sa tête, de type lunettes ou casque de réalité virtuelle et/ou augmentée.
Elle s’applique notamment, mais non exclusivement, à un environnement de travail d’un opérateur encombré par la présence d’objets et dans lequel la visibilité d’autres opérateurs est réduite.
Art antérieur
Dans un environnement encombré et/ou offrant une visibilité réduite, il est difficile pour un individu de distinguer la présence de certains objets ou d’autres individus. En milieu industriel, ce manque de visibilité sur des machines-outils potentiellement dangereuses ou encore d’autres intervenants présents dans un bâtiment, entraîne pour un opérateur un risque accru d’accident. Par exemple, lorsque deux opérateurs sont amenés à travailler à plusieurs sur la maintenance d’une même machine-outil, ils ont besoin de savoir ce que l’autre est en train de faire et où il se trouve à tout moment.
On connaît aujourd’hui des solutions de communication qui permettent à des techniciens équipés de terminaux mobiles, du type téléphone cellulaire ou talkie-walkie, de se parler pour se tenir informés des agissements des uns et des autres. Ces solutions se révèlent cependant insuffisantes pour prévenir certains accidents.
La présente demande vient améliorer la situation.
Exposé de l’invention
A cette fin, la présente demande propose un procédé de génération de données d’enrichissement d’au moins une vue d’au moins une partie d’un environnement depuis au moins un premier point de vue, ladite vue étant destinée à être rendue au moins partiellement par au moins un dispositif de rendu, ledit procédé comprenant :
- une obtention d’informations de localisation d’au moins un objet d’intérêt (dans ledit environnement,
- une génération de données d’enrichissement (de ladite vue, au moins à partir des informations de localisation obtenues, lesdites données d’enrichissement comprenant au moins des données représentatives d’une position dudit objet d’intérêt par rapport audit premier point de vue et des données représentatives d’une partie occultée dudit objet d’intérêt.
La présente demande propose ainsi une approche tout-à-fait nouvelle et inventive permettant une visualisation enrichie d’une partie d’un environnement réel dans lequel se trouve au moins un objet d’intérêt. Cette approche enrichit la vue de la partie de l’environnement en lui ajoutant notamment des informations de position de l’objet d’intérêt et des informations sur la partie occultée de cet objet. En particulier, la présente demande propose d’améliorer la visibilité d’un environnement réel pour un utilisateur équipé d’un dispositif de rendu monté sur sa tête et au travers duquel il visualise cet environnement., ce que ne permettent pas par exemple des solutions basées uniquement sur la voix.
Il s’agit par exemple d’indications visuelles, sonores ou encore haptiques qui viennent compléter le rendu de la vue quand celle-ci est affichée sur le dispositif de rendu. La vue ainsi enrichie peut par exemple aider un utilisateur du dispositif de rendu à surveiller le déplacement d’un ou plusieurs objets d’intérêt dans l’environnement et à prévenir des situations à risques en termes d’accident.
De la sorte, la présente demande peut contribuer à aider un utilisateur d’un dispositif de rendu à prendre connaissance, sur la partie de l’environnement enrichie restituée par le dispositif de rendu, de la présence et de la position d’objets d’intérêt présents dans l’environnement réel, même s’ils ne sont pas visibles, ou partiellement, en réalité depuis son propre point de vue (ils peuvent être cachés par un objet physique tel qu’une cloison, du mobilier, une machine, une palette de cartons empilés, etc).
On comprend qu’on désigne ici par environnement un lieu réel, fermé ou ouvert, par exemple une usine, un entrepôt, un bâtiment d’habitation, un centre commercial etc, dans lequel peuvent se trouver tous types d’objets d’intérêts au sens large. On utilise le terme de vue de l’environnement rendu par le dispositif de rendu, pour toute représentation de cet environnement réel affichée sur l’écran du dispositif de rendu de l’utilisateur, qu’elle soit virtuelle, mixte ou augmentée. On désigne ici par objet d’intérêt tout type objet susceptible de présenter un intérêt pour un utilisateur du dispositif de rendu, c’est-à-dire aussi bien un engin de chantier, un robot, un animal qu’un individu. Dans ce contexte, un être humain ou un animal est considéré comme « objet » d’une détection ou de localisation par une technique adaptée mettant en œuvre des capteurs. Dans au moins certains modes de réalisation, l’objet d’intérêt est susceptible de bouger, par exemple de se déplacer dans l’environnement et/ou d’effectuer des mouvements, par exemple de rotation et/ou de torsion sur lui-même, c’est-à-dire sans changer nécessairement de position. Il peut être au moins partiellement visible depuis le premier point de vue, voire totalement occulté par des obstacles physiques (mobilier, machines, cloisons etc) et/ou par manque de luminosité.
Dans au moins certains modes de réalisation, les informations de localisation sont obtenues plusieurs fois, par exemple périodiquement, par exemple une fois par seconde, et la partie de l’environnement rendue par le dispositif de rendu est mise à jour quand de nouvelles informations de localisation sont disponibles, de façon à présenter à un instant à un utilisateur du dispositif de rendu une vue enrichie en cohérence avec la réalité du terrain.
Selon la présente demande, le dispositif de rendu peut correspondre à tout type de terminal utilisateur équipé de moyens de communication et de rendu adaptés.
Par exemple, dans au moins certains modes de réalisation, une vue virtuelle de l’environnement comprenant des données d’enrichissement générées par l’invention vient se superposer comme une couche supplémentaire à celle de la vue de la partie de l’environnement réel affichée par le dispositif de rendu, qui peut être elle-même réelle, virtuelle ou mixte. Selon un premier exemple, le dispositif de rendu est un terminal fixe, de type poste de travail ou de surveillance depuis lequel un utilisateur, ou superviseur, peut surveiller au moins une partie de l’environnement réel et/ou l’activité qui s’y déroule. Il peut être compris dans l’environnement ou distant. Dans ce cas, la vue de la partie de l’environnement réel rendue par le dispositif est obtenue à partir d’images capturées par une ou plusieurs caméras disposées en différentes positions de l’environnement réel. Le point de vue est par exemple celui d’une des caméras en question.
Selon au moins un mode de réalisation, l’au moins un dispositif de rendu est un dispositif de supervision dudit environnement, et/ou une pluralité de dispositifs de rendu mobiles. Le dispositif de rendu peut être par exemple un dispositif de supervision globale dudit environnement, par exemple un équipement terminal tel qu’un ordinateur fixe ou mobile, qui n’est pas nécessairement situé dans l’environnement et peut être distant. L’utilisateur est par exemple un superviseur en charge de surveiller l’activité à l’intérieur de l’environnement et notamment de s’assurer de la sécurité des individus qui s’y trouvent. Dans ce cas, le point de vue peut être le point de vue d’une caméra dont les données vidéo ont servi à produire la vue produite par le dispositif de rendu ou plus généralement l’origine d’un référentiel de l’environnement. Complémentairement ou alternativement, la ou les vues enrichies peuvent être rendues par une pluralité de dispositifs de rendu mobiles.
Selon au moins un mode de réalisation, au moins un dispositif de rendu parmi la pluralité de dispositifs de rendu mobiles est un équipement terminal mobile dudit environnement et comprend au moins une caméra configurée pour capturer des données vidéo depuis le premier point de vue, la vue rendue étant générée au moins partiellement à partir de données vidéo de ladite caméra.
Selon au moins un mode de réalisation, le dispositif de rendu est un équipement mobile tel qu’un dispositif de rendu porté sur la tête ou HMD (de l’anglais, « Head Mounted Device »), de type lunettes ou casque de réalité virtuelle et/ou augmentée). Dans ce cas l’utilisateur de ce dispositif se trouve à l’intérieur de l’environnement réel et peut s’y déplacer. Par exemple, il s’agit d’un opérateur de maintenance chargé d’intervenir sur des machines-outils présentes dans l’environnement. Dans ce cas, le dispositif de rendu est présent dans l’environnement et le point de vue est celui du dispositif de rendu de l’utilisateur.
Dans au moins un mode de réalisation, le procédé de génération de données d’enrichissement comprend en outre une génération des données d’enrichissement d’une représentation graphique virtuelle dudit environnement, destinée à être rendue par ledit dispositif de supervision dudit environnement, permettant ainsi par exemple à un utilisateur, par exemple un superviseur, de réaliser une supervision globale dudit environnement.
Selon au moins un mode de réalisation, le procédé comprend :
- une détection dudit au moins un objet d’intérêt au moins dans ladite vue,
- une obtention d’information de description dudit au moins un objet d’intérêt détecté, et
- une utilisation des informations de description pour générer au moins certaines des données d’enrichissement de la vue.
Selon un exemple, l’objet d’intérêt est un objet physique au moins partiellement visible sur la vue. Il s’agit par exemple d’une pièce d’une machine-outil, dont certaines faces ne sont pas visibles parce que masquées par d’autres pièces constitutives de la machine-outil. Une fois l’objet détecté et reconnu, des informations de description, telles que des informations de forme, dimension, structure, matière etc sont par exemple obtenues et exploitées pour enrichir la vue. Les données d’enrichissement peuvent contribuer, dans au moins certains modes de réalisation, à rehausser l’objet physique dans la vue affichée à l’utilisateur. Par exemple, ses contours apparaissent en surbrillance, un bruit produit par l’objet d’intérêt est amplifié, des informations de description textuelles (nom, référence, etc) ou graphiques sont incrustées en superposition de la vue réelle, indiquant où se trouve précisément la pièce qu’il a devant lui et de quelle pièce il s’agit.
Ces informations de description sont par exemple stockées dans une mémoire.
Dans au moins certains modes de réalisation, des données vidéo de la partie de l’environnement capturées par des caméras de l’environnement depuis des points de vue distincts peuvent être utilisées pour détecter et reconnaître l’objet d’intérêt.
Selon un autre exemple, l’objet d’intérêt est un individu présent dans l’environnement. On suppose qu’au moins une partie de son corps est détectable sur la vue ou sur d’autres séquences vidéo capturées par d’autres caméras. Lorsque cette partie de corps a été détectée et reconnue en tant que telle, des informations de description du corps humain (données d’anatomie, positions de points clés tels que genoux, chevilles, tête, mains etc) peuvent être exploitées pour enrichir la vue affichée par le dispositif de rendu au niveau de la position de l’individu.
Selon encore un autre exemple, l’objet d’intérêt est une partie du corps de l’utilisateur du dispositif de rendu, par exemple ses bras.
Selon encore un autre exemple, l’objet d’intérêt est un dispositif électromécanique, ou une partie de ce dispositif, par exemple un bras de manutention articulé.
Selon encore un autre aspect de l’invention, le procédé comprend : une obtention d’une représentation graphique de la partie occultée de l’objet d’intérêt dans la vue de la partie de l’environnement rendue par le dispositif de rendu au moins en fonction de la position de l’objet d’intérêt par rapport au point de vue et des informations de description les données d’enrichissement de la partie occultée comprennent la représentation graphique obtenue.
Par exemple, les informations de description comprennent un modèle de représentation graphique 3D manipulable de l’objet d’intérêt, qui pourra être affiché avec la vue (comme en marge de la vue).
Par exemple, la représentation graphique 3D de l’objet d’intérêt a été construite au préalable et stockée en mémoire. L’utilisateur peut la visualiser sous différents angles voire obtenir des informations supplémentaires sur cet objet et par exemple visualiser des parties cachées de cette pièce. S’il s’agit d’une pièce d’une machine, il pourrait aussi accéder à des informations relatives à des interactions de cette pièce avec d’autres pièces de la machine, par exemple incluses dans un manuel de description accessible via son dispositif de rendu.
Un avantage, dans au moins certains modes de réalisation, est que le rendu de cette représentation graphique peut aider à l’utilisateur du dispositif de rendu à visualiser la partie occultée de l’objet d’intérêt et donc d’avoir une perception plus complète de cet objet d’intérêt.
Lorsque l’objet d’intérêt est un objet physique, l’enrichissement de la vue peut par exemple aider un opérateur de maintenance à comprendre comment une pièce est agencée avec une ou plusieurs autres pièces d’une machine-outil.
Dans le cas où l’objet d’intérêt est un individu par exemple, la partir occultée déterminée comprend une partie du corps de l’individu et la représentation graphique de cette partie occultée peut comprendre, au moins dans certains modes de réalisation, un avatar de la partie du corps de cet individu. Un avantage, au moins dans certains modes de réalisation, peut-être d’aider ’utilisateur du dispositif de rendu à se rendre compte de la posture et/ou d’un mouvement de cet individu et donc à percevoir d’éventuels risques de collision voire d’accident. Par exemple cet avatar est obtenu à partir de positions de la partie occultée et d’une technique de cinématique inverse qui définit les membres comme des solides indéformables de longueur donnée reliés entre eux par des articulations et soumis à des contraintes maximales données. Un avantage, au moins dans certains modes de réalisation, peut-être d’aider à produire un avatar relativement fidèle à la réalité au sens où le corps de l’individu adoptera des postures réalistes.
Lorsque l’objet d’intérêt est une partie du corps de l’utilisateur du dispositif de rendu HMD, par exemple ses bras, la vue peut être enrichie, au moins dans certains modes de réalisation, des bras d’un avatar aux positions des bras dans la vue. De la sorte, l’utilisateur peut voir par exemple où se trouvent ses bras même s’ils sont en partie occultés par des pièces de la machine-outil qu’il est en train de réparer.
Bien sûr, l’objet d’intérêt peut aussi être un robot ou un bras de manutention articulé, dont une partie est occultée. Une représentation graphique de la partie occultée de ce robot peut être de même que décrit précédemment insérée dans les données d’enrichissement générées pour augmenter la perception de la partie de l’environnement vue par l’utilisateur.
Selon au moins un mode de réalisation, les informations de localisation dudit au moins un objet d’intérêt sont obtenues d'au moins un capteur de position placé à proximité et/ou sur ledit au moins un objet.
Un tel mode de réalisation peut aider à localiser l’objet d’intérêt, qu’il soit visible ou non sur la vue, par exemple lorsqu’il est en dehors du champ de vision de la ou des caméras qui ont capturé les données vidéos à partir desquelles la vue a été générée.
Dans au moins certains modes de réalisation, un tel capteur de position peut aussi aider à identifier l’objet d’intérêt. Par exemple, il s’agit d’un dispositif d’identification radiofréquence ou RFID (de l’anglais, « Radio-frequency Identification ») configuré pour émettre un signal radio de réponse à un signal radio reçu d’au moins un dispositif de lecture de tags placé dans l’environnement, ce dernier étant configuré pour lire au moins une information d’identification contenue dans le tag et déterminer une position relative de l’objet d’intérêt par rapport au dispositif de lecture placé dans l’environnement.
Par exemple, lorsque l’objet d’intérêt est un objet physique, typiquement une pièce d’une machine-outil, un robot, un chariot, un élément de mobilier, etc, il peut généralement être équipé de moyens d’identification, notamment à des fins d’inventaire. Lorsque l’objet d’intérêt est un autre dispositif de rendu, par exemple le dispositif HMD d’un utilisateur qui se trouve dans l’environnement, il peut être lui aussi équipé d’au moins un capteur de position, ainsi que d’autres de capteurs, par exemple de caméras, d’un système inertiel etc.
La localisation d’un objet d’intérêt peut aussi être obtenue par d’autres moyens (notamment dans le cas où l’objet d’intérêt n’est pas équipé d’un capteur de position), par exemple par traitement d’images à partir de séquences vidéo capturées par des caméras placées dans l’environnement et/ou portées par le dispositif de rendu. C’est le cas par exemple d’un individu qui ne porte pas de dispositif de rendu HMD ou d’objets physiques qui ne font pas partie de l’inventaire (à l’inverse de ceux listés ci-avant) mais qui pourraient constituer des obstacles dangereux. Selon au moins un mode de réalisation, le procédé comprend en outre :
- l’obtention d’une cartographie d’au moins une partie de l’environnement, comprenant au moins des informations de localisation d’une pluralité d’objets physiques présents dans l’environnement ; et en ce que la génération des données d’enrichissement comprend au moins l’insertion de données représentatives de positions desdits objets physiques par rapport au premier point de vue. Ainsi, dans au moins certains modes de réalisation, cette cartographie de l’environnement donne à connaître les positions d’objets physiques, par exemple immobiles, présents dans l’environnement qui peuvent constituer des obstacles potentiels à la visibilité des autres utilisateurs. Ils correspondent par exemple à des cloisons, portes, mobiliers, machines, outils, cartons, chariots, et plus généralement tout type d’objet physique. Ils ne correspondent pas forcément un point d’intérêt pour un utilisateur. Dans au moins certains modes de réalisation, cette cartographie peut aussi indiquer au moins une zone de danger.
En alternative, d’autres solutions de géolocalisation sont possibles pour localiser (par exemple de façon précise) les objets d’intérêts et les personnes qui peuvent être équipés de dispositifs de localisation, basés sur une solution de positionnement par satellite par exemple de type GPS (de l’anglais « Global Positioning System ») ou Glonass (de l’anglais, « Global Navigation Satellite System ») en extérieur, ou une solution de géolocalisation par une technologie radio de bande ultra large ou UWB ( de l’anglais, « Ultra Wide Band ») ou encore une technique de détection de direction comme BDF (de l’anglais, « Bluetooth Direction Finding «pour l’intérieur, ou ne pas être équipés de tels dispositifs. Dans ce cas, la géolocalisation est mise en œuvre à l’aide de capteurs présents dans l’environnement comme des caméras RGB-D par exemple, et dont la position est connue dans un référentiel de l’environnement.
En ce qui concerne l’agencement de l’environnement, en termes de cloisons, portes, allées, une cartographie peut être construite à partir notamment des données vidéo 3D capturées par un ou plusieurs utilisateurs lorsqu’ils arpentent les lieux, de façon systématique et exhaustive (construction initiale) ou au gré de leurs interventions (construction au fil de l’eau). Une mise en correspondance d’images de vidéos acquises par différents utilisateurs à différents instants peut aider à détecter les zones qui se retrouvent dans les différentes images puis à les étiqueter à l’aide d’un ensemble d’étiquettes dépendant du type d’environnement considéré (par exemple l’ensemble d’étiquettes peut être adapté à un site et être différent pour un site de maintenance de machines, pour une chaîne de production, pour un entrepôt de stockage de marchandises, etc).
Selon au moins un exemple, les données d’enrichissement comprennent, en plus des positions des objets physiques, des informations d’identification de ce objets physiques obtenus de la cartographie ou de la mise en correspondance d’images précédemment évoquée.
La connaissance de cette cartographie peut par exemple être mise à profit pour aider à obtenir (par exemple déterminer) la partie occultée d’un objet d’intérêt dans la vue affichée par le dispositif de rendu.
Selon encore au moins un mode de réalisation, la détection dudit au moins un objet d’intérêt met en œuvre un module d’intelligence artificielle configuré pour utiliser au moins un modèle préalablement appris et associant lesdites données vidéo 3D à une information de position et de classification dudit objet d’intérêt.
Un avantage de recourir à un module d’intelligence artificielle peut être, au moins dans certains modes de réalisation de profiter de sa puissance de traitement et d’intégration d’une quantité de données qui peut être très importante et de sa capacité, une fois entraîné, à aider à produire des résultats fiables, précis et reproductibles.
Dans certains modes de réalisation, un tel module d’intelligence artificielle peut permettre d’obtenir des informations de position d’un ou plusieurs points clés de l’objet dans la vue et au moins une classe ou type de l’objet. Ceci peut être particulièrement intéressant, au moins dans certains modes de réalisation, notamment pour des objets d’intérêt qui ne sont pas dotés de capteurs de position (comme des capteurs RFID). Par exemple, lorsque l’objet d’intérêt est un objet physique, le module d’intelligence artificielle peut produire en sortie la classe de la pièce et sa position dans l’environnement. A partir de la classe obtenue, il est possible par exemple d’aller chercher en mémoire les informations de description correspondantes.
Lorsque l’objet d’intérêt est un individu, le module d’intelligence artificielle peut produire, au moins dans certains modes de réalisation, la position de points anatomiques clés et reconnaitre qu’il s’agit d’un être humain.
Selon au moins un mode de réalisation, le procédé comprend un apprentissage (par exemple préalable) dudit modèle à partir d’une base de données d’apprentissage comprenant une pluralité de couples de données, un dit couple associant des données vidéo 3D à au moins une information de position d’un objet d’intérêt et une information de classe d’objet.
Pour des objets physiques, une base d’apprentissage peut être constituée en étiquetant manuellement des séquences vidéo d’éléments d’une liste d’objets d’intérêts que l’utilisateur est susceptible de rencontrer lorsqu’il est présent dans l’environnement. Par exemple, il s’agit d’un catalogue de pièces d’une machine industrielle.
Pour des êtres humains, la base d’apprentissage peut être une base de données, par exemple de données publiques, présentant des images étiquetées ou vidéo d’individus dans différentes positions. Les étiquettes indiquent par exemple les différentes parties du corps (membres, tête, tronc).
Dans certains modes de réalisation, l’apprentissage est mis à jour « en continu » à l’aide des données collectées au fil de l’eau et d’évaluations des utilisateurs sur une qualité et précision des données d’enrichissement générées (et en particulier des informations de localisation et d’identification des objets/utilisateurs/individus).
La présente demande concerne aussi un dispositif de données d’enrichissement d’au moins une vue d’au moins une partie d’un environnement depuis au moins un premier point de vue, ladite vue étant destinée à être rendue au moins partiellement par au moins un dispositif de rendu, ledit dispositif étant configuré pour mettre en oeuvre :
- une obtention d’informations de localisation d’au moins un objet d’intérêt dans ledit environnement,
- une génération de données d’enrichissement de ladite vue, au moins à partir des informations de localisation obtenues, lesdites données d’enrichissement comprenant au moins des données représentatives d’une position dudit objet d’intérêt par rapport audit premier point de vue et des données représentatives d’une partie occultée dudit objet d’intérêt.
Dans certains modes de réalisation, le dispositif selon la présente demande peut générer des données d’enrichissement pour plusieurs dispositifs de rendus, comprenant les dispositifs de rendu (par exemple de type HMD) de plusieurs utilisateurs présents dans l’environnement et/ou pour un dispositif de rendu d’un utilisateur superviseur, dit dispositif de supervision, qui n’est pas nécessairement présent dans l’environnement.
Ainsi, un superviseur peut par exemple visualiser une vue globale enrichie de l’environnement sur laquelle les positions des utilisateurs présents sont indiquées. De la sorte, le superviseur peut par exemple les repérer facilement (par exemple les repérer tous en un coup d’œil). En cas d’accident, de tels modes de réalisation peuvent aider le superviseur à appréhender plus rapidement la situation et donc à gérer l’urgence. La position d’un utilisateur accidenté peut par exemple être signalée très rapidement (voire même immédiatement) à d’autres utilisateurs situés à proximité. Connaissant et visualisant sa position, ils peuvent par exemple intervenir sans délai. Les dispositifs de rendu peuvent dans certains modes de réalisation être équipés d’au moins un capteur de signes vitaux (cardiaque, chute, etc.) pour automatiser la détection d’accidents.
Dans certains modes de réalisation de l’invention, le dispositif de génération de données d’enrichissement est configuré pour générer des données enrichissement d’une représentation graphique virtuelle dudit environnement, destinée à être rendue par ledit dispositif de supervision (ET, DISP) dudit environnement.
Selon au moins un mode de réalisation de l’invention, ledit dispositif est configuré pour mettre en œuvre les étapes du procédé de génération de données d’enrichissement d’au moins une vue d’au moins une partie d’un environnement tel que décrit précédemment.
Selon au moins un mode de réalisation de l’invention, ledit dispositif est intégré dans un équipement serveur connecté par l’intermédiaire d’un réseau de communication à au moins un dispositif de rendu adapté à produire un rendu au moins partiel d’une vue d’au moins un environnement depuis au moins un premier point de vue.
Dans certains modes de réalisation de l’invention, ledit équipement serveur comprend un module configuré pour générer une représentation graphique virtuelle de l’environnement destinée à être rendue par ledit dispositif de supervision dudit environnement. Par exemple, cette représentation graphique virtuelle peut être enrichie avec des données d’enrichissement générées par ledit dispositif de génération de données d’enrichissement.
L’équipement serveur et le dispositif présentent au moins les mêmes avantages que ceux conférés par le procédé de génération précité.
Il peut être placé dans l’environnement ou à l’extérieur de cet environnement, par exemple dans un réseau de communication distant par exemple organisé selon une architecture en nuage (de l’anglais, « Cloud Computing »). En particulier, le réseau de communication peut être adapté à permettre des communications entre l’équipement serveur et le ou les dispositifs de rendu ayant une latence raisonnable (par exemple sans latence), c’est-à-dire en quasi temps réel. Dans certains modes de réalisation, l’invention permet de générer des données d’enrichissement de plusieurs rendus de l’environnement réel, par exemple ceux des utilisateurs de dispositifs HMD qui évoluent (se déplacent, travaillent, etc) dans l’environnement réel et celui du superviseur.
Selon au moins un mode de réalisation de la présente demande, l’équipement serveur précité peut lui-même être intégré dans un système de supervision d’un environnement comprenant au moins un dispositif de rendu adapté à produire un rendu au moins partiel d’une vue de l’environnement depuis au moins un premier point de vue et au moins un capteur configuré pour collecter au moins une information de localisation d’au moins un objet d’intérêt présent dans l’environnement.
Dans certains modes de réalisation, ledit système peut comprendre plusieurs dispositifs de rendu :
- un dispositif de rendu fixe destiné à être utilisé par un superviseur en charge de l’activité et de la sécurité de l’environnement, pour visualiser une ou plusieurs vues de parties de l’environnement selon un ou plusieurs points de vue correspondant à des caméras vidéo placées dans l’environnement;
- un ou plusieurs dispositifs de rendu mobiles d’utilisateur(s) présentOs dans l’environnement par l’intermédiaire desquels chacun peut par exemple visualiser la partie de l’environnement visible depuis son propre point de vue.
Selon au moins un mode de réalisation de la présente demande, ledit système de supervision comprend au moins un dispositif de rendu mobile muni d’une étiquette électronique et au moins un dispositif de localisation configuré pour mettre en œuvre la réception d’un signal comprenant des informations d’identification en provenance de ladite étiquette électronique, la détermination d’une localisation de ladite étiquette électronique en fonction des informations d’identification reçues, et la transmission de ladite localisation audit dispositif de génération de données d’enrichissement.
Le dispositif de localisation fournit au dispositif de génération de données d’enrichissement la ou les localisations des dispositifs de rendu mobiles munis d’étiquettes électroniques, ce qui peut contribuer à un allègement de la charge de calcul dudit dispositif de génération de données d’enrichissement.
Dans au moins un mode de réalisation, ledit dispositif de localisation est configuré pour émettre, préalablement à la réception du signal comprenant des informations d’identification en provenance de ladite étiquette électronique, un signal de requête à destination de ladite étiquette électronique, un tel mode de réalisation permet l’utilisation d’étiquettes électroniques de type RFID (de l’anglais, « Radio Frequency Identification ») passives.
Alternativement ou cumulativement, les étiquettes électroniques peuvent émettre (par exemple régulièrement) leurs données d’identifications respectives.
L’invention concerne également un produit programme d'ordinateur comprenant des instructions de code de programme pour la mise en œuvre du procédé de génération de données d’enrichissement tel que décrit précédemment, dans l’un quelconque de ses modes de réalisation, lorsqu’il est exécuté par un processeur.
Un programme peut utiliser n’importe quel langage de programmation, et être sous la forme de code source, code objet, ou de code intermédiaire entre code source et code objet, tel que dans une forme partiellement compilée, ou dans n’importe quelle autre forme souhaitable.
L’invention vise enfin un support d’enregistrement lisible par un ordinateur sur lequel est enregistré le programme d’ordinateur comprenant des instructions de code de programme pour l’exécution des étapes du procédé selon l’invention tel que décrit ci-dessus dans l’un quelconque de ses modes de réalisation.
Un tel support d'enregistrement peut être n'importe quelle entité ou dispositif capable de stocker le programme. Par exemple, le support peut comporter un moyen de stockage, tel qu'une ROM, par exemple un CD ROM ou une ROM de circuit microélectronique, ou encore un moyen d'enregistrement magnétique, par exemple un support mobile (carte mémoire) ou un disque dur ou un SSD.
D'autre part, un tel support d'enregistrement peut être un support transmissible tel qu'un signal électrique ou optique, qui peut être acheminé via un câble électrique ou optique, par radio ou par d'autres moyens, de sorte que le programme d’ordinateur qu’il contient est exécutable à distance. Le programme selon l'invention peut être en particulier téléchargé sur un réseau par exemple le réseau Internet.
Alternativement, le support d'enregistrement peut être un circuit intégré dans lequel le programme est incorporé, le circuit étant adapté pour exécuter ou pour être utilisé dans l'exécution du procédé précité.
Selon un exemple de réalisation, la présente technique est mise en œuvre au moyen de composants logiciels et/ou matériels. Dans cette optique, le terme "module" peut correspondre dans ce document aussi bien à un composant logiciel, qu'à un composant matériel ou à un ensemble de composants matériels et logiciels.
Un composant logiciel correspond à un ou plusieurs programmes d'ordinateur, un ou plusieurs sous-programmes d'un programme, ou de manière plus générale à tout élément d'un programme ou d'un logiciel apte à mettre en œuvre une fonction ou un ensemble de fonctions, selon ce qui est décrit ci-dessous pour le module concerné. Un tel composant logiciel est exécuté par un processeur de données d'une entité physique (terminal, serveur, passerelle, set-top-box, routeur, etc.) et est susceptible d'accéder aux ressources matérielles de cette entité physique (mémoires, supports d'enregistrement, bus de communication, cartes électroniques d'entrées/sorties, interfaces utilisateur, etc.). Par la suite, on entend par ressources tous ensembles d’éléments matériels et/ou logiciels support d’une fonction ou d’un service, qu’ils soient unitaires ou combinés.
De la même manière, un composant matériel correspond à tout élément d'un ensemble matériel (ou hardware) apte à mettre en œuvre une fonction ou un ensemble de fonctions, selon ce qui est décrit ci-dessous pour le module concerné. Il peut s'agir d'un composant matériel programmable ou avec processeur intégré pour l'exécution de logiciel, par exemple un circuit intégré, une carte à puce, une carte à mémoire, une carte électronique pour l'exécution d'un micrologiciel (« firmware » en anglais), etc.
Chaque composante du système précédemment décrit peut mettre bien entendu en œuvre ses propres modules logiciels ou hardwares.
Les différents modes de réalisation mentionnés ci-dessus sont combinables entre eux pour la mise en œuvre de la présente technique.
Brève description des dessins
D’autres caractéristiques et avantages de la présente invention ressortiront de la description faite ci-dessous, en référence aux dessins annexés qui en illustrent un exemple de réalisation dépourvu de tout caractère limitatif. Sur les figures :
• [Fig. 1] illustre de façon schématique un exemple d’architecture d’un système de supervision d’un environnement, comprenant au moins un dispositif de génération de données d’enrichissement d’au moins une vue de l’environnement, selon au moins un mode de réalisation de l’invention ;
• [Fig. 2] décrit sous forme de logigramme les étapes d’un procédé de génération de données d’enrichissement d’une vue d’un environnement mis en œuvre par le dispositif selon au moins un mode de réalisation de l’invention ;
• [Fig. 3] illustre de façon schématique une représentation graphique d’un corps d’un individu dont au moins une partie a été détectée sur la vue, selon au moins un mode de réalisation de l’invention ;
• [Fig. 4A] et [Fig. 4B] illustrent de façon schématique des modules d’intelligence artificielle mettant chacun en œuvre un modèle préalablement appris pour détecter des objets d’intérêt, selon au moins un mode de réalisation de l’invention ;
• [Fig. 5] illustre de façon schématique une vue enrichie d’images d’une scène dans laquelle les parties du corps d’un individu, occultées par un mur, sont représentées par les parties correspondantes d’un avatar de cet individu, selon au moins un mode de réalisation de l’invention ;
• [Fig. 6] illustre de façon schématique les flux de données entre les équipements et dispositifs du système selon au moins un mode de réalisation de l’invention ;
• [Fig. 7] illustre un exemple de structure matérielle d’un dispositif de génération de données d’enrichissement d’une vue d’un environnement selon au moins un mode de réalisation de l’invention.
Description de l’invention
La présente demande concerne un dispositif de génération de données d’enrichissement d’une partie d’un environnement réel rendue par un dispositif de rendu de réalité augmentée AR (de l’anglais, « Augmented Reality ») et/ou virtuelle VR (de l’anglais, « Virtual Reality ») et/ou mixte MR (de l’anglais, « Mixte Reality »). Il s’agit par exemple d’un dispositif de rendu de type HMD (de l’anglais, « Head Mounted Display ») destiné à être monté sur la tête d’un utilisateur, et à travers lequel l’utilisateur peut visualiser un environnement réel, augmenté. Il peut s’agir par exemple de lunettes de réalité augmentée ou d’un casque de réalité virtuelle. Des effets hap- tiques (par exemple des vibrations) et/ou audio peuvent également être rendus
Bien sûr l’invention ne se limite pas aux dispositifs HMD, mais s’applique à tout équipement terminal, par exemple un téléphone intelligent (de l’anglais, « smartphone »), un ordinateur, une tablette etc, pourvu qu’il soit adapté à produire un rendu de réalité virtuelle, augmentée ou mixte.
Pour rappel, la réalité augmentée AR est une technologie qui permet d’intégrer des éléments virtuels (par exemple en 3D et/ou en temps réel) au sein d’un environnement réel. Le principe est de combiner le virtuel et le réel et donner l’illusion d’une intégration parfaite à l’utilisateur. Selon ce principe, des lunettes de réalité augmentée sont équipées de verres transparents qui permettent à l’utilisateur de voir de ses propres yeux une vue de la partie de l’environnement située dans son champ de vision (vue réelle). Des éléments virtuels sont superposés à cette vue réelle et viennent enrichir l’expérience de l’utilisateur. La réalité virtuelle VR est une technologie permettant de simuler numériquement une scène virtuelle par ordinateur, par exemple au moins par la vue. Elle permet par exemple à l’utilisateur d’un casque de réalité virtuelle de vivre une expérience d’immersion dans un monde artificiel. Une vidéo 3D de la partie de l’environnement réel située dans le champ de vision de l’utilisateur est capturée en temps réel par au moins une caméra placée sur le casque et affichée sur l’écran du casque en lieu et place de ce que l’utilisateur verrait de ses propres yeux. La réalité mixte MR est une technologie qui capture l'environnement autour d’un utilisateur, le retranscrit en 3D et permet d'y insérer et de manipuler des objets 3D comme dans le cas de la VR. Selon ces principes, des éléments virtuels supplémentaires sont intégrés dans la vidéo 3D pour enrichir la vue de l’environnement.
Le principe de l’invention consiste notamment à obtenir des informations de localisation d’au moins un objet d’intérêt susceptible de se déplacer dans l’environnement réel et à les exploiter pour générer des données d’enrichissement, par exemple audio, haptique et/ou visuelles, d’une portion de l’environnement rendue par le dispositif de rendu. De telles données d’enrichissement peuvent notamment comprendre, dans le cas d’un dispositif de rendu de type HMD, des indicateurs visuels de positions relatives du ou des objets d’intérêts par rapport au dispositif de rendu (ou à son utilisateur) dans l’environnement réel, qu’ils soient visibles depuis le point de vue de cet utilisateur ou masqués (ie occultés) par la présence d’objets.
On désigne ici par objet d’intérêt un objet susceptible de se déplacer dans l’environnement réel du dispositif de rendu, ou de son utilisateur, tel qu’un autre dispositif électronique ou mécanique (un robot ou un engin de chantier par exemple) ou qu’un être vivant (un animal ou un individu). Dans le dernier cas, cet individu peut être ou non équipé d’un dispositif de rendu, différent ou analogue au dispositif de rendu de la présente demande. Cet autre dispositif de rendu peut par exemple être un dispositif de rendu de type HMD porté par cet individu. Dans l’affirmative, ce deuxième dispositif de rendu permet d’afficher une vue d’une partie de l’environnement depuis son propre point de vue sur un écran de son dispositif HMD placé devant ses yeux.
La présente demande s’applique aussi bien à un environnement intérieur qu’extérieur. Elle peut être particulièrement intéressante pour un environnement de travail, dans lequel interviennent plusieurs opérateurs sur des objets physiques, par exemple des machines-outils, potentiellement dangereux. Elle peut aider en effet, au moins dans certains modes de réalisation, à signaler à tout moment à l’utilisateur du dispositif de rendu, la position d’objets d’intérêts situés à proximité de lui, tels que des individus, utilisateurs ou non de dispositifs de rendu ou de robots et peut ainsi aider à prévenir (ou limiter) la survenue d’accidents de travail.
En relation avec la figure 1 , on présente à titre illustratif un exemple simplifié d’architecture d’un système de supervision S d’un environnement ENV selon un mode de réalisation de l’invention. On suppose ici qu’il s’agit d’un environnement intérieur, par exemple un bâtiment d’usine ou un entrepôt ou n’importe quel type de local. A l’intérieur de cet environnement ENV, on considère un premier utilisateur OP1 équipé d’un dispositif de rendu HMD1 . Ce dispositif de rendu est un dispositif de rendu HMD1 de type HMD monté sur sa tête dans l’exemple illustré. L’utilisateur est en train de visualiser une vue de l’environnement ENV sur l’écran du dispositif de rendu HMD1 placé devant ses yeux. Par exemple, elle a été obtenue à partir d’une ou plusieurs caméras vidéo fixées sur le dispositif HMD et correspond à son champ de vision.
Au moins un objet d’intérêt est susceptible d’être présent et mobile dans l’environnement ENV. Dans l’exemple illustré, il s’agit d’une pluralité d’individus OP2 à OP4. Optionnellement, au moins un de ces individus peut être équipé lui aussi d’un dispositif de rendu identique au ou différent du dispositif de rendu de l’utilisateur OP1 . On suppose dans ce qui suit que les individus sont équipés eux aussi de dispositifs de rendu HMD2 à HMD4, par exemple des dispositifs de type HMD montés sur leur tête.
On suppose que l’environnement ENV comprend aussi une pluralité d’objets physiques, disposés en différents endroits, qui peuvent réduire la visibilité de l’utilisateur OP1 selon sa position, sa taille et/ou son orientation notamment. Il s’agit par exemple d’objets physiques généralement immobiles, participant à un agencement de l’environnement, par exemple une cloison OBJ1 , une porte, un gros mobilier tel que la machine-outil OBJ2, une armoire, une chaîne de production (non représentées), généralement fixes. Il peut s’agir aussi d’objets physiques, par exemple de plus petites tailles, susceptibles d’être déplacés, comme par exemple un chariot OBJ3, un carton OBJ4, une chaise ou une table (non représentées), etc. Il peut s’agir encore d’objets d’intérêt (non représentés) que l’utilisateur a en ligne de mire sur son écran et qu’il souhaite manipuler, par exemple pour procéder à une opération de maintenance.
Selon le mode de réalisation détaillé en relation avec la figure 1 , le système S comprend le dispositif de rendu HMD1 à HMD4 de l’utilisateur OP1 et des individus OP2 à OP4.
Le système S peut comprendre aussi au moins un capteur, par exemple une pluralité de capteurs, SNS_ENV1 à SNS_ENV4, placé(s) dans l’environnement ENV et configuré(s) pour collecter des données de mesure comprenant au moins des informations de localisation du dispositif HDM 1 (et/ou de son utilisateur OP1), des dispositifs HDM 2 à HDM4 (et/ou des individus OP2, OP3, OP4 utilisant ces dispositifs) et plus généralement d’objets d’intérêt présent dans l’environnement. Pour ce faire, l’au moins un capteur comprend par exemple au moins un dispositif de localisation et d’identification RFID (de l’anglais, « Radio Frequency Identification ») configuré pour communiquer par une liaison radio avec au moins une étiquette électronique TAG placée sur au moins un objet d’intérêt, lorsqu’il est dans son champ d’action (par exemple environ de 1cm à 50 m), récupérer les informations d’identification que renferme cette étiquettes et les localiser précisément par triangulation. Par exemple, la technologie de communication sans fil utilisée appartient à un groupe comprenant des technologies radio de type UWB, BLE (de l’anglais, « Bluetooth Low Energy, Wi-Fi, 5G etc.
Bien entendu, selon les modes de réalisation, d’autres types de capteurs adaptés à fournir des informations de localisation peuvent être utilisés.
Ainsi, le système peut comprendre au moins une caméra, ici une pluralité de caméras vidéo placées selon différents points de vue et configurées pour capturer des séquences vidéo 3D de l’environnement ENV. A cet égard, les séquences vidéo 3D fournies par ces caméras peuvent être utilisées pour détecter et localiser des objets d’intérêts (objets physiques ou êtres vivants) présents dans l’environnement ENV mais non équipés d’étiquettes électroniques TAG.
Le système S peut comprendre aussi des capteurs de température, des détecteurs de fumée, ou plus généralement tout autre type de capteur susceptible de collecter des données de mesure relatives à un état de l’environnement ou des éléments qui le constituent à un instant donné.
Selon l’exemple illustré, le système S comprend un dispositif 100 de génération de données d’enrichissement d’une vue d’une partie de l’environnement ENV, par exemple affichée sur un écran du dispositif de rendu (par exemple HMD1) d’au moins un utilisateur (par exemple OP1). Un tel dispositif est configuré pour obtenir des informations relatives à sa propre localisation (ou à celle de son utilisateur), à partir de données collectées par des capteurs couplés au dispositif HMD1 de rendu porté par l’utilisateur et des informations de localisation d’au moins un objet d’intérêt susceptible de se déplacer dans ledit environnement. Ces informations de localisation peuvent être collectées par des capteurs placés dans l’environnement ou sur et/ou dans le dispositif de rendu de l’utilisateur et/ou sur et/ou dans les objets d’intérêt. Le dispositif 100 de génération de données d’enrichissement est configuré, au moins à partir des informations de localisation obtenues, pour déterminer une position relative de l’objet d’intérêt depuis le point de vue du dispositif 100(ou autrement dit son référentiel) puis générer des données d’enrichissement de ladite vue, au moins à partir de la position relative déterminée. Lesdites données d’enrichissement comprennent au moins des indications visuelles, audio, haptiques, etc de la position dudit au moins un objet d’intérêt par rapport à l’utilisateur OP1 et/ou à son dispositif de rendu. Par exemple, le dispositif 100 est configuré pour transmettre lesdites données d’enrichissement au dispositif de rendu de la vue concernée, par exemple au dispositif HMD1 de rendu de l’utilisateur OP1 en vue de leur affichage.
Le dispositif 100 met ainsi en oeuvre le procédé de génération de données d’enrichissement d’au moins une vue d’une partie de l’environnement rendu par un dispositif de rendu selon l’invention qui sera détaillé ci-après en relation avec la figure 2. Selon l’exemple de la figure 1 , chacun des opérateurs OP1 à OP4 est utilisateur d’un dispositif de rendu HM1 à HMD4 et le dispositif 100 est configuré pour générer des données d’enrichissement des vues visualisées par chacun d’eux. Bien évidemment, il peut dans d’autres mises en œuvre générer des données d’enrichissement rendues sur un seul dispositif de rendu du système S. Dans certaines modes de réalisation, le dispositif 100 peut aussi générer des données d’enrichissement d’un rendu global de l’environnement ENV pour un utilisateur superviseur SV en charge de la sécurité de l’environnement ENV et équipé d’un dispositif de rendu, par exemple l’équipement terminal ET. Ce superviseur SV et son équipement terminal ET peuvent être présents dans l’environnement ENV ou distants et connectés aux autres éléments du système de supervision S par un réseau de communication (non représenté).
Dans l’exemple de la figure 1 , le système S comprend un équipement serveur S qui intègre le dispositif 100. Alternativement, le dispositif 100 peut être indépendant de l’équipement serveur S, mais connecté à lui par une liaison filaire ou sans fil. En variante, l’équipement serveur ES peut être placé à l’extérieur de l’environnement ENV, dans un réseau de communication distant, par exemple organisé selon une architecture en nuage, pourvu que les communications entre l’équipement serveur et les dispositifs de rendu puissent se faire avec une latence limitée (par exemple sans latence), c’est-à-dire en quasi temps réel.
Selon encore une autre option, le dispositif 100 peut être intégré dans un dispositif de rendu, par exemple le dispositif de rendu HMD1 de l’utilisateur OP1 ou le dispositif de rendu ET du superviseur SV.
Selon au moins un exemple de réalisation de la figure 1 , l’équipement serveur ES comprend un module E/R d’émission réception configuré par exemple pour recevoir les données de mesure collectées par au moins un capteur (par exemple la pluralité de capteurs SNS_ENV1 à SNS_ENV4) placé dans l’environnement ENV et/ou au moins un capteur d’au moins un dispositif de rendu (par exemple des capteurs des dispositifs de rendu des utilisateurs SNS_OP1 à SNS_OP4).
L’équipement serveur ES peut comprendre également un module d’émission/réception (confondu avec ou distinct du module ci-dessous) configuré pour émettre et recevoir des données à destination ou en provenance d’autres éléments du système S, par exemple recevoir les données de mesure des capteurs et/ou transmettre les données d’enrichissement fournies par le dispositif 100 au dispositif de rendu HMD1 , comprenant au moins une indication de rendu d’au moins une position relative (par rapport à OP1) d’au moins un objet d’intérêt présent dans l’environnement, tel que par exemple au moins un des autres utilisateurs OP2-OP4. L’équipement serveur ES peut comprendre aussi une mémoire M configurée pour stocker au moins les données de mesure reçues des capteurs et les données d’enrichissement de rendu.
Dans certains modes de réalisation, l’équipement serveur ES peut comprendre en outre un module d’intelligence artificielle MIA1 configuré pour détecter et/ou reconnaitre des objets d’intérêt présents dans l’environnement et visibles au moins partiellement dans des séquences vidéo 3D acquises par des caméras placées dans l’environnement et/ou sur et/ou dans les dispositifs de rendu HMD1 à HMD4 des utilisateur OP1 à OP4. On note que le module MIA1 peut aussi être configuré pour détecter et/ou reconnaître des obstacles présents sur le parcours d’un de ces utilisateurs (caisse, chariot élévateur, etc). Selon au moins un mode de réalisation, le module MIA1 est configuré pour analyser les images des séquences vidéo pour déterminer dans quel cadre le ou les objets d’intérêt qu’il a détectés sont utilisés. Par exemple, si le module MIA1 détecte que l’utilisateur a un objet d’intérêt identifiable en face de lui et que ses mains en sont proches, il pourra décider que l’utilisateur souhaite intervenir ou est en train d’intervenir sur cetobjet et produire cette information en sortie de sorte que des données d’enrichissement soient générées pour augmenter la vue de cet objet d’intérêt pour l’utilisateur. Selon une variante, il peut aussi être configuré pour produire en sortie une information selon laquelle un autre utilisateur est déjà en train d’intervenir sur cet objet d’intérêt, de sorte que des données d’enrichissement spécifiques soient générées pour le signaler à l’utilisateur.
L’équipement serveur ES peut comprendre aussi un module d’intelligence artificielle MIA2, éventuellement distinct du module précédent MIA1 , configuré pour détecter et/ou reconnaître des parties (par exemple des membres) du corps d’individus au moins partiellement visibles dans les séquences vidéo (ou encore d’autres parties d’objets d’intérêt non humains dans certains modes des réalisation).
En variante, le module d’émission/réception, la mémoire, le ou les modules d’intelligence artificielles peuvent être intégrés dans le dispositif 100 lui- même.
Selon l’exemple de réalisation de la figure 1 , l’équipement serveur ES comprend un module JUM configuré pour générer une représentation graphique virtuelle de l’environnement ENV, dit jumeau numérique, qu’un utilisateur, par exemple le superviseur SV peut visualiser sur un dispositif d’affichage DISP de son équipement terminal ET et dans laquelle il peut naviguer à sa guise pour réaliser une surveillance. Comme précédemment évoqué, le dispositif 100 peut, dans certains modes de réalisation, être configuré pour générer des données d’enrichissement d’une ou plusieurs vues de ce jumeau numérique et les transmettre au dispositif de rendu ET. En relation avec la figure 2, on décrit maintenant un procédé de génération de données d’enrichissement du rendu d’au moins un dispositif de rendu selon au moins un mode de réalisation de l’invention. Dans l’exemple détaillé, il s’agit de l’enrichissement d’une vue d’au moins une partie de l’environnement ENV affichée sur un écran d’un dispositif de rendu HMD1 d’au moins un utilisateur OP1 . Un tel procédé est par exemple mis en œuvre par le dispositif 100, intégré par exemple dans l’équipement serveur ES de la figure 1. Dans l’exemple illustré, le procédé peut comprendre l’obtention 21 d’informations de localisation LOC du dispositif de rendu HMD1 et/ou de l’utilisateur OP1 , l’obtention 22 d’informations de localisation LOC_OI d’au moins un objet d’intérêt présent dans l’environnement ENV et susceptible de s’y déplacer, tel que au moins un des autres utilisateurs OP2 à OP4 ou un robot. Ces informations de localisation peuvent être obtenues, par exemple à partir de données reçues des capteurs SNS_HMD1 des dispositifs de rendu HMD1 à HMD4 portés par l’utilisateur OP1 et les autres utilisateurs OP2 à OP4 et/ou par d’autres capteurs SNS_ENV1 à SNS_ENV4 placés dans l’environnement. Par exemple, ces informations de localisation peuvent être obtenues de dispositifs de localisation et d’identification RFID placés dans l’environnement, comme précédemment décrit en relation avec la figure 1 . Elles peuvent dans certains modes de réalisation être obtenues à multiples reprises, par exemple périodiquement, par exemple une fois par seconde. Elles peuvent être associées à une information temporelle représentative de l’instant temporel courant de la mesure. Elles peuvent également être obtenues de façon non périodique, par exemple en fonction des déplacements de l’utilisateur et/ou des objets d’intérêts (lors du passage à proximité d’un capteur tel qu’un lecteur RFID par exemple).
Dans l’exemple illustré, le procédé peut comprendre ensuite une détermination 23 des positions de l’utilisateur OP1 (et/ou de son dispositif de rendu) et des objets d’intérêts Ol tels que les autres utilisateurs OP2 à OP4 dans le référentiel Ref de l’environnement ENV, à partir des informations de localisation obtenues. Elles sont par exemple stockées en mémoire, par exemple en mémoire M de l’équipement serveur ES. Cette détermination 23 peut par exemple être déclenchée par l’obtention de nouvelles informations de localisation en 21 et 22. Des positions relatives des objets d’intérêts, par rapport à l’utilisateur OP1 (dans un référentiel de l’utilisateur centré sur son dispositif de rendu HMD1) peuvent aussi être déterminées dans au moins certains modes de réalisation.
En 29, des données d’enrichissement peuvent être générées au moins à partir de ces positions relatives. Elles comprennent par exemple des coordonnées et des informations de description d’un indicateur de rendu, comme un indicateur visuel à insérer dans la vue affichée sur l’écran du dispositif de rendu HMD1 . Il s’agit par exemple, dans le cas d’un indicateur visuel, d’informations de description (couleur, taille , position, orientation etc..) d’une flèche pointant sur la position d’un objet d’intérêt Ol, tel qu’un autre utilisateur présent dans le champ de vision de l’utilisateur OP1 . Il peut s’agir aussi d’indicateurs visuels représentatifs de zones de danger, d’une présence de collègues, informations critiques (panne, péril, etc.). En variante, on peut aussi introduire des vibrations latérales pour indiquer l’utilisateur dans quelle direction se situe la zone de danger, le collègue, etc, des signaux sonores caractéristiques ou simplement un message vocal d’un superviseur.
Le champ de vision FOV de l’utilisateur peut par exemple être déterminé à partir de l’orientation de sa tête et de connaissances générales sur le système visuel humain. L’orientation de la tête peut quant à elle être obtenue par exemple à partir de données inertielles collectées par au moins un capteur de type module de mesure inertielle IMU (de l’anglais, « Inertial Measurement Unit ») placé sur le dispositif de rendu HMD1 et configuré pour mesurer une accélération, une vitesse angulaire et/ou une orientation à l’aide d’accéléromètres, de gyroscopes et/ou de ma- gnétomètres.
Dans certains modes de réalisation, la présence d’un autre utilisateur ou d’un objet d’intérêt qui se déplace dans l’environnement ENV peut être signalée même s’il se trouve hors du champ de vision FOV de l’utilisateur OP1 , par exemple dans son dos.
Le procédé peut comprendre enfin la transmission 30 des données d’enrichissement générées au moins au dispositif renduHMDI de l’utilisateur OP1 en vue de leur rendu. Par exemple, si le dispositif HMD1 est de type lunette de réalité augmentée, les données d’enrichissement générées (ou plus exactement les éléments qu’elles décrivent) seront superposées à la vue réelle de l’environnement que l’utilisateur OP1 perçoit à travers les verres de lunettes. Selon un autre exemple, si le dispositif HMD1 est de type casque de réalité virtuelle, elles seront intégrées par/lors de la mise à jour de la vue virtuelle générée par le casque. Cette transmission peut être optionnelle dans certains modes de réalisation, par exemple lorsque le dispositif de génération est également le dispositif de rendu.
Selon l’exemple de réalisation de la figure 2, le procédé comprend l’obtention 20 d’une cartographie 3D MAP de l’environnement ENV. Il s’agit par exemple d’une carte qui localise et identifie des objets physiques présents dans l’environnement ENV, tels que les cloisons, les portes, les fenêtres, les pièces, allées, meubles etc. Ces objets physiques sont généralement fixes et participent à l’agencement des lieux. Ils sont susceptibles de constituer des obstacles à la visibilité des autres utilisateurs OP2 à OP4. Cette cartographie MAP peut prendre en compte des données issues d’un plan du bâtiment, le cas échéant.
Optionnellement, cette cartographie MAP peut être obtenue à l’aide d’une technique de localisation et de mise en correspondance, par exemple de type SLAM (de l’anglais, « Simultaneous Location and Mapping ») par exemple une technique décrite dans l’article de Ruan et al., intitulé « GP-SLAM+: real-time 3D lidar SLAM based on improved regionalized Gaussian process map reconstruction « , publié en Août 2020 par arXiv, selon laquelle un ou plusieurs opérateurs, par exemple les utilisateurs OP1 à OP4, arpentent l’environnement ENV et capturent des séquences vidéo 3D de cet environnement. Les séquences vidéo obtenues sont exploitées pour reconstruire une vue ou cartographie 3D du bâtiment notamment en détectant les régions communes entre les différentes séquences. Cette opération peut être menée, dans une phase d’initialisation, préalable à la mise en oeuvre du procédé selon l’invention, sur la base d’un arpentage systématique et exhaustif des opérateurs, de sorte à obtenir une version initiale de la cartographie MAP de l’environnement. Elle peut dans certains modes de réalisation être complétée au fil de l’eau par la prise en compte des séquences vidéo 3D acquises par les utilisateurs OP1 à OP4 lors de leurs interventions dans l’environnement ENV.
On comprend ainsi qu’une telle cartographie 3D MAP comprend des informations de localisation et d’identification d’objets physiques OP que comprend l’environnement ENV (par exemple les objets physiques qui le constituent). Dans certains modes de réalisation, ces informations de localisation et d’identification peuvent être prises en compte lors de la génération des données d’enrichissement ENH (en 29). Plus précisément, les indications visuelles des autres utilisateurs OP2 à OP4 peuvent préciser si, depuis le point de vue de l’utilisateur OP1 , ils sont placés devant ou derrière un ou plusieurs des objets physiques OP localisés et identifiés par la cartographie, donc s’ils sont visibles ou au moins partiellement masqués.
Selon l’exemple de réalisation de la figure 2, le procédé comprend aussi l’obtention 24, en provenance d’au moins une caméra CAM dudit dispositif de rendu HMD1 de l’opérateur OP1 , de données vidéo 3D 3DV représentatives de la partie de l’environnement perçue par l’utilisateur OP1 depuis sa position et selon son point de vue. On considère ici en particulier les séquences vidéo acquises sur une période temporelle comprise entre un instant temporel précédent et l’instant temporel courant.
A partir des données vidéo 3DV obtenues, le procédé peut mettre en œuvre la détection 26 d’au moins un objet d’intérêt présent dans la vue, au moins à l’aide des données vidéo 3D obtenues. Il s’agit par exemple d’objet physique, comme une pièce particulière d’une machine-outil dont l’utilisateur OP1 s’est approché et vers laquelle il porte au moins son regard, voire ses mains et sur laquelle il doit intervenir. Il peut s’agir aussi d’un objet physique fixe, qui n’a par exemple pas été cartographié, ou encore d’un être vivant comme un individu qui n’est pas équipé d’un dispositif de rendu HMD (et donc d’une étiquette TAG) ou d’un animal. Selon un autre exemple, l’utilisateur pourrait cligner des yeux pour désigner un objet d’intérêt placé devant lui pour lequel il souhaite un enrichissement de la vue en cours de visualisation. Dans certains modes de réalisation, une position relative dudit au moins un objet d’intérêt par rapport à l’utilisateur OP1 est déterminée, à partir des données vidéo 3D obtenues.
A cet égard, selon au moins un mode de réalisation, on peut paramétrer la détection de sorte à caractériser les objets d’intérêt recherchés. Par exemple, on peut définir à l’aide d’un rayon centré sur le dispositif de rendu, une zone dans laquelle les objets d’intérêt détectés sont pris en considération et présentés à l'utilisateur du dispositif de rendu. Trop proche, il manquerait une partie des infos, trop loin, il serait surchargé.
Dans certains modes de réalisation, l’étape de détection d’au moins un objet d’intérêt peut être réalisée par un module d’intelligence artificielle MIA1 mettant en oeuvre un modèle préalablement appris. Un tel module est entrainé pour produire des informations de position et de classification, voire d’identification de l’objet d’intérêt. Elle sera détaillée plus avant en relation avec la figure 4 A.
Selon l’exemple de réalisation de la figure 2, le procédé comprend en 28 l’obtention d’informations de description DESC de l’objet d’intérêt Ol détecté. Il s’agit par exemple d’une fiche technique ou encore d’une représentation virtuelle 3D manipulable de l’objet d’intérêt. Par exemple ces informations de description DESC sont stockées dans la mémoire M de l’équipement serveur ES, par exemple au sein d’un catalogue virtuel d’objets d’intérêt présents dans l’environnement ENV.
Ces informations de description DESC peuvent être prises en compte en 29 pour générer des données d’enrichissement supplémentaires relatives à l’objet d’intérêt détecté. Par exemple, ces données d’enrichissement supplémentaires peuvent définir un indicateur de contour visuel de l’objet d’intérêt à superposer à la vue affichée et/ou une commande d’insertion de la représentation graphique virtuelle 3D de cet objet d’intérêt manipulable dans un coin de l’écran du dispositif de rendu HMD1.
Ces données d’enrichissement supplémentaires sont agrégées en 29 aux autres données d’enrichissement (comprenant la position relative d’au moins un objet(s) d’intérêt (par exemple au moins un des autres utilisateurs) par rapport à l’utilisateur), avant leur transmission en 30 au dispositif de rendu HMD1 de cet utilisateur pour affichage.
Dans certains modes de réalisation, les informations de détection des objets d’intérêt sont aussi stockées en mémoire. Elles pourront ainsi être utilisées pour enrichir les vues de l’environnement d’autres utilisateurs et/ou celle du jumeau numérique, et/ou dans un but de constitution d’un historique.
Selon l’exemple de réalisation de la figure 2, les données vidéo 3DV capturées en 24 sont en outre exploitées pour détecter et/ou reconnaitre en 25 une ou plusieurs parties du corps de l’utilisateur OP1 et/ ou une ou plusieurs parties d’un individu qui n’est pas équipé d’un dispositif de rendu HMD ou même d’un autre utilisateur OP2-OP4 d’un dispositif de rendu HMD. Elles peuvent également dans certains modes de réalisation être exploitées pour détecter et/ou reconnaître en 25 une ou plusieurs parties d’un objet d’intérêt, tel qu’un dispositif ayant un corps et/ou des portions rigides, éventuellement articulées et/ou interconnectées, de forme et/ou de mouvements possibles connus par exemple, comme un dispositif électromécanique (tel qu’un robot) référencé dans une base de connaissances ).
En ce qui concerne l’utilisateur OP1 , il s’agit par exemple de ses mains, bras, pieds et jambes. En effet, lorsque l’utilisateur OP1 s’approche d’une machine-outil pour manipuler une pièce particulière de cette machine, ses mains peuvent être partiellement visibles sur les données vidéo acquises par la caméra placée sur son dispositif de rendu HMD1. S’il penche la tête, ses pieds ou ses jambes peuvent au moins en partie apparaître sur la séquence vidéo. On note que cette étape peut dans certains modes de réalisation prendre en compte des données vidéo issues d’autres caméras, par exemple fixes de l’environnement ENV et orientées de sorte que l’utilisateur soit dans leur champ de vision et que des parties de son corps non présentes sur les données vidéo capturées par son dispositif de rendu HMD1 soient visibles.
En ce qui concerne les individus (comme les autres utilisateurs OP2 à OP4) , il s’agit par exemple de ceux qui sont au moins partiellement visibles sur les données vidéo capturées par la caméra du dispositif de rendu HMD1 et éventuellement d’autres caméras placées dans l’environnement ENV sur la période temporelle considérée.
Bien sûr, la détection d’objets d’intérêt dans l’environnement et à proximité du dispositif de rendu, peut être réalisée à partir d’autres données d’entrées qu’une ou plusieurs séquences vidéo. Par exemple, des données acquises par d’autres types de capteurs qu’une caméra vidéo, tels qu’un laser (LIDAR), un sonar, un microphone, un capteur de pression, un détecteur de mouvement, peuvent être exploitées à la place ou en complément de la ou des séquences vidéo.
Dans certains modes de réalisation, cette étape de détection peut être réalisée par un module d’intelligence artificielle MIA2 mettant en oeuvre un modèle MOD2 préalablement appris. Elle sera détaillée plus avant en relation avec la figure 4B.
Une fois détectée et identifiée, la partie d’un objet d’intérêt (par exemple la partie du corps de l’utilisateur OP1 et/ou d’au moins un autre individu, par exemple des autres utilisateur OP2- OP4 , ou la partie d’un objet d’intérêt autre qu’humain), est positionnée dans un référentiel de l’utilisateur OP1 et, dans certains modes de réalisation dans un référentiel de l’environnement ENV. Les informations de localisation et éventuellement d’identification obtenues peuvent être stockées en mémoire en association avec l’instant temporel courant (associé à la séquence vidéo capturée) et l’identification de l’utilisateur concerné.
Selon l’exemple de réalisation de la figure 2, le procédé comprend en 27 l’obtention, au moins à partir des informations de détection obtenues, d’une représentation graphique 3D virtuelle de la ou les parties du corps de l’utilisateur OP1 identifiées et/ou des parties d’autres objets d’intérêt éventuels (comme des parties du corps d’autres individus). Autrement dit, il s’agit dans certains modes de réalisation de générer un avatar d’un point d’intérêt comme l’utilisateur OP1 (et/ou du ou des autres individus éventuels) qui pourra être inséré et animé dans une ou plusieurs vues de l’environnement ENV destinées à être visualisées par l’utilisateur lui-même et/ou d’autres utilisateurs d’autres dispositifs de rendu en quasi-temps-réel.
Cette représentation graphique 3D ou avatar peut comprendre par exemple au moins certaines des informations suivantes :
- Identifiant du point d’intérêt,
- Modèle du point d’intérêt ;
- Information de localisation (Latitude, longitude et élévation),
- Position absolue, calculée par rapport au référentiel Ref de l’environnement,
- Une liste des parties à afficher contenant à la fois leur position (X, Y, Z) et une rotation à appliquer (pitch, yaw, roll),
- Instant temporel (en anglais, « Timestamp ») associé aux dernières informations de localisation et d’identification obtenues.
Dans certains modes de réalisation, chaque partie d’un point d’intérêt (tête, tronc, membre pour un individu) peut être définie indépendamment des autres. Par exemple, un bras est composé d’un coude, d’un avant-bras, d’un poignet, d’une paume de main, de doigts, eux-mêmes composés de phalanges. Il convient donc de positionner et d’animer précisément chacun de ces éléments.
Par exemple, on définit différentes parties du corps de l’utilisateur comme suit :
{
Base de la colonne vertébrale : "SpineBase":{"location":{"x":0.71 ,"y":8.82,"z":19.7},"rota- tion":{"x":-0.012,"y":0.999,"z":0}},
Milieu de la colonne vertébrale :"SpineMid":{"location":{"x":0.64,"y":11 ,77,"z":19.69}, "rotation":!"/':^.012, "y":1 ,"z":0}},
Cou : "Neck":{"location":{"x":0.69,"y":14.45,"z":19.52},"rotation":{"x":0.024,"y":0.997,"z":-0.052}}, Tête : "Head":{"location":{"x":0.37,"y":16.28, "z":19.8},"rotation":{"x":0,"y":0,"z":0}},
Epaule gauche : "ShoulderLeft":{"location":{"x":-1 .1 ,"y":13,"z":19.16},"rotation":{"x":0.836,"y":- 0.538, "z":0.057}},
Coude gauche : "ElbowLeft":{"location":{"x":-0.96,"y":13.56,"z":16.15},"rotation":{"x":-0.636,"y":- 0.003, "z":-0.027}}, }
Dans certains modes de réalisation, comme décrit en relation avec la figure 3, les positions relatives des éléments qui composent une partie du corps d’un individu (tronc, membres, tête) peuvent être déterminées en utilisant une technique dite de cinématique inverse, par exemple décrite dans le document de Ramadoss et al., intitulé « Whole-Body Human Kinematics Estimation using Dynamical Inverse
Kinematics and Contact-Aided Lie Group Kalman Filter », publié par arXiv en mai 2022.
Selon cette technique, les membres sont des solides indéformables, de longueur donnée, reliés entre eux par des articulations. Les articulations supportent une certaine torsion maximale, qui varie selon la direction ou la vitesse. Les mouvements sont supposés suffisamment réguliers pour paraître naturels. Une telle technique peut aider à produire un avatar relativement fidèle à la réalité au sens où le corps de l’individu n’adoptera que des postures réalistes.
On comprend que les données vidéo 3DV obtenues du dispositif de rendu HMD1 de l’utilisateur OP1 et/ou d’autres caméras placées dans l’environnement ENV ne fournissent pas nécessairement une image du corps, dans son intégralité, de l’utilisateur OP1 ou d’un autre utilisateur OP2-OP4 présent dans son champ de vision. Néanmoins, la technique de cinématique inverse permet d’extrapoler les parties invisibles sur les données vidéo.
Selon l’exemple de réalisation de la figure 2, les positions relatives de l’utilisateur OP1 et des autres utilisateurs OP2-OP4 déterminées en 22 sont exploitées en 23 pour déterminer quels avatars sont à insérer dans les données d’enrichissement ENH destinées à l’utilisateur OP1 . Dans certains modes de réalisation, la connaissance de l’agencement de l’environnement fournie par la cartographie MAP obtenue en 20, optionnellement les informations de localisation et/ou d’identification des objets d’intérêt OOI et/ou les informations de localisation et/ou les informations d’identification et/ou de localisation d’au moins une partie du corps d’un ou plusieurs autres utilisateurs présents dans la partie de l’environnement rendue par le dispositif de rendu, obtenues en 25, sont exploitées en 29 pour déterminer les parties des objets d’intérêt occultées dans la vue rendu par le dispositif de rendu de l’utilisateur OP1 . La connaissance de cette partie occultée de l’objet d’intérêt peut ensuite être exploiter pour générer des données d’enrichissement spécifiques, destinées à compléter le rendu de cet objet d’intérêt. Par exemple, dans le cas d’un individu pour lequel il a été déterminé qu’au moins un de ses membres est occulté sur la vue, le membre correspondant de l’avatar généré pour cet individu peut être sélectionné pour être inséré dans les données d’enrichissement destiné au dispositif de rendu HDM1 de l’utilisateur OP1 . De la sorte, les données d’enrichissement permettent de représenter la partie du corps occultée de l’autre utilisateur dans la vue affichée sur le dispositif de rendu HMD1 de l’utilisateur OP1 .
Dans certains modes de réalisation, comme décrit en relation avec la figure 4A, la ou les séquences vidéo 3D capturées par la ou les caméras du dispositif de rendu HMD1 de l’utilisateur OP1 sont fournies en entrée d’un module d’intelligence artificielle MIA1 mettant en oeuvre un modèle d’analyse de données MOD1 obtenu par apprentissage machine et destiné à localiser et identifier un ou plusieurs objets d’intérêt Ol à partir de données vidéo d’entrée.
Par exemple, ce module MIA1 est un réseau de neurones ou tout autre module d’intelligence artificielle apte à remplir les mêmes fonctions, basé par exemple sur une des techniques suivantes
- arbre de décision, par exemple de type Random Forests,
- arbre de décision boosté (ou « Gradient boosted decision trees », en anglais), par exemple de type Catboost, XGBoost ou LightGBM
- machine à vecteurs de support (ou « Support Vector Machine », en anglais) ;
- réseau de neurones de type Multi-layer Perceptron ;
- etc.
Dans certains modes de réalisation, cet apprentissage ou entraînement peut avoir été mis en oeuvre au cours d’une étape préalable (non représentée sur la figure 2), qui a permis de construire le modèle d’analyse MOD1 du module MAI1 à partir d’un ensemble de données d’apprentissage. Le modèle d’analyse MOD1 ainsi construit est exploité en 25 par le module MAI pour identifier et localiser un ou plusieurs objets d’intérêt OOI présents dans le champ de vision de l’utilisateur OP1 , et notamment ceux au moins partiellement occultés.
On note que l’apprentissage du modèle MOD1 et l’analyse des données vidéo à l’aide du modèle MOD1 pour localiser et identifier les objets d’intérêt dans les données d’entrée, par exemple des données vidéo 3D, sont ici présentés en deux temps, ou en deux phases distinctes, par simplicité. Il est entendu cependant que l’apprentissage peut être effectué plusieurs fois (notamment en parallèle de ou après l’analyse) et que l’analyse peut être continue.
Ainsi, dans certains modes de réalisation, l’apprentissage peut comprendre une phase d’apprentissage, « en amont » (initiale et préalable à la phase d’analyse) pour apprendre à analyser des données vidéo 3D capturées par une ou plusieurs caméras depuis le point de vue du dispositif de rendu et définir des paramètres (ou poids) pour permettre ensuite, à partir de n'importe quelles autres données vidéo 3D capturées par d’autres caméras d’autres dispositifs de rendu, présentées en entrée du module MD1 , d’identifier et localiser le ou les objets d’intérêt présents. La phase d’apprentissage en amont s’appuie donc sur un ensemble ou base d’apprentissage comprenant une pluralité de données vidéo étiquetées (i. e labélisées). Dans certains modes de réalisation, une étiquette peut comprendre les positions de points clés de l’objet d’intérêt dans les données vidéo et un identifiant de l’objet d’intérêt. Par exemple, la base d’apprentissage peut comprendre des données vidéo étiquetées de chacune des pièces d’un catalogue de pièces d’une machine-outil, selon plusieurs points de vue distincts.
La phase d’apprentissage peut comprendre aussi un apprentissage au fil de l’eau à partir des données collectées par au moins un dispositif de rendu d’une vue d’au moins une partie de l’environnement ENV, afin d’affiner le paramétrage du module d’intelligence artificielle MIA issu de l’apprentissage en amont (réalité terrain). Les deux apprentissages peuvent être effectués sur un même équipement (par exemple par le dispositif 100, par l’équipement serveur ES, et/ou par des équipements différents (par exemple l’apprentissage amont et/ou l’apprentissage au fil de l’eau peuvent être effectués sur un autre équipement, par exemple distant, dédié à cette tâche, I et disposant de capacités de calcul et de mémoire adaptées.
Selon au moins certains modes de réalisation, le module d’intelligence artificielle MIA1 reçoit en entrée sous la forme d’un vecteur d’entrée V1 IN, les données vidéo 3D transmises par le dispositif de rendu HMD1 au dispositif 100. Par exemple, un tel vecteur V1 IN comprend une séquence temporelle de ces données vidéo de durée donnée, par exemple égale à 1s. Dans certains modes de réalisation, le vecteur V1 IN peut comprendre des informations supplémentaires relatives à une pose de la tête de l’utilisateur par exemple, de sorte à prendre en compte la direction de son regard.
Selon au moins certains modes de réalisation, le module de prédiction MIA1 peut être configuré pour produire en sortie un vecteur V1 OUT comprenant des informations de localisation et d’identification d’un ou plusieurs objets d’intérêt, associées à un ou plusieurs instants temporels. Bien sûr, il peut arriver qu’aucun objet d’intérêt ne soit détecté, par exemple lorsque l’utilisateur OP1 déambule dans l’environnement ENV et qu’il n’est pas en train de travailler sur une machine-outil donnée.
Selon l’exemple de réalisation de la figure 2, le vecteur de sortie V1 OUT est exploité en 27 pour obtenir des informations de description DESC, comprenant par exemple un modèle de représentation 3D de l’objet d’intérêt identifié, par exemple auprès d’une mémoire locale ou distante, par exemple structurée comme une base de données indexée par des identifiants des objets d’intérêt. Les données de description obtenues sont ensuite exploitées pour générer des données d’enrichissement supplémentaires de la vue de l’utilisateur en 29, les agréger aux autres données d’enrichissement précédemment générées, notamment des informations de position et les transmettre en 30 à l’utilisateur OP1 . Dans certains modes de réalisation, les informations de localisation et d’identification de l’objet d’intérêt déterminées par le module MIA1 sont stockées en mémoire en association avec l’instant temporel courant.
En relation avec la figure 4B, la ou les séquences vidéo 3D capturées par la ou les caméras du dispositif de rendu HMD1 de l’utilisateur OP1 ainsi que des séquences vidéo capturées par d’autres caméras placées dans l’environnement ENV, sont fournies en entrée d’un module d’intelligence artificielle MIA2 mettant en œuvre un modèle d’analyse de données MOD2 obtenu par apprentissage machine et destiné à localiser et identifier des parties d’un objet d’intérêt (comme des parties du corps d’un ou plusieurs autres utilisateurs). Les considérations sur le réseau de neurones mis en œuvre et l’apprentissage faites en relation avec la figure 4A s’appliquent.
En l’espèce, la base d’apprentissage peut comprendre, dans certains modes de réalisation, une pluralité de séquences vidéo d’objets d’intérêt étiquetées avec des informations de localisation et d’identification de points clés de ces objets (par exemple pour des individus leur tête, tronc, membres). Dans certains modes de réalisation, la base couvre une pluralité de postures ou positions possibles des objets d’intérêts et les séquences vidéo d’apprentissage ont été capturées dans l’environnement ENV.
En relation avec la figure 5, on a représenté deux images 11 , I2 d’une vue d’une scène capturée par une caméra. Sur l’image 11 , le haut du corps d’un individu est visible à travers une fenêtre F et le bas de son corps est masqué par un mur MR. Sur l’image I2, il est complètement caché par le mur MR. La vue de la scène a été enrichie en incrustant dans les images 11 et I2, en lieu et place des parties du corps occultées par le mur MR, les parties correspondantes d’une représentation graphique virtuelle ou avatar de cet individu. On comprend que l’insertion de l’avatar de l’individu peut aider un utilisateur d’un dispositif de rendu qui lui afficherait cette scène, à connaître à tout moment la position et la posture de cet individu et donc l’aider à suivre plus facilement ses mouvements et ses actions.
En relation avec la figure 6, on décrit maintenant les flux de données au sein d’un système S selon un autre exemple de réalisation. Dans ce qui précède et en relation avec les figures 2 à 5, on s’est attaché à décrire un exemple de mise en œuvre de l’invention pour un dispositif de rendu HMD1 particulier. En relation avec la figure 1 , on a décrit un système S comprenant une pluralité de dispositifs de rendu HMD1-HMD4 portés par une pluralité utilisateurs OP1-OP4 présents dans un environnement ENV. Selon l’exemple de réalisation de la figure 6, l’équipement serveur ES du système S est configuré pour enrichir simultanément et en temps réel les vues affichées sur les dispositifs de rendu HMD1 à HMD4 de chacun des utilisateurs OP1 à OP4. Autrement dit, il est configuré pour mettre en œuvre le procédé de génération de données d’enrichissement pour chacune des vues affichées sur les dispositifs de rendu HMD1 à HMD4 des utilisateurs OP1 à OP4. Dans cet exemple, il comprend un dispositif 100 selon l’invention.
Dans certains modes de réalisation, il est en outre configuré pour enrichir la vue du jumeau numérique de l’environnement ENV affichée sur le dispositif de rendu DISP destiné à une supervision globale de cet environnement ENV, par exemple par un superviseur chargé de la sécurité de l’environnement et de ses utilisateurs.
En relation avec la figure 6, des dispositifs EMT de localisation et d’identification RFID placés dans l’environnement ENV émettent plusieurs fois , par exemple périodiquement, par exemple une fois par seconde, un signal de requête de type « ping », auxquels des étiquettes électroniques de type TAG placées sur les dispositifs de rendu HMD1 à HMD4 des utilisateurs OP1 à OP4 et présentes dans le champ d’action des dispositifs EMT répondent en transmettant les informations d’identification qu’elles contiennent. Les dispositifs EMT déterminent une localisation de chacune des étiquettes TAG par triangulation et la transmettent au dispositif 100. Des tels dispositifs de localisation EMT peuvent émettre des signaux à destination des étiquettes électroniques de type TAG (par exemple des étiquettes que l’on souhaite localiser dans l’environnement ENV) et/ou recevoir des signaux en provenance de telles étiquettes électroniques. Dans certains modes de réalisation, les étiquettes électroniques peuvent être passives (en référence à leur utilisation), par exemple dans le cas des étiquettes de type RFID. D’autres technologies peuvent être utilisées, par exemple Ultra Wide Bande, Bluetooth Low Energy ou Wifi. Dans le cas des étiquettes de type RFID, ledit dispositif de localisation EMT peut être configuré pour émettre, à destination des étiquettes électroniques TAG placées sur les dispositifs de rendu HMD1 à HMD4, un signal de requête, recevoir un signal comprenant des informations d’identification en provenance de desdites étiquettes électroniques, déterminer les localisations desdites étiquettes électroniques, en fonction des informations d’identification reçues, et transmettre lesdites localisations audit dispositif de génération de données d’enrichissement.
Dans certains modes de réalisation, les étiquettes électroniques peuvent être actives (en référence à leur utilisation), par exemple dans le cas des étiquettes de type RFID. Ainsi, les étiquettes électroniques TAG placées sur les dispositifs de rendu HMD1 à HMD4 peuvent émettre (par exemple régulièrement) leurs données d’identifications respectives. Cette émission peut être faite à leur initiative (et non en réponse à une requête). Ainsi, le dispositif de localisation EMT peut déterminer les localisations des étiquettes sans effectuer une étape préalable d’émission du signal de requête.
Le dispositif 100 peut à son tour déterminer en 22 des informations de position d’au moins certains (par exemple de chacun) des dispositifs HMD1 à HMD4 dans un référentiel Ref de l’environnement, en fonction des localisations transmises par ledit dispositif de localisation EMT. Il peut obtenir aussi des données de mesures MES collectées par au moins un capteur. Ceux ou cet au moins un capteur SNS peuvent être de types variés et comprennent par exemple une ou plusieurs caméras vidéo placées par exemple en différents points de l’environnement ENV, une ou plusieurs capteurs de température, un ou plusieurs détecteurs de fumée, une ou plusieurs détecteurs de mouvement, par exemple basés lasers, une ou plusieurs capteurs volumétriques de type LIDAR pour mesurer une distance, etc.
Dans certains modes de réalisation, le dispositif 100 est aussi configuré pour collecter des données transmises par des contrôleurs logiques programmables PLC (de l’anglais : Programmable Logic Controller) qui sont des composants programmés et utilisés pour la commande ou la régulation de machines ou d’installations. De telles commandes peuvent être mises en application dans des secteurs très différents, par exemple pour commander des installations de production, des presses à injection. De telles données peuvent aider le dispositif 100 à connaître ainsi le statut des machines et plus généralement des équipements présents dans l’environnement. Il peut aussi, dans certains modes de réalisation, les piloter à distance.
Dans certains modes de réalisation, le dispositif 100 reçoit en 24 des données du ou d capteurs, comme des capteurs SNS_HMD1 à SNS_HMD4 embarqués sur les dispositifs de rendu HMD1 à HMD4, comprenant par exemple des données inertielles (accélération, vitesse, et/ou orientation) et/ou des données vidéo 3D capturées captées par au moins une caméra placée en partie haute et avant du dispositif de rendu correspondant et configurée pour filmer la partie de l’environnement située dans le champ de vision de l’utilisateur OP1 à OP4.
On suppose aussi que le dispositif 100 a préalablement obtenu par exemple d’une mémoire M une cartographie MAP de l’environnement ENV, qui comprend des informations de position et d’identification d’éléments ou objets physiques agencés dans l’environnement ENV (cloisons, machines, mobiliser, portes, fenêtres, allées, etc).
Les informations de cette cartographie peuvent permettre, dans certains modes de réalisation, de déterminer à l’aide de la position d’un autre utilisateur présent dans le champ de vision de l’utilisateur, s’il est effectivement visible ou bien s’il est occulté par un élément d’agencement de l’environnement (tel qu’une cloison par exemple). Cette cartographie MAP peut aussi dans certains modes de réalisation être exploitée pour créer une représentation 3D virtuelle de l’environnement ENV, appelée jumeau numérique JUM. Ce jumeau numérique peut dans certains modes de réalisation être rendu (par exemple affiché) sur le dispositif de rendu ET placé ou non dans l’environnement ENV. Dans certains modes de réalisation, un utilisateur de ce dispositif ET, par exemple un opérateur SV chargé de la supervision et de la sécurité de l’environnement ENV, peut naviguer dans ce jumeau numérique, comme lors d’une visite virtuelle. Il peut aussi afficher des informations précises de certaines machines, telles que leur statut.
Dans certains modes de réalisation, le dispositif 100 peut être configuré pour prédire une trajectoire d’au moins un objet d’intérêt qui se déplace dans l’environnement. Cette prédiction peut par exemple tenir compte de données de capteurs, telles que par exemple les données de vitesse et d’accélération, relatives à ce ou ces objet(s) d’intérêt. Par exemple, à partir des informations de positions obtenues pour chacun des dispositifs de rendu HMD1 à HMD4, d’autres données de capteurs, telles que par exemple les données de vitesse et d’accélération d’au moins certains (par exemple chacun) des dispositifs de rendu HMD1 à HMD4, le dispositif 100 peut être configuré pour prédire une trajectoire d’un objet d’intérêt. Selon un autre exemple, il est configuré pour prendre en compte des déplacements antérieurs de cet objet d’intérêt, sa trajectoire actuelle et la vue de la partie de l’environnement pour prédire là où il va se diriger ensuite.
Selon un autre mode de réalisation, les données collectées par tous les capteurs pour tous les objets d’intérêt en mouvement sont exploitées pour prédire les trajectoires de chacun de ces objets d’intérêt et éviter les collisions, en générant des signaux d’alerte et en enrichissant les vues des différents utilisateurs avec ces signaux.
Le dispositif 100 peut ainsi aider à prévenir d’éventuelles collisions, le dispositif 100 peut être configuré pour transmettre, en cas de risque de collision établi, un message d’alerte à au moins un des utilisateurs concernés. Par exemple, ce message est un message vocal envoyé sur leurs terminaux mobiles. Il peut s’agir aussi d’un indicateur visuel d’alerte ou transmis comme des données d’enrichissement de la vue affichée sur les écrans de leurs dispositifs de rendu respectifs.
Dans certains modes de réalisation, le dispositif 100 peut être configuré pour localiser et/ou identifier des objets d’intérêt visualisés par au moins certains des utilisateurs OP1 à OP4 des dispositifs de rendu HMD1 à HMD4. Cette localisation/identification peut tenir compte par exemple de données vidéo reçues des caméras des dispositifs de rendu HMD1 à HMD4 de ces utilisateurs pour une période temporelle donnée (entre deux instants temporels successifs d’obtention des informations de localisation, par exemple de durée de l’ordre de quelques secondes (par exemple 1 seconde, 2 secondes, 5 secondes...). Dans certains modes de réalisation, il peut exploiter (en complément des données vidéo par exemple) des données d’orientation obtenues des capteurs inertiels (gyroscope) des dispositifs de rendu HMD1 à HMD4 pour déterminer une pose de la tête d’au moins un utilisateur et l’orientation de son regard, ce qui peut aider à délimiter une zone d’intérêt plus restreinte dans son champ de vision. Dans certains modes de réalisation, le dispositif 100 peut faire appel au module d’intelligence artificielle MIA1 intégré par exemple à l’équipement serveur ES qui met en oeuvre un modèle MOD1 préalablement appris pour réaliser ces opérations d’identification et de localisation à partir des données vidéo captées, comme précédemment décrit en relation avec la figure 4A. Les informations d’identification des objets d’intérêt détectés pour au moins un utilisateur sont associées à une information de position de ces objets d’intérêt dans le référentiel Ref de l’environnement et stockés en mémoire. Dans certains modes de réalisation, ces informations sont associées à une représentation graphique 3D virtuelle manipulate de l’objet d’intérêt correspondant disponible en mémoire, par exemple dans le catalogue.
Les données vidéos reçues des caméras des dispositifs de rendu HMD1 à HMD4, et dans certains modes de réalisation les données vidéo d’autres caméras (SNS_ENV1 à SNS_ENV4) placées dans l’environnement peuvent aussi être exploitées pour localiser et identifier en 24 au moins certaines parties du corps de l’utilisateur du dispositif de rendu et/ou d’autres individus visibles dans la vidéo. Pour cette opération, le dispositif 100 peut faire appel au module d’intelligence artificielle MIA2 (de l’équipement serveur ES par exemple), configuré pour reconnaître des parties du corps d’un individu qui apparaissent dans une ou plusieurs séquences vidéo qui lui sont fournies en entrée, comme décrit en relation avec la figure 4B. Les parties du corps identifiées et localisées peuvent dans certains modes de réalisation être associées à un utilisateur en exploitant les informations de positions préalablement obtenues en 21 (notamment l’étiquette TAG reçue du capteur de position de son dispositif de rendu) et stockées en mémoire M.
Dans certains modes de réalisation, une représentation graphique virtuelle ou avatar d’au moins un objet d’intérêt (individu ou dispositif électromécanique par exemple) peut être générée à partir des informations d’identification et de positions des parties de l’objet d’intérêt détectées (donc visibles) sur les données vidéo. Cette représentation graphique virtuelle peut par exemple, dans certains modes de réalisation, être basée au moins partiellement sur un modèle anatomique définissant indépendamment chaque partie de l’objet d’intérêt comme un solide, par exemple selon une technique de cinématique inverse, comme précédemment décrit en relation avec la figure 3. On comprend que cette technique peut aider à extrapoler les positions de parties (comme des membres d’un utilisateur) non visibles sur les séquences vidéo.
Pour au moins un utilisateur OP1 à OP4, ses informations de position et celles d’au moins un objet d’intérêt (comme un des autres utilisateurs de dispositifs de rendu), les informations de cartographie MAP et les informations d’identification et de localisation de parties du corps de l’utilisateur lui-même et/ou de parties d’autres objets d’intérêt (comme des individus visibles dans la vue affichée sur l’écran de son dispositif de rendu HMD1 à HMD4) et d’autres vidéo collectées dans l’environnement, peuvent être agrégées, dans certains modes de réalisation, pour déterminer (par exemple à l’aide d’information de profondeur) si d’autres parties du corps de l’utilisateur lui-même ou des parties d’au moins un objet d’intérêt (comme un ou plusieurs autres individus) sont occultées. Le cas échéant, les parties correspondantes de leurs avatars peuvent être obtenus (par exemple de la mémoire M) et insérés comme données d’enrichissement ENH de la vue affichée sur le dispositif de rendu de l’utilisateur.
Les données d’enrichissement ainsi générées pour un utilisateur d’un dispositif de rendu peuvent être agrégées puis transmises au dispositif de rendu, lorsque le dispositif 100 n’est pas intégré dans le dispositif de rendu.
Dans certains modes de réalisation, des données d’enrichissement spécifiques peuvent être générées pour la vue du jumeau numérique JUM de l’environnement ENV affichée sur le dispositif de supervision DISP.
On présente enfin, en relation avec la figure 7, un exemple de structure matérielle d’un dispositif 100 de génération de données d’enrichissement d’au moins une vue d’au moins une partie d’un environnement (ENV) depuis au moins un premier point de vue. Ladite vue est destinée à être rendue au moins partiellement par au moins un dispositif de rendu. Ledit dispositif comprend au moins un module d’obtention d’informations de localisation d’au moins un objet d’intérêt dans ledit environnement et un module de génération de données d’enrichissement de ladite vue, au moins à partir des informations de localisation obtenues. Lesdites données d’enrichissement comprennent au moins des données représentatives d’une position dudit objet d’intérêt par rapport audit premier point de vue et des données représentatives d’une partie occultée dudit objet d’intérêt.
Dans certains modes de réalisation, le dispositif 100 peut comprendre un module de détection dudit au moins un objet d’intérêt au moins dans ladite vue, un module d’obtention d’information de description dudit au moins un objet d’intérêt détecté, et le module de génération des données d’enrichissement est configuré pour utiliser les informations de description pour générer au moins certaines des données d’enrichissement de la vue.
Dans certains modes de réalisation le dispositif peut comprendre un module d’obtention d’une représentation graphique de la partie occultée de l’objet d’intérêt dans la vue de la partie de l’environnement rendue par le dispositif de rendu au moins en fonction de la position de l’objet d’intérêt par rapport au point de vue et des information de description et le module de génération est configuré pour générer des données d’enrichissement de la partie occultée comprenant la représentation graphique obtenue.
Dans certains modes de réalisation, le dispositif 100 peut comprendre un module d’obtention d’une représentation graphique virtuelle de l’objet d’intérêt identifié, le module de génération des données d’enrichissement étant configuré pour insérer ladite représentation graphique virtuelle de l’objet d’intérêt identifié dans la vue de l’environnement visualisée par l’utilisateur. Dans certains modes de réalisation le module de détection dudit au moins un objet d’intérêt est configuré pour mettre en oeuvre un module d’intelligence artificielle configuré pour utiliser au moins un modèle préalablement appris et associant lesdites données vidéo 3D à au moins une information de position et optionnellement de classification et/ou d’identification dudit objet d’intérêt.
Le terme « module » peut correspondre aussi bien à un composant logiciel qu’à un composant matériel ou un ensemble de composants matériels et logiciels, un composant logiciel correspondant lui-même à un ou plusieurs programmes ou sous-programmes d’ordinateur ou de manière plus générale à tout élément d’un programme apte à mettre en oeuvre une fonction ou un ensemble de fonctions.
Plus généralement, le dispositif 100 peut comprendre une mémoire vive 103 (par exemple une mémoire RAM), une unité de traitement 102 équipée par exemple d'un processeur, et pilotée par un programme d'ordinateur Pg1 , représentatif des modules précédemment cités, stocké dans une mémoire morte 101 (par exemple une mémoire ROM ou un disque dur). A l'initialisation, les instructions de code du programme d'ordinateur sont par exemple chargées dans la mémoire vive 103 avant d'être exécutées par le processeur de l'unité de traitement 102. La mémoire vive 103 peut aussi contenir par exemple les informations de position déterminées, les informations de localisation et d’identification des objets d’intérêt, les informations de localisation et d’identification des parties du corps de l’utilisateur du dispositif et/ou des parties d’objets d’intérêts (comme celles d’individus, par exemple d’autres utilisateurs), les représentations graphiques virtuelles des objets d’intérêt, les représentations graphiques virtuelles des parties du corps des utilisateurs, la cartographie de l’environnement, etc.
La figure 7 illustre seulement une manière particulière, parmi plusieurs possibles, de réaliser le dispositif 100 afin qu’il effectue les étapes du procédé de génération de données d’enrichissement d’une vue d’un environnement d’au moins un utilisateur d’un dispositif de rendu tel que détaillé ci-dessus, en relation avec la figure 2, dans ses différents modes de réalisation. En effet, ces étapes peuvent être réalisées indifféremment sur une machine de calcul reprogrammable (un ordinateur PC, un processeur DSP ou un microcontrôleur) exécutant un programme comprenant une séquence d’instructions, ou sur une machine de calcul dédiée (par exemple un ensemble de portes logiques comme un FPGA ou un ASIC, ou tout autre module matériel) inclus dans le dispositif 100.
Dans le cas où le dispositif 100 est réalisé avec une machine de calcul reprogrammable, le programme correspondant (c'est-à-dire la séquence d’instructions) pourra être stocké dans un médium de stockage amovible (tel que par exemple une carte SD, une clé USB, un CD-ROM ou un DVD-ROM) ou non, ce médium de stockage étant lisible partiellement ou totalement par un ordinateur ou un processeur.
Les différents modes de réalisation ont été décrits ci-avant en relation avec un dispositif 100 intégré dans un dispositif de rendu et/ou un équipement serveur placé ou non à l’intérieur de l’environnement. L’invention n’est toutefois pas limitée à cet exemple, l’équipement serveur pouvant être distant, par exemple dans un réseau en nuages (de l’anglais, « Cloud Computing »), pourvu que des conditions de latence réduites soient garanties.
L’invention qui vient d’être présentée procure certains avantages dans au moins certains modes de réalisation. Elle peut aider à ’enrichir la vue d’un environnement affichée à un utilisateur d’un dispositif de rendu. Selon au moins un mode de réalisation, elle peut procurer à l’utilisateur une vision de la partie de l’environnement rendu à travers les obstacles, ce qui peut aider à une meilleure appréhension de l’environnement par l’utilisateur et peut aider à limiter les risques de collision et plus généralement d’accident.
Les exemples de réalisation détaillés ci-dessus concernent un environnement industriel. Bien sûr, l’invention ne se limite pas à ce cas particulier et s’applique plus généralement à tout environnement dans lequel des obstacles physiques viennent réduire la perception d’un utilisateur d’un dispositif de rendu affichant une vue d’une partie de cet environnement.

Claims

Revendications
1. Procédé de génération de données d’enrichissement d’au moins une vue d’au moins une partie d’un environnement (ENV) depuis au moins un premier point de vue, ladite vue étant destinée à être rendue au moins partiellement par au moins un dispositif de rendu, ledit procédé comprenant :
- une obtention (22) d’informations de localisation d’au moins un objet d’intérêt (Ol) dans ledit environnement (ENV),
- une génération (29) de données d’enrichissement (ENH) de ladite vue, au moins à partir des informations de localisation obtenues, lesdites données d’enrichissement comprenant au moins des données représentatives d’une position dudit objet d’intérêt par rapport audit premier point de vue et des données représentatives d’une partie occultée dudit objet d’intérêt.
2. Procédé selon la revendication précédente, caractérisé en ce que l’au moins un dispositif de rendu est un dispositif de supervision (ET, DISP) dudit environnement (ENV), et/ou une pluralité de dispositifs de rendu mobiles (HMD1-HMD4).
3. Procédé selon la revendication précédente, caractérisé en ce que au moins un dispositif de rendu parmi la pluralité de dispositifs de rendu mobiles (HMD1-HMD4) est un équipement terminal mobile dudit environnement (ENV) et comprend au moins une caméra configurée pour capturer des données vidéo depuis le premier point de vue, la vue rendue étant générée au moins partiellement à partir de données vidéo de ladite caméra.
4. Procédé selon une des revendications 2 ou 3, caractérisé en ce qu’il comprend en outre la génération des données d’enrichissement d’une représentation graphique virtuelle dudit environnement (ENV), destinée à être rendue par ledit dispositif de supervision (ET, DISP) dudit environnement (ENV).
5. Procédé selon l’une quelconque des revendications précédentes, caractérisé en ce qu’il comprend :
- une détection dudit au moins un objet d’intérêt (Ol) au moins dans ladite vue,
- une obtention d’information de description (DESC) dudit au moins un objet d’intérêt détecté, et
- une utilisation des informations de description pour générer au moins certaines des données d’enrichissement de la vue.
6. Procédé selon la revendication précédente, caractérisé en ce qu’il comprend : une obtention d’une représentation graphique de la partie occultée de l’objet d’intérêt (Ol) dans la vue de la partie de l’environnement rendue par le dispositif de rendu au moins en fonction de la position de l’objet d’intérêt (Ol) par rapport au point de vue et des informations de description et en ce que les données d’enrichissement de la partie occultée comprennent la représentation graphique obtenue.
7. Procédé selon l’une quelconque des revendications précédentes, caractérisé en ce que les informations de localisation dudit au moins un objet d’intérêt (Ol) sont obtenues d'au moins un capteur de position placé à proximité et/ou sur ledit au moins un objet.
8. Procédé selon l’une quelconque des revendications précédentes, caractérisé en ce qu’il comprend en outre : - l’obtention (20) d’une cartographie (MAP) d’au moins une partie de l’environnement (ENV), comprenant au moins des informations de localisation d’une pluralité d’objets physiques présents dans l’environnement ; et en ce que la génération (28) des données d’enrichissement comprend au moins l’insertion de données représentatives de positions desdits objets physiques par rapport audit premier point de vue.
9. Procédé selon la revendication 5, caractérisé en ce que la détection dudit au moins un objet d’intérêt (Ol) met en œuvre un module d’intelligence artificielle (MIA1 , MIA2) configuré pour utiliser au moins un modèle (MODI , MOD2) préalablement appris et associant lesdites données vidéo 3D à une information de position et de classification dudit objet d’intérêt.
10. Dispositif (100) de génération de données d’enrichissement d’au moins une vue d’au moins une partie d’un environnement (ENV) depuis au moins un premier point de vue, ladite vue étant destinée à être rendue au moins partiellement par au moins un dispositif de rendu, ledit dispositif étant configuré pour mettre en œuvre :
- une obtention d’informations de localisation d’au moins un objet d’intérêt (Ol) dans ledit environnement (ENV),
- une génération de données d’enrichissement (ENH) de ladite vue, au moins à partir des informations de localisation obtenues, lesdites données d’enrichissement comprenant au moins des données représentatives d’une position dudit objet d’intérêt par rapport audit premier point de vue et des données représentatives d’une partie occultée dudit objet d’intérêt.
11. Dispositif (100) de génération de données d’enrichissement selon la revendication précédente, caractérisé en ce que l’au moins un dispositif de rendu est un dispositif de supervision (ET, DISP) dudit environnement (ENV),_et/ou une pluralité de dispositifs de rendu mobiles (HMD1-HMD4).
12. Dispositif (100) de génération de données d’enrichissement selon la revendication précédente, caractérisé en ce qu’il est en outre configuré pour générer des données enrichissement d’une représentation graphique virtuelle dudit environnement (ENV), destinée à être rendue par ledit dispositif de supervision (ET, DISP) dudit environnement (ENV).
13. Equipement serveur (ES) connecté par l’intermédiaire d’un réseau de communication à au moins un dispositif de rendu (ET, DISP, HMD1-HMD4) adapté à produire un rendu au moins partiel d’une vue d’au moins un environnement depuis au moins un premier point de vue, caractérisé en ce qu’il comprend un dispositif (100) de génération de données d’enrichissement selon une quelconque des revendications 10 à 12.
14. Equipement serveur (ES) selon la revendication précédente, caractérisé en ce qu’il comprend un module (JUM) configuré pour générer une représentation graphique virtuelle de l’environnement (ENV) destinée à être rendue par ledit dispositif de supervision (ET, DISP) dudit environnement (ENV).
15. Système (S) de supervision d’un environnement (ENV), caractérisé en ce qu’il comprend au moins un dispositif de rendu (ET, DISP, HMD1-HMD4) adapté à produire un rendu au moins partiel d’une vue de l’environnement depuis au moins un premier point de vue, au moins un capteur configuré pour collecter au moins une information de localisation d’au moins un objet d’intérêt présent dans l’environnement et un équipement serveur (ES) selon une des revendications 13 ou 14.
16. Système (S) de supervision selon la revendication précédente, caractérisé en ce que ledit au moins un dispositif de rendu est un dispositif de rendu mobile muni d’une étiquette électronique (TAG), et en ce que ledit système (S) de supervision comprend en outre au moins un dispositif de localisation (EMT) configuré pour mettre en œuvre : une réception d’un signal comprenant des informations d’identification en provenance de ladite étiquette électronique (TAG), une détermination d’une localisation de ladite étiquette électronique (TAG) en fonction des informations d’identification reçues, et une transmission de ladite localisation audit dispositif (100) de génération de données d’enrichissement.
17. Programme d'ordinateur comprenant des instructions qui, lorsque ces instructions sont exécutées par un processeur, conduisent celui-ci à mettre en œuvre les étapes du procédé de génération de données d’enrichissement, selon une quelconque des revendications 1 à 9.
18. Support d’enregistrement lisible par un ordinateur sur lequel est enregistré un programme d’ordinateur selon la revendication 17.
EP24703325.1A 2023-02-02 2024-02-01 Procédé de génération de données d'enrichissement d'une vue d'un environnement, dispositif de rendu, équipement serveur, système et programme d'ordinateur correspondants Pending EP4659199A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR2301006A FR3145637A1 (fr) 2023-02-02 2023-02-02 Procédé de génération de données d’enrichissement d’une vue d’un environnement, dispositif de rendu, équipement serveur, système et programme d’ordinateur correspondants
PCT/EP2024/052481 WO2024160946A1 (fr) 2023-02-02 2024-02-01 Procédé de génération de données d'enrichissement d'une vue d'un environnement, dispositif de rendu, équipement serveur, système et programme d'ordinateur correspondants

Publications (1)

Publication Number Publication Date
EP4659199A1 true EP4659199A1 (fr) 2025-12-10

Family

ID=86099847

Family Applications (1)

Application Number Title Priority Date Filing Date
EP24703325.1A Pending EP4659199A1 (fr) 2023-02-02 2024-02-01 Procédé de génération de données d'enrichissement d'une vue d'un environnement, dispositif de rendu, équipement serveur, système et programme d'ordinateur correspondants

Country Status (3)

Country Link
EP (1) EP4659199A1 (fr)
FR (1) FR3145637A1 (fr)
WO (1) WO2024160946A1 (fr)

Family Cites Families (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US10902678B2 (en) * 2018-09-06 2021-01-26 Curious Company, LLC Display of hidden information

Also Published As

Publication number Publication date
FR3145637A1 (fr) 2024-08-09
WO2024160946A1 (fr) 2024-08-08

Similar Documents

Publication Publication Date Title
Cao et al. Mobile augmented reality: User interfaces, frameworks, and intelligence
US12073054B2 (en) Managing virtual collisions between moving virtual objects
US9390561B2 (en) Personal holographic billboard
WO2021068356A1 (fr) Procédé et système d'interaction coopérative basée sur une distance entre l'utilisateur et une pièce exposée pour un musée de réalité augmentée
US9098871B2 (en) Method and system for automatically managing an electronic shopping list
WO2019079806A1 (fr) Gestion de propriétés d'affichage de contenu
KR20230003646A (ko) 클라우드 기반 증강 현실
US10909767B1 (en) Focal and interaction driven content replacement into augmented reality
CA2942652A1 (fr) Systeme de simulation tridimensionnelle virtuelle propre a engendrer un environnement virtuel reunissant une pluralite d'utilisateurs et procede associe
CN103793473A (zh) 保存增强现实
US12614348B2 (en) Incremental scanning for custom landmarkers
Rajpurohit et al. A review on visual positioning system
US9449340B2 (en) Method and system for managing an electronic shopping list with gestures
CN115421623A (zh) 页面信息处理与商品信息交互方法、装置、设备及介质
EP4659199A1 (fr) Procédé de génération de données d'enrichissement d'une vue d'un environnement, dispositif de rendu, équipement serveur, système et programme d'ordinateur correspondants
WO2024069534A1 (fr) Présentation de contenu de réalité étendue adaptative dans de multiples environnements physiques
US11295269B2 (en) Cognitive retail facing
Girgis Deep learning to assist visually impaired individuals with visual exploration
Gupta et al. 24 An Investigative Study of
NL2014682B1 (en) Method of simulating conversation between a person and an object, a related computer program, computer system and memory means.
Al Delail Augmented Reality and Inertial Tracking for Indoor Localization in Smart Mobile Devices

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20250711

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR