EP4699132A1 - Procede d'evaluation d'une prediction d'un resultat d'une propriete d'une molecule, et dispositif associe - Google Patents
Procede d'evaluation d'une prediction d'un resultat d'une propriete d'une molecule, et dispositif associeInfo
- Publication number
- EP4699132A1 EP4699132A1 EP24725556.5A EP24725556A EP4699132A1 EP 4699132 A1 EP4699132 A1 EP 4699132A1 EP 24725556 A EP24725556 A EP 24725556A EP 4699132 A1 EP4699132 A1 EP 4699132A1
- Authority
- EP
- European Patent Office
- Prior art keywords
- subset
- molecules
- prediction
- property
- result
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G16—INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
- G16C—COMPUTATIONAL CHEMISTRY; CHEMOINFORMATICS; COMPUTATIONAL MATERIALS SCIENCE
- G16C20/00—Chemoinformatics, i.e. ICT specially adapted for the handling of physicochemical or structural data of chemical particles, elements, compounds or mixtures
- G16C20/30—Prediction of properties of chemical compounds, compositions or mixtures
-
- G—PHYSICS
- G16—INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
- G16C—COMPUTATIONAL CHEMISTRY; CHEMOINFORMATICS; COMPUTATIONAL MATERIALS SCIENCE
- G16C20/00—Chemoinformatics, i.e. ICT specially adapted for the handling of physicochemical or structural data of chemical particles, elements, compounds or mixtures
- G16C20/70—Machine learning, data mining or chemometrics
Landscapes
- Engineering & Computer Science (AREA)
- Chemical & Material Sciences (AREA)
- Theoretical Computer Science (AREA)
- Computing Systems (AREA)
- Bioinformatics & Computational Biology (AREA)
- Bioinformatics & Cheminformatics (AREA)
- Life Sciences & Earth Sciences (AREA)
- Crystallography & Structural Chemistry (AREA)
- Data Mining & Analysis (AREA)
- Software Systems (AREA)
- Medical Informatics (AREA)
- General Health & Medical Sciences (AREA)
- Evolutionary Computation (AREA)
- Databases & Information Systems (AREA)
- Health & Medical Sciences (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Artificial Intelligence (AREA)
- Management, Administration, Business Operations System, And Electronic Commerce (AREA)
Abstract
L'invention concerne un procédé d'évaluation d'une prédiction d'un résultat d'une propriété d'une molécule dite prédite, la propriété étant une parmi la génotoxicité, la mutagénicité et la cancérogénicité, le procédé comprenant les étapes suivantes : obtention (S100) de la prédiction du résultat de la propriété de la molécule prédite, la prédiction étant déterminée par un modèle à partir d'un premier sous-ensemble d'un ensemble de molécules; détermination (S200) d'au moins deux valeurs parmi une valeur représentative d'une cohérence, pour la propriété, des résultats des molécules du sous-ensemble avec ladite prédiction; une valeur représentative d'une cosimilarité des molécules au sein du sous- ensemble; et une valeur représentative d'une capacité du modèle à prédire le résultat de la propriété de la molécule prédite; et détermination (S300), par un algorithme d'inférence à logique floue, d'une valeur représentative de la fiabilité de la prédiction du résultat de propriété de la molécule prédite.
Description
Description
Titre de l'invention : Procédé d'évaluation d'une prédiction d'un résultat d'une propriété d'une molécule, et dispositif associé
Domaine Technique
[0001] La présente invention appartient au domaine général des molécules chimiques. Elle concerne plus particulièrement un procédé d'évaluation d'un résultat d'au moins une propriété d'une molécule, la au moins une propriété étant une parmi la génotoxicité, la mutagénicité et la cancérogénicité. Elle concerne également un dispositif électronique configuré pour mettre en oeuvre un tel procédé.
[0002] L'invention a ainsi une application privilégiée mais non limitative dans la prédiction de la génotoxicité, de la mutagénicité et/ou de la cancérogénicité des molécules organiques ou inorganiques constituants de très nombreux matériaux utilisés industriellement, comme par exemple les matériaux composites, les colles, les vernis, les peintures, les matériaux énergétiques pour la propulsion spatiale
Technique antérieure
[0003] L'entrée en vigueur en 2007 du règlement européen REACH (acronyme de « Registration Evaluation Autorisation of Chemicals ») impose aux industriels de l'Espace Économique Européen qui fabriquent, importent ou utilisent des substances chimiques dans leur activité en quantité supérieure à 1 tonne par an d'enregistrer au niveau européen ces substances. Il s'agit, par ce biais, de recenser, d'évaluer et de contrôler toutes les substances chimiques fabriquées, importées ou mises sur le marché européen. Ce règlement a vocation à fournir à l'Union Européenne des moyens juridiques et techniques pour garantir un haut niveau de protection contre les risques liés aux substances chimiques. Il concerne toutes les substances chimiques, qu'il s'agisse de matériaux inertes (ex. additifs, stabilisants, plastifiants, colles, etc.) ou énergétiques, voire hautement énergétiques.
[0004] Il existe donc un besoin pour les industriels, afin de se conformer notamment à ce règlement, de disposer de techniques permettant d'identifier les effets biologiques et/ou toxicologiques que peut produire une substance chimique sur l'Homme ou sur l'environnement, et plus généralement d'identifier ses propriétés en termes de génotoxicité, mutagénicité et/ou cancérogénicité.
[0005] La génotoxicité est particulièrement importante puisqu'elle permet d'évaluer le risque cancérogène et mutagène de la substance, entraînant possiblement son classement en tant que « Cancérigène, Mutagène et Reprotoxique » (CMR). Le développement et la sélection de substances non CMR est donc une forte préoccupation pour les industriels qui souhaitent éviter
de voir leur substance fortement menacée par les mesures de restriction imposés par application du règlement REACH.
[0006] Des techniques in vitro ou in vivo existent, mais elles sont généralement longues, complexes à mettre en oeuvre et très coûteuses en termes de ressources, de réactifs et de méthodes de détection.
[0007] Il existe par ailleurs d'autres techniques dites in silico qui s'appuient pour prédire les propriétés d'une substance chimique sur des outils informatiques (ex. modèles informatiques, moyens de calculs informatisés).
[0008] Ces techniques in silico présentent l'avantage de réduire le nombre d'animaux nécessaires à l'expérimentation toxicologique, mais également les coûts relatifs à l'implémentation de stratégies de test. Les techniques in silico les plus courantes utilisent des « relations structure-activité quantitatives » (aussi appelées QSAR pour Quantitative Structure Activity Relationship en anglais), qui sont des algorithmes (ou de façon équivalente des programmes) établissant une prédiction quantitative des effets d'une variation de la structure moléculaire d'une substance chimique sur l'activité biologique. Ainsi ces algorithmes permettent par exemple de déterminer une relation entre une structure moléculaire et des propriétés en termes de mutagénicité.
[0009] L'activité biologique traduite par les QSAR est basée sur des résultats expérimentaux et est propre à un test donné (par exemple le test d'Ames), corrélé typiquement aux exigences définies par le règlement REACH et/ou encore par l'OECD/OCDE (Organization for the Economie Cooperation and Development).
[0010] Des alternatives à l'utilisation de QSAR existent, comme la méthode d'apprentissage supervisée ExtraTrees ("extremely randomized trees") qui permet de construire un ensemble d'arbres de décision, ou l'algorithme RMoS.
[0011] Cependant, l'utilisation de ces techniques in silico pose soit le problème de la fiabilité des modèles, soit le problème relatif à une interprétation correcte des prédictions. En outre, même si un certain modèle a des performances globales montrant une justesse de la prédiction supérieure à un certain seuil, il n'en reste pas moins que ce modèle peut avoir des variations locales significatives en termes de performance.
[0012] Il existe donc un besoin d'évaluer ces techniques in silico à l'aide de mesures décrivant la fiabilité d'une prédiction.
Exposé de l'invention
[0013] La présente invention a pour objectif de remédier à tout ou partie des inconvénients de l'art antérieur, notamment ceux exposés ci-avant, en proposant une solution qui permette d'évaluer la fiabilité d'une prédiction d'un résultat d'une propriété d'une molécule.
[0014] À cet effet, et selon un premier aspect, l'invention concerne un procédé d'évaluation d'une prédiction d'au moins une propriété d'une molécule dite prédite, la au moins une propriété étant une parmi la génotoxicité, la mutagénicité et la cancérogénicité. Le procédé selon l'invention comprend les étapes suivantes, mises en oeuvre par un dispositif électronique :
- obtention de la prédiction du résultat de la au moins une propriété de la molécule prédite, la prédiction étant déterminée par un modèle à partir d'un premier sous- ensemble d'un ensemble de molécules, chacune des molécules du premier sous- ensemble ayant, pour la au moins une propriété, un résultat déterminé de manière expérimentale, les molécules du premier sous-ensemble ayant une mesure de similarité avec la molécule prédite supérieure à un seuil prédéterminé ;
- détermination d'au moins deux valeurs parmi une valeur représentative d'une cohérence, pour la au moins une propriété, des résultats des molécules d'un deuxième sous- ensemble avec ladite prédiction ; une valeur représentative d'une cosimilarité des molécules au sein du deuxième sous-ensemble ; et une valeur représentative d'une capacité du modèle à prédire le résultat de la au moins une propriété de la molécule prédite ;
- détermination, par un algorithme d'inférence à logique floue, d'une valeur représentative de la fiabilité de la prédiction du résultat de la au moins une propriété de la molécule prédite, l'algorithme d'inférence à logique floue prenant en entrée les valeurs déterminées.
[0015] Plus particulièrement, la présente invention permet de déterminer un domaine d'applicabilité pour ce modèle prédictif, c'est-à-dire de déterminer, dans l'espace chimique, les régions de cet espace chimique où les prédictions du modèle sont fiables, et les régions où les prédictions ne sont pas fiables. Ce domaine d'applicabilité est défini par la valeur représentative d'une cohérence, la valeur représentative d'une cosimilarité et la valeur représentative d'une capacité du modèle à prédire un résultat. La limite du domaine d'applicabilité est déterminée à l'aide de cette valeur représentative de la fiabilité de la prédiction, qui est par exemple comprise dans l'intervalle [0 ; 10].
[0016] L'invention offre ainsi un outil permettant la mise en place des stratégies et des prises de décision en se fondant sur une analyse du domaine d'applicabilité du modèle, afin d'accroitre l'efficacité et la pertinence de l'utilisation de ce modèle prédictif. De cette manière, la présente invention permet à un industriel de maitriser le risque lié à l'utilisation d'un modèle donné.
[0017] Aucune limitation n'est attachée à la nature de la molécule prédite considérée. Il s'agit par exemple ici d'une molécule hautement énergétique (ou HEM). Toutefois cet exemple n'est donné qu'à titre illustratif et l'invention s'applique à tout type de molécules.
[0018] De manière générale, on considère que les étapes d'un procédé ne doivent pas être interprétées comme étant liées à une notion de succession temporelle.
[0019] Dans des modes particuliers de mise en œuvre, les premier et deuxième sous-ensembles sont identiques. En variante, le deuxième sous-ensemble est un sous-ensemble du premier sous- ensemble.
[0020] Dans des modes particuliers de mise en œuvre, le procédé d'évaluation peut comporter en outre l'une ou plusieurs des caractéristiques suivantes, prises isolément ou selon toutes les combinaisons techniquement possibles.
[0021] Dans des modes particuliers de mise en œuvre, la valeur représentative de la cohérence, pour la au moins une propriété, des résultats des molécules du deuxième sous-ensemble avec ladite prédiction est déterminée en fonction de
avec n7 le nombre de molécules du deuxième sous-ensemble ayant, pour la au moins une propriété, un résultat identique à la prédiction, et K le nombre de molécules du deuxième sous-ensemble.
[0022] Dans des modes particuliers de mise en œuvre, la valeur représentative de la cosimilarité des molécules au sein du deuxième sous-ensemble est déterminée en fonction de ^=i-y K(M0 i) avec S(MOLi) une valeur représentative de la similarité d'une molécule du deuxième sous- ensemble avec la molécule prédite et K le nombre de molécules du deuxième sous-ensemble.
[0023] Dans des modes particuliers de mise en œuvre, la valeur représentative de la capacité est
déterminée en fonction de , avec M un nombre de molécules d'au moins une partie du deuxième sous-ensemble), et avec M' le nombre de molécules de la moins une partie ayant, pour la au moins une propriété, un résultat prédit identique au résultat déterminé de manière expérimentale.
[0024] Dans des modes particuliers de mise en œuvre, la cohérence des résultats des molécules, la cosimilarité des molécules au sein du deuxième sous-ensemble, la capacité du modèle à prédire le résultat, et la fiabilité de la prédiction du résultat définissent des variables d'entrées ou de sortie, chaque variable d'entrées ou de sortie étant définie par un ensemble d'au moins une fonction d'appartenance, la au moins une fonction d'appartenance représentant un degré d'appartenance entre un terme linguistique caractérisant un état possible d'une variable d'entrées ou de sortie, et entre une plage de valeur de ladite variable d'entrées ou de sortie, et le procédé comprend en outre l'obtention, par le système d'inférence à logique floue, desdits ensembles d'au moins une fonction d'appartenance.
[0025] Dans des modes particuliers de mise en œuvre, les fonctions d'appartenance de l'ensemble définissant la cohérence des résultats, de l'ensemble définissant la capacité du modèle, et de l'ensemble définissant la fiabilité de la prédiction sont des fonctions de forme triangulaire, et les
fonctions d'appartenance de l'ensemble définissant la cosimilarité des molécules au sein du deuxième sous-ensemble sont des fonctions de forme trapézoïdale.
[0026] Dans des modes particuliers de mise en oeuvre, le procédé comprend en outre l'obtention d'une base de règles, chaque règle définissant une relation entre un état possible d'au moins une variable parmi la cohérence des résultats, la cosimilarité au sein du deuxième sous-ensemble et la capacité du modèle, et entre un état possible de la fiabilité de la prédiction, les états possibles étant caractérisés par un terme linguistique.
[0027] Dans des modes particuliers de mise en oeuvre, le procédé comprend en outre la défuzzification d'un degré d'appartenance de la fiabilité de la prédiction, de sorte à obtenir une valeur numérique représentative de ladite fiabilité, la défuzzification étant mise en oeuvre par application d'une méthode parmi le centre de la surface, le centre de la surface modifié, le centre des sommes, le centre du maximum ou la moyenne des maxima.
[0028] Selon un deuxième aspect, l'invention concerne un dispositif électronique configuré pour évaluer une prédiction d'un résultat d'au moins une propriété d'une molécule prédite, la au moins une propriété étant une parmi la génotoxicité, la mutagénicité et la cancérogénicité, le dispositif comprenant :
- un module d'obtention de la prédiction du résultat de la au moins une propriété de la molécule prédite, la prédiction étant déterminée par un modèle à partir d'un premier sous-ensemble d'un ensemble de molécules, chacune des molécules du premier sous- ensemble ayant, pour la au moins une propriété, un résultat déterminé de manière expérimentale, les molécules du premier sous-ensemble ayant une mesure de similarité avec la molécule prédite supérieure à un seuil prédéterminé ;
- un module de détermination d'au moins deux valeurs parmi une valeur représentative d'une cohérence, pour la au moins une propriété, des résultats des molécules d'un deuxième sous-ensemble avec ladite prédiction ; une valeur représentative d'une cosimilarité des molécules au sein du deuxième sous-ensemble ; et une valeur représentative d'une capacité du modèle à prédire le résultat de la au moins une propriété de la molécule prédite ;
- un module d'évaluation configuré pour déterminer, par un algorithme d'inférence à logique floue, une valeur représentative de la fiabilité de la prédiction du résultat de la au moins une propriété de la molécule prédite, l'algorithme d'inférence à logique floue prenant en entrée les valeurs déterminées.
[0029] Selon un troisième aspect, l'invention concerne un programme d'ordinateur comportant des instructions pour la mise en oeuvre d'un procédé d'évaluation d'une prédiction d'un résultat selon l'invention, lorsque ledit programme est exécuté par un processeur.
[0030] Selon un quatrième aspect, l'invention concerne un support d'enregistrement lisible par un ordinateur sur lequel est enregistré le programme d'ordinateur selon l'invention.
Brève description des dessins
[0031] D'autres caractéristiques et avantages de la présente invention ressortiront de la description faite ci-dessous, en référence aux dessins annexés qui en illustrent un exemple de réalisation dépourvu de tout caractère limitatif. Sur les figures :
[0032] [Fig.l] la figure 1 représente schématiquement un mode particulier de mise en oeuvre d'un dispositif électronique d'évaluation d'une prédiction tel que proposé ;
[0033] [Fig. ] la figure 2 représente schématiquement un exemple d'architecture matérielle du dispositif électronique de la [Fig.l] ;
[0034] [Fig.3] la figure 3 représente, sous forme d'ordinogramme, un mode particulier de mise en oeuvre d'un procédé d'évaluation d'une prédiction du résultat d'une propriété d'une molécule tel que proposé, mis en oeuvre dans un système comprenant le dispositif électronique de la [Fig.l] ;
[0035] [Fig.4] la figure 4 représente, un exemple d'ensembles de fonctions d'appartenance pour les variables d'entrées et de sortie de l'algorithme d'inférence à logique floue ;
[0036] [Fig.5] la figure 5 est une représentation graphique d'un taux d'erreur de la prédiction en fonction d'une valeur de fiabilité.
Description des modes de réalisation
[0037] La figure 1 représente schématiquement un mode particulier de mise en oeuvre d'un dispositif électronique d'évaluation d'une prédiction tel que proposé.
[0038] La figure 2 représente schématiquement un exemple d'architecture matérielle d'un dispositif électronique 10 d'évaluation d'une prédiction.
[0039] Tel qu'illustré par la figure 2, le dispositif électronique 10 d'évaluation d'une prédiction dispose de l'architecture matérielle d'un ordinateur. Ainsi, le dispositif électronique 10 comporte, notamment, un processeur 1, une mémoire vive 2, une mémoire morte 3 et une mémoire non volatile 4. Il comporte en outre un module de communication 5.
[0040] La mémoire morte 3 du dispositif électronique 10 constitue un support d'enregistrement tel que proposé, lisible par le processeur 1 et sur lequel est enregistré un programme d'ordinateur PROG conforme à l'invention, comportant des instructions pour l'exécution d'étapes du procédé d'évaluation d'une prédiction tel que proposé ci-après. Le programme PROG définit des modules fonctionnels du dispositif tels que représentés à la figure 1, qui s'appuient ou commandent les éléments matériels 1 à 5 cités précédemment, et qui comprennent notamment :
- un module MODJDBT d'obtention de la prédiction PRED du résultat d'au moins une propriété d'une molécule dite prédite, la prédiction étant déterminée par un modèle à partir d'un premier sous-ensemble SSENS d'un ensemble de molécules, chacune des molécules du premier sous-ensemble ayant, pour la au moins une propriété, un résultat déterminé de manière expérimentale, les molécules du premier sous-ensemble ayant une mesure de similarité avec la molécule prédite supérieure à un seuil prédéterminé ;
- un module MOD_DET de détermination d'au moins deux valeurs parmi une valeur représentative d'une cohérence, pour la au moins une propriété, des résultats des molécules d'un deuxième sous-ensemble avec ladite prédiction ; d'une valeur représentative d'une cosimilarité des molécules au sein du deuxième sous-ensemble ; et d'une valeur représentative d'une capacité du modèle à prédire le résultat de la au moins une propriété de la molécule prédite ; et,
- un module MOD_EVAL d'évaluation configuré pour déterminer, par un algorithme d'inférence à logique floue, une valeur représentative de la fiabilité de la prédiction du résultat de la au moins une propriété de la molécule prédite, l'algorithme d'inférence à logique floue prenant en entrée les au moins deux valeurs déterminées.
[0041] Dans des modes particuliers de mise en oeuvre, le module MOD_EVAL d'évaluation comprend notamment les sous-modules suivants :
- un sous-module MOD_FUZZ de fuzzification configuré pour :
- obtenir une pluralité d'ensembles d'au moins une fonction d'appartenance, chaque ensemble de la pluralité définissant un critère parmi la cohérence des résultats, la cosimilarité des molécules au sein du deuxième sous-ensemble, et la capacité du modèle à prédire le résultat de la au moins une propriété de la molécule prédite,
- obtenir une valeur représentative de la cohérence des résultats des molécules du deuxième sous-ensemble avec ladite prédiction ; une valeur représentative d'une cosimilarité des molécules au sein du deuxième sous-ensemble ; et une valeur représentative d'une capacité du modèle à prédire le résultat de la au moins une propriété de la molécule prédite ; et,
- associer les au moins deux valeurs obtenues à une fonction d'appartenance de la pluralité d'ensembles.
- un sous-module MOD_INF configuré pour appliquer une pluralité de règles floues. Plus précisément, ce sous-module MOD_INF applique chaque règle floue de sorte à obtenir une conclusion partielle correspondant à un degré d'appartenance avec un terme linguistique caractérisant un état possible de la fiabilité de la prédiction de la molécule prédite. Cette conclusion partielle est ensuite agrégée aux autres conclusions partielles issues de l'application des autres règles de la pluralité.
- un sous-module MOD_DEF de défuzzification configuré pour déterminer, à partir des conclusions partielles agrégées, une valeur représentative de la fiabilité de la prédiction de la molécule prédite.
[0042] Par ailleurs, le dispositif électronique 10 peut encore comporter d'autres modules, notamment pour mettre en oeuvre des modes particuliers du procédé d'évaluation d'une prédiction, comme cela est décrit plus en détail ultérieurement.
[0043] Le module de communication 5 permet notamment au dispositif électronique 10 d'évaluation d'une prédiction d'accéder ou de télécharger le contenu d'une ou plusieurs bases de données répertoriant chacune une pluralité de molécules.
[0044] Les bases de données peuvent être hébergées sur des serveurs distants ou au moins une partie de leur contenu peut être stockée dans une mémoire du dispositif électronique 10 d'évaluation d'une prédiction (par exemple dans sa mémoire non volatile 4). Le module de communication 5 du dispositif électronique 10 d'évaluation d'une prédiction lui permet d'y accéder ou de le télécharger via un réseau de télécommunications, ou encore d'obtenir ces bases de données via un support d'enregistrement tel qu'une clé USB (Universal Serial Bus) ou un CDROM. Ils peuvent comprendre à cet effet un port USB, une carte réseau, une interface WIFI (Wireless Fidelity), etc.
[0045] La figure 3 représente, sous forme d'ordinogramme, un mode particulier de mise en oeuvre d'un procédé d'évaluation d'une prédiction du résultat d'une propriété d'une molécule tel que proposé, mis en oeuvre dans un système comprenant le dispositif électronique de la [Fig.l].
[0046] Tel qu'illustré par la figure 3, le procédé d'évaluation d'une prédiction PRED d'une propriété d'une molécule MOLP comprend une première étape S100 d'obtention de la prédiction PRED du résultat de la propriété de la molécule prédite MOLP. Cette prédiction est déterminée par un modèle à partir d'un premier sous-ensemble SSENS issu d'un ensemble ENS de molécules, chacune des molécules du premier sous-ensemble SSENS ayant, pour cette propriété, un résultat déterminé de manière expérimentale, et les molécules du premier sous-ensemble SSENS ayant une mesure de similarité avec la molécule prédite MOLP supérieure à un seuil THR1 prédéterminé. Cette première étape S100 est mise en oeuvre par le module MODJDBT d'obtention de la prédiction du dispositif électronique 10.
[0047] La similarité entre deux molécules encodées sous la forme de vecteurs A et B est une notion bien connue en soi, et qui est par exemple quantifiable au travers de différentes mesures et critères tels que :
- la distance Euclidienne dEuc (A, B) = iSJZi G4[i] — B [i]) , avec n le nombre d'éléments des vecteurs A et B,
- la distance de Manhattan
- I indice distance
^Jac ( fî) — 1 ijac ( , B),
- la mesure de distance définie dans le brevet FR3068047 Bl : = y Oety > 0 Oety = 0 sinon
où x désigne la valeur d'un élément d'un vecteur représentant une première molécule et y la valeur d'un élément d'un vecteur représentant une deuxième molécule (dite courante).
[0048] La première étape S100 d'obtention comprend les sous-étapes SI 10, S120 et S130. Lors de l'étape SI 10, la molécule dont la propriété doit être prédite est obtenue. Puis, lors d'une étape S120, un premier sous-ensemble SSENS de référence est obtenu à partir d'une base de données comprenant un ensemble ENS de molécules associées chacune au résultat expérimental atteint par cette molécule à un test biologique donné.
[0049] Ce test biologique correspond par exemple au test d'Ames (un test biologique permettant de déterminer le potentiel mutagène d'une substance chimique), le test HPRT, le test glycophorine A, le test des comètes (ou « Cornet assay » , le test d'échange des chromatides soeurs, le test d'évaluation d'aberrations chromosomiques, le test des micronoyaux, etc.
[0050] Par souci de simplification, on considère par la suite le cas où une unique base de données est accédée qui comprend un ensemble ENS de molécules et les résultats expérimentaux atteints par ces molécules à un test biologique donné. Cependant, l'invention s'applique également dans le cas où plusieurs bases de données sont considérées.
[0051] De telles bases de données sont connues en soi et ne sont pas décrites en détail ici. Chaque base de données correspond par exemple à un test biologique réalisé sur les molécules qu'elle contient. Des exemples de ces bases de données sont notamment décrits dans le document de DJ. Kirkland et al., intitulé « Testing strategies in mutagenicity and genetic toxicology : an appraisal of the guidelines of the European Scientific Committe for Cosmetics and Non-Food Products for the evaluation of hair dyes », Mutât. Res. Toxicol. Environ. Mutagen, vol. 588, pages 88-105, 2005, ou dans le document de V. Thybaud et al. intitulé « Strategy for genotoxicity testing : hazard identification and risk assessment in relation to in vitro testing », Mutât. Res. Toxicol. Environ. Mutagen, vol. 627, pages 41-58, 2007.
[0052] Comme mentionné précédemment, la base de données peut être hébergée sur des serveurs distants ou son contenu peut être stocké dans une mémoire du dispositif électronique 10 d'évaluation d'une prédiction (par exemple dans sa mémoire non volatile 4). Le module de communication 5 du dispositif électronique 10 d'évaluation d'une prédiction lui permet d'y accéder, ou de télécharger son contenu via un réseau de télécommunications, ou encore d'obtenir le contenu de ces bases de données via un support d'enregistrement tel qu'une clé USB (Universal Serial Bus) ou un CDROM. Ils peuvent comprendre à cet effet un port USB, une carte réseau, une interface WIFI (Wireless Fidelity), etc.
[0053] Il importe, à ce stade, de noter que les algorithmes de prédiction du résultat d'une propriété évoqués ci-après se basent sur une recherche de similarité structurale entre l'ensemble ENS des molécules répertoriées dans la base de données et la molécule dont on cherche à prédire le résultat d'une propriété. Cette recherche par similarité s'appuie sur le postulat que toutes les molécules de l'ensemble ENS qui sont analogues à la molécule considérée possèdent des propriétés similaires.
[0054] Dans des modes particuliers de mise en oeuvre, cette étape S120 de détermination d'un premier sous-ensemble SSENS de référence est mise en oeuvre de la manière suivante :
- détermination, pour chacune des molécules de l'ensemble ENS des molécules de la base de données, d'une mesure représentative de la similarité avec la molécule dont on souhaite prédire les propriétés ; et,
- sélection, à partir de l'ensemble ENS, d'un premier sous-ensemble SSENS de molécules qui présentent une similarité minimale avec la molécule dont on souhaite prédire les propriétés.
[0055] De manière alternative, cette étape S120 de détermination d'un premier sous-ensemble SSENS de référence est mise en oeuvre en identifiant un sous-ensemble de molécules de la base de données à partir d'un autre ensemble connu de molécules, par exemple un ensemble de molécules hautement énergétiques utilisées par un industriel, et à sélectionner les molécules de la base de données qui présentent une similarité minimale avec chacune des molécules de l'ensemble connu.
[0056] De manière alternative, cette étape d'obtention S120 d'un premier sous-ensemble SSENS de référence est une étape de détermination d'un sous-ensemble SSENS de référence mise en oeuvre conformément au procédé faisant l'objet du brevet FR3068047B1.
[0057] Selon ce mode particulier de mise en oeuvre, l'étape S120 d'obtention est alors mise en oeuvre au travers d'un procédé itératif de détermination d'un premier sous-ensemble SSENS de molécules de référence. Ce procédé itératif de détermination comprend une étape d'initialisation associant, à une molécule courante, une valeur d'un descripteur de molécules prédéterminé
associée à la molécule obtenue lors de l'étape SI 10, et lors de chaque itération du procédé de détermination :
- une étape d'évaluation, pour chaque molécule d'une base de données comprenant une pluralité ENS de molécules associée chacune à une valeur dudit descripteur, d'une mesure de similarité globale entre la valeur du descripteur associée à ladite molécule et la valeur du descripteur associée à la molécule courante ;
- une étape de sélection de molécules de la base de données ayant une mesure de similarité globale supérieure à un seuil prédéterminé (e.g., 0,85), les molécules sélectionnées étant ajoutées au sous-ensemble SSENS de référence ; et
- une étape de mise à jour de la valeur du descripteur associée à la molécule courante à partir des valeurs des descripteurs associées à au moins une partie des molécules appartenant au premier sous-ensemble SSENS de référence.
[0058] Ainsi, cette étape S120 de détermination d'un premier sous-ensemble SSENS est basée sur un processus itératif de recherche de similarité, initialisé en premier lieu avec la molécule dont on cherche à prédire les propriétés. Puis, au fil des itérations, des molécules «virtuelles» sont construites à partir des descripteurs des molécules sélectionnées dans la base de données initiale au cours des itérations, et une nouvelle recherche de similarité est réalisée à partir de ces molécules virtuelles.
[0059] Le procédé d'évaluation d'une prédiction d'une propriété comprend en outre une étape S130 au cours de laquelle le résultat d'au moins une propriété de la molécule obtenue lors de l'étape SI 10 est prédit à partir du premier sous-ensemble obtenu lors de l'étape S120. Autrement dit, une technique de prédiction est utilisée qui considère les résultats expérimentaux atteints par les molécules du premier sous-ensemble SSENS de référence et répertoriés dans la base de données dont le premier sous-ensemble SSENS a été extrait.
[0060] Aucune limitation n'est attachée à la technique de prédiction mise en oeuvre. Il peut notamment s'agir un algorithme de type QSAR précédemment évoqué, qui permet d'établir une prédiction quantitative des effets d'une variation de la structure moléculaire d'une substance chimique sur l'activité biologique. En variante, une technique d'apprentissage (e.g., un réseau de neurones, une machine à vecteurs de support, une méthode basée sur les arbres de décision, une méthode des k plus proches voisins, etc.), ou une technique de prédiction par analyse de composantes principales (ou PCA pour « Principal Component Analysis ») ou par moindres carrés partiels (ou « Partial Least Squares ») peuvent être considérés.
[0061] À l'issue de l'étape S130, une prédiction d'au moins une propriété biologique de la molécule obtenue lors de l'étape SI 10 est obtenue.
[0062] Dans les modes de mise en oeuvre jusqu'à présent décrits, les étapes SI 10, 120 et S130 sont réalisées par le dispositif électronique 10 d'évaluation d'une prédiction. En variante, ces étapes
sont mises en œuvre par un dispositif électronique de prédiction distinct du dispositif électronique 10 d'évaluation d'une prédiction, et l'étape S100 d'obtention de la prédiction PRED de la au moins une propriété de la molécule prédite MOLP est une étape de réception, en provenance du dispositif électronique de prédiction, de cette prédiction. Selon cette variante, le dispositif électronique 10 d'évaluation d'une prédiction est également configuré pour accéder au premier sous-ensemble SSENS de référence déterminé par le dispositif de prédiction lors de l'étape S120 d'obtention d'un premier sous-ensemble SSENS.
[0063] Le procédé d'évaluation d'une prédiction comprend en outre une étape S200 au cours de laquelle plusieurs métriques représentatives du premier sous-ensemble SSENS de référence ayant servi à prédire la propriété de la molécule prédite MOLP sont calculées. Plus précisément, au moins deux valeurs parmi les suivantes sont déterminées lors de cette étape : une valeur représentative d'une cohérence des propriétés des molécules d'un deuxième sous-ensemble avec ladite prédiction (PRED) ; une valeur représentative d'une cosimilarité au sein du deuxième sous- ensemble ; et une valeur représentative d'une capacité du modèle à prédire la au moins une propriété de la molécule prédite (MOLP). Cette étape S200 est mise en œuvre par le module MOD_DET de détermination du dispositif électronique 10.
[0064] Valeur représentative d'une cohérence des propriétés des molécules d'un sous-ensemble avec ladite prédiction
[0065] On rappelle à ce stade que les molécules du premier sous-ensemble SSENS ont un certain degré de similarité avec la molécule prédite (MOLP), et que les résultats des propriétés des molécules de ce premier sous-ensemble SSENS ont été déterminés de manière expérimentale (et n'ont donc pas été prédit) , et qu'ils constituent donc à ce titre une vérité-terrain (« ground truth » selon la terminologie anglo-saxonne).
[0066] Dans cet exemple, le deuxième sous-ensemble est constitué des K molécules du premier sous-ensemble les plus similaires avec la molécule dont on souhaite prédire les propriétés.
[0067] La cohérence des propriétés des molécules du deuxième sous-ensemble avec ladite prédiction PRED est déterminée par une analyse statistique des résultats des propriétés des K molécules du deuxième sous-ensemble. Plus précisément, il est déterminé si la prédiction PRED réalisée lors de l'étape S130 est cohérente avec les résultats expérimentaux de ces K molécules.
[0068] De manière intuitive, s'il est par exemple prédit qu'une molécule donnée n'est pas génotoxique, et qu'une majorité des résultats expérimentaux des K molécules du deuxième sous- ensemble reflète effectivement qu'elles ne sont pas génotoxiques, alors cela signifie que ladite prédiction PRED est cohérente avec les résultats des propriétés des molécules du deuxième sous-ensemble. A l'inverse, s'il est prédit qu'une molécule donnée n'est pas génotoxique, mais qu'une majorité des résultats expérimentaux de ces K molécules reflète qu'elles sont
génotoxiques, alors cela signifie que ladite prédiction PRED n'est pas cohérente avec les résultats des propriétés des molécules du deuxième sous-ensemble.
[0069] Ainsi, dans des modes particuliers de mise en oeuvre, la valeur Ic représentative de la cohérence, pour la au moins une propriété, des résultats des molécules du deuxième sous- ensemble avec ladite prédiction PRED est déterminée de sorte que
[0070] avec rij le nombre de molécules du deuxième sous-ensemble ayant, pour une propriété donnée (par exemple la génotoxicité), un résultat identique (par exemple positif) à celui prédit lors de l'étape S120, et K le nombre de molécules du deuxième sous-ensemble. La valeur lc est représentative du fait que si le résultat de la prédiction est cohérent avec les résultats expérimentaux des K molécules les plus similaires avec la molécule dont on souhaite prédire les propriétés, alors il y a une probabilité plus importante de voir la prédiction vérifiée.
[0071] Les inventeurs ont observé que l'évolution de la valeur lc représentative de la cohérence est corrélée avec celle du taux d'erreur œc où
[0072] Plus précisément, une valeur lc élevée est représentative d'un taux d'erreur faible. Ainsi, pour une valeur lc = 1, le taux d'erreur est égal à 2.4%. Pour une valeur lc comprise dans l'intervalle [0.9 ; 1[, le taux d'erreur œc est de 7.4%. Cependant, pour une valeur lc faible (c'est- à-dire comprise dans l'intervalle [0 ; 0.1[), le taux d'erreur œc correspondant est de 35.5%. Aussi, ces résultats montrent que la valeur lc est peu sensible à la détection d'une prédiction peu fiable.
[0073] Valeur I représentative d'une cosimilarité au sein d'un sous-ensemble
[0074] La cosimilarité des molécules au sein du deuxième sous-ensemble vise à caractériser la concentration de molécules similaires entre-elles dans ce deuxième sous-ensemble. Ce critère est avantageux puisqu'il permet de discriminer le cas où le sous-ensemble ne comprend pas de suffisamment d'exemples probants pour prédire le résultat d'une propriété. Or sans un nombre suffisant d'exemples probants, le résultat d'une propriété donnée d'une molécule ne pourra pas être correctement prédit.
[0075] Ainsi, dans des modes particuliers de mise en oeuvre, la valeur Id représentative de la cosimilarité au sein du deuxième sous-ensemble est déterminée de sorte que
avec S MOLi) une valeur représentative de la similarité d'une molécule (MOLj) du deuxième sous-ensemble avec la molécule prédite (MOLP) et K le nombre de molécules du deuxième sous- ensemble.
[0076] Une mesure de similarité S(MOLi) se définit comme un nombre réel compris entre 0 et 1, prenant notamment par convention la valeur 0 lorsque les deux molécules sont considérées comme totalement différentes (i.e. non similaires), et la valeur 1 lorsqu'elles sont considérées comme totalement identiques (i.e. similaires). Des valeurs intermédiaires peuvent être considérées, représentant des nuances de similarité entre ces deux extrêmes.
[0077] Pour se conformer à cette définition, une fonction dite de conversion est appliquée à l'une quelconque des mesures de distance précédemment évoquées, et qui convertit la mesure de distance d en une valeur comprise dans l'intervalle [0,1].
[0078] La fonction de conversion f appliquée vérifie par exemple (d) = exp (^2) , avec d la distance à convertir, et o un nombre réel prédéterminé.
[0079] Les inventeurs ont observé qu'une valeur Id représentative d'une cosimilarité inférieure à 0.70 traduit une incapacité à prédire correctement la molécule cible possédant une telle valeur d'indice, puisque dans ce cas, le taux d'erreur œc est égal à 1. Autrement dit, une valeur faible signifie qu'il n'existe pas, dans l'environnement moléculaire proche de la molécule cible, de composés lui étant fortement ou moyennement similaires, ce qui est problématique lors de la phase d'apprentissage du modèle prédictif.
[0080] Lorsque la valeur Id représentative d'une cosimilarité est comprise dans l'intervalle [0.65 ; 0.70 [, le taux d'erreur est égale à 1. Par contre, une valeur ld représentative d'une cosimilarité strictement supérieure à 0.70 traduit une capacité à fournir une prédiction correcte, puisque le taux d'erreur est inférieur ou égal à 0.15.
[0081] Capacité du modèle à prédire le résultat de la propriété de la molécule prédite
[0082] La capacité du modèle à prédire le résultat de la propriété de la molécule prédite correspond, par exemple, à déterminer la capacité du modèle à prédire la toxicité d'une substance chimique possédant une certaine structure moléculaire. Ce critère vise d'une part à discriminer les prédictions réalisées par le modèle lorsque ce dernier présente de faibles performances en termes de prédiction de résultats pour des molécules de la famille moléculaire à laquelle appartient la molécule prédite, et d'autre part à fiabiliser celles réalisées par le modèle lorsque ce dernier présente de bonnes performances en termes de prédiction de résultats pour des molécules de la famille moléculaire à laquelle appartient la molécule prédite.
[0083] Ce critère vise à accorder une confiance aux prédictions réalisées par le modèle lorsqu'il présente de bonnes performances dans la prédiction de la famille moléculaire à laquelle appartient la molécule prédite.
[0084] La détermination de cette capacité du modèle à prédire un résultat d'une propriété d'une molécule similaire à la molécule prédite est mise en oeuvre de la manière suivante :
- lors d'une première étape, au moins une partie des molécules du premier sous-ensemble SSENS est sélectionnée, de sorte à obtenir un deuxième sous-ensemble. Selon une implémentation particulière, les molécules sélectionnées lors de cette première étape correspondent aux K molécules les plus similaires avec la molécule prédite, avec K=20 par exemple. En variante, les molécules sélectionnées lors de cette première étape correspondent aux molécules ayant une mesure de similarité avec la molécule prédite supérieure à un seuil THR2 prédéterminé, par exemple tel que THR2 > THR1. Enfin, dans un cas particulier, toutes les molécules du premier sous-ensemble SSENS sont sélectionnées, et les premier et deuxième sous-ensembles sont alors identiques ;
- puis, pour chacune des molécules sélectionnées lors de cette première étape, un résultat est prédit, par le modèle, pour la propriété considérée ;
- enfin, une valeur IP représentative de la capacité est déterminée telle que :
avec M le nombre de molécules du deuxième sous-ensemble, et M' le nombre de molécules du deuxième sous-ensemble qui ont, pour la au moins une propriété, un résultat prédit identique au résultat obtenu de manière expérimentale.
[0085] Les inventeurs ont observé que lorsque la valeur IP représentative de la capacité est élevée, le modèle est en mesure de prédire correctement la famille moléculaire de la substance à prédire et donc que l'on peut avoir confiance en la capacité dudit modèle à prédire cette dernière.
[0086] Plus précisément, lorsque la valeur IP est strictement inférieure à 0.5, le taux d'erreur œc varie entre 75 et 90% d'erreur. Et lorsque la valeur IP est égale à 1, le taux d'erreur œc est d'environ 4.3 %.
[0087] De retour à la [Fig. 3], le procédé selon l'invention comprend en outre une étape S300 de détermination, par un algorithme d'inférence à logique floue, d'une valeur VALF représentative de la fiabilité de la prédiction du résultat de la au moins une propriété de la molécule prédite MOLP. Cette étape S300 est mise en oeuvre par le module MOD_EVAL d'évaluation du résultat de la prédiction du dispositif électronique 10.
[0088] L'algorithme d'inférence à logique floue prend en entrée les valeurs déterminées lors de l'étape S200. Sa particularité est de pouvoir déterminer une valeur numérique de sortie en fonction d'un ensemble de règles formulées en langage naturel.
[0089] L'utilisation d'un algorithme d'inférence à logique floue pour évaluer la prédiction du résultat d'une propriété moléculaire offre l'avantage de raisonner non pas sur des variables numériques, mais sur des variables linguistiques, qui permettent de manipuler des connaissances en langage naturel.
[0090] Par ailleurs, lorsque ce système est utilisé dans un contexte réglementaire par des industriels souhaitant justifier les effets biologiques et/ou toxicologiques que peut produire une substance chimique sur l'Homme ou sur l'environnement, l'utilisation d'un algorithme d'inférence à logique floue facilite, pour l'homme, l'interprétation des conclusions qui peut être réalisé par analyse/lecture de la base de règles.
[0091] Concernant les principes génériques sur la logique floue, l'homme du métier peut se référer à l'ouvrage "La logique floue, « Que sais-je ? » n° 2702, Bernadette Bouchon-Meunier, 2007".
[0092] Cette étape S300 de détermination, par un algorithme d'inférence à logique floue, d'une valeur VALF représentative de la fiabilité de la prédiction du résultat comprend les sous-étapes S310, S320 et S330.
[0093] L'étape référencée S310 correspond à une étape de fuzzification des entrées de l'algorithme d'inférence à logique floue. Cette étape S310 est mise en oeuvre par le sous-module MOD_FUZZ de fuzzification du dispositif électronique 10, et a pour objectif de convertir une donnée numérique d'entrée (par exemple une valeur représentative de la capacité du système à prédire un résultat égale à 0.75) en une ou plusieurs variables linguistiques auxquelles sont associés des degrés d'appartenance (par exemple « élevé = 0.5 » et « moyennement élevé = 0.5 »). Pour cela, l'algorithme s'appuie sur des fonctions dites d'appartenance qui sont obtenues par le dispositif électronique 10 lors de cette étape S310.
[0094] Une fonction d'appartenance représente un degré d'appartenance entre un terme linguistique caractérisant un état possible d'une variable d'entrées ou de sortie de l'algorithme, et entre une plage de valeur de ladite variable d'entrées ou de sortie.
[0095] Les fonctions d'appartenance standard classiquement utilisées sont de type A (forme triangulaire), de type fl (forme trapézoïdale), de type singleton (forme de ligne verticale), de type Sigmoïde (forme sinusoïdale) ou de type gaussien (forme de cloche).
[0096] La figure 4 représente, un exemple d'ensembles de fonctions d'appartenance pour les variables d'entrées et de sortie de l'algorithme d'inférence à logique floue.
[0097] Dans cet exemple, la variable d'entrée correspondant à la cohérence des résultats prend les états suivants : « minimal », « très faible », « faible », « moyen », « moyennement élevé »,
« élevé », « très élevé », « extrême » et « maximal ». Les états « minimal » et « maximal » sont représentés par une fonction d'appartenance de type n, et les autres états par une fonction d'appartenance de type A. Ainsi, pour l'état « moyen », la fonction d'appartenance associée est égale à 0 sur l'intervalle [0 ; 0.4] U [0.6 ; 1], est croissante de 0 à 1 sur l'intervalle [0.4 ; 0.5], et est décroissante de 1 à 0 sur l'intervalle [0.5 ; 0.6].
[0098] La variable d'entrée correspondant à la capacité du modèle à prédire un résultat prend les états suivants : « très faible », « faible », « moyen », « moyennement élevé », « élevé », « très élevé » et « maximal ». Les états « très faible » et « maximal » sont représentés par une fonction d'appartenance de type fl, et les autres états par une fonction d'appartenance de type A.
[0099] La variable d'entrée correspondant à la cosimilarité des molécules au sein du sous-ensemble (SSENS) prend les états suivants : « faible » et « élevé ». Ces états sont représentés par une fonction d'appartenance de type fl. Ainsi, la fonction d'appartenance associée à l'état « faible » est égale à 1 sur l'intervalle [0 ; 0.7] et à 0 sur l'intervalle [0,7 ; 1]. Et la fonction associée à l'état « élevé » est égale à 0 sur l'intervalle [0 ; 0.7] et à 1 sur l'intervalle [0,7 ; 1].
[0100] Enfin, la variable de sortie du modèle correspond à la fiabilité de prédiction du résultat, et prend les états suivants : « minimal », « très faible », « faible », «moyennement faible », « moyen », « moyennement élevé », « élevé », « très élevé », « » et « maximal ». Les états « très très faible » et « maximal » sont représentés par une fonction d'appartenance de type fl, et les autres états par une fonction d'appartenance de type A.
[0101] De retour à la Figure 3, l'étape S310 de fuzzification d'une entrée comprend également l'obtention d'au moins deux valeurs parmi les suivantes : une valeur représentative de la cohérence des résultats des molécules du sous-ensemble avec ladite prédiction ; une valeur représentative d'une cosimilarité des molécules au sein du sous-ensemble ; et une valeur représentative d'une capacité du modèle à prédire le résultat de la au moins une propriété de la molécule prédite. Par exemple, la valeur Ip représentative de la cohérence des résultats Ip = 0.45, une valeur Id représentative d'une cosimilarité Id = 0.65, et la valeur Ip représentative de la capacité du système à prédire un résultat Ip = 0.75.
[0102] Ces valeurs numériques sont ensuite « fuzzifiées », c'est-à-dire que chacune d'elles est redéfinie comme un ensemble de données floues, chaque donnée floue correspondant à un degré d'appartenance à un état possible de la variable d'entrée correspondante.
[0103] Ainsi, en considérant les fonctions d'appartenances représentées par la Figure 4A, la valeur représentative de la capacité du système à prédire un résultat Ip = 0.75 est redéfinie de la manière suivante : « capacité élevée = 0.5 » ; « capacité moyennement élevé = 0.5 » ; et les autres états possibles de la capacité sont instanciés à une valeur nulle.
[0104] Le procédé d'évaluation comprend en outre une étape S320 d'inférence correspondant à l'application d'une « base de règles ». Cette étape S320 est mise en oeuvre par le sous-module MOD_INF d'inférence du dispositif électronique 10.
[0105] Une règle d'une base de règles est typiquement de la forme « Si condition Alors conclusion ». La condition (également appelée prémisse de la règle) est définie par une relation de la forme « variable d'entrée est état possible » ou par une combinaison de relations i = 1. . n de la forme « variable d'entrée [i] est état possible de ia variable d'entrée [i]» à l'aide d'opérateurs de logique floue. La conclusion (également appelée conséquence de la règle) est définie par une relation de la forme « variable de sortie est état possible ».
[0106] Les opérateurs flous typiquement utilisés dans ce cadre sont :
- l'opérateur « et » qui est défini tel que X et Y = min(X K) avec mi ( ) l'opérateur de minimalité ; ou X et Y = X. Y avec . l'opérateur produit ;
- l'opérateur « ou » qui est défini tel que X ou Y = max(X K) avec max ) l'opérateur de maximalité ; ou X ou Y = 1 — (1 — a). (1 — b); et,
- l'opérateur « non ».
[0107] Lors de la mise en oeuvre de cette invention, une base de règles de 59 règles a été définie. Ces règles formalisent le comportement de la valeur (VALF) représentative de la fiabilité de la prédiction en fonction de la valeur représentative d'une cohérence, la valeur représentative d'une cosimilarité et la valeur représentative d'une capacité du modèle à réaliser une prédiction.
[0108] Comme préalablement décrit, l'évolution de la valeur représentative d'une cohérence et l'évolution de la valeur représentative d'une capacité du modèle à réaliser une prédiction sont corrélées à l'évolution du taux d'erreur. Par contre, la valeur représentative d'une cosimilarité possède quant-à-elle un profil de type « valeur seuil ». ce comportement est par exemple traduit par la règle suivante : « Si ia valeur représentative d'une cosimiiarité est faible, alors ia valeur représentative de ia fiabilité de ia prédiction est minimal».
[0109] « Si ia valeur représentative d'une capacité du modèle à réaliser une prédiction est faible et ia valeur représentative d'une cohérence est très faible, alors ia valeur représentative de ia fiabilité de ia prédiction est très très faible ». est un autre exemple de règle définie dans ce cadre.
[0110] Lors de cette étape S320 d'inférence, chaque règle floue de la base de règle est appliquée, de de sorte à obtenir une conclusion partielle correspondant à un degré d'appartenance avec un terme linguistique caractérisant un état possible de la fiabilité de la prédiction de la molécule prédite.
[OUI] L'étape S330 correspond à une étape de défuzzification. Cette étape est mise en oeuvre par le sous-module MOD_DEF du dispositif électronique 10, et se déroule en deux temps.
[0112] Tout d'abord, lorsque la base de règles considérée utilise plusieurs règles d'inférences qui ont une même conclusion (par exemple, plusieurs règles d'inférences ont pour conclusion « fiabilité de prédiction du résultat est moyennement faible »), l'application de ces règles permet d'obtenir des conclusions qui doivent être combinées. C'est classiquement l'opérateur « ou » défini tel que XouY = max X,' K) qui est utilisé pour mettre en oeuvre cette étape.
[0113] Ainsi si trois règles donnent les conclusions partielles suivantes « fiabilité de prédiction du résultat est moyennement faible » à 20% ; « Habilité de prédiction du résultat est moyennement faible » à 45% ; « fiabilité de prédiction du résultat est moyennement faible » à 10%, la combinaison de ces règles à l'aide de l'opérateur « ou » précédemment défini permet d'obtenir la conclusion « fiabilité de prédiction du résultat est moyennement faible » à 45%.
[0114] Cette étape permet d'obtenir un unique degré d'appartenance pour au moins une partie des états possibles de la variable de sortie.
[0115] Puis, dans un second temps, les degrés d'appartenance associés aux différents états possibles de la variable de sortie sont « défuzzifiés », c'est-à-dire qu'ils sont convertis en une unique valeur numérique VALF représentative de la fiabilité de la prédiction du résultat de la au moins une propriété de la molécule prédite MOLP est déterminée.
[0116] Différentes méthodes peuvent être utilisées pour mettre en oeuvre cette étape, telles que le centre de la surface, le centre de la surface modifié, le centre des sommes, le centre du maximum ou la moyenne des maxima.
[0117] La figure 5 est une représentation graphique d'un taux d'erreur de la prédiction en fonction d'une valeur de fiabilité.
[0118] Au travers de cette figure 5, il est constaté une très bonne corrélation (0.9) entre le taux d'erreur et la valeur de fiabilité, lorsqu'on considère l'ensemble des points. On remarque que plus la valeur de fiabilité est élevée et moins il y a de probabilité que la prédiction soit fausse. Une valeur de fiabilité comprise entre 0 et 1 exclus correspond à un taux d'erreur de 88%. Tandis qu'une valeur de fiabilité comprise entre 9 et 10 exclus correspond à un taux d'erreur de 2%.
[0119] La méthode selon l'invention est donc avantageuse puisque contrairement à d'autres méthodes, comme les probabilités de classe, les classes de valeurs les plus faibles correspondent à un taux d'erreur élevé et les classes de valeurs les plus élevées correspondent à un taux d'erreur très faible.
[0120] Jusqu'à présent, l'invention a été décrite dans le cas où seul une prédiction est mise en oeuvre. Il n'en reste pas moins que l'invention reste également applicable dans le cas où plusieurs prédictions sont effectuées à partir d'une ou plusieurs bases de données stockant les résultats de plusieurs tests biologiques.
Claims
[Revendication 1] Procédé d'évaluation d'une prédiction (PRED) d'un résultat d'au moins une propriété d'une molécule (MOLP) dite prédite, la au moins une propriété étant une parmi la génotoxicité, la mutagénicité et la cancérogénicité, le procédé comprenant les étapes suivantes, mises en oeuvre par un dispositif électronique (10) :
- obtention (S100) de la prédiction (PRED) du résultat de la au moins une propriété de la molécule prédite, la prédiction (PRED) étant déterminée par un modèle à partir d'un premier sous-ensemble (SSENS) d'un ensemble (ENS) de molécules, chacune des molécules du premier sous-ensemble (SSENS) ayant, pour la au moins une propriété, un résultat déterminé de manière expérimentale, les molécules du premier sous-ensemble (SSENS) ayant une mesure de similarité avec la molécule prédite supérieure à un seuil prédéterminé ;
- détermination (S200) d'au moins deux valeurs parmi une valeur représentative d'une cohérence, pour la au moins une propriété, des résultats des molécules d'un deuxième sous-ensemble avec ladite prédiction (PRED) ; une valeur représentative d'une cosimilarité des molécules au sein du deuxième sous-ensemble ; une valeur représentative d'une capacité du modèle à prédire le résultat de la au moins une propriété de la molécule prédite (MOLP), le deuxième sous-ensemble correspondant au premier sous-ensemble ou à une portion du premier sous-ensemble ;
- détermination (S300), par un algorithme d'inférence à logique floue, d'une valeur (VALF) représentative de la fiabilité de la prédiction du résultat de la au moins une propriété de la molécule prédite (MOLP), l'algorithme d'inférence à logique floue prenant en entrée les valeurs déterminées.
[Revendication 2] Procédé d'évaluation selon la revendication 1, dans lequel la valeur représentative de la cohérence, pour la au moins une propriété, des résultats des molécules x , , , nj du deuxieme sous-ensemble avec ladite prediction (PRED) est determinee en fonction de — , K avec nj le nombre de molécules du deuxième sous-ensemble ayant, pour la au moins une propriété, un résultat identique à la prédiction (PRED), et K le nombre de molécules du deuxième sous-ensemble.
[Revendication 3] Procédé d'évaluation selon la revendication 1 ou 2, dans lequel la valeur représentative de la cosimilarité des molécules au sein du deuxième sous-ensemble est déterminée en fonction avec s(M0Li) une valeur représentative de la
similarité d'une molécule MOLt ) du deuxième sous-ensemble avec la molécule prédite (MOLP) et K le nombre de molécules du deuxième sous-ensemble.
[Revendication 4] Procédé d'évaluation selon l'une quelconque des revendications 1 à 3, dans
M' lequel la valeur representative de la capacité est determinee en fonction de — , avec M un nombre de molécules d'au moins une partie dudit deuxième sous-ensemble, et avec M' le nombre de molécules de la moins une partie ayant, pour la au moins une propriété, un résultat prédit identique au résultat déterminé de manière expérimentale.
[Revendication 5] Procédé d'évaluation selon l'une quelconque des revendications 1 à 4, dans lequel la cohérence des résultats des molécules, la cosimilarité des molécules au sein du deuxième sous-ensemble, la capacité du modèle à prédire le résultat, et la fiabilité de la prédiction (PRED) du résultat définissent des variables, chaque variable étant définie par un ensemble d'au moins une fonction d'appartenance, la au moins une fonction d'appartenance représentant un degré d'appartenance entre un terme linguistique caractérisant un état possible d'une variable, et entre une plage de valeur de ladite variable, le procédé comprenant en outre l'obtention (S310), par le système d'inférence à logique floue, desdits ensembles d'au moins une fonction d'appartenance.
[Revendication 6] Procédé d'évaluation selon la revendication 5, dans lequel les fonctions d'appartenance de l'ensemble définissant la cohérence des résultats, de l'ensemble définissant la capacité du modèle, et de l'ensemble définissant la fiabilité de la prédiction (PRED) sont des fonctions de forme triangulaire, et les fonctions d'appartenance de l'ensemble définissant la cosimilarité des molécules au sein du deuxième sous-ensemble sont des fonctions de forme trapézoïdale.
[Revendication 7] Procédé d'évaluation selon la revendication 5 ou 6, comprenant en outre l'obtention d'une base de règles, chaque règle définissant une relation entre un état possible d'au moins une variable parmi la cohérence des résultats, la cosimilarité au sein du deuxième sous-ensemble et la capacité du modèle, et entre un état possible de la fiabilité de la prédiction, les états possibles étant caractérisés par un terme linguistique.
[Revendication 8] Procédé d'évaluation selon l'une quelconque des revendications 5 à 7, dans lequel le procédé comprend en outre la défuzzification (S330) d'un degré d'appartenance de la fiabilité de la prédiction (PRED), de sorte à obtenir une valeur numérique représentative de ladite fiabilité, la défuzzification étant mise en oeuvre par application d'une méthode parmi le
centre de la surface, le centre de la surface modifié, le centre des sommes, le centre du maximum ou la moyenne des maxima.
[Revendication 9] Dispositif électronique (10) configuré pour évaluer une prédiction (PRED) d'un résultat d'au moins une propriété d'une molécule prédite (MOLP), la au moins une propriété étant une parmi la génotoxicité, la mutagénicité et la cancérogénicité, le dispositif comprenant :
- un module (MODJDBT) d'obtention de la prédiction du résultat de la au moins une propriété de la molécule prédite, la prédiction (PRED) étant déterminée par un modèle à partir d'un premier sous-ensemble (SSENS) d'un ensemble (ENS) de molécules, chacune des molécules du premier sous-ensemble (SSENS) ayant, pour la au moins une propriété, un résultat déterminé de manière expérimentale, les molécules du premier sous- ensemble (SSENS) ayant une mesure de similarité avec la molécule prédite (MOLP) supérieure à un seuil prédéterminé ;
- un module (MOD_DET) de détermination d'au moins deux valeurs parmi une valeur représentative d'une cohérence, pour la au moins une propriété, des résultats des molécules d'un deuxième sous-ensemble avec ladite prédiction (PRED) ; une valeur représentative d'une cosimilarité des molécules au sein du deuxième sous-ensemble ; et une valeur représentative d'une capacité du modèle à prédire le résultat de la au moins une propriété de la molécule prédite (MOLP), le deuxième sous-ensemble correspondant au premier sous-ensemble ou à une portion du premier sous-ensemble ;
- un module (MOD_EVAL) d'évaluation configuré pour déterminer, par un algorithme d'inférence à logique floue, une valeur représentative de la fiabilité de la prédiction du résultat de la au moins une propriété de la molécule prédite (MOLP), l'algorithme d'inférence à logique floue prenant en entrée les valeurs déterminées.
[Revendication 10] Programme d'ordinateur comprenant des instructions qui, lorsque le programme est exécuté par un ordinateur, conduisent celui-ci à mettre en oeuvre la méthode d'évaluation selon l'une quelconque des revendications 1 à 8.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR2303807A FR3147900A1 (fr) | 2023-04-17 | 2023-04-17 | Procédé d'évaluation d'une prédiction d'un résultat d'une propriété d'une molécule, et dispositif associé |
| PCT/FR2024/050497 WO2024218448A1 (fr) | 2023-04-17 | 2024-04-16 | Procede d'evaluation d'une prediction d'un resultat d'une propriete d'une molecule, et dispositif associe |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| EP4699132A1 true EP4699132A1 (fr) | 2026-02-25 |
Family
ID=87748289
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP24725556.5A Pending EP4699132A1 (fr) | 2023-04-17 | 2024-04-16 | Procede d'evaluation d'une prediction d'un resultat d'une propriete d'une molecule, et dispositif associe |
Country Status (3)
| Country | Link |
|---|---|
| EP (1) | EP4699132A1 (fr) |
| FR (1) | FR3147900A1 (fr) |
| WO (1) | WO2024218448A1 (fr) |
Families Citing this family (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN114090958B (zh) * | 2021-11-18 | 2026-02-06 | 深圳市气象局(深圳市气象台) | 一种临近预报效果评估方法、系统、终端以及存储介质 |
Family Cites Families (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| FR3068047B1 (fr) | 2017-06-22 | 2021-02-12 | Airbus Safran Launchers Sas | Procede et dispositif de selection d'un sous-ensemble de molecules destinees a etre utilisees pour predire au moins une propriete d'une structure moleculaire |
-
2023
- 2023-04-17 FR FR2303807A patent/FR3147900A1/fr active Pending
-
2024
- 2024-04-16 EP EP24725556.5A patent/EP4699132A1/fr active Pending
- 2024-04-16 WO PCT/FR2024/050497 patent/WO2024218448A1/fr not_active Ceased
Also Published As
| Publication number | Publication date |
|---|---|
| WO2024218448A1 (fr) | 2024-10-24 |
| FR3147900A1 (fr) | 2024-10-18 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| EP4189572B1 (fr) | Procede mis en oeuvre par ordinateur pour tester la cybersecurite d'un environnement cible | |
| FR3068047A1 (fr) | Procede et dispositif de selection d'un sous-ensemble de molecules destinees a etre utilisees pour predire au moins une propriete d'une structure moleculaire | |
| WO2024218448A1 (fr) | Procede d'evaluation d'une prediction d'un resultat d'une propriete d'une molecule, et dispositif associe | |
| EP3588301A1 (fr) | Determination automatique et auto-optimisee des parametres d'execution d'une application logicielle sur une plateforme de traitement de l'information | |
| Alabdulkarim et al. | Exploring Sentiment Analysis on Social Media Texts | |
| CN114519406B (zh) | 工业数据的分类方法及其模型训练方法、装置 | |
| EP1691319A1 (fr) | Procédé et dispositif de génération d'un arbre de classification permettant d'unifier les approches supervisées et non supervisées, produit programme d'ordinateur et moyen de stockage correspondants | |
| Kwan | Markov image with transfer learning for malware detection and classification | |
| Kulkarni et al. | Malware Detection Using Dynamic Graph Neural Networks | |
| CN114356744B (zh) | 基于机器学习的应用程序界面遍历方法及设备 | |
| EP2356591A1 (fr) | Procede de structuration d'une base de donnees d'objets | |
| CN121212143A (zh) | 舆情级别识别方法、装置、设备、存储介质及程序产品 | |
| FR3125346A1 (fr) | Procédé de détermination d’un degré d’exposition de données | |
| EP4300326A1 (fr) | Procédé d'appariement d'un ensemble à évaluer et d'une liste de référence, moteur d'appariement et programme d'ordinateur correspondants | |
| FR2851353A1 (fr) | Procede de classification hierarchique descendante de donnees multi-valuees | |
| WO2020165519A1 (fr) | Procédé de construction de signatures comportementales de logiciels | |
| WO2022135972A1 (fr) | Procede et dispositif de diagnostic d'anomalies | |
| Imani | Comparing Traditional Machine Learning and Advanced Gradient Boosting Techniques in Customer Churn Prediction: A Telecom Industry Case Study | |
| He et al. | Privacy-preserving categorization of mobile applications based on large-scale usage data | |
| EP1554687A2 (fr) | SystEme associatif flou de description d objets multimEdia | |
| Pukowski et al. | Investigating the Impact of Hard Samples on Accuracy Reveals In-class Data Imbalance | |
| Bozkuş et al. | Fake News Detection on Social Media Data using Community Notes with Machine Learning | |
| Joshi et al. | Genetic Algorithm Based Feature Optimization for Enhanced Darknet Traffic Analysis | |
| FR2865056A1 (fr) | Procede et dispositif de division d'une population d'individus pour predire des modalites d'un attribut cible donne | |
| Pol et al. | Vocal/Music Classification using Incremental Learning Approach |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: UNKNOWN |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE |
|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE |
|
| 17P | Request for examination filed |
Effective date: 20251017 |
|
| AK | Designated contracting states |
Kind code of ref document: A1 Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR |