EP4555517A1 - Verfahren zur klassifizierung physikalischer, chemischer und/oder physiologischer eigenschaften von molekülen - Google Patents

Verfahren zur klassifizierung physikalischer, chemischer und/oder physiologischer eigenschaften von molekülen

Info

Publication number
EP4555517A1
EP4555517A1 EP23742060.9A EP23742060A EP4555517A1 EP 4555517 A1 EP4555517 A1 EP 4555517A1 EP 23742060 A EP23742060 A EP 23742060A EP 4555517 A1 EP4555517 A1 EP 4555517A1
Authority
EP
European Patent Office
Prior art keywords
molecules
molecule
class
chemical
structural
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP23742060.9A
Other languages
English (en)
French (fr)
Inventor
Thilo BAUER
Doris SCHICKER
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Original Assignee
Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV filed Critical Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Publication of EP4555517A1 publication Critical patent/EP4555517A1/de
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16CCOMPUTATIONAL CHEMISTRY; CHEMOINFORMATICS; COMPUTATIONAL MATERIALS SCIENCE
    • G16C20/00Chemoinformatics, i.e. ICT specially adapted for the handling of physicochemical or structural data of chemical particles, elements, compounds or mixtures
    • G16C20/30Prediction of properties of chemical compounds, compositions or mixtures
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16CCOMPUTATIONAL CHEMISTRY; CHEMOINFORMATICS; COMPUTATIONAL MATERIALS SCIENCE
    • G16C20/00Chemoinformatics, i.e. ICT specially adapted for the handling of physicochemical or structural data of chemical particles, elements, compounds or mixtures
    • G16C20/70Machine learning, data mining or chemometrics

Definitions

  • the invention relates to a method for selecting molecules with a desired physical, chemical and/or physiological property from a group of molecules, wherein a classification according to a chemical, physical and/or physiological property of a molecule is carried out with the aid of a mathematical model.
  • This allows molecules with the desired property to be selected from the group of molecules.
  • an experimental confirmation is then carried out as to whether the molecules actually have the desired physical, chemical and/or physiological property.
  • Molecules have chemical, physical and physiological properties. While physical properties can be quantified by measuring underlying physical quantities, chemical properties can be quantified by measuring an underlying chemical quantity in the reaction of a molecule with another substance.
  • the physical properties of a molecule include, for example, the color of the molecule. Water solubility, on the other hand, is one of the chemical properties of a molecule.
  • Molecules also have physiological properties. This includes physical and chemical material properties in terms of perceptibility or impact on the environment. Examples of this are the smell and taste of a molecule.
  • Chemical, physical and physiological properties are of great interest for a wide range of applications.
  • Physiological properties describe properties of molecules that have effects on the organism of living beings. According to the invention, this includes properties such as taste or smell of molecules. Furthermore, according to the invention, this also means the classification of molecules into permitted and prohibited chemicals in cosmetics and personal care. This is regulated by the application authorization according to Articles Regulation, Annex II - Restricted Substances the Annex II of the European Chemicals Agency (ECHA).
  • ECHA European Chemicals Agency
  • the taste of molecules directly appeals to people's sense of taste and thus has a decisive influence on people's eating behavior and in particular which foods are perceived as pleasant or unpleasant. The taste caused by molecules is therefore particularly important in the food industry.
  • Smell is one of the five human senses and plays an important role in daily life.
  • the smell of food influences our eating behavior [1] and smells in threatening situations influence human memory of similar situations [2].
  • smells for humans they also play an important role in the economy, especially in the food industry. and cosmetics industry, where the development of new flavors and the identification of odor-active molecules are essential.
  • a predictive approach during molecular design is required to reduce the space of candidate molecules from virtually all to a promising range of structures.
  • Shang et al. studied different combinations of feature generation models and machine learning algorithms to predict the smell of molecules from ten possible descriptors. They applied the models in GC/O (gas chromatography analysis with olfactometric detection). With an accuracy of 97.08%, the Support Vector Machine (SVM) achieved the best results in previous feature selection with Boruta [15], but when aroma molecules were predicted that were not included in the model building, the accuracy dropped to 70% [6 ],
  • the models used features calculated using Dragon chemoinformatics software for odor prediction. These features are also reported by Snitz et al. used to predict the smell of odorant mixtures [5], Training a deep autoencoder [16] also enabled the extraction of features that can be used as an alternative to using features generated by Dragon. Tran et al. developed the DeepNose autoencoder to extract molecular features. DeepNose features performed equally well compared to Dragon features in predicting odor perceptions [3],
  • the invention provides a method for selecting molecules with a desired physical, chemical and/or physiological property from a group of molecules, comprising the steps
  • a group of O k molecules is provided by a user, where ke becomes N.
  • between 20 and 1000 molecules are provided, preferably between 20 and 800 molecules are provided, particularly preferably between 20 and 300 molecules are provided.
  • provided initially means that the structural formulas of the molecules are available and are therefore made available. This is possible, for example, by providing the molecules in the structural code SMILES, which encodes structural patterns as SMARTS [17, 18, 19], but there is also the possibility of having each of the molecules available as a substance at a later point in time for experimental confirmation.
  • the classification is selected from structure-based properties of molecules, in particular from the group containing smell, taste, color, toxicity, water solubility and permitted and not permitted chemicals in cosmetics and personal care.
  • the classification is a classification based on the smell of the molecules.
  • a classification includes several classes, for example the water solubility classification includes the classes hydrophilic and hydrophobic.
  • the toxicity classification includes the classes toxic and non-toxic.
  • the color classification can include classes of different colors, for example blue, red, yellow, green.
  • the odor classification preferably includes odors such as 'woody, resinous', 'floral', 'fruity, not lemony', 'medicinal', 'perfumed', 'light', 'heavy', 'sweet', 'aromatic', 'fragrant' ', 'disgusting' as classes.
  • the odor classification particularly preferably includes the odors 'woody, resinous', 'floral', 'fruity, not lemony', 'medicinal', 'perfumed' as classes.
  • a mathematical model for the classification provided by a user is provided.
  • the mathematical model has probabilities Gy that a structural pattern Fj of a molecule belongs to a class C or a molecule of a class C has a structural pattern Fj.
  • the mathematical model was previously trained using a training data set for the selected classification.
  • a training data set has 0/ molecules where it is known which class C, the classification they are assigned to, where 1, 1 G N.
  • a molecule can be assigned to several classes C. The creation of the mathematical model is explained later in the description.
  • a weighting function for the mathematical model is selected by a user.
  • a suitable weighting function a,j is selected from the group of statistical measures, such as tf-idf functions, normalization function, equally weighted function, tf and idf values are calculated based on the training data set and the formulas generally known to those skilled in the art [26],
  • the mathematical model has the following steps: a) determining and storing Fj structural patterns of the chemical structure of each of the Ok molecules assigned to the respective molecule, each being N; b) Assign the probability Gij to each structural pattern Fj of a molecule for each class C, and calculate the influence /y according to the formula for each structural pattern F, of a molecule for each class C,; c) Calculation of a point value P iik for each molecule Ok , using for each class C, whereby the influences /y of all structural patterns Fj contained in a molecule Ok are summed up for each class C; d) Assignment of each molecule to class C, with the highest point value P iik for the respective molecule;
  • step a) structural patterns Fj of the chemical structure of each of the Ok molecules are determined. These are stored assigned to the respective molecule. All structural patterns of the OK molecules are determined. Structural patterns that do not appear in the training data set are assigned an influence /y of zero and are therefore not taken into account in the process.
  • a probability Gij is assigned to each structural pattern Fj of a molecule for each class C.
  • the respective probability Gij is known from the mathematical model for each structural pattern Fj for a given classification.
  • the influence /,j is calculated according to the formula h,j — a i,j ' j,j (1) for each class C,. a if j corresponds to the previously selected weighting function.
  • the weighting function allows additional information about the relationship between structural pattern and class to be taken into account, such as selectivity and specificity using the tf-idf function.
  • a score P iik is obtained for each molecule O k according to the formula
  • Pi,k ⁇ iFjEO k h,j (?) for each class C, calculated.
  • the influences ,j of all structural patterns Fj contained in a molecule O k are summed up for each class C.
  • a point value P iik is calculated for a molecule for each class C of the classification.
  • the molecule is then assigned to class C, the classification that has the highest point value P iik for the respective molecule.
  • the molecule is therefore assigned to at least one class C.
  • the molecule is assigned to several classes. This happens when the highest point value P iik is the same for several classes.
  • the assignment is then made to classes C, for which the same highest point value P iik was determined.
  • this molecule is marked as unpredictable. This case can occur, for example, if a molecule consists entirely of structural patterns that do not appear in the training data set and were therefore assigned an influence of zero.
  • the mathematical model therefore makes it possible to assign the molecules to classes C, the classification.
  • the mathematical model is based on the assumption that each structural pattern has a certain influence on a class and that a structural pattern-class relationship exists.
  • the present invention thus enables the OK molecules to be sorted into the classification classes.
  • the mathematical model therefore makes a preselection of molecules that are included in the group of molecules provided and have the desired physical, chemical or physiological property.
  • the mathematical model for the classification of smell is applied and the molecules that are assigned to the class 'flowery' are then subjected to experimental confirmation. It is advantageous to start with the molecule that has the highest point value P iik in this class. Subsequently, further molecules in this class can be examined experimentally, these being advantageously arranged in a sequence according to descending point values P iik . In one embodiment, only the molecule with the highest score in a class is examined experimentally.
  • all molecules are experimentally examined whose point value P iik deviates from the highest point value P iik in this class by at most 50%, preferably at most 30%, particularly preferably at most 10%. In a further embodiment of the present invention, all molecules of a class of classification are examined experimentally.
  • the molecules Ok assigned to the classes of the classification are therefore displayed and/or output.
  • the molecules are displayed and/or output in such a way that the molecules are arranged in a class C in descending order according to their point value P iik , starting with the molecule with the largest point value P iik .
  • the associated point values P iik and/or the associated influences ,j and/or the associated structural pattern Fj are displayed and/or output.
  • the molecules that have been assigned to the class with the desired physical, chemical and/or physiological properties are then selected.
  • connection between at least one structural pattern Fj and a class C is further checked and/or identified by a user. This advantageously makes it possible to gain insight into the structural pattern-class relationship. Physical, chemical and/or physiological properties of molecules can thereby be traced back to specific structural patterns of the molecules.
  • the present invention thus enables a significant saving in personnel and technical effort, since all molecules Ok of a group provided no longer have to be examined experimentally in order to select at least one molecule of a certain class and thus with a certain physical, chemical or physiological property .
  • a selection of molecules is made and the subsequent experimental confirmation can be carried out specifically with this selection of molecules. This compares to the methods from the current state of the art Technology saves time and money. In addition, it is not necessary to have all molecules available as a substance for experimental studies, which saves additional costs.
  • a mathematical model which includes the probability G,j for defined structural patterns for defined classes C, a classification or a molecule of a class C has a structural pattern Fj.
  • the mathematical model is trained using a training data set for a selected classification, a training data set containing 0 / molecules of known class C being specified, where I, ie N.
  • the structural patterns of the molecules are known for the data set and which class of classification the respective molecules should be classified into.
  • a molecule can also be assigned to several classes.
  • the procedure for learning the mathematical model has the following steps: i. Determine and store Fj structural patterns of the chemical structure of each molecule associated with the respective molecule, j e N ; ii. Calculation of the probability Gy that a structural pattern Fj is one
  • step i the structural patterns Fj of each molecule are determined.
  • a structural pattern is a partial fragment of the chemical structure of the molecule. Not all structural components of the molecules necessarily have to be used, but a previous feature selection can be carried out using an algorithm or statistical values.
  • the determination of the structural pattern Fj of a molecule can be implemented using so-called fingerprint algorithms.
  • the state of the art fingerprint algorithm is, for example, the RDKit topology fingerprint [20, 21] known.
  • the Dragon software [22] and Graph Convolutional Neural Networks [23] are known for determining molecular structures.
  • a new method considers molecules as graphs and converts nodes and edges of the graph into a vector, which allows molecules to be represented purely based on structure [24],
  • the Fj structural patterns that are determined and stored in method step a) of the method according to the invention represent a selection from a larger number of structural patterns.
  • the selection can be carried out, for example, by an algorithm, an idf weighting or a tf-idf weighting, become.
  • An algorithm can, for example, select according to the minimum number of molecules that have a structural pattern or according to correlations between different structural patterns.
  • a probability G,j is then calculated that a structural pattern belongs to a class C.
  • the probability G,j is determined using the formula calculated.
  • a probability G,j is then calculated that a molecule of class C has a structural pattern Fj.
  • the probability Gy is determined using the formula calculated.
  • the present invention can be used to select molecules with a desired chemical, physical and/or physiological property from a group of molecules. Furthermore, the present invention can be used to identify the influence of structural patterns in molecules on at least one chemical, physical and/or physiological property of molecules.
  • the method according to the invention is used to determine the odor of a molecule or to select molecules that have a specific odor from a group of molecules.
  • the classification is smell and the classes are individual smells such as 'floral' and 'medicinal'.
  • the method according to the invention also offers an insight into the structural pattern-odor relationship. Since the method calculates an influence j for each structural pattern in the form of a quantitative value for each class and thus for each odor, by comparing these influences, structural patterns can be identified that appear to have a strong effect on a particular odor. The structural patterns can therefore also be arranged according to their influence on a specific smell.
  • Figure 1 shows a sequence of the method according to the invention
  • FIG. 2 shows results of the method according to the invention.
  • Figure 1 shows a sequence of the method according to the invention, which is described in more detail in exemplary embodiment 2.
  • Figure 2 shows results of the method according to the invention, in which a mathematical model was carried out with different weighting functions a, j and with and without selection of the structural patterns.
  • a mathematical model was trained using a group of 5 molecules for the classification of smell with the two classes 'floral' and 'medical'. This means that structural patterns F were determined for all molecules. The class affiliation(s) was known for each of the 5 molecules. With this information, the probabilities Gij for each structural pattern Fj were calculated.
  • Figure 1 are for the Training dataset listed the 5 molecules. The molecules are represented in the structural code SMILES, the structural patterns are coded as SMARTS. For the sake of clarity, the 3 structural patterns [CX4H3], [CX4], dccccd were shown as examples. Each of the 5 molecules was classified as 'floral' or 'medicinal'. Structural patterns with the value 1.0 in the table occur in the respective molecule and structural patterns with the value 0.0 do not occur in the respective molecule.
  • the probabilities Gij for each of the 3 structural patterns were calculated from the training data set for the 'floral' class and for the 'medical' class.
  • the CCOCOCC molecule had the highest score. Due to the manageable number of molecules that were assigned to the 'flowery' class, all three molecules were examined experimentally below. Substances, each consisting of the 3 molecules, were examined by a person trained in the perception of smells and it was found that all three molecules could also be assigned to the 'flowery' class in the experimental confirmation.
  • Embodiment 2 Validation of mathematical model
  • the method according to the invention was carried out using a group of 64 molecules.
  • the 64 molecules were assigned to the smell classification with the classes 'floral', 'medicinal', 'woody, resinous', 'disgusting', 'fruity, not lemony' and 'perfumed'.
  • To train the model 63 molecules of the 64 molecules were used, and their class affiliation was known.
  • a mathematical model for smell classification was created.
  • the class of the remaining molecule was then calculated using the mathematical model. For this purpose, different weighting functions a,j and/or different selections of structural patterns were used.
  • the following table in Figure 2 shows the results.
  • the accuracy when estimating the smell of a molecule is 21.35%.
  • the method according to the invention can classify the smell of molecules with at least twice the accuracy than if it is simply estimated.
  • the results of the classification via the mathematical model were most accurate when a,j was a tf-idf weighting. The accuracy here was over 65%. When calculating the accuracy, all molecules that could not be classified were considered 'wrong'.
  • Example 3 Approval for use of chemicals in the cosmetics industry and personal care
  • the method according to the invention was used to predict the approval of chemicals in cosmetics and care.
  • a data set consisting of 800 molecules (400 with and 400 without application permission) and 500,047 structural fragments was used to train the mathematical model.
  • Fj) was able to replicate with an accuracy of over 85% whether molecules in the training data set have application permission.
  • the application prediction was made using the mathematical model for 200 additional molecules (100 with, 100 without application permission).
  • the results were compared with FCM and Articles Regulation, Annex 11 - Restricted Substances the Annex 11 of the European Chemicals Agency (ECHA). Only 11 molecules were incorrectly classified as permitted. Overall, the accuracy was 81%.
  • the method according to the invention can therefore significantly save labor and personnel costs in the synthesis of chemicals for cosmetics and personal care by concentrating more on predicted permitted substances.

Landscapes

  • Engineering & Computer Science (AREA)
  • Chemical & Material Sciences (AREA)
  • Theoretical Computer Science (AREA)
  • Computing Systems (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Crystallography & Structural Chemistry (AREA)
  • Data Mining & Analysis (AREA)
  • Software Systems (AREA)
  • Medical Informatics (AREA)
  • General Health & Medical Sciences (AREA)
  • Evolutionary Computation (AREA)
  • Databases & Information Systems (AREA)
  • Health & Medical Sciences (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Artificial Intelligence (AREA)
  • Management, Administration, Business Operations System, And Electronic Commerce (AREA)

Abstract

Die Erfindung betrifft ein Verfahren zur Selektion von Molekülen mit einer gesuchten physikalischen, chemischen und/oder physiologischen Eigenschaft aus einer Gruppe von Molekülen, wobei eine Klassifizierung nach einer chemischen, physikalischen und/oder physiologischen Eigenschaft eines Moleküls mit Hilfe eines mathematischen Modells vorgenommen wird. Hierdurch können Moleküle mit der gesuchten Eigenschaft aus der Gruppe von Molekülen selektiert werden. Für diese Auswahl an Molekülen wird anschließend eine experimentelle Bestätigung durchgeführt, ob die Moleküle die gesuchte physikalischen, chemischen und/oder physiologischen Eigenschaft tatsächlich aufweisen. Weiterhin ist die Verwendung des erfindungsgemäßen Verfahrens zur Selektion von mindestens einem Molekül mit einer gesuchten chemischen, physikalischen und/oder physiologischen Eigenschaft aus einer Gruppe von Molekülen sowie zur Identifizierung des Einflusses von Strukturmustern in Molekülen auf mindesten eine chemische, physikalische und/oder physiologische Eigenschaft von Molekülen beschrieben.

Description

Verfahren zur Klassifizierung physikalischer, chemischer und/oder physiologischer Eigenschaften von Molekülen
Die Erfindung betrifft ein Verfahren zur Selektion von Molekülen mit einer gesuchten physikalischen, chemischen und/oder physiologischen Eigenschaft aus einer Gruppe von Molekülen, wobei eine Klassifizierung nach einer chemischen, physikalischen und/oder physiologischen Eigenschaft eines Moleküls mit Hilfe eines mathematischen Modells vorgenommen wird. Hierdurch können Moleküle mit der gesuchten Eigenschaft aus der Gruppe von Molekülen selektiert werden. Für diese Auswahl an Molekülen wird anschließend eine experimentelle Bestätigung durchgeführt, ob die Moleküle die gesuchte physikalische, chemische und/oder physiologische Eigenschaft tatsächlich aufweisen. Weiterhin ist die Verwendung des erfindungsgemäßen Verfahrens zur Selektion von mindestens einem Molekül mit einer gesuchten chemischen, physikalischen und/oder physiologischen Eigenschaft aus einer Gruppe von Molekülen sowie zur Identifizierung des Einflusses von Strukturmustern in Molekülen auf mindesten eine chemische, physikalische und/oder physiologische Eigenschaft von Molekülen beschrieben.
Moleküle weisen chemische, physikalische und physiologische Eigenschaften auf. Während physikalische Eigenschaften durch die Messung zugrundeliegender physikalischer Größen quantifiziert werden können, sind chemische Eigenschaften durch Messungen einer zugrundeliegenden chemischen Größe bei der Reaktion eines Moleküls mit einem anderen Stoff quantifizierbar. Zu den physikalischen Eigenschaften eines Moleküls zählt zum Beispiel die Farbe des Moleküls. Die Wasserlöslichkeit wird hingegen zu den chemischen Eigenschaften eines Moleküls gezählt. Weiterhin weisen Moleküle physiologische Eigenschaften auf. Hierunter werden physikalische und chemische Stoffeigenschaften unter dem Aspekt der Wahrnehmbarkeit oder der Auswirkung auf die Umgebung gezählt. Beispiele hierfür sind der Geruch und der Geschmack eines Moleküls.
Chemische, physikalische und physiologische Eigenschaften sind für vielfältige Anwendungen von großem Interesse. Physiologische Eigenschaften beschreiben Eigenschaften von Molekülen, die Auswirkungen auf den Organismus von Lebewesen haben. Hierunter fallen erfindungsgemäß Eigenschaften wie Geschmack oder Geruch von Molekülen. Weiterhin wird erfindungsgemäß hierunter auch die Eingruppierung von Molekülen in erlaubte und nicht erlaubte Chemikalien in der Kosmetik und Körperpflege verstanden. Dies wird durch die Anwendungserlaubnis gemäß Articles Regulation, Annex II - Restricted Substances the Annex II der European Chemicals Agency (ECHA) geregelt. Der Geschmack von Molekülen spricht unmittelbar den Geschmackssinn des Menschen an und beeinflusst damit entscheidend das Essverhalten des Menschen und insbesondere welche Nahrungsmittel als angenehm oder auch als unangenehm empfunden werden. Der Geschmack, der von Molekülen hervorgerufen wird, ist daher insbesondere in der Lebensmittelindustrie von großer Bedeutung.
Geruchssinn ist einer der fünf Sinne des Menschen und spielt im täglichen Leben eine wichtige Rolle. Der Geruch von Speisen beeinflusst beispielsweise unser Essverhalten [1] und Gerüche in bedrohlichen Situationen beeinflussen das menschliche Erinnerungsvermögen an ebensolche Situationen [2], Neben der Bedeutung von Gerüchen für den Menschen spielen sie auch in der Wirtschaft eine wichtige Rolle, insbesondere in der Lebensmittel- und Kosmetikindustrie, wo die Entwicklung neuer Aromen und die Identifizierung geruchsaktiver Moleküle von wesentlicher Bedeutung sind. Bei der Entwicklung neuer Geruchsstoffe ist ein prädiktiver Ansatz während des Moleküldesigns erforderlich, um den Raum der in Frage kommenden Moleküle von praktisch allen auf eine vielversprechende Reihe von Strukturen zu reduzieren.
Obwohl in den letzten Jahren viele Fortschritte bei der Geruchsvorhersage erzielt wurden [3, 4, 5, 6], ist leider immer noch wenig über die Beziehung zwischen der Struktur eines Moleküls und seinem Geruch bekannt, so dass Chemikern kein „Werkzeugkasten“ an die Hand geben werden kann, um Molekülstrukturen mit einem bestimmten Geruch im Hinterkopf zu entwerfen [7, 8], Darüber hinaus besteht Uneinigkeit über die Dimensionalität des Geruchsraums [9, 10], Um die eher vage Eigenschaft des Geruchs aus objektiv messbaren oder berechenbaren molekularen Eigenschaften abzuleiten, kann eine Beziehung zwischen physikochemischen Parametern und Geruch verwendet werden. Mithilfe dieses Ansatzes und der Hauptkomponentenanalyse (PCA) sagen Khan et al. die Gefälligkeit („pleasantness“) des Geruchs von Molekülen voraus und identifizierten sie als eine der Dimensionen der menschlichen Geruchswahrnehmung [11] in Übereinstimmung mit anderen Studien [12],
Um einen bestimmten Geruch vorherzusagen, haben Keller et al. die Leistung von 22 verschiedenen maschinellen Lernmodellen hinsichtlich der Vorhersage von 19 Geruchsdeskriptoren untersucht. Sie verwendeten physiochemischen Eigenschaften wie den Typ der Atome, funktionelle Gruppen oder topologische und geometrische Informationen. Die Modelle haben acht der 19 betrachteten Deskriptoren erfolgreich vorausgesagt. Die Autoren suchten dabei nach Korrelationen zwischen Merkmalen und Deskriptoren und fanden signifikante Korrelationen zwischen schwefelhaltigen Molekülen und den Deskriptoren "Knoblauch" und "verbrannt". Aufgrund der guten Leistung der linearen Modelle schlossen die Autoren, dass ein linearer, summativer Effekt der Merkmale auf die Geruchswahrnehmung besteht [13], [14],
Shang et al. untersuchten verschiedene Kombinationen von Modellen zur Merkmalsgenerierung und Algorithmen für maschinelles Lernen, um den Geruch von Molekülen aus zehn möglichen Deskriptoren vorherzusagen. Sie wandten die Modelle in GC/O (Gaschromatographie-Analyse mit olfaktometrischer Detektion) an. Mit einer Genauigkeit von 97,08 % erzielte die Support Vector Machine (SVM) die besten Ergebnisse bei der vorherigen Merkmalsauswahl mit Boruta [15], Wurden jedoch Aromamoleküle vorhergesagt, die nicht in die Modellerstellung einbezogen wurden, sank die Genauigkeit auf 70 % [6], Für die Modelle wurden Merkmale verwendet, die mit der Chemoinformatik-Software Dragon für Geruchsvorhersagen berechnet wurden. Diese Merkmale werden auch von Snitz et al. zur Vorhersage des Geruchs von Geruchsstoffmischungen verwendet [5], Das Training eines „deep autoencoder“ [16] ermöglichte auch die Extraktion von Merkmalen die alternativ zur Verwendung von Merkmalen, die von Dragon generiert wurden, verwendet werden können. Tran et al. entwickelten den Autoencoder DeepNose, um molekulare Merkmale zu extrahieren. DeepNose-Merkmale erzielten im Vergleich zu Dragon-Merkmalen gleich gute Ergebnisse bei der Vorhersage von Geruchswahrnehmungen [3],
Die verwendeten Modelle sind zwar vielversprechend und für sich genommen nützlich, verwenden aber eine Vielzahl unterschiedlicher Merkmale, die keinen tiefen Einblick in den Mechanismus der Vorhersage gewähren. Aufgrund ihrer undurchsichtigen Natur fungieren die Modelle aus dem Stand der Technik eher als „Blackbox“, wodurch noch immer das Wissen über die Struktur-Geruchs-Beziehungen fehlt.
Dies führt dazu, dass in der Wirtschaft sowie Wissenschaft sensorisch trainierte Experten an Molekülen riechen müssen, um deren Geruch zu bestimmen. Aufgrund weitgehend unbekannter Struktur-Geruchsbeziehungen herrscht bei der Entwicklung von Aromastoffen oder der Identifizierung geruchsaktiver Moleküle das Prinzip Trial-and-Error vor. Dies ist sehr zeitaufwendig, personalaufwendig und daher unwirtschaftlich.
Genauso wünschenswert ist es andere physikalische, chemische oder physiologische Eigenschaften eines Moleküls aus dessen Struktur ableiten zu können.
Ausgehend vom Stand der Technik ist es daher die Aufgabe der Erfindung ein Verfahren zur Verfügung zu stellen, mit dem Moleküle mit einer gewünschten physikalischen, chemischen oder physiologischen Eigenschaft aus einer vorgegebenen Menge von Molekülen selektiert werden können, ohne alle Moleküle hinsichtlich der gewünschten Eigenschaft mit experimentellen Methoden untersuchen zu müssen.
Hierfür stellt die Erfindung ein Verfahren zur Selektion von Molekülen mit einer gesuchten physikalischen, chemischen und/oder physiologischen Eigenschaft aus einer Gruppe von Molekülen zur Verfügung, aufweisend die Schritte
• Bereitstellen einer Gruppe von Ok Molekülen durch einen Nutzer, wobei k e N;
• Bereitstellen einer Klassifizierung nach einer chemischen, physikalischen und/oder physiologischen Eigenschaft eines Moleküls, aufweisend C, Klassen, wobei i e N;
• Bereitstellen eines mathematischen Modells für die Klassifizierung, wobei das mathematische Modell Beziehungen G,j zwischen einem Strukturmuster und einer Klasse beschreibt, insbesondere durch Wahrscheinlichkeiten, dass ein Strukturmuster Fj eines Moleküls einer Klasse C, angehört oder ein Molekül einer Klasse C, ein Strukturmuster Fj aufweist;
• Auswahl einer Wichtungsfunktion a,j für das mathematische Modell durch einen Nutzer;
• Zuordnung aller Ok Moleküle in die C, Klassen der Klassifizierung durch das mathematische Modell, wobei das mathematische Modell die Schritte aufweist: a) Bestimmen und Speichern von Fj Strukturmustern der chemischen Struktur jedes der Ok Moleküle zugeordnet zu dem jeweiligen Molekül, wobei j e N; b) Zuordnung der Wahrscheinlichkeit Gy zu jedem Strukturmuster Fj eines Moleküls für jede Klasse C, und berechnen des Einflusses ,j gemäß der Formel für jedes Strukturmuster Fj eines Moleküls für jede Klasse C,; c) Berechnung eines Punktewertes Piik für jedes Molekül Ok, mittels für jede Klasse C,, wobei die Einflüsse /y aller Strukturmuster Fj die in einem Molekül Ok enthalten sind für jede Klasse C, aufsummiert wird; d) Zuordnung jedes Moleküls zu der Klasse C, mit dem höchsten Punktewert B.k für das jeweilige Molekül;
• Anzeige und/oder Ausgabe der Moleküle zugeordnet zu den Klassen der Klassifizierung und optional der zugehörigen Punktewerte Piik, der zugehörigen Einflüsse /y und der Strukturmuster p;
• Selektion der Moleküle die der Klasse mit gesuchten physikalischen, chemischen und/oder physiologischen Eigenschaft zugeordnet wurden;
• Experimentelle Bestätigung der physikalischen, chemischen und/oder physiologischen Eigenschaft zumindest eines Teils der selektierten Moleküle durch einen Nutzer; und/oder Überprüfung und/oder Identifizierung des Zusammenhanges zwischen mindestens einem Strukturmuster Fj und einer Klasse C, durch einen Nutzer.
Weiterhin wird die Verwendung des erfindungsgemäßen Verfahrens zur Selektion von mindestens einem Molekül mit einer gesuchten chemischen, physikalischen und/oder physiologischen Eigenschaft aus einer Gruppe von Molekülen sowie zur Identifizierung des Einflusses von Strukturmustern in Molekülen auf mindestens eine chemische, physikalische und/oder physiologische Eigenschaft von Molekülen beschrieben.
Detaillierte Beschreibung
Gemäß der vorliegenden Erfindung wird eine Gruppe von Ok Molekülen durch einen Nutzer bereitgestellt, wobei k e N. In einer Ausführungsform der vorliegenden Erfindung werden zwischen 20 und 1000 Molekülen bereitgestellt, bevorzugt werden zwischen 20 und 800 Molekülen bereitgestellt, besonders bevorzugt werden zwischen 20 und 300 Molekülen bereitgestellt. Bereitgestellt bedeutet in diesem Fall zunächst, dass die Strukturformeln der Moleküle vorliegen und damit bereitgestellt werden. Dies ist beispielweise über die Bereitstellung der Moleküle im Strukturcode SMILES möglich, die Strukturmuster als SMARTS codiert [17, 18, 19], Darüber hinaus besteht jedoch die Möglichkeit jedes der Moleküle als Substanz zu einem späteren Zeitpunkt für experimentelle Bestätigungen vorliegen zu haben.
Erfindungsgemäß wird weiterhin eine Klassifizierung nach einer chemischen, physikalischen und/oder physiologischen Eigenschaft eines Moleküls, aufweisend C, Klassen, wobei i e N bereitgestellt.
In einer Ausführungsform der Erfindung ist die Klassifizierung ausgewählt aus strukturbasierenden Eigenschaften von Molekülen, insbesondere aus der Gruppe enthaltend Geruch, Geschmack, Farbe, Toxizität, Wasserlöslichkeit und erlaubte und nicht erlaubte Chemikalien in Kosmetik und Körperpflege. In einer besonders bevorzugten Ausführungsform ist die Klassifizierung eine Klassifizierung nach dem Geruch der Moleküle.
Eine Klassifizierung umfasst mehre Klassen beispielsweise umfasst die Klassifizierung Wasserlöslichkeit die Klassen hydrophil und hydrophob. Die Klassifizierung Toxizität umfasst die Klassen toxisch und nicht toxisch. Die Klassifizierung Farbe kann als Klassen verschiedene Farben beispielsweise Blau, Rot, Gelb, Grün umfassen. Die Klassifizierung Geschmack entsprechend verschiedene Geschmacksrichtungen, wie bitter, sauer, süß, salzig und umami. Die Klassifizierung Geruch umfasst bevorzugt Geruchsrichtungen wie .holzig, harzig', .blumig', .fruchtig, nicht zitronig', .medizinisch', .parfümiert', .leicht', .schwer', ,süß‘, .aromatisch', .wohlriechend', .widerlich' als Klassen. Besonders bevorzugt umfasst die Klassifizierung Geruch die Geruchsrichtungen .holzig, harzig', .blumig', .fruchtig, nicht zitronig', .medizinisch', .parfümiert' als Klassen.
Weiterhin wird ein mathematisches Modell für die bereitgestellte Klassifizierung durch einen Nutzer bereitgestellt. Erfindungsgemäß weist das mathematische Modell Wahrscheinlichkeiten Gy auf, dass ein Strukturmuster Fj eines Moleküls einer Klasse C, angehört oder ein Molekül einer Klasse C, ein Strukturmuster Fj aufweist. Das mathematische Modell wurde zuvor durch einen Trainingsdatensatz für die ausgewählte Klassifizierung angelernt. Ein Trainingsdatensatz weist dabei 0/ Moleküle auf, bei denen bekannt ist, welcher Klasse C, der Klassifizierung sie zuzuordnen sind, wobei 1, 1 G N. In einer weiteren Ausführungsform kann ein Molekül mehreren Klassen C, zugeordnet sein. Die Erstellung des mathematischen Modells wird an späterer Stelle in der Beschreibung erläutert.
Erfindungsgemäß wird eine Wichtungsfunktion an für das mathematische Modell durch einen Nutzer ausgewählt. Eine geeignete Wichtungsfunktion a,j ist ausgewählt aus der Gruppe statistischer Maße, wie tf-idf-Funktionen, Normalisierungsfunktion, gleichgewichtete Funktion, tf und idf Werte werden anhand des Trainingsdatensatzes und der dem Fachmann allgemein bekannten Formeln errechnet [26],
Anschließend werden alle Ok Moleküle den C, Klassen der Klassifizierung durch das mathematische Modell zugeordnet. Dabei weist das mathematische Modell die folgenden Schritte: a) Bestimmen und Speichern von Fj Strukturmustern der chemischen Struktur jedes der Ok Moleküle zugeordnet zu dem jeweiligen Molekül, wobei j e N; b) Zuordnung der Wahrscheinlichkeit Gij zu jedem Strukturmuster Fj eines Moleküls für jede Klasse C, und berechnen des Einflusses /y gemäß der Formel für jedes Strukturmuster F, eines Moleküls für jede Klasse C,; c) Berechnung eines Punktewertes Piik für jedes Molekül Ok , mittels für jede Klasse C,, wobei die Einflüsse /y aller Strukturmuster Fj die in einem Molekül Ok enthalten sind für jede Klasse C, aufsummiert wird; d) Zuordnung jedes Moleküls zu der Klasse C, mit dem höchsten Punktewert Piik für das jeweilige Molekül;
Im Schritt a) werden Strukturmuster Fj der chemischen Struktur jedes der Ok Moleküle bestimmt. Diese werden zugeordnet zu dem jeweiligen Molekül gespeichert. Dabei werden sämtliche Strukturmuster der Ok Moleküle bestimmt. Strukturmuster, die im Trainingsdatensatz nicht vorkommen, bekommen einen Einflüsse /y von Null zugeordnet und werden damit im Verfahren nicht berücksichtigt. Gemäß dem erfindungsgemäßen Verfahren wird jedem Strukturmuster Fj eines Moleküls für jede Klasse C, eine Wahrscheinlichkeit Gij zugeordnet. Die jeweilige Wahrscheinlichkeit Gij ist aus dem mathematischen Modell für jedes Strukturmuster Fj für eine vorgegebene Klassifizierung bekannt. Der Einfluss /,j wird gemäß der Formel h,j — ai,j ' j,j (1) für jede Klasse C, berechnet. aifj entspricht dabei der zuvor ausgewählten Wichtungsfunktion. Durch die Wichtungsfunktion können zusätzliche Informationen über den Zusammenhang zwischen Strukturmuster und Klasse berücksichtigt werden, wie beispielsweise die Selektivität und Spezifität mittels tf-idf-Funktion. Anschließend wird ein Punktewert Piik für jedes Molekül Ok gemäß der Formel
Pi,k = ^iFjEOk h,j (?) für jede Klasse C, berechnet. Gemäß der Formel werden die Einflüsse ,j aller Strukturmuster Fj die in einem Molekül Ok enthalten sind, für jede Klasse C, aufsummiert. Erfindungsgemäß wird damit für jede Klasse C, der Klassifizierung ein Punktewert Piik für ein Molekül errechnet. Das Molekül wird dann der Klasse C, der Klassifizierung zugeordnet, die den höchsten Punktewert Piik für das jeweilige Molekül aufweist. Erfindungsgemäß wird daher das Molekül mindestens einer Klasse C, zugeordnet. In einer Ausführungsform der Erfindung wird das Molekül mehreren Klassen zugeordnet. Dies geschieht wenn der höchste Punktwert Piik für mehrere Klassen gleich ist. Die Zuordnung erfolgt dann in die Klassen C, für die jeweils der gleiche höchste Punktwert Piik ermittelt wurde.
In einer weiteren Ausführungsform der vorliegenden Erfindung ist vorgesehen, dass wenn die Punktewerte eines Moleküls für alle Klassen C, gleich sind, dieses Molekül als nicht vorhersagbar gekennzeichnet wird. Dieser Fall kann beispielsweise eintreten, wenn ein Molekül vollständig aus Strukturmustern besteht, die im Trainingsdatensatz nicht vorkommen und denen daher jeweils ein Einfluss / von Null zugeordnet wurde.
Durch das mathematische Modell ist daher eine Zuordnung der Moleküle in die Klassen C, der Klassifizierung möglich. Das mathematische Modell basiert dabei auf der Annahme, dass jedes Strukturmuster einen bestimmten Einfluss auf eine Klasse hat und eine Strukturmuster-Klassen-Beziehung besteht. Die vorliegende Erfindung ermöglicht damit eine Sortierung der Ok Moleküle in die Klassen der Klassifizierung. Durch die Anwendung des mathematischen Modells wird demzufolge eine Vorauswahl an Molekülen getroffen, die in der bereitgestellten Gruppe von Molekülen enthalten sind und die gesuchte physikalische, chemische oder physiologische Eigenschaft aufweisen.
Hierdurch wird es einem Nutzer ermöglicht, gezielt eine kleinere Auswahl von Molekülen der Ok Moleküle weiteren experimentellen Untersuchungen zu unterziehen, um Moleküle mit gesuchten physikalischen, chemischen oder physiologischen Eigenschaften zu finden. Vorteilhafterweise ist es nicht wie bisher notwendig alle Ok Moleküle experimentellen Untersuchungen zu unterziehen, stattdessen können bevorzugt die Moleküle mit den höchsten Punktewerten in einer bestimmten Klasse der Klassifizierung und damit mit einer gesuchten physikalischen, chemischen und/oder physiologischen Eigenschaft einer experimentellen Bestätigung unterzogen werden. Experimentell bestätigt wird dabei ob ein Molekül tatsächlich die physikalischen, chemischen und/oder physiologischen Eigenschaft aufweist, die es laut Klassifizierung haben sollte.
Sollen zum Beispiel insbesondere Moleküle aus einer Gruppe herausgefiltert werden, die den Geruch .blumig' aufweisen, so wird das mathematische Modell für die Klassifikation Geruch angewendet und die Moleküle, die der Klasse .blumig' zugeordnet werden, werden anschließend einer experimentellen Bestätigung unterzogen. Vorteilhafterweise wird dabei mit dem Molekül begonnen, das den höchsten Punktewert Piik in dieser Klasse hat. Anschließend können weitere Moleküle in dieser Klasse experimentell untersucht werden, wobei diese vorteilhafterweise in einer Reihenfolge angeordnet nach absteigenden Punktewerten Piik experimentell untersucht werden. In einer Ausführungsform wird nur das Molekül mit dem höchsten Punktewert einer Klasse experimentell untersucht. In einer weiteren Ausführungsform der vorliegenden Erfindung werden alle Moleküle experimentell untersucht, deren Punktewert Piik höchstens 50%, bevorzugt höchstens 30%, besonders bevorzugt höchstens 10% vom höchsten Punktewert Piik in dieser Klasse abweicht. In einer weiteren Ausführungsform der vorliegenden Erfindung werden alle Moleküle einer Klasse der Klassifizierung experimentell untersucht.
Erfindungsgemäß werden daher die Moleküle Ok zugeordnet zu den Klassen der Klassifizierung angezeigt und/oder ausgegeben. In einer Ausführungsform erfolgt die Anzeige und/oder Ausgabe der Moleküle derart, dass die Moleküle in absteigender Reihenfolge nach deren Punktewert Piik in einer Klasse C, angeordnet sind, beginnend mit dem Molekül mit dem größten Punktewert Piik. In einer Ausführungsform wird der zugehörige Punktewerte Piik und/oder der zugehörigen Einflüsse ,j und/oder das zugehörige Strukturmuster Fj angezeigt und/oder ausgegeben. Anschließend werden die Moleküle, die der Klasse mit gesuchten physikalischen, chemischen und/oder physiologischen Eigenschaft zugeordnet wurden, selektiert.
Wie bereits beschrieben, schließt sich eine experimentelle Bestätigung der physikalischen, chemischen und/oder physiologischen Eigenschaft zumindest eines Teils der selektierten Moleküle durch einen Nutzer an. Durch die experimentelle Überprüfung wird gleichzeitig die Klassifizierung des Moleküls durch einen Nutzer überprüft. Die Art der experimentellen Bestätigung hängt dabei von der Klassifizierung ab, die vorgenommen wurde. Die folgende Tabelle bietet einen nicht vollständigen Überblick über gängige experimentelle Methoden, mit denen physikalische, chemische und physiologische Eigenschaften von Molekülen überprüft werden können. Alle weiteren gängigen und dem Fachmann bekannten experimentellen Methoden sind genauso anwendbar.
In einer Ausführungsform der vorliegenden Erfindung findet weiterhin eine Überprüfung und/oder Identifizierung des Zusammenhanges zwischen mindestens einem Strukturmuster Fj und einer Klasse C, durch einen Nutzer statt. Hierdurch wird es vorteilhafterweise ermöglicht Einblick in die Strukturmuster-Klassen-Beziehung zu erlangen. Physikalische, chemische und/oder physiologische Eigenschaften von Molekülen können dadurch auf bestimmte Strukturmuster der Moleküle zurückgeführt werden.
Die vorliegende Erfindung ermöglicht damit eine signifikante Einsparung von Personalaufwand und technischem Aufwand, da nicht länger alle Moleküle Ok einer zur Verfügung gestellten Gruppe experimentell untersucht werden müssen, um zumindest ein Molekül einer bestimmten Klasse und damit mit einer bestimmten physikalischen, chemischen oder physiologischen Eigenschaft zu selektieren. Durch die Anwendung des mathematischen Modells wird eine Auswahl von Molekülen getroffen und die darauffolgende experimentelle Bestätigung kann gezielt mit dieser Auswahl von Molekülen durchgeführt werden. Hierdurch werden im Vergleich zu den Methoden aus dem Stand der Technik Zeit und Kosten gespart. Zudem ist es nicht nötig alle Moleküle als Substanz für experimentelle Untersuchungen vorliegen zu haben, was zusätzliche Kosten einspart.
Erfindungsgemäß wird ein mathematisches Modell genutzt, welches die Wahrscheinlichkeit G,j für definierte Strukturmuster für definierte Klassen C, einer Klassifizierung umfasst oder ein Molekül einer Klasse C, ein Strukturmuster Fj aufweist.
Das mathematische Modell wird hierfür erfindungsgemäß durch einen Trainingsdatensatz für eine ausgewählte Klassifizierung angelernt, wobei ein Trainingsdatensatz aufweisend 0/ Moleküle bekannter Klasse C, vorgegeben wird, wobei I, i e N. Anlernen bedeutet in diesem Zusammenhang nichts anderes, als das die Wahrscheinlichkeiten Gtj = für definierte Strukturmuster für definierte Klassen C, anhand eines vorgegebenen Datensatzes berechnet werden oder das die Wahrscheinlichkeiten Gtj = Pr( |F7) berechnet werden, dass ein Molekül einer Klasse C, ein Strukturmuster Fj aufweist . Dabei sind für den Datensatz die Strukturmuster der Moleküle bekannt und in welche Klasse einer Klassifizierung die jeweiligen Moleküle einzuordnen sind. In einer Ausführungsform der vorliegenden Erfindung kann ein Molekül auch mehreren Klassen zugeordnet sein.
Das Verfahren zum Anlernen des mathematischen Modells weist die folgenden Schritte auf: i. Bestimmen und Speichern von Fj Strukturmustern der chemischen Struktur jedes Moleküls zugeordnet zu dem jeweiligen Molekül, j e N ; ii. Berechnung der Wahrscheinlichkeit Gy, dass ein Strukturmuster Fj einer
Klasse C, angehört, wobei Gtj = Pr(F7 0C|er
Berechnung der Wahrscheinlichkeit G , dass ein Molekül einer Klasse C, ein Strukturmuster Fj aufweist, wobei Gtj = Pr(c F7) =
Im Schritt i. werden die Strukturmuster Fj jedes Moleküls bestimmt. Ein Strukturmuster ist dabei ein Teilfragment der chemischen Struktur des Moleküls. Hierbei müssen nicht zwingend alle Strukturbestandteile der Moleküle verwendet werden, sondern es kann eine vorhergehende Feature Selektion mittels eines Algorithmus oder statistischer Werte durchgeführt werden.
Beispielsweise kann die Bestimmung der Strukturmuster Fj eines Moleküls mittels sogenannter Fingerprint-Algorithmen umgesetzt werden. Als Fingerprint-Algorithmus ist aus dem Stand der Technik beispielsweise der RDKit-Topologiefingerprint [20, 21] bekannt. Weiterhin sind die Dragon Software [22] und Graph Convolutional Neural Networks [23] bekannt, um Molekülstrukturen zu bestimmen. Eine neue Methode betrachtet Moleküle als Graphen und überführt Knoten und Kanten der Graphen in einen Vektor, wodurch Moleküle rein strukturbasiert repräsentiert werden können [24],
In einer Ausführungsform der vorliegenden Erfindung werden nicht alle Strukturmuster, die in einer Gruppe von Molekülen vorkommen, in dem erfindungsgemäßen Verfahren genutzt. In diesem Fall stellen die Fj Strukturmuster die im Verfahrensschritt a) des erfindungsgemäßen Verfahrens bestimmt und gespeichert werden eine Selektion aus einer größeren Anzahl an Strukturmustern dar. Die Selektion kann beispielsweise durch einen Algorithmus, eine idf-Wichtung oder einer tf-idf-Wichtung vorgenommen, werden. Ein Algorithmus kann dabei beispielsweise eine Selektion nach der Mindestanzahl an Molekülen, die ein Strukturmuster aufweisen selektieren oder nach Korrelationen zwischen verschiedenen Strukturmustern.
Zu jedem Strukturmuster Fj wird anschließend eine Wahrscheinlichkeit G,j berechnet, dass ein Strukturmuster einer Klasse C, angehört. Die Wahrscheinlichkeit G,j wird dabei mittels der Formel berechnet.
Alternativ wird zu jedem Strukturmuster Fj anschließend eine Wahrscheinlichkeit G,j berechnet, dass ein Molekül einer Klasse C, ein Strukturmuster Fj aufweist. Die Wahrscheinlichkeit Gy wird dabei mittels der Formel berechnet.
Die vorliegende Erfindung kann zur Selektion von Molekülen mit einer gesuchten chemischen, physikalischen und/oder physiologischen Eigenschaft aus einer Gruppe von Molekülen verwendet werden. Weiterhin kann die vorliegende Erfindung zur Identifizierung des Einflusses von Strukturmustern in Molekülen auf mindestens eine chemische, physikalische und/oder physiologische Eigenschaft von Molekülen verwendet werden.
In einer besonders bevorzugten Ausführungsform wird das erfindungsgemäße Verfahren verwendet, um den Geruch eines Moleküls zu bestimmen, bzw. um aus einer Gruppe von Molekülen, die Moleküle zu selektieren, die einen bestimmten Geruch aufweisen. In diesem Fall ist die Klassifizierung der Geruch und die Klassen sind einzelne Gerüche, wie beispielsweise .blumig' und .medizinisch'.
Vorteilhafterweise bietet das erfindungsgemäße Verfahren damit auch einen Einblick in die Strukturmuster-Geruchs-Beziehung. Da das Verfahren für jedes Strukturmuster eine Einfluss j in Form eines quantitativen Wertes für jedes Klasse und damit für jeden Geruch berechnet, können durch Vergleich dieser Einflüsse Strukturmuster identifiziert werden, welche sich stark hinsichtlich eines bestimmten Geruchs auszuwirken scheinen. Die Strukturmuster können daher auch nach ihrem Einfluss auf einen bestimmten Geruch angeordnet werden.
Die Erfindung wird im Folgenden anhand von 2 Figuren und 3 Ausführungsbeispielen näher erläutert.
Figur 1 stellt einen Ablauf des erfindungsgemäßen Verfahrens dar;
Figur 2 stellt Ergebnisse des erfindungsgemäßen Verfahrens dar.
Figur 1 stellt einen Ablauf des erfindungsgemäßen Verfahrens dar, der im Ausführungsbeispiel 2 näher beschrieben ist.
Figur 2 stellt Ergebnisse des erfindungsgemäßen Verfahrens dar, bei dem ein mathematisches Modell mit unterschiedlichen Wichtungsfunktionen a,j und mit und ohne Selektion der Strukturmuster durchgeführt wurde.
Ausführungsbeispiel 1 - Geruchsbestimmung
Ein mathematisches Modell wurde beispielhaft anhand einer Gruppe von 5 Molekülen für die Klassifizierung Geruch mit den zwei Klassen .blumig' und .medizinisch' trainiert. Das heißt es wurden für alle Moleküle Strukturmuster F, bestimmt. Für jedes der 5 Moleküle war dessen Klassenzugehörigkeit/en bekannt. Mit diesen Informationen wurden die Wahrscheinlichkeiten Gij für jedes Strukturmuster Fj berechnet. In Figur 1 sind für den Trainingsdatensatz die 5 Moleküle aufgelistet. Die Moleküle sind dabei im Strukturcode SMILES dargestellt, die Strukturmuster sind als SMARTS codiert. Der Übersicht halber wurden beispielhaft die 3 Strukturmuster [CX4H3], [CX4], dccccd dargestellt. Zu jedem der 5 Moleküle war dessen Klassifizierung .blumig' oder .medizinal' bekannt. Strukturmuster mit dem Wert 1 .0 in der Tabelle kommen in dem jeweiligen Molekül vor und Strukturmuster mit dem Wert 0.0 kommen nicht in dem jeweiligen Molekül vor.
Aus dem Trainingsdatensatz wurden mit Hilfe der Formel (3) die Wahrscheinlichkeiten Gij für jedes der 3 Strukturmuster jeweils für die Klasse .blumig' und für die Klasse .medizinal' berechnet.
Es sollte nun aus einer Gruppe von 10 Molekülen diejenigen herausgefiltert werden, die einen .blumigen' Geruch aufweisen. Das erfindungsgemäße Vorgehen hierfür wird im Folgenden beispielhaft anhand eines der 10 Moleküle näher erläutert. Es wurde für das Molekül CCOCOCC bestimmt, welche der Strukturmuster des Trainingsdatensatzes in diesem vorkommen. Weiterhin wurde als Wichtungsfunktion a,j eine Gleichwichtung festgelegt, so dass alle Wichtungsfaktoren 1 waren. Nach Formel (1) wurden dann die Einflüsse Z^ berechnet, für alle Strukturmuster berechnet. Die Ergebnisse für beide Klassen für alle 3 Strukturmuster sind in der Figur 1 dargestellt. Das Molekül CCOCOCC weist nur die Strukturmuster [CX4H3], [CX4] auf, so dass die Einflüsse dieser Strukturmuster in beiden Klassen gemäß der Formel (2) aufsummiert wurden. Die ergab einen Punktewert von P, <=1 ,67 für die Klasse .blumig' und einen Punktewert von P,/<=1 ,50 für die Klasse .medizinal'. Das Molekül wurde daraufhin der Klasse .blumig' zugeordnet. Alle weiteren 9 Moleküle wurden nach dem gleichen Prinzip klassifiziert. Dabei konnten 3 Moleküle der Klasse .blumig' zugeordnet werden und 7 Moleküle der Klasse .medizinisch'. Diese 3 Moleküle wurden im Folgenden selektiert.
Von den 3 Molekülen der Klasse .blumig' hatte das Molekül CCOCOCC den höchsten Punktewert. Aufgrund der überschaubaren Menge an Molekülen, die der Klasse .blumig' zugeordnet wurden, wurden alle drei Moleküle im Folgenden experimentell untersucht. Substanzen, bestehend jeweils aus den 3 Molekülen, wurden durch eine in der Wahrnehmung von Gerüchen trainierten Person untersucht und es konnte festgestellt werden, dass alle drei Moleküle auch in der experimentellen Bestätigung der Klasse .blumig' zugeordnet werden konnten.
Ausführungsbeispiel 2 - Validierung mathematisches Modell Das erfindungsgemäße Verfahren wurde anhand einer Gruppe von 64 Molekülen durchgeführt. Die 64 Moleküle wurden der Klassifizierung Geruch mit den Klassen , blumig', .medizinisch', .holzig, harzig', .widerlich', .fruchtig, nicht zitronig' und .parfümiert' zugeordnet. Für das T raining des Modells wurden 63 Moleküle der 64 Moleküle verwendet, wobei deren Klassenzugehörigkeit jeweils bekannt war. Es wurde ein mathematisches Modell für die Klassifizierung Geruch erstellt. Anschließend wurde die Klasse des übrig gebliebenen Moleküls mit Hilfe des mathematischen Modells berechnet. Hierfür wurden verschieden Wichtungsfunktionen a,j und/oder verschiedene Selektionen von Strukturmustern genutzt. Die folgende Tabelle in Figur 2 stellt die Ergebnisse dar. Die Genauigkeit wenn der Geruch eines Moleküls geschätzt wird liegt bei 21 ,35 %. Das bedeutet, dass das erfindungsgemäße Verfahren den Geruch von Molekülen mit mindestens der doppelten Genauigkeit Klassifizieren kann, als wenn lediglich geschätzt wird. Am genauesten waren die Ergebnisse der Klassifizierung über das mathematische Modell wenn a,j eine tf-idf-Wichtung war. Die Genauigkeit lag hier bei über 65%. Bei der Berechnung der Genauigkeit wurden alle Moleküle, die nicht klassifiziert werden konnten als .falsch' gewertet.
Für zwei der Moleküle konnte keine Klassifizierung berechnet werden. Einmal für Hexanol, da dies nur Strukturmuster aufwies, die in allen Klassen vorkommen. Und für Thiophen, welches wiederum nur Strukturmuster aufweist, die von den 64 Molekülen ausschließlich in diesem Molekül vorkommen, das mathematische Modell konnte daher für diese Strukturmuster keine Wahrscheinlichkeiten zur Verfügung stellen.
Ausführungsbeispiel 3 - Anwendungserlaubnis von Chemikalien in der Kosmetikindustrie und Körperpflege
Das erfindungsgemäße Verfahren wurde zur Vorhersage der Anwendungserlaubnis von Chemikalien in der Kosmetik und Pflege verwendet. Hierfür wurde ein Datensatz bestehend aus 800 Molekülen (400 davon mit und 400 ohne Anwendungserlaubnis) und 500.047 Strukturfragmenten zum Trainieren des mathematischen Modells verwendet. Das mathematische Modell mit der tf-idf-gewichteten bedingten Wahrscheinlichkeit Pr(Cj|Fj) konnte mit einer Genauigkeit von über 85% replizieren, ob Moleküle des Trainingsdatensatzes eine Anwendungserlaubnis haben. Für 200 weitere Moleküle (100 mit, 100 ohne Anwendungserlaubnis) wurde mithilfe des mathematischen Modells die Anwendungsvorhersage prognostiziert. Die Ergebnisse wurden mit FCM and Articles Regulation, Annex 11 - Restricted Substances the Annex 11 der European Chemicals Agency (ECHA) verglichen. Nur 11 Moleküle wurden fälschlicherweise als erlaubt klassifiziert. Insgesamt lag die Genauigkeit bei 81%. Somit können durch das erfindungsgemäße Verfahren bei der Synthese von Chemikalien für Kosmetik und Körperpflege signifikant Arbeits- und Personalkosten eingespart werden, indem sich verstärkt auf prognostizierte erlaubte Substanzen konzentriert wird.
Literatur
[1] a) L. G. Fine, C. E. Riera, Frontiers in physiology 2019, 10, 1151 ; b) P.
Morquecho-Campos, K. de Graaf, S. Boesveldt, Food quality and preference 2020, 85, 103959.
[2] J. E. Taylor, H. Lau, B. Seymour, A. Nakae, H. Sumioka, M. Kawato, A. Koizumi, Frontiers in Neuroscience 2020, 14, 255.
[3] N. B. Tran, D. R. Kepple, S. A. Shuvaev, A. A. Koulakov, International Conference on Machine Learning 2019, 6305.
[4] a) A. Keller, R. C. Gerkin, Y. Guan, A. Dhurandhar, G. Turu, B. Szalai, J. D. Mainland, Y. Ihara, C. W. Yu, R. Wolfinger, Science 2017, 355, 820; b) H. Li, B. Panwar, G. S. Omenn, Y. Guan, Gigascience 2018, 7, gix127.
[5] K. Snitz, A. Yablonka, T. Weiss, I. Frumin, R. M. Khan, N. Sobel, PLoS computational biology 2013, 9, e1003184.
[6] L. Shang, C. Liu, Y. Tomiura, K. Hayashi, Analytical chemistry 2017 , 89, 11999.
[7] a) C. S. Sell, Angewandte Chemie International Edition 2006, 45, 6254; b) M. Genva, T. Kenne Kemene, M. Deleu, L. Lins, M.-L. Fauconnier, International journal of molecular sciences 2019, 20, 3018.
[8] K. J. Rossiter, Chemical reviews 1996, 96, 3201.
[9] K. Kaeppler, F. Mueller, Chemical senses 2013, 38, 189.
[10] R. Kumar, R. Kaur, B. Auffarth, A. P. Bhondekar, PloS one 2015, 10, e0141263.
[11] R. M. Khan, C.-H. Luk, A. Flinker, A. Aggarwal, H. Lapid, R. Haddad, N. Sobel, Journal of Neuroscience 2007, 27, 10015.
[12] a) M. Zarzo, Journal of Sensory Studies 2008, 23, 354; b) A. Koulakov, B. E. Kolterman, A. Enikolopov, D. Rinberg, Frontiers in systems neuroscience 2011 , 5, 65.
[13] M. B. Kursa, W. R. Rudnicki, J Stat Softw 2010, 36, 1.
[14] A. Keller, e-Neuroforum 2003, 9, 121.
[15] M. B. Kursa, A. Jankowski, W. R. Rudnicki, Fundamenta Informaticae 2010, 101, 271.
[16] G. E. Hinton, R. R. Salakhutdinov, Science 2006, 313, 504.
[17] D. Weininger, Journal of chemical information and computer sciences 1988, 28, 31.
[18] Daylight Chemical Information Systems, Inc., "3. SMILES - A Simplified Chemical Language", can be found under https://www.daylight.com/dayhtml/doc/theory/theory.smiles.html, 2019,
[19] Daylight Chemical Information Systems, Inc., "4. SMARTS - A Language for Describing Molecular Patterns", can be found under https://www.daylight.com/dayhtml/doc/theory/theory.smarts.html, 2019. [20] https://doi.Org/10.1186/S13321 -020-00445-4
[21] https://www.rdkit.org/UGM/2012/Landrum_RDKit_UGM.Fingerprints.Final.pptx.pdf
[22] http://www.talete.mi.it/products/dragon_molecular_descriptor_list.pdf
[23] https://ai.googleblog.com/2019/10/learning-to-smell-using-deep-learning.html [24] arXiv:1910.10685v2
[25] Chris Manning and Hinrich Schütze, Foundations of Statistical Natural Language Processing, MIT Press. Cambridge, MA: May 1999
[26] Heiner Strickenschmidt, Ontotogien: Konzepte, Technologien und Anwendungen, Springer Verlag, 2009

Claims

Ansprüche
1. Verfahren zur Selektion von Molekülen mit einer gesuchten physikalischen, chemischen und/oder physiologischen Eigenschaft aus einer Gruppe von Molekülen aufweisend die Schritte
• Bereitstellen einer Gruppe von Ok Molekülen durch einen Nutzer, wobei k e N;
• Bereitstellen einer Klassifizierung nach einer chemischen, physikalischen und/oder physiologischen Eigenschaft eines Moleküls, aufweisend C, Klassen, wobei i e N;
• Bereitstellen eines mathematischen Modells für die Klassifizierung, wobei das mathematische Modell Beziehungen G,j zwischen einem Strukturmuster und einer Klasse beschreibt, insbesondere durch Wahrscheinlichkeiten, dass ein Strukturmuster Fj eines Moleküls einer Klasse C, angehört oder ein Molekül einer Klasse C, ein Strukturmuster Fj aufweist;
• Auswahl einer Wichtungsfunktion a,j für das mathematische Modell durch einen Nutzer;
• Zuordnung aller Ok Moleküle in die C, Klassen der Klassifizierung durch das mathematische Modell, wobei das mathematische Modell die Schritte aufweist: a) Bestimmen und Speichern von Fj Strukturmustern der chemischen Struktur jedes der Ok Moleküle zugeordnet zu dem jeweiligen Molekül, wobei j e N; b) Zuordnung der Wahrscheinlichkeit Gij zu jedem Strukturmuster Fj eines Moleküls für jede Klasse C, und berechnen des Einflusses /,j gemäß der Formel für jedes Strukturmuster Fj eines Moleküls für jede Klasse C,; c) Berechnung eines Punktewertes Piik für jedes Molekül Ok, mittels für jede Klasse C,, wobei die Einflüsse ,j aller Strukturmuster Fj die in einem Molekül Ok enthalten sind für jede Klasse C, aufsummiert wird; d) Zuordnung jedes Moleküls zu der Klasse C, mit dem höchsten Punktewert Piik für das jeweilige Molekül; • Anzeige und/oder Ausgabe der Moleküle zugeordnet zu den Klassen der Klassifizierung und optional der zugehörigen Punktewerte Piik, der zugehörigen Einflüsse /,7und der Strukturmuster Ff,
• Selektion der Moleküle die der Klasse mit gesuchten physikalischen, chemischen und/oder physiologischen Eigenschaft zugeordnet wurden;
• Experimentelle Bestätigung der physikalischen, chemischen und/oder physiologischen Eigenschaft zumindest eines Teils der selektierten Moleküle durch einen Nutzer; und/oder Überprüfung und/oder Identifizierung des Zusammenhanges zwischen mindestens einem Strukturmuster Fj und einer Klasse C, durch einen Nutzer. Verfahren nach Anspruch 1, dadurch gekennzeichnet, dass die Anzeige und/oder Ausgabe zumindest eines Teils der Moleküle derart erfolgt, dass die Moleküle in absteigender Reihenfolge nach deren Punktewert Piik in einer Klasse C, angeordnet sind, beginnend mit dem Molekül mit dem größten Punktewert Piik. Verfahren nach einem der vorangegangenen Ansprüche, dadurch gekennzeichnet, dass das mathematische Modell durch einen Trainingsdatensatz für die ausgewählte Klassifizierung angelernt wird, wobei ein Trainingsdatensatz aufweisend 0/ Moleküle bekannter Klasse C, vorgegeben wird, wobei I, i e N, aufweisend die Schritte i. Bestimmen und Speichern von Fj Strukturmustern der chemischen Struktur jedes Moleküls zugeordnet zu dem jeweiligen Molekül, j e N ; ii. Berechnung der Wahrscheinlichkeit Gy, dass ein Strukturmuster Fj einer Klasse C, angehört, wobei
Berechnung der Wahrscheinlichkeit G , dass ein Molekül einer Klasse C, ein Strukturmuster Fj aufweist, wobei Gtj = Pr(c F7) = Verfahren nach Ansprüche 3, dadurch gekennzeichnet, dass die in Schritt i) bestimmten Fj Strukturmustern durch einen Algorithmus, eine idf-Wichtung oder einer tf-idf-Wichtung selektiert werden. Verfahren nach einem der vorangegangenen Ansprüche, dadurch gekennzeichnet, dass die Klassifizierung ausgewählt ist aus der Gruppe strukturbasierender Eigenschaften von Molekülen, insbesondere aus der Gruppe enthaltend Geruch, Geschmack, Farbe, Wasserlöslichkeit, Toxizität und erlaubte und nicht erlaubte Chemikalien in der Kosmetik und Körperpflege. Verfahren nach einem der vorangegangenen Ansprüche, dadurch gekennzeichnet, dass die Wichtungsfunktion a,j ausgewählt ist aus der Gruppe statistischer Maße, wie tf-idf- Funktionen, Normalisierungsfunktion, gleichgewichtete Funktion. Verfahren nach einem der vorangegangenen Ansprüche, dadurch gekennzeichnet, dass alle Moleküle experimentell untersucht werden, deren Punktewert Piik höchstens 50%, bevorzugt höchstens 30%, besonders bevorzugt höchstens 10% vom höchsten Punktewert Piik in dieser Klasse abweicht. Verwendung des Verfahrens gemäß einem der Ansprüche 1 bis 7, dadurch gekennzeichnet, dass das Verfahren zur Selektion von mindestens einem Molekül mit einer gesuchten chemischen, physikalischen und/oder physiologischen Eigenschaft aus einer Gruppe von Molekülen verwendet wird. Verwendung des Verfahrens gemäß einem der Ansprüche 1 bis 7, dadurch gekennzeichnet, dass das Verfahren zur Identifizierung des Einflusses von Strukturmustern in Molekülen auf mindesten eine chemische, physikalische und/oder physiologische Eigenschaft von Molekülen verwendet wird.
EP23742060.9A 2022-07-13 2023-07-13 Verfahren zur klassifizierung physikalischer, chemischer und/oder physiologischer eigenschaften von molekülen Pending EP4555517A1 (de)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
DE102022117408.5A DE102022117408A1 (de) 2022-07-13 2022-07-13 Verfahren zur Klassifizierung physikalischer, chemischer und/oder physiologischer Eigenschaften von Molekülen
PCT/EP2023/069455 WO2024013285A1 (de) 2022-07-13 2023-07-13 Verfahren zur klassifizierung physikalischer, chemischer und/oder physiologischer eigenschaften von molekülen

Publications (1)

Publication Number Publication Date
EP4555517A1 true EP4555517A1 (de) 2025-05-21

Family

ID=87340686

Family Applications (1)

Application Number Title Priority Date Filing Date
EP23742060.9A Pending EP4555517A1 (de) 2022-07-13 2023-07-13 Verfahren zur klassifizierung physikalischer, chemischer und/oder physiologischer eigenschaften von molekülen

Country Status (4)

Country Link
US (1) US20260018257A1 (de)
EP (1) EP4555517A1 (de)
DE (1) DE102022117408A1 (de)
WO (1) WO2024013285A1 (de)

Family Cites Families (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6182016B1 (en) * 1997-08-22 2001-01-30 Jie Liang Molecular classification for property prediction
US10665330B2 (en) * 2016-10-18 2020-05-26 International Business Machines Corporation Correlating olfactory perception with molecular structure
CA3129069A1 (en) * 2019-02-08 2020-08-13 Google Llc Systems and methods for predicting the olfactory properties of molecules using machine learning

Also Published As

Publication number Publication date
US20260018257A1 (en) 2026-01-15
WO2024013285A1 (de) 2024-01-18
DE102022117408A1 (de) 2024-01-18

Similar Documents

Publication Publication Date Title
Berglund et al. Multidimensional analysis of twenty‐one odors
Kaeppler et al. Odor classification: a review of factors influencing perception-based odor arrangements
DE102009032649A1 (de) Massenspektrometrische Identifizierung von Mikroben nach Unterarten
Teixeira et al. Perfumery radar 2.0: A step toward fragrance design and classification
Chastrette Classification of odors and structure-odor relationships
Mbogning Feudjio et al. Fluorescence spectroscopy combined with chemometrics for the investigation of the adulteration of essential oils
WO2010083811A1 (de) Verfahren zur identifizierung insbesondere unbekannter substanzen durch massenspektrometrie
Teixeira et al. Perfumery radar: A predictive tool for perfume family classification
CN120297138A (zh) 一种香精香料定制化配方推荐系统及其方法
WO2024013285A1 (de) Verfahren zur klassifizierung physikalischer, chemischer und/oder physiologischer eigenschaften von molekülen
WO2019007626A1 (de) Verfahren zum rechnergestützten konfigurieren eines datengetriebenen modells basierend auf trainingsdaten
Zarzo Relevant psychological dimensions in the perceptual space of perfumery odors
Berezina Research of the psychological interconnection between the basic odors and the emotional state of a human being
Laing Characteristics of the human sense of smell when processing odor mixtures
Pinquart Soziale Bedingungen psychischer Störungen
DE10160270A1 (de) Computersystem und Verfahren zur Berechnung von ADME-Eigenschaften
Mahabob et al. Preliminary study on classification of cymbopogon nardus essential oil using support vector machine (SVM)
Pintore et al. Comparing the information content of two large olfactory databases
Brown Komplexe Posttraumatische Belastungsstörung Heilen
DE10350525A1 (de) Verfahren zur Visualisierung der ADME-Eigenschaften chemischer Substanzen
EP4168970A1 (de) Verfahren zur bestimmung individueller pflegemittelformulierungen
Auffarth et al. Continuous spatial representations in the olfactory bulb may reflect perceptual categories
Debnath Odor impression prediction using natural language processing
Thieme et al. Novel Classification of Mono-Molecular Odorants using Standardized Semantic Profiles
Dudek et al. Classification of antituberculosis herbs for remedial purposes by using fuzzy sets

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20250130

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)