EP3997715A1 - Procede d'identification et de surveillance epidemiologique d'un foyer bacterien - Google Patents

Procede d'identification et de surveillance epidemiologique d'un foyer bacterien

Info

Publication number
EP3997715A1
EP3997715A1 EP20736332.6A EP20736332A EP3997715A1 EP 3997715 A1 EP3997715 A1 EP 3997715A1 EP 20736332 A EP20736332 A EP 20736332A EP 3997715 A1 EP3997715 A1 EP 3997715A1
Authority
EP
European Patent Office
Prior art keywords
bacterial
threshold
strains
focus
database
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Withdrawn
Application number
EP20736332.6A
Other languages
German (de)
English (en)
Inventor
Gaël KANEKO
Ghislaine GUIGON
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Biomerieux SA
Original Assignee
Biomerieux SA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Biomerieux SA filed Critical Biomerieux SA
Publication of EP3997715A1 publication Critical patent/EP3997715A1/fr
Withdrawn legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16HHEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
    • G16H50/00ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics
    • G16H50/80ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics for detecting, monitoring or modelling epidemics or pandemics, e.g. flu
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B20/00ICT specially adapted for functional genomics or proteomics, e.g. genotype-phenotype associations
    • G16B20/20Allele or variant detection, e.g. single nucleotide polymorphism [SNP] detection

Definitions

  • the present invention relates to the field of bacterial epidemiology, in particular the detection and monitoring of bacterial foci as a function of the genomes of bacterial strains, in particular the partial or total sequencing of the DNA and / or of the RNA of the strains. bacterial.
  • the detection of a bacterial infectious focus conventionally consists in determining whether several bacterial strains taken from subjects (eg from patients and by extension from animals) result from recent transmission of the same strain between patients. subjects, for example transmission of the strain to multiple subjects from a "source” subject or transmission of the strain from subject to subject. Based on conventional microbiological tools, detection is usually carried out in two stages:
  • the aim of the present invention is to provide a method for identifying and monitoring a bacterial focus based on comparison of bacterial genomes which offers freedom in terms of sensitivity and specificity while explicitly taking into account the sources of uncertainty in the prediction of the belonging of bacterial strains to the bacterial focus.
  • the invention relates to a method for detecting and monitoring a bacterial focus linked to a bacterial species within a geographical area, comprising:
  • the bacterial strain sampled and the bacterial strain in the database may belong to the bacterial focus if their genomic distance is between the first and the second threshold;
  • the first threshold is greater than or equal to a third threshold such that a prediction of belonging to the bacterial focus of two bacterial strains having a genomic distance less than the third threshold has maximum specificity
  • the second threshold is less than or equal to a fourth threshold such that a prediction of non-belonging to the bacterial focus of two bacterial strains having a genomic distance greater than the fourth threshold has maximum sensitivity.
  • two different thresholds are used to adjust the sensitivity and specificity of the process, the lower threshold being used to adjust the specificity of the prediction of belonging of a strain to the bacterial focus (hereinafter “ membership specificity ”) and the highest threshold being used to adjust the sensitivity of this prediction (hereinafter” membership sensitivity ").
  • membership specificity the specificity of the prediction of belonging of a strain to the bacterial focus
  • membership sensitivity the highest threshold being used to adjust the sensitivity of this prediction
  • the third and fourth thresholds previously learned to maximize the specificity and sensitivity of membership, define an area where it is difficult to know whether or not strains belong to the same focus due to incomplete or insufficiently diversified data for learn these thresholds, from ignorance of the mutation mechanisms that are heterogeneous within the bacterial species, imprecision of the process due to the choice of genomic comparison method or errors in characterization of infectious foci resulting from epidemiological surveys. This area of uncertainty offers the user flexibility in managing epidemics.
  • the user can set up a preliminary investigation, for example example by cross-checking with the patient's file from which the sample was taken or by analyzing its resistome, viruloma or phylogenic position in the biodiversity of the species, to decide whether or not an in-depth epidemiological investigation should be carried out .
  • the area between the third and fourth thresholds may in certain cases be too large such that the prediction based on these thresholds is not optimal.
  • the first and the second thresholds are equal to two calculated genomic distances:
  • said base comprising:
  • a first quality index of the predictor as a function of the confusion matrix, said first index being different from the sensitivity and the specificity of the predictor; a second quality index, different from the first index, as a function of the confusion matrix, said second index being different from the first index, from the sensitivity and the specificity of the predictor; - By searching for a first fifth threshold value which optimizes the first index and a second fifth threshold value which optimizes the second index;
  • a prediction based on maximum specificity and specificity of membership does not necessarily constitute an optimal prediction with regard to the available epidemiological data stored in the learning database.
  • the first index is chosen to take account of the imbalance, in the learning database, between the number of pairs of linked strains and the number of pairs of linked strains.
  • the first index is the Matthews correlation coefficient or the Fl score.
  • the data concerning bacterial foci that is to say the number of strains considered to be related, are much less numerous than the strains considered as unrelated.
  • the threshold corresponding to the Matthews coefficient or the Fl-score favors specificity without however taking only specificity into account.
  • the second index is the Youden index.
  • This index which explicitly takes into account specificity and sensitivity, naturally makes it possible to optimize the prediction of non-membership, the learning of which is usually carried out on important data.
  • the imbalance in the database causes Youden's index to be more influenced by sensitivity, with specificity close to 1 over the entire range between the third and fourth cutoffs.
  • the predictor is chosen so that:
  • the false positives correspond to pairs of unrelated strains having a genomic distance less than the fifth threshold; and - the true negatives correspond to pairs of unrelated strains having a genomic distance greater than the fifth threshold.
  • the epidemiological database includes the learning database.
  • the learning database is supplemented as the process is implemented, allowing the different thresholds to be refined as the base increases.
  • the genomic distance is a normalized distance. More specifically, the genomic distance between two bacterial strains is calculated by:
  • - the second threshold is set equal to 0, 1;
  • the first threshold is set equal to ma x (D g ⁇ D g ⁇ 0.2), where ma x (D g ⁇ D g ⁇ 0.2) is the greatest genomic distance, among the pairs of linked strains, strictly less than 0.2.
  • the inventors have observed that values greater than 0, 1, usually obtained due to an incomplete or insufficiently diverse training database, materialize a training failure.
  • the first and second thresholds are less than or equal to 0.1.
  • One of the two thresholds is thus fixed at this upper limit.
  • the inventors have observed that two strains of the same subtype have a very large majority of a genomic distance of less than 0.2.
  • max (d r ⁇ d r ⁇ 0.2) two strains of greater genomic distance than the latter, it is predicted that these strains do not belong to the same bacterial subtypes, and therefore do not belong to the same outbreak, which constitutes an important clue for the suspicion of an epidemic.
  • the distances between the digital genomes are calculated as a function of a base of markers, in particular a wgMLST, cgMLST, MLST base, of genes or of SNP.
  • a strain taken when a strain taken is predicted to belong to the bacterial focus, it is labeled in the epidemiological database as being “linked” with the bacterial strains of the bacterial focus and as being “not linked” with the others. bacterial strains.
  • an additional characterization of said strain is carried out to determine whether it actually belongs to said focus, and if this is the case the bacterial strain. collected is labeled, in the epidemiological database, as being "linked” with the bacterial strains of the bacterial focus and as being “unrelated” with the other bacterial strains.
  • the first and the second threshold are recalculated regularly and / or as soon as N new strains are added to the epidemiological database, where N is an integer greater than or equal to 1.
  • prophylactic measures are implemented to stop said focus.
  • FIG. 1 is a flowchart of an embodiment of the method according to the invention.
  • FIG. 2 illustrates a correspondence table between bacterial strains stored in a learning database
  • Figure 3 is a confusion matrix of a binary predictor predicting the related or unrelated state of two bacterial strains
  • FIG. 4 illustrates a distribution of the number of pairs of linked strains and a distribution of the number of pairs of unrelated strains as a function of their genomic distance as well as a threshold Ti used to calculate the confusion matrix of FIG. 3;
  • FIG. 5 is a plot illustrating different thresholds on the genomic distances used by the method according to the invention.
  • FIG. 6 illustrates a computer and sequencing system for implementing the method according to the invention
  • Figures 7A and 7B are distributions of the number of pairs of unrelated strains (upper distribution) and of the number of pairs of related strains (lower distribution) for the bacterial species Clostridium difficile, Figure 7B being an enlargement between 0 and 0.1 of Figure 7A;
  • FIG. 8A and 8B illustrate, for the Clostridium difficile species, the genomic distances for various optimal quality index values, including sensitivity, specificity, precision, accuracy ("accuracy" in English, ie ( TP + TN) / (N + P)), the Fl score, the Youden index, and the Matthews correlation coefficient, FIG. 8B being a magnification between 0 and 0.1 of FIG. 7B;
  • Figures 9A and 9B are distributions of the number of pairs of unrelated strains (upper distribution) and of the number of pairs of linked strains (lower distribution) for the bacterial species Staphylococcus aureus, Figure 9B being an enlargement between 0 and 0.1 of Figure 9A;
  • FIG. 10A and 10B illustrate, for the Staphylococcus aureus species, the genomic distances for various optimal quality index values, including sensitivity, specificity, precision, accuracy, Fl score, Youden index , and the Matthews correlation coefficient, FIG. 10B being a magnification between 0 and 0.1 of FIG. 10B;
  • this method comprises a first step 10 of learning at least two thresholds, denoted S1 and S2, on the basis of which genome comparisons are made to determine whether a bacterial strain belongs to no to a bacterial focus, and a second step 20 for implementing the method according to the invention, configured with the thresholds learned during step 10 More particularly, the method is based on the comparison of a genomic distance, denoted D g (BSi, BSj) between two strains, denoted B Si and BSj, Step 10 begins with the constitution, at 12, of a training database for the species considered comprising:
  • each link between two strains of the base being able to take a “linked” state (black boxes) when the two strains have been determined beforehand as belonging to the same bacterial focus, and an "unrelated" state (white boxes) when the two strains have been previously determined as not belonging to the same bacterial focus, the state of the link between two strains being for example determined during a previous epidemiological study.
  • the bond of a strain with respect to itself is fixed in the "related" state.
  • several infectious foci for the species considered can be taken into account to determine the “linked” and “unrelated” states of the strains of the training database.
  • the training database can also contain strains determined to be "related" without having been diagnosed as belonging to any bacterial focus.
  • said table also stores the genomic distances D g (BSi, BSj) between each pair of strains BSi and BSj of the training database;
  • the genome of a bacterial strain is preferably obtained by:
  • - sequencing preferably complete (or WGS sequencing), of the DNA so as to produce digital sequences, commonly called "read”, for example using a technology of the "next generation sequencing” type such as with the “MiSeq” sequencing platform from Illumina Inc., San Diego, California;
  • wgMLST profile the characterization according to the wgMLST technique (for “whole genome multilocus sequensing typing”) of the genome in the form of contig or reads, commonly called “wgMLST profile”.
  • this characterization consists in locating loci in the genome among a predetermined set of loci, and for each identified locus, in determining the allele which represents this locus.
  • the wgMLST technique is for example described in the document “MLST revisited: the gene-by-gene approach to bacterial genomics” by Martin C.J. Maiden, Nature Reviews Microbiology, 2013.
  • the learning continues with the calculation of thresholds SI and S2 based on the learning database. More particularly, this calculation consists in transforming:
  • a second predictor g Si, s2 whether or not two strains belong to a bacterial focus on the basis of two thresholds SI and S2 on the genomic distances Dg (BSi, BSj) dividing the space of genomic distances into three intervals : BSi and BSj strains are related
  • BSi and BSj are potentially related wuches BSi and BSj are not linked
  • the first predictor f T is defined such that: and the second predictor is defined as:
  • the genomic distance D g (BSi, BSj) is a normalized distance, and therefore between 0 and 1, calculated by:
  • the calculation of the thresholds SI and S2 begins, at 14, with the calculation of a confusion matrix MC (TV) of the binary predictor f T for each of the values Ti of a set [Tl, T2, ..., TM ⁇ of threshold values T between 0 and 1, for example with an increment of 10 -4 .
  • the calculation of the confusion matrix MC (Ti), illustrated in figure 3, for the threshold Ti is illustrated in figure 4 and consists of counting:
  • FNi - false negatives, noted “FNi”, equal to the total number of pairs of linked strains of the base such that D g (BSi, BSj)>Ti;
  • TNi the true negatives, noted “TNi”, equal to the total number of pairs of unrelated strains of the base such that D g (BSi, BSj) ⁇ Ti.
  • N is the number of pairs of unrelated strains
  • the threshold 57 optimizing a first quality index of the predictor f T , different from the sensitivity and specificity and taking into account explicitly the imbalance between the numbers P and TV, preferably the Matthews correlation coefficient (“MCC”), c 'that is to say
  • a step 18 of controlling the quality of the thresholds SI and 52 is then implemented. More particularly (the sign " ⁇ " meaning “such as”):
  • the thresholds 57 and 52 are less than or equal to 0.1, they are kept, meaning that the learning database is suitable for their calculation and subsequent use;
  • this threshold is then set to the minimum of the values 0, 1 and max (D g (BSi, BSj) ⁇ D g (BSi, BSj) ⁇ 0 , 2) if this minimum value is different from the other threshold (eg differs by more than 1%), otherwise this threshold is set at the maximum of these two values.
  • threshold 57 is less than the threshold 52, so that, as illustrated in Figure 4, these thresholds divide the space of genomic distances into three intervals:
  • Step 20 which takes place within the hospital to detect and monitor epidemics of a bacterial nature, is for example implemented systematically as soon as a patient has a bacterial infection, an environmental sample includes a pathogenic bacterium or a patient presents the same or similar symptoms to another patient within the hospital. Other criteria can of course be used to launch this step.
  • Step 20 begins, in 22, with the taking of a sample containing the pathogenic strain, if this sampling has not yet taken place, then continues, in 24, with the sequencing of the strain and the establishment of its wgMLST profile as described in relation to step 12.
  • the genomic distance D g (BSi, BSj) between the strain taken and each of the strains of the training database is then calculated.
  • a first epidemiological diagnosis is then issued in 28. More particularly:
  • the resistome and the viruloma of the strain taken are determined and then compared with the resistome and the viruloma of the strain to which it is potentially linked. If the resistomes and virulomas match, then the strains are determined to be related, the alarm is raised and the study conducted further. Otherwise, the strains are determined to be unrelated.
  • the in-depth study 30 is carried out.
  • Other information can be used during this complementary study, such as for example the time elapsed between the collection and that of the strain in the database, the number of different SNPs in the plastic genes, etc.
  • one of the objectives of study 30, carried out by the hospital epidemiology team, is to determine whether different strains taken from within the hospital constitute an epidemic.
  • the link between different strains is definitively established, ie “related” or “unrelated”. If, moreover, an epidemic is detected then the strains of the epidemic are also labeled according to this epidemic.
  • the genome, the wgMLST profiles, the resistome and the viruloma of the strain taken, its links with the other strains in the database as well as the information concerning the bacterial focus are then stored in the training database to be able to be used later.
  • the thresholds S1 and S2 can thus be updated regularly or at each new entry into the database in order to refine their values.
  • FIG. 6 illustrates a computer and sequencing system 40 for implementing the method according to the invention.
  • System 40 includes a sequencing platform 42 for sequencing bacterial DNA from a sample 44 and thereby producing a set of digital sequences, or "reads".
  • the platform 42 is connected to an information processing unit 46, for example a personal computer, which receives the sequences, and optionally sets a program for assembling reads to produce contigs.
  • the unit 46 is also connected to a remote server 48 implementing software as a service (or "Saas”), for example in the form of a cloud solution.
  • Unit 46 on which "front end" software runs, sends to server 48 the genomes sequenced by platform 42 in the form of reads or contigs.
  • the server 48 on which the IT service runs in the form of a “back end” and which is connected to the learning database 50, receives the genomes and implements the processing steps of the method according to the invention (eg steps 14-18 and 24-32 of FIG. 1), the server storing in a computer memory all of the instructions necessary for this implementation.
  • the server returns the results of the processing to the unit 46 in the form of a report 52.
  • the system 40 also includes one or more servers 54 connected to the unit 42, these servers being in particular those of the computer system storing patient and epidemiological data, these data being used in in-depth studies to characterize epidemiological bacterial foci.
  • Figures 7 and 9 illustrate distributions of the number of pairs of related strains and unrelated strains respectively for the species Clostridium difficile ( Figures 7A and 7B) and Staphylococcus aureus ( Figures 9A and 9B).
  • a genomic distance could code for both the "related" state or the "unrelated" state if only one threshold was employed.
  • This intermediate zone is naturally present and corresponds for example to strains belonging to the same subtype but not having been judged as belonging to the same bacterial focus.
  • the thresholds S3 maximum specificity, denoted “specificity”
  • S4 maximum sensitivity, denoted “sensitivity”
  • sensitivity maximum sensitivity
  • wgMLST core genome multilocus sequencing typing
  • MLST sets of SNPs or genes.
  • a training database was described which was also used for comparison with strains taken.
  • a separate database or "epidemiological database” can be employed to process the strains collected.
  • Such a base is for example specific to a hospital, an institution, a company or other, and the learning database is then used only to establish the value of the thresholds.

Landscapes

  • Health & Medical Sciences (AREA)
  • Public Health (AREA)
  • Engineering & Computer Science (AREA)
  • Medical Informatics (AREA)
  • General Health & Medical Sciences (AREA)
  • Biomedical Technology (AREA)
  • Data Mining & Analysis (AREA)
  • Databases & Information Systems (AREA)
  • Pathology (AREA)
  • Epidemiology (AREA)
  • Primary Health Care (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Physics & Mathematics (AREA)
  • Molecular Biology (AREA)
  • Analytical Chemistry (AREA)
  • Biophysics (AREA)
  • Genetics & Genomics (AREA)
  • Chemical & Material Sciences (AREA)
  • Proteomics, Peptides & Aminoacids (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Biotechnology (AREA)
  • Evolutionary Biology (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Theoretical Computer Science (AREA)
  • Measuring Or Testing Involving Enzymes Or Micro-Organisms (AREA)
  • Medical Treatment And Welfare Office Work (AREA)

Abstract

L'invention a pour objet un procédé de détection et de surveillance d'un foyer bactérien comprenant la prédiction qu'une souche bactérienne prélevée et une souche bactérienne d'une base de données appartiennent au foyer bactérien si leur distance génomique est inférieure à un premier seuil prédéterminé, n'appartiennent pas au foyer bactérien si leur distance génomique est supérieure à un second seuil prédéterminé strictement supérieur au premier seuil, ou appartiennent peut être au foyer bactérien si leur distance génomique est comprise. Le premier seuil est supérieur ou égal à un troisième seuil tel qu'une prédiction d'appartenance au foyer bactérien de deux souches bactériennes ayant une distance génomique inférieure au troisième seuil a une spécificité maximale. Le second seuil est inférieur ou égal à un quatrième seuil tel qu'une prédiction de non appartenance au foyer bactérien de deux souches bactériennes ayant une distance génomique supérieure au quatrième seuil a une sensibilité maximale.

Description

PROCEDE D’IDENTIFICATION ET DE SURVEILLANCE EPIDEMIOLOGIQUE D’UN FOYER
BACTERIEN
DOMAINE DE L’INVENTION
La présente invention a trait au domaine de l’épidémiologie bactérienne, en particulier la détection et la surveillance de foyers bactériens en fonction des génomes de souches bactériennes, notamment le séquençage partiel ou total de l’ADN et/ou de l’ARN des souches bactériennes.
ETAT DE LA TECHNIQUE
La détection d’un foyer infectieux (ou « outbreak ») bactérien consiste classiquement à déterminer si plusieurs souches bactériennes prélevées chez des sujets (e.g. des patients et par extension chez des animaux) résultent d’une transmission récente d’une même souche entre les sujets, par exemple la transmission de la souche à plusieurs sujets depuis un sujet « source » ou la transmission de la souche de sujet à sujet. En se fondant sur les outils microbiologiques classiques, la détection est usuellement réalisée en deux temps :
a. dans un premier temps en suspectant un foyer bactérien, cette suspicion survenant lorsque des souches prélevées appartiennent à la même espèce bactérienne et partagent des caractéristiques phénotypiques communes, par exemple un antibiogramme identique ou voisin pour les bactéries pathogènes ;
b. et en cas de suspicion en menant une enquête épidémiologique visant à démontrer, ou infirmer, que ces souches résultent bien d’une transmission entre sujets. Ce type d’enquête consiste notamment à rechercher si les sujets objets des prélèvements ont été récemment en contact, ont partagé une même localisation (e.g. une même salle d’opération ou une même chambre dans un hôpital), ont été soignés par un même personnel soignant, etc. Ce type d’enquête est le plus souvent long et fastidieux, mobilise beaucoup de personnes. En outre, une enquête peut perturber grandement le fonctionnement d’une institution ou d’une société suspectée d’être l’objet d’une épidémie dans la mesure où des mesures prophylactiques sont le plus souvent mises en œuvre avant la fin de l’enquête, comme par exemple la mise en quarantaine d’une chambre, d’un service ou la fermeture d’une salle d’opération.
Dans ce contexte, l’avènement du séquençage, en particulier les séquençages du type WGS (« whole genome sequencing », séquençage de génome entier en français) représente une avancée notable dans l’épidémiologie bactérienne puisqu’un génome bactérien entier contient un niveau d’information bien plus important que celui délivré par les techniques microbiologiques classiques. Non seulement, les critères pour décider de lancer une étude épidémiologiques sont plus précis mais de plus l’emploi de la génomique peut également grandement simplifier et normaliser celle-ci. Par exemple, si deux souches de staphylocoques dorés, prélevées au sein du même service hospitalier à quelques jours d’intervalle, sont strictement identiques du point de vue génomique, il peut être déterminé sans autre information que les deux souches font bien partie d’un même foyer bactérien.
Si le séquençage se révèle une avancée notable, il ne permet cependant pas à lui seul de déterminer la lignée de deux souches bactériennes quelle que soit l’espèce. En effet, certaines espèces bactériennes ont un génome plastique évoluant très rapidement en l’espace de quelques jours, et ce d’autant plus qu’un traitement antibiotique est mis en œuvre, de sorte qu’une stricte identité entre génomes ne peut être utilisée comme seul critère. Pour tenir compte de cette plasticité, des procédés de détection de foyers bactériens consistent à évaluer que des souches bactériennes appartiennent à un même foyer si leur différence génomique, par exemple calculée en fonction du nombre de polymorphismes d’un seul nucléotide (ou « single-nucleotide polymorphism» en anglais), est inférieure à un seuil prédéterminé. Comme décrit dans l’article « Beyond the SNP threshold : identijying outbreak clusters using infer red transmission » de J. Simson et al, dec. 2018, cette approche est cependant peu précise en raison de nombreuses sources d’incertitude, comme par exemple le contexte dans lequel évoluent les bactéries ou la variabilité du taux de mutation en fonction des espèces. Les auteurs de cet article proposent ainsi de tenir compte également de la chronologie des prélèvements d’échantillon contenant les souches bactériennes et de connaissances a priori sur les mécanismes de mutation et de transmission des souches bactériennes.
Outre la complexification des modèles de prédiction épidémiologiques, l’emploi d’un unique seuil mène nécessairement à un compromis difficile entre sensibilité et spécificité de la prédiction. D’un côté si la prédiction d’appartenance à un foyer bactérien est trop sensible mais trop peu spécifique, le déclenchement des enquêtes épidémiologiques menant à infirmer le caractère épidémique d’un évènement est trop fréquent, ce qui implique un coût important en termes de ressources, de fonctionnement et de budget. D’un autre côté si la prédiction d’appartenance à un foyer est peu sensible, alors des foyers bactériens ne sont pas détectés, avec des conséquences graves en termes de santé, par exemple celle de patients ou de consommateurs.
EXPOSE DE L’INVENTION
Le but de la présente invention est de proposer un procédé d’identification et de surveillance d’un foyer bactérien à base de comparaison de génomes bactériens qui offre une liberté en termes de sensibilité et de spécificité tout en tenant compte explicitement des sources d’incertitude dans la prédiction d’appartenance de souches bactériennes au foyer bactérien.
A cet effet, l’invention a pour objet un procédé de détection et de surveillance d’un foyer bactérien lié à une espèce bactérienne au sein d’une zone géographique, comprenant :
- l’obtention d’un génome numérique d’une souche bactérienne prélevée au sein de la zone géographique et appartenant à l’espèce bactérienne ;
- le calcul d’une distance génomique du génome numérique obtenu avec un génome numérique d’une base de données, dite « épidémiologique », comprenant au moins un génome numérique d’une souche bactérienne appartenant à l’espèce bactérienne;
- la prédiction :
o que la souche bactérienne prélevée et la souche bactérienne de la base de données appartiennent au foyer bactérien si leur distance génomique est inférieure à un premier seuil prédéterminé ; ou
o que la souche bactérienne prélevée et la souche bactérienne de la base de données n’appartiennent pas au foyer bactérien si leur distance génomique est supérieure à un second seuil prédéterminé strictement supérieur au premier seuil ; ou
o que la souche bactérienne prélevée et la souche bactérienne de la base de données appartiennent peut être au foyer bactérien si leur distance génomique est comprise entre le premier et le second seuil ;
procédé selon lequel :
- le premier seuil est supérieur ou égal à un troisième seuil tel qu’une prédiction d’appartenance au foyer bactérien de deux souches bactériennes ayant une distance génomique inférieure au troisième seuil a une spécificité maximale ; et
- le second seuil est inférieur ou égal à un quatrième seuil tel qu’une prédiction de non appartenance au foyer bactérien de deux souches bactériennes ayant une distance génomique supérieure au quatrième seuil a une sensibilité maximale.
En d’autres termes, deux seuils différents sont utilisés pour régler la sensibilité et la spécificité du procédé, le seuil le plus bas étant utilisé pour régler la spécificité de la prédiction d’appartenance d’une souche au foyer bactérien (ci-après « spécificité d’appartenance ») et le seuil le plus haut étant utilisé pour régler la sensibilité de cette prédiction (ci-après « sensibilité d’appartenance »). La zone comprise entre ces deux seuils est ainsi spécifiquement prévue pour tenir compte des incertitudes inhérentes à une prédiction basée sur des distances génomiques. En particulier les troisième et quatrième seuils, préalablement appris pour maximiser la spécificité et la sensibilité d’appartenance, définissent une zone où il est difficile de savoir si des souches appartiennent ou non à un même foyer en raison de données incomplètes ou trop peu diversifiées pour apprendre ces seuils, de méconnaissance des mécanismes de mutation qui sont hétérogènes au sein de l’espèce bactérienne, d’une imprécision du procédé en raison du choix de la méthode de comparaison génomique ou encore des erreurs de caractérisation des foyers infectieux résultant des enquêtes épidémiologiques. Cette zone d’incertitude offre à l’utilisateur une souplesse dans la gestion des épidémies. En particulier, contrairement à la prédiction d’appartenance au foyer bactérien qui déclenche une enquête épidémiologique et des mesures prophylactiques pour endiguer le foyer bactérien, lorsqu’une souche est dans la zone intermédiaire, l’utilisateur peut mettre en place une enquête préliminaire, par exemple en recoupant avec le dossier du patient sur lequel le prélèvement a été réalisé ou en analysant son résistome, son virulome ou sa position phylogénique dans la biodiversité de l’espèce, pour décider si oui ou non une enquête épidémiologique poussée doit être mise en œuvre. Par ailleurs, la zone comprise entre les troisième et quatrième seuils peut dans certain cas être trop importante de sorte que la prédiction basée sur ces seuils n’est pas optimale. Les premier et second seuils, définissant une zone strictement comprise entre les troisième et quatrième seuils, autorisent une optimisation analytique de la prédiction d’appartenance ou de non appartenance au foyer bactérien.
Selon un mode de réalisation, le premier et le second seuils sont égaux à deux distances génomiques calculées :
- en constituant une base de données d’apprentissage de génomes numériques de souches bactériennes appartenant à l’espèce bactérienne, ladite base comprenant :
o des couples de souches bactériennes préalablement déterminées comme appartenant à un même foyer bactérien, et étiquetés comme « couples de souches reliées » ; o des couples de souches bactériennes préalablement déterminée comme n’appartenant pas à un même foyer bactérien, et étiquetés comme « couples de souches non reliées » ;
- en choisissant un prédicteur binaire configuré pour prédire que deux souches bactériennes sont reliées ou non reliées par comparaison de leur distance génomique à un cinquième seuil ;
- pour chaque valeur de cinquième seuil appartenant à un ensemble prédéterminé de valeurs de cinquième seuil, en calculant
o une matrice de confusion dudit prédicteur en fonction de la base de données d’apprentissage ;
o un premier index de qualité du prédicteur en fonction de la matrice de confusion, ledit premier index étant différent de la sensibilité et de la spécificité du prédicteur ; o un second index de qualité, différent du premier index, en fonction de la matrice de confusion, ledit second index étant différent du premier index, de la sensibilité et de la spécificité du prédicteur ; - en recherchant une première valeur de cinquième seuil qui optimise le premier index et une seconde valeur de cinquième seuil qui optimise le second index ;
- en posant le premier seuil comme égal au minimum de la première et de la seconde valeurs de cinquième seuil et en posant le second seuil comme égal au maximum de la première et de la seconde valeurs de cinquième seuil.
En d’autres termes, une prédiction basée sur une spécificité et une spécificité d’appartenance maximales ne constituent pas nécessairement une prédiction optimale au regard des données épidémiologiques disponibles, stockées dans la base de données d’apprentissage. En calculant des premier et second seuils qui optimisent la qualité de la prédiction binaire, il est obtenu de fait une optimisation de la gestion des évènements épidémiques, tout en conservant une zone intermédiaire suffisamment large pour continuer d’alerter l’utilisateur d’un possible foyer bactérien.
Selon un mode de réalisation, le premier index est choisi pour tenir compte du déséquilibre, dans la base de données d’apprentissage, entre le nombre de couples de souches reliées et le nombre de couples de souches reliées. En particulier, le premier index est le coefficient de corrélation de Matthews ou le Fl score. D’une manière générale, les données concernant les foyers bactériens, c’est-à-dire le nombre de souches considérées comme reliées, sont bien moins nombreuses que les souches considérées comme non reliées. En utilisant un index de qualité qui prend explicitement en compte ce déséquilibre, une meilleure optimisation de la prédiction est obtenue. En outre, le seuil correspondant au coefficient de Matthews ou du Fl -score privilégie la spécificité sans pour autant ne prendre que la spécificité en compte.
Selon un mode de réalisation, le second index est l’index de Youden. Cet index, qui prend explicitement en compte la spécificité et la sensibilité permet naturellement d’optimiser la prédiction de non appartenance dont l’apprentissage est réalisée usuellement sur une donnée importante. Le déséquilibre de la base de données a pour effet que l’index de Youden est plus influencé par la sensibilité, la spécificité étant proche de 1 sur tout l’intervalle compris entre les troisième et quatrième seuils.
Selon un mode de réalisation, le prédicteur est choisi de sorte que :
- les vrais positifs correspondent aux couples de souches reliées ayant une distance génomique inférieure au cinquième seuil :
- les faux négatifs correspondent aux couples de souches reliées ayant une distance génomique supérieure au cinquième seuil ;
- la faux positifs correspondent aux couples de souches non reliées ayant une distance génomique inférieure au cinquième seuil ; et - les vrais négatifs correspondent aux couples de souches non reliées ayant une distance génomique supérieure au cinquième seuil.
Selon un mode de réalisation, la base de données épidémiologique comprend la base de données d’apprentissage. En d’autres termes, la base de données d’apprentissage est complétée à mesure que le procédé est mise en œuvre, ce qui permet de raffiner les différents seuils à mesure que la base augmente.
Selon un mode de réalisation, la distance génomique est une distance normalisée. Plus particulièrement, la distance génomique entre deux souches bactériennes est calculée en :
- sélectionnant, dans un ensemble prédominé de loci, les loci communs aux génomes numériques desdites souches ;
- comptant le nombre de différences alléliques, aux loci communs, entre les deux génomes numériques desdites souches ;
- en divisant ledit nombre de différences par le nombre de loci communs.
En normalisant par le nombre de loci en communs, l’impact des erreurs de séquençage, en particulier le fait de ne pas identifier un loccus chez une souche bactérienne, est atténué.
Selon un mode de réalisation privilégié, si les premières et secondes valeurs de cinquième seuil sont supérieures à 0,1, alors :
- le second seuil est posé égal à 0, 1 ;
- le premier seuil est posé égal à ma x(Dg\Dg < 0,2), où ma x(Dg\Dg < 0,2) est la plus grande distance génomique, parmi les couples de souches reliées, strictement inférieure à 0,2.
En particulier, les inventeurs ont constaté que des valeurs supérieures à 0, 1, obtenues usuellement en raison d’une base de données d’apprentissage incomplète ou trop peu diverse, matérialisent un échec de l’apprentissage. Les inventeurs ont de plus noté que dans le cadre d’une base de données d’apprentissage appropriée, les premier et second seuils sont inférieurs ou égaux à 0,1. Un des deux seuils est ainsi fixé à cette borne supérieure. Par ailleurs, les inventeurs ont constaté que deux souches de même sous-type ont en très grande majorité une distance génomique inférieure à 0,2. Ainsi en posant l’autre seuil égal à max(dr\dr < 0,2), deux souches de distance génomique supérieure à ce dernier, il est prédit que ces souches n’appartiennent pas au même sous-types bactérien, et donc n’appartiennent pas au même foyer, ce qui constitue un indice important pour la suspicion d’épidémie. Ainsi, alors même que les données sont encore insuffisantes pour calculer avec précision les premier et second seuils, l’utilisateur dispose d’un procédé par défaut. Selon un mode de réalisation, les distances entre les génomes numériques sont calculées en fonction d’un base de marqueurs, en particulier une base wgMLST, cgMLST, MLST, de gènes ou de SNP.
Selon un mode de réalisation, lorsqu’une souche prélevée est prédite comme appartenant au foyer bactérien, elle est étiquetée dans la base de donnée épidémiologique comme étant « reliée » avec les souches bactériennes du foyer bactérien et comme étant « non reliée » avec les autres souches bactériennes.
Selon un mode de réalisation, lorsqu’une souche prélevée est prédite comme appartenant peut- être au foyer bactérien, une caractérisation supplémentaire de ladite souche est mise en œuvre pour déterminer si elle appartient effectivement audit foyer, et si tel est le cas la souche bactérienne prélevée est étiquetée, dans la base de donnée épidémiologique, comme étant « reliée » avec les souches bactériennes du foyer bactérien et comme étant « non reliée » avec les autres souches bactériennes.
Selon un mode de réalisation, le premier et le second seuil sont recalculés régulièrement et/ou dès que N nouvelles souches sont ajoutées à la base de données épidémiologique, où N est un entier supérieur ou égal à 1.
Selon un mode de réalisation, lorsqu’une souche est prédite comme appartenant au foyer bactérien, des mesures prophylactiques sont mises en œuvre pour enrailler ledit foyer.
BREVE DESCRIPTION DES FIGURES
L’invention sera mieux comprise à la lecture de la description qui va suivre, donnée uniquement à titre d’exemple, et faite en relation avec les dessins annexés, dans lesquels des références identiques désignent des éléments identiques, et dans lesquels :
- la figure 1 est un organigramme d’un mode de réalisation du procédé selon l’invention ;
- la figure 2 illustre une table de correspondance entre souches bactériennes mémorisées dans une base de données d’apprentissage ;
- la figure 3 est une matrice de confusion d’un prédicteur binaire prédisant l’état reliées ou non reliées de deux souches bactériennes ;
- la figure 4 illustre une distribution du nombre de couples de souches reliées et une distribution du nombre de couples de souches non reliées en fonction de leur distance génomique ainsi qu’un seuil Ti utilisé pour calculer la matrice de confusion de la figure 3 ; - la figure 5 est un tracé illustrant différents seuils sur les distances génomiques utilisés par le procédé selon l’invention ;
- la figure 6 illustre un système informatique et de séquençage pour la mise en œuvre du procédé selon l’invention ;
- les figures 7A et 7B sont des distributions du nombre de couples de souches non reliées (distribution supérieure) et du nombre de couples de souches reliées (distribution inférieure) pour l’espèce bactérienne Clostridium difficile , la figure 7B étant un agrandissement entre 0 et 0,1 de la figure 7A ;
- les figures 8 A et 8B illustrent, pour l’espèce Clostridium difficile, les distances génomiques pour différentes valeurs optimales d’indice de qualité, dont la sensibilité, la spécificité, la précision, la justesse (« accuracy » en anglais, i.e. (TP + TN)/(N + P)), le Fl score, l’indice de Youden, et le coefficient de corrélation de Matthews, la figure 8B étant un agrandissement entre 0 et 0,1 de la figure 7B ;
- les figures 9A et 9B sont des distributions du nombre de couples de souches non reliées (distribution supérieure) et du nombre de couples de souches reliées (distribution inférieure) pour l’espèce bactérienne Staphylococcus aureus, la figure 9B étant un agrandissement entre 0 et 0,1 de la figure 9A ;
- les figures 10A et 10B illustrent, pour l’espèce Staphylococcus aureus, les distances génomiques pour différentes valeurs optimales d’indice de qualité, dont la sensibilité, la spécificité, la précision, la justesse, le Fl score, l’indice de Youden, et le coefficient de corrélation de Matthews, la figure 10B étant un agrandissement entre 0 et 0,1 de la figure 10B ;
DESCRIPTION DETAILLEE DE L’INVENTION
Dans ce qui suit « inférieur » signifie « inférieur ou égal » et même « supérieur» signifie « supérieur ou égal » sauf s’il est stipulé strictement.
Il va à présent être décrit un mode de réalisation de l’invention en relation avec la détection et le suivi de foyers infectieux microbiologiques d’une espèce bactérienne particulière dans un hôpital.
En se référant à la figure 1, ce procédé comporte une première étape 10 d’apprentissage d’au moins deux seuils, notés SI et S2, sur la base desquels des comparaisons de génomes sont réalisées pour déterminer si une souche bactérienne appartient à non à un foyer bactérien, et une seconde étape 20 de mise en œuvre du procédé selon l’invention, paramétré avec les seuils appris lors de l’étape 10 Plus particulièrement, le procédé se fonde sur la comparaison d’une distance génomique, notée Dg(BSi, BSj ) entre deux souches, notées B Si et BSj, L’étape 10 débute par la constitution, en 12, d’une base de données d’apprentissage pour l’espèce considérée comprenant :
- des génomes numériques de différentes souches BS1, BS2, BS3... BSN appartenant à l’espèce ;
- une table de correspondance, illustrée à la figure 2, reliant chaque souche de la base de données à l’ensemble des autres souches, chaque lien entre deux souches de la base pouvant prendre un état « reliées » (cases noires) lorsque les deux souches ont été préalablement déterminées comme appartenant à un même foyer bactérien, et un état « non reliées » (cases blanches) lorsque les deux souches ont été préalablement déterminées comme n’appartenant pas à un même foyer bactérien, l’état du lien entre deux souches étant par exemple déterminé lors d’une étude épidémiologique antérieure. En outre, le lien d’une souche par rapport à elle-même est fixée à l’état « reliées ». Comme visible à la figure 2, plusieurs foyers infectieux pour l’espèce considérée peuvent être pris en compte pour déterminer les états « reliées » et « non reliées » des souches de la base de données d’apprentissage. Comme il sera décrit par la suite, la base de données d’apprentissage peut également contenir des souches déterminées comme étant « reliées » sans pour autant avoir été diagnostiquée comme appartenant à un quelconque foyer bactérien. De préférence, ladite table mémorise également les distances génomiques Dg(BSi, BSj ) entre chaque paire de souches BSi et BSj de la base de données d’apprentissage ;
- une table qui répertorie l’ensemble des foyers infectieux identifiés avec leurs souches associées ;
- les résistomes (ensemble de marqueurs génétiques contribuant à la sensibilité ou la résistance aux antibiotiques d’une bactérie) et les virulomes (ensemble de marqueurs génétiques contribuant à la virulence d’une bactérie) des souches BSI, BS2, BS3...., BSN ;
Le génome d’une souche bactérienne est de préférence obtenu par :
- le prélèvement d’un échantillon chez un patient comprenant la souche;
- la préparation d’un isolat de la souche, par exemple en étalant G échantillon sur un milieu de culture gélosé et en réalisant une incubation de manière à faire pousser une colonie de la souche bactérienne ;
- le prélèvement d’une partie de la colonie et la préparation de la quantité prélevée pour un séquençage (e.g. une lyse pour libérer l’ADN des bactéries, le cas échéant amplification de l’ADN libéré et la préparation d’une librairie pour les techniques de séquençage le nécessitant) ; - le séquençage, de préférence complet (ou séquençage WGS), de l’ADN de manière à produire des séquences numériques, communément appelées « read », par exemple à l’aide d’une technologie de type « next génération sequencing » telle qu’avec la plateforme de séquençage « MiSeq » de la société Illumina Inc., San Diego, Californie;
- optionnellement, l’assemblage des reads de manière à produire des séquences assemblées, connues sous le terme de « contig » ;
- la caractérisation selon la technique wgMLST (pour « whole genome multilocus sequensing typing ») du génome sous forme de contig ou de reads, communément appelé « profil wgMLST ». Comme cela est connu en soi, cette caractérisation consiste à localiser des loci dans le génome parmi un ensemble prédéterminé de loci, et pour chaque locus identifié, à déterminer l’allèle qui représente ce locus. La technique wgMLST est par exemple décrite dans le document « MLST revisited: the gene-by-gene approach to bacterial genomics» de Martin C.J. Maiden, Nature Reviews Microbiology, 2013.
L’apprentissage se poursuit par le calcul de seuils SI et S2 en fonction de la base de données d’apprentissage. Plus particulièrement, ce calcul consiste à transformer :
- un premier prédicteur fT d’appartenance ou non de deux souches à un foyer bactérien sur la base d’un unique seuil T sur les distances génomiques Dg(BSi, BSj) divisant l’espace des distances génomiques en deux intervalles uniquement:
1 si les souches BSi et BSj sont reliées
si les souches BSi et BSj sont non reliées
- en un second prédicteur gSi,s2 d’appartenance ou non de deux souches à un foyer bactérien sur la base de deux seuils SI et S2 sur les distances génomiques Dg{BSi, BSj ) divisant l’espace des distances génomiques en trois intervalles : souches BSi et BSj sont reliées
BSi et BSj sont potentiellement reliées wuches BSi et BSj sont non reliées
Dans une variante privilégiée, le premier prédicteur fT est défini tel que : et le second prédicteur est défini tel que : De préférence, la distance génomique Dg(BSi, BSj) est une distance normalisée, et donc comprise entre 0 et 1, calculée en :
a. identifiant dans les profils wgMLST des deux souches BSi et BSj les loci qu’elles ont en commun ;
b. pour chaque locus commun, en déterminant s’il existe une différence allélique entre les deux souches, et dans ce cas en incrémentant de 1 un compteur Compt de différences alléliques si au moins une différence allélique est constatée;
c. en calculant Dg(BSi, BSj ) selon la formule suivante, avec Nlc est le nombre de loci en commun:
Compt
Dg(BSi, BSj )
Nlc
Le calcul des seuils SI et S2 débute, en 14, par le calcul d’une matrice de confusion MC (TV) du prédicteur binaire fT pour chacune des valeurs Ti d’un ensemble [Tl, T2, ... , TM } de valeurs de seuils T comprises entre 0 et 1, par exemple avec un incrément de 10-4. Le calcul de la matrice de confusion MC(Ti ), illustrée à la figure 3, pour le seuil Ti est illustrée à la figure 4 et consiste à compter :
- les vrais positifs, notés « TPis », égal au nombre total de couples de souches reliées de la base tel que Dg(BSi, BSj ) < Ti ;
- les faux négatifs, notés « FNi », égal au nombre total de couples de souches reliées de la base tel que Dg(BSi, BSj ) > Ti ;
- la faux positifs, notés « FPi », égal au nombre total de couples de souches non reliées de la base tel que Dg(BSi, BSj ) < Ti ; et
- les vrais négatifs, notés « TNi », égal au nombre total de couples de souches non reliées de la base tel que Dg(BSi, BSj ) < Ti .
Une fois l’ensemble des matrices de confusion {MC (Tl), MC (T2, ... , MC (TM))} calculé, le procédé se poursuit, en 16, par le calcul de différents seuils illustrés à la figure 5:
- un seuil S3 tel que la spécificité du prédicteur fT est maximale, et donc tel que la spécificité de la prédiction que deux souches sont reliées est maximale, c’est-à-dire
53 où N est le nombre de couples de souches non reliées ;
- un seuil S4 tel que la sensibilité du prédicteur fT est maximale, et donc tel que la sensibilité de la prédiction que deux souches sont non reliées est maximale, c’est-à-dire
TPi\
54 = arg max y— J, où P est le nombre de couples de souches reliées; - le seuil 57 optimisant un premier index de qualité du prédicteur fT, différent de la sensibilité et de la spécificité et tenant compte explicitement du déséquilibre entre les nombres P et TV, préférentiellement le coefficient de corrélation de Matthews (« MCC »), c’est-à-dire
- le seuil S2 optimisant un second index de qualité du prédicteur fT , différent de la sensibilité et de la spécificité, préférentiellement l’index de Youden, c’est-à-dire 52 =
Une étape 18 de contrôle de la qualité des seuils SI et 52 est ensuite mise en œuvre. Plus particulièrement (le signe « \ » signifiant « tel que » ):
- si les seuils 57 et 52 sont inférieurs ou égaux à 0,1, ils sont conservés, signifiant que la base de données d’apprentissage est appropriée pour leur calcul et leur usage ultérieur ;
- si les seuils 57 et 52 sont supérieurs à 0, 1 ou diffèrent de moins de 1% , alors leurs valeurs sont fixées à 0, 1 et M = max(Dg(BSi, BSj)\Dg(BSi, BSj) < 0,2) , où max(Dg(BSi, BSj)\Dg(BSi, BSj) < 0,2) est ici la distance génomique maximale qui est la plus proche de 0,2 parmi les couples de souches reliées de la base de données d’apprentissage;
- si l’un des seuils 57 ou 52 est supérieur à 0,1, ce seuil est alors fixé à au minimum des valeur 0, 1 et max(Dg(BSi, BSj)\Dg(BSi, BSj) < 0,2) si cette valeur minimale est différente de l’autre seuil (e.g. diffère de plus de 1%), sinon ce seuil est fixé au maximum de ces deux valeurs.
Par soucis de simplification, il sera supposé par la suite que le seuil 57 est inférieur au seuil 52, de sorte que, comme illustré à la figure 4, ces seuils divisent l’espace des distances génomiques en trois intervalles :
- un intervalle inférieur ] 0, 51] . Si la distance génomique entre deux souches est comprise dans cet intervalle, ces souches sont prédites comme étant « reliées » (,Ç7SI,S2 = 1);
- un intervalle supérieur ]52, 1] . Si la distance génomique entre deux souches est comprise dans cet intervalle, ces souches sont prédites comme étant « non reliées »
( 9SI,S2 =— 1) i et
- un intervalle intermédiaire ]51, 52] Si la distance génomique entre deux souches est comprise dans cette intervalle, ces souches sont prédites comme « potentiellement reliées » ( gsl S2 = 0) .
Les seuils 57 et 52 sont alors mémorisés dans une mémoire informatique d’un système informatique utilisé pour mettre en œuvre l’étape 20 à présent décrite, ledit système comprenant en outre la base de données d’apprentissage. L’étape 20, qui prend place au sein de l’hôpital pour détecter et surveiller les épidémies de nature bactérienne, est par exemple mise en œuvre de manière systématique dès qu’un patient est atteint d’une infection bactérienne, qu’un échantillon environnemental comprend une bactérie pathogène ou qu’un patient présente des symptômes identiques ou similaires à un autre patient au sein de l’hôpital. D’autres critères peuvent bien entendu être employés pour lancer cette étape.
L’étape 20 débute, en 22, par le prélèvement d’un échantillon contenant la souche pathogène, si ce prélèvement n’a pas encore eu lieu, puis se poursuit, en 24, par le séquençage de la souche et l’établissement de son profil wgMLST tel que décrit en relation avec l’étape 12. En 26, la distance génomique Dg(BSi, BSj) entre la souche prélevée et chacune des souches de la base de données d’apprentissage est ensuite calculée. Un premier diagnostic épidémiologique est alors émis en 28. Plus particulièrement :
- si la souche prélevée n’est reliée à aucune souche de la base de données, c’est-à-dire que quel que soit la souche de la base de données la distance génomique Dg(BSi, BSj ) avec la souche prélevée est supérieure au seuil S2, alors il est déterminé que la souche prélevée n’appartient à aucun foyer bactérien ;
- si la souche prélevée est reliée à une souche de la base de données, c’est-à-dire que ces deux souches ont une distance génomique Dg(BSi, BSj ) inférieure ou égale au seuil SI, une alarme est déclenchée à l’attention de l’utilisateur et une étude épidémiologique approfondie 30 est lancée ainsi que, le cas échéant, des mesures prophylactiques pour lutter contre la transmission de la souche prélevée au sein de l’hôpital ;
- si la souche prélevée est potentiellement reliée à une souche de la base de données (noté « reliées ? » dans la figure 1), c’est-à-dire que ces deux souches ont une distance génomique Dg(BSi, BSj ) comprise entre les seuils SI et S2, une analyse complémentaire est menée, en 34, pour lever l’incertitude sur le lien entre ces deux souches. De manière préférentielle, le résistome et le virulome de la souche prélevée est déterminé puis comparé au résistome et le virulome de la souche à laquelle elle est potentiellement reliée. Si les résistomes et les virulomes sont concordants, les souches sont alors déterminées comme étant reliées, l’alarme est déclenchée et l’étude approfondie 30 menée. Dans le cas contraire, les souches sont déterminées comme étant non reliées. Enfin dans le cas où cette comparaison ne permet pas de trancher, l’étude approfondie 30 est menée. D’autres informations peuvent être utilisées lors de cette étude complémentaire, comme par exemple la durée écoulée entre le prélèvement et celui de la souche de la base de données, le nombre de SNP différents dans les gènes plastiques, etc.
Comme cela est connu en soi, un des objectifs de l’étude 30, menée par l’équipe d’épidémiologie de l’hôpital, est de déterminer si différentes souches prélevées au sein de l’hôpital constituent une épidémie. A l’issue de cette étude, le lien entre différentes souches est définitivement établi, à savoir « reliées » ou « non reliées ». Si par ailleurs une épidémie est détectée alors les souches de l’épidémie sont également étiquetées en fonction de cette épidémie. Le génome, le profils wgMLST, le resistome et le virulome de la souche prélevée, ses liens avec les autres souches de la base de données ainsi que les informations concernant le foyer bactérien sont ensuite mémorisés dans la base de données d’apprentissage pour pouvoir être utilisés ultérieurement. Les seuils SI et S2 peuvent être ainsi actualisés régulièrement ou à chaque nouvelle entrée dans la base de données afin d’affiner leurs valeurs.
La figure 6 illustre un système informatique et de séquençage 40 pour la mise en œuvre du procédé selon l’invention. Le système 40 comporte une plateforme de séquençage 42 pour séquencer l’ADN bactérien d’un échantillon 44 et ainsi produire un ensemble de séquence numériques, ou « reads ». La plateforme 42 est connectée à une unité de traitement d’information 46, par exemple un ordinateur personnel, qui reçoit les séquences, et met optionnellement un programme d’assemblage des reads pour produire des contigs. L’unité 46 est par ailleurs connectée à un serveur distant 48 mettant en œuvre un logiciel en tant que service (ou « Saas »), par exemple sous la forme d’une solution cloud. L’unité 46, sur lequel tourne un logiciel « front end », envoie au serveur 48 les génomes séquencés par la plateforme 42 sous forme de reads ou de contigs. Le serveur 48, sur lequel tourne le service informatique sous forme de « back end » et qui est connecté à la base de données d’apprentissage 50, reçoit les génomes et met en œuvre les étapes de traitement du procédé selon l’invention (e.g. les étapes 14-18 et 24-32 de la figure 1), le serveur mémorisant dans une mémoire informatique l’ensemble des instructions nécessaires à cette mise en œuvre. Le serveur renvoie les résultats du traitement à l’unité 46 sous la forme d’un rapport 52. Le système 40 comporte également un ou plusieurs serveurs 54 connecté(s) à l’unité 42, ces serveurs étant notamment ceux du système informatique mémorisant les données patients et épidémiologiques, ces données étant utilisées lors des études approfondies pour caractériser les foyers bactériens épidémiologiques.
Les figures 7 et 9 illustrent des distributions du nombre de couples de souches reliées et de souches non reliées respectivement pour l’espèce Clostridium difficile (figures 7 A et 7B) et Staphylococcus aureus (figures 9A et 9B). Comme on peut le noter sur ces figures, il existe des couples de souches reliées dont la distance génomique est importante (par exemple au-delà de 0,6 pour Clostridium difficile ) et des couples de souches non reliées dont la distance génomique est faible (par exemple en deçà de 0,2 pour Staphylococcus aureus). Il existe ainsi une zone dans laquelle une distance génomique pourrait coder à la fois pour l’état « reliées » ou l’état « non reliées » si un seul seuil était employé. Cette zone intermédiaire est naturellement présente et correspond par exemple à des souches appartenant à un même sous-type mais n’ayant pas été jugées comme appartenant à un même foyer bactérien. De même, on observe au travers des figures 8A-B et 10A-B, qu’en choisissant les seuils S3 (spécificité maximale, noté « spécificité ») et S4 (sensibilité maximale, notée « sensibilité ») pour diviser en trois l’espace des distances génomiques, la zone intermédiaire est si importante que bon nombre de souches seraient jugées comme potentiellement reliées. En utilisant les seuils SI (e.g. maximisant le coefficient de Matthews MMC) et S2 (e.g. optimiant l’indice de Youden) qui optimisent la qualité de la prédiction, on note que la zone intermédiaire est sensiblement réduite tout en conservant une très bonne sensibilité globale.
Il a été décrit une application à l’épidémiologique de bactéries pathogènes au sein d’un hôpital. Evidemment, l’invention n’est pas limitée à cette application et peut être employée dans le domaine du contrôle microbiologique industriel (par exemple le contrôle agro-alimentaire), environnemental et vétérinaire.
Il a été décrit l’emploi de profil wgMLST pour calculer les distances génomiques. D’autres profils peuvent être employés, comme par exemple des profils cgMLST (« core genome multilocus sequencing typing »), MLST, des ensembles de SNP ou de gènes.
Il a été décrit l’emploi de l’indice de Youden et du coefficient de corrélation de Matthews. D’autres indices de qualité peuvent être employés, comme par exemple le Fl score (i.e. 2 TP/(2TP + FP + FN) ), le coefficient cc , la justesse (ou « accuracy », i.e. (TP + TN)/(N + P)), la précision (i.e. TP /(TP + FP )). De préférence au moins 1 de ces indices tient compte du déséquilibre de la base de données.
Il a été décrit une base de données d’apprentissage utilisée également pour la comparaison avec des souches prélevées. En variante, une base de données séparée, ou « base de données épidémiologique », peut être employée pour traiter les souches prélevées. Une telle base est par exemple propre à un hôpital, une institution, une société ou autre, et la base de données d’apprentissage est alors utilisée uniquement pour établir la valeur des seuils.

Claims

REVENDICATIONS
1. Procédé de détection et de surveillance d’un foyer bactérien lié à une espèce bactérienne au sein d’une zone géographique, comprenant :
- l’obtention d’un génome numérique d’une souche bactérienne prélevée au sein de la zone géographique et appartenant à l’espèce bactérienne ;
- le calcul d’une distance génomique du génome numérique obtenu avec un génome numérique d’une base de données, dite « épidémiologique », comprenant au moins un génome numérique d’une souche bactérienne appartenant à l’espèce bactérienne;
- la prédiction :
o que la souche bactérienne prélevée et la souche bactérienne de la base de données appartiennent au foyer bactérien si leur distance génomique est inférieure à un premier seuil prédéterminé ; ou
o que la souche bactérienne prélevée et la souche bactérienne de la base de données n’appartiennent pas au foyer bactérien si leur distance génomique est supérieure à un second seuil prédéterminé strictement supérieur au premier seuil ; ou
o que la souche bactérienne prélevée et la souche bactérienne de la base de données appartiennent peut être au foyer bactérien si leur distance génomique est comprise entre le premier et le second seuil ;
procédé selon lequel :
- le premier seuil est supérieur ou égal à un troisième seuil tel qu’une prédiction d’appartenance au foyer bactérien de deux souches bactériennes ayant une distance génomique inférieure au troisième seuil a une spécificité maximale ; et
- le second seuil est inférieur ou égal à un quatrième seuil tel qu’une prédiction de non appartenance au foyer bactérien de deux souches bactériennes ayant une distance génomique supérieure au quatrième seuil a une sensibilité maximale.
2. Procédé selon la revendication 1, dans lequel le premier et le second seuils sont égaux à deux distances génomiques calculées :
- en constituant une base de données d’apprentissage de génomes numériques de souches bactériennes appartenant à l’espèce bactérienne, ladite base comprenant : o des couples de souches bactériennes préalablement déterminées comme appartenant à un même foyer bactérien, et étiquetés comme « couples de souches reliées » ;
o des couples de souches bactériennes préalablement déterminée comme n’appartenant pas à un même foyer bactérien, et étiquetés comme « couples de souches non reliées » ; - en choisissant un prédicteur binaire configuré pour prédire que deux souches bactériennes sont reliées ou non reliées par comparaison de leur distance génomique à un cinquième seuil ;
- pour chaque valeur de cinquième seuil appartenant à un ensemble prédéterminé de valeurs de cinquième seuil, en calculant
o une matrice de confusion dudit prédicteur en fonction de la base de données d’apprentissage ;
o un premier index de qualité du prédicteur en fonction de la matrice de confusion, ledit premier index étant différent de la sensibilité et de la spécificité du prédicteur ;
o un second index de qualité, différent du premier index, en fonction de la matrice de confusion, ledit second index étant différent du premier index, de la sensibilité et de la spécificité du prédicteur ;
- en recherchant une première valeur de cinquième seuil qui optimise le premier index et une seconde valeur de cinquième seuil qui optimise le second index ;
- en posant le premier seuil comme égal au minimum de la première et de la seconde valeurs de cinquième seuil et en posant le second seuil comme égal au maximum de la première et de la seconde valeurs de cinquième seuil.
3. Procédé selon la revendication 2, dans lequel le premier index est choisi pour tenir compte du déséquilibre, dans la base de données d’apprentissage, entre le nombre de couples de souches reliées et le nombre de couples de souches reliées.
4. Procédé selon la revendication 3, dans lequel le premier index est le coefficient de corrélation de Matthews ou le Fl score.
5. Procédé selon l’une des revendications 2 à 4, dans lequel le second index est l’index de Youden.
6. Procédé selon l’une des revendications 2 à 5, dans lequel le prédicteur est choisi de sorte que :
- les vrais positifs correspondent aux couples de souches reliées ayant une distance génomique inférieure au cinquième seuil :
- les faux négatifs correspondent aux couples de souches reliées ayant une distance génomique supérieure au cinquième seuil ;
- la faux positifs correspondent aux couples de souches non reliées ayant une distance génomique inférieure au cinquième seuil ; et - les vrais négatifs correspondent aux couples de souches non reliées ayant une distance génomique supérieure au cinquième seuil.
7. Procédé selon l’une des revendications 2 à 6, dans lequel la base de données épidémiologique comprend la base de données d’apprentissage.
8. Procédé selon l’une quelconque des revendications précédentes, dans lequel la distance génomique est une distance normalisée.
9. Procédé selon la revendication 8, dans lequel la distance génomique entre deux souches bactériennes est calculée en :
- sélectionnant, dans un ensemble prédominé de loci, les loci communs aux génomes numériques desdites souches ;
- comptant le nombre de différences alléliques, aux loci communs, entre les deux génomes numériques desdites souches ;
- en divisant ledit nombre de différences par le nombre de loci communs.
10. Procédé selon la revendication 9 et l’une des revendications 4 ou 5, dans lequel si les premières et secondes valeurs de cinquième seuil sont supérieures à 0,1, alors :
- le second seuil est posé égal à 0, 1 ;
- le premier seuil est posé égal à ma x(Dg\Dg < 0,2), où ma x(Dg\Dg < 0,2) est la plus grande distance génomique, parmi les couples de souches reliées, strictement inférieure à 0,2.
11. Procédé selon l’une quelconque des revendications précédentes, dans lequel les distances entre les génomes numériques sont calculées en fonction d’une base de marqueurs, en particulier une base wgMLST, cgMLST, MLST, de gènes ou de SNP.
12. Procédé selon l’une quelconque des revendications précédentes, dans lequel lorsqu’une souche prélevée est prédite comme appartenant au foyer bactérien, elle est étiquetée dans la base de donnée épidémiologique comme étant « reliée » avec les souches bactériennes du foyer bactérien et comme étant « non reliée » avec les autres souches bactériennes.
13. Procédé selon l’une quelconque des revendications précédentes, dans lequel lorsqu’une souche prélevée est prédite comme appartenant peut-être au foyer bactérien, une caractérisation supplémentaire de ladite souche est mise en œuvre pour déterminer si elle appartient effectivement audit foyer, et si tel est le cas la souche bactérienne prélevée est étiquetée, dans la base de donnée épidémiologique, comme étant « reliée » avec les souches bactériennes du foyer bactérien et comme étant « non reliée » avec les autres souches bactériennes.
14. Procédé selon l’une quelconque des revendications précédentes, dans lequel le premier et le second seuil sont recalculés régulièrement et/ou dès que N nouvelles souches sont ajoutées à la base de données épidémiologique, où N est un entier supérieur ou égal à 1.
15. Procédé selon l’une quelconque des revendications précédentes, dans lequel lorsqu’une souche est prédite comme appartenant au foyer bactérien, des mesures prophylactiques sont mises en œuvre pour enrailler ledit foyer.
EP20736332.6A 2019-07-12 2020-07-02 Procede d'identification et de surveillance epidemiologique d'un foyer bacterien Withdrawn EP3997715A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
EP19186032.9A EP3764370B1 (fr) 2019-07-12 2019-07-12 Procédé d'identification et de surveillance épidémiologique d'un foyer bactérien
PCT/EP2020/068611 WO2021008878A1 (fr) 2019-07-12 2020-07-02 Procede d'identification et de surveillance epidemiologique d'un foyer bacterien

Publications (1)

Publication Number Publication Date
EP3997715A1 true EP3997715A1 (fr) 2022-05-18

Family

ID=67437722

Family Applications (2)

Application Number Title Priority Date Filing Date
EP19186032.9A Active EP3764370B1 (fr) 2019-07-12 2019-07-12 Procédé d'identification et de surveillance épidémiologique d'un foyer bactérien
EP20736332.6A Withdrawn EP3997715A1 (fr) 2019-07-12 2020-07-02 Procede d'identification et de surveillance epidemiologique d'un foyer bacterien

Family Applications Before (1)

Application Number Title Priority Date Filing Date
EP19186032.9A Active EP3764370B1 (fr) 2019-07-12 2019-07-12 Procédé d'identification et de surveillance épidémiologique d'un foyer bactérien

Country Status (6)

Country Link
US (1) US20220319716A1 (fr)
EP (2) EP3764370B1 (fr)
JP (1) JP7644082B2 (fr)
CN (1) CN114144843B (fr)
ES (1) ES3004013T3 (fr)
WO (1) WO2021008878A1 (fr)

Families Citing this family (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN114420212B (zh) * 2022-01-27 2022-10-21 上海序祯达生物科技有限公司 一种大肠杆菌菌株鉴定方法和系统
CN117877753B (zh) * 2024-03-12 2024-05-17 江南大学附属医院 基于多元数据的大流行病的监控方法、系统、设备和介质

Family Cites Families (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP4044493B2 (ja) * 2002-07-31 2008-02-06 富士通株式会社 遺伝子発現部位予測支援方法、遺伝子発現部位予測支援プログラムおよび遺伝子発現部位予測支援装置
JP2005275708A (ja) * 2004-03-24 2005-10-06 Nec Corp 風邪ウイルス伝播情報伝達システムと風邪ウイルス情報センター装置および風邪ウイルス伝播情報伝達方法
WO2006116455A2 (fr) * 2005-04-26 2006-11-02 Applera Corporation Systeme de surveillance et d'analyse genetique
US20130031179A1 (en) * 2010-04-16 2013-01-31 President And Fellows Of Harvard College Social-network method for anticipating epidemics and trends
EP2825676B1 (fr) * 2012-03-17 2017-12-20 The Regents of The University of California Diagnostic rapide et traitements personnalisés de l'acné
WO2018081130A1 (fr) * 2016-10-24 2018-05-03 The Chinese University Of Hong Kong Méthodes et systèmes de détection d'une tumeur

Also Published As

Publication number Publication date
CN114144843B (zh) 2025-03-21
EP3764370A1 (fr) 2021-01-13
EP3764370B1 (fr) 2024-09-04
EP3764370C0 (fr) 2024-09-04
ES3004013T3 (en) 2025-03-11
CN114144843A (zh) 2022-03-04
JP7644082B2 (ja) 2025-03-11
WO2021008878A1 (fr) 2021-01-21
US20220319716A1 (en) 2022-10-06
JP2022539826A (ja) 2022-09-13

Similar Documents

Publication Publication Date Title
Sukhum et al. Antibiotic-resistant organisms establish reservoirs in new hospital built environments and are related to patient blood infection isolates
Hennart et al. A dual barcoding approach to bacterial strain nomenclature: genomic taxonomy of Klebsiella pneumoniae strains
Oliveira et al. Regulation of genetic flux between bacteria by restriction–modification systems
Macesic et al. Predicting phenotypic polymyxin resistance in Klebsiella pneumoniae through machine learning analysis of genomic data
US12176071B2 (en) Systems and methods for ultra-fast identification and abundance estimates of microorganisms using a kmer-depth based approach and privacy-preserving protocols
Smith et al. Population genomics of Staphylococcus pseudintermedius in companion animals in the United States
Stoesser et al. Genomic epidemiology of complex, multispecies, plasmid-borne bla KPC carbapenemase in Enterobacterales in the United Kingdom from 2009 to 2014
Buultjens et al. Comparative genomics shows that Mycobacterium ulcerans migration and expansion preceded the rise of Buruli ulcer in southeastern Australia
Abdel-Glil et al. A whole-genome-based gene-by-gene typing system for standardized high-resolution strain typing of Bacillus anthracis
Natesh et al. Conservation priorities for endangered Indian tigers through a genomic lens
Outhred et al. Identifying likely transmission pathways within a 10-year community outbreak of tuberculosis by high-depth whole genome sequencing
Giulieri et al. A statistical genomics framework to trace bacterial genomic predictors of clinical outcomes in Staphylococcus aureus bacteremia
Blom et al. Hybridization in birds-of-paradise: Widespread ancestral gene flow despite strong sexual selection in a lek-mating system
Li et al. Molecular characterization of bla NDM-harboring plasmids reveal its rapid adaptation and evolution in the Enterobacteriaceae
EP3764370B1 (fr) Procédé d&#39;identification et de surveillance épidémiologique d&#39;un foyer bactérien
Yenew et al. A smooth tubercle bacillus from Ethiopia phylogenetically close to the Mycobacterium tuberculosis complex
Steinig et al. Phylodynamic inference of bacterial outbreak parameters using nanopore sequencing
Nikolakis et al. Patterns of relatedness and genetic diversity inferred from whole genome sequencing of archival blood fluke miracidia (Schistosoma japonicum)
Abrams et al. Genomic sequencing of Neisseria gonorrhoeae to respond to the urgent threat of antimicrobial-resistant gonorrhea
Pratama et al. A vanA vancomycin-resistant Enterococcus faecium ST80 outbreak resulting from a single importation event
Ham-Dueñas et al. Adaptive genetic diversity and evidence of population genetic structure in the endangered Sierra Madre Sparrow (Xenospiza baileyi)
Scherff et al. Real-time plasmid transmission detection pipeline
Melamed et al. An information theoretic method to identify combinations of genomic alterations that promote glioblastoma
Mapengo et al. Genomic epidemiology of Histoplasma in Africa
Walter et al. Local and Travel-Associated Transmission of Tuberculosis at Central Western Border of Brazil, 2014–2017

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20211215

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: EXAMINATION IS IN PROGRESS

17Q First examination report despatched

Effective date: 20250120

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN

18D Application deemed to be withdrawn

Effective date: 20250521