LU508376B1 - Ein verfahren zur extraktion geologischer informationen, eine vorrichtung und ein speichermedium - Google Patents
Ein verfahren zur extraktion geologischer informationen, eine vorrichtung und ein speichermedium Download PDFInfo
- Publication number
- LU508376B1 LU508376B1 LU508376A LU508376A LU508376B1 LU 508376 B1 LU508376 B1 LU 508376B1 LU 508376 A LU508376 A LU 508376A LU 508376 A LU508376 A LU 508376A LU 508376 B1 LU508376 B1 LU 508376B1
- Authority
- LU
- Luxembourg
- Prior art keywords
- word
- model
- geological
- extraction
- keyword
- Prior art date
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F16/00—Information retrieval; Database structures therefor; File system structures therefor
- G06F16/30—Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
- G06F16/33—Querying
- G06F16/332—Query formulation
- G06F16/3329—Natural language query formulation
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F18/00—Pattern recognition
- G06F18/20—Analysing
- G06F18/21—Design or setup of recognition systems or techniques; Extraction of features in feature space; Blind source separation
- G06F18/214—Generating training patterns; Bootstrap methods, e.g. bagging or boosting
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/30—Semantic analysis
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/044—Recurrent networks, e.g. Hopfield networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/044—Recurrent networks, e.g. Hopfield networks
- G06N3/0442—Recurrent networks, e.g. Hopfield networks characterised by memory or gating, e.g. long short-term memory [LSTM] or gated recurrent units [GRU]
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/20—Natural language analysis
- G06F40/205—Parsing
- G06F40/216—Parsing using statistical methods
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/20—Natural language analysis
- G06F40/237—Lexical tools
- G06F40/242—Dictionaries
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/20—Natural language analysis
- G06F40/279—Recognition of textual entities
- G06F40/284—Lexical analysis, e.g. tokenisation or collocates
-
- Y—GENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
- Y02—TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
- Y02D—CLIMATE CHANGE MITIGATION TECHNOLOGIES IN INFORMATION AND COMMUNICATION TECHNOLOGIES [ICT], I.E. INFORMATION AND COMMUNICATION TECHNOLOGIES AIMING AT THE REDUCTION OF THEIR OWN ENERGY USE
- Y02D10/00—Energy efficient computing, e.g. low power processors, power management or thermal management
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- Artificial Intelligence (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Data Mining & Analysis (AREA)
- Mathematical Physics (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- General Health & Medical Sciences (AREA)
- Evolutionary Computation (AREA)
- Life Sciences & Earth Sciences (AREA)
- Biophysics (AREA)
- Biomedical Technology (AREA)
- Molecular Biology (AREA)
- Computing Systems (AREA)
- Software Systems (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Evolutionary Biology (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Bioinformatics & Computational Biology (AREA)
- Bioinformatics & Cheminformatics (AREA)
- Human Computer Interaction (AREA)
- Databases & Information Systems (AREA)
- Machine Translation (AREA)
Abstract
Die vorliegende Erfindung offenbart ein Verfahren zur Extraktion geologischer Informationen, eine Vorrichtung und ein Speichermedium, wobei das Verfahren die folgenden Schritte umfasst: Schlagwortextraktion von geologischem Text unter Verwendung von vier Schlagwortextraktionsmethoden, Aktualisierung der Schlagworte in einem DISTILBERT- Modellthesaurus; Vorverarbeitung des geologischen Textkorpus unter Verwendung des vorverarbeiteten Korpus und des aktualisierten Modellthesaurus zum Vortraining durch ein MLM- Vortrainingsverfahren, um ein vortrainiertes Modell zu erhalten, das in der Lage ist, geologische semantische Informationen zu verstehen; Informationsextraktion unter Verwendung des vortrainierten Modells und Umwandlung des aufgeteilten Textes in Vektoren unter Verwendung eines zeichen- und wortbasierten kombinierten Aufteilungsverfahrens für englischen Text, der nicht in der geologischen Domäne erkannt wird, wenn ein Aufteiler zum Aufteilen verwendet wird; Die vorliegende Erfindung schlägt ein auf Zeichen- und Wortkombinationen basierendes Lexikonverfahren vor, das für das Lexikon des englischen Textes im geologischen Bereich verbessert ist und die Ergebnisse der Informationsextraktionsaufgabe optimiert. Durch die Aktualisierung des Thesaurus nach der Schlagwortextraktion und dem anschließenden Pre- Training wird die Wirkung des Pre-Trainings auf die Informationsextraktionsaufgabe weiter verbessert.
Description
Ein Verfahren zur Extraktion geologischer Informationen, eine Vorrichtung und ein LU508376
Speichermedium
Technischer Bereich
Die vorliegende Erfindung bezieht sich auf das Gebiet der Verarbeitung natiirlicher Sprache und insbesondere auf ein Verfahren zur Extraktion geologischer Informationen, eine Vorrichtung und ein Speichermedium.
Technologie im Hintergrund
Angesichts der raschen Anhäufung von Textdaten im Bereich der Geologie besteht die dringende Notwendigkeit, das in diesen massiven Daten enthaltene Wissen effektiv zu erschließen und anzuwenden. Die Informationsextraktion spielt eine entscheidende Rolle bei der Verarbeitung natürlicher Sprache, um die benötigten Schlüsselinformationen aus diesen Textdaten zu extrahieren. Zu den spezifischen Aufgaben der Informationsextraktion gehören die Erkennung benannter Entitäten, die Extraktion von Beziehungen und die Extraktion von Ereignissen.
Um die Aufgaben der Informationsextraktion zu bewältigen, werden in der Regel Methoden wie Deep Learning, Statistik oder Regeln eingesetzt. Unter ihnen haben sich Deep-Learning-
Methoden aufgrund ihrer leistungsstarken Ausdrucksmoglichkeiten durchgesetzt. Allerdings sind regelbasierte und statistische Ansätze nur dann gut, wenn keine umfangreichen gelabelten Daten vorliegen.
Bei der Verwendung von Deep-Learning-Methoden fiir Informationsextraktionsaufgaben ist es in der Regel notwendig, den geologischen Text zu vektorisieren, der zur Unterstützung von
Feature-Learning- und Klassifizierungsaufgaben in nachgelagerten Modellen verwendet wird.
Daher ist die Vektorisierung von Text besonders kritisch. Das DISTILBERT-Modell basiert auf der Transformer-Architektur, die eine große Anzahl öffentlich verfügbarer Korpusdatensätze für das Vortraining verwendet, was zu Vektoren mit kontextbewussten, mehrstufigen Darstellungen und anderen Vorteilen führt. Allerdings ist die Anpassungsfähigkeit der aktuellen vortrainierten
Modelle mit öffentlichem Korpus fiir Informationsextraktionsaufgaben in speziellen Bereichen, wie z. B. der Geologie, immer noch begrenzt.
Um dieses Problem zu lösen, wurden bereits trainierte Modelle für spezielle Bereiche wie
SCIBERT (wissenschaftlicher Bereich), BIOBERT (medizinischer Bereich) usw. entwickelt, wobei die Forschung zu trainierten Modellen für den geologischen Bereich noch nicht so weit fortgeschritten ist.
Nach dem Vortraining des Modells kann das Modell zwar durch das Vortraining des geologischen Korpus eine gewisse Fähigkeit zum semantischen Verständnis im geologischen
Bereich erlangen, aber aufgrund der vielfältigen und sich entwickelnden geologischen Begriffe und Vokabulare kann es dazu führen, dass das Modell auf Wortvektoren mit größtenteils unbekannten Zeichen abgebildet wird, wenn es mit den Fremdtexten im Bereich konfrontiert wird, da einige Begriffe nicht korrekt verarbeitet werden können, was sich auf die nachgelagerten
Aufgaben auswirkt.
Inhalt der Erfindung
Um die oben genannten Probleme zu lösen, die darin bestehen, dass im Bereich der Geologie weniger Forschung an vorgebildeten Modellen betrieben wird und die geologischen Begriffe als
Vektoren einer großen Anzahl unbekannter Zeichen abgebildet werden, schlägt die vorliegende
Erfindung ein Verfahren zur Extraktion geologischer Informationen, eine Vorrichtung und ein
Speichermedium vor.
Im Einzelnen umfasst das Verfahren die folgenden Schritte:
S1, Sammeln eines Korpus englischer geologischer Texte und deren Vorverarbeitung, um den) 508376 vorverarbeiteten Korpus zu erhalten;
S2, Extrahieren wichtiger geologiebezogener Wörter aus dem vorverarbeiteten Korpus mit
Hilfe eines Schlüsselwort-Extraktionsalgorithmus, Aktualisieren eines Modell-Thesaurus und
Erhalten eines aktualisierten Wörterbuchs;
S3, Verwendung des aktualisierten Lexikons, um das DISTILBERT-Modell mit MLM vorzutrainieren und das vorgetrainierte Modell zu erhalten;
S4, Verwendung des vortrainierten Modells fiir nachgelagerte Aufgaben;
S5, Verwendung eines Teils des aktualisierten Wörterbuchs als Validierungssatz, um die
Ausführungsergebnisse der nachgelagerten Aufgabe zu bewerten; wenn der Effekt der nachgelagerten Aufgabe noch optimiert werden muss und der vom DISTILBERT-Modell erzeugte
Wortvektor eine große Anzahl von Vektoren mit unbekannten Zeichenidentifikatoren enthält,
Aktualisierung der Wortsegmentierungsergebnisse unter Verwendung einer auf der Kombination von Zeichen und Wörtern basierenden Segmentierungsmethode;
S6, Eingeben der aktualisierten Partizip-Ergebnisse in das vortrainierte Modell, um
Wortvektoren zu erzeugen; und Weiterleiten der Wortvektoren durch die Netzwerkstruktur von
BiLSTM-CRF, um die nachgeschalteten Aufgaben abzuschließen.
Ein Speichermedium, wobei das Speichermedium Befehle und Daten zur Implementierung eines geologischen Informationsextraktionsverfahrens speichert.
Eine geologische Informationsextraktionsvorrichtung, umfassend: einen Prozessor und das
Speichermedium; wobei der Prozessor Anweisungen und Daten in das Speichermedium lädt und ausführt, um ein geologisches Informationsextraktionsverfahren zu implementieren.
Die vorteilhaften Effekte, die durch die vorliegende Erfindung bereitgestellt werden, sind: 1. Die vorliegende Erfindung schlägt ein Verfahren zur Modellierung und Ausbildung in der geologischen Domäne, wobei die Begriffe in der Domäne Text extrahiert werden, die Domäne
Begriffe werden aktualisiert, um das Modell Thesaurus, und dann eine Pre-Training Aufgabe durchgeführt wird, was zu einer besseren Leistung der Pre-trained Modell in der nachgelagerten
Aufgabe mit der Wirkung des Modells nach der Verwendung dieser Methode. 2. Die vorliegende Erfindung schlägt eine Methode der Worttrennung bei der Extraktion von
Informationen im geologischen Bereich vor, mit der die Erzeugung einer großen Anzahl zufälliger unbekannter Zeichen bei der Erzeugung von Wortvektoren optimiert und die Fähigkeit der
Wortvektoren zur Darstellung der Semantik des Textes verbessert werden kann. 3. Die vorliegende Erfindung praktiziert schließlich die Pre-Training-Methode und die
Segmentierungsmethode, und die optimierten Wortvektoren werden für die Entitätserkennung von geologischem Text durch BILSTM-CRF verwendet, und die optimierten Satzvektoren werden für die Beziehungsextraktion durch lineare Transformation durch eine lineare Schicht (voll verbundene Schicht) verwendet.
Beschreibung der beigefügten Zeichnungen
Bild 1 ist ein schematisches Diagramm des Verfahrensablaufs der vorliegenden Erfindung;
Bild 2 ist ein Flussdiagramm der Segmentierungsmethode der vorliegenden Erfindung;
Bild 3 ist Pre-Training-Modell und Flussdiagramm des Segmentierungsverfahrens zur
Informationsextraktion;
Bild 4 ist ein schematisches Diagramm der Funktionsweise der Hardware-Vorrichtung der vorliegenden Erfindung.
Detaillierte Beschreibung
Um die Ziele, technischen Lösungen und Vorteile der vorliegenden Erfindung 4.508376 verdeutlichen, werden die Ausführungsformen der vorliegenden Erfindung im Folgenden in
Verbindung mit den beigefügten Zeichnungen näher beschrieben.
Bild 1 ist eine schematische Darstellung des Verfahrensablaufs der vorliegenden Erfindung;
Die vorliegende Erfindung stellt ein Verfahren zur Extraktion geologischer Informationen bereit, das die folgenden Schritte umfasst:
S1, Sammeln eines Korpus von englischem geologischem Text und dessen Vorverarbeitung, um das vorverarbeitete Korpus zu erhalten;
Es ist anzumerken, dass die Vorverarbeitung in Schritt S1 Folgendes umfasst: Entfernen von
Satzzeichen, Umwandlung der Groß- und Kleinschreibung, Umwandlung des Zeichenformats und
Löschen ungültiger Informationen.
In einer Ausführungsform erhält die vorliegende Erfindung englische geologische Textdaten durch Öffentlich zugängliche englische geologische Berichte, Dokumente aus geowissenschaftlichen Literaturdatenbanken, manuelle Erfassung usw., und verarbeitet dann den gesammelten Text vor. Die einzelnen Schritte sind wie folgt:
S1-1, Die Literatur der geologischen Literaturdatenbank kann durch Crawling gewonnen werden, zunächst wird der Umfang des geologischen Pre-Trainingskorpus bestimmt, z.B. mit Hilfe von Schlüsselwörtern wie Stromatolithen, Schichten und anderen Schlüsselwörtern gesucht, und dann wird das Crawling der Seitendaten einschließlich der Zusammenfassungen der Literatur durch Selenium und Scrapy Crawler-Toolbibliotheken durchgeführt.
S1-2, Die Vorverarbeitung des englischen geologischen Textes umfasst (1) das Entfernen von
Satzzeichen (2) die Umwandlung des Textinhalts in Kleinbuchstaben, da das verwendete Modell
DISTILBERT-BASE-UNCASED ist, das an englische Kleinbuchstaben angepasst ist. (3)
Umwandlung aller Nicht-ASCH-Zeichen in ihre ASCH-Entsprechungen (4) Entfernung von
Sonderzeichen wie Seitenzahlen, DOIs, E-Mails, Telefonnummern und Postanschriften. (5)
Löschung von Zusammenfassungen und Artikeln, die zu kurz sind (Ergebnisse weniger als 50 nach der Aufteilung) oder Artikel mit zu wenig Wörtern (Inhalt weniger als 300 nach der Aufteilung).
S2, Extrahieren von geologisch relevanten und wichtigen Wörtern aus dem vorverarbeiteten
Korpus mit Hilfe eines Algorithmus zur Schlüsselwortextraktion, Aktualisieren des
Modellthesaurus und Erstellen des aktualisierten Worterbuchs;
Es ist zu beachten, dass der Schritt S2 wie folgt spezifiziert ist:
S21, Eine Vielzahl von Schlüsselwort-Extraktionsalgorithmen wird verwendet, um eine
Vielzahl von Schlüsselwort-Extraktionsergebnissen zu erhalten;
S22, Verwendung der ersten N Schlüsselwörter in jedem Schlüsselwort-Extraktionsergebnis, um die ersten N Schlüsselwörter jedes Schlüsselwort-Ergebnisses zu erhalten; N ist ein voreingestellter Wert;
S23, Entfernen der unbrauchbaren Wörter in den ersten N Schlüsselwörtern jedes
Schlüsselwortergebnisses, um jedes Schlüsselwortergebnis nach Entfernen der unbrauchbaren
Wörter zu erhalten;
S24, Wobei die Schnittmenge jedes Schlüsselwortergebnisses nach Entfernen der unbrauchbaren Wörter als endgültiger Satz von Schlüsselwôrtern genommen wird, und
Aktualisieren des endgültigen Satzes von Schlüsselwörtern in den Modellthesaurus, um das aktualisierte Wörterbuch zu erhalten.
Die Vielzahl von Schlisselwort-Extraktionsalgorithmen, einschließlich eines
Merkmalsauswahlverfahrens, das auf der Teilwort-Wortfrequenz basiert, eines TextRank-basierten
Schlüsselwort-Extraktionsverfahrens, eines Schlüsselwort-Extraktionsverfahrens, das auf eineht/ 508376
LDA-Themenmodell basiert, und eines TFIDF-basierten Schlüsselwort-Extraktionsverfahrens.
In einer Ausführungsform extrahiert die vorliegende Erfindung geologisch relevante wichtige
Wörter mit Hilfe mehrerer Algorithmen zur Schlüsselwortextraktion und nimmt dann die
Schnittmenge der Ergebnisse der verschiedenen Algorithmen als das wichtige Wort, durchsucht den Thesaurus, um zu sehen, ob das wichtige Wort existiert, und aktualisiert, falls es nicht existiert, den Modell-Thesaurus.
Der Name des Modells ist DISTILBERT, das 993 [ungenutzte] Token im Thesaurus hat, und der Aktualisierungsprozess besteht darin, das Vokabular zu verwenden, um die [ungenutzten]
Token in der Modelldatei vocab txt zu ersetzen.
Mit dem Keyword-Extraktion Algorithmus, ist es notwendig, das Problem der Adresse
Domain Text Subwording zu lösen, ist die Lösung, dass vor Subwording, vor allem durch das
Laden alle das Vokabular in den Korpus, wird in den Thesaurus des Lexikons des Lexikons nicht die Worte, die das Lexikon nicht identifizieren, die Worte, die der Algorithmus wird während des
Prozesses der Subwording ausgeführt werden, werden geologische Begriffe aufgeteilt, die die
Wirkung von Keyword-Extraktion betrifft, und dann filtern die Deaktivierung des Wortes
Ergebnisse verwendet werden können, hinzugefügt werden.
Schritt S2 ist wie folgt spezifiziert:
S2-1, Merkmalsauswahl auf der Grundlage von WordPiece-Teilwörtern. WordPiece ist ein
Algorithmus zur Segmentierung von Teilwörtern, der in der Regel für die Textsegmentierung und den Aufbau eines Vokabulars in der natürlichen Sprachverarbeitung verwendet wird. Die einzelnen
Schritte sind wie folgt:
Im ersten Schritt wird das Korpus mit Hilfe des WordPiece-Subwort-
Segmentierungsalgorithmus segmentiert, um ein Vokabular auf Subwortebene zu konstruieren.
Im zweiten Schritt wird die Worthäufigkeit jedes Teilworts im Korpus gezählt.
Im dritten Schritt werden generische Wörter entfernt, d. h. solche, die bereits im Lexikon des vortrainierten Modells vorhanden sind, z. B. Komma, ist, am und andere gebräuchliche Wörter.
Im vierten Schritt werden die Unterwörter nach ihrer Worthäufigkeit und den Unterwörtern, die nur im Korpus vorkommen, sortiert.
Im fünften Schritt werden die ersten n Teilwörter als endgültige Merkmalsmenge ausgewählt. n ist die Anzahl der Merkmalswörter, die extrahiert werden sollen.
S2-2, Schlüsselwortextraktion auf der Grundlage von TextRank, TextRank ist ein graphenbasierter Ranking-Algorithmus für die Schlüsselwortextraktion, der aus dem PageRank-
Algorithmus von Google, einem Algorithmus für das Ranking der Bedeutung von Webseiten, weiterentwickelt wurde. Die einzelnen Schritte sind wie folgt:
Der erste Schritt besteht darin, die Graphenstruktur zu konstruieren. Dazu wird der Text in
Wörter unterteilt, wobei die Knoten Wörter und die Kanten Assoziationen zwischen ihnen darstellen.
Im zweiten Schritt muss zur Berechnung der TextRank-Gewichte jedem Wort ein anfänglicher Gewichtswert zugewiesen werden. Er gibt an, wie wichtig dieser Knoten ist. Das
Gewicht eines Knotens wird durch seine Korrelation mit anderen Knoten und die Bedeutung des
Knotens selbst bestimmt.
Im dritten Schritt werden die Gewichte iterativ berechnet. Das TextRank-Gewicht jedes
Knotens wird iterativ berechnet, und das neue Gewicht jedes Knotens wird in jeder Iterationsrunde berechnet, und dann wird das Gewicht des Knotens aktualisiert. Die Formel zur Berechnung der
Gewichte lautet wie folgt LU508376 . w( ji) .
TRG) = (1-4) Ar TS D RW keQUT(j)
Dabei bezeichnet TR(i) das Gewicht des Wortes 1. d ist der Dämpfungskoeffizient, in der
Regel 0,85. IN(1) bezeichnet alle Knoten, die mit Knoten i verbunden sind. OUT(j) bezeichnet alle 5 Knoten, die von Knoten j aus erreicht werden können. w(ji) bezeichnet den Korrelationswert, d. h. die Gewichte an den Kanten, von Knoten j und Knoten 1.
Im vierten Schritt werden die Ausgabeschliisselworter iterativ konvergiert, und der dritte
Schritt wird so lange wiederholt, bis die TextRank-Werte konvergieren (d. h. sich die Werte nur noch wenig ändern oder eine vorgegebene Anzahl von Iterationen erreicht ist). Dann werden die ausgegebenen Schlüsselwörter nach den hohen und niedrigen Punktzahlen sortiert.
S2-3, Schlagwortextraktion auf der Grundlage des LDA-Themenmodells
LDA, auch bekannt als dreischichtiges Bayes'sches Wahrscheinlichkeitsmodell, enthält drei
Schichten von Wörtern, Themen und Dokumenten; unter Verwendung des gemeinsamen
Auftretens von Wörtern im Dokument werden Wörter entsprechend dem Thema geclustert und zwei Wahrscheinlichkeitsverteilungen von ,Dokument-Thema“ und ,,Thema-Wort“ erhalten. Die spezifischen Schritte bestehen darin, eine Vokabelliste zu erstellen, eine Dokument-Wort-
Häufigkeitsmatrix zu konstruieren, die Anzahl der Themen (Hyperparameter) auszuwählen, den
LDA-Algorithmus zu verwenden, um die Dokument-Wort-Häufigkeitsmatrix zu trainieren, und nachdem das Training abgeschlossen ist, kônnen wir die Themenverteilung jedes Dokuments und die Verteilung der Wôrter jedes Themas erhalten, und wir kônnen die Themenwôrter durch die
Verteilung der Wôrter der Unterwôrter identifizieren.
S2-4, Auf der Grundlage der TFIDF-Schlüsselwort-Extraktion bestimmt TFIDF anhand der
Worthäufigkeitsstatistik, ob ein Wort in einem Dokument oder einem Korpus ein Schlüsselwort ist.
Die Worthäufigkeit (TF) gibt die Häufigkeit von Schlüsselwôrtern im Text an: TF=n/N, n gibt an, wie oft ein Wort in einem Dokument vorkommt, und N gibt die Gesamtzahl aller Wôrter im
Dokument an.
Inverse Document Frequency (IDF): Die IDF eines Schlüsselworts erhält man, indem man die Gesamtzahl der Dokumente durch die Anzahl der Dokumente teilt, in denen das Wort vorkommt, und dann den Logarithmus des resultierenden Quotienten nimmt. Die Formel lautet:
IDF=, D steht für die Gesamtzahl aller Dokumente im Korpus, d steht für die Anzahl der
Dokumente im Korpus, in denen das Schlüsselwort vorkommt, 1 in der Formel soll verhindern, dass der Nenner 0 ist, und lg ist eine logarithmische Zahl mit der Basis 10. Die IDF stellt die
Bedeutung eines Wortes in der gesamten Menge der Dokumente dar. Wenn ein Wort in den meisten
Dokumenten vorkommt, hat es einen niedrigeren IDF-Wert, was darauf hindeutet, dass es weniger unterscheidbar ist. Kommt ein Wort dagegen nur in einigen wenigen Dokumenten vor, ist sein
IDF-Wert hoch, was bedeutet, dass es eine hohe Bedeutung hat.
Endgültiger TFIDF-Wert: Je höher der berechnete TF-IDF-Wert, desto wichtiger ist das Wort in dem Dokument.
S2-5, Die von den drei Algorithmen extrahierten Schlüsselwörter werden gefiltert und zusammengeführt, um den Thesaurus zu aktualisieren.
Die von den drei Algorithmen extrahierten Schlüsselwörter, jeder Algorithmus extrahiert die ersten 200 Wörter, und dann nach der Filterung, um die falsch oder bedeutungslos extrahierten
Schlüsselwörter zu entfernen, nehmen Sie die Schnittmenge der von den drei Algorithmen 508376 extrahierten Schlüsselwörter, und aktualisieren Sie sie.
S3, MLM Pre-Training wird auf dem DISTILBERT-Modell unter Verwendung des aktualisierten Lexikons durchgeführt, und das vortrainierte Modell wird erhalten;
Es sei darauf hingewiesen, dass die MLM-Aufgabe (Masked Language Model) eine wichtige
Aufgabe in der natürlichen Sprachverarbeitung (NLP) ist, die hauptsächlich zum Vortraining von
Deep-Learning-Modellen verwendet wird. Bei der MLM-Aufgabe besteht das Ziel darin, dass das
Modell die sprachliche Struktur, Syntax und Semantik des geologischen Textes versteht und erfasst.
Das Modell wird gebeten, einige verdeckte Wörter auf der Grundlage des Kontexts vorherzusagen.
Diese Aufgabe hilft dem Modell, die Repräsentation des Textes zu erlernen und eine bessere
Leistung bei nachgelagerten NLP-Aufgaben zu erzielen. Zunächst wird das DISTILBERT-Modell aus dem Open-Source-Modell-Repository hugging face geholt. Das aktualisierte Lexikon, die
Modelldateien und die Modellparameterprofile werden lokal gespeichert und das Lexikon des lokalen Modells über AutoTokenizer.from_pretrained() geladen. Dann laden Sie das lokale Modell mit dem Aufgabenkopf MLM.
AutoModelForMaskedLM.from_pretrained(). Verwenden Sie die Transformers-Bibliothek, laden Sie die Trainingsklasse Trainer, setzen Sie den Korpusdatenlader, die Stapelanzahl, die
Iterationsanzahl und andere Parameter und führen Sie dann das Pre-Training durch.
S4, Durchführen einer nachgelagerten Aufgabe unter Verwendung des vortrainierten Modells;
Es ist zu beachten, dass die in Schritt S4 beschriebene nachgelagerte Aufgabe die Erkennung von Entitäten und die Extraktion von Beziehungen umfasst.
In einer Ausführungsform ist das Modell nach dem Vortraining mit dem aktualisierten
Wörterbuch für Daten im geologischen Bereich bei der Durchführung von Aufgaben wie
Clustering, Ähnlichkeitsanalyse, Entitätserkennung usw. effektiver als das Modell ohne
Vortraining mit dem aktualisierten Wörterbuch. Bei der Erkennung von Entitäten in einem regelbasierten annotierten geologischen Textdatensatz werden folgende Entitäten erkannt:
LOCATION, MINERAL, ORE DEPOSIT, ROCK, STRAT und TIMESCALE. Präzision, Recall und fl-socre der spezifischen Erkennungen sowie die für das Training verwendeten
Hyperreferenzen sind alle gleich, und der Vergleich ist in Tabelle 1 unten dargestellt:
Tabelle 1: Vergleich des Effekts vor dem Training nach der Aktualisierung des Thesaurus [precision [recall ~~ |flsocre [Support
Aktualisierung des
Training mr [om Jom ow aw dem Training
Vorgefertigte Modelle erzielen in der Regel bessere Ergebnisse bei nachgelagerten Aufgaben, aber aufgrund von Faktoren wie der variablen Qualität des vorgefertigten Korpus und der
Angemessenheit der Datenvorverarbeitung vor dem Vortraining kann es vorkommen, dass beim
Vortraining nicht genügend Korpus gesammelt werden kann, der Inhalt des Korpus schlecht ist und die vorgefertigten Modelle letztendlich die nachgelagerten Aufgaben nicht wesentlich verbessern. Daher können Änderungen an der Lexikonmethode vorgenommen werden, um eine
Optimierung der Ergebnisse zu erreichen.
SS, Ein Teil des aktualisierten Wörterbuchs wird als Validierungssatz genommen, um die
Ausführungsergebnisse der nachgelagerten Aufgabe zu bewerten, und wenn die Ergebnisse der
; nachgelagerten Aufgabe noch optimiert werden müssen und der vom DISTILBERT-Moddt/508376 erzeugte Wortvektor eine große Anzahl von Vektoren mit unbekannten Zeichenidentifikatoren enthält, werden die Segmentierungsergebnisse unter Verwendung einer auf der Kombination von
Zeichen und Wörtern basierenden Segmentierungsmethode aktualisiert;
Es ist anzumerken, dass in Schritt S5 die besagte Wortsegmentierungsmethode, die auf der
Kombination von Zeichen und Wörtern basiert, wie folgt durchgeführt wird: ein Segment des englischen Textes wird unter Verwendung eines Leerzeichens als Trennzeichen segmentiert, die
Phrase wird durchlaufen, und wenn der Wortsegmentierer identifiziert, dass das Wort nicht im
Lexikon ist, wird das Wort mittels Stemming-Extraktion und Wortform-Reduktion umgewandelt, und dann wird beurteilt, ob das Wort im Lexikon ist oder nicht. Ist dies immer noch nicht der Fall, wird das Wort in einzelne Buchstaben segmentiert und für jeden Buchstaben der entsprechende
Wortvektor erzeugt.
Eine Ausführungsform ist in Bild 2 dargestellt, die ein Flussdiagramm des
Worttrennungsverfahrens der vorliegenden Erfindung zeigt;
Wenn das Wort im Thesaurus vorhanden ist, werden keine Änderungen am Text vorgenommen, und wenn das Wort nicht im Thesaurus vorhanden ist, wird das Wort mit Hilfe von
Stemming-Extraktion und Wortform-Reduktion deformiert, und es wird beurteilt, ob das transformierte Wort im Thesaurus vorhanden ist oder nicht. Wenn es vorhanden ist, ersetzt das umgewandelte Wort das Wort im Originaltext, wenn es immer noch nicht vorhanden ist, wird das
Wort in Einzelbuchstaben zerlegt, und das Wort wird im Originaltext durch Einzelbuchstaben ersetzt und zur Segmentierung mit Leerzeichen geschrieben.
Beim Stemming-Prozess wird die nltk-Bibliothek verwendet, SnowballStemmer importiert und dann die Methode SnowballStemmer.stem() für das Stemming verwendet. Die lexikalische
Reduktionsbibliothek (Lemmatizer) in nltk verwendet hauptsächlich den WordNet-basierten lexikalischen Reduktionsalgorithmus. Dieser Algorithmus basiert auf der Sprachressource
WordNet, einer englischen Vokabeldatenbank, die lexikalische und grammatikalische
Informationen über eine große Anzahl von Wörtern enthält. WordNet enthält die verschiedenen lexikalischen Formen von Wörtern (Substantive, Verben, Adjektive usw.) sowie ihre lexikalisch standardisierten Formen (lexikalische Elemente oder Grundformen).
S6, Das aktualisierte Partizip-Ergebnis wird in das vortrainierte Modell eingegeben, um
Wortvektoren zu erzeugen; die besagten Wortvektoren werden durch die Netzwerkstruktur von
BiLSTM-CRF geleitet, um die nachgelagerte Aufgabe zu erfüllen.
Bild 3 ist ein Flussdiagramm des vortrainierten Modells und der Segmentierungsmethode zur
Informationsextraktion; das vortrainierte Modell hat nach der Aktualisierung des Lexikons eine stärkere semantische Darstellungsfähigkeit, und die Kodierung von Wortvektoren oder
Satzvektoren unterstützt nachgelagerte Klassifizierungs- oder Vorhersageaufgaben. BiLSTM ist eine Variante des rekurrenten neuronalen Netzes (RNN), die bidirektional ist und gleichzeitig
Kontextinformationen berücksichtigen kann. BiLSTM ist sehr effektiv bei der
Sequenzmodellierung, da es langfristige Abhängigkeiten in Sequenzen erfassen kann. Die lexikalischen Eigenschaften eines Wortes können in verschiedenen Sätzen unterschiedlich sein, so dass für die lexikalische Vorhersage die Berücksichtigung von Kontextinformationen erforderlich ist, weshalb diese neuronale Netzstruktur verwendet wird.
Eine lineare Schicht wird vor der CRF-Schicht verwendet, um die Vektorausgabe der
BiLSTM-Schicht in einen Vektor der Dimension N umzuwandeln. Der Wert von N ist die Anzahl der Entitätsklassen, für die eine Entitätserkennung erforderlich ist. Für den nächsten CRF-
Dekodierungsschritt wird eine Folge von Vektoren der gleichen Dimension bereitgestellt. LU508376
CRF ist ein probabilistisches grafisches Modell, das die Modellierung von
Etikettensequenzen implementiert. Die von der linearen Schicht gelieferte Folge von Halsketten wird verwendet, um die Sequenz zu dekodieren und die wahrscheinlichste Etikettenfolge zu finden.
Diese wird schließlich durch die Label-ID in die entsprechende gelabelte Entität umgewandelt, also lexikalische Vorhersage, d. h. Entitätserkennung.
Eine weitere Anwendung ist die Beziehungsextraktion, die in der Regel auf den Ergebnissen der Entitätserkennung basiert, dann den Satz in Satzvektoren kodiert, die Satzvektoren in die lineare neuronale Netzstruktur zur Klassifizierung eingibt und dann die Beziehungskategorie-
Labels der Entitäten im Satz ausgibt, was schließlich zur Beziehungsextraktion führt. Für die
Aufgabe der Informationsextraktion gibt es auch die Ereignisextraktion, deren
Implementierungsprinzip dem der Entitätserkennung ähnelt und die ebenfalls durch BILSTM-CRF implementiert werden kann. Die durch die Informationsextraktion von Beziehungen, Ereignissen,
Entitäten und anderen Informationen gewonnenen Informationen können zum Aufbau des
Wissensgraphen verwendet werden, wodurch der Inhalt des Graphen vollständiger und genauer wird.
Bezugnehmend auf Bild 4 ist Bild 4 ein schematisches Diagramm der Funktionsweise einer
Hardware-Vorrichtung einer Ausführungsform der vorliegenden Erfindung, wobei die Hardware-
Vorrichtung insbesondere umfasst: eine geologische Informationsextraktionsvorrichtung 401, einen Prozessor 402 und ein Speichermedium 403.
Eine geologische = Informationsextraktionsvorrichtung 401: Die geologische
Informationsextraktionsvorrichtung 401 implementiert das geologische
Informationsextraktionsverfahren.
Prozessor 402: Der Prozessor 402 lädt Anweisungen und Daten in das Speichermedium 403 und führt sie aus, um das geologische Informationsextraktionsverfahren zu implementieren.
Speichermedium 403: Das Speichermedium 403 speichert Anweisungen und Daten; das
Speichermedium 403 wird verwendet, um das eine geologische Informationsextraktionsverfahren zu implementieren.
Die vorteilhaften Effekte der vorliegenden Erfindung sind: 1, Die vorliegende Erfindung schlägt ein Modell- und Trainingsverfahren für die geologische
Domäne vor, bei dem die Begriffe im Domänentext extrahiert werden, die Domänenterme in den
Modellthesaurus aktualisiert werden und dann eine Vortrainingsaufgabe durchgeführt wird, so dass das nach Anwendung dieser Methode vortrainierte Modell bei der nachgelagerten Aufgabe besser abschneidet. 2, Die vorliegende Erfindung schlägt eine Methode der Worttrennung bei der Extraktion von
Informationen in der geologischen Domäne vor, mit der die Erzeugung einer großen Anzahl von zufälligen unbekannten Zeichen während der Erzeugung von Wortvektoren optimiert und die
Fähigkeit der Wortvektoren zur Darstellung der Semantik des Textes verbessert werden kann. 3, Die vorliegende Erfindung schließlich praktiziert die Pre-Training-Methode und die
Segmentierungsmethode, und die optimierten Wortvektoren werden für die Entitätserkennung von geologischem Text durch BiLSTM-CRF verwendet, und die optimierten Satzvektoren werden für die Beziehungsextraktion durch lineare Transformation durch eine lineare Schicht (fully connected layer) verwendet.
Das Vorstehende ist nur eine bevorzugte Ausführungsform der vorliegenden Erfindung und soll die vorliegende Erfindung nicht einschränken, und jede Änderung, gleichwertige Ersetzung,
Verbesserung usw., die im Rahmen des Geistes und der Grundsätze der vorliegenden Erfindut£/°08376 vorgenommen wird, fällt in den Schutzbereich der vorliegenden Erfindung.
Claims (8)
1. Ein Verfahren zur Extraktion geologischer Informationen dadurch gekennzeichnet, dass das Verfahren die folgenden Schritte umfasst: S1, Sammeln eines Korpus englischer geologischer Texte und deren Vorverarbeitung, um den vorverarbeiteten Korpus zu erhalten; S2, Extrahieren wichtiger geologiebezogener Wörter aus dem vorverarbeiteten Korpus mit Hilfe eines Schlüsselwort-Extraktionsalgorithmus, Aktualisieren eines Modell-Thesaurus und Erhalten eines aktualisierten Wörterbuchs; S3, Verwendung des aktualisierten Lexikons, um das DISTILBERT-Modell mit MLM vorzutrainieren und das vorgetrainierte Modell zu erhalten; S4, Verwendung des vortrainierten Modells fiir nachgelagerte Aufgaben; SS, Verwendung eines Teils des aktualisierten Lexikons als Validierungssatz, Bewertung der Ausführungsergebnisse der nachgelagerten Aufgabe, und wenn der Effekt der nachgelagerten Aufgabe noch optimiert werden muss und die vom DISTILBERT-Modell erzeugten Wortvektoren eine große Anzahl von Vektoren mit unbekannten Zeichenidentifikatoren enthalten, Aktualisierung der Segmentierungsergebnisse unter Verwendung einer Segmentierungsmethode, die auf einer Kombination von Zeichen und Wörtern basiert; S6, Eingeben der aktualisierten Partizip-Ergebnisse in das vortrainierte Modell, um Wortvektoren zu erzeugen; und Weiterleiten der Wortvektoren durch die Netzwerkstruktur von BiLSTM-CRF, um die nachgelagerte Aufgabe abzuschließen.
2. Ein Verfahren zur Extraktion geologischer Informationen nach Anspruch 1, dadurch gekennzeichnet, dass die Vorverarbeitung in Schritt S1 Folgendes umfasst: Entfernen von Interpunktionszeichen, Groß- und Kleinschreibung, Zeichenformatkonvertierung und Löschen ungültiger Informationen.
3. Ein Verfahren zur Extraktion geologischer Informationen nach Anspruch 1, dadurch gekennzeichnet, dass: Schritt S2 wie folgt abläuft: S21, Eine Vielzahl von Schlüsselwort-Extraktionsalgorithmen wird verwendet, um eine Vielzahl von Schlüsselwort-Extraktionsergebnissen zu erhalten; S22, Nehmen der ersten N Schlüsselwörter in jedem Schlüsselwort-Extraktionsergebnis, um die ersten N Schlüsselwörter jedes Schlüsselwort-Ergebnisses zu erhalten; N ist ein voreingestellter Wert; S23, Entfernen der unbrauchbaren Wörter in den ersten N Schlüsselwörtern jedes Schlüsselwortergebnisses, um jedes Schlüsselwortergebnis nach Entfernen der unbrauchbaren Wörter zu erhalten; S24, Wobei die Schnittmenge jedes Schlüsselwortergebnisses nach Entfernen der unbrauchbaren Wörter als endgültiger Satz von Schlüsselwörtern genommen wird und der endgültige Satz von Schlüsselwörtern in das Modelllexikon aktualisiert wird, um das aktualisierte Lexikon zu erhalten.
4. Ein Verfahren zur Extraktion geologischer Informationen nach Anspruch 3, dadurch gekennzeichnet, dass: die Vielzahl von Schliisselwortextraktionsalgorithmen ein Merkmalsauswahlverfahren auf der Grundlage der Teilwort-Wortfrequenz, ein TextRank- Schlüsselwortextraktionsverfahren auf der Grundlage der TextRank-Schlüsselwortextraktion, ein Schlüsselwortextraktionsverfahren auf der Grundlage des LDA-Themenmodells und ein TFIDF- Schlüsselwortextraktionsverfahren auf der Grundlage der TFIDF-Schlüsselwortextraktion umfasst.
5. Ein Verfahren zur Extraktion geologischer Informationen nach Anspruch 1, dadurdf?508376 gekennzeichnet, dass die nachgelagerte Aufgabe in Schritt S4 die Identifizierung von Entitäten und die Extraktion von Beziehungen umfasst.
6. Ein Verfahren zur Extraktion geologischer Informationen nach Anspruch 1, dadurch gekennzeichnet, dass: in Schritt S5 das Wortsegmentierungsverfahren auf der Kombination von Zeichen und Wörtern basiert, die spezifischen Schritte wie folgt sind: ein Segment des englischen Textes wird unter Verwendung eines Leerzeichens als Trennzeichen segmentiert, und die Phrase wird durchlaufen. Wenn der Wortsplitter erkennt, dass das Wort nicht im Lexikon enthalten ist, wird das Wort mittels Stamm-Extraktion und Wortform-Reduktion umgewandelt und dann bestimmt, ob das Wort im Lexikon enthalten ist, und wenn es immer noch nicht im Lexikon enthalten ist, wird das Wort in einzelne Buchstaben segmentiert und entsprechende Wortvektoren werden entsprechend jedem Buchstaben erzeugt.
7. Ein Speichermedium, dadurch gekennzeichnet, dass: das Speichermedium Anweisungen und Daten zur Implementierung eines geologischen Informationsextraktionsverfahrens, wie in einem der Ansprüche 1 bis 6 beschrieben, speichert.
8. Eine Vorrichtung zur Extraktion geologischer Informationen dadurch gekennzeichnet, dass sie umfasst: einen Prozessor und ein Speichermedium; wobei der Prozessor Anweisungen und Daten in das Speichermedium lädt und ausführt, um ein geologisches Informationsextraktionsverfahren nach einem der Ansprüche 1 bis 6 zu implementieren.
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202311645904.5A CN117668188A (zh) | 2023-11-30 | 2023-11-30 | 一种地质信息抽取方法、设备及存储介质 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| LU508376B1 true LU508376B1 (de) | 2025-03-26 |
Family
ID=90063538
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| LU508376A LU508376B1 (de) | 2023-11-30 | 2024-09-26 | Ein verfahren zur extraktion geologischer informationen, eine vorrichtung und ein speichermedium |
Country Status (2)
| Country | Link |
|---|---|
| CN (1) | CN117668188A (de) |
| LU (1) | LU508376B1 (de) |
Family Cites Families (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN113761893B (zh) * | 2021-11-11 | 2022-02-11 | 深圳航天科创实业有限公司 | 一种基于模式预训练的关系抽取方法 |
| CN116187317A (zh) * | 2022-12-12 | 2023-05-30 | 合肥讯飞数码科技有限公司 | 文本生成方法、装置、设备及计算机可读介质 |
| CN116910251A (zh) * | 2023-06-30 | 2023-10-20 | 平安科技(深圳)有限公司 | 基于bert模型的文本分类方法、装置、设备及介质 |
-
2023
- 2023-11-30 CN CN202311645904.5A patent/CN117668188A/zh active Pending
-
2024
- 2024-09-26 LU LU508376A patent/LU508376B1/de active IP Right Grant
Also Published As
| Publication number | Publication date |
|---|---|
| CN117668188A (zh) | 2024-03-08 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| DE102020113545A1 (de) | Verfahren, vorrichtungen, systeme und erzeugnisse zum bereitstellen von abfrageauswahlsystemen | |
| DE102022201222A1 (de) | Neuronales netz mit interaktionsschicht, zum suchen, abrufen und einstufen | |
| DE69613433T2 (de) | Dokumentklassifizierungseinheit und Dokumentwiederauffindungseinheit | |
| EP1779271B1 (de) | Sprach- und textanalysevorrichtung und entsprechendes verfahren | |
| DE112013004082T5 (de) | Suchsystem der Emotionsentität für das Microblog | |
| CN110472203B (zh) | 一种文章的查重检测方法、装置、设备及存储介质 | |
| DE102021004562A1 (de) | Abwandlung von Szenengraphen auf Grundlage von Befehlen in natürlicher Sprache | |
| CN110287323B (zh) | 一种面向目标的情感分类方法 | |
| DE112018006345T5 (de) | Abrufen von unterstützenden belegen für komplexe antworten | |
| EP3100174A1 (de) | Verfahren zur automatischen sinnerkennung und messung der eindeutigkeit von text | |
| CN115796181A (zh) | 一种针对化工领域的文本关系抽取方法 | |
| CN113157860B (zh) | 一种基于小规模数据的电力设备检修知识图谱构建方法 | |
| Aromi | Linking words in economic discourse: Implications for macroeconomic forecasts | |
| Megala et al. | Enriching text summarization using fuzzy logic | |
| DE102018007024A1 (de) | Dokumentdurchsuchen mittels grammatischer einheiten | |
| DE112021006602T5 (de) | Verfeinern von abfrage-erzeugungsmustern | |
| CN118981476A (zh) | 基于本地知识库的报告自动生成检索增强优化方法和系统 | |
| CN115757726A (zh) | 一种面向特定领域的智能问答系统冷启动方法及装置 | |
| DE202023102803U1 (de) | System zur Erkennung von Emotionen und zur Stimmungsanalyse durch maschinelles Lernen | |
| Trabelsi et al. | SeLaB: Semantic labeling with BERT | |
| Pay et al. | An ensemble of automatic keyword extractors: TextRank, RAKE and TAKE | |
| CN109522396A (zh) | 一种面向国防科技领域的知识处理方法及系统 | |
| CN114090774B (zh) | 一种文本分类方法 | |
| Krungklang et al. | An analysis of natural language text relating to thai criminal law | |
| EP4736401A1 (de) | Computerimplementiertes verfahren zur bereitstellung einer, insbesondere zumindest teilweise textbasierten, ausgangssequenz |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| FG | Patent granted |
Effective date: 20250326 |