EP4309072A1 - Verfahren zur generierung von dateien - Google Patents
Verfahren zur generierung von dateienInfo
- Publication number
- EP4309072A1 EP4309072A1 EP22713040.8A EP22713040A EP4309072A1 EP 4309072 A1 EP4309072 A1 EP 4309072A1 EP 22713040 A EP22713040 A EP 22713040A EP 4309072 A1 EP4309072 A1 EP 4309072A1
- Authority
- EP
- European Patent Office
- Prior art keywords
- files
- data
- text
- generated
- processed
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/045—Combinations of networks
- G06N3/0455—Auto-encoder networks; Encoder-decoder networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/40—Processing or translation of natural language
- G06F40/55—Rule-based translation
- G06F40/56—Natural language generation
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/20—Natural language analysis
- G06F40/205—Parsing
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/20—Natural language analysis
- G06F40/279—Recognition of textual entities
- G06F40/284—Lexical analysis, e.g. tokenisation or collocates
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/0475—Generative networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
- G06N3/0895—Weakly supervised learning, e.g. semi-supervised or self-supervised learning
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/042—Knowledge-based neural networks; Logical representations of neural networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N5/00—Computing arrangements using knowledge-based models
- G06N5/02—Knowledge representation; Symbolic representation
- G06N5/022—Knowledge engineering; Knowledge acquisition
Definitions
- the invention relates to a method for generating files, in particular text and audio files and files for computer games and videos
- a necessary condition for the creation of the automatically generated text types listed above is structured data, i. H. Information in tabular form, with weather reports, for example, information on temperature, air pressure or the probability of precipitation at a location. For human readers, such columns of numbers are less easy to read than continuous text.
- special software translates the data into text.
- the information is inserted into content-relevant components of an intelligent text template.
- Such computer-generated contributions based on intelligent templates are used in the online presence of leading media or in local portals.
- Another method for text generation is the generation of text via language models, which learn a model of language with the help of a neural network based on a large training corpus. Based on this learned model, they can generate texts similar to the training corpus. However, by default, such language models only continue to write a beginning.
- the object of the invention is now to expand the scope and a method for generating files, especially text and To develop audio files as well as files for computer games and videos, which enables the processing of much larger and different amounts of data than the very specialized template-based processes allow.
- Existing data (text data) is filtered, processed (cleaned) and physically normalized via a preprocessing pipeline.
- a training corpus tailored to the desired results is generated from the processed data and the training is started according to specified parameters.
- a file, for example a text, is generated from the trained models, with the provision being made via different APIs (Application Programming Interface).
- Normalization is a technical process, as is known, for example, from the audio sector (increase or decrease of amplitudes) or in the production of steel to create fine-grained structures.
- the filtered and processed (raw) data is displayed in individual tokens or digits and compared or processed. This while retaining the information content of the original representation of the digit sequences.
- files in the example texts, are filtered, cleaned and normalized according to language and content parameters.
- outlier texts that deviate greatly from the average language (e.g. due to an extremely large number of function words without meaning to the content) are removed.
- Sentence splitting and tokenization i.e. the marking of sentences and word units - are carried out.
- Sentence splitting is done using the spacy library, with added rules for parsing normalized symbols for paragraphs, quotation marks, etc. Tokenizing, cleaning,
- Filtering and normalizing is completely based on own rules and regular expressions and results in an extraordinarily clean and homogeneous corpus.
- the high standardization and the thorough cleaning lead to measurably better text output of the models trained with these texts.
- the CorpusComposer compiles a training corpus from a pre-processed text corpus.
- the texts to be taken into account can be sorted according to metadata, e.g. B. the text length, are filtered. Adjustments are made to the model to be trained, e.g. B. replacing unintended special characters or subword encoding.
- the desired input sequences can be specified and control tokens can be placed in front. While previous language models usually only update an input sentence, according to the invention it is also possible to enter prompts, titles, summaries and end sentences. For example, control tokens control the length of the text or the genre.
- the libraries transformers and fairseq are used for subword encoding and for the binarization of corpora for the purpose of training sequence-to-sequence models.
- the creation of a training corpus is otherwise based on your own filters and processing rules.
- the CorpusComposer makes it easy to configure a training corpus and the result is reproducible.
- Training is carried out using the libraries transformers (language models) and fairseq (sequence-to-sequence models) already mentioned.
- the story model contains ready-made Shell scripts that can be adapted to the training to be started (paths, hyperparameters).
- the StoryGenerator module is responsible for the generation. Here, contexts and specifications for story properties are given and stories are thus generated.
- the additional decoder features include a blocklist that prevents the generation of certain words or phrases. You can choose between a basic and an extended block list, and model-specific block lists can also be integrated. It is also possible to reduce the frequency of repetitions and direct speech and to specify the desired mood of the story. In addition, the voltage curve can be influenced there.
- the character names are also configurable on some models. These models were trained on generalized variants of our corpora that contain entity classes (e.g., protagonist, love interest, or person) rather than individual names. They can be replaced with desired names after generation.
- entity classes e.g., protagonist, love interest, or person
- the generated texts are used via format-specific technical interfaces for the automatic generation of other forms of entertainment.
- the interfaces text-to-video and text-to-game can be developed.
- API application programming interface
- a storytelling AI was developed that, for example, writes English short stories worth up to 1,000 tokens.
- the applicant's training corpus contains approximately 700,000 short stories, each with a maximum of 1,000 tokens, which are normalized and filtered according to language and content parameters. Among other things, outlier texts as well as pornographic, violent, legislative and strongly political content will be removed. stories are cleaned up by removing or correcting author comments, stylistic idiosyncrasies, characters from non-Latin alphabets, and common spelling mistakes. Special characters are standardized.
- the user can also specify a prompt, a title, a summary and the end as context.
- the desired text length is determined by control tokens learned during training.
- the sampling architecture has been expanded with its own algorithms, with which unwanted word sequences are forbidden via a block list, Repetitions can be reduced in a more targeted manner and the frequency of direct speech and the desired mood (via sentiment scores) can be controlled.
- Some models can also be given personal names because they have been trained on generalized variants of the corpora that contain entity classes instead of individual names. These can be de-anonymized after generation to desired names.
- the applicant developed an automated GA in order to pre-filter the generated stories using its own metrics and discriminators and to accelerate the process of model selection.
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- General Health & Medical Sciences (AREA)
- Health & Medical Sciences (AREA)
- Artificial Intelligence (AREA)
- Computational Linguistics (AREA)
- General Physics & Mathematics (AREA)
- General Engineering & Computer Science (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Biomedical Technology (AREA)
- Molecular Biology (AREA)
- Computing Systems (AREA)
- Evolutionary Computation (AREA)
- Data Mining & Analysis (AREA)
- Mathematical Physics (AREA)
- Software Systems (AREA)
- Biophysics (AREA)
- Life Sciences & Earth Sciences (AREA)
- Machine Translation (AREA)
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
- Document Processing Apparatus (AREA)
Abstract
Die Erfindung betrifft ein Verfahren zur Generierung von Dateien, insbesondere von Text- und Audiodateien sowie Dateien für Computerspiele oder Videos. Dabei wird die Verarbeitung sehr großer Mengen inhaltlich und strukturell unterschiedlicher Texte ermöglicht. Hierzu werden in einem ersten Schritt vorhandene Daten gefiltert und aufbereitet (gesäubert) werden und nachfolgend wird aus den aufbereiteten Daten ein im Hinblick auf die gewünschten Ergebnisse abgestimmtes Trainingskorpus erzeugt. Die gefilterten und aufbereiteten Daten werden normalisiert.
Description
Verfahren zur Generierung von Dateien
Die Erfindung betrifft ein Verfahren zur Generierung von Dateien, insbesondere von Text- und Audiodateien sowie Dateien für Computerspiele und Videos
Die automatische Erstellung von Texten ist bekannt. So werden zum Beispiel Sportoder Wetterberichte, Börsennachrichten oder Staumeldungen automatisiert erzeugt. Nachrichten-Portale setzen im Content-Mix zunehmend auf Roboterjournalismus und Online-Shops nutzen computergenerierte Texte zur Bewerbung von Produkten. Smarte Anwendungen kreieren automatisiert individuelle Berichte wie Geschäftsberichte, immobilien-Exposes oder Fondsreports. Hierbei ist Kl-basierte Software in der Lage, sprachliche Inhalte effizient zu generieren und in Echtzeit bereitzustellen.
Eine notwendige Bedingung für die Erstellung der oben aufgezählten automatisch generierten Textsorten sind strukturierte Daten, d. h. Informationen in Tabellenform, bei Wetterberichten zum Beispiel die Informationen zu Temperatur, Luftdruck oder Niederschlagswahrscheinlichkeit an einem Ort. Für menschliche Leser sind solche reinen Zahlenkolonnen weniger eingängig lesbar als Fliesstext.
Zur Verbesserung des Nutzererlebnisses übersetzt eine spezielle Software die Daten in Texte. Dabei werden die Informationen in inhaltlich relevante Bestandteile einer intelligenten Textvorlage eingefügt. Solche computergenerierten Beiträge auf Basis intelligenter Templates kommen in den Online-Auftritten der Leitmedien oder auch in lokalen Portalen zum Einsatz. Eine weitere Methode zur Textgenerierung ist die Erzeugung von Text über Language Models, welche mit Hilfe eines Neuronalen Netzes auf Grundlage eines grossen Trainingskorpus’ ein Modell von Sprache lernen. Ausgehend von diesem gelernten Modell können sie dem Trainingskorpus’ ähnliche Texte generieren. Solche Language Modelle schreiben jedoch standardmässig nur einen Anfang weiter.
Die Aufgabe der Erfindung besteht nun darin, den Anwendungsbereich zu erweitern und ein Verfahren zur Generierung von Dateien, insbesondere von Text- und
Audiodateien sowie Dateien für Computerspiele und Videos zu entwickeln, das die Verarbeitung wesentlich grösserer und unterschiedlicher Datenmengen ermöglicht, als es die sehr spezialisierten Template-basierten Verfahren zulassen.
Die Aufgabe ist mit den Merkmalen des Patentanspruchs 1 gelöst.
Es werden vorhandene Daten (Textdaten) über eine Preprocessing-Pipeline gefiltert, aufbereitet (gesäubert) und physikalisch normalisiert. Aus den aufbereiteten Daten wird ein im Hinblick auf die gewünschten Ergebnisse abgestimmtes Trainingskorpus erzeugt und das Training wird nach vorgegebenen Parametern gestartet. Aus den trainierten Modellen wird eine Datei, zum Beispiel ein Text, generiert, wobei die Bereitstellung über unterschiedliche APIs (Application Programming Interface) erfolgt.
Eine Normalisierung ist ein technischer Vorgang, wie er zum Beispiel aus dem Audiobereich (vergrössern oder verkleinern von Amplituden) oder bei der Herstellung von Stahl zur Erzeugung feinkörniger Strukturen bekannt ist.
Vorteilhafte Ausgestaltungen der Erfindung sind in den abhängigen Ansprüchen offenbart.
Die gefilterten und aufbereiteten (Roh-)Daten werden in einzelnen Token bzw. Ziffern dargestellt und verglichen bzw. verarbeitet. Dies unter Beibehaltung des Informationsgehalts der ursprünglichen Darstellung der Ziffernfolgen.
Die Erfindung wird nachfolgend in einem Ausführungsbeispiel näher beschrieben.
Beim Preprocessing werden Dateien, im Beispiel Texte, nach sprachlichen und inhaltlichen Parametern gefiltert, gesäubert und normalisiert. Dabei werden unter anderem Outlier-Texte, welche sprachlich stark vom Durchschnitt abweichen (z.B. durch äußerst viele Funktionswörter ohne inhaltliche Bedeutung) entfernt.
Ausserdem werden unerwünschte bzw. unzulässige Inhalte entfernt. Die Texte werden gesäubert, indem Anmerkungen der Autoren, stilistische Eigenheiten (beispielsweise Formatierungen oder unübliche sprachliche Varianten), Zeichen aus nicht-lateinischen Alphabeten und gängige Rechtschreibfehler entfernt bzw. korrigiert
werden. Sonderzeichen wie Anführungszeichen oder Trennlinien, aber auch für neuronale Netze schwer zu verarbeitende Ziffernfolgen, werden vereinheitlicht. Sentence Splitting und Tokenisierung - also das Markieren von Sätzen und Worteinheiten - werden vorgenommen.
Sentence Splitting erfolgt über die Library spacy, mit angelegten Zusatzregeln zum Parsen normalisierter Symbole für Absätze, Anführungszeichen etc. Das Tokenisieren, Säubern,
Filtern und Normalisieren basiert komplett auf eigenen Regeln und regulären Ausdrücken und resultiert in einem ausserordentlich sauberen und homogenen Korpus. Die hohe Standardisierung und das gründliche Säubern führen zu messbar besserem Textoutput der mit diesen Texten trainierten Modelle.
Der CorpusComposer (Modul) stellt aus einem vorverarbeiteten Textkorpus ein Trainingskorpus zusammen. Die zu berücksichtigenden Texte können nach Metadaten, wie z. B. der Textlänge, gefiltert werden. Es werden Anpassungen an das zu trainierende Modell vorgenommen, wie z. B. das Ersetzen nicht vorgesehener Sonderzeichen oder Subword Encoding. Weiterhin können die gewünschten Eingabesequenzen festgelegt und Control-Token vorangestellt werden. Während bisherige Language Models für gewöhnlich nur einen Eingabesatz fortschreiben, wird erfindungsgemäss zusätzlich die Eingabe von Prompts, Titeln, Zusammenfassungen, sowie Endsätzen ermöglicht. Control-Token steuern beispielsweise die Textlänge oder das Genre.
Für Subword Eencoding sowie für die Binarisierung von Korpora zwecks Trainings von sequence-to-sequence Modellen werden die Libra rys transformers und fairseq herangezogen. Das Erstellen eines Trainingskorpus basiert ansonsten auf eigenen Filtern und Verarbeitungsregeln. Durch den CorpusComposer ist das Zusammenstellen eines Trainingskorpus’ komfortabel konfigurierbar und das Ergebnis reproduzierbar.
Das Training erfolgt über die bereits genannten Librarys transformers (Language Models) und fairseq (sequence to sequence-Modelle). Das Storymodel enthält fertige
Shell-Skripte, die an das zu startende Training angepasst werden können (Pfade, Hyperparameter).
Für die Generierung ist das Modul StoryGenerator zuständig. Hier werden Kontexte sowie Vorgaben zu Story-Eigenschaften mitgegeben und damit Storys erzeugt.
Die Grundlage dafür ist eine erweiterte Textgenerierung aus den Librarys transformers bzw. fairseq. Die zusätzlichen Decoder-Features umfassen u.a. eine Blocklist, die die Generierung bestimmter Wörter oder Wortfolgen verhindert. Es kann zwischen einer basalen und einer erweiterten Blocklist ausgewählt werden, außerdem können modellspezifische Blocklists eingebunden werden. Weiterhin ist ein Reduzieren der Häufigkeit von Wiederholungen und direkter Rede sowie die Vorgabe der gewünschten Stimmungslage der Story möglich. Zudem kann dort die Spannungskurve beeinflusst werden. Auch sind die Figurennamen bei einigen Modellen konfigurierbar. Diese Modelle wurden auf generalisierten Varianten unserer Korpora trainiert, die Entity-Klassen (z. B. Protagonist, Love Interest oder Person) statt individueller Namen enthalten. Sie können nach der Generierung mit Wunschnamen ersetzt werden. Durch die zusätzlichen Features werden viele bekannte Probleme von maschinell generiertem Text vermieden und es wird eine hohe Baseline-Qualität beim sprachlichen Output erzielt. Zudem ermöglichen sie mehr Kontrolle über die generierten Storys.
Um dem Problem zu begegnen, dass neuronale Netze Blackboxes mit schwer zu beeinflussendem Output sind, werden Regeln und ausformuliertes Wissen eingesetzt. Dies verbessert das Lernen von Figuren, indem die Rollen analysiert und in allen Storys gleiche Platzhalter ins Training gegeben werden (anstelle von Namen). Die Spannungskurve in Trainingsstorys wird analysiert und dazu werden Informationen ins Training gegeben, um bei der Generierung die Spannung zu beeinflussen. Das im Modell implizit vorhandene Weltwissen wird erweitert, indem tabellarisches Wissen und Beispiele, wie dieses vom Modell abgerufen werden kann, in die Trainingsdaten integriert werden. Ebenfalls soll explizit formuliertes Wissen aus Wissensgraphen in Training oder Decoder eingebunden werden, so dass einerseits
faktisch korrekte Texte generiert werden, und andererseits über Story-Graphen auch Einfluss auf für eine Story (oder ein Modell) relevante Fakten genommen werden kann, wie z. B. Besonderheiten des Settings.
Semi-automatisierte Tests werden vor jedem Upgrade der API ausgeführt und stellen sicher, dass die neue Version wie erwartet funktioniert.
Die generierten Texte werden über format-individuelle technische Schnittstellen für die automatische Erzeugung von weiteren Unterhaltungsformen genutzt. Hierbei können insbesondere die Schnittstellen text-to-video und text-to-game entwickelt werden.
Das Vorhandensein einer gut dokumentierten Programmierschnittstelle (API) ist ein erheblicher Vorteil für ein Software- oder ein die Software enthaltendes Hardware- Produkt, da auf diese Weise Nutzer in die Lage versetzt werden, zusätzliche Software für dieses System zu erstellen. Dadurch wiederum steigt die Attraktivität des Ausgangssystems, zum Beispiel eines Computersystems. Ein weiterer Faktor ist die Langzeit-Stabilität der API.
Entwickelt wurde eine Storytelling-Al, die zum Beispiel englische Kurzgeschichten im Umfang von bis zu 1.000 Token schreibt.
Das Trainingskorpus der Anmelderin enthält ca. 700.000 Kurzgeschichten mit je maximal 1.000 Token, die normalisiert und nach sprachlichen und inhaltlichen Parametern gefiltert sind. Dabei werden unter anderem Outlier-Texte sowie pornografische, gewalttätige, rassistische und stark politische Inhalte entfernt. Die Geschichten werden gesäubert, indem Autorenkommentare, stilistische Eigenheiten, Zeichen aus nicht-lateinischen Alphabeten und gängige Rechtschreibfehler entfernt bzw. korrigiert werden. Sonderzeichen werden vereinheitlicht.
Der Anwender kann darüber hinaus auch einen Prompt, einen Titel, eine Zusammenfassung sowie das Ende als Kontext vorgeben. Die gewünschte Textlänge wird über beim Training gelernte Kontroll-Token bestimmt. Darüber hinaus ist die Sampling-Architektur um eigene Algorithmen erweitert worden, mit denen unerwünschte Wortfolgen über eine Blocklist verboten werden,
Wiederholungen gezielter reduziert sowie die Häufigkeit direkter Rede und die gewünschte Stimmung (über Sentiment-Scores) gesteuert werden. Bei einigen Modellen können ausserdem Personennamen vorgegeben werden, da sie auf generalisierten Varianten der Korpora trainiert wurden, die Entity-Klassen statt individueller Namen enthalten. Diese können nach der Generierung zu Wunschnamen de-anonymisiert werden.
Auf Basis regelmäßig erhobener menschlicher Annotationen entwickelte die Anmelderin eine automatisierte GA, um mithilfe eigener Metriken und Diskriminatoren die generierten Geschichten vorzufiltern sowie den Prozess der Modellselektion zu beschleunigen.
Claims
1. Verfahren zur Generierung von Dateien, insbesondere von Text- und Audiodateien sowie Dateien für Computerspieie oder Videos, wobei in einem ersten Schritt vorhandene Daten gefiltert und aufbereitet, gesäubert, werden und nachfolgend aus den aufbereiteten Daten ein, im Hinblick auf die gewünschten/angestrebten Ergebnisse, abgestimmtes Trainingskorpus erzeugt wird, dadurch gekennzeichnet, dass die gefilterten und aufbereiteten Daten normalisiert werden.
2. Verfahren nach Anspruch 1, dadurch gekennzeichnet, dass die Daten für die Normalisierung in einzelnen Token bzw. Ziffern zerlegt, dargestellt und verglichen sowie verarbeitet werden.
3. Verfahren nach Anspruch 1 oder 2, dadurch gekennzeichnet, dass mittels der normalisierten Daten neue Daten aus dem Training erzeugt werden.
4. Verfahren nach einem der Ansprüche 1 bis 3, dadurch gekennzeichnet, dass die Dateien Texte, Audioformate oder Videos sind.
5. Verfahren nach einem der Ansprüche 1 bis 4, dadurch gekennzeichnet, dass die Daten- und Dateierzeugung über mindestens eine API erfolgt.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CH00280/21A CH718451A2 (de) | 2021-03-16 | 2021-03-16 | Verfahren zur Generierung von Dateien. |
| PCT/IB2022/052243 WO2022195429A1 (de) | 2021-03-16 | 2022-03-14 | Verfahren zur generierung von dateien |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| EP4309072A1 true EP4309072A1 (de) | 2024-01-24 |
Family
ID=83321964
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP22713040.8A Pending EP4309072A1 (de) | 2021-03-16 | 2022-03-14 | Verfahren zur generierung von dateien |
Country Status (7)
| Country | Link |
|---|---|
| US (1) | US20240152733A1 (de) |
| EP (1) | EP4309072A1 (de) |
| BR (1) | BR112023017560A2 (de) |
| CA (1) | CA3208648A1 (de) |
| CH (1) | CH718451A2 (de) |
| CL (1) | CL2023002713A1 (de) |
| WO (1) | WO2022195429A1 (de) |
Family Cites Families (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN108959312B (zh) * | 2017-05-23 | 2021-01-29 | 华为技术有限公司 | 一种多文档摘要生成的方法、装置和终端 |
| US11232270B1 (en) * | 2018-06-28 | 2022-01-25 | Narrative Science Inc. | Applied artificial intelligence technology for using natural language processing to train a natural language generation system with respect to numeric style features |
| US20200134103A1 (en) * | 2018-10-26 | 2020-04-30 | Ca, Inc. | Visualization-dashboard narration using text summarization |
| US11222167B2 (en) * | 2019-12-19 | 2022-01-11 | Adobe Inc. | Generating structured text summaries of digital documents using interactive collaboration |
| US20210209688A1 (en) * | 2020-01-02 | 2021-07-08 | Cognitive Scale, Inc. | Facilitation of Transparency of Claim-Settlement Processing by a Third-Party Buyer |
| US11675816B1 (en) * | 2021-01-29 | 2023-06-13 | Splunk Inc. | Grouping evens into episodes using a streaming data processor |
-
2021
- 2021-03-16 CH CH00280/21A patent/CH718451A2/de unknown
-
2022
- 2022-03-14 EP EP22713040.8A patent/EP4309072A1/de active Pending
- 2022-03-14 WO PCT/IB2022/052243 patent/WO2022195429A1/de not_active Ceased
- 2022-03-14 US US18/282,249 patent/US20240152733A1/en active Pending
- 2022-03-14 CA CA3208648A patent/CA3208648A1/en active Pending
- 2022-03-14 BR BR112023017560A patent/BR112023017560A2/pt unknown
-
2023
- 2023-09-12 CL CL2023002713A patent/CL2023002713A1/es unknown
Also Published As
| Publication number | Publication date |
|---|---|
| CL2023002713A1 (es) | 2024-06-28 |
| CA3208648A1 (en) | 2022-09-22 |
| BR112023017560A2 (pt) | 2023-10-10 |
| CH718451A2 (de) | 2022-09-30 |
| WO2022195429A1 (de) | 2022-09-22 |
| US20240152733A1 (en) | 2024-05-09 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| DE69622565T2 (de) | Verfahren und vorrichtung zur dynamischen anpassung eines spracherkennungssystems mit grossem wortschatz und zur verwendung von einschränkungen aus einer datenbank in einem spracherkennungssystem mit grossem wortschatz | |
| DE69513369T2 (de) | Verfahren und vorrichtung zur zusammenfassung statischer prozesse in eine auf regeln basierende grammatikalisch definierte natuerliche sprache | |
| DE69330633T2 (de) | Verfahren und Apparat zum Vergleichen von semantischen Mustern für das Wiederauffinden von Texten | |
| DE19825205C2 (de) | Verfahren, Vorrichtung und Erzeugnis zum Generieren von postlexikalischen Aussprachen aus lexikalischen Aussprachen mit einem neuronalen Netz | |
| DE69632517T2 (de) | Erkennung kontinuierlicher Sprache | |
| DE69623082T2 (de) | Automatische Methode zur Extraktionszusammenfassung durch Gebrauch von Merkmal-Wahrscheinlichkeiten | |
| DE69704781T2 (de) | Trainingsverfahren und-gerät | |
| DE69322741T2 (de) | Vorrichtung und Methode zur Verwendung im Ausrichten von zweisprachigen Corpora | |
| DE69427848T2 (de) | Unterstützungssystem zur Herstellung von Wörterbüchern | |
| DE212021000356U1 (de) | Erzeugen einer gestuften Textformatierung für elektronische Dokumente und Anzeigen | |
| DE19922974A1 (de) | Verfahren und Vorrichtung zur Bearbeitung eines Dokuments | |
| WO2012038014A1 (de) | System und verfahren für relevanzbasiertes kategorisieren und zeitnahes lernen von vokabeln | |
| DE112021006602T5 (de) | Verfeinern von abfrage-erzeugungsmustern | |
| EP3255556A1 (de) | Schnell-lese-verfahren und -system für text | |
| WO2022195429A1 (de) | Verfahren zur generierung von dateien | |
| DE102016114265A1 (de) | Verfahren zum zumindest teilweise maschinellen Transferieren einer in einer Quellsprache abgefassten Wortfolge in eine Wortfolge einer Zielsprache | |
| Voga et al. | Masked Morphological Priming with Varying Levels of Form Overlap: Evidence from Greek Verbs. | |
| WO2002042931A2 (de) | Verfahren zur verarbeitung von text in einer rechnereinheit und rechnereinheit | |
| EP1220201A2 (de) | Verfahren und System zur automatischen Aktionssteuerung bei Vorträgen | |
| EP4272110A1 (de) | Nlu-basierte systeme und verfahren zur erleichterten steuerung von industriellen assets | |
| Atay et al. | Rückläufiges Wörterbuch zur türkischen Verbalmorphologie | |
| Farshchi et al. | Reproduction of Traditional Ideas of Gender Discourse in Children and Adolescents’ Writings | |
| EP3665619B1 (de) | Verfahren zum erzeugen einer sprachansage als rückmeldung zu einer handschriftlichen nutzereingabe sowie entsprechende bedienvorrichtung und kraftfahrzeug | |
| Mutal et al. | Standard German Subtitling of Swiss German TV content: the PASSAGE Project | |
| EP4550214A1 (de) | Techniken zum verbessern einer künstlichen intelligenz |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: UNKNOWN |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE |
|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE |
|
| 17P | Request for examination filed |
Effective date: 20230817 |
|
| AK | Designated contracting states |
Kind code of ref document: A1 Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR |
|
| RAP3 | Party data changed (applicant data changed or rights of an application transferred) |
Owner name: ELLA MEDIA AG |
|
| DAV | Request for validation of the european patent (deleted) | ||
| DAX | Request for extension of the european patent (deleted) |