EP3942549A1 - Sprach-zu-text umwandlung von nicht-unterstützter fachsprache - Google Patents

Sprach-zu-text umwandlung von nicht-unterstützter fachsprache

Info

Publication number
EP3942549A1
EP3942549A1 EP20711580.9A EP20711580A EP3942549A1 EP 3942549 A1 EP3942549 A1 EP 3942549A1 EP 20711580 A EP20711580 A EP 20711580A EP 3942549 A1 EP3942549 A1 EP 3942549A1
Authority
EP
European Patent Office
Prior art keywords
text
speech
words
conversion system
technical
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Withdrawn
Application number
EP20711580.9A
Other languages
English (en)
French (fr)
Inventor
Oliver Kroehl
Gaetano Blanda
Stefan Silber
Inga HUSEN
Michael BARDAS
Thomas Lange
Ulf SCHÖNEBERG
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Evonik Operations GmbH
Original Assignee
Evonik Operations GmbH
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Evonik Operations GmbH filed Critical Evonik Operations GmbH
Publication of EP3942549A1 publication Critical patent/EP3942549A1/de
Withdrawn legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/08Speech classification or search
    • G10L15/14Speech classification or search using statistical models, e.g. Hidden Markov Models [HMMs]
    • G10L15/142Hidden Markov Models [HMMs]
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/08Speech classification or search
    • G10L15/18Speech classification or search using natural language modelling
    • G10L15/183Speech classification or search using natural language modelling using context dependencies, e.g. language models
    • G10L15/19Grammatical context, e.g. disambiguation of the recognition hypotheses based on word sequence rules
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/10Text processing
    • G06F40/166Editing, e.g. inserting or deleting
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/20Natural language analysis
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/20Natural language analysis
    • G06F40/253Grammatical analysis; Style critique
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/26Speech to text systems
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/28Constructional details of speech recognition systems
    • G10L15/30Distributed recognition, e.g. in client-server systems, for mobile phones or network applications
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/10Text processing
    • G06F40/12Use of codes for handling textual entities
    • G06F40/151Transformation
    • G06F40/157Transformation using dictionaries or tables
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • G10L2015/221Announcement of recognition results

Definitions

  • the invention relates to computer-implemented methods for speech-to-text conversion, in particular of technical language in the chemical industry.
  • Wear protective equipment which, in addition to a laboratory coat, can also include protective goggles or a protective mask and protective gloves. As a rule, taking and consuming food and drinks is not permitted and to avoid contamination, the office area with a desk, manuals,
  • Security gate can be changed. It may also be mandatory to take off safety clothing when leaving the laboratory area.
  • Computers or computer-controlled machines and laboratory devices are therefore very limited and inefficient in the context of a chemical or biological laboratory.
  • the aim of the present invention is to provide an improved method and terminal device according to the independent claims, which enables an improved control of software and hardware components in a laboratory context.
  • Embodiments of the invention are given in the dependent claims.
  • Embodiments of the present invention can be freely combined with one another if they are not mutually exclusive.
  • the invention relates to a computer-implemented method for speech-to-text conversion.
  • the procedure includes:
  • a voice signal from a user by a terminal, the voice signal including general and technical words spoken by the user;
  • Hardware component configured to perform a function as specified in the corrected text.
  • Embodiments of the invention are particularly suitable for use in biological and chemical laboratories, since they do not have the disadvantages mentioned in the prior art.
  • Voice-based input allows information to be entered into a terminal device at any location where a microphone is available, i.e. also within a laboratory work area, without having to leave the laboratory workstation, take off gloves or even completely interrupt work.
  • Standard textbook of chemistry could be taken, would often be unsuitable for the practice of a special company or a special branch of the chemical industry, since in the laboratory work is often done with trade names of substances. These trade names can change or a large number of new trade names are added for relevant products every year.
  • this problem is solved by resorting to a speech-to-text conversion system which is known to not support the relevant technical terms. So no attempt is made from the outset, an expensive and time-consuming one
  • Allocation table replaces the incorrectly recognized words with technical terms so that a corrected text is created that is finally output.
  • Assignment table is supplemented with the new technical terms, each together with one or more target vocabulary words incorrectly recognized for this technical term. From a technical point of view, the storage and updating of the technical terms is completely decoupled from the actual speech recognition logic. This also has the advantage that a dependency on a certain provider of speech recognition services is avoided. The field of speech recognition is still young and it is not yet foreseeable which of the multitude of parallels
  • the binding to a specific speech-to-text conversion system only takes place in that the received speech signal is first sent to this conversion system and a (faulty) text is received.
  • the binding to a specific speech-to-text conversion system only takes place in that the received speech signal is first sent to this conversion system and a (faulty) text is received.
  • the method according to embodiments of the invention can also be advantageous for employees in the field service of the chemical industry or chemical production, since these employees often use a computer or at least a smartphone in the course of their work and through a
  • Correction software are less distracted by the customer or their work than by entering text on the keyboard.
  • the terminal only picks up the voice signal, corrects the text and outputs the result of executing a software and / or hardware function on the basis of the corrected text.
  • the actual speech-to-text conversion of the speech signal into a text i.e. by far the most computationally intensive step, is carried out by the speech-to-text conversion system.
  • the speech-to-text conversion system can for example be a server that is connected to the terminal via a network, for example the Internet.
  • a terminal device with a low processor capacity for example a smartphone or a single-board computer, can be used for the input and conversion of long and complex verbal inputs.
  • the text generated by the speech-to-text conversion system is received by the terminal.
  • the terminal then also carries out the text correction, with additional ones according to embodiments
  • Data processing steps are carried out by the terminal, e.g. the terminal
  • the terminal can be a
  • Speech input via a speech-to-text interface to the speech-to-text conversion system for receiving the text from this conversion system, for correcting the text using the assignment table and for outputting the corrected text to a software-based and / or hardware-based one
  • the software-based and / or hardware-based execution system is software or hardware or a combination of both which is configured to perform a function in accordance with the
  • the software program on the terminal can e.g. be designed as a browser plug-in or browser add-in or as a standalone software application that is interoperable with the speech-to-text conversion system.
  • the text generated by the speech-to-text conversion system is also received by the terminal.
  • the terminal then does not carry out the text correction itself, but sends the text via the Internet to a control computer with correction software, which carries out the text correction based on the assignment table as described and transfers the corrected text as input to an execution system.
  • the execution system can consist of a software and / or a
  • the execution system can be for example a laboratory software or a laboratory device. According to embodiments of the invention, the execution system returns the result of executing the corrected text to the control computer. Preferably this has
  • the result of the execution of the function is preferably returned by the control computer to the terminal and / or output via other devices.
  • the terminal then outputs the result of executing the function according to the corrected text.
  • the control computer can e.g. implemented as a cloud service or implemented on a single server. This implementation variant can be advantageous for terminals of medium performance, e.g. Smartphones or control modules, which are divided into individual
  • the terminal also coordinates the data input, the data exchange with the speech-to-text conversion system, and the data exchange with the control computer. Optionally, it can be the result of executing the function according to the
  • control computer does not perform the text correction function, but rather transmits the text received from the speech-to-text conversion system to one via the network
  • Correction computer that carries out the text as described above using the table.
  • the control computer receives the corrected text and forwards it over the network to an execution system which executes a software or hardware function according to the information in the corrected text.
  • This embodiment can be advantageous because a better separation of the access rights to the functions and data of the control computer on the one hand and the
  • Correction computers on the other hand are possible. If the text correction is carried out on a separate cloud system, a user can be granted access here for the purpose of updating the table, without this also giving access to sensitive data of the control computer, which e.g. Execution systems such as Laboratory equipment is required.
  • Embodiments of the method thus essentially a device with a microphone and an optional output interface for results of the execution of the corrected text.
  • the terminal can e.g. a loudspeaker and client software that is preconfigured for data exchange with the control computer. This means that the client software on the terminal is configured to send the voice signal to the control computer via a network and a result of the execution of the corrected text in response to it
  • the terminal is preferably designed as a portable terminal.
  • the terminal can be a single board computer, e.g. Raspberry Pi, be.
  • the software “Google Assistant on Raspberry Pi”, for example, can be installed on this, which is configured in such a way that the voice signals received from the end device are sent to the control computer.
  • the address of the control computer is therefore specified and stored in the terminal. This can be advantageous since a portable and very cost-effective terminal is provided for the purpose of simplified interaction with data processing devices and services within a laboratory. It is possible to position such a device anywhere in the room or laboratory. The user can take the device with him to other rooms in the laboratory or a larger laboratory can be equipped with several devices at low cost.
  • the target vocabulary consists of a set of general language words.
  • the target vocabulary consists of a set of general language words and words derived therefrom. These derived words can, for example, be dynamically created concatenations of two or more general language words.
  • derived words can, for example, be dynamically created concatenations of two or more general language words.
  • many words, especially nouns are formed by combining several other nouns.
  • the word "ship's propeller" is so common that it is usually used in most general language
  • Some speech-to-text conversion systems can also use heuristics and / or neural networks to recognize words such as “fastening screw”, provided that the individual word components “fastening” and “screw” are part of the target vocabulary. In this sense, the word “fastening screw” also belongs to the target vocabulary of this type of speech-to-text conversion system.
  • the target vocabulary consists of a set of general language words supplemented by words that are followed by
  • Recognition accuracy in practice is so low that in practice, even such systems ultimately have a target vocabulary that does not contain or does not support these chemical terms.
  • the target vocabulary consists of a set of general language words supplemented by words derived therefrom and supplemented by words that are formed by combining recognized syllables.
  • These conversion systems are also based on a target vocabulary which the
  • the technical words are words from one of the following categories:
  • Names of chemical substances especially paints and varnishes or additives in the paint and varnish sector; in particular, the names also refer to chemical names according to a chemical naming convention, e.g. according to the IUPAC nomenclature;
  • Names e.g. trade names or proper names assigned by the user for the laboratory equipment of a laboratory
  • laboratory equipment and chemical equipment e.g. trade names or proper names assigned by the user for the laboratory equipment of a laboratory
  • the technical terms are words from the field of chemistry, in particular the chemical industry, in particular the chemistry of paints and varnishes.
  • the device or computer system which carries out the text correction for example the terminal or the control computer or a further correction computer of its own, receives or calculates or receives frequency information for at least some of the words in the text which are used by the speech Text conversion system from the speech signal was generated.
  • the frequency information indicates for words in this text how often the occurrence of this word can be expected statistically.
  • received text contain words of the target vocabulary that are in the
  • Allocation table are assigned to a technical term and which would normally be replaced.
  • the text returned could contain the phrase “Polymer Innovation”. Since this term "polymer innovation" is used in the
  • Allocation table is assigned to a technical term "polymerisation", the expression would normally be replaced by "polymerisation” in the course of the text correction.
  • the correction software assumes that the expression “Polymer Innovation” is correct due to this occurrence, even though it is assigned to a technical term in the assignment table and leaves the expression unchanged As a result, “Polymer Innovation” remains unchanged in the text.
  • a context analysis of the words within the sentence or within the entire speech input can show that the word "innovation" occurs alone in the text, e.g. because the text comes from a sales representative who has the merits of a particular
  • the frequencies of occurrence of the words in the text are calculated by the speech-to-text conversion system and returned to the terminal or the control computer together with the text from the speech-to-text conversion system.
  • the speech-to-text conversion system can use Flidden Markov Models (HMMs) to calculate the probability of occurrence of a particular word in the context of a sentence.
  • HMMs Flidden Markov Models
  • the speech-to-text conversion system can equate the occurrence frequency of a word with the occurrence frequency of the word in a large reference corpus. For example, the entirety of the texts of a newspaper over several years or another large data set of texts can serve as a reference corpus. The ratio of the counted number of words in the corpus to the totality of the words in the corpus is the frequency of occurrence of this word observed in this reference corpus. If the text is corrected by a separate correction computer
  • the frequencies of occurrence of the words in the text are calculated by the terminal after the text has been received.
  • the calculation of the probability of occurrence of the individual words or expressions can be carried out by means of HMMs, taking into account the text context of a word or using the frequencies of the word in a reference corpus be calculated.
  • the entirety of the texts received so far from the speech-to-text conversion system by the terminal or by the control computer can be used as the reference corpus.
  • the frequency information is calculated (e.g. by the terminal or by a correction service) using a hidden Markov model.
  • the expected frequency of occurrence i.e. the probability of occurrence
  • the probability of occurrence can be calculated as the product of the emission probabilities of the individual words in a word sequence, e.g. in B. Cestnik "Estimating probabilities: A crucial task in machine learning" In Proceedings of the Ninth European Conference on Artificial Intelligence, pages 147-150, Sweden, 1990.
  • Control computer in addition to the text also part-of-speech tags (POS tags) - for at least some of the words in the text that was generated from the speech signal by the speech-to-text conversion system.
  • POS tags are received by the speech-to-text conversion system and contain at least tags for noun, adjective and verb. It is also possible that the POS tags contain additional types of syntactic or semantic tags. The exact composition of the POS tags taken into account can also depend on the respective language.
  • the technical words are stored linked together with their POS tags. When the corrected text is generated, only those words of the target vocabulary in the received text are replaced by technical-language words in accordance with the assignment table whose POS tags match.
  • POS tags of the text to be replaced do not match the POS tag of the technical words, this is an indication that the corresponding words in the Text could possibly be correct after all.
  • the recognition rate of the POS tags is comparatively high, so that the quality of the correction step can be increased by this measure.
  • a technical word is, for example, the trade name “Platilon®”. It refers to thermoplastic polyurethane films from Covestro.
  • a POS tag "noun" is assigned to this technical term.
  • the method comprises steps for
  • At least one reference speech signal is recorded which selectively reproduces this technical language word.
  • the reference speech signal originates from at least one speaker.
  • at least one reference speech signal which selectively reproduces this technical expression, can be spoken and recorded by at least one speaker.
  • the remaining steps are essentially for words and expressions identical, so that in the following, when a technical term is used, a technical term is included.
  • Each of the recorded reference speech signals is fed into the speech-to-text conversion system
  • the input can in particular be via a network, e.g. the internet.
  • the device which input the reference signals receives at least one word of the target vocabulary generated by the speech-to-text conversion system from the input reference speech signal.
  • This device can e.g. act around the end device.
  • the recording of the reference speech signals, as well as the reception of the (wrong) words or expressions of the target vocabulary, which ultimately serve to create or expand the assignment table, can also be done by any other device with a network connection to the speech-to-text conversion system will.
  • the reference speech signals are preferably input via a device that is as similar as possible to the terminal in terms of construction and in terms of its positioning relative to noise sources in order to ensure that the same errors are reproducibly generated.
  • the at least one word (which can also be an expression) of the target vocabulary that is received for each of the technical language words represents an incorrect conversion since the target vocabulary of the speech-to-text conversion system does not support the technical language words.
  • the assignment table is generated as a table which assigns to each of the technical language words for which at least one reference speech signal has been recorded the at least one word of the target vocabulary in text form, which is used by the language-to-text conversion system from this technical language word containing reference speech signal was generated in each case.
  • a table can be modified and supplemented very easily without having to change source code, recompile a program or retrain a neural network. Even if a different speech-to-text conversion system is used, only the corresponding client interface has to be adapted and the technical terms in the table have to be re-entered by one or more speakers via a microphone and transferred to the new speech-to-text conversion system be transmitted. The one from this one Incorrect target language words and expressions returned to the new system form the basis for the new mapping table. It is thus possible without profound or complex changes and without retraining one
  • the assignment table can be, for example, as a table of a relational database or as a
  • several reference speech signals are recorded by different speakers for each of at least some of the technical language words (or technical language expressions).
  • the multiple reference language signals reproduce this technical word (or this technical expression).
  • the assignment table assigns a plurality of words (or phrases) of the target vocabulary in text form to each of at least some of the technical language words (or phrases).
  • the multiple words (or phrases) of the target vocabulary represent miss-conversions that the speech-to-text conversion system has produced for the various speakers depending on their voice.
  • a specific technical word such as “1,2-methylenedioxybenzene” can be read out by 100 different people and recorded with a microphone as a reference speech signal.
  • Reference speech signals for this one substance name Each of these 100 reference speech signals is sent to the speech-to-text conversion system, and 100 words or phrases of the
  • Target vocabulary returned all of which do not correctly reflect the actual technical name. Often times the 100 words returned will be the same, but not always. Different people have different voices, which means that speech input differs in terms of emphasis, volume, pitch and articulation. Therefore it is possible that a specific language-to-text conversion system for a specific technical word (or a specific technical expression) returns several different, incorrect words or expressions, which are all included in the assignment table.
  • the terminal device or the computer system that carried out the text correction is configured to output the corrected text to the user via a loudspeaker and / or a display. This has the advantage that the user has another chance to check the correctness of the corrected text.
  • the terminal device or the computer system that carried out the text correction is configured to output the result of the execution of the corrected text that is supplied by the execution system to the user.
  • the output can take place, for example, in that the result is displayed in text form on a screen of the
  • the result of the execution of the corrected text can be output via a text-to-speech interface and a loudspeaker of the terminal.
  • the execution system that executes a function according to the corrected text is software.
  • the software can be a chemical one
  • this software can be a database management system (DBMS) and / or an external software program which is interoperable with this de BMS, the DBMS containing and managing the chemical database.
  • the software is designed to interpret the corrected text as a search entry and to determine and return information on the search entry in the database.
  • the Substance database can, for example, be part of a chemical plant, such as an HTE plant.
  • the software can be an Internet search engine which is designed to interpret the corrected text as a search input and to determine and return information about the search input on the Internet.
  • the software can be a
  • the simulation software is designed to determine properties of chemical products, in particular of paints and varnishes, based on a predetermined recipe for the production of the
  • the simulation software interprets the corrected text as a specification of the recipe of the product, its
  • Properties are to be simulated and / or as a specification of the properties of the product.
  • the software can be a
  • control software is designed to interpret the corrected text as a specification of the synthesis or the components of the substance mixture.
  • the corrected text is output by the terminal to the hardware component.
  • the hardware component can in particular be a system for the
  • the system can be a high throughput system (HTE system) for the analysis and manufacture of paints and varnishes.
  • HTE system can be a system for automatic testing and for the automatic production of chemical products, as described in WO 2017/072351 A2.
  • Hardware components can be very advantageous, especially in the context of a biological or chemical laboratory, as the voice input is processed in such a way that it can be passed on directly to a technical system and interpreted correctly by it, without the user having to take off gloves or leave the laboratory, for example .
  • the hardware component can be a device or device module or a computer system within a chemical or biological laboratory.
  • the hardware component can be an automatic or semi
  • This system for analyzing and / or synthesizing chemical products, especially paints and varnishes, can be an HTE system.
  • the system for the analysis and / or synthesis of chemical products can be any system for the analysis and / or synthesis of chemical products.
  • these analyzes can be carried out using optical measurements in cuvettes after sampling;
  • Viscosity measurement can be particularly useful for highly viscous substances or
  • Mixtures contain an automatic dilution step because the
  • Viscosity is easier to determine in a dilute solution; the viscosity of the original substance or substance mixture is calculated based on the viscosity of the diluted solution;
  • the substances and substance mixtures can in particular be substances and substance mixtures which are used to produce paints and varnishes. It can also be with the substances and
  • the speech-to-text conversion system is implemented as a service which is provided to a large number of terminals via the Internet.
  • the speech-to-text conversion system can be Google's “Speech-to-Text” cloud service.
  • This can be advantageous because a functionally powerful API client library is available for this, e.g. for .NET.
  • This can be advantageous because the computationally expensive conversion process of speech signals into text does not take place on the end device, but on a server, preferably a cloud server, which has a greater computing power than the end device and which recognizes the fast and parallel conversion of a large number of speech signals into Texts is designed.
  • the terminal can, for example, be a desktop computer, a notebook, a smartphone, a tablet computer, a computer integrated into a laboratory device, a computer locally coupled to a laboratory device, or a single-board computer
  • the software logic which implements the method according to embodiments of the invention can be implemented exclusively on the terminal device or on the terminal device and one or more other computers, in particular cloud computer systems, in a distributed manner.
  • the software logic is preferably software that is device-independent and preferably also independent of the terminal's operating system.
  • the terminal device is preferably a device which is located within a laboratory room or which is at least operatively connected to a microphone within a laboratory room.
  • the invention relates to a terminal.
  • the end device includes:
  • a microphone for receiving a voice signal from a user the
  • Speech signal spoken by the user general language and
  • the interface is designed to input the received speech signal into the speech-to-text conversion system.
  • the speech-to-text conversion system only supports the conversion of speech signals into a target vocabulary that does not contain the technical words.
  • the interface is designed to receive a text, which from the
  • Speech-to-text conversion system from the speech signal was generated.
  • a data memory with an assignment table of words in text form.
  • the assignment table assigns at least one word of the target vocabulary to each of a multiplicity of technical language words or technical language expressions.
  • the at least one word assigned to the technical-language word can also be an expression or a set of words and expressions from the target vocabulary.
  • the at least one word of the target vocabulary assigned to a technical-language word is a word or an expression which the speech-to-text conversion system incorrectly recognizes (and incorrectly recognized in the course of creating the assignment table) if this
  • a correction program which is designed to a corrected text by automatically replacing words and expressing the target vocabulary in the received text with technical words according to
  • the execution system is software and / or a hardware component and is configured to execute a function according to information in the corrected text.
  • the terminal is preferably configured to receive a result of the execution from the software or hardware via this or another interface;
  • the terminal further includes an output interface, e.g. to create an acoustic interface such as a loudspeaker, or an optical interface, e.g. a GUI (graphic
  • User interface can also be a different interface, e.g. a proprietary data format for exchanging text data with a specific laboratory device.
  • the invention relates to a system comprising one or more terminals according to one of the embodiments described here.
  • the system also includes a speech-to-text conversion system.
  • the speech-to-text conversion system includes:
  • an automatic speech recognition processor for generating text from a received speech signal.
  • the speech recognition processor only supports the conversion of speech signals into a target vocabulary that does not contain the technical words.
  • Said interface of the speech-to-text conversion system is designed to return the text generated from a received speech signal to the terminal from which the speech signal was received.
  • the system in particular in which the text correction is not carried out by the terminal but by the control computer or a correction computer, the system also includes the control computer and / or the correction computer.
  • the system further comprises the software or hardware component that performs the function according to the corrected text.
  • a “vocabulary” is understood here to mean a linguistic area, i.e. a set of words which an entity, e.g. a speech-to-text conversion system.
  • a “word” is understood here to mean a coherent sequence of characters which occur within a certain vocabulary and which represents an independent linguistic unit.
  • a word - in contrast to a sound or a syllable - has an independent one
  • An “expression” is understood here as a linguistic unit made up of two or more words.
  • a “technical word” or “technical term” is understood here to mean a word from a technical term vocabulary. A technical word does not belong to the target vocabulary and is typically not part of the
  • Conversion of speech signals into a target vocabulary supported means that words of another vocabulary either cannot be converted into text at all or are only converted into text with a very high error rate, whereby the error rate is above an error rate limit value per word or phrase to be converted, which is the maximum must be regarded as tolerable for a functioning translation of speech into text.
  • this limit value can be with an error probability per word or expression of over 50%, preferably already over 10%.
  • Labeling understood, which is assigned to each word in a text corpus in order to identify the part of the language and often also other grammatical categories such as tense, number (plural / singular), upper / lower case etc.
  • Tag sets for different languages are typically different.
  • Basic tag sets contain tags for the most common language components (e.g. N for noun, V for verb, A for adjective, etc.).
  • a “virtual laboratory assistant” is software or software routine that works with one or more laboratory devices and / or in a laboratory
  • Software programs is operatively linked in such a way that information from these laboratory equipment and laboratory software programs are received and instructions for use
  • a laboratory assistant has an interface for data exchange with and for controlling one or more laboratory devices and laboratory software programs.
  • the laboratory assistant also has an interface to a user and is configured to provide the user with Interface to enable easier use, monitoring and / or control of the laboratory equipment and the laboratory software programs.
  • the interface to the user can be an acoustic interface or
  • An “end device” is a data processing device (for example PC, notebook, tablet computer, single-board system, Raspberry Pi computer,
  • the terminal is preferably connected to a network connection.
  • a “reference speech signal” is a speech signal that was recorded by a microphone and that is based on a speech input that was not entered by the speaker into the microphone for the purpose of operating software or hardware, but rather for creation or to add to the allocation table.
  • Speech input is a spoken technical word or a spoken technical expression which is recorded in order to pass the corresponding speech signal on to the speech-to-text conversion system and to receive a word or an expression of the target vocabulary in response from the conversion system, that on a faulty one
  • FIG. 1 shows a flow chart of a method for speech-to-text
  • Figure 2 shows a block diagram of a distributed speech-to-text system
  • FIG. 3 shows a block diagram of another distributed system for
  • Figure 4 shows a block diagram of another distributed speech-to-text conversion system
  • FIG. 5 shows a block diagram of another distributed system for
  • Speech-to-text conversion in the context of a laboratory Speech-to-text conversion in the context of a laboratory.
  • FIG. 1 shows a flow diagram of a computer-implemented method for the speech-to-text conversion of texts with technical words.
  • the particular advantage of the process is that it uses an existing speech-to-text conversion system for recognizing and converting texts
  • Implementation system does not support the technical vocabulary at all.
  • the method can be carried out by a terminal device alone or by a terminal device and further data processing devices, for example a control computer and / or a computer that offers a correction service via a network.
  • FIGS. 2, 3 and 4 Data processing systems which can implement a method according to embodiments of the invention are shown in FIGS. 2, 3 and 4. In some cases, reference is also made to these figures in the description of the flow chart in FIG.
  • the method can typically be used in the context of a chemical or biological laboratory.
  • a chemical or biological laboratory In the laboratory there are a number of individual analysis devices and a high throughput system (high throughput
  • the HTE system contains a large number of units and modules that can analyze and measure various chemical or physical parameters of substances and substance mixtures and which can combine and synthesize a large number of different chemical products based on a recipe entered by a user.
  • the HTE system contains an internal database in which recipes, for example of paints and varnishes and their raw materials and their respective physical chemical, optical and other properties are stored.
  • recipes for example of paints and varnishes and their raw materials and their respective physical chemical, optical and other properties are stored.
  • other relevant data can be stored in the database, for example product data sheets of the manufacturers of the substances,
  • Safety data sheets parameters for the configuration of individual modules of the HTE system for the analysis or synthesis of certain substances or products and the like.
  • the HTE system is designed to carry out analyzes and syntheses based on recipes and instructions that are entered in text form.
  • Frequent activities within a laboratory with the laboratory room number 22 relate, for example, to the following activities and related possible voice inputs of a laboratory worker 202 to software or
  • the simulation can e.g. based on CNNs (convolutional neuronal networks).
  • CNNs convolutional neuronal networks
  • all of these inputs and commands can be sent to the respective execution systems without the user having to leave the laboratory and / or take off gloves.
  • the laboratory worker 202 makes a voice input 204 into a microphone 214 of the terminal 212, 312.
  • the voice input can consist of one of the above-mentioned voice commands.
  • the voice inputs usually contain both general and technical language Words and expressions.
  • the words or expressions “rheological”, “naphtenic oil”, “methol n-amyl ketone”, “n-pentyl propiona” are chemical terms and “LMGÜNSTIG” is a trade name for a chemical product. These words or phrases are typically not in that supported by common general language speech-to-text conversion systems
  • the microphone 214 converts the voice input into an electronic voice signal 206. This speech signal is then input to a speech-to-text conversion system 226 in step 104.
  • the terminal device can have an interface 224 and corresponding client application 222 to one of the known general language speech-to-text conversion systems 226 from, for example, Google, Apple, Amazon or Nuance.
  • This client application 222 sends that
  • Speech signal via the interface 224 directly to the speech-to-text conversion system 226. In other embodiments, however, it is also possible that the speech signal via one or more intermediary
  • Data processing equipment is sent to the speech-to-text conversion system 226.
  • the voice signal is first sent to a control computer 314, 414, which then forwards it to the voice-to-text conversion system 226 via a network 236.
  • the network can be, for example, the Internet.
  • the control computer system 314, 414 carries out coordination and control activities with regard to the management and processing of the speech signal and the text generated from it.
  • the control computer 314 is a data processing system which carries out the text correction itself.
  • Control computer 414 also has this calculation step to a further one
  • the speech-to-text conversion system 226 is general language
  • Conversion system that is, it only supports conversion of Speech signals in a general language target vocabulary 234 which does not contain the technical language words of the speech input 204.
  • the speech-to-text conversion system now performs the conversion of the
  • Speech signal into a text based on the target vocabulary is a cloud service that can process a large number of speech signals from several terminals in parallel and return them to them via the network.
  • the generated text will contain, with certainty or with a very high degree of probability, incorrectly recognized words and expressions, since at least some of the words and expressions of the voice input 204 consist of technical language words or expressions. Expressions exist, whereas the conversion system only supports the target vocabulary which does not contain the technical words and expressions.
  • step 106 the data processing system which receives the
  • Speech signal 206 to speech-to-text conversion system 226, in response thereto, the text 208 generated from that signal by the speech-to-text conversion system.
  • receiving system can, depending on
  • an allocation table 238 is used to correct the received text.
  • Correcting text is also referred to here as the "correction system" because of its function.
  • this can be the terminal 212, or the control computer system 314, or a
  • Correction computer system 402 act. If receiving system and
  • Correction system are not identical, the text 208 received from the receiving system is forwarded to the correction computer system.
  • words are assigned to one another in text form.
  • the assignment table assigns at least one word to each of a plurality of technical language words or technical language expressions from the target vocabulary.
  • the at least one word of the target vocabulary assigned to a technical word (or technical expression) is a word or an expression that the speech-to-text conversion system incorrectly recognizes (and has already incorrectly recognized earlier when creating the table) if this technical language Word in the form of an audio signal is input into the speech-to-text conversion system.
  • step 110 the correction system 212, 314, 402 generates a corrected text 210 from the erroneous text 208 of the conversion system 226.
  • the corrected text is automatically generated by the correction system in that words and expressions of the target vocabulary in the received text 208 by technical language according to the allocation table 238 can be replaced.
  • the corrected text is returned to a control computer.
  • the terminal device or the control computer inputs the corrected text 210 directly or indirectly into an execution system 240 in step 112. examples for
  • FIG. 1 The various execution systems are shown in FIG. The
  • Execution system a software and / or flardware component, executes a software and / or flardware function in accordance with the corrected text and returns a result 242.
  • the result can, for example, be returned directly to the terminal or returned to the terminal via the control computer as an intermediate station. Alternatively or additionally, however, the result can also be returned to other terminals and other data processing systems.
  • Control computer 314 functioning as a correction system sends the corrected text to the execution system 240, receives the result 242 of the execution therefrom and forwards this result to the terminal for output to the user 202.
  • the result is typically a text, e.g. a recipe researched in a database for the synthesis of a chemical substance, a document found in a database or on the Internet, e.g. Product data sheet of a substance that
  • terminal device or another data processing system can use the software and / or the result of the execution of the function
  • the software and / or the flardware is preferably software and flardware that are designed within a laboratory or specifically for the activities within a laboratory or that can at least be used for this purpose.
  • the terminal 212 can contain a loudspeaker or be communicatively coupled to it and output the result in acoustic form via this loudspeaker. Additionally or alternatively, the terminal can contain a screen for outputting the result to the user.
  • Other output interfaces are also possible, for example Bluetooth-based components.
  • the method can be used to implement voice control of electronic devices, in particular laboratory instruments and FITE systems, by means of voice control.
  • electronic devices in particular laboratory instruments and FITE systems
  • Voice control can also be used to research and output results of analyzes and syntheses already carried out in the laboratory, laboratory protocols and product data sheets in the corresponding databases of the laboratory and to carry out additional searches also on the Internet and public or proprietary databases accessible via the Internet using voice control. Also voice commands, which special names for chemicals or
  • Embodiments of the invention thus enable largely voice-controlled, highly integrated operation of a chemical or biological laboratory or a laboratory HTE system.
  • CONTROL COMPUTER The word "CONTROL COMPUTER" in the
  • Voice input can, for example, be the name of a virtual assistant 502 for voice-based operation of the devices in a laboratory and / or a FITE system of a laboratory.
  • the word "CONTROL COMPUTER” (or any other name that may be more pronounced of a person such as "EVA") can be used as a trigger signal to trigger a text evaluation logic of this laboratory assistant to evaluate the corrected text .
  • the laboratory assistant is configured to check every received text to see whether it contains its name and, if applicable,
  • the corrected text is further analyzed in order to recognize and execute commands encoded in it.
  • the output of the result data takes place via a loudspeaker which is located within the laboratory room.
  • the loudspeaker can be a loudspeaker that is part of the terminal that received the user's voice input.
  • it can also be another loudspeaker that is communicatively connected to this terminal. This has the advantage that a laboratory worker can enter commands with his voice without media discontinuity, for example about analysis results, product data sheets or other context
  • FIG. 2 shows a block diagram of a distributed system 200 for the speech-to-text conversion of texts with technical language words.
  • Terminal 212 can be, for example, a notebook, a standard computer, a tablet computer, or a smartphone. On the
  • Terminal has installed client software 222 which is interoperable with an existing general language speech-to-text conversion system 226.
  • the speech-to-text conversion system 226 is a cloud computer system which offers this conversion as a service via the Internet via a corresponding language-to-text interface (SZT interface) interface 224.
  • the service is a software program 232 implemented on the server side which, in functional terms, corresponds to a speech recognition and language conversion processor.
  • the software program 232 can be Google's Speech-to-Text
  • the interface 224 is a cloud-based API from Google.
  • the terminal has the assignment table 238 and sufficient computing power to carry out the correction of the text 208 generated by the speech-to-text conversion system 226 based on the table itself.
  • the sending of the voice signal 206 to the server 226, the reception of the text 208 from the server 226 and the Correction of the text to create the corrected text 210 can thus be implemented in the client program 222.
  • the client program 222 can be, for example, a browser plug-in or a standalone application that is interoperable with the server software 232 via the interface 224.
  • FIG. 3 shows a block diagram of a further distributed system 300 for speech-to-text conversion.
  • the system architecture of the system 300 differs from the architecture of the system 200 in that the terminal 312 has outsourced the function of text correction to a control computer 314.
  • Client software 316 installed on the terminal 312, called a control client here, is connected to a
  • control program 320 which is installed on a control computer 314, interoperable.
  • the terminal is connected to the control computer 314 via a network 236, for example the Internet.
  • the control interface 318 is used for data exchange between control client 316 and control program 320.
  • the control computer 314 can be, for example, a
  • Control computer around a server or a cloud computer system Control computer around a server or a cloud computer system.
  • the control program 320 installed on the control computer implements, on the one hand, coordinative functions 322 to facilitate the exchange of data (voice signal 206, recognized text 208, corrected text 210) between the various
  • Correction function 324 which is carried out in the system 200 by the terminal. Correction function 324 is to remove words and phrases from the
  • Conversion system 226 controls and does not perform the text correction can be implemented as part of control program 320. However, it is also possible for the control program 320 and the client 222 to be separate but interoperable programs.
  • the architecture shown in FIG. 3 has the advantage that the terminal does not have to carry out any computationally intensive operations. Both the implementation of the
  • Speech signal in text as well as the correction of this text are taken over by other data processing systems.
  • the function of the terminal device 312 is essentially limited to the reception of the voice signal 206, the
  • Execution system is returned when performing a function according to the corrected text.
  • FIG. 4 shows a block diagram of a further distributed system 400 for speech-to-text conversion.
  • the system architecture of the system 400 differs from the architecture of the system 300 in that the control computer 414 does not carry out the text correction itself, but rather has it carried out by another computer, referred to here as a “correction computer” or “correction server” 402, the other
  • Control program 320 of the control computer is interoperably connected.
  • control program 320 on the control computer 414 can, for example, have extensive access rights with regard to various, in some cases sensitive, data have that in the course of the analysis and synthesis of chemical substances and
  • control computer 414 can, for example, have a machine-to-machine interface in order to send the corrected text in the form of a control command directly to a laboratory device or an HTE system or to their database for analysis, chemical synthesis or Initiate research based on the corrected text 210.
  • a secure and strict access protection for the control computer 414 is therefore particularly important.
  • the correction server 402 in the context of the architecture of the system 400 only serves to correct the text 208 that is generated by the speech-to-text conversion system 226 and sent to the control program 320
  • adding technical terms and expressions has no reading and / or writing access to the control computer 414. It is thus possible to continuously update the assignment table and thus the text correction without the need to do this
  • the terminal 312 of the distributed systems 300, 400 can be, for example, computers, notebooks, smartphones and the like. But it is also possible that the single-board computers are comparatively weak, e.g. Raspberry Pi Systems.
  • All of the system architectures 200, 300, 400 and 500 shown here enable the use of existing speech-to-text APIs from various cloud providers using their own, cloud-provider-independent hardware for a subject-specific one To enable speech recognition and a control of laboratory equipment and electronic search services based on it in a laboratory.
  • FIG. 5 shows a block diagram of a further distributed system 500 for speech-to-text conversion in the context of a chemical laboratory.
  • the laboratory includes a laboratory area 504 with the usual safety regulations.
  • various individual laboratory devices 516 e.g. a centrifuge and an HTE system 518.
  • the HTE system contains a large number of modules and
  • Hardware units 506-514 that are managed and controlled by a controller 520.
  • the controller serves as the central interface for monitoring and
  • Control program 320 on control computer 414 contains a software module 502 which implements a virtual laboratory assistant.
  • control program 320 After the control program 320 has received the corrected text from
  • Correction computer 402 has received, the control program evaluates it and searches for a keyword such as "CONTROL COMPUTER” or "EVA". If the corrected text contains this keyword, the virtual laboratory assistant 502 is prompted to further analyze the corrected text to determine whether the corrected text includes instructions for performing a hardware or software function and, if so, which hardware or software is under control of the laboratory assistant 502 these commands are to be executed.
  • the corrected text can contain names of devices or laboratories, which specify which device and which software the command should be forwarded to.
  • corrected text 210 by the virtual laboratory assistant that an Internet search engine 528 is to search for a certain substance that is specified in the corrected text 210 as a technical word or phrase.
  • the corrected text or certain parts of it are entered into the search engine by the virtual assistant 502 via the Internet.
  • the results 524 of the Internet searches are returned to the assistant 502, who forwards them to a suitable output device in the vicinity of the user 202, for example terminal 312, where they are output via a loudspeaker or screen 218, for example.
  • the evaluation of the corrected text 210 by the virtual laboratory assistant shows that the laboratory device 512, a centrifuge, is to pellet a certain substance at a certain speed.
  • the name of the centrifuge and the substance are specified in the corrected text 210 as a technical word or phrase, which is sufficient because the centrifuge automatically reads the centrifugation parameters to be used such as duration and number of revolutions from an internal database based on the substance name.
  • the corrected text or certain parts of it are sent by the virtual assistant 502 to the centrifuge 512 via the Internet. The centrifuge starts one associated with the substance
  • Centrifugation program and returns a message about successful or unsuccessful centrifugation as text message 522.
  • the result 522 is returned to the assistant 502, which forwards it to a suitable output device, for example terminal 312, where it e.g. is output via a loudspeaker or screen 218.
  • the evaluation of the corrected text 210 by the virtual laboratory assistant shows that the HTE system 518 is to synthesize a specific paint.
  • the components of the paint are also specified in the corrected text and consist of a mixture of trade names of chemical products and IUPAC substance names.
  • the HTE system receives the corrected text 210 and autonomously decides to carry out the synthesis in the synthesis unit 514.
  • a message about the successful synthesis or an error message is returned as result 526 by the synthesis unit 514 to the controller of the HTE system 518, and the controller in turn returns the result 526 to the virtual laboratory assistant 592, which sends it to a suitable output device, for example Terminal 312, where it is output via a loudspeaker or screen 218, for example.
  • a suitable output device for example Terminal 312, where it is output via a loudspeaker or screen 218, for example.

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Computational Linguistics (AREA)
  • Multimedia (AREA)
  • Human Computer Interaction (AREA)
  • Acoustics & Sound (AREA)
  • Theoretical Computer Science (AREA)
  • Artificial Intelligence (AREA)
  • General Health & Medical Sciences (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Probability & Statistics with Applications (AREA)
  • Machine Translation (AREA)
  • Management, Administration, Business Operations System, And Electronic Commerce (AREA)

Abstract

Die Erfindung betrifft ein computerimplementiertes Verfahren zur Sprach-zu-Text- Umwandlung. Das Verfahren umfasst: Empfang (102) eines Sprachsignals (206), welches allgemeinsprachliche und fachsprachliche Wörter beinhaltet; - Eingabe (104) des empfangenen Sprachsignals in ein Sprach-zu-Text- Umwandlungssystem (226) welches lediglich die Umwandlung von Sprachsignalen in ein Zielvokabular (234), welches die fachsprachlichen Wörter nicht beinhaltet, unterstützt; - Empfang (106) eines Textes (208), welcher von dem Sprach-zu-Text- Umwandlungssystem aus dem Sprachsignal erzeugt wurde; - Erzeugen (110) eines korrigierten Textes (210) durch automatisches Ersetzen von Wörtern und Ausdrücken des Zielvokabulars in dem empfangenen Text durch fachsprachliche Wörter gemäß einer Zuordnungstabelle (238) welche jedem von einer Vielzahl von fachsprachlichen Wörtern zumindest ein von dem Sprach-zu-Text- Umwandlungssystem fälschlicherweise erkanntes Wort oder einen fälschlicherweise erkannten Ausdruck aus dem Zielvokabular zuordnet; und - Ausgabe (112) des korrigierten Textes an den Nutzer oder an eine Software und/oder Hardwarekomponente zur Ausführung einer Funktion.

Description

SPRACH-ZU-TEXT UMWANDLUNG VON NICHT-UNTERSTUTZTER
FACHSPRACHE
Technisches Gebiet
Die Erfindung betrifft computerimplementierte Verfahren zur Sprach-zu-Text- Umwandlung, insbesondere von Fachsprache der chemischen Industrie.
Stand der Technik
In chemischen Laboratorien gelten aufgrund verschiedener sowohl von Substanzen als auch von Geräten ausgehender Gefahren eine Vielzahl von Regeln, um dort ein sicheres Arbeiten zu gewährleisten. Je nach Art des Labors, der dort ausgeführten Tätigkeiten und den verwendeten Substanzen können deshalb unter anderem folgende Sicherheitsvorschriften herrschen: es ist eine persönliche
Schutzausrüstung zu tragen, die neben einem Laborkittel auch Schutzbrille oder Schutzmaske sowie Schutzhandschuhe umfassen kann. Mitnahme und Verzehr von Speisen und Getränken ist in der Regel nicht gestattet und zur Vermeidung von Kontamination ist der Bürobereich mit Schreibtisch, Handbüchern,
Produktdokumentation in Papierform, Computerarbeitsplatz und Internetzugang und der Laborarbeitsbereich räumlich voneinander getrennt. Die räumliche Trennung kann vorsehen, dass zwischen Bürobereich und Laborbereich nur über eine
Sicherheitsschleuse gewechselt werden kann. Es kann auch vorgeschrieben sein, die Sicherheitskleidung bei Verlassen des Laborbereiches abzulegen.
Die Sicherheitsvorschriften erschweren den Arbeitsablauf teils erheblich: falls ein Computer mit Internet- und/oder Datenbankzugang nur im Bürobereich verfügbar ist, muss für jeden Bedienschritt die Sicherheitskleidung abgelegt und dann alsbald beim erneuten Betreten des Labors wieder angelegt werden. Sogar falls ein
Computer mit einer Tastatur und Internetanschluss innerhalb des Laborbereichs verfügbar ist, kann die Tastatur mit den Handschuhen oft nicht bedient werden. Die Handschuhe müssen ausgezogen und gegebenenfalls entsorgt werden. Nach Abschluss der Arbeit mit dem Computer müssen erneut Handschuhe angezogen werden, um mit der Laborarbeit fortfahren zu können.
Im Einzelfall gibt es Laborgeräte mit einer besonders großen Tastatur, etwa in Form eines großen Touchscreens, um die Eingabe mit Handschuhen zu erleichtern.
Diese spezielle Hardware ist jedoch teuer und nicht für alle Laborgeräte verfügbar. Insbesondere besitzen Standard-Computer und Standard-Notebooks nicht über eine solche„handschuhgeeignete“ Tastatur.
Die heute in einem Labor verwendeten Geräte sind teilweise hoch komplex und sind auch zur flexiblen Interpretation komplexer textbasierter Eingaben ausgelegt. So beschreiben beispielsweise M. Hummel, D. Porcincula und E. Sapper im European Coatings Journal (01.02.2019) im Artikel„NATURAL LANGUAGE PROCESSING. A semantic framework for coatings Science - robots reading recipes” ein auto matisches Laborsystem, welches dazu ausgebildet ist, natürlichsprachliche Texteingaben Textmining- und NLP Tools automatisch zu analysieren und zu interpretieren und basierend auf den Angaben in diesen natürlichsprachigen Texten chemische Synthesen durchzuführen. Allerdings muss der Nutzer auch bei diesen Systemen manuell mit einer Nutzerschnittstelle interagieren um diesen Test einzugeben, sodass auch hier die Handschuhe abgelegt werden müssen.
Die derzeit verfügbaren Möglichkeiten zur Nutzung von bzw. Interaktion mit
Computern bzw. Computer-kontrollierten Maschinen und Laborgeräten sind daher im Kontext eines chemischen oder biologischen Labors sehr eingeschränkt und ineffizient.
Zusammenfassung
Ziel der vorliegenden Erfindung ist es, ein verbessertes Verfahren und Endgerät gemäß den unabhängigen Ansprüchen bereitzustellen, welches im Laborkontext eine verbesserte Steuerung von Software- und Hardwarekomponenten ermöglicht. Ausführungsformen der Erfindung sind in den abhängigen Ansprüchen angegeben. Ausführungsformen der vorliegenden Erfindung können frei miteinander kombiniert werden, wenn sie sich nicht gegenseitig ausschließen.
In einem Aspekt betrifft die Erfindung ein computerimplementiertes Verfahren zur Sprach-zu-Text-Umwandlung. Das Verfahren beinhaltet:
- Empfang eines Sprachsignals eines Nutzers durch ein Endgerät, wobei das Sprachsignal von dem Nutzer gesprochene allgemeinsprachliche und fachsprachliche Wörter beinhaltet;
- Eingabe des empfangenen Sprachsignals in ein Sprach-zu-Text- Umwandlungssystem, wobei das Sprach-zu-Text-Umwandlungssystem lediglich die Umwandlung von Sprachsignalen in ein Zielvokabular, welches die fachsprachlichen Wörter nicht beinhaltet, unterstützt;
- Empfang eines Textes, welcher von dem Sprach-zu-Text- Umwandlungssystem aus dem Sprachsignal erzeugt wurde, von dem Sprach-zu-T ext-Umwandlungssystem ; - Erzeugen eines korrigierten Textes durch automatisches Ersetzen von Wörtern und Ausdrücken des Zielvokabulars in dem empfangenen Text durch fachsprachliche Wörter gemäß einer Zuordnungstabelle, wobei die Zuordnungstabelle Wörter in Textform einander zuordnet, wobei die Zuordnungstabelle jedem von einer Vielzahl von fachsprachlichen Wörtern oder Ausdrücken zumindest ein von dem Sprach-zu-Text- Umwandlungssystem fälschlicherweise erkanntes Wort oder einen fälschlicherweise erkannten Ausdruck aus dem Zielvokabular zuordnet; und
- Ausgabe des korrigierten Textes an eine Software und/oder an eine
Hardwarekomponente, die dazu konfiguriert ist, eine Funktion gemäß Angaben in dem korrigierten Text auszuführen.
Ausführungsformen der Erfindung eignen sich insbesondere für den Einsatz in biologischen und chemischen Laboratorien, da sie die im Stand der Technik genannten Nachteile nicht aufweisen. Die sprachbasierte Eingabe erlaubt es, Informationen an einem beliebigen Ort, wo ein Mikrophon vorhanden ist, also auch innerhalb eines Laborarbeitsbereiches, Sprachdaten in ein Endgerät einzugeben, ohne den Laborarbeitsplatz verlassen, Handschuhe ablegen oder gar die Arbeit vollständig unterbrechen zu müssen.
Zwar gibt es mittlerweile auf dem Markt günstige Endgeräte und leistungsfähige Applikationen zur sprachbasierten Eingabe von Befehlen in Computersysteme, zum Beispiel Alexa (Amazon), Cortana (Microsoft), den Google Assistant und Siri (Apple). Diese sind jedoch dazu konzipiert, Endnutzer bei alltäglichen Tätigkeiten wie etwa dem Einkauf, der Wahl eines Radioprogramms oder der Buchung eines Hotels zu unterstützen. Die besagten Endgeräte und Applikationen sind damit für alltägliche Situationen konzipiert und unterstützen auch nur allgemeinsprachliche Wörter. Auch dann, wenn vereinzelt fachsprachliche Wörter („Fachwörter“) unterstützt werden, ist die Erkennungsgenauigkeit der besagten Systeme drastisch reduziert. In der Biologie und insbesondere der chemischen Industrie werden im Laborkontext jedoch eine Vielzahl von Fachwörtern benutzt, die in der
Allgemeinsprache nicht Vorkommen. Auch ist gerade im Kontext eines chemischen Labors eine hohe Präzision der Spracherkennung von besonderer Bedeutung. Während in der Alltagssprache kleine Fehler oft als solche erkennbar sind und vom Nutzer oder Empfängersystem als Fehler erkennbar sind und leicht korrigiert oder kompensiert werden können (zum Beispiel fehlerhafte Erkennung der
Singular/Pluralform führt nicht dazu, dass eine entsprechende Eingabe in eine Internetsuchmaschine wesentlich andere Ergebnisse zurückgibt), können im
Kontext chemischer Synthesen bereits kleinste Abweichungen (z.B.„bis“ statt„tris“) dazu führen, dass eine völlig andere Substanz„erkannt“ wird als die, welche der Sprecher eigentlich meinte, und das resultierende Produkt entweder unbrauchbar ist oder sogar ein Gefährdungspotential mit Risiken für die Gesundheit des Personals bzw. den sicheren Laborbetrieb durch Einsatz falscher Substanzen entstehen können. Die besagten und für den Alltag konzipierten Sprach-zu-Text- Umwandlungssysteme sind daher für die Verwendung in biologischen und chemischen Laboratorien mit entsprechenden Risiken nicht geeignet.
Teilweise existieren auch Sprach-zu-Text-Umwandlungssysteme, welche speziell auf die Belange und das Vokabular einer bestimmten Fachrichtung ausgelegt sind. So bietet beispielsweise die Firma Nuance die Software„Dragon Legal“ für Juristen an, welche zusätzlich zum alltagssprachlichen Vokabular auch juristische
Fachbegriffe beinhaltet. Nachteilig ist jedoch, dass das Vokabular, das in einem bestimmten Labor benötigt wird, z.B. im Bereich der Herstellung und Analyse von Farben und Lacken, so speziell und dynamisch veränderlich ist, dass auch eine Spracherkennungssoftware mit chemischen Begriffen, die etwa einem
Standardlehrbuch der Chemie entnommen werden könnte, für die Praxis einer speziellen Firma oder eines speziellen Zweigs der chemischen Industrie oft ungeeignet wäre, da im Labor vielfach auch mit Handelsnahmen von Substanzen gearbeitet wird. Diese Handelsnamen können sich verändern bzw. es kommen jedes Jahr eine Vielzahl neuer Handelsnamen für relevante Produkte hinzu.
Insbesondere kommt jedes Jahr eine Vielzahl weiterer Produkte und
Produktvariationen unter neuen Handelsnamen auf dem Markt, die für die
Herstellung von Farben und Lacken verwendet werden können. Sogar wenn es ein Sprach-zu-Text-Umwandlungssystem gäbe, welches an die Exaktheit der
alltagssprachlichen Systeme von Google oder Apple heranreicht und welches die wichtigsten chemischen Fachbegriffe beinhalten würde (was nicht der Fall ist), wäre dieses System aufgrund der Dynamik und Vielzahl der Namen, die in der Praxis im chemischen Labor, insbesondere bei der Herstellung von Farben und Lacken, eine Rolle spielen, für den Einsatz in der Praxis wenig geeignet, da die meisten in der praxisrelevanten Wörter nicht unterstützt würden bzw. zumindest nach einigen wenigen Jahren das Vokabular völlig veraltet wäre.
Gemäß Ausführungsformen der Erfindung wird dieses Problem dadurch gelöst, dass auf ein Sprach-zu-Text-Umwandlungssystem zurückgegriffen wird, von welchen bekannt ist, dass es die relevanten Fachbegriffe nicht unterstützt. Es wird also von vornherein nicht versucht, hier eine teure und aufwändige
Spezialentwicklung zu implementieren, die nur ein sehr kleines Marktsegment bedient und daher mit einiger Wahrscheinlichkeit nicht die Erkennungsgenauigkeit der bekannten großen Umwandlungssysteme von Amazon, Google oder Apple erreichen würde, was allgemeinsprachliche Begriffe angeht, die bei Spracheingaben neben den chemischen Fachbegriffen in der Regel ja auch berücksichtigt und richtig erkannt werden müssen. Vielmehr machen sich Ausführungsformen der Erfindung die bereits sehr gute Erkennungsgenauigkeit der bestehenden Dienstleister für allgemeinsprachliche Begriffe zu Nutze und führen vor der Ausgabe des erkannten Textes eine Korrektur durch. Im Zuge der Korrektur werden auf Basis der
Zuordnungstabelle die falsch erkannten Wörter durch Fachwörter ersetzt, sodass ein korrigierter Text erstellt wird, der schließlich ausgegeben wird. Das
hochspezifische Fachvokabular, das aufgrund der Dynamik des Gebietes und der Vielzahl an Marktteilnehmern, Produkten und entsprechenden Produktnamen kontinuierlich aktualisiert werden muss, um die Software praxistauglich zu halten, steckt also letztlich in einer Zuordnungstabelle. Diese lässt sich mit sehr geringem Aufwand aktuell halten.
Neue Fachwörter können einfach dadurch ergänzt werden, dass die
Zuordnungstabelle mit den neuen Fachwörtern, jeweils zusammen mit ein oder mehreren für dieses Fachwort fälschlich erkannten Zielvokabular-Wörtern, ergänzt wird. In technischer Hinsicht ist damit die Speicherung und Aktualisierung der Fachwörter von der eigentlichen Spracherkennungslogik völlig entkoppelt. Dies hat zudem den Vorteil, dass eine Abhängigkeit von einem bestimmten Anbieter von Spracherkennungsdiensten vermieden wird. Das Gebiet der Spracherkennung ist noch jung und es ist noch nicht absehbar, welche der Vielzahl an parallelen
Lösungen im Hinblick auf Erkennungsgenauigkeit und/oder Preis langfristig die beste Wahl sind. Die Bindung an ein bestimmtes Sprach-zu-Text- Umwandlungssystem erfolgt gemäß Ausführungsformen der Erfindung nur dadurch, dass das empfangene Sprachsignal zunächst an dieses Umwandlungssystem gesendet und ein (fehlerhafter) Text empfangen wird. Außerdem enthält die
Zuordnungstabelle fehlerhaft erkannte Wörter des Zielvokabulars, welche von diesem speziellen Umwandlungssystem für einen bestimmten Fachbegriff
(fälschlicherweise) zurückgegeben wurden. Beides lässt sich aber leicht ändern, indem für die Erzeugung des (fehlerhaften) Textes ein anderes Sprach-zu-Text- Umwandlungssystem genutzt wird und zu diesem Zwecke zudem mittels dieses anderen Umwandlungssystems die Zuordnungstabelle neu erstellt wird. Komplexe Änderungen, etwa an der Logik eines Syntaxparsers und/oder eines neuronalen Netzes sind nicht erforderlich.
Auch für Mitarbeiter im Außendienst der chemischen Industrie oder der chemischen Produktion kann das Verfahren gemäß Ausführungsformen der Erfindung vorteilhaft sein, da diese Mitarbeiter oftmals ohnehin einen Computer oder zumindest ein Smartphone im Zuge ihrer dienstlichen Tätigkeit benutzen und durch eine
Spracheingabe in eine z.B. als App oder als Browserplugin ausgestaltete
Korrektursoftware weniger vom Kunden bzw. ihrer Tätigkeit abgelenkt werden als durch eine Texteingabe über die Tastatur.
Ein weiterer Vorteil gemäß Ausführungsformen der Erfindung besteht darin, dass das Endgerät lediglich das Sprachsignal aufnimmt, den Text korrigiert und das Resultat der Ausführung einer Software- und/oder Hardwarefunktion auf Basis des korrigierten Textes ausgibt. Die eigentliche Sprache-zu-Text-Umwandlung des Sprachsignals in einen Text, also der bei weitem rechenintensivste Schritt, wird von dem sprach-zu-Text-Umwandlungssystem durchgeführt. Das Sprache-zu-Text- Umwandlungssystem kann zum Beispiel ein Server sein, der über ein Netzwerk, zum Beispiel das Internet, mit dem Endgerät verbunden ist. Somit kann auch ein Endgerät mit geringer Prozessorleistung, zum Beispiel ein Smartphone oder ein Einplatinenrechner, für die Eingabe und Umwandlung langer und komplexer sprachlicher Eingaben verwendet werden. Nach einer Ausführungsform wird der von dem Sprach-zu-Text-Umwandlungs- system erzeugte Text durch das Endgerät empfangen. Das Endgerät führt daraufhin auch die Textkorrektur durch, wobei nach Ausführungsformen auch weitere
Datenverarbeitungsschritte durch das Endgerät ausgeführt werden, z.B. die
Berechnung oder der Empfang von Auftretenswahrscheinlichkeiten einzelner Wörter im Text um diese Wahrscheinlichkeiten bei der Ersetzung von Wörtern und
Ausdrücken auf Basis der Zuordnungstabelle. Diese Implementierungsvariante ist besonders vorteilhaft bei vergleichsweise leistungsstarken Endgeräten, z.B.
Desktoprechnern im Laborbereich. Beispielsweise kann das Endgerät ein
Softwareprogramm zum Empfang der Spracheingabe, zur Weiterleitung der
Spracheingabe über eine Sprach-zu-Text Schnittstelle an das Sprach-zu-Text- Umwandlungssystem, zum Empfang des Texts von diesem Umwandlungssystem, zur Korrektur des Textes anhand der Zuordnungstabelle und zur Ausgabe des korrigierten Textes an ein softwarebasiertes und/oder hardwarebasiertes
Ausführungssystem besitzen. Das softwarebasiertes und/oder hardwarebasiertes Ausführungssystem ist eine Software oder eine Hardware oder eine Kombination von beiden, welche dazu konfiguriert ist, eine Funktion gemäß der in dem
korrigierten Text enthaltenen Angaben auszuführen und vorzugsweise auch ein Ergebnis der Ausführung zurückzugeben. Das Ergebnis wird vorzugsweise in Textform zurückgegeben. Das Softwareprogramm auf dem Endgerät kann z.B. als Browser-Plugin oder Browser-Addin oder als eine Standalone-Softwareapplikation, die mit dem Sprach-zu-Text-Umwandlungssystem interoperabel sind, ausgebildet sein.
Nach einer alternativen Ausführungsform wird der von dem Sprach-zu-Text- Umwandlungssystem erzeugte Text ebenfalls durch das Endgerät empfangen. Das Endgerät führt daraufhin aber die Textkorrektur nicht selbst durch, sondern sendet den Text über das Internet an einen Kontrollcomputer mit einer Korrektursoftware, welche die Textkorrektur basierend auf der Zuordnungstabelle wie beschrieben durchführt und den korrigierten Text als Eingabe an ein Ausführungssystem übergibt. Das Ausführungssystem kann aus einer Software und/oder einer
Hardware bestehen und dazu ausgebildet sein, eine Funktion gemäß der
korrigierten Texteingabe auszuführen. Bei dem Ausführungssystem kann es sich z.B. um eine Laborsoftware oder ein Laborgerät handeln. Nach Ausführungsformen der Erfindung gibt das Ausführungssystem das Ergebnis der Ausführung des korrigierten Texts an den Kontrollcomputer zurück. Vorzugsweise hat dieses
Ergebnis ebenfalls Textform. Das Ergebnis der Ausführung der Funktion wird vom Kontrollcomputer vorzugsweise an das Endgerät zurückgegeben und/oder über andere Geräte ausgegeben. Das Endgerät gibt dann das Ergebnis der Ausführung der Funktion gemäß dem korrigierten Text aus. Der Kontrollcomputer kann z.B. als Clouddienst implementiert sein oder auf einem einzelnen Server implementiert sein. Diese Implementierungsvariante kann vorteilhaft sein bei Endgeräten mittlerer Leistungskraft, z.B. Smartphones oder Kontrollmodulen, welche in einzelne
Laborgeräte oder in Anlagen zur Analyse und/oder Synthese chemischer
Substanzen integriert sind. Das Endgerät führt hier noch die Koordination der Dateneingabe, des Datenaustausches mit dem Sprache-zu-Text- Umwandlungssystem, und des Datenaustausches mit dem Kontrollcomputer durch. Optional kann es das Ergebnis der Ausführung der Funktion gemäß dem
korrigierten Text ausgeben. Bei dieser Ausführungsform führt der Kontrollcomputer die Textkorrekturfunktion nicht durch, sondern übermittelt den von dem Sprache-zu- Text-Umwandlungssystem empfangenen Text über das Netzwerk an einen
Korrekturcomputer, der die Text wie oben beschrieben anhand der Tabelle durchführt. Der Kontrollcomputer empfängt den korrigierten Text und leitet ihn über das Netzwerk an ein Ausführungssystem weiter, welches eine Software oder Hardwarefunktion gemäß den Angaben in dem korrigierten Text ausführt. Diese Ausführungsform kann vorteilhaft sein, da eine bessere Trennung der Zugriffsrechte auf die Funktionen und Daten des Kontrollcomputers einerseits und des
Korrekturcomputers andererseits möglich sind. Wird die Textkorrektur auf einem separaten Cloudsystem ausgeführt, kann einem Nutzer hier zum Zwecke der Aktualisierung der Tabelle Zugriff gewährt werden, ohne dass hierdurch auch Zugriff auf sensible Daten des Kontrollcomputers, welcher z.B. Ausführungssysteme wie z.B. Laborgeräte kontrollieren kann, erforderlich ist.
Nach Ausführungsformen der Erfindung wird somit Koordination des
Datenaustausches mit dem Sprache-zu-Text-Umwandlungssystem, die
Textkorrektur und die Weitergabe des korrigierten Textes an das Ausführungssystem vollständig vom Kontrollcomputer durchgeführt oder von diesem organisiert und koordiniert. Das Endgerät ist nach manchen
Ausführungsformen des Verfahrens also im Wesentlichen ein Gerät mit Mikrophon und optionaler Ausgabeschnittstelle für Ergebnisse der Ausführung des korrigierten Textes. Das Endgerät kann z.B. einem Lautsprecher und eine Clientsoftware, die zum Datenaustausch mit dem Kontrollcomputer vorkonfiguriert ist, beinhalten. Das bedeutet, dass die Clientsoftware auf dem Endgerät dazu konfiguriert ist, das Sprachsignal an den Kontrollcomputer über ein Netzwerk zu senden und ein Ergebnis der Ausführung des korrigierten Texts in Antwort darauf von dem
Kontrollcomputer zu empfangen. Vorzugsweise ist das Endgerät als portables Endgerät ausgebildet. Beispielsweise kann das Endgerät ein Einplatinenrechner, z.B. Raspberry Pi, sein. Auf diesem kann beispielsweise die Software„Google Assistant on Raspberry Pi“ installiert sein, die dahingehend konfiguriert wird, dass die vom Endgerät empfangenen Sprachsignale an den Kontrollcomputer gesendet werden. Die Adresse des Kontrollcomputers ist also im Endgerät vorgegeben und gespeichert. Dies kann vorteilhaft sein, da ein portables und sehr kostengünstiges Endgerät zum Zweck der vereinfachten Interaktion mit datenverarbeitenden Geräten und Diensten innerhalb eines Labors bereitgestellt wird. Es ist möglich, ein solches Endgerät an einer beliebigen Stelle im Raum bzw. Labor zu positionieren. Der Nutzer kann das Endgerät auch in andere Räume des Labors mitnehmen oder es kann ein größeres Labor mit mehreren Endgeräten kostengünstig ausgestattet werden.
Nach Ausführungsformen der Erfindung besteht das Zielvokabular aus einer Menge allgemeinsprachlicher Wörter.
Nach anderen Ausführungsformen der Erfindung besteht das Zielvokabular aus einer Menge allgemeinsprachlicher Wörter sowie daraus abgeleiteter Wörter. Diese abgeleiteten Wörter können zum Beispiel dynamisch erstellte Konkatenationen von zwei oder mehr allgemeinsprachlichen Wörtern sein. In der deutschen Sprache werden beispielsweise viele Wörter, insbesondere Substantive, durch Kombination mehrerer anderer Substantive gebildet. So ist z.B. das Wort„Schiffsschraube“ so gebräuchlich, dass es in der Regel in den meisten allgemeinsprachlichen
Wörterbüchern vorhanden ist. Ein eher selten benutzter Begriff wie „Befestigungsschraube“ fehlt dagegen in den meisten allgemeinsprachlichen
Wörterbüchern. Manche Sprach-zu-Text-Umwandlungssysteme können aber mittels Heuristiken und/oder neuronalen Netzen auch Wörter wie„Befestigungsschraube“ erkennen, sofern die einzelnen Wortbestandteile„Befestigung“ und„Schraube“ Bestandteil des Zielvokabular sind. In diesem Sinne gehört dann auch das Wort „Befestigungsschraube“ zum Zielvokabular dieser Art von Sprach-zu-Text- Umwandlungssystem.
Nach anderen Ausführungsformen der Erfindung besteht das Zielvokabular aus einer Menge allgemeinsprachlicher Wörter ergänzt um Wörter, die durch
Kombination erkannter Silben gebildet werden. Diese Sprach-zu-Text- Umwandlungssysteme sind also flexibler im Hinblick darauf, welche Wörter erkannt werden können, da die Erkennung - zumindest auch - auf der Ebene einzelner Silben, nicht nur einzelner Wörter, erfolgen kann. Allerdings ist die silbenbasierte Erkennung auch besonders fehleranfällig, da die Gefahr einer fehlerhaften
Erkennung eines Wortes, das in keinem bekannten Vokabular existiert, besonders groß ist. Aufgrund der Endlichkeit der Menge an unterstützten bzw. bekannten Silben und der Beschränkung der Menge der kombinierbaren Silben durch die typische Wortlänge ist auch die Menge der silbenbasiert erzeugbaren Zielwörter endlich. Somit haben auch Sprach-zu-Text-Umwandlungssysteme, die eine silbenbasierte Worterzeugung unterstützen, trotz ihrer größeren Flexibilität ein endliches Zielvokabular. Auch wenn solche Systeme aufgrund ihrer Flexibilität theoretisch in der Lage sind, auch viele chemische Begriffe dynamisch zu erkennen, die nicht in einem vorbekannten Lexikon enthalten sind, ist die
Erkennungsgenauigkeit in der Praxis derart gering, dass im Hinblick auf die Praxis auch solche Systeme letztlich ein Zielvokabular haben, welches diese chemischen Begriffe nicht beinhaltet bzw. nicht unterstützt.
In manchen Ausführungsformen der Erfindung besteht das Zielvokabular aus einer Menge allgemeinsprachlicher Wörter ergänzt um daraus abgeleitete Wörter und ergänzt um Wörter, die durch Kombination erkannter Silben gebildet werden. Auch diese Umwandlungssysteme basieren auf einem Zielvokabular, welches die
Fachwörter nicht enthält bzw. im praktischen Einsatz nicht mit hinreichender Genauigkeit erkennen kann, sondern stattdessen andere Wörter, typischerweise allgemeinsprachliche Wörter, fälschlicherweise erkennt und in Text umwandelt.
Somit kann eine Vielzahl unterschiedlicher, heute bereits verfügbarer Sprach-zu- Text-Umwandlungssysteme für das Verfahren gemäß Ausführungsformen der Erfindung genutzt werden, auch wenn diese Systeme im Wesentlichen nur alltagssprachliche Wörter„unterstützen“ (d. h., mit hinreichender Genauigkeit richtig erkennen und in Text umsetzen können). Die Korrektursoftware ist auf kein bestimmtes Umwandlungssystem festgelegt. Falls sich ein bestimmter technischer Ansatz im Laufe der Zeit als besonders genau und zuverlässig erweisen sollte, kann dieser genutzt werden, ohne dass wesentliche Komponenten eines Quellcodes endgerätseitig umprogrammiert werden müssten.
Nach Ausführungsformen der Erfindung handelt es sich bei den fachsprachlichen Wörtern um Wörter aus einer der folgenden Kategorien:
- Namen von chemischen Substanzen, insbesondere von Farben und Lacken oder von Additiven im Färb- und Lackbereich; insbesondere beziehen sich die Namen auch chemische Namen nach einer chemischen Namenskonvention, z.B. gemäß der IUPAC Nomenklatur;
- Physikalische, chemische, mechanische, optische oder haptische Eigenschaften chemischer Substanzen;
- Namen (z.B. Handelsnamen oder vom Benutzer für die Laborgeräte eines Labors vergebene Eigennamen) von Laborgeräten und Geräten der chemischen
Industrie;
- Namen von Labor-Verbrauchsmaterial und Labor-Bedarf;
- Handelsnamen im Färb- und Lackbereich.
Nach Ausführungsformen der Erfindung handelt es sich bei den fachsprachlichen Wörtern um Wörter aus dem Gebiet der Chemie, insbesondere der chemischen Industrie, insbesondere der Chemie der Farben und Lacke. Nach Ausführungsformen der Erfindung empfängt oder berechnet oder empfängt das Gerät bzw. Computersystem, welches die Textkorrektur durchführt, also z.B. das Endgerät oder der Kontrollrechner oder ein weiterer eigener Korrekturrechner, Häufigkeitsangaben für zumindest einige der Wörter in dem Text, welcher von dem Sprach-zu-Text-Umwandlungssystem aus dem Sprachsignal erzeugt wurde. Die Häufigkeitsangaben geben für Wörter in diesem Text jeweils an, wie häufig das Auftreten dieses Wortes statistisch zu erwarten ist.
Bei der Erzeugung des korrigierten Textes werden selektiv nur diejenigen Wörter des Zielvokabulars in dem empfangenen Text durch fachsprachliche Wörter gemäß der Zuordnungstabelle ersetzt, deren statistisch erwartete Auftretenshäufigkeit gemäß den empfangenen Häufigkeitsangaben unter einem vordefinierten
Schwellenwert liegt.
Dies kann vorteilhaft sein, da Spracheingaben des Nutzers in der Regel eine Mischung aus allgemeinsprachlichen Wörtern und Fachwörtern beinhalten. Es kann also auch der Fall auftreten, dass in dem von dem Umsetzungssystem
empfangenen Text Wörter des Zielvokabulars enthalten sind, die in der
Zuordnungstabelle einem Fachwort zugeordnet sind, und die normalerweise ersetzt würden. Beispielsweise könnte der zurückgegebene Text den Ausdruck„Polymer Innovation“ enthalten. Da dieser Ausdruck„Polymer Innovation“ in der
Zuordnungstabelle einem Fachwort„Polymerisation“ zugeordnet ist, würde der Ausdruck normalerweise im Zuge der Textkorrektur durch„Polymerisation“ ersetzt. Ist dem Ausdruck„Polymer Innovation“ jedoch eine Häufigkeitsangabe zugeordnet, die eine hohe Auftretenswahrscheinlichkeit repräsentiert, geht die Korrektursoftware aufgrund dieser Auftretenshäufigkeit davon aus, dass der Ausdruck„Polymer Innovation“ korrekt ist, obwohl dieser in der Zuordnungstabelle einem Fachwort zugewiesen ist und belässt den Ausdruck„Polymer Innovation“ als Folge dessen unverändert in dem Text. Beispielsweise kann eine Kontextanalyse der Wörter innerhalb des Satzes oder innerhalb der gesamten Spracheingabe ergeben, dass in dem Text das Wort„Innovation“ gehäuft alleine auftritt, z.B. weil der Text von einem Außendienstmitarbeiter stammt, der die Vorzüge eines bestimmten
Polymerprodukts schildert. In diesem Kontext kann auch der Ausdruck„Polymer Innovation“ einen korrekt erkannten Ausdruck darstellen. In einem Kontext, in welchem weder Polymer noch Innovation alleine erwähnt werden, sinkt die
Wahrscheinlichkeit. Auch haben Wörter auch kontextunabhängig an sich bereits unterschiedliche Auftretenswahrscheinlichkeiten.
Das Ersetzen von Wörtern gemäß der Zuordnungstabelle in Abhängigkeit von Auftretenswahrscheinlichkeiten der Wörter im empfangenen Text kann vorteilhaft sein, da vermieden wird, dass in wenigen Einzelfällen Wörter der Zielsprache, die an sich oder im Kontext des jeweiligen Textes eine hohe
Auftretenswahrscheinlichkeit haben, fälschlicherweise durch ein Fachwort ersetzt werden und durch die Ersetzung ein Fehler erzeugt anstatt korrigiert wird.
Nach einer Ausführungsform werden die Auftretenshäufigkeiten der Wörter des Textes von dem Sprache-zu-Text-Umwandlungssystem berechnet und zusammen mit dem Text von dem Sprache-zu-Text- Umwandlungssystem an das Endgerät oder den Kontrollcomputer zurückgegeben. Beispielsweise kann das Sprache-zu- Text-Umwandlungssystem Flidden Markov Modelle (HMMs) verwenden, um die Auftretenswahrscheinlichkeit eines bestimmten Wortes im Kontext eines Satzes zu berechnen. Zusätzlich oder alternativ dazu kann das Sprache-zu-Text- Umwandlungssystem die Auftretenshäufigkeit eines Wortes gleichsetzen mit der Auftretenshäufigkeit des Wortes in einem großen Referenzkorpus. Beispielsweise kann die Gesamtheit der Texte einer Zeitung über mehrere Jahre oder ein sonstiger großer Datensatz an Texten als Referenzkorpus dienen. Das Verhältnis der gezählten Anzahl der Wörter in dem Korpus zur Gesamtheit der Worte in dem Korpus ist die in diesem Referenzkorpus beobachtete Auftretenshäufigkeit dieses Wortes. Falls die Textkorrektur von einem separaten Korrekturcomputer
durchgeführt wird, werden gemäß Ausführungsformen der Erfindung die
Häufigkeitsangaben die der Kontrollcomputer von dem Sprache-zu-Text- Umwandlungssystem an den Korrekturcomputer weitergeleitet.
Nach einer weiteren Ausführungsform werden die Auftretenshäufigkeiten der Wörter des Textes von dem Endgerät nach Erhalt des Textes berechnet. Wie bereits zuvor beschrieben kann die Berechnung der Auftretenswahrscheinlichkeiten der einzelnen Wörter oder Ausdrücke mittels HMMs unter Berücksichtigung des Textkontexts eines Wortes oder anhand der Häufigkeiten des Wortes in einem Referenzkorpus berechnet werden. Als Referenzkorpus kann beispielsweise die Gesamtheit der von dem Sprache-zu-Text- Umwandlungssystem durch das Endgerät oder durch den Kontrollcomputer bisher empfangenen Texte verwendet werden.
Somit erfolgt nach Ausführungsformen die Berechnung der Häufigkeitsangaben (z.B. durch das Endgerät oder durch einen Korrekturdienst) mittels eines Hidden- Markov-Modells. Beispielsweise kann die erwartete Auftretenshäufigkeit, also die Auftretenswahrscheinlichkeit, als Produkt aus den Emissionswahrscheinlichkeiten der einzelnen Wörter einer Wortsequenz berechnet werden wie z.B. in B. Cestnik „Estimating probabilities: A crucial task in machine learning“ In Proceedings of the Ninth European Conference on Artificial Intelligence, Seiten 147-150, Stockholm, Schweden, 1990 beschrieben.
Nach Ausführungsformen der Erfindung empfängt das Endgerät oder der
Kontrollcomputer neben dem Text auch Part-of-Speech-Tags (POS Tags) - für zumindest einige der Wörter in dem Text, der von dem Sprach-zu-Text- Umwandlungssystem aus dem Sprachsignal erzeugt wurde. Die POS Tags werden von dem Sprache-zu-Text-Umwandlungssystem empfangen und beinhalten zumindest Tags für Substantiv, Adjektiv und Verb. Es ist auch möglich, dass die POS Tags zusätzliche Arten syntaktischer oder semantischer Tags beinhalten. Die genaue Zusammensetzung der berücksichtigten POS Tags kann auch von der jeweiligen Sprache abhängen. In der Zuordnungstabelle sind die fachsprachlichen Wörter zusammen mit deren POS Tags verknüpft gespeichert. Bei der Erzeugung des korrigierten Textes werden nur diejenigen Wörter des Zielvokabulars in dem empfangenen Text durch fachsprachliche Wörter gemäß der Zuordnungstabelle ersetzt, deren POS-Tags übereinstimmen.
Dies kann vorteilhaft sein, da die Genauigkeit des Textkorrekturschrittes dadurch erhöht wird. Von der Korrektheit der POS Tags in der Zuordnungstabelle kann ausgegangen werden, da die Einträge in der Tabelle semi-automatisch erstellt werden dadurch, dass ein oder mehrere Sprecher ein fachsprachliches Wort oder einen fachsprachlichen Ausdruck in ein Mikrofon eingeben, das dadurch
resultierende Audiosignal von dem Sprach-zu-Text-Umwandlungssystem in ein (fehlerhaftes) Wort oder in einen (fehlerhaften) Ausdruck des Zielvokabulars umgesetzt wird und dieses fehlerhafte Wort bzw. dieser fehlerhafte Ausdruck in der Zuordnungstabelle mit dem fachsprachlichen Ausdruck verknüpft gespeichert wird. Da bekannt ist, wofür das fachsprachliche Wort steht und ob es beispielsweise ein Substantiv, Verb oder Adjektiv ist, kann der fachsprachliche Ausdruck bei der Gelegenheit der Erzeugung oder Aktualisierung der Tabelle auch gleich mit dem korrekten POS Tag verknüpft gespeichert werden. Wenn also gemäß der
Zuordnungstabelle zwar ein bestimmtes Wort und ein bestimmter Ausdruck in dem Text durch ein fachsprachliche Wort ersetzt werden muss, die POS Tags des zu ersetzenden Texts aber nicht mit dem POS Tag der fachsprachlichen Wörter übereinstimmen, ist das ein Hinweis darauf, dass die entsprechenden Wörter in dem Text möglicherweise doch richtig sein könnten. Die Erkennungsrate der POS Tags ist vergleichsweise hoch, sodass durch diese Maßnahme die Qualität des Korrekturschritts erhöht werden kann. Beispielsweise kann es sein, dass ein fachsprachliches Wort z.B. der Handelsname„Platilon®“ ist. Er bezeichnet thermoplastische Polyurethan-Folien der Firma Covestro. In der Tabelle ist diesem Fachwort ein POS-Tag„Substantiv“ zugeordnet. Von dem Sprach-zu-Text- Umwandlungssystem ist bekannt, dass diese das gesprochene Wort„Platilon“ oftmals fälschlicherweise das Zielvokabularwort„Platin“ umgewandelt hat, deswegen ist in der Zuordnungstabelle dem Fachwort„Platilon“ das Wort„Platin“ des Zielvokabulars zugeordnet. Bei einer aktuellen Spracheingabe eines Nutzers wurde das Wort jedoch adjektivisch verwendet:„Zugabe eines Platin- oder Zink basierten Katalysators Anhand des POS Tags von„Platin“ in dem vom
Umwandlungssystem zurückgegebenen Text kann hier ggf. erkannt werden, dass das Wort„Platin“ hier korrekt ist und nicht durch„Platilon“ ersetzt werden soll.
Nach Ausführungsformen der Erfindung umfasst das Verfahren Schritte zur
Erzeugung der Zuordnungstabelle. Für jedes von einer Vielzahl fachsprachlicher Wörter wird zumindest ein Referenz-Sprachsignal aufgezeichnet, welches selektiv dieses fachsprachliche Wort wiedergibt. Das Referenz-Sprachsignal stammt von zumindest einem Sprecher. Auch für fachsprachliche Ausdrücke kann jeweils zumindest ein Referenz-Sprachsignal, welches selektiv diesen fachsprachlichen Ausdruck wiedergibt, von zumindest einem Sprecher gesprochen und aufgezeichnet werden. Die weiteren Schritte sind für Wörter und Ausdrücke im Wesentlichen identisch, sodass im Folgenden, wenn von einem fachsprachlichen Wort die Rede ist, ein fachsprachlicher Ausdruck mitinbegriffen ist. Jedes der aufgezeichneten Referenz-Sprachsignale wird in das Sprach-zu-Text-Umwandlungssystem
eingegeben. Die Eingabe kann insbesondere über ein Netzwerk, z.B. das Internet, erfolgen. Für jedes der eingegebenen Referenz-Sprachsignale, Empfängt das Gerät, welches die Referenzsignale eingegeben hat, zumindest ein Wort des Zielvokabulars, welches von dem Sprach-zu-Text-Umwandlungssystem aus dem eingegebenen Referenz-Sprachsignal erzeugt wurde. Bei diesem Gerät kann es sich z.B. um das Endgerät handeln. Die Aufnahme der Referenz-Sprachsignale, sowie der Empfang der (falschen) Wörter oder Ausdrücke des Zielvokabulars, die letztlich der Erstellung oder Erweiterung der Zuordnungstabelle dienen, können aber auch von beliebigen anderen Geräten mit einer Netzwerkverbindung zu dem Sprach-zu-Text-Umwandlungssystem vorgenommen werden. Vorzugsweise erfolgt die Eingabe der Referenz-Sprachsignale über ein Gerät, das in bautechnischer Hinsicht und im Hinblick auf seine Positionierung relativ zu Geräuschquellen dem Endgerät möglichst ähnlich ist um sicherzustellen, dass reproduzierbar die gleichen Fehler erzeugt werden. Das zumindest eine Wort (das auch ein Ausdruck sein kann) des Zielvokabulars, das für jedes der fachsprachlichen Wörter empfangen wird, repräsentiert eine Fehlumwandlung, da das Zielvokabular der Sprach-zu-Text- Umwandlungssystem die fachsprachlichen Wörter nicht unterstützt. Schließlich wird die Zuordnungstabelle als eine Tabelle erzeugt, die jedem der fachsprachlichen Wörter, für welche zumindest ein Referenz-Sprachsignal aufgezeichnet wurde, das zumindest eine Wort des Zielvokabulars in Textform zuordnet, welches von dem Sprach-zu-Text-Umwandlungssystem aus dem dieses fachsprachliche Wort beinhaltenden Referenz-Sprachsignal jeweils erzeugt wurde.
Dies kann vorteilhaft sein, da eine Tabelle sehr einfach modifiziert und ergänzt werden kann, ohne einen Quellcode verändern, ein Programm neu kompilieren oder ein neuronales Netz neu trainieren zu müssen. Sogar falls ein anderes Sprache-zu- Text-Umwandlungssystem verwendet wird, muss nur die entsprechende Client- Schnittstelle angepasst werden und die fachsprachlichen Ausdrücke der Tabelle erneut von ein oder mehreren Sprechern über ein Mikrofon eingegeben und an das neue Sprache-zu-Text-Umwandlungssystem übertragen werden. Die von diesem neuen System zurückgegebenen falschen Wörter und Ausdrücke der Zielsprache bilden die Grundlage für die neue Zuordnungstabelle. Es ist somit möglich, ohne tiefgreifende oder komplexe Änderungen und ohne Neutrainieren einer
Sprachsoftware beliebige alltagssprachliche Sprache-zu-Text-Umwandlungssystem funktional so zu erweitern, dass auch gesprochene Texte mit fachsprachlichen Wörtern und Ausdrücken korrekt zu Text umgesetzt werden. Die Zuordnungstabelle kann beispielsweise als Tabelle einer relationalen Datenbank oder als
tabulatorgetrennte Textdatei oder als eine andere funktional vergleichbare
Datenstruktur gespeichert sein.
Nach Ausführungsformen der Erfindung werden für jedes von zumindest einigen der fachsprachlichen Wörter (bzw. fachsprachlichen Ausdrücke) mehrere Referenz- Sprachsignale jeweils von unterschiedlichen Sprechern aufgezeichnet. Die mehreren Referenz-Sprachsignale geben dieses fachsprachliche Wort (bzw. diesen fachsprachlichen Ausdruck) wieder. Die Zuordnungstabelle ordnet jedem von zumindest einigen der fachsprachlichen Wörter (oder Ausdrücke) mehrere Wörter (oder Ausdrücke) des Zielvokabulars in Textform zu. Die mehreren Wörter (oder Ausdrücke) des Zielvokabulars repräsentieren Fehlumwandlungen, die das Sprach- zu-Text-Umwandlungssystem für die verschiedenen Sprecher in Abhängigkeit von deren Stimme erzeugt hat.
Beispielsweise kann ein bestimmtes fachsprachliches Wort wie„1 ,2- Methylendioxybenzol“ von 100 unterschiedlichen Personen vorgelesen und mit einem Mikrofon jeweils als Referenz-Sprachsignal aufgezeichnet werden.
Vorzugsweise handelt es sich bei diesen Personen um solche, die mit der
Aussprache chemischer Ausdrücke vertraut sind. Es liegen dann also 100
Referenz-Sprachsignale für diesen einen Substanznamen vor. Jedes dieser 100 Referenz-Sprachsignale wird an das Sprache-zu-Text-Umwandlungssystem gesendet und es werden in Antwort darauf 100 Wörter oder Ausdrücke des
Zielvokabulars zurückgegeben, welche alle den eigentlichen fachsprachlichen Namen nicht korrekt wiedergeben. Oftmals werden die 100 zurückgegebenen Wörter identisch sein, jedoch nicht immer. Unterschiedliche Personen haben unterschiedliche Stimmen, d. h., die Spracheingabe unterscheidet sich im Hinblick auf Betonung, Lautstärke, Stimmhöhe und Artikuliertheit. Deshalb ist es möglich, dass ein bestimmtes Sprache-zu-Text-Umwandlungssystem für ein bestimmtes fachsprachliches Wort (oder einen bestimmten fachsprachlichen Ausdruck) mehrere unterschiedliche, falsche Wörter oder Ausdrücke zurückgibt, welche alle in die Zuordnungstabelle eingehen.
Die Berücksichtigung der Spracheingaben vieler unterschiedlicher Personen für die Erstellung der Zuordnungstabelle kann vorteilhaft sein, da hierdurch die Variabilität menschlicher Stimmen besser berücksichtigt wird und so eine verbesserte
Fehlerkorrekturrate erreicht werden kann.
Nach manchen Ausführungsformen der Erfindung ist das Endgerät oder das Computersystem, das die Textkorrektur durchgeführt hat, dazu konfiguriert, den korrigierten Text über einen Lautsprecher und/oder eine Anzeige an den Nutzer auszugeben. Dies hat den Vorteil, dass der Nutzer nochmals die Chance hat, die Richtigkeit des korrigierten Textes zu überprüfen.
Nach manchen Ausführungsformen der Erfindung ist das Endgerät oder das Computersystem, das die Textkorrektur durchgeführt hat, dazu konfiguriert, das Ergebnis der Ausführung des korrigierten Textes, das von dem Ausführungssystem geliefert wird, an den Nutzer auszugeben. Die Ausgabe kann beispielsweise dadurch erfolgen, dass das Ergebnis in Textform auf einem Bildschirm des
Endgeräts angezeigt wird. Zusätzlich oder alternativ dazu kann das Ergebnis der Ausführung des korrigierten Textes über eine Text-zu-Sprache Schnittstelle und einen Lautsprecher des Endgerätes ausgegeben werden.
Nach einer Ausführungsform ist das Ausführungssystem, welches eine Funktion gemäß dem korrigierten Text ausführt, eine Software.
Bei der Software kann es sich beispielsweise um eine chemische
Substanzdatenbank handeln. Insbesondere kann es sich bei dieser Software um ein Datenbankmanagementsystem (DBMS) und/oder ein externes Softwareprogramm, welches mit diesem de BMS interoperabel ist, handeln, wobei das DBMS die chemische Datenbank beinhaltet und verwaltet. Die Software ist dazu ausgebildet, den korrigierten Text als Sucheingabe zu interpretieren und Informationen zu der Sucheingabe in der Datenbank zu ermitteln und zurückzugeben. Die Substanzdatenbank kann z.B. Bestandteil einer chemischen Anlage, z.B. einer HTE Anlage, sein.
Zusätzlich oder alternativ dazu kann es sich bei der Software um eine Internet- Suchmaschine handeln, welche dazu ausgebildet ist, den korrigierten Text als Sucheingabe zu interpretieren und Informationen zu der Sucheingabe im Internet zu ermitteln und zurückzugeben.
Zusätzlich oder alternativ dazu kann es sich bei der Software um eine
Simulationssoftware handeln. Die Simulationssoftware ist dazu ausgebildet, Eigenschaften von chemischen Erzeugnissen, insbesondere von Lacken und Farben, basierend auf einer vorgegebenen Rezeptur für die Erzeugung des
Erzeugnisses, zu simulieren. Hierbei interpretiert die Simulationssoftware den korrigierten Text als Spezifikation der Rezeptur des Erzeugnisses, dessen
Eigenschaften simuliert werden sollen und/oder als Spezifikation der Eigenschaften des Erzeugnisses.
Zusätzlich oder alternativ dazu kann es sich bei der Software um eine
Steuerungssoftware für die Steuerung chemischer Synthesen und/oder der
Erzeugung von Substanzmischungen, insbesondere von Farben und Lacken, handeln. Die Steuerungssoftware ist dazu ausgebildet, den korrigierten Text als Spezifikation der Synthese oder der Komponenten der Substanzmischung zu interpretieren.
Nach weiteren Ausführungsformen der Erfindung erfolgt die Ausgabe des korrigierten Textes durch das Endgerät an die Hardwarekomponente. Bei der Hardwarekomponente kann es sich insbesondere um eine Anlage für die
Durchführung chemischer Analysen, chemischer Synthesen und/oder um eine Anlage für die Erzeugung von Substanzmischungen, insbesondere von Farben und Lacken, handeln. Die Anlage ist dazu ausgebildet, den korrigierten Text als
Spezifikation der Synthese oder der Komponenten der Substanzmischung oder als Spezifikation der durchzuführenden Analyse zu interpretieren. Bei der Anlage kann es sich um eine Hochdurchsatzanlage (HTE-Anlage) zur Analyse und Herstellung von Farben und Lacken handeln. Beispielsweise kann die HTE-Anlage ein System zum automatischen testen und zur automatischen Herstellung chemischer Produkte sein wie es in der WO 2017/072351 A2 beschrieben ist.
Die Ausgabe des korrigierten Textes an eine Software und/oder
Hardwarekomponente kann insbesondere im Kontext eines biologischen oder chemischen Labors sehr vorteilhaft sein, da die Spracheingabe so verarbeitet wird, dass diese direkt an ein technisches System weitergegeben und von diesem korrekt interpretiert werden kann, ohne dass der Nutzer hierfür beispielsweise Handschuhe ausziehen oder das Labor verlassen muss. Beispielsweise kann es sich bei der Hardwarekomponente um ein Gerät oder Gerätemodul oder ein Computersystem innerhalb eines chemischen oder biologischen Labors handeln. Beispielsweise kann es sich bei der Hardwarekomponente um ein automatisches oder semi
automatisches System zur Durchführung chemischer Analysen oder zur Herstellung von Farben und Lacken handeln.
Bei diesem System zur Analyse und/oder Synthese chemischer Produkte, insbesondere von Farben und Lacken, kann es sich um eine HTE-Anlage handeln.
Das System zur Analyse und/oder Synthese chemischer Produkte kann
beispielsweise dazu ausgebildet sein, einen oder mehrere der folgenden
Arbeitsschritte vollautomatisch in Reaktion auf eine Eingabe des korrigierten Textes über eine Maschine-Maschine Schnittstelle automatisch durchzuführen:
- rheologische Analysen von Substanzen und Substanzmischungen;
- Messung der Lagerstabilität von Substanzen und Substanzmischungen,
insbesondere anhand von Inhomogenitäten und Absetzungsneigung von flüssigen Substanzmischungen; Beispielsweise können diese Analysen anhand optischer Messungen in Küvetten nach Probenahme erfolgen;
- pH-Wert Bestimmung von Substanzen und Substanzmischungen;
- Schaumtests von Substanzen und Substanzmischungen, insbesondere Messung der Entschäumungswirkung und Messung der Schaumabbaukinetik; - Viskositätsmessungen von Substanzen und Substanzmischungen; die
Viskositätsmessung kann insbesondere bei hochviskosen Substanzen bzw.
Mischungen einen automatischen Verdünnungsschritt beinhalten da die
Viskosität in einer verdünnten Lösung leichter bestimmbar ist; auf Basis der Viskosität der verdünnten Lösung wird die Viskosität der ursprünglichen Substanz bzw. Substanzmischung berechnet;
- Messung des Rub-out Verhaltens (Abriebtest) der Substanz bzw. der
Substanzmischung, insbesondere des fertigen Produkts;
- Messung von Farbwerten von Substanzen und Substanzmischungen anhand beispielsweise eines mit Lichtstreuung arbeitenden Spektralphotometers (sog. L- A-B Wert), Haze und Gloss
- Schichtdickenmessung von Substanzen und Substanzmischungen, die auf einer Ebene aufgetragen wurden unter verschiedenen definierten Parametern
(Temperatur, Luftfeuchte, Oberflächenbeschaffenheit der Ebene, etc.)
- Bildanalyseverfahren von Bildern von Substanzen und Substanzmischungen, insbesondere zur Charakterisierung von Substanzoberflächen, z.B. Anzahl,
Größe und Verteilung von Luftblasen oder Kratzern in Farben und Lacken.
Bei den Substanzen und Substanzmischungen kann es sich insbesondere um Substanzen und Substanzmischungen, die zur Herstellung von Farben und Lacken dienen, handeln. Außerdem kann es sich bei den Substanzen und
Substanzmischungen um die Endprodukte, z.B. Farben und Lacke in flüssiger wie getrockneter Form, sowie Zwischenprodukte, z.B. Pigmentkonzentrate,
Anreibeharze und Pigmentpasten, und verwendete Lösungsmittel handeln.
Nach Ausführungsformen der Erfindung ist das Sprach-zu-Text- Umwandlungssystem als Dienst implementiert, welcher über das Internet an eine Vielzahl von Endgeräten bereitgestellt wird. Beispielsweise kann es sich bei dem Sprach-zu-Text-Umwandlungssystem um Googles Clouddienst„Speech-to-Text“ handeln. Dies kann vorteilhaft sein, da hierfür eine funktional mächtige API Client Bibliotheken vorhanden ist, z.B. für .NET. Dies kann vorteilhaft sein, da der rechenaufwändige Umsetzungsprozess von Sprachsignalen in Text nicht auf dem Endgerät erfolgt, sondern auf einem Server, vorzugsweise einem Cloudserver, der eine größere Rechenkraft besitzt als das Endgerät und der auf die schnelle und parallele Umwandlung einer Vielzahl von Sprachsignalen in erkannte Texte ausgelegt ist.
Das Endgerät kann beispielsweise ein Desktop-Com puter, ein Notebook, ein Smartphone, ein Tablet-Computer, ein in ein Laborgerät integrierter Computer, ein an ein Laborgerät lokal gekoppelter Computer oder ein Einplatinencomputer
(Raspberry Pi) sein, insbesondere ein Einplatinencomputer mit Mikrophon und Lautsprecher („Smart Speaker“). Die Softwarelogik, welche das Verfahren gemäß Ausführungsformen der Erfindung implementiert, kann ausschließlich auf dem Endgerät oder auf dem Endgerät und ein oder mehreren weiteren Computern, insbesondere Cloudcomputersystemen, in verteilter Weise implementiert sein. Bei der Softwarelogik handelt es sich vorzugsweise um eine Software, welche geräteunabhängig ist und vorzugsweise auch unabhängig vom Betriebssystem des Endgerätes.
Bei dem Endgerät handelt es sich vorzugsweise um ein Gerät, welches innerhalb eines Laborraums steht oder welcher zumindest mit einem Mikrophon innerhalb eines Laborraums operativ verbunden ist.
In einem weiteren Aspekt betrifft die Erfindung ein Endgerät. Das Endgerät umfasst:
- Ein Mikrophon zum Empfang eines Sprachsignals eines Nutzers, wobei das
Sprachsignal von dem Nutzer gesprochene allgemeinsprachliche und
fachsprachliche Wörter beinhaltet;
- Eine Schnittstelle zu einem Sprach-zu-Text-Umwandlungssystem. Diese
Schnittstelle ist dazu ausgebildet, das empfangene Sprachsignal in das Sprach- zu-Text-Umwandlungssystem einzugeben. Das Sprach-zu-Text- Umwandlungssystem unterstützt lediglich die Umwandlung von Sprachsignalen in ein Zielvokabular, welches die fachsprachlichen Wörter nicht beinhaltet. Die Schnittstelle ist ausgebildet zum Empfang eines Textes, welcher von dem
Sprach-zu-Text-Umwandlungssystem aus dem Sprachsignal erzeugt wurde. - Einen Datenspeicher mit einer Zuordnungstabelle von Wörtern in Textform. Die Zuordnungstabelle ordnet jedem von einer Vielzahl von fachsprachlichen Wörtern oder fachsprachlichen Ausdrücken zumindest ein Wort des Zielvokabulars zu.
Das zumindest eine Wort dem fachsprachlichen Wort zugewiesene Wort kann auch ein Ausdruck sein oder eine Menge aus Wörtern und Ausdrücken des Zielvokabulars. Das einem fachsprachlichen Wort zugeordnete zumindest eine Wort des Zielvokabulars ist ein Wort oder ein Ausdruck, welches das Sprach-zu- Text-Umwandlungssystem fälschlicherweise erkennt (und im Zuge der Erstellung der Zuordnungstabelle fälschlicherweise erkannt hat), wenn dieses
fachsprachliche Wort in Form eines Audiosignals eingegeben wird.
- Ein Korrekturprogramm, welches dazu ausgebildet ist, einen korrigierten Text durch automatisches Ersetzen von Wörtern und Ausdrücken des Zielvokabulars in dem empfangenen Text durch fachsprachliche Wörter gemäß der
Zuordnungstabelle zu erzeugen; und
- Eine Ausgabeschnittstelle zur Ausgabe des korrigierten Textes an einen Nutzer und/oder an ein Ausführungssystem. Das Ausführungssystem ist eine Software und/oder eine Hardwarekomponente und ist dazu konfiguriert, eine Funktion gemäß Angaben in dem korrigierten Text auszuführen.
Vorzugsweise ist das Endgerät dazu konfiguriert, über diese oder eine andere Schnittstelle von der Software oder Hardware ein Ergebnis der Ausführung zu empfangen;
Vorzugsweise beinhaltet das Endgerät ferner eine Ausgabeschnittstelle, z.B. um eine akustische Schnittstelle wie z.B. einen Lautsprecher, oder eine optische Schnittstelle, z.B. eine auf einer Anzeige dargestellte GUI (graphische
Benutzeroberfläche). Es kann sich aber auch um eine andere Schnittstelle handeln, z.B. um ein proprietäres Datenformat zum Austausch von Textdaten mit einem bestimmten Laborgerät.
In einem weiteren Aspekt betrifft die Erfindung ein System beinhaltend ein oder mehrere Endgeräte nach einer der hier beschriebenen Ausführungsformen. Das System umfasst ferner ein Sprach-zu-Text-Umwandlungssystem. Das Sprach-zu- Text-Umwandlungssystem beinhaltet:
- Eine Schnittstelle zum Empfang von Sprachsignalen von jedem der ein oder mehreren Endgeräten; und
- einen automatischen Spracherkennungsprozessor zum Erzeugen von Text aus einem empfangenen Sprachsignal. Dr Spracherkennungsprozessor unterstützt lediglich die Umwandlung von Sprachsignalen in ein Zielvokabular, welches die fachsprachlichen Wörter nicht beinhaltet. Die besagte Schnittstelle des Sprach- zu-Text-Umwandlungssystems ausgebildet ist zur Zurückgabe des aus einem empfangenen Sprachsignal erzeugten Textes an dasjenige Endgerät, von welchem das Sprachsignal empfangen wurde.
Gemäß manchen Ausführungsformen, insbesondere in welchen die Textkorrektur nicht vom Endgerät, sondern vom Kontrollcomputer oder einem Korrekturcomputer durchgeführt wird, umfasst das System auch den Kontrollcomputer und/oder den Korrekturcomputer.
Nach Ausführungsformen der Erfindung umfasst das System ferner die Software oder Hardwarekomponente, die die Funktion gemäß dem korrigierten Text ausführt.
Unter einem„Vokabular“ wird hier ein Sprachraum verstanden, also eine Menge an Wörtern, deren sich eine Entität, z.B. ein Sprache-zu-Text-Umwandlungssystem, bedienen kann.
Unter einem„Wort“ wird hier eine zusammenhängende Sequenz von Zeichen verstanden, welche innerhalb eines bestimmten Vokabulars vorkommt und eine selbständige sprachliche Einheit darstellt. In der natürlichen Sprache besitzt ein Wort - im Gegensatz zu einem Laut oder einer Silbe - eine eigenständige
Bedeutung.
Unter einem„Ausdruck“ wird hier sprachliche Einheit aus zwei oder mehr Wörtern verstanden. Unter einem“fachsprachlichen Wort“ oder„Fachwort“ wird hier ein Wort eines Fachwortvokabulars verstanden. Ein fachsprachliches Wort gehört nicht dem Zielvokabular an und ist typischerweise auch kein Bestandteil des
allgemeinsprachlichen Vokabulars.
Der Ausdruck, dass ein Sprach-zu-Text-Umwandlungssystem lediglich die
Umwandlung von Sprachsignalen in ein Zielvokabular unterstützt bedeutet, dass Wörter eines anderen Vokabulars entweder gar nicht in Text umgesetzt werden können oder nur mit einer sehr hohen Fehlerrate in Text umgesetzt wird, wobei die Fehlerrate über einem Fehlerratengrenzwert pro umzusetzendem Wort oder Ausdruck liegt, der als maximal tolerabel für eine funktionierende Umsetzung von Sprache in Text angesehen werden muss. Beispielsweise kann dieser Grenzwert bei einer Fehlerwahrscheinlichkeit pro Wort oder Ausdruck von über 50%, vorzugsweise schon von über 10% liegen.
Unter einem POS-Tag (oder Part-of-Speech-Tag) wird hier eine spezielle
Kennzeichnung („Label“) verstanden, welche jedem Wort in einem Textkorpus zugeordnet ist, um den Teil der Sprache und oft auch andere grammatikalische Kategorien wie Zeitform, Zahl (Plural/Singular), Groß-/Kleinschreibung usw.
anzugeben, welchen dieses Wort in seinem jeweiligen Textkontext repräsentiert. Ein Satz aller in einem Corpus verwendeten POS-Tags wird als Tagset bezeichnet. Tagsets für verschiedene Sprachen sind typischerweise unterschiedlich.
Grundlegende Tagsets enthalten Tags für die häufigsten Sprachkomponenten (z.B. N für Substantiv, V für Verb, A für Adjektiv usw.).
Ein„virtueller Laborassistent“ ist eine Software oder Softwareroutine, welche mit ein oder mehreren in einem Labor befindlichen Laborgeräten und/oder
Softwareprogrammen operativ verbunden ist derart, dass Informationen von diesen Laborgeräten und Labor-Softwareprogrammen empfangen und Befehle zur
Durchführung von Funktionen von dem Laborassistent an die Laborgeräte und Laborsoftwareprogramme gesendet werden kann. Ein Laborassistent hat also eine Schnittstelle zum Datenaustausch mit und zur Steuerung von ein oder mehreren Laborgeräten und Labor-Softwareprogrammen. Der Laborassistent hat zudem eine Schnittstelle zu einem Nutzer und ist dazu konfiguriert, dem Nutzer über diese Schnittstelle eine erleichterte Nutzung, Überwachung und/oder Kontrolle der Laborgeräte und der Labor-Softwareprogramme zu ermöglichen. Beispielsweise kann die Schnittstelle zu dem Nutzer als akustische Schnittstelle oder
natürlichsprachige Textschnittstelle ausgebildet sein.
Unter einem„Endgerät“ wird hier ein Datenverarbeitungsgerät (zum Beispiel PC, Notebook, Tablet-Computer, Einplatinensystem, Raspberry Pi Rechner,
Smartphone u.a.). Vorzugsweise ist das Endgerät an eine Netzwerkverbindung angeschlossen.
Ein„Referenz-Sprachsignal“ gemäß Ausführungsformen der Erfindung ist ein Sprachsignal, das von einem Mikrophon aufgezeichnet wurde und das auf einer Spracheingabe beruht, die von dem Sprecher nicht zum Zwecke einer Bedienung einer Software oder Hardware in das Mikrophon eingegeben wurde, sondern um die Erstellung oder Ergänzung der Zuordnungstabelle zu ermöglichen. Bei der
Spracheingabe handelt es sich um ein gesprochenes fachsprachliches Wort oder einen gesprochenen fachsprachlichen Ausdruck, welcher aufgenommen wird, um das entsprechende Sprachsignal an das Sprache-zu-Text-Umwandlungssystem weiterzuleiten und um in Antwort darauf vom Umwandlungssystem ein Wort oder einen Ausdruck des Zielvokabulars zu erhalten, das auf einer fehlerhaften
Umwandlung beruht.
Kurzbeschreibung der Zeichnungen
In den folgenden Abbildungen werden Ausführungsformen der Erfindung in exemplarischer Weise näher erläutert:
Figur 1 zeigt ein Flussdiagramm eines Verfahrens zur Sprach-zu-Text
Umwandlung von Texten mit fachsprachlichen Wörtern;
Figur 2 zeigt ein Blockdiagramm eines verteilten Systems zur Sprach-zu-Text
Umwandlung von Texten mit fachsprachlichen Wörtern;
Figur 3 zeigt ein Blockdiagramm eines weiteren verteilten Systems zur
Sprach-zu-Text Umwandlung; Figur 4 zeigt ein Blockdiagramm eines weiteren verteilten Systems zur Sprach-zu-Text Umwandlung; und
Figur 5 zeigt ein Blockdiagramm eines weiteren verteilten Systems zur
Sprach-zu-Text Umwandlung im Kontext eines Labors.
Detaillierte Beschreibung
Figur 1 zeigt ein Flussdiagramm eines computerimplementierten Verfahrens zur Sprach-zu-Text Umwandlung von Texten mit fachsprachlichen Wörtern. Der besondere Vorteil des Verfahrens ist, dass ein bestehendes Sprache-zu-Text- Umwandlungssystem für die Erkennung und Umsetzung von Texten mit
Fachwörtern verwendet werden kann und zwar auch dann, wenn dieses
Umsetzungssystem das fachsprachliche Vokabular gar nicht unterstützt. Das Verfahren kann von einem Endgerät alleine oder von einem Endgerät und weiteren Datenverarbeitungsgeräten, zum Beispiel einem Kontrollcomputer und/oder einem Computer, der einen Korrekturdienst über ein Netzwerk anbietet, ausgeführt werden. Einige mögliche Architekturen von verteilten und nicht verteilten
Datenverarbeitungssystemen, welche ein Verfahren gemäß Ausführungsformen der Erfindung implementieren können, sind in den Figuren 2, 3 und 4 dargestellt. Auf diese Figuren wird teilweise auch bei der Beschreibung des Flussdiagramms in Figur 1 Bezug genommen.
Das Verfahren kann typischerweise im Kontext eines chemischen oder biologischen Labors verwendet werden. In dem Labor befinden sich eine Reihe einzelner Analysegeräte und eine Hochdurchsatz-Anlage (High Throughput
Environment/HTE-Anlage). Die HTE Anlage beinhaltet eine Vielzahl von Einheiten und Modulen, die verschiedene chemische oder physikalische Parameter von Substanzen und Substanzmischungen analysieren und messen können und welche eine Vielzahl verschiedener chemische Produkte basierend auf einer von einem Nutzer eingegebenen Rezeptur kombinieren und synthetisieren können. Außerdem befindet sich in dem Labor ein Endgerät, zum Beispiel ein Notebook des
Laborarbeiters mit einer entsprechenden Software in Form eines Browser-Plugins. Die HTE Anlage beinhaltet eine interne Datenbank, in welcher Rezepturen, zum Beispiel von Farben und Lacken und deren Ausgangsstoffen sowie deren jeweilige physikalische chemische, optische und sonstige Eigenschaften gespeichert sind. Außerdem können in der Datenbank sonstige relevante Daten gespeichert sein, zum Beispiel Produktdatenblätter der Hersteller der Substanzen,
Sicherheitsdatenblätter, Parameter zur Konfiguration einzelner Module der HTE Anlage für die Analyse oder Synthese bestimmter Substanzen oder Produkte und ähnliches. Die HTE-Anlage ist dazu ausgebildet, Analysen und Synthesen basierend auf Rezepturen und Anweisungen, die in Textform eingegeben werden, auszuführen.
Häufige Tätigkeiten innerhalb eines Labors mit der Labor-Raumnummer 22 beziehen sich zum Beispiel auf folgende Tätigkeiten und damit zusammenhängende mögliche Spracheingaben eines Laborarbeiters 202, um eine Software oder
Hardware zur Ausführung einer Operation zu veranlassen:
- Der Laborarbeiter hat am Vortag eine Analyse eines bestimmten Lackes im
Hinblick auf dessen Theologische Eigenschaften gestartet und möchte nun das in der Datenbank der HTE Anlage hinterlegte Ergebnis abfragen. Mögliche
Spracheingabe:„KONTROLLCOMPUTER, zeige mir die Ergebnisse der rheologischen Analyse vom 24. Februar 2019 durch die HTE Anlage in Raum 22“
- der Laborarbeiter möchte Kosten sparen und überlegt sich, ein bestimmtes
Lösungsmittel «LMTEUER» durch ein kostengünstigeres Lösungsmittel «LMGÜNSTIG» zu ersetzen. Bei dem Namen <<LMGÜNSTIG» handelt es sich um einen Handelsnamen des Herstellers. Er ist sich aber nicht sicher, ob das kostengünstigere Lösungsmittel für den Lack, welcher hergestellt werden soll, geeignet ist, und möchte das Produktdatenblatt einsehen, in welchem weitere Angaben zu den chemischen und physikalischen Eigenschaften des kostengünstigen Lösungsmittels spezifiziert sind. Mögliche Spracheingabe:
„KONTROLLCOMPUTER, zeige mir das Produktdatenblatt von
«LMGÜNSTIG» an“ oder„KONTROLLCOMPUTER, zeige mir das in der HTE- Datenbank von Raum 22 gespeicherte Produktdatenblatt von «LMGÜNSTIG» an“.
- Nach Sichtung des Produktdatenblattes des Lösungsmittels «LMGÜNSTIG» ist der Laborarbeiter der Auffassung, dass das Lösungsmittel voraussichtlich anstatt des teureren Lösungsmittels für die Herstellung des bestimmten Lackes verwendet werden kann. Es ist jedoch davon auszugehen, dass die Rezeptur etwas angepasst werden muss, da mehrere Parameter wie etwa pH-Wert, Theologische Eigenschaften, Polarität und andere von denen des teureren
Lösungsmittels abweichen. Da diese Eigenschaften miteinander in
Wechselwirkung stehen, ist es nicht möglich, manuell die nötigen Anpassungen der Rezeptur zu erkennen. Die Durchführung von Testreihen ist arbeitsintensiv und kostet Zeit. Das Labor verfügt aber über eine Software, welche die
Eigenschaften eines chemischen Produkts, zum Beispiel von Farben und Lacken, ausgehend von einer bestimmten Rezeptur Vorhersagen (simulieren) kann. Die Simulation kann z.B. auf CNNs (convolutional neuronal networks) beruhen. Der Laborarbeiter möchte diese Simulationssoftware nutzen, um die
voraussichtlichen Eigenschaften eines Lackes basierend auf einer bekannten Rezeptur, in welchem das teure Lösungsmittel durch das günstige ersetzt wurde, simuliert werden. Mögliche Spracheingabe:„KONTROLLCOMPUTER,
veranlasse die HTE-Simulationssoftware, die Eigenschaften eines Lackes zu berechnen mit folgender Rezeptur: 70.2 g naphtenic oil, 4 g methol n-amyl keton, 1,5 g n-pentyl propionat, 1g Ultrasorb, 50 g «LMGÜNSTIG»““.
- Die Simulation hat ergeben, dass das günstige Lösungsmittel nicht für die
Herstellung des Lackes geeignet ist. Der Labormitarbeiter möchte nun im Internet nach anderen Lösungsmitteln suchen, welche das teure Lösungsmittel ersetzen können ohne die Qualität des Produkts zu beeinträchtigen, um Kosten zu reduzieren. Mögliche Spracheingabe:„ KONTROLLCOMPUTER , suche im
Internet: «hoch viskose Lösungsmittel für die Lackherstellung»“ .
Gemäß Ausführungsformen der Erfindung können all diese Eingaben und Befehle an die jeweiligen Ausführungssysteme erfolgen, ohne dass der Nutzer hierfür den Laborraum verlassen und/oder Handschuhe ausziehen muss.
In einem ersten Schritt 102 macht der Laborarbeiter 202 eine Spracheingabe 204 in ein Mikrofon 214 des Endgerätes 212, 312. Beispielsweise kann die Spracheingabe aus einem der oben genannten Sprachbefehle bestehen. Die Spracheingaben beinhalten in der Regel sowohl allgemeinsprachliche als auch fachsprachliche Wörter und Ausdrücke. So sind zum Beispiel die Wörter bzw. Ausdrücke „rheologische“,„naphtenic oil“,„methol n-amyl keton“„n-pentyl propiona“ chemische Fachbegriffe und «LMGÜNSTIG»ein Handelsname eines chemischen Produkts. Diese Wörter bzw. Ausdrücke sind typischerweise nicht in dem von den gängigen allgemeinsprachlichen Sprache-zu-Text-Umwandlungssystem unterstützten
Vokabular („Zielvokabular“) enthalten.
Das Mikrofon 214 wandelt die Spracheingabe in ein elektronisches Sprachsignal 206 um. Dieses Sprachsignal wird sodann in Schritt 104 in ein Sprach-zu-Text- Umwandlungssystem 226 eingegeben.
Beispielsweise kann, wie in Figur 2 gezeigt, das Endgerät eine Schnittstelle 224 und entsprechende Client Applikation 222 zu einer der bekannten allgemeinsprachlichen Sprach-zu-Text-Umwandlungssystemen 226 von zum Beispiel Google, Apple, Amazon oder Nuance besitzen. Diese Client Applikation 222 sendet das
Sprachsignal über die Schnittstelle 224 direkt an das Sprach-zu-Text- Umwandlungssystem 226. In anderen Ausführungsformen ist es aber auch möglich, dass das Sprachsignal über ein oder mehrere zwischengeschaltete
Datenverarbeitungsgeräte an das Sprache-zu-Text-Umwandlungssystem 226 gesendet wird. Gemäß den in Figuren 3 und 4 dargestellten Ausführungsformen der Erfindung wird das Sprachsignal zunächst an einen Kontrollcomputer 314, 414 gesendet, welcher dieses dann an das Sprache-zu-Text-Umwandlungssystem 226 über ein Netzwerk 236 weiterleitet. Bei dem Netzwerk kann es sich zum Beispiel um das Internet handeln.
Das Kontrollcomputersystem 314, 414 führt Koordinations- und Kontrolltätigkeiten bezüglich der Verwaltung und Verarbeitung des Sprachsignals und des aus diesem generierten Texts aus. Bei dem Kontrollcomputer 314 handelt es sich um ein Datenverarbeitungssystem, welches die Textkorrektur selbst ausführt. Der
Kontrollcomputer 414 hat auch diesen Rechenschritt an ein weiteres
Datenverarbeitungssystem ausgelagert.
Das Sprach-zu-Text-Umwandlungssystem 226 ist ein allgemeinsprachliches
Umwandlungssystem, d. h., es unterstützt lediglich die Umwandlung von Sprachsignalen in ein allgemeinsprachliches Zielvokabular 234, welches die fachsprachlichen Wörter der Spracheingabe 204 nicht beinhaltet.
Das Sprache-zu-Text-Umwandlungssystem führt nun die Umwandlung des
Sprachsignals in einen Text basierend auf dem Zielvokabular durch. Typischerweise handelt es sich bei dem Sprache-zu-Text-Umwandlungssystem 226 um einen Clouddienst, der eine Vielzahl von Sprachsignalen mehrerer Endgeräte parallel verarbeiten und an diese über das Netzwerk zurückgeben kann. Allerdings wird der erzeugte Text - je nachdem, wie das Sprache-zu-Text-Umwandlungssystem implementiert ist - mit Sicherheit oder mit sehr hoher Wahrscheinlichkeit falsch erkannte Wörter und Ausdrücke enthalten, da zumindest einige der Wörter und Ausdrücke der Spracheingabe 204 aus fachsprachlichen Wörtern bzw. Ausdrücken bestehen, wohingegen das Umwandlungssystem lediglich das Zielvokabular unterstützt, welches die fachsprachlichen Wörter und Ausdrücke nicht enthält.
In Schritt 106 empfängt dasjenige Datenverarbeitungssystem, welches das
Sprachsignal 206 an das Sprache-zu-Text-Umwandlungssystem 226 gesendet hatte, in Antwort darauf den aus diesem Signal generierten Text 208 von dem Sprache-zu-Text-Umwandlungssystem. Das als Empfänger fungierende
Datenverarbeitungssystem („Empfängersystem“) kann also, je nach
Systemarchitektur, das Endgerät sein, oder ein Kontrollcomputer 314 wie in Figur 3 gezeigt, oder ein Kontrollcomputer 414, wie in Figur 4 gezeigt.
In einem weiteren Schritt 110 wird eine Zuordnungstabelle 238 verwendet, um den empfangenen Text zu korrigieren. Das Datenverarbeitungssystem, das die
Textkorrektur vornimmt, wird nach seiner Funktion hier auch als„Korrektursystem“ bezeichnet. Bei diesem kann es sich, je nach Ausführungsform, um das Endgerät 212, oder um das Kontrollcomputersystem 314, oder um ein
Korrekturcomputersystem 402 handeln. Falls Empfängersystem und
Korrektursystem nicht identisch sind, wird der vom Empfängersystem empfangene Text 208 an das Korrekturcomputersystem weitergeleitet.
In der Zuordnungstabelle 238 sind Wörter in Textform einander zugeordnet.
Genauer gesagt ordnet die Zuordnungstabelle jedem von einer Vielzahl von fachsprachlichen Wörtern oder fachsprachlichen Ausdrücken zumindest ein Wort aus dem Zielvokabular zu. Das einem fachsprachlichen Wort (oder fachsprachlichen Ausdruck) zugeordnete zumindest eine Wort des Zielvokabulars ist ein Wort oder ein Ausdruck, welches das Sprach-zu-Text-Umwandlungssystem fälschlicherweise erkennt (und früher bei der Erstellung der Tabelle bereits fälschlicherweise erkannt hat), wenn dieses fachsprachliche Wort in Form eines Audiosignals in das Sprache- zu-Text-Umwandlungssystem eingegeben wird.
Das Korrektursystem 212, 314, 402 erzeugt in Schritt 110 einen korrigierten Text 210 aus dem fehlerhaften Text 208 des Umwandlungssystems 226. Der korrigierte Text wird von dem Korrektursystem automatisch dadurch erzeugt, dass Wörter und Ausdrücke des Zielvokabulars in dem empfangenen Text 208 durch fachsprachliche Wörter gemäß der Zuordnungstabelle 238 ersetzt werden.
Falls das Korrektursystem ein Korrekturcomputer ist wie in Figur 4 gezeigt, wird der korrigierte Text an einen Kontrollcomputer zurückgegeben.
Das Endgerät oder der Kontrollcomputer gibt den korrigierten Text 210 in Schritt 112 direkt oder indirekt in ein Ausführungssystem 240 ein. Beispiele für
verschiedene Ausführungssysteme sind in Figur 5 dargestellt. Das
Ausführungssystem, eine Software und/oder Flardwarekomponente, führt eine Software- und/oder Flardwarefunktion gemäß dem korrigierten Text aus und liefert ein Ergebnis 242 zurück. Das Ergebnis kann beispielsweise direkt an das Endgerät zurückgegeben werden oder über den Kontrollcomputer als Zwischenstation an das Endgerät zurückgegeben werden. Alternativ oder zusätzlich kann das Ergebnis jedoch auch an andere Endgeräte und sonstige Datenverarbeitungssysteme zurückgegeben werden.
Bei den in Figuren 3 und 4 dargestellten Ausführungsformen sendet der als
Korrektursystem fungierende Kontrollcomputer 314 den korrigierten Text an das Ausführungssystem 240, empfängt das Ergebnis 242 der Ausführung von diesem und leitet dieses Ergebnis zur Ausgabe an den Nutzer 202 an das Endgerät weiter. Das Ergebnis ist typischerweise ein Text, z.B. ein in einer Datenbank recherchiertes Rezept für Synthese einer chemischen Substanz, ein in einer Datenbank oder im Internet ermitteltes Dokument, z.B. Produktdatenblatt einer Substanz, die
Bestätigung, dass eine chemische Analyse oder Synthese, die gemäß den Angaben in dem korrigierten Text durchgeführt wurde, erfolgreich beendet wurde (oder, falls das nicht der Fall war, eine entsprechende Fehlermeldung).
Schließlich kann das Endgerät oder ein anderes Datenverarbeitungssystem das Ergebnis der Durchführung der Funktion durch das aus Software und/oder
Flardware bestehende Ausführungssystem 240 an den Nutzer 202 aus. Bei der Software und/oder der Flardware handelt es sich vorzugsweise um Software und Flardware, die innerhalb eines Labors oder speziell für die Tätigkeiten innerhalb eines Labors konzipiert sind oder welche dazu zumindest verwendbar sind.
Beispielsweise kann das Endgerät 212 einen Lautsprecher beinhalten oder an diesen kommunikativ gekoppelt sein und das Ergebnis in akustischer Form über diesen Lautsprecher ausgeben. Zusätzlich oder alternativ dazu kann das Endgerät einen Bildschirm zur Ausgabe des Ergebnisses an den Nutzer beinhalten. Auch weitere Ausgabeschnittstellen sind möglich, zum Beispiel Bluetooth- basierte Komponenten.
Beispielsweise kann das Verfahren gemäß Ausführungsformen der Erfindung zur Implementierung einer Sprachsteuerung von elektronischen Geräten, insbesondere Laborinstrumenten und FITE Anlagen mittels Sprachsteuerung dienen. Die
Sprachsteuerung kann auch genutzt werden, um Ergebnisse von bereits im Labor durchgeführten Analysen und Synthesen, Laborprotokolle und Produktdatenblätter in entsprechenden Datenbanken des Labors zu recherchieren und auszugeben und ergänzende Suchen auch im Internet und über das Internet zugänglichen öffentlichen oder proprietären Datenbanken sprachgesteuert durchzuführen. Auch Sprachbefehle, welche spezielle Flandelsnahmen von Chemikalien oder
Laborgeräten bzw. Laborverbrauchsmaterialien und/oder Namen und Adjektive der chemischen Fachsprache beinhalten, werden richtig in Text umgesetzt und können somit vom Ausführungssystem richtig interpretiert werden. Gemäß
Ausführungsformen der Erfindung wird somit ein weitgehend sprachgesteuerter, hoch integrierter Betrieb eines chemischen oder biologischen Labors bzw. einer Labor-HTE-Anlage ermöglicht. Das Wort„KONTROLLCOMPUTER“ in der
Spracheingabe kann beispielweise den Namen eines virtuellen Assistenten 502 zum sprachbasierten Betrieb der Geräte eines Labors und/oder einer FITE Anlage eines Labors darstellen. Analog zu den virtuellen Assistenzen Alexa und Siri für Alltagsprobleme kann das Wort„KONTROLLCOMPUTER“ (oder beliebige andere, ggf. stärker an einen Menschen erinnernde Namen wie„EVA“) als Triggersignal dienen, um eine Textauswertungslogik dieses Laborassistenten zur Auswertung des korrigierten Textes zu veranlassen. Der Laborassistent ist dazu konfiguriert, jeden empfangenen Text daraufhin zu überprüfen, ob dieser seinen Namen und ggf.
weitere Schlüsselwörter beinhaltet. Falls dies der Fall ist, wird der korrigierte Text weiter analysiert um darin kodierte Befehle zu erkennen und auszuführen.
Nach einer Ausführungsform erfolgt die Ausgabe der Ergebnisdaten, die auf Basis des in das Laborgerät oder die HTE Anlage eingegebenen korrigierten Textes ermittelt wurden, über einen Lautsprecher, der sich innerhalb des Laborraums befindet. Beispielsweise kann es sich bei dem Lautsprecher um einen Lautsprecher handeln, der Bestandteil des Endgeräts ist, welches die Spracheingabe des Nutzers empfangen hat. Es kann sich aber auch um einen anderen Lautsprecher handeln, der mit diesem Endgerät kommunikativ verbunden ist. Dies hat den Vorteil, dass ein Laborarbeiter medienbruchfrei Befehle mit seiner Stimme eingeben kann, zum Beispiel um Analysenergebnisse, Produktdatenblätter oder sonstige Kontext
Informationen für chemische Analysen, Synthesen und Produkte schnell in
Erfahrung zu bringen. Die Ergebnisse dieser sprachlichen Suchangabe werden über den Lautsprecher akustisch ausgegeben. Der Nutzer kann die gehörte Information verwenden, um weitere Suchbefehle zu formulieren und/oder einen Sprachbefehl zur Durchführung einer Analyse oder Synthese unter Berücksichtigung der akustisch ausgegebenen Recherchenergebnisse ins Mikrofon zu sprechen. Dieser Zyklus von akustischer Eingabe und Ausgabe kann sich mehrfach wiederholen, ohne dass hierfür eine Eingabe von Daten oder Befehlen über eine Tastatur erforderlich ist. Jedoch können Laborabläufe erheblich effizienter gestaltet werden.
Im Kontext der chemischen Synthese von Farben und Lacken ist die effiziente Einholung von Informationen zu chemischen Substanzen und eine sprachbasierte Steuerung von Laborgeräten und HTE Anlagen besonders vorteilhaft, da eine große Vielzahl von Ausgangsstoffen für die Herstellung von Farben und Lacken notwendig ist, wobei deren Eigenschaften auf komplexe Art und Weise miteinander
wechselwirken und die Eigenschaften des Produkts stark beeinflussen. Es fallen somit im Kontext der Herstellung von Farben und Lacken eine Vielzahl von
Analysen, Kontrollschritten und Testreihen an. Farben und Lacke sind
hochkomplexe Mischungen von bis zu 20 Rohstoffen und mehr, zum Beispiel Lösungsmittel, Harze, Härter, Pigmente, Füllstoffe und zahlreiche Additive
(Dispergierungsmittel, Benetzer, Haftvermittler, Entschäumer, Biozide,
Flammschutzmittel, und weitere). Eine effiziente Beschaffung von Informationen zu den einzelnen Komponenten und zur Ansteuerung entsprechender Analyse- und Syntheseanlagen kann den Herstellungsprozess und die Qualitätssicherung der Produkte erheblich beschleunigen.
Figur 2 zeigt ein Blockdiagramm eines verteilten Systems 200 zur Sprach-zu-Text Umwandlung von Texten mit fachsprachlichen Wörtern.
Die wesentlichen Funktionen der Komponenten des Systems 300 und seiner Komponenten wurden bereits im Hinblick auf Figur 1 beschrieben. Bei dem
Endgerät 212 kann es sich beispielsweise um ein Notebook, einen Standard- Computer, einen Tablet-Computer, oder ein Smartphone handeln. Auf dem
Endgerät ist eine Clientsoftware 222 installiert, welche mit einem existierenden allgemeinsprachlichen Sprache-zu-Text-Umwandlungssystem 226 interoperabel ist. Beispielsweise handelt es sich bei dem Sprache-zu-Text-Umwandlungssystem 226 um ein Cloudcomputersystemen, welches über eine entsprechende Sprache zu Text-Schnittstelle (SZT-Schnittstelle) Schnittstelle 224 diese Umwandlung als Dienst über das Internet anbietet. Bei dem Dienst handelt es sich um ein serverseitig implementiertes Softwareprogramm 232, welches in funktioneller Hinsicht einem Spracherkennungs- und Sprachumsetzungsprozessor entspricht. Beispielsweise kann es sich bei dem Softwareprogramm 232 um Googles Speech-to-Text
Clouddienst handeln. Bei der Schnittstelle 224 handelt es sich in diesem Fall also um eine cloudbasierte API von Google.
In der in Figur 2 dargestellten Ausführungsform verfügt das Endgerät über die Zuordnungstabelle 238 und über hinreichend Rechnerleistung, die auf der Tabelle basierende Korrektur des vom Sprache-zu-Text-Umwandlungssystem 226 erzeugten Textes 208 selbst vorzunehmen. Das Senden des Sprachsignals 206 an den Server 226, der Empfang des Textes 208 von dem Server 226 und die Korrektur des Textes zur Erstellung des korrigierten Textes 210 können also in dem Clientprogramm 222 implementiert sein. Bei dem Clientprogramm 222 kann es sich zum Beispiel um ein Browserplugin oder eine Standalone-Applikation handeln, die über die Schnittstelle 224 mit der Serversoftware 232 interoperabel ist.
Figur 3 zeigt ein Blockdiagramm eines weiteren verteilten Systems 300 zur Sprach- zu-Text Umwandlung.
Die wesentlichen Funktionen des Systems 300 und seiner Komponenten wurden bereits im Hinblick auf die Figur 1 und die Figur 2 beschrieben. Die
Systemarchitektur des Systems 300 unterscheidet sich von der Architektur des Systems 200 dahingehend, dass das Endgerät 312 die Funktion der Textkorrektur ausgelagert hat an einen Kontrollcomputer 314. Eine auf dem Endgerät 312 installierte Clientsoftware 316, hier Kontrollclient genannt, ist mit einem
entsprechenden Kontrollprogramm 320, das auf einem Kontrollcomputer 314 installiert ist, interoperabel. Das Endgerät ist mit dem Kontrollcomputer 314 über ein Netzwerk 236, zum Beispiel das Internet, verbunden. Die Kontrollschnittstelle 318 dient zum Datenaustausch zwischen Kontrollclient 316 und Kontrollprogramm 320.
Bei dem Kontrollcomputer 314 kann es sich zum Beispiel um einen
Standardcomputer handeln. Vorzugsweise jedoch handelt es sich bei dem
Kontrollcomputer um einen Server oder um ein Cloudcomputersystemen.
Das auf dem Kontrollcomputer installierte Kontrollprogramm 320 implementiert zum einen koordinative Funktionen 322, um den Austausch von Daten (Sprachsignal 206, erkannter Text 208, korrigierter Text 210) zwischen den verschiedenen
Datenverarbeitungsgeräten (Endgerät, Kontrollcomputer, Sprache-zu-Text- Umwandlungssystem) zu koordinieren. Zum anderen implementiert das
Kontrollprogramm 320 in der hier gezeigten Ausführungsform eine
Textkorrekturfunktion 324, welche in dem System 200 von dem Endgerät ausgeführt wird. Die Korrekturfunktion 324 besteht darin, Wörter und Ausdrücke des
Zielvokabulars im empfangenen Text 208 durch fachsprachliche Wörter und
Ausdrücke gemäß der Zuordnungstabelle 238 zu ersetzen. Zusätzlich können im Zuge der Ersetzung auch Auftretenswahrscheinlichkeiten und/oder POS-Tags berücksichtigt werden, die von dem Kontrollcomputer 314 berechnet werden oder über die SZT-Schnittstelle 244 von dem Sprache-zu-Text-Umwandlungssystem 226 zusammen mit dem Text 208 empfangen werden. Der Sprachclient 222, der in dieser Ausführungsform lediglich den Datenaustausch mit dem
Umwandlungssystem 226 steuert und nicht die Textkorrektur durchführt, kann als Bestandteil des Kontrollprogramms 320 implementiert sein. Es ist aber auch möglich, dass es sich bei dem Kontrollprogramm 320 und dem Client 222 um separate aber miteinander interoperable Programme handelt.
Die in Figur 3 dargestellte Architektur hat den Vorteil, dass das Endgerät keine rechenintensiven Operationen ausführen muss. Sowohl die Umsetzung des
Sprachsignals in Text als auch die Korrektur dieses Textes werden von anderen Datenverarbeitungssystemen übernommen. Im Wesentlichen ist die Funktion des Endgeräts 312 beschränkt auf den Empfang des Sprachsignals 206, das
Weiterleiten des Sprachsignals an einen vordefinierten Kontrollcomputer 314 mit bekannter Adresse und die Ausgabe eines Ergebnisses, das von einem
Ausführungssystem bei Durchführung einer Funktion gemäß dem korrigierten Text zurückgegeben wird.
Figur 4 zeigt ein Blockdiagramm eines weiteren verteilten Systems 400 zur Sprach- zu-Text Umwandlung.
Die wesentlichen Funktionen des Systems 400 und seiner Komponenten wurden bereits im Hinblick auf die Figuren 1 , 2 und 3 beschrieben. Die Systemarchitektur des Systems 400 unterscheidet sich von der Architektur des Systems 300 dahingehend, dass der Kontrollcomputer 414 die Textkorrektur nicht selbst vornimmt, sondern durch einen anderen Computer, hier als„Korrekturcomputer“ bzw.„Korrekturserver“ 402 bezeichnet, durchführen lässt, wobei der andere
Computer 402 über ein Netzwerk und eine eigene Schnittstelle 406 mit dem
Kontrollprogramm 320 des Kontrollcomputers interoperabel verbunden ist.
Diese Architektur kann vorteilhaft sein, da für die Textkorrektur ein separater Rechner bzw. Rechnerverbund, der als Cloud System ausgebildet sein kann, verwendet wird. Dies erleichtert eine separate Vergabe von Zugriffsrechten. Das Kontrollprogramm 320 auf dem Kontrollcomputer 414 kann beispielsweise umfassende Zugriffsrechte in Hinblick auf verschiedene, teilweise sensible Daten haben, die im Zuge der Analyse und Synthese chemischer Substanzen und
Substanzmischungen im Labor, zum Beispiel durch eine HTE Anlage, erzeugt werden. Nach Ausführungsformen der Erfindung kann der Kontrollcomputer 414 beispielsweise eine Maschine-zu-Maschine Schnittstelle haben, um den korrigierten Text in Form eines Kontrollkommandos direkt an ein Laborgerät oder eine HTE- Anlage oder an deren Datenbank zu senden, um dort eine Analyse, chemische Synthese oder Recherche, basierend auf dem korrigierten Text 210 einzuleiten. Ein sicherer und strenger Zugriffsschutz für den Kontrollcomputer 414 ist daher besonders wichtig.
Der Korrekturserver 402 in dem Kontext der Architektur des Systems 400 dient lediglich der Korrektur des Textes 208, der von dem Sprache-zu-Text- Umwandlungssystem 226 erzeugt und an das Kontrollprogramm 320
zurückgegeben wurde. Ein Nutzer, der Zugriff auf den Korrekturserver 402 bekommt, zum Beispiel um die Tabelle 238 zu aktualisieren und um weitere
Fachwörter und Fachausdrücke zu ergänzen, hat also nach Ausführungsformen der Erfindung keinen lesenden und/oder schreibenden Zugriff auf den Kontrollcomputer 414. Somit ist es möglich, die Zuordnungstabelle und damit die Textkorrektur laufend zu aktualisieren, ohne dass es hierfür erforderlich ist, dem hierfür
verantwortlichen Personal umfassende Zugriffsrechte auf sensible Steuerlogik und Datenbestände eines Labors zu gewähren.
Bei dem Endgerät 312 der verteilten Systeme 300, 400 kann es sich beispielsweise um Computer, Notebooks, Smartphones und dergleichen handeln. Es ist aber auch möglich, dass es sich um vergleichsweise rechenschwache Einplatinenrechner, z.B. Raspberry Pi Systeme, handelt.
Die Hardware (Smart Speaker) bekannter Sprache-zu-Text-Clouddienst- Anbieter verfolgen das Ziel, die durch den Cloud Anbieter selbst entwickelten Services direkt anzusteuern und zu nutzen. Die Anwendung im Bereich Fachvokabular ist derzeit nicht oder in nur sehr geringem Umfang erschlossen.
Alle der hier gezeigten System architekturen 200, 300, 400 und 500 ermöglichen die Verwendung bestehender Sprach-zu-Text-APIs diverser Cloud-Anbieter mittels einer eigenen, Cloud-Anbieter-unabhängige Hardware um eine fachspezifische Spracherkennung und eine darauf basierende Steuerung von Laborgeräten und elektronischen Suchdiensten in einem Labor zu ermöglichen.
Figur 5 zeigt ein Blockdiagramm eines weiteren verteilten Systems 500 zur Sprach- zu-Text Umwandlung im Kontext eines chemischen Labors. Das Labor umfasst einen Laborbereich 504 mit den üblichen Sicherheitsvorschriften. In diesem stehen verschiedene einzelne Laborgeräte 516, z.B. eine Zentrifuge, sowie eine HTE- Anlage 518. Die HTE Anlage beinhaltet eine Vielzahl von Modulen und
Hardwareeinheiten 506-514, die von einem Controller 520 verwaltet und gesteuert werden. Der Controller dient als zentrale Schnittstelle zur Überwachung und
Steuerung der in der HTE Anlage enthaltenen Geräte nach außen. Das
Kontrollprogramm 320 auf dem Kontrollcomputer 414 beinhaltet ein Softwaremodul 502, das einen virtuellen Laborassistenten implementiert.
Die Erzeugung eines korrigierten Texts 210 aus einer Spracheingabe 204 eines Nutzers 202 erfolgt wie gemäß Ausführungsformen der Erfindung bereits
beschrieben. Nachdem das Kontrollprogramm 320 den korrigierten Text vom
Korrekturcomputer 402 empfangen hat, wertet das Kontrollprogramm diesen aus und sucht dabei nach einem Schlüsselwort wie z.B.„KONTROLLCOMPUTER“ oder „EVA“. Falls der korrigierte Text dieses Schlüsselwort enthält, wird der virtuelle Laborassistent 502 dazu veranlasst, den korrigierten Text weiter daraufhin zu analysieren, ob der korrigierte Text Befehle zur Durchführung einer Hard- oder Softwarefunktion beinhaltet und, falls ja, von welcher Hardware oder Software unter der Kontrolle des Laborassistenten 502 diese Befehle ausgeführt werden sollen. Beispielsweise kann der korrigierte Text Namen von Geräten oder Laborräumen enthalten, welche spezifizieren, an welches Gerät und welche Software der Befehl weitergeleitet werden soll.
In einem möglichen Implementierungsbeispiel ergibt die Auswertung des
korrigierten Textes 210 durch den virtuellen Laborassistenten, dass eine Internet- Suchmaschine 528 nach einer bestimmten Substanz, die in dem korrigierten Text 210 als fachsprachliches Wort oder Ausdruck spezifiziert ist, suchen soll. Der korrigierte Text bzw. bestimmte Teile von diesem werden vom virtuellen Assistenten 502 über das Internet in die Suchmaschine eingegeben. Die Ergebnisse 524 der Internetrecherche werden an den Assistenten 502 zurückgegeben, der diese an ein geeignetes Ausgabegerät in der Nähe des Nutzers 202, zum Beispiel Endgerät 312, weiterleitet, wo sie z.B. über einen Lautsprecher oder Bildschirm 218 ausgegeben werden.
In einem weiteren möglichen Implementierungsbeispiel ergibt die Auswertung des korrigierten Textes 210 durch den virtuellen Laborassistenten, dass das Laborgerät 512, eine Zentrifuge, einen bestimmten Stoff bei einer bestimmten Drehzahl pelletieren soll. Der Name der Zentrifuge und der Stoff sind in dem korrigierten Text 210 als fachsprachliches Wort oder Ausdruck spezifiziert, was ausreichend ist, da die Zentrifuge die zu verwendenden Zentrifugationsparameter wie Dauer und Umdrehungszahl selbsttätig aus einer internen Datenbank basierend auf dem Substanznahmen ausliest. Der korrigierte Text bzw. bestimmte Teile von diesem werden vom virtuellen Assistenten 502 über das Internet an die Zentrifuge 512 gesendet. Die Zentrifuge startet ein zu der Substanz gehörendes
Zentrifugationsprogramm und gibt eine Meldung über die erfolgreiche oder nicht erfolgreiche Zentrifugation als Textmeldung 522 zurück. Das Ergebnis 522 wird an den Assistenten 502 zurückgegeben, der diese an ein geeignetes Ausgabegerät, zum Beispiel Endgerät 312, weiterleitet, wo es z.B. über einen Lautsprecher oder Bildschirm 218 ausgegeben wird.
In einem weiteren möglichen Implementierungsbeispiel ergibt die Auswertung des korrigierten Textes 210 durch den virtuellen Laborassistenten, dass die HTE-Anlage 518 einen bestimmten Lack synthetisieren soll. Die Komponenten des Lacks sind in dem korrigierten Text ebenfalls spezifiziert und bestehen aus einer Mischung von Handelsnamen chemischer Produkte und IUPAC Substanznahmen. Die HTE- Anlage empfängt den korrigierten Text 210 und entscheidet autonom, die Synthese in der Syntheseeinheit 514 durchzuführen. Eine Nachricht über die erfolgreiche Synthese oder eine Fehlermeldung wird als Ergebnis 526 von der Syntheseeinheit 514 an den Kontroller der HTE-Anlage 518 zurückgegeben und der Kontroller wiederum gibt das Ergebnis 526 an den virtuellen Laborassistenten 592 zurück, der es an ein geeignetes Ausgabegerät, zum Beispiel Endgerät 312, weiterleitet, wo es z.B. über einen Lautsprecher oder Bildschirm 218 ausgegeben wird. Liste der Referenznummern
102-1 12 Schritte
200 verteiltes System
202 Nutzer
204 Spracheingabe
206 Sprachsignal
208 erkannter Text
210 korrigierter Text
212 Endgerät
214 Mikrofon
216 Prozessor(en)
218 Bildschirm
220 Speichermedium
222 Client-Programm
224 Schnittstelle (clientseitig)
224 Schnittstelle (serverseitig)
226 Sprach-zu-Text Umwandlungssystem/Cloud-System
228 Prozessor(en)
230 Speichermedium
232 Spracherkennungsprozessor
234 Zielvokabular
236 Netzwerk
238 Zuordnungstabelle
240 Ausführungssystem (Software und/oder Hardware)
242 Ergebnis der Ausführung des korrigierten Textes (in
Textform)
300 verteiltes System
312 Endgerät
316 Clientsoftware des Kontrollprogramms
318 Schnittstelle des Kontrollprogramms
320 Kontrollprogramm 322 Koordinationsfunktion
324 Text-Korrekturfunktion/Text-Korrekturprogramm
400 verteiltes System
402 Korrektur-Server/Textkorrektur-Cloud System
404 Clientsoftware des Text-Korrekturprogramms
406 Schnittstelle des Text-Korrekturprogramms
414 Kontrollcomputer
500 verteiltes System
502 virtueller Laborassistent
504 Laborbereichs
506 Analysegerät
508 Analysegerät
510 Mischer
512 Syntheseeinheit
514 Syntheseeinheit
516 Standalone- Laborgerät
522 Ergebnis der Ausführung des korrigierten Textes
(Textform)
524 Ergebnis der Ausführung des korrigierten Textes
(Textform)
526 Ergebnis der Ausführung des korrigierten Textes
(Textform)
528 Internet Suchmaschine

Claims

Patentansprüche
1. Computerimplementiertes Verfahren zur Sprach-zu-Text-Umwandlung,
beinhaltend:
- Empfang (102) eines Sprachsignals (206) eines Nutzers (202) durch ein Endgerät (212), wobei das Sprachsignal von dem Nutzer gesprochene allgemeinsprachliche und fachsprachliche Wörter beinhaltet;
- Eingabe (104) des empfangenen Sprachsignals in ein Sprach-zu-Text- Umwandlungssystem (226), wobei das Sprach-zu-Text- Umwandlungssystem lediglich die Umwandlung von Sprachsignalen in ein Zielvokabular (234), welches die fachsprachlichen Wörter nicht beinhaltet, unterstützt;
- Empfang (106) eines Textes (208), welcher von dem Sprach-zu-Text- Umwandlungssystem aus dem Sprachsignal erzeugt wurde, von dem Sprach-zu-Text-Umwandlungssystem;
- Erzeugen (110) eines korrigierten Textes (210) durch automatisches
Ersetzen von Wörtern und Ausdrücken des Zielvokabulars in dem empfangenen Text durch fachsprachliche Wörter gemäß einer
Zuordnungstabelle (238) von Wörtern in Textform, wobei die
Zuordnungstabelle jedem von einer Vielzahl von fachsprachlichen Wörtern zumindest ein Wort aus dem Zielvokabular zuordnet, wobei das einem fachsprachlichen Wort zugeordnete zumindest eine Wort des
Zielvokabulars ein Wort oder ein Ausdruck ist, welches das Sprach-zu- Text-Umwandlungssystem fälschlicherweise erkennt, wenn dieses fachsprachliche Wort in Form eines Audiosignals eingegeben wird; und
- Ausgabe (112) des korrigierten Textes an den Nutzer und/oder an eine Software (528, 240) und/oder an eine Hardwarekomponente (506-516, 240), wobei die Software oder Hardwarekomponente dazu konfiguriert ist, eine Funktion gemäß Angaben in dem korrigierten Text auszuführen.
2. Das computerimplementierte Verfahren nach Anspruch 1 , wobei das Erzeugen des korrigierten Textes von einem Korrektursystem durchgeführt wird, wobei das Korrektursystem das Endgerät (212) oder ein mit dem Endgerät über ein Netzwerk operativ verbundenes Korrekturcomputersystem (314, 402) ist.
3. Das computerimplementierte Verfahren nach einem der vorigen Ansprüche,
- wobei das Zielvokabular aus einer Menge allgemeinsprachlicher Wörter besteht; oder
- wobei das Zielvokabular aus einer Menge allgemeinsprachlicher Wörter sowie daraus abgeleiteter Wörter besteht; oder
- wobei das Zielvokabular aus einer Menge allgemeinsprachlicher Wörter ergänzt um daraus abgeleitete Wörter und/oder ergänzt um Wörter, die durch Kombination erkannter Silben gebildet werden, besteht.
4. Das computerimplementierte Verfahren nach einem der vorigen Ansprüche, wobei es sich bei den fachsprachlichen Wörtern um Wörter aus einer der folgenden Kategorien handelt:
- Namen von chemischen Substanzen, insbesondere von Farben und
Lacken oder von Additiven im Färb- und Lackbereich;
- Physikalische, chemische, mechanische, optische oder haptische
Eigenschaften chemischer Substanzen;
- Namen von Laborgeräten und Geräten der chemischen Industrie;
- Namen von Labor-Verbrauchsmaterial und Labor-Bedarf;
Handelsnamen im Färb- und Lackbereich.
5. Das computerimplementierte Verfahren nach einem der vorigen Ansprüche, ferner umfassend:
- Empfang oder Berechnung von Häufigkeitsangaben, wobei die
Häufigkeitsangaben für zumindest einige der Wörter in dem Text, welcher von dem Sprach-zu-Text-Umwandlungssystem aus dem Sprachsignal erzeugt wurde, angeben, wie häufig das Auftreten dieses Wortes statistisch zu erwarten ist;
- wobei bei der Erzeugung des korrigierten Textes nur diejenigen Wörter des Zielvokabulars in dem empfangenen Text durch fachsprachliche Wörter gemäß der Zuordnungstabelle ersetzt werden, deren statistisch erwartete Auftretenshäufigkeit gemäß den empfangenen Häufigkeitsangaben unter einem vordefinierten Schwellenwert liegt.
6. Das computerimplementierte Verfahren nach Anspruch 5
- wobei die Berechnung der Häufigkeitsangaben mittels eines Hidden- Markov-Modells erfolgt.
7. Das computerimplementierte Verfahren nach einem der vorigen Ansprüche, ferner umfassend:
- Empfang von Part-of-Speech-Tags - POS Tags - für zumindest einige der Wörter in dem Text, welcher von dem Sprach-zu-Text- Umwandlungssystem aus dem Sprachsignal erzeugt wurde, wobei die POS Tags zumindest Tags für Substantiv, Adjektiv und Verb beinhalten; wobei die fachsprachlichen Wörter der Zuordnungstabelle zusammen mit Part-of-Speech-Tags der fachsprachlichen Wörter gespeichert sind; wobei bei der Erzeugung des korrigierten Textes nur diejenigen Wörter des Zielvokabulars in dem empfangenen Text durch fachsprachliche Wörter gemäß der Zuordnungstabelle ersetzt werden, deren POS-Tags
übereinstimmen.
8. Das computerimplementierte Verfahren nach einem der vorigen Ansprüche, ferner umfassend:
- Für jedes von einer Vielzahl fachsprachlicher Wörter, Aufzeichnung
zumindest eines Referenz-Sprachsignals, welches selektiv dieses fachsprachliche Wort wiedergibt, von zumindest einem Sprecher;
- Eingabe jedes der Referenz-Sprachsignale in das Sprach-zu-Text- Umwandlungssystem;
- Für jedes der eingegebenen Referenz-Sprachsignale, Empfang von
zumindest einem Wort des Zielvokabulars, welches von dem Sprach-zu- Text-Umwandlungssystem aus dem eingegebenen Referenz-Sprachsignal erzeugt wurde, von dem Sprach-zu-Text-Umwandlungssystem, wobei jedes der empfangenen Wörter des Zielvokabulars eine Fehlumwandlung repräsentiert, da das Zielvokabular der Sprach-zu-Text- Umwandlungssystem die fachsprachlichen Wörter nicht unterstützt; wobei die Zuordnungstabelle jedem der fachsprachlichen Wörter und Ausdrücke, für welche zumindest ein Referenz-Sprachsignal aufgezeichnet wurde, das zumindest eine Wort des Zielvokabulars in Textform zuordnet, welches von dem Sprach-zu-Text-Umwandlungssystem aus dem dieses fachsprachliche Wort beinhaltenden Referenz-Sprachsignal jeweils erzeugt wurde.
9. Das computerimplementierte Verfahren nach Anspruch 8: wobei für jedes von zumindest einigen der fachsprachlichen Wörter mehrere Referenz-Sprachsignale jeweils von unterschiedlichen Sprechern gesprochen und aufgezeichnet werden, wobei die mehreren Referenz- Sprachsignale dieses fachsprachliche Wort wiedergeben;
- wobei die Zuordnungstabelle jedem von zumindest einigen der
fachsprachlichen Wörter mehrere Wörter des Zielvokabulars in Textform zuordnet, wobei die mehreren Wörter des Zielvokabulars
Fehlumwandlungen repräsentieren, die das Sprach-zu-Text- Umwandlungssystem für die verschiedenen Sprecher in Abhängigkeit von deren Stimme erzeugt hat.
10. Das computerimplementierte Verfahren nach einem der vorigen Ansprüche, wobei die Ausgabe des korrigierten Textes an den Nutzer erfolgt und umfasst: o Anzeige des korrigierten Textes auf einem Bildschirm (218) des Endgerätes; und/oder
o Ausgabe des korrigierten Textes über eine Text-zu-Sprache
Schnittstelle und einen Lautsprecher des Endgerätes.
11. Das computerimplementierte Verfahren nach einem der vorigen Ansprüche, wobei die Ausgabe des korrigierten Textes an die Software erfolgt, wobei die Software ausgewählt ist aus einer Gruppe umfassend:
- Eine chemische Substanzdatenbank die dazu ausgebildet ist, den
korrigierten Text als Sucheingabe zu interpretieren und Informationen zu der Sucheingabe in der Datenbank zu ermitteln und zurückzugeben;
und/oder
- Eine Internet-Suchmaschine die dazu ausgebildet ist, den korrigierten Text als Sucheingabe zu interpretieren und Informationen zu der Sucheingabe im Internet zu ermitteln und zurückzugeben; und/oder
- Eine Simulationssoftware die dazu ausgebildet ist, Eigenschaften von
chemischen Erzeugnissen, insbesondere von Lacken und Farben, basierend auf einer vorgegebenen Rezeptur zu simulieren, wobei die Simulationssoftware dazu ausgebildet ist, den korrigierten Text als
Spezifikation einer Rezeptur eines Erzeugnisses, dessen Eigenschaften simuliert werden sollen, zu interpretieren;
- Eine Steuerungssoftware für die Steuerung chemischer Synthesen
und/oder der Erzeugung von Substanzmischungen, insbesondere von Farben und Lacken, wobei die Steuerungssoftware dazu ausgebildet ist, den korrigierten Text als Spezifikation der Synthese oder der Komponenten der Substanzmischung zu interpretieren.
12. Das computerimplementierte Verfahren nach einem der vorigen Ansprüche, ferner umfassend:
- Ausgabe eines Ergebnisses der Durchführung der Funktion durch die
Software- oder Hardwarekomponente über einen Lautsprecher oder eine Anzeige des Endgeräts.
13. Das computerimplementierte Verfahren nach einem der vorigen Ansprüche,
- wobei die Ausgabe des korrigierten Textes an die Hardwarekomponente erfolgt,
- wobei die Hardwarekomponente Anlage für die Durchführung chemischer Analysen, chemischer Synthesen und/oder für die Erzeugung von
Substanzmischungen, insbesondere von Farben und Lacken, ist,
- wobei die Anlage dazu ausgebildet ist, den korrigierten Text als
Spezifikation der Synthese oder der Komponenten der Substanzmischung oder als eine Spezifikation der Analyse noch zu interpretieren.
14. Das computerimplementierte Verfahren nach einem der vorigen Ansprüche, - wobei das Sprach-zu-Text-Umwandlungssystem als Dienst implementiert ist, welcher über das Internet an eine Vielzahl von Endgeräten
bereitgestellt wird; und/oder
- wobei das Endgerät ein Desktop-Com puter, Notebook, Smartphone, ein in ein Laborgerät integrierter Computer, ein an ein Laborgerät lokal gekoppelter Computer oder ein Einplatinencomputer (Raspberry Pi) ist.
15. Ein Endgerät (212), umfassend:
- Ein Mikrophon (214) zum Empfang eines Sprachsignals (206) eines
Nutzers, wobei das Sprachsignal von dem Nutzer gesprochene
allgemeinsprachliche und fachsprachliche Wörter beinhaltet;
- Eine Schnittstelle (224) zu einem Sprach-zu-Text-Umwandlungssystem (226), o wobei die Schnittstelle dazu ausgebildet ist, das empfangene
Sprachsignal in das Sprach-zu-Text-Umwandlungssystem
einzugeben, wobei das Sprach-zu-Text-Umwandlungssystem lediglich die Umwandlung von Sprachsignalen in ein Zielvokabular (234), welches die fachsprachlichen Wörter nicht beinhaltet, unterstützt; und o wobei die Schnittstelle ausgebildet ist zum Empfang eines Textes (208), welcher von dem Sprach-zu-Text-Umwandlungssystem aus dem Sprachsignal erzeugt wurde;
- Einen Datenspeicher (220) mit einer Zuordnungstabelle (238) von Wörtern in Textform, wobei die Zuordnungstabelle jedem von einer Vielzahl von fachsprachlichen Wörtern zumindest ein Wort des Zielvokabulars zuordnet, wobei das einem fachsprachlichen Wort zugeordnete zumindest eine Wort des Zielvokabulars ein Wort oder ein Ausdruck ist, welches das Sprach-zu- Text-Umwandlungssystem fälschlicherweise erkennt, wenn dieses fachsprachliche Wort in Form eines Audiosignals eingegeben wird;
- Ein Korrekturprogramm (222), welches dazu ausgebildet ist, einen
korrigierten Text (210) durch automatisches Ersetzen von Wörtern und Ausdrücken des Zielvokabulars in dem empfangenen Text durch
fachsprachliche Wörter gemäß der Zuordnungstabelle zu erzeugen; und
- Eine Ausgabeschnittstelle (218) zur Ausgabe (112) des korrigierten Textes an den Nutzer und/oder an eine Software (528, 240) und/oder an eine Hardwarekomponente (506-516, 240), wobei die Software oder die
Hardwarekomponente dazu konfiguriert ist, eine Funktion gemäß Angaben in dem korrigierten Text auszuführen.
16. Ein System beinhaltend ein oder mehrere Endgeräte (212) nach Anspruch 15, ferner umfassend ein Sprach-zu-Text-Umwandlungssystem (226), wobei das
Sprach-zu-Text-Umwandlungssystem beinhaltet:
- Eine Schnittstelle (224‘) zum Empfang von Sprachsignalen (206) von
jedem der ein oder mehreren Endgeräten;
- einen automatischen Spracherkennungsprozessor (232) zum Erzeugen von Text (208) aus einem empfangenen Sprachsignal (206), wobei der Spracherkennungsprozessor lediglich die Umwandlung von
Sprachsignalen in ein Zielvokabular (234), welches die fachsprachlichen Wörter nicht beinhaltet, unterstützt; und wobei die Schnittstelle ausgebildet ist zur Zurückgabe des aus einem empfangenen Sprachsignal erzeugten Textes (208) an dasjenige Endgerät, von welchem das Sprachsignal empfangen wurde.
EP20711580.9A 2019-03-18 2020-03-13 Sprach-zu-text umwandlung von nicht-unterstützter fachsprache Withdrawn EP3942549A1 (de)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
EP19163510 2019-03-18
PCT/EP2020/056960 WO2020187787A1 (de) 2019-03-18 2020-03-13 Sprach-zu-text umwandlung von nicht-unterstützter fachsprache

Publications (1)

Publication Number Publication Date
EP3942549A1 true EP3942549A1 (de) 2022-01-26

Family

ID=65818364

Family Applications (1)

Application Number Title Priority Date Filing Date
EP20711580.9A Withdrawn EP3942549A1 (de) 2019-03-18 2020-03-13 Sprach-zu-text umwandlung von nicht-unterstützter fachsprache

Country Status (7)

Country Link
US (1) US20220270595A1 (de)
EP (1) EP3942549A1 (de)
JP (1) JP2022526467A (de)
CN (1) CN113678196A (de)
AR (1) AR118332A1 (de)
TW (1) TWI742562B (de)
WO (1) WO2020187787A1 (de)

Families Citing this family (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2022051097A1 (en) 2020-09-03 2022-03-10 Spark23 Corp. Eyeglass augmented reality speech to text device and method
US12057123B1 (en) * 2020-11-19 2024-08-06 Voicebase, Inc. Communication devices with embedded audio content transcription and analysis functions
CN113761118B (zh) * 2021-04-22 2025-08-26 腾讯科技(深圳)有限公司 音频数据处理方法、装置、音频数据处理设备及存储介质
GB202211620D0 (en) * 2022-08-09 2022-09-21 Oakspire Ltd Automated speech recognition to support context-aware intent recognition
CN116050354A (zh) * 2023-01-03 2023-05-02 深圳华为云计算技术有限公司 一种实验手册的配置方法以及装置
US20250149042A1 (en) * 2023-11-03 2025-05-08 Xanderglasses, Inc. Speech-to-text captioning system

Family Cites Families (10)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP3825526B2 (ja) * 1997-03-31 2006-09-27 株式会社東芝 音声認識装置
WO2001016940A1 (en) * 1999-08-31 2001-03-08 Accenture, Llp System, method, and article of manufacture for a voice recognition system for identity authentication in order to gain access to data on the internet
ATE417346T1 (de) * 2003-03-26 2008-12-15 Koninkl Philips Electronics Nv Spracherkennungs- und korrektursystem, korrekturvorrichtung und verfahren zur erstellung eines lexikons von alternativen
US7539619B1 (en) * 2003-09-05 2009-05-26 Spoken Translation Ind. Speech-enabled language translation system and method enabling interactive user supervision of translation and speech recognition accuracy
JP5207642B2 (ja) * 2007-03-06 2013-06-12 ニュアンス コミュニケーションズ,インコーポレイテッド 語句として新たに認識するべき文字列を取得するためのシステム、方法及びコンピュータプログラム
JP2010066365A (ja) * 2008-09-09 2010-03-25 Toshiba Corp 音声認識装置、方法、及びプログラム
US9292621B1 (en) * 2012-09-12 2016-03-22 Amazon Technologies, Inc. Managing autocorrect actions
CH711717B1 (de) 2015-10-29 2019-11-29 Chemspeed Tech Ag Anlage und Verfahren zur Durchführung eines Bearbeitungsprozesses.
EP3270374A1 (de) * 2016-07-13 2018-01-17 Tata Consultancy Services Limited Systeme und verfahren zur automatischen reparatur der ausgabe einer spracherkennungsengine
JP2018045001A (ja) * 2016-09-12 2018-03-22 株式会社リコー 音声認識システム、情報処理装置、プログラム、音声認識方法

Also Published As

Publication number Publication date
TW202046292A (zh) 2020-12-16
US20220270595A1 (en) 2022-08-25
AR118332A1 (es) 2021-09-29
TWI742562B (zh) 2021-10-11
CN113678196A (zh) 2021-11-19
JP2022526467A (ja) 2022-05-24
WO2020187787A1 (de) 2020-09-24

Similar Documents

Publication Publication Date Title
EP3942302B1 (de) Laborsystem mit portablem, ein mikrophon beinhaltendem gerät und verfahren hierzu
EP3942549A1 (de) Sprach-zu-text umwandlung von nicht-unterstützter fachsprache
Gilquin et al. Corpora and experimental methods: A state-of-the-art review.
CN109785698B (zh) 用于口语水平评测的方法、装置、电子设备以及介质
CN111428467B (zh) 生成阅读理解的问题题目的方法、装置、设备及存储介质
Dizon et al. A Pilot Study of Alexa for Autonomous Second Language Learning.
Pfeifer et al. How ready is speech-to-text for psychological language research? Evaluating the validity of AI-generated English transcripts for analyzing free-spoken responses in younger and older adults
CN108280065A (zh) 一种外文文本评价方法及装置
CN113408253A (zh) 一种作业评阅系统及方法
Li The comprehensive training effect of translation ability of college English majors based on machine learning
Duan et al. Automatically build corpora for chinese spelling check based on the input method
CN120296246A (zh) 一种基于人工智能的智能化求职助手系统
JP2018031828A (ja) 学習者の口述音声から自動的に採点するプログラム、装置及び方法
DE112019005921T5 (de) Informationsverarbeitungsvorrichtung, informationsverarbeitungsverfahren und programm
DE202023105413U1 (de) System zur automatisierten Texterzeugung mit Fehlerkorrektur
Wilson Units and constituency in prosodic analysis: a quantitative assessment
Thierfelder et al. The Chinese lexicon of deaf readers: A database of character decisions and a comparison between deaf and hearing readers
CN120163688B (zh) 一种基于语义理解和云服务的英语教学管理方法及系统
Mac Yves et al. Measuring Spoken English Proficiency Level Based on IELTS Speaking Test Using Machine Learning Models
Zhang et al. Integrating CAI Tools & ASR in the Interpreting Classroom: A Proposal for Lesson Plans Using InterpretBank.
Zembrzuski et al. Automatic speech recognition adaptation to the IoT domain dialogue system
Abe AFRICAN LANGUAGES IN THE DEVELOPMENT OF CORPUS LINGUISTICS AND OPENAI/CHATGPT: A CASE STUDY OF THE YORUBA LANGUAGE
Louw Building Speech-Driven Assessment Tools for Afrikaans and isiXhosa Children
van den Heuvel Crossing the SSH Bridge with Interview Data
Ibeke Unheard voices: addressing AI bias towards accented English in educational technologies.

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20211018

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)
GRAP Despatch of communication of intention to grant a patent

Free format text: ORIGINAL CODE: EPIDOSNIGR1

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: GRANT OF PATENT IS INTENDED

INTG Intention to grant announced

Effective date: 20230920

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN

18D Application deemed to be withdrawn

Effective date: 20240131