TW202046292A - 不支援之技術語言之語音至文本轉換 - Google Patents
不支援之技術語言之語音至文本轉換 Download PDFInfo
- Publication number
- TW202046292A TW202046292A TW109108492A TW109108492A TW202046292A TW 202046292 A TW202046292 A TW 202046292A TW 109108492 A TW109108492 A TW 109108492A TW 109108492 A TW109108492 A TW 109108492A TW 202046292 A TW202046292 A TW 202046292A
- Authority
- TW
- Taiwan
- Prior art keywords
- text
- speech
- words
- conversion system
- word
- Prior art date
Links
Images
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/14—Speech classification or search using statistical models, e.g. Hidden Markov Models [HMMs]
- G10L15/142—Hidden Markov Models [HMMs]
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/08—Speech classification or search
- G10L15/18—Speech classification or search using natural language modelling
- G10L15/183—Speech classification or search using natural language modelling using context dependencies, e.g. language models
- G10L15/19—Grammatical context, e.g. disambiguation of the recognition hypotheses based on word sequence rules
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/10—Text processing
- G06F40/166—Editing, e.g. inserting or deleting
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/20—Natural language analysis
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/20—Natural language analysis
- G06F40/253—Grammatical analysis; Style critique
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/26—Speech to text systems
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/28—Constructional details of speech recognition systems
- G10L15/30—Distributed recognition, e.g. in client-server systems, for mobile phones or network applications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/10—Text processing
- G06F40/12—Use of codes for handling textual entities
- G06F40/151—Transformation
- G06F40/157—Transformation using dictionaries or tables
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L15/00—Speech recognition
- G10L15/22—Procedures used during a speech recognition process, e.g. man-machine dialogue
- G10L2015/221—Announcement of recognition results
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Computational Linguistics (AREA)
- Multimedia (AREA)
- Human Computer Interaction (AREA)
- Acoustics & Sound (AREA)
- Theoretical Computer Science (AREA)
- Artificial Intelligence (AREA)
- General Health & Medical Sciences (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Probability & Statistics with Applications (AREA)
- Machine Translation (AREA)
- Management, Administration, Business Operations System, And Electronic Commerce (AREA)
Abstract
本發明係關於一種用於語音至文本轉換之電腦實施方法。該方法包含:
接收(102)包含通用語言及技術語言字詞之一語音信號(206);
將該所接收語音信號輸入(104)至一語音至文本轉換系統(226)中,該語音至文本轉換系統僅支援語音信號至不包含該等技術語言字詞之一目標詞彙(234)之轉換;
接收(106)由該語音至文本轉換系統自該語音信號產生之一段文本(208);
藉由根據一指派表(238)使用技術語言字詞自動地取代該所接收文本中來自該目標詞彙之字詞及表達而產生(110)經校正之一段文本(210),該指派表將由該語音至文本轉換系統錯誤辨識之至少一個字詞或來自該目標詞彙之一錯誤辨識表達指派給大量技術語言字詞中之每一者;以及
將該經校正文本輸出(112)至使用者或軟體及/或一硬體組件以用於執行一功能。
Description
本發明係關於用於語音至文本轉換,詳言之化工技術語言之電腦實施方法。
在化學實驗室中,由於物質及裝置均會產生各種危害,因此有大量確保在實驗室中安全工作的規則已經生效。取決於實驗室之類型、在其中進行之活動以及所使用之物質,以下安全性規定因此可尤其重要:需要穿戴個人防護設備,其除了實驗工作服之外,亦可包含護目鏡或防護面罩以及防護手套。通常不允許攜帶及食用食品以及飲料,且為避免污染,帶辦公桌的辦公室區域、手冊、紙質產品文檔、電腦工作站及網際網路接入與實驗室工作區域在物理上係彼此分開的。物理隔離只能經由安全門系統實現辦公室區域與實驗室區域之間的交叉。離開實驗室區域時脫掉安全服亦可為一項規定。
安全性規定部分地使工作流程顯著複雜化:若具有網際網路及/或資料庫存取之電腦僅可用於辦公室區域中,則必須針對每個操作步驟脫掉安全服且接著必須在再次進入實驗室時立即再次穿上安全服。即使具有鍵盤及網際網路連接之電腦可用於實驗室區域內,鍵盤常常亦無法藉由分指手套操作。在必要時必須脫下及棄置分指手套。在已經完成藉由電腦之工作之後,必須再次戴上分指手套以便能夠繼續實驗室工作。
在個別情況下,存在具有尤其大的鍵盤之實驗室裝置,其例如呈較大觸控螢幕之形式,以便促進運用分指手套進行輸入。然而,此特殊的硬體係昂貴的,並且不適用於所有實驗室裝置。詳言之,標準電腦及標準筆記型電腦沒有此種類型之「分指手套友好」的鍵盤。
如今用於實驗室中之裝置部分高度複雜且亦被設計成靈活地解譯複雜的基於文本的輸入。例如,M. Hummel、D. Porcincula及E. Sapper在歐洲塗層雜誌(2019年02月01日)中的文章「自然語言處理-用於塗層科學機器人讀取配方之語義框架(NATURAL LANGUAGE PROCESSING .A semantic framework for coatings science-robots reading recipes)」中描述自動實驗室系統,其被設計成自動地分析及解譯自然語言文本輸入、文本挖掘及NLP工具並基於此等各段自然語言文本中之資訊進行化學合成。然而,使用者必須亦手動地與此等系統中之使用者介面交互以便輸入此文本,結果為在此情況下亦必須脫下分指手套。
用於使用及與電腦或電腦經控制機器及實驗室裝置交互的當前可用選項因此在化學或生物實驗室之上下文內極其受限且低效。
本發明之目標為提供根據獨立請求項之改良方法及終端機,這使得有可能在實驗室上下文中以改良方式控制軟體及硬體組件。本發明之實施例指定於附屬請求項中。若本發明之實施例並不互斥,則本發明之實施例可彼此自由組合。
在一個態樣中,本發明係關於一種用於語音至文本轉換之電腦實施方法。該方法包含:
- 藉助於終端機接收來自使用者之語音信號,其中該語音信號包含該使用者說出之通用語言及技術語言字詞;
- 將該所接收語音信號輸入至語音至文本轉換系統中,其中該語音至文本轉換系統僅支援語音信號至不包含該等技術語言字詞之目標詞彙之轉換;
- 自該語音至文本轉換系統接收由該語音至文本轉換系統自該語音信號產生之一段文本;
- 藉由根據指派表使用技術語言字詞自動地取代所接收文本中來自目標詞彙之字詞及表達而產生經校正之一段文本,其中指派表以文本形式將字詞指派給彼此,其中指派表將藉由語音至文本轉換系統錯誤地辨識之至少一個字詞或來自目標詞彙之錯誤地辨識之表達指派至大量技術語言字詞或表達中之每一者;以及
- 將經校正文本輸出至經組態以根據經校正文本中之資訊執行功能之軟體及/或硬體組件。
本發明之實施例詳言之適合用於生物及化學實驗室,由於其並不具有先前技術中所提及之缺點。基於語音之輸入允許在存在麥克風之任何所要位置處,亦即甚至在實驗室工作區域內將資訊輸入至終端機中,而無需離開實驗室工作場所、脫下分指手套或甚至必須完全中斷工作。
現在市面上確實存在便宜的終端機及強大的應用程式以用於將命令之基於語音之輸入輸入至電腦系統中,例如Alexa (亞馬遜公司(Amazon))、Cortana (微軟公司(Microsoft))、Google助理及Siri (蘋果公司(Apple))。然而,此等終端機及應用程式被設計成輔助終端使用者之日常活動,例如購物、選擇無線電站點或預訂旅館。該等終端機及應用程式因此被設計成用於日常情形且亦僅支援通用語言字詞。甚至在偶爾支援技術語言字詞(「技術字詞」)時,該等系統之辨識準確性顯著降低。然而,在生物學及化工中,詳言之,並不出現於通用語言中之大量技術字詞在實驗室上下文中使用。較高程度之語音辨識精確性亦尤其重要,尤其在化學實驗室之上下文中。儘管較小錯誤因而在日常語言中常常可辨識且可由使用者或接收器系統辨識為錯誤且可易於校正或補償(例如,單數/複數形式之不正確辨識不會引起至傳回大體上不同結果之網際網路搜尋引擎中之對應輸入),但即使最微小的偏差(例如,「雙」而非「三」)在化學合成之上下文中可使得「辨識到」完全不同物質,而非說話者實際上意指之物質,且可引起所得產品不可用或甚至可能風險由於使用不正確物質而產生對於人員健康或實驗室之安全操作的風險。被設計成用於日常使用的該等語音至文本轉換系統因此在對應風險下不適合於用於生物及化學實驗室。
在一些情況下,亦存在針對特定領域之要求及詞彙專門設計的語音至文本轉換系統。舉例而言,Nuance公司為律師提供「Dragon Legal」軟體,其除了日常語言詞彙之外亦包含法律技術術語。然而,缺點在於在特定實驗室中,例如在生產及分析塗料及塗層之領域中,所需之詞彙因此具體並且動態地可變,使得甚至含有化學術語之語音辨識軟體常常不合適用於特定公司或化工之特定分支之實踐,此係由於常常亦使用物質之商標名在實驗室中進行工作,該等化學術語可例如取自標準化學教科書。此等商標名可改變或每年添加用於相關產品之大量的新商標名。詳言之,每年市面上均會出現可用於生產塗料及塗層之在新商標名下之大量其他產品及產品變型。即使存在達到來自Google或Apple之日常語言系統之準確性且包含最重要化學技術術語的語音至文本轉換系統(情況並非如此),此系統實際上亦並非極其適合於使用,由於在化學實驗室中之實踐中起作用的動態及大量名稱(詳言之當生產塗料及塗層時,由於與實踐相關之大多數字詞)將未經支援或詞彙至少在幾年之後將完全過時。
根據本發明之實施例,此問題藉由訴諸於已知不支援相關技術術語之語音至文本轉換系統而被解決。因此,一開始不嘗試在此處實施昂貴並且複雜的特殊開發,其僅服務於極小的市場區段,且因此就涉及的通用語言術語而言,在一定機率下將不會達到來自Amazon、Google或Apple之已知的大型轉換系統之辨識準確性,除了化學技術術語之外,語音輸入中通常亦必須考慮並且正確地辨識該等通用語言術語。實際上,本發明之實施例使用用於通用語言術語之現有服務提供商之已經極佳的辨識準確性並且在輸出經辨識本文之前進行校正。在校正過程中,基於指派表用技術字詞取代錯誤地辨識之字詞,結果為形成且最後輸出經校正之一段文本。因此最終將高度特定的技術詞彙置於指派表中,由於領域之動態性及市場參與者、產品及對應產品名稱之多樣性必須連續更新該技術詞彙以便使軟體保持適合於實踐。此表不費吹灰之力就可保持最新。
可藉由在每種情況下添加新的技術字詞連同針對此技術字詞而被錯誤辨識之一或多個目標詞彙字詞而將新的技術字詞容易地添加至指派表。自技術視角,技術字詞之儲存及更新因此與實際語音辨識邏輯完全無關。此亦具有避免對語音辨識服務之特定提供商之依賴性的優點。語音辨識領域仍很年輕,且尚且無法預測相對於辨識準確性及/或價格,長遠而言大量並行解決方案中之哪一者為最佳選擇。根據本發明之實施例,系結至一個特定語音至文本轉換系統僅由於所接收語音信號最初傳輸至轉換系統且接收到(錯誤)的一段文本。另外,指派表含有目標詞彙之經錯誤地辨識之字詞,其係由此特定轉換系統針對特定技術術語被(不正確地)傳回。然而,兩者均可藉由使用不同的語音至文本轉換系統產生(錯誤的)文本而被容易地改變,並且出於此目的,此另一轉換系統另外用以重新形成指派表。不需要複雜的改變,例如語法剖析器及/或神經網路之邏輯之改變。
根據本發明之實施例之方法亦可有利於化工或化學生產中之現場服務雇員,此係由於此等雇員在其企業活動過程中常常使用電腦或至少智慧型電話並且藉由例如經組態為應用程式或瀏覽器外掛程式之輸入至校正軟體中之語音而非藉由使用小鍵盤輸入之文本而自客戶或其活動分心的較少。
根據本發明之實施例之另一優點在於終端機僅接收語音信號,校正文本並基於經校正文本輸出軟體及/或硬體功能之執行結果。語音信號至一段文本之實際語音至文本轉換,亦即迄今為止最運算密集型步驟係藉由語音至文本轉換系統進行。語音至文本轉換系統可例如為經由網路,例如網際網路連接至終端機之伺服器。具有低處理器功率之終端機,例如智慧型電話或單板電腦因此亦可用於輸入及轉換長且複雜的語音輸入。
根據一個實施例,藉由語音至文本轉換系統產生之文本由終端機接收。終端機接著亦進行文本校正,在此情況下,根據實施例,進一步資料處理步驟亦藉由終端機進行,例如文本中個別字詞之出現機率之計算或接收,以便在基於指派表取代字詞及表達時考慮此等機率。此實施變體在相對強大終端機,例如實驗室區域中之桌上型電腦中尤其有利。例如,終端機可具有軟體程式,其用於接收語音輸入、用於經由語音至文本介面將語音輸入轉遞至語音至文本轉換系統、用於自此轉換系統接收文本、用於基於指派表校正文本,及用於將經校正文本輸出至基於軟體及/或基於硬體之執行系統。基於軟體及/或基於硬體之執行系統為軟體或硬體或兩者之組合,其經組態以根據含於經校正文本中之資訊執行功能且較佳地亦傳回執行結果。結果較佳以文本形式傳回。終端機上之軟體程式可例如呈瀏覽器外掛程式或瀏覽器附加程式或獨立軟體應用程式形式,其可與語音至文本轉換系統互操作。
根據替代實施例,藉由語音至文本轉換系統產生之文本由終端機接收。然而,終端機接著自身並不進行文本校正,而是實際上經由網際網路將文本傳輸至具有基於指派表進行文本校正之校正軟體之控制電腦,如所描述,且將經校正文本轉移至執行系統以作為輸入。執行系統可由軟體及/或硬體組成且可被設計成根據經校正文本輸入執行功能。執行系統可例如為實驗室軟體或實驗室裝置。根據本發明之實施例,執行系統將經校正文本之執行結果傳回至控制電腦。此結果較佳地同樣具有文本形式。功能之執行結果較佳由控制電腦傳回至終端機及/或經由其他裝置輸出。終端機接著根據經校正文本輸出功能之執行結果。控制電腦可例如實施為雲端服務或可實施於個別伺服器上。此實施變體在具有平均執行功率之終端機,例如整合於個別實驗室裝置中或用於分析及/或合成化學物質之系統中之智慧型電話或控制模組中可為有利的。終端機在此處亦協調資料輸入、與語音至文本轉換系統之資料交換及與控制電腦之資料交換。終端機視需要可根據經校正文本輸出功能之執行結果。在此實施例中,控制電腦並不進行文本校正功能,而是實際上經由網路將自語音至文本轉換系統接收到之文本傳輸至基於該表進行文本之校正電腦,如上文所描述。控制電腦接收經校正文本並經由網路將其轉遞至根據經校正文本中之資訊執行軟體或硬體功能之執行系統。此實施例可為有利的,此係由於一方面分離對控制電腦之功能及資料之存取權限且另一方面分離對校正電腦之功能及資料之存取權限有可能為較佳的。若文本校正進行於單獨雲端系統上,則在此處出於更新該表的目的可准許使用者進行存取,而無需此亦需要存取可控制例如執行系統,例如實驗室裝置的控制電腦之敏感資料。
根據本發明之實施例,與語音至文本轉換系統之資料交換之協調、文本校正及經校正文本至執行系統之轉遞因此完全由控制電腦進行或由控制電腦組織及協調。根據該方法之一些實施例,終端機因此大體上為具有用於經校正文本之執行結果之麥克風及視情況存在之輸出介面的裝置。終端機可包含例如揚聲器及用戶端軟體,其經預先組態以與控制電腦交換資料。此意謂終端機上之用戶端軟體經組態以經由網路將語音信號傳輸至控制電腦並回應於此自控制電腦接收經校正文本之執行結果。終端機較佳呈攜帶型終端機形式。例如,終端機可為單板電腦,例如樹莓派電腦。例如,「樹莓派電腦上之Google助理」可安裝於終端機上且經組態以使得由終端機接收之語音信號被傳輸至控制電腦。控制電腦之位址因此指定並儲存於終端機中。此可為有利的,由於出於簡化與實驗室內之資料處理裝置及服務之相互作用的目的提供攜帶型且極其節約成本的終端機。有可能將此終端機定位於房間或實驗室中之任何所要點處。使用者亦可將終端機置於實驗室之其他房間中,或較大實驗室可以節約成本方式配備有複數個終端機。
根據本發明之實施例,目標詞彙由一組通用語言字詞組成。
根據本發明之其他實施例,目標詞彙由一組通用語言字詞及自其衍生之字詞組成。舉例而言,此等衍生字詞可為兩個或多於兩個通用語言字詞之動態形成的組合。舉例而言,在德語中,許多字詞,尤其名詞,藉由組合多個其他名詞形成。因而,例如字詞「Schiffsschraube」[船的螺旋槳]非常常用,因此其通常存在於大多數通用語言詞典中。另一方面,較不常用術語,諸如「Befestigungsschraube」[固定螺釘]在大多數通用語言詞典中不存在。一些語音至文本轉換系統亦可藉助於試探法及/或神經網路辨識字詞,諸如「Befestigungsschraube」,然而,其限制條件為個別字詞成分「Befestigung」及「Schraube」為目標詞彙之部分。就此而言,字詞「Befestigungsschraube」接著亦為此類型之語音至文本轉換系統之目標詞彙之部分。
根據本發明之其他實施例,目標詞彙由一組通用語言字詞組成,該組通用語言字詞由藉由組合經辨識音節形成之字詞補充。此等語音至文本轉換系統因此相對於可辨識哪些字詞較靈活,由於不僅個別字詞,至少亦可在個別音節之層級上進行辨識。然而,基於音節之辨識尤其亦易受錯誤影響,由於並不存在於任何已知詞彙中之字詞之不正確辨識之風險尤其高。由於所支援及/或已知音節集合之有限性質及藉由典型字詞長度對可組合音節集合之限制,可以基於音節之方式產生之目標字詞集合亦為有限的。支援字詞之基於音節之產生的語音至文本轉換系統因此亦具有有限目標詞彙,即使其靈活性較高。即使此類系統由於其靈活性在理論上能夠亦動態地辨識並不包括於先前已知詞典中之許多化學術語,辨識準確性實際上亦如此之低以至於此類系統相對於實踐最終亦具有不含有或支援此等化學術語之目標詞彙。
在本發明之一些實施例中,目標詞彙由一組通用語言字詞組成,該組通用語言字詞由自其衍生之字詞補充且由藉由組合經辨識音節而形成之字詞補充。此等轉換系統亦基於目標詞彙,其不含有技術字詞及在實際使用中無法以足夠的準確性辨識該等技術字詞,而是實際上不正確地辨識其他字詞,通常為通用語言字詞,並且將該等字詞轉換成文本。
如今已經可用之大量不同語音至文本轉換系統因此可用於根據本發明之實施例之方法,即使此等系統大體上僅「支援」日常語言字詞(亦即可以足夠的準確性正確地辨識該等字詞且可將其轉換成文本)。校正軟體並不系結至特定轉換系統。若特定技術方法隨時間推移證明為尤其準確且可靠的,則可使用此方法而不必再程式化終端機側上原始程式碼之基本組分。
根據本發明之實施例,技術語言字詞為來自以下類別中之一者之字詞:
- 化學物質,詳言之塗料及塗層或塗料及塗層行業中之添加劑之名稱;詳言之,根據化學命名慣例,例如根據IUPAC命名法,名稱亦係關於化學名稱;
- 化學物質之物理、化學、機械、光學或觸覺屬性;
- 化工中之實驗室裝置及裝置之名稱(例如,由使用者指派給實驗室中之實驗室裝置之商標名或適當名稱);
- 實驗室消耗品及實驗室裝備之名稱;
- 塗料及塗層行業中之商標名。
根據本發明之實施例,技術語言字詞為來自化學領域,詳言之化工,詳言之塗料及塗層之化學物質之字詞。
根據本發明之實施例,執行文本校正之裝置或電腦系統,亦即例如該終端機或該控制電腦或另一單獨校正電腦接收或計算由語音至文本轉換系統自語音信號產生之文本中字詞中之至少一些的頻率資訊。頻率資訊指示對於此文本中之每個字詞,可以統計方式預期此字詞之出現頻率。
當產生經校正文本時,僅根據指派表用技術語言字詞選擇性地取代根據所接收頻率資訊以統計方式預期之出現頻率低於預定義臨限值的所接收文本中來自目標詞彙之彼等字詞。
此可為有利的,由於來自使用者之語音輸入通常包含通用語言字詞與技術字詞之混合物。因此亦可產生以下情形:自轉換系統接收到之文本含有指派給指派表中之技術字詞且通常將被取代的來自目標詞彙之字詞。例如,所傳回文本可含有表達「聚合物創新」。由於此表達「聚合物創新」被指派給指派表中之技術字詞「聚合」,因此該表達在文本校正期間通常將用「聚合」取代。然而,若將表示高出現機率之頻率資訊之項目分配給表達「聚合物創新」,則校正軟體基於此出現頻率假定表達「聚合物創新」為正確的,即使此表達被指派給指派表中之技術字詞,且因此使表達「聚合物創新」在文本中保持不變。例如,對句子內或完整語音輸入內之字詞之上下文分析可揭露字詞「創新」時常單獨出現於文本中,例如因為該文本來自描述特定聚合物產品之優點之現場服務雇員。在此上下文中,表達「聚合物創新」亦可表示經正確地辨識之表達。在既未單獨提及聚合物亦未單獨提及創新之上下文中該機率降低。字詞自身亦已經具有不同出現機率,無關於上下文。
基於所接收文本中字詞之出現機率根據指派表取代字詞之實踐可為有利的,由於避免了以下情形:在幾個個別情況下,目標語言之字詞自身具有高出現機率或在各別文本之上下文中錯誤地用技術字詞取代,且產生錯誤而非藉由取代校正錯誤。
根據一個實施例,文本之字詞之出現頻率藉由語音至文本轉換系統計算且與文本一起藉由語音至文本轉換系統傳回至終端機或控制電腦。例如,語音至文本轉換系統可使用隱式馬爾可夫模型(HMM)來在句子上下文中計算特定字詞之出現機率。另外或替代地,語音至文本轉換系統可將字詞之出現頻率等同於字詞在較大參考正文中之出現頻率。例如,報紙中幾年來的所有各段文本或各段文本之另一較大資料集可用作參考正文。正文中經計數的字詞數目與正文中字詞之總數目的比率為在此參考正文中觀察到之此字詞之出現頻率。若文本校正係藉由單獨校正電腦進行,則根據本發明之實施例將頻率資訊自語音至文本轉換系統轉遞至校正電腦。
根據另一實施例,文本中字詞之出現頻率在接收文本之後藉由終端機計算。如上文已經描述,個別字詞或表達之出現機率可藉助於HMM考慮字詞之文本上下文或基於參考正文中字詞之頻率來計算。先前藉由終端機或藉由控制電腦自語音至文本轉換系統接收到之所有各段文本可例如用作參考正文。
根據實施例,頻率資訊因此藉助於隱式馬爾可夫模型計算(例如,藉由終端機或藉由校正服務)。例如,預期出現頻率,亦即出現機率可經計算為字詞序列中個別字詞之發射機率之乘積,例如描述於B. Cestnik之「估計機率 : 機器學習中之關鍵任務
(Estimating probabilities : A crucial task in machine learning
)」,在第九屆歐洲關於人工智慧之會議之論文集中,第147至150頁,瑞典斯德哥爾摩,1990年。
根據本發明之實施例,除文本之外,終端機或控制電腦亦接收用於由語音至文本轉換系統自語音信號產生之文本中字詞中之至少一些的詞性標籤(POS標籤)。POS標籤係自語音至文本轉換系統接收到且至少包含用於名詞、形容詞及動詞之標籤。POS標籤亦有可能包含額外類型之語法或語義標籤。所考慮之POS標籤之確切組合亦可取決於各別語言。技術語言字詞以與其POS標籤相關之方式儲存於指派表中。當產生經校正文本時,僅根據指派表用技術語言字詞取代對應於POS標籤的所接收文本中來自目標詞彙之彼等字詞。
此可為有利的,此係由於藉此提高文本校正步驟之準確性。指派表中之POS標籤可假定為正確的,由於該表中之條目藉助於在麥克風中輸入技術語言字詞或技術語言表達之一或多個說話者以半自動方式建立,所得音訊信號藉由語音至文本轉換系統轉換成來自目標詞彙之(不正確)字詞或(不正確)表達且此不正確字詞或此不正確表達以與技術語言表達相關之方式儲存於指派表中。由於已知技術語言字詞表示什麼及技術語言字詞為名詞、動詞抑或形容詞,例如,技術語言表達亦可在有機會產生或更新該表之情況下立即以與正確POS標籤相關之方式儲存。若文本中之特定字詞及特定表達必須因此根據指派表用技術語言字詞取代,但待取代之文本之POS標籤並不對應於技術語言字詞之POS標籤,則此為文本中之對應字詞有可能為正確的指示。POS標籤之辨識速率相對較高,結果為校正步驟之品質可藉由此措施而提高。例如,情況可為技術語言字詞例如為商標「Platilon®」。其表示來自Covestro公司之熱塑性聚胺基甲酸酯膜。在該表中,將POS標籤「名詞」指派給此技術字詞。語音至文本轉換系統知曉其常常已錯誤地將所說出之字詞「Platilon」轉換成目標詞彙字詞「Platin」[鉑],且因此將來自目標詞彙之字詞「Platin」指派給指派表中之技術字詞「Platilon」。然而,該字詞在使用者之當前語音輸入中已經用作形容詞:「Zugabe eines Platin-oder Zink-basierten Katalysators[...] (添加基於鉑或基於鋅之催化劑[...])」。基於藉由轉換系統傳回之文本中「Platin」之POS標籤,在此處有可能辨識到,字詞「Platin」在此處為正確的且並不意欲用「Platilon」取代。
根據本發明之實施例,該方法包含用於產生指派表之步驟。對於大量技術語言字詞中之每一者,記錄至少一個參考語音信號,其選擇性地表示此技術語言字詞。該參考語音信號來自至少一個說話者。亦對於技術語言表達,可分別藉由至少一個說話者說出並記錄至少一個參考語音信號,其選擇性地表示此技術語言表達。其他步驟對於字詞及表達大體上相同,結果為若參考以下技術語言字詞,則包括技術語言表達。將所記錄參考語音信號中之每一者輸入至語音至文本轉換系統中。詳言之,可經由網路,例如網際網路實現輸入。對於輸入參考語音信號中之每一者,輸入參考信號之裝置接收由語音至文本轉換系統自輸入參考語音信號產生之來自目標詞彙之至少一個字詞。此裝置可例如為終端機。然而,參考語音信號之記錄及最終用於形成或擴展指派表的來自目標詞彙之(不正確)字詞或表達之接收亦可藉由具有至語音至文本轉換系統之網路連接之任何所要其他裝置進行。參考語音信號較佳地經由自結構視角且相對於其相對於雜訊源之定位儘可能類似於終端機之裝置輸入,以便確保以可再現方式產生相同錯誤。來自目標詞彙之針對技術語言字詞中之每一者接收之至少一個字詞(其亦可為表達)表示不正確轉換,此係由於語音至文本轉換系統之目標詞彙不支援技術語言字詞。最後,該指派表作為表格產生,其將來自該目標詞彙之呈文本形式之該至少一個字詞指派給該等技術語言字詞中之每一者,對於該等技術語言字詞中之每一者,記錄至少一個參考語音信號,該至少一個字詞分別由該語音至文本轉換系統自包含此技術語言字詞之參考語音信號產生。
此可為有利的,由於可極易於修改及補充表而無需改變原始程式碼、重新編譯程式或重新訓練神經網路。即使使用另一語音至文本轉換系統,僅必須調適對應用戶端介面且該表中之技術語言表達必須由一或多個說話者經由麥克風再次輸入且傳輸至新語音至文本轉換系統。目標語言之由此新的系統傳回之不正確字詞及表達形成用於新的指派表之基礎。因此有可能在功能上擴展任何所要日常語言語音至文本轉換系統,而無需深入或複雜的改變且無需重新訓練語音軟體,以這種方式使得含有技術語言字詞及表達之所說出之各段文本亦被正確地轉換成文本。指派表可例如儲存為關係資料庫之表或製表符分隔文本檔案或另一功能上相當的資料結構。
根據本發明之實施例,複數個參考語音信號分別針對技術語言字詞(或技術語言表達)中之至少一些中之每一者記錄自不同說話者。該複數個參考語音信號表示此技術語言字詞(或此技術語言表達)。指派表將來自目標詞彙之呈文本形式之複數個字詞(或表達)指派給技術語言字詞(或表達)中之至少一些中之每一者。來自目標詞彙之該複數個字詞(或表達)表示藉由語音至文本轉換系統針對不同說話者基於其話音所產生之不正確轉換。
例如,特定技術語言字詞,諸如「1,2-亞甲基二氧苯」可由100個不同的人大聲地讀出且可分別使用麥克風記錄為參考語音信號。此等人較佳為熟悉化學表達之讀音的人。接著對於此一個物質名稱存在100個參考語音信號。此等100個參考語音信號中之每一者被傳輸至語音至文本轉換系統,且作為回應,傳回均未正確地表示實際技術語言名稱之來自目標詞彙之100個字詞或表達。所傳回之100個字詞將常常相同,但並非始終相同。不同人具有不同話音,亦即就重音、音量、音調及吐字而言,語音輸入不同。因此,特定語音至文本轉換系統有可能針對特定技術語言字詞(或特定技術語言表達)傳回均包括於指派表中之複數個不同的不正確字詞或表達。
出於形成指派表的目的考慮許多不同人的語音輸入可為有利的,由於因此較佳地應考慮人類話音之可變性且可因此實現改良錯誤校正。
根據本發明之一些實施例,進行文本校正之終端機或電腦系統經組態以經由揚聲器及/或顯示器將經校正文本輸出至使用者。此具有使用者再次具有檢查經校正文本之正確性之機會的優點。
根據本發明之一些實施例,進行文本校正之終端機或電腦系統經組態以將由執行系統提供之經校正文本之執行結果輸出至使用者。可例如藉由將結果以文本形式顯示於終端機之螢幕上而實現輸出。另外或替代地,經校正文本之執行結果可經由終端機之文本至語音介面及揚聲器輸出。
根據一個實施例,根據經校正文本執行功能之執行系統為軟體。
軟體可例如為化學物質資料庫。詳言之,此軟體可為資料庫管理系統(DBMS)及/或可與此DBMS互操作之外部軟體程式,其中該DBMS包含及管理化學資料庫。該軟體被設計成將經校正文本解譯為搜尋條目並判定及傳回關於資料庫中之搜尋條目之資訊。物質資料庫可例如為化學系統,例如HTE系統之部分。
另外或替代地,該軟體可為網際網路搜尋引擎,其被設計成將經校正文本解譯為搜尋條目並判定及傳回關於網際網路上之搜尋條目之資訊。
另外或替代地,該軟體可為模擬軟體。模擬軟體被設計成基於用於生產產品之預定義配方模擬化學產品,詳言之塗層及塗料之屬性。在此情況下,模擬軟體將經校正文本解譯為產品配方之規格,及/或解譯為產品屬性之規格,希望模擬產品之屬性。
另外或替代地,該軟體可為用於控制物質混合物,詳言之塗料及塗層之化學合成及/或生產的控制軟體。該控制軟體被設計成將經校正文本解譯為物質混合物之合成或組分之規格。
根據本發明之其他實施例,藉由終端機將經校正文本輸出至硬體組件。詳言之,硬體組件可為用於進行化學分析、化學合成之系統及/或用於生產物質混合物,詳言之塗料及塗層之系統。該系統被設計成將經校正文本解譯為物質混合物之合成或組分之規格或待進行之分析之規格。該系統可為高輸送量系統(HTE系統)以用於分析及生產塗料及塗層。例如,HTE系統可為用於自動地測試及自動地生產化學產品之系統,如WO 2017/072351 A2中所描述。
詳言之在生物或化學實驗室之上下文中將經校正文本輸出至軟體及/或硬體組件可極其有利,由於語音輸入經處理以這種方式使得其可直接轉遞至技術系統且可正確地由技術系統解譯而無需使用者例如出於此目的必須脫下分指手套或必須離開實驗室。例如,硬體組件可為化學或生物實驗室內部之裝置或裝置模組或電腦系統。例如,硬體組件可為用於進行化學分析或用於生產塗料及塗層之自動或半自動系統。
用於分析及/或合成化學產品,詳言之塗料及塗層之此系統可為HTE系統。
用於分析及/或合成化學產品之系統可例如被設計成回應於經校正文本經由機器至機器介面之輸入以全自動方式自動地進行以下工作步驟中之一或多者:
- 物質及物質混合物之流變分析;
- 物質及物質混合物之儲存穩定性之量測,詳言之基於液體物質混合物之非均質性及沈降傾向;例如,可在取樣之後基於光析槽中之光學量測結果進行此等分析;
- 物質及物質混合物之pH值判定;
- 物質及物質混合物之泡沫測試,詳言之消泡效果之量測及泡沫降解動力學之量測;
- 物質及物質混合物之黏度量測;黏度量測可包含自動稀釋步驟,詳言之在高度黏性物質或混合物之情況下,由於在稀釋溶液中可更易於判定黏度;基於稀釋溶液之黏度計算出原始物質或物質混合物之黏度;
- 物質或物質混合物,詳言之成品之摩擦行為(磨損測試)之量測;
- 基於例如在光散射下操作之分光光度計(所謂的L-A-B值)、混濁度及光澤度對物質及物質混合物之色彩值之量測;
- 在不同界定參數(溫度、濕度、平面之表面條件等)下對已經施加至平面之物質及物質混合物之層厚度量測;
- 物質及物質混合物之影像之影像分析方法,詳言之用於表徵物質表面,例如氣泡或刮擦在塗料及塗層中之數目、大小及分佈。
詳言之,物質及物質混合物可為用於生產塗料及塗層之物質及物質混合物。物質及物質混合物亦可為最終產品,例如呈液體及乾燥形式之塗料及塗層;及中間產品,例如顏料濃縮物、研磨樹脂及顏料漿,及所使用溶劑。
根據本發明之實施例,語音至文本轉換系統實施為經由網際網路提供至大量終端機之服務。藉助於實例,語音至文本轉換系統可為Google的雲端服務「語音至文本」。此可為有利的,因為存在用於其,例如用於NET的功能上強大的API用戶端程式庫。
此可為有利的,由於自語音信號至文本之運算密集型轉換過程並不進行於終端機上,而是實際上進行於伺服器,較佳地雲端伺服器上,該伺服器相較於終端機具有較高運算能力且被設計成用於大量語音信號至所辨識之各段文本之快速且並行轉換。
該終端機可例如為桌上型電腦、筆記型電腦、智慧型電話、平板電腦、整合於實驗室裝置中之電腦、在本端耦接至實驗室裝置之電腦或單板電腦(樹莓派電腦),詳言之具有麥克風及揚聲器(「智慧型揚聲器」)之單板電腦。實施根據本發明之實施例之方法之軟體邏輯可僅僅實施於終端機上或可以分佈方式實施於終端機及一或多個其他電腦,詳言之雲端電腦系統上。軟體邏輯較佳為獨立於裝置且較佳亦獨立於終端機之作業系統之軟體。
終端機較佳為在實驗室房間內部或以操作方式連接至實驗室房間內部之至少一個麥克風之裝置。
在另一態樣中,本發明係關於一種終端機。該終端機包含:
- 麥克風,其用於接收來自使用者之語音信號,其中該語音信號包含由該使用者說出之通用語言及技術語言字詞;
- 介面,其針對語音至文本轉換系統。此介面被設計成將所接收語音信號輸入至語音至文本轉換系統中。語音至文本轉換系統僅支援語音信號至不包含技術語言字詞之目標詞彙之轉換。該介面被設計成接收由該語音至文本轉換系統自該語音信號產生之一段文本。
- 資料記憶體,其含有呈文本形式之字詞之指派表。該指派表將來自目標詞彙之至少一個字詞指派至大量技術語言字詞或技術語言表達中之每一者。指派給技術語言字詞之至少一個字詞亦可為來自目標詞彙之一表達或一組字詞及表達。指派給技術語言字詞之來自目標詞彙之至少一個字詞為語音至文本轉換系統在以音訊信號形式輸入此技術語言字詞時錯誤地辨識(及在形成指派表時錯誤地辨識)之字詞或表達。
- 校正程式,其被設計成藉由根據該指派表使用技術語言字詞自動地取代該所接收文本中來自該目標詞彙之字詞及表達而產生經校正之一段文本;以及
- 輸出介面,其用於將經校正文本輸出至使用者及/或執行系統。執行系統為軟體及/或硬體組件並經組態以根據經校正文本中之資訊執行功能。
終端機較佳經組態以經由此介面或另一介面自軟體或硬體接收執行結果。
終端機較佳地亦包含輸出介面,例如聲學介面,例如揚聲器;或光學介面,例如顯示於顯示器上之圖形使用者介面(GUI)。然而,其亦可為另一介面,例如專有資料格式以用於與特定實驗室裝置互換文本資料。
在另一態樣中,本發明係關於一種包含根據此處所描述之實施例中之一者的一或多個終端機的系統。該系統亦包含語音至文本轉換系統。該語音至文本轉換系統包含:
- 介面,其用於自該一或多個終端機中之每一者接收語音信號;及
- 自動語音辨識處理器,其用於自所接收語音信號產生文本。語音辨識處理器僅支援語音信號至不包含技術語言字詞之目標詞彙之轉換。語音至文本轉換系統之該介面被設計成將由所接收語音信號產生之文本傳回至該終端機,自該終端機接收該語音信號。
根據詳言之文本校正並不藉由該終端機進行而是實際上藉由控制電腦或校正電腦進行之一些實施例,該系統亦包含控制電腦及/或校正電腦。
根據本發明之實施例,該系統亦包含根據經校正文本執行功能之軟體或硬體組件。
「詞彙」在此處被理解為意謂語言區,亦即可由實體,例如語音至文本轉換系統使用之一組字詞。
「字詞」在此處被理解為意謂在特定詞彙內出現並構成獨立語言單位之字元之連接序列。在自然語言中,一字詞相比於聲音或音節具有獨立含義。
「表達」在此處被理解為意謂包含兩個或更多個字詞之語言單位。
「技術語言字詞」或「技術字詞」在此處被理解為意謂來自技術字詞詞彙之字詞。技術語言字詞並不屬於目標詞彙且通常並非通用語言詞彙之部分。
語音至文本轉換系統僅支援語音信號至目標詞彙之轉換的表達意謂來自另一詞彙之字詞根本無法轉換成文本或僅在極高錯誤率情況下轉換成文本,其中該錯誤率高於對於待轉換之每個字詞或表達必須認為對於語音至文本之起作用轉換至多可容許之錯誤率界限值。例如,對於每個字詞或表達之高於50%之錯誤機率,此界限值較佳地可能已經高於10%。
POS標籤(或詞性標籤)在此處被理解為意謂特殊標記,其指派給文本正文中之每個字詞以便指示語言之該部分,且常常亦指示其他語法類別,諸如時態、數目(複數/單數)、大寫字母/小寫字母等。該特殊標記由此字詞在其各別文本上下文中表示。正文中所使用之一組所有POS標籤被稱作標籤集。不同語言之標籤集通常不同。基本標籤集含有用於最常用語言成分之標籤(例如,N用於名詞,V用於動詞,A用於形容詞等)。
「虛擬實驗室助理」為軟體或軟體常式,其以操作方式連接至實驗室中之一或多個實驗室裝置及/或軟體程式以這種方式使得可自此等實驗室裝置及實驗室軟體程式接收到資訊且用於執行功能之命令可自實驗室助理傳輸至實驗室裝置及實驗室軟體程式。實驗室助理因此具有用於與一或多個實驗室裝置及實驗室軟體程式互換資料並用於控制一或多個實驗室裝置及實驗室軟體程式之介面。實驗室助理亦具有針對使用者且經組態以使得使用者有可能經由此介面簡單地使用、監控及/或控制實驗室裝置及實驗室軟體程式的介面。例如,針對使用者之介面可呈聲學介面或自然語言文本介面形式。
「終端機」在此處被理解為意謂資料處理裝置(例如,PC、筆記型電腦、平板電腦、單板系統、樹莓派電腦、智慧型電話等)。該終端機較佳連接至網路連接。
根據本發明之實施例的「參考語音信號」為已經藉由麥克風記錄且係基於藉由說話者輸入至麥克風中之語音輸入的語音信號,這並非出於操作軟體或硬體的目的而是實際上為了使得有可能形成或補充指派表。語音輸入為所說出的技術語言字詞或所說出的技術語言表達,其經記錄以便將對應語音信號轉遞至語音至文本轉換系統,且作為回應,自轉換系統接收係基於不正確轉換的來自目標詞彙之字詞或表達。
圖 1
展示用於含有技術語言字詞之各段文本之語音至文本轉換之電腦實施方法的流程圖。該方法之特定優點在於現有語音至文本轉換系統可用於甚至在此轉換系統根本不支援技術語言詞彙時將含有技術字詞之各段文本辨識及轉換為精確的。該方法可單獨藉由一個終端機或藉由一終端機及其他資料處理裝置,例如控制電腦及/或經由網路提供校正服務之電腦來進行。可實施根據本發明之實施例之方法的分佈式及非分佈式資料處理系統之一些可能架構說明於圖2、圖3及圖4中。有時在描述圖1中之流程圖時亦參考此等圖式。
該方法通常可在化學或生物實驗室之上下文中使用。實驗室含有多個個別分析裝置及高輸送量系統(高輸送量環境/HTE系統)。HTE系統包含大量單元及模組,其可基於使用者輸入之配方分析及量測物質及物質混合物之不同化學或物理參數且可組合及合成大量不同化學產品。實驗室亦含有一終端機,例如屬於實驗室工作者之筆記型電腦,具有呈瀏覽器外掛程式形式之適合的軟體。HTE系統包含儲存例如塗料及塗層之配方及其起始材料及其各別物理、化學、光學及其他屬性的內部資料庫。資料庫亦可儲存其他相關資料,例如來自物質之製造商的產品資料表、安全性資料表、用於組態HTE系統之個別模組以用於分析或合成特定物質或產品之參數等等。HTE系統被設計成基於以本文形式輸入之配方及指令進行分析及合成。
實驗室房間號為22之實驗室內部之頻繁活動例如係關於以下活動且因此係關於實驗室工作者202之相關聯可能語音輸入以便提示軟體或硬體執行操作:
- 實驗室工作者在前一日開始相對於特定塗層之流變屬性對特定塗層進行分析且現在想要擷取儲存於HTE系統之資料庫中之結果。可能語音輸入:「控制電腦請展示房間 22 中 HTE 系統自 2019 年 2 月 24 日之 流變分析之結果
(CONTROL COMPUTER show me the results of the rheological analysis from 24 February 2019 by the HTE system in room 22
)」。
- 實驗室工作者想要節約成本並考慮藉由較節約成本的溶劑<<LMGÜNSTIG>>取代特定溶劑<<LMTEUER>>。名稱<<LMGÜNSTIG>>為製造商之商標。然而,實驗室工作者並不確定較節約成本的溶劑是否適合於意欲生產之塗層,且想要查看產品資料表,其中指定了節約成本的溶劑之化學及物理屬性之其他細節。可能語音輸入:「控制電腦請展示 << LMG Ü NSTIG >> 之產品資料表
(CONTROL COMPUTER show me the product data sheet of << LMG Ü NSTIG >>
)」或「控制電腦請展示儲存於房間 22 之 HTE 資料庫中的 << LMG Ü NSTIG >> 之產品資料表
(CONTROL COMPUTER show me the product data sheet of << LMG Ü NSTIG >> stored in the HTE database of room 22
)」。
- 在檢查溶劑<<LMGÜNSTIG>>之產品資料表之後,實驗室工作者認為出於生產特定塗層的目的該溶劑有可能取代較昂貴溶劑使用。然而,可假定,由於複數個參數,例如pH值、流變屬性、極性及其他參數不同於較昂貴溶劑,因此必須略微調適配方。由於此等屬性彼此相互作用,因此不可能手動識別對配方之必要調適。測試序列之執行為勞動密集型且耗時的。然而,實驗室具有可自特定配方開始預測(模擬)例如塗料及塗層等化學產品之屬性的軟體。模擬可例如基於迴旋神經網路(CNN)。實驗室工作者想要使用此模擬軟體來基於已經藉由便宜的溶劑取代昂貴溶劑的已知配方模擬塗層之可能屬性。可能語音輸入:「控制電腦請提示 HTE 模擬軟體計算具有以下配方之塗層之屬性 : 70 . 2 g 環烷油、 4 g 甲基正戊基酮、 1 . 5 g 丙酸正戊酯、 1 g Ultrasorb 、 50 g << LMG Ü NSTIG >>
(CONTROL COMPUTER prompt the HTE simulation software to calculate the properties of a coating with the following recipe
:70 . 2 g naphthenic oil , 4 g methyl
n-amyl ketone , 1 . 5 g n - pentyl propionate , 1g Ultrasorb , 50 g
<<LMGÜNSTIG>>)」。
- 該模擬揭露便宜的溶劑並不適合於生產塗層。實驗室雇員現想要在網際網路上搜尋可取代昂貴溶劑而不會降低產品品質以便降低成本的其他溶劑。可能語音輸入:「控制電腦請在網際網路上搜尋 : << 用於生產塗層之高黏性溶劑 >>
(CONTROL COMPUTER search on the Internet :
<<highly
viscoussolvents for producing coating
s>>)」。
根據本發明之實施例,可針對各別執行系統產生所有此等輸入及命令而無需使用者出於此目的必須離開實驗室房間及/或脫下分指手套。
在第一步驟102中,實驗室工作者202於終端機212、312之麥克風214中生成語音輸入204。語音輸入可由例如上文所提及之語音命令中之一者組成。語音輸入通常包含通用語言及技術語言字詞及表達兩者。例如,字詞或表達「流變」、「環烷油
」、「甲基正戊基酮
」、「丙酸正戊酯
」為化學技術術語且<<LMGÜNSTIG>>為化學產品之商標。此等字詞或表達通常不含於共同通用語言語音至文本轉換系統所支援之詞彙(「目標詞彙」)中。
麥克風214將語音輸入轉換成電子語音信號206。此語音信號接著在步驟104中被輸入至語音至文本轉換系統226中。
如圖2中所示,該終端機可具有例如介面224及例如來自Google、Apple、Amazon或Nuance之用於已知通用語言語音至文本轉換系統226中之一者的對應用戶端應用程式222。此用戶端應用程式222直接經由介面224將語音信號傳輸至語音至文本轉換系統226。然而,在其他實施例中,語音信號亦有可能經由一或多個插入資料處理裝置傳輸至語音至文本轉換系統226。根據圖3及圖4中所說明之本發明之實施例,語音信號首先被傳輸至控制電腦314、414,其接著經由網路236將此信號轉遞至語音至文本轉換系統226。網路可例如為網際網路。
控制電腦系統314、414相對於語音信號及由語音信號之處理產生之文本之管理及處理進行協調及控制活動。控制電腦314為自身進行文本校正之資料處理系統。控制電腦414亦已將此運算步驟移動至另一資料處理系統。
語音至文本轉換系統226為通用語言轉換系統,亦即其僅支援語音信號至不包含語音輸入204之技術語言字詞之通用語言目標詞彙234之轉換。
語音至文本轉換系統現基於該目標詞彙將語音信號轉換成一段文本。語音至文本轉換系統226通常為雲端服務,其可以並行方式處理來自複數個終端機之大量語音信號且可經由網路將語音信號傳回至複數個終端機。然而,取決於如何實施語音至文本轉換系統,所產生文本當然含有或在很高機率下將含有錯誤辨識字詞及表達,由於語音輸入204之字詞及表達中之至少一些由技術語言字詞或表達組成,而轉換系統僅支援不含有技術語言字詞及表達之目標詞彙。
在步驟106中,將語音信號206傳輸至語音至文本轉換系統226之資料處理系統接收由該信號產生之文本208以作為來自語音至文本轉換系統之回應。充當接收器(「接收器系統」)之資料處理系統可因此取決於如圖3中所示之系統架構、終端機或控制電腦314或如圖4中所示之控制電腦414。
在另一步驟110中,指派表238用於校正所接收文本。進行文本校正之資料處理系統根據其功能在此處亦被稱作「校正系統」。取決於實施例,此可為終端機212或控制電腦系統314或校正電腦系統402。若接收器系統及校正系統並不相同,則將藉由接收器系統接收之文本208轉遞至校正電腦系統。
將呈文本形式之字詞在指派表238中指派給彼此。更精確而言,指派表將來自目標詞彙之至少一個字詞指派給大量技術語言字詞或技術語言表達中之每一者。指派給技術語言字詞(或技術語言表達)之來自目標詞彙之至少一個字詞為在將此技術語言字詞以音訊信號形式輸入至語音至文本轉換系統中時藉由語音至文本轉換系統錯誤地辨識(且在形成該表期間已經較早地錯誤辨識)之字詞或表達。
在步驟110中,校正系統212、314、402由來自轉換系統226之不正確文本208產生經校正之一段文本210。由校正系統藉由根據指派表238使用技術語言字詞取代所接收文本208中來自目標詞彙之字詞及表達自動地產生經校正文本。
若校正系統為校正電腦,如圖4中所示,則將經校正文本傳回至控制電腦。
終端機或控制電腦在步驟112中直接地或間接地將經校正文本210輸入至執行系統240中。不同執行系統之實例說明於圖5中。執行系統、軟體及/或硬體組件根據經校正文本執行軟體及/或硬體功能並傳回結果242。該結果可例如直接傳回至終端機或可經由作為中間站點之控制電腦傳回至終端機。然而,替代地或另外,該結果亦可傳回至其他終端機及其他資料處理系統。
在圖3及圖4中所說明的實施例中,充當校正系統之控制電腦314將經校正文本傳輸至執行系統240,自該執行系統接收執行之結果242,並將此結果轉遞至終端機以供輸出至使用者202。該結果通常為一段文本,例如用於合成在資料庫中搜尋之化學物質之配方;在資料庫中或網際網路上所判定之文獻,例如物質之產品資料表;根據經校正文本中之資訊進行的化學分析或合成已經成功地結束的確認(或情況並非如此時的對應錯誤消息)。
最後,終端機或另一資料處理系統可將由軟體及/或硬體組成之執行系統240之功能執行結果輸出至使用者202。軟體及/或硬體較佳地為經設計於實驗室內部或特定地針對實驗室內部之活動設計的軟體及硬體或可至少用於此目標。
例如,終端機212可包含揚聲器或可以通信方式耦接至揚聲器且可經由此揚聲器以聲學形式輸出該結果。另外或替代地,終端機可包含用於將結果輸出至使用者之螢幕。其他輸出介面亦為可能的,例如基於藍芽之組件。
例如,根據本發明之實施例之方法可用於藉助於語音控制實施對電子裝置,詳言之實驗室儀器及HTE系統之語音控制。語音控制亦可用以搜尋及輸出已經在實驗室中進行之分析及合成之結果、實驗室協定及實驗室之對應資料庫中之產品資料表,並亦可用以在網際網路上及在可經由網際網路存取之公共或專有資料庫中以語音受控方式進行補充搜尋。包含化學物質或實驗室裝置或實驗室消耗品之特殊商標名及/或呈化學技術語言之名稱及形容詞的語音命令亦被正確地轉換成文本且可因此藉由執行系統正確地解譯。根據本發明之實施例,因此啟用化學或生物實驗室或實驗室HTE系統之基本上語音經控制的高度整合操作。語音輸入中之字詞「控制電腦」可表示例如用於實驗室中之裝置及/或實驗室之HTE系統之基於語音之操作的虛擬助理502之名稱。對於日常問題,與虛擬助理Alexa及Siri以類似方式,字詞「控制電腦」(或有可能更能使人聯想到人之任何所要其他名稱,諸如「EVA」)可用作觸發信號以便提示此實驗室助理之文本評估邏輯評估經校正文本。實驗室助理經組態以檢查所接收之每段文本以便判定其是否含有其名稱及是否有可能含有其他關鍵詞。若情況如此,則進一步分析經校正文本以便辨識及執行其中經寫碼之命令。
根據一個實施例,基於輸入至實驗室裝置或HTE系統中之經校正文本所判定之結果資料經由實驗室房間內部之揚聲器輸出。例如,揚聲器可為係接收來自使用者之語音輸入之終端機之部分的揚聲器。然而,揚聲器亦可為以通信方式連接至此終端機之另一揚聲器。此具有以下優點:實驗室工作者可藉由他的話音無縫地輸入命令,例如以便迅速發現分析結果、產品資料表或其他上下文資訊以用於化學分析、合成及產品。此語言搜尋請求之結果經由揚聲器以聲學方式輸出。使用者可使用所聽到之資訊來製定其他搜尋命令及/或考慮到以聲學方式輸出之搜尋結果於麥克風中說出語音命令以用於進行分析或合成。聲學輸入及輸出之此循環可重複若干次而不需要經由鍵盤輸入資料或命令。然而,實驗室程序明顯可更高效。
在塗料及塗層之化學合成之上下文中,由於需要各種起始材料來生產塗料及塗層,因此關於化學物質及對實驗室裝置及HTE系統之基於語音之控制的資訊之高效收集尤其有利,在此情況下起始材料之屬性以複雜方式彼此相互作用並大大影響產品之屬性。因此在生產塗料及塗層之上下文中產生大量分析、控制步驟及測試序列。塗料及塗層為多達20種原材料等之高度複雜混合物,例如溶劑、樹脂、硬化劑、顏料、填料及多種添加劑(分散劑、濕潤劑、黏著促進劑、消泡劑、殺生物劑、阻燃劑等)。高效地獲取關於個別組件及用於控制對應分析及合成系統之資訊可顯著加速產品之生產過程及品質保證。
圖 2
展示用於含有技術語言字詞之各段文本之語音至文本轉換之分佈式系統200的方塊圖。
系統300及其組件之基本功能已經相對於圖1進行描述。終端機212可例如為筆記型電腦、標準電腦、平板電腦或智慧型電話。可與現有通用語言語音至文本轉換系統226互操作之用戶端軟體222安裝於終端機上。例如,語音至文本轉換系統226為經由網際網路將此轉換提供為經由對應語音至文本介面(S2T介面) 224之服務的雲端電腦系統。該服務為軟體程式232,其實施於伺服器側上自從功能觀點而言係對應於語音辨識及語音轉換處理器。例如,軟體程式232可為Google的語音至文本雲端服務。在此情況下,介面224因此為Google之基於雲端之API。
在圖2中所說明的實施例中,終端機具有指派表238及足夠的電腦功率以自身進行基於該表對由語音至文本轉換系統226產生之文本208之校正。將語音信號206傳輸至伺服器226、自伺服器226接收文本208及校正文本以便形成經校正文本210可因此實施於用戶端程式222中。用戶端程式222可例如為可經由介面224與伺服器軟體232互操作之瀏覽器外掛程式或獨立應用程式。
圖 3
展示用於語音至文本轉換之另一分佈式系統300之方塊圖。
系統300及其組件之基本功能已經相對於圖1及圖2進行描述。系統300之系統架構不同於系統200之架構,使得終端機310已將文本校正功能移動至控制電腦314。安裝於終端機312上之此處被稱作控制用戶端之用戶端軟體316可與安裝於控制電腦314上之對應控制程式320互操作。終端機經由網路236,例如網際網路連接至控制電腦314。控制介面318用於在控制用戶端316與控制程式320之間交換資料。
控制電腦314可例如為標準電腦。然而,控制電腦較佳為伺服器或雲端電腦系統。
安裝於控制電腦上之控制程式320一方面實施協調功能322以便協調資料(語音信號206、所辨識文本208、經校正文本210)在各種資料處理裝置(終端機、控制電腦、語音至文本轉換系統)之間的交換。另一方面,在此處展示之實施例中,控制程式320實施藉由系統200中之終端機執行的文本校正功能324。校正功能324涉及根據指派表238藉由技術語言字詞及表達取代所接收文本208中來自目標詞彙之字詞及表達。另外,在取代過程中亦可考慮藉由控制電腦314計算出的或所接收到的出現機率及/或POS標籤以及經由語音至文本介面244來自語音至文本轉換系統226之文本208。在此實施例中僅控制與轉換系統226之資料交換而並不進行文本校正之語音用戶端222可實施為控制程式320之部分。然而,控制程式320及用戶端222亦有可能為單獨但可彼此互操作的程式。
圖3中所說明的架構具有終端機不一定必須執行任何運算密集型操作的優點。語音信號至文本之轉換及此文本之校正兩者均由其他資料處理系統進行。終端機312之功能大體上限於接收語音信號206、將語音信號轉遞至藉由已知位址所界定的控制電腦314,及輸出在根據經校正文本進行功能後由執行系統傳回之結果。
圖 4
展示用於語音至文本轉換之另一分佈式系統400之方塊圖。
系統400及其組件之基本功能已經相對於圖1、圖2及圖3進行描述。系統400之系統架構不同於系統300之架構,使得控制電腦414並不自身進行文本校正,但實際上文本校正可由在此處被稱作「校正電腦」或「校正伺服器」402之另一電腦進行,其中另一電腦402經由網路及單獨介面406以可互操作方式連接至控制電腦之控制程式320。
此架構可為有利的,由於可呈雲端系統形式之單獨電腦或電腦集群用於文本校正。此有助於存取權限之單獨分配。控制電腦414上之控制程式320可具有例如對於在例如藉助於HTE系統分析及合成實驗室中之化學物質及物質混合物的過程中所產生之不同的部分敏感資料的全面存取權限。根據本發明之實施例,控制電腦414可具有機器至機器介面,例如以便直接將呈控制命令形式之經校正文本傳輸至實驗室裝置或HTE系統或傳輸至其資料庫以便基於經校正文本210在此處起始分析、化學合成或搜尋。對於控制電腦414之安全且嚴格的存取保護因此尤其重要。
校正伺服器402在系統400之架構之上下文中僅用以校正由語音至文本轉換系統226產生並傳回至控制程式320之文本208。根據本發明之實施例,准許存取校正伺服器402,例如以便更新表238並添加其他技術字詞及技術表達的使用者因此無法對控制電腦414進行任何讀取及/或寫入存取。因此,有可能連續更新指派表及因此文本校正而不需要授予負責此目標之人員對實驗室之敏感控制邏輯及資料資源的全面存取權限。
分佈式系統300、400之終端機312可例如為電腦、筆記型電腦、智慧型電話等。然而,終端機亦有可能為在運算上相對較弱的單板電腦,例如樹莓派系統。
已知語音至文本雲端服務提供商之硬體(智慧型揚聲器)追求直接控制及使用由雲端提供商自身開發之服務的目標。在技術詞彙領域中之用途當前尚未開發或僅已開發至極其受限程度。
此處展示之所有系統架構200、300、400及500使得有可能獨立於雲端提供商藉助於專有硬體使用各種雲端提供商之現有語音至文本API以便基於其實現實驗室中實驗室裝置及電子搜尋服務之專家語音辨識及控制。
圖 5
展示用於在化學實驗室上下文中之語音至文本轉換之另一分佈式系統500之方塊圖。實驗室包含具有習知安全性規定之實驗室區域504。該實驗室區域含有各種個別實驗室裝置516,例如離心機,及HTE系統518。HTE系統包含由控制器520管理及控制之大量模組及硬體單元506至514。控制器相對於外部用作中心介面以用於監控及控制含於HTE系統中之裝置。控制電腦414上之控制程式320包含實施虛擬實驗室助理之軟體模組502。
經校正之一段文本210由使用者202以已經根據本發明之實施例所描述之方式自語音輸入204產生。在控制程式320已自校正電腦402接收經校正文本之後,控制程式評估文本並搜尋關鍵字,例如「控制電腦」或「EVA」。若經校正文本含有此關鍵字,則提示虛擬實驗室系統502進一步分析經校正文本以便判定經校正文本是否包含用於進行硬體或軟體功能之命令,且若包含該等命令,則判定希望哪一硬體或軟體在實驗室助理502的控制下執行此等命令。例如,經校正文本可含有指定希望將命令轉遞至的裝置及軟體的裝置或實驗室房間之名稱。
在一個可能的例示性實施中,由虛擬實驗室助理對經校正文本210之評估揭露網際網路搜尋引擎528希望搜尋經校正文本210中所指定之特定物質以作為技術語言字詞或表達。經校正文本或經校正文本之特定部分由虛擬助理502經由網際網路輸入至搜尋引擎中。將網際網路搜尋之結果524傳回至助理502,該助理將結果轉遞至使用者202附近之合適的輸出裝置,例如終端機312,其中經由例如揚聲器或螢幕218輸出結果。
在另一可能的例示性實施中,由虛擬實驗室助理對經校正文本210之評估揭露實驗室裝置512、離心機希望在特定速度下粒化特定物質。離心機及物質之名稱在經校正本文210中指定為足夠的技術語言字詞或表達,此係由於離心機基於物質名稱自內部資料庫自動讀取待使用之離心參數,諸如持續時間及轉速。經校正文本或經校正文本之特定部分由虛擬助理502經由網際網路傳輸至離心機512。離心機開始屬於物質之離心程式並將關於成功或不成功離心之消息作為文本消息522傳回。將結果522傳回至助理502,該助理將該結果轉遞至合適的輸出裝置,例如終端機312,其中經由例如揚聲器或螢幕218輸出該結果。
在另一可能的例示性實施中,由虛擬實驗室助理對經校正文本210之評估揭露HTE系統518希望合成特定塗層。塗層之組分同樣地在經校正本文中指定並且由化學產品之商標名與IUPAC物質名稱之混合物組成。HTE系統接收經校正文本210並自主地決定在合成單元514中進行合成。關於成功合成之消息或錯誤消息藉由合成單元514傳回至HTE系統518之控制器以作為結果526,且控制器繼而將結果526傳回至虛擬實驗室助理592,該助理將該結果轉遞至合適的輸出裝置,例如終端機312,其中經由例如揚聲器或螢幕218輸出該結果。
102~112:步驟
200:分佈式系統
202:使用者
204:語音輸入
206:語音信號
208:所辨識文本
210:經校正文本
212:終端機
214:麥克風
216:一或多個處理器
218:螢幕
220:儲存媒體
222:用戶端程式
224:介面(用戶端側)
224':介面(伺服器側)
226:語音至文本轉換系統/雲端系統
228:一或多個處理器
230:儲存媒體
232:語音辨識處理器
234:目標詞彙
236:網路
238:指派表
240:執行系統(軟體及/或硬體)
242:經校正文本之執行結果(呈文本形式)
300:分佈式系統
312:終端機
316:控制程式之用戶端軟體
318:控制程式之介面
320:控制程式
322:協調功能
324:文本校正功能/文本校正程式
400:分佈式系統
402:校正伺服器/文本校正雲端系統
404:文本校正程式之用戶端軟體
406:文本校正程式之介面
414:控制電腦
500:分佈式系統
502:虛擬實驗室助理
504:實驗室區域
506:分析裝置
508:分析裝置
510:混合器
512:合成單元
514:合成單元
516:獨立實驗室裝置
522:經校正文本之執行結果(文本形式)
524:經校正文本之執行結果(文本形式)
526:經校正文本之執行結果(文本形式)
528:網際網路搜尋引擎
本發明之實施例在以下圖式中以例示性方式更詳細地解釋:
圖1展示用於含有技術語言字詞之各段文本之語音至文本轉換之方法的流程圖;
圖2展示用於含有技術語言字詞之各段文本之語音至文本轉換之分佈式系統的方塊圖;
圖3展示用於語音至文本轉換之另一分佈式系統之方塊圖;
圖4展示用於語音至文本轉換之另一分佈式系統之方塊圖;且
圖5展示用於在實驗室上下文中之語音至文本轉換之另一分佈式系統之方塊圖。
200:分佈式系統
202:使用者
204:語音輸入
206:語音信號
208:所辨識文本
210:經校正文本
212:終端機
214:麥克風
216:一或多個處理器
218:螢幕
220:儲存媒體
222:用戶端程式
224:介面(用戶端側)
224':介面(伺服器側)
226:語音至文本轉換系統/雲端系統
228:一或多個處理器
230:儲存媒體
232:語音辨識處理器
234:目標詞彙
236:網路
238:指派表
240:執行系統(軟體及/或硬體)
242:經校正文本之執行結果(呈文本形式)
Claims (16)
- 一種用於語音至文本轉換之電腦實施方法,其包含: 藉助於一終端機(212)接收(102)來自一使用者(202)之一語音信號(206),其中該語音信號包含該使用者說出之通用語言及技術語言字詞; 將該所接收語音信號輸入(104)至一語音至文本轉換系統(226)中,其中該語音至文本轉換系統僅支援語音信號至不包含該等技術語言字詞之一目標詞彙(234)之轉換; 自該語音至文本轉換系統接收(106)由該語音至文本轉換系統自該語音信號產生之一段文本(208); 藉由根據呈文本形式之字詞之一指派表(238)使用技術語言字詞自動地取代該所接收文本中來自該目標詞彙之字詞及表達而產生(110)經校正之一段文本(210),其中該指派表將來自該目標詞彙之至少一個字詞指派給大量技術語言字詞中之每一者,其中若一技術語言字詞以一音訊信號形式經輸入,則指派給此技術語言字詞之來自該目標詞彙之該至少一個字詞為由該語音至文本轉換系統錯誤辨識之一字詞或一表達;以及 將該經校正文本輸出(112)至該使用者及/或軟體(528,240)及/或一硬體組件(506至516,240),其中該軟體或硬體組件經組態以根據該經校正文本中之資訊執行一功能。
- 如請求項1之電腦實施方法,其中藉由一校正系統產生該經校正文本,其中該校正系統為該終端機(210)或經由一網路以操作方式連接至該終端機之一校正電腦系統(314,402)。
- 如前述請求項中之一項之電腦實施方法, 其中該目標詞彙由一組通用語言字詞組成;或 其中該目標詞彙由一組通用語言字詞及自該組通用語言字詞衍生之字詞組成;或 其中該目標詞彙由一組通用語言字詞組成,該組通用語言字詞由自其衍生之字詞補充及/或由藉由組合辨識音節所形成之字詞補充。
- 如請求項1或2之電腦實施方法,其中該等技術語言字詞為來自以下類別中之一者的字詞: 化學物質,詳言之塗料及塗層或塗料及塗層行業中之添加劑之名稱; 化學物質之物理、化學、機械、光學或觸覺屬性; 實驗室裝置及化工裝置之名稱; 實驗室消耗品及實驗室裝備之名稱; 該塗料及塗層行業中之商標名。
- 如請求項1或2之電腦實施方法,其亦包含: 接收或計算頻率資訊,其中該頻率資訊指示對於由該語音至文本轉換系統自該語音信號產生之該文本中該等字詞中之至少一些,可以統計方式預期此字詞之出現頻率; 其中當產生該經校正文本時,僅根據該指派表用技術語言字詞取代根據該所接收頻率資訊以統計方式預期之出現頻率低於一預定義臨限值的該所接收文本中來自該目標詞彙之彼等字詞。
- 如請求項5之電腦實施方法, 其中藉助於一隱式馬爾可夫模型計算該頻率資訊。
- 如請求項1或2之電腦實施方法,其亦包含: 接收用於由該語音至文本轉換系統自該語音信號產生之該文本中該等字詞中之至少一些的詞性標籤-POS標籤,其中該等POS標籤至少包含名詞、形容詞及動詞之標籤; 其中該指派表中之該等技術語言字詞與該等技術語言字詞之詞性標籤一起儲存; 其中當產生該經校正文本時,僅根據該指派表用技術語言字詞取代對應於POS標籤的該經接收文本中來自該目標詞彙之彼等字詞。
- 如請求項1或2之電腦實施方法,其亦包含: 對於大量技術語言字詞中之每一者,記錄來自至少一個說話者之至少一個參考語音信號,其選擇性地表示此技術語言字詞; 將該等參考語音信號中之每一者輸入至該語音至文本轉換系統中; 對於已經輸入之該等參考語音信號中之每一者,自該語音至文本轉換系統接收來自該目標詞彙之至少一個字詞,其由該語音至文本轉換系統自該輸入參考語音信號產生,其中來自該目標詞彙之該等所接收字詞中之每一者由於該語音至文本轉換系統之該目標詞彙並不支援該等技術語言字詞而表示一不正確轉換; 其中該指派表將來自該目標詞彙之呈文本形式之該至少一個字詞指派給該等技術語言字詞及表達中之每一者,對於該等技術語言字詞及表達中之每一者,記錄至少一個參考語音信號,該至少一個字詞分別由該語音至文本轉換系統自包含此技術語言字詞之該參考語音信號產生。
- 如請求項8之電腦實施方法, 其中對於該等技術語言字詞中之至少一些中之每一者,複數個參考語音信號在每種情況下由不同說話者說出並經記錄,其中該複數個參考語音信號表示此技術語言字詞; 其中該指派表將來自該目標詞彙之呈文本形式之複數個字詞指派給該等技術語言字詞中之至少一些中之每一者,其中來自該目標詞彙之該複數個字詞表示由該語音至文本轉換系統針對該等不同說話者基於該等不同說話者之話音所產生的不正確轉換。
- 如請求項1或2之電腦實施方法,其中將該經校正文本輸出至該使用者且該輸出包含: 在該終端機之一螢幕(218)上顯示該經校正文本;及/或 經由該終端機之一文本至語音介面及一揚聲器輸出該經校正文本。
- 如請求項1或2之電腦實施方法,其中將該經校正文本輸出至該軟體,其中該軟體選自包含以下各項之一群組: 一化學物質資料庫,其被設計成將該經校正文本解譯為一搜尋條目且判定並傳回關於該資料庫中之該搜尋條目之資訊;及/或 一網際網路搜尋引擎,其被設計成將該經校正文本解譯為一搜尋條目且判定並傳回關於該網際網路上之該搜尋條目之資訊;及/或 模擬軟體,其被設計成基於一預定義配方模擬化學產品,詳言之塗層及塗料之屬性,其中該模擬軟體被設計成將該經校正文本解譯為一產品之一配方之規格,該產品之該等屬性意欲被模擬; 控制軟體,其用於控制物質混合物,詳言之塗料及塗層之化學合成及/或生產,其中該控制軟體被設計成將該經校正文本解譯為該物質混合物之該合成或組分之一規格。
- 如請求項1或2之電腦實施方法,其亦包含: 經由該終端機之一揚聲器或一顯示器藉助於該軟體或硬體組件輸出執行該功能之一結果。
- 如請求項1或2之電腦實施方法, 其中將該經校正文本輸出至該硬體組件, 其中該硬體組件為用於進行化學分析、化學合成及/或用於生產物質混合物,詳言之塗料及塗層之一系統, 其中該系統被設計成亦將該經校正文本解譯為該物質混合物之該合成或該等組分之一規格或該分析之一規格。
- 如請求項1或2之電腦實施方法, 其中該語音至文本轉換系統被實施為經由該網際網路對大量終端機提供之一服務;及/或 其中該終端機為一桌上型電腦、一筆記型電腦、一智慧型電話、整合於一實驗室裝置中之一電腦、在本端耦接至一實驗室裝置之一電腦,或一單板電腦(樹莓派電腦)。
- 一種終端機(212),其包含: 一麥克風(214),其用於接收來自一使用者之一語音信號(206),其中該語音信號包含由該使用者說出之通用語言及技術語言字詞; 一介面(224),其針對一語音至文本轉換系統(226), 其中該介面被設計成將該所接收語音信號輸入至該語音至文本轉換系統中,其中該語音至文本轉換系統僅支援語音信號至不包含該等技術語言字詞之一目標詞彙(234)之轉換;且 其中該介面被設計成接收由該語音至文本轉換系統自該語音信號產生之一段文本(208); 一資料記憶體(220),其具有呈文本形式之字詞之一指派表(238),其中該指派表將來自該目標詞彙之至少一個字詞指派給大量技術語言字詞中之每一者,其中若一技術語言字詞以一音訊信號形式經輸入,則指派給此技術語言字詞之來自該目標詞彙之該至少一個字詞為由該語音至文本轉換系統錯誤辨識之一字詞或一表達; 一校正程式(222),其被設計成藉由根據該指派表使用技術語言字詞自動地取代該所接收文本中來自該目標詞彙之字詞及表達而產生經校正之一段文本(210);以及 一輸出介面(218),其用於將該經校正文本輸出(112)至該使用者及/或軟體(528,240)及/或一硬體組件(506至516,240),其中該軟體或該硬體組件經組態以根據該經校正文本中之資訊執行一功能。
- 一種系統,其含有如請求項15之一或多個終端機(212),亦包含一語音至文本轉換系統(226),其中該語音至文本轉換系統包含: 一介面(224'),其用於自該一或多個終端機中之每一者接收語音信號(206); 一自動語音辨識處理器(232),其用於自一所接收語音信號(206)產生文本(208),其中該語音辨識處理器僅支援語音信號至不包含該等技術語言字詞之一目標詞彙(234)之轉換;且 其中該介面被設計成將由一所接收語音信號產生之該文本(208)傳回至該終端機,自該終端機接收該語音信號。
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| EP19163510.1 | 2019-03-18 | ||
| EP19163510 | 2019-03-18 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| TW202046292A true TW202046292A (zh) | 2020-12-16 |
| TWI742562B TWI742562B (zh) | 2021-10-11 |
Family
ID=65818364
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| TW109108492A TWI742562B (zh) | 2019-03-18 | 2020-03-13 | 不支援之技術語言之語音至文本轉換 |
Country Status (7)
| Country | Link |
|---|---|
| US (1) | US20220270595A1 (zh) |
| EP (1) | EP3942549A1 (zh) |
| JP (1) | JP2022526467A (zh) |
| CN (1) | CN113678196A (zh) |
| AR (1) | AR118332A1 (zh) |
| TW (1) | TWI742562B (zh) |
| WO (1) | WO2020187787A1 (zh) |
Families Citing this family (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| WO2022051097A1 (en) | 2020-09-03 | 2022-03-10 | Spark23 Corp. | Eyeglass augmented reality speech to text device and method |
| US12057123B1 (en) * | 2020-11-19 | 2024-08-06 | Voicebase, Inc. | Communication devices with embedded audio content transcription and analysis functions |
| CN113761118B (zh) * | 2021-04-22 | 2025-08-26 | 腾讯科技(深圳)有限公司 | 音频数据处理方法、装置、音频数据处理设备及存储介质 |
| GB202211620D0 (en) * | 2022-08-09 | 2022-09-21 | Oakspire Ltd | Automated speech recognition to support context-aware intent recognition |
| CN116050354A (zh) * | 2023-01-03 | 2023-05-02 | 深圳华为云计算技术有限公司 | 一种实验手册的配置方法以及装置 |
| US20250149042A1 (en) * | 2023-11-03 | 2025-05-08 | Xanderglasses, Inc. | Speech-to-text captioning system |
Family Cites Families (10)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP3825526B2 (ja) * | 1997-03-31 | 2006-09-27 | 株式会社東芝 | 音声認識装置 |
| WO2001016940A1 (en) * | 1999-08-31 | 2001-03-08 | Accenture, Llp | System, method, and article of manufacture for a voice recognition system for identity authentication in order to gain access to data on the internet |
| ATE417346T1 (de) * | 2003-03-26 | 2008-12-15 | Koninkl Philips Electronics Nv | Spracherkennungs- und korrektursystem, korrekturvorrichtung und verfahren zur erstellung eines lexikons von alternativen |
| US7539619B1 (en) * | 2003-09-05 | 2009-05-26 | Spoken Translation Ind. | Speech-enabled language translation system and method enabling interactive user supervision of translation and speech recognition accuracy |
| JP5207642B2 (ja) * | 2007-03-06 | 2013-06-12 | ニュアンス コミュニケーションズ,インコーポレイテッド | 語句として新たに認識するべき文字列を取得するためのシステム、方法及びコンピュータプログラム |
| JP2010066365A (ja) * | 2008-09-09 | 2010-03-25 | Toshiba Corp | 音声認識装置、方法、及びプログラム |
| US9292621B1 (en) * | 2012-09-12 | 2016-03-22 | Amazon Technologies, Inc. | Managing autocorrect actions |
| CH711717B1 (de) | 2015-10-29 | 2019-11-29 | Chemspeed Tech Ag | Anlage und Verfahren zur Durchführung eines Bearbeitungsprozesses. |
| EP3270374A1 (en) * | 2016-07-13 | 2018-01-17 | Tata Consultancy Services Limited | Systems and methods for automatic repair of speech recognition engine output |
| JP2018045001A (ja) * | 2016-09-12 | 2018-03-22 | 株式会社リコー | 音声認識システム、情報処理装置、プログラム、音声認識方法 |
-
2020
- 2020-03-11 AR ARP200100683A patent/AR118332A1/es unknown
- 2020-03-13 US US17/439,891 patent/US20220270595A1/en not_active Abandoned
- 2020-03-13 EP EP20711580.9A patent/EP3942549A1/de not_active Withdrawn
- 2020-03-13 TW TW109108492A patent/TWI742562B/zh not_active IP Right Cessation
- 2020-03-13 JP JP2022504328A patent/JP2022526467A/ja active Pending
- 2020-03-13 WO PCT/EP2020/056960 patent/WO2020187787A1/de not_active Ceased
- 2020-03-13 CN CN202080022512.1A patent/CN113678196A/zh active Pending
Also Published As
| Publication number | Publication date |
|---|---|
| US20220270595A1 (en) | 2022-08-25 |
| EP3942549A1 (de) | 2022-01-26 |
| AR118332A1 (es) | 2021-09-29 |
| TWI742562B (zh) | 2021-10-11 |
| CN113678196A (zh) | 2021-11-19 |
| JP2022526467A (ja) | 2022-05-24 |
| WO2020187787A1 (de) | 2020-09-24 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| TWI742562B (zh) | 不支援之技術語言之語音至文本轉換 | |
| JP7586405B2 (ja) | マイクロフォンを備える携帯用装置を有する実験室システム、およびその方法 | |
| Wang et al. | Textflint: Unified multilingual robustness evaluation toolkit for natural language processing | |
| Fantinuoli | Speech recognition in the interpreter workstation | |
| WO2020098269A1 (zh) | 一种语音合成方法及语音合成装置 | |
| EP2956931B1 (en) | Facilitating development of a spoken natural language interface | |
| US11093110B1 (en) | Messaging feedback mechanism | |
| US9613638B2 (en) | Computer-implemented systems and methods for determining an intelligibility score for speech | |
| US20080133245A1 (en) | Methods for speech-to-speech translation | |
| CN110428813B (zh) | 一种语音理解的方法、装置、电子设备及介质 | |
| CN108717853B (zh) | 一种人机语音交互方法、装置及存储介质 | |
| JP2017058673A (ja) | 対話処理装置及び方法と知能型対話処理システム | |
| EP2940551B1 (en) | Method and device for implementing voice input | |
| US11501762B2 (en) | Compounding corrective actions and learning in mixed mode dictation | |
| Hashimoto et al. | Impacts of machine translation and speech synthesis on speech-to-speech translation | |
| JP2015200860A (ja) | 辞書データベース管理装置、apiサーバ、辞書データベース管理方法、及び辞書データベース管理プログラム | |
| Lengkong et al. | The Implementation of Yandex Engine on Live Translator Application for Bahasa and English Using Block Programming MIT App Inventor Mobile Based | |
| US20230097338A1 (en) | Generating synthesized speech input | |
| Sharma et al. | Exploration of speech enabled system for English | |
| Ghosh et al. | MediBeng Whisper Tiny: A Fine-Tuned Code-Switched Bengali-English Translator for Clinical Applications | |
| CN107077863A (zh) | 用于在指定语言中辅助改善用户语音的方法和系统 | |
| Won | Assessing the efficacy of word error rate as a proxy for pronunciation quality: A comparative study of ASR systems and human evaluations among young EFL learners | |
| WO2025122288A1 (en) | Using text corrections to improve the accuracy of an llm | |
| KR20220060098A (ko) | 두 나라의 언어를 사용하는 대화를 통한 언어학습 시스템 및 방법 | |
| CN121809467A (zh) | 一种语法解析方法及相关装置 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| MM4A | Annulment or lapse of patent due to non-payment of fees |