JP4652737B2 - 単語境界確率推定装置及び方法、確率的言語モデル構築装置及び方法、仮名漢字変換装置及び方法、並びに、未知語モデルの構築方法、 - Google Patents
単語境界確率推定装置及び方法、確率的言語モデル構築装置及び方法、仮名漢字変換装置及び方法、並びに、未知語モデルの構築方法、 Download PDFInfo
- Publication number
- JP4652737B2 JP4652737B2 JP2004207864A JP2004207864A JP4652737B2 JP 4652737 B2 JP4652737 B2 JP 4652737B2 JP 2004207864 A JP2004207864 A JP 2004207864A JP 2004207864 A JP2004207864 A JP 2004207864A JP 4652737 B2 JP4652737 B2 JP 4652737B2
- Authority
- JP
- Japan
- Prior art keywords
- word
- corpus
- probability
- gram
- character
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Images
Classifications
-
- G—PHYSICS
- G06—COMPUTING; CALCULATING OR COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/40—Processing or translation of natural language
- G06F40/53—Processing of non-Latin text
-
- G—PHYSICS
- G06—COMPUTING; CALCULATING OR COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/20—Natural language analysis
- G06F40/205—Parsing
- G06F40/216—Parsing using statistical methods
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- Health & Medical Sciences (AREA)
- Artificial Intelligence (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Computational Linguistics (AREA)
- General Health & Medical Sciences (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Probability & Statistics with Applications (AREA)
- Machine Translation (AREA)
Description
P(x|y) = P(y|x) P(x) / P(y) (ここで、P(y) は y:given により定数)
の右辺の P(y|x), P(x) の最大化という2つのモデルに分解できる。このうち P(x) の方に関するモデルは入力データの種類(記号列、文字列、音声データなど)に依らないため、言語モデルと呼ばれており、最も一般的に用いられている確率的言語モデルとして単語 n-gram モデルが挙げられる。
従来技術として、分割済みコーパスでの学習に基づいて,非分割コーパスを分割した結果を用いるという方式がある。
(a) 分割候補を用いて,確率の重みつきで n-gram をカウントする。
(b) 自動分割結果の候補から 1-best のみを用いる。
(c) 自動分割結果の候補から n-best を用いる。
ただし、(a) (c) は bi-gram 以上で計算コストが大きく非現実的である.(b) に対する本発明の優位性は後述の実験において示す.
自然言語処理 -基礎と応用-,1999,電子情報通信学会,田中穂積監修. W. J. Teahan and John G. Cleary,1996,The entropy of English using ppm-based models,In DCC. Leo Breiman, Jerome H. Friedman, Richard A. Olshen, and Charles J. Stone. 1984. Classification and Regression Trees. Chapman & Hall, Inc. Masaaki Nagata,A Self-Organizing Japanese Word Segmenter using Heuristic Word Identification and Re-estimation.1997.
大量の例文が記憶されている記憶装置である学習コーパスとして
(a)第1のコーパス(単語分割済み): 比較的サイズの小さい、人手による単語分割情報を含むコーパス
(b)第2のコーパス(単語非分割): 比較的サイズの大きい、生のコーパス
が与えられている状況で,精度の高い単語 n-gram 確率を計算する。
第1のコーパス(単語分割済み)は n-gram を求めるのと、隣り合う2文字の間が単語境界になる確率(分割確率)を求めるのに用いる。第2のコーパス(単語非分割)は、第1のコーパス(単語分割済み)の情報を元に確率的な単語境界が割り当てられ、単語 n-gram を計算するのに用いる。
第2のコーパス(単語非分割)において、第1のコーパス(単語分割済み)で計算した分割確率を各文字の間に割り当てる。
<文字単位の未知語モデル>
文字単位で、文字と読みの対応関係をモデル化する。このことにより、未知語に対する仮名漢字変換モデルが提案される。
以下、本発明を応用することができる仮名漢字変換装置1(図1,図2)の動作を説明する。
[仮名漢字変換装置1]以下、本発明を応用することができる仮名漢字変換装置1を説明する。図1は、本発明を応用することができる仮名漢字変換装置1の構成を例示する図である。図1に示すように、本発明にかかる仮名漢字変換装置1は、マイクロプロセッサ、メモリおよびこれらの周辺回路など(いずれも図示せず)から構成されるCPU10、マウス、キーボード、および、入力装置12、CRTディスプレイなどの表示装置14、HDD装置、DVD装置、CD装置などの記憶装置16から構成される。
ベースフォームプール30は、言語モデル32の第1コーパス(単語分割済み)320に対応して、第1のコーパス(単語分割済み)に出現する語彙の読みが語彙辞書300に記憶されている。さらに、それら語彙を構成している全ての文字と読みの組み合わせが文字単位辞書302に記憶されている。文字単位辞書は単漢字辞書と呼ばれる場合もある。
図3では、第1のコーパスの詳細を示している。第1のコーパス(単語未分割)320には、複数の文字から形成された文字列が記憶されている。
図3では、第2のコーパスの詳細を示している。推定単語境界確率推定装置(図4)が、第1のコーパス(単語分割済み)について単語境界が存在するであろう確率を計算して参照し、それを第2のコーパス(単語未分割)における文字間にあてはめて、単語境界が存在するであろう確率として推定する。
言語復号部22は、入力の記号列を、ベースフォームプール30および言語モデル32により計算される確率が最大になる単語列(下記式2のW’)をテキストデータとして、表示装置14あるいは記録装置16に対して出力し、これらに表示あるいは記録する。
Pr(w1|w2,w3)=λP1(w1|w2,w3)+(1-λ)P2(w1|w2,w3) ・・・(1)
ただし、
本式はN=3の場合を例示し、
0≦λ≦1、
P1は第1のコーパス(単語分割済み)を示し、
P2は第2のコーパス(単語未分割)を示す。
を示す。
但し、Yは入力記号列(y1,y2,...,yk)、
Wは単語列(w1,w2,....,wl)、
W'は単語列(w'1,w'2,....,w'l)である。
第1のコーパス(単語分割済み)320について、単語境界が存在するであろう確率を計算する方法について説明する。
第2のコーパス(単語未分割)322中では、この第1のコーパス(単語分割済み)320から計算された結果である単語境界が存在する確率を参照して、確率的な分割を推定することができる。
[1] 言 [0.24955045] 語 [0.24955045] 学 [0.67322202] を [0.97213218] 学 [0.67332202] ぶ [1]。[1]
これは、図6の関係にある文字種の順列の関係に基づいている。
すなわち、「平叙文を読む。」という例文が第2のコーパス(単語未分割)に現れた場合であっても、同様に、以下の [ ] 内のような同様の確率を伴った境界を各2文字の間に付加することになる。
[1] 平 [0.24955045] 叙 [0.24955045] 文 [0.67332202] を [0.97213218] 読 [0.67322202] む [0.99999955]。[1]
n-gram モデルとは、ある文字列の中で、n個の文字列または単語の組み合わせが、どの程度出現するかを調査する言語モデルである。
単語分割確率( i 番目とi+1 番目の文字の間の分割確率を Pi とおく )が計算されれば、単語 w の uni-gram は
「言語」 : 1×(1-0.24955045)×(1-0.24955045)
として計算される。
「言語学」 : 1×(1-0.24955045)×(1-0.24955045)×(1-0.67332202)
として計算される。
「を学」 : 0.6733202×(1-0.97213218)×0.6733202
として計算されるもの、きわめて低い数値になる。すなわち、「を学」という単語が出現する確率はきわめて低いものであるということ、すなわち、単語の中では平仮名の後に漢字が出現しにくいであろうことが推測できる。このことは、経験的に理解できる。
・・・はシャ乱Qの・・・(ここで、実際には注目文字列の前後に他の文字列が存在しているが・・・によって略している、以下、同じ。)
という注目文字列が見つかった場合には、注目文字列の前には「は」という「平仮名」があり、注目文字列の後には「の」という「平仮名」がある。
よって、Psumは、(1-0.99999955)(1-0.99999955)として計算される。
例えば、次に、
・・・「シャ乱Q」・・・
という注目文字列(前後パターン)が見つかった場合には、S240で注目文字列である場合には、S220へ戻る。注目文字列の前には「「」という「記号」があり、注目文字列の後にも「」」という「記号」がある。
すなわち、Psumは、(1-0.99999955)(1-0.99999955)として計算されて、Psumに加算される。
言語復号部22は、ベースフォームプール30の内、語彙辞書300および文字単位辞書302の両方を参照する。
適用文書の書き起こしにおいて提案手法を導入することの優位性を検証する.以下の図9に本実験で用いたコーパスの詳細を記す。
単語分割の性能評価として、適合率(precision),再現率(recall) まで求めた実験である。評価基準は、片仮名表記された仮名漢字変換結果と正解の最長共通部分列(LCS;longest common subsequence)の文字数に基づくものであり、第1のコーパス(単語分割済み)の表記に含まれる文字数をNCとし、仮名漢字変換結果に含まれる文字数をNSYSとし、これらの最長共通部分列の文字数をNLCSとすると、再現率はNLCS/NCと定義され、適合率はNLCS/NSYSと定義される。
さらに、技術分野によって、第2のコーパス(単語未分割)を多く利用したり少なく利用したりしたい場合が生じるが、本発明に係る方法においては、第1のコーパス(単語分割済み)との線形補間時の重みの調整によって容易に制御できる。第2のコーパス(単語未分割)から推定された n-gram 確率は、人手により正確に単語に分割されたコーパスから推定された言語モデルほど正確ではないと考えた場合に基づく。
10・・・CPU
12・・・入力装置12
14・・・表示装置
16・・・記憶装置
18・・・記録媒体
2・・・仮名漢字変換プログラム
22・・・言語復号部
30・・・ベースフォームプール
300・・・語彙辞書
302・・・文字単位辞書
32・・・言語モデル
320・・・第1のコーパス(単語分割済み)
322・・・第2のコーパス(単語未分割)
Claims (4)
- コーパスの文字列を形成している各2つの文字の間に単語境界が存在するであろう確率を推定する単語境界推定手段と、前記コーパスにおける単語n-gramの期待頻度を算出する手段と、前記コーパスにおける単語n-gram確率を算出する手段とを含む、確率的言語モデル構築装置であって、
前記単語n-gramの期待頻度を算出する手段は、前記単語境界推定手段によって推定された確率を用いて単語n-gramの期待頻度を算出するものであり、
前記単語n-gramの期待頻度は、単語n-gramを形成する各単語を形成する文字列内に単語境界が無く、かつ、単語n-gramを形成する各単語の両端(直前の文字との間と直後の文字との間)には境界がある確率を、前記コーパスにおける単語n-gramの文字列のすべての出現に対して加算した値であって、
前記単語n-gram確率は、前記単語n-gramの期待頻度を、単語(n-1)-gramの期待頻度で割った値である、
確率的言語モデル構築装置。 - 請求項1に記載の確率的言語モデル構築装置を用いて算出した前記単語 n-gram 確率と、
前記コーパスとは異なるコーパスから算出した新たな単語 n-gram 確率との、
加重平均を単語 n-gram 確率として求める、
単語 n-gram 確率計算方法。 - 前記各2つの文字の間に単語境界が存在するであろう確率が、漢字、記号、数字、平仮名、カタカナ、西洋文字、という文字種の順番に基づいて推定される、請求項1に記載の確率的言語モデル構築装置。
- 前記各2つの文字の間に単語境界が存在するであろう確率が、分割されていることを示す数値1から分割されていないことを示す0の値をとる、請求項1に記載の確率的言語モデル構築装置。
Priority Applications (3)
Application Number | Priority Date | Filing Date | Title |
---|---|---|---|
JP2004207864A JP4652737B2 (ja) | 2004-07-14 | 2004-07-14 | 単語境界確率推定装置及び方法、確率的言語モデル構築装置及び方法、仮名漢字変換装置及び方法、並びに、未知語モデルの構築方法、 |
US11/180,153 US20060015326A1 (en) | 2004-07-14 | 2005-07-13 | Word boundary probability estimating, probabilistic language model building, kana-kanji converting, and unknown word model building |
US12/126,980 US7917350B2 (en) | 2004-07-14 | 2008-05-26 | Word boundary probability estimating, probabilistic language model building, kana-kanji converting, and unknown word model building |
Applications Claiming Priority (1)
Application Number | Priority Date | Filing Date | Title |
---|---|---|---|
JP2004207864A JP4652737B2 (ja) | 2004-07-14 | 2004-07-14 | 単語境界確率推定装置及び方法、確率的言語モデル構築装置及び方法、仮名漢字変換装置及び方法、並びに、未知語モデルの構築方法、 |
Publications (2)
Publication Number | Publication Date |
---|---|
JP2006031295A JP2006031295A (ja) | 2006-02-02 |
JP4652737B2 true JP4652737B2 (ja) | 2011-03-16 |
Family
ID=35600561
Family Applications (1)
Application Number | Title | Priority Date | Filing Date |
---|---|---|---|
JP2004207864A Active JP4652737B2 (ja) | 2004-07-14 | 2004-07-14 | 単語境界確率推定装置及び方法、確率的言語モデル構築装置及び方法、仮名漢字変換装置及び方法、並びに、未知語モデルの構築方法、 |
Country Status (2)
Country | Link |
---|---|
US (2) | US20060015326A1 (ja) |
JP (1) | JP4652737B2 (ja) |
Families Citing this family (193)
Publication number | Priority date | Publication date | Assignee | Title |
---|---|---|---|---|
US8645137B2 (en) | 2000-03-16 | 2014-02-04 | Apple Inc. | Fast, language-independent method for user authentication by voice |
US7937396B1 (en) | 2005-03-23 | 2011-05-03 | Google Inc. | Methods and systems for identifying paraphrases from an index of information items and associated sentence fragments |
JP4769031B2 (ja) * | 2005-06-24 | 2011-09-07 | マイクロソフト コーポレーション | 言語モデルを作成する方法、かな漢字変換方法、その装置、コンピュータプログラムおよびコンピュータ読み取り可能な記憶媒体 |
US8677377B2 (en) | 2005-09-08 | 2014-03-18 | Apple Inc. | Method and apparatus for building an intelligent automated assistant |
US7937265B1 (en) | 2005-09-27 | 2011-05-03 | Google Inc. | Paraphrase acquisition |
US7908132B2 (en) * | 2005-09-29 | 2011-03-15 | Microsoft Corporation | Writing assistance using machine translation techniques |
CN101512518B (zh) * | 2006-09-07 | 2015-06-24 | 日本电气株式会社 | 自然语言处理系统和词典登录系统 |
US9318108B2 (en) | 2010-01-18 | 2016-04-19 | Apple Inc. | Intelligent automated assistant |
JP5207642B2 (ja) * | 2007-03-06 | 2013-06-12 | ニュアンス コミュニケーションズ,インコーポレイテッド | 語句として新たに認識するべき文字列を取得するためのシステム、方法及びコンピュータプログラム |
US8977255B2 (en) | 2007-04-03 | 2015-03-10 | Apple Inc. | Method and system for operating a multi-function portable electronic device using voice-activation |
JP2010531492A (ja) * | 2007-06-25 | 2010-09-24 | グーグル・インコーポレーテッド | ワード確率決定 |
US8086441B1 (en) | 2007-07-27 | 2011-12-27 | Sonicwall, Inc. | Efficient string search |
US8010341B2 (en) * | 2007-09-13 | 2011-08-30 | Microsoft Corporation | Adding prototype information into probabilistic models |
US10002189B2 (en) | 2007-12-20 | 2018-06-19 | Apple Inc. | Method and apparatus for searching using an active ontology |
US9330720B2 (en) | 2008-01-03 | 2016-05-03 | Apple Inc. | Methods and apparatus for altering audio output signals |
US8996376B2 (en) | 2008-04-05 | 2015-03-31 | Apple Inc. | Intelligent text-to-speech conversion |
US8046222B2 (en) * | 2008-04-16 | 2011-10-25 | Google Inc. | Segmenting words using scaled probabilities |
US10496753B2 (en) | 2010-01-18 | 2019-12-03 | Apple Inc. | Automatically adapting user interfaces for hands-free interaction |
US9411800B2 (en) * | 2008-06-27 | 2016-08-09 | Microsoft Technology Licensing, Llc | Adaptive generation of out-of-dictionary personalized long words |
US8595282B2 (en) * | 2008-06-30 | 2013-11-26 | Symantec Corporation | Simplified communication of a reputation score for an entity |
US20100030549A1 (en) | 2008-07-31 | 2010-02-04 | Lee Michael M | Mobile device having human language translation capability with positional feedback |
JP5320925B2 (ja) * | 2008-09-18 | 2013-10-23 | 富士通株式会社 | 情報検索方法、情報検索装置及び情報検索プログラム |
US8676904B2 (en) | 2008-10-02 | 2014-03-18 | Apple Inc. | Electronic devices with voice command and contextual data processing capabilities |
WO2010067118A1 (en) | 2008-12-11 | 2010-06-17 | Novauris Technologies Limited | Speech recognition involving a mobile device |
CN101430680B (zh) * | 2008-12-31 | 2011-01-19 | 阿里巴巴集团控股有限公司 | 一种无词边界标记语言文本的分词序列选择方法及系统 |
US10241644B2 (en) | 2011-06-03 | 2019-03-26 | Apple Inc. | Actionable reminder entries |
US10241752B2 (en) | 2011-09-30 | 2019-03-26 | Apple Inc. | Interface for a virtual digital assistant |
US9858925B2 (en) | 2009-06-05 | 2018-01-02 | Apple Inc. | Using context information to facilitate processing of commands in a virtual assistant |
US20120309363A1 (en) | 2011-06-03 | 2012-12-06 | Apple Inc. | Triggering notifications associated with tasks items that represent tasks to perform |
US9431006B2 (en) | 2009-07-02 | 2016-08-30 | Apple Inc. | Methods and apparatuses for automatic speech recognition |
US10679605B2 (en) | 2010-01-18 | 2020-06-09 | Apple Inc. | Hands-free list-reading by intelligent automated assistant |
US10705794B2 (en) | 2010-01-18 | 2020-07-07 | Apple Inc. | Automatically adapting user interfaces for hands-free interaction |
US10553209B2 (en) | 2010-01-18 | 2020-02-04 | Apple Inc. | Systems and methods for hands-free notification summaries |
US10276170B2 (en) | 2010-01-18 | 2019-04-30 | Apple Inc. | Intelligent automated assistant |
US8682667B2 (en) | 2010-02-25 | 2014-03-25 | Apple Inc. | User profiling for selecting user specific voice input processing information |
CN102237081B (zh) * | 2010-04-30 | 2013-04-24 | 国际商业机器公司 | 语音韵律评估方法与系统 |
JP5466588B2 (ja) * | 2010-07-02 | 2014-04-09 | 株式会社Kddi研究所 | 単語境界判定装置 |
DE102010040553A1 (de) * | 2010-09-10 | 2012-03-15 | Siemens Aktiengesellschaft | Spracherkennungsverfahren |
US8364709B1 (en) * | 2010-11-22 | 2013-01-29 | Google Inc. | Determining word boundary likelihoods in potentially incomplete text |
US10762293B2 (en) | 2010-12-22 | 2020-09-01 | Apple Inc. | Using parts-of-speech tagging and named entity recognition for spelling correction |
CN102681981A (zh) * | 2011-03-11 | 2012-09-19 | 富士通株式会社 | 自然语言词法分析方法、装置及分析器训练方法 |
US9262612B2 (en) | 2011-03-21 | 2016-02-16 | Apple Inc. | Device access using voice authentication |
US10057736B2 (en) | 2011-06-03 | 2018-08-21 | Apple Inc. | Active transport based notifications |
US10672399B2 (en) | 2011-06-03 | 2020-06-02 | Apple Inc. | Switching between text data and audio data based on a mapping |
US8706472B2 (en) * | 2011-08-11 | 2014-04-22 | Apple Inc. | Method for disambiguating multiple readings in language conversion |
US8994660B2 (en) | 2011-08-29 | 2015-03-31 | Apple Inc. | Text correction processing |
US8914277B1 (en) * | 2011-09-20 | 2014-12-16 | Nuance Communications, Inc. | Speech and language translation of an utterance |
CN103186522B (zh) * | 2011-12-29 | 2018-01-26 | 富泰华工业(深圳)有限公司 | 电子设备及其自然语言分析方法 |
US10134385B2 (en) | 2012-03-02 | 2018-11-20 | Apple Inc. | Systems and methods for name pronunciation |
US9483461B2 (en) | 2012-03-06 | 2016-11-01 | Apple Inc. | Handling speech synthesis of content for multiple languages |
US9280610B2 (en) | 2012-05-14 | 2016-03-08 | Apple Inc. | Crowd sourcing information to fulfill user requests |
US9721563B2 (en) | 2012-06-08 | 2017-08-01 | Apple Inc. | Name recognition system |
US9495129B2 (en) | 2012-06-29 | 2016-11-15 | Apple Inc. | Device, method, and user interface for voice-activated navigation and browsing of a document |
US9576574B2 (en) | 2012-09-10 | 2017-02-21 | Apple Inc. | Context-sensitive handling of interruptions by intelligent digital assistant |
US9547647B2 (en) | 2012-09-19 | 2017-01-17 | Apple Inc. | Voice-based media searching |
JP6055267B2 (ja) * | 2012-10-19 | 2016-12-27 | 株式会社フュートレック | 文字列分割装置、モデルファイル学習装置および文字列分割システム |
JP5770753B2 (ja) * | 2013-01-15 | 2015-08-26 | グーグル・インコーポレーテッド | Cjk名前検出 |
EP3809407A1 (en) | 2013-02-07 | 2021-04-21 | Apple Inc. | Voice trigger for a digital assistant |
US9368114B2 (en) | 2013-03-14 | 2016-06-14 | Apple Inc. | Context-sensitive handling of interruptions |
US10652394B2 (en) | 2013-03-14 | 2020-05-12 | Apple Inc. | System and method for processing voicemail |
AU2014233517B2 (en) | 2013-03-15 | 2017-05-25 | Apple Inc. | Training an at least partial voice command system |
WO2014144579A1 (en) | 2013-03-15 | 2014-09-18 | Apple Inc. | System and method for updating an adaptive speech recognition model |
WO2014197334A2 (en) | 2013-06-07 | 2014-12-11 | Apple Inc. | System and method for user-specified pronunciation of words for speech synthesis and recognition |
US9582608B2 (en) | 2013-06-07 | 2017-02-28 | Apple Inc. | Unified ranking with entropy-weighted information for phrase-based semantic auto-completion |
WO2014197336A1 (en) | 2013-06-07 | 2014-12-11 | Apple Inc. | System and method for detecting errors in interactions with a voice-based digital assistant |
WO2014197335A1 (en) | 2013-06-08 | 2014-12-11 | Apple Inc. | Interpreting and acting upon commands that involve sharing information with remote devices |
KR101922663B1 (ko) | 2013-06-09 | 2018-11-28 | 애플 인크. | 디지털 어시스턴트의 둘 이상의 인스턴스들에 걸친 대화 지속성을 가능하게 하기 위한 디바이스, 방법 및 그래픽 사용자 인터페이스 |
US10176167B2 (en) | 2013-06-09 | 2019-01-08 | Apple Inc. | System and method for inferring user intent from speech inputs |
JP2016521948A (ja) | 2013-06-13 | 2016-07-25 | アップル インコーポレイテッド | 音声コマンドによって開始される緊急電話のためのシステム及び方法 |
AU2014306221B2 (en) | 2013-08-06 | 2017-04-06 | Apple Inc. | Auto-activating smart responses based on activities from remote devices |
US10296160B2 (en) | 2013-12-06 | 2019-05-21 | Apple Inc. | Method for extracting salient dialog usage from live data |
CN103885938B (zh) * | 2014-04-14 | 2015-04-22 | 东南大学 | 基于用户反馈的行业拼写错误检查方法 |
US9620105B2 (en) | 2014-05-15 | 2017-04-11 | Apple Inc. | Analyzing audio input for efficient speech and music recognition |
US10592095B2 (en) | 2014-05-23 | 2020-03-17 | Apple Inc. | Instantaneous speaking of content on touch devices |
US9502031B2 (en) | 2014-05-27 | 2016-11-22 | Apple Inc. | Method for supporting dynamic grammars in WFST-based ASR |
US10289433B2 (en) | 2014-05-30 | 2019-05-14 | Apple Inc. | Domain specific language for encoding assistant dialog |
US9760559B2 (en) | 2014-05-30 | 2017-09-12 | Apple Inc. | Predictive text input |
US9633004B2 (en) | 2014-05-30 | 2017-04-25 | Apple Inc. | Better resolution when referencing to concepts |
US9842101B2 (en) | 2014-05-30 | 2017-12-12 | Apple Inc. | Predictive conversion of language input |
US9785630B2 (en) * | 2014-05-30 | 2017-10-10 | Apple Inc. | Text prediction using combined word N-gram and unigram language models |
US10078631B2 (en) | 2014-05-30 | 2018-09-18 | Apple Inc. | Entropy-guided text prediction using combined word and character n-gram language models |
US9734193B2 (en) | 2014-05-30 | 2017-08-15 | Apple Inc. | Determining domain salience ranking from ambiguous words in natural speech |
US9715875B2 (en) | 2014-05-30 | 2017-07-25 | Apple Inc. | Reducing the need for manual start/end-pointing and trigger phrases |
US9430463B2 (en) | 2014-05-30 | 2016-08-30 | Apple Inc. | Exemplar-based natural language processing |
US10170123B2 (en) | 2014-05-30 | 2019-01-01 | Apple Inc. | Intelligent assistant for home automation |
US9966065B2 (en) | 2014-05-30 | 2018-05-08 | Apple Inc. | Multi-command single utterance input method |
US10659851B2 (en) | 2014-06-30 | 2020-05-19 | Apple Inc. | Real-time digital assistant knowledge updates |
US9338493B2 (en) | 2014-06-30 | 2016-05-10 | Apple Inc. | Intelligent automated assistant for TV user interactions |
JP6269953B2 (ja) * | 2014-07-10 | 2018-01-31 | 日本電信電話株式会社 | 単語分割装置、方法、及びプログラム |
US10446141B2 (en) | 2014-08-28 | 2019-10-15 | Apple Inc. | Automatic speech recognition based on user feedback |
US9818400B2 (en) | 2014-09-11 | 2017-11-14 | Apple Inc. | Method and apparatus for discovering trending terms in speech requests |
US10789041B2 (en) | 2014-09-12 | 2020-09-29 | Apple Inc. | Dynamic thresholds for always listening speech trigger |
US9646609B2 (en) | 2014-09-30 | 2017-05-09 | Apple Inc. | Caching apparatus for serving phonetic pronunciations |
US10074360B2 (en) | 2014-09-30 | 2018-09-11 | Apple Inc. | Providing an indication of the suitability of speech recognition |
US9886432B2 (en) | 2014-09-30 | 2018-02-06 | Apple Inc. | Parsimonious handling of word inflection via categorical stem + suffix N-gram language models |
US10127911B2 (en) | 2014-09-30 | 2018-11-13 | Apple Inc. | Speaker identification and unsupervised speaker adaptation techniques |
US9668121B2 (en) | 2014-09-30 | 2017-05-30 | Apple Inc. | Social reminders |
US10552013B2 (en) | 2014-12-02 | 2020-02-04 | Apple Inc. | Data detection |
US9711141B2 (en) | 2014-12-09 | 2017-07-18 | Apple Inc. | Disambiguating heteronyms in speech synthesis |
US9865280B2 (en) | 2015-03-06 | 2018-01-09 | Apple Inc. | Structured dictation using intelligent automated assistants |
US10152299B2 (en) | 2015-03-06 | 2018-12-11 | Apple Inc. | Reducing response latency of intelligent automated assistants |
US9886953B2 (en) | 2015-03-08 | 2018-02-06 | Apple Inc. | Virtual assistant activation |
US10567477B2 (en) | 2015-03-08 | 2020-02-18 | Apple Inc. | Virtual assistant continuity |
US9721566B2 (en) | 2015-03-08 | 2017-08-01 | Apple Inc. | Competing devices responding to voice triggers |
US9899019B2 (en) | 2015-03-18 | 2018-02-20 | Apple Inc. | Systems and methods for structured stem and suffix language models |
US9703394B2 (en) * | 2015-03-24 | 2017-07-11 | Google Inc. | Unlearning techniques for adaptive language models in text entry |
US9842105B2 (en) | 2015-04-16 | 2017-12-12 | Apple Inc. | Parsimonious continuous-space phrase representations for natural language processing |
US10083688B2 (en) | 2015-05-27 | 2018-09-25 | Apple Inc. | Device voice control for selecting a displayed affordance |
US10127220B2 (en) | 2015-06-04 | 2018-11-13 | Apple Inc. | Language identification from short strings |
US9578173B2 (en) | 2015-06-05 | 2017-02-21 | Apple Inc. | Virtual assistant aided communication with 3rd party service in a communication session |
US10101822B2 (en) | 2015-06-05 | 2018-10-16 | Apple Inc. | Language input correction |
US11025565B2 (en) | 2015-06-07 | 2021-06-01 | Apple Inc. | Personalized prediction of responses for instant messaging |
US10255907B2 (en) | 2015-06-07 | 2019-04-09 | Apple Inc. | Automatic accent detection using acoustic models |
US10186254B2 (en) | 2015-06-07 | 2019-01-22 | Apple Inc. | Context-based endpoint detection |
US10747498B2 (en) | 2015-09-08 | 2020-08-18 | Apple Inc. | Zero latency digital assistant |
US10671428B2 (en) | 2015-09-08 | 2020-06-02 | Apple Inc. | Distributed personal assistant |
US9697820B2 (en) | 2015-09-24 | 2017-07-04 | Apple Inc. | Unit-selection text-to-speech synthesis using concatenation-sensitive neural networks |
US11010550B2 (en) | 2015-09-29 | 2021-05-18 | Apple Inc. | Unified language modeling framework for word prediction, auto-completion and auto-correction |
US10366158B2 (en) | 2015-09-29 | 2019-07-30 | Apple Inc. | Efficient word encoding for recurrent neural network language models |
US11587559B2 (en) | 2015-09-30 | 2023-02-21 | Apple Inc. | Intelligent device identification |
US10691473B2 (en) | 2015-11-06 | 2020-06-23 | Apple Inc. | Intelligent automated assistant in a messaging environment |
US10049668B2 (en) | 2015-12-02 | 2018-08-14 | Apple Inc. | Applying neural network language models to weighted finite state transducers for automatic speech recognition |
US10223066B2 (en) | 2015-12-23 | 2019-03-05 | Apple Inc. | Proactive assistance based on dialog communication between devices |
US10446143B2 (en) | 2016-03-14 | 2019-10-15 | Apple Inc. | Identification of voice inputs providing credentials |
CN105845133A (zh) * | 2016-03-30 | 2016-08-10 | 乐视控股(北京)有限公司 | 语音信号处理方法及装置 |
CN107305575B (zh) * | 2016-04-25 | 2021-01-26 | 北京京东尚科信息技术有限公司 | 人机智能问答系统的断句识别方法和装置 |
US9934775B2 (en) | 2016-05-26 | 2018-04-03 | Apple Inc. | Unit-selection text-to-speech synthesis based on predicted concatenation parameters |
US9972304B2 (en) | 2016-06-03 | 2018-05-15 | Apple Inc. | Privacy preserving distributed evaluation framework for embedded personalized systems |
US10249300B2 (en) | 2016-06-06 | 2019-04-02 | Apple Inc. | Intelligent list reading |
US10049663B2 (en) | 2016-06-08 | 2018-08-14 | Apple, Inc. | Intelligent automated assistant for media exploration |
DK179309B1 (en) | 2016-06-09 | 2018-04-23 | Apple Inc | Intelligent automated assistant in a home environment |
US10509862B2 (en) | 2016-06-10 | 2019-12-17 | Apple Inc. | Dynamic phrase expansion of language input |
US10192552B2 (en) | 2016-06-10 | 2019-01-29 | Apple Inc. | Digital assistant providing whispered speech |
US10586535B2 (en) | 2016-06-10 | 2020-03-10 | Apple Inc. | Intelligent digital assistant in a multi-tasking environment |
US10067938B2 (en) | 2016-06-10 | 2018-09-04 | Apple Inc. | Multilingual word prediction |
US10490187B2 (en) | 2016-06-10 | 2019-11-26 | Apple Inc. | Digital assistant providing automated status report |
DK179343B1 (en) | 2016-06-11 | 2018-05-14 | Apple Inc | Intelligent task discovery |
DK201670540A1 (en) | 2016-06-11 | 2018-01-08 | Apple Inc | Application integration with a digital assistant |
DK179049B1 (en) | 2016-06-11 | 2017-09-18 | Apple Inc | Data driven natural language event detection and classification |
DK179415B1 (en) | 2016-06-11 | 2018-06-14 | Apple Inc | Intelligent device arbitration and control |
CN106339367B (zh) * | 2016-08-22 | 2018-09-18 | 内蒙古大学 | 一种蒙古文自动校正方法 |
US10474753B2 (en) | 2016-09-07 | 2019-11-12 | Apple Inc. | Language identification using recurrent neural networks |
US10043516B2 (en) | 2016-09-23 | 2018-08-07 | Apple Inc. | Intelligent automated assistant |
US11281993B2 (en) | 2016-12-05 | 2022-03-22 | Apple Inc. | Model and ensemble compression for metric learning |
US10372816B2 (en) * | 2016-12-13 | 2019-08-06 | International Business Machines Corporation | Preprocessing of string inputs in natural language processing |
US10593346B2 (en) | 2016-12-22 | 2020-03-17 | Apple Inc. | Rank-reduced token representation for automatic speech recognition |
US11204787B2 (en) | 2017-01-09 | 2021-12-21 | Apple Inc. | Application integration with a digital assistant |
US10372821B2 (en) * | 2017-03-17 | 2019-08-06 | Adobe Inc. | Identification of reading order text segments with a probabilistic language model |
US9864956B1 (en) | 2017-05-01 | 2018-01-09 | SparkCognition, Inc. | Generation and use of trained file classifiers for malware detection |
US10417266B2 (en) | 2017-05-09 | 2019-09-17 | Apple Inc. | Context-aware ranking of intelligent response suggestions |
DK201770383A1 (en) | 2017-05-09 | 2018-12-14 | Apple Inc. | USER INTERFACE FOR CORRECTING RECOGNITION ERRORS |
US10395654B2 (en) | 2017-05-11 | 2019-08-27 | Apple Inc. | Text normalization based on a data-driven learning network |
US10726832B2 (en) | 2017-05-11 | 2020-07-28 | Apple Inc. | Maintaining privacy of personal information |
DK201770439A1 (en) | 2017-05-11 | 2018-12-13 | Apple Inc. | Offline personal assistant |
DK201770429A1 (en) | 2017-05-12 | 2018-12-14 | Apple Inc. | LOW-LATENCY INTELLIGENT AUTOMATED ASSISTANT |
DK179745B1 (en) | 2017-05-12 | 2019-05-01 | Apple Inc. | SYNCHRONIZATION AND TASK DELEGATION OF A DIGITAL ASSISTANT |
DK179496B1 (en) | 2017-05-12 | 2019-01-15 | Apple Inc. | USER-SPECIFIC Acoustic Models |
US11301477B2 (en) | 2017-05-12 | 2022-04-12 | Apple Inc. | Feedback analysis of a digital assistant |
DK201770431A1 (en) | 2017-05-15 | 2018-12-20 | Apple Inc. | Optimizing dialogue policy decisions for digital assistants using implicit feedback |
DK201770432A1 (en) | 2017-05-15 | 2018-12-21 | Apple Inc. | Hierarchical belief states for digital assistants |
US10403278B2 (en) | 2017-05-16 | 2019-09-03 | Apple Inc. | Methods and systems for phonetic matching in digital assistant services |
US10311144B2 (en) | 2017-05-16 | 2019-06-04 | Apple Inc. | Emoji word sense disambiguation |
DK179549B1 (en) | 2017-05-16 | 2019-02-12 | Apple Inc. | FAR-FIELD EXTENSION FOR DIGITAL ASSISTANT SERVICES |
US10303715B2 (en) | 2017-05-16 | 2019-05-28 | Apple Inc. | Intelligent automated assistant for media exploration |
US10657328B2 (en) | 2017-06-02 | 2020-05-19 | Apple Inc. | Multi-task recurrent neural network architecture for efficient morphology handling in neural language modeling |
US10713519B2 (en) | 2017-06-22 | 2020-07-14 | Adobe Inc. | Automated workflows for identification of reading order from text segments using probabilistic language models |
US10616252B2 (en) | 2017-06-30 | 2020-04-07 | SparkCognition, Inc. | Automated detection of malware using trained neural network-based file classifiers and machine learning |
US10305923B2 (en) | 2017-06-30 | 2019-05-28 | SparkCognition, Inc. | Server-supported malware detection and protection |
US10445429B2 (en) | 2017-09-21 | 2019-10-15 | Apple Inc. | Natural language understanding using vocabularies with compressed serialized tries |
US10755051B2 (en) | 2017-09-29 | 2020-08-25 | Apple Inc. | Rule-based natural language processing |
CN107832302B (zh) * | 2017-11-22 | 2021-09-17 | 北京百度网讯科技有限公司 | 分词处理方法、装置、移动终端及计算机可读存储介质 |
CN107832301B (zh) * | 2017-11-22 | 2021-09-17 | 北京百度网讯科技有限公司 | 分词处理方法、装置、移动终端及计算机可读存储介质 |
US10636424B2 (en) | 2017-11-30 | 2020-04-28 | Apple Inc. | Multi-turn canned dialog |
CN108073704B (zh) * | 2017-12-18 | 2020-07-14 | 清华大学 | 一种liwc词表扩展方法 |
US10733982B2 (en) | 2018-01-08 | 2020-08-04 | Apple Inc. | Multi-directional dialog |
US10733375B2 (en) | 2018-01-31 | 2020-08-04 | Apple Inc. | Knowledge-based framework for improving natural language understanding |
US10789959B2 (en) | 2018-03-02 | 2020-09-29 | Apple Inc. | Training speaker recognition models for digital assistants |
US10592604B2 (en) | 2018-03-12 | 2020-03-17 | Apple Inc. | Inverse text normalization for automatic speech recognition |
US10818288B2 (en) | 2018-03-26 | 2020-10-27 | Apple Inc. | Natural assistant interaction |
US10909331B2 (en) | 2018-03-30 | 2021-02-02 | Apple Inc. | Implicit identification of translation payload with neural machine translation |
US11145294B2 (en) | 2018-05-07 | 2021-10-12 | Apple Inc. | Intelligent automated assistant for delivering content from user experiences |
US10928918B2 (en) | 2018-05-07 | 2021-02-23 | Apple Inc. | Raise to speak |
US10984780B2 (en) | 2018-05-21 | 2021-04-20 | Apple Inc. | Global semantic word embeddings using bi-directional recurrent neural networks |
DK179822B1 (da) | 2018-06-01 | 2019-07-12 | Apple Inc. | Voice interaction at a primary device to access call functionality of a companion device |
US10892996B2 (en) | 2018-06-01 | 2021-01-12 | Apple Inc. | Variable latency device coordination |
DK180639B1 (en) | 2018-06-01 | 2021-11-04 | Apple Inc | DISABILITY OF ATTENTION-ATTENTIVE VIRTUAL ASSISTANT |
US11386266B2 (en) | 2018-06-01 | 2022-07-12 | Apple Inc. | Text correction |
DK201870355A1 (en) | 2018-06-01 | 2019-12-16 | Apple Inc. | VIRTUAL ASSISTANT OPERATION IN MULTI-DEVICE ENVIRONMENTS |
US10496705B1 (en) | 2018-06-03 | 2019-12-03 | Apple Inc. | Accelerated task performance |
CN109190124B (zh) * | 2018-09-14 | 2019-11-26 | 北京字节跳动网络技术有限公司 | 用于分词的方法和装置 |
CN109800435B (zh) * | 2019-01-29 | 2023-06-20 | 北京金山数字娱乐科技有限公司 | 一种语言模型的训练方法及装置 |
CN112530417B (zh) * | 2019-08-29 | 2024-01-26 | 北京猎户星空科技有限公司 | 语音信号处理方法、装置、电子设备及存储介质 |
CN112131866A (zh) * | 2020-09-25 | 2020-12-25 | 马上消费金融股份有限公司 | 一种分词方法、装置、设备及可读存储介质 |
Family Cites Families (15)
Publication number | Priority date | Publication date | Assignee | Title |
---|---|---|---|---|
US5806021A (en) * | 1995-10-30 | 1998-09-08 | International Business Machines Corporation | Automatic segmentation of continuous text using statistical approaches |
DE19639844A1 (de) * | 1996-09-27 | 1998-04-02 | Philips Patentverwaltung | Verfahren zum Ableiten wenigstens einer Folge von Wörtern aus einem Sprachsignal |
US6092038A (en) * | 1998-02-05 | 2000-07-18 | International Business Machines Corporation | System and method for providing lossless compression of n-gram language models in a real-time decoder |
US6411932B1 (en) * | 1998-06-12 | 2002-06-25 | Texas Instruments Incorporated | Rule-based learning of word pronunciations from training corpora |
ATE374421T1 (de) * | 1998-08-28 | 2007-10-15 | Ibm | Segmentierungsverfahren zur erweiterung des aktiven vokabulars von spracherkennern |
US6363342B2 (en) * | 1998-12-18 | 2002-03-26 | Matsushita Electric Industrial Co., Ltd. | System for developing word-pronunciation pairs |
US6185524B1 (en) * | 1998-12-31 | 2001-02-06 | Lernout & Hauspie Speech Products N.V. | Method and apparatus for automatic identification of word boundaries in continuous text and computation of word boundary scores |
JP3476007B2 (ja) * | 1999-09-10 | 2003-12-10 | インターナショナル・ビジネス・マシーンズ・コーポレーション | 認識単語登録方法、音声認識方法、音声認識装置、認識単語登録のためのソフトウエア・プロダクトを格納した記憶媒体、音声認識のためのソフトウエア・プロダクトを格納した記憶媒体 |
US7308400B2 (en) * | 2000-12-14 | 2007-12-11 | International Business Machines Corporation | Adaptation of statistical parsers based on mathematical transform |
CN1236422C (zh) * | 2001-05-02 | 2006-01-11 | 索尼公司 | 机器人装置、字符识别方法和装置 |
US7610189B2 (en) * | 2001-10-18 | 2009-10-27 | Nuance Communications, Inc. | Method and apparatus for efficient segmentation of compound words using probabilistic breakpoint traversal |
US7124080B2 (en) * | 2001-11-13 | 2006-10-17 | Microsoft Corporation | Method and apparatus for adapting a class entity dictionary used with language models |
US7349839B2 (en) * | 2002-08-27 | 2008-03-25 | Microsoft Corporation | Method and apparatus for aligning bilingual corpora |
US20050071148A1 (en) * | 2003-09-15 | 2005-03-31 | Microsoft Corporation | Chinese word segmentation |
US7447627B2 (en) * | 2003-10-23 | 2008-11-04 | Microsoft Corporation | Compound word breaker and spell checker |
-
2004
- 2004-07-14 JP JP2004207864A patent/JP4652737B2/ja active Active
-
2005
- 2005-07-13 US US11/180,153 patent/US20060015326A1/en not_active Abandoned
-
2008
- 2008-05-26 US US12/126,980 patent/US7917350B2/en not_active Expired - Fee Related
Also Published As
Publication number | Publication date |
---|---|
US20080228463A1 (en) | 2008-09-18 |
US20060015326A1 (en) | 2006-01-19 |
JP2006031295A (ja) | 2006-02-02 |
US7917350B2 (en) | 2011-03-29 |
Similar Documents
Publication | Publication Date | Title |
---|---|---|
JP4652737B2 (ja) | 単語境界確率推定装置及び方法、確率的言語モデル構築装置及び方法、仮名漢字変換装置及び方法、並びに、未知語モデルの構築方法、 | |
US9471566B1 (en) | Method and apparatus for converting phonetic language input to written language output | |
KR101425182B1 (ko) | 타이핑 효율을 증강시키기 위한 타이핑 후보생성방법 | |
US11024287B2 (en) | Method, device, and storage medium for correcting error in speech recognition result | |
US9164983B2 (en) | Broad-coverage normalization system for social media language | |
JP5535417B2 (ja) | スペルミス、タイプミス、および変換誤りに耐性のある、あるテキスト形式から別のテキスト形式に変換する言語入力アーキテクチャ | |
US8380488B1 (en) | Identifying a property of a document | |
US8881005B2 (en) | Methods and systems for large-scale statistical misspelling correction | |
JP4833476B2 (ja) | モードレス入力で一方のテキスト形式を他方のテキスト形式に変換する言語入力アーキテクチャ | |
US6738741B2 (en) | Segmentation technique increasing the active vocabulary of speech recognizers | |
KR101279676B1 (ko) | 언어 모델을 생성하기 위한 방법, 가나-간지 변환 방법 및그 장치 | |
JP2008539476A (ja) | スペル提示の生成方法およびシステム | |
JP2003514304A5 (ja) | ||
TWI567569B (zh) | Natural language processing systems, natural language processing methods, and natural language processing programs | |
JPH10326275A (ja) | 形態素解析方法および装置、並びに日本語形態素解析方法および装置 | |
JP7040155B2 (ja) | 情報処理装置、情報処理方法及びプログラム | |
JP5097802B2 (ja) | ローマ字変換を用いる日本語自動推薦システムおよび方法 | |
JP7102710B2 (ja) | 情報生成プログラム、単語抽出プログラム、情報処理装置、情報生成方法及び単語抽出方法 | |
US8977538B2 (en) | Constructing and analyzing a word graph | |
JP2000353159A (ja) | 表記・読み対応付け装置、表記・読み対応辞書作成方法、テキスト読み振り装置、テキスト読み振り方法および記録媒体 | |
JP2003331214A (ja) | 文字認識誤り訂正方法、装置及びプログラム | |
US11080488B2 (en) | Information processing apparatus, output control method, and computer-readable recording medium | |
US20230039439A1 (en) | Information processing apparatus, information generation method, word extraction method, and computer-readable recording medium | |
JPH0589281A (ja) | 誤読修正・検出方法 | |
JP6020093B2 (ja) | アルファベット読み推定装置 |
Legal Events
Date | Code | Title | Description |
---|---|---|---|
A621 | Written request for application examination |
Free format text: JAPANESE INTERMEDIATE CODE: A621 Effective date: 20070711 |
|
A131 | Notification of reasons for refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A131 Effective date: 20070731 |
|
A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20070824 Free format text: JAPANESE INTERMEDIATE CODE: A821 Effective date: 20070824 |
|
RD12 | Notification of acceptance of power of sub attorney |
Free format text: JAPANESE INTERMEDIATE CODE: A7432 Effective date: 20070824 |
|
A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A821 Effective date: 20070824 |
|
A02 | Decision of refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A02 Effective date: 20071009 |
|
A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A821 Effective date: 20071024 |
|
RD14 | Notification of resignation of power of sub attorney |
Free format text: JAPANESE INTERMEDIATE CODE: A7434 Effective date: 20071024 |
|
A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20071228 |
|
A911 | Transfer to examiner for re-examination before appeal (zenchi) |
Free format text: JAPANESE INTERMEDIATE CODE: A911 Effective date: 20080207 |
|
A912 | Re-examination (zenchi) completed and case transferred to appeal board |
Free format text: JAPANESE INTERMEDIATE CODE: A912 Effective date: 20080222 |
|
A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20101116 |
|
A01 | Written decision to grant a patent or to grant a registration (utility model) |
Free format text: JAPANESE INTERMEDIATE CODE: A01 |
|
A61 | First payment of annual fees (during grant procedure) |
Free format text: JAPANESE INTERMEDIATE CODE: A61 Effective date: 20101216 |
|
R150 | Certificate of patent or registration of utility model |
Ref document number: 4652737 Country of ref document: JP Free format text: JAPANESE INTERMEDIATE CODE: R150 Free format text: JAPANESE INTERMEDIATE CODE: R150 |
|
FPAY | Renewal fee payment (event date is renewal date of database) |
Free format text: PAYMENT UNTIL: 20131224 Year of fee payment: 3 |