KR102516577B1 - 디지털 어시스턴트를 위한 음성 트리거 - Google Patents

디지털 어시스턴트를 위한 음성 트리거 Download PDF

Info

Publication number
KR102516577B1
KR102516577B1 KR1020227024872A KR20227024872A KR102516577B1 KR 102516577 B1 KR102516577 B1 KR 102516577B1 KR 1020227024872 A KR1020227024872 A KR 1020227024872A KR 20227024872 A KR20227024872 A KR 20227024872A KR 102516577 B1 KR102516577 B1 KR 102516577B1
Authority
KR
South Korea
Prior art keywords
sound
implementations
electronic device
user
voice
Prior art date
Application number
KR1020227024872A
Other languages
English (en)
Other versions
KR20220106856A (ko
Inventor
저스틴 지. 바인더
오누르 택킨
사무엘 디. 포스트
토마스 알. 그루버
Original Assignee
애플 인크.
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by 애플 인크. filed Critical 애플 인크.
Priority to KR1020237010639A priority Critical patent/KR102579086B1/ko
Publication of KR20220106856A publication Critical patent/KR20220106856A/ko
Application granted granted Critical
Publication of KR102516577B1 publication Critical patent/KR102516577B1/ko

Links

Images

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L17/00Speaker identification or verification techniques
    • G10L17/22Interactive procedures; Man-machine interfaces
    • G10L17/24Interactive procedures; Man-machine interfaces the user being prompted to utter a password or a predefined phrase
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F3/00Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
    • G06F3/16Sound input; Sound output
    • G06F3/167Audio in a user interface, e.g. using voice commands for navigating, audio feedback
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/06Transformation of speech into a non-audible representation, e.g. speech visualisation or speech processing for tactile aids
    • G10L21/16Transforming into a non-visible representation
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/02Feature extraction for speech recognition; Selection of recognition unit
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/26Speech to text systems
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/28Constructional details of speech recognition systems
    • G10L15/30Distributed recognition, e.g. in client-server systems, for mobile phones or network applications
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • G10L2015/223Execution procedure of a spoken command
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/48Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
    • G10L25/51Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/78Detection of presence or absence of voice signals
    • G10L25/84Detection of presence or absence of voice signals for discriminating voice from noise

Landscapes

  • Engineering & Computer Science (AREA)
  • Health & Medical Sciences (AREA)
  • Multimedia (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Computational Linguistics (AREA)
  • Theoretical Computer Science (AREA)
  • General Health & Medical Sciences (AREA)
  • General Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • Quality & Reliability (AREA)
  • Signal Processing (AREA)
  • Data Mining & Analysis (AREA)
  • Otolaryngology (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • User Interface Of Digital Computer (AREA)
  • Telephone Function (AREA)
  • Telephonic Communication Services (AREA)
  • Machine Translation (AREA)
  • Apparatuses For Generation Of Mechanical Vibrations (AREA)
  • Electrophonic Musical Instruments (AREA)
  • Reverberation, Karaoke And Other Acoustics (AREA)

Abstract

본 명세서에는 음성 트리거를 동작시키기 위한 방법이 제공되었다. 일부 구현예들에서, 이 방법은 하나 이상의 프로세서 및 하나 이상의 프로세서에 의해 실행하기 위한 명령어들을 저장하는 메모리를 포함하는 전자 디바이스에서 수행된다. 이 방법은 사운드 입력을 수신하는 단계를 포함한다. 사운드 입력은 구술된 단어 또는 구, 또는 이들의 일부분에 대응할 수 있다. 이 방법은 사운드 입력의 적어도 일부분이 사람의 음성과 같은 사전결정된 타입의 사운드에 대응하는지 여부를 결정하는 단계를 포함한다. 이 방법은, 사운드 입력의 적어도 일부분이 사전결정된 타입에 대응한다는 결정에 따라, 사운드 입력이 사전결정된 트리거 단어 또는 구와 같은 사전결정된 콘텐츠를 포함하는지 여부를 결정하는 단계를 포함한다. 이 방법은 또한, 사운드 입력이 사전결정된 콘텐츠를 포함한다는 결정에 따라, 음성-기반 디지털 어시스턴트와 같은 스피치-기반 서비스를 개시하는 단계를 포함한다.

Description

디지털 어시스턴트를 위한 음성 트리거{VOICE TRIGGER FOR A DIGITAL ASSISTANT}
관련 출원 상호 참조
본 출원은 2013년 2월 7일 출원된 미국 임시출원 제61/762,260호, 발명의 명칭 "VOICE TRIGGER FOR A DIGITAL ASSISTANT"의 우선권을 주장하며, 이것은 전체가 본 명세서에 참조로서 포함된다.
개시된 구현예는 일반적으로 디지털 어시스턴트에 관한 것으로, 보다 구체적으로는 디지털 어시스턴트를 위한 음성 트리거 방법 및 시스템에 관한 것이다.
최근에, 애플(Apple)사의 시리(SIRI)와 같은 음성-기반 디지털 어시스턴트가 웹 탐색 및 내비게이션과 같은 다양한 작업들을 다루기 위한 시장에 도입되었다. 이러한 음성-기반 디지털 어시스턴트의 일 장점은 사용자들이 디바이스를 다루거나 볼 필요조차도 없이 핸드-프리 방식으로 디바이스와 상호작용할 수 있다는 것이다. 핸드-프리 동작은, 사용자들이 운전을 할 때와 같이 사용자가 디바이스를 물리적으로 다룰 수 없거나 다루어서는 안되는 경우에서 특히 바람직할 수 있다. 그러나, 음성-기반 어시스턴트를 개시하기 위해서, 사용자들은 통상적으로 버튼을 누르거나 터치 스크린 상의 아이콘을 선택해야만 한다. 이러한 접촉식 입력은 핸드-프리 경험을 손상시킨다. 따라서, 접촉식 입력이 아닌 음성 입력 또는 신호를 이용하여 음성-기반 디지털 어시스턴트(또는 다른 스피치-기반 서비스)를 활성화하는 방법 및 시스템을 제공하는 것이 바람직할 수 있다.
음성 입력을 이용하여 음성-기반 어시스턴트를 활성화하는 것은 음성 입력을 검출하기 위해 오디오 채널을 모니터링하는 것을 필요로 한다. 이러한 모니터링은 배터리에 의존하고 이러한 음성-기반 디지털 어시스턴트들이 주로 실행되는 핸드헬드 또는 휴대용 디바이스 상의 제한된 리소스인 전력을 소비한다. 따라서, 디바이스 상에서 음성- 및/또는 스피치-기반 서비스들을 개시하도록 사용될 수 있는 에너지 효율적인 음성 트리거를 제공하는 것이 바람직할 것이다.
따라서, 제한된 전력 리소스를 과도하게 소비하지 않고 "항상-청취하는" 음성 트리거 기능을 제공할 수 있는 저전력 음성 트리거에 대한 필요성이 존재한다. 아래에서 기술되는 구현예들은 전자 디바이스에서 음성 트리거를 이용하여 음성-기반 어시스턴트를 개시하기 위한 시스템들 및 방법들을 제공한다. 음성-기반 디지털 어시스턴트(또는 스피치-텍스트(speech-to-text) 전사 서비스와 같은 다른 스피치-기반 서비스)와의 상호작용들은 종종 사용자가 디지털 어시스턴트를 활성화하기 위해 디바이스 상의 어포던스(affordance)(예를 들어, 버튼 또는 아이콘)을 누를 때 시작되고, 그에 이어 디바이스가 광, 사운드(예를 들어, 삐 소리), 또는 음성화된 출력(예를 들어, "무엇을 해드릴까요?")과 같이 디지털 어시스턴트가 활동중이며 청취중이라는 일부 표시를 사용자에게 제공한다. 본 명세서에서 기술되는 바와 같이, 음성 트리거는 또한 사용자에 의한 물리적 상호작용을 요구하지 않고 특정한 사전결정된 단어, 구(phrase), 또는 사운드에 응답하여 활성화되도록 구현될 수도 있다. 예를 들어, 사용자는 구 "안녕, 시리"라고 말함으로써 아이폰(IPHONE) 상의 시리 디지털 어시스턴트(둘 모두가 본 출원의 양수인인 애플 인크.(Apple Inc.)에 의해 제공됨)를 활성화할 수 있다. 그에 응답하여, 디바이스는 사용자에게 청취 모드가 활동중임을 나타내는 삐 소리, 사운드, 또는 스피치 출력(예를 들어, "무엇을 해드릴까요?")을 출력한다. 따라서, 사용자는 디지털 어시스턴트 기능을 제공하는 디바이스를 물리적으로 터치해야 할 필요 없이 디지털 어시스턴트와의 상호작용을 개시할 수 있다.
음성 트리거를 이용하여 스피치-기반 서비스를 개시하기 위한 일 기술은 사전결정된 트리거 단어, 구, 또는 사운드(이들 중 임의의 것이 본 명세서에서 "트리거 사운드"로 지칭될 수 있다)를 계속해서 청취하는 스피치-기반 서비스를 갖는 것이다. 그러나, 스피치-기반 서비스(예를 들어, 음성-기반 디지털 어시스턴트)를 계속해서 동작시키는 것은 상당한 오디오 프로세싱 및 배터리 전력을 요구한다. 음성 트리거 기능을 제공함으로써 소비되는 전력을 감소시키기 위해서, 몇몇 기술들이 사용될 수 있다. 일부 구현예들에서, 전자 디바이스의 메인 프로세서(즉, "애플리케이션 프로세서")가 저전력 또는 전력공급되지 않는 상태로 유지되는 반면, (예를 들어, 애플리케이션 프로세서에 의존하지 않기 때문에) 더 적은 전력을 사용하는 하나 이상의 사운드 검출기는 활동적으로 남아있게 된다. (저전력 또는 전력공급되지 않는 상태에 있는 경우, 애플리케이션 프로세서 또는 임의의 다른 프로세서, 프로그램, 또는 모듈이 비활동적이거나 스탠바이 모드에 있는 것으로 기술될 수 있다.) 예를 들어, 애플리케이션 프로세서가 비활동적일 때에도 저전력 사운드 검출기가 트리거 사운드에 대해 오디오 채널을 모니터링하도록 사용된다. 이러한 사운드 검출기는 때때로 본 명세서에서 트리거 사운드 검출기로서 지칭된다. 일부 구현예들에서, 이것은 특정한 사운드, 음소(phoneme), 및/또는 단어를 검출하도록 구성된다. (하드웨어 및/또는 소프트웨어 컴포넌트들을 포함하는) 트리거 사운드 검출기는 특정한 단어, 사운드, 또는 구를 인식하도록 설계되지만, 일반적으로 이러한 작업이 더 큰 컴퓨터 및 전력 리소스를 요구하기 때문에, 전체 스피치-텍스트 기능을 제공하기 위해 최적화될 수 없다. 따라서, 일부 구현예들에서, 트리거 사운드 검출기는 음성 입력이 사전정의된 패턴(예를 들어, 단어들 "안녕, 시리"에 부합하는 소리 패턴)을 포함하는지 여부를 인식하지만, 음성 입력을 텍스트로 변환하거나 상당한 양의 다른 단어들을 인식할 수 없다(또는 그렇게 구성되지 않는다). 트리거 사운드가 검출되면, 그 다음 디지털 어시스턴트는 사용자가 음성 커맨드를 제공할 수 있도록 스탠바이 모드 밖으로 나가게 된다.
일부 구현예들에서, 트리거 사운드 검출기는 단어들의 세트, 구, 사운드, 및/또는 이들의 조합과 같은 몇몇 서로 다른 트리거 사운드들을 검출하도록 구성된다. 그 다음 사용자는 스피치-기반 서비스를 개시하기 위해서 임의의 이러한 사운드를 사용할 수 있다. 일 예에서, 음성 트리거는 "안녕, 시리", "일어나, 시리", "나의 디지털 어시스턴트를 호출해줘", 또는 "안녕, 핼(HAL), 읽고 있니 핼?"과 같은 구들에 대해 응답하도록 사전구성된다. 일부 구현예들에서, 사용자는 사전구성된 트리거 사운드들 중 하나를 단독 트리거 사운드로서 선택해야만 한다. 일부 구현예들에서, 사용자는 사전구성된 트리거 사운드들의 하위세트를 선택하며, 그에 따라 사용자가 서로 다른 트리거 사운드들을 이용하여 스피치-기반 서비스를 개시할 수 있다. 일부 구현예들에서, 사전구성된 트리거 사운드들 전부가 유효 트리거 사운드들로 남아있다.
일부 구현예들에서, 트리거 사운드 검출기가 대부분의 시간 동안 저전력 또는 전력공급되지 않는 모드로 유지될 수 있도록 다른 사운드 검출기가 사용된다. 예를 들어, 상이한 타입의 사운드 검출기(예를 들어, 트리거 사운드 검출기보다 더 적은 전력을 사용하는 사운드 검출기)가 사운드 입력이 소정 타입의 사운드에 대응하는지 여부를 결정하기 위해 오디오 채널을 모니터링하도록 사용된다. 사운드들은 소정의 식별가능한 사운드들의 특징에 기초하여 상이한 "타입들"로 분류된다. 예를 들어, "사람의 음성" 타입의 사운드는 소정의 스펙트럼 콘텐츠, 주기성, 본질적 주파수 등을 갖는다. 다른 타입의 사운드들(예를 들어, 휘파람, 손뼉 등)은 다른 특징들을 갖는다. 서로 다른 타입의 사운드들은 본 명세서에 기술된 것과 같은 오디오 및/또는 신호 프로세싱 기술들을 이용하여 식별된다. 이러한 사운드 검출기는 때때로 본 명세서에서 "사운드-타입 검출기"로 지칭된다. 예를 들어, 만약 사전결정된 트리거 구가 "안녕, 시리"라면, 사운드-타입 검출기는 입력이 사람의 스피치에 대응할 가능성이 높은지 여부를 결정한다. 만약 트리거 사운드가 휘파람과 같은 비-음성 사운드라면, 사운드-타입 검출기는 사운드 입력이 휘파람에 대응할 가능성이 높은지 여부를 결정한다. 적절한 타입의 사운드가 검출되면, 사운드-타입 검출기는 사운드를 추가로 프로세싱 및/또는 분석하기 위해 트리거 사운드 검출기를 개시한다. 그리고 (예를 들어, 사운드-타입 검출기가 트리거 사운드 검출기보다 더 낮은 전력 수요 및/또는 더욱 효율적인 오디오 프로세싱 알고리즘을 갖는 회로를 사용하기 때문에) 사운드-타입 검출기가 트리거 사운드 검출기보다 더 적은 전력을 요구하므로, 음성 트리거 기능은 트리거 사운드 검출기를 단독으로 사용하는 것보다도 더 적은 전력을 소비한다.
일부 구현예들에서, 전술된 사운드-타입 검출기 및 트리거 사운드 검출기 모두가 대부분의 시간 동안 저전력 또는 전력공급되지 않는 모드로 유지될 수 있도록 또 다른 사운드 검출기가 사용된다. 예를 들어, 사운드-타입 검출기보다 더 적은 전력을 사용하는 사운드 검출기는 사운드 입력이 진폭(예를 들어, 볼륨) 임계값과 같은 사전결정된 조건을 만족시키는지 여부를 결정하기 위해 오디오 채널을 모니터링하도록 사용된다. 이러한 사운드 검출기는 본 명세서에서 노이즈 검출기로 지칭될 수 있다. 노이즈 검출기가 사전결정된 임계값을 만족시키는 사운드를 검출하면, 노이즈 검출기는 사운드를 추가로 프로세싱 및/또는 분석하기 위해 사운드-타입 검출기를 개시한다. 그리고 (예를 들어, 노이즈 검출기가 더 낮은 전력 수요 및/또는 더욱 효율적인 오디오 프로세싱 알고리즘을 갖는 회로를 사용하기 때문에) 노이즈 검출기가 사운드-타입 검출기 또는 트리거 사운드 검출기보다 더 적은 전력을 요구하므로, 음성 트리거 기능은 노이즈 검출기 없이 사운드-타입 검출기와 트리거 사운드 검출기의 조합보다도 더 적은 전력을 소비한다.
일부 구현예들에서, 전술된 임의의 하나 이상의 사운드 검출기는, 이들이 "온(on)" 및 "오프(off)" 상태 사이에서 순환되는 듀티 사이클에 따라 동작된다. 이것은 음성 트리거의 전력 소비를 감소시키는 것을 추가로 돕는다. 예를 들어, 일부 구현예들에서, 노이즈 검출기가 10ms 동안 "온"되고(즉, 오디오 채널을 활동적으로 모니터링함) 이어지는 90ms 동안 "오프"된다. 이러한 방식으로, 노이즈 검출기는 시간의 90% 동안 "오프"되는 동시에, 여전히 효율적으로 연속적인 노이즈 검출 기능을 제공한다. 일부 구현예들에서, 사운드 검출기들에 대한 온 및 오프 지속시간은 트리거 사운드가 여전히 입력 중인 동안에 모든 검출기들이 활성화되도록 선택된다. 예를 들어, "안녕, 시리"의 트리거 구에 있어서, 사운드 검출기들은 트리거 구가 듀티 사이클(들) 내의 어디에서 시작하더라도 트리거 사운드 검출기가 충분한 양의 입력을 분석하기 위해 시간 내에 활성화되도록 구성될 수 있다. 예를 들어, 트리거 사운드 검출기는 사운드가 트리거 구에 부합한다고 결정하기에 충분한 사운드인 "녕 시리"를 수신, 프로세싱 및 분석하기 위해 시간 내에 활성화될 것이다. 일부 구현예들에서, 사운드 입력의 더 큰 부분이 분석될 수 있도록 사운드 입력이 업스트림 검출기에 수신되고 전달될 때 메모리 내에 저장된다. 따라서, 트리거 구가 발언된 후까지도 트리거 사운드 검출기가 개시되지 않는다고 해도, 여전히 전체 기록된 트리거 구를 분석할 수 있다.
일부 구현예들은 음성 트리거를 동작하기 위한 방법을 제공한다. 이 방법은 하나 이상의 프로세서 및 하나 이상의 프로세서에 의해 실행하기 위한 명령어들을 저장하는 메모리를 포함하는 전자 디바이스에서 수행된다. 이 방법은 사운드 입력을 수신하는 것을 포함한다. 이 방법은 또한 사운드 입력의 적어도 일부분이 사전결정된 타입의 사운드에 대응하는지 여부를 결정하는 것을 포함한다. 이 방법은 사운드 입력의 적어도 일부분이 사전결정된 타입에 대응한다는 결정에 따라, 사운드 입력이 사전결정된 콘텐츠를 포함하는지 여부를 결정하는 것을 더 포함한다. 이 방법은, 사운드 입력이 사전결정된 콘텐츠를 포함한다는 결정에 따라, 스피치-기반 서비스를 개시하는 것을 더 포함한다. 일부 구현예들에서, 스피치-기반 서비스는 음성-기반 디지털 어시스턴트이다. 일부 구현예들에서, 스피치-기반 서비스는 딕테이션(dictation) 서비스이다.
일부 구현예들에서, 사운드 입력이 사전결정된 타입의 사운드에 대응하는지 여부를 결정하는 것은 제1 사운드 검출기에 의해 수행되고, 사운드 입력이 사전결정된 콘텐츠를 포함하는지 여부를 결정하는 것은 제2 사운드 검출기에 의해 수행된다. 일부 구현예들에서, 제1 사운드 검출기는 동작 중에 제2 사운드 검출기보다 더 적은 전력을 소비한다. 일부 구현예들에서, 제1 사운드 검출기는 사운드 입력의 주파수-도메인 분석을 수행한다. 일부 구현예들에서, 사운드 입력이 사전결정된 타입의 사운드에 대응하는지 여부를 결정하는 것은 (예를 들어, 아래에서 논의되는 제3 사운드 검출기에 의해 결정되는 바와 같이) 사운드 입력이 사전결정된 조건을 만족시킨다는 결정에 따라 수행된다.
일부 구현예들에서, 제1 사운드 검출기는 듀티 사이클에 따라 오디오 채널을 주기적으로 모니터링한다. 일부 구현예들에서, 듀티 사이클은 약 20ms의 온-시간 및 약 100ms의 오프-시간을 포함한다.
일부 구현예들에서, 사전결정된 타입은 사람의 음성이고 사전결정된 콘텐츠는 하나 이상의 단어이다. 일부 구현예들에서, 사운드 입력의 적어도 일부분이 사전결정된 타입의 사운드에 대응하는지 여부를 결정하는 것은 사운드 입력의 적어도 일부분이 사람의 음성의 주파수 특징을 포함하는지 여부를 결정하는 것을 포함한다.
일부 구현예들에서, 제2 사운드 검출기는 사운드 입력이 사전결정된 타입에 대응한다는 제1 사운드 검출기에 의한 결정에 응답하여 개시된다. 일부 구현예들에서, 제2 사운드 검출기는 사운드 입력이 사전결정된 타입에 대응한다는 제1 사운드 검출기에 의한 결정 후 적어도 사전결정된 길이의 시간 동안 동작된다. 일부 구현예들에서, 사전결정된 길이의 시간은 사전결정된 콘텐츠의 지속시간에 대응한다.
일부 구현예들에서, 사전결정된 콘텐츠는 하나 이상의 사전결정된 음소이다. 일부 구현예들에서, 하나 이상의 사전결정된 음소는 적어도 하나의 단어를 구성한다.
일부 구현예들에서, 이 방법은, 사운드 입력이 사전결정된 타입의 사운드에 대응하는지 여부를 결정하기 전에, 사운드 입력이 사전결정된 조건을 만족시키는지 여부를 결정하는 것을 포함한다. 일부 구현예들에서, 사전결정된 조건은 진폭 임계값이다. 일부 구현예들에서, 사운드 입력이 사전결정된 조건을 만족시키는지 여부를 결정하는 것은 제3 사운드 검출기에 의해 수행되며, 이때 제3 사운드 검출기는 동작 중에 제1 사운드 검출기보다 더 적은 전력을 소비한다. 일부 구현예들에서, 제3 사운드 검출기는 듀티 사이클에 따라 오디오 채널을 주기적으로 모니터링한다. 일부 구현예들에서, 듀티 사이클은 약 20ms의 온-시간 및 약 500ms의 오프-시간을 포함한다. 일부 구현예들에서, 제3 사운드 검출기는 사운드 입력의 시간-도메인 분석을 수행한다.
일부 구현예들에서, 이 방법은 사운드 입력의 적어도 일부분을 메모리에 저장하고, 스피치-기반 서비스가 개시되면 사운드 입력의 해당 부분을 스피치-기반 서비스에 제공하는 것을 포함한다. 일부 구현예들에서, 사운드 입력의 해당 부분은 직접 메모리 액세스를 이용하여 메모리에 저장된다.
일부 구현예들에서, 이 방법은 사운드 입력이 특정 사용자의 음성에 대응하는지 여부를 결정하는 것을 포함한다. 일부 구현예들에서, 스피치-기반 서비스는 사운드 입력이 사전결정된 콘텐츠를 포함하고 사운드 입력이 특정 사용자의 음성에 대응한다는 결정에 따라 개시된다. 일부 구현예들에서, 스피치-기반 서비스는 사운드 입력이 사전결정된 콘텐츠를 포함하고 사운드 입력이 특정 사용자의 음성에 대응하지 않는다는 결정에 따라 제한된 액세스 모드로 개시된다. 일부 구현예들에서, 이 방법은 사운드 입력이 특정 사용자의 음성에 대응한다는 결정에 따라, 특정 사용자의 이름을 포함하는 음성 프롬프트(prompt)를 출력하는 것을 포함한다.
일부 구현예들에서, 사운드 입력이 사전결정된 콘텐츠를 포함하는지 여부를 결정하는 것은 사운드 입력의 표현을 기준 표현에 비교하는 것과, 사운드 입력의 표현이 기준 표현에 부합하는 경우 사운드 입력이 사전결정된 콘텐츠를 포함한다고 결정하는 것을 포함한다. 일부 구현예들에서, 만약 사운드 입력의 표현이 사전결정된 신뢰도로 기준 표현에 부합한다면 부합이 결정된다. 일부 구현예들에서, 이 방법은 이 사운드 입력을 포함하는 복수의 사운드 입력을 수신하는 것; 그리고 개별 사운드 입력들이 사전결정된 콘텐츠를 포함한다는 결정에 응답하여, 복수의 사운드 입력들 중 개별 사운드 입력들을 이용하여 기준 표현을 반복하여 조정하는 것을 포함한다.
일부 구현예들에서, 이 방법은 전자 디바이스가 사전결정된 방향에 있는지 여부를 결정하는 것과, 전자 디바이스가 사전결정된 방향에 있다는 결정에 따라 음성 트리거의 사전결정된 모드를 활성화하는 것을 포함한다. 일부 구현예들에서, 사전결정된 방향은 실질적으로 수평이고 아래를 보고 있는 디바이스의 디스플레이 스크린에 대응하며, 사전결정된 모드는 스탠바이 모드이다. 일부 구현예들에서, 사전결정된 방향은 실질적으로 수평이고 위를 보고 있는 디바이스의 디스플레이 스크린에 대응하며, 사전결정된 모드는 청취 모드이다.
일부 구현예들은 음성 트리거를 동작시키기 위한 방법을 제공한다. 이 방법은 하나 이상의 프로세서 및 하나 이상의 프로세서에 의해 실행하기 위한 명령어들을 저장하는 메모리를 포함하는 전자 디바이스에서 수행된다. 이 방법은 제1 모드에서 음성 트리거를 동작시키는 것을 포함한다. 이 방법은 전자 디바이스의 하나 이상의 마이크로폰 및 카메라가 폐색되었음(occluded)을 검출함으로써 전자 디바이스가 실질적으로 밀폐된 공간 내에 있는지 여부를 결정하는 것을 더 포함한다. 이 방법은 전자 디바이스가 실질적으로 밀폐된 공간 내에 있다는 결정에 따라, 음성 트리거를 제2 모드로 전환하는 것을 더 포함한다. 일부 구현예들에서, 제2 모드는 스탠바이 모드이다.
일부 구현예들은 음성 트리거를 동작시키기 위한 방법을 제공한다. 이 방법은 하나 이상의 프로세서 및 하나 이상의 프로세서에 의해 실행하기 위한 명령어들을 저장하는 메모리를 포함하는 전자 디바이스에서 수행된다. 이 방법은 전자 디바이스가 사전결정된 방향에 있는지 여부를 결정하는 것과, 전자 디바이스가 사전결정된 방향에 있다는 결정에 따라 음성 트리거의 사전결정된 모드를 활성화하는 것을 포함한다. 일부 구현예들에서, 사전결정된 방향은 실질적으로 수평이고 아래를 보고 있는 디바이스의 디스플레이 스크린에 대응하며, 사전결정된 모드는 스탠바이 모드이다. 일부 구현예들에서, 사전결정된 방향은 실질적으로 수평이고 위를 보고 있는 디바이스의 디스플레이 스크린에 대응하며, 사전결정된 모드는 청취 모드이다.
일부 구현예들에 따르면, 전자 디바이스는 사운드 입력을 수신하도록 구성된 사운드 수신 유닛; 및 사운드 수신 유닛에 연결된 프로세싱 유닛을 포함한다. 프로세싱 유닛은 사운드 입력의 적어도 일부분이 사전결정된 타입의 사운드에 대응하는지 여부를 결정하고; 사운드 입력의 적어도 일부분이 사전결정된 타입에 대응한다는 결정에 따라, 사운드 입력이 사전결정된 콘텐츠를 포함하는지 여부를 결정하며; 사운드 입력이 사전결정된 콘텐츠를 포함한다는 결정에 따라, 스피치-기반 서비스를 개시하도록 구성된다. 일부 구현예들에서, 프로세싱 유닛은 사운드 입력이 사전결정된 타입의 사운드에 대응하는지 여부를 결정하기 전에, 사운드 입력이 사전결정된 조건을 만족시키는지 여부를 결정하도록 추가로 구성된다. 일부 구현예들에서, 프로세싱 유닛은 사운드 입력이 특정 사용자의 음성에 대응하는지 여부를 결정하도록 추가로 구성된다.
일부 구현예들에 따르면, 전자 디바이스는 복수의 모드들 중 제1 모드에서 음성 트리거를 동작시키도록 구성된 음성 트리거 유닛; 및 음성 트리거 유닛에 연결된 프로세싱 유닛을 포함한다. 일부 구현예들에서, 프로세싱 유닛은: 전자 디바이스의 하나 이상의 마이크로폰 및 카메라가 폐색되어 있음을 검출함으로써 전자 디바이스가 실질적으로 밀폐된 공간 내에 있는지 여부를 결정하고; 전자 디바이스가 실질적으로 밀폐된 공간 내에 있다는 결정에 따라, 음성 트리거를 제2 모드로 전환하도록 구성된다. 일부 구현예들에서, 프로세싱 유닛은 전자 디바이스가 사전결정된 방향에 있는지 여부를 결정하고; 전자 디바이스가 사전결정된 방향에 있다는 결정에 따라, 음성 트리거의 사전결정된 모드를 활성화하도록 구성된다.
일부 구현예들에 따르면, 컴퓨터 판독가능한 저장 매체(예를 들어, 비일시적 컴퓨터 판독가능한 저장 매체)가 제공되며, 컴퓨터 판독가능한 저장 매체는 전자 디바이스의 하나 이상의 프로세서에 의해 실행하기 위한 하나 이상의 프로그램을 저장하고, 하나 이상의 프로그램은 본 명세서에 기술된 방법들 중 임의의 방법을 수행하기 위한 명령어들을 포함한다.
일부 구현예들에 따르면, 본 명세서에 기술된 방법들 중 임의의 방법을 수행하기 위한 수단을 포함하는 전자 디바이스(예를 들어, 휴대용 전자 디바이스)가 제공된다.
일부 구현예들에 따르면, 본 명세서에 기술된 방법들 중 임의의 방법을 수행하도록 구성된 프로세싱 유닛을 포함하는 전자 디바이스(예를 들어, 휴대용 전자 디바이스)가 제공된다.
일부 구현예들에 따르면, 하나 이상의 프로세서 및 하나 이상의 프로세서에 의해 실행하기 위한 하나 이상의 프로그램을 저장하는 메모리를 포함하는 전자 디바이스(예를 들어, 휴대용 전자 디바이스)가 제공되며, 하나 이상의 프로그램은 본 명세서에 기술된 방법들 중 임의의 방법을 수행하기 위한 명령어들을 포함한다.
일부 구현예들에 따르면, 전자 디바이스에서 사용하기 위한 정보 프로세싱 장치가 제공되며, 이러한 정보 프로세싱 장치는 본 명세서에 기술된 방법들 중 임의의 방법을 수행하기 위한 수단을 포함한다.
도 1은 일부 구현예들에 따른 디지털 어시스턴트가 동작하는 환경을 도시하는 블록 다이어그램이다.
도 2는 일부 구현예들에 따른 디지털 어시스턴트 클라이언트 시스템을 도시하는 블록 다이어그램이다.
도 3a는 일부 구현예들에 따른 독립형 디지털 어시스턴트 시스템 또는 디지털 어시스턴트 서버 시스템을 도시하는 블록 다이어그램이다.
도 3b는 일부 구현예들에 따른 도 3a에 도시된 디지털 어시스턴트의 기능들을 도시하는 블록 다이어그램이다.
도 3c는 일부 구현예들에 따른 온톨로지(ontology)의 일부분을 도시하는 네트워크도이다.
도 4는 일부 구현예들에 따른 음성 트리거 시스템의 컴포넌트들을 도시한 블록 다이어그램이다.
도 5 내지 도 7은 일부 구현예들에 따른 음성 트리거 시스템을 동작하기 위한 방법들을 도시한 순서도이다.
도 8 및 도 9는 일부 구현예들에 따른 전자 디바이스의 기능 블록 다이어그램이다.
동일한 도면 부호들은 도면들 전체에 걸쳐 대응하는 부분들을 가리킨다.
도 1은 일부 구현예들에 따른 디지털 어시스턴트의 동작 환경(100)의 블록 다이어그램이다. "디지털 어시스턴트", "가상 어시스턴트", "인텔리전트 자동화 어시스턴트", "음성-기반 디지털 어시스턴트", 또는 "자동 디지털 어시스턴트"와 같은 용어들은 사용자 의도를 추론하기 위해서 자연 언어 입력을 구두의(spoken) 및/또는 텍스트의(textual) 형태로 해석하고(예를 들어, 자연 언어 입력에 상응하는 작업 타입을 식별), 추론된 사용자 의도에 기초하여 행동들을 수행하는(예를 들어, 식별된 작업 타입에 상응하는 작업을 수행) 임의의 정보 프로세싱 시스템을 지칭한다. 예를 들면, 추론된 사용자 의도를 좇아 행동하기 위해, 시스템은 다음의 것 중 하나 이상을 수행할 수 있다: 추론된 사용자 의도를 달성하도록 설계된 단계들 및 파라미터들을 갖는 작업 흐름을 식별하는 단계(예를 들어, 작업 유형을 식별하는 단계), 추론된 사용자 의도로부터의 특정 요구사항들을 작업 흐름에 입력하는 단계, 프로그램, 방법, 서비스, API 등을 호출함으로써 작업 흐름을 실행하는 단계(예를 들어, 서비스 제공자에게 요청을 송신하는 단계), 및 청각적(예를 들어, 스피치) 및/또는 시각적 형태로 사용자에 대한 출력 응답을 생성하는 단계.
특히, 한번 개시되면, 디지털 어시스턴트 시스템은 적어도 부분적으로 자연 언어 커맨드, 요청, 진술, 서술 및/또는 조회의 형태인 사용자 요청을 수용할 수 있다. 통상적으로, 사용자 요청은 디지털 어시스턴트 시스템을 통해 정보를 제공하는 대답 또는 작업의 수행 중 하나를 요구한다. 사용자 요청에 대한 만족스러운 응답은 일반적으로 요구한 정보를 제공하는 대답의 제공, 요구한 작업의 수행 중 하나, 또는 이 둘의 조합이다. 예를 들어, 사용자는 디지털 어시스턴트 시스템에게 "지금 내가 어디에 있습니까?"와 같은 질문을 할 수 있다. 사용자의 현재 위치에 기초하여, 디지털 어시스턴트는 "당신은 서문 근처 센트럴파크에 있습니다"라고 대답할 수 있다. 사용자는 또한 예를 들어 "나의 친구들을 다음주 내 여자친구의 생일파티에 초대해주세요"라고 진술함으로써 작업의 수행을 요청할 수 있다. 그에 대한 응답으로, 디지털 어시스턴트는 "네, 바로 실행하겠습니다"라는 음성 출력을 생성함으로써 요청을 수신하였음을 알린 후에 사용자의 이메일 주소로부터 사용자의 전자 주소록 또는 연락처 목록에 나열된 사용자의 친구들 각각에게 적절한 캘린더 초대를 전송할 수 있다. 정보 또는 다양한 작업들의 수행을 요청하기 위해 디지털 어시스턴트와 상호작용하는 많은 다른 방식들이 존재한다. 언어적 응답을 제공하는 것과 프로그래밍된 행동을 취하는 것 외에도, 디지털 어시스턴트는 또한 (예를 들어, 텍스트, 알람, 음악, 비디오, 애니메이션 등과 같은) 다른 시각적 또는 청각적 형태의 응답도 제공할 수 있다.
도 1에 도시된 바와 같이, 일부 구현예들에서, 디지털 어시스턴트 시스템은 클라이언트-서버 모델에 따라 구현된다. 디지털 어시스턴트 시스템은 사용자 디바이스(예를 들어, (104a, 104b)) 상에서 실행되는 클라이언트 측 부분(예를 들어, (102a, 102b))(아래에서는 "디지털 어시스턴트(DA) 클라이언트(102)") 및 서버 시스템(108) 상에서 실행되는 서버 측 부분(106)(아래에서는 "디지털 어시스턴트(DA) 서버(106)")을 포함한다. DA 클라이언트(102)는 하나 이상의 네트워크(110)를 통해 DA 서버(106)와 통신한다. DA 클라이언트(102)는, 사용자 대면(user-facing) 입출력 프로세싱 및 DA 서버(106)와의 통신과 같은 클라이언트 측 기능들을 제공한다. DA 서버(106)는 (클라이언트 디바이스 또는 전자 디바이스로도 지칭되는) 개별 사용자 디바이스(104) 상에 각각 존재하는 임의의 수의 DA 클라이언트(102)에 대한 서버 측 기능들을 제공한다.
일부 구현예들에서, DA 서버(106)는 클라이언트-대면 I/O 인터페이스(112), 하나 이상의 프로세싱 모듈(114), 데이터 및 모델(116), 외부 서비스에 대한 I/O 인터페이스(118), 사진 및 태그 데이터베이스(130) 및 사진-태그 모듈(132)을 포함한다. 클라이언트-대면 I/O 인터페이스는 디지털 어시스턴트 서버(106)에 대한 클라이언트-대면 입출력 프로세싱을 가능하게 한다. 하나 이상의 프로세싱 모듈(114)은 데이터 및 모델(116)을 활용하여 자연 언어 입력에 기초해 사용자의 의도를 결정하고 추론된 사용자 의도에 기초하여 작업 실행을 수행한다. 사진 및 태그 데이터베이스(130)는 디지털 사진들의 핑거프린트 및 선택적으로는 디지털 사진들 자체뿐만 아니라, 디지털 사진들과 연관된 태그들을 저장한다. 사진-태그 모듈(132)은 태그를 생성하고, 사진 및/또는 핑거프린트와 연관하여 태그를 저장하고, 사진을 자동으로 태그하고, 태그를 사진 내의 위치에 링크시킨다.
일부 구현예들에서, DA 서버(106)는 작업 완료 또는 정보 획득을 위해 네트워크(들)(110)를 통해 외부 서비스(120)(예를 들어, 내비게이션 서비스(들)(122-1), 메시징 서비스(들)(122-2), 정보 서비스(들)(122-3), 캘린더 서비스(122-4), 텔레포니 서비스(122-5), 사진 서비스(들)(122-6) 등)와 통신한다. 외부 서비스(118)에 대한 I/O 인터페이스는 이러한 통신을 용이하게 한다.
사용자 디바이스(104)의 예에는 핸드헬드 컴퓨터, 개인용 디지털 어시스턴트(PDA), 태블릿 컴퓨터, 랩톱 컴퓨터, 데스크탑 컴퓨터, 셀룰러 전화기, 스마트폰, 개선된 일반 패킷 무선 서비스(enhanced general packet radio service, EGPRS) 모바일 전화기, 미디어 플레이어, 탐색 디바이스, 게임 콘솔, 텔레비전, 원격 조종기, 또는 이러한 데이터 프로세싱 디바이스들 중 임의의 둘 이상의 조합 또는 임의의 다른 적절한 데이터 프로세싱 디바이스들이 포함되지만, 이에 제한되지는 않는다. 사용자 디바이스(104)에 대한 더 자세한 내용은 도 2에 도시된 예시적인 사용자 디바이스(104)를 참조하여 제공된다.
통신 네트워크(들)(110)의 예에는 로컬 영역 네트워크(LAN) 및 예로서 인터넷과 같은 광역 네트워크(WAN)가 포함된다. 통신 네트워크(들)(110)는 다양한 유선 또는 무선 프로토콜, 예컨대 이더넷(Ethernet), 범용 직렬 버스(Universal Serial Bus, USB), 화이어와이어(FIREWIRE), 모바일 통신용 글로벌 시스템(Global System for Mobile Communication, GSM), 개선된 데이터 GSM 환경(Enhanced Data GSM Environment, EDGE), 코드 분할 다중 접속(code division multiple access, CDMA), 시간 분할 다중 접속(time division multiple access, TDMA), 블루투스(Bluetooth), Wi-Fi, VoIP(voice over Internet Protocol), Wi-MAX, 또는 임의의 다른 적합한 통신 프로토콜을 포함하는 임의의 알려진 네트워크 프로토콜을 사용하여 구현될 수 있다.
서버 시스템(108)은 적어도 하나의 데이터 프로세싱 장치 및/또는 분산된 컴퓨터들의 네트워크 상에서 구현될 수 있다. 일부 구현예들에서, 서버 시스템(108)은 또한 제3자 서비스 제공자들(예컨대, 제3자 클라우드 서비스 제공자들)의 다양한 가상 디바이스들 및/또는 서비스들을 사용하여, 서버 시스템(108)의 기초 컴퓨팅 리소스들 및/또는 인프라구조 리소스들을 제공한다.
도 1에 도시된 디지털 어시스턴트 시스템이 클라이언트 측 부분(예를 들어, DA 클라이언트(102)) 및 서버 측 부분(예를 들어, DA 서버(106)) 모두를 포함하지만, 일부 구현예들에서, 디지털 어시스턴트 시스템은 오직 서버 측 부분(예를 들어 DA 서버(106))만을 지칭한다. 일부 구현예들에서, 디지털 어시스턴트의 기능들은 사용자 디바이스 상에 설치된 독립형 애플리케이션으로서 구현될 수 있다. 또한, 디지털 어시스턴트의 클라이언트 부분과 서버 부분 사이의 기능들의 분담은 상이한 구현예들에서 다를 수 있다. 예를 들어, 일부 구현예들에서, DA 클라이언트(102)는 오직 사용자-대면 입력 및 출력 프로세싱 기능들만을 제공하고 디지털 어시스턴트의 다른 모든 기능들을 DA 서버(106)에 위임하는 씬-클라이언트(thin-client)이다. 일부 다른 구현예들에서, DA 클라이언트(102)는 DA 서버(106)의 하나 이상의 기능들을 수행하거나 보조하도록 구성된다.
도 2는 일부 구현예들에 따른 사용자 디바이스(104)의 블록 다이어그램이다. 사용자 디바이스(104)는 메모리 인터페이스(202), 하나 이상의 프로세서(204) 및 주변장치 인터페이스(206)를 포함한다. 사용자 디바이스(104)의 다양한 컴포넌트들은 하나 이상의 통신 버스들 또는 신호 라인들에 의해 연결된다. 사용자 디바이스(104)는 주변장치 인터페이스(206)에 연결된 다양한 센서들, 서브시스템들 및 주변 디바이스들을 포함한다. 센서들, 서브시스템들 및 주변 디바이스들은 정보를 수집하고/하거나 사용자 디바이스(104)의 다양한 기능들을 가능하게 한다.
예를 들어, 일부 구현예들에서, 동작 센서(210)(예를 들어, 가속도계), 광 센서(212), GPS 수신기(213), 온도 센서 및 근접 센서(214)가 방향, 광 및 근접 감지 기능을 용이하게 하도록 주변장치 인터페이스(206)에 연결된다. 일부 구현예들에서, 생체 인식 센서, 기압계 등과 같은 다른 센서들(216)이 주변장치 인터페이스(206)에 접속되어 관련 기능들을 가능하게 한다.
일부 구현예들에서, 사용자 디바이스(104)는 주변장치 인터페이스(206)에 연결된 카메라 서브시스템(220)을 포함한다. 일부 구현예들에서, 카메라 서브시스템(220)의 광학 센서(222)는 사진 촬영 및 비디오 클립 녹화와 같은 카메라 기능들을 가능하게 한다. 일부 구현예들에서, 사용자 디바이스(104)는 통신 기능들을 제공하는 하나 이상의 유선 및/또는 무선 통신 서브시스템(224)을 포함한다. 통신 서브시스템(224)은 통상적으로 다양한 통신 포트, 무선 주파수 수신기 및 송신기 및/또는 광학(예를 들어, 적외선) 수신기 및 송신기를 포함한다. 일부 구현예들에서, 사용자 디바이스(104)는 하나 이상의 스피커(228) 및 하나 이상의 마이크로폰(230)에 연결된 오디오 서브시스템(226)을 포함하여, 음성 인식, 음성 복제, 디지털 녹음 및 전화 기능들과 같은 음성-인에이블형 기능들을 가능하게 한다. 일부 구현예들에서, 오디오 서브시스템(226)은 음성 트리거 시스템(400)에 연결된다. 일부 구현예들에서, 음성 트리거 시스템(400) 및/또는 오디오 서브시스템(226)은 사운드 입력을 수신 및/또는 분석하기 위한 저전력 오디오 회로 및/또는 프로그램(즉, 하드웨어 및/또는 소프트웨어를 포함함)을 포함하며, 이들은 예를 들어 하나 이상의 아날로그-디지털 변환기, 디지털 신호 프로세서(DSP), 사운드 검출기, 메모리 버퍼, 코덱 등을 포함한다. 일부 구현예들에서, 저전력 오디오 회로는 (단독으로 또는 사용자 디바이스(104)의 다른 컴포넌트들에 더하여) 음성-기반 디지털 어시스턴트 또는 다른 스피치-기반 서비스와 같은 사용자 디바이스(104)의 하나 이상의 양태에 대한 음성(또는 사운드) 트리거 기능을 제공한다. 일부 구현예들에서, 저전력 오디오 회로는 프로세서(들)(204), I/O 서브시스템(240), 메모리(250) 등과 같은 사용자 디바이스(104)의 다른 컴포넌트들이 셧다운되고/되거나 스탠바이 모드에 있을 때에도 음성 트리거 기능을 제공한다. 음성 트리거 시스템(400)은 도 4와 관련하여 더욱 자세하게 기술된다.
일부 구현예들에서, I/O 서브시스템(240)이 또한 주변장치 인터페이스(206)에 연결된다. 일부 구현예들에서, 사용자 디바이스(104)는 터치 스크린(246)을 포함하고, I/O 서브시스템(240)은 터치 스크린(246)에 연결된 터치 스크린 제어기(242)를 포함한다. 사용자 디바이스(104)가 터치 스크린(246) 및 터치 스크린 제어기(242)를 포함할 때, 터치 스크린(246) 및 터치 스크린 제어기(242)는 통상적으로, 예를 들어 용량성, 저항성, 적외선, 표면 음파 기술, 근접 센서 어레이 등과 같은 복수의 터치 감지 기술들 중 임의의 기술을 이용하여 터치 스크린의 접촉 및 이동 또는 고장을 검출하도록 구성된다. 일부 구현예들에서, 사용자 디바이스(104)는 터치 감지 표면을 포함하지 않는 디스플레이를 포함한다. 일부 구현예들에서, 사용자 디바이스(104)는 별개의 터치 감지 표면을 포함한다. 일부 구현예들에서, 사용자 디바이스(104)는 다른 입력 제어기(들)(244)를 포함한다. 사용자 디바이스(104)가 다른 입력 제어기(들)(244)를 포함하는 경우, 다른 입력 제어기(들)(244)는 통상적으로 다른 입력/제어 디바이스(248), 예컨대 하나 이상의 버튼, 로커 스위치(rocker switch), 썸 휠(thumb-wheel), 적외선 포트, USB 포트 및/또는 스타일러스와 같은 포인터 디바이스에 연결된다.
메모리 인터페이스(202)는 메모리(250)에 연결된다. 일부 구현예들에서, 메모리(250)는 고속 랜덤 액세스 메모리 및/또는 비휘발성 메모리와 같은 비일시적(non-transitory) 컴퓨터 판독가능한 매체를 포함한다(예를 들어, 하나 이상의 자기 디스크 저장 디바이스, 하나 이상의 플래시 메모리 디바이스, 하나 이상의 광학 저장 디바이스 및/또는 다른 비휘발성 고체 상태 메모리 디바이스). 일부 구현예들에서, 메모리(250)는 운영 시스템(252), 통신 모듈(254), 그래픽 사용자 인터페이스 모듈(256), 센서 프로세싱 모듈(258), 폰 모듈(260), 애플리케이션(262) 및 이들의 하위세트 또는 상위세트를 저장한다. 운영 시스템(252)은 기본 시스템 서비스를 핸들링하고 하드웨어 의존 작업들을 수행하기 위한 명령어들을 포함한다. 통신 모듈(254)은 하나 이상의 추가 디바이스, 하나 이상의 컴퓨터 및/또는 하나 이상의 서버와의 통신을 가능하게 한다. 그래픽 사용자 인터페이스 모듈(256)은 그래픽 사용자 인터페이스 프로세싱을 가능하게 한다. 센서 프로세싱 모듈(258)은 센서 관련 프로세싱 및 기능(예를 들어, 하나 이상의 마이크로폰(228)을 이용하여 수신된 음성 입력을 프로세싱함)을 가능하게 한다. 전화 모듈(260)은 전화 관련 프로세스 및 기능을 가능하게 한다. 애플리케이션 모듈(262)은, 전자 메시징, 웹브라우징, 미디어 프로세싱, 내비게이션, 이미징 및/또는 다른 프로세스들 및 기능들과 같은 사용자 애플리케이션들의 다양한 기능성을 가능하게 한다. 일부 구현예들에서, 사용자 디바이스(104)는 외부 서비스 제공자들 중 적어도 하나와 각각 연관된 하나 이상의 소프트웨어 애플리케이션(270-1, 270-2)을 메모리(250)에 저장한다.
전술된 바와 같이, 일부 구현예들에서, 메모리(250)는 또한 디지털 어시스턴트의 클라이언트 측 기능들을 제공하기 위해 (예컨대, 디지털 어시스턴트 클라이언트 모듈(264) 내의) 클라이언트 측 디지털 어시스턴트 명령어들 및 다양한 사용자 데이터(266)(예컨대, 사용자-특정 어휘 데이터, 선호도 데이터 및/또는 사용자의 전자 주소록 또는 연락처 목록, 할 일 목록, 쇼핑 목록 등과 같은 다른 데이터)를 저장한다.
다양한 구현예들에서, 디지털 어시스턴트 클라이언트 모듈(264)은 사용자 디바이스(104)의 다양한 사용자 인터페이스(예컨대, I/O 서브시스템(244))를 통해 음성 입력, 텍스트 입력, 터치 입력 및/또는 제스처 입력을 수용할 수 있다. 디지털 어시스턴트 클라이언트 모듈(264)은 또한 청각적, 시각적 및/또는 촉각적 형태의 출력을 제공하는 것이 가능하다. 예를 들면, 출력은 음성, 사운드, 알람, 텍스트 메시지, 메뉴, 그래픽, 비디오, 애니메이션, 진동 및/또는 상기한 것들 중 2개 이상의 조합으로서 제공될 수 있다. 작동 중에, 디지털 어시스턴트 클라이언트 모듈(264)은 통신 서브시스템(224)을 이용하여 디지털 어시스턴트 서버(예를 들어, 디지털 어시스턴트 서버(106), 도 1)와 통신한다.
일부 구현예들에서, 디지털 어시스턴트 클라이언트 모듈(264)은 사용자 입력과 연관된 콘텍스트(context)를 확립하기 위해 다양한 센서, 서브시스템 및 주변장치 디바이스를 활용하여 사용자 디바이스(104)의 주변 환경으로부터 추가 정보를 수집한다. 일부 구현예들에서, 디지털 어시스턴트 클라이언트 모듈(264)은 사용자 입력과 함께 콘텍스트 정보 또는 그의 하위세트를 디지털 어시스턴트 서버(예컨대, 디지털 어시스턴트 서버(106), 도 1)에 제공하여 사용자의 의도를 추론하는 것을 돕는다.
일부 구현예들에서, 사용자 입력에 동반될 수 있는 콘텍스트 정보는 센서 정보, 예컨대 조명, 주변 소음, 주변 온도, 주위 환경의 이미지 또는 비디오 등을 포함한다. 일부 구현예들에서, 콘텍스트 정보는 또한 디바이스의 물리적 상태, 예컨대 디바이스 방향, 디바이스 위치, 디바이스 온도, 전력 레벨, 속도, 가속도, 동작 패턴들, 셀룰러 신호 강도 등을 포함한다. 일부 구현예들에서, 사용자 디바이스(106)의 소프트웨어 상태에 관련된 정보, 예컨대 사용자 디바이스(104)의 실행 중인 프로세스들, 설치된 프로그램들, 과거 및 현재의 네트워크 활동성들, 백그라운드 서비스들, 에러 로그들, 리소스 사용 등이 또한 사용자 입력과 연관된 콘텍스트 정보로서 디지털 어시스턴트 서버(예컨대, 디지털 어시스턴트 서버(106), 도 1)에 제공된다.
일부 구현예들에서, DA 클라이언트 모듈(264)은 디지털 어시스턴트 서버로부터의 요청들에 응답하여 사용자 디바이스(104) 상에 저장된 정보(예컨대, 사용자 데이터(266)의 적어도 일부분)를 선택적으로 제공한다. 일부 구현예들에서, 디지털 어시스턴트 클라이언트 모듈(264)은 또한 디지털 어시스턴트 서버(106)(도 1)에 의한 요청 시에 자연 언어 대화 또는 다른 사용자 인터페이스들을 통해 사용자로부터 추가 입력을 이끌어낸다. 디지털 어시스턴트 클라이언트 모듈(264)은, 사용자 요청에서 표현된 사용자의 의도의 의도 추론 및/또는 이행에서 디지털 어시스턴트 서버(106)를 돕기 위해, 추가적인 입력을 디지털 어시스턴트 서버(106)에 전달한다.
일부 구현예들에서, 메모리(250)는 추가 명령어들을 포함할 수 있거나 또는 더 적은 명령어들을 포함할 수 있다. 또한, 사용자 디바이스(104)의 다양한 기능들이 하나 이상의 신호 프로세싱 및/또는 애플리케이션 특정 집적 회로에 포함되는 하드웨어 및/또는 펌웨어에서 구현될 수 있으며, 따라서 사용자 디바이스(104)가 도 2에 도시된 모든 모듈 및 애플리케이션을 포함할 필요는 없다.
도 3a는 일부 구현예들에 따른 예시적인 디지털 어시스턴트 시스템(300)(디지털 어시스턴트로도 지칭됨)의 블록 다이어그램이다. 일부 구현예들에서, 디지털 어시스턴트 시스템(300)은 독립형 컴퓨터 시스템 상에서 구현된다. 일부 구현예들에서, 디지털 어시스턴트 시스템(300)은 다수의 컴퓨터들에 걸쳐서 분포된다. 일부 구현예들에서, 디지털 어시스턴트의 모듈들 및 기능들 중 일부는 서버 부분과 클라이언트 부분으로 나뉘는데, 여기서 클라이언트 부분은 사용자 디바이스(예컨대, 사용자 디바이스(104)) 상에 존재하고, 예컨대 도 1에 도시된 바와 같은 하나 이상의 네트워크들을 통해 서버 부분(예컨대, 서버 시스템(108))과 통신한다. 일부 구현예들에서, 디지털 어시스턴트 시스템(300)은 도 1에 도시된 서버 시스템(108)(및/또는 디지털 어시스턴트 서버(106))의 실시예이다. 일부 구현예들에서, 디지털 어시스턴트 시스템(300)은 사용자 디바이스(예컨대, 사용자 디바이스(104), 도 1)에서 구현되며, 그에 따라 클라이언트-서버 시스템에 대한 필요성을 제거한다. 디지털 어시스턴트 시스템(300)은 디지털 어시스턴트 시스템의 일 예에 불과하며, 디지털 어시스턴트 시스템(300)은 도시된 것보다 더 많은 또는 더 적은 컴포넌트들을 구비할 수도 있거나, 2개 이상의 컴포넌트들을 병합할 수도 있거나, 또는 컴포넌트들의 상이한 구성 또는 배치를 가질 수도 있음을 주목해야만 한다. 도 3a에 도시된 다양한 컴포넌트들은 하나 이상의 신호 프로세싱 및/또는 애플리케이션 특정 집적 회로를 포함하는 하드웨어, 소프트웨어, 펌웨어, 또는 이들의 조합에서 구현될 수 있다.
디지털 어시스턴트 시스템(300)은 메모리(302), 하나 이상의 프로세서(304), 입력/출력(I/O) 인터페이스(306) 및 네트워크 통신 인터페이스(308)를 포함한다. 이러한 컴포넌트들은 하나 이상의 통신 버스 또는 신호 라인(310)을 통해 서로 통신한다.
일부 구현예들에서, 메모리(302)는 고속 랜덤 액세스 메모리 및/또는 비휘발성 컴퓨터 판독가능 저장 매체와 같은 비일시적 컴퓨터 판독가능 매체를 포함한다(예컨대, 하나 이상의 자기 디스크 저장 디바이스, 하나 이상의 플래시 메모리 디바이스, 하나 이상의 광학 저장 디바이스 및/또는 다른 비휘발성 고체 상태 메모리 디바이스들).
I/O 인터페이스(306)는 디스플레이, 키보드, 터치 스크린 및 마이크로폰과 같은 디지털 어시스턴트 시스템(300)의 입력/출력 디바이스들(316)을 사용자 인터페이스 모듈(322)에 연결한다. I/O 인터페이스(306)는, 사용자 인터페이스 모듈(322)과 함께, 사용자 입력(예를 들어, 음성 입력, 키보드 입력, 터치 입력 등)을 수신하여 그에 따라 그것들을 프로세싱한다. 일부 구현예들에서, 디지털 어시스턴트가 독립형 사용자 디바이스 상에서 구현되는 경우, 디지털 어시스턴트 시스템(300)은 도 2의 사용자 디바이스(104)에 대해 기술된 컴포넌트들 및 I/O 및 통신 인터페이스들 중 임의의 것(예컨대, 하나 이상의 마이크로폰들(230))을 포함한다. 일부 구현예들에서, 디지털 어시스턴트 시스템(300)은 디지털 어시스턴트 구현예의 서버 부분을 나타내고, 사용자 디바이스(예컨대, 도 2에 도시된 사용자 디바이스(104)) 상에 존재하는 클라이언트 측 부분을 통해 사용자와 상호작용한다.
일부 구현예들에서, 네트워크 통신 인터페이스(308)는 유선 통신 포트(들)(312) 및/또는 무선 송신 및 수신 회로(314)를 포함한다. 유선 통신 포트(들)는 하나 이상의 유선 인터페이스, 예를 들어, 이더넷, 범용 직렬 버스(USB), 파이어와이어 등을 통해 통신 신호를 수신하고 송신한다. 무선 회로(314)는 통상적으로 통신 네트워크 및 기타 통신 디바이스로/로부터 RF 신호 및/또는 광학 신호를 수신하고 송신한다. 무선 통신들은, GSM, EDGE, CDMA, TDMA, 블루투스, 와이파이, VoIP, 와이맥스, 또는 임의의 다른 적절한 통신 프로토콜과 같은 복수의 통신 표준들, 프로토콜들 및 기술들 중 임의의 것을 사용할 수도 있다. 네트워크 통신 인터페이스(308)는 인터넷, 인트라넷 및/또는 무선 네트워크, 예컨대 셀룰러 전화 네트워크, 무선 근거리 통신망(LAN) 및/또는 도시권 통신망(metropolitan area network, MAN)과 같은 네트워크들을 통해 디지털 어시스턴트 시스템(300)과 다른 디바이스들 사이의 통신을 가능하게 한다.
일부 구현예들에서, 메모리(302)의 비일시적 컴퓨터 판독가능 저장 매체는: 프로그램, 모듈, 명령어 및 운영 시스템(318), 통신 모듈(320), 사용자 인터페이스 모듈(322), 하나 이상의 애플리케이션(324) 및 디지털 어시스턴트 모듈(326) 모두 또는 이들의 하위세트를 포함하는 데이터 구조를 저장한다. 하나 이상의 프로세서(304)는 이들 프로그램, 모듈 및 명령어를 실행하고, 데이터 구조로부터/로 판독/기록한다.
운영 시스템(318)(예컨대, 다윈(Darwin), RTXC, LINUX, UNIX, OS X, iOS, WINDOWS, 또는 VxWorks와 같은 내장형 운영 시스템)은 일반적인 시스템 작업들(예컨대, 메모리 관리, 저장 디바이스 제어, 전력 관리 등)을 제어하고 관리하기 위한 다양한 소프트웨어 컴포넌트들 및/또는 드라이버들을 포함하고, 다양한 하드웨어, 펌웨어 및 소프트웨어 컴포넌트들 간의 통신을 가능하게 한다.
통신 모듈(320)은 네트워크 통신 인터페이스(308)를 통해 다른 디바이스들과 디지털 어시스턴트 시스템(300) 사이의 통신을 가능하게 한다. 예를 들어, 통신 모듈(320)은 도 2에 도시된 디바이스(104)의 통신 모듈(254)과 통신할 수 있다. 통신 모듈(320)은 또한 무선 회로(314) 및/또는 유선 통신 포트(312)에 의해 수신되는 데이터를 핸들링하기 위한 다양한 소프트웨어 컴포넌트들을 포함한다.
일부 구현예들에서, 사용자 인터페이스 모듈(322)은 I/O 인터페이스(306)를 통해 사용자로부터(예컨대, 키보드, 터치 스크린 및/또는 마이크로폰으로부터) 커맨드 및/또는 입력을 수신하고, 디스플레이 상에 사용자 인터페이스 객체들을 제공한다.
애플리케이션들(324)은, 하나 이상의 프로세서(304)에 의해 실행되도록 구성된 프로그램들 및/또는 모듈들을 포함한다. 예를 들어, 디지털 어시스턴트 시스템이 독립형 사용자 디바이스 상에서 구현되면, 애플리케이션들(324)은, 게임, 캘린더 애플리케이션, 내비게이션 애플리케이션, 또는 이메일 애플리케이션과 같은 사용자 애플리케이션들을 포함할 수도 있다. 디지털 어시스턴트 시스템(300)이 서버 팜(server farm) 상에 구현되면, 애플리케이션들(324)은, 예를 들어, 리소스 관리 애플리케이션, 진단 애플리케이션, 또는 스케줄링 애플리케이션을 포함할 수도 있다.
메모리(302)는 또한 디지털 어시스턴트 모듈(또는 디지털 어시스턴트의 서버 부분)(326)을 저장한다. 일부 구현예들에서, 디지털 어시스턴트 모듈(326)은: 입력/출력 프로세싱 모듈(328), 스피치-텍스트(STT) 프로세싱 모듈(330), 자연 언어 프로세싱 모듈(332), 대화 흐름 프로세싱 모듈(334), 작업 흐름 프로세싱 모듈(336), 서비스 프로세싱 모듈(338) 및 사진 모듈(132)과 같은 서브 모듈들, 또는 이들의 하위세트 또는 상위세트를 포함한다. 이 프로세싱 모듈들의 각각은: 온톨로지(360), 어휘 인덱스(344), 사용자 데이터(348), 분류 모듈(349), 중의성 해결(disambiguation) 모듈(350), 작업 흐름 모델(354), 서비스 모델(356), 사진 태깅 모듈(358), 탐색 모듈(360) 및 로컬 태그/사진 스토리지(362)와 같은 디지털 어시스턴트(326)의 데이터 및 모델 중 하나 이상, 또는 이들의 하위세트 또는 상위세트에 대한 액세스를 갖는다.
일부 구현예들에서, 디지털 어시스턴트 모듈(326)에서 구현되는 프로세싱 모듈들(예컨대, 입력/출력 프로세싱 모듈(328), STT 프로세싱 모듈(330), 자연 언어 프로세싱 모듈(332), 대화 흐름 프로세싱 모듈(334), 작업 흐름 프로세싱 모듈(336) 및/또는 서비스 프로세싱 모듈(338)), 데이터 및 모델들을 이용하여, 디지털 어시스턴트 시스템(300)은: 사용자로부터 수신된 자연 언어 입력에서 표현된 사용자의 의도를 식별하는 것; 사용자의 의도를 완전히 추론하는 데 필요한 정보를 (예를 들어, 단어, 이름, 의도 등의 중의성을 해결함으로써) 능동적으로 유도하고 획득하는 것; 추론된 의도를 이행하기 위한 작업 흐름을 결정하는 것; 및 추론된 의도를 이행하기 위해 작업 흐름을 실행하는 것 중 적어도 일부를 수행한다. 일부 구현예들에서, 디지털 어시스턴트는 또한 다양한 이유들로 만족스러운 응답이 사용자에게 제공되지 않았거나 제공될 수 없었을 때 적절한 행동들을 취한다.
일부 구현예들에서, 아래에서 논의되는 바와 같이, 디지털 어시스턴트 시스템(300)이 자연 언어 입력으로부터 디지털 사진에 태그하라는 사용자의 의도를 식별하고, 적절한 정보를 이용하여 디지털 사진을 태그하도록 자연 언어 입력을 프로세싱한다. 일부 구현예들에서, 디지털 어시스턴트 시스템(300)은 자연 언어 입력을 이용한 디지털 사진 탐색, 사진의 자동-태그 등과 같이 사진과 관련된 다른 작업들도 수행한다. 도 3b에 도시된 바와 같이, 일부 구현예들에서, I/O 프로세싱 모듈(328)은 도 3a의 I/O 디바이스(316)를 통해 사용자와 상호작용하거나 또는 도 3a의 네트워크 통신 인터페이스(308)를 통해 사용자 디바이스(예를 들어, 도 1의 사용자 디바이스(104))와 상호작용하여 사용자 입력(예로서, 스피치 입력)을 획득하고 사용자 입력에 대한 응답을 제공한다. I/O 프로세싱 모듈(328)은, 사용자 입력의 수신과 함께 또는 사용자 입력의 수신 직후에, 사용자 디바이스로부터 사용자 입력과 관련된 콘텍스트 정보를 선택적으로 획득한다. 콘텍스트 정보(context information)는 사용자 입력과 관련이 있는 사용자 특정 데이터, 어휘 및/또는 선호사항을 포함한다. 일부 구현예들에서, 콘텍스트 정보는 또한 사용자 요청이 수신될 때의 디바이스(예컨대, 도 1의 사용자 디바이스(104))의 소프트웨어 및 하드웨어 상태들 및/또는 사용자 요청이 수신된 때의 사용자의 주변 환경에 관련된 정보를 포함한다. 일부 구현예들에서, I/O 프로세싱 모듈(328)은 또한 사용자 요청에 관하여 사용자에게 후속 질문들을 전송하고, 그로부터 답변들을 수신한다. 일부 구현예들에서, 사용자 요청이 I/O 프로세싱 모듈(328)에 의해 수신되고 사용자 요청이 스피치 입력을 포함하는 경우, I/O 프로세싱 모듈(328)은 스피치-텍스트 변환을 위해 스피치 입력을 스피치-텍스트(STT) 프로세싱 모듈(330)로 보낸다.
일부 구현예들에서, 스피치-텍스트 프로세싱 모듈(330)은 I/O 프로세싱 모듈(328)을 통해 스피치 입력(예컨대, 음성 녹음에서 캡처된 사용자 발언)을 수신한다. 일부 구현예들에서, 스피치-텍스트 프로세싱 모듈(330)은 음소들의 시퀀스 및 궁극적으로, 하나 이상의 언어들로 기록되는 단어들 또는 토큰(token)들의 시퀀스로서 스피치 입력을 인식하기 위해 다양한 음향 및 언어 모델들을 이용한다. 스피치-텍스트 프로세싱 모듈(330)은 임의의 적절한 스피치 인식 기술, 음향 모델 및 언어 모델, 예컨대 히든 마르코프 모델(Hidden Markov Model), 동적 타임 워핑(Dynamic Time Warping, DTW) 기반 스피치 인식 및 기타 통계 및/또는 분석 기술을 사용하여 구현된다. 일부 구현예들에서, 스피치-텍스트 프로세싱은 적어도 부분적으로 제3자 서비스에 의해 또는 사용자의 디바이스 상에서 수행될 수 있다. 스피치-텍스트 프로세싱 모듈(330)이 스피치-텍스트 프로세싱의 결과물(예를 들어, 단어들 또는 토큰들의 시퀀스)을 획득하면, 의도 추론을 위해 결과물을 자연 언어 프로세싱 모듈(332)로 전달한다. 디지털 어시스턴트(326)의 자연 언어 프로세싱 모듈(332)("자연 언어 프로세서")은 스피치-텍스트 프로세싱 모듈(330)에 의해 생성된 단어들 또는 토큰들의 시퀀스("토큰 시퀀스")를 취하여, 이러한 토큰 시퀀스를 디지털 어시스턴트에 의해 인식된 하나 이상의 "행동가능한 의도(actionable intent)"와 연관시키고자 시도한다. 본 명세서에서 사용되는 "행동가능한 의도"는 디지털 어시스턴트(326) 및/또는 디지털 어시스턴트 시스템(300)(도 3a)에 의해 수행될 수 있는 작업을 나타내며, 작업 흐름 모델(354)에서 구현되는 연관된 작업 흐름을 갖는다. 연관된 작업 흐름은 디지털 어시스턴트 시스템(300)이 작업을 수행하기 위하여 취하는 일련의 프로그래밍된 행동 및 단계들이다. 디지털 어시스턴트 시스템의 능력의 범위는 작업 흐름 모델(354) 내에서 구현되고 저장된 작업 흐름들의 수와 다양성에 의존하거나, 또는 다시 말하면, 디지털 어시스턴트 시스템(300)이 인식하는 "행동가능한 의도"의 수와 다양성에 의존한다. 그러나, 디지털 어시스턴트 시스템(300)의 실효성은 자연 언어로 표현된 사용자 요청으로부터 올바른 "행동가능한 의도(들)"를 추론하기 위한 디지털 어시스턴트 시스템의 능력에도 의존한다.
일부 구현예들에서, 스피치-텍스트 프로세싱 모듈(330)로부터 획득된 단어들 또는 토큰들의 시퀀스뿐만 아니라, 자연 언어 프로세서(332)는 또한 (예컨대, I/O 프로세싱 모듈(328)로부터) 사용자 요청과 관련된 콘텍스트 정보를 수신한다. 자연 언어 프로세서(332)는, 스피치-텍스트 프로세싱 모듈(330)로부터 수신된 토큰 시퀀스에 포함된 정보를 명확히 하고, 보충하고/하거나 더 정의하기 위해 콘텍스트 정보를 선택적으로 사용한다. 콘텍스트 정보는, 예를 들어, 사용자 선호사항, 사용자 디바이스의 하드웨어 및/또는 소프트웨어 상태, 사용자 요청 전, 요청 중, 또는 요청 직후에 수집된 센서 정보, 디지털 어시스턴트와 사용자 간의 이전 상호작용(예를 들어, 대화) 등을 포함한다.
일부 구현예들에서, 자연 언어 프로세싱은 온톨로지(360)에 기초한다. 온톨로지(360)는 복수의 노드들을 포함하고, 각각의 노드가 하나 이상의 "행동가능한 의도들" 또는 다른 "속성들"과 관련된 "행동가능한 의도" 또는 "속성"을 나타내는 계층적 구조이다. 전술된 바와 같이, "행동가능한 의도"는 디지털 어시스턴트 시스템(300)이 수행할 수 있는 작업(예를 들어, "행동가능"하거나 작용될 수 있는 작업)을 나타낸다. "속성"은 행동가능한 의도와 연관된 파라미터 또는 다른 속성의 하위-양태를 나타낸다. 온톨로지(360)에서 행동가능한 의도 노드와 속성 노드의 연결성은 속성 노드에 의해 표현되는 파라미터가 행동가능한 의도 노드에 의해 표현되는 작업에 관련되는 방식을 정의한다. 일부 구현예들에서, 온톨로지(360)는 행동가능한 의도 노드들 및 속성 노드들로 구성된다. 온톨로지(360) 내에서, 각각의 행동가능한 의도 노드는 하나 이상의 속성 노드들에 직접적으로 또는 하나 이상의 중간 속성 노드들을 통해 링크된다. 마찬가지로, 각각의 속성 노드는 하나 이상의 행동가능한 의도 노드들에 직접적으로 또는 하나 이상의 중간 속성 노드들을 통해 링크된다. 예를 들어, 도 3c에 도시된 온톨로지(360)는 행동가능한 의도 노드인 "레스토랑 예약" 노드를 포함한다. 속성 노드들 "레스토랑", (예약에 대한) "날짜/시간" 및 "인원수"가 각각 "레스토랑 예약" 노드(즉, 행동가능한 의도 노드)에 직접 링크된다. 또한, 속성 노드들 "요리", "가격대", "전화 번호" 및 "위치"는 속성 노드 "레스토랑"의 하위-노드들이며, 각각이 중간 속성 노드 "레스토랑"을 통해 "레스토랑 예약" 노드(즉, 행동가능한 의도 노드)에 링크된다. 다른 예에서, 도 3c에 도시된 온톨로지(360)는 또한 다른 행동가능한 의도 노드인 "리마인더 설정" 노드를 포함한다. 속성 노드들 (리마인더를 설정하기 위한) "날짜/시간" 및 (리마인더를 위한) "제목"이 각각 "리마인더 설정" 노드에 링크된다. 속성 "날짜/시간"이 레스토랑 예약 작업 및 리마인더 설정 작업 모두와 관련되기 때문에, 속성 노드 "날짜/시간"은 온톨로지(360)에서 "레스토랑 예약" 노드 및 "리마인더 설정" 노드 모두에 링크된다.
자신이 링크된 개념 노드들과 함께, 행동가능한 의도 노드는 "도메인"으로서 기술될 수 있다. 본 논의에서, 각각의 도메인은 각각의 행동가능한 의도와 연관되며, 특정 행동가능한 의도와 연관된 노드들의 그룹(및 그들 간의 관계)을 지칭한다. 예를 들어, 도 3c에 도시된 온톨로지(360)는 온톨로지(360) 내의 레스토랑 예약 도메인(362)의 일례 및 리마인더 도메인(364)의 일례를 포함한다. 레스토랑 예약 도메인은 행동가능한 의도 노드 "레스토랑 예약", 속성 노드들 "레스토랑", "날짜/시간" 및 "인원수" 및 하위-속성 노드들 "요리", "가격대", "전화 번호" 및 "위치"를 포함한다. 리마인더 도메인(364)은 행동가능한 의도 노드 "리마인더 설정" 및 속성 노드들 "제목" 및 "날짜/시간"을 포함한다. 일부 구현예들에서, 온톨로지(360)는 다수의 도메인들로 구성된다. 각각의 도메인은 하나 이상의 속성 노드들을 하나 이상의 다른 도메인들과 공유할 수도 있다. 예를 들어, "날짜/시간" 속성 노드는 레스토랑 예약 도메인(362) 및 리마인더 도메인(364)에 더하여 다수의 다른 도메인들(예를 들어, 스케줄링 도메인, 여행 예약 도메인, 영화 티켓 도메인 등)과 연관될 수 있다. 도 3c가 온톨로지(360) 내의 두 개의 예시적인 도메인들을 도시하지만, 온톨로지(360)는 "전화 통화 개시", "방향 찾기", "미팅 스케줄링", "메시지 전송" 및 "질문에 대한 답변 제공", "사진 태그" 등과 같은 다른 도메인들(또는 행동가능한 의도들)을 포함할 수 있다. 예를 들어, "메시지 전송" 도메인은 "메시지 전송" 행동가능한 의도 노드와 연관되고, "수신자(들)", "메시지 타입" 및 "메시지 내용"과 같은 속성 노드들을 추가로 포함할 수 있다. 속성 노드 "수신자"는 예를 들어 "수신자 이름" 및 "메시지 주소"와 같은 하위-속성 노드들에 의해 추가로 정의될 수 있다.
일부 구현예들에서, 온톨로지(360)는 디지털 어시스턴트가 이해할 수 있고 영향을 미칠 수 있는 모든 도메인들(및 이에 따른 행동가능한 의도들)을 포함한다. 일부 구현예들에서, 온톨로지(360)는, 예컨대 온톨로지(360) 내의 도메인들 또는 노드들을 추가하거나 삭제함으로써 또는 노드들 간의 관계를 수정함으로써 수정될 수 있다.
일부 구현예들에서, 다수의 관련된 행동가능한 의도들과 연관된 노드들이 온톨로지(360) 내의 "상위 도메인" 하에서 클러스터될 수 있다. 예를 들어, "여행" 상위 도메인이 여행과 관련된 속성 노드들 및 행동가능한 의도 노드들의 클러스터를 포함할 수 있다. 여행과 관련된 행동가능한 의도 노드들은 "항공권 예약", "호텔 예약", "차량 렌트", "방향 잡기", "관심 지점 찾기" 등을 포함할 수 있다. 동일한 상위 도메인(예를 들어, "여행" 상위 도메인) 하의 행동가능한 의도 노드들은 다수의 속성 노드들을 공통으로 가질 수 있다. 예를 들어, "항공권 예약", "호텔 예약", "차량 렌트", "방향 잡기", "관심 지점 찾기"에 대한 행동가능한 의도 노드들은 하나 이상의 속성 노드들 "시작 위치", "목적지", "출발 날짜/시간", "도착 날짜/시간" 및 "인원수"를 공유할 수 있다.
일부 구현예들에서, 온톨로지(360)에서 각각의 노드는 노드에 의해 표현되는 속성 또는 행동가능한 의도와 관련된 단어들 및/또는 구들의 세트와 연관된다. 각각의 노드와 연관된 단어들 및/또는 구들의 개별 세트는 노드와 연관된 이른바 "어휘"이다. 각각의 노드와 연관된 단어들 및/또는 구들의 개별 세트는 노드에 의해 표현되는 속성 또는 행동가능한 의도와 연관되어 어휘 인덱스(344)(도 3b)에 저장될 수 있다. 예를 들어, 도 3b로 돌아오면, "레스토랑"의 속성에 대한 노드와 연관된 어휘가 "음식", "음료", "요리", "배고픔", "먹다", "피자", "패스트 푸드", "식사" 등과 같은 단어들을 포함할 수 있다. 다른 예를 들면, "전화 통화 개시"의 행동가능한 의도에 대한 노드와 연관된 어휘는 "통화", "전화", "다이얼", "신호음", "이 번호로 전화", "-에게 전화 걸기" 등과 같은 단어들 및 구들을 포함할 수 있다. 어휘 인덱스(344)는 상이한 언어들의 단어들과 구들을 선택적으로 포함한다. 일부 구현예들에서, 도 3b에 도시된 자연 언어 프로세서(332)는 스피치-텍스트 프로세싱 모듈(330)로부터 토큰 시퀀스(예컨대, 텍스트 스트링)를 수신하고, 토큰 시퀀스 내의 단어들에 의해 어떤 노드들이 연루되는지를 결정한다. 일부 구현예들에서, 만약 토큰 시퀀스 내의 단어 또는 구가 (어휘 인덱스(344)를 통해) 온톨로지(360) 내의 하나 이상의 노드와 연관되는 것으로 발견되면, 단어 또는 구는 이러한 노드들을 "트리거" 또는 "활성화"할 것이다. 다수의 노드들이 활성화된 노드들의 수 및/또는 상대적인 중요도에 기초하여 "트리거된" 경우에, 자연 언어 프로세서(332)는 디지털 어시스턴트가 수행하도록 사용자가 의도한 작업(또는 작업 유형)으로서 행동가능한 의도들 중 하나를 선택할 것이다. 일부 구현예들에서, 가장 "트리거된" 노드들을 갖는 도메인이 선택된다. 일부 구현예들에서, (예컨대, 그의 다양한 트리거된 노드들의 상대적 중요도에 기초하여) 최고 신뢰 값을 갖는 도메인이 선택된다. 일부 구현예들에서, 도메인은 트리거된 노드들의 수 및 중요도의 조합에 기초하여 선택된다. 일부 구현예들에서, 디지털 어시스턴트 시스템(300)이 사용자로부터의 유사한 요청을 이전에 정확하게 해석했는지 여부와 같은 추가 인자들이 또한 노드를 선택하는 데 있어 고려된다.
일부 구현예들에서, 디지털 어시스턴트 시스템(300)은 또한 어휘 인덱스(344) 내의 특정 엔티티(entity)들의 이름들을 저장하여, 이들 이름들 중 하나가 사용자 요청에서 검출되는 경우, 자연 언어 프로세서(332)는 이름이 온톨로지 내의 속성 또는 하위-속성의 특정 사례를 지칭한다는 것을 인식할 수 있을 것이다. 일부 구현예들에서, 특정 엔티티들의 이름은 사업체, 레스토랑, 사람, 영화 등의 이름이다. 일부 구현예들에서, 디지털 어시스턴트 시스템(300)은 사용자의 주소록 또는 연락처 목록, 영화 데이터베이스, 음악가 데이터베이스 및/또는 레스토랑 데이터베이스와 같은 다른 데이터 소스들로부터 특정 엔티티 이름을 검색할 수 있고 식별할 수 있다. 일부 구현예들에서, 토큰 시퀀스 내의 단어가 (사용자 주소록 또는 연락처 목록 내의 이름과 같은) 특정 엔티티의 이름임을 자연 언어 프로세서(332)가 식별하는 경우, 그 단어는 사용자 요청에 대한 온톨로지 내의 행동가능한 의도를 선택함에 있어서 추가적인 중요성을 부여받는다. 예를 들어, "Mr. Santo"라는 단어들이 사용자 요청으로부터 인식된 경우, 성인 "Santo"가 사용자의 연락처 목록 내의 연락처들 중 하나로서 어휘 인덱스(344) 내에서 발견되며, 그 다음 사용자 요청이 "메시지 전송" 또는 "전화 통화 개시" 도메인에 대응할 가능성이 있다. 다른 예를 들면, "ABC 카페"라는 단어들이 사용자 요청에서 발견된 경우, 용어 "ABC 카페"가 사용자의 도시 내의 특정 레스토랑의 이름으로서 어휘 인덱스(344)에서 발견되며, 그 다음 사용자 요청이 "레스토랑 예약" 도메인에 대응할 가능성이 있다.
사용자 데이터(348)는, 사용자 특정 어휘, 사용자 선호사항, 사용자 주소, 사용자의 디폴트 언어와 제2 언어, 사용자의 연락처 목록 및 각각의 사용자에 대한 다른 단기 또는 장기 정보와 같은 사용자 특정 정보를 포함한다. 자연 언어 프로세서(332)는 사용자 특정 정보를 사용해서 사용자 입력에 포함된 정보를 보충하여 사용자 의도를 추가적으로 정의한다. 예를 들어, "나의 친구들을 나의 생일 파티에 초대해주세요"라는 사용자 요청에 대해서, 사용자가 자신의 요청 내에 이러한 정보를 명확하게 제공할 것을 요구하지 않고 자연 언어 프로세서(332)가 "친구들"이 누구이며 "생일 파티"가 언제 어디에서 열리는지를 결정하기 위해 사용자 데이터(348)에 액세스할 수 있다.
일부 구현예들에서, 자연 언어 프로세서(332)는 분류 모듈(349)을 포함한다. 일부 구현예들에서, 분류 모듈(349)은, 아래에서 더 상세히 논의되는 바와 같이, (예컨대, 디지털 사진과 관련된 스피치 입력에 대응하는) 텍스트 스트링 내의 하나 이상의 용어들 각각이 엔티티, 활동성, 또는 위치 중 하나인지 여부를 결정한다. 일부 구현예들에서, 분류 모듈(349)은 하나 이상의 용어들의 각각의 용어를 엔티티, 활동성, 또는 위치 중 하나로서 분류한다. 자연 언어 프로세서(332)가 사용자 요청에 기초하여 행동가능한 의도(또는 도메인)를 식별하면, 자연 언어 프로세서(332)는 식별된 행동가능한 의도를 나타내기 위하여 구조화된 쿼리(structured query)를 생성한다. 일부 구현예들에서, 구조화된 쿼리는, 행동가능한 의도를 위한 도메인 내의 하나 이상의 노드에 대한 파라미터들을 포함하고, 파라미터들 중 적어도 일부에는 사용자 요청에 명시된 특정 정보 및 요건들이 기재된다. 예를 들어, 사용자는 "초밥집에 7시로 저녁 예약을 해주세요"라고 말할 수 있다. 이러한 경우에, 자연 언어 프로세서(332)는 사용자 입력에 기초하여 행동가능한 의도가 "레스토랑 예약"인 것으로 올바르게 식별하는 것이 가능할 수 있다. 온톨로지에 따라서, "레스토랑 예약" 도메인에 대해 구조화된 쿼리가 {요리}, {시간}, {날짜}, {인원수} 등과 같은 파라미터들을 포함할 수 있다. 사용자의 발언에 포함된 정보에 기초하여, 자연 언어 프로세서(332)는 레스토랑 예약 도메인에 대해 부분적인 구조화된 쿼리를 생성할 수 있으며, 여기에서 부분적인 구조화된 쿼리는 파라미터들 {요리= "초밥"} 및 {시간= "저녁 7시"}를 포함한다. 그러나, 이러한 예에서, 사용자의 발언은 도메인과 연관된 구조화된 쿼리를 완성하기에 불충분한 정보를 포함한다. 따라서, {인원수} 및 {날짜}와 같은 다른 필요한 파라미터들이 현재 이용가능한 정보에 기초하여 구조화된 쿼리에서 식별되지 않는다. 일부 구현예들에서, 자연 언어 프로세서(332)는 수신된 콘텍스트 정보를 구조화된 쿼리의 일부 파라미터들에 기재한다. 예를 들어, 만약 사용자가 "내 근처에 있는" 초밥 레스토랑을 요청하였다면, 자연 언어 프로세서(332)는 사용자 디바이스(104)로부터의 GPS 좌표를 이용하여 구조화된 쿼리 내에 {위치} 파라미터를 이주시킬 수 있다.
일부 구현예들에서, 자연 언어 프로세서(332)는 (임의의 완성된 파라미터들을 포함하는) 구조화된 쿼리를 작업 흐름 프로세싱 모듈(336)("작업 흐름 프로세서")로 전달한다. 작업 흐름 프로세서(336)는: 자연 언어 프로세서(332)로부터 구조화된 쿼리를 수신하는 것, 구조화된 쿼리를 완성하는 것, 사용자의 궁극적인 요청을 "완성"하기 위해 요구되는 행동들을 수행하는 것 중 하나 이상을 수행하도록 구성된다. 일부 구현예들에서, 이들 작업들을 완수하는 데 필요한 다양한 절차들이 작업 흐름 모델(354)에서 제공된다. 일부 구현예들에서, 작업 흐름 모델(354)은 사용자로부터 추가 정보를 획득하기 위한 절차 및 행동가능한 의도와 연관된 행동들을 수행하기 위한 작업 흐름들을 포함한다. 위에서 설명된 바와 같이, 구조화된 쿼리를 완성시키기 위해, 작업 흐름 프로세서(336)는 추가적인 정보를 얻고/얻거나 잠재적으로 중의적인 발언들을 명확하게 하도록 사용자와 추가적인 대화를 개시할 필요가 있을 수도 있다. 이러한 상호작용이 필요한 경우, 작업 흐름 프로세서(336)는 사용자와의 대화에 관여하기 위해 대화 프로세싱 모듈(334)("대화 프로세서")을 호출한다. 일부 구현예들에서, 대화 프로세싱 모듈(334)은 어떻게(그리고/또는 언제) 사용자에게 추가 정보를 요청할 것인지 결정하고, 사용자 응답들을 수신하고 프로세싱한다. 일부 구현예들에서, 질문들은 I/O 프로세싱 모듈(328)을 통해 사용자들에게 제공되고 이들로부터 답변들이 수신된다. 예를 들어, 대화 프로세싱 모듈(334)은 청각적 및/또는 시각적 출력을 통해 사용자에게 대화 출력을 표시하고, 구두의 또는 물리적(예를 들어, 터치 제스처) 응답을 통해 사용자로부터 입력을 수신한다. 위의 예시에서 계속하여, 작업 흐름 프로세서(336)가 도메인 "레스토랑 예약"과 연관된 구조화된 쿼리에 대한 "인원수" 및 "날짜" 정보를 결정하도록 대화 프로세서(334)를 호출하면, 대화 프로세서(334)는 사용자에게 전달하기 위한 "인원수는?" 및 "날짜는?"과 같은 질문들을 생성한다. 사용자로부터 대답이 수신되면, 대화 프로세싱 모듈(334)은 구조화된 쿼리에 부족한 정보를 기재하거나 정보를 작업 흐름 프로세서(336)에 전달하여 구조화된 쿼리로부터 부족한 정보를 완성한다.
몇몇 경우들에서, 작업 흐름 프로세서(336)는 하나 이상의 중의적인 속성들을 갖는 구조화된 쿼리를 수신할 수도 있다. 예를 들어, "메시지 전송" 도메인에 대한 구조화된 쿼리는 의도된 수신자가 "Bob"임을 나타낼 수 있고, 이때 사용자가 "Bob"이라는 이름의 다수의 연락처를 가지고 있을 수 있다. 작업 흐름 프로세서(336)는 대화 프로세서(334)가 이러한 구조화된 쿼리의 속성의 중의성을 해결할 것을 요청할 것이다. 그 결과, 대화 프로세서(334)는 사용자에게 "어떤 Bob?"이라고 물어볼 수 있고, 사용자가 선택할 수 있는 "Bob"이라는 이름의 연락처들의 목록을 디스플레이(또는 판독)할 수 있다.
일부 구현예들에서, 대화 프로세서(334)는 중의성 해결 모듈(350)을 포함한다. 일부 구현예들에서, 중의성 해결 모듈(350)은 하나 이상의 중의적 용어들(예컨대, 디지털 사진과 관련된 스피치 입력에 대응하는 텍스트 스트링 내의 하나 이상의 중의적 용어들)의 중의성을 해결한다. 일부 구현예들에서, 중의성 해결 모듈(350)은 하나 이상의 용어들 중 제1 용어가 다수의 후보 의미들을 가짐을 식별하고, 사용자에게 제1 용어에 관한 추가 정보를 프롬프트하고, 프롬프트에 응답하여 사용자로부터 추가 정보를 수신하고, 추가 정보에 따라 제1 용어에 관련된 엔티티, 활동성, 또는 위치를 식별한다.
일부 구현예들에서, 중의성 해결 모듈(350)은 대명사들의 중의성을 해결한다. 그러한 구현예들에서, 중의성 해결 모듈(350)은 하나 이상의 용어들 중 하나를 대명사로서 식별하고, 대명사가 지칭하는 명사를 결정한다. 일부 구현예들에서, 중의성 해결 모듈(350)은 전자 디바이스의 사용자와 관련된 연락처 목록을 사용함으로써 대명사가 지칭하는 명사를 결정한다. 대안적으로, 또는 추가로, 중의성 해결 모듈(350)은 대명사가 이전에 태그했던 디지털 사진과 관련된 이전 스피치 입력에서 식별된 엔티티, 활동성, 또는 위치의 이름으로서 지칭하는 명사를 결정한다. 대안적으로, 또는 추가로, 중의성 해결 모듈(350)은 대명사가 이전에 태그했던 디지털 사진과 관련된 이전 스피치 입력에 기초하여 식별된 사람의 이름으로서 지칭하는 명사를 결정한다. 일부 구현예들에서, 중의성 해결 모듈(350)은 용어들 중 하나 이상의 것의 의미를 결정하기 위해 핸드헬드 전자 디바이스(예컨대, 사용자 디바이스(104))의 하나 이상의 센서들(예컨대, 근접 센서(214), 광 센서(212), GPS 수신기(213), 온도 센서(215) 및 모션 센서(210))로부터 획득된 정보에 액세스한다. 일부 구현예들에서, 중의성 해결 모듈(350)은 엔티티, 활동성, 또는 위치 중 하나와 각각 관련되는 두 개의 용어들을 식별한다. 예를 들어, 두 개의 용어들 중 제1의 것은 사람을 지칭하고, 두 개의 용어들 중 제2의 것은 위치를 지칭한다. 일부 구현예들에서, 중의성 해결 모듈(350)은 엔티티, 활동성, 또는 위치 중 하나와 각각 관련되는 세 개의 용어들을 식별한다.
작업 흐름 프로세서(336)가 행동가능한 의도에 대한 구조화된 쿼리를 완성시키면, 작업 흐름 프로세서(336)는 행동가능한 의도와 관련된 궁극적인 작업을 수행하도록 진행한다. 따라서, 작업 흐름 프로세서(336)는 구조화된 쿼리에 포함된 특정 파라미터에 따라 작업 흐름 모델에서 단계 및 명령어를 실행한다. 예를 들어, "레스토랑 예약"의 행동가능한 의도에 대한 작업 흐름 모델은 레스토랑에 접촉하여 특정 시간에 특정 인원수에 대해 실질적으로 예약할 것을 요청하는 단계들 및 명령어들을 포함할 수 있다. 예를 들어, {레스토랑 예약, 레스토랑 = ABC 카페, 날짜 = 3/12/2012, 시간 = 오후 7시, 인원수 = 5}와 같은 구조화된 쿼리를 이용하여, 작업 흐름 프로세서(336)가: (1) ABC 카페의 서버 또는 ABC 카페와 같은 다수의 레스토랑에 대한 예약을 수용하도록 구성된 레스토랑 예약 시스템에 로그인하는 단계, (2) 웹사이트 상에서 소정 양식에 날짜, 시간 및 인원수 정보를 입력하는 단계, (3) 양식을 제출하는 단계 및 (4) 사용자의 캘린더에 예약에 대한 캘린더 입력을 행하는 단계들을 수행할 수 있다. 아래에서 더 상세히 기술되는 다른 예에서, 작업 흐름 프로세서(336)는, 예컨대 사진 모듈(132)과 함께, 음성 입력에 응답하여 디지털 사진들을 태그하는 것 또는 검색하는 것과 관련되는 단계들 및 명령어들을 실행한다. 일부 구현예들에서, 작업 흐름 프로세서(336)는 사용자 입력 내에서 요청된 작업을 완수하기 위해 또는 사용자 입력 내에서 요청된 정보제공 답변을 제공하기 위해 서비스 프로세싱 모듈(338)("서비스 프로세서")의 지원을 사용한다. 예를 들어, 서비스 프로세서(338)는 전화 통화, 캘린더 입력 설정, 지도 탐색 호출, 사용자 디바이스 상에 설치된 다른 사용자 애플리케이션들 호출 또는 그와의 상호작용 및 제3자 서비스(예를 들어, 레스토랑 예약 포털, 소셜 네트워킹 웹사이트 또는 서비스, 은행 포털 등)의 호출 또는 그와의 상호작용을 위해 작업 흐름 프로세서(336)를 대신하여 행동할 수 있다. 일부 구현예들에서, 각각의 서비스에 의해 요구되는 프로토콜들 및 애플리케이션 프로그래밍 인터페이스(API)들은 서비스 모델들(356)의 각각의 서비스 모델에 의해 명시될 수 있다. 서비스 프로세서(338)는 서비스를 위한 적절한 서비스 모델에 액세스하고 서비스 모델에 따른 서비스에 의해 요구되는 프로토콜 및 API에 따라 서비스에 대한 요청을 생성한다.
예를 들어, 레스토랑이 온라인 예약 서비스를 가능하게 한 경우, 레스토랑은 예약에 필요한 파라미터 및 온라인 예약 서비스에 필요한 파라미터들의 값을 전달하기 위한 API를 명시하는 서비스 모델을 제출할 수 있다. 작업 흐름 프로세서(336)에 의해 요청되는 경우, 서비스 프로세서(338)는 서비스 모델(356)에 저장된 웹 주소를 사용하여 온라인 예약 서비스와의 네트워크 접속을 설정하고, 온라인 예약 서비스의 API에 따른 포맷으로 예약에 필요한 파라미터(예를 들어, 시간, 날짜, 인원수)를 온라인 예약 인터페이스에 전송할 수 있다.
일부 구현예들에서, 자연 언어 프로세서(332), 대화 프로세서(334) 및 작업 흐름 프로세서(336)는 사용자의 의도를 추론 및 정의하고, 사용자 의도를 더 명확히 하고 세밀하게 하도록 정보를 획득하고, 최종적으로 사용자의 의도를 이행하기 위해 응답을 생성(예를 들어, 사용자에게 출력을 제공하거나, 작업을 완수)하도록 총체적이고 반복적으로 사용된다.
일부 구현예들에서, 사용자의 요청을 이행하는 데 필요한 모든 작업들이 수행된 후, 디지털 어시스턴트(326)는 확인 응답을 표현하고, I/O 프로세싱 모듈(328)을 통해 사용자에게 응답을 회신한다. 사용자 요청이 정보를 제공하는 대답을 요구하는 경우, 확인 응답은 사용자에게 요청된 정보를 표시한다. 일부 구현예들에서, 디지털 어시스턴트는 또한 사용자가 디지털 어시스턴트(326)에 의해 생성된 응답에 만족하는지 여부를 나타내도록 사용자에게 요청한다.
이제 일부 구현예들에 따른 음성 트리거 시스템(400)의 컴포넌트들을 도시한 블록 다이어그램인 도 4에 집중한다. (음성 트리거 시스템(400)은 음성에만 제한되지 않으며, 본 명세서에 기술된 구현예들은 비-음성 사운드들에도 동일하게 적용된다.) 음성 트리거 시스템(400)은 전자 디바이스(104) 내의 다양한 컴포넌트들, 모듈들 및/또는 소프트웨어 프로그램들로 구성된다. 일부 구현예들에서, 음성 트리거 시스템(400)은 각각이 오디오 버스(401)에 연결된 노이즈 검출기(402), 사운드-타입 검출기(404), 트리거 사운드 검출기(406) 및 스피치-기반 서비스(408) 및 오디오 서브시스템(226)을 포함한다. 일부 구현예들에서, 더 많거나 더 적은 수의 이러한 모듈들이 사용된다. 사운드 검출기(402, 404, 406)는 모듈들로 지칭될 수 있으며, 하드웨어(예로서, 회로, 메모리, 프로세서 등), 소프트웨어(예로서, 프로그램, 소프트웨어-온-칩, 펌웨어 등) 및/또는 본 명세서에 기술된 기능을 수행하기 위한 이들의 임의의 조합들을 포함할 수 있다. 일부 구현예들에서, 사운드 검출기들은 파선들에 의해 도 4에 도시된 바와 같이, (예를 들어, 통신 버스를 통해) 서로에게 통신상, 프로그램상, 물리적으로 및/또는 동작상 연결된다. (설명의 용이성을 위해서, 도 4는 각각의 사운드 검출기가 오직 인접한 사운드 검출기들에만 연결된 것으로 도시한다. 각각의 사운드 검출기는 임의의 다른 사운드 검출기들에도 연결될 수 있다는 것이 이해될 것이다.)
일부 구현예들에서, 오디오 서브시스템(226)은 코덱(410), 오디오 디지털 신호 프로세서(DSP)(412) 및 메모리 버퍼(414)를 포함한다. 일부 구현예들에서, 오디오 서브시스템(226)은 하나 이상의 마이크로폰(230)(도 2) 및 하나 이상의 스피커(228)(도 2)에 연결된다. 오디오 서브시스템(226)은 프로세싱 및/또는 분석을 위해 (전화 및/또는 전화의 기저대역 서브시스템과 같은 다른 컴포넌트들 또는 모듈들뿐만 아니라) 사운드 검출기(402, 404, 406) 및 스피치-기반 서비스(408)에도 사운드 입력을 제공한다. 일부 구현예들에서, 오디오 서브시스템(226)은 적어도 하나의 마이크로폰(418) 및 적어도 하나의 스피커(420)를 포함하는 외부 오디오 시스템(416)에 연결된다.
일부 구현예들에서, 스피치-기반 서비스(408)는 음성-기반 디지털 어시스턴트이며, 도 1 내지 도 3c를 참조하여 전술된 디지털 어시스턴트 시스템의 하나 이상의 컴포넌트 또는 기능에 대응한다. 일부 구현예들에서, 스피치-기반 서비스는 일부 구현예들에서 스피치-텍스트 서비스, 딕테이션 서비스 등이며, 노이즈 검출기(402)는 오디오 서브시스템(226)으로부터의 사운드 입력이 진폭 임계값과 같은 사전결정된 조건을 만족시키는지 여부를 결정하도록 오디오 채널을 모니터링한다. 오디오 채널은 하나 이상의 마이크로폰(230)(도 2)과 같은 하나 이상의 사운드 픽업 디바이스에 의해 수신된 오디오 정보의 스트림에 대응한다. 오디오 채널은 오디오 정보를 프로세싱 및/또는 전송하는 프로세싱의 상태 또는 특정 하드웨어와 무관한 오디오 정보를 지칭한다. 예를 들어, 오디오 채널은 마이크로폰(230)으로부터의 아날로그식 전기 임펄스(및/또는 이것이 전파되는 회로)뿐만 아니라, (예를 들어, 오디오 서브시스템(226) 및/또는 전자 디바이스(104)의 임의의 다른 오디오 프로세싱 시스템에 의한) 아날로그식 전기 임펄스의 프로세싱으로 발생한 디지털식으로 인코딩된 오디오 스트림을 지칭할 수 있다.
일부 구현예들에서, 사전결정된 조건은 사운드 입력이 사전결정된 시간의 길이 동안 소정의 볼륨 위에 있는지의 여부이다. 일부 구현예들에서, 노이즈 검출기는 (사운드-타입 검출기(404), 트리거 워드 검출기(406) 및/또는 스피치-기반 서비스(408)에 의해 수행되는 것과 같은) 다른 타입의 분석에 비교하여 상대적으로 작은 컴퓨터 및 배터리 리소스를 요구하는 사운드 입력의 시간-도메인 분석을 사용한다. 일부 구현예들에서, 예를 들어 주파수-도메인 분석을 포함하는 다른 타입의 신호 프로세싱 및/또는 오디오 분석이 사용된다. 만약 노이즈 검출기(402)가 사운드 입력이 사전결정된 조건을 만족시킨다고 결정한다면, (하나 이상의 프로세싱 루틴을 개시하기 위해 제어 신호를 제공함으로써 및/또는 업스트림 사운드 검출기에 전력을 제공함으로써) 사운드-타입 검출기(404)와 같은 업스트림 사운드 검출기를 개시한다. 일부 구현예들에서, 업스트림 사운드 검출기는 다른 조건들이 만족되는 것에 응답하여 개시된다. 예를 들어, 일부 구현예들에서, 업스트림 사운드 검출기는 디바이스가 (예를 들어, 광의 임계 레벨을 검출하는 광 검출기에 기초하여) 밀폐된 공간 내에 보관되어 있지 않다는 결정에 응답하여 개시된다.
사운드-타입 검출기(404)는 사운드 입력이 사람의 음성, 휘파람, 손뼉 등의 특징 사운드와 같은 소정의 타입의 사운드에 대응하는지 여부를 결정하도록 오디오 채널을 모니터링한다. 사운드-타입 검출기(404)가 인식하도록 구성된 사운드의 타입은 음성 트리거가 인식하도록 구성된 특정 트리거 사운드(들)에 대응할 것이다. 트리거 사운드가 구술된 단어 또는 구인 구현예들에서, 사운드-타입 검출기(404)는 "음성 활동 검출기(VAD)"를 포함한다. 일부 구현예들에서, 사운드-타입 검출기(404)는 사운드 입력의 주파수-도메인 분석을 사용한다. 예를 들어, 사운드-타입 검출기(404)는 (예를 들어, 푸리에 변환(Fourier transform)을 이용하여) 수신된 사운드 입력의 스펙트로그램(spectrogram)을 생성하고, 사운드 입력이 특정 타입 또는 카테고리의 사운드(예를 들어, 사람의 스피치)에 대응할 가능성이 있는지 여부를 결정하도록 사운드 입력의 스펙트럼 컴포넌트들을 분석한다. 따라서, 트리거 사운드가 구술된 단어 또는 구인 구현예들에서, 만약 오디오 채널이 주변 사운드(예를 들어, 교통 소음)를 듣지만 사람의 스피치를 듣지 않는다면, VAD는 트리거 사운드 검출기(406)를 개시하지 않을 것이다. 일부 구현예들에서, 사운드-타입 검출기(404)는 임의의 다운스트림 사운드 검출기(예를 들어, 노이즈 검출기(402))의 사전결정된 조건이 만족되는 한 활동적으로 남아있게 된다. 예를 들어, 일부 구현예들에서, 사운드-타입 검출기(404)는 사운드 입력이 (노이즈 검출기(402)에 의해 결정된 바와 같은) 사전결정된 진폭 임계값 위에 있는 사운드를 포함하는 한 활동적으로 남아있으며, 사운드가 사전결정된 임계값 아래로 하강하는 경우 비활성화된다. 일부 구현예들에서, 한번 개시되면, 사운드-타입 검출기(402)는 타이머의 만료(예를 들어, 1, 2, 5, 또는 10초, 또는 임의의 다른 적절한 지속시간 동안), 사운드-타입 검출기(404)의 온/오프 사이클의 소정의 횟수의 만료, 또는 이벤트의 발생(예를 들어, 노이즈 검출기(402) 및/또는 사운드-타입 검출기(404)에 의해 결정된 바와 같이, 제2 임계값 아래로 사운드의 진폭이 떨어지는 것)과 같은 조건이 만족될 때까지 활동적으로 남아있게 된다.
전술된 바와 같이, 만약 사운드-타입 검출기(404)가 사운드 입력이 사운드의 사전결정된 타입에 대응한다고 결정하면, (예를 들어, 하나 이상의 프로세싱 루틴을 개시하기 위해 제어 신호를 제공함으로써 및/또는 업스트림 사운드 검출기에 전력을 제공함으로써) 트리거 사운드 검출기(406)와 같은 업스트림 사운드 검출기를 개시한다.
트리거 사운드 검출기(406)는 사운드 입력이 소정의 사전결정된 콘텐츠의 적어도 부분(예를 들어, 트리거 단어, 구, 또는 사운드의 적어도 부분)을 포함하는지 여부를 결정하도록 구성된다. 일부 구현예들에서, 트리거 사운드 검출기(406)는 사운드 입력의 표현("입력 표현")을 트리거 단어의 하나 이상의 기준 표현에 비교한다. 만약 입력 표현이 수용가능한 신뢰도를 가지고 하나 이상의 기준 표현 중 적어도 하나에 부합하면, 트리거 사운드 검출기(406)는 (예를 들어, 하나 이상의 프로세싱 루틴을 개시하기 위해 제어 신호를 제공함으로써 및/또는 업스트림 사운드 검출기에 전력을 제공함으로써) 스피치-기반 서비스(408)를 개시한다. 일부 구현예들에서, 입력 표현 및 하나 이상의 기준 표현은 스펙트로그램(또는 이것의 수학적 표현)이며, 이것은 신호의 스펙트럼 밀도가 시간에 따라 어떻게 달라지는지를 나타낸다. 일부 구현예들에서, 표현들은 다른 타입의 오디오 서명 또는 성문(voiceprint)이다. 일부 구현예들에서, 스피치-기반 서비스(408)를 개시하는 것은 하나 이상의 회로, 프로그램 및/또는 프로세서를 스탠바이 모드로부터 불러내는 것과 사운드-기반 서비스를 호출하는 것을 포함한다. 그 다음 사운드-기반 서비스는 더욱 포괄적인 스피치 인식, 스피치-텍스트 프로세싱 및/또는 자연 언어 프로세싱을 제공할 준비가 된다. 일부 구현예들에서, 음성-트리거 시스템(400)은 음성 인증 기능을 포함하며, 그에 따라 만약 사운드 입력이 디바이스의 소유자/사용자와 같은 특정 인물의 음성에 대응하는지를 결정할 수 있다. 예를 들어, 일부 구현예들에서, 사운드-타입 검출기(404)는 사운드 입력이 인증된 사용자에 의해 발언되었는지를 결정하기 위한 성문 감정 기술을 사용한다. 음성 인증 및 성문 감정은 미국 특허 출원 제13/053,144호에서 더욱 자세하게 기술되며, 이것은 본 출원의 출원인에게 양도되어 그 전체가 본 명세서에 참조로서 포함된다. 일부 구현예들에서, 음성 인증은 본 명세서에 기술된 임의의 사운드 검출기들(예를 들어, 노이즈 검출기(402), 사운드-타입 검출기(404), 트리거 사운드 검출기(406) 및/또는 스피치-기반 서비스(408))에 포함된다. 일부 구현예들에서, 음성 인증은 (예를 들어, 도 4의 음성 인증 모듈(428)과 같이) 위에서 나열된 사운드 검출기들과는 별개의 모듈로서 구현되며, 노이즈 검출기(402) 뒤에, 사운드-타입 검출기(404) 뒤에, 트리거 사운드 검출기(406) 뒤에, 또는 임의의 다른 적절한 위치에 동작상 위치될 수 있다.
일부 구현예들에서, 트리거 사운드 검출기(406)는 임의의 다운스트림 사운드 검출기(들)(예를 들어, 노이즈 검출기(402) 및/또는 사운드-타입 검출기(404))의 조건이 만족되는 한 활동적으로 남아있게 된다. 예를 들어, 일부 구현예들에서, 트리거 사운드 검출기(406)는 사운드 입력이 (노이즈 검출기(402)에 의해 검출된 것과 같이) 사전결정된 임계값 위에 있는 사운드를 포함하는 한 활동적으로 남아있게 된다. 일부 구현예들에서, 이것은 사운드 입력이 (사운드-타입 검출기(404)에 의해서 검출된 것과 같이) 소정의 타입의 사운드를 포함하는 한 활동적으로 남아있게 된다. 일부 구현예들에서, 이것은 전술된 조건들이 만족되는 한 활동적으로 남아있게 된다.
일부 구현예들에서, 한번 개시되면, 트리거 사운드 검출기(406)는 타이머의 만료(예를 들어, 1, 2, 5, 또는 10초, 또는 임의의 다른 적절한 지속시간), 트리거 사운드 검출기(406)의 온/오프 사이클의 소정의 횟수의 만료, 또는 이벤트의 발생(예를 들어, 제2 임계값 아래로 사운드의 진폭이 떨어지는 것)과 같은 조건이 만족될 때까지 활동적으로 남아있게 된다. 일부 구현예들에서, 하나의 사운드 검출기가 다른 검출기를 개시할 때, 두 사운드 검출기들 모두가 활동적으로 남아있게 된다. 그러나, 사운드 검출기들은 다양한 시간에서 활동적 또는 비활동적일 수 있으며, 업스트림 사운드 검출기들이 활동적이기 위해서 모든 다운스트림(예로서, 더 낮은 전력 및/또는 세련도) 사운드 검출기들이 활동적이어야 할 필요는 없다(또는 그들 각각의 조건들이 만족될 필요가 없다). 예를 들어, 일부 구현예들에서, 노이즈 검출기(402) 및 사운드-타입 검출기(404)가 그들 각각의 조건들이 만족된다고 결정한 후에, 트리거 사운드 검출기(406)가 개시되고, 노이즈 검출기(402) 및 사운드-타입 검출기(404) 중 하나 또는 둘 모두는 트리거 사운드 검출기(406)가 동작하는 동안 비활성화되고/되거나 스탠바이 모드에 진입한다. 다른 구현예들에서, 노이즈 검출기(402) 및 사운드-타입 검출기(404) 모두가(또는 이들 중 하나가) 트리거 사운드 검출기(406)가 동작하는 동안 활동적 상태에 머무른다. 다양한 구현예들에서, 사운드 검출기들의 서로 다른 조합들이 서로 다른 시간에 활동적이고, 활동적 또는 비활동적인지 여부는 다른 사운드 검출기들의 상태에 의존할 수 있거나, 또는 다른 사운드 검출기들의 상태에 대해 독립적일 수 있다.
도 4가 세 개의 분리된 사운드 검출기들을 묘사하지만, 각각이 사운드 입력의 서로 다른 양태들을 검출하도록 구성되며, 더 많거나 더 적은 사운드 검출기들이 음성 트리거의 다양한 구현에서 사용된다. 예를 들어, 일부 구현예들에서, 오직 트리거 사운드 검출기(406)만이 사용된다. 일부 구현예들에서, 트리거 사운드 검출기(406)는 노이즈 검출기(402) 또는 사운드-타입 검출기(404)와 함께 사용된다. 일부 구현예들에서, 모든 검출기들(402-406)이 사용된다. 일부 구현예들에서, 추가적인 사운드 검출기들도 포함된다.
또한, 사운드 검출기들의 서로 다른 조합들이 서로 다른 시간에서 사용될 수 있다. 예를 들어, 사운드 검출기들의 특정 조합 및 그들이 상호작용하는 방식이 디바이스의 콘텍스트 또는 동작 상태와 같은 하나 이상의 조건에 의존할 수 있다. 구체적인 예와 같이, 만약 디바이스가 플러그인 된다면(그리고 그에 따라 오로지 배터리 전력에만 의존하지 않는다면), 트리거 사운드 검출기(406)가 활동적인 반면, 노이즈 검출기(402) 및 사운드-타입 검출기(404)는 비활동적으로 남아있게 된다. 다른 예에서, 만약 디바이스가 주머니 또는 백팩 내에 있다면, 모든 사운드 검출기들이 비활동적이다. 전술된 바와 같이 사운드 검출기들을 캐스케이드함으로써, 더 낮은 전력을 요구하는 검출기들에 의해 필요할 때에만 더 많은 전력을 요구하는 검출기들이 호출되고, 전력 효율 음성 트리거링 기능이 제공될 수 있다. 전술된 바와 같이, 추가적인 전력 효율이 듀티 사이클에 따라서 하나 이상의 사운드 검출기를 동작함으로써 획득된다. 예를 들어, 일부 구현예들에서, 시간의 적어도 부분 동안 노이즈 검출기가 오프된다고 해도, 노이즈 검출기(402)는 효율적으로 연속적인 노이즈 검출을 수행하도록 듀티 사이클에 따라 동작한다. 일부 구현예들에서, 노이즈 검출기(402)는 10ms 동안 온(on)되고 90ms 동안 오프(off)된다. 일부 구현예들에서, 노이즈 검출기(402)는 20ms 동안 온되고 500ms 동안 오프된다. 다른 온 및 오프 지속시간들도 가능하다.
일부 구현예들에서, 만약 노이즈 검출기(402)가 자신의 "온" 간격 동안 노이즈를 검출한다면, 노이즈 검출기(402)는 사운드 입력의 추가적인 프로세싱 및/또는 분석을 위해 온으로 남아있을 것이다. 예를 들어, 노이즈 검출기(402)는 이것이 사전결정된 시간의 길이(예로서, 100ms) 동안 사전결정된 진폭 위의 사운드를 검출한다면 업스트림 사운드 검출기를 개시하도록 구성될 수 있다. 따라서, 만약 노이즈 검출기(402)가 자신의 10ms "온" 간격 동안 사전결정된 진폭보다 높은 사운드를 검출하면, 즉시 "오프" 간격으로 진입하지 않을 것이다. 대신, 노이즈 검출기(402)는 활동적으로 남아있게 되며 전체 사전결정된 지속시간(예로서, 100ms) 동안 임계값을 초과하는지 여부를 결정하기 위해 사운드 입력을 계속해서 프로세싱한다.
일부 구현예들에서, 사운드-타입 검출기(404)는 듀티 사이클에 따라 동작한다. 일부 구현예들에서, 사운드-타입 검출기(404)는 20ms 동안 온되고 100ms 동안 오프된다. 다른 온 및 오프 지속시간들도 가능하다. 일부 구현예들에서, 사운드-타입 검출기(404)는 사운드 입력이 자신의 듀티 사이클의 "온" 간격 내에서 사전결정된 타입의 사운드에 대응하는지 여부를 결정할 수 있다. 따라서, 사운드-타입 검출기(404)는 만약 사운드-타입 검출기(404)가 자신의 "온" 간격 동안 사운드가 소정의 타입임을 결정하면, 트리거 사운드 검출기(406) (및 임의의 다른 업스트림 사운드 검출기)를 개시할 것이다. 이와 달리, 일부 구현예들에서, 만약 사운드-타입 검출기(404)가 "온" 간격 동안 사전결정된 타입에 대응할 수 있는 사운드를 검출한다면, 검출기는 즉시 "오프" 간격으로 진입하지 않을 것이다. 대신, 사운드-타입 검출기(404)는 활동적으로 남아있게 되며 계속해서 사운드 입력을 프로세싱하여 그것이 사전결정된 타입의 사운드에 대응하는지 여부를 결정한다. 일부 구현예들에서, 만약 사운드 검출기가 사전결정된 타입의 사운드가 검출되었다고 결정하면, 사운드 입력을 추가로 프로세싱하고 트리거 사운드가 검출되었는지 여부를 결정하기 위해 트리거 사운드 검출기(406)를 개시한다. 노이즈 검출기(402) 및 사운드-타입 검출기(404)와 유사하게, 일부 구현예들에서, 트리거 사운드 검출기(406)는 듀티 사이클에 따라 동작한다. 일부 구현예들에서, 트리거 사운드 검출기(406)는 50ms 동안 온되고 50ms 동안 오프된다. 다른 온 및 오프 지속시간들도 가능하다. 만약 트리거 사운드 검출기(406)가 자신의 "온" 간격 동안 트리거 사운드에 대응할 수 있는 사운드가 존재한다는 것을 검출하면, 검출기는 즉시 "오프" 간격으로 진입하지 않을 것이다. 대신, 트리거 사운드 검출기(406)는 활동적으로 남아있게 되며 계속해서 사운드 입력을 프로세싱하여 그것이 트리거 사운드를 포함하는지 여부를 결정한다. 일부 구현예들에서, 만약 이러한 사운드가 검출되면, 트리거 사운드 검출기(406)는 1, 2, 5, 또는 10초, 또는 임의의 다른 적절한 지속시간과 같은 사전결정된 지속시간 동안 오디오를 프로세싱하기 위해 활동적으로 남아있게 된다. 일부 구현예들에서, 지속시간은 검출하도록 구성된 특정한 트리거 단어 또는 사운드의 길이에 기초하여 선택된다. 예를 들어, 만약 트리거 구가 "안녕, 시리(SIRI)"라면, 트리거 단어 검출기는 사운드 입력이 해당 구를 포함하는지 여부를 결정하기 위해 약 2초 동안 동작된다.
일부 구현예들에서, 사운드 검출기들 중 일부가 듀티 사이클에 따라 동작되는 반면, 다른 사운드 검출기들은 활동적인 경우 계속해서 동작한다. 예를 들어, 일부 구현예들에서, 오직 제1 사운드 검출기만이 듀티 사이클에 따라 동작되며(예를 들어, 도 4의 노이즈 검출기(402)), 업스트림 사운드 검출기들은 그들이 한번 개시되면 계속해서 동작된다. 일부 다른 구현예들에서, 노이즈 검출기(402) 및 사운드-타입 검출기(404)가 듀티 사이클에 따라 동작되는 반면, 트리거 사운드 검출기(406)는 계속해서 동작된다. 특정한 사운드 검출기가 계속해서 동작되는지 또는 듀티 사이클에 따라 동작되는지 여부는 디바이스의 콘텍스트 또는 동작 상태와 같은 하나 이상의 조건에 의존한다. 일부 구현예들에서, 만약 디바이스가 플러그인 되었고 오로지 배터리 전력에만 의존하지 않는다면, 모든 사운드 검출기들이 한번 개시되면 계속해서 동작한다. 다른 구현예들에서, 만약 (예로서 센서 및/또는 마이크로폰 신호에 의해 결정된 바와 같이) 디바이스가 주머니 또는 백팩 내에 있다면 노이즈 검출기(402)(또는 임의의 사운드 검출기)가 듀티 사이클에 따라 동작하지만, 디바이스가 보관되어 있지 않은 가능성이 있는 것으로 결정되는 경우에는 계속해서 동작한다. 일부 구현예들에서, 특정한 사운드 검출기가 계속해서 동작되는지 또는 듀티 사이클에 따라 동작되는지 여부는 디바이스의 배터리 충전 레벨에 의존한다. 예를 들어, 배터리 충전이 50%보다 위에 있으면 노이즈 검출기(402)가 계속해서 동작하며, 배터리 충전이 50%보다 아래에 있으면 듀티 사이클에 따라 동작한다. 일부 구현예들에서, 음성 트리거는 노이즈, 에코 및/또는 사운드 소거 기능(집합적으로 노이즈 소거로 지칭됨)을 포함한다. 일부 구현예들에서, 노이즈 소거(noise cancellation)는 오디오 서브시스템(226)에 의해 (예를 들어, 오디오 DSP(412)에 의해) 수행된다. 노이즈 소거는 이것이 사운드 검출기들에 의해 프로세싱되기 전에 사운드 입력으로부터 원치 않는 노이즈 또는 사운드를 감소시키거나 제거한다. 일부 경우들에서, 원치 않는 노이즈는 팬(fan) 또는 키보드의 클릭 소리와 같은 사용자의 환경으로부터의 배경 노이즈이다. 일부 구현예들에서, 원치 않는 노이즈는 사전결정된 진폭 또는 주파수에 있거나 또는 그보다 위, 또는 아래에 있는 임의의 사운드이다. 예를 들어, 일부 구현예들에서, 전형적인 사람의 음성 범위(예를 들어, 3000 ㎐)보다 위에 있는 사운드가 신호로부터 필터링되거나 제거된다. 일부 구현예들에서, 다수의 마이크로폰(예로서, 마이크로폰(230))이 수신된 사운드의 어떤 컴포넌트들이 감소 및/또는 제거되어야만 하는지를 결정하는 것을 돕도록 사용된다. 예를 들어, 일부 구현예들에서, 오디오 서브시스템(226)은 공간 내의 단일 포인트(예를 들어, 사용자의 입)로부터 유래한 것으로 나타나는 사운드 또는 사운드 입력의 부분들을 식별하기 위한 빔 형성 기술을 사용한다. 그 다음 오디오 서브시스템(226)은 모든 마이크로폰들에 의해 동일하게 수신되는 입력 사운드(예를 들어, 임의의 특정 방향으로부터 유래한 것으로 나타나지 않는 주변 사운드)를 사운드로부터 제거함으로써 이러한 사운드에 초점을 맞춘다.
일부 구현예들에서, DSP(412)는 디지털 어시스턴트가 동작하는 디바이스에 의해 출력되고 있는 입력 사운드를 사운드로부터 소거 또는 제거하도록 구성된다. 예를 들어, 만약 오디오 서브시스템(226)이 음악, 라디오, 팟캐스트, 음성 출력, 또는 임의의 다른 오디오 콘텐츠를 (예로서 스피커(228)를 통해서) 출력하고 있다면, DSP(412)는 마이크로폰에 의해 들리고 사운드 입력 내에 포함된 임의의 출력된 사운드를 제거한다. 따라서, 사운드 입력은 출력된 오디오로부터 자유롭다(또는 적어도 출력된 오디오를 거의 포함하지 않는다). 따라서, 사운드 검출기들에게 제공된 사운드 입력은 더욱 깨끗할 것이며, 트리거는 보다 정확할 것이다. 노이즈 소거의 양태들은 미국 특허 제7,272,224호에 더욱 자세하게 기술되었으며, 이것은 본 출원의 출원인에게 양도되어 그 전체가 본 명세서에 참조로서 포함된다.
일부 구현예들에서, 서로 다른 사운드 검출기들이 사운드 입력이 서로 다른 방식으로 필터링 및/또는 프로세싱될 것을 요구한다. 예를 들어, 일부 구현예들에서, 노이즈 검출기(402)는 60 내지 20,000 ㎐ 사이의 시간-도메인 오디오 신호를 분석하도록 구성되고, 사운드-타입 검출기는 60 내지 3,000 ㎐ 사이의 오디오의 주파수-도메인 분석을 수행하도록 구성된다. 따라서, 일부 구현예들에서, 오디오 DSP(412)(및/또는 디바이스(104)의 다른 오디오 DSP)가 사운드 검출기들의 개별 필요성에 따라서 수신된 오디오를 사전프로세싱한다. 일부 구현예들에서, 다른 한편으로, 사운드 검출기들은 그들의 구체적인 필요성에 따라서 오디오 서브시스템(226)으로부터의 오디오를 필터링 및/또는 사전프로세싱하도록 구성된다. 이러한 경우들에서, 오디오 DSP(412)는 여전히 사운드 검출기들에게 사운드 입력을 제공하기 이전에 노이즈 소거를 수행할 수 있다. 일부 구현예들에서, 전자 디바이스의 콘텍스트가 음성 트리거를 동작할지 여부 및 어떻게 동작할지 여부를 결정하는 것을 돕도록 사용된다. 예를 들어, 디바이스가 사용자의 주머니, 지갑, 또는 백팩에 보관되어 있을 때 사용자가 음성-기반 디지털 어시스턴트와 같은 스피치-기반 서비스를 호출할 가능성이 낮을 수 있다. 또한, 사용자가 시끄러운 락 콘서트에 있을 때 스피치-기반의 서비스를 호출할 가능성이 낮을 수 있다. 일부 사용자들에 있어서, 그들이 하루 중 소정의 시간대에(예를 들어, 늦은 밤) 스피치-기반 서비스를 호출할 가능성이 낮다. 다른 한편으로, 사용자가 음성 트리거를 이용하여 스피치-기반 서비스를 호출할 가능성이 더 높은 콘텍스트 또한 존재한다. 예를 들어, 일부 사용자들은 그들이 운전 중이거나, 혼자 있거나, 일하는 중인 경우 등에 음성 트리거를 사용할 가능성이 더 높을 것이다. 다양한 기술들이 디바이스의 콘텍스트를 결정하도록 사용된다. 다양한 구현예들에서, 디바이스는 디바이스의 콘텍스트를 결정하기 위해 GPS 수신기, 광 센서, 마이크로폰, 근접 센서, 방향 센서, 관성 센서, 카메라, 통신 회로 및/또는 안테나, 충전 및/또는 전력 회로, 스위치 포지션, 온도 센서, 나침반, 가속도계, 캘린더, 사용자 선호사항 등의 컴포넌트들 또는 정보 소스들 중 임의의 하나 이상으로부터의 정보를 사용한다. 그 다음 디바이스의 콘텍스트는 음성 트리거가 동작하는지 여부 및 어떻게 동작하는지를 조정하도록 사용될 수 있다. 예를 들어, 소정의 콘텍스트에서, 음성 트리거는 해당 콘텍스트가 유지되는 한 비활성화될 것이다(또는 상이한 모드에서 동작될 것이다). 예를 들어, 일부 구현예들에서, 전화기가 사전결정된 방향에 있을 때(예를 들어, 표면 상에서 아래를 보고 놓여있을 때), 사전결정된 시간의 주기 동안(예를 들어, 밤 10시와 오전 8시 사이), (예를 들어, 스위치 위치, 모드 설정, 또는 사용자 선호사항에 기초하여) 전화기가 "묵음" 또는 "방해 금지" 모드에 있을 때, 디바이스가 실질적으로 밀폐된 공간(예를 들어, 주머니, 가방, 지갑, 서랍, 또는 글러브 박스) 내에 있을 때, (예를 들어, 근접 센서, 음향/무선/적외선 통신에 기초하여) 디바이스가 음성 트리거 및/또는 스피치-기반 서비스를 갖는 다른 디바이스 근처에 있을 때 등의 경우에서 음성 트리거는 비활성화된다. 일부 구현예들에서, 비활성화되는 대신, 음성 트리거 시스템(400)은 저전력 모드에서 동작된다(예를 들어, 노이즈 검출기(402)를 10ms의 "온" 간격 및 5초의 "오프" 간격을 갖는 듀티 사이클에 따라 동작시킨다). 일부 구현예들에서, 오디오 채널은 음성 트리거 시스템(400)이 저전력 모드에서 동작될 때 더욱 드물게 모니터링된다. 일부 구현예들에서, 음성 트리거는 정상 모드에 있을 때보다 저전력 모드에 있을 때 상이한 사운드 검출기 또는 사운드 검출기들의 조합을 사용한다. (음성 트리거는 다수의 서로 다른 모드들 또는 동작 상태들일 수 있고, 각각은 서로 다른 전력량을 사용할 수 있으며, 서로 다른 구현예들이 자신의 특정 설계에 따라 사용할 것이다.)
다른 한편으로, 디바이스가 일부 다른 콘텍스트에 있을 때, 음성 트리거는 콘텍스트가 유지되는 한 활성화될 것이다(또는 상이한 모드에서 동작될 것이다). 예를 들어, 일부 구현예들에서, 음성 트리거는 자신이 전원에 플러그인 되어있는 동안, 전화기가 사전결정된 방향에 있는 동안(예를 들어, 표면 상에서 위를 보고 놓여있음), 사전결정된 시간의 주기 동안(예를 들어, 오전 8시와 밤 10시 사이), (예를 들어, GPS 신호, 차량과의 블루투스 접속 또는 도킹 등에 기초하여) 디바이스가 이동 중 및/또는 차량 안에 있는 경우 등에 활동적으로 남아있게 된다. 디바이스가 차량 안에 있는 경우 라이닝을 검출하는 양태들은 미국 임시특허출원 제61/657,744호에 더욱 자세하게 기술되어 있으며, 이것은 본 출원의 출원인에게 양도되어 그 전체가 본 명세서에 참조로서 포함된다. 소정의 콘텍스트를 결정하는 방법의 몇몇 구체적인 예들이 아래에 제공된다. 다양한 실시예들에서, 서로 다른 기술들 및/또는 정보 소스들이 이러한 콘텍스트들 및 다른 콘텍스트들을 검출하도록 사용된다.
위에서 언급된 바와 같이, 음성 트리거 시스템(400)이 활동 중인지(예를 들어, 청취 중인지) 아닌지 여부는 디바이스의 물리적 방향에 의존할 수 있다. 일부 구현예들에서, 음성 트리거는 디바이스가 표면 상에서 "위를 보게(face-up)" 배치되어 있는 경우에 (예를 들어, 디스플레이 및/또는 터치스크린 표면을 볼 수 있음) 활동적이고/이거나, "아래를 보게(face-down)" 배치되어 있는 경우에 비활동적이다. 이것은 사용자에게 설정 메뉴, 스위치, 또는 버튼의 조작을 요구하지 않고 음성 트리거를 활성화 및/또는 비활성화하는 쉬운 방식을 제공한다. 일부 구현예들에서, 디바이스는 (예를 들어, 디바이스(104)의 전면 및 후면 상의 입사광의 차이에 기초하는) 광 센서, 근접 센서, 자기 센서, 가속도계, 자이로스코프, 기울기 센서, 카메라 등을 이용하여 표면 상에서 위를 보는지 또는 아래를 보는지 여부를 검출한다. 일부 구현예들에서, 다른 동작 모드, 설정, 파라미터, 또는 선호사항이 디바이스의 방향 및/또는 위치에 의해 영향을 받는다. 일부 구현예들에서, 특정 트리거 사운드, 음성 트리거의 단어, 또는 구를 청취하는 것은 디바이스의 방향 및/또는 위치에 의존한다. 예를 들어, 일부 구현예들에서, 음성 트리거는 디바이스가 일 방향에 있을 때(예를 들어, 표면 상에서 위를 보게 놓여 있을 때) 제1 트리거 단어, 구, 또는 사운드를 청취하며, 디바이스가 다른 방향에 있을 때(예를 들어, 아래를 보게 놓여 있을 때) 다른 트리거 단어, 구, 또는 사운드를 청취한다. 일부 구현예들에서, 아래를 보는 방향에 대한 트리거 구는 위를 보는 방향에 대한 것보다 더 길고/길거나 더 복잡하다. 따라서, 사용자는 음성 트리거가 더 짧거나 단순한 트리거 단어들에 대해서 더욱 빈번할 수 있는 오류 수용을 감소시키는 동안에도 여전히 동작될 수 있도록 사용자 주위에 다른 사람들이 있거나 시끄러운 환경에 있을 때 디바이스가 아래를 보게 배치할 수 있다. 특정 예로서, 위를 보는 트리거 구는 "안녕, 시리"일 수 있는 반면, 아래를 보는 트리거 구는 "안녕, 시리, 나는 앤드류야. 나를 깨워줘"일 수 있다. 더욱 긴 트리거 구는 또한 사운드 검출기들에 대한 더 넓은 음성 샘플 및/또는 프로세싱 및/또는 분석하기 위한 음성 인증을 제공하며, 따라서 음성 트리거의 정확도를 증가시키고 오류 수용을 감소시킨다.
일부 구현예들에서, 디바이스(104)는 자신이 차량(예를 들어, 승용차) 안에 있는지 여부를 검출한다. 음성 트리거는 디바이스 및/또는 스피치-기반 서비스를 동작시키기 위해 필요한 물리적 상호작용을 감소시키는 것을 돕기 때문에, 사용자가 차량 내에 있을 때 스피치-기반 서비스를 호출하는데 특히 유리하다. 실제로, 음성-기반 디지털 어시스턴트의 이점들 중 하나는 이것이 디바이스를 바라보거나 터치하는 것이 비실용적이거나 안전하지 않을 경우에 작업을 수행하도록 사용될 수 있다는 점이다. 따라서, 음성 트리거는 사용자가 디지털 어시스턴트를 호출하기 위해서 디바이스를 터치해야 할 필요가 없도록 디바이스가 차량 내에 있을 때 사용될 수 있다. 일부 구현예들에서, 디바이스는 예컨대 블루투스 통신(또는 다른 무선 통신)을 통한, 또는 도킹 커넥터 또는 케이블을 통해 차량에 접속되고/되거나 차량과 짝을 이루었음을 검출함으로써 자신이 차량 내에 있음을 검출한다. 일부 구현예들에서, 디바이스는 (예를 들어, GPS 수신기, 가속도계 및/또는 자이로스코프를 사용하여) 디바이스의 위치 및/또는 속도를 결정함으로써 디바이스가 차량 내에 있다고 결정한다. 만약 디바이스가 차량 내에 있을 가능성이 높다고 결정되면, 차량이 시간당 20마일보다 높은 속도로 이동하고 있으며 길을 따라 이동하고 있다고 결정되기 때문에, 예를 들어 음성 트리거가 활동적으로 남아있게 되고/되거나 고전력 또는 더욱 민감한 상태에 있게 된다.
일부 구현예들에서, 디바이스는 디바이스가 실질적으로 밀폐된 공간 내에 있는지 여부를 결정함으로써 디바이스가 (예를 들어, 주머니, 지갑, 가방, 서랍 등에) 보관되어 있는지 여부를 검출한다. 일부 구현예들에서, 디바이스는 자신이 보관되어 있음을 결정하기 위해 광 센서(예로서, 전용 주변 광 센서 및/또는 카메라)를 사용한다. 예를 들어, 일부 구현예들에서, 광 센서가 광을 거의 검출하지 않거나 전혀 검출하지 않는다면 디바이스가 보관되어 있을 가능성이 높다. 일부 구현예들에서, 하루의 시간 및/또는 디바이스의 위치 또한 고려된다. 예를 들어, 만약 광 센서가 (예컨대, 하루 중에) 높은 광 레벨이 예상될 때에 낮은 광 레벨을 검출한다면, 디바이스는 보관되어 있을 수 있고 음성 트리거 시스템(400)이 필요하지 않을 수 있다. 따라서, 음성 트리거 시스템(400)은 저전력 또는 스탠바이 상태에 있을 것이다. 일부 구현예들에서, 디바이스의 대향하는 면들 상에 위치된 센서들에 의해 검출된 광의 차는 디바이스의 위치를 결정하도록 사용될 수 있으며, 그러므로 디바이스가 보관되어 있는지 아닌지 여부를 결정하도록 사용될 수 있다. 특히, 사용자들은 디바이스가 주머니 또는 가방 안에 보관되어 있을 때보다 디바이스가 테이블 또는 표면 상에 그대로 있을 때 음성 트리거를 활성화하고자 시도할 가능성이 높다. 그러나 디바이스가 테이블 또는 데스크와 같은 표면 상에 아래를 보도록 (또는 위를 보도록) 놓여있을 때, 디바이스의 일 표면은 해당 표면에 광이 거의 또는 전혀 도달하지 않도록 폐색되는 반면, 다른 표면은 주변 광에 노출될 것이다. 따라서, 만약 디바이스의 전면 및 후면 상의 광 센서들이 뚜렷하게 다른 광 레벨을 검출한다면, 디바이스는 자신이 보관되지 않았다고 결정한다. 다른 한편으로, 만약 대향하는 면들 상의 광 센서들이 동일하거나 유사한 광 레벨을 검출한다면, 디바이스는 자신이 실질적으로 밀폐된 공간 내에 보관되었다고 결정한다. 또한, 만약 광 센서들이 모두 낮시간 동안에 (또는 디바이스가 전화기가 밝은 환경에 있을 것으로 예상할 수 있을 때) 낮은 광 레벨을 검출한다면, 디바이스는 높은 신뢰도로 자신이 보관되어 있다고 결정한다.
일부 구현예들에서, 다른 기술들이 디바이스가 보관되었는지 여부를 결정하기 위해 (광 센서 대신 또는 광 센서에 추가로) 사용된다. 예를 들어, 일부 구현예들에서, 디바이스는 스피커 또는 트랜듀서(예로서, 스피커(228))로부터 하나 이상의 사운드(예를 들어, 톤, 클릭, 핑 등)를 방출하며, 방출된 사운드(들)의 에코를 검출하도록 하나 이상의 마이크로폰 또는 트랜듀서(예를 들어, 마이크로폰(230))를 모니터링한다. (일부 구현예들에서, 디바이스는 사람이 듣는 범위 밖에 있는 사운드와 같은 청취 불가능한 신호를 방출한다.) 에코로부터, 디바이스는 둘러싼 환경의 특징들을 결정한다. 예를 들어, 비교적 넓은 환경(예를 들어, 방 또는 차량)이 비교적 작은, 밀폐된 환경(예를 들어, 주머니, 지갑, 가방, 서랍 등)과는 다른 사운드를 반사시킬 것이다.
일부 구현예들에서, 만약 음성 트리거 시스템(400)이 (음성 트리거 및/또는 스피치-기반 서비스를 갖는 다른 디바이스와 같은) 다른 디바이스들 부근에 있다면, 음성 트리거 시스템(400)이 다른 디바이스들 부근에 있지 않은 경우와 상이하게 동작한다. 이것은 예를 들어, 다수의 디바이스들이 함께 가까이 있을 때, 한 사람이 트리거 단어를 발언하면 다른 둘러싼 디바이스들 또한 트리거되지 않도록 음성 트리거 시스템(400)의 민감도를 셧다운하거나 감소시키는 데에 유용할 수 있다. 일부 구현예들에서, 디바이스는 RFID, 근거리 통신, 적외선/음향 신호 등을 이용하여 다른 디바이스들에 대한 근접도를 결정한다. 앞서 언급된 바와 같이, 음성 트리거는 사용자가 운전 중인 경우와 같이 디바이스가 핸드-프리 모드에서 동작되고 있는 중에 특히 유용하다. 이러한 경우들에서, 사용자들은 종종 전화를 걸거나 텍스트 입력을 딕테이션하기 위해 사용자가 자신의 얼굴 근처에 디바이스를 유지시켜야 할 필요성으로부터 자유롭게 하도록, 유선 또는 무선 헤드셋, 스피커 및/또는 마이크로폰을 갖는 손목시계, 차량의 빌트인 마이크로폰 및 스피커와 같은 외부 오디오 시스템을 사용한다. 예를 들어, 무선 헤드셋 및 차량 오디오 시스템이 블루투스 통신 또는 임의의 다른 적절한 무선 통신을 이용하여 전자 디바이스에 접속할 수 있다. 그러나, 음성 트리거에 있어서 무선 액세서리를 이용한 오픈 오디오 채널을 유지하기 위해 요구되는 전력으로 인해 무선 오디오 액세서리를 통해 수신되는 오디오를 모니터링하는 것이 비효율적일 수 있다. 특히, 무선 헤드셋은 몇 시간의 연속적인 대화 시간을 제공하기에 충분한 전하를 자신의 배터리 내에 보유할 수 있으며, 따라서 단순히 주변 오디오를 모니터링하고 가능한 트리거 사운드를 기다리도록 이용하는 대신 실질적인 통신을 위해 헤드셋이 필요한 경우에 대해 배터리를 보존하는 데에 바람직하다. 또한, 유선 외부 헤드셋 액세서리가 단독의 온-보드 마이크로폰보다 뚜렷하게 더 많은 전력을 요구할 수 있으며, 헤드셋 마이크로폰 활동성을 유지하는 것이 디바이스의 배터리 전하를 고갈시킬 것이다. 이것은 특히 무선 또는 유선 헤드셋에 의해 수신된 주변 오디오가 전형적으로 대부분의 묵음의 또는 무관한 사운드를 구성할 것이라는 것을 고려할 때 사실이다. 따라서, 일부 구현예들에서, 음성 트리거 시스템(400)은 디바이스가 외부 마이크로폰에 (유선 또는 무선으로) 연결되어 있을 때에도 디바이스 상의 마이크로폰(230)으로부터의 오디오를 모니터링한다. 그 다음, 음성 트리거가 트리거 단어를 검출하면, 디바이스는 디바이스 상의 마이크로폰(230)보다는 외부 마이크로폰을 통해 (음성-기반 디지털 어시스턴트에 대한 커맨드와 같은) 후속하는 사운드 입력을 수신하기 위해 외부 마이크로폰과의 활동적 오디오 링크를 초기화한다. 그럼에도, 소정의 조건들이 만족될 때, 활동적 통신 링크가 (유선 또는 무선을 통해 디바이스(104)에 통신상 연결될 수 있는) 외부 오디오 시스템(416)과 디바이스 사이에서 유지될 수 있으며 그에 따라 음성 트리거 시스템(400)이 디바이스 상의 마이크로폰(230)을 대신하여 (또는 그에 더하여) 외부 오디오 시스템(416)을 통해 트리거 사운드를 청취할 수 있다. 예를 들어, 일부 구현예들에서, (예를 들어, 개별 디바이스들 상의 가속도계, 자이로스코프 등에 의해 결정된 바와 같은) 전자 디바이스 및/또는 외부 오디오 시스템(416)의 동작의 특징들이 음성 트리거 시스템(400)이 디바이스 상의 마이크로폰(230) 또는 외부 마이크로폰(418)을 이용하여 주변 사운드를 모니터링해야만 하는지 여부를 결정하도록 사용된다. 특히, 디바이스와 외부 오디오 시스템(416)의 동작 사이의 차이는 외부 오디오 시스템(416)이 실질적으로 사용되는지 여부에 대한 정보를 제공한다. 예를 들어, 만약 디바이스 및 무선 헤드셋 모두가 실질적으로 동일하게 이동 중이라면(또는 이동하지 않는다면), 헤드셋이 사용되지 않거나 착용되어 있지 않음이 결정될 수 있다. 이것은 예를 들어 두 디바이스가 서로의 부근에 있으며 유휴 상태(예를 들어, 테이블 상에 놓여 있거나 주머니, 가방, 지갑, 서랍 등에 보관되어 있음)에 있기 때문에 발생할 수 있다. 따라서, 이러한 조건 하에서, 음성 트리거 시스템(400)은 헤드셋이 실질적으로 사용되고 있지 않을 가능성이 높기 때문에 디바이스 상의 마이크로폰을 모니터링한다. 그러나 만약 무선 헤드셋과 디바이스 사이의 동작에 차이가 존재한다면, 사용자가 헤드셋을 착용중인 것으로 결정된다. 이러한 조건은 예를 들어 디바이스를 (예로서, 표면 상에 또는 가방 안에) 내려놓은 동안 헤드셋이 머리에 착용되어 있기 때문에 발생할 수 있다(착용자가 비교적 가만히 있을 때에도 적어도 소량 이동할 가능성이 높다). 이러한 조건 하에서, 헤드셋이 착용되어 있을 가능성이 높기 때문에, 음성 트리거 시스템(400)이 활동적인 통신 링크를 유지하고 디바이스 상의 마이크로폰(230) 대신 (또는 그에 더하여) 헤드셋의 마이크로폰(418)을 모니터링한다. 그리고 이러한 기술이 디바이스 및 헤드셋의 동작의 차이에 초점을 맞추기 때문에, 두 디바이스들에 대해 공통적인 동작은 상쇄될 수 있다. 이것은 예를 들어 사용자가 이동하는 차량에서 헤드셋을 이용하고 있을 때, 디바이스(예를 들어, 셀룰러폰)가 컵 홀더, 빈 좌석, 또는 사용자의 주머니 내에서 그대로 있고 헤드셋이 사용자의 머리에 착용되어 있는 경우 유용할 수 있다. 두 디바이스들에 대한 공통적인 동작(예를 들어, 차량의 동작)이 상쇄되면, 헤드셋이 사용되고 있는 가능성이 높은지 여부(또는, 헤드셋이 착용되지 않았는지 여부)를 결정하기 위해서 (만약 존재하는 경우) 디바이스에 비교하여 헤드셋의 상대적인 동작이 결정될 수 있다. 전술된 논의에서 무선 헤드셋을 지칭하지만, 유사한 기술이 유선 헤드셋에 대해서도 적용된다.
사람들의 음성은 매우 다르기 때문에, 특정 사용자의 음성을 인식하는 것의 정확도를 향상시키기 위해 음성 트리거를 튜닝하는 것이 필요하거나 유리할 수 있다. 또한, 예를 들어 질병, 노화 또는 호르몬 변화와 관련된 자연적인 음성 변화 등으로 인해 사람들의 음성이 시간에 따라 변화할 수 있다. 따라서, 일부 구현예들에서, 음성 트리거 시스템(400)은 특정 사용자 또는 사용자들의 그룹에 대해 자신의 음성 및/또는 사운드 인식 프로파일을 적응시킬 수 있다. 전술된 바와 같이, 사운드 검출기들(예를 들어, 사운드-타입 검출기(404) 및/또는 트리거 사운드 검출기(406))이 사운드 입력(예를 들어 사용자에 의해 제공된 사운드 또는 발언)의 표현을 하나 이상의 기준 표현에 비교하도록 구성될 수 있다. 예를 들어, 만약 입력 표현이 기준 표현에 사전결정된 신뢰도 레벨로 부합하면, 사운드 검출기는 사운드 입력이 사전결정된 타입의 사운드에 대응한다고 결정하거나(예로서, 사운드-타입 검출기(404)) 또는 사운드 입력이 사전결정된 콘텐츠를 포함한다고 결정할 것이다(예로서, 트리거 사운드 검출기(406)). 음성 트리거 시스템(400)을 튜닝하기 위해서, 일부 구현예들에서, 디바이스는 입력 표현이 비교되는 기준 표현을 조정한다. 일부 구현예들에서, 기준 표현은 음성 등록 또는 "트레이닝" 절차의 부분으로서 조정(또는 생성)되며, 이때 사용자는 디바이스가 기준 표현을 조정(또는 생성)할 수 있도록 수차례 트리거 사운드를 출력한다. 그 결과 디바이스는 해당 사람의 실제 음성을 이용하여 기준 표현을 생성할 수 있다.
일부 구현예들에서, 디바이스는 기준 표현을 조정하기 위해 정상 사용 조건 하에서 수신되는 트리거 사운드를 사용한다. 예를 들어, 성공적인 음성 트리거링 이벤트(예를 들어, 모든 트리거링 기준을 만족시키기 위한 사운드 입력이 발견됨) 후에, 디바이스는 기준 표현을 조정 및/또는 튜닝하기 위해 사운드 입력으로부터의 정보를 사용할 것이다. 일부 구현예들에서, 소정의 신뢰도를 가지고 트리거링 기준의 전체 또는 일부를 만족시키는 것으로 결정된 사운드 입력만이 기준 표현을 조정하도록 사용된다. 따라서, 사운드 입력이 트리거 사운드에 대응하거나 트리거 사운드를 포함하는 것에 대해 음성 트리거가 더 낮은 신뢰도를 가질 때, 해당 음성 입력이 기준 표현을 조정하기 위한 목적으로 무시될 수 있다. 다른 한편으로, 일부 구현예들에서, 더 낮은 신뢰도로 음성 트리거 시스템(400)을 만족시킨 사운드 입력은 기준 표현을 조정하도록 사용된다.
일부 구현예들에서, 디바이스(104)는 점점 더 많은 사운드 입력이 수신되면 시간에 따라 사용자의 음성에서의 미세한 변화를 수용할 수 있도록 (이러한 기술들 또는 다른 기술들을 이용하여) 기준 표현을 반복적으로 조정한다. 예를 들어, 일부 구현예들에서, 디바이스(104)(및/또는 연관된 디바이스들 또는 서비스들)가 각각의 성공적인 트리거링 이벤트 후에 기준 표현을 조정한다. 일부 구현예들에서, 디바이스(104)는 각각의 성공적인 트리거링 이벤트와 연관된 사운드 입력을 분석하여 (예를 들어, 만약 소정의 조건들이 만족되면) 입력에 기초하여 기준 표현들이 조정되어야만 하는지 여부를 결정하며, 만약 그렇게 하는 것이 적절하다면 기준 표현만을 조정한다. 일부 구현예들에서, 디바이스(104)는 시간에 따른 기준 표현의 이동 평균을 유지한다. 일부 구현예들에서, 음성 트리거 시스템(400)은 (예를 들어, 하나 이상의 사운드 검출기에 의해 결정된 바와 같은) 하나 이상의 트리거링 기준을 만족시키지 않지만, 실질적으로 권한이 부여된 사용자에 의해 그렇게 되도록 하는 시도일 수 있는 사운드를 검출한다. 예를 들어, 음성 트리거 시스템(400)은 "안녕, 시리"와 같은 트리거 구에 응답하도록 구성될 수 있지만, 만약 사용자의 음성이 (예로서, 질병, 노화, 액센트/억양 변화 등으로 인해) 변화되었다면, 음성 트리거 시스템(400)은 디바이스를 활성화하기 위한 사용자의 시도를 인식할 수 없다. (이것은 또한 음성 트리거 시스템(400)이 디폴트 조건으로 설정되고/되거나 사용자가 사용자의 음성에 대해 음성 트리거 시스템(400)을 맞춤화하기 위해 초기화 또는 트레이닝 절차를 수행하지 않았을 때와 같이, 음성 트리거 시스템(400)이 해당 사용자의 특정 음성에 대해 적절하게 튜닝되지 않은 경우에 발생할 수 있다.) 만약 음성 트리거 시스템(400)이 음성 트리거를 활성화하기 위한 사용자의 제1 시도에 응답하지 않는다면, 사용자는 트리거 구를 반복할 가능성이 높다. 디바이스는 이러한 반복된 사운드 입력들이 서로 유사하다는 것을 검출하고/하거나, 그들이 (음성 트리거 시스템(400)이 스피치-기반 서비스를 활성화하기에 충분히 유사하지 않음에도) 트리거 구와 유사하다고 검출한다. 만약 이러한 조건들이 만족되면, 디바이스는 사운드 입력이 음성 트리거 시스템(400)을 활성화하기 위한 유효 시도에 대응한다고 결정한다. 따라서, 일부 구현예들에서, 음성 트리거 시스템(400)은 사용자에 의한 유사한 발언이 미래의 유효 트리거로서 수용되도록 음성 트리거 시스템(400)의 하나 이상의 양태들을 조정하기 위해 이러한 수신된 사운드 입력들을 사용한다. 일부 구현예들에서, 이들 사운드 입력은 소정의 조건들 또는 조건들의 조합만이 만족될 때에만 음성 트리거 시스템(400)을 적응시키도록 사용된다. 예를 들어, 일부 구현예들에서, 사전결정된 수의 사운드 입력들이 연속으로 수신될 때(예를 들어, 2, 3, 4, 5, 또는 임의의 다른 적절한 수), 사운드 입력들이 기준 표현과 충분히 유사할 때, 사운드 입력들이 서로 충분히 유사할 때, (예를 들어, 사운드 입력들이 사전결정된 시간의 지속시간 내에 및/또는 사전결정된 간격에서 또는 그 부근에서 수신되었을 때) 사운드 입력들이 함께 근접하고/하거나, 이들 조건 또는 다른 조건들의 임의의 조합인 경우에, 음성 트리거 시스템(400)을 적응시키도록 사용된다. 일부 경우들에서, 음성 트리거 시스템(400)은 (예를 들어, 버튼 또는 아이콘을 누름으로써) 스피치-기반 서비스를 수동 개시한 것에 이어서, 하나 이상의 트리거링 기준을 만족시키지 않는 하나 이상의 사운드 입력을 검출할 수 있다. 일부 구현예들에서, 스피치-기반 서비스가 사운드 입력이 수신된 직후에 개시되었기 때문에, 음성 트리거 시스템(400)은 사운드 입력이 실질적으로 실패한 음성 트리거링 시도에 대응된다고 결정한다. 따라서, 음성 트리거 시스템(400)은 전술된 바와 같이 사용자에 의한 발언이 미래의 유효 트리거로서 수용될 수 있도록 음성 트리거 시스템(400)의 하나 이상의 양태들을 조정하기 위해 이러한 수신된 사운드 입력을 사용한다.
전술된 적응 기술들이 기준 표현을 조정하는 것을 지칭하지만, 트리거 사운드 검출 기술들의 다른 양태들이 기준 표현을 조정하는 것에 더하여 또는 그 대신 동일하거나 유사한 방식으로 조정될 수 있다. 예를 들어, 일부 구현예들에서, 디바이스는 예컨대 사운드 입력의 소정의 주파수 또는 주파수의 범위에 초점을 맞추고/맞추거나 소정의 주파수 또는 주파수의 범위를 삭제하기 위해, 디바이스는 사운드 입력이 필터링되는 방식 및/또는 사운드 입력에 어떤 필터가 적용되는지를 조정한다. 일부 구현예들에서, 디바이스는 입력 표현을 기준 표현과 비교하도록 사용되는 알고리즘을 조정한다. 예를 들어, 일부 구현예들에서, 입력 표현과 기준 표현 사이의 차이를 결정하기 위해 사용되는 수학적 함수의 하나 이상의 항이 변화, 추가, 또는 제거되거나, 또는 상이한 수학적 함수로 대체된다. 일부 구현예들에서, 전술된 것과 같은 적응 기술들은 음성 트리거 시스템(400)이 제공할 수 있거나 제공하도록 구성될 수 있는 것보다 더 많은 리소스를 요구한다. 특히, 사운드 검출기들은 기준 표현 및/또는 사운드 검출 알고리즘(또는 음성 트리거 시스템(400)의 임의의 다른 적절한 양태)의 반복적인 적응을 수행하기 위해 필요한 프로세서, 데이터, 또는 메모리의 양 또는 타입을 구비하지 않을 수 있거나, 또는 그에 대한 액세스를 갖지 않을 수 있다. 따라서, 일부 구현예들에서, 하나 이상의 전술된 적응 기술이 애플리케이션 프로세서(예를 들어, 프로세서(들)(204))와 같은 더욱 강력한 프로세서에 의해, 또는 상이한 디바이스(예를 들어, 서버 시스템(108))에 의해 수행된다. 그러나, 음성 트리거 시스템(400)은 애플리케이션 프로세서가 스탠바이 모드에 있을 때에도 동작하도록 설계된다. 따라서, 애플리케이션 프로세서가 활동적이지 않고 사운드 입력을 프로세싱할 수 없을 때 음성 트리거 시스템(400)을 적응시키도록 사용되기 위한 사운드 입력이 수신된다. 따라서, 일부 구현예들에서, 사운드 입력이 수신된 후에 추가로 프로세싱 및/또는 분석될 수 있도록 디바이스에 의해 저장된다. 일부 구현예들에서, 사운드 입력은 오디오 서브시스템(226)의 메모리 버퍼(414) 내에 저장된다. 일부 구현예들에서, (애플리케이션 프로세서가 개시될 것을 요구하지 않고 데이터가 복사되거나 이동될 수 있도록 예를 들어 DMA 엔진을 이용하는 것을 포함하는) 직접 메모리 액세스(DMA) 기술을 이용하여 사운드 입력이 시스템 메모리(예를 들어, 도 2의 메모리(250)) 내에 저장된다. 그 다음 애플리케이션 프로세서가 전술된 하나 이상의 적응 기술을 실행할 수 있도록 한번 개시되면 저장된 사운드 입력이 애플리케이션 프로세서(또는 서버 시스템(108) 또는 다른 적절한 디바이스)에 제공되거나 또는 그에 의해 액세스된다. 일부 구현예들에서,
도 5 내지 도 7은 소정의 구현예들에 따라 음성 트리거를 동작하기 위한 방법들을 나타낸 순서도이다. 이 방법들은 선택적으로, 컴퓨터 메모리 또는 비일시적 컴퓨터 판독가능한 저장 매체(예를 들어, 클라이언트 디바이스(104)의 메모리(250), 디지털 어시스턴트 시스템(300)과 연관된 메모리(302))에 저장되고 서버 시스템(108) 및/또는 사용자 디바이스(104a)를 포함하지만 이것으로 제한되지 않는 디지털 어시스턴트 시스템의 하나 이상의 컴퓨터 시스템의 하나 이상의 프로세서에 의해 실행되는 명령어들에 의해 통제된다. 컴퓨터 판독가능 저장 매체는 자기 또는 광학 디스크 저장 디바이스, 플래시 메모리와 같은 고체 상태 저장 디바이스들, 또는 다른 비휘발성 메모리 디바이스 또는 디바이스들을 포함할 수 있다. 컴퓨터 판독가능 저장 매체 상에 저장된 컴퓨터 판독가능 명령어들은 다음 중 하나 이상을 포함할 수 있다: 소스 코드, 어셈블리 언어 코드, 객체 코드, 또는 하나 이상의 프로세서들에 의해 해석되는 다른 명령어 포맷. 다양한 구현예들에서, 각각의 방법 내의 일부 동작들이 결합될 수 있고/있거나 일부 동작들의 순서가 도면에 도시된 순서로부터 변화될 수 있다. 또한, 일부 구현예들에서, 개별 도면들에 도시된 및/또는 개별 방법들과 연관하여 논의된 동작들이 다른 방법들을 형성하도록 결합될 수 있으며, 동일한 도면에 도시된 및/또는 동일한 방법과 연관하여 논의된 동작들이 서로 다른 방법들로 분리될 수 있다. 또한, 일부 구현예들에서, 방법들 내의 하나 이상의 동작이, 예를 들어 자연 언어 프로세싱 모듈(332), 대화 흐름 프로세싱 모듈(334), 오디오 서브시스템(226), 노이즈 검출기(402), 사운드-타입 검출기(404), 트리거 사운드 검출기(406), 스피치-기반 서비스(408) 및/또는 이들의 임의의 하위모듈들을 포함하는 디지털 어시스턴트 시스템(300) 및/또는 전자 디바이스(예를 들어, 사용자 디바이스(104))의 모듈들에 의해 수행된다. 도 5는 일부 구현예들에 따라 음성 트리거 시스템(예로서, 도 4의 음성 트리거 시스템(400))을 동작하는 방법(500)을 도시한다. 일부 구현예들에서, 방법(500)이 하나 이상의 프로세서 및 하나 이상의 프로세서(예를 들어, 전자 디바이스(104))에 의해 실행하기 위한 명령어들을 저장하는 메모리를 포함하는 전자 디바이스에서 수행된다. 전자 디바이스는 사운드 입력을 수신한다(502). 사운드 입력은 구술된 발언(예를 들어, 단어, 구, 또는 문장), 사람이 발생시킨 사운드(예를 들어, 휘파람 소리, 혀를 차는 소리, 손가락 튕기는 소리, 손뼉 등), 또는 임의의 다른 사운드(예를 들어, 전기적으로 발생된 처프(chirp), 기계적인 노이즈 메이커 등)에 대응할 수 있다. 일부 구현예들에서, 전자 디바이스는 (예를 들어, 도 4를 참조하여 기술된 코덱(410), 오디오 DSP(412), 버퍼(414)뿐만 아니라 마이크로폰(230, 418)을 포함하는) 오디오 서브시스템(226)을 통해 사운드 입력을 수신한다.
일부 구현예들에서, 전자 디바이스는 사운드 입력이 사전결정된 조건을 만족시키는지 여부를 결정한다(504). 일부 구현예들에서, 전자 디바이스는 사운드 입력이 사전결정된 조건을 만족시키는지 여부를 결정하기 위해 사운드 입력에 대한 시간-도메인 분석을 적용한다. 예를 들어, 전자 디바이스는 사운드 진폭이 사전결정된 레벨에 도달하는지 여부를 결정하도록 시간 주기에 걸쳐 사운드 입력을 분석한다. 일부 구현예들에서, 만약 사운드 입력의 진폭(예컨대, 볼륨)이 사전결정된 임계값과 만나고/만나거나 사전결정된 임계값을 초과하면 임계값이 만족된다. 일부 구현예들에서, 만약 사운드 입력이 사전결정된 시간의 길이에 대한 사전결정된 임계값을 만나고/만나거나 사전결정된 임계값을 초과하면 임계값이 만족된다. 아래에서 더욱 자세하게 논의되는 바와 같이, 일부 구현예들에서, 사운드 입력이 사전결정된 조건을 만족시키는지 여부를 결정하는 것(504)은 제3 사운드 검출기(예를 들어, 노이즈 검출기(402))에 의해 수행된다. (제3 사운드 검출기는 이 경우에서 다른 사운드 검출기들(예를 들어, 아래에서 논의되는 제1 및 제2 사운드 검출기들)로부터 사운드 검출기를 구별하도록 사용되며, 반드시 임의의 동작상 위치 또는 사운드 검출기들의 순서를 나타내는 것은 아니다.)
전자 디바이스는 사운드 입력이 사전결정된 타입의 사운드에 대응하는지 여부를 결정한다(506). 위에서 언급된 바와 같이, 사운드들은 사운드들의 소정의 식별가능한 특징들에 기초하여 서로 다른 "타입들"로서 분류된다. 사운드 입력이 사전결정된 타입에 대응하는지 여부를 결정하는 것은 사운드 입력이 특정 타입의 특징들을 포함하거나 나타내는지 여부를 결정하는 것을 포함한다. 일부 구현예들에서, 사전결정된 타입의 사운드는 사람의 음성이다. 이러한 구현예들에서, 사운드 입력이 사람의 음성에 대응하는지 여부를 결정하는 것은 사운드 입력이 사람의 음성의 주파수 특징을 포함하는지 여부를 결정하는 것(508)을 포함한다. 아래에서 더욱 자세하게 논의되는 바와 같이, 일부 구현예들에서, 사운드 입력이 사전결정된 타입의 사운드에 대응하는지 여부를 결정하는 것(506)은 제1 사운드 검출기(예를 들어, 사운드-타입 검출기(404))에 의해 수행된다. 사운드 입력이 사전결정된 타입의 사운드에 대응한다는 결정에 따라, 전자 디바이스는 사운드 입력이 사전결정된 콘텐츠를 포함하는지 여부를 결정한다(510). 일부 구현예들에서, 사전결정된 콘텐츠는 하나 이상의 사전결정된 음소에 대응한다(512). 일부 구현예들에서, 하나 이상의 사전결정된 음소는 적어도 하나의 단어를 구성한다. 일부 구현예들에서, 사전결정된 콘텐츠는 사운드(예를 들어, 휘파람, 클릭, 또는 박수)이다. 일부 구현예들에서, 아래에서 논의되는 바와 같이, 사운드 입력이 사전결정된 콘텐츠를 포함하는지 여부를 결정하는 것(510)은 제2 사운드 검출기(예를 들어, 트리거 사운드 검출기(406))에 의해 수행된다.
사운드 입력이 사전결정된 콘텐츠를 포함한다는 결정에 따라, 전자 디바이스는 스피치-기반 서비스를 개시한다(514). 일부 구현예들에서, 스피치-기반 서비스는 아래에서 위에서 자세하게 기술된 바와 같은 음성-기반 디지털 어시스턴트이다. 일부 구현예들에서, 스피치-기반 서비스는 스피치 입력이 텍스트로 변환되고 (예를 들어, 이메일, 텍스트 메시지, 워드 프로세싱 또는 노트 필기 애플리케이션 등의) 텍스트 입력 필드 내에 포함되고/되거나 디스플레이되는 딕테이션 서비스이다. 스피치-기반 서비스가 음성-기반 디지털 어시스턴트인 구현예에서, 음성-기반 디지털 어시스턴트가 개시되면, 사용자가 디지털 어시스턴트에게 음성 입력 및/또는 커맨드를 제공할 수 있음을 나타내는 프롬프트가 사용자에게 발행된다(예를 들어, 사운드 또는 스피치 프롬프트). 일부 구현예들에서, 음성-기반 디지털 어시스턴트를 개시하는 것은 애플리케이션 프로세서(예를 들어, 도 2의 프로세서(들)(204))를 활성화하는 것, 하나 이상의 프로그램 또는 모듈(예를 들어, 도 2의 디지털 어시스턴트 클라이언트 모듈(264))을 개시하는 것, 및/또는 원격 서버 또는 디바이스(예를 들어, 도 1의 디지털 어시스턴트 서버(106))로의 접속을 확립하는 것을 포함한다.
일부 구현예들에서, 전자 디바이스는 사운드 입력이 특정 사용자의 음성에 대응하는지 여부를 결정한다(516). 예를 들어, 사운드 입력이 권한이 부여된 디바이스의 사용자의 음성에 대응하는지 여부를 결정하기 위해 하나 이상의 음성 인증 기술이 사운드 입력에 적용된다. 음성 인증 기술은 위에서 더욱 자세하게 기술된다. 일부 구현예들에서, 음성 인증은 사운드 검출기들 중 하나(예를 들어, 트리거 사운드 검출기(406))에 의해 수행된다. 일부 구현예들에서, 음성 인증은 (임의의 적절한 하드웨어 및/또는 소프트웨어를 포함하는) 전용 음성 인증 모듈에 의해 수행된다. 일부 구현예들에서, 사운드-기반 서비스는 사운드 입력이 사전결정된 콘텐츠를 포함하며 사운드 입력이 특정 사용자의 음성에 대응한다는 결정에 응답하여 개시된다. 따라서, 예를 들어, 사운드-기반 서비스(예를 들어, 음성-기반 디지털 어시스턴트)는 오직 권한이 주어진 사용자에 의해 트리거 단어 또는 구가 구술되었을 때에만 개시될 것이다. 트리거 사운드의 일 사용자의 발언이 다른 사용자의 음성 트리거를 활성화하지 않을 것이기 때문에, 이것은 서비스가 권한이 없는 사용자에 의해 호출될 수 있는 가능성을 감소시키며, 다수의 전자 디바이스들이 근거리에 있는 경우에 특히 유용할 수 있다.
스피치-기반 서비스가 음성-기반 디지털 어시스턴트인 일부 구현예들에서, 사운드 입력이 사전결정된 콘텐츠를 포함하지만 특정 사용자의 음성에 대응하지 않는다는 결정에 응답하여, 음성-기반 디지털 어시스턴트는 제한된 액세스 모드로 개시된다. 일부 구현예들에서, 제한된 액세스 모드는 디지털 어시스턴트가 다른 방식으로 제공할 수 있는 데이터, 서비스, 및/또는 기능 중 오직 하위세트에만 디지털 어시스턴트가 액세스하는 것을 가능하게 한다. 일부 구현예들에서, (예를 들어, 디지털 어시스턴트의 권한이 없는 사용자가 캘린더, 작업 목록, 연락처, 사진, 이메일, 텍스트 메시지 등으로부터의 데이터에 액세스할 수 없도록) 제한된 액세스 모드는 기록-전용 모드에 대응한다. 일부 구현예들에서, 제한된 액세스 모드는 스피치-기반 서비스의 샌드박스된 인스턴스(sandboxed instance)에 대응하며, 그에 따라 스피치-기반 서비스가 디바이스(104) 상의 사용자 데이터(266)(도 2)와 같은, 또는 임의의 다른 디바이스 상의 사용자의 데이터(예를 들어, 도 1의 서버 시스템(108)과 같은 원격 서버 상에 저장될 수 있는 도 3a의 사용자 데이터(348))에 기록하거나 그로부터 판독하지 않을 것이다.
일부 구현예들에서, 사운드 입력이 사전결정된 콘텐츠를 포함하고 사운드 입력이 특정 사용자의 음성에 대응한다는 결정에 응답하여, 음성-기반 디지털 어시스턴트가 특정 사용자의 이름을 포함하는 프롬프트를 출력한다. 예를 들어, 특정 사용자가 음성 인증을 통해 식별되었을 때, 음성-기반 디지털 어시스턴트는 톤, 삐 소리, 또는 비-개인화된 음성 프롬프트와 같은 보다 일반적인 프롬프트 대신, "무엇을 도와드릴까요, 피터?"와 같은 프롬프트를 출력할 수 있다. 위에서 언급된 바와 같이, 일부 구현예들에서, 제1 사운드 검출기는 사운드 입력이 사전결정된 타입의 사운드에 대응하는지 여부를 결정하고(단계(506)), 제2 사운드 검출기는 사운드 입력이 사전결정된 콘텐츠를 포함하는지 여부를 결정한다(단계(510)). 일부 구현예들에서, 예를 들어 제1 사운드 검출기가 제2 사운드 검출기보다 덜 프로세서-집약적인 기술을 사용하기 때문에, 제1 사운드 검출기는 동작 중에 제2 사운드 검출기보다 더 적은 전력을 소비한다. 일부 구현예들에서, 제1 사운드 검출기는 사운드-타입 검출기(404)이고, 제2 사운드 검출기는 트리거 사운드 검출기(406)이며, 둘 모두가 도 4와 관련하여 위에서 논의된다. 일부 구현예들에서, 도 4를 참조하여 위에서 기술된 바와 같이, 동작 중에 제1 및/또는 제2 사운드 검출기는 듀티 사이클에 따라 주기적으로 오디오 채널을 모니터링한다.
일부 구현예들에서, 제1 및/또는 제2 사운드 검출기는 사운드 입력의 주파수-도메인 분석을 수행한다. 예를 들어, 이들 사운드 검출기는 주파수 스펙트럼을 생성하기 위해서 또는 사운드 입력 또는 그 일부분의 스펙트럼 밀도를 결정하기 위해서 라플라스 변환(Laplace transform), Z-변환(Z-transform), 또는 푸리에 변환(Fourier transform)을 수행한다. 일부 구현예들에서, 제1 사운드 검출기는 사운드 입력이 사람의 음성의 특징인 (또는 사람의 음성의 특징인 사운드 입력의 다른 특성, 양태, 또는 속성인) 주파수를 포함하는지 여부를 결정하도록 구성된 음성-활동 검출기이다.
일부 구현예들에서, 제1 사운드 검출기가 사전결정된 타입의 사운드 입력을 검출할 때까지 제2 사운드 검출기는 오프되거나 활동하지 않는다. 따라서, 일부 구현예들에서, 방법(500)은 사운드 입력이 사전결정된 타입에 대응한다는 결정에 응답하여 제2 사운드 검출기를 개시하는 단계를 포함한다. (다른 구현예들에서, 제2 사운드 검출기는 다른 조건들에 응답하여 개시되거나, 또는 제1 사운드 검출기로부터의 결정과 무관하게 연속적으로 동작된다.) 일부 구현예들에서, 제2 사운드 검출기를 개시하는 것은 (예를 들어, 회로, 프로세서, 프로그램, 메모리 등을 포함하는) 하드웨어 및/또는 소프트웨어를 활성화하는 것을 포함한다. 일부 구현예들에서, 제2 사운드 검출기는 자신이 개시된 후 적어도 사전결정된 길이의 시간 동안 동작된다(예를 들어, 활동하거나 오디오 채널을 모니터링한다). 예를 들어, 제1 사운드 검출기가 사운드 입력이 사전결정된 타입에 대응한다고 결정할 때(예를 들어, 사람의 음성을 포함함), 제2 사운드 검출기가 그 사운드 입력이 또한 사전결정된 콘텐츠(예로서, 트리거 단어)를 포함하는지를 결정하도록 동작된다. 일부 구현예들에서, 사전결정된 길이의 시간은 사전결정된 콘텐츠의 지속시간에 대응한다. 따라서, 만약 사전결정된 콘텐츠가 "안녕, 시리"라는 구라면, 사전결정된 길이의 시간은 해당 구가 발언되었는지를 결정하기에 충분히 길 것이다(예를 들어, 1 또는 2초, 또는 임의의 다른 적절한 지속시간). 만약 사전결정된 콘텐츠가 "안녕 시리, 일어나서 나를 도와줘"와 같이 더 길다면, 사전결정된 시간이 더 길 것이다(예를 들어, 5초, 또는 다른 적절한 지속시간). 일부 구현예들에서, 제2 사운드 검출기는 제1 사운드 검출기가 사전결정된 타입에 대응하는 사운드를 검출하는 한 동작한다. 이러한 구현예들에서, 제1 사운드 검출기가 사운드 입력 내의 사람의 스피치를 검출한다면, 제2 사운드 검출기는 이것이 사전결정된 콘텐츠를 포함하는지를 결정하도록 사운드 입력을 프로세싱할 것이다.
위에서 언급된 바와 같이, 일부 구현예들에서, 제3 사운드 검출기(예를 들어, 노이즈 검출기(402))는 사운드 입력이 사전결정된 조건을 만족시키는지 여부를 결정한다(단계(504)). 일부 구현예들에서, 제3 사운드 검출기는 동작 중에 제1 사운드 검출기보다 더 적은 전력을 소비한다. 일부 구현예들에서, 제3 사운드 검출기는 도 4와 관련하여 위에서 논의된 바와 같이, 듀티 사이클에 따라 오디오 채널을 주기적으로 모니터링한다. 또한, 일부 구현예들에서, 제3 사운드 검출기는 사운드 입력의 시간-도메인 분석을 수행한다. 일부 구현예들에서, 시간-도메인 분석은 제2 사운드 검출기에 의해 적용되는 주파수-도메인 분석보다 덜 프로세서 집약적이기 때문에, 제3 사운드 검출기는 제1 사운드 검출기보다 더 적은 전력을 소비한다.
제1 사운드 검출기(예를 들어, 사운드-타입 검출기(404))에 의한 결정에 응답하여 제2 사운드 검출기(예를 들어, 트리거 사운드 검출기(406))를 개시하는 것과 관련하여 위에서 논의된 것과 유사하게, 일부 구현예들에서, 제1 사운드 검출기는 제3 사운드 검출기(예를 들어, 노이즈 검출기(402))에 의한 결정에 응답하여 개시된다. 예를 들어, 일부 구현예들에서, 사운드-타입 검출기(404)는 사운드 입력이 사전결정된 조건(예를 들어, 충분한 지속시간 동안 소정의 불륨 위에 있음)을 만족시킨다는 노이즈 검출기(402)에 의한 결정에 응답하여 개시된다. 일부 구현예들에서, 제1 사운드 검출기를 개시하는 것은 (예를 들어, 회로, 프로세서, 프로그램, 메모리 등을 포함하는) 하드웨어 및/또는 소프트웨어를 활성화하는 것을 포함한다. 다른 구현예들에서, 제1 사운드 검출기는 다른 조건들에 응답하여 개시되거나 또는 계속해서 동작된다. 일부 구현예들에서, 디바이스는 사운드 입력의 적어도 일부분을 메모리에 저장한다(518). 일부 구현예들에서, 메모리는 오디오 서브시스템(226)의 버퍼(414)(도 4)이다. 저장된 사운드 입력은 디바이스에 의한 사운드 입력의 비-실시간 프로세싱을 가능하게 한다. 예를 들어, 일부 구현예들에서, 하나 이상의 사운드 검출기가 저장된 사운드 입력을 프로세싱하기 위해 저장된 사운드 입력을 판독 및/또는 수신한다. 이것은 오디오 서브시스템(226)에 의한 사운드 입력을 수신하는 도중까지 업스트림 사운드 검출기(예를 들어, 트리거 사운드 검출기(406))가 개시되지 않는 경우에 특히 유용할 수 있다. 일부 구현예들에서, 스피치-기반 서비스가 개시되면 사운드 입력의 저장된 부분이 스피치-기반 서비스에 제공된다(520). 따라서, 스피치-기반 서비스는 사운드 입력의 해당 부분이 수신된 후까지 스피치-기반 서비스가 완전히 동작하지 않는다고 해도 사운드 입력의 저장된 부분에 대해 전사, 프로세싱, 또는 다른 방식으로 동작할 수 있다. 일부 구현예들에서, 사운드 입력의 저장된 부분이 전자 디바이스의 적응 모듈에 제공된다.
다양한 구현예들에서, 단계(516) 내지 단계(520)가 방법(500) 내의 서로 다른 위치들에서 수행된다. 예를 들어, 일부 구현예들에서, 단계(516) 내지 단계(520) 중 하나 이상이 단계(502)와 단계(504) 사이, 단계(510)와 단계(514) 사이, 또는 임의의 다른 적절한 위치에서 수행된다.
도 6은 일부 구현예들에 따라 음성 트리거 시스템(예를 들어, 도 4의 음성 트리거 시스템(400))을 동작하는 방법(600)을 도시한다. 일부 구현예들에서, 방법(600)은 하나 이상의 프로세서 및 하나 이상의 프로세서에 의해 실행하기 위한 명령어들을 저장하는 메모리를 포함하는 전자 디바이스에서 수행된다(예를 들어, 전자 디바이스(104)). 전자 디바이스는 자신이 사전결정된 방향에 있는지 여부를 결정한다(602). 일부 구현예들에서, 전자 디바이스는 (카메라를 포함하는) 광센서, 마이크로폰, 근접 센서, 자기 센서, 가속도계, 자이로스코프, 기울기 센서 등을 이용하여 자신의 방향을 검출한다. 예를 들어, 전자 디바이스는 앞을 보는(front-facing) 카메라의 센서 상에 입사하는 광량 또는 밝기와 뒤를 보는(rear-facing) 카메라의 센서 상에 입사하는 광량 또는 밝기를 비교함으로써 표면 상에서 아래를 보도록(face-down) 또는 위를 보도록(face-up) 놓여있는지 여부를 결정한다. 만약 앞을 보는 카메라에 의해 검출된 광량 및/또는 밝기가 뒤를 보는 카메라에 의해 검출된 것보다 뚜렷하게 더 크다면, 전자 디바이스는 자신이 위를 보고 있다고 결정할 것이다. 다른 한편으로, 만약 뒤를 보는 카메라에 의해 검출된 광량 및/또는 밝기가 앞을 보는 카메라에 의해 검출된 것보다 뚜렷하게 더 크다면, 디바이스는 자신이 아래를 보고 있다고 결정할 것이다. 전자 디바이스가 사전결정된 방향에 있다는 결정에 따라, 전자 디바이스는 음성 트리거의 사전결정된 모드를 활성화한다(604). 일부 구현예들에서, 사전결정된 방향은 실질적으로 수평이고 아래를 보고 있는 디바이스의 디스플레이 스크린에 대응하며, 사전결정된 모드는 스탠바이 모드이다(606). 예를 들어, 일부 구현예들에서, 만약 스마트폰 또는 태블릿의 스크린이 아래를 보도록 테이블 또는 데스크 상에 놓여 있다면, 음성 트리거는 음성 트리거의 의도하지 않은 활성화를 방지하기 위해서 스탠바이 모드에 놓이게 된다(예를 들어, 턴-오프 된다).
다른 한편으로, 일부 구현예들에서, 사전결정된 방향은 실질적으로 수평이고 위를 보고 있는 디바이스의 디스플레이 스크린에 대응하며, 사전결정된 모드는 청취 모드이다(608). 따라서, 예를 들어, 만약 스마트폰 또는 태블릿의 스크린이 위를 보도록 테이블 또는 데스크 상에 놓여 있다면, 음성 트리거는 트리거를 검출하였을 때 사용자에게 응답할 수 있도록 청취 모드에 놓이게 된다.
도 7은 일부 구현예들에 따라 음성 트리거(예를 들어, 도 4의 음성 트리거 시스템(400))를 동작하는 방법(700)을 도시한다. 일부 구현예들에서, 방법(700)은 하나 이상의 프로세서 및 하나 이상의 프로세서에 의해 실행하기 위한 명령어들을 저장하는 메모리를 포함하는 전자 디바이스에서 수행된다(예를 들어, 전자 디바이스(104)). 전자 디바이스는 제1 모드에서 음성 트리거(예를 들어, 음성 트리거 시스템(400))를 동작시킨다(702) 일부 구현예들에서, 제1 모드는 정상 청취 모드이다.
전자 디바이스는 전자 디바이스의 하나 이상의 마이크로폰 및 카메라가 폐색되었음을 검출함으로써 자신이 실질적으로 밀폐된 공간 내에 있는지 여부를 결정한다(704). 일부 구현예들에서, 실질적으로 밀폐된 공간은 주머니, 지갑, 가방, 서랍, 글러브박스, 서류가방 등을 포함한다.
전술된 바와 같이, 일부 구현예들에서, 디바이스는 스피커 또는 트랜듀서로부터 하나 이상의 사운드(예를 들어, 톤, 클릭, 핑 소리 등)를 방출하고 하나 이상의 마이크로폰 또는 트랜듀서가 방출된 사운드(들)의 에코를 검출하는지를 모니터링함으로써 마이크로폰이 폐색되었는지를 검출한다. 예를 들어, 비교적 넓은 환경(예를 들어, 방 또는 차량)이 비교적 작은, 실질적으로 밀폐된 환경(예를 들어, 지갑 또는 주머니)과 다르게 사운드를 반사시킬 것이다. 따라서, 만약 디바이스가 에코(또는 에코의 부재)에 기초하여 마이크로폰(또는 사운드가 방출된 스피커)가 폐색되었음을 검출하면, 디바이스는 자신이 실질적으로 밀폐된 공간 내에 있다고 결정한다. 일부 구현예들에서, 디바이스는 마이크로폰이 밀폐된 공간의 사운드 특징을 픽업하였음을 검출함으로써 마이크로폰이 폐색되었음을 검출한다. 예를 들어, 디바이스가 주머니 내에 있을 때, 마이크로폰은 마이크로폰이 주머니의 섬유와 접촉하거나 근접하게 됨으로 인해 특징적인 바스락거리는 노이즈를 검출할 수 있다. 일부 구현예들에서, 디바이스는 센서에 의해, 또는 초점이 맞춰진 이미지를 획득할 수 있는지 여부를 결정함으로써 수신된 광의 레벨에 기초하여 카메라가 폐색되었는지를 검출한다. 예를 들어, 만약 카메라 센서가 높은 레벨의 광이 예상될 수 있는 시간 동안 (예를 들어, 낮시간 동안) 낮은 레벨의 광을 검출한다면, 디바이스는 카메라가 폐색되었고, 그 디바이스는 실질적으로 밀폐된 공간 내에 있다고 결정한다. 다른 예로서, 카메라는 자신의 센서 상에 초점이 맞은 이미지를 획득하고자 시도할 수 있다. 일반적으로, 만약 카메라가 극도로 어두운 장소(예를 들어, 주머니 또는 백팩) 내에 있거나, 또는 카메라가 초점을 맞추고자 시도하고 있는 물체에 너무 가까이 있다면(예를 들어, 지갑 또는 백팩 내부), 초점이 맞은 이미지를 획득하는 것은 어려울 것이다. 따라서, 만약 카메라가 초점이 맞은 이미지를 획득할 수 없다면, 디바이스가 실질적으로 밀폐된 공간 내에 있다고 결정한다.
전자 디바이스가 실질적으로 밀폐된 공간 내에 있다는 결정에 따라, 전자 디바이스는 음성 트리거를 제2 모드로 전환한다(706). 일부 구현예들에서, 제2 모드는 스탠바이 모드이다(708). 일부 구현예들에서, 스탠바이 모드에 있을 때, 음성 트리거 시스템(400)은 계속해서 주변 오디오를 모니터링할 것이지만, 다른 방식으로 음성 트리거 시스템(400)을 트리거할 것인지 여부와 무관하게 수신된 사운드에 응답하지 않을 것이다. 일부 구현예들에서, 스탠바이 모드에서는 음성 트리거 시스템(400)이 비활성화되며, 트리거 사운드를 검출하기 위해 오디오를 프로세싱하지 않는다. 일부 구현예들에서, 제2 모드는 제1 모드와 다른 듀티 사이클에 따라 음성 트리거 시스템(400)의 하나 이상의 사운드 검출기를 동작시키는 것을 포함한다. 일부 구현예들에서, 제2 모드는 제1 모드와 다른 사운드 검출기들의 조합을 동작시키는 것을 포함한다.
일부 구현예들에서, 실질적으로 밀폐된 공간 내에 있다고 해도 음성 트리거 시스템(400)이 트리거 사운드를 검출하고 그에 반응할 수 있도록 제2 모드는 더욱 민감한 모니터링 모드에 대응한다. 일부 구현예들에서, 음성 트리거가 제2 모드로 전환되면, 디바이스는 (예를 들어, 단계(704)와 관련하여 전술된 임의의 기술을 이용하여) 전자 디바이스의 하나 이상의 마이크로폰 및 카메라가 폐색되었는지 여부를 검출함으로써 전자 디바이스가 여전히 실질적으로 밀폐된 공간 내에 있는지 여부를 주기적으로 결정한다. 만약 디바이스가 실질적으로 밀폐된 공간 내에 남아있다면, 음성 트리거 시스템(400)은 제2 모드로 유지될 것이다. 일부 구현예들에서, 만약 디바이스가 실질적으로 밀폐된 공간으로부터 제거되면, 전자 디바이스는 음성 트리거를 제1 모드로 복귀시킬 것이다.
일부 구현예들에 따라, 도 8은 전술된 바와 같은 본 발명의 원리에 따라 구성된 전자 디바이스(800)의 기능 블록 다이어그램을 도시한다. 디바이스의 기능 블록들은 본 발명의 원리들을 실행하도록 하드웨어, 소프트웨어 또는 하드웨어와 소프트웨어의 조합에 의해 구현될 수 있다. 도 8에 묘사된 기능 블록들은 앞서 기재된 바와 같이 본 발명의 원리들을 구현하기 위해 조합되거나 서브-블록들로 분리될 수 있음이 본 발명이 속하는 기술분야에서 통상의 지식을 가진 자에 의해 이해된다. 따라서, 본 명세서에서의 설명은 본 명세서에서 기술된 기능 블록들의 임의의 가능한 조합 또는 분리 또는 추가적인 정의를 지원할 수 있다.
도 8에 도시된 바와 같이, 전자 디바이스(800)는 사운드 입력을 수신하도록 구성된 사운드 수신 유닛(802)을 포함한다. 전자 디바이스(800)는 또한 스피치 수신 유닛(802)에 연결된 프로세싱 유닛(806)을 포함한다. 일부 구현예들에서, 프로세싱 유닛(806)은 노이즈 검출 유닛(808), 사운드 타입 검출 유닛(810), 트리거 사운드 검출 유닛(812), 서비스 개시 유닛(814) 및 음성 인증 유닛(816)을 포함한다. 일부 구현예들에서, 노이즈 검출 유닛(808)은 위에서 논의된 노이즈 검출기(402)에 대응하며, 노이즈 검출기(402)를 참조로 하여 전술된 임의의 동작들을 수행하도록 구성된다. 일부 구현예들에서, 사운드 타입 검출 유닛(810)은 위에서 논의된 사운드-타입 검출기(404)에 대응하며, 사운드-타입 검출기(404)를 참조로 하여 전술된 임의의 동작들을 수행하도록 구성된다. 일부 구현예들에서, 트리거 사운드 검출 유닛(812)은 위에서 논의된 트리거 사운드 검출기(406)에 대응하며, 트리거 사운드 검출기(406)를 참조로 하여 전술된 임의의 동작들을 수행하도록 구성된다. 일부 구현예들에서, 음성 인증 유닛(816)은 위에서 논의된 음성 인증 모듈(428)에 대응하며, 음성 인증 모듈(428)을 참조로 하여 전술된 임의의 동작들을 수행하도록 구성된다. 프로세싱 유닛(806)은 사운드 입력의 적어도 일부분이 사전결정된 타입의 사운드에 대응하는지 여부를 결정하고(예를 들어, 사운드 타입 검출 유닛(810)을 이용); 사운드 입력의 적어도 일부분이 사전결정된 타입에 대응한다는 결정에 따라, 사운드 입력이 사전결정된 콘텐츠를 포함하는지 여부를 결정하며(예를 들어, 트리거 사운드 검출 유닛(812)을 이용); 사운드 입력이 사전결정된 콘텐츠를 포함한다는 결정에 따라, 스피치-기반 서비스를 개시한다(예를 들어, 서비스 개시 유닛(814)을 이용).
일부 구현예들에서, 프로세싱 유닛(806)은 또한, 사운드 입력이 사전결정된 타입의 사운드에 대응하는지 여부를 결정하기 전에, 사운드 입력이 사전결정된 조건을 만족시키는지 여부를 결정하도록 구성된다(예를 들어, 노이즈 검출 유닛(808)을 이용). 일부 구현예들에서, 프로세싱 유닛(806)은 또한 사운드 입력이 특정 사용자의 음성에 대응하는지 여부를 결정하도록 구성된다(예를 들어, 음성 인증 유닛(816)을 이용).
일부 구현예들에 따라서, 도 9는 전술된 바와 같은 본 발명의 원리들에 따라 구성된 전자 디바이스(900)의 기능 블록 다이어그램을 도시한다. 디바이스의 기능 블록들은 본 발명의 원리들을 실행하도록 하드웨어, 소프트웨어 또는 하드웨어와 소프트웨어의 조합에 의해 구현될 수 있다. 도 9에 묘사된 기능 블록들은 앞서 기재된 바와 같이 본 발명의 원리들을 구현하기 위해 조합되거나 서브-블록들로 분리될 수 있음이 본 발명이 속하는 기술분야에서 통상의 지식을 가진 자에 의해 이해된다. 따라서, 본 명세서에서의 설명은 본 명세서에서 기술된 기능 블록들의 임의의 가능한 조합 또는 분리 또는 추가적인 정의를 지원할 수 있다.
도 9에 도시된 바와 같이, 전자 디바이스(900)는 음성 트리거 유닛(902)을 포함한다. 음성 트리거 유닛(902)은 다양한 서로 다른 모드들에서 동작될 수 있다. 제1 모드에서, 음성 트리거 유닛은 사운드 입력을 수신하고 사운드 입력이 소정의 기준을 만족시키는지를 결정한다(예를 들어, 청취 모드). 제2 모드에서, 음성 트리거 유닛(902)은 사운드 입력을 수신하지 않고/않거나 프로세싱하지 않는다(예를 들어, 스탠바이 모드). 전자 디바이스(900)는 또한 음성 트리거 유닛(902)에 연결된 프로세싱 유닛(906)을 포함한다. 일부 구현예들에서, 프로세싱 유닛(906)은 (예를 들어, 마이크로폰, 카메라, 가속도계, 자이로스코프 등을 포함하는) 하나 이상의 센서를 포함할 수 있고/할 수 있거나 하나 이상의 센서와 인터페이스할 수 있는 환경 검출 유닛(908) 및 모드 전환 유닛(910)을 포함한다. 일부 구현예들에서, 프로세싱 유닛(906)은: 전자 디바이스의 하나 이상의 마이크로폰 및 카메라가 폐색되었음을 검출함으로써 전자 디바이스가 실질적으로 밀폐된 공간 내에 있는지 여부를 결정하고(예를 들어, 환경 검출 유닛(908)을 이용); 전자 디바이스가 실질적으로 밀폐된 공간 내에 있다는 결정에 따라, 음성 트리거를 제2 모드로 전환하도록 구성된다(예를 들어, 모드 전환 유닛(910)을 이용).
일부 구현예들에서, 프로세싱 유닛은: 전자 디바이스가 사전결정된 방향에 있는지 여부를 결정하고(예를 들어, 환경 검출 유닛(908)을 이용); 전자 디바이스가 사전결정된 방향에 있다는 결정에 따라, 음성 트리거의 사전결정된 모드를 활성화하도록 구성된다(예를 들어, 모드 전환 유닛(910)을 이용).
일부 구현예들에 따라서, 도 10은 전술된 바와 같은 본 발명의 원리들에 따라 구성된 전자 디바이스(1000)의 기능 블록 다이어그램을 도시한다. 디바이스의 기능 블록들은 본 발명의 원리들을 실행하도록 하드웨어, 소프트웨어 또는 하드웨어와 소프트웨어의 조합에 의해 구현될 수 있다. 도 10에 묘사된 기능 블록들은 전술된 바와 같이 본 발명의 원리들을 구현하기 위해 조합되거나 서브-블록들로 분리될 수 있음이 본 발명이 속하는 기술분야에서 통상의 지식을 가진 자에 의해 이해된다. 따라서, 본 명세서에서의 설명은 본 명세서에서 기술된 기능 블록들의 임의의 가능한 조합 또는 분리 또는 추가적인 정의를 지원할 수 있다.
도 10에 도시된 바와 같이, 전자 디바이스(1000)는 음성 트리거 유닛(1002)을 포함한다. 음성 트리거 유닛(1002)은 다양한 서로 다른 모드들에서 동작될 수 있다. 제1 모드에서, 음성 트리거 유닛은 사운드 입력을 수신하고 사운드 입력이 소정의 기준을 만족시키는지를 결정한다(예를 들어, 청취 모드). 제2 모드에서, 음성 트리거 유닛(1002)은 사운드 입력을 수신하지 않고/않거나 프로세싱하지 않는다(예를 들어, 스탠바이 모드). 전자 디바이스(1000)는 또한 음성 트리거 유닛(1002)에 연결된 프로세싱 유닛(1006)을 포함한다. 일부 구현예들에서, 프로세싱 유닛(1006)은 마이크로폰 및/또는 카메라를 포함할 수 있고/할 수 있거나 이들과 인터페이스할 수 있는 환경 검출 유닛(1008) 및 모드 전환 유닛(1010)을 포함한다.
프로세싱 유닛(1006)은: 전자 디바이스의 하나 이상의 마이크로폰 및 카메라가 폐색되었음을 검출함으로써 전자 디바이스가 실질적으로 밀폐된 공간 내에 있는지 여부를 결정하고(예를 들어, 환경 검출 유닛(1008)을 이용); 전자 디바이스가 실질적으로 밀폐된 공간 내에 있다는 결정에 따라, 음성 트리거를 제2 모드로 전환하도록 구성된다(예를 들어, 모드 전환 유닛(1010)을 이용). 전술된 내용은 설명을 위해 특정 구현예들을 참조하여 기술되었다. 그러나, 상기의 예시적인 논의들은 개시된 구현예들을 망라하거나 또는 개시된 정확한 형태들로 제한하려는 의도는 아니다. 많은 수정들 및 변형들이 상기 교시 내용들의 관점에서 가능하다. 구현예들은 개시된 아이디어들의 원리들 및 실제 응용들을 가장 잘 설명하여, 이로써 당업자가 이들을 고려되는 특정 용도에 맞춰진 바와 같은 다양한 수정들과 함께 가장 잘 활용할 수 있게 하기 위해 선택되었고 기술되었다.
"제1", "제2" 등의 용어들이 본 명세서에서 다양한 요소들을 기술하기 위해 사용될 수 있지만, 이러한 요소들이 이들 용어들로 제한되어서는 안된다는 것이 이해될 것이다. 이들 용어들은 하나의 요소를 다른 요소와 구별하는 데에만 사용된다. 예를 들어, 등장하는 모든 제1 사운드 검출기가 일관적으로 명칭이 변경되고 등장하는 모든 제2 사운드 검출기가 일관적으로 명칭이 변경되는 한, 설명의 의미를 변화시키지 않고 제1 사운드 검출기가 제2 사운드 검출기로 명명될 수 있으며, 유사하게, 제2 사운드 검출기가 제1 사운드 검출기로 명명될 수 있다. 제1 사운드 검출기 및 제2 사운드 검출기는 모두 사운드 검출기들이지만, 동일한 사운드 검출기는 아니다.
본 명세서에서 사용되는 용어는 단지 특정 구현예들만을 기술하기 위한 것이고, 특허청구범위를 제한하고자 의도되는 것은 아니다. 구현예들 및 첨부된 특허청구범위의 설명에서 사용되는 바와 같은 단수 형태의 명사들은 맥락에서 달리 명백하게 나타내지 않는 한, 복수 형태의 명사들 또한 포함하고자 의도된다. 또한 본 명세서에서 사용되는 바와 같은 용어 "및/또는"이 하나 이상의 연관된 나열된 아이템들의 임의의 가능한 조합 및 모든 가능한 조합들을 지칭하며 이를 망라한다는 것이 이해될 것이다. 또한 용어 "포함한다" 및/또는 "포함하는"이 본 명세서에 사용되었을 때, 이러한 용어가 언급된 특성, 정수, 단계, 동작, 요소, 및/또는 컴포넌트들의 존재를 명시하지만, 하나 이상의 다른 특성, 정수, 단계, 동작, 요소, 및/또는 컴포넌트들, 및/또는 이들의 그룹의 존재 또는 추가를 배재하는 것은 아니라는 것이 추가로 이해될 것이다. 본 명세서에서 사용되는 바와 같이, 용어 "만약 ~한다면"은 맥락에 따라, 언급된 조건 선례가 참인 "~하는 경우" 또는 "~함에 따라" 또는 "결정에 응답하여" 또는 "결정에 따라서" 또는 "검출에 응답하여"를 의미하는 것으로 해석될 수 있다. 유사하게, "만약 [언급된 조건 선례가 참이라고] 결정된다면" 또는 "만약 [언급된 조건 선례가 참]이라면" 또는 "[언급된 조건 선례가 참]인 경우"와 같은 구가 맥락에 따라 언급된 조건 선례가 참인 "결정함에 따라" 또는 "~라는 결정에 따라" 또는 "결정한 것에 응답하여" 또는 "결정에 따라서" 또는 "검출함에 따라" 또는 "검출한 것에 응답하여"를 의미하는 것으로 해석될 수 있다.

Claims (15)

  1. 음성 트리거(voice trigger)를 동작시키는 방법으로서 - 상기 방법은 하나 이상의 프로세서 및 상기 하나 이상의 프로세서에 의한 실행을 위한 명령어들을 저장하는 메모리를 포함하는 전자 디바이스에서 수행됨 -,
    상기 음성 트리거를 제1 모드에서 동작시키는 단계;
    상기 음성 트리거를 상기 제1 모드에서 동작시키는 동안, 상기 전자 디바이스가 제2 전자 디바이스의 물리적 근접도 내에 있다고 결정하는 단계 - 상기 제2 전자 디바이스는 제2 음성 트리거를 동작시킴 -; 및
    상기 전자 디바이스가 상기 제2 전자 디바이스의 물리적 근접도 내에 있다는 결정에 따라,
    상기 음성 트리거를 제2 모드로 전환하는 단계
    를 포함하는, 방법.
  2. 제1항에 있어서, 상기 전자 디바이스는 제1 마이크로폰을 포함하고, 상기 방법은,
    상기 음성 트리거를 상기 제1 모드에서 동작시키는 동안 그리고 상기 전자 디바이스가 제2 마이크로폰을 포함하는 외부 전자 디바이스에 연결되어 있는 동안, 상기 제1 마이크로폰을 이용하여 오디오 입력을 모니터링 하는 단계; 및
    상기 오디오 입력이 사전결정된 콘텐츠를 포함한다는 결정에 따라,
    스피치 기반 서비스를 개시하는 단계;
    상기 제2 마이크로폰이 제2 오디오 입력을 모니터링하게 하는 단계; 및
    상기 제1 마이크로폰을 이용하여 상기 오디오 입력을 모니터링하는 것을 중단하는 단계
    를 더 포함하는, 방법.
  3. 제1항에 있어서, 상기 전자 디바이스는 제1 마이크로폰을 포함하고, 상기 방법은,
    상기 음성 트리거를 상기 제1 모드에서 동작시키는 동안,
    제1 오디오 입력이 사전결정된 콘텐츠를 포함하는지 여부를 결정하기 위해 상기 제1 마이크로폰을 이용하여 상기 제1 오디오 입력을 모니터링하는 단계; 및
    상기 전자 디바이스가 제2 마이크로폰을 포함하는 외부 전자 디바이스에 연결되어 있는 동안,
    사전결정된 조건이 만족된다는 결정에 따라,
    제2 오디오 입력이 상기 사전결정된 콘텐츠를 포함하는지 여부를 결정하기 위해 상기 제2 마이크로폰이 상기 제2 오디오 입력을 모니터링하게 하는 단계; 및
    상기 제1 마이크로폰을 이용하여 상기 제1 오디오 입력을 모니터링하는 것을 중단하는 단계
    를 더 포함하는, 방법.
  4. 제3항에 있어서, 상기 사전결정된 조건이 만족된다고 결정하는 것은 상기 외부 전자 디바이스가 사용자에 의해 현재 착용되어 있다고 결정하는 것을 포함하는, 방법.
  5. 제4항에 있어서, 상기 외부 전자 디바이스가 상기 사용자에 의해 현재 착용되어 있다고 결정하는 것은,
    상기 전자 디바이스의 동작과 상기 외부 전자 디바이스의 동작 사이의 차이를 결정하는 것을 포함하는, 방법.
  6. 제3항에 있어서,
    상기 제2 오디오 입력이 상기 사전결정된 콘텐츠를 포함한다는 결정에 따라,
    상기 전자 디바이스에서 동작하는 스피치 기반 서비스를 개시하는 단계
    를 더 포함하는, 방법.
  7. 제6항에 있어서, 상기 스피치 기반 서비스는 디지털 어시스턴트를 포함하는, 방법.
  8. 제3항에 있어서, 상기 외부 전자 디바이스는 헤드셋을 포함하는, 방법.
  9. 제3항에 있어서, 상기 사전결정된 콘텐츠는 하나 이상의 단어를 포함하는, 방법.
  10. 제1항에 있어서, 상기 제1 모드는 청취 모드를 포함하는, 방법.
  11. 제1항에 있어서, 상기 제2 모드는 스탠바이 모드를 포함하는, 방법.
  12. 제1항에 있어서, 상기 전자 디바이스가 상기 제2 전자 디바이스의 물리적 근접도 내에 있다고 결정하는 것은,
    RFID 통신을 이용하여 상기 제2 전자 디바이스에 대한 물리적 근접도를 결정하는 것을 포함하는, 방법.
  13. 제1항에 있어서, 상기 전자 디바이스가 상기 제2 전자 디바이스의 물리적 근접도 내에 있다고 결정하는 것은,
    근거리 통신을 이용하여 상기 제2 전자 디바이스에 대한 물리적 근접도를 결정하는 것을 포함하는, 방법.
  14. 전자 디바이스의 하나 이상의 프로세서에 의해 실행되기 위한 하나 이상의 프로그램을 저장하는 컴퓨터 판독가능한 저장 매체로서, 상기 하나 이상의 프로그램은 제1항 내지 제13항 중 어느 한 항에 기재된 방법을 수행하기 위한 명령어들을 포함하는, 컴퓨터 판독가능한 저장 매체.
  15. 전자 디바이스로서,
    하나 이상의 프로세서;
    메모리; 및
    하나 이상의 프로그램을 포함하고,
    상기 하나 이상의 프로그램은 상기 메모리에 저장되고 상기 하나 이상의 프로세서에 의해 실행되도록 구성되며,
    상기 하나 이상의 프로그램은 제1항 내지 제13항 중 어느 한 항에 기재된 방법을 수행하기 위한 명령어들을 포함하는, 전자 디바이스.
KR1020227024872A 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거 KR102516577B1 (ko)

Priority Applications (1)

Application Number Priority Date Filing Date Title
KR1020237010639A KR102579086B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거

Applications Claiming Priority (4)

Application Number Priority Date Filing Date Title
US201361762260P 2013-02-07 2013-02-07
US61/762,260 2013-02-07
KR1020227009916A KR102423670B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거
PCT/US2014/015418 WO2014124332A2 (en) 2013-02-07 2014-02-07 Voice trigger for a digital assistant

Related Parent Applications (1)

Application Number Title Priority Date Filing Date
KR1020227009916A Division KR102423670B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거

Related Child Applications (1)

Application Number Title Priority Date Filing Date
KR1020237010639A Division KR102579086B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거

Publications (2)

Publication Number Publication Date
KR20220106856A KR20220106856A (ko) 2022-07-29
KR102516577B1 true KR102516577B1 (ko) 2023-04-03

Family

ID=50193584

Family Applications (8)

Application Number Title Priority Date Filing Date
KR1020167029691A KR102103057B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거
KR1020237031091A KR102698417B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거
KR1020237010639A KR102579086B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거
KR1020227024872A KR102516577B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거
KR1020157021438A KR20150104615A (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거
KR1020207015307A KR102380145B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거
KR1020227009916A KR102423670B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거
KR1020187017535A KR102118209B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거

Family Applications Before (3)

Application Number Title Priority Date Filing Date
KR1020167029691A KR102103057B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거
KR1020237031091A KR102698417B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거
KR1020237010639A KR102579086B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거

Family Applications After (4)

Application Number Title Priority Date Filing Date
KR1020157021438A KR20150104615A (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거
KR1020207015307A KR102380145B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거
KR1020227009916A KR102423670B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거
KR1020187017535A KR102118209B1 (ko) 2013-02-07 2014-02-07 디지털 어시스턴트를 위한 음성 트리거

Country Status (9)

Country Link
US (8) US10199051B2 (ko)
EP (3) EP4138075A1 (ko)
JP (8) JP2016508007A (ko)
KR (8) KR102103057B1 (ko)
CN (4) CN113744733B (ko)
AU (3) AU2014214676A1 (ko)
BR (1) BR112015018905B1 (ko)
DE (2) DE212014000045U1 (ko)
WO (1) WO2014124332A2 (ko)

Families Citing this family (625)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US10032452B1 (en) 2016-12-30 2018-07-24 Google Llc Multimodal transmission of packetized data
US8677377B2 (en) 2005-09-08 2014-03-18 Apple Inc. Method and apparatus for building an intelligent automated assistant
US9318108B2 (en) 2010-01-18 2016-04-19 Apple Inc. Intelligent automated assistant
US8977255B2 (en) 2007-04-03 2015-03-10 Apple Inc. Method and system for operating a multi-function portable electronic device using voice-activation
US10469556B2 (en) 2007-05-31 2019-11-05 Ooma, Inc. System and method for providing audio cues in operation of a VoIP service
KR101572768B1 (ko) 2007-09-24 2015-11-27 애플 인크. 전자 장치 내의 내장형 인증 시스템들
US10002189B2 (en) 2007-12-20 2018-06-19 Apple Inc. Method and apparatus for searching using an active ontology
US8600120B2 (en) 2008-01-03 2013-12-03 Apple Inc. Personal computing device control using face detection and recognition
US9330720B2 (en) 2008-01-03 2016-05-03 Apple Inc. Methods and apparatus for altering audio output signals
US10013986B1 (en) 2016-12-30 2018-07-03 Google Llc Data structure pooling of voice activated data packets
US11017428B2 (en) 2008-02-21 2021-05-25 Google Llc System and method of data transmission rate adjustment
US8996376B2 (en) 2008-04-05 2015-03-31 Apple Inc. Intelligent text-to-speech conversion
US20100030549A1 (en) 2008-07-31 2010-02-04 Lee Michael M Mobile device having human language translation capability with positional feedback
US8676904B2 (en) 2008-10-02 2014-03-18 Apple Inc. Electronic devices with voice command and contextual data processing capabilities
US10241752B2 (en) 2011-09-30 2019-03-26 Apple Inc. Interface for a virtual digital assistant
US20120309363A1 (en) 2011-06-03 2012-12-06 Apple Inc. Triggering notifications associated with tasks items that represent tasks to perform
US10241644B2 (en) 2011-06-03 2019-03-26 Apple Inc. Actionable reminder entries
US9431006B2 (en) 2009-07-02 2016-08-30 Apple Inc. Methods and apparatuses for automatic speech recognition
US10276170B2 (en) 2010-01-18 2019-04-30 Apple Inc. Intelligent automated assistant
US8682667B2 (en) 2010-02-25 2014-03-25 Apple Inc. User profiling for selecting user specific voice input processing information
US10013978B1 (en) 2016-12-30 2018-07-03 Google Llc Sequence dependent operation processing of packet based data message transmissions
US9262612B2 (en) 2011-03-21 2016-02-16 Apple Inc. Device access using voice authentication
US10057736B2 (en) 2011-06-03 2018-08-21 Apple Inc. Active transport based notifications
US11087424B1 (en) 2011-06-24 2021-08-10 Google Llc Image recognition-based content item selection
US10972530B2 (en) * 2016-12-30 2021-04-06 Google Llc Audio-based data structure generation
US8688514B1 (en) 2011-06-24 2014-04-01 Google Inc. Ad selection using image data
US10630751B2 (en) 2016-12-30 2020-04-21 Google Llc Sequence dependent data message consolidation in a voice activated computer network environment
US9002322B2 (en) 2011-09-29 2015-04-07 Apple Inc. Authentication with secondary approver
US11451618B2 (en) * 2014-05-15 2022-09-20 Universal Electronics Inc. Universal voice assistant
US11700412B2 (en) 2019-01-08 2023-07-11 Universal Electronics Inc. Universal voice assistant
US11792185B2 (en) 2019-01-08 2023-10-17 Universal Electronics Inc. Systems and methods for associating services and/or devices with a voice assistant
US10586127B1 (en) 2011-11-14 2020-03-10 Google Llc Extracting audiovisual features from content elements on online documents
US11093692B2 (en) 2011-11-14 2021-08-17 Google Llc Extracting audiovisual features from digital components
US10134385B2 (en) 2012-03-02 2018-11-20 Apple Inc. Systems and methods for name pronunciation
US10417037B2 (en) 2012-05-15 2019-09-17 Apple Inc. Systems and methods for integrating third party services with a digital assistant
US10776830B2 (en) 2012-05-23 2020-09-15 Google Llc Methods and systems for identifying new computers and providing matching services
US9721563B2 (en) 2012-06-08 2017-08-01 Apple Inc. Name recognition system
US9767479B2 (en) 2012-06-25 2017-09-19 Google Inc. System and method for deploying ads based on a content exposure interval
US9536528B2 (en) 2012-07-03 2017-01-03 Google Inc. Determining hotword suitability
US9547647B2 (en) 2012-09-19 2017-01-17 Apple Inc. Voice-based media searching
US10373615B2 (en) * 2012-10-30 2019-08-06 Google Technology Holdings LLC Voice control user interface during low power mode
US9584642B2 (en) * 2013-03-12 2017-02-28 Google Technology Holdings LLC Apparatus with adaptive acoustic echo control for speakerphone mode
US10304465B2 (en) * 2012-10-30 2019-05-28 Google Technology Holdings LLC Voice control user interface for low power mode
US10381002B2 (en) * 2012-10-30 2019-08-13 Google Technology Holdings LLC Voice control user interface during low-power mode
US10650066B2 (en) 2013-01-31 2020-05-12 Google Llc Enhancing sitelinks with creative content
DE212014000045U1 (de) 2013-02-07 2015-09-24 Apple Inc. Sprach-Trigger für einen digitalen Assistenten
KR20140104220A (ko) * 2013-02-20 2014-08-28 삼성전자주식회사 투명 디스플레이를 이용하는 전자장치에서 화면전환 방법 및 장치
US9111546B2 (en) * 2013-03-06 2015-08-18 Nuance Communications, Inc. Speech recognition and interpretation system
US10652394B2 (en) 2013-03-14 2020-05-12 Apple Inc. System and method for processing voicemail
US10748529B1 (en) 2013-03-15 2020-08-18 Apple Inc. Voice activated device for use with a voice-based digital assistant
US10719591B1 (en) 2013-03-15 2020-07-21 Google Llc Authentication of audio-based input signals
US10541997B2 (en) 2016-12-30 2020-01-21 Google Llc Authentication of packetized audio signals
US11064250B2 (en) * 2013-03-15 2021-07-13 Google Llc Presence and authentication for media measurement
US9530410B1 (en) 2013-04-09 2016-12-27 Google Inc. Multi-mode guard for voice commands
US20140365225A1 (en) * 2013-06-05 2014-12-11 DSP Group Ultra-low-power adaptive, user independent, voice triggering schemes
WO2014197334A2 (en) 2013-06-07 2014-12-11 Apple Inc. System and method for user-specified pronunciation of words for speech synthesis and recognition
WO2014197335A1 (en) 2013-06-08 2014-12-11 Apple Inc. Interpreting and acting upon commands that involve sharing information with remote devices
US10176167B2 (en) 2013-06-09 2019-01-08 Apple Inc. System and method for inferring user intent from speech inputs
AU2014278592B2 (en) 2013-06-09 2017-09-07 Apple Inc. Device, method, and graphical user interface for enabling conversation persistence across two or more instances of a digital assistant
US11218434B2 (en) 2013-06-12 2022-01-04 Google Llc Audio data packet status determination
US9747899B2 (en) 2013-06-27 2017-08-29 Amazon Technologies, Inc. Detecting self-generated wake expressions
US9711148B1 (en) 2013-07-18 2017-07-18 Google Inc. Dual model speaker identification
US9575720B2 (en) * 2013-07-31 2017-02-21 Google Inc. Visual confirmation for a recognized voice-initiated action
WO2015020942A1 (en) 2013-08-06 2015-02-12 Apple Inc. Auto-activating smart responses based on activities from remote devices
US9898642B2 (en) 2013-09-09 2018-02-20 Apple Inc. Device, method, and graphical user interface for manipulating user interfaces based on fingerprint sensor inputs
US9386148B2 (en) 2013-09-23 2016-07-05 Ooma, Inc. Identifying and filtering incoming telephone calls to enhance privacy
US9703757B2 (en) 2013-09-30 2017-07-11 Google Inc. Automatically determining a size for a content item for a web page
US10431209B2 (en) 2016-12-30 2019-10-01 Google Llc Feedback controller for data transmissions
US10614153B2 (en) 2013-09-30 2020-04-07 Google Llc Resource size-based content item selection
US9658688B2 (en) * 2013-10-15 2017-05-23 Microsoft Technology Licensing, Llc Automatic view adjustment
US10079019B2 (en) 2013-11-12 2018-09-18 Apple Inc. Always-on audio control for mobile device
US9189742B2 (en) 2013-11-20 2015-11-17 Justin London Adaptive virtual intelligent agent
US20150154002A1 (en) * 2013-12-04 2015-06-04 Google Inc. User interface customization based on speaker characteristics
US10296160B2 (en) 2013-12-06 2019-05-21 Apple Inc. Method for extracting salient dialog usage from live data
US10147441B1 (en) * 2013-12-19 2018-12-04 Amazon Technologies, Inc. Voice controlled system
EP3084760A4 (en) * 2013-12-20 2017-08-16 Intel Corporation Transition from low power always listening mode to high power speech recognition mode
WO2015100430A1 (en) 2013-12-24 2015-07-02 Digimarc Corporation Methods and system for cue detection from audio input, low-power data processing and related arrangements
US20150234930A1 (en) 2014-02-19 2015-08-20 Google Inc. Methods and systems for providing functional extensions with a landing page of a creative
US9430186B2 (en) 2014-03-17 2016-08-30 Google Inc Visual indication of a recognized voice-initiated action
US9275632B1 (en) * 2014-03-19 2016-03-01 West Corporation Voice-activated customer service assistant
US9547468B2 (en) * 2014-03-31 2017-01-17 Microsoft Technology Licensing, Llc Client-side personal voice web navigation
US10770075B2 (en) * 2014-04-21 2020-09-08 Qualcomm Incorporated Method and apparatus for activating application by speech input
US9883301B2 (en) * 2014-04-22 2018-01-30 Google Technology Holdings LLC Portable electronic device with acoustic and/or proximity sensors and methods therefor
US10063625B2 (en) 2014-05-15 2018-08-28 Universal Electronics Inc. System and method for appliance detection and app configuration
US11445011B2 (en) * 2014-05-15 2022-09-13 Universal Electronics Inc. Universal voice assistant
US9633547B2 (en) 2014-05-20 2017-04-25 Ooma, Inc. Security monitoring and control
US10769931B2 (en) 2014-05-20 2020-09-08 Ooma, Inc. Network jamming detection and remediation
US10553098B2 (en) 2014-05-20 2020-02-04 Ooma, Inc. Appliance device integration with alarm systems
US10482461B2 (en) 2014-05-29 2019-11-19 Apple Inc. User interface for payments
AU2015266863B2 (en) 2014-05-30 2018-03-15 Apple Inc. Multi-command single utterance input method
US10170123B2 (en) 2014-05-30 2019-01-01 Apple Inc. Intelligent assistant for home automation
US9715875B2 (en) 2014-05-30 2017-07-25 Apple Inc. Reducing the need for manual start/end-pointing and trigger phrases
US9633004B2 (en) 2014-05-30 2017-04-25 Apple Inc. Better resolution when referencing to concepts
US9430463B2 (en) 2014-05-30 2016-08-30 Apple Inc. Exemplar-based natural language processing
CN106664123A (zh) * 2014-06-02 2017-05-10 施拉奇锁有限责任公司 自然语言用户界面
US9697828B1 (en) * 2014-06-20 2017-07-04 Amazon Technologies, Inc. Keyword detection modeling using contextual and environmental information
KR102208477B1 (ko) 2014-06-30 2021-01-27 삼성전자주식회사 마이크 운용 방법 및 이를 지원하는 전자 장치
US9338493B2 (en) 2014-06-30 2016-05-10 Apple Inc. Intelligent automated assistant for TV user interactions
US11330100B2 (en) * 2014-07-09 2022-05-10 Ooma, Inc. Server based intelligent personal assistant services
US10325591B1 (en) * 2014-09-05 2019-06-18 Amazon Technologies, Inc. Identifying and suppressing interfering audio content
US9818400B2 (en) 2014-09-11 2017-11-14 Apple Inc. Method and apparatus for discovering trending terms in speech requests
US10789041B2 (en) 2014-09-12 2020-09-29 Apple Inc. Dynamic thresholds for always listening speech trigger
US20160077793A1 (en) * 2014-09-15 2016-03-17 Microsoft Corporation Gesture shortcuts for invocation of voice input
US9668121B2 (en) 2014-09-30 2017-05-30 Apple Inc. Social reminders
US10127911B2 (en) 2014-09-30 2018-11-13 Apple Inc. Speaker identification and unsupervised speaker adaptation techniques
US10074360B2 (en) 2014-09-30 2018-09-11 Apple Inc. Providing an indication of the suitability of speech recognition
US9699550B2 (en) 2014-11-12 2017-07-04 Qualcomm Incorporated Reduced microphone power-up latency
KR102299330B1 (ko) * 2014-11-26 2021-09-08 삼성전자주식회사 음성 인식 방법 및 그 전자 장치
US10192549B2 (en) 2014-11-28 2019-01-29 Microsoft Technology Licensing, Llc Extending digital personal assistant action providers
KR20160065503A (ko) * 2014-12-01 2016-06-09 엘지전자 주식회사 이동 단말기 및 그 제어 방법
US10147421B2 (en) 2014-12-16 2018-12-04 Microcoft Technology Licensing, Llc Digital assistant voice input integration
US9690542B2 (en) * 2014-12-22 2017-06-27 Microsoft Technology Licensing, Llc Scaling digital personal assistant agents across devices
WO2016104824A1 (ko) * 2014-12-23 2016-06-30 엘지전자 주식회사 포터블 디바이스 및 그 제어 방법
US9837081B2 (en) 2014-12-30 2017-12-05 Microsoft Technology Licensing, Llc Discovering capabilities of third-party voice-enabled resources
US9653079B2 (en) * 2015-02-12 2017-05-16 Apple Inc. Clock switching in always-on component
KR102346302B1 (ko) * 2015-02-16 2022-01-03 삼성전자 주식회사 전자 장치 및 음성 인식 기능 운용 방법
FR3033111A1 (fr) * 2015-02-23 2016-08-26 Orange Procede d'utilisation d'une gestion automatique de communication, procede et dispositif de gestion automatique de communication et terminal l'utilisant
GB2535766B (en) * 2015-02-27 2019-06-12 Imagination Tech Ltd Low power detection of an activation phrase
US10152299B2 (en) 2015-03-06 2018-12-11 Apple Inc. Reducing response latency of intelligent automated assistants
US9865280B2 (en) * 2015-03-06 2018-01-09 Apple Inc. Structured dictation using intelligent automated assistants
US9886953B2 (en) 2015-03-08 2018-02-06 Apple Inc. Virtual assistant activation
US10567477B2 (en) 2015-03-08 2020-02-18 Apple Inc. Virtual assistant continuity
US9721566B2 (en) * 2015-03-08 2017-08-01 Apple Inc. Competing devices responding to voice triggers
EP3067884B1 (en) * 2015-03-13 2019-05-08 Samsung Electronics Co., Ltd. Speech recognition system and speech recognition method thereof
CA2982196C (en) 2015-04-10 2022-07-19 Huawei Technologies Co., Ltd. Speech recognition method, speech wakeup apparatus, speech recognition apparatus, and terminal
US9799349B2 (en) * 2015-04-24 2017-10-24 Cirrus Logic, Inc. Analog-to-digital converter (ADC) dynamic range enhancement for voice-activated systems
WO2016175354A1 (ko) * 2015-04-29 2016-11-03 주식회사 아카인텔리전스 인공지능 대화 장치 및 방법
CN104820556A (zh) * 2015-05-06 2015-08-05 广州视源电子科技股份有限公司 唤醒语音助手的方法及装置
US10009286B2 (en) 2015-05-08 2018-06-26 Ooma, Inc. Communications hub
US10771396B2 (en) 2015-05-08 2020-09-08 Ooma, Inc. Communications network failure detection and remediation
US9521069B2 (en) 2015-05-08 2016-12-13 Ooma, Inc. Managing alternative networks for high quality of service communications
US11171875B2 (en) 2015-05-08 2021-11-09 Ooma, Inc. Systems and methods of communications network failure detection and remediation utilizing link probes
US10911368B2 (en) 2015-05-08 2021-02-02 Ooma, Inc. Gateway address spoofing for alternate network utilization
US10460227B2 (en) 2015-05-15 2019-10-29 Apple Inc. Virtual assistant in a communication session
US10446142B2 (en) 2015-05-20 2019-10-15 Microsoft Technology Licensing, Llc Crafting feedback dialogue with a digital assistant
US10200824B2 (en) 2015-05-27 2019-02-05 Apple Inc. Systems and methods for proactively identifying and surfacing relevant content on a touch-sensitive device
US10083688B2 (en) 2015-05-27 2018-09-25 Apple Inc. Device voice control for selecting a displayed affordance
US10504509B2 (en) 2015-05-27 2019-12-10 Google Llc Providing suggested voice-based action queries
US10091140B2 (en) 2015-05-31 2018-10-02 Microsoft Technology Licensing, Llc Context-sensitive generation of conversational responses
US9578173B2 (en) 2015-06-05 2017-02-21 Apple Inc. Virtual assistant aided communication with 3rd party service in a communication session
US11025565B2 (en) 2015-06-07 2021-06-01 Apple Inc. Personalized prediction of responses for instant messaging
KR102296174B1 (ko) * 2015-06-26 2021-08-31 삼성전자주식회사 전자 장치 및 그의 오디오 변환 방법
WO2016208789A1 (ko) * 2015-06-26 2016-12-29 삼성전자 주식회사 소리를 판별하는 방법 및 이를 위한 장치
US9646628B1 (en) 2015-06-26 2017-05-09 Amazon Technologies, Inc. Noise cancellation for open microphone mode
US20160378747A1 (en) 2015-06-29 2016-12-29 Apple Inc. Virtual assistant for media playback
CN105070288B (zh) 2015-07-02 2018-08-07 百度在线网络技术(北京)有限公司 车载语音指令识别方法和装置
US10438593B2 (en) 2015-07-22 2019-10-08 Google Llc Individualized hotword detection models
US10068027B2 (en) 2015-07-22 2018-09-04 Google Llc Systems and methods for selecting content based on linked devices
US10671428B2 (en) * 2015-09-08 2020-06-02 Apple Inc. Distributed personal assistant
US10740384B2 (en) 2015-09-08 2020-08-11 Apple Inc. Intelligent automated assistant for media search and playback
US10747498B2 (en) 2015-09-08 2020-08-18 Apple Inc. Zero latency digital assistant
US10331312B2 (en) 2015-09-08 2019-06-25 Apple Inc. Intelligent automated assistant in a media environment
CN105094020B (zh) * 2015-09-10 2018-04-06 北京进化者机器人科技有限公司 一种机器人运行状态切换方法和系统
KR102446392B1 (ko) * 2015-09-23 2022-09-23 삼성전자주식회사 음성 인식이 가능한 전자 장치 및 방법
US11010550B2 (en) 2015-09-29 2021-05-18 Apple Inc. Unified language modeling framework for word prediction, auto-completion and auto-correction
WO2017058929A1 (en) * 2015-09-29 2017-04-06 Realtime Adventure Data, Inc. Sensor system for measuring a snowpack profile
US10366158B2 (en) 2015-09-29 2019-07-30 Apple Inc. Efficient word encoding for recurrent neural network language models
US11587559B2 (en) 2015-09-30 2023-02-21 Apple Inc. Intelligent device identification
US20170092278A1 (en) * 2015-09-30 2017-03-30 Apple Inc. Speaker recognition
US20170091612A1 (en) * 2015-09-30 2017-03-30 Apple Inc. Proactive assistant with memory assistance
CN107710148B (zh) * 2015-09-30 2020-02-14 华为技术有限公司 一种语音控制的处理方法和装置
US9691413B2 (en) 2015-10-06 2017-06-27 Microsoft Technology Licensing, Llc Identifying sound from a source of interest based on multiple audio feeds
US10116796B2 (en) 2015-10-09 2018-10-30 Ooma, Inc. Real-time communications-based internet advertising
CN105185378A (zh) * 2015-10-20 2015-12-23 珠海格力电器股份有限公司 声控方法、声控系统及能够进行声控的空调
CN106653010B (zh) 2015-11-03 2020-07-24 络达科技股份有限公司 电子装置及其透过语音辨识唤醒的方法
US10691473B2 (en) 2015-11-06 2020-06-23 Apple Inc. Intelligent automated assistant in a messaging environment
CN105426357A (zh) * 2015-11-06 2016-03-23 武汉卡比特信息有限公司 语音快速选择方法
US10956666B2 (en) 2015-11-09 2021-03-23 Apple Inc. Unconventional virtual assistant interactions
KR102453603B1 (ko) * 2015-11-10 2022-10-12 삼성전자주식회사 전자 장치 및 그 제어 방법
US10049668B2 (en) 2015-12-02 2018-08-14 Apple Inc. Applying neural network language models to weighted finite state transducers for automatic speech recognition
US10223066B2 (en) 2015-12-23 2019-03-05 Apple Inc. Proactive assistance based on dialog communication between devices
WO2017121049A1 (en) 2016-01-15 2017-07-20 Findpiano Information Technology (Shanghai) Co., Ltd. Piano system and operating method thereof
US10354653B1 (en) 2016-01-19 2019-07-16 United Services Automobile Association (Usaa) Cooperative delegation for digital assistants
US10388280B2 (en) * 2016-01-27 2019-08-20 Motorola Mobility Llc Method and apparatus for managing multiple voice operation trigger phrases
KR102642666B1 (ko) * 2016-02-05 2024-03-05 삼성전자주식회사 음성인식 장치 및 방법, 음성인식시스템
US10095470B2 (en) 2016-02-22 2018-10-09 Sonos, Inc. Audio response playback
US9965247B2 (en) 2016-02-22 2018-05-08 Sonos, Inc. Voice controlled media playback system based on user profile
US10264030B2 (en) 2016-02-22 2019-04-16 Sonos, Inc. Networked microphone device control
US9947316B2 (en) 2016-02-22 2018-04-17 Sonos, Inc. Voice control of a media playback system
US10509626B2 (en) 2016-02-22 2019-12-17 Sonos, Inc Handling of loss of pairing between networked devices
US9820039B2 (en) 2016-02-22 2017-11-14 Sonos, Inc. Default playback devices
US10446143B2 (en) 2016-03-14 2019-10-15 Apple Inc. Identification of voice inputs providing credentials
US10282165B2 (en) 2016-04-06 2019-05-07 International Business Machines Corporation Selective displaying of push notifications
EP3434024B1 (en) 2016-04-21 2023-08-02 Hewlett-Packard Development Company, L.P. Electronic device microphone listening modes
CN107305774B (zh) * 2016-04-22 2020-11-03 腾讯科技(深圳)有限公司 语音检测方法和装置
US10854199B2 (en) 2016-04-22 2020-12-01 Hewlett-Packard Development Company, L.P. Communications with trigger phrases
US10880833B2 (en) * 2016-04-25 2020-12-29 Sensory, Incorporated Smart listening modes supporting quasi always-on listening
DE102016115243A1 (de) * 2016-04-28 2017-11-02 Masoud Amri Programmieren in natürlicher Sprache
US9912846B2 (en) * 2016-05-11 2018-03-06 Microsoft Technology Licensing, Llc Obtaining calibration data of a camera
DK179186B1 (en) 2016-05-19 2018-01-15 Apple Inc REMOTE AUTHORIZATION TO CONTINUE WITH AN ACTION
US9934775B2 (en) 2016-05-26 2018-04-03 Apple Inc. Unit-selection text-to-speech synthesis based on predicted concatenation parameters
US10038644B2 (en) 2016-05-27 2018-07-31 Bank Of America Corporation Communication system for resource usage monitoring
US10154101B2 (en) 2016-05-27 2018-12-11 Bank Of America Corporation System for resource usage monitoring
US10104199B2 (en) 2016-05-27 2018-10-16 Bank Of America Corporation Three-way communication link for information retrieval and notification
US9972304B2 (en) 2016-06-03 2018-05-15 Apple Inc. Privacy preserving distributed evaluation framework for embedded personalized systems
US10587978B2 (en) 2016-06-03 2020-03-10 Nureva, Inc. Method, apparatus and computer-readable media for virtual positioning of a remote participant in a sound space
US11227589B2 (en) 2016-06-06 2022-01-18 Apple Inc. Intelligent list reading
US10394358B2 (en) 2016-06-06 2019-08-27 Nureva, Inc. Method, apparatus and computer-readable media for touch and speech interface
US10249300B2 (en) 2016-06-06 2019-04-02 Apple Inc. Intelligent list reading
EP3465414B1 (en) 2016-06-06 2023-08-16 Nureva Inc. Method, apparatus and computer-readable media for touch and speech interface with audio location
US10049663B2 (en) 2016-06-08 2018-08-14 Apple, Inc. Intelligent automated assistant for media exploration
US9978390B2 (en) 2016-06-09 2018-05-22 Sonos, Inc. Dynamic player selection for audio signal processing
DK179309B1 (en) 2016-06-09 2018-04-23 Apple Inc Intelligent automated assistant in a home environment
US10509862B2 (en) 2016-06-10 2019-12-17 Apple Inc. Dynamic phrase expansion of language input
US10067938B2 (en) 2016-06-10 2018-09-04 Apple Inc. Multilingual word prediction
US10586535B2 (en) 2016-06-10 2020-03-10 Apple Inc. Intelligent digital assistant in a multi-tasking environment
US10490187B2 (en) 2016-06-10 2019-11-26 Apple Inc. Digital assistant providing automated status report
US10192552B2 (en) 2016-06-10 2019-01-29 Apple Inc. Digital assistant providing whispered speech
DK179415B1 (en) 2016-06-11 2018-06-14 Apple Inc Intelligent device arbitration and control
AU2017100586B4 (en) * 2016-06-11 2018-03-01 Apple Inc. Application integration with a digital assistant
DK179049B1 (en) 2016-06-11 2017-09-18 Apple Inc Data driven natural language event detection and classification
DK179343B1 (en) 2016-06-11 2018-05-14 Apple Inc Intelligent task discovery
DK201670540A1 (en) 2016-06-11 2018-01-08 Apple Inc Application integration with a digital assistant
TWI584270B (zh) * 2016-06-15 2017-05-21 瑞昱半導體股份有限公司 語音控制系統及其方法
US10474946B2 (en) 2016-06-24 2019-11-12 Microsoft Technology Licensing, Llc Situation aware personal assistant
US10628172B2 (en) * 2016-06-27 2020-04-21 Qualcomm Incorporated Systems and methods for using distributed universal serial bus (USB) host drivers
US10678494B2 (en) 2016-06-27 2020-06-09 Qualcomm Incorporated Controlling data streams in universal serial bus (USB) systems
US11232136B2 (en) 2016-06-27 2022-01-25 Google Llc Contextual voice search suggestions
WO2018009397A1 (en) * 2016-07-06 2018-01-11 Pcms Holdings, Inc. System and method for customizing smart home speech interfaces using personalized speech profiles
US10134399B2 (en) 2016-07-15 2018-11-20 Sonos, Inc. Contextualization of voice inputs
US10152969B2 (en) 2016-07-15 2018-12-11 Sonos, Inc. Voice detection by multiple devices
US10621992B2 (en) * 2016-07-22 2020-04-14 Lenovo (Singapore) Pte. Ltd. Activating voice assistant based on at least one of user proximity and context
US10451430B2 (en) 2016-07-26 2019-10-22 International Business Machines Corporation Navigation alerting using conversation analysis
WO2018022085A1 (en) * 2016-07-29 2018-02-01 Hewlett-Packard Development Company, L.P. Identification of preferred communication devices
US10115400B2 (en) 2016-08-05 2018-10-30 Sonos, Inc. Multiple voice services
US11086593B2 (en) * 2016-08-26 2021-08-10 Bragi GmbH Voice assistant for wireless earpieces
US20180067717A1 (en) * 2016-09-02 2018-03-08 Allomind, Inc. Voice-driven interface to control multi-layered content in a head mounted display
US10474753B2 (en) 2016-09-07 2019-11-12 Apple Inc. Language identification using recurrent neural networks
US10043516B2 (en) 2016-09-23 2018-08-07 Apple Inc. Intelligent automated assistant
DK179978B1 (en) 2016-09-23 2019-11-27 Apple Inc. IMAGE DATA FOR ENHANCED USER INTERACTIONS
US9942678B1 (en) 2016-09-27 2018-04-10 Sonos, Inc. Audio playback settings for voice interaction
US11367436B2 (en) 2016-09-27 2022-06-21 Hewlett-Packard Development Company, L.P. Communication apparatuses
US9743204B1 (en) 2016-09-30 2017-08-22 Sonos, Inc. Multi-orientation playback device microphones
KR102564349B1 (ko) 2016-09-30 2023-08-04 엘지디스플레이 주식회사 유기 발광 표시 장치
US10304463B2 (en) * 2016-10-03 2019-05-28 Google Llc Multi-user personalization at a voice interface device
US10552742B2 (en) 2016-10-14 2020-02-04 Google Llc Proactive virtual assistant
US10181323B2 (en) 2016-10-19 2019-01-15 Sonos, Inc. Arbitration-based voice recognition
US20180122372A1 (en) * 2016-10-31 2018-05-03 Soundhound, Inc. Distinguishable open sounds
GB2555661A (en) * 2016-11-07 2018-05-09 Cirrus Logic Int Semiconductor Ltd Methods and apparatus for biometric authentication in an electronic device
JP6616048B1 (ja) 2016-11-07 2019-12-04 グーグル エルエルシー 記録されたメディアホットワードトリガ抑制
US20180131692A1 (en) * 2016-11-09 2018-05-10 Idefend Ltd. System and a method for applying dynamically configurable means of user authentication
US10482885B1 (en) * 2016-11-15 2019-11-19 Amazon Technologies, Inc. Speaker based anaphora resolution
KR102591413B1 (ko) * 2016-11-16 2023-10-19 엘지전자 주식회사 이동단말기 및 그 제어방법
US10528605B2 (en) * 2016-11-18 2020-01-07 DefinedCrowd Corporation Crowdsourced training of textual natural language understanding systems
US10268447B1 (en) 2016-12-02 2019-04-23 Amazon Technologies, Inc. Curating audio and IR commands through machine learning
US10469787B1 (en) 2016-12-02 2019-11-05 Amazon Technologies, Inc. Learning multi-device controller with personalized voice control
US10375340B1 (en) * 2016-12-02 2019-08-06 Amazon Technologies, Inc. Personalizing the learning home multi-device controller
US11281993B2 (en) 2016-12-05 2022-03-22 Apple Inc. Model and ensemble compression for metric learning
US10079015B1 (en) * 2016-12-06 2018-09-18 Amazon Technologies, Inc. Multi-layer keyword detection
US10403279B2 (en) * 2016-12-21 2019-09-03 Avnera Corporation Low-power, always-listening, voice command detection and capture
US10593346B2 (en) 2016-12-22 2020-03-17 Apple Inc. Rank-reduced token representation for automatic speech recognition
KR102643501B1 (ko) * 2016-12-26 2024-03-06 현대자동차주식회사 대화 처리 장치, 이를 포함하는 차량 및 대화 처리 방법
US10924376B2 (en) * 2016-12-30 2021-02-16 Google Llc Selective sensor polling
US10437928B2 (en) 2016-12-30 2019-10-08 Google Llc Device identifier dependent operation processing of packet based data communication
US10593329B2 (en) 2016-12-30 2020-03-17 Google Llc Multimodal transmission of packetized data
US10957326B2 (en) 2016-12-30 2021-03-23 Google Llc Device identifier dependent operation processing of packet based data communication
US10347247B2 (en) 2016-12-30 2019-07-09 Google Llc Modulation of packetized audio signals
US11295738B2 (en) 2016-12-30 2022-04-05 Google, Llc Modulation of packetized audio signals
US10708313B2 (en) 2016-12-30 2020-07-07 Google Llc Multimodal transmission of packetized data
US11204787B2 (en) 2017-01-09 2021-12-21 Apple Inc. Application integration with a digital assistant
US11164570B2 (en) 2017-01-17 2021-11-02 Ford Global Technologies, Llc Voice assistant tracking and activation
CN108319599B (zh) * 2017-01-17 2021-02-26 华为技术有限公司 一种人机对话的方法和装置
KR20180085931A (ko) * 2017-01-20 2018-07-30 삼성전자주식회사 음성 입력 처리 방법 및 이를 지원하는 전자 장치
US10614804B2 (en) 2017-01-24 2020-04-07 Honeywell International Inc. Voice control of integrated room automation system
JP2018124805A (ja) * 2017-02-01 2018-08-09 トヨタ自動車株式会社 車載情報端末及び情報検索プログラム
CN108447472B (zh) * 2017-02-16 2022-04-05 腾讯科技(深圳)有限公司 语音唤醒方法及装置
US10909980B2 (en) * 2017-02-27 2021-02-02 SKAEL, Inc. Machine-learning digital assistants
US10706843B1 (en) * 2017-03-09 2020-07-07 Amazon Technologies, Inc. Contact resolution for communications systems
US10810912B2 (en) 2017-03-15 2020-10-20 Aether Inc. Face recognition triggered digital assistant and LED light ring for a smart mirror
WO2018173295A1 (ja) * 2017-03-24 2018-09-27 ヤマハ株式会社 ユーザインタフェース装置及び方法、並びに音操作システム
CN106992012A (zh) * 2017-03-24 2017-07-28 联想(北京)有限公司 语音处理方法及电子设备
US11183181B2 (en) 2017-03-27 2021-11-23 Sonos, Inc. Systems and methods of multiple voice services
JP6642808B2 (ja) * 2017-03-29 2020-02-12 京セラドキュメントソリューションズ株式会社 音声入力システム、音声入力装置および音声入力プログラム
US10121494B1 (en) * 2017-03-30 2018-11-06 Amazon Technologies, Inc. User presence detection
CN107122179A (zh) 2017-03-31 2017-09-01 阿里巴巴集团控股有限公司 语音的功能控制方法和装置
US11250844B2 (en) * 2017-04-12 2022-02-15 Soundhound, Inc. Managing agent engagement in a man-machine dialog
KR20180118471A (ko) * 2017-04-21 2018-10-31 엘지전자 주식회사 음성 인식 장치
US20180322869A1 (en) * 2017-05-04 2018-11-08 Unlimiter Mfa Co., Ltd. Voice transmission device and method for executing voice assistant program thereof
DK201770383A1 (en) 2017-05-09 2018-12-14 Apple Inc. USER INTERFACE FOR CORRECTING RECOGNITION ERRORS
US10417266B2 (en) 2017-05-09 2019-09-17 Apple Inc. Context-aware ranking of intelligent response suggestions
US10311870B2 (en) 2017-05-10 2019-06-04 Ecobee Inc. Computerized device with voice command input capability
US10395654B2 (en) 2017-05-11 2019-08-27 Apple Inc. Text normalization based on a data-driven learning network
US10726832B2 (en) 2017-05-11 2020-07-28 Apple Inc. Maintaining privacy of personal information
DK201770439A1 (en) 2017-05-11 2018-12-13 Apple Inc. Offline personal assistant
DK180048B1 (en) 2017-05-11 2020-02-04 Apple Inc. MAINTAINING THE DATA PROTECTION OF PERSONAL INFORMATION
CN108874460B (zh) * 2017-05-11 2022-12-02 达发科技股份有限公司 语音传输装置及其执行语音助理程序的方法
US10170112B2 (en) * 2017-05-11 2019-01-01 Google Llc Detecting and suppressing voice queries
DK179745B1 (en) 2017-05-12 2019-05-01 Apple Inc. SYNCHRONIZATION AND TASK DELEGATION OF A DIGITAL ASSISTANT
DK179496B1 (en) 2017-05-12 2019-01-15 Apple Inc. USER-SPECIFIC Acoustic Models
US10380852B2 (en) * 2017-05-12 2019-08-13 Google Llc Systems, methods, and devices for activity monitoring via a home assistant
DK201770428A1 (en) 2017-05-12 2019-02-18 Apple Inc. LOW-LATENCY INTELLIGENT AUTOMATED ASSISTANT
US11301477B2 (en) 2017-05-12 2022-04-12 Apple Inc. Feedback analysis of a digital assistant
DK201770431A1 (en) 2017-05-15 2018-12-20 Apple Inc. Optimizing dialogue policy decisions for digital assistants using implicit feedback
DK201770432A1 (en) 2017-05-15 2018-12-21 Apple Inc. Hierarchical belief states for digital assistants
DK201770411A1 (en) 2017-05-15 2018-12-20 Apple Inc. MULTI-MODAL INTERFACES
US10403278B2 (en) 2017-05-16 2019-09-03 Apple Inc. Methods and systems for phonetic matching in digital assistant services
US10303715B2 (en) 2017-05-16 2019-05-28 Apple Inc. Intelligent automated assistant for media exploration
US20180336892A1 (en) 2017-05-16 2018-11-22 Apple Inc. Detecting a trigger of a digital assistant
US10311144B2 (en) 2017-05-16 2019-06-04 Apple Inc. Emoji word sense disambiguation
DK179560B1 (en) 2017-05-16 2019-02-18 Apple Inc. FAR-FIELD EXTENSION FOR DIGITAL ASSISTANT SERVICES
US20180366108A1 (en) * 2017-05-18 2018-12-20 Aiqudo, Inc. Crowdsourced training for commands matching
US11056105B2 (en) 2017-05-18 2021-07-06 Aiqudo, Inc Talk back from actions in applications
US11043206B2 (en) 2017-05-18 2021-06-22 Aiqudo, Inc. Systems and methods for crowdsourced actions and commands
US11520610B2 (en) 2017-05-18 2022-12-06 Peloton Interactive Inc. Crowdsourced on-boarding of digital assistant operations
US11340925B2 (en) 2017-05-18 2022-05-24 Peloton Interactive Inc. Action recipes for a crowdsourced digital assistant system
CN111539216A (zh) * 2017-05-19 2020-08-14 北京蓦然认知科技有限公司 一种用于自然语言内容标题消歧的方法、设备和系统
US10664533B2 (en) 2017-05-24 2020-05-26 Lenovo (Singapore) Pte. Ltd. Systems and methods to determine response cue for digital assistant based on context
US10531196B2 (en) 2017-06-02 2020-01-07 Apple Inc. Spatially ducking audio produced through a beamforming loudspeaker array
US10657328B2 (en) 2017-06-02 2020-05-19 Apple Inc. Multi-task recurrent neural network architecture for efficient morphology handling in neural language modeling
US10614122B2 (en) 2017-06-09 2020-04-07 Google Llc Balance modifications of audio-based computer program output using a placeholder field based on content
US10600409B2 (en) 2017-06-09 2020-03-24 Google Llc Balance modifications of audio-based computer program output including a chatbot selected based on semantic processing of audio
US10652170B2 (en) 2017-06-09 2020-05-12 Google Llc Modification of audio-based computer program output
US10657173B2 (en) 2017-06-09 2020-05-19 Google Llc Validate modification of audio-based computer program output
US10984329B2 (en) 2017-06-14 2021-04-20 Ademco Inc. Voice activated virtual assistant with a fused response
US10528228B2 (en) 2017-06-21 2020-01-07 Microsoft Technology Licensing, Llc Interaction with notifications across devices with a digital assistant
US9900556B1 (en) * 2017-06-28 2018-02-20 The Travelers Indemnity Company Systems and methods for virtual co-location
US11189273B2 (en) * 2017-06-29 2021-11-30 Amazon Technologies, Inc. Hands free always on near field wakeword solution
US20240036721A1 (en) * 2017-07-01 2024-02-01 Oliver H. Melgrove Portable device with adjustable stopwatch feature
US10599377B2 (en) 2017-07-11 2020-03-24 Roku, Inc. Controlling visual indicators in an audio responsive electronic device, and capturing and providing audio using an API, by native and non-native computing devices and services
CN107340991B (zh) * 2017-07-18 2020-08-25 百度在线网络技术(北京)有限公司 语音角色的切换方法、装置、设备以及存储介质
US10311872B2 (en) 2017-07-25 2019-06-04 Google Llc Utterance classifier
US10475449B2 (en) 2017-08-07 2019-11-12 Sonos, Inc. Wake-word detection suppression
US10204624B1 (en) * 2017-08-14 2019-02-12 Lenovo (Singapore) Pte. Ltd. False positive wake word
US10455322B2 (en) 2017-08-18 2019-10-22 Roku, Inc. Remote control with presence sensor
KR102098633B1 (ko) * 2017-08-22 2020-04-08 네이버 주식회사 인공지능 기기에서의 연속 대화 기능
US11062710B2 (en) 2017-08-28 2021-07-13 Roku, Inc. Local and cloud speech recognition
US11062702B2 (en) 2017-08-28 2021-07-13 Roku, Inc. Media system with multiple digital assistants
US10777197B2 (en) 2017-08-28 2020-09-15 Roku, Inc. Audio responsive device with play/stop and tell me something buttons
US10515625B1 (en) * 2017-08-31 2019-12-24 Amazon Technologies, Inc. Multi-modal natural language processing
US10048930B1 (en) 2017-09-08 2018-08-14 Sonos, Inc. Dynamic computation of system response volume
KR102185854B1 (ko) 2017-09-09 2020-12-02 애플 인크. 생체측정 인증의 구현
EP4156129A1 (en) 2017-09-09 2023-03-29 Apple Inc. Implementation of biometric enrollment
US10445429B2 (en) 2017-09-21 2019-10-15 Apple Inc. Natural language understanding using vocabularies with compressed serialized tries
US10545025B2 (en) 2017-09-22 2020-01-28 Telenav, Inc. Navigation system with a system initiated inquiry and method of operation thereof
US10672379B1 (en) * 2017-09-25 2020-06-02 Amazon Technologies, Inc. Systems and methods for selecting a recipient device for communications
US10748538B2 (en) 2017-09-26 2020-08-18 Google Llc Dynamic sequence-based adjustment of prompt generation
US10446165B2 (en) 2017-09-27 2019-10-15 Sonos, Inc. Robust short-time fourier transform acoustic echo cancellation during audio playback
US10051366B1 (en) 2017-09-28 2018-08-14 Sonos, Inc. Three-dimensional beam forming with a microphone array
US10621981B2 (en) 2017-09-28 2020-04-14 Sonos, Inc. Tone interference cancellation
US10482868B2 (en) 2017-09-28 2019-11-19 Sonos, Inc. Multi-channel acoustic echo cancellation
US10674303B2 (en) 2017-09-29 2020-06-02 Apple Inc. System and method for maintaining accuracy of voice recognition
US10755051B2 (en) 2017-09-29 2020-08-25 Apple Inc. Rule-based natural language processing
US10466962B2 (en) 2017-09-29 2019-11-05 Sonos, Inc. Media playback system with voice assistance
KR102419597B1 (ko) * 2017-09-29 2022-07-11 삼성전자주식회사 입력 디바이스와 전자 장치, 이를 포함하는 시스템 및 그 제어 방법
KR102142642B1 (ko) * 2017-10-03 2020-08-10 구글 엘엘씨 차량 환경에서의 다중 인자 인증 및 액세스 제어
KR102421255B1 (ko) * 2017-10-17 2022-07-18 삼성전자주식회사 음성 신호를 제어하기 위한 전자 장치 및 방법
JP2019086903A (ja) 2017-11-02 2019-06-06 東芝映像ソリューション株式会社 音声対話端末、および音声対話端末制御方法
CN109767774A (zh) 2017-11-08 2019-05-17 阿里巴巴集团控股有限公司 一种交互方法和设备
KR20190052394A (ko) * 2017-11-08 2019-05-16 삼성전자주식회사 복수의 마이크를 이용하여 기능을 실행하기 위한 방법 및 그 전자 장치
CN107945806B (zh) * 2017-11-10 2022-03-08 北京小米移动软件有限公司 基于声音特征的用户识别方法及装置
US11100913B2 (en) 2017-11-14 2021-08-24 Thomas STACHURA Information security/privacy via a decoupled security cap to an always listening assistant device
US10867623B2 (en) 2017-11-14 2020-12-15 Thomas STACHURA Secure and private processing of gestures via video input
US10872607B2 (en) 2017-11-14 2020-12-22 Thomas STACHURA Information choice and security via a decoupled router with an always listening assistant device
US10999733B2 (en) 2017-11-14 2021-05-04 Thomas STACHURA Information security/privacy via a decoupled security accessory to an always listening device
US10867054B2 (en) 2017-11-14 2020-12-15 Thomas STACHURA Information security/privacy via a decoupled security accessory to an always listening assistant device
CN107895573B (zh) * 2017-11-15 2021-08-24 百度在线网络技术(北京)有限公司 用于识别信息的方法及装置
JP7243625B2 (ja) * 2017-11-15 2023-03-22 ソニーグループ株式会社 情報処理装置、及び情報処理方法
US10636424B2 (en) 2017-11-30 2020-04-28 Apple Inc. Multi-turn canned dialog
AU2017442245B2 (en) * 2017-12-08 2020-03-26 Google Llc System for securing a personal digital assistant with stacked data structures
US10971173B2 (en) 2017-12-08 2021-04-06 Google Llc Signal processing coordination among digital voice assistant computing devices
EP3519910B1 (en) 2017-12-08 2024-02-14 Google LLC Content source allocation between computing devices
US10665236B2 (en) 2017-12-08 2020-05-26 Google Llc Digital assistant processing of stacked data structures
WO2019112625A1 (en) 2017-12-08 2019-06-13 Google Llc Signal processing coordination among digital voice assistant computing devices
US11438346B2 (en) 2017-12-08 2022-09-06 Google Llc Restrict transmission of manipulated content in a networked environment
US10558426B2 (en) 2017-12-08 2020-02-11 Google Llc Graphical user interface rendering management by voice-driven computing infrastructure
CN110168636B (zh) 2017-12-08 2023-08-01 谷歌有限责任公司 对重复的分组化数据传输的检测
CN110149810B (zh) 2017-12-08 2021-02-26 谷歌有限责任公司 限制在网络环境中操纵内容的传输系统和方法及数字助理装置
US10880650B2 (en) 2017-12-10 2020-12-29 Sonos, Inc. Network microphone devices with automatic do not disturb actuation capabilities
US10818290B2 (en) 2017-12-11 2020-10-27 Sonos, Inc. Home graph
US10733991B2 (en) * 2017-12-21 2020-08-04 Deere & Company Construction machine mode switching with voice services
US10621982B2 (en) * 2017-12-21 2020-04-14 Deere & Company Construction machines with voice services
US20190196779A1 (en) * 2017-12-21 2019-06-27 Harman International Industries, Incorporated Intelligent personal assistant interface system
CN107919124B (zh) * 2017-12-22 2021-07-13 北京小米移动软件有限公司 设备唤醒方法及装置
US10601599B2 (en) * 2017-12-29 2020-03-24 Synaptics Incorporated Voice command processing in low power devices
EP3776169A4 (en) * 2017-12-29 2022-01-26 Polk Audio, LLC VOICE CONTROLLED SPEAKER SYSTEM WITH DEDICATED DSP SETTINGS FOR VOICE ASSISTANT AND MODE SWITCHING METHOD
US10733982B2 (en) 2018-01-08 2020-08-04 Apple Inc. Multi-directional dialog
KR20190084789A (ko) 2018-01-09 2019-07-17 엘지전자 주식회사 전자 장치 및 그 제어 방법
KR102530391B1 (ko) * 2018-01-25 2023-05-09 삼성전자주식회사 외부 인터럽트를 지원하는 저전력 보이스 트리거 시스템을 포함하는 애플리케이션 프로세서, 이를 포함하는 전자 장치 및 그 동작 방법
KR102459920B1 (ko) 2018-01-25 2022-10-27 삼성전자주식회사 저전력 에코 제거를 지원하는 애플리케이션 프로세서, 이를 포함하는 전자 장치 및 그 동작 방법
KR102629385B1 (ko) * 2018-01-25 2024-01-25 삼성전자주식회사 바지-인 관련 직접 경로를 지원하는 저전력 보이스 트리거 시스템을 포함하는 애플리케이션 프로세서, 이를 포함하는 전자 장치 및 그 동작 방법
KR102629424B1 (ko) 2018-01-25 2024-01-25 삼성전자주식회사 보안 기능을 지원하는 저전력 보이스 트리거 시스템을 포함하는 애플리케이션 프로세서, 이를 포함하는 전자 장치 및 그 동작 방법
KR102585784B1 (ko) * 2018-01-25 2023-10-06 삼성전자주식회사 오디오 재생시 인터럽트를 지원하는 애플리케이션 프로세서, 이를 포함하는 전자 장치 및 그 동작 방법
US10768954B2 (en) 2018-01-30 2020-09-08 Aiqudo, Inc. Personalized digital assistant device and related methods
US10733375B2 (en) 2018-01-31 2020-08-04 Apple Inc. Knowledge-based framework for improving natural language understanding
US10762113B2 (en) * 2018-01-31 2020-09-01 Cisco Technology, Inc. Conversational knowledge graph powered virtual assistant for application performance management
WO2019152722A1 (en) 2018-01-31 2019-08-08 Sonos, Inc. Device designation of playback and network microphone device arrangements
US10681970B2 (en) * 2018-02-02 2020-06-16 Ervin McManus Translucent reconfigurable bag
US10834365B2 (en) 2018-02-08 2020-11-10 Nortek Security & Control Llc Audio-visual monitoring using a virtual assistant
US10714084B2 (en) * 2018-02-09 2020-07-14 Accenture Global Solutions Limited Artificial intelligence based service implementation
US11145298B2 (en) 2018-02-13 2021-10-12 Roku, Inc. Trigger word detection with multiple digital assistants
US11295139B2 (en) 2018-02-19 2022-04-05 Intellivision Technologies Corp. Human presence detection in edge devices
US11615623B2 (en) 2018-02-19 2023-03-28 Nortek Security & Control Llc Object detection in edge devices for barrier operation and parcel delivery
US10978050B2 (en) 2018-02-20 2021-04-13 Intellivision Technologies Corp. Audio type detection
US10789959B2 (en) * 2018-03-02 2020-09-29 Apple Inc. Training speaker recognition models for digital assistants
US10896213B2 (en) 2018-03-07 2021-01-19 Google Llc Interface for a distributed network system
CA3093066A1 (en) 2018-03-08 2019-09-12 Frontive, Inc. Methods and systems for speech signal processing
WO2019171732A1 (ja) * 2018-03-08 2019-09-12 ソニー株式会社 情報処理装置、情報処理方法、プログラム及び情報処理システム
US10978061B2 (en) * 2018-03-09 2021-04-13 International Business Machines Corporation Voice command processing without a wake word
US10592604B2 (en) 2018-03-12 2020-03-17 Apple Inc. Inverse text normalization for automatic speech recognition
US10332543B1 (en) * 2018-03-12 2019-06-25 Cypress Semiconductor Corporation Systems and methods for capturing noise for pattern recognition processing
KR102508863B1 (ko) * 2018-03-19 2023-03-10 삼성전자 주식회사 전자 장치 및 상기 전자 장치로부터 수신된 데이터를 처리하는 서버
KR102635811B1 (ko) * 2018-03-19 2024-02-13 삼성전자 주식회사 사운드 데이터를 처리하는 시스템 및 시스템의 제어 방법
US11392688B2 (en) 2018-03-21 2022-07-19 Google Llc Data transfer in secure processing environments
US11568863B1 (en) * 2018-03-23 2023-01-31 Amazon Technologies, Inc. Skill shortlister for natural language processing
US11461779B1 (en) * 2018-03-23 2022-10-04 Amazon Technologies, Inc. Multi-speechlet response
US10929601B1 (en) * 2018-03-23 2021-02-23 Amazon Technologies, Inc. Question answering for a multi-modal system
US10818288B2 (en) 2018-03-26 2020-10-27 Apple Inc. Natural assistant interaction
US10789940B2 (en) * 2018-03-27 2020-09-29 Lenovo (Singapore) Pte. Ltd. Dynamic wake word identification
US10909331B2 (en) 2018-03-30 2021-02-02 Apple Inc. Implicit identification of translation payload with neural machine translation
JP6660974B2 (ja) * 2018-03-30 2020-03-11 本田技研工業株式会社 情報提供装置、情報提供方法、およびプログラム
US10930278B2 (en) 2018-04-09 2021-02-23 Google Llc Trigger sound detection in ambient audio to provide related functionality on a user interface
US11010436B1 (en) 2018-04-20 2021-05-18 Facebook, Inc. Engaging users by personalized composing-content recommendation
US11715042B1 (en) 2018-04-20 2023-08-01 Meta Platforms Technologies, Llc Interpretability of deep reinforcement learning models in assistant systems
US11115410B1 (en) 2018-04-20 2021-09-07 Facebook, Inc. Secure authentication for assistant systems
US11886473B2 (en) 2018-04-20 2024-01-30 Meta Platforms, Inc. Intent identification for agent matching by assistant systems
US10978056B1 (en) 2018-04-20 2021-04-13 Facebook, Inc. Grammaticality classification for natural language generation in assistant systems
EP3564949A1 (en) 2018-04-23 2019-11-06 Spotify AB Activation trigger processing
US11113372B2 (en) 2018-04-25 2021-09-07 Google Llc Delayed two-factor authentication in a networked environment
US11288351B2 (en) 2018-04-25 2022-03-29 Google Llc Delayed two-factor authentication in a networked environment
US20190332848A1 (en) 2018-04-27 2019-10-31 Honeywell International Inc. Facial enrollment and recognition system
CN112639718B (zh) * 2018-05-04 2024-09-03 谷歌有限责任公司 自动化助手功能的免热词调配
KR102531654B1 (ko) 2018-05-04 2023-05-11 삼성전자주식회사 음성 입력 인증 디바이스 및 그 방법
US10733984B2 (en) 2018-05-07 2020-08-04 Google Llc Multi-modal interface in a voice-activated network
US11145294B2 (en) 2018-05-07 2021-10-12 Apple Inc. Intelligent automated assistant for delivering content from user experiences
US10928918B2 (en) 2018-05-07 2021-02-23 Apple Inc. Raise to speak
WO2019216996A1 (en) * 2018-05-07 2019-11-14 Apple Inc. Raise to speak
US11175880B2 (en) 2018-05-10 2021-11-16 Sonos, Inc. Systems and methods for voice-assisted media content selection
US10847178B2 (en) 2018-05-18 2020-11-24 Sonos, Inc. Linear filtering for noise-suppressed speech detection
US10984780B2 (en) 2018-05-21 2021-04-20 Apple Inc. Global semantic word embeddings using bi-directional recurrent neural networks
US10959029B2 (en) 2018-05-25 2021-03-23 Sonos, Inc. Determining and adapting to changes in microphone performance of playback devices
DK201870355A1 (en) 2018-06-01 2019-12-16 Apple Inc. VIRTUAL ASSISTANT OPERATION IN MULTI-DEVICE ENVIRONMENTS
DK180639B1 (en) 2018-06-01 2021-11-04 Apple Inc DISABILITY OF ATTENTION-ATTENTIVE VIRTUAL ASSISTANT
US10892996B2 (en) 2018-06-01 2021-01-12 Apple Inc. Variable latency device coordination
DK179822B1 (da) 2018-06-01 2019-07-12 Apple Inc. Voice interaction at a primary device to access call functionality of a companion device
US11609739B2 (en) 2018-06-01 2023-03-21 Apple Inc. Providing audio information with a digital assistant
US11386266B2 (en) 2018-06-01 2022-07-12 Apple Inc. Text correction
US11170085B2 (en) 2018-06-03 2021-11-09 Apple Inc. Implementation of biometric authentication
US10944859B2 (en) 2018-06-03 2021-03-09 Apple Inc. Accelerated task performance
US10963492B2 (en) 2018-06-14 2021-03-30 Google Llc Generation of domain-specific models in networked system
US10956462B1 (en) * 2018-06-21 2021-03-23 Amazon Technologies, Inc. System answering of user inputs
US20190390866A1 (en) 2018-06-22 2019-12-26 Honeywell International Inc. Building management system with natural language interface
JP6966979B2 (ja) * 2018-06-26 2021-11-17 株式会社日立製作所 対話システムの制御方法、対話システム及びプログラム
US10460749B1 (en) * 2018-06-28 2019-10-29 Nuvoton Technology Corporation Voice activity detection using vocal tract area information
US10681460B2 (en) 2018-06-28 2020-06-09 Sonos, Inc. Systems and methods for associating playback devices with voice assistant services
KR20200013152A (ko) * 2018-07-18 2020-02-06 삼성전자주식회사 이전에 대화를 수집한 결과를 기반으로 인공 지능 서비스를 제공하는 전자 장치 및 방법
KR102592769B1 (ko) 2018-07-20 2023-10-24 삼성전자주식회사 전자 장치 및 그의 동작 방법
US10659548B2 (en) * 2018-07-23 2020-05-19 NRS Systems Invocation devices in an organization information distribution system
CN108650595B (zh) * 2018-07-24 2020-07-17 Oppo(重庆)智能科技有限公司 堵孔处理方法、装置、电子设备及计算机可读存储介质
US11544591B2 (en) 2018-08-21 2023-01-03 Google Llc Framework for a computing system that alters user behavior
US10949616B1 (en) 2018-08-21 2021-03-16 Facebook, Inc. Automatically detecting and storing entity information for assistant systems
US10896295B1 (en) 2018-08-21 2021-01-19 Facebook, Inc. Providing additional information for identified named-entities for assistant systems
US11100918B2 (en) * 2018-08-27 2021-08-24 American Family Mutual Insurance Company, S.I. Event sensing system
JP7055721B2 (ja) * 2018-08-27 2022-04-18 京セラ株式会社 音声認識機能を有する電子機器、その電子機器の制御方法およびプログラム
US10461710B1 (en) 2018-08-28 2019-10-29 Sonos, Inc. Media playback system with maximum volume setting
US11076035B2 (en) 2018-08-28 2021-07-27 Sonos, Inc. Do not disturb feature for audio notifications
KR102628211B1 (ko) * 2018-08-29 2024-01-23 삼성전자주식회사 전자 장치 및 그 제어 방법
CN110875058A (zh) * 2018-08-31 2020-03-10 中国移动通信有限公司研究院 一种语音通信处理方法、终端设备及服务器
US20220036881A1 (en) * 2018-09-14 2022-02-03 Aondevices, Inc. System architecture and embedded circuit to locate a lost portable device using voice command
US10587430B1 (en) 2018-09-14 2020-03-10 Sonos, Inc. Networked devices, systems, and methods for associating playback devices based on sound codes
US10878811B2 (en) 2018-09-14 2020-12-29 Sonos, Inc. Networked devices, systems, and methods for intelligently deactivating wake-word engines
WO2020061047A1 (en) * 2018-09-17 2020-03-26 Vet24seven Inc. Livestock management system with audio support
US11024331B2 (en) 2018-09-21 2021-06-01 Sonos, Inc. Voice detection optimization using sound metadata
US10811015B2 (en) 2018-09-25 2020-10-20 Sonos, Inc. Voice detection optimization based on selected voice assistant service
US11010561B2 (en) 2018-09-27 2021-05-18 Apple Inc. Sentiment prediction from textual data
US11100349B2 (en) 2018-09-28 2021-08-24 Apple Inc. Audio assisted enrollment
US11170166B2 (en) 2018-09-28 2021-11-09 Apple Inc. Neural typographical error modeling via generative adversarial networks
US11100923B2 (en) 2018-09-28 2021-08-24 Sonos, Inc. Systems and methods for selective wake word detection using neural network models
US10860096B2 (en) * 2018-09-28 2020-12-08 Apple Inc. Device control using gaze information
US11462215B2 (en) 2018-09-28 2022-10-04 Apple Inc. Multi-modal inputs for voice commands
US10839159B2 (en) 2018-09-28 2020-11-17 Apple Inc. Named entity normalization in a spoken dialog system
US10692518B2 (en) 2018-09-29 2020-06-23 Sonos, Inc. Linear filtering for noise-suppressed speech detection via multiple network microphone devices
KR102606789B1 (ko) * 2018-10-01 2023-11-28 삼성전자주식회사 복수의 음성 인식 장치들을 제어하는 방법 및 그 방법을 지원하는 전자 장치
US11157169B2 (en) 2018-10-08 2021-10-26 Google Llc Operating modes that designate an interface modality for interacting with an automated assistant
EP3853712A1 (en) 2018-10-08 2021-07-28 Google LLC Operating modes that designate an interface modality for interacting with an automated assistant
US10831442B2 (en) * 2018-10-19 2020-11-10 International Business Machines Corporation Digital assistant user interface amalgamation
US11074912B2 (en) * 2018-10-23 2021-07-27 Polycom, Inc. Identifying a valid wake input
US11899519B2 (en) 2018-10-23 2024-02-13 Sonos, Inc. Multiple stage network microphone device with reduced power consumption and processing load
KR20200045851A (ko) * 2018-10-23 2020-05-06 삼성전자주식회사 음성 인식 서비스를 제공하는 전자 장치 및 시스템
JP2020067906A (ja) * 2018-10-25 2020-04-30 シャープ株式会社 情報処理装置、情報処理装置の制御方法、情報処理プログラムおよび記録媒体
US11475898B2 (en) 2018-10-26 2022-10-18 Apple Inc. Low-latency multi-speaker speech recognition
US20200135191A1 (en) * 2018-10-30 2020-04-30 Bby Solutions, Inc. Digital Voice Butler
EP3654249A1 (en) 2018-11-15 2020-05-20 Snips Dilated convolutions and gating for efficient keyword spotting
US10657968B1 (en) * 2018-11-19 2020-05-19 Google Llc Controlling device output according to a determined condition of a user
EP3657303B1 (en) 2018-11-23 2022-05-11 Société BIC Writing instrument serving as a mechanical remote control for an electronic device
US10984791B2 (en) 2018-11-29 2021-04-20 Hughes Network Systems, Llc Spoken language interface for network management
US11100925B2 (en) 2018-12-06 2021-08-24 Comcast Cable Communications, Llc Voice command trigger words
US11183183B2 (en) 2018-12-07 2021-11-23 Sonos, Inc. Systems and methods of operating media playback systems having multiple voice assistant services
US11132989B2 (en) 2018-12-13 2021-09-28 Sonos, Inc. Networked microphone devices, systems, and methods of localized arbitration
US10602268B1 (en) 2018-12-20 2020-03-24 Sonos, Inc. Optimization of network microphone devices using noise classification
US11152001B2 (en) * 2018-12-20 2021-10-19 Synaptics Incorporated Vision-based presence-aware voice-enabled device
US20220036751A1 (en) * 2018-12-31 2022-02-03 4S Medical Research Private Limited A method and a device for providing a performance indication to a hearing and speech impaired person learning speaking skills
TWI713016B (zh) * 2019-01-03 2020-12-11 瑞昱半導體股份有限公司 語音偵測處理系統與語音偵測方法
US11638059B2 (en) 2019-01-04 2023-04-25 Apple Inc. Content playback on multiple devices
US11776539B2 (en) 2019-01-08 2023-10-03 Universal Electronics Inc. Voice assistant with sound metering capabilities
US11665757B2 (en) * 2019-01-08 2023-05-30 Universal Electronics Inc. Universal audio device pairing assistant
WO2020146105A1 (en) * 2019-01-08 2020-07-16 Universal Electronics Inc. Universal voice assistant
US10959018B1 (en) * 2019-01-18 2021-03-23 Amazon Technologies, Inc. Method for autonomous loudspeaker room adaptation
KR20200094839A (ko) * 2019-01-23 2020-08-10 삼성전자주식회사 사용자 입력에 대한 피드백 정보를 제공하는 전자 장치 및 그 동작 방법
CN110166890B (zh) * 2019-01-30 2022-05-31 腾讯科技(深圳)有限公司 音频的播放采集方法、设备及存储介质
US11388516B2 (en) 2019-02-07 2022-07-12 Thomas STACHURA Privacy device for smart speakers
US10867604B2 (en) 2019-02-08 2020-12-15 Sonos, Inc. Devices, systems, and methods for distributed voice processing
US11315556B2 (en) 2019-02-08 2022-04-26 Sonos, Inc. Devices, systems, and methods for distributed voice processing by transmitting sound data associated with a wake word to an appropriate device for identification
IN201941005740A (ko) * 2019-02-13 2019-02-22
US11423885B2 (en) 2019-02-20 2022-08-23 Google Llc Utilizing pre-event and post-event input streams to engage an automated assistant
CN110070863A (zh) * 2019-03-11 2019-07-30 华为技术有限公司 一种语音控制方法及装置
CN109976515B (zh) * 2019-03-11 2023-07-07 阿波罗智联(北京)科技有限公司 一种信息处理方法、装置、车辆及计算机可读存储介质
US11348573B2 (en) 2019-03-18 2022-05-31 Apple Inc. Multimodality in digital assistant systems
US11120794B2 (en) 2019-05-03 2021-09-14 Sonos, Inc. Voice assistant persistence across multiple network microphone devices
US11475884B2 (en) 2019-05-06 2022-10-18 Apple Inc. Reducing digital assistant latency when a language is incorrectly determined
US11423908B2 (en) 2019-05-06 2022-08-23 Apple Inc. Interpreting spoken requests
US11307752B2 (en) 2019-05-06 2022-04-19 Apple Inc. User configurable task triggers
DK201970509A1 (en) 2019-05-06 2021-01-15 Apple Inc Spoken notifications
US11140099B2 (en) 2019-05-21 2021-10-05 Apple Inc. Providing message response suggestions
DK180129B1 (en) 2019-05-31 2020-06-02 Apple Inc. USER ACTIVITY SHORTCUT SUGGESTIONS
US11289073B2 (en) 2019-05-31 2022-03-29 Apple Inc. Device text to speech
DK201970510A1 (en) 2019-05-31 2021-02-11 Apple Inc Voice identification in digital assistant systems
US11496600B2 (en) 2019-05-31 2022-11-08 Apple Inc. Remote execution of machine-learned models
US11468890B2 (en) 2019-06-01 2022-10-11 Apple Inc. Methods and user interfaces for voice-based control of electronic devices
US11360641B2 (en) 2019-06-01 2022-06-14 Apple Inc. Increasing the relevance of new available information
US10586540B1 (en) 2019-06-12 2020-03-10 Sonos, Inc. Network microphone device with command keyword conditioning
US11361756B2 (en) 2019-06-12 2022-06-14 Sonos, Inc. Conditional wake word eventing based on environment
US11200894B2 (en) 2019-06-12 2021-12-14 Sonos, Inc. Network microphone device with command keyword eventing
US11114104B2 (en) 2019-06-18 2021-09-07 International Business Machines Corporation Preventing adversarial audio attacks on digital assistants
US11442992B1 (en) 2019-06-28 2022-09-13 Meta Platforms Technologies, Llc Conversational reasoning with knowledge graph paths for assistant systems
US11657094B2 (en) 2019-06-28 2023-05-23 Meta Platforms Technologies, Llc Memory grounded conversational reasoning and question answering for assistant systems
US11488592B2 (en) * 2019-07-09 2022-11-01 Lg Electronics Inc. Communication robot and method for operating the same
CN112534771B (zh) 2019-07-17 2024-04-19 谷歌有限责任公司 在基于声学的数字助理应用中验证触发关键字的系统和方法
EP3970000A1 (en) 2019-07-19 2022-03-23 Google LLC Condensed spoken utterances for automated assistant control of an intricate application gui
US11468246B2 (en) * 2019-07-22 2022-10-11 Capital One Services, Llc Multi-turn dialogue response generation with template generation
CN110580914A (zh) * 2019-07-24 2019-12-17 安克创新科技股份有限公司 一种音频处理方法、设备及具有存储功能的装置
JP6817386B2 (ja) * 2019-07-25 2021-01-20 華為技術有限公司Huawei Technologies Co.,Ltd. 音声認識方法、音声ウェイクアップ装置、音声認識装置、および端末
KR20190096853A (ko) * 2019-07-30 2019-08-20 엘지전자 주식회사 음성 처리 방법 및 음성 처리 장치
US11138975B2 (en) 2019-07-31 2021-10-05 Sonos, Inc. Locally distributed keyword detection
US10871943B1 (en) 2019-07-31 2020-12-22 Sonos, Inc. Noise classification for event detection
US11138969B2 (en) 2019-07-31 2021-10-05 Sonos, Inc. Locally distributed keyword detection
US10915227B1 (en) 2019-08-07 2021-02-09 Bank Of America Corporation System for adjustment of resource allocation based on multi-channel inputs
US20220277733A1 (en) * 2019-08-14 2022-09-01 Unify Patente Gmbh & Co. Kg Real-time communication and collaboration system and method of monitoring objectives to be achieved by a plurality of users collaborating on a real-time communication and collaboration platform
US11651044B2 (en) * 2019-08-30 2023-05-16 Accenture Global Solutions Limited Intelligent insight system and method for facilitating participant involvement
CN110718219B (zh) * 2019-09-12 2022-07-22 百度在线网络技术(北京)有限公司 一种语音处理方法、装置、设备和计算机存储介质
US11488406B2 (en) 2019-09-25 2022-11-01 Apple Inc. Text detection using global geometry estimators
US11145315B2 (en) * 2019-10-16 2021-10-12 Motorola Mobility Llc Electronic device with trigger phrase bypass and corresponding systems and methods
US11308284B2 (en) 2019-10-18 2022-04-19 Facebook Technologies, Llc. Smart cameras enabled by assistant systems
US11567788B1 (en) 2019-10-18 2023-01-31 Meta Platforms, Inc. Generating proactive reminders for assistant systems
US10984086B1 (en) 2019-10-18 2021-04-20 Motorola Mobility Llc Methods and systems for fingerprint sensor triggered voice interaction in an electronic device
US11189286B2 (en) 2019-10-22 2021-11-30 Sonos, Inc. VAS toggle based on device orientation
US11418358B2 (en) 2019-11-04 2022-08-16 International Business Machines Corporation Smart device active monitoring
JP7418563B2 (ja) * 2019-11-08 2024-01-19 グーグル エルエルシー オンデバイスの機械学習モデルの訓練のための自動化アシスタントの機能の訂正の使用
US11302323B2 (en) * 2019-11-21 2022-04-12 International Business Machines Corporation Voice response delivery with acceptable interference and attention
US20210158803A1 (en) * 2019-11-21 2021-05-27 Lenovo (Singapore) Pte. Ltd. Determining wake word strength
TWI727521B (zh) * 2019-11-27 2021-05-11 瑞昱半導體股份有限公司 動態語音辨識方法及其裝置
WO2021119362A1 (en) * 2019-12-10 2021-06-17 Okeeffe Gregory Systems, devices, and methods for enhancing user privacy and/or user control over audio-activated devices
US11289075B1 (en) * 2019-12-13 2022-03-29 Amazon Technologies, Inc. Routing of natural language inputs to speech processing applications
US11200900B2 (en) 2019-12-20 2021-12-14 Sonos, Inc. Offline voice control
RU2757264C2 (ru) * 2019-12-24 2021-10-12 Общество С Ограниченной Ответственностью «Яндекс» Способ и система для обработки пользовательского разговорного речевого фрагмента
US11562740B2 (en) 2020-01-07 2023-01-24 Sonos, Inc. Voice verification for media playback
US11064294B1 (en) 2020-01-10 2021-07-13 Synaptics Incorporated Multiple-source tracking and voice activity detections for planar microphone arrays
US11556307B2 (en) 2020-01-31 2023-01-17 Sonos, Inc. Local voice data processing
JP6858335B2 (ja) * 2020-02-06 2021-04-14 Tvs Regza株式会社 電子機器及びその制御方法
JP6858334B2 (ja) * 2020-02-06 2021-04-14 Tvs Regza株式会社 電子機器及びその制御方法
US11593984B2 (en) 2020-02-07 2023-02-28 Apple Inc. Using text for avatar animation
US11308958B2 (en) 2020-02-07 2022-04-19 Sonos, Inc. Localized wakeword verification
US11562744B1 (en) 2020-02-13 2023-01-24 Meta Platforms Technologies, Llc Stylizing text-to-speech (TTS) voice response for assistant systems
US11321048B2 (en) * 2020-02-25 2022-05-03 Motorola Solutions, Inc. Method and apparatus for temporary hands-free voice interaction
WO2021173127A1 (en) 2020-02-26 2021-09-02 Google Llc Pre-emptively limiting responsiveness of various assistant devices in an environment using an inaudible tone or other rendered output
CN115668206A (zh) * 2020-03-10 2023-01-31 梅特凯股份有限公司 推动多语言、多轮次、多领域虚拟助理的并行假设推理
US12045572B2 (en) 2020-03-10 2024-07-23 MeetKai, Inc. System and method for handling out of scope or out of domain user inquiries
US11159767B1 (en) 2020-04-07 2021-10-26 Facebook Technologies, Llc Proactive in-call content recommendations for assistant systems
KR20210125356A (ko) * 2020-04-08 2021-10-18 삼성전자주식회사 전자 장치 및 그 동작 방법
US11587564B2 (en) 2020-04-20 2023-02-21 Rovi Guides, Inc. Enhancing signature word detection in voice assistants
WO2021216135A1 (en) * 2020-04-20 2021-10-28 Rovi Guides, Inc. Enhancing signature word detection in voice assistants
CN113658596A (zh) * 2020-04-29 2021-11-16 扬智科技股份有限公司 语意辨识方法与语意辨识装置
US11061543B1 (en) 2020-05-11 2021-07-13 Apple Inc. Providing relevant data items based on context
US11038934B1 (en) 2020-05-11 2021-06-15 Apple Inc. Digital assistant hardware abstraction
US11755276B2 (en) 2020-05-12 2023-09-12 Apple Inc. Reducing description length based on confidence
US11727919B2 (en) 2020-05-20 2023-08-15 Sonos, Inc. Memory allocation for keyword spotting engines
US11482224B2 (en) 2020-05-20 2022-10-25 Sonos, Inc. Command keywords with input detection windowing
US11308962B2 (en) 2020-05-20 2022-04-19 Sonos, Inc. Input detection windowing
KR20210144443A (ko) * 2020-05-22 2021-11-30 삼성전자주식회사 인공지능 가상 비서 서비스에서의 텍스트 출력 방법 및 이를 지원하는 전자 장치
US11153739B1 (en) * 2020-06-03 2021-10-19 Micron Technology, Inc. Emergency mode for mobile devices
US20210383796A1 (en) * 2020-06-08 2021-12-09 Sonos, Inc. Wakewordless Voice Quickstarts
US11658835B2 (en) 2020-06-29 2023-05-23 Meta Platforms, Inc. Using a single request for multi-person calling in assistant systems
US11490204B2 (en) 2020-07-20 2022-11-01 Apple Inc. Multi-device audio adjustment coordination
US11438683B2 (en) 2020-07-21 2022-09-06 Apple Inc. User identification using headphones
US11615795B2 (en) * 2020-08-03 2023-03-28 HCL America Inc. Method and system for providing secured access to services rendered by a digital voice assistant
US11922949B1 (en) * 2020-08-17 2024-03-05 Amazon Technologies, Inc. Sound detection-based power control of a device
US11698771B2 (en) 2020-08-25 2023-07-11 Sonos, Inc. Vocal guidance engines for playback devices
US11663415B2 (en) * 2020-08-31 2023-05-30 Walgreen Co. Systems and methods for voice assisted healthcare
US11922372B2 (en) 2020-08-31 2024-03-05 Walgreen Co. Systems and methods for voice assisted goods delivery
US11783827B2 (en) 2020-11-06 2023-10-10 Apple Inc. Determining suggested subsequent user actions during digital assistant interaction
US11984123B2 (en) 2020-11-12 2024-05-14 Sonos, Inc. Network device interaction by range
US11688392B2 (en) * 2020-12-08 2023-06-27 Google Llc Freeze words
KR20220086342A (ko) * 2020-12-16 2022-06-23 삼성전자주식회사 음성 입력의 응답 제공 방법 및 이를 지원하는 전자 장치
JP7258007B2 (ja) * 2020-12-24 2023-04-14 オナー デバイス カンパニー リミテッド 音声認識方法、音声ウェイクアップ装置、音声認識装置、および端末
US11563706B2 (en) 2020-12-29 2023-01-24 Meta Platforms, Inc. Generating context-aware rendering of media contents for assistant systems
US11809480B1 (en) 2020-12-31 2023-11-07 Meta Platforms, Inc. Generating dynamic knowledge graph of media contents for assistant systems
US12008048B2 (en) 2021-01-04 2024-06-11 Oracle International Corporation Drill back to original audio clip in virtual assistant initiated lists and reminders
US11551700B2 (en) 2021-01-25 2023-01-10 Sonos, Inc. Systems and methods for power-efficient keyword detection
EP4241187A1 (en) 2021-02-12 2023-09-13 Google LLC Utilization of sandboxed feature detection process to ensure security of captured audio and/or other sensor data
US11756574B2 (en) 2021-03-11 2023-09-12 Apple Inc. Multiple state digital assistant for continuous dialog
US11886821B2 (en) * 2021-04-16 2024-01-30 Accenture Global Solutions Limited Method and system for inferring answers from knowledge graphs
US11861315B2 (en) 2021-04-21 2024-01-02 Meta Platforms, Inc. Continuous learning for natural-language understanding models for assistant systems
US11481686B1 (en) * 2021-05-13 2022-10-25 Google Llc Selectively rendering a keyboard interface in response to an assistant invocation in certain circumstances
US11935168B1 (en) 2021-05-14 2024-03-19 Apple Inc. Selective amplification of voice and interactive language simulator
US11797766B2 (en) 2021-05-21 2023-10-24 Apple Inc. Word prediction with multiple overlapping contexts
US11960790B2 (en) * 2021-05-27 2024-04-16 Microsoft Technology Licensing, Llc Spatial attention model enhanced voice engagement system
US11663024B2 (en) * 2021-06-07 2023-05-30 International Business Machines Corporation Efficient collaboration using a virtual assistant
KR20230007138A (ko) * 2021-07-05 2023-01-12 현대자동차주식회사 차량 품질 문제 관리 시스템 및 그의 데이터 처리 방법
US11915698B1 (en) * 2021-09-29 2024-02-27 Amazon Technologies, Inc. Sound source localization
DE202021105276U1 (de) 2021-09-30 2023-01-10 WAGO Verwaltungsgesellschaft mit beschränkter Haftung Vorrichtung zur lokalen Erkennung eines Befehls aus einem vorbestimmten Befehlssatz
US20230113883A1 (en) * 2021-10-13 2023-04-13 Google Llc Digital Signal Processor-Based Continued Conversation
US12045568B1 (en) 2021-11-12 2024-07-23 Meta Platforms, Inc. Span pointer networks for non-autoregressive task-oriented semantic parsing for assistant systems
US12057138B2 (en) * 2022-01-10 2024-08-06 Synaptics Incorporated Cascade audio spotting system
US20230289652A1 (en) * 2022-03-14 2023-09-14 Matthias THÖMEL Self-learning audio monitoring system
US12008921B2 (en) * 2022-04-22 2024-06-11 617 Education Inc. Systems and methods for grapheme-phoneme correspondence learning
US11908473B2 (en) 2022-05-10 2024-02-20 Apple Inc. Task modification after task initiation
DE102022112743B4 (de) 2022-05-20 2024-02-01 Audi Aktiengesellschaft Verfahren zur Verbesserung der Qualität einer Audio- und/oder Videoaufzeichnung sowie Steuervorrichtung für ein mobiles Endgerät
US11995457B2 (en) 2022-06-03 2024-05-28 Apple Inc. Digital assistant integration with system interface
US11978436B2 (en) 2022-06-03 2024-05-07 Apple Inc. Application vocabulary integration with a digital assistant
US20240029725A1 (en) * 2022-07-21 2024-01-25 Sony Interactive Entertainment LLC Customized dialogue support
WO2024084263A1 (en) * 2022-10-16 2024-04-25 Parham Mohammad Ibrahim Suburban smart kiosk with information, advertisement and relief system
US11983329B1 (en) 2022-12-05 2024-05-14 Meta Platforms, Inc. Detecting head gestures using inertial measurement unit signals
WO2024141900A1 (en) * 2022-12-27 2024-07-04 Cochlear Limited Audiological intervention
US11928569B1 (en) * 2023-06-30 2024-03-12 Intuit, Inc. Automated user experience orchestration using natural language based machine learning techniques
US12093965B1 (en) * 2023-09-13 2024-09-17 Dmitry Shapiro Systems and methods for generating response records for individual users based on user responses to prompts
US11922143B1 (en) 2023-10-05 2024-03-05 Dmitry Shapiro Systems and methods for providing a user interface that facilitates application development

Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2008075082A1 (en) 2006-12-21 2008-06-26 Symbian Software Limited Mobile device and method of operation thereof
JP4319573B2 (ja) * 2004-04-07 2009-08-26 株式会社東芝 移動通信端末装置
US20090318198A1 (en) * 2007-04-04 2009-12-24 Carroll David W Mobile personal audio device

Family Cites Families (6606)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US1559320A (en) 1924-11-17 1925-10-27 Albert A Hirsh Tooth cleaner
US2180522A (en) 1938-11-01 1939-11-21 Henne Isabelle Dental floss throw-away unit and method of making same
US3828132A (en) 1970-10-30 1974-08-06 Bell Telephone Labor Inc Speech synthesis by concatenation of formant encoded words
US3710321A (en) 1971-01-18 1973-01-09 Ibm Machine recognition of lexical symbols
US3704345A (en) 1971-03-19 1972-11-28 Bell Telephone Labor Inc Conversion of printed text into synthetic speech
US3979557A (en) 1974-07-03 1976-09-07 International Telephone And Telegraph Corporation Speech processor system for pitch period extraction using prediction filters
US4013085A (en) 1974-07-17 1977-03-22 Wright Charles E Dental cleaning means and method of manufacture therefor
US4108211A (en) 1975-04-28 1978-08-22 Fuji Photo Optical Co., Ltd. Articulated, four-way bendable tube structure
US4107784A (en) 1975-12-22 1978-08-15 Bemmelen Henri M Van Management control terminal method and apparatus
US4090216A (en) 1976-05-26 1978-05-16 Gte Sylvania Incorporated Ambient light contrast and color control circuit
BG24190A1 (en) 1976-09-08 1978-01-10 Antonov Method of synthesis of speech and device for effecting same
US4081631A (en) 1976-12-08 1978-03-28 Motorola, Inc. Dual purpose, weather resistant data terminal keyboard assembly including audio porting
US4384169A (en) 1977-01-21 1983-05-17 Forrest S. Mozer Method and apparatus for speech synthesizing
US4159536A (en) 1977-04-08 1979-06-26 Willard E. Kehoe Portable electronic language translation device
GB1545406A (en) 1977-12-16 1979-05-10 Ibm Keyboard apparatus
US4181821A (en) 1978-10-31 1980-01-01 Bell Telephone Laboratories, Incorporated Multiple template speech recognition system
JPS597120B2 (ja) 1978-11-24 1984-02-16 日本電気株式会社 音声分析装置
US4241286A (en) 1979-01-04 1980-12-23 Mack Gordon Welding helmet lens assembly
US4253477A (en) 1979-08-02 1981-03-03 Eichman John J Dental floss holder
JPS5681900A (en) 1979-12-10 1981-07-04 Nippon Electric Co Voice synthesizer
US4310721A (en) 1980-01-23 1982-01-12 The United States Of America As Represented By The Secretary Of The Army Half duplex integral vocoder modem system
US4348553A (en) 1980-07-02 1982-09-07 International Business Machines Corporation Parallel pattern verifier with dynamic time warping
JPS5741731A (en) 1980-08-25 1982-03-09 Fujitsu Ltd Coordinate input device
US4332464A (en) 1980-09-22 1982-06-01 Xerox Corporation Interactive user-machine interface method and apparatus for copier/duplicator
NZ199001A (en) 1981-01-30 1984-02-03 Mobil Oil Corp Alkylation of aromatic compounds using catalyst with metal component and a zeolite
JPS57178295A (en) 1981-04-27 1982-11-02 Nippon Electric Co Continuous word recognition apparatus
US4495644A (en) 1981-04-27 1985-01-22 Quest Automation Public Limited Company Apparatus for signature verification
US4433377A (en) 1981-06-29 1984-02-21 Eustis Mary S Data processing with format varying
US4386345A (en) 1981-09-22 1983-05-31 Sperry Corporation Color and brightness tracking in a cathode ray tube display system
EP0444717B1 (en) 1982-06-11 1996-05-22 Mitsubishi Denki Kabushiki Kaisha Vector quantizer
US4451849A (en) 1982-06-23 1984-05-29 Rca Corporation Plural operating mode ambient light responsive television picture control
US4485439A (en) 1982-07-27 1984-11-27 S.A. Analis Standard hardware-software interface for connecting any instrument which provides a digital output stream with any digital host computer
US4513379A (en) 1982-09-07 1985-04-23 General Electric Company Customization window for a computer numerical control system
JPS5957336A (ja) 1982-09-27 1984-04-02 Toshiba Corp 画像表示装置
US4555775B1 (en) 1982-10-07 1995-12-05 Bell Telephone Labor Inc Dynamic generation and overlaying of graphic windows for multiple active program storage areas
US4587670A (en) 1982-10-15 1986-05-06 At&T Bell Laboratories Hidden Markov model speech recognition arrangement
US4688195A (en) 1983-01-28 1987-08-18 Texas Instruments Incorporated Natural-language interface generating system
US4831551A (en) 1983-01-28 1989-05-16 Texas Instruments Incorporated Speaker-dependent connected speech word recognizer
US4586158A (en) 1983-02-22 1986-04-29 International Business Machines Corp. Screen management system
EP0121015B1 (en) 1983-03-31 1990-03-07 International Business Machines Corporation Presentation space management and viewporting on a multifunction virtual terminal
US4654875A (en) 1983-05-23 1987-03-31 The Research Foundation Of State University Of New York System to achieve automatic recognition of linguistic strings
SE8303123L (sv) 1983-06-02 1984-12-03 Fixfabriken Ab Festanordning
US4618984A (en) 1983-06-08 1986-10-21 International Business Machines Corporation Adaptive automatic discrete utterance recognition
JPS603056A (ja) 1983-06-21 1985-01-09 Toshiba Corp 情報整理装置
DE3335358A1 (de) 1983-09-29 1985-04-11 Siemens AG, 1000 Berlin und 8000 München Verfahren zur bestimmung von sprachspektren fuer die automatische spracherkennung und sprachcodierung
US4611346A (en) 1983-09-29 1986-09-09 International Business Machines Corporation Method and apparatus for character recognition accommodating diacritical marks
US4802223A (en) 1983-11-03 1989-01-31 Texas Instruments Incorporated Low data rate speech encoding employing syllable pitch patterns
US4797930A (en) 1983-11-03 1989-01-10 Texas Instruments Incorporated constructed syllable pitch patterns from phonological linguistic unit string data
US5212638A (en) 1983-11-14 1993-05-18 Colman Bernath Alphabetic keyboard arrangement for typing Mandarin Chinese phonetic data
US5164900A (en) 1983-11-14 1992-11-17 Colman Bernath Method and device for phonetically encoding Chinese textual data for data processing entry
US4680805A (en) 1983-11-17 1987-07-14 Texas Instruments Incorporated Method and apparatus for recognition of discontinuous text
US4589022A (en) 1983-11-28 1986-05-13 General Electric Company Brightness control system for CRT video display
JPS60116072A (ja) 1983-11-29 1985-06-22 N K B:Kk 情報提供システム
US4736296A (en) 1983-12-26 1988-04-05 Hitachi, Ltd. Method and apparatus of intelligent guidance in natural language
US4726065A (en) 1984-01-26 1988-02-16 Horst Froessl Image manipulation by speech signals
US4955047A (en) 1984-03-26 1990-09-04 Dytel Corporation Automated attendant with direct inward system access
US4811243A (en) 1984-04-06 1989-03-07 Racine Marsh V Computer aided coordinate digitizing system
US4692941A (en) 1984-04-10 1987-09-08 First Byte Real-time text-to-speech conversion system
US4709390A (en) 1984-05-04 1987-11-24 American Telephone And Telegraph Company, At&T Bell Laboratories Speech message code modifying arrangement
JPH067397Y2 (ja) 1984-07-30 1994-02-23 カシオ計算機株式会社 文書入力装置
JPH0724055B2 (ja) 1984-07-31 1995-03-15 株式会社日立製作所 単語分割処理方法
US4783807A (en) 1984-08-27 1988-11-08 John Marley System and method for sound recognition with feature selection synchronized to voice pitch
JP2607457B2 (ja) 1984-09-17 1997-05-07 株式会社東芝 パターン認識装置
JPS61105671A (ja) 1984-10-29 1986-05-23 Hitachi Ltd 自然言語処理装置
US4718094A (en) 1984-11-19 1988-01-05 International Business Machines Corp. Speech recognition system
US5165007A (en) 1985-02-01 1992-11-17 International Business Machines Corporation Feneme-based Markov models for words
US4783804A (en) 1985-03-21 1988-11-08 American Telephone And Telegraph Company, At&T Bell Laboratories Hidden Markov model speech recognition arrangement
US4944013A (en) 1985-04-03 1990-07-24 British Telecommunications Public Limited Company Multi-pulse speech coder
US4670848A (en) 1985-04-10 1987-06-02 Standard Systems Corporation Artificial intelligence system
US4658425A (en) 1985-04-19 1987-04-14 Shure Brothers, Inc. Microphone actuation control system suitable for teleconference systems
US4833712A (en) 1985-05-29 1989-05-23 International Business Machines Corporation Automatic generation of simple Markov model stunted baseforms for words in a vocabulary
US4819271A (en) 1985-05-29 1989-04-04 International Business Machines Corporation Constructing Markov model word baseforms from multiple utterances by concatenating model sequences for word segments
US4698625A (en) 1985-05-30 1987-10-06 International Business Machines Corp. Graphic highlight adjacent a pointing cursor
US4829583A (en) 1985-06-03 1989-05-09 Sino Business Machines, Inc. Method and apparatus for processing ideographic characters
US5067158A (en) 1985-06-11 1991-11-19 Texas Instruments Incorporated Linear predictive residual representation via non-iterative spectral reconstruction
US5175803A (en) 1985-06-14 1992-12-29 Yeh Victor C Method and apparatus for data processing and word processing in Chinese using a phonetic Chinese language
US4713775A (en) 1985-08-21 1987-12-15 Teknowledge, Incorporated Intelligent assistant for using and operating computer system capabilities to solve problems
EP0218859A3 (en) 1985-10-11 1989-09-06 International Business Machines Corporation Signal processor communication interface
US4754489A (en) 1985-10-15 1988-06-28 The Palantir Corporation Means for resolving ambiguities in text based upon character context
US5133023A (en) 1985-10-15 1992-07-21 The Palantir Corporation Means for resolving ambiguities in text based upon character context
US4655233A (en) 1985-11-04 1987-04-07 Laughlin Patrick E Dental flossing tool
US4776016A (en) 1985-11-21 1988-10-04 Position Orientation Systems, Inc. Voice control system
NL8503304A (nl) 1985-11-29 1987-06-16 Philips Nv Werkwijze en inrichting voor het segmenteren van een uit een akoestisch signaal, bij voorbeeld een spraaksignaal, afgeleid elektrisch signaal.
JPH0833744B2 (ja) 1986-01-09 1996-03-29 株式会社東芝 音声合成装置
US4680429A (en) 1986-01-15 1987-07-14 Tektronix, Inc. Touch panel
US4807752A (en) 1986-01-21 1989-02-28 Placontrol Corporation Dental floss holders and package assembly of same
US4724542A (en) 1986-01-22 1988-02-09 International Business Machines Corporation Automatic reference adaptation during dynamic signature verification
US5057915A (en) 1986-03-10 1991-10-15 Kohorn H Von System and method for attracting shoppers to sales outlets
US5759101A (en) 1986-03-10 1998-06-02 Response Reward Systems L.C. Central and remote evaluation of responses of participatory broadcast audience with automatic crediting and couponing
US5032989A (en) 1986-03-19 1991-07-16 Realpro, Ltd. Real estate search and location system and method
EP0241170B1 (en) 1986-03-28 1992-05-27 AT&T Corp. Adaptive speech feature signal generation arrangement
JPS62235998A (ja) 1986-04-05 1987-10-16 シャープ株式会社 音節識別方式
JPH0814822B2 (ja) 1986-04-30 1996-02-14 カシオ計算機株式会社 命令入力装置
US4903305A (en) 1986-05-12 1990-02-20 Dragon Systems, Inc. Method for representing word models for use in speech recognition
US4837798A (en) 1986-06-02 1989-06-06 American Telephone And Telegraph Company Communication system having unified messaging
GB8618665D0 (en) 1986-07-31 1986-09-10 British Telecomm Graphical workstation
US4790028A (en) 1986-09-12 1988-12-06 Westinghouse Electric Corp. Method and apparatus for generating variably scaled displays
ES2047494T3 (es) 1986-10-03 1994-03-01 British Telecomm Sistema de traduccion de lenguas.
US5765131A (en) 1986-10-03 1998-06-09 British Telecommunications Public Limited Company Language translation system and method
US4837831A (en) 1986-10-15 1989-06-06 Dragon Systems, Inc. Method for creating and using multiple-word sound models in speech recognition
US5083268A (en) 1986-10-15 1992-01-21 Texas Instruments Incorporated System and method for parsing natural language by unifying lexical features of words
EP0287679B1 (en) 1986-10-16 1994-07-13 Mitsubishi Denki Kabushiki Kaisha Amplitude-adapted vector quantizer
US5123103A (en) 1986-10-17 1992-06-16 Hitachi, Ltd. Method and system of retrieving program specification and linking the specification by concept to retrieval request for reusing program parts
US4829576A (en) 1986-10-21 1989-05-09 Dragon Systems, Inc. Voice recognition system
US4887212A (en) 1986-10-29 1989-12-12 International Business Machines Corporation Parser for natural language text
US4833718A (en) 1986-11-18 1989-05-23 First Byte Compression of stored waveforms for artificial speech
US4852168A (en) 1986-11-18 1989-07-25 Sprague Richard P Compression of stored waveforms for artificial speech
US4727354A (en) 1987-01-07 1988-02-23 Unisys Corporation System for selecting best fit vector code in vector quantization encoding
US4827520A (en) 1987-01-16 1989-05-02 Prince Corporation Voice actuated control system for use in a vehicle
US5179627A (en) 1987-02-10 1993-01-12 Dictaphone Corporation Digital dictation system
US4965763A (en) 1987-03-03 1990-10-23 International Business Machines Corporation Computer method for automatic extraction of commonly specified information from business correspondence
JP2595235B2 (ja) 1987-03-18 1997-04-02 富士通株式会社 音声合成装置
US4755811A (en) 1987-03-24 1988-07-05 Tektronix, Inc. Touch controlled zoom of waveform displays
US4803729A (en) 1987-04-03 1989-02-07 Dragon Systems, Inc. Speech recognition method
US5027408A (en) 1987-04-09 1991-06-25 Kroeker John P Speech-recognition circuitry employing phoneme estimation
US5125030A (en) 1987-04-13 1992-06-23 Kokusai Denshin Denwa Co., Ltd. Speech signal coding/decoding system based on the type of speech signal
US5644727A (en) 1987-04-15 1997-07-01 Proprietary Financial Products, Inc. System for the operation and management of one or more financial accounts through the use of a digital communication and computation system for exchange, investment and borrowing
AT386947B (de) 1987-04-17 1988-11-10 Rochus Marxer Spannbarer faden, behaelter fuer diesen faden und halter zur zahnpflege, insbesondere zur reinigung von zahnzwischenraeumen
JPS63285598A (ja) 1987-05-18 1988-11-22 ケイディディ株式会社 音素接続形パラメ−タ規則合成方式
CA1295064C (en) 1987-05-29 1992-01-28 Kuniyoshi Marui Voice recognition system used in telephone apparatus
US5231670A (en) 1987-06-01 1993-07-27 Kurzweil Applied Intelligence, Inc. Voice controlled system and method for generating text from a voice controlled input
CA1265623A (en) 1987-06-11 1990-02-06 Eddy Lee Method of facilitating computer sorting
DE3723078A1 (de) 1987-07-11 1989-01-19 Philips Patentverwaltung Verfahren zur erkennung von zusammenhaengend gesprochenen woertern
CA1288516C (en) 1987-07-31 1991-09-03 Leendert M. Bijnagte Apparatus and method for communicating textual and image information between a host computer and a remote display terminal
US4974191A (en) 1987-07-31 1990-11-27 Syntellect Software Inc. Adaptive natural language computer interface system
US4827518A (en) 1987-08-06 1989-05-02 Bell Communications Research, Inc. Speaker verification system using integrated circuit cards
CA1280215C (en) 1987-09-28 1991-02-12 Eddy Lee Multilingual ordered data retrieval system
JP2602847B2 (ja) 1987-09-29 1997-04-23 株式会社日立製作所 マルチメディアメールシステム
US5022081A (en) 1987-10-01 1991-06-04 Sharp Kabushiki Kaisha Information recognition system
DE3850885D1 (de) 1987-10-09 1994-09-01 Sound Entertainment Inc Spracherzeugung aus digital gespeicherten koartikulierten sprachsegmenten.
JPH01102599A (ja) 1987-10-12 1989-04-20 Internatl Business Mach Corp <Ibm> 音声認識方法
US4852173A (en) 1987-10-29 1989-07-25 International Business Machines Corporation Design and construction of a binary-tree system for language modelling
US5072452A (en) 1987-10-30 1991-12-10 International Business Machines Corporation Automatic determination of labels and Markov word models in a speech recognition system
DE3876379T2 (de) 1987-10-30 1993-06-09 Ibm Automatische bestimmung von kennzeichen und markov-wortmodellen in einem spracherkennungssystem.
US4914586A (en) 1987-11-06 1990-04-03 Xerox Corporation Garbage collector for hypermedia systems
US4992972A (en) 1987-11-18 1991-02-12 International Business Machines Corporation Flexible context searchable on-line information system with help files and modules for on-line computer system documentation
US4908867A (en) 1987-11-19 1990-03-13 British Telecommunications Public Limited Company Speech synthesis
US5220657A (en) 1987-12-02 1993-06-15 Xerox Corporation Updating local copy of shared data in a collaborative system
JP2739945B2 (ja) 1987-12-24 1998-04-15 株式会社東芝 音声認識方法
US5053758A (en) 1988-02-01 1991-10-01 Sperry Marine Inc. Touchscreen control panel with sliding touch control
US4984177A (en) 1988-02-05 1991-01-08 Advanced Products And Technologies, Inc. Voice language translator
GB2219178A (en) 1988-02-11 1989-11-29 Benchmark Technologies State machine controlled video processor
US5194950A (en) 1988-02-29 1993-03-16 Mitsubishi Denki Kabushiki Kaisha Vector quantizer
US5079723A (en) 1988-03-04 1992-01-07 Xerox Corporation Touch dialogue user interface for reproduction machines
US4994966A (en) 1988-03-31 1991-02-19 Emerson & Stern Associates, Inc. System and method for natural language parsing by initiating processing prior to entry of complete sentences
FI80536C (fi) 1988-04-15 1990-06-11 Nokia Mobira Oy Matrisdisplay.
US4914590A (en) 1988-05-18 1990-04-03 Emhart Industries, Inc. Natural language understanding system
US4975975A (en) 1988-05-26 1990-12-04 Gtx Corporation Hierarchical parametric apparatus and method for recognizing drawn characters
US5315689A (en) 1988-05-27 1994-05-24 Kabushiki Kaisha Toshiba Speech recognition system having word-based and phoneme-based recognition means
US5029211A (en) 1988-05-30 1991-07-02 Nec Corporation Speech analysis and synthesis system
US5111423A (en) 1988-07-21 1992-05-05 Altera Corporation Programmable interface for computer system peripheral circuit card
FR2636163B1 (fr) 1988-09-02 1991-07-05 Hamon Christian Procede et dispositif de synthese de la parole par addition-recouvrement de formes d'onde
US5257387A (en) 1988-09-09 1993-10-26 Compaq Computer Corporation Computer implemented method and apparatus for dynamic and automatic configuration of a computer system and circuit boards including computer resource allocation conflict resolution
US5161102A (en) 1988-09-09 1992-11-03 Compaq Computer Corporation Computer interface for the configuration of computer system and circuit boards
US5353432A (en) 1988-09-09 1994-10-04 Compaq Computer Corporation Interactive method for configuration of computer system and circuit boards with user specification of system resources and computer resolution of resource conflicts
US4839853A (en) 1988-09-15 1989-06-13 Bell Communications Research, Inc. Computer information retrieval using latent semantic structure
JPH0286397A (ja) 1988-09-22 1990-03-27 Nippon Telegr & Teleph Corp <Ntt> マイクロホンアレー
JPH0293597A (ja) 1988-09-30 1990-04-04 Nippon I B M Kk 音声認識装置
US5201034A (en) 1988-09-30 1993-04-06 Hitachi Ltd. Interactive intelligent interface
US4905163A (en) 1988-10-03 1990-02-27 Minnesota Mining & Manufacturing Company Intelligent optical navigator dynamic information presentation and navigation system
US5282265A (en) 1988-10-04 1994-01-25 Canon Kabushiki Kaisha Knowledge information processing system
US4918723A (en) 1988-10-07 1990-04-17 Jerry R. Iggulden Keyboard to facsimile machine transmission system
DE3837590A1 (de) 1988-11-05 1990-05-10 Ant Nachrichtentech Verfahren zum reduzieren der datenrate von digitalen bilddaten
DE68913669T2 (de) 1988-11-23 1994-07-21 Digital Equipment Corp Namenaussprache durch einen Synthetisator.
JP2807242B2 (ja) 1988-11-28 1998-10-08 株式会社東芝 音声認識装置
US5027110A (en) 1988-12-05 1991-06-25 At&T Bell Laboratories Arrangement for simultaneously displaying on one or more display terminals a series of images
US5027406A (en) 1988-12-06 1991-06-25 Dragon Systems, Inc. Method for interactive speech recognition and training
JPH02153415A (ja) 1988-12-06 1990-06-13 Hitachi Ltd キーボード装置
GB8828796D0 (en) 1988-12-09 1989-01-18 British Telecomm Data compression
US4935954A (en) 1988-12-28 1990-06-19 At&T Company Automated message retrieval system
DE3853885T2 (de) 1988-12-30 1995-09-14 Ezel Inc Vektorisationsverfahren.
US5127055A (en) 1988-12-30 1992-06-30 Kurzweil Applied Intelligence, Inc. Speech recognition apparatus & method having dynamic reference pattern adaptation
US5293448A (en) 1989-10-02 1994-03-08 Nippon Telegraph And Telephone Corporation Speech analysis-synthesis method and apparatus therefor
US5047614A (en) 1989-01-23 1991-09-10 Bianco James S Method and apparatus for computer-aided shopping
JP2574892B2 (ja) 1989-02-15 1997-01-22 株式会社日立製作所 自動車における負荷分担制御方法
US5086792A (en) 1989-02-16 1992-02-11 Placontrol Corp. Dental floss loop devices, and methods of manufacture and packaging same
US4928307A (en) 1989-03-02 1990-05-22 Acs Communications Time dependent, variable amplitude threshold output circuit for frequency variant and frequency invariant signal discrimination
SE466029B (sv) 1989-03-06 1991-12-02 Ibm Svenska Ab Anordning och foerfarande foer analys av naturligt spraak i ett datorbaserat informationsbehandlingssystem
JPH0636156B2 (ja) 1989-03-13 1994-05-11 インターナショナル・ビジネス・マシーンズ・コーポレーション 音声認識装置
JP2763322B2 (ja) 1989-03-13 1998-06-11 キヤノン株式会社 音声処理方法
US5033087A (en) 1989-03-14 1991-07-16 International Business Machines Corp. Method and apparatus for the automatic determination of phonological rules as for a continuous speech recognition system
JPH0782544B2 (ja) 1989-03-24 1995-09-06 インターナショナル・ビジネス・マシーンズ・コーポレーション マルチテンプレートを用いるdpマツチング方法及び装置
US5003577A (en) 1989-04-05 1991-03-26 At&T Bell Laboratories Voice and data interface to a voice-mail service system
US4977598A (en) 1989-04-13 1990-12-11 Texas Instruments Incorporated Efficient pruning algorithm for hidden markov model speech recognition
US5197005A (en) 1989-05-01 1993-03-23 Intelligent Business Systems Database retrieval system having a natural language interface
US4994983A (en) 1989-05-02 1991-02-19 Itt Corporation Automatic speech recognition system using seed templates
US5287448A (en) 1989-05-04 1994-02-15 Apple Computer, Inc. Method and apparatus for providing help information to users of computers
JP2904283B2 (ja) 1989-05-22 1999-06-14 マツダ株式会社 車両用多重伝送装置
US4953106A (en) 1989-05-23 1990-08-28 At&T Bell Laboratories Technique for drawing directed graphs
US5010574A (en) 1989-06-13 1991-04-23 At&T Bell Laboratories Vector quantizer search arrangement
JPH03163623A (ja) 1989-06-23 1991-07-15 Articulate Syst Inc 音声制御コンピュータ・インターフェース
JP2527817B2 (ja) 1989-07-14 1996-08-28 シャープ株式会社 主題連想装置および単語連想装置
JP2940005B2 (ja) 1989-07-20 1999-08-25 日本電気株式会社 音声符号化装置
JPH03113578A (ja) 1989-09-27 1991-05-14 Fujitsu Ltd 図形出力処理方式
US5091945A (en) 1989-09-28 1992-02-25 At&T Bell Laboratories Source dependent channel coding with error protection
US5276616A (en) 1989-10-16 1994-01-04 Sharp Kabushiki Kaisha Apparatus for automatically generating index
CA2027705C (en) 1989-10-17 1994-02-15 Masami Akamine Speech coding system utilizing a recursive computation technique for improvement in processing speed
US5075896A (en) 1989-10-25 1991-12-24 Xerox Corporation Character and phoneme recognition based on probability clustering
US4980916A (en) 1989-10-26 1990-12-25 General Electric Company Method for improving speech quality in code excited linear predictive speech coding
US5020112A (en) 1989-10-31 1991-05-28 At&T Bell Laboratories Image recognition method using two-dimensional stochastic grammars
US5220629A (en) 1989-11-06 1993-06-15 Canon Kabushiki Kaisha Speech synthesis apparatus and method
US5220639A (en) 1989-12-01 1993-06-15 National Science Council Mandarin speech input method for Chinese computers and a mandarin speech recognition machine
US5021971A (en) 1989-12-07 1991-06-04 Unisys Corporation Reflective binary encoder for vector quantization
US5179652A (en) 1989-12-13 1993-01-12 Anthony I. Rozmanith Method and apparatus for storing, transmitting and retrieving graphical and tabular data
US5077669A (en) 1989-12-27 1991-12-31 International Business Machines Corporation Method for quasi-key search within a national language support (nls) data processing system
US5091790A (en) 1989-12-29 1992-02-25 Morton Silverberg Multipurpose computer accessory for facilitating facsimile communication
EP0438662A2 (en) 1990-01-23 1991-07-31 International Business Machines Corporation Apparatus and method of grouping utterances of a phoneme into context-de-pendent categories based on sound-similarity for automatic speech recognition
US5218700A (en) 1990-01-30 1993-06-08 Allen Beechick Apparatus and method for sorting a list of items
US5175814A (en) 1990-01-30 1992-12-29 Digital Equipment Corporation Direct manipulation interface for boolean information retrieval
US5255386A (en) 1990-02-08 1993-10-19 International Business Machines Corporation Method and apparatus for intelligent help that matches the semantic similarity of the inferred intent of query or command to a best-fit predefined command intent
CH681573A5 (en) 1990-02-13 1993-04-15 Astral Automatic teller arrangement involving bank computers - is operated by user data card carrying personal data, account information and transaction records
EP0443548B1 (en) 1990-02-22 2003-07-23 Nec Corporation Speech coder
US5067503A (en) 1990-03-21 1991-11-26 Stile Thomas W Dental apparatus for flossing teeth
US5266949A (en) 1990-03-29 1993-11-30 Nokia Mobile Phones Ltd. Lighted electronic keyboard
US5299284A (en) 1990-04-09 1994-03-29 Arizona Board Of Regents, Acting On Behalf Of Arizona State University Pattern classification using linear programming
US5125022A (en) 1990-05-15 1992-06-23 Vcs Industries, Inc. Method for recognizing alphanumeric strings spoken over a telephone network
US5127043A (en) 1990-05-15 1992-06-30 Vcs Industries, Inc. Simultaneous speaker-independent voice recognition and verification over a telephone network
US5301109A (en) 1990-06-11 1994-04-05 Bell Communications Research, Inc. Computerized cross-language document retrieval using latent semantic indexing
JP3266246B2 (ja) 1990-06-15 2002-03-18 インターナシヨナル・ビジネス・マシーンズ・コーポレーシヨン 自然言語解析装置及び方法並びに自然言語解析用知識ベース構築方法
US5202952A (en) 1990-06-22 1993-04-13 Dragon Systems, Inc. Large-vocabulary continuous speech prefiltering and processing system
EP0464712A3 (en) 1990-06-28 1993-01-13 Kabushiki Kaisha Toshiba Display/input control system for software keyboard in information processing apparatus having integral display/input device
DE4023318A1 (de) 1990-07-21 1992-02-20 Fraunhofer Ges Forschung Verfahren zur durchfuehrung eines variablen dialogs mit technischen geraeten
US5175536A (en) 1990-08-01 1992-12-29 Westinghouse Electric Corp. Apparatus and method for adapting cards designed for a VME bus for use in a VXI bus system
US5103498A (en) 1990-08-02 1992-04-07 Tandy Corporation Intelligent help system
JPH0493894A (ja) 1990-08-03 1992-03-26 Canon Inc 文字処理方法および装置
EP0545988B1 (en) 1990-08-09 1999-12-01 Semantic Compaction System Communication system with text message retrieval based on concepts inputted via keyboard icons
GB9017600D0 (en) 1990-08-10 1990-09-26 British Aerospace An assembly and method for binary tree-searched vector quanisation data compression processing
DE4126902C2 (de) 1990-08-15 1996-06-27 Ricoh Kk Sprachintervall - Feststelleinheit
US5404295A (en) 1990-08-16 1995-04-04 Katz; Boris Method and apparatus for utilizing annotations to facilitate computer retrieval of database material
US5309359A (en) 1990-08-16 1994-05-03 Boris Katz Method and apparatus for generating and utlizing annotations to facilitate computer text retrieval
US5297170A (en) 1990-08-21 1994-03-22 Codex Corporation Lattice and trellis-coded quantization
EP0473864A1 (en) 1990-09-04 1992-03-11 International Business Machines Corporation Method and apparatus for paraphrasing information contained in logical forms
US5400434A (en) 1990-09-04 1995-03-21 Matsushita Electric Industrial Co., Ltd. Voice source for synthetic speech system
JPH0833739B2 (ja) 1990-09-13 1996-03-29 三菱電機株式会社 パターン表現モデル学習装置
US5119079A (en) 1990-09-17 1992-06-02 Xerox Corporation Touch screen user interface with expanding touch locations for a reprographic machine
US5216747A (en) 1990-09-20 1993-06-01 Digital Voice Systems, Inc. Voiced/unvoiced estimation of an acoustic signal
US5276794A (en) 1990-09-25 1994-01-04 Grid Systems Corporation Pop-up keyboard system for entering handwritten data into computer generated forms
US5164982A (en) 1990-09-27 1992-11-17 Radish Communications Systems, Inc. Telecommunication display system
US5305205A (en) 1990-10-23 1994-04-19 Weber Maria L Computer-assisted transcription apparatus
US5128672A (en) 1990-10-30 1992-07-07 Apple Computer, Inc. Dynamic predictive keyboard
US5325298A (en) 1990-11-07 1994-06-28 Hnc, Inc. Methods for generating or revising context vectors for a plurality of word stems
US5317507A (en) 1990-11-07 1994-05-31 Gallant Stephen I Method for document retrieval and for word sense disambiguation using neural networks
US5260697A (en) 1990-11-13 1993-11-09 Wang Laboratories, Inc. Computer with separate display plane and user interface processor
US5450523A (en) 1990-11-15 1995-09-12 Matsushita Electric Industrial Co., Ltd. Training module for estimating mixture Gaussian densities for speech unit models in speech recognition systems
US5247579A (en) 1990-12-05 1993-09-21 Digital Voice Systems, Inc. Methods for speech transmission
US5345536A (en) 1990-12-21 1994-09-06 Matsushita Electric Industrial Co., Ltd. Method of speech recognition
US5127053A (en) 1990-12-24 1992-06-30 General Electric Company Low-complexity method for improving the performance of autocorrelation-based pitch detectors
US5133011A (en) 1990-12-26 1992-07-21 International Business Machines Corporation Method and apparatus for linear vocal control of cursor position
US5196838A (en) 1990-12-28 1993-03-23 Apple Computer, Inc. Intelligent scrolling
US5210689A (en) 1990-12-28 1993-05-11 Semantic Compaction Systems System and method for automatically selecting among a plurality of input modes
US5497319A (en) 1990-12-31 1996-03-05 Trans-Link International Corp. Machine translation and telecommunications system
JPH04236624A (ja) 1991-01-18 1992-08-25 Sony Corp 制御システム
FI88345C (fi) 1991-01-29 1993-04-26 Nokia Mobile Phones Ltd Belyst tastatur
US5712949A (en) 1991-01-29 1998-01-27 Sony Corporation Disc reproduction system with sequential reproduction of audio and image data
US5268990A (en) 1991-01-31 1993-12-07 Sri International Method for recognizing speech using linguistically-motivated hidden Markov models
US5369577A (en) 1991-02-01 1994-11-29 Wang Laboratories, Inc. Text searching system
US5613056A (en) 1991-02-19 1997-03-18 Bright Star Technology, Inc. Advanced tools for speech synchronized animation
US5167004A (en) 1991-02-28 1992-11-24 Texas Instruments Incorporated Temporal decorrelation method for robust speaker verification
GB9105367D0 (en) 1991-03-13 1991-04-24 Univ Strathclyde Computerised information-retrieval database systems
EP0505621A3 (en) 1991-03-28 1993-06-02 International Business Machines Corporation Improved message recognition employing integrated speech and handwriting information
US5212821A (en) 1991-03-29 1993-05-18 At&T Bell Laboratories Machine-based learning system
US5327342A (en) 1991-03-31 1994-07-05 Roy Prannoy L Method and apparatus for generating personalized handwriting
JP2970964B2 (ja) 1991-09-18 1999-11-02 株式会社日立製作所 監視装置
KR100318330B1 (ko) 1991-04-08 2002-04-22 가나이 쓰도무 감시장치
DE4113050A1 (de) * 1991-04-22 1992-10-29 Schiemann Harald Verfahren und vorrichtung zur akustischen steuerung
US5303406A (en) 1991-04-29 1994-04-12 Motorola, Inc. Noise squelch circuit with adaptive noise shaping
US5367640A (en) 1991-04-30 1994-11-22 Hewlett-Packard Company System for configuring an input/output board in a computer
US5274771A (en) 1991-04-30 1993-12-28 Hewlett-Packard Company System for configuring an input/output board in a computer
JP3123558B2 (ja) 1991-05-09 2001-01-15 ソニー株式会社 情報入力処理装置および方法
US5341466A (en) 1991-05-09 1994-08-23 New York University Fractal computer user centerface with zooming capability
US5202828A (en) 1991-05-15 1993-04-13 Apple Computer, Inc. User interface system having programmable user interface elements
US5500905A (en) 1991-06-12 1996-03-19 Microelectronics And Computer Technology Corporation Pattern recognition neural network with saccade-like operation
US5241619A (en) 1991-06-25 1993-08-31 Bolt Beranek And Newman Inc. Word dependent N-best search method
US5475587A (en) 1991-06-28 1995-12-12 Digital Equipment Corporation Method and apparatus for efficient morphological text analysis using a high-level language for compact specification of inflectional paradigms
US5293452A (en) 1991-07-01 1994-03-08 Texas Instruments Incorporated Voice log-in using spoken name input
US5442780A (en) 1991-07-11 1995-08-15 Mitsubishi Denki Kabushiki Kaisha Natural language database retrieval system using virtual tables to convert parsed input phrases into retrieval keys
US5477451A (en) 1991-07-25 1995-12-19 International Business Machines Corp. Method and system for natural language translation
US5687077A (en) 1991-07-31 1997-11-11 Universal Dynamics Limited Method and apparatus for adaptive control
JPH05197389A (ja) 1991-08-13 1993-08-06 Toshiba Corp 音声認識装置
US5278980A (en) 1991-08-16 1994-01-11 Xerox Corporation Iterative technique for phrase query formation and an information retrieval system employing same
US5450522A (en) 1991-08-19 1995-09-12 U S West Advanced Technologies, Inc. Auditory model for parametrization of speech
US5326270A (en) 1991-08-29 1994-07-05 Introspect Technologies, Inc. System and method for assessing an individual's task-processing style
US5199077A (en) 1991-09-19 1993-03-30 Xerox Corporation Wordspotting for voice editing and indexing
DE4131387A1 (de) 1991-09-20 1993-03-25 Siemens Ag Verfahren zur erkennung von mustern in zeitvarianten messsignalen
US5488727A (en) 1991-09-30 1996-01-30 International Business Machines Corporation Methods to support multimethod function overloading with compile-time type checking
JP2662120B2 (ja) 1991-10-01 1997-10-08 インターナショナル・ビジネス・マシーンズ・コーポレイション 音声認識装置および音声認識用処理ユニット
JPH05108065A (ja) 1991-10-15 1993-04-30 Kawai Musical Instr Mfg Co Ltd 自動演奏装置
JP3155577B2 (ja) 1991-10-16 2001-04-09 キヤノン株式会社 文字認識方法及び装置
US5222146A (en) 1991-10-23 1993-06-22 International Business Machines Corporation Speech recognition apparatus having a speech coder outputting acoustic prototype ranks
US5371853A (en) 1991-10-28 1994-12-06 University Of Maryland At College Park Method and system for CELP speech coding and codebook for use therewith
US5757979A (en) 1991-10-30 1998-05-26 Fuji Electric Co., Ltd. Apparatus and method for nonlinear normalization of image
KR940002854B1 (ko) 1991-11-06 1994-04-04 한국전기통신공사 음성 합성시스팀의 음성단편 코딩 및 그의 피치조절 방법과 그의 유성음 합성장치
US5386494A (en) 1991-12-06 1995-01-31 Apple Computer, Inc. Method and apparatus for controlling a speech recognition function using a cursor control device
JPH05165459A (ja) 1991-12-19 1993-07-02 Toshiba Corp 拡大表示方式
US5475796A (en) 1991-12-20 1995-12-12 Nec Corporation Pitch pattern generation apparatus
US6081750A (en) 1991-12-23 2000-06-27 Hoffberg; Steven Mark Ergonomic man-machine interface incorporating adaptive pattern recognition based control system
US5903454A (en) 1991-12-23 1999-05-11 Hoffberg; Linda Irene Human-factored interface corporating adaptive pattern recognition based controller apparatus
US5502790A (en) 1991-12-24 1996-03-26 Oki Electric Industry Co., Ltd. Speech recognition method and system using triphones, diphones, and phonemes
US5349645A (en) 1991-12-31 1994-09-20 Matsushita Electric Industrial Co., Ltd. Word hypothesizer for continuous speech decoding using stressed-vowel centered bidirectional tree searches
JPH05188994A (ja) 1992-01-07 1993-07-30 Sony Corp 騒音抑圧装置
US5392419A (en) 1992-01-24 1995-02-21 Hewlett-Packard Company Language identification system and method for a peripheral unit
US5357431A (en) 1992-01-27 1994-10-18 Fujitsu Limited Character string retrieval system using index and unit for making the index
US5274818A (en) 1992-02-03 1993-12-28 Thinking Machines Corporation System and method for compiling a fine-grained array based source program onto a course-grained hardware
US5267345A (en) 1992-02-10 1993-11-30 International Business Machines Corporation Speech recognition apparatus which predicts word classes from context and words from word classes
US5621806A (en) 1992-02-14 1997-04-15 Texas Instruments Incorporated Apparatus and methods for determining the relative displacement of an object
US5412735A (en) 1992-02-27 1995-05-02 Central Institute For The Deaf Adaptive noise reduction circuit for a sound reproduction system
ES2128390T3 (es) 1992-03-02 1999-05-16 At & T Corp Metodo de adiestramiento y dispositivo para reconocimiento de voz.
US6055514A (en) 1992-03-20 2000-04-25 Wren; Stephen Corey System for marketing foods and services utilizing computerized centraland remote facilities
US5353376A (en) 1992-03-20 1994-10-04 Texas Instruments Incorporated System and method for improved speech acquisition for hands-free voice telecommunication in a noisy environment
US5333266A (en) 1992-03-27 1994-07-26 International Business Machines Corporation Method and apparatus for message handling in computer systems
US5283818A (en) 1992-03-31 1994-02-01 Klausner Patent Technologies Telephone answering device linking displayed data with recorded audio message
US5757358A (en) 1992-03-31 1998-05-26 The United States Of America As Represented By The Secretary Of The Navy Method and apparatus for enhancing computer-user selection of computer-displayed objects through dynamic selection area and constant visual feedback
US5390236A (en) 1992-03-31 1995-02-14 Klausner Patent Technologies Telephone answering device linking displayed data with recorded audio message
CA2088080C (en) 1992-04-02 1997-10-07 Enrico Luigi Bocchieri Automatic speech recognizer
US5317647A (en) 1992-04-07 1994-05-31 Apple Computer, Inc. Constrained attribute grammars for syntactic pattern recognition
JPH05293126A (ja) 1992-04-15 1993-11-09 Matsushita Electric Works Ltd 歯科用フロス
US5412804A (en) 1992-04-30 1995-05-02 Oracle Corporation Extending the semantics of the outer join operator for un-nesting queries to a data base
US5745873A (en) 1992-05-01 1998-04-28 Massachusetts Institute Of Technology Speech recognition using final decision based on tentative decisions
US5369575A (en) 1992-05-15 1994-11-29 International Business Machines Corporation Constrained natural language interface for a computer system
US5377103A (en) 1992-05-15 1994-12-27 International Business Machines Corporation Constrained natural language interface for a computer that employs a browse function
US5293584A (en) 1992-05-21 1994-03-08 International Business Machines Corporation Speech recognition system for natural language translation
US5477447A (en) 1992-05-27 1995-12-19 Apple Computer, Incorporated Method and apparatus for providing computer-implemented assistance
US5463696A (en) 1992-05-27 1995-10-31 Apple Computer, Inc. Recognition system and method for user inputs to a computer system
US5434777A (en) 1992-05-27 1995-07-18 Apple Computer, Inc. Method and apparatus for processing natural language
US5390281A (en) 1992-05-27 1995-02-14 Apple Computer, Inc. Method and apparatus for deducing user intent and providing computer implemented services
US5734789A (en) 1992-06-01 1998-03-31 Hughes Electronics Voiced, unvoiced or noise modes in a CELP vocoder
JP2795058B2 (ja) 1992-06-03 1998-09-10 松下電器産業株式会社 時系列信号処理装置
US5543588A (en) 1992-06-08 1996-08-06 Synaptics, Incorporated Touch pad driven handheld computing device
US5502774A (en) 1992-06-09 1996-03-26 International Business Machines Corporation Automatic recognition of a consistent message using multiple complimentary sources of information
AU4013693A (en) 1992-06-16 1993-12-23 Honeywell Inc. A method for utilizing a low resolution touch screen system in a high resolution graphics environment
JPH064093A (ja) 1992-06-18 1994-01-14 Matsushita Electric Ind Co Ltd Hmm作成装置、hmm記憶装置、尤度計算装置及び、認識装置
US5333275A (en) 1992-06-23 1994-07-26 Wheatley Barbara J System and method for time aligning speech
US5325297A (en) 1992-06-25 1994-06-28 System Of Multiple-Colored Images For Internationally Listed Estates, Inc. Computer implemented method and system for storing and retrieving textual data and compressed image data
US5835732A (en) 1993-10-28 1998-11-10 Elonex Ip Holdings, Ltd. Miniature digital assistant having enhanced host communication
JPH0619965A (ja) 1992-07-01 1994-01-28 Canon Inc 自然言語処理装置
US5303308A (en) 1992-07-07 1994-04-12 Gn Netcom A/S Audio frequency signal compressing system
JP3230319B2 (ja) 1992-07-09 2001-11-19 ソニー株式会社 音響再生装置
US5625554A (en) 1992-07-20 1997-04-29 Xerox Corporation Finite-state transduction of related word forms for text indexing and retrieval
US5325462A (en) 1992-08-03 1994-06-28 International Business Machines Corporation System and method for speech synthesis employing improved formant composition
US5999908A (en) 1992-08-06 1999-12-07 Abelow; Daniel H. Customer-based product design module
JPH0669954A (ja) 1992-08-18 1994-03-11 Fujitsu Ltd メッセージ廃棄通達方式
GB9220404D0 (en) 1992-08-20 1992-11-11 Nat Security Agency Method of identifying,retrieving and sorting documents
US5412806A (en) 1992-08-20 1995-05-02 Hewlett-Packard Company Calibration of logical cost formulae for queries in a heterogeneous DBMS using synthetic database
US5305768A (en) 1992-08-24 1994-04-26 Product Development (Zgs) Ltd. Dental flosser units and method of making same
DE4229577A1 (de) 1992-09-04 1994-03-10 Daimler Benz Ag Verfahren zur Spracherkennung mit dem eine Anpassung von Mikrofon- und Sprachcharakteristiken erreicht wird
US5425108A (en) 1992-09-04 1995-06-13 Industrial Technology Research Institute Mobile type of automatic identification system for a car plate
US5333236A (en) 1992-09-10 1994-07-26 International Business Machines Corporation Speech recognizer having a speech coder for an acoustic match based on context-dependent speech-transition acoustic models
US5982352A (en) 1992-09-18 1999-11-09 Pryor; Timothy R. Method for providing human input to a computer
US5384893A (en) 1992-09-23 1995-01-24 Emerson & Stern Associates, Inc. Method and apparatus for speech synthesis based on prosodic analysis
FR2696036B1 (fr) 1992-09-24 1994-10-14 France Telecom Procédé de mesure de ressemblance entre échantillons sonores et dispositif de mise en Óoeuvre de ce procédé.
JPH0772840B2 (ja) 1992-09-29 1995-08-02 日本アイ・ビー・エム株式会社 音声モデルの構成方法、音声認識方法、音声認識装置及び音声モデルの訓練方法
JP2779886B2 (ja) 1992-10-05 1998-07-23 日本電信電話株式会社 広帯域音声信号復元方法
JP2851977B2 (ja) 1992-10-14 1999-01-27 シャープ株式会社 再生装置
US5758313A (en) 1992-10-16 1998-05-26 Mobile Information Systems, Inc. Method and apparatus for tracking vehicle location
US5353374A (en) 1992-10-19 1994-10-04 Loral Aerospace Corporation Low bit rate voice transmission for use in a noisy environment
US6092043A (en) 1992-11-13 2000-07-18 Dragon Systems, Inc. Apparatuses and method for training and operating speech recognition systems
US5636325A (en) 1992-11-13 1997-06-03 International Business Machines Corporation Speech synthesis and analysis of dialects
US5920837A (en) 1992-11-13 1999-07-06 Dragon Systems, Inc. Word recognition system which stores two models for some words and allows selective deletion of one such model
EP0598598B1 (en) 1992-11-18 2000-02-02 Canon Information Systems, Inc. Text-to-speech processor, and parser for use in such a processor
US5455888A (en) 1992-12-04 1995-10-03 Northern Telecom Limited Speech bandwidth extension method and apparatus
US8073695B1 (en) 1992-12-09 2011-12-06 Adrea, LLC Electronic book with voice emulation features
US7835989B1 (en) 1992-12-09 2010-11-16 Discovery Communications, Inc. Electronic book alternative delivery systems
US5465401A (en) 1992-12-15 1995-11-07 Texas Instruments Incorporated Communication system and methods for enhanced information transfer
US5335276A (en) 1992-12-16 1994-08-02 Texas Instruments Incorporated Communication system and methods for enhanced information transfer
WO1994014270A1 (en) 1992-12-17 1994-06-23 Bell Atlantic Network Services, Inc. Mechanized directory assistance
US5533182A (en) 1992-12-22 1996-07-02 International Business Machines Corporation Aural position indicating mechanism for viewable objects
US5412756A (en) 1992-12-22 1995-05-02 Mitsubishi Denki Kabushiki Kaisha Artificial intelligence software shell for plant operation simulation
EP0664025B1 (en) 1992-12-23 1997-04-23 Otlc Object oriented framework system
US5373566A (en) 1992-12-24 1994-12-13 Motorola, Inc. Neural network-based diacritical marker recognition system and method
FR2700055B1 (fr) 1992-12-30 1995-01-27 Sextant Avionique Procédé de débruitage vectoriel de la parole et dispositif de mise en Óoeuvre.
US6311157B1 (en) 1992-12-31 2001-10-30 Apple Computer, Inc. Assigning meanings to utterances in a speech recognition system
US5384892A (en) 1992-12-31 1995-01-24 Apple Computer, Inc. Dynamic language model for speech recognition
US5463725A (en) 1992-12-31 1995-10-31 International Business Machines Corp. Data processing system graphical user interface which emulates printed material
US5390279A (en) 1992-12-31 1995-02-14 Apple Computer, Inc. Partitioning speech rules by context for speech recognition
US5613036A (en) 1992-12-31 1997-03-18 Apple Computer, Inc. Dynamic categories for a speech recognition system
US5734791A (en) 1992-12-31 1998-03-31 Apple Computer, Inc. Rapid tree-based method for vector quantization
US5335011A (en) 1993-01-12 1994-08-02 Bell Communications Research, Inc. Sound localization system for teleconferencing using self-steering microphone arrays
JP2752309B2 (ja) 1993-01-19 1998-05-18 松下電器産業株式会社 表示装置
US5490234A (en) 1993-01-21 1996-02-06 Apple Computer, Inc. Waveform blending technique for text-to-speech system
US5642466A (en) 1993-01-21 1997-06-24 Apple Computer, Inc. Intonation adjustment in text-to-speech systems
US5878396A (en) 1993-01-21 1999-03-02 Apple Computer, Inc. Method and apparatus for synthetic speech in facial animation
US6122616A (en) 1993-01-21 2000-09-19 Apple Computer, Inc. Method and apparatus for diphone aliasing
EP0609030B1 (en) 1993-01-26 1999-06-09 Sun Microsystems, Inc. Method and apparatus for browsing information in a computer database
US5491758A (en) 1993-01-27 1996-02-13 International Business Machines Corporation Automatic handwriting recognition using both static and dynamic parameters
US5890122A (en) 1993-02-08 1999-03-30 Microsoft Corporation Voice-controlled computer simulateously displaying application menu and list of available commands
US5449368A (en) 1993-02-18 1995-09-12 Kuzmak; Lubomyr I. Laparoscopic adjustable gastric banding device and method for implantation and removal thereof
US5864844A (en) 1993-02-18 1999-01-26 Apple Computer, Inc. System and method for enhancing a user interface with a computer based training tool
US5473728A (en) 1993-02-24 1995-12-05 The United States Of America As Represented By The Secretary Of The Navy Training of homoscedastic hidden Markov models for automatic speech recognition
US5467425A (en) 1993-02-26 1995-11-14 International Business Machines Corporation Building scalable N-gram language models using maximum likelihood maximum entropy N-gram models
CA2091658A1 (en) 1993-03-15 1994-09-16 Matthew Lennig Method and apparatus for automation of directory assistance using speech recognition
CA2119397C (en) 1993-03-19 2007-10-02 Kim E.A. Silverman Improved automated voice synthesis employing enhanced prosodic treatment of text, spelling of text and rate of annunciation
JPH06274586A (ja) 1993-03-22 1994-09-30 Mitsubishi Electric Corp 表示方式
US6055531A (en) 1993-03-24 2000-04-25 Engate Incorporated Down-line transcription system having context sensitive searching capability
EP0691023B1 (en) 1993-03-26 1999-09-29 BRITISH TELECOMMUNICATIONS public limited company Text-to-waveform conversion
US5536902A (en) 1993-04-14 1996-07-16 Yamaha Corporation Method of and apparatus for analyzing and synthesizing a sound by extracting and controlling a sound parameter
US5444823A (en) 1993-04-16 1995-08-22 Compaq Computer Corporation Intelligent search engine for associated on-line documentation having questionless case-based knowledge base
US6496793B1 (en) 1993-04-21 2002-12-17 Borland Software Corporation System and methods for national language support with embedded locale-specific language driver identifiers
CA2095452C (en) 1993-05-04 1997-03-18 Phillip J. Beaudet Dynamic hierarchical selection menu
US5428731A (en) 1993-05-10 1995-06-27 Apple Computer, Inc. Interactive multimedia delivery engine
US5860064A (en) 1993-05-13 1999-01-12 Apple Computer, Inc. Method and apparatus for automatic generation of vocal emotion in a synthetic text-to-speech system
DE69432199T2 (de) 1993-05-24 2004-01-08 Sun Microsystems, Inc., Mountain View Graphische Benutzerschnittstelle mit Verfahren zur Schnittstellebildung mit fernsteuernden Einrichtungen
US5652897A (en) 1993-05-24 1997-07-29 Unisys Corporation Robust language processor for segmenting and parsing-language containing multiple instructions
JPH06332617A (ja) 1993-05-25 1994-12-02 Pfu Ltd タッチパネル入力装置における表示方法
US5710922A (en) 1993-06-02 1998-01-20 Apple Computer, Inc. Method for synchronizing and archiving information between computer systems
WO1994029788A1 (en) 1993-06-15 1994-12-22 Honeywell Inc. A method for utilizing a low resolution touch screen system in a high resolution graphics environment
KR950001695A (ko) 1993-06-18 1995-01-03 오오가 노리오 디스크 재생장치
US5574823A (en) 1993-06-23 1996-11-12 Her Majesty The Queen In Right Of Canada As Represented By The Minister Of Communications Frequency selective harmonic coding
US5481739A (en) 1993-06-23 1996-01-02 Apple Computer, Inc. Vector quantization using thresholds
JPH0756933A (ja) 1993-06-24 1995-03-03 Xerox Corp 文書検索方法
US5515475A (en) 1993-06-24 1996-05-07 Northern Telecom Limited Speech recognition method using a two-pass search
JP3685812B2 (ja) 1993-06-29 2005-08-24 ソニー株式会社 音声信号送受信装置
JP2648558B2 (ja) 1993-06-29 1997-09-03 インターナショナル・ビジネス・マシーンズ・コーポレイション 情報選択装置及び情報選択方法
US5860075A (en) 1993-06-30 1999-01-12 Matsushita Electric Industrial Co., Ltd. Document data filing apparatus for generating visual attribute values of document data to be filed
US5794207A (en) 1996-09-04 1998-08-11 Walker Asset Management Limited Partnership Method and apparatus for a cryptographically assisted commercial network system designed to facilitate buyer-driven conditional purchase offers
US5973676A (en) 1993-06-30 1999-10-26 Kabushiki Kaisha Toshiba Input apparatus suitable for portable electronic device
WO1995002221A1 (en) 1993-07-07 1995-01-19 Inference Corporation Case-based organizing and querying of a database
JPH0736882A (ja) 1993-07-19 1995-02-07 Fujitsu Ltd 辞書検索装置
US5818182A (en) 1993-08-13 1998-10-06 Apple Computer, Inc. Removable media ejection system
US5495604A (en) 1993-08-25 1996-02-27 Asymetrix Corporation Method and apparatus for the modeling and query of database structures using natural language-like constructs
US5619694A (en) 1993-08-26 1997-04-08 Nec Corporation Case database storage/retrieval system
US5940811A (en) 1993-08-27 1999-08-17 Affinity Technology Group, Inc. Closed loop financial transaction method and apparatus
US5377258A (en) 1993-08-30 1994-12-27 National Medical Research Council Method and apparatus for an automated and interactive behavioral guidance system
US5627939A (en) 1993-09-03 1997-05-06 Microsoft Corporation Speech recognition system and method employing data compression
US5500937A (en) 1993-09-08 1996-03-19 Apple Computer, Inc. Method and apparatus for editing an inked object while simultaneously displaying its recognized object
US5568540A (en) 1993-09-13 1996-10-22 Active Voice Corporation Method and apparatus for selecting and playing a voice mail message
US5689641A (en) 1993-10-01 1997-11-18 Vicor, Inc. Multimedia collaboration system arrangement for routing compressed AV signal through a participant site without decompressing the AV signal
US6594688B2 (en) 1993-10-01 2003-07-15 Collaboration Properties, Inc. Dedicated echo canceler for a workstation
US5873056A (en) 1993-10-12 1999-02-16 The Syracuse University Natural language processing system for semantic vector representation which accounts for lexical ambiguity
JP2986345B2 (ja) 1993-10-18 1999-12-06 インターナショナル・ビジネス・マシーンズ・コーポレイション 音声記録指標化装置及び方法
US5708659A (en) 1993-10-20 1998-01-13 Lsi Logic Corporation Method for hashing in a packet network switching system
JP3697276B2 (ja) 1993-10-27 2005-09-21 ゼロックス コーポレイション 画像ディスプレイ方法及び画像ディスプレイ装置並びに画像スケーリング方法
US5422656A (en) 1993-11-01 1995-06-06 International Business Machines Corp. Personal communicator having improved contrast control for a liquid crystal, touch sensitive display
JP2813728B2 (ja) 1993-11-01 1998-10-22 インターナショナル・ビジネス・マシーンズ・コーポレイション ズーム/パン機能付パーソナル通信機
US5977950A (en) 1993-11-29 1999-11-02 Motorola, Inc. Manually controllable cursor in a virtual image
WO1995016950A1 (en) 1993-12-14 1995-06-22 Apple Computer, Inc. Method and apparatus for transferring data between a computer and a peripheral storage device
US5578808A (en) 1993-12-22 1996-11-26 Datamark Services, Inc. Data card that can be used for transactions involving separate card issuers
US5384671A (en) 1993-12-23 1995-01-24 Quantum Corporation PRML sampled data channel synchronous servo detector
US5537618A (en) 1993-12-23 1996-07-16 Diacom Technologies, Inc. Method and apparatus for implementing user feedback
JP2610114B2 (ja) 1993-12-30 1997-05-14 インターナショナル・ビジネス・マシーンズ・コーポレイション ポインティング・システム、コンピュータ・システムおよび力応答方法
US5621859A (en) 1994-01-19 1997-04-15 Bbn Corporation Single tree method for grammar directed, very large vocabulary speech recognizer
US5577164A (en) 1994-01-28 1996-11-19 Canon Kabushiki Kaisha Incorrect voice command recognition prevention and recovery processing method and apparatus
US5583993A (en) 1994-01-31 1996-12-10 Apple Computer, Inc. Method and apparatus for synchronously sharing data among computer
US5577135A (en) 1994-03-01 1996-11-19 Apple Computer, Inc. Handwriting signal processing front-end for handwriting recognizers
AU684872B2 (en) 1994-03-10 1998-01-08 Cable And Wireless Plc Communication system
US5548507A (en) 1994-03-14 1996-08-20 International Business Machines Corporation Language identification process using coded language words
US5724406A (en) 1994-03-22 1998-03-03 Ericsson Messaging Systems, Inc. Call processing system and method for providing a variety of messaging services
US5584024A (en) 1994-03-24 1996-12-10 Software Ag Interactive database query system and method for prohibiting the selection of semantically incorrect query parameters
US5574824A (en) 1994-04-11 1996-11-12 The United States Of America As Represented By The Secretary Of The Air Force Analysis/synthesis-based microphone array speech enhancer with variable signal distortion
CH689410A5 (de) 1994-04-21 1999-03-31 Info Byte Ag Verfahren und Vorrichtung zur sprachgesteuerten Fernbedienung elektrischer Verbraucher.
GB9408042D0 (en) 1994-04-22 1994-06-15 Hewlett Packard Co Device for managing voice data
US5642519A (en) 1994-04-29 1997-06-24 Sun Microsystems, Inc. Speech interpreter with a unified grammer compiler
US5670985A (en) 1994-05-09 1997-09-23 Apple Computer, Inc. System and method for adjusting the output of an output device to compensate for ambient illumination
US5786803A (en) 1994-05-09 1998-07-28 Apple Computer, Inc. System and method for adjusting the illumination characteristics of an output device
US5828768A (en) 1994-05-11 1998-10-27 Noise Cancellation Technologies, Inc. Multimedia personal computer with active noise reduction and piezo speakers
US5596260A (en) 1994-05-13 1997-01-21 Apple Computer, Inc. Apparatus and method for determining a charge of a battery
JPH07320079A (ja) 1994-05-20 1995-12-08 Nippon Telegr & Teleph Corp <Ntt> 図形の部分拡大表示方法及び図形の部分拡大表示装置
JPH07320051A (ja) 1994-05-20 1995-12-08 Nippon Telegr & Teleph Corp <Ntt> 図形の任意領域拡大縮小表示方法及び図形の任意領域拡大縮小表示装置
EP0684607B1 (en) 1994-05-25 2001-03-14 Victor Company Of Japan, Limited Variable transfer rate data reproduction apparatus
JPH07325591A (ja) 1994-05-31 1995-12-12 Nec Corp 疑似音楽演奏環境生成方法および装置
US5537317A (en) 1994-06-01 1996-07-16 Mitsubishi Electric Research Laboratories Inc. System for correcting grammer based parts on speech probability
US5535121A (en) 1994-06-01 1996-07-09 Mitsubishi Electric Research Laboratories, Inc. System for correcting auxiliary verb sequences
US5477448A (en) 1994-06-01 1995-12-19 Mitsubishi Electric Research Laboratories, Inc. System for correcting improper determiners
US5485372A (en) 1994-06-01 1996-01-16 Mitsubishi Electric Research Laboratories, Inc. System for underlying spelling recovery
US5521816A (en) 1994-06-01 1996-05-28 Mitsubishi Electric Research Laboratories, Inc. Word inflection correction system
US5644656A (en) 1994-06-07 1997-07-01 Massachusetts Institute Of Technology Method and apparatus for automated text recognition
US5493677A (en) 1994-06-08 1996-02-20 Systems Research & Applications Corporation Generation, archiving, and retrieval of digital images with evoked suggestion-set captions and natural language interface
US5812697A (en) 1994-06-10 1998-09-22 Nippon Steel Corporation Method and apparatus for recognizing hand-written characters using a weighting dictionary
US5675819A (en) 1994-06-16 1997-10-07 Xerox Corporation Document information retrieval using global word co-occurrence patterns
JPH0869470A (ja) 1994-06-21 1996-03-12 Canon Inc 自然言語処理装置及びその方法
US5948040A (en) 1994-06-24 1999-09-07 Delorme Publishing Co. Travel reservation information and planning system
US5610812A (en) 1994-06-24 1997-03-11 Mitsubishi Electric Information Technology Center America, Inc. Contextual tagger utilizing deterministic finite state transducer
US5581484A (en) 1994-06-27 1996-12-03 Prince; Kevin R. Finger mounted computer input device
EP0769175B9 (en) 1994-07-01 2005-01-12 Palm Computing, Inc. Multiple pen stroke character set and handwriting recognition system
US6442523B1 (en) 1994-07-22 2002-08-27 Steven H. Siegel Method for the auditory navigation of text
CN1059303C (zh) 1994-07-25 2000-12-06 国际商业机器公司 在个人通讯设备的显示屏幕上标记文本的装置和方法
US5568536A (en) 1994-07-25 1996-10-22 International Business Machines Corporation Selective reconfiguration method and apparatus in a multiple application personal communications device
JP3359745B2 (ja) 1994-07-29 2002-12-24 シャープ株式会社 動画像再生装置、及び動画像記録装置
US5907597A (en) * 1994-08-05 1999-05-25 Smart Tone Authentication, Inc. Method and system for the secure communication of data
US5764852A (en) 1994-08-16 1998-06-09 International Business Machines Corporation Method and apparatus for speech recognition for distinguishing non-speech audio input events from speech audio input events
JP3586777B2 (ja) 1994-08-17 2004-11-10 富士通株式会社 音声入力装置
JP3565453B2 (ja) 1994-08-23 2004-09-15 キヤノン株式会社 画像入出力装置
US6137476A (en) 1994-08-25 2000-10-24 International Business Machines Corp. Data mouse
JPH0877173A (ja) 1994-09-01 1996-03-22 Fujitsu Ltd 文字列修正システムとその方法
US5559301A (en) 1994-09-15 1996-09-24 Korg, Inc. Touchscreen interface having pop-up variable adjustment displays for controllers and audio processing systems
DE69524340T2 (de) 1994-09-22 2002-08-14 Aisin Aw Co Berührungsanzeige für ein Informationseingabesystem
GB9419388D0 (en) 1994-09-26 1994-11-09 Canon Kk Speech analysis
JP3027321B2 (ja) 1994-09-27 2000-04-04 財団法人工業技術研究院 拘束のない手書き英数字のオンライン認識の方法及び装置
US5799268A (en) 1994-09-28 1998-08-25 Apple Computer, Inc. Method for extracting knowledge from online documentation and creating a glossary, index, help database or the like
IT1266943B1 (it) 1994-09-29 1997-01-21 Cselt Centro Studi Lab Telecom Procedimento di sintesi vocale mediante concatenazione e parziale sovrapposizione di forme d'onda.
US5682539A (en) 1994-09-29 1997-10-28 Conrad; Donovan Anticipated meaning natural language interface
GB2293667B (en) 1994-09-30 1998-05-27 Intermation Limited Database management system
US5715468A (en) 1994-09-30 1998-02-03 Budzinski; Robert Lucius Memory system for storing and retrieving experience and knowledge with natural language
US5777614A (en) 1994-10-14 1998-07-07 Hitachi, Ltd. Editing support system including an interactive interface
US5661787A (en) 1994-10-27 1997-08-26 Pocock; Michael H. System for on-demand remote access to a self-generating audio recording, storage, indexing and transaction system
US5845255A (en) 1994-10-28 1998-12-01 Advanced Health Med-E-Systems Corporation Prescription management system