KR102581837B1 - 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법 - Google Patents

뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법 Download PDF

Info

Publication number
KR102581837B1
KR102581837B1 KR1020237018549A KR20237018549A KR102581837B1 KR 102581837 B1 KR102581837 B1 KR 102581837B1 KR 1020237018549 A KR1020237018549 A KR 1020237018549A KR 20237018549 A KR20237018549 A KR 20237018549A KR 102581837 B1 KR102581837 B1 KR 102581837B1
Authority
KR
South Korea
Prior art keywords
active word
sound data
active
algorithm
candidate
Prior art date
Application number
KR1020237018549A
Other languages
English (en)
Other versions
KR20230085214A (ko
Inventor
조아힘 패이버그
다니엘 지아코벨로
클라우스 할텅
Original Assignee
소노스 인코포레이티드
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by 소노스 인코포레이티드 filed Critical 소노스 인코포레이티드
Priority to KR1020237031855A priority Critical patent/KR20230145195A/ko
Publication of KR20230085214A publication Critical patent/KR20230085214A/ko
Application granted granted Critical
Publication of KR102581837B1 publication Critical patent/KR102581837B1/ko

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/28Constructional details of speech recognition systems
    • G10L15/30Distributed recognition, e.g. in client-server systems, for mobile phones or network applications
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/04Segmentation; Word boundary detection
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/08Speech classification or search
    • G10L15/14Speech classification or search using statistical models, e.g. Hidden Markov Models [HMMs]
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/08Speech classification or search
    • G10L15/16Speech classification or search using artificial neural networks
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/28Constructional details of speech recognition systems
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/28Constructional details of speech recognition systems
    • G10L15/32Multiple recognisers used in sequence or in parallel; Score combination systems therefor, e.g. voting systems
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L17/00Speaker identification or verification techniques
    • G10L17/26Recognition of special voice characteristics, e.g. for use in lie detectors; Recognition of animal voices
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/78Detection of presence or absence of voice signals
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/08Speech classification or search
    • G10L2015/088Word spotting
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • G10L2015/223Execution procedure of a spoken command

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Health & Medical Sciences (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Computational Linguistics (AREA)
  • Artificial Intelligence (AREA)
  • Evolutionary Computation (AREA)
  • Theoretical Computer Science (AREA)
  • Signal Processing (AREA)
  • Probability & Statistics with Applications (AREA)
  • Biomedical Technology (AREA)
  • Mathematical Physics (AREA)
  • Biophysics (AREA)
  • Data Mining & Analysis (AREA)
  • General Health & Medical Sciences (AREA)
  • Molecular Biology (AREA)
  • Computing Systems (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Software Systems (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Selective Calling Equipment (AREA)
  • User Interface Of Digital Computer (AREA)
  • Circuit For Audible Band Transducer (AREA)
  • Telephonic Communication Services (AREA)
  • Feedback Control In General (AREA)
  • Radar Systems Or Details Thereof (AREA)

Abstract

미디어 재생 시스템을 통하여 미디어를 재생하기 위한 시스템 및 방법은 네트워크 마이크로폰 장치를 통하여 사운드 데이터를 캡쳐하는 단계와 사운드 데이터 내 후보 활성 단어를 식별하는 단계를 포함한다. 사운드 데이터 내 후보 활성 단어의 식별에 기초하여, 시스템은 복수의 활성 단어 엔진으로부터 제1 활성 단어 엔진을 선택한다.
제1 활성 단어 엔진을 통하여, 시스템은 사운드 데이터를 분석하여 확인된 활성 단어를 검출하고, 제1 활성 단어 엔진이 확인된 활성 단어를 검출하는 것에 응답하여, 음성 지원 서비스와 연관된 하나 이상의 원격 컴퓨팅 장치로 상기 사운드 데이터의 음성 발화를 전송한다.

Description

뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법 {SYSTEMS AND METHODS FOR SELECTIVE WAKE WORD DETECTION USING NEURAL NETWORK MODELS}
본 출원은 그 전체가 여기에서 참조로서 포함된 2018년 9월 28일에 출원된 미국 특허 출원 제16/145,275호에 대한 우선권을 주장한다.
현재 기술은 소비재, 특히 음성 제어가능 미디어 재생 시스템 또는 그 일부 양상에 관한 방법, 시스템, 제품, 특징, 서비스 및 기타 요소에 관련된다.
2003년 소노스 사(SONOS, Inc.)가 그 최초 특허 출원 중 하나인 "다수의 네트워킹된 장치들 사이의 오디오 재생을 동기화하기 위한 방법(Method for Synchronizing Audio Playback between Multiple Networked Devices)"을 출원하고 2005년 미디어 재생 시스템을 판매 제공하기 시작하기까지 소리를 내는 환경(out-loud setting)에서 디지털 오디오를 액세스하고 듣기 위한 옵션은 제한적이었다. 소노스 무선 하이파이 시스템(Sonos Wireless HiFi System)은 사람들로 하여금 하나 이상의 네트워킹된 재생 장치를 통하여 많은 소스로부터 음악을 경험하는 것을 가능하게 한다. 스마트폰, 태블릿 또는 컴퓨터 상에 설치된 소프트웨어 제어 애플리케이션을 통하여, 네트워킹된 재생 장치를 가지는 임의의 공간에서 원하는 것을 재생할 수 있다. 또한, 컨트롤러를 사용하여, 예컨대 다양한 노래가 재생 장치를 가지는 각각의 공간에서 스트리밍될 수 있거나, 공간이 동기 재생을 위해 함께 그룹화될 수 있거나, 같은 노래가 모든 공간에서 동시에 들릴 수 있다.
계속 성장하는 디지털 미디어에 대한 관심을 고려하여 볼 때, 청취 경험을 더 향상시키기 위해 소비자 접근 가능 기술을 개발할 필요가 계속 있다.
여기에 개시된 기술의 특징, 태양 및 이점은 이하의 설명, 첨부된 청구범위 및 첨부 도면과 관련하여 더 잘 이해될 수 있다.
도 1a는 개시된 기술의 양상에 따라서 구성된 미디어 재생 시스템을 가지는 환경의 부분적인 절단도이다.
도 1b는 하나 이상의 네트워크와 도 1a의 미디어 재생 시스템의 개략도이다.
도 2a는 예시적인 재생 장치의 기능적 블록도이다.
도 2b는 도 2a의 재생 장치의 예시적인 하우징의 등각도이다.
도 3a-3e는 본 개시의 양상에 따라 예시적인 재생 장치 구성을 도시하는 도면이다.
도 4a는 본 개시의 양상에 따른 예시적인 컨트롤러 장치의 기능적인 블록도이다.
도 4b 및 도 4c는 본 개시의 양상에 따른 컨트롤러 인터페이스이다.
도 5는 본 개시의 양상에 따라서 예시적인 네트워크 마이크로폰 장치의 일부 컴포넌트의 기능적인 블록도이다.
도 6a는 예시적인 음성 입력의 도면이다.
도 6b는 본 개시의 양상에 따른 사운드 견본을 나타내는 그래프이다.
도 7은 본 개시의 양상에 따른 2 단계 활성 단어 검출에 대한 예시적인 방법의 흐름도이다.
도 8은 본 개시의 양상에 따른 키워드 스포팅과 선택에 대한 모델을 생성하기 위한 시스템의 기능적 블록도이다.
도 9는 본 개시의 양상에 따라 소프트-가중치 공유를 통하여 압축 전후 뉴럴 네트워크 모델에 대한 가중치의 로그 가중치 분포를 예시하는 차트이다.
도 10은 본 개시의 양상에 따른 뉴럴 네트워크 모델의 압축형 스파스 로우 표현의 예시를 예시한다.
도면은 예시적인 실시예를 예시하기 위한 것이나, 도면에 도시된 배열 및 수단에 발명이 제한되지 않음이 이해될 것이다. 도면에서, 동일한 참조 번호는 적어도 일반적으로 유사한 요소를 식별한다. 임의의 특정 요소의 논의를 용이하게 하도록, 임의의 참조 번호 중 최상위 숫자는 요소가 처음 소개된 도면을 언급한다. 예를 들어, 요소 103a는 도 1a에 관련하여 처음 소개되고 논의된다.
I. 개요
음성 제어는 무선 오디오 재생 장치, 조명 장치 및 가정-자동화 장치(예컨대, 온도조절기, 도어락 등)와 같은 통신 네트워크와 연결되는 장치 및 스마트 가전을 포함하는 "스마트" 홈에서 유익할 수 있다. 일부 구현예에서, 네트워크 마이크로폰 장치는 스마트 홈 장치를 제어하는 데 사용될 수 있다.
네트워크 마이크로폰 장치("NMD")는 보통 마이크로폰 어레이와 같은 마이크로폰의 배열을 포함하는 네트워킹된 컴퓨팅 장치이고, NMD의 환경에 존재하는 사운드를 검출하도록 구성된다. 검출된 사운드는 배경 잡음(예컨대, 재생 장치에 의해 출력되는 음악 또는 다른 주위 소음)과 혼합된 사람의 회화를 포함할 수 있다. 실시에서, NMD는 보통 검출된 사운드를 걸러 사람의 회화로부터 배경 잡음을 제거하여 회화가 음성 제어를 나타내는 음성 입력을 포함하는지 여부를 식별하는 것을 용이하게 한다. 그런 경우, NMD는 그러한 음성 입력에 기초하여 동작을 취할 수 있다.
NMD는 보통 NMD에 내장된 활성 단어 엔진(wake-word engine)을 종종 이용하여 NMD에 의해 검출된 사운드가 특정 활성 단어를 포함하는 음성 입력을 포함하는지 여부를 식별한다. 활성 단어 엔진은 하나 이상의 식별 알고리즘을 사용하여 특정 활성 단어를 식별(즉, "스폿") 하도록 구성될 수 있다. 활성 단어 식별 프로세스는 흔히 "키워드 스포팅"이라고 지칭된다. 실시에서, 키워드 스포팅을 용이하게 하는 데 도움 주도록, NMD는 NMD의 마이크로폰에 의해 검출된 사운드를 버퍼링할 수 있고, 이후 활성 단어 엔진을 사용하여 버퍼링된 사운드를 프로세싱하여 활성 단어가 존재하는지 여부를 결정할 수 있다.
활성 단어 엔진이 검출된 사운드에서 활성 단어를 스폿하는 경우, NMD는 NMD가 잠재적인 음성 입력을 포함하는 사운드를 검출했음을 나타내는 활성 단어 이벤트(즉, "활성 단어 트리거")가 발생했음을 결정할 수 있다. 활성 단어 이벤트의 발생은 보통 NMD로 하여금 검출된 사운드를 수반하는 추가적인 프로세스를 수행하도록 한다. 일부 구현예에서, 추가적인 프로세스는, 다른 가능한 추가적인 프로세스 중에서도, 활성 단어가 식별되는 것을 나타내는 경보(예컨대, 가청 소리 및/또는 광 표시)를 출력하고 버퍼로부터 검출된 사운드 데이터를 추출하는 것을 포함할 수 있다. 검출된 사운드를 추출하는 것은 특정 포맷에 따라 검출된 사운드의 스트림을 판독하고 패키징(packaging)하는 것과 패키징된 사운드 데이터를 해석을 위한 적절한 음성 지원 서비스(VAS)로 전송하는 것을 포함할 수 있다.
결국, 활성 단어 엔진에 의해 식별된 활성 단어에 대응하는 VAS는 통신 네트워크를 지나 NMD로부터 전송된 사운드 데이터를 수신한다. VAS는 종래에는 음성 입력을 프로세싱하도록 구성된 하나 이상의 클라우드 서버를 사용하여 구현된 원격 서비스의 형태(예컨대, 아마존의 알렉사, 애플의 시리, 마이크로소프트의 콜타나, 구글의 어시스턴트 등)를 취한다. 일부 경우에서, VAS의 일부 컴포넌트와 기능은 로컬과 원격 장치에 전체에 걸쳐에 분배될 수 있다. 추가적으로 또는 대안적으로, VAS는 NMD를 포함하는 미디어 재생 시스템 또는 NMD에 구현된 로컬 서비스의 형태를 취하여 음성 입력 또는 일부 유형의 음성 입력(예컨대, 기초적인 명령)이 원격 VAS로부터의 개입없이 로컬로 프로세싱될 수 있다.
임의의 경우에서, VAS가 검출된 사운드 데이터를 수신하는 경우, VAS는 보통 이러한 데이터를 프로세싱할 것이며, 이는 음성 입력을 식별하고 음성 입력에서 캡쳐된 단어의 의도를 결정하는 것을 수반한다. VAS는 이후 결정된 의도에 따라 일부 명령어와 함께 NMD로 응답을 제공할 수 있다. 그 명령어에 기초하여, NMD는 하나 이상의 스마트 장치로 하여금 동작을 수행하도록 할 수 있다. 예를 들어, VAS로부터의 명령어에 따라, NMD는 재생 장치로 하여금, 다른 예시 중에서도, 특정 노래를 재생하거나 조명 장치를 켜고 끄도록 할 수 있다. 일부 경우에서, NMD 또는 NMD를 가진 미디어 시스템(예컨대, NMD 구비형 재생 장치를 가지는 미디어 재생 장치 시스템)은 복수의 VAS들과 상호작용하도록 구성될 수 있다. 실시에서, NMD는 NMD에 의해 검출된 사운드에서 식별된 특정 활성 단어에 더 기초하여 하나의 VAS를 선택할 수 있다.
일부 구현예에서, 네트워킹된 미디어 재생 시스템의 일부인 재생 장치는 NMD의 기능 및 컴포넌트를 포함할 수 있다(즉, 재생 장치는 "NMD를 구비"한 것임). 이러한 양상에서, 그러한 재생 장치는 사람들의 대화와 같이 재생 장치의 환경에 존재하는 사운드, 재생 장치 자체 또는 인근에 있는 다른 재생 장치에 의해 출력되는 오디오 또는 다른 주위의 소음을 검출하도록 구성되는 마이크로폰을 포함할 수 있고, 또한 활성 단어 식별을 용이하게 하도록 검출된 사운드를 버퍼링하기 위한 컴포넌트를 포함할 수 있다.
일부 NMD 구비형 재생 장치는 재생 장치가 벽 전기 콘센트 등에 물리적으로 연결되지 않으면서 동작하는 것을 허용하는 내부 전력 소스(예컨대, 충전지)를 포함할 수 있다. 이러한 점에서, 그러한 재생 장치는 여기에서 "휴대용 재생 장치"로 지칭될 수 있다. 한편, 벽 전기 콘센트 등으로부터의 전력에 의존하도록 구성되는 재생 장치가 여기에서 "고정 재생 장치"로 지칭될 수 있으나 그러한 장치는 사실 집 또는 다른 환경 주변에서 움직일 수 있다. 실시에서, 사람은 종종 하나 이상의 고정 재생 장치가 남아 있는 집 또는 다른 환경으로 그리고 그로부터 휴대용 재생 장치를 가지고 갈 수 있다.
일부 경우에, 다수의 음성 서비스는 NMD 또는 NMD의 시스템(예컨대, 재생 장치의 미디어 재생 시스템)에 대해 구성된다. 하나 이상의 서비스는 셋업(set-up) 절차동안 구성될 수 있고, 추가적 음성 서비스가 나중에 시스템을 위해 구성될 수 있다. 이와 같이, NMD는 다수의 음성 서비스와의 인터페이스로서 역할을 하여, 아마도 각 음성 서비스와 상호작용하도록 음성 서비스 각각으로부터 NMD를 가지도록 하는 요구를 완화한다. 또한, NMD는 소정의 음성 명령을 프로세싱하도록 가정에 존재하는 서비스-특정 NMD와 협력하여 동작할 수 있다.
둘 이상의 음성 서비스가 NMD에 대해 구성되는 경우, 특정 음성 서비스가 특정 음성 서비스에 대응하는 활성 단어의 발화에 의해 적용될 수 있다. 예를 들어, 아마존(AMAZON)을 쿼리함에 있어서, 사용자는 활성 단어 "알렉사"에 이어 음성 명령을 말할 수 있다. 다른 예시는 구글(GOOGLE)을 쿼리하기 위한 "오케이, 구글" 및 애플(APPLE)을 쿼리하기 위한 "헤이, 시리"를 포함한다.
일부 경우에서, 포괄적인 활성 단어는 NMD로의 음성 입력을 나타내는 데 사용될 수 있다. 일부 경우에서, 이는 임의의 특정 음성 서비스에 결부된 활성 단어 보다는 생산사-특정 활성 단어(예컨대, NMD가 SONOS 재생 장치인 경우 "헤이, 소노스")이다. 그러한 활성 단어가 주어지면, NMD는 특정 음성 서비스를 식별하여 요청을 프로세싱할 수 있다. 예를 들어, 활성 단어 이후 음성 입력이 특정 유형의 명령(예컨대, 음악 재생)에 관련된 경우, 음성 입력은 그러한 유형의 명령과 연관된 특정 음성 서비스(예컨대, 음성 명령 능력을 가지는 음악 서비스 스트리밍)로 송신된다.
키워드 스포팅은 사운드 데이터가 하나 이상의 키워드를 포함하는지 여부를 검출하도록 사운드 데이터를 연속적으로 프로세싱하는 것을 수반함에 따라, 연산적으로 부담이고 전력 집약적일 수 있다. 추가적으로, 키워드 스포팅 알고리즘은 재생 장치 상의 상당한 메모리를 소비할 수 있고, 더 큰 메모리 요청 및 더 느린 키워드 스포팅 알고리즘의 오버 더 에어(over the air) 소프트웨어 업데이트로 이어진다. 이러한 이슈를 다루기 위한 한 가지 방법은 연산적으로 효율적이고/거나 메모리를 덜 요구하도록 설계되는 키워드 스포팅 알고리즘을 사용하는 것이다. 예를 들어, 일부 키워드 스포팅 알고리즘은 알고리즘이 캡쳐된 사운드 데이터를 프로세싱하는 방식에 기초하여 다른 것들보다 본질적으로 효율적일 수 있다. 추가적으로, 특정 키워드 스포팅 알고리즘은 예를 들어, 보다 단순한 모델을 사용하여 키워드를 정의하거나 보다 단순한 필터를 사용하여 캡쳐된 사운드 데이터를 프로세싱하여, 결과적으로, 캡쳐된 사운드 데이터를 키워드 모델에 비교하는 경우 보다 적은 프로세싱 동작이 되도록 함으로써, 연산적으로 보다 효율적으로도 만들어 질 수 있다. 키워드 스포팅 알고리즘을 조정하여 그 연산적 효율성을 향상시키는 다른 예시는 다양한 실시예에서 이용될 수 있다. 그러나, 연산적으로 덜 집약적인 키워드 스포팅 알고리즘은 또한 보통 키워드를 검출함에 있어서 덜 정확하고 결과적으로 높은 비율의 긍정 오류 및/또는 부정 오류를 발생시킬 수 있다.
이러한 이슈 또는 다른 문제를 다루는데 도움을 주기 위한 시스템과 방법이 여기에서 개시된다. 특히, NMD의 연산적인 리소스 사용, 전력 소비 및/또는 메모리 요구를 줄이는 한편 활성 단어 검출에 있어서 여전히 충분히 높은 정확성을 유지하도록, NMD는 연산 복잡도를 변동시키는 둘 이상의 키워드 스포팅 알고리즘을 수행한다. 예를 들어, 하나 이상의 활성 단어를 듣는 경우, NMD는 비교적 낮은 정도의 프로세싱 전력을 사용하는 제1 키워드 스포팅 알고리즘을 사용한다. 상기 논의에 따라, 제1 키워드 스포팅 알고리즘은 연산적인 단순함 및/또는 감소된 메모리 요구를 위하여 정확성을 희생할 수 있다. 이 때문에, 제1 알고리즘을 사용하여 활성 단어를 검출하는 것에 응답하여, NMD는 더 높은 정도의 프로세싱 전력 및/또는 보다 많은 메모리를 사용하고 제1 알고리즘보다 정확한 제2 키워드 스포팅 알고리즘을 사용하여 제1 알고리즘에 의해 검출된 활성 단어의 존재를 확인하거나 틀림을 밝힌다. 이러한 방식에서, 연산적으로 부담이고 전력 집약적인 키워드 스포팅 알고리즘을 계속해서 수행하는 대신, NMD는 보다 덜 부담인 알고리즘을 사용하는 예비 활성 단어 검출에 예비적으로 기초하여 그러한 알고리즘만을 사용한다.
추가적으로 또는 대안적으로, 제1 알고리즘은 후보 활성 단어의 예비 검출을 위해 사용될 수 있다. 식별된 후보 활성 단어에 기초하여, 일 활성 단어 엔진이 복수의 가능한 활성 단어 엔진 중에서 선택될 수 있다. 이러한 활성 단어 엔진은 보다 연산적으로 집약적이고 더 많은 전력과 메모리를 요구하는 알고리즘을 이용할 수 있다. 결과적으로, 예비 검출을 위해 제1 알고리즘을 사용하여 적절한 후보 활성 단어가 검출되면 단지 특정 활성 단어 엔진을 선택하고 작동시키는 것이 유익할 수 있다. 일부 실시예에서, 예비 검출을 위해 사용된 제1 알고리즘은 예를 들어, 연산적으로 덜 집약적인 활성 단어 엔진보다 효율적일 수 있다.
저부담 활성 단어 검출 알고리즘의 예시는 메모리 및 전력 요구 둘 다를 줄이도록 압축된 뉴럴 네트워크 모델을 포함한다. 일부 실시예에서, 뉴럴 네트워크 모델은 압축형 스파스 로우(CSR) 표현 또는 이하 보다 자세히 설명되는 바와 같은 압축형 뉴럴 네트워크 모델을 달성하기 위한 다른 적절한 기법을 사용하여 가중치를 저장할 수 있는 소프트-가중치 공유형 뉴럴 네트워크 모델일 수 있다.
예컨대, 일부 실시예에서, NMD는 NMD의 하나 이상의 마이크로폰을 통하여 오디오 컨텐츠를 캡쳐하고, NMD는 제1 알고리즘을 사용하여 캡쳐된 오디오 컨텐츠가 복수의 활성 단어 중에서 특정 후보 활성 단어를 포함하는지 여부를 결정하며, 여기서 복수의 활성 단어 각각은 각 음성 서비스에 대응한다. 캡쳐된 사운드 데이터가 특정 후보 활성 단어를 포함한다고 결정하는 것에 응답하여, NMD는 복수의 활성 단어 엔진 중에서 제1 활성 단어 엔진을 선택하고 활성화한다. 선택된 활성 단어 엔진은 제2 알고리즘을 사용하여 캡쳐된 사운드 데이터에서 후보 활성의 존재를 확인 또는 부정할 수 있다. 여기서, 제2 알고리즘은 제1 알고리즘보다 연산적으로 집약적일 수 있다. 일부 실시예에서, 제2 알고리즘이 복수의 가능한 활성 단어 검출 알고리즘 중에서 선택될 수 있으며, 예를 들어, 다른 알고리즘은 다른 VAS와 연관된 활성 단어를 검출하도록 구성된다.
일부 실시예에서, 제2 알고리즘이 캡쳐된 사운드 데이터에서 후보 활성 단어의 존재를 확인하는 경우, NMD는 특정 활성 단어에 대응하는 각 음성 서비스로 하여금 캡쳐된 오디오 컨텐츠를 프로세싱하도록 한다. 대신, 제2 알고리즘이 캡쳐된 사운드 데이터에서 후보 활성 단어의 존재를 부정하는 경우, NMD는 특정 활성 단어를 검출하도록 캡쳐된 사운드 데이터를 프로세싱하는 것을 중단한다.
여기에서 설명되는 일부 실시예가 "사용자" 및/또는 다른 엔티티(entity)와 같은 소정의 행위자에 의해 수행되는 기능을 참조할 수 있으나, 이러한 기술은 단지 설명을 위한 것임이 이해되어야 한다. 청구범위는 청구범위 자체의 언어에 의하여 명시적으로 요구되지 않는 한 임의의 그러한 예시적인 행위자에 의한 행위를 요구하는 것으로 해석되어서는 안된다.
II. 예시적인 동작 환경
도 1a 및 1b는 여기에 개시된 하나 이상의 실시예가 구현될 수 있는 미디어 재생 시스템(100)(또는 "MPS(100)")의 예시적인 구성을 예시한다. 우선, 도 1a를 참조하면, 도시된 바와 같은 MPS(100)는 일괄하여 "집 환경", "스마트 홈" 또는 "환경(101)"으로 지칭될 수 있는 복수의 공간 및 장소를 가지는 예시적인 집 환경과 연관된다. 환경(101)은 여러 공간, 장소 및/또는 재생 구역을 가지는 가정을 포함하고, 이는 주 화장실(101a), 주 침실(101b)(여기서 "Nick의 공간"으로 지칭됨), 제2 침실(101c), 가족 공간 또는 서재(101d), 사무실(101e), 거실(101f), 식당(101g), 주방(101h) 및 외부 파티오(101i)를 포함한다. 일부 실시예 및 예시가 집 환경의 맥락에서 이하에서 설명되는 한편, 여기에서 설명된 기법은 다른 유형의 환경에서 구현될 수 있다. 일부 실시예에서, 예를 들어 MPS(100)는 하나 이상의 상업 환경(예컨대, 레스토랑, 몰, 공항, 호텔, 소매 또는 다른 상점), 하나 이상의 운송 수단(예컨대, SUV(sports utility vehicle), 버스, 자동차, 선박, 배 및 비행기), 멀티 환경(예컨대, 가정 또는 운송 수단 환경의 조합) 및/또는 멀티 구역 오디오가 요구될 수 있는 다른 적절한 환경에서 구현될 수 있다.
이러한 공간과 장소 내에서, MPS(100)는 하나 이상의 컴퓨팅 장치를 포함한다. 도 1a 및 도 1b를 함께 참조하면, 그러한 컴퓨팅 장치는 재생 장치(102)(각각 재생 장치(102a-102o)로서 식별됨), 네트워크 마이크로폰 장치(103)(각각 "NMD"(103a-103i)로서 식별됨) 및 컨트롤러 장치(104a 및 104b)(집합적으로 "컨트롤러 장치"(104))를 포함할 수 있다. 도 1b를 참조하면, 집 환경은 추가적인 및/또는 다른 컴퓨팅 장치를 포함할 수 있고, 이는 하나 이상의 스마트 조명 장치(108)(도 1b), 스마트 온도 조절 장치(110) 및 로컬 컴퓨팅 장치(105)(도 1a)와 같은 로컬 네트워크 장치를 포함한다. 이하 설명된 실시예에서, 다양한 재생 장치(102) 중 하나 이상은 휴대용 재생 장치로서 구성될 수 있는 한편, 다른 것은 고정된 재생 장치로서 구성될 수 있다. 예를 들어, 책장 위의 재생 장치(102d)가 고정 장치인 한편, 헤드폰(102o)(도 1b)은 휴대용 재생 장치이다. 다른 예시로서, 벽 콘센트 또는 그와 비슷한 플러그로 연결되지 않은 경우, 파티오 상의 재생 장치(102c)는 환경(101)내에서 다양한 구역으로, 그리고 환경(101)의 외부로 이동하는 것을 허용할 수 있는 배터리 전력 장치일 수 있다.
도 1b를 참조하면, MPS(100)의 다양한 재생, 네트워크 마이크로폰 및 컨트롤러 장치(102-104) 및/또는 다른 네트워크 장치는 네트워크 라우터(109)를 포함하는 LAN(111)을 통하고, 유선 및/또는 무선 연결될 수 있는 두 지점 간 연결(point-to-point connection) 및/또는 다른 연결을 통하여 서로 연결될 수 있다. 예를 들어, "왼쪽" 장치로서 지정될 수 있는 서재(101d)(도 1a)에 있는 재생 장치(102j)는 역시 서재에 있고 "오른쪽" 장치로서 지정될 수 있는 재생 장치(102a)와 두 지점 간 연결을 가질 수 있다. 관련된 실시예에서, 왼쪽 재생 장치(102j)는 "앞쪽" 장치로서 지정될 수 있는 재생 장치(102b)와 같은 다른 네트워크 장치와 두 지점 간 연결 및/또는 LAN(111)을 통한 다른 연결을 통하여 통신할 수 있다.
도 1b에서 더 도시된 바와 같이, MPS(100)는 광역 네트워크("WAN")(107)를 통하여 하나 이상의 원격 컴퓨팅 장치(106)와 연결될 수 있다. 일부 실시예에서, 각 원격 컴퓨팅 장치(106)는 하나 이상의 클라우드 서버의 형태를 취할 수 있다. 원격 컴퓨팅 장치(106)는 다양한 방식으로 환경(101) 내 컴퓨팅 장치와 상호 작용하도록 구성될 수 있다. 예를 들어, 원격 컴퓨팅 장치(106)는 집 환경(101)에서 오디오와 같은 미디어 컨텐츠의 재생을 제어 및/또는 스트리밍하는 것을 용이하게 하도록 구성될 수 있다.
일부 구현예에서, 다양한 재생 장치, NMD 및/또는 컨트롤러 장치(102-104)는 VAS와 연관된 적어도 하나의 원격 컴퓨팅 장치 및 미디어 컨텐츠 서비스("MCS")와 연관된 적어도 하나의 원격 컴퓨팅 장치와 통신으로 연결될 수 있다. 예를 들어, 도 1b의 예시된 예시에서, 원격 컴퓨팅 장치(106a)는 VAS(190)와 연관되고, 원격 컴퓨팅 장치(106b)는 MCS(192)와 연관된다. 명확성을 위해 단일 VAS(190) 및 단일 MCS(192)만이 도 1b의 예시에서 도시되었지만, MPS(100)는 복수의 상이한 VAS 및/또는 MCS에 연결될 수 있다. 일부 구현예에서, VAS는 아마존, 구글, 애플, 마이크로소프트, 소노스 또는 기타 음성 지원 제공자 중 하나 이상에 의해 동작될 수 있다. 일부 구현예에서, MCS는 스포티파이, 판도라, 아마존 뮤직 또는 기타 미디어 컨텐츠 서비스 중 하나 이상에 의해 동작될 수 있다.
도 1b에서 추가로 도시된 바와 같이, 원격 컴퓨팅 장치(106)는 다른 동작 중에서도 원격으로 미디어 재생 기능을 용이하게 하고, 장치 및 시스템 상태 정보를 관리하고, MPS(100)의 장치와 하나 또는 복수의 VAS 및/또는 MCS 사이의 통신을 디렉팅하는 것과 같은, 일부 동작을 수행하도록 구성되는 원격 컴퓨팅 장치(106c)를 더 포함한다. 일 예시에서, 원격 컴퓨팅 장치(106c)는 하나 이상의 소노스 무선 하이파이 시스템을 위해 클라우드 서버를 제공한다.
다양한 구현예에서, 재생 장치(102) 중 하나 이상은 내장된(예컨대, 통합된) 네트워크 마이크로폰 장치의 형태를 취하거나 이를 포함할 수 있다. 예를 들어, 재생 장치(102a-e)는 각각 대응하는 NMD(103a-e)를 포함하거나 아니면 NMD(103a-e)가 구비된다. NMD를 포함하거나 이를 구비하는 재생 장치는 설명에서 별도의 표시가 없다면, 여기서 교환 가능하게 재생 장치 또는 NMD로서 지칭될 수 있다. 일부 경우에서, NMD(103) 중 하나 이상은 독립형 장치일 수 있다. 예를 들어, NMD(103f 및 103g)는 독립형 장치일 수 있다. 독립형 NMD는 스피커 또는 관련 전자기기와 같은, 재생 장치에 보통 포함된 기능 및/또는 컴포넌트를 생략할 수 있다. 예를 들어, 이러한 경우에, 독립형 NMD는 오디오 출력을 생산하지 않을 수 있거나, 제한된 오디오 출력(예컨대, 비교적 저음질 오디오 출력)을 생산할 수 있다.
MPS(100)의 다양한 재생 및 네트워크 마이크로폰 장치(102 및 103)는 이러한 장치 중 하나 이상의 셋업 동안과 같이, 사용자에 의해 각 장치에 할당될 수 있는 고유한 이름과 연관될 수 있다. 예를 들어, 도 1b의 예시된 예시에 도시된 바와 같이, 사용자는 물리적으로 책장 위에 위치해 있기 때문에, 재생 장치(102d)에 "책장"이라는 이름을 할당할 수 있다. 유사하게, NMD(103f)는 물리적으로 주방(101h)(도 1a)에 있는 아일랜드 조리대(island countertop) 상에 위치해 있기 때문에 "아일랜드"라는 이름이 할당될 수 있다. 일부 재생 장치는 이름이 각각 "침실", "식당", "거실" 및 "사무실"인 재생 장치(102e, 102l, 102m 및 102n)와 같이 구역 또는 공간에 따라 이름이 할당될 수 있다. 추가적으로, 일부 재생 장치는 기능적으로 서술하는 이름을 가질 수 있다. 예를 들어, 재생 장치(102a 및 102b)는 각각 "오른쪽" 및 "앞쪽"이라는 이름이 할당되는데, 이는 이 두 장치가 서재(101d)(도 1a)의 구역에서 미디어 재생 동안 특별 오디오 채널을 제공하도록 구성되기 때문이다. 파티오에 있는 재생 장치(102c)는 휴대용으로 명명될 수 있는데, 이는 배터리로 전력 공급되고/거나 환경(101)의 다른 영역으로 쉽게 이동할 수 있기 때문이다. 다른 명명 규칙도 가능하다.
위에서 논의된 바와 같이, NMD는 NMD의 부근에서 사람에 의해 말해진 회화와 혼합된 배경 잡음을 포함하는 사운드와 같은, 그 환경으로부터의 사운드를 검출하고 프로세싱할 수 있다. 예를 들어, 사운드가 환경에 있는 NMD에 의해 검출되는 것과 같이, NMD는 사운드가 NMD 및 본질적으로 특정 VAS를 위해 의도된 음성 입력이 들어 있는 회화를 포함하는 경우를 결정하도록 검출된 사운드를 프로세싱할 수 있다. 예를 들어, NMD는 회화가 특정 VAS와 연관된 활성 단어를 포함하는지 여부를 식별할 수 있다.
도 1b의 예시된 예시에서, NMD(103)는 LAN(111) 및 라우터(109)를 통하여 네트워크를 지나 VAS(190)과 상호 작용하도록 구성된다. VAS(190)와의 상호 작용은 예를 들어, NMD가 검출된 사운드에서 잠재적인 활성 단어를 식별하는 경우, 개시될 수 있다. 식별은 활성 단어 이벤트를 일으키며, 이는 차례로 NMD로 하여금 검출된 사운드 데이터를 VAS(190)로 전송을 시작하도록 한다. 일부 구현예에서, MPS(100)의 원격 컴퓨팅 장치(106c) 및/또는 다양한 로컬 네트워크 장치(102-105)(도 1a)는 다양한 피드백, 정보, 명령어 및/또는 선택된 VAS에 연관된 원격 컴퓨팅 장치와 관련된 데이터를 교환할 수 있다. 그러한 교환은 음성 입력을 포함하는 전송된 메시지와 관련되거나 이와 독립적인 것일 수 있다. 일부 실시예에서, 원격 컴퓨팅 장치(들) 및 미디어 재생 시스템(100)은 여기서 설명된 바와 같이 통신로를 통하고/거나 그 전체가 참조로서 여기에 포함된 2017년 2월 21에 제출되고 제목이 "미디어 재생 시스템의 음성 제어(Voice Control of a Media Playback System)"인 미국 출원 제15/438,749호에서 설명된 바와 같이 메타데이터 교환 채널을 사용하여 데이터를 교환할 수 있다.
사운드 데이터의 스트림을 수신하면, VAS(190)는 NMD로부터의 스트림 데이터에 음성 입력이 있는지 결정하고, 그런 경우 VAS(190)는 또한 음성 입력에서 본질적인 의도를 결정할 것이다. 다음, VAS(190)는 MPS(100)로 응답을 다시 전송할 수 있으며, 이는 활성 단어 이벤트를 일으킨 NMD로 직접 응답을 전송하는 것을 포함할 수 있다. 응답은 보통 VAS(190)가 음성 입력에 존재한다고 결정한 의도에 기초한다. 예시로서, "비틀즈의 헤이 주드 재생"이라는 발화를 가진 음성 입력을 수신하는 VAS(190)에 응답하여, VAS(190)는 음성 입력의 본질적인 의도가 재생을 개시하기 위한 것이라는 것을 결정하고 또한 음성 입력의 의도가 특정 노래 "헤이 주드"를 재생하기 위한 것이라는 것을 결정할 수 있다. 이러한 결정 이후, VAS(190)는 특정 MCS(192)로 명령을 전송하여 컨텐츠를 검색(즉, 노래 "헤이 주드")할 수 있고, 그 MCS(192)는 차례로 이러한 컨텐츠를 직접 MPS(100)로 제공하거나 VAS(190)을 통하여 간접적으로 제공한다(예컨대, 스트림). 일부 구현예에서, VAS(190)는 MPS(100) 자체로 하여금 MCS(192)로부터 컨텐츠를 검색하도록 하는 명령을 MPS(100)로 전송할 수 있다.
일부 구현예에서, NMD는, 음성 입력이 서로의 근처 내에 위치된 둘 이상의 NMD에 의해 검출된 회화에서 식별되는 경우, 서로 간의 중재를 용이하게 할 수 있다. 예를 들어, 환경(101)(도 1a)에서 NMD-구비형 재생 장치(102d)는 NMD-구비형 거실 재생 장치(102m)에 비교적 가까운 근처에 있고, 두 장치(102d 및 102m)는 적어도 때로는 동일한 사운드를 검출할 수 있다. 그러한 경우에서, 어떤 장치가 원격 VAS로 검출된 사운드 데이터를 제공할 궁극적인 책임이 있는지에 관하여 중재를 요구할 수 있다. NMD 사이의 중재의 예시는 예를 들어, 이전에 참조된 미국 특허 제15/438,749호에서 발견될 수 있다.
일부 구현예에서, NMD는 NMD를 포함하지 않을 수 있는 지정된 재생 장치 또는 디폴트 재생 장치에 할당되거나 연관될 수 있다. 예를 들어, 주방(101h)(도 1a)에 있는 아일랜드 NMD(103f)는 아일랜드 NMD(103f)에 비교적 가까운 근처에 있는 식당 재생 장치(102l)에 할당될 수 있다. 실시에서, NMD는 오디오를 재생하도록 NMD로부터 음성 입력을 수신하는 원격 VAS에 응답하여 오디오를 재생하도록 할당된 재생 장치를 디렉트할 수 있으며, 여기서 NMD는 사용자가 일부 노래, 앨범, 플레이리스트 등을 재생하도록 명령을 말하는 것에 응답하여, VAS에 전송했을 수 있다. 지정된 장치 또는 디폴트 장치로서 NMD 및 재생 장치를 할당하는 것에 관한 추가적인 세부 사항은 예를 들어, 이전에 참조된 미국 특허 출원 제15/438,749호에 있을 수 있다.
예시적인 MPS(100)의 다른 컴포넌트와 관련 있는 추가 양상 및 다른 컴포넌트가 어떻게 미디어 경험을 사용자에게 제공하도록 상호작용할 수 있는지는 다음의 섹션에서 발견될 수 있다. 여기에서 논의가 일반적으로 예시적인 MPS(100)을 나타내는 한편, 여기서 설명되는 기술은 그 중에서도 위에서 설명된 집 환경 내에서의 응용에 제한되는 것이 아니다. 예를 들어, 여기서 설명된 기술은 재생 장치, 네트워크 마이크로폰 및/또는 컨트롤러 장치(102-104) 중 임의의 것보다 많거나 적은 것을 포함하는 다른 집 환경 구성에서 유용할 수 있다. 예를 들어, 여기에서의 기술은 단일 재생 장치(102) 및/또는 단일 NMD(103)를 가지는 환경 내에서 활용될 수 있다. 그러한 경우의 일부 예시에서, LAN(111)(도 1b)은 제거될 수 있고 단일 재생 장치(102) 및/또는 단일 NMD(103)는 원격 컴퓨팅 장치(106a-d)와 직접적으로 통신할 수 있다. 일부 실시예에서, 전기 통신 네트워크(예컨대, LTE 네트워크, 5G 네트워크 등)은 LAN에 독립적인 다양한 재생, 네트워크 마이크로폰 및/또는 컨트롤러 장치(102-104)와 통신할 수 있다.
a. 예시적인 재생 & 네트워크 마이크로폰 장치
도 2a는 도 1a 및 1b의 MPS(100)의 재생 장치(102) 중 하나의 일부 양상을 예시하는 기능적인 블록도이다. 도시된 바와 같이, 재생 장치(102)는 각각 아래에서 더 자세하게 논의되는 다양한 컴포넌트를 포함하고, 재생 장치(102)의 다양한 컴포넌트는 시스템 버스, 통신 네트워크 또는 일부 다른 연결 메커니즘을 통하여 동작 가능하게 서로 연결될 수 있다. 도 2a의 예시된 예시에서, 재생 장치(102)는 도 1a에 도시된 바와 같이 NMD(103) 중 하나와 같은, NMD의 기능을 지원하는 컴포넌트를 포함하므로 "NMD-구비형" 재생 장치로 지칭될 수 있다.
도시된 바와 같이, 재생 장치(102)는 적어도 하나의 프로세서(212)를 포함하며, 이는 메모리(213)에 저장된 명령어에 따라 입력 데이터를 프로세싱하도록 구성되는 클락 구동(clock-driven) 컴퓨팅 컴포넌트일 수 있다. 메모리(213)는 프로세서(212)에 의해 실행 가능한 명령어를 저장하도록 구성되는 유형의 비일시적인 컴퓨터 판독 가능 기록매체일 수 있다. 예를 들어, 메모리(213)는 일부 기능을 달성하기 위해 프로세서(212)에 의해 실행 가능한 소프트웨어 코드(214)로 로딩될 수 있는 데이터 저장소일 수 있다.
일 예시에서, 이러한 기능은 다른 재생 장치일 수 있는 오디오 소스로부터 오디오 데이터를 검색하는 재생 장치(102)를 수반할 수 있다. 다른 예시에서, 기능은 오디오 데이터, (예컨대, 음성 입력에 대응하는)검출된 사운드 데이터 및/또는 다른 정보를 적어도 하나의 네트워크 인터페이스(224)를 통하여 네트워크 상의 다른 장치로 전송하는 재생 장치(102)를 수반할 수 있다. 또 다른 예시에서, 기능은 재생 장치(102)가 하나 이상의 다른 재생 장치로 하여금 재생 장치(102)와 동기적으로 오디오를 재생하도록 하는 것을 수반할 수 있다. 또 다른 예시에서, 기능은 재생 장치(102)가 하나 이상의 다른 재생 장치와 페어링되거나 아니면 연결되는 것을 용이하게 하여 멀티 채널 오디오 환경을 생성하는 것을 수반할 수 있다. 많은 다른 예시적인 기능이 가능하고 그 중 일부는 아래에서 논의된다.
언급한 바와 같이, 일부 기능은 재생 장치(102)가 오디오 컨텐츠의 재생을 하나 이상의 다른 재생 장치와 동기화하는 것을 포함할 수 있다. 동기화 재생하는 동안, 청취자는 동기화된 재생 장치에 의한 오디오 컨텐츠의 재생 간의 시간 지연 차이를 감지하지 않을 수 있다. 전체 내용이 여기에 참조로서 포함되는 2004년 4월 4일에 출원되고 제목이 "복수의 독립적으로 클록(clock)되는 디지털 데이터 처리 장치 사이에서 동작을 동기화하기 위한 시스템 및 방법(System and method for synchronizing operations among a plurality of independently clocked digital data processing devices)"인 미국 특허 제8,234,395호는 재생 장치 중에서 오디오 재생 동기화에 대한 더 상세한 일부 예시를 제공한다.
오디오 재생을 용이하게 하도록, 재생 장치(102)는 일반적으로 오디오를 렌더링하는 재생 장치(102)에 앞서 오디오를 프로세싱하도록 구성되는 오디오 처리 컴포넌트(216)를 포함한다. 이러한 점에서, 오디오 처리 컴포넌트(216)는 하나 이상의 디지털-아날로그 변환기("DAC"), 하나 이상의 오디오 전처리 컴포넌트, 하나 이상의 오디오 향상 컴포넌트, 하나 이상의 디지털 신호 프로세서("DSP") 등을 포함할 수 있다. 일부 구현예에서, 오디오 처리 컴포넌트(216) 중 하나 이상은 프로세서(212)의 서브 컴포넌트일 수 있다. 동작에서, 오디오 처리 컴포넌트(216)는 아날로그 및/또는 디지털 오디오를 수신하고, 오디오를 프로세싱하고/거나 의도적으로 변경하여 재생에 대한 오디오 신호를 생산한다.
생산된 오디오 신호는 이후 증폭기(217)에 동작 가능하게 연결된 하나 이상의 스피커(218)를 통하여 증폭 및 재생을 위해 하나 이상의 오디오 증폭기(217)로 제공될 수 있다. 오디오 증폭기(217)는 오디오 신호를 스피커(218) 중 하나 이상을 구동하기 위한 레벨로 증폭하도록 구성된 컴포넌트를 포함할 수 있다.
스피커(218) 각각은 개별의 변환기(transducer)(예컨대, "드라이버")를 포함할 수 있거나 스피커(218)는 하나 이상의 드라이버와 엔클로저를 수반하는 완전한 스피커 시스템을 포함할 수 있다. 스피커(218)의 특정 드라이버는 예를 들면, (예컨대, 저주파수를 위한) 서브 우퍼, (예컨대, 중간 주파수를 위한) 중간 범위의 드라이버 및/또는 (예컨대, 고주파를 위한) 트위터를 포함할 수 있다. 일부 경우에서, 변환기는 오디오 증폭기(217)의 개별 대응 오디오 증폭기에 의해 구동될 수 있다. 일부 구현예에서, 재생 장치는 스피커(218)를 포함하지 않을 수 있지만, 대신 외부 스피커로 재생 장치를 연결하기 위한 스피커 인터페이스를 포함할 수 있다. 일부 실시예에서, 재생 장치는 스피커(218)와 오디오 증폭기(217)를 모두 포함하지 않을 수 있지만, 대신 외부 오디오 증폭기 또는 오디오 영상 수신기로 재생 장치를 연결하기 위한 오디오 인터페이스(도시되지 않음)를 포함할 수 있다.
재생 장치(102)에 의해 재생을 위한 오디오 신호를 생성하는 것에 더하여, 오디오 처리 컴포넌트(216)는 재생을 위해 네트워크 인터페이스(224)를 통하여 하나 이상의 다른 재생 장치로 전송될 오디오를 프로세싱하도록 구성될 수 있다. 예시적인 시나리오에서, 재생 장치(102)에 의해 프로세싱 및/또는 재생될 오디오 컨텐츠는 재생 장치(102)(도시되지 않음)의 오디오 라인인 인터페이스(audio line-in interface)(예컨대, 자동 검출 3.5mm 오디오 라인인 연결)를 통하여 또는 아래에 설명된 바와 같이 네트워크 인터페이스(224)를 통하는 것과 같이, 외부 소스로부터 수신될 수 있다.
도시된 바와 같이, 적어도 하나의 네트워크 인터페이스(224)는 하나 이상의 무선 인터페이스(225) 및/또는 하나 이상의 유선 인터페이스(226)의 형태를 취할 수 있다. 무선 인터페이스는 재생 장치(102)가 통신 프로토콜(예컨대, IEEE 802.11a, 802.11b, 802.11g, 802.11n, 802.11ac, 802.15, 4G 모바일 통신 표준 등을 포함하는 임의의 무선 표준)에 따라 다른 장치(예컨대, 다른 재생 장치(들), NMD(들) 및/또는 컨트롤러 장치(들))와 무선으로 통신하도록 네트워크 인터페이스 기능을 제공할 수 있다. 유선 인터페이스는 재생 장치(102)가 통신 프로토콜(예컨대, IEEE 802.3)에 따라 다른 장치와 유선 연결 통신하도록 네트워크 인터페이스 기능을 제공할 수 있다. 도 2a에 도시되는 네트워크 인터페이스(224)가 유선 및 무선 인터페이스 둘 다를 포함하는 한편, 재생 장치(102)는 일부 구현예에서 무선 인터페이스(들)만을 또는 유선 인터페이스(들)만을 포함할 수 있다.
보통, 네트워크 인터페이스(224)는 재생 장치(102)와 데이터 네트워크 상의 하나 이상의 다른 장치 간의 데이터 흐름을 용이하게 한다. 예를 들어, 재생 장치(102)는 하나 이상의 다른 재생 장치, LAN 내의 네트워크 장치 및/또는 인터넷과 같은 광역 네트워크 상에서의 오디오 컨텐츠 소스로부터 데이터 네트워크에서 오디오 컨텐츠를 수신하도록 구성될 수 있다. 일 예시에서, 재생 장치(102)에 의해 전송되고 수신되는 오디오 컨텐츠 및 다른 신호는 인터넷 프로토콜(Internet Protocol)(IP) 기반 소스 주소 및 IP 기반 목적지 주소를 포함하는 디지털 패킷(packet data) 데이터의 형태로 전송될 수 있다. 그러한 경우, 네트워크 인터페이스(224)는 재생 장치(102)로 향하는 데이터가 재생 장치(102)에 의해 적절히 수신되고 프로세싱되도록 디지털 패킷 데이터를 파싱(parsing)하도록 구성될 수 있다.
도 2a에 도시된 바와 같이, 재생 장치(102)는 또한 하나 이상의 마이크로폰(222)에 동작 가능하게 연결된 음성 처리 컴포넌트(220)를 포함한다. 마이크로폰(222)은 재생 장치(102)의 환경에서 사운드(즉, 어쿠스틱 파장)를 검출하도록 구성되며, 이는 이후 음성 처리 컴포넌트(220)로 제공된다. 보다 구체적으로, 각 마이크로폰(222)은 사운드를 검출하고 사운드를 검출된 사운드의 디지털 또는 아날로그 신호 표현으로 전환하도록 구성되며, 이는 이후 아래에서 더 자세하게 설명되는 바와 같이, 음성 처리 컴포넌트(220)로 하여금 검출된 사운드에 기초된 다양한 기능을 수행하도록 할 수 있다. 일 구현예에서, 마이크로폰(222)은 마이크로폰의 어레이(예컨대, 6개의 마이크로폰의 어레이)로서 배열된다. 일부 구현예에서, 재생 장치(102)는 6개의 마이크로폰보다 많거나(예컨대, 8개의 마이크로폰 또는 12개의 마이크로폰) 6개의 마이크로폰보다 적은 것(예컨대, 4개의 마이크로폰, 2개의 마이크로폰 또는 단일 마이크로폰)을 포함한다.
동작에서, 음성 처리 컴포넌트(220)는 일반적으로 마이크로폰(222)을 통하여 수신된 사운드를 검출 및 프로세싱하고, 검출된 사운드에서 잠재적인 음성 입력을 식별하며, 검출된 사운드 데이터를 추출하여 VAS(190)(도 1b)와 같은, VAS가 검출된 사운드 데이터에서 식별된 음성 입력을 프로세싱할 수 있도록 구성된다. 음성 처리 컴포넌트(220)는 다른 예시적인 음성 처리 컴포넌트 중에서도 하나 이상의 아날로그 디지털 변환기, 음향 반향 캔슬러(acoustic echo canceller; "AEC"), 공간 프로세서(예컨대, 하나 이상의 멀티 채널 위너 필터, 하나 이상의 다른 필터 및/또는 하나 이상의 빔 형성 컴포넌트), 하나 이상의 버퍼(예컨대, 하나 이상의 원형 버퍼), 하나 이상의 활성 단어 엔진, 하나 이상의 음성 추출기 및/또는 하나 이상의 회화 처리 컴포넌트(예컨대, 가정과 연관 있는 사용자의 특정 집합 또는 특정 사용자의 음성을 인식하도록 구성된 컴포넌트)를 포함할 수 있다. 예시적인 구현예에서, 음성 처리 컴포넌트(220)는 하나 이상의 DSP의 형태 또는 DSP의 하나 이상의 모듈을 포함하거나 아니면 이를 취할 수 있다. 이러한 점에서, 일부 음성 처리 컴포넌트(220)는 특정 기능을 달성하도록 수정되거나 조정될 수 있는 특정 파라미터(예컨대, 이득 및/또는 스펙트럼 파라미터)로 구성될 수 있다. 일부 구현예에서, 음성 처리 컴포넌트(220) 중 하나 이상은 프로세서(212)의 서브 컴포넌트일 수 있다.
일부 구현예에서, 음성 처리 컴포넌트(220)는 MPS(100)의 사용자 계정과 연관될 수 있는 사용자의 음성 프로파일을 검출하고 저장할 수 있다. 예를 들어, 음성 프로파일은 데이터 테이블 또는 명령 정보의 세트에 저장된 변수로서 저장 및/또는 변수에 비교될 수 있다. 음성 프로파일은 이전에 참조된 미국 특허 출원 제15/438,749호에 설명된 바와 같이, 사용자의 음성의 톤 또는 주파수의 양상 및/또는 사용자의 음성의 다른 고유한 양상을 포함할 수 있다.
도 2a에 추가 도시된 바와 같이, 재생 장치(102)는 또한 전력 컴포넌트(227)을 포함한다. 전력 컴포넌트(227)는 적어도 외부 전력 소스 인터페이스(228)을 포함하며, 이는 전기 콘센트 또는 일부 다른 외부 전력 소스에 물리적으로 재생 장치(102)를 연결하는 전력 케이블 등을 통하여 전력 소스(도시되지 않음)에 연결될 수 있다. 다른 전력 컴포넌트는 예를 들어, 변압기, 컨버터 및 전력을 포맷하도록 구성된 유사 컴포넌트를 포함할 수 있다.
일부 구현예에서, 재생 장치(102)의 전력 컴포넌트(227)는 또한, 외부 전력 소스로의 물리적 연결 없이 재생 장치(102)에 전력을 공급하도록 구성된 내부 전력 소스(229)(예컨대, 하나 이상의 배터리)를 포함할 수 있다. 내부 전력 소스(229)에 구비되는 경우, 재생 장치(102)는 외부 전력 소스에 독립적으로 동작할 수 있다. 일부 그러한 구현예에서, 외부의 전력 소스 인터페이스(228)는 내부 전력 소스(229)를 충전하는 것을 용이하게 하도록 구성될 수 있다. 이전에 논의된 바와 같이, 내부 전력 소스를 포함하는 재생 장치는 여기서 "휴대용 재생 장치"로 지칭될 수 있다. 한편, 외부 전력 소스를 사용하여 동작하는 재생 장치는, 이러한 장치들이 실은 집 또는 다른 환경 주변에서 이동될 수 있지만, 여기서 "고정된 재생 장치"로 지칭될 수 있다.
재생 장치(102)는 컨트롤러 장치(104) 중 하나 이상에 의해 용이하게 되는 사용자 상호 작용과 함께 또는 이에 독립한 사용자 상호 작용을 용이하게 할 수 있는 사용자 인터페이스(240)를 더 포함한다. 다양한 실시예에서, 사용자 인터페이스(240)는 사용자가 직접 입력을 제공하도록, 다른 가능성 중에서도 하나 이상의 물리적 버튼 및/또는 터치 센싱 스크린(들) 및/또는 표면(들) 상에 제공되는 서포트 그래픽 인터페이스를 포함한다. 사용자 인터페이스(240)는 사용자에게 시각적 및/또는 오디오 피드백을 제공하도록 광(예컨대, LED) 및 스피커 중 하나 이상을 더 포함할 수 있다.
예시와 같이, 도 2b는 하우징(230)의 상부(234)에서 제어 영역(232)의 형태로 사용자 인터페이스를 포함하는 재생 장치(102)의 예시적인 하우징(230)을 도시한다. 제어 영역(232)은 오디오 재생, 음량 레벨 및 다른 기능을 제어하기 위한 버튼(236a-c)을 포함한다. 제어 영역(232)은 또한 마이크로폰(222)을 온(on) 상태 또는 오프(off) 상태로 토글링(toggling)하기 위한 버튼(236d)을 포함한다.
도 2b에 더 도시된 바와 같이, 제어 영역(232)은 하우징(230)의 상부(234)에 형성된 애퍼처에 의해 적어도 부분적으로 둘러싸이며, 이를 통하여 마이크로폰(222)(도 2b에서 보이지 않음)이 재생 장치(102)의 환경에서 사운드를 수신한다. 마이크로폰(222)은 하우징(230)의 상부(234) 또는 다른 영역을 따라 그리고/또는 그 내에서의 다양한 위치에서 배열되어 재생 장치(102)에 관해 하나 이상의 방향으로부터 사운드를 검출할 수 있다.
예를 들어, 소노스 사(SONONS, Inc.)는 여기에 개시된 실시예 중 일부를 구현할 수 있는 일부 재생 장치를 현재 판매하며 (또는 판매해왔고), 이는 "PLAY:1", "PLAY:3", "PLAY:5", "PLAYBAR", "CONNECT:AMP", "PLAYBASE", "BEAM", "CONNECT" 및 "SUB"를 포함한다. 임의의 다른 과거, 현재 및/또는 미래의 재생 장치가 추가적으로 또는 대안적으로 여기에 개시되는 예시적인 실시예의 재생 장치를 구현하도록 사용될 수 있다. 또한, 재생 장치가 도 2a 또는 2b에서 예시되는 예시 또는 소노스 제품 제안에 제한되지 않음이 이해되어야 한다. 예를 들어, 재생 장치는 네트워크 인터페이스 등을 통하여 미디어 재생 시스템(100)의 일부로서 동작할 수 있는 유선 또는 무선 헤드폰 세트를 포함하거나 아니면 그 형태를 취할 수 있다. 다른 예시에서, 재생 장치는 개인 모바일 미디어 재생 장치를 위해 도킹 스테이션(docking station)을 포함하거나 이와 상호작용할 수 있다. 또 다른 예시에서, 재생 장치는 텔레비전, 조명 기구, 또는 내부 또는 외부 용도를 위한 일부 다른 장치와 같은 다른 장치 또는 컴포넌트에 통합될 수 있다.
b. 예시적인 재생 장치 구성
도 3a-3e는 재생 장치의 예시적인 구성을 도시한다. 먼저 도 3a를 참조하면, 일부 예시적인 경우에서, 단일 재생 장치는 구역에 속할 수 있다. 예를 들어, 파티오 상의 재생 장치(102c)(도 1a)는 구역 A에 속한다. 이하에서 설명된 일부 구현예에서, 복수의 재생 장치는 "결합된 페어"를 형성하도록 "결합"될 수 있으며, 이는 함께 단일 구역을 형성할 수 있다. 예를 들어, 도 3a에서 "침대 1"로 명명된 재생 장치(102f)(도 1a)는 구역 B를 형성하도록 도 3a에서 "침대 2"로 명명된 재생 장치(102g)(도 1a)와 결합될 수 있다. 결합된 재생 장치는 상이한 재생 책임(예컨대, 채널 책임)을 가질 수 있다. 이하에서 설명된 다른 구현예에서, 복수의 재생 장치가 병합되어 단일 구역을 형성할 수 있다. 예를 들어, "책장"으로 명명된 재생 장치(102d)는 "거실"로 명명된 재생 장치(102m)와 병합되어 단일 구역 C를 형성할 수 있다. 병합된 재생 장치(102d 및 102m)는 다른 재생 책임에 명시적으로 할당되지 않을 수 있다. 즉, 병합된 재생 장치(102d 및 102m)는, 오디오 컨텐츠를 동기로 재생하는 것 외에, 그들이 병합되지 않은 경우 그들이 하는 것처럼 오디오 컨텐츠를 각각 재생할 수 있다.
제어를 위해, MPS(100)에 있는 각 구역은 단일 사용자 인터페이스("UI") 엔티티로서 표현할 수 있다. 예를 들어, 컨트롤러 장치(104)에 의해 디스플레이된 것과 같이, 구역 A는 "휴대용"으로 명명된 단일 엔티티로서 제공될 수 있고, 구역 B는 "스테레오"로 명명된 단일 엔티티로서 제공될 수 있고, 구역 C는 "거실"로 명명된 단일 엔티티로서 제공될 수 있다.
다양한 실시예에서, 구역은 구역에 속하는 재생 장치 중 하나의 이름을 취할 수 있다. 예를 들어, 구역 C는 (도시된 바와 같이) 거실 장치(102m)의 이름을 취할 수 있다. 다른 예시에서, 구역 C는 책장 장치(102d)의 이름을 대신 취할 수 있다. 추가 예시에서, 구역 C는 책장 장치(102d)와 거실 장치(102m)의 일부 조합인 이름을 취할 수 있다. 선정된 이름은 컨트롤러 장치(104)에서 입력을 통하여 사용자에 의해 선택될 수 있다. 일부 실시예에서, 구역은 구역에 속하는 장치(들)과 다른 이름이 주어질 수 있다. 예를 들어, 도 3a에 있는 구역 B는 "스테레오"라고 명명되지만 구역 B에 있는 일부 장치도 이러한 이름을 가지고 있지 않다. 일 양상에서, 구역 B는 구성 장치 "침대 1" 및 "침대 2"로 구성된 "스테레오"로 명명된 단일 장치를 나타내는 단일 UI 엔티티이다. 일 구현예에서, 침대 1 장치는 주 침실(101h)(도 1a)에 있는 재생 장치(102f)일 수 있고, 침대 2 장치는 역시 주 침실(101h)(도 1a)에 있는 재생 장치(102g)일 수 있다.
상기 언급된 바와 같이, 결합되는 재생 장치는 일부 오디오 채널에 대한 재생 책임과 같이, 상이한 재생 책임을 가질 수 있다. 예를 들어, 도 3b에 도시된 바와 같이, 침대 1 및 침대 2 장치(102f 및 102g)는 오디오 컨텐츠의 스테레오 효과를 생산 또는 향상하도록 결합될 수 있다. 이러한 예시에서, 침대 1 재생 장치(102f)가 왼쪽 채널 오디오 컴포넌트를 재생하도록 구성될 수 있는 한편, 침대 2 재생 장치(102g)는 오른쪽 채널 오디오 컴포넌트를 재생하도록 구성될 수 있다. 일부 구현예에서, 이러한 스테레오 결합은 "페어링"으로 지칭될 수 있다.
또한, 결합되도록 구성된 재생 장치는 추가적 및/또는 다른 각 스피커 드라이버를 가질 수 있다. 도 3c에서 도시된 바와 같이, "앞쪽"이라고 명명된 재생 장치(102b)는 "서브"라고 명명된 재생 장치(102k)와 결합될 수 있다. 앞쪽 장치(102b)는 중간 내지 고주파수의 범위를 렌더링할 수 있고, 서브 장치(102k)는 예를 들어, 서브 우퍼와 같이 저주파수를 렌더링할 수 있다. 결합되지 않은 경우, 앞쪽 장치(102b)는 주파수의 모든 범위를 렌더링하도록 구성될 수 있다. 다른 예시로서, 도 3d는 각각 오른쪽과 왼쪽 재생 장치(102a 및 102j)와 더 결합된 앞쪽 및 서브 장치(102b 및 102k)를 도시한다. 일부 구현예에서, 오른쪽과 왼쪽 장치(102a 및 102j)는 홈 시어터 시스템(home theater system)의 서라운드 또는 "위성" 채널을 형성할 수 있다. 결합된 재생 장치(102a, 102b, 102j 및 102k)는 단일 구역 D(도 3a)을 형성할 수 있다.
일부 구현예에서, 재생 장치는 또한 "병합"될 수 있다. 일부 결합된 재생 장치와는 대조적으로, 병합되는 재생 장치는 할당된 재생 책임을 가지지 않을 수 있지만, 각 재생 장치가 할 수 있는 오디오 컨텐츠의 모든 범위를 각각 렌더링할 수 있다. 그럼에도 불구하고, 병합된 장치는 단일 UI 엔티티(즉, 위에서 논의된 바와 같이, 구역)로서 표현될 수 있다. 예를 들어, 도 3e는 병합되는 거실 내 재생 장치(102d 및 102m)를 도시하며, 이는 결국 이러한 장치가 구역 C의 단일 UI 엔티티에 의해 표현될 것이다. 일 실시예에서, 재생 장치(102d 및 102m)는 오디오를 동기로 재생하며, 그 동안 각 재생 장치(102d 및 102m)가 각각 렌더링 할 수 있는 오디오 컨텐츠의 모든 범위를 출력할 수 있다.
일부 실시예에서, 독립형의 NMD는 홀로 구역에 있을 수 있다. 예를 들어, 도 1a에서 NMD(103h)는 "옷장"이라고 명명되고 도 3a에서 구역 I를 형성한다. NMD는 또한 구역을 형성하도록 다른 장치와 결합되거나 병합될 수 있다. 예를 들어, "아일랜드"로 명명된 NMD 장치(103f)는 함께 구역 F를 형성하고, 또한 "주방"이라고 명명된 재생 장치(102i) 주방과 결합될 수 있다. 지정된 장치 또는 디폴트 장치로서 NMD 및 재생 장치를 할당하는 것에 관한 추가적 세부 사항은 예를 들어, 이전에 참조된 미국 특허 출원 제15/438,749호에서 발견될 수 있다. 일부 실시예에서, 독립형 NMD는 구역에 할당되지 않을 수 있다.
개별 장치, 결합된 장치 및/또는 병합된 장치의 구역은 동기화로 오디오를 재생하는 재생 장치의 세트를 형성하도록 배열될 수 있다. 그러한 재생 장치의 세트는 "그룹", "구역 그룹", "동기화 그룹" 또는 "재생 그룹"으로서 지칭될 수 있다. 컨트롤러 장치(104)를 통하여 제공되는 입력에 응답하여, 재생 장치는 동기화로 오디오 컨텐츠를 재생하는 새롭거나 상이한 그룹을 형성하도록 동적으로 그룹화되고 그룹화 해제될 수 있다. 예를 들어, 도 3a를 참조하면, 구역 A는 두 구역의 재생 장치를 포함하는 구역 그룹을 형성하도록 구역 B와 그룹화될 수 있다. 다른 예시에서, 구역 A는 하나 이상의 다른 구역 C-I과 그룹화될 수 있다. 구역 A-I는 많은 방식으로 그룹화되고 그룹화 해제될 수 있다. 예를 들어, 구역 A-I 중 셋, 넷, 다섯 이상(예컨대, 전부)이 그룹화될 수 있다. 그룹화되는 경우, 개별 장치 및/또는 결합된 재생 장치의 구역은 이전에 참조된 미국 특허 제8,234,395호에 설명된 바와 같이 서로 동기로 오디오를 재생할 수 있다. 그룹화되고 결합된 장치는 위에서 논의되고 아래에서 더 자세하게 설명되는 것과 같이 트리거 이벤트에 응답하여 생길 수 있는, 휴대용 및 고정 재생 장치 사이의 연계의 예시적인 유형이다.
다양한 구현예에서, 환경 내 구역은 도 3a에 도시된 것처럼 "식당 + 주방"과 같은, 구역 그룹 내에서 구역의 이름의 조합 또는 구역 그룹 내의 구역의 디폴트 이름일 수 있는 특정 이름이 할당될 수 있다. 일부 실시예에서, 구역 그룹은 도 3a에도 도시된 것처럼, "Nick의 공간"과 같은 사용자에 의해 선택된 고유한 이름이 주어질 수 있다. "Nick의 공간"이라는 이름은 "주 침실"이라는 공간 이름과 같은 구역 그룹에 대한 이전 이름 위로 사용자에 의해 선정된 이름일 수 있다.
다시 도 2a를 참조하면, 일부 데이터는 재생 구역, 재생 장치(들) 및/또는 그것과 연관된 구역 그룹의 상태를 설명하도록 정기적으로 업데이트되고 사용되는 하나 이상 상태 변수로서 메모리(213)에 저장될 수 있다. 메모리(213)는 또한 장치 중 하나 이상이 시스템과 연관된 최신 데이터를 가지도록 장치에 따라 가끔 공유될 수 있는 미디어 재생 시스템(100)의 다른 장치의 상태와 연관된 데이터를 포함할 수 있다.
일부 실시예에서, 재생 장치(102)의 메모리(213)는 상태와 연관된 다양한 변수 유형의 인스턴스를 저장할 수 있다. 변수 인스턴스는 유형에 대응하는 식별자(예컨대, 테그)와 저장될 수 있다. 예를 들어, 일부 식별자는 구역의 재생 장치(들)을 식별하기 위한 제1 유형 "a1", 구역에서 결합될 수 있는 재생 장치(들)을 식별하기 위한 제2 유형 "b1", 구역이 속할 수 있는 그룹 구역을 식별하기 위한 제3 유형 "c1"일 수 있다. 도 1a에서 관련된 예시와 같이, 파티오와 연관된 식별자는 파티오가 특정 구역의 유일한 재생 장치이고 구역 그룹에 있지 않다는 것을 나타낼 수 있다. 거실과 연관된 식별자는 거실이 다른 구역과 그룹화되지 않았지만, 결합된 재생 장치(102a, 102b, 102j 및 102k)를 포함한다는 것을 나타낼 수 있다. 식당과 연관된 식별자는 식당이 식당+주방 그룹의 일부이고, 장치(103f 및 102i)가 결합됨을 나타낼 수 있다. 주방과 연관된 식별자는 식당+주방 구역 그룹의 일부가 되는 주방 덕에 동일하거나 비슷한 정보를 나타낼 수 있다. 다른 예시적인 구역 변수 및 식별자는 아래에서 설명된다.
또 다른 예시에서, MPS(100)는 도 3a에 도시된 것처럼, 영역과 연관된 식별자와 같은, 구역 및 구역 그룹의 다른 연계를 나타내는 변수 또는 식별자를 포함할 수 있다. 영역은 구역 그룹 내에 있지 않은 구역 및/또는 구역 그룹의 클러스터를 수반한다. 예를 들어, 도 3a는 "제1 영역"이라고 명명된 제1 영역과 "제2 영역"이라고 명명된 제2 영역을 도시한다. 제1 영역은 파티오, 서재, 식당, 주방 및 화장실의 구역 및 구역 그룹을 포함한다. 제2 영역은 화장실, Nick의 공간, 침실 및 거실의 구역 및 구역 그룹을 포함한다. 일 양상에서, 영역은 다른 클러스터의 하나 이상의 구역 및/또는 구역 그룹을 공유하는 구역 그룹 및/또는 구역의 클러스터에 적용하도록 사용될 수 있다. 이러한 측면에서, 그러한 영역은, 구역을 다른 구역 그룹과 공유하지 않는 구역 그룹과 다르다. 영역을 구현하기 위한 기법의 추가 예시는 예를 들어, 2017년 8월 21일 출원되고 제목이 "명칭에 기초한 공간 연계"인 미국 특허 출원 제15/682,506호 및 2007년 9월 11일 출원되고 제목이 "멀티 구역 미디어 시스템에서 그룹화 제어 및 조정"인 미국 특허 제8,483,853호에서 발견될 수 있다. 이러한 출원 각각은 그 전체가 참조로서 여기에 포함된다. 일부 실시예에서, MPS(100)는 영역을 구현하지 않을 수 있으며, 이 경우 시스템은 영역과 연관된 변수를 저장하지 않을 수 있다.
메모리(213)는 다른 데이터를 저장하도록 더 구성될 수 있다. 그러한 데이터는 재생 장치(또는 일부 다른 재생 장치(들))가 연관될 수 있는 재생 큐 또는 재생 장치(102)에 의해 접근 가능한 오디오 소스와 관련될 수 있다. 이하에서 설명되는 실시예에서, 메모리(213)는 음성 입력을 프로세싱하는 경우, 특정 VAS를 선택하기 위해 명령 데이터의 세트를 저장하도록 구성된다.
동작 동안, 도 1a의 환경에서 하나 이상의 재생 구역은 각각 상이한 오디오 컨텐츠를 재생할 수 있다. 예를 들어, 사용자는 파티오 구역에서 그릴에 굽고 재생 장치(102c)에 의해 재생되는 힙합 음악을 들을 수 있는 한편, 다른 사용자는 주방 구역에서 음식을 준비하고 재생 장치(102i)에 의해 재생되는 클래식 음악을 들을 수 있다. 다른 예시에서, 재생 구역은 다른 재생 구역과 동기화로 동일한 오디오 컨텐츠를 재생할 수 있다. 예를 들어, 사용자는 재생 장치(102n)가 파티오 구역에 있는 재생 장치(102c)에 의해 재생하고 있는 동일한 힙합 음악을 재생하고 있는 사무실 구역에 있을 수 있다. 이러한 경우에, 재생 장치(102c 및 102n)는 사용자가 다른 재생 구역 사이를 이동하면서 소리 내어 재생되고 있는 오디오 컨텐츠를 끊김 없이 (또는 적어도 실질적으로 끊김 없이) 즐길 수 있도록 동기화로 힙합 음악을 재생할 수 있다. 재생 구역 사이의 동기화는 이전에 참조된 미국 특허 제 8,234,395호에 설명되는 바와 같이, 재생 장치 중의 동기화와 비슷한 방식으로 달성될 수 있다.
위에서 제안되는 바와 같이, MPS(100)의 구역 구성은 동적으로 수정될 수 있다. 이와 같이, MPS(100)는 다수의 구성을 지원한다. 예를 들어, 사용자가 하나 이상의 재생 장치를 구역으로부터 또는 구역으로 물리적으로 이동하는 경우, MPS(100)는 변화(들)를 수용하도록 재구성될 수 있다. 예를 들어, 사용자가 재생 장치(102c)를 파티오 구역으로부터 사무실 구역으로 물리적으로 이동하는 경우, 사무실 구역은 재생 장치(102c 및 102n) 둘 다를 포함할 수 있다. 일부 경우에서, 사용자는 예를 들어, 컨트롤러 장치(104) 및/또는 음성 입력 중 하나를 사용하여, 사무실 구역에 있는 플레이어를 재명칭하고/거나 이동된 재생 장치(102c)를 사무실 구역과 페어링 또는 그룹화할 수 있다. 다른 예시로서, 하나 이상의 재생 장치가 이미 재생 구역이 아닌 집 환경에서 특정 장소로 이동되는 경우, 이동된 재생 장치(들)는 특정 공간에 대한 재생 장치와 연관되거나 재명칭될 수 있다.
또한, MPS(100)의 상이한 재생 구역은 동적으로 구역 그룹으로 조합되거나 개별 재생 구역으로 나누어질 수 있다. 예를 들어, 식당 구역과 주방 구역은 저녁 파티를 위해 구역 그룹으로 조합되어 재생 장치(102i 및 102l)가 동기로 오디오 컨텐츠를 렌더링할 수 있다. 다른 예시로서, 서재 구역 내 결합된 재생 장치는 (i) 텔레비전 구역과 (ii) 별도 청취 구역으로 나누어질 수 있다. 텔레비전 구역은 앞쪽 재생 장치(102b)를 포함할 수 있다. 청취 구역은 위에서 설명된 바와 같이, 그룹화, 페어링 또는 병합될 수 있는 오른쪽, 왼쪽 및 서브 재생 장치(102a, 102j 및 102k)를 포함할 수 있다. 서재 구역을 이러한 방식으로 나누는 것은 일 사용자가 거실 공간의 일 영역에 있는 청취 구역에서 음악을 듣도록 허용하고, 다른 사용자가 거실 공간의 다른 영역에서 텔레비전을 볼 수 있도록 허용할 수 있다. 관련된 예시에서, 사용자는 텔레비전 구역과 청취 구역으로 분리되기 이전에 서재 구역을 제어하도록 NMD(103a 또는 103b)(도 1b) 중 하나를 이용할 수 있다. 분리되면, 청취 구역은 예를 들어, NMD(103a)의 근처에 있는 사용자에 의해 제어될 수 있고, 텔레비전 구역은 예를 들어, NMD(103b)의 근처에 있는 사용자에 의해 제어될 수 있다. 그러나, 위에서 설명된 바와 같이, NMD(103) 중 임의의 것은 MPS(100)의 다양한 재생 및 다른 장치를 제어하도록 구성될 수 있다.
c. 예시적인 컨트롤러 장치
도 4a는 도 1a의 MPS(100)의 컨트롤러 장치(104) 중 선택된 하나의 일부 양상을 예시하는 기능 블록도이다. 그러한 컨트롤러 장치는 또한 여기서 "제어 장치" 또는 "컨트롤러"로서 지칭될 수 있다. 도 4a에 도시된 컨트롤러 장치는 컴포넌트를 포함할 수 있는데, 이는 일반적으로 프로세서(412), 프로그램 소프트웨어(414)를 저장하는 메모리(413), 적어도 하나의 네트워크 인터페이스(424) 및 하나 이상의 마이크로폰(422)과 같은, 위에서 설명된 네트워크 장치의 일부 컴포넌트와 유사하다. 일 예시에서, 컨트롤러 장치는 MPS(100)를 위한 전용 컨트롤러일 수 있다. 다른 예시에서, 제어 장치(300)는 예컨대 아이폰(iPhone)??, 아이패드(iPad)?? 또는 임의의 다른 스마트폰, 타블렛 또는 네트워크 장치(예컨대, PC 또는 맥(Mac)??과 같은 네트워킹된 컴퓨터)와 같은 미디어 재생 시스템 컨트롤러 어플리케이션 소프트웨어가 설치될 수 있는 네트워크 장치일 수 있다.
컨트롤러 장치(104)의 메모리(413)는 컨트롤러 어플리케이션 소프트웨어 및 시스템(100)의 사용자 및/또는 MPS(100)와 연관된 다른 데이터를 저장하도록 구성될 수 있다. 메모리(413)는 MPS(100)의 구성, 제어 및/또는 사용자 접근을 용이하게 하는 것과 같은, 일부 기능을 달성하도록 프로세서(412)에 의해 실행 가능한 소프트웨어(414)에서 명령어로 로드될 수 있다. 컨트롤러 장치(104)는 위에서 설명된 바와 같이 무선 인터페이스의 형태를 취할 수 있는 네트워크 인터페이스(424)를 통하여 다른 네트워크 장치와 통신하도록 구성될 수 있다.
일 예시에서, (예컨대, 상태 변수와 같은) 시스템 정보는 네트워크 인터페이스(424)를 통하여 컨트롤러 장치(104)와 다른 장치 사이에서 통신될 수 있다. 예를 들어, 컨트롤러 장치(104)는 재생 장치, NMD 또는 다른 네트워크 장치로부터 MPS(100)에 있는 재생 구역과 구역 그룹 구성을 수신할 수 있다. 마찬가지로, 컨트롤러 장치(104)는 네트워크 인터페이스(424)를 통하여 재생 장치 또는 다른 네트워크 장치로 그러한 시스템 정보를 전송할 수 있다. 일부 경우에서, 다른 네트워크 장치는 다른 컨트롤러 장치일 수 있다.
컨트롤러 장치(104)는 또한 네트워크 인터페이스(424)를 통하여 재생 장치로 음량 제어 및 오디오 재생 제어와 같은 재생 장치 제어 명령을 통신할 수 있다. 위에서 제안된 바와 같이, MPS(100)의 구성으로의 변화는 또한 컨트롤러 장치(104)를 사용하여 사용자에 의해 수행될 수 있다. 구성 변경은 다른 것들 중에서도 구역으로/으로부터 하나 이상의 재생 장치를 추가/제거하는 것, 구역 그룹으로/으로부터 하나 이상의 구역을 추가/제거하는 것, 결합 또는 병합된 재생 장치를 형성, 결합 또는 병합된 재생 장치로부터 하나 이상의 재생 장치를 분리하는 것을 포함할 수 있다.
도 4a에 도시된 바와 같이, 컨트롤러 장치(104)는 또한, 일반적으로 MPS(100)의 제어와 사용자 접근을 용이하게 하도록 구성되는 사용자 인터페이스를 포함한다. 사용자 인터페이스(440)는 도 4b와 4c에 도시되는 컨트롤러 인터페이스(440a 및 440b)와 같은 다양한 그래픽 컨트롤러 인터페이스를 제공하도록 구성되는 터치 스크린 디스플레이 또는 기타 물리적 인터페이스를 포함할 수 있다. 도 4b 및 4c를 함께 참조하면, 컨트롤러 인터페이스(440a 및 440b)는 재생 제어 영역(442), 재생 구역 영역(443), 재생 상태 영역(444), 재생 큐 영역(446) 및 소스 영역(448)을 포함한다. 도시된 바와 같이 사용자 인터페이스는 도 4a에서 도시되는 컨트롤러 장치와 같이, 네트워크 장치 상에서 제공되고 MPS(100)과 같은, 미디어 재생 시스템을 제어하도록 사용자에 의해 접근될 수 있는 인터페이스의 단순한 일 예시이다. 포맷, 스타일 및 상호작용 순서를 변동하는 다른 사용자 인터페이스가 하나 이상의 네트워크 장치 상에서 대안적으로 구현되어 미디어 재생 시스템으로 비슷한 제어 접근을 제공할 수 있다.
재생 제어 영역(442)(도 4b)은, 선택되는 경우, 선택된 재생 구역 또는 구역 그룹 내 재생 장치가 재생 또는 일시 정지, 빨리 감기, 뒤로 감기, 다음으로 스킵, 이전으로 스킵, 셔플(shuffle) 모드 시작/종료, 크로스 페이드 모드(cross fade mode) 시작/종료 등을 하도록 하는 (예컨대, 터치의 방식으로 또는 커서를 이용함으로써) 선택 가능한 아이콘을 포함할 수 있다. 재생 제어 영역(442)은 또한 선택되는 경우, 다른 가능성 중에서도 이퀄라이제이션 설정(equalization setting) 및/또는 재생 음량을 변경하는 선택 가능한 아이콘을 포함할 수 있다.
재생 구역 영역(443)(도 4c)은 MPS(100) 내에 있는 재생 구역의 표현(representation)을 포함할 수 있다. 재생 구역 영역(443)은 또한 도시된 바와 같이 식당+주방 구역 그룹과 같은 구역 그룹의 표현을 포함할 수 있다. 일부 실시예에서, 재생 구역의 그래픽적 표현은, 다른 가능성 중에서도, 결합된 구역의 생성, 구역 그룹의 생성, 구역 그룹의 분리 및 구역 그룹의 재명칭과 같은 MPS(100)에서의 재생 구역을 관리하거나 구성하기 위한 추가의 선택 가능한 아이콘을 띄우도록 선택 가능할 수 있다.
예를 들면, 도시된 바와 같이, "그룹" 아이콘이 재생 구역의 그래픽적 표현 각각 내에서 제공될 수 있다. 특정 구역의 그래픽적 표현 내에서 제공되는 "그룹" 아이콘은 특정 구역과 그룹화될 MPS(100) 내 하나 이상의 다른 구역을 선택하기 위한 옵션을 띄우도록 선택 가능할 수 있다. 그룹화 되면, 특정 구역과 그룹화된 구역 내 재생 장치는 특정 구역 내 재생 장치와 동기화로 오디오 컨텐츠를 재생하도록 구성될 것이다. 비슷하게, "그룹" 아이콘이 구역 그룹의 그래픽적 표현 내에서 제공될 수 있다. 이러한 경우에, "그룹" 아이콘은 구역 그룹으로부터 제거될 구역 그룹 내 하나 이상의 구역을 선택 해제하기 위한 옵션을 띄우도록 선택 가능할 수 있다. 사용자 인터페이스를 통하여 구역을 그룹화 및 그룹화 해제하기 위한 다른 상호 작용 및 구현도 가능하다. 재생 구역 영역(443)(도 4c)에서 재생 구역의 표현은 재생 구역 또는 구역 그룹 구성이 변경됨에 따라 동적으로 갱신될 수 있다.
재생 상태 영역(444)(도 4b)은 선택된 재생 구역 또는 구역 그룹에서 현재 재생되거나, 이전에 재생되었거나 다음에 재생하도록 스케줄링되는 오디오 컨텐츠의 그래픽적 표현을 포함할 수 있다. 선택된 재생 구역 또는 구역 그룹은 재생 구역 영역(443) 및/또는 재생 상태 영역(444) 내에서와 같이 컨트롤러 인터페이스 상에서 시각적으로 구분될 수 있다. 그래픽적 표현은 트랙 타이틀(track title), 아티스트 이름, 앨범 이름, 앨범 년도, 트랙 길이 및/또는 컨트롤러 인터페이스를 통하여 MPS(100)를 제어하는 경우, 사용자가 알기에 유용할 수 있는 다른 관련 정보를 포함할 수 있다.
재생 큐 영역(446)은 선택된 재생 구역 또는 구역 그룹과 연관된 재생 큐 내의 오디오 컨텐츠의 그래픽적 표현을 포함할 수 있다. 일부 실시예에서, 각각의 재생 구역 또는 구역 그룹은 재생 구역 또는 구역 그룹에 의한 재생을 위한 0 개 이상 오디오 항목에 대응하는 정보를 포함하는 재생 큐와 연관될 수 있다. 예를 들어, 재생 큐에 있는 각각의 오디오 항목은 이후 재생 장치에 의해 재생될 수 있는 로컬 오디오 컨텐츠 소스 또는 네트워킹된 오디오 컨텐츠 소스로부터 오디오 항목을 탐색 및/또는 검색하도록 재생 구역 또는 구역 그룹에서 재생 장치에 의해 사용될 수 있는 인터넷 식별자(URI), 자료 위치 주소(URL), 또는 일부 다른 식별자를 포함할 수 있다.
일 예시에서, 플레이리스트는 재생 큐에 추가될 수 있으며, 이러한 경우에 플레이리스트 내 각 오디오 항목에 대응하는 정보는 재생 큐에 추가될 수 있다. 다른 예시에서, 재생 큐에 있는 오디오 항목은 플레이리스트로서 저장될 수 있다. 추가적인 예시에서, 재생 구역 또는 구역 그룹이 재생 기간을 가지는 개별 오디오 항목 보다는 달리 멈출 때까지 지속적으로 재생할 수 있는 인터넷 라디오와 같은, 계속해서 스트리밍되는 오디오 컨텐츠를 재생하는 경우, 재생 큐는 비어 있거나 차 있더라도, "사용되지 않음"일 수 있다. 대안적인 실시예에서, 재생 큐는 재생 구역 또는 구역 그룹이 그러한 아이템을 재생하고 있는 경우, 인터넷 라디오 및/또는 다른 스트리밍 오디오 컨텐츠 항목을 포함할 수 있고, "사용 중"일 수 있다. 다른 예시도 또한 가능하다.
재생 구역 또는 구역 그룹이 "그룹화" 또는 "그룹화 해제"되는 경우, 영향을 받는 재생 구역 또는 구역 그룹과 연관되는 재생 큐는 정리되거나 재연관될 수 있다. 예를 들어, 제1 재생 큐를 포함하는 제1 재생 구역이 제2 재생 큐를 포함하는 제2 재생 구역과 그룹화되면, 규정된 구역 그룹은 처음에는 비어 있고, (제2 재생 구역이 제1 재생 구역으로 추가된 경우와 같이) 제1 재생 큐로부터의 오디오 항목을 포함하고, (제1 재생 구역이 제1 재생 구역으로 추가되는 경우와 같이) 제2 재생 큐로부터의 오디오 항목 또는 제1 및 제2 재생 큐 둘 다로부터의 오디오 항목의 조합을 포함하는 연관된 재생 큐를 가질 수 있다. 차후에, 규정된 구역 그룹이 그룹화 해제되는 경우, 결과적인 제1 재생 구역은 이전의 제1 재생 큐와 재연관될 수 있거나, 비어 있거나 규정된 구역 그룹이 그룹화 해제되기 이전에 규정된 구역 그룹과 연관된 재생 큐로부터 오디오 항목을 포함하는 새로운 재생 큐와 연관될 수 있다. 유사하게, 결과적인 제2 재생 구역은 이전의 제2 재생 큐와 재연관될 수 있거나, 비어 있거나 규정된 구역 그룹이 그룹화 해제되기 이전에 규정된 구역 그룹과 연관된 재생 큐로부터 오디오 항목을 포함하는 새로운 재생 큐와 연관될 수 있다. 다른 예시도 가능하다.
계속 도 4b 및 4c를 참조하면, 재생 큐 영역(446)(도 4b) 내 오디오 컨텐츠의 그래픽적 표현은 트랙 타이틀, 아티스트 이름, 트랙 길이 및/또는 재생 큐에서 오디오 컨텐츠와 연관되는 다른 관련 정보를 포함할 수 있다. 일 예시에서, 오디오 컨텐츠의 그래픽적 표현은 재생 큐 및/또는 재생 큐에서 표현되는 오디오 컨텐츠를 관리 및/또는 조작하도록 추가의 선택 가능한 아이콘을 띄우도록 선택 가능할 수 있다. 예를 들어, 표현되는 오디오 컨텐츠는 다른 가능성 중에서도 재생 큐로부터 제거되거나, 재생 큐 내에서 다른 위치로 이동되거나 임의의 현재 오디오 컨텐츠 이후 또는 즉시 재생되도록 선택될 수 있다. 재생 구역 또는 구역 그룹과 연관된 재생 큐는 재생 구역 또는 구역 그룹 내 하나 이상의 재생 장치, 재생 구역 또는 구역 그룹에 있지 않은 재생 장치 및/또는 일부 다른 지정된 장치 상의 메모리에 저장될 수 있다. 그러한 재생 큐의 재생은 아마도 순차적이거나 무작위 순서로 큐의 미디어 항목을 재생하는 하나 이상의 재생 장치를 수반할 수 있다.
소스 영역(448)은 선택 가능한 오디오 컨텐츠 소스 및/또는 대응하는 VAS와 연관된 선택 가능한 음성 보조원(assistant)의 그래픽적 표현을 포함할 수 있다. VAS는 선택적으로 할당될 수 있다. 일부 예시에서, 아마존의 알렉사, 마이크로소프트의 콜타나 등과 같은 다수의 VAS는 동일한 NMD에 의해 작동될 수 있다. 일부 실시예에서, 사용자는 하나 이상의 NMD에 배타적으로 VAS를 할당할 수 있다. 예를 들어, 사용자는 도 1a에 도시된 거실에 있는 NMD(102a 및 102b) 중 하나 또는 둘 다에 제1 VAS를, 그리고 주방에 있는 NMD(103)에 제2 VAS를 할당할 수 있다. 다른 예시도 가능하다.
d. 예시적인 오디오 컨텐츠 소스
소스 영역(448)에 있는 오디오 소스는 오디오 컨텐츠가 선택된 재생 구역 또는 구역 그룹에 의해 검색되고 재생될 수 있는 오디오 컨텐츠 소스일 수 있다. 구역 또는 구역 그룹 내 하나 이상의 재생 장치는 다양한 이용 가능한 오디오 컨텐츠 소스로부터 (예컨대, 오디오 컨텐츠에 대하여 대응하는 URI 또는 URL에 따라) 재생 오디오 컨텐츠를 검색하도록 구성될 수 있다. 일 예시에서, 오디오 컨텐츠는 대응하는 오디오 컨텐츠 소스로부터 직접적으로 (예컨대, 라인인 연결을 통하여) 재생 장치에 의해 검색될 수 있다. 다른 예시에서, 오디오 컨텐츠는 하나 이상의 다른 재생 장치 또는 네트워크 장치를 통하여 네트워크 상에서 재생 장치로 제공될 수 있다. 이하에서 더 자세하게 설명된 바와 같이, 일부 실시예에서 오디오 컨텐츠는 하나 이상의 미디어 컨텐츠 서비스에 의해 제공될 수 있다.
예시적인 오디오 컨텐츠 소스는 다른 가능성 중에서도, 도 1의 MPS(100)와 같은 미디어 재생 시스템 내 하나 이상의 재생 장치의 메모리, 하나 이상의 네트워크 장치 상의 로컬 음악 라이브러리(예컨대, 컨트롤러 장치, 네트워크 가능한 개인 컴퓨터, 또는 네트워크 접속 기반 파일 서버(NAS)), 인터넷을 통하여 오디오 컨텐츠를 제공하는 스트리밍 오디오 서비스(예컨대, 클라우드 기반 음악 서비스) 또는 재생 장치 또는 네트워크 장치 상에서 라인인 입력 연결을 통하여 미디어 재생 시스템으로 연결되는 오디오 소스를 포함할 수 있다.
일부 실시예에서, 오디오 컨텐츠 소스는 도 1a의 MPS(100)과 같은 미디어 재생 시스템으로부터 추가 또는 제거될 수 있다. 일 예시에서, 하나 이상의 오디오 컨텐츠 소스가 추가, 제거 또는 갱신될 때마다 오디오 항목의 인덱싱(indexing)이 수행될 수 있다. 오디오 항목의 인덱싱은 미디어 재생 시스템 내 재생 장치에 의해 액세스 가능한 네트워크 상에서 공유되는 모든 폴더/디렉토리에서 식별 가능한 오디오 항목에 대하여 스캐닝하는 것 및 메타데이터(예컨대, 다른 것들 중에서도 타이틀, 아티스트, 앨범, 트랙 길이)와 탐색되는 각각의 식별 가능한 오디오 항목에 대한 URI 또는 URL과 같은 다른 연관되는 정보를 포함하는 오디오 컨텐츠 데이터베이스를 생성 또는 갱신하는 것을 수반할 수 있다. 오디오 컨텐츠 소스를 관리 및 유지하기 위한 다른 예시도 가능할 수 있다.
e. 예시적인 네트워크 마이크로폰 장치
도 5는 본 개시의 실시예 따라 구성된 NMD(503)를 도시하는 기능적 블록도이다. NMD(503)는 음성 캡쳐 컴포넌트("VCC")(560), 각각 사용 가능하게 VCC(560)와 결합된 복수의 식별 엔진(569) 및 적어도 하나의 음성 추출기(572)를 포함한다. NMD(503)는 위에서 설명한 마이크로폰(222) 및 적어도 하나의 네트워크 인터페이스(224)를 더 포함하고, 명확성을 위해 도 5에 도시되지 않은 오디오 증폭기, 스피커, 사용자 인터페이스 등과 같은, 다른 컴포넌트도 포함할 수 있다.
NMD(503)의 마이크로폰(222)은 NMD(503)의 환경으로부터 VCC(560)로 검출된 사운드 SD를 제공하도록 구성된다. 검출된 사운드 SD는 하나 이상의 아날로그 또는 디지털 신호의 형태를 취할 수 있다. 예시적인 구현예에서, 검출된 사운드 SD는 VCC로 피드되는, 각 채널(562)과 연관된 복수의 신호로 구성될 수 있다.
각 채널(562)은 특정 마이크로폰(222)에 대응할 수 있다. 예를 들어, 6개 마이크로폰을 가지는 NMD는 6 개의 대응하는 채널을 가질 수 있다. 검출된 사운드 SD의 각 채널은 다른 채널과 일부 유사성을 포함할 수 있지만, 일부 고려사항과 다를 수 있고, 이는 다른 채널의 마이크로폰에 관한 소정의 채널의 대응하는 마이크로폰의 위치로 인한 것일 수 있다. 예를 들어, 검출된 사운드 SD의 채널 중 하나 이상은 다른 채널보다 배경 잡음에 대한 회화의 더 큰 신호 대 잡음비("SNR")를 가질 수 있다.
도 5에 더 도시된 바와 같이, VCC(560)는 AEC(564), 공간 프로세서(566) 및 하나 이상의 버퍼(568)를 포함한다. 동작에서, AEC(564)는 검출된 사운드 SD를 수신하고 필터링하거나 아니면 사운드를 프로세싱하여, 에코를 억제하고/거나 검출된 사운드 SD의 품질을 개선한다. 프로세싱된 사운드는 이후, 공간 프로세서(566)로 보내질 수 있다.
공간 프로세서(566)는 보통 검출된 사운드 SD를 분석하고 사운드의 진폭(예컨대, 데시벨 레벨), 주파수 스펙트럼, 방향성 등과 같은 일부 특성을 식별하도록 구성된다. 일 측면에서, 공간 프로세서(566)는 위에서 논의된 바와 같이, 검출된 사운드SD의 구성 채널(562) 내 유사성과 차이에 기초하여 잠재적인 사용자 회화로부터 검출된 사운드 SD에 있는 주위 소음을 필터링 또는 억제하는 것을 도울 수 있다. 일 가능성에서, 공간 프로세서(566)는 회화를 다른 사운드로부터 구별하는 메트릭스를 모니터링할 수 있다. 그러한 메트릭스는 예를 들어, 배경 잡음에 관한 회화 대역 내의 에너지 및 가장 흔한 배경 잡음에서 보다 회화에서 보통 낮은 회화 대역 내의 엔트로피 - 스펙트럼 구조의 측정 -를 포함할 수 있다. 일부 구현예에서, 공간 프로세서(566)는 회화 존재 가능성을 결정하도록 구성될 수 있고, 그러한 기능의 예시는 전체 내용이 참조로서 여기에 포함되는 2018년 5월 18일 출원되고 제목이 "소음 억제 회화 검출을 위한 선형 필터링"인 미국 특허 출원 제15/984,073호에 개시된다.
동작에서, 하나 이상의 버퍼(568) - 이 중 하나 이상은 메모리의 일부 또는 메모리에서 독립된 것임 -는 검출된 사운드 SD에 대응하는 데이터를 캡쳐한다. 더 구체적으로, 하나 이상의 버퍼(568)는 업스트림 AEC(564) 및 공간 프로세서(566)에 의해 프로세싱된 검출된 사운드 데이터를 캡쳐한다.
일반적으로, 검출된 사운드 데이터는 마이크로폰(222)에 의해 검출된 사운드의 디지털 표현(즉, 사운드 데이터 스트림)SDS을 형성한다. 실시에서, 사운드 데이터 스트림 SDS은 다양한 형태를 취한다. 일 가능성으로서, 사운드 데이터 스트림 SDS은 각각 하나 이상의 사운드 샘플을 포함할 수 있는 프레임으로 구성될 수 있다. 프레임은 NMD(503)의 식별 엔진(569) 및 음성 추출기(572)와 같은, 다운스트림 컴포넌트에 의한 추가 처리를 위해 하나 이상의 버퍼(568)로부터 스트리밍(즉, 판독됨)될 수 있다.
일부 구현예에서, 적어도 하나의 버퍼(568)는 슬라이딩 윈도우 접근법을 이용하여 검출된 사운드 데이터를 캡쳐하며, 여기서 소정 양의 가장 최근에 캡쳐된 검출된 사운드 데이터가 적어도 하나의 버퍼(568)에서 유지되는 한편, 오래된 검출된 사운드 데이터는, 그들이 윈도우의 범위 밖에 있는 경우 덮어쓰여진다(overwrite). 예를 들어, 적어도 하나의 버퍼(568)는 소정의 시간에서 사운드 표본의 20 프레임을 임시로 유지하고, 만료 기간 이후에 가장 오래된 프레임을 버리고, 이후 사운드 표본의 19개의 이전 프레임에 더해지는 새로운 프레임을 캡쳐할 수 있다.
실시에서, 사운드 데이터 스트림 SDS이 프레임으로 구성되는 경우, 프레임은 다양한 특성을 가지는 다양한 형태를 취할 수 있다. 일 가능성으로서, 프레임은 샘플링 레이트(sampling rate)(예컨대, 44,100Hz)에 기초할 수 있는 일부 해상도(예컨대, 16 비트의 해상도)를 가지는 오디오 프레임의 형태를 취할 수 있다. 추가적으로 또는 대안적으로, 프레임은 다른 예시 중에서도, 주파수 응답, 전력 입력 레벨, SNR, 마이크로폰 채널 식별 및/또는 소정의 사운드 표본의 다른 정보를 나타내는 메타 데이터와 같이, 프레임이 정의하는 소정의 사운드 표본에 대응하는 정보를 포함할 수 있다. 따라서 일부 실시예에서, 프레임은 사운드의 부분(예컨대, 소정의 사운드 표본 중 하나 이상의 샘플)과 사운드의 부분에 대한 메타 데이터를 포함할 수 있다. 다른 실시예에서, 프레임은 사운드의 부분(예컨대, 소정의 사운드 표본 중 하나 이상의 샘플) 또는 사운드의 부분에 대한 메타 데이터만을 포함할 수 있다.
임의의 경우에서, NMD(503)의 다운스트림 컴포넌트는 사운드 데이터 스트림 SDS를 프로세싱할 수 있다. 예를 들어, 식별 엔진(569)은 하나 이상의 식별 알고리즘을 사운드 데이터 스트림 SDS(예컨대, 스트리밍된 사운드 프레임)에 적용하여 검출된 사운드 SD에서 잠재적인 활성 단어를 스폿하도록 구성될 수 있다. 식별 엔진(569)은 도 7에 관하여 이하에서 더 자세하게 설명된 바와 같이 키워드 스포터(576), 제1 활성 단어 엔진(570a), 제2 활성 단어 엔진(570b) 및 선택적으로 다른 엔진(571a)을 포함한다. 식별 엔진(569)이 잠재적인 활성 단어를 스폿하는 경우, 식별 엔진(569) 중 하나 이상은 "활성 단어 이벤트"("활성 단어 트리거"로도 지칭됨)의 표시를 음성 추출기(572)에 제공할 수 있다.
활성 단어 이벤트에 응답하여 (예를 들어, 활성 단어 이벤트를 나타내는 식별 엔진(569)로부터의 신호에 응답하여), 음성 추출기(572)는 사운드 데이터 스트림 SDS을 수신하고 포맷(예컨대, 패킷화)하도록 구성된다. 예를 들어, 음성 추출기(572)는 사운드 데이터 스트림 SDS의 프레임을 메시지로 패킷화한다. 음성 추출기(572)는 네트워크 인터페이스(218)를 통하여 VAS(190)(도 1b)와 같은 원격 VAS로 실시간으로 또는 거의 실시간으로 음성 입력을 포함할 수 있는 이러한 메시지MV를 전송하거나 스트리밍한다.
VAS는 NMD(503)로부터 송신된 메시지 MV에 포함된 사운드 데이터 스트림 SDS를 프로세싱하도록 구성된다. 보다 구체적으로, VAS는 사운드 데이터 스트림 SDS에 기초하여 음성 입력을 식별하도록 구성된다. 도 6a를 참조하면, 음성 입력(680)은 활성 단어 부분(680a) 및 발화 부분(680b)을 포함할 수 있다. 활성 단어 부분(680a)은 활성 단어 이벤트를 일으킨 검출된 사운드에 대응한다. 예를 들어, 활성 단어 부분(680a)은 식별 엔진(569)으로 하여금 활성 단어 이벤트의 표시를 음성 추출기(572)로 제공하도록 한 검출된 사운드에 대응한다. 발화 부분(680b)은 활성 단어 부분(680a)에 이어 사용자 요청을 잠재적으로 포함하는 검출된 사운드에 대응한다.
예시와 같이, 도 6b는 예시적인 제1 사운드 표본을 도시한다. 이러한 예시에서, 사운드 표본은 도 6a의 스포팅된 활성 단어(680a)와 연관된 사운드 데이터 스트림 SDS(예컨대, 하나 이상의 오디오 프레임)에 대응한다. 예시된 바와 같이, 예시적인 제1 사운드 표본은 (i) 프리롤 부분으로 지칭될 수 있는 활성 단어가 언급되기 직전(시간 t0와 t1 사이), (ii) 활성 미터 부분으로 지칭될 수 있는 활성 단어가 언급되는 동안(t1과 t2 사이) 및/또는 (iii) 포스트 롤 위치로 지칭될 수 있는 활성 단어가 언급된 이후(t2와 t3 사이)에 재생 장치(102i)의 환경에서 검출된 사운드를 포함한다. 다른 사운드 표본도 가능하다.
보통, VAS는 활성 단어의 존재를 입증하도록 사운드 데이터 스트림 SDS 내의 활성 단어 부분(680a)을 먼저 프로세싱할 수 있다. 일부 경우에서, VAS는 활성 단어 부분(680a)이 거짓 활성 단어(예를 들어, "알렉사"가 타겟 활성 단어인 경우, 단어 "일렉션")를 포함한다고 결정할 수 있다. 그러한 발생에서, VAS는 NMD(503)(도 5)로 NMD(503)에 대한 표시와 응답을 송신하여 사운드 데이터의 추출을 중단시키고, 이는 음성 추출기(572)로 하여금 VAS로의 검출된 사운드 데이터의 추가 스트리밍을 중지하도록 할 수 있다. 식별 엔진(569)(예컨대, 키워드 스포터(576)) 중 하나 이상은 다른 활성 단어 이벤트로 이어지는 다른 잠재적 활성 단어까지 사운드 표본 모니터링을 계속하거나 재개할 수 있다. 일부 구현예에서, VAS는 활성 단어 부분(680a)을 프로세싱하거나 수신하지 않을 수 있지만 대신 발화 부분(680b)만을 프로세싱한다.
임의의 경우에서, VAS는 검출된 사운드 데이터에서 임의의 단어의 존재를 식별하고, 이러한 단어로부터 근본적인 의도를 결정하도록 발화 위치(680b)를 프로세싱한다. 단어는 일부 명령과 (제1 키워드(684a) 및 제2 키워드(684b)로서 도 6a에서 개별적으로 식별되는) 일부 키워드(684)에 대응할 수 있다. 키워드는 예를 들어, MPS(100) 내 특정 장치 또는 그룹을 식별하는 음성 입력(680)에 있는 단어일 수 있다. 예를 들어, 예시된 예시에서, 키워드(684)는 거실과 식당(도 1a)과 같은, 음악이 재생될 하나 이상의 구역을 식별하는 하나 이상의 단어일 수 있다.
단어의 의도를 결정하기 위해, VAS는 보통 MPS(100)의 하나 이상의 데이터베이스(도시되지 않음) 및 또는 VAS(도시되지 않음)와 연관된 하나 이상의 데이터베이스와 통신한다. 그러한 데이터베이스는 자연 언어 처리 및/또는 다른 처리를 위한 다양한 사용자 데이터, 분석 및 기타 정보를 저장할 수 있다. 일부 구현예에서, 그러한 데이터베이스는 음성 입력 프로세싱에 기초하여 뉴럴 네트워크를 위한 피드백 또는 적응 학습을 위해 업데이트될 수 있다. 일부 경우에서, 발화 부분(680b)은 도 6a에 도시된 것처럼, 사용자에 의해 언급되는 단어 사이에서 검출된 정지와 같은 추가적 정보(예를 들어, 비-회화 기간)를 포함할 수 있다. 정지는 분리된 명령, 키워드 또는 발화 부분(680b) 내에서 사용자에 의해 언급된 다른 정보의 위치를 경계 지을 수 있다.
일부 명령 기준에 기초하여, VAS는 명령(682)과 같은, 음성 입력 내 하나 이상의 명령을 식별하는 결과로서 동작을 취할 수 있다. 명령 기준은 다른 가능성 중에서도, 음성 입력 내의 일부 키워드의 포함에 기초될 수 있다. 추가적으로 또는 대안적으로, 명령에 대한 명령 기준은 하나 이상의 특정 명령의 식별과 함께 하나 이상의 제어 상태 및/또는 구역 상태 변수의 식별을 수반할 수 있다. 제어 상태 변수는 예를 들어, 음량의 레벨, 하나 이상의 장치와 연관된 큐 및 장치가 큐를 재생, 정지 등을 하는지 여부와 같은 재생 상태를 식별하는 지표를 포함할 수 있다. 구역 상태 변수는 예를 들어, 있다면, 구역 플레이어가 그룹화됨을 식별하는 지표를 포함할 수 있다.
음성 입력을 프로세싱한 이후, VAS는 음성 입력으로부터 결정된 의도에 기초하여 하나 이상의 동작을 수행하기 위한 명령어를 가지고 MPS(100)로 응답을 전송할 수 있다. 예를 들어, 음성 입력에 기초하여, VAS는 MPS(100)가 다른 동작 중에서도, 재생 장치(102) 중 하나 이상을 재생하는 것을 시작하고, 이러한 장치 중 하나 이상을 제어(예컨대, 음량을 높임/낮춤, 장치를 그룹화/그룹화 해제 등)하고, 일부 스마트 장치를 끄고 켜도록 지시할 수 있다. VAS로부터 응답을 수신한 이후, NMD(503)의 식별 엔진(569) 중 하나 이상은 위에서 논의된 바와 같이, 다른 잠재적인 활성 단어를 스폿할 때까지, 사운드 데이터 스트림 SDS을 모니터링하는 것을 계속하거나 재개할 수 있다.
도 5를 다시 참조하면, 복수 VAS 구현예에서, NMD(503)는 VAS 셀렉터(574)(파선으로 도시됨)를 포함할 수 있으며, 이는 소정의 활성 단어가 제1 활성 단어 엔진(570a), 제2 활성 단어 엔진(570b) 또는 추가적인 활성 단어 엔진(571)과 같은 특정 활성 단어 엔진에 의해 식별되는 경우, 음성 추출기의 추출과 적절한 VAS로의 사운드 데이터 스트림 SDS의 전파를 디렉트하도록 일반적으로 구성된다. 그러한 구현예에서, NMD(503)는 특정 VAS에 의해 각각 서포트되는 복수의 상이한 활성 단어 엔진 및/또는 음성 추출기를 포함할 수 있다. 상기 논의와 유사하게, 각 활성 단어 엔진은 하나 이상의 버퍼(568)로부터 사운드 데이터 스트림 SDS을 입력으로서 수신하고, 식별 알고리즘을 적용하여 적절한 VAS에 대한 활성 단어 트리거를 일으키도록 구성될 수 있다. 따라서, 일 예시로서, 제1 활성 단어 엔진(570a)은 활성 단어 "알렉사"를 식별하고 "알렉사"가 스폿되는 경우, NMD(503)로 하여금 아마존 VAS를 적용하도록 구성될 수 있다. 다른 예시로서, 제2 활성 단어 엔진(570b)은 활성 단어 "오케이, 구글"을 식별하고, "오케이, 구글"이 스폿되는 경우, NMD(503)로 하여금 구글 VAS를 적용하도록 구성될 수 있다. 단일 VAS 구현에서, VAS 셀렉터(574)는 생략될 수 있다.
추가적 또는 교대하는 구현예에서, NMD(503)는 NMD(503)가 원격 VAS의 지원없이 동작할 수 있도록 하는 다른 음성 입력 식별 엔진(571)(파선으로 도시됨)을 포함할 수 있다. 일 예시로서, 그러한 엔진은 검출된 사운드에서 일부 명령(예컨대, "재생", "정지", "켜" 등) 및/또는 소정의 재생 장치에 할당된 고유한 명칭(예컨대, "책장", "파티오", "사무실" 등)과 같은 일부 키워드 또는 어구를 식별할 수 있다. 이러한 명령, 키워드 및/또는 어구 중 하나 이상을 식별하는 것에 응답하여, NMD(503)는 오디오 처리 컴포넌트(216)(도 2a)로 하여금 하나 이상의 동작을 수행하도록 하는 신호(도 5에서 도시되지 않음)를 통신할 수 있다. 예를 들어, 사용자가 "헤이, 소노스. 사무실에서 음악을 멈춰"라고 말하는 경우, NMD(503)는 직접적이거나 간접적으로, 사무실 장치(102n)로 하여금 오디오 재생을 멈추도록 하는 MPS(100)의 하나 이상의 다른 장치를 통하여, 사무실 재생 장치(102n)로 신호를 통신할 수 있다. 원격 VAS로부터 지원에 대한 요구를 감소하거나 제거하는 것은 원격으로 음성 입력을 프로세싱하는 경우, 발생할 수 있는 지연 시간을 감소할 수 있다. 일부 경우에서, 이용된 식별 알고리즘은 이전의 활성 단어 없이 언급되는 명령을 식별하도록 구성될 수 있다. 예를 들어, 위의 예시에서, NMD(503)는 사용자가 "헤이, 소노스" 또는 다른 활성 단어를 먼저 말하지 않으면서 사무실에서 음악을 멈추도록 이벤트를 트리거하는 식별 알고리즘을 이용할 수 있다.
III. 활성 단어의 2 단계 검출을 위한 예시적인 시스템 및 방법.
도 5에서 도시된 바와 같이, NMD(503)의 식별 엔진(569)은 제1 및 제2 활성 단어 엔진(570a 및 570b)의 업스트림인 키워드 스포터(576) 및 위에서 논의된 다른 음성 입력 식별 엔진(571)을 포함한다. 동작에서, 사운드 데이트 스트림 SDS은 VCC(560)에서 키워드 스포터(576)로 보내진다. 키워드 스포터(576)는 사운드 데이터 스트림 SDS을 분석하여 활성 단어 또는 명령과 같은 키워드를 검출한다. 이하에서 더 자세히 설명되는 바와 같이, 일부 실시예에서, 키워드 스포터(576)는 사운드 데이터 스트림 SDS 내 후보 키워드를 식별한다. 사운드 데이터 스트림 SDS 내 하나 이상의 키워드 또는 후보 키워드를 스포팅하는 것에 응답하여, 키워드 스포터(576)는 또한 적절한 출력을 선택하여 추가 프로세싱을 위한 사운드 데이터 스트림 SDS를 제공한다. 예시된 바와 같이, 키워드 스포터(576)는 로컬 장치 기능을 위해 구성되는 제1 활성 단어 엔진(570a), 제2 활성 단어 엔진(570b) 및/또는 다른 엔진(571)으로 사운드 데이터 스트림 SDS을 보낼 수 있다. 일부 실시예에서, 출력 목적지는 사운드 데이터 스트림 SDS에서 키워드 스포터(576)를 통하여 스폿된 키워드에 기초하여 결정된다.
일부 실시예에서, 키워드 스포터(576)는 사운드 데이터 스트림 SDS 상의 제1 알고리즘을 수행하여 음성 입력에서 예비 또는 후보 활성 단어를 식별할 수 있다. 제1 알고리즘은 제1 및/또는 제2 활성 단어 엔진(570a 및 570b)에 의해 사용되는 다운스트림 알고리즘보다 연산적으로 덜 복잡하고/거나 메모리를 덜 소비할 수 있다. 일부 예시에서, 제1 알고리즘은 음성 입력이 "알렉사", "오케이, 구글" 및 "헤이, 시리"와 같은 복수의 가능한 활성 단어 중에서 하나의 활성 단어를 포함하는지 여부를 결정하는 데 사용된다.
일부 실시예에서, 키워드 스포터(576)는 사운드 데이터 스트림 SDS에서 후보 활성 단어에 범위 또는 확률 스코어를 할당하도록 구성된다. 예를 들어, 제1 알고리즘은, "오케이, 구글"이 후보 또는 예비 활성 단어로서 식별될 수 있는 경우에, 활성 단어 "오케이, 구글"이 사운드 데이터 스트림 SDS에서 검출된 80% 확률을 나타낼 수 있다. 일부 실시예에서, 식별된 후보 활성 단어는 일부 최소 임계값 확률 스코어를 요구한다. 예를 들어, 60% 또는 더 큰 확률로 식별된 활성 단어는 후보 활성 단어로서 식별될 수 있는 한편, 60% 확률 미만으로 식별된 활성 단어는 후보 활성 단어로서 식별되지 않을 수 있다. 특정 임계값은 예를 들어 50%, 60%, 70%, 80% 또는 90% 확률보다 더 큰, 다양한 실시예에서, 변동될 수 있다. 일부 실시예에서, 단일 사운드 데이터 스트림 SDS 내에서 두 가지 상이한 활성 단어는 각각 확률 스코어 또는 범위가 할당될 수 있어, 각각이 후보 활성 단어로서 식별된다.
키워드 스포터(576)에 의해 이용된 제1 알고리즘은 현재 알려진 또는 나중에 개발되는, 다양한 키워드 스포팅 알고리즘 또는 그것의 변형을 포함할 수 있다. 일부 실시예에서, 제1 알고리즘은 키워드 스포팅에 대한 심층 뉴럴 네트워크(DNN), 중첩형 뉴럴 네트워크(CNN) 또는 반복형 뉴럴 네트워크(RNN)과 같은 뉴럴 네트워크를 사용하여 많은 양의 키워드 특정 트레이닝 데이터에 기초하여 키워드를 모델링한다. 일부 실시예에서, 키워드 스포터(576)에 의해 활용되는 뉴럴 네트워크는 압축되어 뉴럴 네트워크에 대한 연산적 복잡성 및/또는 메모리 요구의 실질적인 감소를 달성한다. 이는 뉴럴 네트워크가 지나친 전력 또는 메모리 소비 없이 NMD 또는 재생 장치 상에 로컬로 저장될 수 있게 한다. 활성 단어 검출에 대한 뉴럴 네트워크의 압축에 관하여 추가적 세부사항은 도 8-10에 대하여 이하에서 설명된다.
키워드 스포터(576)를 통한 활성 단어의 예비 검출에 기초하여, 사운드 데이터 스트림 SDS이 제1 활성 단어 엔진(570a) 또는 제2 활성 단어 엔진(570b)과 같은 적절한 활성 단어 엔진으로 보내질 수 있거나, 음성 입력이 로컬 장치 기능을 위해 구성된 다른 엔진(571)으로 보내질 수 있다. 일부 실시예에서, 제1 및 제2 활성 단어 엔진(570a 및 570b)은 상이한 음성 지원 서비스에 연관될 수 있다. 예를 들어, 제1 활성 단어 엔진(570a)은 아마존 음성 지원 서비스와 연관될 수 있고, 제2 활성 단어 엔진(570b)는 구글 음성 지원 서비스와 연관될 수 있다. 여기에 도시되지 않은 또 다른 활성 단어 엔진은 예를 들어, 애플 음성 서비스 등과 연관된 제3 활성 단어 엔진을 포함할 수 있다. 이러한 활성 단어 엔진 각각은 키워드 스포터(576)에 의한 결정에 응답하여 인에이블(예컨대, 전력 공급) 및 디세이블(예컨대, 전력 차단)될 수 있다.
결과로서, 특정 활성 단어 엔진은 키워드 스포터(576)에 의해 선택되는 경우에만 인에이블 및 활성화될 수 있다.
활성 단어 엔진(570a 및 570b) 각각은 키워드 스포터(576)로부터 수신된 사운드 데이터 스트림 SDS를 분석하여 확인된 활성 단어를 검출하도록 구성된다. 확인된 활성 단어는 키워드 스포터(576)에 의해 이전에 식별된 동일한 활성 단어일 수 있다. 일부 실시예에서, (어떤 것이 선택되었는지에 따라) 제1 또는 제2 활성 단어 엔진(570a 또는 570b)은 보다 높은 정확성을 가지고, 따라서 검출된 활성 단어에서 보다 높은 신뢰성을 가진다. 제1 및 제2 활성 단어 엔진(570a 및 570b)은 확인된 활성 단어를 검출하기 위해 연산적으로 더 집약적인 알고리즘을 사용할 수 있다. 일 예시에서, 아마존 음성 서비스와 연관되는 키워드 스포터(576)는 "알렉사"의 후보 활성 단어를 식별하고 이후, 음성 입력의 추가 프로세싱을 위해 제1 활성 단어 엔진(570a)을 선택한다. 이후, 제1 활성 단어 엔진(570a)은 음성 입력을 분석하여 음성 입력에서 활성 단어 "알렉사"의 존재를 확인 또는 부정한다. 활성 단어가 확인되는 경우, NMD(503)는 위에서 논의된 바와 같이, 추가 프로세싱을 위해 사운드 데이터 스트림 SDS 의 추가적인 데이터(예컨대, 도 6a의 음성 발화 부분(680b))을 적절한 음성 지원 서비스로 보낼 수 있다. 활성 단어가 부정되는 경우, NMD(503)는 그 특정 사운드 데이터 스트림 SDS에 대하여 추가 동작을 수행하지 않을 수 있거나 NMD(503)는 예비 활성 단어가 제1 활성 단어 엔진(570a)에 의해 부정되었음을 알려주는 경보 또는 다른 출력을 제공할 수 있다.
위에서 언급된 바와 같이, 다양한 활성 단어 엔진(570a 및 570b)은 각각 상이한 음성 서비스와 연관될 수 있다. 그러한 활성 단어 엔진은 현재 알려지건 나중에 개발되건 이들의 변형이건 음성 입력에서 확인된 활성 단어를 식별하기 위해 상이한 알고리즘을 이용할 수 있다. 그러한 알고리즘의 예시는 (i) 캡쳐된 오디오의 슬라이딩 시간 간격 내에 있는 특징이 키워드 모델과 비교되는 슬라이딩 윈도우 모델, (ii) 비-키워드 모델이 키워드 회화로부터 비 키워드 회화를 구별하는 것에 도움이 되도록, 은닉 마코브 모델(Hidden Markov Model)(HMM)이 각 키워드 및 비-키워드로 구성되는 가비지 모델(garbage model), (iii) 입력 회화가 미리 정의된 키워드로 검색되는 격자로 디코딩되는, 대규모 어휘 연속 음성 인식(Large Vocabulary Continuous Speech Recognition; LVCSR)의 사용 및 (iv) 다량의 키워드 특정 트레이닝 데이터에 기초하여 키워드를 모델링하기 위한 심층 뉴럴 네트워크(DNN), 중첩형 뉴럴 네트워크(CNN) 또는 반복형 뉴럴 네트워크(RNN)와 같은, 뉴럴 네트워크의 사용을 포함하지만 이에 제한되지는 않는다.
이전에 언급된 바와 같이, 일부 실시예에서 키워드 스포터(576)는 사운드 데이터 스트림 SDS을 제1 활성 및/또는 제2 활성 단어 엔진(570a 및/또는 570b)으로 보내는 대신에 또는 그에 더하여, 사운드 데이터 스트림 SDS을 다른 엔진(571)으로 보낼 수 있다. 키워드 스포터(576)가 사운드 데이터 스트림 SDS에서 로컬 장치 명령과 같은 키워드를 식별하는 경우, 키워드 스포터(576)는 수행될 명령에 대하여 이러한 입력을 다른 엔진(571)으로 보낼 수 있다. 일 예시로서, 키워드 스포터(576)가 "음량을 키워"라는 키워드를 검출하는 경우, 키워드 스포터(576)는 사운드 데이터 스트림 SDS을 다른 엔진(571)으로 보낼 수 있다. 다양한 실시예에서, 다른 엔진(571)은, 재생 음량 변경하기, 트랙 제어 (정지하기, 스킵하기, 반복하기 등), 장치 그룹화 또는 그룹화 해제, 마이크로폰 비활성화하기, 임의의 다른 로컬 장치 기능과 같은 임의의 수의 상이한 기능을 수행하도록 구성되는 컴포넌트를 포함할 수 있다. 일부 실시예에서, 다른 엔진(571)은 사운드 데이터 스트림 SDS을 수신한 특정 NMD 상에서 기능을 수행하는 것에 제한된다. 다른 실시예에서, 다른 엔진(571)은 사운드 데이터 스트림 SDS을 수신하는 NMD와 통신하는 다른 재생 장치 또는 NMD 상에서 수행될 기능을 하게 할 수 있다.
a. 활성 단어의 예시적인 2 단계 검출
위에서 논의된 바와 같이, 일부 예시에서, NMD는 수신된 오디오를 모니터링하고 분석하여 임의의 활성 단어가 수신된 오디오에 존재하는지를 결정하도록 구성된다. 도 7은, 임의의 활성 단어가 수신된 오디오에 존재하는지를 결정하도록 NMD에 대한 방법(700)의 예시적인 실시예를 도시한다. 방법(700)은 여기에서 설명 및/또는 개시된 NMD 중 임의의 것 또는 현재 알려진 또는 나중에 개발되는 임의의 다른 NMD에 의해 구현될 수 있다.
방법(700)의 다양한 실시예는 블록(702 내지 718)에 의해 예시되는 하나 이상의 동작, 기능 및 작용을 포함한다. 블록도가 순차적인 순서로 예시되어 있지만, 이러한 블록도는 병렬 및/또는 여기에 개시되고 설명된 순서와 상이한 순서로도 수행될 수 있다. 또한, 다양한 블록은 요구되는 구현에 기초하여 더 적은 블록도로 결합되고/거나, 추가적인 블록도로 분할되고/거나 제거될 수 있다.
방법(700)은 블록(702)에서 시작하며 이는 NMD가 하나 이상의 마이크로폰을 통하여 검출된 사운드 데이터를 캡쳐하는 단계를 수반한다. 캡쳐된 사운드 데이터는 NMD의 환경으로부터의 사운드 데이터를 포함하고, 일부 실시예에서, 도 6a에서 도시되는 음성 입력(680)과 같은 음성 입력을 포함한다.
블록(704)에서, 방법(700)은 NMD가 제1 알고리즘을 사용하여 사운드 데이터 내 후보 활성 단어를 식별하는 단계를 수반한다. 후보 활성 단어는 복수의 가능한 활성 단어 중에서의 하나일 수 있고, 복수의 활성 단어 중 일부 각 활성 단어는 복수의 음성 서비스 중 각 음성 서비스에 대응한다. 일부 실시예에서, 이는 NMD가 도 5와 관하여 위에서 설명된 키워드 스포터(576)로 하여금 활성 단어 검출 알고리즘을 이용하여 후보 활성 단어를 검출하도록 하는 단계를 수반한다. 추가적으로, 일부 실시예에서, 복수의 활성 단어는 (i) 아마존 음성 서비스에 대응하는 활성 단어 "알렉사", (ii) 구글 음성 서비스에 대응하는 활성 단어 "오케이, 구글", (iii) 애플 음성 서비스에 대응하는 활성 단어 "헤이, 시리" 중 하나 이상을 포함한다. 따라서, 일부 예시에서, 제1 활성 단어 검출 프로세스를 수행하도록 제1 알고리즘을 사용하는 단계는 NMD가 제1 알고리즘을 사용하여 캡쳐된 사운드 데이터가 "알렉사", "오케이, 구글" 및 "헤이, 시리"와 같은 복수의 활성 단어를 포함하는지 여부를 결정하는 단계를 수반한다. 추가로, 일부 예시에서, NMD는 제1 알고리즘을 병렬로 사용하여 캡쳐된 사운드 데이터가 다수의 활성 단어를 포함하는지 여부를 동시에 결정한다.
추가적으로, 일부 실시예에서, 복수의 활성 단어는 (i) 아마존 음성 서비스에 대응하는 활성 단어 "알렉사", (ii) 구글 음성 서비스에 대응하는 활성 단어 "오케이, 구글", (iii) 애플 음성 서비스에 대응하는 활성 단어 "헤이, 시리" 중 하나 이상을 포함한다. 따라서, 일부 예시에서, 제1 활성 단어 검출 프로세서를 수행하도록 제1 알고리즘을 사용하는 단계는 NMD가 제1 알고리즘을 사용하여 캡쳐된 사운드 데이터가 "알렉사", "오케이, 구글" 및 "헤이, 시리"와 같은, 복수의 활성 단어를 포함하는지 여부를 결정하는 단계를 수반한다. 또한, 일부 실시예에서, NMD는 제1 알고리즘을 병렬로 사용하여 캡쳐된 사운드 데이터가 복수의 활성 단어를 포함하는지 여부를 동시에 결정한다.
일부 실시예에서, 후보 활성 단어를 식별하는 단계는 하나 이상의 활성 단어로 범위 또는 확률 스코어를 할당하는 단계를 포함한다. 예를 들어, 제1 알고리즘은 활성 단어 "알렉사"가 음성 입력에서 검출된 70% 확률을 나타낼 수 있으며, 이는 "알렉사"가 후보 활성 단어로 간주될 수 있다. 일부 실시예에서, 두 상이한 활성 단어는 각각 확률 스코어 또는 범위에 할당되어 각각이 후보 활성 단어로서 식별될 수 있다.
위에서 언급된 바와 같이, 후보 활성 단어를 식별하도록 블록(704)에서 이용된 제1 알고리즘은 현재 알려진 또는 나중에 개발되는 다양한 키워드 스포팅 알고리즘 또는 그것의 변형을 포함할 수 있다. 일부 실시예에서, 제1 알고리즘은 심층 뉴럴 네트워크(DNN), 중첩형 뉴럴 네트워크(CNN) 또는 반복형 뉴럴 네트워크(RNN)과 같이 키워드 스포팅을 위해 뉴럴 네트워크를 사용하여 키워드 특정의 트레이닝 데이터에 기초하여 키워드를 모델링 한다. 일부 실시예에서, 블록(704)에서 이용되는 뉴럴 네트워크는 압축되어 뉴럴 네트워크에 대한 연산적 복잡성 및/또는 메모리 요구의 실질적인 감소를 달성하였다. 이는 뉴럴 네트워크가 과도한 전력 또는 메모리 소비 없이 NMD 또는 재생 장치 상에 로컬로 저장될 수 있게 한다. 활성 단어 검출을 위한 뉴럴 네트워크의 압축에 관한 추가적인 세부사항은 도 8-10에 대하여 이하에서 설명된다.
블록(706)에서, 방법(700)은 NMD가 임의의 후보 활성 단어가 블록(704)에서 사운드 데이터에서 검출되었는지 여부를 결정하는 단계를 수반한다. NMD가 후보로서 캡쳐된 사운드 데이터에서 다수의 활성 단어 중 임의의 것을 식별하지 않는 경우, 방법(700)은 블록(702)으로 돌아가고, NMD는 계속 추가적 사운드 데이터를 캡쳐하고 제1 알고리즘을 이용하여 그 추가적인 사운드 데이터를 프로세싱하여 사운드 데이터에서 임의의 후보 활성 단어를 식별한다. 대안적으로, NMD가 제1 알고리즘을 사용하여 특정 활성 단어를 식별한 경우, 방법(700)은 블록(708)으로 진행하며, 여기서 NMD는 후보 활성 단어가 캡쳐된 사운드 데이터 내에 존재하는지 여부를 확인하도록 시도한다.
사운드 데이터에서 후보 활성 단어의 식별에 응답하여, NMD는 블록(708)에서 제1 활성 단어 엔진 또는 블록(709)에서 제2 활성 단어 엔진을 선택하고 활성화한다. 일부 실시예에서, 제1 활성 단어 엔진을 활성화하는 단계는 NMD가 (예컨대, 저전력 또는 무전력 상태에서 고전력 상태로) 파워업(power up)하거나 아니면 특정 활성 단어 엔진 컴포넌트로 하여금 캡쳐된 사운드 데이터를 분석할 수 있도록 하는 단계를 수반한다.
제1 활성 단어 엔진 및 제2 활성 단어 엔진 간의 선택은 블록(704)의 사운드 데이터에서 검출된 특정 후보 활성 단어에 기초하여 이루어질 수 있다. 예를 들어, 제1 활성 단어 엔진은 제1 VAS와 연관될 수 있고, 제2 활성 단어 엔진은 제2 VAS와 연관될 수 있다. 후보 활성 단어가 제1 VAS와 연관되는 경우, 제1 활성 단어 엔진은 블록(708)에서 선택되고 활성화된다. 대신, 후보 활성 단어가 제2 VAS와 연관되는 경우, 제2 활성 단어 엔진은 블록(709)에서 선택되고 활성화된다.
일 예시에서, 제1 활성 단어 엔진은 활성 단어 "알렉사"를 검출하여 NMD가 블록(706)에서 예비 활성 단어 검출 프로세스가 후보 활성 단어로서 단어 "알렉사"를 검출했다고 결정하는 경우, NMD는 블록(708)에서 응답으로 제1 활성 단어 엔진을 활성화하고, 블록(710)에서 사운드 데이터 내 후보 활성 단어 "알렉사"의 존재를 확인하거나 부정하도록 구성된다. 동일하거나 다른 예시에서, 제2 활성 단어 엔진은 활성 단어 "오케이, 구글"을 검출하여 NMD가 블록(704)에서 식별된 예비 활성 단어가 "오케이, 구글"이라는 것을 블록(706)에서 결정하는 경우, NMD는 블록(709)에서 응답으로 제2 활성 단어 엔진을 활성화하고, 블록(711)에서 사운드 데이터 내 "오케이, 구글"의 존재를 확인하거나 부정하도록 구성된다. 일부 실시예에서, 방법(700)은 추가적 활성 단어 검출 모듈을 사용하여 추가적인 활성 단어 검출 프로세스를 수행하는 단계를 수반한다. 예를 들어, 일부 실시예에서, 방법(700)은 NMD가 검출하도록 구성되는 각 활성 단어에 대한 각각의 활성 단어 검출 모듈을 사용하는 단계를 수반한다.
블록(708)에서, 방법(700)은 NMD가 제1 활성 단어 엔진로 하여금 사운드 데이터를 분석하여 사운드 데이터 내 후보 활성 단어의 존재를 확인하거나 부정하도록 하는 단계를 수반한다. 확인되는 경우, NMD는 확인된 활성 단어를 출력할 수 있다. 확인된 활성 단어는 제1 활성 단어 엔진이 더 높은 예상 정확도와 그에 따라 검출된 활성 단어에서 더 높은 신뢰도를 가질 수 있는 것을 제외하고 블록(704)에서 예비로서 이전에 식별된 활성 단어와 동일할 수 있다. 일부 실시예에서, 제1 활성 단어 엔진은 후보 활성 단어를 식별하기 위해 사용되는 제1 알고리즘보다 확인된 활성 단어를 검출하기 위해 연산적으로 더 집약적인 알고리즘을 사용할 수 있다. 일 예시에서, 블록(704)에서의 "알렉사"의 후보 활성 단어로서 식별되는 제1 알고리즘과 블록(708)에서 아마존 음성 서비스에 연관되는 활성 단어 엔진이 선택된다. 이후, 블록(710)에서, 아마존 활성 단어 엔진은 사운드 데이터를 분석하여 사운드 데이터에서 "알렉사"의 존재를 확인하거나 부정한다. 아마존 활성 단어 엔진이 활성 단어 "알렉사"를 식별하는 경우, 이는 확인된 활성 단어로서 식별된다. 다른 예시에서, 제1 알고리즘이 블록(704)에서의 후보 활성 단어 "오케이, 구글"로서 식별하였으며, 블록(708)에서 구글 음성 서비스에 연관되는 활성 단어 엔진이 선택된다. 이후, 블록(710)에서 구글 활성 단어 엔진은 사운드 데이터를 분석하여 사운드 데이터에서 "오케이, 구글"의 존재를 확인하거나 부정한다.
예비 활성 단어 검출과 다운스트림 활성 단어 엔진과 관련되는 위에서 설명된 알고리즘은 현재 알려진 또는 나중에 개발되는 다양한 키워드 스포팅 알고리즘 또는 그들의 변형을 포함할 수 있다. 키워드 스포팅 알고리즘의 예시는 (i) 캡쳐된 오디오의 슬라이딩 시간 간격 내에 있는 특징이 키워드 모델과 비교되는 슬라이딩 윈도우 모델, (ii) 비-키워드 모델이 키워드 회화로부터 비 키워드 회화를 구별하는 것에 도움이 되도록, 은닉 마코브 모델(Hidden Markov Model)(HMM)이 각 키워드 및 비-키워드로 구성되는 가비지 모델(garbage model), (iii) 입력 회화가 미리 정의된 키워드로 검색되는 격자로 디코딩되는, 대규모 어휘 연속 음성 인식(LVCSR)의 사용 및 (iv) 다량의 키워드 특정 트레이닝 데이터에 기초하여 키워드를 모델링하기 위한 심층 뉴럴 네트워크(DNN), 중첩형 뉴럴 네트워크(CNN) 또는 반복형 뉴럴 네트워크(RNN)와 같은, 뉴럴 네트워크의 사용을 포함하지만 이에 제한되지는 않는다. 뉴럴 네트워크의 사용에 관하여 추가적인 세부사항은 도 8-10에 대해 이하에서 설명된다.
블록(712)에서, 방법(700)은 확인된 활성 단어가 캡쳐된 사운드 데이터에서 검출되었는지 여부를 결정하는 것을 수반한다. 확인된 활성 단어가 블록(710) 또는 블록(711)에서 검출되는 경우, 이후 방법(700)은 블록(714)로 진행한다. 그리고 확인되지 않은 활성 단어가 블록(710) 또는 블록(711)에서 검출되는 경우(즉, 예비 활성 단어가 블록(710)또는 블록(711)에서 부정됨), 이후 방법(700)은 블록(716)로 진행한다.
블록(714)에서, 방법(700)은 NMD가 그 네트워크 인터페이스를 통하여 특정 활성 단어에 대응하는 각 음성 서비스로 하여금 캡쳐된 사운드 데이터를 프로세싱하도록 하는 단계를 수반한다. 일부 실시예에서, 이는 먼저 복수의 음성 서비스 중 어떠한 각 음성 서비스가 특정 활성 단어에 대응하는지 식별하는 단계를 수반하며, 그 예시는 그 전체가 여기에 참조로서 포함되는 미국 특허 출원 제15/229,868호에 개시된다.
일부 실시예에서, 각 음성 서비스로 하여금 캡쳐된 사운드 데이터를 프로세싱하도록 하는 단계는 NMD가 네트워크 인터페이스를 통하여 각 음성 서비스의 하나 이상의 서버로 사운드 데이터를 나타내는 데이터 및 사운드 데이터를 나타내는 데이터를 프로세싱하도록 명령 또는 쿼리를 전송하는 단계를 수반한다. 명령 또는 쿼리는 각 음성 서비스로 하여금, 음성 명령을 프로세싱하도록 할 수 있고, 각 음성 서비스에 따라, 명령 또는 쿼리를 각 음성 서비스에(예컨대, 음성 서비스의 API에) 따르게 하도록 변화할 수 있다.
위에서 언급된 바와 같이, 일부 예시에서, 캡쳐된 오디오는 음성 입력(680)을 포함하며, 이는 차례로 활성 단어(680a)를 나타내는 제1 부분 및 음성 발화(680b)를 나타내는 제2 부분을 포함하고, 이는 명령(682)과 같은 하나 이상의 명령을 포함할 수 있다. 일부 경우에서, NMD는 음성 입력의 적어도 제2 부분(예컨대, 음성 발화(680b)를 나타내는 부분)을 나타내는 데이터만을 전송할 수 있다. 제1 부분을 제외하고, NMD는 다른 가능한 이점 중에서도, 활성 단어(680a)로 인해 음성 입력(680)의 가능한 미스프로세싱(misprocessing)을 피하고 음성 입력(680)을 전송하는 데 요구되는 대역폭을 줄일 수 있다. 대안적으로, NMD는 음성 입력(680)의 두 부분 또는 음성 입력(680)의 일부 다른 부분을 나타내는 데이터를 전송할 수 있다.
일부 실시예에서, 각 음성 서비스로 하여금 캡쳐된 사운드 데이터를 프로세싱하도록 하는 단계는, NMD가 각 음성 서비스에 대응하는 활성 단어 검출 알고리즘을 쿼리하는 단계를 수반한다. 위에서 언급된 바와 같이, 음성 서비스로의 쿼리는 NMD 상에 로컬로 또는 네트워크 인터페이스를 사용하여 원격으로 음성 서비스의 각 API를 적용하는 단계를 수반한다. 각 음성 서비스의 활성 단어 검출 알고리즘으로의 쿼리에 응답하여, NMD는 쿼리에 제출된 캡쳐된 사운드 데이터가 그 음성 서비스에 대응하는 활성 단어를 포함했는지 여부를 나타내는 응답을 수신한다. 특별한 음성 서비스의 활성 단어 검출 알고리즘이 캡쳐된 사운드 데이터가 특별한 음성 서비스에 대응하는 특정 활성 단어를 포함함을 검출하는 경우, NMD는 그 특별한 음성 서비스로 하여금, 사운드 데이터를 더 프로세싱하도록, 예를 들어, 캡쳐된 사운드 데이터에서 음성 명령을 식별하도록 할 수 있다.
각 음성 서비스로 하여금 캡쳐된 오디오를 프로세싱하도록 하는 단계 이후, NMD는 프로세싱의 결과를 수신한다. 예를 들어, 검출된 사운드 데이터가 서치 쿼리(search query)를 나타내는 경우, NMD는 검색 결과를 수신할 수 있다. 다른 예시로서, 검출된 사운드 데이터가 장치로의 명령(예컨대, 재생 장치로의 미디어 재생 명령)을 나타내는 경우, NMD는 명령 및 아마도 명령과 연관된 추가적 데이터(예컨대, 명령과 연관된 미디어 소스)를 수신할 수 있다. NMD는 명령의 유형과 수신된 결과에 적절히 기초하여 이러한 결과를 출력할 수 있다.
대안적으로, 검출된 사운드 데이터가 NMD외에 다른 장치로 향하는 음성 명령을 포함하는 경우, 결과는 NMD 보다 장치를 향할 수 있다. 예를 들어, 도 1a를 참조하면, 주방(101h)에 있는 NMD(103f)는 (예를 들어, 재생 장치(102l)에 의해 미디어 재생을 조정하도록) 식당(101g)의 재생 장치(102l)를 향하는 음성 입력을 수신할 수 있다. 그러한 실시예에서, NMD(103f)가 음성 입력의 프로세싱을 용이하게 하지만, 프로세싱의 결과(예컨대, 미디어 재생을 조정하기 위한 명령)는 재생 장치(102l)로 전송될 수 있다. 대안적으로, 음성 서비스는 NMD(103f)로 결과를 보낼 수 있으며, 이는 명령을 재생 장치(102l)로 전달할 수 있거나 아니면 재생 장치(102l)로 하여금 명령을 수행하도록 할 수 있다.
블록(716)에서, 방법(700)은 NMD가 캡쳐된 사운드 데이터가 특정 활성 단어를 포함하지 않는다는 것을 결정하는 것에 응답하여 확인된 활성 단어를 검출하도록 캡쳐된 사운드 데이터를 프로세싱하는 것을 중단하는 단계를 수반한다. 일부 실시예에서, 특정 활성 단어를 검출하도록 캡쳐된 사운드 데이터를 프로세싱하는 것을 중단하는 단계는 캡쳐된 사운드 데이터가 특정 활성 단어와 상이한 활성 단어를 포함하는지 여부를 결정하도록 캡쳐된 사운드 데이터를 추가로 프로세싱하는 NMD를 수반한다. 예를 들어, 복수의 활성 단어 중 각각의 활성 단어에 대해, NMD는 캡쳐된 사운드 데이터가 각 활성 단어를 포함하는지 여부를 결정하도록 하나 이상의 알고리즘을 사용할 수 있다.
추가적으로 또는 대안적으로, 일부 실시예에서, 특정 활성 단어를 검출하도록 캡쳐된 사운드 데이터를 프로세싱하는 것을 중단하는 단계는 NMD가 캡쳐된 사운드 데이터를 프로세싱하는 것을 완전히 중단하는 단계는 수반하지 않는다. 대신, NMD는 방법(700)을 반복함으로써 예를 들어, 추가적 사운드 데이터를 캡쳐하고, 추가적 캡쳐된 사운드 데이터 상에 제1 및 제2 활성 단어 검출 프로세스를 수행함으로써, 계속해서 활성 단어를 듣는다.
임의의 경우에, 블록(718)에서, 방법(700)은 NMD가 선택된 활성 단어 엔진(즉, 어떤 엔진이 이전에 선택되고 활성화되었는지에 따라 제1 및/또는 제2 활성 단어 엔진)을 비활성화시키는 단계를 수반한다. 따라서, 일부 예시에서, 방법(700)은 NMD가 블록(716)에서 사운드 데이터를 프로세싱하는 것을 중단하는 단계 이후에 선택된 활성 단어 엔진을 비활성화하는 단계를 수반한다. 그리고, 다른 예시에서, 방법(700)은 NMD가 블록(714)에서 음성 서비스로 하여금 특정 활성 단어를 프로세싱하도록 하는 단계 이후에 선택된 활성 단어 엔진을 비활성화하는 단계를 수반한다. 위에서 논의된 바에 따라, 일부 실시예에서, 선택된 활성 단어 엔진을 비활성화하는 단계는 NMD가 파워 다운(power down)하거나 아니면 활성 단어 엔진 컴포넌트(570a 및/또는 570b)를 캡쳐된 사운드 데이터를 분석하는 것으로부터 비활성화하는 단계를 수반한다.
b. 활성 단어 검출을 위해 뉴럴 네트워크 모델을 압축하는 예시
도 8은 키워드 스포팅 및 선택에 대한 압축형 뉴럴 네트워크 모델을 생성하기 위한 시스템(800)의 기능적 블록도이다. 도 8에 도시된 바와 같이, 미리 트레이닝된 뉴럴 네트워크 모델(802)은 키워드 선택 및 압축 모듈(804)에 제공된다. 미리 트레이닝된 뉴럴 네트워크 모델(802)은 다량의 키워드-특정 트레이닝 데이터에 기초하여 하나 이상의 선택된 키워드를 모델링한다. 예컨대, 심층 뉴럴 네트워크(DNN), 중첩형 뉴럴 네트워크(CNN) 또는 반복형 뉴럴 네트워크(RNN)과 같은 뉴럴 네트워크일 수 있다. 키워드 선택 및 압축 모듈(804)은 미리 트레이닝된 뉴럴 네트워크 모델을 최적화하고 압축하여 미리 트레이닝된 뉴럴 네트워크 모델 입력(802)보다 잘 수행하는 압축형 뉴럴 네트워크 모델을 제공할 수 있으며, 이는 예를 들어, 키워드 검출의 정확성의 실질적인 감소 없이 연산적으로 덜 집약적이고/거나 메모리를 덜 요구할 수 있다.
이하에서 더 자세히 설명된 바와 같이, 키워드 선택 및 압축 모듈(804)은 미리 트레이닝된 뉴럴 네트워크 모델의 가중치를 K 클러스터로 압축함으로써, 예를 들어 가중치에 가우시안 혼합 모델(Gaussian mixture model)(GMM)을 피팅함으로써, 미리 트레이닝된 뉴럴 네트워크 모델(802)을 재트레이닝하고 압축할 수 있다. 이러한 기법은 소프트-가중치 공유로 알려져 있고, 결과적으로 뉴럴 네트워크 모델의 상당한 압축이 될 수 있다. 미리 트레이닝된 뉴럴 네트워크 모델의 가중치와 함께 GMM의 컴포넌트를 피팅함으로써, 가중치는 다수의 클러스터 컴포넌트 주위에 타이트하게 집중되는 경향이 있는 한편, 클러스터 센터는 스스로 최적화되어, 네트워크에 높은 예측 정확도를 제공한다. 이는 뉴럴 네트워크 모델이 미리 트레이닝된 뉴럴 네트워크 모델의 가중치 모두 보다는 K 클러스터 평균(mean)만을 인코딩 하면 되므로 결과적으로 높은 압축이 된다. 추가적으로, 일 클러스터는 도 10에 대하여 아래에서 논의된 바와 같이 스파스 표현을 감안하여 GMM에서 높은 초기 책임을 가지고 0에서 고정될 수 있다.
키워드 선택 및 압축 모듈(804)의 초기화 모듈(806)에서 GMM의 컴포넌트는 초기화된다. 예를 들어, 미리 정해진 수의 비 고정 컴포넌트의 평균이 미리 트레이닝된 뉴럴 네트워크 모델(802)의 가중치의 범위에서 고르게 분포될 수 있다. 분산은 각 가우시안이 그 각 영역에서 상당한 확률 질량을 가지도록 초기화될 수 있다. 일부 실시예에서, 뉴럴 네트워크 모델의 가중치는 또한 사전 트레이닝에 기초하여 초기화 모듈(806)을 통하여 초기화될 수 있다. 일부 실시예에서, GMM은 17개의 컴포넌트(24+1)로 초기화될 수 있고, 가중치 및 평균에 대한 러닝 레이트(learning rate), 로그 분산 및 로그 혼합 비율은 모두 별도로 초기화될 수 있다.
GMM 컴포넌트의 초기화에 이어, 조인트 최적화 모듈(808)은 GMM을 사용하여 미리 트레이닝된 뉴럴 네트워크 모델을 재트레이닝한다. 조인트 최적화 모듈(808)은 초기화된 GMM을 미리 트레이닝된 뉴럴 네트워크 모델의 가중치에 피팅하고, 최적화 알고리즘을 실행하여 GMM의 클러스터 주위에 뉴럴 네트워크 모델의 가중치를 클러스터링 한다. 예를 들어, 일부 실시예에서, 이하의 방정식은 기울기 하강을 통하여 최적화될 수 있다.
여기서, w는 뉴럴 네트워크 모델의 파라미터(또는 가중치)이고, μjjj는 GMM의 평균, 분산 및 혼합 가중치이며, X와 T는 음향 특성 입력과 뉴럴 네트워크 모델의 분류 타겟이다. 손실은 GMM의 항 과 뉴럴 네트워크 모델에 대한 항 으로 분해되며, 이들은 가중치 인자τ을 사용하여 상쇄된다.
일부 예시에서, 가중치 인자 τ는 0.005로 설정될 수 있다. 다음 단계에서 희소성(sparsity)을 촉진하고 압축을 향상하기 위해, GMM의 일 컴포넌트는 고정된 평균 μj=0 = 0 과 혼합 가중치 πj=0 = 0.999를 가질 수 있다. 컴포넌트의 나머지들은 학습된다. 대안적으로, 단계는 또한 πj=0도 트레이닝할 수 있지만 베타 분포와 같은 하이퍼프라이어(hyperprior)를 사용하여 이를 제한할 수 있다. 연속적인 반복 이후, 함수는 뉴럴 네트워크 모델의 가중치가 GMM의 클러스터 주위에 타이트하게 클러스터링되도록 수렴한다.
조인트 최적화 모듈(808)에서, 기울기 하강 계산은 선택된 러닝 레이트와 파라미터에 매우 민감할 수 있다. 러닝 레이트가 너무 높은 경우, GMM은 매우 빠르게 붕괴될 수 있고, 뉴럴 네트워크 모델의 가중치는 임의의 컴포넌트 외부에 남고 클러스터링에 실패할 수 있다. 반대로 러닝 레이트가 너무 낮은 경우, 혼합은 매우 느리게 수렴할 수 있다. 일부 실시예에서, 러닝 레이트는 대략 5x10-4로 설정될 수 있다. 일부 실시예에서, 인버스-감마 하이퍼 프라이어(Inverse-Gamma hyperprior)는 혼합 컴포넌트가 매우 빠르게 붕괴하는 것을 방지하도록 혼합 분산 상에서 적용될 수 있다.
키워드 선택 및 압축 모듈(804)의 마지막 단계로서, 양자화 모듈(810)은 모델을 더 압축한다. 예를 들어, 뉴럴 네트워크 모델이 조인트 최적화 모듈(808)을 통하여 재트레이닝된 이후, 각 가중치는 그것을 위해 최대 책임을 취하는 컴포넌트의 평균으로 설정될 수 있다. 이 프로세스는 양자화로서 지칭될 수 있다. 그러나 양자화 이전에, 리던던트(redudant) 컴포넌트는 제거될 수 있다. 일 예시에서, 쿨백 라이블러(Kullback-Leibler)(KL) 발산은 모든 컴포넌트 사이에서 계산될 수 있고, 역치보다 작은 KL 발산에 대하여, 두 컴포넌트는 단일 컴포넌트를 형성하도록 병합될 수 있다. 양자화 이후, 결과적인 뉴럴 네트워크 모델은 미리 트레이닝된 뉴럴 네트워크 모델(802)과 비교하여 가중치 전체에 걸쳐지나 상당히 감소된 수의 개별 값을 가진다.
키워드 선택 및 압축 모듈(804)의 출력은 이후 키워드 스포터(576)와 같이 출력되기 이전에 포스트 프로세싱(812)(예컨대, 추가적인 필터링, 포맷 등)의 대상이 될 수 있다. 일부 실시예에서, 포스트 프로세싱은 도 10에 대하여 이하에서 설명되는 바와 같이, 압축형 스파스 로우(CSR) 표현을 포함할 수 있다. 도 5 내지 도 7에 대하여 상술된 바와 같이, 키워드 스포터(576)는 활성 단어 검출을 수행하여, 예를 들어, 캡쳐된 사운드 데이터 상에 예비 활성 단어 검출 분석을 수행하는 데 사용될 수 있다. 이러한 압축형 뉴럴 네트워크 모델의 출력에 기초하여, 제2 활성 단어 검출 프로세스는 예를 들어, 특정 VAS 또는 활성 단어의 특정 세트와 연관되는 활성 단어 엔진을 활용하여 수행될 수 있다.
소프트 가중치 공유된 뉴럴 네트워크, 양자화, 압축형 스파스 로우 표현 및 KL 발산의 사용의 예시와 추가적인 세부사항은 각각 그 전체가 참조로써 여기에 포함되는 https://arxiv.org/abs/1702.04008v2에서 이용할 수 있는 울리히 등의 "뉴럴 네트워크 압축에 대한 소프트 가중치 공유", https://arxiv.org/abs/1510.00149v5에서 이용할 수 있는 한 등의 "심층 압축: 프루닝, 트레이닝된 양자화 및 허프만 코딩과 심층 뉴럴 네트워크 압축하기" 및 https://arxiv.org/abs/1506.02626v3에서 이용할 수 있는 한 등의 "효율적인 뉴럴 네트워크를 위한 가중치 및 연결 모두 배우기"에서 발견될 수 있다. 위에서 참조된 논문에서 개시된 기법 중 임의의 것은 위에서 설명된 키워드 선택 및 압축 모듈(804) 및/또는 포스트 프로세싱(812)에 포함될 수 있다.
도 9는 소프트 가중치 공유를 통하여 압축 전후 뉴럴 네트워크 모델에 대한 가중치의 로그 가중치 분포를 예시한다. 도 9의 맨 위에 있는 히스토그램은 미리 트레이닝된 뉴럴 네트워크 모델(예컨대, 도 8의 미리 트레이닝된 뉴럴 네트워크 모델(802))의 가중치w의 분포를 도시한다. 오른쪽에서 동일한 분포가 (예컨대, 키워드 스포터(576)의 압축형 뉴럴 네트워크 모델에서 반영된 바와 같이) 재트레이닝이 수행된 소프트 가중치 공유 이후에 도시된다. 각 가중치의 값에서의 변화는 산점도에 의해 예시된다. 도시된 바와 같이, 가중치는 함께 모여 이산 값 주위에 클러스터링하여 미리 트레이닝된 뉴럴 네트워크 모델과 비교하여 소프트 가중치 공유된 뉴럴 네트워크 모델 내 가중치 전반에 걸쳐 개별 값의 수를 크게 감소시킨다. 추가적으로, 가중치의 최고 농도가 0에 있으며, 이로써 결과적인 뉴럴 네트워크 모델에서 0이 아닌 가중치의 수를 최소화한다. 이는 도 10에 대하여 아래에서 설명된 바와 같이, 압축형 스파스 로우(CSR) 표현을 사용하는 더 큰 압축을 고려한다. CSR(또는 가중치의 다른 압축형 표현)과 함께 소프트 가중치 공유에 의해 달성되는 가중치 전체에 걸친 개별 값에서의 감축은 정확성에서 내용 감소없이 뉴럴 네트워크 모델의 연산적 복합성 및 사이즈를 상당히 감소시킨다.
도 10는 뉴럴 네트워크 모델의 압축형 스파스 로우(CSR) 표현의 예시를 예시한다. 공유된 가중치 클러스터링에 더하여, 뉴럴 네트워크 모델은 스파스 표현을 사용하여 추가 압축될 수 있다. 일 예시는 행렬 M이 세 개의 일차원의 어레이에 의해 표현되는 스탠다드 CSR 표현이다. 특히, 도 10에 관하여, 행렬 D는 세 개의 일차원의 어레이(A, IA 및 JA)에 의해 표현될 수 있다. 어레이 A는 행렬 D의 0이 아닌 컴포넌트(5, 8, 3 및 6)를 취함으로써 얻어진다. 어레이 IA는 행렬 D의 각 로우에서의 0이 아닌 컴포넌트의 수로부터 회귀적으로 얻어지며, 추가적인 첫번째 값 0을 가진다. 행렬 D에서, 각 로우의 0이 아닌 컴포넌트의 수는 각각 0, 2, 1 및 1이다. 이들을 회귀적으로 더하는 것은 어레이 IA에서 반영된 바와 같이, 0, 2(0+2), 3(2+1) 및 4(3+1)의 값을 제공한다. 마지막으로, 어레이 JA는 행렬 D에서 각각 0이 아닌 값의 칼럼 인덱스로부터 생성된다. 예를 들어, 제1의 0이 아닌 값(5)은 칼럼 0에 있고, 제2의 0이 아닌 값(8)은 칼럼 1에 있고, 제3의 0이 아닌 값(3)은 칼럼 2에 있으며 제4의 0이 아닌 값(6)은 칼럼 1에 있다. 따라서, 어레이 JA는 값 0, 1, 2, 1을 포함한다. 이러한 세 개의 어레이는 예를 들어, 뉴럴 네트워크 모델을 표현하도록 저장될 필요가 있는 값의 전체 수를 감소시킴으로써, 압축형 포맷으로 행렬 M을 표현할 수 있다. 도 10의 예시에서, 행렬 M은 16개의 값을 가지는 한편 세 개의 어레이 A, IA 및 JA는 결합하여 전체 13개 값을 가진다.
이러한 어레이 각각은 더 최적화될 수 있다. 예를 들어, 어레이 IA에서 가장 큰 수는 D에서 0이 아닌 요소의 전체 수이므로, IA에 있는 수는 낮은 정밀도로 저장될 수 있다. 어레이 A는 인덱스로의 코드북으로 양자화함으로써 최적화될 수 있다. 그리고, 어레이 JA는 낮은 정밀도 인덱스로 최적화될 수 있고/거나 차이를 저장할 수 있다.
CSR 기법을 사용하여 압축된 뉴럴 네트워크 모델을 평가함에 있어서, 발명자는 베이스라인 뉴럴 네트워크 모델로부터 사이즈에서의 상당한 감소를 발견했다. 8개의 컴포넌트를 가지는 일 예시에서, 뉴럴 네트워크 모델의 베이스라인 전체의 사이즈는 540kB이다. 압축형 스파스 로우 표현 이후, 1.16의 전반적인 압축률을 반영하여 사이즈는 462.5kB로 감소되었다. CSR 어레이의 최적화 이후, 3.1의 전반적인 압축률을 반영하여 사이즈는 174kB로 더 감소되었다. 따라서, 어레이의 최적화와 함께 CSR 표현을 이용하는 것은 3분의 2 이상까지 전반적인 사이즈가 감소하는 것이 발견되었다. 이러한 압축 기법 및 다른 압축 기법은 위에서 설명된 바와 같이 활성 단어를 검출하는 데 사용된 뉴럴 네트워크 모델의 연산적 복합성 및/또는 사이즈를 감소하는 데 사용될 수 있다.
c. NMD 사이 중재를 위한 뉴럴 네트워크 사용의 예시
이전에 언급된 바와 같이, 일부 구현예에서, 음성 입력이 서로의 근처 내에 위치되는 둘 이상의 NMD에 의해 검출되는 회화에서 식별되는 경우, NMD는 서로 간의 중재를 용이하게 할 수 있다. 예를 들어, 서로에 가까이 위치되는 두 NMD는 적어도 때로는 동일한 사운드를 검출할 수 있다. 이러한 경우, 이는 어떤 장치가 근본적으로 검출된 사운드 데이터를 원격 VAS로 제공할 책임이 있는지에 관하여 중재를 요구할 수 있다.
일부 실시예에서, 둘 이상의 NMD 각각은 검출된 사운드 데이터를 분석하여 위에서 설명된 키워드 스포팅 알고리즘 중 임의의 하나를 사용하여(예컨대, 키워드 스포터(576), 제1 활성 단어 엔진(570a) 및/또는 제2 활성 단어 엔진(570b)를 이용하여) 활성 단어 또는 후보 활성 단어를 식별할 수 있다. 예를 들어, 두 NMD는 각각 뉴럴 네트워크 기반 키워드 스포터를 이용하여 음성 입력에서 후보 활성 단어를 식별할 수 있다. 적어도 일부 실시예에서, 키워드 스포터는 또한 사운드 데이터 스트림 SDS에 있는 후보 활성 단어에 확률 스코어 또는 범위를 할당할 수 있다. 각 NMD에 의해 식별된 후보 활성 단어 및 상대적인 확률 스코어에 기초하여, NMD 중 하나는 원격 VAS로 검출된 사운드 데이터를 제공하기 위해 선택될 수 있다.
일 예시로서, 제1 NMD 및 제2 NMD는 그들이 동일한 사운드를 검출하도록 서로 가까이 위치될 수 있다. 제1 NMD 상에서 동작하는 키워드 스포터는 활성 단어 "오케이, 구글"이 제1 NMD의 사운드 데이터 스트림 SDS에서 검출된 80% 확률을 나타낼 수 있는 한편, 제2 NMD 상에서 동작하는 키워드 스포터는 활성 단어 "오케이, 구글"이 제2 NMD의 사운드 데이터 스트림 SDS에서 검출된 70% 확률을 나타낼 수 있다. 제1 NMD가 제2 NMD보다 높은 확률의 검출된 활성 단어를 가지므로, 제1 NMD는 원격 VAS와 통신하도록 선택될 수 있다.
결론
위 설명은 다른 컴포넌트 중에서도 하드웨어 상에서 실행되는 펌웨어 및/또는 소프트웨어를 포함하는, 다른 것들 중에서도, 다양한 예시적인 시스템, 방법, 장비 및 제품을 개시한다. 이러한 예시는 단지 예시적이며, 제한하는 것으로 간주되어서는 안된다고 이해된다. 예를 들어, 펌웨어, 하드웨어 및/또는 소프트웨어 태양 또는 컴포넌트 중 임의의 것 또는 모두가 하드웨어로만, 소프트웨어로만, 펌웨어로만 또는 하드웨어, 소프트웨어 및/또는 펌웨어의 임의의 조합으로 구현될 수 있음이 고려된다. 따라서, 제공되는 예시는 그러한 시스템, 방법, 장비 및/또는 제품을 구현하기 위한 유일한 방식이 아니다.
명세서는 주로 예시적인 환경, 시스템, 절차, 단계, 논리 블록, 처리 및 네트워크로 결합된 데이터 처리 장치의 동작에 직접 또는 간접적으로 유사한 다른 심볼 표현의 관점에서 제공된다. 이러한 프로세스 설명 및 표현은 일반적으로 당업자에 의해 가장 효과적으로 자신의 연구의 본질을 다른 분야에 전달하기 위해 사용된다. 본 개시의 완전한 이해를 제공하기 위해 다수의 구체적인 세부 사항이 개시된다. 그러나 본 개시의 일부 실시예는 일부 구체적인 세부 사항 없이 수행될 수 있음이 당업자에게 이해된다. 다른 경우에, 잘 알려진 방법, 절차, 컴포넌트 및 회로는 실시예의 태양을 불필요하게 흐리는 것을 피하기 위해 상세히 설명되지 않았다. 따라서, 본 개시의 범위는 앞의 실시예의 설명이 아니라 첨부된 청구범위에 의해 정의된다.
첨부된 청구범위 중에서 임의의 것이 순전히 소프트웨어 및/또는 펌웨어 구현을 커버하는 것으로 읽히는 경우, 적어도 하나의 예시에서의 구성 요소 중 적어도 하나는 여기에서 명시적으로 메모리, DVD, CD, 블루레이 등과 같이 소프트웨어 및/또는 펌웨어를 저장하는 유형의 비일시적인 매체를 포함하는 것으로 정의된다.
본 기법이 예를 들어, 아래에서 설명되는 다양한 양상에 따라 예시된다. 본 기법의 양상의 다양한 예시가 편의를 위해 번호 예시(1, 2, 3 등)으로 설명된다. 이는 예시로서 제공되고, 본 기법을 제한하지 않는다. 의존하는 예시 중 임의의 것이 임의의 조합으로 결합될 수 있고, 각각 독립된 예시가 배치된다는 것이 알려져 있다. 다른 예시가 비슷한 방식으로 존재할 수 있다.
예시 1: 네트워크 마이크로폰 장치를 통하여 사운드 데이터를 캡쳐하는 단계; 네트워크 마이크로폰 장치를 통해 사운드 데이터 내 후보 활성 단어를 식별하는 단계; 사운드 데이터 내 후보 활성 단어의 식별에 기초하여, 복수의 활성 단어 엔진으로부터 제1 활성 단어 엔진을 선택하는 단계; 제1 활성 단어 엔진으로, 사운드 데이터를 분석하여 활성 단어의 검출을 확인하는 단계; 및 확인된 활성 단어를 검출하는 것에 응답하여 제1 활성 단어 엔진이 활성 단어의 검출을 확인하는 경우, 음성 지원 서비스와 연관된 하나 이상의 원격 컴퓨팅 장치로 사운드 데이터의 음성 발화를 전송하는 단계를 포함하는 방법. 예시 2: 예시 1에 있어서, 후보 활성 단어를 식별하는 단계는 후보 활성 단어가 사운드 데이터에 존재하는 확률을 결정하는 단계를 포함하는, 방법. 예시 3: 예시 1-2 중 어느 하나에 있어서, 제1 활성 단어 엔진은 후보 활성 단어와 연관되고, 복수의 활성 단어 엔진 중 다른 것은 하나 이상의 추가적인 활성 단어와 연관되는 것인, 방법. 예시 4: 예시 1-3 중 어느 하나에 있어서, 후보 활성 단어를 식별하는 단계는 뉴럴 네트워크 모델을 사운드 데이터에 적용하는 단계를 포함하는, 방법. 예시 5: 예시 4에 있어서, 뉴럴 네트워크 모델은 압축형 뉴럴 네트워크 모델을 포함하는, 방법. 예시 6: 예시 4에 있어서, 뉴럴 네트워크 모델은 소프트 가중치 공유된 뉴럴 네트워크 모델을 포함하는, 방법. 예시 7: 예시 1-6 중 어느 하나에 있어서, 추가적인 사운드 데이터를 전송하는 단계 이후에, 네트워크 마이크로폰 장치를 통하여 추가적인 사운드 데이터와 관련된 미디어 컨텐츠의 선택을 수신하는 단계를 더 포함하는 방법. 예시8: 예시 1-7 중 어느 하나에 있어서, 복수의 활성 단어 엔진은 제1 활성 단어 엔진; 및 네트워크 마이크로폰 장치의 로컬 기능을 수행하는 예시적인 제2 활성 단어 엔진을 포함하는, 방법.
예시 9: 하나 이상의 프로세서; 적어도 하나의 마이크로폰; 및 네트워크 마이크로폰 장치로 하여금, 예시 1-8 중 어느 하나를 포함하는 동작을 수행하도록 하나 이상의 프로세서에 의해 실행 가능한 명령어를 저장하는 유형의 비일시적인 컴퓨터 판독 가능 기록매체를 포함하는 네트워크 마이크로폰 장치.
예시 10: 네트워크 마이크로폰 장치로 하여금, 예시 1-8 중 어느 하나를 포함하는 동작을 수행하도록 하나 이상의 프로세서에 의해 실행 가능한 명령어를 저장하는 유형의 비일시적인 컴퓨터 판독 가능 기록매체를 포함하는 네트워크 마이크로폰 장치.

Claims (19)

  1. 네트워크 마이크로폰 장치를 통하여 사운드 데이터를 캡처하는 단계;
    키워드 스포팅 알고리즘을 사용하여, 상기 사운드 데이터 내 후보 활성 단어를 식별하는 단계;
    상기 키워드 스포팅 알고리즘을 통하여 상기 사운드 데이터 내의 상기 후보 활성 단어의 식별에 기초하여, 상기 네트워크 마이크로폰 장치에 저장된 복수의 활성 단어 검출 알고리즘 중에서, 제1 활성 단어 검출 알고리즘을 선택하는 단계 - 상기 제1 활성 단어 검출 알고리즘은 제1 음성 지원 서비스와 연관되며, 상기 복수의 활성 단어 검출 알고리즘의 다른 하나는 상기 제1 음성 지원 서비스와 상이한 제2 음성 지원 서비스와 연관됨 -;
    상기 제1 활성 단어 검출 알고리즘을 선택한 이후에 그리고 상기 복수의 활성 단어 검출 알고리즘의 다른 하나는 사용하지 않으면서, 상기 제1 활성 단어 검출 알고리즘을 사용하여 상기 사운드 데이터를 분석하여 상기 키워드 스포팅 알고리즘을 통하여 식별된 상기 후보 활성 단어의 검출을 확인하는 단계 - 상기 제1 활성 단어 검출 알고리즘은 상기 키워드 스포팅 알고리즘보다 높은 정확도를 가지고 상기 후보 활성 단어가 상기 사운드 데이터 내에 존재하는지 여부를 결정함 -; 및
    상기 후보 활성 단어의 검출을 확인하는 단계에 응답하여, 상기 제1 음성 지원 서비스와 연관된 하나 이상의 원격 컴퓨팅 장치로 상기 사운드 데이터의 음성 발화를 전송하는 단계
    를 포함하는, 방법.
  2. 제1항에 있어서,
    상기 복수의 활성 단어 검출 알고리즘의 다른 하나는 사용하지 않고, 상기 제1 활성 단어 검출 알고리즘을 사용하여, 상기 사운드 데이터를 분석하여 상기 후보 활성 단어의 검출을 확인하는 단계는, 상기 복수의 활성 단어 검출 알고리즘의 다른 하나를 사용하여 상기 사운드 데이터를 프로세싱하는 제2 활성 단어 엔진이 비활성화 상태에 있는 동안, 제1 활성 단어 엔진을 활성화하여 상기 제1 활성 단어 검출 알고리즘을 사용하여 상기 사운드 데이터를 프로세싱하는 단계를 포함하는, 방법.
  3. 제1항에 있어서,
    상기 후보 활성 단어를 식별하는 단계는 상기 사운드 데이터 내에 상기 후보 활성 단어가 존재하는 확률을 결정하는 단계를 포함하는, 방법.
  4. 제1항에 있어서,
    상기 제1 활성 단어 검출 알고리즘은 상기 후보 활성 단어와 연관되고, 상기 복수의 활성 단어 검출 알고리즘의 다른 하나는 하나 이상의 추가적인 활성 단어와 연관되는 것인, 방법.
  5. 제1항에 있어서,
    상기 후보 활성 단어를 식별하는 단계는 뉴럴 네트워크 모델(neural network model)을 상기 사운드 데이터에 적용하는 단계를 포함하는, 방법.
  6. 제5항에 있어서,
    상기 뉴럴 네트워크 모델은 상기 네트워크 마이크로폰 장치 상에 로컬로 저장된 압축형 뉴럴 네트워크 모델을 포함하는, 방법.
  7. 제1항에 있어서,
    상기 음성 발화를 전송하는 단계 이후에, 상기 네트워크 마이크로폰 장치를 통하여, 상기 음성 발화에 관한 미디어 컨텐츠의 선택을 수신하는 단계를 더 포함하는, 방법.
  8. 제1항에 있어서,
    상기 복수의 활성 단어 검출 알고리즘은
    상기 제1 활성 단어 검출 알고리즘; 및
    상기 네트워크 마이크로폰 장치의 로컬 기능을 수행하도록 하는 제2 활성 단어 검출 알고리즘을 포함하는, 방법.
  9. 네트워크 마이크로폰 장치로서,
    하나 이상의 프로세서;
    적어도 하나의 마이크로폰; 및
    상기 네트워크 마이크로폰 장치로 하여금 동작들을 수행하도록 하는 하나 이상의 프로세서에 의해 실행가능한 명령어를 저장하는 유형의, 비일시적인 컴퓨터 판독가능 기록매체
    를 포함하고, 상기 동작들은,
    상기 하나 이상의 마이크로폰을 통하여 사운드 데이터를 캡처하는 동작;
    키워드 스포팅 알고리즘을 사용하여, 상기 사운드 데이터 내 후보 활성 단어를 식별하는 동작;
    상기 키워드 스포팅 알고리즘을 통하여, 상기 사운드 데이터 내의 상기 후보 활성 단어의 식별에 기초하여, 상기 네트워크 마이크로폰 장치에 저장된 복수의 활성 단어 검출 알고리즘 중에서 제1 활성 단어 검출 알고리즘을 선택하는 동작 - 상기 제1 활성 단어 검출 알고리즘은 제1 음성 지원 서비스와 연관되며, 상기 복수의 활성 단어 검출 알고리즘의 다른 하나는 상기 제1 음성 지원 서비스와 상이한 제2 음성 지원 서비스와 연관됨 -;
    상기 제1 활성 단어 검출 알고리즘을 선택한 이후에 그리고 상기 복수의 활성 단어 검출 알고리즘의 다른 하나는 사용하지 않으면서, 상기 제1 활성 단어 검출 알고리즘을 사용하여 상기 사운드 데이터를 분석하여 상기 키워드 스포팅 알고리즘을 통하여 식별된 상기 후보 활성 단어의 검출을 확인하는 동작 - 상기 제1 활성 단어 검출 알고리즘은 상기 키워드 스포팅 알고리즘보다 높은 정확도를 가지고 상기 후보 활성 단어가 상기 사운드 데이터 내에 존재하는지 여부를 결정함 -; 및
    상기 후보 활성 단어의 검출을 확인하는 동작에 응답하여, 상기 제1 음성 지원 서비스와 연관된 하나 이상의 원격 컴퓨팅 장치로 상기 사운드 데이터의 음성 발화를 전송하는 동작을 포함하는, 네트워크 마이크로폰 장치.
  10. 제9항에 있어서,
    상기 복수의 활성 단어 검출 알고리즘의 다른 하나는 사용하지 않고, 상기 제1 활성 단어 검출 알고리즘을 사용하여, 상기 사운드 데이터를 분석하여 상기 후보 활성 단어의 검출을 확인하는 동작은, 상기 활성 단어 검출 알고리즘의 다른 하나를 사용하여 상기 사운드 데이터를 프로세싱하는 제2 활성 단어 엔진이 비활성화 상태에 있는 동안, 제1 활성 단어 엔진을 활성화하여 상기 제1 활성 단어 검출 알고리즘을 사용하여 상기 사운드 데이터를 프로세싱하는 동작을 포함하는, 네트워크 마이크로폰 장치.
  11. 제9항에 있어서,
    상기 후보 활성 단어를 식별하는 동작은 상기 사운드 데이터 내에 상기 후보 활성 단어가 존재하는 확률을 결정하는 동작을 포함하는, 네트워크 마이크로폰 장치.
  12. 제9항에 있어서,
    상기 제1 활성 단어 검출 알고리즘은 상기 후보 활성 단어와 연관되며, 상기 복수의 활성 단어 검출 알고리즘의 다른 하나는 하나 이상의 추가적인 활성 단어와 연관되는 것인, 네트워크 마이크로폰 장치.
  13. 제9항에 있어서,
    상기 후보 활성 단어를 식별하는 동작은 뉴럴 네트워크 모델을 상기 사운드 데이터에 적용하는 동작을 포함하는, 네트워크 마이크로폰 장치.
  14. 제9항에 있어서,
    상기 동작들은
    상기 음성 발화를 전송하는 동작 이후에, 상기 네트워크 마이크로폰 장치를 통하여, 상기 음성 발화에 관한 미디어 컨텐츠의 선택을 수신하는 동작을 더 포함하는, 네트워크 마이크로폰 장치.
  15. 제9항에 있어서,
    상기 복수의 활성 단어 검출 알고리즘은
    상기 제1 활성 단어 검출 알고리즘; 및
    상기 네트워크 마이크로폰 장치의 로컬 기능을 수행하도록 하는 제2 활성 단어 검출 알고리즘을 포함하는, 네트워크 마이크로폰 장치.
  16. 네트워크 마이크로폰 장치로 하여금 동작들을 수행하도록 하는 하나 이상의 프로세서에 의해 실행가능한 명령어를 저장하는, 유형이고 비일시적인 컴퓨터 판독 가능 매체로서,
    상기 동작들은,
    상기 네트워크 마이크로폰 장치를 통하여 사운드 데이터를 캡처하는 동작;
    키워드 스포팅 알고리즘을 사용하여, 상기 사운드 데이터 내 후보 활성 단어를 식별하는 동작;
    상기 키워드 스포팅 알고리즘을 통하여 상기 사운드 데이터 내의 상기 후보 활성 단어의 식별에 기초하여, 상기 네트워크 마이크로폰 장치에 저장된 복수의 활성 단어 검출 알고리즘 중에서 제1 활성 단어 검출 알고리즘을 선택하는 동작 - 상기 제1 활성 단어 검출 알고리즘은 제1 음성 지원 서비스와 연관되며, 상기 복수의 활성 단어 검출 알고리즘의 다른 하나는 상기 제1 음성 지원 서비스와 상이한 제2 음성 지원 서비스와 연관됨 -;
    상기 제1 활성 단어 검출 알고리즘을 선택한 이후에 그리고 상기 복수의 활성 단어 검출 알고리즘의 다른 하나는 사용하지 않으면서, 상기 제1 활성 단어 검출 알고리즘을 사용하여 상기 사운드 데이터를 분석하여 상기 키워드 스포팅 알고리즘을 통하여 식별된 상기 후보 활성 단어의 검출을 확인하는 동작 - 상기 제1 활성 단어 검출 알고리즘은 상기 키워드 스포팅 알고리즘보다 높은 정확도를 가지고 상기 후보 활성 단어가 상기 사운드 데이터 내에 존재하는지 여부를 결정함 -; 및
    상기 후보 활성 단어의 검출을 확인하는 동작에 응답하여, 상기 제1 음성 지원 서비스와 연관된 하나 이상의 원격 컴퓨팅 장치로 상기 사운드 데이터의 음성 발화를 전송하는 동작을 포함하는, 컴퓨터 판독가능 기록매체.
  17. 제16항에 있어서,
    상기 복수의 활성 단어 검출 알고리즘의 다른 하나는 사용하지 않고, 상기 제1 활성 단어 검출 알고리즘을 사용하여, 상기 사운드 데이터를 분석하여 상기 후보 활성 단어의 검출을 확인하는 동작은, 상기 복수의 활성 단어 검출 알고리즘의 다른 하나를 사용하여 상기 사운드 데이터를 프로세싱하는 제2 활성 단어 엔진이 비활성화 상태에 있는 동안, 제1 활성 단어 엔진을 활성화하여 상기 제1 활성 단어 검출 알고리즘을 사용하여 상기 사운드 데이터를 프로세싱하는 동작을 포함하는, 컴퓨터 판독가능 기록매체.
  18. 제16항에 있어서,
    상기 제1 활성 단어 검출 알고리즘은 상기 후보 활성 단어와 연관되며, 상기 복수의 활성 단어 검출 알고리즘의 다른 하나는 하나 이상의 추가적인 활성 단어와 연관되는 것인, 컴퓨터 판독가능 기록매체.
  19. 제16항에 있어서,
    상기 후보 활성 단어를 식별하는 동작은 뉴럴 네트워크 모델을 상기 사운드 데이터에 적용하는 동작을 포함하는, 컴퓨터 판독가능 기록매체.
KR1020237018549A 2018-09-28 2019-09-25 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법 KR102581837B1 (ko)

Priority Applications (1)

Application Number Priority Date Filing Date Title
KR1020237031855A KR20230145195A (ko) 2018-09-28 2019-09-25 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법

Applications Claiming Priority (4)

Application Number Priority Date Filing Date Title
US16/145,275 2018-09-28
US16/145,275 US11100923B2 (en) 2018-09-28 2018-09-28 Systems and methods for selective wake word detection using neural network models
PCT/US2019/052841 WO2020068909A1 (en) 2018-09-28 2019-09-25 Systems and methods for selective wake word detection using neural network models
KR1020217030939A KR102541498B1 (ko) 2018-09-28 2019-09-25 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법

Related Parent Applications (1)

Application Number Title Priority Date Filing Date
KR1020217030939A Division KR102541498B1 (ko) 2018-09-28 2019-09-25 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법

Related Child Applications (1)

Application Number Title Priority Date Filing Date
KR1020237031855A Division KR20230145195A (ko) 2018-09-28 2019-09-25 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법

Publications (2)

Publication Number Publication Date
KR20230085214A KR20230085214A (ko) 2023-06-13
KR102581837B1 true KR102581837B1 (ko) 2023-09-25

Family

ID=68165815

Family Applications (5)

Application Number Title Priority Date Filing Date
KR1020217030939A KR102541498B1 (ko) 2018-09-28 2019-09-25 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법
KR1020237018549A KR102581837B1 (ko) 2018-09-28 2019-09-25 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법
KR1020207003504A KR102122312B1 (ko) 2018-09-28 2019-09-25 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법
KR1020237031855A KR20230145195A (ko) 2018-09-28 2019-09-25 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법
KR1020207016077A KR102308525B1 (ko) 2018-09-28 2019-09-25 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법

Family Applications Before (1)

Application Number Title Priority Date Filing Date
KR1020217030939A KR102541498B1 (ko) 2018-09-28 2019-09-25 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법

Family Applications After (3)

Application Number Title Priority Date Filing Date
KR1020207003504A KR102122312B1 (ko) 2018-09-28 2019-09-25 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법
KR1020237031855A KR20230145195A (ko) 2018-09-28 2019-09-25 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법
KR1020207016077A KR102308525B1 (ko) 2018-09-28 2019-09-25 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법

Country Status (7)

Country Link
US (3) US11100923B2 (ko)
EP (2) EP3655948B1 (ko)
JP (2) JP7096353B2 (ko)
KR (5) KR102541498B1 (ko)
CN (1) CN111247582A (ko)
AU (2) AU2019299865B2 (ko)
WO (1) WO2020068909A1 (ko)

Families Citing this family (80)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US9965247B2 (en) 2016-02-22 2018-05-08 Sonos, Inc. Voice controlled media playback system based on user profile
US10264030B2 (en) 2016-02-22 2019-04-16 Sonos, Inc. Networked microphone device control
US9947316B2 (en) 2016-02-22 2018-04-17 Sonos, Inc. Voice control of a media playback system
US9820039B2 (en) 2016-02-22 2017-11-14 Sonos, Inc. Default playback devices
US10095470B2 (en) 2016-02-22 2018-10-09 Sonos, Inc. Audio response playback
US9811314B2 (en) 2016-02-22 2017-11-07 Sonos, Inc. Metadata exchange involving a networked playback system and a networked microphone system
US9978390B2 (en) 2016-06-09 2018-05-22 Sonos, Inc. Dynamic player selection for audio signal processing
US10152969B2 (en) 2016-07-15 2018-12-11 Sonos, Inc. Voice detection by multiple devices
US10134399B2 (en) 2016-07-15 2018-11-20 Sonos, Inc. Contextualization of voice inputs
US10115400B2 (en) 2016-08-05 2018-10-30 Sonos, Inc. Multiple voice services
US9942678B1 (en) 2016-09-27 2018-04-10 Sonos, Inc. Audio playback settings for voice interaction
US9743204B1 (en) 2016-09-30 2017-08-22 Sonos, Inc. Multi-orientation playback device microphones
US10181323B2 (en) 2016-10-19 2019-01-15 Sonos, Inc. Arbitration-based voice recognition
US10475449B2 (en) 2017-08-07 2019-11-12 Sonos, Inc. Wake-word detection suppression
US10048930B1 (en) 2017-09-08 2018-08-14 Sonos, Inc. Dynamic computation of system response volume
US10446165B2 (en) 2017-09-27 2019-10-15 Sonos, Inc. Robust short-time fourier transform acoustic echo cancellation during audio playback
US10621981B2 (en) 2017-09-28 2020-04-14 Sonos, Inc. Tone interference cancellation
US10482868B2 (en) 2017-09-28 2019-11-19 Sonos, Inc. Multi-channel acoustic echo cancellation
US10466962B2 (en) 2017-09-29 2019-11-05 Sonos, Inc. Media playback system with voice assistance
US10880650B2 (en) 2017-12-10 2020-12-29 Sonos, Inc. Network microphone devices with automatic do not disturb actuation capabilities
US10818290B2 (en) 2017-12-11 2020-10-27 Sonos, Inc. Home graph
WO2019152722A1 (en) 2018-01-31 2019-08-08 Sonos, Inc. Device designation of playback and network microphone device arrangements
US11175880B2 (en) 2018-05-10 2021-11-16 Sonos, Inc. Systems and methods for voice-assisted media content selection
US10847178B2 (en) * 2018-05-18 2020-11-24 Sonos, Inc. Linear filtering for noise-suppressed speech detection
US10959029B2 (en) 2018-05-25 2021-03-23 Sonos, Inc. Determining and adapting to changes in microphone performance of playback devices
US10681460B2 (en) 2018-06-28 2020-06-09 Sonos, Inc. Systems and methods for associating playback devices with voice assistant services
US11076035B2 (en) 2018-08-28 2021-07-27 Sonos, Inc. Do not disturb feature for audio notifications
US10461710B1 (en) 2018-08-28 2019-10-29 Sonos, Inc. Media playback system with maximum volume setting
US10587430B1 (en) 2018-09-14 2020-03-10 Sonos, Inc. Networked devices, systems, and methods for associating playback devices based on sound codes
US11024331B2 (en) 2018-09-21 2021-06-01 Sonos, Inc. Voice detection optimization using sound metadata
US10811015B2 (en) 2018-09-25 2020-10-20 Sonos, Inc. Voice detection optimization based on selected voice assistant service
US11100923B2 (en) 2018-09-28 2021-08-24 Sonos, Inc. Systems and methods for selective wake word detection using neural network models
US10692518B2 (en) 2018-09-29 2020-06-23 Sonos, Inc. Linear filtering for noise-suppressed speech detection via multiple network microphone devices
US10971158B1 (en) * 2018-10-05 2021-04-06 Facebook, Inc. Designating assistants in multi-assistant environment based on identified wake word received from a user
US11899519B2 (en) 2018-10-23 2024-02-13 Sonos, Inc. Multiple stage network microphone device with reduced power consumption and processing load
EP3654249A1 (en) * 2018-11-15 2020-05-20 Snips Dilated convolutions and gating for efficient keyword spotting
US11183183B2 (en) 2018-12-07 2021-11-23 Sonos, Inc. Systems and methods of operating media playback systems having multiple voice assistant services
US11132989B2 (en) 2018-12-13 2021-09-28 Sonos, Inc. Networked microphone devices, systems, and methods of localized arbitration
US10602268B1 (en) 2018-12-20 2020-03-24 Sonos, Inc. Optimization of network microphone devices using noise classification
US10839158B2 (en) * 2019-01-25 2020-11-17 Motorola Mobility Llc Dynamically loaded phrase spotting audio-front end
US10867604B2 (en) 2019-02-08 2020-12-15 Sonos, Inc. Devices, systems, and methods for distributed voice processing
US11315556B2 (en) 2019-02-08 2022-04-26 Sonos, Inc. Devices, systems, and methods for distributed voice processing by transmitting sound data associated with a wake word to an appropriate device for identification
US11444845B1 (en) * 2019-03-05 2022-09-13 Amazon Technologies, Inc. Processing requests using compressed and complete machine learning models
EP4224469A3 (en) 2019-04-01 2023-09-06 Google LLC Adaptive management of casting requests and/or user inputs at a rechargeable device
EP3722158A1 (en) * 2019-04-10 2020-10-14 Volvo Car Corporation A voice assistant system
US11120794B2 (en) 2019-05-03 2021-09-14 Sonos, Inc. Voice assistant persistence across multiple network microphone devices
US11200894B2 (en) 2019-06-12 2021-12-14 Sonos, Inc. Network microphone device with command keyword eventing
US10586540B1 (en) 2019-06-12 2020-03-10 Sonos, Inc. Network microphone device with command keyword conditioning
US11361756B2 (en) 2019-06-12 2022-06-14 Sonos, Inc. Conditional wake word eventing based on environment
EP3785396B1 (en) * 2019-07-17 2022-09-21 Google LLC Systems and methods to verify trigger keywords in acoustic-based digital assistant applications
US10871943B1 (en) 2019-07-31 2020-12-22 Sonos, Inc. Noise classification for event detection
US11138969B2 (en) 2019-07-31 2021-10-05 Sonos, Inc. Locally distributed keyword detection
US11138975B2 (en) 2019-07-31 2021-10-05 Sonos, Inc. Locally distributed keyword detection
KR102629796B1 (ko) * 2019-10-15 2024-01-26 삼성전자 주식회사 음성 인식의 향상을 지원하는 전자 장치
US11189286B2 (en) 2019-10-22 2021-11-30 Sonos, Inc. VAS toggle based on device orientation
US11200900B2 (en) 2019-12-20 2021-12-14 Sonos, Inc. Offline voice control
US20210201928A1 (en) * 2019-12-31 2021-07-01 Knowles Electronics, Llc Integrated speech enhancement for voice trigger application
US11562740B2 (en) 2020-01-07 2023-01-24 Sonos, Inc. Voice verification for media playback
US11556307B2 (en) 2020-01-31 2023-01-17 Sonos, Inc. Local voice data processing
US11790902B2 (en) * 2020-02-04 2023-10-17 Amazon Technologies, Inc. Speech-processing system
US11367445B2 (en) * 2020-02-05 2022-06-21 Citrix Systems, Inc. Virtualized speech in a distributed network environment
US11308958B2 (en) 2020-02-07 2022-04-19 Sonos, Inc. Localized wakeword verification
US11482222B2 (en) * 2020-03-12 2022-10-25 Motorola Solutions, Inc. Dynamically assigning wake words
US11308962B2 (en) 2020-05-20 2022-04-19 Sonos, Inc. Input detection windowing
US11727919B2 (en) 2020-05-20 2023-08-15 Sonos, Inc. Memory allocation for keyword spotting engines
US11482224B2 (en) 2020-05-20 2022-10-25 Sonos, Inc. Command keywords with input detection windowing
CN113744732A (zh) * 2020-05-28 2021-12-03 阿里巴巴集团控股有限公司 设备唤醒相关方法、装置及故事机
CN111768783B (zh) 2020-06-30 2024-04-02 北京百度网讯科技有限公司 语音交互控制方法、装置、电子设备、存储介质和系统
US11698771B2 (en) 2020-08-25 2023-07-11 Sonos, Inc. Vocal guidance engines for playback devices
KR20220037819A (ko) * 2020-09-18 2022-03-25 엘지전자 주식회사 복수의 기동어를 인식하는 인공 지능 장치 및 그 방법
US11557292B1 (en) * 2020-10-21 2023-01-17 Amazon Technologies, Inc. Speech command verification
CN112291436B (zh) * 2020-10-23 2022-03-01 杭州蓦然认知科技有限公司 一种对主叫用户的调度方法及装置
US11164084B1 (en) * 2020-11-11 2021-11-02 DeepCube LTD. Cluster-connected neural network
US11984123B2 (en) 2020-11-12 2024-05-14 Sonos, Inc. Network device interaction by range
WO2022122121A1 (en) * 2020-12-08 2022-06-16 Huawei Technologies Co., Ltd. End-to-end streaming acoustic trigger apparatus and method
CN112712801B (zh) * 2020-12-14 2024-02-02 北京有竹居网络技术有限公司 一种语音唤醒方法、装置、电子设备及存储介质
US11551700B2 (en) 2021-01-25 2023-01-10 Sonos, Inc. Systems and methods for power-efficient keyword detection
US11657818B2 (en) * 2021-03-10 2023-05-23 GM Global Technology Operations LLC Multi-assistant control
US20220399007A1 (en) * 2021-06-11 2022-12-15 Harman International Industries, Incorporated System and method for robust wakeword detection in presence of noise in new unseen environments without additional data
US20230099144A1 (en) * 2021-09-30 2023-03-30 Sonos, Inc. Enabling and Disabling Microphones and Voice Assistants

Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2016524193A (ja) 2013-06-27 2016-08-12 ロウルズ リミテッド ライアビリティ カンパニー 自己生成ウェイク表現の検出
US20180096678A1 (en) 2016-09-30 2018-04-05 Robert Bosch Gmbh System And Method For Speech Recognition
US20180277113A1 (en) 2017-03-27 2018-09-27 Sonos, Inc. Systems and Methods of Multiple Voice Services

Family Cites Families (1212)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US999715A (en) 1911-05-31 1911-08-01 Hans Gundersen Flying-machine.
US4941187A (en) 1984-02-03 1990-07-10 Slater Robert W Intercom apparatus for integrating disparate audio sources for use in light aircraft or similar high noise environments
US4741038A (en) 1986-09-26 1988-04-26 American Telephone And Telegraph Company, At&T Bell Laboratories Sound location arrangement
JPS63301998A (ja) 1987-06-02 1988-12-08 日本電気株式会社 音声認識応答装置
US4974213A (en) 1988-12-16 1990-11-27 Siwecki Thomas L Passive active underwater sound detection apparatus
US5036538A (en) 1989-11-22 1991-07-30 Telephonics Corporation Multi-station voice recognition and processing system
US5440644A (en) 1991-01-09 1995-08-08 Square D Company Audio distribution system having programmable zoning features
DE69220342T2 (de) 1991-12-20 1997-11-20 Matsushita Electric Ind Co Ltd Lautsprecherapparat zur Basswiedergabe
US6311157B1 (en) 1992-12-31 2001-10-30 Apple Computer, Inc. Assigning meanings to utterances in a speech recognition system
JPH0883091A (ja) 1994-09-09 1996-03-26 Matsushita Electric Ind Co Ltd 音声認識装置
US5740260A (en) 1995-05-22 1998-04-14 Presonus L.L.P. Midi to analog sound processor interface
US6070140A (en) 1995-06-05 2000-05-30 Tran; Bao Q. Speech recognizer
US5857172A (en) 1995-07-31 1999-01-05 Microsoft Corporation Activation control of a speech recognizer through use of a pointing device
US7174299B2 (en) 1995-08-18 2007-02-06 Canon Kabushiki Kaisha Speech recognition system, speech recognition apparatus, and speech recognition method
FR2739736B1 (fr) 1995-10-05 1997-12-05 Jean Laroche Procede de reduction des pre-echos ou post-echos affectant des enregistrements audio
JP3094900B2 (ja) 1996-02-20 2000-10-03 ヤマハ株式会社 ネットワーク機器およびデータ送受信方法
US6404811B1 (en) 1996-05-13 2002-06-11 Tektronix, Inc. Interactive multimedia system
JP3679526B2 (ja) 1996-10-31 2005-08-03 キヤノン株式会社 画像共有装置、画面制御方法及びコンピュータ可読メモリ
US6469633B1 (en) 1997-01-06 2002-10-22 Openglobe Inc. Remote control of electronic devices
US6078886A (en) 1997-04-14 2000-06-20 At&T Corporation System and method for providing remote automatic speech recognition services via a packet network
US6611537B1 (en) 1997-05-30 2003-08-26 Centillium Communications, Inc. Synchronous network for digital media streams
US6408078B1 (en) 1997-10-30 2002-06-18 Maximilian Hobelsberger Active reactive acoustical elements
US6088459A (en) 1997-10-30 2000-07-11 Hobelsberger; Maximilian Hans Loudspeaker system with simulated baffle for improved base reproduction
US6032202A (en) 1998-01-06 2000-02-29 Sony Corporation Of Japan Home audio/video network with two level device control
US20020002039A1 (en) 1998-06-12 2002-01-03 Safi Qureshey Network-enabled audio device
US6301603B1 (en) 1998-02-17 2001-10-09 Euphonics Incorporated Scalable audio processing on a heterogeneous processor array
US6953886B1 (en) 1998-06-17 2005-10-11 Looney Productions, Llc Media organizer and entertainment center
IL127569A0 (en) 1998-09-16 1999-10-28 Comsense Technologies Ltd Interactive toys
US6839410B2 (en) 1998-09-01 2005-01-04 At&T Corp. Method and apparatus for setting user communication parameters based on voice identification of users
JP2002527800A (ja) 1998-10-02 2002-08-27 インターナショナル・ビジネス・マシーンズ・コーポレーション 会話ブラウザおよび会話システム
US20020116196A1 (en) * 1998-11-12 2002-08-22 Tran Bao Q. Speech recognizer
US6243676B1 (en) 1998-12-23 2001-06-05 Openwave Systems Inc. Searching and retrieving multimedia information
US7130616B2 (en) 2000-04-25 2006-10-31 Simple Devices System and method for providing content, management, and interactivity for client devices
US6256554B1 (en) 1999-04-14 2001-07-03 Dilorenzo Mark Multi-room entertainment system with in-room media player/dispenser
US6414251B1 (en) 1999-04-19 2002-07-02 Breck Colquett Weighing apparatus and method having automatic tolerance analysis and calibration
US7657910B1 (en) 1999-07-26 2010-02-02 E-Cast Inc. Distributed electronic entertainment method and apparatus
GB2352933A (en) 1999-07-31 2001-02-07 Ibm Speech encoding in a client server system
US6542868B1 (en) 1999-09-23 2003-04-01 International Business Machines Corporation Audio notification management system
US6937977B2 (en) 1999-10-05 2005-08-30 Fastmobile, Inc. Method and apparatus for processing an input speech signal during presentation of an output audio signal
US6611604B1 (en) 1999-10-22 2003-08-26 Stillwater Designs & Audio, Inc. Ultra low frequency transducer and loud speaker comprising same
US7725307B2 (en) 1999-11-12 2010-05-25 Phoenix Solutions, Inc. Query engine for processing voice based queries including semantic decoding
US6594630B1 (en) 1999-11-19 2003-07-15 Voice Signal Technologies, Inc. Voice-activated control for electrical device
US6522886B1 (en) 1999-11-22 2003-02-18 Qwest Communications International Inc. Method and system for simultaneously sharing wireless communications among multiple wireless handsets
US6219645B1 (en) 1999-12-02 2001-04-17 Lucent Technologies, Inc. Enhanced automatic speech recognition using multiple directional microphones
EP1104968B1 (en) 1999-12-03 2007-02-14 Telefonaktiebolaget LM Ericsson (publ) A method of simultaneously playing back audio files in two telephones
KR20010054622A (ko) 1999-12-07 2001-07-02 서평원 음성 인식 시스템의 음성 인식률 향상 방법
US20010042107A1 (en) 2000-01-06 2001-11-15 Palm Stephen R. Networked audio player transport protocol and architecture
US7661107B1 (en) 2000-01-18 2010-02-09 Advanced Micro Devices, Inc. Method and apparatus for dynamic allocation of processing resources
WO2001053994A2 (en) 2000-01-24 2001-07-26 Friskit, Inc. Streaming media search and playback system
WO2001053963A1 (en) 2000-01-24 2001-07-26 Zapmedia, Inc. System and method for the distribution and sharing of media assets between media players devices
AU2001237673A1 (en) 2000-02-18 2001-08-27 Bridgeco Ag Reference time distribution over a network
JP2001236093A (ja) 2000-02-24 2001-08-31 Omron Corp 電子機器制御装置および電子機器
US8645137B2 (en) 2000-03-16 2014-02-04 Apple Inc. Fast, language-independent method for user authentication by voice
US6631410B1 (en) 2000-03-16 2003-10-07 Sharp Laboratories Of America, Inc. Multimedia wired/wireless content synchronization system and method
US20020022453A1 (en) 2000-03-31 2002-02-21 Horia Balog Dynamic protocol selection and routing of content to mobile devices
GB2363036B (en) 2000-05-31 2004-05-12 Nokia Mobile Phones Ltd Conference call method and apparatus therefor
US20050164664A1 (en) 2000-07-21 2005-07-28 Difonzo Daniel F. Dynamically reconfigurable wireless networks (DRWiN) and methods for operating such networks
US20040105566A1 (en) 2000-07-27 2004-06-03 International Business Machines Corporation Body set type speaker unit
WO2002023389A1 (en) 2000-09-15 2002-03-21 Robert Fish Systems and methods for translating an item of information using a distal computer
US6934756B2 (en) 2000-11-01 2005-08-23 International Business Machines Corporation Conversational networking via transport, coding and control conversational protocols
US20020054685A1 (en) 2000-11-09 2002-05-09 Carlos Avendano System for suppressing acoustic echoes and interferences in multi-channel audio systems
US20020072816A1 (en) 2000-12-07 2002-06-13 Yoav Shdema Audio system
US7016847B1 (en) 2000-12-08 2006-03-21 Ben Franklin Patent Holdings L.L.C. Open architecture for a voice user interface
US6778869B2 (en) 2000-12-11 2004-08-17 Sony Corporation System and method for request, delivery and use of multimedia files for audiovisual entertainment in the home environment
US7143939B2 (en) 2000-12-19 2006-12-05 Intel Corporation Wireless music device and method therefor
US20020124097A1 (en) 2000-12-29 2002-09-05 Isely Larson J. Methods, systems and computer program products for zone based distribution of audio signals
US7617099B2 (en) 2001-02-12 2009-11-10 FortMedia Inc. Noise suppression by two-channel tandem spectrum modification for speech signal in an automobile
GB2372864B (en) 2001-02-28 2005-09-07 Vox Generation Ltd Spoken language interface
US6885989B2 (en) 2001-04-02 2005-04-26 International Business Machines Corporation Method and system for collaborative speech recognition for small-area network
US6757517B2 (en) 2001-05-10 2004-06-29 Chin-Chi Chang Apparatus and method for coordinated music playback in wireless ad-hoc networks
US7136934B2 (en) 2001-06-19 2006-11-14 Request, Inc. Multimedia synchronization method and device
KR100420069B1 (ko) 2001-08-23 2004-02-25 한국과학기술원 인지 특성을 반영한 메뉴 설계 및 아이템 제시방법
US6892083B2 (en) 2001-09-05 2005-05-10 Vocera Communications Inc. Voice-controlled wireless communications system and method
US7536704B2 (en) 2001-10-05 2009-05-19 Opentv, Inc. Method and apparatus automatic pause and resume of playback for a popup on interactive TV
CA2408045A1 (en) 2001-10-16 2003-04-16 Audio Products International Corp. Loudspeaker with large displacement motional feedback
CA2407123C (en) 2001-10-16 2007-12-18 Audio Products International Corp. Low distortion loudspeaker cone suspension
US7006639B2 (en) 2001-11-20 2006-02-28 Maximilian Hans Hobelsberger Active noise-attenuating duct element
US7103542B2 (en) 2001-12-14 2006-09-05 Ben Franklin Patent Holding Llc Automatically improving a voice recognition system
US7391791B2 (en) 2001-12-17 2008-06-24 Implicit Networks, Inc. Method and system for synchronization of content rendering
DE10163213A1 (de) 2001-12-21 2003-07-10 Philips Intellectual Property Verfahren zum Betrieb eines Spracherkennungssystems
US8103009B2 (en) 2002-01-25 2012-01-24 Ksc Industries, Inc. Wired, wireless, infrared, and powerline audio entertainment systems
US7853341B2 (en) 2002-01-25 2010-12-14 Ksc Industries, Inc. Wired, wireless, infrared, and powerline audio entertainment systems
JP4086280B2 (ja) 2002-01-29 2008-05-14 株式会社東芝 音声入力システム、音声入力方法及び音声入力プログラム
AU2003216319A1 (en) 2002-02-20 2003-09-09 Meshnetworks, Inc. A system and method for routing 802.11 data traffic across channels to increase ad-hoc network capacity
JP3715584B2 (ja) 2002-03-28 2005-11-09 富士通株式会社 機器制御装置および機器制御方法
CA2485100C (en) 2002-05-06 2012-10-09 David Goldberg Localized audio networks and associated digital accessories
US7643894B2 (en) 2002-05-09 2010-01-05 Netstreams Llc Audio network distribution system
US6961423B2 (en) 2002-06-24 2005-11-01 Freescale Semiconductor, Inc. Method and apparatus for performing adaptive filtering
JP3815388B2 (ja) 2002-06-25 2006-08-30 株式会社デンソー 音声認識システムおよび端末
US8060225B2 (en) 2002-07-31 2011-11-15 Hewlett-Packard Development Company, L. P. Digital audio device
EP1389853B1 (en) 2002-08-14 2006-03-29 Sony Deutschland GmbH Bandwidth oriented reconfiguration of wireless ad hoc networks
JP3910898B2 (ja) 2002-09-17 2007-04-25 株式会社東芝 指向性設定装置、指向性設定方法及び指向性設定プログラム
US7228275B1 (en) 2002-10-21 2007-06-05 Toyota Infotechnology Center Co., Ltd. Speech recognition system having multiple speech recognizers
JP2004163590A (ja) 2002-11-12 2004-06-10 Denso Corp 再生装置及びプログラム
KR20040042242A (ko) 2002-11-13 2004-05-20 삼성전자주식회사 홈서버를 이용하는 홈로봇 및 이를 포함하는 홈네트워크시스템
US7295548B2 (en) 2002-11-27 2007-11-13 Microsoft Corporation Method and system for disaggregating audio/visual components
CN100392723C (zh) 2002-12-11 2008-06-04 索夫塔马克斯公司 在稳定性约束下使用独立分量分析的语音处理系统和方法
US7076428B2 (en) 2002-12-30 2006-07-11 Motorola, Inc. Method and apparatus for selective distributed speech recognition
KR100668297B1 (ko) 2002-12-31 2007-01-12 삼성전자주식회사 음성인식방법 및 장치
US6823050B2 (en) 2003-02-13 2004-11-23 International Business Machines Corporation System and method for interfacing with a personal telephony recorder
CA2518121A1 (en) 2003-03-03 2004-09-16 America Online, Inc. Source audio identifiers for digital communications
JP2004347943A (ja) 2003-05-23 2004-12-09 Clarion Co Ltd データ処理装置、楽曲再生装置、データ処理装置の制御プログラムおよび楽曲再生装置の制御プログラム
JP2004354721A (ja) 2003-05-29 2004-12-16 Shimizu Corp 音声制御装置、音声制御方法および音声制御プログラム
US7571014B1 (en) 2004-04-01 2009-08-04 Sonos, Inc. Method and apparatus for controlling multimedia players in a multi-zone system
US8290603B1 (en) 2004-06-05 2012-10-16 Sonos, Inc. User interfaces for controlling and manipulating groupings in a multi-zone media system
US7961892B2 (en) 2003-07-28 2011-06-14 Texas Instruments Incorporated Apparatus and method for monitoring speaker cone displacement in an audio speaker
US10613817B2 (en) 2003-07-28 2020-04-07 Sonos, Inc. Method and apparatus for displaying a list of tracks scheduled for playback by a synchrony group
US8234395B2 (en) 2003-07-28 2012-07-31 Sonos, Inc. System and method for synchronizing operations among a plurality of independently clocked digital data processing devices
US20050031139A1 (en) 2003-08-07 2005-02-10 Tymphany Corporation Position detection of an actuator using impedance
US20060104451A1 (en) 2003-08-07 2006-05-18 Tymphany Corporation Audio reproduction system
US20050031138A1 (en) 2003-08-07 2005-02-10 Tymphany Corporation Method of measuring a cant of an actuator
US20050031132A1 (en) 2003-08-07 2005-02-10 Tymphany Corporation Control system
US20050031140A1 (en) 2003-08-07 2005-02-10 Tymphany Corporation Position detection of an actuator using a capacitance measurement
US20050031133A1 (en) 2003-08-07 2005-02-10 Tymphany Corporation Process for position indication
US20050031131A1 (en) 2003-08-07 2005-02-10 Tymphany Corporation Method of modifying dynamics of a system
US20050031137A1 (en) 2003-08-07 2005-02-10 Tymphany Corporation Calibration of an actuator
US20050031134A1 (en) 2003-08-07 2005-02-10 Tymphany Corporation Position detection of an actuator using infrared light
KR20050023841A (ko) 2003-09-03 2005-03-10 삼성전자주식회사 비선형 왜곡 저감 방법 및 장치
US7099821B2 (en) 2003-09-12 2006-08-29 Softmax, Inc. Separation of target acoustic signals in a multi-transducer arrangement
US20050077843A1 (en) 2003-10-11 2005-04-14 Ronnie Benditt Method and apparatus for controlling a performing arts show by an onstage performer
EP1680942A1 (en) 2003-10-24 2006-07-19 Koninklijke Philips Electronics N.V. Adaptive sound reproduction
DE602004021716D1 (de) 2003-11-12 2009-08-06 Honda Motor Co Ltd Spracherkennungssystem
US7705565B2 (en) 2003-12-31 2010-04-27 Motorola, Inc. Method and system for wireless charging
US7707039B2 (en) 2004-02-15 2010-04-27 Exbiblio B.V. Automatic modification of web pages
JP4269973B2 (ja) 2004-02-27 2009-05-27 株式会社デンソー カーオーディオシステム
US7483538B2 (en) 2004-03-02 2009-01-27 Ksc Industries, Inc. Wireless and wired speaker hub for a home theater system
US7415117B2 (en) 2004-03-02 2008-08-19 Microsoft Corporation System and method for beamforming using a microphone array
JP4059214B2 (ja) 2004-03-04 2008-03-12 ソニー株式会社 情報再生システムの制御方法、情報再生システム、情報提供装置、および情報提供プログラム
US10200504B2 (en) 2007-06-12 2019-02-05 Icontrol Networks, Inc. Communication protocols over internet protocol (IP) networks
US7372966B2 (en) 2004-03-19 2008-05-13 Nokia Corporation System for limiting loudspeaker displacement
JP2005284492A (ja) 2004-03-29 2005-10-13 Mitsubishi Electric Corp 音声利用操作装置
US7630501B2 (en) 2004-05-14 2009-12-08 Microsoft Corporation System and method for calibration of an acoustic system
US7792311B1 (en) 2004-05-15 2010-09-07 Sonos, Inc., Method and apparatus for automatically enabling subwoofer channel audio based on detection of subwoofer device
US7346846B2 (en) 2004-05-28 2008-03-18 Microsoft Corporation Strategies for providing just-in-time user assistance
US7006938B2 (en) 2004-06-16 2006-02-28 Ami Semiconductor, Inc. Reactive sensor modules using Pade' Approximant based compensation and providing module-sourced excitation
US7672845B2 (en) 2004-06-22 2010-03-02 International Business Machines Corporation Method and system for keyword detection using voice-recognition
US20060004834A1 (en) 2004-06-30 2006-01-05 Nokia Corporation Dynamic shortcuts
JP2006092482A (ja) 2004-09-27 2006-04-06 Yamaha Corp 音声認識通報装置
US7720232B2 (en) 2004-10-15 2010-05-18 Lifesize Communications, Inc. Speakerphone
US8386523B2 (en) 2004-12-30 2013-02-26 Texas Instruments Incorporated Random access audio decoder
TWI272860B (en) 2005-01-03 2007-02-01 Lite On Technology Corp Audio receiver and volume reminder method
US20070189544A1 (en) 2005-01-15 2007-08-16 Outland Research, Llc Ambient sound responsive media player
US8396213B2 (en) 2005-01-21 2013-03-12 Certicom Corp. Elliptic curve random number generation
US20060190968A1 (en) 2005-01-31 2006-08-24 Searete Llc, A Limited Corporation Of The State Of The State Of Delaware Sharing between shared audio devices
EP1715669A1 (en) 2005-04-19 2006-10-25 Ecole Polytechnique Federale De Lausanne (Epfl) A method for removing echo in an audio signal
US8594320B2 (en) 2005-04-19 2013-11-26 (Epfl) Ecole Polytechnique Federale De Lausanne Hybrid echo and noise suppression method and device in a multi-channel audio signal
US7991167B2 (en) 2005-04-29 2011-08-02 Lifesize Communications, Inc. Forming beams with nulls directed at noise sources
US7720684B2 (en) 2005-04-29 2010-05-18 Nuance Communications, Inc. Method, apparatus, and computer program product for one-step correction of voice interaction
US9300790B2 (en) 2005-06-24 2016-03-29 Securus Technologies, Inc. Multi-party conversation analyzer and logger
JP4760160B2 (ja) 2005-06-29 2011-08-31 ヤマハ株式会社 集音装置
JP4804052B2 (ja) 2005-07-08 2011-10-26 アルパイン株式会社 音声認識装置、音声認識装置を備えたナビゲーション装置及び音声認識装置の音声認識方法
US20070018844A1 (en) 2005-07-19 2007-01-25 Sehat Sutardja Two way remote control
JP4285457B2 (ja) 2005-07-20 2009-06-24 ソニー株式会社 音場測定装置及び音場測定方法
WO2007013622A1 (ja) 2005-07-29 2007-02-01 Matsushita Electric Industrial Co., Ltd. スピーカ装置
CN1909625A (zh) 2005-08-05 2007-02-07 鸿富锦精密工业(深圳)有限公司 一种自动调整音量的电视装置及控制方法
US20090076821A1 (en) 2005-08-19 2009-03-19 Gracenote, Inc. Method and apparatus to control operation of a playback device
US20070060054A1 (en) 2005-09-15 2007-03-15 Sony Ericsson Mobile Communications Ab Wireless home communication system method and apparatus
JP4519041B2 (ja) 2005-09-20 2010-08-04 ローランド株式会社 楽器用スピーカ装置
EP1952177A2 (en) 2005-09-21 2008-08-06 Koninklijke Philips Electronics N.V. Ultrasound imaging system with voice activated controls usiong remotely positioned microphone
WO2007051493A1 (en) 2005-11-07 2007-05-10 Telecom Italia S.P.A. Method for managing a conference call in a telephone network
JP4929685B2 (ja) 2005-11-15 2012-05-09 ヤマハ株式会社 遠隔会議装置
WO2007058130A1 (ja) 2005-11-15 2007-05-24 Yamaha Corporation 遠隔会議装置及び放収音装置
US20070140058A1 (en) 2005-11-21 2007-06-21 Motorola, Inc. Method and system for correcting transducer non-linearities
US7600194B2 (en) 2005-12-02 2009-10-06 Microsoft Corporation Start menu operation for computer user interface
JP2007174233A (ja) 2005-12-21 2007-07-05 Pioneer Electronic Corp スピーカー装置及び携帯電話機
JP4677341B2 (ja) 2005-12-21 2011-04-27 パイオニア株式会社 スピーカー装置及び携帯電話機
US20160066087A1 (en) 2006-01-30 2016-03-03 Ludger Solbach Joint noise suppression and acoustic echo cancellation
KR100762636B1 (ko) 2006-02-14 2007-10-01 삼성전자주식회사 네트워크 단말의 음성 검출 제어 시스템 및 방법
JP4422692B2 (ja) 2006-03-03 2010-02-24 日本電信電話株式会社 伝達経路推定方法、残響除去方法、音源分離方法、これらの装置、プログラム、記録媒体
WO2007103937A2 (en) 2006-03-06 2007-09-13 General Innovations, Inc. Positionally sequenced loudspeaker system
EP2005319B1 (en) 2006-04-04 2017-01-11 Johnson Controls Technology Company System and method for extraction of meta data from a digital media storage device for media selection in a vehicle
EP1848243B1 (en) 2006-04-18 2009-02-18 Harman/Becker Automotive Systems GmbH Multi-channel echo compensation system and method
KR100786108B1 (ko) 2006-05-01 2007-12-18 김준식 음파통신 네트워크
US9208785B2 (en) 2006-05-10 2015-12-08 Nuance Communications, Inc. Synchronizing distributed speech recognition
ATE436151T1 (de) 2006-05-10 2009-07-15 Harman Becker Automotive Sys Kompensation von mehrkanalechos durch dekorrelation
US8041057B2 (en) 2006-06-07 2011-10-18 Qualcomm Incorporated Mixing techniques for mixing audio
JP4984683B2 (ja) 2006-06-29 2012-07-25 ヤマハ株式会社 放収音装置
US8207936B2 (en) 2006-06-30 2012-06-26 Sony Ericsson Mobile Communications Ab Voice remote control
US8189765B2 (en) 2006-07-06 2012-05-29 Panasonic Corporation Multichannel echo canceller
US20080037814A1 (en) 2006-08-09 2008-02-14 Jeng-Jye Shau Precision audio speakers
US8428278B2 (en) 2006-08-10 2013-04-23 Claudio Lastrucci Improvements to systems for acoustic diffusion
US10013381B2 (en) 2006-08-31 2018-07-03 Bose Corporation Media playing from a docked handheld media device
US8483853B1 (en) 2006-09-12 2013-07-09 Sonos, Inc. Controlling and manipulating groupings in a multi-zone media system
US8473618B2 (en) 2006-09-19 2013-06-25 Motorola Solutions, Inc. Method and system for processing multiple communication sessions in a communication network
JP2008079256A (ja) 2006-09-25 2008-04-03 Toshiba Corp 音響信号処理装置、音響信号処理方法及びプログラム
US8073681B2 (en) 2006-10-16 2011-12-06 Voicebox Technologies, Inc. System and method for a cooperative conversational voice user interface
US7747293B2 (en) 2006-10-17 2010-06-29 Marvell Worl Trade Ltd. Display control for cellular phone
JP2010507294A (ja) 2006-10-17 2010-03-04 アベガ システムズ ピーティーワイ リミテッド マルチメディアデバイスの統合
TWI435591B (zh) 2006-10-17 2014-04-21 Marvell World Trade Ltd 用於蜂巢電話之顯示控制
US8391501B2 (en) 2006-12-13 2013-03-05 Motorola Mobility Llc Method and apparatus for mixing priority and non-priority audio signals
US9124650B2 (en) 2006-12-13 2015-09-01 Quickplay Media Inc. Digital rights management in a mobile environment
US20080146289A1 (en) 2006-12-14 2008-06-19 Motorola, Inc. Automatic audio transducer adjustments based upon orientation of a mobile communication device
JP2008158868A (ja) 2006-12-25 2008-07-10 Toyota Motor Corp 移動体、及びその制御方法
US7973857B2 (en) 2006-12-27 2011-07-05 Nokia Corporation Teleconference group formation using context information
US20090013255A1 (en) 2006-12-30 2009-01-08 Matthew John Yuschik Method and System for Supporting Graphical User Interfaces
KR101316750B1 (ko) 2007-01-23 2013-10-08 삼성전자주식회사 수신된 위치 정보에 따라 오디오 파일을 재생하는 장치 및그 방법
TW200833152A (en) 2007-01-31 2008-08-01 Bluepacket Comm Co Ltd Multimedia switching system
WO2008096414A1 (ja) 2007-02-06 2008-08-14 Pioneer Corporation コンテンツ取得装置、コンテンツ取得方法、コンテンツ取得プログラムおよび記録媒体
US20090228919A1 (en) 2007-11-16 2009-09-10 Zott Joseph A Media playlist management and viewing remote control
US20080208594A1 (en) 2007-02-27 2008-08-28 Cross Charles W Effecting Functions On A Multimodal Telephony Device
JP4728982B2 (ja) 2007-03-05 2011-07-20 株式会社東芝 利用者と対話する装置、方法およびプログラム
US8996379B2 (en) 2007-03-07 2015-03-31 Vlingo Corporation Speech recognition text entry for software applications
US8635243B2 (en) 2007-03-07 2014-01-21 Research In Motion Limited Sending a communications header with voice recording to send metadata for use in speech recognition, formatting, and search mobile search application
US8886545B2 (en) 2007-03-07 2014-11-11 Vlingo Corporation Dealing with switch latency in speech recognition
US8019076B1 (en) 2007-03-14 2011-09-13 Clearone Communications, Inc. Portable speakerphone device and subsystem utilizing false doubletalk detection
GB0706074D0 (en) 2007-03-28 2007-05-09 Skype Ltd Detection of communication states
US8977255B2 (en) 2007-04-03 2015-03-10 Apple Inc. Method and system for operating a multi-function portable electronic device using voice-activation
US8983051B2 (en) 2007-04-03 2015-03-17 William F. Barton Outgoing call classification and disposition
US8406439B1 (en) 2007-04-04 2013-03-26 At&T Intellectual Property I, L.P. Methods and systems for synthetic audio placement
US8848879B1 (en) 2007-05-03 2014-09-30 Avaya Inc. Customizable notification based on recent communication history
US8032383B1 (en) 2007-05-04 2011-10-04 Foneweb, Inc. Speech controlled services and devices using internet
US8041565B1 (en) 2007-05-04 2011-10-18 Foneweb, Inc. Precision speech to text conversion
KR100827613B1 (ko) 2007-05-04 2008-05-07 삼성전자주식회사 휴대용 단말기의 마이크 제어 장치 및 방법
US8136040B2 (en) 2007-05-16 2012-03-13 Apple Inc. Audio variance for multiple windows
BRPI0810285A2 (pt) 2007-05-18 2014-12-30 Shorthand Mobile Inc "sistema e processo para comunicações aperfeiçoadas via sistemas de comunicação de pequena taxa de dados"
US20080291916A1 (en) 2007-05-22 2008-11-27 Bo Xiong Systems and methods for dynamic quality of service
EP1998446A1 (en) 2007-05-31 2008-12-03 Alcatel Lucent Remote control for devices with connectivity to a service delivery platform
US8068925B2 (en) 2007-06-28 2011-11-29 Apple Inc. Dynamic routing of audio among multiple audio devices
JP4985151B2 (ja) 2007-06-29 2012-07-25 ヤマハ株式会社 コンテンツ配信システム及びセンタ装置
JP4916394B2 (ja) 2007-07-03 2012-04-11 富士通株式会社 エコー抑圧装置、エコー抑圧方法及びコンピュータプログラム
WO2009020617A1 (en) 2007-08-06 2009-02-12 Orison Corporation System and method for three-dimensional ultrasound imaging
US20090046866A1 (en) 2007-08-15 2009-02-19 Fortemedia, Inc. Apparatus capable of performing acoustic echo cancellation and a method thereof
US8073125B2 (en) 2007-09-25 2011-12-06 Microsoft Corporation Spatial audio conferencing
US7844724B2 (en) 2007-10-24 2010-11-30 Social Communications Company Automated real-time data stream switching in a shared virtual area communication environment
US8639214B1 (en) 2007-10-26 2014-01-28 Iwao Fujisaki Communication device
US8013720B2 (en) 2007-11-02 2011-09-06 Reverse Control, Inc. Signal apparatus for facilitating safe backup of vehicles
CN101584225B (zh) 2007-11-20 2013-11-06 松下电器产业株式会社 扬声器、视频设备、以及便携式信息处理装置
US9247346B2 (en) 2007-12-07 2016-01-26 Northern Illinois Research Foundation Apparatus, system and method for noise cancellation and communication for incubators and related devices
US20090153289A1 (en) 2007-12-12 2009-06-18 Eric James Hope Handheld electronic devices with bimodal remote control functionality
US9386154B2 (en) 2007-12-21 2016-07-05 Nuance Communications, Inc. System, method and software program for enabling communications between customer service agents and users of communication devices
US8473081B2 (en) 2007-12-25 2013-06-25 Personics Holdings, Inc. Method and system for event reminder using an earpiece
US8423893B2 (en) 2008-01-07 2013-04-16 Altec Lansing Australia Pty Limited User interface for managing the operation of networked media playback devices
US9992314B2 (en) 2008-01-24 2018-06-05 Garmin Switzerland Gmbh Automatic device mode switching
DE102008039329A1 (de) 2008-01-25 2009-07-30 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Vorrichtung und Verfahren zur Berechnung von Steuerinformationen für ein Echounterdrückungsfilter und Vorrichtung und Verfahren zur Berechnung eines Verzögerungswerts
DE102008039330A1 (de) 2008-01-31 2009-08-13 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Vorrichtung und Verfahren zum Berechnen von Filterkoeffizienten zur Echounterdrückung
US8072905B2 (en) 2008-02-04 2011-12-06 Sony Ericsson Mobile Communications Ab Intelligent interaction between devices in a local network
US8213598B2 (en) 2008-02-26 2012-07-03 Microsoft Corporation Harmonic distortion residual echo suppression
US8638908B2 (en) 2008-02-28 2014-01-28 Computer Products Introductions, Corp Contextual conversation processing in telecommunication applications
US8194882B2 (en) 2008-02-29 2012-06-05 Audience, Inc. System and method for providing single microphone noise suppression fallback
US8255224B2 (en) 2008-03-07 2012-08-28 Google Inc. Voice recognition grammar selection based on context
US9113240B2 (en) 2008-03-18 2015-08-18 Qualcomm Incorporated Speech enhancement using multiple microphones on multiple devices
WO2009120301A2 (en) 2008-03-25 2009-10-01 Square Products Corporation System and method for simultaneous media presentation
US20090248397A1 (en) 2008-03-25 2009-10-01 Microsoft Corporation Service Initiation Techniques
US7516068B1 (en) 2008-04-07 2009-04-07 International Business Machines Corporation Optimized collection of audio for speech recognition
CN101562671A (zh) 2008-04-18 2009-10-21 鸿富锦精密工业(深圳)有限公司 音频设备的音量控制方法及通信装置
JP5423670B2 (ja) 2008-04-30 2014-02-19 日本電気株式会社 音響モデル学習装置および音声認識装置
US8589161B2 (en) 2008-05-27 2013-11-19 Voicebox Technologies, Inc. System and method for an integrated, multi-modal, multi-device natural language voice services environment
US8831948B2 (en) 2008-06-06 2014-09-09 At&T Intellectual Property I, L.P. System and method for synthetically generated speech describing media content
US8385557B2 (en) 2008-06-19 2013-02-26 Microsoft Corporation Multichannel acoustic echo reduction
US8325909B2 (en) 2008-06-25 2012-12-04 Microsoft Corporation Acoustic echo suppression
US8693663B2 (en) 2008-06-27 2014-04-08 Centurylink Intellectual Property Llc System and method for implementing do-not-disturb during playback of media content
US8364481B2 (en) 2008-07-02 2013-01-29 Google Inc. Speech recognition with parallel recognition tasks
US8505056B2 (en) 2008-07-10 2013-08-06 Apple Inc. Updating properties of remote A/V performance nodes
EP2146519B1 (en) 2008-07-16 2012-06-06 Nuance Communications, Inc. Beamforming pre-processing for speaker localization
US8781833B2 (en) 2008-07-17 2014-07-15 Nuance Communications, Inc. Speech recognition semantic classification training
US8639830B2 (en) 2008-07-22 2014-01-28 Control4 Corporation System and method for streaming audio
US8325938B2 (en) 2008-08-12 2012-12-04 Sony Corporation Handsfree call apparatus, acoustic reproducing apparatus with handsfree call function, and handsfree call method
JP5206234B2 (ja) 2008-08-27 2013-06-12 富士通株式会社 雑音抑圧装置、携帯電話機、雑音抑圧方法及びコンピュータプログラム
US8676586B2 (en) 2008-09-16 2014-03-18 Nice Systems Ltd Method and apparatus for interaction or discourse analytics
KR20100034229A (ko) 2008-09-23 2010-04-01 삼성전자주식회사 이어폰 회로를 포함하는 휴대 단말기 및 이의 운용방법
US8676904B2 (en) 2008-10-02 2014-03-18 Apple Inc. Electronic devices with voice command and contextual data processing capabilities
KR101829865B1 (ko) 2008-11-10 2018-02-20 구글 엘엘씨 멀티센서 음성 검출
US8386261B2 (en) 2008-11-14 2013-02-26 Vocollect Healthcare Systems, Inc. Training/coaching system for a voice-enabled work environment
US8095368B2 (en) 2008-12-04 2012-01-10 At&T Intellectual Property I, L.P. System and method for voice authentication over a computer network
JP5347472B2 (ja) 2008-12-12 2013-11-20 ヤマハ株式会社 遠隔制御装置および遠隔制御システム
US8548812B2 (en) 2008-12-22 2013-10-01 Avaya Inc. Method and system for detecting a relevant utterance in a voice session
KR101467796B1 (ko) 2009-01-12 2014-12-10 엘지전자 주식회사 이동단말기 및 그 제어 방법
US20100179874A1 (en) 2009-01-13 2010-07-15 Yahoo! Inc. Media object metadata engine configured to determine relationships between persons and brands
US8351617B2 (en) 2009-01-13 2013-01-08 Fortemedia, Inc. Method for phase mismatch calibration for an array microphone and phase calibration module for the same
US20130283166A1 (en) 2012-04-24 2013-10-24 Social Communications Company Voice-based virtual area navigation
US8428758B2 (en) 2009-02-16 2013-04-23 Apple Inc. Dynamic audio ducking
FR2943875A1 (fr) 2009-03-31 2010-10-01 France Telecom Procede et dispositif de classification du bruit de fond contenu dans un signal audio.
KR101064976B1 (ko) 2009-04-06 2011-09-15 한국과학기술원 음원위치추정시스템 및 이를 구비한 음원에 반응하는 로봇
US8243949B2 (en) 2009-04-14 2012-08-14 Plantronics, Inc. Network addressible loudspeaker and audio play
EP2420050B1 (en) 2009-04-15 2013-04-10 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Multichannel echo canceller
US8483398B2 (en) 2009-04-30 2013-07-09 Hewlett-Packard Development Company, L.P. Methods and systems for reducing acoustic echoes in multichannel communication systems by reducing the dimensionality of the space of impulse responses
JP5550456B2 (ja) 2009-06-04 2014-07-16 本田技研工業株式会社 残響抑圧装置、及び残響抑圧方法
US9858925B2 (en) 2009-06-05 2018-01-02 Apple Inc. Using context information to facilitate processing of commands in a virtual assistant
JP4820434B2 (ja) 2009-06-08 2011-11-24 レノボ・シンガポール・プライベート・リミテッド マイクロフォンのミュート・コントロール
US20100332236A1 (en) 2009-06-25 2010-12-30 Blueant Wireless Pty Limited Voice-triggered operation of electronic devices
US8478982B2 (en) 2009-08-06 2013-07-02 Broadcom Corporation Media access control security management in physical layer
US8625775B2 (en) 2009-08-06 2014-01-07 Hti Ip, L.L.C. Method and system for reducing echo and noise in a vehicle passenger compartment environment
JP5440053B2 (ja) 2009-09-14 2014-03-12 ソニー株式会社 情報処理装置及び情報処理方法、並びにコンピューター・プログラム
US8753279B2 (en) 2009-09-17 2014-06-17 Hitachi Medical Corporation Ultrasound probe and ultrasound imaging device
US20110091055A1 (en) 2009-10-19 2011-04-21 Broadcom Corporation Loudspeaker localization techniques
US8600073B2 (en) 2009-11-04 2013-12-03 Cambridge Silicon Radio Limited Wind noise suppression
KR101301535B1 (ko) 2009-12-02 2013-09-04 한국전자통신연구원 하이브리드 번역 장치 및 그 방법
US20110145581A1 (en) 2009-12-14 2011-06-16 Verizon Patent And Licensing, Inc. Media playback across devices
JP5641186B2 (ja) 2010-01-13 2014-12-17 ヤマハ株式会社 雑音抑圧装置およびプログラム
US10553209B2 (en) 2010-01-18 2020-02-04 Apple Inc. Systems and methods for hands-free notification summaries
NO332437B1 (no) 2010-01-18 2012-09-17 Cisco Systems Int Sarl Apparat og fremgangsmate for a supprimere et akustisk ekko
WO2011091402A1 (en) 2010-01-25 2011-07-28 Justin Mason Voice electronic listening assistant
US8718290B2 (en) 2010-01-26 2014-05-06 Audience, Inc. Adaptive noise reduction using level cues
US8713571B2 (en) 2010-02-17 2014-04-29 Microsoft Corporation Asynchronous task execution
US8682667B2 (en) 2010-02-25 2014-03-25 Apple Inc. User profiling for selecting user specific voice input processing information
US9209987B2 (en) 2010-03-02 2015-12-08 Microsoft Technology Licensing, Llc Social media playback
EP2375779A3 (en) 2010-03-31 2012-01-18 Fraunhofer-Gesellschaft zur Förderung der Angewandten Forschung e.V. Apparatus and method for measuring a plurality of loudspeakers and microphone array
US9112989B2 (en) 2010-04-08 2015-08-18 Qualcomm Incorporated System and method of smart audio logging for mobile devices
US9514476B2 (en) 2010-04-14 2016-12-06 Viacom International Inc. Systems and methods for discovering artists
US8538035B2 (en) 2010-04-29 2013-09-17 Audience, Inc. Multi-microphone robust noise suppression
US8437339B2 (en) 2010-04-28 2013-05-07 Hewlett-Packard Development Company, L.P. Techniques to provide integrated voice service management
JP5572445B2 (ja) 2010-04-30 2014-08-13 本田技研工業株式会社 残響抑圧装置、及び残響抑圧方法
WO2011140221A1 (en) 2010-05-04 2011-11-10 Shazam Entertainment Ltd. Methods and systems for synchronizing media
US9307340B2 (en) 2010-05-06 2016-04-05 Dolby Laboratories Licensing Corporation Audio system equalization for portable media playback devices
JP2013530420A (ja) 2010-05-06 2013-07-25 ドルビー ラボラトリーズ ライセンシング コーポレイション 可搬型メディア再生装置に関するオーディオ・システム等化処理
US9736600B2 (en) 2010-05-17 2017-08-15 Iii Holdings 4, Llc Devices and methods for collecting acoustic data
US20110289506A1 (en) 2010-05-18 2011-11-24 Google Inc. Management of computing resources for applications
US8395653B2 (en) 2010-05-18 2013-03-12 Polycom, Inc. Videoconferencing endpoint having multiple voice-tracking cameras
US9558755B1 (en) 2010-05-20 2017-01-31 Knowles Electronics, Llc Noise suppression assisted automatic speech recognition
US8831761B2 (en) 2010-06-02 2014-09-09 Sony Corporation Method for determining a processed audio signal and a handheld device
JP2011259097A (ja) 2010-06-07 2011-12-22 Sony Corp 音声信号処理装置及び音声信号処理方法
US8588849B2 (en) 2010-07-09 2013-11-19 Blackberry Limited System and method for resuming media
US8699723B2 (en) 2010-07-20 2014-04-15 International Business Machines Corporation Audio device volume manager using measured volume perceived at a first audio device to control volume generation by a second audio device
US8762144B2 (en) 2010-07-21 2014-06-24 Samsung Electronics Co., Ltd. Method and apparatus for voice activity detection
US9025782B2 (en) 2010-07-26 2015-05-05 Qualcomm Incorporated Systems, methods, apparatus, and computer-readable media for multi-microphone location-selective processing
US9349368B1 (en) 2010-08-05 2016-05-24 Google Inc. Generating an audio notification based on detection of a triggering event
US8359020B2 (en) 2010-08-06 2013-01-22 Google Inc. Automatically monitoring for voice input based on context
US8731939B1 (en) 2010-08-06 2014-05-20 Google Inc. Routing queries based on carrier phrase registration
KR101607419B1 (ko) 2010-08-27 2016-03-29 인텔 코포레이션 원격 제어 장치
US8861756B2 (en) 2010-09-24 2014-10-14 LI Creative Technologies, Inc. Microphone array system
US20120078635A1 (en) 2010-09-24 2012-03-29 Apple Inc. Voice control system
JP5259020B2 (ja) 2010-10-01 2013-08-07 三菱電機株式会社 音声認識装置
US9240111B2 (en) 2010-10-06 2016-01-19 Microsoft Technology Licensing, Llc Inferring building metadata from distributed sensors
CN103222192B (zh) 2010-10-08 2019-05-07 日本电气株式会社 信号处理设备和信号处理方法
KR20140035310A (ko) 2010-10-22 2014-03-21 포러스, 인코포레이티드 미디어 배포 아키텍처
EP2444967A1 (en) 2010-10-25 2012-04-25 Fraunhofer-Gesellschaft zur Förderung der Angewandten Forschung e.V. Echo suppression comprising modeling of late reverberation components
US9552840B2 (en) 2010-10-25 2017-01-24 Qualcomm Incorporated Three-dimensional sound capturing and reproducing with multi-microphones
US9226069B2 (en) 2010-10-29 2015-12-29 Qualcomm Incorporated Transitioning multiple microphones from a first mode to a second mode
EP2456199A3 (en) 2010-11-22 2014-07-16 DDS Newco Inc. Method and systems of dynamically managing content for use by a media playback device
US20120148075A1 (en) 2010-12-08 2012-06-14 Creative Technology Ltd Method for optimizing reproduction of audio signals from an apparatus for audio reproduction
JP6012621B2 (ja) 2010-12-15 2016-10-25 コーニンクレッカ フィリップス エヌ ヴェKoninklijke Philips N.V. リモートノイズ検知器を使用したノイズ削減システム
JP5771002B2 (ja) 2010-12-22 2015-08-26 株式会社東芝 音声認識装置、音声認識方法および音声認識装置を搭載したテレビ受像機
US9241227B2 (en) 2011-01-06 2016-01-19 Bose Corporation Transducer with integrated sensor
JP2012150237A (ja) 2011-01-18 2012-08-09 Sony Corp 音信号処理装置、および音信号処理方法、並びにプログラム
US8929564B2 (en) 2011-03-03 2015-01-06 Microsoft Corporation Noise adaptive beamforming for microphone arrays
CN102123188A (zh) 2011-03-03 2011-07-13 曾超宁 移动电话耳麦装置
KR20120100514A (ko) 2011-03-04 2012-09-12 삼성전자주식회사 디바이스 그룹핑 방법 및 이를 적용한 서버
US8804977B2 (en) 2011-03-18 2014-08-12 Dolby Laboratories Licensing Corporation Nonlinear reference signal processing for echo suppression
US9262612B2 (en) 2011-03-21 2016-02-16 Apple Inc. Device access using voice authentication
US8938312B2 (en) 2011-04-18 2015-01-20 Sonos, Inc. Smart line-in processing
US9493130B2 (en) 2011-04-22 2016-11-15 Angel A. Penilla Methods and systems for communicating content to connected vehicle users based detected tone/mood in voice input
KR20120128542A (ko) 2011-05-11 2012-11-27 삼성전자주식회사 멀티 채널 에코 제거를 위한 멀티 채널 비-상관 처리 방법 및 장치
US9342516B2 (en) 2011-05-18 2016-05-17 Microsoft Technology Licensing, Llc Media presentation playback annotation
US8320577B1 (en) 2011-05-20 2012-11-27 Google Inc. Method and apparatus for multi-channel audio processing using single-channel components
WO2012166811A2 (en) 2011-05-31 2012-12-06 Google Inc. Muting participants in a communication session
US8897465B2 (en) 2011-06-01 2014-11-25 Robert Bosch Gmbh Class D micro-speaker
US8958571B2 (en) 2011-06-03 2015-02-17 Cirrus Logic, Inc. MIC covering detection in personal audio devices
US8738925B1 (en) 2013-01-07 2014-05-27 Fitbit, Inc. Wireless portable biometric device syncing
US9307321B1 (en) 2011-06-09 2016-04-05 Audience, Inc. Speaker distortion reduction
US9226088B2 (en) 2011-06-11 2015-12-29 Clearone Communications, Inc. Methods and apparatuses for multiple configurations of beamforming microphone arrays
WO2012174301A1 (en) 2011-06-14 2012-12-20 Related Content Database, Inc. System and method for presenting content with time based metadata
US8731765B2 (en) 2011-06-28 2014-05-20 GM Global Technology Operations LLC Method and apparatus for fault detection in a torque machine of a powertrain system
US20130018659A1 (en) 2011-07-12 2013-01-17 Google Inc. Systems and Methods for Speech Command Processing
US9042556B2 (en) 2011-07-19 2015-05-26 Sonos, Inc Shaping sound responsive to speaker orientation
US20130024018A1 (en) 2011-07-22 2013-01-24 Htc Corporation Multimedia control method and multimedia control system
JP5289517B2 (ja) 2011-07-28 2013-09-11 株式会社半導体理工学研究センター センサネットワークシステムとその通信方法
US9148742B1 (en) 2011-07-29 2015-09-29 Google Inc. Proximity detection via audio
JP5640918B2 (ja) 2011-08-05 2014-12-17 ブラザー工業株式会社 サーバ装置、対応付け方法、及び携帯機器用プログラム
EP2555598A1 (en) 2011-08-05 2013-02-06 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Method and device for generating optical radiation by means of electrically operated pulsed discharges
EP2557813A2 (en) 2011-08-08 2013-02-13 Bang & Olufsen A/S A modular, configurable speaker system and a method of operating it
KR101252167B1 (ko) 2011-08-18 2013-04-05 엘지전자 주식회사 가전기기 진단장치 및 그 진단방법
US20130211826A1 (en) 2011-08-22 2013-08-15 Claes-Fredrik Urban Mannby Audio Signals as Buffered Streams of Audio Signals and Metadata
US8750677B2 (en) 2011-08-23 2014-06-10 Microsoft Corporation Method for transferring media playback from a different device
US20130073293A1 (en) 2011-09-20 2013-03-21 Lg Electronics Inc. Electronic device and method for controlling the same
US9094539B1 (en) 2011-09-22 2015-07-28 Amazon Technologies, Inc. Dynamic device adjustments based on determined user sleep state
US8768707B2 (en) 2011-09-27 2014-07-01 Sensory Incorporated Background speech recognition assistant using speaker verification
US8996381B2 (en) 2011-09-27 2015-03-31 Sensory, Incorporated Background speech recognition assistant
US8762156B2 (en) 2011-09-28 2014-06-24 Apple Inc. Speech recognition repair using contextual information
US9729631B2 (en) 2011-09-30 2017-08-08 Apple Inc. Asynchronous data manipulation
US8340975B1 (en) 2011-10-04 2012-12-25 Theodore Alfred Rosenberger Interactive speech recognition device and system for hands-free building control
US8971546B2 (en) 2011-10-14 2015-03-03 Sonos, Inc. Systems, methods, apparatus, and articles of manufacture to control audio playback devices
CN103052001B (zh) 2011-10-17 2015-06-24 联想(北京)有限公司 智能设备及其控制方法
GB201118784D0 (en) 2011-10-31 2011-12-14 Omnifone Ltd Djml
GB2496660B (en) 2011-11-18 2014-06-04 Skype Processing audio signals
US8983089B1 (en) 2011-11-28 2015-03-17 Rawles Llc Sound source localization using multiple microphone arrays
CN102567468B (zh) 2011-12-06 2014-06-04 上海聚力传媒技术有限公司 一种用于对媒体文件的播放音量进行调节的方法与设备
GB2497343B (en) 2011-12-08 2014-11-26 Skype Processing audio signals
EP2792152A4 (en) 2011-12-13 2015-07-22 Intel Corp NAVIGATING CHANNELS IN MULTIMEDIA DEVICES CONNECTED BY SELECTING KEYWORDS
US9084058B2 (en) 2011-12-29 2015-07-14 Sonos, Inc. Sound field calibration using listener localization
KR102022318B1 (ko) 2012-01-11 2019-09-18 삼성전자 주식회사 음성 인식을 사용하여 사용자 기능을 수행하는 방법 및 장치
US8825020B2 (en) 2012-01-12 2014-09-02 Sensory, Incorporated Information access and device control using mobile phones and audio in the home environment
US9654817B2 (en) 2012-01-27 2017-05-16 Avaya Inc. System and method to synchronize video playback on mobile devices
US9401058B2 (en) 2012-01-30 2016-07-26 International Business Machines Corporation Zone based presence determination via voiceprint location awareness
WO2013115748A1 (en) 2012-01-30 2013-08-08 Echostar Ukraine, L.L.C. Apparatus, systems and methods for adjusting output audio volume based on user location
US9418658B1 (en) 2012-02-08 2016-08-16 Amazon Technologies, Inc. Configuration of voice controlled assistant
US9173025B2 (en) 2012-02-08 2015-10-27 Dolby Laboratories Licensing Corporation Combined suppression of noise, echo, and out-of-location signals
US9947333B1 (en) 2012-02-10 2018-04-17 Amazon Technologies, Inc. Voice interaction architecture with intelligent background noise cancellation
US8453058B1 (en) 2012-02-20 2013-05-28 Google Inc. Crowd-sourced audio shortcuts
US9065895B2 (en) 2012-02-22 2015-06-23 Broadcom Corporation Non-linear echo cancellation
EP2632141B1 (en) 2012-02-22 2014-10-15 Dialog Semiconductor B.V. Postfilter for Spectral Domain Echo Cancellers to handle Non-linear Echo Components
US9838810B2 (en) 2012-02-27 2017-12-05 Qualcomm Technologies International, Ltd. Low power audio detection
US20130238326A1 (en) 2012-03-08 2013-09-12 Lg Electronics Inc. Apparatus and method for multiple device voice control
US9361878B2 (en) 2012-03-30 2016-06-07 Michael Boukadakis Computer-readable medium, system and method of providing domain-specific information
US9198204B2 (en) 2012-04-11 2015-11-24 Google Inc. Apparatus and method for seamless commissioning of wireless devices
WO2013155619A1 (en) 2012-04-20 2013-10-24 Sam Pasupalak Conversational agent
US9633186B2 (en) 2012-04-23 2017-04-25 Apple Inc. Systems and methods for controlling output of content based on human recognition data detection
US9117449B2 (en) 2012-04-26 2015-08-25 Nuance Communications, Inc. Embedded system for construction of small footprint speech recognition with user-definable constraints
WO2013166080A1 (en) 2012-04-30 2013-11-07 Creative Technology Ltd A universal reconfigurable echo cancellation system
US8886524B1 (en) 2012-05-01 2014-11-11 Amazon Technologies, Inc. Signal processing based on audio context
US11452153B2 (en) 2012-05-01 2022-09-20 Lisnr, Inc. Pairing and gateway connection using sonic tones
US20130294611A1 (en) 2012-05-04 2013-11-07 Sony Computer Entertainment Inc. Source separation by independent component analysis in conjuction with optimization of acoustic echo cancellation
US9584909B2 (en) 2012-05-10 2017-02-28 Google Inc. Distributed beamforming based on message passing
US9768829B2 (en) 2012-05-11 2017-09-19 Intel Deutschland Gmbh Methods for processing audio signals and circuit arrangements therefor
US8908879B2 (en) 2012-05-23 2014-12-09 Sonos, Inc. Audio content auditioning
US9633368B2 (en) 2012-05-25 2017-04-25 Apple Inc. Content ranking and serving on a multi-user device or interface
CN103456332A (zh) 2012-05-28 2013-12-18 富泰华工业(深圳)有限公司 音频播放装置及音量调节方法
US20130324031A1 (en) 2012-05-31 2013-12-05 Nokia Corporation Dynamic allocation of audio channel for surround sound systems
US9060224B1 (en) 2012-06-01 2015-06-16 Rawles Llc Voice controlled assistant with coaxial speaker and microphone arrangement
EP2856690B1 (en) 2012-06-01 2020-12-02 BlackBerry Limited Universal synchronization engine based on probabilistic methods for guarantee of lock in multiformat audio systems
US9997069B2 (en) 2012-06-05 2018-06-12 Apple Inc. Context-aware voice guidance
US9881616B2 (en) 2012-06-06 2018-01-30 Qualcomm Incorporated Method and systems having improved speech recognition
US8903526B2 (en) 2012-06-06 2014-12-02 Sonos, Inc. Device playback failure recovery and redistribution
US9301073B2 (en) 2012-06-08 2016-03-29 Apple Inc. Systems and methods for determining the condition of multiple microphones
US9183845B1 (en) 2012-06-12 2015-11-10 Amazon Technologies, Inc. Adjusting audio signals based on a specific frequency range associated with environmental noise characteristics
US9031255B2 (en) 2012-06-15 2015-05-12 Sonos, Inc. Systems, methods, apparatus, and articles of manufacture to provide low-latency audio
US9142215B2 (en) * 2012-06-15 2015-09-22 Cypress Semiconductor Corporation Power-efficient voice activation
US9674587B2 (en) 2012-06-26 2017-06-06 Sonos, Inc. Systems and methods for networked music playback including remote add to queue
US10354650B2 (en) 2012-06-26 2019-07-16 Google Llc Recognizing speech with mixed speech recognition models to generate transcriptions
US9106192B2 (en) 2012-06-28 2015-08-11 Sonos, Inc. System and method for device playback calibration
US9706323B2 (en) 2014-09-09 2017-07-11 Sonos, Inc. Playback device calibration
US9137564B2 (en) 2012-06-28 2015-09-15 Sonos, Inc. Shift to corresponding media in a playback queue
US9384737B2 (en) 2012-06-29 2016-07-05 Microsoft Technology Licensing, Llc Method and device for adjusting sound levels of sources based on sound source priority
US20140006825A1 (en) 2012-06-30 2014-01-02 David Shenhav Systems and methods to wake up a device from a power conservation state
US9497544B2 (en) 2012-07-02 2016-11-15 Qualcomm Incorporated Systems and methods for surround sound echo reduction
US9615171B1 (en) 2012-07-02 2017-04-04 Amazon Technologies, Inc. Transformation inversion to reduce the effect of room acoustics
US20140003635A1 (en) 2012-07-02 2014-01-02 Qualcomm Incorporated Audio signal processing device calibration
KR101972955B1 (ko) 2012-07-03 2019-04-26 삼성전자 주식회사 음성을 이용한 사용자 디바이스들 간 서비스 연결 방법 및 장치
US9536528B2 (en) 2012-07-03 2017-01-03 Google Inc. Determining hotword suitability
US8972762B2 (en) 2012-07-11 2015-03-03 Blackberry Limited Computing devices and methods for resetting inactivity timers on computing devices
US8983844B1 (en) 2012-07-31 2015-03-17 Amazon Technologies, Inc. Transmission of noise parameters for improving automatic speech recognition
US8831957B2 (en) 2012-08-01 2014-09-09 Google Inc. Speech recognition models based on location indicia
CN107068913B (zh) 2012-08-03 2019-04-30 株式会社半导体能源研究所 发光元件、发光装置、电子设备以及照明装置
US8930005B2 (en) 2012-08-07 2015-01-06 Sonos, Inc. Acoustic signatures in a playback system
EP3462452A1 (en) 2012-08-24 2019-04-03 Oticon A/s Noise estimation for use with noise reduction and echo cancellation in personal communication
US9532153B2 (en) 2012-08-29 2016-12-27 Bang & Olufsen A/S Method and a system of providing information to a user
US9088336B2 (en) 2012-09-06 2015-07-21 Imagination Technologies Limited Systems and methods of echo and noise cancellation in voice communication
US20140075311A1 (en) 2012-09-11 2014-03-13 Jesse William Boettcher Methods and apparatus for controlling audio volume on an electronic device
US20140075306A1 (en) 2012-09-12 2014-03-13 Randy Rega Music search and retrieval system
US8798598B2 (en) 2012-09-13 2014-08-05 Alain Rossmann Method and system for screencasting Smartphone video game software to online social networks
US9532139B1 (en) 2012-09-14 2016-12-27 Cirrus Logic, Inc. Dual-microphone frequency amplitude response self-calibration
US8983383B1 (en) 2012-09-25 2015-03-17 Rawles Llc Providing hands-free service to multiple devices
US9319816B1 (en) 2012-09-26 2016-04-19 Amazon Technologies, Inc. Characterizing environment using ultrasound pilot tones
JP2014071138A (ja) 2012-09-27 2014-04-21 Xing Inc カラオケ装置
KR102091236B1 (ko) 2012-09-28 2020-03-18 삼성전자 주식회사 전자기기 및 그 제어방법
US8725125B2 (en) 2012-09-28 2014-05-13 United Video Properties, Inc. Systems and methods for controlling audio playback on portable devices with vehicle equipment
WO2014055312A1 (en) 2012-10-02 2014-04-10 Mh Acoustics, Llc Earphones having configurable microphone arrays
US8484025B1 (en) 2012-10-04 2013-07-09 Google Inc. Mapping an audio utterance to an action using a classifier
US9640194B1 (en) 2012-10-04 2017-05-02 Knowles Electronics, Llc Noise suppression for speech processing based on machine-learning mask estimation
CN102902253B (zh) 2012-10-09 2015-07-15 鸿富锦精密工业(深圳)有限公司 具有语音控制功能的智能开关及智能控制系统
US20140108010A1 (en) 2012-10-11 2014-04-17 Intermec Ip Corp. Voice-enabled documents for facilitating operational procedures
US9232310B2 (en) 2012-10-15 2016-01-05 Nokia Technologies Oy Methods, apparatuses and computer program products for facilitating directional audio capture with multiple microphones
EP2906941B1 (en) 2012-10-15 2021-05-26 Msi Dfat Llc Direct field acoustic testing in a semi-reverberant enclosure
DE102012020271A1 (de) 2012-10-17 2014-04-17 Wolfgang Klippel Anordnung und Verfahren zur Steuerung von Wandlern
KR101978688B1 (ko) 2012-10-22 2019-05-15 삼성전자주식회사 마이크로폰 장치를 갖는 전자 장치 및 그 운용 방법
US9319445B2 (en) 2012-10-22 2016-04-19 Spotify Ab Systems and methods for pre-fetching media content
WO2014064324A1 (en) 2012-10-26 2014-05-01 Nokia Corporation Multi-device speech recognition
KR20140054643A (ko) 2012-10-29 2014-05-09 삼성전자주식회사 음성인식장치 및 음성인식방법
US10381002B2 (en) 2012-10-30 2019-08-13 Google Technology Holdings LLC Voice control user interface during low-power mode
US9584642B2 (en) 2013-03-12 2017-02-28 Google Technology Holdings LLC Apparatus with adaptive acoustic echo control for speakerphone mode
US8761349B2 (en) 2012-10-31 2014-06-24 Citrix Systems, Inc. Systems and methods of monitoring performance of acoustic echo cancellation
US9275637B1 (en) * 2012-11-06 2016-03-01 Amazon Technologies, Inc. Wake word evaluation
KR20140060040A (ko) 2012-11-09 2014-05-19 삼성전자주식회사 디스플레이장치, 음성취득장치 및 그 음성인식방법
US9275642B2 (en) 2012-11-13 2016-03-01 Unified Computer Intelligence Corporation Voice-operated internet-ready ubiquitous computing device and method thereof
CN102999161B (zh) * 2012-11-13 2016-03-02 科大讯飞股份有限公司 一种语音唤醒模块的实现方法及应用
US9685171B1 (en) 2012-11-20 2017-06-20 Amazon Technologies, Inc. Multiple-stage adaptive filtering of audio signals
US9070367B1 (en) 2012-11-26 2015-06-30 Amazon Technologies, Inc. Local speech recognition of frequent utterances
WO2014142702A1 (en) 2013-03-15 2014-09-18 Obschestvo S Ogranichennoy Otvetstvennostiyu "Speaktoit" Selective speech recognition for chat and digital personal assistant systems
US20140149118A1 (en) 2012-11-28 2014-05-29 Lg Electronics Inc. Apparatus and method for driving electric device using speech recognition
US9154877B2 (en) 2012-11-28 2015-10-06 Qualcomm Incorporated Collaborative sound system
US9203045B2 (en) 2012-11-29 2015-12-01 Semiconductor Energy Laboratory Co., Ltd. Light-emitting element, light-emitting device, electronic device, and lighting device
US9171092B2 (en) 2012-12-07 2015-10-27 Empire Technology Development Llc Personal assistant context building
US20140161263A1 (en) 2012-12-10 2014-06-12 Microsoft Corporation Facilitating recognition of real-time content
US9704486B2 (en) 2012-12-11 2017-07-11 Amazon Technologies, Inc. Speech recognition power management
US9226071B2 (en) 2012-12-13 2015-12-29 Maxim Integrated Products, Inc. Direct measurement of an input signal to a loudspeaker to determine and limit a temperature of a voice coil of the loudspeaker
US9271111B2 (en) 2012-12-14 2016-02-23 Amazon Technologies, Inc. Response endpoint selection
US9300910B2 (en) 2012-12-14 2016-03-29 Biscotti Inc. Video mail capture, processing and distribution
US9607046B2 (en) 2012-12-14 2017-03-28 Microsoft Technology Licensing, Llc Probability-based state modification for query dialogues
EP3691179A1 (en) 2012-12-18 2020-08-05 Samsung Electronics Co., Ltd. Method and device for controlling home device remotely in home network system
US9047857B1 (en) 2012-12-19 2015-06-02 Rawles Llc Voice commands for transitioning between device states
US9098467B1 (en) 2012-12-19 2015-08-04 Rawles Llc Accepting voice commands based on user identity
US20150338917A1 (en) 2012-12-26 2015-11-26 Sia Technology Ltd. Device, system, and method of controlling electronic devices via thought
US9620115B2 (en) 2013-01-03 2017-04-11 Telenav, Inc. Content delivery system with barge-in mechanism and method of operation thereof
KR102051588B1 (ko) 2013-01-07 2019-12-03 삼성전자주식회사 휴대 단말기의 오디오 컨텐츠 재생 방법 및 그 장치
US9318125B2 (en) 2013-01-15 2016-04-19 Intel Deutschland Gmbh Noise reduction devices and noise reduction methods
JP2014137590A (ja) 2013-01-18 2014-07-28 Yoji Fukinuki 音楽コンテンツ配信方法
US9646605B2 (en) * 2013-01-22 2017-05-09 Interactive Intelligence Group, Inc. False alarm reduction in speech recognition systems using contextual information
DE102013001219B4 (de) 2013-01-25 2019-08-29 Inodyn Newmedia Gmbh Verfahren und System zur Sprachaktivierung eines Software-Agenten aus einem Standby-Modus
US20140215332A1 (en) 2013-01-31 2014-07-31 Hewlett-Packard Development Company, Lp Virtual microphone selection corresponding to a set of audio source devices
DE212014000045U1 (de) 2013-02-07 2015-09-24 Apple Inc. Sprach-Trigger für einen digitalen Assistenten
TWI593294B (zh) 2013-02-07 2017-07-21 晨星半導體股份有限公司 收音系統與相關方法
US9818407B1 (en) 2013-02-07 2017-11-14 Amazon Technologies, Inc. Distributed endpointing for speech recognition
US9300266B2 (en) 2013-02-12 2016-03-29 Qualcomm Incorporated Speaker equalization for mobile devices
US9842489B2 (en) 2013-02-14 2017-12-12 Google Llc Waking other devices for additional data
US9237384B2 (en) 2013-02-14 2016-01-12 Sonos, Inc. Automatic configuration of household playback devices
US9172747B2 (en) 2013-02-25 2015-10-27 Artificial Solutions Iberia SL System and methods for virtual assistant networks
BR112015020150B1 (pt) 2013-02-26 2021-08-17 Mediatek Inc. Aparelho para gerar um sinal de fala, e, método para gerar um sinal de fala
US9195432B2 (en) 2013-02-26 2015-11-24 Sonos, Inc. Pre-caching of audio content
CN104010251B (zh) 2013-02-27 2018-06-19 晨星半导体股份有限公司 收音系统与相关方法
US10395651B2 (en) 2013-02-28 2019-08-27 Sony Corporation Device and method for activating with voice input
US9460715B2 (en) 2013-03-04 2016-10-04 Amazon Technologies, Inc. Identification using audio signatures and additional characteristics
US20140258292A1 (en) 2013-03-05 2014-09-11 Clip Interactive, Inc. Apparatus, system, and method for integrating content and content services
US9349386B2 (en) 2013-03-07 2016-05-24 Analog Device Global System and method for processor wake-up based on sensor data
KR101887983B1 (ko) 2013-03-07 2018-08-14 애플 인크. 룸 및 프로그램 응답 확성기 시스템
JP6429465B2 (ja) 2013-03-07 2018-11-28 株式会社半導体エネルギー研究所 装置及びその作製方法
US9161126B2 (en) 2013-03-08 2015-10-13 Cirrus Logic, Inc. Systems and methods for protecting a speaker
CN104053088A (zh) 2013-03-11 2014-09-17 联想(北京)有限公司 一种麦克风阵列调整方法、麦克风阵列及电子设备
WO2014164234A1 (en) 2013-03-11 2014-10-09 Tiskerling Dynamics Llc Timbre constancy across a range of directivities for a loudspeaker
TWI533686B (zh) 2013-03-11 2016-05-11 緯創資通股份有限公司 虛擬頻道之管理方法、具有虛擬頻道之網路多媒體重現系統和電腦可讀取記錄媒體
US11393461B2 (en) 2013-03-12 2022-07-19 Cerence Operating Company Methods and apparatus for detecting a voice command
WO2014165032A1 (en) 2013-03-12 2014-10-09 Aawtend, Inc. Integrated sensor-array processor
CN105009203A (zh) 2013-03-12 2015-10-28 纽昂斯通讯公司 用于检测语音命令的方法和装置
KR20140111859A (ko) 2013-03-12 2014-09-22 삼성전자주식회사 콘텐트 공유 방법 및 이를 위한 디바이스
US9357306B2 (en) 2013-03-12 2016-05-31 Nokia Technologies Oy Multichannel audio calibration method and apparatus
US9361885B2 (en) 2013-03-12 2016-06-07 Nuance Communications, Inc. Methods and apparatus for detecting a voice command
US9173021B2 (en) 2013-03-12 2015-10-27 Google Technology Holdings LLC Method and device for adjusting an audio beam orientation based on device location
US9060052B2 (en) 2013-03-13 2015-06-16 Accusonus S.A. Single channel, binaural and multi-channel dereverberation
KR101571338B1 (ko) 2013-03-13 2015-11-24 삼성전자주식회사 복수의 재생 장치들이 스트리밍 컨텐트를 동기화하여 재생하는 방법 및 이를 위한 장치
US20140274185A1 (en) 2013-03-14 2014-09-18 Aliphcom Intelligence device connection for wireless media ecosystem
CN105144754B (zh) 2013-03-14 2017-03-15 苹果公司 扬声器与调节由房间中的扬声器发出的声音的方法和设备
JP6013951B2 (ja) 2013-03-14 2016-10-25 本田技研工業株式会社 環境音検索装置、環境音検索方法
KR102152754B1 (ko) 2013-03-14 2020-09-07 삼성전자주식회사 블루루스 디바이스에서 통신 연결 방법 및 그 장치
US20140278933A1 (en) 2013-03-15 2014-09-18 F. Gavin McMillan Methods and apparatus to measure audience engagement with media
US9626436B2 (en) 2013-03-15 2017-04-18 Spotify Ab Systems, methods, and computer readable medium for generating playlists
US9854081B2 (en) 2013-03-15 2017-12-26 Apple Inc. Volume control for mobile device using a wireless device
US9201865B2 (en) 2013-03-15 2015-12-01 Bao Tran Automated assistance for user request that determines semantics by domain, task, and parameter
US9888316B2 (en) 2013-03-21 2018-02-06 Nuance Communications, Inc. System and method for identifying suboptimal microphone performance
WO2014157433A1 (en) 2013-03-26 2014-10-02 Semiconductor Energy Laboratory Co., Ltd. Light-emitting element, light-emitting device, electronic device, and lighting device
CA2897539C (en) 2013-04-04 2016-05-17 James S. RAND Unified communications system and method
JP6300589B2 (ja) 2013-04-04 2018-03-28 株式会社半導体エネルギー研究所 半導体装置の作製方法
JP6198432B2 (ja) 2013-04-09 2017-09-20 小島プレス工業株式会社 音声認識制御装置
WO2014172299A1 (en) 2013-04-15 2014-10-23 Chacha Search, Inc. Method and system of increasing user interaction
US9875494B2 (en) 2013-04-16 2018-01-23 Sri International Using intents to analyze and personalize a user's dialog experience with a virtual personal assistant
US9501533B2 (en) 2013-04-16 2016-11-22 Sonos, Inc. Private queue for a media playback system
US9304736B1 (en) 2013-04-18 2016-04-05 Amazon Technologies, Inc. Voice controlled assistant with non-verbal code entry
JP6416752B2 (ja) 2013-04-19 2018-10-31 パナソニック インテレクチュアル プロパティ コーポレーション オブ アメリカPanasonic Intellectual Property Corporation of America 家電機器の制御方法、家電機器制御システム、及びゲートウェイ
US9936290B2 (en) 2013-05-03 2018-04-03 Qualcomm Incorporated Multi-channel echo cancellation and noise suppression
US9892729B2 (en) 2013-05-07 2018-02-13 Qualcomm Incorporated Method and apparatus for controlling voice activation
US20140337031A1 (en) * 2013-05-07 2014-11-13 Qualcomm Incorporated Method and apparatus for detecting a target keyword
KR102230139B1 (ko) 2013-05-17 2021-03-18 가부시키가이샤 한도오따이 에네루기 켄큐쇼 발광 소자, 조명 장치, 발광 장치, 및 전자 기기
CN109584868B (zh) 2013-05-20 2022-12-13 英特尔公司 用于虚拟个人助理系统的自然人-计算机交互
US9472201B1 (en) 2013-05-22 2016-10-18 Google Inc. Speaker localization by means of tactile input
US20140358535A1 (en) 2013-05-28 2014-12-04 Samsung Electronics Co., Ltd. Method of executing voice recognition of electronic device and electronic device using the same
US9390708B1 (en) * 2013-05-28 2016-07-12 Amazon Technologies, Inc. Low latency and memory efficient keywork spotting
US9215545B2 (en) 2013-05-31 2015-12-15 Bose Corporation Sound stage controller for a near-field speaker-based audio system
US20140357248A1 (en) 2013-06-03 2014-12-04 Ford Global Technologies, Llc Apparatus and System for Interacting with a Vehicle and a Device in a Vehicle
US9438193B2 (en) 2013-06-05 2016-09-06 Sonos, Inc. Satellite volume control
US20140365225A1 (en) 2013-06-05 2014-12-11 DSP Group Ultra-low-power adaptive, user independent, voice triggering schemes
US9654073B2 (en) 2013-06-07 2017-05-16 Sonos, Inc. Group volume control
WO2014197336A1 (en) 2013-06-07 2014-12-11 Apple Inc. System and method for detecting errors in interactions with a voice-based digital assistant
WO2014197335A1 (en) 2013-06-08 2014-12-11 Apple Inc. Interpreting and acting upon commands that involve sharing information with remote devices
CN105284168B (zh) 2013-06-09 2019-06-14 苹果公司 蓝牙警示通知服务
US9787273B2 (en) 2013-06-13 2017-10-10 Google Technology Holdings LLC Smart volume control of device audio output based on received audio input
US9641891B2 (en) 2013-06-17 2017-05-02 Spotify Ab System and method for determining whether to use cached media
US8953778B2 (en) 2013-06-17 2015-02-10 Avaya Inc. Real-time intelligent mute interactive features
US9324322B1 (en) 2013-06-18 2016-04-26 Amazon Technologies, Inc. Automatic volume attenuation for speech enabled devices
US9494683B1 (en) 2013-06-18 2016-11-15 Amazon Technologies, Inc. Audio-based gesture detection
US9311298B2 (en) 2013-06-21 2016-04-12 Microsoft Technology Licensing, Llc Building conversational understanding systems using a toolset
US9697831B2 (en) 2013-06-26 2017-07-04 Cirrus Logic, Inc. Speech recognition
US9640179B1 (en) 2013-06-27 2017-05-02 Amazon Technologies, Inc. Tailoring beamforming techniques to environments
WO2014210429A1 (en) * 2013-06-28 2014-12-31 Harman International Industries, Inc. Wireless control of linked devices
US20150019201A1 (en) 2013-07-09 2015-01-15 Stanley F. Schoenbach Real-time interpreting systems and methods
US9298415B2 (en) 2013-07-09 2016-03-29 Sonos, Inc. Systems and methods to provide play/pause content
US9396727B2 (en) 2013-07-10 2016-07-19 GM Global Technology Operations LLC Systems and methods for spoken dialog service arbitration
US9293480B2 (en) 2013-07-10 2016-03-22 Semiconductor Energy Laboratory Co., Ltd. Semiconductor device and display device including the semiconductor device
US9445209B2 (en) 2013-07-11 2016-09-13 Intel Corporation Mechanism and apparatus for seamless voice wake and speaker verification
DE102014109122A1 (de) 2013-07-12 2015-01-15 Gm Global Technology Operations, Llc Systeme und Verfahren für ergebnisbezogene Arbitrierung in Sprachdialogsystemen
WO2015009748A1 (en) 2013-07-15 2015-01-22 Dts, Inc. Spatial calibration of surround sound systems including listener position estimation
US9445196B2 (en) 2013-07-24 2016-09-13 Mh Acoustics Llc Inter-channel coherence reduction for stereophonic and multichannel acoustic echo cancellation
US9431014B2 (en) 2013-07-25 2016-08-30 Haier Us Appliance Solutions, Inc. Intelligent placement of appliance response to voice command
US9772994B2 (en) 2013-07-25 2017-09-26 Intel Corporation Self-learning statistical natural language processing for automatic production of virtual personal assistants
US9666187B1 (en) 2013-07-25 2017-05-30 Google Inc. Model for enabling service providers to address voice-activated commands
US9418651B2 (en) 2013-07-31 2016-08-16 Google Technology Holdings LLC Method and apparatus for mitigating false accepts of trigger phrases
US10186262B2 (en) 2013-07-31 2019-01-22 Microsoft Technology Licensing, Llc System with multiple simultaneous speech recognizers
US9548047B2 (en) 2013-07-31 2017-01-17 Google Technology Holdings LLC Method and apparatus for evaluating trigger phrase enrollment
WO2015017303A1 (en) 2013-07-31 2015-02-05 Motorola Mobility Llc Method and apparatus for adjusting voice recognition processing based on noise characteristics
DE102013012811B4 (de) 2013-08-01 2024-02-22 Wolfgang Klippel Anordnung und Verfahren zur Identifikation und Korrektur der nichtlinearen Eigenschaften elektromagnetischer Wandler
US9565497B2 (en) 2013-08-01 2017-02-07 Caavo Inc. Enhancing audio using a mobile device
US10873997B2 (en) 2013-08-01 2020-12-22 Fong-Min Chang Voice controlled artificial intelligent smart illumination device
EP3036594B1 (en) 2013-08-21 2021-05-26 Ademco Inc. Devices and methods for interacting with an hvac controller
US9940927B2 (en) 2013-08-23 2018-04-10 Nuance Communications, Inc. Multiple pass automatic speech recognition methods and apparatus
US9190043B2 (en) 2013-08-27 2015-11-17 Bose Corporation Assisting conversation in noisy environments
US9514747B1 (en) 2013-08-28 2016-12-06 Amazon Technologies, Inc. Reducing speech recognition latency
TWI520127B (zh) 2013-08-28 2016-02-01 晨星半導體股份有限公司 應用於音訊裝置的控制器與相關的操作方法
CN103718528B (zh) 2013-08-30 2016-09-28 华为技术有限公司 一种多终端协同播放多媒体文件的方法和相关装置及系统
WO2015037396A1 (ja) 2013-09-11 2015-03-19 株式会社デンソー 音声出力制御装置、プログラムおよび記録媒体
US9672812B1 (en) 2013-09-18 2017-06-06 Amazon Technologies, Inc. Qualifying trigger expressions in speech-based systems
US9516081B2 (en) 2013-09-20 2016-12-06 Amazon Technologies, Inc. Reduced latency electronic content system
US9848260B2 (en) 2013-09-24 2017-12-19 Nuance Communications, Inc. Wearable communication enhancement device
US9668052B2 (en) 2013-09-25 2017-05-30 Google Technology Holdings LLC Audio routing system for routing audio data to and from a mobile device
US9355555B2 (en) 2013-09-27 2016-05-31 Sonos, Inc. System and method for issuing commands in a media playback system
US9443527B1 (en) 2013-09-27 2016-09-13 Amazon Technologies, Inc. Speech recognition capability generation and control
US9288596B2 (en) 2013-09-30 2016-03-15 Sonos, Inc. Coordinator device for paired or consolidated players
CN103546616A (zh) 2013-09-30 2014-01-29 深圳市同洲电子股份有限公司 一种调节音量的方法及装置
KR102114219B1 (ko) 2013-10-10 2020-05-25 삼성전자주식회사 오디오 시스템 및 오디오 출력 방법, 그리고 스피커 장치
US9245527B2 (en) 2013-10-11 2016-01-26 Apple Inc. Speech recognition wake-up of a handheld portable electronic device
TWI642170B (zh) 2013-10-18 2018-11-21 半導體能源研究所股份有限公司 顯示裝置及電子裝置
US9300268B2 (en) 2013-10-18 2016-03-29 Apple Inc. Content aware audio ducking
US9633671B2 (en) 2013-10-18 2017-04-25 Apple Inc. Voice quality enhancement techniques, speech recognition techniques, and related systems
US9818061B1 (en) 2013-10-22 2017-11-14 Lumin, LLC Collaboration of audio sensors for geo-location and continuous tracking of multiple users in a device-independent artificial intelligence (AI) environment
WO2015060867A1 (en) 2013-10-25 2015-04-30 Intel Corporation Techniques for preventing voice replay attacks
EP2869599B1 (en) 2013-11-05 2020-10-21 Oticon A/s A binaural hearing assistance system comprising a database of head related transfer functions
JP2015090570A (ja) 2013-11-06 2015-05-11 ソニー株式会社 情報処理装置および制御方法
US10311482B2 (en) 2013-11-11 2019-06-04 At&T Intellectual Property I, Lp Method and apparatus for adjusting a digital assistant persona
US8775191B1 (en) 2013-11-13 2014-07-08 Google Inc. Efficient utterance-specific endpointer triggering for always-on hotwording
JP6236303B2 (ja) 2013-11-26 2017-11-22 株式会社デンソーアイティーラボラトリ 制御装置、制御方法およびプログラム
US9698999B2 (en) 2013-12-02 2017-07-04 Amazon Technologies, Inc. Natural language control of secondary device
US9373321B2 (en) 2013-12-02 2016-06-21 Cypress Semiconductor Corporation Generation of wake-up words
US9704478B1 (en) 2013-12-02 2017-07-11 Amazon Technologies, Inc. Audio output masking for improved automatic speech recognition
CN104143326B (zh) 2013-12-03 2016-11-02 腾讯科技(深圳)有限公司 一种语音命令识别方法和装置
US8719039B1 (en) 2013-12-05 2014-05-06 Google Inc. Promoting voice actions to hotwords
US10720153B2 (en) 2013-12-13 2020-07-21 Harman International Industries, Incorporated Name-sensitive listening device
US10055190B2 (en) 2013-12-16 2018-08-21 Amazon Technologies, Inc. Attribute-based audio channel arbitration
US9378651B2 (en) 2013-12-17 2016-06-28 Google Inc. Audio book smart pause
US9721570B1 (en) 2013-12-17 2017-08-01 Amazon Technologies, Inc. Outcome-oriented dialogs on a speech recognition platform
US10224056B1 (en) 2013-12-17 2019-03-05 Amazon Technologies, Inc. Contingent device actions during loss of network connectivity
GB2523984B (en) 2013-12-18 2017-07-26 Cirrus Logic Int Semiconductor Ltd Processing received speech data
US9899021B1 (en) 2013-12-20 2018-02-20 Amazon Technologies, Inc. Stochastic modeling of user interactions with a detection system
US9099974B2 (en) 2013-12-20 2015-08-04 Vmware, Inc. Volume redirection
US20150179181A1 (en) 2013-12-20 2015-06-25 Microsoft Corporation Adapting audio based upon detected environmental accoustics
WO2015094369A1 (en) 2013-12-20 2015-06-25 Intel Corporation Transition from low power always listening mode to high power speech recognition mode
EP2890160B1 (en) 2013-12-24 2019-08-14 Nxp B.V. Loudspeaker controller
US9301077B2 (en) 2014-01-02 2016-03-29 Harman International Industries, Incorporated Context-based audio tuning
US8938394B1 (en) 2014-01-09 2015-01-20 Google Inc. Audio triggers based on context
US9443516B2 (en) 2014-01-09 2016-09-13 Honeywell International Inc. Far-field speech recognition systems and methods
EP3092824B1 (en) 2014-01-10 2017-11-01 Dolby Laboratories Licensing Corporation Calibration of virtual height speakers using programmable portable devices
US9300647B2 (en) 2014-01-15 2016-03-29 Sonos, Inc. Software application and zones
US9288597B2 (en) 2014-01-20 2016-03-15 Sony Corporation Distributed wireless speaker system with automatic configuration determination when new speakers are added
DE112014006235T5 (de) 2014-01-22 2016-10-13 Apple Inc. Koordiniertes Weiterreichen einer Audiodatenübermittlung
US9356882B2 (en) 2014-02-04 2016-05-31 Printeron Inc. Streamlined system for the transmission of network resource data
US9443876B2 (en) 2014-02-05 2016-09-13 Semiconductor Energy Laboratory Co., Ltd. Semiconductor device, display device including the semiconductor device, display module including the display device, and electronic device including the semiconductor device, the display device, and the display module
US9929368B2 (en) 2014-02-06 2018-03-27 Semiconductor Energy Laboratory Co., Ltd. Light-emitting element, lighting device, and electronic appliance
US9652532B2 (en) 2014-02-06 2017-05-16 Sr Homedics, Llc Methods for operating audio speaker systems
TWI685116B (zh) 2014-02-07 2020-02-11 日商半導體能源研究所股份有限公司 半導體裝置
US9318112B2 (en) 2014-02-14 2016-04-19 Google Inc. Recognizing speech in the presence of additional audio
JP6289936B2 (ja) 2014-02-26 2018-03-07 株式会社東芝 音源方向推定装置、音源方向推定方法およびプログラム
FR3018024B1 (fr) 2014-02-26 2016-03-18 Devialet Dispositif de commande d'un haut-parleur
FR3018025B1 (fr) 2014-02-26 2016-03-18 Devialet Dispositif de commande d'un haut-parleur
US9408008B2 (en) 2014-02-28 2016-08-02 Sonos, Inc. Playback zone representations
US10015593B2 (en) 2014-03-03 2018-07-03 University Of Utah Digital signal processor for audio extensions and correction of nonlinear distortions in loudspeakers
EP3739460A1 (en) 2014-03-03 2020-11-18 Sony Corporation Information processing apparatus, information processing method, and program
US9489171B2 (en) 2014-03-04 2016-11-08 Microsoft Technology Licensing, Llc Voice-command suggestions based on user identity
US9679054B2 (en) 2014-03-05 2017-06-13 Sonos, Inc. Webpage media playback
US10599287B2 (en) 2014-03-11 2020-03-24 Sonos, Inc. Group volume control
US9640669B2 (en) 2014-03-13 2017-05-02 Semiconductor Energy Laboratory Co., Ltd. Semiconductor device, display device including the semiconductor device, display module including the display device, and electronic appliance including the semiconductor device, the display device, and the display module
US9264839B2 (en) 2014-03-17 2016-02-16 Sonos, Inc. Playback device configuration based on proximity detection
US9226062B2 (en) 2014-03-18 2015-12-29 Cisco Technology, Inc. Techniques to mitigate the effect of blocked sound at microphone arrays in a telepresence device
US10514747B2 (en) 2014-03-24 2019-12-24 Silicon Laboratories Inc. Low-power communication apparatus with wakeup detection and associated methods
US9654076B2 (en) 2014-03-25 2017-05-16 Apple Inc. Metadata for ducking control
US9648564B1 (en) 2014-03-26 2017-05-09 Amazon Technologies, Inc. Wake-up management for mobile devices
US9431021B1 (en) 2014-03-27 2016-08-30 Amazon Technologies, Inc. Device grouping for audio based interactivity
US9916839B1 (en) 2014-03-27 2018-03-13 Amazon Technologies, Inc. Shared audio functionality based on device grouping
US9547468B2 (en) 2014-03-31 2017-01-17 Microsoft Technology Licensing, Llc Client-side personal voice web navigation
KR102146462B1 (ko) 2014-03-31 2020-08-20 삼성전자주식회사 음성 인식 시스템 및 방법
US8874448B1 (en) 2014-04-01 2014-10-28 Google Inc. Attention-based dynamic audio level adjustment
US9640183B2 (en) 2014-04-07 2017-05-02 Samsung Electronics Co., Ltd. Speech recognition using electronic device and server
US9560437B2 (en) 2014-04-08 2017-01-31 Doppler Labs, Inc. Time heuristic audio control
US9510094B2 (en) 2014-04-09 2016-11-29 Apple Inc. Noise estimation in a mobile device using an external acoustic microphone signal
DE102014005381B3 (de) 2014-04-11 2014-12-11 Wolfgang Klippel Anordnung und Verfahren zur Identifikation und Kompensation nichtlinearer Partialschwingungen elektromechanischer Wandler
US9953632B2 (en) * 2014-04-17 2018-04-24 Qualcomm Incorporated Keyword model generation for detecting user-defined keyword
US20150302856A1 (en) 2014-04-17 2015-10-22 Qualcomm Incorporated Method and apparatus for performing function by speech input
US20150334471A1 (en) 2014-05-15 2015-11-19 Echostar Technologies L.L.C. Multiple simultaneous audio video data decoding
WO2015178950A1 (en) 2014-05-19 2015-11-26 Tiskerling Dynamics Llc Directivity optimized sound reproduction
CN106465458B (zh) 2014-05-23 2019-12-13 三星电子株式会社 用于提供通知的方法和设备
US9860289B2 (en) 2014-05-23 2018-01-02 Radeeus, Inc. Multimedia digital content retrieval, matching, and syncing systems and methods of using the same
US9900723B1 (en) 2014-05-28 2018-02-20 Apple Inc. Multi-channel loudspeaker matching using variable directivity
US9715875B2 (en) 2014-05-30 2017-07-25 Apple Inc. Reducing the need for manual start/end-pointing and trigger phrases
WO2015184186A1 (en) 2014-05-30 2015-12-03 Apple Inc. Multi-command single utterance input method
TWI682563B (zh) 2014-05-30 2020-01-11 日商半導體能源研究所股份有限公司 發光元件,發光裝置,電子裝置以及照明裝置
US10318016B2 (en) 2014-06-03 2019-06-11 Harman International Industries, Incorporated Hands free device with directional interface
US20150355818A1 (en) 2014-06-04 2015-12-10 Sonos, Inc. Continuous Playback Queue
US9720642B2 (en) 2014-06-04 2017-08-01 Sonos, Inc. Prioritizing media content requests
US10624612B2 (en) 2014-06-05 2020-04-21 Chikayoshi Sumi Beamforming method, measurement and imaging instruments, and communication instruments
US9615170B2 (en) 2014-06-09 2017-04-04 Harman International Industries, Inc. Approach for partially preserving music in the presence of intelligible speech
CN104092936B (zh) 2014-06-12 2017-01-04 小米科技有限责任公司 自动对焦方法及装置
US20150363061A1 (en) 2014-06-13 2015-12-17 Autonomic Controls, Inc. System and method for providing related digital content
US9767159B2 (en) 2014-06-13 2017-09-19 Google Inc. Ranking search results
US9766702B2 (en) 2014-06-19 2017-09-19 Apple Inc. User detection by a computing device
US9520139B2 (en) 2014-06-19 2016-12-13 Yang Gao Post tone suppression for speech enhancement
US9589556B2 (en) 2014-06-19 2017-03-07 Yang Gao Energy adjustment of acoustic echo replica signal for speech enhancement
US20150373100A1 (en) 2014-06-19 2015-12-24 Pavel KRAVETS Context sharing between different clients
US9697828B1 (en) 2014-06-20 2017-07-04 Amazon Technologies, Inc. Keyword detection modeling using contextual and environmental information
US20150371628A1 (en) 2014-06-23 2015-12-24 Harman International Industries, Inc. User-adapted speech recognition
US10152987B2 (en) 2014-06-23 2018-12-11 Google Llc Remote invocation of mobile device actions
US9632748B2 (en) 2014-06-24 2017-04-25 Google Inc. Device designation for audio input monitoring
US9691379B1 (en) 2014-06-26 2017-06-27 Amazon Technologies, Inc. Selecting from multiple content sources
US9368105B1 (en) 2014-06-26 2016-06-14 Amazon Technologies, Inc. Preventing false wake word detections with a voice-controlled device
US9335819B1 (en) 2014-06-26 2016-05-10 Audible, Inc. Automatic creation of sleep bookmarks in content items
US9639854B2 (en) 2014-06-26 2017-05-02 Nuance Communications, Inc. Voice-controlled information exchange platform, such as for providing information to supplement advertising
US9398392B2 (en) 2014-06-30 2016-07-19 Microsoft Technology Licensing, Llc Audio calibration and adjustment
US9338493B2 (en) 2014-06-30 2016-05-10 Apple Inc. Intelligent automated assistant for TV user interactions
US9420331B2 (en) 2014-07-07 2016-08-16 Google Inc. Method and system for categorizing detected motion events
US11330100B2 (en) 2014-07-09 2022-05-10 Ooma, Inc. Server based intelligent personal assistant services
US9374634B2 (en) 2014-07-10 2016-06-21 Nxp B.V. System for controlling displacement of a loudspeaker
US9467737B2 (en) 2014-07-14 2016-10-11 Sonos, Inc. Zone group control
JP2016024212A (ja) 2014-07-16 2016-02-08 ソニー株式会社 情報処理装置、情報処理方法およびプログラム
US10209947B2 (en) 2014-07-23 2019-02-19 Sonos, Inc. Device grouping
US9671997B2 (en) 2014-07-23 2017-06-06 Sonos, Inc. Zone grouping
US9263042B1 (en) 2014-07-25 2016-02-16 Google Inc. Providing pre-computed hotword models
KR20160017253A (ko) 2014-08-01 2016-02-16 삼성전자주식회사 디스플레이 구동용 집적 회로 칩
US9874997B2 (en) 2014-08-08 2018-01-23 Sonos, Inc. Social playback queues
US9548066B2 (en) 2014-08-11 2017-01-17 Amazon Technologies, Inc. Voice application architecture
US9769552B2 (en) 2014-08-19 2017-09-19 Apple Inc. Method and apparatus for estimating talker distance
US20160055847A1 (en) 2014-08-19 2016-02-25 Nuance Communications, Inc. System and method for speech validation
JP6118838B2 (ja) 2014-08-21 2017-04-19 本田技研工業株式会社 情報処理装置、情報処理システム、情報処理方法、及び情報処理プログラム
DE112015003945T5 (de) 2014-08-28 2017-05-11 Knowles Electronics, Llc Mehrquellen-Rauschunterdrückung
KR20160026317A (ko) 2014-08-29 2016-03-09 삼성전자주식회사 음성 녹음 방법 및 장치
US9560050B2 (en) 2014-09-08 2017-01-31 At&T Intellectual Property I, L.P System and method to share a resource or a capability of a device
US9910634B2 (en) 2014-09-09 2018-03-06 Sonos, Inc. Microphone calibration
US9354687B2 (en) 2014-09-11 2016-05-31 Nuance Communications, Inc. Methods and apparatus for unsupervised wakeup with time-correlated acoustic events
US10789041B2 (en) 2014-09-12 2020-09-29 Apple Inc. Dynamic thresholds for always listening speech trigger
US9747011B2 (en) 2014-09-16 2017-08-29 Google Inc. Continuation of playback of media content by different output devices
US9548053B1 (en) 2014-09-19 2017-01-17 Amazon Technologies, Inc. Audible command filtering
US10645130B2 (en) 2014-09-24 2020-05-05 Sonos, Inc. Playback updates
US9641919B1 (en) 2014-09-30 2017-05-02 Amazon Technologies, Inc. Audio assemblies for electronic devices
US9681228B2 (en) 2014-09-30 2017-06-13 Apple Inc. Capacitive position sensing for transducers
GB2525051B (en) 2014-09-30 2016-04-13 Imagination Tech Ltd Detection of acoustic echo cancellation
US10127911B2 (en) 2014-09-30 2018-11-13 Apple Inc. Speaker identification and unsupervised speaker adaptation techniques
JP6624368B2 (ja) 2014-09-30 2019-12-25 パナソニックIpマネジメント株式会社 接客モニタリングシステム及び接客モニタリング方法
EP3201913A4 (en) 2014-10-01 2018-06-06 Xbrain Inc. Voice and connection platform
US10817672B2 (en) 2014-10-01 2020-10-27 Nuance Communications, Inc. Natural language understanding (NLU) processing based on user-specified interests
US9318107B1 (en) 2014-10-09 2016-04-19 Google Inc. Hotword detection on multiple devices
US9812128B2 (en) 2014-10-09 2017-11-07 Google Inc. Device leadership negotiation among voice interface devices
KR102287943B1 (ko) 2014-10-14 2021-08-09 삼성전자주식회사 전자 기기, 상기 전자 기기의 음량 조절 방법 및 상기 전자 기기의 제어 방법
EP3010251B1 (en) 2014-10-15 2019-11-13 Nxp B.V. Audio system
US20160162469A1 (en) 2014-10-23 2016-06-09 Audience, Inc. Dynamic Local ASR Vocabulary
US9743127B2 (en) 2014-10-30 2017-08-22 Verizon Patent And Licensing Inc. Media service user interface systems and methods
US9530408B2 (en) 2014-10-31 2016-12-27 At&T Intellectual Property I, L.P. Acoustic environment recognizer for optimal speech processing
US10368121B2 (en) 2014-11-07 2019-07-30 Roku, Inc. System and method for collecting data
US9699550B2 (en) 2014-11-12 2017-07-04 Qualcomm Incorporated Reduced microphone power-up latency
US20160134982A1 (en) 2014-11-12 2016-05-12 Harman International Industries, Inc. System and method for estimating the displacement of a speaker cone
JP2016095383A (ja) 2014-11-14 2016-05-26 株式会社ATR−Trek 音声認識クライアント装置及びサーバ型音声認識装置
US10116748B2 (en) 2014-11-20 2018-10-30 Microsoft Technology Licensing, Llc Vehicle-based multi-modal interface
KR102299330B1 (ko) 2014-11-26 2021-09-08 삼성전자주식회사 음성 인식 방법 및 그 전자 장치
US10431214B2 (en) 2014-11-26 2019-10-01 Voicebox Technologies Corporation System and method of determining a domain and/or an action related to a natural language input
WO2016082046A1 (en) 2014-11-28 2016-06-02 Audera Acoustics Inc. High displacement acoustic transducer systems
US9812126B2 (en) 2014-11-28 2017-11-07 Microsoft Technology Licensing, Llc Device arbitration for listening devices
US10192549B2 (en) 2014-11-28 2019-01-29 Microsoft Technology Licensing, Llc Extending digital personal assistant action providers
US10126406B2 (en) 2014-12-02 2018-11-13 Qualcomm Incorporated Method and apparatus for performing ultrasonic presence detection
CN104538030A (zh) 2014-12-11 2015-04-22 科大讯飞股份有限公司 一种可以通过语音控制家电的控制系统与方法
CN107209549B (zh) 2014-12-11 2020-04-17 微软技术许可有限责任公司 能够实现可动作的消息传送的虚拟助理系统
US9779725B2 (en) 2014-12-11 2017-10-03 Mediatek Inc. Voice wakeup detecting device and method
US9775113B2 (en) 2014-12-11 2017-09-26 Mediatek Inc. Voice wakeup detecting device with digital microphone and associated method
US9813812B2 (en) 2014-12-12 2017-11-07 Analog Devices Global Method of controlling diaphragm excursion of electrodynamic loudspeakers
US9552816B2 (en) 2014-12-19 2017-01-24 Amazon Technologies, Inc. Application focus in speech-based systems
US9560441B1 (en) 2014-12-24 2017-01-31 Amazon Technologies, Inc. Determining speaker direction using a spherical microphone array
CN104575504A (zh) 2014-12-24 2015-04-29 上海师范大学 采用声纹和语音识别进行个性化电视语音唤醒的方法
CN104635539A (zh) 2014-12-26 2015-05-20 东莞市掌商信息科技有限公司 一种智能硬件远程语音安全控制方法及其系统
US10572810B2 (en) 2015-01-07 2020-02-25 Microsoft Technology Licensing, Llc Managing user interaction for input understanding determinations
DE112016000287T5 (de) 2015-01-07 2017-10-05 Knowles Electronics, Llc Verwendung von digitalen Mikrofonen zur Niedrigleistung-Schlüsselworterkennung und Rauschunterdrückung
US9934406B2 (en) 2015-01-08 2018-04-03 Microsoft Technology Licensing, Llc Protecting private information in input understanding system
US9584915B2 (en) 2015-01-19 2017-02-28 Microsoft Technology Licensing, Llc Spatial audio with remote speakers
US20160210110A1 (en) 2015-01-21 2016-07-21 Ford Global Technologies, Llc Audio synchronization between vehicles and mobile devices
US9947313B2 (en) 2015-01-26 2018-04-17 William Drewes Method for substantial ongoing cumulative voice recognition error reduction
KR102351366B1 (ko) 2015-01-26 2022-01-14 삼성전자주식회사 음성 인식 방법 및 장치
CN104572009B (zh) 2015-01-28 2018-01-09 合肥联宝信息技术有限公司 一种自适应外界环境的音频控制方法及装置
US9633661B1 (en) 2015-02-02 2017-04-25 Amazon Technologies, Inc. Speech-responsive portable speaker
GB201501791D0 (en) 2015-02-03 2015-03-18 Microsoft Technology Licensing Llc Non-linear echo path detection
US20160232451A1 (en) 2015-02-09 2016-08-11 Velocee Ltd. Systems and methods for managing audio content
US9521496B2 (en) 2015-02-12 2016-12-13 Harman International Industries, Inc. Media content playback system and method
US10121472B2 (en) 2015-02-13 2018-11-06 Knowles Electronics, Llc Audio buffer catch-up apparatus and method with two microphones
US20160239255A1 (en) 2015-02-16 2016-08-18 Harman International Industries, Inc. Mobile interface for loudspeaker optimization
US20160253050A1 (en) 2015-02-26 2016-09-01 Fingertips Lab, Inc. System and method for audio and tactile based browsing
US20170337921A1 (en) 2015-02-27 2017-11-23 Sony Corporation Information processing device, information processing method, and program
US9721566B2 (en) 2015-03-08 2017-08-01 Apple Inc. Competing devices responding to voice triggers
US10762894B2 (en) 2015-03-27 2020-09-01 Google Llc Convolutional neural networks
US9697826B2 (en) 2015-03-27 2017-07-04 Google Inc. Processing multi-channel audio waveforms
US10192546B1 (en) 2015-03-30 2019-01-29 Amazon Technologies, Inc. Pre-wakeword speech processing
US10034109B2 (en) 2015-04-09 2018-07-24 Audera Acoustics Inc. Acoustic transducer systems with position sensing
US9678707B2 (en) 2015-04-10 2017-06-13 Sonos, Inc. Identification of audio content facilitated by playback device
US10198242B2 (en) 2015-04-14 2019-02-05 Motorola Solutions, Inc. Method and apparatus for a volume of a device
US10079012B2 (en) 2015-04-21 2018-09-18 Google Llc Customizing speech-recognition dictionaries in a smart-home environment
US10178474B2 (en) 2015-04-21 2019-01-08 Google Llc Sound signature database for initialization of noise reduction in recordings
US9472196B1 (en) 2015-04-22 2016-10-18 Google Inc. Developer voice actions system
CN104853405B (zh) 2015-05-12 2018-11-30 浙江生辉照明有限公司 智能联网方法及智能设备
KR102623039B1 (ko) 2015-05-15 2024-01-08 가부시키가이샤 한도오따이 에네루기 켄큐쇼 발광 소자, 발광 장치, 전자 기기 및 조명 장치
EP3096277A1 (en) 2015-05-19 2016-11-23 ResearchGate GmbH Enhanced online user-interaction tracking
US10070237B2 (en) 2015-05-21 2018-09-04 Analog Devices, Inc. Optical and capacitive sensing of electroacoustic transducers
TWI757234B (zh) 2015-05-21 2022-03-11 日商半導體能源研究所股份有限公司 發光元件、顯示裝置、電子裝置、及照明裝置
KR20180011134A (ko) 2015-05-21 2018-01-31 가부시키가이샤 한도오따이 에네루기 켄큐쇼 발광 소자, 표시 장치, 전자 기기, 및 조명 장치
US9837547B2 (en) 2015-05-22 2017-12-05 Semiconductor Energy Laboratory Co., Ltd. Semiconductor device comprising oxide conductor and display device including the semiconductor device
JP2016218852A (ja) 2015-05-22 2016-12-22 ソニー株式会社 情報処理装置および情報処理方法、並びにプログラム
EP3099047A1 (en) 2015-05-28 2016-11-30 Nxp B.V. Echo controller
US9584935B2 (en) 2015-05-29 2017-02-28 Sound United, Llc. Multi-zone media system and method for providing multi-zone media
US10657949B2 (en) 2015-05-29 2020-05-19 Sound United, LLC System and method for integrating a home media system and other home systems
US9734822B1 (en) 2015-06-01 2017-08-15 Amazon Technologies, Inc. Feedback based beamformed signal selection
US9864571B2 (en) 2015-06-04 2018-01-09 Sonos, Inc. Dynamic bonding of playback devices
US9672821B2 (en) 2015-06-05 2017-06-06 Apple Inc. Robust speech recognition in the presence of echo and noise using multiple signals for discrimination
US9736578B2 (en) 2015-06-07 2017-08-15 Apple Inc. Microphone-based orientation sensors and related techniques
US10249205B2 (en) 2015-06-08 2019-04-02 Novel Effect, Inc. System and method for integrating special effects with a text source
KR102444075B1 (ko) 2015-06-09 2022-09-16 삼성전자주식회사 전자 장치, 주변 기기 및 그 제어 방법
US10248376B2 (en) 2015-06-11 2019-04-02 Sonos, Inc. Multiple groupings in a playback system
US20160373909A1 (en) 2015-06-17 2016-12-22 Hive Life, LLC Wireless audio, security communication and home automation
WO2016203350A1 (en) 2015-06-17 2016-12-22 Semiconductor Energy Laboratory Co., Ltd. Iridium complex, light-emitting element, display device, electronic device, and lighting device
JP6739907B2 (ja) 2015-06-18 2020-08-12 パナソニック インテレクチュアル プロパティ コーポレーション オブ アメリカPanasonic Intellectual Property Corporation of America 機器特定方法、機器特定装置及びプログラム
US10025447B1 (en) 2015-06-19 2018-07-17 Amazon Technologies, Inc. Multi-device user interface
KR20170001173A (ko) 2015-06-25 2017-01-04 엘지전자 주식회사 와치 타입 이동 단말기 및 그의 동작 방법
US9554210B1 (en) 2015-06-25 2017-01-24 Amazon Technologies, Inc. Multichannel acoustic echo cancellation with unique individual channel estimations
KR102317526B1 (ko) 2015-06-25 2021-10-26 엘지전자 주식회사 헤드셋 및 그 제어 방법
US9472203B1 (en) 2015-06-29 2016-10-18 Amazon Technologies, Inc. Clock synchronization for multichannel system
US20160378747A1 (en) 2015-06-29 2016-12-29 Apple Inc. Virtual assistant for media playback
JP6602406B2 (ja) 2015-06-30 2019-11-06 フラウンホーファー−ゲゼルシャフト・ツール・フェルデルング・デル・アンゲヴァンテン・フォルシュング・アインゲトラーゲネル・フェライン データベースを生成するための方法および装置
KR20240035638A (ko) 2015-07-08 2024-03-15 가부시키가이샤 한도오따이 에네루기 켄큐쇼 발광 소자, 표시 장치, 전자 장치, 및 조명 장치
US10304440B1 (en) 2015-07-10 2019-05-28 Amazon Technologies, Inc. Keyword spotting using multi-task configuration
KR20240047495A (ko) 2015-07-21 2024-04-12 가부시키가이샤 한도오따이 에네루기 켄큐쇼 발광 소자, 표시 장치, 전자 기기, 및 조명 장치
US9686625B2 (en) 2015-07-21 2017-06-20 Disney Enterprises, Inc. Systems and methods for delivery of personalized audio
US9769563B2 (en) 2015-07-22 2017-09-19 Harman International Industries, Incorporated Audio enhancement via opportunistic use of microphones
KR102516496B1 (ko) 2015-07-23 2023-04-04 가부시키가이샤 한도오따이 에네루기 켄큐쇼 발광 소자, 표시 장치, 전자 기기, 및 조명 장치
US20170034263A1 (en) 2015-07-30 2017-02-02 Amp Me Inc. Synchronized Playback of Streamed Audio Content by Multiple Internet-Capable Portable Devices
US10529318B2 (en) 2015-07-31 2020-01-07 International Business Machines Corporation Implementing a classification model for recognition processing
US9691361B2 (en) 2015-08-03 2017-06-27 International Business Machines Corporation Adjusting presentation of content on a display
KR102402512B1 (ko) 2015-08-04 2022-05-27 삼성전자주식회사 외부장치의 음량을 조정하는 전자장치 및 방법
CN105187907A (zh) 2015-08-05 2015-12-23 四川长虹电器股份有限公司 智能电视音量控制系统及控制方法
US9913056B2 (en) 2015-08-06 2018-03-06 Dolby Laboratories Licensing Corporation System and method to enhance speakers connected to devices with microphones
US10333904B2 (en) 2015-08-08 2019-06-25 Peter J. Tormey Voice access and control
KR102386854B1 (ko) 2015-08-20 2022-04-13 삼성전자주식회사 통합 모델 기반의 음성 인식 장치 및 방법
US10270041B2 (en) 2015-08-28 2019-04-23 Semiconductor Energy Laboratory Co., Ltd. Light-emitting element, light-emitting device, electronic device, and lighting device
US20180249267A1 (en) 2015-08-31 2018-08-30 Apple Inc. Passive microphone array localizer
CN106488302B (zh) 2015-09-02 2021-02-23 哈曼国际工业有限公司 切换音频输出的方法、回放设备及回放系统
US10339917B2 (en) 2015-09-03 2019-07-02 Google Llc Enhanced speech endpointing
KR102417682B1 (ko) 2015-09-09 2022-07-07 삼성전자주식회사 음성 인식을 이용한 닉네임 관리 장치 및 방법
KR20170031392A (ko) 2015-09-11 2017-03-21 삼성전자주식회사 전자 장치, 음향 시스템 및 오디오 출력 방법
US10026399B2 (en) 2015-09-11 2018-07-17 Amazon Technologies, Inc. Arbitration between voice-enabled devices
CN105206281B (zh) 2015-09-14 2019-02-15 胡旻波 基于分布式麦克风阵列网络的语音增强方法
KR20170032096A (ko) 2015-09-14 2017-03-22 삼성전자주식회사 전자장치, 전자장치의 구동방법, 음성인식장치, 음성인식장치의 구동 방법 및 컴퓨터 판독가능 기록매체
US10289734B2 (en) 2015-09-18 2019-05-14 Samsung Electronics Co., Ltd. Entity-type search system
US10706873B2 (en) 2015-09-18 2020-07-07 Sri International Real-time speaker state analytics platform
CN105204357B (zh) 2015-09-18 2018-02-06 小米科技有限责任公司 智能家居设备的情景模式调整方法及装置
US9875081B2 (en) 2015-09-21 2018-01-23 Amazon Technologies, Inc. Device selection for providing a response
KR102420450B1 (ko) 2015-09-23 2022-07-14 삼성전자주식회사 음성인식장치, 음성인식방법 및 컴퓨터 판독가능 기록매체
KR102446392B1 (ko) 2015-09-23 2022-09-23 삼성전자주식회사 음성 인식이 가능한 전자 장치 및 방법
US9936156B2 (en) 2015-09-24 2018-04-03 Samantha WESTERN Volume adjusting apparatus and method
US10229700B2 (en) 2015-09-24 2019-03-12 Google Llc Voice activity detection
CN105162886B (zh) 2015-09-25 2019-04-12 北京奇艺世纪科技有限公司 一种声音控制方法及装置
US10186276B2 (en) 2015-09-25 2019-01-22 Qualcomm Incorporated Adaptive noise suppression for super wideband music
JP6536320B2 (ja) 2015-09-28 2019-07-03 富士通株式会社 音声信号処理装置、音声信号処理方法及びプログラム
CN107710770B (zh) 2015-09-28 2021-02-09 谷歌有限责任公司 用于时间同步的多区域媒体流式传输的系统和方法
US9996316B2 (en) 2015-09-28 2018-06-12 Amazon Technologies, Inc. Mediation of wakeword response for multiple devices
US10241754B1 (en) 2015-09-29 2019-03-26 Amazon Technologies, Inc. Systems and methods for providing supplemental information with a response to a command
US20170092278A1 (en) 2015-09-30 2017-03-30 Apple Inc. Speaker recognition
CN111341927B (zh) 2015-09-30 2023-06-09 株式会社半导体能源研究所 发光元件、显示装置、电子设备及照明装置
KR20170038681A (ko) 2015-09-30 2017-04-07 가부시키가이샤 한도오따이 에네루기 켄큐쇼 발광 소자, 표시 장치, 전자 기기, 및 조명 장치
US9978366B2 (en) 2015-10-09 2018-05-22 Xappmedia, Inc. Event-based speech interactive media player
KR102429260B1 (ko) 2015-10-12 2022-08-05 삼성전자주식회사 음성 에이전트 기반의 제어 명령 처리 장치 및 방법과, 에이전트 장치
US9754580B2 (en) 2015-10-12 2017-09-05 Technologies For Voice Interface System and method for extracting and using prosody features
WO2017063706A1 (en) 2015-10-15 2017-04-20 Huawei Technologies Co., Ltd. A sound processing node of an arrangement of sound processing nodes
US9928840B2 (en) 2015-10-16 2018-03-27 Google Llc Hotword recognition
US9747926B2 (en) 2015-10-16 2017-08-29 Google Inc. Hotword recognition
CN107016999B (zh) 2015-10-16 2022-06-14 谷歌有限责任公司 热词识别
US10453450B2 (en) 2015-10-20 2019-10-22 Bragi GmbH Wearable earpiece voice command control system and method
KR102444061B1 (ko) 2015-11-02 2022-09-16 삼성전자주식회사 음성 인식이 가능한 전자 장치 및 방법
CN105427861B (zh) 2015-11-03 2019-02-15 胡旻波 智能家居协同麦克风语音控制的系统及其控制方法
US9691378B1 (en) 2015-11-05 2017-06-27 Amazon Technologies, Inc. Methods and devices for selectively ignoring captured audio data
US9653075B1 (en) 2015-11-06 2017-05-16 Google Inc. Voice commands across devices
US10863267B2 (en) 2015-11-10 2020-12-08 Savant Systems, Inc. Volume control for audio/video devices
US9990209B2 (en) 2015-11-12 2018-06-05 Microsoft Technology Licensing, Llc Digital assistance device for facilitating multi-stage setup
US10706852B2 (en) 2015-11-13 2020-07-07 Microsoft Technology Licensing, Llc Confidence features for automated speech recognition arbitration
US10592949B2 (en) 2015-11-13 2020-03-17 [24]7.ai, Inc. Method and apparatus for linking customer interactions with customer messaging platforms
US20170140750A1 (en) 2015-11-17 2017-05-18 Le Holdings (Beijing) Co., Ltd. Method and device for speech recognition
CN105472191B (zh) 2015-11-18 2019-09-20 百度在线网络技术(北京)有限公司 一种跟踪回声时延的方法和装置
US11929088B2 (en) 2015-11-20 2024-03-12 Synaptics Incorporated Input/output mode control for audio processing
JP6570651B2 (ja) 2015-11-25 2019-09-04 三菱電機株式会社 音声対話装置および音声対話方法
US10040423B2 (en) 2015-11-27 2018-08-07 Bragi GmbH Vehicle with wearable for identifying one or more vehicle occupants
US9484030B1 (en) 2015-12-02 2016-11-01 Amazon Technologies, Inc. Audio triggered commands
US9699597B2 (en) 2015-12-07 2017-07-04 Google Inc. Wireless signal forwarding
US9747920B2 (en) 2015-12-17 2017-08-29 Amazon Technologies, Inc. Adaptive beamforming to create reference channels
CN105632486B (zh) 2015-12-23 2019-12-17 北京奇虎科技有限公司 一种智能硬件的语音唤醒方法和装置
US10134388B1 (en) 2015-12-23 2018-11-20 Amazon Technologies, Inc. Word generation for speech recognition
CN105679318A (zh) 2015-12-23 2016-06-15 珠海格力电器股份有限公司 一种基于语音识别的显示方法、装置、显示系统和空调
US10311862B2 (en) 2015-12-23 2019-06-04 Rovi Guides, Inc. Systems and methods for conversations with devices about media using interruptions and changes of subjects
US9826599B2 (en) 2015-12-28 2017-11-21 Amazon Technologies, Inc. Voice-controlled light switches
US10026401B1 (en) 2015-12-28 2018-07-17 Amazon Technologies, Inc. Naming devices via voice commands
US10547942B2 (en) 2015-12-28 2020-01-28 Samsung Electronics Co., Ltd. Control of electrodynamic speaker driver using a low-order non-linear model
US9992642B1 (en) 2015-12-29 2018-06-05 Amazon Technologies, Inc. Automated messaging
US9820036B1 (en) 2015-12-30 2017-11-14 Amazon Technologies, Inc. Speech processing of reflected sound
US9813810B1 (en) 2016-01-05 2017-11-07 Google Inc. Multi-microphone neural network for sound recognition
US10049666B2 (en) 2016-01-06 2018-08-14 Google Llc Voice recognition system
US9743207B1 (en) 2016-01-18 2017-08-22 Sonos, Inc. Calibration using multiple recording devices
KR20170086814A (ko) 2016-01-19 2017-07-27 삼성전자주식회사 음성 인식 기능을 제공하는 전자 장치 및 그 동작 방법
KR102392113B1 (ko) 2016-01-20 2022-04-29 삼성전자주식회사 전자 장치 및 전자 장치의 음성 명령 처리 방법
CN105741838B (zh) 2016-01-20 2019-10-15 百度在线网络技术(北京)有限公司 语音唤醒方法及装置
US9749731B2 (en) 2016-01-21 2017-08-29 Bose Corporation Sidetone generation using multiple microphones
KR20170091913A (ko) 2016-02-02 2017-08-10 삼성전자주식회사 영상 서비스 제공 방법 및 장치
US9653060B1 (en) 2016-02-09 2017-05-16 Amazon Technologies, Inc. Hybrid reference signal for acoustic echo cancellation
US9659555B1 (en) 2016-02-09 2017-05-23 Amazon Technologies, Inc. Multichannel acoustic echo cancellation
US11437020B2 (en) 2016-02-10 2022-09-06 Cerence Operating Company Techniques for spatially selective wake-up word recognition and related systems and methods
US9898250B1 (en) 2016-02-12 2018-02-20 Amazon Technologies, Inc. Controlling distributed audio outputs to enable voice output
US9858927B2 (en) 2016-02-12 2018-01-02 Amazon Technologies, Inc Processing spoken commands to control distributed audio outputs
US9947316B2 (en) 2016-02-22 2018-04-17 Sonos, Inc. Voice control of a media playback system
US10095470B2 (en) 2016-02-22 2018-10-09 Sonos, Inc. Audio response playback
US9965247B2 (en) 2016-02-22 2018-05-08 Sonos, Inc. Voice controlled media playback system based on user profile
US9820039B2 (en) 2016-02-22 2017-11-14 Sonos, Inc. Default playback devices
US9811314B2 (en) 2016-02-22 2017-11-07 Sonos, Inc. Metadata exchange involving a networked playback system and a networked microphone system
US10264030B2 (en) 2016-02-22 2019-04-16 Sonos, Inc. Networked microphone device control
US9779735B2 (en) 2016-02-24 2017-10-03 Google Inc. Methods and systems for detecting and processing speech signals
WO2017147936A1 (zh) 2016-03-04 2017-09-08 茹旷 智能家居助手
US10133612B2 (en) 2016-03-17 2018-11-20 Nuance Communications, Inc. Session processing interaction between two or more virtual assistants
US9769420B1 (en) 2016-03-18 2017-09-19 Thomas Lawrence Moses Portable wireless remote monitoring and control systems
US10373612B2 (en) 2016-03-21 2019-08-06 Amazon Technologies, Inc. Anchored speech detection and speech recognition
US9805714B2 (en) * 2016-03-22 2017-10-31 Asustek Computer Inc. Directional keyword verification method applicable to electronic device and electronic device using the same
US10365887B1 (en) 2016-03-25 2019-07-30 Amazon Technologies, Inc. Generating commands based on location and wakeword
US10332508B1 (en) 2016-03-31 2019-06-25 Amazon Technologies, Inc. Confidence checking for speech processing and query answering
US9952827B2 (en) 2016-04-13 2018-04-24 Comcast Cable Communications, Llc Dynamic adjustment of equalization settings of audio components via a sound device profile
EP3430514B1 (en) 2016-04-18 2019-10-09 Google LLC Automated assistant invocation of appropriate agent
US10318236B1 (en) 2016-05-05 2019-06-11 Amazon Technologies, Inc. Refining media playback
US20170329397A1 (en) 2016-05-12 2017-11-16 Rovi Guides, Inc. Systems and methods for navigating a media guidance application using gaze control
US10447748B2 (en) 2016-05-12 2019-10-15 Apple Inc. Sharing media information between applications on client devices
US10149049B2 (en) 2016-05-13 2018-12-04 Bose Corporation Processing speech from distributed microphones
US20170330565A1 (en) 2016-05-13 2017-11-16 Bose Corporation Handling Responses to Speech Processing
US10187440B2 (en) 2016-05-27 2019-01-22 Apple Inc. Personalization of media streams
US10063965B2 (en) 2016-06-01 2018-08-28 Google Llc Sound source estimation using neural networks
US10079027B2 (en) 2016-06-03 2018-09-18 Nxp B.V. Sound signal detector
US10474419B2 (en) 2016-06-03 2019-11-12 Crestron Electronics, Inc. Audio digital signal processor utilizing a hybrid network architecture
AU2017100581B4 (en) 2016-06-08 2018-02-01 Apple Inc. Intelligent automated assistant for media exploration
US10235124B2 (en) 2016-06-08 2019-03-19 Google Llc Audio announcement prioritization system
US9754605B1 (en) 2016-06-09 2017-09-05 Amazon Technologies, Inc. Step-size control for multi-channel acoustic echo canceller
DK179415B1 (en) 2016-06-11 2018-06-14 Apple Inc Intelligent device arbitration and control
AU2017100486C4 (en) 2016-06-11 2019-09-05 Apple Inc. Intelligent device arbitration and control
DK179034B1 (en) 2016-06-12 2017-09-04 Apple Inc Devices, methods, and graphical user interfaces for dynamically adjusting presentation of audio outputs
US20170364371A1 (en) 2016-06-15 2017-12-21 Microsoft Technology Licensing, Llc Context-Dependent Digital Action-Assistance Tool
US11600269B2 (en) 2016-06-15 2023-03-07 Cerence Operating Company Techniques for wake-up word recognition and related systems and methods
US10212029B2 (en) 2016-06-15 2019-02-19 Microsoft Technology Licensing, Llc Service provisioning in cloud computing systems
KR20170142001A (ko) 2016-06-16 2017-12-27 삼성전자주식회사 전자 장치, 그의 반향 신호 제거 방법 및 비일시적 컴퓨터 판독가능 기록매체
US9749738B1 (en) 2016-06-20 2017-08-29 Gopro, Inc. Synthesizing audio corresponding to a virtual microphone location
US9875740B1 (en) 2016-06-20 2018-01-23 A9.Com, Inc. Using voice information to influence importance of search result categories
ITUA20164622A1 (it) 2016-06-23 2017-12-23 St Microelectronics Srl Procedimento di beamforming basato su matrici di microfoni e relativo apparato
US10091545B1 (en) 2016-06-27 2018-10-02 Amazon Technologies, Inc. Methods and systems for detecting audio output of associated device
US9728188B1 (en) 2016-06-28 2017-08-08 Amazon Technologies, Inc. Methods and devices for ignoring similar audio being received by a system
KR102471499B1 (ko) 2016-07-05 2022-11-28 삼성전자주식회사 영상처리장치, 영상처리장치의 구동방법 및 컴퓨터 판독가능 기록매체
EP3270377B1 (en) 2016-07-12 2020-02-19 Dolby Laboratories Licensing Corporation Assessment and adjustment of audio installation
US20180018965A1 (en) 2016-07-12 2018-01-18 Bose Corporation Combining Gesture and Voice User Interfaces
US10152969B2 (en) 2016-07-15 2018-12-11 Sonos, Inc. Voice detection by multiple devices
US9860670B1 (en) 2016-07-15 2018-01-02 Sonos, Inc. Spectral correction using spatial calibration
US10134399B2 (en) 2016-07-15 2018-11-20 Sonos, Inc. Contextualization of voice inputs
US9979680B2 (en) 2016-07-21 2018-05-22 Fujitsu Limited Smart notification scheduling and modality selection
US10621992B2 (en) 2016-07-22 2020-04-14 Lenovo (Singapore) Pte. Ltd. Activating voice assistant based on at least one of user proximity and context
US20180033429A1 (en) 2016-07-26 2018-02-01 Ford Global Technologies, Llc Extendable vehicle system
CN106028223A (zh) 2016-07-26 2016-10-12 广东欧珀移动通信有限公司 一种智能音箱的控制方法、装置及智能音箱
KR102575634B1 (ko) 2016-07-26 2023-09-06 삼성전자주식회사 전자 장치 및 전자 장치의 동작 방법
US10431211B2 (en) 2016-07-29 2019-10-01 Qualcomm Incorporated Directional processing of far-field audio
US10115400B2 (en) 2016-08-05 2018-10-30 Sonos, Inc. Multiple voice services
US10459684B2 (en) 2016-08-05 2019-10-29 Sonos, Inc. Calibration of a playback device based on an estimated frequency response
US10026403B2 (en) 2016-08-12 2018-07-17 Paypal, Inc. Location based voice association system
US9967382B2 (en) 2016-08-19 2018-05-08 Amazon Technologies, Inc. Enabling voice control of telephone device
US20180053504A1 (en) 2016-08-19 2018-02-22 Otis Elevator Company Intention recognition for triggering voice recognition system
US9691384B1 (en) 2016-08-19 2017-06-27 Google Inc. Voice action biasing system
CN107767863B (zh) * 2016-08-22 2021-05-04 科大讯飞股份有限公司 语音唤醒方法、系统及智能终端
US9972320B2 (en) 2016-08-24 2018-05-15 Google Llc Hotword detection on multiple devices
US20180061396A1 (en) 2016-08-24 2018-03-01 Knowles Electronics, Llc Methods and systems for keyword detection using keyword repetitions
US10461953B2 (en) 2016-08-29 2019-10-29 Lutron Technology Company Llc Load control system having audio control devices
US10360910B2 (en) 2016-08-29 2019-07-23 Garmin Switzerland Gmbh Automatic speech recognition (ASR) utilizing GPS and sensor data
US10685656B2 (en) 2016-08-31 2020-06-16 Bose Corporation Accessing multiple virtual personal assistants (VPA) from a single device
US10074369B2 (en) 2016-09-01 2018-09-11 Amazon Technologies, Inc. Voice-based communications
US10580404B2 (en) 2016-09-01 2020-03-03 Amazon Technologies, Inc. Indicator for voice-based communications
US10057698B2 (en) 2016-09-02 2018-08-21 Bose Corporation Multiple room communication system and method
CA3155320A1 (en) 2016-09-06 2018-03-15 Deepmind Technologies Limited Generating audio using neural networks
EP3297298B1 (en) 2016-09-19 2020-05-06 A-Volute Method for reproducing spatially distributed sounds
US9972318B1 (en) 2016-09-21 2018-05-15 Amazon Technologies, Inc. Interpreting voice commands
JP6520878B2 (ja) 2016-09-21 2019-05-29 トヨタ自動車株式会社 音声取得システムおよび音声取得方法
JP2018055259A (ja) * 2016-09-27 2018-04-05 キヤノン株式会社 情報処理装置、情報処理方法及びプログラム
US9942678B1 (en) 2016-09-27 2018-04-10 Sonos, Inc. Audio playback settings for voice interaction
US10409548B2 (en) 2016-09-27 2019-09-10 Grabango Co. System and method for differentially locating and modifying audio sources
US9743204B1 (en) 2016-09-30 2017-08-22 Sonos, Inc. Multi-orientation playback device microphones
WO2018067402A1 (en) 2016-10-03 2018-04-12 Google Inc. Selection of computational agent for task performance
US10283138B2 (en) 2016-10-03 2019-05-07 Google Llc Noise mitigation for a voice interface device
JP6683893B2 (ja) 2016-10-03 2020-04-22 グーグル エルエルシー デバイストポロジーに基づく音声コマンドの処理
CN107919116B (zh) * 2016-10-11 2019-09-13 芋头科技(杭州)有限公司 一种语音激活检测方法及装置
US10712997B2 (en) 2016-10-17 2020-07-14 Sonos, Inc. Room association based on name
US10181323B2 (en) 2016-10-19 2019-01-15 Sonos, Inc. Arbitration-based voice recognition
US20180122372A1 (en) 2016-10-31 2018-05-03 Soundhound, Inc. Distinguishable open sounds
US10783883B2 (en) 2016-11-03 2020-09-22 Google Llc Focus session at a voice interface device
KR102241970B1 (ko) 2016-11-07 2021-04-20 구글 엘엘씨 기록된 미디어 핫워드 트리거 억제
US10154496B2 (en) 2016-11-10 2018-12-11 Futurewei Technologies, Inc. System and method for beamformed reference signals in three dimensional multiple input multiple output communications systems
US10382806B2 (en) 2016-11-14 2019-08-13 DISH Technologies L.L.C. Apparatus, systems and methods for controlling presentation of content using a multi-media table
US10170110B2 (en) 2016-11-17 2019-01-01 Robert Bosch Gmbh System and method for ranking of hybrid speech recognition results with neural networks
CN106708403A (zh) 2016-11-30 2017-05-24 努比亚技术有限公司 输入滑动操作时同步播放提示音的方法及装置
US10186265B1 (en) 2016-12-06 2019-01-22 Amazon Technologies, Inc. Multi-layer keyword detection to avoid detection of keywords in output audio
US10079015B1 (en) 2016-12-06 2018-09-18 Amazon Technologies, Inc. Multi-layer keyword detection
US10134396B2 (en) 2016-12-07 2018-11-20 Google Llc Preventing of audio attacks
US10241748B2 (en) 2016-12-13 2019-03-26 EVA Automation, Inc. Schedule-based coordination of audio sources
US11184764B2 (en) 2016-12-14 2021-11-23 Amzetta Technologies, Llc Methods and systems of establishing communication between devices
CN106531165A (zh) 2016-12-15 2017-03-22 北京塞宾科技有限公司 一种便携式智能家居语音控制系统及控制方法
US10339957B1 (en) 2016-12-20 2019-07-02 Amazon Technologies, Inc. Ending communications session based on presence data
US10068573B1 (en) 2016-12-21 2018-09-04 Amazon Technologies, Inc. Approaches for voice-activated audio commands
US10559309B2 (en) 2016-12-22 2020-02-11 Google Llc Collaborative voice controlled devices
WO2018119470A1 (en) 2016-12-23 2018-06-28 Synaptics Incorporated Online dereverberation algorithm based on weighted prediction error for noisy time-varying environments
CN106910500B (zh) 2016-12-23 2020-04-17 北京小鸟听听科技有限公司 对带麦克风阵列的设备进行语音控制的方法及设备
US10546578B2 (en) 2016-12-26 2020-01-28 Samsung Electronics Co., Ltd. Method and device for transmitting and receiving audio data
US10580405B1 (en) 2016-12-27 2020-03-03 Amazon Technologies, Inc. Voice control of remote device
US10276161B2 (en) 2016-12-27 2019-04-30 Google Llc Contextual hotwords
US10593328B1 (en) 2016-12-27 2020-03-17 Amazon Technologies, Inc. Voice control of remote device
US10186266B1 (en) 2016-12-28 2019-01-22 Amazon Technologies, Inc. Message playback using a shared device
US10229680B1 (en) 2016-12-29 2019-03-12 Amazon Technologies, Inc. Contextual entity resolution
US10831366B2 (en) 2016-12-29 2020-11-10 Google Llc Modality learning on mobile devices
US10290302B2 (en) 2016-12-30 2019-05-14 Google Llc Compact home assistant with combined acoustic waveguide and heat sink
US10224031B2 (en) 2016-12-30 2019-03-05 Google Llc Generating and transmitting invocation request to appropriate third-party agent
KR102412202B1 (ko) 2017-01-03 2022-06-27 삼성전자주식회사 냉장고 및 이의 정보 표시 방법
US10248613B2 (en) 2017-01-10 2019-04-02 Qualcomm Incorporated Data bus activation in an electronic device
US10672387B2 (en) 2017-01-11 2020-06-02 Google Llc Systems and methods for recognizing user speech
US10306254B2 (en) 2017-01-17 2019-05-28 Seiko Epson Corporation Encoding free view point data in movie data container
KR20180084392A (ko) 2017-01-17 2018-07-25 삼성전자주식회사 전자 장치 및 그의 동작 방법
US11164570B2 (en) 2017-01-17 2021-11-02 Ford Global Technologies, Llc Voice assistant tracking and activation
KR20180085931A (ko) 2017-01-20 2018-07-30 삼성전자주식회사 음성 입력 처리 방법 및 이를 지원하는 전자 장치
KR102556840B1 (ko) 2017-01-20 2023-07-18 삼성전자주식회사 전자 장치 및 그의 제어 방법
US20180218747A1 (en) 2017-01-28 2018-08-02 Bose Corporation Audio Device Filter Modification
KR20180090586A (ko) 2017-02-03 2018-08-13 삼성전자주식회사 알림을 제공하는 방법 및 그 전자 장치
US10694608B2 (en) 2017-02-07 2020-06-23 Lutron Technology Company Llc Audio-based load control system
US10762891B2 (en) 2017-02-10 2020-09-01 Synaptics Incorporated Binary and multi-class classification systems and methods using connectionist temporal classification
CN108446281B (zh) 2017-02-13 2021-03-12 北京嘀嘀无限科技发展有限公司 确定用户亲密度的方法、装置及存储介质
US20180293221A1 (en) 2017-02-14 2018-10-11 Microsoft Technology Licensing, Llc Speech parsing with intelligent assistant
US11100384B2 (en) 2017-02-14 2021-08-24 Microsoft Technology Licensing, Llc Intelligent device user interactions
US10311876B2 (en) 2017-02-14 2019-06-04 Google Llc Server side hotwording
US10467510B2 (en) 2017-02-14 2019-11-05 Microsoft Technology Licensing, Llc Intelligent assistant
US10431217B2 (en) 2017-02-15 2019-10-01 Amazon Technologies, Inc. Audio playback device that dynamically switches between receiving audio data from a soft access point and receiving audio data from a local access point
US10264358B2 (en) 2017-02-15 2019-04-16 Amazon Technologies, Inc. Selection of master device for synchronized audio
US10839795B2 (en) 2017-02-15 2020-11-17 Amazon Technologies, Inc. Implicit target selection for multiple audio playback devices in an environment
CN106921560B (zh) 2017-02-28 2020-06-02 北京小米移动软件有限公司 语音通信方法、装置及系统
US20180262793A1 (en) 2017-03-09 2018-09-13 Google Inc. Reverse Casting from a First Screen Device to a Second Screen Device
US10089981B1 (en) 2017-03-09 2018-10-02 Amazon Technologies, Inc. Messaging account disambiguation
US10706843B1 (en) 2017-03-09 2020-07-07 Amazon Technologies, Inc. Contact resolution for communications systems
US10540961B2 (en) 2017-03-13 2020-01-21 Baidu Usa Llc Convolutional recurrent neural networks for small-footprint keyword spotting
US10074371B1 (en) 2017-03-14 2018-09-11 Amazon Technologies, Inc. Voice control of remote device by disabling wakeword detection
US10600406B1 (en) 2017-03-20 2020-03-24 Amazon Technologies, Inc. Intent re-ranker
US10499139B2 (en) 2017-03-20 2019-12-03 Bose Corporation Audio signal processing for noise reduction
US10621980B2 (en) 2017-03-21 2020-04-14 Harman International Industries, Inc. Execution of voice commands in a multi-device system
JP6791356B2 (ja) 2017-03-24 2020-11-25 ヤマハ株式会社 音声端末、音声コマンド生成システム、及び音声コマンド生成システムの制御方法
US10643609B1 (en) 2017-03-29 2020-05-05 Amazon Technologies, Inc. Selecting speech inputs
CN107135443B (zh) 2017-03-29 2020-06-23 联想(北京)有限公司 一种信号处理方法及电子设备
US10373630B2 (en) 2017-03-31 2019-08-06 Intel Corporation Systems and methods for energy efficient and low power distributed automatic speech recognition on wearable devices
US10825471B2 (en) 2017-04-05 2020-11-03 Avago Technologies International Sales Pte. Limited Voice energy detection
US11188808B2 (en) 2017-04-11 2021-11-30 Lenovo (Singapore) Pte. Ltd. Indicating a responding virtual assistant from a plurality of virtual assistants
US10748531B2 (en) 2017-04-13 2020-08-18 Harman International Industries, Incorporated Management layer for multiple intelligent personal assistant services
CN107122158A (zh) 2017-04-14 2017-09-01 北京小米移动软件有限公司 播放信息提示音频的方法及装置、电子设备
KR102068182B1 (ko) 2017-04-21 2020-01-20 엘지전자 주식회사 음성 인식 장치, 및 음성 인식 시스템
KR102392297B1 (ko) 2017-04-24 2022-05-02 엘지전자 주식회사 전자기기
KR102298947B1 (ko) 2017-04-28 2021-09-08 삼성전자주식회사 음성 데이터 처리 방법 및 이를 지원하는 전자 장치
US10992795B2 (en) 2017-05-16 2021-04-27 Apple Inc. Methods and interfaces for home media control
US10311870B2 (en) 2017-05-10 2019-06-04 Ecobee Inc. Computerized device with voice command input capability
US10013995B1 (en) 2017-05-10 2018-07-03 Cirrus Logic, Inc. Combined reference signal for acoustic echo cancellation
US20180336892A1 (en) 2017-05-16 2018-11-22 Apple Inc. Detecting a trigger of a digital assistant
DK179549B1 (en) 2017-05-16 2019-02-12 Apple Inc. FAR-FIELD EXTENSION FOR DIGITAL ASSISTANT SERVICES
US10628484B2 (en) 2017-05-17 2020-04-21 Board Of Trustees Of The University Of Illinois Vibrational devices as sound sensors
US10564928B2 (en) 2017-06-02 2020-02-18 Rovi Guides, Inc. Systems and methods for generating a volume- based response for multiple voice-operated user devices
US10403299B2 (en) 2017-06-02 2019-09-03 Apple Inc. Multi-channel speech signal enhancement for robust voice trigger detection and automatic speech recognition
US10531196B2 (en) 2017-06-02 2020-01-07 Apple Inc. Spatially ducking audio produced through a beamforming loudspeaker array
US10522146B1 (en) 2019-07-09 2019-12-31 Instreamatic, Inc. Systems and methods for recognizing and performing voice commands during advertisement
US10395650B2 (en) 2017-06-05 2019-08-27 Google Llc Recorded media hotword trigger suppression
US10410635B2 (en) 2017-06-09 2019-09-10 Soundhound, Inc. Dual mode speech recognition
US10983753B2 (en) 2017-06-09 2021-04-20 International Business Machines Corporation Cognitive and interactive sensor based smart home solution
US10984329B2 (en) 2017-06-14 2021-04-20 Ademco Inc. Voice activated virtual assistant with a fused response
US10028069B1 (en) 2017-06-22 2018-07-17 Sonos, Inc. Immersive audio in a media playback system
US10950228B1 (en) 2017-06-28 2021-03-16 Amazon Technologies, Inc. Interactive voice controlled entertainment
US11189273B2 (en) 2017-06-29 2021-11-30 Amazon Technologies, Inc. Hands free always on near field wakeword solution
EP3646161A1 (en) 2017-06-30 2020-05-06 Google LLC Methods, systems, and media for voice-based call operations
US10687353B2 (en) 2017-07-10 2020-06-16 Qualcomm Incorporated Management of conflicting scheduling commands in wireless networks
US20190013019A1 (en) * 2017-07-10 2019-01-10 Intel Corporation Speaker command and key phrase management for muli -virtual assistant systems
US10310082B2 (en) 2017-07-27 2019-06-04 Quantenna Communications, Inc. Acoustic spatial diagnostics for smart home management
US11205421B2 (en) 2017-07-28 2021-12-21 Cerence Operating Company Selection system and method
US11798544B2 (en) 2017-08-07 2023-10-24 Polycom, Llc Replying to a spoken command
US10475449B2 (en) 2017-08-07 2019-11-12 Sonos, Inc. Wake-word detection suppression
JP6513749B2 (ja) 2017-08-09 2019-05-15 レノボ・シンガポール・プライベート・リミテッド 音声アシストシステム、サーバ装置、その音声アシスト方法、及びコンピュータが実行するためのプログラム
KR102389041B1 (ko) 2017-08-11 2022-04-21 엘지전자 주식회사 이동단말기 및 머신 러닝을 이용한 이동 단말기의 제어방법
US10304475B1 (en) 2017-08-14 2019-05-28 Amazon Technologies, Inc. Trigger word based beam selection
US11062710B2 (en) 2017-08-28 2021-07-13 Roku, Inc. Local and cloud speech recognition
US11062702B2 (en) 2017-08-28 2021-07-13 Roku, Inc. Media system with multiple digital assistants
US20190066710A1 (en) 2017-08-28 2019-02-28 Apple Inc. Transparent near-end user control over far-end speech enhancement processing
US10553235B2 (en) 2017-08-28 2020-02-04 Apple Inc. Transparent near-end user control over far-end speech enhancement processing
US10546583B2 (en) 2017-08-30 2020-01-28 Amazon Technologies, Inc. Context-based device arbitration
US10366699B1 (en) 2017-08-31 2019-07-30 Amazon Technologies, Inc. Multi-path calculations for device energy levels
US10911596B1 (en) 2017-08-31 2021-02-02 Amazon Technologies, Inc. Voice user interface for wired communications system
US10515625B1 (en) 2017-08-31 2019-12-24 Amazon Technologies, Inc. Multi-modal natural language processing
US11361763B1 (en) 2017-09-01 2022-06-14 Amazon Technologies, Inc. Detecting system-directed speech
US10847149B1 (en) 2017-09-01 2020-11-24 Amazon Technologies, Inc. Speech-based attention span for voice user interface
US10482895B2 (en) 2017-09-01 2019-11-19 Cirrus Logic, Inc. Acoustic echo cancellation (AEC) rate adaptation
JP6571144B2 (ja) 2017-09-08 2019-09-04 シャープ株式会社 監視システム、監視機器、サーバ、および監視方法
US20190082255A1 (en) 2017-09-08 2019-03-14 Olympus Corporation Information acquiring apparatus, information acquiring method, and computer readable recording medium
US10048930B1 (en) 2017-09-08 2018-08-14 Sonos, Inc. Dynamic computation of system response volume
US10083006B1 (en) 2017-09-12 2018-09-25 Google Llc Intercom-style communication using multiple computing devices
KR102338376B1 (ko) 2017-09-13 2021-12-13 삼성전자주식회사 디바이스 그룹을 지정하기 위한 전자 장치 및 이의 제어 방법
US11314215B2 (en) 2017-09-15 2022-04-26 Kohler Co. Apparatus controlling bathroom appliance lighting based on user identity
US9973849B1 (en) 2017-09-20 2018-05-15 Amazon Technologies, Inc. Signal quality beam selection
US10719507B2 (en) 2017-09-21 2020-07-21 SayMosaic Inc. System and method for natural language processing
US10580411B2 (en) 2017-09-25 2020-03-03 Cirrus Logic, Inc. Talker change detection
US10586534B1 (en) 2017-09-27 2020-03-10 Amazon Technologies, Inc. Voice-controlled device control using acoustic echo cancellation statistics
US10051366B1 (en) 2017-09-28 2018-08-14 Sonos, Inc. Three-dimensional beam forming with a microphone array
US10621981B2 (en) 2017-09-28 2020-04-14 Sonos, Inc. Tone interference cancellation
US11233782B2 (en) 2017-10-04 2022-01-25 Resilience Magnum IP, LLC Single node network connectivity for structure automation functionality
US10897680B2 (en) 2017-10-04 2021-01-19 Google Llc Orientation-based device interface
KR102543693B1 (ko) 2017-10-17 2023-06-16 삼성전자주식회사 전자 장치 및 그의 동작 방법
KR102421255B1 (ko) 2017-10-17 2022-07-18 삼성전자주식회사 음성 신호를 제어하기 위한 전자 장치 및 방법
US10403266B2 (en) * 2017-10-18 2019-09-03 Intel Corporation Detecting keywords in audio using a spiking neural network
CN107808670B (zh) 2017-10-25 2021-05-14 百度在线网络技术(北京)有限公司 语音数据处理方法、装置、设备及存储介质
JP2019086903A (ja) 2017-11-02 2019-06-06 東芝映像ソリューション株式会社 音声対話端末、および音声対話端末制御方法
CN107832837B (zh) * 2017-11-28 2021-09-28 南京大学 一种基于压缩感知原理的卷积神经网络压缩方法及解压缩方法
US20190163153A1 (en) 2017-11-30 2019-05-30 International Business Machines Corporation Enforcing dynamic volume thresholds of an entertainment device
US10445365B2 (en) 2017-12-04 2019-10-15 Amazon Technologies, Inc. Streaming radio with personalized content integration
US10546593B2 (en) 2017-12-04 2020-01-28 Apple Inc. Deep learning driven multi-channel filtering for speech enhancement
US10510340B1 (en) 2017-12-05 2019-12-17 Amazon Technologies, Inc. Dynamic wakeword detection
US10777189B1 (en) 2017-12-05 2020-09-15 Amazon Technologies, Inc. Dynamic wakeword detection
US20190172452A1 (en) 2017-12-06 2019-06-06 GM Global Technology Operations LLC External information rendering
US10958467B2 (en) 2017-12-06 2021-03-23 Google Llc Ducking and erasing audio from nearby devices
CN107919123B (zh) 2017-12-07 2022-06-03 北京小米移动软件有限公司 多语音助手控制方法、装置及计算机可读存储介质
US11182122B2 (en) 2017-12-08 2021-11-23 Amazon Technologies, Inc. Voice control of computing devices
US20190179611A1 (en) 2017-12-11 2019-06-13 Sonos, Inc. Systems and Methods of Receiving Voice Input
US10051600B1 (en) 2017-12-12 2018-08-14 Amazon Technologies, Inc. Selective notification delivery based on user presence detections
US10425247B2 (en) 2017-12-12 2019-09-24 Rovi Guides, Inc. Systems and methods for modifying playback of a media asset in response to a verbal command unrelated to playback of the media asset
US10847137B1 (en) 2017-12-12 2020-11-24 Amazon Technologies, Inc. Trigger word detection using neural network waveform processing
US10374816B1 (en) 2017-12-13 2019-08-06 Amazon Technologies, Inc. Network conference management and arbitration via voice-capturing devices
US10663313B2 (en) 2017-12-15 2020-05-26 Google Llc Providing traffic warnings to a user based on return journey
US10540971B2 (en) 2017-12-15 2020-01-21 Blue Jeans Network, Inc. System and methods for in-meeting group assistance using a virtual assistant
US11409816B2 (en) 2017-12-19 2022-08-09 Motorola Solutions, Inc. Methods and systems for determining an action to be taken in response to a user query as a function of pre-query context information
US11295748B2 (en) 2017-12-26 2022-04-05 Robert Bosch Gmbh Speaker identification with ultra-short speech segments for far and near field voice assistance applications
EP3732626A4 (en) 2017-12-28 2021-09-15 Syntiant ALWAYS ACTIVE KEYWORD DETECTOR
US10614811B2 (en) 2017-12-29 2020-04-07 Intel Corporation Hierarchical speech recognition resolution
WO2019128541A1 (en) 2017-12-31 2019-07-04 Midea Group Co., Ltd. Method and system for controlling multiple home devices
CN111357048A (zh) 2017-12-31 2020-06-30 美的集团股份有限公司 用于控制家庭助手装置的方法和系统
US9972343B1 (en) 2018-01-08 2018-05-15 Republic Wireless, Inc. Multi-step validation of wakeup phrase processing
US10795332B2 (en) 2018-01-16 2020-10-06 Resilience Magnum IP, LLC Facilitating automating home control
CN108198548B (zh) * 2018-01-25 2020-11-20 苏州奇梦者网络科技有限公司 一种语音唤醒方法及其系统
US20190237067A1 (en) 2018-01-31 2019-08-01 Toyota Motor Engineering & Manufacturing North America, Inc. Multi-channel voice recognition for a vehicle environment
US10157042B1 (en) 2018-02-06 2018-12-18 Amazon Technologies, Inc. Audio output control
US11024307B2 (en) 2018-02-08 2021-06-01 Computime Ltd. Method and apparatus to provide comprehensive smart assistant services
US11145298B2 (en) 2018-02-13 2021-10-12 Roku, Inc. Trigger word detection with multiple digital assistants
US10425780B1 (en) 2018-02-22 2019-09-24 Amazon Technologies, Inc. Outputting notifications using device groups
US10491962B2 (en) 2018-03-14 2019-11-26 Rovi Guides, Inc. Systems and methods for presenting event notifications, based on active applications in a social group, on devices notwithstanding a user instruction to disable event notifications
US11127405B1 (en) 2018-03-14 2021-09-21 Amazon Technologies, Inc. Selective requests for authentication for voice-based launching of applications
US10749828B2 (en) 2018-03-14 2020-08-18 Rovi Guides, Inc. Systems and methods for presenting event notifications, based on trending communications, on devices notwithstanding a user instruction to disable event notifications
US10438605B1 (en) 2018-03-19 2019-10-08 Bose Corporation Echo control in binaural adaptive noise cancellation systems in headsets
US10685669B1 (en) 2018-03-20 2020-06-16 Amazon Technologies, Inc. Device selection from audio data
US10440440B1 (en) 2018-03-23 2019-10-08 Rovi Guides, Inc. Systems and methods for prompting a user to view an important event in a media asset presented on a first device when the user is viewing another media asset presented on a second device
US10777203B1 (en) 2018-03-23 2020-09-15 Amazon Technologies, Inc. Speech interface device with caching component
US10755706B2 (en) 2018-03-26 2020-08-25 Midea Group Co., Ltd. Voice-based user interface with dynamically switchable endpoints
US10446169B1 (en) 2018-03-26 2019-10-15 Motorola Mobility Llc Pre-selectable and dynamic configurable multistage echo control system for large range level of acoustic echo
US11151991B2 (en) 2018-03-30 2021-10-19 Verizon Media Inc. Electronic message transmission
WO2019195799A1 (en) 2018-04-05 2019-10-10 Synaptics Incorporated Context-aware control for smart devices
WO2019193378A1 (en) 2018-04-06 2019-10-10 Flex Ltd. Device and system for accessing multiple virtual assistant services
US10720166B2 (en) 2018-04-09 2020-07-21 Synaptics Incorporated Voice biometrics systems and methods
US10679629B2 (en) 2018-04-09 2020-06-09 Amazon Technologies, Inc. Device arbitration by multiple speech processing systems
US10928917B2 (en) 2018-04-12 2021-02-23 International Business Machines Corporation Multiple user interaction with audio devices using speech and gestures
CN108520741B (zh) 2018-04-12 2021-05-04 科大讯飞股份有限公司 一种耳语音恢复方法、装置、设备及可读存储介质
US10679615B2 (en) 2018-04-16 2020-06-09 Google Llc Adaptive interface in a voice-based networked system
CN108538305A (zh) 2018-04-20 2018-09-14 百度在线网络技术(北京)有限公司 语音识别方法、装置、设备及计算机可读存储介质
EP3561806B1 (en) 2018-04-23 2020-04-22 Spotify AB Activation trigger processing
US10803864B2 (en) 2018-05-07 2020-10-13 Spotify Ab Voice recognition system for use with a personal media streaming appliance
US11308947B2 (en) 2018-05-07 2022-04-19 Spotify Ab Voice recognition system for use with a personal media streaming appliance
US11175880B2 (en) 2018-05-10 2021-11-16 Sonos, Inc. Systems and methods for voice-assisted media content selection
JP2019204025A (ja) 2018-05-24 2019-11-28 レノボ・シンガポール・プライベート・リミテッド 電子機器、制御方法、及びプログラム
US10959029B2 (en) 2018-05-25 2021-03-23 Sonos, Inc. Determining and adapting to changes in microphone performance of playback devices
US10777195B2 (en) 2018-05-31 2020-09-15 International Business Machines Corporation Wake command nullification for digital assistance and voice recognition technologies
US20190371324A1 (en) 2018-06-01 2019-12-05 Apple Inc. Suppression of voice response by device rendering trigger audio
WO2019235863A1 (en) 2018-06-05 2019-12-12 Samsung Electronics Co., Ltd. Methods and systems for passive wakeup of a user interaction device
US10433058B1 (en) 2018-06-14 2019-10-01 Sonos, Inc. Content rules engines for audio playback devices
US10762896B1 (en) 2018-06-25 2020-09-01 Amazon Technologies, Inc. Wakeword detection
US10681460B2 (en) 2018-06-28 2020-06-09 Sonos, Inc. Systems and methods for associating playback devices with voice assistant services
NL2021308B1 (en) 2018-07-16 2020-01-24 Hazelebach & Van Der Ven Holding B V Methods for a voice processing system
JP7000268B2 (ja) 2018-07-18 2022-01-19 株式会社東芝 情報処理装置、情報処理方法、およびプログラム
US11144596B2 (en) 2018-07-24 2021-10-12 Harman International Industries, Incorporated Retroactive information searching enabled by neural sensing
GB2576016B (en) 2018-08-01 2021-06-23 Arm Ip Ltd Voice assistant devices
US10461710B1 (en) 2018-08-28 2019-10-29 Sonos, Inc. Media playback system with maximum volume setting
KR102225984B1 (ko) 2018-09-03 2021-03-10 엘지전자 주식회사 음성 인식 서비스를 제공하는 서버
US10622009B1 (en) 2018-09-10 2020-04-14 Amazon Technologies, Inc. Methods for detecting double-talk
US20200090647A1 (en) 2018-09-14 2020-03-19 Comcast Cable Communications, Llc Keyword Detection In The Presence Of Media Output
US10878811B2 (en) * 2018-09-14 2020-12-29 Sonos, Inc. Networked devices, systems, and methods for intelligently deactivating wake-word engines
US10650807B2 (en) 2018-09-18 2020-05-12 Intel Corporation Method and system of neural network keyphrase detection
US11024331B2 (en) * 2018-09-21 2021-06-01 Sonos, Inc. Voice detection optimization using sound metadata
KR20200034430A (ko) 2018-09-21 2020-03-31 삼성전자주식회사 전자 장치, 시스템 및 음성 인식 서비스 이용 방법
US10861444B2 (en) 2018-09-24 2020-12-08 Rovi Guides, Inc. Systems and methods for determining whether to trigger a voice capable device based on speaking cadence
US10811015B2 (en) 2018-09-25 2020-10-20 Sonos, Inc. Voice detection optimization based on selected voice assistant service
US10950249B2 (en) 2018-09-25 2021-03-16 Amazon Technologies, Inc. Audio watermark encoding/decoding
US11170758B2 (en) 2018-09-27 2021-11-09 Rovi Guides, Inc. Systems and methods for providing notifications within a media asset without breaking immersion
US11100923B2 (en) 2018-09-28 2021-08-24 Sonos, Inc. Systems and methods for selective wake word detection using neural network models
KR102606789B1 (ko) 2018-10-01 2023-11-28 삼성전자주식회사 복수의 음성 인식 장치들을 제어하는 방법 및 그 방법을 지원하는 전자 장치
US10971158B1 (en) 2018-10-05 2021-04-06 Facebook, Inc. Designating assistants in multi-assistant environment based on identified wake word received from a user
US20200110571A1 (en) 2018-10-05 2020-04-09 Sonos, Inc. Systems and methods for media content selection
US10346122B1 (en) 2018-10-18 2019-07-09 Brent Foster Morgan Systems and methods for a supplemental display screen
US11899519B2 (en) 2018-10-23 2024-02-13 Sonos, Inc. Multiple stage network microphone device with reduced power consumption and processing load
US10943599B2 (en) 2018-10-26 2021-03-09 Spotify Ab Audio cancellation for voice recognition
US10388272B1 (en) 2018-12-04 2019-08-20 Sorenson Ip Holdings, Llc Training speech recognition systems using word sequences
US10573312B1 (en) 2018-12-04 2020-02-25 Sorenson Ip Holdings, Llc Transcription generation from multiple speech recognition systems
US11183183B2 (en) 2018-12-07 2021-11-23 Sonos, Inc. Systems and methods of operating media playback systems having multiple voice assistant services
US11132989B2 (en) 2018-12-13 2021-09-28 Sonos, Inc. Networked microphone devices, systems, and methods of localized arbitration
US10602268B1 (en) 2018-12-20 2020-03-24 Sonos, Inc. Optimization of network microphone devices using noise classification
KR102570384B1 (ko) 2018-12-27 2023-08-25 삼성전자주식회사 가전기기 및 이의 음성 인식 방법
US11198446B2 (en) 2019-01-04 2021-12-14 Faraday & Future Inc. On-board vehicle query system
JP2020112692A (ja) 2019-01-11 2020-07-27 パナソニック インテレクチュアル プロパティ コーポレーション オブ アメリカPanasonic Intellectual Property Corporation of America 方法、制御装置、及びプログラム
US11349834B2 (en) 2019-01-30 2022-05-31 Ncr Corporation Multi-factor secure operation authentication
US11315556B2 (en) 2019-02-08 2022-04-26 Sonos, Inc. Devices, systems, and methods for distributed voice processing by transmitting sound data associated with a wake word to an appropriate device for identification
US10867604B2 (en) 2019-02-08 2020-12-15 Sonos, Inc. Devices, systems, and methods for distributed voice processing
CN109712626B (zh) 2019-03-04 2021-04-30 腾讯科技(深圳)有限公司 一种语音数据处理方法及装置
US10943598B2 (en) 2019-03-18 2021-03-09 Rovi Guides, Inc. Method and apparatus for determining periods of excessive noise for receiving smart speaker voice commands
US10964314B2 (en) 2019-03-22 2021-03-30 Cirrus Logic, Inc. System and method for optimized noise reduction in the presence of speech distortion using adaptive microphone array
US10984783B2 (en) 2019-03-27 2021-04-20 Intel Corporation Spoken keyword detection based utterance-level wake on intent system
US20200310751A1 (en) 2019-03-29 2020-10-01 Qualcomm Incorporated System and method of managing device sound level
EP3726856B1 (en) 2019-04-17 2022-11-16 Oticon A/s A hearing device comprising a keyword detector and an own voice detector
US11120794B2 (en) * 2019-05-03 2021-09-14 Sonos, Inc. Voice assistant persistence across multiple network microphone devices
US10586540B1 (en) 2019-06-12 2020-03-10 Sonos, Inc. Network microphone device with command keyword conditioning
US11200894B2 (en) 2019-06-12 2021-12-14 Sonos, Inc. Network microphone device with command keyword eventing
US11361756B2 (en) 2019-06-12 2022-06-14 Sonos, Inc. Conditional wake word eventing based on environment
US20200409926A1 (en) 2019-06-28 2020-12-31 Rovi Guides, Inc. Automated contact creation based on content communications
US11138969B2 (en) 2019-07-31 2021-10-05 Sonos, Inc. Locally distributed keyword detection
US11138975B2 (en) 2019-07-31 2021-10-05 Sonos, Inc. Locally distributed keyword detection
US10871943B1 (en) 2019-07-31 2020-12-22 Sonos, Inc. Noise classification for event detection
US11159878B1 (en) 2019-08-15 2021-10-26 Amazon Technologies, Inc. Autonomously motile device with beamforming
JP7191793B2 (ja) 2019-08-30 2022-12-19 株式会社東芝 信号処理装置、信号処理方法、及びプログラム
US11172328B2 (en) 2019-09-27 2021-11-09 Sonos, Inc. Systems and methods for device localization
US11189286B2 (en) 2019-10-22 2021-11-30 Sonos, Inc. VAS toggle based on device orientation
KR20210066647A (ko) 2019-11-28 2021-06-07 삼성전자주식회사 전자 장치 및 이의 제어 방법
US20220301561A1 (en) 2019-12-10 2022-09-22 Rovi Guides, Inc. Systems and methods for local automated speech-to-text processing
US11823659B2 (en) 2019-12-11 2023-11-21 Amazon Technologies, Inc. Speech recognition through disambiguation feedback
US11445301B2 (en) 2020-02-12 2022-09-13 Sonos, Inc. Portable playback devices with network operation modes
CN111341306B (zh) 2020-02-14 2022-06-17 东南大学 基于语音特征复用的关键词唤醒cnn的存储和计算压缩方法
US11206052B1 (en) 2020-06-18 2021-12-21 HAJEN Co., Ltd Smart speaker
US20220050585A1 (en) 2020-08-14 2022-02-17 Apple Inc. Audio media playback user interface

Patent Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2016524193A (ja) 2013-06-27 2016-08-12 ロウルズ リミテッド ライアビリティ カンパニー 自己生成ウェイク表現の検出
US20180096678A1 (en) 2016-09-30 2018-04-05 Robert Bosch Gmbh System And Method For Speech Recognition
US20180277113A1 (en) 2017-03-27 2018-09-27 Sonos, Inc. Systems and Methods of Multiple Voice Services

Also Published As

Publication number Publication date
AU2019299865B2 (en) 2023-08-17
AU2023266275A1 (en) 2023-12-07
CN111247582A (zh) 2020-06-05
AU2019299865A1 (en) 2020-04-16
EP4099322B1 (en) 2024-03-27
EP4099322A1 (en) 2022-12-07
US20230410812A1 (en) 2023-12-21
KR20200037245A (ko) 2020-04-08
US20210343284A1 (en) 2021-11-04
US20200105256A1 (en) 2020-04-02
US11100923B2 (en) 2021-08-24
KR20230085214A (ko) 2023-06-13
KR102308525B1 (ko) 2021-10-05
JP7096353B2 (ja) 2022-07-05
JP2022126805A (ja) 2022-08-30
JP2021516790A (ja) 2021-07-08
US11790911B2 (en) 2023-10-17
KR102122312B1 (ko) 2020-06-12
EP3655948A1 (en) 2020-05-27
KR102541498B1 (ko) 2023-06-13
KR20210120138A (ko) 2021-10-06
KR20230145195A (ko) 2023-10-17
WO2020068909A1 (en) 2020-04-02
KR20200067941A (ko) 2020-06-12
EP3655948B1 (en) 2022-07-06
JP7397920B2 (ja) 2023-12-13

Similar Documents

Publication Publication Date Title
KR102581837B1 (ko) 뉴럴 네트워크 모델을 사용하여 선택적 활성 단어 검출을 위한 시스템 및 방법
US11899519B2 (en) Multiple stage network microphone device with reduced power consumption and processing load
US11538460B2 (en) Networked microphone devices, systems, and methods of localized arbitration
US11830495B2 (en) Networked devices, systems, and methods for intelligently deactivating wake-word engines
US20230317077A1 (en) Devices, systems, and methods for distributed voice processing
US11961519B2 (en) Localized wakeword verification
CA3067776A1 (en) Systems and methods for selective wake word detection using neural network models
WO2022246463A1 (en) Systems and methods for acoustic echo cancellation for audio playback devices

Legal Events

Date Code Title Description
A107 Divisional application of patent
E701 Decision to grant or registration of patent right
GRNT Written decision to grant