KR20200035118A

KR20200035118A - 활성 단어 검출 억제

Info

Publication number: KR20200035118A
Application number: KR1020207006519A
Authority: KR
Inventors: 조나단 랑
Original assignee: 소노스 인코포레이티드
Priority date: 2017-08-07
Filing date: 2018-08-06
Publication date: 2020-04-01
Also published as: WO2019032462A1; CA3072492C; EP3665562B1; US20190043492A1; US20230021785A1; EP4040285A1; JP2020530585A; US20200075010A1; AU2018312989A1; US11900937B2; US11380322B2; JP6963673B2; CN111194439B; EP3665562A1; CA3140979C; CN111194439A; AU2023203687A1; CN116954545A; US10475449B2; AU2018312989B2

Abstract

예시적인 기법이 NMD의 방향을 결정하는 것을 수반한다. 예시적인 구현예는 재생 장치에 의한 재생을 위한 오디오 컨텐츠를 나타내는 데이터를 수신하는 재생 장치를 포함한다. 재생 장치에 의해 오디오 컨텐츠가 재생되기 전에, 재생 장치는 오디오 컨텐츠에서 하나 이상의 음성 서비스에 대한 하나 이상의 활성 단어를 검출한다. 재생 장치는 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 하고, 하나 이상의 스피커를 통하여 오디오 컨텐츠를 재생한다. 인에이블 되는 경우, 특정 활성 단어에 대한 소정의 네트워킹된 마이크로폰 장치의 활성 응답은 소정의 네트워킹된 마이크로폰 장치로 하여금 마이크로폰을 통하여 특정 활성 단어에 후속하는 음성 명령을 듣도록 한다.

Description

활성 단어 검출 억제

본 개시는 소비재, 특히, 미디어 재생 또는 그 일부 양상에 관한 방법, 시스템, 제품, 특징, 서비스 및 기타 요소에 관련된다.

2003년 소노스 사(SONOS, Inc.)가 그 최초 특허 출원 중 하나인 "다수의 네트워킹된 장치들 사이의 오디오 재생을 동기화하기 위한 방법(Method for Synchronizing Audio Playback between Multiple Networked Devices)"을 출원하고 2005년 미디어 재생 시스템을 판매 제공하기 시작하기까지 소리를 내는 환경(out-loud setting)에서 디지털 오디오를 액세스하고 듣기 위한 옵션은 제한적이었다. 소노스 무선 하이파이 시스템(Sonos Wireless HiFi System)은 사람들로 하여금 하나 이상의 네트워킹된 재생 장치를 통하여 많은 소스로부터 음악을 경험하는 것을 가능하게 한다. 스마트폰, 태블릿 또는 컴퓨터 상에 설치된 소프트웨어 제어 애플리케이션을 통하여, 네트워킹된 재생 장치를 가지는 임의의 공간에서 원하는 것을 재생할 수 있다. 또한, 컨트롤러를 사용하여, 예컨대 다양한 노래가 재생 장치를 가지는 각각의 공간에서 스트리밍될 수 있거나, 공간이 동기 재생을 위해 함께 그룹화될 수 있거나, 같은 노래가 모든 공간에서 동시에 들릴 수 있다.

계속 성장하는 디지털 미디어에 대한 관심을 고려하여 볼 때, 청취 경험을 더 향상시키기 위해 소비자 접근 가능 기술을 개발할 필요가 계속 있다.

여기에 개시된 기술의 특징, 태양 및 이점은 이하의 설명, 첨부된 청구범위 및 첨부 도면과 관련하여 더 잘 이해될 수 있다.
도 1은 일부 실시예가 실시될 수 있는 예시적인 미디어 재생 시스템 구성을 도시한다.
도 2는 예시적인 재생 장치의 기능적 블록도를 도시한다.
도 3은 예시적인 컨트롤 장치의 기능적 블록도를 도시한다.
도 4는 예시적인 컨트롤러 인터페이스를 도시한다.
도 5는 예시적인 프로세싱 시스템을 도시한다.
도 6은 여기에서 설명되는 양상에 따른 예시적인 복수의 네트워크 장치를 도시한다.
도 7은 여기에서 설명되는 양상에 따른 예시적인 네트워크 마이크로폰 장치의 기능적 블록도를 도시한다.
도 8은 하나 이상의 NMD의 활성 반응을 디세이블(disable)하기 위한 예시적인 흐름도를 도시한다.
도 9는 NMD로 하여금 활성단어를 무시하도록 하는 예시적인 메시지를 도시한다.
도 10(a) 내지 도 10(d)는 NMD로 하여금 활성 단어를 무시하도록 하는 예시적인 명령어를 예시한다.
도 11는 하나 이상의 NMD의 활성 응답을 디세이블하기 위한 예시적인 흐름도를 도시한다.
도 12는 하나 이상의 NMD의 활성 반응을 디세이블하기 위한 예시적인 흐름도를 도시한다.
도 13은 활성 응답을 억제하기 위한 예시적인 흐름도를 도시한다.
도면은 예시적인 실시예를 예시하기 위한 것이나, 도면에 도시된 배열 및 수단에 발명이 제한되지 않음이 이해될 것이다.

본 출원은 그 전체가 여기에서 참조로서 포함된 2018년 9월 28일에 출원된 미국 특허 출원 제15/670,361호에 대한 우선권을 주장한다.

I. 개요

네트워킹된 마이크로폰 장치(NMD)는 음성 컨트롤을 사용하여 집(household)을 컨트롤하도록 사용될 수 있다. NMD는 마이크로폰을 통해, 음성 입력을 수신할 수 있는, 예를 들어, SONOS® 재생 장치, 서버 또는 시스템이거나 그 일부일 수 있다. 일부 예시에서, 재생 장치는 SONOS®재생 장치이다. 추가적으로, NMD는 마이크로폰을 통해, 음성 입력을 수신할 수 있는 다른 장치, 서버 또는 시스템(예컨대, 다른 예시 중에서도 AMAZON®, ECHO®, APPLE®, IPHONE®)이거나 그 일부일 수 있다. 2017년 2월 21에 출원되고 제목이 "미디어 재생 시스템의 음성 제어(Voice Control of a Media Playback System)"인 미국 출원 제15/438,749호는 그 전체가 참조로서 여기에 포함되며, 음성-인에이블된 집 건축의 예시를 제공한다. 음성 컨트롤은 재생 장치, 무선 조명 장치, 온도 조절기, 도어락, 가정 자동화 및 다른 예시와 같이 "스마트" 홈이 있는 다양한 장치에 대하여 유익할 수 있다.

일부 구현예에서, NMD에 의해 검출된 음성 입력은 프로세싱을 위해 음성 서비스로 송신된다. 재생 장치와 함께 NMD는 음성 서비스에 대한 마이크로폰/스피커 인터페이스로서 동작할 수 있다. 음성 입력은 NMD의 마이크로폰에 의해 검출되고, 이후 프로세싱을 위해 특정한 음성 서비스로 전송된다. 음성 서비스는 이후, 명령 또는 음성 입력의 다른 결과를 반환할 수 있다.

활성 단어의 발화는 음성 서비스를 작동시킬 수 있다. 예를 들어 AMAZON® 음성 서비스를 쿼리함에서, 사용자는 활성 단어 "Alexa"에 후속하여 음성 입력을 말할 수 있다. 다른 예시는 GOOGLE® 음성 서비스를 쿼리하기 위한 "Ok, Google" 및 APPLE® 음성 서비스를 쿼리하기 위한 "Hey, Siri"를 포함한다. 활성 단어와 음성 서비스의 다른 예시가 존재한다. 활성 단어를 검출하면, NMD는 마이크로폰을 통해, 활성 단어에 후속하는 음성 명령을 들음으로써 응답할 수 있다. 이러한 응답은 여기에서 NMD의 "활성 응답"으로 지칭된다.

일부 상황에서, 활성 단어를 포함하는 오디오 컨텐츠의 재생은 NMD의 활성 응답을 잘못 트리거할 수 있다. 많은 음성 서비스에 대한 활성 단어는 기존 언어의 어휘로부터 선택된 기 존재하는 단어이다. 예를 들어, 여러 대중적인 음성 서비스는 소정의 이름(예컨대, "Alexa" 및 "Siri")을 활성 단어로서 사용한다. 따라서, 일부 상황에서, 다른 것들 중에서도 토크쇼, 영화, 텔레비전 쇼, 팟캐스트, 인터넷 스트리밍 비디오와 같은 녹음된 오디오 컨텐츠는 활성 단어 또는 그와 유사한 것을 포함할 수 있다. NMD의 범위에서의 그러한 오디오 컨텐츠의 재생은 NMD를 잘못 트리거할 수 있고, 이는 오디오 컨텐츠의 즐거움을 방해할 수 있다는 점을 포함하는 많은 이유로 바람직하지 않을 수 있다.

예를 들어, 텔레비전은 소정의 음성 서비스에 대한 광고를 재생할 수 있다. 광고 동안, 배우는 예컨대 어떻게 음성 서비스가 작동하는지를 보여주기 위해 음성 서비스에 대한 활성 단어를 말할 수 있다. 텔레비전과 동일한 공간 내 NMD는 텔레비전으로부터의 오디오 출력을 검출할 수 있고, NMD가 광고에서 활성 단어를 검출하는 경우, 음성 서비스를 작동시킬 수 있다. 이는 바람직하지 않을 수 있다. 또한, 광고가 많은 텔레비전 상에서 동시에 재생될 수 있기 때문에, 광고는 같은 시간에 많은 NMD를 트리거할 수 있으며, 이는 음성 서비스로의 요청에서 요구되지 않는 급증을 야기할 수 있다.

그 광고들이 잘못 트리거하는 것을 피하기 위해, 음성 서비스의 오퍼레이터(operator)는 활성 단어를 포함하는 그 광고의 부분을 마크할 수 있고 이러한 마크된 부분을 무시하도록 그들의 NMD를 프로그래밍할 수 있다. 예를 들어, 오퍼레이터는 음성 서비스에 대한 광고에 톤(tone) 또는 다른 오디오 마커를 혼합할 수 있고, 이러한 오디오 마커와 함께 검출되는 활성 단어를 무시하도록 그들의 NMD를 프로그래밍할 수 있다. 이러한 구현은 음성 서비스의 오퍼레이터가 오디오 컨텐츠로 이러한 마커를 임베딩할 수 있는 음성 서비스에 대한 광고와 같이 제한된 경우에서 유용할 수 있다. 그러나, 이러한 구현은 음성 서비스의 오퍼레이터가 컨트롤하지 않는, 대부분의 기타 오디오 컨텐츠에 대해서 유용하지 않다.

여기서 설명된 예시적인 기법은 오디오 컨텐츠가 재생 장치에 의해 들을 수 있게 재생되기 전에, 재생 장치에 의해 재생될 오디오 컨텐츠를 프로세싱하는 것, 오디오 컨텐츠가 하나 이상의 활성 단어를 포함하는지 여부를 결정하는 것 및 재생 장치에 의해 재생되는 경우, 활성 단어를 무시하도록 하나 이상의 NMD에 통지하는 것을 포함할 수 있다. 이러한 방식에서, 기법은 NMD의 잘못된 트리거를 방지하는 데 도움을 줄 수 있다. 특히, 그러한 기법은 재생 장치에 의해 재생될 임의의 녹음된 오디오 컨텐츠에 적용 가능할 수 있다.

예를 들어, 재생 장치는 재생을 위한 오디오 컨텐츠를 수신할 수 있다. 오디오 컨텐츠를 재생하기 전에, 재생 장치는 오디오 컨텐츠를 메모리(예컨대, 버퍼)에 저장하고, 오디오 컨텐츠 상에서 활성 단어 검출 알고리즘을 동작한다. 임의의 활성 단어가 오디오 컨텐츠에서 검출되는 경우, 재생 장치(NMD 자체일 수 있음)는 하나 이상의 NMD로 하여금, 재생 장치가 결국 오디오 컨텐츠를 재생할 때, 이러한 활성 단어를 무시하도록 한다.

다른 예시로서, NMD는 재생 장치에 의한 재생을 위해 지정된 오디오 컨텐츠를 수신할 수 있다. 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, NMD는 오디오 컨텐츠 상의 활성 단어 검출 알고리즘을 실행할 수 있다. 임의의 활성 단어가 오디오 컨텐츠에서 검출되는 경우, NMD는 그 자신(및 아마 부근에 있는 다른 NMD)이 그들이 결국 재생 장치에 의해 재생되는 경우 이러한 활성 단어를 무시하도록 한다.

NMD는 다양한 기법 중 임의의 것을 사용하여 활성 단어를 무시할 수 있다. 일부 예시에서, NMD는 가능하다면 다른 예시 중에서도, 활성 단어를 듣는 것을 멈추도록 NMD에 지시하거나, 기간동안 NMD의 마이크로폰 어레이를 디세이블하거나, 또는 재생 장치의 방향에 청취 무효(listening NULL)를 생성함으로써, 재생 장치에 의해 재생되는 동안 활성 단어를 검출하지 않도록 명령될 수 있다. 대안적으로, NMD는 처음에 활성 단어를 검출하도록 진행될 수 있지만, 예컨대 어떠한 기간 동안 활성 단어를 무시하거나 또는 어떠한 기간 동안 모든 녹음된 오디오를 무시함으로써 활성 단어를 검출하는 것에 응답하여 음성 서비스를 작동하기 위한 그 프로그래밍된 활성 응답을 억제하도록 지시될 수 있다.

재생 장치가 오디오 컨텐츠를 들리도록 재생하기 전에 오디오 컨텐츠를 프로세싱하는 경우, (재생 장치 또는 NMD와 같은) 프로세싱 장치는 녹음된 오디오 컨텐츠의 어떤 섹션이 활성 단어를 포함하는지를 결정할 수 있다. 이러한 섹션은 활성 단어에 대한 시작과 중단 시각(예컨대, 33:52.543에서 시작하고 33:54.013에서 종료하는 팟캐스트에서의 활성 단어)과 같은 오디오 컨텐츠 내의 기간에 의해 정의될 수 있다. 오디오 컨텐츠가 재생되는 경우, 부근에 있는 NMD는 이러한 기간동안 활성 단어를 무시하도록 지시될 수 있다.

다른 예시로서, 프로세싱 장치는 오디오 컨텐츠(또는 오디오 컨텐츠의 부분)에서 활성 단어의 수를 카운트할 수 있다. 예를 들어, 광고의 오디오 컨텐츠를 프로세싱을 하는 재생 장치는 그 광고에서 활성 단어의 네 개의 인스턴스를 검출할 수 있다. 이후, 재생 장치는 재생 장치의 부근에 있는 NMD에, 카운트와 동일한 수의 활성 단어를 검출할 때까지 활성 단어를 무시하도록(예컨대, 다음 네가지 활성 단어를 무시하도록) 지시할 수 있다.

다른 예시에서, 프로세싱 장치는 녹음된 오디오 컨텐츠에 오디오 톤 또는 다른 마커를 동적으로 삽입하여 오디오 컨텐츠에서 검출된 활성 단어를 지정할 수 있다. 이후, 오디오 컨텐츠가 재생 장치에 의해 재생되는 경우, 활성 단어와 함께 오디오 마커를 검출하는 NMD는 활성 단어의 그 인스턴스를 무시하도록 지시받을 수 있다. 재생 장치의 가청 범위에 있는 복수의 NMD는 활성 단어를 각각 검출할 수 있고 연관된 오디오 마커를 검출하는 것에 응답하여 활성 단어를 무시할 수 있다.

예시적인 기법은 하나 이상의 NMD의 활성 응답을 디세이블하는 것을 수반할 수 있다. 제1 구현예는 네트워크 인터페이스를 통하여, 재생 장치에 의한 재생을 위한 오디오 컨텐츠를 나타내는 데이터를 수신하는 것과 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, 오디오 컨텐츠에서 하나 이상의 음성 서비스에 대한 하나 이상의 활성 단어를 검출하는 것을 포함할 수 있다. 제1 구현예는 또한 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블 하는 것을 포함할 수 있고, 인에이블되는 경우, 특정 활성 단어에 대한 소정의 네트워킹된 마이크로폰 장치의 활성 응답은 소정의 네트워킹된 마이크로폰 장치로 하여금 마이크로폰을 통해, 특정 활성 단어에 후속하는 음성 명령을 듣도록 한다. 제1 구현예는 하나 이상의 스피커를 통하여 오디오 컨텐츠를 재생하는 것을 더 포함할 수 있다.

제2 구현예는 네트워크 인터페이스를 통하여, 재생 장치에 의한 재생을 위한 오디오 컨텐츠를 나타내는 데이터를 수신하는 것을 포함할 수 있다. 제2 구현예는 또한 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, 오디오 컨텐츠에서, 하나 이상의 음성 서비스에 대한 하나 이상의 활성 단어를 검출하는 것을 포함할 수 있다. 제2 구현예는 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 검출된 하나 이상의 활성 단어에 대한 네트워킹된 마이크로폰 장치의 활성 응답을 디세이블하는 것과 재생 장치가 오디오 컨텐츠를 재생하는 한편, 마이크로폰을 통하여 재생되는 오디오 컨텐츠를 검출하는 것을 더 포함할 수 있다.

제3 구현예는 컴퓨팅 시스템의 인터페이스를 통하여, 하나 이상의 재생 장치에 의한 재생을 위한 오디오 컨텐츠를 수신하는 것을 포함할 수 있다. 제3 구현예는 또한 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, 오디오 컨텐츠에서, 하나 이상의 음성 서비스에 대한 하나 이상의 활성 단어를 검출하는 것을 포함할 수 있다. 제3 구현예는 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 것을 더 포함할 수 있다.

제4 구현예는 네트워크 인터페이스를 통하여, 하나 이상의 활성 단어에 대한 네트워킹된 마이크로폰 장치의 활성 응답을 디세이블하기 위한 명령어를 수신하는 것을 포함할 수 있다. 제4 구현예는 또한 마이크로폰을 통해, 하나 이상의 재생 장치에 의해 재생되는 오디오 컨텐츠를 검출하는 것을 포함할 수 있다. 제4 구현예는 검출된 오디오 컨텐츠가 하나 이상의 활성 단어를 포함한다고 결정하는 것과 수신된 명령어에 응답하여, 검출된 오디오 컨텐츠에서 하나 이상의 활성 단어에 대한 네트워킹된 마이크로폰 장치의 활성 응답을 디세이블하는 것을 더 포함할 수 있다.

이러한 예시적인 구현예 각각은 다른 예시 중에서도, 방법, 구현예를 수행하도록 구성되는 장치, 구현예를 수행하도록 구성되는 장치의 시스템 또는 구현예를 수행하도록 하나 이상의 프로세서에 의해 실행 가능한 명령어를 포함하는 유형의 비일시적인 컴퓨터 판독 가능 기록매체로서 실시될 수 있다. 본 개시는 여기에 설명되는 예시적인 특징의 조합을 포함하는 많은 다른 실시예를 포함한다는 것이 당업자에 의해 이해될 것이다. 또한, 기법을 예시하기 위한 소정의 장치에 의해 수행되는 것으로 설명되는 임의의 예시적인 동작은 여기에 설명된 장치를 포함하는 임의의 적절한 장치에 의해 수행될 수 있다. 또한, 임의의 장치는 다른 장치로 하여금 여기에 설명된 임의의 동작을 수행하도록 할 수 있다.

여기에서 설명되는 일부 예시가 "사용자" 및/또는 다른 엔티티(entity)와 같은 소정의 행위자에 의해 수행되는 기능을 참조할 수 있으나, 이러한 설명은 단지 설명을 위한 것임이 이해되어야 한다. 청구범위는 청구범위 자체의 언어에 의하여 명시적으로 요구되지 않는다면 임의의 그러한 예시적인 행위자에 의한 행위를 요구하는 것으로 해석되어서는 안된다.

II. 예시적인 동작 환경

도 1은 여기에서 개시되는 하나 이상의 실시예가 실시되거나 구현될 미디어 재생 시스템(100)의 예시적인 조합을 예시한다. 도시된 바와 같이, 미디어 재생 시스템(100)은 예를 들어, 주 침실, 사무실, 식당 및 거실과 같은 여러 공간과 장소를 가지는 예시적인 가정 환경과 연관되어 있다. 도 1의 예시에서 도시된 바와 같이, 미디어 재생 시스템(100)은 재생 장치(102, 104, 108, 110, 112, 114, 116, 118, 120, 122 및 124), 컨트롤 장치(126 및 128) 및 유선 또는 무선 네트워크 라우터(130)를 포함한다. 또한 도 1에 있는 것은 NMD(132 및 134)이다.

예시적인 미디어 재생 시스템(100)의 다양한 컴포넌트와 관련 있는 추가 논의 및 다양한 컴포넌트가 어떻게 미디어 경험을 사용자에게 제공하도록 상호작용할 수 있는지는 다음의 섹션에서 발견될 수 있다. 여기에서 논의가 일반적으로 예시적인 미디어 재생 시스템(100)을 나타내는 한편, 여기서 설명되는 기술은 그 중에서도 도 1에 도시된 바와 같이 집 환경 내에서의 응용에 제한되는 것이 아니다. 예를 들어, 여기서 설명된 기술은 예를 들어, 레스토랑, 몰 또는 공항과 같은 상업적 환경, 스포츠형 다목적 차량(SUV), 버스 또는 자동차, 선박 또는 배, 비행기 등과 같은 운송 수단과 같은 멀티-구역 오디오가 요구될 수 있는 환경에서 유용할 수 있다.

a. 예시적인 재생 장치

도 2는 도 1의 미디어 재생 시스템(100)의 재생 장치(102-124) 중 하나 이상으로 구성될 수 있는 예시적인 재생 장치(200)의 기능적 블록도를 도시한다. 재생 장치(200)는 프로세서(202), 소프트웨어 컴포넌트(204), 메모리(206), 오디오 프로세싱 컴포넌트(208), 오디오 증폭기(210), 스피커(212) 및 무선 인터페이스(216)와 유선 인터페이스(218)을 포함하는 네트워크 인터페이스(214)를 포함할 수 잇다. 일 예시에서, 재생 장치(200)는 스피커(212)를 포함하지 않을 수 있지만, 외부 스피커로 재생 장치(200)를 연결하기 위한 스피커 인터페이스를 포함할 수 있다. 다른 경우에서, 재생 장치(200)는 스피커(212)와 오디오 증폭기(210) 모두를 포함하지 않을 수 있지만, 외부 오디오 증폭기 또는 오디오 영상 수신기로 재생 장치를 연결하기 위한 오디오 인터페이스를 포함할 수 있다.

일 예시에서, 프로세서(202)는 메모리(206)에 저장된 명령어에 따라 입력 데이터를 프로세싱하도록 구성되는 클락 구동(clock-driven) 컴퓨팅 컴포넌트일 수 있다. 메모리(206)는 프로세서(202)에 의해 실행 가능한 명령어를 저장하도록 구성되는 유형의 컴퓨터 판독 가능 기록매체일 수 있다. 예를 들어, 메모리(206)는 일부 기능을 달성하기 위해 프로세서(202)에 의해 실행 가능한 소프트웨어 컴포넌트(204) 중 하나 이상으로 로딩될 수 있는 데이터 저장소일 수 있다. 일 예시에서, 기능은 재생 장치(200)가 다른 재생 장치 또는 오디오 소스로부터 오디오 데이터를 검색하는 것을 수반할 수 있다. 다른 예시에서, 기능은 재생 장치(200)가 오디오 데이터를 다른 장치 또는 네트워크 상의 재생 장치로 송신하는 것을 수반할 수 있다. 또 다른 예시에서, 기능은 재생 장치(200)가 하나 이상의 재생 장치와 페어링하여 멀티 채널 오디오 환경을 생성하는 것을 수반할 수 있다.

일부 기능은 재생 장치(200)가 오디오 컨텐츠의 재생을 하나 이상의 다른 재생 장치와 동기화하는 것을 포함할 수 있다. 동기화 재생하는 동안, 청취자는 바람직하게는, 재생 장치(200)과 하나 이상의 다른 재생 장치에 의한 오디오 컨텐츠의 재생 간의 시간 지연 차이를 감지할 수 없을 것이다. 제목이 "복수의 독립적으로 클락(clock)되는 디지털 데이터 처리 장치 사이에서 동작을 동기화하기 위한 시스템 및 방법(System and method for synchronizing operations among a plurality of independently clocked digital data processing devices)"인 미국 특허 제8,234,395호는 전체 내용이 여기에 참조로서 포함되며 재생 장치 중에서 오디오 재생 동기화에 대한 더 상세한 일부 예시를 제공한다.

메모리(206)는 재생 장치(200)가 그 일부인 하나 이상의 구역 및/또는 구역 그룹, 재생 장치(200)에 의해 접근 가능한 오디오 소스 또는 재생 장치(또는 다른 재생 장치)가 연관될 수 있는 재생 큐와 같은 재생 장치(200)와 연관된 데이터를 저장하도록 더 구성될 수 있다.데이터는 재생 장치(200)의 상태를 설명하도록 정기적으로 업데이트되고 사용되는 하나 이상의 상태 변수로서 저장될 수 있다. 메모리(206)는 또한 미디어 시스템의 다른 장치의 상태와 연관되고 장치 중 하나 이상이 시스템과 연관된 최신 데이터를 가지도록 장치 중에서 가끔 공유되는 데이터를 포함할 수 있다. 다른 실시예 또한 가능하다.

오디오 프로세싱 컴포넌트(208)는 하나 이상의 디지털-아날로그 변환기("DAC"), 오디오 전프로세싱 컴포넌트, 오디오 향상 컴포넌트, 디지털 신호 프로세서("DSP") 등을 포함할 수 있다. 일 실시예에서, 오디오 프로세싱 컴포넌트(208) 중 하나 이상은 프로세서(202)의 서브 컴포넌트일 수 있다. 일 예시에서, 오디오 컨텐츠는 오디오 프로세싱 컴포넌트(208)에 의해 프로세싱되고/거나 의도적으로 수정되어, 오디오 신호를 생산할 수 있다. 생산된 오디오 신호는 이후 스피커(212)를 통하여 증폭 및 재생을 위해 오디오 증폭기(210)로 제공될 수 있다. 특히, 오디오 증폭기(210)는 오디오 신호를, 스피커(212) 중 하나 이상을 구동하기 위한 레벨로 증폭하도록 구성된 장치를 포함할 수 있다. 스피커(212)는 개별의 변환기(transducer)(예컨대, "드라이버") 또는 하나 이상의 드라이버가 있는 엔클로저를 수반하는 완전한 스피커 시스템을 포함할 수 있다. 스피커(212)의 특정 드라이버는 예를 들면, (예컨대, 저주파수를 위한) 서브 우퍼, (예컨대, 중간 주파수를 위한) 중간 범위의 드라이버 및/또는 (예컨대, 고주파를 위한) 트위터를 포함할 수 있다. 일부 경우에서, 하나 이상의 스피커(212)에 있는 각 변환기는 오디오 증폭기(210)의 개별 대응 오디오 증폭기에 의해 구동될 수 있다. 재생 장치(200)에 의한 재생을 위한 아날로그 신호를 생성하는 것에 더하여, 오디오 프로세싱 컴포넌트(208)는 재생을 위해 하나 이상의 다른 재생 장치로 전송될 오디오 컨텐츠를 프로세싱하도록 구성될 수 있다.

재생 장치(200)에 의해 프로세싱되고/거나 재생될 오디오 컨텐츠는 오디오 라인 인(line in) 입력 연결(예컨대, 자동 검출 3.5mm 오디오 라인 인 연결) 또는 네트워크 인터페이스(214)를 통하는 것과 같이, 외부 소스로부터 수신될 수 있다.

네트워크 인터페이스(214)는 재생 장치(200)와 데이터 네트워크 상의 하나 이상의 다른 장치 간의 데이터 흐름을 용이하게 하도록 구성될 수 있다. 이와 같이, 재생 장치(200)는 재생 장치(200), 근거리 네트워크 내의 네트워크 장치 또는 인터넷과 같은 광역 네트워크 상에서 오디오 컨텐츠 소스와 통신하는 하나 이상의 다른 재생 장치로부터 데이터 네트워크에서 오디오 컨텐츠를 수신하도록 구성될 수 있다. 일 예시에서, 재생 장치(200)에 의해 전송되고 수신되는 오디오 컨텐츠 및 다른 신호는 인터넷 프로토콜(Internet Protocol)(IP) 기반 소스 주소 및 IP 기반 목적지 주소를 포함하는 디지털 패킷 데이터(digital packet data)의 형태로 전송될 수 있다. 그러한 경우, 네트워크 인터페이스(214)는 재생 장치(200)로 향하는 데이터가 재생 장치(200)에 의해 적절히 수신되고 프로세싱되도록 디지털 패킷 데이터를 파싱(parsing)하도록 구성될 수 있다.

도시된 바와 같이, 네트워크 인터페이스(214)는 무선 인터페이스(216) 및 유선 인터페이스(218)를 포함할 수 있다. 무선 인터페이스(216)는 재생 장치(200)가 통신 프로토콜(예컨대, IEEE 802.11a, 802.11b, 802.11g, 802.11n, 802.11ac, 802.15, 4G 모바일 통신 표준 등을 포함하는 임의의 무선 표준)에 따라 다른 장치(예컨대, 다른 재생 장치, 스피커, 수신기, 네트워크 장치, 재생 장치(200)가 연관된 데이터 네트워크 내의 컨트롤러 장치)와 무선으로 통신하도록 네트워크 인터페이스 기능을 제공할 수 있다. 유선 인터페이스(218)는 재생 장치(200)가 통신 프로토콜(예컨대, IEEE 802.3)에 따라 다른 장치와 유선 연결 통신하도록 네트워크 인터페이스 기능을 제공할 수 있다. 도 2에 도시되는 네트워크 인터페이스(214)가 무선 인터페이스(216) 및 유선 인터페이스(218) 둘 다를 포함하는 한편, 네트워크 인터페이스(214)는 일부 실시예에서 무선 인터페이스만을 또는 유선 인터페이스만을 포함할 수 있다.

일 예시에서, 재생 장치(200) 및 하나의 다른 재생 장치는 오디오 컨텐츠의 두 개의 독립된 오디오 컴포넌트를 재생하도록 페어링될 수 있다. 예를 들어, 재생 장치(200)가 왼쪽 채널 오디오 컴포넌트를 재생하도록 구성될 수 있는 한편, 다른 재생 장치는 오른쪽 채널 오디오 컴포넌트를 재생하도록 구성될 수 있고, 이로써 오디오 컨텐츠의 스테레오 효과를 생산 또는 향상할 수 있다. 페어링된 재생 장치(또한 "결합된 장치"로서 지칭됨)는 다른 재생 장치와 서로 동기로 오디오 컨텐츠를 더 재생할 수 있다.

다른 예시에서, 재생 장치(200)는 하나 이상의 다른 재생 장치와 음향적으로 통합되어 단일의, 통합된 재생 장치를 형성할 수 있다. 통합된 재생 장치가 오디오 컨텐츠가 렌더링 될 수 있는 추가적인 스피커 드라이버를 가질 수 있기 때문에, 통합된 재생 장치는 통합되지 않은 재생 장치 또는 페어링된 재생 장치와 상이하게 사운드를 프로세싱 및 재생산하도록 구성될 수 있다. 예를 들어, 재생 장치(200)가 저주파수 범위의 오디오 컨텐츠를 렌더링하도록 설계된 재생 장치(즉, 서브 우퍼)인 경우, 재생 장치(200)는 모든 주파수 범위의 오디오 컨텐츠를 렌더링하도록 설계된 재생 장치와 통합될 수 있다. 이러한 경우에서, 모든 주파수 범위의 재생 장치가, 저주파수 재생 장치(200)와 통합된 경우, 오직 오디오 컨텐츠의 중간 내지 고주파수 컴포넌트를 렌더링하도록 구성되는 한편, 저주파수 범위의 재생 장치(200)는 오디오 컨텐츠의 저주파수 컴포넌트를 렌더링할 수 있다. 통합된 재생 장치는 단일 재생 장치 또는 또 다른 통합된 재생 장치와 더 페어링될 수 있다.

예를 들어, 소노스 사(SONONS, Inc.)는 일부 재생 장치를 현재 판매하며 (또는 판매해왔고), 이는 "PLAY:1", "PLAY:3", "PLAY:5", "PLAYBAR", "CONNECT:AMP", "CONNECT" 및 "SUB"를 포함한다. 임의의 다른 과거, 현재 및/또는 미래의 재생 장치가 추가적으로 또는 대안적으로 여기에 개시되는 예시적인 실시예의 재생 장치를 구현하도록 사용될 수 있다. 또한, 재생 장치가 도 2에서 예시되는 예시 또는 소노스 제품 제안에 제한되지 않음이 이해된다. 예를 들어, 재생 장치는 유선 또는 무선 헤드폰을 포함할 수 있다. 다른 예시에서, 재생 장치는 개인 모바일 미디어 재생 장치를 위한 도킹 스테이션(docking station)을 포함하거나 이와 상호작용할 수 있다. 또 다른 예시에서, 재생 장치는 텔레비전, 조명 기구, 또는 내부 또는 외부 용도를 위한 일부 다른 장치와 같은 다른 장치 또는 컴포넌트에 통합될 수 있다.

b. 예시적인 재생 구역 구성

도 1의 미디어 재생 시스템(100)을 다시 참조하면, 환경은 각각 하나 이상의 재생 장치가 있는 하나 이상의 재생 구역을 가질 수 있다. 미디어 재생 시스템(100)은 하나 이상의 재생 구역으로 규정될 수 있고, 이후 하나 이상의 구역이 추가되거나 제거되어 도 1에서 도시된 예시적인 배치에 도달할 수 있다. 각각의 구역은 사무실, 화장실, 주침실, 침실, 주방, 식당, 거실 및/또는 발코니와 같은 상이한 공간과 장소에 따라 이름이 주어질 수 있다. 일 예시에서, 단일 재생 구역은 복수의 공간 또는 장소를 포함할 수 있다. 다른 경우에서, 단일 공간 또는 장소는 복수의 재생 구역을 포함할 수 있다.

도 1에 도시된 바와 같이, 발코니, 식당, 주방, 화장실, 사무실 및 침실 구역은 각각 하나의 재생 장치를 가지는 한편, 거실 및 주침실 구역은 복수의 재생 장치를 가진다. 거실 구역에서, 재생 장치(104, 106, 108 및 110)는 개별의 재생 장치로서, 하나 이상의 결합된 재생 장치로서, 하나 이상의 통합된 재생 장치로서 또는 이들의 임의의 조합으로서 동기로 오디오 컨텐츠를 재생하도록 구성될 수 있다. 유사하게, 주침실의 경우에서, 재생 장치(122 및 124)는 개별 재생 장치로서, 결합된 재생 장치로서 또는 통합된 재생 장치로서 동기로 오디오 컨텐츠를 재생하도록 구성될 수 있다.

일 예시에서, 도 1의 환경에서 하나 이상의 재생 구역은 각각 상이한 오디오 컨텐츠를 재생할 수 있다. 예를 들어, 사용자는 발코니 구역에서 그릴에 굽고 재생 장치(102)에 의해 재생되는 힙합 음악을 들을 수 있는 한편, 다른 사용자는 주방 구역에서 음식을 준비하고 재생 장치(114)에 의해 재생되는 클래식 음악을 들을 수 있다. 다른 예시에서, 재생 구역은 다른 재생 구역과 동기화로 동일한 오디오 컨텐츠를 재생할 수 있다. 예를 들어, 사용자는 재생 장치(118)가 발코니 구역에 있는 재생 장치(102)에 의해 재생하고 있는 동일한 락 음악을 재생하고 있는 사무실 구역에 있을 수 있다. 그러한 경우에, 재생 장치(102 및 118)는 사용자가 다른 재생 구역 사이를 이동하면서 소리 내어 재생되고 있는 오디오 컨텐츠를 끊김 없이 (또는 적어도 실질적으로 끊김 없이) 즐길 수 있도록 동기화로 락 음악을 재생할 수 있다. 재생 구역 사이의 동기화는 이전에 참조된 미국 특허 제 8,234,395호에서 설명되는 바와 같이, 재생 장치 중의 동기화와 비슷한 방식으로 달성될 수 있다.

위에서 제안되는 바와 같이, 미디어 재생 시스템(100)의 구역 구성은 동적으로 수정될 수 있고, 일부 실시예에서, 미디어 재생 시스템(100)은 다수의 구성을 지원한다. 예를 들어, 사용자가 하나 이상의 재생 장치를 구역으로부터 또는 구역으로 물리적으로 이동하는 경우, 미디어 재생 시스템(100)은 변화를 수용하도록 재구성될 수 있다. 예를 들어, 사용자가 재생 장치(102)를 발코니 구역으로부터 사무실 구역으로 물리적으로 이동하는 경우, 사무실 구역은 재생 장치(118 및 102) 둘 다를 포함할 수 있다. 재생 장치(102)는 컨트롤 장치(126 및 128)과 같은 컨트롤 장치를 통하여 원하는 경우, 재명칭되고/거나 사무실 구역과 페어링되거나 그룹화할 수 있다. 한편, 하나 이상의 재생 장치가 이미 재생 구역이 아닌 집 환경에서 특정 구역으로 이동되는 경우, 특정 구역에 대한 새로운 재생 구역이 생성될 수 있다.

또한, 미디어 재생 시스템(100)의 상이한 재생 구역은 동적으로 구역 그룹으로 조합되거나 개별 재생 구역으로 나뉘어질 수 있다. 예를 들어, 식당 구역과 주방 구역(114)은 저녁 파티를 위해 구역 그룹으로 조합되어 재생 장치(112 및 114)가 동기로 오디오 컨텐츠를 렌더링할 수 있다. 한편, 사용자가 거실 장소에서 음악을 듣기를 원하는 한편, 다른 사용자가 텔레비전을 보기를 원하는 경우, 거실 구역은 재생 장치(104)를 포함하는 텔레비전 구역과 재생 장치(106, 108 및 110)를 포함하는 청취 구역으로 나뉘어질 수 있다.

c. 예시적인 컨트롤 장치

도 3은 미디어 재생 시스템(100)의 컨트롤 장치(126 및 128) 중 하나 또는 둘 다로 구성될 수 있는 예시적인 컨트롤 장치의 기능적 블록도를 도시한다. 컨트롤 장치(300)는 또한 컨트롤러(300)으로서 지칭될 수 있다. 도시된 바와 같이, 컨트롤 장치(300)는 프로세서(302), 메모리(304), 네트워크 인터페이스(306) 및 사용자 인터페이스(308)를 포함할 수 있다. 일 예시에서, 컨트롤 장치(300)는 미디어 재생 시스템을 위한 전용 컨트롤러일 수 있다. 다른 예시에서, 컨트롤 장치(300)는 예컨대 아이폰(iPhone)™, 아이패드(iPad)™ 또는 임의의 다른 스마트폰, 타블렛 또는 네트워크 장치(예컨대, PC 또는 맥(Mac)™과 같은 네트워킹된 컴퓨터)와 같은, 미디어 재생 시스템 컨트롤러 어플리케이션 소프트웨어가 설치될 수 있는 네트워크 장치일 수 있다.

프로세서(302)는 사용자 접근, 컨트롤 및 미디어 재생 시스템의 구성을 용이하게 하는 것과 관련 있는 기능을 수행하도록 구성될 수 있다. 메모리(304)는 그러한 기능을 수행하도록 프로세서(302)에 의해 실행 가능한 명령어를 저장하도록 구성될 수 있다. 메모리(304)는 또한 미디어 재생 시스템 컨트롤러 어플리케이션 소프트웨어 및 사용자 및 미디어 재생 시스템(100)과 연관된 다른 데이터를 저장하도록 구성될 수 있다.

일 예시에서, 네트워크 인터페이스(306)는 산업 표준(예컨대, 적외선, 라디오, IEEE 802.3을 포함하는 유선 표준, IEEE 802.11a, 802.11b, 802.11g, 802.11n, 802.11ac, 802.15, 4G 모바일 통신 표준을 포함하는 무선 표준 등)에 기초할 수 있다. 네트워크 인터페이스(306)는 미디어 재생 시스템(100)에서 다른 장치와 통신하도록 컨트롤 장치(300)에 대한 수단을 제공할 수 있다. 일 예시에서, (예컨대, 상태 변수와 같은) 데이터 및 정보는 네트워크 인터페이스(306)를 통하여 컨트롤 장치(300)와 다른 장치 사이에서 통신될 수 있다. 예를 들어, 미디어 재생 시스템(100)에서 재생 구역 및 구역 그룹 구성은 컨트롤 장치(300)에 의해, 재생 장치 또는 다른 네트워크 장치로부터 수신될 수 있거나, 컨트롤 장치(300)에 의해, 네트워크 인터페이스(306)를 통하여 다른 재생 장치 또는 네트워크 장치로 전송될 수 있다. 일부 경우에서, 다른 네트워크 장치는 다른 컨트롤 장치일 수 있다.

음량 컨트롤 및 오디오 재생 컨트롤과 같은 재생 장치 컨트롤 명령은 또한 네트워크 인터페이스(306)를 통하여 컨트롤 장치(300)로부터 재생 장치로 통신할 수 있다. 위에서 제안된 바와 같이, 미디어 재생 시스템(100)의 구성으로의 변화는 또한 컨트롤러 장치(300)를 사용하여 사용자에 의해 수행될 수 있다. 구성 수정은 다른 것들 중에서도 구역으로/으로부터 하나 이상의 재생 장치를 추가/제거하는 것, 구역 그룹으로/으로부터 하나 이상의 구역을 추가/제거하는 것, 결합 또는 통합된 재생 장치를 형성, 결합 또는 통합된 재생 장치로부터 하나 이상의 재생 장치를 분리하는 것을 포함할 수 있다. 따라서, 컨트롤 장치(300)는, 컨트롤 장치(300)가 전용 컨트롤러이건 미디어 재생 시스템 컨트롤러 어플리케이션 소프트웨어가 설치된 네트워크 장치이건, 종종 컨트롤러로서 지칭될 수 있다.

컨트롤 장치(300)의 사용자 인터페이스(308)는 도 4에 도시된 컨트롤러 인터페이스(400)과 같은 컨트롤러 인터페이스를 제공함으로써 사용자 접근 및 미디어 재생 시스템(100)의 컨트롤을 용이하게 하도록 구성될 수 있다. 컨트롤러 인터페이스(400)는 재생 컨트롤 영역(410), 재생 구역 영역(420), 재생 상태 영역(430), 재생 큐 영역(440) 및 오디오 컨텐츠 소스 영역(450)을 포함한다. 도시된 바와 같은 사용자 인터페이스(400)는 단지 도 3의 컨트롤 장치(300)(및/또는 도 1의 컨트롤 장치(126 및 128))와 같은 네트워크 장치 상에서 제공되고 미디어 재생 시스템(100)과 같은, 미디어 재생 시스템을 제어하도록 사용자에 의해 접근될 수 있는 사용자 인터페이스의 일 예시이다. 포맷, 스타일 및 상호작용 순서를 변동하는 다른 사용자 인터페이스가 하나 이상의 네트워크 장치 상에서 대안적으로 구현되어 미디어 재생 시스템으로 비슷한 제어 접근을 제공할 수 있다.

재생 컨트롤 영역(410)은 선택된 재생 구역 또는 구역 그룹 내 재생 장치가 재생 또는 일시 정지, 빨리 감기, 뒤로 감기, 다음으로 스킵, 이전으로 스킵, 셔플(shuffle) 모드 시작/종료, 크로스 페이드 모드(cross fade mode) 시작/종료를 하도록 하는 (예컨대, 터치의 방식으로 또는 커서를 이용함으로써) 선택 가능한 아이콘을 포함할 수 있다. 재생 컨트롤 영역(410)은 또한 다른 가능성 중에서도, 이퀄라이제이션 설정(equalization setting) 및 재생 음량을 수정하도록 선택 가능한 아이콘을 포함할 수 있다.

재생 구역 영역(420)은 미디어 재생 시스템(100) 내에 있는 재생 구역의 표현(representation)을 포함할 수 있다. 일부 실시예에서, 재생 구역의 그래픽적 표현은, 다른 가능성 중에서도, 결합된 구역의 생성, 구역 그룹의 생성, 구역 그룹의 분리 및 구역 그룹의 재명칭과 같은 미디어 재생 시스템(100)에서의 재생 구역을 관리하거나 구성하기 위한 추가의 선택 가능한 아이콘을 띄우도록 선택 가능할 수 있다.

예를 들면, 도시된 바와 같이, "그룹" 아이콘이 재생 구역의 그래픽적 표현 각각 내에서 제공될 수 있다. 특정 구역의 그래픽적 표현 내에서 제공되는 "그룹" 아이콘은 특정 구역과 그룹화될 미디어 재생 시스템(100) 내 하나 이상의 다른 구역을 선택하기 위한 옵션을 띄우도록 선택 가능할 수 있다. 그룹화 되면, 특정 구역과 그룹화된 구역 내 재생 장치는 특정 구역 내 재생 장치와 동기화로 오디오 컨텐츠를 재생하도록 구성될 것이다. 비슷하게, "그룹" 아이콘이 구역 그룹의 그래픽적 표현 내에서 제공될 수 있다. 이러한 경우에, "그룹" 아이콘은 구역 그룹으로부터 제거될 구역 그룹 내 하나 이상의 구역을 선택 해제하기 위한 옵션을 띄우도록 선택 가능할 수 있다. 사용자 인터페이스(400)와 같은, 사용자 인터페이스를 통하여 구역을 그룹화 및 그룹화 해제하기 위한 다른 상호 작용 및 구현도 가능하다. 재생 구역 영역(420)에서 재생 구역의 표현은 재생 구역 또는 구역 그룹 구성이 수정됨에 따라 동적으로 갱신될 수 있다.

재생 상태 영역(430)은 선택된 재생 구역 또는 구역 그룹에서 현재 재생되거나, 이전에 재생되었거나 다음에 재생하도록 스케줄링되는 오디오 컨텐츠의 그래픽적 표현을 포함할 수 있다. 선택된 재생 구역 또는 구역 그룹은 재생 구역 영역(420) 및/또는 재생 상태 영역(430) 내에서와 같이 사용자 인터페이스 상에서 시각적으로 구분될 수 있다. 그래픽적 표현은 트랙 타이틀(track title), 아티스트 이름, 앨범 이름, 앨범 년도, 트랙 길이 및/또는 사용자 인터페이스(400)를 통하여 미디어 재생 시스템(100)을 제어하는 경우, 사용자가 알기에 유용할 수 있는 다른 관련 정보를 포함할 수 있다.

재생 큐 영역(440)은 선택된 재생 구역 또는 구역 그룹과 연관된 재생 큐 내의 오디오 컨텐츠의 그래픽적 표현을 포함할 수 있다. 일부 실시예에서, 각각의 재생 구역 또는 구역 그룹은 재생 구역 또는 구역 그룹에 의한 재생을 위한 0 개 이상의 오디오 항목에 대응하는 정보를 포함하는 재생 큐와 연관될 수 있다. 예를 들어, 재생 큐에 있는 각각의 오디오 항목은 가능한, 재생 장치에 의한 재생을 위한 로컬 오디오 컨텐츠 소스 또는 네트워킹된 오디오 컨텐츠 소스로부터 오디오 항목을 탐색 및/또는 검색하도록 재생 구역 또는 구역 그룹에서 재생 장치에 의해 사용될 수 있는 URI(uniform resource identifier), URL(uniform resource locator), 또는 일부 다른 식별자를 포함할 수 있다.

일 예시에서, 플레이리스트는 재생 큐에 추가될 수 있으며, 이러한 경우에 플레이리스트 내 각 오디오 항목에 대응하는 정보는 재생 큐에 추가될 수 있다. 다른 예시에서, 재생 큐에 있는 오디오 항목은 플레이리스트로서 저장될 수 있다. 추가적인 예시에서, 재생 구역 또는 구역 그룹이 재생 기간을 가지는 개별 오디오 항목 보다는 달리 멈출 때까지 지속적으로 재생할 수 있는 인터넷 라디오와 같은, 계속해서 스트리밍 오디오 컨텐츠를 재생하는 경우, 재생 큐는 비어 있거나 차 있더라도, "사용되지 않음"일 수 있다. 대안적인 실시예에서, 재생 큐는 재생 구역 또는 구역 그룹이 그러한 아이템을 재생하고 있는 경우, 인터넷 라디오 및/또는 다른 스트리밍 오디오 컨텐츠 항목을 포함할 수 있고, "사용 중"일 수 있다. 다른 예시도 또한 가능하다.

재생 구역 또는 구역 그룹이 "그룹화" 또는 "그룹화 해제"되는 경우, 영향을 받는 재생 구역 또는 구역 그룹과 연관되는 재생 큐는 정리되거나 재연관될 수 있다. 예를 들어, 제1 재생 큐를 포함하는 제1 재생 구역이 제2 재생 큐를 포함하는 제2 재생 구역과 그룹화되면, 규정된 구역 그룹은 처음에는 비어 있고, (제2 재생 구역이 제1 재생 구역으로 추가된 경우와 같이) 제1 재생 큐로부터의 오디오 항목을 포함하고, (제1 재생 구역이 제1 재생 구역으로 추가되는 경우와 같이) 제2 재생 큐로부터의 오디오 항목 또는 제1 및 제2 재생 큐 둘 다로부터의 오디오 항목의 조합을 포함하는 연관된 재생 큐를 가질 수 있다. 차후에, 규정된 구역 그룹이 그룹화 해제되는 경우, 결과적인 제1 재생 구역은 이전의 제1 재생 큐와 재연관될 수 있거나, 비어 있거나 규정된 구역 그룹이 그룹화 해제되기 이전에 규정된 구역 그룹과 연관된 재생 큐로부터 오디오 항목을 포함하는 새로운 재생 큐와 연관될 수 있다. 유사하게, 결과적인 제2 재생 구역은 이전의 제2 재생 큐와 재연관될 수 있거나, 비어 있거나 규정된 구역 그룹이 그룹화 해제되기 이전에 규정된 구역 그룹과 연관된 재생 큐로부터 오디오 항목을 포함하는 새로운 재생 큐와 연관될 수 있다. 다른 예시도 가능하다.

도 4의 사용자 인터페이스(400)를 다시 참조하면, 재생 큐 영역(440) 내 오디오 컨텐츠의 그래픽적 표현은 트랙 타이틀, 아티스트 이름, 트랙 길이 및 재생 큐에서 오디오 컨텐츠와 연관되는 다른 관련 정보를 포함할 수 있다. 일 예시에서, 오디오 컨텐츠의 그래픽적 표현은 재생 큐 및/또는 재생 큐에서 나타나는 오디오 컨텐츠를 관리 및/또는 조작하도록 추가의 선택 가능한 아이콘을 띄우도록 선택 가능할 수 있다. 예를 들어, 나타나는 오디오 컨텐츠는 다른 가능성 중에서도 재생 큐로부터 제거되거나, 재생 큐 내에서 다른 위치로 이동되거나 임의의 현재 오디오 컨텐츠 이후 또는 즉시 재생되도록 선택될 수 있다. 재생 구역 또는 구역 그룹과 연관된 재생 큐는 재생 구역 또는 구역 그룹 내 하나 이상의 재생 장치, 재생 구역 또는 구역 그룹에 있지 않은 재생 장치 및/또는 일부 다른 지정된 장치 상의 메모리에 저장될 수 있다. 그러한 재생 큐의 재생은 예컨대 순차적이거나 무작위 순서로 큐의 미디어 항목을 재생하는 하나 이상의 재생 장치를 수반할 수 있다.

오디오 컨텐츠 소스 영역(450)은 오디오 컨텐츠가, 선택된 재생 구역 또는 구역 그룹에 의해 검색되고 재생될 수 있는 오디오 컨텐츠 소스일 수 있는 선택 가능한 오디오 컨텐츠 소스의 그래픽적 표현을 포함할 수 있다. 오디오 컨텐츠 소스와 관련 있는 논의는 다음의 섹션에서 발견될 수 있다.

d. 예시적인 오디오 컨텐츠 소스

이전에 나타낸 바와 같이, 구역 또는 구역 그룹 내 하나 이상의 재생 장치는 다양한 이용 가능한 오디오 컨텐츠 소스로부터 (예컨대, 오디오 컨텐츠에 대하여 대응하는 URI 또는 URL에 따라) 재생 오디오 컨텐츠를 검색하도록 구성될 수 있다. 일 예시에서, 오디오 컨텐츠는 대응하는 오디오 컨텐츠 소스로부터 직접적으로 (예컨대, 라인인 연결을 통하여) 재생 장치에 의해 검색될 수 있다. 다른 예시에서, 오디오 컨텐츠는 하나 이상의 다른 재생 장치 또는 네트워크 장치를 통하여 네트워크 상에서 재생 장치로 제공될 수 있다.

예시적인 오디오 컨텐츠 소스는 다른 가능성 중에서도, 도 1의 미디어 재생시스템(100)과 같은 미디어 재생 시스템 내 하나 이상의 재생 장치의 메모리, (예컨대, 컨트롤 장치, 네트워크 가능한 개인 컴퓨터, 또는 네트워크 접속 기반 파일 서버(NAS)와 같은) 하나 이상의 네트워크 장치 상의 로컬 음악 라이브러리, 인터넷을 통하여 오디오 컨텐츠를 제공하는 스트리밍 오디오 서비스(예컨대, 클라우드) 또는 재생 장치 또는 네트워크 장치 상에서 라인인 입력 연결을 통하여 미디어 재생 시스템으로 연결되는 오디오 소스를 포함할 수 있다.

일부 실시예에서, 오디오 컨텐츠 소스는 도 1의 미디어 재생 시스템(100)과 같은 미디어 재생 시스템으로부터 정기적으로 추가 또는 제거될 수 있다. 일 예시에서, 하나 이상의 오디오 컨텐츠 소스가 추가, 제거 또는 갱신될 때마다 오디오 항목의 인덱싱(indexing)이 수행될 수 있다. 오디오 항목의 인덱싱은 미디어 재생 시스템 내 재생 장치에 의해 액세스 가능한 네트워크 상에서 공유되는 모든 폴더/디렉토리에서 식별 가능한 오디오 항목에 대하여 스캐닝하는 것 및 메타데이터(예컨대, 다른 것들 중에서도 타이틀, 아티스트, 앨범, 트랙 길이)와 탐색되는 각각의 식별 가능한 오디오 항목에 대한 URI 또는 URL과 같은 다른 연관되는 정보를 포함하는 오디오 컨텐츠 데이터베이스를 생성 또는 갱신하는 것을 수반할 수 있다. 오디오 컨텐츠 소스를 관리 및 유지하기 위한 다른 예시도 가능할 수 있다.

e. 예시적인 프로세싱 시스템

도 5는 오디오 입력/출력 컴포넌트(502), 활성 단어 검출 컴포넌트(504) 및 알림 컴포넌트(506)를 포함하는 예시적인 프로세싱 시스템(500)의 기능적 블록도를 도시한다. 동작에서, 프로세싱 시스템(500)은 녹음된 오디오 컨텐츠 내의 활성 단어를 검출하고, NMD로 알림을 제공하여 활성 단어를 검출하는 것에 대한 프로그래밍된 활성 응답을 무시하거나 억제한다. 다양한 실시예 내에서, 프로세싱 시스템(500)은 다른 예시 중에서도 재생 장치, NMD 또는 클라우드 서버와 같은 별개의 프로세싱 장치에서 구현될 수 있다. 일부 실시예에서, 프로세싱 시스템(및/또는 그 기능)의 다양한 컴포넌트는 복수의 장치에 분배된다.

동작에서, 오디오 입력/출력 컴포넌트(502)는 입력 인터페이스를 통하여, 재생 장치에 의한 재생을 위해 지정된 녹음된 오디오 컨텐츠를 수신한다. 예를 들어, (예컨대, 도 1의 컨트롤 장치(126 또는 128)와 같은) 컨트롤 장치는 재생 장치(예컨대, 도 1의 임의의 재생 장치)에 지시하여 예컨대 다른 예시 중에서도 재생 장치의 재생 큐에 위치될 컨텐츠로 하여금 재생 장치가 오디오 컨텐츠를 검색하도록 하거나, 오디오 컨텐츠 스트림을 재생 장치로 향하게 하거나, 또는 아날로그 또는 디지털 라인-인 인터페이스를 통하여 재생 장치로 오디오 컨텐츠를 향하게 함으로써, 일부 오디오 컨텐츠를 재생하도록 할 수 있다. 프로세싱 시스템(500)의 오디오 입력/출력 컴포넌트(502)는 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, 녹음된 오디오 컨텐츠를 수신한다.

위에서 언급된 바와 같이, 일부 예시에서, 프로세싱 시스템(500)은 재생 장치 내에서 구현된다. 이러한 실시예에서, 재생 장치(500)는 이미 재생을 위해 필요한 오디오 컨텐츠로의 접근을 가진다. 예를 들어, 재생 장치는 다른 가능성 중에서도, 광역 네트워크(WAN), 근거리 네트워크(LAN) 및 개인 영역 네트워크(PAN)와 같은 하나 이상의 유형의 네트워크 상에서 네트워크 인터페이스를 통하여 네트워크 소스(예컨대, 스트리밍 미디어 서비스 또는 모바일 장치)로부터 오디오 컨텐츠를 수신할 수 있다. 대안적으로, 재생 장치는 아날로그(예컨대, RCA) 또는 디지털(예컨대, TosLink® 또는 HDMI®) 라인 인 인터페이스를 통하여 오디오 컨텐츠를 수신할 수 있다.

다른 예시에서, 프로세싱 시스템(500)은 NMD 또는 재생 장치로부터 분리되는 다른 프로세싱 장치 내에서 구현된다. 이러한 실시예에서, 프로세싱 시스템(500)은 다른 예시 중에서도, 재생 장치로부터 또는 오디오 컨텐츠의 소스로부터 네트워크 인터페이스를 통하여 오디오 컨텐츠를 수신할 수 있다. 다른 예시에서, 라인 인 인터페이스는 오디오 컨텐츠를 NMD로 직접 제공할 수 있거나 재생 장치는 라인 인 인터페이스를 통하여 오디오 컨텐츠를 수신할 수 있고, 하나 이상의 네트워크 상에서 프로세싱 시스템(500)으로 컨텐츠를 전달할 수 있다.

예를 들어, 프로세싱 시스템(500)은 재생 장치의 재생 큐로의 접근을 가질 수 있다. 위에서 언급된 바와 같이, 재생 큐에 있는 각각의 오디오 항목은 가능하다면 재생 장치에 의한 재생을 위한 로컬 오디오 컨텐츠 소스 또는 네트워킹된 오디오 컨텐츠 소스로부터 오디오 항목을 탐색 및/또는 검색하도록 재생 구역 또는 구역 그룹에서 재생 장치에 의해 사용될 수 있는 URI(uniform resource identifier), URL(uniform resource locator), 또는 일부 다른 식별자를 포함할 수 있다. 프로세싱 시스템(500)은 재생 장치에 의한 재생 이전에, 로컬 오디오 컨텐츠 소스 또는 네트워킹된 오디오 컨텐츠 소스로부터 오디오 컨텐츠를 검색하도록 이러한 식별자를 유사하게 사용할 수 있다.

일부 구현예에서, 재생 큐는 재생 장치의 데이터 저장소에 저장된다. 추가 구현예에서, 재생 큐는 클라우드 서버 상에 저장된다. 클라우드 서버(즉, 클라우드 큐) 상에 저장된 재생 큐는 재생 장치 상에 저장된 재생 큐의 표현 또는 인스턴스일 수 있다. 클라우드 큐는 재생 포인터 또는 재생 장치 상의 재생의 현재 상태를 나타내는 다른 상태 정보를 포함할 수 있다.

일부 경우에서, 프로세싱 시스템(500)은 활성 단어 검출을 위해 적합한 포맷으로 수신된 오디오 컨텐츠를 전환할 수 있다. 예를 들어, 오디오 컨텐츠가 아날로그 라인 인 인터페이스를 통하여 오디오 입력/출력 컴포넌트(502)로 제공되는 경우, 프로세싱 시스템(500)은 (예컨대, 소프트웨어 또는 하드웨어 기반 아날로그 디지털 변환기를 사용하여) 아날로그 오디오를 디지털화할 수 있다. 다른 예시로서, 수신된 오디오 컨텐츠가 분석을 위해 적합하지 않은 디지털 형태로 수신되는 경우, 프로세싱 시스템(500)은 녹음을 적합한 포맷으로 트랜스코딩(transcode)할 수 있다.

활성 검출 컴포넌트(504)는 수신된 오디오 컨텐츠를 분석하여 임의의 활성 단어가 녹음에 존재하는지를 결정한다. 활성 단어 검출 컴포넌트(504)는 활성 단어 검출 알고리즘을 사용하여, 수신된 오디오 컨텐츠를 분석할 수 있다. 예시적인 활성 단어 검출 알고리즘은 입력으로서, 오디오 녹음을 받아들이고, 출력으로서, 활성 단어가 녹음에 존재하는지 여부의 표시를 제공한다.

일부 구현예에서, 활성 단어 검출 컴포넌트(504)는 마이크로폰을 통하여 녹음된 오디오에서 활성 단어를 검출하기 위해 NMD에 의해 활용된 것처럼 녹음 상의 동일한 알고리즘을 사용할 수 있다. 보통의 동작 동안, 예시적인 NMD는 녹음된 오디오가 활성 단어를 포함하는지를 결정하기 위하여 지속적으로 오디오를 녹음하고, 녹음된 오디오 스트림을 활성 단어 알고리즘으로 제공한다. 여기서, NMD의 마이크로폰에 의해 녹음된 오디오를 활성 단어 검출 알고리즘으로 제공하는 대신, 활성 단어 검출 컴포넌트(504)는 재생을 위해 지정된 미리 녹음된 오디오 컨텐츠를 제공한다.

분석 동안, 활성 단어 검출 컴포넌트(504)는 추가적으로 각 활성 단어가 수신된 오디오 컨텐츠 내에서 발생하는 곳을 결정한다. 예를 들어, 활성 단어 검출 컴포넌트(504)는 수신된 오디오 컨텐츠를 알려진 길이의 세그먼트로 분할할 수 있다. 이후, 활성 단어 검출 컴포넌트(504) 검출된 세그먼트를 식별함으로써 활성 단어가 발생하는 녹음에서의 위치를 결정할 수 있다. 예를 들어, 각각의 세그먼트가 5초 길이이고, 활성 단어가 4번째 세그먼트에서 검출되는 경우, 활성 단어는 녹음에서 15 내지 20초 사이에 위치해야만 한다. 활성 단어 검출 컴포넌트(504)는 예컨대 하나 이상의 타임스탬프(예컨대, 활성 단어에 대한 시작 시간을 나타내는 타임스탬프 및 예컨대 활성 단어에 대한 중단 시간을 나타내는 다른 타임스탬프)를 사용하여, 활성 단어를 포함하는 오디오 컨텐츠의 부분을 녹음할 수 있다. 그러한 타임스탬프는 오디오 녹음의 시작으로부터, 또는 오디오 녹음에 있는 다른 특정한 위치로부터의 각 시간 오프셋을 규정할 수 있다. 일부 경우에서, 활성 단어 검출 컴포넌트(504)는 오디오 녹음을 오버랩핑 세그먼트로 분리하여, 활성 단어가 인지할 수 없는 부분으로 쪼개지는 것을 피할 수 있다. 오디오 녹음 내의 활성 단어의 위치를 결정하기 위한 다른 기법도 활용될 수 있다.

예시 내에서, 프로세싱 시스템(500)은 메모리에서 수신된 오디오 컨텐츠를 버퍼링할 수 있다. 예를 들어, 프로세싱 시스템(500)은 선입선출 버퍼(first-in-first-out buffer)(예컨대, 원형 버퍼)에서 수신된 오디오 컨텐츠를 저장할 수 있다. 이러한 구현예에서, 수신된 오디오의 부분은 그들이 수신되었을 때, 버퍼에 저장되고, 이들이 프로세싱되어 수신된 오디오 컨텐츠가 활성 단어를 포함하는지를 결정함에 따라 제거된다.

일부 경우에서, 활성 단어 검출 컴포넌트(504)는 수신된 오디오 컨텐츠 상의 복수의 활성 단어 검출 알고리즘을 동시에(또는 실질적으로 동시에) 실행한다. 위에서 언급된 바와 같이, 다양한 음성 서비스(예컨대, AMAXON의 ALEXA®, APPLE의 SIRI® 또는 MICROSOFT의 CORTANA®) 각각은 그들의 각 음성 서비스를 작동시키기 위한 다양한 활성 단어를 사용한다. 복수의 서비스를 지원하기 위해, 활성 단어 검출 컴포넌트(504)는 각각 병렬로 지원된 음성 서비스에 대한 활성 단어 검출 알고리즘을 통하여 수신된 오디오 컨텐츠를 실행할 수 있다.

하나 이상의 활성 단어가 오디오 컨텐츠에서 검출되는 경우, 알림 컴포넌트(506)는 하나 이상의 NMD(예컨대, 도 1의 NMD(132 및/또는 134))를 알린다. 이러한 알림은, NMD로 하여금, 재생 장치가 활성 단어가 포함된 오디오 컨텐츠를 재생하는 동안 재생될 때 검출된 활성 단어를 무시하도록 한다. 예를 들어, 알림 컴포넌트(506)은 네트워크 인터페이스를 지나 하나 이상의 NMD로 명령어를 송신하여 일부 활성 단어 또는 일정 수의 활성 단어를 무시할 수 있다.

일부 경우에서, 알림 컴포넌트(506)은 NMD가 재생 장치에 의해 재생됨에 따라 활성 단어를 검출하는 것을 방지할 수 있다. 예를 들어, 알림 컴포넌트(506)는 NMD에 지시하여 기간 동안 활성 단어를 듣는 것을 중단(예컨대, 녹음된 오디오를 프로세싱하는 것을 중단)하도록 할 수 있다. 대안적으로, 알림 컴포넌트(506)는 NMD에 지시하여, 마이크로폰 어레이를 일시적으로(예컨대, 활성 단어가 재생 장치에 의해 재생될 것으로 예상되는 때에 대응하는 기간 동안) 디세이블할 수 있다. 또 다른 예시에서, 알림 컴포넌트(506)는 NMD에 지시하여 마이크로폰 어레이를 사용하여 재생 장치의 방향으로 청취 무효(listening NULL)를 생성하여 NMD가 활성 단어를 검출하지 않을 수 있다. 다른 예시도 가능하다.

대안적으로, NMD는 활성 단어를 검출할 수 있지만, 알림 컴포넌트(506)는 NMD에 지시하여 활성 단어를 검출하는 것에 응답하여 음성 서비스를 작동하기 위한 그 프로그래밍된 활성 응답을 억제한다. 예를 들어, 알림 컴포넌트(506)는 NMD에 지시하여 일정 기간동안 모든 오디오를 무시하거나 일정 기간 동안 활성 단어를 무시하도록 할 수 있다. 다른 예시도 가능하다.

재생 장치가 오디오 컨텐츠를 들리도록 재생하기 전에, 오디오 컨텐츠를 프로세싱하는 경우, (재생 장치 또는 NMD와 같은) 프로세싱 장치는 또한 녹음된 오디오 컨텐츠의 어떤 섹션이 활성 단어를 포함하는지를 결정할 수 있다. 이러한 섹션은 활성 단어에 대한 시작과 중단 시각(예컨대, 33:52.543에서 시작하고 33:54.013에서 종료하는 팟캐스트에서의 활성 단어)과 같은 오디오 컨텐츠 내의 기간에 의해 정의될 수 있다. 오디오 컨텐츠가 재생되는 경우, 부근에 있는 NMD는 이러한 기간동안 활성 단어를 무시하도록 지시될 수 있다.

다른 예시로서, 프로세싱 시스템(500)은 오디오 컨텐츠 내의 (또는 오디오 컨텐츠의 부분 내의) 활성 단어의 수를 카운트할 수 있다. 예를 들어, 프로세싱 시스템(500)은 예시적인 오디오 컨텐츠(예컨대, 텔레비전 쇼) 내의 세 개의 활성 단어를 검출할 수 있다. 위에서 언급된 바와 같이, 이러한 경우는 다양한 음성 서비스를 위한 다양한 활성 단어를 포함하는 활성 단어의 임의의 조합을 포함할 수 있다. 이후, 프로세싱 시스템(500)은 부근에 있는 NMD에 지시하여, 그들이 카운트와 같은 활성 단어의 수를 검출할 때까지 활성 단어를 무시(예컨대, 다음 세 개의 활성 단어를 무시)할 수 있다.

다른 예시에서, 프로세싱 시스템(500)은 녹음된 오디오 컨텐츠에 다른 마커 또는 오디오 톤을 동적으로 삽입하여 오디오 컨텐츠에서 검출된 활성 단어를 지정할 수 있다. 이후, 오디오 컨텐츠가 재생 장치에 의해 재생되는 경우, 활성 단어와 함께 오디오 마커를 검출하는 NMD는 활성 단어의 그 인스턴스를 무시하도록 지시받을 수 있다. 복수의 NMD가 재생 장치의 가청 범위에 있는 경우, 활성 단어를 검출하는 각각의 NMD는 연관된 오디오 마커를 검출하는 것에 응답하여 이를 무시할 수 있다. 일부 경우에서, 오디오 마커는 사람의 청력 범위 밖에 있는 오디오 주파수(예컨대, 20kHZ 초과)로 구성되어 삽입된 톤은 인간 청취자에 의해 인식 가능하지 않다.

일부 구현예에서, 프로세싱 시스템(500)은 오디오 컨텐츠의 소스와 재생 장치 사이의 중재자로서 동작한다. 예를 들어, 프로세싱 시스템(500)이 오디오 마커를 사용하여 NMD에 알리는 구현예에서, 프로세싱 시스템은 재생 장치에 의한 재생을 위해 지정된 오디오 컨텐츠를 수정한다. 그러한 구현예에서, 프로세싱 시스템(500)은 (예컨대, 네트워크 또는 라인 인 인터페이스를 통하여) 오디오 소스로부터 오디오 컨텐츠를 수신하고, 오디오 컨텐츠를 분석하고, 수정된 오디오 컨텐츠를 예컨대 네트워크 인터페이스를 통하여, 재생을 위한 재생 장치로 제공할 수 있다.

대안적으로, 위에서 언급된 바와 같이, 프로세싱 시스템(500)은 재생 장치 자체에서 구현된다. 그러한 경우에서, 오디오 컨텐츠를 분석하는 것 이후, 재생 장치는 오디오 컨텐츠를 재생하도록 진행할 수 있다. 또한, 위에서 언급된 바와 같이, 일부 경우에서, 재생 장치는 (예컨대, 구역 그룹, 스테레오 쌍 또는 서라운드 사운드 구성에서) 하나 이상의 추가적인 재생 장치와 동시에 오디오 컨텐츠를 재생하도록 구성될 수 있다. 그러한 상황에서, 재생 장치는 (예컨대 수정된) 오디오 컨텐츠를 예컨대 네트워크 인터페이스를 통하여, 하나 이상의 추가적인 재생 장치로 제공할 수 있다.

추가적 예시에서, 프로세싱 시스템(500)은 NMD에서 구현된다. 이러한 경우에서, 프로세싱 시스템(500)은 NMD 자체로 하여금, 오디오 컨텐츠가 재생될 때 오디오 컨텐츠에 있는 활성 단어를 무시하도록 할 수 있다. 또한, NMD는 활성 단어를 무시하도록 다른 NMD에 지시할 수 있다. 예를 들어, NMD(132)는 활성 단어를 무시하도록 NMD(134)에 지시할 수 있다. 또한, NMD가 재생 장치(예컨대, 재생 장치(104))에서 구현되는 경우, NMD/재생 장치는 활성 단어를 무시하도록 다른 NMD(그들 자체가 재생 장치에서 구현될 수 있음)에 지시할 수 있다.

f. 예시적인 복수의 네트워킹된 장치

도 6은 음성 컨트롤에 기초하여 오디오 재생 경험을 제공하도록 구성될 수 있는 예시적인 복수의 장치(600)를 도시한다. 당업자는, 도 6에 도시된 장치가 단지 예시적인 목적을 위한 것이며, 상이하고/거나 추가적인 장치를 포함하는 변동이 가능함을 인정할 것이다. 도시된 바와 같이, 복수의 장치(600)는 컴퓨팅 장치(604, 606 및 608), 네트워크 마이크로폰 장치(NMD)(612, 614 및 616), 재생 장치(PBD)(632, 634, 636 및 638) 및 컨트롤러 장치(CR)(622)를 포함한다.

복수의 장치(600) 각각은, 예컨대, 다른 가능성 중에서도, 광역 네트워크(WAN), 근거리 네트워크(LAN) 및 개인 영역 네트워크(PAN)와 같은 하나 이상의 유형의 네트워크에서, 다른 예시 중에서도 NFC, 블루투스, 이더넷 및 IEEE 802.11과 같은 하나 이상의 네트워크 프로토콜에 따라 복수의 장치에서 하나 이상의 다른 장치와의 통신을 수립할 수 있는 네트워크-가능한 장치일 수 있다.

도시한 바와 같이, 컴퓨팅 장치(604, 606 및 608)는 클라우드 네트워크(602)의 일부일 수 있다. 클라우드 네트워크(602)는 추가적인 컴퓨팅 장치를 포함할 수 있다. 일 예시에서, 컴퓨팅 장치(604, 606 및 608)는 상이한 서버일 수 있다. 다른 예시에서, 컴퓨팅 장치(604, 606 및 608) 중 둘 이상은 단일 서버의 모듈일 수 있다. 비슷하게, 컴퓨팅 장치(604, 606 및 608) 각각은 하나 이상의 모듈 또는 서버를 포함할 수 있다. 여기서 예시 목적의 편의를 위해, 컴퓨팅 장치(604, 606 및 608) 각각은 클라우드 네트워크(602) 내에서 특정한 기능을 수행하도록 구성될 수 있다. 예를 들어, 컴퓨팅 장치(608) 스트리밍 음악 서비스를 위한 오디오 컨텐츠의 소스일 수 있다.

도시된 바와 같이, 컴퓨팅 장치(604)는 통신 경로(642)를 통하여 NMD(612, 614 및 616)와 인터페이싱 하도록 구성될 수 있다. NMD(612, 614 및 616)는 하나 이상의 “스마트 홈” 시스템의 컴포넌트일 수 있다. 일 예시에서, NMD(612, 614 및 616)는 도 1의 도시된 장치의 분배와 유사하게, 집 전반에 물리적으로 분배될 수 있다. 다른 경우에서, NMD(612, 614 및 616) 중 둘 이상은 서로 비교적 근접하게 물리적으로 위치될 수 있다. 통신 경로(642)는 다른 가능성 중에서도, 인터넷을 포함하는 WAN, LAN 및/또는 PAN과 같은 하나 이상의 유형의 네트워크를 포함할 수 있다.

일 예시에서, NMD(612, 614 및 616) 중 하나 이상은 주로 오디오 검출을 위해 구성되는 장치일 수 있다. 다른 예시에서, NMD(612, 614 및 616) 중 하나 이상은 다양한 주된 효용을 가지는 장치의 컴포넌트일 수 있다. 예를 들어, 도 2 및 도 3와 관련하여 위에서 논의된 바와 같이, NMD(612, 614 및 616) 중 하나 이상은 재생 장치(200)의 마이크로폰(220) 또는 네트워크 장치(300)의 마이크로폰(310)일 수 있다. 또한, 일부 경우에서, NMD(612, 614 및 616) 중 하나 이상은 재생 장치(200) 또는 네트워크 장치(300)일 수 있다. 일 예시에서, NMD(612, 614 및/또는 616) 중 하나 이상은 마이크로폰 어레이에서 배열된 복수의 마이크로폰을 포함할 수 있다.

도시된 바와 같이, 컴퓨팅 장치(606)는 통신 경로(644)를 통하여, CR(622) 및 PBD(632, 634, 636 및 638)와 인터페이싱 하도록 구성될 수 있다. 일 예시에서, CR(622)은 도 2의 네트워크 장치(200)와 같은 네트워크 장치일 수 있다. 따라서, CR(622)은 도 4의 컨트롤러 인터페이스(400)를 제공하도록 구성될 수 있다. 유사하게, PBD(632, 634, 636 및 638)는 도 3의 재생 장치(300)와 같은 재생 장치일 수 있다. 이와 같이, PBD(632, 634, 636 및 638)는 도 1에 도시된 바와 같이, 집 전반에 걸쳐 물리적으로 분배될 수 있다. 예시를 위해, PBD(636 및 638)는 결합된 구역(630)의 일부일 수 있는 한편, PBD(632 및 634)는 그들의 각 구역의 일부일 수 있다. 위에서 설명된 바와 같이, PBD(632, 634, 636 및 638)는 동적으로 결합되고, 그룹화되고, 결합해제 되고, 그룹화해제 될 수 있다. 통신 경로(644)는 다른 가능성 중에서도, 인터넷을 포함하는 WAN, LAN 및/또는 PAN과 같은 하나 이상의 유형의 네트워크를 포함할 수 있다.

일 예시에서, NMD(612, 614 및 616)와 같이, CR(622) 및 PBD(632, 634, 636 및 638)도 하나 이상의 "스마트 홈" 시스템의 컴포넌트일 수 있다. 일 예시에서, PBD(632, 634, 636 및 638)는 NMD(612, 614 및 616)처럼 동일한 집 전반에 분배될 수 있다. 또한, 위에서 제안된 바와 같이, PBD(632, 634, 636 및 638) 중 하나 이상은 NMD(612, 614 및 616) 중 하나 이상일 수 있다.

NMD(612, 614 및 616)는 근거리 네트워크의 일부일 수 있고, 통신 경로(642)는 NMD(612, 614 및 616)의 근거리 네트워크를 WAN(통신 경로 도시되지 않음)을 통해 컴퓨팅 장치(604)로 연결하는 액세스 포인트를 포함할 수 있다. 마찬가지로, NMD(612, 614 및 616) 각각은 그러한 액세스 포인트를 통하여 서로 통신할 수 있다.

유사하게, CR(622) 및 PBD(632, 634, 636 및 638)는 근거리 네트워크 및/또는 이전 섹션에서 논의된 바와 같은, 로컬 재생 네트워크의 일부일 수 있고, 통신 경로(644)는 근거리 네트워크 및/또는 CR(622) 및 PBD(632, 634, 636 및 638)의 로컬 재생 네트워크를 WAN을 통해 컴퓨팅 장치(606)로 연결하는 액세스 포인트를 포함할 수 있다. 이와 같이, CR(622) 및 PBD(632, 634, 636 및 638) 각각은 또한 이러한 액세스 포인트를 통해 서로와 통신할 수 있다.

일 예시에서, 통신 경로(642 및 644)는 동일한 액세스 포인트를 포함할 수 있다. 일 예시에서, NMD(612, 614 및 616), CR(622) 및 PBD(632, 634, 636 및 638) 각각은 집에 대한 동일한 액세스 포인트를 통하여 클라우드 네트워크(602)에 접근할 수 있다.

도 6에서 도시된 바와 같이, NMD(612, 614 및 616), CR(622) 및 PBD(632, 634, 636 및 638) 각각은 또한 통신 수단(646)을 통하여 다른 장치 중 하나 이상과 직접적으로 통신할 수 있다. 여기서 설명된 바와 같이, 통신 수단(646)은 하나 이상의 유형의 네트워크를 통해 하나 이상의 네트워크 프로토콜에 따라, 장치 간의 하나 이상의 형태의 통신을 수반할 수 있고/거나 하나 이상의 다른 네트워크 장치를 통하여 통신을 수반할 수 있다. 예를 들어, 통신 수단(646)은 다른 가능성 중에서도, 예컨대, 블루투스^TM(IEEE 802.15), NFC, 무선 직통 및/또는 등록된 무선 중 하나 이상을 포함할 수 있다.

일 예시에서, CR(622)은 블루투스^TM를 통해 NMD(612)와 통신할 수 있고, 다른 근거리 네트워크를 통해 PBD(634)와 통신할 수 있다. 다른 예시에서, NMD(614)는 다른 근거리 네트워크를 통해 CR(622)과 통신할 수 있고, 블루투스를 통해 PBD(636)와 통신할 수 있다. 추가 예시에서, PBD(632, 634, 636 및 638) 각각이 로컬 재생 네트워크를 통해 스패닝 트리 프로토콜을 따라(spanning tree protocol) 서로와 통신하는 한편, 각각은 로컬 재생 네트워크와 상이한 근거리 네트워크를 통해 CR(622)과 통신할 수 있다. 다른 예시도 가능하다.

일부 경우에서, NMD(612, 614 및 616), CR(622) 및 PBD(632, 634, 636 및 638) 간의 통신 수단은 장치, 네트워크 상태 및/또는 지연 요구 간의 통신의 유형에 따라 변화할 수 있다. 예를 들어, 통신 수단(646)은, NMD(616)가 PBD(632, 634, 636 및 638)가 있는 집에 처음 도입되는 경우, 사용될 수 있다. 일 예시에서, NMD(616)는 NFC를 통하여 NMD(616)에 대응하는 식별 정보를 PBD(638)로 전송할 수 있고, PBD(638)는 이에 응답하여, NFC(또는 통신의 다른 형태)를 통하여 근거리 네트워크 정보를 NMD(616)로 전송할 수 있다. 그러나, NMD(616)가 집 내에서 구성되면, NMD(616)와 PBD(638) 간의 통신 수단은 바꿀 수 있다. 예를 들어, NMD(616)는 차후에 통신 경로(642), 클라우드 네트워크(602) 및 통신 경로(644)를 통하여, PBD(638)와 통신할 수 있다. 다른 예시에서, NMD 및 PBD는 로컬 통신 수단(646)을 통하여 전혀 통신하지 않을 수 있다. 추가 예시에서, NMD 및 PBD는 주로 로컬 통신 수단(646)을 통하여 통신할 수 있다. 다른 예시도 가능하다.

예시적인 예시에서, NMD(612, 614 및 616)는 음성 입력을 수신하여 PBD(632, 634, 636 및 638)를 컨트롤하도록 구성될 수 있다. 이용 가능한 컨트롤 명령은 다른 가능성 중에서도, 재생 음량 컨트롤, 재생 운송 컨트롤, 음악 소스 선택 및 그룹화와 같은 이전에 논의된 임의의 미디어 재생 시스템 컨트롤을 포함할 수 있다. 일 예시에서, NMD(612)는 PBD(632, 634, 636 및 638) 중 하나 이상을 컨트롤하도록 음성 입력을 수신할 수 있다. 음성 입력을 수신하는 것에 응답하여, NMD(612)는 통신 경로(642)를 통하여 음성 입력을 프로세싱을 위한 컴퓨팅 장치(604)로 전송할 수 있다. 일 예시에서, 컴퓨팅 장치(604)는 음성 입력을 동등한 텍스트 명령으로 전환할 수 있고, 텍스트 명령을 파싱하여 명령을 식별할 수 있다. 컴퓨팅 장치(604)는 이후, 텍스트 명령을 컴퓨팅 장치(606)로 차후에 전송할 수 있다. 다른 예시에서, 컴퓨팅 장치(604)는 음성 입력을 동등한 텍스트 명령으로 전환할 수 있고, 이후 텍스트 명령을 컴퓨팅 장치(606)로 차후에 전송할 수 있다. 컴퓨팅 장치(606)는 이후, 텍스트 명령을 파싱하여 하나 이상의 재생 명령을 식별할 수 있다.

예를 들어, 텍스트 명령이 "'구역 1'에서 '스트리밍 서비스 1'로부터 '아티스트 1'의 '트랙 1'을 재생해"인 경우, 컴퓨팅 장치(606)는 (i) "스트리밍 서비스 1"로부터 이용 가능한 "아티스트 1"의 "트랙 1"에 대한 URL 및 (ii) "구역 1"에 있는 적어도 하나의 재생 장치를 식별할 수 있다. 이러한 예시에서, "스트리밍 서비스 1"로부터 "아티스트 1"의 "트랙 1"에 대한 URL은 컴퓨팅 장치(608)를 지시하는 URL일 수 있고, "구역 1"은 결합된 구역(630)일 수 있다. 이와 같이, URL 및 PBD(636 및 638) 중 하나 또는 둘 다를 식별하면, 컴퓨팅 장치(606)는 통신 경로(644)를 통하여, PBD(636 및 638) 중 하나 또는 둘 다로 재생을 위한 식별된 URL을 전송할 수 있다. PBD(636 및 638) 중 하나 또는 둘 다는 수신된 URL에 따라, 컴퓨팅 장치(608)로부터 오디오 컨텐츠를 응답으로 검색할 수 있고, "스트리밍 서비스 1"로부터 "아티스트 1"의 "트랙 1" 재생을 시작할 수 있다.

또 다른 예시에서, 컴퓨팅 장치(604)는 일부 프로세싱을 수행하여 관련된 명령 또는 사용자의 의도를 식별할 수 있고 컴퓨팅 장치(606)로 음성 입력에 관련된 미디어 컨텐츠에 관한 정보를 제공할 수 있다. 예를 들어, 컴퓨팅 장치(604)는 음성 입력의 스피치 투 텍스트 변환(speech-to-text conversion)을 수행하고 명령을 어떻게 실행하는지에 대한 다른 정보를 따라 명령 또는 의도(예컨대, 재생, 정지, 중단, 음량 높임, 음량 낮춤, 스킵, 다음, 그룹, 그룹해제)에 대하여 음성 입력을 분석할 수 있다. 컴퓨팅 장치(604) 또는 컴퓨팅 장치(606)는 어떤 PBD 명령이 컴퓨팅 장치(604)에 의해 결정된 명령 또는 의도에 대응하는 지를 결정할 수 있다. 명령을 실행하는 것과 관련된 다른 정보 및/또는 음성 입력으로부터 결정된 명령 또는 의도는 컴퓨팅 장치(604)로부터 컴퓨팅 장치(606)로 전송될 수 있다. 컴퓨팅 장치(604) 상의 프로세싱은 어플리케이션, 모듈, 애드온(add-on) 소프트웨어, 네이티브 네트워킹된 마이크로폰 시스템 소프트웨어 플랫폼과의 통합 및/또는 네이티브 네트워킹된 마이크로폰 시스템 소프트웨어 플랫폼에 의해 수행될 수 있다.

당업자는 위 내용이 단순히 일 예시이고, 다른 구현예 또한 가능함을 인정할 것이다. 일 예시에서, 위에서 설명된 바와 같이 복수의 장치(600) 중 하나 이상에 의해 수행되는 동작은 복수의 장치(600)에서 하나 이상의 다른 장치에 의해 수행될 수 있다. 예를 들어, 음성 입력으로부터 텍스트 명령으로의 전환은 NMD(612), 컴퓨팅 장치(606), PBD(636) 및/또는 PBD(638)와 같은 다른 장치에 의해 대안적, 부분적 또는 전체적으로 수행될 수 있다. 유사하게, URL의 식별은 NMD(612), 컴퓨팅 장치(604), PBD(636) 및/또는 PBD(638)과 같은 다른 장치에 의해 대안적, 부분적 또는 전체적으로 수행될 수 있다.

g. 예시적인 네트워크 마이크로폰 장치

도 7은 도 7의 NMD(712, 714 및 716) 중 하나 이상으로 구성될 수 있는 예시적인 네트워킹 마이크로폰 장치(700)의 기능적 블록도를 도시한다. 도시된 바와 같이, 네트워크 마이크로폰 장치(700)는 프로세서(702), 메모리(704), 마이크로폰 어레이(706), 네트워크 인터페이스(708), 사용자 인터페이스(710), 소프트웨어 컴포넌트(712) 및 스피커(714)를 포함한다. 당업자는 다른 네트워크 마이크로폰 장치 구성 및 배열 또한 가능함을 인정할 것이다. 예를 들어, 네트워크 마이크로폰 장치는 대안적으로 스피커(714)를 배제하거나, 마이크로폰 어레이(706) 대신 단일 마이크로폰을 가질 수 있다.

프로세서(702)는 하나 이상의 프로세서 및/또는 컨트롤러를 포함할 수 있으며, 이는 일반적 또는 특수 목적의 프로세서 또는 컨트롤러의 형태를 취할 수 있다. 예를 들어, 프로세싱 유닛(702)은 마이크로프로세서, 마이크로컨트롤러, 어플리케이션-특정 집적 회로, 디지털 신호 프로세서 등을 포함할 수 있다. 메모리(704)는 그러한 기능을 수행하도록 프로세서(702)에 의해 실행 가능한 소프트웨어 컴포넌트 중 하나 이상과 로딩될 수 있는 데이터 저장소일 수 있다. 따라서, 메모리(704)는 하나 이상의 비일시적 컴퓨터 판독 가능 기록매체를 포함할 수 있고, 그 예는 다른 가능성 중에서도, RAM(random access memory), 레지스터, 캐시 등과 같은 휘발성 저장 매체와 ROM(read-only memory), 하드디스크 드라이브, SSD(solid-state drive), 플래시 메모리 및/또는 광학 저장 장치와 같은 비휘발성 저장 매체를 포함할 수 있다.

마이크로폰 어레이(706)는 네트워크 마이크로폰 장치(700)의 환경에서 사운드를 검출하도록 배열된 복수의 마이크로폰일 수 있다. 마이크로폰 어레이(706)는 다른 가능성 중에서도, 콘덴서 마이크로폰(condenser microphone), 일렉트레트 콘덴서 마이크로폰(electret condenser microphone) 또는 다이내믹 마이크로폰(dynamic microphone)과 같이, 현재 알려지거나 추후에 개발되는 임의의 유형의 마이크로폰일 수 있다. 일 예시에서, 마이크로폰 어레이는 네트워크 마이크로폰에 관하여 하나 이상의 방향으로부터 오디오를 검출하도록 배열될 수 있다. 마이크로폰 어레이(706)는 주파수 범위의 일부에 민감할 수 있다. 일 예시에서, 마이크로폰 어레이(706)의 제1 서브세트는 제1 주파수 범위에 민감할 수 있는 한편, 마이크로폰 어레이의 제2 서브 세트는 제2 주파수 범위에 민감할 수 있다. 마이크로폰 어레이(706)는 오디오 소스(예컨대, 음성, 가청 사운드)의 위치 정보를 캡쳐하고/거나 배경 잡음을 필터링하는 것을 돕도록 더 배열될 수 있다. 특히, 일부 실시예에서, 마이크로폰 어레이는 복수의 마이크로폰 보다도 단일 마이크로폰만으로 구성될 수 있다.

네트워크 인터페이스(708)는 도 7을 참조하면, 다른 가능성 중에서도, CR(722), PBD(732-738), 클라우드 네트워크(702)에 있는 컴퓨팅 장치(704-708) 및 다른 네트워크 마이크로폰 장치와 같은, 다양한 네트워크 장치 간의 무선 및/또는 유선 통신을 용이하게 하도록 구성될 수 있다. 이와 같이, 네트워크 인터페이스(708)는 이러한 기능을 수행하기 위해 임의의 적합한 형태를 취할 수 있고, 그 예는 이더넷 인터페이스, 시리얼 버스 인터페이스(예컨대, FireWire, USB 2.0 등), 무선 통신을 용이하게 하도록 구성된 안테나와 칩셋 및/또는 유선 및/또는 무선 통신을 제공하는 임의의 다른 인터페이스를 포함할 수 있다. 일 예시에서, 네트워크 인터페이스(708)는 산업 표준(예컨대, 적외선, 라디오, IEEE 802.3을 포함하는 유선 표준, IEEE 802.11a, 802.11b, 802.11g, 802.11n, 802.11ac, 802.15, 4G 모바일 통신 표준을 포함하는 무선 표준 등)에 기초할 수 있다.

네트워크 마이크로폰 장치(700)의 사용자 인터페이스(710)는 네트워크 마이크로폰 장치로 사용자 상호작용을 용이하게 하도록 구성될 수 있다. 일 예시에서, 사용자 인터페이스(708)는 사용자가 네트워크 마이크로폰 장치(700)로 직접 입력을 제공하도록, 다른 가능성 중에서도 물리적 버튼, 터치 센스 스크린 및/또는 표면 상에 제공되는 그래픽 인터페이스 중 하나 이상을 포함할 수 있다. 사용자 인터페이스(710)는 사용자에게 시각적 및/또는 오디오 피드백을 제공하도록 조명 및 스피커(714) 중 하나 이상을 더 포함할 수 있다. 일 예시에서, 네트워크 마이크로폰 장치(700)는 스피커(714)를 통하여 오디오 컨텐츠를 재생하도록 더 구성될 수 있다.

III. 활성 단어를 디세이블하기 위한 재생 장치에 대한 예시적인 기법

위에서 논의된 바와 같이, 여기서 설명된 실시예는 활성 응답을 디세이블하는 것을 수반할 수 있다. 도 8은 재생 장치가 하나 이상의 NMD의 활성 응답을 디세이블하는, 예시적인 구현예(800)를 예시한다.

a. 재생을 위한 오디오 컨텐츠를 나타내는 데이터를 수신

블록(802)에서, 구현예(800)는 재생을 위한 오디오 컨텐츠를 나타내는 데이터를 수신하는 것을 수반한다. 예를 들어, 재생 장치는 재생 장치에 의한 재생을 위한 오디오 컨텐츠를 수신할 수 있다. 예시적인 재생 장치는 도 1에 도시된 재생 장치(102, 104, 106, 108, 110, 112, 114, 116, 118, 120, 122 및 124)중 임의의 것을 포함하며, 이는 예를 들어, 도 2의 재생 장치(200)에 의해 나타나는 바와 같이 구현될 수 있다. 일부 구현예에서, 재생 장치는 프로세싱 시스템(예컨대, 프로세싱 시스템(500))을 포함하고 (도 5의 오디오 입력/출력 컴포넌트(502)와 같은) 오디오 입력/출력 컴포넌트를 사용하여 오디오 컨텐츠를 나타내는 데이터를 수신할 수 있다.

예시적인 오디오 컨텐츠는 오디오 컨텐츠의 많은 다른 형태 중에서도, 하나 이상의 오디오 트랙, 토크 쇼, 영화, 텔레비전 쇼, 팟캐스트, 인터넷 스트리밍 비디오를 포함할 수 있다. 오디오 컨텐츠는 비디오(예컨대, 비디오의 오디오 트랙)에 의해 동반되는 오디오 컨텐츠 또는 비디오에 의해 동반되지 않은 오디오를 포함할 수 있다.

재생 장치는 다른 예시 중에서도, 유선 또는 무선 네트워크 인터페이스 또는 아날로그 또는 디지털 라인 인 인터페이스일 수 있는, 입력 인터페이스를 통하여 오디오 컨텐츠를 수신할 수 있다. 예를 들어, 재생 장치는 다른 가능성 중에서도, 광역 네트워크(WAN), 근거리 네트워크(LAN) 및 개인 영역 네트워크(PAN)와 같은 하나 이상의 유형의 네트워크에서 네트워크 인터페이스를 통하여 네트워크 소스로부터 오디오 컨텐츠를 수신할 수 있다.

재생 장치는 로컬 또는 원격 오디오 소스로부터 오디오 컨텐츠를 나타내는 데이터를 수신할 수 있다. 예를 들어, 재생 장치는 로컬 미디어 서버 또는 근거리 네트워크 상의 다른 장치로부터, (예컨대, 네트워크 인터페이스를 통하여 근거리 네트워크에서) 재생 장치와 통신하는 다른 장치 또는 재생 장치에 의해 판독되는 (CD, DVD, Blu-Ray, 플래시 메모리 또는 하드드라이브와 같은) 매체로부터, 또는 재생 장치 자체 상의 데이터 저장소로부터 오디오 컨텐츠를 수신할 수 있다. 재생 장치는 예컨대, 하나 이상의 클라우드 서버로부터 오디오 컨텐츠 스트림과 같은 오디오 컨텐츠를 수신할 수 있다. 예를 들어, 재생 장치는 네트워크 인터페이스를 통하여, URL로부터 오디오 컨텐츠 스트림을 검색할 수 있다. 대안적으로, 재생 장치는 (예컨대, 네트워크 인터페이스를 통하여, 근거리 네트워크에서) 재생 장치 또는 재생 장치와 통신하는 다른 장치 상의 라인 인 인터페이스로부터 오디오 컨텐츠를 수신할 수 있다.

일부 경우에서, 재생 장치는 예컨대, 아날로그 라인 인 인터페이스를 통하여, 오디오 컨텐츠를 아날로그 포맷으로 수신할 수 있다. 이러한 경우에서, 재생 장치는 (예컨대, 소프트웨어 또는 하드웨어 기반 아날로그-디지털 변환기를 사용하여) 아날로그 오디오를 프로세싱에 적합한 포맷으로 디지털화한다. 대안적으로, 재생 장치와 통신하는 장치는 아날로그 포맷으로 오디오 컨텐츠를 수신하고, 오디오 컨텐츠를 디지털화하고, 재생 장치로 오디오 컨텐츠를 나타내는 데이터를 전송할 수 있다.

위에서 언급된 바와 같이, 수신된 오디오 컨텐츠는 재생 장치에 의한 재생을 위해 설계된다. 예를 들어, (도 1의 컨트롤 장치(126 또는 128)와 같은) 컨트롤 장치는 예컨대, 일부 오디오 컨텐츠로 하여금 재생 장치의 재생 큐에 위치되도록 함으로써, 일부 오디오 컨텐츠를 재생하도록 재생 장치에 지시할 수 있다. 오디오 트랙 또는 다른 오디오 컨텐츠를 그러한 큐 안으로 위치시키는 것은, 재생 장치로 하여금, 예컨대 재생이 컨트롤 장치 또는 재생 장치 자체에 있는 컨트롤(예컨대, 재생/정지 버튼)을 통하여 개시된 이후, 오디오 컨텐츠를 검색하도록 한다. 재생 장치는 다른 예시 중에서도, 오디오 컨텐츠를 아날로그 또는 디지털 라인 인 인터페이스를 통하여 재생 장치로 향하게 하거나 오디오 컨텐츠 스트림을 네트워크 인터페이스를 통하여 재생 장치로 향하게 함으로써, 로컬 또는 원격 오디오 소스로부터 오디오 컨텐츠를 검색할 수 있다.

예시 내에서, 재생 장치는 수신된 오디오 컨텐츠의 적어도 일부를 메모리에 저장할 수 있다. 예를 들어, 재생 장치는 선입선출 버퍼(예컨대, 원형의 버퍼)에서 수신된 오디오 컨텐츠를 버퍼링할 수 있다. 이러한 구현예에서, 수신된 오디오의 부분은, 수신될 때, 버퍼에 저장되고, 수신된 오디오 컨텐츠가 활성 단어를 포함하는지를 결정하도록 재생 장치를 인에이블하도록 프로세싱됨에 따라 제거된다.

b. 오디오 컨텐츠에서 하나 이상의 활성 단어 검출

도 8을 다시 참조하면, 블록(804)에서, 구현예(800)는 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, 오디오 컨텐츠에서 하나 이상의 활성 단어를 검출하는 것을 수반한다. 예를 들어, 재생 장치는 오디오 컨텐츠를 나타내는 수신된 데이터를 분석하여 임의의 음성 서비스에 대한 활성 단어 오디오 컨텐츠에 나타나는지를 결정할 수 있고, 오디오 컨텐츠가 재생되는 경우, 활성 단어가 들을 수 있게 재생될 것이다. 위에서 언급된 바와 같이, 일부 구현예에서, 재생 장치는 프로세싱 시스템(예컨대, 프로세싱 시스템(500))을 포함하고, (도 5의 활성 단어 검출 컴포넌트(504)와 같은) 활성 단어 검출 컴포넌트를 사용하여 오디오 컨텐츠 내에서 활성 단어를 검출할 수 있다.

재생 장치는 하나 이상의 활성 단어 검출 알고리즘을 사용하여 수신된 오디오 컨텐츠를 분석할 수 있다. 예시적인 활성 단어 검출 알고리즘은 입력으로서 오디오 녹음을 받아들이고, 출력으로서 활성 단어가 녹음 내에 존재하는지의 지표를 제공한다. 많은 당사자 및 제3자 활성 단어 검출 알고리즘이 알려져 있고 상업적으로 이용 가능하다. 예를 들어, 음성 서비스의 오퍼레이터는 제3자 장치에서 사용 가능한 그들의 알고리즘을 만들 수 있다. 대안적으로, 알고리즘은 일부 활성 단어를 검출하도록 트레이닝될 수 있다.

일부 구현예에서, 재생 장치는 마이크로폰을 통하여 녹음된 오디오에서 활성 단어를 검출하기 위해 NMD에 의해 활용되는 바와 같이, 오디오 컨텐츠를 나타내는 수신된 데이터 상에 동일하거나 유사한 알고리즘을 사용할 수 있다. 그러한 방식에서, 재생 장치는 오디오 컨텐츠가 NMD의 가청 범위에서 재생되는지를 NMD가 검출할 것임에 따라, 오디오 컨텐츠에서 동일하거나 유사한 활성 단어를 검출할 수 있다. 그러나, NMD가 다양한 환경 조건(예컨대, 시끄러운 집)에서 매우 다양한 사람의 음성에 의해 말해진 마이크로폰으로 녹음된 오디오 상에 활성 단어 검출 알고리즘을 실행하는 경우, 이러한 변동성 없이 수신된 오디오 컨텐츠 상에서 동작하는 활성 단어 알고리즘은 활성 단어를 검출하는 것에서 보다 더 효과적일 수 있다.

분석 동안, 재생 장치는 각 활성 단어가 수신된 오디오 컨텐츠에서 발생하는 곳이 어디인지를 결정할 수 있다. 활성 단어를 포함하도록 결정되는 오디오 컨텐츠의 부분을 식별하는 것 이후에, 재생 장치는 하나 이상의 타임스탬프(예컨대, 활성 단어에 대한 시작 시간을 나타내는 타임스탬프와 혹은 활성 단어에 대한 중단 시간을 나타내는 다른 타임스탬프)를 사용하여 오디오 컨텐츠의 이러한 부분을 주목할 수 있다. 궁극적으로, 이러한 타임 스탬프는 각 타임 스탬프에 대응하는 활성 단어에 대한 하나 이상의 NMD의 활성 응답을 디세이블하는 데 사용될 수 있다.

일 예시에서, 재생 장치는 수신된 오디오 컨텐츠를 알려진 길이의 세그먼트로 분할할 수 있다. 이후, 재생 장치는 활성 단어가 검출된 세그먼트를 식별함으로써 의해 활성 단어를 포함하는 오디오 컨텐츠의 부분-즉, 세그먼트-을 식별한다. 예를 들어, 각 세그먼트가 3초이고, 활성 단어가 제4 세그먼트에서 검출되는 경우, 활성 단어는 녹음에서 9 내지 12초 사이에 위치된다. 일부 경우에서, 재생 장치는 오디오 녹음을 오버랩핑 세그먼트로 분리하여, 인지할 수 없는 부분(예컨대, "Hey"를 나타내는 일 섹션과 "Siri"를 나타내는 다른 세그먼트)으로 활성 단어가 쪼개지는 것을 피할 수 있다. 오디오 녹음 내에서 활성 단어의 위치를 결정하기 위한 다른 기법도 활용될 수 있다.

일부 경우에서, 재생 장치는 수신된 오디오 컨텐츠 상에 복수의 활성 단어 검출 알고리즘을 동시에(또는 실질적으로 동시에) 실행한다. 위에서 언급된 바와 같이, 다양한 음성 서비스(예컨대, AMAZON의 ALEXA®, APPLE의 SIRI® 또는 MICROSOFT의 CORTANA®)는 그들의 각 음성 서비스를 작동시키기 위한 다양한 활성 단어를 각각 사용할 수 있다. 또한, 일부 음성 서비스는 선호된 활성 단어 또는 맞춤 활성 단어를 구성하도록 사용자 선택을 허용할 수 있다. 복수의 서비스(및/또는 다양한 활성 단어)를 지원하기 위해, 재생 장치는 각 지원되는 음성 서비스에 대한 활성 단어 검출 알고리즘을 통하여 수신된 오디오 컨텐츠를 병렬로 실행할 수 있다. 예를 들어, 재생 장치는 오디오 컨텐츠가 재생 장치에 의한 재생되기 전에, 오디오 컨텐츠로 제1 음성 서비스에 대한 제1 오디오 검출 알고리즘을 적용하여 제1 음성 서비스에 대한 적어도 하나의 제1 활성 단어를 검출하고, 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, 오디오 컨텐츠로 제2 음성 서비스에 대한 제2 오디오 검출 알고리즘을 적용하여 제2 음성 서비스에 대한 적어도 하나의 제2 활성 단어를 검출할 수 있다. 재생 장치는 예컨대 각 음성 서비스에 대하여 또한, 추가적 오디오 검출 알고리즘을 오디오 컨텐츠에 적용할 수 있다.

c. 오디오 컨텐츠의 재생 동안, 하나 이상의 NMD로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블

도 8의 블록(806)에서, 구현예(800)는 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 것을 수반한다. 예를 들어, 재생 장치는 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 재생 장치의 가청 범위에 있는 NMD로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 할 수 있다. 위에서 언급된 바와 같이, 재생 장치는 알림 컴포넌트(예컨대, 도 5의 알림 컴포넌트(506))를 포함하는 프로세싱 시스템(500)을 구현할 수 있고, 알림 컴포넌트를 사용하여 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 NMD로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 할 수 있다.

위에서 언급된 바와 같이, NMD의 활성 응답은 활성 단어를 검출하는 프로그래밍된 응답을 지칭한다. 활성 응답이 인에이블되는 경우, 활성 단어를 검출하는 것에 응답하여, NMD의 활성 응답은 NMD로 하여금 마이크로폰을 통하여 특정한 활성 단어에 후속하는 음성 명령을 듣도록 한다. NMD는 음성 명령을 수행하기 위한 음성 서비스를 작동시킨다. 그러나 활성 응답이 디세이블되는 경우, NMD는 음성 명령을 듣지 않을 수 있고, 음성 명령을 수행하기 위한 음성 서비스를 작동하지 않을 것이다.

일부 구현예에서, 재생 장치 자체는 NMD를 포함한다(예컨대, NMD(700)은 재생 장치 내에 구현됨). 그러한 구현예에서, 재생 장치는, 재생 장치가 오디오 컨텐츠를 재생하는 한편, 검출된 하나 이상의 활성 단어에 대한 NMD의 활성 응답을 디세이블한다. 예를 들어, 재생 장치에서 구현되는 프로세싱 시스템(500)의 인스턴스는 하나 이상의 활성 단어 및 그 재생 시간을 NMD에 알려 NMD로 하여금 검출된 하나 이상의 활성 단어에 대한 NMD의 활성 응답을 디세이블하도록 할 수 있다. 예를 들어, 프로세싱 시스템은 다른 예시 중에서도, RAM 내 플래그를 수정하여 활성 응답을 디세이블하거나 내부 통신 버스를 사용하여 NMD에 메시징함으로써, NMD에 알릴 수 있다. 이후, 오디오 컨텐츠를 재생하는 동안, 재생 장치의 NMD는 마이크로폰을 통하여, 재생 장치에 의해 재생되는 오디오 컨텐츠를 녹음하고, 녹음된 오디오 컨텐츠 내의 하나 이상의 활성 단어에 대한 NMD의 활성 응답을 디세이블할 수 있다.

예시적인 구현예 내에서, 재생 장치는 집 내의 모든 네트워킹된 마이크로폰 장치로 하여금 각 활성 응답을 디세이블할 수 있다. 예를 들어, 도 1에 도시된 재생 장치(104)는, 재생 장치(104)가 하나 이상의 활성 단어를 포함하는 오디오 컨텐츠를 재생하면, NMD(132 및 134)로 하여금 그 각 활성 응답을 디세이블하도록 할 수 있다. 또한, 재생 장치(102 또는 106-124) 중 임의의 것이 NMD를 구현하는 경우, 재생 장치(104)는, 재생 장치(104)가 하나 이상의 활성 단어를 포함하는 오디오 컨텐츠를 재생하면, 이러한 장치로 하여금 그 각 활성 응답을 디세이블하도록 할 수 있다. 더 추가적으로, 재생 장치(104) 자체가 NMD를 구현하는 경우 또는 컨트롤 장치(126 또는 128)가 NMD를 구현하는 경우, 재생 장치(104)는, 재생 장치(104)가 오디오 컨텐츠를 재생하면, 이러한 장치로 하여금 그 각 활성 응답을 디세이블하도록 할 수 있다.

대안적으로, 재생 장치는 집 내의 NMD의 서브세트로 하여금 그들의 각 활성 응답을 디세이블하도록 할 수 있다. 예를 들어, 재생 장치는 재생 장치의 가청 범위 내의 NMD로 하여금 활성 응답을 디세이블하도록 할 수 있다. 대안적으로 재생 장치는 재생 장치와 연관되어 온 NMD로 하여금 그 각 활성 응답을 디세이블하도록 할 수 있다.

가청 범위는 임의의 적합한 기법을 사용하여 결정될 수 있다. 일부 구현예에서, 가청 범위는 재생 장치의 재생 구성에 기초하여 규정된다. 예를 들어, 재생 장치가 하나 이상의 재생 장치와 동기 재생 구성으로 있는 경우, 이러한 재생 장치는 재생 장치의 가청 범위에 있는 것으로 추정될 수 있다. 따라서, 이러한 재생 장치 중 임의의 것이 NMD를 구현하는 경우, 이러한 재생 장치의 각 활성 응답은 디세이블된다. 재생 장치는, 집에 있는 재생 장치 전반에 걸쳐 동기화되는 하나 이상의 상태 변수에 저장될 수 있는 재생 장치의 구성을 참조함으로써, 그러한 NMD가 재생 장치의 가청범위에 있다고 결정할 수 있다.

다른 예시에서, 가청 범위는 셋업 절차(예컨대, 교정 절차) 동안 규정된다. 이러한 셋업 절차 동안, 집 내의 NMD는 집에 있는 재생 장치에 의해 재생되는 오디오 신호(예컨대, 톤)를 듣도록 지시될 수 있다. NMD가 그 마이크로폰을 통하여 오디오 신호를 검출할 수 있는 경우, 그 NMD는 가청 범위 내에 있다고 추정될 수 있다. 집 내의 재생 장치는 다양한 음량에서 오디오 신호의 재생을 통해 순환하도록 지시되어, 임의의 소정의 음량 레벨에서 각 재생 장치의 가청 범위에 있는 NMD의 세트를 결정할 수 있다. 예시적인 교정 절차는 교정 사운드의 출력을 수반할 수 있으며, 이는 집 내에서 NMD에 의해 검출될 오디오 신호로서 역할할 수 있다.

예컨대, 예시적인 셋업 절차 동안, 도 1의 컨트롤 장치(126)는 주 침실 구역에 있는 재생 장치(즉, 재생 장치(122 및 124))에 지시하여 오디오 신호를 출력하도록 할 수 있다. 대부분 음량 레벨에서, 이러한 출력은 NMD(134)에 의해 검출된다. 그러나 음량 레벨이 증가됨에 따라, 다른 NMD도 출력을 검출하기 시작한다. 예를 들어, 재생 장치(118) 및 컨트롤 장치(128)는 NMD를 각각 구현하고 비교적 높은 음량 레벨에서 오디오 신호 출력을 검출할 수 있다. 이와 같이, 예시적인 셋업 절차를 통하여, NMD(134)는 일부 음량 범위(예컨대, 5% -100%)에서 재생 장치(122 및 124)의 가청 범위에 있는 것으로 규정되는 한편, 재생 장치(118) 및 컨트롤 장치(128)가 고려되는 동안, 일부 높은 음량 범위(예컨대, 음량 레벨>80%)에서 재생 장치(122 및 124)의 가청 범위에 있는 것으로 규정된다. 이러한 절차는 집 내의 NMD와 다른 재생 장치에 대하여 반복될 수 있다.

다른 예시에서, NMD는, 알려진 물리적 근접성에 기초하여 하나 이상의 재생 장치와 페어링될 수 있다. 예를 들어, 도 1을 다시 참조하면, NMD(134)는 주 침실 구역에 대한 NMD로서 재생 장치(122 및/또는 124)와 페어링될 수 있다. 그러한 페어링은 사용자 인터페이스를 통하여, 컨트롤 장치(126 또는 128)와 같은 컨트롤 장치 상에서 구성될 수 있다. 다른 예시로서, NMD(132)는, NMD가 주방 구역과 페어링되고 주방 구역이 식당/및 거실 구역에 물리적 근접성이 있는 것으로 알려진 근거 또는 주방 구역이 식당 또는 거실 구역과 구역 그룹으로 형성되는 근거로, 재생 장치(104, 106, 108, 110, 112 및 114)와 페어링 될 수 있다. NMD가 하나 이상 재생 장치와 페어링되는 경우, NMD는 이러한 재생 장치의 가청 범위 내에 있다고 추정될 수 있다.

미디어 재생 시스템의 재생 장치에 근접성에 있는 NMD의 존재를 검출하기 위한 다른 예시는 2016.4.14에 출원되고 제목이 “디폴트 재생 장치 지정”인 미국 출원 제15/098,867호; 2016.4.14에 출원되고 제목이 “디폴트 재생 장치”인 미국 출원 제15/098,892호; 제목이 “오디오 응답 재생”인 미국 출원 제15/237,133호; 및 2016.8.5에 출원되고 제목이 “오디오 재생 장치에 관하여 네트워킹된 마이크로폰 장치의 방향을 검출”인 미국 출원 제15/229,855호에서 설명된다. 이러한 출원 각각은 그 전체가 참조로서 포함된다.

위에서 제안된 바와 같이, 일부 경우에서, 재생 장치는 예컨대 구역 그룹, 스테레오 쌍 또는 서라운드 사운드 구성에서 하나 이상의 추가적인 재생 장치와 동시에 오디오를 재생하도록 구성될 수 있다. 그러한 구성은, 재생 장치의 가청 범위에 있는 임의의 NMD 또는 하나 이상의 추가적 재생 장치 중 임의의 것이 동기로 이러한 재생 장치에 의해 재생된 오디오 컨텐츠 내 활성 단어에 응답하여 잘못 트리거할 수 있음에 따라, 재생 장치의 가청 범위를 연장할 수 있다. 이와 같이, 재생 장치가 하나 이상의 추가적 재생 장치와 현재 동기화 재생 구성으로 있는 경우, 재생 장치는 가청 범위에 있거나 이러한 추가적 재생 장치와 연관된 NMD의 각 활성 응답을 디세이블할 수 있다.

일부 구현예에서, 재생 장치는 수신된 오디오 컨텐츠의 재생 동안, 하나 이상의 NMD에 대한 네트워크 인터페이스를 통하여 하나 이상의 NMD로 하여금 각 활성 응답을 디세이블하도록 하는 명령어를 네트워크 인터페이스를 통하여 하나 이상의 NMD로 송신함으로써, 하나 이상의 NMD로 하여금 검출된 하나 이상의 활성 단어에 대한 그 각 활성 응답을 디세이블하도록 한다. 위에서 언급된 바와 같이, 미디어 재생 시스템(예컨대, 컨트롤 장치, 재생 장치 및 NMD)의 다양한 장치는 근거리 네트워크를 통하여(예컨대, 도 1의 유선 또는 무선 네트워크 라우터(130)에 의해 형성된 근거리 네트워크를 통하여) 서로 연결되어 집 내의 장치 간의 다른 메시징과 명령어의 교환을 허용할 수 있다. 미디어 재생 시스템의 이러한 장치는 시스템에서 다른 장치로부터의 일부 명령에 응답하여 각각 프로그래밍될 수 있다.

일부 예시에서, 그러한 명령어는 하나 이상의 NMD가 활성 단어를, 재생 장치에 의해 재생됨에 따라 검출하는 것으로부터 방지할 수 있다. 예를 들어, 재생 장치는 하나 이상의 NMD에 지시하여, 하나 이상의 기간(즉, 예컨대 타임 스탬프에 의해 기록되는, 활성 단어가 재생 장치에 의해 재생될 때와 대응하는 기간)동안 활성 단어를 듣는 것을 멈출 수 있다(예컨대, 녹음된 오디오 프로세싱을 멈출 수 있음). 대안적으로, 재생 장치는 하나 이상의 NMD에 지시하여 그 각 마이크로폰을 일시적으로(예컨대, 위에서 언급된 기간 동안) 디세이블할 수 있다. 또 다른 예시에서, 재생 장치는 하나 이상의 NMD에 지시하여 그 마이크로폰 어레이를 사용하여, 재생 장치의 방향으로 청취 무효(listening NULL)를 생성하여 NMD가 활성 단어를 검출하지 않을 수 있다. 다른 예시도 가능하다. 예를 들어, 재생 장치가 활성 단어를 포함하는 오디오 컨텐츠의 부분을 재생하기 직전에, 재생 장치는 하나 이상의 NMD에 지시하여 활성 단어 검출을 디세이블하는 제1 메시지를 송신할 수 있다. 이후, 재생 장치가 활성 단어를 포함하는 오디오 컨텐츠의 부분을 재생한 직후에, 재생 장치는 하나 이상의 NMD에 지시하여 활성 단어 검출을 인에이블하는 제2 메시지를 송신할 수 있다.

예컨대, 도 9는 예시적인 메시지(900)를 도시하며, 이는 재생 장치가 하나 이상의 NMD로 송신하여 하나 이상의 NMD로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 할 수 있다. 메시지(900)는 (이더넷 패킷과 프레임의 구조를 명시하는) IEEE 802.3 사양과 같은, 사양과 일치할 수 있다. 도시된 바와 같이, 메시지(900)는 프리앰블(902)을 포함하며, 이는 네트워크 상의 장치(다른 것들 중에서도, 예컨대, NMD, 재생 장치 및/또는 컨트롤 장치)가 그들의 수신자 클락을 동기화 할 수 있는 교호하는 비트의 패턴을 포함한다. 메시지(900)는 또한 프리앰블(이더넷 패킷의 제1 필드)의 끝을 마크하는 프레임 구분의 시작(start of frame delimiter; SFD)(904)과 메시지의 이더넷 프레임 부분의 시작을 포함한다. 메시지(900)는 또한 목적지(예컨대, NMD) 및 소스(예컨대, 재생 장치)를 나타내는 목적지 주소(906) 및 소스 주소(908)를 포함한다. 메시지(900)는 페이로드(910)를 더 포함한다. 페이로드(910)는 NMD(즉, 목적지 주소(906)에 의해 나타나는 NMD)로 하여금 하나 이상의 활성 단어에 대한 활성 응답을 디세이블하도록 하는 명령어를 포함한다. 메시지(900)는 프레임 검사 순서(frame check sequence; FCS)(912)를 더 포함하며, 이는 수신됨에 따라 프레임 내에 손상된 데이터의 검출을 허용하는 순환 중복 검사 값이다.

명령어는 둘 이상의 이더넷 패킷(예컨대, 메시지(900) 중 둘 이상)을 사용하여 전송될 수 있다. 예를 들어, 하나의 NMD로의 명령어는 메시지(900) 중 둘 이상의 인스턴스의 페이로드 전체에 걸쳐 분할될 수 있다. 또한, 복수의 NMD로의 명령어는 메시지(900) 중 하나 이상의 각 인스턴스에서 각각 송신될 수 있다. 다른 예시도 가능하다.

예를 들어, 도 10(a), 10(b), 10(c) 및 10(d)는 하나 이상의 메시지의 페이로드(예컨대, 메시지(900)의 페이로드(910))에 있어 NMD로 전송될 수 있는 예시적인 명령어(1000A, 1000B, 1000C 및 1000D)를 예시한다. 도 10(a)에 도시된 바와 같이, 명령어(1000A)는 타임 스탬프(1004A, 1006A, 1008A 및 1010A)에 의해 정의되는 일부 기간 동안 NMD로 하여금 활성 응답을 디세이블하도록 하는 명령(1002A)을 포함한다. 일부 예시에서, 타임 스탬프(1004A 및 1006A)는, 재생 장치가 제1 활성 단어를 포함하는 오디오 컨텐츠의 부분을 재생할 기간의 시작과 끝을 각각 지정한다. 유사하게, 타임 스탬프(1008A 및 1010A)는, 재생 장치가 제2 활성 단어를 포함하는 오디오 컨텐츠의 부분을 재생할 기간의 시작과 끝을 각각 지정한다. 명령어(1000A)는 추가적인 기간을 정의하는 타임 스탬프를 더 포함할 수 있다. 대안적으로 스탬프(1004A, 1006A, 1008A 및 1010A)는 다른 예시 중에서도, 오디오의 특정한 프레임에 대한 재생 시간; 송신하거나 수신하는 장치 상의 시스템 클락에 대응하는 시간; 또는 NMD 및 재생 장치 둘 다에 대해 알려진 글로벌 클락에 대응하는 시간에 대응할 수 있다.

도 10(b)는 명령어(1000B)를 도시하며, 이는 NMD로 하여금 좌표(1004B 및 1006B)에 의해 정의되는 일부 방향에서 청취 무효를 생성하도록 하기 위한 명령(1002B)을 포함한다. 좌표(1004B 및 1006B)는 NMD에 대한 각 재생 장치의 방향을 나타낸다. 예를 들어, 도 1을 다시 참조하면, 명령어(1000B)의 예시적인 인스턴스는 NMD(134)에 대한 재생 장치(122 및 124)의 방향을 나타내기 위한 좌표(1004B 및 1006B)를 포함할 수 있다. 이러한 예시에서, 좌표(1004B 및 1006B)는 재생 장치(122)가 NMD(134)에 관하여 O°(즉, NMD(134)의 바로 정면)인 한편 재생 장치(124)는 NMD(134)에 관하여 왼쪽으로 45°에 있다는 점을 NMD에 대해서 나타낼 수 있다. 서로에 관하여 집 내에 있는 장치의 각 위치는 셋업 또는 구성 절차에 의해 미리 규정될 수 있다.

도 10(c) 및 10(d)는 명령어(1000C 및 1000D)를 각각 도시한다. 명령어(1000C)는 수신하는 NMD로 하여금 활성 단어 검출을 디세이블하도록 하기 위한 명령(1002C)을 포함한다. 재생 장치는 활성 단어를 포함하는 오디오 컨텐츠의 부분을 재생하기 직전에, 그러한 명령어를 송신할 수 있다. 명령어(1000D)는 수신하는 NMD로 하여금 활성 단어 검출을 인에이블하도록 하기 위한 명령(1002D)을 포함한다. 재생 장치는 활성 단어를 포함하는 오디오 컨텐츠의 부분을 재생한 직후, 그러한 명령어를 송신할 수 있다.

추가 예시에서, 하나 이상의 NMD는 활성 단어를 검출할 수 있지만, 재생 장치는 하나 이상의 NMD에 지시하여 활성 응답을 억제한다. 예를 들어, 재생 장치는 하나 이상의 NMD에 지시하여, 일부 기간 동안 활성 단어를 무시하거나, 일부 기간 동안 모든 오디오를 무시할 수 있다. 다른 예시도 가능하다.

다른 예시와 같이, 재생 장치는 오디오 컨텐츠에서 (또는 오디오 컨텐츠의 부분에서) 활성 단어의 수를 카운트할 수 있다. 예를 들어, 재생 장치는 예시적인 오디오 컨텐츠에서 세 개의 활성 단어를 검출할 수 있다. 위에서 언급된 바와 같이, 다양한 음성 서비스에 대한 다양한 활성 단어를 포함하는 활성 단어의 임의의 조합을 포함할 수 있다. 이후, 재생 장치는 부근에 있는 하나 이상의 NMD에 지시하여, 그들이 카운트와 같은 수의 활성 단어를 검출할 때까지 활성 단어를 무시(예컨대, 다음 세 개의 활성 단어를 무시)할 수 있다.

대안적으로, 재생 장치는 오디오 컨텐츠의 세그먼트에서 음향 마커를 포함하도록 오디오 컨텐츠를 동적으로 수정함으로써, 하나 이상의 NMD로 하여금 검출된 활성 단어에 대한 각 활성 응답을 디세이블하도록 한다. 예를 들어, 재생 장치는 녹음된 오디오 컨텐츠에서 다른 마커 또는 오디오 톤을 삽입(예컨대, 혼합)하여, 오디오 컨텐츠에서 검출된 활성 단어를 지정할 수 있다. 이후, NMD는 활성 단어와 관련하여 음향 마커를 검출하는 경우(예컨대, 활성 단어 직전 또는 활성 단어와 동시에), 활성 단어의 인스턴스를 무시하도록 지시되거나 미리 프로그래밍될 수 있다. 그러한 기법을 사용하여, 재생 장치의 가청 범위에 있는 NMD는 미리 결정되거나 추정될 필요가 없다. 그보다는, 음향 마커가 오디오 컨텐츠와 재생되므로, 오디오 컨텐츠를 검출하도록 가청 범위에 있는 (그리고 이와 같이, 이러한 컨텐츠에 의해 잘못 트리거될 수 있는) NMD는 또한 음향 마커를 검출하고 응답하여 그 활성 응답을 디세이블하기 위한 범위에 있다. 복수의 NMD가 재생 장치의 가청 범위에 있는 경우, 응답으로 활성 단어를 검출하는 각각의 NMD는 연관된 음향 마커를 검출하는 것에 응답하여 활성 단어에 대한 활성 응답을 디세이블한다.

d. 오디오 컨텐츠를 재생

도 8의 블록(808)에서, 구현예(800)는 하나 이상의 스피커를 통하여 오디오 컨텐츠를 재생하는 것을 수반한다. 재생 장치는 하나 이상의 오디오 변환기(예컨대, 스피커)를 통하여 오디오 컨텐츠를 재생한다. 일부 경우에서, 스피커는 동일한 하우징에서 재생 장치와 함께 위치된다. 대안적으로, 하나 이상의 별개의 패시브 스피커로 스피커 잭을 통하여 증폭된 오디오를 제공할 수 있다. 다른 예시로서, 재생 장치는 증폭기로 회선 레벨 오디오를 제공함으로써 오디오 컨텐츠를 재생할 수 있으며, 이는 이후 결국 스피커 잭을 통하여 하나 이상의 패시브 스피커로 증폭된 오디오를 제공한다.

위에서 언급된 바와 같이, 일부 경우에서, 재생 장치는 하나 이상의 추가적 재생 장치와 동기화 재생 구성으로 구성된다. 그러한 경우에서, 오디오 컨텐츠를 재생하는 것은 하나 이상의 추가적인 재생 장치와 동기로 오디오 컨텐츠를 재생하는 것을 수반한다. 일부 재생 구성(예컨대, 스테레오 쌍 또는 서라운드)에서, 재생 구성에 있는 각 재생 장치는 재생 구성에 있는 다른 재생 장치와 동기로 오디오 컨텐츠의 부분을 재생한다.

일부 구현예에서, 재생 장치는 재생을 위해 하나 이상의 추가적 재생 장치로 오디오 컨텐츠를 제공하여 재생 장치와 오디오 컨텐츠의 동기 재생을 용이하게 한다. 그러한 구현예에서, 재생 장치는 재생 장치와 하나 이상의 추가적인 재생 장치를 포함하는 동기화 그룹에 대하여 그룹 조정자(group coordinator)로서 동작할 수 있다. 그룹 조정자로서, 재생 장치는 또한 타이밍 정보를 하나 이상의 추가적인 재생 장치로 제공하여, 동기화 그룹이 동기 재생을 스케줄링하는 것을 용이하게 할 수 있다. 재생 장치는 네트워크 인터페이스를 통하여 오디오 컨텐츠 및/또는 타이밍 정보를 제공한다.

위에서 언급된 바와 같이, 일부 경우에서, 재생 장치는 음향 마커를 포함하도록 오디오 컨텐츠를 수정한다. 그러한 실시예에서, 재생 장치가 동기화 그룹에 있는 경우, 재생 장치는 수정된 오디오 컨텐츠를 동기화 그룹 내 다른 장치로 제공할 수 있다. 동기화 그룹 내 각 재생 장치는 이후 그룹에서 다른 재생 장치와 수정된 오디오 컨텐츠를 동기로 재생할 수 있다.

예컨대, 일 예시에서, 재생 장치(114 및 122 및 124)는 동기로 오디오 컨텐츠를 재생하도록 구성되는 구역 그룹(즉, 주방 + 주 침실 구역 그룹)에 있다. 구역 그룹에 의한 재생을 위해 지정된 오디오 컨텐츠에서 활성 단어를 검출하는 것 이후에, 재생 장치(114)는 음향 마커를 포함하여 오디오 컨텐츠에 활성 단어를 지정하도록 오디오 컨텐츠를 수정할 수 있다. 재생 장치(114)는 이후 수정된 오디오 컨텐츠를 재생 장치(122)로 제공하여 수정된 오디오 컨텐츠의 동기 재생을 용이하게 할 수 있다.

IV. 활성 응답을 디세이블하기 위한 NMD에 대한 예시적인 기법

위에서 논의된 바와 같이, 여기서 설명된 실시예는 활성 응답을 디세이블하는 것을 수반할 수 있다. 도 11은 NMD가 하나 이상의 검출된 활성 단어에 대한 활성 응답을 디세이블하는 예시적인 구현예(1100)를 예시한다.

a. 재생을 위한 오디오 컨텐츠를 나타내는 데이터를 수신

블록(1102)에서, 구현예(1100)는 녹음된 오디오 컨텐츠를 나타내는 데이터를 수신하는 것을 수반한다. 예를 들어, NMD는 재생 장치에 의한 재생을 위한 오디오 컨텐츠를 수신할 수 있다. 예시적인 NMD는 도 1에 도시된 NMD(132 및 134)중 임의의 것을 포함할 수 있으며, 이는 예를 들어, 도 7의 NMD(700)로서 구현될 수 있다. 예시적인 재생 장치는 도 1에 도시된 재생 장치(102, 104, 106, 108, 110, 112, 114, 116, 118, 120, 122 및 124) 중 임의의 것을 포함할 수 있으며, 이는, 예를 들어, 도 2의 재생 장치(200)에 의해 나타난 바와 같이 구현될 수 있다. 추가 예시적인 NMD는 그러한 장치가 재생 또는 컨트롤 장치로서 그들의 기능성에 더하여 NMD를 구현할 수 있음에 따라 이러한 재생 장치 및/또는 컨트롤 장치(126 및/또는 128) 중 임의의 것을 포함할 수 있다. NMD는 프로세싱 시스템(예컨대, 프로세싱 시스템(500))을 포함하고 (도 5의 오디오 입력/출력 컴포넌트(502)와 같은) 오디오 입력/출력 컴포넌트를 사용하여 오디오 컨텐츠를 나타내는 데이터를 수신할 수 있다.

NMD는 다른 예시 중에서도, 유선 또는 무선 네트워크 또는 아날로그 또는 디지털 라인 인 인터페이스일 수 있는 입력 인터페이스를 통하여 오디오 컨텐츠를 수신할 수 있다. 예를 들어, NMD는 다른 가능성 중에서도, WAN, LAN 및 PAN과 같은 하나 이상의 유형의 네트워크에서 네트워크 인터페이스를 통하여 네트워크 소스로부터 오디오 컨텐츠를 수신할 수 있다.

NMD는 로컬 또는 원격 오디오 소스로부터 오디오 컨텐츠를 나타내는 데이터를 수신할 수 있다. 예를 들어, NMD는 근거리 네트워크 상의 다른 장치 또는 로컬 미디어 서버로부터, NMD와 통신하는 다른 장치(예컨대, 네트워크 인터페이스를 통하여 근거리 네트워크에서 NMD로 연결되는 재생 장치)에 의해 또는 NMD에 의해 판독되는 (CD, DVD, Blu-Ray, 플래시 메모리 또는 하드 드라이브와 같은) 매체로부터 또는 NMD 자체 상의 데이터 저장소로부터 오디오 컨텐츠를 수신할 수 있다.

NMD는 오디오 컨텐츠 스트림처럼 예컨대, 하나 이상의 클라우드 서버로부터 오디오 컨텐츠를 수신할 수 있다. 예를 들어, NMD는 네트워크 인터페이스를 통하여 URL로부터 오디오 컨텐츠 스트림을 검색할 수 있다. 대안적으로, NMD는 NMD 상의 라인 인 인터페이스 또는 NMD와 통신하는 다른 장치(예컨대, 네트워크 인터페이스 통하여 근거리 네트워크에서 NMD로 연결되는 재생 장치)로부터 오디오 컨텐츠를 수신할 수 있다.

일부 경우에서, NMD는 예컨대 아날로그 라인 인 인터페이스를 통하여, 아날로그 포맷에서 오디오 컨텐츠를 수신할 수 있다. 이러한 경우에서, NMD는 프로세싱을 위해 적합한 포맷으로 (예컨대, 소프트웨어 또는 하드웨어 기반 아날로그 디지털 변환기를 사용하여) 아날로그 오디오를 디지털화한다. 대안적으로, NMD(예컨대, 재생 장치)와 통신하는 장치는 아날로그 포맷에서 오디오 컨텐츠를 수신하고, 오디오 컨텐츠를 디지털화하고, 재생 장치로 오디오 컨텐츠를 나타내는 데이터를 전송할 수 있다.

위에서 언급된 바와 같이, 수신된 오디오 컨텐츠는 재생 장치에 의한 재생을 위해 설계된다. 예를 들어, (도 1의 컨트롤 장치(126 또는 128)과 같은) 컨트롤 장치는 예컨대, 일부 오디오 컨텐츠로 하여금 재생 장치의 재생 큐에 위치되도록 함으로써 일부 오디오 컨텐츠를 재생하도록 재생 장치에 지시할 수 있다. 오디오 트랙 또는 다른 오디오 컨텐츠를 그러한 큐에 위치시키는 것은, 예컨대 재생이 컨트롤 장치 또는 재생 장치 자체 상의 컨트롤(예컨대, 재생/정지 버튼)을 통하여 개시된 이후, 재생 장치로 하여금 오디오 컨텐츠를 검색하도록 한다. NMD는 이러한 큐로 접근할 수 있다(예컨대, 큐의 컨텐츠는 LAN 또는 다른 네트워크를 통하여, NMD와 공유될 수 있음). 그러한 접근을 고려하여 볼 때, NMD는 다른 예시 중에서도, 아날로그 또는 디지털 라인 인 인터페이스를 통하여 재생 장치로 오디오 컨텐츠를 향하게 함으로써 또는 네트워크 인터페이스를 통하여 재생 장치로 오디오 컨텐츠 스트림을 향하게 함으로써, 로컬 또는 원격 오디오 소스로부터 오디오 컨텐츠를 검색할 수 있다.

일부 경우에서, 수신된 오디오 컨텐츠는 둘 이상의 재생 장치에 의한 재생을 위해 설계될 수 있다. 예를 들어, 둘 이상의 재생 장치는 동기화 그룹(예컨대, 구역 그룹, 스테레오 쌍 또는 서라운드 사운드 구성)으로 구성될 수 있다. 특정한 오디오 컨텐츠는 이러한 동기화 그룹에 의한 재생을 위해 지정될 수 있다.

예시 내에서, 프로세싱 시스템(500)은 메모리에서 수신된 오디오 컨텐츠의 적어도 일부를 저장할 수 있다. 예를 들어, 프로세싱 시스템(500)은 선입선출 버퍼(예컨대, 원형의 버퍼)에서 수신된 오디오 컨텐츠를 버퍼링할 수 있다. 이러한 구현예에서, 수신된 오디오의 부분은, 수신될 때, 버퍼에 저장되고, 수신된 오디오 컨텐츠가 활성 단어를 포함하는지를 결정하도록 재생 장치를 인에이블하도록 프로세싱됨에 따라 제거된다.

b. 오디오 컨텐츠에서 하나 이상의 활성 단어를 검출

도 11의 블록(1104)에서, 구현예(1100)는 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, 오디오 컨텐츠에서 하나 이상의 활성 단어를 검출하는 것을 수반한다. 예를 들어, NMD는 오디오 컨텐츠를 나타내는 수신된 데이터를 분석하여 임의의 음성 서비스에 대한 활성 단어가 오디오 컨텐츠에서 나타나는지를 결정할 수 있고, 오디오 컨텐츠가 재생되는 경우, 활성 단어는 들을 수 있게 재생될 것이다. 위에서 언급된 바와 같이, 일부 구현예에서, NMD는 프로세싱 시스템(예컨대, 프로세싱 시스템(500))을 포함하고, (예컨대, 도 5의 활성 단어 검출 컴포넌트(504)와 같은) 활성 단어 검출 컴포넌트를 사용하여 오디오 컨텐츠 내에서 활성 단어를 검출할 수 있다.

NMD는 하나 이상의 활성 단어 검출 알고리즘을 사용하여 수신된 오디오 컨텐츠를 분석할 수 있다. 예시적인 활성 단어 검출 알고리즘은 입력으로서 오디오 녹음을 받아들이고, 출력으로서 활성 단어가 녹음에 존재하는지 여부의 지표를 제공한다. 많은 당사자 및 제3자 활성 단어 검출 알고리즘이 알려져 있고, 상업적으로 이용 가능하다. 예를 들어, 음성 서비스의 오퍼레이터는 제3자 장치에서 사용 가능한 그들의 알고리즘을 만들 수 있다. 대안적으로, 알고리즘은 일부 활성 단어를 검출하도록 트레이닝될 수 있다.

보통의 동작에서, NMD는 마이크로폰을 통하여 집 또는 다른 환경에서 사운드(예컨대, 사람 음성)를 듣고, 그 사운드가 활성 단어를 포함하는지를 검출하도록 활성 단어 검출 알고리즘을 통하여, 그 사운드의 오디오 녹음을 실행할 것이다. 이러한 프로세스에서, NMD는 사람 음성에 의해 말해진 활성 단어를 검출하기 위해 NMD에 의해 사용되는 바와 동일하거나 유사한 알고리즘을 사용할 수 있다. 그러나, 알고리즘으로의 입력이 마이크로폰을 통하여 녹음된 오디오인 대신, 입력은 재생 장치에 의한 재생을 위한 오디오 컨텐츠이다. 이러한 방식에서, NMD는, 오디오 컨텐츠가 NMD의 가청 범위에서 재생되었는지를 NMD가 검출할 것임에 따라, 오디오 컨텐츠에서 동일하거나 비슷한 활성 단어를 검출할 수 있다. 그러나, NMD가 보통 다양한 환경 조건(예컨대, 시끄러운 집)에서 매우 다양한 사람의 음성에 의해 말해진 마이크로폰으로 녹음된 오디오 상에 활성 단어 검출 알고리즘을 실행하는 경우, 이러한 변동성 없이 수신된 오디오 컨텐츠 상에서 동작하는 활성 단어 알고리즘은 활성 단어를 검출하는 것에서 보다 더 효과적일 수 있다.

분석 동안, NMD는 각 활성 단어가 수신된 오디오 컨텐츠 발생하는 곳이 어디인지를 결정할 수 있다. 활성 단어를 포함하도록 결정되는 오디오 컨텐츠의 부분을 식별하는 것 이후에, NMD는 하나 이상의 타임스탬프(예컨대, 활성 단어에 대한 시작 시간을 나타내는 타임스탬프 및 활성 단어에 대한 중단 시간을 나타내는 예컨대, 다른 타임 스탬프)를 사용하여 오디오 컨텐츠의 이러한 부분을 주목할 수 있다. 궁극적으로, 이러한 타임 스탬프는 각 타임 스탬프에 대응하는 활성 단어에 대한 NMD의 활성 응답을 디세이블하는 데 사용될 수 있다.

일 예시에서, NMD는 수신된 오디오 컨텐츠를 알려진 길이의 세그먼트로 분할할 수 있다. 이후, NMD는, 활성 단어가 검출된 세그먼트를 식별함으로써 활성 단어를 포함하는 오디오 컨텐츠의 부분-즉, 세그먼트-을 식별할 수 있다. 예를 들어, 각 세그먼트가 4초이고, 활성 단어가 제6 세그먼트에서 검출되는 경우, 활성 단어는 녹음에서 20 내지 24초 사이에 위치된다. 일부 경우에서, NMD는 오디오 녹음을 오디오 녹음을 오버랩핑 세그먼트로 분리하여, 인지할 수 없는 부분(예컨대, "Hey"를 나타내는 일 섹션 및 "Alexa"를 나타내는 다른 세그먼트)으로 활성 단어가 쪼개지는 것을 피할 수 있다. 오디오 녹음 내에서 활성 단어의 위치를 결정하기 위한 다른 기법 또한 활용될 수 있다.

일부 경우에서, NMD는 수신된 오디오 컨텐츠 상에서 동시에 복수의 활성 단어 검출 알고리즘을 실행한다. 위에서 언급된 바와 같이, 다양한 음성 서비스(예컨대, AMAZON의 ALEXA®, APPLE의 SIRI® 또는 MICROSOFT의 CORTANA®)는 그들의 각 음성 서비스를 작동시키기 위한 다양한 활성 단어를 각각 사용할 수 있다. 또한, 각 음성 서비스는 복수의 활성 단어 및/또는 맞춤 활성 단어를 지원할 수 있다. 복수의 음성 서비스를 지원하기 위해, NMD는 각 지원된 음성 서비스에 대한 활성 단어 검출 알고리즘을 통하여 수신된 오디오 컨텐츠를 병렬로 실행하여, 오디오 컨텐츠에서 나타날 수 있는 다양한 활성 단어를 검출할 수 있다. 예를 들어, NMD는 제1 음성 서비스에 대한 제1 오디오 검출 알고리즘을 적용하여 제1 음성 서비스에 대한 적어도 하나의 제1 활성 단어를 검출하고, 제2 음성 서비스에 대한 제2 오디오 검출 알고리즘을 적용하여 제2 음성 서비스에 대한 적어도 하나의 제2 활성 단어를 검출할 수 있다. 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, NMD는 예컨대 각 음성 서비스에 대하여, 오디오 컨텐츠에 대한 추가적인 오디오 검출 알고리즘도 적용할 수 있다.

c. 오디오 컨텐츠의 재생 동안, 검출된 하나 이상의 활성 단어에 대한 활성 응답을 디세이블함

도 11의 블록(1106)에서, 구현예(1100)는 오디오 컨텐츠의 재생 동안, 검출된 하나 이상의 활성 단어에 대한 활성 응답을 디세이블하는 것을 수반한다. 예를 들어, NMD는 오디오 컨텐츠가 재생 장치에 의해 들릴 수 있게 재생되는 경우, 오디오 컨텐츠에서 검출된 하나 이상의 활성 단어에 대한 활성 응답을 디세이블할 수 있다.

위에서 언급된 바와 같이, NMD의 활성 응답은 활성 단어 검출에 대한 프로그래밍된 응답을 지칭한다. 활성 응답이 인에이블되는 경우, 활성 단어를 검출하는 것에 응답하여, NMD의 활성 응답은 NMD로 하여금 마이크로폰을 통하여, 특정 활성 단어에 후속하는 음성 명령을 듣도록 한다. NMD는 음성 명령을 수행하기 위한 음성 서비스를 작동시킬 수 있다. 그러나 활성 응답이 디세이블되는 경우, NMD는 음성 명령을 듣지 않을 수 있고, 음성 명령을 수행하기 위한 음성 서비스를 작동시키지 않을 것이다.

일부 구현예에서, NMD는 NMD가 활성 단어를, 재생 장치에 의해 재생됨에 따라 검출하는 것으로부터 방지함으로써 그 활성 응답을 디세이블한다. 예를 들어, NMD는 하나 이상의 기간 (즉, 예컨대 타임 스탬프에 의해 기록되는, 활성 단어가 재생 장치에 의해 재생될 때와 대응하는 기간)동안 활성 단어를 듣는 것을 중단(예컨대, 녹음된 오디오 프로세싱을 중단)할 수 있다. 대안적으로, NMD는 그것의 마이크로폰을 일시적으로(예컨대, 위에서 언급된 기간 동안) 디세이블할 수 있다. 또 다른 예시에서, NMD는 그 마이크로폰 어레이를 사용하여 재생 장치의 방향으로 청취 무효를 생성하여 NMD가 활성 단어를 검출하지 않을 수 있다. 다른 예시도 가능하다.

추가 예시에서, NMD는 활성 단어를, 재생 장치에 의해 재생됨에 따라 검출하지만, 검출된 활성 단어에 대한 활성 응답을 억제한다. 예를 들어, NMD는 일부 기간 동안 활성 단어를 무시하거나, 일부 기간 동안 모든 오디오를 무시할 수 있다. 다른 예시도 가능하다.

다른 예시에서, NMD는 오디오 컨텐츠에서 (또는 오디오 컨텐츠의 부분에서) 활성 단어의 수를 카운트할 수 있다. 예를 들어, NMD는 예시적인 오디오 컨텐츠에서 세 개의 활성 단어를 검출할 수 있다. 위에서 언급된 바와 같이, 이러한 인스턴스는 다양한 음성 서비스에 대한 다양한 활성 단어를 포함하는, 활성 단어의 임의의 조합을 포함할 수 있다. 이후, NMD는 카운트와 같은 수의 활성 단어를 검출할 때까지 (예컨대, 다음 세 개의 활성 단어를 무시함으로써) 활성 응답을 디세이블할 수 있다.

대안적으로, NMD는 오디오 컨텐츠의 세그먼트에 음향 마커를 포함하도록 오디오 컨텐츠를 수정함으로써, 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블한다. 예를 들어, NMD는 녹음된 오디오 컨텐츠에서 다른 마커 또는 오디오 톤을 삽입(예컨대, 혼합)하여, 오디오 컨텐츠에서 검출된 활성 단어를 지정할 수 있다. 이후, NMD가 그러한 오디오 마커를 검출하는 것에 응답하여 활성 응답을 디세이블하도록 프로그래밍되는 경우, NMD는, 재생 장치에 의해 재생되는 오디오 컨텐츠에서 활성 단어를 검출하면, 활성 응답을 자동적으로 억제할 것이다.

일부 예시에서, NMD는 활성 단어가 재생 장치에 의해 재생되는 경우, 하나 이상의 추가적인 네트워킹된 마이크로폰 장치로 하여금 검출된 활성 단어에 대한 각 활성 응답을 디세이블할 수 있다. 예를 들어, 도 1을 참조하면, NMD(132)는 NMD(134)로 하여금 활성 응답을 디세이블하도록 할 수 있다. 또한, 집 내의 재생 장치 및/또는 컨트롤 장치 중 임의의 것은 NMD를 구현할 수 있고, NMD(132)는 또한 이러한 재생 장치 중 임의의 것의 활성 응답을 디세이블할 수 있다.

NMD는 집 내의 NMD의 특정한 세트를 디세이블할 수 있다. 일부 경우에서, 디세이블된 활성 응답을 가지는 NMD의 세트는 구역 또는 미디어 재생 시스템의 구역 그룹 구성에 기초한다. 예를 들어, NMD가 특정한 구역과 연관되는 경우 (예컨대, NMD(132)가 주방 구역과 연관되는 경우), NMD는 동일한 구역과도 연관되는 임의의 NMD의 각 활성 응답이 디세이블되도록 할 수 있다. 이러한 NMD는 NMD(예컨대, 재생 장치) 및 전용 NMD를 구현하는 다양한 장치를 포함할 수 있다. 또한, NMD가 연관되는 특정한 구역이 구역 그룹 내 하나 이상의 추가적 구역과 연결되는 경우, NMD는 하나 이상의 추가적 구역과도 연관되는 임의의 NMD의 각 활성 응답이 또한 디세이블되도록 할 수 있다. 위에서 나타난 바와 같이, 연관성이 미디어 재생 시스템의 구역과 NMD 사이에 생성되어, 예컨대 집의 특별 공간(예컨대, 주방 구역)에서 협력을 용이하게 할 수 있다.

대안적으로, 디세이블된 활성 응답을 가지는, 특정한 추가적인 NMD는 활성 단어를 포함하는 오디오 컨텐츠를 재생하는 재생 장치의 가청 범위에 기초한다. 가청 범위는 임의의 적합한 기법을 사용하여 결정될 수 있다. 일부 구현예에서, 가청 범위는 위에서 나타난 바와 같이, 하나 이상의 구역과 NMD의 연관성에 기초하여 규정된다. 다른 예시에서, 가청 범위는 위의 섹션 III에서 설명된 바와 같이, 셋업 절차(예컨대, 교정 절차) 동안 규정된다. 구역 구성 및/또는 셋업 절차에 의해 규정된 가청 범위는 하나 이상의 상태 변수로서 저장되고 네트워크(예컨대, 도 1에 도시된 집 내의 라우터(130)에 의해 규정되는 LAN) 내의 장치 중에서 공유될 수 있다. 그러한 정보에 접근함으로써, NMD는, 오디오 컨텐츠를 재생할 재생 장치의 가청 범위에 있을 NMD의 세트를 결정하고, NMD의 이러한 세트의 각 활성 응답으로 하여금 디세이블되도록 한다.

예컨대, 일 예시에서, 도 1 내 NMD(132)는 주방 구역에 있는 재생 장치(114)에 의한 재생을 위해 설계된 소정의 오디오 컨텐츠에 있는 하나 이상의 활성 단어를 검출한다. 따라서, NMD(132)는 이러한 활성 단어에 대한 활성 응답을 디세이블한다. 재생 장치(114) 또한 NMD이므로, NMD(132)는 재생 장치(114)의 활성 응답을 디세이블 한다. 또한, 주방 구역이 식당 구역이 있는 구역 그룹에 있으므로, NMD(132)는 또한 NMD인 재생 장치(112)의 활성 응답을 또한 디세이블하여, 오디오 컨텐츠가 주방 구역에서 식당 구역과 동기로 재생되면, 재생 장치의 NMD(112)는 잘못 트리거하지 않는다.

다른 예시에서, 도 1에서 NMD(134)는 주 침실 구역 내 재생 장치(122 및 124)에 의한 재생을 위해 설계된 소정의 오디오 컨텐츠에 있는 하나 이상의 활성 단어를 검출한다. 따라서, NMD는 이러한 활성 단어에 대한 활성 응답을 디세이블한다. 재생 장치(116)가 NMD를 구현하고 현재 음량 레벨에서 재생 장치(122 및 124)의 가청 범위에 있도록 미리 규정되었으므로, NMD(134)는 또한 재생 장치(116)의 활성 응답을 디세이블한다. NMD(134)는 라우터(130)에 의해 생성된 LAN을 통하여 NMD(134)와 공유된 하나 이상의 상태 변수로부터 현재 음량 레벨에서 재생 장치(122 및 124)의 가청 범위에 있는 것을 인식한다. 그러한 상태 변수는 재생 장치(122 및 124)(예컨대, 스테레오 쌍)의 현재 재생 구성과 같은 미디어 재생 시스템(100)의 다양한 양상의 상태와 어떤 NMD가 재생 구성 및 음량 레벨에서 이러한 재생 장치의 가청 범위 내에 있는지 결정되었는지 NMD(134)에 나타낸다.

NMD는 임의의 적합한 기법을 사용하여 하나 이상의 추가적 NMD로 하여금 각 활성 응답을 디세이블할 수 있다. NMD는 알림 컴포넌트(예컨대, 도 5의 알림 컴포넌트(506))를 포함하는 프로세싱 시스템(500)을 구현하고, 알림 컴포넌트를 사용하여 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 NMD의 세트로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 할 수 있다.

일부 구현예에서, NMD는 네트워크 인터페이스를 통하여, 하나 이상의 NMD로 명령어를 송신함으로써, 수신된 오디오 컨텐츠의 재생 동안, 하나 이상의 추가적 NMD로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 하는데, 명령어는 하나 이상의 NMD로 하여금 각 활성 응답을 디세이블하도록 한다. 위에서 언급된 바와 같이, 미디어 재생 시스템(예컨대, 컨트롤 장치, 재생 장치 및 NMD)의 다양한 장치는 근거리 네트워크를 통하여(예컨대, 도 1의 유선 또는 무선 네트워크 라우터(130)에 의해 형성된 근거리 네트워크를 통하여) 서로 연결되어 집 내의 장치 간의 명령어와 다른 메시징의 교환을 허용할 수 있다. 이러한 미디어 재생 시스템의 장치는 시스템에 있는 다른 장치로부터 일부 명령어에 응답하도록 각각 프로그래밍될 수 있다. 예시적인 메시지 및 명령어는 도 9 및 도 10(a), 10(b), 10(c) 및 10(d)와 관련하여 위에서 설명된다.

대안적으로, NMD는, 오디오 컨텐츠의 세그먼트에 음향 마커를 포함하도록 오디오 컨텐츠를 수정함으로써, 하나 이상의 NMD로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 한다. 이러한 기법을 사용하여, 재생 장치의 가청 범위에 있는 NMD는 미리 결정되거나 추정될 필요가 없다. 그보다는, 음향 마커가 오디오 컨텐츠와 재생되므로, 오디오 컨텐츠를 검출하도록 가청 범위 내에 있는(및 이와 같이, 이러한 컨텐츠에 의해 잘못 트리거될 수 있는) NMD는 또한 음향 마커를 검출하고 그 활성 응답을 응답하여 디세이블기 위한 범위 내에 있다. 복수의 NMD가 NMD의 가청 범위에 있는 경우, 응답하여 각 활성 단어를 검출하는 각각의 NMD는 연관된 음향 마커를 검출하는 것에 응답하여 활성 단어에 대한 활성 응답을 디세이블한다.

일부 구현예에서, NMD가 오디오 컨텐츠를 수정하는 바와 같이, NMD는 오디오 컨텐츠를 재생 장치에 제공한다. 이러한 경우에서, NMD는 오디오 컨텐츠의 소스와 재생 장치 사이의 중재자로서 동작할 수 있다. 오디오 컨텐츠를 재생 장치로 전송하는 것은 재생 장치가 수신된 오디오 컨텐츠를 재생하도록 구성될 수 있음에 따라, 재생 장치로 하여금 오디오 컨텐츠를 재생하도록 할 수 있다. NMD는 네트워크 인터페이스와 같은, 임의의 적합한 통신 인터페이스를 통하여 오디오 컨텐츠를 재생 장치로 제공할 수 있다. 복수의 재생 장치가 오디오 컨텐츠를 재생하도록 구성되는 경우, NMD는 오디오 컨텐츠를 재생 장치 모두에 제공할 수 있거나, NMD는 오디오 컨텐츠를 예컨대, 동기 재생을 스케줄링하기 위한 타이밍 정보에 따라 오디오 컨텐츠를 그룹 내 다른 재생 장치로 분배하는 재생 장치의 서브 세트(예컨대, 그룹 조정자)로 전송할 수 있다.

예컨대, 일 예시에서, 재생 장치(112 및 114)는 동기로 오디오 컨텐츠를 재생하도록 구성되는 구역 그룹(즉, 주방 + 식당 구역 그룹)에 있다. 구역 그룹에 의한 재생을 위해 지정된 오디오 컨텐츠에서 활성 단어를 검출하는 것 이후, NMD(132)는 오디오 컨텐츠를 수정하여 오디오 컨텐츠에 있는 활성 단어를 지정하도록 음향 마커를 포함할 수 있다. 재생 장치(132)는 이후 수정된 오디오 컨텐츠를 재생 장치(112 및/또는 114)에 제공하여 수정된 오디오 컨텐츠의 동기 재생을 용이하도록 할 수 있다.

d. 재생되는 오디오 컨텐츠 검출

블록(1108)에서, 구현예(1100)는 마이크로폰을 통하여 재생되는 오디오 컨텐츠를 검출하는 것을 포함한다. 예를 들어, 재생 장치가 하나 이상의 검출된 활성 단어를 포함하는 오디오 컨텐츠를 재생하는 한편, NMD는 마이크로폰을 통하여 재생되는 오디오 컨텐츠를 검출할 수 있다. NMD의 활성 응답이 인에이블되는 구성에서, 활성 단어를 포함하는 재생되는 오디오 컨텐츠의 부분을 검출하는 것은 NMD의 활성 응답을 트리거할 것이다. 그러나, NMD가 오디오 컨텐츠에서 하나 이상의 활성 단어에 대한 활성 응답을 디세이블했으므로, 활성 응답은 트리거되지 않는다.

일부 구현예에서, 재생 장치는 NMD를 구현한다. 이러한 예시에서, 재생 장치는 하나 이상의 스피커를 통하여 수신된 오디오 컨텐츠를 재생할 수 있다. 일부 경우에서, 스피커는 동일한 하우징에 NND와 함께 위치된다. 대안적으로, 재생 장치는 증폭된 오디오를 스피커 잭을 통하여 하나 이상의 별개의 패시브 스피커로 제공할 수 있다. 다른 예시로서, 재생 장치는 라인 레벨 오디오를 증폭기로 제공하고, 이는 이후 차례로, 증폭된 오디오를 스피커 잭을 통하여 하나 이상의 패시브 스피커로 제공함으로써, 오디오 컨텐츠를 재생할 수 있다.

일부 경우에서, NMD는 하나 이상의 추가적인 재생 장치가 있는 동기화 재생 구성으로 구성될 수 있다. 그러한 경우에서, 오디오 컨텐츠를 재생하는 것은 하나 이상의 추가적인 재생 장치와 동기로 오디오 컨텐츠를 재생하는 것을 수반한다. 일부 재생 구성(예컨대, 스테레오 쌍 또는 서라운드)에서, 재생 구성에 있는 각각의 재생 장치는 재생 구성에 있는 다른 재생 장치와 동기로 오디오 컨텐츠의 부분을 재생한다.

위에서 언급된 바와 같이, 일부 구현예에서, NMD는 재생을 위한 하나 이상의 재생 장치로 오디오 컨텐츠를 제공한다. 일부 예시에서, NMD는 하나 이상의 재생 장치로 오디오 컨텐츠를 제공하여 NMD와 그 오디오 컨텐츠의 동기 재생을 용이하게 하도록 한다. 이러한 구현예에서, NMD는 NMD 및 하나 이상의 추가적인 재생 장치를 포함하는 동기 그룹을 위한 그룹 중재자로서 동작할 수 있다. 그룹 중재자로서, NMD는 추가적으로 하나 이상의 추가 재생 장치로 타이밍 정보를 제공하여 동기 그룹이 동기 재생을 스케줄링하는 것을 용이하게 할 수 있다. 재생 장치는 네트워크 인터페이스를 통하여 오디오 컨텐츠 및/또는 타이밍 정보를 제공한다.

V. 활성 응답을 디세이블하기 위한 컴퓨팅 시스템에 대한 예시적인 기법

위에서 논의된 바와 같이, 여기서 설명된 실시예는 활성 응답을 디세이블하는 것을 수반할 수 있다. 도 12는 컴퓨팅 시스템이 오디오 컨텐츠 내 하나 이상의 활성 단어에 대한 하나 이상의 NMD의 활성 응답을 디세이블하는 예시적인 구현예(1200)를 예시한다. 다양한 실시예에서, 컴퓨팅 시스템은 클라우드 서버일 수 있다. 대안적으로, 컴퓨팅 시스템은 로컬 프로세싱 장치(예컨대, 미디어 재생 시스템처럼 동일한 LAN으로 연결되는 장치)일 수 있다. 컴퓨팅 시스템은 재생 장치 또는 NMD를 구현할 수 있다.

a. 녹음된 오디오 컨텐츠를 나타내는 데이터를 수신

블록(1202)에서, 구현예(1200)는 녹음된 오디오 컨텐츠를 나타내는 데이터를 수신하는 것을 수반한다. 예를 들어, 컴퓨팅 시스템은 재생 장치에 의한 재생을 위한 오디오 컨텐츠를 수신할 수 있다. 예시적인 재생 장치는 도 1에 도시된 재생 장치(102, 104, 106, 108, 110, 112, 114, 116, 118, 120, 122 및 124) 중 임의의 것을 포함하며, 이는 예를 들어, 도 2의 재생 장치(200)에 의해 나타나는 바와 같이 구현될 수 있다. 프로세싱 시스템은 프로세싱 시스템(예컨대, 프로세싱 시스템(500))을 포함할 수 있고 (도 5의 오디오 입력/출력 컴포넌트(502)와 같은) 오디오 입력/출력 컴포넌트를 사용하여 오디오 컨텐츠를 나타내는 데이터를 수신할 수 있다. 컴퓨팅 시스템은 위의 섹션 II, III 및 IV에서 논의된 기법과 같이 임의의 적합한 기법을 사용하여 오디오 컨텐츠를 수신할 수 있다.

b. 오디오 컨텐츠에서 하나 이상의 활성 단어 검출

도 12의 블록(1204)에서, 구현예(1200)는 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, 오디오 컨텐츠에서 하나 이상의 활성 단어를 검출하는 것을 수반한다. 예를 들어, 컴퓨팅 시스템은 오디오 컨텐츠를 나타내는 수신된 데이터를 분석하여 임의의 음성 서비스에 대한 활성 단어가 오디오 컨텐츠에서 나타나는지를 결정할 수 있어, 오디오 컨텐츠가 재생될 때, 활성 단어는 들릴 수 있게 재생될 것이다. 위에서 언급된 바와 같이, 일부 구현예에서, 컴퓨팅 시스템은 프로세싱 시스템(예컨대, 프로세싱 시스템(500))을 포함하고, (도 5의 활성 단어 검출 컴포넌트(504)와 같은) 활성 단어 검출 컴포넌트를 사용하여 오디오 컨텐츠 내의 활성 단어를 검출할 수 있다. 컴퓨팅 시스템은 위의 섹션 II, III 및 IV에서 논의된 기법과 같이 임의의 적합한 기법을 사용하여 활성 단어를 검출할 수 있다.

c. 오디오 컨텐츠의 재생 동안, 하나 이상의 NMD로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블함

도 12의 블록(1206)에서, 구현예(1200)는 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 하는 것을 수반한다. 예를 들어, 컴퓨팅 시스템은 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 재생 장치의 가청 범위에 있는 NMD로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 할 수 있다. 위에서 언급된 바와 같이, 컴퓨팅 시스템은 알림 컴포넌트(예컨대, 도 5의 알림 컴포넌트(506))를 포함하는 프로세싱 시스템(500)을 구현할 수 있고, 알림 컴포넌트를 사용하여 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 NMD로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 할 수 있다. 컴퓨팅 시스템은 위의 섹션 II, III 및 IV에서 논의된 기법과 같이 임의의 적합한 기법을 사용하여 오디오 컨텐츠의 재생 동안, 하나 이상의 NMD로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 할 수 있다.

VI. 활성 응답을 억제하기 위한 예시적인 기법

위에서 논의된 바와 같이, 여기서 설명된 실시예는 활성 응답을 억제하는 것을 수반할 수 있다. 도 13은 NMD가 활성 응답을 디세이블하는 예시적인 구현예(1300)를 예시한다.

a. 하나 이상의 활성 단어에 대한 NMD의 활성 응답을 디세이블하도록 하는 명령어를 수신

블록(1302)에서, 구현예(1300)는 하나 이상의 활성 단어에 대한 NMD의 활성 응답을 디세이블하도록 하는 명령어를 수신하는 것을 수반한다. 예를 들어, NMD(예컨대, NMD(132))는 다른 NMD, 재생 장치, 컴퓨팅 시스템 또는 임의의 다른 장치로부터 명령어를 수신할 수 있다. 명령어는 NMD로 하여금, 하나 이상의 재생 장치에 의한 재생을 위해 지정된 일부 오디오 컨텐츠에서 나타나는 하나 이상의 활성 단어에 대한 활성 응답을 디세이블하도록 한다.

일부 구현예에서, 하나 이상의 활성 단어에 대한 NMD의 활성 응답을 디세이블하기 위한 수신된 명령어가 내포된다. 예를 들어, NMD는, 다른 예시 중에서도, 예컨대 활성 단어를 듣는 것을 멈추도록 NMD에 지시함으로써, 기간 동안 NMD의 마이크로폰 어레이를 디세이블함으로써, 또는 재생 장치의 방향에서 청취 무효(listening NULL)를 생성함으로써, 활성 단어를 재생 장치에 의해 재생됨에 따라 검출하지 않도록 지시될 수 있다. 대안적으로, NMD는 활성 단어를 검출할 수 있지만, 예컨대 일부 기간 동안 활성 단어를 무시함으로써 또는 일부 기간 동안 모든 오디오를 무시함으로써, 활성 단어를 검출하는 것에 응답하여 음성 서비스를 작동시키기 위한 프로그래밍된 활성 응답을 억제하도록 지시될 수 있다. NMD는 위의 섹션 II, III 및 IV에서 논의된 바와 같이, 임의의 적합한 명령어를 사용하여 지시될 수 있다.

대안적으로, 수신된 명령어가 내포된다. 예를 들어, 위에서 설명된 바와 같이, 오디오 컨텐츠는 활성 단어를 지정하는 음향 마커를 포함하도록 수정될 수 있다. 이러한 구현예에서, 수신된 명령어는 음향 마커의 형태로 있을 수 있다. 일부 경우에서, 수신된 명령어는 음향 마커가 검출되는 경우, NMD의 활성 응답을 디세이블하기 위한 명령어일 수 있다.

b. 하나 이상의 재생 장치에 의해 재생되는 오디오 컨텐츠 검출

도 13의 블록(1304)에서, 구현예(1300)는 하나 이상의 재생 장치에 의해 재생되는 오디오 컨텐츠를 검출하는 것을 수반한다. 예를 들어, NMD는 마이크로폰을 통하여 단일 재생 장치에 의해 재생되는 오디오 컨텐츠를 검출할 수 있다. 대안적으로 NMD는 (예컨대, 동시에) 둘 이상의 장치에 의해 재생되는 오디오 컨텐츠를 검출할 수 있다.

c. 검출된 오디오 컨텐츠가 하나 이상의 활성 단어를 포함한다고 결정

도 13의 블록(1306)에서, 구현예(1300)는 검출된 오디오 컨텐츠가 하나 이상의 활성 단어를 포함한다고 결정하는 것을 수반한다. 예를 들어, NMD는 하나 이상의 활성 단어 검출 알고리즘을 통해 검출된 오디오 컨텐츠를 실행함으로써, 검출된 오디오 컨텐츠가 하나 이상의 활성 단어를 포함한다고 결정할 수 있다. 일부 경우에서, NMD는 복수의 활성 단어 검출 알고리즘(예컨대, 예컨대, 다양한 음성 서비스를 위한 다양한 활성 단어에 대한 활성 단어 알고리즘)을 통해 검출된 오디오 컨텐츠를 실행할 수 있다. 예시적인 활성 단어 검출 알고리즘은 본 개시의 전반에 걸쳐 설명된다.

d. 검출된 오디오 컨텐츠에서 하나 이상의 활성 단어에 대한 NMD의 활성 응답을 디세이블

도 13의 블록(1308)에서, 구현예(1300)는 검출된 오디오 컨텐츠에 있는 하나 이상의 활성 단어에 대한 NMD의 활성 응답을 디세이블하는 것을 수반한다. 위에서 언급된 바와 같이, NMD의 활성 응답은 활성 단어를 검출하는 것에 대한 프로그래밍된 응답을 지칭한다. 활성 응답이 인에이블되는 경우, 활성 단어를 검출하는 것에 응답하여, NMD의 활성 응답은 NMD로 하여금, 마이크로폰을 통하여, 특정 활성 단어에 후속하는 음성 명령을 듣도록 한다. NMD는 음성 서비스를 작동시켜 음성 명령을 수행한다. 그러나 활성 응답이 디세이블되는 경우, NMD는 음성 명령을 듣지 않을 수 있고, 음성 명령을 수행하기 위한 음성 서비스를 작동시키지 않을 것이다.

VII. 결론

위 설명은 다른 컴포넌트 중에서도 하드웨어 상에서 실행되는 펌웨어 및/또는 소프트웨어를 포함하는, 다른 것들 중에서도, 다양한 예시적인 시스템, 방법, 장비 및 제품을 개시한다. 이러한 예시는 단지 예시적이며, 제한하는 것으로 간주되어서는 안된다고 이해된다. 예를 들어, 펌웨어, 하드웨어 및/또는 소프트웨어 태양 또는 컴포넌트 중 임의의 것 또는 모두가 하드웨어로만, 소프트웨어로만, 펌웨어로만 또는 하드웨어, 소프트웨어 및/또는 펌웨어의 임의의 조합으로 구현될 수 있음이 고려된다. 따라서, 제공되는 예시는 그러한 시스템, 방법, 장비 및/또는 제품을 구현하기 위한 유일한 방식이 아니다.

(특징 1) 재생 장치를 통하여, 재생 장치에 의한 재생을 위한 오디오 컨텐츠를 나타내는 데이터를 수신하는 단계; 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, 오디오 컨텐츠에서, 하나 이상의 음성 서비스에 대한 하나 이상의 활성 단어를 검출하는 단계; 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블(disable)하는 단계 - 인에이블(enable)되는 경우, 특정 활성 단어에 대한 소정의 네트워킹된 마이크로폰 장치의 활성 응답은 소정의 네트워킹된 마이크로폰 장치로 하여금 마이크로폰을 통해, 특정 활성 단어에 후속하는 음성 명령을 듣도록 함-; 및 하나 이상의 스피커를 통하여 오디오 컨텐츠를 재생하는 단계를 포함하는 방법.

(특징 2) 특징 1의 방법에 있어서, 재생 장치는 소정의 네트워킹된 마이크로폰 장치를 포함하고, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블(disable)하는 단계는, 오디오 컨텐츠를 재생하는 동안, 마이크로폰을 통하여, 재생되는 오디오 컨텐츠를 녹음하는 단계; 및 녹음된 오디오 컨텐츠 내에서의 하나 이상의 활성 단어에 대한 소정의 네트워킹된 마이크로폰 장치의 각 활성 응답을 디세이블하는 단계를 포함하는, 방법.

(특징 3) 특징 1의 방법에 있어서, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블(disable)하는 단계는 네트워크 인터페이스를 통해 하나 이상의 네트워킹된 마이크로폰 장치로, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 하는 명령어를 송신하는 단계를 포함하는, 방법.

(특징 4) 특징 2의 방법에 있어서, 하나 이상의 네트워킹된 마이크로폰 장치는 집(household) 내 네트워킹된 마이크로폰 장치의 서브 세트(subset)이고, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블(disable)하는 단계는 하나 이상의 네트워킹된 마이크로폰 장치가 오디오 컨텐츠의 가청 부근(audible vicinity)에 있다고 결정하는 단계 및 하나 이상의 네트워킹된 마이크로폰 장치가 오디오 컨텐츠의 가청 부근에 있다고 결정하는 것에 응답하여, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 마이크로폰 장치로 하여금 하나 이상의 활성 단어에 대한 각 활성 단어를 디세이블하도록 하는 명령어를 송신하는 단계를 포함하는 방법.

(특징 5) 특징 4의 방법에 있어서, 하나 이상의 네트워킹된 마이크로폰 장치는 각각의 재생 장치를 포함하고, 하나 이상의 네트워킹된 마이크로폰 장치가 오디오 컨텐츠의 가청 부근에 있다고 결정하는 단계는 하나 이상의 네트워킹된 마이크로폰 장치가 재생 장치와 동기화 재생 구성으로 있다고 결정하는 단계를 포함하는, 방법.

(특징 6) 특징 4의 방법에 있어서, 하나 이상의 네트워킹된 마이크로폰 장치가 오디오 컨텐츠의 가청 부근에 있다고 결정하는 단계는 하나 이상의 네트워킹된 마이크로폰 장치가 재생 장치의 가청 부근에 있다고 결정하는 단계를 포함하는, 방법.

(특징 7) 특징 1의 방법에 있어서, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 단계는 오디오 컨텐츠를 재생하기 전에, 오디오 컨텐츠를 수정하여 각 활성 단어를 나타내는 오디오 컨텐츠의 세그먼트에 음향 마커(acoustic marker)를 포함시키는 단계를 포함하고, 음향 마커를 검출하는 것은 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 하는 것인, 방법.

(특징 8) 특징 1의 방법에 있어서, 하나 이상의 활성 단어를 검출하는 단계는 복수의 활성 단어 검출 알고리즘을 오디오 컨텐츠에 적용하는 단계를 포함하고, 복수의 활성 단어 검출 알고리즘은 제1 음성 서비스에 대한 제1 활성 단어 검출 알고리즘과 제2 음성 서비스에 대한 제2 활성 단어 검출 알고리즘을 포함하고, 오디오 컨텐츠가 재생 장치에 의해서 재생되기 전에, 복수의 활성 단어 검출 알고리즘을 오디오 컨텐츠에 적용하는 단계는, 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, 오디오 컨텐츠에 제1 음성 서비스에 대한 제1 오디오 검출 알고리즘을 적용하여 제1 음성 서비스에 대한 적어도 하나의 제1 활성 단어를 검출하는 단계; 및 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, 오디오 컨텐츠에 제2 음성 서비스에 대한 제2 오디오 검출 알고리즘을 적용하여 제2 음성 서비스에 대한 적어도 하나의 제2 활성 단어를 검출하는 단계를 포함하고, 제2 활성 단어는 제1 활성 단어와 상이한 단어인, 방법.

(특징 9) 특징 1의 방법에 있어서, 하나 이상의 네트워킹된 마이크로폰 장치는 제1 네트워킹된 마이크로폰 장치 및 제2 네트워킹된 마이크로폰 장치를 포함하고, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 단계는, 제1 네트워킹된 마이크로폰 장치로 하여금 검출된 적어도 하나의 제1 활성 단어에 대한 각 활성 응답을 디세이블하는 단계; 및 제2 네트워킹된 마이크로폰 장치로 하여금 검출된 적어도 하나의 제2 활성 단어에 대한 각 활성 응답을 디세이블하는 단계를 포함하는, 방법.

(특징 10) 특징 1의 방법에 있어서, 오디오 컨텐츠에서, 하나 이상의 음성 서비스에 대한 하나 이상의 활성 단어를 검출하는 단계는 오디오 컨텐츠에서 특정 활성 단어의 복수 인스턴스를 검출하는 단계를 포함하고, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 단계는 하나 이상의 네트워킹된 마이크로폰 장치로 하여금, 각 네트워킹된 마이크로폰 장치가 오디오 컨텐츠 내 특정 활성 단어의 복수 인스턴스의 수와 동일한 수의 활성 단어를 검출할 때까지 각 활성 응답을 디세이블하는 단계를 포함하는, 방법.

(특징 11) 장치로 하여금 특징 1 내지 10 중 어느 하나의 방법을 수행하도록 하는 하나 이상의 프로세서에 의해 실행 가능한 명령어를 저장하는 유형의 비일시적인 컴퓨터 판독 가능 기록매체.

(특징 12) 특징 1 내지 10 중 어느 하나의 방법을 수행하도록 구성되는 장치.

(특징 13) 특징 1 내지 10 중 어느 하나의 방법을 수행하도록 구성되는 미디어 재생 시스템.

(특징 14) 네트워킹된 마이크로폰 장치를 통하여, 재생 장치에 의한 재생을 위한 오디오 컨텐츠를 나타내는 데이터를 수신하는 단계;오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, 오디오 컨텐츠에서, 하나 이상의 음성 서비스에 대한 하나 이상의 활성 단어를 검출하는 단계; 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 검출된 하나 이상의 활성 단어에 대한 네트워킹된 마이크로폰 장치의 활성 응답을 디세이블하는 단계 -인에이블(enable)되는 경우, 특정 활성 단어에 대한 네트워킹된 마이크로폰 장치의 활성 응답은 네트워킹된 마이크로폰 장치로 하여금 마이크로폰을 통해, 특정 활성 단어에 후속하는 음성 명령을 듣도록 함-; 및 재생 장치가 오디오 컨텐츠를 재생하는 한편, 마이크로폰을 통하여 재생되는 오디오 컨텐츠를 검출하는 단계를 포함하는 방법.

(특징 15) 특징 14의 방법에 있어서, 재생 장치로 하여금 오디오 컨텐츠를 재생하기 위한 오디오 컨텐츠를 나타내는 데이터를 네트워크 인터페이스를 통하여, 재생 장치로 전송하는 단계를 더 포함하는 방법.

(특징 16) 특징 15의 방법에 있어서, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 검출된 하나 이상의 활성 단어에 대한 네트워킹된 마이크로폰 장치의 활성 응답을 디세이블하는 단계는; 재생 장치에 대한 오디오 컨텐츠를 나타내는 데이터를 전송하기 전에, 오디오 컨텐츠를 수정하여 각 활성 단어를 나타내는 오디오 컨텐츠의 세그먼트에 음향 마커를 포함시키는 단계를 포함하고, 여기서 음향 마커를 검출하는 단계는 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 네트워킹된 마이크로폰 장치로 하여금 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 하는, 방법.

(특징 17) 특징 14의 방법에 있어서, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 추가적인 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 단계를 더 포함하는 방법.

(특징 18) 특징 17의 방법에 있어서, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 추가적인 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 단계는 네트워크 인터페이스를 통해 하나 이상의 추가적인 네트워킹된 마이크로폰 장치로, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 하는 명령어를 송신하는 단계를 포함하는, 방법.

(특징 19) 특징 17의 방법에 있어서, 하나 이상의 추가적인 네트워킹된 마이크로폰 장치는 집(household) 내 네트워킹된 마이크로폰 장치의 서브 세트(subset)이고, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 추가적인 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블(disable)하는 단계는 하나 이상의 네트워킹된 마이크로폰 장치가 오디오 컨텐츠의 가청 부근(audible vicinity)에 있다고 결정하는 단계 및 하나 이상의 네트워킹된 마이크로폰 장치가 오디오 컨텐츠의 가청 부근에 있다고 결정하는 것에 응답하여, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 마이크로폰 장치로 하여금 하나 이상의 활성 단어에 대한 각 활성 단어를 디세이블하도록 하는 명령어를 송신하는 단계를 포함하는 방법.

(특징 20) 특징 19의 방법에 있어서, 하나 이상의 네트워킹된 마이크로폰 장치는 각각의 재생 장치를 포함하고, 하나 이상의 네트워킹된 마이크로폰 장치가 오디오 컨텐츠의 가청 부근에 있다고 결정하는 단계는 하나 이상의 네트워킹된 마이크로폰 장치가 재생 장치와 동기화 재생 구성에 있다고 결정하는 단계를 포함하는, 방법.

(특징 21) 특징 14의 방법에 있어서, 하나 이상의 네트워킹된 마이크로폰 장치가 오디오 컨텐츠의 가청 부근에 있다고 결정하는 단계는 하나 이상의 네트워킹된 마이크로폰 장치가 재생 장치의 가청 부근에 있다고 결정하는 단계를 포함하는, 방법.

(특징 22) 특징 14의 방법에 있어서, 하나 이상의 활성 단어를 검출하는 단계는 복수의 활성 단어 검출 알고리즘을 오디오 컨텐츠에 적용하는 단계를 포함하고, 복수의 활성 단어 검출 알고리즘은 제1 음성 서비스에 대한 제1 활성 단어 검출 알고리즘과 제2 음성 서비스에 대한 제2 활성 단어 검출 알고리즘을 포함하고, 오디오 컨텐츠가 재생 장치에 의해서 재생되기 전에, 복수의 활성 단어 검출 알고리즘을 오디오 컨텐츠에 적용하는 단계는, 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, 오디오 컨텐츠에 제1 음성 서비스에 대한 제1 오디오 검출 알고리즘을 적용하여 제1 음성 서비스에 대한 적어도 하나의 제1 활성 단어를 검출하는 단계; 및 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, 오디오 컨텐츠에 제2 음성 서비스에 대한 제2 오디오 검출 알고리즘을 적용하여 제2 음성 서비스에 대한 적어도 하나의 제2 활성 단어를 검출하는 단계를 포함하고, 제2 활성 단어는 제1 활성 단어와 상이한 단어인, 방법.

(특징 23) 특징 14의 방법에 있어서, 네트워킹된 마이크로폰 장치는 재생 장치를 포함하고, 방법은 하나 이상의 스피커를 통하여 오디오 컨텐츠를 재생하는 단계를 더 포함하는 방법.

(특징 24) 장치로 하여금 특징 14 내지 23 중 어느 하나의 방법을 수행하도록 하는 하나 이상의 프로세서에 의해 실행 가능한 명령어를 저장하는 유형의 비일시적인 컴퓨터 판독 가능 기록매체.

(특징 25) 특징 14 내지 23 중 어느 하나의 방법을 수행하도록 구성되는 장치.

(특징 26) 특징 14 내지 23 중 어느 하나의 방법을 수행하도록 구성되는 미디어 재생 시스템.

(특징 27) 컴퓨팅 시스템의 인터페이스를 통해, 수신되는 컴퓨팅 시스템을 통하여, 하나 이상의 재생 장치에 의한 재생을 위한 오디오 컨텐츠를 수신하는 단계; 오디오 컨텐츠가 재생 장치에 의해 재생되기 전에, 오디오 컨텐츠에서, 하나 이상의 음성 서비스에 대한 하나 이상의 활성 단어를 검출하는 단계; 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 재생 장치에 의한 오디오 컨텐츠의 재생 동안 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블(disable)하는 단계 - 인에이블(enable)되는 경우, 특정 활성 단어에 대한 소정의 네트워킹된 마이크로폰 장치의 활성 응답은 소정의 네트워킹된 마이크로폰 장치로 하여금 마이크로폰을 통해, 특정 활성 단어에 후속하는 음성 명령을 듣도록 함-;를 포함하는 방법.

(특징 28) 특징 27의 방법에 있어서, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블(disable)하는 단계는, 네트워크 인터페이스를 통해 하나 이상의 네트워킹된 마이크로폰 장치로, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 하는 명령어를 송신하는 단계를 포함하는, 방법.

(특징 29) 특징 28의 방법에 있어서, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블 하도록 하는 명령어를 송신하는 단계는; 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 하나 이상의 재생 장치가 각 활성 단어를 나타내는 오디오 컨텐츠의 세그먼트를 재생 할 때에 대응하는 하나 이상의 기간 동안 각 활성 응답을 디세이블 하도록 하는 명령어를 송신하는 단계를 포함하는 방법.

(특징 30) 특징 28의 방법에 있어서, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블 하도록 하는 명령어를 송신하는 단계는; 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 하나 이상의 재생 장치가 각 활성 단어를 나타내는 오디오 컨텐츠의 세그먼트를 재생 할 때에 대응하는 하나 이상의 기간 동안 각 마이크로폰을 디세이블 하도록 하는 명령어를 송신하는 단계를 포함하는 방법.

(특징 31) 특징 28의 방법에 있어서, 컴퓨팅 시스템은 오디오 컨텐츠에 있는 활성 단어의 특정한 수를 검출하고, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블 하도록 하는 명령어를 송신하는 단계는; 하나 이상의 네트워킹된 마이크로폰 장치가 검출된 오디오 컨텐츠에서 활성 단어의 특정한 수와 같은 수의 활성 단어를 검출할 때까지, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 하나 이상의 재생 장치가 각 활성 응답을 디세이블 하도록 하는 명령어를 송신하는 단계를 포함하는 방법.

(특징 32) 특징 28의 방법에 있어서, 하나 이상의 네트워킹된 마이크로폰 장치는 집(household) 내 네트워킹된 마이크로폰 장치의 서브 세트(subset)이고, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블(disable)하는 단계는 하나 이상의 네트워킹된 마이크로폰 장치가 오디오 컨텐츠의 가청 부근(audible vicinity)에 있다고 결정하는 단계 및 하나 이상의 네트워킹된 마이크로폰 장치가 오디오 컨텐츠의 가청 부근에 있다고 결정하는 것에 응답하여, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 마이크로폰 장치로 하여금 하나 이상의 활성 단어에 대한 각 활성 단어를 디세이블하도록 하는 명령어를 송신하는 단계를 포함하는 방법.

(특징 33) 특징 32의 방법에 있어서, 하나 이상의 네트워킹된 마이크로폰 장치는 각각의 재생 장치를 포함하고, 하나 이상의 네트워킹된 마이크로폰 장치가 오디오 컨텐츠의 가청 부근에 있다고 결정하는 단계는 하나 이상의 네트워킹된 마이크로폰 장치가 재생 장치와 동기화 재생 구성에 있다고 결정하는 단계를 포함하는, 방법.

(특징 34) 특징 32의 방법에 있어서, 하나 이상의 네트워킹된 마이크로폰 장치가 오디오 컨텐츠의 가청 부근에 있다고 결정하는 단계는 하나 이상의 네트워킹된 마이크로폰 장치가 재생 장치의 가청 부근에 있다고 결정하는 단계를 포함하는, 방법.

(특징 35) 특징 27의 방법에 있어서, 재생 장치에 의한 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블(disable)하는 단계는 하나 이상의 재생 장치가 오디오 컨텐츠를 재생하기 전에, 오디오 컨텐츠를 수정하여 각 활성 단어를 나타내는 오디오 컨텐츠의 세그먼트에서 음향 마커를 포함시키는 단계; 재생 장치에 의한 오디오 컨텐츠의 재생 동안,하나 이상의 네트워킹된 마이크로폰 장치로 하여금 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 하는 음향 마커를 검출하는 단계; 및 하나 이상의 재생 장치에 의해 수정된 오디오 컨텐츠를 재생을 위한 하나 이상의 재생 장치 중 적어도 하나로 전송하는 단계를 포함하는 방법.

(특징 36) 특징 35의 방법에 있어서, 하나 이상의 재생 장치에 의한 재생의 위한 오디오 컨텐츠를 수신하는 단계는; (a) 인터페이스의 네트워크 인터페이스를 통하여, 오디오 컨텐츠를 나타내는 데이터를 수신하는 단계 또는 (b) 인터페이스의 아날로그 인터페이스를 통하여, 오디오 컨텐츠를 나타내는 아날로그 신호를 수신하는 단계 중 하나를 포함하는 방법.

(특징 37) 특징 27의 방법에 있어서, 컴퓨팅 시스템은 하나 이상의 재생 장치 중 특정한 재생 장치를 포함하고, 동작은 오디오 컨텐츠 재생을 더 포함하는 방법.

(특징 38) 특징 27의 방법에 있어서, 컴퓨팅 시스템은 하나 이상의 네트워킹된 마이크로폰 장치 중 특정한 네트워킹된 마이크로폰 장치를 포함하고, 동작은 마이크로폰을 통하여, 하나 이상의 재생 장치에 의해 재생되는 오디오 컨텐츠를 검출하는 동작을 더 포함하는 방법.

(특징 39) 장치로 하여금 특징 27 내지 38 중 어느 하나의 방법을 수행하도록 하는 하나 이상의 프로세서에 의해 실행 가능한 명령어를 저장하는 유형의 비일시적인 컴퓨터 판독 가능 기록매체.

(특징 40) 특징 27 내지 38 중 어느 하나의 방법을 수행하도록 구성되는 장치.

(특징 41) 특징 27 내지 38 중 어느 하나의 방법을 수행하도록 구성되는 미디어 재생 시스템.

(특징 42) 네트워킹된 마이크로폰 장치를 통해, 하나 이상의 활성 단어에 대한 네트워킹된 마이크로폰 장치의 활성 응답을 디세이블하도록 하는 명령어를 수신하는 단계 -인에이블(enable)되는 경우, 소정의 활성 단어에 대한 네트워킹된 마이크로폰 장치의 활성 응답은 네트워킹된 마이크로폰 장치로 하여금 마이크로폰을 통해, 소정의 활성 단어에 후속하는 음성 명령을 듣도록 함-; 마이크로폰을 통해, 하나 이상의 재생 장치에 의해 재생되는 오디오 컨텐츠를 검출하는 단계; 검출된 오디오 컨텐츠가 하나 이상의 활성 단어를 포함한다고 결정하는 단계; 수신된 명령어에 응답하여, 검출된 오디오 컨텐츠에서 하나 이상의 활성 단어에 대한 네트워킹된 마이크로폰 장치의 활성 응답을 디세이블하는 단계를 포함하는 방법.

(특징 43) 특징 42의 방법에 있어서, 하나 이상의 활성 단어에 대한 네트워킹된 마이크로폰 장치의 활성 응답을 디세이블하도록 하는 명령어를 수신하는 단계는; 하나 이상의 재생 장치가 각 검출된 활성 단어에 대응하는 오디오 컨텐츠의 세그먼트를 재생할 때에 대응하는 하나 이상의 기간 동안 활성 단어를 디세이블하도록 하는 명령어를 수신하는 것을 포함하는 방법.

(특징 44) 특징 42의 방법에 있어서, 하나 이상의 활성 단어에 대한 네트워킹된 마이크로폰 장치의 활성 응답을 디세이블하도록 하는 명령어를 수신하는 단계는; 하나 이상의 재생 장치가 각 검출된 활성 단어에 대응하는 오디오 컨텐츠의 세그먼트를 재생할 때에 대응하는 하나 이상의 기간 동안 마이크로폰을 디세이블하도록 하는 명령어를 수신하는 것을 포함하는 방법.

(특징 45) 특징 42의 방법에 있어서, 하나 이상의 활성 단어에 대한 네트워킹된 마이크로폰 장치의 활성 응답을 디세이블하도록 하는 명령어를 수신하는 단계는; 네트워킹된 마이크로폰 장치가 활성 단어의 특정한 수와 같은 수의 활성 단어를 검출할 때까지, 연속적으로 활성 단어가 검출되는 경우, 활성 단어를 디세이블하도록 하는 명령어를 수신하는 단계를 포함하는 방법.

(특징 46) 특징 42의 방법에 있어서, 하나 이상의 활성 단어에 대한 네트워킹된 마이크로폰 장치의 활성 응답을 디세이블하도록 하는 명령어를 수신하는 단계는; 음향 마커가 검출되는 경우, 활성 응답을 디세이블하도록 하는 명령어를 수신하는 단계를 포함하고, 검출된 오디오 컨텐츠에서 하나 이상의 활성 단어에 대한 네트워킹된 마이크로폰 장치의 활성 응답을 디세이블하는 단계는 각 검출된 활성 단어에 대응하는 검출된 오디오 컨텐츠에서 음향 마커를 검출하는 단계 및 각 음향 마커를 검출하는 단계에 응답하여 활성 응답을 디세이블하는 단계를 포함하는 방법.

(특징 47) 특징 42의 방법에 있어서, 검출된 오디오 컨텐츠가 하나 이상의 활성 단어를 포함한다고 결정하는 단계는 검출된 오디오 컨텐츠에 하나 이상의 활성 단어 검출 알고리즘을 적용하는 단계를 포함하는 방법.

(특징 48) 장치로 하여금 특징 42 내지 47 중 어느 하나의 방법을 수행하도록 하는 하나 이상의 프로세서에 의해 실행 가능한 명령어를 저장하는 유형의 비일시적인 컴퓨터 판독 가능 기록매체.

(특징 49) 특징 42 내지 47 중 어느 하나의 방법을 수행하도록 구성되는 장치.

(특징 50) 특징 42 내지 47 중 어느 하나의 방법을 수행하도록 구성되는 미디어 재생 시스템.

명세서는 주로 예시적인 환경, 시스템, 절차, 단계, 논리 블록, 처리 및 네트워크로 결합된 데이터 처리 장치의 동작에 직접 또는 간접적으로 유사한 다른 심볼 표현의 관점에서 제공된다. 이러한 프로세스 설명 및 표현은 일반적으로 당업자에 의해 가장 효과적으로 자신의 연구의 본질을 다른 분야에 전달하기 위해 사용된다. 본 개시의 완전한 이해를 제공하기 위해 다수의 구체적인 세부 사항이 개시된다. 그러나 본 개시의 일부 실시예는 일부 구체적인 세부 사항 없이 수행될 수 있음이 당업자에게 이해된다. 다른 경우에, 잘 알려진 방법, 절차, 컴포넌트 및 회로는 실시예의 태양을 불필요하게 흐리는 것을 피하기 위해 상세히 설명되지 않았다. 따라서, 본 개시의 범위는 앞의 실시예의 설명이 아니라 첨부된 청구범위에 의해 정의된다.

첨부된 청구범위 중에서 임의의 것이 순전히 소프트웨어 및/또는 펌웨어 구현을 커버하는 것으로 읽히는 경우, 적어도 하나의 예시에서의 구성 요소 중 적어도 하나는 여기에서 명시적으로 메모리, DVD, CD, 블루레이 등과 같이 소프트웨어 및/또는 펌웨어를 저장하는 유형의 비일시적인 매체를 포함하는 것으로 정의된다.

Claims

재생 장치로서,
네트워크 인터페이스;
하나 이상의 프로세서; 및
상기 재생 장치로 하여금 동작을 수행하도록 하는 상기 하나 이상의 프로세서에 의해 실행 가능한 명령어를 저장하는 유형의 비일시적인 컴퓨터 판독 가능 기록매체
를 포함하고, 상기 동작은,
상기 네트워크 인터페이스를 통하여, 상기 재생 장치에 의한 재생을 위한 오디오 컨텐츠를 나타내는 데이터를 수신하는 동작;
상기 오디오 컨텐츠가 상기 재생 장치에 의해 재생되기 전에, 상기 오디오 컨텐츠에서, 하나 이상의 음성 서비스에 대한 하나 이상의 활성 단어를 검출하는 동작;
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블(disable)하는 동작 - 인에이블(enable)되는 경우, 특정 활성 단어에 대한 소정의 네트워킹된 마이크로폰 장치의 상기 활성 응답은 상기 소정의 네트워킹된 마이크로폰 장치로 하여금 마이크로폰을 통해, 상기 특정 활성 단어에 후속하는 음성 명령을 듣도록 함-; 및
하나 이상의 스피커를 통하여 상기 오디오 컨텐츠를 재생하는 동작을 포함하는, 재생 장치.
제1항에 있어서,
상기 재생 장치는 상기 소정의 네트워킹된 마이크로폰 장치를 포함하고,
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 동작은,
상기 오디오 컨텐츠를 재생하는 동안, 상기 마이크로폰을 통하여, 재생되는 상기 오디오 컨텐츠를 녹음하는 동작; 및
상기 녹음된 오디오 컨텐츠 내에서의 상기 하나 이상의 활성 단어에 대한 상기 소정의 네트워킹된 마이크로폰 장치의 각 활성 응답을 디세이블하는 동작을 포함하는, 재생 장치.
제1항에 있어서,
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 동작은,
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 하는 명령어를 상기 네트워크 인터페이스를 통해 상기 하나 이상의 네트워킹된 마이크로폰 장치로 송신하는 동작을 포함하는, 재생 장치.
제3항에 있어서,
상기 하나 이상의 네트워킹된 마이크로폰 장치는 집(household) 내 네트워킹된 마이크로폰 장치의 서브 세트(subset)이고,
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 동작은,
상기 하나 이상의 네트워킹된 마이크로폰 장치가 상기 오디오 컨텐츠의 가청 부근(audible vicinity)에 있다고 결정하는 동작; 및
상기 하나 이상의 네트워킹된 마이크로폰 장치가 상기 오디오 컨텐츠의 가청 부근에 있다고 결정하는 동작에 응답하여, 상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 하나 이상의 활성 단어에 대한 각 활성 반응을 디세이블하도록 하는 명령어를 송신하는 동작을 포함하는, 재생 장치.
제4항에 있어서,
상기 하나 이상의 네트워킹된 마이크로폰 장치는 각각의 재생 장치를 포함하고,
상기 하나 이상의 네트워킹된 마이크로폰 장치가 상기 오디오 컨텐츠의 가청 부근에 있다고 결정하는 동작은 상기 하나 이상의 네트워킹된 마이크로폰 장치가 상기 재생 장치와 동기화 재생 구성으로 되어 있다고 결정하는 동작을 포함하는, 재생 장치.
제4항에 있어서,
상기 하나 이상의 네트워킹된 마이크로폰 장치가 상기 오디오 컨텐츠의 가청 부근에 있다고 결정하는 동작은 상기 하나 이상의 네트워킹된 마이크로폰 장치가 상기 재생 장치의 가청 부근에 있다고 결정하는 동작을 포함하는, 재생 장치.
제1항에 있어서,
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 동작은,
상기 오디오 컨텐츠를 재생하기 전에, 상기 오디오 컨텐츠를 수정하여 각 활성 단어를 나타내는 상기 오디오 컨텐츠의 세그먼트에 음향 마커(acoustic markers)를 포함시키는 동작을 포함하고,
상기 음향 마커를 검출하는 것은 상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 하는 것인, 재생 장치.
제1항에 있어서,
상기 하나 이상의 활성 단어를 검출하는 동작은 복수의 활성 단어 검출 알고리즘을 상기 오디오 컨텐츠에 적용하는 동작을 포함하고,
상기 복수의 활성 단어 검출 알고리즘은 제1 음성 서비스에 대한 제1 활성 단어 검출 알고리즘과 제2 음성 서비스에 대한 제2 활성 단어 검출 알고리즘을 포함하고,
상기 오디오 컨텐츠가 상기 재생 장치에 의해서 재생되기 전에, 복수의 활성 단어 검출 알고리즘을 상기 오디오 컨텐츠에 적용하는 동작은,
상기 오디오 컨텐츠가 상기 재생 장치에 의해 재생되기 전에, 상기 오디오 컨텐츠에 상기 제1 음성 서비스에 대한 상기 제1 오디오 검출 알고리즘을 적용하여 상기 제1 음성 서비스에 대한 적어도 하나의 제1 활성 단어를 검출하는 동작; 및
상기 오디오 컨텐츠가 상기 재생 장치에 의해 재생되기 전에, 상기 오디오 컨텐츠에 상기 제2 음성 서비스에 대한 상기 제2 오디오 검출 알고리즘을 적용하여 상기 제2 음성 서비스에 대한 적어도 하나의 제2 활성 단어를 검출하는 동작을 포함하고,
상기 제2 활성 단어는 제1 활성 단어와 상이한 단어인, 재생 장치.
제8항에 있어서,
상기 하나 이상의 네트워킹된 마이크로폰 장치는 제1 네트워킹된 마이크로폰 장치 및 제2 네트워킹된 마이크로폰 장치를 포함하고,
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 동작은,
상기 제1 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 적어도 하나의 제1 활성 단어에 대한 각 활성 응답을 디세이블하는 동작; 및
상기 제2 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 적어도 하나의 제2 활성 단어에 대한 각 활성 응답을 디세이블하는 동작을 포함하는, 재생 장치.
제1항에 있어서,
상기 오디오 컨텐츠에서, 하나 이상의 음성 서비스에 대한 하나 이상의 활성 단어를 검출하는 동작은 상기 오디오 컨텐츠에서 특정 활성 단어의 복수 인스턴스를 검출하는 동작을 포함하고,
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 동작은,
상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금, 각 네트워킹된 마이크로폰 장치가 상기 오디오 컨텐츠 내 상기 특정 활성 단어의 상기 복수 인스턴스의 수와 동일한 수의 활성 단어를 검출할 때까지 각 활성 응답을 디세이블하는 동작을 포함하는, 재생 장치.
재생 장치로 하여금 동작을 수행하도록 하는 하나 이상의 프로세서에 의해 실행 가능한 명령어를 저장하는, 유형의 비일시적인 컴퓨터 판독 가능 기록매체로서,
상기 동작은,
상기 네트워크 인터페이스를 통하여, 상기 재생 장치에 의한 재생을 위한 오디오 컨텐츠를 나타내는 데이터를 수신하는 동작;
상기 오디오 컨텐츠가 상기 재생 장치에 의해 재생되기 전에, 상기 오디오 컨텐츠에서, 하나 이상의 음성 서비스에 대한 하나 이상의 활성 단어를 검출하는 동작;
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블(disable)하는 동작 - 인에이블(enable)되는 경우, 특정 활성 단어에 대한 소정의 네트워킹된 마이크로폰 장치의 상기 활성 응답은 상기 소정의 네트워킹된 마이크로폰 장치로 하여금 마이크로폰을 통해, 상기 특정 활성 단어에 후속하는 음성 명령을 듣도록 함-; 및
하나 이상의 스피커를 통하여 상기 오디오 컨텐츠를 재생하는 동작을 포함하는, 유형의 비일시적인 컴퓨터 판독 가능 기록매체.
제11항에 있어서,
상기 재생 장치는 상기 소정의 네트워킹된 마이크로폰 장치를 포함하고,
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 동작은,
상기 오디오 컨텐츠를 재생하는 동안, 상기 마이크로폰을 통하여, 재생되는 상기 오디오 컨텐츠를 녹음하는 동작; 및
상기 녹음된 오디오 컨텐츠 내에서의 상기 하나 이상의 활성 단어에 대한 상기 소정의 네트워킹된 마이크로폰 장치의 각 활성 응답을 디세이블하는 동작을 포함하는, 유형의 비일시적인 컴퓨터 판독 가능 기록매체.
제11항에 있어서,
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 동작은,
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 하는 명령어를 상기 네트워크 인터페이스를 통해 상기 하나 이상의 네트워킹된 마이크로폰 장치로 송신하는 동작을 포함하는, 유형의 비일시적인 컴퓨터 판독 가능 기록매체.
제11항에 있어서,
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하는 동작은
상기 오디오 컨텐츠를 재생하기 전에, 상기 오디오 컨텐츠를 수정하여 각 활성 단어를 나타내는 상기 오디오 컨텐츠의 세그먼트에 음향 마커(acoustic marker)를 포함시키는 동작을 포함하고,
상기 음향 마커를 검출하는 것은 상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 하는 것인, 유형의 비일시적인 컴퓨터 판독 가능 기록매체.
제11항에 있어서,
상기 하나 이상의 활성 단어를 검출하는 동작은 복수의 활성 단어 검출 알고리즘을 상기 오디오 컨텐츠에 적용하는 동작을 포함하고,
상기 복수의 활성 단어 검출 알고리즘은 제1 음성 서비스에 대한 제1 활성 단어 검출 알고리즘과 제2 음성 서비스에 대한 제2 활성 단어 검출 알고리즘을 포함하고,
상기 오디오 컨텐츠가 상기 재생 장치에 의해서 재생되기 전에, 상기 복수의 활성 단어 검출 알고리즘을 상기 오디오 컨텐츠에 적용하는 동작은,
상기 오디오 컨텐츠가 상기 재생 장치에 의해 재생되기 전에, 상기 오디오 컨텐츠에 상기 제1 음성 서비스에 대한 상기 제1 오디오 검출 알고리즘을 적용하여 상기 제1 음성 서비스에 대한 적어도 하나의 제1 활성 단어를 검출하는 동작; 및
상기 오디오 컨텐츠가 상기 재생 장치에 의해 재생되기 전에, 상기 오디오 컨텐츠에 상기 제2 음성 서비스에 대한 상기 제2 오디오 검출 알고리즘을 적용하여 상기 제2 음성 서비스에 대한 적어도 하나의 제2 활성 단어를 검출하는 동작을 포함하고,
상기 제2 활성 단어는 제1 활성 단어와 상이한 단어인, 유형의 비일시적인 컴퓨터 판독 가능 기록매체.
재생 장치의 네트워크 인터페이스를 통하여, 상기 재생 장치에 의한 재생을 위한 오디오 컨텐츠를 나타내는 데이터를 수신하는 단계;
상기 오디오 컨텐츠가 상기 재생 장치에 의해 재생되기 전에, 상기 재생 장치에 의해, 상기 오디오 컨텐츠에서, 하나 이상의 음성 서비스에 대한 하나 이상의 활성 단어를 검출하는 단계;
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 재생 장치에 의해, 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블(disable)하는 단계 - 인에이블(enable)되는 경우, 특정 활성 단어에 대한 소정의 네트워킹된 마이크로폰 장치의 상기 활성 응답은 상기 소정의 네트워킹된 마이크로폰 장치로 하여금 마이크로폰을 통해, 상기 특정 활성 단어에 후속하는 음성 명령을 듣도록 함-; 및
상기 재생 장치에 의해, 하나 이상의 스피커를 통하여 상기 오디오 컨텐츠를 재생하는 단계
를 포함하는 방법.
제16항에 있어서,
상기 재생 장치는 상기 소정의 네트워킹된 마이크로폰 장치를 포함하고,
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블(disable)하는 단계는,
상기 오디오 컨텐츠를 재생하는 동안, 상기 마이크로폰을 통하여, 재생되는 상기 오디오 컨텐츠를 녹음하는 단계; 및
상기 녹음된 오디오 컨텐츠 내에서의 상기 하나 이상의 활성 단어에 대한 상기 소정의 네트워킹된 마이크로폰 장치의 각 활성 응답을 디세이블하는 단계를 포함하는, 방법.
제16항에 있어서,
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블(disable)하는 단계는,
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블하도록 하는 명령어를 상기 네트워크 인터페이스를 통해 상기 하나 이상의 네트워킹된 마이크로폰 장치로 송신하는 단계를 포함하는, 방법.
제16항에 있어서,
상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 검출된 하나 이상의 활성 단어에 대한 각 활성 응답을 디세이블(disable)하는 단계는,
상기 오디오 컨텐츠를 재생하기 전에, 상기 오디오 컨텐츠를 수정하여 각 활성 단어를 나타내는 상기 오디오 컨텐츠의 세그먼트에 음향 마커(acoustic marker)를 포함시키는 단계를 포함하고,
상기 음향 마커를 검출하는 단계는 상기 재생 장치에 의한 상기 오디오 컨텐츠의 재생 동안, 상기 하나 이상의 네트워킹된 마이크로폰 장치로 하여금 상기 하나 이상의 활성 단어에 대한 그들의 각 활성 반응을 디세이블하는 단계를 포함하는, 방법.
제16항에 있어서,
상기 하나 이상의 활성 단어를 검출하는 단계는 복수의 활성 단어 검출 알고리즘을 상기 오디오 컨텐츠에 적용하는 단계를 포함하고,
상기 복수의 활성 단어 검출 알고리즘은 제1 음성 서비스에 대한 제1 활성 단어 검출 알고리즘과, 제2 음성 서비스에 대한 제2 활성 단어 검출 알고리즘을 포함하고,
상기 오디오 컨텐츠가 상기 재생 장치에 의해서 재생되기 전에, 복수의 활성 단어 검출 알고리즘을 상기 오디오 컨텐츠에 적용하는 단계는,
상기 오디오 컨텐츠가 상기 재생 장치에 의해 재생되기 전에, 상기 오디오 컨텐츠에 상기 제1 음성 서비스에 대한 상기 제1 오디오 검출 알고리즘을 적용하여 상기 제1 음성 서비스에 대한 적어도 하나의 제1 활성 단어를 검출하는 단계; 및
상기 오디오 컨텐츠가 상기 재생 장치에 의해 재생되기 전에, 상기 오디오 컨텐츠에 상기 제2 음성 서비스에 대한 상기 제2 오디오 검출 알고리즘을 적용하여 상기 제2 음성 서비스에 대한 적어도 하나의 제2 활성 단어를 검출하는 단계를 포함하고,
상기 제2 활성 단어는 제1 활성 단어와 상이한 단어인, 방법.