KR20230149835A

KR20230149835A - 미디어 재생 시스템의 음성 제어

Info

Publication number: KR20230149835A
Application number: KR1020237032988A
Authority: KR
Inventors: 사이먼 자비스; 니콜라스 에이.제이. 밀링턴; 케이스 코빈; 마크 플래그; 로미 카드리; 크리스토퍼 부츠; 옌 니안 윌리 첸
Original assignee: 소노스 인코포레이티드
Priority date: 2016-02-22
Filing date: 2017-02-21
Publication date: 2023-10-27
Also published as: US11006214B2; AU2017223395A1; KR102343902B1; EP3420736A4; AU2019236722A1; US10499146B2; JP2022008837A; US20210120334A1; EP3974957A1; JP2023134786A; EP3420737A4; AU2023203239B2; US20240244368A1; EP4258690A3; US20170245050A1; US20170245051A1; AU2023201078A1; US20190045299A1; KR20220103824A; US12047752B2

Abstract

명령 단어, 하나 이상의 미디어 변수 인스턴스 및 하나 이상의 구역 변수 인스턴스를 포함하는 음성 입력이 수신된다. 명령 단어에 대응하는 미디어 재생 시스템 명령이 결정된다. 하나 이상의 미디어 변수 인스턴스에 대응하는 미디어 콘텐트가 식별된다. 미디어 재생 시스템은 하나 이상의 구역 변수 인스턴스에 기초하여 미디어 콘텐트 상에 미디어 재생 시스템 명령을 실행할 수 있다.

Description

미디어 재생 시스템의 음성 제어 {VOICE CONTROL OF A MEDIA PLAYBACK SYSTEM}

본 출원은 PCT 제8조 하에서(i) 2016년 7월 29일에 출원된 미국 특허 출원 제15/223,218호 "미디어 재생 시스템의 음성 제어(Voice Control of a Media Playback System)", (ii) 2016년 4월 14일에 출원된 미국 특허 출원 제15/098,718호 "음악 서비스 선택(Music Service Selection)", (iii) 2016년 4월 14일에 출원된 미국 특허 출원 제15/098,805호 "공간 정정된 음성 검출(Room-Corrected Voice Detection)", (iv) 2016년 4월 18일에 출원된 미국 특허 출원 제15/131,776호 "사용자 ID에 기반하는 액션(Action based on User ID)", (v) 2016년 3월 23일에 출원된 미국 가출원 제62/312,350호 "미디어 재생 시스템의 음성 제어(Voice Control of a Media Playback System)", (vi) 2016년 2월 22일에 출원된 미국 가출원 제62/298,418호 "오디오 응답 재생(Audio Response Playback)", (vii) 2016년 2월 22일에 출원된 미국 가출원 제62/298,425호 "음악 서비스 선택(Music Service Selection)", (vii) 2016년 2월 22일에 출원된 미국 가출원 제62/298,350호 "네트워킹된 재생 시스템과 네트워킹된 마이크로폰 시스템에 수반되는 메타데이터 교환(Metadata Exchange Involving a Networked Playback System and a Networked Microphone System)", (viii) 2016년 2월 22일에 출원된 미국 가출원 제62/298,388호 "네트워킹된 장치들 사이의 페어링 손실 처리(Handling of Loss of Pairing Between Networked Devices)," (ix) 2016년 2월 22일에 출원된 미국 가출원 제62/298,410호 "디폴트 재생 장치(Default Playback Device(s))", (x) 2016년 2월 22일에 출원된 미국 가출원 제62/298,433호 "공간 정정된 음성 검출(Room-Corrected Voice Detection)", (xi) 2016년 2월 22일에 출원된 미국 가출원 제62/298,439호 "콘텐트 믹싱(Content Mixing)", 및 (xii) 2016년 2월 22일에 출원된 미국 가출원 제62/298,393호 "사용자 ID에 기반하는 액션(Action Based on User ID)"에 대한 우선권을 주장한다. 이 출원들 각각의 내용은 전부 참조로서 여기에 포함된다.

본 개시는 소비재, 특히 미디어 재생에 관련되는 방법, 시스템, 제품, 특징, 서비스 및 기타 요소 또는 그 일부 태양에 관련된다.

2003년 소노스 사(SONOS, Inc.)가 그 최초 특허 출원 중 하나인 "다수의 네트워킹된 장치들 사이의 오디오 재생을 동기화하기 위한 방법(Method for Synchronizing Audio Playback between Multiple Networked Devices)"을 출원하고 2005년 미디어 재생 시스템을 판매 제공하기 시작하기 전까지 소리를 내는 환경(out-loud setting)에서 디지털 오디오를 액세스 및 듣기 위한 옵션은 제한적이었다. 소노스 무선 하이파이 시스템(Sonos Wireless HiFi System)은 사람들로 하여금 하나 이상의 네트워킹된 재생 장치를 통하여 다수의 소스로부터 음악을 경험하는 것을 가능하게 한다. 스마트폰, 태블릿 또는 컴퓨터 상에 설치된 소프트웨어 제어 애플리케이션을 통하여, 네트워킹된 재생 장치를 가지는 임의의 공간에서 원하는 것을 재생할 수 있다. 또한, 컨트롤러를 사용하여, 예컨대 다양한 노래가 재생 장치를 구비한 각각의 공간에서 스트리밍될 수 있거나, 공간이 동시 재생을 위해 함께 그룹핑될 수 있거나, 같은 노래가 모든 공간에서 동시에 들릴 수 있다.

계속 성장하는 디지털 미디어에 대한 관심을 고려하여 볼 때, 청취 경험을 더 향상시키기 위한 소비자가 액세스할 수 있는 기술을 개발할 필요가 계속 있다.

여기에 개시되는 기술의 특징, 태양 및 이점은 이하의 설명, 첨부된 청구범위 및 첨부 도면에 관련하여 더 잘 이해될 수 있다.
도 1은 어떠한 실시예가 실시될 수 있는 예시적인 미디어 재생 시스템 구성을 도시한다.
도 2는 여기에 설명되는 태양에 따르는 예시적인 재생 장치의 기능 블록도를 도시한다.
도 3은 여기에 설명되는 태양에 따르는 예시적인 제어 장치의 기능 블록도를 도시한다.
도 4는 여기에 설명되는 태양에 따르는 예시적인 컨트롤러 인터페이스를 도시한다.
도 5는 여기에 설명되는 태양에 따르는 예시적인 복수의 네트워크 장치를 도시한다.
도 6은 여기에 설명되는 태양에 따르는 예시적인 네트워크 마이크로폰 장치의 기능 블록도를 도시한다.
도 7은 네트워크 마이크로폰 장치에 환경(environment)의 어쿠스틱스(acoustics)를 제공하는 것에 관련되는 예시적인 흐름도이다.
도 8은 네트워크 마이크로폰 장치에 환경의 어쿠스틱스를 제공하는 것에 관련되는 다른 예시적인 흐름도이다.
도 9는 네트워크 마이크로폰 장치에 의해 수신되는 음성 입력을 해석하는 것에 관련되는 예시적인 흐름도이다.
도 10은 환경의 어쿠스틱스를 결정하는 것에 관련되는 예시적인 흐름도이다.
도 11은 재생 장치에 의하여 재생되는 오디오 콘텐트에 방향성(directionality)을 적용하는 것에 관련되는 다른 예시적인 흐름도이다.
도 12는 여기에 설명되는 태양에 따르는 예시적인 음악 제어 방법의 흐름도를 도시한다.
도 13a-13d는 여기에 설명되는 태양에 따르는 구성 프로세스의 예시적인 사용자 인터페이스를 도시한다.
도 14는 일부 실시예에 따르는 예시적인 방법을 도시한다.
도 15는 일부 실시예에 따르는 다른 예시적인 방법을 도시한다.
도 16은 네트워크 마이크로폰 장치를 통한 스트리밍 음악 서비스를 식별하는 것에 관련되는 예시적인 흐름도이다.
도 17은 네트워크 마이크로폰 장치를 통한 스트리밍 음악 서비스를 식별하는 것에 관련되는 다른 예시적인 흐름도이다.
도면은 예시적인 실시예를 묘사하기 위한 것이나, 도면에 도시된 배열 및 수단에 발명이 제한되지 않음이 이해된다.

I. 개관

일반적으로, 음성 명령은 여기에서 논의되는 미디어 재생 시스템 제어 중 임의의 것을 제어하기 위한 명령일 수 있다. 예를 들어, 음성 명령은 미디어 재생 시스템이 미디어 재생 시스템의 하나 이상의 재생 장치를 통하여 미디어 콘텐트를 재생하기 위한 명령일 수 있다. 다른 예시에서, 음성 명령은 미디어 재생 시스템의 하나 이상의 미디어 재생 장치를 위한 재생 설정을 변경하기 위한 명령일 수 있다. 재생 설정은, 예컨대 다른 가능성 중에서도 재생 음량, 재생 수송 제어, 음악 소스 선택 및 그룹핑을 포함할 수 있다.

일 태양에서, 여기에서 설명되는 예시는 네트워크 마이크로폰 장치(NMD)에 NMD가 동작하는 환경의 어쿠스틱스를 제공하는 것에 관한 것이다. NMD는 NMD에 의해 수신되는 음성 명령을 해석하는 데에 환경의 어쿠스틱스를 사용할 수 있다.

NMD는 마이크로폰 배열을 통하여 음성 입력, 예컨대 말을 수신하고 음성 입력에 기초하여 기능을 수행하는 장치일 수 있다. 예를 들어, NMD는 음성 명령을 수신하고 수신된 음성 입력을 해석할 수 있다. 이후, NMD는 음성 명령에 기초하여 기능을 수행할 수 있다. 특히, NMD는 "'스트리밍 서비스 1'로부터 '아티스트 1'에 의한 '트랙 1'을 재생하라"는 음성 명령을 수신하고 음성 입력이 오디오 콘텐트를 재생하라는 명령이라고 결정하고 '스트리밍 서비스 1'로부터 요청된 '아티스트 1'에 의한 오디오의 '트랙 1'을 재생하는 것을 가능하게 할 수 있다. 다른 배열 또한 가능하다.

NMD가 동작하는 환경은 어떠한 어쿠스틱스를 가질 수 있다. 어쿠스틱스는 소리가 환경 내에서 어떻게 이동하는지를 정의한다. 환경의 어쿠스틱스는 다수의 방식으로 결정될 수 있다. 일 예시로서, 스피커와 마이크로폰을 가지는 재생 장치는 스피커를 통하여 테스트 톤을 출력하고 마이크로폰을 통하여 테스트 톤을 수신하며 수신된 테스트 톤을 분석하여 환경의 어쿠스틱스를 결정할 수 있다. 다른 예시에서, (제어 장치, 제1 재생 장치, 또는 심지어 NMD 자체와 같은) 다른 네트워크 장치는 제2 재생 장치의 스피커로부터 테스트 톤을 수신하고 수신된 테스트 톤을 분석하여 환경의 어쿠스틱스를 결정하는 마이크로폰을 포함할 수 있다. 테스트 톤은 다른 주파수에서의 오디오 소리일 수 있다. 이러한 어쿠스틱스는 오디오 콘텐트의 재생에 있어서 재생 장치에 의한 사용을 위하여 재생 장치 상에 또는 통신 네트워크 내 컴퓨팅 장치 상에 저장될 수 있다.

일부 예시에서, 어쿠스틱스는 공간의 크기, 공간의 천장 높이, 및 공간 내 가구와 같은 환경의 알려진 특징에 기초하여 추측(infer)될 수 있다. 데이터베이스는 다른 특징을 가지는 공간에 대하여 어쿠스틱스를 저장할 수 있다. 데이터베이스에 저장된 어쿠스틱스는 특정 특징을 가지는 공간의 이전 분석에 기초하여 결정되었을 수 있다. 사용자는 공간의 특징을 입력할 수 있고 데이터베이스는 환경의 어쿠스틱스를 출력할 수 있다. 어쿠스틱스는 또한 재생 장치에 의한 사용을 위하여 재생 장치 자체 상에 또는 데이터베이스에도 저장될 수 있다.

미국 특허 출원 제14/481,511호 "재생 장치 교정(Playback Device Calibration)", 제14/216,306호 "환경에 기초한 오디오 설정(Audio Settings Based on Environment)", 제14/805,140호 "움직이는 마이크로폰을 사용하는 장소 평균된 공간 오디오 교정을 위한 하이브리드 테스트 톤(Hybrid Test Tone for Space-Averaged Rom Audio Calibration Using a Moving Microphone)", 및 제14/825,961호 "미디어 시스템에서의 다채널 페어링(Multi-Channel Pairing in Media System)", 및 미국 특허 제9,106,192호 "장치 재생 교정을 위한 시스템 및 방법(System and Method for Device Playback Calibration)"은 또한 재생 장치의 교정을 위한 다양한 예시를 설명하며, 그 내용은 각각 여기에 전부 참조로서 포함된다.

NMD는 통상적으로 마이크로폰 응답을 통하여 음성 입력을 처리할 수 있다. 마이크로폰 응답은 주파수에 대한 마이크로폰의 감도(sensitivity)의 표시이다. 실시예에서, NMD는 또한 환경의 어쿠스틱스를 사용하여 음성 입력을 처리하여 음성 입력의 왜곡을 정정할 수 있다. 이러한 방식으로 음성 입력이 더 잘 해석될 수 있다.

재생 장치는 NMD에 환경의 어쿠스틱스를 제공할 수 있다. 미디어 재생 시스템이 복수의 재생 장치를 가질 수 있으므로, 어쿠스틱스를 제공하는 재생 장치는 NMD에 가장 가까운 것일 수 있다. 다른 예시로서, 어쿠스틱스를 제공하는 재생 장치는 같은 구역인 것일 수 있다. 일부 예시에서, 재생 장치는 NMD와 결합(그룹핑 또는 페어링)될 수 있다. 결합은 재생 장치와 NMD가 같은 공간 또는 구역에서와 같이 서로 가까이 근접함 및/또는 동시에 콘텐트를 재생함을 나타낼 수 있다. NMD가 재생 장치와 결합되는 경우, NMD는 결합된 재생 장치로부터 환경의 어쿠스틱스를 수신하도록 배열될 수 있다. 또한, NMD가 이동되고 다른 재생 장치와 결합되는 경우, 결합되는 다른 재생 장치는 NMD가 있는 환경에 대한 새로운 어쿠스틱스를 제공할 수 있다.

NMD는 그 동작을 개선하기 위해 그것이 있는 환경의 어쿠스틱스를 사용할 수 있다. 예를 들어, NMD는 어쿠스틱스에 기초하여 필터를 정의할 수 있다. NMD는 네트워크 마이크로폰 장치에 의해 수신되는 음성 입력에 필터를 적용하여 음성 입력에서 환경의 어쿠스틱스, 예컨대 스펙트럴, 공간적 및 시간적 왜곡을 정정할 수 있다. 이러한 방식으로 음성 입력이 더 잘 해석될 수 있다.

많은 상황에서, NMD는 미디어 재생 시스템에 근접하여 위치될 수 있다. 미디어 재생 시스템은 오디오 콘텐트를 재생하는 복수의 재생 장치를 포함할 수 있다. 이러한 재생 장치는 집 안에서 다양한 위치에 분산될 수 있고, 이러한 위치는 집의 침실 또는 거실과 같은 구역으로서 지칭될 수 있다. 그 결과, NMD는 미디어 재생 시스템에 의해 재생되고 있는 음악과 같은 오디오 콘텐트의 존재 가운데에서 음성 입력을 해석할 필요가 있을 수 있다.

일부 상황에서, 재생 장치는 NMD가 환경의 어쿠스틱스를 정정하기 위하여 음성 입력에 필터를 적용하는 것 뿐 아니라 음성 입력을 더 잘 고립시키기 위해 재생되는 오디오 콘텐트를 사용할 수 있도록 재생되고 있는 콘텐트의 표시를 NMD에 제공할 수 있다.

추가적으로 또는 대안적으로, NMD는 음성 입력의 방향성을 결정할 수 있다. 방향성은 음성 입력이 오는 방향을 정의할 수 있다. 이러한 방향성은 미디어 재생 시스템에 제공될 수 있다. 미디어 재생 시스템은 복수의 스피커를 포함할 수 있다. 미디어 재생 시스템은 이러한 방향성을 사용하여 복수의 스피커의 오디오 출력을 조정할 수 있다. 예를 들어, 미디어 재생 시스템은 하나 이상의 재생 장치로부터 산출되는 오디오 소리를 음성 입력이 오는 방향으로 향하게 할 수 있다. 이것은 청취자가 위치되는 곳일 수 있다. 다른 배열 또한 가능하다.

다른 태양에서, 여기에서 설명되는 일부 예시는 음성 입력을 통하여 미디어 재생 시스템을 제어하는 것을 수반한다. 여기에서 제공되는 일부 예시는 방법을 수반할 수 있다. 방법은 하나 이상의 미디어 변수 인스턴스(instance) 및 명령 단어(command word)를 포함하는 음성 입력을 수신하는 것과 음성 입력이 음악 제어에 대응한다고 결정하는 것을 포함할 수 있다. 방법은 명령 단어에 대응하는 명령을 결정하는 것과 음성 입력을 처리하여 의도에 대응하는 미디어 재생 시스템 명령을 식별하는 것을 더 수반할 수 있다. 음성 입력은 하나 이상의 음악 변수 인스턴스에 관련되는 미디어 콘텐트를 식별하도록 처리될 수 있고, 미디어 콘텐트의 하나 이상의 미디어 항목이 결정될 수 있다. 미디어 재생 시스템은 하나 이상의 미디어 항목 상에서 명령을 실행하게 될 수 있다.

다른 예시에서, 비일시적인(non-transitory) 컴퓨터 판독 가능 매체가 제공된다. 비일시적인 컴퓨터 판독 가능 매체는 컴퓨팅 장치가 기능을 수행하도록 하는 컴퓨팅 장치에 의해 실행 가능한 명령어를 저장할 수 있다. 기능은 하나 이상의 미디어 변수 인스턴스 및 명령 단어를 포함하는 음성 입력을 수신하는 것과 음성 입력이 음악 제어에 대응한다고 결정하는 것을 포함한다. 기능은 명령 단어에 대응하는 명령을 결정하는 것과 음성 입력을 처리하여 의도에 대응하는 미디어 재생 시스템 명령을 식별하는 것을 더 수반할 수 있다. 음성 입력은 하나 이상의 음악 변수 인스턴스에 관련되는 미디어 콘텐트를 식별하도록 처리될 수 있고, 미디어 콘텐트의 하나 이상의 미디어 항목이 결정될 수 있다. 미디어 재생 시스템은 하나 이상의 미디어 항목 상에서 명령을 실행하게 될 수 있다.

추가적인 예시에서, 시스템이 제공된다. 시스템은 프로세서 및 메모리를 포함한다. 메모리는 시스템이 기능을 수행하도록 하는 기기에 의해 실행 가능한 명령어를 저장한다. 기능은 하나 이상의 미디어 변수 인스턴스 및 명령 단어를 포함하는 음성 입력을 수신하는 것과 음성 입력이 음악 제어에 대응한다고 결정하는 것을 포함한다. 기능은 명령 단어에 대응하는 명령을 결정하는 것과 음성 입력을 처리하여 의도에 대응하는 미디어 재생 시스템 명령을 식별하는 것을 더 수반할 수 있다. 음성 입력은 하나 이상의 음악 변수 인스턴스에 관련되는 미디어 콘텐트를 식별하도록 처리될 수 있고, 미디어 콘텐트의 하나 이상의 미디어 항목이 결정될 수 있다. 미디어 재생 시스템은 하나 이상의 미디어 항목 상에서 명령을 실행하게 될 수 있다.

또 다른 태양에서, 여기에서 설명되는 예시는 음성 명령을 수신하고 사용자 ID에 기초하여 실행하기 위한 미디어 재생 시스템을 위한 적절한 액션을 결정하는 미디어 재생 시스템(또는 아마 그 하나 이상의 컴포넌트)을 포함한다.

미디어 콘텐트를 소리 내어 청취하는 것은 가족, 친구 및 손님이 참여하는 사회 활동일 수 있다. 미디어 콘텐트는 예를 들어 토크 라디오, 책, 텔레비전으로부터의 오디오, 로컬 드라이브에 저장된 음악, 미디어 소스로부터의 음악(예컨대, 판도라(Pandora)® 라디오, 스포티파이(Spotify)®, 슬래커(Slacker)®, 라디오, 구글 플레이(Google Play)™, 아이튠즈(iTunes) 라디오) 및 다른 들을 수 있는 소재를 포함할 수 있다. 예를 들어, 집에서 사람들은 파티나 다른 사회 모임에서 음악을 소리내어 재생할 수 있다. 그러한 환경에서, 사람들은 하나의 청취 구역 또는 다수의 청취 구역에서 동시에, 음악이 각각의 청취 구역에서 들을 수 있는 에코(echo)나 글리치(glitch) 없이 동기화될 수 있도록 음악을 재생하기를 원할 수 있다. 그러한 경험은 사람들이 오디오 재생 장치 또는 시스템을 제어하기 위해 음성 명령을 사용할 수 있을 경우 더 풍부해질 수 있다. 예를 들어, 사람은 오디오 콘텐트, 재생 목록 또는 청취 구역을 변경, 재생 목록 또는 재생 큐(queue)에 음악 트랙을 추가, 또는 재생 설정(예컨대, 그 중에서도, 재생, 일시 정지, 다음 트랙, 이전 트랙, 재생 음량 및 EQ 설정)을 변경하기를 원할 수 있다.

미디어 콘텐트를 소리 내어 청취하는 것은 또한 개인적인 경험일 수 있다. 예를 들어, 개인은 일 하기 전에 아침에, 일하는 동안, 저녁에 저녁 식사 동안, 또는 집에서나 일터에서 하루 중 다른 때에 자신을 위해 소리 내어 음악을 재생할 수 있다. 이러한 개인적인 경험을 위하여, 개인은 오디오 콘텐트의 재생을 단일 청취 구역 또는 지역으로 제한하기를 선택할 수 있다. 그러한 경험은 개인이 다른 설정 중에서도 청취 구역, 오디오 콘텐트 및 재생 설정을 선택하기 위해 음성 명령을 사용할 수 있는 경우 더 풍부해질 수 있다.

음성 명령을 실행하기를 시도하는 사람을 식별하는 것 또한 경험의 중요한 요소일 수 있다. 그 사람이 누구인지와 그 사람이 미디어 재생 장치 또는 시스템이 하기 원하는 것에 기초하여 음성 명령을 실행하는 것이 바람직할 수 있다. 예시로서, 집에서의 파티 또는 사회 모임에서, 호스트 또는 집 주인은 어떠한 손님이 음성 명령을 사용하여 오디오 콘텐트, 청취 구역 또는 재생 설정을 변경하는 것을 막기 원할 수 있다. 일부 경우에, 호스트 또는 집 주인은 어떠한 손님이 음성 명령을 사용하여 오디오 콘텐트, 청취 구역 또는 재생 설정을 변경하는 것을 허용하는 한편 다른 손님이 그러한 변경을 하는 것을 막기 원할 수 있다. 사용자 프로파일 또는 음성 구성 설정에 기초한 사용자 식별은 집 주인의 음성을 손님의 음성과 구분하는 것을 도울 수 있다.

다른 예시에서, 사용자 식별은 어른의 음성을 어린이의 음성과 구분하는 데에 사용될 수 있다. 일부 경우에, 집 주인은 어린이가 음성 명령을 사용하여 어린이에게 적합하지 않은 오디오 콘텐트를 청취하는 것을 막기를 원할 수 있다. 다른 경우에, 집 주인은 어린이가 청취 구역 또는 재생 설정을 변경하는 것을 막기 원할 수 있다. 예를 들어, 집 주인은 어떠한 음량에서 오디오 콘텐트를 청취하고 어린이가 오디오 콘텐트의 음량을 변경하는 것을 막기 원할 수 있다. 사용자 식별은 어린이가 어떠한 콘텐트에 액세스하거나 청취 구역 또는 재생 설정을 변경하는 것을 막는 제한 설정 또는 부모 제어(parental control) 설정을 설정하는 것을 도울 수 있다. 예를 들어, 사용자 프로파일 또는 음성 구성 설정에 기초하는 사용자 식별은 어린이가 누구인지, 무엇이 어린이가 청취하도록 허용된 것인지, 또는 어떠한 설정이 어린이가 변경하도록 허용된 것인지 결정하는 것을 도울 수 있다.

또 다른 예시에서, 사용자 식별은 의도하지 않은 음성 명령을 방지하는 데에 사용될 수 있다. 예를 들어, 집 주인은 의도하지 않게 음성 명령을 트리거하는 것으로부터 텔레비전으로부터의 오디오 또는 다른 오디오 콘텐트를 방지하기 원할 수 있다. 위와 유사하거나 상이한 많은 다른 예시들이 여기에 설명되며, 음성 인식에 기초하는 상이한 유형의 액션을 묘사한다.

여기에 설명되는 일부 실시예는 음성 명령을 수신하고 사용자 식별에 기초하여 실행하기 위한 미디어 재생 시스템을 위한 적절한 액션을 결정하는 미디어 재생 시스템(또는 아마 그 하나 이상의 컴포넌트)을 포함한다.

예시적인 구성에서, 미디어 재생 시스템은 하나 이상의 미디어 재생 장치를 단독으로 또는 미디어 재생 시스템 서버와 같은 컴퓨팅 장치와 조합하여 포함한다. 다른 예시적인 구성에서, 미디어 재생 시스템은 네트워킹된 마이크로폰 시스템 서버 및 하나 이상의 NMD를 포함하거나 이와 통신할 수 있다. 또 다른 예시적인 구성에서, 미디어 재생 시스템 서버 및/또는 네트워킹된 마이크로폰 시스템 서버는 클라우드 기반 서버 시스템일 수 있다. 이러한 장치 및/또는 서버 중 임의의 하나 또는 그 조합이 미디어 재생 시스템을 위한 음성 명령을 수신할 수 있다.

예시적인 동작에서, 네트워킹된 마이크로폰 시스템에 의해 개별적으로 또는 미디어 재생 시스템과 조합하여 하나 이상의 기능이 수행될 수 있다. 예를 들어, 음성 명령을 수신하는 것은 네트워킹된 마이크로폰 시스템이 하나 이상의 NMD를 통하여 음성 명령을 수신하는 것 및 추가적인 처리를 위해 음성 명령을 미디어 재생 시스템으로 송신하는 것을 포함할 수 있다. 미디어 재생 시스템은 이후 음성 명령을 상당하는 텍스트 명령으로 전환하고 텍스트 명령을 파싱(parse)하여 명령을 식별할 수 있다. 다른 예시에서, 네트워킹된 마이크로폰 시스템은 음성 명령을 상당하는 텍스트 명령으로 전환하고 텍스트 명령을 미디어 재생 시스템에 송신하여 텍스트 명령을 파싱하고 명령을 식별할 수 있다.

음성 명령은 여기에서 논의되는 미디어 재생 시스템 제어 중 임의의 것을 제어하기 위한 명령일 수 있다. 예를 들어, 일부 실시예에서, 음성 명령은 미디어 재생 시스템이 미디어 재생 시스템의 하나 이상의 재생 장치를 통하여 미디어 콘텐트를 재생하기 위한 명령일 수 있다. 일부 실시예에서, 음성 명령은 미디어 재생 시스템의 하나 이상의 미디어 재생 장치를 위한 재생 설정을 변경하기 위한 명령일 수 있다. 재생 설정은, 다른 가능성 중에서도, 예컨대 재생 음량, 재생 수송 제어, 음악 소스 선택 및 그룹핑을 포함할 수 있다.

음성 명령을 수신한 후, 미디어 재생 시스템의 컴퓨팅 장치는 음성 명령이 미디어 재생 시스템의 등록된 사용자로부터 수신되었는지 여부를 결정할 수 있다. 예를 들어, 미디어 재생 시스템은 집에서 특정 사용자 또는 하나 이상의 사용자에게 등록될 수 있다. 미디어 재생 시스템의 컴퓨팅 장치는 컴퓨팅 장치에 저장된 사용자 프로파일에 기초하여 등록된 사용자에 음성 명령을 연관시키도록 구성될 수 있다. 등록된 사용자는 컴퓨팅 장치에서 생성 및 저장된 사용자 프로파일을 가질 수 있다. 사용자 프로파일은 사용자에게 특정된 어떠한 정보를 포함할 수 있다. 예를 들어, 사용자 프로파일은 다른 가능성 중에서도 사용자의 나이, 위치, 선호되는 재생 설정, 선호되는 재생 목록, 선호되는 오디오 콘텐트, 사용자에 대하여 설정된 액세스 제한 및 사용자의 음성을 식별하는 정보에 관한 정보를 포함할 수 있다.

미디어 재생 시스템의 컴퓨팅 장치는 사용자에 의해 설정된 음성 구성 설정에 기초하여 사용자에 음성 명령을 연관시키도록 구성될 수 있다. 예를 들어, 미디어 재생 시스템은 사용자에게 음성 입력 또는 일련의 음성 입력을 제공하도록 요청할 수 있다. 미디어 재생 시스템의 컴퓨팅 장치는 이후 음성 입력을 처리하고, 음성 입력을 사용자에 연관시키고, 정보를 저장할 수 있어 미디어 재생 시스템은 사용자로부터의 음성 명령을 인식할 수 있다.

일부 예시에서, 미디어 재생 시스템의 컴퓨팅 장치는 음성 명령과 연관되는 신뢰 수준(confidence level)을 결정하도록 구성될 수 있으며, 이는 음성 명령이 등록된 사용자로부터 수신되었다고 결정하는 것을 더 도울 수 있다. 신뢰 수준은 사용자 이력, 위치에 기초하여 개별적으로 또는 사용자 프로파일에서 일반적으로 발견되는 임의의 다른 정보와 조합하여 결정될 수 있다.

음성 명령이 등록된 사용자로부터 수신되었다고 결정하는 것에 응답하여, 미디어 재생 시스템의 컴퓨팅 장치는 미디어 재생 시스템을 위한 명령어를 구성할 수 있다. 명령어는 음성 명령으로부터의 콘텐트와 등록된 사용자에 대한 사용자 프로파일에서의 정보에 기초할 수 있다. 추가적으로 또는 대안적으로, 명령어는 음성 명령으로부터의 콘텐트와 컴퓨팅 장치 상에 저장된 음성 구성 설정에 기초할 수 있다.

여기에서 예시에서 설명되는 바와 같이, 음성 명령은 다양한 콘텐트를 포함할 수 있다. 일 예시에서, 음성 명령으로부터의 콘텐트는 하나 이상의 재생 장치가 미디어 콘텐트를 재생하기 위한 명령을 포함할 수 있다. 일부 예시에서, 하나 이상의 재생 장치가 미디어 콘텐트를 재생하기 위한 명령 및 등록된 사용자에 대한 사용자 프로파일 내 정보에 기초하여, 미디어 재생 시스템의 컴퓨팅 장치는 하나 이상의 재생 장치가 등록된 사용자의 선호되는 미디어 소스(예컨대, 음악 스트리밍 서비스)로부터 미디어 콘텐트를 획득하게 하는 명령어를 구성할 수 있다. 컴퓨팅 장치는 이후 미디어 재생 시스템이 미디어 재생 시스템의 하나 이상의 재생 장치를 통하여 미디어 콘텐트를 재생하도록 하는 명령어를 구성할 수 있다. 추가적인 예시에서, 하나 이상의 재생 장치가 미디어 콘텐트를 재생하기 위한 명령 및 등록된 사용자에 대한 사용자 프로파일 내 정보에 기초하여, 컴퓨팅 장치는 (i) 등록된 사용자의 선호되는 재생 설정 중 하나 이상으로 하나 이상의 재생 장치를 구성하고 (ii) 하나 이상의 재생 장치가 등록된 사용자의 선호되는 재생 설정으로 미디어 재생 시스템을 통하여 미디어 콘텐트를 재생하게 하는 명령어를 포함할 수 있다.

다른 예시에서, 음성 명령으로부터의 콘텐트는 하나 이상의 재생 장치가 미디어 콘텐트를 재생하기 위한 명령을 포함할 수 있으나, 미디어 재생 시스템의 특정 청취 구역 또는 재생 구역을 식별하지 않을 수 있다. 음성 명령으로부터의 콘텐트 및 등록된 사용자를 위한 사용자 프로파일 내의 정보에 기초하여, 컴퓨팅 장치는 미디어 재생 시스템의 특정 재생 구역 내의 하나 이상의 미디어 재생 장치를 통하여 하나 이상의 미디어 재생 장치가 미디어 콘텐트를 재생하도록 하기 위한 명령어를 구성할 수 있다.

또 다른 예시에서, 음성 명령으로부터의 콘텐트는 미디어 재생 시스템이 재생 설정을 변경하기 위한 명령을 포함할 수 있다. 음성 명령으로부터의 콘텐트 및 등록된 사용자를 위한 사용자 프로파일 내 정보에 기초하여, 컴퓨팅 장치는 미디어 재생 시스템이 미디어 재생 시스템의 하나 이상의 재생 장치를 위한 재생 설정을 변경하도록 하기 위한 명령어를 구성할 수 있다.

추가적인 예시는 미디어 재생 시스템이 상이한 사용자로부터 수신되는 상반되는(conflicting) 음성 명령을 해결하기 위해 선호도의 순서를 결정하는 것을 수반할 수 있다. 예를 들어, 미디어 재생 시스템은 등록된 손님으로부터 수신되는 음성 명령이 등록되지 않은 손님보다 높은 우선 순위를 가지는 선호도의 순서를 할당할 수 있다. 상반되는 음성 명령은, 예를 들어 노래를 재생하도록 하는 사용자로부터 수신되는 음성 명령과 노래를 재생하는 것을 멈추도록 하는 다른 사용자로부터 수신되는 후속의 음성 명령을 포함할 수 있다. 위와 유사하거나 상이한 많은 다른 예시가 여기에서 설명된다.

다른 예시에서, 미디어 재생 시스템은 등록된 사용자 또는 등록된 손님 사용자와 연관되는 깨우기(wakeup) 단어 또는 깨우기 어구를 수신하는 것에 기초하여 액션을 취할 수 있다. 깨우기 단어 또는 깨우기 어구(예컨대, "헤이 소노스")는 시스템이 수신된 깨우기 단어에 기초하여 사용자로부터 추가적인 명령을 받아들일 시간 간격을 트리거하는 데에 사용될 수 있다. 예를 들어, 호스트 또는 권한 있는 손님은 재생 큐에 노래를 추가하기 위한 음성 명령(예컨대, "헤이 소노스, 노래를 줄 세우자")을 전송할 수 있고, 이는 호스트 또는 권한 있는 손님이 재생 큐에 특정 노래를 추가하기 위한 추가적인 음성 명령을 전송하기 위한 시간 간격(예컨대, 5분)을 시작할 수 있다. 위와 유사하거나 상이한 다른 많은 예시가 여기에서 설명된다.

미디어 재생 시스템을 위한 명령어 또는 명령어의 집합을 구성한 후, 컴퓨팅 장치의 일부 실시예는 명령어 또는 명령어의 집합을 미디어 재생 시스템의 하나 이상의 재생 장치로 전송할 수 있다.

또 다른 예시에서, 미디어 재생 시스템의 컴퓨팅 장치는 음성 명령이 어린이로부터 수신되었는지 여부를 결정할 수 있다. 컴퓨팅 장치는 사용자 프로파일 또는 손님 프로파일 내 정보에 기초하여 어른과 어린이 사이를 구분하도록 구성될 수 있다. 특히, 컴퓨팅 장치는 사용자의 음성의 톤 또는 주파수에 기초하여 어른과 어린이 사이를 구분할 수 있다.

음성 명령이 어린이로부터 수신되었다고 결정하는 것에 응답하여, 하나 이상의 재생 장치는 어린이에게 부적합할 수 있는 소정의 미디어 콘텐트를 재생하는 것이 방지될 수 있다. 일부 경우에, 컴퓨팅 장치 및/또는 하나 이상의 재생 장치는 어린이의 음성 명령의 콘텐트에 기초하여 재생 설정을 변경하는 것이 방지될 수 있다.

또 다른 예시에서, 액션은 음성 명령이 미디어 재생 시스템의 등록된 사용자 대신 손님 사용자로부터 수신되었는지 여부를 결정하는 것에 기초할 수 있다. 일 예시에서, 등록된 사용자는 손님 사용자에 대한 손님 프로파일을 생성하였을 수 있다. 손님 프로파일은 사용자 프로파일에 포함된 임의의 정보를 포함할 수 있다. 다른 예시에서, 미디어 재생 시스템의 컴퓨팅 장치는 음성 명령이 등록된 사용자로부터 수신되지 않았다고 결정할 수 있고, 이후 등록된 사용자에게 음성 명령이 등록된 사용자의 손님으로부터 온 것인지를 물을 수 있다.

음성 명령이 손님 사용자로부터 수신되었다고 결정하는 것에 응답하여, 미디어 재생 시스템의 컴퓨팅 장치는 (1) 손님 사용자에 대한 제한 설정을 할당하고, (2) 음성 명령으로부터의 콘텐트 및 손님 사용자에 대하여 할당된 제한 설정에 기초하여 하나 이상의 재생 장치를 위한 명령어를 구성하며, (3) 명령어를 하나 이상의 재생 장치에 전송할 수 있다. 제한 설정은 미디어 재생 시스템의 제어를 제한하는 임의의 설정일 수 있다.

추가적인 태양에서, 여기에서 설명되는 예시는 명령에 기초하여 적절한 스트리밍 서비스(예컨대, 오디오 트랙 스트리밍)를 식별하고 액세스하는 것에 관련한다.

스트리밍 서비스는 NMD에 의하여 제공되는 음성 명령에 기초하여 식별 및 액세스될 수 있다. 예를 들어, NMD는 "판도라® 70년대 락 라디오를 재생하라"는 음성 명령을 수신하고, 그 말이 특정 스트리밍 서비스로부터의 특정 방송(station)을 재생하는 명령이라고 결정하고, 그 서비스로부터 방송의 재생을 가능하게 할 수 있다. 다른 구현에서, 스트리밍 서비스의 선택은 컨트롤러 장치의 사용자 인터페이스를 통한 명령 입력(예컨대, 텍스트 입력)에 기초할 수 있다. 다른 유형의 명령도 가능하다.

다른 예시에서, 명령은 사용자가 액세스되기를 희망하는 스트리밍 서비스를 명시적으로 특정하지 않을 수 있다. 예를 들어, 사용자는 "퀸(Queen)을 재생하라" 또는 "70년대 락을 재생하라"와 같은 더 일반적인 명령을 발할 수 있다. 이러한 예시에서, 기존 시스템은 사용자가 재생되기 희망하는 콘텐트 유형(즉, 아티스트 또는 앨범 퀸, 70년대 락 라디오 방송 또는 "베스트" 앨범)을 구분하는 데에 그 능력이 제한된다. 추가적으로, 그러한 시스템은 사용자의 의도된 콘텐트 유형을 다양한 스트리밍 서비스의 콘텐트 유형 가능성(capabilities)(즉, 어떠한 서비스가 라디오 방송, 아티스트, 앨범을 재생할 수 있는지)에 매칭할 수 없다.

증가하는 이용 가능한 스트리밍 서비스의 수와 콘텐트의 양을 고려하여 볼 때, 사용자 명령에 기초하여 사용자에게 제공하기 위한 콘텐트 유형에 매칭하는 요망되는 스트리밍 서비스를 똑똑하게 선택할 수 있는 시스템에 대한 필요가 있다.

일 예시에서, 스트리밍 서비스의 선택은 복수의 네트워크 가능 장치를 포함하는 네트워크 구성에 의하여 달성될 수 있다. 네트워크 구성은 명령을 수신, 처리 및 분석하는 NMD, 재생 장치, 컴퓨팅 장치 및/또는 컨트롤러 장치(예컨대, 태블릿, 스마트폰)를 포함할 수 있다. 구성은 수신된 명령의 처리 및 분석에 기초하여 하나 이상의 음악 콘텐트 서버로부터 오디오 콘텐트를 검색(retrieving) 및/또는 요청하는 것을 더 수반할 수 있다. 오디오 콘텐트는 이후 NMD, 컨트롤러 장치 및/또는 임의의 수의 재생 장치에 의해 획득되어 명령에 기초한 오디오 재생 경험을 제공할 수 있다. 네트워크 구성은 또한 다른 형태를 취할 수 있다.

다른 예시에서, 선택은 다수의 기준에 개별적으로 또는 조합하여 기초할 수 있다. 한 경우에, 스트리밍 서비스의 선택은 명령에 의해 표시된 콘텐트 유형(예컨대, 노래, 장르, 라디오 방송) 및 특정 스트리밍 서비스가 표시된 콘텐트 유형을 지원하는지 여부에 의존할 수 있다. 그러한 경우, 콘텐트 유형 논리는 명령 또는 명령의 일부를 콘텐트 유형에 상관시키는 데에 이용될 수 있다. 논리를 통하여 식별된 콘텐트 유형은 이후 이용 가능한 콘텐트 유형을 가지는 스트리밍 서비스에 맵핑될 수 있다. 명령을 통하여 표시된 콘텐트 유형의 분석은 다양한 다른 방식으로 수행될 수 있다.

또 다른 예시에서, 스트리밍 서비스의 선택은 사용자의 스트리밍 서비스 선호도를 고려할 수 있는 사용자 이력에 부분적으로 기초할 수 있다. 사용자 선호도는 다양한 다른 것들 중에서도 구역 별로, 가장 많이 재생된 콘텐트 유형에 기초할 수 있다. 추가적으로, 지리적, 인구학적 및 날씨 유형 데이터를 포함하나 이에 제한되지 않는 다양한 형태의 "외부" 데이터가 포함될 수 있다. 다른 유형의 선택에 영향을 미치는 기준이 존재할 수 있다.

스트리밍 서비스를 선택하는 것에 더하여, 사용자 명령의 처리는 대리(alternate) 표시가 출력되도록 할 수 있다. 그러한 예시에서, 시스템은 명령에 의해 표시된 콘텐트 유형의 재생이 가능한 스트리밍 서비스의 제안을 출력할 수 있다. 다른 예시에서, 시스템은 "콘텐트가 이용 불가하다"는 표시를 출력할 수 있다. 그러한 표시는 네트워크 마이크로폰 장치 또는 컨트롤러를 통하여 NMD, 컨트롤러 또는 하나 이상의 재생 장치에서 출력될 수 있다.

다양한 선택 기준은 다양한 스트리밍 서비스에 대한 신뢰 메트릭(confidence metric)을 결정하기 위한 알고리즘의 입력으로서 작용할 수 있다. 신뢰 메트릭은 특정 스트리밍 서비스가 사용자가 청취하기 희망할 수 있는 것인지 여부의 표시일 수 있다. 예를 들어, 신뢰 수준은 스트리밍 서비스에 할당되는 확률 값 또는 백분율(예컨대, 1-100)일 수 있다. 일 예시에서, 가장 높은 신뢰 메트릭을 가지는 스트리밍 서비스가 스트리밍을 위해 제공될 수 있다. 다른 예시에서, 가장 높은 계산된 신뢰 메트릭이 문턱 신뢰 값을 초과하지 않거나 상위 N 신뢰 수준이 서로의 특정 범위 내에 있는 경우 에러 상태가 트리거될 수 있다. 그러한 경우, 에러 상태는 다른 가능성 중에서도, 네트워크 마이크로폰 장치가 (1) "콘텐트가 이용 불가하다"는 표시를 출력하고, (2) 사용자가 명령을 반복/더 특정하도록 요청하고, (3) 오디오가 선호되는 파트너 또는 디폴트 서비스에 의해 재생되도록 할 수 있다. 신뢰 메트릭은 다양한 많은 다른 방식으로 사용될 수 있다.

여기에서 설명되는 일부 예시가 "사용자" 및/또는 다른 엔티티(entity)와 같은 소정의 행위자에 의해 수행되는 기능을 참조할 수 있으나, 이는 단지 설명을 위한 것임이 이해되어야 한다. 청구범위는 청구범위 자체의 언어에 의하여 명시적으로 요구되지 않는 한 임의의 그러한 예시적인 행위자에 의한 액션을 요구하는 것으로 해석되어서는 안된다. 본 개시가 다양한 다른 실시예들을 포함함이 당업자에 의해 이해될 것이다.

II. 예시적인 동작 환경

도 1은 여기에 개시되는 하나 이상의 실시예가 실시 또는 구현될 수 있는 미디어 재생 시스템(100)의 예시적인 구성을 도시한다. 도시된 미디어 재생 시스템(100)은, 예컨대 주침실, 사무실, 식당 및 거실과 같은 여러 공간 및 장소를 가지는 예시적인 집 환경과 연관된다. 도 1의 예시에 도시된 바와 같이, 미디어 재생 시스템(100)은 재생 장치(102-124), 제어 장치(126 및 128) 및 유선 또는 무선 네트워크 라우터(130)를 포함한다.

예시적인 미디어 재생 시스템(100)의 상이한 컴포넌트와 상이한 컴포넌트가 어떻게 사용자에게 미디어 경험을 제공하도록 상호작용할 수 있는지에 관한 추가적인 논의가 이하의 부분에서 발견될 수 있다. 여기의 논의가 일반적으로 예시적인 미디어 재생 장치(100)를 참조할 수 있으나, 여기에 설명되는 기술이 다른 것들 중에서도 도 1에 도시된 집 환경 내의 적용에 제한되지 않는다. 예를 들어, 여기에 설명되는 기술은, 예컨대 레스토랑, 몰 또는 공항과 같은 상업 설정, SUV(sports utility vehicle), 버스 또는 자동차와 같은 차량, 선박 또는 배, 비행기 등과 같이 다수 구역 오디오가 요구될 수 있는 환경에서 유용할 수 있다.

a. 예시적인 재생 장치

도 2는 도 1의 미디어 재생 시스템(100)의 재생 장치(102-124) 중 하나 이상으로 구성될 수 있는 예시적인 재생 장치(200)의 기능 블록도를 도시한다. 재생 장치(200)는 프로세서(202), 소프트웨어 컴포넌트(204), 메모리(206), 오디오 처리 컴포넌트(208), 오디오 증폭기(210), 스피커(212), 무선 인터페이스(216) 및 유선 인터페이스(218)를 포함하는 네트워크 인터페이스(214) 및 마이크로폰(220)을 포함할 수 있다. 한 경우에, 재생 장치(200)는 스피커(212)를 포함하지 않고 재생 장치(200)를 외부 스피커에 연결하기 위한 스피커 인터페이스를 포함할 수 있다. 다른 경우에, 재생 장치(200)는 스피커(212)와 오디오 증폭기(210)를 포함하지 않고 재생 장치(200)를 외부 오디오 증폭기 또는 오디오비주얼 수신기에 연결하기 위한 오디오 인터페이스를 포함할 수 있다.

일 예시에서, 프로세서(202)는 메모리(206)에 저장된 명령어에 따라 입력 데이터를 처리하도록 구성되는 클럭 구동(clock-driven) 컴퓨팅 컴포넌트일 수 있다. 메모리(206)는 프로세서(202)에 의해 실행 가능한 명령어를 저장하도록 구성되는 유형의 컴퓨터 판독 가능 매체일 수 있다. 예를 들어, 메모리(206)는 어떠한 기능을 달성하기 위해 프로세서(202)에 의해 실행 가능한 소프트웨어 컴포넌트(204) 중 하나 이상으로 로딩될 수 있는 데이터 스토리지일 수 있다. 일 예시에서, 기능은 재생 장치(200)가 오디오 소스 또는 다른 재생 장치로부터 오디어 데이터를 검색하는 것을 수반할 수 있다. 다른 예시에서, 기능은 재생 장치(200)가 네트워크 상에서 다른 장치 또는 재생 장치로 오디오 데이터를 전송하는 것을 수반할 수 있다. 또 다른 예시에서, 기능은 다채널 오디오 환경을 생성하도록 재생 장치(200)를 하나 이상의 재생 장치와 페어링하는 것을 수반할 수 있다.

어떠한 기능은 재생 장치(200)가 오디오 콘텐트의 재생을 하나 이상의 다른 재생 장치와 동기화하는 것을 수반할 수 있다. 동시 재생 동안, 청취자는 재생 장치(200)와 하나 이상의 다른 재생 장치의 오디오 콘텐트의 재생 사이의 시간 지연 차이를 바람직하게는 감지하지 않을 수 있을 것이다. 여기에 참조로서 포함되는 미국 특허 제8,234,395호 "복수의 독립적으로 클로킹되는 디지털 데이터 처리 장치 사이에서 동작을 동기화하기 위한 시스템 및 방법(System and method for synchronizing operations among a plurality of independently clocked digital data processing devices)"은 재생 장치 사이의 오디오 재생 동기화에 대한 더 상세한 일부 예시를 제공한다.

메모리(206)는 재생 장치(200)가 일부인 하나 이상의 구역 및/또는 구역 그룹, 재생 장치(200)에 의해 액세스 가능한 오디오 소스 또는 재생 장치(200)(또는 일부 다른 재생 장치)가 연관될 수 있는 재생 큐와 같은 재생 장치(200)와 연관되는 데이터를 저장하도록 더 구성될 수 있다. 데이터는 주기적으로 갱신되고 재생 장치(200)의 상태를 설명하는 데에 사용되는 하나 이상의 상태 변수로서 저장될 수 있다. 메모리(206)는 또한 미디어 시스템의 다른 장치의 상태와 연관되고 장치 중 하나 이상이 시스템과 연관되는 가장 최신 데이터를 가지도록 장치 사이에서 때때로 공유되는 데이터를 포함할 수 있다. 다른 실시예도 가능하다.

오디오 처리 컴포넌트(208)는 하나 이상의 디지털 아날로그 변환기(DAC), 오디오 전처리 컴포넌트, 오디오 개선 컴포넌트 또는 디지털 신호 처리기(DSP) 등을 포함할 수 있다. 일 실시예에서, 오디오 처리 컴포넌트(208) 중 하나 이상은 프로세서(202)의 서브컴포넌트일 수 있다. 일 예시에서, 오디오 콘텐트가 오디오 처리 컴포넌트(208)에 의하여 처리 및/또는 의도적으로 변경되어 오디오 신호를 산출할 수 있다. 산출된 오디오 신호는 이후 증폭을 위해 오디오 증폭기(210)에 제공되고 스피커(212)를 통해 재생될 수 있다. 특히, 오디오 증폭기(210)는 스피커(212) 중 하나 이상을 구동하기 위한 수준으로 오디오 신호를 증폭하도록 구성되는 장치를 포함할 수 있다. 스피커(212)는 개별 트랜스듀서(transducer)(예컨대, "드라이버(driver)") 또는 하나 이상의 드라이버를 가지는 인클로저(enclosure)를 수반하는 완전한 스피커 시스템을 포함할 수 있다. 스피커(212)의 특정 드라이버는, 예컨대 (예컨대 낮은 주파수를 위한) 서브우퍼(subwoofer), (예컨대 중간 주파수를 위한) 미드레인지(mid-range) 드라이버 및/또는 (예컨대 높은 주파수를 위한) 트위터(tweeter)를 포함할 수 있다. 일부 경우에, 하나 이상의 스피커(212)의 각각의 트랜스듀서는 오디오 증폭기(210)의 개별의 대응하는 오디오 증폭기에 의해 구동될 수 있다. 재생 장치(200)에 의한 재생을 위한 아날로그 신호를 산출하는 것에 더하여, 오디오 처리 컴포넌트(208)는 재생을 위해 하나 이상의 다른 재생 장치로 전송될 오디오 콘텐트를 처리하도록 구성될 수 있다.

재생 장치(200)에 의해 처리 및/또는 재생될 오디오 콘텐트는 오디오 라인인(line-in) 입력 연결(예컨대, 자동 검출 3.5mm 오디오 라인인 연결) 또는 네트워크 인터페이스(214)를 통해서와 같이 외부 소스로부터 수신될 수 있다.

네트워크 인터페이스(214)는 데이터 네트워크 상에서 재생 장치(200)와 하나 이상의 다른 장치 사이의 데이터 흐름을 용이하게 하도록 구성될 수 있다. 이와 같이, 재생 장치(200)는 재생 장치(200)와 통신하는 하나 이상의 다른 재생 장치, 근거리 네트워크 내의 네트워크 장치, 또는 인터넷과 같은 광역 네트워크 상에서 오디오 콘텐트 소스로부터 데이터 네트워크 상에서 오디오 콘텐트를 수신하도록 구성될 수 있다. 일 예시에서, 재생 장치(200)에 의해 송신 및 수신되는 오디오 콘텐트 및 다른 신호는 IP(Internet Protocol) 기반 소스 어드레스 및 IP 기반 목적지 어드레스를 포함하는 디지털 패킷 데이터의 형태로 송신될 수 있다. 그러한 경우, 네트워크 인터페이스(214)는 재생 장치(200)로 향하는 데이터가 재생 장치(200)에 의해 적절하게 수신 및 처리되도록 디지털 패킷 데이터를 파싱하도록 구성될 수 있다.

도시된 바와 같이, 네트워크 인터페이스(214)는 무선 인터페이스(216) 및 유선 인터페이스(218)를 포함할 수 있다. 무선 인터페이스(216)는 재생 장치(200)가 통신 프로토콜(예컨대, IEEE 802.11a, 802.11b, 802.11g, 802.11n, 802.1lac, 802.15, 4G 모바일 통신 표준 등을 포함하는 임의의 무선 표준)에 따라 다른 장치(예컨대, 재생 장치(200)가 연관되는 데이터 네트워크 내의 다른 재생 장치, 스피커, 수신기, 네트워크 장치, 제어 장치)와 무선으로 통신하기 위한 네트워크 인터페이스 기능을 제공할 수 있다. 유선 인터페이스(218)는 재생 장치(200)가 통신 프로토콜(예컨대, IEEE 802.3)에 따라 다른 장치와 유선 연결 상에서 통신하기 위한 네트워크 인터페이스 기능을 제공할 수 있다. 도 2에 도시된 네트워크 인터페이스(214)는 무선 인터페이스(216)와 유선 인터페이스(218)를 모두 포함하나, 일부 실시예에서 네트워크 인터페이스(214)는 무선 인터페이스만 또는 유선 인터페이스만 포함할 수 있다.

마이크로폰(220)은 재생 장치(200)의 환경에서 소리를 검출하도록 배열될 수 있다. 예를 들어, 마이크로폰은 재생 장치의 하우징의 외부 벽에 장착될 수 있다. 마이크로폰은 콘덴서(condenser) 마이크로폰, 일렉트레트(electret) 콘덴서 마이크로폰 또는 다이내믹(dynamic) 마이크로폰과 같이 지금 알려진 또는 추후에 개발되는 임의의 유형의 마이크로폰일 수 있다. 마이크로폰은 스피커(220)의 주파수 범위의 일부에 민감할 수 있다. 스피커(220) 중 하나 이상은 마이크로폰(220)과 역으로 동작할 수 있다. 일부 태양에서, 재생 장치(200)는 마이크로폰(220)을 가지지 않을 수 있다.

일 예시에서, 재생 장치(200) 및 하나의 다른 재생 장치가 페어링되어 오디오 콘텐트의 두 별도 오디오 컴포넌트를 재생할 수 있다. 예를 들어, 재생 장치(200)는 좌측 채널 오디오 컴포넌트를 재생하도록 구성될 수 있고, 다른 재생 장치는 우측 채널 오디오 컴포넌트를 재생하도록 구성될 수 있어, 오디오 콘텐트의 스테레오 효과를 산출 또는 향상시킬 수 있다. ("결합된 재생 장치"로도 언급되는) 페어링된 재생 장치는 다른 재생 장치와 동시에 오디오 콘텐트를 더 재생할 수 있다.

다른 예시에서, 재생 장치(200)는 단일의 통합된 재생 장치를 형성하도록 하나 이상의 다른 재생 장치와 음파적으로(sonically) 통합될 수 있다. 통합된 재생 장치는 페어링된 재생 장치나 통합되지 않은 재생 장치와 다르게 소리를 처리 또는 복제(reproduce)하도록 구성될 수 있는데, 이는 통합된 재생 장치가 오디오 콘텐트가 렌더링 될 수 있는 추가적인 스피커 드라이버를 가질 수 있기 때문이다. 예를 들어, 재생 장치(200)가 낮은 주파수 범위 오디오 콘텐트를 렌더링하도록 설계된 재생 장치(즉, 서브우퍼)인 경우, 재생 장치(200)는 모든 주파수 범위 오디오 콘텐트를 렌더링하도록 설계된 재생 장치와 통합될 수 있다. 그러한 경우, 모든 주파수 범위 재생 장치는 낮은 주파수 재생 장치(200)와 통합되는 경우 오디오 콘텐트의 중간 및 높은 주파수 컴포넌트만을 렌더링하도록 구성될 수 있고, 낮은 주파수 범위 재생 장치(200)는 오디오 콘텐트의 낮은 주파수 컴포넌트를 렌더링한다. 통합된 재생 장치는 단일의 재생 장치 또는 또 다른 통합된 재생 장치와 더 페어링될 수 있다.

예를 들어, 소노스 사는"PLAY:1", "PLAY:3", "PLAY:5", "PLAYBAR", "CONNECT:AMP", "CONNECT" 및 "SUB"를 포함하는 어떠한 재생 장치를 현재 판매 제공한다(또는 제공해 왔다). 임의의 다른 과거, 현재 및/또는 미래의 재생 장치가 추가적으로 또는 대안적으로 여기에 개시되는 예시적인 실시예의 재생 장치를 구현하는 데에 사용될 수 있다. 추가적으로, 재생 장치는 도 2에 도시된 예시나 소노스 제품 제공에 제한되지 않음이 이해된다. 예를 들어, 재생 장치는 유선 또는 무선 헤드폰을 포함할 수 있다. 다른 예시에서, 재생 장치는 개인 모바일 미디어 재생 장치를 위한 도킹 스테이션을 포함하거나 이와 상호작용할 수 있다. 또 다른 예시에서, 재생 장치는 텔레비전, 조명 기구 또는 실내 또는 실외 사용을 위한 일부 다른 장치와 같은 다른 장치 또는 컴포넌트에 통합될 수 있다.

b. 예시적인 재생 구역 구성

다시 도 1의 미디어 재생 시스템(100)을 참조하면, 환경은 각각이 하나 이상의 재생 장치를 가지는 하나 이상의 재생 구역을 가질 수 있다. 미디어 재생 시스템(100)은 하나 이상의 재생 구역으로 성립될 수 있고, 도 1에 도시된 예시적인 구성에 도달하도록 그 후에 하나 이상의 구역이 추가 또는 제거될 수 있다. 각각의 구역에는 사무실, 욕실, 주침실, 침실, 주방, 식당, 거실 및/또는 발코니와 같은 상이한 공간 또는 장소에 따라 이름이 주어질 수 있다. 한 경우에, 단일의 재생 구역은 다수의 공간 또는 장소를 포함할 수 있다. 다른 경우에, 단일의 공간 또는 장소는 다수의 재생 구역을 포함할 수 있다.

도 1에 도시된 바와 같이, 발코니, 식당, 주방, 욕실, 사무실 및 침실 구역은 각각 하나의 재생 장치를 가지고, 거실과 주침실 구역은 각각 다수의 재생 장치를 가진다. 거실 구역에서, 재생 장치(104, 106, 108 및 110)는 개별 재생 장치, 하나 이상의 결합된 재생 장치, 하나 이상의 통합된 재생 장치 또는 그 임의의 조합으로서 동시에 오디오 콘텐트를 재생하도록 구성될 수 있다. 유사하게, 주침실의 경우, 재생 장치(122 및 124)는 개별 재생 장치, 결합된 재생 장치 또는 통합된 재생 장치로서 동시에 오디오 콘텐트를 재생하도록 구성될 수 있다.

일 예시에서, 도 1의 환경에서의 하나 이상의 재생 구역은 각각 상이한 오디오 콘텐트를 재생하고 있을 수 있다. 예를 들어, 사용자는 발코니 구역에서 그릴에 구우면서 재생 장치(102)에 의해 재생되고 있는 힙합 음악을 듣고 있을 수 있는 한편, 다른 사용자는 주방 구역에서 음식을 준비하면서 재생 장치(114)에 의해 재생되고 있는 클래식 음악을 듣고 있을 수 있다. 다른 예시에서, 재생 구역은 다른 재생 구역과 동시에 동일한 오디오 콘텐트를 재생할 수 있다. 예를 들어, 사용자는 발코니 구역에서 재생 장치(102)에 의해 재생되고 있는 것과 같은 락 음악을 재생 장치(118)가 재생하고 있는 사무실 구역에 있을 수 있다. 그러한 경우, 재생 장치(102 및 118)는 사용자가 다른 재생 구역 사이를 이동하면서 소리 내어 재생되고 있는 오디오 콘텐트를 끊김없이 (또는 적어도 실질적으로 끊김없이) 즐길 수 있도록 동시에 락 음악을 재생하고 있을 수 있다. 재생 구역 사이의 동기화는 이전에 참조된 미국 특허 제8,234,395호에 설명된 재생 장치 사이의 동기화와 유사한 방식으로 달성될 수 있다.

위에서 제안된 바와 같이, 미디어 재생 시스템(100)의 구역 구성은 동적으로 수정될 수 있고, 일부 실시예에서, 미디어 재생 시스템(100)은 다수의 구성을 지원한다. 예를 들어, 사용자가 하나 이상의 재생 장치를 구역으로 또는 구역으로부터 물리적으로 이동하는 경우, 미디어 재생 시스템(100)은 변화를 수용하도록 재구성될 수 있다. 예를 들어, 사용자가 재생 장치(102)를 발코니 구역에서 사무실 구역으로 물리적으로 이동하는 경우, 사무실 구역은 이제 재생 장치(118)와 재생 장치(102) 둘다를 포함할 수 있다. 재생 장치(102)는 제어 장치(126 및 128)와 같은 제어 장치를 통하여 요구되는 경우 오피스 구역과 페어링 또는 그룹핑 및/또는 재명명될 수 있다. 한편, 아직 재생 구역이 아닌 집 환경 내 특정 영역으로 하나 이상의 재생 장치가 이동되는 경우, 새로운 재생 구역이 특정 영역에 대하여 생성될 수 있다.

또한, 미디어 재생 시스템(100)의 상이한 재생 구역은 동적으로 구역 그룹으로 조합되거나 개별 재생 구역으로 나누어질 수 있다. 예를 들어, 식당 구역 및 주방 구역(114)은 저녁 파티를 위한 구역 그룹으로 조합되어 재생 장치(112 및 114)가 동시에 오디오 콘텐트를 렌더링할 수 있다. 한편, 사용자가 거실 장소에서 음악을 청취하기를 원하면서 다른 사용자가 텔레비전을 보기를 원하는 경우, 거실 구역은 재생 장치(104)를 포함하는 텔레비전 구역과 재생 장치(106, 108 및 110)을 포함하는 청취 구역으로 나누어질 수 있다.

c. 예시적인 제어 장치

도 3은 미디어 재생 시스템(100)의 제어 장치(126 및 128) 중 하나 또는 둘 다로 구성될 수 있는 예시적인 제어 장치(300)의 기능 블록도를 도시한다. 도시된 바와 같이, 제어 장치(300)는 프로세서(302), 메모리(304), 네트워크 인터페이스(306), 사용자 인터페이스(308), 마이크로폰(310) 및 소프트웨어 컴포넌트(312)를 포함할 수 있다. 일 예시에서, 제어 장치(300)는 미디어 재생 시스템(100)을 위한 전용 컨트롤러일 수 있다. 다른 예시에서, 제어 장치(300)는 아이폰(iPhone)™, 아이패드(iPad)™ 또는 임의의 다른 스마트폰, 태블릿 또는 네트워크 장치(예컨대 PC 또는 맥(Mac)™과 같은 네트워킹된 컴퓨터)와 같이 미디어 재생 시스템 컨트롤러 애플리케이션 소프트웨어가 설치될 수 있는 네트워크 장치일 수 있다.

프로세서(302)는 미디어 재생 시스템(100)의 사용자 액세스, 제어 및 구성을 가능하게 하는 것에 관련되는 기능을 수행하도록 구성될 수 있다. 메모리(304)는 그러한 기능을 수행하도록 프로세서(302)에 의해 실행 가능한 소프트웨어 컴포넌트 중 하나 이상이 로드될 수 있는 데이터 스토리지일 수 있다. 메모리(304)는 또한 미디어 재생 시스템 컨트롤러 애플리케이션 소프트웨어 및 사용자와 미디어 재생 시스템(100)과 연관되는 다른 데이터를 저장하도록 구성될 수 있다.

일 예시에서, 네트워크 인터페이스(306)는 산업 표준(예컨대, 적외선, 라디오, IEEE 802.3을 포함하는 유선 표준, IEEE 802.11a, 802.11b, 802.11g, 802.11n, 802.1lac, 802.15, 4G 모바일 통신 표준을 포함하는 무선 표준 등)에 기초할 수 있다. 네트워크 인터페이스(306)는 제어 장치(300)가 미디어 재생 시스템(100) 내 다른 장치와 통신하기 위한 수단을 제공할 수 있다. 일 예시에서, (예컨대, 상태 변수와 같은) 정보 및 데이터가 네트워크 인터페이스(306)를 통하여 제어 장치(300)와 다른 장치 사이에서 통신될 수 있다. 예를 들어, 네트워크 인터페이스(306)를 통하여 미디어 재생 시스템(100)에서의 재생 구역 및 구역 그룹 구성이 제어 장치(300)에 의해 재생 장치 또는 다른 네트워크 장치로부터 수신되거나 제어 장치(300)에 의해 다른 재생 장치 또는 네트워크 장치로 송신될 수 있다. 일부 경우에, 다른 네트워크 장치는 다른 제어 장치일 수 있다.

음량 제어와 오디오 재생 제어와 같은 재생 장치 제어 명령 또한 네트워크 인터페이스(306)를 통하여 제어 장치(300)로부터 재생 장치로 통신될 수 있다. 위에서 제안된 바와 같이, 미디어 재생 시스템(100)의 구성에 대한 변경 또한 제어 장치(300)를 사용하여 사용자에 의해 수행될 수 있다. 구성 변경은 다른 것들 중에서도 구역으로/으로부터 하나 이상의 재생 장치를 추가/제거, 구역 그룹으로/으로부터 하나 이상의 구역을 추가/제거, 결합된 또는 통합된 재생 장치를 형성, 결합된 또는 통합된 재생 장치로부터 하나 이상의 제어 장치를 분리하는 것을 포함할 수 있다. 따라서, 제어 장치(300)가 전용 컨트롤러이든 미디어 재생 시스템 컨트롤러 애플리케이션 소프트웨어가 설치된 네트워크 장치이든, 제어 장치(300)는 때때로 컨트롤러로서 지칭될 수 있다.

제어 장치(300)는 마이크로폰(310)을 포함할 수 있다. 마이크로폰(310)은 제어 장치(300)의 환경에서 소리를 검출하도록 배열될 수 있다. 마이크로폰(310)은 콘덴서 마이크로폰, 일렉트레트 콘덴서 마이크로폰 또는 다이내믹 마이크로폰과 같이 지금 알려진 또는 추후에 개발되는 임의의 유형의 마이크로폰일 수 있다. 마이크로폰은 주파수 범위의 일부에 민감할 수 있다. 둘 이상의 마이크로폰(310)이 오디오 소스(예컨대, 음성, 들을 수 있는 소리)의 위치 정보를 캡쳐 및/또는 배경 잡음을 필터링하는 것을 돕도록 배열될 수 있다.

제어 장치(300)의 사용자 인터페이스(308)는 도 4에 도시된 컨트롤러 인터페이스(400)와 같은 컨트롤러 인터페이스를 제공함으로써 미디어 재생 시스템(100)의 사용자 액세스 및 제어를 용이하게 하도록 구성될 수 있다. 컨트롤러 인터페이스(400)는 재생 제어 영역(410), 재생 구역 영역(420), 재생 상태 영역(430), 재생 큐 영역(440) 및 오디오 콘텐트 소스 영역(450)을 포함한다. 도시된 사용자 인터페이스(400)는 도 3의 제어 장치(300)(및/또는 도 1의 제어 장치(126 및 128))와 같은 네트워크 장치 상에 제공될 수 있고 미디어 재생 시스템(100)과 같은 미디어 재생 시스템을 제어하도록 사용자에 의해 액세스될 수 있는 사용자 인터페이스의 단지 하나의 예시이다. 미디어 재생 시스템에 비슷한 제어 액세스를 제공하도록 다양한 포맷, 스타일 및 상호작용 시퀀스의 다른 사용자 인터페이스가 하나 이상의 네트워크 장치 상에 대안적으로 구현될 수 있다.

재생 제어 영역(410)은 선택된 재생 구역 또는 구역 그룹 내 재생 장치가 재생 또는 일시 정지, 빨리 감기, 뒤로 감기, 다음으로 스킵, 이전으로 스킵, 셔플(shuffle) 모드 시작/끝, 반복 모드 시작/끝, 크로스 페이드(cross fade) 모드 시작/끝 하도록 (예컨대, 터치의 방식으로 또는 커서를 사용하여) 선택 가능한 아이콘을 포함할 수 있다. 재생 제어 영역(410)은 또한 다른 가능성 중에서도 이퀄라이제이션(equalization) 설정 및 재생 음량을 변경하도록 선택 가능한 아이콘을 포함할 수 있다.

재생 구역 영역(420)은 미디어 재생 시스템(100) 내의 재생 구역의 표상(representation)을 포함할 수 있다. 일부 실시예에서, 다른 가능성 중에서도 결합된 구역의 생성, 구역 그룹의 생성, 구역 그룹의 분리 및 구역 그룹의 재명명과 같은 미디어 재생 시스템의 재생 구역을 관리 또는 구성하기 위한 추가적인 선택 가능한 아이콘을 띄우도록 재생 구역의 그래픽 표상이 선택 가능할 수 있다.

예를 들어, 도시된 바와 같이, "그룹" 아이콘이 재생 구역의 그래픽 표상 각각 내에 제공될 수 있다. 특정 구역의 그래픽 표상 내에 제공되는 "그룹" 아이콘은 특정 구역과 그룹핑될 미디어 재생 시스템의 하나 이상의 다른 구역을 선택하기 위한 옵션을 띄우도록 선택 가능할 수 있다. 그룹핑되면, 특정 구역과 그룹핑된 구역 내 재생 장치는 특정 구역 내 재생 장치와 동시에 오디오 콘텐트를 재생하도록 구성될 것이다. 비슷하게, "그룹" 아이콘이 구역 그룹의 그래픽 표상 내에 제공될 수 있다. 이러한 경우, "그룹" 아이콘은 구역 그룹으로부터 제거될 구역 그룹 내 하나 이상의 구역을 선택 해제하기 위한 옵션을 띄우도록 선택 가능할 수 있다. 사용자 인터페이스(400)와 같은 사용자 인터페이스를 통하여 구역을 그룹핑 및 그룹핑 해제 하기 위한 다른 상호 작용 및 구현도 가능하다. 재생 구역 영역(420) 내 재생 구역의 표상은 재생 구역 또는 구역 그룹이 변경됨에 따라 동적으로 갱신될 수 있다.

재생 상태 영역(430)은 선택된 재생 구역 또는 구역 그룹에서 현재 재생되고 있는, 이전에 재생된 또는 다음에 재생하기로 스케줄된 오디오 콘텐트의 그래픽 표상을 포함할 수 있다. 재생 구역 영역(420) 및/또는 재생 상태 영역(430) 내에서와 같이 선택된 재생 구역 또는 구역 그룹은 사용자 인터페이스 상에서 시각적으로 구분될 수 있다. 그래픽 표상은 트랙 타이틀, 아티스트 이름, 앨범 이름, 앨범 연도, 트랙 길이 및 사용자 인터페이스(400)를 통하여 미디어 재생 시스템을 제어하는 경우 사용자가 알기에 유용할 수 있는 다른 관련 정보를 포함할 수 있다.

재생 큐 영역(440)은 선택된 재생 구역 또는 구역 그룹과 연관되는 재생 큐 내의 오디오 콘텐트의 그래픽 표상을 포함할 수 있다. 일부 실시예에서, 각각의 재생 구역 또는 구역 그룹은 재생 구역 또는 구역 그룹에 의한 재생을 위한 0 이상의 오디오 항목에 대응하는 정보를 포함하는 재생 큐와 연관될 수 있다. 예를 들어, 재생 큐 내의 각각의 오디오 항목은 아마 재생 장치에 의한 재생을 위해 재생 구역 또는 구역 그룹 내 재생 장치에 의해 로컬 오디오 콘텐트 소스 또는 네트워킹된 오디오 콘텐트 소스로부터 오디오 항목을 탐색 및/또는 검색하는 데에 사용될 수 있는 URI(uniform resource identifier), URL(uniform resource locator) 또는 일부 다른 식별자를 포함할 수 있다.

일 예시에서, 재생 목록이 재생 큐에 부가될 수 있으며, 그러한 경우 재생 목록 내 각각의 오디오 항목에 대응하는 정보가 재생 큐에 부가될 수 있다. 다른 예시에서, 재생 큐 내 오디오 항목은 재생 목록으로서 저장될 수 있다. 추가적인 예시에서, 재생 구역 또는 구역 그룹이 재생 기간을 가지는 개별 오디오 항목 대신 멈출 때까지 계속 재생할 수 있는 인터넷 라디오와 같은 계속적으로 스트리밍하는 오디오 콘텐트를 재생하고 있는 경우, 재생 큐는 비어 있거나, 차 있더라도 "사용되지 않을" 수 있다. 대안적인 실시예에서, 재생 큐는 재생 구역 또는 구역 그룹이 그러한 항목을 재생하고 있는 경우 인터넷 라디오 및/또는 다른 스트리밍 오디오 콘텐트 항목을 포함할 수 있고 "사용될" 수 있다. 다른 예시도 또한 가능하다.

재생 구역 또는 구역 그룹이 "그룹핑" 또는 "그룹핑 해제"되는 경우, 영향을 받는 재생 구역 또는 구역 그룹과 연관되는 재생 큐는 소거되거나 재연관될 수 있다. 예를 들어, 제1 재생 큐를 포함하는 제1 재생 구역이 제2 재생 큐를 포함하는 제2 재생 구역과 그룹핑되는 경우, 수립된 구역 그룹은 처음에는 비어 있고 (제2 재생 구역이 제1 재생 구역에 부가된 경우에서와 같이) 제1 재생 큐로부터의 오디오 항목을 포함하고 (제1 재생 구역이 제2 재생 구역에 부가된 경우에서와 같이) 제2 재생 큐로부터의 오디오 항목 또는 제1 및 제2 재생 큐 둘 다로부터의 오디오 항목의 조합을 포함하는 연관된 재생 큐를 가질 수 있다. 후속적으로, 수립된 구역 그룹이 그룹핑 해제되는 경우, 결과로 나오는 제1 재생 구역은 이전의 제1 재생 큐와 재연관될 수 있거나, 비어 있거나 수립된 구역 그룹이 그룹핑 해제되기 전에 수립된 구역 그룹과 연관된 재생 큐로부터의 오디오 항목을 포함하는 새로운 재생 큐와 연관될 수 있다. 유사하게, 결과로 나오는 제2 재생 구역은 이전의 제2 재생 큐와 재연관될 수 있거나, 비어 있거나 수립된 구역 그룹이 그룹핑 해제되기 전에 수립된 구역 그룹과 연관된 재생 큐로부터의 오디오 항목을 포함하는 새로운 재생 큐와 연관될 수 있다. 다른 예시도 가능하다.

다시 도 4의 사용자 인터페이스(400)를 참조하면, 재생 큐 영역(440) 내의 오디오 콘텐트의 그래픽 표상은 트랙 타이틀, 아티스트 이름, 트랙 길이 및 재생 큐 내의 오디오 콘텐트와 연관되는 다른 관련 정보를 포함할 수 있다. 일 예시에서, 오디오 콘텐트의 그래픽 표상은 재생 큐 및/또는 재생 큐 내에 표시되는 오디오 콘텐트를 관리 및/또는 조작하기 위해 추가적인 선택 가능한 아이콘을 띄우도록 선택 가능할 수 있다. 예를 들어, 표시된 오디오 콘텐트는 다른 가능성 중에서도 재생 큐로부터 제거, 재생 큐 내의 다른 위치로 이동, 또는 즉시 또는 임의의 현재 재생 중인 오디오 콘텐트 후에 재생되도록 선택될 수 있다. 재생 구역 또는 구역 그룹과 연관되는 재생 큐는 재생 구역 또는 구역 그룹 내 하나 이상의 재생 장치, 재생 구역 또는 구역 그룹 내에 있지 않은 재생 장치 및/또는 일부 다른 지정된 장치 상에서 메모리에 저장될 수 있다.

오디오 콘텐트 소스 영역(450)은 오디오 콘텐트가 선택된 재생 구역 또는 구역 그룹에 의해 검색 및 재생될 수 있는 선택 가능한 오디오 콘텐트 소스의 그래픽 표상을 포함할 수 있다.

d. 예시적인 오디오 콘텐트 소스

앞서 말한 바와 같이, 구역 또는 구역 그룹 내 하나 이상의 재생 장치는 다양한 이용 가능한 오디오 콘텐트 소스로부터 (예컨대, 오디오 콘텐트를 위한 대응하는 URI 또는 URL에 따라) 재생 오디오 콘텐트를 검색하도록 구성될 수 있다. 일 예시에서, 오디오 콘텐트는 대응하는 오디오 콘텐트 소스로부터 직접(예컨대, 라인인 연결) 재생 장치에 의해 검색될 수 있다. 다른 예시에서, 오디오 콘텐트는 하나 이상의 다른 재생 장치 또는 네트워크 장치를 통하여 네트워크 상에서 재생 장치로 제공될 수 있다.

예시적인 오디오 콘텐트 소스는, 다른 가능성 중에서도, 도 1의 미디어 재생 시스템(100)과 같은 미디어 재생 시스템 내 하나 이상의 재생 장치의 메모리, (예컨대, 제어 장치, 네트워크 가능 개인용 컴퓨터 또는 네트워크 부착 스토리지(networked-attached storage(NAS))와 같은) 하나 이상의 네트워크 장치 상의 로컬 음악 라이브러리, 인터넷을 통해 오디오 콘텐트를 제공하는 스트리밍 오디오 서비스(예컨대, 클라우드), 또는 재생 장치 또는 네트워크 장치 상에서 라인인 입력 연결을 통하여 미디어 재생 시스템에 연결되는 오디오 소스를 포함할 수 있다.

일부 실시예에서, 오디오 콘텐트 소스는 도 1의 미디어 재생 시스템(100)과 같은 미디어 재생 시스템으로부터 정기적으로 추가 또는 제거될 수 있다. 일 예시에서, 하나 이상의 오디오 콘텐트 소스가 추가, 제거 또는 갱신될 때마다 오디오 항목의 인덱싱(indexing)이 수행될 수 있다. 오디오 항목의 인덱싱은 미디어 재생 시스템 내 재생 장치에 의해 액세스 가능한 네트워크 상에서 공유되는 모든 폴더/디렉토리에서 식별 가능한 오디오 항목을 스캐닝하는 것과 메타데이터(예컨대, 다른 것들 중에서도, 타이틀, 아티스트, 앨범, 트랙 길이)와 탐색되는 각각의 식별 가능한 오디오 항목에 대한 URI 또는 URL과 같은 다른 연관되는 정보를 포함하는 오디오 콘텐트 데이터베이스를 생성 또는 갱신하는 것을 수반할 수 있다. 오디오 콘텐트 소스를 관리 및 유지하기 위한 다른 예시도 가능하다.

재생 장치, 제어 장치, 재생 구역 구성 및 미디어 콘텐트 소스에 관한 위의 논의는 아래에서 설명되는 기능 및 방법이 구현될 수 있는 동작 환경의 일부 예시만을 제공한다. 여기에 명시적으로 설명되지 않은 미디어 재생 시스템, 재생 장치 및 네트워크 장치의 다른 동작 환경 및 구성도 기능 및 방법의 구현에 적합하고 적용 가능할 수 있다.

e. 예시적인 복수의 네트워크 장치

도 5는 음성 제어에 기초하여 오디오 재생 경험을 제공하도록 구성될 수 있는 예시적인 복수의 장치(500)를 도시한다. 당업자는 도 5에 도시된 장치가 예시의 목적일 뿐이고 상이한 및/또는 추가적인 장치를 포함하는 변형이 가능할 수 있음을 알 것이다. 도시된 바와 같이, 복수의 장치(500)는 컴퓨팅 장치(504, 506 및 508), 네트워크 마이크로폰 장치(NMD)(512, 514 및 516), 재생 장치(PBD)(532, 534, 536 및 538) 및 컨트롤러 장치(CR)(522)를 포함한다.

복수의 장치(500) 각각은, 다른 가능성 중에서 광역 네트워크(WAN), 근거리 네트워크(LAN) 및 개인 영역 네트워크(PAN)와 같은 하나 이상의 유형의 네트워크 상에서, 다른 예시 중에서도 NFC, 블루투스(Bluetooth), 이더넷(Ethernet) 및 IEEE 802.11과 같은 하나 이상의 네트워크 프로토콜에 따라 복수의 장치 중 하나 이상의 다른 장치와 통신을 수립할 수 있는 네트워크 가능 장치일 수 있다.

도시된 바와 같이, 컴퓨팅 장치(504, 506 및 508)는 클라우드 네트워크(502)의 일부일 수 있다. 클라우드 네트워크(502)는 추가적인 컴퓨팅 장치를 포함할 수 있다. 일 예시에서, 컴퓨팅 장치(504, 506 및 508)는 상이한 서버일 수 있다. 다른 예시에서, 컴퓨팅 장치(504, 506 및 508) 중 둘 이상은 단일 서버의 모듈일 수 있다. 비슷하게, 컴퓨팅 장치(504, 506 및 508) 각각은 하나 이상의 모듈 또는 서버를 포함할 수 있다. 여기에서 설명의 편의를 위해, 컴퓨팅 장치(504, 506 및 508) 각각은 클라우드 네트워크(502) 내에서 특정 기능을 수행하도록 구성될 수 있다. 예를 들어, 컴퓨팅 장치(508)는 스트리밍 음악 서비스를 위한 오디오 콘텐트의 소스일 수 있다.

도시된 바와 같이, 컴퓨팅 장치(504)는 통신 경로(542)를 통하여 NMD(512, 514 및 516)와 인터페이스하도록 구성될 수 있다. NMD(512, 514 및 516)는 하나 이상의 "스마트 홈" 시스템의 컴포넌트일 수 있다. 한 경우에, NMD(512, 514 및 516)는 도 1의 장치의 분포와 유사하게 집 도처에 물리적으로 분산될 수 있다. 다른 경우에, NMD(512, 514 및 516) 중 둘 이상은 물리적으로 서로 상대적으로 가까이 근접하여 위치될 수 있다. 통신 경로(542)는 다른 가능성 중에서도 인터넷을 포함하는 WAN, LAN 및/또는 PAN과 같은 하나 이상의 유형의 네트워크를 포함할 수 있다.

일 예시에서, NMD(512, 514 및 516) 중 하나 이상은 주로 오디오 검출하도록 구성되는 장치일 수 있다. 다른 예시에서, NMD(512, 514 및 516) 중 하나 이상은 다양한 주된 쓸모를 가지는 장치의 컴포넌트일 수 있다. 예를 들어, 도 2 및 3에 관하여 위에서 논의된 바와 같이, NMD(512, 514 및 516) 중 하나 이상은 재생 장치(200)의 마이크로폰(220) 또는 네트워크 장치(300)의 마이크로폰(310)일 수 있다. 또한, 일부 경우에, NMD(512, 514 및 516) 중 하나 이상은 재생 장치(200) 또는 네트워크 장치(300)일 수 있다. 일 예시에서, NMD(512, 514 및/또는 516) 중 하나 이상은 마이크로폰 어레이로 배열되는 다수의 마이크로폰을 포함할 수 있다.

도시된 바와 같이, 컴퓨팅 장치(506)는 통신 경로(544)를 통하여 CR(522) 및 PBD(532, 534, 536 및 538)와 인터페이스하도록 구성될 수 있다. 일 예시에서, CR(522)은 도 2의 네트워크 장치(200)와 같은 네트워크 장치일 수 있다. 따라서, CR(522)은 도 4의 컨트롤러 인터페이스(400)를 제공하도록 구성될 수 있다. 유사하게, PBD(532, 534, 536 및 538)는 도 3의 재생 장치(300)와 같은 재생 장치일 수 있다. 이와 같이, PBD(532, 534, 536 및 538)는 도 1에 도시된 바와 같이 집 도처에 물리적으로 분산될 수 있다. 예시의 목적으로, PBD(536 및 538)는 결합된 구역(530)의 일부일 수 있고, PBD(532 및 534)는 자신의 각각의 구역의 일부일 수 있다. 위에서 설명한 바와 같이, PBD(532, 534, 536 및 538)는 동적으로 결합, 그룹핑, 결합 해제 및 그룹핑 해제될 수 있다. 통신 경로(544)는 다른 가능성 중에서도 인터넷을 포함하는 WAN, LAN 및/또는 PAN과 같은 하나 이상의 유형의 네트워크를 포함할 수 있다.

일 예시에서, NMD(512, 514 및 516)와 같이, CR(522) 및 PBD(532, 534, 536 및 538)도 하나 이상의 "스마트 홈" 시스템의 컴포넌트일 수 있다. 한 경우에, PBD(532, 534, 536 및 538)는 NMD(512, 514 및 516)와 같은 집 도처에 분산될 수 있다. 또한, 위에서 제안된 바와 같이, PBD(532, 534, 536 및 538) 중 하나 이상은 NMD(512, 514 및 516) 중 하나 이상일 수 있다.

NMD(512, 514 및 516)는 근거리 네트워크의 일부일 수 있으며, 통신 경로(542)는 WAN(도시되지 않은 통신 경로) 상에서 NMD(512, 514 및 516)의 근거리 네트워크를 컴퓨팅 장치(504)에 링크하는 액세스 포인트를 포함할 수 있다. 비슷하게, NMD(512, 514 및 516) 각각은 그러한 액세스 포인트를 통하여 서로 통신할 수 있다.

유사하게, CR(522) 및 PBD(532, 534, 536 및 538)는 근거리 네트워크 및/또는 이전 부분에서 논의된 바와 같은 로컬 재생 네트워크의 일부일 수 있고, 통신 경로(544)는 WAN 상에서 CR(522) 및 PBD(532, 534, 536 및 538)의 근거리 네트워크 및/또는 로컬 재생 네트워크를 컴퓨팅 장치(506)에 링크하는 액세스 포인트를 포함할 수 있다. 이와 같이, CR(522) 및 PBD(532, 534, 536 및 538) 각각은 또한 그러한 액세스 포인트를 통하여 서로 통신할 수 있다.

일 예시에서, 통신 경로(542 및 544)는 같은 액세스 포인트를 포함할 수 있다. 일 예시에서, NMD(512, 514 및 516), CR(522) 및 PBD(532, 534, 536 및 538) 각각은 집을 위한 같은 액세스 포인트를 통하여 클라우드 네트워크(502)에 액세스할 수 있다.

도 5에 도시된 바와 같이, NMD(512, 514 및 516), CR(522) 및 PBD(532, 534, 536 및 538) 각각은 또한 통신 수단(546)을 통하여 다른 장치들 중 하나 이상과 직접 통신할 수 있다. 여기에서 설명되는 통신 수단(546)은 하나 이상의 유형의 네트워크 상에서 하나 이상의 네트워크 프로토콜에 따르는 장치 사이의 하나 이상의 형태의 통신을 수반, 및/또는 하나 이상의 다른 네트워크 장치를 통한 통신을 수반할 수 있다. 예를 들어, 통신 수단(546)은 예컨대, 다른 가능성 중에서, 블루투스™(IEEE 802.15), NFC, 무선 다이렉트(Wireless direct) 및/또는 독점 무선(Proprietary wireless) 중 하나 이상을 포함할 수 있다.

일 예시에서, CR(522)은 블루투스™ 상에서 NMD(512)와 통신할 수 있고, 다른 근거리 네트워크 상에서 PBD(534)와 통신할 수 있다. 다른 예시에서, NMD(514)는 다른 근거리 네트워크 상에서 CR(522)과 통신할 수 있고, 블루투스 상에서 PBD(536)과 통신할 수 있다. 추가적인 예시에서, PBD(532, 534, 536 및 538) 각각은 로컬 재생 네트워크 상에서 스패닝 트리 프로토콜(spanning tree protocol)에 따라 서로 통신할 수 있고, 각각은 로컬 재생 네트워크와 다른 근거리 네트워크 상에서 CR(522)과 통신할 수 있다. 다른 예시 또한 가능하다.

일부 경우에, NMD(512, 514 및 516), CR(522) 및 PBD(532, 534, 536 및 538) 사이의 통신 수단은 장치 사이의 통신의 유형, 네트워크 상황 및/또는 지연(latency) 요구에 따라 변할 수 있다. 예를 들어, PBD(532, 534, 536 및 538)를 가지는 집에 NMD(516)가 처음 도입되는 경우 통신 수단(546)이 사용될 수 있다. 한 경우에, NMD(516)는 NFC를 통하여 PBD(538)로 NMD(516)에 대응하는 식별 정보를 송신할 수 있고, PBD(538)는 응답하여 NFC(또는 일부 다른 형태의 통신)를 통하여 NMD(516)로 근거리 네트워크 정보를 송신할 수 있다. 그러나, 일단 NMD(516)가 집 안에 구성되면, NMD(516)과 PBD(538) 사이의 통신 수단은 변할 수 있다. 예를 들어, NMD(516)는 후속적으로 통신 경로(542), 클라우드 네트워크(502) 및 통신 경로(544)를 통하여 PBD(538)와 통신할 수 있다. 다른 예시에서, NMD와 PBD는 로컬 통신 수단(546)을 통하여 통신하지 않을 수 있다. 추가적인 예시에서, NMD와 PBD는 주로 로컬 통신 수단(546)을 통하여 통신할 수 있다. 다른 예시도 가능하다.

일 예시에서, NMD(512, 514 및 516)는 PBD(532, 534, 536 및 538)를 제어하기 위한 음성 입력을 수신하도록 구성될 수 있다. 이용 가능한 제어 명령은 다른 가능성 중에서도 재생 음량 제어, 재생 수송 제어, 음악 소스 선택 및 그룹핑과 같은 앞서 논의된 임의의 미디어 재생 시스템 제어를 포함할 수 있다. 일 예시에서, NMD(512)는 PBD(532, 534, 536 및 538) 중 하나 이상을 제어하기 위한 음성 입력을 수신할 수 있다. 음성 입력을 수신하는 것에 응답하여, NMD(512)는 통신 경로(542)를 통하여 처리를 위해 컴퓨팅 장치(504)로 음성 입력을 송신할 수 있다. 일 예시에서, 컴퓨팅 장치(504)는 음성 입력을 상당하는 텍스트 명령으로 변환하고 텍스트 명령을 파싱하여 명령을 식별할 수 있다. 컴퓨팅 장치(504)는 이후 후속적으로 텍스트 명령을 컴퓨팅 장치(506)로 송신할 수 있다. 다른 예시에서, 컴퓨팅 장치(504)는 음성 입력을 상당하는 텍스트 명령으로 변환하고 이후 후속적으로 텍스트 명령을 컴퓨팅 장치(506)로 송신할 수 있다. 컴퓨팅 장치(506)는 이후 텍스트 명령을 파싱하여 하나 이상의 재생 명령을 식별할 수 있다.

예를 들어, 텍스트 명령이 "'구역 1'에서 '스트리밍 서비스 1'로부터 '아티스트 1'에 의한 '트랙 1'을 재생하라"인 경우, 컴퓨팅 장치(506)는 (i) "스트리밍 서비스 1"로부터 이용 가능한 "아티스트 1"에 의한 "트랙 1"을 위한 URL, 및 (ii) "구역 1" 내의 적어도 하나의 재생 장치를 식별할 수 있다. 이러한 예시에서, "스트리밍 서비스 1"로부터의 "아티스트 1"에 의한 "트랙 1"을 위한 URL은 컴퓨팅 장치(508)를 가리키는 URL일 수 있고 "구역 1"은 결합된 구역(530)일 수 있다. 이와 같이, URL과 PBD(536 및 538) 중 하나 또는 둘 다를 식별한 후, 컴퓨팅 장치(506)는 통신 경로(544)를 통하여 PBD(536 및 538) 중 하나 또는 둘 다로 재생을 위한 식별된 URL을 송신할 수 있다. PBD(536 및 538) 중 하나 또는 둘 다는 응답하여 수신된 URL에 따라 컴퓨팅 장치(508)로부터 오디오 콘텐트를 검색하고 "스트리밍 서비스 1"로부터 "아티스트 1"에 의한 "트랙 1"을 재생하기 시작할 수 있다.

또 다른 예시에서, 컴퓨팅 장치(504)는 일부 처리를 수행하여 관련된 명령 또는 사용자의 의도를 식별하고 컴퓨팅 장치(506)로 음성 입력에 관련되는 미디어 콘텐트에 관한 정보를 제공할 수 있다. 예를 들어, 컴퓨팅 장치(504)는 음성 입력의 음성 텍스트 변환(speech-to-text conversion)을 수행하고 명령 또는 의도(예컨대, 재생, 일시 정지, 정지, 음량 증가, 음량 감소, 스킵, 다음, 그룹핑, 그룹핑 해제)와 명령을 어떻게 실행할 것인가에 관한 다른 정보를 위해 음성 입력을 해석할 수 있다. 컴퓨팅 장치(504) 또는 컴퓨팅 장치(506)는 어떠한 PBD 명령이 컴퓨팅 장치(504)에 의해 결정된 명령 또는 의도에 대응하는지 결정할 수 있다. 음성 입력으로부터 결정되는 명령 또는 의도 및/또는 명령을 실행하는 것에 관련되는 기타 정보는 컴퓨팅 장치(504)로부터 컴퓨팅 장치(506)로 송신될 수 있다. 컴퓨팅 장치(504) 상의 처리는 애플리케이션, 모듈, 애드온(add-on) 소프트웨어, 네이티브 네트워킹된 마이크로폰 시스템 소프트웨어 플랫폼과의 통합(integration) 및/또는 네이티브 네트워킹된 마이크로폰 시스템 소프트웨어 플랫폼에 의해 수행될 수 있다.

이상은 단지 하나의 예시이고 다른 구현 또한 가능함을 당업자는 알 것이다. 한 경우에, 위에서 설명된 복수의 장치(500) 중 하나 이상에 의해 수행되는 동작은 복수의 장치(500) 중 하나 이상의 다른 장치에 의해 수행될 수 있다. 예를 들어, 음성 입력으로부터 텍스트 명령으로의 변환은 NMD(512), 컴퓨팅 장치(506), PBD(536) 및/또는 PBD(538)와 같은 다른 장치 또는 장치들에 의해 대안적으로, 부분적으로 또는 전체적으로 수행될 수 있다. 비슷하게, URL의 식별은 NMD(512), 컴퓨팅 장치(504), PBD(536) 및/또는 PBD(538)와 같은 다른 장치 또는 장치들에 의해 대안적으로, 부분적으로 또는 전체적으로 수행될 수 있다.

f. 예시적인 네트워크 마이크로폰 장치

도 6은 도 5의 NMD(512, 514 및 516) 중 하나 이상으로 구성될 수 있는 예시적인 네트워크 마이크로폰 장치(600)의 기능 블록도를 도시한다. 도시된 바와 같이, 네트워크 마이크로폰 장치(600)는 프로세서(602), 메모리(604), 마이크로폰 어레이(606), 네트워크 인터페이스(608), 사용자 인터페이스(610), 소프트웨어 컴포넌트(612) 및 스피커(614)를 포함한다. 당업자는 다른 네트워크 마이크로폰 장치 구성 및 배열 또한 가능함을 알 것이다. 예를 들어, 네트워크 마이크로폰 장치는 대안적으로 스피커(614)를 배제할 수 있거나, 마이크로폰 어레이(606) 대신 단일의 마이크로폰을 가질 수 있다.

프로세서(602)는 범용 또는 특수 목적 프로세서 또는 컨트롤러의 형태를 취할 수 있는 하나 이상의 프로세서 및/또는 컨트롤러를 포함할 수 있다. 예를 들어, 처리 유닛(602)은 마이크로프로세서, 마이크로컨트롤러, 주문형 집적 회로(application-specific integrated circuit), 디지털 신호 프로세서 등을 포함할 수 있다. 메모리(604)는 이러한 기능을 수행하도록 프로세서(602)에 의해 실행 가능한 소프트웨어 컴포넌트 중 하나 이상이 로드될 수 있는 데이터 스토리지일 수 있다. 따라서, 메모리(604)는 하나 이상의 비일시적 컴퓨터 판독 가능 저장 매체를 포함할 수 있으며, 그 예는 다른 가능성 중에서도 랜덤 액세스 메모리, 레지스터, 캐시 등과 같은 휘발성 저장 매체 및 읽기 전용 메모리, 하드 디스크 드라이브, 고체 상태 드라이브, 플래시 메모리 및/또는 광학 저장 장치와 같은 비휘발성 저장 매체를 포함할 수 있다.

마이크로폰 어레이(606)는 네트워크 마이크로폰 장치(600)의 환경에서 소리를 검출하도록 배열되는 복수의 마이크로폰일 수 있다. 마이크로폰 어레이(606)는 다른 가능성 중에서도 콘덴서 마이크로폰, 일렉트레트 콘덴서 마이크로폰 또는 다이내믹 마이크로폰과 같이 지금 알려진 또는 추후에 개발되는 임의의 유형의 마이크로폰을 포함할 수 있다. 일 예시에서, 마이크로폰 어레이는 네트워크 마이크로폰 장치에 대한 하나 이상의 방향으로부터 오디오를 검출하도록 배열될 수 있다. 마이크로폰 어레이(606)는 주파수 범위의 일부에 민감할 수 있다. 일 예시에서, 마이크로폰 어레이(606)의 제1 부분집합은 제1 주파수 범위에 민감할 수 있고, 마이크로폰 어레이의 제2 부분집합은 제2 주파수 범위에 민감할 수 있다. 마이크로폰 어레이(606)는 오디오 소스(예컨대, 음성, 들을 수 있는 소리)의 위치 정보를 캡쳐 및/또는 배경 잡음을 필터링하는 것을 돕도록 더 배열될 수 있다. 특히, 일부 실시예에서, 마이크로폰 어레이는 복수의 마이크로폰 대신 단일의 마이크로폰으로만 구성될 수 있다.

네트워크 인터페이스(608)는 다른 가능성 중에서도 도 5를 참조하여 CR(522), PBD(532-538), 클라우드 네트워크(502) 내 컴퓨팅 장치(504-508) 및 다른 네트워크 마이크로폰 장치와 같은 다양한 네트워크 장치 사이의 무선 및/또는 유선 통신을 용이하게 하도록 구성될 수 있다. 이와 같이, 네트워크 인터페이스(608)는 이러한 기능을 수행하기 위한 임의의 적절한 형태를 취할 수 있으며, 그 예시는 이더넷 인터페이스, 직렬 버스 인터페이스(예컨대, 파이어와이어, USB 2.0 등), 무선 통신을 용이하게 하도록 적응된 칩셋 및 안테나, 및/또는 무선 및/또는 유선 통신을 제공하는 임의의 다른 인터페이스를 포함할 수 있다. 일 예시에서, 네트워크 인터페이스(608)는 산업 표준(예컨대, 적외선, 라디오, IEEE 802.3을 포함하는 유선 표준, IEEE 802.11a, 802.11b, 802.11g, 802.11n, 802.11ac, 802.15, 4G 모바일 통신 표준을 포함하는 무선 표준 등)에 기초할 수 있다.

네트워크 마이크로폰 장치(600)의 사용자 인터페이스(610)는 네트워크 마이크로폰 장치와의 사용자 상호 작용을 용이하게 하도록 구성될 수 있다. 일 예시에서, 사용자 인터페이스(608)는 사용자가 네트워크 마이크로폰 장치(600)에 직접 입력을 제공하도록, 다른 가능성 중에서도 물리적 버튼, 터치 감지 스크린 및/또는 표면 상에 제공되는 그래픽 인터페이스 중 하나 이상을 포함할 수 있다. 사용자 인터페이스(610)는 사용자에게 시각적 및/또는 오디오 피드백을 제공하도록 조명 및 스피커(614) 중 하나 이상을 더 포함할 수 있다. 일 예시에서, 네트워크 마이크로폰 장치(600)는 스피커(614)를 통하여 오디오 콘텐트를 재생하도록 더 구성될 수 있다.

III. 공간 정정된 음성 검출을 위한 예시적인 시스템, 기기 및 방법

많은 상황에서, 네트워크 마이크로폰 장치는 재생 장치에 근접하여 위치될 수 있다. 예를 들어, 재생 장치는 네트워크 마이크로폰 장치와 같은 공간에 위치될 수 있다.

여기에 설명되는 예시는 NMD가 동작하는 환경의 어쿠스틱스를 NMD에 제공하는 것을 수반한다. 환경은 침실 또는 거실과 같은 집의 공간일 수 있다. 환경의 어쿠스틱스는 공간에서 소리가 어떻게 이동하는지를 정의할 수 있다. 환경의 어쿠스틱스는 NMD로 말해지는 음성 입력을 해석하기 위해 NMD에 의해 사용될 수 있다. 많은 상황에서, 네트워크 마이크로폰 장치(NMD)는 재생 장치에 근접하여 위치될 수 있다. 예를 들어, 재생 장치는 NMD와 같은 공간에 위치될 수 있다.

어쿠스틱스는 통상적으로 환경에서 표면에 의해 정의된다. 예를 들어, 공간 내 딱딱한 표면은 소리를 반사할 수 있다. 한편, 부드러운 표면은 소리를 흡수할 수 있다. 환경에서의 이러한 상이한 유형의 표면의 존재 및 배열은 공간의 어쿠스틱스 및 음성 입력을 해석하기 위한 NMD의 능력에 영향을 미칠 것이다.

NMD는 이러한 어쿠스틱스의 관점에서 말해진 음성 입력을 정확히 복구할 필요가 있을 수 있다. 추가적으로, 일부 경우에, NMD가 음성 입력을 수신하는 것과 동시에 오디오 콘텐트가 재생 장치에 의해 동시에 재생될 수 있다. 콘텐트 재생 및/또는 환경의 어쿠스틱스의 지식은 NMD에 의해 음성 입력을 해석하는 데에 사용될 수 있다.

도 7-11은 개시된 동작 환경 내에서 구현될 수 있는 실시예를 제시한다.

도 7은 NMD에 의해 수신되는 음성 입력의 해석을 개선하도록 수행될 수 있는 기능의 흐름도이다. 일부 예시에서, 설명된 이러한 기능 중 하나 이상은 재생 장치에 의해 수행될 수 있다. 다른 예시에서, 504-508과 같은 컴퓨팅 장치가 또한 재생 장치와 함께 또는 재생 장치 대신에 이러한 기능 중 하나 이상을 수행할 수 있다. 컴퓨팅 장치는 재생 장치와 연관될 수 있고 재생 장치와 연관된 처리를 수행할 수 있다.

702에서, 환경의 어쿠스틱스가 획득될 수 있다. 어쿠스틱스는 재생 장치가 동작하는 환경과 연관될 수 있다. 어쿠스틱스는 다양한 방식으로 결정되었을 수 있다. 예를 들어, 재생 시스템은 일부 교정(calibration) 단계를 통해 환경의 어쿠스틱스를 이미 결정했을 수 있다. 미디어 재생 시스템의 재생 장치는 마이크로폰과 스피커를 가질 수 있다. 스피커는 하나 이상의 톤을 출력할 수 있고 하나 이상의 스피커는 각각의 마이크로폰을 사용하여 톤을 수신할 수 있다. 톤은 오디오의 하나 이상의 주파수일 수 있다. 재생 장치 각각은 톤을 출력할 수 있다. 복수의 재생 장치에 의해 수신되는 톤에 기초하여, 환경의 어쿠스틱스가 결정될 수 있다. 다른 예시에서, (제어 장치, 제1 재생 장치 또는 NMD 자체와 같은) 다른 네트워크 장치는 제2 재생 장치의 스피커에 의해 출력되는 테스트 톤을 수신하는 마이크로폰을 포함할 수 있다. 다른 네트워크 장치는 재생 장치 대신에 또는 그에 더하여 환경의 어쿠스틱스를 결정하도록 수신된 테스트 톤을 분석할 수 있다. 다른 배열도 가능하다.

어쿠스틱스는 톤의 스펙트럼 응답, 공간 응답 및 시간 응답에 의해 정의될 수 있다. 스펙트럼 응답은 마이크로폰에서 수신되는 소리 에너지의 분석일 수 있다. 공간 응답은 마이크로폰에서 수신되는 소리 에너지의 방향의 분석일 수 있다. 시간 응답은 마이크로폰에서 수신되는 소리 에너지의 반향의 분석일 수 있다. 재생 시스템은 이러한 응답을 분석할 수 있고 아마 톤이 수신되는 방향을 처리하여 환경의 어쿠스틱스를 결정할 수 있다. 이러한 어쿠스틱스 특징의 표시는 재생 장치 및/또는 컴퓨팅 장치(504-508) 중 하나 이상에 저장될 수 있다.

다른 예시에서, 어쿠스티그는 공간의 크기, 공간의 천장의 높이, 공간 내 가구와 같은 환경의 알려진 특징에 기초하여 미리 정의될 수 있다. 컴퓨팅 장치(504-508) 중 하나 이상에 의해 유지되는 데이터베이스는 상이한 유형의 특징을 가지는 공간에 대한 어쿠스틱스를 저장할 수 있다. 컴퓨팅 장치 상에 저장된 어쿠스틱스는 특정 특징을 가지는 공간의 이전 분석에 기초하여 결정되었을 수 있다. 사용자는 미디어 재생 시스템의 컨트롤러 장치 상에 공간의 특징을 입력할 수 있고 컨트롤러 장치는 이러한 데이터베이스에 액세스하여 공간의 어쿠스틱스를 결정할 수 있다. 이러한 어쿠스틱스는 이후 환경 내에 위치된 재생 장치로 제공 또는 컴퓨팅 장치 상에 저장될 수 있다.

예시로서, 어쿠스틱스는 공간이 왼쪽에 딱딱한 표면, 오른쪽에 부드러운 표면을 가지고 직사각형 모양임을 가리킬 수 있다. 본질적으로, 어쿠스틱스는 어쿠스틱스 관점으로부터 공간을 특징지을 수 있다.

미디어 재생 시스템은 복수의 재생 장치를 포함할 수 있다. 재생 장치 각각은 재생 장치가 동작하는 환경의 어쿠스틱스를 가질 수 있다. 704에서, 하나 이상의 NMD가 식별될 수 있다. 하나 이상의 NMD는 같은 환경에 있을 수 있다. 일부 예시에서, NMD에 어쿠스틱스를 전송하는 재생 장치는 NMD에 가장 가까운 재생 장치일 수 있다. 다른 예시에서, NMD에 어쿠스틱스를 전송하는 재생 장치는 NMD와 같은 구역에 있는 재생 장치일 수 있다. 근접성은 재생 장치 및/또는 NMD의 셋업 동안 일부 교정 프로세스 동안 표시될 수 있다. 예를 들어, NMD는 그 존재의 표시를 재생 장치에 전송할 수 있다. 이러한 존재는 재생 장치에서 상태 변수에 의해 표시될 수 있다. 재생 장치는 이러한 상태 변수에 액세스하여 NMD를 식별할 수 있다. 유사하게, NMD는 재생 장치의 존재를 식별하는 유사한 상태 변수를 가질 수 있다.

다른 예시에서, 미디어 재생 시스템의 재생 장치는 NMD와 결합(페어링 또는 그룹핑)될 수 있다. 결합은 또한 같은 공간 또는 구역 또는 동시에 오디오 콘텐트를 재생하는 것과 같이 재생 장치와 NMD가 서로 가까이 근접함을 가리킬 수 있다. 재생 장치와 NMD 사이의 결합은 어떠한 면에서 재생 장치들이 어떻게 결합될 수 있는지와 유사할 수 있다. 이러한 결합은 재생 장치에 의해 저장되는 상태 변수에 반영될 수 있다. NMD가 재생 장치와 결합되는 경우, 재생 장치는 NMD를 식별하도록 배열될 수 있다. 또한, NMD가 이동되고 다른 재생 장치에 결합되는 경우, 다른 재생 장치의 상태 변수는 NMD와의 결합을 반영하도록 갱신될 수 있다. 유사하게, NMD는 새로운 재생 장치의 존재를 반영하도록 자신의 상태 변수를 갱신할 수 있다.

일부 예시에서, 결합된 재생 장치와 NMD는 자신들 간의 지연을 감소시키도록 다양한 네트워킹 기술을 사용할 수 있다. 예를 들어, WAN 대신 로컬 네트워크 연결(LAN 또는 블루투스)이 통신을 위해 사용될 수 있다. 다른 예시로서, 통신은 로컬 네트워크에서 다른 주파수 영역으로 회귀, 예컨대 재생 장치가 NMD에 결합되는 동안 "전형적인" 2.4Ghz 통신에서 5Ghz 통신으로 전환할 수 있다. 또 다른 예시로서, 재생 장치가 NMD에 결합되는 경우 통신은 2.4 또는 5Ghz 스펙트럼 상에서 예약된 채널로 전환할 수 있거나 다른 네트워크 트래픽이 감소, 예컨대 재생 장치가 다른 네트워크 트래픽에 대한 중계 노드로서 작용하는 것을 멈출 수 있다. 다른 배열도 가능하다.

706에서, 어쿠스틱스가 음성 입력에 적용되게 하도록 어쿠스틱스가 제공될 수 있다. 일 실시예에서, 어쿠스틱스는 재생 장치로부터 통신 네트워크(546) 중 하나 이상 상에서 NMD로 메시지로서 전송될 수 있다. 다른 실시예에서, 재생 장치는 컴퓨팅 장치 상의 어쿠스틱스가 통신 링크(542)를 통하여 NMD로 전송되도록 할 수 있다. 또 다른 실시예에서, 어쿠스틱스는 재생 장치와 연관된 컴퓨팅 장치 상에 있을 수 있고, 재생 장치는 NMD와 연관되는 컴퓨팅 장치가 어쿠스틱스에 대한 액세스를 가지게 할 수 있다. 다른 배열도 가능하다.

일부 실시예에서, 재생 장치는 NMD에 어쿠스틱스를 제공할 필요가 없을 수 있다. 대신에, NMD는 컴퓨팅 장치 자체로부터 어쿠스틱스를 검색할 수 있다. NMD는 자신에 근접한(결합된, 페어링된 등) 재생 장치의 표시를 제공할 수 있고 컴퓨팅 장치는 환경에 대한 어쿠스틱스를 제공할 수 있다. 다른 배열 또한 가능하다.

NMD는 전형적으로 마이크로폰 응답을 통하여 음성 입력을 처리할 수 있다. 마이크로폰 응답은 주파수에 대한 마이크로폰의 감도의 표시이다.

실시예에서, NMD는 자신이 수신한 음성 입력에 어쿠스틱스를 적용하여 음성 입력 내 왜곡을 정정할 수 있다. 이러한 방식으로 NMD는 음성 입력을 더 잘 해석할 수 있다. NMD는 이러한 어쿠스틱스 자체를 적용 및/또는 컴퓨팅 장치로 처리를 분담시킬 수 있으며, 이 경우 NMD 상의 처리는 클라우드 기반일 수 있다.

NMD는 음성 입력에 어쿠스틱스를 적용하는 데에 있어서 어쿠스틱스에 기초하는 필터를 정의할 수 있다. 필터는 환경의 스펙트럼, 공간 및 시간 응답을 포함할 수 있다. NMD는 음성 입력을 해석하기 전에 왜곡을 정정하도록 NMD에 의해 수신된 음성 입력에 필터를 적용할 수 있다. 필터는 다음의 도출에 기초하여 결정될 수 있다.

여기서 Xa는 교정 톤, P는 재생 장치의 스피커 응답, h는 공간 응답(예컨대, 공간의 어쿠스틱스), m은 마이크로폰 응답, Ya는 교정 처리 동안 전송되는 톤에 대응하는 수신된 톤일 수 있는 처리된 응답이다. 부호 x는 주파수 도메인에서의 콘볼루션(convolution) 함수를 나타낸다. Xa, P, m 및 Ya가 알려짐에 따라 공간 응답(예컨대, 필터)은 다음과 같이 계산될 수 있다.

이후, 음성 입력 Yb가 수신되는 경우, 공간 응답 h(예컨대, 필터)가 다음과 같이 음성 입력 Xb를 결정하도록 적용될 수 있다.

일부 실시예에서, 재생 시스템은 환경의 변화를 설명하도록 주기적으로 한경의 어쿠스틱스를 결정할 수 있다. 이러한 경우, 하나 이상의 재생 장치는 동작(702-706)을 주기적으로 수행할 수 있어 NMD는 그것을 적절히 해석하도록 수신된 음성 입력에 현재의 어쿠스틱스를 적용할 수 있다.

도 8은 NMD에 의한 음성 입력의 복구를 개선하도록 수행될 수 있는 기능의 다른 흐름도이다. 일부 예시에서, 이러한 설명된 기능 중 하나 이상은 재생 장치에 의해 수행될 수 있다. 다른 예시에서, 504-508과 같은 컴퓨팅 장치도 재생 장치와 함게 또는 재생 장치 대신에 이러한 기능 중 하나 이상을 수행할 수 있다. 컴퓨팅 장치는 재생 장치와 연관될 수 있고 재생 장치와 연관된 처리를 수행할 수 있다.

802에서 환경의 어쿠스틱스가 획득될 수 있고, 804에서 NMD가 식별될 수 있으며, 806에서 어쿠스틱스가 제공될 수 있다. 어쿠스틱스는 NMD 및/또는 NMD와 연관되는 컴퓨팅 장치에 제공될 수 있다.

일부 상황에서, NMD는 미디어 재생 시스템이 또한 오디오 콘텐트를 재생하고 있는 환경에서 동작할 수 있다. NMD는 오디오 콘텐트가 또한 재생되고 있는 동안 음성 입력을 수신할 수 있다.

808에서, 오디오 콘텐트가 제공될 수 있다. 오디오 콘텐트는 NMD 및/또는 NMD와 연관되는 컴퓨팅 장치에 제공될 수 있다. 콘텐트는 예컨대 재생 장치에 의해 재생되고 있는 음악의 스트림일 수 있다. 재생 장치는 오디오 콘텐트를 NMD에 근접한, NMD와 같은 구역 내의, 또는 NMD에 결합(또는 그룹핑)될 수 있는 NMD에 제공할 수 있다. 일부 실시예에서, 예컨대 NMD에 의한 처리가 클라우드 기반인 경우, 콘텐트는 컴퓨팅 장치를 거쳐 NMD에 제공될 수 있다. 또 다른 실시예에서, 예컨대 NMD 및/또는 재생 장치에 의한 처리가 클라우드 기반인 경우, 콘텐트는 재생 장치와 연관되는 컴퓨팅 장치를 거쳐 NMD와 연관되는 컴퓨팅 장치에 제공될 수 있다.

808에서, 어쿠스틱스(및 선택적으로 오디오 콘텐트)가 음성 입력에 적용될 수 있다. 예를 들어, NMD(또는 NMD에 연관되는 컴퓨팅 장치)는 음성 입력을 해석하도록 NMD에 의해 수신된 음성 입력에 필터를 적용할 수 있다. 예를 들어, NMD(또는 NMD에 연관되는 컴퓨팅 장치)는 음성 입력을 더 잘 분리하도록 음성 입력과 함께 재생되고 있는 오디오 콘텐트를 사용할 수 있다. 음성 입력을 해석하기 위하여, 재생 장치에 의해 재생되고 있는 오디오 콘텐트는 실질적으로 잡음일 수 있다. 이러한 점에서, 수신된 음성 입력을 더 잘 분리하기 위하여 오디오 콘텐트는 수신된 음성 입력에서 제하여질 수 있다.

도 9는 음성 입력을 해석하는 데에 있어서 NMD 및/또는 연관되는 컴퓨팅 장치에 의해 수행되는 기능의 흐름도이다. 902에서, 환경의 어쿠스틱스의 표시가 획득될 수 있다. 904에서, 재생 장치에 의해 재생되고 있는 오디오 콘텐트가 또한 선택적으로 수신될 수 있다. 재생 장치는 같은 구역에, NMD가 있는 데에 또는 NMD에 결합될 수 있다. 906에서, 예컨대 NMD에 의해 음성 입력이 수신될 수 있다. 음성 입력은 음성 명령일 수 있다. NMD는 NMD 상의 일부 버튼 눌림이나 그것이 음성 입력이라는 것을 나타내는 음성 입력 내 명령 단어를 통해 자신이 음성 입력을 수신하였음을 알 수 있다. 908에서, 수신된 음성 입력을 해석하도록 필터 및/또는 재생 장치에 의해 재생되고 있는 오디오 콘텐트 중 하나 이상이 적용/사용될 수 있다.

도 10은 예컨대 재생 장치에 의해 제공되는 것이 아니라 NMD가 환경의 어쿠스틱스를 결정하는 것을 가능하게 하기 위한 기능의 흐름도이다. 기능은 재생 장치 및/또는 재생 장치와 연관되는 컴퓨팅 장치에 의해 수행될 수 있다.

NMD는 톤을 재생하기 위한 하나 이상의 재생 장치를 위한 표시를 전송할 수 있다. NMD가 표시를 전송하는 재생 장치는 NMD에 근접한 재생 장치 및/또는 NMD에 결합(또는 그룹핑)되거나 같은 구역에 있는 재생 장치를 포함할 수 있다.

1002에서, 오디오 톤을 재생하기 위한 표시가 수신될 수 있다. 표시는 NMD 또는 NMD와 연관되는 컴퓨팅 장치로부터 수신될 수 있다. 응답하여, 1004에서, 오디오 톤이 재생 장치에 의해 출력될 수 있다. NMD는 마이크로폰 어레이(606)를 사용하여 톤을 수신할 수 있다. 마이크로폰 어레이(606)는 톤의 크기(magnitude)의 표시를 제공할 수 있다. 추가적으로, 마이크로폰 어레이(606)는 톤의 방향의 표시를 제공할 수 있다. 방향은 복수의 재생 장치로부터 톤을 수신하는 것에 기초하여 결정될 수 있다. 복수의 재생 장치로부터 톤을 수신하는 것에 기초하여, NMD 및/또는 연관된 컴퓨팅 장치는 이후 환경의 어쿠스틱스를 결정할 수 있다. 이러한 방식으로 NMD는 재생 장치로부터 이러한 어쿠스틱스를 획득할 필요가 없을 수 있다.

마이크로폰 어레이(606)는 NMD가 음성 입력이 오는 방향을 결정하는 것을 가능하게 할 수 있다. 이러한 방향은 재생 장치에 의해 사용되어 오디오 콘텐트의 재생을 개선할 수 있다. 예를 들어, 미디어 재생 시스템은 하나 이상의 재생 장치로부터 산출되는 오디오 소리가 음성 입력이 오는 방향으로 향하게 할 수 있다. 이는 청취자가 위치된 곳일 수 있다. 다른 배열 또한 가능하다.

도 11은 NMD를 통하여 결정된 방향성을 사용하는 것과 연관되는 재생 장치 및/또는 연관되는 컴퓨팅 장치에 의해 수행되는 기능의 흐름도이다.

1102에서, 방향의 표시가 수신될 수 있다. 이는 NMD 및/또는 연관된 컴퓨팅 장치로부터 수신될 수 있다. 방향은 NMD가 음성 입력을 수신한 곳과 따라서 사용자가 환경에서 위치될 수 있는 곳을 나타낼 수 있다. 재생 장치는 복수의 스피커를 가질 수 있고, 그 출력은 재생 장치에 의해 재생되는 오디오 콘텐트의 방향성에 영향을 미치도록 제어될 수 있다. 1104에서, 재생 장치는 복수의 스피커의 오디오 출력을 조정하도록 이러한 방향성을 사용할 수 있다. 오디오 출력은 음악 콘텐트의 재생일 수 있다. 재생 장치는 NMD에 의해 표시되는 방향성에 따라 오디오 출력의 방향성을 산출하도록 스피커에 의해 출력되는 오디오 신호의 위상(phase)을 조정할 수 있다. 이러한 점에서, 오디오 콘텐트는 사용자에게 향할 수 있고, 따라서 오디오 청취 경험을 개선할 수 있다. 추가적으로 또는 대안적으로, 재생 장치는 오디오 출력의 크기(예컨대, 음량)도 조정할 수 있다. 일부 경우에, NMD는 오디오 출력도 산출할 수 있다. 오디오 출력은 음성 입력에 대한 음성 응답 또는 비프(beep) 또는 톤과 같은 일부 유형의 다른 소리일 수 있다. 또 추가적으로 또는 대안적으로, 방향성은 NMD 대신에 또는 그에 더하여 이러한 오디오 출력을 출력하는 데에 적합할 수 있는 재생 장치를 식별하도록 재생 장치에 의해 사용될 수 있다. 예를 들어, 식별된 재생 장치는 청취자의 바로 앞에 있을 수 있고, 이는 청취자가 오디오 출력을 듣는 것을 더 쉽게 만들 수 있다. 다른 배열 또한 가능하다.

IV. 미디어 재생 시스템의 음성 제어를 위한 예시적인 시스템, 기기 및 방법

여기에 설명되는 예시는 미디어 재생 시스템을 제어하는 것을 수반할 수 있다. 특히, 도 12는 오디오 응답을 재생하기 위한 방법의 예시적인 흐름도(1200)를 도시한다. 방법(1200)은, 예컨대 도 1의 미디어 재생 시스템(100), 도 2의 재생 장치(200) 중 하나 이상, 도 3의 제어 장치(300) 중 하나 이상, 및 도 5의 시스템(500)의 복수의 장치 중 하나 이상을 수반하는 동작 환경에서 구현될 수 있는 방법의 실시예를 제시한다. 방법(1200)은 여기에 설명되는 바와 같이 다양한 통신 경로를 통하여 네트워킹된 마이크로폰 시스템과 미디어 재생 시스템 사이에서 정보를 송신 및 수신하는 것 및/또는 2016년 2월 22일에 출원된 출원 제62/298,350호 "네트워킹된 재생 시스템 및 네트워킹된 마이크로폰 시스템을 수반하는 메타데이터 교환(Metadata exchange involving a networked playback system and a networked microphone system)"에 설명된 메타데이터 교환 채널을 사용하는 것을 수반할 수 있다. 이 출원은 여기에 참조로서 전체가 포함된다. 방법(1200)은 하나 이상의 동작, 기능 또는 액션을 포함할 수 있다.

일부 예시에서, NMD(512, 514, 516) 중 하나 이상은 하나 이상의 네트워크 또는 통신 경로(542, 546)에 연결될 수 있다. NMD는 미디어 재생 시스템(예컨대, 컴퓨팅 장치(506), CR(522), PBD(532, 534, 536, 538))과 통합 또는 인터페이스하도록 구성될 수 있다. NMD는 네트워킹된 마이크로폰 시스템(예컨대, NMD(512, 514, 516, 504))에 포함될 수 있다.

블록 1202에서, NMD를 미디어 재생 시스템과 인터페이스 또는 연관시키도록 NMD를 구성하기 위하여, 사용자는 예컨대 제어 장치(예컨대, CR(522)) 상에서 NMD 또는 네트워킹된 마이크로폰 시스템 또는 미디어 재생 시스템과 연관되는 애플리케이션을 시작하는 것을 선택할 수 있다. 애플리케이션은 네트워킹된 마이크로폰 시스템 및/또는 미디어 재생 시스템의 기능 또는 설정을 제어하기 위한 애플리케이션일 수 있다. 네트워킹된 마이크로폰 시스템은 네트워킹된 마이크로폰 시스템에 추가 또는 향상된 기능을 제공하기 위해 이용 가능한 하나 이상의 전문화된 애드온 특징을 가질 수 있다.

블록 1204에서, 네트워킹된 마이크로폰 시스템을 위한 이용 가능한 애드온 특징이 사용자가 선택하도록 디스플레이될 수 있다. 도 13a에서 이용 가능한 애드온 특징을 디스플레이하는 예시적인 사용자 인터페이스(1300)가 도시된다. NMD는 하나 이상의 이용 가능한 애드온 특징(1302, 1304, 1306)을 가질 수 있다. 특징(1302)은 예컨대 미디어 재생 시스템의 재생을 제어할 수 있는 음악 제어 특징일 수 있다. 블록 1206에서, 제어 장치는 NMD에 음악 제어 특징 또는 스킬을 부가하기 위한 사용자 입력을 수신할 수 있다. 예를 들어, 사용자는 특징(1302)을 선택함으로써 음악 제어 특징(1302)을 부가하도록 선택할 수 있다. 음악 제어 특징(1302)은 사용자를 위해 네트워킹된 마이크로폰 시스템에 음악 제어 기능성 또는 스킬을 부가하는 애플리케이션일 수 있다. 음악 제어 특징(1302)을 부가하도록 선택한 후, 디스플레이는 사용자로부터 계정 정보를 유도하도록 사용자 인터페이스(1308)를 보여주도록 변할 수 있다.

블록 1208에서, 제어 장치는 사용자 인터페이스(1308) 및 입력 필드(1310 및 1312)를 통하여 음악 제어 특징을 위한 계정 정보를 수신할 수 있다. 계정 정보는 미디어 재생 시스템 및/또는 음악 서비스를 가지는 사용자가 가지는 계정의 것일 수 있다. 계정 정보는 계정의 사용자 이름 및 패스워드를 포함할 수 있다. 사용자 이름은 필드(1310)에 입력될 수 있고 패스워드는 필드(1312)에 입력될 수 있다. 사용자는 제출 버튼(1314)과 같은 버튼을 선택하여 미디어 재생 시스템(예컨대, 컴퓨팅 장치(506)) 및/또는 음악 서비스(예컨대, 컴퓨팅 장치(508))와의 인증을 위한 사용자 이름 및 패스워드를 제출할 수 있다. 계정 정보는 컴퓨팅 장치(504), 컴퓨팅 장치(506) 및/또는 컴퓨팅 장치(508)에서의 인증을 위해 통신 경로(542, 544, 546) 및/또는 메타데이터 교환 채널 중 임의의 것을 통하여 송신될 수 있다. 인증되면, 계정과 연관되는 사용자 정보가 미디어 재생 시스템으로부터 네트워킹된 마이크로폰 시스템으로 송신될 수 있다. 사용자 정보는 맞춤(custom) 이름(예컨대, 맞춤 구역 이름, 맞춤 재생 목록 이름, 맞춤 노래 이름, 맞춤 앨범 이름, 맞춤 아티스트 이름 등), 사용자 정보와 연관되는 집 식별자, PBD 식별자 및/또는 구역 식별자일 수 있다. 맞춤 이름은 사용자에 의해 제공되는 임의의 이름일 수 있다. 예를 들어, 미디어 재생 시스템은 구역을 명명할 때 사용자가 선택하기 위한 보통의 구역 이름의 목록을 제공 및/또는 사용자에게 구역의 이름을 입력하는 옵션을 제공할 수 있다. 제어 장치(300)의 인터페이스는 보통의 구역 이름의 목록을 디스플레이 및/또는 제어 장치(300)에 의해 수신되는 입력(예컨대, 음성, 텍스트)을 통해 맞춤 구역 이름을 사용자가 넣을 수 있는 필드를 디스플레이할 수 있다. 맞춤 이름 정보는 시스템(500) 내 임의의 장치와 공유 또는 송신될 수 있다.

블록 1210에서, 디폴트 구역(예컨대, 하나 이상의 재생 장치) 또는 디폴트 구역(예컨대, 상이한 구역, 적어도 두 구역의 그룹 내 적어도 두 재생 장치)이 NMD를 위해 결정될 수 있다. 디폴트 구역 또는 재생 장치는 2016년 2월 22일에 출원된 출원 제62/298,410호 "디폴트 재생 장치(Default Playback Device(s))"에서 설명된 바와 같이 결정될 수 있다. 이 출원은 여기에 그 전체가 참조로서 포함된다.

일부 태양에서, 사용자는 초기 구성 또는 설정 동안 디폴트 구역을 특정할 수 있다. 도 13c에 도시된 사용자 인터페이스(1316)는 사용자가 NMD와 연관시키도록 디폴트 재생 구역을 선택하는 것을 가능하게 하는 예시적인 사용자 인터페이스를 도시한다. 사용자 인터페이스(1316)는 이용 가능한 재생 구역(1318)의 목록을 디스플레이할 수 있다. 이용 가능한 재생 구역의 디스플레이된 이름은 블록 1208에서 입력된 사용자 계정과 연관된 맞춤 이름을 포함할 수 있다. 예를 들어, 이용 가능한 재생 구역(1318)의 목록은 "거실" 및 "주방" 및 "닉의 방"의 맞춤 구역 이름을 포함할 수 있다. 디스플레이된 목록은 NMD 또는 다른 제어 장치에 의해 수신된 명령에 응답하여 사용자가 음성 응답 및/또는 음악의 재생을 위한 디폴트 구역을 특정하는 것을 가능하게 하도록 선택 가능할 수 있다. 도 13c는 사용자가 주방을 디폴트 구역을 선택한 예시를 도시한다. 사용자는 제출 버튼과 같은 버튼(1320)을 선택하여 디폴트 구역의 선택을 확인하고 제출할 수 있다. 도 13d에 도시된 확인 스크린(1322)은 설정 과정이 완료되었음을 확인하도록 사용자에게 디스플레이될 수 있고, 사용자는 버튼(1326)을 선택하여 확인 스크린(1322)을 종결시킬 수 있다.

블록 1212에서, 사용자별 재생 정보가 예컨대 미디어 재생 시스템으로부터 네트워킹된 마이크로폰 시스템으로 전송될 수 있다. 사용자별 정보는 맞춤 구역 이름, 맞춤 재생 목록 및/또는 맞춤 재생 목록 이름과 같은 맞춤 재생 정보일 수 있다. 일부 태양에서, 사용자별 정보 및/또는 사용자 계정은 집 식별자(HHI)와 연관될 수 있다. 사용자별 재생 정보는 미디어 재생 시스템(예컨대, 컴퓨팅 장치(506), CR(522), PBD(532), PBD(534), PBD(536) 및/또는 PBD(538))로부터 네트워킹된 마이크로폰 시스템(예컨대, 컴퓨팅 장치(504), NBD(512), NMD(514) 및/또는 NMD(516))으로 예컨대 메타데이터 교환 채널 및/또는 미디어 재생 시스템과 네트워킹된 마이크로폰 시스템 사이의 임의의 다른 통신 경로를 통하여 송신될 수 있다.

통신 장치(504)는 상이한 변수 유형과 동적으로 연관될 수 있는 변수일 수 있는 동적 변수로서 맞춤 재생 정보를 저장할 수 있다. 예를 들어, "닉의 방"은 맞춤 구역 이름일 수 있고 구역 변수 유형과 연관되는 동적 변수로서 저장될 수 있다. 다른 예시로서, "닉이 좋아하는 것"은 사용자에 의해 생성된 맞춤 이름을 가지는 맞춤 재생 목록일 수 있다. "닉이 좋아하는 것"이라는 이름은 동적 변수로서 저장될 수 있고 재생 목록 변수 유형과 연관될 수 있다. 이러한 방식으로, 네트워킹된 마이크로폰 시스템은 사용자와 연관되는 맞춤 정보를 음성 입력에서 인지할 수 있고 식별할 수 있다.

동적 변수는 테이블 또는 다른 데이터 구조로 저장될 수 있고 다른 변수 유형과 동적으로 연관될 수 있다. 예를 들어, 각각의 동적 변수는 하나 이상의 변수 유형과 연관될 수 있다. 동적 변수는 사용자 계정과 연관되는 식별자와 저장될 수 있다. 예를 들어, "닉의 방"의 맞춤 구역 이름은 미디어 재생 시스템의 구역 식별자 및/또는 "닉의 방" 구역 내 PBD의 식별자와 연관될 수 있다. 다른 예시로서, "닉의 방"의 맞춤 구역 이름은 구역 식별자 태그와 저장 및/또는 "닉의 방" 구역의 PBD의 식별자는 "닉의 방" 구역으로 태그와 저장될 수 있다. 동적 변수는 사용자에 의해 추가 또는 제거되거나 사용자의 계정과 연관되는 새로운 맞춤 이름을 포함하도록 계속적으로, 주기적으로 또는 비주기적으로 갱신될 수 있다. 맞춤 이름은 데이터베이스에 이미 존재하거나 존재하지 않을 수 있는 사용자에 의해 제공되는 임의의 이름일 수 있다.

일부 예시에서, 각각의 동적 변수는 미디어 재생 시스템 명령에서 동적 변수를 식별하는 데에 사용될 수 있는 식별자와 연관되거나 저장될 수 있다. 예를 들어, "닉의 방" 구역 이름은 미디어 재생 시스템에 특정된 구역 식별자와 저장될 수 있고 명령이 "닉의 방" 내 재생 장치 상에서 수행될 액션을 요청하는 경우 "닉의 방"에 대한 구역 식별자가 미디어 재생 시스템 명령으로 "닉의 방"에 더하여 또는 그 대신에 제공될 수 있다.

블록 1214에서, 사용자는 NMD에 의해 수신될 수 있는 명령 또는 요청을 말함으로써 음성 입력을 제공할 수 있다. 네트워킹된 마이크로폰 시스템은 말로부터의 음성 입력을 텍스트로 변환하고 단어를 파싱하여 음성 입력의 구문(syntax)을 결정할 수 있다. 말해진 명령은 음악 재생 제어의 영역 또는 도메인에 있는 것으로 네트워킹된 마이크로폰 시스템이 인식할 수 있는 특정 구문을 가질 수 있다. 예를 들어, 사용자는 "주방과 닉의 방에서 비틀스(The Beatles)를 재생하라"고 말할 수 있다. 네트워킹된 마이크로폰 시스템은 단어 "재생"을 음악 재생과 연관되는 의도로서 직접 또는 의도에 대응하는 명령으로서 인식할 수 있고 블록 1216에서 음악 재생 제어의 영역 또는 도메인에서와 같이 말해진 명령을 식별할 수 있다.

다른 예시에서, 하나 이상의 미디어 변수 인스턴스 및/또는 하나 이상의 구역 변수 인스턴스의 존재 또는 포함은 명령 단어 "재생"이 "재생" 의도에 대응함을 가리킬 수 있다. 네트워킹된 마이크로폰 시스템은 음악 메타데이터를 포함할 수 있는 음악 카탈로그를 탐색하고 예컨대 한 아티스트 이름이 "비틀스"라고 결정함으로써 "비틀스"가 미디어 변수 인스턴스에 대응한다고 결정할 수 있다. 네트워킹된 마이크로폰 시스템은 보통의 구역 이름 및/또는 구역 변수 유형과 연관되는 동적 변수에 기초하여 "주방" 및/또는 "닉의 방"이 구역 이름에 대응한다고 결정할 수 있다. 미디어 변수 "비틀스" 및/또는 "닉의 방"과 명령 단어 "재생"의 조합은 네트워킹된 마이크로폰 시스템이 음성 입력이 요청된 음악을 재생하는 음악 제어 의도에 대응한다고 결정하는 것을 가능하게 할 수 있다.

말해진 명령이 음악 재생 제어의 영역 또는 도메인에 있는 것으로 식별되기 때문에, 네트워킹된 마이크로폰 시스템은 알려진 아티스트인 "비틀스"에 관련된 음악 콘텐트에 대한 탐색 결과에 우선 순위를 두고 임의의 알려진 아티스트와 연관되지 않을 수 있는 동음이의어 "비틀스"에 관련된 음악 콘텐트에 대한 탐색 결과에 우선 순위를 두지 않거나 배제할 수 있다. 즉, 음성 입력이 음악 도메인에 있음을 식별하는 것에 대한 응답으로, 음성 텍스트 변환에 사용되는 단어 또는 어휘의 집합이 음악 도메인에 특정되도록 변화될 수 있고, 이는 보통 사전에서 발견되지 않는 및/또는 사전에 있을 수 있는 단어 또는 말해지는 언어와 다른 언어의 단어를 포함할 수 있다.

예를 들어, 음성 텍스트 인식에 사용되는 단어 또는 어휘의 집합은 음성 입력이 음악 도메인에 있다고 결정하는 것에 응답하여 미디어 항목의 메타데이터 정보(예컨대, 아티스트 이름, 트랙 이름, 앨범 이름, 노래 이름)를 포함하도록 갱신될 수 있다. 일부 태양에서, 음성 입력은, 예컨대 맞춤 이름(예컨대, 구역, 재생 목록), 미디어 변수 및/또는 아티스트, 앨범 및/또는 트랙의 이름을 위한 문자 및/또는 부호의 받아쓰기(dictation)를 포함할 수 있다. 다른 예시로서, 음성 텍스트 변환으로부터의 결과로 얻어지는 텍스트에서의 단어는 음악 제어 명령을 처리하기 전에 미디어 특정 단어를 사용하도록 변화될 수 있다. 미디어 변수 인스턴스를 위한 음성 텍스트 변환은 네트워킹된 마이크로폰 시스템에 의해 사용되는 표준 단어에 더하여 또는 그 대신에 음악 메타데이터, 미디어 카탈로그 및/또는 맞춤 또는 로컬 미디어 식별자(예컨대, 재생 목록 이름, 트랙 이름, 앨범 이름, 아티스트 이름 등)에서 발견되는 단어를 사용할 수 있다. 유사하게, 구역 변수에 대한 음성 텍스트 변환은 맞춤 구역 이름을 사용할 수 있다.

블록 1218에서, 음악 제어 명령을 포함하는 음성 입력이 처리될 수 있다. 네트워킹된 마이크로폰 시스템은 사용자의 의도(예컨대, 재생, 일시 정지, 큐에 추가, 그룹핑, 다른 수송 제어, 제어 장치(300)를 통하여 이용 가능한 제어)와 연관될 수 있는 다양한 미리 정의된 구문을 가질 수 있다. 각각의 의도는 의도와 같거나 유사할 수 있거나 그렇지 않을 수 있는 하나 이상의 미디어 재생 시스템 명령에 대응할 수 있다. 예를 들어, 음악 재생을 제1 구역에서 제2 구역으로 이동하려는 의도는 현재 재생 미디어 항목 및/또는 재생 큐를 제1 구역에서 제2 구역으로 이동하기 위한 미디어 재생 시스템 명령에 대응할 수 있다. 다른 예시에서, 음악을 이동하려는 의도는 제1 구역의 재생 큐를 제2 구역의 재생 큐로 복사 및/또는 제1 구역의 상태 변수를 제2 구역의 상태 변수로 복사하기 위한 미디어 재생 시스템을 위한 재생 큐 복사 명령에 대응할 수 있다.

또 다른 예시로서, 음악을 이동하려는 의도는 2개의 미디어 재생 시스템 명령에 대응할 수 있다. 2개의 명령은 제2 구역을 제1 구역과 그룹핑하고 이후 제1 구역을 그룹으로부터 제거하여 사실상 제1 구역의 상태를 제2 구역으로 옮기는 것일 수 있다.

미디어 재생 시스템 명령은 의도가 미디어 재생 시스템 명령에 대응한다고 결정하는 것에 응답하여 호출되는 API(application program interface)를 포함할 수 있다. 네트워킹된 마이크로폰 시스템 및/또는 미디어 재생 시스템은 사용자의 의도와 미디어 재생 시스템 명령 사이의 정의된 맵핑 또는 대응(correspondence)을 가질 수 있다.

일부 예시에서, 미디어 재생 시스템 명령은 클라우드 네트워크(502)에서 컴퓨팅 장치(예컨대, 컴퓨팅 장치(504), 컴퓨팅 장치(506), 컴퓨팅 장치(508))에 저장되는 데이터 상에서 실행될 수 있다. 예를 들어, 다른 재생 목록 또는 재생 큐에 미디어 항목(예컨대, 트랙, 앨범, 재생 목록)을 추가하려는 의도는 클라우드 네트워크(502)에 저장된 재생 목록 또는 재생 큐에 추가될 수 있다. PBD(532, 534, 536, 538) 상에 저장된 재생 큐는 클라우드 네트워크(502)에 저장된 재생 목록 또는 재생 큐의 변화에 응답하여 재생 큐의 일부가 클라우드 네트워크(502) 내 재생 목록 또는 재생 큐의 일부 또는 전체에 매칭하도록 갱신될 수 있다.

어떠한 단어, 구문 및/또는 어구는 같은 의도에 연관될 수 있다. 예를 들어, 음성 입력에 명령 단어 "재생", "청취" 또는 "듣기"를 포함하는 것은 미디어 재생 시스템이 미디어 콘텐트를 재생하는 사용자의 의도에 대응할 수 있다. 각각의 의도는 명령 또는 의도에 의해 특정되는 액션을 수행할 상이한 유형의 미리 정의된 변수 또는 슬롯(slot)을 가질 수 있다. 변수 또는 슬롯은 다양한 어구의 미리 정의된 위치 또는 자리에 있을 수 있다. 예를 들어, "재생" 명령 구문은 사용자가 재생하고 싶어하는 미디어를 위한 미디어 변수를 가질 수 있고, 사용자가 연관된 재생 장치가 미디어 콘텐트를 재생하고 싶어하는 위치 또는 구역에 대한 위치 또는 구역 변수를 더 가질 수 있다. "주방에서 비틀스 재생하라"는 말해진 명령의 예시에서, 미디어 또는 음악 변수의 인스턴스는 "비틀스"일 수 있고 구역 변수의 인스턴스는 "주방"일 수 있다. 네트워킹된 마이크로폰 시스템 및/또는 미디어 재생 시스템은 미디어 변수 인스턴스 및/또는 구역 변수 인스턴스에 대응하는 관련 객체를 식별하는 데에 있어서 구역 변수와 별도로 및/또는 상이하게 미디어 변수를 처리할 수 있다.

"재생" 의도와 연관될 수 있는 구문 또는 어구의 다른 예시는 "[구역 변수]에서 [미디어 변수]를 들려달라"는 구문일 수 있다. 이러한 구문의 일 예시는 "에밀리의 방에서 폴 사이먼을 들려달라"일 수 있으며, 여기서 "들려달라"가 "재생" 의도와 연관될 수 있고, "폴 사이먼"이 미디어 변수의 인스턴스일 수 있으며, "에밀리의 방"이 구역 변수의 인스턴스일 수 있다. 네트워킹된 마이크로폰 시스템은 음성 입력을 파싱하고 네트워킹된 마이크로폰 시스템에 저장된 어떠한 구문이 음성 입력과 매치하는지 결정하여 음성 입력의 의도록 식별할 수 있다. 구문은 네트워킹된 마이크로폰 시스템 내 장치 중 임의의 것에 저장될 수 있다.

"재생" 의도 또는 명령을 위한 구문 또는 어구의 또 다른 예시는 "나는 [구역 변수]에서 [미디어 변수]를 듣기 원한다"는 구문일 수 있다. 단어 "듣기" 또는 절 "나는 듣기 원한다"는 "재생" 의도와 연관될 수 있다. "재생" 의도를 위한 다른 구문이 가능하다.

다른 예시적인 명령 또는 의도는 미디어 재생 시스템에(예컨대, PBD, 컴퓨팅 장치(506) 및/또는 CR(522)에) 저장될 수 있는 큐에 미디어 콘텐트를 추가하는 것에 관련될 수 있다. 예시적인 큐에 추가 구문은 "[구역 변수]에서 큐에 [미디어 변수]를 추가하라"는 것일 수 있다. 여기에 설명되는 다른 태양에 유사하게, 구역 변수는 선택적일 수 있고, 시스템은 다양한 기법 또는 방법에 기초하여(예컨대, 디폴트 구역을 사용, 가장 마지막에 사용된 구역을 사용, 사용자 존재 정보에 기초하여, 활발하게 미디어를 재생한 구역을 사용) 명령을 적용할 구역을 결정할 수 있다. 미디어 변수에 대응하는 선택된 미디어 콘텐트는 구역 내 큐에 추가될 수 있다.

또 다른 예시적인 명령 또는 의도는 다음 재생 명령일 수 있고, 이는 선택된 미디어 콘텐트가 구역에서 다음에 재생될 큐의 제일 위에 추가되도록 할 수 있다. 이러한 명령에 대한 예시적인 구문은 "다음에 [미디어 변수]를 재생하라"는 것일 수 있다. 여기에 설명되는 다른 태양에 유사하게, 구역 변수는 선택적일 수 있다.

명령 또는 의도의 다른 예시는 이동 또는 수송 명령일 수 있고, 이는 하나의 구역에서 다른 구역으로 현재 재생하고 있는 음악 및/또는 구역의 재생 큐를 이동 또는 수송할 수 있다. 예를 들어, 사용자는 "음악을 [구역 변수]로 이동하라"는 음성 입력을 말할 수 있고, 명령 단어 "이동" 또는 "수송"은 재생 상태를 다른 구역으로 이동하려는 의도에 대응할 수 있다.

여기에 설명되는 명령 및 의도는 예시이며 다른 의도 또는 명령이 가능하다. 예를 들어, 여기에 설명된 미디어 재생 시스템을 제어하기 위한 제어 장치(300)를 통하여 이용 가능한 제어 각각은 시스템을 제어하는 데에 사용되도록 이용 가능한 대응하는 의도를 가질 수 있다. 예를 들어, 제어 명령의 이름이 의도에 대응할 수 있다. 제어 명령이 하나 이상의 미디어 항목을 수반하는 경우, 명령을 위한 구문은 하나 이상의 미디어 변수를 포함할 수 있다. 제어 명령이 하나 이상의 구역을 수반하는 경우, 명령을 위한 구문은 하나 이상의 구역 변수를 포함할 수 있다. 다른 의도로 사용될 다른 변수도 가능하다.

미디어 재생 시스템을 제어하기 위하여 제어 장치(300)를 통하여 이용 가능한 제어의 예시는 수송 제어 명령을 포함할 수 있다. 이러한 명령 또는 의도는 수송 명령(예컨대, 정지, 일시 정지, 스킵, 되감기, 빨리 감기, 뒤로, 음량 등) 또는 현재 재생되는 미디어 항목을 다른 재생 큐 또는 재생 목록에 저장 또는 추가하는 것에 관련되는 명령과 같은 현재 재생되고 있는 미디어 항목에 관련될 수 있다. 현재 재생 중인 미디어 항목에 취해질 액션 또는 의도를 위한 구문은 더 단순할 수 있고 수송 제어의 이름에 대응할 수 있다. 예를 들어, 음악 재생을 일시 정지하고자 하는 의도를 위한 음성 입력은 음성 입력 "일시 정지"일 수 있다.

상이한 유형의 변수가 상이한 명령 구문에서 사용될 수 있다. 미디어 변수에 관하여, 미디어 변수는 사용자가 듣거나 재생하기를 원하는 미디어 콘텐트를 음성 입력을 통하여 사용자가 특정하고자 하는 구문 내 슬롯 또는 변수일 수 있다. 미디어 변수는 앨범 이름, 아티스트 이름, 노래 이름, 재생 목록 이름, 맞춤 재생 목록 이름, 장르(예컨대, 팝, 클래식, 컨트리, 락, 알앤비 등), 무드(예컨대, 로맨틱, 운동, 생산적), 음악 빠르기(예컨대, 상박, 느린), 라디오 방송 이름, 작곡가 이름, 음악 시대(예컨대, 바로크, 로맨틱, 클래식, 20세기), 시기(예컨대, 80년대, 90년대), 재생 목록 생성자의 이름, 랭킹(예컨대, 베스트, 탑 40) 및/또는 다른 음악 식별 특징을 포함하나 이에 제한되지 않는 다양한 음악 관련 특징 또는 특성(예컨대, 미디어 변수의 유형)일 수 있다. 음악 변수는 사용자 계정의 사용자에 의해 생성된 맞춤 재생 목록 이름 또는 다른 맞춤 이름(예컨대, 맞춤 노래 이름, 맞춤 앨범 이름, 맞춤 아티스트 이름)일 수 있는 맞춤 이름을 가질 수 있다.

구역 변수에 관하여, 구역 변수는 사용자가 요청된 액션을 수행할 장소 또는 구역 또는 의도(예컨대, 요청된 음악을 재생)를 음성 입력을 통해 특정하고자 하는 구문 내 슬롯 또는 변수일 수 있다. 사용자는 음성 입력에 구역 인스턴스를 포함하거나 포함하지 않을 수 있다. 사용자가 예컨대 "어떤 비틀스를 재생하라"고 단순히 말함으로써 구역을 특정하지 않은 경우, 네트워킹된 마이크로폰 시스템 및/또는 미디어 재생 시스템은 디폴트 구역 및/또는 다른 입력(예컨대, 사용자 존재 정보, 컨텍스트 정보, 위치 정보)에 기초하여 다른 구역에서 "어떤 비틀스를 재생"하도록 결정할 수 있다. 구역 변수는 사용자에 의해 제공되는 맞춤 구역 이름을 위한 동적 변수를 포함할 수 있다. 다른 예시로서, 맞춤 구역 이름은 예컨대 "닉의 방" 또는 "3층 회의실"일 수 있다.

일부 예시에서, 구문은 음성 입력을 실행하기 위해 미디어 서비스 또는 애플리케이션 또는 다른 미디어 관련 서비스, 제품 또는 애플리케이션(예컨대, 미디어 재생 시스템)을 위한 미디어 서비스 변수를 포함할 수 있다. 시스템은 모든 미디어 관련 콘텐트에 대해 디폴트 재생 시스템 또는 구역을 식별하거나 상이한 재생 시스템 또는 구역을 상이한 서비스와 연관시킬 수 있다. 예를 들어, 사용자는 "침실에서 조쉬 그로반(Josh Groban)을 스포티파이 상에서 재생하라"고 말할 수 있다. 시스템(예컨대, 네트워킹된 마이크로폰 시스템 및/또는 미디어 재생 시스템)은 "스포티파이"를 미디어 서비스 변수의 인스턴스로서, "조쉬 그로반"을 음악 변수의 인스턴스로서, "침실"을 구역 변수의 인스턴스로서 인식할 수 있다. 시스템은 미디어 서비스 스포티파이®의 미디어 카탈로그 내에서 여기에서 논의된 바와 같이 "조쉬 그로반"에 연관되는 미디어 콘텐트를 탐색할 수 있다.

스칼라 변수가 같은 변수의 하나보다 많은 인스턴스를 포함하는 벡터 또는 집합으로 만들어질 수 있다는 점에서 변수의 일부 유형은 스칼라일 수 있다. 스칼라 변수의 벡터는 사용자에 의해 말해지는 경우 "[제1 스칼라 변수] 및 [제2 스칼라 변수]", "[제1 스칼라 변수], [제2 스칼라 변수], 및 [제3 스칼라 변수]" 또는 "[제1 스칼라 변수][제2 스칼라 변수][제3 스칼라 변수]"의 구문 또는 포맷을 가질 수 있다. 예를 들어, 구역 변수는 스칼라 변수일 수 있고, 사용자는 미디어 콘텐트가 하나보다 많은 "주방, 거실 및 식당"에서 재생되는 것으로 특정할 수 있다. 일부 태양에서, 스칼라 변수의 미리 정의된 집합 또는 벡터에 이름이 주어질 수 있다. 예를 들어, "아래층"으로 이름지어진 미리 정의된 벡터는 집 환경에서 아래층인 구역 모두와 연관될 수 있다. 도 1에 도시된 예시적인 환경에서, "아래층"은 "거실", "식당", "사무실", "주침실", "침실" 및 "욕실" 구역일 수 있다. 제어 장치(300)는 구역의 목록을 보여줄 수 있고, 사용자는 구역의 목록으로부터 "아래층" 이름 또는 라벨과 연관시킬 구역을 선택할 수 있다.

일부 예시에서, 미디어 변수는 스칼라 변수일 수 있다. 같은 유형의 음악 변수 중 하나보다 많은 것이 단일의 명령 어구에서 말해질 수 있으며, 각각의 미디어 변수 인스턴스는 다른 미디어 변수 인스턴스와 독립적으로 또는 다른 미디어 변수 인스턴스와 조합하여 대응하는 미디어 항목에 대해 처리될 수 있다. 예를 들어, 음성 입력은 "비틀스와 비치 보이즈(the Beach Boys)로부터의 음악을 듣자"일 수 있고, 이는 "[제1 미디어 변수] 및 [제2 미디어 변수]로부터의 음악을 듣자"는 구문에 대응할 수 있다. 일 태양에서, 제1 미디어 변수 인스턴스 "비틀스"는 "비치 보이즈"와 독립적으로 처리될 수 있다. "비틀스"를 "비치 보이즈"와 독립적으로 처리함에 있어서, 블록 1218에 관하여 더 상세히 설명될 바와 같이, "비틀스"는 비틀스에 관련되는 임의의 미디어 항목에 대해 처리될 수 있고, "비치 보이즈"는 "비치 보이즈"에 관련되는 임의의 미디어 항목에 대해 처리될 수 있다. 다른 태양에서, 제1 미디어 변수 인스턴스 "비틀스"와 제2 미디어 변수 인스턴스 "비치 보이즈"는 조합으로서 처리될 수 있으며, 시스템은 "비틀스"와 "비치 보이즈" 둘 다와 관련되는 미디어 항목(예컨대, 비틀스와 비치 보이즈가 연주 및/또는 아티스트로서 리스팅된 노래)에 대하여 처리할 수 있다.

네트워킹된 마이크로폰 시스템 및/또는 미디어 재생 시스템은 구역 변수 인스턴스의 집합 또는 벡터를 그룹핑 명령과 연관시킬 수 있다. 예를 들어, 네트워킹된 마이크로폰 시스템 및/또는 미디어 재생 시스템은 공간 변수에 대한 스칼라 변수 구문을 인식할 수 있고 이러한 구문이 구역 변수의 특정 인스턴스를 그룹핑하는 미디어 재생 시스템 명령에 대응한다고 결정할 수 있다. 예시로서, 사용자는 미디어 콘텐트를 "거실, 주방 및 닉의 방"에서 재생하도록 특정할 수 있다. 시스템(500)(예컨대, 네트워킹된 마이크로폰 시스템 및/또는 미디어 재생 시스템)은 어구에서 "닉의 방"이 말해진 위치 또는 배치에 기초하여 "닉의 방"을 구역 변수로서 인식할 수 있고 "닉의 방"에 대응하는 맞춤 구역 이름을 위한 동적 변수를 저장한 표를 탐색할 수 있다. 탐색은 컴퓨팅 장치(504) 및/또는 컴퓨팅 장치(506)에 의해 수행될 수 있고, 맞춤 구역 이름 및/또는 식별자는 표의 탐색에 기초하여 컴퓨팅 장치(504)와 컴퓨팅 장치(506) 사이에서 송신될 수 있다. 송신은 메타데이터 교환 채널 및/또는 컴퓨팅 장치(504)와 컴퓨팅 장치(506) 사이의 임의의 다른 통신 경로를 통할 수 있다.

미디어 재생 시스템에 의해 그룹핑 명령으로 인식될 수 있는 구문의 다른 예시는 "[구역 변수]를 추가하라" 또는 [구역 변수]에서 역시 재생하라"일 수 있다. 예를 들어, 네트워킹된 마이크로폰 시스템은 단어 "추가" 또는 어구 "역시 재생"을 그룹핑 의도 또는 명령에 대응하는 것으로서 인식할 수 있다. 시스템은 구문의 명령 단어 자리에서 명령 단어 "추가" 또는 "역시 재생"을 포함하는 음성 입력에만 기초하여 또는 명령 단어를 포함하는 음성 입력과 구역 변수 인스턴스에 기초하여 의도를 결정할 수 있다. 이러한 유형의 그룹핑은 음악이 이미 재생되고 있는 구역의 컨텍스트와 같은 컨텍스트에 기초할 수 있다. 미디어 재생 시스템은 이러한 정보를 임의의 통신 경로 및/또는 메타데이터 교환 채널을 통하여 네트워킹된 마이크로폰 시스템으로 전송할 수 있다. 일부 태양에서, 미디어 재생 시스템은 정보를 수신할 수 있고, 현재 재생되고 있는 음악을 특정된 구역 내 하나 이상의 구역에서도 재생 및/또는 기존 그룹에서 특정된 구역을 포함하는 것을 이해할 수 있다.

일부 예시에서, 음악 변수는 스칼라 변수일 수 있다. 예를 들어, 사용자는 "90년대로부터 백스트리트 보이즈(Backstreet Boys) 음악을 재생하라"고 특정할 수 있다. "백스트리트 보이즈"는 아티스트의 이름일 수 있고 "90년대"는 음악을 위한 기간일 수 있다. 다른 예시는 "마돈나(Madonna)에 의한 아메리칸 파이(American Pie)를 재생하라"일 수 있으며, "아메리칸 파이"는 트랙 이름일 수 있고 "마돈나"는 아티스트의 이름일 수 있다.

음악 변수는 특정 음악 변수에 관련되는 정보를 위한 음악 데이터베이스를 탐색함으로써 처리될 수 있다. 데이터베이스는 컴퓨팅 장치(504), 컴퓨팅 장치(506) 및/또는 컴퓨팅 장치(508)에서의 음악의 데이터베이스일 수 있다. 예를 들어, 사용자는 "아메리칸 파이를 재생하라"고 말할 수 있다. 네트워킹된 마이크로폰 시스템은 "아메리칸 파이"에 관련되는 임의의 음악 정보를 위하여 컴퓨팅 장치(504)를 탐색할 수 있다. 컴퓨팅 장치(504)는, 예컨대 음악 변수와 같은 이름의 앨범을 가지는 아티스트, 음악 변수와 매치하거나 유사한 앨범 이름, 음악 변수 이름의 트랙, 음악 변수의 라디오 방송, 음악 변수 이름의 재생 목록, 음악 변수와 관련된 콘텐트의 스트리밍 서비스 제공자 식별자 및/또는 처리되지 않은 음성 텍스트 변환 결과의 결과를 반환할 수 있다. "아메리칸 파이"의 예시를 사용하면, 탐색 결과는 아티스트 "돈 맥클린(Don McLean)", "아메리칸 파이" 이름의 앨범, "아메리칸 파이" 이름의 트랙, "아메리칸 파이" 이름의 라디오 방속국(예컨대, "아메리칸 파이"를 위한 판도라 라디오 방송 식별자), 트랙 "아메리칸 파이"를 위한 음악 서비스(예컨대, 스포티파이® 또는 판도라®와 같은 스트리밍 음악 서비스) 트랙 식별자(예컨대, "아메리칸 파이"를 위한 스포티파이® 트랙 식별자, URI 및/또는 URL) 및/또는 "아메리칸 파이"의 처리되지 않은 음성 텍스트 변환 결과를 반환할 수 있다. 네트워킹된 마이크로폰 시스템은 데이터베이스 탐색으로부터의 결과의 집합을 미디어 재생 시스템에 제공할 수 있다. 결과는 메타데이터 교환 채널 및/또는 네트워킹된 마이크로폰 시스템과 미디어 재생 시스템 사이에 수립된 임의의 다른 통신 경로를 통하여 제공될 수 있다.

일부 예시에서, 말해진 명령은 "아메리칸 파이 앨범을 재생하라"와 같이 재생할 구체적인 미디어 콘텐트(예컨대, 노래, 아티스트) 또는 미디어 콘텐트의 집합(예컨대, 앨범)을 특정할 수 있고, 그러한 경우 탐색 결과는 "아메리칸 파이" 이름의 앨범과 "아메리칸 파이" 이름의 앨범을 위한 음악 서비스의 식별자를 반환할 수 있다.

다른 예시로서, 사용자는 음악 변수가 "푸푸"인 명령 "푸푸를 재생하라"를 말할 수 있다. "푸푸"는 어떠한 음악 특징 또는 특성에도 대응하지 않을 수 있고, 그 결과 데이터베이스는 음악 변수 "푸푸"에 대응하는 임의의 아티스트, 앨범 및 또는 트랙을 가지지 않을 수 있다. 이러한 예시에서, 반환되는 결과는 "푸푸"의 음성 텍스트 변환의 결과만일 수 있다. 음성 텍스트 변환 또는 처리되지 않은 텍스트는 맞춤 이름(예컨대, 맞춤 앨범 이름, 맞춤 노래 이름, 맞춤 아티스트 이름)을 탐색하는 데에 사용될 수 있다. 처리되지 않은 텍스트는 장치(예컨대, CR(522)) 상에 또는 네트워크 가능 저장 장치(예컨대, 네트워크 부착 스토리지(NAS) 장치) 상에 저장된 콘텐트를 탐색하는 데에 사용될 수 있다. 네트워크 가능 저장 장치는 통신 경로(542, 544, 546)를 통하여 미디어 재생 시스템 및/또는 네트워킹된 마이크로폰 시스템과 통신할 수 있다. 일부 경우에, 맞춤 콘텐트가 사용자에 의해 컴퓨팅 장치(508) 상에 저장될 수 있다. 네트워크 가능 저장 장치 내 콘텐트는 시스템(500) 내 임의의 장치 상에서 인덱싱될 수 있고, 처리되지 않은 텍스트에 기초하여 탐색 가능할 수 있다.

또 다른 예시로서, 사용자는 명령 "비틀스를 재생하라"를 말할 수 있다. 음악 컨텍스트 이외에서 "비틀스"는 "딱정벌레(beetles)"에 대응하는 것으로 해석될 수 있는데, 이 단어들이 동음이의어이기 때문이다. 말해진 명령이 블록 716에서 음악 제어의 영역에 있는 것으로 식별될 수 있으므로, 네트워킹된 마이크로폰 시스템은 말해진 명령 "비틀스를 재생하라"에서 "비틀스"가 아티스트나 "비틀스" 이름의 다른 음악 콘텐트에 대응할 것 같다고 인식할 수 있다. 데이터베이스의 탐색은 아티스트 비틀스, 다른 스트리밍 서비스를 위한 비틀스를 위한 아티스트 식별자, 아티스트 비틀스에 기초하여 추천되는 재생 목록을 위한 식별자 및/또는 발언 "비틀스"의 음성 텍스트 변환의 처리되지 않은 결과의 결과를 산출할 수 있다.

다른 예시로서, 사용자에 의해 말해진 음성 입력이 "재즈를 재생하라"일 수 있다. 시스템(500)은 장르의 목록을 저장하는 데이터베이스의 탐색에 기초하여 "재즈"를 장르로서 식별할 수 있다. 시스템은 재즈의 장르에 대응하는 관련 미디어 콘텐트를 탐색할 수 있다. 탐색 결과는 예컨대 다양한 음악 서비스의 데이터베이스에서 장르 "재즈"를 위한 식별자 및/또는 장르 "재즈"에 대응하는 재생 목록 이름 또는 재생 목록의 식별자일 수 있다.

일부 예시에서, 음성 입력은 차례차례로 말해지는 두 개의 명령 또는 어구를 포함할 수 있다. 네트워킹된 마이크로폰 시스템은 차례차례로 말해지는 두 개의 명령이 관련될 수 있다고 인식할 수 있다. 제1 명령은 제1 변수 유형을 포함할 수 있고, 제2 명령은 제1 변수 유형의 부분집합을 포함할 수 있다. 예를 들어, 사용자는 "어떤 클래식 음악을 재생하라"에 뒤이어 "로맨틱한 무언가를 재생하라"는 음성 입력을 제공할 수 있다. 두 개의 명령 사이에 끊김이 있을 수 있다. 시스템(500)은 음악 변수의 클래식 인스턴스와 연관되는 클래식 음악의 시대를 가질 수 있다. 시스템(500)은 "로맨틱"이 클래식 음악의 로맨틱 시대를 가리키는 것으로 인식할 수 있고, 명령을 로맨틱한 무드의 무언가를 재생하는 것이 아니라 로맨틱 시대로부터의 무언가를 재생하기 위한 명령으로서 처리할 수 있다. 다른 예시로서, 사용자는 "어떤 엔싱크(*NSync)를 재생하라"에 뒤이어 짧은 끊김 이후 "No Strings Attached를 재생하라"를 말할 수 있다. 시스템(500)은 "No Strings Attached"를 아티스트 엔싱크에 의한 앨범이라고 인식할 수 있고, 다른 아티스트에 의한 "No Strings Attached" 이름의 앨범이 아닌 이 앨범을 재생할 수 있다.

일부 예시에서, 명령은 미디어 재생 시스템의 이름을 위한 시스템 이름 변수를 포함할 수 있다. 미디어 재생 시스템은 미디어 재생 시스템 제조자(예컨대, 소노스®)의 이름, 맞춤 이름 및/또는 다른 이름과 같은 이름과 연관될 수 있다. 음성 입력은 명령 또는 의도를 실행할 사용자 계정과 연관되는 특정 시스템을 식별하도록 시스템의 이름을 포함할 수 있다. 일부 경우에, 말해진 명령에서 미디어 재생 시스템 이름 변수의 존재는 음성 입력을 음악 제어의 영역에 있는 것으로 자동으로 식별하도록 블록 1216에서 사용될 수 있다.

블록 1220에서, 미디어 재생 시스템은 파싱된 명령 및 변수 각각을 실행함으로써 말해진 음악 제어 명령을 실행할 수 있다. 미디어 재생 시스템은 네트워킹된 마이크로폰 시스템으로부터의 탐색 결과 및/또는 하나 이상의 미디어 재생 시스템 명령을 수신할 수 있다. 미디어 재생 시스템 명령 및/또는 미디어 정보(예컨대, 탐색 결과)는 네트워킹된 마이크로폰 시스템으로부터 하나 이상의 메시지로 미디어 재생 시스템에 의해 수신될 수 있다. 탐색 결과에 기초하여, 미디어 재생 시스템(예컨대, 컴퓨팅 장치(506), 제어 장치(522) 및/또는 재생 장치(532, 534, 536, 538))은 말해진 명령에 응답하여 어떠한 미디어 콘텐트를 재생 또는 재생을 위해 큐할지 결정할 수 있다. 처리되지 않은 텍스트 음성 변환에 더하여 탐색 결과가 수신되는 경우 말해진 명령에 응답하여 무엇을 재생할지 결정하는 데에 다양한 기술이 사용될 수 있다.

일부 태양에서, 미디어 재생 시스템은 다양한 데이터 포인트 및/또는 선호도에 기초하여 상이한 결과에 가중치를 줄 수 있다. 예를 들어, 상이한 결과에 가중치를 주는 것은 인기, 사용자 재생 이력, 사용자 계정에 연관되는 음악 서비스, 미디어 재생 시스템에 이용 가능한 음악 서비스, 미디어 재생 시스템과 연관되는 저장 장치 상에 저장된 음악 및/또는 사용자 선호도 중 임의의 것에 기초할 수 있다. 예시로서, 상이한 아티스트에 의한 노래가 같은 이름을 가질 수 있다. 탐색 결과가 상이한 아티스트에 의한 같은 이름을 가진 노래를 반환하는 경우, 더 인기있는 노래가 더 가중치가 주어짐 및/또는 선택될 수 있다. 노래의 인기는 사용자 재생 횟수, 라디오 재생 횟수, 음악 차트 랭킹, 판매 부수 및/또는 다른 이용 가능한 데이터와 같은 다양한 소스에 기초하여 결정될 수 있다. 다른 예시로서, 사용자에 의해 최근 재생된 미디어 항목에 더 가중치가 주어질 수 있다.

일부 예시에서, 사용자는 미디어 변수에 대하여 선택할 미디어 항목을 위한 선호도 순서를 표시할 수 있다. 예를 들어, 사용자는 맞춤 재생 목록이 제일 선호되고, 라디오 방송, 큐레이티드(curated) 재생 목록, 트랙, 앨범, 아티스트가 뒤를 잇는다고 표시할 수 있다. 시스템은 사용자의 선호도에 기초하여 높은 우선 순위의 미디어 변수 유형에 더 가중치를 줄 수 있다. 사용자의 선호도는 사용자 프로파일에 저장 및/또는 사용자의 계정과 연관될 수 있어, 사용자의 선호도가 네트워킹된 마이크로폰 시스템 및/또는 미디어 재생 시스템으로 송신될 수 있다. 일부 미디어 변수 유형에는 동일한 우선 순위 또는 가중치가 주어질 수 있다.

일부 예시에서, 사용자가 사용자 선호도를 제공하지 않은 경우 디폴트 우선 순위 매김이 사용될 수 있다. 시스템은 상이한 미디어 변수 유형에 대하여 우선 순위의 임의의 조합을 사용할 수 있다. 예를 들어, 시스템은 처리되지 않은 텍스트에 대응하는 결과 앞에 앨범에 뒤이어 아티스트와 트랙에 대응하는 미디어 콘텐트에 우선 순위를 매길 수 있다.

다른 예시로서, 미디어 변수 인스턴스는 아티스트의 이름일 수 있고, 아티스트는 재생 목록 및 라디오 방송에 대응할 수 있다. 미디어 변수 인스턴스에 대하여, 라디오 방송의 재생은 재생 목록보다 선호될 수 있다.

또 다른 예시로서, 미디어 재생 시스템은 사용자 및/또는 미디어 재생 시스템이 액세스를 가지지 않는 음악 서비스와 연관되는 결과를 걸러낼 수 있다. 액세스 할 수 없는 결과를 걸러낸 후, 미디어 재생 시스템은 여기에 설명되는 다양한 방법 또는 기술에 기초하여 재생할 미디어 콘텐트를 선택할 수 있다.

여기에 설명되는 선택 방법은 예시적이며, "재생" 명령에 응답하여 재생할 미디어 항목을 선택하기 위한 방법 또는 기술의 다른 예시가 사용될 수 있다.

"재생" 명령 또는 의도를 수신하는 것에 응답하여 재생할 콘텐트를 선택하는 것에 응답하여, 미디어 재생 시스템은 콘텐트를 위한 소스를 식별하도록 식별자 및/또는 탐색 결과로부터 제공되는 다른 식별 정보를 사용할 수 있다. 식별자는 대응하는 콘텐트가 네트워크 스토리지 위치 또는 URL(uniform resource locator) 및/또는 메타데이터(예컨대, 아티스트 이름, 앨범 이름, 트랙 번호, 라디오 방송 이름, 재생 목록 이름, 미디어 서비스 이름 등)와 같은 미디어 재생 시스템에 의해 검색될 수 있는 네트워크 주소 또는 링크일 수 있다.

일부 예시에서, 명령 또는 의도는 수송 명령(예컨대, 일시 정지, 일시 정지 후 재생, 스킵, 뒤로, 뒤로 감기, 빨리 감기)일 수 있다. 앞서 논의된 바와 같이, 시스템(500)은 명령 또는 의도에 대응하는 미디어 재생 시스템 명령을 결정할 수 있고 대응하는 미디어 재생 시스템 명령을 실행할 수 있다. 네트워킹된 마이크로폰 시스템은 의도(예컨대, 재생, 일시 정지 등)에 대응하는 명령을 식별하는 명령 정보 및 명령의 관련 객체(예컨대, 구역 이름, 구역 식별자, 그룹 식별자, 미디어 식별자 등과 같은 변수)를 포함하는 메시지를 미디어 재생 시스템에 송신함으로써 미디어 재생 시스템이 명령을 실행하도록 할 수 있다. 예를 들어, 수송 명령은 명령이 실행될 구역을 위한 구역 변수의 인스턴스(예컨대, 닉의 방, 주방 또는 구역을 위한 다른 식별자)를 포함할 수 있다.

음성 입력에 기초하여 PBD 상에 액션을 야기하는 것에 응답하여, 미디어 재생 시스템은 PBD에 의해 수행되는 액션에 관련한 상태 정보를 갱신 및/또는 저장할 수 있다. 예를 들어, PBD는 구역 또는 특정 재생 장치가 현재 특정 미디어 항목을 재생하고 있는 것 및/또는 특정 미디어 항목이 PBD 상에 저장되는 큐에 추가되었다는 것과 같은 구역의 상태를 나타내는 상태 변수를 갱신할 수 있다. 시스템(500) 내 다양한 장치로부터의 끊김 없는 재생 및/또는 제어를 가능하게 하기 위해 상태 변수는 시스템(500) 내 임의의 장치에 의해 액세스될 수 있다.

여기에서 미디어 콘텐트(예컨대, 음악 콘텐트, 비디오 콘텐트)에 관하여 방법 및 시스템이 설명되었으나, 여기에 설명되는 방법 및 시스템은 미디어 재생 시스템에 의해 재생될 수 있는 오디오와 연관될 수 있는 다양한 콘텐트에 적용될 수 있다. 예를 들어, 음악 카탈로그의 일부가 아닐 수 있는 미리 녹음된 소리가 음성 입력에 응답하여 재생될 수 있다. 일 예시는 음성 입력 "나이팅게일 소리가 어떠한가?"일 수 있다. 이러한 음성 입력에 대한 네트워킹된 마이크로폰 시스템의 응답은 식별자를 가지는 음악 콘텐트가 아닐 수 있고 대신 짧은 오디오 클립일 수 있다. 미디어 재생 시스템은 짧은 오디오 클립을 재생하는 것과 연관된 정보(예컨대, 스토리지 주소, 링크, URL, 파일) 및 짧은 오디오 클립을 재생하기 위한 미디어 재생 시스템 명령을 수신할 수 있다. 팟캐스트, 뉴스 클립, 알림 소리, 알람 등을 포함하는 다른 예시가 가능하다.

V. 사용자 식별에 기초하는 액션을 위한 예시적인 시스템, 기기 및 방법

여기에 설명되는 예시는 음성 명령을 수신하고 사용자 식별에 기초하여 (또는 적어도 음성 명령을 말하는 사용자에 기초하여) 미디어 재생 시스템이 실행할 적절한 액션을 결정하는 미디어 재생 시스템(또는 아마 하나 이상의 그 컴포넌트)을 포함한다. 일부 예시에서, 미디어 재생 시스템은 (미디어 재생 시스템 서버로서 구성되는) 컴퓨팅 장치(506)와 PBD(532, 534, 536 및 538) 중 하나 이상을 포함할 수 있다. 일부 실시예에서, 미디어 재생 시스템은 (네트워킹된 마이크로폰 시스템 서버로서 구성될 수 있는) 컴퓨팅 장치(504)와 NMD(512, 514 및 516) 중 하나 이상을 포함하는 네트워킹된 마이크로폰 시스템을 포함 또는 그와 통신할 수 있다.

일반적으로, 여기에서 설명되는 하나 이상의 기능은 네트워킹된 마이크로폰 시스템에 의해 개별적으로 또는 미디어 재생 시스템과 조합하여 수행될 수 있음이 이해되어야 한다. 또한 컴퓨팅 장치(506)에 의해 수행되는 하나 이상의 기능이 미디어 재생 시스템의 CR(522) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상에 의해 수행될 수 있음이 이해되어야 한다.

앞서 언급된 바와 같이, 음성 명령의 예시는 이전에 논의된 미디어 재생 시스템 제어 중 임의의 것을 제어하기 위한 명령을 포함한다. 예를 들어, 음성 명령은 미디어 재생 시스템의 하나 이상의 재생 장치를 통하여 미디어 콘텐트를 재생하기 위한 미디어 재생 시스템을 위한 명령일 수 있다. 다른 예시에서, 음성 명령은 처음 음성 명령과 연관되는 추가적인 음성 명령을 수신할 기간 또는 시간대를 트리거하기 위한 명령일 수 있다. 또 다른 예시로서, 음성 명령은 미디어 재생 시스템의 하나 이상의 미디어 재생 장치를 위한 재생 설정을 변경하기 위한 명령일 수 있다. 재생 설정은 다른 가능성 중에서도 예컨대 재생 음량, 재생 수송 제어, 음악 소스 선택 및 그룹핑을 포함할 수 있다.

미디어 콘텐트의 예시는 다른 것들 중에서도 토크 라디오, 책, 텔레비전으로부터의 오디오, 로컬 드라이브 상에 저장된 음악 또는 미디어 소스로부터의 음악을 포함한다. 미디어 소스의 예시는 다른 것들 중에서도 판도라® 라디오, 스포티파이®, 슬래커®, 라디오, 구글 플레이™, 및 아이튠즈 라디오를 포함한다.

사용자 식별의 예시는 등록된 사용자, 손님 사용자, 어린이 또는 무명 사용자로서 사용자를 식별하는 것을 포함한다.

예시적인 등록된 사용자는 다른 가능성 중에서도 사용자 프로파일 및/또는 음성 구성 설정에 의해 미디어 재생 시스템과 연관되거나 링크되는 하나 이상의 사용자를 포함한다. 예시적인 사용자 프로파일은 다른 가능성 중에서도 사용자의 나이, 위치, 선호되는 재생 설정, 선호되는 재생 목록, 선호되는 오디오 콘텐트, 사용자에 대하여 설정된 액세스 제한 및 사용자의 음성을 식별하는 정보, 사용자 이력에 관한 정보를 포함할 수 있다. 사용자의 음성을 식별하는 예시적인 정보는 다른 정보 중에서도 사용자의 음성의 톤 또는 주파수, 나이, 성별 및 사용자 이력을 포함한다. 예시적인 음성 구성 설정은 사용자를 인식 또는 그와 연관시키기 위하여 미디어 재생 시스템을 위해 사용자가 음성 입력 또는 일련의 음성 입력을 제공하도록 요청하는 설정을 포함할 수 있다.

예시적인 손님 사용자는 등록된 사용자의 사용자 프로파일 또는 등록된 사용자 또는 등록된 사용자의 허락을 가지는 손님 사용자에 의해 생성된 손님 프로파일에 의해 미디어 재생 시스템과 연관되거나 링크되는 하나 이상의 사용자를 포함한다. 예시적인 손님 프로파일은 사용자 프로파일에 포함되는 임의의 유형의 정보를 포함할 수 있다.

일부 예시에서, 자신의 집에 자신의 미디어 재생 시스템을 가지는 손님은 컴퓨팅 장치(506)에 저장되는 자신의 미디어 재생 시스템에 연관되는 사용자 프로파일을 가질 수 있다. 손님이 주인의 집에 도착하고 주인의 미디어 재생 시스템을 제어하기 위하여 음성 명령을 사용하는 것을 시도하는 경우, 주인의 재생 시스템에 연결된 컴퓨팅 장치(506)는 (i) 손님이 사용자 계정을 가지는 음악 서비스, (ii) 손님의 재생 목록, (iii) 주인이 손님에게 주인의 미디어 재생 시스템을 제어하기 위한 액세스를 허락하였는지 여부, 및/또는 (iv) 아마 손님의 사용자 프로파일 내 다른 사용자 정보를 포함하나 이에 제한되지 않는 손님의 사용자 프로파일 설정을 액세스할 수 있다.

어린이는 예컨대 어린이가 미디어 재생 시스템의 등록된 사용자 중 하나인 경우 사용자 프로파일 내 정보, 손님 프로파일 내 정보 및/또는 사용자의 음성의 톤 또는 주파수에 의해 식별될 수 있다.

일부 예시에서, 음성 명령을 수신하는 것은 미디어 재생 시스템이 (미디어 재생 시스템 서버로서 구성되는) 컴퓨팅 장치(506) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상을 통하여 음성 명령을 수신하는 것을 포함한다. 컴퓨팅 장치(506)는 음성 명령을 상당하는 텍스트 명령으로 변환하고 텍스트 명령을 파싱하여 명령을 식별할 수 있다.

추가의 예시에서, 하나 이상의 기능은 네트워킹된 마이크로폰 시스템에 의해 개별적으로 또는 미디어 재생 시스템과 조합하여 수행될 수 있다. 예를 들어, 음성 명령을 수신하는 것은 네트워킹된 마이크로폰 시스템이 NMD(512, 514 또는 516)를 통하여 음성 명령을 수신하는 것과, 추가적인 처리를 위하여 음성 명령을 컴퓨팅 장치(506) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상으로 송신하는 것을 포함한다. 컴퓨팅 장치(506)는 음성 명령을 상당하는 텍스트 명령으로 변환하고 텍스트 명령을 파싱하여 명령을 식별할 수 있다. 일부 경우에, 네트워킹된 마이크로폰 시스템은 음성 명령을 상당하는 텍스트 명령으로 변환하고 텍스트 명령을 컴퓨팅 장치(506) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상으로 송신하여 텍스트 명령을 파싱하고 명령을 식별할 수 있다.

음성 명령을 수신한 후, 컴퓨팅 장치(506) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상은 음성 명령이 미디어 재생 시스템의 등록된 사용자로부터 수신되었는지 여부를 결정할 수 있다. 일부 예시에서, 음성 명령이 등록된 사용자로부터 수신되었는지 여부를 결정하는 것은 컴퓨팅 장치(506) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상이 음성 명령과 연관되는 미디어 재생 시스템 상에 저장된 사용자 프로파일이 있는지 여부를 결정하는 것을 포함할 수 있다. 예를 들어, 컴퓨팅 장치(506) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상은 미디어 재생 시스템 상에 저장된 사용자 프로파일에 포함될 수 있는 사용자의 음성을 식별하는 정보에 음성 입력을 매칭하는 것을 시도할 수 있다. 네트워킹된 마이크로폰 시스템은 개별적으로 또는 미디어 재생 시스템과 조합하여 컴퓨팅 장치(506)와 통신함으로써 미디어 재생 시스템의 등록된 사용자로부터 음성 명령이 수신되었는지 여부를 결정할 수 있다.

추가적인 예시에서, 음성 명령이 등록된 사용자로부터 수신되었는지 여부를 결정하는 것은 컴퓨팅 장치(506) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상이 음성 명령이 미디어 재생 시스템의 음성 구성 설정 내 음성 입력에 매칭하는지 여부를 결정하는 것을 포함할 수 있다. 예를 들어, 사용자는 사용자를 인식 및 연관시키도록 미디어 재생 시스템을 위한 음성 입력 또는 일련의 음성 입력을 제공함으로써 사용자의 음성을 인식하도록 미디어 재생 시스템을 이전에 구성하였을 수 있다. 음성 입력 또는 일련의 음성 입력은 컴퓨팅 장치(506) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상 상에 저장될 수 있다. 일부 실시예에서, 음성 입력 또는 일련의 음성 입력은 네트워킹된 마이크로폰 시스템 상에 저장될 수 있다.

또 다른 예시에서, 음성 명령이 등록된 사용자로부터 수신되었는지 여부를 결정하는 것은 컴퓨팅 장치(506), CR(522) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상이 개별적으로 또는 조합하여 수신된 음성 명령과 연관되는 신뢰 수준을 결정하는 것을 포함할 수 있다. 신뢰 수준은 사용자 이력, 위치에 기초하여 개별적으로 또는 사용자 프로파일에서 일반적으로 발견되는 임의의 다른 정보와 조합하여 결정될 수 있다.

예를 들어, 미디어 재생 시스템은 주방에서 등록된 사용자로부터 제1 음성 명령을 수신하고 수신된 음성 명령에 기초하여 신뢰 수준을 결정할 수 있다. 미디어 재생 시스템은 제1 음성 명령을 NMD(512-513), CR(522) 및 PBD(532-538) 중 임의의 하나 이상으로부터 수신할 수 있다. 또한, 미디어 재생 시스템은 사용자의 집의 다른 공간에서 등록된 사용자로부터 같은 음성 명령을 수신하고 수신된 음성 명령에 기초하여 신뢰 수준을 결정할 수 있다. 미디어 재생 시스템은 제2 음성 명령을 NMD(512-513), CR(522) 및 PBD(532-538) 중 임의의 하나 이상으로부터 수신할 수 있다. 미디어 재생 시스템은 이후 사용자 집 도처의 상이한 컴퓨팅 장치(예컨대, CR(522)), NMD 및/또는 PBD로부터 수신된 명령에 기초하여 새로운 신뢰 수준을 결정할 수 있다. 결과적으로, 미디어 재생 시스템은 음성 명령이 등록된 사용자로부터 수신되었다는 더 큰 신뢰 수준을 가질 수 있다.

다른 예시에서, 미디어 재생 시스템은 등록된 사용자로부터 음성 명령을 수신하고 사용자 이력에 기초하여 신뢰 수준을 결정할 수 있다. 동작에 있어서, 미디어 재생 시스템은 음성 명령을 NMD(512-513), CR(522) 및 PBD(532-538) 중 임의의 하나 이상으로부터 수신할 수 있다. 음성 명령을 수신한 후, 컴퓨팅 장치(506), CR(522) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상은 개별적으로 또는 조합하여, 수신된 음성 명령이 아티스트, 재생 목록, 장르 또는 등록된 사용자와 통상 연관되는 사용자 프로파일에서 발견되는 임의의 다른 정보를 포함하는 경우 더 높은 신뢰 수준을 결정할 수 있다. 예를 들어, 등록된 사용자가 통상 마이클 잭슨(Michael Jackson)에 의한 노래를 청취하는 경우, 미디어 재생 시스템은 마이클 잭슨에 의한 "스릴러(Thriller)"를 재생하기 위한 음성 명령이 등록된 사용자로부터 수신되었다는 더 큰 신뢰 수준을 가질 수 있다. 위와 유사하거나 상이한 많은 다른 예시가 가능하다.

추가적인 예시에서, 미디어 재생 시스템은 사용자 프로파일에서 발견되는 등록된 사용자의 음성 명령의 패턴에 기초하여 신뢰 수준을 만들 수 있다. 예를 들어, 미디어 재생 시스템은 등록된 사용자로부터 브리트니 스피어스(Britney Spears)에 의한 특정 노래를 재생하기 위한 음성 명령을 수신하고 수신된 음성 명령에 기초하여 신뢰 수준을 결정할 수 있다. 미디어 재생 시스템이 브리트니 스피어스에 의한 다른 노래를 재생하기 위한 명령과 같이 동일한 음성 명령 또는 유사한 음성 명령을 수신할 때마다, 미디어 재생 시스템은 더 높은 신뢰 수준을 만들 수 있고, 따라서 음성 명령이 등록된 사용자로부터 수신되었다는 더 큰 신뢰 수준을 가질 수 있다.

일반적으로, 앞서 언급된 바와 같이, 여기에 설명된 하나 이상의 기능이 네트워킹된 마이크로폰 시스템에 의해 개별적으로 또는 미디어 재생 시스템과 조합하여 수행될 수 있음이 이해되어야 한다. 또한 컴퓨팅 장치(506)에 의해 수행되는 하나 이상의 기능이 미디어 재생 시스템의 CR(522) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상 및/또는 아마 NMD(512, 514 및 516) 중 하나 이상에 의해 수행될 수 있음이 이해되어야 한다.

일부 예시에서, 신뢰 수준을 결정하는 것은 미디어 재생 시스템이 (미디어 재생 시스템 서버로서 구성될 수 있는) 컴퓨팅 장치(506), CR(522) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상을 통하여 개별적으로 또는 서로 조합하여 신뢰 수준을 결정하는 것을 포함한다. 예를 들어, CR(522) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상은 (i) 수신된 음성 명령에 연관되는 신뢰 수준을 결정, (ii) 결정된 신뢰 수준에 기초하여 음성 명령이 등록된 사용자로부터 수신되었다고 결정, 및 (iii) 음성 명령을 실행하기 위한 명령어를 (미디어 재생 시스템 서버로서 구성되는) 컴퓨팅 장치(506)로 전송할 수 있다. 다른 예시에서, CR(522) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상은 (i) 수신된 음성 명령에 연관되는 신뢰 수준을 결정, 및 (ii) 추가적인 처리를 위하여 신뢰 수준에 연관되는 데이터를 컴퓨팅 장치(506)로 전송할 수 있다. 컴퓨팅 장치(506)는 이후 (i) 결정된 신뢰 수준에 기초하여 음성 명령이 등록된 사용자로부터 수신되었다고 결정, 및 (ii) 음성 명령을 실행하기 위한 명령어를 CR(522) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상에 전송할 수 있다.

추가적인 예시에서, 신뢰 수준을 결정하는 것은 미디어 재생 시스템이 개별적으로 또는 네트워킹된 마이크로폰 시스템과 조합하여 신뢰 수준을 결정하는 것을 포함한다. 예를 들어, 미디어 재생 시스템은 미디어 재생 시스템의 CR(522) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상 및/또는 아마 NMD(512, 514 및 516) 중 하나 이상을 통하여 음성 명령을 수신할 수 있다. 수신된 음성 명령에 응답하여, 미디어 재생 시스템은 신뢰 수준에 연관되는 데이터를 NMD(512, 514 또는 516) 중 하나 이상에 전송할 수 있다. 네트워킹된 마이크로폰은 이후 (i) 수신된 데이터에 연관된 신뢰 수준을 결정, 및 (ii) 명령을 실행하거나 명령을 실행하기 위한 명령어를 미디어 재생 시스템에 전송할 수 있다. 음성 명령이 등록된 사용자로부터 수신되었다고 결정하는 것에 응답하여, 컴퓨팅 장치(506)는 미디어 재생 시스템의 하나 이상의 PBD를 위한 명령어를 구성할 수 있다. 명령어는 음성 명령으로부터의 콘텐트 및 등록된 사용자를 위한 사용자 프로파일 내 정보에 기초할 수 있다. 추가적으로 또는 대안적으로, 명령어는 음성 명령으로부터의 콘텐트 및 컴퓨팅 장치(506), PBD(532, 534, 536 및 538) 중 하나 이상 또는 네트워킹된 마이크로폰 시스템 상에 저장된 음성 구성 설정에 기초할 수 있다.

일부 예시에서, 음성 명령으로부터의 콘텐트는 미디어 콘텐트를 재생하기 위한 미디어 재생 시스템의 하나 이상의 PBD를 위한 명령을 포함할 수 있다. 일부 실시예에서, 미디어 콘텐트를 재생하기 위한 미디어 재생 시스템을 위한 명령 및 등록된 사용자를 위한 사용자 프로파일 내 정보에 기초하여, 컴퓨팅 장치(506)는 PBD 중 하나 이상이 등록된 사용자의 선호되는 미디어 소스로부터 미디어 콘텐트를 획득하게 하는 명령어 또는 명령어의 집합을 구성할 수 있다.

다른 예시에서, 미디어 콘텐트를 재생하기 위한 미디어 재생 시스템을 위한 명령 및 등록된 사용자를 위한 사용자 프로파일 내 정보에 기초하여, 컴퓨팅 장치(506)는 미디어 재생 시스템이 미디어 재생 시스템의 하나 이상의 PBD를 통하여 미디어 콘텐트를 재생하도록 하는 명령어를 구성할 수 있다. 예를 들어, 컴퓨팅 장치(506)는 (i) 등록된 사용자의 선호되는 재생 설정 중 하나 이상으로 미디어 재생 시스템을 구성 및 (ii) 등록된 사용자의 선호되는 재생 설정으로 하나 이상의 PBD가 미디어 콘텐트를 재생하도록 하기 위한 명령어를 포함할 수 있다.

선호되는 재생 설정은 등록된 사용자의 사용자 프로파일에 저장된 선호되는 재생 설정일 수 있다. 추가적으로 또는 대안적으로, 선호되는 재생 설정은 등록된 사용자의 사용자 프로파일에 저장된 사용자 이력에 기초할 수 있다. 사용자 이력은 사용자에 의해 미디어 콘텐트를 재생하기 위해 흔히 사용되거나 이전에 사용된 재생 설정을 포함할 수 있다.

또 다른 예시에서, 음성 명령으로부터의 콘텐트는 미디어 콘텐트를 재생하기 위한 미디어 재생 시스템을 위한 명령을 포함할 수 있으나, 미디어 재생 시스템의 특정 재생 구역을 식별하지 않을 수 있다. 콘텐트 및 사용자 이력과 같은 등록된 사용자를 위한 사용자 프로파일 내 정보에 기초하여, 컴퓨팅 장치(506)는 (i) 미디어 재생 시스템이 미디어 재생 시스템의 특정 재생 구역 내의 하나 이상의 PBD를 통하여 미디어 콘텐트를 재생하도록 하기 위한 명령어를 구성 및 (ii) 하나 이상의 PBD를 통하여 미디어 콘텐트를 재생하도록 구성된 명령어를 구현할 수 있다.

또 다른 예시에서, 음성 명령으로부터의 콘텐트는 재생 설정을 변경하기 위한 미디어 재생 시스템을 위한 명령을 포함할 수 있다. 재생 설정을 변경하기 위한 미디어 재생 시스템을 위한 명령 및 등록된 사용자를 위한 사용자 프로파일 내 정보에 기초하여, 컴퓨팅 장치(506)는 (i) 미디어 재생 시스템이 미디어 재생 시스템의 하나 이상의 PBD를 위한 재생 설정을 변경하도록 하기 위한 명령어를 구성 및 (ii) 하나 이상의 PBD를 통하여 재생 설정을 변경하도록 구성된 명령어를 구현할 수 있다.

추가적인 예시는 미디어 재생 시스템이 음성 명령이 어린이로부터 수신되었는지 여부를 결정하는 것을 포함할 수 있다. 예를 들어, 컴퓨팅 장치(506)는 어린이가 미디어 재생 시스템의 등록된 사용자 중 하나인 경우 사용자 프로파일 내 정보에 기초하여 어른과 어린이 사이를 구분할 수 있다. 다른 예시에서, 컴퓨팅 장치(506)는 사용자 음성의 톤 또는 주파수에 기초하여 어른과 어린이 사이를 구분할 수 있다.

추가적인 예시에서, 음성 명령이 어린이로부터 수신되었는지 여부를 결정하는 것은 컴퓨팅 장치(506), CR(522) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상이 (개별적으로 또는 조합하여) 수신된 음성 명령에 연관되는 신뢰 수준을 결정하는 것을 포함할 수 있다. 위에서 설명한 바와 같이, 신뢰 수준은 사용자 이력, 위치에 기초하여, 개별적으로 또는 사용자 프로파일에서 일반적으로 발견되는 임의의 다른 정보와 조합하여 결정될 수 있다.

예시적인 동작에서, 미디어 재생 시스템은 어린이가 있을 가능성이 높은 특정 공간(예컨대, 어린이의 침실, 놀이방, 지하실 등)에 위치된 NMD 또는 PBD로부터 음성 명령을 수신할 수 있다. 음성 명령이 어린이가 있을 가능성이 높은 공간에 위치된 장치(NMD 또는 PBD)로부터 수신되었으므로, 미디어 재생 시스템은 음성 명령이 어린이로부터 수신되었다는 더 큰 신뢰 수준을 가질 수 있다.

다른 예시에서, 미디어 재생 시스템은 콘텐트의 특정 유형을 위한 음성 명령을 수신하고, 콘텐트의 유형에 기초하여 음성 명령이 어린이로부터 수신되었다는 더 높은 신뢰 수준을 결정할 수 있다. 예를 들어, 미디어 재생 시스템이 만화 쇼 또는 영화의 사운드트랙을 재생하기 위한 음성 명령을 수신하는 경우, 미디어 재생 시스템은 음성 명령이 어린이로부터 수신되었다는 더 큰 신뢰 수준을 가질 수 있다. 위와 유사하거나 상이한 많은 다른 예시가 가능하다.

음성 명령이 어린이로부터 수신되었다고 결정하는 것에 응답하여, 일부 예시는 하나 이상의 PBD가 어린이에게 부적합할 수 있는 소정의 미디어를 재생하는 것이 방지되는 것을 포함할 수 있다. 일부 예시에서, 컴퓨팅 장치(506) 및/또는 하나 이상의 PBD는 어린이의 음성 명령의 콘텐트에 기초하여 재생 설정을 변경하는 것이 방지될 수 있다. 예를 들어, 컴퓨팅 장치(506) 및/또는 하나 이상의 PBD는 하나 이상의 PBD의 음량을 증가시키기 위한 어린이의 음성 명령을 무시할 수 있다.

일부 경우에, 미디어 재생 장치는 음성 명령이 미디어 재생 시스템의 등록된 사용자 대신 손님 사용자로부터인지 여부를 결정하는 것에 기초하여 액션을 취할 수 있다. 예를 들어, 컴퓨팅 장치(506)는 특정 손님과 연관될 수 있는 이전에 생성된 손님 프로파일을 저장하였을 수 있다. 다른 예시에서, 컴퓨팅 장치(506)는 음성 명령이 등록된 사용자로부터 수신되지 않았다고 결정할 수 있고, 이후 음성 명령이 손님으로부터 왔는지 등록된 사용자에게 물을 수 있다. 등록된 사용자는 이후 컴퓨팅 장치(506) 및/또는 하나 이상의 PBD가 음성 명령의 콘텐트의 전부 또는 일부를 실행하는 것을 방지하기 위한 옵션을 가질 수 있다.

또 다른 예시에서, 음성 명령이 손님 사용자로부터 수신되었는지 여부를 결정하는 것은 컴퓨팅 장치(506), CR(522) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상이 (개별적으로 또는 조합하여) 수신된 음성 명령과 연관되는 신뢰 수준을 결정하는 것을 포함할 수 있다. 위에서 설명한 바와 같이, 신뢰 수준은 사용자 이력, 위치에 기초하여, 개별적으로 또는 사용자 프로파일에서 일반적으로 발견되는 임의의 다른 정보와 조합하여 결정될 수 있다.

음성 명령이 손님 사용자로부터 수신되었다고 결정하는 것에 응답하여, 컴퓨팅 장치(506)는 (1) 손님 사용자에 대하여 제한 설정을 할당, (2) 음성 명령으로부터의 콘텐트 및 손님 사용자에 대하여 할당된 제한 설정에 기초하여 하나 이상의 PBD에 대한 명령어를 구성, 및 (3) 명령어를 실행을 위하여 하나 이상의 PBD로 전송할 수 있다. 일부 예시에서, 손님 사용자에 대하여 제한 설정을 할당하는 것은 컴퓨팅 장치(506)가 컴퓨팅 장치(506) 및/또는 하나 이상의 PBD에 저장된 특정 손님 프로파일에 음성 명령을 매칭하는 것을 포함할 수 있다. 손님 프로파일은 제한 설정 및 앞서 설명된 다른 정보 중에서도 손님의 음성의 주파수나 톤과 같은 특정 손님 사용자의 음성에 관한 정보를 포함할 수 있다. 제한 설정은 미디어 재생 시스템의 제어를 제한하는 임의의 설정일 수 있다.

추가적인 예시는 미디어 재생 시스템이 상이한 사용자로부터 수신되는 상반되는 음성 명령을 해결하기 위해 선호도의 순서를 결정하는 것을 포함한다. 상반되는 음성 명령은 예컨대 노래를 재생하라는 사용자로부터 수신된 음성 명령과 노래를 재생하는 것을 멈추라는 다른 사용자로부터 수신된 후속 음성 명령일 수 있다. 하나 이상의 PBD(532, 534, 536 및 538)의 음량을 증가시키라는 사용자로부터 수신된 음성 명령과 음량을 감소시키라는 다른 사용자로부터 수신된 후속 음성 명령과 같은 다른 예시가 가능하다.

특히, 미디어 재생 시스템은 (NMD(512-516), CR(522), PBD(532-538) 및/또는 컴퓨팅 장치(506) 중 하나 이상을 통하여) 재생 구역에서 노래를 재생하라는 등록된 사용자 또는 주인으로부터의 음성 명령을 수신할 수 있다. 후속적으로, 미디어 재생 시스템은 재생 구역에서 노래를 재생하는 것을 멈추라는 등록되지 않은 사용자로부터의 상반되는 음성 명령을 수신할 수 있다. 이러한 충돌을 해결하기 위하여, 미디어 재생 시스템은 등록된 사용자로부터 수신된 음성 명령이 등록되지 않은 사용자나 손님보다 더 높은 우선 순위를 가지는 선호도의 순서를 적용할 수 있다.

다른 예시에서, 미디어 재생 시스템은 등록된 손님으로부터 수신된 음성 명령이 등록되지 않은 손님보다 더 높은 우선 순위를 가지는 선호도의 순서를 할당할 수 있다. 일부 예시에서, 한 등록된 손님으로부터 수신된 음성 명령은 다른 등록된 손님보다 더 높은 우선 순위를 가질 수 있다. 추가적으로 또는 대안적으로, 어른으로부터 수신된 음성 명령은 어린이보다 더 높은 우선 순위를 가질 수 있다.

또 다른 예시에서, 미디어 재생 시스템에 의해 수신된 컨트롤러 발행 명령(예컨대, CR(522) 또는 미디어 재생 시스템을 제어하도록 구성되는 다른 컴퓨팅 장치에 의해 발행된 명령)은 등록된 사용자보다 더 낮은 우선 순위를 가질 수 있으나, 등록되지 않은 사용자 또는 손님보다 더 높은 우선 순위를 가질 수 있다. 일부 예시에서, 일부 등록된 손님은 컨트롤러 발행 명령보다 더 높은 우선 순위를 가질 수 있다. 선호도의 순서를 결정 및 할당하는 다른 예시가 가능하다.

추가적으로, 미디어 재생 시스템은 등록된 사용자와 연관되는 깨우기 단어 또는 깨우기 어구에 기초하여 액션을 취할 수 있다. 깨우기 단어 또는 어구는 등록된 사용자의 프로파일에 저장된 특정 단어 또는 어구(예컨대, "헤이, 소노스")를 포함할 수 있다. 일부 예시에서, 상이한 사용자는 상이한 깨우기 단어 또는 어구에 대하여 미디어 재생 시스템을 구성할 수 있다. 다른 예시에서, 미디어 재생 시스템은 모든 (또는 임의의) 사용자에 대하여 같은 깨우기 단어 또는 어구로 구성될 수 있다.

일부 예시에서, 등록된 사용자는 미디어 재생 시스템이 등록된 사용자, 손님 및/또는 등록되지 않은 사용자로부터 깨우기 단어 또는 어구와 연관되는 추가적인 음성 명령을 수신하기 위한 기간 또는 시간대를 트리거하는 보편적인(universal) 깨우기 단어 또는 어구를 가질 수 있다. 예를 들어, 등록된 사용자 또는 주인은 재생 큐에 노래를 추가히기 위한 음성 명령(예컨대, "헤이 소노스, 노래를 큐에 넣자")를 전송할 수 있고, 이는 등록된 사용자가 특정 노래를 재생 큐에 추가하기 위한 추가적인 음성 명령(예컨대, "마이클 잭슨에 의한 스릴러를 추가하라")을 전송할 수 있는 기간 또는 시간대(예컨대, 5분)를 시작할 수 있다. 다른 예시에서, 등록된 사용자 또는 주인은 사용자 정의된 또는 디폴트 기간 또는 시간대 동안, 또는 특정 기간 동안(예컨대, "헤이 소노스, 다음 4시간 동안 내 집 시스템에 대한 제어를 개방하라" 또는 "헤이 소노스, 지금부터 토요일 오후 2시까지 내 집 시스템에 대한 제어를 개방하라") 다른 기능 중에서도 재생 큐에 노래를 추가, 노래를 재생 또는 음량을 변화하기 위한 음성 명령을 전송하는 권한을 집 안의 모든 손님에게 부여하는 음성 명령(예컨대, "헤이 소노스, 내 집 시스템에 대한 제어를 개방하라")을 전송할 수 있다. 일부 예시에서, 등록된 사용자 또는 주인은 기간 또는 시간대 동안 재생 구역에서 하나 이상의 PBD(532, 534, 536 및 538) 및/또는 컴퓨팅 장치(506)를 제어하기 위한 음성 명령을 전송할 권한을 손님 중 일부에게만 부여하는 음성 명령(예컨대, "헤이 소노스, 내 거실에 대한 제어를 권한 부여된 손님에게 제한하라")을 전송할 수 있다.

다른 예시에서, 등록된 사용자는 깨우기 단어 또는 어구와 연관되는 추가적인 음성 명령을 수신하기 위한 미디어 재생 시스템을 위한 기간 또는 시간대를 트리거하는 상이한 음성 명령에 대하여 상이한 깨우기 단어 또는 어구를 가질 수 있다. 예를 들어, 등록된 사용자 또는 주인은 재생 큐에 노래를 추가하기 위한 음성 명령을 전송하기 위해 사용자별 깨우기 단어 또는 어구(예컨대, "헤이 소노스, 노래를 큐에 넣자", "요, 소노스, 노래를 줄세워라", "알파 노래 큐" 등)를 가질 수 있고, 집 안의 손님에게 미디어 재생 장치를 제어할 권한을 부여하기 위하여 다른 사용자별 깨우기 단어 또는 어구(예컨대, "헤이 소노스, 액세스를 개방하라", "파티 타임이다" 등)를 가질 수 있다.

또 다른 예시에서, 등록된 사용자 또는 주인은 집 안의 어떠한 손님이 기간 또는 시간대 동안 미디어 재생 시스템의 제한된 제어를 가지도록 권한을 부여하는 음성 명령을 전송하기 위한 사용자별 또는 보편적인 깨우기 단어 또는 어구를 가질 수 있다. 여기에 참조로서 그 전체가 포함되는 미국 특허 공개 제2013/0346859호 "크라우드 소싱되는 재생 목록에 게스트 액세스를 제공하기 위한 시스템, 방법, 기기 및 제조 물품(Systems, Methods, Apparatus, and Articles of Manufacture to Provide a Crowd-Sourced Playlist with Guest Access)"은 미디어 재생 시스템의 제한된 제어에 대한 일부 예시를 더 상세히 제공한다.

추가적인 예시에서, 등록된 사용자 또는 주인은 집 안의 등록된 손님이 기간 또는 시간대 동안 미디어 재생 시스템의 개방된 제어 또는 제한된 제어를 가지도록 권한을 부여하나 등록되지 않은 손님이 제어를 가지는 것을 방지하기 위한 음성 명령을 전송하기 위한 사용자별 또는 보편적인 깨우기 단어 또는 어구를 가질 수 있다. 일부 예시에서, 등록된 사용자 또는 주인은 기간 또는 시간대 동안 미디어 재생 시스템의 개방된 제어 또는 제한된 제어를 가지도록 집 안의 어른에게 권한을 부여하나 어린이가 제어를 가지는 것을 방지하기 위한 음성 명령을 전송하기 위한 사용자별 또는 보편적인 깨우기 단어 또는 어구를 가질 수 있다. 위와 유사하거나 상이한 많은 다른 예시가 가능하다.

일부 예시에서, 등록된 사용자 또는 주인은 미디어 재생 시스템이 추가적인 음성 명령을 수신하기 위한 기간 또는 시간대를 특정할 수 있다. 예를 들어, 등록된 사용자 또는 주인은 특정된 기간(예컨대, 한 시간) 동안 미디어 재생 시스템을 제어하기 위한 추가적인 음성 명령을 손님이 전송하도록 권한을 부여하는 음성 명령(예컨대, "헤이, 소노스, 한 시간 동안 내 집 시스템에 대한 제어를 개방하라")을 전송할 수 있다. 위와 유사하거나 상이한 많은 다른 예시가 가능하다.

추가적인 예시에서, 등록된 사용자 또는 주인은 초기 깨우기 단어 또는 어구와 연관되는 추가적인 음성 명령을 수신하기 위한 기간 또는 시간대를 닫거나 키오프(key off) 할 수 있다. 예를 들어, 등록된 사용자 또는 주인이 한 시간 동안 추가적인 음성 명령을 수신하기 위한 기간 또는 시간대를 시작하는 깨우기 단어 또는 어구로 음성 명령을 말한 경우, 등록된 사용자 또는 주인은 한 시간 기간이 만료하기 전에 한 시간 기간 또는 시간대를 키오프 하기 위한 다른 음성 명령(예컨대, "헤이 소노스, 노래 큐를 끝내라")을 전송할 수 있다. 위와 유사하거나 상이한 많은 다른 예시가 가능하다.

또한, 예시는 미디어 재생 시스템이 등록된 손님 사용자로부터 깨우기 단어 또는 깨우기 어구를 수신하는 것에 기초하여 액션을 취하는 것을 수반할 수 있다. 등록된 손님 사용자는 손님 프로파일에 저장된 깨우기 단어 또는 어구를 가질 수 있다. 깨우기 단어 또는 깨우기 어구가 손님 사용자로부터 수신되었다고 결정하는 것에 응답하여, 미디어 재생 시스템은 (i) 손님 사용자와 연관되는 제한 설정이 있는지 여부를 결정, (ii) 깨우기 단어 또는 어구 및 손님 사용자에 대하여 할당된 제한 설정에 기초하여 하나 이상의 PBD를 위한 명령어를 구성, 및 (iii) 명령어를 실행을 위해 하나 이상의 PBD에 전송(예컨대, 깨우기 단어 명령과 연관되는 추가적인 음성 명령을 수신하기 위한 기간 또는 시간대를 시작)할 수 있다.

일부 예시에서, 예컨대 미디어 재생 시스템이 이미 등록된 사용자 또는 주인으로부터 깨우기 단어 또는 어구와 음성 명령을 수신하였고 추가적인 명령을 수신하기 위한 기간 또는 시간대가 만료하지 않은 경우, 미디어 재생 시스템은 등록된 손님 사용자로부터 깨우기 단어 또는 어구를 수신하는 것에 기초하여 액션을 취하는 것을 삼갈 수 있다.

추가적인 예시에서, 미디어 재생 시스템이 후속적으로 등록된 사용자 또는 주인으로부터 음성 명령을 수신하는 경우 미디어 재생 시스템은 등록된 손님 사용자로부터 깨우기 단어 또는 깨우기 어구를 수신하는 것에 기초하여 액션을 취할 수 있고 후속적으로 추가적인 음성 명령을 수신하기 위한 기간 또는 시간대를 닫거나 키오프 할 수 있다. 일부 실시예에서, 등록된 손님은 기간 또는 시간대가 만료하기 전에 닫거나 키오프 할 수 있다. 다른 실시예에서, 등록된 손님이 어린이인 경우 어른은 기간 또는 시간대가 만료하기 전에 닫거나 키오프 할 수 있다. 위와 유사하거나 상이한 많은 다른 예시가 가능하다.

미디어 재생 시스템을 위한 명령어를 구성한 후, 일부 예시는 명령어를 실행하기 위하여 명령어가 미디어 재생 시스템의 하나 이상의 PBD로 전송되는 것을 포함할 수 있다. 일부 예시에서, 미디어 재생 시스템은 컴퓨팅 장치(506)로 명령어를 전송할 수 있다. 다른 예시에서, 미디어 재생 시스템은 네트워킹된 마이크로폰 시스템으로 명령어를 전송할 수 있다.

도 14에 도시된 방법(1400)은 예컨대 도 1의 미디어 재생 시스템(100), 도 2의 하나 이상의 재생 장치(200), 도 3의 하나 이상의 제어 장치(300), 도 4의 사용자 인터페이스 및/또는 도 5에 도시된 구성을 포함 또는 수반하는 동작 환경 내에서 구현될 수 있는 방법의 실시예를 제공한다. 방법(1400)은 블록(1402-1406) 중 하나 이상에 의해 도시되는 하나 이상의 동작, 기능 또는 액션을 포함할 수 있다.

방법(1400)은 블록 1402에서 시작하며, 이는 미디어 재생 시스템을 위한 음성 명령을 수신하는 것을 포함한다. 일부 실시예에서, 음성 명령을 수신하는 것은 미디어 재생 시스템이 (미디어 재생 시스템 서버로서 구성되는) 컴퓨팅 장치(506) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상을 통하여 음성 명령을 수신하는 것을 포함한다. 일 예시에서, 컴퓨팅 장치(506)는 음성 명령을 상당하는 텍스트 명령으로 변환하고 텍스트 명령을 파싱하여 명령을 식별할 수 있다.

일 예시에서, 하나 이상의 기능은 네트워킹된 마이크로폰 시스템에 의하여 개별적으로 또는 미디어 재생 시스템과 조합하여 수행될 수 있다. 일부 실시예에서, 음성 명령을 수신하는 것은 네트워킹된 마이크로폰 시스템이 NMD(512, 514 또는 516) 중 하나 이상을 통하여 음성 명령을 수신하는 것, 및 추가적인 처리를 위하여 음성 명령을 컴퓨팅 장치(506) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상으로 송신하는 것을 포함한다. 다른 예시에서, 컴퓨팅 장치(506) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상은 음성 명령을 상당하는 텍스트 명령으로 변환하고 텍스트 명령을 파싱하여 명령을 식별할 수 있다. 추가적인 예시에서, 네트워킹된 마이크로폰 시스템은 음성 명령을 상당하는 텍스트 명령으로 변환하고 텍스트 명령을 컴퓨팅 장치(506) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상으로 송신하여 텍스트 명령을 파싱하고 명령을 식별할 수 있다.

다음, 방법(1400)은 블록 1404로 진행하며, 이는 음성 명령이 미디어 재생 시스템의 등록된 사용자로부터 수신되었는지 여부를 결정하는 것을 포함한다. 일부 예시에서, 음성 명령이 등록된 사용자로부터 수신되었는지 여부를 결정하는 것은 컴퓨팅 장치(506)가 음성 명령에 연관되는 미디어 재생 시스템 상에 저장된 사용자 프로파일이 있는지 여부를 결정하는 것을 포함할 수 있다. 예를 들어, 컴퓨팅 장치(506)는 사용자 프로파일 내 사용자의 음성을 식별하는 정보에 음성 명령을 매칭하는 것을 시도할 수 있다.

다른 예시에서, 음성 명령이 등록된 사용자로부터 수신되었는지 여부를 결정하는 것은 음성 명령이 미디어 재생 시스템의 음성 구성 설정에 저장된 음성 입력에 매칭하는지 여부를 결정하는 것을 포함할 수 있다. 예를 들어, 사용자는 사용자를 인식 및 연관시키도록 미디어 재생 시스템에 음성 입력 또는 일련의 음성 입력을 제공함으로써 미디어 재생 시스템이 사용자의 음성을 인식하도록 이전에 구성하였을 수 있다. 음성 구성 설정은 컴퓨팅 장치(506) 및/또는 PBD(532, 534, 536 및 538) 중 하나 이상 상에 저장될 수 있다. 대안적으로, 컴퓨팅 장치(506)는 음성 구성 설정을 저장하도록 네트워킹된 마이크로폰 시스템과 통신할 수 있다.

또 다른 예시에서, 음성 명령이 등록된 사용자로부터 수신되었는지 여부를 결정하는 것은 수신된 음성 명령과 연관되는 신뢰 수준을 결정하는 것을 포함할 수 있다. 신뢰 수준은 명령을 말한 사람과 연관되는 신뢰 수준, 예컨대 명령이 일반적으로 등록된 사용자로부터 수신된 신뢰 수준, 명령이 특정 등록된 사용자로부터 수신된 신뢰 수준, 명령이 등록된 사용자가 아닌 누군가로부터 수신된 신뢰 수준, 명령이 등록된 손님으로부터 수신된 신뢰 수준, 명령이 어린이로부터 수신된 신뢰 수준, 및/또는 명령이 특정 어린이로부터 수신된 신뢰 수준일 수 있다. 신뢰 수준은 요청의 콘텐트와 연관되는 신뢰 수준, 예컨대 요청이 매우 유사한 소리가 나는 이름을 가진 두 개의 매우 다른 밴드인 "헤이시드 딕시(Hayseed Dixie)" 대신 "AC/DC"를 재생하기 위한 요청인 신뢰 수준일 수도 있다. 신뢰 수준은 사용자 이력, 위치에 기초하여, 개별적으로 또는 사용자 프로파일에서 일반적으로 발견되는 임의의 다른 정보와 조합하여 결정될 수 있다. 동작에 있어서, 신뢰 수준의 결정은 CR(522), PBD(532-538), NMD(512-516) 및/또는 컴퓨팅 장치(504-508) 중 임의의 하나 이상에 의하여 개별적으로 또는 조합하여 수행될 수 있다.

예시적인 동작에서, 미디어 재생 시스템은 주방에서 등록된 사용자로부터 음성 명령을 수신하고 수신된 음성 명령에 기초하여 신뢰 수준을 결정할 수 있다. 미디어 재생 장치는 CR(522), NMD(512-516) 및/또는 PBD(532-538) 중 임의의 하나 이상으로부터 음성 명령을 수신할 수 있다. 다음, 미디어 재생 시스템은 사용자의 집의 다른 공간에서 등록된 사용자로부터 같은 음성 명령을 수신하고 수신된 음성 명령에 기초하여 신뢰 수준을 결정할 수 있다. 미디어 재생 시스템은 이후 음성 명령이 수신된 공간에 적어도 부분적으로 기초하여 사용자의 집 도처에서 상이한 공간에서 상이한 장치로부터 수신된 명령에 기초하여 새로운 신뢰 수준을 결정할 수 있다. 결과적으로 미디어 재생 시스템은 음성 명령이 등록된 사용자로부터 수신된 더 큰 신뢰 수준을 가질 수 있다.

다른 예시에서, 미디어 재생 시스템은 등록된 사용자로부터 음성 명령을 수신하고 사용자 이력에 기초하여 신뢰 수준을 결정할 수 있다. 특히, 수신된 음성 명령이 아티스트, 재생 목록, 장르 또는 등록된 사용자와 통상적으로 연관되는 사용자 프로파일에서 발견되는 임의의 다른 정보를 포함하는 경우 미디어 재생 시스템은 더 높은 신뢰 수준을 결정할 수 있다. 예를 들어, 등록된 사용자가 통상적으로 마이클 잭슨에 의한 노래를 청취하는 경우, 미디어 재생 시스템은 "스릴러를 재생하라"는 음성 명령이 등록된 사용자로부터 수신되었다는 더 큰 신뢰 수준을 가질 수 있다. 유사하게, 등록된 사용자가 통상적으로 마이클 잭슨에 의한 노래와 일반적으로 1980년대 노래를 청취하는 경우, 미디어 재생 시스템은 "스릴러를 재생하라"는 음성 명령이 밴드 폴 아웃 보이(Fall Out Boy)에 의한 노래 "스릴러"가 아니라 아티스트 마이클 잭슨에 의한 노래 "스릴러"를 재생하기 위한 명령이라는 더 큰 신뢰 수준을 가질 수 있다. 위와 유사하거나 상이한 많은 다른 예시가 가능하다.

또 다른 예시에서, 미디어 재생 시스템은 사용자 프로파일에서 발견되는 등록된 사용자의 음성 명령의 패턴에 기초하여 신뢰 수준을 만들 수 있다. 예를 들어, 미디어 재생 시스템은 등록된 사용자로부터 브리트니 스피어스에 의한 특정 노래를 재생하라는 음성 명령을 수신하고 수신된 음성 명령에 기초하여 신뢰 수준을 결정할 수 있다. 미디어 재생 시스템이 브리트니 스피어스의 다른 노래를 재생하기 위한 명령과 같이 같은 음성 명령 또는 유사한 음성 명령을 수신할 때마다, 미디어 재생 시스템은 더 높은 신뢰 수준을 만들 수 있고 음성 명령이 등록된 사용자로부터 수신되었다는 더 큰 신뢰 수준을 가질 수 있다.

마지막으로, 방법(1400)은 블록 1406으로 진행하며, 이는 음성 명령이 등록된 사용자로부터 수신되었다고 결정하는 것에 응답하여, 음성 명령으로부터의 콘텐트 및 등록된 사용자에 대한 사용자 프로파일 내 정보에 기초하여 미디어 재생 시스템을 위한 명령어를 구성하는 것을 포함한다.

일부 예시에서, 음성 명령으로부터의 콘텐트는 미디어 재생 시스템의 하나 이상의 PBD가 미디어 콘텐트를 재생하기 위한 명령을 포함할 수 있다. 일부 예시에서, 하나 이상의 PBD가 미디어 콘텐트를 재생하기 위한 명령 및 등록된 사용자에 대한 사용자 프로파일 내 정보에 기초하여, 컴퓨팅 장치(506)는 미디어 재생 시스템이 등록된 사용자의 선호되는 미디어 소스로부터 미디어 또는 오디오 콘텐트를 획득하도록 하기 위한 명령어를 구성할 수 있다.

추가적인 예시에서, 미디어 콘텐트를 재생하기 위한 미디어 재생 시스템을 위한 명령 및 등록된 사용자를 위한 사용자 프로파일 내 정보에 기초하여, 미디어 재생 시스템은 미디어 재생 시스템이 미디어 재생 시스템의 하나 이상의 PBD를 통하여 미디어 콘텐트를 재생하도록 하기 위한 명령어를 구성할 수 있다. 특히, 컴퓨팅 장치(506)는 (i) 등록된 사용자의 선호되는 재생 설정 중 하나 이상으로 미디어 재생 시스템을 구성, 및 (ii) 미디어 재생 시스템의 하나 이상의 PBD가 등록된 사용자의 선호되는 재생 설정으로 미디어 콘텐트를 재생하도록 하기 위한 명령어를 포함할 수 있다. 선호되는 재생 설정은 등록된 사용자의 사용자 프로파일에 저장된 선호되는 재생 설정일 수 있다. 추가적으로 또는 대안적으로, 선호되는 재생 설정은 등록된 사용자의 사용자 프로파일에 저장된 사용자 이력에 기초할 수 있다. 사용자 이력은 미디어 콘텐트를 재생하기 위해 사용자에 의하여 통상적으로 사용되거나 이전에 사용된 재생 설정을 포함할 수 있다.

일부 경우에, 음성 명령으로부터의 콘텐트는 미디어 재생 시스템의 하나 이상의 PBD가 미디어 콘텐트를 재생하기 위한 명령을 포함할 수 있으나 미디어 재생 시스템의 특정 청취 구역 또는 재생 구역을 식별하지 않을 수 있다. 이러한 콘텐트 및 사용자 이력과 같은 등록된 사용자를 위한 사용자 프로파일 내 정보에 기초하여, 컴퓨팅 장치(506)는 미디어 재생 시스템이 미디어 재생 시스템의 특정 재생 구역 내에서 하나 이상의 미디어 재생 장치를 통하여 미디어 콘텐트를 재생하도록 하기 위한 명령어 또는 명령어의 집합을 구성할 수 있다.

다른 경우에, 음성 명령으로부터의 콘텐트는 미디어 재생 시스템이 재생 설정을 변경하기 위한 명령을 포함할 수 있다. 미디어 재생 시스템이 재생 설정을 변경하기 위한 명령 및 등록된 사용자를 위한 사용자 프로파일 내 정보에 기초하여, 컴퓨팅 장치(506)는 (i) 미디어 재생 시스템이 미디어 재생 시스템의 하나 이상의 PBD를 위한 재생 설정을 변경하도록 하기 위한 명령어 또는 명령어의 집합을 구성, 및 (ii) 하나 이상의 PBD를 통하여 재생 설정을 변경하도록 구성된 명령어 또는 명령어의 집합을 구현할 수 있다.

추가적인 예시는 미디어 재생 시스템이 음성 명령이 어린이로부터 수신되었는지 여부를 결정하는 것을 수반할 수 있다. 예를 들어, 어린이가 미디어 재생 시스템의 등록된 사용자 중 하나인 경우 컴퓨팅 장치(506)는 사용자 프로파일 내 정보에 기초하여 어른과 어린이 사이를 구분할 수 있다. 다른 예시에서, 컴퓨팅 장치(506)는 사용자의 음성의 톤 또는 주파수에 기초하여 어른과 어린이 사이를 구분할 수 있다.

또 다른 예시에서, 음성 명령이 어린이로부터 수신되었는지 여부를 결정하는 것은 수신된 음성 명령과 연관되는 신뢰 수준을 결정하는 것을 포함할 수 있다. 위에서 설명된 바와 같이, 신뢰 수준은 사용자 이력, 위치에 기초하여 개별적으로 또는 사용자 프로파일에서 일반적으로 발견되는 임의의 다른 정보와 조합하여 결정될 수 있다.

일부 예시에서, 미디어 재생 시스템은 어린이가 있을 가능성이 높은 특정 공간(예컨대, 어린이의 침실, 놀이방, 지하실 등) 내 장치(예컨대, NMD(512-516) 또는 PBD(532-538) 중 임의의 것)를 통하여 음성 명령을 수신할 수 있다. 어린이가 있을 가능성이 높은 공간에 위치된 장치로부터 명령이 수신되었으므로 미디어 재생 시스템은 음성 명령이 어린이로부터 수신되었다는 더 큰 신뢰 수준을 가질 수 있다.

추가적인 예시에서, 미디어 재생 시스템은 음성 명령을 수신하고 음성 명령의 콘텐트에 기초하여 명령이 어린이로부터 수신되었다는 신뢰 수준을 결정할 수 있다. 예를 들어, 미디어 재생 시스템이 만화 쇼 또는 영화의 사운드트랙을 재생하기 위한 음성 명령을 수신하는 경우, 미디어 재생 시스템은 음성 명령이 어린이로부터 수신되었다는 더 큰 신뢰 수준을 가질 수 있다. 위와 유사하거나 상이한 많은 다른 예시가 가능하다.

음성 명령이 어린이로부터 수신되었다고 결정하는 것에 응답하여, 일부 예시는 미디어 재생 시스템의 하나 이상의 PBD가 어린이에게 부적절할 수 있는 소정의 미디어를 재생하는 것이 금지되는 것을 수반할 수 있다. 일부 예시는 컴퓨팅 장치(506) 및/또는 하나 이상의 PBD가 어린이의 음성 명령의 콘텐트에 기초하여 재생 설정을 변경하는 것이 금지되는 것을 수반할 수 있다. 예를 들어, 컴퓨팅 장치(506)는 하나 이상의 PBD의 음량을 증가시키기 위한 어린이의 음성 명령을 무시할 수 있다.

추가적으로, 추가적인 예시는 음성 명령이 미디어 재생 시스템의 등록된 사용자 대신 손님 사용자로부터 수신되었는지 여부를 결정하는 것에 기초하는 액션을 수반할 수 있다. 일부 예시에서, 컴퓨팅 장치(506)는 특정 손님과 연관될 수 있는 이전에 생성된 손님 프로파일을 저장하였을 수 있다. 추가적인 예시에서, 컴퓨팅 장치(506)는 음성 명령이 등록된 사용자로부터 수신되지 않았다고 결정할 수 있고, 이후 음성 명령이 손님으로부터 왔는지 등록된 사용자에게 물을 수 있다.

또한, 음성 명령이 손님 사용자로부터 수신되었는지 여부를 결정하는 것은 미디어 재생 시스템이 수신된 음성 명령과 연관되는 신뢰 수준을 결정하는 것을 포함할 수 있다. 위에서 설명된 바와 같이, 신뢰 수준은 사용자 이력, 위치에 기초하여 개별적으로 또는 사용자 프로파일에서 일반적으로 발견되는 임의의 다른 정보와 조합하여 결정될 수 있다.

음성 명령이 손님 사용자로부터 수신되었다고 결정하는 것에 응답하여, 컴퓨팅 장치(506)는 (1) 손님 사용자에 대한 제한 설정을 할당, (2) 음성 명령으로부터의 콘텐트 및 손님 사용자에 대하여 할당된 제한 설정에 기초하여 하나 이상의 PBD를 위한 명령어를 구성, 및 (3) 실행을 위하여 하나 이상의 PBD에 명령어를 전송할 수 있다. 일부 실시예에서, 손님 사용자에 대하여 제한 설정을 할당하는 것은 컴퓨팅 장치(506)가 컴퓨팅 장치(506) 상에 저장된 특정 손님 프로파일에 음성 명령을 매칭하는 것을 포함할 수 있다.

또한, 예시는 미디어 재생 시스템이 상이한 사용자로부터 수신되는 상반되는 음성 명령을 해결하기 위해 선호도의 순서를 적용하는 것을 수반할 수 있다. 상반되는 음성 명령은 예컨대 노래를 재생하기 위한 사용자로부터 수신된 음성 명령과 노래를 재생하는 것을 멈추기 위한 다른 사용자로부터 수신된 후속 음성 명령일 수 있다. 하나 이상의 재생 장치(예컨대, PBD(532, 534, 536 및 538))의 음량을 증가시키기 위한 사용자로부터 수신된 음성 명령과 음량을 감소시키기 위한 다른 사용자로부터 수신된 후속 음성 명령과 같은 다른 예시가 가능하다. 특히, 미디어 재생 시스템은 등록된 사용자 또는 주인으로부터 재생 구역에서 노래를 재생하기 위한 음성 명령을 수신할 수 있다. 후속적으로, 미디어 재생 시스템은 등록되지 않은 사용자 또는 손님으로부터 재생 구역에서 노래를 재생하는 것을 멈추기 위한 상반되는 음성 명령을 수신할 수 있다. 이러한 충돌을 해결하기 위해, 미디어 재생 시스템은 등록된 사용자로부터 수신된 음성 명령이 등록되지 않은 사용자 또는 손님으로부터의 음성 명령보다 더 높은 우선 순위를 가지는 선호도의 순서를 적용할 수 있다.

일부 예시에서, 미디어 재생 시스템은 등록된 손님으로부터 수신된 음성 명령이 등록되지 않은 손님으로부터 수신된 음성 명령보다 더 높은 우선 순위를 가지는 선호도의 순서를 할당할 수 있다. 일 예시에서, 한 등록된 손님으로부터 수신된 음성 명령은 다른 등록된 손님보다 더 높은 우선 순위를 가질 수 있다. 다른 예시에서, 어른으로부터 수신된 음성 명령은 어린이보다 더 높은 우선 순위를 가질 수 있다.

추가적인 예시에서, 미디어 재생 시스템에 의해 수신되는 컨트롤러 발행 명령(예컨대, CR(522) 또는 미디어 재생 시스템을 제어하도록 구성되는 다른 컴퓨팅 장치로부터 수신되는 명령, 또는 아마 컴퓨팅 장치(506)로부터 수신되는 명령)은 등록된 사용자보다 더 낮은 우선 순위를 가질 수 있으나, 등록되지 않은 사용자 또는 손님보다 더 높은 우선 순위를 가질 수 있다. 일부 실시예에서, 일부 등록된 손님은 컨트롤러 발행 명령어보다 더 높은 우선 순위를 가질 수 있다. 선호도의 순서를 결정 및 할당하는 다른 예시가 가능하다.

미디어 재생 시스템을 위한 명령어를 구성한 후, 일부 실시예는 명령어를 실행하기 위해 미디어 재생 시스템의 하나 이상의 PBD로 명령어를 전송할 수 있다. 일부 실시예에서, 컴퓨팅 장치(506)는 네트워킹된 마이크로폰 시스템에 명령어를 전송할 수 있다.

도 15에 도시된 방법(1500)은 예컨대 도 1의 미디어 재생 시스템(100), 도 2의 하나 이상의 재생 장치(200), 도 3의 하나 이상의 제어 장치(300), 도 4의 사용자 인터페이스 및/또는 도 5에 도시된 구성을 포함 또는 수반하는 동작 환경 내에서 구현될 수 있는 방법의 실시예를 제공한다. 방법(1500)은 블록(1502-1506) 중 하나 이상에 의해 도시된 하나 이상의 동작, 기능 또는 액션을 포함할 수 있다.

방법(1500)은 블록 1502에서 시작하며, 이는 미디어 재생 시스템을 위한 음성 명령과 연관되는 깨우기 단어 또는 깨우기 어구를 수신하는 것을 포함한다. 위에서 설명된 바와 같이, 깨우기 단어 또는 어구는 사용자 프로파일에 저장된 특정 단어 또는 어구(예컨대, "헤이, 소노스")일 수 있다. 일부 실시예에서, 미디어 재생 시스템은 등록된 사용자의 음성 명령과 연관되는 보편적인 깨우기 단어 또는 어구(예컨대, "헤이 소노소")를 수신할 수 있다. 추가적으로 또는 대안적으로, 미디어 재생 시스템은 등록된 손님 사용자의 음성 명령과 연관되는 보편적인 깨우기 단어 또는 어구를 수신할 수 있다. 일부 예시에서, 미디어 재생 시스템은 상이한 등록된 사용자에 대하여 상이한 깨우기 단어 또는 어구를 가지도록 구성될 수 있다.

특히, 등록된 사용자는 상이한 음성 명령에 대하여 상이한 사용자별 깨우기 단어 또는 어구를 가질 수 있다. 예를 들어, 미디어 재생 시스템은 재생 큐에 노래를 추가하기 위한 깨우기 단어 또는 어구(예컨대, "헤이 소노스, 노래를 큐에 넣자", "요, 소노스, 노래를 줄세워라", "알파 노래 큐" 등)를 수신할 수 있고, 집 안의 손님에게 미디어 재생 장치를 제어할 권한을 부여하기 위한 상이한 사용자별 깨우기 단어 또는 어구(예컨대, "헤이 소노스, 액세스를 개방하라", "파티 타임이다" 등)를 수신할 수 있다.

다음, 방법(1500)은 블록 1504로 진행하며, 이는 음성 명령과 연관되는 깨우기 단어가 미디어 재생 시스템의 등록된 사용자로부터 수신되었는지 여부를 결정하는 것을 포함한다. 일부 실시예에서, 음성 명령과 연관되는 깨우기 단어가 등록된 사용자로부터 수신되었는지 여부를 결정하는 것은 방법(1400)에 대하여 블록 1404에서 설명된 음성 명령이 등록된 사용자로부터 수신되었는지 여부를 결정하는 것과 유사할 수 있다.

마지막으로, 방법(1500)은 블록 1506으로 진행하며, 이는 음성 명령과 연간되는 깨우기 단어가 등록된 사용자로부터 수신되었다고 결정하는 것에 응답하여 수신된 깨우기 단어, 음성 명령으로부터의 콘텐트 및 등록된 사용자를 위한 사용자 프로파일 내 정보에 기초하여 미디어 재생 시스템을 위한 명령어를 구성하는 것을 포함한다.

일부 예시에서, 미디어 재생 시스템을 위한 명령어는 등록된 사용자, 손님 및/또는 등록되지 않은 사용자로부터 수신된 깨우기 단어와 연관되는 추가적인 음성 명령을 수신하기 위한 미디어 재생 시스템을 위한 기간 또는 시간대를 시작하기 위한 명령어를 포함할 수 있다. 예를 들어, 재생 큐에 노래를 추가하기 위한 깨우기 단어가 등록된 사용자로부터 수신되었다고 결정하는 것에 응답하여, 미디어 재생 시스템은 재생 큐에 특정 노래를 추가하기 위한 추가적인 음성 명령(예컨대, "마이클 잭슨에 의한 스릴러를 추가하라")을 전송하기 위한 등록된 사용자를 위한 기간(예컨대, 5분)을 시작할 수 있다.

다른 예시에서, 모든 손님에게 미디어 재생 시스템을 제어하기 위한 권한을 부여하기 위한 깨우기 단어가 등록된 사용자로부터 수신되었다고 결정하는 것에 응답하여, 미디어 재생 시스템은 집 안의 모든 손님이 사용자 정의된 또는 디폴트 기간 또는 시간대 동안 다른 기능 중에서도 재생 큐에 노래를 추가, 노래를 재생 또는 음량을 변경하기 위한 음성 명령을 전송하는 것을 허용하기 위한 기간(예컨대, 한 시간)을 시작할 수 있다.

다음, 방법(1500)은 블록 1506으로 진행하며, 이는 깨우기 단어가 등록된 사용자로부터 수신되었다고 결정하는 것에 응답하여, 수신된 깨우기 단어 또는 어구, 음성 명령으로부터의 콘텐트 및 등록된 사용자를 위한 사용자 프로파일 내 정보에 기초하여 깨우기 단어가 제한 설정에 연관되는지 여부를 결정하는 것을 포함한다.

일부 예시에서, 미디어 재생 시스템은 등록된 사용자 또는 등록된 손님 사용자를 위한 사용자 프로파일 내 제한 설정에 기초하여 명령어를 구성할 수 있다. 등록된 사용자로부터 수신된 깨우기 단어는 어떠한 손님에 대한 제한 설정에 연관될 수 있다. 예를 들어, 등록된 사용자 또는 주인은 기간 또는 시간대 동안 재생 구역에서 하나 이상의 PBD(532, 534, 536 및 538) 및/또는 컴퓨팅 장치(506)를 제어하기 위한 추가적인 음성 명령을 전송할 권한을 등록된 손님에게 부여하나 등록되지 않은 손님이 추가적인 음성 명령을 전송하는 것을 방지하는 음성 명령(예컨대, "헤이 소노스, 내 거실에 대한 제어를 권한 부여된 손님에게 제한하라")을 전송할 수 있다. 다른 예시에서, 수신된 깨우기 단어는 어린이를 위한 제한 설정과 연관될 수 있다. 여기 다른 곳에 설명된 예시를 포함하나 이에 제한되지 않는, 위와 유사하거나 상이한 많은 다른 예시가 가능하다.

추가적인 예시에서, 등록된 사용자로부터 수신된 깨우기 단어는 어떠한 손님이 기간 또는 시간대 동안 미디어 재생 시스템의 제한된 제어를 가지도록 허용하는 제한 설정과 연관될 수 있다. 여기에 참조로서 그 전체가 포함되는 미국 특허 공개 제2013/0346859호 "크라우드 소싱되는 재생 목록에 게스트 액세스를 제공하기 위한 시스템, 방법, 기기 및 제조 물품"은 미디어 재생 시스템의 제한된 제어에 대한 일부 예시를 더 상세히 제공한다.

깨우기 단어 또는 깨우기 어구가 손님 사용자로부터 수신되었다고 결정하는 것에 응답하여, 미디어 재생 시스템은 (i) 손님 사용자와 연관되는 제한 설정이 있는지 여부를 결정, (ii) 깨우기 단어 또는 어구 및 손님 사용자에 대하여 할당된 제한 설정에 기초하여 하나 이상의 PBD를 위한 명령어를 구성, 및 (iii) (예컨대, 깨우기 단어 명령과 연관되는 추가적인 음성 명령을 수신하기 위한 기간 또는 시간대를 시작하기 위해) 실행을 위하여 명령어를 하나 이상의 PBD로 전송할 수 있다.

일부 예시에서, 예컨대 미디어 재생 시스템이 이미 등록된 사용자 또는 주인으로부터 깨우기 단어 또는 어구와 음성 명령을 수신하였고 추가적인 명령을 수신하기 위한 기간 또는 시간대가 만료하지 않은 경우, 미디어 재생 장치는 하나 이상의 PBD(532, 534, 536 및 538) 및/또는 컴퓨팅 장치(506)를 통하여 등록된 손님 사용자로부터 깨우기 단어 또는 어구를 수신하는 것에 기초하여 액션을 취하는 것을 삼갈 수 있다.

미디어 재생 시스템을 위한 명령어를 구성한 후, 일부 예시는 명령어를 실행하기 위하여 미디어 재생 시스템의 하나 이상의 PBD로 명령을 전송하는 것을 수반할 수 있다. 일부 예시에서, 컴퓨팅 장치(506)는 미디어 재생 시스템의 하나 이상의 PBD로 명령 또는 명령의 집합을 전송할 수 있다.

일부 예시에서, 실행하기 위한 미디어 재생 시스템을 위한 명령어를 구성한 후, 등록된 사용자 또는 주인은 명령어와 연관되는 추가적인 음성 명령을 수신하기 위한 기간 또는 시간대를 닫거나 키오프 할 수 있다. 예를 들어, 등록된 사용자 또는 주인이 한 시간 동안 추가적인 음성 명령을 수신하기 위한 기간 또는 시간대를 시작하는 깨우기 단어 또는 어구로 음성 명령을 전송한 경우, 등록된 사용자 또는 주인은 한 시간 기간이 만료하기 전에 한 시간 기간 또는 시간대를 키오프 하기 위한 다른 음성 명령(예컨대, "헤이 소노스, 노래 큐를 끝내라")을 전송할 수 있다. 위와 유사하거나 상이한 많은 다른 예시가 가능하다.

추가적인 예시는 미디어 재생 시스템이 후속적으로 등록된 사용자 또는 주인으로부터 음성 명령을 수신하는 경우 미디어 재생 시스템이 등록된 손님 사용자로부터 깨우기 단어 또는 깨우기 어구를 수신하는 것에 기초하여 액션을 취하고 후속적으로 추가적인 음성 명령을 수신하기 위한 기간 또는 시간대를 닫거나 키오프 하는 것을 수반할 수 있다. 일부 실시예에서, 등록된 손님은 기간 또는 시간대가 만료하기 전에 닫거나 키오프 할 수 있다. 다른 실시예에서, 등록된 손님이 어린이인 경우 어른은 기간 또는 시간대가 만료하기 전에 닫거나 키오프 할 수 있다. 위와 유사하거나 상이한 많은 다른 예시가 가능하다.

VI. 음악 서비스 선택을 위한 예시적인 시스템, 기기 및 방법

여기에 설명되는 예시는 명령에 기초하여 적절한 스트리밍 서비스(예컨대, 오디오 트랙 스트리밍)를 식별 및 액세스하는 것에 관련된다.

도 16 및 17에 도시된 방법(1600 및 1700)은 예컨대 도 1의 미디어 재생 시스템(100), 도 2의 재생 장치(200) 중 하나 이상 및 도 3의 제어 장치(300) 중 하나 이상을 수반하는 동작 환경 내에서 구현될 수 있는 방법의 실시예를 제공한다. 방법(1600 및 1700)은 블록(1602-1614 및 1702-1708) 중 하나 이상에 의해 도시되는 하나 이상의 동작, 기능 또는 액션을 포함할 수 있다.

도 16은 스트리밍을 위한 음악 서비스를 식별하기 위한 프로세스에 관련되는 예시적인 흐름도이다. 1602에서, NMD(512-516) 또는 CR(522)은 스트리밍 서비스로부터 재생을 위해 제공될 오디오 콘텐트를 나타낼 수 있는 명령의 표시를 수신할 수 있다. 일부 예시에서, NMD(512-516)에 의해 수신되는 명령은 음성 명령의 형태를 취할 수 있고, CR(522)에 의해 수신되는 명령은 사용자 인터페이스 상의 텍스트 명령 입력일 수 있다.

통상적으로, 수신된 명령은 하나 이상의 오디오 콘텐트 유형에 관한 정보를 포함할 수 있다. 일부 경우에, 명령은 아티스트의 이름, 노래, 앨범 또는 장르를 포함할 수 있다(예컨대, "레드 제플린(Led Zeppelin)을 재생하라", "70년대 락을 재생하라"). 추가적으로, 명령은 콘텐트 유형을 더 나타낼 수 있는 접두사 및/또는 접미사 유형 정보(예컨대, "…의 베스트", "… 라디오", "… 재생 목록")를 포함할 수 있다. 예를 들어, 명령 "레드 제플린 라디오를 재생하라"는 라디오 포맷으로 특정 아티스트의 음악을 청취하고자 하는 사용자의 희망을 나타낼 수 있다. 수신된 명령은 또한 콘텐트 유형을 나타내는 다양한 다른 형태의 정보를 포함할 수 있다.

1602에서 수신된 명령의 표시는 다양한 방식으로 처리될 수 있다. 일 구현예에서, 명령의 처리는 클라우드 네트워크(502)를 통하여 이루어질 수 있다. 그러한 경우, NMD(512-516)에 의해 수신된 음성 명령은 음성 입력이 처리를 위하여 통신 네트워크(546)를 통하여 컴퓨팅 장치(504-508) 중 하나 이상으로 송신되도록 할 수 있다. 클라우드 컴퓨팅 장치는 음성 입력을 상당하는 텍스트 명령으로 변환하고 텍스트 명령을 파싱하여 명령을 식별할 수 있다. 다른 구성에서, 클라우드 컴퓨팅 장치는 음성 입력을 상당하는 텍스트 포맷으로 변환만 할 수 있고 파싱 및 명령 식별을 위하여 상당하는 텍스트를 제2의 컴퓨팅 장치로 전송할 수 있다. 다른 예시에서, NMD(512-516)는 통신 네트워크(546)를 통한 송신 전에 음성 입력을 텍스트로 변환할 수 있거나 음성 입력을 텍스트로 변환하고 파싱을 수행하여 명령을 식별할 수 있다. CR(522)이 텍스트 명령을 수신하는 경우, 텍스트 입력은 파싱 및 명령 식별을 위하여 통신 네트워크(546)를 통하여 컴퓨팅 장치(504-508) 중 하나로 송신될 수 있다. 다른 예시에서, CR(522)은 텍스트 입력의 파싱을 수행하여 명령을 식별할 수 있다.

다른 구현예에서, 명령의 처리는 로컬 네트워크 상에서 로컬로 이루어질 수 있다. 그러한 경우에, NMD(512-516)에 의해 수신되는 음성 명령은 음성 입력이 처리를 위하여 로컬 네트워크를 통하여 하나 이상의 로컬 컴퓨팅 장치로 송신되도록 할 수 있다. 로컬 컴퓨팅 장치는 음성 입력을 상당하는 텍스트 명령으로 변환하고 텍스트 명령을 파싱하여 명령을 식별할 수 있다. 다른 구성에서, 로컬 컴퓨팅 장치는 음성 입력을 상당하는 텍스트 포맷으로 변환만 할 수 있고 파싱 및 명령 식별을 위하여 상당하는 텍스트 포맷을 제2의 로컬 컴퓨팅 장치로 전송할 수 있다. 다른 예시에서, NMD(512-516)는 로컬 네트워크를 통한 송신 전에 음성 입력을 텍스트로 변환할 수 있거나 음성 입력을 텍스트로 변환하고 파싱을 수행하여 명령을 식별할 수 있다. CR(522)이 텍스트 명령을 수신하는 경우, 텍스트 입력은 파싱 및 명령 식별을 위하여 로컬 네트워크를 통하여 로컬 컴퓨팅 장치로 송신될 수 있다. 다른 예시에서, CR(522)은 텍스트 입력의 파싱을 수행하여 명령을 식별할 수 있다. 명령을 처리하기 위한 다른 구성이 존재할 수 있다.

1604에서, 컴퓨팅 장치는 명령에 의해 표시되는 콘텐트 유형을 식별할 수 있다. 콘텐트 유형의 식별은 클라우드 네트워크(502)를 통하여 또는 로컬 네트워크 상에서 로컬로 이루어질 수 있다.

일 구현예에서, 컴퓨팅 장치는 콘텐트 유형 로직을 사용하여 명령 또는 명령의 일부를 콘텐트 유형에 관련시킬 수 있다. 위에서 언급한 "레드 제플린 라디오를 재생하라"의 예시를 사용하면, 컴퓨팅 장치는 "아티스트/라디오 방송"으로 콘텐트 유형을 식별할 수 있다. 다른 예시에서, 명령 "일렉트로닉 댄스 음악을 재생하라"는 콘텐트 유형이 "장르"로서 식별되도록 할 수 있다. 다양한 다른 콘텐트 유형에 대하여 유사한 식별이 이루어질 수 있다. 콘텐트 유형의 식별은 "댄스 음악"과 같은 명령의 키워드를 입력하는 것을 통하여 인스턴스에 대해 이루어질 수 있고 데이터베이스는 키워드를 장르와 같은 콘텐트 유형에 대한 표시로 맵핑할 수 있다. 일부 예시에서, 데이터베이스는 컴퓨팅 장치 상에 또는 네트워크 마이크로폰 장치 상에 있을 수 있다.

1608에서 어떠한 콘텐트 유형도 식별되지 않는 것으로 결정되는 경우, 방법은 1614로 직접 진행할 수 있다. 콘텐트 유형은 사용자 입력 에러, 나쁜 음성 입력 품질, 배경 잡음, 또는 단순히 그러한 콘텐트 유형이 알려지지 않음을 포함하는 다수의 이유로 식별 불가능할 수 있다. 예를 들어, 잘 알려져 있지 않은 아티스트 이름을 나타내는 명령의 콘텐트 유형은 식별될 수 없을 수 있다.

1614에서, "콘텐트가 이용 불가능하다"고 나타내는 표시가 컴퓨팅 장치에 의해 출력되고 통신 네트워크(546)를 통하여 NMD(512-516), PBD(532-538) 또는 CR(522) 중 임의의 것 또는 모두로 송신될 수 있다. 어떠한 콘텐트도 이용가능하지 않다는 표시는 이후 사용자에게 청각적 또는 시각적으로 제공될 수 있다. 예를 들어, NMD와 PBD는 청각적 표시를 출력할 수 있는 한편 CR은 청각적 및 시각적 표시를 모두 출력할 수 있다. 추가적으로 또는 대안적으로, 전송된 표시는 사용자가 명령을 재입력하도록 지시하는 제안이 사용자에게 출력되도록 할 수 있다. 예를 들어, 제안은 콘텐트 유형을 식별하는 것을 돕기 위하여 사용자가 일부 추가적은 식별 특징을 특정하도록 하는 것일 수 있다.

그러나, 1606에서 콘텐트 유형이 식별되었다고 결정되는 경우, 방법은 1608로 진행하여 1604에서 식별된 콘텐트 유형을 재생할 수 있는 스트리밍 서비스를 식별할 수 있다. 일반적으로, 특정 스트리밍 서비스는 무슨 오디오 콘텐트를 그들이 제공하는가 뿐만 아니라 그들이 콘텐트를 어떻게 제공하는가에서도 다른 스트리밍 서비스와 크게 다를 수 있다. 예를 들어, 각각의 스트리밍 서비스는 어떠한 아티스트 또는 앨범의 음악 콘텐트를 스트리밍하기 위하여 상대적으로 독점적인 권리를 소유할 수 있다. 다른 예시에서, 판도라®와 같은 일부 스트리밍 서비스는 라디오 방송 포맷으로만 스트리밍할 수 있는 한편, 스포티파이® 같은 다른 것은 아티스트, 노래, 앨범 또는 라디오 방송에 의한 요구에 따라 음악을 스트리밍할 수 있다. 이러한 사실의 관점에서, 모든 스트리밍 서비스가 704에서 식별된 콘텐트 유형을 스트리밍할 수 있는 것은 아니라는 점이 분명하다.

일 예시에서, 컴퓨팅 장치는 식별된 콘텐트 유형의 메타데이터를 이용 가능한 콘텐트에 대한 엔트리와 다양한 스트리밍 서비스에 대하여 콘텐트가 어떠한 포맷으로 제공될 수 있는지를 포함할 수 있는 순람표(look-up table)와 비교함으로써 적절한 스트리밍 서비스를 식별할 수 있다. 일부 경우에, 컴퓨팅 장치는 이용 가능한 스트리밍 서비스 전체에 쿼리를 보낼 수 있다. 다른 경우세, 컴퓨팅 장치는 이용 가능한 스트리밍 서비스의 부분집합에만 쿼리할 수 있다. 그러한 부분집합은 다른 것들 중에서도 사용자가 등록된 스트리밍 서비스, 사용자가 스트리밍 서비스를 가장 나중에 사용한 때로부터의 일수, 스트리밍 서비스 인기도, 사용자 설정을 포함하는 다수의 요인 하나 또는 조합에 기초하여 컴퓨팅 장치에 의해 선택될 수 있다. 예를 들어, 사용자가 판도라®, 스포티파이® 및 디저(Deezer)®에만 등록한 경우, 컴퓨팅 장치는 무엇이 적절한지 결정하기 위해 그 스트리밍 서비스에만 쿼리할 수 있다.

그러한 순람표는 컴퓨팅 장치 상의 메모리 또는 음악 서비스 또는 컴퓨팅 장치와 같은 외부 위치에 저장될 수 있다. 다양한 순람표가 다양한 음악 서비스 사이에 분산될 수 있다는 점을 고려하면, 컴퓨팅 장치는 매치를 찾기 위해 각각의 음악 서비스에 동시에 또는 순차적으로 쿼리할 수 있다. 적절한 스트리밍 서비스를 식별하는 다른 방식이 가능하다.

일 구현예에서, 1608에서의 스트리밍 서비스의 식별은 사용자가 등록된 스트리밍 서비스의 현재 이용 가능한 재생 용량(capacity)을 결정하는 것을 더 수반할 수 있다. 일반적으로, 일부 스트리밍 서비스는 임의의 소정의 시각에 등록된 계정에 대하여 이용 가능한 액티브 스트림의 수를 제한할 수 있다. 예를 들어, 스포티파이®는 등록된 계정 당 단일 액티브 스트림만을 허용할 수 있다. 일 예시에서, 컴퓨팅 장치는 사용 상태(즉, 얼마나 많은 액티브 스트림)에 대하여 사용자가 등록된 서비스에 쿼리하고 사용 상태를 용량 제한 데이터(즉, 스포티파이 = 1 액티브 스트림만)에 비교함으로써 현재 이용 가능한 재생 용량을 결정할 수 있다. 다른 예시에서, 스트리밍 서비스는 스트림이 이용 가능한지 아닌지 여부를 나타내기 위한 쿼리에 대한 응답으로 이진 값을 출력할 수 있다. 이용 가능한 재생 용량은 다른 방식으로 결정될 수 있다.

이러한 구현예에서, 컴퓨팅 장치는 1608에서 명령에 의해 표시되는 콘텐트 유형을 지원하는 것으로서 등록된 서비스를 식별하고 등록된 서비스가 이용 가능한 스트림을 가지지 않는다고 더 결정할 수 있다. 예를 들어, 사용자와 그 배우자가 스포티파이® 계정을 공유하고 사용자가 명령 "호랑이의 눈(Eye of the Tiger)을 재생하라"를 발행한 때에 체육관에서 배우자의 스마트폰 장치로 음악이 스트리밍되고 있는 경우, 컴퓨팅 장치는 스포티파이®가 노래를 재생할 수 있는 것으로 식별하며 또한 스트림이 이용 가능하지 않다고 식별할 수 있다. 그러한 경우는 컴퓨팅 장치가 애플 뮤직®과 같은 콘텐트 유형을 지원할 수 있는 다른 스트리밍 서비스를 식별하도록 할 수 있다.

다른 예시에서, 컴퓨팅 장치는 콘텐트 유형을 지원할 수 있는 다른 스트리밍 서비스를 식별할 수 없을 수 있다. 이는 다른 예시 중에서도 예컨대 사용자가 단일 스트리밍 서비스에 의해서만 제공되는 콘텐트를 요청하는 경우 컴퓨팅 장치가 스트리밍 서비스의 부분집합만 고려하는 경우 일어날 수 있다. 그러한 경우에, 컴퓨팅 장치는 명령에 대응하는 콘텐트를 제공하는 데에 있어서 현재 액티브 스트림이 사용 "도난"되게 할 수 있다. 앞서 언급한 예시를 사용하면, "호랑이의 눈"을 지원할 수 있는 다른 스트리밍 서비스가 없는 경우, 체육관에서의 배우자에 대한 스트림은 취소되고 사용자에게 제공될 수 있다.

일 예시에서, 이용 가능한 스트리밍 서비스가 1610에서 식별된 콘텐트 유형을 지원할 수 있는 것으로 식별되는 경우, 프로세스는 1614로 진행하여 PBD(532-538) 중 임의의 조합이 오디오 콘텐트를 재생하도록 할 수 있다. 일 예시에서, 콘텐트를 위한 서비스 API를 쿼리하고 콘텐트가 스트리밍되게 함으로써 음악 서비스가 액세스될 수 있다. 오디오 콘텐트는 PBD(532-538) 또는 컴퓨팅 장치(504-506)로부터의 요청 후에 컴퓨팅 장치(508)로부터 직접 또는 스트리밍 음악 서비스와 연관되는 다양한 다른 컴퓨팅 장치로부터 직접 PBD(532-538)로 스트리밍될 수 있다. 스트리밍 미디어 콘텐트의 재생을 시작하고 야기하는 다른 방식 또한 존재한다.

다른 예시에서, 710에서 식별된 스트리밍 서비스가 현재 이용 가능하지 않은 경우(즉, 애플리케이션이 설치되지 않음, 사용자가 등록되지 않음), 컴퓨팅 장치는 714에서 사용될 음악 서비스를 가능하게 하기 위한 제안적인 방침에 관한 표시의 출력을 야기할 수 있다. 표시는 NMD(512-516), PBD(532-538) 또는 CR(522)의 임의의 조합으로 전송될 수 있고 콘텐트 유형을 지원할 수 있는 식별된 음악 서비스를 나타내는 청각적 및/또는 시각적 제안을 야기 및/또는 음악 서비스를 어떻게 가입, 다운로드 또는 이용하는지에 대한 지시를 제공할 수 있다.

도 17은 도 16의 블록 1610 및 1612에서 스트리밍 음악 서비스를 식별하기 위한 예시적인 프로세스에 관련되는 다른 예시적인 흐름도이다. 1702에서, 컴퓨팅 장치는 명령에 의해 식별된 콘텐트 유형에 적어도 부분적으로 기초하여 스트리밍 서비스에 대해 신뢰 메트릭이 결정되도록 할 수 있다. 일반적으로, 신뢰 메트릭은 스트리밍 서비스 또는 서비스들에 대하여 계산되는 수치 또는 백분율 값(예컨대, 1-100)일 수 있다. 그러한 신뢰 메트릭은 스트리밍 오디오를 제공하기 위한 특정 음악 서비스의 선택이 사용자가 희망하는 콘텐트를 사용자에게 제공할 가능성을 반영할 수 있다. 예를 들어, 80의 신뢰 메트릭이 할당된 스트리밍 서비스는 45의 신뢰 메트릭을 가지는 스트리밍 서비스보다 콘텐트 제공에 더 적합할 수 있으며, 여기서 더 높은 숫자는 더 높은 적합성의 신뢰 수준을 가리킨다.

스트리밍 서비스에 대한 계산된 신뢰 메트릭은 다른 것들 중에서도 콘텐트 유형, 재생 용량, 사용 이력, 외부 데이터와 같은 수 기준에 기초할 수 있다. 그러한 기준은 다양한 데이터 유형에 의해 구성될 수 있고, NMD, CR, PBD, 컴퓨팅 장치, 음악 서비스 및 다양한 외부 소스와 같은 다양한 소스로부터 검색될 수 있다. 데이터는 컴퓨팅 장치(504 또는 506)와 연관되는 데이터베이스와 같은 중앙 위치에 또는 분산된 방식으로 결집 및 저장될 수 있다.

일 예시에서, 신뢰 메트릭은 명령에 의해 표시되는 콘텐트 유형을 지원하기 위한 스트리밍 서비스의 적합성을 고려할 수 있다. 콘텐트 유형을 제공하기 위한 다양한 스트리밍 서비스의 적합성을 결정하는 것은 식별된 콘텐트 유형에 관련되는 메타데이터를 순람표에 맵핑하는 것 또는 다양한 음악 서비스의 표를 쿼리하는 것 및 매칭하는 다수의 필드에 값을 할당하는 것을 수반할 수 있다. 예시로서, "잭슨 파이브(Jackson 5) 재생 목록을 재생하라"고 특정하는 명령은 "아티스트/재생 목록" 콘텐트 유형을 가질 수 있다. 그러한 경우, 판도라®와 스포티파이® 같은 두 스트리밍 서비스의 순람표는 둘 다 아티스트 필드에 잭슨 파이브에 대한 참조를 포함할 수 있다. 그러나, 판도라®는 콘텐트 유형 재생 목록을 지원하지 않으므로, 스포티파이®만 잭슨 파이브를 식별하는 재생 목록 필드를 포함할 수 있다. 그러한 경우, 판도라®는 2의 콘텐트 유형 값이 주어질 수 있고 스포티파이®는 1의 값이 주어질 수 있다.

추가적으로 또는 대안적으로, 필드 매칭의 강도가 이용될 수 있다. 앞서 언급된 예시를 사용하고 스포티파이® 서비스가 잭슨 파이브에 대응하는 아티스트 필드를 포함하지 않으나 잭슨 파이브의 이전 멤버였던 것으로 음악 메타데이터를 이용하는 컴퓨팅 장치에 의해 식별될 수 있는 마이클 잭슨에 대한 아티스트 엔트리를 가진다고 가정한다. 그러한 경우, 스포티파이® 서비스는 아티스트 필드에 대해 0의 값이 주어지지 않을 수 있고 서비스에 1보다 작은 조정된 값이 주어질 수 있다. 스트리밍 서비스 콘텐트 유형 적합성 값을 결정하는 다른 형태가 가능하다.

다른 예시에서, 신뢰 메트릭은 다양한 형태의 이력 사용 데이터에 부분적으로 기초하여 계산될 수 있다. 다양한 이력 데이터 유형은 NMD, CR, PBD, 컴퓨팅 장치, 음악 서비스 및 다양한 외부 소스와 같은 다양한 소스로부터 검색될 수 있다. 데이터는 컴퓨팅 장치(504 또는 506)와 연관되는 데이터베이스와 같은 중앙 위치에 또는 분산된 방식으로 결집 및 저장될 수 있다.

예를 들어, 사용 데이터는 사용자가 얼마나 자주 소정의 스트리밍 서비스를 액세스하는지 나타낼 수 있다. 다른 예시로서, 사용 데이터는 사용자가 보통 하루 중 다양한 시간, 일주일 중 다양한 날, 일년 중 다양한 월에 사용하는 서비스를 식별하기 위한 시간 기반 데이터를 포함할 수 있다. 예를 들어, 사용자는 아침에 아이허트라디오(iHeartRadio)® 및 저녁에 타이달(Tidal)®을 청취하는 것을 선호할 수 있다. 다른 예시로서, 다중 구역 환경에서 그러한 사용 데이터는 구역 별 스트리밍 서비스에 관한 사용자 선호도를 나타낼 수 있다. 예를 들어, 사용자가 통상 욕실 구역에서 시간의 90%를 스포티파이®를 액세스하고 거실 구역에서 시간의 80%를 디저®를 액세스하는 경우, 스포티파이®와 디저®에 대응하는 신뢰 메트릭은 어느 구역으로 사용자가 오디오를 스트리밍하기를 의도하는지에 따라 크게 변할 수 있다. 그러한 경우, 사용자가 욕실에서 음악을 청취하기를 희망하는 경우, 스포티파이®가 훨씬 나은 선택일 것이다. 다양한 다른 유형의 이력 사용 데이터가 또한 존재할 수 있다.

추가적으로, 신뢰 메트릭은 다양한 "외부" 데이터 유형에 부분적으로 기초하여 결정될 수 있다. 그러한 데이터는 다른 가능성 중에서도 지리적 위치 또는 인구 데이터를 고려할 수 있는 매크로(macro) 유형 데이터를 포함할 수 있다. 예를 들어, 그러한 매크로 데이터는 특정 스트리밍 서비스가 세계의 어떤 지역 또는 나라의 소지역에서 이용 가능하지 않거나 인기가 없다고 나타낼 수 있고, 그 결과 더 낮은 신뢰 메트릭이 될 수 있다. 그러한 경우, 그 스트리밍 서비스에 대한 신뢰 메트릭은 지리적 위치에 따라 변할 수 있다. "외부" 데이터의 유형은 날씨 데이터를 더 포함할 수 있고, 이는 예컨대 시원하고 건조한 여름 저녁에 파티오에서 스포티파이®를 청취하고자 하는 사용자의 선호도가 고려될 수 있다. 추가적으로, 달력 데이터가 휴일과 그러한 날에 통상적으로 스트리밍되는 음악 서비스를 식별하도록 고려될 수 있다. 다른 유형의 외부 데이터가 존재할 수 있다.

또한, 소정의 스트리밍 서비스에 대한 신뢰 메트릭을 결정하기 위해 다양한 기준을 조합하는 것이 가능하다. 예를 들어, 사용자는 판도라®를 사용하여 거실에서 다양한 클래식 음악을 청취하는 것을 선호할 수 있으나 애플 뮤직®만을 사용하여 침실에서 가장 좋아하는 아티스트의 앨범 전체를 청취할 수 있다. 그러한 경우, 콘텐트 유형(장르, 아티스트)은 특정 음악 서비스의 사용 위치에 관련하는 사용자 이력과 조합되어 특정 음악 서비스에 대한 신뢰 메트릭을 결정할 수 있다. 다양한 다른 조합이 존재할 수 있다.

컴퓨터 구현 알고리즘은 위에서 설명된 기준을 스트리밍 서비스에 대한 신뢰 메트릭에 맵핑할 수 있다. 예를 들어, 하나 이상의 기준이 신뢰 메트릭을 출력하는 표로 맵핑될 수 있다. 일부 실시예에서, 알고리즘은 콘텐트 유형, 사용 이력 및/또는 "외부 데이터"와 같은 다양한 기준에 가중치를 주는 것을 수반할 수 있다. 알고리즘은 상대적인 중요도에 기초하여 다양한 기준에 상이한 가중치를 할당할 수 있다. 예를 들어, 사용자 선호도는 지리적 데이터보다 더 영향력이 큰 것으로 간주될 수 있고 더 큰 가중치가 주어질 수 있다. 입력에 가중치를 주는 것은 시스템에 의해, 사용자 설정에 의해 정의되거나 사용자 피드백에 기초하여 동적으로 조정될 수 있다. 가중치가 주어진 입력 각각은 예컨대 신뢰 메트릭으로의 맵핑을 위해 표에 입력될 수 있으며, 이는 이후 조합되어 전체로서 음악 서비스에 대한 결집된 신뢰 메트릭을 형성할 수 있다.

1704에서, 컴퓨팅 장치(504 또는 506)는 소정의 스트리밍 서비스가 신뢰 조건을 만족하는지 여부를 결정할 수 있다. 신뢰 조건은 다수의 방식으로 만족될 수 있다. 일 예시에서, 신뢰 조건은 소정의 스트리밍 서비스에 대한 신뢰 메트릭이 신뢰 수준 문턱값을 초과하는 경우 만족될 수 있으며, 이는 디폴트 시스템 설정 또는 사용자에 의해 조정 가능할 수 있다. 예를 들어, 문턱 신뢰 수준이 80으로 서비스 1 = 85, 서비스 2 = 83, 서비스 3 = 25로서 세 개의 신뢰 메트릭이 계산되는 경우, (1614를 참조하여 위에서 논의된 바와 같이) 1706에서 서비스 1이 스트리밍을 위해 출력되거나 사용자에게 제안될 수 있다.

다른 예시에서, 신뢰 조건은 (1) 계산된 신뢰 메트릭이 문턱 신뢰 수준 위인 스트리밍 서비스 및 (2) 두 개의 가장 높은 계산된 신뢰 메트릭이 서로의 문턱 범위 내가 아닌 경우에만 만족될 수 있다. 예를 들어, 바로 위에 언급된 경우에서 신뢰 수준 범위가 3인 경우 서비스 1과 서비스 2의 신뢰 메트릭 때문에 신뢰 조건이 만족되지 않을 것이다. 신뢰 조건은 추가적으로 또는 대안적으로 다양한 다른 규칙을 포함할 수 있다.

1708에서 신뢰 조건이 만족되지 않는 것으로 여겨지는 경우 컴퓨팅 장치(504 또는 506)에 의해 에러 상태가 트리거될 수 있다. 에러 상태는 1616을 참조하여 논의된 바와 같이 콘텐트가 이용 가능하지 않다는 표시를 출력하는 것과 같은 어떠한 이벤트가 야기되도록 트리거할 수 있다. 다른 예시에서, 트리거된 에러 상태는 디폴트 스트리밍 서비스 또는 선호되는 파트너 서비스를 통하여 콘텐트가 스트리밍되게 할 수 있다. 또 다른 예시에서, 에러 상태는 이미 수신된 명령에 관한 정보를 더 획득하기 위해 명령어 또는 쿼리의 청각적 또는 시각적 제공을 야기하도록 하는 표시를 컴퓨팅 장치가 NMD(512-516), PBD(532-538) 또는 CR(522) 중 하나 또는 전부에 출력하도록 할 수 있다.

일 예시에서 사용자는 아티스트 또는 앨범과 같은 추가적인 콘텐트 유형을 제공하도록 지시될 수 있다. 예를 들어, 처음 명령이 "라디오 방송을 재생하라"였던 경우, 사용자는 "장르를 제공해 주세요"라고 지시될 수 있다.

다른 예시에서, 사용자는 처음 명령과 그에 따르는 다양한 스트리밍 서비스에 대한 신뢰 메트릭을 더 조율하는 것을 도울 수 있는 질문 또는 일련의 질문을 받을 수 있다. 예를 들어, 처음 명령이 "전자(Electronic)"의 넓은 장르에 관한 것이었던 경우, 사용자는 "드럼 앤 베이스(Drum and Bass)"나 "트랜스(Trance)"와 같은 어떠한 하위 장르를 선호하는지 여부에 관해 질문 받을 수 있다. 추가적으로 또는 대안적으로, 사용자는 사용자가 청취하기 원할 수 있는 하위 장르를 유추하기 위해 "무엇을 하고 있는지" 또는 "상태가 어떠한지"와 같은 음악에 관련되지 않은 질문을 받을 수 있다. 예를 들어, 사용자가 위에 언급한 질문에 대하여 "독서" 및/또는 "느긋하다"고 대답한 경우, 사용자가 하위 장르 트랜스에 관심이 있다고 유추될 수 있다. 쿼리의 다양한 다른 예시가 가능하다.

지시 또는 질문에 대한 사용자 응답은 NMD에 의해 수신될 수 있는 음성 입력 또는 CR의 그래픽 인터페이스를 통한 텍스트 입력의 형태를 취할 수 있다. 사용자 응답은 프로세스(1600)가 반복되도록 할 수 있고, 그 결과 신뢰 조건이 만족되거나 추가적인 에러 상태가 트리거될 수 있다.

VII. 추가적인 예시 특징

(특징 1) 적어도 하나의 재생 장치 및 마이크로폰 장치를 포함하는 네트워크 장치를 포함하는 재생 시스템을 위한 방법으로서, 재생 장치가 위치되는 환경의 어쿠스틱스를 획득함, 재생 장치의 환경에서 네트워크 마이크로폰 장치를 식별함, 어쿠스틱스를 네트워크 마이크로폰 장치에 제공함, 네트워크 마이크로폰 장치에 의해 수신된 음성 입력에 어쿠스틱스를 네트워크 마이크로폰 장치에 의해 적용함을 포함함.

(특징 2) 특징 1의 방법으로서, 재생 장치에 의해 환경에서 재생되고 있는 오디오 콘텐트를 네트워크 마이크로폰 장치에 제공함, 네트워크 마이크로폰 장치에 의해 수신되는 음성 입력에 제공된 오디오 콘텐트를 마이크로폰 장치에 의해 적용함을 더 포함함.

(특징 3) 특징 1 또는 2의 방법으로서, 식별된 네트워크 마이크로폰 장치는 재생 장치에 결합되거나 재생 장치와 동일 구역 내의 것 중 적어도 하나임.

(특징 4) 임의의 위의 특징의 방법으로서, 마이크로폰 장치에 어쿠스틱스를 전송하는 재생 장치는 마이크로폰 장치에 가장 가까운 미디어 재생 시스템 내 복수의 재생 장치 중의 재생 장치임.

(특징 5) 임의의 위의 특징의 방법으로서, 음성 입력의 방향의 표시를 네트워크 마이크로폰 장치로부터 수신함, 및 수신된 음성 입력의 방향의 표시에 기초하여 재생 장치에 의해 재생되는 오디오 콘텐트의 방향성을 조정함을 더 포함함.

(특징 6) 임의의 위의 특징의 방법으로서, 네트워크 마이크로폰 장치에 의해 수신된 음성 입력에 네트워크 마이크로폰 장치가 어쿠스틱스를 적용하도록 하는 것은 재생 장치가 수신된 음성 입력에 어쿠스틱스에 기초하여 필터를 적용하도록 하는 것을 포함함.

(특징 7) 임의의 위의 특징의 방법으로서, 환경의 어쿠스틱스는 하나 이상의 재생 장치가 하나 이상의 톤을 출력하고, 네트워크 장치의 마이크로폰이 하나 이상의 재생 장치에 의해 출력된 톤을 수신하고, 수신된 톤이 분석되어 환경의 어쿠스틱스를 결정하는 교정 단계에서 획득됨.

(특징 8) 임의의 위의 특징의 방법으로서, 마이크로폰 장치에 어쿠스틱스를 제공하는 것은 어쿠스틱스를 메시지로서 마이크로폰 장치에 전송하는 것 및 마이크로폰 장치에 어쿠스틱스에 대한 액세스를 제공하는 것 중 하나를 포함함.

(특징 9) 프로세서에 의한 실행을 위한 명령어를 포함하는 컴퓨터 판독 가능 저장 매체로서, 명령어는 실행되는 경우 프로세서가 임의의 위의 특징에 따른 방법을 구현하도록 함.

(특징 10) 적어도 하나의 재생 장치 및 마이크로폰 장치를 포함하는 네트워크 장치를 포함하는 미디어 재생 시스템으로서, 미디어 재생 시스템은 임의의 위의 특징의 방법을 수행하도록 구성됨.

(특징 11) 컴퓨팅 장치를 위한 방법으로서, 명령 단어, 하나 이상의 미디어 변수 인스턴스 및 하나 이상의 구역 변수 인스턴스를 포함하는 음성 입력을 수신하는 것, 명령 단어에 대응하는 미디어 재생 시스템 명령을 결정하는 것, 하나 이상의 미디어 변수 인스턴스에 대응하는 미디어 콘텐트를 식별하는 것, 및 미디어 재생 시스템이 하나 이상의 구역 변수 인스턴스에 기초하여 미디어 콘텐트에 대하여 미디어 재생 시스템 명령을 실행하도록 하는 것을 포함함.

(특징 12) 특징 11의 방법으로서, 미디어 재생 시스템 명령이 명령 단어에 대응한다고 결정하기 전에 음성 입력이 음악 제어에 대응한다고 결정하는 것을 더 포함하고, 명령 단어에 대응하는 미디어 재생 시스템 명령은 음악 제어에 대응하는 이용 가능한 명령에 기초하여 결정됨.

(특징 13) 특징 11 또는 12의 방법으로서, 식별된 미디어 콘텐트로부터 하나 이상의 미디어 항목을 결정하는 것, 및 하나 이상의 미디어 항목의 네트워크 저장 위치를 나타내는 식별자를 송신하는 것을 더 포함함.

(특징 14) 임의의 위의 특징 11 내지 13의 방법으로서, 제1 장소에 있는 명령 단어에 기초하여 음성 입력에서 명령 단어를 식별하는 것, 제2 장소에 있는 하나 이상의 미디어 변수 인스턴스에 기초하여 음성 입력에서 하나 이상의 미디어 변수 인스턴스를 식별하는 것, 및 제3 장소에 있는 하나 이상의 구역 변수 인스턴스에 기초하여 음성 입력에서 하나 이상의 구역 변수 인스턴스를 식별하는 것을 더 포함함.

(특징 15) 임의의 위의 특징 11 내지 14의 방법으로서, 명령 단어에 대응하는 미디어 재생 시스템 명령을 결정하는 것은 명령 단어에 대응하는 의도를 결정하는 것, 및 의도에 대응하는 미디어 재생 시스템 명령을 결정하는 것을 포함함.

(특징 16) 임의의 위의 특징 11 내지 15의 방법으로서, 수신된 음성 입력의 하나 이상의 구역 변수 인스턴스는 미디어 재생 시스템의 하나 이상의 구역을 나타내고, 하나 이상의 구역은 하나 이상의 재생 장치를 포함함.

(특징 17) 임의의 위의 특징 11 내지 16의 방법으로서, 미디어 재생 시스템이 미디어 콘텐트 상에 미디어 재생 시스템 명령을 실행하도록 하는 것은 컴퓨팅 장치로부터 미디어 재생 시스템으로 미디어 재생 시스템 명령, 하나 이상의 미디어 변수 인스턴스에 대응하는 미디어 콘텐트를 식별하는 미디어 정보 및 하나 이상의 구역 변수 인스턴스에 대응하는 하나 이상의 구역 식별자를 식별하는 명령 정보를 포함하는 메시지를 송신하는 것을 포함함.

(특징 18) 컴퓨팅 장치의 하나 이상의 프로세서에 의해 실행되는 경우 컴퓨팅 장치가 임의의 위의 특징 11 내지 17의 방법을 수행하도록 하는 명령어를 저장하는 유형의 비일시적인 컴퓨터 판독 가능 매체.

(특징 19) 하나 이상의 프로세서, 하나 이상의 프로세서에 의해 실행되는 경우 컴퓨팅 장치가 특징 11 내지 17 중 하나의 방법을 수행하도록 하는 명령어를 저장하는 메모리를 포함하는 컴퓨팅 장치.

(특징 20) 방법으로서, 미디어 재생 시스템을 위한 음성 명령을 수신하는 것, 음성 명령이 미디어 재생 시스템의 등록된 사용자로부터 수신되었는지 여부를 결정하는 것, 및 음성 명령이 등록된 사용자로부터 수신된 경우 음성 명령으로부터의 콘텐트 및 등록된 사용자에 대한 사용자 프로파일 내 정보에 기초하여 미디어 재생 시스템을 위한 명령어를 구성하는 것을 포함함.

(특징 21) 특징 20의 방법으로서, 명령어를 미디어 재생 시스템의 하나 이상의 재생 장치로 전송하는 것을 더 포함함.

(특징 23) 특징 21 또는 22의 방법으로서, 음성 명령은 미디어 콘텐트를 재생하기 위한 미디어 재생 시스템을 위한 명령임.

(특징 24) 특징 23의 방법으로서, 구성된 명령어는 미디어 재생 시스템이 등록된 사용자의 선호되는 미디어 소스로부터 미디어 콘텐트를 획득하도록 지시함.

(특징 25) 특징 23의 방법으로서, 구성된 명령어는 미디어 재생 시스템이 미디어 재생 시스템의 하나 이상의 미디어 재생 장치를 통하여 미디어 콘텐트를 재생하도록 함.

(특징 26) 특징 23의 방법으로서, 구성된 명령어는 등록된 사용자의 선호되는 재생 설정 중 하나 이상으로 미디어 재생 시스템을 구성하기 위한 명령어, 및 미디어 재생 시스템이 등록된 사용자의 선호되는 재생 설정으로 미디어 재생 시스템을 통하여 미디어 콘텐트를 재생하도록 하기 위한 명령어를 포함함.

(특징 27) 특징 26의 방법으로서, 등록된 사용자의 선호되는 재생 설정은 선호되는 재생 음량 및 선호되는 오디오 이퀄라이제이션 설정 중 하나 이상을 포함함.

(특징 28) 특징 21 또는 22의 방법으로서, 음성 명령은 미디어 재생 시스템이 재생 설정을 변경하기 위한 명령이고, 구성된 명령어는 미디어 재생 시스템이 미디어 재생 시스템의 하나 이상의 미디어 재생 장치를 위한 재생 설정을 변경하도록 함.

(특징 29) 임의의 위의 특징 20 내지 28의 방법으로서, 음성 명령이 등록된 사용자로부터 수신되지 않은 경우 음성 명령이 손님 사용자로부터 수신되었는지 여부를 결정하는 것, 음성 명령이 손님 사용자로부터 수신된 경우 손님 사용자에 대하여 제한 설정을 할당하는 것, 음성 명령으로부터의 콘텐트 및 손님 사용자에 대한 할당된 제한 설정에 기초하여 미디어 재생 시스템을 위한 명령어를 구성하는 것, 및 명령어를 미디어 재생 시스템에 전송하는 것을 더 포함함.

(특징 30) 임의의 위의 특징 20 내지 29의 방법으로서, 미디어 재생 시스템은 재생 네트워크 및 하나 이상의 재생 장치를 포함함.

(특징 31) 임의의 위의 특징 20 내지 30의 방법으로서, 음성 명령이 등록된 사용자로부터 수신되지 않은 경우 음성 명령을 무시하는 것을 더 포함함.

(특징 32) 인코딩된 명령어를 가지는 유형의 비일시적인 컴퓨터 판독 가능 매체로서, 명령어가 하나 이상의 프로세서에 의해 실행되는 경우 컴퓨팅 장치가 임의의 위의 특징 20 내지 31에 따르는 방법을 수행하도록 함.

(특징 33) 하나 이상의 프로세서, 및 특징 32에 따르는 유형의 비일시적인 컴퓨터 판독 가능 매체를 포함하는 미디어 재생 시스템.

(특징 34) 방법으로서, 콘텐트에 대한 표시를 수신하는 것, 수신된 표시에 기초하여 적어도 하나의 콘텐트 유형을 식별하는 것, 복수의 음악 서비스로부터 적어도 하나의 콘텐트 유형을 지원하는 적어도 하나의 음악 서비스를 결정하는 것, 적어도 하나의 콘텐트 유형을 지원하는 적어도 하나의 음악 서비스에 기초하여 적어도 하나의 음악 서비스가 콘텐트 유형과 연관되는 오디오 콘텐트를 송신하도록 하는 것을 포함함.

(특징 35) 특징 34의 방법으로서, 콘텐트에 대한 표시는 네트워크 마이크로폰 장치를 통하여 수신됨.

(특징 36) 특징 34 또는 35의 방법으로서, 적어도 하나의 음악 서비스를 결정하는 것은 복수의 음악 서비스로부터 적어도 하나의 음악 서비스에 대응하는 신뢰 메트릭을 결정하는 것을 포함함.

(특징 37) 특징 34 또는 35의 방법으로서, 적어도 하나의 음악 서비스를 결정하는 것은 신뢰 수준 조건이 만족되는지 여부를 결정하는 것을 포함함.

(특징 38) 특징 37의 방법으로서, 신뢰 메트릭은 복수의 음악 서비스의 음악 서비스에 대한 액세스의 이력에 기초함.

(특징 39) 특징 38의 방법으로서, 신뢰 메트릭은 특정 음악 서비스의 사용의 특정 위치에 더 기초함.

(특징 40) 임의의 위의 특징 34 내지 39의 방법으로서, 콘텐트에 대한 제2의 표시를 수신하는 것, 수신된 표시에 기초하여 적어도 하나의 콘텐트 유형을 식별하는 것, 복수의 음악 서비스 중 어떤 음악 서비스도 적어도 하나의 콘텐트 유형을 지원하지 않는다고 결정하는 것, 및 에러 상태가 트리거되도록 하는 것을 포함함.

(특징 41) 임의의 위의 특징 34 내지 40의 방법으로서, 콘텐트 유형은 아티스트, 장르, 노래, 앨범 및 라디오 방송으로 구성되는 그룹으로부터 선택됨.

(특징 42) 임의의 위의 특징 34 내지 41의 방법으로서, 적어도 하나의 음악 서비스를 결정하는 것은 복수의 스트리밍 서비스에 대한 이용 가능한 콘텐트에 대한 엔트리를 포함하는 순람표를 액세스하는 것을 포함함.

(특징 43) 임의의 위의 특징 34 내지 42의 방법으로서, 복수의 음악 서비스로부터 사용자가 등록된 음악 서비스만을 쿼리하는 것을 더 포함함.

(특징 44) 임의의 위의 특징 34 내지 43의 방법으로서, 콘텐트 유형을 식별한 후에, 콘텐트에 대한 초기 표시에서 표시된 콘텐트 유형을 더 특정하도록 사용자에게 하나 이상의 질문을 하는 것, 더 구체적인 콘텐트 유형을 표시하는 추가적인 사용자 입력을 수신하는 것, 및 더 구체적인 콘텐트 유형에 기초하여 하나 이상의 음악 서비스를 결정하는 것을 더 포함함.

(특징 45) 네트워크 상에서 복수의 네트워킹된 장치와 통신하도록 구성되는 네트워크 인터페이스, 실행되는 경우 프로세서가 임의의 위의 특징 34 내지 44에 따르는 방법을 수행하도록 하는 명령어를 포함하는 프로세서를 포함하는 네트워크 장치.

(특징 46) 프로세서에 의한 실행을 위한 명령어를 포함하는 컴퓨터 판독 가능 저장 매체로서, 명령어는 실행되는 경우 프로세서가 특징 34 내지 44 중 하나에 따르는 방법을 구현하도록 함.

VIII. 결론

위의 설명은 다른 컴포넌트들 중에서도 하드웨어 상에서 실행되는 소프트웨어 및/또는 펌웨어를 포함하는, 다른 것들 중에서도 다양한 예시적인 시스템, 방법, 기기 및 제조 물품을 개시한다. 그러한 예시는 단지 예시적이고 제한하는 것으로서 간주되어서는 안됨이 이해된다. 예를 들어, 펌웨어, 하드웨어 및/또는 소프트웨어 태양 또는 컴포넌트 중 임의의 것 또는 모두가 하드웨어로만, 소프트웨어로만, 펌웨어로만, 또는 하드웨어, 소프트웨어 및/또는 펌웨어의 임의의 조합으로 구현될 수 있음이 고려된다. 따라서, 제공되는 예시는 그러한 시스템, 방법, 기기 및/또는 제조 물품을 구현하기 위한 유일한 방식이 아니다.

여기에 개시된 방법 및 다른 프로세스는 하나 이상의 동작, 기능 또는 액션을 포함할 수 있다. 순차적인 순서로 블록들이 도시되고 있으나, 이러한 블록들은 병렬적으로 및/또는 여기서 설명된 것과 다른 순서로 수행될 수도 있다. 또한, 요구되는 구현에 따라 다양한 블록들은 더 적은 블록들로 조합, 추가적인 블록들로 분할, 및/또는 제거될 수 있다.

또한, 여기에 개시된 방법 및 다른 프로세스 및 방법에 대하여, 흐름도는 본 실시예의 하나의 가능한 구현의 기능 및 동작을 보여준다. 이러한 점에서, 각각의 블록은 프로세스에서 특정 로직 기능 또는 단계를 구현하기 위한 프로세서에 의해 실행 가능한 하나 이상의 명령어를 포함하는 모듈, 세그먼트, 프로그램 코드의 일부를 나타낼 수 있다. 프로그램 코드는 예컨대 디스크 또는 하드 드라이브를 포함하는 저장 장치와 같은 임의의 유형의 컴퓨터 판독 가능 매체에 저장될 수 있다. 컴퓨터 판독 가능 매체는 예컨대 레지스터 메모리, 프로세서 캐시 및 랜덤 액세스 메모리(RAM)와 같은 짧은 기간 동안 데이터를 저장하는 컴퓨터 판독 가능 매체와 같은 비일시적인 컴퓨터 판독 가능 매체를 포함할 수 있다. 컴퓨터 판독 가능 매체는 또한 예컨대 읽기 전용 메모리(ROM), 광 또는 자기 디스크, 컴팩트 디스크 읽기 전용 메모리(CD-ROM)와 같은 이차적인 또는 지속성의 장기 스토리지와 같은 비일시적인 매체를 포함할 수 있다. 컴퓨터 판독 가능 매체는 또한 임의의 다른 휘발성 또는 비휘발성 저장 시스템일 수 있다. 컴퓨터 판독 가능 매체는 예컨대 컴퓨터 판독 가능 저장 매체 또는 유형의 저장 장치로 고려될 수 있다. 또한, 도면의 각각의 블록은 프로세스에서 특정 로직 기능을 수행하기 위해 배선되는 회로를 나타낼 수 있다.

또한, 여기에서 "실시예"에 대한 참조는 실시예와 관련하여 설명되는 특정 특징, 구조 또는 특성이 발명의 적어도 하나의 예시적인 실시예에 포함될 수 있음을 의미한다. 명세서에서 다양한 곳에서 이러한 어구의 등장은 반드시 모두 같은 실시예를 참조하는 것이 아니며, 다른 실시예와 상호 배타적인 독립된 또는 대안적인 실시예가 아니다. 이와 같이, 당업자에 의해 명시적 및 암시적으로 이해되는 여기에 설명되는 실시예는 다른 실시예와 조합될 수 있다.

명세서는 주로 예시적인 환경, 시스템, 절차, 단계, 논리 블록, 처리 및 네트워크에 결합되는 데이터 처리 장치의 동작에 직접 또는 간접적으로 유사한 다른 심볼 표현의 관점에서 제공된다. 이러한 프로세스 설명 및 표현은 통상적으로 당업자에 의해 가장 효과적으로 자신의 연구의 본질을 다른 분야에 전달하기 위해 사용된다. 본 개시의 완전한 이해를 제공하기 위해 다수의 구체적인 세부 사항이 개시된다. 그러나, 본 개시의 어떠한 실시예는 어떠한 구체적인 세부 사항 없이 실시될 수 있음이 당업자에게 이해된다. 다른 경우에, 잘 알려진 방법, 절차, 컴포넌트 및 회로는 실시예의 태양을 불필요하게 흐리는 것을 피하기 위해 상세히 설명되지 않았다. 따라서, 본 개시의 범위는 앞의 실시예의 설명이 아니라 첨부된 청구범위에 의해 정의된다.

첨부된 청구범위 중 임의의 것이 순전히 소프트웨어 및/또는 펌웨어 구현을 커버하는 것으로 읽히는 경우, 적어도 하나의 예시에서의 구성요소 중 적어도 하나는 여기에서 명시적으로 메모리, DVD, CD, 블루레이 등과 같이 소프트웨어 및/또는 펌웨어를 저장하는 유형의 비일시적인 매체를 포함하는 것으로 정의된다.

Claims

복수의 재생 구역을 포함하는 미디어 재생 시스템을 위한 방법으로서,
상기 미디어 재생 시스템의 둘 이상의 재생 장치는 음성 입력을 수신가능하고,
상기 방법은
상기 미디어 재생 시스템의 제1 재생 구역의 제1 재생 장치가 특정 미디어 콘텐트를 재생하고 있고 상태 변수는 상기 특정 미디어 콘텐트가 상기 제1 재생 구역에서 재생되고 있음을 나타내는 동안, 상기 미디어 재생 시스템의 상기 둘 이상의 재생 장치 중 하나 이상의 재생 장치에서, 명령 단어 및 하나 이상의 구역 변수 인스턴스를 포함하는 상기 음성 입력을 수신하는 단계;
상기 미디어 재생 시스템의 하나 이상의 재생 장치에 의해, 상기 하나 이상의 구역 변수 인스턴스 및 상기 명령 단어에 기초하여 제2 재생 구역에서 상기 특정 미디어 콘텐트를 재생하고 청취 구역을 변경하고자 하는 의도를 결정하는 단계; 및
상기 결정하는 단계 이후에, 상기 미디어 재생 시스템에 의해, 상기 제2 재생 구역의 하나 이상의 재생 장치로 하여금 상기 미디어 콘텐트를 상기 제2 재생 구역에서 재생하고 상기 미디어 콘텐트를 상기 제1 재생 구역에서 재생하는 것을 중단하도록 하고 상기 미디어 콘텐트가 상기 제2 재생 구역에서 재생되고 있음을 나타내는 상태 변수를 갱신 및/또는 저장하는 단계
를 포함하는, 방법.