KR102736282B1 - 대화형 인공지능 기반 자동차 인포테인먼트를 제공하기 위한 시스템 및 이의 제어 방법 - Google Patents

대화형 인공지능 기반 자동차 인포테인먼트를 제공하기 위한 시스템 및 이의 제어 방법 Download PDF

Info

Publication number
KR102736282B1
KR102736282B1 KR1020230197817A KR20230197817A KR102736282B1 KR 102736282 B1 KR102736282 B1 KR 102736282B1 KR 1020230197817 A KR1020230197817 A KR 1020230197817A KR 20230197817 A KR20230197817 A KR 20230197817A KR 102736282 B1 KR102736282 B1 KR 102736282B1
Authority
KR
South Korea
Prior art keywords
user
gui
server
identified
user terminal
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
KR1020230197817A
Other languages
English (en)
Inventor
유승재
Original Assignee
(주)페르소나에이아이
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by (주)페르소나에이아이 filed Critical (주)페르소나에이아이
Priority to KR1020230197817A priority Critical patent/KR102736282B1/ko
Application granted granted Critical
Publication of KR102736282B1 publication Critical patent/KR102736282B1/ko
Priority to PCT/KR2024/019999 priority patent/WO2025143636A1/ko
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • BPERFORMING OPERATIONS; TRANSPORTING
    • B60VEHICLES IN GENERAL
    • B60KARRANGEMENT OR MOUNTING OF PROPULSION UNITS OR OF TRANSMISSIONS IN VEHICLES; ARRANGEMENT OR MOUNTING OF PLURAL DIVERSE PRIME-MOVERS IN VEHICLES; AUXILIARY DRIVES FOR VEHICLES; INSTRUMENTATION OR DASHBOARDS FOR VEHICLES; ARRANGEMENTS IN CONNECTION WITH COOLING, AIR INTAKE, GAS EXHAUST OR FUEL SUPPLY OF PROPULSION UNITS IN VEHICLES
    • B60K35/00Instruments specially adapted for vehicles; Arrangement of instruments in or on vehicles
    • B60K35/20Output arrangements, i.e. from vehicle to user, associated with vehicle functions or specially adapted therefor
    • B60K35/28Output arrangements, i.e. from vehicle to user, associated with vehicle functions or specially adapted therefor characterised by the type of the output information, e.g. video entertainment or vehicle dynamics information; characterised by the purpose of the output information, e.g. for attracting the attention of the driver
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B60VEHICLES IN GENERAL
    • B60KARRANGEMENT OR MOUNTING OF PROPULSION UNITS OR OF TRANSMISSIONS IN VEHICLES; ARRANGEMENT OR MOUNTING OF PLURAL DIVERSE PRIME-MOVERS IN VEHICLES; AUXILIARY DRIVES FOR VEHICLES; INSTRUMENTATION OR DASHBOARDS FOR VEHICLES; ARRANGEMENTS IN CONNECTION WITH COOLING, AIR INTAKE, GAS EXHAUST OR FUEL SUPPLY OF PROPULSION UNITS IN VEHICLES
    • B60K35/00Instruments specially adapted for vehicles; Arrangement of instruments in or on vehicles
    • B60K35/20Output arrangements, i.e. from vehicle to user, associated with vehicle functions or specially adapted therefor
    • B60K35/29Instruments characterised by the way in which information is handled, e.g. showing information on plural displays or prioritising information according to driving conditions
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/30Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
    • G06F16/33Querying
    • G06F16/332Query formulation
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/30Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
    • G06F16/33Querying
    • G06F16/332Query formulation
    • G06F16/3329Natural language query formulation
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/30Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
    • G06F16/33Querying
    • G06F16/338Presentation of query results
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F3/00Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
    • G06F3/16Sound input; Sound output
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F3/00Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
    • G06F3/16Sound input; Sound output
    • G06F3/167Audio in a user interface, e.g. using voice commands for navigating, audio feedback
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/30Semantic analysis
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F9/00Arrangements for program control, e.g. control units
    • G06F9/06Arrangements for program control, e.g. control units using stored programs, i.e. using an internal store of processing equipment to receive or retain programs
    • G06F9/44Arrangements for executing specific programs
    • G06F9/451Execution arrangements for user interfaces
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B60VEHICLES IN GENERAL
    • B60KARRANGEMENT OR MOUNTING OF PROPULSION UNITS OR OF TRANSMISSIONS IN VEHICLES; ARRANGEMENT OR MOUNTING OF PLURAL DIVERSE PRIME-MOVERS IN VEHICLES; AUXILIARY DRIVES FOR VEHICLES; INSTRUMENTATION OR DASHBOARDS FOR VEHICLES; ARRANGEMENTS IN CONNECTION WITH COOLING, AIR INTAKE, GAS EXHAUST OR FUEL SUPPLY OF PROPULSION UNITS IN VEHICLES
    • B60K2360/00Indexing scheme associated with groups B60K35/00 or B60K37/00 relating to details of instruments or dashboards
    • B60K2360/16Type of output information
    • B60K2360/164Infotainment
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • G10L2015/223Execution procedure of a spoken command
    • YGENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
    • Y10TECHNICAL SUBJECTS COVERED BY FORMER USPC
    • Y10STECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
    • Y10S715/00Data processing: presentation processing of document, operator interface processing, and screen saver display processing
    • Y10S715/978Audio interaction as part of an operator interface

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Computational Linguistics (AREA)
  • Human Computer Interaction (AREA)
  • Software Systems (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Chemical & Material Sciences (AREA)
  • Data Mining & Analysis (AREA)
  • Databases & Information Systems (AREA)
  • General Health & Medical Sciences (AREA)
  • Combustion & Propulsion (AREA)
  • Transportation (AREA)
  • Mechanical Engineering (AREA)
  • Multimedia (AREA)
  • Mathematical Physics (AREA)
  • Artificial Intelligence (AREA)
  • Acoustics & Sound (AREA)
  • User Interface Of Digital Computer (AREA)

Abstract

사용자 단말 및 서버를 포함하는 대화형 인공지능 기반의 자동차 인포테인먼트(Car Infotainment) 시스템이 개시된다. 본 개시에 따른 시스템은, 사용자 단말이 자동차 GUI를 출력하는 동안 사용자의 사용자 명령 데이터가 획득되면, 사용자 단말이 사용자 명령 데이터를 서버로 전송하는 단계; 서버가 사용자 단말로부터 수신된 사용자 명령 데이터에 대응되는 텍스트 데이터를 식별하는 단계; 서버가 텍스트 데이터의 의미를 식별하는 단계; 서버가 식별된 의미에 기초하여 텍스트 데이터에 대응되는 자동차 GUI의 출력 제어 신호를 생성하는 단계; 서버가 식별된 의미에 기초하여 텍스트 데이터에 대응되는 답변 데이터를 생성하는 단계; 서버가 출력 제어 신호 및 답변 데이터를 사용자 단말로 전송하는 단계; 및 사용자 단말이 출력 제어 신호에 대응되는 자동차 GUI 및 답변 데이터를 출력하여 사용자에게 제공하는 단계;를 포함할 수 있다.

Description

대화형 인공지능 기반 자동차 인포테인먼트를 제공하기 위한 시스템 및 이의 제어 방법{SYSTEM AND THE CONTROLLING METHOD THEREOF FOR PROVIDING INTERACTIVE ARTIFICIAL INTELLIGENCE-BASED AUTOMOBILE INFOTAINMENT}
본 개시는 대화형 인공지능 기반 자동차 인포테인먼트 시스템에 관한 것으로, 더욱 상세하게는, 대화형 인공지능을 통해 사용자의 음성 또는 텍스트에 대응되는 자동차의 이미지, 기능 정보를 제공하는 시스템 및 이의 제어 방법에 관한 것이다.
인공지능 산업 융합 사업단의 과제(2023년 AI+X 기술개발 지원사업 / 과제명:대화형 인공지능 기반 미래 모빌리티 카 인포테인먼트(Car Infotainment)용 콘텐츠 구축 기술)를 통해 개발된 기술이다.
인공지능 시스템은 인간 수준의 지능을 구현하는 컴퓨터 시스템으로서 기계가 스스로 학습하고 판단하며, 사용할수록 인식률이 향상되는 시스템이다
인공지능 기술은 입력 데이터들의 특징을 스스로 분류/학습하는 알고리즘을 이용하는 기계학습, 딥러닝 기술 및 기계학습, 딥러닝 알고리즘을 활용하여 인간 두뇌의 인지, 판단 등의 기능을 모사하는 요소 기술들로 구성된다.
요소 기술들은, 예로, 인간의 언어/문자를 인식하는 언어적 이해 기술, 사물을 인간의 시각처럼 인식하는 시각적 이해 기술, 정보를 판단하여 논리적으로 추론하고 예측하는 추론/예측 기술 등이 있다.
언어적 이해는 인간의 언어/문자를 인식하고 응용/처리하는 기술로서, 자연어 처리, 기계 번역, 대화시스템, 질의 응답, 음성 인식/합성 등을 포함한다.
구체적으로, 문장에서 주어, 목적어가 무엇인지, 그들의 의미적 관계가 어떠한지 컴퓨터가 자동으로 결정해주는 의미역 결정, 문장의 구조, 의존 구조 분석 등이 가능하다.
또한, 컴퓨터 그래픽 기술의 발달로, 실제 사물의 외형을 컴퓨터 그래픽 기반의 3차원 이미지로 구현하여 사용자에게 제공할 수 있다. 3차원 컴퓨터 그래픽 이미지, 영상에 대한 렌더링 작업을 수행하여 실제 사물과 같은 사실적인 외형을 구현할 수 있다.
자동차의 종류가 많아지고, 기능이 복잡해짐에 따라 사용자가 단편적이고 단발적인 자동차 정보를 제공받더라도 이를 실제 자동차의 외형, 기능과 접목하여 숙지하지 못하는 문제점이 있다.
따라서, 사용자가 공간과 시간에 제약받지 않고 간편한 방법으로 자동차의 실제 외형을 살펴보고, 자동차의 복잡한 기능을 가상의 그래픽 시뮬레이션으로 습득하는 방법의 모색이 요청된다.
본 개시의 목적들은 이상에서 언급한 목적으로 제한되지 않으며, 언급되지 않은 본 개시의 다른 목적 및 장점들은 하기의 설명에 의해서 이해될 수 있고, 본 개시의 실시 예에 의해 보다 분명하게 이해될 것이다. 또한, 본 개시의 목적 및 장점들은 특허 청구 범위에 나타낸 수단 및 그 조합에 의해 실현될 수 있음을 쉽게 알 수 있을 것이다.
본 개시의 일 실시 예에 따른 사용자 단말 및 서버를 포함하는 대화형 인공지능 기반의 자동차 인포테인먼트(Car Infotainment) 시스템의 제어 방법은, 상기 사용자 단말이 자동차 GUI를 출력하는 동안 사용자 명령 데이터가 획득되면, 상기 사용자 단말이 상기 사용자 명령 데이터를 서버로 전송하는 단계; 상기 서버가 상기 사용자 단말로부터 수신된 상기 사용자 명령 데이터에 대응되는 텍스트 데이터를 식별하는 단계; 상기 서버가 상기 텍스트 데이터의 의미를 식별하는 단계; 상기 서버가 상기 식별된 의미에 기초하여 상기 텍스트 데이터에 대응되는 자동차 GUI의 출력 제어 신호를 생성하는 단계; 상기 서버가 상기 식별된 의미에 기초하여 상기 텍스트 데이터에 대응되는 답변 데이터를 생성하는 단계; 상기 서버가 상기 출력 제어 신호 및 상기 답변 데이터를 상기 사용자 단말로 전송하는 단계; 및 상기 사용자 단말이 상기 출력 제어 신호에 대응되는 자동차 GUI 및 상기 답변 데이터를 출력하여 사용자에게 제공하는 단계;를 포함할 수 있다.
한편, 상기 자동차 GUI는, 기 설정된 자동차 모델의 외관 또는 실내의 3차원 그래픽 이미지일 수 있다.
한편, 상기 텍스트 데이터의 의미를 식별하는 단계는, 상기 서버가 상기 식별된 의미에 기초하여 상기 텍스트 데이터에 포함된 자동차의 부품 또는 부품 그룹을 식별하는 단계;를 포함하고, 상기 GUI의 출력 제어 신호를 생성하는 단계는, 상기 서버가 상기 식별된 자동차의 부품 또는 상기 식별된 부품 그룹에 대한 확대 이미지를 상기 사용자 단말이 출력하기 위한 GUI의 출력 제어 신호를 생성할 수 있다.
한편, 상기 텍스트 데이터의 의미를 식별하는 단계는, 상기 서버가 상기 식별된 자동차의 부품 또는 상기 식별된 부품 그룹에 대응되는 자동차의 기능을 식별하는 단계;를 포함하고, 상기 GUI의 출력 제어 신호를 생성하는 단계는, 상기 서버가 상기 식별된 자동차의 부품 또는 상기 식별된 부품 그룹에 대응되는 자동차의 기능이 수행되는 영상을 출력하기 위한 GUI의 출력 제어 신호를 생성할 수 있다.
한편, 상기 텍스트 데이터의 의미를 식별하는 단계는, 상기 서버가 상기 식별된 의미에 기초하여 상기 사용자 단말을 통해 출력 중인 자동차 GUI에 대응되는 사용자의 1인칭 시점 각도 및 사용자의 1인칭 시점 거리 중 적어도 하나에 대한 변경 정보를 식별하는 단계;를 포함하고, 상기 GUI의 출력 제어 신호를 생성하는 단계는, 상기 서버가 상기 식별된 변경 정보에 기초하여 상기 사용자 단말을 통해 출력 중인 자동차 GUI에 대응되는 사용자의 1인칭 시점 각도 및 사용자의 1인칭 시점 거리 중 적어도 하나를 변경하는 GUI의 출력 제어 신호를 생성할 수 있다.
한편, 상기 텍스트 데이터의 의미를 식별하는 단계는, 상기 서버가 상기 식별된 의미에 기초하여 상기 텍스트 데이터에 포함된 자동차의 부품 또는 부품 그룹을 식별하는 단계;를 포함하고, 상기 답변 데이터를 생성하는 단계는, 상기 서버가 상기 식별된 자동차의 부품 또는 상기 식별된 부품 그룹에 대한 설명을 포함하는 답변 데이터를 생성할 수 있다.
한편, 상기 텍스트 데이터의 의미를 식별하는 단계는, 상기 서버가 상기 식별된 자동차의 부품 또는 상기 식별된 부품 그룹에 대응되는 자동차의 기능을 식별하는 단계;를 포함하고, 상기 답변 데이터를 생성하는 단계는, 상기 서버가 상기 식별된 자동차의 기능에 대한 설명을 포함하는 답변 데이터를 생성할 수 있다.
한편, 상기 자동차 GUI 및 상기 답변 데이터를 출력하여 사용자에게 제공하는 단계는, 상기 사용자 단말이 상기 자동차 GUI를 디스플레이를 통해 출력하여 사용자에게 제공하고, 상기 사용자 단말이 상기 답변 데이터에 대응되는 답변 음성을 스피커를 통해 출력하여 사용자에게 제공할 수 있다.
본 개시의 일 실시 예에 따른, 대화형 인공지능 기반의 자동차 인포테인먼트(Car Infotainment)를 제공하는 전자 장치의 제어 방법은, 디스플레이를 통해 자동차 GUI를 출력하는 동안 사용자 명령 데이터가 획득되면, 상기 사용자 명령 데이터에 대응되는 텍스트 데이터를 식별하는 단계; 상기 텍스트 데이터의 의미를 식별하는 단계; 상기 식별된 의미에 기초하여 상기 텍스트 데이터에 대응되는 자동차 GUI의 출력 제어 신호를 생성하는 단계; 상기 식별된 의미에 기초하여 상기 텍스트 데이터에 대응되는 답변 데이터를 생성하는 단계; 및 상기 출력 제어 신호에 대응되는 자동차 GUI 및 상기 답변 데이터를 디스플레이 및 스피커 중 적어도 하나를 통해 출력하여 사용자에게 제공하는 단계;를 포함할 수 있다.
본 개시의 일 실시 예에 따른 비일시적 컴퓨터 판독가능 기록매체는 전자 장치의 프로세서의 의해 실행되어 상기 전자 장치의 제어 방법을 수행하도록 하는 적어도 하나의 인스트럭션이 저장된 것일 수 있다.
대화형 인공지능과 3차원 이미지로 제공되는 자동차 인포테인먼트를 결합한 시스템을 이용하여 사용자가 시간과 공간에 제약받지 않고 자동차의 외형을 살펴보고, 자동차의 기능을 습득할 수 있다.
본 개시의 특정 실시 예의 양상, 특징 및 이점은 첨부된 도면들을 참조하여 후술되는 설명을 통해 보다 명확해질 것이다.
도 1은 본 개시의 일 실시 예에 따른, 대화형 인공지능 기반의 자동차 인포테인먼트 시스템을 구성하는 전자 장치 및 서버를 설명하기 위한 도면이다.
도 2는 본 개시의 일 실시 예에 따른, 대화형 인공지능 기반의 자동차 인포테인먼트 시스템의 전체 동작을 설명하기 위한 도면이다.
도 3a는 본 개시의 일 실시 예에 따른, 사용자 단말의 구성을 도시한 블록도이다.
도 3b는 본 개시의 일 실시 예에 따른, 서버의 구성을 도시한 블록도이다.
도 4는 본 개시의 일 실시 예에 따른, 시스템의 동작을 설명하기 위한 시퀀스도이다.
도 5a는 본 개시의 일 실시 예에 따른, 사용자 단말을 통해 자동차의 외형에 대한 3차원 이미지가 출력되는 화면을 설명하기 위한 도면이다.
도 5b는 본 개시의 일 실시 예에 따른, 사용자 단말을 통해 자동차의 외형에 대한 3차원 이미지가 출력되는 화면을 설명하기 위한 도면이다.
도 6a는 본 개시의 일 실시 예에 따른, 사용자 단말을 통해 자동차의 실내에 대한 3차원 이미지가 출력되는 화면을 설명하기 위한 도면이다.
도 6b는 본 개시의 일 실시 예에 따른, 사용자 단말을 통해 자동차의 실내에 대한 3차원 이미지가 출력되는 화면을 설명하기 위한 도면이다.
도 7은 본 개시의 일 실시 예에 따른, 전자 장치의 동작을 설명하기 위한 흐름도이다.
본 실시 예들은 다양한 변환을 가할 수 있고 여러 가지 실시 예를 가질 수 있는바, 특정 실시 예들을 도면에 예시하고 상세한 설명에 상세하게 설명하고자 한다. 그러나 이는 특정한 실시 형태에 대해 범위를 한정하려는 것이 아니며, 본 개시의 실시 예의 다양한 변경(modifications), 균등물(equivalents), 및/또는 대체물(alternatives)을 포함하는 것으로 이해되어야 한다. 도면의 설명과 관련하여, 유사한 구성요소에 대해서는 유사한 참조 부호가 사용될 수 있다.
본 개시를 설명함에 있어서, 관련된 공지 기능 혹은 구성에 대한 구체적인 설명이 본 개시의 요지를 불필요하게 흐릴 수 있다고 판단되는 경우 그에 대한 상세한 설명은 생략한다.
덧붙여, 하기 실시 예는 여러 가지 다른 형태로 변형될 수 있으며, 본 개시의 기술적 사상의 범위가 하기 실시 예에 한정되는 것은 아니다. 오히려, 이들 실시 예는 본 개시를 더욱 충실하고 완전하게 하고, 당업자에게 본 개시의 기술적 사상을 완전하게 전달하기 위하여 제공되는 것이다.
본 개시에서 사용한 용어는 단지 특정한 실시 예를 설명하기 위해 사용된 것으로, 권리범위를 한정하려는 의도가 아니다. 단수의 표현은 문맥상 명백하게 다르게 뜻하지 않는 한, 복수의 표현을 포함한다.
본 개시에서, "가진다," "가질 수 있다," "포함한다," 또는 "포함할 수 있다" 등의 표현은 해당 특징(예: 수치, 기능, 동작, 또는 부품 등의 구성요소)의 존재를 가리키며, 추가적인 특징의 존재를 배제하지 않는다.
본 개시에서, "A 또는 B," "A 또는/및 B 중 적어도 하나," 또는 "A 또는/및 B 중 하나 또는 그 이상"등의 표현은 함께 나열된 항목들의 모든 가능한 조합을 포함할 수 있다. 예를 들면, "A 또는 B," "A 및 B 중 적어도 하나," 또는 "A 또는 B 중 적어도 하나"는, (1) 적어도 하나의 A를 포함, (2) 적어도 하나의 B를 포함, 또는 (3) 적어도 하나의 A 및 적어도 하나의 B 모두를 포함하는 경우를 모두 지칭할 수 있다.
본 개시에서 사용된 "제1," "제2," "첫째," 또는 "둘째,"등의 표현들은 다양한 구성요소들을, 순서 및/또는 중요도에 상관없이 수식할 수 있고, 한 구성요소를 다른 구성요소와 구분하기 위해 사용될 뿐 해당 구성요소들을 한정하지 않는다.
어떤 구성요소(예: 제1 구성요소)가 다른 구성요소(예: 제2 구성요소)에 "(기능적으로 또는 통신적으로) 연결되어((operatively or communicatively) coupled with/to)" 있다거나 "접속되어(connected to)" 있다고 언급된 때에는, 어떤 구성요소가 다른 구성요소에 직접적으로 연결되거나, 다른 구성요소(예: 제3 구성요소)를 통하여 연결될 수 있다고 이해되어야 할 것이다.
반면에, 어떤 구성요소(예: 제1 구성요소)가 다른 구성요소(예: 제2 구성요소)에 "직접 연결되어" 있다거나 "직접 접속되어" 있다고 언급된 때에는, 어떤 구성요소와 다른 구성요소 사이에 다른 구성요소(예: 제3 구성요소)가 존재하지 않는 것으로 이해될 수 있다.
본 개시에서 사용된 표현 "~하도록 구성된(또는 설정된)(configured to)"은 상황에 따라, 예를 들면, "~에 적합한(suitable for)," "~하는 능력을 가지는(having the capacity to)," "~하도록 설계된(designed to)," "~하도록 변경된(adapted to)," "~하도록 만들어진(made to)," 또는 "~를 할 수 있는(capable of)"과 바꾸어 사용될 수 있다. 용어 "~하도록 구성된(또는 설정된)"은 하드웨어적으로 "특별히 설계된(specifically designed to)" 것만을 반드시 의미하지 않을 수 있다.
대신, 어떤 상황에서는, "~하도록 구성된 장치"라는 표현은, 그 장치가 다른 장치 또는 부품들과 함께 "~할 수 있는" 것을 의미할 수 있다. 예를 들면, 문구 "A, B, 및 C를 수행하도록 구성된(또는 설정된) 프로세서"는 해당 동작을 수행하기 위한 전용 프로세서(예: 임베디드 프로세서), 또는 메모리 장치에 저장된 하나 이상의 소프트웨어 프로그램들을 실행함으로써, 해당 동작들을 수행할 수 있는 범용 프로세서(generic-purpose processor)(예: CPU 또는 application processor)를 의미할 수 있다.
실시 예에 있어서 '모듈' 혹은 '부'는 적어도 하나의 기능이나 동작을 수행하며, 하드웨어 또는 소프트웨어로 구현되거나 하드웨어와 소프트웨어의 결합으로 구현될 수 있다. 또한, 복수의 '모듈' 혹은 복수의 '부'는 특정한 하드웨어로 구현될 필요가 있는 '모듈' 혹은 '부'를 제외하고는 적어도 하나의 모듈로 일체화되어 적어도 하나의 프로세서로 구현될 수 있다.
한편, 도면에서의 다양한 요소와 영역은 개략적으로 그려진 것이다. 따라서, 본 발명의 기술적 사상은 첨부한 도면에 그려진 상대적인 크기나 간격에 의해 제한되지 않는다.
이하에서는 첨부한 도면을 참고하여 본 개시에 따른 실시 예에 대하여 본 개시가 속하는 기술 분야에서 통상의 지식을 가진 자가 용이하게 실시할 수 있도록 상세히 설명한다.
도 1은 본 개시의 일 실시 예에 따른, 대화형 인공지능 기반의 자동차 인포테인먼트 시스템을 구성하는 전자 장치 및 서버를 설명하기 위한 도면이다.
도 1을 참조하면, 사용자 단말(100)은 데스크탑 PC(desktop Personal Computer), 태블릿 PC(tablet Personal Computer), 랩탑 PC(laptop Personal Computer), 넷북 컴퓨터(netbook computer), 모바일 기기, 스마트폰(smartphone), 웨어러블 장치(wearable device) 중 적어도 하나를 포함할 수 있으나 이에 국한되는 것은 아니다.
서버(200)는, 예를 들어 클라이언트에게 네트워크를 통해 서비스하는 컴퓨터인 서버(200)일 수 있다. 서버(200)는, FTP 서버(200), 웹 서버(200), 데이터 베이스 서버(200), 클라우드형 서버(200)일 수 있으며, 서버(200)는 리눅스 등의 운영체제로 구축될 수 있다.
도 2는 본 개시의 일 실시 예에 따른, 대화형 인공지능 기반의 자동차 인포테인먼트 시스템의 전체 동작을 설명하기 위한 도면이다.
도 2를 참조하면, 사용자 단말(100)은 자동차 GUI를 출력하여 대화형 인공지능 기반의 자동차 인포테인먼트 서비스를 사용자에게 제공할 수 있다.
사용자 단말(100)은 자동차 GUI가 출력되는 동안 마이크를 통해 사용자의 음성 데이터를 획득할 수 있다.
또한, 이외에도 사용자 단말(100)은 자동차 GUI가 출력되는 동안 사용자 인터페이스를 통해 사용자 명령에 대응되는 텍스트를 입력 받을 수 있다.
여기서, 사용자의 음성 데이터 또는 텍스트 데이터는 자동차 인포테인먼트 제어를 위한 사용자 명령에 대한 것일 수 있다. 사용자 단말(100)은 획득된 음성 데이터 또는 텍스트 데이터를 서버(200)로 전송할 수 있다.
서버(200)는 사용자 단말(100)로부터 수신된 음성 데이터에 대응되는 텍스트 데이터를 식별하는 음성인식 동작을 수행할 수 있다.
서버(200)는 사용자의 음성에 대응되는 텍스트 데이터의 의미를 식별하고, 자동차 인포테인먼트의 자동차 GUI 출력을 제어하기 위한 제어 신호 및 텍스트 데이터에 대한 답변 데이터를 생성하여 사용자 단말(100)로 전송할 수 있다. 이 경우, 사용자 단말(100)은 서버(200)로부터 수신된 제어 신호에 기초하여 자동차 GUI를 출력하여 사용자에게 제공하고, 답변 데이터에 대응되는 답변 음성을 출력하여 사용자에게 제공할 수 있다.
상술한 사용자 단말(100) 및 서버(200)를 포함하는 대화형 인공지능 기반의 자동차 인포테인먼트 제공 시스템은, 별도의 프로그램, 솔루션, 데이터를 사용자 단말(100)로 다운로드받지 않은 상태에서 웹-환경, 웹-기반에서 활용될 수 있어, 간편하고 빠르게 사용자에게 서비스를 제공할 수 있다는 이점이 있다.
도 3a는 본 개시의 일 실시 예에 따른, 사용자 단말(100)의 구성을 도시한 블록도이다.
도 3a를 참조하면, 사용자 단말(100)은 디스플레이(110), 스피커(120), 마이크(130), 통신 인터페이스(140), 메모리(150) 및 프로세서(160)를 포함할 수 있다.
다만, 사용자 단말(100)의 장치 구성은 상술한 바에 국한되는 것은 아니며, 이외의 장치 구성, 예를 들어, 사용자 인터페이스를 추가로 더 포함하거나, 일부 구성을 생략할 수 있다.
디스플레이(110)는 LCD(Liquid Crystal Display) 패널, OLED(Organic Light Emitting Diodes) 패널, AM-OLED(Active-Matrix Organic Light-Emitting Diode), LcoS(Liquid Crystal on Silicon), QLED(Quantum dot Light-Emitting Diode) 및 DLP(Digital Light Processing), PDP(Plasma Display Panel) 패널, 무기 LED 패널, Micro LED 패널 등 다양한 종류의 디스플레이(110) 패널을 포함할 수 있으나, 이에 한정되는 것은 아니다. 한편, 디스플레이(110)는 터치 패널과 함께 터치스크린을 구성할 수도 있으며, 플렉서블(flexible) 패널로 이루어질 수도 있다.
디스플레이(110)는 2D 형태의 정사각형, 직사각형으로 구현될 수 있으나, 이에 국한되지 않고, 원형, 다각형, 3D 입체 형태 등 다양한 형태로 구현될 수 있다.
디스플레이(110)는 전자 장치의 표면 중 일 영역에 배치될 수 있으나, 이에 국한되지 않고 공간 상에 투영되는 3차원 공간 상에서 3차원 홀로그램으로 투영되거나, 2차원 평면상에 투영되는 프로젝션 형태로 구현될 수도 있다.
디스플레이(110)는 전자 장치의 일 구성으로 포함될 수 있으나, 이에 국한되는 것은 아니며, 별도로 구비된 디스플레이(110) 장치가 전자 장치와 통신 인터페이스(140) 또는 입출력 인터페이스를 통해 무선/유선으로 연결되어 프로세서(160)의 신호에 따른 이미지, 영상, GUI를 출력할 수 있다. 이 경우, 프로세서(160)는 통신 인터페이스(140) 또는 입출력 인터페이스를 통해 무선/유선으로 디스플레이(110) 장치와 연결을 수행하여 이미지, 영상, GUI 출력을 위한 신호를 전송할 수 있다.
프로세서(160)는 디스플레이(110)를 통해 자동차의 외형 또는 자동차의 실내에 대한 3차원 이미지, 영상, GUI로 이루어진 자동차 인포테인먼트를 출력하여 사용자에게 제공할 수 있다.
프로세서(160)는 디스플레이(110)를 통해 자동차의 구성별 기능에 대한 정보를 포함하는, 텍스트를 출력하여 사용자에게 제공할 수 있다.
이외에도, 프로세서(160)는 디스플레이(110)를 통해 사용자의 음성에 대한 답변 텍스트를 출력하여 사용자에게 제공할 수 있다.
스피커(120)는 고음역대 소리 재생을 위한 트위터, 중음역대 소리 재생을 위한 미드레인지, 저음역대 소리 재생을 위한 우퍼, 극저음역대 소리 재생을 위한 서브우퍼, 공진을 제어하기 위한 인클로저, 스피커(120)에 입력되는 전기 신호 주파수를 대역 별로 나누는 크로스오버 네트워크 등으로 이루어질 수 있다.
스피커(120)는, 음향 신호를 전자 장치의 외부로 출력할 수 있다. 스피커(120)는 멀티미디어 재생, 녹음 재생, 각종 알림음, 음성 메시지 등을 출력할 수 있다. 전자 장치는 스피커(120)와 같은 오디오 출력 장치를 포함할 수 있으나, 오디오 출력 단자와 같은 출력 장치를 포함할 수 있다. 특히, 스피커(120)는 획득한 정보, 획득한 정보에 기초하여 가공·생산한 정보, 사용자 음성에 대한 응답 결과 또는 동작 결과 등을 음성 형태로 제공할 수 있다.
프로세서(160)는 스피커(120)를 통해 사용자의 음성에 대응되는 답변 음성을 출력하여 사용자에게 제공할 수 있다.
이외에도, 프로세서(160)는 스피커(120)를 통해 대화형 인공지능 기반의 자동차 인포테인먼트의 조작과 관련된 다양한 안내 음성을 출력하여 사용자에게 제공할 수 있다.
마이크(130)는 소리를 획득하여 전기 신호로 변환하는 모듈을 의미할 수 있으며, 콘덴서 마이크, 리본 마이크, 무빙코일 마이크, 압전소자 마이크, 카본 마이크, MEMS(Micro Electro Mechanical System) 마이크일 수 있다. 또한, 무지향성, 양지향성, 단일지향성, 서브 카디오이드(Sub Cardioid), 슈퍼 카디오이드(Super Cardioid), 하이퍼 카디오이드(Hyper Cardioid)의 방식으로 구현될 수 있다.
프로세서(160)는 획득된 사용자 음성 정보에 기초하여 사용자 음성 명령을 식별할 수 있다. 구체적으로, 프로세서(160)는 STT(Speech to Text) 모듈을 포함할 수 있고, STT 모듈을 통해 사용자 음성에 대응되는 전기 신호를 텍스트 형태로 식별할 수 있다. 프로세서(160)는 식별된 사용자 음성 명령에 대응되는 동작을 수행할 수 있다. 여기서, 프로세서(160)는 사용자 음성 명령을 식별할 때, 언어 모델(Lagauge Mode, LM), ASR(Automatic Sound Recognition) 모델을 이용하여 사용자 음성에 대응되는 전기 신호 또는 전기 신호에 대응되는 텍스트에 포함된 사용자 음성 명령을 식별할 수 있다.
프로세서(160)는 마이크(130)를 통해 사용자 음성 데이터를 획득할 수 있다. 여기서, 사용자의 음성 데이터는 대화형 인공지능 기반의 자동차 인포테인먼트 시스템을 제어하기 위한 사용자 명령일 수 있다.
사용자 인터페이스는, 버튼(button), 레버(lever), 스위치(switch), 터치(Touch)형 인터페이스 등을 포함할 수 있고, 터치형 인터페이스는 디스플레이(110) 화면 상에서 사용자의 터치로 입력을 받는 방식으로 구현될 수 있다.
프로세서(160)는 사용자 인터페이스를 통해 텍스트 데이터를 입력받을 수 있다. 여기서, 텍스트 데이터는 대화형 인공지능 기반 자동차 인포테인먼트의 GUI 제어 및 기능 정보 획득 위한 사용자 명령에 대응될 수 있다.
또한, 프로세서(160)는 터치형 사용자 인터페이스를 통해 디스플레이를 통해 출력 중인 자동차 GUI의 확대, 축소, 이동, 전환 등에 대한 GUI 제어 명령을 수신할 수 있다.
통신 인터페이스(140)는 무선 통신 인터페이스, 유선 통신 인터페이스 또는 입력 인터페이스를 포함할 수 있다. 무선 통신 인터페이스는, 무선 통신 기술이나 이동 통신 기술을 이용하여 각종 외부 장치와 통신을 수행할 수 있다. 이러한 무선 통신 기술로는, 예를 들어, 블루투스(Bluetooth), 저전력 블루투스(Bluetooth Low Energy), 캔(CAN) 통신, 와이 파이(Wi-Fi), 와이파이 다이렉트(Wi-Fi Direct), 초광대역 통신(UWB, ultrawide band), 지그비(zigbee), 적외선 통신(IrDA, infrared Data Association) 또는 엔에프씨(NFC, Near Field Communication) 등이 포함될 수 있으며, 이동 통신 기술 로는, 3GPP, 와이맥스(Wi-Max), LTE(Long Term Evolution), 5G 등이 포함될 수 있다.
무선 통신 인터페이스는 전자기파를 외부로 송신하거나 또는 외부에서 전달된 전자기파를 수신할 수 있는 안테나, 통신 칩 및 기판 등을 이용하여 구현될 수 있다.
유선 통신 인터페이스는 유선 통신 네트워크를 기반으로 각종 장치와 통신을 수행할 수 있다. 여기서, 유선 통신 네트워크는, 예를 들어, 페어 케이블, 동축 케이블, 광섬유 케이블 또는 이더넷(Ethernet) 케이블 등 물리적인 케이블을 이용하여 구현될 수 있다.
무선 통신 인터페이스 및 유선 통신 인터페이스는 실시 예에 따라 어느 하나가 생략될 수도 있다. 따라서, 전자 장치는 무선 통신 인터페이스만을 포함하거나 유선 통신 인터페이스만을 포함할 수 있다. 뿐만 아니라, 전자 장치는 무선 통신 인터페이스에 의한 무선 접속과 유선 통신 인터페이스에 의한 유선 접속을 모두 지원하는 통합된 통신 인터페이스(140)를 구비할 수도 있다.
전자 장치는 한 가지 방식의 통신 연결을 수행하는 한 개의 통신 인터페이스(140)를 포함하는 경우에 국한되지 않고, 복수의 방식으로 통신 연결을 수행하는 복수의 통신 인터페이스(140)를 포함할 수 있다.
프로세서(160)는 마이크(130)를 통해 획득된 사용자의 음성 데이터를 통신 인터페이스(140)를 통해 서버(200)로 전송할 수 있다.
이외에도, 프로세서(160)는 마이크(130)를 통해 획득된 사용자의 음성 데이터에 대응되는 텍스트 데이터를 통신 인터페이스(140)를 통해 서버(200)로 전송할 수 있다.
프로세서(160)는 통신 인터페이스(140)를 통해 서버(200)로부터 사용자의 음성 명령에 대응되는 자동차 GUI의 출력을 위한 제어 신호를 수신할 수 있다.
프로세서(160)는 통신 인터페이스(140)를 통해 서버(200)로부터 사용자의 음성 명령에 대응되는 답변 데이터를 수신할 수 있다.
다만, 이외에도 프로세서(160)는 통신 인터페이스(140)를 통해 서버(200)와 통신 연결을 수행하여 대화형 인공지능 기반의 자동차 인포테인먼트 시스템의 동작과 관련된 다양한 정보를 전송하거나 수신할 수 있다.
메모리(150)는 각종 프로그램이나 데이터를 일시적 또는 비일시적으로 저장하고, 프로세서(160)의 호출에 따라서 저장된 정보를 프로세서(160)에 전달한다. 또한, 메모리(150)는, 프로세서(160)의 연산, 처리 또는 제어 동작 등에 필요한 각종 정보를 전자적 포맷으로 저장할 수 있다.
메모리(150)는, 예를 들어, 주기억장치 및 보조기억장치 중 적어도 하나를 포함할 수 있다. 주기억장치는 롬(ROM) 및/또는 램(RAM)과 같은 반도체 저장 매체를 이용하여 구현된 것일 수 있다. 롬은, 예를 들어, 통상적인 롬, 이피롬(EPROM), 이이피롬(EEPROM) 및/또는 마스크롬(MASK-ROM) 등을 포함할 수 있다. 램은 예를 들어, 디램(DRAM) 및/또는 에스램(SRAM) 등을 포함할 수 있다. 보조기억장치는, 플래시 메모리 장치, SD(Secure Digital) 카드, 솔리드 스테이트 드라이브(SSD, Solid State Drive), 하드 디스크 드라이브(HDD, Hard Disc Drive), 자기 드럼, 컴팩트 디스크(CD), 디브이디(DVD) 또는 레이저 디스크 등과 같은 광 기록 매체(optical media), 자기테이프, 광자기 디스크 및/또는 플로피 디스크 등과 같이 데이터를 영구적 또는 반영구적으로 저장 가능한 적어도 하나의 저장 매체를 이용하여 구현될 수 있다.
메모리(150)는 마이크(130)를 통해 획득된 사용자의 음성 데이터를 저장할 수 있다. 메모리(150)는 사용자의 음성 데이터에 대응되는 텍스트 데이터를 저장할 수 있다.
메모리(150)는 사용자의 음성 명령에 대응되는 자동차 GUI의 출력을 위한 제어 신호를 저장할 수 있다. 메모리(150)는 사용자의 음성 명령에 대응되는 답변 데이터를 저장할 수 있다.
메모리(150)는 대화형 인공지능 기반의 자동차 인포테인먼트 시스템의 동작과 관련된 다양한 정보를 저장할 수 있다.
프로세서(160)는, 전자 장치의 전반적인 동작을 제어한다. 구체적으로, 프로세서(160)는 상술한 바와 메모리(150)를 포함하는 전자 장치의 구성과 연결되며, 상술한 바와 같은 메모리(150)에 저장된 적어도 하나의 인스트럭션을 실행함으로써, 전자 장치의 동작을 전반적으로 제어할 수 있다. 특히, 프로세서(160)는 하나의 프로세서로 구현될 수 있을 뿐만 아니라 복수의 프로세서로 구현될 수 있다.
프로세서(160)는 다양한 방식으로 구현될 수 있다. 예를 들어, 하나 이상의 프로세서(160)는 CPU (Central Processing Unit), GPU (Graphics Processing Unit), APU (Accelerated Processing Unit), MIC (Many Integrated Core), DSP (Digital Signal Processor), NPU (Neural Processing Unit), 하드웨어 가속기 또는 머신 러닝 가속기 중 하나 이상을 포함할 수 있다. 하나 이상의 프로세서(160)는 전자 장치의 다른 구성요소 중 하나 또는 임의의 조합을 제어할 수 있으며, 통신에 관한 동작 또는 데이터 처리를 수행할 수 있다. 하나 이상의 프로세서(160)는 메모리(150)에 저장된 하나 이상의 프로그램 또는 명령어(instruction)을 실행할 수 있다. 예를 들어, 하나 이상의 프로세서(160)는 메모리(150)에 저장된 하나 이상의 명령어를 실행함으로써, 본 개시의 일 실시 예에 따른 방법을 수행할 수 있다.
본 개시의 일 실시 예에 따른 방법이 복수의 동작을 포함하는 경우, 복수의 동작은 하나의 프로세서(160)에 의해 수행될 수도 있고, 복수의 프로세서(160)에 의해 수행될 수도 있다. 예를 들어, 일 실시 예에 따른 방법에 의해 제 1 동작, 제 2 동작, 제 3 동작이 수행될 때, 제 1 동작, 제 2 동작, 및 제 3 동작 모두 제 1 프로세서에 의해 수행될 수도 있고, 제 1 동작 및 제 2 동작은 제 1 프로세서(예를 들어, 범용 프로세서)에 의해 수행되고 제 3 동작은 제 2 프로세서(예를 들어, 인공지능 전용 프로세서)에 의해 수행될 수도 있다.
하나 이상의 프로세서(160)는 하나의 코어를 포함하는 단일 코어 프로세서(single core processor)로 구현될 수도 있고, 복수의 코어(예를 들어, 동종 멀티 코어 또는 이종 멀티 코어)를 포함하는 하나 이상의 멀티 코어 프로세서(multicore processor)로 구현될 수도 있다. 하나 이상의 프로세서(160)가 멀티 코어 프로세서로 구현되는 경우, 멀티 코어 프로세서에 포함된 복수의 코어 각각은 온 칩(On-chip) 메모리(150)와 같은 프로세서 내부 메모리를 포함할 수 있으며, 복수의 코어에 의해 공유되는 공통 캐시가 멀티 코어 프로세서(160)에 포함될 수 있다. 또한, 멀티 코어 프로세서(160)에 포함된 복수의 코어 각각(또는 복수의 코어 중 일부)은 독립적으로 본 개시의 일 실시 예에 따른 방법을 구현하기 위한 프로그램 명령을 판독하여 수행할 수도 있고, 복수의 코어 전체(또는 일부)가 연계되어 본 개시의 일 실시 예에 따른 방법을 구현하기 위한 프로그램 명령을 판독하여 수행할 수도 있다.
본 개시의 일 실시 예에 따른 방법이 복수의 동작을 포함하는 경우, 복수의 동작은 멀티 코어 프로세서에 포함된 복수의 코어 중 하나의 코어에 의해 수행될 수도 있고, 복수의 코어에 의해 수행될 수도 있다. 예를 들어, 일 실시 예에 따른 방법에 의해 제 1 동작, 제 2 동작, 및 제 3 동작이 수행될 때, 제 1 동작, 제2 동작, 및 제3 동작 모두 멀티 코어 프로세서에 포함된 제 1 코어에 의해 수행될 수도 있고, 제 1 동작 및 제 2 동작은 멀티 코어 프로세서에 포함된 제 1 코어에 의해 수행되고 제 3 동작은 멀티 코어 프로세서에 포함된 제 2 코어에 의해 수행될 수도 있다.
본 개시의 실시 예들에서, 프로세서(160)는 하나 이상의 프로세서(160) 및 기타 전자 부품들이 집적된 시스템 온 칩(SoC), 단일 코어 프로세서, 멀티 코어 프로세서, 또는 단일 코어 프로세서 또는 멀티 코어 프로세서에 포함된 코어를 의미할 수 있으며, 여기서 코어는 CPU, GPU, APU, MIC, DSP, NPU, 하드웨어 가속기 또는 기계 학습 가속기 등으로 구현될 수 있으나, 본 개시의 실시 예들이 이에 한정되는 것은 아니다.
프로세서(160)는 상술한 디스플레이(110), 스피커(120), 마이크(130), 통신 인터페이스(140) 및 메모리(150)와 연결되어 대화형 인공지능 기반의 자동차 인포테인먼트 시스템의 동작과 관련된 데이터, 정보, 신호를 식별/획득할 수 있고, 적어도 하나의 인스트럭션을 실행하여 상술한 구성을 제어하는 동작을 수행할 수 있다.
도 3b는 본 개시의 일 실시 예에 따른, 서버(200)의 구성을 도시한 블록도이다.
도 3b를 참조하면, 서버(200)는 통신 인터페이스(210), 메모리(220) 및 프로세서(230)를 포함할 수 있다.
통신 인터페이스(210), 메모리(220) 및 프로세서(230)의 일반적인 세부 구성 및 기능은 도 3a와 함께 상술하였다.
프로세서(230)는 통신 인터페이스(210)를 통해 사용자 단말(100)과 통신 연결을 수행하여 사용자의 음성 데이터 또는 사용자의 음성 데이터에 대응되는 텍스트 데이터를 수신할 수 있다.
통신 인터페이스(210)를 통해 사용자의 음성 데이터가 수신되는 경우, 프로세서(230)는 획득된 사용자 음성 정보에 기초하여 사용자 음성 명령을 식별할 수 있다. 구체적으로, 프로세서(230)는 STT(Speech to Text) 모듈을 포함할 수 있고, STT 모듈을 통해 사용자 음성에 대응되는 전기 신호를 텍스트 형태로 식별할 수 있다. 프로세서(230)는 식별된 사용자 음성 명령에 대응되는 동작을 수행할 수 있다. 여기서, 프로세서(230)는 사용자 음성 명령을 식별할 때, 언어 모델(Lagauge Mode, LM), ASR(Automatic Sound Recognition) 모델을 이용하여 사용자 음성에 대응되는 전기 신호 또는 전기 신호에 대응되는 텍스트에 포함된 사용자 음성 명령을 식별할 수 있다.
프로세서(230)는 통신 인터페이스(210)를 통해 사용자 단말(100)로 자동차 GUI 출력에 대한 제어 신호 및 사용자 음성에 대한 답변 데이터를 전송할 수 있다.
이외에도, 프로세서(230)는 통신 인터페이스(210)를 통해 사용자 단말(100)과 통신 연결을 수행하여 대화형 인공지능 기반의 자동차 인포테인먼트 시스템의 동작과 관련된 다양한 정보를 전송하거나 수신할 수 있다.
메모리(220)는 마이크를 통해 획득된 사용자의 음성 데이터를 저장할 수 있다. 메모리(220)는 사용자의 음성 데이터에 대응되는 텍스트 데이터를 저장할 수 있다.
메모리(220)는 사용자의 음성 명령에 대응되는 자동차 GUI의 출력을 위한 제어 신호를 저장할 수 있다. 메모리(220)는 사용자의 음성 명령에 대응되는 답변 데이터를 저장할 수 있다.
메모리(220)는 대화형 인공지능 기반의 자동차 인포테인먼트 시스템의 동작과 관련된 다양한 정보를 저장할 수 있다.
프로세서(230)는 통신 인터페이스(210) 및 메모리(220)와 연결되어 대화형 인공지능 기반의 자동차 인포테인먼트 시스템의 동작과 관련된 데이터, 정보, 신호를 식별/획득할 수 있고, 적어도 하나의 인스트럭션을 실행하여 상술한 구성을 제어하는 동작을 수행할 수 있다.
보다 구체적인 시스템의 제어 방법은 도 4 내지 6과 함께 설명한다.
도 4는 본 개시의 일 실시 예에 따른, 시스템의 동작을 설명하기 위한 시퀀스도이다.
도 4를 참조하면, 사용자 단말(100)은 자동차 GUI를 출력하여 사용자에게 제공할 수 있다.
도 5a 및 5b는 본 개시의 일 실시 예에 따른, 사용자 단말(100)을 통해 자동차의 외형에 대한 3차원 이미지가 출력되는 화면을 설명하기 위한 도면이다.
도 5a 및 5b를 참조하면, 자동차 GUI는 기 설정된 자동차 모델의 외관에 대한 3차원 그래픽 이미지일 수 있다.
자동차 외관에 대한 3차원 이미지는 기 설정된 자동차 모델을 실제와 동일하게 구현한 것이며, 빛에 따라 자동차 외부 표면의 색감, 질감이 다르게 표현되는 것도 구현될 수 있다.
도 6a 및 6b는 본 개시의 일 실시 예에 따른, 사용자 단말(100)을 통해 자동차의 실내에 대한 3차원 이미지가 출력되는 화면을 설명하기 위한 도면이다.
도 6a 및 6b를 참조하면, 자동차 GUI는 기 설정된 자동차 모델의 실내에 대한 3차원 그래픽 이미지일 수 있다.
실내에 대한 3차원 그래픽 이미지는, 자동차 운전석에서 사용자가 전방을 바라볼 때 시야에 보이는 대쉬보드, 송풍구, 레버, 버튼, 터치 패드, 계기판, 센터 모니터, 센터페시아, 기어, 룸 리어 뷰 미러, 사이드 미러 등일 수 있다.
또한, 이외에도 실내에 대한 3차원 그래픽 이미지는 운전석 아래에 위치한 브레이크 페달, 액셀러레이터 페달, 조수석의 시트, 뒷자석 시트, 자동차 도어 내부에 배치된 버튼 등이 포함될 수 있다.
사용자 단말(100)은 자동차 GUI를 출력하는 동안 사용자 명령 데이터 획득할 수 있다(S410). 여기서, 사용자 명령 데이터는 마이크(130)를 통해 획득된 사용자 음성 데이터, 사용자 인터페이스를 통해 획득된 텍스트 데이터 또는 터치형 인터페이스를 통해 획득된 GUI 터치 제어 명령 데이터일 수 있다.
사용자 명령 데이터가 획득되면, 사용자 단말(100)은 사용자 명령 데이터를 서버(200)로 전송할 수 있다(S420).
다만, 이에 국한되지 않고 사용자의 음성 데이터가 획득되면, 사용자 단말(100)은 사용자의 음성 데이터를 기 학습된 음성인식 모델에 입력하여 음성 데이터에 대응되는 텍스트 데이터를 획득하고, 획득된 텍스트 데이터를 서버(200)로 전송할 수도 있다.
여기서, 음성인식 모델은, 자동음성인식(ASR, Automatic Sound Recognition) 모델일 수 있다.
음성인식 모델은 음성 데이터에 대한 신포 증폭, 특징 값 추출 등 전처리 동작을 수행하는 전처리 모듈을 포함할 수 있다.
음성인식 모델은, 특징으로부터 결과값 산출 음성 신호의 전처리를 통해 얻어낸 특징을 바탕으로, 문장을 구성하는데 필요한 원소인 음소, 음절, 단어를 인식해내는 패턴 식별 모듈을 포함할 수 있다.
음성인식 모델은 언어 모듈 또는 음성인식 모듈로부터 출력된 벡터 값에 대한 음소, 음절, 단어를 재구성하여 문장을 획득하는 후처리 동작을 수행하는 후처리 모듈을 포함할 수 있다.
서버(200)는 사용자 명령 데이터, 예를 들어, 음성 데이터 또는 텍스트 데이터에 대응되는 텍스트 데이터를 식별할 수 있다(S430). 여기서, 서버(200)는 상술한 음성인식 모델에 음성 데이터를 입력하여 텍스트 데이터를 식별할 수도 있다.
서버(200)는 사용자 단말(100)로부터 수신된 사용자 명령 데이터에 대응되는 텍스트 데이터의 의미를 식별할 수 있다(S440). 서버(200)는 식별된 의미에 기초하여 텍스트 데이터에 대응되는 자동차 GUI의 출력 제어 신호를 생성하고(S450), 식별된 의미에 기초하여 텍스트 데이터에 대응되는 답변 데이터를 생성할 수 있다(S460).
여기서, 서버(200)는 텍스트 데이터를 언어 모델에 입력하여 텍스트 데이터의 의미를 식별하고, 텍스트 데이터에 대응되는 출력 제어 신호 및 답변 데이터를 생성할 수 있다.
언어 모델은, 언어모델은 단어 시퀀스에 대해 확률을 할당하는 모델이며, 확률적 언어모델(Probabilistic Language Model)로도 불린다.
언어 모델은, 예를 들어, 거대 언어 모델(LLM, Large Language Model )일 수 있으며, 거대 언어 모델은 방대한 양의 데이터에 기반하여 자기 지도 학습 또는 반자기지도학습을 통해 레이블링 되지 않은 텍스트로 학습된 딥러닝 모델이다.
거대 언어 모델에 기반하여 입력된 자연어를 인식하고 해석하는 자연어 처리(NLP, Natural Language Processing), 단어, 문장을 생성하고, 보강하고, 재구성하는 자연어 생성(NLG, Natural Language Generation)이 이루어질 수 있다.
보다 구체적으로, 거대 언어 모델은 기계 번역, 텍스트 요약, 질의 응답 시스템, 대화 시스템, 컨텐츠 생성 등에 이용될 수 있다.
거대 언어 모델은, 텍스트 임베딩을 통해 입력된 텍스트 데이터를 잠재 공간 상의 벡터 값으로 변환하고, 잠재 공간 상의 벡터 값에 기초하여 비슷한 의미를 가진 단어 및 구문의 문맥은 물론 품사와 같은 단어 간의 기타 관계를 식별할 수 있고, 이러한 벡터 값 간의 관계에 기초하여 자연어 처리, 자연어 생성 등에 대한 결과 값을 출력할 수 있다.
구체적으로, 서버(200)는 식별된 의미에 기초하여 텍스트 데이터에 포함된 자동차의 부품 또는 부품 그룹을 식별할 수 있다.
자동차의 부품은 자동차가 포함하는 부품, 부속품, 구성일 수 있다. 예를 들어, 계기판, 핸들, 기어, 센터페시아, 와이퍼, 사이드 미러, 브레이크 페달, 송풍구, 공조 장치 조작 버튼, 창문 버튼, 트렁크, 헤드램프, 테일램프 등일 수 있으나, 이에 국한되지 않는다.
부품 그룹은, 텍스트 데이터에 포함된 부품과 관련되어 하나의 기능 또는 동일한 항목의 기능(예: 구동, 속도 제어, 공기 조화, 창문 개폐 등)을 수행하는 일군의 부품들일 수 있다. 예를 들어, 식별된 텍스트에 포함된 부품이 바퀴인 경우, 바퀴에 대한 부품 그룹은 휠, 타이어, 브레이크 패드, 브레이크 캘리퍼로 구성될 수 있다. 또한, 식별된 텍스트에 포함된 부품이 운전대인 경우, 운전대에 대한 부품 그룹은 운전대를 구성하는 핸들, 방향지시등 레버, 와이퍼 레버, 운전대 위치조정 레버 등으로 이루어질 수 있다. 식별된 텍스트에 포함된 부품이 창문인 경우, 창문에 대한 부품 그룹은 창문 조작 버튼, 창문 등으로 이루어질 수 있다. 식별된 텍스트에 포함된 부품이 공조 장치인 경우, 공조 장치에 대한 부품 그룹은 에어컨/히터 조작 버튼, 송풍구 등으로 이루어질 수 있다. 부품 그룹은 속도 제어 그룹일 수 있다. 식별된 텍스트 데이터에 포함된 부품이 페달인 경우, 페달에 대한 부품 그룹은 브레이크 페달, 엑셀러레이터 페달, 클러치 페달 드응로 이루어질 수 있다.
그리고, 서버(200)는, 식별된 자동차의 부품 또는 식별된 부품 그룹에 대응되는 자동차의 기능을 식별할 수 있다.
자동차의 기능은 예를 들어, 공조 장치를 이용한 실내 온도 조절, 액셀러레이터 페달을 밟아 가속하는 기능, 선루프 개폐 기능, 창문 개폐 기능, 와이퍼 기능, 음악 재생 기능, 실내 조명 동작 기능, 핸들 조향 기능, 기어 조작 기능 등일 수 있으나, 이에 국한되지 않는다.
식별된 자동차의 부품 또는 식별된 부품 그룹에 대한 확대 이미지를 사용자 단말(100)이 출력하기 위한 GUI의 출력 제어 신호를 생성할 수 있다.
서버(200)는 식별된 자동차의 부품 또는 식별된 부품 그룹에 대응되는 자동차의 기능이 수행되는 영상을 출력하기 위한 GUI의 출력 제어 신호를 생성할 수 있다.
다양한 실시 예에 따르면, 서버(200)는 텍스트 데이터에 복수의 자동차 부품 또는 부품 그룹이 포함되어 있는 경우, 식별된 텍스트의 의미에 기초하여 복수의 자동차 부품 또는 부품 그룹 각각에 대한 3차원 이미지를 사용자 단말(100)이 기 설정된 시간 동안 순차적으로 출력하도록 하는 GUI의 출력 제어 신호를 생성할 수 있다.
여기서, 서버(200)는 식별된 텍스트 데이터에 포함된 복수의 부품 중 식별된 부품에 대응되는 부품 그룹의 부품 수가 많거나, 식별된 부품에 대응되는 기능수행과 관련하여 운전자에게 제공되는 정보가 많은 부품일수록 긴 시간 동안 해당 부품에 대한 3차원 이미지를 사용자 단말(100)이 출력하도록 하고, 복수의 부품 중 식별된 부품에 대응되는 부품 그룹의 구성요소 적거나, 식별된 부품에 대응되는 기능수행과 관련하여 운전자에게 제공되는 정보가 적은 부품일수록 짧은 시간 동안 해당 부품에 대한 3차원 이미지를 사용자 단말(100)이 출력하도록 GUI의 출력 제어 신호를 생성할 수 있다.
여기서, 기능수행과 관련하여 운전자에게 제공되는 정보는, 해당 부품이 기능을 수행할 때 시각적, 청각적으로 양적, 수치적으로 제공되는 정보를 의미할 수 있다. 예를 들어, 부품이 계기판의 경우, 사용자에게 제공되는 정보는, 속력, 엔진의 분당 회전수, 연료 게이지 등일 수 있다. 또한, 예를 들어, 부품이 공조 장치인 경우, 사용자에게 제공되는 정보는, 온도 정보, 풍향 정보, 바람 세기 정보일 수 있다.
다양한 실시 예에 따르면, 서버(200)는, 식별된 텍스트 데이터에 포함된 제1 부품에 대응되는 부품 그룹에 포함된 부품 수가 제1 기 설정된 값 미만이고, 부품에 대응되는 기능수행과 관련하여 운전자에게 제공되는 정보가 제2 기 설정된 값 이상인 부품에 대한 3차원 이미지를 사용자 단말(100)이 출력하는 제1 시간보다 식별된 텍스트 데이터에 포함된 부품에 대응되는 부품 그룹에 포함된 부품 수가 제1 기 설정된 값 이상이고, 부품에 대응되는 기능수행과 관련하여 운전자에게 제공되는 정보가 제2 기 설정된 값 미만인 부품에 대한 3차원 이미지를 사용자 단말(100)이 출력하는 제2 시간이 짧은 GUI의 출력 제어 신호를 생성할 수 있다.
서버(200)는 식별된 텍스트 데이터의 의미에 기초하여 사용자 단말(100)을 통해 출력 중인 자동차 GUI에 대응되는 사용자의 1인칭 시점 각도 및 사용자의 1인칭 시점 거리 중 적어도 하나에 대한 변경 정보를 식별할 수 있다.
서버(200)는, 식별된 변경 정보에 기초하여 사용자 단말(100)을 통해 출력 중인 자동차 GUI에 대응되는 사용자의 1인칭 시점 각도 및 사용자의 1인칭 시점 거리 중 적어도 하나를 변경하는 GUI의 출력 제어 신호를 생성할 수 있다.
서버(200)는, 식별된 의미에 기초하여 텍스트 데이터에 포함된 자동차의 부품 또는 부품 그룹을 식별하고, 식별된 자동차의 부품 또는 식별된 부품 그룹에 대한 설명을 포함하는 답변 데이터를 생성할 수 있다.
서버(200)는, 식별된 자동차의 부품 또는 식별된 부품 그룹에 대응되는 자동차의 기능을 식별하고, 식별된 자동차의 기능에 대한 설명을 포함하는 답변 데이터를 생성할 수 있다.
이외에도 서버(200)는 사용자 단말(100)로부터 수신된 사용자 명령 데이터가 자동차 GUI에 확대, 축소, 이동, 전환에 대한 GUI 제어를 위한 터치 명령인 경우, 해당 터치 명령에 대응되는 자동차 GUI의 확대, 축소, 이동, 전환에 대한 GUI 출력 제어 신호를 생성할 수 있다.
서버(200)는 제어 신호 및 답변 데이터를 사용자 단말(100)로 전송할 수 있다(S470).
사용자 단말(100)은 자동차 GUI 및 답변 데이터를 출력하여 사용자에게 제공할 수 있다(S480).
사용자 단말(100)은 사용자 단말(100)이 자동차 GUI를 디스플레이를 통해 출력하여 사용자에게 제공할 수 있다.
사용자 단말(100)은 사용자 단말(100)이 답변 데이터에 대응되는 답변 음성을 스피커를 통해 출력하여 사용자에게 제공할 수 있다. 다만, 이에 국한되지 않고, 사용자 단말(100)은 답변 데이터에 대응되는 텍스트를 디스플레이를 통해 출력하여 사용자에게 제공할 수 있다.
상술한 시스템은 사용자 단말(100)과 서버(200)의 구성으로 이루어진 시스템뿐만 아니라 하나의 전자 장치의 동작을 통해서 구현될 수도 있다.
도 7은 본 개시의 일 실시 예에 따른, 전자 장치의 동작을 설명하기 위한 흐름도이다.
도 7을 참조하면, 디스플레이를 통해 자동차 GUI를 출력하는 동안 사용자 명령 데이터가 획득되면, 전자 장치는 사용자 명령 데이터에 대응되는 텍스트 데이터를 식별할 수 있다(S710).
전자 장치는 텍스트 데이터의 의미를 식별할 수 있다(S720).
전자 장치는 식별된 의미에 기초하여 텍스트 데이터에 대응되는 자동차 GUI의 출력 제어 신호를 생성할 수 있다(S730).
전자 장치는 식별된 의미에 기초하여 텍스트 데이터에 대응되는 답변 데이터를 생성할 수 있다(S740).
전자 장치는 출력 제어 신호에 대응되는 자동차 GUI 및 답변 데이터를 디스플레이 및 스피커 중 적어도 하나를 통해 출력하여 사용자에게 제공할 수 있다(S750).
본 개시에 따른 인공지능과 관련된 기능은 사용자 단말(100) 또는 서버(200)의 프로세서(160)(230)와 메모리(150)(220)를 통해 동작된다.
프로세서(160)(230)는 하나 또는 복수의 프로세서(160)(230)로 구성될 수 있다. 이때, 하나 또는 복수의 프로세서(160)(230)는 CPU(Central Processing Unit), GPU(Graphic Processing Unit), NPU(Neural Processing Unit) 중 적어도 하나를 포함할 수 있으나 전술한 프로세서(160)(230)의 예시에 한정되지 않는다.
CPU는 일반 연산뿐만 아니라 인공지능 연산을 수행할 수 있는 범용 프로세서(160)(230)로서, 다계층 캐시(Cache) 구조를 통해 복잡한 프로그램을 효율적으로 실행할 수 있다. CPU는 순차적인 계산을 통해 이전 계산 결과와 다음 계산 결과의 유기적인 연계가 가능하도록 하는 직렬 처리 방식에 유리하다. 범용 프로세서(160)(230)는 전술한 CPU로 명시한 경우를 제외하고 전술한 예에 한정되지 않는다.
GPU는 그래픽 처리에 이용되는 부동 소수점 연산 등과 같은 대량 연산을 위한 프로세서(160)(230)로서, 코어를 대량으로 집적하여 대규모 연산을 병렬로 수행할 수 있다. 특히, GPU는 CPU에 비해 컨볼루션(Convolution) 연산 등과 같은 병렬 처리 방식에 유리할 수 있다. 또한, GPU는 CPU의 기능을 보완하기 위한 보조 프로세서(160)(230)(co-processor)로 이용될 수 있다. 대량 연산을 위한 프로세서(160)(230)는 전술한 GPU로 명시한 경우를 제외하고 전술한 예에 한정되지 않는다.
NPU는 인공 신경망을 이용한 인공지능 연산에 특화된 프로세서(160)(230)로서, 인공 신경망을 구성하는 각 레이어를 하드웨어(예로, 실리콘)로 구현할 수 있다. 이때, NPU는 업체의 요구 사양에 따라 특화되어 설계되므로, CPU나 GPU에 비해 자유도가 낮으나, 업체가 요구하기 위한 인공지능 연산을 효율적으로 처리할 수 있다. 한편, 인공지능 연산에 특화된 프로세서(160)(230)로, NPU 는 TPU(Tensor Processing Unit), IPU(Intelligence Processing Unit), VPU(Vision processing unit) 등과 같은 다양한 형태로 구현 될 수 있다. 인공 지능 프로세서(160)(230)는 전술한 NPU로 명시한 경우를 제외하고 전술한 예에 한정되지 않는다.
또한, 하나 또는 복수의 프로세서(160)(230)는 SoC(System on Chip)으로 구현될 수 있다. 이때, SoC에는 하나 또는 복수의 프로세서(160)(230) 이외에 메모리(150)(220), 및 프로세서(160)(230)와 메모리(150)(220) 사이의 데이터 통신을 위한 버스(Bus)등과 같은 네트워크 인터페이스를 더 포함할 수 있다.
사용자 단말(100) 또는 서버(200)에 포함된 SoC(System on Chip)에 복수의 프로세서(160)(230)가 포함된 경우, 사용자 단말(100) 또는 서버(200)는 복수의 프로세서(160)(230) 중 일부 프로세서(160)(230)를 이용하여 인공지능과 관련된 연산(예를 들어, 인공지능 모델의 학습(learning)이나 추론(inference)에 관련된 연산)을 수행할 수 있다. 예를 들어, 사용자 단말(100) 또는 서버(200)는 복수의 프로세서(160)(230) 중 컨볼루션 연산, 행렬 곱 연산 등과 같은 인공지능 연산에 특화된 GPU, NPU, VPU, TPU, 하드웨어 가속기 중 적어도 하나를 이용하여 인공지능과 관련된 연산을 수행할 수 있다. 다만, 이는 일 실시예에 불과할 뿐, CPU 등과 범용 프로세서(160)(230)를 이용하여 인공지능과 관련된 연산을 처리할 수 있음은 물론이다.
또한, 사용자 단말(100) 또는 서버(200)는 하나의 프로세서(160)(230)에 포함된 멀티 코어(예를 들어, 듀얼 코어, 쿼드 코어 등)를 이용하여 인공지능과 관련된 기능에 대한 연산을 수행할 수 있다. 특히, 사용자 단말(100) 또는 서버(200)는 프로세서(160)(230)에 포함된 멀티 코어를 이용하여 병렬적으로 컨볼루션 연산, 행렬 곱 연산 등과 같은 인공 지능 연산을 수행할 수 있다.
하나 또는 복수의 프로세서(160)(230)는, 메모리(150)(220)에 저장된 기정의된 동작 규칙 또는 인공지능 모델에 따라, 입력 데이터를 처리하도록 제어한다. 기정의된 동작 규칙 또는 인공지능 모델은 학습을 통해 만들어진 것을 특징으로 한다.
여기서, 학습을 통해 만들어진다는 것은, 다수의 학습 데이터들에 학습 알고리즘을 적용함으로써, 원하는 특성의 기정의된 동작 규칙 또는 인공지능 모델이 만들어짐을 의미한다. 이러한 학습은 본 개시에 따른 인공지능이 수행되는 기기 자체에서 이루어질 수도 있고, 별도의 서버(200)/시스템을 통해 이루어 질 수도 있다.
인공지능 모델은, 복수의 신경망 레이어들로 구성될 수 있다. 적어도 하나의 레이어는 적어도 하나의 가중치(weight values)을 갖고 있으며, 이전(previous) 레이어의 연산 결과와 적어도 하나의 정의된 연산을 통해 레이어의 연산을 수행한다. 신경망의 예로는, CNN (Convolutional Neural Network), DNN (Deep Neural Network), RNN (Recurrent Neural Network), RBM (Restricted Boltzmann Machine), DBN (Deep Belief Network), BRDNN(Bidirectional Recurrent Deep Neural Network) 및 심층 Q-네트워크 (Deep Q-Networks), Transformer가 있으며, 본 개시에서의 신경망은 명시한 경우를 제외하고 전술한 예에 한정되지 않는다.
학습 알고리즘은, 다수의 학습 데이터들을 이용하여 소정의 대상 기기(예컨대, 로봇)을 훈련시켜 소정의 대상 기기 스스로 결정을 내리거나 예측을 할 수 있도록 하는 방법이다. 학습 알고리즘의 예로는, 지도형 학습(supervised learning), 비지도형 학습(unsupervised learning), 준지도형 학습(semi-supervised learning) 또는 강화 학습(reinforcement learning)이 있으며, 본 개시에서의 학습 알고리즘은 명시한 경우를 제외하고 전술한 예에 한정되지 않는다.
일 실시 예에 따르면, 본 문서에 개시된 다양한 실시 예들에 따른 방법은 컴퓨터 프로그램 제품(computer program product)에 포함되어 제공될 수 있다. 컴퓨터 프로그램 제품은 상품으로서 판매자 및 구매자 간에 거래될 수 있다. 컴퓨터 프로그램 제품은 기기로 읽을 수 있는 저장 매체(예: compact disc read only memory (CD-ROM))의 형태로 배포되거나, 또는 어플리케이션 스토어(예: 플레이 스토어TM)를 통해 또는 두개의 사용자 장치들(예: 스마트폰들) 간에 직접, 온라인으로 배포(예: 다운로드 또는 업로드)될 수 있다. 온라인 배포의 경우에, 컴퓨터 프로그램 제품(예: 다운로더블 앱(downloadable app))의 적어도 일부는 제조사의 서버, 어플리케이션 스토어의 서버, 또는 중계 서버의 메모리와 같은 기기로 읽을 수 있는 저장 매체에 적어도 일시 저장되거나, 임시적으로 생성될 수 있다.
이상에서는 본 개시의 바람직한 실시 예에 대하여 도시하고 설명하였지만, 본 개시는 상술한 특정의 실시 예에 한정되지 아니하며, 청구범위에서 청구하는 본 개시의 요지를 벗어남이 없이 당해 개시에 속하는 기술분야에서 통상의 지식을 가진 자에 의해 다양한 변형 실시가 가능한 것은 물론이고, 이러한 변형실시들은 본 개시의 기술적 사상이나 전망으로부터 개별적으로 이해되어져서는 안될 것이다.
100: 사용자 단말 200: 서버
110: 디스플레이 210: 통신 인터페이스
120: 스피커 220: 메모리
130: 마이크 230: 프로세서
140: 통신 인터페이스
150: 메모리
160: 프로세서

Claims (10)

  1. 사용자 단말 및 서버를 포함하는 대화형 인공지능 기반의 자동차 인포테인먼트(Car Infotainment) 시스템의 제어 방법에 있어서,
    상기 사용자 단말이 자동차 GUI를 출력하는 동안 사용자 명령 데이터가 획득되면, 상기 사용자 단말이 상기 사용자 명령 데이터를 서버로 전송하는 단계;
    상기 서버가 상기 사용자 단말로부터 수신된 상기 사용자 명령 데이터에 대응되는 텍스트 데이터를 식별하는 단계;
    상기 서버가 상기 텍스트 데이터의 의미를 식별하는 단계;
    상기 서버가 상기 식별된 의미에 기초하여 상기 텍스트 데이터에 대응되는 자동차 GUI의 출력 제어 신호를 생성하는 단계;
    상기 서버가 상기 식별된 의미에 기초하여 상기 텍스트 데이터에 대응되는 답변 데이터를 생성하는 단계;
    상기 서버가 상기 출력 제어 신호 및 상기 답변 데이터를 상기 사용자 단말로 전송하는 단계; 및
    상기 사용자 단말이 상기 출력 제어 신호에 대응되는 자동차 GUI 및 상기 답변 데이터를 출력하여 사용자에게 제공하는 단계;를 포함하는, 제어 방법.
  2. 제1항에 있어서,
    상기 자동차 GUI는,
    기 설정된 자동차 모델의 외관 또는 실내의 3차원 그래픽 이미지인, 제어 방법.
  3. 제1항에 있어서,
    상기 텍스트 데이터의 의미를 식별하는 단계는,
    상기 서버가 상기 식별된 의미에 기초하여 상기 텍스트 데이터에 포함된 자동차의 부품 또는 부품 그룹을 식별하는 단계;를 포함하고,
    상기 GUI의 출력 제어 신호를 생성하는 단계는,
    상기 서버가 상기 식별된 자동차의 부품 또는 상기 식별된 부품 그룹에 대한 확대 이미지를 상기 사용자 단말이 출력하기 위한 GUI의 출력 제어 신호를 생성하는, 제어 방법.
  4. 제3항에 있어서,
    상기 텍스트 데이터의 의미를 식별하는 단계는,
    상기 서버가 상기 식별된 자동차의 부품 또는 상기 식별된 부품 그룹에 대응되는 자동차의 기능을 식별하는 단계;를 포함하고,
    상기 GUI의 출력 제어 신호를 생성하는 단계는,
    상기 서버가 상기 식별된 자동차의 부품 또는 상기 식별된 부품 그룹에 대응되는 자동차의 기능이 수행되는 영상을 출력하기 위한 GUI의 출력 제어 신호를 생성하는, 제어 방법.
  5. 제1항에 있어서,
    상기 텍스트 데이터의 의미를 식별하는 단계는,
    상기 서버가 상기 식별된 의미에 기초하여 상기 사용자 단말을 통해 출력 중인 자동차 GUI에 대응되는 사용자의 1인칭 시점 각도 및 사용자의 1인칭 시점 거리 중 적어도 하나에 대한 변경 정보를 식별하는 단계;를 포함하고,
    상기 GUI의 출력 제어 신호를 생성하는 단계는,
    상기 서버가 상기 식별된 변경 정보에 기초하여 상기 사용자 단말을 통해 출력 중인 자동차 GUI에 대응되는 사용자의 1인칭 시점 각도 및 사용자의 1인칭 시점 거리 중 적어도 하나를 변경하는 GUI의 출력 제어 신호를 생성하는, 제어 방법.
  6. 제1항에 있어서,
    상기 텍스트 데이터의 의미를 식별하는 단계는,
    상기 서버가 상기 식별된 의미에 기초하여 상기 텍스트 데이터에 포함된 자동차의 부품 또는 부품 그룹을 식별하는 단계;를 포함하고,
    상기 답변 데이터를 생성하는 단계는,
    상기 서버가 상기 식별된 자동차의 부품 또는 상기 식별된 부품 그룹에 대한 설명을 포함하는 답변 데이터를 생성하는, 제어 방법.
  7. 제6항에 있어서,
    상기 텍스트 데이터의 의미를 식별하는 단계는,
    상기 서버가 상기 식별된 자동차의 부품 또는 상기 식별된 부품 그룹에 대응되는 자동차의 기능을 식별하는 단계;를 포함하고,
    상기 답변 데이터를 생성하는 단계는,
    상기 서버가 상기 식별된 자동차의 기능에 대한 설명을 포함하는 답변 데이터를 생성하는, 제어 방법.
  8. 제1항에 있어서,
    상기 자동차 GUI 및 상기 답변 데이터를 출력하여 사용자에게 제공하는 단계는,
    상기 사용자 단말이 상기 자동차 GUI를 디스플레이를 통해 출력하여 사용자에게 제공하고,
    상기 사용자 단말이 상기 답변 데이터에 대응되는 답변 음성을 스피커를 통해 출력하여 사용자에게 제공하는, 제어 방법.
  9. 대화형 인공지능 기반의 자동차 인포테인먼트(Car Infotainment)를 제공하는 전자 장치의 제어 방법에 있어서,
    디스플레이를 통해 자동차 GUI를 출력하는 동안 마이크를 통해 사용자 명령 데이터가 획득되면, 상기 사용자 명령 데이터에 대응되는 텍스트 데이터를 식별하는 단계;
    상기 텍스트 데이터의 의미를 식별하는 단계;
    상기 식별된 의미에 기초하여 상기 텍스트 데이터에 대응되는 자동차 GUI의 출력 제어 신호를 생성하는 단계;
    상기 식별된 의미에 기초하여 상기 텍스트 데이터에 대응되는 답변 데이터를 생성하는 단계; 및
    상기 출력 제어 신호에 대응되는 자동차 GUI 및 상기 답변 데이터를 디스플레이 및 스피커 중 적어도 하나를 통해 출력하여 사용자에게 제공하는 단계;를 포함하는, 제어 방법.
  10. 전자 장치의 프로세서의 의해 실행되어 상기 전자 장치가 제9항의 제어 방법을 수행하도록 하는 적어도 하나의 인스트럭션이 저장된 비일시적 컴퓨터 판독가능 기록매체.
KR1020230197817A 2023-12-29 2023-12-29 대화형 인공지능 기반 자동차 인포테인먼트를 제공하기 위한 시스템 및 이의 제어 방법 Active KR102736282B1 (ko)

Priority Applications (2)

Application Number Priority Date Filing Date Title
KR1020230197817A KR102736282B1 (ko) 2023-12-29 2023-12-29 대화형 인공지능 기반 자동차 인포테인먼트를 제공하기 위한 시스템 및 이의 제어 방법
PCT/KR2024/019999 WO2025143636A1 (ko) 2023-12-29 2024-12-06 대화형 인공지능 기반 자동차 인포테인먼트를 제공하기 위한 시스템 및 이의 제어 방법

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
KR1020230197817A KR102736282B1 (ko) 2023-12-29 2023-12-29 대화형 인공지능 기반 자동차 인포테인먼트를 제공하기 위한 시스템 및 이의 제어 방법

Publications (1)

Publication Number Publication Date
KR102736282B1 true KR102736282B1 (ko) 2024-11-29

Family

ID=93705472

Family Applications (1)

Application Number Title Priority Date Filing Date
KR1020230197817A Active KR102736282B1 (ko) 2023-12-29 2023-12-29 대화형 인공지능 기반 자동차 인포테인먼트를 제공하기 위한 시스템 및 이의 제어 방법

Country Status (2)

Country Link
KR (1) KR102736282B1 (ko)
WO (1) WO2025143636A1 (ko)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2025143636A1 (ko) * 2023-12-29 2025-07-03 (주)페르소나에이아이 대화형 인공지능 기반 자동차 인포테인먼트를 제공하기 위한 시스템 및 이의 제어 방법
KR102919564B1 (ko) 2025-04-25 2026-02-02 케이지모빌리티 주식회사 초광대역 통신과 음성인식 기반의 차량 제어시스템 및 방법

Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR20230039799A (ko) * 2021-09-13 2023-03-22 현대자동차주식회사 차량 및 그 제어 방법
KR20230090510A (ko) * 2021-12-15 2023-06-22 현대자동차주식회사 단말기 및 차량

Family Cites Families (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US8407057B2 (en) * 2009-01-21 2013-03-26 Nuance Communications, Inc. Machine, system and method for user-guided teaching and modifying of voice commands and actions executed by a conversational learning system
KR101180278B1 (ko) * 2010-02-25 2012-09-07 연세대학교 산학협력단 증강 현실을 이용한 사용자 설명서 제공 단말기, 서버 및 방법
KR102585545B1 (ko) * 2020-12-31 2023-10-05 채상훈 음성 기반 제품사용설명서 안내 서비스 제공 방법
KR102736282B1 (ko) * 2023-12-29 2024-11-29 (주)페르소나에이아이 대화형 인공지능 기반 자동차 인포테인먼트를 제공하기 위한 시스템 및 이의 제어 방법

Patent Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR20230039799A (ko) * 2021-09-13 2023-03-22 현대자동차주식회사 차량 및 그 제어 방법
KR20230090510A (ko) * 2021-12-15 2023-06-22 현대자동차주식회사 단말기 및 차량

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2025143636A1 (ko) * 2023-12-29 2025-07-03 (주)페르소나에이아이 대화형 인공지능 기반 자동차 인포테인먼트를 제공하기 위한 시스템 및 이의 제어 방법
KR102919564B1 (ko) 2025-04-25 2026-02-02 케이지모빌리티 주식회사 초광대역 통신과 음성인식 기반의 차량 제어시스템 및 방법

Also Published As

Publication number Publication date
WO2025143636A1 (ko) 2025-07-03

Similar Documents

Publication Publication Date Title
KR102728388B1 (ko) 오인식된 단어를 바로잡아 음성을 인식하는 인공 지능 장치 및 그 방법
US11003414B2 (en) Acoustic control system, apparatus and method
EP3992965B1 (en) Voice signal processing method and speech separation method
KR102914202B1 (ko) 단어 사용 빈도를 고려하여 사용자의 음성을 인식하는 인공 지능 장치 및 그 방법
KR102887559B1 (ko) 비식별화된 음성 신호를 학습하는 인공 지능 기기 및 그 방법
KR102912749B1 (ko) 발화 스타일을 고려하여 음성을 인식하는 인공 지능 장치 및 그 방법
US11495214B2 (en) Artificial intelligence device for providing voice recognition service and method of operating the same
US11164586B2 (en) Artificial intelligence apparatus and method for recognizing utterance voice of user
US20200051566A1 (en) Artificial intelligence device for providing notification to user using audio data and method for the same
KR20210057611A (ko) 이미지 데이터에 포함된 객체를 인식하는 인공 지능 장치 및 그 방법
US20200058290A1 (en) Artificial intelligence apparatus for correcting synthesized speech and method thereof
US11769508B2 (en) Artificial intelligence apparatus
US11355101B2 (en) Artificial intelligence apparatus for training acoustic model
US20200001173A1 (en) Method and apparatus for driving an application
KR20190100117A (ko) 인공지능 기반의 홈 시어터 음성 제어 장치 및 방법
KR20220070466A (ko) 지능적 음성 인식 방법 및 장치
US20250178624A1 (en) Speech-based vehicular control
KR102802728B1 (ko) 인공 지능을 이용하여, 안내 서비스를 제공하는 로봇 및 그의 동작 방법
WO2025143636A1 (ko) 대화형 인공지능 기반 자동차 인포테인먼트를 제공하기 위한 시스템 및 이의 제어 방법
KR102770873B1 (ko) 발화 스타일을 제어하여 음성 합성을 하는 인공 지능 장치 및 그 방법
KR102865243B1 (ko) 통역 상황 정보를 제공하는 방법 및 장치
US20210407517A1 (en) Artificial intelligence robot for providing voice recognition function and method of operating the same
US20250378619A1 (en) Generative ai models for image rendering and inverse rendering
KR20250075444A (ko) 기술 맞춤형 사업 컨설팅 알고리즘
CN112860210A (zh) 人工智能设备及其操作方法

Legal Events

Date Code Title Description
PA0109 Patent application

St.27 status event code: A-0-1-A10-A12-nap-PA0109

PA0201 Request for examination

St.27 status event code: A-1-2-D10-D11-exm-PA0201

PA0302 Request for accelerated examination

St.27 status event code: A-1-2-D10-D17-exm-PA0302

St.27 status event code: A-1-2-D10-D16-exm-PA0302

D13-X000 Search requested

St.27 status event code: A-1-2-D10-D13-srh-X000

P11-X000 Amendment of application requested

St.27 status event code: A-2-2-P10-P11-nap-X000

PE0801 Dismissal of amendment

St.27 status event code: A-2-2-P10-P12-nap-PE0801

PE0701 Decision of registration

St.27 status event code: A-1-2-D10-D22-exm-PE0701

GRNT Written decision to grant
PR0701 Registration of establishment

St.27 status event code: A-2-4-F10-F11-exm-PR0701

PR1002 Payment of registration fee

St.27 status event code: A-2-2-U10-U11-oth-PR1002

Fee payment year number: 1

PG1601 Publication of registration

St.27 status event code: A-4-4-Q10-Q13-nap-PG1601

R18-X000 Changes to party contact information recorded

St.27 status event code: A-5-5-R10-R18-oth-X000

R18 Changes to party contact information recorded

Free format text: ST27 STATUS EVENT CODE: A-5-5-R10-R18-OTH-X000 (AS PROVIDED BY THE NATIONAL OFFICE)

R18-X000 Changes to party contact information recorded

St.27 status event code: A-5-5-R10-R18-oth-X000