EP4599440A1 - Fahrzeug und verfahren zur bestimmung von charakteristischen lippenbewegungsmustern - Google Patents

Fahrzeug und verfahren zur bestimmung von charakteristischen lippenbewegungsmustern

Info

Publication number
EP4599440A1
EP4599440A1 EP24755234.2A EP24755234A EP4599440A1 EP 4599440 A1 EP4599440 A1 EP 4599440A1 EP 24755234 A EP24755234 A EP 24755234A EP 4599440 A1 EP4599440 A1 EP 4599440A1
Authority
EP
European Patent Office
Prior art keywords
singing
vehicle
song
vocal
vehicle occupant
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP24755234.2A
Other languages
English (en)
French (fr)
Inventor
Felix Ehret
Alexander Hanuschkin
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Mercedes Benz Group AG
Original Assignee
Mercedes Benz Group AG
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Mercedes Benz Group AG filed Critical Mercedes Benz Group AG
Publication of EP4599440A1 publication Critical patent/EP4599440A1/de
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/48Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
    • G10L25/51Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/003Changing voice quality, e.g. pitch or formants
    • G10L21/007Changing voice quality, e.g. pitch or formants characterised by the process used
    • G10L21/013Adapting to target pitch
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/06Transformation of speech into a non-audible representation, e.g. speech visualisation or speech processing for tactile aids
    • G10L21/16Transforming into a non-visible representation

Definitions

  • the invention relates to a vehicle of the type defined in more detail in the preamble of claim 1 and to a method for determining characteristic lip movement patterns.
  • a vehicle's infotainment system can play media content such as movies, series, music videos, audiobooks, podcasts, songs, and the like.
  • the music played in the vehicle can inspire passengers to sing or hum along. This can be viewed both positively and negatively by individual vehicle occupants.
  • US 2011/0251841 A1 also discloses the coordination and mixing of vocals recorded by geographically distant singers.
  • This document describes an app that can be run on a mobile device such as a smartphone to provide a karaoke function. Songs can be listened to via the smartphone, with the lyrics and pitch information being displayed on the smartphone's screen. The app user can then sing along, and their vocals are recorded using the smartphone's integrated microphone. Data generated via the smartphone can be transmitted to a central server. Several geographically distant people can sing the same song. Recordings made by the different people can be mixed together by the server.
  • the app or server also offers the functionality to perform automatic pitch correction, correcting the sound of off-key passages. Vocal performance can also be evaluated, and the best singers can be ranked.
  • MIDI format Information can be exchanged between the respective devices, among other things, in so-called MIDI format.
  • the app user must independently demonstrate the intention to perform karaoke. Operating the app requires a high level of cognitive effort and is therefore completely unsuitable for use by a person driving a vehicle.
  • DE 102018214 976 A1 discloses a method for controlling a multimedia device and a computer program.
  • a vehicle occupant's reaction to the playback of a multimedia piece in a vehicle is detected by sensors, and the subsequent playback of multimedia pieces is planned using a machine learning method.
  • DE 102022 107293 A1 discloses an assistance system and an assistance method for a vehicle.
  • a vehicle occupant's reaction to the output of a multimedia piece in a vehicle is detected by sensors, and a vehicle function is activated depending on the reaction.
  • CN 1 08 346427 A discloses a method for voice recognition, as well as a device and storage medium suitable for this purpose. This involves comparing acoustically recorded speech with speech recorded by lip reading.
  • the present invention is based on the object of providing an improved vehicle which is characterized by improved user interaction, in particular while driving.
  • a generic vehicle comprising media playback means for outputting songs in the vehicle interior, comprises song determination means for detecting and recording the singing along of at least one vehicle occupant during the output of a song;
  • Vocal analysis means for detecting deviations between the vehicle occupant's singing and the vocals contained in the song
  • Vocal indication means which are designed to indicate to the vehicle occupant at least the deviations between the singing along and the singing and to record the singing along, to compensate for deviations in the singing along by means of an automatic pitch correction and to output the compensated singing along via the media playback means.
  • the singing indication means are further configured to train a machine learning model with the singing behavior of a specific vehicle occupant, so that the machine learning model learns to predict deviations between the singing and the singing along for defined songs when the respective song is played in the vehicle interior before the vehicle occupant sings along to a respective passage of the song, and to determine pitch adjustments that can be used for automatic pitch correction by means of the trained machine learning model and to apply these.
  • the vehicle according to the invention is thus able to react appropriately to a specific situation in which a vehicle occupant sings along during use of the vehicle.
  • a vehicle occupant sings along during use of the vehicle.
  • another source will inform the vehicle occupant that they may be singing out of tune. If other vehicle occupants have already pointed this out, but the singing vehicle occupant does not believe the other vehicle occupants, this can prevent an argument from arising, as the vehicle evaluates the singing along from a neutral point of view.
  • a vehicle occupant is singing out of tune, it can also be automatically corrected by applying the aforementioned automatic pitch correction, also known as auto-tune.
  • the vehicle's infotainment system for example the vehicle's infotainment system.
  • the vehicle's radio is used as the audio source, a file stored on a storage medium such as a hard drive, an SSD, an SD card, or a USB drive.
  • a sound file stored on a USB stick is read out, or music is obtained from a music streaming service.
  • a song particularly favored by the driver is played, either accidentally or intentionally. Suddenly, the driver begins to sing along, even though this was not their intention.
  • the vehicle is equipped with a corresponding number of vocal identification, vocal analysis, and vocal indication devices.
  • the singing of a specific vehicle occupant could be evaluated, and the deviation of the singing from the singing in the vehicle could be displayed.
  • Any display device in the vehicle could be used for this purpose, such as the instrument cluster display, the head unit display, a dedicated passenger display, a display integrated into a headrest, and the like. Having the other vehicle occupants follow the singing of the vehicle occupant can be entertaining and thus enhance the driving experience.
  • the media playback means comprise at least acoustic output means such as sound transducers, in particular in the form of loudspeakers, and a corresponding processing unit for controlling the acoustic output means.
  • the processing unit also requires a source of songs, for example in the form of said radio, in the form of a sound file read from a computer-readable storage medium, and/or in the form of an internet stream.
  • the media playback means or the processing unit can also analyze the audio content to be output via the acoustic output means and determine underlying musical characteristics. However, these could also be explicitly present in a corresponding sound file, for example, determined by the respective distributor of the song. This could include, for example, the lyrics, the semantic content of the lyrics, the harmony, the melody, and/or the rhythm of at least a passage of the song, or preferably the entire song.
  • Harmony, melody, and rhythm represent three fundamental systems for classifying music. Harmony describes the structure of pitches, i.e., the simultaneous sounding of several individual sounds. Melody describes the temporal arrangement or sequence of notes. Rhythm indicates the dynamics of music and can be further divided into bar, meter, and tempo.
  • vocal characteristics corresponding to the corresponding musical characteristics can be identified, which allows a comparison by the vocal analysis tools.
  • Singers identified by the vehicle can also be entered into a leaderboard, and their respective singing performances can be tracked.
  • a leaderboard can be maintained locally in each vehicle, allowing the respective vehicle occupants to compete against each other within the vehicle.
  • a corresponding leaderboard can also be maintained across the vehicles in a fleet, for example, managed by a central computing device external to the vehicle, such as a cloud server. This allows users of different vehicles to compete against each other in a singing competition. To do so, the respective vehicle users can log in to their vehicle with an individual user ID, for example, in the form of a user name and a secret password. This links the respective singing performances to the user ID and stores them accordingly with the central computing device external to the vehicle.
  • the vehicle can have communication means such as a telecommunications unit.
  • a respective computing unit of the vehicle can use the telecommunications unit to establish a wireless communication connection to the vehicle-external central computing device, for example, via mobile communications and/or Wi-Fi. This allows information to be exchanged with the Internet via mobile communications or via a Wi-Fi hotspot and then transmitted to the central computing device connected to the Internet.
  • the vocal indication means are further configured to train a machine learning model with the vocal behavior of a specific vehicle occupant, so that the machine learning model learns to predict deviations between the vocals and the along-singing when the respective song is played in the vehicle interior before the vehicle occupant sings along to a respective passage of the song, and to determine and apply pitch adjustments usable for automatic pitch correction using the trained machine learning model.
  • This increases the reliability in determining balanced along-singing.
  • classic Auto-Tune methods are capable of performing automatic pitch correction almost in real time, this is still associated with a certain latency.
  • the balanced along-singing played in the vehicle interior does not completely synchronize with the singing in terms of time.
  • this disadvantage can be overcome with the help of the appropriately trained machine learning model.
  • the corresponding machine learning model gradually learns the singing behavior of the respective vehicle occupant and can thus be enabled to predict song passages that are sung out of tune. This determines not only the overall off-key singing itself, but also the extent to which notes are not pitched correctly. Accordingly, the machine learning model is able to suggest a correction for the extent to which pitch correction is necessary. This allows the pitch to be corrected while the user is singing along, so that the balanced vocals can be played simultaneously with the singing in the vehicle interior. This further improves user interaction with the vehicle.
  • temporally convolutional neural networks can be used in conjunction with short-term memories such as GRUs, also known as Gated Recurrent Units, or LSTMs, also known as Long Short-Term Memory.
  • GRUs also known as Gated Recurrent Units
  • LSTMs also known as Long Short-Term Memory.
  • the vocal determination means comprise at least one microphone for detecting the acoustics in the vehicle interior and a computing unit for processing acoustic signals generated by the microphone, wherein the computing unit is configured to recognize vocal features in the acoustic signals, in particular in the form of the lyrics, the semantic content of the lyrics, the harmony, the melody and/or the rhythm of at least one passage of the song, and wherein the computing unit is further preferably configured to receive the song content from the media playback and subtract it from the acoustic signals. This enables acoustic detection of the singing along in the vehicle interior.
  • the singing vehicle occupant can also be located within the vehicle interior. This makes it possible to determine which vehicle occupant is currently singing.
  • a song is played in the vehicle interior via the media playback device.
  • the song overlays the singing of the vehicle occupant(s). This can make it difficult to capture the singing acoustically.
  • techniques known from so-called audio decomposition can be used.
  • Techniques such as harmonic-percussive residual decomposition, melody-residual decomposition, transient-residual decomposition, robust principle component analysis and/or machine learning methods such as discriminators in the context of a generative adversarial network are used. This makes it possible to separate different sound sources from an audio signal. In this way, the singing along can be differentiated from the vocals contained in the song and the vocals of different vehicle occupants can be distinguished from one another.
  • the computing unit obtains the song content, i.e. the sounds to be output via the vehicle's loudspeakers, directly from the media playback devices, so that the computing unit is reliably able to filter the song content from the acoustic signal recorded by the microphone(s).
  • the singing determination means thus comprise at least one camera that captures at least the face of at least one vehicle occupant and a computing unit for processing camera images generated by the camera, wherein the computing unit is configured to recognize lip movements of the vehicle occupant in the camera images, to compare these with lip movement patterns characteristic of singing, and to recognize the singing by the vehicle occupant if the camera images contain at least one such characteristic lip movement pattern.
  • the singing of a vehicle occupant can be determined not only acoustically but also visually.
  • This way preferably no acoustic detection of the vehicle interior takes place, which improves data protection and thus the privacy of the vehicle occupants.
  • the acoustic vehicle interior detection can be activated and the Vocal analysis and vocal indication devices can be controlled. This further reduces the driver's level of distraction, as no manual control actions are required. This further improves user interaction with the vehicle and also increases road safety due to the reduction in driver distraction.
  • the lip movement patterns characteristic of singing can be stored in a database stored on a respective computing unit. Characteristic lip movement patterns can, for example, have been identified by a service provider or the vehicle manufacturer in previous measurement campaigns. Lip movements can be identified in the camera images using machine vision. Artificial intelligence-based methods, such as machine learning models, particularly in the form of artificial neural networks, can also be used for this purpose.
  • the computing unit is further configured to recognize singing characteristics in the recorded lip movements by comparing them with the characteristic lip movement patterns, in particular in the form of the lyrics, the semantic content of the lyrics, the harmony, the melody and/or the rhythm of at least one passage of the song.
  • the visual detection of the vehicle occupants not only generally allows the singing along to be recognized, but also the singing characteristics can be determined. This can support or replace the acoustic detection of the singing characteristics.
  • the respective singing characteristics can be linked to the characteristic lip movement patterns. For this purpose, appropriate measurement campaigns can be carried out in order to establish a connection between singing characteristics and characteristic lip movement patterns.
  • corresponding karaoke versions can be stored in a computer unit of the vehicle or, as needed, accessed via the Internet via a corresponding service provider.
  • a further advantageous embodiment of the vehicle according to the invention further provides that the vocal indication means are further configured to control the media playback means to reduce the volume of the vocal track contained in the output song and/or to increase the volume of the balanced vocals.
  • the computing unit can also be configured to reduce the volume of the vocal track contained in the song instead of a karaoke version of the respective song played in the vehicle interior and to instead play back the balanced vocals determined by the vocal indication means at a louder level. This makes it easier for the vehicle occupant(s) to perceive their own singing along. Since this is balanced singing along, this significantly increases the well-being of the respective vehicle occupants. The respective vehicle occupants thus perceive that they are hitting the notes of the vocals, which ultimately convinces them of their own singing abilities.
  • a further advantageous embodiment of the vehicle according to the invention further provides that the vocal analysis means are further configured, upon detection of a temporal discrepancy between the singing and the singing along, to cause the output of at least one visual and/or at least one haptic indication in the vehicle interior at the exact time at which the singing requires the intervention of the vehicle occupant.
  • This can improve the vehicle occupant's ability to sing in rhythm with the song. avoid the respective vehicle occupant singing a certain passage of a song too early or too late.
  • methods and means are already known from the prior art, such as the temporal change of a color gradient of the displayed lyrics, whereby the border of the color gradient runs exactly with the song passage to be sung.
  • haptic cues can be output, for example, by the actuators of a massage seat or by imparting vibrations to vehicle elements touched by the vehicle occupant, such as the steering wheel or a gearshift lever.
  • the output of haptic cues is particularly subtle, as only the respective vehicle occupant notices the haptic cue. This makes it easier for them to sing along in time with the song without the other vehicle occupants noticing the assistance.
  • a classification of the vocal mood also referred to as expression classification, can also be performed, whereby the most likely desired expression is assigned to a sequence. Based on this additional dimension, the evaluation It is possible to evaluate vocal elements that deviate from the target at a higher level of abstraction.
  • a method for determining characteristic lip movement patterns comprises the following method steps:
  • Figure 1 shows a vehicle 1 according to the invention, which is designed to detect singing along 6 of at least one vehicle occupant 4 to a song played in the vehicle interior and to react to it in a situation-specific manner.
  • the vehicle 1 comprises media playback means 2 for outputting songs.
  • the media playback means 2 comprise at least acoustic output means, for example in the form of loudspeakers 13, as well as a computing unit 9 for controlling the loudspeakers 13.
  • the computing unit 9 can use different song sources, such as a radio (not shown in detail), a computer-readable storage medium to which the computing unit 9 has access, and/or an internet stream.
  • a mobile device (not shown in detail), such as a smartphone, can also be coupled to the computing unit 9, for example wirelessly via Bluetooth, NFC, or Wi-Fi, or wired, for example via a USB cable or Ethernet cable, and a sound file stored on a computer-readable storage medium of the mobile device can be read out.
  • Lip movement patterns can be compared by the computing unit 9 with known lip movement patterns that occur during singing, thereby identifying the singing along of the vehicle occupant 4.
  • the characteristic lip movement patterns can also contain indications of singing characteristics, such as the lyrics, as well as the harmony, melody, and/or rhythm of the song.
  • the computing unit 9 can read lips by processing the camera images and thereby determine the spoken lyrics. Through a semantic analysis of the lyrics, for example, with the help of natural language recognition models, the semantic content of the lyrics can also be determined.
  • the vocal analysis means 5 can be implemented by program routines executed on the computing unit 9. By means of the vocal analysis means 5, deviations between the vocals 6 of the vehicle occupant 4 and the vocals contained in the song are detected. Furthermore, the vehicle 1 has vocal indication means 7, which are configured to display at least the deviations between the vocals 6 and the vocals to the vehicle occupant 4, to record the vocals 6, to compensate for deviations in the vocals 6 through automatic pitch correction, and to output the compensated vocals via the media playback means 2. Corresponding program routines for providing corresponding method steps can also be stored on the computing unit 9 and executed there accordingly. Furthermore, at least one display device 14 is part of the vocal indication means 7 in order to be able to display the corresponding deviations between the vocals 6 and the vocals.

Landscapes

  • Engineering & Computer Science (AREA)
  • Quality & Reliability (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Fittings On The Vehicle Exterior For Carrying Loads, And Devices For Holding Or Mounting Articles (AREA)

Abstract

Die Erfindung betrifft ein Fahrzeug (1), umfassend Medienwiedergabemittel (2) zur Ausgabe von Liedern im Fahrzeuginnenraum. Das erfindungsgemäße Fahrzeug ist gekennzeichnet durch Gesangbestimmungsmittel (3) zur Detektion und Erfassung des Mitsingens wenigstens eines Fahrzeuginsassen (4) während der Ausgabe eines Lieds; Gesanganalysemittel (5) zur Detektion von Abweichungen zwischen dem Mitgesang (6) des Fahrzeuginsassen (4) und dem im Lied enthaltenen Gesang; und Gesangindikationsmittel (7), welche dazu eingerichtet sind dem Fahrzeuginsassen (4) zumindest die Abweichungen zwischen dem Mitgesang (6) und dem Gesang anzuzeigen und/oder den Mitgesang (6) aufzuzeichnen, Abweichungen des Mitgesangs (6) durch eine automatische Tonhöhenkorrektur auszugleichen und den ausgeglichenen Mitgesang über die Medienwiedergabemittel (2) auszugeben.

Description

Fahrzeug und Verfahren zur Bestimmung von charakteristischen Lippenbewegungsmustern
Die Erfindung betrifft ein Fahrzeug nach der im Oberbegriff von Anspruch 1 näher definierten Art sowie ein Verfahren zur Bestimmung von charakteristischen Lippenbewegungsmustern.
Über das Infotainmentsystem eines Fahrzeugs lassen sich Medieninhalte wie Filme, Serien, Musikvideos, Hörbücher, Podcasts, Lieder und dergleichen abspielen. Die im Fahrzeug wiedergegebene Musik kann die Fahrzeuginsassen dazu anregen mitzusingen oder mitzusummen. Dies kann von individuellen Fahrzeuginsassen sowohl positiv, als auch negativ erachtet werden.
Singt ein Fahrzeuginsasse beispielsweise schief, also trifft die jeweiligen Tonhöhen der Noten nicht oder singt nicht zeitsynchron mit dem Liedtext des Gesangs, so kann dies leicht als störend empfunden werden. Im schlimmsten Falle kann daraus ein Streit entstehen, der in besonderem Ausmaß die fahrzeugführende Person von ihrer Fahraufgabe ablenken kann.
Das insbesondere gemeinsame Singen kann jedoch auch erheiternd wirken und somit für mehr Spaß bei der Nutzung des Fahrzeugs sorgen.
Mit Hilfe der sogenannten Audiodekomposition können Stimmen von begleitender Musik oder Hintergrundgeräuschen separiert werden. Hierzu wird beispielsweise auf Driedger, J., & Müller, M. (2015, April). Extracting singing voice from music recordings by cascading audio decomposition techniques. In 2015 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) (pp. 126-130). IEEE verwiesen.
Ferner sind Methoden zur computergestützten Bewertung von Karaokegesangleistungen bekannt, mit denen der Computer die Gesangleistung so bewerten kann, wie dies auch Menschen tun würden. Hierzu wird auf Tsai, W. H., & Lee, H. C. (2011). Automatic evaluation of karaoke singing based on pitch, volume, and rhythm features. IEEE transactions on audio, speech, and language processing, 20(4), 1233-1243 und Mayor, O., Bonada, J., & Loscos, A. (2009, February). Performance analysis and scoring of the singing voice. In Proc. 35th AES Inti. Conf., London, UK (pp. 1-7) verwiesen.
Aus der US 2011/0251841 A1 ist zudem das Koordinieren und Mischen von Gesang bekannt, welcher von geografisch zueinander entfernten Sängern aufgenommen wurde. Die Druckschrift beschreibt eine auf einem mobilen Endgerät wie einem Smartphone ausführbare App zur Bereitstellung einer Karaokefunktion. Dabei können Lieder über das Smartphone angehört werden, wobei insbesondere der Liedtext sowie Tonhöhenhinweise auf dem Display des Smartphones angezeigt werden. Der Nutzer der App kann dann mitsingen, wobei der Gesang des Nutzers mittels des smartphoneintegrierten Mikrofons aufgezeichnet wird. Über das Smartphone generierte Daten können an einen zentralen Server übermittelt werden. Mehrere geografisch entfernt zueinander befindliche Personen können dasselbe Lied singen. Von den verschiedenen Personen getätigte Aufnahmen können dabei vom Server zusammengemischt werden. Die App bzw. der Server bietet zudem die Funktionalität eine automatische Tonhöhenkorrektur durchzuführen, sodass schief gesungene Passagen im Klang korrigiert werden. Die Gesangleistung kann zudem bewertet werden und die besten Sänger können in einer Rangliste gelistet werden. Informationen können zwischen den jeweiligen Geräten dabei unter anderem im sogenannten MIDI-Format ausgetauscht werden. Ein jeweiliger Appnutzer muss dabei selbstständig die Intention aufweisen Karaoke durchführen zu wollen. Die entsprechende Appbedienung erfordert einen hohen kognitiven Aufwand und ist daher zur Ausführung von einer fahrzeugführenden Person gänzlich ungeeignet.
Zudem offenbart die US 2019/0147841 A1 Mittel zur Darstellung einer Karaokeschnittstelle. Die Druckschrift beschreibt ebenfalls die Nutzung eines mobilen Endgeräts wie eines Smartphones zur Teilnahme an einer gemeinsamen Karaokeaktivität. Dabei können sich die einzelnen Nutzer mit der Frontkamera ihres Smartphones filmen und Videos oder Bilder ihrer Karaokevorstellung aufnehmen und untereinander teilen. Dabei kann eine kamerabasierte Gesichtserkennung durchgeführt werden, um charakteristische Gesichtsmerkmale zu identifizieren und diese als Referenzpunkte zum Aufprägen einer virtuellen Maske zu nutzen. So kann beispielsweise das Gesicht eines Nutzers durch das Gesicht einer berühmten Persönlichkeit, eines Maskottchens oder einer Comicfigur ersetzt werden. Die Gesangqualität der einzelnen Karaokevorstellungen kann ebenfalls ermittelt und bewertet werden. Diese Aufgabe kann sowohl von einem Computersystem, als auch von den Nutzern einer entsprechenden App durchgeführt werden. Dabei kann auch eine Gewichtung der jeweils durch das Computermodell oder die Nutzer bewerteten Gesangsqualität erfolgen. Erfolgreiche bzw. beliebte Nutzer können in einer Rangliste auf den vorderen Plätzen gelistet werden.
Zudem offenbart die DE 102015 014652 B4 ein Kraftfahrzeug und ein Verfahren zum Betreiben des Kraftfahrzeugs, bei welchem ein Text eines Musikstücks ausgegeben wird. Während im Kraftfahrzeug Karaoke von den Fahrzeuginsassen vollführt wird, wird das Kraftfahrzeug zumindest semi-autonom betrieben. Dabei wird eine Tonspur im Fahrzeuginnenraum aufgezeichnet und daraus ermittelt, wie „gut“ der Fahrzeuginsasse das Lied nachsingt.
Zudem offenbart die CN 1 13270082 A ein Fahrzeug mit Karaokefunktion. Dabei wird der in einem Lied enthaltene Gesang mittels Methoden der Stimmunterdrückung aus einem Audiosignal herausgefiltert und das Audiosignal im Fahrzeug ausgegeben. Zudem wird die Akustik im Fahrzeuginnenraum aufgezeichnet, um ein Umgebungsaudiosginal aufzuzeichnen. Aus dem Umgebungsaudiosignal werden Echos herausgefiltert, sodass der Mitgesang eines singenden Fahrzeuginsassen besser wahrnehmbar ist.
Zudem offenbart die DE 102018214 976 A1 ein Verfahren zur Steuerung einer Multimedia-Einrichtung sowie ein Computerprogramm. Dabei wird eine Reaktion eines Fahrzeuginsassen auf die Ausgabe eines Multimedia-Stücks in einem Fahrzeug sensorisch erfasst und mittels eines Maschinenlernverfahrens das weitere Ausgeben von Multimedia-Stücken geplant.
Zudem offenbart die DE 102022 107293 A1 ein Assistenzsystem und ein Assistenzverfahren für ein Fahrzeug. Dabei wird eine Reaktion eines Fahrzeuginsassen auf die Ausgabe eines Multimedia-Stücks in einem Fahrzeug sensorisch erfasst und in Abhängigkeit der Reaktion eine Fahrzeugfunktion angesteuert.
Ferner offenbart die CN 1 08 346427 A ein Verfahren zur Stimmerkennung sowie eine hierzu einsetzbare Vorrichtung und ein Speichermedium. Dabei erfolgt ein Abgleich von akustisch erfasster Sprache und durch Lippenlesen erfasster Sprache. Der vorliegenden Erfindung liegt die Aufgabe zugrunde ein verbessertes Fahrzeug anzugeben, welches sich durch eine verbesserte Nutzerinteraktion, insbesondere während der Fahrt, auszeichnet.
Erfindungsgemäß wird diese Aufgabe durch ein Fahrzeug mit den Merkmalen des Anspruchs 1 gelöst. Vorteilhafte Ausgestaltungen und Weiterbildungen sowie ein Verfahren zur Bestimmung von charakteristischen Lippenbewegungsmustern ergeben sich aus den hiervon abhängigen Ansprüchen.
Ein gattungsgemäßes Fahrzeug, umfassend Medienwiedergabemittel zur Ausgabe von Liedern im Fahrzeuginnenraum, umfasst Gesangbestimmungsmittel zur Detektion und Erfassung des Mitsingens wenigstens eines Fahrzeuginsassen während der Ausgabe eines Lieds;
Gesanganalysemittel zur Detektion von Abweichungen zwischen dem Mitgesang des Fahrzeuginsassen und dem im Lied enthaltenen Gesang; und
Gesangindikationsmittel, welche dazu eingerichtet sind dem Fahrzeuginsassen zumindest die Abweichungen zwischen dem Mitgesang und dem Gesang anzuzeigen und den Mitgesang aufzuzeichnen, Abweichungen des Mitgesangs durch eine automatische Tonhöhenkorrektur auszugleichen und den ausgeglichenen Mitgesang über die Medienwiedergabemittel auszugeben.
Erfindungsgemäß sind die Gesangindikationsmittel ferner dazu eingerichtet, ein Modell des maschinellen Lernens mit dem Gesangverhalten eines bestimmten Fahrzeuginsassen zu trainieren, sodass das Modell des maschinellen Lernens lernt für definierte Lieder Abweichungen zwischen dem Gesang und dem Mitgesang bei der Ausgabe des jeweiligen Lieds im Fahrzeuginnenraum vorherzusagen, bevor der Fahrzeuginsasse eine jeweilige Liedpassage mitsingt, und zur automatischen Tonhöhenkorrektur verwendbare Tonhöhenanpassungen mittels des trainierten Modells des maschinellen Lernens zu bestimmen und diese anzuwenden.
Das erfindungsgemäße Fahrzeug ist mit Hilfe der Gesangbestimmungsmittel, Gesanganalysemittel und Gesangindikationsmittel somit dazu in der Lage situationsspezifisch angemessen auf eine jeweilige Situation zu reagieren, in der ein Fahrzeuginsasse während der Nutzung des Fahrzeugs mitsingt. Durch das Anzeigen der Abweichungen zwischen dem Mitgesang und dem Gesang wird dem jeweiligen Fahrzeuginsassen durch eine weitere Quelle mitgeteilt, dass er gegebenenfalls schief singt. Wird dies bereits von weiteren Fahrzeuginsassen angekreidet, glaubt jedoch der singende Fahrzeuginsasse den anderen Fahrzeuginsassen nicht, so kann hierdurch einem entstehenden Streit vorgebeugt werden, da das Fahrzeug den Mitgesang von einem neutralen Standpunkt aus bewertet. Darüber hinaus kann das Schiefsingen eines Fahrzeuginsassen auch automatisch durch das Anwenden besagter automatischer Tonhöhenkorrektur, auch als sogenanntes Auto-Tune bezeichnet, korrigiert werden. Dies erfolgt bevorzugt auf eine subtile Art und Weise, sodass der jeweilige Fahrzeuginsasse dies nicht merkt. Auch hierdurch lässt sich dem Entstehen von Streit, bedingt durch die schlechten Gesangsfähigkeiten des singenden Fahrzeuginsassen, entgegenwirken. Dies verbessert letztendlich die Verkehrssicherheit, da die fahrzeugführende Person durch den potenziellen Streit im Fahrzeuginnenraum nicht abgelenkt wird.
Die einzelnen Fahrzeuginsassen können jedoch auch am Mitsingen Freude haben. Durch das Anzeigen der Abweichungen zwischen dem Mitgesang und dem Gesang kann der jeweilige Fahrzeuginsasse seine Gesangsfähigkeit trainieren und somit verbessern. Durch das Korrigieren von schiefem Mitgesang mittels Auto-Tune wird es auch schlechten Sängern ermöglicht Freude am Mitsingen zu haben. Dadurch steigt die Stimmung der Fahrzeuginsassen, was letztendlich das Nutzungserlebnis des Fahrzeugs verbessert.
Die Interaktion zwischen dem oder den Fahrzeuginsassen und dem Fahrzeug erfolgt dabei auf eine subtile Art und Weise, sodass die jeweiligen Fahrzeuginsassen, insbesondere die fahrzeugführende Person, kognitiv nicht übermäßig beansprucht werden. So können insbesondere die Gesangbestimmungsmittel Mitgesang im Fahrzeuginnenraum proaktiv detektieren, und müssen hierzu nicht erst von einem Fahrzeuginsassen aktiviert werden. Entsprechend wird auch automatisch die Abweichung zwischen dem Mitgesang und dem Gesang festgestellt und die Gesangindikationsmittel entsprechend angesteuert.
Im einfachsten Falle hält sich lediglich die fahrzeugführende Person im Fahrzeug auf und fährt von einem Startort zu einem Zielort. Über die Medienwiedergabemittel, beispielsweise das Infotainmentsystem des Fahrzeugs, wird Musik wiedergegeben, beispielsweise wird dabei als Audioquelle das Radio des Fahrzeugs verwendet, ein von einem Speichermedium wie einer Festplatte, einer SSD, einer SD-Karte oder einem USB- Stick bevorratetes Soundfile ausgelesen oder aber Musik über einen Musikstreamingdienstleister bezogen. Zufällig oder vorsätzlich wird ein von der fahrzeugführenden Person besonders bevorzugtes Lied abgespielt. Plötzlich fängt die fahrzeugführende Person an mitzusingen, obwohl dies gar nicht beabsichtigt war. Ohne dass die fahrzeugführende Person dies bemerkt, wird der Mitgesang erfasst, die Abweichung zum Gesang bestimmt, der Mitgesang durch die automatische Tonhöhenkorrektur ausgeglichen und der ausgeglichene Mitgesang entsprechend über die Medienwiedergabemittel ausgegeben. Somit merkt die fahrzeugführende Person nicht, dass sie schief singt, was sie ansonsten frustrieren könnte, wodurch wiederum ihre Fähigkeit, das Fahrzeug sicher zu führen, beeinträchtigt werden könnte. Dies lässt sich mit Hilfe des erfindungsgemäßen Fahrzeugs zuverlässig verhindern.
Es könnten sich auch mehr Fahrzeuginsassen im Fahrzeug befinden, wie beispielsweise zwei, drei, vier oder auch noch mehr Fahrzeuginsassen. Der Mitgesang kann dabei auch für die einzelnen Fahrzeuginsassen individuell erfasst und bewertet werden. Hierzu verfügt das Fahrzeug über entsprechend viele Gesangbestimmungsmittel, Gesanganalysemittel und Gesangindikationsmittel.
In einer weiteren Situation könnte der Mitgesang von einem bestimmten Fahrzeuginsassen bewertet werden und die Abweichung des Mitgesangs zum Gesang im Fahrzeug angezeigt werden. Hierzu kann eine beliebige Anzeigevorrichtung im Fahrzeug genutzt werden, wie beispielsweise das Display des Kombiinstruments, der Headunit, ein dediziertes Beifahrerdisplay, eine in eine Kopfstütze integrierte Anzeigevorrichtung und dergleichen. Das Mitverfolgen der Gesangsleistung des Fahrzeuginsassen durch die jeweils anderen Fahrzeuginsassen kann erheiternd wirken und somit für ein gesteigertes Fahrerlebnis sorgen.
Die Medienwiedergabemittel umfassen zumindest akustische Ausgabemittel wie Schallwandler, insbesondere in Form von Lautsprechern, und eine entsprechende Recheneinheit zum Ansteuern der akustischen Ausgabemittel. Die Recheneinheit benötigt darüber hinaus eine Quelle von Liedern, beispielsweise in Form von besagtem Radio, in Form einer von einem computerlesbaren Speichermedium ausgelesenen Sounddatei und/oder in Form des Internetstreams. Die Medienwiedergabemittel bzw. die Recheneinheit kann den über die akustischen Ausgabemittel auszugebenden Audioinhalte dabei auch analysieren und zugrunde liegende Musikmerkmale identifizieren. Diese könnten jedoch auch explizit in einer entsprechenden Sounddatei vorliegen, beispielsweise ermittelt durch den jeweiligen Distributor des Lieds. Hierbei kann es sich beispielsweise um den Liedtext, den semantischen Inhalt des Liedtextes, die Harmonie, die Melodie und/oder den Rhythmus zumindest einer Passage des Lieds oder bevorzugt des vollständigen Lieds, handeln.
So stellen die Harmonie, Melodie und der Rhythmus drei grundlegende Ordnungssysteme zur Klassifizierung von Musik dar. Dabei beschreibt die Harmonie das Gefüge von Tonhöhen, also das gleichzeitige Erklingen mehrerer Einzelklänge. Die Melodie beschreibt die zeitliche Anordnung bzw. Abfolge von Tönen. Der Rhythmus gibt die Dynamik von Musik an und lässt sich wiederum in Takt, Metrum und Tempo unterteilen.
Konkrete Ausführungsformen der Gesangbestimmungsmittel werden im Folgenden noch genannt.
Mit Hilfe der Gesangsbestimmungsmittel lassen sich mit den entsprechenden Musikmerkmalen korrespondierende Gesangmerkmale identifizieren, was einen Vergleich durch die Gesanganalysemittel erlaubt.
Die Gesanganalysemittel vergleichen die Gesangmerkmale mit den Musikmerkmalen und können hierdurch die Abweichungen zwischen dem Mitgesang und dem Gesang identifizieren. Insbesondere untersuchen die Gesanganalysemittel, ob der jeweils singende Fahrzeuginsasse die passende Tonhöhe zum passenden Zeitpunkt trifft und/oder der korrekte Liedtext gesungen wird. Im einfachsten Falle werden die Gesanganalysemittel durch eine auf einer Recheneinheit ausgeführte Programmroutine ausgebildet. Es kann sich dabei um dieselbe Recheneinheit handeln, die auch zur Ausbildung der Medienwiedergabemittel dient. Generell können sowohl die Medienwiedergabemittel, die Gesangsbestimmungsmittel, die Gesanganalysemittel und/oder die Gesangindikationsmittel von einer oder auch von mehreren unterschiedlichen Recheneinheiten bereitgestellte Kapazitäten nutzen.
Vom Fahrzeug identifizierte Mitsänger können ebenfalls in eine Bestenliste eingetragen und somit ihre jeweiligen Gesangsleistungen nachverfolgt werden. Es kann eine jeweilige Bestenliste lokal in einem jeweiligen Fahrzeug vorgehalten und gepflegt werden, sodass jeweilige Fahrzeuginsassen innerhalb des Fahrzeugs gegeneinander in einen Gesangwettbewerb treten können. Eine entsprechende Bestenliste kann auch über die Fahrzeuge einer Fahrzeugflotte hinweg geführt werden, beispielsweise verwaltet durch eine fahrzeugexterne zentrale Recheneinrichtung wie einen Cloudserver. So können die Nutzer verschiedener Fahrzeuge gegeneinander in einen Gesangwettbewerb treten. Hierzu können sich die jeweiligen Fahrzeugnutzer mit einer individuellen Nutzerkennung, beispielsweise in Form eines Nutzernamens und eines geheimen Passworts, an ihrem Fahrzeug anmelden, welches die jeweiligen Gesangsleistungen mit der Nutzerkennung verknüpft und entsprechend bei der fahrzeugexternen zentralen Recheneinrichtung hinterlegt.
Das Fahrzeug kann Kommunikationsmittel wie eine Telekommunikationseinheit aufweisen. Eine jeweilige Recheneinheit des Fahrzeugs kann mittels der Telekommunikationseinheit eine drahtlose Kommunikationsverbindung zur fahrzeugexternen zentralen Recheneinrichtung aufbauen, beispielsweise per Mobilfunk und/oder Wi-Fi. So können per Mobilfunk oder auch über einen Wi-Fi-Hotspot Informationen mit dem Internet ausgetauscht werden und entsprechend an die an das Internet angeschlossene zentrale Recheneinrichtung übertragen werden.
Wie im Vorigen bereits beschrieben, sind die Gesangindikationsmittel ferner dazu eingerichtet ein Modell des maschinellen Lernens mit dem Gesangverhalten eines bestimmten Fahrzeuginsassen zu trainieren, sodass das Modell des maschinellen Lernens lernt für definierte Lieder Abweichungen zwischen dem Gesang und dem Mitgesang bei der Ausgabe des jeweiligen Lieds im Fahrzeuginnenraum vorherzusagen, bevor der Fahrzeuginsasse eine jeweilige Liedpassage mitsingt, und zur automatischen Tonhöhenkorrektur verwendbare Tonhöhenanpassungen mittels des trainierten Modells des maschinellen Lernens zu bestimmen und diese anzuwenden. Dies erhöht die Zuverlässigkeit bei der Bestimmung des ausgeglichenen Mitgesangs. So sind zwar klassische Auto-Tune Verfahren dazu in der Lage, eine automatische Tonhöhenkorrektur nahezu in Echtzeit durchzuführen, jedoch geht dies immer noch mit einer gewissen Latenz einher. Somit stimmt der im Fahrzeuginnenraum ausgegebene ausgeglichene Mitgesang zeitlich nicht vollständig mit dem Gesang überein. Mit Hilfe des entsprechend angelernten Modells des maschinellen Lernens lässt sich dieser Nachteil jedoch überwinden. So lernt das entsprechende Modell des maschinellen Lernens nach und nach das Gesangverhalten des jeweiligen Fahrzeuginsassen und kann dadurch dazu in die Lage versetzt werden, schief gesungene Liedpassagen zu prädizieren. Dabei wird nicht nur das generelle Schiefsingen an sich bestimmt, sondern auch das Ausmaß, also in wieweit Töne nicht in ihrer Tonhöhe getroffen werden. Entsprechend ist das Modell des maschinellen Lernens dazu in der Lage, einen Korrekturvorschlag zu bestimmen, in welchem Ausmaß die Tonhöhenkorrektur erfolgen muss. Dies ermöglicht das Korrigieren der Tonhöhe bereits während dem Mitsingen, sodass der ausgeglichene Mitgesang zeitgleich mit dem Gesang im Fahrzeuginnenraum ausgegeben werden kann. Dies verbessert die Nutzerinteraktion mit dem Fahrzeug noch weiter.
Insbesondere können hierzu zeitlich faltende neuronalen Netze in Verbindung mit Kurzeitspeichern wie GRUs, auch als Gated Recurrent Unit bezeichnet oder LSTMs, auch als Long short-term memory bezeichnet, genutzt werden.
Eine vorteilhafte Weiterbildung des erfindungsgemäßen Fahrzeugs sieht ferner vor, dass die Gesangbestimmungsmittel zumindest ein die Akustik im Fahrzeuginnenraum erfassendes Mikrofon und eine Recheneinheit zur Verarbeitung von dem Mikrofon erzeugten Akustiksignale aufweisen, wobei die Recheneinheit dazu eingerichtet ist, in den Akustiksignalen Gesangmerkmale zu erkennen, insbesondere in Form des Liedtextes, des semantischen Inhalt des Liedtextes, der Harmonie, der Melodie und/oder des Rhythmus zumindest einer Passage des Lieds, und wobei die Recheneinheit darüber hinaus bevorzugt dazu eingerichtet ist den Liedinhalt von den Medienwiedergabe zu empfangen und diesen von den Akustiksignalen abzuziehen. Dies ermöglicht eine akustische Erfassung des Mitgesangs im Fahrzeuginnenraum.
Bevorzugt werden mehrere verteilt im Fahrzeuginnenraum angeordnete Mikrofone zur Erfassung des Mitgesangs verwendet. Dies ermöglicht eine noch zuverlässigere Detektion des Mitsingens. Unter Analyse einer Laufzeitdifferenz mit der der Mitgesang von den jeweiligen Mikrofonen erfasst wird und/oder unter Berücksichtigung einer unterschiedlich hohen Amplitude des jeweiligen Schallsignals, kann dabei auch der singende Fahrzeuginsasse im Fahrzeuginnenraum verortet werden. Dies ermöglicht eine Bestimmung, welcher Fahrzeuginsasse gerade singt.
Über die Medienwiedergabemittel wird dabei ein Lied im Fahrzeuginnenraum wiedergegeben. Das Lied überlagert den Mitgesang des oder der Fahrzeuginsassen. Dies kann das Erfassen des Mitgesangs auf akustische Art und Weise erschweren. Um dem entgegenzuwirken, können aus der sogenannten Audiodekomposition bekannte Techniken eingesetzt werden, wie beispielsweise Harmonic-Percussive-Residual Decomposition, Melody-Residual Decomposition, Transient-Residual Decomposition, Robust Principle Component Analysis und/oder Methoden des maschinellen Lernens, wie Diskriminatoren im Rahmen eines Generative Adversarial Networks. Dies ermöglicht das Separieren verschiedener Soundquellen aus einem Audiosignal. So kann der Mitgesang von dem im Lied enthaltenen Gesang differenziert werden und auch der Gesang unterschiedlicher Fahrzeuginsassen voneinander unterschieden werden. Dies ermöglicht es den Mitgesang des oder der Fahrzeuginsassen „noch klarer zu hören“ und somit zuverlässiger zu extrahieren. Insbesondere bezieht die Recheneinheit den Liedinhalt, also diejenigen über die Lautsprecher des Fahrzeugs auszugebenden Töne, direkt von den Medienwiedergabemitteln, sodass die Recheneinheit zuverlässig dazu in der Lage ist, den Liedinhalt aus dem von dem oder den Mikrofonen aufgenommenem Akustiksignal zu filtern.
Bei einer rein akustikbasierten Analyse zur Detektion von Mitgesang besteht jedoch immer ein Restrisiko, dass der Mitgesang im Fahrzeuginnenraum nicht korrekt identifiziert wird. Entsprechend einer weiteren vorteilhaften Ausgestaltung des erfindungsgemäßen Fahrzeugs, umfassen somit die Gesangbestimmungsmittel zumindest eine wenigstens das Gesicht zumindest eines Fahrzeuginsassen erfassende Kamera und eine Recheneinheit zur Verarbeitung von der Kamera erzeugter Kamerabilder, wobei die Recheneinheit dazu eingerichtet ist Lippenbewegungen des Fahrzeuginsassen in den Kamerabildern zu erkennen, diese mit für das Singen charakteristischen Lippenbewegungsmustern abzugleichen und das Ausüben von Gesang durch den Fahrzeuginsassen zu erkennen, wenn die Kamerabilder zumindest ein solches charakteristisches Lippenbewegungsmuster enthalten. Somit lässt sich das Singen eines Fahrzeuginsassen nicht nur akustisch, sondern auch visuell ermitteln.
Dies kann besonders bevorzugt dazu genutzt werden, das entsprechende Analysieren des Mitgesangs und Anzeigen der Abweichungen zwischen dem Mitgesang und dem Gesang bzw. Ermitteln eines ausgeglichenen Mitgesangs und dessen Ausgabe über die Medienwiedergabemittel, automatisch zu initiieren. So erfolgt bevorzugt keinerlei akustische Erfassung des Fahrzeuginnenraums, was den Datenschutz und damit die Privatsphäre der Fahrzeuginsassen verbessert. Sobald jedoch für das Singen charakteristische Lippenbewegungen identifiziert werden, kann dann die akustische Fahrzeuginnenraumerfassung aktiviert werden und entsprechend die Gesanganalysemittel und Gesangindikationsmittel angesteuert werden. Dies reduziert den Ablenkungsgrad der fahrzeugführenden Person noch weiter, da keinerlei manuelle Bedienhandlungen eingegeben werden müssen. Dies verbessert die Nutzerinteraktion mit Fahrzeug noch weiter und erhöht aufgrund der Reduktion des Ablenkungsgrads der fahrzeugführenden Person auch die Sicherheit im Straßenverkehr.
Die für das Singen charakteristischen Lippenbewegungsmuster können dabei in einer auf einer jeweiligen Recheneinheit bevorrateten Datenbank gespeichert sein. Charakteristische Lippenbewegungsmuster können beispielsweise von einem Dienstleister oder auch dem Fahrzeughersteller in vorausgehenden Messkampagnen identifiziert worden sein. Lippenbewegungen lassen sich dabei mit Hilfe des maschinellen Sehens in den Kamerabildern identifizieren. Besonders bevorzugt können hierzu ebenfalls auf künstlicher Intelligenz basierende Methoden eingesetzt werden, beispielsweise Modelle des maschinellen Lernens, insbesondere in Form von künstlichen neuronalen Netzen.
Bevorzugt ist die die Recheneinheit ferner dazu eingerichtet, durch den Abgleich mit den charakteristischen Lippenbewegungsmustern Gesangmerkmale in den erfassten Lippenbewegungen zu erkennen, insbesondere in Form des Liedtextes, des semantischen Inhalt des Liedtextes, der Harmonie, der Melodie und/oder des Rhythmus zumindest einer Passage des Lieds. Somit lässt sich durch die visuelle Erfassung der Fahrzeuginsassen nicht nur generell das Mitsingen an sich erkennen, sondern die Gesangmerkmale zusätzlich ermitteln. Dies kann die akustische Erfassung der Gesangmerkmale unterstützen oder auch ersetzen. Die jeweiligen Gesangmerkmale können dabei mit den charakteristischen Lippenbewegungsmustern verknüpft sein. Hierzu können entsprechende Messkampagnen durchgeführt worden sein, um einen Zusammenhang zwischen Gesangmerkmalen und charakteristischen Lippenbewegungsmustern herzustellen.
So kann die Recheneinheit dazu in die Lage versetzt werden Lippen zu lesen, also durch das rein visuelle Beobachten der Lippenbewegungen eines Fahrzeuginsassen die jeweils gesprochenen bzw. gesungenen Worte zu identifizieren. Diese Worte können zu einem Textstring gewandelt werden und in ein Modell zur Erkennung von Sprache eingelesen werden. Somit kann nicht nur der Liedtext an sich, sondern auch dessen semantischer Inhalt bestimmt werden. Eine weitere vorteilhafte Ausgestaltung des erfindungsgemäßen Fahrzeugs sieht ferner vor, dass die Gesangbestimmungsmittel ferner dazu eingerichtet sind, die Medienwiedergabemittel beim Detektieren des Mitsingens seitens wenigstens eines Fahrzeuginsassen anzusteuern, um das Ausgeben einer Karaokeversion des im Fahrzeuginnenraum ausgegebenen Lieds zu bewirken, wobei die Karaokeversion eine in ihrer Lautstärke reduzierte Gesangspur umfasst oder gänzlich frei ist von Gesangspuren. Dies erleichtert es dem Fahrzeuginsassen mitzusingen, da der Gesang im Lied weniger stark gehört wird oder sogar gänzlich fehlt, sodass sich die jeweiligen Fahrzeuginsassen besser auf den eigenen Gesang konzentrieren können. Hierzu können in einer Recheneinheit des Fahrzeugs entsprechende Karaokeversionen vorgehalten werden oder auch nach Bedarf über das Internet über einen entsprechenden Dienstleister abgerufen werden.
Eine weitere vorteilhafte Ausgestaltung des erfindungsgemäßen Fahrzeugs sieht ferner vor, dass die Gesangindikationsmittel ferner dazu eingerichtet sind, die Medienwiedergabemittel zur Reduktion der Lautstärke der im ausgegebenen Lied enthaltenen Gesangspur und/oder zur Erhöhung der Lautstärke des ausgeglichenen Mitgesangs anzusteuern. Die Recheneinheit kann auch dazu eingerichtet sein anstelle einer Karaokeversion des jeweiligen im Fahrzeuginnenraum ausgegebenen Lieds lediglich die im Lied enthaltene Gesangsspur in ihrer Lautstärke zu reduzieren und dafür den durch die Gesangindikationsmittel bestimmten ausgeglichenen Mitgesang lauter wiederzugeben. Dies erleichtert es dem oder den Fahrzeuginsassen ihren eigenen Mitgesang wahrzunehmen. Da es sich um den ausgeglichenen Mitgesang handelt, steigert dies das Wohlbefinden der jeweiligen Fahrzeuginsassen im besonderen Maß. So nehmen die jeweiligen Fahrzeuginsassen wahr, dass sie die Töne des Gesangs treffen, was sie letztendlich von ihren eigenen Gesangfähigkeiten überzeugt.
Eine weitere vorteilhafte Ausgestaltung des erfindungsgemäßen Fahrzeugs sieht ferner vor, dass die Gesanganalysemittel ferner dazu eingerichtet sind, beim Detektieren einer zeitlichen Abweichung zwischen dem Gesang und dem Mitgesang die Ausgabe wenigstens eines visuellen und/oder wenigstens eines haptischen Hinweises im Fahrzeuginnenraum zu genau dem Zeitpunkt zu bewirken, an dem der Gesang den Einsatz des Fahrzeuginsassen erfordert. Dies kann die Fähigkeiten des Fahrzeuginsassen verbessern im Rhythmus des Lieds zu singen. So lässt sich vermeiden, dass der jeweilige Fahrzeuginsasse eine bestimmte Liedpassage zu früh oder zu spät singt. Zur zeitlichen Indikation, wann welcher Liedtext gesungen werden muss, sind aus dem Stand der Technik bereits Verfahren und Mittel bekannt, wie das zeitliche Ändern eines Farbverlaufs des dargestellten Liedtextes, wobei die Grenze des Farbverlaufs mit genau der zu singenden Liedpassage mitläuft. Erfindungsgemäß können jedoch fahrzeuginterne Vorrichtungen zur Ausgabe der visuellen und/oder haptischen Hinweise genutzt werden. So kann beispielsweise eine im Innenraum des Fahrzeugs angeordnete Leuchte genau dann eingeschaltet werden, wenn der Einsatz des Fahrzeuginsassen gefordert ist. Hierzu könnte beispielsweise auch ein sogenanntes Ambientelicht verwendet werden. Zusätzlich oder alternativ können haptische Hinweise beispielsweise durch die Aktoren eines Massagesitzes oder auch durch das Aufprägen von Schwingungen an vom Fahrzeuginsassen berührte Fahrzeugelemente wie das Lenkrad oder einen Schaltknüppel ausgegeben werden.
Insbesondere die Ausgabe von haptischen Hinweisen ist besonders subtil, da nur der jeweilige Fahrzeuginsasse den haptischen Hinweis bemerkt. Dies erleichtert es ihm in zeitlicher Übereinstimmung mit dem Gesang mitzusingen, ohne dass die übrigen Fahrzeuginsassen die Hilfestellung hierzu bemerken.
Entsprechend einer weiteren vorteilhaften Ausgestaltung des erfindungsgemäßen Fahrzeugs, sind die Gesanganalysemittel ferner dazu eingerichtet, die Abweichung zwischen dem Gesang und dem Mitgesang anhand fest vorgegebener Bewertungsmetriken objektiv zu bewerten und/oder mittels eines Modells des maschinellen Lernens subjektiv zu bewerten, wobei das Modell des maschinellen Lernens mit den subjektiven Bewertungen des Mitgesangs einer Vielzahl an Testhörern in Messkampagnen für ausgewählte Lieder trainiert wurde. Dabei kann eine Gewichtung zwischen einer objektiven Bewertung und einer subjektiven Bewertung erfolgen. Zur objektiven Bewertung der Abweichung des Mitgesangs zum Gesang können beispielsweise Unterschiede auf einer Musical Instrument Digital Interface (MIDI) Notenskala zur Bestimmung einer korrekten Tonhöhe festgestellt werden. Mittels shortterm log-energy können Fehler der relativen Lautstärke bestimmt werden. Mittels Hidden Markov Modellen lassen sich Abweichungen im gesungenen Rhythmus feststellen. Auch kann eine Klassifikation der Gesangsstimmung, auch als Expression Classification bezeichnet, durchgeführt werden, wobei einer Sequenz die wahrscheinlichste angestrebte Expression zugewiesen wird. Anhand dieser zusätzlichen Dimension ist die Bewertung möglich, auch vom Soll abweichende Gesangselemente auf höherer Abstraktionsebene zu bewerten.
Ein Verfahren zur Bestimmung von charakteristischen Lippenbewegungsmustern weist erfindungsgemäß die folgenden Verfahrensschritte auf:
- Übertragen, durch eine in einem im vorigen beschriebenen Fahrzeug vorgesehene Recheneinheit, einer Zuordnung aus Lippenbewegungen und Gesangmerkmalen an eine fahrzeugexterne Recheneinrichtung, wobei die Recheneinheit Musikmerkmale von den Medienwiedergabemitteln empfängt und die den Lippenbewegungen zuzuordnenden Gesangmerkmale aus den Musikmerkmalen extrahiert;
- Aggregieren der von einer Vielzahl von unterschiedlichen Recheneinheiten bezogenen Zuordnungen in einer Übereinstimmungsdatenbank durch die Recheneinrichtung;
- Untersuchen der aggregierten Zuordnungen auf charakteristische Muster hin, um für bestimmte Gesangmerkmale charakteristische Lippenbewegungsmuster zu identifizieren, durch die Recheneinrichtung; und
- Bereitstellen der derartig identifizierten Lippenbewegungsmuster zum Abrufen durch die jeweiligen Recheneinheiten.
Mit Hilfe des erfindungsgemäßen Verfahrens ist es möglich neue charakteristische Lippenbewegungsmuster zu identifizieren und zur Anwendung an die jeweiligen Recheneinheiten der Fahrzeuge zu verteilen. Dies ermöglicht es noch zuverlässiger Gesang durch eine visuelle Erfassung der Fahrzeuginsassen festzustellen sowie darüber hinaus auch noch die jeweiligen Gesangmerkmale zu bestimmen. Zum Untersuchen der aggregierten Zuordnungen auf charakteristische Muster hin, können jeweils ähnliche Lippenbewegungsmuster zu Gruppen geordnet werden. Hierzu können bewährte Gruppierungsalgorithmen, auch als Clustering Algorithmen bezeichnet, eingesetzt werden, wie beispielsweise der k-means-Algorithmus.
Wie bereits im vorigen erwähnt, können die Musikmerkmale wie Liedtext, semantischer Inhalt des Liedtextes, Harmonie, Melodie und/oder Rhythmus zumindest einer Liedpassage in einer entsprechenden Sounddatei enthalten sein oder aber durch Analyse der Sounddatei durch die Recheneinheit bestimmt werden. Diese Musikmerkmale werden dann entsprechenden korrespondierenden Gesangmerkmalen zugeordnet, was wiederum eine entsprechende Zuordnung zu den Lippenbewegungen erlaubt. Weitere vorteilhafte Ausgestaltungen des erfindungsgemäßen Fahrzeugs ergeben sich auch aus dem Ausführungsbeispiel, welches nachfolgend unter Bezugnahme auf die Figur näher beschrieben wird.
Dabei zeigt Figur 1 eine schematisierte Darstellung eines erfindungsgemäßen Fahrzeugs.
Figur 1 zeigt ein erfindungsgemäßes Fahrzeug 1, welches dazu ausgeführt ist, Mitgesang 6 wenigstens eines Fahrzeuginsassen 4 zu einem im Fahrzeuginnenraum ausgegebenen Lied zu detektieren und situationsspezifisch darauf zu reagieren.
Hierzu umfasst das Fahrzeug 1 Medienwiedergabemittel 2 zur Ausgabe von Liedern. Die Medienwiedergabemittel 2 umfassen zumindest akustische Ausgabemittel, beispielsweise in Form von Lautsprechern 13, sowie eine Recheneinheit 9 zum Ansteuern der Lautsprecher 13. Die Recheneinheit 9 kann unterschiedliche Quellen von Liedern nutzen wie beispielsweise ein nicht näher dargestelltes Radio, ein computerlesbares Speichermedium, auf welches die Recheneinheit 9 Zugriff hat, und/oder einen Internetstream. Auch kann ein nicht näher dargestelltes mobiles Endgerät wie ein Smartphone mit der Recheneinheit 9 gekoppelt werden, beispielsweise drahtlos per Bluetooth, NFC oder Wi-Fi, oder auch kabelgebunden, beispielsweise per USB-Kabel oder Ethernet-Kabel, und eine auf einem computerlesbaren Speichermedium des mobilen Endgeräts bevorratete Sounddatei ausgelesen werden.
Das Fahrzeug 1 umfasst ferner Gesangbestimmungsmittel 3 zur Detektion und Erfassung des Mitsingens 6 des wenigstens einen Fahrzeuginsassen 4 während der Ausgabe des Lieds. Hierzu kommt eine rein akustische Überwachung des Fahrzeuginnenraums mittels eines oder mehrerer Mikrofone 8 infrage sowie alternativ oder ergänzend eine visuelle Erfassung des Fahrzeuginnenraums mit Hilfe wenigstens einer Kamera 10, mittels derer mindestens das Gesicht des wenigstens einen Fahrzeuginsassen 4 erfassbar ist. Dies ermöglicht es Lippenbewegungen des Fahrzeuginsassen 4 zu detektieren. Von dem oder den Mikrofonen 8 bzw. der oder den Kameras 10 erzeugte Sensordaten lassen sich ebenfalls durch die Recheneinheit 9 auswerten. In entsprechenden akustischen Signalen lässt sich der Mitgesang 6 des Fahrzeuginsassen 4 besonders einfach erkennen. Es besteht jedoch das Risiko, dass der Mitgesang 6 übertönt wird, beispielsweise durch die im Fahrzeuginnenraum ausgegebenen Lieder oder auch sonstigen Lärm und dadurch nicht korrekt erfasst werden kann. In den entsprechenden Kamerabildern erkannte Lippenbewegungsmuster lassen sich durch die Recheneinheit 9 mit bekannten beim Singen entstehenden Lippenbewegungsmustern abgleichen, wodurch sich das Mitsingen des Fahrzeuginsassen 4 identifizieren lässt. Die charakteristischen Lippenbewegungsmuster können zudem Indizien für Gesangmerkmale enthalten, wie beispielsweise den Liedtext sowie die Harmonie, die Melodie und/oder den Rhythmus des Lieds. So kann die Recheneinheit 9 unter Verarbeitung der Kamerabilder Lippen lesen und dadurch den gesprochenen Liedtext bestimmen. Durch eine semantische Analyse des Liedtextes, beispielsweise mit Hilfe von Modellen zur Erkennung natürlicher Sprache, kann auch der semantische Inhalt des Liedtextes bestimmt werden.
Die Gesanganalysemittel 5 können durch auf der Recheneinheit 9 ausgeführte Programmroutinen ausgebildet werden. Mittels der Gesanganalysemittel 5 werden Abweichungen zwischen dem Mitgesang 6 des Fahrzeuginsassen 4 und dem im Lied enthaltenen Gesang detektiert. Ferner verfügt das Fahrzeug 1 über Gesangindikationsmittel 7, welche dazu eingerichtet sind, den Fahrzeuginsasse 4 zumindest die Abweichungen zwischen dem Mitgesang 6 und dem Gesang anzuzeigen und den Mitgesang 6 aufzuzeichnen, Abweichungen des Mitgesangs 6 durch eine automatische Tonhöhenkorrektur auszugleichen und den ausgeglichenen Mitgesang über die Medienwiedergabemittel 2 auszugeben. Entsprechende Programmroutinen zur Bereitstellung entsprechender Verfahrensschritte können ebenfalls auf der Recheneinheit 9 vorgehalten und entsprechend dort ausgeführt werden. Ferner ist wenigstens eine Anzeigevorrichtung 14 Teil der Gesangindikationsmittel 7, um die entsprechenden Abweichungen zwischen dem Mitgesang 6 und dem Gesang darstellen zu können.
Mit Hilfe eines erfindungsgemäßen Verfahrens lassen sich ferner neue für das Singen charakteristische Lippenbewegungsmuster identifizieren. So bestimmt die Recheneinheit 9 aus von den Medienwiedergabemitteln 2 bezogenen Informationen mit den jeweiligen Gesangmerkmalen korrespondierende Musikmerkmale und ordnet diese entsprechend identifizierten Lippenbewegungen zu. Diese Zuordnungen werden von der Recheneinheit 9 an eine fahrzeugexterne Recheneinrichtung 11 übermittelt, welche eine Übereinstimmungsdatenbank 12 zum Bevorraten dieser Zuordnungen vorhält. Hierzu kann das Fahrzeug 1 über eine Telekommunikationseinheit 15 verfügen. Die fahrzeugexterne zentrale Recheneinrichtung 11 untersucht die Zuordnungen von Musik- bzw. Gesangmerkmalen zu Lippenbewegungen auf das Vorhandensein charakteristischer Muster hin. So lassen sich ähnliche charakteristische Lippenbewegungsmuster für gleiche Gesangmerkmale gruppieren. Lippenbewegungsmuster mit einer hohen Ähnlichkeit werden denselben Musik- bzw. Gesangmerkmalen zugeordnet und können somit zum Abrufen für die jeweiligen Recheneinheiten 9 bereitgestellt werden, um dort zur Bestimmung von Gesangmerkmalen unter Analyse der Lippenbewegungen eingesetzt zu werden.

Claims

Patentansprüche
1. Fahrzeug (1), umfassend Medienwiedergabemittel (2) zur Ausgabe von Liedern im Fahrzeuginnenraum, umfassend
Gesangbestimmungsmittel (3) zur Detektion und Erfassung des Mitsingens wenigstens eines Fahrzeuginsassen (4) während der Ausgabe eines Lieds; Gesanganalysemittel (5) zur Detektion von Abweichungen zwischen dem Mitgesang (6) des Fahrzeuginsassen (4) und dem im Lied enthaltenen Gesang; und Gesangindikationsmittel (7), welche dazu eingerichtet sind dem Fahrzeuginsassen (4) zumindest die Abweichungen zwischen dem Mitgesang (6) und dem Gesang anzuzeigen und den Mitgesang (6) aufzuzeichnen, Abweichungen des Mitgesangs (6) durch eine automatische Tonhöhenkorrektur auszugleichen und den ausgeglichenen Mitgesang über die Medienwiedergabemittel (2) auszugeben, dadurch gekennzeichnet, dass die Gesangindikationsmittel (7) ferner dazu eingerichtet sind ein Modell des maschinellen Lernens mit dem Gesangverhalten eines bestimmten Fahrzeuginsassen (4) zu trainieren, sodass das Modell des maschinellen Lernens lernt für definierte Lieder Abweichungen zwischen dem Gesang und dem Mitgesang (6) bei der Ausgabe des jeweiligen Lieds im Fahrzeuginnenraum vorherzusagen, bevor der Fahrzeuginsasse (4) eine jeweilige Liedpassage mitsingt, und zur automatischen Tonhöhenkorrektur verwendbare Tonhöhenanpassung mittels des trainierten Modells des maschinellen Lernens zu bestimmen und diese anzuwenden.
2. Fahrzeug (1) nach Anspruch 1 , dadurch gekennzeichnet, dass die Gesangbestimmungsmittel (3) zumindest ein die Akustik im Fahrzeuginnenraum erfassendes Mikrofon (8) und eine Recheneinheit (9) zur Verarbeitung von dem Mikrofon (8) erzeugten Akustiksignale aufweisen, wobei die Recheneinheit (9) dazu eingerichtet ist in den Akustiksignalen Gesangmerkmale zu erkennen, insbesondere in Form des Liedtextes, des semantischen Inhalt des Liedtextes, der Harmonie, der Melodie und/oder des Rhythmus zumindest einer Passage des Lieds, und wobei die Recheneinheit (9) darüber hinaus bevorzugt dazu eingerichtet ist den Liedinhalt von den Medienwiedergabemitteln (2) zu empfangen und diesen von den Akustiksignalen abzuziehen.
3. Fahrzeug (1) nach Anspruch 1 oder 2, dadurch gekennzeichnet, dass die Gesangbestimmungsmittel (3) zumindest eine wenigstens das Gesicht zumindest eines Fahrzeuginsassen (4) erfassende Kamera (10) und eine Recheneinheit (9) zur Verarbeitung von der Kamera (10) erzeugter Kamerabilder umfassen, wobei die Recheneinheit (9) dazu eingerichtet ist Lippenbewegungen des Fahrzeuginsassen (4) in den Kamerabildern zu erkennen, diese mit für das Singen charakteristischen Lippenbewegungsmustern abzugleichen und das Ausüben von Gesang durch den Fahrzeuginsassen (4) zu erkennen, wenn die Kamerabilder zumindest ein solches charakteristisches Lippenbewegungsmuster enthalten.
4. Fahrzeug (1) nach Anspruch 3, dadurch gekennzeichnet, dass die Recheneinheit (9) ferner dazu eingerichtet ist durch den Abgleich mit den charakteristischen Lippenbewegungsmustern Gesangmerkmale in den erfassten Lippenbewegungen zu erkennen, insbesondere in Form des Liedtextes, des semantischen Inhalt des Liedtextes, der Harmonie, der Melodie und/oder des Rhythmus zumindest einer Passage des Lieds.
5. Fahrzeug (1) nach einem der Ansprüche 1 bis 4, dadurch gekennzeichnet, dass die Gesangbestimmungsmittel (3) ferner dazu eingerichtet sind, die Medienwiedergabemittel (2) beim Detektieren des Mitsingens seitens wenigstens eines Fahrzeuginsassen (4) anzusteuern, um das Ausgeben einer Karaokeversion des im Fahrzeuginnenraum ausgegebenen Lieds zu bewirken, wobei die Karaokeversion eine in ihrer Lautstärke reduzierte Gesangspur umfasst oder gänzlich frei ist von Gesangspuren.
6. Fahrzeug (1) nach einem der Ansprüche 1 bis 5, dadurch gekennzeichnet, dass die Gesangindikationsmittel (7) ferner dazu eingerichtet sind, die Medienwiedergabemittel (2) zur Reduktion der Lautstärke der im ausgegeben Lied enthaltenen Gesangspur und/oder zur Erhöhung der Lautstärke des ausgeglichenen Mitgesangs anzusteuern.
7. Fahrzeug (1) nach einem der Ansprüche 1 bis 6, dadurch gekennzeichnet, dass die Gesanganalysemittel (5) ferner dazu eingerichtet sind, beim Detektieren einer zeitlichen Abweichung zwischen dem Gesang und dem Mitgesang (6) die Ausgabe wenigstens eines visuellen und/oder wenigstens eines haptischen Hinweises im Fahrzeuginnenraum zu genau dem Zeitpunkt zu bewirken, an dem der Gesang den Einsatz des Fahrzeuginsassen (4) erfordert.
8. Fahrzeug (1) nach einem der Ansprüche 1 bis 7, dadurch gekennzeichnet, dass die Gesanganalysemittel (5) ferner dazu eingerichtet sind, die Abweichung zwischen dem Gesang und dem Mitgesang (6) anhand fest vorgegebener Bewertungsmetriken objektiv zu bewerten und/oder mittels eines Modells des maschinellen Lernens subjektiv zu bewerten, wobei das Modell des maschinellen Lernens mit den subjektiven Bewertungen des Mitgesangs (6) einer Vielzahl an Testhörern in Messkampagnen für ausgewählte Lieder trainiert wurde.
9. Verfahren zur Bestimmung von charakteristischen Lippenbewegungsmustern, gekennzeichnet durch die folgenden Verfahrensschritte:
- Übertragen, durch eine in einem Fahrzeug nach einem der Ansprüche 4 oder 5 bis 8 rückbezogen auf Anspruch 4 vorgesehene Recheneinheit (9), einer Zuordnung aus Lippenbewegungen und Gesangmerkmalen an eine fahrzeugexterne Recheneinrichtung (11), wobei die Recheneinheit (9) Musikmerkmale von den Medienwiedergabemitteln (2) empfängt und die den Lippenbewegungen zuzuordnenden Gesangmerkmale aus den Musikmerkmalen extrahiert; - Aggregieren der von einer Vielzahl von unterschiedlichen Recheneinheiten (9) bezogenen Zuordnungen in einer Übereinstimmungsdatenbank (12) durch die Recheneinrichtung (11);
- Untersuchen der aggregierten Zuordnungen auf charakteristische Muster hin, um für bestimmte Gesangmerkmale charakteristische Lippenbewegungsmuster zu identifizieren, durch die Recheneinrichtung (11); und
- Bereitstellen der derartig identifizierten Lippenbewegungsmuster zum Abrufen durch die jeweiligen Recheneinheiten (9).
EP24755234.2A 2023-09-23 2024-08-09 Fahrzeug und verfahren zur bestimmung von charakteristischen lippenbewegungsmustern Pending EP4599440A1 (de)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
DE102023003866.0A DE102023003866B3 (de) 2023-09-23 2023-09-23 Fahrzeug und Verfahren zur Bestimmung von charakteristischen Lippenbewegungsmustern
PCT/EP2024/072556 WO2025061373A1 (de) 2023-09-23 2024-08-09 Fahrzeug und verfahren zur bestimmung von charakteristischen lippenbewegungsmustern

Publications (1)

Publication Number Publication Date
EP4599440A1 true EP4599440A1 (de) 2025-08-13

Family

ID=92409175

Family Applications (1)

Application Number Title Priority Date Filing Date
EP24755234.2A Pending EP4599440A1 (de) 2023-09-23 2024-08-09 Fahrzeug und verfahren zur bestimmung von charakteristischen lippenbewegungsmustern

Country Status (4)

Country Link
EP (1) EP4599440A1 (de)
CN (1) CN121866619A (de)
DE (1) DE102023003866B3 (de)
WO (1) WO2025061373A1 (de)

Families Citing this family (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
DE102024116504A1 (de) * 2024-06-12 2025-12-18 Audi Aktiengesellschaft Karaokeendgerät

Family Cites Families (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US8868411B2 (en) 2010-04-12 2014-10-21 Smule, Inc. Pitch-correction of vocal performance in accord with score-coded harmonies
US10930256B2 (en) * 2010-04-12 2021-02-23 Smule, Inc. Social music system and method with continuous, real-time pitch correction of vocal performance and dry vocal capture for subsequent re-rendering based on selectively applicable vocal effect(s) schedule(s)
DE102015014652B4 (de) 2015-11-12 2023-05-17 Audi Ag Verfahren zum Betreiben eines Kraftfahrzeugs, bei welchem ein Text eines Musikstücks ausgegeben wird, und Kraftfahrzeug
US20190147841A1 (en) 2017-11-13 2019-05-16 Facebook, Inc. Methods and systems for displaying a karaoke interface
CN108346427A (zh) 2018-02-05 2018-07-31 广东小天才科技有限公司 一种语音识别方法、装置、设备及存储介质
DE102018214976A1 (de) 2018-09-04 2020-03-05 Robert Bosch Gmbh Verfahren zur Steuerung einer Multimedia-Einrichtung sowie Computerprogramm und Einrichtung dazu
CN113270082A (zh) 2020-02-14 2021-08-17 广州汽车集团股份有限公司 一种车载ktv控制方法及装置、以及车载智能网联终端
DE102022107293A1 (de) 2022-03-28 2023-09-28 Bayerische Motoren Werke Aktiengesellschaft Assistenzsystem und Assistenzverfahren für ein Fahrzeug

Also Published As

Publication number Publication date
DE102023003866B3 (de) 2025-02-06
CN121866619A (zh) 2026-04-14
WO2025061373A1 (de) 2025-03-27

Similar Documents

Publication Publication Date Title
EP3661797B1 (de) Verfahren, vorrichtung, mobiles anwendergerät, computerprogramm zur steuerung eines audiosystems eines fahrzeugs
DE102015014652B4 (de) Verfahren zum Betreiben eines Kraftfahrzeugs, bei welchem ein Text eines Musikstücks ausgegeben wird, und Kraftfahrzeug
DE10008226C2 (de) Vorrichtung zur Sprachsteuerung und Verfahren zur Sprachsteuerung
DE102017213252B4 (de) Verfahren, Vorrichtung und Computerprogramm zum Variieren eines in einem Fahrzeug auszugebenden Audio-Inhalts
DE102023003866B3 (de) Fahrzeug und Verfahren zur Bestimmung von charakteristischen Lippenbewegungsmustern
EP3833052A1 (de) Verfahren zum trainieren eines hörsituationen-klassifikators für ein hörgerät
EP3167627A1 (de) Hörsystem mit anwenderspezifischer programmierung
DE102014224120A1 (de) Ausgeben von Audiobeiträgen für ein Fahrzeug
WO2023186546A1 (de) Assistenzsystem und assistenzverfahren für ein fahrzeug
DE102017111443A1 (de) Autiosystem und Verfahren zum Auswählen einer Inhaltsauswahl und/oder zum Einstellen einer Soundeinstellung
DE102017213249A1 (de) Verfahren und System zum Erzeugen einer auditiven Meldung in einem Innenraum eines Fahrzeugs
DE102009032735A1 (de) Vorrichtung und Verfahren zur Wiedergabe von Musik in Fahrzeugen, die nach Aktivierungsgraden kategorisiert ist
DE102017213256B4 (de) Verfahren, Vorrichtung, mobiles Anwendergerät, Computerprogramm zur Steuerung eines Audiosystems eines Fahrzeugs
EP4381498B1 (de) Sprachsignalbearbeitungsvorrichtung, sprachsignalwiedergabesystem und verfahren zum ausgeben eines entemotionalisierten sprachsignals
DE102020209073A1 (de) Verfahren und System zur Abstimmung zwischen einer Musikwiedergabe in einem Kraftfahrzeug und dessen Bewegungen
DE102022212194A1 (de) Emotionspflegevorrichtung und Verfahren dafür
DE102018211133A1 (de) Audioeinrichtung für ein Fahrzeug und Verfahren zum Betrieb einer Audioeinrichtung für ein Fahrzeug
DE102023003673B3 (de) Verfahren zur Steuerung einer Fahrzeugfunktion
DE102023102777B3 (de) Verfahren zum Betreiben eines Gesangsassistenten für ein Fahrzeug sowie Steuervorrichtung und Kraftfahrzeug
DE102016226042A1 (de) Vorrichtung, Fortbewegungsmittel und Verfahren zur Gestaltung eines Übergangs zwischen zwei Audio-Dateien
DE102024003192A1 (de) Verfahren zur Erzeugung, zum Aufzeichnen und/oder zur Aktivierung von Unterhaltungsinhalten in einem Fahrzeug
DE102024003531B3 (de) Verfahren zum Betrieb eines Sprachassistenzsystems in einem Fahrzeug
KR20260057103A (ko) 차량 및 특징적 입술 움직임 패턴을 결정하기 위한 방법
EP4497485B1 (de) Interaktives spielzeugset zum abspielen digitaler medien sowie verfahren zum betreiben eines solchen spielzeugsets
DE102023116308A1 (de) Verfahren zum Anpassen eines Audioinhalts an ein Kompetenzprofil eines Nutzers eines Kraftfahrzeugs, Computerprogramm und/oder computerlesbares Medium, Datenverarbeitungsvorrichtung, Kraftfahrzeug

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20250505

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: EXAMINATION IS IN PROGRESS