EP1504407A1 - Verfahren zum analysieren einer szene sowie entsprechendes datenverarbeitungsgerät und programmprodukt - Google Patents

Verfahren zum analysieren einer szene sowie entsprechendes datenverarbeitungsgerät und programmprodukt

Info

Publication number
EP1504407A1
EP1504407A1 EP03735301A EP03735301A EP1504407A1 EP 1504407 A1 EP1504407 A1 EP 1504407A1 EP 03735301 A EP03735301 A EP 03735301A EP 03735301 A EP03735301 A EP 03735301A EP 1504407 A1 EP1504407 A1 EP 1504407A1
Authority
EP
European Patent Office
Prior art keywords
image
face
segment
scene
area
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
EP03735301A
Other languages
English (en)
French (fr)
Inventor
Gerald Clemens
Carlos Lucas Verdoy
Matthias Marke
Klaus Lukas
Jesus Fernando Guitarte Perez
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Siemens AG
Siemens Corp
Original Assignee
Siemens AG
Siemens Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Siemens AG, Siemens Corp filed Critical Siemens AG
Publication of EP1504407A1 publication Critical patent/EP1504407A1/de
Ceased legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V40/00Recognition of biometric, human-related or animal-related patterns in image or video data
    • G06V40/10Human or animal bodies, e.g. vehicle occupants or pedestrians; Body parts, e.g. hands
    • G06V40/16Human faces, e.g. facial parts, sketches or expressions
    • G06V40/168Feature extraction; Face representation
    • G06V40/171Local features and components; Facial parts ; Occluding parts, e.g. glasses; Geometrical relationships

Definitions

  • the present invention relates to a method for analyzing a scene, in particular for locating a human face in the scene, and a data processing system for executing the method.
  • FIG. 1 shows an exemplary general sequence of an audio-visual speech recognition method.
  • a first branch an acoustic branch, an acoustic speech signal or audio input signal AS1 is processed in an acoustic preprocessing step AVI and speech feature vectors are extracted. With a search over the reference space WEH probabilities for certain phoneme candidates are determined in a subsequent step. This can be done using "Hidden Markov Models" (HMM) or "Artificial Neural Networks" (ANN).
  • HMM Hidden Markov Models
  • ANN Artificial Neural Networks
  • a next step WE12 the most likely Visem candidates for the extracted features are determined from the feature vectors obtained.
  • a recognized speech feature is finally determined from the acoustic and visual candidates by means of a weighting and decision function GEF, which can then be fed to a control device in order to trigger a specific control process, for example.
  • a method for analyzing a scene initially involves defining segments in the captured image which have brightness-specific features.
  • the brightness-specific features can include, for example, light-dark transitions and / or dark-light transitions.
  • a positional relationship of the defined segments to one another is then checked, an existence of a (human) face in the captured image being derived if a selection of defined segments has a specific positional relationship.
  • This means that the method just described can only be concluded from the presence of a face, in particular a human face, by analyzing certain areas of the captured image, namely the segments with brightness-specific features, more precisely by checking the positional relationship of the defined segments.
  • a low computing power is required to carry out the method, which enables resource reduction or resource optimization of a data processing system to carry out the method.
  • the captured image is an image captured by an electronic camera and can be processed electronically.
  • the captured image is composed of individual pixels, to which respective grayscale values are assigned.
  • segments are defined in the captured image in which the brightness-specific features have sharp or abrupt transitions in brightness, for example from dark to light or from light after dark.
  • Such (sharp) transitions in brightness can be found, for example, in a person's face, in particular in the transition from the forehead to the eyebrows or (in the case of people with light hair color) in the transition from the forehead to the shadow of the eye sockets.
  • Such (sharp) brightness transitions are, however, also found in the transition from the upper lip area or lip area to the mouth opening or from the mouth opening to the lip area of the lower lip or to the lower lip area.
  • a further brightness transition occurs between the lower lip and the chin area, more precisely as a shadow area (depending on the lighting conditions or the incidence of light) based on a slight bulging of the lower lip.
  • a shadow area depending on the lighting conditions or the incidence of light
  • the step of defining segments in the captured image comprises processing the image by means of a gradient filter, in particular a horizontal gradient filter, in order in particular to achieve horizontal (sharp) brightness transitions, such as those on the eyebrows, on the eyes, or on the mouth make visible.
  • the processing by means of the gradient filter produces a first processed image in which, at the location of a brightness transition in the captured image, corresponding pixels with a grayscale value are provided in the first processed image, which depend on the sharpness of the brightness transition in the captured image. This means that when the brightness changes within a few pixels from a low brightness value (low grayscale value) to a high brightness value (high grayscale value), corresponding information is entered in the first processed image.
  • the first processed image is displayed in the form of a grayscale image
  • a positive horizontal gradient filter that is applied from top to bottom of the captured image
  • areas of the image in which there are no brightness transitions are displayed in medium gray scale values, while light-dark transitions (from top to bottom) depending on the sharpness of the transitions receive a correspondingly higher gray value than the mean gray value and dark-light transitions (from top to bottom) receive a correspondingly lower gray value depending on the sharpness of the respective transition.
  • the step of defining segments in the captured image can include binarization processing of the first processed image.
  • a second processed image can be generated, for the corresponding pixels, whose gray scale value exceeds a first predetermined threshold value (which is selected depending on the brightness of the captured image), a binary "1" value is assigned, while a binary one is assigned to the other pixels "0" value is assigned.
  • the pixels whose grayscale value exceeds the predetermined first threshold value can be assigned the value "white", while the remaining pixels are assigned the value "black”.
  • Contiguous pixels that are assigned a white value can be seen as a unit of pixels that are written into a geometric shape, such as a rectangle, for subsequent evaluation.
  • This geometric shape can then be defined as a fixed segment. Since it is necessary to filter or extract biometric features, in particular relating to a human face, from the scene captured in the captured image in order to be able to conclude that a human face is present, it is advantageous to discard rich or structures in the captured image that, for example, because of their size or shape, have no biometric features with respect to a face.
  • certain areas of the second processed image with coherent pixels are discarded on the basis of predetermined parameters with regard to size and / or shape of the area or the geometrical shape that describes them, and in particular the pixels assigned to the areas are assigned a black value set.
  • a criterion with regard to the shape of areas of connected pixels with a white value can be, for example, that the height of this area or structure has a value that is too large in contrast to the width of the structure. That means the ratio of height to width is too large.
  • Such a definition becomes clear when - as already mentioned above - segments are defined on the basis of brightness-specific features of horizontally running eyebrows or horizontally running lips or mouth parts. This in turn means that the previously captured image with a large number of pixels is traced back to only a small number of defined segments, from whose positional relationship to one another the presence of a face can now be deduced.
  • each of the defined segments is examined to determine whether there is a second defined segment for a segment to be examined, which exists on a horizontal line or an essentially horizontal line to the determined segment just examined.
  • the second segment does not necessarily have to lie on a horizontal line of pixels encompassed by the segment to be examined, it can also be higher by a predetermined small amount of pixels or lower with respect to the horizontal or horizontal line.
  • a third fixed segment is searched for, which is located below the examined and the second fixed segment and for which it applies that a distance from the examined to the second fixed segment and a distance of a connecting path between has a first predetermined relationship between the examined segment and the second defined segment and the third defined segment.
  • a normal to the connection between the examined and the second defined segment can be defined, the distance from the third segment (along the normal) to the connection between the examined and the second defined segment being included in the first predetermined ratio.
  • the distance between the examined and the second segment can be defined such that the distance from a respective center of the defined segments is used. A center point can easily be determined, in particular when using segments with the geometric shape of a rectangle.
  • the first examination step just described can thus be used to infer the presence of a face by determining the positional relationship between three defined segments. It is assumed here that the examined and the second defined segment represents a respective eyebrow section in the face of a human being, which normally has a striking or sharp light-dark-light transition from top to bottom and is therefore clearly recognizable in the second processed image.
  • the third defined segment represents a segment of a mouth area or the border area forming a shadow between the upper lip and lower lip. It has been found that to determine a human face, the first predetermined ratio between the distance from the examined and the second defined segments to the distance between the Link of the two segments to the third defined segment with a value of 1: 1 to 1: 1.7, in particular from 1: 1.2 to 1: 1.5, is advantageous.
  • each of the defined segments is examined to determine whether a fourth defined segment exists for this segment, which is below, in particular along a vertical, the examined determined segment and for which the horizontal length of the examined determined segment and the distance of the fourth determined segment from the examined determined segment have a second predetermined ratio.
  • This second examination step assumes that the individual eyebrows are not recognizable, in particular in the case of people who wear glasses or sunglasses, but that only a segment or structure that is geometrically the length is recognizable due to the strong contours of the glasses corresponds to the two eyebrows together.
  • the length of this segment comprising the two eyebrows is again in a certain ratio to the distance from the mouth on the face of the user. If two defined segments are thus identified, in which the length of the first segment relative to the distance between the second segment has a second predetermined ratio, then the presence of a human face can also be concluded according to the second examination step.
  • a value of 1: 1 to 1: 1.7, but in particular 1: 1.2 to 1: 1.5, can again be assumed as the valid range for the second predetermined ratio.
  • the first examination step is first carried out, in particular to search for faces of people who are not wearing glasses. If the first examination step shows no result in which no second and third segments have been found for the respective examined segments, the second examination step is carried out below. However, it is also possible to carry out the second and then the first examination step first.
  • the positional relationship of three defined segments to one another or a first predetermined ratio of the distances between the segments to one another is determined and in the second examination step the positional relationship of (two) Segments depending on the size and / or shape, in particular the (horizontal) length, of the first segment are used as a criterion for deriving the presence of a face in the captured image of a scene.
  • extraction of biometric features with regard to the mouth area or lip area from an analysis area by a found third or fourth defined segment can be carried out in a further method step be performed.
  • the third processed image can then represent a sharp light-dark transition from the upper lip region to the “intermediate lip region” or to the mouth opening region, corresponding to the first processed image, with this transition being used to infer the shape of the upper lip can.
  • This determined shape can be subjected to a first test step, which is to use the shape of the upper lip line to determine whether it is actually an upper lip or some other structure. If the upper lip has specific geometrical properties for it, such as a certain (horizontal) length or one or more specific curvatures, it can first be concluded that a mouth part is actually present and thus also that a person's face is present.
  • the feature extraction can pass into a second extraction section or a second test step in which a lower lip or lower lip lip line to be extracted.
  • a lower lip can be identified or extracted, for example, by means of a vertical search algorithm, in which the grayscale values of the upper lip are first determined in the analysis area and then corresponding grayscale values are searched for in a section which is located in the vertical direction below the area of the upper lip. In this way it is possible to skip over very bright areas, such as the teeth, as well as very dark areas, such as the throat area, and to identify one as the lower lip with regard to the brightness of the upper lip.
  • Another option for extracting the lower lip is based on the fact that, with a correspondingly large selection of the analysis area, in which a part of the chin area is included, in particular in the third processed image viewed from bottom to top, a dark area (shadow area ) can be seen below the lower lip, which is due to the fact that the lower lip is normally curved forward by a small amount with respect to the face.
  • the lower lip or lower lip line can be inferred from the bottom to the top based on the lowest and most distinctive brightness transition from dark to light.
  • the upper lip and lower lip have been identified, it is now possible to extract visemes or mouth features by examining the geometric properties of the upper lip and lower lip separately. For example, if the upper lip and lower lip have a small horizontal length, but a strong curvature (the upper lip is strongly curved upwards and the lower lip is strongly curved downwards), it can be concluded, for example, that the mouth area is just a "0" articulated. If, on the other hand, the upper lip and the lower lip have a relatively large horizontal length and almost no curvature, the articulation of the letter "M" can be concluded, for example.
  • a method according to the present invention initially allows brightness-specific segments to be determined on the basis of a captured image in order to infer the presence of a (human) face when checking their positional relationship. It is possible to trigger a control process in a data processing system or data processing arrangement if there are corresponding conditions with regard to the positional relationship, such as are defined, for example, in the first and second predetermined ratio in the first and second examination step in the step of checking the positional relationship , For example, it is possible that a display of the data processing system is only activated when a face of a user is recognized, an (acoustic) speech recognition method is activated, loudspeaker or microphone is activated, etc.
  • a first specific control process can be triggered, while when the letter "M" is recognized, a second specific control process is triggered.
  • a face of a person, in particular the mouth area is to be recorded over a longer period of time in order to extract or derive visemes from it, it is not necessary to carry out an above-mentioned method for each new captured image, which involves checking a positional position Relationship of fixed segments in the captured image to the mouth area can be concluded, the following method can be carried out to reduce the computing power. If a first image is recorded from a scene and the position of the mouth area of a face is determined in this, then it can be assumed that the position is different in a subsequent captured image that is captured by the scene in a fraction of a second later the mouth part found in the first captured image has not shifted very significantly. Such an assumption can, for example, with an image acquisition rate of 10 images
  • an analysis area that is enlarged by a certain factor in the second image can be used in the second image.
  • the expanded analysis area is advantageously arranged at a position in the second captured image, so that it is concentric with the analysis area in the first captured image.
  • the extended analysis area can be larger by a factor of 1.1 to 1.2, ie 10% to 20%, than the analysis area in the first captured image.
  • the expanded analysis area can be reduced again to the size of the original analysis area, whereby it is arranged in position such that it again includes the mouth area of the face.
  • the position of the mouth area changes from the first captured image to the second captured image, a somewhat larger area is first analyzed in the second captured image, and then the size of the analysis area is reduced - and with the movement of the mouth area with respect to Position moved with.
  • an analysis area can be moved or moved with the movement of the mouth area of a detected face and the method remains fixed on its target, the mouth area.
  • a lip tracking mechanism of the type shown above does not. If it is more necessary to capture the entire face of a user, according to an advantageous embodiment, only an image of the (original) analysis area or an image of the new analysis area of the present (second) captured image expanded by a certain factor can be captured during lip tracking and be analyzed. For this purpose, the analysis area can be separately focused be settled.
  • a data processing system or an optical sensor can be an auto focusing device and possibly. have a movement or tracking device for the sensor. Such devices then allow the (new) analysis area to be recorded with a good or the best possible resolution in order to derive features or visems with high quality.
  • this lip tracking mechanism in which only a section of a captured image, namely the analysis area determined in the last captured image, is analyzed, has the advantage that computing power can be saved which would be required if the entire captured image was analyzed each time should be.
  • an arrangement in particular a data processing system, which is set up to carry out a method described above or advantageous refinements thereof.
  • Such an arrangement has an optical sensor, such as a camera, for recording or capturing an image of a scene.
  • a CCD (Charged Coupled Device) camera can be used as the optical sensor or camera.
  • the arrangement further comprises an evaluation device with an optical evaluation section for analyzing the scene shown in the captured image in accordance with a method or refinements thereof shown above. It is not necessary for the optical sensor to be integrated in the arrangement; it can also be connected to the arrangement as an external component or extension component.
  • the arrangement or data processing system can be implemented as a stationary computer, a portable computer, in particular a PDA (Personal Digital Assistant: personal digital assistant), as a mobile radio device or mobile phone.
  • PDA Personal Digital Assistant
  • the method according to the invention is suitable for use in portable or mobile data processing systems, such as PDAs or mobile radio devices or mobile telephones.
  • a program product is created for a data processing system, which contains software code sections with which the method described above or advantageous refinements thereof can be carried out on the data processing system.
  • the program product can be executed by suitable implementation of the method or the advantageous embodiment thereof in a programming language and translation into code executable for the data processing system, in particular its evaluation device.
  • the software code sections are stored for this.
  • a program product is understood to mean the program as a tradable product. It can be in any form, e.g. B. on paper, a computer readable disk or distributed over a network.
  • the method described above or advantageous refinements thereof can be integrated in a method for speech recognition, in particular for acoustic speech recognition.
  • an acoustic speech signal is recorded and phoneme features are determined from the speech signal.
  • phoneme features are determined from the speech signal.
  • HMM Hidden Markov Models
  • ANN Artificial Neural Networks
  • a scene is recorded with a face, the face of the person emitting the acoustic speech signal, and Visem features are extracted from the face or the mouth area thereof. Speech features are then derived using a combination of the phoneme features and Visem features, possibly including a weighting and decision function.
  • the above-mentioned arrangement or data processing system can also be an acoustic one Sensor, such as a microphone, for recording an acoustic speech signal, the evaluation device further comprising a speech recognition section connected to the optical evaluation section and the acoustic sensor for speech recognition.
  • an acoustic one Sensor such as a microphone
  • the method can be used to trigger certain control processes when certain visemes or visem characteristics are present.
  • a so-called push-to-talk function can be implemented, in which a user of the mobile radio device merely presses a push-to-talk button on a radio has to look at the mobile device to start a voice transmission to another mobile radio subscriber. It is also conceivable to use the face recognition or the position recognition of a face or a mouth area in a captured image for game applications.
  • a user By changing the position of his face or mouth area relative to an optical sensor, such as a camera, a user can move, for example, a pointing element on a user interface of a data processing system shown on a display and then by setting certain visems of the mouth area, in particular certain events trigger at the location of the pointing element on the user interface.
  • an optical sensor such as a camera
  • the method only requires a grayscale image with certain brightness values or luminance values.
  • the method is not limited to a grayscale image, but rather is also able to produce a color image (with processed by a color camera, for example). It is essential here that the luminance values of the color image or the image point are again examined and processed (such as when processing the image by means of the gradient filter, etc.).
  • a color image offers further advantages. After capturing the image by a camera or before processing by the gradient filter, as explained above, it is possible to carry out a color classification of the image in a first preparatory step. This means that the image is examined for color values, whereby those image areas are marked which have color values in a specific color range that corresponds to the color values of human skin. These image areas (it can also be just an image area) are now used to carry out the actual examination for face-specific features (starting with the processing by the gradient filter, etc.). For this purpose, these areas can be inscribed in examination frames, which advantageously have a rectangular shape, the examination being carried out in the examination frame according to face-specific features. This procedure has several advantages.
  • the certainty or probability with which a face and not a structure similar in brightness features is found in the scene becomes greater, since the color classification offers another characteristic distinguishing feature (for a face compared to other objects in the scene).
  • the actual examination or processing of only the examination frames which generally have a significantly smaller size than the entire captured image, significantly reduces the processing or computational effort, particularly in the case of gradient filtering.
  • the described method can also be used in the provision of information for image or video transmission services. be det.
  • UMTS Universal Mobile Telecommunications System
  • the import of text messages as banner text or the display of small avatars to improve user interaction also enable new information provision options.
  • the problem with image or video transmission to mobile phones is that the display for displaying an image is very small.
  • the display of information elements is therefore a difficult matter since, if possible, the information element should not cover the face of the subscriber at the other end of the connection (if the face of the other subscriber were constantly covered, a video transmission would not make much sense).
  • a method for inserting an information field into an image of a scene comprises the following steps. First, the presence and position of a face in the image is determined. This can be done using, but is not limited to, a method described above. The face is then inscribed in a face frame object, the face frame object having a geometric shape, in particular that of a rectangle. Now the information field is inserted into the image in such a way that the face frame object and the information field do not overlap.
  • the face frame object is intended to identify a surface that is both the actual frame around the face as well as the area within the frame. In this way, information fields, such as advertising or logos, etc. can be inserted into an image without covering a person's face.
  • the information field can be inserted above, below, left or right of the face frame object, which, as already mentioned, advantageously has the shape of a rectangle.
  • the information field can advantageously be based on a predetermined standard
  • Position is inserted. It would also be conceivable to first reduce the face frame object by a certain amount in the event that the area of the image remaining outside the face frame object is smaller than the area required for the information field, so that the face may be reduced by one small amount protrudes beyond the face frame object, but is still essentially covered by it. It can now be checked whether the area of the image remaining outside the reduced face frame object is smaller than the area required for the information field. If the remaining area is now sufficient, the information field can be placed there, while if the area is too small, the information field is inserted at the previously determined standard position.
  • the information field can in turn be inserted at a predetermined standard position.
  • the information field comprises symbols, logos, alphanumeric characters or moving picture objects.
  • the described method can also be used to focus on an object.
  • the face of the person When capturing images of a person, i.e. in the case of photographs or films, the face of the person should always be in focus regardless of the position of the face in the imaging area of the camera element of a photo or video camera and regardless of the distance to the camera.
  • camera optics ie the arrangement of its lenses, always only sharp objects that are in a certain distance range. If the lens arrangement can be changed, the distance range in which objects are sharply imaged can be set. This is also known as focusing on an object. This focusing can also be carried out automatically by the camera if the camera has a so-called auto focus function. However, the camera can only use objects at certain points in the imaging area for focusing or focusing. For example, it always focuses on the object in the center of the image.
  • a method for automatically focusing on an object comprises the following steps. First, a camera device with an optical sensor for capturing an image, a scene and an imaging device arranged in front of the camera element for imaging the scene on the optical sensor is provided. The position of a face is then determined in the image of the scene captured by the optical sensor. This can be done using, but is not limited to, a method described above. Furthermore, the distance of the face to the camera device is determined by means of a distance measuring device. It is now possible to adjust the imaging device to the determined distance of the face from the camera device in such a way that the face is sharply imaged on the optical sensor.
  • the imaging device In particular in the case of continuous acquisition of images or acquisition at regular time intervals, for example in the context of a video telephony application or a video conference, it is thus possible to ensure that the imaging device also focuses at regular intervals so that a face of a participant is always captured sharply and transmitted to one or more other participants.
  • the method described can also be used to transmit image data.
  • Mobile devices especially mobile phones, with multimedia or video functionality face two major challenges.
  • a low data transmission rate for example in the range of 50 Kbps (kilobits per second) is available for transmitting video content.
  • This requires a very high data compression of the video data to be transmitted, which, however, means coding artifacts, such as " Block formation artifacts "as a result of block-oriented coding according to an H.263 or MPEG4 (Motion Picture Experts Group 4) standard.
  • Block formation artifacts as as a result of block-oriented coding according to an H.263 or MPEG4 (Motion Picture Experts Group 4) standard.
  • MPEG4 Motion Picture Experts Group 4
  • a method for transmitting image data from a first communication device to a second communication device in a communication network has the following steps.
  • the communication network can be a communication network with fixed transceivers, such as base stations, and a core network connecting them, or it can only be a network established between two communication devices.
  • a first image of a scene is provided in the first communication device. This can be done, for example, in that the first image has been recorded by a camera connected to the first communication device or integrated therein.
  • the position of a face in the first image is then determined. This can be done using, but is not limited to, a method described above.
  • the face is then inscribed in a face frame object, which may have the shape of a rectangle, for example.
  • the image area encompassed by the face frame object is cut out so as to obtain a second image.
  • This second picture is then encoded and the encoded second picture is transmitted to the second communication device.
  • the second image can be decoded and displayed, for example, on a display device of the second communication device.
  • only the essential image content of a first captured image namely a face of a person or a communication participant, is encoded and transmitted to a second communication participant.
  • this saves computing power when coding and decoding, and thus brings an extended service life of the communication devices.
  • the entire computing power can be used for the relevant parts of an image, which increases the coding quality and reduces the occurrence of artifacts.
  • the first image can also be encoded and this encoded image can be transmitted to the second communication device.
  • the transmitted second picture is inserted into the first picture at the position at which it was cut out of the first picture in the first communication device.
  • the first image is to be repeatedly encoded and sent to the second communication device at greater time intervals than the second image, that is to say, for example, while the second image is encoded and transmitted 15 times per second, the first image is encoded only once per second and transmitted (which can be accepted since the background that can be seen in the first picture changes only slightly with time).
  • an "artificial” background such as an arbitrarily designed (artificial) frame (after a coding process) to transmit the first to the second communication device.
  • an artificial frame is decoded by the second communication device and merged with the actual image of a face, so that the actual image with the face is arranged within the frame. Since this artificial frame does not change over time, it is sufficient to transmit it only once, for example at the beginning of an image or video transmission.
  • the first communication device can send a new frame to the second communication device in the event of a change (desired by the user of the first communication device).
  • the user of the first communication device can set the appearance of the frame, for example by selecting from a list provided by the communication device.
  • One-off or rare over- Carrying the frame in contrast to the frequent transmission of the image contained on a face) thus reduces the resources for coding the background image and provides the user of the first communication device with a possibility to influence the display of the image data on the second communication device.
  • each of the faces is inscribed in a respective face frame object, cut out as second images, encoded and transmitted to a second communication device.
  • the (second) images can either be put together directly next to one another, inserted in a standard background image provided by the second communication device or in an artificial frame (for a plurality of faces) transmitted by the first communication device, or else, according to the above Embodiment can be used in a corresponding position in the first transmitted image.
  • the transmitted (decoded) second image is surrounded in the second communication device with a visible frame provided by the second communication device, which can have any shapes and colors and can be set in a user-defined manner in the context of a "fun" application.
  • the described method can also be used to convert a
  • Image of a scene can be used.
  • the present invention relates to a method of converting an image of a
  • Scene especially in an image that depicts a human sees, as well as a data processing arrangement for executing the method.
  • cameras are conventionally provided which capture or provide images which have an image format which is larger than an image format which is used for coding or encryption or for displaying on a display.
  • scaling down the image i.e. the size or resolution of the image can be reduced (for example from a VGA (Video Graphics Array) / CIF (Common Intermediate Format) format to a QCIF (Quarter Common Intermediate Format) format).
  • VGA Video Graphics Array
  • CIF Common Intermediate Format
  • QCIF Quadrater Common Intermediate Format
  • the face of a person is the essential object in an image, in particular in image or video transmission methods with reference to the MMS (Multimedia Messaging Service) service or a video telephony application in communication systems or mobile radio communication systems .
  • MMS Multimedia Messaging Service
  • a video telephony application in communication systems or mobile radio communication systems
  • the distance from the person to the camera or, for example, a cell phone having a camera is large, the person's face will appear relatively small in the image and be poorly visible. This effect is further increased if, as already mentioned above, an image for transmission to other mobile telephones or for display on a display (corresponding to the dimensions of a mobile telephone) is scaled down.
  • a method for converting a first image of a scene into a second image with a smaller size comprises the following steps. First, the position of a face in the first image with the first size, which has been captured by a camera, for example, is determined. This can be done using, but is not limited to, a method described above. The face is then inscribed in a face frame object that corresponds to the size of the second image. The image area that is encompassed by the face frame object is then cut out in order to obtain the second image with the desired second size. It is thus possible in a simple manner to effect an automatic scaling down of an image with simultaneous zooming on the essential image component, namely the view of a person. This in turn means that the essential part of the image remains easily recognizable despite being scaled down.
  • the face is inscribed in a second face frame object (the size of which is larger than that of the second image or the first face frame object), and the image area of the first image encompassed by the second face frame object is scaled down to the size of the second image, in order in this way the second face frame object convert to the first face frame object with the desired size of the second image. It is thus also possible to achieve a scaling down with a considerable difference in the size of the first (captured) image and the (desired) second image, the face in the scene being provided as much as possible in the second image.
  • the first image can be in a CIF or VGA format and the second image can be in a QCIF format.
  • Figure 1 shows an exemplary arrangement for audiovisual speech recognition
  • FIG. 2 shows a schematic arrangement of the essential components for analyzing a scene or a face according to a preferred embodiment
  • FIG. 3 shows a schematic arrangement of the method steps according to a primary lip detection mechanism for locating a mouth area in an image of a scene
  • FIG. 4 pictures of a scene from capturing the scene or after two specific processing steps
  • FIG. 5 shows a captured image of a scene with a marked segment of a mouth area
  • Figure 6 is an enlarged view of the mouth area shown in Figure 5 with marked upper lip and lower lip lines;
  • FIG. 8 shows an image of a captured scene with a marked analysis area and an expanded analysis area. rich or an enlarged view of the extended analysis area;
  • FIG. 9 shows the essential components of a data processing arrangement for inserting an information field into an image according to a preferred embodiment
  • FIG. 10 pictures of a scene into which information fields according to the present invention have been inserted
  • FIG. 11 shows a communication arrangement consisting of two mobile telephones and a communication network in which a video telephony application with image processing is carried out in accordance with an embodiment of the present invention
  • FIG. 12 shows a data processing system in the form of a mobile phone for focusing on an object according to an embodiment of the invention
  • FIG. 13 shows the essential components of a communication system or a communication arrangement for transmitting an image from a first communication device to a second communication device according to a preferred embodiment
  • Figures 14 are images of a scene illustrating the extraction of a person's face
  • FIG. 15 shows the essential components of a data processing arrangement for converting the image of a scene according to a preferred embodiment
  • FIG. 2 shows a schematic representation of the components or mechanisms for detecting and analyzing a scene.
  • a camera K is provided as an optical sensor, which is able to capture a scene (a real environment with certain things and / or people).
  • the camera can be designed, for example, as a CCD camera.
  • the camera K is connected to an optical evaluation section OAA, in which various mechanisms or methods for analyzing the scene captured by the camera can run.
  • the optical evaluation section OAA is able to carry out a first or primary lip detection mechanism PLD for locating a face or a mouth area in the captured image of the scene. Accordingly, the optical evaluation section can carry out an alternative or additional second or secondary lip detection mechanism Perform an SLD to locate a face or mouth area.
  • an extraction plausibility check can be carried out on the one hand by means of a feature extraction ME, to determine whether it is actually a mouth part that has been found, and mouth features or viseme of the mouth can be determined on the basis of geometric data Properties of the upper and lower lip are derived.
  • the mouth area or its position found in a first captured image or frame can then be followed up in the following captured images of the scene by means of a lip tracking mechanism or lip tracking mechanism LVM, in order not only to describe individual mouth features of the captured mouth area on their own , but also to track a temporal change in oral characteristics.
  • the PLD, SLD and ME mechanisms Results obtained can be forwarded to a control device SE.
  • a control device SE By means of the determined results or information, namely that a face or a part of the mouth is present in the image captured by the camera K, it is possible to trigger certain control processes, for example in a data processing system or a data processing arrangement.
  • a data processing system designed as a mobile radio device
  • a loudspeaker or a microphone can be switched on in order to enable voice control of the device.
  • the visemas can be fed to an acoustic evaluation section for performing acoustic speech recognition, the acoustic evaluation section AAA being connected to a microphone MIK as an acoustic sensor for detecting an acoustic speech signal from a user.
  • the components OAA, SE and AAA can be viewed as part of an evaluation unit.
  • the components shown in FIG. 2 are arranged in a data processing system in the form of a mobile telephone (other implementations of a data processing system are also possible, of course, in which the components shown in FIG. 2 can be provided), the Camera K can either be permanently integrated in the mobile phone or can be provided as an exchangeable peripheral component. Especially in mostly small mobile devices like that
  • FIG. 3 a schematic representation of the components or individual method steps for realizing the primary lip detection mechanism is shown.
  • An image of a scene captured by the camera K is first fed to an optional image contrast enhancement BKV by means of a histogram-based gray level compensation (histogram qualification) BKV of the individual pixels of the captured image.
  • the image thus improved with the contrast is then processed by a horizontally oriented positive gradient filter GF, by means of which brightness-specific horizontal contours, ie distinctive or sharp light-dark transitions or dark-light transitions, can be extracted.
  • the first processed image obtained in this way is fed to a segmentation algorithm SA in which all the pixels with a gray value above a certain threshold value are assigned the gray level value "white", while the other pixels are assigned the gray level value "black”. In this way, for example, only certain sharp horizontal light-dark transitions can be made visible.
  • SA segmentation algorithm
  • the segments defined in the segmentation algorithm SA can then make a first are subjected to the test step US1, by using the positional relationship of corresponding defined segments or using the positional relationship and the shape or extent of the segments, including biogeometric criteria for a face, for the presence of a face and for the position of the face or the corresponding one Mouth part can be closed.
  • FIGS. 4A to 4C A primary lip detection mechanism described in this way will now be illustrated in detail with reference to FIGS. 4A to 4C.
  • the image that is optionally subjected to an image contrast improvement BKV (cf. FIG. 3) is then subjected to processing by a horizontally oriented positive gradient filter in order to determine horizontal structures, ie striking transitions in brightness.
  • Such a (first) processed image can be seen in FIG.
  • a large number can be removed in a (second) edited image for the analysis of the scene of unimportant details.
  • SA can also now be removed white areas whose size or shape do not meet certain criteria, in particular biogeometric criteria with regard to a face. After discarding these too small or too large white areas or areas that are not relevant in form and by assigning the value "black" to the corresponding pixels, the actual segments relevant for the later examination are determined. For better analysis, these segments are written into rectangles, as can be seen in FIG. 4C.
  • the first examination step US1 the defined remaining segments are examined in order for their geometric or positional relationship to one another. The investigation is based on the fact that for two horizontally arranged segments, which can represent the eyebrows (cf.
  • a third segment is located below these first two segments that corresponds to a possible mouth segment (cf. the mouth area MB in FIGS. 4A, 4B) based on the brightness transition from the upper lip area to the intermediate lip area). If a first and a second segment lying horizontally to one another are found, such as the segments S1 and S2, their distance from one another, in this case the distance b, is determined on the basis of the respective center points of the segments.
  • a third segment is sought below the two segments S1 and S2, whose distance, the distance a, from the first two segments or a connecting line thereof is in a first biogeometric relationship with respect to a human face.
  • a ratio of a to b can have a value between 1.0: 1 to 1.7: 1, but in particular a value of 1.2: 1 to 1.5: 1.
  • the segment S3 and S4 could be considered as a possible third segment (potential mouth segment) in FIG. 4C.
  • a fourth relevant segment is sought, which is located immediately below the third segment.
  • this shadow area can serve as a fourth segment in a type of plausibility check, which must be located immediately below the third segment. Based on this check, segment S4 can then be identified as a potential mouth segment, segment S5 representing the shadow below the lower lip.
  • An area is now stored in the captured image of FIG. 4A which corresponds in size and position to the area (segment S4) identified as a potential mouth segment. This area, which will later be referred to as the analysis area, is used for the following feature extraction.
  • the entire process of the primary lip detection mechanism as just described can be carried out in a single pass, at the end of the pass the originally captured image can be discarded and only requires the stored pixel data of the analysis area become.
  • the image data of the captured image are considerably reduced within this single pass using very simple algorithms, which takes into account the requirement for minimizing the memory requirement, computing time and lead time.
  • the following feature extraction serves on the one hand to check the plausibility of whether there is really a mouth area or lips in the analysis area found, and also serves to obtain features or feature vectors for a subsequent Visem search based on the mouth part found.
  • FIG. 5 in which the scene captured by the camera K in FIG. 3 is shown again in accordance with FIG. 4A, the region AB of the mouth area now to be analyzed below, which was saved during the implementation of the first lip detection mechanism, being marked , This area is shown enlarged in FIG. 6.
  • the analysis area AB shown enlarged in FIG. 6 is now also subjected to processing with a horizontally oriented positive gradient filter.
  • an image contrast improvement can again be carried out in accordance with the image contrast improvement BKV in FIG. 3.
  • the processing with the horizontally oriented positive gradient filter now creates a third processed image, in which (horizontal) light-dark transitions, in particular from the upper lip area to the intermediate lip area, or in other words from the area of the upper lip to the area below the Upper lip can be extracted.
  • the upper lip line that has now been found or smoothed can now be evaluated with regard to its geometric properties (length, curvature, etc.), ie whether it corresponds to biogeometric features of an actual upper lip or upper lip line.
  • a second test step or extraction step is carried out, in which the lower lip or lower lip line is to be identified. Since the exact extraction of the lower lip due to generally weaker contouring of the lower lip using a filter, such as the gradient filter described above, is difficult, a vertical search algorithm is used in this case, which is based on the relatively well recognizable upper lip or upper lip line, which is characterized by the 6, the first color-like or grayscale-like pixel value looking down along the vertical.
  • the secondary lip detection mechanism is used to find a mouth area analysis area.
  • the secondary lip detection mechanism can already be considered algorithmically when passing through the primary lip detection mechanism, ie after capturing the first image of the scene.
  • the second lip detection mechanism can only be carried out in a second pass with respect to a second captured image of the scene. If the secondary lip detection mechanism is already carried out when the primary lip detection mechanism is run through, the segments identified or defined with it can then only be evaluated when the secondary lip detection mechanism is called up.
  • the reason for the failure of the primary lip detection mechanism may be that in the case of strongly contoured glasses, sunglasses or continuous eyebrows, there are no two separate eyebrow segments available for facial geometry assessment, which is why a different detection mechanism should be used in this case.
  • the second lip detection mechanism the same processing steps as the steps BKV, GF and SA explained in FIG. 3 are carried out first.
  • a second examination step US2 is used here, in which the facial geometry is used again to find the lips within the image captured by the camera K, a segment being sought here instead of the first and the second segment that can correspond geometrically to the length of the two eyebrows together.
  • FIG. 7A which has the face of a user (a person in a vehicle) who has strongly contoured glasses, the face or the mouth area of this face is to be determined here.
  • a (second) processed image (corresponding to FIG. 4C) shown in FIG. 7B is obtained, in which only striking light-dark transitions of a certain relevant size and shape are present.
  • the horizontal length b 'of each of these existing segments is determined, as is shown in the segment S6.
  • a segment located below that is at a certain distance a 1 from it is sought, the ratio a 'to b' having to have a second biogeometric ratio with respect to a face.
  • This second ratio of a to b is in the range from 1: 1 to 1.7: 1, but in particular between 1.2: 1 to 1.5: 1.
  • a further segment S7 is found for segment S6, by means of which the conditions of the second ratio can be met. If there are several segments through which the second ratio can be fulfilled, it is possible to find further test criteria for this plurality of segments. For example, the length of the segment below the segment representing the eyebrows, which has to lie within predetermined parameters, can be checked. If, for example, the length of the further segment is too long (for example greater than the length b), this cannot be identified as a potential mouth segment.
  • this region found can be stored in terms of position and size in the captured image as an analysis region and can be supplied to the feature extraction shown above. Lip tracking mechanism
  • the lip tracking mechanism is based on the fact that the analysis area with the mouth part found in a first captured image serves as reference coordinates for the next captured image when the features have been extracted successfully.
  • an analysis area EAB is expanded by a certain factor (here factor 1.1) with respect to the original analysis area AB , which is particularly concentric to the original analysis area, first used to perform a feature extraction.
  • the primary or secondary lip detection mechanism must be used again in a subsequent captured image in order to determine the position of an analysis area with the mouth area.
  • a test step of a feature extraction in the extended analysis area EAB as shown in FIG. 8A compared to the original analysis area AB, is positive, then in a second test step or the actual feature extraction in the extended analysis area EAB, as shown, for example, in FIG. 8B it is shown, mouth features or visemes are extracted, as has been described above.
  • the expanded analysis area can then be reduced to the size of the original analysis area, but to a position that corresponds to the actual position of the mouth area in this second analyzed image captured. This position can then again serve as a reference coordinate in a third captured image, etc.
  • the method carried out in the optical evaluation section OAA for analyzing a scene or for locating, tracking and analyzing a mouth area is advantageous, in particular for data processing systems with limited resources.
  • the visual or optical data volume for further processing can be reduced very quickly to small segment quantities.
  • Built-in plausibility and robustness checks also allow a high degree of reliability and prevent incorrect detection.
  • the resource-optimized lip tracking allows a person present in a scene to track the lip areas over many captured images with little movement, without having to perform lip detection mechanisms again.
  • the results obtained in the optical evaluation section OAA with regard to recognized visemes, or the temporal changes Detected Viseme can also be used to support acoustic speech recognition, especially for noisy environments.
  • noisy environments can be found, for example, in a car, it being advantageous in such an environment that the driver has only low degrees of movement and can therefore be easily detected, for example, by a camera integrated in a mobile phone.
  • the mobile phone together with the camera is attached, for example, in a holder on the center console (possible images that can be taken by a camera in the arrangement shown are shown in FIGS. 4A, 7A or 8A).
  • An audio-visual speech recognition can be carried out similarly to the speech recognition shown in FIG. 1.
  • a method for lip finding or lip tracking in the optical signal with the image of a captured scene can now be carried out according to one of the lip detection mechanisms or the lip tracking mechanism described above, while using the feature extraction, lip features can be extracted from the captured image or a found mouth area.
  • the most likely Visem candidates are then determined from the features or feature vectors obtained in step WE12 of FIG.
  • FIG. 9 in which the essential components of a data processing arrangement for processing an image or for inserting information fields are shown. These components can be provided, for example, in a server (of a network operator) of a communication network, as will be explained in detail with reference to FIG. 11.
  • An image of a scene is first routed to an input section or an input device EER.
  • the image can be captured directly by a camera K and fed into the input device EER. It can also, as it relates.
  • FIG. 11 will be explained later, can be routed via a communication network and can be entered into the input device EER via a reception module FM, such as a radio module. It is then passed to an evaluation device AWER, in which the presence and position of a face in the image is determined.
  • the evaluation device AWER can have an optical evaluation section OAA (see FIG. 2), which in turn can include a primary PLD or secondary SLD lip detection mechanism (OAA, SE, AAA) explained with reference to FIG.
  • OAA optical evaluation section
  • a face GES in order to determine the presence and position of a face GES in the image of a scene.
  • the face GES is then written into a face frame object GRO (see also the description of FIGS. 10), which can have a rectangular shape, for example, in an inscription device EBER, which is part of the evaluation device AWER.
  • EBER which is part of the evaluation device AWER.
  • at least one information field is inserted into the image in an insertion device EFER in such a way that the face frame object and the information field do not overlap.
  • the image thus generated with at least one additional information field is then forwarded via an output device AER, either to a display or a display DSP, for example, or, as will be explained with reference to FIG. 11, via a transmission module FM, such as a radio module , forwarded to another data processing component.
  • a transmission module FM such as a radio module
  • FIGS. 10A to IOC The mode of operation of the data processing arrangement just explained is now to be illustrated by means of FIGS. 10A to IOC.
  • a face GES is present in a first image BI1 of a scene.
  • the position of the face GES in the image was determined by means of the evaluation device AWER.
  • the face GES was then written into a face frame object GRO by the inscription device, here in the form of a rectangle (more precisely a square).
  • the insertion device has now inserted a first information field IF1, here for example as a logo of a company, and a second information field IF2, here as a banner text, the face frame object GRO and the information fields IF1 and IF2 do not overlap.
  • a first information field IF1 here for example as a logo of a company
  • a second information field IF2 here as a banner text
  • the first information field IF1 from the insertion device is arranged to the left of the face frame object GRO in the image BI2, so that there is no overlap with the face frame object.
  • a method just described can be used, for example, in the context of an image transmission or video telephony application (which is provided by a network operator or an additional service provider) in a communication or data processing arrangement.
  • a first communication device such as a mobile phone MFG1
  • a data processing component or a computer SP of the network operator is provided in the communication network KN, which has components for data processing, as described in FIG. 9.
  • the image from the first mobile phone MFG1 is received by a receiving module of the communication network (for example a base station) and passed to an input device of the computer SP of the network operator, where it is processed by an evaluation device, a description device and an insertion device and finally via an output device of the computer SP to a transmission module of the communication network (for example a base station) in order to be forwarded to a second communication device, such as a mobile phone MFG2, via a radio link (indicated by a second "zigzag" arrow).
  • a receiving module of the communication network for example a base station
  • an input device of the computer SP of the network operator where it is processed by an evaluation device, a description device and an insertion device and finally via an output device of the computer SP to a transmission module of the communication network (for example a base station) in order to be forwarded to a second communication device, such as a mobile phone MFG2, via a radio link (indicated by a second "zigzag" arrow).
  • Information fields, such as advertising fields, of the network operator can thus be inserted into an image captured by the first mobile telephone MFG1, the targeted placement of the information fields not losing the essential part of the image information, ie the face of the first participant.
  • Such careful and less distracting advertising means that it is possible, for example, that the second subscriber of the second mobile phone MFG2 is repeatedly (positively) reminded of the network operator of the first subscriber and possibly becomes a customer of this network operator as a result.
  • the advertising is not limited to the network operator's own advertising, but can also be advertising from any company that commissions a network operator (for a fee) to insert its advertising into an image data transmission or video application.
  • a further server or computer DACO from a service provider (such as an MMS service provider or a provider of information on current stock prices, etc.) is provided in the communication network and is connected to the computer SP.
  • a service provider such as an MMS service provider or a provider of information on current stock prices, etc.
  • the computer DACO it is also possible for the computer DACO to be provided in another communication network (for example based on an Internet protocol) which is connected to the communication network KN.
  • the computer DACO can supply the computer SP with data for information fields or entire (finished) information fields, so that the computer SP inserts this information into the image (or the images) to be transmitted. In this way, a service provider can easily send advertising to a user of a communication device or mobile phone.
  • the information fields can generally (ie regardless of the data transmission arrangement just mentioned), for example, display of network operator logos, advertising banners of network operators or sponsored services, banners with share prices, sports information, or avatars with help for the respective device on which they are displayed, and finally, information that is faded in during a single image acquisition (such as resolution, aperture, etc.) but is not visible in the final image.
  • a first mobile phone MFG1 can have a camera and additionally a sensor, such as a temperature sensor, whereby in a video telephony application, in addition to the face of the first subscriber, the current sensor data, for example the prevailing temperature at the location of the first mobile phone, is always detected by the camera Image as information field is shown.
  • the complete data processing or image processing would take place in the first mobile phone.
  • the mobile telephone MFG has a camera K, which, shown in more detail here, has a camera element KEL, for example in the form of a CCD camera element or CMOS CCD camera element, and camera optics or an imaging device.
  • the camera element KEL is capable of capturing an image of the surroundings, in particular a scene with people, the camera optics KOP, for example in the design of a camera lens, having a lens arrangement which is designed to change the spatial structure of individual lenses to change the focal length of the camera optics relative to one another so that objects such as a face GES of a person can be imaged sharply on the camera element after the focal length has been set.
  • the camera optics KOP for example in the design of a camera lens, having a lens arrangement which is designed to change the spatial structure of individual lenses to change the focal length of the camera optics relative to one another so that objects such as a face GES of a person can be imaged sharply on the camera element after the focal length has been set.
  • the mobile phone has Other facilities.
  • the position of a face is determined by means of an evaluation device AWE, which can have an optical evaluation section OAA (cf. FIG. 2), which in turn can include a primary PLD or secondary SLD lip detection mechanism (OAA, SE, AAA) explained with reference to FIG determined in the image of a scene captured by the camera K or its camera element KEL.
  • OAA optical evaluation section
  • the distance is then measured using a distance measuring device EM.
  • the distance measurement can take place actively or passively. Passive methods try to measure the distance with the available light. For this purpose, the image impression is in principle evaluated at locally different positions in or on the camera or the lens (camera optics) and the distance via angular relationships is determined by triangular regions (triangulation). Active processes therefore send out their own measuring beam. These are usually infrared rays. However, when taking individual pictures (instead of video sequences), the use of visible light is also possible. As an alternative, ultrasound distance measurements are also possible (sonar), although, for example, transparent window panes can be very irritating due to their reflections.
  • a camera control device KST now sets the camera optics KOP to the distance determined by the distance measuring device in such a way that the face GES is sharply imaged on the camera element KEL.
  • the distance measuring device can be constructed as follows. It is possible for the distance measuring device to have a plurality of distance measuring sensors EMS, which are arranged in such a way that they detect the distance of objects of the scene in image areas assigned to them. In other words, a raster RAS is placed over the image captured by the camera, with each distance measurement sensor being responsible for a raster area.
  • the distance measuring device determines in the area of responsibility which distance measuring sensor the face is from is located, so that this distance measuring sensor can then be instructed to detect the distance of the face to the camera. It is also conceivable that the distance measuring device has a distance measuring sensor whose measuring direction can be varied, so that after the detection of a face in the scene by the evaluation device, the measuring direction of this distance measuring sensor is aligned by the distance measuring device to the recognized face.
  • a video conference is set up between several participants, at least one participant having a mobile telephone MFG with a camera system, as has been explained for FIG. 12. If such a conference lasts for a long time, the individual participants will usually not keep still and move their heads, slide back and forth in their armchairs or slide left and right. Conventionally, the face of a participant would never be captured sharply and transmitted to the other participants, since the distance of the face to the mobile phone or its camera is constantly changing.
  • a mobile telephone MGF according to FIG.
  • the position of the face of a subscriber is localized continuously or at regular time intervals, its distance to the camera or to the mobile phone is determined and the camera optics are accordingly focused in order to position the face on the Capture camera element sharply and transmit it to the other conference participants.
  • a camera system with camera K, evaluation device AWE, camera control device KST and distance measuring device EM explained with reference to FIG. 12 does not necessarily have to be installed in a mobile phone, but must also be installed in a different way.
  • led data processing system such as a stationary or portable computer or a landline phone.
  • the camera K with camera element KEL and camera optics KOP and possibly the distance measuring device EM are provided in a separate module, which can be connected to a computer or a mobile phone.
  • FIG. 13 in which the essential components of a communication arrangement for transmitting an image of a scene with a head or face of a person are shown from a first communication device MFG21 in the form of a cell phone to a second communication device MFG22 in the form of a cell phone.
  • an image of a scene is captured by a camera K of the first mobile telephone MFG21 and sent to an evaluation device AWER2, in which the presence and position of a face in the first image is determined.
  • the evaluation device AWER2 can have an optical evaluation section OAA (see FIG. 2), which in turn can include a primary PLD or secondary SLD lip detection mechanism (OAA, SE, AAA) explained with reference to FIG. 3, in order to determine the presence and position of a face in the Image of a scene determined.
  • OAA primary PLD or secondary SLD lip detection mechanism
  • the face is written into a face frame object (see also the description of FIGS. 14), which can have a rectangular shape, for example, in an inscription device EBER2, which is part of the evaluation device AWER2.
  • the image area which is encompassed by the face frame object is cut out by a cut-out device ASER2, in order to obtain a second image.
  • This second image is then encoded by a coding device KDER2 in order to compress the image data.
  • the coding device KDER2 can, for example, be based on an H.263, MPEG4 or H.26L standard work.
  • the encoded second image or its image data is now transmitted via a radio module FM21, which is connected to an antenna ANT21, over a first radio link (indicated by a first "zigzag” arrow) to a communication network KN, which transmits the image data via transmits a second radio link (indicated by a second "zigzag” arrow) to the second mobile phone MFG22.
  • the data is received by an FM22 radio module via an ANT22 antenna and sent to a decoder DKER2.
  • the decoding device DKER2 decodes the data of the second picture and passes the second (decoded) picture to a display device DSP, on which the picture of the user of the first mobile telephone MFG21 can now be displayed.
  • an object such as a frame
  • This insertion of objects or whether and which object should be inserted can be set, for example, by the user of the second mobile telephone MFG22 himself on the mobile telephone.
  • Both the communication network KN and the mobile telephones MFG21, MFG22 can operate, for example, according to a GSM (Global System for Mobile Communications) -, UMTS (Universal Mobile Telecommunications System) - or WLAN (wireless LAN: wireless local area network) - standard.
  • GSM Global System for Mobile Communications
  • UMTS Universal Mobile Telecommunications System
  • WLAN wireless LAN: wireless local area network
  • FIGS. 14A to 14C The mode of operation of the data processing arrangement just explained is now to be illustrated by means of FIGS. 14A to 14C.
  • a face GES is present in a first image BI1 of a scene captured by a camera.
  • the evaluation device AWER2 see FIG. 13
  • the position of the face GES in determined the picture.
  • the face GES was then written into a face frame object GRO, here in the form of a rectangle, by the inscription device.
  • the area of the first image BI1 encompassed by the facial frame object GRO is now cut out by the cutting device, so that a second image BI2 is produced (cf. FIG. 14B).
  • the further mobile telephone or a device provided in it can have an additional object, such as a frame RAH insert into the image as shown in Figure 14C to finally obtain an image BI2 ''.
  • This "artificial" frame RAH can be provided directly by the second communication device, or it could have been previously transmitted by the first communication device.
  • the advantage of the described method now lies in the fact that the essential image component, i.e. the face of the user of the first mobile phone is extracted from the first image, so that the resources involved in coding and transmitting an image to a second mobile phone are minimized.
  • FIG. 15 in which the essential components of a data processing arrangement for processing an image or for converting a first image of a scene into a second image with a smaller size are shown. These components can be provided, for example, in a data processing arrangement in the form of a mobile phone MFG3.
  • a first image of a scene with a first size is created by a camera K of the mobile telephone MFG3 summarizes and passed to an evaluation device AWER1, in which the presence and position of a face in the first image is determined.
  • the evaluation device AWER1 can have an optical evaluation section OAA (see FIG. 2), which in turn can include a primary PLD or secondary SLD lip detection mechanism (OAA, SE, AAA) explained with reference to FIG. 3, in order to determine the presence and position of a face GES in the first image of a scene.
  • OAA optical evaluation section
  • OAA primary PLD or secondary SLD lip detection mechanism
  • the face GES is then written into a face frame object GRO (see also the description of FIGS.
  • the face frame object has the shape and size of a desired second image.
  • the image area, which is encompassed by the face frame object, is cut out by a cut-out device ASER1 in order to obtain the second image in the desired format or size.
  • This second image can then be shown in a display or a display device DSP of the mobile phone MFG3 or can be encoded by a video encoder (for example in accordance with one of the standards H.263, MPEG4) and to another mobile phone via a communication network, for example in the context of video telephony -Application or as part of an MMS service.
  • FIGS. 16A to 16C The mode of operation of the data processing arrangement just explained is now to be illustrated by means of FIGS. 16A to 16C.
  • a face GES is present in a first image BI1 of a scene captured by a camera.
  • This first image has, for example, a CIF or VGA format.
  • the position of the face GES in the image was determined by means of the evaluation device AWER1 (see FIG. 15).
  • the face GES was inscribed into a face frame object GRO, here in the form of a rectangle (more precisely a square) by the inscription device, which shape and size of a desired has the second image.
  • GRO face frame object
  • the area of the first image BI1 encompassed by the facial frame object GRO is now cut out by the cutting device, so that a second image BI2, for example in CIF format, is produced (cf. FIG. 16B), which has the desired size and the desired format.
  • a second image BI2 for example in CIF format
  • the image BI1 is scaled down in a conventional manner, as is shown, for example, in FIG. 16C with reference to image BI2 ', which is also available in CIF format, for example, the face GES would be greatly reduced in size and thus only still difficult to see.
  • image BI2 ' would be of little advantage, particularly in a video telephony application, since a call participant should be clearly visible, as is the case in picture 9B.

Landscapes

  • Engineering & Computer Science (AREA)
  • Health & Medical Sciences (AREA)
  • Oral & Maxillofacial Surgery (AREA)
  • General Health & Medical Sciences (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Multimedia (AREA)
  • Theoretical Computer Science (AREA)
  • Image Processing (AREA)
  • Image Analysis (AREA)

Abstract

Offenbart ist ein Verfahren zum Analysieren einer Szene, von der ein Bild erfasst worden ist. Dabei werden zunächst Segmente (S1 - S5) in dem erfassten Bild festgelegt, die helligkeitsspezifischen Merkmale aufweisen. Anschließend wird eine positionsmäßige Beziehung (a, b) der festgelegten Segment zueinander überprüft. Weist eine Auswahl (S1, S2, S4) von festgelegten Segmenten eine bestimmte positionsmäßige Beziehung auf, so kann daraus das Vorhandenseins eines Gesichts in dem erfassten Bild abgeleitet werden. Gemäß einer vorteilhaften Ausgestaltung kann ein einer Mundpartie entsprechendes festgelegtes Segment bezüglich Mundmerkmale oder Viseme untersucht werden. Die resultierenden Ergebnisse können zur Verbesserung einer akustischen Spracherkennung verwendet werden.

Description

VERFAHREN ZUM ANALYSIEREN EINER SZENE SOWIE ENTSPRECHENDES DATENVERARBEITUNGSGERÄT UND PROGRAMMPRODUKT
Die vorliegende Erfindung betrifft ein Verfahren zum Analysieren einer Szene, insbesondere zum Auffinden eines menschlichen Gesichts in der Szene, sowie eine Datenverarbeitungsanlage zum Ausführen des Verfahrens.
Eine akustische Spracherkennung auf mobilen Endgeräten, wie Mobiltelefonen, ist speziell in geräuschbehafteten Umgebungen ein fehleranfälliger Prozess, da die akustischen Informationen eines Benutzers stark verzerrt oder von Geräuschen deutlich überlagert sind. Es kommt jedoch oft vor, dass Umgebun- gen, in denen mobile Endgeräte eingesetzt werden, oft geräuschbehaftet sind, wie beispielsweise Umgebungen in Fahrzeugen, auf der Strasse oder in Menschenansammlungen. Für die Verbesserung der akustischen Spracherkennung in geräuschbehafteten Umgebungen existieren verschiedene Ansätze. Die ge- bräuchlichste Methode liegt in der Verbesserung der Vorverarbeitung durch geeignete Geräuschunterdrückungsmaßnahmen bzw. in dem Einsatz geeigneter Filter. Diese Vorgehensweise ist speziell für bestimmte bzw. dedizierte Umgebungen einsetzbar und bis zu einem gewissen Verhältnis von Geräusch- zu Nutzin- formation (Signal-to-Noise-Ratio: SNR) sinnvoll. Ist das SNR ungünstiger, helfen die erwähnten Verfahren bzw. Methoden nicht weiter. Ein weiterer Ansatz besteht in der Verwendung von Mehrfachmikrofonen zur besseren Extraktion von Nutzinformationen. Neben dem zusätzlichen Hardware-Aufwand ist aller- dings auch hier der Einsatz nur bis zu einem bestimmten SNR sinnvoll .
In den vergangenen Jahren wurden einige Ansätze zur Verbesserung der (akustischen) Spracherkennung durch Lippenlesetech- nologien entwickelt. Diese Ansätze zielen speziell auf geräuschbehaftete Umgebungen, sind aber auf Grund der verwendeten rechenaufwändigen Verfahren für mobile Endgeräte ungeeig- net. Die entwickelten Verfahren optimieren nämlich die Spracherkennung auf Kosten des Ressourcen-Einsatzes, d. h. auf Kosten des benötigten Speicherbedarfs bzw. der benötigten Prozessorleistung.
In Figur 1 ist ein beispielhafter allgemeiner Ablauf eines audio-visuellen Spracherkennungsverfahren dargestellt. Dabei wird in einem ersten Zweig, einem akustischen Zweig, ein a- kustisches Sprachsignal oder Audio-Eingangssignal AS1 in ei- nem akustischen Vorverarbeitungsschritt AVI aufb reitet und es werden Sprachmerkmalsvektoren extrahiert. Mit einer Suche über den Referenzraum werden in einem folgenden Schritt WEH Wahrscheinlichkeiten für bestimmte Phonem-Kandidaten ermittelt. Dies kann mittels "Hidden Markov Modellen" (HMM) oder mittels "Artificial Neural Networks" (ANN) erfolgen. In einem zweiten Zweig, einem optischen bzw. visuellen Zweig, wird ein optisches Signal oder Video-Eingangssignal OS1 einer Lippen- detektion zugeführt und es wird eine visuelle Vorverarbeitung (visuelles Pre-Processing) Wl zur Extraktion von Merkmalen aus den detektierten Lippen durchgeführt. Aus den erhaltenen Merkmalsvektoren werden in einem nächsten Schritt WE12 die wahrscheinlichsten Visem-Kandidaten für die extrahierten Merkmale ermittelt. Aus den akustischen und visuellen Kandidaten wird schließlich mittels einer Gewichtungs- und Ent- scheidungsfunktion GEF ein erkanntes Sprachmerkmal ermittelt, das dann einer Steuereinrichtung zugeführt werden kann, um beispielsweise einen bestimmten Steuervorgang auszulösen.
Es ist nun die Aufgabe der vorliegenden Erfindung, eine res- sourcenoptimierte Möglichkeit zur Analyse einer Szene zu schaffen, die insbesondere zur Verbesserung der akustischen Spracherkennung verwendbar ist.
Diese Aufgabe wird durch ein Verfahren zum Analysieren einer Szene gemäß Anspruch 1, durch ein Computerprogramm für eine Datenverarbeitungsanlage gemäß Anspruch 19, durch ein Verfahren zur Spracherkennung gemäß Anspruch 20 sowie durch eine Datenverarbeitungsanlage gemäß Anspruch 21 gelöst. Vorteilhafte Ausgestaltungen sind Gegenstand der Unteransprüche.
Ein Verfahren zum Analysieren einer Szene (einer Anordnung von Sachen bzw. Gegenständen und evtl. von Lebewesen, insbesondere Menschen) , von der ein Bild erfasst worden ist, ura- fasst zunächst ein Festlegen von Segmenten in dem erfassten Bild, die helligkeitsspezifische Merkmale aufweisen. Wie es unten näher erläutert werden wird, können die helligkeitsspe- zifischen Merkmale beispielsweise Hell-Dunkel-Übergänge und/oder Dunkel-Hell-Übergänge umfassen. Anschließend wird eine positionsmäßige Beziehung der festgelegten Segmente zueinander überprüft, wobei ein Vorhandensein eines (menschlichen) Gesichts in dem erfassten Bild abgeleitet wird, wenn eine Auswahl von festgelegten Segmenten eine bestimmte positionsmäßige Beziehung aufweist. Das bedeutet, durch das gerade beschriebene Verfahren kann nur durch Analyse bestimmter Bereiche des erfassten Bildes, nämlich der Segmente mit helligkeitsspezifischen Merkmalen, genauer gesagt durch Überprü- fen der positionsmäßigen Beziehung der festgelegten Segmente auf das Vorhandensein eines Gesichts, insbesondere menschlichen Gesichts, geschlossen werden. Somit wird zur Durchführung des Verfahrens nur eine geringe Rechenleistung benötigt, wodurch eine Ressourcenverringerung bzw. Ressourcenoptimie- rung einer Datenverarbeitungsanlage zum Durchführen des Verfahrens ermöglicht wird.
Gemäß einer vorteilhaften Ausgestaltung handelt es sich bei dem erfassten Bild um ein von einer elektronischen Kamera er- fassten Bild, das elektronisch verarbeitbar ist. Insbesondere ist das erfasste Bild aus einzelnen Bildpunkten zusammengesetzt, welchen jeweilige Graustufenwerte zugeordnet sind.
Gemäß einer weiteren vorteilhaften Ausgestaltung werden Seg- mente in dem erfassten Bild festgelegt, bei denen die helligkeitsspezifischen Merkmale scharfe bzw. abrupte Helligkeitsübergänge, beispielsweise von Dunkel nach Hell oder von Hell nach Dunkel aufweisen. Derartige (scharfe) Helligkeitsübergänge finden sich beispielsweise in einem Gesicht eines Menschen, insbesondere beim Übergang von der Stirn zu den Augenbrauen oder (bei Menschen mit heller Haarfarbe) beim Übergang von der Stirn in den Schatten der Augenhöhlen. Derartige (scharfe) Helligkeitsübergänge finden sich jedoch auch beim Übergang von dem Oberlippenbereich bzw. Lippenbereich zur Mundöffnung oder von der Mundöffnung zum Lippenbereich der Unterlippe bzw. zum Unterlippenbereich. Ein weiterer Hellig- keitsübergang stellt sich zwischen der Unterlippe und dem Kinnbereich, genauer gesagt als Schattenbereich (je nach Lichtverhältnis bzw. Lichteinfall) basierend auf einer leichten Vorwölbung der Unterlippe, ein. Wie es unten ausführlicher erläutert werden wird, ist es möglich, anhand dieser Helligkeitsübergänge bzw. anhand der positionsmäßigen Beziehung einer Auswahl der Helligkeitsübergänge auf das Vorhandensein eines menschlichen Gesichts bzw. insbesondere auf die Position einer Mundpartie zu schließen.
Gemäß einer vorteilhaften Ausgestaltung umfasst der Schritt des Festlegens von Segmenten in dem erfassten Bild eine Bearbeitung des Bilds mittels eines Gradientenfilters, insbesondere eines horizontalen Gradientenfilters, um insbesondere horizontale (scharfe) Helligkeitsübergänge, wie die an den Augenbrauen, an den Augen, oder an dem Mund sichtbar zu machen. Durch die Bearbeitung mittels des Gradientenfilters wird ein erstes bearbeitetes Bild erzeugt, bei dem am Ort eines Helligkeitsübergangs im erfassten Bild entsprechende Bildpunkte im ersten bearbeiteten Bild mit einem Graustufen- wert vorgesehen werden, die von der Schärfe des Helligkeitsübergangs im erfassten Bild abhängen. Das bedeutet, bei einem Helligkeitsübergang innerhalb weniger Bildpunkte von einem niedrigen Helligkeitswert (niedriger Graustufenwert) zu einem hohen Helligkeitswert (hoher Graustufenwert) wird in dem ers- ten bearbeiteten Bild eine entsprechende Information eingetragen. Wird davon ausgegangen, dass das erste bearbeitete Bild in Form eines Graustufenbildes dargestellt wird, so kön- nen beispielsweise bei Verwendung eines positiven horizontalen Gradientenfilters, der von oben nach unten auf das er- fasste Bild angewendet wird, Bereiche des Bilds, in denen keine Helligkeitsübergänge vorhanden sind, in mittleren Grau- stufenwerten dargestellt werden, während Hell-Dunkel- Übergänge (von oben nach unten) je nach Schärfe der Übergänge einen dementsprechend höheren Grauwert als den mittleren Grauwert erhalten und Dunkel-Hell-Übergänge (von oben nach unten) einen entsprechend niedrigeren Grauwert in Abhängig- keit der Schärfe des jeweiligen Übergangs erhalten.
Gemäß einer weiteren vorteilhaften Ausgestaltung kann der Schritt des Festlegen von Segmenten in dem erfassten Bild eine Binärisierungsbearbeitung des ersten bearbeiteten Bildes umfassen. Hierbei kann ein zweites bearbeitetes Bild erzeugt werden, bei den entsprechenden Bildpunkten, deren Graustufenwert einen ersten vorbestimmten Schwellenwert (welcher in Abhängigkeit der Helligkeit des erfassten Bildes gewählt wird) übersteigt, ein binärer "1" -Wert zugeordnet wird, während den übrigen Bildpunkten ein binärer "0"-Wert zugeordnet wird. Anders ausgedrückt, kann den Bildpunkten, deren Graustufenwert den vorbestimmten ersten Schwellenwert übersteigt, der Wert "weiß" zugeordnet werden, während den übrigen Bildpunkten der Wert "schwarz" zugeordnet wird. Somit sind in dem zweiten be- arbeiteten Bild nur noch Helligkeitsübergänge mit einer bestimmten ausgeprägten Schärfe zu erkennen.
Zusammenhängende Bildpunkte, denen ein Weiß-Wert zugeordnet ist, können als eine Einheit von Bildpunkten gesehen werden, die zur folgenden Auswertung in eine geometrische Form, wie beispielsweise ein Rechteck, eingeschrieben werden. Diese geometrische Form kann dann als ein festgelegtes Segment definiert werden. Da es notwendig ist, aus der in dem erfassten Bild erfassten Szene biometrische Merkmale, insbesondere ein Gesicht eines Menschen betreffend, herauszufiltern bzw. zu extrahieren, um auf das Vorhandensein eines menschlichen Gesichts schließen zu können, ist es vorteilhaft, bestimmte Be- reiche bzw. Strukturen in dem erfassten Bild, die beispielsweise auf Grund ihrer Größe oder Form keine biometrischen Merkmale bezüglich eines Gesichts aufweisen, zu verwerfen. Gemäß einer vorteilhaften Ausgestaltung werden dabei bestimm- te Bereiche des zweiten bearbeiteten Bildes mit zusammenhängenden Bildpunkten auf Grund von vorbestimmten Parameteren bezüglich Größe und/oder Form der Bereich oder der diese einbeschreibenden geometrischen Form verworfen und insbesondere werden die den Bereichen zugeordneten Bildpunkte auf einen Schwarz-Wert gesetzt. Ein Kriterium bezüglich der Form von Bereichen zusammenhängender Bildpunkte mit einem Weiß-Wert kann beispielsweise sein, dass die Höhe dieses Bereichs bzw. dieser Struktur einen zu großen Wert im Gegensatz zur Breite der Struktur aufweist. Das bedeutet, das Verhältnis aus Höhe zu Breite ist zu groß. Eine derartige Festlegung wird deutlich, wenn - wie oben bereits erwähnt - Segmente anhand helligkeitsspezifischer Merkmale von horizontal verlaufenden Augenbrauen oder horizontal verlaufender Lippen- bzw. Mundpartien festgelegt werden. Das bedeutet wiederum, dass das zuvor erfasste Bild mit einer großen Anzahl von Bildpunkten auf nur noch eine geringe Anzahl von festgelegten Segmenten zurückgeführt wird, aus deren positionsmäßiger Beziehung zueinander nun das Vorhandensein eines Gesichts abgeleitet werden kann.
Gemäß einer vorteilhaften Ausgestaltung wird dabei in dem Schritt des Überprüfen der positionsmäßigen Beziehung in einem ersten Untersuchungsschritt (entsprechend einem ersten Lippendetektionsmechanismus) jedes der festgelegten Segmente dahingehend untersucht, ob zu einem zu untersuchenden Segment ein zweites festgelegtes Segment existiert, das auf einer horizontalen Linie bzw. einer im Wesentlichen horizontal verlaufenden Linie zu dem gerade untersuchten festgelegten Segment liegt. Ausgehend von einem erfassten Bild, bestehend aus einer Mehrzahl von Bildpunkten muss das zweite Segment nicht unbedingt auf einer der von dem zu untersuchenden Segment um- fassten wagrechten Linie an Bildpunkten liegen, es kann auch um einen vorbestimmten kleinen Betrag an Bildpunkten höher oder tiefer bezüglich der wagrechten oder horizontalen Line liegen. Wird ein zweites festgelegtes horizontales Segmente gefunden, so wird nach einem dritten festgelegten Segment gesucht, das sich unterhalb des untersuchten und des zweiten festgelegten Segments befindet und für das gilt, dass ein Abstand von dem untersuchten zu dem zweiten festgelegten Segment und ein Abstand einer Verbindungsstrecke zwischen dem untersuchten und dem zweiten festgelegten Segment zu dem dritten festgelegten Segment ein erstes vorbestimmtes Ver- hältnis aufweist. Insbesondere kann eine Normale zu der Verbindungsstrecke zwischen dem untersuchten und dem zweiten festgelegten Segment definiert werden, wobei der Abstand von dem dritten Segment (entlang der Normalen) zu der Verbindungsstrecke zwischen dem untersuchten und dem zweiten fest- gelegten Segment in das erste vorbestimmte Verhältnis eingeht. Der Abstand zwischen den untersuchten und dem zweiten Segment kann derart definiert werden, dass der Abstand von einem jeweiligen Mittelpunkt der festgelegten Segmente verwendet wird. Insbesondere bei der Verwendung von Segmenten mit der geometrischen Form eines Rechtecks kann ein Mittelpunkt leicht bestimmt werden. Durch den gerade beschriebenen ersten Untersuchungsschritt kann somit auf das Vorhandensein eines Gesichts geschlossen werden, indem die positionsmäßige Beziehung zwischen drei festgelegten Segmenten ermittelt wird. Hierbei wird davon ausgegangen, dass das untersuchte und das zweite festgelegte Segment einen jeweiligen Augenbrauenabschnitt im Gesicht eines Menschen darstellt, der normalerweise einen markanten bzw. scharfen Hell-Dunkel- Helligkeitsübergang von oben nach unten aufweist und somit im zweiten bearbeiteten Bild gut erkennbar ist. Das dritte festgelegte Segment stellt ein Segment einer Mundpartie bzw. den zwischen Oberlippe und Unterlippe Schatten bildenden Grenzbereich dar. Es hat sich erwiesen, dass zur Bestimmung eines menschlichen Gesichts das erste vorbestimmte Verhältnis zwi- sehen Abstand von untersuchten und zweiten festgelegten Segmenten zu dem Abstand der Verbindungsstrecke der beiden Segmente zu dem dritten festgelegten Segment mit einem Wert von 1:1 bis 1:1,7, insbesondere von 1:1,2 bis 1:1,5 vorteilhaft ist. Neben der Möglichkeit, Augenbrauen als markante Segmente mit helligkeitsspezifischen Merkmalen zu verwenden, ist es auch möglich, an Stelle der Augenbrauen Schatten bildende Be- reiche der Augenhöhlen bzw. die Augen oder die Iris selbst zu verwenden.
Gemäß einer weiteren vorteilha ten Ausgestaltung wird in dem Schritt des Überprüfens der positionsmäßigen Beziehung in ei- nem zweiten Untersuchungsschritt (entsprechend einem zweiten Lippendetektionsmechanismus) jedes der festgelegten Segmente dahingehend untersucht, ob zu diesem Segment ein viertes festgelegtes Segment existiert, das sich unterhalb, insbesondere entlang einer Vertikalen, dem untersuchten festgelegten Segment befindet und für das gilt, dass die horizontale Länge des untersuchten festgelegten Segments und der Abstand des vierten festgelegten Segments zum untersuchen festgelegten Segments ein zweites vorbestimmtes Verhältnis aufweisen. Dieser zweite Untersuchungsschritt geht dabei davon aus, dass insbesondere bei Personen, die eine Brille oder Sonnenbrille tragen, die einzelnen Augenbrauen nicht erkennbar sind, sondern dass auf Grund der starken Konturen der Brillen lediglich ein Segment bzw. eine Struktur erkennbar ist, die geometrisch der Länge der beiden Augenbrauen zusammen ent- spricht. Somit steht auch die Länge dieses die beiden Augenbrauen umfassenden Segments wieder in einem bestimmten Verhältnis zur Entfernung des Mundes im Gesicht des Benutzers. Werden somit zwei festgelegte Segmente erkannt, bei denen die Länge des ersten Segments zum Abstand des zweiten Segments ein zweites vorbestimmtes Verhältnis aufweist, so kann auch gemäß dem zweiten Untersuchungsschritt auf das Vorhandensein eines menschlichen Gesichts geschlossen werden. Als gültiger Bereich für das zweite vorbestimmte Verhältnis kann wieder ein Wert von 1:1 bis 1:1,7, aber insbesondere von 1:1,2 bis 1:1,5 angenommen werden. Gemäß einer vorteilhaften Ausgestaltung wird in dem Schritt des Überprüfens der positionsmäßigen Beziehung zunächst der erste Untersuchungsschritt durchgeführt, um insbesondere nach Gesichtern von Menschen zu suchen, die keine Brillenträger sind. Zeigt der erste Untersuchungsschritt kein Ergebnis, bei dem zu den jeweiligen untersuchten Segmenten kein zweites und drittes Segment gefunden worden ist, so wird im Folgenden der zweite Untersuchungsschritt durchgeführt. Es ist jedoch auch möglich, zunächst den zweiten und dann den ersten Untersu- chungsschritt durchzuführen.
Bei dem bisher beschriebenen Verfahren bzw. den vorteilhaften Ausgestaltungen hiervon wird insbesondere in dem ersten Untersuchungsschritt die positionsmäßige Beziehung dreier fest- gelegter Segmente zueinander bzw. ein erstes vorbestimmtes Verhältnis der Abstände der Segmente zueinander und wird bei dem zweiten Untersuchungsschritt die positionsmäßige Beziehung von (zwei) Segmenten in Abhängigkeit der Größe und/oder Form, insbesondere der (horizontalen) Länge, des ersten Seg- ents als Kriterium zum Ableiten eines Vorhandenseins eines Gesichts in dem erfassten Bild einer Szene verwendet werden. Zur Verbesserung des Verfahrens, d. h. zur Erhöhung der Wahrscheinlichkeit, dass es sich tatsächlich um ein Gesicht handelt, kann gemäß einer weiteren vorteilhaften Ausgestaltung in einem weiteren Verfahrensschritt ein Extrahieren biometrischer Merkmale bezüglich der Mundpartie oder Lippenpartie aus einem Analysebereich um ein gefundenes drittes oder viertes festgelegtes Segment durchgeführt werden. Das bedeutet, es sollen in diesem zusätzlichen Schritt weitere Untersuchungen durchgeführt werden, ob das einen Mundbereich repräsentierende dritte oder vierte festgelegte Segment tatsächlich einen Mundbereich bzw. eine Mundpartie repräsentiert. Dabei können in dem erfassten Bild in einem Bereich, der sich an der Position des dritten oder des vierten festgelegten Segments be- findet und das jeweilige Segment umfasst, Hell-Dunkel- und Dunkel-Hell-Helligkeitsübergänge bestimmt werden, um das Vorhandensein einer Oberlippe und Unterlippe einer Mundpartie abzuleiten. Vorteilhafter Weise wird dabei der Analysebereich des erfassten Bildes, der Bereich mit der vermuteten Mundpartie, einer Bearbeitung mit einem horizontal orientierten Gradientenfilter unterzogen, um ein drittes bearbeitetes Bild zu erhalten. Das dritte bearbeitete Bild, von oben nach unten betrachtet, kann dann entsprechend dem ersten bearbeiteten Bild eine scharfen Hell-Dunkel-Übergang vom Oberlippenbereich zum "Zwischenlippenbereich" bzw. zum Mundöffnungsbereich darstellen, wobei anhand dieses Übergangs auf die Form der Ober- lippe geschlossen werden kann. Diese ermittelte Form kann einem ersten Prüfschritt unterzogen werden, der anhand der Form der Oberlippenlinie feststellen soll, ob es sich tatsächlich um eine Oberlippe oder irgendeine andere Struktur handelt. Weist die Oberlippe für sie spezifische geometrische Eigen- Schäften auf, wie beispielsweise eine bestimmte (horizontale) Länge oder eine bzw. mehrere spezifische Krümmungen, so kann zunächst auf das tatsächliche Vorhandensein einer Mundpartie und somit auch auf das Vorhandensein eines Gesichts eines Menschen geschlossen werden. Somit kann das oben beschriebene Verfahren einschließlich dessen vorteilhafter Ausgestaltungen, bei dem bzw. denen anhand der positionsmäßigen Beziehung verschiedener festgelegter Segmente auf das Vorhandensein eines Gesichts geschlossen wird, durch eine Merkmalsextraktion, in diesem Fall der Extraktion geometrischer Eigenschaften der Oberlippe in dem ersten Prüfschritt, verbessert werden. Das bedeutet, dass nach diesem ersten Abschnitt der Merkmalsextraktion im Rahmen des ersten Prüfschritts schon die Wahrscheinlichkeit erhöht werden kann, dass es sich bei dem dritten oder vierten festgelegten Segment bzw. bei dem Analysebe- reich um einen Bildbereich handelt, in dem sich eine Mundpartie eines Gesichts befindet.
Erfüllen die bestimmten geometrischen Eigenschaften (beispielsweise bezüglich Länge bzw. Krümmung) die für eine Ober- lippe spezifischen Kriterien, so kann die Merkmalsextraktion in einen zweiten Extraktionsabschnitt bzw. einen zweiten Prüfschritt übergehen, in dem nun eine Unterlippe bzw. Unter- lippenlinie extrahiert werden soll. Eine Unterlippe kann beispielsweise mittels eines vertikalen Such-Algorithmus erkannt bzw. extrahiert werden, bei dem im Analysebereich zunächst die Graustufenwerte der Oberlippe ermittelt werden und dann entsprechende Graustufenwerte in einem Abschnitt gesucht werden, der sich in vertikaler Richtung unterhalb dem Bereich der Oberlippe befindet. Auf diese Weise ist es möglich, sehr helle Bereiche, wie beispielsweise die Zähne, sowie sehr dunkle Bereiche, wie beispielsweise den Rachenbereich, zu ü- berspringen und einen bezüglich der Helligkeit der Oberlippe als Unterlippe zu identifizieren. Eine weitere Möglichkeit, die Unterlippe zu extrahieren, beruht auf der Tatsache, dass bei entsprechend großer Wahl des Analysebereichs, bei der ein Teil des Kinnbereichs mit enthalten ist, insbesondere in dem dritten bearbeiteten Bild von, unten nach oben betrachtet, ein dunkler Bereich (Schattenbereich) unterhalb der Unterlippe erkennbar ist, der darauf beruht, dass die Unterlippe normaler Weise bezüglich des Gesichts um einen kleinen Betrag nach vorne gekrümmt ist. Somit kann gemäß diesem Verfahren anhand des untersten und markantesten Helligkeitsübergangs von Dunkel nach Hell von unten nach oben betrachtet, auf die Unterlippe bzw. Unterlippenlinie geschlossen werden.
Sind nun Oberlippe und Unterlippe identifiziert, so ist es nun möglich, Viseme bzw.. Mundmerkmale zu extrahieren, indem die geometrischen Eigenschaften der Oberlippe und Unterlippe getrennt untersucht werden. Weisen Oberlippe und Unterlippe beispielsweise eine geringe horizontale Länge, jedoch eine starke Krümmung auf (die Oberlippe ist stark nach oben ge- krümmt und die Unterlippe ist stark nach unten gekrümmt) , so kann beispielsweise auf eine Mundpartie geschlossen werden, die gerade ein "0" artikuliert. Weist hingegen die Oberlippe und die Unterlippe eine relativ große horizontale Länge und nahezu keine Krümmung auf, so kann beispielsweise auf die Ar- tikulation des Buchstaben "M" geschlossen werden. Es kann somit zusammenfassend gesagt werden, dass ein Verfahren gemäß der vorliegenden Erfindung es zunächst erlaubt, anhand eines erfassten Bildes in einem Durchlauf helligkeitsspezifische Segmente festzulegen, um bei der Überprüfung de- rer positionsmäßigen Beziehung auf das Vorhandensein eines (menschlichen) Gesichts zu schließen. Es ist dabei möglich, bei Vorhandensein entsprechender Bedingungen bezüglich der positionsmäßigen Beziehung, wie sie beispielsweise in dem ersten und zweiten vorbestimmten Verhältnis in dem ersten und zweiten Untersuchungsschritt in dem Schritt des Uberprüfens der positionsmäßigen Beziehung festgelegt sind, einen Steuervorgang in einer Datenverarbeitungsanlage bzw. Datenverarbeitungsanordnung auszulösen. Beispielsweise ist es möglich, dass erst beim Erkennen eines Gesichts eines Benutzers eine Anzeige der Datenverarbeitungsanlage aktiviert wird, ein (a- kustisches) Spracherkennungsverfahren aktiviert wird, Lautsprecher bzw. Mikrofon aktiviert wird, usw. Auf diese Weise ist es möglich, Energie bzw. Leistung für Komponenten der Datenverarbeitungsanlage einzusparen, die nicht benötigt wer- den, wenn der Benutzer gerade nicht in der Position ist, um die Datenverarbeitungsanlage zu bedienen. Es ist jedoch auch möglich, einen Steuervorgang in einer Datenverarbeitungsanlage erst dann auszulösen, wenn die "verbesserte" Überprüfung des Vorhandenseins eines Gesichts mittels der Merkmalsextrak- tion, insbesondere dem ersten Prüfschritt, durchgeführt worden ist. Eine weitere Differenzierung beim Auslösen eines bestimmten Steuervorgangs kann vorgenommen werden, wenn nicht nur das Vorhandensein einer Oberlippe bzw. Unterlippe in dem erfassten Bild bzw. dem Analysebereich festgestellt wird, sondern wenn die geometrischen Eigenschaften der Unterlippe bzw. Oberlippe erfasst werden. Somit kann, wie in dem oben erwähnten Beispiel, bei Erkennen einer Mundpartie, die beispielsweise den Buchstaben "0" artikuliert, beispielsweise ein erster bestimmter Steuervorgang ausgelöst werden, während bei Erkennen des Buchstabens "M" ein zweiter bestimmter Steuervorgang ausgelöst wird. Durch Erfassen des Mundbereichs eines Gesichts über einen längeren Zeitraum bzw. über mehrere erfasste Bilder hinweg ist es auch möglich, die zeitliche Veränderung von Mundmerkmalen zu ermitteln und bei Erkennen einer bestimmten zeitli- chen Abfolge von Mundmerkmalen ein bestimmtes Signal auszugeben bzw. einen bestimmten Steuervorgang auszulösen.
Soll nun über einen längeren Zeitraum hinweg ein Gesicht eines Menschen, insbesondere die Mundpartie, erfasst werden, um daraus Viseme zu extrahieren bzw. abzuleiten, so muss nicht bei jedem neuen erfassten Bild ein oben erwähntes Verfahren durchgeführt werden, bei dem anhand der Überprüfung einer positionsmäßigen Beziehung von festgelegten Segmenten in dem erfassten Bild auf die Mundpartie geschlossen werden kann, es kann zur Verringerung der Rechenleistung folgendes Verfahren durchgeführt werden. Wird von einer Szene ein erstes Bild aufgenommen, und in diesem die Position der Mundpartie eines Gesichts bestimmt, so kann bei einem folgenden erfassten Bild, das im Bruchteil einer Sekunde später von der Szene er- fasst wird, davon ausgegangen werden, dass sich die Position der in dem ersten erfassten Bild gefundenen Mundpartie nicht sehr wesentlich verschoben hat. Eine derartige Annahme kann beispielsweise bei einer Bilderfassungsrate von 10 Bildern
(Frames) pro Sekunde oder mehr, insbesondere 15 Bilder pro Sekunde, und insbesondere für eine Szene angenoin.T-.en werden, bei der der Benutzer sich in einer im Wesentlichen ortsfesten Position befindet, wie beispielsweise ein Fahrer in einem Auto. Gemäß einer vorteilhaften Ausgestaltung wird somit in dem zweiten erfassten Bild lediglich ein Bereich bzw. Analysebe- reich an der Position des Analysebereichs des ersten Bilds untersucht, d. h. es wird eine Merkmalsextraktion einschließlich des ersten' Prüfschritts und eventuell des zweiten Prüf- schritts durchgeführt, um zum Einen eine Plausibilitätsprü- fung durchzuführen, ob in dem neuen Analysebereich eine Mund- partie eines Gesichts enthalten ist, und wenn dies zutrifft, welches Visem bzw. Mundmerkmal gebildet von der Ober- und Unterlippe in dem neuen Analysebereich vorhanden ist. Gemäß ei- ner weiteren vorteilhaften Ausgestaltung kann zur Berücksichtigung einer zumindest geringen Bewegung des Gesichts in der Szene ein gegenüber dem im ersten Bild um einen bestimmten Faktor vergrößerter Analysebereich im zweiten erfassten Bild verwendet werden. Vorteilhafter Weise wird der erweiterte A- nalysebereich an einer Position im zweiten erfassten Bild angeordnet, so dass er konzentrisch gegenüber dem Analysebe- reich im ersten erfassten Bild ist. Beispielsweise kann der erweiterte Analysebereich um einen Faktor 1,1 bis 1,2, d.h. 10 % bis 20%, größer sein als der Analysebereich im ersten erfassten Bild.
Wurde in dem neuen erweiterten Analysebereich des zweiten erfassten Bildes eine Mundpartie bzw. Ober- und Unterlippe in einem bestimmten Abschnitt dieses Analysebereichs erkannt, so kann der erweiterte Analysebereich wieder auf die Größe des ursprünglichen Analysebereichs verringert werden, wobei er derart positionsmäßig angeordnet wird, dass er wieder die Mundpartie des Gesichts einschließt. Das bedeutet, verändert sich die Position der Mundpartie von dem ersten erfassten Bild zu dem zweiten erfassten Bild, so wird in dem zweiten erfassten Bild zunächst ein etwas größerer Bereich analysiert, und dann die Größe des Analysebereichs verringert .und mit der Bewegung der Mundpartie bezüglich der Position mit verschoben. Somit kann von Bild zu Bild ein Analysebereich mit der Bewegung der Mundpartie eines erfassten Gesichts mit bewegt bzw. mit verschoben werden und das Verfahren bleibt an seinem Ziel, der Mundpartie, fixiert.
Da bei einem Lippenverfolgungsmechanismus der oben dargestellten Art es nicht . mehr notwendig ist, das ganze Gesicht eines Benutzers zu erfassen, kann gemäß einer vorteilhaften Ausgestaltung während der Lippenverfolgung lediglich ein Bild des (ursprünglichen) Analysebereichs bzw. ein Bild des um ei- nen bestimmten Faktor erweiterten neuen Analysebereichs des vorliegenden (zweiten) erfassten Bildes erfasst und analysiert werden. Dazu kann der Analysebereich gesondert fokus- siert werden. Eine Datenverarbeitungsanlage bzw. ein optischer Sensor kann dabei eine Autofocussierungseinrichtung sowie evtl . eine Bewegungs- oder Nachführeinrichtung für den Sensor aufweisen. Derartige Einrichtungen erlauben dann dem (neuen) Analysebereich stets mit einer guten bzw. bestmöglichen Auflösung zu erfassen, um Merkmale bzw. Viseme mit hoher Qualität abzuleiten.
Zusammenfassend bringt dieser Lippen-Verfolgungsmechanismus, bei dem lediglich ein Ausschnitt eines erfassten Bildes, nämlich der im letzten erfassten Bild ermittelte Analysebereich, analysiert wird, den Vorteil, dass Rechenleistung eingespart werden kann, die benötigt werden würde, wenn jedes Mal das gesamte erfasste Bild analysiert werden müsste.
Gemäß einem weiteren Aspekt der Erfindung wird eine Anordnung, insbesondere eine Datenverarbeitungsanlage, geschaffen, die derart eingerichtet ist, ein oben dargestelltes Verfahren bzw. vorteilhafte Ausgestaltungen hiervon auszuführen. Eine derartige Anordnung hat dabei einen optischen Sensor, wie eine Kamera, zum Aufnehmen bzw. Erfassen eines Bildes einer Szene. Als optischer Sensor bzw. Kamera kann dabei eine CCD(Charged Coupled Device: Ladungsgekoppelte Vorrichtung) - Kamera verwendet werden. Die Anordnung umfasst ferner eine Auswerteeinrichtung mit einem optischen Auswerteabschnitt zum Analysieren der in dem erfassten Bild dargestellten Szene gemäß einem oben dargestellten Verfahren bzw. Ausgestaltungen hiervon. Es ist dabei nicht notwendig, dass der optische Sensor in der Anordnung integriert ist, er kann auch als externe Komponente bzw. Erweiterungskomponente mit der Anordnung verbunden sein. Die Anordnung bzw. Datenverarbeitungsanlage kann als stationärer Computer, tragbarer Computer, insbesondere PDA (Personal Digital Assistant: Persönlicher digitaler Assistent) , als Mobilfunkgerät bzw. Mobiltelefon, bzw. realisiert sein. Aufgrund des geringen Ressourcenbedarfs (bezüglich Rechenleistung oder Speicherbedarfs) des oben dargestellten Verfahrens, das in der Auswerteeinrichtung, genauer gesagt im optischen Auswerteabschnitt durchzuführen ist, eignet sich das dargestellte erfindungsgemäße Verfahren zur Verwendung in tragbaren bzw. mobilen Datenverarbeitungsanlagen, wie PDAs oder Mobilfunkgeräten bzw. Mobiltelefonen.
Gemäß einem weiteren Aspekt wird ein Programmprodukt für eine Datenverarbeitungsanlage geschaffen, das Softwarcode- Abschnitte enthält, mit denen das oben dargestellte Verfahren bzw. vorteilhafte Ausgestaltungen hiervon auf der Datenverar- beitungsanlage ausgeführt werden kann. Das Programmprodukt lässt sich durch geeignete Implementierung des Verfahrens bzw. der vorteilhaften Ausgestaltung davon in einer Programmiersprache und Übersetzung in für die Datenverarbeitungsanlage, insbesondere dessen Auswerteeinrichtung, ausführbaren Code ausführen. Die Softwarecode-Abschnitte werden dazu gespeichert. Dabei wird unter einem Programmprodukt das Programm als handelsbares Produkt verstanden. Es kann in beliebiger Form vorliegen, z. B. auf Papier, einem computerlesbaren Datenträger oder über ein Netz verteilt.
Gemäß einem weiteren Aspekt der Erfindung kann das oben dargestellte Verfahren bzw. vorteilhafte Ausgestaltungen hiervon in einem Verfahren zur Spracherkennung, insbesondere zur a- kustischen Spracherkennung, integriert sein. Gemäß einem der- artigen Verfahren wird ein akustisches Sprachsignal aufgenommen und werden Phonem-Merkmale aus dem Sprachsignal ermittelt. Eine derartige Ermittlung kann mittels HMM (Hidden Mar- kov Modellen) oder ANN (Artificial Neural Networks) erfolgen. Ferner wird eine Szene mit einem Gesicht, dem Gesicht der das akustische Sprachsignal abgebenden Person, aufgenommen und aus dem Gesicht bzw. dessen Mundpartie Visem-Merkmale extrahiert. Anschließend werden anhand einer Kombination der Phonem-Merkmale und Visem-Merkmale unter eventueller Einbeziehung einer Gewichtungs- und Entscheidungsfunktion Sprachmerk- male abgeleitet. Zum Durchführen eines derartigen Verfahrens kann die oben erwähnte Anordnung bzw. Datenverarbeitungsanlage gemäß einem Aspekt der Erfindung ferner einen akustischen Sensor, wie ein Mikrofon, zum Aufnehmen eines akustischen Sprachsignals aufweisen, wobei die Auswerteeinrichtung ferner eine mit dem optischen Auswerteabschnitt und dem akustischen Sensor verbundenen Spracherkennungsabschnitt zur Spracherken- nung umfasst.
Neben der Möglichkeit, das oben dargestellte Verfahren zur (Mundbereichs-)Visem-Erkennung in einem integrierten Sprach- erkennungsverfahren zu verwenden, ist es auch möglich, das Verfahren in anderen Anwendungen zum Einsatz zu bringen. Wie bereits erwähnt, kann das Verfahren dafür verwendet werden, bei Vorliegen bestimmter Viseme bzw. Visem-Merkmale bestimmte Steuervorgänge auszulösen. Ferner kann bei Erkennen eines Gesichts eines Benutzers einer Datenverarbeitungsanlage, insbe- sondere eines Mobilfunkgeräts, eine sogenannte Push-to-talk- Funktion realisiert werden, bei dem ein Benutzer des Mobilfunkgeräts ähnlich dem Drücken einer Push-to-talk-Taste bei einem Funkgerät lediglich das Mobilfunkgerät anschauen muss, um eine Sprachübertragung zu einem anderen Mobi1funkteilneh- mer zu starten. Es ist auch denkbar, die Gesichtserkennung bzw. die Positionserkennung eines Gesichts bzw. einer Mundpartie in einem erfassten Bild für Spielanwendungen zu nutzen. Dabei kann ein Benutzer durch Verändern der Position seines Gesichts bzw. seiner Mundpartie gegenüber einem opti- sehen Sensor, wie einer Kamera, beispielsweise ein Zeigeelement auf einer auf einer Anzeige dargestellten Benutzeroberfläche einer Datenverarbeitungsanlage bewegen und anschließend durch Einstellen bestimmter Viseme der Mundpartie bestimmte Ereignisse, insbesondere am Ort des Zeigeelements auf der Benutzeroberfläche auslösen.
Wie es aus obiger Beschreibung der Analyse eines Bildes einer Szene zum Auffinden eines Gesichts zu ersehen ist, ist für das Verfahren lediglich ein Graustufenbild mit bestimmten Helligkeitswerten bzw. Luminanzwerten erforderlich. Jedoch ist das Verfahren nicht auf ein Graustufenbild beschränkt, sondern ist vielmehr auch in der Lage, ein Farbbild (bei- spielsweise von einer Farbkamera erfasst) zu verarbeiten. Wesentlich hierbei ist, dass wiederum die Luminanzwerte des Farbbildes bzw. der Bildpunkt untersucht und verarbeitet werden (wie beispielsweise bei der Verarbeitung des Bildes mit- tels des Gradientenfilters, usw.).
Die Verwendung eines Farbbildes bietet dabei noch weitere Vorteile. Nach Erfassen des Bildes durch eine Kamera bzw. vor der Verarbeitung durch den Gradientenfilter, wie oben erläu- tert, ist es möglich, in einem ersten vorbereitenden Schritt eine Farbklassifikation des Bildes vorzunehmen. Das bedeutet, das Bild wird nach Farbwerten untersucht, wobei diejenigen Bildbereiche markiert werden, die Farbwerte in einem bestimmten Farbbereich aufweisen, der den Farbwerten menschlicher Haut entspricht. Diese Bildbereiche (es kann auch lediglich ein Bildbereich sein) werden nun verwendet, um die eigentliche Untersuchung nach gesichtsspezifischen Merkmalen durchzuführen (beginnend mit der Verarbeitung durch den Gradientenfilter, usw. ) . Dazu können die diese Bereiche in Untersu- chungsrahmen einbeschrieben werden, die vorteilhafterweise eine rechteckige Form aufweisen, wobei in den Untersuchungs- rahmen die Untersuchung nach gesichtsspezifischen Merkmalen durchgeführt wird. Dieses Vorgehen hat dabei mehrere Vorteile. Zum einen wird die Sicherheit bzw. Wahrscheinlichkeit, mit der ein Gesicht und nicht ein in den Helligkeitsmerkmalen ähnliches Gebilde in der Szene gefunden wird größer, da ja die Farbklassifikation ein weiteres charakteristisches Unterscheidungsmerkmal (für ein Gesicht gegenüber anderen Objekten in der Szene) bietet. Zum anderen wird dann durch das eigent- liehe Untersuchen bzw. Verarbeiten nur der Untersuchungsrah- en, die im allgemeinen eine wesentlich geringere Größe als das gesamte erfasste Bild aufweisen, der Verarbeitungs- bzw. Rechenaufwand, insbesondere bei der Gradientenfilterung, wesentlich verringert.
Das beschriebene Verfahren kann ferner in der Informationsbereitstellung bei Bild- bzw. Videoübertragungsdiensten verwen- det werden. Zur Verbesserung der Informationsbereitstellung insbesondere bei Bild- bzw. Videoübertragungsdiensten in Mobilfunksystemen der 3. Generation bzw. gemäß dem UMTS (Universal Mobile Telecommunications System) -Standard besteht die Möglichkeit, Werbung, Provider-Logos, Informationsbanner, usw. in ein Bild einer Bild- bzw. Videoübertragun einzublenden. Auch das Einspielen von Text-Nachrichten als Bannertext oder die Einblendung von kleinen Avataren zur Verbesserung der Benutzerinteraktion erlauben neue Informationsbereitstel- lungsmöglichkeiten.
Problematisch bei der Bild- bzw. Videoübertragung auf Mobiltelefone ist dabei, dass das Display zur Anzeige eines Bildes sehr klein ist. Somit ist die Einblendung von Informations- elementen eine diffizile Angelegenheit, da nach Möglichkeit das Informationselement nicht das Gesicht des Teilnehmers am anderen Ende der Verbindung überdecken soll (wenn das Gesicht des anderen Teilnehmers ständig überdeckt wäre, würde nämlich eine Videoübertragung nicht viel Sinn machen) .
Somit ist es gemäß einem weiteren Aspekt der Erfindung denkbar, eine Möglichkeit zu schaffen, die eine verbesserte Informationsbereitstellung in einem Bild bei minimierter Beeinträchtigung des wesentlichen Bildinhalts gewährleistet.
Ein Verfahren zum Einfügen eines Informationsfelds in ein Bild einer Szene umfasst dabei folgende Schritte. Zunächst wird das Vorhandensein und die Position eines Gesichts in dem Bild bestimmt. Dies kann mit gemäß einem oben beschriebenen Verfahren erfolgen, ist aber nicht darauf beschränkt. Anschließend wird das Gesicht in ein Gesichtsrahmenobjekt einbeschrieben, wobei das Gesichtsrahmenobjekt eine geometrische Form, insbesondere die eines Rechtecks aufweist. Nun wird das Informationsfeld derart in das Bild eingefügt, dass sich das Gesichtsrahmenobjekt und das Informationsfeld nicht überlappen. Das Gesichtsrahmenobjekt soll dabei eine Fläche kennzeichnen, die sowohl den eigentlichen Rahmen um das Gesicht als auch die Fläche innerhalb des Rahmens umfasst. Auf diese Weise können Informationsfelder, wie beispielsweise Werbung oder Logos usw. in ein Bild eingefügt werden, ohne dass das Gesicht einer Person überdeckt wird. Insbesondere bei einer Videotelefonieanwendung, bei der ein Bild eines ersten Teilnehmers bzw. Benutzers auf das Mobiltelefon eines weiteren Teilnehmers übertragen wird, können so weitere Informationen zusätzlich zum Bild des ersten Teilnehmers übertragen werden, ohne den wesentlichen Bildinhalt, nämlich das Gesicht des ersten Teilnehmers zu überdecken.
Das Informationsfeld kann dabei oberhalb, unterhalb, links oder rechts von dem Gesichtsrahmenobjekt, das wie bereits erwähnt, vorteilhafterweise die Form eines Rechtecks aufweist, eingefügt werden.
In dem Fall, dass der außerhalb des Gesichtsrahmenobjekts verbleibende Bereich des Bildes kleiner als der für das Informationsfeld benötigte Bereich ist, kann vorteilhafterweise das Informationsfeld an einer vorher bestimmten Standard-
Position eingefügt wird. Es wäre ferner denkbar, das Gesichtsrahmenobjekt in dem Fall, dass der außerhalb des Ge- sichtsrahmenobjekts verbleibende Bereich des Bildes kleiner als der für das Informationsfeld benötigte Bereich ist, zu- nächst um einen bestimmten Betrag zu verkleinern, so dass das Gesicht zwar eventuell um einen kleinen Betrag über das Gesichtsrahmenobjekt hinaussteht, aber dennoch im wesentlichen davon erfasst wird. Nun kann überprüft werden, ob der außerhalb des reduzierten Gesichtsrahmenobjekts verbleibende Be- reich des Bildes kleiner als der für das Informationsfeld benötigte Bereich ist. Reicht der verbleibende Bereich nun aus, kann das Informationsfeld dort plaziert werden, während bei zu geringem Bereich das Informationsfeld an der vorher bestimmten Standard-Position eingefügt wird.
Tritt der Fall ein, bei dem das Vorhandensein eines Gesichts erfolglos bestimmt wurde (weil kein Gesicht in der Szene vor- handen war oder nicht auffindbar war) so kann das Informationsfeld wiederum an einer vorbestimmten Standard-Position eingefügt werden.
Gemäß einer vorteilhaften Ausgestaltung umfasst das Informationsfeld Symbole, Logos, alphanumerische Zeichen oder bewegte Bildobjekte.
Das beschriebene Verfahren kann ferner zum Fokussieren auf ein Objekt verwendet werden. Beim Erfassen von Bildern einer Person, d.h. bei Ablichten bzw. Filmen, soll das Gesicht der Person immer scharf abgebildet werden, unabhängig von der Position des Gesicht im Abbildungsbereich des Kameraelements einer Foto- oder Videokamera und unabhängig von der Entfernung zur Kamera.
Durch den Aufbau einer Kameraoptik, d.h. durch die Anordnung deren Linsen, werden immer nur Objekte scharf abgebildet, die in einem bestimmten Entfernungsbereich liegen. Ist die Linsenanordnung veränderbar, so lässt sich der Entfernungsbereich, in dem Objekte scharf abgebildet werden, einstellen. Dies wird auch als Fokussierung auf ein Objekt bezeichnet. Diese Fokussierung kann von der Kamera auch automatisch vor- genommen, wenn die Kamera eine sogenannte Auto-Fokus-Funktion besitzt. Allerdings kann die Kamera hier nur auch Objekte an bestimmten Punkten im Abbildungsbereich für die Fokussierung bzw. ScharfStellung verwenden. Es wird beispielsweise immer auf das Objekt in der Bildmitte fokussiert. Wenn aber ein Ob- jekte, wie ein Gesicht, das beispielsweise bei einer Videote- lefonie-Anwendung in einem Mobiltelefon relevant ist, vor einem Hintergrund erfasst wird, soll eigentlich nach Möglichkeit das Gesicht scharf abgebildet werden, ungeachtet, an welcher Position im Abbildungsbereich des Kameraelements es sich befindet. Um eine Fokussierung auf ein Gesicht zu erreichen, musste nun das Mobiltelefon bzw. dessen das Kameraelement aufweisende Kameramodul so ausgerichtet werden, dass sich das Gesicht im Fokussierungspunkt (beispielsweise der Bildmitte) des Kameraelements befindet, musste das Gesicht fokussiert werden und dann das Kameramodul wieder in die ursprüngliche Stellung gebracht werden, um die gewünschte Szene bzw. das gewünschte Bild bei scharf abgebildetem Gesicht zu erfassen. Als nachteilig stellt sich bei einem derartigen Vorgehen heraus, dass in dem Fall, in dem sich das Gesicht bewegt und seine Entfernung zum Kameramodul verändert, das Gesicht nicht mehr scharf abgebildet wird und das beschriebe- ne aufwendige Vorgehen zur Fokussierung auf das Gesicht wiederholt werden müsste.
Somit ist es gemäß einem weiteren Aspekt der Erfindung denkbar, eine Möglichkeit der automatischen Fokussierung auf ein Objekt, insbesondere ein Gesicht, zu schaffen, die eine verfahrenstechnische minimierte Fokussierung bei einem sich bewegenden Objekt ermöglicht.
Ein Verfahren zum automatischen Fokussieren auf ein Objekt umfasst dabei folgende Schritte. Dabei wird zunächst eine Kameraeinrichtung mit einem optischen Sensor zum Erfassen eines Bildes, einer Szene und einer vor dem Kameraelement angeordneten Abbildungseinrichtung zum Abbilden der Szene auf den optischen Sensor bereitgestellt. Anschließend wird die Posi- tion eines Gesichts in dem von dem optischen Sensor erfassten Bild der Szene bestimmt. Dies kann mit gemäß einem oben beschriebenen Verfahren erfolgen, ist aber nicht darauf beschränkt. Ferner wird die Entfernung des Gesicht zu der Kameraeinrichtung mittels einer Entfernungsmessungseinrichtung ermittelt. Somit ist es nun möglich, die Abbildungseinrichtung auf die ermittelte Entfernung des Gesichts zu der Kameraeinrichtung derart einzustellen, um das Gesicht auf dem optischen Sensor scharf abzubilden.
Insbesondere bei einer fortwährenden Erfassung von Bildern bzw. einer Erfassung in regelmäßigen zeitlichen Abständen, wie beispielsweise im Rahmen einer Videotelefonie-Anwendung bzw. einer Videokonferenz ist es somit möglich Scharfstellen der Abbildungseinrichtung ebenso in regelmäßigen Abständen zu gewährleisten, dass ein Gesicht eines Teilnehmers immer scharf erfasst und zu einem oder mehreren anderen Teilnehmern übertragen wird.
Das • beschriebene Verfahren kann ferner zum Übertragen von Bilddaten verwendet werden. An mobile Endgeräte, insbesondere Mobiltelefone, mit Multimedia- bzw. Video-Funktionalität sind zwei wesentliche Herausforderungen gestellt. Zum einen ist eine niedrige Datenübertragungsrate (beispielsweise im Bereich von 50 Kbps (Kilobits Per Second) zur Übertragung von Videoinhalten verfügbar. Dies macht eine sehr starke Daten- kompression der zu übertragenden Videodaten erforderlich, was jedoch Kodierungsartefakte ("coding artefacts"), wie "Blockbildungsartefakte" als Folge einer blockorientierten Kodierung gemäß einem H.263- oder MPEG4 (Motion Picture Experts Group 4) -Standard, mit sich bringt. Diese Artefakte verrin- gern die Videoqualität einer Videoübertragung eines Teilnehmers beispielsweise einer Videotelefonie-Anwendung, wodurch die Akzeptanz mobiler Video-Anwendungen verringert wird.
Andererseits wird die Integration qualitativ hochwertiger Vi- deo-Anwendungen ein wichtiger Schritt zur Stärkung der Wettbewerbsposition auf dem Markt für Hersteller mobiler Endgeräte, wie Mobiltelefone, sein.
Somit ist es gemäß einem weiteren Aspekt der Erfindung denk- bar, eine Möglichkeit zur Videoübertragung, insbesondere zwischen mobilen Endgeräten, zu schaffen, die eine gute Qualität bei der Übertragung der wesentlichen Bildbestandteile gewährleistet.
Ein Verfahren zum Übertragen von Bilddaten von einem ersten Kommunikationsgerät zu einem zweiten Kommunikationsgerät in einem Kommunikationsnetz hat dabei folgende Schritte. Das Ko munikationsnetz kann dabei ein Kommunikationsnetz mit feststehenden Sende-/Empfangseinrichtungen, wie Basisstationen, und einem diese verbindenden Kernnetz sein, oder kann lediglich ein zwischen zwei Kommunikationsgeräten etabliertes Netz sein. Zunächst wird ein erstes Bilds einer Szene in dem ersten Kommunikationsgerät bereitgestellt. Dies kann beispielsweise dadurch geschehen, dass das erste Bild von einer mit dem ersten Kommunikationsgerät verbundenen bzw. in diesem integrierten Kamera aufgenommen worden ist. Anschließend wird die Position eines Gesichts in dem ersten Bild bestimmt. Dies kann mit gemäß einem oben beschriebenen Verfahren erfolgen, ist aber nicht darauf beschränkt. Das Gesicht wird dann in ein Gesichtsrahmenobjekt einbeschrieben, das beispielsweise die Form eines Rechtecks aufweisen kann. Ferner wird der Bildbereich, der von dem Gesichtsrahmenobjekt umfasst wird, ausgeschnitten, um so ein zweites Bild zu erhalten. Diese zweite Bild wird dann kodiert und es wird das kodierte zweite Bild zu dem zweiten Kommunikationsgerät übertragen. Dort kann das zweite Bild dekodiert und beispielsweise auf einer Anzei- geeinrichtung des zweiten Kommunikationsgeräts angezeigt werden. Auf diese Weise wird nur der wesentliche Bildinhalt eines ersten erfassten Bildes, nämlich ein Gesicht einer Person bzw. eines Kommunikationsteilnehmers, kodiert und zu einem zweiten Kommunikationsteilnehmer übertragen. Dies spart zum einen Rechenleistung beim Kodieren und Dekodieren, und bringt somit eine verlängerte Standzeit der Kommunikationsgeräte. Ferner kann die gesamte Rechenleistung für die relevanten Teile eines Bildes eingesetzt werden, wodurch die Kodierungsqualität erhöht und das Auftreten von Artefakten verringert wird.
Neben der Möglichkeit, nur die relevanten Teile (das Gesicht eines Teilnehmers) eines Bildes zu übertragen, besteht ferner die Möglichkeit das gesamte erste Bild, d.h. eine Person mit Hintergrund an einen zweiten Kommunikationsteilnehmer zu ü- bertragen. Dabei kann ferner das erste Bild kodiert und dieses kodierte Bild zu dem zweiten Kommunikationsgerät übertra- gen werden, wobei in dem zweiten Kommunikationsgerät das ü- bertragene zweite Bild an der Position in das erste Bild eingefügt wird, an der es in dem ersten Kommunikationsgerät aus dem ersten Bild ausgeschnitten worden ist. Um jedoch wieder die Bildqualität in den wesentlichen Bereichen des Bilds (d.h. im Bereich des Gesichts einer Person) zu erhöhen, ist es vorteilhaft, das zweite Bild mit einer höheren Rate zu kodieren und zu dem zweiten Kommunikationsgerät zu übertragen als das erste Bild. Anders ausgedrückt soll das erste Bild in größeren zeitlichen Abständen wiederholt kodiert und zu dem zweiten Kommunikationsgerät gesendet werden als das zweite Bild, d.h. während beispielsweise das zweite Bild 15 mal pro Sekunde kodiert und übertragen wird, wird das erste Bild nur 1 mal pro Sekunde kodiert und übertragen (was in Kauf genom- men werden kann da sich der Hintergrund, der auf dem ersten Bild zu sehen ist, nur geringfügig mit der Zeit ändert) .
Anstelle der Möglichkeit, einen "reellen" Hintergrund in der Form des ersten Bildes, wie gerade beschrieben, zu übertra- gen, besteht ferner die Möglichkeit, einen "künstlichen" Hintergrund, wie einen beliebig ausgestalteten (künstlichen) Rahmen (nach einem Kodiervorgang) von dem ersten an das zweite Kommunikationsgerät zu übertragen. Dieser wird vom zweiten Kommunikationsgerät dekodiert und mit dem eigentlichen Bild eines Gesichts zusammengeführt, so dass das eigentliche Bild mit dem Gesicht innerhalb des Rahmens angeordnet ist. Da dieser künstliche Rahmen sich nicht mit der Zeit ändert, ist es ausreichend diesen nur einmal, beispielsweise zu Beginn einer Bild- bzw. Videoübertragung zu übertragen. Soll sich das Aus- sehen des Rahmens jedoch mehrmals während der Bild- bzw. Videoübertragung ändern, so kann das erste Kommunikationsgerät bei einer (vom Benutzer des ersten Kommunikationsgerät gewünschten Änderung) einen neuen Rahmen zum zweiten Kommunikationsgerät senden. Wie gerade erwähnt, kann der Benutzer des ersten Kommunikationsgerät das Aussehen des Rahmens einstellen, beispielsweise durch Auswahl aus einer vom Kommunikationsgerät bereitgestellten Liste. Einmalige oder seltene Über- tragung des Rahmens (im Gegensatz zu der häufigen Übertragung des ein Gesicht enthaltenen Bildes) verringert somit die Ressourcen bei der Kodierung des Hintergrundbildes und stellt dem Benutzer des ersten Kommunikationsgeräts eine Möglichkeit bereit, auf die Darstellung der Bilddaten auf dem zweiten Kommunikationsgerät Einfluss zu nehmen.
Es ist ferner denkbar, nicht nur ein Gesicht in dem ersten Bild zu erkennen, sondern auch mehrere. Dabei wird dann, wenn ein derartiges Verfahren angewendet werden soll, jedes der Gesichter in ein jeweiliges Gesichtsrahmenobjekt einbeschrieben, als zweite Bilder ausgeschnitten, kodiert und zu einem zweiten Kommunikationsgerät übertragen. Dort können die (zweiten) Bilder entweder direkt nebeneinander zusammenge- setzt werden, in einem von dem zweiten Kommunikationsgerät bereitgestellten Standard-Hintergrundbild oder in eine von dem ersten Kommunikationsgerät übermittelten künstlichen Rahmen (für eine Mehrzahl von Gesichter) eingefügt werden, oder aber, gemäß obiger Ausgestaltung an entsprechender Position in das erste übertragene Bild eingesetzt werden.
Gemäß einer vorteilhaften Ausgestaltung wird das übertragene (dekodierte) zweite Bild im zweiten Kommunikationsgerät mit einem vom zweiten Kommunikationsgerät bereitgestellten sieht- baren Rahmen umgeben, der beliebige Formen und Farben aufweisen kann, und im Rahmen einer "Fun" -Anwendung benutzerdefiniert einstellbar ist. Das bedeutet bei dieser Ausgestaltung kann der Benutzer des zweiten Kommunikationsgeräts das Aussehen des als Hintergrund zu verwenden Rahmens bestimmen bzw. einstellen.
Das beschriebene Verfahren kann ferner zum Umwandeln eines
Bilds einer Szene verwendet werden. Die vorliegende Erfin- düng betrifft ein Verfahren zum Umwandeln eines Bilds einer
Szene, insbesondere in eines Bild, das ein menschliches Ge- sieht aufweist, sowie eine Datenverarbeitungsanordnung zum Ausführen des Verfahrens.
In mobilen Endgeräten mit Multimedia-Funktionalität sind her- kömmlicherweise Kameras vorgesehen, die Bilder erfassen bzw. bereitstellen, welche ein Bildformat aufweisen, das größer als ein Bildformat ist, das zum Kodieren bzw. Verschlüsseln oder zum Anzeigen auf einem Display verwendet wird. Somit muss ein Herunterskalieren des Bildes, d.h. ein Verringern der Größe bzw. Auflösung des Bildes durchgeführt werden (beispielsweise von einem VGA(Video Graphics Array) /CIF (Common Intermediate Format) -Format zu einem QCIF (Quarter Common In- termediate Format) -Format) . Dies verursacht jedoc oft einen Qualitätsverlust, der von dem Herunterskalierungsalgorithmus abhängt, welcher natürlich die begrenzte Leistungsfähigkeit kleiner mobiler Endgeräte berücksichtigt.
Auf der anderen Seite ist in einem Bild das Gesicht einer Person, insbesondere bei Bild- bzw. Videoübertragungsverfah- ren mit Bezug auf den MMS (Multimedia Messaging Service) - Dienst oder einer Videotelefonie-Anwendung in Kommunikations- Systemen bzw. MobilfunkkommunikationsSystemen, das wesentliche Objekt. Ist die Entfernung von der Person zur Kamera oder beispielsweise einem eine Kamera aufweisenden Mobiltelefon jedoch groß, so wird das Gesicht der Person relativ klein im Bild erscheinen und schlecht sichtbar sein. Dieser Effekt verstärkt sich weiter, wenn, wie oben bereits erwähnt, ein Bild zur Übertragung an weitere Mobiltelefone odei zur Anzeige auf einem (den Abmessungen eines Mobiltelefons entspre- chend kleinen) Display herunterskaliert wird.
Somit ist es gemäß einem weiteren Aspekt der Erfindung denkbar, eine Möglichkeit zu schaffen, ein Herunterskalieren eines Bildes einer Szene durchzuführen, bei dem die wesentli- chen Bildbestandteile bestmöglich sichtbar bleiben. Ein Verfahren zum Umwandeln eines ersten Bilds einer Szene in ein zweites Bild mit einer geringeren Größe umfasst dabei folgende Schritte. Zunächst wird die Position eines Gesichts in dem ersten Bild mit der ersten Größe, das beispielsweise von einer Kamera erfasst worden ist, bestimmt. Dies kann mit gemäß einem oben beschriebenen Verfahren erfolgen, ist aber nicht darauf beschränkt. Anschließend wird das Gesicht in ein Gesichtsrahmenobjekt, das der Größe des zweiten Bilds entspricht, einbeschrieben. Der Bildbereich, der von dem Ge- sichtsrahmenobjekt umfasst wird, wird dann ausgeschnitten, um so das zweite Bild mit der gewünschten zweiten Größe zu erhalten. Somit ist es auf einfache Weise möglich, ein automatisches Herunterskalieren eines Bildes bei gleichzeitigem Zoomen auf den wesentlich Bildbestandteil, nämlich das Ge- sieht einer Person, zu bewirken. Das wiederum bedeutet, dass der wesentliche Bildbestandteil trotz des Herunterskalierens gut erkennbar bleibt .
Gemäß einer vorteilhaften Ausgestaltung wird in dem Fall, dass die Größe des Gesichts größer als die Größe des zweiten
Bilds ist, das Gesicht in ein zweites Gesichtsrahmenobjekt (dessen Größe größer als die des zweiten Bildes bzw. des ersten Gesichtsrahmenobjekt ist) einbeschrieben und der von dem zweiten Gesichtsrahmenobjekt umfasste Bildbereich des ersten Bilds auf die Größe des zweiten Bildes herunterskaliert, um so das zweite Gesichtsrahmenobjekt in das erste Gesichtsrahmenobjekt mit der gewünschten Größe des zweiten Bilds umzuwandeln. Somit ist es auch noch möglich, bei einem beträchtlichen Unterschied in der Größe des ersten (erfassten) Bildes und des (gewünschten) zweiten Bildes ein Herunterskalieren zu erreichen, wobei das Gesicht in der Szene größt möglichst noch in dem zweiten Bild vorgesehen ist.
Neben der Möglichkeit, die Bildgröße umzuwandeln besteht fer- ner die Möglichkeit das Format, d.h. das geometrische Längen- Breiten-Verhältnis und/oder die Auflösung, bei der Umwandlung vom ersten in das zweite Bild umzuwandeln. Beispielsweise kann das erste Bild ein CIF- oder VGA-Format und das zweite Bild ein QCIF-Format aufweisen.
Bevorzugte Ausführungsformen der Erfindung werden nachfolgend Bezug nehmend auf die beiliegenden Zeichnungen näher erläutert. Es zeigen:
Figur 1 eine beispielhafte Anordnung für einen audiovisuelle Spracherkennung;
Figur 2 eine schematische Anordnung der wesentlichen Komponenten zur Analyse einer Szene bzw. eines Gesichts gemäß einer bevorzugten Ausführungsform;
Figur 3 eine schematische Anordnung der Verfahrensschritte gemäß einem primären Lippendetektionsmechanis- mus zum Auffinden einer Mundpartie in einem Bild einer Szene;
Figuren 4 Bilder einer Szene vom Erfassen der Szene bzw. nach zwei bestimmten Verarbeitungsschritten;
Figur 5 ein erfasstes Bild einer Szene mit einem markierten Segment eines Mundbereichs;
Figur 6 eine vergrößerte Ansicht des in Figur 5 dargestellten Mundbereichs mit markierten Uberlippen- und Unterlippenlinien;
Figuren 7 ein Bild einer weiteren erfassten Szene bzw. ein Bild der Szene nach einer Mehrzahl von Verarbeitungsschritten zum Darstellen eines sekundären Lippendetektionsmechanismus; und
Figuren 8 ein Bild einer erfassten Szene mit markiertem A- nalysebereich sowie einem erweiterten Analysebe- reich bzw. eine vergrößerte Darstellung des erweiterten -Analysebereichs;
Figur 9 die wesentlichen Komponenten einer Datenverarbei- tungsanordnung zum Einfügen eines Informationsfeldes in ein Bild gemäß einer bevorzugten Aus- führungsform;
Figuren 10 Bilder einer Szene, in die Informationsfelder ge- maß der vorliegenden Erfindung eingefügt worden sind;
Figur 11 eine Kommunikationsanordnung bestehend aus zwei Mobiltelefonen und einem Ko munikationsnetz, in der eine Videotelefonie-Anwendung mit einer Bildverarbeitung gemäß einer Ausführungsform der vorliegenden Erfindung durchgeführt wird;
Figur 12 eine Datenverarbeitungsanlage in Form eines Mo- biltelefons zum Fokussieren auf ein Objekt gemäß einer Ausführungsform der Erfindung;
Figur 13 die wesentlichen Komponenten eines Kommunikati- onssystems bzw. einer Kommunikationsanordnung zum Übertragen eines Bildes von einem ersten Kommunikationsgerät zu einem zweiten Kommunikationsgerät gemäß einer bevorzugten Ausführungsform;
Figuren 14 Bilder einer Szene, in denen das Extrahieren des Gesichts einer Person veranschaulicht ist;
Figur 15 die wesentlichen Komponenten einer Datenverarbeitungsanordnung zum Umwandeln des Bilds einer Szene gemäß einer bevorzugten Ausführungsform; Figuren 16 Bilder einer Szene, in denen das Extrahieren des Gesichts einer Person bzw. das Umwandeln eines ersten Bildes in ein zweites veranschaulicht ist.
Es sei dabei zunächst auf Figur 2 verwiesen, in der eine schematische Darstellung der Komponenten bzw. Mechanismen zum Erfassen und Analysieren einer Szene dargestellt sind. Wie es in Figur 2 zu erkennen ist, ist dabei eine Kamera K als opti- scher Sensor vorgesehen, die in der Lage ist, eine Szene (eine reelle Umgebung mit bestimmten Sachen und/oder Personen) zu erfassen. Die Kamera kann dabei beispielsweise als eine CCD-Kamera ausgebildet sein. Die Kamera K ist mit einem optischen Auswerteabschnitt OAA verbunden, in dem verschiedene Mechanismen bzw. Verfahren zur Analyse der von der Kamera erfassten Szene ablaufen können. Der optische Auswerteabschnitt OAA ist dabei in der Lage, einen ersten oder primären Lippendetektionsmechanismus PLD zum Auffinden eines Gesichts bzw. einer Mundpartie in dem erfassten Bild der Szene durchzufüh- ren. Entsprechend kann der optische Auswerteabschnitt einen alternativen oder zusätzlichen zweiten bzw. sekundären Lip- pendetektionsmechanismus SLD zum Auffinden eines Gesichts bzw. einer Mundpartie durchführen. Nach gefundener Position der Mundpartie eines Gesichts gemäß dem primären oder sekun- dären Lippendetektionsmechanismus kann mittels einer Merkmalsextraktion ME zum Einen eine verbesserte Plausibilitäts- überprüfung durchgeführt werden, ob es sich tatsächlich um eine gefundene Mundpartie handelt und es können Mundmerkmale bzw. Viseme des Mundes anhand geometrischer Eigenschaften der Ober- und Unterlippe abgeleitet werden. Die in einem ersten erfassten Bild oder Rahmen (Frame) gefundene Mundpartie bzw. deren Position kann dann in folgenden erfassten Bildern der Szene mittels einem Lippen-Tracking-Mechanismus bzw. Lippenverfolgungsmechanismus LVM weiterverfolgt werden, um nicht nur einzelne Mundmerkmale der erfassten Mundpartie für sich alleine, sondern auch eine zeitliche Änderungen der Mundmerkmale zu verfolgen. Die aus den Mechanismen PLD, SLD und ME gewonnenen Ergebnisse, nämlich dass in dem Bild einer erfassten Szene ein Gesicht einer Person bzw. eine Mundpartie vorhanden ist, können in eine Steuereinrichtung SE weitergeleitet werden. Mittels der ermittelten Ergebnisse bzw. Informa- tion, nämlich dass ein Gesicht oder eine Mundpartie in dem von der Kamera K erfassten Bild vorhanden ist, ist es möglich, bestimmte Steuervorgänge beispielsweise in einer Datenverarbeitungsanlage bzw. einer Datenverarbeitungsanordnung auszulösen. So kann beispielsweise bei Erkennen eines Ge- sichts einer Person bzw. eines Benutzers in einer als Mobilfunkgerät ausgeführten Datenverarbeitungsanlage beispielsweise ein Lautsprecher bzw. ein Mikrofon eingeschaltet werden, um eine Sprachsteuerung des Geräts zu ermöglichen. Es ist jedoch auch möglich, wie es unten ausführlicher beschrieben wird, die bei der Merkmalsextraktion extrahierten Viseme oder Mundmerkmale für eine differenziertere Steuerung einer Datenverarbeitungsanlage zu verwenden, oder als zusätzliche bzw. unterstützende Merkmale im Rahmen einer akustischen Spracherkennung zu verwenden. In diesem Fall können die Viseme einem akustischen Auswerteabschnitt zum Durchführen einer akustischen Spracherkennung zugeführt werden, wobei der akustische Auswerteabschnitt AAA zum Erfassen eines akustischen Sprachsignals eines Benutzers mit einem Mikrofon MIK als akustischem Sensor verbunden ist. Die Komponenten OAA, SE und AAA können als Teil einer Auswerteeinheit angesehen werden.
Für den Fall der im folgenden erläuterten bevorzugten Ausführungsform sind die in Figur 2 dargestellten Komponenten in einer Datenverarbeitungsanlage in Form eines Mobiltelefons (es sind natürlich auch andere Realisierungen einer Datenverarbeitungsanlage möglich, in denen die in Figur 2 dargestellten Komponenten vorgesehen werden können) angeordnet, wobei die Kamera K entweder fest im Mobiltelefon integriert sein kann oder als auswechselbare Peripheriekomponente vorgesehen sein kann. Gerade in zumeist kleinen mobilen Geräten wie den
Mobiltelefonen, ist es wichtig, dass Anwendungen, wie die im Folgenden beschriebenen Analyse einer Szene, ressourcenspa- rende Algorithmen aufweist, die hinsichtlich des Speicherbedarfs, so wie der Rechenzeit bzw. Rechenleistung minimiert sind, um die Ressourcen der Geräte möglichst auszunutzen, ohne aber einen zusätzlichen Prozessor- oder Speicherausbau notwendig zu machen.
Im Folgenden sollen nun die in dem optischen Auswerteabschnitt OAA durchführbaren Mechanismen bzw. einzelnen Verfahren ausführlich dargestellt werden.
Primärer Lippendetektionsmechanismus
Es sei nun auf Figur 3 verwiesen, in der eine schematisch Darstellung der Komponenten bzw. einzelnen Verfahrensschritte zum Realisieren des primären Lippendetektionsmechanismus gezeigt sind. Ein von der Kamera K erfasstes Bild einer Szene wird zunächst einer optionalen Bildkontrastverbesserung BKV durch einen histogramm-basierten Graustufenausgleich (Histogram Ξqualization) BKV der einzelnen Bildpunkte des erfassten Bild zugeführt wird. Das so mit dem Kontrast verbesserte erfasste Bild wird dann einer Bearbeitung durch einen horizontal orientierten positiven Gradientenfilter GF zugeführt, mittels der helligkeitsspezifische horizontale Kontu- ren, d.h. markante bzw. scharfe Hell-Dunkel-Übergänge oder Dunkel-Hell-Übergänge extrahiert werden können. Das so erhaltene erste bearbeitete Bild wird einem Segmentationsalgo- rithmus SA zugeführt, in dem allen Bildpunkten mit einem Grauwert über einen bestimmten Schwellenwert der Graustufen- wert "weiß" zugeordnet wird, während den übrigen Bildpunkten der Graustufenwert "schwarz" zugeordnet wird. Auf diese Weise können beispielsweise nur bestimmte scharfe horizontale Hell- Dunkel-Übergänge sichtbar gemacht werden. In einem derartigen erhaltenen zweiten bearbeiteten Bild können die nun verblie- benen "weißen" Bereiche bezüglich ihrer Fläche, Position oder Geometrie untersucht werden. Die in dem Segmentationsalgo- rithmus SA festgelegten Segmente können dann einen ersten Un- tersuchungsschritt US1 unterzogen werden, indem anhand der positionsmäßigen Beziehung entsprechender festgelegter Segmente bzw. anhand der positionsmäßigen Beziehung und der Form oder Ausdehnung der Segmente unter Einbeziehung biogeometri- scher Kriterien für ein Gesicht auf das Vorhandensein eines Gesichts und auf die Position des Gesichts bzw. der entsprechenden Mundpartie geschlossen werden kann.
Ein derart beschriebener primärer Lippendetektionsmechanismus soll nun anhand der Figuren 4A bis 4C ausführlich dargestellt werden. Dabei ist zunächst in Figur 4A das von der Kamera erfasste Bild (einer Person in einem Fahrzeug) dargestellt, das als Graustufenbild vorliegt, d. h. das Bild besteht aus einzelnen Bildpunkten, denen ein jeweiliger bestimmter Graustu- fenwert zugeordnet ist. Das optional einer Bildkontrastverbesserung BKV (vgl. Figur 3) unterzogene erfasste Bild wird dann einer Bearbeitung durch einen horizontal orientierten positiven Gradientenfilter unterzogen, um horizontale Strukturen, d. h. markante Helligkeitsübergänge, zu ermitteln. Ein derart (erstes) bearbeitetes Bild ist in Figur 4B zu sehen, bei dem Hell-Dunkel-Übergänge von oben nach unten betrachtet, ausgehend von einem mittleren Graustufenwert, entsprechend der Schärfe des Übergangs zu einem erhöhten Graustufenwert (in Richtung "weiß") übergehen, während Dunkel-Hell- Helligkeitsübergänge von oben nach unten betrachtet, ausgehend von einem mittleren Graustufenwert in einen geringeren Graustufenwert (in Richtung "schwarz") übergehen. Durch Anwenden einer Schwellwertbildung (wobei der Schwellwert in Abhängigkeit der Helligkeit des erfassten Bildes gewählt wird, beispielsweise anhand einer Histogrammdarstellung der Graustufenwerte der einzelnen Bildpunkte in dem erfassten Bild) werden Bildpunkten, deren Graustufenwert über dem hellig- keits bhängigen Schwellwert liegt, der Wert "weiß" zugeordnet, während den anderen Bildpunkten der Wert "schwarz" zuge- ordnet wird. Auf diese Weise können in einem (zweiten) bearbeiteten Bild eine Großzahl für die Analyse der Szene unwichtiger Details entfernt werden. In dem Segmentations- algorithmus SA können ferner nun erhaltene weiße Bereiche entfernt werden, deren Größe oder Form nicht bestimmten Kriterien, insbesondere biogeometrischen Kriterien bezüglich eines Gesichts entsprechen. Nach Verwerfen dieser zu kleinen bzw. zu großen weißen Bereiche oder in der Form nicht relevanten Bereiche und durch Zuordnen des Werts "schwarz" den entsprechenden Bildpunkten werden die eigentlichen für die spätere Untersuchung relevanten Segmente festgelegt. Zur besseren Analyse werden diese Segmente in Rechtecke einbeschrie- ben, wie es in Figur 4C zu erkennen ist. In dem ersten Untersuchungsschritt US1 werden nun die festgelegten noch verbliebenen Segmente der Reihe nach auf ihre geometrische bzw. positionsmäßige Beziehung zueinander untersucht. Die Untersuchung basiert darauf, dass zu zwei horizontal zueinander an- geordneten Segmenten, die die Augenbrauen (vgl. die Augenbrauenbereiche ABB in Figur 4A, 4B) oder Brillenkonturen in einem Gesicht eines Menschen darstellen können, ein drittes unterhalb diesen ersten beiden Segmenten liegendes Segment gesucht wird, das einem möglichen Mundsegment (vgl. den Mund- bereich MB in Figur 4A, 4B) basierend auf dem Helligkeitsübergang von dem Oberlippenbereich in den Zwischenlippenbereich) entspricht. Sind dabei ein erstes und ein zweites horizontal zueinander liegendes Segment gefunden, wie die Segmente Sl und S2, so wird deren Abstand zueinander, in diesem Fall der Abstand b, ausgehend von den jeweiligen Mittelpunkten der Segmente bestimmt. Anschließend wird unterhalb der beiden Segmente Sl und S2 ein drittes Segment gesucht, dessen Abstand, der Abstand a, zu den ersten beiden Segmenten bzw. einer Verbindungslinie hiervon in einem ersten biogeometri- sehen Verhältnis bezüglich eines menschlichen Gesichts stehen. Ein derartiges Verhältnis von a zu b kann einen Wert zwischen 1,0:1 bis 1,7:1, jedoch insbesondere einen Wert von 1,2:1 bis 1,5:1 aufweisen. Je nach Verwendung des Gültigkeitsbereichs für das erste Verhältnis von a zu b, könnten in Figur 4C das Segment S3 und S4 als mögliches drittes Segment (potenzielles Mundsegment) in Frage kommen. Gemäß einer vorteilhaften Ausgestaltung kann daher in diesem Fall noch nach einem vierten relevanten Segment gesucht werden, das sich unmittelbar unterhalb des dritten Segments befindet. Basierend auf der Tatsache, dass im Normalfall die Unterlippe eines Mundsegments leicht nach vorne bezüglich des Gesichts ge- krümmt ist und somit unterhalb der Unterlippe ein Schattenbereich entsteht (vgl. dazu auch den in Figur 8B dargestellten erweiterten Analysebereich, in dem dieser Schattenbereich ULB sich unmittelbar unterhalb des dunklen Zwischenlippenbereichs ZLB befindet) , kann dieser Schattenbereich bei einer Art Plausibilitätsprüfung als viertes Segment, das sich unmittelbar unterhalb des dritten Segments befinden muss, dienen. Auf Grund dieser Überprüfung kann dann das Segment S4 als potenzielles Mundsegment identifiziert werden, wobei das Segment S5 den Schatten unterhalb der Unterlippe darstellt. Nun wird ein Bereich in dem erfassten Bild von Figur 4A gespeichert, der den als potenzielles Mundsegment identifizierten Bereich (Segment S4) in Größe und Position entspricht. Dieser Bereich, der später als Analysebereich bezeichnet wird, wird für die folgende Merkmalsextraktion verwendet .
Es sei bemerkt, dass der gesamte Vorgang des primären Lippendetektionsmechanismus, wie er gerade beschrieben worden ist, in einem einzigen Durchgang durchgeführt werden kann, wobei am Ende des Durchgangs das ursprünglich erfasste Bild verwor- fen werden kann und nur noch die gespeicherten Bildpunktdaten des Analysebereich benötigt werden. Wie es ferner zu erkennen ist, werden innerhalb dieses einzigen Durchlaufs die Bilddaten des erfassten Bildes mit sehr einfachen Algorithmen erheblich verringert, was der Anforderung nach Minimierung des Speicherbedarfs, Rechenzeit und Durchlaufzeit Rechnung trägt.
Merkmalsextraktion
Die nun folgende Merkmalsextraktion dient zum Einen der Plausibilitätsprüfung, ob in dem gefundenen Analysebereich wirklich eine Mundpartie bzw. Lippen vorliegen, und dient ferner dazu, anhand der gefundenen Mundpartie Merkmale bzw. Merkmalsvektoren für eine nachfolgende Visem-Suche zu gewinnen. Zunächst sei auf Figur 5 verwiesen, in der nochmals die von der Kamera K in Figur 3 erfasste Szene entsprechend Figur 4A dargestellt ist, wobei der nun im Folgenden zu analysierende Bereich AB der Mundpartie, der während der Durchführung des ersten Lippendetektionsmechanismus gespeichert wurde, markiert ist. Dieser Bereich ist vergrößert in Figur 6 dargestellt. Entsprechend der in Figur 3 dargestellten Bearbeitung mit einem horizontal orientierten Gradientenfilter wird nun auch der in Figur 6 vergrößert dargestellte Analysebereich AB einer Bearbeitung mit einem horizontal orientierten positiven Gradientenfilter unterzogen. Es sei bemerkt, dass vor der Bearbeitung mit dem Gradientenfilter wieder eine Bildkontrast- Verbesserung entsprechend der Bildkontrastverbesserung BKV in Figur 3 durchgeführt werden kann. Durch die Bearbeitung mit dem horizontal orientierten positiven Gradientenfilter entsteht nun ein drittes bearbeitetes Bild, bei dem (horizontale) Hell-Dunkel-Übergänge, insbesondere von dem Oberlippenbe- reich in den Zwischenlippenbereich, oder anders ausgedrückt von dem Bereich der Oberlippe zu dem Bereich unterhalb der Oberlippe extrahiert werden. Auf diese Weise ist es möglich, einzelne Segmente der Oberlippe zu gewinnen, welche miteinander verbunden werden können und geglättet werden können. Die nun gefundene bzw. geglättete Oberlippenlinie kann nun bezüglich ihrer geometrischen Eigenschaften (Länge, Krümmung usw.) bewertet werden, d. h. ob sie biogeometrischen Merkmalen einer tatsächlichen Oberlippe bzw. Oberlippenlinie entspricht. Es ist nun möglich, dass sich in dem Analysebereich AB mehre- re Hell-Dunkel-Übergänge befinden, die eine Oberlippenlinie darstellen können. Wird eine erste Oberlippenlinie bzw. eine Kombination mehrere als Oberlippenlinie identifizierter Segmente, wie gerade beschrieben, negativ bewertet, wird ein weiterer Hell-Dunkel-Übergang bzw. ein weiterer Abschnitt aus mehreren Hell-Dunkel-Übergängen, die zu einer Oberlippenlinie zusammensetzbar sind, auf das Vorhandensein bestimmter geometrischer Eigenschaften entsprechend einer tatsächlichen 0- berlippe untersucht. In Versuchen hat sich gezeigt, dass eine Wiederholung der Untersuchung mit einem drittwahrscheinlichst möglichen Hell-Dunkel-Übergangsbereich zwar möglich ist, aber meist nicht erfolgreich, weshalb gemäß dieser Ausgestaltung der Merkmalsextraktion zu dem unten näher erläuterten sekundären Lippendetektionsmechanismus zum Auffinden der Position eines Gesichts bzw. einer Mundpartie übergegangen wird.
Wird eine gefundene Oberlippenlinie als positiv (entsprechend einer tatsächlichen Oberlippe bzw. Oberlippenlinie) bewertet, wird ein zweiter Prüfschritt bzw. Extraktionsschritt durchgeführt, bei dem die Unterlippe oder Unterlippenlinie identifiziert werden soll. Da das genaue Extrahieren der Unterlippe auf Grund generell schwächerer Konturierung der Unterlippe mittels einem Filter, wie dem oben beschriebenen Gradientenfilter, schwierig ist, wird in diesem Fall ein vertikaler Suchalgorithmus angewandt, der ausgehend von der relativ gut erkennbaren Oberlippe bzw. Oberlippenlinie, welche durch die oberen weißen Quadrate OL in Figur 6 dargestellt ist, den ersten farbähnlichen bzw. graustufenähnlichen Bildpunktwert entlang der Vertikalen nach unten sucht. Damit ist es möglich, helle Bereiche, wie beispielsweise die Zähne, sowie auch dunkle Bereiche, wie beispielsweise der Rachenbereich, zu überspringen und einen möglichst nahen Unterlippenbereich, der in Figur 6 durch die Linie aus weißen Quadraten UL gebildet wird, zu identifizieren. Die entsprechenden gefundenen Ober- und Unterlippenlinien OL und UL können dann bezüglich ihrer geometrischen Eigenschaften (Länge und Krümmung) untersucht werden, so dass aus den gefundenen geometrischen Eigen- Schäften mögliche Mundmerkmale oder Viseme, beispielsweise mittels HMM-Technologien abgeleitet werden kann.
Sekundärere Lippendetektionsmechanismus
Wie oben bezüglich der Merkmalsextraktion erwähnt worden ist, ist es möglich, dass nach Durchführen des primären Lippende- tektionsmechanismus und nach einer Plausibilitätsprüfung in einem ersten Prüfschritt der Merkmalsextraktion der durch den primären Lippendetektionsmechanismus gefundene Analysebereich keine tatsächliche Mundpartie aufweisen kann. In diesem Fall wird der sekundäre Lippendetektionsmechanismus eingesetzt, um einen Analysebereich für eine Mundpartie zu finden. Es sei dabei erwähnt, dass der sekundäre Lippendetektionsmechanismus bereits algorithmisch beim Durchlauf des primären Lippendetektionsmechanismus berücksichtigt werden kann, d. h. nach Erfassen des ersten Bildes der Szene. Es ist jedoch auch möglich, dass der zweite Lippendetektionsmechanismus aber erst in einem zweiten Durchlauf bezüglich eines zweiten erfassten Bildes der Szene durchgeführt werden kann. Wird der sekundäre Lippendetektionsmechanismus bereits beim Durchlaufen des pri- mären Lippendetektionsmechanismus durchgeführt, so können die damit identifizierten bzw. festgelegten Segmente dann erst beim Aufruf des sekundären Lippendetektionsmechanismus ausgewertet werden.
Der Grund für das Fehlschlagen des primären Lippendetektionsmechanismus kann darin liegen, dass bei stark konturierten Brillen, Sonnenbrillen oder durchgängigen Augenbrauen keine zwei getrennten Augenbrauensegmente für die gesichtsgeometrische Beurteilung zur Verfügung stehen, weshalb in diesem Fall ein anderer Detektionsmechanismus zu verwenden ist. Bei dem zweiten Lippendetektionsmechanismus werden dabei zunächst die gleichen Bearbeitungsschritte, wie die in Figur 3 erläuterten Schritte BKV, GF und SA durchgeführt. An Stelle des ersten Untersuchungsschritts US1 wird jedoch hier ein zweiter Unter- suchungsschritt US2 verwendet, bei dem zum Finden der Lippen innerhalb des von der Kamera K erfassten Bildes wieder die Gesichtsgeometrie genutzt wird, wobei hier an Stelle des ersten und des zweiten Segments ein Segment gesucht wird, das geometrisch der Länge der beiden Augenbrauen zusammen ent- sprechen kann. Ausgehend von einem in Figur 7A gezeigten einem Bild einer Szene, die das Gesicht eines Benutzers (einer Person in einem Fahrzeug) aufweist, welcher eine stark konturierte Brille aufweist, soll hier das Gesicht bzw. die Mundpartie dieses Gesichts ermittelt werden. Nach Durchführen der in Figur 3 erläuterten Bearbeitungsschritte BKV, GF, SA bzgl . des erfaß- ten Bildes von Figur 7A, wird ein in Figur 7B gezeigtes (zweites) bearbeitetes Bild (entsprechend Figur 4C) erhalten, in dem nur noch markante Hell-Dunkel-Übergänge bestimmter re- levanter Größe und Form vorhanden sind. Zunächst wird von jedem dieser vorhandenen Segmente die horizontale Länge b' bestimmt, wie es bei dem Segment S6 dargestellt ist. Nun wird zu jedem Segment, hier beispielhaft an dem Segment S6 gezeigt, ein sich unterhalb befindliches Segment gesucht, das von diesem einen bestimmten Abstand a1 aufweist, wobei das Verhältnis a' zu b' ein zweites biogeometrisches Verhältnis bezüglich eines Gesichts aufweisen muss. Dieses zweite Verhältnis von a zu b liegt dabei im Bereich von 1:1 bis 1,7:1, insbesondere jedoch zwischen 1,2:1 bis 1,5:1. Wie es in Figur 7B zu sehen ist, wird zu dem Segment S6 ein weiteres Segment S7 gefunden, durch das die Bedingungen des zweiten Verhältnisses erfüllbar sind. Sind mehrere Segmente vorhanden, durch die das zweite Verhältnis erfüllbar ist, so ist es möglich, für diese Mehrzahl von Segmenten weitere Prüfkriterien zu finden. Beispielsweise kann die Länge des weiteren unterhalb des die Augenbrauen darstellenden Segments überprüft werden, die innerhalb vorbestimmter Parameter zu liegen hat. Ist die Länge des weiteren Segments beispielsweise zu groß (z.B größer als die Länge b) , so kann dieses nicht als ein potenziel- les Mundsegment identifiziert werden.
Ist nun mittels dem sekundären Lippendetektionsmechanismus zu einem ersten den Augenbrauen entsprechenden Segment ein zweites der Mundpartie entsprechendes Segment gefunden worden, so kann dieser gefundene Bereich bezüglich Position und Größe in dem erfassten Bild als Analysebereich gespeichert werden und der oben dargestellten Merkmalsextraktion zugeführt werden. Lippenverfolgungsmechanismus
Ist einmal die Position eines -Analysebereichs in einem er- fassten Bild gefunden, so ist es nicht nötig, in einem folgenden erfassten Bild jedes Mal den primären bzw. sekundären Lippendetektionsmechanismus durchzuführen, sondern es ist möglich, ausgehend von der Position des gefundenen Analysebereichs mit der Mundpartie auf die Position eines Analysebe- reichs mit einer Mundpartie in dem folgenden zweiten erfassten Bild zu schließen. Dies spart zum Einen Rechenleistung als auch Energie bzw. Strom einer Stromversorgungsquelle, in diesem Fall eines Mobiltelefons. Ausgehend von einer Bilderfassungsrate von 15 Bildern pro Sekunden kann angenommen wer- den, dass insbesondere in Situationen, in denen sich eine Person in einer Umgebung bzw. Szene quasi nicht bewegt, wie beispielsweise ein Fahrer in einem Auto, sich die Position des gefundenen Analysebereichs mit der Mundpartie nicht wesentlich von einem zum anderen erfassten Bild verändert. An- ders ausgedrückt, basiert der Lippenverfolgungsmechanismus darauf, dass der in einem ersten erfassten Bild gefundene A- nalysebereich mit der Mundpartie bei einer erfolgreichen Merkmalsextraktion als Referenzkoordinaten für das nächste erfasste Bild dient. Um jedoch geringe Abweichungen bezüglich der Position des Analysebereichs auszugleichen, wird gemäß einer vorteilhaften Ausgestaltung im zweiten erfassten Bild, wie es beispielsweise in Figur 8A gezeigt ist, ein bezüglich des ursprünglichen Analysebereichs AB um einen bestimmten Faktor (hier Faktor 1,1) erweiterter Analysebereich EAB, der insbesondere konzentrisch zum ursprünglichen Analysebereich ist, zunächst verwendet, um eine Merkmalsextraktion durchzuführen. Wird aus der Merkmalsextraktion, insbesondere dem ersten Prüfschritt mit der Plausibilitätsprüfung ein negatives Ergebnis erhalten, so müssen der primäre bzw. sekundäre Lippendetektionsmechanismus in einem folgenden erfassten Bild wieder verwendet werden, um die Position eines Analysebereichs mit Mundpartie zu bestimmen. Ist jedoch der erste Prüfschritt einer Merkmalsextraktion in dem erweiterten -Analysebereich EAB, wie er in Figur 8A gegenüber dem ursprünglichen Analysebereich AB dargestellt ist, positiv, so können in einem zweiten Prüfschritt bzw. der eigentlichen Merkmalsex- traktion in dem erweiterten Analysebereich EAB, wie er beispielsweise in Figur 8B gezeigt ist, Mundmerkmale bzw. Viseme extrahiert werden, wie es oben beschrieben worden ist. Nach erfolgreicher Merkmalsextraktion kann dann der erweiterte A- nalysebereich auf die Größe des ursprünglichen Analysebe- reichs verringert werden, jedoch an eine Position, die der tatsächlichen Position der Mundpartie in diesem zweiten analysierten erfassten Bild entspricht. Diese Position kann dann in einem dritten erfassten Bild wieder als Referenzkoordinate dienen usw.
Zusammenfassend kann also festgestellt werden, dass die in dem optischen Auswerteabschnitt OAA durchgeführten Verfahren zur Analyse einer Szene bzw. zum Auffinden, Verfolgen und A- nalysieren einer Mundpartie, insbesondere für Datenverarbei- tungsanlage mit eingeschränkten Ressourcen vorteilhaft ist.
Durch den Einsatz von gesichtsgeometrischen Segmentierungsverfahren kann das visuelle oder optische Datenvolumen zur Weiterverarbeitung sehr schnell auf kleine Segmentmengen reduziert werden. Eingebaute Plausibilitäts- bzw. Robustheits- prüfung (bei der Merkmalsextraktion) erlauben dabei auch ein hohes Maß an Zuverlässigkeit und verhindern eine Fehldetekti- on. Die ressourcenoptimierte Lippenverfolgung erlaubt bei geringen Bewegungen eine in einer Szene vorhandenen Person die Verfolgung der Lippenbereiche über viele erfasste Bilder, oh- ne erneutes Durchführen von Lippendetektionsmechanismen.
Spracherkennung
Wie es bereits bezüglich Figur 2 erläutert worden ist, können die in dem optischen Auswerteabschnitt OAA erhaltenen Resultate bezüglich erkannter Viseme, oder die zeitliche Verände- rung erkannter Viseme auch zur Unterstützung einer akustischen Spracherkennung, insbesondere für geräuschbehaftete Umgebungen verwendet werden. Derartige geräuschbehaftete Umgebungen finden sich beispielsweise in einem Auto, wobei in ei- ner derartigen Umgebung von Vorteil ist, dass der Fahrer nur geringe Bewegungsgrade hat und somit beispielsweise von einer in einem Mobiltelefon integrierten Kamera gut erfassbar ist. Es wird davon ausgegangen, dass das Mobiltelefon samt der Kamera beispielsweise in einer Halterung auf der Mittelkonsole angebracht ist (mögliche Bilder, die von einer Kamera in der dargestellten Anordnung gemacht werden können, sind in den Figuren 4A, 7A oder 8A gezeigt) .
Eine audio-visuelle Spracherkennung kann dabei ähnlich zu der in Figur 1 dargestellten Spracherkennung durchgeführt werden. Im Rahmen der visuellen Vorverarbeitung Wl der Spracherkennung von Figur 1 kann nun ein Verfahren zum Lippenfinden bzw. Lippenverfolgen in dem optischen Signal mit dem Bild einer erfassten Szene gemäß einem der oben beschriebenen Lippende- tektionsmechanismen bzw. dem Lippenverfolgungsmechanismus durchgeführt werden, während mittels der Merkmalsextraktion Lippenmerkmale aus dem erfassten Bild bzw. einem gefundenen Mundbereich extrahiert werden können. Aus den erhaltenen Merkmalen bzw. Merkmalsvektoren werden dann in dem Schritt WE12 von Figur 1 die wahrscheinlichsten Visem-Kandidaten ermittelt, um schließlich durch Kombination der in dem akustischen Zweig erhaltenen Phonem-Kandidaten und der ermittelten Visem-Kandidaten auf bestimmte Sprachmerkmale schließen zu können und eventuell mit Hilfe dieser bestimmte Steuervorgän- ge in einer Datenverarbeitungsanlage, wie dem im Beispiel verwendeten Mobiltelefon, auszulösen zu können.
Einfügen von Informationsfeldern in ein Bild
Es sei nun auf Figur 9 verwiesen, in der die wesentlichen Komponenten einer Datenverarbeitungsanordnung zum Verarbeiten eines Bildes bzw. zum Einfügen von Informationsfeider dargestellt sind. Diese Komponenten können beispielsweise in einem Server (eines Netzbetreibers) eines Kommunikationsnetzes vorgesehen sein, wie es noch ausführlich mit Bezug auf Figur 11 erläutert werden wird.
Dabei wird ein Bild einer Szene zunächst zu einem Eingangsabschnitt bzw. einer Eingängseinrichtung EER geleitet. Das Bild kann dabei direkt von einer Kamera K erfasst werden und in die Eingangseinrichtung EER geleitet werden. Es kann ferner, wie es bzgl . Figur 11 noch erläutert werden wird, über ein Kommunikationsnetz geleitet werden und über ein En-pfangsmodul FM, wie beispielsweise ein Funkmodul, in die Eingangseinrichtung EER eingegeben werden. Anschließend wird es in eine Aus- Werteeinrichtung AWER geleitet, in der das Vorhandenseins und die Position eines Gesichts in dem Bild bestimmt wird. Die Auswerteeinrichtung AWER kann dabei einen optischen Auswerteabschnitt OAA (vgl. Figur 2) aufweisen, der wiederum einen bezüglich Figur 3 erläuterten primären PLD oder sekundären SLD Lippendetektionsmechanismus (OAA, SE, AAA) umfassen kann, um das Vorhandensein und die Position eines Gesichts GES in dem Bild einer Szene bestimmt. Anschließend wird in einer Einbeschreibungseinrichtung EBER, die Teil der Auswerteeinrichtung AWER ist, das Gesichts GES in ein Gesichtsrahmenob- jekt GRO (vgl. hierzu auch die Beschreibung der Figuren 10), das beispielsweise eine rechteckige Form haben kann, einbeschrieben. Schließlich wird in einer Einfügungseinrichtung EFER zumindest ein Informationsfeld derart in das Bild eingefügt, dass sich das Gesichtsrahmenobjekt und das Informati- onsfeld nicht überlappen. Das so erzeugte Bild mit zumindest einem zusätzlichen Informationsfeld wird dann über eine Ausgangseinrichtung AER weitergeleitet, entweder beispielsweise an eine Anzeige bzw. ein Display DSP oder wird, wie es bzgl. Figur 11 noch erläutert werden wird, über ein Sendemodul FM, wie beispielsweise ein Funkmodul, an eine weitere Datenverarbeitungskomponente weitergeleitet . Anhand der Figuren 10A bis IOC soll nun die Funktionsweise der gerade erläuterten Datenverarbeitungsanordnung bildhaft dargestellt werden. Wie es in Figur 10A zu sehen ist, ist in einem ersten Bild BI1 einer Szene ein Gesicht GES vorhanden. Mittels der Auswerteeinrichtung AWER wurde die Position des Gesichts GES in dem Bild bestimmt. Anschließend wurde durch die Einbeschreibungseinrichtung das Gesicht GES in ein Gesichtsrahmenobjekt GRO, hier in Form eines Rechtecks (genauer eines Quadrats) , einbeschrieben. In dem nun verbleibenden Bildbereich außerhalb des Gesichtsrahmenobjekts GRO hat nun die Einfügungseinrichtung ein erstes Informationsfeld IF1, hier beispielsweise als ein Logo eines Unternehmens, und ein zweites Informationsfeld IF2, hier als einen Bannertext, eingefügt, wobei sich das Gesichtsrahmenobjekt GRO und die In- formationsfeider IFl und IF2 nicht überlappen.
Bewegt sich das Gesicht GES von links nach rechts, wie es in Figur 10B gezeigt ist, so wird in dem Bild BI2 das erste Informationsfeld IFl von der Einfügungseinrichtung links von dem Gesichtsrahmenobjekt GRO angeordnet, so dass keine Überlappung mit dem Gesichtsrahmenobjekt auftritt.
Bewegt sich schließlich das Gesicht GES nach unten, so ist der verbleibende Platz unterhalb dem Gesichtsrahmenobjekt GRO zu gering, um noch das zweite Informationsfeld IF2 einzufügen. Somit wird, wie es in Figur IOC gezeigt ist, in dem Bild BI3 das zweite Informationsfeld IF2 ganz entfernt.
Ein gerade beschriebenes Verfahren kann beispielsweise im Rahmen einer Bildübertragung bzw. Videotelefonieanwendung (die von einem Netzbetreiber oder einem Zudatzdiensteanbieter bereitgestellt wird) in einer Kommunikations- bzw. Datenverarbeitungsanordnung angewendet werden. In Figur 11 wird dabei davon ausgegangen, dass ein erstes Kommunikation gerät, wie ein Mobiltelefon MFGl, mittels einer eingebauten Kamera ein Bild eines ersten Kommunikationsteilnehmers erfasst und (angedeutet durch einen ersten "Zick-Zack" -Pfeil) über eine Funkverbindung an ein Kommunikationsnetz KN eines Netzbetreibers überträgt. In dem Kommunikationsnetz KN ist eine Datenverarbeitungskomponente bzw. bzw. ein Computer SP des Netzbetreibers vorgesehen, der Komponenten zur Datenverarbeitung hat, wie sie in Figur 9 beschrieben worden sind. Genauer gesagt, wird das Bild vom ersten Mobiltelefon MFGl von einem Empfangsmoduls des Kommunikationsnetzes (beispielsweise einer Basisstation) empfangen und zu einer Eingangseinrichtung des Computers SP des Netzbetreibers geleitet, dort von einer Aus- Werteeinrichtung, einer Einbeschreibungseinrichtung und einer Einfügungseinrichtung verarbeitet und schließlich über eine Ausgangseinrichtung des Computers SP zu einem Sendemodul des Kommunikationsnetzes (beispielsweise einer Basisstation) geleitet, um über eine Funkverbindung (angedeutet durch einen zweiten "Zick-Zack" -Pfeil) an ein zweites Kommunikationsgerät, wie ein Mobiltelefon MFG2 , weitergeleitet zu werden. Es sei erwähnt, dass das Kommunikationsnetz sowie die beiden Mobiltelefone beispielsweise gemäß dem UMTS (Universal Mobile Telecommunications System) -Standard arbeiten können.
In ein von dem ersten Mobiltelefon MFGl erfasste Bild können somit Informationsfelder, wie Werbefelder, des Netzbetreibers in dem Computer SP eingefügt werden, wobei durch die gezielte Plazierung der Informationsfelder nicht der wesentliche Teil der Bildinformation, d.h. das Gesicht des ersten Teilnehmers, verloren geht. Durch eine derartige vorsichtige und wenig störende Werbung ist es somit möglich, dass beispielsweise der zweite Teilnehmer des zweiten Mobiltelefons MFG2 immer wieder (positiv) an den Netzbetreiber des ersten Teilnehmers erinnert wird, und eventuell aufgrund dessen selbst Kunde dieses Netzbetreibers wird. Es sei erwähnt, dass die Werbung nicht auf eigene Werbung des Netzbetreibers beschränkt ist, sondern auch Werbung eines beliebigen Unternehmens sein kann, das einen Netzbetreiber (gegen Entgeld) beauftragt, seine Werbung in einer Bilddatenübertragung bzw. Videoanwendung einzufügen. Gemäß einer weiteren vorteilhaften Ausgestaltung ist in dem Kommunikationsnetz ein weiterer Server bzw. Computer DACO eines Dienstanbieters (wie eines MMS-Dienstanbieters oder eines Anbieters von Informationen aktueller Aktienkurse, usw.) vor- gesehen, der mit dem Computer SP verbunden ist. Es ist jedoch auch möglich, dass der Computer DACO in einem anderen (beispielsweise auf einem Internet-Protololl basierten) Kommunikationsnetz vorgesehen ist, das mit dem Kommunikationsnetz KN verbunden ist. Der Computer DACO kann dem Computer SP Daten für Informationsfelder oder gesamte (fertige) Informationsfelder zuleiten, damit der Computer SP diese Informationen in das zu übertragende Bild (bzw. die Bilder) einfügt. Auf diese Weise kann ein Dienstanbieter auf einfache Weise bei einem Benutzer eines Kommunikationsgeräts bzw. Mobiltelefons Wer- bung zukommen lassen.
Die Informationsfelder können allgemein (d.h. unabhängig vom der gerade erwähnten Datenübertragungsanordnung) beispielsweise Einblendungen von Netzbetreiber-Logos, Werbebanner der Netzbetreiber oder von gesponserten Diensten, Banner mit Aktienkursen, SportInformationen, oder aber auch Avatare mit Hilfestellungen zum jeweiligen Gerät, auf dem sie angezeigt werden, und schließlich Informationen, die bei einer Einzelbildaufnahme eingeblendet werden (wie Auflösung, Blende usw.) aber im endgültigen Bild nicht sichtbar sind, aufweisen.
Neben der Möglichkeit, die Komponente zur Datenverarbeitung gemäß Figur 9 in einem (stationären) Computer zu integrieren, besteht auch die Möglichkeit, diese alle in einem tragbaren Kommunikationsgerät, wie in einem Mobiltelefon oder einem tragbaren Computer zu integrieren. Beispielsweise kann ein erstes Mobiltelefon MFGl eine Kamera und zusätzlich einen Sensor, wie einen Temperatursensor aufweisen, wobei bei einer Videotelefonie-Anwendung zusätzlich zum Gesicht des ersten Teilnehmers immer die gerade aktuellen Sensordaten, beispielsweise die herrschende Temperatur am Ort des ersten Mobiltelefons im von der Kamera erfassten Bild als Informati- onsfeld eingeblendet wird. In diesem Beispiel würde also die komplette Datenverarbeitung bzw. Bildverarbeitung im ersten Mobiltelefon erfolgen.
Fokussieren auf ein Objekt
Es sei nun auf Figur 12 verwiesen, in der eine Datenverarbeitungsanlage in Form eines Mobiltelefons MFG gemäß einer be- vorzugten Ausführungsform gezeigt ist. Das Mobiltelefon MFG weist, wie bereits zu Figur 2 erläutert eine Kamera K auf, die hier genauer dargestellt ein Kameraelement KEL beispielsweise in Form eines CCD-Kameraelements oder CMOS CCD- Kameraelements und eine Kameraoptik bzw. eine Abbildungsein- richtung aufweist. Das Kameraelement KEL ist dabei in der Lage, ein Bild der Umgebung, insbesondere einer Szene mit Personen zu erfassen, wobei die Kameraoptik KOP, beispielsweise in der Ausführung eines Kameraobjektivs, eine Linsenanordnung aufweist, die dafür ausgelegt ist, durch Veränderung der räumlichen Struktur einzelner Linsen zueinander die Brennweite der Kameraoptik zu verändern, so dass Objekte, wie ein Gesicht GES einer Person nach Einstellung der Brennweite scharf auf dem Kameraelement abgebildet werden können.
Um jedoch in der Lage zu sein, automatisch auf ein Gesicht GES in einer Szene zu fokussieren und somit automatisch die Kameraoptik an die Entfernung des Gesichts GES anzupassen, insbesondere wenn sich das Gesicht nicht in Ruhe befindet und des öfteren seine Position ändert, hat das Mobiltelefon wei- tere Einrichtungen. Mittels einer Auswerteeinrichtung AWE, die einen optischen Auswerteabschnitt OAA (vgl. Figur 2) aufweisen kann, der wiederum einen bezüglich Figur 3 erläuterten primären PLD oder sekundären SLD Lippendetektionsmechanismus (OAA, SE, AAA) umfassen kann, wird die Position eines Ge- sichts GES in dem von der Kamera K bzw. deren Kameraelement KEL erfassten Bild einer Szene bestimmt. Anschließend wird mittels einer Entfernungsmessungseinrichtung EM die Entfer- nung der Kamera K zu dem in der Szene erfassten Gesicht GES bestimmt (gekennzeichnet durch den gestrichelten Pfeil von der Entfernungsmessungseinrichtung EM zum Gesicht GES) . Die Entfernungsmessung kann dabei aktiv oder passiv erfolgen. Passive Verfahren versuchen mit dem vorhandenen Licht eine Entfernungsmessung durchzuführen. Dazu wird prinzipiell der Bildeindruck an örtlich unterschiedlichen Positionen in oder an der Kamera oder dem Objektiv (Kameraoptik) ausgewertet und durch Dreiecksbereichungen die Entfernung über Winkelbezie- hungen ermittelt (Triangulation) . Aktive Verfahren senden daher einen eigenen Messstrahl aus. Üblich sind dies Infrarotstrahlen. Jedoch ist bei Aufnahme einzelner Bilder (anstelle von Videosequenzen) auch die Anwendung von sichtbarem Licht möglich. Alternativ sind noch Ultraschall- Entfernungsmessungen möglich (Sonar) , wobei allerdings z.B. durchsichtige Fensterscheiben durch ihre Reflexionen die Scharfeinstellung stark irritieren können. Eine Kamerasteuereinrichtung KST stellt nun die Kameraoptik KOP derart auf die von der Entfernungsmessungseinrichtung ermittelte Entfernung ein, dass das Gesicht GES auf dem Kameraelement KEL scharf abgebildet wird.
Zum Bestimmen der Entfernung des Gesicht, das in einem bestimmten Bereich des Bildes vorhanden ist, kann die Entfer- nungsmessungseinrichtung folgendermaßen aufgebaut sein. Es ist dabei möglich, dass die Entfernungsmessungseinrichtung eine Mehrzahl von Entfernungsmessungssensoren EMS aufweist, die derart angeordnet sind, dass sie die Entfernung von Objekten der Szene in ihnen zugewiesen Bildbereichen erfassen. Anders ausgedrückt wird über das von der Kamera erfasste Bild ein Raster RAS gelegt, wobei jeder Entfernungsmessungssensor für einen Rasterbereich zuständig ist. Wird nun ein Gesicht in dem erfassten Bild von der Auswerteeinrichtung AWE erkannt (wie im Beispiel im rechten oberen Rasterbereich) , so wird von der Entfernungsmessungseinrichtung (oder schon von der Auswerteeinrichtung) festgestellt in dem Zuständigkeitsbereich von welchem Entfernungsmessungssensor sich das Gesicht befindet, so dass dieser Entfernungsmessungssensor dann angewiesen werden kann, die Entfernung des Gesichts zu der Kamera zu erfassen. Es ist ferner denkbar, dass die Entfernungsmessungseinrichtung einen Entfernungsmessungssensor hat, dessen Messrichtung variierbar ist, so dass nach der Erfassung eines Gesichts in der Szene durch die Auswerteeinrichtung die Messrichtung dieses Entfernungsmessungssensors von der Entfernungsmessungseinrichtung auf das erkannte Gesicht ausgerichtet wird.
Der Vorteil der Verwendung der Technologie der Gesichtslokalisierung zur Fokussierung einer Kamera auf ein Gesicht soll nun anhand eines einfachen Beispiels kurz erläutert werden. Es wird beispielsweise eine Video-Konferenz zwischen mehreren Teilnehmern aufgebaut, wobei zumindest ein Teilnehmer ein Mobiltelefon MFG mit einem Kamerasystem hat, wie es zu Figur 12 erläutert worden ist. Dauert eine derartige Konferenz über eine längere Zeit an, so werden sich die einzelnen Teilnehmer in der Regel nicht still halten und ihren Kopf bewegen, in ihrem Sessel vor und zurück oder links und rechts rutschen. Herkömmlicherweise würde dabei das Gesicht eines Teilnehmers nie scharf erfasst und zu den anderen Teilnehmer übertragen werden können, da sich ständig die Entfernung des Gesichts zu dem Mobiltelefon bzw. dessen Kamera ändert. In einem Mobilte- lefon MGF nach Figur 12 jedoch wird fortlaufend bzw. in regelmäßigen zeitlichen Abständen die Position des Gesichts eines Teilnehmers lokalisiert, dessen Entfernung zur Kamera bzw. zum Mobiltelefon bestimmt und entsprechend eine Scharf- stellung der Kameraoptik vorgenommen, um das Gesicht auf dem Kameraelement scharf zu erfassen und an die anderen Konferenz-Teilnehmer zu übertragen.
Es sei abschließend erwähnt, dass ein bezüglich Figur 12 erläutertes Kamerasystem mit Kamera K, Auswerteeinrichtung AWE, Kamerasteuerungseinrichtung KST und Entfernungsmessungseinrichtung EM nicht notwendigerweise in einem Mobiltelefon eingebaut sein muss, sondern sich auch in einer anders ausge- führten Datenverarbeitungsanlage, wie einem stationären oder tragbaren Computer oder einem Festnetztelefon befinden kann. Es ist auch denkbar, dass die Kamera K mit Kameraelement KEL und Kameraoptik KOP und eventuell die Entfernungsmessungseinrichtung EM in einem separaten Modul vorgesehen sind, die mit einem Computer oder einem Mobiltelefon verbindbar sind.
Übertragen von Bilddaten
Es sei nun auf Figur 13 verwiesen, in der die wesentlichen Komponenten einer Kommunikationsanordnung zum Übertragen eines Bildes einer Szene mit einem Kopf bzw. Gesicht einer Person von einem ersten Kommunikationsgerät MFG21 in Form eines Mobiltelefons an ein zweites Kommunikationsgerät MFG22 in Form eines Mobiltelefons dargestellt sind.
Im Beispiel hier wird ein Bild einer Szene von einer Kamera K des ersten Mobiltelefons MFG21 erfasst und zu einer Auswerte- einrichtung AWER2 geleitet, in der das Vorhandenseins und die Position eines Gesichts in dem ersten Bild bestimmt wird. Die Auswerteeinrichtung AWER2 kann dabei einen optischen Auswerteabschnitt OAA (vgl. Figur 2) aufweisen, der wiederum einen bezüglich Figur 3 erläuterten primären PLD oder sekundären SLD Lippendetektionsmechanismus (OAA, SE, AAA) umfassen kann, um das Vorhandensein und die Position eines Gesichts in dem Bild einer Szene bestimmt. Anschließend wird in einer Einbe- schreibungseinrichtung EBER2 , die Teil der Auswerteeinrichtung AWER2 ist, das Gesichts in ein Gesichtsrahmenobjekt (vgl. hierzu auch die Beschreibung der Figuren 14), das beispielsweise eine rechteckige Form haben kann, einbeschrieben. Schließlich wird durch eine Ausschneideeinrichtung ASER2 der Bildbereich, der von dem Gesichtsrahmenobjekt umfasst wird, ausgeschnitten, um so ein zweites Bild zu erhalten. Dieses zweite Bild wird dann von einer Kodiereinrichtung KDER2 kodiert, um die Bilddaten zu komprimieren. Dabei kann die Kodiereinrichtung KDER2 beispielsweise nach einem H.263-, MPEG4- oder H.26L-Standard arbeiten. Das kodierte zweite Bild bzw. deren Bilddaten wird nun über ein Funkmodul FM21, das mit einer Antenne ANT21 verbunden ist, über eine erste Funkstrecke (angedeutet durch einen ersten "Zick-Zack"-Pfeil) zu einem Kommunikationsnetz KN übertragen, das die Bilddaten über eine zweite Funkstrecke (angedeutet durch einen zweiten "Zick-Zack" -Pfeil) weiter zu dem zweiten Mobiltelefon MFG22 überträgt. Dort werden die Daten über eine Antenne ANT22 von einem Funkmodul FM22 empfangen und zu einer Dekodiereinrich- tung DKER2 geleitet. Die Dekodiereinrichtung DKER2 dekodiert die Daten des zweiten Bildes und leitet das zweite (dekodierte) Bild an eine Anzeigeeinrichtung DSP, auf der nun das Bild des Benutzers des ersten Mobiltelefons MFG21 angezeigt werden kann.
Gemäß einer vorteilhaften Ausgestaltung kann in der Dekodiereinrichtung DKER2 ein Objekt, wie beispielsweise einen Rahmen, in das zweite Bild eingefügt werden (es sind jedoch beliebige Objekte denkbar) . Dieses Einfügen von Objekten bzw. ob und welches Objekt eingefügt werden soll, kann beispielsweise von dem Benutzer des zweiten Mobiltelefons MFG22 selbst am Mobiltelefon eingestellt werden. Sowohl das Kommunikationsnetz KN als auch die Mobiltelefone MFG21, MFG22 können beispielsweise gemäß einem GSM (Global System for Mobile Com- munications) -, UMTS (Universal Mobile Telecommunications System)-, oder WLAN (wireless LAN: drahtloses lokales Netz)- Standard arbeiten. Es ist auch denkbar, dass beispielsweise die erste Funkstrecke gemäß einem ersten Mobilfunk-Standard und die zweite Funkstrecke gemäß einem zweiten Mobilfunk- Standard aufgebaut wird.
Anhand der Figuren 14A bis 14C soll nun die Funktionsweise der gerade erläuterten Datenverarbeitungsanordnung bildhaft dargestellt werden. Wie es in Figur 14A zu sehen ist, ist in einem ersten von einer Kamera erfassten Bild BI1 einer Szene ein Gesicht GES vorhanden. Mittels der Auswerteeinrichtung AWER2 (vgl. Figur 13) wurde die Position des Gesichts GES in dem Bild bestimmt. Anschließend wurde durch die Einbeschrei- bungseinrichtung das Gesicht GES in ein Gesichtsrahmenobjekt GRO, hier in Form eines Rechtecks, einbeschrieben. Nun wird der von dem Gesichtsrahmenobjekt GRO umfasste Bereich des ersten Bildes BIl von der Ausschneideeinrichtung ausgeschnitten, so dass ein zweites Bild BI2 entsteht (vgl. Figur 14B) . Nachdem dieses Bild dann kodiert und zu einem weiteren Kommunikationsgerät bzw. Mobiltelefon übertragen worden ist, kann das weitere Mobiltelefon bzw. eine in diesem vorgesehene Ein- richtung, wie die Dekodiereinrichtung zum dekodieren der ü- bertragenen Bilddaten, ein zusätzliches Objekt, wie einen Rahmen RAH in das Bild einfügen, wie es in Figur 14C gezeigt ist, um schließlich ein Bild BI2 ' ' zu erhalten. Dieser "künstliche" Rahmen RAH kann dabei direkt vom zweiten Kommu- nikationsgerät bereitgestellt werden, oder aber zuvor von dem ersten Kommunikationsgerät übermittelt worden sein..
Der Vorteil des beschriebenen Verfahrens liegt nun darin, dass der wesentliche Bildbestandteil, d.h. das Gesicht des Benutzers des ersten Mobiltelefons aus dem ersten Bild herausextrahiert wird, so dass dadurch der Ressourcenaufwand beim kodieren und Übertragen eines Bildes zu einem zweiten Mobiltelefon minimiert wird.
Umwandeln eines Bildes bezüglich der Größe
Es sei nun auf Figur 15 verwiesen, in der die wesentlichen Komponenten einer Datenverarbeitungsanordnung zum Verarbeiten eines Bildes bzw. zum Umwandeln eines ersten Bilds einer Szene in ein zweites Bild mit einer geringeren Größe dargestellt sind. Diese Komponenten können beispielsweise in einer Datenverarbeitungsanordnung in Form eines Mobiltelefons MFG3 vorgesehen sein.
Im Beispiel hier wird ein erstes Bild einer Szene mit einer ersten Größe von einer Kamera K des Mobiltelefons MFG3 er- fasst und zu einer Auswerteeinrichtung AWERl geleitet, in der das Vorhandenseins und die Position eines Gesichts in dem ersten Bild bestimmt wird. Die Auswerteeinrichtung AWERl kann dabei einen optischen Auswerteabschnitt OAA (vgl. Figur 2) aufweisen, der wiederum einen bezüglich Figur 3 erläuterten primären PLD oder sekundären SLD Lippendetektionsmechanismus (OAA, SE, AAA) umfassen kann, um das Vorhandensein und die Position eines Gesichts GES in dem ersten Bild einer Szene bestimmt. Anschließend wird in einer Einbeschreibungseinrich- tung EBERl, die Teil der Auswerteeinrichtung AWERl ist, das Gesichts GES in ein Gesichtsrahmenobjekt GRO (vgl. hierzu auch die Beschreibung der Figuren 16) , das beispielsweise eine rechteckige Form haben kann, einbeschrieben. Das Gesichtsrahmenobjekt hat dabei die Form und Größe eines gewünschten zweiten Bildes. Schließlich wird durch eine Ausschneideeinrichtung ASERl der Bildbereich, der von dem Gesichtsrahmenobjekt umfasst wird, ausgeschnitten, um so das zweite Bild in dem gewünschten Format bzw. der gewünschten Größe zu erhalten. Dieses zweite Bild kann dann in einem Display bzw. einer Anzeigeeinrichtung DSP des Mobiltelefons MFG3 angezeigt werden oder kann von einem Video Encoder kodiert (beispielsweise gemäß einem der Standards H.263, MPEG4) und zu einem weiteren Mobiltelefon über ein Kommunikationsnetz beispielsweise im Rahmen einer Videotelefonie-Anwendung oder im Rahmen eines MMS-Dienstes übertragen werden.
Anhand der Figuren 16A bis 16C soll nun die Funktionsweise der gerade erläuterten Datenverarbeitungsanordnung bildhaft dargestellt werden. Wie es in Figur 16A zu sehen ist, ist in einem ersten von einer Kamera erfassten Bild BI1 einer Szene ein Gesicht GES vorhanden. Dieses erste Bild hat beispielsweise ein CIF- oder VGA-Format. Mittels der Auswerteeinrichtung AWERl (vgl. Figur 15) wurde die Position des Gesichts GES in dem Bild bestimmt. Anschließend wurde durch die Einbe- Schreibungseinrichtung das Gesicht GES in ein Gesichtsrahmenobjekt GRO, hier in Form eines Rechtecks (genauer eines Quadrats) , einbeschrieben, das die Form und Größe eines gewünsch- ten zweiten Bilds hat. Nun wird der von dem Gesichtsrahmenobjekt GRO umfasste Bereich des ersten Bildes BIl von der Ausschneideeinrichtung ausgeschnitten, so dass ein zweites Bild BI2, beispielsweise im CIF-Format, entsteht (vgl. Figur 16B) , das die gewünschte Größe und das gewünschte Format aufweist. Der Vorteil dieses Verfahrens bei der Umwandlung bzw. dem Herunterskalieren eines Bildes besteht darin, dass das Gesicht GES einer Person in voller Größe erhalten bleibt und somit der Bildinhalt auf den wesentlichsten Bestandteil redu- ziert ist.
Wird das Bild BIl hingegen auf herkömmliche Weise herunter- skaliert, wie es beispielsweise in Figur 16C mit Bezug auf Bild BI2 ' , das beispielsweise ebenso im CIF-Format vorliegt, gezeigt ist, so würde das Gesicht GES stark in der Größe reduziert und somit nur noch schwer erkennbar sein. Insbesondere bei einer Videotelefonie-Anwendung wäre ein derartiges Bild BI2 ' wenig vorteilhaft, da ja ein Gesprächsteilnehmer gut sichtbar sein soll, wie es in Bild 9B der Fall ist.

Claims

Patentansprüche
1. Verfahren zum Analysieren eines erfassten Bildes einer Szene, mit folgenden Schritten: - Festlegen von Segmenten (Sl - S7) in dem erfassten Bild, die helligkeitsspezifische Merkmale aufweisen;
- Überprüfen einer positionsmäßigen Beziehung (a, b) der festgelegten Segmente zueinander;
- Ableiten eines Vorhandenseins eines Gesichts in dem er- fassten Bild., wenn eine Auswahl von festgelegten Segmenten
(Sl, S2, S4; S6, S7) eine bestimmte positionsmäßige Beziehung aufweist.
2. Verfahren nach Anspruch 1, bei dem das erfasste Bild aus einzelnen Bildpunkten zusammengesetzt ist, welchen jeweilige Graustufenwerte zugeordnet sind.
3. Verfahren nach Anspruch 1 oder 2 , bei dem die helligkeitsspezifischen Merkmale scharfe Helligkeitsübergänge aufweisen.
4. Verfahren nach Anspruch 3 , bei dem der Schritt des Festlegens von Segmenten in dem er- fassten Bild eine Bearbeitung (GF) des Bildes mittels eines Gradientenfilters, insbesondere eines positiven horizontalen Gradientenfilters, umfasst, um ein erstes bearbeitetes Bild zu erzeugen, bei dem am Ort eines Helligkeitsübergangs im erfassten Bild entsprechende Bildpunkte im ersten bearbeiteten Bild mit einem Graustufenwert vorgesehen werden, der von der Schärfe des Helligkeitsübergangs im erfassten Bild abhängt.
5. Verfahren nach Anspruch 4 , bei dem der Schritt des Festlegens von Segmenten in dem er- fassten Bild eine Binärisierungsbearbeitung (SA) des ersten bearbeiteten Bildes umfasst, um daraus ein zweites bearbeitetes Bild zu erzeugen, bei dem entsprechenden Bildpunkten, de- ren Graustufenwert einen vorbestimmten Schwellenwert übersteigt, ein "weiß"-Wert zugeordnet wird, während den übrigen Bildpunkten ein "schwarz "-Wert zugeordnet wird.
6. Verfahren nach Anspruch 5 , bei dem der Schritt des Festlegens von Segmenten in dem erfassten Bild ein Einbeschreiben (SA) eines Bereichs des zweiten bearbeiteten Bilds mit zusammenhängenden Bildpunkten, denen ein "weiß" -Wert zugeordnet ist, in eine geometrische Form, insbesondere ein Rechteck, als festgelegtes Segment umfasst.
7. Verfahren nach Anspruch 5 oder 6 , bei dem bestimmte Bereiche des zweiten bearbeiteten Bilds mit zusammenhängenden "weißen" Bildpunkten auf Grund von bestimmten Parametern bezüglich Größe und/oder Form der Bereiche o- der der diese einbeschreibenden geometrischen Form verworfen werden.
8. Verfahren nach einem der Ansprüche 1 bis 7, bei dem in dem Schritt des Uberprüfens der positionsmäßigen Beziehung in einem ersten Untersuchungsschritt jedes der festgelegten Segmente dahingehend untersucht wird, ob zu diesem ein zweites (S2) festgelegtes Segment existiert, das im Wesentlichen horizontal zu dem untersuchten festgelegten Segment (Sl) liegt, wobei bei Vorhandensein des zweiten festgelegten Segments nach einem dritten festgelegten Segment (S4) gesucht wird, das sich unterhalb des untersuchten und des zweiten Segments befindet, und für das gilt, dass ein Abstand (b) von dem untersuchten zu dem zweiten festgelegten Segment, und ein Abstand (a) einer Verbindungsstrecke zwischen dem untersuchten und dem zweiten festgelegten Segment zu dem dritten festgelegten Segment ein erstes vorbestimmtes Verhältnis aufweist .
9. Verfahren nach einem der Ansprüche 1 bis 8, bei dem in dem Schritt des Uberprüfens der positionsmäßigen Beziehung in einem zweiten Untersuchungsschritt jedes der festgelegten Segmente dahingehend untersucht wird, ob zu diesem ein viertes festgelegtes Segment (S7) existiert, das sich unterhalb dem untersuchten festgelegten Segment (S6) befin- det, und für das gilt, dass die horizontale Länge (b1) des untersuchten festgelegten Segments und der Abstand (a1) des vierten festgelegten Segments zum untersuchten festgelegten Segment ein zweites vorbestimmtes Verhältnis aufweisen.
10. Verfahre nach Anspruch 8 oder 9, bei dem das erste/oder das zweite vorbestimmte Verhältnis einen Wert von 1:1 bis 1:1,7, insbesondere von 1:1,2 bis 1:1,5 aufweist .
11. Verfahren nach einem der Ansprüche 8 bis 10, das ferner einen Schritt eines Extrahierens biometrischer Merkmale bezüglich einer Mundpartie aus einem Analysebereich um das gefundene dritte (S4) oder vierte (S7) festgelegte Segment umfasst.
12. Verfahren nach Anspruch 11, bei dem in dem erfassten Bild in einem Analysebereich (AB) , der sich an der Position des dritten oder vierten festgelegten Segments befindet, und der das jeweilige Segment umfasst, Hell-Dunkel- und/oder Dunkel-Hell-Helligkeitsübergänge bestimmt werden, um das Vorhandensein einer Oberlippe und Unterlippe einer Mundpartie abzuleiten.
13. Verfahren nach Anspruch 11 oder 12, bei dem die als Oberlippe und Unterlippe erkannten Abschnitte bezüglich ihrer geometrischen Eigenschaften, insbesondere Länge und Krümmung, untersucht werden, um daraus Viseme abzuleiten.
14. Verfahren nach einem der Ansprüche 11 bis 13, bei dem ein weiteres Bild der Szene erfasst wird, wobei am Ort des Analysebereichs (AB) ein um einen bestimmten Faktor erweiterter Analysebereich (EAB) festgelegt wird, aus dem wiederum biometrische Merkmale bezüglich einer Mundpartie extrahiert werden.
15. Verfahren nach einem der Ansprüche 1 bis 14, bei dem ein Informationsfeld in das erfasste Bild einer Szene eingefügt wird, wobei nach dem Bestimmen des Vorhandenseins des Gesichts (GES) in dem Bild (BIl, BI2 , BI3), das Gesicht (GES) in ein Gesichtsrahmenobjekt (GRO) einbeschrieben wird und das Informationsfeld (IFl, IF2 ) derart in das Bild eingefügt wird, dass sich das Gesichtsrahmenobjekt und das Informationsfeld nicht überlappen.
16. Verfahren nach einem der Ansprüche 1 bis 14, bei dem fer- ner eine Kameraeinrichtung (K) mit einem optischen Sensor
(KEL) zum Erfassen eines Bildes einer Szene und einer vor dem Kameraelement angeordneten Abbildungseinrichtung (KOP) zum Abbilden der Szene auf den optischen Sensor bereitgestellt wird, wobei nach dem Bestimmen des Vorhandenseins eines Ge- sichts (GES) in dem von dem optischen Sensor (KEL) erfassten Bild die Entfernung des Gesicht (GES) zu der Kameraeinrichtung (K) ermittelt wird und die Abbildungseinrichtung (KOP) auf die ermittelte Entfernung des Gesichts zu der Kameraeinrichtung (K) eingestellt wird, um das Gesicht (GES) auf dem optischen Sensor (KEL) scharf abzubilden.
17. Verfahren nach einem der Ansprüche 1 bis 14, bei dem das erfasste Bild einer Szene als ein erstes Bild (BIl) einer Szene in einem ersten Kommunikationsgerät (MFG21) bereitge- stellt wird, wobei nach dem Bestimmen des Vorhandenseins eines Gesichts (GES) in dem ersten Bild, das Gesicht in ein Gesichtsrahmenobjekt (GRO) einbeschrieben wird, der Bildbereich ausgeschnitten wird, der von dem Gesichtsrahmenobjekt umfasst wird, um so ein zweites Bild (BI2) zu erhalten, und das zwei- te Bild kodiert und zu einem zweiten Kommunikationsgerät ü- bertragen wird.
18. Verfahren nach einem der Ansprüche 1 bis 14, bei dem das erfasste Bild einer Szene als ein erstes Bild (BIl) in ein zweites Bild (BI2) mit einer geringeren Größe umgewandelt wird, wobei nach dem Bestimmen des Vorhandenseins eines Gesichts (GES) in dem ersten Bild mit der ersten Größe, das Gesicht in ein Gesichtsrahmenobjekt (GRO) , das der Größe des zweiten Bilds entspricht einbeschrieben wird und der Bildbereich, der von dem Gesichtsrahmenobjekt umfasst wird ausgeschnitten wird, um so das zweite Bild (BI2) zu erhalten.
19. Programmprodukt für eine Datenverarbeitungsanlage, das Software-Code-Abschnitte enthält, mit denen ein Verfahren nach zumindest einem der Ansprüche 1 bis 14 auf einer Datenverarbeitungsanlage ausgeführt werden kann.
20. Verfahren zur Spracherkennung, mit folgenden Schritten: Aufnehmen eines akustischen Sprachsignals (AS1) und Ermitteln von Phonem-Merkmalen (AVI, WEl) aus diesem; Aufnehmen einer Szene (0S1) mit einem menschlichen Gesicht und Extrahieren von Visem-Merkmalen (Wl, WEl) gemäß einem
Verfahren der Ansprüche 11 bis 14;
Ermitteln (GEF) von Sprach-Merkmalen aus einer Kombination der Phonem-Merkmale und Visem-Merkmale.
21. Datenverarbeitungsanlage mit folgenden Merkmalen: einem optischen Sensor (K) zum Aufnehmen eines Bildes einer Szene; - einer Auswerteeinrichtung (OAA, SE, AAA) mit einem optischen Auswerteabschnitt (OAA) zum Analysieren einer Szene gemäß einem Verfahren der Ansprüche 1 bis 14.
22. Datenverarbeitungsanlage nach Anspruch 21, ferner mit einem akustischen Sensor (MIK) zum Aufnehmen eines akustischen Sprachsignals (AS1) , wobei die Auswerteeinrich- tung (OAA, SE, AAA) ferner eine mit dem optischen Auswerteabschnitt (OAA) und dem akustischen Sensor (MIK) verbundenen Spracherkennungsabschnitt (AAA) zur Spracherkennung gemäß einem Verfahren des Anspruchs 16 umfasst .
EP03735301A 2002-05-14 2003-05-13 Verfahren zum analysieren einer szene sowie entsprechendes datenverarbeitungsgerät und programmprodukt Ceased EP1504407A1 (de)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
DE10221391 2002-05-14
DE10221391A DE10221391B4 (de) 2002-05-14 2002-05-14 Verfahren zum Analysieren einer Szene
PCT/DE2003/001542 WO2003096261A1 (de) 2002-05-14 2003-05-13 Verfahren zum analysieren einer szene sowie entsprechendes datenverarbeitungsgerät und programmprodukt

Publications (1)

Publication Number Publication Date
EP1504407A1 true EP1504407A1 (de) 2005-02-09

Family

ID=29413796

Family Applications (1)

Application Number Title Priority Date Filing Date
EP03735301A Ceased EP1504407A1 (de) 2002-05-14 2003-05-13 Verfahren zum analysieren einer szene sowie entsprechendes datenverarbeitungsgerät und programmprodukt

Country Status (4)

Country Link
EP (1) EP1504407A1 (de)
AU (1) AU2003236795A1 (de)
DE (1) DE10221391B4 (de)
WO (1) WO2003096261A1 (de)

Families Citing this family (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
DE10321501A1 (de) * 2003-05-13 2004-12-02 Siemens Ag Verfahren zum Einfügen eines Informationsfelds in ein Bild
WO2014016695A2 (en) 2012-07-27 2014-01-30 Assa Abloy Ab Presence-based credential updating
ES2872351T3 (es) 2012-07-27 2021-11-02 Assa Abloy Ab Controles de ajuste automático basados en la información de presencia fuera de la habitación

Family Cites Families (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5586215A (en) * 1992-05-26 1996-12-17 Ricoh Corporation Neural network acoustic and visual speech recognition system
GB2341231A (en) * 1998-09-05 2000-03-08 Sharp Kk Face detection in an image

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
MIAO J; YIN B; WANG K; SHEN L; CHEN X: "A hierarchical multiscale and multiangle system for human face detection in a complex background using gravity-center template", PATTERN RECOGNITION, vol. 32, no. 7, July 1999 (1999-07-01), pages 1237 - 1248, XP004169474 *

Also Published As

Publication number Publication date
WO2003096261A1 (de) 2003-11-20
DE10221391B4 (de) 2006-08-24
AU2003236795A1 (en) 2003-11-11
DE10221391A1 (de) 2003-12-04

Similar Documents

Publication Publication Date Title
EP1119822B1 (de) Verfahren und system zur personenerkennung mit modellbasierter gesichtsfindung
DE69612700T2 (de) Merkmallokalisierung in einem Bild
DE60307583T2 (de) Auswertung der Schärfe eines Bildes der Iris eines Auges
US6381345B1 (en) Method and apparatus for detecting eye location in an image
DE60116949T2 (de) Gesichtserfassungsverfahren
DE69920138T2 (de) Videokonferenzsystem mit tonquellelokalisierung
US5625704A (en) Speaker recognition using spatiotemporal cues
CN112712906B (zh) 视频图像处理方法、装置、电子设备及存储介质
CN110889334A (zh) 人员闯入识别方法及装置
EP1667113A2 (de) Verfahren zur selektiven Aufnahme eines Schallsignals
WO2004038646A1 (de) Prüfung von bildaufnahmen von personen
CN111967319B (zh) 基于红外和可见光的活体检测方法、装置、设备和存储介质
DE102010016251A1 (de) Erkennungsverfahren für ein bewegliches Objekt und das der Erkennung des beweglichen Objekts zugrunde liegende Befehlseingabeverfahren
CN112839167A (zh) 图像处理方法、装置、电子设备及计算机可读介质
WO2017153354A1 (de) Verfahren und vorrichtung zum bewerten von blickabbildungen
DE112016005482T5 (de) Objektdetektion mit adaptiven Kanalmerkmalen
CN109377494A (zh) 一种用于图像的语义分割方法和装置
LU506204B1 (en) Eine methode zur erkennung ungewöhnlichen verhaltens von personen in einer bank basierend auf zwei kameras
EP3663981B1 (de) Verfahren zur erfassung von fingerabdrücken
EP4341918B1 (de) Vorrichtung und verfahren zur erzeugung eines biometrischen bildes eines gesichts einer person
DE10313019A1 (de) Einhandbedienung von Endgeräten per Gestikerkennung
AT521934A1 (de) Verfahren zur Erfassung von Fingerabdrücken
WO2003096261A1 (de) Verfahren zum analysieren einer szene sowie entsprechendes datenverarbeitungsgerät und programmprodukt
DE112022002910T5 (de) Auf verstärkungslernen basierendes system für die abstimmung von kameraparametern zur verbesserung der analytik
DE10321502A1 (de) Verfahren zum Fokussieren auf ein Objekt

Legal Events

Date Code Title Description
PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

17P Request for examination filed

Effective date: 20041022

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HU IE IT LI LU MC NL PT RO SE SI SK TR

AX Request for extension of the european patent

Extension state: AL LT LV MK

DAX Request for extension of the european patent (deleted)
RBV Designated contracting states (corrected)

Designated state(s): DE FR GB

17Q First examination report despatched

Effective date: 20050711

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION HAS BEEN REFUSED

18R Application refused

Effective date: 20070908