EP2308010A1 - Verfahren zur rechnergestützten erkennung eines spezifischen objekts aus einer datenmenge basierend auf einer interaktion mit einem nutzer - Google Patents

Verfahren zur rechnergestützten erkennung eines spezifischen objekts aus einer datenmenge basierend auf einer interaktion mit einem nutzer

Info

Publication number
EP2308010A1
EP2308010A1 EP09780519A EP09780519A EP2308010A1 EP 2308010 A1 EP2308010 A1 EP 2308010A1 EP 09780519 A EP09780519 A EP 09780519A EP 09780519 A EP09780519 A EP 09780519A EP 2308010 A1 EP2308010 A1 EP 2308010A1
Authority
EP
European Patent Office
Prior art keywords
user
specific object
real
training examples
learning method
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
EP09780519A
Other languages
English (en)
French (fr)
Inventor
Josef Alois Birchbauer
Horst Bischof
Bernhard Frühstück
Helmut Grabner
Thuy Nguyen
Peter Michael Roth
Martin Winter
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Siemens AG Oesterreich
Technische Universitaet Graz
Original Assignee
Siemens AG Oesterreich
Technische Universitaet Graz
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Siemens AG Oesterreich, Technische Universitaet Graz filed Critical Siemens AG Oesterreich
Publication of EP2308010A1 publication Critical patent/EP2308010A1/de
Ceased legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V40/00Recognition of biometric, human-related or animal-related patterns in image or video data
    • G06V40/10Human or animal bodies, e.g. vehicle occupants or pedestrians; Body parts, e.g. hands
    • G06V40/103Static body considered as a whole, e.g. static pedestrian or occupant recognition
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/40Software arrangements specially adapted for pattern recognition, e.g. user interfaces or toolboxes therefor

Definitions

  • the invention relates to a method for computer-aided recognition or identification of a specific object from a data volume based on an interaction with a user as well as a corresponding device and a corresponding computer program product.
  • Document [1] describes an interactive training method with which a detector for a classification task is trained based on real-time learning.
  • the support systems known from the prior art have the disadvantage that they do not perform a completely interactive training or are not used to recognize a specific object specified by a user.
  • the object of the invention is therefore to provide a completely interactive method for the computer-aided recognition of a specific object from a data set.
  • a data quantity processed using a real-time-capable learning method is displayed via a user interface, wherein a user can identify training examples for the specific object in the displayed data volume via the user interface.
  • the specific object is an arbitrary object that can be specified or recognized in accordance with the user preferences in the dataset.
  • object is to be construed broadly and may include any type of objects, such as objects, living beings, persons, and the like, as well as constellations of several such objects (combined into an object) has specific object and is able to recognize objects in the dataset as specific objects
  • the specific object is thus no longer an object class, but rather a fixed object corresponding to the user preferences, in particular in the form of the instance of an object class.
  • the mouse Being configured manner, preferably it includes a monitor for displaying the amount of data and a corresponding input unit in the form of a keyboard or mouse. Particularly preferred is the use of a mouse, the mouse can be moved to a corresponding object and the identification of the object can be made as a training example by clicking.
  • a knowledge base is updated real-time-capable learning method, with the real-time learning method learning a model for identifying the specific object based on the updated knowledge base, whereby the processing tete amount of data is received. This is followed by an updated display of the data quantity according to the above step a).
  • the method according to the invention is thus characterized by an iterative process of displaying and subsequently updating the data volume, the method being completely interactive, since after each user interaction in the form of identification of one or more training examples, the knowledge base is updated immediately the real-time learning method is performed.
  • any of the real-time-capable learning methods known from the prior art can be used in the method according to the invention.
  • the on-line learning described in the document [1] or [2] is used.
  • the entire disclosure of these references is incorporated herein by reference.
  • the online learning described in the document is based on a so-called boosting method in which a classifier is learned through on-line training.
  • an on-line version of the adaboost learning method known from the prior art is used.
  • the classifier no longer identifies classes of objects but rather a specifically defined object.
  • the method according to the invention By stepwise transferring knowledge from a user to a system in the method according to the invention, the effort on the human side is drastically reduced and is increasingly limited to corrective interventions.
  • the method according to the invention adapts fluently to the respective preferences of the user and not only takes work away from it, but even acts proactively in his or her sense.
  • objects are identified in the amount of data processed using the real-time learning method be classified as the specific object by the learned model.
  • the user selects training examples by the user such that the user of the real-time learning method correctly marks objects classified as specific objects as positive training examples and / or objects incorrectly classified as specific objects as negative training examples by the real-time-capable learning method. This creates a simple and intuitive way for a user to generate new training examples.
  • a particularly fast and effective identification of training examples can be made, in particular, if only negative training examples can be marked by the user via the user interface. It is taken into account that after a plurality of iterations the number of negative training examples becomes ever smaller, since with advanced learning an ever better identification of the specific object takes place in the dataset.
  • the user interface can also mark, as negative training examples, objects that correspond to the specific object and have not been classified as a specific object by the real-time learning method.
  • the display in step a) contains a list of the objects identified by the real-time-capable learning method. This list can be easily and intuitively edited by a user by highlighting positive or negative training examples in the list.
  • the inventive method can be used for any types of data.
  • the method identifies specific objects in a dataset from one or more video streams.
  • the specific object in the video stream may be a person characterized by its outward appearance, particularly its clothing and / or body measurements and / or body movements.
  • This can eg be evaluated in a surveillance video, which acts a specific person performs.
  • a surveillance video which acts a specific person performs.
  • a user may first note the appearance of a person doing an unauthorized act (for example, a theft).
  • the method according to the invention the occurrence of the same person in the video stream or in other video streams can be determined interactively. In this way, a search for wanted persons in video streams is made possible by an interactive computer-aided method.
  • the method according to the invention is used to identify or identify specific objects (and not object classes) in a dataset.
  • the method can also be used to annotate large amounts of data.
  • the real-time learning method does not provide objects which are classified as specific objects, but objects which are assumed to have a certain annotation.
  • the user can in turn identify training examples in the annotated objects, for example he can mark incorrectly annotated objects accordingly.
  • the annotation effort is greatly simplified by a user, since a large part of the annotations made computer-aided and the user only has to take corrective action.
  • the invention further includes an apparatus for computer-aided recognition of a specific object from a data set based on an interaction with a user.
  • the device comprises a
  • User interface for displaying a data set processed using a real-time learning method, wherein a user uses the user interface to provide training examples for the spe- can identify a cifical object in the displayed dataset.
  • an arithmetic unit is provided which, in operation, after each identification made by the user of one or more training examples, in particular of 20 training examples or less, preferably of 15 or 10 training examples or less, and more preferably of a single training example, a knowledge base and real-time-capable learning method, wherein the real-time learning method learns a model for identifying the specific object based on the updated knowledge base, thereby obtaining the processed amount of data displayed by the user interface.
  • the device is preferably designed such that any desired variant of the method according to the invention can be carried out with the device.
  • the invention further relates to a computer program product with a program code stored on a machine-readable carrier for carrying out each of the above-described variants of the inventive method when the program is run on a computer.
  • Fig. 1 is a schematic representation of the steps which are performed in an embodiment of the invention.
  • FIG. 2 shows a schematic representation of the objects identified in the steps of an embodiment of the method according to the invention.
  • a plurality of video streams is used as data quantity processed.
  • the goal here is to identify an object in the form of a specific person in a computer-aided manner in the video streams.
  • the particular person is, for example, a person included in another video stream and viewed by a user.
  • the user is thus aware of the appearance of the person, and the user's knowledge is used interactively in the inventive method for computer-aided identification of the same person in the plurality of video streams.
  • One use case may be that a person in a video stream has committed a tampering action that has been filmed by a video camera.
  • the embodiment of the invention described here uses a real-time or online learning method known per se.
  • a variant of such a learning method is described in the document [1] or [2].
  • This learning method is used in the cited document for the classification of objects, but according to the invention is used to search for specific objects.
  • the real-time learning method is first initialized with a user-identified image of the person sought as a training example, this image is generated for example by marking a point in a video that shows the person searched. Subsequently, a generalization of a descriptor for the individual description of the person is derived from several consecutive frames of the video. The derivation of general sated descriptors is well known from classification methods and is therefore not described in detail.
  • Classifier learned and applied to the video streams As a result, on a user interface 1, a table of objects identified by the classifier as the searched person is displayed (step S1).
  • the learning method was computer-aided carried out on the designated in Fig. 1 by reference numeral 2 arithmetic unit.
  • the user interface 1 is shown schematically in FIG. 1 as a monitor with a keyboard and a connected mouse. Via the user interface, the user can make corresponding inputs, in particular he can mark displayed objects by clicking on the mouse. The user now selects from the displayed table of detected objects one or more of such objects, which were recognized by the classifier as the searched person, but are not that person. These objects are marked as a negative training example by the user with the mouse.
  • an update of the known training examples immediately follows. That is, the knowledge base on which the online learning method operates is updated immediately after being marked with the mouse by including the negative training examples in the knowledge base. Based on the updated knowledge base, the online learning process for learning the classifier is performed immediately in step S2 by means of the arithmetic unit 2. Finally, the objects resulting from the updated classifier, which are classified as the searched person, are displayed in a new step S1 on the user interface. This is indicated by a corresponding arrow P from step S2 to step S1. Thus, an updated list of recognized objects is displayed in real time, it being assumed that the updated list is based on the further training example contains fewer objects that are incorrectly identified as the person you are looking for.
  • step S2 is carried out, i. the knowledge base is updated with the further training examples and the online learning process is carried out.
  • the updated result is displayed again in step S1.
  • the method is repeated iteratively a plurality of times, the method being characterized in that any user intervention in the form of flags of one or more training examples results in an immediate update of the knowledge base and an immediate visual effect by display on the user interface 1.
  • This is made possible by an on-line learning method, i. through a learning process that is fast enough to enable real-time training based on newly added training examples.
  • the learning method described in the document [1] or [2] is preferably used, which is an online version of the adaboost learning method known to the person skilled in the art.
  • FIG. 2 again clearly shows the filtering of a searched person from a dataset.
  • a user P marks the user interface of a person P as an object to be recognized in a video image at a location in a video stream.
  • step S108 persons from another video stream or elsewhere in the video stream are reproduced step by step in the form of a list.
  • This list contains those persons identified as person P according to a real-time learning method.
  • a user makes the identification of positive training examples, ie of correct meetings, from the corresponding lists with a mouse click.
  • the persons marked as correct hits are provided in FIG. 2 with corresponding reference signs T. It can be seen that in step S100, where the filter has not yet been learned, no real hit is found. Gradually, more and more hits are found, which are always identified by the user as positive training examples. Finally, four hits are identified in step S108.
  • the process finally ends in a step S109 in which a person in the video stream is recognized as the original person P from the video image of the step SlO1.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Multimedia (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Artificial Intelligence (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Data Mining & Analysis (AREA)
  • Evolutionary Biology (AREA)
  • Evolutionary Computation (AREA)
  • General Engineering & Computer Science (AREA)
  • Image Analysis (AREA)

Abstract

Die Erfindung betrifft ein Verfahren zur rechnergestützten Erkennung eines spezifischen Objekts aus einer Datenmenge basierend auf einer Interaktion mit einem Nutzer. Das erfindungsgemäße Verfahren verwendet ein echtzeitfähiges Lernverfahren, wobei eine mit dem Lernverfahren verarbeitete Datenmenge über eine Nutzerschnittstelle angezeigt wird. Der Nutzer kann über die Nutzerschnittstelle Trainingsbeispiele für das spezifische Objekt in der angezeigten Datenmenge identifizieren. Nach jeder, durch den Nutzer vorgenommenen Identifikation von einem oder mehreren Trainingsbeispielen wird eine Wissensbasis aktualisiert und das echtzeitfähige Lernverfahren durchgeführt, wobei mit dem Lernverfahren ein Modell zur Identifikation des spezifischen Objekts basierend auf der aktualisierten Wissensbasis gelernt wird, wodurch die verarbeitete Datenmenge erhalten wird, die über die Nutzerschnittstelle angezeigt wird. Das erfindungsgemäße Verfahren zeichnet sich dadurch aus, dass nach jeder Interaktion des Nutzers in der Form der Identifikation von einem oder mehreren Trainingsbeispielen unmittelbar ein echtzeitfähiges Lernverfahren durchgeführt wird, so dass es nur zu geringfügigen Zeitverzögerungen bei der Durchführung des Verfahrens kommt. Das erfindungsgemäße Verfahren wird vorzugsweise zur Erkennung von Objekten in Videoströmen eingesetzt, beispielsweise zur Identifikation einer Person anhand ihres äußeren Erscheinungsbilds.

Description

Beschreibung
Verfahren zur rechnergestützten Erkennung eines spezifischen Objekts aus einer Datenmenge basierend auf einer Interaktion mit einem Nutzer
Die Erfindung betrifft ein Verfahren zur rechnergestützten Erkennung bzw. Identifikation eines spezifischen Objekts aus einer Datenmenge basierend auf einer Interaktion mit einem Nutzer sowie eine entsprechende Vorrichtung und ein entsprechendes Computerprogrammprodukt.
Die Erkennung spezifischer Objekte in großen Datenmengen durch einen Nutzer ist ein sehr zeitaufwändiger und konzent- rationsintensiver Prozess. Aus dem Stand der Technik sind rechnergestützte Systeme bekannt, mit denen ein Nutzer bei der Durchführung solcher Prozesse unterstützt werden kann.
Das Dokument [1] beschreibt eine interaktive Trainingsmetho- de, mit der basierend auf einem echtzeitfähigen Lernen ein Detektor für eine Klassifikationsaufgabe trainiert wird.
Die aus dem Stand der Technik bekannten Unterstützungssysteme weisen den Nachteil auf, dass sie kein vollständig interakti- ves Training durchführen bzw. nicht zur Erkennung eines spezifischen, durch einen Nutzer festgelegten Objekts eingesetzt werden .
Aufgabe der Erfindung ist es deshalb, ein vollständig inter- aktives Verfahren zur rechnergestützten Erkennung eines spezifischen Objekts aus einer Datenmenge zu schaffen.
Diese Aufgabe wird durch das Verfahren gemäß Patentanspruch 1 bzw. die Vorrichtung gemäß Patentanspruch 10 bzw. das Compu- terprogrammprodukt gemäß Patentanspruch 12 gelöst. Weiterbildungen der Erfindung sind in den abhängigen Ansprüchen definiert . In dem erfindungsgemäßen Verfahren wird in einem Schritt a) eine mit einem echtzeitfähigen Lernverfahren verarbeitete Datenmenge über eine Nutzerschnittstelle angezeigt, wobei ein Nutzer über die Nutzerschnittstelle Trainingsbeispiele für das spezifische Objekt in der angezeigten Datenmenge identifizieren kann. Das spezifische Objekt ist dabei ein beliebiges Objekt, das gemäß den Nutzerpräferenzen in der Datenmenge spezifiziert bzw. erkannt werden kann. Der Begriff „Objekt" ist dabei weit auszulegen und kann beliebige Arten von Objek- ten, wie Gegenstände, Lebewesen, Personen und dergleichen, umfassen sowie Konstellationen von mehreren solcher Objekte (zusammengefasst zu einem Objekt) . Entscheidend ist, dass der Nutzer Wissen über das spezifische Objekt hat und Objekte in der Datenmenge als spezifische Objekte erkennen kann. Das spezifische Objekt ist somit keine Objektklasse mehr, sondern es handelt sich um ein festgelegtes, den Nutzerpräferenzen entsprechendes Objekt, insbesondere in der Form der Instanz einer Objektklasse.
Erfindungsgemäß kann die Nutzerschnittstelle in beliebiger
Weise ausgestaltet sein, vorzugsweise umfasst sie einen Monitor zur Anzeige der Datenmenge sowie eine entsprechende Eingabeeinheit in der Form einer Tastatur oder Maus. Besonders bevorzugt ist die Verwendung einer Maus, wobei die Maus auf ein entsprechendes Objekt bewegt werden kann und durch einen Klick die Identifikation des Objekts als Trainingsbeispiel vorgenommen werden kann.
In dem erfindungsgemäßen Verfahren wird in einem Schritt b) nach jeder, durch den Nutzer vorgenommenen Identifikation von einem oder mehreren Trainingsbeispielen, insbesondere von 20 Trainingsbeispielen oder weniger, vorzugsweise von 15 oder 10 Trainingsbeispielen oder weniger und besonders bevorzugt von einem einzelnen Trainingsbeispiel, eine Wissensbasis aktuali- siert und das echtzeitfähige Lernverfahren durchgeführt, wobei mit dem echtzeitfähigen Lernverfahren ein Modell zur Identifikation des spezifischen Objekts basierend auf der aktualisierten Wissensbasis gelernt wird, wodurch die verarbei- tete Datenmenge erhalten wird. Anschließend erfolgt wiederum eine aktualisierte Anzeige der Datenmenge gemäß obigem Schritt a) . Das erfindungsgemäße Verfahren zeichnet sich somit durch einen iterativen Prozess der Anzeige und nachfol- genden Aktualisierung der Datenmenge aus, wobei das Verfahren vollständig interaktiv abläuft, da nach jeder Interaktion eines Nutzers in der Form der Identifikation eines oder mehrerer Trainingsbeispiele unmittelbar eine Aktualisierung der Wissensbasis erfolgt und das echtzeitfähigen Lernverfahren durchgeführt wird.
In dem erfindungsgemäßen Verfahren können beliebige, aus dem Stand der Technik bekannte echtzeitfähige Lernverfahren eingesetzt werden. In einer besonders bevorzugten Ausführungs- form wird das in der Druckschrift [1] bzw. [2] beschriebene Online-Lernen verwendet. Die gesamte Offenbarung dieser Druckschriften wird durch Verweis zum Inhalt der vorliegenden Anmeldung gemacht. Das in der Druckschrift beschriebene Online-Lernen basiert auf einem sog. Boosting-Verfahren, bei dem durch On-line-Training ein Klassifikator gelernt wird. Es wird hierbei eine On-line-Version des aus dem Stand der Technik bekannten Adaboost-Lernverfahrens eingesetzt. Im Unterschied zur Druckschrift [1] werden erfindungsgemäß mit dem Klassifikator keine Klassen von Objekten mehr identifiziert, sondern ein spezifisch festgelegtes Objekt.
Indem in dem erfindungsgemäßen Verfahren schrittweise Wissen von einem Nutzer auf ein System übertragen wird, reduziert sich der Aufwand auf menschlicher Seite drastisch und wird zunehmend auf korrigierende Eingriffe beschränkt. Gleichzeitig passt sich das erfindungsgemäße Verfahren fließend an die jeweiligen Präferenzen des Nutzers an und nimmt diesem nicht nur Arbeit ab, sondern agiert sogar vorausschauend in seinem Sinne .
In einer bevorzugten Ausführungsform des erfindungsgemäßen Verfahrens werden in der mit dem echtzeitfähigen Lernverfahren verarbeiteten Datenmenge Objekte identifiziert, welche durch das gelernte Modell als das spezifische Objekt eingestuft werden. Vorzugsweise sind dabei über die Nutzerstelle Trainingsbeispiele durch den Nutzer derart auswählbar, dass der Nutzer von dem echtzeitigen Lernverfahren korrekt als spezifisches Objekt eingestufte Objekte als positive Trainingsbeispiele und/oder von dem echtzeitfähigen Lernverfahren inkorrekt als spezifisches Objekt eingestufte Objekte als negative Trainingsbeispiele markiert. Auf diese Weise wird eine einfache und intuitive Möglichkeit für einen Nutzer geschaf- fen, neue Trainingsbeispiele zu generieren.
Eine besonders schnelle und effektive Identifikation von Trainingsbeispielen kann insbesondere dann vorgenommen werden, wenn über die Nutzerschnittstelle nur negative Trai- ningsbeispiele durch den Nutzer markierbar sind. Dabei wird berücksichtigt, dass nach einer Mehrzahl von Iterationen die Anzahl an negativen Trainingsbeispielen immer geringer wird, da bei fortgeschrittenem Lernen eine immer bessere Identifikation des spezifischen Objekts in der Datenmenge erfolgt.
Zur Generierung weiterer relevanter Trainingsbeispiele sind in einer weiteren bevorzugten Ausführungsform über die Nutzerschnittstelle als negative Trainingsbeispiele ferner solche Objekte durch den Nutzer markierbar, welche dem spezifi- sehen Objekt entsprechen und von dem echtzeitfähigen Lernverfahren nicht als spezifisches Objekt eingestuft wurden.
In einer weiteren, besonders bevorzugten Ausführungsform des erfindungsgemäßen Verfahrens enthält die Anzeige in Schritt a) eine Liste der von dem echtzeitfähigen Lernverfahren identifizierten Objekte. Diese Liste kann ein Nutzer einfach und intuitiv durch Markieren von positiven bzw. negativen Trainingsbeispielen in der Liste abarbeiten.
Das erfindungsgemäße Verfahren kann für beliebige Arten von Datenmengen verwendet werden. In einer speziellen Anwendung werden mit dem Verfahren spezifische Objekte in einer Datenmenge aus einem oder mehreren Videoströmen identifiziert. Beispielsweise kann das spezifische Objekt in dem Videostrom eine Person sein, welche durch ihr äußeres Erscheinungsbild, insbesondere ihre Kleidung und/oder ihre Körpermaße und/oder ihre Körperbewegungen, charakterisiert ist. Damit kann z.B. in einem Überwachungsvideo evaluiert werden, welche Handlungen eine spezifische Person durchführt. Ein Nutzer kann sich durch Betrachten des Überwachungsvideos zunächst das Erscheinungsbild einer Person merken, welche eine unerlaubte Handlung vornimmt (beispielsweise einen Diebstahl) . Anschließend kann mit dem erfindungsgemäßen Verfahren das Auftreten der gleichen Person in dem Videostrom oder in anderen Videoströmen interaktiv ermittelt werden. Auf diese Weise wird eine Recherche nach gesuchten Personen in Videoströmen durch ein interaktives rechnergestütztes Verfahren ermöglicht.
Das erfindungsgemäße Verfahren dient zur Erkennung bzw. Identifikation von spezifischen Objekten (und nicht von Objektklassen) in einer Datenmenge. In abgewandelter Form kann das Verfahren jedoch auch zur Annotation von großen Datenmengen verwendet werden. Dabei liefert das echtzeitfähige Lernverfahren nicht Objekte, welche als spezifische Objekte eingestuft werden, sondern Objekte, für welche angenommen wird, dass sie eine bestimmte Annotierung aufweisen. Der Nutzer kann dabei wiederum Trainingsbeispiele in den annotierten Ob- jekten identifizieren, beispielsweise kann er falsch annotierte Objekte entsprechend markieren. Bei dieser Abwandlung wird der Annotierungsaufwand durch einen Nutzer stark vereinfacht, da ein Großteil der Annotierungen rechnergestützt vorgenommen und der Nutzer lediglich korrigierend eingreifen muss.
Neben dem oben beschriebenen Verfahren umfasst die Erfindung ferner eine Vorrichtung zur rechnergestützten Erkennung eines spezifischen Objekts aus einer Datenmenge basierend auf einer Interaktion mit einem Nutzer. Die Vorrichtung umfasst eine
Nutzerschnittstelle zur Anzeige einer mit einem echtzeitfähi- gen Lernverfahren verarbeiteten Datenmenge, wobei ein Nutzer über die Nutzerschnittstelle Trainingsbeispiele für das spe- zifische Objekt in der angezeigten Datenmenge identifizieren kann. Ferner ist eine Recheneinheit vorgesehen, welche im Betrieb nach jeder, durch den Nutzer vorgenommenen Identifikation von einem oder mehreren Trainingsbeispielen, insbesonde- re von 20 Trainingsbeispielen oder weniger, vorzugsweise von 15 oder 10 Trainingsbeispielen oder weniger und besonders bevorzugt von einem einzelnen Trainingsbeispiel, eine Wissensbasis aktualisiert und das echtzeitfähige Lernverfahren durchführt, wobei mit dem echtzeitfähigen Lernverfahren ein Modell zur Identifikation des spezifischen Objekts basierend auf der aktualisierten Wissensbasis gelernt wird, wodurch die verarbeitete Datenmenge erhalten wird, welche durch die Nutzerschnittstelle angezeigt wird. Die Vorrichtung ist vorzugsweise derart ausgestaltet, dass jede beliebige Variante des erfindungsgemäßen Verfahrens mit der Vorrichtung durchführbar ist .
Die Erfindung betrifft ferner ein Computerprogrammprodukt mit einem auf einem maschinenlesbaren Träger gespeicherten Pro- grammcode zur Durchführung jeder der oben beschriebenen Varianten des erfindungsgemäßen Verfahrens, wenn das Programm auf einem Rechner abläuft.
Ausführungsbeispiele des erfindungsgemäßen Verfahrens werden nachfolgend anhand der beigefügten Figuren beschrieben.
Es zeigen:
Fig. 1 eine schematische Darstellung der Schritte, welche in einem Ausführungsbeispiel der Erfindung durchgeführt werden; und
Fig. 2 eine schematische Darstellung der in den Schritten einer Ausführungsform des erfindungsgemäßen Verfah- rens erkannten Objekte.
In der Ausführungsform des erfindungsgemäßen Verfahrens gemäß Fig. 1 wird als Datenmenge eine Mehrzahl von Videoströmen verarbeitet. Ziel ist es dabei, ein Objekt in der Form einer bestimmten Person rechnergestützt in den Videoströmen zu identifizieren. Die bestimmte Person ist beispielsweise eine Person, welche in einem weiteren Videostrom enthalten ist und von einem Nutzer betrachtet wurde. Dem Nutzer ist somit das Erscheinungsbild der Person bekannt, und das Wissen des Nutzers wird interaktiv in dem erfindungsgemäßen Verfahren zur rechnergestützten Identifikation derselben Person in der Mehrzahl von Videoströmen eingesetzt. Ein Anwendungsfall kann darin bestehen, dass eine Person in einem Videostrom eine unerlaubte Handlung begangen hat, welche durch eine Videokamera gefilmt wurde. Nunmehr soll in weiteren Videoströmen nach derselben Person recherchiert werden, um beispielsweise zu ermitteln, was die Person vor bzw. nach der Durchführung der unerlaubten Handlung gemacht hat. Dabei wird die Person durch den Nutzer nicht durch eine Gesichtserkennung wiedererkannt, welche auflösungsbedingt in Videos nur begrenzt möglich ist. Stattdessen wird das Erscheinungsbild (sog. „appearance") der Person von dem Nutzer erfasst, beispielsweise wie sich die Person bewegt, welche Kleidung die Person trägt bzw. welche Körpermaße bzw. welches Geschlecht die Person hat.
Die hier beschriebene Ausführungsform der Erfindung verwendet ein an sich bekanntes echtzeitfähiges bzw. Online-Lernverfah- ren. Eine Variante eines solchen Lernverfahrens ist in der Druckschrift [1] bzw. [2] beschrieben. Dieses Lernverfahren dient in der genannten Druckschrift zur Klassifikation von Objekten, wird erfindungsgemäß jedoch zur Recherche nach spezifischen Objekten eingesetzt.
Das echtzeitfähige Lernverfahren wird zunächst mit einem von dem Nutzer identifizierten Bild der gesuchten Person als Trainingsbeispiel initialisiert, wobei dieses Bild beispielsweise durch eine Markierung einer Stelle in einem Video er- zeugt wird, welches die gesuchte Person zeigt. Anschließend wird aus mehreren, aufeinander folgenden Frames des Videos eine Generalisierung eines Deskriptors zur individuellen Beschreibung der Person abgeleitet. Die Ableitung von generali- sierten Deskriptoren ist hinlänglich aus Klassifikationsverfahren bekannt und wird deshalb nicht näher beschrieben.
Zunächst wird mit dem einzelnen Trainingsbeispiel oder mit mehreren über das Objekt vorab bekannten Datenmustern der
Klassifikator gelernt und auf die Videoströme angewandt. Als Ergebnis wird auf einer Benutzerschnittstelle 1 eine Tabelle von Objekten angezeigt, welche durch den Klassifikator als die gesuchte Person identifiziert wurden (Schritt Sl) . Das Lernverfahren wurde dabei rechnergestützt auf der in Fig. 1 mit Bezugszeichen 2 bezeichneten Recheneinheit durchgeführt. Die Nutzerschnittstelle 1 ist in Fig. 1 schematisiert als ein Monitor mit Tastatur und angeschlossener Maus wiedergegeben. Über die Nutzerschnittstelle kann der Nutzer entsprechende Eingaben machen, insbesondere kann er angezeigte Objekte mit einem Klick auf die Maus markieren. Der Nutzer wählt nun aus der angezeigten Tabelle von erkannten Objekten ein oder mehrere solcher Objekte aus, welche durch den Klassifikator zwar als die gesuchte Person erkannt wurden, jedoch nicht diese Person sind. Diese Objekte werden als negatives Trainingsbeispiel durch den Nutzer mittels der Maus markiert.
Anschließend erfolgt unmittelbar eine Aktualisierung der bekannten Trainingsbeispiele. Das heißt, die Wissensbasis, auf welcher das Online-Lernverfahren arbeitet, wird unmittelbar nach der Markierung mit der Maus dadurch aktualisiert, dass die negativen Trainingsbeispiele in die Wissensbasis aufgenommen werden. Basierend auf der aktualisierten Wissensbasis wird unmittelbar in Schritt S2 mittels der Recheneinheit 2 das Online-Lernverfahren zum Lernen des Klassifikators durchgeführt. Schließlich werden die sich mit dem aktualisierten Klassifikator ergebenden Objekte, welche als die gesuchte Person eingestuft werden, in einem neuen Schritt Sl auf der Nutzerschnittstelle angezeigt. Dies ist durch einen entspre- chenden Pfeil P von Schritt S2 nach Schritt Sl angedeutet. Es wird somit in Echtzeit eine aktualisierte Liste der erkannten Objekte dargestellt, wobei davon auszugehen ist, dass die aktualisierte Liste aufgrund des weiteren Trainingsbeispiels weniger Objekte enthält, welche fälschlicherweise als die gesuchte Person identifiziert wurden.
Anschließend wird wiederum mittels einer Nutzerinteraktion über die Nutzerschnittstelle 1 ein oder mehrere weitere Objekte markiert, welche falsch als die gesuchte Person eingestuft wurden, und darauffolgend wird wiederum der Schritt S2 durchgeführt, d.h. die Wissensbasis wird mit den weiteren Trainingsbeispielen aktualisiert und das Online-Lernverfahren wird durchgeführt. Das aktualisierte Ergebnis wird wieder in Schritt Sl angezeigt.
Das Verfahren wird iterativ mehrere Male wiederholt, wobei sich das Verfahren dadurch auszeichnet, dass jeder Eingriff des Nutzers in der Form von Markierungen von einem oder mehreren Trainingsbeispielen zu einer unmittelbaren Aktualisierung der Wissensbasis und einem unmittelbaren sichtbaren Effekt durch Anzeige auf der Nutzerschnittstelle 1 führt. Dies wird durch ein onlinefähiges Lernverfahren ermöglicht, d.h. durch ein Lernverfahren, welches schnell genug ist, um echt- zeitfähiges Training basierend auf neu hinzukommenden Trainingsbeispielen zu ermöglichen. Wie bereits erwähnt, wird vorzugsweise das in der Druckschrift [1] bzw. [2] beschriebene Lernverfahren eingesetzt, welches eine Online-Version des dem Fachmann bekannten Adaboost-Lernverfahrens ist.
Mit dem im Vorangegangenen beschriebenen schrittweisen Lernen wird der Filter zum Herausfiltern der gesuchten Person adaptiv immer schärfer. Der Filter ist zunächst sehr breit, wo- durch die Wahrscheinlichkeit eines Übersehens einer gesuchten Person minimiert wird. Am Anfang des Verfahrens werden somit sehr viele Objekte auf der Nutzerschnittstelle angezeigt, welche nicht der gesuchten Person entsprechen, d.h. es werden anfangs viele falsche Treffer induziert. Schrittweise werden diese falschen Treffer dann durch die interaktive Ergänzung mit weiteren Trainingsbeispielen eliminiert, so dass der Filter im Laufe der Recherche nach der gesuchten Person immer schärfer wird. Fig. 2 zeigt nochmals anschaulich die Filterung einer gesuchten Person aus einer Datenmenge. Zunächst wird in einem Schritt SlOl von einem Nutzer über die Nutzerschnittstelle einer Person P als zu erkennendes Objekt in einem Videobild an einer Stelle in einem Videostrom markiert. Anschließend werden schrittweise in den einzelnen Schritten S102, S103, ... bis S108 Personen aus einem anderen Videostrom bzw. an anderer Stelle im Videostrom in der Form einer Liste wiedergege- ben. Diese Liste enthält diejenigen Personen, welche gemäß einem echtzeitfähigen Lernverfahren als die Person P identifiziert wurden. In jedem der Schritte S102 bis S108 erfolgt durch einen Benutzer mit einem Mausklick die Identifikation von positiven Trainingsbeispielen, d.h. von richtigen Tref- fern aus den entsprechenden Listen. Die als richtige Treffer markierten Personen sind in Fig. 2 mit entsprechenden Bezugszeichen T versehen. Man erkennt, dass in Schritt SlOl, bei dem der Filter noch nicht gelernt ist, gar kein richtiger Treffer gefunden wird. Schrittweise werden immer mehr Treffer gefunden, die von dem Nutzer immer als positive Trainingsbeispiele identifiziert werden. In Schritt S108 werden schließlich vier Treffer identifiziert. Das Verfahren endet schließlich in einem Schritt S109, in dem eine Person in dem Videostrom als ursprüngliche Person P aus dem Videobild des Schritts SlOl erkannt wird.
Literaturverzeichnis
[1] H. Grabner, T. Nguyen, B. Gruber und H. Bischof: „Online boosting based car detection from aerial images", http: //www, icg.ru-grdz.3c.ar/pub/pubob3ects/ThuyRIVFO7
[2] H. Grabner und H. Bischof: "On-line boosting and Vision", IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2006), http: //www. icg. tu- graz . ac . at/Members/hgrabner/pub hgrabner/grabner2006Onli neBoosting.pdf

Claims

Patentansprüche
1. Verfahren zur rechnergestützten Erkennung eines spezifischen Objekts aus einer Datenmenge basierend auf einer Inter- aktion mit einem Nutzer, bei dem: a) eine mit einem echtzeitfähigen Lernverfahren verarbeitete Datenmenge über eine Nutzerschnittstelle (1) angezeigt wird, wobei ein Nutzer über die Nutzerschnittstelle (1) Trainingsbeispiele für das spezifische Objekt in der an- gezeigten Datenmenge identifizieren kann; b) nach jeder, durch den Nutzer vorgenommenen Identifikation von einem oder mehreren Trainingsbeispielen eine Wissensbasis aktualisiert wird und das echtzeitfähige Lernver¬ fahren durchgeführt wird, wobei mit dem echtzeitfähigen Lernverfahren ein Modell zur Identifikation des spezifischen Objekts basierend auf der aktualisierten Wissensba¬ sis gelernt wird, wodurch die verarbeitete Datenmenge er¬ halten wird, welche in Schritt a) angezeigt wird.
2. Verfahren nach Anspruch 1, bei dem in der mit dem echt- zeitfähigen Lernverfahren verarbeiteten Datenmenge Objekte identifiziert sind, welche durch das gelernte Modell als das spezifische Objekt eingestuft werden.
3. Verfahren nach Anspruch 2, bei dem über die Nutzerschnittstelle (1) Trainingsbeispielen durch den Nutzer derart auswählbar sind, dass der Nutzer von dem echtzeitfähigen Lernverfahren korrekt als spezifisches Objekt eingestufte Objekte als positive Trainingsbeispiele und/oder von dem echtzeitfä- higen Lernverfahren inkorrekt als spezifisches Objekt einge¬ stufte Objekte als negative Trainingsbeispiele markiert.
4. Verfahren nach Anspruch 3, bei dem über die Nutzerschnittstelle (1) nur negative Trainingsbeispiele durch den Nutzer markierbar sind.
5. Verfahren nach einem der Ansprüche 2 oder 4, bei dem über die Nutzerschnittstelle (1) als negative Trainingsbeispiele ferner solche Objekte durch den Nutzer markierbar sind, welche dem spezifischen Objekt entsprechen und von dem echtzeit- fähigen Lernverfahren nicht als spezifisches Objekt eingestuft wurden.
6. Verfahren nach einem der Ansprüche 2 bis 5, bei dem die Anzeige in Schritt a) eine Liste der von dem echtzeitfähigen Lernverfahren identifizierten Objekte enthält.
7. Verfahren nach einem der vorhergehenden Ansprüche, bei dem mit dem Verfahren spezifische Objekte in einer Datenmenge aus einem oder mehreren Videoströmen identifiziert werden.
8. Verfahren nach Anspruch 7, bei dem das spezifische Objekt in dem Videostrom eine Person ist, welche durch ihr äußeres Erscheinungsbild, insbesondere ihre Kleidung und/oder ihre Körpermaße und/oder ihre Körperbewegungen, charakterisiert ist .
9. Verfahren nach einem der vorhergehenden Ansprüche, bei dem das durchgeführte echtzeitfähige Lernverfahren ein On-line- Boosting-Verfahren ist.
10. Vorrichtung zur rechnergestützten Erkennung eines spezi- fischen Objekts aus einer Datenmenge basierend auf einer Interaktion mit einem Nutzers, umfassend: eine Nutzerschnittstelle (1) zur Anzeige einer mit einem echtzeitfähigen Lernverfahren verarbeiteten Datenmenge, wobei ein Nutzer über die Nutzerschnittstelle (1) Trai- ningsbeispiele für das spezifische Objekt in der angezeigten Datenmenge identifizieren kann; eine Recheneinheit (2), welche im Betrieb nach jeder, durch den Nutzer vorgenommenen Identifikation von einem oder mehreren Trainingsbeispielen eine Wissensbasis aktu- alisiert und das echtzeitfähige Lernverfahren durchführt, wobei mit dem echtzeitfähigen Lernverfahren ein Modell zur Identifikation des spezifischen Objekts basierend auf der aktualisierten Wissensbasis gelernt wird, wodurch die verarbeitete Datenmenge erhalten wird, welche durch die Nutzerschnittstelle angezeigt wird.
11. Vorrichtung nach Anspruch 10, welche derart ausgestaltet ist, dass ein Verfahren nach einem der Ansprüche 1 bis 9 mit der Vorrichtung durchführbar ist.
12. Computerprogrammprodukt mit einem auf einem maschinenlesbaren Träger gespeicherten Programmcode zur Durchführung ei- nes Verfahrens nach einem der Ansprüche 1 bis 9, wenn das Programm auf einem Rechner abläuft.
EP09780519A 2008-08-08 2009-07-13 Verfahren zur rechnergestützten erkennung eines spezifischen objekts aus einer datenmenge basierend auf einer interaktion mit einem nutzer Ceased EP2308010A1 (de)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
DE102008037022A DE102008037022A1 (de) 2008-08-08 2008-08-08 Verfahren zur rechnergestützten Erkennung eines spezifischen Objekts aus einer Datenmenge basierend auf einer Interaktion mit einem Nutzer
PCT/EP2009/058930 WO2010015488A1 (de) 2008-08-08 2009-07-13 Verfahren zur rechnergestützten erkennung eines spezifischen objekts aus einer datenmenge basierend auf einer interaktion mit einem nutzer

Publications (1)

Publication Number Publication Date
EP2308010A1 true EP2308010A1 (de) 2011-04-13

Family

ID=41078006

Family Applications (1)

Application Number Title Priority Date Filing Date
EP09780519A Ceased EP2308010A1 (de) 2008-08-08 2009-07-13 Verfahren zur rechnergestützten erkennung eines spezifischen objekts aus einer datenmenge basierend auf einer interaktion mit einem nutzer

Country Status (3)

Country Link
EP (1) EP2308010A1 (de)
DE (1) DE102008037022A1 (de)
WO (1) WO2010015488A1 (de)

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
See references of WO2010015488A1 *

Also Published As

Publication number Publication date
WO2010015488A1 (de) 2010-02-11
DE102008037022A1 (de) 2010-04-08

Similar Documents

Publication Publication Date Title
DE102014210820B4 (de) Verfahren zum Nachweis von großen und Passagierfahrzeugen von festen Kameras
DE112017002821T5 (de) Verfahren, System und Computerprogrammprodukt zur interaktiven Identifizierung von gleichen Personen oder Objekten in Videoaufnahmen
WO2010040668A1 (de) Verfahren und einrichtung zur analyse von umgebungsobjekten und/oder umgebungsszenen, wie zur objekt- und szenenklassensegmentierung
DE102014213408A1 (de) Verfahren zur Ermittlung eines dreidimensionalen Modelldatensatzes eines wenigstens ein Gefäßsegment umfassenden Blutgefäßsystems
DE112022001468B4 (de) Selektives unkenntlichmachen von bildern
DE102011015730A1 (de) Phantombilddatenbank (3D)
EP3029628A1 (de) Verfahren zum Erzeugen eines Trainingsbildes
DE102012218870A1 (de) Verbessertes Erkennen herrenloser Objekte unter Verwendung des Erfassens von Fussgängern
DE112020001625T5 (de) Bildsuchsystem und Bildsuchverfahren
DE112016002275T5 (de) Koordinierte benutzerwortauswahl zum übersetzen und erhalten von kontextinformtionen für das ausgewählte wort
EP2756458A1 (de) Maschinelles lernverfahren zum maschinellen erlernen von erscheinungsformen von objekten in bildern
DE102016124277A1 (de) Verfahren zum Ermitteln und Anzeigen von Produkten auf einer elektronischen Anzeigeeinrichtung
DE102023202598A1 (de) Computerimplementiertes Verfahren und System zum Trainieren eines Lehrernetzwerks eines teilüberwachten Lernalgorithmus
Riedl Unsupervised methods for learning and using semantics of natural language
EP2359308B1 (de) Vorrichtung zur erzeugung und/oder verarbeitung einer objektsignatur, überwachungsvorrichtung, verfahren und computerprogramm
DE102009060687A1 (de) Verfahren und Vorrichtung zum rechnergestützten Annotieren von Multimediadaten
EP2308010A1 (de) Verfahren zur rechnergestützten erkennung eines spezifischen objekts aus einer datenmenge basierend auf einer interaktion mit einem nutzer
EP4435638A1 (de) Computerimplementiertes verfahren zum erkennen eines zustandes eines innenraumes eines öffentlichen verkehrsmittels
DE102022201161A1 (de) Objektklassifizierung mit einem einstufigen metabasierten Objektdetektor unter Verwendung von Klassenprototypen
Al-Behadili et al. Teilüberwachtes Lernen von emblematischen Gesten Semi-supervised learning of emblematic gestures.
EP4250246A1 (de) Computerimplementiertes verfahren zum erkennen eines objektes in einem innenraum eines öffentlichen verkehrsmittels
DE112021005555T5 (de) Multitasking-lernen über gradienteilung zur umfangreichen menschlichen analyse
DE102023202597A1 (de) Computerimplementiertes Verfahren und System zum Trainieren eines Lehrernetzwerks eines teilüberwachten Lernalgorithmus
Villalba Prediction, detection, and correction of misunderstandings in interactive tasks
DE102023203379A1 (de) System und verfahren zur iterativen verfeinerung und kuratierung von bildern auf basis von visuellen vorlagen

Legal Events

Date Code Title Description
PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

17P Request for examination filed

Effective date: 20101217

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO SE SI SK SM TR

AX Request for extension of the european patent

Extension state: AL BA RS

RIN1 Information on inventor provided before grant (corrected)

Inventor name: WINTER, MARTIN

Inventor name: ROTH, PETER, MICHAEL

Inventor name: NGUYEN, THUY

Inventor name: GRABNER, HELMUT

Inventor name: FRUEHSTUECK, BERNHARD

Inventor name: BISCHOF, HORST

Inventor name: BIRCHBAUER, JOSEF, ALOIS

RIN1 Information on inventor provided before grant (corrected)

Inventor name: WINTER, MARTIN

Inventor name: ROTH, PETER, MICHAEL

Inventor name: NGUYEN, THUY

Inventor name: GRABNER, HELMUT

Inventor name: FRUEHSTUECK, BERNHARD

Inventor name: BISCHOF, HORST

Inventor name: BIRCHBAUER, JOSEF, ALOIS

17Q First examination report despatched

Effective date: 20110722

DAX Request for extension of the european patent (deleted)
RIN1 Information on inventor provided before grant (corrected)

Inventor name: WINTER, MARTIN

Inventor name: ROTH, PETER, MICHAEL

Inventor name: NGUYEN, THUY

Inventor name: GRABNER, HELMUT

Inventor name: FRUEHSTUECK, BERNHARD

Inventor name: BISCHOF, HORST

Inventor name: BIRCHBAUER, JOSEF, ALOIS

REG Reference to a national code

Ref country code: DE

Ref legal event code: R003

RIN1 Information on inventor provided before grant (corrected)

Inventor name: WINTER, MARTIN

Inventor name: ROTH, PETER, MICHAEL

Inventor name: NGUYEN, THUY

Inventor name: GRABNER, HELMUT

Inventor name: FRUEHSTUECK, BERNHARD

Inventor name: BISCHOF, HORST

Inventor name: BIRCHBAUER, JOSEF, ALOIS

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION HAS BEEN REFUSED

18R Application refused

Effective date: 20120129