EP4706009A1 - Verfahren und system zur detektion eines objekts - Google Patents
Verfahren und system zur detektion eines objektsInfo
- Publication number
- EP4706009A1 EP4706009A1 EP24733928.6A EP24733928A EP4706009A1 EP 4706009 A1 EP4706009 A1 EP 4706009A1 EP 24733928 A EP24733928 A EP 24733928A EP 4706009 A1 EP4706009 A1 EP 4706009A1
- Authority
- EP
- European Patent Office
- Prior art keywords
- image information
- pixel
- information
- partial
- vehicle
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/20—Image preprocessing
- G06V10/24—Aligning, centring, orientation detection or correction of the image
- G06V10/247—Aligning, centring, orientation detection or correction of the image by affine transforms, e.g. correction due to perspective effects; Quadrilaterals, e.g. trapezoids
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06T—IMAGE DATA PROCESSING OR GENERATION, IN GENERAL
- G06T5/00—Image enhancement or restoration
- G06T5/50—Image enhancement or restoration using two or more images, e.g. averaging or subtraction
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06T—IMAGE DATA PROCESSING OR GENERATION, IN GENERAL
- G06T7/00—Image analysis
- G06T7/30—Determination of transform parameters for the alignment of images, i.e. image registration
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/10—Image acquisition
- G06V10/16—Image acquisition using multiple overlapping images; Image stitching
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/20—Image preprocessing
- G06V10/30—Noise filtering
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/70—Arrangements for image or video recognition or understanding using pattern recognition or machine learning
- G06V10/74—Image or video pattern matching; Proximity measures in feature spaces
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/70—Arrangements for image or video recognition or understanding using pattern recognition or machine learning
- G06V10/77—Processing image or video features in feature spaces; using data integration or data reduction, e.g. principal component analysis [PCA] or independent component analysis [ICA] or self-organising maps [SOM]; Blind source separation
- G06V10/80—Fusion, i.e. combining data from various sources at the sensor level, preprocessing level, feature extraction level or classification level
- G06V10/803—Fusion, i.e. combining data from various sources at the sensor level, preprocessing level, feature extraction level or classification level of input or preprocessed data
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V20/00—Scenes; Scene-specific elements
- G06V20/50—Context or environment of the image
- G06V20/56—Context or environment of the image exterior to a vehicle by using sensors mounted on the vehicle
- G06V20/58—Recognition of moving objects or obstacles, e.g. vehicles or pedestrians; Recognition of traffic objects, e.g. traffic signs, traffic lights or roads
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06T—IMAGE DATA PROCESSING OR GENERATION, IN GENERAL
- G06T2207/00—Indexing scheme for image analysis or image enhancement
- G06T2207/10—Image acquisition modality
- G06T2207/10016—Video; Image sequence
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06T—IMAGE DATA PROCESSING OR GENERATION, IN GENERAL
- G06T2207/00—Indexing scheme for image analysis or image enhancement
- G06T2207/10—Image acquisition modality
- G06T2207/10028—Range image; Depth image; 3D point clouds
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06T—IMAGE DATA PROCESSING OR GENERATION, IN GENERAL
- G06T2207/00—Indexing scheme for image analysis or image enhancement
- G06T2207/20—Special algorithmic details
- G06T2207/20084—Artificial neural networks [ANN]
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06T—IMAGE DATA PROCESSING OR GENERATION, IN GENERAL
- G06T2207/00—Indexing scheme for image analysis or image enhancement
- G06T2207/20—Special algorithmic details
- G06T2207/20212—Image combination
- G06T2207/20221—Image fusion; Image merging
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06T—IMAGE DATA PROCESSING OR GENERATION, IN GENERAL
- G06T2207/00—Indexing scheme for image analysis or image enhancement
- G06T2207/30—Subject of image; Context of image processing
- G06T2207/30248—Vehicle exterior or interior
- G06T2207/30252—Vehicle exterior; Vicinity of vehicle
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/70—Arrangements for image or video recognition or understanding using pattern recognition or machine learning
- G06V10/82—Arrangements for image or video recognition or understanding using pattern recognition or machine learning using neural networks
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- General Physics & Mathematics (AREA)
- Multimedia (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Databases & Information Systems (AREA)
- Computing Systems (AREA)
- Artificial Intelligence (AREA)
- Evolutionary Computation (AREA)
- General Health & Medical Sciences (AREA)
- Medical Informatics (AREA)
- Software Systems (AREA)
- Health & Medical Sciences (AREA)
- Image Processing (AREA)
- Image Analysis (AREA)
Abstract
Die Erfindung betrifft ein Verfahren zur Detektion eines Objekts (O) in Bildinformationen mittels zumindest einer Rechnereinheit (2) eines Fahrzeugs (1).
Description
Verfahren und System zur Detektion eines Objekts
Die Erfindung betrifft ein Verfahren und ein System zur Detektion eines Objekts in einer Sequenz von Bildinformationen, die von bildgebenden Sensoren eines Fahrzeugs bereitgestellt werden.
Es ist grundsätzlich bekannt, mittels bildgebender Sensoren das Umfeld des Fahrzeugs zu erfassen. Beispiele für bildgebende Sensoren sind Monokameras, Stereokameras, aber auch Radar- und Laser-basierte Sensoren (LIDAR).
Für autonome Fahrfunktionen ist es nötig, dass ein Fahrzeug Hindernisse, die sich auf der Fahrbahnoberfläche im Umfeld des Fahrzeugs befinden, erfassen kann. Bei bekannten Verfahren zur Detektion eines Objekts ist es problematisch, kleine Gegenstände, die auf der Fahrbahn liegen, zu erkennen, beispielsweise Reifenteile etc.
Bei der Erkennung von kleinen Gegenständen in den Bildinformationen, die von der bildgebenden Sensorik bereitgestellt werden, liegen die Hauptprobleme im Rauschen und im Kontrast der Bildinformationen. Dies gilt insbesondere bei schlechten Lichtbedingungen. Zur Reduzierung des Rauschens wird häufig die Belichtungszeit vergrößert. Dies führt jedoch dazu, dass aufgrund der Fahrzeugbewegung und/oder der Bewegung des erfassten Objekts unscharfe Bilder entstehen.
Die Verwendung von Bildinformationen mit einem niedrigen Signal- Rausch-Verhältnis bzw. verschwommenen Bildinformationen in bekannten Objekterkennungsalgorithmen führt zu unzureichenden Detektionsergebnissen und damit zu einem für autonome Fahrfunktionen zu ungenauen Umfeldmodell.
Ausgehend hiervon ist es Aufgabe der Erfindung, ein Verfahren zur Detektion eines Objekts in Bildinformationen anzugeben, das eine hinreichend gute Objekterkennung von kleinen Objekten auch bei widrigen Sichtbedingungen ermöglicht.
Die Aufgabe wird durch ein Verfahren mit den Merkmalen des unabhängigen Patentanspruchs 1 gelöst. Bevorzugte Ausführungsformen sind Gegenstand der Unteransprüche. Ein System zur Detektion eines Objekts in Bildinformationen ist Gegenstand des nebengeordneten Patentanspruchs 15.
Gemäß einem ersten Aspekt bezieht sich die Erfindung auf ein Verfahren zur Detektion eines Objekts in Bildinformationen in einem Fahrzeug. Das Fahrzeug weist eine Sensorik zur Erfassung und eine Rechnereinheit zur Verarbeitung der Bildinformationen auf.
Das Verfahren umfasst die folgenden Schritte:
Zunächst werden mehrere zeitlich aufeinanderfolgende Bildinformationen von der Sensorik des Fahrzeugs empfangen. In anderen Worten wird eine Sequenz von zeitlich nacheinander erfassten Bildinformationen empfangen. Die Bildinformationen weisen Information bezüglich mindestens eines Objekts im Umgebungsbereich des Fahrzeugs auf.
Anschließend werden die zeitlich aufeinanderfolgend erfassten Bildinformationen durch die Rechnereinheit verarbeitet.
Dabei können die empfangenen Bildinformationen zumindest partiell relativ zueinander angepasst werden, so dass die Pixel der jeweiligen empfangenen Bildinformationen, die sich auf dieselben Teilbereiche des Objekts beziehen, jeweils an der gleichen örtlichen Position in den Bildinformationen liegen. In anderen Worten werden bei der Verarbeitung zumindest Teile der Bildinformationen in deren Lage und/oder Ausrichtung
derart verändert, dass in den Bildinformationen dargestellten Objektbereiche in den jeweiligen Bildinformationen deckungsgleich oder im Wesentlichen deckungsgleich zu liegen kommen. Durch dieses Anpassen der empfangenen Bildinformationen wird ein Satz von angepassten Bildinformationen erzeugt.
Alternativ oder zusätzlich kann die Verarbeitung der Bildinformationen ein Ermitteln von Pixelkorrespondenzen zwischen Bildteilinformationen, die in den mehreren Bildinformationen enthalten sind und die sich auf dieselben Teilbereiche des Objekts beziehen, umfassen. In anderen Worten wird pixelweise ermittelt, ob ein in ersten Bildinformationen dargestelltes Pixel, das sich auf einen bestimmten Teilbereich eines Objekts bezieht, mit einem Pixel zweiten Bildinformationen korrespondiert, d.h. den selben Teilbereich des Objekts darstellt. Die korrespondierenden Pixel können aufgrund der Relativbewegung zwischen Fahrzeug und Objekt eine unterschiedliche Position in dem digitalen Bild haben.
Anschließend werden die angepassten Bildinformationen (d.h. der Satz von angepassten Bildinformationen) oder die Bildteilinformationen, die Pixelkorrespondenzen aufweisen, pixelweise zusammengeführt. Dadurch werden aggregierte Bildinformationen gebildet. Das pixelweise Zusammenführen umfasst ein Sammeln und Verarbeiten der Pixelinformationen der jeweiligen Pixel, die an der gleichen örtlichen Position in den angepassten Bildinformationen liegen oder die Pixelkorrespondenzen aufweisen, jeweils zu einer pixelweisen Gesamtinformation. In anderen Worten wird beispielsweise aus den Farb- und/oder Helligkeitsinformationen der jeweiligen Pixel, die in den angepassten Bildinformationen jeweils an der gleichen Position liegen (korrespondierende x-y-Position bei 2D-Bildern oder korrespondierende x- y-z-Position bei 3D-Bildern) eine Gesamtinformation berechnet und diese Gesamtinformation bildet die Färb- und/oder Helligkeitsinformation des entsprechenden Pixels der aggregierten Bildinformationen. In dem Fall, dass die ermittelten Pixelkorrespondenzen zum Zusammenführen
verwendet werden, wird aus den Färb- und/oder Helligkeitsinformationen der Pixel, die in zu unterschiedlichen Zeitpunkten erfassten Bildinformationen enthalten sind und zu denen Pixelkorrespondenzen ermittelt wurden, eine Gesamtinformation berechnet und diese Gesamtinformation bildet die Färb- und/oder Helligkeitsinformation eines Pixels der aggregierten Bildinformationen.
Zuletzt wird die Lage zumindest eines Objekts in den aggregierten Bildinformationen detektiert. Hierzu kann beispielsweise ein Objekterkennungsalgorithmus verwendet werden. Vorzugsweise wird zusätzlich zur Lage auch die Ausdehnung des Objekts und/oder die Höhe des Objekts (d.h. die in Bezug auf die Fahrbahnoberfläche gemessene Höhe) bestimmt.
Der technische Vorteil des vorgeschlagenen Verfahrens besteht darin, dass trotz der Bewegung des Fahrzeugs und/oder des Objekts ein Zusammenführen mehrerer zu unterschiedlichen Zeitpunkten erfasster Bildinformationen zu einem Gesamtbild ermöglicht wird, bei dem die Rauscheffekte im Vergleich zu den einzelnen Bildinformationen reduziert sind und bei dem der Bildkontrast erhalten bleibt, da bei dem erfindungsgemäßen Zusammenführen der Bildinformationen zumindest weitestgehend ein Verwischen der Objektkanten vermieden wird.
Gemäß einem Ausführungsbeispiel umfasst das zumindest partielle Anpassen der empfangenen Bildinformationen relativ zueinander eine Verschiebung, ein Skalieren und/oder ein Verdrehen der Bildinformationen um zumindest eine Bildachse. In anderen Worten werden entweder Teile der Bildinformationen oder das Gesamtbild derart verschoben, skaliert und/oder verdreht, dass zumindest die objektrelevanten Bildbereiche in dem Satz von angepassten Bildinformationen lagegenau zueinander zu liegen kommen und damit beim Zusammenführen der angepassten Bildinformationen lagegenau aggregiert werden. Dadurch wird erreicht,
dass die durch die Relativbewegung zwischen dem Fahrzeug und dem erfassten Objekt entstehenden Bildveränderungen kompensiert werden und damit eine Überlagerung der angepassten Bildinformationen möglich ist, ohne dass die resultierenden aggregierten Bildinformationen unscharf sind.
Gemäß einem Ausführungsbeispiel erfolgt die Ermittlung von Pixelkorrespondenzen zwischen Bildteilinformationen mittels eines Pixel- Matching-Algorithmus. Dieser Algorithmus ist dazu ausgebildet, zu erkennen, welche Pixel in der Sequenz von empfangenen Bildinformationen sich jeweils auf gleiche Objektbereiche beziehen. Diese durch den Pixel-Matching-Algorithmus ermittelten Zusammenhänge können beim Zusammenführen der Bildinformationen verwendet werden, dass Informationen von Pixeln, die sich auf gleiche Objektbereiche beziehen, aggregiert werden.
Gemäß einem Ausführungsbeispiel erfolgt die Ermittlung von Pixelkorrespondenzen zwischen Bildteilinformationen mittels eines künstlichen neuronalen Netzes. Dieses künstliche neuronale Netz ist dazu trainiert, Pixel in der Sequenz von empfangenen Bildinformationen zu erkennen, die sich auf gleiche Objektbereiche beziehen. Alternativ kann die Ermittlung von Pixelkorrespondenzen auch durch ein rekurrentes Netz, ein Hyper-Permutations-Netz oder ein Transformer-Netz erreicht werden.
Gemäß einem Ausführungsbeispiel umfasst das Fahrzeug einen Fahrzeugeigenbewegungs-Schätzer. Die Ausgangsinformationen des Fahrzeugeigenbewegungs-Schätzers werden zum zumindest partiellen Anpassen der empfangenen Bildinformationen und/oder zur Ermittlung von Pixelkorrespondenzen zwischen den empfangenen Bildinformationen verwendet. Der Fahrzeugeigenbewegungs-Schätzer stellt beispielsweise Ausgangsinformationen in Form der zukünftigen Bewegungsrichtung des Fahrzeugs, des zukünftigen Rollwinkels, des zukünftigen Nickwinkels und
des zukünftigen Gierwinkels bereit. In anderen Worten kann der Fahrzeugeigenbewegungs-Schätzer eine Voraussage treffen, welche Position das Fahrzeug zu einem zukünftigen Zeitpunkt einnehmen wird. Diese Informationen können vorteilhaft zur Anpassung der empfangenen Bildinformationen und/oder zur Ermittlung von Pixelkorrespondenzen verwendet werden.
Gemäß einem Ausführungsbeispiel umfasst das Fahrzeug zumindest eine Steuereinheit, die Objektbewegungsinformationen, die Angaben zur Bewegung des mindestens einen Objekts enthalten, bereitstellt. In anderen Worten wird durch die Steuereinheit eine Ausgangsinformation bereitgestellt, die angibt oder aus der abgeleitet werden kann, wo sich ein Objekt zukünftig befindet. Die Objektbewegungsinformationen können zum zumindest partiellen Anpassen der empfangenen Bildinformationen und/oder zur Ermittlung von Pixelkorrespondenzen zwischen den empfangenen Bildinformationen verwendet werden. Anhand Objektbewegungsinformationen kann nämlich ermittelt werden, an welcher Position in den Bildinformationen sich das bewegte Objekt zukünftig befinden wird, was vorteilhaft für das Anpassen der empfangenen Bildinformationen und/oder für die Ermittlung von Pixelkorrespondenzen zwischen den empfangenen Bildinformationen ist.
Gemäß einem Ausführungsbeispiel wird das Verfahren rekursiv in aufeinanderfolgenden Zyklen vollzogen, wobei eine in einem vorhergehenden Zyklus detektierte Lage eines Objekts in den aggregierten Bildinformationen in einem nachfolgenden Zyklus dazu verwendet wird, relevante Bildteilinformationen zu definieren, in Bezug auf die die zeitlich aufeinanderfolgenden Bildinformationen anzugleichen sind oder zu denen Pixelkorrespondenzen zu ermitteln sind. Damit kann der Rechenaufwand zur Anpassung der Sequenz von Bildinformationen und/oder zur Ermittlung von Pixelkorrespondenzen zwischen den Bildinformationen entscheidend reduziert werden.
Gemäß einem Ausführungsbeispiel sind die Bildinformationen dreidimensionale (3D) Bildinformationen. Das zumindest partielle Anpassen der empfangenen Bildinformationen und/oder das Ermitteln der Pixelkorrespondenzen zwischen den empfangenen Bildinformationen erfolgt entlang drei Dimensionen im Raum. Damit ist mittels des vorgeschlagenen Verfahrens möglich, die Objekterfassung in dreidimensionalen Bildinformationen zu verbessern.
Gemäß einem Ausführungsbeispiel wird basierend auf Bewegungsunschärfe-Artefakten, die durch die Bewegung des zu detektierenden Objekts in den zeitlich aufeinanderfolgenden Bildinformationen entstehen, die Bewegungsrichtung und/oder die Bewegungsgeschwindigkeit des Objekts bestimmt. Die Bewegungsrichtung und/oder die Bewegungsgeschwindigkeit des Objekts wird anschließend zum zumindest partiellen Anpassen der empfangenen Bildinformationen und/oder zum Ermitteln der Pixelkorrespondenzen zwischen den empfangenen Bildinformationen verwendet. Dadurch kann aus der Sequenz der empfangenen Bildinformationen selbst die Bewegungsrichtung des Objekts abgeleitet und zur Bildverarbeitung verwendet werden, um eine Bildunschärfe, die durch die Bewegung des Objekts entsteht, zu vermeiden oder zu reduzieren.
Gemäß einem Ausführungsbeispiel erfolgt das zumindest partielle Anpassen der empfangenen Bildinformationen relativ zueinander rekursiv in mehreren aufeinander folgenden Teilschritten. Die Anpassung der Bildinformationen erfolgt damit schrittweise, wobei in den Teilschritten jeweils Teilanpassungen der Bildinformationen vorgenommen werden, die nacheinander vollzogen, eine finale Anpassung der Bildinformationen bewirken. So kann beispielsweise in den Teilschritten jeweils eine Teilverschiebung, eine Teilskalierung oder eine teilweise Verdrehung der Bildinformationen vorgenommen werden. Dadurch kann die final
resultierende Anpassung der empfangenen Bildinformationen verbessert werden.
Gemäß einem Ausführungsbeispiel umfasst das pixelweise Zusammenführen der angepassten Bildinformationen oder der Bildteilinformationen und/oder das pixelweise Zusammenführen der Bildteilinformationen, die Pixelkorrespondenzen aufweisen, zumindest ein Aufsummieren der pixelbezogenen Helligkeitsinformationen und/oder Farbinformationen. Aufgrund der zumindest partiellen Anpassung der Bildinformationen und/oder der Nutzung der Pixelkorrespondenzen werden damit die Helligkeitsinformationen und/oder Farbinformationen, die sich auf Objektbereiche beziehen, verstärkt, wohingegen statistische Rauscheffekte keiner Verstärkung unterliegen, da die Bildanpassung diese nicht deckungsgleich überlagert bzw. zu den verrauschten Pixeln keine Pixelkorrespondenzen ermittelt werden. Dies führt zu aggregierten Bildinformationen mit einem verringerten Rauschen und einem hohen Kontrast trotz der Relativbewegung zwischen dem Fahrzeug und dem zu detektierenden Objekt.
Gemäß einem Ausführungsbeispiel umfasst das pixelweise Zusammenführen der angepassten Bildinformationen oder der Bildteilinformationen und/oder das pixelweise Zusammenführen der Bildteilinformationen, die Pixelkorrespondenzen aufweisen, zumindest eine Mittelwertbildung der pixelbezogenen Helligkeitsinformationen und/oder Farbinformationen. Dadurch können aggregierte Bildinformationen erreicht werden, die unabhängig sind von der Anzahl der in der Sequenz vorhandenen und damit zusammengeführten Bildinformationen.
Gemäß einem Ausführungsbeispiel umfasst die Sensorik zumindest eine Kamera, zumindest eine Stereokamera, zumindest einen Radarsensor und/oder zumindest einen LIDAR-Sensor. Die Bildinformationen können
von einem einzigen Sensor bereitgestellt werden. Alternativ können die Bildinformationen auch durch eine Fusion von Bildern mehrerer Sensoren bzw. mehrerer unterschiedlicher Sensortypen (z.B. Kamera und Radarsensor) gebildet sein.
Gemäß einem Ausführungsbeispiel umfasst die Sensorik zumindest eine Kamera oder eine Stereokamera. Das zumindest partielle Anpassen der empfangenen Bildinformationen und/oder das Ermitteln von Pixelkorrespondenzen zwischen Bildteilinformationen erfolgt unter Berücksichtigung von Kalibrierungsparametern der zumindest einen Kamera oder Stereokamera. Damit können Kalibrierungsungenauigkeiten, die einen Einfluss auf die Sequenz von Bildinformationen haben, ausgeglichen werden.
Gemäß einem weiteren Aspekt betrifft die Erfindung ein System zur Detektion von Objekten in Bildinformationen mittels zumindest einer Rechnereinheit eines Fahrzeugs. Das Fahrzeug umfasst eine Sensorik zur Ermittlung von Bildinformationen. Die Rechnereinheit ist dazu konfiguriert, die folgenden Schritte zu vollziehen:
- Empfangen mehrerer zeitlich aufeinanderfolgender Bildinformationen von einer Sensorik des Fahrzeugs, wobei die Bildinformationen Information bezüglich mindestens eines Objekts im Umgebungsbereich des Fahrzeugs aufweisen;
- Verarbeiten der zeitlich aufeinanderfolgenden Bildinformationen umfassend: o ein zumindest partielles Anpassen der empfangenen Bildinformationen relativ zueinander, so dass die Pixel der jeweiligen empfangenen Bildinformationen, die sich auf dieselben Teilbereiche des Objekts beziehen, jeweils an der gleichen örtlichen Position in den Bildinformationen liegen, wodurch ein Satz von angepassten Bildinformationen gebildet wird; und/oder
o eine Ermittlung von Pixelkorrespondenzen zwischen Bildteilinformationen, die in den mehreren Bildinformationen enthalten sind und die sich auf dieselben Teilbereiche des Objekts beziehen;
- Pixelweises Zusammenführen der angepassten Bildinformationen oder der Pixelkorrespondenzen aufweisenden Bildteilinformationen, wodurch aggregierte Bildinformationen entstehen, wobei das pixelweise Zusammenführen ein Sammeln und Verarbeiten der Pixelinformationen der jeweiligen Pixel, die an der gleichen örtlichen Position in den angepassten Bildinformationen liegen oder die Pixelkorrespondenzen aufweisen, jeweils zu einer pixelweisen Gesamtinformation umfasst;
- Detektieren der Lage zumindest eines Objekts in den aggregierten Bildinformationen.
Unter „Bildinformationen“ im Sinne der vorliegenden Offenbarung werden jegliche Informationen verstanden, basierend auf denen eine Darstellung der Fahrzeugumgebung erfolgen kann. Dies sind insbesondere digitale, pixelbasierte Bilder, die von bildgebenden Sensoren, beispielsweise einer Monokamera, einer Stereokamera, einem RADAR-Sensor oder einem LIDAR-Sensor bereitgestellt werden.
Die Ausdrücke „näherungsweise“, „im Wesentlichen“ oder „etwa“ bedeuten im Sinne der Erfindung Abweichungen vom jeweils exakten Wert um +/- 10%, bevorzugt um +/- 5% und/oder Abweichungen in Form von für die Funktion unbedeutenden Änderungen.
Weiterbildungen, Vorteile und Anwendungsmöglichkeiten der Erfindung ergeben sich auch aus der nachfolgenden Beschreibung von Ausführungsbeispielen und aus den Figuren. Dabei sind alle beschriebenen und/oder bildlich dargestellten Merkmale für sich oder in
beliebiger Kombination grundsätzlich Gegenstand der Erfindung, unabhängig von ihrer Zusammenfassung in den Ansprüchen oder deren Rückbeziehung. Auch wird der Inhalt der Ansprüche zu einem Bestandteil der Beschreibung gemacht.
Die Erfindung wird im Folgenden anhand der Figuren an Ausführungsbeispielen näher erläutert. Es zeigen:
Fig. 1 beispielhaft eine schematische Darstellung eines Fahrzeugs mit einer Sensorik, das zur Erfassung von Objekten im Umgebungsbereich vor dem Fahrzeug ausgebildet ist;
Fig. 2 beispielhaft eine schematische Darstellung eines Systems zur Detektion von Objekten aus einer Sequenz von Bildinformationen;
Fig. 3 beispielhaft eine schematische Darstellung, die die Detektion von Objekten aus einer Sequenz von Bildinformationen verdeutlicht; und
Fig. 4 beispielhaft ein Ablaufdiagramm zur Verdeutlichung der Schritte eines Verfahrens zur Detektion eines Objekts um Umgebungsbereich eines Fahrzeugs.
Figur 1 zeigt beispielhaft ein Fahrzeug 1 , das mit einer Rechnereinheit 2 und einer Sensorik 3 zur Erfassung und Detektion eines Objekts 0 im Umgebungsbereich des Fahrzeugs 1 ausgestattet ist. Die Sensorik 3 kann einen oder mehrere Sensoren umfassen. Zudem kann die Sensorik gleiche oder unterschiedliche Sensortypen umfassen, wobei die Sensortypen beispielsweise eine Kamera (insbesondere Mono-Kamera), eine Stereokamera, einen Radarsensor und/oder einen LIDAR-Sensor sein können. Ferner kann das Fahrzeug 1 einen Fahrzeugeigenbewegungsschätzer 4 aufweisen. Der
Fahrzeugeigenbewegungsschätzer 4 ist zur Schätzung der Eigenbewegung des Fahrzeugs ausgebildet. Die Schätzung der Eigenbewegung des Fahrzeugs 1 kann basierend auf Informationen einer Odometrieeinheit des Fahrzeugs 1 erfolgen. Alternativ oder zusätzlich kann die Eigenbewegung des Fahrzeugs durch ein Tracking von Bildern einer Kamera oder anderen Eigenbewegungs-Schätzmethoden bestimmt werden.
Fig. 2 zeigt ein Blockdiagramm, das die Struktur eines System zur Detektion eines Objekts 0 basierend auf einer Bildsequenz zeitlich nacheinander aufgenommener Bildinformationen B1 , ... , Bn verdeutlicht, wobei n eine natürliche Zahl ist uns n > 2 gilt.
Zunächst werden mehrere zu unterschiedlichen Zeitpunkten aufgenommene Bildinformationen B1 , ... , Bn empfangen. In anderen Worten wird eine Bildsequenz empfangen, die zeitlich gestaffelt erfasste Bildinformationen B1 , ... , Bn enthält. Die Bildinformationen B1 , ... , Bn können beispielsweise Einzelbilder eines bildgebenden Sensors sein und pixelbezogene Färb- und/oder Helligkeitsinformationen umfassen. Diese Bildinformationen B1 , ... , Bn können von einem einzigen Sensor der Sensorik 3 stammen oder aus einer Fusion von Informationen mehrerer Sensoren gebildet sein. Die Sensoren können den gleichen Sensortyp oder unterschiedliche Sensortypen haben.
Die empfangenen Bildinformationen B1 , ... , Bn werden einer Bildverarbeitungseinheit 10 zugeführt.
Gemäß einem ersten Ausführungsbeispiel ist die Bildverarbeitungseinheit 10 dazu ausgebildet, die empfangenen Bildinformationen B1 , ... , Bn zumindest partiell anzupassen, d.h. es erfolgt entweder eine Anpassung der gesamten Bilder relativ zueinander oder eine relative Anpassung von Teilinformationen der jeweiligen empfangenen Bildinformationen B1 , ... ,
Bn. Unter „Anpassung“ wird hier eine zweidimensionale oder dreidimensionale Lageangleichung der gesamten Bildinformationen B1 ,
Bn oder Teilen dieser Bildinformationen relativ zueinander verstanden, und zwar derart, dass nach der Anpassung die Pixel der jeweiligen Bildinformationen B1 , ... , Bn, die sich auf gleiche Objektbereiche beziehen, jeweils an der gleichen Position in den Bildinformationen B1 , ... , Bn zu liegen kommen. In anderen Worten würden damit nach dem Anpassen gleiche Objektbereiche des Objekts, deckungsgleich in den angepassten Bildinformationen zu liegen kommen. Das Anpassen der Bildinformationen kann beispielsweise durch ein translatorisches Verschieben der Bildinformationen B1 , ... , Bn relativ zueinander, ein Skalieren (d.h. ein Vergrößern oder Verkleinern) der Bildinformationen B1 , ... , Bn relativ zueinander, ein Verdrehen der Bildinformationen um eine oder mehrere Achsen eines kartesischen Bildkoordinatensystems (d.h. ein Verändern abhängig vom Roll-, Nick-, und/oder Gier-Winkel des Fahrzeugs) umfassen. Dadurch können zumindest teilweise Veränderungen in den zeitlich aufeinanderfolgenden Bildinformationen, die aufgrund der Relativbewegung des Fahrzeugs und des Objekts entstehen, behoben oder vermindert werden.
Alternativ zu einer Anpassung der gesamten Bildinformationen der zeitlich nacheinander empfangenen Bildinformationen können in einem weiteren Ausführungsbeispiel der Erfindung die empfangenen Bildinformationen durch die Bildverarbeitungseinheit 10 auch lediglich in Bezug auf Bildteilinformationen angepasst werden. Unter „Bildteilinformationen“ werden Informationen verstanden, die sich lediglich auf einen Teil eines Bildes beziehen. So können die zeitlich nacheinander empfangenen Bildinformationen beispielsweise objektbezogen angepasst werden, d.h. die Bereiche der empfangenen Bildinformationen, die sich jeweils auf ein Objekt beziehen, werden derart relativ zueinander angepasst, dass die Pixel der sich auf das jeweilige Objekt beziehenden Sequenz von Bildteilinformationen lagerichtig zusammengeführt werden können. Auch
hier kann das Anpassen der Bildteilinformationen ein translatorisches Verschieben der Bildteilinformationen relativ zueinander, ein Skalieren (d.h. ein Vergrößern oder Verkleinern) der Bildteilinformationen relativ zueinander oder ein Verdrehen der Bildinformationen um eine oder mehrere Achsen eines kartesischen Bildkoordinatensystems (d.h. ein Verändern der Bildinformationenabhängig vom Roll-, Nick-, und/oder Gier- Winkel des Fahrzeugs) umfassen. Dadurch kann beispielsweise erreicht werden, dass die Bildteilinformationen eines Objekts, das durch das Annähern des Fahrzeugs auf den empfangenen Bildinformationen zunehmend größer wird, derart verkleinert wird, dass die sich auf das Objekt beziehenden Bildteilinformationen in den zusammenzuführenden angepassten Bildinformationen jeweils die gleiche Größe haben.
Die zumindest partielle Anpassung der Sequenz von Bildinformationen relativ zueinander kann in einem einzigen Schritt vollzogen werden. Alternativ kann die zumindest partielle Anpassung iterativ in mehreren Teilschritten erfolgen, d.h. in einzelnen Teilschritten wird jeweils eine teilweise Anpassung vollzogen bis nach mehreren Teilschritten eine finale Anpassung erreicht wurde.
In einem weiteren alternativen Ausführungsbeispiel kann die Bildverarbeitungseinheit 10 dazu ausgebildet sein, in der empfangenen Sequenz von Bildinformationen Pixelkorrespondenzen zu ermitteln. Die Pixelkorrespondenzen geben dabei an, welche Pixel der empfangenen Bildinformationen sich auf gleiche Bildinhalte und/oder Objektbereiche beziehen. So kann sich beispielsweise eine Pixelkorrespondenz auf eine Ecke eines Objekts beziehen und angeben, welche Pixel in den empfangenen Bildinformationen sich jeweils auf diese Ecke des Objekts beziehen. Die Pixelkorrespondenzen können für die gesamten empfangenen Bildinformationen oder lediglich für Bildteilbereiche bestimmt werden, insbesondere für einen Bildteilbereich, der sich auf ein
Objekt bezieht, das in sämtlichen empfangenen Bildinformationen enthalten ist.
Die Bildverarbeitungseinheit 10 kann ein künstliches neuronales Netz, insbesondere ein faltendes neuronales Netz (CNN), ein rekurrentes Netz, ein Hyper-Permutations-Netz oder ein Transformer-Netz zur Anpassung der empfangenen Bildinformationen, zur Anpassung der Bildteilinformationen und/oder zur Ermittlung der Pixelkorrespondenzen zwischen den empfangenen Bildinformationen aufweisen.
Das in Fig. 2 gezeigte System umfasst zudem eine Zusammenführungseinheit 11. Die von der Bildverarbeitungseinheit 10 bereitgestellten angepassten Bildinformationen oder Pixelkorrespondenzen zu den empfangenen Bildinformationen werden von dieser Zusammenführungseinheit 11 empfangen.
Die Zusammenführungseinheit 11 ist dazu ausgebildet, die angepassten Bildinformationen, d.h. die Bildinformationen, die zumindest partiell in Bezug auf deren Lage der Pixel relativ zueinander angepasst wurden, pixelbezogen zusammenzuführen und/oder zu aggregieren. Dadurch entstehen aggregierte Bildinformationen. Unter „Zusammenführen und/oder Aggregieren“ wird insbesondere ein Integrieren oder eine Mittelwertbildung der pixelbezogenen Färb- und/oder Helligkeitsinformationen verstanden. Alternativ könnte das „Zusammenführen und/oder Aggregieren“ durch eine gewichtete Summenbildung mit unterschiedlichen Gewichtungsfaktoren erfolgen, beispielsweise mittels eines Exponential-Filters. Beispielsweise könnten die Gewichtungsfaktoren derart gewählt werden, dass zeitlich aktuellere pixelbezogene Färb- und/oder Helligkeitsinformationen stärker gewichtet werden als zeitlich weiter zurückliegende pixelbezogene Färb- und/oder Helligkeitsinformationen. Durch das Zusammenführen der angepassten Bildinformationen, bei denen die Bildveränderungen, die durch die
Relativbewegung des Fahrzeugs zur Umgebung entstehen, kompensiert wurden, addieren sich die Färb- und/oder Helligkeitsinformationen von Pixeln, die beispielsweise einen Objektbereich darstellen, auf, wodurch diese Objektbereiche in den aggregierten Bildinformationen verstärkt erkennbar sind. Im Unterschied dazu werden Rauscheffekte, die statistisch verteilt in den Bildinformationen enthalten sind und daher in den angepassten Bildinformationen nicht lagemäßig angepasst wurden, nicht kumuliert und werden daher in den aggregierten Bildinformationen nicht verstärkt.
Für den Fall, dass die Bildverarbeitungseinheit 10 Informationen zu Pixelkorrespondenzen zwischen den Bildinformationen B1 , ... , Bn bereitstellt, kann die Zusammenführungseinheit 11 die Färb- und/oder Helligkeitsinformationen der Pixel der Bildinformationen B1 , ... , Bn, zu denen Pixelkorrespondenzen ermittelt wurden, zusammenführen. Unter „Zusammenführen und/oder Aggregieren“ wird auch hier insbesondere ein Integrieren oder eine Mittelwertbildung der pixelbezogenen Färb- und/oder Helligkeitsinformationen verstanden. Alternativ könnte das „Zusammenführen und/oder Aggregieren“ durch eine gewichtete Summenbildung mit unterschiedlichen Gewichtungsfaktoren erfolgen, beispielsweise mittels eines Exponential-Filters. Beispielsweise könnten die Gewichtungsfaktoren derart gewählt werden, dass zeitlich aktuellere pixelbezogene Färb- und/oder Helligkeitsinformationen stärker gewichtet werden als zeitlich weiter zurückliegende pixelbezogene Färb- und/oder Helligkeitsinformationen. Damit können korrespondierende Bildteilinformationen auf Pixelebene aggregiert werden, wodurch aggregierte Bildinformationen entstehen. Da durch die Bildverarbeitungseinheit 10 Pixelkorrespondenzen insbesondere zu Objekten bzw. Objektbereichen erkannt werden, die in den zeitlich aufeinanderfolgenden Bildinformationen B1 , ... , Bn jeweils enthalten sind, jedoch aufgrund der Relativbewegung des Fahrzeugs in Bezug auf das Objekt an unterschiedlicher Position, in unterschiedlicher Größe und ggf.
in anderer Ausrichtung, können durch die Berücksichtigung der Pixelkorrespondenzen diejenigen Bildteilinformationen auf Pixelebene zusammengeführt werden, die sich jeweils auf gleiche Objektbereiche beziehen. Damit sind diese Objektbereiche in den aggregierten Bildinformationen verstärkt erkennbar und statistisch verteilte Rauscheffekte der Bildinformationen B1 , ... , Bn werden nicht verstärkt.
Die von der Zusammenführungseinheit 11 bereitgestellten aggregierten Bildinformationen werden von einer Detektionseinheit 12 empfangen. Die Detektionseinheit 12 ist dazu ausgebildet, in den aggregierten Bildinformationen ein oder mehrere Objekte zu detektieren. Beispielsweise kann die Detektionseinheit 12 einen Objekterkennungsalgorithmus implementieren, der in den aggregierten Bildinformationen Objekte erkennt und kennzeichnet.
Zudem kann die Detektionseinheit 12 dazu ausgebildet sein, die Position und Größe des Objekts zu schätzen. Diese Schätzung kann eine zweidimensionale oder dreidimensionale Schätzung im Raum sein. Als Ergebnis dieser Schätzung kann beispielsweise ein Begrenzungsrahmen (sog. bounding box) erzeugt werden, die die Größe und Position des Objekts in der Ebene (2D) oder im Raum (3D) angibt. Die Informationen zur Position und/oder Größe eines Objekts kann in den nachfolgenden Anpassungsschritten dazu verwendet werden, um zu ermitteln, in Bezug auf welche Bereiche der Bildinformationen insbesondere eine Anpassung zu erfolgen hat bzw. zu welchen Bereichen der Bildinformationen insbesondere Pixelkorrespondenzen zu ermitteln sind.
Die Detektionseinheit 12 kann zudem eine Tracking-Information zu einem Objekt bereitstellen, die angibt, welche Position das Objekt zukünftig in der Ebene (2D) oder im Raum (3D) einnehmen wird. Diese Information kann für das zumindest partielle Anpassen von neu empfangenen Bildinformationen genutzt werden. Die Tracking-Information kann hierzu
an die Bildverarbeitungseinheit 10 übermittelt werden, so dass diese basierend auf der Tracking-Information den Anpassungsvorgang vornehmen kann. Dadurch wird eine verbesserte objektbezogene Bildanpassung erreicht.
Fig. 3 zeigt schematisch die Erzeugung von aggregierten Bildinformationen basierend auf einer beispielhaften Bildsequenz eines Umgebungsbereichs eines Fahrzeugs und die daran anschließende Detektion von Objekten basierend auf den aggregierten Bildinformationen.
Im vorliegenden Fall werden eine Sequenz von Bildinformationen B und eine Sequenz von Abstandsinformationen T zu diesen Bildinformationen B empfangen. Die Bildinformationen B sind beispielsweise digitale Bilder, die pixelbezogene Färb- und/oder Helligkeitsinformationen enthalten. Jedem digitalen Bild ist ein Satz von Abstandsinformationen T zugeordnet, wobei der Satz von Abstandsinformationen T den Pixeln des digitalen Bildes jeweils eine Tiefeninformation zuordnet. Diese Tiefeninformation gibt an, wie weit ein auf dem Pixel des digitalen Bildes dargestellter Umgebungsbereich von einem Bezugspunkt der Sensorik oder des Fahrzeugs entfernt ist.
Nach dem Empfang der Sequenz von Bildinformationen B und der Sequenz von Abstandsinformationen T werden die Bildinformationen entweder partiell angepasst oder die Pixelkorrespondenzen zwischen den einzelnen aufeinanderfolgenden Bildinformationen ermittelt. Eine entsprechende Anpassung wird auch bei den Abstandsinformationen T vorgenommen, d.h. eine translatorische Verschiebung, Skalierung und/oder Verdrehung der Bildinformationen wird in gleicher weise auf die zugehörigen Abstandsinformationen angewandt, so dass auch nach der Anpassung die Zuordnung der Abstandsinformationen zu den Bildinformationen erhalten bleibt.
Für den Fall, dass Pixelkorrespondenzen zwischen den einzelnen aufeinanderfolgenden Bildinformationen ermittelt werden, werden die entsprechenden Pixelkorrespondenzen auch auf die zeitlich aufeinanderfolgenden Abstandsinformationen T angewendet.
Anschließend erfolgt, wie vorbeschrieben, das pixelweise Zusammenführen der angepassten Bildinformationen sowie der Abstandsinformationen, die den Bildinformationen zugeordnet sind. Insbesondere werden die den jeweiligen Pixeln zugeordneten Farb- und/oder Helligkeitsinformationen aufaddiert bzw. integriert.
Beispielsweise kann eine Mittelwertbildung der pixelbezogenen Farb- und/oder Helligkeitsinformationen erfolgen. Dadurch entstehen aggregierte Bildinformationen. In gleicher weise können die zeitlich nacheinander empfangenen, pixelbezogenen Abstandsinformationen aufaddiert bzw. integriert und vorzugsweise auch gemittelt werden. Dadurch entstehen aggregierte Abstandsinformationen.
Durch das Kombinieren der aggregierten Bildinformationen und der aggregierten Abstandsinformationen entsteht eine aggregierte dreidimensionale Repräsentation des erfassten Umgebungsbereichs, in dem die Objekte verbessert erkennbar sind, die Rauscheffekte hingegen unterdrückt sind.
Basierend auf dieser aggregierten dreidimensionalen Repräsentation kann die Objektdetektion erfolgen. Insbesondere können den Objekten dreidimensionale Begrenzungsrahmen zugeordnet werden, die die Größe und Position des Objekts im Raum repräsentieren.
Es versteht sich, dass das zuvor basierend auf Fig. 3 beschriebene
Verfahren auch mit reinen 2D-Bildinformationen, d.h. ohne Abstandsinformationen vollzogen werden kann.
Die verarbeiteten Bildinformationen können von einem einzelnen Sensor stammen oder aus einer Fusion von Bildinformationen mehrerer Sensoren und/oder einer Fusion von Bildinformationen unterschiedlicher Sensortypen.
Das vorbeschriebene Verfahren zur Detektion eines Objekts kann iterativ vollzogen werden. Dabei wird nach einem Empfang mehrerer Bildinformationen (z.B. in Form von n digitalen Bildern, wobei n eine natürliche Zahl ist) zunächst eine vorbeschriebene Bildverarbeitung mittels der Bildverarbeitungseinheit 10, eine Zusammenführung der Bildinformationen zu einer aggregierten Bildinformation und die Objektdetektion basierend auf der aggregierten Bildinformation vollzogen. Dieser Vorgang wird vorzugsweise nach dem Empfang einer weiteren Bildinformation wiederholt, und zwar derart, dass die älteste Bildinformation des im vorherigen Iterationsschritt verarbeiteten Satzes von Bildinformationen verworfen und durch die neu empfangene Bildinformation ersetzt wird. Die Verarbeitung erfolgt damit vorzugsweise gemäß dem sog. FIFO-Prinzip (first in - first out).
Fig. 4 zeigt ein Diagramm, das die Schritte eines Verfahrens zur Detektion eines Objekts basierend auf einer Sequenz von Bildinformationen illustriert.
Zunächst werden mehrere zeitlich aufeinanderfolgende Bildinformationen von einer Sensorik des Fahrzeugs empfangen. Die Bildinformationen enthalten Informationen bezüglich mindestens eines Objekts im Umgebungsbereich des Fahrzeugs. Die Bildinformationen wurden zu unterschiedlichen Zeitpunkten aufgenommen, so dass diese Bildinformationen aufgrund der Bewegung des Fahrzeugs und/oder eines Objekts, das in den Bildinformationen dargestellt ist, Unterschiede aufweisen (S10).
Anschließend werden die zeitlich aufeinanderfolgenden Bildinformationen verarbeitet.
Dieses Verarbeiten kann einerseits ein zumindest partielles Anpassen der empfangenen Bildinformationen relativ zueinander umfassen, so dass die Pixel der jeweiligen empfangenen Bildinformationen, die sich auf dieselben Teilbereiche des Objekts beziehen, jeweils an der gleichen örtlichen Position in den Bildinformationen liegen, wodurch ein Satz von angepassten Bildinformationen gebildet wird.
Alternativ oder zusätzlich kann das Verarbeiten ein Ermitteln von Pixelkorrespondenzen zwischen Bildteilinformationen, die in den mehreren Bildinformationen enthalten sind und die sich auf dieselben Teilbereiche des Objekts beziehen, umfassen (S11 ).
Im Weiteren werden die angepassten Bildinformationen oder die Bildteilinformationen gemäß der ermittelten Pixelkorrespondenzen pixelweise zusammengeführt, wodurch aggregierte Bildinformationen entstehen. Das pixelweise Zusammenführen umfasst ein Sammeln und Verarbeiten der Pixelinformationen der jeweiligen Pixel, die an der gleichen örtlichen Position in den angepassten Bildinformationen liegen oder die Pixelkorrespondenzen aufweisen, jeweils zu einer pixelweisen Gesamtinformation (S12).
Zuletzt wird die Lage zumindest eines Objekts in den aggregierten Bildinformationen detektiert (S13). Vorzugsweise wird zusätzlich zur Lage auch die Ausdehnung des Objekts und/oder die Höhe des Objekts (d.h. die in Bezug auf die Fahrbahnoberfläche gemessene Höhe) bestimmt.
Die Erfindung wurde voranstehend an Ausführungsbeispielen beschrieben. Es versteht sich, dass zahlreiche Änderungen sowie Abwandlungen möglich sind, ohne dass dadurch der durch die Patentansprüche definierte Schutzbereich verlassen wird.
Bezugszeichenliste
1 Fahrzeug
2 Rechnereinheit
3 Sensorik
4 Fahrzeugeigenbewegungsschätzer
5 Steuereinheit
10 Bildverarbeitungseinheit
11 Zusammenführungseinheit
12 Detektionseinheit
AB aggregierte Bildinformationen
B Bildinformationen
B1 , Bn Bildinformationen
0 Objekt
T Abstandsinformation
Claims
Patentansprüche
1 ) Verfahren zur Detektion eines Objekts (0) in Bildinformationen mittels zumindest einer Rechnereinheit (2) eines Fahrzeugs (1 ), umfassend die folgenden Schritte:
- Empfangen mehrerer zeitlich aufeinanderfolgender Bildinformationen (B1 , , Bn) von einer Sensorik (3) des Fahrzeugs (1 ), wobei die Bildinformationen (B1 , ... , Bn) Information bezüglich mindestens eines Objekts (0) im Umgebungsbereich des Fahrzeugs (1 ) aufweisen (S10);
- Verarbeiten der zeitlich aufeinanderfolgenden Bildinformationen (B1 , ... , Bn) umfassend: o ein zumindest partielles Anpassen der empfangenen Bildinformationen (B1 , ... , Bn) relativ zueinander, so dass die Pixel der jeweiligen empfangenen Bildinformationen (B1 , ... , Bn), die sich auf dieselben Teilbereiche des Objekts (0) beziehen, jeweils an der gleichen örtlichen Position in den Bildinformationen liegen, wodurch ein Satz von angepassten Bildinformationen gebildet wird; und/oder o Ermitteln von Pixelkorrespondenzen zwischen Bildteilinformationen, die in den mehreren Bildinformationen (B1 , ... , Bn) enthalten sind und die sich auf dieselben Teilbereiche des Objekts beziehen (S11 );
- Pixelweises Zusammenführen der angepassten Bildinformationen oder der Pixelkorrespondenzen aufweisenden Bildteilinformationen, wodurch aggregierte Bildinformationen (AB) entstehen, wobei das pixelweise Zusammenführen ein Sammeln und Verarbeiten der Pixelinformationen der jeweiligen Pixel, die an der gleichen örtlichen Position in den angepassten Bildinformationen liegen
oder die Pixelkorrespondenzen aufweisen, jeweils zu einer pixelweisen Gesamtinformation umfasst (S12);
- Detektieren der Lage zumindest eines Objekts (0) in den aggregierten Bildinformationen (S13).
2) Verfahren nach Anspruch 1 , dadurch gekennzeichnet, dass das zumindest partielle Anpassen der empfangenen Bildinformationen (B1 , ... , Bn) relativ zueinander eine Verschiebung, ein Skalieren und/oder ein Verdrehen der Bildinformationen (B1 , ... , Bn) um zumindest eine Bildachse umfasst.
3) Verfahren nach Anspruch 1 oder 2, dadurch gekennzeichnet, dass die Ermittlung von Pixelkorrespondenzen zwischen Bildteilinformationen mittels eines Pixel-Matching-Algorithmus erfolgt.
4) Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass die Ermittlung von Pixelkorrespondenzen zwischen Bildteilinformationen mittels eines künstlichen neuronalen Netzes erfolgt.
5) Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass das Fahrzeug (1 ) einen Fahrzeugeigenbewegungs-Schätzer (4) umfasst und dass Ausgangsinformationen des Fahrzeugeigenbewegungs-Schätzers (4) zum zumindest partiellen Anpassen der empfangenen Bildinformationen (B1 , ... , Bn) und/oder zur Ermittlung von Pixelkorrespondenzen zwischen den empfangenen Bildinformationen (B1 , ... , Bn) verwendet wird.
6) Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass das Fahrzeug (1 ) zumindest eine Steuereinheit (5) umfasst, die Objektbewegungsinformationen, die Angaben zur
Bewegung des mindestens einen Objekts (0) enthalten, bereitstellt und dass die Objektbewegungsinformationen zum zumindest partiellen Anpassen der empfangenen Bildinformationen (B1 , Bn) und/oder zur Ermittlung von Pixelkorrespondenzen zwischen den empfangenen Bildinformationen (B1 , Bn) verwendet werden.
7) Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass das Verfahren rekursiv in aufeinanderfolgenden Zyklen vollzogen wird, wobei eine in einem vorhergehenden Zyklus detektierte Lage eines Objekts (0) in den aggregierten Bildinformationen (AB) in einem nachfolgenden Zyklus dazu verwendet wird, relevante Bildteilinformationen zu definieren, in Bezug auf die die aufeinanderfolgenden Bildinformationen anzugleichen sind oder zu denen Pixelkorrespondenzen zu ermitteln sind.
8) Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass die Bildinformationen (B1 , ... , Bn) 3D- Bildinformationen sind und dass das zumindest partielle Anpassen der empfangenen Bildinformationen (B1 , ... , Bn) und/oder das Ermitteln der Pixelkorrespondenzen zwischen den empfangenen Bildinformationen (B1 , ... , Bn) entlang drei Dimensionen im Raum erfolgt.
9) Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass basierend auf den Bewegungsunschärfe- Artefakten, die durch die Bewegung des zu detektierenden Objekts (0) in den zeitlich aufeinanderfolgenden Bildinformationen (B1 , ... , Bn) entstehen, die Bewegungsrichtung und/oder die Bewegungsgeschwindigkeit des Objekts (0) bestimmt wird und dass die Bewegungsrichtung und/oder die Bewegungsgeschwindigkeit des Objekts (0) zum zumindest partiellen Anpassen der empfangenen Bildinformationen (B1 , ... , Bn) und/oder zum Ermitteln der
Pixelkorrespondenzen zwischen den empfangenen Bildinformationen (B1 , Bn) verwendet wird.
10) Verfahren einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass das zumindest partielle Anpassen der empfangenen Bildinformationen (B1 , ... , Bn) relativ zueinander rekursiv in mehreren aufeinander folgenden Teilschritten erfolgt.
11 ) Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass das pixelweise Zusammenführen der angepassten Bildinformationen oder der Bildteilinformationen und/oder das pixelweise Zusammenführen der Bildteilinformationen, die Pixelkorrespondenzen aufweisen, zumindest ein Aufsummieren der pixelbezogenen Helligkeitsinformationen und/oder Farbinformationen umfasst.
12) Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass das pixelweise Zusammenführen der angepassten Bildinformationen oder der Bildteilinformationen und/oder das pixelweise Zusammenführen der Bildteilinformationen, die Pixelkorrespondenzen aufweisen, zumindest eine Mittelwertbildung der pixelbezogenen Helligkeitsinformationen und/oder Farbinformationen umfasst.
13) Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass die Sensorik (3) zumindest eine Kamera, zumindest eine Stereokamera, zumindest einen Radarsensor und/oder zumindest einen LIDAR-Sensor umfasst.
14) Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass die Sensorik zumindest eine Kamera oder eine Stereokamera umfasst und dass das zumindest partielle Anpassen
der empfangenen Bildinformationen (B1 , Bn) und/oder das Ermitteln von Pixelkorrespondenzen zwischen Bildteilinformationen unter Berücksichtigung von Kalibrierungsparametern der zumindest einen Kamera oder Stereokamera erfolgt.
15) System zur Detektion von Objekten in Bildinformationen (B1 , Bn) mittels zumindest einer Rechnereinheit (2) eines Fahrzeugs (1 ), wobei das Fahrzeug (1 ) eine Sensorik (3) zur Ermittlung von Bildinformationen umfasst, wobei die Rechnereinheit (2) dazu konfiguriert ist, die folgenden Schritte zu vollziehen:
- Empfangen mehrerer zeitlich aufeinanderfolgender Bildinformationen (B1 , ... , Bn) von einer Sensorik (3) des Fahrzeugs (1 ), wobei die Bildinformationen (B1 , ... , Bn) Information bezüglich mindestens eines Objekts (0) im Umgebungsbereich des Fahrzeugs (1 ) aufweisen (S10);
- Verarbeiten der zeitlich aufeinanderfolgenden Bildinformationen (B1 , ... , Bn) umfassend: o ein zumindest partielles Anpassen der empfangenen Bildinformationen (B1 , ... , Bn) relativ zueinander, so dass die Pixel der jeweiligen empfangenen Bildinformationen (B1 , ... , Bn), die sich auf dieselben Teilbereiche des Objekts (0) beziehen, jeweils an der gleichen örtlichen Position in den Bildinformationen liegen, wodurch ein Satz von angepassten Bildinformationen gebildet wird; und/oder o eine Ermittlung von Pixelkorrespondenzen zwischen Bildteilinformationen, die in den mehreren Bildinformationen (B1 , ... , Bn) enthalten sind und die sich auf dieselben Teilbereiche des Objekts beziehen (S11 );
- Pixelweises Zusammenführen der angepassten Bildinformationen oder der Pixelkorrespondenzen
aufweisenden Bildteilinformationen, wodurch aggregierte Bildinformationen (AB) entstehen, wobei das pixelweise Zusammenführen ein Sammeln und Verarbeiten der Pixelinformationen der jeweiligen Pixel, die an der gleichen örtlichen Position in den angepassten Bildinformationen liegen oder die Pixelkorrespondenzen aufweisen, jeweils zu einer pixelweisen Gesamtinformation umfasst (S12);
- Detektieren der Lage zumindest eines Objekts (0) in den aggregierten Bildinformationen (S13).
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| DE102023116272.1A DE102023116272A1 (de) | 2023-06-21 | 2023-06-21 | Verfahren und System zur Detektion eines Objekts |
| PCT/EP2024/066760 WO2024260904A1 (de) | 2023-06-21 | 2024-06-17 | Verfahren und system zur detektion eines objekts |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| EP4706009A1 true EP4706009A1 (de) | 2026-03-11 |
Family
ID=91585386
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP24733928.6A Pending EP4706009A1 (de) | 2023-06-21 | 2024-06-17 | Verfahren und system zur detektion eines objekts |
Country Status (4)
| Country | Link |
|---|---|
| EP (1) | EP4706009A1 (de) |
| CN (1) | CN121359175A (de) |
| DE (1) | DE102023116272A1 (de) |
| WO (1) | WO2024260904A1 (de) |
Family Cites Families (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US8958654B1 (en) * | 2001-04-25 | 2015-02-17 | Lockheed Martin Corporation | Method and apparatus for enhancing three-dimensional imagery data |
| US9449374B2 (en) * | 2014-03-17 | 2016-09-20 | Qualcomm Incoporated | System and method for multi-frame temporal de-noising using image alignment |
| US12394012B2 (en) * | 2021-09-30 | 2025-08-19 | Waymo Llc | Systems, methods, and apparatus for aligning image frames |
-
2023
- 2023-06-21 DE DE102023116272.1A patent/DE102023116272A1/de active Pending
-
2024
- 2024-06-17 WO PCT/EP2024/066760 patent/WO2024260904A1/de not_active Ceased
- 2024-06-17 CN CN202480033751.5A patent/CN121359175A/zh active Pending
- 2024-06-17 EP EP24733928.6A patent/EP4706009A1/de active Pending
Also Published As
| Publication number | Publication date |
|---|---|
| WO2024260904A1 (de) | 2024-12-26 |
| CN121359175A (zh) | 2026-01-16 |
| DE102023116272A1 (de) | 2024-12-24 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| DE69127809T2 (de) | Verfahren um zwei bewegungen in hintereinanderfolgenden teilbildern mit drei teilbildern dynamisch zu analysieren | |
| DE102008053472B4 (de) | Objekt-Erfassungssystem | |
| DE69635980T2 (de) | Verfahren und vorrichtung zur detektierung von objektbewegung in einer bilderfolge | |
| DE102009005861B4 (de) | Fahrzeugumgebungs-Erkennungssystem | |
| DE69627138T2 (de) | Verfahren zum abschätzen der lage einer bild-zielregion aus mehreren regionen mitverfolgter landmarken | |
| DE102014209137A1 (de) | Verfahren und Vorrichtung zur Kalibrierung eines Kamerasystems eines Kraftfahrzeugs | |
| DE102013114996A1 (de) | Bildsuperauflösung für dynamischen Rückspiegel | |
| EP1634243A1 (de) | Verfahren und vorrichtung zur objektortung für kraftfahrzeuge | |
| EP2736017A2 (de) | Verfahren zur Ermittlung der Bewegung eines Kraftfahrzeugs | |
| WO2019016104A1 (de) | Verfahren und vorrichtung zum ermitteln eines optischen flusses anhand einer von einer kamera eines fahrzeugs aufgenommenen bildsequenz | |
| EP3293971B1 (de) | Verfahren zur nachführung eines bildausschnitts | |
| WO2014009406A1 (de) | VERFAHREN UND VORRICHTUNG ZUM BERECHNEN EINER VERÄNDERUNG EINES ABBILDUNGSMAßSTABS EINES OBJEKTS | |
| DE102020215696B4 (de) | Verfahren zur Darstellung einer Umgebung eines Fahrzeugs, Computerprogrammprodukt, Speichermedium, Steuergerät und Fahrzeug | |
| WO2022200222A1 (de) | Verfahren und system zur bestimmung von informationen bezüglich der eigenbewegung eines fahrzeugs | |
| DE102018130229B4 (de) | Verfahren und Vorrichtung zur Objektextraktion aus eine dreidimensionale Szene darstellenden Szenenbilddaten | |
| EP4706009A1 (de) | Verfahren und system zur detektion eines objekts | |
| WO2021180679A1 (de) | Festlegen eines aktuellen fokusbereichs eines kamerabildes basierend auf der position der fahrzeugkamera an dem fahrzeug und einem aktuellen bewegungsparameter | |
| DE102021113111B4 (de) | Verfahren zur Kalibrierung von Sensorinformationen eines Fahrzeugs sowie Fahrassistenzsystem | |
| DE102019218479A1 (de) | Verfahren und Vorrichtung zur Klassifikation von Objekten auf einer Fahrbahn in einem Umfeld eines Fahrzeugs | |
| DE102024109094A1 (de) | Fahrzeugsicherheits- und/oder Fahrerassistenzverfahren, -anordnung und Datenverarbeitungsprogrammprodukt unter Verwendung eines anschließbaren Bilderfassungssystems für Straßenfahrzeuge | |
| WO2008154989A1 (de) | Verfahren zur optimierung eines stereoskopischen bildes | |
| EP4384892A1 (de) | Verfahren zur darstellung einer rückwärtigen umgebung einer mobilen plattform, die mit einem anhänger gekoppelt ist | |
| DE112019002126T5 (de) | Positionsschätzungsvorrichtung, positionsschätzungsverfahren und programm dafür | |
| DE19934904C2 (de) | Verfahren und Vorrichtung zur Bildzuordnung | |
| DE19630194B4 (de) | Verfahren zur Detektion von Objekten |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: UNKNOWN |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE |
|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE |
|
| 17P | Request for examination filed |
Effective date: 20251201 |
|
| AK | Designated contracting states |
Kind code of ref document: A1 Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR |