EP4631020A1 - Verfahren zur verarbeitung von bilddaten für die anwendung eines maschinenlern-modells - Google Patents

Verfahren zur verarbeitung von bilddaten für die anwendung eines maschinenlern-modells

Info

Publication number
EP4631020A1
EP4631020A1 EP23793825.3A EP23793825A EP4631020A1 EP 4631020 A1 EP4631020 A1 EP 4631020A1 EP 23793825 A EP23793825 A EP 23793825A EP 4631020 A1 EP4631020 A1 EP 4631020A1
Authority
EP
European Patent Office
Prior art keywords
grid
representation
image data
machine learning
learning model
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP23793825.3A
Other languages
English (en)
French (fr)
Inventor
Tamas Kapelner
Matthias Kirschner
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Robert Bosch GmbH
Original Assignee
Robert Bosch GmbH
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Robert Bosch GmbH filed Critical Robert Bosch GmbH
Publication of EP4631020A1 publication Critical patent/EP4631020A1/de
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T5/00Image enhancement or restoration
    • G06T5/60Image enhancement or restoration using machine learning, e.g. neural networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/82Arrangements for image or video recognition or understanding using pattern recognition or machine learning using neural networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T5/00Image enhancement or restoration
    • G06T5/80Geometric correction
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T7/00Image analysis
    • G06T7/80Analysis of captured images to determine intrinsic or extrinsic camera parameters, i.e. camera calibration
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/20Image preprocessing
    • G06V10/32Normalisation of the pattern dimensions
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/40Extraction of image or video features
    • G06V10/44Local feature extraction by analysis of parts of the pattern, e.g. by detecting edges, contours, loops, corners, strokes or intersections; Connectivity analysis, e.g. of connected components
    • G06V10/443Local feature extraction by analysis of parts of the pattern, e.g. by detecting edges, contours, loops, corners, strokes or intersections; Connectivity analysis, e.g. of connected components by matching or filtering
    • G06V10/449Biologically inspired filters, e.g. difference of Gaussians [DoG] or Gabor filters
    • G06V10/451Biologically inspired filters, e.g. difference of Gaussians [DoG] or Gabor filters with interaction between the filter responses, e.g. cortical complex cells
    • G06V10/454Integrating the filters into a hierarchical structure, e.g. convolutional neural networks [CNN]
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V20/00Scenes; Scene-specific elements
    • G06V20/50Context or environment of the image
    • G06V20/56Context or environment of the image exterior to a vehicle by using sensors mounted on the vehicle
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2207/00Indexing scheme for image analysis or image enhancement
    • G06T2207/20Special algorithmic details
    • G06T2207/20081Training; Learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2207/00Indexing scheme for image analysis or image enhancement
    • G06T2207/20Special algorithmic details
    • G06T2207/20084Artificial neural networks [ANN]
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2207/00Indexing scheme for image analysis or image enhancement
    • G06T2207/30Subject of image; Context of image processing
    • G06T2207/30248Vehicle exterior or interior
    • G06T2207/30252Vehicle exterior; Vicinity of vehicle

Definitions

  • the present invention relates to a method for processing image data for the application of a machine learning model.
  • the invention also relates to a computer program and a device for this purpose.
  • the input is based on a line of sight representation and thus in particular on a camera-independent representation of the image data.
  • the machine learning model preferably in the form of an artificial neural network, can be used independently of the specific camera type.
  • the vehicle can be designed, for example, as a motor vehicle, preferably a passenger car.
  • the vehicle has a driving function for autonomous driving and/or for supporting a driver of the vehicle.
  • the driving function can be designed to control the vehicle, e.g. to steer and/or accelerate it, based on the image data and/or an output of the applied machine learning model.
  • the image data in the line of sight representation are represented by pixels, whereby the provision of the input can include the following step for further preprocessing: - Providing a grid representation in which a grid has several grid cells, wherein the pixels are assigned to the grid cells.
  • the grid density and the exact assignment can be hyperparameters of the method according to the invention.
  • a hyperparameter is in particular a parameter whose value is used to control the learning process.
  • the geometric shape of the grid can be predefined if necessary and correspond, for example, to a projection surface of the visual rays, preferably the image plane, of the visual ray representation.
  • the image points can be those points on the grid at which the visual rays arrive.
  • the image points can each represent an intersection point with a visual ray of the visual ray representation. Accordingly, the image points can also be referred to as ray intersection points.
  • the term "sight ray” is commonly used in the field for a representation such as that described in Z. Zhang, Camera Parameters (Intrinsic, Extrinsic), pp. 81-85. Boston, MA: Springer US, 2014 or Ikeuchi, K. (eds) Computer Vision. Springer, Boston, MA.
  • this representation describes a point at which the light ray that created a point or pixel in the image data hit a hypothetical plane (also referred to as a projection surface in the context of the invention) on the optical path.
  • This representation is therefore also referred to as a "sight ray representation".
  • the hypothetical plane is often also referred to as an "image plane”. It should be noted that despite the designation as a "plane”, any virtual surface such as a sphere can also be constructed as an image plane and the sight ray representation of an image, i.e. the image data, can be calculated relative to this surface.
  • the image data can initially be in an image representation, e.g. a pixel matrix representation. This can be the representation of the image data as it is usually provided by the camera.
  • the image data can then be converted into the line of sight representation.
  • the line of sight representation can be converted into a representation that refers to a grid, preferably a two-dimensional (2D) grid. This can be referred to as providing the grid representation.
  • a grid, preferably 2D grid is specified on the image plane (or the projection surface onto which the visual rays were projected) and each visual ray is assigned to a grid cell in this grid.
  • the image points can therefore be those points on the grid at which the visual rays arrive on the image plane or projection surface.
  • the pixels are assigned to the grid cells in different numbers, whereby the provision of the input includes the following step for further preprocessing:
  • Performing a normalization based on the grid representation preferably by normalizing a distance between a cell center of the respective grid cell and the pixels assigned to the grid cell in the grid representation.
  • the grid representation can be converted to a convolutional representation and/or normalized to a 2D grid of fixed-length vectors. This can have the advantage that it can be processed using machine learning algorithms, in particular standard CNN approaches.
  • the advantage can be achieved that the method according to the invention enables the image data to be converted into a distortion-free representation, so that the machine learning model can be used as a generic algorithm, e.g. for recognizing objects in the image data or for semantic segmentation of the image data.
  • This enables the method according to the invention to be used, e.g. in machines such as vehicles or robots, in order to control the machine based on object recognition.
  • a feature map is calculated by normalization, wherein the feature map for each grid cell comprises a feature vector which is calculated from the pixels of the respective grid cell.
  • the normalization may be based on an application of a neural network to the pixels of the respective grid cell.
  • a neural network for example, by applying the neural network in the form of a CNN (Convolutional Neural Network), the feature map can be obtained on a 2D grid level. This enables direct modeling of camera distortions.
  • the neural network comprises at least one convolution layer.
  • the feature map comprises a single feature vector, preferably with at least one channel, per grid cell. Applied to all grid cells, the result of this process can be a feature map with the same dimensions as the 2D grid described above.
  • the machine learning model is applied with the input provided, wherein a vehicle is preferably controlled based on the application of the machine learning model, wherein the machine learning model is preferably trained using dropout, preferably a special form of dropout.
  • a vehicle function such as a driver assistance function and/or an autonomous driving function can be provided which evaluates an output of the applied machine learning model in order to control the vehicle based thereon.
  • a dropout in the first layer can be used during the training of the machine learning model in order to make the machine learning model robust against changes in the optical parameters.
  • the machine learning model hereinafter also referred to as the model, can have been trained beforehand using image data from a camera of a certain type. Due to the advantageous transfer to the line of sight representation, the machine learning model trained in this way is nevertheless suitable for other camera types.
  • the type and/or the imaging errors such as camera distortion of the camera when applying the machine learning model can differ from a camera that was used to train the machine learning model.
  • the model can therefore preferably be trained in such a way that it is invariant to differences in the optical properties between cameras.
  • the method according to the invention can therefore preferably be used to apply models such as CNNs to camera distortions that were not yet taken into account during training.
  • Directly modeling camera distortions also offers several advantages.
  • explicitly modeling prior knowledge about the distortions can make the learning problem less difficult.
  • a neural network does not need to implicitly learn the transformations between different distortions because they are explicitly modeled in the CNN structure. This can free up capacity in the model that can be used to learn features that are relevant to the task at hand.
  • explicitly training invariance to camera distortions enables the use of different machine learning models, e.g. in the form of deep learning models trained for completely different camera distortions, especially if the sensors of the two cameras are compatible.
  • the machine learning model could also be used on fisheye cameras even if the model was not trained for such camera distortions.
  • applying a trained machine learning model to a dataset with a different camera distortion does not require extensive labeling and retraining.
  • the invention also relates to a computer program, in particular a computer program product, comprising instructions which, when the computer program is executed by a computer, cause the computer to carry out the method according to the invention.
  • the computer program according to the invention therefore brings with it the same advantages as have been described in detail with reference to a method according to the invention.
  • the invention also relates to a device for data processing which is set up to carry out the method according to the invention.
  • the device can be provided, for example, as a computer which executes the computer program according to the invention.
  • the computer can have at least one processor for executing the computer program.
  • a non-volatile data memory can also be provided in which the computer program is stored and from which the computer program can be read by the processor for execution.
  • the invention can also relate to a computer-readable storage medium which comprises the computer program according to the invention.
  • the storage medium is designed, for example, as a data storage device such as a hard disk and/or a non-volatile memory and/or a memory card.
  • the storage medium can, for example, be integrated into the computer.
  • the method according to the invention can also be implemented as a computer-implemented method.
  • Fig. 1 an example visualization of the different optical parameters of cameras.
  • Fig. 2 a definition of a 2D grid on the image plane for converting visual rays into relative representations.
  • Fig. 3 An application of a CNN to the relative line of sight representation.
  • Fig. 4 an exemplary implementation of the embodiment according to Fig. 3, in which the CNN is a transformer network.
  • Fig. 6 shows a schematic visualization of a method, a device and a computer program according to embodiments of the invention.
  • Fig. 1 An example of such pixels is shown in Fig. 1. It is often useful to first convert this pixel matrix into another representation as follows. Using the camera's own parameters, one can calculate the coordinates at which the light hits the image plane for each pixel (see, for example, Z. Zhang, Camera Parameters (Intrinsic, Extrinsic), pp. 81-85. Boston, MA: Springer US, 2014.). Essentially, this representation describes a point at which the light ray that created the pixel hit a hypothetical plane on the optical path. Therefore, this representation is also called a "line of sight representation".
  • this representation can always refer to a plane that is usually called the "image plane".
  • image plane a plane that is usually called the "image plane”.
  • Fig. 1 illustrates the different optical parameters of cameras.
  • a barrel distortion is applied, which results in more pixels on the sides of the image than in the center.
  • a distortion is applied to the second image (Fig. 1 b) in which more pixels are imaged in the central area and fewer at the edges.
  • Computer vision algorithms that leverage deep learning are extremely successful in a wide range of applications. They rely on a specific representation of the information captured by a camera: a set of pixels arranged in a matrix structure with specific neighborhood relationships: an image is typically a multi-valued H x W x C matrix, where H and W are the height and width of the image and C is the number of channels, e.g. 3 for an RGB image.
  • this representation is largely camera-dependent, as the optical parameters of the camera determine the pixel representation of, e.g., an object in the real world (see Fig. 1).
  • the image can be converted into a ray-of-sight representation using known methods.
  • the points can then be converted into relative coordinates along a 2D grid.
  • a fully convolutional network can be applied to this representation for each grid cell, and fourth, a normal CNN can then be applied to the resulting feature map to solve a specific task (e.g. semantic segmentation).
  • a dropout in the first layer can be used during training to make the model robust to changes in the optical parameters. The steps of the procedure are described below in further detail.
  • the image representation, preferably pixel matrix representation, of an image can be converted into a ray of sight representation. This can be done using conventional state-of-the-art methods (see, e.g., Z. Zhang, Camera Parameters (Intrinsic, Extrinsic), pp. 81-85. Boston, MA: Springer US, 2014. In: Ikeuchi, K. (eds) Computer Vision. Springer, Boston, MA.).
  • the visual ray representation can be converted into a representation that refers to a two-dimensional (2D) grid.
  • 2D grid is specified on the image plane (or the plane onto which the visual rays were projected) and each visual ray is assigned to a grid cell in this grid.
  • This serves as preprocessing and only needs to be done once, as shown in Fig. 2.
  • it is also referred to as a grid representation.
  • these steps can map the representation of the visual rays onto a 2D grid.
  • this representation may not yet be directly usable by the machine learning model, since there are a different number of mapped visual rays in each grid cell.
  • a 2D grid on the image plane for converting sight rays into relative representations are visualized. Both the grid density and the exact mapping method can be hyperparameters of a method according to embodiments of the invention.
  • a conversion of the relative ray of sight representation, preferably a grid representation, into a convolutional representation can be performed.
  • the relative ray of sight representation can be normalized to a 2D grid of vectors of fixed length. This can have the advantage that it can be processed using standard CNN approaches - as shown in Fig. 3.
  • an artificial neural network such as a CNN can be applied to one or more points l t for each grid cell to calculate some features for this grid cell.
  • the CNN can be defined in many ways, e.g. B. as a series of convolutions and poolings with variable input size, as in Fig. 3, or as a transformer network, as used in “A. Dosovitskiy, L. Beyer, A. Kolesnikov, D. Weissenborn, X. Zhai, T. Unterthiner, M. Dehghani, M. Minderer, G.
  • Fig. 3 an application of a CNN to the relative ray of sight representation is visualized.
  • the CNN preferably works with a variable input size N_i x D, where is the number of view rays associated with grid cell i and D is the input dimension (5 for 2D RGB).
  • the output of this block can then be generated in a fully convolutional manner and have the form 1 x F, where F is the chosen feature dimension (this is a hyperparameter of the model, just like all other convolutional layers).
  • Fig. 4 shows an alternative implementation of the embodiment of Fig. 3, where the CNN is a transformer network.
  • a standard CNN can be applied to the feature map output in the previous step to perform a range of tasks such as semantic segmentation or object detection.
  • the labels can also be mapped to the grid representation described previously to enable training.
  • a particular advantage can be achieved by training the resulting model to be robust to changes in the ray of sight representation. This can be made possible in particular by allowing the mapping of P to L to be changed dynamically. For example, some form of dropout can be included, where some /( points are randomly dropped from each grid cell, effectively resulting in less information being available for the grid cells. Since the CNN applied to the Li points are fully convolutional and therefore shared by all grid cells, this results in a distortion-independent information processing step that works on images from cameras with different optical properties.
  • embodiments of the invention are visualized in blocks: creation of a (relative) line of sight representation (A), application of a CNN to obtain a feature map on a 2D grid level (B), and application of a standard CNN to the resulting features (C).
  • Fig. 2 shows that the image data 205 can be represented in the line of sight representation by pixels 215.
  • the further preprocessing can also make it possible to provide the grid representation 210, in which the grid has several grid cells, with the pixels 215 being assigned to the grid cells.
  • the pixels 215 can be assigned to the grid cells in different numbers. Normalization can then be provided, in which a distance between the respective cell center and the respective pixels 215 in the grid representation can be normalized, e.g. by a neural network 230, resulting in a feature map 220 (see Fig. 3).
  • the feature map 220 can advantageously comprise a single feature vector, preferably with at least one channel, per grid cell.
  • a transformer 230 can also be used as neural network 230 with a previous generation of "embeddings" 235 to generate the feature map 220.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Multimedia (AREA)
  • Evolutionary Computation (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Health & Medical Sciences (AREA)
  • Artificial Intelligence (AREA)
  • General Health & Medical Sciences (AREA)
  • Computing Systems (AREA)
  • Software Systems (AREA)
  • Medical Informatics (AREA)
  • Databases & Information Systems (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Molecular Biology (AREA)
  • Biomedical Technology (AREA)
  • Biodiversity & Conservation Biology (AREA)
  • Image Analysis (AREA)

Abstract

Die Erfindung betrifft ein Verfahren (100) zur Verarbeitung von Bilddaten (205) für die Anwendung eines Maschinenlern-Modells (200), umfassend: - Ermitteln (101) von Bilddaten (205), wobei die Bilddaten (205) aus einer Bilderfassung mit einer Kamera (40) resultieren, - Überführen (102) der Bilddaten (205) in eine Sichtstrahldarstellung, - Bereitstellen (103) einer Eingabe für das Maschinenlern-Modell (200) basierend auf den Bilddaten (205) in der Sichtstrahldarstellung.

Description

Beschreibung
Titel
Verfahren zur Verarbeitung von Bilddaten für die Anwendung eines Maschinenlern-Modells
Die vorliegende Erfindung betrifft ein Verfahren zur Verarbeitung von Bilddaten für die Anwendung eines Maschinenlern-Modells. Ferner bezieht sich die Erfindung auf ein Computerprogramm sowie eine Vorrichtung zu diesem Zweck.
Stand der Technik
Aus dem Stand der Technik ist es bekannt, dass Computer- Vision-Algorithmen verwendet werden können, um Bilder einer Kameraaufzeichnung, insbesondere bei einem Fahrzeug, zu verbessern. Hierbei wird die Anpassung von Computer- Vision-Algorithmen an unterschiedliche Kameraverzerrungen üblicherweise als Domänenanpassungsproblem formuliert. Dabei wird die Domäneninvarianz durch ein spezielles Trainingsverfahren sichergestellt, bei dem dasselbe CNN auf Bildern mit unterschiedlichen Kameraverzerrungen trainiert wird, so dass die resultierenden Gewichte domänenübergreifend verallgemeinert werden können.
In „X. Peng, Y. L. Murphey, S. Stent, Y. Li, and Z. Zhao, .Spatial focal loss for pedestrian detection in fisheye imagery,“ 2019 IEEE Winter Conference on Applications of Computer Vision (WACV), pp. 561-569, 2019.“ werden spezielle Arten von Kosten beschrieben, die Proben mit unterschiedlichen Kameraverzerrungen neu gewichten, um das Lernen domäneninvarianter Merkmale zu fördern.
Offenbarung der Erfindung
Gegenstand der Erfindung ist ein Verfahren mit den Merkmalen des Anspruchs 1 , ein Computerprogramm mit den Merkmalen des Anspruchs 9 sowie eine Vorrichtung mit den Merkmalen des Anspruchs 10. Weitere Merkmale und Details der Erfindung ergeben sich aus den jeweiligen Unteransprüchen, der Beschreibung und den Zeichnungen. Dabei gelten Merkmale und Details, die im Zusammenhang mit dem erfindungsgemäßen Verfahren beschrieben sind, selbstverständlich auch im Zusammenhang mit dem erfindungsgemäßen Computerprogramm sowie der erfindungsgemäßen Vorrichtung, und jeweils umgekehrt, so dass bezüglich der Offenbarung zu den einzelnen Erfindungsaspekten stets wechselseitig Bezug genommen wird bzw. werden kann.
Gegenstand der Erfindung ist insbesondere ein Verfahren zur Verarbeitung, insbesondere Vorverarbeitung, von Bilddaten für die Anwendung eines Maschinenlern-Modells, umfassend die nachfolgenden Schritte, welche vorzugsweise nacheinander und/oder wiederholt ausgeführt werden:
- Ermitteln von Bilddaten, wobei die Bilddaten aus einer Bilderfassung mit einer Kamera, vorzugsweise eines Fahrzeuges, resultieren,
- Überführen, vorzugsweise Konvertieren, der Bilddaten in eine Sichtstrahldarstellung,
- Bereitstellen einer Eingabe für das Maschinenlern-Modell basierend auf den Bilddaten in der Sichtstrahldarstellung, vorzugsweise, um das Maschinenlern- Modell mit der Eingabe anzuwenden, bevorzugt, um die Bilddaten auszuwerten, bspw. zu klassifizieren und/oder zu segmentieren.
Die Eingabe basiert auf einer Sichtstrahldarstellung und damit insbesondere auf einer kameraunabhängigen Repräsentation der Bilddaten. Dies hat den Vorteil, dass das Maschinenlern-Modell, vorzugsweise in der Form eines künstlichen neuronalen Netzes, unabhängig von dem konkreten Kameratyp angewendet werden kann. Das Fahrzeug kann z. B. als ein Kraftfahrzeug, vorzugsweise Personenkraftfahrzeug, ausgebildet sein. Insbesondere weist das Fahrzeug eine Fahrfunktion zum autonomen Fahren und/oder zur Unterstützung eines Fahrers des Fahrzeuges auf. Die Fahrfunktion kann dazu ausgeführt sein, basierend auf den Bilddaten und/oder einer Ausgabe des angewandten Maschinenlern-Modells das Fahrzeug zu steuern, bspw. zu lenken und/oder zu beschleunigen.
Ferner ist es denkbar, dass die Bilddaten in der Sichtstrahldarstellung durch Bildpunkte repräsentiert werden, wobei das Bereitstellen der Eingabe den nachfolgenden Schritt zur weiteren Vorverarbeitung umfassen kann: - Bereitstellen einer Gitterdarstellung, bei welcher ein Gitter mehrere Gitterzellen aufweist, wobei die Bildpunkte den Gitterzellen zugeordnet werden.
Die Gitterdichte sowie die exakte Zuordnung können dabei Hyperparameter des erfindungsgemäßen Verfahrens sein. In diesem Kontext des maschinellen Lernens ist ein Hyperparameter insbesondere ein Parameter, dessen Wert zur Steuerung des Lernprozesses verwendet wird. Die geometrische Form des Gitters kann ggf. vordefiniert sein und bspw. einer Projektionsfläche der Sichtstrahlen, vorzugsweise Bildebene, der Sichtstrahldarstellung entsprechen.
Die Bildpunkte können solche Punkte auf dem Gitter sein, in denen die Sichtstrahlen eintreffen. In anderen Worten können die Bildpunkte jeweils einen Schnittpunkt mit einem Sichtstrahl der Sichtstrahldarstellung repräsentieren. Entsprechend können die Bildpunkte auch als Strahlenschnittpunkte bezeichnet werden.
Der Ausdruck „Sichtstrahl“, engl. „Sight Ray“, ist dabei fachüblich für eine Darstellung, wie sie bspw. in Z. Zhang, Camera Parameters (Intrinsic, Extrinsic), pp. 81-85. Boston, MA: Springer US, 2014 bzw. Ikeuchi, K. (eds) Computer Vision. Springer, Boston, MA beschrieben wird. Im Wesentlichen beschreibt diese Darstellung einen Punkt, an dem der Lichtstrahl, der ein Punkte bzw. Pixel in den Bilddaten erzeugt hat, auf eine hypothetische Ebene (im Rahmen der Erfindung auch als Projektionsfläche bezeichnet) auf dem optischen Pfad getroffen ist. Daher wird diese Darstellung auch als "Sichtstrahldarstellung" bezeichnet. Die hypothetische Ebene wird häufig auch als "Bildebene" bezeichnet. Es ist zu beachten, dass trotz der Bezeichnung als „Ebene“ auch eine beliebige virtuelle Fläche wie eine Kugel als Bildebene konstruiert und die Sichtstrahldarstellung eines Bildes, d. h. der Bilddaten, relativ zu dieser Fläche berechnet werden kann.
Die Bilddaten können zunächst in einer Bilddarstellung vorliegen, also z. B. einer Pixelmatrixdarstellung. Es kann sich dabei um die Darstellung der Bilddaten handeln, wie sie von der Kamera üblicherweise bereitgestellt wird. Anschließend können die Bilddaten in die Sichtstrahldarstellung überführt werden. Im nächsten Schritt kann die Sichtstrahldarstellung in eine Darstellung umgewandelt werden, die sich auf ein Gitter, vorzugsweise zweidimensionales (2D-) Gitter, bezieht. Dies kann als das Bereitstellen der Gitterdarstellung bezeichnet werden. Das bedeutet, dass ein Gitter, vorzugsweise 2D-Gitter, auf die Bildebene (oder die Projektionsfläche, auf die die Sichtstrahlen projiziert wurden) spezifiziert wird und jeder Sichtstrahl einer Gitterzelle in diesem Gitter zugeordnet wird. Die Bildpunkte können daher solche Punkte auf dem Gitter sein, in denen die Sichtstrahlen auf die Bildebene bzw. Projektionsfläche eintreffen.
Ferner ist es optional vorgesehen, dass die Bildpunkte den Gitterzellen in unterschiedlicher Anzahl zugeordnet werden, wobei das Bereitstellen der Eingabe den nachfolgenden Schritt zur weiteren Vorverarbeitung umfasst:
Durchführen einer Normalisierung basierend auf der Gitterdarstellung, vorzugsweise durch ein Normalisieren eines Abstands zwischen einem Zellenmittelpunkt der jeweiligen Gitterzelle und den jeweils der Gitterzelle zugeordneten Bildpunkten in der Gitterdarstellung.
Dabei kann die Gitterdarstellung in eine Faltungsdarstellung umgewandelt und/oder auf ein 2D-Gitter aus Vektoren fester Länge normalisiert werden. Dies kann den Vorteil haben, dass sie mit Algorithmen des maschinellen Lernens, insbesondere Standard-CNN-Ansätzen, verarbeitet werden kann.
Ferner kann der Vorteil erzielt werden, dass durch das erfindungsgemäße Verfahren eine Umwandlung der Bilddaten in eine verzeichnungsfreie Darstellung möglich ist, so dass das Maschinenlern-Modell als ein generischer Algorithmus z. B. zur Erkennung von Objekten in den Bilddaten oder zur semantischen Segmentierung der Bilddaten verwendet werden kann. Dies ermöglicht den Einsatz des erfindungsgemäßen Verfahrens z. B. in Maschinen wie Fahrzeugen oder Robotern, um eine Steuerung der Maschine anhand der Objekterkennung vorzunehmen.
Ferner kann im Rahmen der Erfindung vorgesehen sein, dass durch das Normalisieren eine Merkmalskarte berechnet wird, wobei die Merkmalskarte für die Gitterzellen jeweils einen Merkmalsvektor umfasst, welcher aus den Bildpunkten der jeweiligen Gitterzelle berechnet wird. Dies ermöglicht es, eine Reihe von Aufgaben wie semantische Segmentierung oder Objekterkennung auf Basis der Merkmalskarte mittels des Maschinenlern-Modells durchzuführen. Bspw. können hierzu Label auch auf die Gitterdarstellung abgebildet werden, um das Training des Maschinenlern-Modells zu ermöglichen.
Es kann ferner möglich sein, dass das Normalisieren auf einer Anwendung eines neuronalen Netzes auf die Bildpunkte der jeweiligen Gitterzelle basiert Zum Beispiel kann durch die Anwendung des neuronalen Netzes in der Form eines CNN (Convolutional Neural Network oder faltendes neuronales Netzwerk) die Merkmalskarte auf 2D-Gitterebene erhalten werden. Damit ist eine direkte Modellierung von Kameraverzeichnungen möglich. Optional kann es daher auch vorgesehen sein, dass das neuronale Netz mindestens eine Faltungsschicht umfasst.
Des Weiteren ist es denkbar, dass die Merkmalskarte einen einzigen Merkmalsvektor, vorzugsweise mit mindestens einem Kanal, pro Gitterzelle umfasst. Auf alle Gitterzellen angewandt kann das Ergebnis dieses Vorgangs eine Merkmalskarte mit denselben Abmessungen wie das voranstehend bereits beschriebene 2D-Gitter sein.
Bevorzugt kann im Rahmen der Erfindung vorgesehen sein, dass das Maschinenlern-Modell mit der bereitgestellten Eingabe angewendet wird, wobei vorzugsweise basierend auf der Anwendung des Maschinenlern-Modells ein Fahrzeug gesteuert wird, wobei das Maschinenlern-Modell vorzugsweise mittels Dropout, vorzugsweise einer speziellen Form von Dropout, trainiert ist. Es kann eine Fahrzeugfunktion wie eine Fahrerassistenz-Funktion und/oder eine autonome Fahrfunktion vorgesehen sein, welche eine Ausgabe des angewandten Maschinenlern-Modells auswertet, um darauf basierend das Fahrzeug zu steuern. Ferner kann während des Trainings des Maschinenlern- Modells ein Dropout in der ersten Schicht verwendet werden, um das Maschinenlern-Modell robust gegenüber Änderungen der optischen Parameter zu machen.
Das Maschinenlern-Modell, nachfolgend auch kurz Modell bezeichnet, kann zuvor durch Bilddaten einer Kamera eines bestimmten Typs trainiert worden sein. Durch die vorteilhafte Überführung in die Sichtstrahldarstellung ist das auf diese Weise trainierte Maschinenlern-Modell dennoch geeignet, auch für andere Kameratypen eingesetzt zu werden. Dabei kann sich der Typ und/oder es können die Abbildungsfehler wie Verzeichnungen (engl. camera distortion) der Kamera bei der Anwendung des Maschinenlern-Modells von einer Kamera unterscheiden, welche zum Training des Maschinenlern-Modells eingesetzt worden ist. Somit kann das Modell vorzugsweise so trainiert werden, dass es invariant gegenüber Unterschieden in den optischen Eigenschaften zwischen Kameras ist. Damit können durch das erfindungsgemäße Verfahren vorzugsweise Modelle wie CNNs auf Kameraverzerrungen angewendet werden, die beim Training noch nicht vorgesehen waren.
Die direkte Modellierung von Kameraverzeichnungen bietet ferner ebenfalls mehrere Vorteile. Zunächst kann das Lernproblem durch die explizite Modellierung des Vorwissens über die Verzeichnungen weniger schwierig sein. Ein neuronales Netz muss die Transformationen zwischen verschiedenen Verzeichnungen nicht implizit erlernen, da sie in der CNN-Struktur explizit modelliert sind. Dadurch kann im Modell Kapazität freigegeben werden, die für das Lernen von Merkmalen verwendet werden kann, die für die jeweilige Aufgabe relevant sind. Zudem ermöglicht das explizite Training der Invarianz gegenüber Kameraverzeichnungen die Verwendung von unterschiedlichen Maschinenlern-Modellen, bspw. in der Form von Deep-Learning-Modellen, die für völlig unterschiedliche Kameraverzeichnungen trainiert wurden, insbesondere dann, wenn die Sensoren der beiden Kameras kompatibel sind. So könnte das Maschinenlern-Modell beispielsweise auch auf fisheye- Kameras verwendet werden, selbst wenn das Modell nicht auf solche Kameraverzeichnungen trainiert wurde. Dies bedeutet auch, dass für die Anwendung eines trainierten Maschinenlern-Modells auf einen Datensatz mit einer anderen Kameraverzeichnung (z. B. Schrägsichtbilder) keine umfangreiches Labelling und kein erneutes Training erforderlich sind.
Ebenfalls Gegenstand der Erfindung ist ein Computerprogramm, insbesondere Computerprogrammprodukt, umfassend Befehle, die bei der Ausführung des Computerprogrammes durch einen Computer diesen veranlassen, das erfindungsgemäße Verfahren auszuführen. Damit bringt das erfindungsgemäße Computerprogramm die gleichen Vorteile mit sich, wie sie ausführlich mit Bezug auf ein erfindungsgemäßes Verfahren beschrieben worden sind. Ebenfalls Gegenstand der Erfindung ist eine Vorrichtung zur Datenverarbeitung, die eingerichtet ist, das erfindungsgemäße Verfahren auszuführen. Als die Vorrichtung kann bspw. ein Computer vorgesehen sein, welcher das erfindungsgemäße Computerprogramm ausführt Der Computer kann wenigstens einen Prozessor zur Ausführung des Computerprogramms aufweisen. Auch kann ein nicht-flüchtiger Datenspeicher vorgesehen sein, in welchem das Computerprogramm hinterlegt und von welchem das Computerprogramm durch den Prozessor zur Ausführung ausgelesen werden kann.
Ebenfalls Gegenstand der Erfindung kann ein computerlesbares Speichermedium sein, welches das erfindungsgemäße Computerprogramm umfasst. Das Speichermedium ist bspw. als ein Datenspeicher wie eine Festplatte und/oder ein nicht-flüchtiger Speicher und/oder eine Speicherkarte ausgebildet. Das Speichermedium kann z. B. in den Computer integriert sein.
Darüber hinaus kann das erfindungsgemäße Verfahren auch als ein computerimplementiertes Verfahren ausgeführt sein.
Weitere Vorteile, Merkmale und Einzelheiten der Erfindung ergeben sich aus der nachfolgenden Beschreibung, in der unter Bezugnahme auf die Zeichnungen Ausführungsbeispiele der Erfindung im Einzelnen beschrieben sind. Dabei können die in den Ansprüchen und in der Beschreibung erwähnten Merkmale jeweils einzeln für sich oder in beliebiger Kombination erfindungswesentlich sein. Es zeigen:
Fig. 1 : eine beispielhafte Visualisierung der verschiedenen optischen Parameter von Kameras.
Fig. 2: eine Definition eines 2D-Gitters auf der Bildebene zur Umwandlung von Sichtstrahlen in relative Darstellungen.
Fig. 3: eine Anwendung eines CNN auf die relative Sichtstrahldarstellung. Fig. 4: eine beispielhafte Umsetzung des Ausführungsbeispiels gemäß Fig. 3, bei der das CNN ein Transformer-Netzwerk ist.
Fig. 5: Ausführungsbeispiele der Erfindung visualisiert in Blöcken.
Fig. 6 eine schematische Visualisierung eines Verfahrens, einer Vorrichtung sowie eines Computerprogramms gemäß Ausführungsbeispielen der Erfindung.
In den nachfolgenden Figuren werden für die gleichen technischen Merkmale auch von unterschiedlichen Ausführungsbeispielen die identischen Bezugszeichen verwendet.
Da Kameras typischerweise visuelle Informationen mit einer Methode aufzeichnen, bei der die einzelnen Sensoren in einem Raster angeordnet sind, ist die Ausgabe solcher Kameras eine Matrix von Pixelwerten. Beispielhaft sind solche Pixel in Fig. 1 dargestellt. Es ist häufig zunächst sinnvoll, dass diese Pixelmatrix wie folgt in eine andere Darstellung umgewandelt wird. Mit Hilfe der kameraeigenen Parameter kann man für jedes Pixel die Koordinaten berechnen, an denen das Licht auf die Bildebene trifft (s. bspw. Z. Zhang, Camera Parameters (Intrinsic, Extrinsic), pp. 81-85. Boston, MA: Springer US, 2014.). Im Wesentlichen beschreibt diese Darstellung einen Punkt, an dem der Lichtstrahl, der das Pixel erzeugt hat, auf eine hypothetische Ebene auf dem optischen Pfad getroffen ist. Daher wird diese Darstellung auch als "Sichtstrahldarstellung" bezeichnet. Es ist zu beachten, dass sich diese Darstellung immer auf eine Ebene beziehen kann, die normalerweise als "Bildebene" bezeichnet wird. Man kann allerdings eine beliebige virtuelle Fläche konstruieren und die Sichtstrahldarstellung eines Bildes relativ zu dieser Fläche berechnen. Um kameraunabhängige Modelle zu trainieren, kann es sinnvoll sein, eine virtuelle Fläche zu wählen, die leicht zwischen verschiedenen Kameras verallgemeinert werden kann, z. B. eine Kugel um die Kamera.
In Fig. 1 sind die verschiedenen optischen Parameter von Kameras veranschaulicht. Auf dem ersten Bild (Fig. 1a) wird eine tonnenförmige Verzeichnung angewendet, die dazu führt, dass mehr Pixel an den Seiten des Bildes abgebildet werden als in der Mitte. Umgekehrt wird auf dem zweiten Bild (Fig. 1 b) eine Verzerrung angewendet, bei der mehr Pixel im mittleren Bereich und weniger an den Rändern abgebildet werden.
Computer-Vision-Algorithmen, die Deep Learning nutzen, sind in einer Vielzahl von Anwendungen äußerst erfolgreich. Sie stützen sich auf eine spezifische Darstellung der von einer Kamera erfassten Informationen: eine Reihe von Pixeln, die in einer Matrixstruktur mit spezifischen Nachbarschaftsbeziehungen angeordnet sind: Ein Bild ist in der Regel eine H x W x C-Matrix mit mehreren Werten, wobei H und W die Höhe und Breite des Bildes und C die Anzahl der Kanäle ist, z. B. 3 für ein RGB-Bild. Diese Darstellung ist jedoch weitgehend kameraabhängig, da die optischen Parameter der Kamera die Pixeldarstellung z. B. eines Objekts in der realen Welt bestimmen (siehe Fig. 1). Daher können herkömmliche Maschinenlern-Modell, die auf solchen Bildern trainiert werden, nur diese kameraspezifische Repräsentation lernen und haben Probleme, wenn sich diese Repräsentation ändert, weil eine andere Kamera verwendet werden - selbst wenn das aufgenommene Objekt dasselbe ist (s. bspw. X. Peng, Y. L. Murphey, S. Stent, Y. Li, and Z. Zhao, “Spatial focal loss for pedestrian detection in fisheye imagery,” 2019 IEEE Winter Conference on Applications of Computer Vision (WACV), pp. 561-569, 2019.).
Ausführungsbeispiele der Erfindung können diese Nachteile hingegen durch die folgenden Schritte überwinden:
Erstens kann zunächst eine Konvertierung des Bildes in eine Sichtstrahldarstellung mittels bekannter Methoden erfolgen. Zweitens kann anschließend eine Umrechnung der Punkte in relative Koordinaten entlang eines 2D-Gitters vorgesehen sein. Drittens kann ein vollständig gefaltetes Netz (engl. fully convolutional network) auf diese Darstellung für jede Gitterzelle angewandt werden, und viertens kann anschließend ein normales CNN auf die resultierende Merkmalskarte (engl. feature map) angewandt werden, um eine spezifische Aufgabe zu lösen (z. B. semantische Segmentierung). Ferner kann fünftens während des Trainings ein Dropout in der ersten Schicht verwendet werden, um das Modell robust gegenüber Änderungen der optischen Parameter zu machen. Die Schritte des Verfahrens sind nachfolgend mit weiteren Einzelheiten beschrieben.
Zunächst kann die Bilddarstellung, vorzugsweise Pixelmatrixdarstellung, eines Bildes in eine Sichtstrahldarstellung umgewandelt werden. Dies kann mit herkömmlichen Methoden aus dem Stand der Technik geschehen (s. bspw. Z. Zhang, Camera Parameters (Intrinsic, Extrinsic), pp. 81-85. Boston, MA: Springer US, 2014. In: Ikeuchi, K. (eds) Computer Vision. Springer, Boston, MA.). Im Wesentlichen besteht diese Darstellung aus einer Menge von Punkten pi e P, wobei pi = (Xi.yi.rgbi) und x^yt Koordinaten auf der Bildebene sind und rgbi die Farbinformation des Pixels ist (es ist zu beachten, dass die gleiche Methode für jeden Farbraum, nicht nur RGB, verwendet werden kann und für andere Modalitäten wie RGBD trivial erweitert werden kann).
Sodann kann im nächsten Schritt die Sichtstrahldarstellung in eine Darstellung umgewandelt werden, die sich auf ein zweidimensionales (2D-) Gitter bezieht. Das bedeutet, dass ein 2D-Gitter auf die Bildebene (oder die Ebene, auf die die Sichtstrahlen projiziert wurden) spezifiziert wird und jeder Sichtstrahl einer Gitterzelle in diesem Gitter zugeordnet wird. Dies dient als Vorverarbeitung und muss nur einmal durchgeführt werden, wie in Fig. 2 dargestellt. In diesem Zusammenhang wird auch von einer Gitterdarstellung gesprochen. Die relative Sichtstrahldarstellung besteht demnach aus Punkten e L, wobei = (Axi.Ayi.rgbi), wobei Ax^Ayi Koordinaten relativ zum nächstgelegenen Gitterpunkt sind. Im Wesentlichen kann mit diesen Schritten die Darstellung der Sichtstrahlen auf ein 2D-Gitter abgebildet werden. Allerdings kann diese Darstellung ggf. noch nicht direkt von dem Maschinenlern-Modell verwendet werden, da es in jeder Gitterzelle eine unterschiedliche Anzahl abgebildeter (engl. „mapped“) Sichtstrahlen gibt.
In Fig. 2 sind die Definitionen eines 2D-Gitters auf der Bildebene zur Umwandlung von Sichtstrahlen in relative Darstellungen visualisiert. Sowohl die Gitterdichte als auch die genaue Zuordnungsmethode können Hyperparameter eines Verfahrens gemäß Ausführungsbeispielen der Erfindung sein. In einem weiteren Schritt kann eine Umwandlung der relativen Sichtstrahldarstellung, vorzugsweise Gitterdarstellung, in eine Faltungsdarstellung erfolgen. In anderen Worten kann die relative Sichtstrahldarstellung auf ein 2D-Gitter aus Vektoren fester Länge normalisiert werden. Dies kann den Vorteil haben, dass sie mit Standard-CNN-Ansätzen verarbeitet werden kann - wie in Fig. 3 dargestellt. Zu diesem Zweck kann ein künstliches neuronales Netz wie ein CNN auf einen oder mehrere Punkte lt für jede Gitterzelle angewandet werden, um einige Merkmale für diese Gitterzelle zu berechnen. Dabei kann es sich beispielsweise um eine oder mehrere eindimensionale Faltungsschichten und ein globales Durchschnitts-Pooling (engl. global average pooling) handeln. Entscheidend kann sein, dass die resultierende Merkmalskarte als Ergebnis einen einzigen Merkmalsvektor (mit einem oder mehreren Kanälen) pro Gitterzelle haben muss. Auf alle Gitterzellen angewandt, kann das Ergebnis dieses Vorgangs eine Merkmalskarte mit denselben Abmessungen wie das voranstehend bereits beschriebene 2D-Gitter sein. Das CNN kann auf viele Arten definiert werden, z. B. als eine Reihe von Faltungen und Poolings mit variabler Eingangsgröße, wie in Fig. 3, oder als ein Transformator-Netzwerk, wie in „A. Dosovitskiy, L. Beyer, A. Kolesnikov, D. Weissenborn, X. Zhai, T. Unterthiner, M. Dehghani, M. Minderer, G. Heigold, S. Gelly, J. Uszkoreit, and N. Houlsby, ,An image is worth 16x16 words: Transformers for image recognition at scale,“ ArXiv, vol. abs/2010.11929, 2020.“ verwendet, und in Fig. 4 veranschaulicht ist.
In Fig. 3 ist eine Anwendung eines CNN auf die relative Sichtstrahldarstellung visualisiert. Das CNN arbeitet vorzugsweise mit einer variablen Eingabegröße N_i x D, wobei die Anzahl der Sichtstrahlen ist, die der Gitterzelle i zugeordnet sind, und D die Eingabedimension ist (5 für 2D RGB). Die Ausgabe dieses Blocks kann dann auf voll gefaltete Weise erzeugt werden und die Form 1 x F haben, wobei F die gewählte Merkmalsdimension ist (dies ist ein Hyperparameter des Modells, genau wie bei allen anderen Faltungsschichten). In Fig. 4 ist eine alternative Umsetzung des Ausführungsbeispiels gemäß Fig. 3 dargestellt, bei der das CNN ein Transformer-Netzwerk ist. Schließlich kann ein Standard-CNN auf die im vorherigen Schritt ausgegebene Merkmalskarte angewendet werden, um eine Reihe von Aufgaben wie semantische Segmentierung oder Objekterkennung durchzuführen. Dabei können die Labels vorzugsweise auch auf die zuvor beschriebene Gitterdarstellung abgebildet werden, um das Training zu ermöglichen.
Ein besonderer Vorteil kann dadurch ermöglicht werden, dass das resultierende Modell so trainiert wird, dass es gegenüber Änderungen in der Sichtstrahldarstellung robust ist. Dies kann vor allem dadurch möglich sein, dass die Zuordnung von P zu L dynamisch geändert werden kann. Es kann zum Beispiel eine Form von Dropout einbezogen werden, bei der einige /(-Punkte aus jeder Gitterzelle zufällig ausgeblendet werden, was effektiv dazu führt, dass weniger Informationen für die Gitterzellen verfügbar sind. Da die auf die Li- Punkte angewandten CNN vollständig gefaltet sind und daher von allen Gitterzellen gemeinsam genutzt werden, führt dies zu einem verzerrungsunabhängigen Informationsverarbeitungsschritt, der bei Bildern von Kameras mit unterschiedlichen optischen Eigenschaften funktioniert.
In Fig. 5 erfolgt eine Visualisierung von Ausführungsbeispielen der Erfindung in Blöcken: Erstellung einer (relativen) Sichtstrahldarstellung (A), Anwendung eines CNN, um eine Merkmalskarte auf 2D-Gitterebene zu erhalten (B), und Anwendung eines Standard-CNN auf die resultierenden Merkmale (C).
In Fig. 6 sind das Verfahren sowie eine Vorrichtung und ein Computerprogramm gemäß Ausführungsbeispielen der Erfindung schematisch dargestellt. Dabei kann das Verfahren 100 zur Verarbeitung von Bilddaten 205 für die Anwendung eines Maschinenlern-Modells 200 in einem ersten Verfahrensschritt 101 ein Ermitteln 101 von Bilddaten 205 umfassen, wobei die Bilddaten 205 aus einer Bilderfassung mit einer Kamera 40 resultieren. Sodann kann gemäß einem zweiten Verfahrensschritt 102 ein Überführen der Bilddaten 205 in eine Sichtstrahldarstellung vorgesehen sein. Anschließend kann gemäß einem dritten Verfahrensschritt 103 eine Eingabe für das Maschinenlern-Modell 200 basierend auf den Bilddaten 205 in der Sichtstrahldarstellung bereitgestellt werden. Die Bereitstellung kann z. B. eine Datenübertragung umfassen, bei welcher die Bilddaten - ggf. nach einer weiteren Vorverarbeitung - dem Maschinenlern- Modell als die Eingabe übergeben werden.
In Fig. 2 ist gezeigt, dass die Bilddaten 205 in der Sichtstrahldarstellung durch Bildpunkte 215 repräsentiert werden können. Durch die weitere Vorverarbeitung kann ferner ein Bereitstellen der Gitterdarstellung 210 möglich sein, bei welcher das Gitter mehrere Gitterzellen aufweist, wobei die Bildpunkte 215 den Gitterzellen zugeordnet werden. Hierbei können die Bildpunkte 215 den Gitterzellen in unterschiedlicher Anzahl zugeordnet werden. Anschließend kann ein Normalisieren vorgesehen sein, bei welchem ein Abstand zwischen dem jeweiligen Zellenmittelpunkt und den jeweiligen Bildpunkten 215 in der Gitterdarstellung normalisiert werden kann, z. B. durch ein neuronales Netz 230, wobei hieraus eine Merkmalskarte 220 resultiert (s. Fig. 3).
Die Merkmalskarte 220 kann vorteilhafterweise einen einzigen Merkmalsvektor, vorzugsweise mit mindestens einem Kanal, pro Gitterzelle umfassen. In Fig. 4 ist gezeigt, dass auch ein Transformer 230 als neuronales Netz 230 mit einer vorherigen Generierung von „Embeddings“ 235 verwendet werden kann, um die Merkmalskarte 220 zu generieren.
Die voranstehende Erläuterung der Ausführungsformen beschreibt die vorliegende Erfindung ausschließlich im Rahmen von Beispielen. Selbstverständlich können einzelne Merkmale der Ausführungsformen, sofern technisch sinnvoll, frei miteinander kombiniert werden, ohne den Rahmen der vorliegenden Erfindung zu verlassen.

Claims

Ansprüche
1 . Verfahren (100) zur Verarbeitung von Bilddaten (205) für die Anwendung eines Maschinenlern-Modells (200), umfassend:
Ermitteln (101) von Bilddaten (205), wobei die Bilddaten (205) aus einer Bilderfassung mit einer Kamera (40) resultieren,
Überführen (102) der Bilddaten (205) in eine Sichtstrahldarstellung, Bereitstellen (103) einer Eingabe für das Maschinenlern-Modell (200) basierend auf den Bilddaten (205) in der Sichtstrahldarstellung.
2. Verfahren (100) nach Anspruch 1 , dadurch gekennzeichnet, dass die Bilddaten (205) in der Sichtstrahldarstellung durch Bildpunkte (215) repräsentiert werden, wobei das Bereitstellen (103) der Eingabe den nachfolgenden Schritt zur weiteren Vorverarbeitung umfasst: Bereitstellen einer Gitterdarstellung (210), bei welcher ein Gitter mehrere Gitterzellen aufweist, wobei die Bildpunkte (215) den Gitterzellen zugeordnet werden.
3. Verfahren (100) nach Anspruch 2, dadurch gekennzeichnet, dass die Bildpunkte (215) den Gitterzellen in unterschiedlicher Anzahl zugeordnet werden, wobei das Bereitstellen (103) der Eingabe den nachfolgenden Schritt zur weiteren Vorverarbeitung umfasst: Durchführen einer Normalisierung basierend auf der Gitterdarstellung (210), vorzugsweise durch ein Normalisieren eines Abstands zwischen einem Zellenmittelpunkt der jeweiligen Gitterzelle und den jeweils der Gitterzelle zugeordneten Bildpunkten (215) in der Gitterdarstellung. Verfahren (100) nach Anspruch 3, dadurch gekennzeichnet, dass durch das Normalisieren eine Merkmalskarte (220) berechnet wird, wobei die Merkmalskarte (220) für die Gitterzellen jeweils einen Merkmalsvektor umfasst, welcher aus den Bildpunkten (215) der jeweiligen Gitterzelle berechnet wird. Verfahren (100) nach Anspruch 3 oder 4, dadurch gekennzeichnet, dass das Normalisieren auf einer Anwendung eines neuronalen Netzes (230) auf die Bildpunkte (215) der jeweiligen Gitterzelle basiert Verfahren (100) nach Anspruch 5, dadurch gekennzeichnet, dass das neuronale Netz (230) mindestens eine Faltungsschicht umfasst. Verfahren (100) nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass die Merkmalskarte (220) einen einzigen Merkmalsvektor, vorzugsweise mit mindestens einem Kanal, pro Gitterzelle umfasst. Verfahren (100) nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass das Maschinenlern-Modell (200) mit der bereitgestellten Eingabe angewendet wird, wobei basierend auf der Anwendung des Maschinenlern-Modells (200) ein Fahrzeug (1) gesteuert wird, wobei das Maschinenlern-Modell vorzugsweise mittels Dropout trainiert ist. Computerprogramm (20), umfassend Befehle, die bei der Ausführung des Computerprogramms (20) durch einen Computer (10) diesen veranlassen, das Verfahren (100) nach einem der vorhergehenden Ansprüche auszuführen. Vorrichtung (10) zur Datenverarbeitung, die eingerichtet ist, das Verfahren (100) nach einem der Ansprüche 1 bis 8 auszuführen.
EP23793825.3A 2022-12-09 2023-10-20 Verfahren zur verarbeitung von bilddaten für die anwendung eines maschinenlern-modells Pending EP4631020A1 (de)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
DE102022213386.2A DE102022213386A1 (de) 2022-12-09 2022-12-09 Verfahren zur Verarbeitung von Bilddaten für die Anwendung eines Maschinenlern-Modells
PCT/EP2023/079315 WO2024120687A1 (de) 2022-12-09 2023-10-20 Verfahren zur verarbeitung von bilddaten für die anwendung eines maschinenlern-modells

Publications (1)

Publication Number Publication Date
EP4631020A1 true EP4631020A1 (de) 2025-10-15

Family

ID=88511277

Family Applications (1)

Application Number Title Priority Date Filing Date
EP23793825.3A Pending EP4631020A1 (de) 2022-12-09 2023-10-20 Verfahren zur verarbeitung von bilddaten für die anwendung eines maschinenlern-modells

Country Status (5)

Country Link
US (1) US20260080512A1 (de)
EP (1) EP4631020A1 (de)
CN (1) CN120345008A (de)
DE (1) DE102022213386A1 (de)
WO (1) WO2024120687A1 (de)

Family Cites Families (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US11538231B2 (en) * 2020-04-06 2022-12-27 Nvidia Corporation Projecting images captured using fisheye lenses for feature detection in autonomous machine applications

Also Published As

Publication number Publication date
US20260080512A1 (en) 2026-03-19
CN120345008A (zh) 2025-07-18
WO2024120687A1 (de) 2024-06-13
DE102022213386A1 (de) 2024-06-20

Similar Documents

Publication Publication Date Title
DE102021129544A1 (de) Systeme und verfahren zur tiefenabschätzung in einem fahrzeug
DE102019214402A1 (de) Verfahren und vorrichtung zum verarbeiten von daten mittels eines neuronalen konvolutionsnetzwerks
WO2019001649A1 (de) Wissenstransfer zwischen verschiedenen deep-learning architekturen
DE112020006935T5 (de) Verfahren und gerät zur parkplatzerkennung sowie vorrichtung und speichermedium
DE102022214336A1 (de) Verfahren zur Erzeugung mindestens einer Darstellung aus der Vogelperspektive von mindestens einem Teil der Umgebung eines Systems
DE102022213442A1 (de) Verfahren zur omnidirektionalen dense-regression für maschinelle wahrnehmungsaufgaben mittels verzerrungsfreiem cnn und sphärischer self-attention
DE102018113621A1 (de) Verfahren zum Trainieren eines konvolutionellen neuronalen Netzwerks zum Verarbeiten von Bilddaten zur Anwendung in einem Fahrunterstützungssystem
DE102024133805A1 (de) Techniken zum trainieren von visuellen foundation-modellen mittels multi-teacher-distillation
DE102021108308A1 (de) Computerimplementiertes Verfahren zum Verarbeiten eines Satzes von Scanpunkten, Computerprogramm, computerlesbares Speichermedium und Fahrerassistenzsystem für ein Kraftfahrzeug
DE102022124384A1 (de) Automatische Umfeldwahrnehmung auf der Basis von multimodalen Sensordaten eines Fahrzeugs
DE102021102643A1 (de) Verfahren zum Schätzen einer Pose eines Objektes, Computerprogramm und System
DE102023202598A1 (de) Computerimplementiertes Verfahren und System zum Trainieren eines Lehrernetzwerks eines teilüberwachten Lernalgorithmus
DE102022214330A1 (de) Verfahren zur Erzeugung mindestens einer Ground Truth aus der Vogelperspektive
DE102017121052A1 (de) Verarbeitung einer von einer Umgebungserfassungseinrichtung eines Kraftfahrzeugs erzeugten Punktwolke zu einem Poincaré-invarianten symmetrischen Eingabevektor für ein neurales Netzwerk
DE102022214341A1 (de) Verfahren zur Erkennung von mindestens einer Fahrspurlinie und/oder Straßenmarkierung in mindestens einer digitalen Bilddarstellung
DE102021205034A1 (de) Trainieren eines maschinenlernfähigen modells zur schätzung des relativen objektmassstabs
DE102023130646B4 (de) Verfahren zur Dimensionsreduzierung
DE102020116774A1 (de) Automatische visuelle Wahrnehmung mittels eines künstlichen neuronalen Netzes
EP4631020A1 (de) Verfahren zur verarbeitung von bilddaten für die anwendung eines maschinenlern-modells
EP4526842B1 (de) Verfahren zum steuern einer robotervorrichtung
DE102020105070A1 (de) Verfahren zum Erkennen eines befahrbaren Bereichs in einer Umgebung eines Fahrzeugs mithilfe eines binären künstlichen neuronalen Netzes, Recheneinrichtung sowie Fahrerassistenzsystem
DE102023113925A1 (de) Verfahren zur Detektion von wenigstens einem Hindernis bei einem automatisierten und/oder zumindest teilautonomen Fahrsystem
DE102023105792A1 (de) Verfahren zum Erzeugen einer Umgebungsdarstellung
DE102018009345A1 (de) Verfahren und vorrichtung zum trainieren eines neuronalen netzwerks zum spezifizieren von landmarken auf 2d- und 3d-bildern
DE102022121839A1 (de) Texterkennung basierend auf einem verzeichneten Kamerabild

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20250709

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)