EP4150508A1 - Verbesserte detektion von objekten - Google Patents

Verbesserte detektion von objekten

Info

Publication number
EP4150508A1
EP4150508A1 EP21723981.3A EP21723981A EP4150508A1 EP 4150508 A1 EP4150508 A1 EP 4150508A1 EP 21723981 A EP21723981 A EP 21723981A EP 4150508 A1 EP4150508 A1 EP 4150508A1
Authority
EP
European Patent Office
Prior art keywords
image
surroundings
resolution
areas
environment
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP21723981.3A
Other languages
English (en)
French (fr)
Inventor
Fabian BURGER
Philippe Lafon
Thomas Boulay
Diego Mendoza Barrenechea
Flora Dellinger
Prashanth Viswanath
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Valeo Schalter und Sensoren GmbH
Original Assignee
Valeo Schalter und Sensoren GmbH
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Valeo Schalter und Sensoren GmbH filed Critical Valeo Schalter und Sensoren GmbH
Publication of EP4150508A1 publication Critical patent/EP4150508A1/de
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V20/00Scenes; Scene-specific elements
    • G06V20/50Context or environment of the image
    • G06V20/56Context or environment of the image exterior to a vehicle by using sensors mounted on the vehicle
    • G06V20/58Recognition of moving objects or obstacles, e.g. vehicles or pedestrians; Recognition of traffic objects, e.g. traffic signs, traffic lights or roads
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/24Classification techniques
    • G06F18/241Classification techniques relating to the classification model, e.g. parametric or non-parametric approaches
    • G06F18/2413Classification techniques relating to the classification model, e.g. parametric or non-parametric approaches based on distances to training or reference patterns
    • G06F18/24133Distances to prototypes
    • G06F18/24137Distances to cluster centroïds
    • G06F18/2414Smoothing the distance, e.g. radial basis function networks [RBFN]
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/25Fusion techniques
    • G06F18/254Fusion techniques of classification results, e.g. of results related to same input data
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/40Extraction of image or video features
    • G06V10/44Local feature extraction by analysis of parts of the pattern, e.g. by detecting edges, contours, loops, corners, strokes or intersections; Connectivity analysis, e.g. of connected components
    • G06V10/443Local feature extraction by analysis of parts of the pattern, e.g. by detecting edges, contours, loops, corners, strokes or intersections; Connectivity analysis, e.g. of connected components by matching or filtering
    • G06V10/449Biologically inspired filters, e.g. difference of Gaussians [DoG] or Gabor filters
    • G06V10/451Biologically inspired filters, e.g. difference of Gaussians [DoG] or Gabor filters with interaction between the filter responses, e.g. cortical complex cells
    • G06V10/454Integrating the filters into a hierarchical structure, e.g. convolutional neural networks [CNN]
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/40Extraction of image or video features
    • G06V10/50Extraction of image or video features by performing operations within image blocks; by using histograms, e.g. histogram of oriented gradients [HoG]; by summing image-intensity values; Projection analysis
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/82Arrangements for image or video recognition or understanding using pattern recognition or machine learning using neural networks

Definitions

  • the present invention relates to a method for recognizing objects in an image of the surroundings using a neural network, in particular a convolutional neural network using deep learning, for a driving support system of a vehicle.
  • a neural network in particular a convolutional neural network using deep learning
  • the image of the surroundings is received and encoded to provide a two-dimensional grid with image information.
  • Object recognition is then carried out based on the image information.
  • the present invention also relates to a driving assistance system for a vehicle, in particular as an improved driver assistance system, with at least one camera-based environment sensor for providing an image of the surroundings and a control unit which receives the image of the environment from the at least one camera-based environment sensor, the driving assistance system being designed to carry out the above method .
  • ADAS Advanced Driver Assistance Systems
  • An important system parameter is a grid size of the grid, i.e. a size of cells that are defined by the grid.
  • This grid size defines a total number of objects that can be recognized and classified. In addition, this results in a spatial accuracy of the detection and classification of the objects.
  • FIG. 1 a shows an image of the surroundings 100 that was recorded with a camera-based surroundings sensor of a vehicle.
  • the image of the surroundings 100 shows a roadway 102 with two lateral footpaths 104.
  • several objects 106 which are pedestrians here, can be seen in the image of the surroundings 100.
  • FIG. 1b) shows a uniform grid placed over the image of the surroundings 100 with a plurality of regular cells 108.
  • the cells 108 define a resolution for which the image of the surroundings 100 is encoded and image information is provided.
  • the grid is selected to be fine, so that distant objects 106 can also be reliably detected and classified in the image of the surroundings 100. For nearby objects 106, however, the identification and classification of the objects 106 requires a comparatively large amount of processing.
  • FIG. 1c) also shows a uniform grid placed over the image of the surroundings 100 with a plurality of regular cells 108. The cells 108. In FIG. 1c), the grid is roughly selected compared to the representation in FIG. 1b), so that objects in the vicinity are recognized very efficiently and can be classified.
  • the fine grid of FIG. 1b also enables an improved differentiation of objects that extend over several cells. However, this goes hand in hand with an increased processing effort, with an increased number of regression steps typically being required.
  • the invention is therefore based on the object of developing a method for recognizing objects in an image of the surroundings using a neural network, in particular a convolutional neural network using deep learning, for a driving support system of a vehicle, as well specify a corresponding driving support system for carrying out the method, which enables a reliable and efficient detection of objects in images of the surroundings.
  • a method for recognizing objects in an image of the surroundings using a neural network, in particular a convolutional neural network using deep learning, for a driving support system of a vehicle comprising the steps of receiving the image of the surroundings, encoding the image of the surroundings to provide a two-dimensional grid, which has a first resolution, with Image information, subdividing the surrounding image into a plurality of image areas with at least one first image area and at least one second image area, performing a decoding step in the at least one second image area to provide a two-dimensional grid that has a second resolution that is lower than the first resolution Image information, and performing an object recognition based on the image information of the plurality of image areas, wherein the at least one first image area has the first resolution and the at least one second image area has the second resolution.
  • a driving support system for a vehicle in particular as an improved driver assistance system, with at least one camera-based environment sensor for providing an image of the surroundings and a control unit that receives the image of the surroundings from the at least one camera-based environment sensor is also specified, the driving assistance system being designed to carry out the above method .
  • the basic idea of the present invention is therefore to provide the image information of an image of the surroundings with a different degree of detail so that, on the one hand, the entire image of the surroundings can be efficiently processed and, on the other hand, no important detailed information is lost.
  • the image of the surroundings is first encoded in order to provide the image information with the first resolution.
  • the image information of the first resolution is preprocessed in the decoding step in order to provide the at least one second image area with a lower resolution of the image information.
  • At least a first image area remains with the resolution of the image information as it is present after encoding, and which can be decoded without the need for additional processing in order to recognize and classify objects.
  • the image information is provided with a resolution depending on the respective image area, so that it can be processed efficiently in a correspondingly adapted network structure of the neural network.
  • the detection of the objects can be carried out optimally for each of the image areas, since there are comparable ratios of the objects in relation to the cells of the grid.
  • distant objects which are relatively small in the surrounding image, can have a high reliability. Close objects that are relatively large in the image of the surroundings can also be recognized well.
  • the training for recognizing the objects is made easier, since the objects are represented similarly in each of the image areas and are therefore easy to recognize.
  • meta-knowledge about the information to be expected in the image of the surroundings is preferably used in order to define the different image areas and to divide the image of the surroundings accordingly.
  • the meta-knowledge relates, for example, to knowledge about an assembly and / or alignment of the at least one camera-based environmental sensor on the vehicle.
  • the grid defines an arrangement of cells with image information.
  • the grid can, for example, define a cell size of 16 x 16 pixels or 32 x 32 pixels for the first resolution, a balance here too between a desired level of detail in the detection and classification of the objects and the processing speed.
  • the grid can, for example, define a corresponding cell size of 32 x 32 pixels or 64 x 64 pixels for the second resolution.
  • the grid can define cells with any dimensions, it not being necessary for the cells to include the same number of pixels in each plane direction. This applies to each resolution independently.
  • the cells for one resolution can have a square shape, while the cells for another resolution have a rectangular shape.
  • the cells for another resolution can have a different rectangular shape.
  • the cells of the at least one second image area with the second resolution each combine a plurality of cells of the at least one image area with the first resolution.
  • the cells for the grid can be newly formed with the second resolution and, for example, comprise non-integer multiples of cells with the first resolution.
  • the at least one second image area relates to an area of the environmental image that is defined by the second resolution.
  • the image of the surroundings can thus have a plurality of independent second image areas, which can be contiguous or non-contiguous. The same applies to the at least one first image area.
  • the subdivision of the surrounding image into the plurality of image areas can accordingly take place with a high degree of freedom.
  • the detection of objects in the image of the surroundings relates to a detection of the objects with their position and a classification of the object, for example as a pedestrian, car, truck, tree, house, dog or the like.
  • the neural network is designed in particular as a convolutional neural network using deep learning.
  • Convolutional Neural Networks are widespread in the field of object recognition and are highly reliable.
  • the driving assistance system is designed, for example, as an improved driver assistance system.
  • improved driver assistance systems are known, for example, as ADAS (Advanced Driver Assistance Systems) and can include various functions. These functions can include, for example, a blind spot assistant, a lane departure warning system and / or a collision warning and protection system.
  • ADAS Advanced Driver Assistance Systems
  • these functions can include, for example, a blind spot assistant, a lane departure warning system and / or a collision warning and protection system.
  • the detection of objects is also relevant for other driving support functions through to the implementation of functions for autonomous driving of vehicles.
  • the environment image is an image provided by the camera-based environment sensor. It contains a matrix with image points (pixels) which at least partially reproduce the surroundings of the vehicle.
  • the surrounding image can only include brightness information for the individual pixels, ie the image of the surroundings is an image in the manner of a black / white image, or brightness information for a plurality of colors, for example in the RGB format or others.
  • the camera-based environment sensor can be designed as a camera that only provides a brightness value for individual pixels, or the camera-based environment sensor is, for example, a camera for providing color information, ie a brightness value for each color that can be perceived by the camera.
  • the environment image can be provided by a single camera-based environment sensor alone or as a combination of several individual images from a plurality of camera-based environment sensors together.
  • the latter usually relates to a combination of the multiple individual images in a horizontal direction in order to create the image of the surroundings in the manner of a panorama image.
  • the camera-based environment sensor can be designed as an optical camera.
  • optical camera For example, wide-angle cameras through to cameras with fish-eye lenses are used in current vehicles for monitoring the surroundings.
  • the optical camera can be designed for visible light and / or for light in wavelengths that are not visible to humans, for example for ultraviolet light or for infrared light.
  • the encoding of the image of the surroundings to provide a two-dimensional grid with image information includes providing image information for each cell formed by the grid. Different image information can be provided for this purpose, as set out below.
  • the encoding of the image of the surroundings includes, in particular, an encoding of the image of the surroundings with a CNN encoder to provide the image information for the entire image of the surroundings in accordance with the grid with the first resolution.
  • the resolution of the image information relates to a level of detail in the image information. More image information means a higher resolution, less image information means a lower resolution. Accordingly, a higher resolution means providing one finer grid, ie with smaller cells, whereas a lower resolution means providing a coarser grid, ie with larger cells.
  • Carrying out the decoding step in the at least one second image area to provide a two-dimensional raster, which has a second resolution that is lower than the first resolution, with image information relates to processing the image information with the first resolution in the area of the at least one second image area to provide the two-dimensional grid with the image information with the second resolution therefrom.
  • the image information in the at least one first image area is adopted unchanged for the subsequent object recognition.
  • An object recognition is carried out based on the image information of the plurality of image areas.
  • Various approaches are known as such in the prior art to perform object recognition, as further specified below.
  • the image of the surroundings is provided by the at least one camera-based surroundings sensor and transmitted to the control unit.
  • the control unit After receiving the image of the surroundings, the control unit carries out the encoding of the image of the surroundings, the subdivision of the image of the surroundings into the image areas, the decoding step in the at least one second image area to provide the two-dimensional grid, which has a second resolution that is lower than the first resolution, with image information as well as performing the object recognition based on the image information of the plurality of image areas.
  • the control unit is also referred to as an ECU (Electronic Control Unit).
  • the control unit is preferably designed as an embedded device and is provided in the vehicle.
  • subdividing the environmental image into a plurality of image areas includes subdividing the environmental image into a plurality of image areas with at least one third image area, and the method includes an additional step of performing a decoding step in the at least one third image area to provide a two-dimensional grid that has a third resolution that is lower than the first resolution and is different from the second resolution, with image information.
  • the surrounding image can therefore be divided into three image areas, whereby the same principles can be applied as with the division into only two image areas.
  • a division into four or more image areas with different resolutions is also conceivable.
  • the individual image areas can be arranged contiguously or distributed and not contiguous.
  • dividing the image of the surroundings into a plurality of image areas includes dividing the image of the surroundings into a plurality of image areas with at least one fourth image area, and the method includes an additional step for discarding image information in the at least one fourth image area.
  • the meta-knowledge relates to a knowledge of the installation and alignment of the at least one camera-based environment sensor on the vehicle, whereby, for example, areas in the environment image can be identified that are covered or overlap with a field of view of another camera and therefore do not have to be processed twice.
  • areas with strong distortions can be excluded from further processing, as can sometimes occur when using wide-angle optics through to fish-eye lenses.
  • the subdivision of the environmental image into a plurality of image areas with the at least one fourth image area is preferably carried out as a static subdivision, in particular when the at least one fourth image area is based on meta-knowledge about the assembly and alignment of the at least one camera-based environmental sensor on the vehicle, i.e. on static information .
  • the fourth image area can also be defined dynamically, for example by determining the horizon or an area with sky in previous images of the surroundings.
  • the method comprises an additional step for identifying a horizon of the image of the surroundings, and the subdivision of the image of the surroundings into a plurality of image areas with at least one fourth image area is carried out based on the horizon.
  • objects are usually located below or only slightly above a horizon plane in the image of the surroundings.
  • image information can be discarded from an upper edge of the image downwards, but at a distance above the horizon, since no relevant objects are to be expected there on the road, ie no objects that are relevant for driving the vehicle.
  • objects in the air are usually of little relevance.
  • an upper row with cells with the encoded image information in the grid with the first resolution above the horizon can be discarded.
  • several rows with cells can also be discarded.
  • dividing the image of the surroundings into a plurality of image areas comprises dividing the image of the surroundings into two image areas along at least one horizontal line, with the at least one second image area and / or the at least one third image area being based on an orientation of the image of the surroundings below the at least one horizontal line is arranged.
  • the subdivision of the image of the surroundings to form the different image areas along the horizontal line or along a plurality of horizontal lines is based on a typical image division of the at least one camera-based environmental sensor. In particular when driving outside of built-up areas, closer objects are typically located below a horizontal line in the image of the surroundings compared to more distant objects.
  • a size within the image of the surroundings is typically dependent on their vertical position in the image of the surroundings. This can be taken into account by dividing the image of the surroundings along the at least one horizontal line. Image areas below a horizontal line preferably have a grid with a lower resolution than image areas above the corresponding horizontal line.
  • performing an object recognition based on the image information of the plurality of image areas includes performing an independent object recognition in the plurality of image areas and merging the object recognition of the plurality of image areas for object recognition in the surrounding image.
  • the same principles can therefore be used for each of the image areas can be used to capture and recognize objects.
  • the object recognition for the different image areas can also be carried out with the same decoder, since there are no or only minor differences in principle for the objects with regard to the resolution of the raster in the different image areas.
  • performing an independent object recognition in the plurality of image areas includes an independent object recognition using at least one regression layer of a deep neural network, YOLO and / or SSD.
  • a deep neural network YOLO and / or SSD.
  • Each image area of the respective environment image can be processed in the same way or in a different way.
  • the same deep neural network can also be used to process the image information of different image areas, since objects have the same properties regardless of their position.
  • YOLO is an abbreviation for "You only look once”
  • SSD is an abbreviation for "Single Shot multibox Detector". Both YOLO and SSD are known as such in the prior art and are therefore not explained in detail at this point.
  • YOLO as well as SSD are well suited for real-time object recognition, especially in embedded systems.
  • the merging of the object recognition of the plurality of image areas for object recognition in the surrounding image includes providing a uniform resolution space for providing a list with merged object recognitions.
  • the recognized objects can be made available for further processing in a uniform manner.
  • encoding the image of the surroundings to provide a two-dimensional grid with image information and / or performing a decoding step in the at least one second image area to provide a two-dimensional grid with image information for each cell defined by the grid includes providing for each recognized object an object trustworthiness, a position of a bounding box enclosing the object, determining dimensions of the bounding box, and a Determining an object class probability for each object class to be recognized.
  • object trustworthiness specifies how high the trust in the existence of an object is.
  • the object class probability for each possible object class indicates the probability that the recognized object belongs to the corresponding object class. Further information is the position and dimensions of the bounding box that encloses the object, which enables easy handling of the recognized object. Objects at borders within each cell can also lie at borders thereof, and the objects themselves can extend over these several cells as recognized objects of several cells.
  • the image information preferably includes information that relates not only to the respective cell, but also to neighboring cells or other cells located in the vicinity.
  • the objects can be recognized with a high degree of reliability, in particular in the case of objects that extend over more than a single cell.
  • FIG. 1 shows a view of an image of the surroundings with a road with lateral
  • FIG. 2 shows a view of a vehicle with a driving assistance system, in particular as an improved driver assistance system, with a camera-based environment sensor for providing an image of the environment and a control unit that controls the Receives environmental image from the camera-based environmental sensor, according to a first, preferred embodiment,
  • FIG. 3 shows a view of an image of the surroundings with a road with lateral
  • Footpaths and a plurality of people alone and with a grid comprising an image area with a fine grid and an image area with a coarse grid in accordance with the first embodiment
  • FIG. 4 shows a system illustration of the driving assistance system from FIG.
  • FIG. 5 shows a view of an image of the surroundings with a road with sidewalks and a person extending over several cells of an image area with a fine grid and several cells of an image area with a coarse grid, in accordance with the first embodiment
  • FIG. 6 shows a flow diagram of a method for recognizing objects in an image of the surroundings using a neural network in accordance with the first embodiment.
  • FIG. 2 shows a vehicle 10 with a driving support system 12 according to a first, preferred embodiment.
  • the driving assistance system 12 is designed, for example, as an improved driver assistance system.
  • improved driver assistance systems are known, for example, as ADAS (Advanced Driver Assistance Systems) and can include various functions. These functions can include, for example, a blind spot assistant, a lane departure warning system and / or a collision warning and protection system.
  • the driving support system 12 can support functions up to and including autonomous driving of the vehicle 10.
  • the driving assistance system 12 is shown by way of example in FIG. 2 with a camera-based environment sensor 14.
  • the camera-based environment sensor 14 is an optical camera in this exemplary embodiment.
  • the optical camera 14 has, for example, a resolution of approximately 2 megapixels.
  • the driving support system 12 also includes a control unit 16.
  • the control unit 16 is also referred to as an ECU (Electronic Control Unit) in the field of vehicles.
  • the control unit 16 is embodied as an embedded device and is provided in the vehicle 10.
  • the optical camera 14 is connected to the control unit 16 via a data bus 18.
  • the optical camera 14 detects the surroundings 20 of the vehicle 10 and records images of the surroundings 30, which are transmitted to the control unit 16 via the data bus 18.
  • the surroundings images 30 each contain a matrix with image points (pixels) which at least partially reproduce the surroundings 20 of the vehicle 10.
  • the image of the surroundings 30 comprises brightness information for a plurality of colors for each pixel, for example in the RGB or other format, which is provided by the optical camera 14.
  • FIGS. 3 to 6 a method for recognizing objects 36 in the image of the surroundings 30 using a neural network is described below.
  • objects 36 pedestrians 36 are represented in the image of surroundings 30 by way of example.
  • the neural network is a convolutional neural network using deep learning. The method is carried out with the driving support system 12 described above.
  • step S100 which relates to receiving the image 30 of the surroundings.
  • the image of the surroundings 30 is recorded by the optical camera 14 and transmitted to the control unit 16 via the data bus 18.
  • Step S110 relates to an encoding of the image of the surroundings 30 in order to provide a two-dimensional grid 38, which has a first resolution, with image information.
  • a plurality of cells 40 is formed by the grid 38, image information being provided for each of the cells 40 by the encoding.
  • the grid 38 thus defines an arrangement of the cells 40 with image information, the cells 40 in the exemplary embodiment described having a cell size of 16 ⁇ 16 pixels for the first resolution.
  • the encoding of the image of the surroundings 30 includes an encoding of the image of the surroundings 30 with a CNN encoder 42, which is shown in FIG. 4, for providing the image information for the entire image of the surroundings 30 according to the grid 38 with the first resolution.
  • the control unit 16 includes the encoder 42 and carries out the encoding of the environmental image 30.
  • An object trustworthy value, a position of a bounding box 44 which encloses the object 36, dimensions of the bounding box 44 and an object class probability for each object class to be recognized are determined as image information for each cell 40 defined by the grid 38 for each recognized object 36.
  • the object trustworthiness specifies how high the trust in the existence of an object 36 is.
  • the object class probability for each possible object class indicates the probability that the recognized object 36 belongs to the corresponding object class.
  • Further information is the position and dimensions of the bounding box 44 which encloses the object 36.
  • the image information includes information that relates not only to the respective cell 40, but also to neighboring cells 40 or other cells 40 located in the vicinity.
  • Step S120 relates to subdividing the image of the surroundings 30 into a plurality of image areas 46a, 46b, 46c.
  • the image of the surroundings is first divided into an upper half 50 and a lower half 52 of the image.
  • the upper half of the image 50 is then divided into a first image area 46a and a fourth image area 46c.
  • the fourth image area 46c is formed on the upper edge of the image 30 of the surroundings.
  • the lower half of the image 52 forms a second image area 46b.
  • the image of the surroundings 30 is divided along horizontal lines 48.
  • a horizon of the image of the surroundings 30 lies parallel to the two horizontal lines 48, as a result of which the subdivision of the image areas 46a, 46b, 46c and in particular the establishment of the fourth image area 46c takes place based on the horizon.
  • the subdivision of the surrounding image 30 into the image areas 46a, 46b, 46c takes place as a static subdivision.
  • Step S120 can also be carried out at any earlier point in time than the configuration of the driving support system 12.
  • the subdivision of the environmental image into the image areas 46a, 46b, 46c is therefore identical for all environmental images 30 of the same type, i.e. for all environmental images 30 of the optical camera 14.
  • Step S130 relates to discarding image information in the fourth image area 46c.
  • the image information at the upper edge of the environmental image 30 is discarded, i.e. the image information from an upper image edge of the environmental image 30 downwards, but at a distance above the horizon, is discarded, since no relevant objects 36 are to be expected there on the road 32.
  • Step S140 relates to carrying out a decoding step in the second image region 46b in order to provide a two-dimensional raster 38, which has a second resolution, which is lower than the first resolution, with image information.
  • the image information is fed to a decoder 54, which is implemented in the control unit 16 and carries out the decoding step.
  • the decoding step comprises processing the image information with the first resolution of the surrounding image 30 in the area of the second image area 46b in order to provide therefrom the two-dimensional raster 38 with the image information with the second resolution, which is lower than the first resolution.
  • This is indicated in FIG. 4 by the fact that the lower half of the image 52 at the end of the decoding step, ie after passing through the decoder 54, has a smaller size than before passing through the decoder 54.
  • the grid 38 in the second Image area 46b has a cell size of 32 x 32 pixels.
  • the image information of the image areas 46a, 46b, 46c is then combined and further processed together, as shown in FIG. There is one Combination of the two different grids 38 for an image of the surroundings 30, as is also shown in FIG. 3b.
  • Step S150 relates to performing an object recognition based on the image information of the image areas 46a, 46b, 46c.
  • the image information is adopted unchanged in the first image area 46a.
  • the detection of objects 36 in the image of the surroundings 30 relates to a detection of the objects 36 with their position and a classification of the respective object 36, for example as a pedestrian, car, truck, tree, house, dog or the like.
  • An object recognition is carried out based on the image information of the plurality of image areas 46a, 46b, 46c. In this case, an independent object recognition is carried out in the first and second image areas 46a, 46b. The object recognition of the first and second image areas 46a, 46b is then merged to completely complete the object recognition in the environmental image 30. The same principles are used for the first and second image areas 46a, 46b in order to detect and recognize the objects 36. The object recognition for the first and second image areas 46a, 46b can in principle be carried out with the same decoder 54.
  • the object recognition is carried out in detail using at least one regression layer of a deep neural network, YOLO and / or SSD.
  • YOLO is an abbreviation for "You only look once”
  • SSD is an abbreviation for "Single Shot multibox Detector”.
  • the merging of the object recognition of the first and second image areas 46a, 46b for object recognition in the environment image 30 includes providing a uniform resolution space for providing a list with merged object recognitions. As a result, the recognized objects 36 are made available in a uniform manner for further processing.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Physics & Mathematics (AREA)
  • Multimedia (AREA)
  • Evolutionary Computation (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Artificial Intelligence (AREA)
  • Data Mining & Analysis (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Health & Medical Sciences (AREA)
  • General Health & Medical Sciences (AREA)
  • Molecular Biology (AREA)
  • Software Systems (AREA)
  • Medical Informatics (AREA)
  • Biodiversity & Conservation Biology (AREA)
  • Biomedical Technology (AREA)
  • Computing Systems (AREA)
  • Databases & Information Systems (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Evolutionary Biology (AREA)
  • General Engineering & Computer Science (AREA)
  • Image Analysis (AREA)
  • Traffic Control Systems (AREA)

Abstract

Die Erfindung betrifft ein Verfahren zur Erkennung von Objekten (36) in einem Umgebungsbild (30) unter Verwendung eines neuronalen Netzes, insbesondere eines Konvolutionellen Neuronalen Netzes unter Verwendung von Deep Learning, für ein Fahrunterstützungssystem (12) eines Fahrzeugs (10), umfassend die Schritte Empfangen des Umgebungsbildes (30), Enkodieren des Umgebungsbildes (30) zur Bereitstellung eines zweidimensionalen Rasters (38), das eine erste Auflösung aufweist, mit Bildinformation, Unterteilen des Umgebungsbildes (30) in eine Mehrzahl Bildbereiche (46a, 46b, 46c) mit wenigstens einem ersten Bildbereich (46a) und wenigstens einem zweiten Bildbereich (46b), Durchführen eines Dekodierschrittes in dem wenigstens einen zweiten Bildbereich (46b) zur Bereitstellung eines zweidimensionalen Rasters (38), das eine zweite Auflösung aufweist, die niedriger ist als die erste Auflösung, mit Bildinformation, und Durchführen einer Objekterkennung basierend auf der Bildinformation der Mehrzahl Bildbereiche (46a, 46b, 46c), wobei der wenigstens eine erste Bildbereich (46a) die erste Auflösung und der wenigstens eine zweite Bildbereich (46b) die zweite Auflösung aufweist. Die Erfindung betrifft außerdem ein Fahrunterstützungssystem (12) für ein Fahrzeug (10) mit wenigstens einem kamerabasierten Umgebungssensor (14) zur Bereitstellung eines Umgebungsbildes (30) und einer Steuerungseinheit (16), welche das Umgebungsbild (30) von dem wenigstens einen kamerabasierten Umgebungssensor (14) empfängt, wobei das Fahrunterstützungssystem (12) ausgeführt ist, das obige Verfahren durchzuführen.

Description

Verbesserte Detektion von Objekten
Die vorliegende Erfindung betrifft ein Verfahren zur Erkennung von Objekten in einem Umgebungsbild unter Verwendung eines neuronalen Netzes, insbesondere eines Konvolutionellen Neuronalen Netzes unter Verwendung von Deep Learning, für ein Fahrunterstützungssystem eines Fahrzeugs. Verfahrensgemäß wird das Umgebungsbild empfangen und enkodiert zur Bereitstellung eines zweidimensionalen Rasters mit Bildinformation. Anschließend wird eine Objekterkennung basierend auf der Bildinformation durchgeführt.
Auch betrifft die vorliegende Erfindung ein Fahrunterstützungssystem für ein Fahrzeug, insbesondere als verbessertes Fahrerassistenzsystem, mit wenigstens einem kamerabasierten Umgebungssensor zur Bereitstellung eines Umgebungsbildes und einer Steuerungseinheit, welche das Umgebungsbild von dem wenigstens einen kamerabasierten Umgebungssensor empfängt, wobei das Fahrunterstützungssystem ausgeführt ist, das obige Verfahren durchzuführen.
Entsprechende Verfahren und Fahrunterstützungssysteme werden bereits in Fahrzeugen verschiedener Fiersteller verwendet, um den Fahrzeugführer beim Führen des Fahrzeugs zu unterstützen und dadurch die Fahrsicherheit für alle Verkehrsteilnehmer zu verbessern. Dabei sind insbesondere verbessertes Fahrerassistenzsysteme bekannt, die üblicherweise als ADAS (Advanced Driver Assistance Systems) bezeichnet werden und verschiedenen Funktionen umfassen können.
Diese Fahrunterstützungssysteme basieren auf einer guten Kenntnis der Umgebung des Fahrzeugs, um ihre jeweilige Unterstützungsfunktion bereitstellen zu können. Dabei bekommen kamerabasierte Umgebungssensoren eine zunehmende Bedeutung, um beispielsweise Objekte wie Fahrzeuge oder Fußgänger zu erkennen und korrekt zu klassifizieren.
Im Stand der Technik werden solche Objekterkennungen oftmals mit Systemen basierend auf Deep Learning (Verwendung tiefer neuronaler Netwerke) bereitgestellt. Dabei ergibt sich bei der Verwendung in Fahrzeugen oftmals, dass eine Abwägung zwischen einer Erkennungsleistung und einer Verarbeitungsgeschwindigkeit durchgeführt werden muss, um die Umgebungsbilder in Echtzeit verarbeiten zu können. Nur dadurch können entsprechende Systeme als eingebettete Systeme in Fahrzeugen bereitgestellt werden, ohne dass die Kosten ausufern und die Fahrunterstützungssysteme und damit auch die Fahrzeuge bezahlbar bleiben. Daher finden auch Gitter-basierte Detektoren wie YOLO (You only look once) oder SSD (Single Shot Multibox Detector) besonders in solchen eingebetteten Systemen Verwendung, da sie ein günstiges Laufzeitverhalten aufweisen. Diese Gitter-basierten Detektoren verwenden einen einfachen, relativ schnell zu berechnenden Regressionsschritt, um einhüllende Rechtecke (Bounding Boxes) von Objekten zu bestimmen.
Ein wichtiger Systemparameter ist dabei eine Gittergröße des Gitters, d.h. eine Größe von Zellen, die durch das Gitter definiert werden. Diese Gittergröße definiert eine gesamte Anzahl von Objekten, die erkannt und klassifiziert werden können. Außerdem ergibt sich dadurch eine räumliche Genauigkeit der Erkennung und Klassifizierung der Objekte.
Dazu ist in Figur 1a) ein Umgebungsbild 100 dargestellt, das mit einem kamerabasierten Umgebungssensor eines Fahrzeugs aufgenommen wurde. Das Umgebungsbild 100 zeigt eine Fahrbahn 102 mit zwei seitlichen Fußwegen 104. Zusätzlich sind mehrere Objekte 106, die hier Fußgänger sind, in dem Umgebungsbild 100 zu erkennen.
Figur 1b) zeigt ein über das Umgebungsbild 100 gelegtes einheitliches Raster mit einer Mehrzahl regelmäßiger Zellen 108. Die Zellen 108 definieren dabei eine Auflösung, für die jeweils eine Enkodierung des Umgebungsbildes 100 erfolgt und Bildinformation bereitgestellt wird. In Figur 1b) ist das Raster fein gewählt, so dass auch entfernte Objekte 106 in dem Umgebungsbild 100 zuverlässig erfasst und klassifiziert werden können. Für nahe Objekte 106 erfordert die Erkennung und Klassifizierung der Objekte 106 jedoch einen vergleichsweise großen Verarbeitungsaufwand. Figur 1c) zeigt ebenfalls ein über das Umgebungsbild 100 gelegtes einheitliches Raster mit einer Mehrzahl regelmäßiger Zellen 108. Die Zellen 108. In Figur 1c) ist das Raster gegenüber der Darstellung in Figur 1b) grob gewählt, so dass Objekte in der Nähe sehr effizient erkannt und klassifiziert werden können. Aufgrund des groben Raster können allerdings entfernte Objekte 106 in dem Umgebungsbild 100 nicht immer zuverlässig erfasst und klassifiziert werden. Dies betrifft insbesondere Objekte im Bereich eines Florizonts des Umgebungsbildes, wo oftmals eine hohe Anzahl von relevanten Objekten in dem Umgebungsbild vorhanden ist, insbesondere beim Fahren mit einer hohen Geschwindigkeit, beispielsweise auf Landstraßen oder Autobahnen.
Auch können aufgrund des feinen Raster der Figur 1b) mehr Objekte erfasst und klassifiziert werden, als bei dem groben Raster der Figur 1c). Das feine Raster der Figur 1b) ermöglicht darüber hinaus eine verbesserte Unterscheidung von Objekten, die sich über mehrere Zellen erstrecken. Dies geht allerdings mit einem erhöhten Verarbeitungsaufwand einher, wobei typischerweise eine erhöhte Anzahl von Regressionsschritten erforderlich ist.
Ausgehend von dem oben genannten Stand der Technik liegt der Erfindung somit die Aufgabe zugrunde, ein Verfahren zur Erkennung von Objekten in einem Umgebungsbild unter Verwendung eines neuronalen Netzes, insbesondere eines Konvolutionellen Neuronalen Netzes unter Verwendung von Deep Learning, für ein Fahrunterstützungssystem eines Fahrzeugs, wie auch ein entsprechendes Fahrunterstützungssystem zur Durchführung des Verfahrens anzugeben, die eine zuverlässige und effiziente Erfassung von Objekten in Umgebungsbildern ermöglichen.
Die Lösung der Aufgabe erfolgt erfindungsgemäß durch die Merkmale der unabhängigen Ansprüche. Vorteilhafte Ausgestaltungen der Erfindung sind in den Unteransprüchen angegeben.
Erfindungsgemäß ist somit ein Verfahren zur Erkennung von Objekten in einem Umgebungsbild unter Verwendung eines neuronalen Netzes, insbesondere eines Konvolutionellen Neuronalen Netzes unter Verwendung von Deep Learning, für ein Fahrunterstützungssystem eines Fahrzeugs, angegeben, umfassend die Schritte Empfangen des Umgebungsbildes, Enkodieren des Umgebungsbildes zur Bereitstellung eines zweidimensionalen Rasters, das eine erste Auflösung aufweist, mit Bildinformation, Unterteilen des Umgebungsbildes in eine Mehrzahl Bildbereiche mit wenigstens einem ersten Bildbereich und wenigstens einem zweiten Bildbereich, Durchführen eines Dekodierschrittes in dem wenigstens einen zweiten Bildbereich zur Bereitstellung eines zweidimensionalen Rasters, das eine zweite Auflösung aufweist, die niedriger ist als die erste Auflösung, mit Bildinformation, und Durchführen einer Objekterkennung basierend auf der Bildinformation der Mehrzahl Bildbereiche, wobei der wenigstens eine erste Bildbereich die erste Auflösung und der wenigstens eine zweite Bildbereich die zweite Auflösung aufweist.
Erfindungsgemäß ist außerdem ein Fahrunterstützungssystem für ein Fahrzeug, insbesondere als verbessertes Fahrerassistenzsystem, mit wenigstens einem kamerabasierten Umgebungssensor zur Bereitstellung eines Umgebungsbildes und einer Steuerungseinheit, welche das Umgebungsbild von dem wenigstens einen kamerabasierten Umgebungssensor empfängt, angegeben, wobei das Fahrunterstützungssystem ausgeführt ist, das obige Verfahren durchzuführen.
Grundidee der vorliegenden Erfindung ist es also, die Bildinformation eines Umgebungsbildes mit einem unterschiedlichen Detailgrad bereitzustellen, so dass einerseits eine effiziente Verarbeitung des gesamten Umgebungsbildes erfolgen kann und andererseits keine wichtige Detailinformation verloren geht. Dazu wird das Umgebungsbild zunächst enkodiert, um die Bildinformation mit der ersten Auflösung bereitzustellen. Für den wenigstens einen zweiten Bildbereich wird die Bildinformation der ersten Auflösung in dem Dekodierschritt vorverarbeitet, um den wenigstens einen zweiten Bildbereich mit einer geringeren Auflösung der Bildinformation bereitzustellen. Dadurch kann die Verarbeitung der Bildinformation für den wenigstens einen zweiten Bildbereich beschleunigt durchgeführt werden. Es verbliebt wenigstens ein erster Bildbereich mit der Auflösung der Bildinformation, wie sie nach dem Enkodieren vorliegt, und die ohne Notwendigkeit einer zusätzlichen Bearbeitung dekodiert werden kann, um Objekte zu erkennen und zu klassifizieren. Dadurch wird die Bildinformation mit einer Auflösung abhängig von dem jeweiligen Bildbereich bereitgestellt, so dass sie in einer entsprechend angepassten Netzstruktur des Neuronalen Netzes effizient verarbeitet werden kann. Darüber hinaus kann die Erkennung der Objekte für jeden der Bildbereiche optimal durchgeführt werden, da sich vergleichbare Verhältnisse der Objekte in Bezug auf die Zellen des Rasters ergeben. Dadurch können entfernte Objekte, die in dem Umgebungsbild eine relativ geringe Größe aufweisen, mit einer hohen Zuverlässigkeit erkannt werden. Auch nahe Objekte, die in dem Umgebungsbild eine relativ große Größe aufweisen, können gut erkannt werden. Gleichzeit wird bei der Verwendung von neuronalen Netzen das Training zur Erkennung der Objekte erleichtert, da sich die Objekte in jedem der Bildbereiche ähnlich darstellen und sie daher leicht zu erkennen sind.
Dabei wird vorzugsweise Metawissen über die zu erwartende Information in dem Umgebungsbild ausgenutzt, um die unterschiedlichen Bildbereiche zu definieren und das Umgebungsbild entsprechend aufzuteilen. Das Metawissen betrifft beispielsweise ein Wissen über eine Montage und/oder Ausrichtung des wenigstens einen kamerabasierten Umgebungssensors an dem Fahrzeug. Dadurch können Bildbereiche, in denen die zu erkennenden Objekte typischerweise eine kleine Größe in dem Umgebungsbild aufweisen, und Bildbereiche, in denen die zu erkennenden Objekte typischerweise eine große Größe in dem Umgebungsbild aufweisen, festgelegt und deren Bildinformation entsprechend verarbeitet werden.
Das Raster definiert eine Anordnung von Zellen mit Bildinformation. Das Raster kann beispielsweise eine Zellgröße von 16 x 16 Pixel oder 32 x 32 Pixel für die erste Auflösung definieren, wobei auch hier zwischen einem gewünschten Detailgrad bei der Erkennung und Klassifizierung der Objekte und der Verarbeitungsgeschwindigkeit abzuwägen ist. Das Raster kann beispielsweise eine entsprechende Zellgröße von 32 x 32 Pixel oder 64 x 64 Pixel für die zweite Auflösung definieren. Dadurch kann beispielsweise statt der Bildinformation von vier Zellen des Rasters mit der ersten Auflösung zu lediglich Bildinformation für eine einzelne Zelle bereitgestellt werden zur weiteren Verarbeitung.
Prinzipiell kann das Raster Zellen mit beliebigen Abmessungen definieren, wobei es nicht erforderlich ist, dass die Zellen in jeder Ebenenrichtung die gleiche Anzahl Bildpunkte umfassen. Dies gilt für jede Auflösung unabhängig. So können beispielsweise die Zellen für eine Auflösung eine quadratische Form aufweisen, während die Zellen für eine andere Auflösung eine rechteckige Form aufweisen. Für eine wieder andere Auflösung können die Zellen eine davon abweichende rechteckige Form aufweisen. Auch ist es nicht erforderlich, dass die Zellen des wenigstens einen zweiten Bildbereichs mit der zweiten Auflösung jeweils eine Mehrzahl Zellen des wenigstens einen Bildbereichs mit der ersten Auflösung zusammenfassen. Prinzipiell können ausgehend von der ersten Auflösung die Zellen für das Raster mit der zweiten Auflösung neu gebildet werden und beispielsweise nicht ganzzahlige Vielfache von Zellen mit der ersten Auflösung umfassen.
Der wenigstens eine zweite Bildbereich betrifft eine Bereich des Umgebungsbildes, der durch die zweite Auflösung definiert ist. Somit kann das Umgebungsbild mehrere unabhängige zweite Bildbereiche aufweisen, die zusammenhängend oder nicht zusammenhängend sein können. Entsprechendes gilt für den wenigstens einen ersten Bildbereich. Das Unterteilen des Umgebungsbildes in die Mehrzahl Bildbereiche kann entsprechend mit einem hohen Freiheitsgrad erfolgen.
Die Erkennung von Objekten in dem Umgebungsbild betrifft ein Erkennen der Objekte mit ihrer Position und einer Klassifizierung des Objekts, beispielsweise als Fußgänger, PKW, LKW, Baum, Haus, Hund oder ähnliches.
Das neuronale Netz ist insbesondere als Konvolutionelles Neuronales Netz unter Verwendung von Deep Learning ausgeführt. Konvolutionelle Neuronale Netze (Convolutional Neural Networks, CNN) sind im Bereich der Objekterkennung verbreitet und weisen eine hohe Zuverlässigkeit auf.
Das Fahrunterstützungssystem ist beispielsweise als verbessertes Fahrerassistenzsystem ausgeführt. Solche verbesserten Fahrerassistenzsysteme sind beispielsweise als ADAS (Advanced Driver Assistance Systems) bekannt und können verschiedenen Funktionen umfassen. Dies Funktionen können beispielhaft einen Toter Winkel-Assistent, einen Spurhalteassistent und/oder ein Kollisionswarn- und Schutzsystem umfassen. Darüber hinaus ist die Erkennung von Objekten auch für andere Fahrunterstützungsfunktionen bis hin zur Realisierung von Funktionen zum autonomen Fahren von Fahrzeugen relevant.
Das Umgebungsbild ist ein von dem kamerabasierten Umgebungssensor bereitgestelltes Bild. Es enthält eine Matrix mit Bildpunkten (Pixel), welche die Umgebung des Fahrzeugs zumindest teilweise wiedergeben. Das Umgebungsbild kann lediglich Helligkeitsinformation für die einzelnen Bildpunkte umfassen, d. h. das Umgebungsbild ist ein Bild nach der Art eines schwarz/weiß-Bildes, oder Helligkeitsinformation für eine Mehrzahl Farben, beispielsweise in dem Format RGB oder andere. Entsprechend kann der kamerabasierte Umgebungssensor als Kamera ausgeführt sein, die für einzelne Bildpunkte lediglich eine Helligkeitswert bereitstellt, oder der kamerabasierte Umgebungssensor ist beispielsweise eine Kamera zur Bereitstellung von Farbinformation, d.h. einem Helligkeitswert für jede Farbe, die von der Kamera wahrnehmbar ist.
Darüber hinaus kann das Umgebungsbild von einem einzelnen kamerabasierten Umgebungssensor alleine oder als Kombination von mehreren Einzelbildern von einer Mehrzahl kamerabasierter Umgebungssensoren gemeinsam bereitgestellt werden. Letzteres betrifft üblicherweise eine Kombination der mehreren Einzelbilder in einer horizontalen Richtung zur Erstellung des Umgebungsbildes nach der Art eines Panoramabildes.
Der kamerabasierte Umgebungssensor kann als optische Kamera ausgeführt sein. Beispielsweise finden in aktuellen Fahrzeugen zur Überwachung der Umgebung Weitwinkelkameras bis hin zu Kameras mit Fischaugenlinsen Verbreitung. Die optische Kamera kann für sichtbares Licht und/oder für Licht in für Menschen nicht sichtbaren Wellenlängen ausgeführt sein, beispielsweise für ultraviolettes Licht oder für infrarotes Licht.
Das Enkodieren des Umgebungsbildes zur Bereitstellung eines zweidimensionalen Rasters mit Bildinformation umfasst ein Bereitstellen von Bildinformation für jede durch das Raster gebildete Zelle. Unterschiedliche Bildinformation kann dazu bereitgestellt werden, wie nachstehend ausgeführt ist. Das Enkodieren des Umgebungsbildes umfasst insbesondere ein Enkodieren des Umgebungsbildes mit einem CNN Enkodierer zur Bereitstellung der Bildinformation für das gesamte Umgebungsbild gemäß dem Raster mit der ersten Auflösung.
Die Auflösung der Bildinformation betrifft einen Detailgrad der Bildinformation. Mehr Bildinformation bedeutet eine höhere Auflösung, weniger Bildinformation eine geringere Auflösung. Entsprechend bedeutet eine höhere Auflösung eine Bereitstellung eines feineren Rasters, d.h. mit kleineren Zellen, wohingegen eine geringere Auflösung eine Bereitstellung eines gröberen Rasters, d.h. mit größeren Zellen, bedeutet.
Das Durchführen des Dekodierschrittes in dem wenigstens einen zweiten Bildbereich zur Bereitstellung eines zweidimensionalen Rasters, das eine zweite Auflösung aufweist, die niedriger ist als die erste Auflösung, mit Bildinformation betrifft eine Verarbeitung der Bildinformation mit der ersten Auflösung im Bereich des wenigstens einen zweiten Bildbereichs, um daraus das zweidimensionale Raster mit der Bildinformation mit der zweiten Auflösung bereitzustellen. Die Bildinformation in dem wenigstens einen ersten Bildbereich wird unverändert für die nachfolgende Objekterkennung übernommen.
Das Durchführen einer Objekterkennung erfolgt basierend auf der Bildinformation der Mehrzahl Bildbereiche. Verschiedene Ansätze sind als solche im Stand der Technik bekannt, um die Objekterkennung durchzuführen, wie nachstehend weiter spezifiziert wird.
In dem Fahrunterstützungssystem wird das Umgebungsbild von dem wenigstens einen kamerabasierten Umgebungssensor bereitgestellt und an die Steuerungseinheit übertragen. Die Steuerungseinheit führt im nach dem Empfang des Umgebungsbildes das Enkodieren des Umgebungsbildes, das Unterteilen des Umgebungsbildes in die Bildbereiche, den Dekodierschritt in dem wenigstens einen zweiten Bildbereich zur Bereitstellung des zweidimensionalen Rasters, das eine zweite Auflösung aufweist, die niedriger ist als die erste Auflösung, mit Bildinformation sowie das Durchführen der Objekterkennung basierend auf der Bildinformation der Mehrzahl Bildbereiche durch. Die Steuerungseinheit wird im Bereich von Fahrzeugen auch als ECU (Electronic Control Unit) bezeichnet. Die Steuerungseinheit ist vorzugsweise als eingebettetes Gerät ausgeführt und in dem Fahrzeug bereitgestellt.
In vorteilhafter Ausgestaltung der Erfindung umfasst das Unterteilen des Umgebungsbildes in eine Mehrzahl Bildbereiche ein Unterteilen des Umgebungsbildes in eine Mehrzahl Bildbereiche mit wenigstens einem dritten Bildbereich, und das Verfahren umfasst einen zusätzlichen Schritt zum Durchführen eines Dekodierschrittes in dem wenigstens einen dritten Bildbereich zur Bereitstellung eines zweidimensionalen Rasters, das eine dritte Auflösung aufweist, die niedriger als die erste Auflösung und unterschiedlich zu der zweiten Auflösung ist, mit Bildinformation. Prinzipiell kann das Umgebungsbild also in drei Bildbereiche aufgeteilt werden, wobei die gleichen Prinzipien anwendbar sind, wie bei der Aufteilung in nur zwei Bildbereiche. Auf die gleiche Weise ist auch eine Aufteilung in vier oder mehr Bildbereiche mit unterschiedlichen Auflösungen denkbar. Wie zuvor beschrieben können die einzelnen Bildbereiche dabei zusammenhängend oder verteilt und nicht zusammenhängend angeordnet sein.
In vorteilhafter Ausgestaltung der Erfindung umfasst das Unterteilen des Umgebungsbildes in eine Mehrzahl Bildbereiche ein Unterteilen des Umgebungsbildes in eine Mehrzahl Bildbereiche mit wenigstens einem vierten Bildbereich, und das Verfahren umfasst einen zusätzlichen Schritt zum Verwerfen von Bildinformation in dem wenigstens einen vierten Bildbereich. Dies ermöglicht es, beispielsweise Metawissen über die zu erwartende Information in dem Umgebungsbild auszunutzen, um dadurch die Verarbeitung der Bildinformation zu beschleunigen. Das Metawissen betrifft ein Wissen über die Montage und Ausrichtung des wenigstens einen kamerabasierten Umgebungssensors an dem Fahrzeug, wodurch sich beispielsweise Bereiche in dem Umgebungsbild identifizieren lassen, die verdeckt sind oder mit einem Sichtfeld einer weiteren Kamera überlappen, und deshalb nicht doppelt verarbeitet werden müssen. Weiter können Bereich mit starken Verzerrungen von der weiteren Verarbeitung ausgeklammert werden, wie sie teilweise bei der Verwendung von Weitwinkeloptiken bis hin zu Fischaugenlinsen auftreten können.
Das Unterteilen des Umgebungsbildes in eine Mehrzahl Bildbereiche mit dem wenigstens einen vierten Bildbereich erfolgt vorzugsweise als statische Unterteilung, insbesondere wenn der wenigstens eine vierte Bildbereich basierend auf Metawissen über die Montage und Ausrichtung des wenigstens einen kamerabasierten Umgebungssensors an dem Fahrzeug, basiert, also auf statischer Information.
Prinzipiell kann aber auch eine dynamische Festlegung des vierten Bildbereichs erfolgen, beispielsweise durch eine Bestimmung des Horizonts oder eines Bereichs mit Himmel in vorherigen Umgebungsbildern.
In vorteilhafter Ausgestaltung der Erfindung umfasst das Verfahren einen zusätzlichen Schritt zum Identifizieren eines Horizonts des Umgebungsbilds, und das Unterteilen des Umgebungsbildes in eine Mehrzahl Bildbereiche mit wenigstens einem vierten Bildbereich erfolgt basierend auf dem Horizont. Für das Fahren auf einer Straße ist wichtig zu wissen, welche Objekte sich auf der Straße befinden. Diese Objekte befinden sich üblicherweise unterhalb oder nur geringfügig oberhalb einer Horizontebene in dem Umgebungsbild. In diesem Fall kann beispielsweise Bildinformation von einem oberen Bildrand des Umgebungsbildes abwärts, aber mit einem Abstand oberhalb des Horizonts, verworfen werden, da dort keine relevanten Objekte auf der Straße zu erwarten sind, d.h. keine Objekte, die für das Führen des Fahrzeugs relevant sind. Für auf einer Straße fahrende Fahrzeug sind Objekte in der Luft üblicherweise von geringer Relevanz. Entsprechend kann beispielsweise eine obere Reihe mit Zellen mit der enkodierten Bildinformation in dem Raster mit der ersten Auflösung oberhalb des Horizonts verworfen werden. Abhängig von der ersten Auflösung können auch mehrere Reihen mit Zellen verworfen werden.
In vorteilhafter Ausgestaltung der Erfindung umfasst das Unterteilen des Umgebungsbildes in eine Mehrzahl Bildbereiche ein Unterteilen des Umgebungsbildes in zwei Bildbereiche entlang wenigstens einer horizontalen Linie, wobei insbesondere der wenigstens eine zweite Bildbereich und/oder der wenigstens eine dritte Bildbereich bezogen auf eine Ausrichtung des Umgebungsbildes unterhalb der wenigstens einen horizontalen Linie angeordnet ist. Das Unterteilen des Umgebungsbildes zur Bildung der unterschiedlichen Bildbereiche entlang der horizontalen Linie oder entlang mehrerer horizontaler Linien basiert auf einer typischen Bildaufteilung des wenigstens einen kamerabasierten Umgebungssensors. Insbesondere beim Fahren außerhalb von Ortschaften befinden sich nähere Objekte in dem Umgebungsbild typischerweise unterhalb einer horizontalen Linie verglichen mit entfernteren Objekten. Entsprechend ist für gleichartige Objekte eine Größe innerhalb des Umgebungsbildes typischerweise abhängig von ihrer vertikalen Position in dem Umgebungsbild. Dem kann durch die Aufteilung des Umgebungsbildes entlang der wenigstens einen horizontalen Linie Rechnung getragen werden. Dabei weisen Bildbereiche unterhalb einer horizontalen Linie vorzugsweise ein Raster mit einer geringeren Auflösung auf als Bildbereiche oberhalb der entsprechenden horizontalen Linie.
In vorteilhafter Ausgestaltung der Erfindung umfasst das Durchführen einer Objekterkennung basierend auf der Bildinformation der Mehrzahl Bildbereiche ein Durchführen einer unabhängigen Objekterkennung in der Mehrzahl Bildbereiche und ein Fusionieren der Objekterkennung der Mehrzahl Bildbereiche zur Objekterkennung in dem Umgebungsbild. Es können also die selben Prinzipien für jeden der Bildbereiche angewendet werden, um Objekte zu erfassen und zu erkennen. Auch kann die Objekterkennung für die verschiedenen Bildbereiche mit dem gleichen Dekodierer durchgeführt werden, da es keine oder nur geringe prinzipielle Unterschiede für die Objekte in Bezug auf die Auflösung des Raster in den verschiedenen Bildbereichen gibt. Durch das Fusionieren der Objekterkennung der Mehrzahl Bildbereiche können auch Objekte in Übergangsbereichen zwischen unterschiedlichen Bildbereichen zuverlässig erkannt werden.
In vorteilhafter Ausgestaltung der Erfindung umfasst das Durchführen einer unabhängigen Objekterkennung in der Mehrzahl Bildbereiche eine unabhängige Objekterkennung unter Verwendung wenigstens einer Regressionsschicht eines tiefen neuronalen Netzes, YOLO und/oder SSD. Dabei kann jeder Bildbereich des jeweiligen Umgebungsbildes auf dieselbe Weise verarbeitet werden, oder auf eine unterschiedliche Weise. Prinzipiell kann auch beispielsweise dasselbe tiefe Neuronale Netz verwendet werden, um die Bildinformation verschiedener Bildbereiche zu verarbeiten, da Objekte unabhängig von ihrer Position dieselben Eigenschaften aufweisen. YOLO steht dabei als Abkürzung für „You only look once“, SSD steht als Abkürzung für „Single Shot multibox Detector“. Sowohl YOLO wie auch SSD sind als solche im Stand der Technik bekannt und werden daher an dieser Stelle nicht im Detail erläutert. YOLO wie auch SSD sind zur Echtzeit-Objekterkennung insbesondere in eingebetteten Systemen gut geeignet.
In vorteilhafter Ausgestaltung der Erfindung umfasst das Fusionieren der Objekterkennung der Mehrzahl Bildbereiche zur Objekterkennung in dem Umgebungsbild ein Bereitstellen eines einheitlichen Auflösungsraums zur Bereitstellung einer Liste mit fusionierten Objekterkennungen. Dadurch können die erkannten Objekte in einer einheitlichen Weise zur weiteren Verarbeitung bereitgestellt werden.
In vorteilhafter Ausgestaltung der Erfindung umfassen das Enkodieren des Umgebungsbildes zur Bereitstellung eines zweidimensionalen Rasters mit Bildinformation und/oder das Durchführen eines Dekodierschrittes in dem wenigstens einen zweiten Bildbereich zur Bereitstellung eines zweidimensionalen Rasters mit Bildinformation für jede durch das Raster definierte Zelle für jedes erkannte Objekt ein Bereitstellen eines Objektvertrauenswertes, einer Position einer Bounding Box, die das Objekt umschließt, ein Bestimmen von Abmessungen der Bounding Box und ein Bestimmen einer Objektklassenwahrscheinlichkeit für jede zu erkennende Objektklasse. Diese Arten der Bildinformation können verwendet werden, um darauf basierend die Objekte in dem Umgebungsbild mit ihrer Position und Objektart zu erkennen für eine weitere Verarbeitung. Dabei spezifiziert der Objektvertrauenswert, wie hoch das Vertrauen in die Existenz eines Objekts ist. Darüber hinaus gibt die Objektklassenwahrscheinlichkeit für jede mögliche Objektklasse die Wahrscheinlichkeit an, dass das erkannte Objekt zu der entsprechenden Objektklasse gehört. Weitere Informationen sind die Position und Abmessungen der Bounding Box, die das Objekt umschließt, wodurch eine einfache Handhabung des erkannten Objekts erfolgen kann. Dabei können Objekte an Grenzen innerhalb jeder Zelle auch an Grenzen davon liegen, und die Objekte selber können sich als erkannte Objekte mehrerer Zellen über diese mehreren Zellen erstrecken.
Die Bildinformation umfasst vorzugsweise Information, die nicht nur die jeweilige Zelle betrifft, sondern auch benachbarte Zellen oder andere, in der Nähe befindliche Zellen. Dadurch können die Objekte mit einer hohen Zuverlässigkeit erkannt werden, insbesondere bei Objekten, die sich über mehr als eine einzelne Zelle erstrecken.
Nachfolgend wird die Erfindung unter Bezugnahme auf die anliegende Zeichnung anhand bevorzugter Ausführungsformen näher erläutert. Die dargestellten Merkmale können sowohl jeweils einzeln als auch in Kombination einen Aspekt der Erfindung darstellen. Merkmale verschiedener Ausführungsbeispiele sind übertragbar von einem Ausführungsbeispiel auf ein anderes.
Es zeigt
Fig. 1 eine Ansicht eines Umgebungsbildes mit einer Straße mit seitlichen
Fußwegen und einer Mehrzahl Personen alleine und mit einem feinen Raster sowie mit einem groben Raster von Bildinformation gemäß dem Stand der Technik,
Fig. 2 eine Ansicht eines Fahrzeugs mit einem Fahrunterstützungssystem, insbesondere als verbessertes Fahrerassistenzsystem, mit einem kamerabasierten Umgebungssensor zur Bereitstellung eines Umgebungsbildes und einer Steuerungseinheit, welche das Umgebungsbild von dem kamerabasierten Umgebungssensor empfängt, gemäß einer ersten, bevorzugten Ausführungsform,
Fig. 3 eine Ansicht eines Umgebungsbildes mit einer Straße mit seitlichen
Fußwegen und einer Mehrzahl Personen alleine und mit einem Raster umfassend einen Bildbereich mit einem feinen Raster und einen Bildbereich mit einem groben Raster in Übereinstimmung mit der ersten Ausführungsform,
Fig. 4 eine Systemdarstellung des Fahrunterstützungssystems aus Fig. 2 zur
Erfassung und Klassifizierung basierend auf einem Raster umfassend einen Bildbereich mit einem feinen Raster und einen Bildbereich mit einem groben Raster in Übereinstimmung mit der Darstellung in Fig. 3,
Fig. 5 eine Ansicht eines Umgebungsbildes mit einer Straße mit seitlichen Fußwegen und einer Person, die sich über mehrere Zellen eines Bildbereichs mit einem feinen Raster und mehrere Zellen eines Bildbereichs mit einem groben Raster erstreckt, in Übereinstimmung mit der ersten Ausführungsform, und
Fig. 6 ein Ablaufdiagramm eines Verfahrens zur Erkennung von Objekten in einem Umgebungsbild unter Verwendung eines neuronalen Netzes in Übereinstimmung mit der ersten Ausführungsform.
Die Figur 2 zeigt ein Fahrzeug 10 mit einem Fahrunterstützungssystem 12 gemäß einer ersten, bevorzugten Ausführungsform.
Das Fahrunterstützungssystem 12 ist beispielsweise als verbessertes Fahrerassistenzsystem ausgeführt. Solche verbesserten Fahrerassistenzsysteme sind beispielsweise als ADAS (Advanced Driver Assistance Systems) bekannt und können verschiedenen Funktionen umfassen. Dies Funktionen können beispielhaft einen Toter Winkel-Assistent, einen Spurhalteassistent und/oder ein Kollisionswarn- und Schutzsystem umfassen. Alternativ kann das Fahrunterstützungssystem 12 Funktionen bis hin zum autonomen Fahren des Fahrzeugs 10 unterstützen. Das Fahrunterstützungssystem 12 ist in Figur 2 beispielhaft mit einem kamerabasierten Umgebungssensor 14 dargestellt. Der kamerabasierte Umgebungssensor 14 ist in diesem Ausführungsbeispiel eine optische Kamera. Die optische Kamera 14 hat beispielhaft eine Auflösung von etwa 2 Megapixel.
Das Fahrunterstützungssystem 12 umfasst außerdem eine Steuerungseinheit 16. Die Steuerungseinheit 16 wird im Bereich von Fahrzeugen auch als ECU (Electronic Control Unit) bezeichnet. Die Steuerungseinheit 16 ist als eingebettetes Gerät ausgeführt und in dem Fahrzeug 10 bereitgestellt.
Die optische Kamera 14 ist über einen Datenbus 18 mit der Steuerungseinheit 16 verbunden. Die optische Kamera 14 erfasst eine Umgebung 20 des Fahrzeugs 10 und nimmt Umgebungsbilder 30 auf, die über den Datenbus 18 an die Steuerungseinheit 16 übertragen werden. Die Umgebungsbilder 30 enthalten jeweils eine Matrix mit Bildpunkten (Pixel), welche die Umgebung 20 des Fahrzeugs 10 zumindest teilweise wiedergeben. Das Umgebungsbild 30 umfasst in diesem Ausführungsbeispiel für jedes Pixel Helligkeitsinformation für eine Mehrzahl Farben, beispielsweise in dem Format RGB oder andere, die von der optischen Kamera 14 bereitgestellt wird.
Nachstehend wird unter zusätzlichem Bezug auf die Figuren 3 bis 6 ein Verfahren zur Erkennung von Objekten 36 in dem Umgebungsbild 30 unter Verwendung eines neuronalen Netzes beschrieben. Ein beispielhaftes Umgebungsbild 30, das in den Figuren gezeigt ist, zeigt eine Fahrbahn 32 mit seitlichen Fußwegen 34. Als Objekte 36 sind beispielhaft Fußgänger 36 in dem Umgebungsbild 30 dargestellt. Das Neuronale Netz ist in diesem Ausführungsbeispiel ein konvolutioneiles Neuronales Netzes unter Verwendung von Deep Learning. Das Verfahren wird mit dem oben beschriebenen Fahrunterstützungssystem 12 durchgeführt.
Das Verfahren beginnt mit Schritt S100, der ein Empfangen des Umgebungsbildes 30 betrifft. Das Umgebungsbild 30 wird von der optischen Kamera 14 aufgenommen und über den Datenbus 18 an die Steuerungseinheit 16 übertragen.
Schritt S110 betrifft ein Enkodieren des Umgebungsbildes 30 zur Bereitstellung eines zweidimensionalen Rasters 38, das eine erste Auflösung aufweist, mit Bildinformation. Durch das Raster 38 wird eine Mehrzahl Zellen 40 gebildet, wobei für jede der Zellen 40 durch das Enkodieren Bildinformation bereitgestellt wird. Das Raster 38 definiert somit eine Anordnung der Zellen 40 mit Bildinformation, wobei die Zellen 40 in dem beschriebenen Ausführungsbeispiel eine Zellgröße von 16 x 16 Pixel für die erste Auflösung aufweisen. Das Enkodieren des Umgebungsbildes 30 umfasst ein Enkodieren des Umgebungsbildes 30 mit einem CNN Enkodierer 42, der in Figur 4 dargestellt ist, zur Bereitstellung der Bildinformation für das gesamte Umgebungsbild 30 gemäß dem Raster 38 mit der ersten Auflösung. Die Steuerungseinheit 16 führt umfasst den Enkodierer 42 und führt das Enkodieren des Umgebungsbildes 30 durch.
Als Bildinformation werden für jede durch das Raster 38 definierte Zelle 40 für jedes erkannte Objekt 36 ein Objektvertrauenswertes, eine Position einer Bounding Box 44, die das Objekt 36 umschließt, Abmessungen der Bounding Box 44 und eine Objektklassenwahrscheinlichkeit für jede zu erkennende Objektklasse bestimmt. Dabei spezifiziert der Objektvertrauenswert, wie hoch das Vertrauen in die Existenz eines Objekts 36 ist. Darüber hinaus gibt die Objektklassenwahrscheinlichkeit für jede mögliche Objektklasse die Wahrscheinlichkeit an, dass das erkannte Objekt 36 zu der entsprechenden Objektklasse gehört. Weitere Informationen sind die Position und Abmessungen der Bounding Box 44, die das Objekt 36 umschließt. Die Bildinformation umfasst Information, die nicht nur die jeweilige Zelle 40 betrifft, sondern auch benachbarte Zellen 40 oder andere, in der Nähe befindliche Zellen 40.
Schritt S120 betrifft ein Unterteilen des Umgebungsbildes 30 in eine Mehrzahl Bildbereiche 46a, 46b, 46c. Dazu wird das Umgebungsbild zunächst in eine obere Bildhälfte 50 und eine untere Bildhälfte 52 geteilt. Die obere Bildhälfte 50 wird dann in einen ersten Bildbereich 46a und einen vierten Bildbereich 46c geteilt. Der vierte Bildbereich 46c ist am oberen Rand des Umgebungsbildes 30 gebildet. Die untere Bildhälfte 52 bildet einen zweiten Bildbereich 46b. Das Umgebungsbild 30 ist dabei entlang von horizontalen Linien 48 unterteilt.
Ein Horizont des Umgebungsbildes 30 liegt parallel zu den beiden horizontalen Linien 48, wodurch das Unterteilen der Bildbereiche 46a, 46b, 46c und insbesondere das Festlegen des vierten Bildbereichs 46c basierend auf dem Horizont erfolgt. Das Unterteilen des Umgebungsbildes 30 in die Bildbereiche 46a, 46b, 46c erfolgt als statische Unterteilung.
Schritt S120 kann auch zu einem beliebigen, früheren Zeitpunkt durchgeführt werden als Konfiguration des Fahrunterstützungssystems 12. Die Unterteilung des Umgebungsbildes in die Bildbereiche 46a, 46b, 46c ist also für alle gleichartigen Umgebungsbilder 30 identisch, d.h. für alle Umgebungsbilder 30 der optischen Kamera 14.
Schritt S130 betrifft ein Verwerfen von Bildinformation in dem vierten Bildbereich 46c. Entsprechend wird die Bildinformation am oberen Rand des Umgebungsbildes 30 verworfen, d.h. die Bildinformation von einem oberen Bildrand des Umgebungsbildes 30 abwärts, aber mit einem Abstand oberhalb des Horizonts, wird verworfen, da dort keine relevanten Objekte 36 auf der Straße 32 zu erwarten sind.
Schritt S140 betrifft ein Durchführen eines Dekodierschrittes in dem zweiten Bildbereich 46b zur Bereitstellung eines zweidimensionalen Rasters 38, das eine zweite Auflösung aufweist, die niedriger ist als die erste Auflösung, mit Bildinformation. Dazu wird die Bildinformation einem Dekodierer 54 zugeführt, der in der Steuerungseinheit 16 implementiert ist und den Dekodierschritt durchführt.
Der Dekodierschritt umfasst eine Verarbeitung der Bildinformation mit der ersten Auflösung des Umgebungsbildes 30 im Bereich des zweiten Bildbereichs 46b, um daraus das zweidimensionale Raster 38 mit der Bildinformation mit der zweiten Auflösung, die niedriger ist als die erste Auflösung, bereitzustellen. Dies ist in Figur 4 dadurch angedeutet, dass die untere Bildhälfte 52 am Ende des Dekodierschritts, d.h. nach dem Durchgang durch den Dekodierer 54, eine geringere Größe aufweist als vor dem Durchgang durch den Dekodierer 54. In diesem Ausführungsbeispiel weist das Raster 38 in dem zweiten Bildbereich 46b eine Zellgröße von 32 x 32 Pixel auf. Dadurch kann die Bildinformation von vier Zellen 40 des Rasters 38 mit der ersten Auflösung zu Bildinformation für lediglich eine einzelne Zelle 40 des Rasters 38 mit der zweiten Auflösung bereitgestellt werden zur weiteren Verarbeitung.
Die Bildinformation der Bildbereiche 46a, 46b, 46c wird im Anschluss kombiniert und gemeinsam weiterverarbeitet, wie in Figur 4 dargestellt ist. Es ergibt sich eine Kombination der beiden unterschiedlichen Raster 38 für ein Umgebungsbild 30, wie auch in Figur 3b dargestellt ist.
Schritt S150 betrifft ein Durchführen einer Objekterkennung basierend auf der Bildinformation der Bildbereiche 46a, 46b, 46c. Dazu wird die Bildinformation in dem ersten Bildbereich 46a unverändert übernommen.
Die Erkennung von Objekten 36 in dem Umgebungsbild 30 betrifft ein Erkennen der Objekte 36 mit ihrer Position und einer Klassifizierung des jeweiligen Objekts 36, beispielsweise als Fußgänger, PKW, LKW, Baum, Haus, Hund oder ähnliches.
Das Durchführen einer Objekterkennung erfolgt basierend auf der Bildinformation der Mehrzahl Bildbereiche 46a, 46b, 46c. Dabei wird eine unabhängige Objekterkennung in dem ersten und zweiten Bildbereich 46a, 46b durchgeführt. Anschließend erfolgt ein Fusionieren der Objekterkennung des ersten und zweiten Bildbereichs 46a, 46b zur vollständigen Vervollständigung der Objekterkennung in dem Umgebungsbild 30. Es werden dabei dieselben Prinzipien für den ersten und zweiten Bildbereich 46a, 46b angewendet, um die Objekte 36 zu erfassen und zu erkennen. Dabei kann die Objekterkennung für den ersten und zweiten Bildbereich 46a, 46b prinzipiell mit dem gleichen Dekodierer 54 durchgeführt werden.
Die Objekterkennung wird im Detail unter Verwendung wenigstens einer Regressionsschicht eines tiefen neuronalen Netzes, YOLO und/oder SSD durchgeführt. YOLO steht dabei als Abkürzung für „You only look once“, SSD steht als Abkürzung für „Single Shot multibox Detector“.
Durch das Fusionieren der Objekterkennung des ersten und zweiten Bildbereichs 46a, 46b werden auch Objekte 36 in Übergangsbereichen zwischen dem ersten und zweiten Bildbereich 46a, 46b zuverlässig erkannt, wie in Figur 5 dargestellt ist.
Das Fusionieren der Objekterkennung des ersten und zweiten Bildbereichs 46a, 46b zur Objekterkennung in dem Umgebungsbild 30 umfasst ein Bereitstellen eines einheitlichen Auflösungsraums zur Bereitstellung einer Liste mit fusionierten Objekterkennungen. Dadurch werden die erkannten Objekte 36 in einer einheitlichen Weise zur weiteren Verarbeitung bereitgestellt. SEITE ABSICHTLICH LEER GELASSEN
Bezugszeichenliste 10 Fahrzeug
12 Fahrunterstützungssystem
14 Kamera
16 Steuerungseinheit, ECU
18 Datenbus
20 Umgebung
30 Umgebungsbild
32 Fahrbahn
34 Fußweg
36 Objekt, Fußgänger
38 Raster
40 Zelle
42 Enkodierer
44 Bounding Box
46a erster Bildbereich
46b zweiter Bildbereich
46c vierter Bildbereich
48 horizontale Linie
50 obere Bildhälfte
52 untere Bildhälfte
54 Dekodierer
100 Umgebungsbild (Stand der Technik) 102 Fahrbahn (Stand der T echnik)
104 Fußweg (Stand der T echnik)
106 Objekt (Stand der Technik)
108 Zelle (Stand der T echnik)

Claims

Patentansprüche
1. Verfahren zur Erkennung von Objekten (36) in einem Umgebungsbild (30) unter Verwendung eines neuronalen Netzes, insbesondere eines Konvolutionellen Neuronalen Netzes unter Verwendung von Deep Learning, für ein Fahrunterstützungssystem (12) eines Fahrzeugs (10), umfassend die Schritte
Empfangen des Umgebungsbildes (30),
Enkodieren des Umgebungsbildes (30) zur Bereitstellung eines zweidimensionalen Rasters (38), das eine erste Auflösung aufweist, mit Bildinformation,
Unterteilen des Umgebungsbildes (30) in eine Mehrzahl Bildbereiche (46a, 46b, 46c) mit wenigstens einem ersten Bildbereich (46a) und wenigstens einem zweiten Bildbereich (46b),
Durchführen eines Dekodierschrittes in dem wenigstens einen zweiten Bildbereich (46b) zur Bereitstellung eines zweidimensionalen Rasters (38), das eine zweite Auflösung aufweist, die niedriger ist als die erste Auflösung, mit Bildinformation, und
Durchführen einer Objekterkennung basierend auf der Bildinformation der Mehrzahl Bildbereiche (46a, 46b, 46c), wobei der wenigstens eine erste Bildbereich (46a) die erste Auflösung und der wenigstens eine zweite Bildbereich (46b) die zweite Auflösung aufweist.
2. Verfahren nach Anspruch 1 , dadurch gekennzeichnet, dass das Unterteilen des Umgebungsbildes (30) in eine Mehrzahl Bildbereiche (46a, 46b, 46c) ein Unterteilen des Umgebungsbildes (30) in eine Mehrzahl Bildbereiche (46a, 46b, 46c) mit wenigstens einem dritten Bildbereich umfasst, und das Verfahren einen zusätzlichen Schritt umfasst zum Durchführen eines Dekodierschrittes in dem wenigstens einen dritten Bildbereich zur Bereitstellung eines zweidimensionalen Rasters (38), das eine dritte Auflösung aufweist, die niedriger als die erste Auflösung und unterschiedlich zu der zweiten Auflösung ist, mit Bildinformation.
3. Verfahren nach einem der vorhergehenden Ansprüche 1 oder 2, dadurch gekennzeichnet, dass das Unterteilen des Umgebungsbildes (30) in eine Mehrzahl Bildbereiche (46a, 46b, 46c) ein Unterteilen des Umgebungsbildes (30) in eine Mehrzahl Bildbereiche (46a, 46b, 46c) mit wenigstens einem vierten Bildbereich (46c) umfasst, und das Verfahren einen zusätzlichen Schritt zum Verwerfen von Bildinformation in dem wenigstens einen vierten Bildbereich (46c) umfasst.
4. Verfahren nach Anspruch 3, dadurch gekennzeichnet, dass das Verfahren einen zusätzlichen Schritt zum Identifizieren eines Horizonts des Umgebungsbilds (30) umfasst, und das Unterteilen des Umgebungsbildes (30) in eine Mehrzahl Bildbereiche (46a, 46b, 46c) mit wenigstens einem vierten Bildbereich (46c) basierend auf dem Horizont erfolgt.
5. Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass das Unterteilen des Umgebungsbildes (30) in eine Mehrzahl Bildbereiche (46a, 46b, 46c) ein Unterteilen des Umgebungsbildes (30) in zwei Bildbereiche entlang wenigstens einer horizontalen Linie (48) umfasst, wobei insbesondere der wenigstens eine zweite Bildbereich (46b) und/oder der wenigstens eine dritte Bildbereich bezogen auf eine Ausrichtung des Umgebungsbildes (30) unterhalb der wenigstens einen horizontalen Linie (48) angeordnet ist.
6. Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass das Durchführen einer Objekterkennung basierend auf der Bildinformation der Mehrzahl Bildbereiche (46a, 46b, 46c) ein Durchführen einer unabhängigen Objekterkennung in der Mehrzahl Bildbereiche (46a, 46b, 46c) und ein Fusionieren der Objekterkennung der Mehrzahl Bildbereiche (46a, 46b, 46c) zur Objekterkennung in dem Umgebungsbild (30) umfasst.
7. Verfahren nach Anspruch 6, dadurch gekennzeichnet, dass das Durchführen einer unabhängigen Objekterkennung in der Mehrzahl Bildbereiche (46a, 46b, 46c) eine unabhängige Objekterkennung unter Verwendung wenigstens einer Regressionsschicht eines tiefen neuronalen Netzes, YOLO und/oder SSD umfasst.
8. Verfahren nach einem der vorhergehenden Ansprüche 6 oder 7, dadurch gekennzeichnet, dass das Fusionieren der Objekterkennung der Mehrzahl Bildbereiche (46a,
46b, 46c) zur Objekterkennung in dem Umgebungsbild (30) ein Bereitstellen eines einheitlichen Auflösungsraums zur Bereitstellung einer Liste mit fusionierten Objekterkennungen umfasst.
9. Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass das Enkodieren des Umgebungsbildes (30) zur Bereitstellung eines zweidimensionalen Rasters (38) mit Bildinformation und/oder das Durchführen eines Dekodierschrittes in dem wenigstens einen zweiten Bildbereich (46b) zur Bereitstellung eines zweidimensionalen Rasters (38) mit Bildinformation für jede durch das Raster (38) definierte Zelle (40) für jedes erkannte Objekt (36) ein Bereitstellen eines Objektvertrauenswertes, einer Position einer Bounding Box (44), die das Objekt (36) umschließt, ein Bestimmen von Abmessungen der Bounding Box (44) und ein Bestimmen einer Objektklassenwahrscheinlichkeit für jede zu erkennende Objektklasse umfassen.
10. Fahrunterstützungssystem (12) für ein Fahrzeug (10), insbesondere als verbessertes Fahrerassistenzsystem, mit wenigstens einem kamerabasierten Umgebungssensor (14) zur Bereitstellung eines Umgebungsbildes (30) und einer Steuerungseinheit (16), welche das Umgebungsbild (30) von dem wenigstens einen kamerabasierten Umgebungssensor (14) empfängt, wobei das Fahrunterstützungssystem (12) ausgeführt ist, das Verfahren nach einem der vorhergehenden Ansprüche 1 bis 9 durchzuführen.
EP21723981.3A 2020-05-12 2021-05-06 Verbesserte detektion von objekten Pending EP4150508A1 (de)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
DE102020112860.6A DE102020112860A1 (de) 2020-05-12 2020-05-12 Verbesserte Detektion von Objekten
PCT/EP2021/062026 WO2021228686A1 (de) 2020-05-12 2021-05-06 Verbesserte detektion von objekten

Publications (1)

Publication Number Publication Date
EP4150508A1 true EP4150508A1 (de) 2023-03-22

Family

ID=75850207

Family Applications (1)

Application Number Title Priority Date Filing Date
EP21723981.3A Pending EP4150508A1 (de) 2020-05-12 2021-05-06 Verbesserte detektion von objekten

Country Status (3)

Country Link
EP (1) EP4150508A1 (de)
DE (1) DE102020112860A1 (de)
WO (1) WO2021228686A1 (de)

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2020028116A1 (en) * 2018-07-30 2020-02-06 Optimum Semiconductor Technologies Inc. Object detection using multiple neural networks trained for different image fields

Family Cites Families (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
DE102011121473A1 (de) 2011-12-17 2013-06-20 Valeo Schalter Und Sensoren Gmbh Verfahren zum Anzeigen von Bildern auf einer Anzeigeeinrichtung eines Kraftfahrzeugs,Fahrerassistenzeinrichtung, Kraftfahrzeug und Computerprogramm
EP2696310B1 (de) 2012-08-10 2017-10-18 Delphi Technologies, Inc. Verfahren zum Identifizieren eines Straßenrands
DE102013201545A1 (de) 2013-01-30 2014-07-31 Bayerische Motoren Werke Aktiengesellschaft Erstellen eines Umfeldmodells für ein Fahrzeug
US9305214B1 (en) * 2013-10-29 2016-04-05 The United States Of America, As Represented By The Secretary Of The Navy Systems and methods for real-time horizon detection in images
DE102015212771A1 (de) 2015-07-08 2017-01-12 Bayerische Motoren Werke Aktiengesellschaft Vorrichtung zur Erkennung von teilverdeckten beweglichen Objekten für ein Umfelderfassungssystem eines Kraftfahrzeugs
DE102017130488A1 (de) 2017-12-19 2019-06-19 Valeo Schalter Und Sensoren Gmbh Verfahren zur Klassifizierung von Parklücken in einem Umgebungsbereich eines Fahrzeugs mit einem neuronalen Netzwerk
US10949711B2 (en) * 2018-04-23 2021-03-16 Intel Corporation Non-maximum suppression of features for object detection
DE102018114229A1 (de) 2018-06-14 2019-12-19 Connaught Electronics Ltd. Verfahren zum Bestimmen eines Bewegungszustands eines Objekts in Abhängigkeit einer erzeugten Bewegungsmaske und eines erzeugten Begrenzungsrahmens, Fahrerassistenzsystem sowie Kraftfahrzeug

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2020028116A1 (en) * 2018-07-30 2020-02-06 Optimum Semiconductor Technologies Inc. Object detection using multiple neural networks trained for different image fields

Also Published As

Publication number Publication date
WO2021228686A1 (de) 2021-11-18
DE102020112860A1 (de) 2021-11-18

Similar Documents

Publication Publication Date Title
EP2179381B1 (de) Verfahren und vorrichtung zur verkehrszeichenerkennung
DE69624980T2 (de) Objektüberwachungsverfahren und -gerät mit zwei oder mehreren Kameras
DE112013001858B4 (de) Mehrfachhinweis-Objekterkennung und -Analyse
DE102005063199B4 (de) Vorrichtung und Verfahren zur Erkennung von Straßenmarkierungen
EP2394234A1 (de) Verfahren und vorrichtung zum ermitteln einer geltenden fahrspurmarkierung
DE19955919C1 (de) Verfahren zur Erkennung von Objekten in Bildern auf der Bildpixelebene
DE102011111440A1 (de) Verfahren zur Umgebungsrepräsentation
DE102009009047A1 (de) Verfahren zur Objektdetektion
WO2014032904A1 (de) Verfahren und vorrichtung zum erkennen einer position eines fahrzeugs auf einer fahrspur
DE102017203276B4 (de) Verfahren und Vorrichtung zur Ermittlung einer Trajektorie in Off-road-Szenarien
DE102016210534A1 (de) Verfahren zum Klassifizieren einer Umgebung eines Fahrzeugs
DE102017130488A1 (de) Verfahren zur Klassifizierung von Parklücken in einem Umgebungsbereich eines Fahrzeugs mit einem neuronalen Netzwerk
EP3520023B1 (de) Detektion und validierung von objekten aus sequentiellen bildern einer kamera
DE102018121008B4 (de) System zum fahren eines autonomen fahrzeugs sowie damit ausgestattetes fahrzeugs
DE102012000459A1 (de) Verfahren zur Objektdetektion
DE102017216802A1 (de) Verfahren und vorrichtung zum erkennen von fahrspuren, fahrerassistenzsystem und fahrzeug
WO2020020654A1 (de) Verfahren zum betreiben eines fahrerassistenzsystems mit zwei erfassungseinrichtungen
DE102019132012B4 (de) Verfahren und System zur Detektion von kleinen unklassifizierten Hindernissen auf einer Straßenoberfläche
DE102009022278A1 (de) Verfahren zur Ermittlung eines hindernisfreien Raums
WO2021228686A1 (de) Verbesserte detektion von objekten
DE102020204840A1 (de) Prozessierung von Mehrkanal-Bilddaten einer Bildaufnahmevorrichtung durch einen Bilddatenprozessor
DE102024107974A1 (de) Verfahren zum Bestimmen einer Fahrzeugumfeldinformation, die mindestens ein Objekt beschreibt
WO2015074915A1 (de) Filteranordnung und verfahren zum herstellen einer filteranordnung
DE102022200147A1 (de) Erkennung mit höherer Sicherheitsintegrität von Eigenschaften einer Szenerie durch Abgleich von Sensordaten mit einer Erwartung
DE102015112389A1 (de) Verfahren zum Erfassen zumindest eines Objekts auf einer Straße in einem Umgebungsbereich eines Kraftfahrzeugs, Kamerasystem sowie Kraftfahrzeug

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20221108

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: EXAMINATION IS IN PROGRESS

17Q First examination report despatched

Effective date: 20250203