EP4662572A1 - Kontextinformation für eine überwachungskamera - Google Patents

Kontextinformation für eine überwachungskamera

Info

Publication number
EP4662572A1
EP4662572A1 EP24703280.8A EP24703280A EP4662572A1 EP 4662572 A1 EP4662572 A1 EP 4662572A1 EP 24703280 A EP24703280 A EP 24703280A EP 4662572 A1 EP4662572 A1 EP 4662572A1
Authority
EP
European Patent Office
Prior art keywords
context information
camera
images
neural network
camera arrangement
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP24703280.8A
Other languages
English (en)
French (fr)
Inventor
Moritz Michael Knorr
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Robert Bosch GmbH
Original Assignee
Robert Bosch GmbH
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Robert Bosch GmbH filed Critical Robert Bosch GmbH
Publication of EP4662572A1 publication Critical patent/EP4662572A1/de
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V20/00Scenes; Scene-specific elements
    • G06V20/50Context or environment of the image
    • G06V20/52Surveillance or monitoring of activities, e.g. for recognising suspicious objects
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/25Fusion techniques
    • G06F18/251Fusion techniques of input or preprocessed data
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/77Processing image or video features in feature spaces; using data integration or data reduction, e.g. principal component analysis [PCA] or independent component analysis [ICA] or self-organising maps [SOM]; Blind source separation
    • G06V10/80Fusion, i.e. combining data from various sources at the sensor level, preprocessing level, feature extraction level or classification level
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/045Combinations of networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/82Arrangements for image or video recognition or understanding using pattern recognition or machine learning using neural networks

Definitions

  • the invention relates to the detection of objects in a surveillance area with the aid of a camera.
  • a machine learning system which is set up to detect smoke within the images depending on a plurality of images captured one after the other.
  • the machine learning system comprises a convolutional recurrent neural network. Furthermore, a method for detecting smoke using this machine learning system is known.
  • the object of the invention is to propose improvements with regard to the detection of objects in a surveillance area by means of a camera.
  • the camera arrangement is used to generate parameters.
  • the parameters in turn are used to detect objects in a surveillance area.
  • the camera arrangement contains a camera. This is to be mounted or is mounted in a known mounting position relative to the surveillance area as intended. "As intended" means that the invention is based on a camera mounted in this way. It is therefore assumed that the camera is or is aimed at an environmental area in order to be able to create images of this area and is set up for such use there. In other words, a relevant environmental area and an alignment of the camera to this area are assumed to be given - at least when the camera is in operation.
  • the camera is designed to generate or be able to generate images of the surveillance area in this mounting position.
  • the camera in the mounting position, i.e. in a mounted state, the camera is aimed at the surveillance area so that it can capture images of it.
  • the camera is fixed in the mounting position, i.e. a so-called static camera.
  • fixed we mean that it is installed at a fixed installation location relative to the surveillance area.
  • the camera can be fixed, i.e. it can be directed in a fixed direction in a fixed way.
  • a fixed installation can also be understood here as a swiveling and/or zoomable camera (so-called PTZ camera, pan/tilt/zoom).
  • PTZ camera pan/tilt/zoom
  • the fixed installation in question must be distinguished from, for example, a mobile camera mounted on a vehicle; such a camera is not considered here.
  • the background to this is that only with a fixed camera can the surrounding area be assumed to be "known” during operation in the sense that definitely relevant context information about it can be determined, e.g. a known recording/image of the surrounding area when visibility and lighting conditions are known to be good.
  • the surveillance area is, for example, a landscape, a company premises or the interior of a building. Specifically, for example, a road junction that includes both a roadway and its surroundings (houses, lawns, traffic islands, traffic lights, etc. All of this is then shown in the pictures.
  • Monitoring the area involves discovering or detecting any objects in the monitoring area that do not originally belong to the monitoring area. These objects are therefore located in or on the monitoring area. If the monitoring area is, for example, the intersection mentioned above, objects are, for example, people or vehicles that may be in the monitoring area or moving through it.
  • the camera arrangement contains a neural network.
  • the network has an input for the images generated by the camera and an output.
  • the network is basically set up to process the images fed into the input (one or more) into at least one parameter.
  • the parameter is correlated with the desired detection of objects.
  • the network is also set up to provide the determined parameters at the output.
  • the characteristic is, for example, a yes/no value as to whether an object is in the surveillance area, or it is the position coordinates of a potentially detected object in the camera image, or a classification as to what the object could be (for example, "car”, “truck”, “pedestrian”, “bicycle”, an official license plate of a vehicle, etc.).
  • the camera arrangement contains a context module. This is designed to provide at least one piece of context information correlated with the surveillance area.
  • the "context information” is explained in more detail below.
  • the camera arrangement is designed to feed the context information into the input of the network in addition to the images.
  • the network is designed to process the context information fed into the input together with the images fed into the input into at least one parameter correlated with the detection of objects and to provide the parameters at the output.
  • the camera arrangement therefore provides the parameters and thus allows the parameters to be used for the actual detection of objects in the surveillance area. If necessary, the actual detection itself can also take place in the camera arrangement.
  • the camera arrangement then contains an evaluation unit in particular. This is then set up to detect any objects in the surveillance area based on the parameters.
  • the camera arrangement is then one for detecting objects in the surveillance area and is therefore functionally expanded to the actual detection compared to the first-mentioned camera arrangement (generation of parameters).
  • the evaluation unit is preferably set up to trigger an alarm when an object is detected, for example by activating a siren and/or a flash light.
  • the evaluation unit is set up to send the detected object and/or the alarm derived from it to a control center by wire and/or wirelessly.
  • Such a camera arrangement is sometimes simply referred to as a "camera”, for example if it is designed as a structural unit that contains the actual camera and the neural network as well as the context module and, if applicable, the evaluation unit.
  • the invention is based on the realization that deep learning and machine learning methods are increasingly being used in surveillance cameras and connected cloud services. Similar to classic methods in computer vision, the performance of these methods suffers from poor quality of the images generated by the camera, which is caused, for example, by poor lighting, poor visibility due to weather conditions or disruptive effects such as backlighting. To counteract this, it is proposed here to provide the neural network with additional information in the form of context information, e.g. additional channels, during inference (i.e. at runtime). For example, in addition to a current image, a background image that was taken under good visibility conditions could be provided as context information.
  • context information e.g. additional channels
  • Calibration information such as distances (from components of the surrounding area to the camera) and ground plane normals (of the surrounding area) could also be provided as context information in the form of a 2D or 3D array.
  • results (output variables) from another, e.g. larger, neural network that has received the background image as input (or entire image sequences) could also be used as context information.
  • the neural network receives background information that it does not have to derive from the current image (the context information therefore represents contextual knowledge of the current camera image).
  • This background information can be determined in advance and stored on the camera, so that only a small overhead is incurred during runtime, e.g. by providing additional input channels (part of the input for feeding in the context information).
  • the background information (context information, sensor information from additional sensors, etc.) can also be pre-processed by a neural network and, for example, the number of channels reduced (condensed, e.g. to a context value).
  • the input contains at least one, in particular several, channel inputs.
  • the input consists exclusively of one, in particular several, channel inputs.
  • the camera arrangement is then set up to provide at least one of the images and/or at least one of the context information to the neural network (the first and/or second, see below) in the form of at least one channel at the channel inputs.
  • exactly one channel is provided here to exactly one channel input.
  • the channel inputs for the context information can in particular be additional channel inputs to those via which the images are fed into the network.
  • channel inputs and “channels” are understood as follows: For example, a color image generated by the camera is an RGB image (red-green-blue).
  • the image is made available in the form of three channels or three partial images, namely a red image, a green image and a blue image.
  • Each of these partial images has identical dimensions (same number and arrangement of pixels).
  • the pixels in the red image are the red values of a respective pixel
  • those in the green image are the green values
  • those in the blue image are the blue values of a respective color triplet per color pixel.
  • the context information is then also provided, for example, as an additional (fourth) channel, i.e. as a data structure with the same "pixel dimensions".
  • a fourth value is provided as context information for each image pixel. This type of channel processing is particularly advantageous in a neural network.
  • the camera arrangement has a memory in particular.
  • the context information is determined before the camera takes the picture and processes the corresponding current images. In the camera arrangement, therefore, no effort is required to generate or determine the context information, i.e. no resources are kept available; a simple memory is sufficient, for example.
  • At least one of the context information is a background image of the surveillance area.
  • At least one of the context information is a semantic segmentation of the surveillance area. This provides information about, for example, which image areas correspond to a street, a building, a tree, a meadow, etc. This can also improve the performance of the neural network.
  • At least one of the context information items is calibration information for the camera in relation to the surveillance area.
  • calibration information is, for example, a so-called depth image, which - in the mounting position of the camera - provides, for example, for each pixel a distance between the camera and a point in the surveillance area depicted in the pixel.
  • corresponding calibration information can also be, for example, a respective ground plane normal of the surveillance area.
  • the normal direction of the point in the surveillance area depicted in the pixel is specified for each pixel. This can also significantly increase the performance of the neural network if necessary.
  • the neural network described so far is a first neural network.
  • the camera arrangement then contains a further, second neural network. This is set up to process at least one of the context information into at least one context value.
  • the camera arrangement is then further set up to feed at least one of the context information into the second network and (after processing) to feed the context value (and thus the context information pre-processed into the context value) into the input of the first network.
  • the context information is pre-processed by the second network into a context value and then fed (compressed/condensed) into the first network as a context value.
  • the second network usually also has an input and output, which will not be explained in more detail here.
  • context channels can be reduced to a single channel (context value) by preprocessing in the second neural network.
  • the first neural network then only has to process the one context channel (context value). This means that, for example, the processing load in the first neural network can be reduced with the same amount of processed context information.
  • the camera arrangement is set up to store at least one item of registration information, optionally also to generate it beforehand.
  • the camera arrangement is then also set up to take the registration information into account in relation to the processing in the camera arrangement, in particular in the (first or possibly also second) neural network and all other steps of processing context information and/or images.
  • the registration information represents a spatial/local relationship between the images recorded or to be recorded by the camera and the context information.
  • the registration information therefore describes the local or spatial relative relationships between images and context information.
  • movements of the camera whether intentional or unintentional (misalignment due to aging/wind pressure or readjustment as part of a service job or regular movement/image change during operation, e.g. due to PTZ), can be taken into account in order to be able to assign the context information and the images to the correct location.
  • At least one of the context information is one that is generated by processing at least one image recorded by the camera in the mounting position.
  • registration information it is thus ensured that the context information and image, and thus also the camera, are fully registered with each other, i.e. are in the correct position.
  • PTZ camera A known change in the actual or current relative position
  • at least one of the context information is based on at least one sensor information from at least one sensor. The sensor is different from the camera and in particular does not belong to the camera arrangement.
  • the sensor then represents an external sensor and provides at least a portion of context information for the camera arrangement.
  • the camera arrangement then has in particular an interface that is set up to receive the sensor information and/or the corresponding context information, in particular from outside the camera arrangement.
  • expensive and complex sensor technology/preprocessing can be used to determine "external" context information in order to set up the camera arrangement or camera once.
  • the camera arrangement itself can thus be kept simple and inexpensive. This is particularly useful in combination with the storage of pre-generated context information in the camera arrangement.
  • the object of the invention is also achieved by a method according to patent claim 10. This preferably serves to operate the camera arrangement according to the invention as described above.
  • the invention thus relates to a computer-implemented method for generating parameters for detecting objects in a surveillance area, wherein images of the surveillance area generated by a camera are provided, wherein at least one piece of context information correlated with the surveillance area is provided, wherein the neural network processes the context information fed into an input of the neural network together with the images fed into the input to form at least one parameter correlated with the detection of objects and provides the parameter at the output of the neural network.
  • the neural network is a neural network trained with images and context information correlated with the images.
  • the camera is mounted in the mounting position relative to the surveillance area.
  • the camera in the mounting position generates images of the surveillance area.
  • the images are fed into the input of the neural network.
  • the context module provides the context information(s) correlated with the surveillance area.
  • the context information(s) are also fed into the input of the neural network.
  • the neural network processes the context information(s) together with the images to produce the characteristic(s) and provides the characteristic(s) at the output.
  • the invention further relates to a computer program that is designed to carry out all the steps of the method described.
  • the computer program preferably runs on a control unit or a computer with a microprocessor and a memory.
  • the invention further relates to a machine-readable storage medium, in particular a non-volatile machine-readable storage medium, on which the computer program is stored.
  • the invention is based on the following findings, observations and considerations and also has the following preferred embodiments. These embodiments are sometimes referred to as "the invention” for the sake of simplicity.
  • the embodiments can also contain parts or combinations of the above-mentioned embodiments or correspond to them and/or possibly also include embodiments not previously mentioned.
  • the invention aims to improve the performance, e.g. detection rate, of a neural network which processes data from a static surveillance camera by incorporating context information and its generation and incorporation.
  • a major problem for surveillance cameras is poor visibility in the broadest sense. These include, for example: reflections on wet roads, scattered light from water on the lens or fog, low/poor illumination of the scene and the resulting image noise, compression artifacts due to strong compression of the image material, obscuring of viewing areas by interfering objects on the lens or, for example, large vehicles, blurring in the camera image, etc.
  • the image can also be (artificially) enlarged or only fed into the neural network in a later layer (typically the spatial resolution decreases with each layer at the input of a neural network) (i.e. via an input that leads to one of the inner layers of the network).
  • this additional information must be available for both training and inference (use on the camera or in the cloud or edge box (mini computer/controller) with current images).
  • a possible additional information is a background image.
  • This can be, for example, a single image from a daytime shot, a temporally filtered series of images where moving objects no longer appear (e.g. by forming a median) or the result of processing a series of images by a neural network.
  • Another additional piece of information could be a semantic segmentation, which was generated, for example, with the help of another neural network.
  • the background image could serve as input for this.
  • a semantic segmentation could also be generated directly by a person (annotation / labeling).
  • a semantic segmentation on the background image can be generated, for example, by "Rene Ranftl, Alexey Bochkovskiy, Vladlen Koltun: Vision Transformers for Dense Prediction, https://github.com/isl-org/DPT”.
  • a depth image could also be stored as context information. This could be determined, for example, by a neural network (e.g. the depth image can be generated by "Rene Ranftl” see above, applied to the background image) or, for example, by another sensor and registration (see below) when installing the camera.
  • An extrinsic calibration as context information can, for example, be information about a ground plane.
  • the parameters of a plane normal and distance i.e. three parameters
  • registration is a topic to be discussed here: Two types of registration are discussed below. On the one hand, the registration of background information (additional information / context information) on the current image, and the registration of information from an additional sensor (e.g. a depth camera).
  • additional information additional information / context information
  • additional sensor e.g. a depth camera
  • a registration can also be carried out.
  • corresponding pixels would be calculated from the background image and the current image and then a compensating image transformation would be carried out.
  • This can also be carried out, for example, taking into account a known intrinsic of the camera.
  • Corresponding places in the Background information that no longer contains any information after the transformation would have to be marked accordingly (as ignore) or extrapolated. Both can also be simulated/augmented during training in order to achieve a corresponding non-susceptibility.
  • the information from an IMU intial measurement unit
  • IMU intial measurement unit
  • the background information is obtained from the same perspective (e.g. directly next to the camera), so that in the simplest case only a virtual rotation of the data needs to be carried out.
  • the background information be generated once. In general, however, it can also be updated after a certain time. This can be done periodically, for example, or after a major change in the scene has been detected.
  • the additional information can be generated (I) on the camera itself.
  • the relevant information would be collected (e.g. images for generating the background image or auto-calibration of the scene) and generated by a neural network or other algorithm. This process does not have to take place in real time.
  • the generation of background information could also be (II) the installer's laptop/PC or (III) in the cloud or edge box and then copied to the camera. Processing in the cloud would have the particular advantage that the background information could also be updated if an improved version of its generation is available.
  • the additional information / background information can be introduced in various ways.
  • the corresponding channels can either simply be attached to the input image or a later layer.
  • preprocessing can also be carried out by another (second) neural network.
  • second neural network is used for this, which can be trained together with the actual network, for example. This condensation does not have to be carried out for all additional channels.
  • a corresponding uncertainty can also be stored in the additional channels.
  • a neural network can be, for example, a CNN or transformer-based method for machine learning.
  • the method/arrangement can be used for individual images or image series. It is irrelevant whether it is an RGB, YUV or even just a grayscale image.
  • the method/arrangement could also be extended to moving cameras, where the calibration information could be of particular interest, for example. With a PTZ camera, it can be useful to create a background image by stitching several individual images and to provide the corresponding section as context information during operation.
  • the input of a neural network on a surveillance camera consists of a single RGB image (or a series of images or one or more grayscale images), which thus corresponds to three channels.
  • the performance of these networks typically decreases at night or in the rain, for example people or vehicles are not recognized or are therefore recognized much more uncertainly.
  • This context knowledge can, for example, be the result of a semantic segmentation that was determined in advance on a good weather image using a different neural network that does not have to run on the camera.
  • the good weather image itself, or a dedicated background image the result of a depth estimate or measurement and calibration information can be added.
  • another neural network could be used that first condenses the background information, i.e. reduces the number of channels. This can be done for all of the background information or just for parts of it.
  • the additional neural network can be trained together with the actual network.
  • Figure 1 shows a surveillance area monitored by a camera arrangement and context information for the camera arrangement
  • Figure 2 a camera image of the camera arrangement in poor visibility conditions with objects to be detected
  • Figure 3 further context information for the camera arrangement
  • Figure 4 a camera arrangement with a second neural network
  • Figure 5 shows the generation of context information from current camera images.
  • Figure 1 shows a surveillance area 2, which is only shown schematically here, here a section of a landscape, namely a road junction 4. This is surrounded by four lawns 6 as well as two houses 8, a tree 10 and two traffic lights 12.
  • the surveillance area 2 is to be monitored or is monitored by a camera arrangement 14, which is also only shown schematically in Figure 1.
  • the camera arrangement 14 is intended to generate parameters 16, which in turn are used to detect objects 18 in the surveillance area 2.
  • All objects shown in Figure 1 in the surveillance area 2 (road, houses, trees, ...) are not objects 18 in this sense, but merely fixed components of the surveillance area 2.
  • Objects 18 are, for example, people or animals or vehicles that move in or through the surveillance area 2. These can be seen in Figure 2 (see below).
  • the camera arrangement 14 contains a camera 20. This is located in a designated mounting position M in a fixed relative position R to the surveillance area 2, indicated by a double arrow.
  • the camera 20 is mounted on the roof 24 of the house 8, of which only a part of the roof 24 can be seen from above in Figure 1.
  • the camera 20 looks from the house 8 in a fixed orientation, i.e. with an unchanging viewing direction/angle of view, onto the surveillance area 2.
  • the camera 20 continuously generates images 22 of the surveillance area 2, one after the other, here for example one image 22 per second. Due to the mounting of the camera 20 on the house 8, only its roof 24 can be seen in the foreground of the recorded images 22.
  • One of the images 22 is indicated by way of example by a dashed frame in the surveillance area 2.
  • the camera arrangement 14 contains a neural network 26, which has an input 28 for the images 22 and an output 30 for outputting the parameter 16.
  • the network 26 is basically set up to to process the fed-in images 22 into the characteristic variable 16 and to provide the characteristic variable 16 at the output 30.
  • the camera arrangement 14 also contains a context module 32. This is set up to provide at least one piece of context information 34 correlated with the surveillance area 2 (reference symbol "34" generally also represents one or more of "34a-g”).
  • the camera arrangement 14 is set up to feed the context information 34 into the input 28 in addition to the images 22.
  • the network 26 is thus ultimately and specifically set up to process not only the images 22 fed into the input, but also these together with the context information 34 fed into the input 28, to form the characteristic variable 16.
  • the characteristic variable 16 is correlated with the detection of objects 18 and is provided at the output 30. In the example, it indicates the number and location in the image 22 of detected objects 18.
  • the input 28 contains a total of five channel inputs 36a-e.
  • the camera arrangement 14 is set up to provide the images or each of the images 22 to the network 26 in the form of three channels 38a-c each. It is also set up to provide two pieces of context information 34a, b as additional channels 38d,e at the channel inputs 36d,e in the example.
  • the channels 38a-c are red, green and blue channels of a respective image 22 and are each fed into the respective channel inputs 36a-c.
  • Each of the channels 38a-e has the format of a (1024 x 768) pixel image with 768 rows of 1024 pixels each (images 22) or values (context information).
  • the context information 34 is also provided as such an image format, although this does not necessarily have to be/represent an actual "image”.
  • the context information 34a, b is permanent in the present case, namely stored in the camera arrangement 14 from the time of installation of the camera arrangement 14 in the surveillance area 2, here in a memory 40 of the camera arrangement 14 and was thus created before the camera 20 was put into operation.
  • the image 22 of the surveillance area 2 shown in Figure 1 and indicated by the dashed frame was taken without any objects 18 and under optimal visibility conditions (daylight, no precipitation, clean camera lens, etc.). This image thus forms a background image 42 of the surveillance area 2 and thus represents exemplary context information 34.
  • Figure 1 shows a symbolic representation of registration information 62, which contains statements about how the images 22 currently generated by the camera 20 and the context information 34a, b are spatially connected to one another or are related to one another.
  • the camera arrangement 14 is set up to also take this registration information 62 into account when determining the parameter 16, i.e. to assign the relevant context information 34a, b to a current image 22 in the correct location or to take it into account in the correct location when processing it.
  • Figure 1 also shows - here purely symbolically indicated - a sensor 66 which is different from the camera 20 and which determines sensor information 68 from the surveillance area 2. This is in particular depth information, namely distances between points in the surveillance area 2 and the camera 20 (see below). Alternatively, the sensor 66 determines orientation information as sensor information 68, i.e. a respective normal vector at respective points in the surveillance area 2 (see below). Context information 34 is then obtained from the sensor information 68 or based on it and provided to the camera arrangement 14 for use, in particular stored in its memory 40.
  • Figure 2 shows another image 22 taken during operation of the camera arrangement 14 or the camera 20.
  • This image 22 was taken in winter.
  • the roof 24 is therefore no longer clearly visible because it is covered by snow 44.
  • In the surveillance area 2 there are two fog patches 48, which are indicated by horizontal dashes, and which also impair the view in the camera image 22.
  • Two objects 18 in the Surveillance area 2 here a pedestrian and a vehicle, are therefore difficult to recognize in Figure 22.
  • Figure 2 shows further context information 34b in the form of a semantic segmentation 50, which is indicated in Figure 2 as follows:
  • the roof 24, which is no longer recognizable in the real image recording 22, is segmented as a hatched area, and the lawns 6 are also indicated by other hatching.
  • the context information 34b is also fed to the network 26.
  • the neural network 26 When generating the characteristic variable 16, the neural network 26 is thus informed about known contents in the camera image 22 with helpful information in the form of the context information 34a, b and can thus take over the recognition of the objects 18 or the generation of the characteristic variables 16 in a simplified and improved manner.
  • FIG 3 shows further examples of context information 34, here in the form of calibration information 52.
  • this is available as a depth image, here clarified or illustrated in the form of depth lines 54.
  • Each depth line 54 designates points in the surveillance area 2 shown at the relevant "image location" of the context information, which are a certain distance from the camera 20.
  • three depth lines 54 namely depth line 54a for distances of 5m, 54b for 10m and 54c for 15m, are indicated by dashed lines.
  • the calibration information 52 is actually a depth image of the surrounding area 2, in which each "pixel" has the corresponding distance value of the surveillance area 2 to the camera 20.
  • a normal image is indicated in Fig. 3.
  • This has values at each "pixel” that describe a ground plane normal 56 (normal vector of the surface) at the corresponding location in the monitoring area 2.
  • the normal image therefore describes at each "pixel” which respective vectorial orientation the surface (its normal) has at the corresponding location in the monitoring area 2.
  • the upper two lawns 6 each slope down towards the road junction 4 as a slope (normals inclined obliquely to the road), whereas the two lower lawns shown in the image 16 (vertical normals) merge into the road junction 4.
  • the inclination/orientation of the roof 24 is also visible.
  • the normals are only indicated in a few places as examples.
  • the actual normal image contains the orientation of the surveillance area 2 at each "pixel".
  • the context information 34 in the form of the calibration information 52 is determined in particular based on the sensor 66 or its sensor information 68.
  • FIG. 4 symbolically shows a section of an alternative camera arrangement 14.
  • the previously designated neural network 26 is a first neural network.
  • the feeding of the images 22 into the input 28 of this first neural network 26 is not shown in Figure 4 for the sake of clarity.
  • Only the feeding of the context information 34 is shown.
  • a total of four pieces of context information 34d-g are fed into the neural network 26, each again into a respective channel 38d-g.
  • preprocessing takes place here before the actual feeding into the neural network 26.
  • the camera arrangement 14 contains a second neural network 58.
  • the four pieces of context information 34 are fed into this and compressed or condensed into a single piece of context information 34 in the form of a context value 60. Only this is then fed into the first neural network 26 as the only channel 38h and processed as usual together with the images 22 to form the parameter 16.
  • the context information 34 is thus fed into the neural network 26 as a preprocessed context value 60.
  • Figure 5 shows one possibility for generating the context information 34, namely by processing images 22 actually recorded by the camera 20 itself (only one is shown as an example) using a processing unit 64. The latter can be part of the camera arrangement 14, but does not have to be.
  • Figure 5 once again illustrates the structure of an image 20 from the three channels 38a (red), 38b (green) and 38c (blue) and their feeding into the neural network 26.
  • the processing unit 64 is used to obtain, for example, the background image 42 and the semantic segmentation 50 from the images 22.
  • the camera 20 when operating the camera arrangement 14, the camera 20 is first firmly mounted in the known mounting position M relative to the monitoring area 2, i.e. in the relative position R. The camera 20 then generates images 22 of the monitoring area 2. The images 22 are fed into the input 28 of the neural network 26. In addition to these, the context information 34 is also fed into the input 28. The neural network 26 processes all of this into the parameters 16 and makes them available at the output 30.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • General Physics & Mathematics (AREA)
  • Physics & Mathematics (AREA)
  • Data Mining & Analysis (AREA)
  • Artificial Intelligence (AREA)
  • Multimedia (AREA)
  • Evolutionary Computation (AREA)
  • Databases & Information Systems (AREA)
  • Software Systems (AREA)
  • Medical Informatics (AREA)
  • General Health & Medical Sciences (AREA)
  • Computing Systems (AREA)
  • Health & Medical Sciences (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Evolutionary Biology (AREA)
  • General Engineering & Computer Science (AREA)
  • Image Analysis (AREA)

Abstract

Eine Kameraanordnung (14) mit einer Kamera (20) zur Erzeugung von Bildern (22) eines Überwachungsbereiches (2) und einem neuronalen Netz (26) und einem Kontextmodul (32) für mit dem Überwachungsbereich (2) korrelierte Kontextinformationen (34a-g) ist dazu eingerichtet, die Bildern (22) und die Kontextinformationen (34a-g) in das neuronale Netz (26) einzuspeisen, das die Kontextinformation (34a-g) zusammen mit den Bildern (22) zu mit der Detektion von Objekten (18) im Überwachungsbereich (2) korrelierten Kenngrößen (16) verarbeitet und diese bereitstellt. Bei einem Verfahren zum Betreiben der Kameraanordnung (14) wird die Kamera (20) fest relativ zum Überwachungsbereich (2) montiert, um Bilder (22) von diesem zu erzeugen, stellt das Kontextmodul (32) die Kontextinformationen (34a- g) bereit, werden die Bilder (22) und die Kontextinformationen (34a-g) in das Netz (26) eingespeist und von diesem zu den Kenngrößen (16) verarbeitet und die Kenngrößen (16) bereitstellt.

Description

Beschreibung
Titel
Kontextinformation für eine Überwachungskamera
Die Erfindung betrifft die Detektion von Objekten in einem Überwachungsbereich mit Hilfe einer Kamera.
Stand der Technik
Aus der DE 10 2019 207 711 A1 ist ein maschinelles Lernsystem bekannt, welches eingerichtet ist, abhängig von einer Mehrzahl von nacheinander erfassten Bildern innerhalb der Bilder Rauch zu detektieren. Das maschinelle Lernsystem umfasst ein faltendes rekurrentes neuronales Netz (engl. convolutional recurrent neural Network). Ferner ist ein Verfahren zur Detektion von Rauch mittels dieses maschinellen Lernsystems bekannt.
Offenbarung der Erfindung
Aufgabe der Erfindung ist es, Verbesserungen in Bezug auf die Detektion von Objekten in einem Überwachungsbereich mittels einer Kamera vorzuschlagen.
Die Aufgabe wird gelöst durch eine Kameraanordnung gemäß Patentanspruch 1. Bevorzugte oder vorteilhafte Ausführungsformen der Erfindung sowie anderer Erfindungskategorien ergeben sich aus den weiteren Ansprüchen, der nachfolgenden Beschreibung sowie den beigefügten Figuren.
Die Kameraanordnung dient zur Erzeugung von Kenngrößen. Die Kenngrößen wiederum dienen zur Detektion von Objekten in einem Überwachungsbereich. Die Kameraanordnung enthält eine Kamera. Diese ist bestimmungsgemäß in einer bekannten Montageposition relativ zu dem Überwachungsbereich zu montieren bzw. montiert. "Bestimmungsgemäß" heißt, dass die Erfindung von einer derart montierten Kamera ausgeht. Es wird also vorausgesetzt, dass die Kamera auf einen Umgebungsbereich ausgerichtet wird oder ist, um von diesem Bilder erstellen zu können und für einen derartigen Einsatz dort eingerichtet ist. Mit anderen Worten wird insbesondere ein betreffender Umgebungsbereich und eine Ausrichtung der Kamera auf diesen als - zumindest beim Betrieb der Kamera - gegeben vorausgesetzt.
Die Kamera ist dazu eingerichtet, in dieser Montageposition Bilder von dem Überwachungsbereich zu erzeugen bzw. erzeugen zu können. In der Montageposition, also in einem Montagezustand, ist die Kamera mit anderen Worten also auf den Überwachungsbereich ausgerichtet, sodass sie diesen in Bildern abbilden kann.
Die Kamera ist dabei in der Montageposition fest montiert, also eine sogenannte statische Kamera. Mit "fest" ist gemeint, dass sie an einen relativ zum Überwachungsbereich festen Installationsort installiert ist. Die Kamera kann dabei fest ausgerichtet sein, d.h. unverändert fest in eine bestimmte ortsfeste Blickrichtung gerichtet sein. Unter einer Festmontage ist hier jedoch alternativ auch eine schwenkbare und / oder zoombare Kamera zu verstehen (sogenannte PTZ-Kamera, Pan / Tiit / Zoom). Die vorliegende Festmontage ist dagegen abzugrenzen zum Beispiel von einer an einem Fahrzeug mobil montierten Kamera; eine solche soll hier nicht betrachtet werden. Hintergrund ist, dass nur bei einer fest montierten Kamera der Umgebungsbereich bei deren Betrieb als insofern "bekannt" vorausgesetzt werden kann, dass definitiv zutreffende Kontextinformationen über diesen ermittelbar sind, z.B. eine bekannte Aufnahme / Bild des Umgebungsbereiches bei bekannte guten Sicht- und Beleuchtungsverhältnissen.
Der Überwachungsbereich ist zum Beispiel eine Landschaft, ein Firmengelände oder ein Innenraum eines Gebäudes. Konkret z.B. eine Straßenkreuzung, die beispielsweise sowohl eine Fahrbahn als auch deren Umgebung (Häuser, Rasen, Verkehrsinseln, Ampeln usw. enthält. All dies ist dann auf den Bildern abgebildet.
Die Überwachung des Bereiches besteht darin, eventuell Objekte in dem Überwachungsbereich zu entdecken bzw. zu detektieren, die nicht originäre zum Überwachungsbereich gehören. Diese Objekte befinden sich also in oder auf dem Überwachungsbereich. Ist der Überwachungsbereich beispielsweise die oben genannte Straßenkreuzung, so sind Objekte zum Beispiel Personen oder Fahrzeuge, welche sich gegebenenfalls in dem Überwachungsbereich befinden oder sich durch diesen bewegen.
Die Kameraanordnung enthält ein neuronales Netz. Das Netz weist einen Eingang für die von der Kamera erzeugten Bilder und einen Ausgang auf. Das Netz ist schon dem Grunde nach dazu eingerichtet, die in den Eingang eingespeisten Bilder (eines oder mehrere) zu wenigstens einer Kenngröße zu verarbeiten. Die Kenngröße ist dabei mit der gewünschten Detektion von Objekten korreliert. Das Netz ist auch dazu eingerichtet, die ermittelten Kenngrößen am Ausgang bereitzustellen.
Die Kenngröße ist zum Beispiel ein Ja/Nein-Wert, ob sich ein Objekt im Überwachungsbereich befindet, oder es sind Positionskoordinaten eines potentiell detektierten Objektes im Kamerabild, oder eine Klassifizierung, um welches Objekt es sich handeln könnte (zum Beispiel "PKW", "LKW", "Fußgänger", "Fahrrad", ein amtliches Kennzeichen eines Fahrzeuges usw.).
Die Kameraanordnung enthält ein Kontextmodul. Dieses ist dazu eingerichtet, wenigstens eine mit dem Überwachungsbereich korrelierte Kontextinformation bereitzustellen. Die "Kontextinformation" wird weiter unten näher erläutert.
Die Kameraanordnung ist dazu eingerichtet, neben den Bildern auch die Kontextinformationen in den Eingang des Netzes einzuspeisen. Das Netz ist dazu eingerichtet, die in den Eingang eingespeisten Kontextinformationen zusammen mit den in den Eingang eingespeisten Bildern zu wenigstens einer mit der Detektion von Objekten korrelierten Kenngröße zu verarbeiten und die Kenngrößen am Ausgang bereitzustellen. Die Kameraanordnung stellt also die Kenngrößen bereit und erlaubt es damit, die Kenngröße zur eigentlichen Detektion der Objekte in dem Überwachungsbereich weiterzuverwenden. Gegebenenfalls kann auch die eigentliche Detektion selbst in der Kameraanordnung erfolgen. Hierzu enthält die Kameraanordnung dann insbesondere eine Auswerteeinheit. Diese ist dann dazu eingerichtet, eventuelle Objekte im Überwachungsbereich anhand der Kenngrößen zu detektieren. Die Kameraanordnung ist dann eine solche zur Detektion von Objekten in dem Überwachungsbereich und somit gegenüber der zuerst genannten Kameraanordnung (Erzeugung von Kenngrößen) funktional zur eigentlichen Detektion erweitert. Vorzugsweise ist die Auswerteeinheit dazu eingerichtet, bei Detektion eines Objektes einen Alarm, beispielsweise durch Aktivierung einer Sirene und/oder eines Blitzlichtes, auszulösen. In einer Variante ist die Auswerteeinheit dazu eingerichtet, das detektierte Objekt und/oder den daraus abgeleiteten Alarm drahtgebunden und/oder drahtlos an eine Zentrale zu senden.
Eine derartige Kameraanordnung wird gelegentlich auch einfach als „Kamera" bezeichnet, zum Beispiel, wenn diese als bauliche Einheit ausgeführt ist, welche die eigentliche Kamera und das neuronale Netz sowie das Kontextmodul, gegebenenfalls auch die Auswerteeinheit, enthält.
Gemäß der Erfindung ergibt sich also die Erzeugung und Einbringung von Kontextinformation für bzw. in eine Überwachungskamera bzw. in eine entsprechende Kameraanordnung.
Die Erfindung beruht auf der Erkenntnis, dass Deep-Learning- und Machine- Learning-Verfahren in Überwachungskameras und angebundenen Cloud- Diensten immer größeren Einsatz finden. Ähnlich wie auch bei klassischen Verfahren in der Computer Vision leidet die Performance dieser Verfahren unter schlechter Qualität der von der Kamera erzeugten Bilder, die bspw. durch schlechte Beleuchtung, wetterbedingte schlechte Sichtbedingungen oder Störeffekte, wie Gegenlicht, verursacht wird. Um dem entgegen zu wirken, wird vorliegend vorgeschlagen, dem Neuronalen Netzwerk weitere Informationen in Form der Kontextinformationen, z.B. weiterer Kanäle, bei der Inferenz (also zur Laufzeit) bereitzustellen. Z.B. könnte neben einem aktuellen Bild als Kontextinformation ein Hintergrundbild bereitgestellt werden, dass bei guten Sichtbedingungen aufgenommen wurde. Auch könnten als Kontextinformation Kalibrierinformationen, wie Abstände (von Bestandteilen des Umgebungsbereiches zur Kamera) und Grundebenennormalen (des Umgebungsbereiches) in Form eines 2D- oder 3D-Arrays bereitgestellt werden. Schließlich könnten als Kontextinformation auch Ergebnisse (Ausgangsgrößen) aus einem weiteren, bspw. größeren, neuronalen Netz, das bspw. das Hintergrundbild als Input bekommen hat (oder ganze Bildsequenzen), genutzt werden.
Der Hauptvorteil liegt darin, dass das neuronale Netz Hintergrundinformationen erhält, die es nicht aus dem aktuellen Bild ableiten muss (die Kontextinformation stellt also Kontextwissen zu dem aktuellen Kamerabild dar). Diese Hintergrundinformationen können dabei im Vorfeld bestimmt und auf der Kamera gespeichert werden, so dass während der Laufzeit nur ein geringer Overhead, z.B. durch die Bereitstellung zusätzlicher Input-Kanäle (Teil des Eingangs zur Einspeisung der Kontextinformation) entsteht. In einer Variation können die Hintergrundinformationen (Kontextinformation, Sensorinformation zusätzlicher Sensorik usw.) ebenfalls durch ein neuronales Netz vorverarbeitet und dabei bspw. in der Anzahl der Kanäle reduziert (kondensiert, z.B. zu einem Kontextwert) werden.
In einer bevorzugten Ausführungsform enthält der Eingang wenigstens einen, insbesondere mehrere, Kanaleingang. Alternativ besteht der Eingang ausschließlich aus einem, insbesondere mehreren, Kanaleingängen. Die Kameraanordnung ist dann dazu eingerichtet, wenigstens eines der Bilder und / oder wenigstens eine der Kontextinformationen dem neuronalen Netz (dem ersten und/oder zweiten, siehe unten) in Form mindestens eines Kanals an den Kanaleingängen bereitzustellen. Insbesondere wird hier genau ein Kanal genau einem Kanaleingang bereitgestellt. Bei den Kanaleingängen für die Kontextinformation kann es sich insbesondere um zusätzliche Kanaleingänge zu denjenigen handeln, über welche die Bilder in das Netz eingespeist werden. Unter "Kanaleingängen" und "Kanälen" ist folgendes zu verstehen: Zum Beispiel ist ein Farbbild, welches von der Kamera erzeugt wird, ein RGB-Bild (Rot-Grün-Blau). Das Bild wird dabei in Form von drei Kanälen bzw. drei Teilbildern, nämlich einem Rot-Bild, einem Grün-Bild und einem Blau-Bild zur Verfügung gestellt. Jedes dieser Teilbilder weist identische Dimensionen (gleiche Pixelanzahl und -anordnung) auf. Die Pixel im Rot-Bild sind die Rot-Werte eines jeweiligen Pixels, die im Grün-Bild die Grün-Werte und die im Blau-Bild die Blau-Werte eines jeweiligen Farbtripels pro Farbpixel. Auch die Kontextinformationen wird dann zum Beispiel als weiterer (vierter) Kanal, d.h. als Datenstruktur mit den gleichen "Pixeldimensionen" bereitgestellt. Mit anderen Worten wird zu jedem Bild-Pixel neben den drei Werten für Rot-, Grün- und Blau- Anteil noch ein vierter Wert als Kontextinformation geliefert. Eine derartige Kanalverarbeitung ist in einem neuronalen Netz besonders vorteilhaft.
In einer bevorzugten Ausführungsform ist zumindest ein Teil der Kontextinformation wenigstens beim Betrieb der Kameraanordnung in dieser gespeichert. Hierzu weist die Kameraanordnung insbesondere einen Speicher auf. Insbesondere ist die Kontextinformation dabei schon vor der Bild-Aufnahme durch die Kamera und der Verarbeitung entsprechender aktueller Bilder ermittelt. In der Kameraanordnung muss daher kein Aufwand für die Erzeugung bzw. Ermittlung der Kontextinformation betrieben, d.h. keine Ressourcen vorgehalten werden; ein einfacher Speicher reicht z.B. aus. In der Kameraanordnung ergibt sich dann gegenüber einer solchen ohne die Verarbeitung von Kontextinformation lediglich ein geringer Overhead an Leistung. Zum Beispiel muss lediglich ein "größerer" Eingang vorgesehen sein, zum Beispiel zusätzliche Kanäle für die Kontextinformation, um auch diese neben den Bildern in das neuronale Netz einspeisen zu können.
In einer bevorzugten Ausführungsform ist wenigstens eine der Kontextinformationen ein Hintergrundbild des Überwachungsbereiches. Dieses entspricht insbesondere der Abbildung des (reinen) Überwachungsbereiches, also ohne jegliche Objekte, insbesondere einem Kamerabild bei "guten" Sichtbedingungen, also beispielsweise bei Tageslicht, ohne Störlichtquellen, ohne Regen / Schnee mit trockener und sauberer Kameralinse aufgenommen. Somit wird dem neuronalen Netz z.B. ein "optimales / gutes Soll-Bild" des Überwachungsbereiches zur Verfügung gestellt.
Alternativ oder zusätzlich ist wenigstens eine der Kontextinformationen eine semantische Segmentierung des Überwachungsbereiches. Hierdurch werden zum Beispiel Informationen darüber geliefert, welche Bildbereiche einer Straße, einem Gebäude, einem Baum, einer Wiese usw. entsprechen. Auch dies kann die Leistungsfähigkeit des neuronalen Netzes verbessern.
In einer bevorzugten Ausführungsform ist wenigstens eine der Kontextinformationen eine Kalibrierinformation der Kamera in Bezug auf den Überwachungsbereich. Eine solche Kalibrierinformation ist zum Beispiel ein sogenanntes Tiefenbild, welches - in der Montageposition der Kamera - z.B. für jeden Bildpunkt einen Abstand zwischen der Kamera und einer im Bildpunkt abgebildeten Stelle des Überwachungsbereiches liefert. Eine entsprechende Kalibrierinformation kann jedoch auch zum Beispiel eine jeweilige Grundebenennormale des Überwachungsbereiches sein. Hier wird z.B. für jeden Bildpunkt die Normalenrichtung der Stelle des Überwachungsbereiches angegeben, die im Bildpunkt abgebildet ist. Auch hierdurch kann die Leistungsfähigkeit des neuronalen Netzes gegebenenfalls deutlich gesteigert werden.
In einer bevorzugten Ausführungsform ist das bisher beschriebene neuronale Netz ein erstes neuronales Netz. Die Kameraanordnung enthält dann ein weiteres, zweites neuronales Netz. Dieses ist dazu eingerichtet, wenigstens eine der Kontextinformationen zu wenigstens einem Kontextwert zu verarbeiten. Die Kameraanordnung ist dann weiterhin dazu eingerichtet, wenigstens eine der Kontextinformationen in das zweite Netz einzuspeisen und (nach deren Verarbeitung) den Kontextwert (und damit die zum Kontextwert vorverarbeiteten Kontextinformationen) in den Eingang des ersten Netzes einzuspeisen. Mit anderen Worten wird die Kontextinformation durch das zweite Netz zu einem Kontextwert vorverarbeitet und dann (komprimiert / kondensiert) als Kontextwert in das erste Netz eingespeist. Das zweite Netz weist hierbei in der Regel auch einen Eingang und Ausgang auf, was hier nicht näher erläutert werden soll. So können zum Beispiel mehrere zusätzliche Kontextkanäle (Kanäle mit jeweiliger Kontextinformation) durch Vorverarbeitung im zweiten neuronalen Netz auf einen einzigen Kanal (Kontextwert) reduziert werden. Das erste neuronale Netz muss dann nur noch den einen Kontextkanal (Kontextwert) verarbeiten. Somit kann zum Beispiel die Verarbeitungslast im ersten neuronalen Netz bei gleicher Menge an verarbeiteter Kontextinformation verringert werden.
In einer bevorzugten Ausführungsform ist die Kameraanordnung dazu eingerichtet, wenigstens eine Registrierinformation zu speichern, optional auch vorher zu erzeugen. Die Kameraanordnung ist dann auch dazu eingerichtet, die Registrierinformationen in Bezug auf die Verarbeitung in der Kameraanordnung, insbesondere im (ersten oder ggf. auch zweiten) neuronalen Netz und allen sonstigen Schritten der Verarbeitung von Kontextinformationen und/oder Bildern zu berücksichtigen. Die Registrierinformation bildet einen räumlich / örtlichen Zusammenhang zwischen den von der Kamera aufgenommen bzw. aufzunehmenden Bildern und den Kontextinformationen ab. Die Registrierinformationen beschreiben also die örtlichen bzw. räumlichen Relativverhältnisse zwischen Bildern und Kontextinformation. Hier können zum Beispiel Bewegungen der Kamera, ob willentlich oder unbeabsichtigt (Dejustierung durch Alterung/ Winddruck oder Nachjustierung im Rahmen einer Servicearbeit oder reguläre Bewegung / Bildveränderung im Betrieb, z.B. durch PTZ), berücksichtigt werden, um die Kontextinformation und die Bilder ortsrichtig zuordnen zu können.
In einer bevorzugten Ausführungsform ist wenigstens eine der Kontextinformationen eine solche, die durch die Verarbeitung wenigstens eines von der Kamera in der Montageposition aufgenommenem Bildes erzeugt ist. Insbesondere im Hinblick auf oben (Registrierinformation) ist somit sichergestellt, dass Kontextinformation und Bild und damit auch Kamera zueinander vollständig registriert, d.h. ortsrichtig im Verhältnis stehen. Hier ist lediglich sicherzustellen, dass sich die Kamera bei der Aufnahme späterer Bilder in ihrer Relativposition gegenüber dem Überwachungsbereich nicht verändert hat. Eine bekannte Änderung der tatsächlichen bzw. momentanen Relativposition (PTZ-Kamera) kann hierbei dann als bekannt vorausgesetzt und berücksichtigt werden. In einer bevorzugten Ausführungsform basiert wenigstens eine der Kontextinformationen auf wenigstens einer Sensorinformation wenigstens eines Sensors. Der Sensor ist von der Kamera verschieden und gehört insbesondere nicht zur Kameraanordnung. Der Sensor stellt dann also einen externen Sensor dar und liefert zumindest einen Anteil an einer Kontextinformation für die Kameraanordnung. Die Kameraanordnung weist dann insbesondere eine Schnittstelle auf, die für die Entgegennahme der Sensorinformationen und / oder der entsprechenden Kontextinformationen, insbesondere von außerhalb der Kameraanordnung, eingerichtet ist. So kann zum Beispiel teure und aufwendige Sensorik / Vorverarbeitung zur Ermittlung "externer" Kontextinformationen verwendet werden, um die Kameraanordnung bzw. Kamera einmalig einzurichten. Die Kameraanordnung selbst kann dadurch unaufwändig und günstig gehalten werden. Dies ist insbesondere in Kombination mit der Speicherung von vorab erzeugter Kontextinformation in der Kameraanordnung sinnvoll.
Die Aufgabe der Erfindung wird auch gelöst durch ein Verfahren gemäß Patentanspruch 10. Dieses dient vorzugsweise zum Betreiben der erfindungsgemäßen Kameraanordnung, wie sie oben beschrieben wurde.
Die Erfindung betrifft somit ein computer-implementiertes Verfahren zur Erzeugung von Kenngrößen zur Detektion von Objekten in einem Überwachungsbereich, wobei von einer Kamera erzeugte Bilder von dem Überwachungsbereich bereitgestellt werden, wobei wenigstens eine mit dem Überwachungsbereich korrelierte Kontextinformation bereitgestellt wird, wobei das neuronale Netz die in einen Eingang des neuronalen Netzes eingespeisten Kontextinformation zusammen mit den in den Eingang eingespeisten Bildern zu wenigstens einer mit der Detektion von Objekten korrelierten Kenngröße verarbeitet und die Kenngröße am Ausgang des neuronalen Netzes bereitstellt.
Vorzugsweise ist das neuronale Netz ein mit Bildern und zu den Bildern korrelierter Kontextinformation trainiertes neuronales Netz.
Die bei dem Verfahren wird die Kamera bestimmungsgemäß in der Montageposition fest relativ zu dem Überwachungsbereich montiert. Im Betrieb erzeugt die Kamera in der Montageposition Bilder von dem Überwachungsbereich. Die Bilder werden in den Eingang des neuronalen Netzes eingespeist Das Kontextmodul stellt die mit dem Überwachungsbereich korrelierte(n) Kontextinformation(en) bereit. Neben den Bildern werden auch die Kontextinformation(en) in den Eingang des neuronalen Netzes eingespeist. Das neuronale Netz verarbeitet die Kontextinformation(en) zusammen mit den Bildern zu der Kenngröße(n) und stellt die Kenngröße(n) am Ausgang bereit.
Das Verfahren und zumindest ein Teil dessen möglicher Ausführungsformen sowie die jeweiligen Vorteile wurden sinngemäß bereits im Zusammenhang mit der erfindungsgemäßen Kameraanordnung erläutert.
Die Erfindung betrifft ferner ein Computerprogramm, das eingerichtet ist, alle Schritte des beschriebenen Verfahrens auszuführen. Vorzugsweise läuft das Computerprogramm auf einer Steuereinheit oder einem Computer mit einem Mikroprozessor und einem Speicher. Ferner betrifft die Erfindung ein maschinenlesbares Speichermedium, insbesondere nichtflüchtiges maschinenlesbares Speichermedium, auf dem das Computerprogramm gespeichert ist.
Die Erfindung beruht auf folgenden Erkenntnissen, Beobachtungen bzw. Überlegungen und weist noch die nachfolgenden bevorzugten Ausführungsformen auf. Diese Ausführungsformen werden dabei teils vereinfachend auch "die Erfindung" genannt. Die Ausführungsformen können hierbei auch Teile oder Kombinationen der oben genannten Ausführungsformen enthalten oder diesen entsprechen und/oder gegebenenfalls auch bisher nicht erwähnte Ausführungsformen einschließen.
Die Erfindung verfolgt das Ziel einer Verbesserung der Performance, bspw. Detektionsrate, eines neuronalen Netzwerkes, welches Daten einer statischen Überwachungskamera verarbeitet durch Einbringen von Kontextinformation und deren Erzeugung und Einbringung.
Die Erfindung beruht auf folgender Grundidee: Ein großes Problem für Überwachungskameras (und auch bewegte Kameras) sind schlechte Sichtbedingungen im weitesten Sinne. Dazu zählen bspw.: Reflektionen auf nasser Straße, Streulicht durch Wasser auf der Linse oder Nebel, geringe/schlechte Ausleuchtung der Szene und daraus resultierendes Bildrauschen, Kompressionsartefakte durch starke Komprimierung des Bildmaterials, Verdeckungen von Sichtbereichen durch Störobjekte auf der Linse oder bspw. große Fahrzeuge, Unschärfe im Kamerabild, ...
Diese Beeinträchtigungen führen typischerweise dazu, dass Objekte, wie bspw. Personen oder Fahrzeuge, nicht oder nur mit einer sehr geringen Sicherheit detektiert werden. Sollen diese Objekte dennoch erkannt werden, könnte der Threshold für eine Mindestsicherheit des Detektors gering gewählt werden, was dann aber häufig zu Fehldetektionen führt.
In allen diesen Fällen (und auch in Fällen in denen keine Beeinträchtigung vorliegt) ist es daher vorteilhaft, Zusatzinformation oder Kontextwissen (Kontextinformation) über die Szene (Überwachungsbereich) hinzuzufügen. Eine einfache Möglichkeit ist bspw. ein Tiefenbild hinzuzunehmen. Dabei wird z.B. an die drei Kanäle des RGB-Bildes ein weiterer Kanal angefügt (und in das neuronale Netz eingespeist). Wichtig dabei ist, dass das Tiefenbild die gleiche Auflösung wie das Originalbild besitzt. Alternativ kann das Bild (Kontextinformation) auch (künstlich) vergrößert werden oder erst in einem späteren Layer (typischerweise verringert sich die Ortsauflösung mit jedem Layer am Eingang eines neuronalen Netzwerkes) in das neuronale Netz eingespeist werden (also über einen Eingang, der in eine der inneren Schichten des Netzes führt).
Generell ist es schwierig in ein neuronales Netzwerk Zusatzinformation einzubringen, die in anderer Form, als in gleicher oder ähnlicher Auflösung wie das Bild (RGB-Bild) vorliegt. Ein Beispiel hierfür ist die Information über eine extrinsische Kalibrierung, die bspw. aus dem Tiit- und Rollwinkel und einer Kamerahöhe besteht. Obwohl dies nur drei Parameter sind, kann es sinnvoll sein, einen ganzen Tensor (mit gleicher Größe des Originalbildes) zu erzeugen in dem diese Information abgelegt ist. Dies hat zudem den Vorteil, dass diese Information bei der Verarbeitung nah an der entsprechenden Bildinformation liegt (Lokalität). Im Falle eines Convolutional Neural Networks (CNN) werden die Input-Kanäle durch einen Kernel gefaltet (convolution) der gleichzeitig alle Kanäle (also RGB = Bild und Zusatzinformation = Kontextinformation) aber nur beschränkt auf einen kleinen Ausschnitt des Bildes gleichzeitig betrachtet. Durch das Hintereinanderlegen der Eingangskanäle ist sicherstellt, dass die für den lokalen Bildausschnitt relevante Information innerhalb des Kernels vorliegt.
Der Vorteil einer fest montierten Überwachungskamera gegenüber einer bewegten Kamera, bspw. am Fahrzeug, ist, dass sich die Ausrichtung der Kamera typischerweise nicht ändert (siehe unten). Damit muss die Hintergrundinformation (Kontextinformation, also insb. die zusätzlichen Kanäle) nur einmalig erzeugt werden.
Für ein neuronales Netzwerk muss diese Zusatzinformation sowohl für das Training als auch für die Inferenz (Einsatz auf der Kamera oder in der Cloud oder Edgebox (Kleinstcomputer / -controller) mit aktuellen Bildern) vorliegen.
Es folgt eine detaillierte Beschreibung möglicher Eingangskanäle und naheliegender Alternativen.
Eine mögliche Zusatzinformation (Kontextinformation) ist ein Hintergrundbild. Dieses kann bspw. ein einzelnes Bild einer Tagaufnahme, eine zeitlich gefilterte Bildserie sein, wobei bewegte Objekte nicht mehr auftauchen (bspw. durch Medianbildung) oder das Ergebnis der Verarbeitung einer Bildserie durch ein neuronales Netzwerk sein.
Eine weitere Zusatzinformation (Kontextinformation) könnte eine semantische Segmentierung sein, die z.B. mit Hilfe eines weiteren neuronalen Netzwerkes erzeugt wurde. Als Input dafür könnte bspw. das Hintergrundbild dienen. Alternativ könnte eine semantische Segmentierung auch durch eine Person (Annotation / Labeling) direkt erzeugt werden. Eine semantische Segmentierung auf dem Hintergrundbild kann z.B. durch "Rene Ranftl, Alexey Bochkovskiy, Vladlen Koltun: Vision Transformers for Dense Prediction, https:// github. com/ isl-org/ DPT" erzeugt werden. Ähnlich zu der semantischen Segmentierung könnte auch ein Tiefenbild als Kontextinformation hinterlegt werden. Dieses könnte bspw. durch ein neuronales Netzwerk bestimmt werden (z.B. kann das Tiefenbild durch " Rene Ranftl siehe oben, angewendet auf das Hintergrundbild erzeugt werden) oder bspw. durch einen weiteren Sensor und Registrierung (siehe unten) bei der Installation der Kamera erzeugt werden.
Eine extrinsische Kalibrierung als Kontextinformation kann bspw. Information über eine Grundebene sein. Dabei könnten bspw. die Parameter einer Ebenennormale und Distanz (also drei Parameter) in einem Array der Größe Bildbreite x Bildhöhe x 3 abgelegt werden. Dies hat bspw. den Vorteil, dass sofort ersichtlich ist wie eine aufrechte Person (als Objekt) im Bild orientiert sein müsste und wie groß sie im Bild erscheinen sollte.
Des Weiteren ist hier eine Registrierung zu thematisieren: Im Folgenden werden zwei Arten der Registrierung besprochen. Einerseits die Registrierung der Hintergrundinformation (Zusatzinformation / Kontextinformation) auf das aktuelle Bild, sowie die Registrierung der Information eines Zusatzsensors (bspw. einer Tiefenkamera).
Im einfachsten Fall werden alle, zur Erzeugung der Zusatzinformation nötigen Bilder, direkt von der Kamera bezogen. Dies hat den Vorteil, dass keine Registrierung irgendeiner Art notwendig ist (außer für Kalibrierinformation). Bewegt sich die Kamera jedoch über die Zeit, bspw. durch Wind oder gezielt durch Panning der Kamera, so passen Hintergrundinformation und das aktuelle Bild nicht mehr direkt zusammen. Dies könnte unerheblich sein, da sich die Hintergrundinformation meistens nicht sprungartig ändert und diese Effekte schon beim Training simuliert (augmentiert) werden könnten um eine entsprechende Nichtanfälligkeit zu erreichen.
Alternativ kann jedoch auch eine Registrierung durchgefügt werden. Dabei würden bspw. aus dem Hintergrundbild und aktuellen Bild korrespondierende Bildpunkte berechnet und anschließend eine kompensierende Bildtransformation durchgeführt. Diese kann bspw. auch unter Berücksichtigung einer bekannten Intrinsik der Kamera durchgeführt werden. Entsprechende Stellen in der Hintergrundinformation an der nach der Transformation keine Information mehr vorliegt müssten entsprechend gekennzeichnet werden (als Ignore) oder extrapoliert werden. Beides kann auch während des Training simuliert/augmentiert werden um eine entsprechende Nichtanfälligkeit zu erreichen.
Alternativ kann auch die Information einer IMU (Trägheitsmesseinrichtung/ Inertial Measurement Unit) benutzt werden.
Werden Informationen eines zusätzlichen Sensors eingebracht, hat bspw. der Installateur eine Tiefenkamera dabei, so muss auch diese Information gegen das aktuelle Bild registriert und transformiert werden. Dabei kann prinzipiell genauso wie gerade beschrieben vorgegangen werden.
Generell ist es jedoch vorteilhaft, wenn die Gewinnung der Hintergrundinformation aus einer gleichen Perspektive (also bspw. direkt neben der Kamera) gemacht wird, so dass im einfachsten Fall nur eine virtuelle Rotation der Daten durchgeführt werden muss.
Zur Erzeugung der Zusätzlichen Kanäle / Hintergrundinformation ist zu sagen:
Bisher wurde vorgeschlagen, die Hintergrundinformation einmalig zu erzeugen. Generell kann diese jedoch auch nach einer bestimmten Zeit aktualisiert werden. Dies kann bspw. periodisch durchgeführt werden oder nachdem eine größere Veränderung in der Szene festgestellt wurde. Die Zusatzinformation kann dabei (I) auf der Kamera selbst erzeugt werden. Dabei würden die entsprechenden Informationen gesammelt (bspw. Bilder zur Generierung des Hintergrundbildes oder Autokalibrierung der Szene) und durch ein neuronales Netzwerk oder anderen Algorithmus erzeugt. Dieser Vorgang muss nicht in Echtzeit erfolgen.
Dies hat den Vorteil, dass bspw. ein deutlich größeres und komplexeres neuronales Netzwerk benutzt werden kann, als dies nachher im Betrieb der Fall ist.
Alternativ könnte die Erzeugung der Hintergrundinformation auch (II) auf dem Laptop/PC des Installateurs oder (III) in der Cloud oder Edgebox erfolgen und anschließend auf die Kamera kopiert werden. Eine Verarbeitung in der Cloud hätte den besonderen Vorteil, dass die Hintergrundinformation auch aktualisiert werden könnte, wenn eine verbesserte Variante zu ihrer Erzeugung vorliegt.
Die Zusatzinformation / Hintergrundinformation (synonym für Kontextinformationen) kann auf verschiedene Weisen eingebracht werden. Entweder können die entsprechenden Kanäle einfach an das Eingangsbild oder einen späteren Layer angehängt werden. Alternativ kann aber auch eine Vorverarbeitung durch ein weiteres (zweites) neuronales Netz erfolgen. Hier werden viele Zusatzkanäle auf wenige reduziert. Dafür wird ein weiteres (zweites) neuronales Netzwerk genutzt, welches bspw. zusammen mit dem eigentlichen Netzwerk trainiert werden kann. Diese Kondensierung muss nicht für alle Zusatzkanäle erfolgen.
In den Zusatzkanälen kann neben der Hauptinformation, bspw. der Tiefe, auch eine entsprechende Unsicherheit abgelegt werden.
Mögliche Alternativen / Varianten der Erfindung sind: Ein neuronales Netzwerk kann bspw. ein CNN oder Transformer-basiertes-Verfahren zum maschinellen Lernen sein. Das Verfahren / Anordnung kann für Einzelbilder oder Bildserien verwendet werden. Es ist unerheblich, ob es sich um ein RGB, YUV oder auch nur ein Grauwertbild handelt. Das Verfahren / Anordnung könnte auch auf bewegte Kameras ausgeweitet werden, wobei bspw. besonders die Kalibrierinformation von Interesse sein könnte. Bei einer PTZ-Kamera kann es sinnvoll sein, ein Hintergrundbild durch Stitching mehrerer Einzelbilder zu erzeugen und den entsprechenden Ausschnitt während des Betriebs als Kontextinformation bereitzustellen.
Viele Vorteile des Verfahrens / der Anordnung wurden bereits beschrieben. Der Hauptvorteil der hier beschriebenen Varianten liegt darin, dass wertvolle Hintergrundinformation in Form der Kontextinformationen erzeugt und dem neuronalen Netzwerk zur Verfügung gestellt werden kann, ohne dass dadurch während der Inferenz ein deutlicher Mehraufwand entsteht. Im einfachsten Fall ändert sich nur die Kerneltiefe im Inputlayer, was auf die Gesamtlaufzeit nur geringen Einfluss haben sollte.
Die Hauptidee der Erfindung lässt sich wie folgt veranschaulichen: Klassischerweise / in der Praxis besteht der Input eines neuronalen Netzwerks auf einer Überwachungskamera aus einem einzelnen RGB-Bild (oder einer Serie von Bildern oder einem oder mehreren Grauwertbildern), das somit drei Kanälen (Channels) entspricht Gerade bei Nacht oder Regen nimmt typischerweise die Performance dieser Netze ab, bspw. werden Personen oder Fahrzeuge nicht erkannt bzw. also deutlich unsicherer erkannt Um dem entgegenzuwirken, wird hier vorgeschlagen, Kontextwissen in Form weiterer Kanäle hinzuzunehmen. Dieses Kontextwissen kann bspw. das Ergebnis einer semantischen Segmentierung sein, die vorab auf einem Gut-Wetter-Bild mit einem anderen neuronalen Netz, das nicht auf der Kamera laufen muss, bestimmt worden ist. Ebenso kann das Gut-Wetter-Bild selbst, bzw. ein dediziertes Hintergrundbild, das Ergebnis einer Tiefenschätzung oder Messung und Kalibrierinformation hinzugefügt werden.
Um die Anzahl / den Overhead durch die Zusätzlichen Kanäle zu reduzieren (kondensieren), könnte ein weiteres neuronales Netz genutzt werden, das die Hintergrundinformation zunächst verdichtet, also bspw. die Anzahl der Kanäle reduziert. Dies kann für die gesamte Hintergrundinformation oder nur für Teile davon erfolgen. Das zusätzliche neuronale Netzwerk kann zusammen mit dem eigentlichen Netzwerk trainiert werden.
Weitere Merkmale, Wirkungen und Vorteile der Erfindung ergeben sich aus der nachfolgenden Beschreibung eines bevorzugten Ausführungsbeispiels der Erfindung sowie der beigefügten Figuren. Dabei zeigen, jeweils in einer schematischen Prinzipskizze:
Figur 1 einen Überwachungsbereich, der von einer Kameraanordnung überwacht wird, und eine Kontextinformation für die Kameraanordnung,
Figur 2 ein Kamerabild der Kameraanordnung bei schlechten Sichtverhältnissen mit zu detektierenden Objekten,
Figur 3 weitere Kontextinformation für die Kameraanordnung, Figur 4 eine Kameraanordnung mit zweiten neuronalem Netzwerk,
Figur 5 die Erzeugung von Kontextinformation aus aktuellen Kamerabildern.
Figur 1 zeigt einen hier nur schematisch angedeuteten Überwachungsbereich 2, hier ein Ausschnitt aus einer Landschaft, nämlich eine Straßenkreuzung 4. Diese ist umgeben von vier Rasenflächen 6 sowie zwei Häusern 8, einem Baum 10 und zwei Ampeln 12. Der Überwachungsbereich 2 ist durch eine Kameraanordnung 14, die ebenfalls nur schematisch in Figur 1 dargestellt ist, zu überwachen bzw. überwacht. Hierzu soll die Kameraanordnung 14 Kenngrößen 16 erzeugen, die wiederum zur Detektion von Objekten 18 in dem Überwachungsbereich 2 genutzt werden. Sämtliche in Figur 1 dargestellten Gegenstände im Überwachungsbereich 2 (Straße, Häuser, Bäume, ...) sind keine Objekte 18 in diesem Sinn, sondern lediglich feste Bestandteile des Überwachungsbereiches 2. Objekte 18 sind zum Beispiel Menschen oder Tiere oder Fahrzeuge, welches sich in oder durch den Überwachungsbereich 2 bewegen. Solche sind in Figur 2 zu sehen (siehe unten).
Die Kameraanordnung 14 enthält eine Kamera 20. Diese befindet sich in einer bestimmungsgemäßen Montageposition M in einer durch einen Doppelpfeil angedeuteten festen Relativlage R zu dem Überwachungsbereich 2. Im Beispiel ist die Kamera 20 auf dem Dach 24 des Hauses 8 montiert, von dem in Figur 1 daher nur ein Teil des Daches 24 von oben her zu erkennen ist. Die Kamera 20 blickt von den Haus 8 aus in einer festen Ausrichtung, d.h. mit unveränderlicher Blickrichtung / Blickwinkel auf den Überwachungsbereich 2.
In der Montageposition M und im Betrieb erzeugt die Kamera 20 fortlaufend Bilder 22 von dem Überwachungsbereich 2, zeitlich nacheinander, hier zum Beispiel ein Bild 22 pro Sekunde. Aufgrund der Montage der Kamera 20 auf dem Haus 8 ist nur dessen Dach 24 im Vordergrund der aufgenommenen Bilder 22 zu erkennen. Eines der Bilder 22 ist exemplarisch durch einen gestrichelten Rahmen im Überwachungsbereich 2 angedeutet.
Die Kameraanordnung 14 enthält ein neuronales Netz 26, das einen Eingang 28 für die Bilder 22 sowie einen Ausgang 30 zur Ausgabe der Kenngröße 16 aufweist. Das Netz 26 ist grundlegend dazu eingerichtet, die in den Eingang 28 eingespeisten Bilder 22 zu der Kenngröße 16 zu verarbeiten und die Kenngröße 16 an dem Ausgang 30 bereitzustellen.
Die Kameraanordnung 14 enthält auch ein Kontextmodul 32. Dieses ist dazu eingerichtet, wenigstens eine mit dem Überwachungsbereich 2 korrelierte Kontextinformation 34 (Bezugszeichen "34" allgemein stellvertretend auch für eines /mehrere von "34a-g") bereitzustellen. Die Kameraanordnung 14 ist dazu eingerichtet, neben den Bildern 22 auch die Kontextinformationen 34 in den Eingang 28 einzuspeisen. Das Netz 26 ist somit schlussendlich und konkret dazu eingerichtet, nicht nur die in den Eingang eingespeisten Bilder 22, sondern diese auch zusammen mit den in den Eingang 28 eingespeisten Kontextinformationen 34, zu der Kenngröße 16 zu verarbeiten. Die Kenngröße 16 ist mit der Detektion von Objekten 18 korreliert und wird am Ausgang 30 bereitgestellt. Im Beispiel gibt sie die Anzahl und den Ort im Bild 22 von detektierten Objekten 18 an.
Der Eingang 28 enthält im Beispiel insgesamt fünf Kanaleingänge 36a-e. Die Kameraanordnung 14 ist dazu eingerichtet, die Bilder bzw. jedes der Bilder 22 dem Netz 26 in Form von hier je drei Kanälen 38a-c bereitzustellen. Sie ist auch dazu eingerichtet, im Beispiel konkret zwei Kontextinformationen 34a, b als weitere Kanäle 38d,e an den Kanaleingängen 36d,e bereitzustellen. Die Kanäle 38a-c sind Rot-, Grün- und Blaukanäle eines jeweiligen Bildes 22 und werden jeder für sich in die respektiven Kanaleingänge 36a-c eingespeist. Jeder der Kanäle 38a-e hat dabei das Format eines (1024 x 768-) Pixelbildes mit 768 Reihen zu je 1024 Pixeln (Bilder 22) bzw. Werten (Kontextinformation). Auch die Kontextinformation 34 wird also als solches Bildformat bereitgestellt, wobei diese nicht zwangsweise ein tatsächliches "Bild" sein /repräsentieren muss.
In Figur 1 sind vereinfacht zwei Kontextinformationen 34a, b stellvertretend für eine Vielzahl dieser dargestellt.
Die Kontextinformationen 34a, b sind vorliegend dauerhaft, nämlich ab Installation der Kameraanordnung 14 am Überwachungsbereich 2 in der Kameraanordnung 14 gespeichert, hier in einem Speicher 40 der Kameraanordnung 14 und wurden somit vor Inbetriebnahme der Kamera 20 erstellt. Das in Figur 1 dargestellte, mit dem gestrichelten Rahmen angedeutete Bild 22 des Überwachungsbereiches 2 wurde ohne jegliche Objekte 18 und bei optimalen Sichtbedingungen (Tageslicht, kein Niederschlag, saubere Kameralinse, usw.). aufgenommen. Dieses Bild so bildet somit ein Hintergrundbild 42 des Überwachungsbereiches 2 und stellt damit eine beispielhafte Kontextinformation 34 dar.
Figur 1 zeigt symbolisch dargestellt eine Registrierinformation 62, welche Aussagen darüber beinhaltet, wie die aktuell von der Kamera 20 erzeugten Bilder 22 und die Kontextinformationen 34a, b räumlich miteinander Zusammenhängen, bzw. in Relation stehen. Die Kameraanordnung 14 ist dazu eingerichtet, auch diese Registrierinformationen 62 bei der Ermittlung der Kenngröße 16 zu berücksichtigen, d.h. die betreffende Kontextinformation 34a, b ortsrichtig einem jeweils aktuellen Bild 22 zuzuordnen bzw. bei dessen Verarbeitung ortsrichtig zu berücksichtigen.
Figur 1 zeigt noch - hier rein symbolisch angedeutet - einen von der Kamera 20 verschiedenen Sensor 66, der Sensorinformation 68 vom Überwachungsbereich 2 ermittelt. Diese ist insbesondere eine Tiefeninformation, nämlich Abstände zwischen Punkten des Überwachungsbereiches 2 und der Kamera 20 (siehe unten). Alternativ ermittelt der Sensor 66 als Sensorinformation 68 eine Orientierungsinformation, also einen jeweiligen Normalenvektor an jeweiligen Punkten des Überwachungsbereiches 2 (siehe unten). Aus der Sensorinformation 68 bzw. basieren auf dieser wird dann Kontextinformation 34 gewonnen und der Kameraanordnung 14 zur Verwendung bereitgestellt, insbesondere in deren Speicher 40 gespeichert.
Figur 2 zeigt ein während des Betriebs der Kameraanordnung 14 bzw. der Kamera 20 aufgenommenes weiteres Bild 22. Dieses Bild 22 wurde im Winter aufgenommen. Das Dach 24 ist daher nicht mehr gut zu erkennen, da es von Schnee 44 bedeckt ist. Auf der Linse der Kamera 20 befinden sich zwei Wasserflecken 46, die an den entsprechenden Stellen das Kamerabild 22 verwischen bzw. beeinträchtigen. Im Überwachungsbereich 2 befinden sich zwei Nebelschwaden 48, die durch waagerechte Strichelungen angedeutet sind, und die ebenfalls die Sicht im Kamerabild 22 beeinträchtigen. Zwei Objekte 18 im Überwachungsbereich 2, hier ein Fußgänger sowie ein Fahrzeug, sind daher im Bild 22 schwerlich zu erkennen.
Figur 2 zeigt eine weitere Kontextinformation 34b in Form einer semantischen Segmentierung 50, die in Figur 2 wie folgt angedeutet ist: Das in der realen Bildaufnahme 22 nicht mehr erkennbare Dach 24 ist als schraffierte Bereich segmentiert, ebenso die Rasenflächen 6 durch anderweitige Schraffierung angedeutet. Die Kontextinformation 34b wird dem Netz 26 ebenfalls zugeführt.
Bei der Erzeugung der Kenngröße 16 ist somit das neuronale Netz 26 mit hilfreichen Informationen in Form der Kontextinformation 34a, b über bekannte Inhalte im Kamerabild 22 informiert und kann somit die Erkennung der Objekte 18 bzw. Erzeugung der Kenngrößen 16 vereinfacht und verbessert übernehmen.
Figur 3 zeigt weitere Beispiele für Kontextinformationen 34, hier in Form von Kalibrierinformationen 52. Diese liegen in einem ersten Beispiel als Tiefenbild, hier verdeutlicht bzw. illustriert in Form von Tiefenlinien 54, vor. Jede Tiefenlinie 54 bezeichnet an der betreffenden "Bildstelle" der Kontextinformation abgebildeten Punkte im Überwachungsbereich 2, die von der Kamera 20 eine bestimmte Entfernung aufweisen. In Figur 3 sind drei Tiefenlinien 54, nämlich Tiefenlinie 54a für Abstände von 5m, 54b für 10m und 54c für 15m durch Strichelung angedeutet. Tatsächlich ist die Kalibrierinformation 52 ein Tiefenbild des Umgebungsbereiches 2, bei dem also jedes "Pixel" den entsprechenden Entfernungswert des Überwachungsbereiches 2 zur Kamera 20 aufweist.
Als weitere Alternative für eine Kontextinformation 34 in Form einer Kalibrierinformation 52 ist in Fig. 3 ein Normalenbild angedeutet. Dieses weist an jedem "Bildpunkt" Werte auf, die eine Grundebenennormale 56 (Normalenvektor der Oberfläche) an der entsprechenden Stelle des Überwachungsbereiches 2 beschreiben. Das Normalenbild beschreibt also an jedem "Pixel", welche jeweilige vektorielle Orientierung die Oberfläche (deren Normale) am entsprechenden Ort des Überwachungsbereiches 2 aufweist. So ist zum Beispiel erkennbar, dass in Fig. 3 die oberen beiden Rasenflächen 6 jeweils als Böschung (schräg zur Straße hin geneigte Normalen) zur Straßenkreuzung 4 hin abfallen, wobei hingegen die beiden unteren im Bild dargestellte Rasenflächen 16 eben (senkrechte Normalen) in die Straßenkreuzung 4 übergehen. Auch die Neigung / Ausrichtung des Daches 24 ist erkennbar. Auch hier gilt, dass die Normalen nur an wenigen Stellen exemplarisch angedeutet sind. Das tatsächliche Normalenbild enthält an jedem "Pixel" die Orientierung des Überwachungsbereiches 2.
Die Kontextinformation 34 in Form der Kalibrierinformation 52 wird insbesondere basierend auf dem Sensor 66 bzw. dessen Sensorinformation 68 ermittelt.
Figur 4 zeigt symbolisch einen Ausschnitt aus einer alternative Kameraanordnung 14. Hier ist das bisher bezeichnete neuronale Netz 26 ein erstes neuronales Netz. Das Einspeisen der Bilder 22 in den Eingang 28 dieses ersten neuronalen Netzes 26 ist in Figur 4 der Deutlichkeit halber nicht dargestellt. Es ist nur die Einspeisung der Kontextinformationen 34 gezeigt. Insgesamt werden hier vier Kontextinformationen 34d-g in das neuronale Netz 26 eingespeist, jede wieder in einen jeweiligen Kanal 38d-g. Allerdings findet hier eine Vorverarbeitung vor der eigentlichen Einspeisung in das neuronale Netz 26 statt. Hierzu enthält die Kameraanordnung 14 ein zweites neuronales Netz 58. In dieses werden die vier Kontextinformationen 34 eingespeist und zu einer einzigen Kontextinformation 34 in Form eines Kontextwertes 60 verdichtet bzw. kondensiert. Erst dieser wird dann als einziger Kanal 38h in das erste neuronale Netz 26 eingespeist und wie üblich zusammen mit den Bildern 22 zur Kenngröße 16 verarbeitet. Die Kontextinformationen 34 werden somit als vorverarbeiteter Kontextwert 60 in das neuronale Netz 26 eingespeist.
Figur 5 zeigt eine Möglichkeit zur Erzeugung der Kontextinformation 34, nämlich durch Verarbeitung von tatsächlich von der Kamera 20 selbst aufgenommenen Bildern 22 (exemplarisch nur eines dargestellt) mithilfe einer Verarbeitungseinheit 64. Letztere kann Teil der Kameraanordnung 14 sein, muss dies jedoch nicht. Figur 5 illustriert dabei nochmals den Aufbau eines Bildes 20 aus den drei Kanälen 38a (rot), 38b (grün) und 38c (blau) sowie deren Einspeisung in das neuronale Netz 26.
Insbesondere wird anhand der Verarbeitungseinheit 64 also aus den Bildern 22 z.B. das Hintergrundbild 42 und die semantische Segmentierung 50 gewonnen. Zusammenfassend wird also beim Betrieb der Kameraanordnung 14 zunächst die Kamera 20 in der bekannten Montageposition M relativ, also in der Relativlage R, zu dem Überwachungsbereich 2 fest montiert. Anschließend erzeugt die Kamera 20 Bilder 22 von dem Überwachungsbereich 2. Die Bilder 22 werden in den Eingang 28 des neuronalen Netzes 26 eingespeist Neben diesen werden auch die Kontextinformationen 34 in den Eingang 28 eingespeist. Das neuronale Netz 26 verarbeitet all dies zu den Kenngrößen 16 und stellt diese am Ausgang 30 bereit.

Claims

Ansprüche
1 . Kameraanordnung (14) zur Erzeugung von Kenngrößen (16) zur Detektion von Objekten (18) in einem Überwachungsbereich (2),
- mit einer bestimmungsgemäß in einer bekannten Montageposition (M) fest relativ zu dem Überwachungsbereich (2) zu montierenden oder montierten Kamera (20), die dazu eingerichtet ist, in der Montageposition (M) Bilder (22) von dem Überwachungsbereich (2) zu erzeugen,
- und mit einem neuronalen Netz (26), das einen Eingang (28) und einen Ausgang (30) aufweist,
- und mit einem Kontextmodul (32), das dazu eingerichtet ist, wenigstens eine mit dem Überwachungsbereich (2) korrelierte Kontextinformation (34a-g) bereitzustellen,
- wobei die Kameraanordnung (14) dazu eingerichtet ist, neben den Bildern (22) auch die Kontextinformationen (34a-g) in den Eingang (28) einzuspeisen,
- und das neuronale Netz (26) dazu eingerichtet ist, die in den Eingang (28) eingespeisten Kontextinformation (34a-g) zusammen mit den in den Eingang (28) eingespeisten Bildern (22) zu wenigstens einer mit der Detektion von Objekten
(18) korrelierten Kenngröße (16) zu verarbeiten und die Kenngröße (16) am Ausgang (30) bereitzustellen.
2. Kameraanordnung (14) nach Anspruch 1 , dadurch gekennzeichnet, dass
- der Eingang (28) wenigstens einen Kanaleingang (36a-g) enthält,
- und die Kameraanordnung (14) dazu eingerichtet ist, wenigstens eines der Bilder (22) und / oder wenigstens eine der Kontextinformationen (34d-g) dem Netz (26) in Form mindestens eines Kanals (38a-g) an den Kanaleingängen (36a-g) bereitzustellen.
3. Kameraanordnung (14) nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass zumindest ein Teil der Kontextinformation (34a-g) wenigstens beim Betrieb der Kameraanordnung (14) in der Kameraanordnung (14) gespeichert ist.
4. Kameraanordnung (14) nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass wenigstens eine der Kontextinformationen (34a-g) ein Hintergrundbild (42) des Überwachungsbereiches (2) und / oder eine semantische Segmentierung (50) des Überwachungsbereiches (2) ist.
5. Kameraanordnung (14) nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass wenigstens eine der Kontextinformationen (34a-g) eine Kalibrierinformation (52) der Kamera (20) in Bezug auf den Überwachungsbereich (2) ist.
6. Kameraanordnung (14) nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass das neuronale Netz (26) ein erstes neuronales Netz (26) ist und die Kameraanordnung (14) ein zweites neuronales Netz (58) enthält, das dazu eingerichtet ist, wenigstens eine der Kontextinformationen (34a-g) zu wenigstens einem Kontextwert (60) zu verarbeiten, wobei die Kameraanordnung (14) dazu eingerichtet ist, wenigstens eine der Kontextinformationen (34a-g) in das zweite Netz (58) einzuspeisen und nach deren Verarbeitung als Kontextwert (60) in den Eingang (28) des ersten Netzes (26) einzuspeisen.
7. Kameraanordnung (14) nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass die Kameraanordnung (14) dazu eingerichtet ist,
- wenigstens eine Registrierinformation (62) zwischen den Bildern (22) und den Kontextinformationen (34a-g) zu speichern und optional auch zu erzeugen,
- und die Registrierinformationen (62) in Bezug auf die Verarbeitung in der Kameraanordnung (14) mit zu berücksichtigen.
8. Kameraanordnung (14) nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass wenigstens eine der Kontextinformationen (34a-g) eine solche ist, die durch
Verarbeitung wenigstens eines von der Kamera (20) in der Montageposition (M) aufgenommenem Bildes (22) erzeugt ist
9. Kameraanordnung (14) nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass wenigstens eine der Kontextinformationen (34a-g) auf wenigstens einer Sensorinformation (68) wenigstens eines von der Kamera (20) verschiedenen Sensors (66) basiert.
10. Computer-implementiertes Verfahren zur Erzeugung von Kenngrößen (16) zur Detektion von Objekten (18) in einem Überwachungsbereich (2), wobei von einer Kamera (20) erzeugte Bilder (22) von dem Überwachungsbereich (2) bereitgestellt werden, wobei wenigstens eine mit dem Überwachungsbereich (2) korrelierte Kontextinformation (34a-g) bereitgestellt wird, wobei ein neuronales Netz (26) die in einen Eingang (28) des neuronalen Netzes (26) eingespeisten Kontextinformation (34a-g) zusammen mit den in den Eingang (28) eingespeisten Bildern (22) zu wenigstens einer mit der Detektion von Objekten (18) korrelierten Kenngröße (16) verarbeitet und die Kenngröße (16) am Ausgang (30) des neuronalen Netzes (26) bereitstellt.
11. Verfahren nach Anspruch 10, dadurch gekennzeichnet, dass das neuronale Netz (26) ein mit Bildern (22) und zu den Bildern (22) korrelierter Kontextinformation (34a-g) trainiertes neuronales Netz (26) ist.
12. Verfahren nach einem der Ansprüche 10 oder 11 zum Betreiben einer Kameraanordnung (14) nach einem der Ansprüche 1 bis 9.
13. Verfahren nach Anspruch 12, bei dem:
- die Kamera (20) bestimmungsgemäß in der bekannten Montageposition (M) fest relativ zu dem Überwachungsbereich (2) montiert wird,
- die Kamera (20) in der Montageposition (M) Bilder (22) von dem Überwachungsbereich (2) erzeugt, - die Bilder (22) in den Eingang (28) des neuronalen Netzes (26) eingespeist werden,
- das Kontextmodul (32) die mit dem Überwachungsbereich (2) korrelierten Kontextinformationen (34a-g) bereitstellt, - neben den Bildern (22) auch die Kontextinformationen (34a-g) in den Eingang
(28) eingespeist werden,
- und das neuronale Netz (26) die Kontextinformationen (34a-g) zusammen mit den Bildern (22) zu den Kenngrößen (16) verarbeitet und die Kenngrößen (16) am Ausgang (30) bereitstellt.
14. Computerprogramm, das eingerichtet ist, alle Schritte des Verfahrens nach einem der Ansprüche 10 bis 13 auszuführen.
15. Maschinenlesbares Speichermedium, insbesondere nichtflüchtiges maschinenlesbares Speichermedium, auf dem das Computerprogramm nach
Anspruch 14 gespeichert ist.
EP24703280.8A 2023-02-07 2024-01-29 Kontextinformation für eine überwachungskamera Pending EP4662572A1 (de)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
DE102023200975.7A DE102023200975A1 (de) 2023-02-07 2023-02-07 Kontextinformation für eine Überwachungskamera
PCT/EP2024/052039 WO2024165351A1 (de) 2023-02-07 2024-01-29 Kontextinformation für eine überwachungskamera

Publications (1)

Publication Number Publication Date
EP4662572A1 true EP4662572A1 (de) 2025-12-17

Family

ID=89843513

Family Applications (1)

Application Number Title Priority Date Filing Date
EP24703280.8A Pending EP4662572A1 (de) 2023-02-07 2024-01-29 Kontextinformation für eine überwachungskamera

Country Status (3)

Country Link
EP (1) EP4662572A1 (de)
DE (1) DE102023200975A1 (de)
WO (1) WO2024165351A1 (de)

Family Cites Families (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20180096595A1 (en) * 2016-10-04 2018-04-05 Street Simplified, LLC Traffic Control Systems and Methods
DE102019207711A1 (de) 2019-05-27 2020-12-03 Robert Bosch Gmbh Verfahren und Vorrichtung zur Detektion von Rauch

Also Published As

Publication number Publication date
WO2024165351A1 (de) 2024-08-15
DE102023200975A1 (de) 2024-08-08

Similar Documents

Publication Publication Date Title
EP3014569B1 (de) Inspektion der konturierten fläche des unterbodens eines kraftfahrzeugs
DE112017007579T5 (de) Verfahren und System zum automatischen Kolorieren von Nachtsichtbildern
DE102009036844B4 (de) Belichtungsbestimmungsvorrichtung und Bildverarbeitungsvorrichtung
DE102007034657B4 (de) Bildverarbeitungsvorrichtung
DE102018201054A1 (de) System und Verfahren zur Bilddarstellung durch ein Fahrerassistenzmodul eines Fahrzeugs
DE102011055458A1 (de) Adaptierungstechnik zur Erkennung einer freien Fahrbahn mittels verlässlicher lokaler Modellkalibrierung
DE10304703A1 (de) Verfahren und Vorrichtung zur Sichtbarmachung der Umgebung eines Fahrzeugs mit umgebungsabhängiger Fusion eines Infrarot- und eines Visuell-Abbilds
DE112013001858T5 (de) Mehrfachhinweis-Objekterkennung und -Analyse
DE102008062121A1 (de) Kameraeinheit mit Fahrkorridor-Anzeigefunktion für ein Fahrzeug, Verfahren zur Anzeige einer vorausberechneten Fahrzeugtrajektorie und System zur Generierung von Fahrkorridormarkierungen
DE102019115459A1 (de) Verfahren und vorrichtung zur bewertung einer fahrbahnoberfläche für kraftfahrzeuge
DE102011055459A1 (de) Adaptierungstechnik zur Erkennung einer freien Fahrbahn mit zusätzlichen Klassifikatoren
DE102018008282A1 (de) Vorrichtung und Verfahren zum Erfassen von Flugobjekten
DE10160719B4 (de) Verfahren und Vorrichtung zur Erkennung und Wiedererkennung von sich bewegenden Objekten
DE102020133506A1 (de) Parkplatzsteuerungssystem, Parkplatzsteuerungsverfahren und Programm
DE102008048309A1 (de) Verfahren und Vorrichtung zum Detektieren von Fahrzeugen bei Dunkelheit
DE102019116006A1 (de) Verfahren und vorrichtung zur objekterkennung in kamera-toträumen
EP3236440B1 (de) Vorrichtung, system und verfahren zur markierungsfreien hangüberwachung und/oder bauüberwachung
DE102013022050A1 (de) Verfahren zum Verfolgen eines Zielfahrzeugs, insbesondere eines Motorrads, mittels eines Kraftfahrzeugs, Kamerasystem und Kraftfahrzeug
DE102015216993A1 (de) Verbessertes Verfahren zum Aufnehmen einer Szene, insbesondere bei einer kritischen Belichtungssituation
DE102019116058A1 (de) Verfahren und vorrichtung zur objekterkennung in kamera-blindzonen
WO2024165351A1 (de) Kontextinformation für eine überwachungskamera
DE102020215696A1 (de) Verfahren zur Darstellung einer Umgebung eines Fahrzeugs, Computerprogrammprodukt, Speichermedium, Steuergerät und Fahrzeug
DE102013220839B4 (de) Verfahren zum dynamischen Einstellen einer Helligkeit eines Bilds einer Rückansichts-Anzeigevorrichtung sowie entsprechendes Fahrzeugabbildungssystem
DE102015007678A1 (de) Fahrzeug sowie Verfahren und Vorrichtung zur Selbstlokalisation eines Fahrzeugs
DE102004047476B4 (de) Vorrichtung und Verfahren zur Einstellung einer Kamera

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20250821

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR