EP4587962A1 - Verfahren und vorrichtung zum trainieren eines objektdetektors mit einem ensemble von mehreren detektionsköpfen - Google Patents

Verfahren und vorrichtung zum trainieren eines objektdetektors mit einem ensemble von mehreren detektionsköpfen

Info

Publication number
EP4587962A1
EP4587962A1 EP23768504.5A EP23768504A EP4587962A1 EP 4587962 A1 EP4587962 A1 EP 4587962A1 EP 23768504 A EP23768504 A EP 23768504A EP 4587962 A1 EP4587962 A1 EP 4587962A1
Authority
EP
European Patent Office
Prior art keywords
neural network
head
training
image
output
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Withdrawn
Application number
EP23768504.5A
Other languages
English (en)
French (fr)
Inventor
Alexander Hirsch
Lukas ENDERICH
Simon Heming
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Robert Bosch GmbH
Original Assignee
Robert Bosch GmbH
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Robert Bosch GmbH filed Critical Robert Bosch GmbH
Publication of EP4587962A1 publication Critical patent/EP4587962A1/de
Withdrawn legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N5/00Computing arrangements using knowledge-based models
    • G06N5/04Inference or reasoning models
    • G06N5/045Explanation of inference; Explainable artificial intelligence [XAI]; Interpretable artificial intelligence
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/0464Convolutional networks [CNN, ConvNet]
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/084Backpropagation, e.g. using gradient descent
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/82Arrangements for image or video recognition or understanding using pattern recognition or machine learning using neural networks

Definitions

  • a neural network which is trained according to a method with features of claim 1, enables the advantages of object detection using an ensemble (more precise predictions, more precise uncertainty determination), while the computing time is only slightly increased.
  • the invention relates to a computer-implemented method for training a neural network, wherein the neural network is designed to detect objects in images, and the training comprises the following steps: Determining a feature representation of a training image using a backbone of the neural network; ⁇ Determining head outputs based on the feature representation and by means of a plurality of heads of the neural network, the head outputs each characterizing a presence or absence of an object for areas of the training image or characterizing an extent of the object or characterizing a position of the object or the extent and the position characterized; ⁇ Determining a plurality of first loss values, a first loss value corresponding to a head output and characterizing a deviation of the head output from a desired head output; ⁇ Adjusting at least one parameter of the spine and/or at least one parameter of a head
  • So sensor in particular optical sensors can be used, in particular a camera.
  • images within the meaning of the invention can also be recorded by other sensors, for example a LIDAR, a radar, an ultrasonic sensor or a thermal camera.
  • the output signal can also characterize a spatial extent of at least one object within the image and/or a positioning of the object within the image.
  • the output signal can also characterize a spatial expansion with respect to real dimensions of the object in the real world and/or positioning within a coordinate system of the real world.
  • the intrinsic and extrinsic parameters of a camera can be used to assign a coordinate in a predefined coordinate system of the real world to the pixels and thus objects of an image.
  • the neural network can then be trained in such a way that instead of determining the position and/or extent of the object with respect to a width and height of the image in pixels, a position and/or extent of the object with respect to the predefined coordinate system.
  • the neural network itself can be understood as consisting of two parts.
  • the first part of the network includes the backbone.
  • backbone is common in the state of the art.
  • base or base network are occasionally used synonymously with the term backbone.
  • the backbone sometimes referred to as a feature extractor, can in turn be understood as a neural network.
  • the task of the backbone is to transform the image into the feature representation, on the basis of which object detection can then be carried out.
  • the well-known CenterNet architecture there is a head for determining the presence/absence, a head for determining the position and a head for determining the width and height of the object.
  • the well-known Single Shot Detection (SSD) architecture there are two heads, one of which carries out the presence/absence determination and the other head carries out the position and extent determination.
  • the structure of a Faster RCNN looks similar to the SSD.
  • the neural network presented in this invention determines a plurality of heads to determine the absence/absence or to determine the position or to determine the extent or to determine the extent and the position.
  • the heads can therefore be understood as an ensemble, which is formed, the presence/absence or the position or the extent or the position R.401853 - 6 - and to determine the extent.
  • the inventors were able to find that the introduction of an ensemble leads to a significant increase in the accuracy of object detection.
  • a head is preferably a neural network.
  • the neural network can therefore preferably be composed of several sub-networks, namely the backbone and the heads.
  • other models from the field of machine learning are also possible as backbones and heads, for example support vector machines.
  • the heads of the plurality of heads each determine a head output. For training, these head outputs are compared with a desired head output in order to determine a first loss value.
  • a plurality of heads can also be provided for determining the presence/absence and for determining the position and for determining the extent.
  • This can be understood as meaning that there is an ensemble for determining the presence/absence, the position and the extent in the neural network, i.e. a plurality of pluralities of heads.
  • the inventors were able to determine that the accuracy of the neural network can be increased even further by using a plurality of heads.
  • the invention relates to executing the trained neural network, i.e.
  • the head outputs determined by the majority of heads are combined into the one head output, with the output signal which characterizes an object detection of objects in the image being determined based on this combined head output.
  • Various methods can be chosen for summarizing.
  • the head outputs can be the same in their form (for example matrix or tensor) (for example the same R.401853 - 9 - Number of dimensions and elements in the respective dimensions). This can be the case in particular if the individual heads are the same in their architecture (for example, the same number of layers with the same number of neurons) or the last layers of the heads are the same.
  • the average values of elements at the same index positions of the header outputs can be used for summarization.
  • each header output can be assigned a weight, which is used for all values of the corresponding header output when forming the weighted sum.
  • the inventors were able to determine that the special design of the network through a backbone and the ensemble of heads advantageously increases the accuracy of the network. In addition, the requirement for computing capacity and memory is significantly lower compared to using a deep ensemble.
  • the output signal additionally includes a value that characterizes an uncertainty regarding the summary of the plurality of head outputs.
  • the user is thus advantageously given the opportunity to intervene in expenditures that are associated with a high degree of uncertainty in order to reduce or suppress possible misconduct.
  • the head outputs are typically in the form of a matrix or a tensor
  • the uncertainty can be determined in particular with respect to each element or a subset of elements of the matrix or tensor.
  • This plurality of uncertainties can then be provided in the output signal.
  • the user of the neural network can be shown which area of the image the object detection has determined which uncertainty.
  • the uncertainty can be expressed as a value that is determined using a predefined function. In particular, mutual information can be used as a function.
  • an entropy can be determined for each header output and a maximum entropy can be provided as an uncertainty value with respect to the index position for each index position within the header outputs.
  • a method is provided for determining a control signal of an actuator or a display device based on an image, wherein the control signal is determined based on the output signal.
  • the actuator can be controlled better in this way, since the output signal enables more precise object detection.
  • the control signal can in particular also be determined based on the determined uncertainty.
  • FIG. 1 shows a neural network (60) which is set up for training.
  • the neural network (60) includes a backbone ( ⁇ ), which in turn characterizes a neural network, for example a vision transformer.
  • the backbone is designed to determine a feature representation ( ⁇ ) from a training image ( ⁇ ⁇ ), which the neural network receives as input.
  • This feature representation is sent to a plurality ( ⁇ ⁇ ) of heads ( ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ ) of the neural network (60) as input of the heads ( ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ ) transmitted.
  • the heads ( ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ ) are preferably also neural networks, for example convolutional neural networks (CNN).
  • CNN convolutional neural networks
  • the heads are set up to determine the presence or absence of objects.
  • the heads ( ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ ) each determine head outputs ( ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ ) in the form of matrices whose elements correspond to areas of the training image ( ⁇ ⁇ ).
  • the receptive field of an element of the matrix defines the extent of the area within the training image ( ⁇ ⁇ ). An element can then characterize whether there is an object within the area of the training image corresponding to it or not.
  • an element can indicate whether a center of a bounding box that encloses the object lies within the region.
  • the element can preferably be a real-valued number between 0 and 1, which can be characterized as the probability of the existence of an object. From a predefined threshold value, for example 0.5, an element can then be understood as indicating the presence of an object. In this case, values less than 0.5 characterize the absence of objects within the corresponding area.
  • the threshold value can be understood as a hyperparameter of the neural network.
  • the neural network (60) comprises a further plurality ( ⁇ ⁇ ) of heads ( ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ ) to determine an extent of the object (for example width and height within the image).
  • the heads ( ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ ) of this further plurality ( ⁇ ⁇ ) determine further head outputs ( ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ ), each of which characterizes the exact position and in the output signal ( ⁇ ⁇ ) to be provided.
  • the extent and position are determined jointly by heads of a plurality of heads.
  • the desired output signal ( ⁇ ⁇ ) preferably includes a desired head output for the presence or absence of objects within the training image ( ⁇ ⁇ ), for a position of objects within the training image ( ⁇ ⁇ ) and for an extent of the objects within of the training image ( ⁇ ⁇ ).
  • the neural network (60) determines an output signal ( ⁇ ⁇ ) based on the input image ( ⁇ ⁇ ).
  • the desired output signal ( ⁇ ⁇ ) and the determined output signal ( ⁇ ⁇ ) are transmitted to a change unit (180). Based on the desired output signal ( ⁇ ⁇ ) and the determined output signal ( ⁇ ⁇ ), the change unit (180) then determines new parameters ( ⁇ ′) for the neural network (60).
  • the change unit (180) first determines a plurality of first loss values, each loss value being a deviation of a head output ( ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ ⁇ ) of the output signal ( ⁇ ⁇ ) is characterized by a corresponding desired head output included in the desired output signal ( ⁇ ⁇ ).
  • the head outputs ( ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ ) included in the output signal ( ⁇ ⁇ ) can each be in the form of a matrix or a three-dimensional tensor are present, in which case the desired head output encompassed by the desired output signal ( ⁇ ) is also present in the form of a matrix or a three-dimensional tensor.
  • the corresponding matrices or tensors each contain values along a height and a width dimension R.401853 - 15 - or vectors that characterize a presence or absence, a position or an extent.
  • Values or vectors at the same indices along the height and width dimensions of a head output ( ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ ⁇ ) and a corresponding head output can be are then compared using a loss function.
  • the values determined in this way can be accumulated using a mathematical operation, for example summed, weighted summed or their maximum value can be determined.
  • ⁇ ( ⁇ ) , ... , ⁇ ( ⁇ ) is the plurality of head outputs
  • is the number of head outputs
  • is the number of elements along the height dimension within a head output
  • is the number of elements along the width dimension within a head edition
  • is the Euclidean norm.
  • the determined new parameters ( ⁇ ′) are provided to the neural network (60) as parameters ( ⁇ ).
  • the training described is repeated iteratively for a predefined number of iteration steps or repeated iteratively until the first loss value falls below a predefined threshold value.
  • the training is ended when an average first loss value with respect to a test or validation data set falls below a predefined threshold value.
  • the new parameters ( ⁇ ′) determined in a previous iteration are used as parameters ( ⁇ ) of the neural network (60).
  • the neural network (60) comprises a summary unit ( ⁇ ⁇ , ⁇ ⁇ , ⁇ ⁇ ) at the inference time, which Header issues of the majority of header issues are combined into a single header issue ( ⁇ , ⁇ , ⁇ ).
  • the presence or absence, position and extent are determined based on a respective plurality of head outputs.
  • one summary unit ( ⁇ , ⁇ , ⁇ ) is provided for each plurality of head outputs in the neural network (60).
  • FIG. 4 shows a control system (40), which is designed to determine a control signal (A) of an actuator (10) based on the neural network (60).
  • the control system (40) receives the sequence of sensor signals (S) from the sensor (30) in an optional receiving unit (50), which converts the sequence of sensor signals (S) into a sequence of input images ( ⁇ ) converted (alternatively, the sensor signal (S) can also be taken over directly as an input image ( ⁇ ).
  • the input image ( ⁇ ) can be, for example, a section or further processing of the sensor signal (S). In other words, the input image ( ⁇ ) is determined depending on the sensor signal (S).
  • the sequence of input images ( ⁇ ) is fed to the neural network (60).
  • the neural network (60) is preferably parameterized by parameters ( ⁇ ) which are stored in a parameter memory (DB) and are provided by it.
  • control system (40) comprises at least one processor (45) and at least one machine-readable storage medium (46) on which instructions are stored which, when executed on the at least one processor (45), Cause the control system (40) to carry out the method according to the invention.
  • a display device (10a) is provided as an alternative or in addition to the actuator (10).
  • the display device (10a) can in particular be an optical display device, for example a screen.
  • the display device (10a) can also be set up for other human senses. For example, it can be a loudspeaker or display an event to a user via haptic signals such as vibration.
  • the control signal (A) can then be determined in such a way that the actuator or actuators (10) are controlled in such a way that the motor vehicle (100), for example, prevents a collision with the objects identified by the neural network (60), in particular if These are objects of certain classes, e.g. pedestrians.
  • the display device (10a) can be controlled with the control signal (A).
  • the display device can be, for example, a screen on which the identified objects are displayed. It is also possible for the display device (10a) to be controlled with the control signal (A) in such a way that it emits a visual or acoustic warning signal if it is determined that the motor vehicle (100) is threatening to strike one of the identified objects collide.
  • the output signal ( ⁇ ) includes information that characterizes the identity of a person detected by the neural network (60), and the control signal (A) is selected based on the identity of the person.
  • logical access control can also be provided.
  • Figure 8 shows an exemplary embodiment in which the control system (40) is used to control a monitoring system (400). This exemplary embodiment differs from the exemplary embodiment shown in FIG. 7 in that instead of the actuator (10), the display device (10a), which is controlled by the control system (40), is provided.
  • the sensor (30) is set up to determine an image of a patient, for example an X-ray image, an MRI image or an ultrasound image. At least part of the image is transmitted to the neural network (60) as an input image ( ⁇ ).
  • the neural network (60) can, for example, be set up to detect different types of tissue to be recognized on the input image ( ⁇ ).
  • the control signal (A) can then be selected such that the determined types of tissue are highlighted in color on the display device (10a).
  • the imaging system (500) can also be used for non-medical purposes, for example to determine material properties of a workpiece. For this purpose, the imaging system (500) can record an image of a workpiece.
  • the neural network (60) can be set up in such a way that it receives at least part of the image as an input image ( ⁇ ) and detects materials of the workpiece.
  • the detection determined in this way can, for example, be displayed together with the input image on the display device (10a).
  • the term “computer” includes any device for processing predetermined calculation rules. These calculation rules can be in the form of software, or in the form of hardware, or even in a mixed form of software and hardware.
  • a plurality can be understood as indexed, that is, each element of the plurality is assigned a unique index, preferably by assigning consecutive integers to the elements contained in the plurality.
  • a plurality comprises ⁇ elements, R.401853 - 24 - where ⁇ is the number of elements in the plural, the elements are assigned the integers from 1 to ⁇ .

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Computing Systems (AREA)
  • Software Systems (AREA)
  • Artificial Intelligence (AREA)
  • Mathematical Physics (AREA)
  • Computational Linguistics (AREA)
  • Data Mining & Analysis (AREA)
  • Evolutionary Computation (AREA)
  • General Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • Biomedical Technology (AREA)
  • Molecular Biology (AREA)
  • General Health & Medical Sciences (AREA)
  • Biophysics (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Health & Medical Sciences (AREA)
  • Medical Informatics (AREA)
  • Image Analysis (AREA)

Abstract

Computerimplementiertes Verfahren zum Trainieren eines neuronalen Netzes (60), wobei das neuronale Netz (60) ausgebildet ist, Objekte in Bildern (x) zu detektieren, und das Training folgende Schritte umfasst: • Ermitteln einer Merkmalsrepräsentation (f) eines Trainingsbildes (x i ) mittels eines Rückgrats (B) des neuronalen (60); • Ermitteln von Kopfausgaben (C1, C2, C3, P1, P2, P3, S1, S2, S3) basierend auf der Merkmalsrepräsentation (f) und mittels einer Mehrzahl (M C , M P , M S ) von Köpfen (H C1 , H C2 , H C3 , H P1 , H P2 , H P3 , H S1 , H S2 , H S3 ) des neuronalen Netzes (60), wobei die Kopfausgaben (C1, C2, C3, P1, P2, P3, S1, S2, S3) jeweils für Bereiche des Trainingsbildes (x i ) eine Anwesenheit oder Abwesenheit eines Objekts charakterisiert oder eine Ausdehnung des Objekts charakterisiert oder eine Position des Objekts charakterisiert oder die Ausdehnung und die Position charakterisiert; • Ermitteln einer Mehrzahl von ersten Verlustwerten, wobei jeweils ein erster Verlustwert mit einer Kopfausgabe (C 1 , C 2 , C 3 , P 1 , P 2 , P 3 , S 1 , S 2 , S 3 ) korrespondiert und eine Abweichung der Kopfausgabe (C 1 , C 2 , C 3 , P 1 , P 2 , P 3 , S 1 , S 2 , S 3 ) von einer gewünschten Kopfausgabe charakterisiert; • Anpassen zumindest eines Parameters (θ) des Rückgrats (B) und/oder zumindest eines Parameters eines Kopfes (H C1 , H C2 , H C3 , H P1 , H P2 , H P3 , H S1 , H S2 , H S3 ) basierend auf einem zweiten Verlustwert, wobei der zweite Verlustwert eine Summe der ersten Verlustwerte charakterisiert.

Description

R.401853 - 1 - Beschreibung Titel Verfahren und Vorrichtung zum Trainieren eines Objektdetektors Die Erfindung betrifft ein Verfahren zum Trainieren eines neuronalen Netzes, ein Verfahren zum Ausführen des neuronalen Netzes, einer Vorrichtung zum Trainie- ren, einer Vorrichtung zum Ausführen, einem Computerprogramm und einem computerlesbaren Speichermedium. Stand der Technik Tran et al „Hydra: Preserving Ensemble Diversity for Model Distillation”, 2020, https://arxiv.org/pdf/2001.04694.pdf offenbart ein Ensemble für Bildklassifikation. Zhuo et al. „Objects as Points“, 2019, https://arxiv.org/abs/1904.07850 offenbart CenterNet, eine neuronale Netzwerk Architektur zur Objektdetektion. Liu et al.: „SSD: Single Shot MultiBox Detector”, 2016, https://ar- xiv.org/abs/1512.02325 offenbart SSD, eine neuronale Netzwerk Architektur zur Objektdetektion. Ren et al. „Faster R-CNN: Towards Real-Time Object Detection with Region Pro- posal Networks“, 2015, https://arxiv.org/abs/1506.01497 offenbart Faster-RCNN, eine neuronale Netzwerk Architektur zur Objektdetektion. Vorteile der Erfindung Systeme des maschinellen Lernens, insbesondere neuronale Netze werden im- mer häufiger in verschiedenen Bereichen der Technik verwendet. Insbesondere in Fall, in denen aus Daten Aussagen nicht mehr oder nicht mit hinreichender R.401853 - 2 - Güte regelbasiert extrahiert werden können, haben sich diese statistischen Ver- fahren als geeignet erwiesen. Insbesondere bei der Detektion von Objekten aus digitalen Bildern erlauben Verfahren aus dem Bereich des maschinellen Lernens eine derzeit bestmögliche Güte hinsichtlich der Objektdetektionen. In diesem Zusammenhang hat sich gezeigt, dass Ensemble-Methoden im Ver- gleich zu einzelnen neuronalen Netzen sowohl die Qualität der Vorhersage als auch die Quantifizierung der Unsicherheit verbessern. Ensemble-Methoden kön- nen beispielsweise aus mehreren unabhängig voneinander trainierten neurona- len Netzen bestehen (engl. Deep Ensemble). Indem eine Mehrzahl von insbe- sondere verschiedenen Vorhersagen für dieselben Eingabedaten berechnet wer- den, kann unter anderem die Varianz der Vorhersagen als ein Indikator für eine Unsicherheit bezüglich einer Objektdetektion verwendet werden. Wenn beispiels- weise die verschiedenen neuronalen Netze eines Deep Ensemble in ihrer Vor- hersage weitgehend übereinstimmen, ist die Unsicherheit eher gering; wenn sie es nicht sind, nimmt die Unsicherheit zu. Die Vorhersagequalität verbessert sich außerdem durch die Berechnung des Mittelwerts über die einzelnen Vorhersa- gen. Diese Steigerung der Vorhersageperformanz kommt allerdings mit dem Preis ei- nes stark erhöhten Rechenbedarfs. Typischerweise wächst der Bedarf an Re- chenkapazitäten und Speicher linear mit der Anzahl der neuronalen Netze an, was bei heutigen neuronalen Netzen selbst bei einem kleinen Ensemble dazu führen kann, dass das Ensemble nicht mehr oder nicht mehr hinreichend schnell ausgewertet werden kann bzw. ein Speicherbedarf zu groß für den ausführenden Computer ist. Dies stellt insbesondere bei sicherheitskritischen Anwendungen ein erhebliches Risiko dar, da die Objekte der Bilder nicht mehr schnell genug ermit- telt werden können. Vorteilhafterweise ermöglicht ein neuronales Netz, welches nach einem Verfah- ren mit Merkmalen des Anspruchs 1 trainiert wird, die Vorteile einer Objektdetek- tion mittels eines Ensembles (genauere Vorhersagen, genauere Unsicherheits- bestimmung), während die Rechenzeit nur leicht erhöht wird. Dies erlaubt den R.401853 - 3 - Einsatz des neuronalen Netzes auch in Computerarchitekturen, die mit stark be- grenzten Rechen- und Speicherkapazitäten umgehen müssen, wie beispiels- weise eingebetteten Systemen. Offenbarung der Erfindung In einem ersten Aspekt betrifft die Erfindung ein computerimplementiertes Ver- fahren zum Trainieren eines neuronalen Netzes, wobei das neuronale Netz aus- gebildet ist, Objekte in Bildern zu detektieren, und das Training folgende Schritte umfasst: ^ Ermitteln einer Merkmalsrepräsentation eines Trainingsbildes mittels eines Rückgrats des neuronalen Netzes; ^ Ermitteln von Kopfausgaben basierend auf der Merkmalsrepräsentation und mittels einer Mehrzahl von Köpfen des neuronalen Netzes, wobei die Kopfausgaben jeweils für Bereiche des Trainingsbildes eine Anwesenheit oder Abwesenheit eines Objekts charakterisiert oder eine Ausdehnung des Objekts charakterisiert oder eine Position des Objekts charakterisiert oder die Ausdehnung und die Position charakterisiert; ^ Ermitteln einer Mehrzahl von ersten Verlustwerten, wobei jeweils ein erster Verlustwert mit einer Kopfausgabe korrespondiert und eine Abweichung der Kopfausgabe von einer gewünschten Kopfausgabe charakterisiert; ^ Anpassen zumindest eines Parameters des Rückgrats und/oder zumindest eines Parameters eines Kopfes basierend auf einem zweiten Verlustwert, wobei der zweite Verlustwert eine Summe der ersten Verlustwerte charak- terisiert. Dass das neuronale Netz ausgebildet ist, Objekte auf Bildern zu detektieren, kann insbesondere derart verstanden werden, als dass das neuronale Netz aus- gebildet ist ein Eingabebild zu verarbeiten, wobei das Eingabebild das Bild, ins- besondere ein digitales Bild, umfasst und das neuronale Netz ferner eingerichtet ist ein Ausgabesignal zu ermitteln, welches die Anwesenheit oder Abwesenheit von Objekten innerhalb des Bildes charakterisiert. Insbesondere kann der Begriff „Objektdetektion“ damit als die Detektion einer Abwesenheit eines Objekts ver- standen werden. R.401853 - 4 - Der Ausdruck des „Objekts, welches sich im Bild befindet“ oder „Objekt eines Bil- des“ kann insbesondere derart verstanden werden, dass das Bild das Objekt ab- bildet, es also eine Mehrzahl von Pixelwerten innerhalb des Bildes gibt, die zu- sammen das Objekt repräsentieren. Typischerweise sind solche Objekte die Ab- bildung eines Objekts der realen Welt auf ein digitales Bild mittels eines entspre- chenden Sensors. Also Sensor können insbesondere optische Sensoren einge- setzt werden, insbesondere eine Kamera. Bilder im Sinne der Erfindung können jedoch auch von anderen Sensoren aufgezeichnet werden, zum Beispiel einem LIDAR, einem Radar, einem Ultraschallsensor oder einer Thermalkamera. Vorzugsweise kann das Ausgabesignal auch eine räumliche Ausdehnung zumin- dest eines Objekts innerhalb des Bildes und/oder eine Positionierung des Ob- jekts innerhalb des Bildes charakterisieren. Alternativ zur räumlichen Ausdeh- nung innerhalb des Bildes und/oder zur Positionierung innerhalb des Bildes kann das Ausgabesignal auch eine räumliche Ausdehnung bezüglich realer Maße des Objekts in der echten Welt und/oder Positionierung innerhalb eines Koordinaten- systems der echten Welt charakterisieren. Zum Beispiel können durch intrinsi- sche und extrinsische Parameter einer Kamera den Pixeln und damit Objekten eines Bildes eine Koordinate in einem vordefinierten Koordinatensystem der rea- len Welt zugeordnet werden. Das neuronale Netz kann dann derart trainiert wer- den anstatt, der Position und/oder Ausdehnung des Objekts bezüglich einer Breite und Höhe des Bildes in Pixeln eine Position und/oder Ausdehnung des Objekts bezüglich des vordefinierten Koordinatensystems zu ermitteln. Das neuronale Netz selbst kann als aus zwei Teilen bestehend verstanden wer- den. Der erste Teil des Netzes umfasst das Rückgrat (engl. backbone). Der Be- griff Backbone ist geläufig im Stand der Technik. Gelegentlich werden auch die Begriffe Basis (engl. base) oder Basisnetzwerk (engl. base network) synonym zum Begriff Backbone verwendet. Das Rückgrat, manchmal auch als Merkmals- extraktor (engl. Feature Extractor) bezeichnet, kann wiederum als neuronales Netz verstanden werden. Die Aufgabe des Rückgrats ist es, dass Bild in die Merkmalsrepräsentation zu transformieren, auf deren Basis dann die Objektde- tektion durchgeführt werden kann. Vorzugsweise handelt es sich bei der Merk- malsrepräsentation um zumindest einen dreidimensionalen Tensor mit jeweils ei- ner Dimension für Breite, Höhe und Tiefe. Entlang der Tiefendimension befinden R.401853 - 5 - sich in diesem Fall Merkmalsvektoren, die Bereiche des Bildes charakterisieren, wobei der Bereich des Bildes, welchen der Merkmalsvektor repräsentiert, durch die Breite- und Höhedimension des Tensors angezeigt wird. Die Architektur des Rückgrats kann gängigen Architekturen für neuronale Netze, insbesondere neu- ronalen Netzen für Bilder, folgen, zum Beispiel Residualnetzwerken (engl. Resi- dual Networks, ResNets) oder optischen Transformatoren (engl. Vision Transfor- mer oder Visual Transformer). Die Merkmalsrepräsentation wird von einem zweiten Teil des neuronalen Netzes verarbeitet. Dieser zweite Teil umfasste sogenannte Köpfe (engl. Heads). Die Köpfe sind jeweils ausgebildet jeweils für Bereiche des Trainingsbildes eine Kopfausgabe zu ermitteln, welche eine Anwesenheit oder Abwesenheit eines Objekts zu charakterisiert oder sind jeweils ausgebildet eine Ausdehnung des Objekts zu charakterisiert oder sind jeweils ausgebildet eine Position des Objekts zu charakterisiert oder sind jeweils ausgebildet die Ausdehnung und die Position zu charakterisiert. Zusätzlich zur Anwesenheit oder Abwesenheit eines Objekts kann außerdem auch eine von einem Kopf bestimmte Klassenzugehörigkeit ei- nes Objekts in einer Kopfausgabe bereitgestellt werden. Dies ist ein Unterschied zu bekannten neuronalen Netzen, da bei bekannten neuronalen Netzen nur ein Kopf vorgesehen ist, um die Anwesenheit oder Abwesenheit eines Objekts oder eine Ausdehnung des Objekts oder eine Position des Objekts oder die Ausdeh- nung und die Position vorherzusagen. Zum Beispiel existiert bei der bekannten CenterNet Architektur jeweils ein Kopf für die An-/Abwesenheitsbestimmung, ein Kopf für die Positionsbestimmung und ein Kopf für die Bestimmung von Breite und Höhe des Objekts. Bei der bekannten Single Shot Detection (SSD) Architek- tur existieren zwei Köpfe, wobei einer die An-/Abwesenheitsbestimmung durch- führt und der andere Kopf die Positions- und Ausdehnungsbestimmung durch- führt. Ähnlich zum SSD sieht der Aufbau eines Faster-RCNN aus. Im Gegensatz zu diesen bekannten Architekturen ermittelt das in dieser Erfin- dung vorgestellte neuronale Netz jeweils eine Mehrzahl von Köpfen zur Ermitt- lung der Ab-/Abwesenheit oder zur Ermittlung der Position oder zum Ermitteln der Ausdehnung oder zum Ermitteln der Ausdehnung und der Position. Die Köpfe können daher als Ensemble verstanden werden, welches ausgebildet ist, die An-/Abwesenheit oder die Position oder die Ausdehnung oder die Position R.401853 - 6 - und die Ausdehnung zu ermitteln. Dier Erfinder konnten feststellen, dass die Ein- führung eines Ensembles zu einer erheblichen Steigerung der Genauigkeit be- züglich der Objektdetektion führt. Bevorzugt ist ein Kopf wiederum ein neuronales Netz. Das neuronale Netz kann sich somit bevorzugt aus mehreren Unternetzen zusammensetzen, nämlich dem Rückgrat und den Köpfen. Als Rückgrat und Köpfe sind jedoch auch andere Mo- delle aus dem Bereich des maschinellen Lernens möglich, zum Beispiel Stütz- vektor-Maschinen (engl. Support Vector Machines). Die Köpfe der Mehrzahl von Köpfen ermitteln jeweils eine Kopfausgabe. Zum Training werden diese Kopfausgaben jeweils mit einer gewünschten Kopfaus- gabe verglichen, um einen ersten Verlustwert zu ermitteln. So kann für jeden Kopf ein erster Verlustwert basierend auf der Kopfausgabe des Kopfes ermittelt werden. Hierdurch entsteht eine eins-zu-eins Korrespondenz jeweils eines Kop- fes mit einem ersten Verlustwert. Die so ermittelten ersten Verlustwerte können dann über eine Summe, beispielsweise eine gewichtete Summe, insbesondere eine gleichgewichtete Summe zum zweiten Verlustwert zusammengeführt wer- den. Basierend auf dem zweiten Verlustwert kann dann das neuronale Netz wäh- rend des Trainings angepasst werden, zum Beispiel mittels einem Gradientenab- stieg der Parameter des neuronalen Netzes bezüglich des zweiten Verlustwerts. Eine Kopfausgabe ist vorzugsweise in Form einer Matrix oder eines Tensors ge- geben. Zum Ermitteln der ersten Verlustwerte kann jeweils die gleiche gewünschte Kopf- ausgabe mit den jeweiligen ermittelten Kopfausgaben verglichen werden. Für den Fall, dass die Kopfausgaben eine An- bzw. Abwesenheit von Objekten cha- rakterisieren, kann insbesondere eine Kreuzentropie zwischen einer Kopfaus- gabe und der gewünschten Kopfausgabe als erster Verlustwert bereitgestellt werden. Für die anderen Fälle kann insbesondere eine ^^-Verlustfunktion ver- wendet werden, um einen ersten Verlustwert zu ermitteln. R.401853 - 7 - In bevorzugten weiteren Ausführungsformen kann auch vorgesehen sein, dass der zweite Verlustwert eine negative Korrelation bezüglich der verschiedenen Kopfausgaben charakterisiert. Die Kopfausgaben können insbesondere in Form von Matrizen oder Tensoren vorliegen, wobei gleichende Indizes verschiedener Kopfausgaben jeweils einen gleichen Teil des Trainingsbildes charakterisieren. Für jeweils gleiche Indizes kann dann jeweils eine negative Korrelation der Werte an den entsprechenden Indizes ermittelt werden. Als Trainingsziel kann dann vorteilhafterweise festgelegt werden, dass die jeweiligen Werte der Kopfausgaben an gleichen Indizes eine möglichst hohe negative Korrelation aufweisen. Als Trainingsziel kann aber auch eine andere Metrik verwendet werden, die eine Diversität zwischen den Kopfaus- gaben ausdrückt und somit maximiert werden soll. Dies kann als eine Regularisierung der Kopfausgaben verstanden werden. Durch die Regularisierung der Kopfausgaben lernt das neuronale Netz bezüglich einer Merkmalsrepräsentation unterschiedliche Kopfausgaben zu ermitteln, wobei die Summe der ersten Verlustwerte das neuronale Netz weiterhin lernen lässt, die Objekte korrekt zu detektieren. Dies kann als ein Ausbalancieren von zwei Lern- zielen verstanden werden, zum einen das Ziel möglichst unterschiedliche Kopf- ausgaben zu ermitteln und zum anderen das Ziel Objekte im Trainingsbild korrekt zu detektieren. Die Erfinder konnten feststellen, dass der Einsatz einer negativen Korrelation als Regularisierung die Genauigkeit des neuronalen Netzes vorteil- hafterweise weiter steigert. Technisch gesehen können alle negativen Korrelationen von Werten gleicher In- dizes zwischen den Kopfausgaben summiert werden oder ein Durchschnittswert aus den negativen Korrelationen ermittelt werden, wobei die Summe oder der Durchschnittswert als die oben beschriebene negative Korrelation in den zweiten Verlustwert mit einfließt. Die negative Korrelation kann insbesondere als Term zur Summe der ersten Verlustwerte addiert werden, um den zweiten Verlustwert zu ermitteln. Vorzugsweise kann die negative Korrelation mit einem vordefinier- ten Wert multipliziert werden, der als Hyperparameter des Trainings verstanden werden kann. R.401853 - 8 - In verschiedenen bevorzugten Ausführungsformen kann auch jeweils für die Be- stimmung der An-/Abwesenheit und für die Bestimmung der Position und für die Bestimmung der Ausdehnung eine Mehrzahl von Köpfen vorgesehen sein. Dies kann derart verstanden werden, als dass jeweils ein Ensemble zur Bestimmung der An-/Abwesenheit, der Position und der Ausdehnung im neuronalen Netz exis- tiert, also eine Mehrzahl von Mehrzahlen von Köpfen. Die Erfinder konnten fest- stellen, dass durch den Einsatz einer Mehrzahl von Mehrzahlen von Köpfen die Genauigkeit des neuronalen Netzes noch weiter gesteigert werden kann. In einem weiteren Aspekt betrifft die Erfindung ein Ausführen des trainierten neu- ronalen Netzes, also ein Verfahren zum Ermitteln eins Ausgabesignal mittels des neuronalen Netzes, wobei das Verfahren die folgenden Schritte umfasst: ^ Ermitteln einer Merkmalsrepräsentation des Bildes mittels des Rück- grats des neuronalen Netzes; ^ Ermitteln einer Mehrzahl von Kopfausgaben basierend auf der Merk- malsrepräsentation und mittels der Mehrzahl von Köpfen des neurona- len Netzes; ^ Ermitteln einer Zusammenfassung der Mehrzahl von Kopfausgaben zu einer Kopfausgabe; ^ Ermitteln des Ausgabesignals basierend auf der einen Kopfausgabe. Die Schritte zum Ausführen des neuronalen Netzes, also die Schritte während der Inferenzphase, sind größtenteils gleich mit den Schritten, die notwendig sind, um das neuronale Netz zu trainieren. Ein wesentlicher Unterschied liegt jedoch im Ermitteln des Ausgabesignals. Während des Trainings wurden die verschiede- nen Kopfausgaben jeweils ausgegeben, sodass jede Kopfausgabe mit einer ge- wünschten Kopfausgabe verglichen werden kann. Zur Inferenzzeit werden die von der Mehrzahl der Köpfe ermittelten Kopfausgaben zu der einen Kopfausgabe zusammengefasst, wobei basierend auf dieser zusammengefassten Kopfaus- gabe das Ausgabesignal ermittelt wird, welches eine Objektdetektion von Objek- ten des Bildes charakterisiert. Zum Zusammenfassen können verschiedene Verfahren gewählt werden. In ver- schiedenen Ausführungsformern ist möglich, dass die Kopfausgaben in ihrer Form (zum Beispiel Matrix oder Tensor) jeweils gleich sind (zum Beispiel gleiche R.401853 - 9 - Anzahl von Dimensionen und Elementen in den jeweiligen Dimensionen). Dies kann insbesondere dann der Fall sein, wenn die einzelnen Köpfe in ihrer Archi- tektur jeweils gleich sind (zum Beispiel eine gleiche Anzahl von Schichten mit gleicher Anzahl von Neuronen) bzw. die jeweils letzten Schichten der Köpfe gleich sind. In diesen bevorzugten Fällen können zum Zusammenfassen jeweils die durchschnittlichen Werte von Elementen an gleichen Indexpositionen der Kopfausgaben verwendet werden. Alternativ ist auch möglich, dass anstelle einer Durchschnittsbildung eine gewichtete Summe gewählt wird, wobei die jeweiligen Gewichte als Hyperparameter des neuronalen Netzes verstanden werden kön- nen. Insbesondere kann jeder Kopfausgabe ein Gewicht zugeordnet sein, wel- ches für alle Werte der entsprechenden Kopfausgabe bei der Bildung der ge- wichteten Summe verwendet wird. Die Erfinder konnten feststellen, dass die besondere Ausgestaltung des Netzes durch ein Rückgrat und das Ensemble von Köpfen die Genauigkeit des Netzes vorteilhafterweise steigert. Darüber hinaus ist die Anforderung an Rechenkapazi- tät und Speicher im Vergleich zu einem Einsatz eines tiefen Ensembles (engl. Deep Ensemble) wesentlich geringer. In verschiedenen Vorteilhaften Ausführungsformen kann darüber hinaus vorge- sehen sein, dass das Ausgabesignal zusätzlich einen Wert umfasst, der eine Un- sicherheit bezüglich der Zusammenfassung der Mehrzahl von Kopfausgaben charakterisiert. Falls die Kopfausgaben der Mehrzahl von Kopfausgaben eine Klassifikation be- züglich der An- bzw. Abwesenheit von Objekten charakterisieren, kann die Unsi- cherheit beispielsweise eine Unsicherheit über die tatsächliche An- bzw. Abwe- senheit eines Objekts charakterisieren. Falls die Kopfausgaben der Mehrzahl von Kopfausgaben eine Prädiktion bezüglich der Ausdehnung eines Objekts charak- terisieren, kann die Unsicherheit beispielsweise eine Unsicherheit über die tat- sächliche Ausdehnung des Objekts charakterisieren. Falls die Kopfausgaben der Mehrzahl von Kopfausgaben eine Prädiktion bezüglich der Position eines Objekts charakterisieren, kann die Unsicherheit beispielsweise eine Unsicherheit über die tatsächliche Position des Objekts charakterisieren. Vorteilhafterweise kann einem Benutzer des neuronalen Netzes mittels der Unsicherheit angezeigt werden, wie R.401853 - 10 - vertrauenswürdig das neuronale Netz seine Ausgabe selber einschätzt. Dem Be- nutzer wird so vorteilhafterweise die Möglichkeit gegeben, dass er bei Ausgaben, die mit einer hohen Unsicherheit verbunden sind, einzugreifen, um mögliches Fehlverhalten zu verringern oder zu unterdrücken. Da die Kopfausgaben typischerweise in Form einer Matrix oder eines Tensors vorliegen, kann die Unsicherheit insbesondere bezüglich jedes Elements oder ei- ner Untermenge von Elementen der Matrix bzw. des Tensors ermittelt werden. Diese Mehrzahl von Unsicherheiten kann dann im Ausgabesignal bereitgestellt werden. Hierdurch kann insbesondere den Benutzer des neuronalen Netzes an- gezeigt werden, für welchen Bereich des Bildes die Objektdetektion welche Unsi- cherheit ermittelt hat. Die Unsicherheit kann als ein Wert ausgedrückt werden, der mittels einer vordefi- nierten Funktion ermittelt wird. Als Funktion kann insbesondere die gemeinsame Information (engl. mutual Information) verwendet werden. Alternativ sind auch andere Funktionen möglich, zum Beispiel kann für jede Kopfausgabe eine Entro- pie ermittelt werden und für jede Indexposition innerhalb der Kopfausgaben eine maximale Entropie als Unsicherheitswert bezüglich der Indexposition bereitge- stellt werden. In weiteren Aspekten der Erfindung ist ein Verfahren zum Ermitteln eines Ansteu- ersignals eines Aktors oder einer Anzeigevorrichtung basierend auf einem Bild vorgesehen, wobei das Ansteuersignal basierend auf dem Ausgabesignal ermit- telt wird. Vorteilhafterweise kann der Aktor so besser angesteuert werden, da das Ausga- besignal genauere Objektdetektion ermöglicht. Das Ansteuersignal kann insbesondere auch basierend auf der ermittelten Unsi- cherheit ermittelt werden. Zum Beispiel kann das Ansteuersignal derart gewählt werden, dass ein Benutzer der Vorrichtung aufgefordert wird die Steuerung des Aktors zu übernehmen, falls die Unsicherheit bezüglich der Zusammenfassung der Mehrzahl von Kopfausgaben einen vordefinierten Schwellenwert erreicht R.401853 - 11 - oder übersteigt. Vorteilhafterweise kann so die Steuerung des Aktors sicherer ge- staltet werden, da Entscheidung mit hoher Unsicherheit und damit hohem Fehl- potential durch den Benutzer korrigiert werden können. In einem weiteren Aspekt betrifft die Erfindung eine Vorrichtung, welche einge- richtet ist, das Verfahren zur Ermittlung des Ausgabesignals oder des Ansteuer- signals auszuführen. Die Vorrichtung kann insbesondere als Computer oder Teil eines Computers ver- standen werden. Nachfolgend werden Ausführungsformen der Erfindung unter Bezugnahme auf die beiliegenden Zeichnungen näher erläutert. In den Zeichnungen zeigen: Figur 1 schematisch ein neuronales Netz zur Trainingszeit; Figur 2 schematisch ein Trainingssystem zum Trainieren des neuronalen Netzes; Figur 3 das neuronale Netz zur Inferenzzeit; Figur 4 schematisch einen Aufbau eines Steuerungssystems zur Ansteue- rung eines Aktors; Figur 5 schematisch ein Ausführungsbeispiel zur Steuerung eines wenigs- tens teilautonomen Roboters; Figur 6 schematisch ein Ausführungsbeispiel zur Steuerung eines Ferti- gungssystems; Figur 7 schematisch ein Ausführungsbeispiel zur Steuerung eines Zugangs- systems; Figur 8 schematisch ein Ausführungsbeispiel zur Steuerung eines Überwa- chungssystems; R.401853 - 12 - Figur 9 schematisch ein Ausführungsbeispiel zur Steuerung eines persönli- chen Assistenten; Figur 10 schematisch ein Ausführungsbeispiel zur Steuerung eines medizi- nisch bildgebenden Systems. Beschreibung der Ausführungsbeispiele Figur 1 zeigt ein neuronales Netz (60), welches zum Training eingerichtet ist. Das neuronale Netz (60) umfasst ein Rückgrat (^), welches wiederum ein neuronales Netz charakterisiert, zum Beispiel einen Vision Transformer. Das Rückgrat ist ausgebildet, aus einem Trainingsbild (^^), welches das neuronale Netz als Ein- gabe erhält, eine Merkmalsrepräsentation (^) zu ermitteln. Diese Merkmalsreprä- sentation wird an eine Mehrzahl (^^) von Köpfen (^^^ , ^^^ , ^^^) des neuronalen Netzes (60) als Eingabe der Köpfe (^^^ , ^^^ , ^^^) übermittelt. Die Köpfe (^^^ , ^^^ , ^^^) sind vorzugsweise jeweils auch neuronale Netze, zum Beispiel Faltungsnetze (engl. Convolutional neural networks, CNN). Im Ausführungsbei- spiel sind die Köpfe eingerichtet eine An- bzw. Abwesenheit von Objekten zu er- mitteln. Hierzu ermitteln die Köpfe (^^^ , ^^^ , ^^^) jeweils Kopfausgaben (^^ , ^^ , ^^) in Form von Matrizen, deren Elemente mit Bereichen des Trainingsbil- des (^^) korrespondieren. Das rezeptive Feld (engl. receptive field) eines Ele- ments der Matrix definiert dabei die Ausdehnung des Bereiches innerhalb des Trainingsbildes (^^). Ein Element kann dann charakterisieren, ob sich innerhalb des mit ihm korrespondierenden Bereichs des Trainingsbildes ein Objekt befindet oder nicht. Vorzugsweise kann ein Element angeben, ob ein Mittelpunkt einer Begrenzungsbox (engl. Bounding Box), die das Objekt umschließt, innerhalb des Bereichs liegt. Das Element kann vorzugsweise eine reellwertige Zahl zwischen einschließlich 0 und 1 sein, die als Wahrscheinlichkeit für das Vorhandensein ei- nes Objekts charakterisiert werden kann. Ab einem vordefinierten Schwellenwert, z.B. 0,5 kann dann ein Element derart verstanden werden, als dass es die Anwe- senheit eines Objekts anzeigt. Werte kleiner 0,5 charakterisieren in diesem Fall die Abwesenheit von Objekten innerhalb des korrespondierenden Bereichs. Der Schwellenwert kann als Hyperparameter des neuronalen Netzes verstanden wer- den. R.401853 - 13 - Die Kopfausgaben (^^ , ^^ , ^^) werden im Training als Teil eines Ausgabesignals (^^) bereitgestellt. Vorzugsweise umfasst das neuronale Netz (60) zur Ermittlung einer genauen Position des Objekts (z.B. des Mittelpunkts der Begrenzungsbox) eine weitere Mehrzahl (^^) von Köpfen (^^^ , ^^^ , ^^^). Die Köpfe (^^^ , ^^^ , ^^^) dieser weiteren Mehrzahl (^^) ermitteln weitere Kopfausgaben (^^, ^^, ^^) die je- weils die genaue Position charakterisieren und im Ausgabesignal (^^) bereitge- stellt werden. Alternativ oder zusätzlich umfasst das neuronale Netz (60) zur Ermittlung einer Ausdehnung des Objekts (zum Beispiel Breite und Höhe innerhalb des Bildes) eine weitere Mehrzahl (^^) von Köpfen (^^^ , ^^^ , ^^^). Die Köpfe (^^^ , ^^^ , ^^^) dieser weiteren Mehrzahl (^^) ermitteln weitere Kopfausgaben (^^, ^^ , ^^) die je- weils die genaue Position charakterisieren und im Ausgabesignal (^^) bereitge- stellt werden. In weiteren Ausführungsbeispielen (nicht abgebildet) kann auch vorgesehen wer- den, dass Ausdehnung und Position jeweils gemeinsam von Köpfen einer Mehr- zahl von Köpfen ermittelt werden. Figur 2 zeigt ein Ausführungsbeispiel eines Trainingssystems (140) zum Trainie- ren des neuronalen Netzes (60) mittels eines Trainingsdatensatzes (T). Der Trai- ningsdatensatz (T) umfasst eine Mehrzahl von Trainingsbilden (^^), die zum Trai- nieren des neuronalen Netzes (60) verwendet werden, wobei der Trainingsdaten- satz (T) ferner zu jeweils einem Eingabebild (^^) ein gewünschtes Ausgabesignal (^^) umfasst, welches mit dem Eingabebild (^^) korrespondiert und die An- bzw. Abwesenheit von Objekten innerhalb des Trainingsbildes (^^) sowie deren Posi- tion und Ausdehnung innerhalb des Trainingsbildes (^^) charakterisiert. Zum Training greift eine Trainingsdateneinheit (150) auf eine computerimplemen- tierte Datenbank (St2) zu, wobei die Datenbank (St2) den Trainingsdatensatz (T) zur Verfügung stellt. Die Trainingsdateneinheit (150) ermittelt aus dem Trainings- datensatz (T) vorzugsweise zufällig zumindest ein Trainingsbild (^^) und das zum Trainingsbild (^^) korrespondierende gewünschte Ausgabesignal (^^) und über- R.401853 - 14 - mittelt das Trainingsbild (^^) an das neuronale Netz (60). Das gewünschte Aus- gabesignal (^^) umfasst zumindest eine gewünschte Kopfausgabe, Beispiel eine gewünschte Kopfausgabe bezüglich An- bzw. Abwesenheit von Objekten im Trai- ningsbild (^^). Vorzugsweise umfasst die gewünschte Ausgabesignal (^^) jeweils eine gewünschte Kopfausgabe für An- bzw. Abwesenheit von Objekten innerhalb des Trainingsbildes (^^), für eine Position von Objekten innerhalb des Trainings- bildes (^^) und für eine Ausdehnung der Objekte innerhalb des Trainingsbildes (^^). Das neuronale Netz (60) ermittelt auf Basis des Eingabebilds (^^) ein Ausga- besignal (^^). Das gewünschte Ausgabesignal (^^) und das ermittelte Ausgabesignal (^^) wer- den an eine Veränderungseinheit (180) übermittelt. Basierend auf dem gewünschten Ausgabesignal (^^) und dem ermittelten Ausga- besignal (^^) werden dann von der Veränderungseinheit (180) neue Parameter (Φ′) für das neuronale Netz (60) bestimmt. Hierfür ermittelt die Veränderungsein- heit (180) zunächst eine Mehrzahl von ersten Verlustwerten, wobei ein Verlust- wert jeweils eine Abweichung einer Kopfausgabe (^^ , ^^ , ^^ , ^^, ^^, ^^, ^^, ^^ , ^^) des Ausgabesignals (^^) von einer korrespondierenden vom gewünschten Aus- gabesignal (^^) umfassten gewünschten Kopfausgabe charakterisiert. Eine Kopf- ausgabe (^^ , ^^ , ^^ , ^^, ^^, ^^, ^^, ^^ , ^^) korrespondiert mit einer gewünschten Kopfausgabe genau dann, wenn die Kopfausgabe (^^ , ^^ , ^^ , ^^, ^^, ^^, ^^, ^^ , ^^) die gleiche Eigenschaft (also entweder An- bzw. Abwesenheit, Position, Ausdeh- nung) beschreibt wie die gewünschte Kopfausgabe. Falls eine Kopfausgabe Bei- spielsweise die An- bzw. Abwesenheit eines Objekts charakterisiert, wird diese Kopfausgabe mit der gewünschten Kopfausgabe für An- bzw. Abwesenheit ver- glichen. Insbesondere können die vom Ausgabesignal (^^) umfassten Kopfausgaben (^^ , ^^ , ^^ , ^^, ^^, ^^, ^^, ^^, ^^) jeweils in Form einer Matrix oder eines dreidimensio- nalen Tensors vorliegen, wobei in diesem Fall auch die vom gewünschten Aus- gabesignal (^^) umfasste gewünschte Kopfausgabe in Form einer Matrix bzw. ei- nes dreidimensionalen Tensors vorliegt. Die entsprechenden Matrizen bzw. Ten- soren enthalten entlang einer Höhen- und einer Breitendimension jeweils Werte R.401853 - 15 - bzw. Vektoren, die eine An- bzw. Abwesenheit, eine Position oder eine Ausdeh- nung charakterisieren. Werte bzw. Vektoren an gleichen Indizes entlang der Hö- hen- und Breitendimension einer Kopfausgabe (^^ , ^^ , ^^ , ^^, ^^, ^^, ^^ , ^^, ^^) und einer korrespondieren Kopfausgabe können dann jeweils mittels einer Verlust- funktion verglichen werden. Die so ermittelten Werte können mittels einer mathe- matischen Operation akkumuliert werden beispielsweise summiert, gewichtet summiert oder ihr maximaler Wert ermittelt werden. Das Ergebnis der Akkumula- tion kann dann als ein erster Verlustwert bezüglich der Kopfausgabe (^^ , ^^ , ^^ , ^^, ^^, ^^, ^^, ^^, ^^) bereitgestellt werden. Die ermittelten ersten Verlustwerte können dann wiederum zusammengefasst werden, um einen zweiten Verlustwert zu ermitteln. Die Zusammenfassung kann wiederum durch eine Summe, eine gewichtete Summe oder eine Ermittlung des Maximums der ersten Werte geschehen. Bevorzugt ist auch möglich, dass der zweite Verlustwert um zumindest eine Regularisierung angereichert wird, bei- spielsweise eine ^^- oder ^^-Normalisierung von Parametern (Φ) des neuronalen Netzes (60). Vorzugsweise kann auch eine negative Korrelation zwischen den Kopfausgabe (^^ , ^^ , ^^ , ^^, ^^, ^^, ^^, ^^ , ^^) als Regularisierung mit in den zweiten Verlustwert aufgenommen werden. Hierzu kann zunächst ein jeweils ein durch- schnittlicher Wert oder durchschnittlicher Vektor über die Elemente der Kopfaus- gaben (^^, ^^ , ^^ , ^^, ^^, ^^, ^^ , ^^, ^^) entlang der Höhen- und Breitendimension er- mittelt werden. Anschließend kann für jedes Element eine negative Korrelation ermittelt werden und die so ermittelten Werte zu einer einzigen negativen Korre- lation zusammengefasst werden. Diese Schritte können insbesondere durch die Formel charakterisiert werden, wobei ^(^), … , ^(^) die Mehrzahl von Kopfausgaben ist, ^ die Anzahl der Kopfausgaben, ^ die Anzahl von Elementen entlang der Höhendi- mension innerhalb einer Kopfausgabe, ^ die Anzahl von Elementen entlang der Breitendimension innerhalb einer Kopfausgabe, das Element der ^-ten R.401853 - 16 - Kopfausgabe an Position ℎ, ^ entlang der Höhen- bzw. Breitendimension und || ⋅ || ^ die Euklidische Norm ist. Der zweite Verlustwert kann daher insbesondere basierend auf der Formel: ermittelt werden, wobei ^2 der zweite Verlustwert ist, ^1(^) der ^-te erste Verlust- wert ist und ^ ein Gewichtungskoeffizient der Regularisierung ist, wobei ^ einen Hyperparameter des Trainings charakterisiert. Die Veränderungseinheit (180) ermittelt auf Grundlage des zweiten Verlustwertes die neuen Parameter (Φ′). Im Ausführungsbeispiel geschieht dies mittels eines Gradientenabstiegsverfahren, vorzugsweise Stochastic Gradient Descent, Adam, oder AdamW. In weiteren Ausführungsbeispielen kann das Training auch auf ei- nem evolutionären Algorithmus oder einer Zweite-Grad-Optimierung (engl. se- cond-order optimization) beruhen. Die ermittelten neuen Parameter (Φ′) werden in einem Modellparameterspeicher (St1) gespeichert. Vorzugsweise werden die ermittelten neuen Parameter (Φ′) als Parameter (Φ) dem Neuronales Netz (60) bereitgestellt. In weiteren bevorzugten Ausführungsbeispielen wird das beschriebene Training iterativ für eine vordefinierte Anzahl an Iterationsschritten wiederholt oder iterativ wiederholt, bis der erste Verlustwert einen vordefinierten Schwellenwert unter- schreitet. Alternativ oder zusätzlich ist auch vorstellbar, dass das Training been- det wird, wenn ein durchschnittlicher erster Verlustwert bezüglich eines Test- oder Validierungsdatensatzes einen vordefinierten Schwellenwert unterschreitet. In mindestens einer der Iterationen werden die in einer vorherigen Iteration be- stimmten neuen Parameter (Φ′) als Parameter (Φ) des neuronalen Netzes (60) verwendet. Des Weiteren kann das Trainingssystem (140) mindestens einen Prozessor (145) und mindestens ein maschinenlesbares Speichermedium (146) umfassen, R.401853 - 17 - welches Befehle enthält, welche, wenn sie durch den Prozessor (145) ausgeführt werden, das Trainingssystem (140) veranlassen, ein Trainingsverfahren nach ei- nem der Aspekte der Erfindung auszuführen. Figur 3 zeigt, wie das neuronale Netz (60) zur Objektdetektion von Objekten ei- nes Eingabebildes (^) Inferenzzeit verwendet werden kann. Vorzugsweise liegen Parameter (Φ) des neuronalen Netzes (60) in trainierter Form vor. Mit anderen Worten, das neuronale Netz (60) ist zur Inferenzzeit bereits trainiert worden. Da zur Inferenzzeit nicht mehrere Kopfausgaben bezüglich An- bzw. Abwesen- heit oder Position oder Ausdehnung gewünscht sind, sondern jeweils nur eine, umfasst das neuronale Netz (60) zur Inferenzzeit eine Zusammenfassungseinheit (^^ , ^^, ^^), die die Kopfausgaben der Mehrzahl von Kopfausgaben zu einer einzi- gen Kopfausgabe (^, ^, ^) zusammenfasst. Im Ausführungsbeispiel ist vorgese- hen, dass jeweils An- bzw. Abwesenheit, Position und Ausdehnung basierend auf einer jeweiligen Mehrzahl von Kopfausgaben ermittelt wird. In diesem Fall ist je eine Zusammenfassungseinheit (^, ^, ^) pro Mehrzahl von Kopfausgaben im neuronalen Netz (60) vorgesehen. Die entsprechend ermittelten einzelnen Kopf- ausgaben (^, ^, ^) werden dann in einem Ausgabesignal (^) vom neuronalen Netz (60) zur Verfügung gestellt. In anderen Ausführungsbeispielen (nicht abge- bildet) kann auch vorgesehen sein, dass basierend auf den einzelnen Kopfaus- gaben (^, ^, ^) Begrenzungsboxen ermittelt werden und anstelle der Kopfausga- ben (^, ^, ^) oder zusätzlich zu den Kopfausgaben (^, ^, ^) die Begrenzungsbo- xen im Ausgabesignal (^) bereitgestellt werden. Figur 4 zeigt ein Steuerungssystem (40), welches ausgebildet ist, basierend auf dem neuronalen Netz (60) ein Ansteuersignal (A) eines Aktors (10) zu ermitteln. In vorzugsweise regelmäßigen zeitlichen Abständen wird die Umgebung (20) des Aktors (10) in einem Sensor (30), insbesondere einem Kamerasensor, erfasst, der auch durch eine Mehrzahl von Kamerasensoren gegeben sein kann, bei- spielsweise einer Stereokamera. Das Sensorsignal (S) – bzw. im Fall mehrerer Sensoren je ein Sensorsignal (S) – des Sensors (30) wird an das Steuerungssys- tem (40) übermittelt. Das Steuerungssystem (40) empfängt somit eine Folge von Sensorsignalen (S). Das Steuerungssystem (40) ermittelt hieraus Ansteuersig- nale (A), welche an den Aktor (10) übertragen werden. R.401853 - 18 - Das Steuerungssystem (40) empfängt die Folge von Sensorsignalen (S) des Sensors (30) in einer optionalen Empfangseinheit (50), die die Folge von Sensor- signalen (S) in eine Folge von Eingabebildern (^) umwandelt (alternativ kann auch unmittelbar je das Sensorsignal (S) als Eingabebild (^) übernommen wer- den). Das Eingabebild (^) kann beispielsweise ein Ausschnitt oder eine Weiter- verarbeitung des Sensorsignals (S) sein. Mit anderen Worten wird das Eingabe- bild (^) abhängig von Sensorsignal (S) ermittelt. Die Folge von Eingabebildern (^) wird dem neuronalen Netz (60) zugeführt. Das neuronale Netz (60) wird vorzugsweise parametriert durch Parameter (Φ), die in einem Parameterspeicher (DB) hinterlegt sind und von diesem bereitge- stellt werden. Das neuronale Netz (60) ermittelt aus den Eingabebildern (^) Ausgabesignale (^). Die Ausgabesignale (^) werden einer optionalen Umformeinheit (80) zuge- führt, die hieraus Ansteuersignale (A) ermittelt, welche dem Aktor (10) zugeführt werden, um den Aktor (10) entsprechend anzusteuern. Der Aktor (10) empfängt die Ansteuersignale (A), wird entsprechend angesteuert und führt eine entsprechende Aktion aus. Der Aktor (10) kann hierbei eine (nicht notwendigerweise baulich integrierte) Ansteuerlogik umfassen, welches aus dem Ansteuersignal (A) ein zweites Ansteuersignal ermittelt, mit dem dann der Aktor (10) angesteuert wird. In weiteren Ausführungsformen umfasst das Steuerungssystem (40) den Sensor (30). In noch weiteren Ausführungsformen umfasst das Steuerungssystem (40) alternativ oder zusätzlich auch den Aktor (10). In weiteren bevorzugten Ausführungsformen umfasst das Steuerungssystem (40) zumindest einen Prozessor (45) und zumindest ein maschinenlesbares Speicher- medium (46), auf dem Anweisungen gespeichert sind, die dann, wenn sie auf dem zumindest einen Prozessor (45) ausgeführt werden, das Steuerungssystem (40) veranlassen, das erfindungsgemäße Verfahren auszuführen. R.401853 - 19 - In alternativen Ausführungsformen ist alternativ oder zusätzlich zum Aktor (10) eine Anzeigevorrichtung (10a) vorgesehen. Die Anzeigevorrichtung (10a) kann insbesondere eine optische Anzeigevorrichtung sein, zum Beispiel ein Bild- schirm. Alternativ kann die Anzeigevorrichtung (10a) auch für andere Sinne des Menschen eingerichtet sein. Sie kann zum Beispiel ein Lautsprecher sein oder über haptische Signale wie Vibration einem Benutzer ein Ereignis anzeigen. Figur 5 zeigt, wie das Steuerungssystem (40) zur Steuerung eines wenigstens teilautonomen Roboters, hier eines wenigstens teilautonomen Kraftfahrzeugs (100), eingesetzt werden kann. Bei dem Sensor (30) kann es sich beispielsweise um einen vorzugsweise im Kraftfahrzeug (100) angeordneten Kamerasensor handeln. Das neuronale Netz (60) ist im Ausführungsbeispiel eingerichtet, auf den Eingab- ebildern (^) erkennbare Objekte zu identifizieren, zum Beispiel andere Fahr- zeuge, Personen, Tiere oder statische Objekte wie Ampeln oder Häuser. Bei dem vorzugsweise im Kraftfahrzeug (100) angeordneten Aktor (10) kann es sich beispielsweise um eine Bremse, einen Antrieb oder eine Lenkung des Kraft- fahrzeugs (100) handeln. Das Ansteuersignal (A) kann dann derart ermittelt wer- den, dass der Aktor oder die Aktoren (10) derart angesteuert wird, dass das Kraftfahrzeug (100) beispielsweise eine Kollision mit den vom neuronalen Netz (60) identifizierten Objekten verhindert, insbesondere, wenn es sich um Objekte bestimmter Klassen, z.B. um Fußgänger, handelt. Alternativ oder zusätzlich kann mit dem Ansteuersignal (A) die Anzeigevorrich- tung (10a) angesteuert werden. Die Anzeigevorrichtung kann beispielsweise ein Bildschirm sein, auf dem die identifizierten Objekte dargestellt werden. Auch ist es möglich, dass die Anzeigevorrichtung (10a) mit dem Ansteuersignal (A) derart angesteuert wird, dass sie ein optisches oder akustisches Warnsignal ausgibt, wenn ermittelt wird, dass das Kraftfahrzeug (100) droht, mit einem der identifi- zierten Objekte zu kollidieren. Die Warnung mittels eines Warnsignals kann auch mittels eines haptischen Warnsignals erfolgen, beispielsweise über ein Vibrieren eines Lenkrads des Kraftfahrzeugs (100). R.401853 - 20 - Alternativ kann es sich bei dem wenigstens teilautonomen Roboter auch um ei- nen anderen mobilen Roboter (nicht abgebildet) handeln, beispielsweise um ei- nen solchen, der sich durch Fliegen, Schwimmen, Tauchen oder Schreiten fort- bewegt. Bei dem mobilen Roboter kann es sich beispielsweise auch um einen wenigstens teilautonomen Rasenmäher oder einen wenigstens teilautonomen Putzroboter handeln. Auch in diesen Fällen kann das Ansteuersignal (A) derart ermittelt werden, dass Antrieb und/oder Lenkung des mobilen Roboters derart angesteuert werden, dass der wenigstens teilautonome Roboter beispielsweise eine Kollision mit vom Bildneuronales Netz (60) identifizierten Objekten verhin- dert. Figur 6 zeigt ein Ausführungsbeispiel, in dem das Steuerungssystem (40) zur An- steuerung einer Fertigungsmaschine (11) eines Fertigungssystems (200) ver- wendet wird, indem ein die Fertigungsmaschine (11) steuernder Aktor (10) ange- steuert wird. Bei der Fertigungsmaschine (11) kann es sich beispielsweise um eine Maschine zum Stanzen, Sägen, Bohren und/oder Schneiden handeln. Wei- terhin ist denkbar, dass die Fertigungsmaschine (11) ausgebildet ist mittels eines Greifers ein Fertigungserzeugnis (12a, 12b) zu greifen. Bei dem Sensor (30) kann es sich dann beispielsweise um einen Videosensor handeln, der z.B. die Förderfläche eines Förderbandes (13) erfasst, wobei sich auf dem Förderband (13) Fertigungserzeugnissen (12a, 12b) befinden können. Das neuronale Netz (60) kann beispielsweise eingerichtet sein die Fertigungser- zeugnisse (12a, 12b) auf dem Förderband zu detektieren und insbesondere ihre Position auf dem Förderband zu ermitteln. Der die Fertigungsmaschine (11) steu- ernde Aktor (10) kann dann abhängig von den ermittelten Positionen der Ferti- gungserzeugnisse (12a, 12b) angesteuert werden. Beispielsweise kann der Aktor (10) derart angesteuert werden, dass er ein Fertigungserzeugnis (12a, 12b) an einer vorbestimmten Stelle des Fertigungserzeugnisses (12a, 12b) stanzt, sägt, bohrt und/oder schneidet. Weiterhin ist denkbar, dass das neuronale Netz (60) ausgebildet ist, alternativ oder zusätzlich zur Position weitere Eigenschaften eines Fertigungserzeugnisses (12a, 12b) zu ermitteln. Insbesondere ist vorstellbar, dass das neuronale Netz R.401853 - 21 - (60) ermittelt, ob ein Fertigungserzeugnis (12a, 12b) defekt und/oder beschädigt ist. In diesem Fall kann der Aktor (10) derart angesteuert werden, dass die Ferti- gungsmaschine (11) ein defektes und/oder beschädigtes Fertigungserzeugnis (12a, 12b) aussortiert. Figur 7 zeigt ein Ausführungsbeispiel, bei dem das Steuerungssystem (40) zur Steuerung eines Zugangssystems (300) eingesetzt wird. Das Zugangssystem (300) kann eine physische Zugangskontrolle umfassen, beispielsweise eine Tür (401). Der Sensor (30) kann insbesondere ein Videosensor oder Wärme- bildsensor sein, der eingerichtet ist, einen Bereich vor der Tür (401) zu erfassen. Mittels des neuronalen Netzes (60) kann ein erfasstes Bild interpretiert werden. Insbesondere kann das neuronale Netz (60) Personen auf einem übermittelten Eingabebild (^) detektieren. Sind mehrere Personen gleichzeitig detektiert wor- den, kann durch eine Zuordnung der Personen (also der Objekte) zueinander beispielweise die Identität der Personen besonders zuverlässig ermittelt werden, beispielsweise durch eine Analyse ihrer Bewegungen. Der Aktor (10) kann ein Schloss sein, dass abhängig vom Ansteuersignal (A) die Zugangskontrolle freigibt, oder nicht, beispielsweise die Tür (401) öffnet, oder nicht. Hierzu kann das Ansteuersignal (A) abhängig vom mittels des neuronalen Netzes (60) zum Eingabebild (^) ermittelten Ausgabesignal (^) gewählt werden. Beispielsweise ist denkbar, dass das Ausgabesignal (^) Informationen umfasst, die die Identität einer vom neuronalen Netz (60) detektierten Person charakteri- siert, und das Ansteuersignal (A) basierend auf der Identität der Person gewählt wird. Anstelle der physischen Zugangskontrolle kann auch eine logische Zugangskon- trolle vorgesehen sein. Figur 8 zeigt ein Ausführungsbeispiel, bei dem das Steuerungssystem (40) zur Steuerung eines Überwachungssystems (400) verwendet wird. Von dem in Figur 7 dargestellten Ausführungsbeispiel unterscheidet sich dieses Ausführungsbei- spiel dadurch, dass an Stelle des Aktors (10) die Anzeigevorrichtung (10a) vorge- sehen ist, die vom Steuerungssystem (40) angesteuert wird. Beispielsweise kann der Sensor (30) ein Eingabebild (^) aufzeichnen, auf dem zumindest eine Person R.401853 - 22 - zu erkennen ist, und die Position der zumindest einen Person mittels des neuro- nalen Netzes (60) detektiert werden. Das Eingabebild (^) kann dann auf der An- zeigevorrichtung (10a) dargestellt werden, wobei die detektierten Personen farb- lich hervorgehoben dargestellt werden können. Figur 9 zeigt ein Ausführungsbeispiel, bei dem das Steuerungssystem (40) zur Steuerung eines persönlichen Assistenten (250) eingesetzt wird. Der Sensor (30) ist bevorzugt ein optischer Sensor, der Bilder einer Geste eines Nutzers (249) empfängt, beispielsweise ein Videosensor oder eine Wärmebildkamera. Abhängig von den Signalen des Sensors (30) ermittelt das Steuerungssystem (40) ein Ansteuersignal (A) des persönlichen Assistenten (250), beispielsweise, indem das neuronale Netz (60) eine Gestenerkennung durchführt. Dem persönli- chen Assistenten (250) wird dann dieses ermittelte Ansteuersignal (A) übermittelt und er somit entsprechend angesteuert. Das ermittelte Ansteuersignal (A) kann insbesondere derart gewählt werden, dass es einer vermuteten gewünschten An- steuerung durch den Nutzer (249) entspricht. Diese vermutete gewünschte An- steuerung kann abhängig von der vom neuronalen Netz (60) erkannten Geste er- mittelt werden. Das Steuerungssystem (40) kann dann abhängig von der vermu- teten gewünschten Ansteuerung das Ansteuersignal (A) zur Übermittlung an den persönlichen Assistenten (250) wählen und/oder das Ansteuersignal (A) zur Übermittlung an den persönlichen Assistenten entsprechend der vermuteten ge- wünschten Ansteuerung (250) wählen. Diese entsprechende Ansteuerung kann beispielsweise beinhalten, dass der per- sönliche Assistent (250) Informationen aus einer Datenbank abruft und sie für den Nutzer (249) rezipierbar wiedergibt. Anstelle des persönlichen Assistenten (250) kann auch ein Haushaltsgerät (nicht abgebildet), insbesondere eine Waschmaschine, ein Herd, ein Backofen, eine Mikrowelle oder eine Spülmaschine vorgesehen sein, um entsprechend ange- steuert zu werden. R.401853 - 23 - Figur 10 zeigt ein Ausführungsbeispiel, bei dem das Steuerungssystem (40) zur Steuerung eines medizinischen bildgebenden Systems (500), beispielsweise ei- nes MRT-, Röntgen- oder Ultraschallgeräts, verwendet wird. Der Sensor (30) kann beispielsweise durch einen bildgebenden Sensor gegeben sein. Durch das Steuerungssystem (40) wird die Anzeigevorrichtung (10a) angesteuert. Die An- zeigevorrichtung (10a) kann insbesondere durch einen Bildschirm gegeben sein. Der Sensor (30) ist eingerichtet ein Bild eines Patienten zu ermitteln, beispiels- weise ein Röntgenbild, ein MRT-Bild oder ein Ultraschallbild. Zumindest ein Teil des Bildes wird als Eingabebild (^) an das neuronale Netz (60) übermittelt. Das neuronale Netz (60) kann beispielsweise eingerichtet sein, unterschiedlicher Ar- ten eines auf dem Eingabebild (^) zu erkennendem Gewebe zu detektieren. Das Ansteuersignal (A) kann dann derart gewählt werden, dass die ermittelten Arten von Gewebe auf der Anzeigevorrichtung (10a) farblich hervorgehoben dar- gestellt werden. In weiteren Ausführungsbeispielen (nicht gezeigt) kann das bildgebende System (500) auch für nicht medizinische Zwecke verwendet werden, zum Beispiel um Materialeigenschaften eines Werkstücks zu ermitteln. Zu diesem Zweck kann das bildgebende System (500) ein Bild eines Werkstücks aufzeichnen. Das neu- ronale Netz (60) kann in diesem Fall derart eingerichtet sein, dass es zumindest einen Teil des Bildes als Eingabebild (^) entgegennimmt und Materialien des Werkstücks detektiert. Die so ermittelte Detektion kann beispielsweise zusam- men mit dem Eingabebild auf der Anzeigevorrichtung (10a) dargestellt werden. Der Begriff „Computer“ umfasst beliebige Geräte zur Abarbeitung vorgebbarer Rechenvorschriften. Diese Rechenvorschriften können in Form von Software vor- liegen, oder in Form von Hardware, oder auch in einer Mischform aus Software und Hardware. Im Allgemeinen kann eine Mehrzahl als indexiert verstanden werden, d.h. jedem Element der Mehrzahl wird ein eindeutiger Index zugewiesen, vorzugsweise durch Zuweisung aufeinanderfolgender Ganzzahlen an die in der Mehrzahl ent- haltenen Elemente. Vorzugsweise, wenn eine Mehrzahl ^ Elemente umfasst, R.401853 - 24 - wobei ^ die Anzahl der Elemente in der Mehrzahl ist, werden den Elementen die ganzen Zahlen von 1 bis ^ zugewiesen.

Claims

R.401853 - 25 - Ansprüche 1. Computerimplementiertes Verfahren zum Trainieren eines neuronalen Net- zes (60), wobei das neuronale Netz (60) ausgebildet ist, Objekte in Bildern (^) zu detektieren, und das Training folgende Schritte umfasst: ^ Ermitteln einer Merkmalsrepräsentation (^) eines Trainingsbildes (^^) mittels eines Rückgrats (^) des neuronalen (60); ^ Ermitteln von Kopfausgaben (^^ , ^^ , ^^, ^^, ^^, ^^, ^^, ^^, ^^) basierend auf der Merkmalsrepräsentation (^) und mittels einer Mehrzahl (^^ , ^^, ^^) von Köpfen (^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^) des neuronalen Netzes (60), wobei die Kopfausgaben (^^ , ^^ , ^^ , ^^, ^^, ^^, ^^, ^^, ^^) je- weils für Bereiche des Trainingsbildes (^^) eine Anwesenheit oder Ab- wesenheit eines Objekts charakterisiert oder eine Ausdehnung des Ob- jekts charakterisiert oder eine Position des Objekts charakterisiert oder die Ausdehnung und die Position charakterisiert; ^ Ermitteln einer Mehrzahl von ersten Verlustwerten, wobei jeweils ein erster Verlustwert mit einer Kopfausgabe (^^ , ^^ , ^^ , ^^, ^^, ^^, ^^ , ^^, ^^) korrespondiert und eine Abweichung der Kopfausgabe (^^ , ^^ , ^^ , ^^, ^^, ^^, ^^, ^^ , ^^) von einer gewünschten Kopfausgabe cha- rakterisiert; ^ Anpassen zumindest eines Parameters (^) des Rückgrats (^) und/oder zumindest eines Parameters eines Kopfes (^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^) basierend auf einem zweiten Verlustwert, wobei der zweite Verlustwert eine Summe der ersten Ver- lustwerte charakterisiert. 2. Verfahren nach Anspruch 1, wobei der zweite Verlustwert zusätzlich eine ne- gative Korrelation zwischen den Kopfausgaben (^^ , ^^ , ^^ , ^^, ^^, ^^, ^^, ^^, ^^) charakterisiert. R.401853 - 26 - 3. Verfahren nach Anspruch 1 oder 2, wobei das neuronale Netz (60) eine Mehrzahl von Mehrzahlen (^^ , ^^ , ^^) von Köpfen (^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^) umfasst und für jede Mehrzahl (^^ , ^^ , ^^) von Köpfen (^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^) jeweils ein zweiter Verlustwert ermittelt wird und das neuronale Netz (60) basierend auf einer Summe der zweiten Verlustwerte trainiert wird. 4. Verfahren zum Ermitteln eins Ausgabesignal (^) mittels eines neuronalen Netzes (60), wobei das neuronale Netz gemäß einem der Ansprüche 1 bis 3 eingerichtet ist und das Ausgabesignal (^) die Anwesenheit bzw. Abwesen- heit von Objekten innerhalb eines Bildes (^) charakterisiert, wobei das Ver- fahren die folgenden Schritte umfasst: ^ Ermitteln einer Merkmalsrepräsentation (^) des Bildes (^) mittels des Rückgrats (B) des neuronalen Netzes (60); ^ Ermitteln einer Mehrzahl von Kopfausgaben basierend auf der Merk- malsrepräsentation (^) und mittels der Mehrzahl (^^ , ^^ , ^^) von Köp- fen (^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^ , ^^^) des neuronalen Netzes (60); ^ Ermitteln einer Zusammenfassung (^^ , ^^, ^^) der Mehrzahl von Kopf- ausgaben (^^ , ^^ , ^^ , ^^, ^^, ^^, ^^, ^^ , ^^) zu einer Kopfausgabe (^, ^, ^); ^ Ermitteln des Ausgabesignals (^) basierend auf der einen Kopfausgabe (^, ^, ^). 5. Verfahren nach Anspruch 4, wobei das Verfahren zusätzlich das Training des neuronalen Netzes nach einem der Ansprüche 1 bis 3 umfasst. 6. Verfahren nach Anspruch 4 oder 5, wobei das Ausgabesignal (^) zusätzlich einen Wert umfasst, der eine Unsicherheit bezüglich der Zusammenfassung der Mehrzahl von Kopfausgaben charakterisiert. 7. Verfahren zum Ermitteln eines Ansteuersignals (A) eines Aktors (10) oder einer Anzeigevorrichtung (10a) basierend auf einem Bild (^), wobei im Ver- fahren ein Ausgabesignal (^) basierend auf einem Bild (^) und gemäß einem der Ansprüche 4 bis 6 ermittelt wird und anschließend das Ansteuersignal R.401853 - 27 - (A) basierend auf dem Ausgabesignal (^) ermittelt wird. 8. Vorrichtung (40), welche eingerichtet ist, das Verfahren nach einem der An- sprüche 4 bis 7 auszuführen. 9. Trainingsvorrichtung (140), welche eingerichtet ist, das Verfahren nach ei- nem der Ansprüche 1 bis 3 auszuführen. 10. Computerprogramm, welches eingerichtet ist, das Verfahren nach einem der Ansprüche 1 bis 7 auszuführen, wenn es durch einen Prozessor (45, 145) ausgeführt wird. 11. Maschinenlesbares Speichermedium (46, 146), auf dem das Computerpro- gramm nach Anspruch 10 gespeichert ist.
EP23768504.5A 2022-09-12 2023-09-07 Verfahren und vorrichtung zum trainieren eines objektdetektors mit einem ensemble von mehreren detektionsköpfen Withdrawn EP4587962A1 (de)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
DE102022209517.0A DE102022209517A1 (de) 2022-09-12 2022-09-12 Verfahren und Vorrichtung zum Trainieren eines Objektdetektors
PCT/EP2023/074544 WO2024056503A1 (de) 2022-09-12 2023-09-07 Verfahren und vorrichtung zum trainieren eines objektdetektors mit einem ensemble von mehreren detektionsköpfen

Publications (1)

Publication Number Publication Date
EP4587962A1 true EP4587962A1 (de) 2025-07-23

Family

ID=88018238

Family Applications (1)

Application Number Title Priority Date Filing Date
EP23768504.5A Withdrawn EP4587962A1 (de) 2022-09-12 2023-09-07 Verfahren und vorrichtung zum trainieren eines objektdetektors mit einem ensemble von mehreren detektionsköpfen

Country Status (4)

Country Link
EP (1) EP4587962A1 (de)
CN (1) CN119923649A (de)
DE (1) DE102022209517A1 (de)
WO (1) WO2024056503A1 (de)

Family Cites Families (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US11334766B2 (en) * 2019-11-15 2022-05-17 Salesforce.Com, Inc. Noise-resistant object detection with noisy annotations
US12456047B2 (en) * 2019-11-21 2025-10-28 Google Llc Distilling from ensembles to improve reproducibility of neural networks
DE102020209162A1 (de) * 2020-07-21 2022-01-27 Robert Bosch Gesellschaft mit beschränkter Haftung Verfahren und Vorrichtung zum Detektieren von Anomalien in Sensoraufzeichnungen eines technischen Systems

Also Published As

Publication number Publication date
WO2024056503A1 (de) 2024-03-21
CN119923649A (zh) 2025-05-02
DE102022209517A1 (de) 2024-03-14

Similar Documents

Publication Publication Date Title
DE102020210352A1 (de) Verfahren und Vorrichtung zum Transferlernen zwischen modifizierten Aufgaben
EP3853778B1 (de) Verfahren und vorrichtung zum betreiben eines steuerungssystems
DE102020212515A1 (de) Verfahren und Vorrichtung zum Trainieren eines maschinellen Lernsystems
DE202019105282U1 (de) Vorrichtung zum Optimieren eines System für das maschinelle Lernen
DE102023213094A1 (de) Verfahren und Vorrichtung zur Validierung von Erklärbarkeitsmethoden für ein maschinelles Lernsystem
DE102020208828A1 (de) Verfahren und Vorrichtung zum Erstellen eines maschinellen Lernsystems
DE102018218834A1 (de) Verfahren und Vorrichtung zum Ermitteln eines Ansteuersignals
DE102022201679A1 (de) Verfahren und Vorrichtung zum Trainieren eines neuronalen Netzes
DE102020212514A1 (de) Verfahren zur Ermittlung eines Ausgabesignals mittels eines maschinellen Lernsystems
DE102021209212A1 (de) Verfahren und Vorrichtung zum Ermitteln von Objektdetektionen eines Bildes
EP4587962A1 (de) Verfahren und vorrichtung zum trainieren eines objektdetektors mit einem ensemble von mehreren detektionsköpfen
DE102018211875A1 (de) Verfahren und Vorrichtung zum Betreiben eines Steuerungssystems
DE102021108907A1 (de) Verfahren und Vorrichtung zum Ermitteln einer Klassifikation und/oder eines Regressionsergebnisses unter fehlenden Sensordaten
DE102020212108A1 (de) Verfahren und Vorrichtung zum Anlernen eines maschinellen Lernsystems
WO2020173700A1 (de) Verfahren und vorrichtung zum betreiben eines steuerungssystems
DE102020211262A1 (de) Verfahren und Vorrichtung zum Komprimieren eines neuronalen Netzes
DE102021202342A1 (de) Verfahren und Vorrichtung zum Trainieren eines Klassifikators und/oder Regressors
DE102022205824A1 (de) Verfahren und Vorrichtung zum Trainieren eines neuronalen Netzes
DE202020104727U1 (de) Vorrichtung zum Transferlernen zwischen modifizierten Aufgaben
DE102018216298A1 (de) Verfahren und Vorrichtung zum Betreiben eines Steuerungssystems
DE102021209643A1 (de) Verfahren und Vorrichtung zur Objektdetektion und/oder zur semantischen Segmentierung
DE102021207937A1 (de) Verfahren und Vorrichtung zum Erstellen eines maschinellen Lernsystems mit einer Mehrzahl von Ausgängen
DE102018216295B4 (de) Verfahren und Vorrichtung zum Ermitteln eines Ansteuersignals zum Ansteuern eines Aktors
DE102020208309A1 (de) Verfahren und Vorrichtung zum Erstellen eines maschinellen Lernsystems
DE102020213527A1 (de) Verfahren zum Optimieren einer Strategie für einen Roboter

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20250414

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN

18D Application deemed to be withdrawn

Effective date: 20251028