EP4677567A1 - Verfahren zum erkennen von rauch und/oder flammen in einem bild einer umgebung und verfahren zum trainieren eines maschinenlernalgorithmus - Google Patents
Verfahren zum erkennen von rauch und/oder flammen in einem bild einer umgebung und verfahren zum trainieren eines maschinenlernalgorithmusInfo
- Publication number
- EP4677567A1 EP4677567A1 EP24707168.1A EP24707168A EP4677567A1 EP 4677567 A1 EP4677567 A1 EP 4677567A1 EP 24707168 A EP24707168 A EP 24707168A EP 4677567 A1 EP4677567 A1 EP 4677567A1
- Authority
- EP
- European Patent Office
- Prior art keywords
- image
- smoke
- machine learning
- flames
- learning algorithm
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V10/00—Arrangements for image or video recognition or understanding
- G06V10/70—Arrangements for image or video recognition or understanding using pattern recognition or machine learning
- G06V10/82—Arrangements for image or video recognition or understanding using pattern recognition or machine learning using neural networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V20/00—Scenes; Scene-specific elements
- G06V20/50—Context or environment of the image
- G06V20/52—Surveillance or monitoring of activities, e.g. for recognising suspicious objects
Definitions
- the present invention relates to a method for detecting smoke and/or flames in an image of an environment and a method for training a machine learning algorithm as well as a computing unit and a computer program for carrying out the same.
- Detecting fire, smoke and/or flames in an environment is in many cases a safety-relevant task.
- video-based systems can be used to detect smoke and/or flames in images of the environment.
- DE 102019 207 711 A1 describes a way of detecting smoke based on a sequence of images of an environment.
- anchors usually include information about the position and extent of the object in the image. This information can be represented, for example, using rectangles around the object to be localized.
- anchor-free methods such as the so-called FCOS, as described in “Tian, Zhi, et al. "Feos: Fully convolutional one-stage object detection.” Proceedings of the IEEE/CVF international conference on computer vision. 2019”.
- Smoke can be understood in particular as a mixture of a solid phase and a gaseous phase.
- Smoke can also be understood as an aerosol produced by combustion in a finely divided form consisting of particles such as dust or ash particles and/or liquid droplets (water, oil vapors, acid vapors, liquid combustion residues), in particular contained in exhaust gases.
- a line-by-line (or area-by-area) localization of smoke and/or flames (this can also be referred to as fire detection) is proposed, using a machine learning algorithm such as an artificial neural network, in particular a convolutional neural network.
- the machine learning algorithm can be based on deep learning. This is therefore in particular a video-based video fire detection algorithm based on deep learning.
- the machine learning algorithm expediently receives the image as input and, when applied, the machine learning algorithm then divides the image into the several image areas (instead of image areas, cells can also be spoken of).
- the image is divided into image areas in advance, so that the image areas are passed directly to the machine learning algorithm as input.
- the image can, for example, be divided into nx by ny image areas or cells, where nx stands for a number of image areas in the x direction (e.g. horizontally) and ny for a number of image areas in the y direction (e.g. vertically).
- the detection of smoke or flames in the individual image areas can then be carried out, for example, based on image processing or image analysis, such as based on motion estimation using optical flow. This then detects, for example, the typically upward movement behavior of smoke.
- the output of the machine learning algorithm is then information about whether smoke and/or flames have been detected in each image area; this information can then be made available for further use. For example, if smoke or flames are detected, an alarm can be triggered or other measures can be initiated.
- the machine learning algorithm comprises multiple processing layers and/or the machine learning algorithm is configured to detect smoke and/or flames in the image and thereby divide the image into multiple separate image regions in which smoke and/or flames have been detected.
- the image is divided into several image areas and a prediction is made for each of these image areas, which should indicate whether smoke and/or flames are present in the given image area.
- the advantages of this method are its simplicity compared to anchor-based methods (no hyperparameters and no so-called “non-maximum suppression” are necessary), as well as the visually better localization similar to a coarse segmentation.
- a machine learning algorithm or network with preferably several layers in which the input is processed is used to determine whether smoke or flames are detected.
- the machine learning algorithm or network includes, for example, a combination of convolution, activation, normalization and pooling layers or just some of them.
- the last of these multiple layers has a dimension or output dimension that corresponds to a product of a number of horizontal image areas (see nx above) of the image, a number of vertical image areas (see ny above) of the image, and a number of classes.
- the number of classes is at least two. These classes are selected from, for example: smoke detected, flames detected, and neither smoke nor flames detected. In the case of combined smoke and flame detection, the number of classes is, for example, three. In the case of simple smoke detection, however, the number of classes is two.
- An activation function of this last layer can be a so-called softmax function, for example, whereby the output can be interpreted as probabilities for the respective class. The output can therefore be interpreted as a probability estimate for the presence of smoke or flames in the respective image areas. It can then be concluded that smoke is present, for example, if the probability for the presence of smoke is higher than a certain, predefined threshold.
- Training data can be provided to train such a machine learning algorithm or artificial neural network.
- the training data includes several images, each with several image areas, as well as several labels (so-called annotations) that indicate for at least some, preferably all, image areas whether smoke and/or flames can be seen in them.
- the several images preferably come from different environments and/or situations, which therefore also show different situations in relation to smoke and/or flames (e.g. in relation to their extent).
- the machine learning algorithm is then adjusted based on the training data so that the machine learning algorithm determines information for each image area as to whether smoke and/or flames have been detected in it.
- the multiple labels can be generated from existing labels, each of which indicates for an image whether smoke and/or flames can be seen in it, by transferring information from the existing labels, in particular automatically, to the image areas.
- existing anchor-based labels can be transferred to the individual cells or image areas using a so-called "intersection-over-union heuristic".
- a grid can be imagined, for example, and a rectangular bounding box on top of it (which is or will be defined by a user, for example). Labels in grid format (instead of a box) are then used to train the grid-based approach.
- an overlap with the bounding box can be calculated (or between each cell and the bounding box, This means that each cell is assigned a value (“intersection-over-union” with the bounding box). Cells with a certain overlap can then be defined as “positive” (ie cells with smoke). Cells with too little overlap are entered into training as “negative” (ie cells without smoke).
- the labels for the image areas can also be created manually.
- a cross entropy can be used as a “loss function” for training (especially supervised learning) the machine learning algorithm or network.
- loss functions can also be considered.
- Anchor-based methods differ from the proposed approach mainly in the form of the output. In the latter, a single box is usually expected for an object. In the approach described or proposed here, the output potentially includes several cells or image areas per object.
- a computing unit e.g. a computer or a control unit of a surveillance camera, is set up, in particular in terms of programming, to carry out a method according to the invention.
- a machine-readable storage medium is provided with a computer program stored on it as described above.
- Suitable storage media or data carriers for providing the computer program are in particular magnetic, optical and electrical memories, such as hard disks, flash memories, EEPROMs, DVDs, etc.
- Figure 1 shows schematically an environment in which a method according to the invention can be carried out.
- Figure 2 shows schematically a result of a method according to the invention in a preferred embodiment.
- Figure 3 shows schematically a sequence of a method according to the invention in a preferred embodiment.
- Figure 4 shows schematically a sequence of a method according to the invention in a further preferred embodiment.
- Figure 1 shows a schematic of an environment 100 in which a method according to the invention can be carried out.
- two objects 110 and 112 are shown as examples, as well as smoke 114, which can develop in the environment 100, for example, due to a fire.
- a surveillance camera 120 with a control or computing unit 122 is shown as an example, by means of which the environment 100 can be monitored.
- a remote server or computer 130 is shown as an example (this can represent a so-called cloud, for example), which transmits data, e.g. wirelessly (as indicated) or otherwise) with the surveillance camera 120 or the control or computing unit 122 there.
- the surveillance camera 120 generates video data while monitoring the environment 100, which in turn also includes images. By analyzing these images or one of these images, potential smoke in the environment, as indicated by 114, or flames, can now be detected.
- Figure 2 shows two images schematically, an image 200 at the top and an image 210 at the bottom; both images show the same situation of an environment with smoke.
- image 200 for example, the smoke is detected using an anchor-based method and is shown or indicated by a single rectangle 201.
- the smoke only fills a small part of the rectangle, i.e. detection is rather difficult here.
- the smoke is detected by means of a method according to the invention in a preferred embodiment.
- a border 211 of the smoke is significantly more detailed and precise here; this is based on a cell- or image-area-wise detection of the smoke, as mentioned above and will be explained in more detail below, and is shown or indicated by a single rectangle 201.
- Figure 3 shows a schematic sequence of a method according to the invention in a preferred embodiment. Such a method can run completely or partially, e.g. in the control or computing unit 122 of the surveillance camera 120 or in the server or computer 130 or divided between both.
- an image 300 of the surroundings is first provided.
- This image may have been captured by the surveillance camera; in particular, this image may also have been extracted from video data or a video sequence of the surveillance camera.
- the method is only explained here for one image, the method can also be repeated for a new or different image. next image (e.g. from the video data) in order to achieve continuous monitoring or detection.
- a step 310 it is determined for each of several image areas of the image 300 whether smoke and/or flames are detected therein, using a machine learning algorithm 312 that receives the image or image areas as input.
- Two image areas 302, 303 are shown as examples later in a subsequent step.
- the machine learning algorithm 312 e.g. a neural network
- the last layer 314 has a dimension that corresponds to a product of a number of horizontal image areas of the image, a number of vertical image areas of the image, and a number of classes.
- the number of classes is, for example, three and includes the classes: smoke detected, flames detected, and neither smoke nor flames detected (i.e. no detection).
- information 321 is determined for each image area (two image areas 302, 303 are indicated here as an example) as to whether smoke and/or flames have been detected therein.
- this information can be made available for further use; for example, if smoke or flames are detected, an alarm can be triggered or another measure can be initiated.
- An activation function of this last layer 314 can be a so-called softmax function, for example, whereby the outputs can be interpreted as probabilities for the respective class.
- the output can therefore be interpreted as a probability estimate for the presence of smoke or flames in the respective image areas can be interpreted. If the probability of the presence of smoke is higher than a certain, predefined threshold, it can then be concluded that smoke is present.
- Figure 4 schematically shows a sequence of a method according to the invention in a further preferred embodiment, namely a training of a machine learning algorithm, as it can be used - especially after training - to detect smoke and/or flames in an image of an environment, as was explained in more detail with reference to Figure 3, for example.
- training data 402 is first provided in step 400.
- the training data 402 comprises a plurality of images 404, each with a plurality of image regions, and a plurality of labels 406, which indicate for at least some, preferably all, image regions whether smoke and/or flames can be seen therein.
- the images or image regions can, for example, be of the type also explained and shown with reference to Figure 3; however, it is understood that a significantly higher number of such images or image regions, and in particular also of different environments, is expedient for training.
- a machine learning algorithm 412 is then adapted based on the training data 402. This is done in such a way that the machine learning algorithm 412 determines information for each image area as to whether smoke and/or flames have been detected in it. In this case, for example, weights or so-called neurons (or parameters in general) of the machine learning algorithm are adapted, i.e. changed if necessary. In this way, a trained or machine learning algorithm 422 is obtained, which can be made available for further use in a step 420.
- the training of the machine learning algorithm can be carried out, for example, on a suitable computer, e.g. on the server or computer 130 as shown in Figure 1.
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- General Physics & Mathematics (AREA)
- Multimedia (AREA)
- Evolutionary Computation (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Artificial Intelligence (AREA)
- Health & Medical Sciences (AREA)
- Computing Systems (AREA)
- Databases & Information Systems (AREA)
- General Health & Medical Sciences (AREA)
- Medical Informatics (AREA)
- Software Systems (AREA)
- Image Analysis (AREA)
- Image Processing (AREA)
Abstract
Die Erfindung betrifft ein Verfahren zum Erkennen von Rauch und/oder Flammen in einem Bild einer Umgebung, unter Verwendung eines Maschinenlernalgorithmus, umfassend: Bereitstellen (300) eines Bildes (301) der Umgebung; Bestimmen (310) für jeden von mehreren Bildbereichen (302, 303) des Bildes, ob darin Rauch und/oder Flammen erkannt werden, unter Verwendung des Maschinenlernalgorithmus (312), der das Bild oder die Bildbereiche als Eingang erhält; und Bereitstellen (320), als Ausgang des Maschinenlernalgorithmus, einer Information (321) für jeden Bildbereich, ob darin Rauch und/oder Flammen erkannt worden sind.
Description
Beschreibung
Titel
Verfahren zum Erkennen von Rauch und/oder Flammen in einem Bild einer Urn- und Verfahren zum Trainieren eines
Die vorliegende Erfindung betrifft ein Verfahren zum Erkennen von Rauch und/oder Flammen in einem Bild einer Umgebung und ein Verfahren zum Trainieren eines Maschinenlernalgorithmus sowie eine Recheneinheit und ein Computerprogramm zu deren Durchführung.
Hintergrund der Erfindung
Eine Erkennung von Brand bzw. Rauch und/oder Flammen in einer Umgebung ist in vielen Fällen eine sicherheitsrelevante Aufgabe. Hierzu können z.B. videobasierte Systeme eingesetzt werden, die Rauch und/oder Flammen in Bildern der Umgebung erkennen. Aus der DE 102019 207 711 A1 ist z.B. eine Möglichkeit bekannt, anhand einer Bildfolge von Bildern einer Umgebung Rauch zu erkennen.
Offenbarung der Erfindung
Erfindungsgemäß werden ein Verfahren zum Erkennen von Rauch und/oder Flammen in einem Bild einer Umgebung und ein Verfahren zum Trainieren eines Maschinenlernalgorithmus sowie eine Recheneinheit und ein Computerprogramm zu deren Durchführung mit den Merkmalen der unabhängigen Patentansprüche vorgeschlagen. Vorteilhafte Ausgestaltungen sind Gegenstand der Unteransprüche sowie der nachfolgenden Beschreibung.
Eine automatisierte Lokalisierung von Objekten in Bildern kann z.B. über sogenannte Anker oder Ankerpunkte („anchor“) vorgenommen werden. Solche Anker
umfassen in der Regel Informationen zur Position und Ausdehnung des Objektes im Bild. Diese Informationen können z.B. mittels Rechtecken um das zu lokalisierende Objekt dargestellt werden. Eine Alternative zu Anker-basierten Methoden sind sogenannte Anker-freie Methoden wie z.B. das sog. FCOS, wie in „Tian, Zhi, et al. "Feos: Fully convolutional one-stage object detection." Proceedings of the IEEE/CVF international conference on computer vision. 2019“ Beschrieben.
Die Detektion von Rauch oder auch Flammen unterscheidet sich jedoch deutlich von der Detektion anderer Objekte durch die nichttriviale Lokalisierung von Rauch bzw. Flammen. Als semi-transparentes Objekt besitzt Rauch in der Regel keine klaren Kanten, sodass häufig nicht festgestellt werden kann, an welcher Stelle im Bild sich tatsächlich Rauch befindet. Entsprechend ist eine exakte Lokalisierung von Rauch selten möglich. Des Weiteren lässt sich Rauch nicht immer anhand eines Rechtecks beschreiben, was dazu führt das der Rauch nur einen kleinen Bereich des Rechtecks (z.B. bei der erwähnten Anker-basierten Methode) abdeckt. Dies gilt gleichermaßen für Flammen. Die Erkennung von Rauch und Flammen gestaltet sich damit also in der Regel schwierig.
Unter Rauch kann insbesondere ein Gemisch aus einer festen in einer gasförmigen Phase verstanden werden. Unter Rauch kann ferner ein durch Verbrennung entstehendes Aerosol in feinstverteilter Form aus Partikeln, wie Staub- oder Asche-partikel und /oder Flüssigkeitströpfchen (Wasser, Öldämpfe, Säuredämpfe, flüssige Verbrennungsrückstände), insbesondere im Abgas enthalten, verstanden werden.
In Rahmen der vorliegenden Erfindung wird nunmehr eine zeilenweise (oder bereichsweise) Lokalisierung von Rauch und/oder Flammen (es kann auch von einer Branderkennung gesprochen werden) vorgeschlagen, und zwar unter Verwendung eines Maschinenlernalgorithmus wie z.B. ein künstliches neuronales Netz, insbesondere ein faltendes neuronales Netz. Insbesondere kann der Maschinenlernalgorithmus auf Deep-Learning basieren. Es handelt sich damit also insbesondere um einen auf Deep-Learning basierenden, videobasierten Video- Branderkennungs-Algorithmus.
Hierbei wird zunächst ein Bild einer Umgebung, die es z.B. zu überwachen gilt, bereitgestellt. So kann das Bild z.B. von einer Kamera oder Überwachungska- mera bereitgestellt werden. Ein solches Bild kann dabei auch Teil eines Videos oder einer Videosequenz sein. Es versteht sich, dass auch mehrere Bilder bereitgestellt werden können, für die das nachfolgend zu beschreibende Verfahren dann jeweils separat angewendet werden kann - dies erlaubt dann z.B. eine kontinuierliche Überwachung auf Rauch und/oder Flammen.
Dann wird für jeden von mehreren Bildbereichen des Bildes bestimmt, ob darin Rauch und/oder Flammen erkannt werden, und zwar unter Verwendung des Maschinenlernalgorithmus, der das Bild oder die Bildbereiche als Eingang erhält. Zweckmäßigerweise erhält der Maschinenlernalgorithmus das Bild als Eingang und der Maschinenlernalgorithmus unterteilt dann bei Anwendung das Bild in die mehreren Bildbereiche (es kann anstelle von Bildbereichen auch von Zellen gesprochen werden). Denkbar ist an sich aber auch, dass die Unterteilung des Bildes in die Bildbereiche vorab erfolgt, sodass dem Maschinenlernalgorithmus direkt die Bildbereiche als Eingang übergeben werden. Das Bild kann z.B. in nx mal ny Bildbereiche bzw. Zellen unterteilt sein, wobei nx für eine Anzahl an Bildbereichen in x-richtung (z.B. horizontal) und ny für eine Anzahl an Bildbereichen in y-richtung (z.B. vertikal) steht. Diese Anzahlen und auch deren Anordnung (zweckmäßigerweise nicht überlappend aber vorzugsweise aneinander angrenzend) können vorab festgelegt sein.
Die Erkennung von Rauch bzw. Flammen in den einzelnen Bildbereichen kann dann z.B. basierend auf Bildverarbeitung oder Bildanalyse erfolgen, wie z.B. basierend auf einer Bewegungsschätzung mittels optischen Flusses. Diese detek- tiert dann z.B. das typischerweise aufwärtsgerichtete Bewegungsverhalten von Rauch.
Als Ausgang des Maschinenlernalgorithmus wird dann also eine Information für jeden Bildbereich erhalten, ob darin Rauch und/oder Flammen erkannt worden sind; diese Information kann dann für eine weitere Verwendung bereitgestellt werden. So können z.B. bei erkanntem Rauch oder Flammen ein Alarm ausgelöst oder sonstige Maßnahmen eingeleitet werden.
Vorzugsweise weist der Maschinenlernalgorithmus mehrere Verarbeitungsschichten auf, und/oder ist der Maschinenlernalgorithmus ausgebildet, Rauch und/oder Flammen in dem Bild zu erkennen und dabei das Bild in mehrere getrennte Bildbereiche zu unterteilen, in denen Rauch und/oder Flammen erkannt worden sind.
Das Bild wird also in mehrere Bildbereiche unterteilt und es wird eine Vorhersage für jeden dieser Bildbereiche getroffen, die angeben soll, ob sich Rauch und/oder Flammen im gegebenen Bildbereich befinden. Die Vorteile dieser Methode sind ihre Einfachheit verglichen mit Anker-basierten Methoden (es sind keine Hyperparameter und keine sog. „non-maximum-suppression“ nötig), sowie die visuell bessere Lokalisierung ähnlich einer groben Segmentierung.
Grundlegend kann es sich um einen typischen Aufbau einer Deep-Learning-An- wendung handeln. Aus einer Eingabe (z.B. ein Bild, ggf. aus einer Videosequenz, eines möglichen Brandszenarios) wird mittels eines Maschinenlernalgorithmus bzw. Netzwerks mit vorzugsweise mehreren Schichten, in denen die Eingabe prozessiert wird, bestimmt, ob Rauch oder Flammen erkannt werden. Der Maschinenlernalgorithmus bzw. das Netzwerk umfasst dabei z.B. eine Kombination aus Faltungs-, Aktivierungs-, Normalisierungs- und Pooling-Schichten oder auch nur einige davon.
Die letzte dieser mehreren Schichten hat dabei insbesondere eine Dimension bzw. Ausgabe-Dimension, die einem Produkt aus einer Anzahl an horizontalen Bildbereichen (vgl. nx oben) des Bildes, einer Anzahl an vertikalen Bildbereichen (vgl. ny oben) des Bildes, und einer Anzahl an Klassen entspricht. Die Anzahl an Klassen ist dabei wenigstens zwei. Diese Klassen sind z.B. ausgewählt aus: Rauch erkannt, Flammen erkannt, und weder Rauch noch Flammen erkannt. Im Falle einer kombinierten Rauch- und Flammendetektion ist die Anzahl der Klassen also z.B. drei. Bei einer einfachen Rauchdetektion hingegen ist die Anzahl an Klassen zwei.
Eine Aktivierungsfunktion dieser letzten Schicht kann z.B. eine sog. Softmax- Funktion sein, wodurch die Ausgaben als Wahrscheinlichkeiten für die jeweilige Klasse interpretiert werden können. Die Ausgabe kann also als Wahrscheinlichkeits-Schätzung für das Vorhandensein von Rauch oder Flammen in den jeweiligen Bildbereichen interpretiert werden. Es kann dann z.B. bei einer Wahrscheinlichkeit für das Vorhandensein von z.B. Rauch, die höher als in bestimmter, vorgegebenen Schwellwert ist, auf das Vorhandensein von Rauch geschlossen werden.
Zum Trainieren eines solchen Maschinenlernalgorithmus bzw. künstlichen neuronalen Netzes können Trainingsdaten bereitgestellt werden. Die Trainingsdaten umfassen dabei mehrere Bilder mit jeweils mehreren Bildbereichen, sowie mehrere Label (sog. Annotationen), die für zumindest einige, vorzugsweise alle, Bildbereiche angeben, ob darin Rauch und/oder Flammen zu erkennen sind. Die mehreren Bilder stammen dabei vorzugsweise von verschiedenen Umgebungen und/oder Situationen, die also insbesondere auch verschiedene Situationen in Bezug auf Rauch und/oder Flammen (z.B. in Bezug auf deren Ausdehnung) zeigen.
Der Maschinenlernalgorithmus wird dann basierend auf den Trainingsdaten derart angepasst, dass der Maschinenlernalgorithmus eine Information für jeden Bildbereich bestimmt, ob darin Rauch und/oder Flammen erkannt worden sind.
Die mehreren Label können dabei aus vorhandenen Label erzeugt werden, die jeweils für ein Bild angeben, ob darin Rauch und/oder Flammen zu erkennen sind, indem eine Information der vorhandenen Label, insbesondere automatisiert, auf die Bildbereiche übertragen wird. Beispielsweise können vorhandene Ankerbasierte Label mittels einer sog. „Intersection-over-Union Heuristik“auf die einzelnen Zellen bzw. Bildbereiche übertragen werden. Hierfür kann sich z.B. ein Gitter vorgestellt werden, und darüberliegend eine rechteckige Bounding-Box (die z.B. von einem Benutzer definiert ist oder wird). Zum Trainieren des gitter-basierten Ansatzes werden dann entsprechend Labels im Gitter-Format (statt einer Box) verweden. Um ein Labels im Gitter-Format zu erzeugen, kann ein Überlapp mit der Bounding-Box berechnet (bzw. zwischen jeder Zelle und der Bounding-Box,
„Intersection-over-Union“) werden. So wird jeder Zelle ein Wert („Intersection-o- ver-Union“ mit der Bounding-Box) zugeordnet. Dann können Zellen ab einem gewissen Überlapp als „positiv“ (d.h. Zellen mit Rauch) definiert werden. Zellen mit einem zu geringen Überlapp gehen entsprechend als „negativ“ (d.h. Zellen ohne Rauch) ins Training ein. An sich können die Labe für die Bildbereiche aber auch manuell erzeugt werden.
Als „Loss-Funktion“ bzw. Verlustfunktion für das Training (insbesondere eines überwachten Lernens) des Maschinenlernalgorithmus bzw. Netzwerkes kann eine Kreuzentropie genutzt werden. An sich kommen aber auch andere Verlustfunktion in Betracht.
Anchor-basierte Methoden unterscheiden sich hauptsächlich in der Form des Outputs von dem vorgeschlagenen Vorgehen. Dort wird meist eine einzelne Box für ein Objekt erwartet. In dem hier beschriebenen bzw. vorgeschlagenen Vorgehen umfasst der Ausgang potential mehrere Zellen bzw. Bildbereiche pro Objekt.
Eine erfindungsgemäße Recheneinheit, z.B. ein Computer oder eine Steuereinheit einer Überwachungskamera, ist, insbesondere programmtechnisch, dazu eingerichtet, ein erfindungsgemäßes Verfahren durchzuführen.
Auch die Implementierung eines erfindungsgemäßen Verfahrens in Form eines Computerprogramms oder Computerprogrammprodukts mit Programmcode zur Durchführung aller Verfahrensschritte ist vorteilhaft, da dies besonders geringe Kosten verursacht, insbesondere wenn ein ausführendes Steuergerät noch für weitere Aufgaben genutzt wird und daher ohnehin vorhanden ist. Schließlich ist ein maschinenlesbares Speichermedium vorgesehen mit einem darauf gespeicherten Computerprogramm wie oben beschrieben. Geeignete Speichermedien bzw. Datenträger zur Bereitstellung des Computerprogramms sind insbesondere magnetische, optische und elektrische Speicher, wie z.B. Festplatten, Flash- Speicher, EEPROMs, DVDs u.a.m. Auch ein Download eines Programms über Computernetze (Internet, Intranet usw.) ist möglich. Ein solcher Download kann dabei drahtgebunden bzw. kabelgebunden oder drahtlos (z.B. über ein WLAN- Netz, eine 3G-, 4G-, 5G- oder 6G-Verbindung, etc.) erfolgen.
Weitere Vorteile und Ausgestaltungen der Erfindung ergeben sich aus der Beschreibung und der beiliegenden Zeichnung.
Die Erfindung ist anhand eines Ausführungsbeispiels in der Zeichnung schematisch dargestellt und wird im Folgenden unter Bezugnahme auf die Zeichnung beschrieben.
Kurze Beschreibung der Zeichnungen
Figur 1 zeigt schematisch eine Umgebung, bei der ein erfindungsgemäßes Verfahren durchführbar ist.
Figur 2 zeigt schematisch ein Ergebnis eines erfindungsgemäßen Verfahrens in einer bevorzugten Ausführungsform.
Figur 3 zeigt schematisch einen Ablauf eines erfindungsgemäßen Verfahrens in einer bevorzugten Ausführungsform.
Figur 4 zeigt schematisch einen Ablauf eines erfindungsgemäßen Verfahrens in einer weiteren bevorzugten Ausführungsform.
Ausführungsform(en) der Erfindung
In Figur 1 ist schematisch eine Umgebung 100 gezeigt, bei der ein erfindungsgemäßes Verfahren durchführbar ist. In der Umgebung sind beispielhaft zwei Objekte 110 und 112 gezeigt, sowie beispielhaft Rauch 114, der sich z.B. aufgrund eines Brandes in der Umgebung 100 entwickeln kann.
Weiterhin ist beispielhaft eine Überwachungskamera 120 mit einer Steuer- oder Recheneinheit 122 gezeigt, mittels welcher die Umgebung 100 überwacht werden kann. Außerdem ist beispielhaft ein entfernter Server oder Computer 130 gezeigt (dieser kann z.B. eine sog. Cloud repräsentieren), der datenübertragend,
z.B. drahtlos (wie angedeutet) oder auch anderweitig) mit der Überwachungska- mera 120 bzw. dort der Steuer- oder Recheneinheit 122 verbunden sein kann.
Die Überwachungskamera 120 erzeugt während der Überwachung der Umgebung 100 Videodaten, die wiederum auch Bilder umfassen. Durch Analyse dieser Bilder oder eines dieser Bilder soll nun potentieller Rauch in der Umgebung, wie mit 114 angedeutet, oder auch Flammen, erkannt werden.
In Figur 2 sind schematisch zwei Bilder gezeigt, oben ein Bild 200 und unten ein Bild 210; beide Bilder zeigen an sich dieselbe Situation einer Umgebung mit Rauch. In dem Bild 200 ist der Rauch z.B. mittels einer Anker-basierten Methode erkannt und durch ein einzelnes Rechteck 201 dargestellt bzw. angedeutet. Hier ist deutlich zu sehen, dass der Rauch nur einen geringen Teil des Rechtecks ausfüllt, d.h. die Erkennung ist hier eher schwierig.
In dem Bild 210 ist der Rauch mittels eines erfindungsgemäßen Verfahrens in einer bevorzugten Ausführungsformeiner erkannt. Eine Umrandung 211 des Rauchs ist hier deutlich detaillierter und genauer; dies basiert auf einer zellen- bzw. bildbereichsweisen Erkennung des Rauchs, wie vorstehend erwähnt und nachfolgend noch näher erläutert werden soll, und durch ein einzelnes Rechteck 201 dargestellt bzw. angedeutet.
In Figur 3 ist schematisch ein Ablauf eines erfindungsgemäßen Verfahrens in einer bevorzugten Ausführungsform dargestellt. Ein solches Verfahren kann, vollständig oder teilweise, z.B. in der Steuer- oder Recheneinheit 122 der Überwachungskamera 120 oder in dem Server oder Computer 130 oder aufgeteilt auf beides ablaufen.
In einem Schritt 300 wird zunächst ein Bild 300 der Umgebung bereitgestellt. Dieses kann mittels der Überwachungskamera erfasst worden sein; insbesondere kann dieses Bild auch aus Videodaten bzw. einer Videosequenz der Überwachungskamera extrahiert worden sein. Wenngleich das Verfahren hier nur für ein Bild erläutert wird, so kann das Verfahren auch immer wieder für ein neues bzw.
nächstes Bild (z.B. aus den Videodaten) durchgeführt werden, um so eine laufende Überwachung bzw. Erkennung zu erreichen.
In einem Schritt 310 wird für jeden von mehreren Bildbereichen des Bildes 300 bestimmt, ob darin Rauch und/oder Flammen erkannt werden, und zwar unter Verwendung eines Maschinenlernalgorithmus 312, der das Bild oder die Bildbereiche als Eingang erhält. Zwei Bildbereiche 302, 303 sind beispielhaft erst später in einem nachfolgenden Schritt dargestellt.
Es ist zu sehen, dass der Maschinenlernalgorithmus 312, z.B. ein neuronales Netz, mehrere Verarbeitungsschichten aufweist, wobei eine letzte Schicht davon mit 314 bezeichnet ist. Es kann sich dabei um Faltungs-, Aktivierungs-, Normali- sierungs- und Pooling-Schichten bzw. eine Kombination davon handeln. Je nach Art des Netzwerks können auch nur manche dieser Schichten Verwendung finden.
Insbesondere die letzte Schicht 314 weist hierbei eine Dimension auf, die einem Produkt aus einer Anzahl an horizontalen Bildbereichen des Bildes, einer Anzahl an vertikalen Bildbereichen des Bildes, und einer Anzahl an Klassen entspricht. Die Anzahl an Klassen ist z.B. drei und umfasst die Klassen: Rauch erkannt, Flammen erkannt, und weder Rauch noch Flammen erkannt (also keine Detektion).
Als Ausgang des Maschinenlernalgorithmus 312 wird damit eine Information 321 für jeden Bildbereich (hier sind beispielhaft zwei Bildbereiche 302, 303 angedeutet) bestimmt, ob darin Rauch und/oder Flammen erkannt worden sind. In Schritt 320 können diese Informationen zur weiteren Verwendung bereitgestellt werden; so kann z.B. bei erkanntem Rauch oder erkannten Flammen ein Alarm ausgelöst oder eine sonstige Maßnahme eingeleitet werden.
Eine Aktivierungsfunktion dieser letzten Schicht 314 kann z.B. eine sog. Softmax- Funktion sein, wodurch die Ausgaben als Wahrscheinlichkeiten für die jeweilige Klasse interpretiert werden können. Die Ausgabe kann also als Wahrscheinlichkeits-Schätzung für das Vorhandensein von Rauch oder Flammen in den
jeweiligen Bildbereichen interpretiert werden. Es kann dann z.B. bei einer Wahrscheinlichkeit für das Vorhandensein von z.B. Rauch, die höher als in bestimmter, vorgegebenen Schwellwert ist, auf das Vorhandensein von Rauch geschlossen werden.
In Figur 4 ist schematisch ein Ablauf eines erfindungsgemäßen Verfahrens in einer weiteren bevorzugten Ausführungsform dargestellt, und zwar ein Trainieren eines Maschinenlernalgorithmus, wie er - insbesondere nach dem Trainieren - zum Erkennen von Rauch und/oder Flammen in einem Bild einer Umgebung verwendet werden kann, wie dies z.B. in Bezug auf Figur 3 näher erläutert wurde.
Hierzu werden zunächst in Schritt 400 Trainingsdaten 402 bereitgestellt. Die Trainingsdaten 402 umfassen dabei mehrere Bilder 404 mit jeweils mehreren Bildbereichen, und mehrere Label 406, die für zumindest einige, vorzugsweise alle, Bildbereiche angeben, ob darin Rauch und/oder Flammen zu erkennen sind. Die Bilder bzw. Bildbereiche können z.B. in der Art vorliegen, wie sie auch in Bezug auf Figur 3 erläutert und gezeigt sind; es versteht sich jedoch, dass zum Trainieren eine deutlich höhere Anzahl solcher Bilder bzw. Bildbereiche und insbesondere auch von verschiedenen Umgebungen zweckmäßig ist.
In einem Schritt 410 wird ein Maschinenlernalgorithmus 412 dann angepasst, und zwar basierend auf den Trainingsdaten 402. Dies erfolgt derart, dass der Maschinenlernalgorithmus 412 eine Information für jeden Bildbereich bestimmt, ob darin Rauch und/oder Flammen erkannt worden sind. Hierbei werden z.B. Gewichte oder sog. Neuronen (oder allgemein Parameter) des Maschinenlernalgorithmus angepasst, also ggf. verändert. Auf diese Weise wird ein trainierter bzw. Maschinenlernalgorithmus 422 erhalten, der in einem Schritt 420 zur weiteren Verwendung bereitgestellt werden kann.
Das Trainieren des Maschinenlernalgorithmus kann z.B. auf einem geeigneten Computer durchgeführt werden, z.B. auch auf dem Server bzw. Computer 130 wie in Figur 1 gezeigt.
Claims
1. Verfahren zum Erkennen von Rauch und/oder Flammen in einem Bild einer Umgebung, unter Verwendung eines Maschinenlernalgorithmus, umfassend:
Bereitstellen (300) eines Bildes (301) der Umgebung;
Bestimmen (310) für jeden von mehreren Bildbereichen (302, 303) des Bildes, ob darin Rauch und/oder Flammen erkannt werden, unter Verwendung des Maschinenlernalgorithmus (312), der das Bild oder die Bildbereiche als Eingang erhält; und
Bereitstellen (320), als Ausgang des Maschinenlernalgorithmus, einer Information (321) für jeden Bildbereich, ob darin Rauch und/oder Flammen erkannt worden sind.
2. Verfahren nach Anspruch 1 , wobei der Maschinenlernalgorithmus (312) mehrere Verarbeitungsschichten (314) aufweist, und/oder der Maschinenlernalgorithmus (312) ausgebildet ist, Rauch und/oder Flammen in dem Bild (301) zu erkennen und dabei das Bild (301) in mehrere getrennte Bildbereiche (302, 303) zu unterteilen, in denen Rauch und/oder Flammen erkannt worden sind.
3. Verfahren nach Anspruch 2, wobei eine letzte der mehreren Verarbeitungsschichten eine Dimension aufweist, die einem Produkt aus einer Anzahl an horizontalen Bildbereichen des Bildes, einer Anzahl an vertikalen Bildbereichen des Bildes, und einer Anzahl an Klassen entspricht, und wobei die Anzahl an Klassen wenigstens zwei ist.
4. Verfahren nach Anspruch 3, wobei die Klassen ausgewählt sind aus:
Rauch erkannt, Flammen erkannt, und
- weder Rauch noch Flammen erkannt.
5. Verfahren nach einem der vorstehenden Ansprüche, wobei der Maschinenlernalgorithmus ein künstliches neuronales Netz, insbesondere ein faltendes neuronales Netz, umfasst, und/oder auf Deep-Learning basiert.
6. Verfahren nach einem der vorstehenden Ansprüche, wobei der Maschinenlernalgorithmus das Bild (301) als Eingang erhält und bei Anwendung das Bild in die mehreren Bildbereiche unterteilt.
7. Verfahren zum Trainieren eines Maschinenlernalgorithmus zum Erkennen von Rauch und/oder Flammen in einem Bild einer Umgebung, umfassend:
Bereitstellen (400) von Trainingsdaten (402), umfassend mehrere Bilder mit jeweils mehreren Bildbereichen, und mehrere Label, die für zumindest einige, vorzugsweise alle, Bildbereiche angeben, ob darin Rauch und/oder Flammen zu erkennen sind;
Anpassen (410) des Maschinenlernalgorithmus (412), basierend auf den Trainingsdaten, derart, dass der Maschinenlernalgorithmus eine Information für jeden Bildbereich bestimmt, ob darin Rauch und/oder Flammen erkannt worden sind; und
Bereitstellen (420) des trainierten Maschinenlernalgorithmus (422).
8. Verfahren nach Anspruch 7, wobei die mehreren Label aus vorhandenen Label erzeugt werden, die jeweils für ein Bild angeben, ob darin Rauch und/oder Flammen zu erkennen sind, indem eine Information der vorhandenen Label, insbesondere automatisiert, auf die Bildbereiche übertragen wird.
9. Recheneinheit (122, 130), die dazu eingerichtet ist, alle Verfahrensschritte eines Verfahrens nach einem der vorstehenden Ansprüche durchzuführen.
10. Computerprogramm, das eine Recheneinheit (122, 130) dazu veranlasst, alle Verfahrensschritte eines Verfahrens nach einem der Ansprüche 1 bis 8 durchzuführen, wenn es auf der Recheneinheit (122, 130) ausgeführt wird.
11. Maschinenlesbares Speichermedium mit einem darauf gespeicherten Computerprogramm nach Anspruch 10.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| DE102023201939.6A DE102023201939A1 (de) | 2023-03-03 | 2023-03-03 | Verfahren zum Erkennen von Rauch und/oder Flammen in einem Bild einer Umgebung und Verfahren zum Trainieren eines Maschinenlernalgorithmus |
| PCT/EP2024/054489 WO2024184081A1 (de) | 2023-03-03 | 2024-02-22 | Verfahren zum erkennen von rauch und/oder flammen in einem bild einer umgebung und verfahren zum trainieren eines maschinenlernalgorithmus |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| EP4677567A1 true EP4677567A1 (de) | 2026-01-14 |
Family
ID=90054139
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP24707168.1A Pending EP4677567A1 (de) | 2023-03-03 | 2024-02-22 | Verfahren zum erkennen von rauch und/oder flammen in einem bild einer umgebung und verfahren zum trainieren eines maschinenlernalgorithmus |
Country Status (3)
| Country | Link |
|---|---|
| EP (1) | EP4677567A1 (de) |
| DE (1) | DE102023201939A1 (de) |
| WO (1) | WO2024184081A1 (de) |
Family Cites Families (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP6968681B2 (ja) * | 2016-12-21 | 2021-11-17 | ホーチキ株式会社 | 火災監視システム |
| DE102019207711A1 (de) | 2019-05-27 | 2020-12-03 | Robert Bosch Gmbh | Verfahren und Vorrichtung zur Detektion von Rauch |
-
2023
- 2023-03-03 DE DE102023201939.6A patent/DE102023201939A1/de active Pending
-
2024
- 2024-02-22 EP EP24707168.1A patent/EP4677567A1/de active Pending
- 2024-02-22 WO PCT/EP2024/054489 patent/WO2024184081A1/de not_active Ceased
Also Published As
| Publication number | Publication date |
|---|---|
| WO2024184081A1 (de) | 2024-09-12 |
| DE102023201939A1 (de) | 2024-09-05 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| EP3671632B1 (de) | Bildbasierte wartungsvorhersage und detektion von fehlbedienungen | |
| DE202017102381U1 (de) | Vorrichtung zum Verbessern der Robustheit gegen "Adversarial Examples" | |
| DE19955919C1 (de) | Verfahren zur Erkennung von Objekten in Bildern auf der Bildpixelebene | |
| DE112017001311T5 (de) | System und Verfahren zum Trainieren eines Objektklassifikators durch maschinelles Lernen | |
| EP3977430B1 (de) | Verfahren und vorrichtung zur detektion von rauch | |
| EP3748454B1 (de) | Verfahren und vorrichtung zum automatischen ausführen einer steuerfunktion eines fahrzeugs | |
| EP3748453A1 (de) | Verfahren und vorrichtung zum automatischen ausführen einer steuerfunktion eines fahrzeugs | |
| DE102021201124A1 (de) | Trainieren von bildklassifizierernetzen | |
| DE102009055127A1 (de) | Vorrichtung und Verfahren zum Überwachen von Videoobjekten | |
| DE102021204040A1 (de) | Verfahren, Vorrichtung und Computerprogramm zur Erstellung von Trainingsdaten im Fahrzeug | |
| EP3782081B1 (de) | Verfahren zur erzeugung eines testdatensatzes, verfahren zum testen, verfahren zum betreiben eines systems, vorrichtung, steuerungssystem, computerprogrammprodukt, computerlesbares medium, erzeugung und verwendung | |
| DE102022001208A1 (de) | Verfahren zur Prädiktion von Trajektorien von Objekten | |
| DE102020201605A1 (de) | Computerimplementiertes Verfahren und Vorrichtung für maschinelles Lernen | |
| DE102013224382A1 (de) | Beschleunigte Objekterkennung in einem Bild | |
| DE102019209228A1 (de) | Verfahren und Vorrichtung zum Überprüfen der Robustheit eines künstlichen neuronalen Netzes | |
| DE102019207911A1 (de) | Verfahren, Vorrichtung und Computerprogramm zur Vorhersage einer Lernkurve | |
| EP4677567A1 (de) | Verfahren zum erkennen von rauch und/oder flammen in einem bild einer umgebung und verfahren zum trainieren eines maschinenlernalgorithmus | |
| WO2024184080A1 (de) | Verfahren zum erkennen von rauch in bildern einer umgebung und verfahren zum trainieren eines maschinenlernalgorithmus | |
| DE102021124649A1 (de) | Verfahren und Vorrichtung zur Erzeugung von Bildern anhand von Szenegraphen | |
| DE102024207482A1 (de) | Verfahren und vorrichtung zur automatischen optischen inspektion (aoi) | |
| DE102020101911A1 (de) | Computerimplementiertes Verfahren zum Trainieren eines künstlichen neuronalen Netzwerks, computerimplementiertes Verfahren zur visuellen Objekterkennung, Verfahren zum Steuern eines Kraftfahrzeugs, Computerprogramm sowie computerlesbares Speichermedium | |
| DE102019117680A1 (de) | Automatisiertes segmentierungsverfahren für die qualitätsprüfung | |
| DE102021113767A1 (de) | Überwachungseinrichtung und Verfahren zum Überwachen eines Gesamtsystems aus mehreren unterschiedlichen Teilsystemen auf Fehler und Kraftfahrzeug | |
| DE102020202392A1 (de) | Verfahren, Vorrichtung und Computerprogramm zum Vorhersagen einer geeigneten Konfiguration eines maschinellen Lernsystems für einen Trainingsdatensatz | |
| DE102023208956A1 (de) | Verfahren zur Objekterkennung in einer Umgebung |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: UNKNOWN |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE |
|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE |
|
| 17P | Request for examination filed |
Effective date: 20251006 |
|
| AK | Designated contracting states |
Kind code of ref document: A1 Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR |