WO2025261663A1 - Verfahren und system zum betrieb eines technischen geräts - Google Patents
Verfahren und system zum betrieb eines technischen gerätsInfo
- Publication number
- WO2025261663A1 WO2025261663A1 PCT/EP2025/063039 EP2025063039W WO2025261663A1 WO 2025261663 A1 WO2025261663 A1 WO 2025261663A1 EP 2025063039 W EP2025063039 W EP 2025063039W WO 2025261663 A1 WO2025261663 A1 WO 2025261663A1
- Authority
- WO
- WIPO (PCT)
- Prior art keywords
- model
- client
- server
- aggregated
- global
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
- G06N3/098—Distributed learning, e.g. federated learning
Definitions
- the invention relates to a computer-implemented method for operating a technical device by a system comprising a server and at least one client with a respective connected technical device.
- the invention relates to a system and a computer program product.
- a foundation model is a model based on artificial intelligence (AI) that is trained with broad data so that it can be applied to a wide variety of use cases.
- AI artificial intelligence
- Foundation models have transformed AI and enabled prominent chatbots and generative AI. Foundation models are general-purpose technologies that can support a wide variety of use cases.
- a communication strategy for federated learning often involves the exchange of model updates between a central server and the participating devices while respecting privacy and minimizing data transfer.
- Publication US 2024/155025 A1 describes a so-called “Importance-Aware Federated Edge Learning” (FEEL) system, in which a problem for maximizing learning efficiency is formulated based on the relationship between loss reduction and gradient norm by jointly considering the allocation of communication resources and data selection, thereby reducing training latency and improving learning accuracy.
- FEEL Transactional-Aware Federated Edge Learning
- Model distribution the updated global model is then sent back to the devices for the next round of local training.
- the importance or materiality values or metrics can be calculated using the L2 norm, especially for the size of gradients for each weighting.
- the Euclidean norm, standard norm, or L2 norm is a vector norm commonly used in mathematics.
- a norm induced by a scalar product As a norm induced by a scalar product, it possesses, in addition to the three norm axioms, a number of other properties, such as the validity of the Cauchy-Schwarz inequality and the parallelogram equation, as well as invariance under unitary transformations.
- the Euclidean norm itself satisfies a more general form of the Pythagorean theorem.
- the server only contains importance or materiality values or metrics from those clients whose corresponding values exceed a predetermined threshold.
- the threshold parameter in the "communicate_important_weights" function controls which weights are considered important. Adjusting this threshold affects the rarity of the communicated weights.
- Adjustments to hyperparameters can be made based on specific requirements and characteristics of the problem domain.
- the initial model based on artificial intelligence includes weights and structural information in the form of a neural network.
- the server is connected to the respective clients via a data connection in order to transfer or exchange models.
- Training the respective local model with provided training data from the respective client can be done, for example, by labeling sensor data accordingly and marking permissible or impermissible features in the sensor data.
- Calculating first and/or second gradients over the behavior of model weights of the respective local model involves analyzing changes in individual model weights over an observation period or across training sessions.
- Calculating importance metrics of the local model based on the first gradients can be done, for example, by classifying model weights that do not change or change only slightly during training as not "important", which can be expressed by a corresponding importance metric.
- the importance metrics can then be checked to see if they lie within a specified range of values.
- Aggregating the model parameters with the global model to form an aggregated model can be done, for example, by including the "important" model weights in the global model and replacing corresponding previous values of the global model.
- Model parameters for which no respective importance metrics are available can be removed from the aggregated model.
- the first or second gradient can converge, that is, approach a final value, where the final value can represent a model weight and can be calculated using a predefined convergence criterion.
- the operation of the technical device with the local model by the respective client can be carried out in such a way that, for example, sensor data for the device is read in and analyzed using the model in order to make a prediction about future behavior.
- the operation of the technical device with the local model by the respective client can also be carried out in such a way that, for example, the device is controlled individually by taking special operating conditions into account.
- step f) the aggregated model has fewer model weights than the global model.
- step f an average is calculated of the received model parameters of the respective clients.
- the problem according to the invention is also solved by a system for operating a technical device, comprising a server and at least one client with a respective connected technical device, wherein the system is configured to execute the method according to the invention.
- the problem according to the invention is also solved by a computer program product with machine-readable instructions stored therein which, when executed by the system according to the invention, cause it to execute the method according to the invention.
- Fig. 1 shows a first embodiment of the invention in the form of a pseudo-code
- Fig. 2 shows a second embodiment of the invention in the form of a pseudocode
- Fig. 3 shows a simplified block diagram for a Vision-FM segmentation
- Fig. 4 shows a system for carrying out the method according to the invention.
- Fig. 5 is an example of a flowchart for the method according to the invention.
- Fig. 1 shows a first embodiment of an algorithm according to the invention in the form of a pseudo-code
- Fig. 2 shows a second embodiment of an algorithm according to the invention in the form of a pseudo-code, wherein an improvement of the algorithm is carried out by applying a more powerful FM.
- low_rank_adaptation applies the singular value decomposition (SVD) to the model weights and retains only the singular values and vectors of the top “rank” to obtain an approximation of the low rank.
- SVD singular value decomposition
- the rank parameter in the function "low_rank_adaptation" controls the desired rank of the low-rank approach.
- Fig. 3 shows a simplified block diagram for a Vision-FM segmentation, i.e. an application of the FM FL strategy to vision transformer models such as “Segment Anything” (SAM).
- SAM Segment Anything
- the largest part of the model is the image encoder l_ENC, namely a VIT-based image encoder ("Vision Transformer"), which calculates the image embeddings IMG_EMB using the attention to patches of an image IMG.
- VIT-based image encoder (“Vision Transformer")
- masks M are fed to a lightweight mask decoder LWM_DEC.
- the lightweight mask decoder LWM_DEC is controlled via a prompt encoder P_ENC, which is configured using points P, boxes B and texts T.
- the lightweight mask decoder LWM_DEC delivers valid masks V_M with confidence values CS1-CS3. Relative positional embedding is used.
- This approach can be used to train or refine the image encoder of a SAM-like model, for example to fine-tune the encoder specifically for industrial fault detection data.
- Fig. 4 shows an embodiment of a system with a server S, two clients C1, C2 and each connected devices TD1 , TD2.
- the system is designed to execute the method according to the invention.
- the procedure for operating a technical device through the system is at least partially computer-implemented.
- the following process steps are performed: a) Provisioning and initializing an initial model based on artificial intelligence, and storing it as a global model, by the server S; b) Transferring the global model to at least one client C1, C2, and storing it as a respective local model; c) Training the respective local model with training data provided by the respective client C1, C2, and calculating initial gradients over the behavior of the model weights of the respective local model during training; d) Calculating the respective importance metrics of the local model based on the initial gradients by the respective client C1, C2; e) Transmitting the model parameters of the respective local model, including the respective importance metrics, which lie within a predefined range of values, from the respective client C1, C2 to the server S; f) Aggregating the previously received model parameters of the respective clients C1, C2, with the global model to form an aggregated model.
- server S g) saving the aggregated model as a global model, by server S, h) calculating second gradients over the behavior of model weights of the aggregated model, and checking whether the second gradient has reached a predefined convergence criterion; if not, proceed with step b, otherwise proceed with step i, by server S, i) Operation of the technical device TD1, TD2 with the local model, by the respective client C1, 02.
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- General Health & Medical Sciences (AREA)
- Computing Systems (AREA)
- Biomedical Technology (AREA)
- Biophysics (AREA)
- Computational Linguistics (AREA)
- Data Mining & Analysis (AREA)
- Evolutionary Computation (AREA)
- Life Sciences & Earth Sciences (AREA)
- Molecular Biology (AREA)
- Artificial Intelligence (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Mathematical Physics (AREA)
- Software Systems (AREA)
- Health & Medical Sciences (AREA)
- Management, Administration, Business Operations System, And Electronic Commerce (AREA)
- Information Transfer Between Computers (AREA)
Abstract
Computer-implementiertes Verfahren zum Betrieb eines technischen Geräts durch ein System, wobei folgende Schritte ausgeführt werden: a) Bereitstellen und Initialisieren eines Initial-Modells auf Basis künstlicher Intelligenz, und Speichern als globales Modell, b) Übertragen des globalen Modells an den zumindest einen Klienten und Speichern als jeweiliges lokales Modell, c) Trainieren des jeweiligen lokalen Modells mit bereitgestellten Trainings-Daten des jeweiligen Klienten, und Berechnen von ersten Gradienten über das Verhalten von Modellgewichten des jeweiligen lokalen Modells während des Trainings, d) Berechnen von jeweiligen Wichtigkeits-Metriken des lokalen Modells basierend auf den ersten Gradienten durch den jeweiligen Klienten, e) Übermitteln der Modell-Parameter des jeweiligen lokalen Modells mit den jeweiligen Wichtigkeits-Metriken, welche innerhalb eines vorgegebenen Wertebereichs liegen, vom jeweiligen Klienten an den Server, f) Aggregieren der zuvor empfangenen Modell-Parameter der jeweiligen Klienten mit dem globalen Modell zu einem aggregierten Modell, und Entfernen jener Modell-Parameter im aggregierten Modell, für welche keine jeweiligen Wichtigkeits-Metriken vorliegen, g) Speichern des aggregierten Modells als globales Modell, h) Berechnen von zweiten Gradienten über das Verhalten von Modellgewichten des aggregierten Modells, und Prüfen, ob der zweite Gradient ein vorgegebenes Konvergenz-Kriterium erreicht haben, wenn nein, Fortsetzen mit Schritt b), sonst Fortsetzen mit Schritt i), i) Betreiben des technischen Geräts mit dem lokalen Modell.
Description
Verfahren und System zum Betrieb eines technischen Geräts
Die Erfindung betrifft ein computer-implementiertes Verfahren zum Betrieb eines technischen Geräts durch ein System, welches einen Server und zumindest einen Klienten mit einem jeweilig verbundenen technischen Gerät umfasst.
Die Erfindung betrifft ein System und ein Computer-Programmprodukt.
Ein Basis-, Grund- oder Gründungs-Modell (engl. „foundation model“, kurz FM) ist ein Modell auf Basis künstlicher Intelligenz (kurz Kl), das mit breiten Daten trainiert wird, so dass es auf eine Vielzahl von Anwendungsfällen angewendet werden kann.
Grund-Modelle haben die Kl verändert und prominente Chatbots und generative Kl unterstützt. Foundation-Modelle sind Allzwecktechnologien, die eine Vielzahl von Anwendungsfällen unterstützen können.
Die Erstellung von Grundlagenmodellen ist oft sehr ressourcenintensiv, wobei die teuersten Modelle Hunderte von Millionen Dollar kosten, um die zugrunde liegenden Daten und Berechnungen zu bezahlen.
Föderiertes Lernen (engl. „federated learning“, kurz FL) erweist sich als praktikable Lösung, um große Datenmengen auf einfache Weise bereitzustellen, und es daher Grund-Modellen ermöglicht, reichhaltige Daten aus einem breiteren Spektrum von Quellen zu nutzen.
Dieser verbesserte Zugriff auf Daten führt zur Entwicklung genauerer und effizienterer Systeme, die besser auf die spezifischen Bedürfnisse und Präferenzen der Benutzer in verschiedenen Szenarien zugeschnitten sind.
Darüber hinaus wird durch die Integration von FL mit FM die Nutzung privater Daten rechenschaftspflichtiger und bietet Einzelpersonen die Möglichkeit, die Quellen ihrer Daten zu verfolgen.
Andererseits erfordert die Erzeugung von Grund-Modellen meist einen hohen Einsatz an Rechen-, Speicher- sowie Kommunikations-Kapazitäten.
Die Kommunikation großer Mengen von Modellparametern, beispielsweise bei großen Sprachmodellen wie „Large Language Model Meta AI“, kurz „LLaMA“, mit bis zu 70 Milliarden Parametern, kann auch in FM-FL-Szenarien in der Praxis ungeeignet sein.
Ferner ist die Frage nach Datenschutz bei der Nutzung von Daten, sowie die Inhaberschaft der zugrunde liegenden Daten nicht immer geklärt.
Im Stand der Technik beinhaltet eine Kommunikationsstrategie beim föderierten Lernen häufig den Austausch von Modellaktualisierungen zwischen einem zentralen Server und den
teilnehmenden Geräten unter Wahrung der Privatsphäre und Minimierung der Datenübertragung.
In der Veröffentlichung US 2024/155025 A1 ist ein sogenanntes “Importance-Aware Federated Edge Learning” (FEEL)-System beschrieben, wobei basierend auf dem Zusammenhang zwischen Verlustabnahme und Gradientennorm ein Problem zur Maximierung der Lerneffizienz formuliert wird, indem die Zuordnung von Kommunikationsressourcen und die Datenauswahl gemeinsam berücksichtigt werden, wodurch die Trainingslatenz reduziert und die Lerngenauigkeit verbessert werden kann.
Eine typische Kommunikationsstrategie beim föderierten Lernen ist beispielsweise:
1) Initialisierung: Der zentrale Server initialisiert ein globales Modell und teilnehmende Geräte (Klienten) laden das globale Modell herunter.
2) Modelltraining auf Geräten: Jedes Gerät trainiert das Modell lokal mit seinen eigenen Daten, und das lokale Training verwendet das heruntergeladene globale Modell als Ausgangspunkt.
3) Lokale Modellaktualisierungen: Nach dem lokalen Training berechnet jedes Gerät die Modellaktualisierungen, in der Regel in Form von Gradienten, basierend auf seinen lokalen Daten.
4) Aggregation auf dem zentralen Server: die Geräte laden ihre Modell-Aktualisierungen auf den zentralen Server hoch und der zentrale Server aggregiert diese Aktualisierungen, um ein verfeinertes globales Modell zu erhalten.
5) Modellverteilung: das aktualisierte globale Modell wird dann für die nächste Runde des lokalen Trainings an die Geräte zurückgesendet.
6) Iterationen: die Schritte 2 bis 5 werden iterativ für mehrere Runden wiederholt, bis das Modell konvergiert.
Die Herausforderung bei der Kommunikation beim föderierten Lernen mit Grund-Modellen ergeben sich aus der beträchtlichen Größe dieser Modelle, was zu hohem Datenübertragungsaufwand, Einschränkungen der Netzwerkbandbreite und erhöhter Kommunikationslatenz führt.
Es ist daher Aufgabe der Erfindung eine Lösung bereitzustellen, welche die Anforderungen an die Kommunikation bei der Anwendung von FL auf FM verbessert.
Die erfindungsgemäße Aufgabe wird gelöst durch ein computer-implementiertes Verfahren zum Betrieb eines technischen Geräts durch ein System, welches einen Server und zumindest einen Klienten mit einem jeweilig verbundenen technischen Gerät umfasst, wobei folgende Schritte ausgeführt werden:
a) Bereitstellen und Initialisieren eines Initial-Modells auf Basis künstlicher Intelligenz, und Speichern als globales Modell, durch den Server, b) Übertragen des globalen Modells an den zumindest einen Klienten, und Speichern als jeweiliges lokales Modell, c) Trainieren des jeweiligen lokalen Modells mit bereitgestellten Trainings-Daten des jeweiligen Klienten, und Berechnen von ersten Gradienten über das Verhalten von Modellgewichten des jeweiligen lokalen Modells während des Trainings, d) Berechnen von jeweiligen Wichtigkeits-Metriken des lokalen Modells basierend auf den ersten Gradienten durch den jeweiligen Klienten, e) Übermitteln der Modell-Parameter des jeweiligen lokalen Modells mit den jeweiligen Wichtigkeits-Metriken, welche innerhalb eines vorgegebenen Wertebereichs liegen, vom jeweiligen Klienten an den Server, f) Aggregieren der zuvor empfangenen Modell-Parameter der jeweiligen Klienten mit dem globalen Modell zu einem aggregierten Modell, und Entfernen jener Modell-Parameter im aggregierten Modell, für welche keine jeweiligen Wichtigkeits-Metriken vorliegen, durch den Server, g) Speichern des aggregierten Modells als globales Modell, durch den Server, h) Berechnen von zweiten Gradienten über das Verhalten von Modellgewichten des aggregierten Modells, und Prüfen, ob der zweite Gradient ein vorgegebenes Konvergenz-Kriterium erreicht haben, wenn nein, Fortsetzen mit Schritt b), sonst Fortsetzen mit Schritt i), durch den Server, i) Betreiben des technischen Geräts mit dem lokalen Modell, durch den jeweiligen Klienten.
Die Reduzierung der Kommunikationskosten in einem sehr großen Parameter-Modell, beispielsweise mit sieben Milliarden Parametern, hängt wie jedes spezifische Szenario von Faktoren wie der Modellarchitektur, der Verteilung der Trainingsdaten und dem Grad der erforderlichen Parameteraktualisierungen ab.
Strategien wie die Übertragung nur wichtiger Gewichte, Quantisierungs- und Komprimierungstechniken können dazu beitragen, den Kommunikationsaufwand zu minimieren.
Der Ansatz umfasst einen modifizierten FL-Algorithmus, bei dem jeder Klient die Gewichtungsbedeutung berechnet und nur wichtige Gewichtungen an den Server übermittelt.
Die Wichtigkeits- oder Wesentlichkeits-Werte oder -Metriken können anhand der L2-Norm, insbesondere für die Größe von Gradienten für jede Gewichtung berechnet werden.
Die euklidische Norm, Standardnorm oder L2-Norm ist eine in der Mathematik häufig verwendete Vektornorm.
Im zwei- und dreidimensionalen euklidischen Raum entspricht die euklidische Norm der anschaulichen Länge oder dem Betrag eines Vektors und kann mit dem Satz des Pythagoras berechnet werden.
Allgemeiner wird die euklidische Norm auch für reelle und komplexe Vektorräume beliebiger endlicher Dimension definiert und ist dann die vom Standardskalar-Produkt abgeleitete Norm.
Sie besitzt als eine von einem Skalarprodukt induzierte Norm neben den drei Normaxiomen eine Reihe weiterer Eigenschaften, wie die Gültigkeit der Cauchy-Schwarz-Ungleichung und der Parallelogramm-Gleichung, sowie eine Invarianz unter unitären Transformationen.
Für orthogonale Vektoren erfüllt die euklidische Norm selbst eine allgemeinere Form des Satzes des Pythagoras.
Von der euklidischen Norm werden Begriffe wie der euklidische Abstand und die euklidische Topologie abgeleitet, und kann auf unendlich dimensionale Vektorräume verallgemeinert werden, beispielsweise auf Folgenräume durch die £2-Norm und auf Funktionenräume durch die L2-Norm.
Diese Bewertungen helfen dabei, die Bedeutung der einzelnen Gewichtungen für den Beitrag zu den Modellaktualisierungen zu bestimmen.
Nur Gewichtungen mit Wichtigkeitswerten über einem bestimmten Schwellenwert werden an den zentralen Server übermittelt, was den Kommunikationsaufwand reduziert, indem nur die relevanten Informationen übertragen werden.
Mit anderen Worten liegen am Server nur Wichtigkeits- oder Wesentlichkeits-Werte oder - Metriken von jenen Klienten vor, deren entsprechende Werte über einem vorbestimmten Schwellenwert liegen.
All jene Klienten, mit deren jeweiligen lokalen Modellen, mit Wichtigkeits- oder Wesentlichkeits- Werte oder -Metriken unter dem Schwellenwert werden am Server aus einem aggregierten, globalen Modell entfernt.
Der Schwellenwertparameter in der Funktion "communicate_important_weights" steuert, welche Gewichte als wichtig angesehen werden. Die Anpassung dieses Schwellenwerts beeinflusst die Seltenheit der kommunizierten Gewichte.
Auf das lokale T raining auf jedem Gerät folgt die Aggregation nur der wichtigen Gewichte auf dem zentralen Server, also im globalen Modell, was dezentrale Modellaktualisierungen bei gleichzeitiger Konzentration auf wichtige Informationen ermöglicht.
Dieser FL-Algorithmus betont die selektive Kommunikation wichtiger Gewichte und bietet ein Gleichgewicht zwischen der Minimierung der Kommunikationskosten und der Erhaltung der Gesamtleistung des Modells.
Anpassungen von Hyperparametern, wie beispielsweise einem Schwellenwert für die Bestimmung der Wichtigkeit, können basierend auf spezifischen Anforderungen und Merkmalen der Problemdomäne vorgenommen werden.
Das Initial-Modell auf Basis künstlicher Intelligenz umfasst Gewichte und Strukturinformationen in Form eines neuronalen Netzes.
Der Server ist mit den jeweiligen Klienten mit einer Datenverbindung verbunden, um Modelle zu übertragen beziehungsweise auszutauschen.
Das Trainieren des jeweiligen lokalen Modells mit bereitgestellten Trainings-Daten des jeweiligen Klienten kann beispielsweise dadurch erfolgen, dass Sensordaten entsprechend gekennzeichnet sind und zulässige oder auch unzulässige Merkmale in den Sensordaten markieren.
Das Berechnen von ersten und/oder zweiten Gradienten über das Verhalten von Modellgewichten des jeweiligen lokalen Modells umfasst die Analyse von Veränderungen von einzelnen Modellgewichten über einen Beobachtungszeitraum oder über Trainings hinweg.
Das Berechnen von Wichtigkeits-Metriken des lokalen Modells basierend auf den ersten Gradienten kann beispielsweise dadurch erfolgen, dass Modellgewichte, die sich über das Training nicht oder nur wenig ändern, als nicht „Wichtig“ eingestuft werden, was durch eine entsprechende Wichtigkeits-Metrik ausgedrückt werden kann.
Die Wichtigkeits-Metriken können dann darauf geprüft werden, ob sie innerhalb eines vorgegebenen Wertebereichs liegen.
Das Aggregieren der Modell-Parameter mit dem globalen Modell zu einem aggregierten Modell kann beispielsweise so erfolgen, dassdie „wichtigen“ Modellgewichte in das globale Modell aufgenommen werden und entsprechende vorhergehende Werte des globalen Modells ersetzen.
Es können jene Modell-Parameter im aggregierten Modell entfernt werden, für welche keine jeweiligen Wichtigkeits-Metriken vorliegen.
Der erste beziehungsweise zweite Gradient kann konvergieren, das heißt sich einem Endwert annähern, wobei der Endwert ein Modellgewicht darstellen kann und mithilfe eines vorgegebenen Konvergenz-Kriteriums berechnet werden kann.
Das Betreiben des technischen Geräts mit dem lokalen Modell durch den jeweiligen Klienten kann derart erfolgen, dass beispielsweise Sensordaten für das Gerät eingelesen werden und mithilfe des Modells analysiert werden, um eine Prädiktion auf das zukünftige Verhalten durchzuführen.
Das Betreiben des technischen Geräts mit dem lokalen Modell durch den jeweiligen Klienten kann aber auch derart erfolgen, dass beispielsweise das Gerät individuell angesteuert wird, indem besondere Betriebszustände berücksichtigt werden.
In einer Weiterbildung der Erfindung ist es vorgesehen, dass im Schritt f) das aggregierte Modell weniger Modellgewichte als das globale Modell aufweist.
Durch die Reduktion der Modellgröße wird die Komplexität des Verfahrens hinsichtlich der benötigten Ressourcen reduziert.
In einer Weiterbildung der Erfindung ist es vorgesehen, dass bei der Aggregation im Schritt f) eine Mittelwertbildung der empfangenen Modell-Parameter der jeweiligen Klienten durchgeführt wird.
Dadurch wird die Modellgenauigkeit für eine allgemeine Anwendung verbessert.
Die erfindungsgemäße Aufgabe wird auch durch ein System zum Betrieb eines technischen Geräts gelöst, umfassend einen Server und zumindest einen Klienten mit einem jeweilig verbundenen technischen Gerät, wobei das System dazu eingerichtet ist, das erfindungsgemäße Verfahren auszuführen.
Die erfindungsgemäße Aufgabe wird auch gelöst durch ein Computer-Programm-Produkt mit darin gespeicherten maschinenlesbaren Anweisungen, die, wenn sie von dem erfindungsgemäßen System ausgeführt werden, dieses veranlassen, das erfindungsgemäße Verfahren auszuführen
In den folgenden Algorithmen und Figuren wird die Erfindung anhand eines Ausführungsbeispiels im Detail beschrieben. In den Algorithmen und Figuren zeigt
Fig. 1 ein erstes Ausführungsbeispiel der Erfindung in Form eines Pseudo-Codes,
Fig. 2 ein zweites Ausführungsbeispiel der Erfindung in Form eines Pseudocodes,
Fig. 3 ein vereinfachtes Blockschaltbild für eine Vision-FM Segmentierung,
Fig. 4 ein System zur Ausführung des erfindungsgemäßen Verfahrens.
Fig. 5 ein Beispiel für ein Flussdiagramm für das erfindungsgemäße Verfahren.
Fig. 1 zeigt ein erstes Ausführungsbeispiel für einen Algorithmus gemäß der Erfindung in Form eines Pseudo-Codes,
In diesem Beispiel ist gezeigt, die auf einfache und effiziente Weise das erfindungsgemäße Verfahren implementiert werden kann.
Fig. 2 stellt ein zweites Ausführungsbeispiel für einen Algorithmus gemäß der Erfindung in Form eines Pseudo-Codes dar, wobei eine Verbesserung des Algorithmus durch Anwendung einer leistungsfähigeren FM durchgeführt wird.
Eine Erweiterung des vorhergehenden Algorithmus mithilfe der sogenannten “Low Rank Adaptation”, kurz „LoRA”, eine Tuning-Technik, welche die Leistungsfähigkeit fortschrittlicher FMs für benutzerdefinierte Aufgaben und Datensätze nutzt, um die System-Ressourcen weniger zu belasten oder übermäßige „Kosten“, also die System-Komplexität zu verringern und zu verbessern.
Die Funktion „low_rank_adaptation“ wendet die Singulärwertzerlegung (SVD) auf die Modellgewichtungen an und behält nur die singulären Werte und Vektoren des obersten "Rangs" bei, um eine Annäherung an den niedrigen Rang zu erhalten.
•Die Funktion „communicate_important_weights_with_low_rank“ beinhaltet eine Low-Rank- Anpassung, bevor die wichtigen Gewichte ausgewählt und kommuniziert werden.
Der Rangparameter in der Funktion „low_rank_adaptation“ steuert den gewünschten Rang der Annäherung mit niedrigem Rang.
Fig. 3 zeigt ein vereinfachtes Blockschaltbild für eine Vision-FM Segmentierung, also eine Anwendung der FM FL-Strategie auf Vision-Transformatormodelle wie „Segment Anything“ (SAM).
Der größte Teil des Modells ist der Bild-Encoder l_ENC, nämlich ein VIT-basierter Bild- Encoder („Vision Transformer“), welcher die Bildeinbettungen IMG_EMB unter Verwendung der Aufmerksamkeit für Patches eines Bildes IMG berechnet.
Mithilfe einer Abtastung DS werden Masken M einem Leichtgewichts Masken- Decoder LWM_DEC zugeführt.
Der Leichtgewichts Masken-Decoder LWM_DEC wird über einen welcher über einen Prompt- Encoder P_ENC angesteuert, welcher mithilfe von Punkten P, Boxen B und Texten T konfiguriert wird.
Der Leichtgewichts Masken-Decoder LWM_DEC liefert gültige Masken V_M mit Vertrauenswerten CS1-CS3.
Es wird die relative positionelle Einbettung verwendet.
Dieser Ansatz kann verwendet werden, um den Bild-Encoder eines SAM-ähnlichen Modells zu trainieren oder zu verfeinern, um den Encoder beispielsweise speziell für industrielle Fehlererkennungsdaten fein zu justieren.
Fig. 4 zeigt ein Ausführungsbeispiel für ein System mit einem Server S, zwei Klienten C1, C2 und jeweils verbundenen Geräten TD1 , TD2.
Das System ist dazu eingerichtet das erfindungsgemäße Verfahren auszuführen.
Fig. 5 zeigt ein Ausführungsbeispiel für ein Flussdiagramm des erfindungsgemäßen Verfahrens.
Das Verfahren zum Betrieb eines technischen Geräts durch das System ist zumindest teilweise Computer-implementiert.
Folgende Verfahrens-Schritte werden ausgeführt: a) Bereitstellen und Initialisieren eines Initial-Modells auf Basis künstlicher Intelligenz, und Speichern als globales Modell, durch den Server S, b) Übertragen des globalen Modells an den zumindest einen Klienten C1 , 02, und Speichern als jeweiliges lokales Modell, c) Trainieren des jeweiligen lokalen Modells mit bereitgestellten Trainings-Daten des jeweiligen Klienten 01, 02, und Berechnen von ersten Gradienten über das Verhalten von Modellgewichten des jeweiligen lokalen Modells während des Trainings, d) Berechnen von jeweiligen Wichtigkeits-Metriken des lokalen Modells basierend auf den ersten Gradienten durch den jeweiligen Klienten 01, 02, e) Übermitteln der Modell-Parameter des jeweiligen lokalen Modells mit den jeweiligen Wichtigkeits-Metriken, welche innerhalb eines vorgegebenen Wertebereichs liegen, vom jeweiligen Klienten 01, 02 an den Server S, f) Aggregieren der zuvor empfangenen Modell-Parameter der jeweiligen Klienten 01 , 02 mit dem globalen Modell zu einem aggregierten Modell, und Entfernen jener Modell- Parameter im aggregierten Modell, für welche keine jeweiligen Wichtigkeits-Metriken vorliegen, durch den Server S, g) Speichern des aggregierten Modells als globales Modell, durch den Server S, h) Berechnen von zweiten Gradienten über das Verhalten von Modellgewichten des aggregierten Modells, und Prüfen, ob der zweite Gradient ein vorgegebenes Konvergenz-Kriterium erreicht haben, wenn nein, Fortsetzen mit Schritt b, sonst Fortsetzen mit Schritt i, durch den Server S,
i) Betreiben des technischen Geräts TD1 , TD2 mit dem lokalen Modell, durch den jeweiligen Klienten C1 , 02.
In der ersten Trainings-Runde werden Trainingsdaten basierend auf dem Initial-Modell mit dessen Modell-Struktur angewendet, der ersten Modell-Struktur. Das aggregierte Modell im Schritt f) weist weniger Modellgewichte als das globale Modell auf, ist also ein vereinfachtes, reduziertes Modell, wobei die Modell-Struktur geändert hat.
Daraus ergibt sich, dass die jeweiligen Trainingsdaten bei den Klienten ebenfalls an die neue Modell-Struktur, nämlich die zweite Modell-Struktur, angepasst werden müssen.
Die zweite Modell-Struktur kann sich nach jeder Trainings-Runde ändern. Bei der Aggregation im Schritt f) wird optional eine Mittelwertbildung der empfangenen Modell- Parameter der jeweiligen Klienten 01, 02 durchgeführt wird.
Unabhängig vom grammatikalischen Geschlecht eines bestimmten Begriffes sind Personen mit männlicher, weiblicher oder anderer Geschlechteridentität mit umfasst.
Bezugszeichenliste:
B Box
C1. C2 Klient
CS1-CS3 Vertrauenswert (engl. „confidence score“)
DS Abtastung (engl. „down sample”) l_ENC Bild-Encoder
IMG Bild
IMG_EMB Bild-Einbettung (engl. „image embedding“)
LWM_DEC Leichtgewichts Masken-Decoder (engl. „lightweight mask decoder“)A
M Maske
P Punkt
P_ENC Prompt-Encoder (engl. „prompt encoder“)
S Server
T Text
TD1, TD2 technisches Gerät (engl. „technical device“)
V_M gültige Masken (engl. „valid masks“)
Claims
1. Computer-implementiertes Verfahren zum Betrieb eines technischen Geräts durch ein System, welches einen Server (S) und zumindest einen Klienten (C1 , 02) mit einem jeweilig verbundenen technischen Gerät (TD1 , TD2) umfasst, wobei folgende Schritte ausgeführt werden: a) Bereitstellen und Initialisieren eines Initial-Modells auf Basis künstlicher Intelligenz, und Speichern als globales Modell, durch den Server (S), b) Übertragen des globalen Modells an den zumindest einen Klienten (01 , 02), und Speichern als jeweiliges lokales Modell, c) Trainieren des jeweiligen lokalen Modells mit bereitgestellten Trainings-Daten des jeweiligen Klienten (01 , 02), und Berechnen von ersten Gradienten über das Verhalten von Modellgewichten des jeweiligen lokalen Modells während des Trainings, d) Berechnen von jeweiligen Wichtigkeits-Metriken des lokalen Modells basierend auf den ersten Gradienten durch den jeweiligen Klienten (01, 02), e) Übermitteln der Modell-Parameter des jeweiligen lokalen Modells mit den jeweiligen Wichtigkeits-Metriken, welche innerhalb eines vorgegebenen Wertebereichs liegen, vom jeweiligen Klienten (01 , 02) an den Server (S), f) Aggregieren der zuvor empfangenen Modell-Parameter der jeweiligen Klienten (01, 02) mit dem globalen Modell zu einem aggregierten Modell, und Entfernen jener Modell- Parameter im aggregierten Modell, für welche keine jeweiligen Wichtigkeits-Metriken vorliegen, durch den Server (S), g) Speichern des aggregierten Modells als globales Modell, durch den Server (S), h) Berechnen von zweiten Gradienten über das Verhalten von Modellgewichten des aggregierten Modells, und Prüfen, ob der zweite Gradient ein vorgegebenes Konvergenz-Kriterium erreicht haben, wenn nein, Fortsetzen mit Schritt b), sonst Fortsetzen mit Schritt i), durch den Server (S), i) Betreiben des technischen Geräts (TD1, TD2) mit dem lokalen Modell, durch den jeweiligen Klienten (01, 02).
2. Verfahren nach dem vorhergehenden Anspruch, wobei im Schritt f) das aggregierte Modell weniger Modellgewichte als das globale Modell aufweist.
3. Verfahren nach einem der vorhergehenden Ansprüche, wobei bei der Aggregation im Schritt f) eine Mittelwertbildung der empfangenen Modell-Parameter der jeweiligen Klienten (01, 02) durchgeführt wird.
4. System zum Betrieb eines technischen Geräts (TD1, TD2), umfassend einen Server (S) und zumindest einen Klienten (01 , 02) mit einem jeweilig verbundenen technischen
Gerät (TD1 , TD2), wobei das System dazu eingerichtet ist, das Verfahren nach einem der vorhergehenden Ansprüche auszuführen.
5. Computer-Programm-Produkt mit darin gespeicherten maschinenlesbaren
Anweisungen, die, wenn sie von dem System nach einem der vorhergehenden Ansprüche ausgeführt werden, dieses veranlassen, das Verfahren nach einem der vorhergehenden Ansprüche auszuführen
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| EP24183739.2 | 2024-06-21 | ||
| EP24183739.2A EP4668167A1 (de) | 2024-06-21 | 2024-06-21 | Verfahren und system zum betrieb eines technischen geräts |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| WO2025261663A1 true WO2025261663A1 (de) | 2025-12-26 |
Family
ID=91664116
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| PCT/EP2025/063039 Pending WO2025261663A1 (de) | 2024-06-21 | 2025-05-13 | Verfahren und system zum betrieb eines technischen geräts |
Country Status (2)
| Country | Link |
|---|---|
| EP (1) | EP4668167A1 (de) |
| WO (1) | WO2025261663A1 (de) |
Citations (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20240155025A1 (en) | 2021-06-09 | 2024-05-09 | Intel Corporation | Uses of coded data at multi-access edge computing server |
-
2024
- 2024-06-21 EP EP24183739.2A patent/EP4668167A1/de active Pending
-
2025
- 2025-05-13 WO PCT/EP2025/063039 patent/WO2025261663A1/de active Pending
Patent Citations (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20240155025A1 (en) | 2021-06-09 | 2024-05-09 | Intel Corporation | Uses of coded data at multi-access edge computing server |
Non-Patent Citations (1)
| Title |
|---|
| HE YINGHUI ET AL: "Resource Allocation for Wireless Federated Edge Learning based on Data Importance", GLOBECOM 2020 - 2020 IEEE GLOBAL COMMUNICATIONS CONFERENCE, IEEE, 7 December 2020 (2020-12-07), pages 1 - 6, XP033882234, DOI: 10.1109/GLOBECOM42002.2020.9322155 * |
Also Published As
| Publication number | Publication date |
|---|---|
| EP4668167A1 (de) | 2025-12-24 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| DE212020000731U1 (de) | Kontrastives Vortraining für Sprachaufgaben | |
| DE112020000281T5 (de) | Vereinigen von modellen, die jeweilige zielklassen aufweisen, mit destillation | |
| DE102017122240A1 (de) | Kommunikationseffizientes gemeinschaftliches Lernen | |
| DE112021003908T5 (de) | Föderales maschinenlernen durch verwenden von ortsabhängigem hashing | |
| DE112018005227T5 (de) | Merkmalsextraktion mithilfe von multi-task-lernen | |
| DE102016014798A1 (de) | Genaues Vorhersagen einer Etikettrelevanz bei einer Bildabfrage | |
| DE102018121905A1 (de) | Verfahren und Vorrichtung zum Quantisieren von künstlichen neuronalen Netzen | |
| DE102016223193A1 (de) | Verfahren und Vorrichtung zum Komplettieren eines Wissensgraphen | |
| DE102019004300A1 (de) | Verwendung eines dynamischen speichernetzwerks zum verfolgen digitaler dialogzustände und erzeugen von antworten | |
| DE112021002867T5 (de) | Defektdetektion für eine leiterplattenbaugruppe | |
| DE112020001774T5 (de) | Datensatzabhängiges niedrigrang-zerlegen von neuronalen netzwerken | |
| DE102024205216A1 (de) | Einschritt-Diffusionsdestillation über tiefe Gleichgewichtsmodelle | |
| DE102020001541A1 (de) | Verfahren zur Transformation erfasster Sensordaten aus einer ersten Datendomäne in eine zweite Datendomäne | |
| EP1546823B1 (de) | Verfahren zur rechnergestützten erstellung von prognosen für operative systeme sowie system zur erstellung von prognosen für operative systeme | |
| EP0925541B1 (de) | Verfahren und vorrichtung zur rechnergestützten generierung mindestens eines künstlichen trainingsdatenvektors für ein neuronales netz | |
| DE102023111527A1 (de) | Systeme und Verfahren zur Gesichtsbildgenerierung | |
| DE112022007656T5 (de) | Informationsverarbeitungseinrichtung und informationsverarbeitungsverfahren | |
| WO2025261663A1 (de) | Verfahren und system zum betrieb eines technischen geräts | |
| DE102021124252A1 (de) | Neuronale Netzwerksysteme für abstraktes Denken | |
| DE102024212013A1 (de) | Verfahren und vorrichtung zur modellaggregation im föderierten lernen | |
| DE102024206526A1 (de) | Verfahren und Vorrichtung zum Erzeugen einer projektspezifischen Netzwerkarchitektur | |
| DE212024000257U1 (de) | Gegenstandgesteuertes neuronales Diffusionsnetz | |
| WO2023139130A1 (de) | Computer-implementierte datenstruktur, verfahren und system zum betrieb eines technischen geräts mit einem modell auf basis föderierten lernens | |
| DE102023123146A1 (de) | Verfahren und System zur automatisierten Erkennung von Anomalien in Zeitreihendatensätzen | |
| EP1264253A1 (de) | Verfahren und anordnung zur modellierung eines systems |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| 121 | Ep: the epo has been informed by wipo that ep was designated in this application |
Ref document number: 25727834 Country of ref document: EP Kind code of ref document: A1 |