EP4634861A1 - Objektlagedetektion mit automatisierter merkmalsextraktion und/oder merkmalszuordnung - Google Patents

Objektlagedetektion mit automatisierter merkmalsextraktion und/oder merkmalszuordnung

Info

Publication number
EP4634861A1
EP4634861A1 EP23809139.1A EP23809139A EP4634861A1 EP 4634861 A1 EP4634861 A1 EP 4634861A1 EP 23809139 A EP23809139 A EP 23809139A EP 4634861 A1 EP4634861 A1 EP 4634861A1
Authority
EP
European Patent Office
Prior art keywords
image
features
determined
robot
determining
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP23809139.1A
Other languages
English (en)
French (fr)
Inventor
Kirill SAFRONOV
Dominik Joho
Yunus Ayar
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
KUKA Deutschland GmbH
Original Assignee
KUKA Deutschland GmbH
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Priority claimed from DE102022213568.7A external-priority patent/DE102022213568B3/de
Priority claimed from DE102022213555.5A external-priority patent/DE102022213555A1/de
Priority claimed from DE102022213557.1A external-priority patent/DE102022213557B3/de
Priority claimed from DE102022213562.8A external-priority patent/DE102022213562A1/de
Application filed by KUKA Deutschland GmbH filed Critical KUKA Deutschland GmbH
Publication of EP4634861A1 publication Critical patent/EP4634861A1/de
Pending legal-status Critical Current

Links

Classifications

    • BPERFORMING OPERATIONS; TRANSPORTING
    • B25HAND TOOLS; PORTABLE POWER-DRIVEN TOOLS; MANIPULATORS
    • B25JMANIPULATORS; CHAMBERS PROVIDED WITH MANIPULATION DEVICES
    • B25J9/00Program-controlled manipulators
    • B25J9/16Program controls
    • B25J9/1694Program controls characterised by use of sensors other than normal servo-feedback from position, speed or acceleration sensors, perception control, multi-sensor controlled systems, sensor fusion
    • B25J9/1697Vision controlled systems
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B25HAND TOOLS; PORTABLE POWER-DRIVEN TOOLS; MANIPULATORS
    • B25JMANIPULATORS; CHAMBERS PROVIDED WITH MANIPULATION DEVICES
    • B25J9/00Program-controlled manipulators
    • B25J9/16Program controls
    • B25J9/1612Program controls characterised by the hand, wrist, grip control
    • BPERFORMING OPERATIONS; TRANSPORTING
    • B25HAND TOOLS; PORTABLE POWER-DRIVEN TOOLS; MANIPULATORS
    • B25JMANIPULATORS; CHAMBERS PROVIDED WITH MANIPULATION DEVICES
    • B25J9/00Program-controlled manipulators
    • B25J9/16Program controls
    • B25J9/1656Program controls characterised by programming, planning systems for manipulators
    • B25J9/1669Program controls characterised by programming, planning systems for manipulators characterised by special application, e.g. multi-arm co-operation, assembly, grasping
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T7/00Image analysis
    • G06T7/70Determining position or orientation of objects or cameras
    • G06T7/73Determining position or orientation of objects or cameras using feature-based methods
    • G06T7/74Determining position or orientation of objects or cameras using feature-based methods involving reference images or patches
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2207/00Indexing scheme for image analysis or image enhancement
    • G06T2207/20Special algorithmic details
    • G06T2207/20081Training; Learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2207/00Indexing scheme for image analysis or image enhancement
    • G06T2207/20Special algorithmic details
    • G06T2207/20084Artificial neural networks [ANN]

Definitions

  • the present invention relates to a method for automated feature extraction and/or feature assignment, a system for automated feature extraction, and a computer program or computer program product.
  • Feature-based object recognition usually consists of two steps: A first step with feature extraction, which usually includes a manual selection of features, such as circles, edges, corners, etc., and a selection or implementation of algorithms and/or methods for feature recognition, such as in particular Hough transformation for circle detection, etc. For edge detection, for example, suitable parameters must be found, such as in particular with a Canny filter. A second step, which usually includes feature assignment with subsequent pose recognition. Accordingly, the pose of the object is derived from the distortion and/or displacement of the object in different shots or perspectives of a scene that includes the object.
  • the object of the present invention is in particular to improve feature-based object recognition, in particular to automate feature extraction, and further in particular to automate feature assignment.
  • a method for automated feature extraction and/or feature assignment is provided.
  • the method comprises capturing an image with a perspective of a scene with at least one object using a recording device. In one embodiment, the method comprises determining a descriptor image based on the captured image. In one embodiment the determination of the descriptor image is based on the image recorded, in particular by the recording device. In one embodiment, the determination of the descriptor image is based on a previously trained artificial intelligence or on a method that uses a trained artificial intelligence to determine a descriptor image in particular or with the help of which the descriptor image is or can be determined.
  • the scene comprises at least one object, in particular at least one object for the automated feature extraction and/or feature assignment, further in particular at least one object that is to be grasped or is grasped based on the automated feature extraction and/or feature assignment.
  • a perspective can be predetermined or set in advance, in particular in the case of permanently installed recording device(s), or a perspective can be, at least substantially, randomized or adopted in a randomized manner.
  • the method in particular upstream of the method for automated feature extraction and/or feature assignment, in particular described above, comprises training an artificial intelligence with a step, in particular a first step, of recording a first image with a first perspective of a scene with a, in particular first, recording device.
  • the scene comprises at least one object, in particular at least one object for the automated feature extraction and/or feature assignment.
  • the method comprises a step, in particular a second step, of recording a second image with a second perspective of the scene by means of the first or the same recording device and/or a second recording device.
  • the method comprises, in particular in a third step, determining an assignment of pixels of the first image to pixels of the second image, in particular based on the first perspective and the second perspective.
  • a perspective can be predetermined or set in advance, in particular in the case of permanently installed recording devices, or a perspective can be, at least essentially, randomized or adopted in a randomized manner, in particular such that in one embodiment the first perspective differs from the second perspective.
  • the method comprises, in particular in a fourth step, determining an assignment of pixels of the first image to pixels of the second image, in particular based on depth data, wherein the first and/or the second recording device in one embodiment is set up to capture or record depth data, in particular depth data is determined from the first image and/or the second image.
  • the method comprises, in particular in a fifth step, determining a descriptor image based on, in particular an inference, of the first and/or the second image.
  • determining the descriptor image is based on an image, in particular the first image and/or the second image.
  • the image, in particular the first and/or the second image is a two-dimensional image.
  • the method comprises, in particular in a sixth step, determining at least one feature of the at least one object based on the determined descriptor image.
  • the term "scene” as used herein should be understood in particular as a snapshot of a (relevant) environment, which includes a scenery with at least one object, in particular in a container.
  • the scene has the at least one object, which can in particular be in a container, and parts of the environment of the container, in particular parts of a robot, further in particular parts of a system that includes the robot.
  • irrelevant parts of the scene can be (automatically) filtered out.
  • the term “perspective” as used herein is to be understood in particular as the viewing direction of the recording device, which is in particular oriented such that the scene, as described herein, is at least partially in the field of view of the recording device, in particular the entire scene, in particular in applications of automated feature extraction and/or feature assignment for determining a pose and/or a grip position in (robotic) gripping applications.
  • descriptor image is to be understood in particular as a (learned) dense visual descriptor mapping that maps an image, in particular an RGB image, further in particular with full resolution, with space R WxHx3 , to a dense descriptor space, R WxHxD , where in particular a D-dimensional descriptor vector (D) is present for each pixel;
  • W and H refer to In one embodiment, this refers to a position of the pixel in the image with a width and a height of the respective pixel in the image, in particular in relation to the width and height of the image. In one embodiment, this is done pixel by pixel, so that each pixel in particular has its own descriptor vector.
  • This (automated) procedure, in particular determining the (at least one) descriptor vector can be referred to as inference in one embodiment or is an inference.
  • inference is to be understood in particular as “an inference automatically drawn from a formal system”, further in particular as conclusion(s) drawn automatically by an inference engine, a system described below and/or its means, which in particular includes the pixel-by-pixel assignment and the derivation of the descriptor vector.
  • identical or similar features of similar objects can advantageously be determined more easily using determined descriptor image(s) for the respective objects, in particular correspondences between the respective images can be found, in particular automatically or automatically, in particular with the help of or based on the descriptor image(s).
  • different features are predetermined or selected using a reference image, in particular after (completed) training of a neural network set up (for this purpose), in particular in such a way that a pose estimation or determination, in particular three-dimensional, is possible based on the features, these in particular different features are distributed over the object, in particular over the object of the reference image, these can or are advantageously determined in the image (automatically), especially if the object is different from the reference image, but especially if it is of the same type.
  • the image in particular the first image and/or the second image, can originate from or be extracted from a video recorded by the recording device, in particular the first and/or second recording device, in particular if the recording device has changed its perspective on the scene or the perspective has been changed.
  • the image can originate from or be extracted from a video recorded by a recording device.
  • the first image can originate from a video recorded by a first recording device and the second image can originate from or be extracted from a video recorded by a second recording device.
  • the method further comprises determining a pose of the at least one object, in particular based on at least three determined features of the object.
  • a pose of the at least one object can be determined with less time than, in particular with manual feature assignment.
  • the method comprises determining a grip position on the at least one object based on a determined pose of the object. In one embodiment, the method comprises determining a grip position for a gripping robot, in particular based on a determined pose of the object.
  • the descriptor image is determined by means of at least one artificial neural network. In one embodiment, further steps of the method, in particular determining an assignment and/or determining at least one feature, by means of an (artificial) neural network or are carried out by it.
  • this can also make it possible for a selection of features on the at least one object, in particular on several objects, in a scene to be automatically extracted or recognized and/or assigned or to be able to be assigned.
  • the determination of the pose of the at least one object is based on at least three predetermined features of a reference image, wherein the features of the reference image, in one embodiment, are predetermined based on a determined descriptor image of a reference object.
  • the reference image corresponds to a descriptor image of a reference object, in particular a descriptor image that has a reference object.
  • at least three different features of the object (in the scene) are assigned to the at least three predetermined features of the reference image.
  • the pose of the at least one object can be determined more quickly and/or more robustly.
  • the determination of a pose of the at least one object by calculating a distortion and/or a shift from a manually marked reference image, in particular manually.
  • statistical recording of features of different (but similar) objects, in particular in a reference image or several reference images can be dispensed with.
  • the determination of at least one feature is not limited to identical objects and/or objects with the same appearance, but can be applied to similar objects and accordingly (as described herein) a pose of the at least one object, in particular of the plurality of (similar) objects, can be determined.
  • Similar as used herein, is intended in embodiments in particular to mean of the same type, genus, family and/or order or the like, especially in analogy to biology.
  • the method comprises a step of determining a probability, wherein the probability describes a similarity of a combination of determined features in the scene to the predetermined features of the reference image and/or the reference object, in particular in order to determine whether the features belong to a single object or to exclude combinations of features that are distributed in combination across several different objects.
  • the relative arrangement of the features to one another is determined from the, in particular predetermined, features of the reference image and/or several, in particular predetermined, features of several reference images.
  • an object in a scene with multiple objects, in particular with multiple similar objects can advantageously be recognized or determined more robustly and/or quickly and, in one embodiment, the pose of the object can be recognized or determined more robustly and/or quickly.
  • feature combinations that do not belong to just one object or in which features are distributed across multiple different objects can advantageously be excluded, at least substantially. In one embodiment, this can at least substantially prevent an incorrect assignment of features to an object in the scene based on the probability, in particular determined features can be assigned to an object more clearly and automatically.
  • an object, in particular an object to be grasped can be a fish that is stored in a box with other fish of a different fish species.
  • identical features of the different fish can be recognized or determined, in particular at least substantially.
  • the features are recognized or determined independently of the number of objects on the objects.
  • a probability in particular as described herein, it can be determined or is determined whether the determined Features of an object or of various objects belong, in the example, to one or more of the fish. If in one embodiment the features in the example are assigned to a fish, in particular a probability that the features belong to the object, here fish, is greater than a predetermined probability, a pose of the fish can be determined, in particular using the determined and assigned features. Based on the determined pose, in one embodiment a grip pose or grip position tailored to the fish can be determined, with the help of which the fish can be or is gripped.
  • the method comprises determining a gripping pose based on the probability. This advantageously makes it possible to find a gripping pose that is matched to the determined features, in particular in comparison with methods that are based on a predetermined, in particular manually selected, gripping position on the object and determine this position based on determined images.
  • a more advantageous grip position in particular grip pose, can be or is determined, which can be or is in particular adapted to (several) similar objects in a scene.
  • the (first and/or second) recording device is arranged on the at least one robot, in particular on a flange of the robot.
  • the robot is moved and/or aligned to record the image, in particular the first image and the second image, in particular between recording the first image and recording the second image, further in particular to set the, in particular first and/or second, perspective.
  • the method has a step of moving and/or aligning the robot, in particular the flange of the robot, further in particular the recording device which is arranged on the flange of the robot.
  • this advantageously makes it possible for a basis for the allocation of pixels, as described herein, to be automated. can be or is recorded. In one embodiment, this can be done automatically, in particular, if the recording device is not attached to the robot, but rather, in one embodiment, at (different) predetermined points, in particular with a view of the scene, so that a first image can be or is recorded with a first perspective and a second image with a second perspective, in particular different from the first perspective.
  • the recording device particularly preferably comprises a recording device for recording digital and/or two-dimensional, in particular three-dimensional, images, and can in particular have at least one 2D camera, 3D camera and/or at least two spatially spaced cameras and/or at least one scanner, preferably for three-dimensional scanning.
  • an image mentioned here has a point cloud and/or color information, preferably a three-dimensional point cloud, further in particular a point cloud with color information, in particular assigned to the points of the point cloud, and can in particular be such or consist of such.
  • an image (recorded using the recording device) which in one embodiment is generally a three-dimensional image and/or an image with color information.
  • a system for automated feature extraction and/or for operating a multi-axis machine, in particular a gripping robot.
  • the system is set up to carry out a method described herein.
  • the system has at least one robot arm, in particular a gripper guided by a robot arm.
  • the system has a receiving device, in particular a receiving device as described herein.
  • the receiving device is arranged on a flange of the at least one robot arm.
  • the system and/or its means have means for determining a descriptor image, in particular based on an (automatically determined) inference of the Recording device, in particular based on the first image recorded by the first recording device and/or the second image recorded by the second recording device.
  • the system has means for determining an assignment of pixels of a first image (recorded by the recording device) to pixels of a second image (recorded by the recording device), in particular if the system is set up or designed to train an (artificial) neural network, as described herein.
  • system and/or its means have means for determining a pose of the at least one object.
  • system and/or its means have means for determining a grip position on the at least one object, in particular based on a determined pose of the at least one object.
  • system and/or its means have means for determining a probability.
  • a method for gripping an object with a gripping robot comprises a step of determining a gripping position as described herein. Furthermore, in one embodiment, the method comprises gripping the object with the gripping robot based on the (determined) gripping position.
  • this can enable the gripping robot to find a grip on the object more quickly or to carry out this grip more quickly, in particular in comparison to prior art methods.
  • a system and/or means in the sense of the present invention can be designed in terms of hardware and/or software, in particular at least one, preferably data- or signal-connected, especially digital, processing unit, especially microprocessor unit (CPU), graphics card (GPU) or the like, and/or one or more programs or program modules, preferably with a memory and/or bus system.
  • the processing unit can be designed to process commands that are implemented as a program stored in a memory system, to detect input signals from a data bus and/or to output signals to a data bus.
  • a memory system can have one or more, in particular various storage media, in particular optical, magnetic, solid-state and/or other non-volatile media.
  • the program can be designed in such a way that it embodies or is capable of carrying out the methods described here, so that the processing unit can carry out the steps of such methods and thus in particular can operate or monitor the multi-axis machine, in particular the gripping robot.
  • a computer program product can have, in particular be, a storage medium, in particular a computer-readable and/or non-volatile one, for storing a program or instructions or with a program or instructions stored thereon.
  • execution of this program or these instructions by a system or a controller, in particular a computer or an arrangement of several computers causes the system or the controller, in particular the computer(s), to carry out a method described here or one or more of its steps, or the program or the instructions are set up for this purpose.
  • one or more, in particular all, steps of the method are carried out completely or partially automatically, in particular by the controller or its means.
  • the system comprises the robot.
  • Fig. 1 a system according to an embodiment of the present invention.
  • Fig. 2 several similar objects in a scene after an execution
  • Fig. 3 an object with determined features after an execution
  • Fig. 4 several similar objects in a scene with determined features, combinations of features and a handle position
  • Fig. 5 a block diagram of a method according to an embodiment.
  • FIG. 1 shows a system 1 with a robot 2, on the flange of which a gripper 3 is arranged. Furthermore, Figure 1 shows a recording device 4 which has different perspectives on the scene 10 with several objects 5 and which is data-connected to the robot 2 via a processing unit.
  • the recording device 4' is arranged on the robot 2, in particular on the robot arm, further in particular on the flange of the robot arm (shown in dashed lines in Figure 1).
  • the objects 5 are shown in a container 6.
  • the objects 5 are captured by the recording device 4 in that the recording device 4 takes an image from one perspective on the scene 10, in particular a first image from a first perspective on the scene 10 and a second image with a second perspective, which differs from the first perspective, on the scene 10.
  • pixels of one image are assigned to pixels of the second image, so that in particular an assignment can be determined between the first image and the second image, in particular their pixels, in particular to each other, in particular when or for training an (artificial) neural network.
  • the recording device 4 In order to automatically record a first image and a second image, in the case that the recording device 4 is attached or arranged on the flange of the robot, in particular on the flange of its robot arm, it can be moved by the robot, in particular by a robot controller, or in a different pose of the recording device achieved by the movement of the robot and/or the robot arm, in particular with a different (second) perspective on the scene 10, a second image can be recorded in one embodiment based on the recorded image, which can be used or can be used and/or is used in one embodiment to determine features.
  • Figure 2 schematically shows a scene 10 with several similar objects 5, which can be in a container (not shown).
  • the (similar) objects 5 are shown with patterns that are examples of the descriptor image, in which a feature vector is assigned to each pixel. Areas with the same pattern are intended to indicate areas with the same features. A separation between the areas is clearly demarcated here; this can comprise a transition, in particular a continuous one, between the areas in embodiments, in particular descriptors in the areas can differ (slightly) from one another, but are assigned to an area by way of example in Figure 2 and the following figures.
  • similar objects 5, which differ in particular in size, length, width, height and/or the like and/or the characteristics of individual features can have at least substantially the same features.
  • a feature can then be determined, in particular on each object 5, which has at least substantially the same features in the descriptor image (reference is made to a representation of features in Figure 3).
  • Figure 3 shows a schematic representation of an object 5 in which features M1 to M3 were determined, in particular based on features of a reference image with predetermined features.
  • the features M1 to M3 have in particular characteristic properties.
  • a relationship, in particular a relative arrangement to one another, between the features M1 to M3 is shown schematically. For example, if feature M1 and feature M3 are connected by a (virtual) line (shown in dashed lines), feature M2 is arranged offset from this line (shown with a dashed line that is perpendicular to the connecting line between M1 and M3).
  • the features M1 to M3 can also be connected directly via (virtual) lines.
  • Figure 4 shows three similar objects 5, each of which shows or has determined features M1 to M3 by way of example.
  • a feature M1 is connected to a feature M2 and a feature M3.
  • W1 to W3 denote probabilities of the respective connections of the features M1 to M3, which describe a similarity to the arrangement of the features M1 to M3 in a reference image with predetermined features M1 to M1. From this it can be seen that the similarity of the arrangement of the features M1 to M3 in the two objects 5 shown on the left side of Figure 4 is lower than in the object shown on the right in the figure.
  • Figure 4 schematically shows a gripping position G, in particular for a gripper of a gripping robot, which is shown as an example with three gripping fingers. Based on the features M1 to M3, a pose of the object 5 can be determined, based on which, in one embodiment, an optimal(er) gripping position G on the object can be determined.
  • Figure 5 schematically shows a block diagram of a method 20 that shows the steps of the method 20, where S10 represents, by way of example, the recording of a first image from a first perspective, S20 represents the recording of a second image from a second perspective that is different from the first perspective, S30 represents a determination of an assignment of pixels of the first image to pixels of the second image, S40 represents a determination of a descriptor image based on the recorded first image, in particular based on an inference, and S50 represents a determination of at least one feature M1, M2, M3 based on the determined descriptor image.
  • S20 and S30 are dashed to schematically represent that a determination S40 of a descriptor image is or can be carried out based on one, in particular exactly one, recorded image and in particular S20 and S30 are or can be used in or for training an (artificial) neural network.

Landscapes

  • Engineering & Computer Science (AREA)
  • Robotics (AREA)
  • Mechanical Engineering (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Theoretical Computer Science (AREA)
  • Health & Medical Sciences (AREA)
  • General Health & Medical Sciences (AREA)
  • Orthopedic Medicine & Surgery (AREA)
  • Manipulator (AREA)
  • Image Analysis (AREA)

Abstract

Ein Verfahren (20) zur automatisierten Merkmalsextraktion und/oder Merkmalszuordnung, mit den Schritten: Aufnehmen (S10) eines Bilds mit einer Perspektive einer Szene (10) mit wenigstens einem Objekt (5) mithilfe einer Aufnahmevorrichtung (4); Ermitteln (S40) eines Deskriptorbilds basierend auf dem aufgenommenen Bild; und Ermitteln (S50) von wenigstens einem Merkmal (M1, M2, M3) des wenigstens einen Objekts (5) basierend auf dem ermittelten Deskriptorbild.

Description

Beschreibung
Objektlagedetektion mit automatisierter Merkmalsextraktion und/oder Merkmalszuordnung
Die vorliegende Erfindung betrifft ein Verfahren zur automatisierten Merkmalsextraktion und/oder Merkmalszuordnung, ein System zur automatisierten Merkmalsextraktion, sowie ein Computerprogramm bzw. Computerprogrammprodukt.
Merkmalsbasierte Objekterkennung besteht üblicherweise aus zwei Schritten: Einem ersten Schritt mit Merkmalsextraktion, der üblicherweise eine manuelle Auswahl von Merkmalen, wie beispielsweise Kreise, Kanten, Ecken, etc. umfasst, sowie eine Auswahl bzw. Implementierung von Algorithmen und/oder Methoden zur Merkmalserkennung, wie insbesondere Hough-Transformation für die Kreiserkennung, etc. Für eine Kantendetektion müssen beispielsweise passende Parameter gefunden werden, wie insbesondere bei einem Canny-Filter. Einem zweiten Schritt, der üblicherweise eine Merkmalszuordnung mit anschließender Posenerkennung umfasst. Entsprechend leitet sich die Pose des Objekts von der Verzerrung und/oder Verschiebung des Objekts in unterschiedlichen Aufnahmen bzw. Perspektiven einer Szene, die das Objekt umfasst, ab.
Aufgabe der vorliegenden Erfindung ist es insbesondere eine merkmalsbasierte Objekterkennung zu verbessern, insbesondere eine Merkmalsextraktion zu automatisieren, weiter insbesondere eine Merkmalszuordnung zu automatisieren.
Diese Aufgabe wird durch ein Verfahren mit den Merkmalen des Anspruchs 1 gelöst. Die Unteransprüche betreffen vorteilhafte Weiterbildungen.
In einer Ausführung der vorliegenden Erfindung wird ein Verfahren zur automatisierten Merkmalsextraktion und/oder Merkmalszuordnung bereitgestellt.
In einer Ausführung weist das Verfahren ein Aufnehmen eines Bilds mit einer Perspektive einer Szene mit wenigstens einem Objekt mithilfe einer Aufnahmevorrichtung auf. In einer Ausführung weist das Verfahren ein Ermitteln eines Deskriptorbilds basierend auf dem aufgenommenen Bild auf. In einer Ausführung basiert das Ermitteln des Deskriptorbilds auf dem, insbesondere durch die Aufnahmevorrichtung, aufgenommenen Bild. In einer Ausführung basiert das Ermitteln des Deskriptorbilds auf einer zuvor trainierten künstlichen Intelligenz bzw. auf einem Verfahren, das eine trainierte künstliche Intelligenz verwendet, um insbesondere ein Deskriptorbild zu ermitteln bzw. mithilfe dessen das Deskriptorbild ermittelt wird bzw. werden kann. In einer Ausführung umfasst die Szene wenigstens ein Objekt, insbesondere wenigstens ein Objekt für die automatisierte Merkmalsextraktion und/oder Merkmalszuordnung, weiter insbesondere wenigstens ein Objekt, das basierend auf der automatisierten Merkmalsextraktion und/oder Merkmalszuordnung gegriffen werden soll bzw. gegriffen wird. In einer Ausführung kann eine Perspektive vorbestimmt bzw. im Voraus festgelegt sein, insbesondere bei fest installierten Aufnahmevorrichtung(en) oder eine Perspektive kann, zumindest im Wesentlichen, randomisiert sein bzw. randomisiert eingenommen werden.
In einer Ausführung weist das Verfahren, insbesondere vorgelagert zum, insbesondere oben beschriebenen Verfahren zur automatisierten Merkmalsextraktion und/oder Merkmalszuordnung, ein Trainieren einer künstlichen Intelligenz mit einem Schritt, insbesondere einem ersten Schritt, mit Aufnehmen eines ersten Bilds mit einer ersten Perspektive einer Szene mit einer, insbesondere ersten, Aufnahmevorrichtung auf. In einer Ausführung umfasst die Szene wenigstens ein Objekt, insbesondere wenigstens ein Objekt für die automatisierte Merkmalsextraktion und/oder Merkmalszuordnung. In einer Ausführung weist das Verfahren einen Schritt, insbesondere einen zweiten Schritt, mit Aufnehmen eines zweiten Bilds mit einer zweiten Perspektive der Szene mittels der ersten bzw. derselben Aufnahmevorrichtung und/oder einer zweiten Aufnahmevorrichtung auf. In einer Ausführung weist das Verfahren, insbesondere in einem dritten Schritt, ein Ermitteln einer Zuordnung von Pixeln des ersten Bilds zu Pixeln des zweiten Bilds auf, insbesondere basierend auf der ersten Perspektive und der zweiten Perspektive. In einer Ausführung kann eine Perspektive vorbestimmt bzw. im Voraus festgelegt sein, insbesondere bei fest installierten Aufnahmevorrichtungen oder eine Perspektive kann, zumindest im Wesentlichen, randomisiert sein bzw. randomisiert eingenommen werden, insbesondere derart, dass sich in einer Ausführung die erste Perspektive von der zweiten Perspektive unterscheidet. In einer Ausführung weist das Verfahren, insbesondere in einem vierten Schritt, ein Ermitteln einer Zuordnung von Pixeln des ersten Bilds zu Pixeln des zweiten Bilds auf, insbesondere basierend auf Tiefendaten, wobei die erste und/oder die zweite Aufnahmevorrichtung in einer Ausführung dazu eingerichtet ist, Tiefendaten zu erfassen bzw. aufzunehmen, insbesondere Tiefendaten aus dem ersten Bild und/oder dem zweiten Bild ermittelt werden. In einer Ausführung weist das Verfahren, insbesondere in einem fünften Schritt, ein Ermitteln eines Deskriptorbilds basierend auf, insbesondere einer Inferenz, des ersten und/oder des zweiten Bilds, auf. In einer Ausführung basiert das Ermitteln des Deskriptorbilds auf einem bzw. dem Bild, insbesondere dem ersten Bild und/oder dem zweiten Bild. In einer Ausführung ist das Bild, insbesondere das erste und/oder das zweite Bild ein zweidimensionales Bild. In einer Ausführung weist das Verfahren, insbesondere in einem sechsten Schritt, ein Ermitteln von wenigstens einem Merkmal des wenigstens einen Objekts basierend auf dem ermittelten Deskriptorbild auf.
Der Begriff „Szene“, wie hierin verwendet, soll insbesondere als eine Momentaufnahme eines (relevanten) Umfelds, welche eine Szenerie mit wenigstens einem Objekt, insbesondere in einem Behälter, umfasst, verstanden werden. In einer Ausführung weist die Szene das wenigstens eine Objekt, das insbesondere in einem Behälter sein kann, und Teile des Umfelds des Behälters auf, insbesondere Teile eines Roboters, weiter insbesondere Teile eines Systems, das den Roboter umfasst. In einer Ausführung können nicht relevante Teile der Szene (automatisiert) herausgefiltert werden.
Der Begriff „Perspektive“, wie hierin verwendet, soll insbesondere als Blickrichtung der Aufnahmevorrichtung verstanden werden, die insbesondere derart ausgerichtet ist, dass die Szene, wie hierin beschrieben, zumindest teilweise im Blickfeld der Aufnahmevorrichtung ist, insbesondere die gesamte Szene, insbesondere bei Anwendungen der automatisierten Merkmalsextraktion und/oder Merkmalszuordnung zum Ermitteln einer Pose und/oder einer Griffposition in (robotischen) Greifanwendungen.
Der Begriff „Deskriptorbild“, wie hierin verwendet, soll insbesondere als (erlernte) dichte visuelle Deskriptor Abbildung, die ein Bild, insbesondere ein RGB-Bild, weiter insbesondere mit voller Auflösung, mit Raum RWxHx3, auf einen dichten Deskriptorraum, RWxHxD, abbildet, wobei insbesondere für jedes Pixel ein D- dimensionaler Deskriptorvektor (D) vorliegt, verstanden werden; W und H beziehen sich in einer Ausführung auf eine Position des Pixels im Bild mit einer Breite („width“) und einer Höhe („height“) des jeweiligen Pixels im Bild, insbesondere bezogen auf die Breite und Höhe des Bilds. Dies erfolgt in einer Ausführung pixelweise, so dass jedes Pixel insbesondere einen eigenen Deskriptor-Vektor aufweist. Dieses (automatisierte) Vorgehen, insbesondere ein Ermitteln des (wenigstens einen) Deskriptorvektors, kann in einer Ausführung als Inferenz bezeichnet werden bzw. ist eine Inferenz.
Der Begriff „Inferenz“, wie hierin verwendet, soll insbesondere als „aus einem formalen System automatisiert erstellte Folgerung“ verstanden werden, weiter insbesondere als automatisiert von einer Inferenzmaschine (englisch: „inference engine“), hierin ein weiter unten beschriebenes System und/oder seine Mittel, gezogene Schlussfolgerung(en), die hierin insbesondere die pixelweise ermittelte Zuordnung und die Ableitung des Deskriptor-Vektors umfasst.
Hierdurch kann vorteilhafter Weise, in einer Ausführung, eine automatisierte Merkmalsauswahl realisiert werden, insbesondere basierend auf dem Deskriptorbild, die, insbesondere im Vergleich mit einer manuellen Merkmalsauswahl, wenig(er) zeitaufwendig ist. Ferner können hierdurch vorteilhafter Weise, in einer Ausführung, automatisiert Merkmale mehrerer Objekte mit gleichartigem Aussehen, insbesondere gleichartiger Objekte, automatisiert extrahiert und/oder zugeordnet werden. In einer Ausführung kann hierdurch vorteilhafter Weise auf eine Definition neuer Merkmale eines anderen, insbesondere gleichartigen, Objekts verzichtet werden.
Gleiche oder ähnliche Merkmale gleichartiger Objekte können in einer Ausführung anhand ermitteltm/er Deskiptorenbild/er zu den jeweiligen Objekten vorteilhafterweise einfach(er) ermittelt werden, insbesondere Korrespondenzen zwischen den jeweiligen Bildern, insbesondere automatisch bzw. automatisiert, gefunden werden, insbesondere mithilfe der bzw. basierend auf dem/n Deskriptorenbild/ern. Sind in einer Ausführung verschiedene Merkmale anhand eines Referenzbildes, insbesondere nach einem (abgeschlossenen) Training eines (hierzu) eingerichteten neuronalen Netzwerks, vorbestimmt oder ausgewählt, insbesondere derart, dass eine, insbesondere dreidimensionale, Posenschätzung bzw. -ermittlung basierend auf den Merkmalen möglich ist, diese insbesondere unterschiedlichen Merkmale über das Objekt, insbesondere über das Objekt des Referenzbildes, verteilt angeordnet sind, können diese bzw. werden diese vorteilhafterweise im Bild (automatisiert) ermittelt, insbesondere wenn es sich um ein vom Referenzbild unterschiedliches, insbesondere aber gleichartiges, Objekt handelt.
In einer Ausführung kann das Bild, insbesondere das erste Bild und/oder das zweite Bild, aus einem von der Aufnahmevorrichtung, insbesondere der ersten und/oder zweiten Aufnahmevorrichtung, aufgenommenen Video stammen bzw. extrahiert werden, insbesondere wenn die Aufnahmevorrichtung ihre Perspektive auf die Szene verändert hat bzw. die Perspektive verändert wurde. In einer Ausführung kann das Bild aus einem von einer Aufnahmevorrichtung aufgenommenen Video stammen bzw. ist aus diesem extrahiert. In einer Ausführung kann das erste Bild aus einem von einer ersten Aufnahmevorrichtung aufgenommenen Video stammen und dass zweite Bild aus einer von einer zweiten Aufnahmevorrichtung aufgenommen Video stammen bzw. ist aus diesem extrahiert.
In einer Ausführung umfasst das Verfahren ferner ein Ermitteln einer Pose des wenigstens einen Objekts, insbesondere basierend auf wenigstens drei ermittelten Merkmalen des Objekts.
Hierdurch kann vorteilhafter Weise, in einer Ausführung, mit wenig(er) Zeitaufwand als, insbesondere bei manueller Merkmalszuordnung, eine Pose des wenigstens einen Objekts ermittelt werden.
In einer Ausführung weist das Verfahren ein Ermitteln einer Griffposition an dem wenigstens einen Objekt auf, basierend auf einer ermittelten Pose des Objekts. In einer Ausführung weist das Verfahren ein Ermitteln einer Griffposition für einen Greifroboter auf, insbesondere basierend auf einer ermittelten Pose des Objekts.
Hierdurch kann in vorteilhafter Weise schnell(er) ein Objekt der Szene von einem Greifroboter gegriffen werden bzw. eine Griffposition für den Greifroboter ermittelt werden.
In einer Ausführung wird das Deskriptorbild mittels wenigstens einem künstlichen neuronalen Netz ermittelt. In einer Ausführung können weitere Schritte des Verfahrens, insbesondere das Ermitteln einer Zuordnung und/oder das Ermitteln von wenigstens einem Merkmal, mittels (künstlichem) neuronalen Netz durchgeführt werden bzw. werden von diesem durchgeführt.
Hierdurch kann vorteilhafter Weise ermöglicht werden, dass Merkmale eines Referenzobjekts, insbesondere Merkmale eines Referenzbilds, insbesondere schnell(er), bei gleichartigen Objekten erkannt werden bzw. erkennbar sind, insbesondere dann wenn mehrere Objekte in der Szene vorhanden sind. In einer Ausführung kann hierdurch ferner ermöglicht werden, dass eine Auswahl von Merkmalen an dem wenigstens einen Objekt, insbesondere an mehreren Objekten, in einer Szene automatisiert extrahiert bzw. erkannt werden und/oder zugeordnet werden bzw. zugeordnet werden können.
In einer Ausführung basiert das Ermitteln der Pose des wenigstens einen Objekts auf wenigstens drei vorbestimmten Merkmalen eines Referenzbilds, wobei die Merkmale des Referenzbilds, in einer Ausführung, anhand eines ermittelten Deskriptorbilds eines Referenzobjekts vorbestimmt sind bzw. werden. In einer Ausführung entspricht das Referenzbild einem Deskriptorbild eines Referenzobjekts, insbesondere einem Deskriptorbild, das ein Referenzobjekt aufweist In einer Ausführung werden wenigstens drei unterschiedliche Merkmale des Objekts (in der Szene) den wenigstens drei vorbestimmten Merkmalen des Referenzbilds zugeordnet.
Hierdurch kann vorteilhafter Weise, in einer Ausführung, ermöglicht werden, dass die Pose des wenigstens einen Objekts schnell(er) und/oder robuster ermittelt wird bzw. werden kann. Ferner kann in einer Ausführung auf das Ermitteln einer Pose des wenigstens einen Objekts mittels Berechnen einer Verzerrung und/oder einer Verschiebung aus einem manuell markierten Referenzbild, insbesondere manuell Vorteilhafterweise kann in einer Ausführung auf ein statistisches Erfassen von Merkmalen von unterschiedlichen (aber gleichartigen) Objekten, insbesondere in einem Referenzbild oder mehreren Referenzbildern, verzichtet werden. Insbesondere ist, in einer Ausführung, das Ermitteln von wenigstens einem Merkmal nicht auf identische Objekte und/oder Objekte mit gleichem Aussehen beschränkt, sondern kann auf gleichartige Objekte angewandt werden und entsprechend (wie hierin beschriebenen) eine Pose des wenigstens einen Objekts, insbesondere der Vielzahl an (gleichartigen) Objekten, ermittelt werden. „Gleichartig“, wie hierin verwendet, soll in Ausführungen insbesondere als von der gleichen Art, Gattung, Familie und/oder Ordnung oder dergleichen, insbesondere in Analogie zur Biologie, verwendet bzw. verstanden werden.
In einer Ausführung umfasst das Verfahren, wenn die Szene mehrere, insbesondere gleichartige, Objekte aufweist, einen Schritt mit Ermitteln einer Wahrscheinlichkeit wobei die Wahrscheinlichkeit eine Ähnlichkeit einer Kombination von ermittelten Merkmalen in der Szene zu den vorbestimmten Merkmalen des Referenzbilds und/oder dem Referenzobjekt beschreibt, insbesondere um die Zugehörigkeit der Merkmale zu einem einzelnen Objekt zu ermitteln bzw. um Kombinationen von Merkmalen auszuschließen, die sich in Kombination auf mehrere verschiedene Objekte verteilen. In einer Ausführung wird die relative Anordnung der Merkmale zueinander aus den, insbesondere vorbestimmten, Merkmalen des Referenzbilds und/oder mehrerer, insbesondere vorbestimmter, Merkmale mehrerer Referenzbilder ermittelt.
Hierdurch kann in einer Ausführung vorteilhafter Weise ein Objekt in einer Szene mit mehreren Objekten, insbesondere mit mehreren gleichartigen Objekten, robust(er) und/oder schnell(er) erkannt bzw. ermittelt werden und, in einer Ausführung, die Pose des Objekts robust(er) und oder schnell(er) erkannt bzw. ermittelt werden. Ferner können in einer Ausführung vorteilhafter Weise Merkmalskombinationen, zumindest im Wesentlichen, ausgeschlossen werden, die nicht nur zu einem Objekt gehören bzw. bei denen Merkmale über mehrere verschiedene Objekte hin verteilt sind. Dadurch kann, in einer Ausführung, anhand der Wahrscheinlichkeit eine falsche Zuordnung von Merkmalen zu einem Objekt der Szene, zumindest im Wesentlichen, verhindert werden, insbesondere ermittelten Merkmale eindeutig(er) einem Objekt automatisiert zugeordnet werden. Ohne Einschränkung der Allgemeinheit kann in einer Ausführung ein Objekt, insbesondere ein zu greifendes Objekt, ein Fisch sein, der mit anderen Fischen einer anderen Fischart in einer Kiste gelagert ist. Anhand eines ermittelten Deskriptorenbilds und insbesondere basierend auf vorbestimmten Merkmalen in einem Referenzbild können, insbesondere zumindest im Wesentlichen, gleiche Merkmale der unterschiedlichen Fische erkannt bzw. ermittelt werden. Die Merkmale werden in einer Ausführung unabhängig von der Vielzahl der Objekte auf den Objekten erkannt bzw. ermittelt. Mittels einer Wahrscheinlichkeit, insbesondere wie hierin beschrieben, kann ermittelt werden bzw. wird ermittelt, ob die ermittelten Merkmale zu einem Objekt oder zu verschiedenen Objekten gehören, im Beispiel, zu einem oder zu mehreren der Fische. Sind in einer Ausführung die Merkmale im Beispiel zu einem Fisch zugeordnet, insbesondere eine Wahrscheinlichkeit dass die Merkmale zu dem Objekt, hier Fisch, gehören größer als eine vorbestimmte Wahrscheinlichkeit, kann insbesondere eine Pose des Fischs ermittelt werden, weiter insbesondere mittels der ermittelten und zugeordneten Merkmale. Anhand der ermittelten Pose kann in einer Ausführung eine auf den Fisch abgestimmte Griffpose bzw. Griffposition ermittelt werden mithilfe derer der Fisch gegriffen werden kann bzw. wird.
In einer Ausführung umfasst das Verfahren ein Ermitteln einer Griffpose basierend auf der Wahrscheinlichkeit. Hierdurch kann vorteilhafterweise eine Griffpose gefunden werden, die auf die ermittelten Merkmale abgestimmt ist, insbesondere im Vergleich mit Verfahren, die auf einer vorbestimmten, insbesondere manuell auswählten, Greifposition am Objekt basieren und anhand von ermittelten Bildern diese Position ermitteln.
Hierdurch kann vorteilhafter Weise, in einer Ausführung, ermöglicht werden, dass eine vorteilhafte(re) Griffposition, insbesondere Griffpose, ermittelt werden kann bzw. ermittelt wird, die insbesondere auf (mehrere) gleichartige Objekte in einer Szene abgestimmt werden kann bzw. abgestimmt ist.
In einer Ausführung ist die (erste und/oder zweite) Aufnahmevorrichtung an dem wenigstens einen Roboter, insbesondere an einem Flansch des Roboters, angeordnet. In einer Ausführung wird der Roboter zum Aufnehmen des Bilds, insbesondere des ersten Bilds und des zweiten Bilds, bewegt und/oder ausgerichtet, insbesondere zwischen dem Aufnehmen des ersten Bilds und dem Aufnehmen des zweiten Bilds, weiter insbesondere zum Einstellen der, insbesondere ersten und/oder der zweiten, Perspektive. In einer Ausführung weist das Verfahren einen Schritt des Bewegens und oder Ausrichtens des Roboters, insbesondere des Flanschs des Roboters, weiter insbesondere der Aufnahmevorrichtung, die an dem Flansch des Roboters angeordnet ist, auf.
Hierdurch kann in einer Ausführung vorteilhafter Weise ermöglicht werden, dass eine Basis für die Zuordnung von Pixeln, wie hierin beschrieben, automatisiert erfolgt bzw. aufgenommen werden kann bzw. aufgenommen wird. Dies kann, in einer Ausführung, insbesondere auch dann automatisiert erfolgen, wenn die Aufnahmevorrichtung nicht am Roboter angebracht ist, sondern, in einer Ausführung, an (unterschiedlichen) vorbestimmten Punkten, insbesondere mit Blick auf die Szene, sodass ein erstes Bild mit einer ersten Perspektive und ein zweites mit einer zweiten, insbesondere von der ersten Perspektive unterschiedliche, Perspektive aufgenommen werden kann bzw. aufgenommen wird.
Die Aufnahmevorrichtung umfasst besonders bevorzugt eine Aufnahmevorrichtung zum Aufnehmen von digitalen und/oder zweidimensionalen, insbesondere dreidimensionalen, Bildern, kann insbesondere wenigstens eine 2D-Kamera, 3D- Kamera und/oder wenigstens zwei räumlich voneinander beabstandete Kameras und/oder wenigstens einen Scannner, vorzugsweise zum dreidimensionalen Scannen, aufweisen. In einer Ausführung weist ein hier genanntens Bild (jeweils) eine Punktewolke und/oder Farbinformation, vorzugsweise eine dreidimensionale Punktewolke, weiter insbesondere eine Punktewolke mit Farbinformation, insbesondere den Punkten der Punktewolke zugeordnet, auf, kann insbesondere eine solche sein bzw. aus einer solchen bestehen. Entsprechend wird insbesondere eine mithilfe einer Aufnahmevorrichtung aufgenommene dreidimensionale Punktewolke und/oder Farbinformation als (mithilfe der Aufnahmevorrichtung aufgenommenes) Bild bezeichnet, welches allgemein in einer Ausführung ein dreidimensionales Bild und/oder ein Bild mit Farbinformation ist.
In einer Ausführung der vorliegenden Erfindung wird ein System zur automatisierten Merkmalsextraktion und/oder zum Betreiben einer mehrachsigen Maschine, insbesondere eines Greifroboters bereitgestellt. In einer Ausführung ist das System zur Durchführung eines hierin beschriebenen Verfahrens eingerichtet. In einer Ausführung weist das System wenigstens einen Roboterarm, insbesondere einen von einem Roboterarm geführten Greifer auf. In einer Ausführung weist das System eine Aufnahmevorrichtung, insbesondere eine Aufnahmevorrichtung wie hierin beschrieben, auf. In einer Ausführung ist die Aufnahmevorrichtung an einem Flansch des wenigstens einen Roboterarms angeordnet. In einer Ausführung weist das System und/oder seine Mittel, Mittel zum Ermitteln eines Deskriptorbilds auf, insbesondere basierend auf einer (automatisiert ermittelten) Inferenz des von der Aufnahmevorrichtung aufgenommenen Bilds, insbesondere basierend auf dem von der ersten Aufnahmevorrichtung aufgenommenen ersten Bild und/oder dem von der zweiten Aufnahmevorrichtung aufgenommenen zweiten Bild. In einer Ausführung weist das System Mittel zum Ermitteln einer Zuordnung von Pixeln eines (von der Aufnahmevorrichtung aufgenommenen) ersten Bilds zu Pixeln eines (von der Aufnahmevorrichtung aufgenommenen) zweiten Bilds auf, insbesondere wenn das System zum Trainieren eines (künstlichen) neuronalen Netzes, wie hierin beschrieben, eingerichtet bzw. ausgebildet ist.
In einer Weiterbildung weist das System und/oder seine Mittel, Mittel zum Ermitteln einer Pose des wenigstens einen Objekts auf. In einer Weiterbildung weist das System und/oder seine Mittel, Mittel zum Ermitteln einer Griffposition an dem wenigstens einen Objekt, insbesondere basierend auf einer ermittelten Pose des wenigstens einen Objekts, auf. In einer Weiterbildung weist das System und/oder seine Mittel, Mittel zum Ermitteln einer Wahrscheinlichkeit auf.
In einer Ausführung der vorliegenden Erfindung weist ein Verfahren zum Greifen eines Objekts mit einem Greifroboter einen Schritt mit Ermitteln einer Griffposition, wie hierin beschrieben, auf. Ferner weist das Verfahren in einer Ausführung ein Greifen des Objekts mit dem Greifroboter basierend auf der (ermittelten) Griffposition auf.
Vorteilhafterweise kann hierdurch, in einer Ausführung, ermöglicht werden, dass der Greifroboter schnell(er) einen Griff am Objekt findet bzw. schnell(er) diesen Griff ausführt, insbesondere im Vergleich zu Verfahren des Stands der Technik.
Ein System und/oder ein Mittel im Sinne der vorliegenden Erfindung kann hard- und/oder softwaretechnisch ausgebildet sein, insbesondere wenigstens eine, vorzugsweise mit einem Speicher- und/oder Bussystem daten- bzw. signalverbundene, insbesondere digitale, Verarbeitungs-, insbesondere Mikroprozessoreinheit (CPU), Graphikkarte (GPU) oder dergleichen, und/oder ein oder mehrere Programme oder Programmmodule aufweisen. Die Verarbeitungseinheit kann dazu ausgebildet sein, Befehle, die als ein in einem Speichersystem abgelegtes Programm implementiert sind, abzuarbeiten, Eingangssignale von einem Datenbus zu erfassen und/oder Ausgangssignale an einen Datenbus abzugeben. Ein Speichersystem kann ein oder mehrere, insbesondere verschiedene, Speichermedien, insbesondere optische, magnetische, Festkörper- und/oder andere nicht-flüchtige Medien aufweisen. Das Programm kann derart beschaffen sein, dass es die hier beschriebenen Verfahren verkörpert bzw. auszuführen imstande ist, sodass die Verarbeitungseinheit die Schritte solcher Verfahren ausführen kann und damit insbesondere die mehrachsige Maschine, insbesondere den Greifroboter, betreiben bzw. überwachen kann.
Ein Computerprogrammprodukt kann in einer Ausführung ein, insbesondere computerlesbares und/oder nicht-flüchtiges, Speichermedium zum Speichern eines Programms bzw. von Anweisungen bzw. mit einem darauf gespeicherten Programm bzw. mit darauf gespeicherten Anweisungen aufweisen, insbesondere sein. In einer Ausführung veranlasst ein Ausführen dieses Programms bzw. dieser Anweisungen durch ein System bzw. eine Steuerung, insbesondere einen Computer oder eine Anordnung von mehreren Computern, das System bzw. die Steuerung, insbesondere den bzw. die Computer, dazu, ein hier beschriebenes Verfahren bzw. einen oder mehrere seiner Schritte auszuführen, bzw. sind das Programm bzw. die Anweisungen hierzu eingerichtet.
In einer Ausführung werden ein oder mehrere, insbesondere alle, Schritte des Verfahrens vollständig oder teilweise automatisiert durchgeführt, insbesondere durch die Steuerung bzw. ihr(e) Mittel. In einer Ausführung weist das System den Roboter auf.
Weitere Vorteile und Merkmale ergeben sich aus den Unteransprüchen und den Ausführungsbeispielen. Hierzu zeigt, teilweise schematisiert:
Fig. 1 : ein System nach einer Ausführung der vorliegenden Erfindung; und
Fig. 2: mehrere gleichartige Objekte in einer Szene nach einer Ausführung;
Fig. 3: ein Objekt mit ermittelten Merkmalen nach einer Ausführung;
Fig. 4: mehrere gleichartige Objekte in einer Szene mit ermittelten Merkmalen, Kombinationen von Merkmalen und einer Griffposition; Fig. 5: ein Blockdiagramm eines Verfahrens nach einer Ausführung.
Fig. 1 zeigt ein System 1 mit einem Roboter 2, an dessen Flansch ein Greifer 3 angeordnet ist. Ferner ist in Figur 1 eine Aufnahmevorrichtung 4, die unterschiedliche Perspektiven auf die Szene 10 mit mehreren Objekten 5 hat, gezeigt, und die über eine Verarbeitungseinheit mit dem Roboter 2 datenverbunden ist. In einer Ausführung ist die Aufnahmevorrichtung 4‘ am Roboter 2, insbesondere am Roboterarm, weiter insbesondere am Flansch des Roboterarms, angeordnet (in Figur 1 gestrichelt dargestellt). Die Objekte 5 sind in einem Behälter 6 dargestellt. Die Objekte 5 werden von der Aufnahmevorrichtung 4 erfasst, indem die Aufnahmevorrichtung 4 ein Bild aus einer Perspektive auf die Szene 10, insbesondere ein erstes Bild aus einer ersten Perspektive auf die Szene 10 und ein zweiten Bild mit einer zweiten Perspektive, die sich von der ersten Perspektive unterscheidet, auf die Szene 10, aufnimmt. Basierend auf den unterschiedlichen Perspektiven werden Pixel des einen Bilds Pixeln des zweiten Bilds zugeordnet, so dass insbesondere eine Zuordnung ermittelt werden kann zwischen dem ersten Bild und dem zweiten Bild, insbesondere deren Pixeln, insbesondere zueinander, insbesondere beim bzw. zum Trainieren eines (künstlichen) neuronalen Netzes. Um automatisiert ein erstes Bild und ein zweites Bild aufzunehmen, kann in dem Fall, dass die Aufnahmevorrichtung 4 am Flansch des Roboters, insbesondere am Flansch seines Roboterarms, angebracht bzw. angeordnet ist, diese vom Roboter, insbesondere von einer Robotersteuerung bewegt werden bzw. in einer durch die Bewegung des Roboters und/oder des Roboterarms erreichten anderen Pose der Aufnahmevorrichtung, insbesondere mit einer anderen (zweiten) Perspektive auf die Szene 10, ein zweites Bild aufnehmen. Anhand des aufgenommenen Bilds kann in einer Ausführung ein Deskriptorbild ermittelt werden, das in einer Ausführung zum Ermitteln von Merkmalen einsetzbar ist bzw. eingesetzt werden kann und/oder eingesetzt wird.
Figur 2 zeigt schematisch eine Szene 10 mit mehreren gleichartigen Objekten 5, die insbesondere in einem Behälter sein können (nicht dargestellt). Die (gleichartigen) Objekte 5 sind mit Mustern dargestellt, die beispielhaft für das Deskriptorbild stehen, bei dem insbesondere jedem Pixel ein Merkmalsvektor zugeordnet ist. Bereiche mit gleichem Muster sollen hier beispielhaft auf Bereiche mit gleichen Merkmalen hindeuten. Eine Trennung zwischen den Bereichen ist hier scharf abgegrenzt; dies kann in Ausführungen einen, insbesondere steten, Übergang zwischen den Bereichen umfassen, insbesondere können sich Deskriptoren in den Bereichen voneinander (geringfügig) unterscheiden, sind aber in Figur 2 und den folgenden Figuren beispielhaft einem Bereich zugeordnet. So können gleichartige Objekte 5, die sich insbesondere in Größe, Länge, Breite, Höhe und/oder dergleichen und/oder Ausprägung von einzelnen Merkmalen unterscheiden, zumindest im Wesentlichen, gleiche Merkmale aufweisen. Basierend auf dem ermittelten Deskriptorbild kann dann, insbesondere an jedem Objekt 5, ein Merkmal ermittelt werden, das, zumindest im Wesentlichen, gleiche Merkmale im Deskriptorbild aufweist (es wird auf eine Darstellung von Merkmalen in Figur 3 verwiesen).
Figur 3 zeigt schematisch ein Objekt 5 bei dem Merkmale M1 bis M3 ermittelt wurden, insbesondere anhand von Merkmalen eines Referenzbilds mit vorbestimmten Merkmalen. Die Merkmale M1 bis M3 weisen insbesondere charakteristische Eigenschaften auf. Ferner ist schematisch ein Bezug, insbesondere relative Anordnung zueinander, zwischen den Merkmalen M1 bis M3 gezeigt, so ist, wenn Merkmal M1 und Merkmal M3 durch eine (virtuelle) Linie verbunden sind (gestrichelt dargestellt), Merkmal M2 versetzt zu dieser Linie angeordnet (mit einer gestrichelten Linie, die senkrecht auf der Verbindungslinie von M1 und M3 ist, dargestellt). Ferner können auch die Merkmale M1 bis M3 direkt über (virtuelle) Linien verbunden sein. Dies kann insbesondere in Fig. 4 aufgegriffen werden, die drei gleichartige Objekte 5 zeigt, die jeweils ermittelte Merkmale M1 bis M3 beispielhaft zeigen bzw. aufweisen. Ferner sind in Figur 4 jeweils ein Merkmal M1 mit einem Merkmal M2 und einem Merkmal M3 verbunden. Mit W1 bis W3 sind Wahrscheinlichkeiten der jeweiligen Verbindungen der Merkmale M1 bis M3 bezeichnet, die eine Ähnlichkeit zu der Anordnung der Merkmale M1 bis M3 in einem Referenzbild mit vorbestimmten Merkmalen M1 bis M1 beschreiben. Hieraus lässt sich erkennen, dass die Ähnlichkeit der Anordnung der Merkmale M1 bis M3 bei den beiden Objekten 5, die auf der linken Seite von Figur 4 dargestellt sind, geringer ist, als bei dem rechts in der Figur dargestellten Objekt. Daraus lässt sich insbesondere ableiten, dass die Merkmalskombinationen, die links dargestellt sind, (wahrscheinlich) nicht zur Merkmalskombination M1 bis M3 eines einzelnen Objekts 5 gehören, weil eine Ähnlichkeit zur Merkmalsanordnung M1 bis M3 eines Referenzobjekts, insbesondere eines Referenzbilds, geringer ist. Ferner ist in Figur 4 schematisch eine Griffposition G, insbesondere für einen Greifer eines Greifroboters, gezeigt, die beispielhaft mit drei Greif-Fingern gezeigt ist. Anhand der Merkmale M1 bis M3 lässt sich eine Pose des Objekts 5 ermitteln, anhand derer in einer Ausführung eine optimale(re) Griffposition G am Objekt ermittelt werden kann.
In Figur 5 ist schematisch ein Blockdiagramm eines Verfahrens 20 dargestellt, das die Schritte des Verfahrens 20 zeigt, wobei S10 beispielhaft das Aufnehmen eines ersten Bilds mit einer ersten Perspektive darstellt, S20 das Aufnehmen eines zweiten Bilds mit einer zweiten, von der ersten Perspektive unterschiedlichen Perspektive, S30 ein Ermitteln einer Zuordnung von Pixeln des ersten Bilds zu Pixeln des zweiten Bilds, S40 ein Ermitteln eines Deskriptorbilds basierend auf dem aufgenommenen ersten Bild, insbesondere basierend auf einer Inferenz, und S50 ein Ermitteln von wenigstens einem Merkmal M1 , M2, M3 basierend auf dem ermittelten Deskriptorbild, schematisch darstellt. S20 und S30 sind gestrichelt, um schematisch darzustellen, dass ein Ermitteln S40 eines Deskriptorbilds basierend auf einem, insbesondere genau einem, aufgenommenen Bild erfolgt bzw. erfolgen kann und insbesondere S20 und S30 beim bzw. zum Trainieren eine (künstlichen) neuronalen Netzes herangezogen werden bzw. werden können.
Obwohl in der vorhergehenden Beschreibung exemplarische Ausführungen erläutert wurden, sei darauf hingewiesen, dass eine Vielzahl von Abwandlungen möglich ist. Außerdem sei darauf hingewiesen, dass es sich bei den exemplarischen Ausführungen lediglich um Beispiele handelt, die den Schutzbereich, die Anwendungen und den Aufbau in keiner Weise einschränken sollen. Vielmehr wird dem Fachmann durch die vorausgehende Beschreibung ein Leitfaden für die Umsetzung von mindestens einer exemplarischen Ausführung gegeben, wobei diverse Änderungen, insbesondere in Hinblick auf die Funktion und Anordnung der beschriebenen Bestandteile, vorgenommen werden können, ohne den Schutzbereich zu verlassen, wie er sich aus den Ansprüchen und diesen äquivalenten Merkmalskombinationen ergibt. Bezuqszeichenliste
1 System
2 Roboter 3 Greifer
4 Aufnahmevorrichtung
5 Objekt
6 Behälter
7 Verarbeitungseinrichtung 10 Szene
20 Verfahren
M1 , M2, M3 ermittelte Merkmale
W1 , W2, W3 ermittelte Wahrscheinlichkeiten
S10 Aufnehmen eines ersten Bilds
S20 Aufnehmen eines zweiten Bilds
S30 Ermitteln einer Zuordnung
S40 Ermitteln eines Deskriptorbilds
S50 Ermitteln von wenigstens einem Merkmal

Claims

Patentansprüche Verfahren (20) zur automatisierten Merkmalsextraktion und/oder Merkmalszuordnung, mit den Schritten:
- Aufnehmen (S10) eines Bilds mit einer Perspektive einer Szene (10) mit wenigstens einem Objekt (5) mithilfe einer Aufnahmevorrichtung (4);
- Ermitteln (S40) eines Deskriptorbilds basierend auf dem aufgenommenen Bild; und
- Ermitteln (S50) von wenigstens einem Merkmal (M1 , M2, M3) des wenigstens einen Objekts (5) basierend auf dem ermittelten Deskriptorbild. Verfahren (20) nach Anspruch 1 , dadurch gekennzeichnet, dass das Verfahren (20) ein Ermitteln einer Pose des wenigstens eines Objekts (5) umfasst basierend auf dem wenigstens einen Merkmal (M1 , M2, M3). Verfahren (20) nach dem vorhergehenden Anspruch, dadurch gekennzeichnet, dass das Ermitteln der Pose des wenigstens einen Objekts (50) auf wenigstens drei vorbestimmten Merkmalen (M1 , M2, M3) eines Referenzbilds basiert, wobei wenigstens drei unterschiedliche ermittelte Merkmale (M1 , M2, M3) des Objekts (5) den wenigstens drei vorbestimmten Merkmalen (M1 , M2, M3) des Referenzbilds zugeordnet werden. Verfahren (20) nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass das Deskriptorbild mittels künstlicher Intelligenz, insbesondere mittels wenigstens einem künstlichen neuronalen Netz, ermittelt wird. Verfahren (20) nach dem vorhergehenden Anspruch, dadurch gekennzeichnet, dass das Verfahren (20), wenn die Szene mehrere, insbesondere gleichartige, Objekte (5) aufweist, ferner einen Schritt mit Ermitteln einer Wahrscheinlichkeit (W1 , W2, W3) aufweist, wobei die Wahrscheinlichkeit (W1 , W2, W3) eine Ähnlichkeit einer Kombination von ermittelten Merkmalen (M1 , M2, M3) in der Szene zu den vorbestimmten Merkmalen (M1 , M2, M3) des Referenzbilds und/oder eines Referenzobjekts beschreibt.
6. Verfahren nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass die, insbesondere erste und/oder die zweite, Aufnahmevorrichtung (4, 4‘) an dem wenigstens einen Roboter, insbesondere an einem Flansch des Roboters, angeordnet ist.
7. Verfahren (20) nach einem der vorhergehenden Ansprüche, dadurch gekennzeichnet, dass das Verfahren (20) ein Ermitteln einer Griffposition (G) an dem wenigstens einen Objekt (5), insbesondere einer Griffposition (G) für einen Greifroboter, umfasst, insbesondere basierend auf der ermittelten Pose des Objekts (5).
8. Verfahren zum Greifen eines Objekts mit einem Greifroboter mit den Schritten:
- Ermitteln einer Griffposition (G) nach dem vorhergehenden Anspruch; und
- Greifen des Objekts (5) mit dem Greifroboter basierend der Griffposition (G).
9. System zur automatisierten Merkmalsextraktion und/oder zum Betreiben einer mehrachsigen Maschine, insbesondere eines Greifroboters, das zur Durchführung eines Verfahrens nach einem der vorhergehenden Ansprüche eingerichtet ist und/oder aufweist:
- einen Roboterarm und einen von dem Roboterarm geführten Greifer;
- wenigstens eine Aufnahmevorrichtung, wobei die Aufnahmevorrichtung insbesondere an einem Flansch das Roboterarms angeordnet ist;
- Mittel zum Ermitteln eines Deskriptorbilds.
10. Computerprogramm oder Computerprogrammprodukt, wobei das Computerprogramm oder Computerprogrammprodukt, insbesondere auf einem computerlesbaren und/oder nicht-flüchtigen Speichermedium gespeicherte, Anweisungen enthält, die bei der Ausführung durch einen oder mehrere Computer oder ein System nach Anspruch 9 den oder die Computer oder das System dazu veranlassen, ein Verfahren nach einem der Ansprüche 1 bis 7 und/oder 8 durchzuführen.
EP23809139.1A 2022-12-13 2023-11-15 Objektlagedetektion mit automatisierter merkmalsextraktion und/oder merkmalszuordnung Pending EP4634861A1 (de)

Applications Claiming Priority (5)

Application Number Priority Date Filing Date Title
DE102022213568.7A DE102022213568B3 (de) 2022-12-13 2022-12-13 Kalibrieren einer Steuerung
DE102022213555.5A DE102022213555A1 (de) 2022-12-13 2022-12-13 Objektlagedetektion mit automatisierter Merkmalsextraktion und/oder Merkmalszuordnung
DE102022213557.1A DE102022213557B3 (de) 2022-12-13 2022-12-13 Betreiben eines Roboters mit Greifer
DE102022213562.8A DE102022213562A1 (de) 2022-12-13 2022-12-13 Greifen mit Verpackungsmaterial
PCT/EP2023/081829 WO2024125918A1 (de) 2022-12-13 2023-11-15 Objektlagedetektion mit automatisierter merkmalsextraktion und/oder merkmalszuordnung

Publications (1)

Publication Number Publication Date
EP4634861A1 true EP4634861A1 (de) 2025-10-22

Family

ID=88838801

Family Applications (4)

Application Number Title Priority Date Filing Date
EP23808745.6A Pending EP4633876A1 (de) 2022-12-13 2023-11-15 Kalibrieren einer greifersteuerung
EP23809139.1A Pending EP4634861A1 (de) 2022-12-13 2023-11-15 Objektlagedetektion mit automatisierter merkmalsextraktion und/oder merkmalszuordnung
EP23808744.9A Pending EP4633875A1 (de) 2022-12-13 2023-11-15 Betreiben eines roboters mit greifer
EP23808746.4A Pending EP4633877A1 (de) 2022-12-13 2023-11-15 Greifen mit verpackungsmaterial

Family Applications Before (1)

Application Number Title Priority Date Filing Date
EP23808745.6A Pending EP4633876A1 (de) 2022-12-13 2023-11-15 Kalibrieren einer greifersteuerung

Family Applications After (2)

Application Number Title Priority Date Filing Date
EP23808744.9A Pending EP4633875A1 (de) 2022-12-13 2023-11-15 Betreiben eines roboters mit greifer
EP23808746.4A Pending EP4633877A1 (de) 2022-12-13 2023-11-15 Greifen mit verpackungsmaterial

Country Status (3)

Country Link
EP (4) EP4633876A1 (de)
CN (4) CN120344356A (de)
WO (4) WO2024125921A1 (de)

Family Cites Families (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2015089575A (ja) * 2013-11-05 2015-05-11 セイコーエプソン株式会社 ロボット、制御装置、ロボットシステム及び制御方法
EP3871172A1 (de) * 2018-10-25 2021-09-01 Berkshire Grey, Inc. Systeme und verfahren zum lernen zur extrapolation optimaler zielrouting- und handhabungsparameter
DE112019000125B4 (de) * 2018-10-30 2021-07-01 Mujin, Inc. Systeme, vorrichtungen und verfahren zur automatisierten verpackungsregistrierung
DE102021109036A1 (de) * 2021-04-12 2022-10-13 Robert Bosch Gesellschaft mit beschränkter Haftung Vorrichtung und verfahren zum lokalisieren von stellen von objekten aus kamerabildern der objekte

Also Published As

Publication number Publication date
CN120344357A (zh) 2025-07-18
WO2024125921A1 (de) 2024-06-20
WO2024125920A1 (de) 2024-06-20
CN120359544A (zh) 2025-07-22
EP4633877A1 (de) 2025-10-22
CN120359107A (zh) 2025-07-22
WO2024125919A1 (de) 2024-06-20
EP4633876A1 (de) 2025-10-22
WO2024125918A1 (de) 2024-06-20
CN120344356A (zh) 2025-07-18
EP4633875A1 (de) 2025-10-22

Similar Documents

Publication Publication Date Title
DE102015111080B4 (de) Robotervorrichtung mit maschinellem Sehen
DE102021107333A1 (de) 3d-stellungsabschätzung mit einer 2d-kamera
DE102019131261A1 (de) Robotermanipulation unter verwendung eines unabhängig betätigten visionssystems, eines gegensteuerschemas und einer multi-tasking-architektur für tiefgehendes lernen
DE102021121612A1 (de) System und verfahren zum aufnehmen von kisten von einem stapel
DE102019124810A1 (de) Bildverarbeitungsgerät und Bildverarbeitungsverfahren
DE102021107351A1 (de) System zur eigenschaftserkennung durch deep-learning und vektorfeldschätzung
DE112010002677T5 (de) Verfahren und vorrichtung zum bestimmen einer formübereinstimmung in drei dimensionen
DE102021107479A1 (de) Erfassung einer dreidimensionalen pose durch mehrere 2d-kameras
DE112020006594B4 (de) Maschinenlernverfahren und Robotersystem
DE102022106765B3 (de) Verfahren zum Bestimmen einer Lage eines Objekts relativ zu einer Erfassungseinrichtung, Computerprogramm und Datenträger
EP4536447A1 (de) Erhöhung der greifrate
DE102018205669A1 (de) Aufnehmen von Nutzlasten mittels eines robotergeführten Werkzeugs
EP3870406B1 (de) Verfahren zum erstellen eines objektmodells zum greifen eines objekts, computerlesbares speichermedium und robotersystem
WO2024125918A1 (de) Objektlagedetektion mit automatisierter merkmalsextraktion und/oder merkmalszuordnung
DE102022213555A1 (de) Objektlagedetektion mit automatisierter Merkmalsextraktion und/oder Merkmalszuordnung
DE102024104640B3 (de) Betreiben eines Roboters mithilfe einer Datenverarbeitung und Trainieren dieser Datenverarbeitung
EP4063081A1 (de) Verfahren zum ermitteln von steuerungsdaten für eine greifeinrichtung zum greifen eines gegenstands
DE102022212198B4 (de) Anpassung einer Greifsimulation durch Parameteridentifikation in der realen Welt
DE102016006232A1 (de) Verfahren und System zur Ausrichtung eines virtuellen Modells an einem realen Objekt
EP2059905A2 (de) Verfahren zur lagebestimmung von objeckten im dreidimensionalen raum
DE19506328C2 (de) Verfahren zur Erkennung der Position und Lage eines Objekts im dreidimensionalen Raum
DE102022213562A1 (de) Greifen mit Verpackungsmaterial
DE102023134599B3 (de) Vorrichtung und Verfahren zur bildbasierten Prüfung eines Kabelbaums
EP4141805A1 (de) Verfahren zum erzeugen, automatisierten annotieren und bereitstellen von trainings-bilddaten
DE102022124064A1 (de) Verfahren und System zur Erstellung eines Trainingsdatensatzes für ein maschinelles Lernverfahren unter Verwendung eines Roboters, Computerprogrammprodukt sowie Fahrzeug

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20250509

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR

P01 Opt-out of the competence of the unified patent court (upc) registered

Free format text: CASE NUMBER: UPC_APP_0011793_4634861/2025

Effective date: 20251031

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)