EP4659137A1 - Vorrichtung und verfahren zur automatisierten, dreidimensionalen bauwerksdatenmodellierung - Google Patents

Vorrichtung und verfahren zur automatisierten, dreidimensionalen bauwerksdatenmodellierung

Info

Publication number
EP4659137A1
EP4659137A1 EP24701692.6A EP24701692A EP4659137A1 EP 4659137 A1 EP4659137 A1 EP 4659137A1 EP 24701692 A EP24701692 A EP 24701692A EP 4659137 A1 EP4659137 A1 EP 4659137A1
Authority
EP
European Patent Office
Prior art keywords
point cloud
cloud data
building
data
infrastructure
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP24701692.6A
Other languages
English (en)
French (fr)
Inventor
Stephan Mönchinger
Robert Joost
Qinyuan Fan
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Original Assignee
Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV filed Critical Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Publication of EP4659137A1 publication Critical patent/EP4659137A1/de
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F30/00Computer-aided design [CAD]
    • G06F30/10Geometric CAD
    • G06F30/12Geometric CAD characterised by design entry means specially adapted for CAD, e.g. graphical user interfaces [GUI] specially adapted for CAD
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F30/00Computer-aided design [CAD]
    • G06F30/10Geometric CAD
    • G06F30/13Architectural design, e.g. computer-aided architectural design [CAAD] related to design of buildings, bridges, landscapes, production plants or roads
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F30/00Computer-aided design [CAD]
    • G06F30/20Design optimisation, verification or simulation
    • G06F30/27Design optimisation, verification or simulation using machine learning, e.g. artificial intelligence, neural networks, support vector machines [SVM] or training a model
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N20/00Machine learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/09Supervised learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V20/00Scenes; Scene-specific elements
    • G06V20/10Terrestrial scenes
    • G06V20/176Urban or other man-made structures
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V20/00Scenes; Scene-specific elements
    • G06V20/60Type of objects
    • G06V20/64Three-dimensional [3D] objects
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F30/00Computer-aided design [CAD]
    • G06F30/10Geometric CAD
    • G06F30/17Mechanical parametric or variational design
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/044Recurrent networks, e.g. Hopfield networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/045Combinations of networks
    • G06N3/0455Auto-encoder networks; Encoder-decoder networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/0464Convolutional networks [CNN, ConvNet]
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/0475Generative networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/092Reinforcement learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N5/00Computing arrangements using knowledge-based models
    • G06N5/01Dynamic search techniques; Heuristics; Dynamic trees; Branch-and-bound
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N7/00Computing arrangements based on specific mathematical models
    • G06N7/01Probabilistic graphical models, e.g. probabilistic networks

Definitions

  • the application relates to building data modelling, in particular to a device and a method for automated building data modelling.
  • BIM Building Information Modelling
  • the traditional methods of creating BIM models are divided into the following two main types: First, there is computer-aided 3D modeling, which mainly relies on basic measuring instruments such as laser rangefinders, digital cameras and tape measures to collect the dimensions of all building formations through manual measurements and uses commercial software (such as AutodeskRevit, Auto-CAD, 3DS MAX, etc.) to perform modeling based on the measurement parameters.
  • the other is generating BIM models based on early industrial design drawings, e.g., using the original 2D design drawings of the building as a reference and generating BIM models based on the drawing parameters (see [4]).
  • Fig. 2 shows traditional BIM construction methods.
  • Fig. 3 shows advanced BIM construction methods in a point cloud workflow.
  • Fig. 3 shows the workflow of today's point cloud generation and processing.
  • the novel approach to the BIM creation process is highlighted with a dotted line in Fig. 3.
  • Meshing is a well-known standard process.
  • the point cloud generation is described below.
  • point clouds are essential in this advanced BIM construction method.
  • Video image processing which is initially based on the "Structure from Motion" (SfM) technique to obtain sparse point cloud data, from which dense point clouds can then be obtained by processing.
  • SfM Structure from Motion
  • feature extraction is described. This is described, for example, in references [14] to [29].
  • the algorithms used in the feature extraction step can be divided into two categories, feature point detectors, which determine the position of feature points in the image, and feature point descriptors, which generate vectors or strings to describe the feature points detected by the feature point detectors.
  • Feature points are some special points in the image data that have certain special properties and more information than ordinary points and can be used to describe the key information in the image based on these feature points. Once the feature points and their descriptions are known, the correspondence of these points in different images can be adopted for subsequent algorithms.
  • the goal of this step is to find the camera parameters for each pair of images using the feature points of each image pair, both intrinsic (i.e., focal length and radial aberration) and extrinsic (i.e., rotation and translation) parameters.
  • intrinsic i.e., focal length and radial aberration
  • extrinsic i.e., rotation and translation
  • two matrices can be used to describe the correspondence between the matching feature points of the image pair, namely the essential matrix and fundamental matrix [53] .
  • the essential matrix [53] contains the extrinsic parameters that describe the correspondence between matching feature points in camera coordinates
  • the fundamental matrix [53] contains the intrinsic and extrinsic parameters that describe the correspondence between matching feature points in pixel coordinates.
  • the five-point algorithm is used to calculate the extrinsic parameters
  • the eight-point algorithm is used to calculate the intrinsic and extrinsic parameters.
  • the five-point algorithm is more suitable when the intrinsic parameters are known and the goal is to calculate extrinsic parameters
  • the eight-point algorithm is more suitable when the goal is to calculate both extrinsic and intrinsic parameters.
  • Direct linear transform (DLT) uses feature points in pixel coordinates and corresponding 3D points in absolute coordinates in the scene to calculate intrinsic and extrinsic parameters based on the least squares method, while the five- and eight-point algorithms do not require 3D points in absolute coordinates in the scene.
  • the goal of this step is to correct the camera parameters of each image to reduce the error in reprojection.
  • the intrinsic and extrinsic camera parameters for each image from the Motion Estimation section and the 3D positions of the points in the point cloud from the previous step are used to generate the exact camera parameters of each image and the exact 3D positions of the points in the point cloud.
  • the above steps in point cloud generation result in a complete dense point cloud from the raw data of the underlying scene. This can then be processed to obtain the final 3D model.
  • the 3D models are divided into three main types: tessellated (networked) models, point cloud models and geometric models.
  • the requirements for 3D models vary in different scenarios. In industry, geometric models are mainly used due to the high requirements for model accuracy. Geometric models are more versatile and can be easily converted into the other two 3D models.
  • 3D BIM is a typical format of geometric models.
  • the generated point cloud contains not only the target object information but also other point cloud data of the environment, which may be an obstacle to the further application of the point cloud. Therefore, according to the current state of research, preprocessing of point clouds, segmentation of point clouds and modeling of point clouds are essential to to meet the application requirements for converting point clouds into geometric models.
  • this step is to create a point cloud model or to generate a high-quality point cloud for the subsequent steps.
  • this step consists of four sub-steps, namely alignment, noise filtering, outlier removal and downsampling. Which of the four sub-steps is used depends on the application requirements and the quality of the point cloud.
  • point cloud segmentation is described. This is presented in references [54] and [58] - [62]. The goal of this step is to segment the point cloud to obtain the points of the object of interest.
  • the algorithms used in the publications differ slightly from each other, the traditional algorithms mainly used today for point cloud segmentation can be divided into two categories, namely feature-based segmentation algorithms and model-based segmentation algorithms.
  • Feature-based segmentation algorithms segment a point cloud based on the features of each point in the cloud by classifying points with the same features into a subgroup.
  • Model-based segmentation algorithms segment a point cloud based on a mathematical model of the object under consideration, where the mathematical model used in model-based segmentation is usually a plane equation, which can usually be mathematically parameterizable geometries such as plane, cylinder, torus, etc.
  • point cloud modeling is described. This is presented in [56] and [63].
  • the goal of this step is to create a geometric model of the object under consideration using the segmented point cloud segments from the previous step.
  • the model parameters should be determined based on the results of point cloud segmentation.
  • the method of determining the model parameters is generally to determine the dimensions of the object.
  • the radius of a cylindrical pipe is one of its model parameters and can be determined by calculating the shortest distance between the centerline and the point cloud of the pipe obtained from point cloud segmentation [56], alternatively perpendicularly by projecting the point cloud of the pipeline onto a plane to the centerline of the pipeline to generate a resulting circle and calculate the radius of the circle (see [46] and [64]).
  • the model parameters a geometric model of the target object can be easily constructed.
  • a device for creating a digital model of an existing building or an existing industrial plant or an existing infrastructure comprises an input unit for providing point cloud data representing the building or the industrial plant or the infrastructure. Furthermore, the device comprises a processing unit which comprises an artificial intelligence module for creating the model depending on the point cloud data, wherein the artificial intelligence module is trained by means of machine learning.
  • a method for creating a digital model of an existing building or an existing industrial plant or an existing infrastructure comprises:
  • Embodiments aim to solve the above problems, improve the automation and accuracy of construction of existing BIM, and achieve a perfect combination of the advantages between 3D scanning technology and BIM technology.
  • Embodiments mainly concern the point cloud processing phase, while the prior art concerns the point cloud generation and application phase.
  • embodiments relate to the process of converting point clouds into geometric models.
  • the efficiency and accuracy of the process of converting point clouds into geometric models will significantly improve and make it possible to automate the process.
  • Embodiments provide semantic segmentation to remove the influence of ambient noise from the point cloud data.
  • object-level segmentation of point cloud targets is performed by instance segmentation to obtain geometric and positional parameters of the target object, e.g., rooms, furniture, walls.
  • a database is extended by converting existing geometric models into point cloud data to achieve better segmentation accuracy.
  • Fig. 1 shows a device for creating a digital model of an existing building or an existing industrial plant or an existing infrastructure according to an embodiment.
  • Fig. 2 shows traditional BIM construction methods.
  • Fig. 3 shows advanced BIM construction methods in a point cloud workflow.
  • Fig. 4 a target building scene with point cloud noise containing environmental information after point cloud registration.
  • Fig. 5 shows different method and group approaches for semantic segmentation of point clouds.
  • Fig. 6 shows a state after removing ambient noise information.
  • Fig. 7 shows the target object without any other buildings.
  • Fig. 8 shows different methods for instance segmentation of point clouds.
  • Fig. 9 shows a flow of a feedback process.
  • Fig. 10 shows an extraction of boxes from a point cloud according to a
  • Embodiment to obtain training data Embodiment to obtain training data.
  • Fig. 11 shows a visualization of the data augmentation according to a first embodiment.
  • Fig. 12 shows a visualization of the data augmentation according to a second embodiment.
  • Fig. 1 shows a device for creating a digital model of an existing building or an existing industrial plant or an existing infrastructure according to an embodiment.
  • the device comprises an input unit 110 for providing point cloud data representing the building or industrial plant or infrastructure. Furthermore, the device comprises a processing unit 120, which comprises an artificial intelligence module 125 for creating the model depending on the point cloud data, wherein the artificial intelligence module 125 is trained by means of machine learning.
  • An infrastructure can be, for example, a train station, a platform, a bridge, or another type of infrastructure.
  • the input unit 110 can be designed, for example, to receive two or more point cloud partial data sets, each representing a partial area of the building or a partial area of the industrial plant or a partial area of the infrastructure.
  • the input unit 110 can be designed, for example, to generate the point cloud data representing the building or the industrial plant or the infrastructure from the two or more point cloud data.
  • the input unit 110 can be configured, for example, to receive sensor data from one or more cameras and/or from one or more laser scanners and/or from one or more depth cameras.
  • the input unit 110 can be configured, for example, to determine the point cloud data and a portion of the point cloud data depending on the sensor data; or wherein the sensor data comprises the point cloud data or a portion of the point cloud data.
  • the processing unit 120 may, for example, be configured to detect the data in the point cloud data that do not represent the building or the industrial plant or the infrastructure and/or that are located outside the building or the industrial plant or the infrastructure. For example, these detected data that do not represent the building or the industrial plant or the infrastructure may be subsequently removed (e.g., if necessary).
  • the processing unit 120 may, for example, be configured to determine boundaries of the building or industrial plant or infrastructure in order to detect the data in the point cloud data that lie outside the building or industrial plant or infrastructure.
  • the point cloud data may contain information about surfaces of the building or industrial plant or infrastructure and Include information about the interior of the building or industrial plant or infrastructure.
  • the processing unit 120 may, for example, be configured to process the point cloud data such that one or more subsets of the point cloud data are classified such that the one or more subsets are each assigned to one of one or more object categories.
  • the one or more object categories may include, for example, one or more building part types.
  • the processing unit 120 may, for example, be configured to carry out the classification in such a way that it comprises a first instance segmentation that classifies at least a subset of the one or more subsets of the point cloud data in such a way that it is classified as one of the one or more building part types of the building or the industrial plant or the infrastructure.
  • the one or more building part types can be freely defined, for example, by a developer.
  • a developer is, for example, a user who configures the device.
  • the one or more building part types may, for example, include one or more of the following building part types: a roof, an exterior wall, an exterior door, an exterior window, an interior space, a stairwell, an elevator shaft, or another type of building part type.
  • the one or more object categories may, for example, comprise one or more spatial structure types.
  • the processing unit 120 may, for example, be configured to carry out the classification in such a way that it comprises a second instance segmentation that classifies at least a subset of the one or more subsets of the point cloud data in such a way that it is classified as a spatial structure from the one or more spatial structure types of a room of the building or industrial plant or infrastructure.
  • the one or more spatial structure types can be freely definable, for example, by a developer.
  • a developer is, for example, a user who configures the device.
  • the one or more spatial structure types may include, for example, one or more of the following spatial structure types: a wall, a ceiling, a floor, a door, a window, furniture, or another type of spatial structure type.
  • the processing unit 120 may, for example, be configured to classify the one or more subsets of the point cloud data such that classification is performed using the artificial intelligence module 125, which is trained by means of machine learning and which is configured to receive the point cloud data as input data.
  • the artificial intelligence module 125 may be trained using supervised deep learning, for example.
  • the artificial intelligence module 125 can be designed, for example, to perform the classification in a projection-based and/or discretization-based and/or point-based manner.
  • the artificial intelligence module 125 may, for example, comprise a deep learning neural network having at least two hidden layers (e.g., at least two inner layers, i.e., layers that do not have input and output nodes).
  • the artificial intelligence module 125 may, for example, comprise a recurrent neural network for determining one or more features of a portion of the point cloud data.
  • the artificial intelligence module 125 may be trained, for example, by means of machine learning by assigning a first point cloud to an object category of the one or more object categories, and wherein the first point cloud and the said object category were used as a first training data set for the artificial intelligence module 125.
  • object classes or categories are open or freely definable.
  • the artificial intelligence module 125 can be trained, for example, by means of machine learning by processing the first point cloud one or more times was modified to obtain one or more modified point clouds, wherein each of the one or more modified point clouds and the said object category were used as a further training data set from one or more further training data sets.
  • the first point cloud may have been modified one or more times, for example, by applying translation dithering and/or rotation and/or random scaling and/or elastic deformation of the first point cloud.
  • the point cloud data may be, for example, three-dimensional point cloud data.
  • the processing unit 120 may, for example, be configured to map the three-dimensional point cloud data to two-dimensional point cloud data and to classify the one or more subsets of the point cloud data using the two-dimensional point cloud data.
  • the point cloud data can be, for example, three-dimensional point cloud data.
  • the processing unit 120 can, for example, be designed to assign the three-dimensional point cloud data to a plurality of voxels and to assign the point cloud data to the plurality of voxels depending on the assignment.
  • the processing unit 120 may, for example, be configured to create a virtual construction plan depending on the classification of the one or more subsets of the point cloud data.
  • the processing unit 120 may, for example, be configured to create a three-dimensional building data model depending on the classification of the one or more subsets of the point cloud data.
  • Embodiments relate to an apparatus and a method for the automated creation of digital parametric geometric models for existing buildings and industrial facilities and infrastructures. Embodiments can be applied to building information modeling (BIM models), digital factories, digital twins and others.
  • the input data for a device according to the invention are point cloud data of a complete scene containing the target object.
  • the input data is then processed by various artificial intelligence models tailored to the user's situation and based on different devices, resulting in the automatic creation of a digital parameterized geometric model.
  • the entered point cloud data can be in any format.
  • a focus of some embodiments is the processing of point cloud data with real-time character.
  • This point cloud data can be acquired with a variety of environment-specific sensor devices, including, but not limited to, high-resolution cameras, laser scanners or depth cameras, etc. These sensors can also be operated via various media such as mobile robots and drones and data can be acquired efficiently.
  • point cloud data it is not possible to acquire all point clouds of an object at once because the sensors are limited and the target object is a large scene such as a building or a factory. It is therefore necessary to acquire sub-scenes of the target object according to sub-areas of the target building. The sub-scenes should then be registered several times (point cloud registration) to obtain the complete scene.
  • this complete point cloud data contains a lot of information other than the target object, e.g. trees, vehicles, pedestrians, facades of surrounding houses, and park and street scenes, as shown in Fig. 4.
  • Fig. 4 shows a target building scene with point cloud noise containing environmental information after point cloud registration.
  • the point cloud data other than the target building are redundant, i.e. point cloud noise can also occur.
  • An advantageous embodiment is to achieve the elimination of point cloud information that does not correspond to the category of the target object by means of a scene-level 3D point cloud segmentation algorithm, i.e. semantic segmentation.
  • Point cloud semantic segmentation generates semantic information for each point in the point cloud data, which is achieved through supervised learning methods, so that the classification of point cloud data into subsets based on the semantic information of the points and the classification of different target object categories can be achieved.
  • Point cloud segmentation includes both "regular" supervised machine learning and modern deep learning, where regular supervised machine learning refers to algorithms that do not belong to deep supervised learning.
  • PCSS point cloud semantic segmentation
  • PCSS statistical context model such as Associative and Non-Associative Markov Networks [74-76], Conditional Random Fields [77-81], Simplified Markov Random Fields [82], Multi-stage inference method using point cloud statistics and learning relational information over fine and coarse scales [83], and a Spatial inference engine framework that models mid-range and long-range dependencies in the data [84],
  • neighborhood selection, feature extraction, feature selection, and semantic segmentation [85] Since individual PCSS does not consider contextual features (with neighboring points) of points, individual classifiers, although they can work effectively, will inevitably generate noise, resulting in uneven PCSS results.
  • Statistical context models can alleviate this problem.
  • Deep learning-based PCSS can be used to obtain high-dimensional features from the training data using more than two hidden layers and then process them, while traditional handcrafted features are designed with domain-specific knowledge.
  • PCSS for semantic segmentation based on deep learning there are a total of four paradigms: projection-based approaches, discretization-based approaches, point-based approaches, and hybrid approaches [86].
  • projection-based approaches discretization-based approaches
  • point-based approaches point-based approaches
  • hybrid approaches there are different procedures under different methods.
  • the features of the target object point cloud can be identified in different ways and aligned for relatively correct segmentation mainly by changing the structure of the (neural) deep learning network.
  • Projection-based approaches typically involve projecting a 3D point cloud onto a 2D image, including multi-view images and spherical images, i.e., multi-view representation method and spherical representation method.
  • multi-view representation method There are several methods for multi-view representation method, one of which allows to first project a 3D point cloud from multiple virtual camera views onto a 2D plane, and then a multi-stream fully convolutional network (FCN) is used to predict pixel-wise scores on synthetic images. The final semantic label for each point is obtained by merging the reprojected scores over different views [87],
  • FCN fully convolutional network
  • the final semantic label for each point is obtained by merging the reprojected scores over different views [87].
  • multiple RGB and depth snapshots of a point cloud are taken using multiple camera locations [88], and then pixel-wise labeling of these snapshots is performed using 2D segmentation networks.
  • tangent convolution can be introduced for the segmentation of dense point clouds, which is based on the assumption that the point cloud is sampled from a local Euclidean surface.
  • This method first projects the local surface geometry around each point onto a virtual tangent plane.
  • the tangent convolution is then applied directly to the surface geometry.
  • This method has good scalability and enables the processing of large amounts of point clouds with millions of points [90].
  • the performance of multi-view segmentation methods depends on the selection of the viewpoint and the occlusion of the viewpoint.
  • these methods do not fully exploit the underlying geometric and structural information because the projection step inevitably leads to information loss.
  • There are also different methods for the spherical representation method one of which is an end-to-end network based on SqueezeNet [91] and Conditional Random Fields (ORF)
  • Another method first transfers the semantic labels from 2D range images to 3D point clouds, using an efficient GPU-enabled KNN-based post-processing step to reduce the problem of discretization errors and fuzzy inference results
  • Discretization-based approaches typically convert a point cloud into a dense/sparse discrete
  • representation method e.g. into volumetric and sparse permutohedral grids.
  • dense discretization representation one method is to first divide the point cloud into a set of occupancy voxels and then feed this cached data into a full 3D CNN for voxel-wise segmentation [95]. Finally, all point distributions within each voxel are summarized into a compact latent region. Finally, all points within a voxel are assigned the same semantic label as the voxel (the performance of this method is demonstrated by the granularity of the voxels and the boundary artifacts are severely limited due to the partitioning of the point cloud).
  • Another approach is to introduce a deterministic trilinear interpolation to map the coarse voxel predictions generated by 3D fully convolutional networks (3D-FCNN) [96] back to the point cloud, and then use a fully connected conditional random field (CRF) or fully connected CRF (FCCRF) to enforce the spatial consistency of these derived perpoint labels, enabling fine-grained and globally consistent semantic segmentation [97].
  • CRF conditional random field
  • FCCRF fully connected CRF
  • the third approach is to encode the local geometric structures within each voxel via a kernel-based interpolated variational autoencoder architecture [98]. Instead of a binary occupancy representation, RBFs are used for each voxel to obtain a continuous representation and capture the distribution of points in each voxel.
  • Variational Auto Encoders are further used to map the point distribution within each voxel to a compact latent region. Then, both symmetry groups and an equivalence CNN are used to achieve robust feature learning.
  • a fourth method is to first hierarchically infer geometric relationships at different levels of point clouds and then use 3D convolution and weighted mean pooling to extract features and incorporate long-range dependencies. This method can handle large point clouds and has good scalability in the inference process (It is called Fully-Convolutional Point Network FCPN) [99], The fifth method takes advantage of the scalability of the fourth method (FCPN) and can adapt to different input data sizes during training and testing.
  • a coarse-to-fine strategy was used to hierarchically improve the resolution of the predicted results so that the 3D scans could be completed and semantic labels could be made per voxel [100].
  • the first three methods voxelize the point cloud into a dense grid and then used standard 3D convolution.
  • the last two methods are volume-based 3D convolutional neural networks (3D-CNN), which are also volumetric representations (however, the voxelization step inevitably leads to discretization artifacts and information loss. High resolution leads to high storage and computational costs, while low resolution leads to a loss of detail).
  • the volumetric representation is inherently sparse because the number of non-zero values is only one small percentage, making it inefficient to apply dense convolutional neural networks to spatially sparse data.
  • One method is a sparse submanifold convolutional network based on an indexing structure. This method significantly reduces the memory and computational costs by restricting the output of the convolution to the occupied voxels.
  • sparse convolution allows control over the sparsity of the extracted features. This sparse submanifold convolution is suitable for the efficient processing of high-dimensional and spatially sparse data [101].
  • Another method is a 4D spatiotemporal convolutional neural network for 3D video perception, which uses a generalized sparse convolution to efficiently process high-dimensional data and also uses a trilateral-stationary conditional random field to enforce consistency [102].
  • a third method uses the Sparse Lattice Networks (SPLATNet) based on Bilateral Convolution Layers (BCLs), in which the original point cloud is first interpolated into a permutohedral sparse lattice, then BCL is applied to convolve the occupied part of the sparse grid, and the filtered output is then interpolated back to the original point cloud, which enables flexible joint processing of images and point clouds with multiple views.
  • the fourth method uses fast mesh convolution by embedding local geometry in a permutohedral sparse mesh, keeping the memory footprint low and introducing a novel interpolation module as data is learned to project mesh features back into the point cloud [104],
  • Hybrid approaches are used to learn multimodal features from 3D scans using a number of methods.
  • One method uses a 3D CNN stream and multiple 2D streams to extract features, and a differentiable backprojection layer is used to jointly fuse the learned 2D embeddings and 3D geometric features, which is a joint 3D multi-view network to combine RGB features and geometric features [105]
  • Another method is a unified point-based framework that learns 2D texture features, 3D structures, and global context features from point clouds and directly applies a point-based network to extract local geometric features and global context from a sparsely sampled point set without voxelization [106]
  • Another The method is a Multi-View PointNet to aggregate appearance features from 2D multi-view images and spatial geometric features in the canonical point cloud space [107],
  • PointNet In point-based approaches, point clouds are disordered and unstructured, so the direct application of standard CNNs is not possible. Therefore, the pioneering work PointNet [108] was developed, which uses shared multilayer perceptrons (MLPs) to learn per-point features and uses symmetric pooling functions to learn global features.
  • MLPs shared multilayer perceptrons
  • a series of point-based networks are developed on the basis of PointNet. In general, these methods can be roughly classified into pointwise MLP methods, point convolution methods, RNN-based methods, and graph-based methods. Point-based pointwise MLP methods use shared MLPs as the basic units of their networks to achieve high efficiency (point-like features extracted by a shared MLP, however, do not capture the local geometry and interactions between points in a point cloud [108]).
  • To capture a broader context for each point and learn richer local structures several special networks were introduced, including methods based on neighboring feature pooling, attention-based aggregation, and local-global feature aggregation.
  • Point-based pointwise MLP methods based on attention-based aggregation have several methods to capture local geometric patterns, which learn a feature for each point by aggregating the information from local neighbor points.
  • PointNet++ hierarchically clusters points in multiple scales and multi-resolution clustering to overcome the problems caused by the non-uniformity and different density of the point cloud, and learns progressively from larger local regions [109], Besides, there is a method that stacks and encodes information from eight spatial orientations through a three-stage ordered convolution.
  • Multiscale features are concatenated to achieve adaptability to different scales for orientation encoding and scale awareness [110]
  • Another method different from the clustering technique used in PointNet++ i.e., sphere query
  • K-means clustering and KNN uses K-means clustering and KNN to define two neighborhoods in space and feature space separately. Based on the assumption that points of the same class are expected to be closer to each other in the feature space, a pairwise distance loss and a centroid loss are introduced to further regularize feature learning [111],
  • the fourth method uses an Adaptive Feature Adjustment (AFA) module to achieve information exchange and feature refinement.
  • AFA Adaptive Feature Adjustment
  • the fifth method is a permutation-invariant convolution based on the statistics of concentric spherical shells.
  • a set of concentric spheres is first queried with multiscale, then the max-pooling operation within different shells is used to summarize the statistics, and MLPs and 1 D convolution are used to obtain the final convolution output [113],
  • the sixth method is an efficient lightweight network for large point cloud segmentation.
  • the network uses random point sampling and achieves significant efficiency in terms of memory and computation.
  • this network has a local feature aggregation module to capture and obtain geometric features [114],
  • point-based pointwise MLP methods based on attention-based aggregation [115] are introduced.
  • One method is to model the relationship between the points by group shuffle attention, where a permutation-invariant, task-independent and discriminable Gumbel Subset Sampling (GSS) replaces the widely used FPS approach.
  • GSS Gumbel Subset Sampling
  • This module is less sensitive to outliers and allows the selection of a representative subset of points [116], Another method is to better capture the spatial distribution of point clouds by learning spatial awareness weights through a Local Spatial Aware (LSA) layer based on the spatial arrangement and local structure of the point clouds [117], Another method, similar to Conditional Random Fields (CRF), uses an Attention-based Score Refinement (ASR) module to post-process the segmentation results generated by the network. The original segmentation result is refined by merging the scores of the neighboring points with learned attention weights.
  • LSA Local Spatial Aware
  • ASR Attention-based Score Refinement
  • This module can be easily integrated into existing deep networks to To improve segmentation performance [118], Third point-based pointwise MLP methods based on local-global features have a method that uses four repeatedly stacked encoders, where each encoder has two basic components Edgeconv [119] and NetVLAD [120] to capture local information and global features at the scene level to incorporate the local structure and global context of the point cloud [121],
  • Point-based point convolution methods tend to propose effective convolution operators for point clouds.
  • One method may use a pointwise convolution operator, which can bin neighboring points into kernel cells and then convolve them with kernel weights [122]
  • Another approach can be achieved by using parametric kernel functions that cover the entire continuous vector space and enable parametric continuous convolution (PCCN) that can be learned on any data structure whose support relations are computable [123]
  • Another method is a Kernel Point Fully Convolutional Network based on Kernel Point Convolution (KPConv) [124], Specifically, the convolution weights of KPConv are determined by the Euclidean distances to the kernel points, and the number of kernel points is not fixed.
  • the positions of the kernel points are formulated as a best coverage optimization problem in a sphere space. Note that the radius neighborhood is used to obtain a consistent receptive field, while subsampling of the grid in each layer is used to achieve high robustness under varying densities of point clouds.
  • the next method aggregates dilated neighboring features instead of K-nearest neighbors using a Dilated Point Convolution (DPC) operation. This method proved to be very effective in increasing the receptive field and can be easily integrated into existing aggregation-based networks [125].
  • DPC Dilated Point Convolution
  • RNN Recurrent Neural Networks
  • CU Consolidation Units
  • RCU Recurrent Consolidation Units
  • the graph-based method and the point-based approach to capture the underlying shapes and geometric structures of 3D point clouds.
  • One such method is to represent the point cloud as a set of interconnected simple shapes and superpoints and use an attributive directed graph (i.e., the superpoint graph) to capture the structure and context information.
  • the problem of segmenting large point clouds is then divided into three subproblems, namely, geometrically homogeneous segmentation, superpoint embedding, and contextual segmentation [131].
  • Another method optimizes the partitioning step of the previous methods by using a supervised framework to over-segment the point cloud into pure superpoints. This problem is formulated as a deep metric learning problem structured by an adjacency graph.
  • a graph-structured contrastive loss is proposed to support the detection of boundaries between objects [132].
  • the third method enables a better capture of local geometric relationships in high-dimensional space by a
  • PyramNet which is based on the Graph Embedding Module (GEM) and the Pyramid Attention Network (PAN) [133].
  • GEM Graph Embedding Module
  • PAN Pyramid Attention Network
  • the GEM module formulates the point cloud as a directed acyclic graph and uses a covariance matrix to replace the Euclidean distance for constructing the neighbor similarity matrix, and in the PAN module, four different convolution kernels are used to extract features with different semantic intensities [133],
  • the relevant features are selectively learned from a local neighborhood set by Graph Attention Convolution (GAC). This process is achieved by dynamically assigning attention weights to different neighboring points and feature channels based on the spatial positions and feature differences.
  • GAC Graph Attention Convolution
  • PointGCR Point Global Context Reasoning
  • PointGCR is a plug-and-play and end-to-end trainable module and can be easily integrated into an existing segmentation network to improve performance [135]
  • semantic segmentation of point clouds under weak supervision such as a two-stage approach to train a segmentation network with subcloud level labels [136] and a network that can be trained with partially labeled points (e.g., 10%) for an inaccurate supervised method for semantic segmentation of point clouds [137],
  • Fig. 5 shows different method of approaches and group for semantic segmentation of point clouds (Point Cloud Semantic Segmentation, PCSS).
  • Fig. 5 shows the different method of approaches and group for semantic segmentation of point clouds.
  • Embodiments include, but are not limited to, the above-mentioned methods and procedures to provide the first Step of removing ambient noise information from the 3D point clouds that does not match the category of the target object.
  • Fig. 6 shows the result of performing this step according to embodiments.
  • Fig. 6 shows the result after removing environmental noise information that is not the category of the target object by PCSS.
  • Point clouds of the same category (buildings) can be determined using the method described above.
  • Some embodiments allow automatic noise reduction based on the density and distances of the point clouds using a clustering algorithm at certain distances or a histogram statistic of the x-, y- and z-axis coordinates of the point clouds.
  • the results can be seen in Fig. 7, where the extraction of the target building is achieved.
  • Fig. 7 shows the target object without any other buildings.
  • the extraction of the target buildings there is a very small accuracy error due to the semantic segmentation.
  • another effective implementation of some embodiments is to extract the boundaries of the different views of the target building and then use the boundary information to segment the original point cloud data so that the point cloud data of the target building can be obtained without errors.
  • Another advantageous embodiment consists in the instance segmentation of point clouds (Point Cloud Instance Segmentation, PCIS) of the entire target building or factory, where the targets of the instance segmentation are mainly stairwells, elevator shafts, interior rooms and exterior walls of the target building, and the doors and windows on the exterior walls of the target building.
  • PCIS Point Cloud Instance Segmentation
  • This method first eliminates the influence of stairwells and elevator shafts on the determination of the floor heights, then the floor heights and roof heights of each floor of the entire building or factory are determined from the heights of the interior rooms. Subsequently, the point clouds of the windows and doors on the exterior walls are used to obtain the geometric parameters and positions of the windows and doors.
  • another advantageous embodiment is the PCIS of the different rooms of a house or factory, such as walls, different pieces of furniture (chairs, tables, cabinets, PCs, etc.) and machine tools, material, etc. in the factory.
  • This is the main step of the fourth Step of an embodiment, which then allows the determination of the geometric parameters and the position of these objects using our algorithms and later using the algorithms of this embodiment the reconstruction of a highly detailed geometric model, such as BIM, CAD, etc.
  • the proposal-based method transforms the problem of instance segmentation into two subtasks: 3D object detection and instance mask prediction.
  • One method is to use a 3D fully-convolutional Semantic Instance Segmentation (3D-SIS) to perform semantic instance segmentation for RGB-D scans. This network learns from both color and geometric features. Similar to 3D object detection, a 3D Region Proposal Network (3DRPN) and a 3D Region of Interesting (3D- Rol) layer are used to predict bounding box positions, object class labels and instance masks [138].
  • 3D Region Proposal Network 3D Region Proposal Network
  • 3D- Rol 3D Region of Interesting
  • Another method follows the analysis-by-synthesis strategy to generate 3D proposals with high objectivity using a Generative Shape Suggestion Network (GSPN) via a synthetic analysis [139].
  • GSPN Generative Shape Suggestion Network
  • R-PointNet Region-based PointNet
  • the final label is determined by predicting a binary mask per point for each class label.
  • This method removes a large amount of meaningless proposals by forcing a geometric understanding.
  • Another method is the Implementation of an online 3D volumetric mapping system by extending 2D panoptic segmentation to 3D mapping to jointly achieve large-scale 3D reconstruction, semantic labeling and instance segmentation. The method first uses 2D semantic and instance segmentation networks to obtain pixel-wise panoptic labels, and then integrates these labels into the volumetric map. A fully linked Conditional Random Fields (CRF) is further used to achieve accurate segmentation.
  • CRF Conditional Random Fields
  • a fourth method proposes a one-stage, anchor-free and end-to-end trainable network called 3D-BoNet to achieve instance segmentation on point clouds.
  • This method directly regresses coarse 3D bounding boxes for all potential instances and then uses a point-level binary classifier to obtain instance labels.
  • the task of generating bounding boxes is formulated as an optimal matching problem.
  • a multi-objective loss function is proposed to regularize the generated bounding boxes.
  • This method requires no post-processing and is computationally efficient [141].
  • the fifth method is a network for instance segmentation of large-scale outdoor LiDAR point clouds.
  • This method learns a bird's eye view feature representation of point clouds using self-attention blocks.
  • the final instance labels are determined based on the predicted horizontal center and elevation boundaries [142].
  • the sixth method is the layout prediction of an indoor 3D room using a hierarchy-aware Variational Denoising Recursive AutoEncoder (VDRAE).
  • VDRAE Variational Denoising Recursive AutoEncoder
  • the object predictions are generated iteratively and refined by recursive context aggregation and propagation [143].
  • the proposed methods [138,139,141,144] are intuitive and simple, and the instance segmentation results are usually of good objectivity. However, these proposed methods require multi-stage training and filtering out redundant proposals. Therefore, they are usually time-consuming and computationally intensive.
  • Proposal-free methods do not have proposal generation, i.e. no module for predicting objects. Instead, they consider Instance segmentation is usually performed as a subsequent clustering step after semantic segmentation.
  • most existing methods are based on the assumption that points belonging to the same instance should have very similar features. Therefore, these methods mainly focus on learning discriminatory features and grouping points.
  • most existing methods are based on the assumption that points belonging to the same instance should have very similar features. Therefore, these methods mainly focus on learning discriminatory features and grouping points.
  • One method is Similarity Group Proposal Network (SGPN). This method first learns a feature and a semantic map for each point, and then introduces a similarity matrix to represent the similarity between each pair of features.
  • SGPN Similarity Group Proposal Network
  • a double-hinge loss is used to mutually adapt the similarity matrix and the semantic segmentation results.
  • a heuristic and non-maximum suppression method is employed to cluster similar points into instances. Since the construction of a similarity matrix requires a large memory footprint, the scalability of this method is limited [145], The second method uses sparse convolution [101] of submanifolds to predict semantic values for each voxel and the affinity between neighboring voxels. A clustering algorithm is then used to group points into instances based on the predicted affinities and the network topology [146], Another method uses a structure-aware loss for learning discriminatory embeddings.
  • An attention-based graph CNN has further been used to adaptively refine the learned features by aggregating different information from neighbors [147], Since the semantic category and the instance label of a point are usually interdependent, several methods have been proposed to combine these two tasks into a single task.
  • One approach is to integrate the two tasks by introducing an end-to-end and learning module for associative instance and semantic segmentation (ASIS).
  • ASIS associative instance and semantic segmentation
  • JSNet Another novel combined Method to implement instance and semantic segmentation is JSNet [149]
  • An alternative method is the MultiTask Pointwise Network (MT-PNet) to assign a label to each point and regularize the embeddings in the feature space by introducing a discriminatory loss [150], Then it merged the predicted semantic labels and embeddings with a Multi-Value Conditional Random Field (MV-CRF) model for joint optimization. Finally, variational mean field inference is used to generate semantic labels and instance labels [151],
  • DDG Dynamic Region Growing
  • DRG Dynamic Region Growing
  • Multi-stage segmentation of the patches is then performed using context information between the patches. Finally, these labeled patches are merged at object level to obtain final semantic labels and instance labels [152], Another method to achieve instance segmentation in full 3D scenes is to use a hybrid 2D-3D network to jointly learn global consistent instance features from a BEV representation and local geometric features from point clouds. The learned features are then combined to achieve semantic and instance segmentation [153], Another method is to learn the abstract feature embedding of each instance and the direction information of the instance center for each voxel. Feature embedding loss and direction loss are proposed to adapt the learned feature embeddings in the latent feature space.
  • Mean-shift clustering and nonmaximum suppression are employed to group voxels into instances [154],
  • the other method consists of a semantic segmentation branch and offset prediction branch.
  • a dual-set clustering algorithm and the ScoreNet are further used to achieve better clustering results [155].
  • a semantic superpoint tree (SST) is constructed from the semantic features of the learned superpoints, which is then traversed and segmented at the nodes of the intermediate tree to propose object instances.
  • This method is complemented by a refinement module CliqueNet to clean up the superpoints that could be wrongly classified as instance proposals [156],
  • Fig. 8 shows various methods for point cloud instance segmentation (PCIS). Embodiments include the above-mentioned Methods and procedures related to algorithms that should implement object-level instance segmentation.
  • the database of the segmentation algorithm in different steps can also be expanded by building a point cloud database from existing geometric models, which can be used to improve the segmentation accuracy of the algorithm.
  • the algorithm according to the invention is able to determine the geometric parameters, the position and orientation of an object in the interior of the building as well as the individual walls, windows and doors of the building, e.g. the thickness of the walls, the start and end points, etc. With these parameters, it is possible to build interfaces to various drawing software programs and then automate the modeling according to the procedures of the drawing software.
  • Fig. 9 shows a sequence of the feedback process.
  • the software should be accessible to end users, for example, through a simple installation option.
  • the boundary conditions, libraries and utilities should be able to be set or integrated without user input.
  • the optional interfaces to external software APIs enable the integration of the framework into existing software environments.
  • Various implementations are conceivable in order to meet the needs of the individual technical applications. Depending on the given conditions, it can either be open source-based or implemented in proprietary software in a suitable programming language. For the present application, for example, connections to the proprietary software products Revit and ArchiCAD are required, which represent the desired front end for the end user.
  • the virtual construction plan is the basis for the automated modeling of the 3D BIM models in the authoring systems. It contains all the necessary parameters and is transferred to the authoring system via an interface. The modeling runs according to the scheme stored in the construction plan, taking into account the stored parameters. The result is a 3D BIM model. This represents the virtual representation of the real initial scene.
  • Training data augmentation according to one embodiment is described below.
  • the point cloud of the specified box size (e.g. cuboid size) in the original scene is extracted one by one during training (the box size can be changed based on the hardware).
  • Online data augmentation of the point clouds in the boxes is performed.
  • the point cloud box can be randomly extracted 100 times from the entire scene. This provides a solution to the problem of training large scenes on limited hardware.
  • Fig. 10 shows such an extraction of boxes (cuboid-shaped subregions) of the point cloud according to one embodiment to obtain training data.
  • translation dithering for the entire building and/or 360-degree rotation around the entire building and/or random scaling for the entire building and/or elastic deformation of the entire building can be used.
  • data augmentation and/or cross-combination described above can be used.
  • Fig. 11 shows a visualization of the data augmentation according to a first embodiment.
  • Fig. 12 shows a visualization of the data augmentation according to a second embodiment.
  • Embodiments offer architects the opportunity to solve these problems. Automated building modeling allows architects and project developers to save hours of work at the touch of a button and thus reduce the major problems of insufficient time and budget. This means that they can start directly with the actual value creation, the planning of the construction measures. In addition, embodiments should offer the possibility of checking, quantifying and validating the accuracy of the returned model. In the previous manual process, the positioning of building elements in the virtual model is carried out by eye. This represents a possible source of error in the quality of the model, which can be minimized or even eliminated by algorithms. A quick visual and quantitative check of the results creates a high level of confidence on the part of the user in the quality of the model, which is essential for further planning processes.
  • Technical areas of application of embodiments are in the use for the generation of 3D BIM for buildings and industrial plants and infrastructures for serial renovation, renovation in general, construction planning, construction processes in general, insurance services, damage analyses and predictions, visualizations (XR), etc. Further areas of application are in the generation of 3D BIM of the current state/construction progress of buildings and industrial plants and infrastructures, further in the generation of 3D BIM of infrastructure, further in the generation of smart city models. Further use cases are in the generation of 3D BIM of individual rooms and in the generation of interior models for houses or apartments to make it easier for designers to design the interior.
  • aspects have been described in connection with a device, it is understood that these aspects also represent a description of the corresponding method, so that a block or a component of a device is also to be understood as a corresponding method step or as a feature of a method step. Analogously, aspects that have been described in connection with or as a method step also represent a description of a corresponding block or details or feature of a corresponding device.
  • Some or all of the method steps may be performed by (or using) a hardware apparatus, such as a microprocessor, a programmable computer, or an electronic circuit. In some embodiments, some or more of the key method steps may be performed by such an apparatus.
  • embodiments of the invention may be implemented in hardware or in software, or at least partially in hardware or at least partially in software.
  • the implementation may be carried out using a digital storage medium, for example a floppy disk, a DVD, a BluRay disc, a CD, a ROM, a PROM, an EPROM, an EEPROM or a FLASH memory, a hard disk or another magnetic or optical storage device on which electronically readable control signals are stored that can interact or do interact with a programmable computer system in such a way that the respective method is carried out. Therefore, the digital storage medium may be computer readable.
  • Some embodiments according to the invention thus comprise a data carrier having electronically readable control signals capable of interacting with a programmable computer system such that one of the methods described herein is carried out.
  • embodiments of the present invention may be implemented as a computer program product having a program code, wherein the program code is operable to perform one of the methods when the computer program product is run on a computer.
  • the program code can, for example, also be stored on a machine-readable medium.
  • an embodiment of the method according to the invention is thus a computer program that has a program code for carrying out one of the methods described herein when the computer program runs on a computer.
  • a further embodiment of the methods according to the invention is thus a data carrier (or a digital storage medium or a computer-readable medium) on which the computer program for carrying out one of the methods described herein is recorded.
  • the data carrier or the digital storage medium or the computer-readable medium is typically tangible and/or non-transitory.
  • a further embodiment of the method according to the invention is thus a data stream or a sequence of signals which represents the computer program for carrying out one of the methods described herein.
  • the data stream or the sequence of signals can be configured, for example, to be transferred via a data communication connection, for example via the Internet.
  • a further embodiment comprises a processing device, for example a computer or a programmable logic device, which is configured or adapted to carry out one of the methods described herein.
  • a processing device for example a computer or a programmable logic device, which is configured or adapted to carry out one of the methods described herein.
  • a further embodiment comprises a computer on which the computer program for carrying out one of the methods described herein is installed.
  • a further embodiment according to the invention comprises a device or a system which is designed to transmit a computer program for carrying out at least one of the methods described herein to a recipient.
  • the transmission can be carried out electronically or optically, for example.
  • the recipient can be, for example, a computer, a mobile device, a storage device or a similar device.
  • the device or system can, for example, comprise a file server for transmitting the computer program to the recipient.
  • a programmable logic device e.g., a field programmable gate array, an FPGA
  • a field programmable gate array may cooperate with a microprocessor to perform any of the methods described herein.
  • the methods are performed by any hardware device. This may be general-purpose hardware such as a computer processor (CPU) or hardware specific to the method such as an ASIC.

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Theoretical Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Geometry (AREA)
  • Evolutionary Computation (AREA)
  • General Engineering & Computer Science (AREA)
  • Computer Hardware Design (AREA)
  • Software Systems (AREA)
  • Artificial Intelligence (AREA)
  • Medical Informatics (AREA)
  • Mathematical Physics (AREA)
  • Computing Systems (AREA)
  • Pure & Applied Mathematics (AREA)
  • Mathematical Optimization (AREA)
  • Mathematical Analysis (AREA)
  • Data Mining & Analysis (AREA)
  • Computational Mathematics (AREA)
  • Architecture (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Multimedia (AREA)
  • Biophysics (AREA)
  • Molecular Biology (AREA)
  • General Health & Medical Sciences (AREA)
  • Civil Engineering (AREA)
  • Structural Engineering (AREA)
  • Computational Linguistics (AREA)
  • Biomedical Technology (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Health & Medical Sciences (AREA)
  • Human Computer Interaction (AREA)
  • Image Analysis (AREA)

Abstract

Eine Vorrichtung zur Erstellung eines digitalen Models eines bestehenden Gebäudes oder einer bestehenden Industrieanlage oder einer bestehenden Infrastruktur gemäß einer Ausführungsform wird bereitgestellt. Die Vorrichtung umfasst eine Eingangseinheit (110) zum Bereitstellen von Punktwolkendaten, die das Gebäude oder die Industrieanlage oder die Infrastruktur repräsentieren. Des Weiteren umfasst die Vorrichtung eine Verarbeitungseinheit (120), die ein Künstliches-Intelligenz-Modul (125) zur Erstellung des Modells abhängig von den Punktwolkendaten umfasst, wobei das Künstliche-Intelligenz-Modul (125) mittels maschinellem Lernen trainiert ist.

Description

Vorrichtung und Verfahren zur automatisierten, dreidimensionalen Bauwerksdatenmodellierung
Beschreibung
Die Anmeldung betrifft Bauwerksdatenmodellierung, insbesondere eine Vorrichtung und ein Verfahren zur automatisierten Bauwerksdatenmodellierung.
Bauwerksdatenmodellierung (BIM; engl.: Building Information Modelling) beschreibt eine Arbeitsmethode für die vernetzte Planung, den Bau und die Bewirtschaftung von Gebäuden und anderen Bauwerken mithilfe von Software und wird vor allem für die Visualisierung von Gebäuden, die Kostenschätzung, die Bauplanung, die Detektion von Konflikten, Störungen und Kollisionen sowie das Facility Management eingesetzt (siehe [1], [2]). Daher kann BIM Planungsfehler vermeiden, den Materialeinsatz optimieren, die Bau- und Instandhaltungskosten senken und die Effizienz des Ressourceneinsatzes in der gesamten Kette der Bauindustrie verbessern (siehe [2]). Besonders in Industrieländern mit niedrigen Neubauraten verlagern sich die Aktivitäten des Bausektors zunehmend auf Umbauten, Nachrüstungen und den Rückbau bestehender Gebäude (siehe [3]). Der Einsatz von BIM ist daher unerlässlich, um bestehende Gebäude kostengünstig instand halten zu können.
Die traditionellen Methoden zur Erstellung von BIM-Modellen unterteilen sich in die folgenden zwei Haupttypen: Zum einen gibt es die computergestützte 3D-Modellierung, die sich hauptsächlich auf grundlegende Messinstrumente wie Laserentfernungsmesser, Digitalkameras und Maßbänder stützt, um die Abmessungen aller Gebäudeformationen durch manuelle Messungen zu erfassen und kommerzielle Software (wie AutodeskRevit, Auto- CAD, 3DS MAX usw.) zur Durchführung der Modellierung auf der Grundlage der Messparameter zu verwenden. Zum anderen wird die Erzeugung von BIM-Modellen auf der Grundlage früher industrieller Konstruktionszeichnungen, z.B. unter Verwendung der ursprünglichen 2D-Konstruktionszeichnungen des Gebäudes als Referenz und Erzeugung von BIM-Modellen anhand der Zeichnungsparameter eingesetzt (siehe [4]). Diese beiden traditionellen Methoden können unter einigen Situationen akzeptable BIM-Modelle bereitstellen, leiden aber unter Schwierigkeiten bei der Datenerfassung, geringer Automatisierung, Ineffizienz oder mangelnder Aktualität aufgrund fehlender Zeichnungen oder Änderungen bei der Renovierung von Gebäudeeinrichtungen. Mit der Entwicklung der Computer-, Sensor- und Bildverarbeitungstechnologie kann schnell eine 3D-Punktwolke, die zahlreiche und verstreute Punkte mit Koordinaten (X, Y, Z) und Attributen (z.B. RGB-Farben, Intensität) erzeugt werden. Diese Form von Daten bietet eine effektive Unterstützung für die 3D-Modellierung, da sie die komplexe reale Welt effektiv darstellen. Die Schwierigkeiten der Datenerfassung werden immer geringer, und hierdurch lassen sich Aktualität und Genauigkeit der Daten bei traditionellen Methoden verbessern. Daher werden heute zur Erzeugung von BIM für Bestandsgebäude, vermehrt Sensoren zum 3D-Scannen eingesetzt. Diese erzeugen 3D- Punktwolken, aus denen man Parameter der Gebäude ableiten kann. Im industriellen Kontext werden Mitarbeiter eingesetzt, die manuell die Umwandlung von Punktwolken zu BIM-Modellen durchführen. Dafür erfordert dieser Prozess Software- Interaktion, ist zeitaufwendig und fehleranfällig. Die Vorteile der 3D-Scanning-Technologie und BIM- Technologie werden dadurch nicht effizient genutzt.
Diese Arbeitsweise hat verschiedene Probleme: Einerseits kann das System aufgrund der großen Menge an Punktwolkendaten bei Modellierungsprojekten extrem langsam werden oder ausfallen (siehe [5]). Andererseits kann sie manuelle 3D-Modellierung von Szenen mit vielen Details zeitaufwändig und fehleranfällig sein (siehe [6]- [8]). Zudem können, wenn die Szenen zu komplex sind, Wände und andere interessante Bereiche fehlen, was viele Herausforderungen mit sich bringt (siehe [8], [9]).
Die traditionelle Methode zur Erstellung eines BIM-Modells besteht darin, die Gebäudedaten mit Hilfe von Messinstrumenten zu messen oder die Daten aus vorhandenen 2D-Zeichnungsdateien zu verwenden, um die Gebäudeparameter zu erhalten und das Gebäude manuell mit diesen Daten zu modellieren, wie in Fig. 2 dargestellt. Die meisten Renovierungs- und Immobilienunternehmen verwenden auch heute noch diese traditionellen Methoden, um das Problem zu lösen. So zeigt Fig. 2 traditionelle BIM-Konstruktionsmethoden.
Bei der Umwandlung von 2D-Konstruktionszeichnungen zu BIM, gibt es für die geometrische 3D-Modellierung, eine Reihe von Forschungseinrichtungen, die Methoden zur Verbesserung der Effizienz der Modellierung veröffentlicht haben. Einerseits kann durch die halbautomatische Rekonstruktion virtueller 3D-Architekturmodelle aus 2D- Architekturzeichnungen, die Effizienz des früheren manuellen Rekonstruktionsprozesses verbessert werden (siehe [10]). Anderseits kann eine Verbesserung durch die Kombination der Geometrie und der Semantik aus mehreren Konstruktionszeichnungen und Tabellen, um Gebäudedaten zu integrieren und zu normalisieren, erreicht werden (siehe [11]). Ein Ansatz besteht darin, ein interaktives Skizzengerüst mit wahrnehmungsbasierten Techniken zu kombinieren, wobei das Scharnierwinkelschema des interaktiven Skizzierens verwendet wird, um eine stabile, genaue und stärker automatisierte 3D-Modellkonstruktion zu erreichen (siehe [12]). Mit Hilfe von Matching-, Mapping- und Klassifizierungsmethoden kann die Interaktion, während der 3D- Rekonstruktion reduziert werden, so dass die Grundstruktur des Gebäudemodells einfach und schnell rekonstruiert werden kann (siehe [13]). Obwohl es mehrere Ansätze gibt, die auf 2D- Konstruktionszeichnungen basieren, war es bisher nicht möglich, die Generierung von 3D-Gebäudemodellen aus 2D- Konstruktionszeichnungen vollständig zu automatisieren, da die Darstellung der Gebäudezeichnungen von Region zu Region etwas unterschiedlich ist und die Zeichnungen nicht unbedingt den aktuellen Bauzuständen entsprechen.
Mit der Weiterentwicklung der Hard- und Softwaretechnologien, wurden fortschrittliche Methoden entwickelt. Mit Laserscannern und unterschiedlichen Kameras (monokulare Kameras, binokulare Kamera und Kameras in Drohnen) ist es möglich, auf effiziente Weise Punktwolken-Daten der aktuellen Innen- und Außenszenen eines Gebäudes zu sammeln und dann mit der Bearbeitung von Punktwolkendaten und entsprechender Konstruktionszeichnungssoftware die Gebäudeparameter aus den vorhandenen Szenen zu gewinnen und zu modellieren.
Fig. 3 zeigt fortschrittliche BIM-Konstruktionsmethoden in einem Punktwolken-Workflow. Insbesondere zeigt Fig. 3 den Workflow der heutigen Punktwolkenerzeugung und -Verarbeitung. Der neuartige Ansatz zum BIM-Erstellungsprozess ist in Fig. 3 mit einer gepunkteten Linie hervorgehoben. Das Vernetzen (Meshing) ist ein bekannter Standardprozess.
Im Folgenden wird die Punktwolkenerzeugung beschrieben.
Die Generierung von Punktwolken ist bei dieser fortschrittlichen BIM-Konstruktions- methode unerlässlich. Es wird zwischen zwei Haupttypen von Punktwolkendaten unterschieden, wobei die erste Art indirekt durch die Verarbeitung von Foto-/Videobildern und die zweite Art direkt durch die Sensoren, die die Punktwolkendaten erzeugen, gewonnen wird. Da direkte Punktwolkendatensensoren nicht einfach zu verwenden sind und die Hardwarekosten hoch sind, konzentriert sich der Großteil der aktuellen Forschung auf die Erfassung von Punktwolkendaten aus 2D-Bildern durch Foto-/ Videobildverarbeitung, die zunächst auf der "Structure from Motion" (SfM) Technik basieren, um spärliche Punktwolkendaten zu erhalten, aus denen dann durch Verarbeitung dichte Punktwolken gewonnen werden können.
Die wichtigsten Schritte zur Generierung von Punktwolken sind auf der linken Seite von Fig. 3 dargestellt.
Im folgenden Abschnitt werden die Algorithmen und Methoden erläutert, die derzeit für jeden der Hauptschritte zur Punktwolkenerzeugung verwendet werden.
Zunächst wird dabei die Merkmalsextraktion (engl.: Feature Extraction) beschrieben. Diese ist beispielsweise in den Referenzen [14] bis [29] beschrieben. Die im Schritt der Merkmalsextraktion verwendeten Algorithmen können in zwei Kategorien eingeteilt werden, die Detektoren für Merkmalspunkte, die die Position von Merkmalspunkten im Bild ermitteln, und die Deskriptoren für Merkmalspunkte, die Vektoren oder Zeichenketten zur Beschreibung der von den Merkmalspunkte-Detektoren erkannten Merkmalspunkte erzeugen. Merkmalspunkte sind einige spezielle Punkte in den Bilddaten, die bestimmte besondere Eigenschaften und mehr Informationen als gewöhnliche Punkte haben und dazu verwendet werden können, die Schlüsselinformationen im Bild anhand dieser Merkmalspunkte zu beschreiben. Sobald die Merkmalspunkte und ihre Beschreibungen bekannt sind, kann die Entsprechung dieser Punkte in verschiedenen Bildern für nachfolgende Algorithmen übernommen werden.
Als nächstes wird der Merkmalsvergleich (engl.: Feature Matching) beschrieben. Dieser ist beispielsweise in den Referenzen [17] , [21] und [30] bis [37] dargestellt. Nachdem also die Merkmalspunkte jedes Bildes extrahiert worden sind, sollten die Merkmalspunkte in jedem Bild abgeglichen werden, d. h. die entsprechenden Merkmalspunkte eines Bildes sollten in dem anderen Bild gefunden werden. Wenn zwei Punkte in verschiedenen Bildern die gleiche Beschreibung haben, dann können diese Punkte als identisch in Bezug auf ihr Aussehen in der Szene betrachtet werden; wenn zwei Bilder eine gemeinsame Menge von Punkten haben, dann kann man sagen, dass sie einen gemeinsamen Teil der Szene abbilden. Es können verschiedene Strategien verwendet werden, um Übereinstimmungen zwischen Bildern effizient zu berechnen. Das Ergebnis dieser Phase ist ein Satz von Bildern, die sich mindestens paarweise überschneiden, und ein Satz von Korrespondenzen zwischen den Merkmalen. Nun wird die Bewegungsschätzung (engl.: Motion Estimation) beschrieben. Diese ist beispielsweise in [21], [24], [29], [32] und [38] bis [42] dargestellt. Das Ziel dieses Schrittes ist es, die Kameraparameter für jedes Paar von Bildern zu finden, indem die Merkmalspunkte jedes Bildpaares verwendet werden, sowohl intrinsische (d.h. Brennweite und radiale Aberration) als auch extrinsische (d.h. Rotation und Translation) Parameter. In der polaren Geometrie eines Bildpaares können zwei Matrizen verwendet werden, um die Korrespondenz zwischen den übereinstimmenden Merkmals-punkten des Bildpaares zu beschreiben, nämlich die essentielle Matrix und fundamentale Matrix [53] . Die essentielle Matrix [53] enthält die extrinsischen Parameter, die die Korrespondenz zwischen übereinstimmenden Merkmalspunkten in Kamerakoordinaten beschreiben, während die fundamentale Matrix [53] die intrinsischen und extrinsischen Parameter enthält, die die Korrespondenz zwischen übereinstimmenden Merkmalspunkten in Pixelkoordinaten beschreiben. In der Regel wird der Fünf-Punkte-Algorithmus zur Berechnung der extrinsischen Parameter verwendet, während der Acht-Punkte- Algorithmus zur Berechnung der intrinsischen und extrinsischen Parameter verwendet wird. Mit anderen Worten, der Fünf-Punkt-Algorithmus ist besser geeignet, wenn die intrinsischen Parameter bekannt sind und das Ziel darin besteht, extrinsische Parameter zu berechnen, während der Acht-Punkt-Algorithmus besser geeignet ist, wenn das Ziel darin besteht, sowohl extrinsische als auch intrinsische Parameter zu berechnen. Direkte Lineartransformation (engl.: Direct Linear Transform; DLT) verwendet Merkmalspunkte in Pixelkoordinaten und entsprechende 3D-Punkte in absoluten Koordinaten in der Szene, um intrinsische und extrinsische Parameter auf der Grundlage der Methode der kleinsten Quadrate zu berechnen, während die Fünf- und Acht-Punkt-Algorithmen keine 3D-Punkte in absoluten Koordinaten in der Szene benötigen Punkte, während die Fünf- und Acht- Punkt-Algorithmen keine dreidimensionalen Punkte in absoluten Koordinaten in der Szene benötigen.
Als nächstes wird dünn besetzte 3D Rekonstruktion (engl.: Sparse 3D reconstruction) beschrieben. Diese ist beispielsweise in den Referenzen [15], [17], [26] und [43] dargestellt. Ziel dieses Schritts ist es, die 3D-Punkte zu berechnen, indem die aus dem Abschnitt "Merkmalsvergleich" gewonnenen Merkmalspunkte mit Korrespondenzen und die aus dem Abschnitt "Bewegungsschätzung" gewonnenen Kameraparameter jedes Bildes verwendet werden, um eine Punktwolke der Szene zu erzeugen.
Nun wird die Parameterkorrektur (engl.: Parameters Correction) beschrieben. Diese ist in den Referenzen [15] - [17], [21], [35] und [44] dargestellt. Ziel dieses Schritts ist es, die Kameraparameter jedes Bildes zu korrigieren, um den Fehler bei der Reprojektion zu verringern. Dazu werden die intrinsischen und extrinsischen Kameraparameter für jedes Bild aus dem Abschnitt "Bewegungsschätzung" und die 3D-Positionen der Punkte in der Punktwolke aus dem vorherigen Schritt verwendet, um die genauen Kameraparameter jedes Bildes und die exakten 3D- Positionen der Punkte in der Punktwolke zu erzeugen.
Nun wird der Schritt der dichten 3D Rekonstruktion (engl.: Dense 3D reconstruction) beschrieben . Diese ist in den Referenzen [15], [17], [21], [43] und [45] - [52] dargestellt. Ziel dieses Schritts ist es, die Details der Szene wiederherzustellen, indem die Bilder einer bestimmten Szene, die intrinsischen und extrinsischen Parameter der Kameras für jedes Bild, die aus dem Abschnitt "Parametrische Korrektur" gewonnen wurden, und die spärliche Punktwolke, die aus dem vorherigen Schritt gewonnen wurde, verwendet werden, um eine dichte Punktwolke zu erzeugen.
Im Folgenden wird die Punktwolkenverarbeitung dargestellt.
Die oben genannten Schritte bei der Punktwolkenerzeugung führen zu einer vollständigen dichten Punktwolke aus den Rohdaten der zugrundeliegenden Szene. Diese kann dann verarbeitet werden, um das endgültige 3D-Modell zu erhalten. Die 3D-Modelle werden dabei in drei Haupttypen unterteilt: Tesselierte (vernetzte) Modelle, Punktwolkenmodelle und geometrische Modelle. Die Anforderungen an 3D-Modelle variieren in verschiedenen Szenarien. In der Industrie werden aufgrund der hohen Anforderungen an die Modellgenauigkeit hauptsächlich geometrische Modelle verwendet. Geometrische Modelle sind vielseitiger und können leicht in die beiden anderen 3D-Modelle konvertiert werden. 3D-BIM sind ein typisches Format von geometrischen Modellen.
Aufgrund der Einschränkungen der dichten Punktwolke, die im Schritt der Punktwolkengenerierung erzeugt wird, ist es nicht möglich, die Anforderungen der Anwendung direkt zu erfüllen. Beispielsweise enthält die erzeugte Punktwolke neben der Zielobjektinformation auch andere Punktwolkendaten der Umgebung, was ein Hindernis für die weitere Anwendung der Punktwolke sein kann. Nach dem derzeitigen Stand der Forschung ist daher die Vorverarbeitung (eng.: Preprocessing) von Punktwolken, die Segmentierung von Punktwolken und die Modellierung von Punktwolken unerlässlich, um die Anforderungen der Anwendung zur Umwandlung von Punktwolken in geometrische Modelle zu erfüllen.
Die Algorithmen und Methoden die in den verschiedenen Schritten der Verarbeitung von Punktwolken zu Geometriemodellen zum Einsatz kommen, nachfolgend erläutert.
Zunächst wird die Punktwolkenvorverarbeitung (engl.: Point Cloud Preprocessing) beschrieben. Diese ist in [15], [17] und [54] bis [57] dargestellt. Der Zweck dieses Schritts ist die Erstellung eines Punktwolkenmodells oder die Erzeugung einer qualitativ hochwertigen Punktwolke für die nachfolgenden Schritte. Wie in Fig. 3 dargestellt, besteht dieser Schritt aus vier Teilschritten, nämlich Ausrichtung, Rauschfilterung, Entfernung von Aureißern und Reduzierung der Abtastung (engl.: Downsampling). Welcher der vier Teilschritte verwendet wird, hängt von den Anwendungsanforderungen und der Qualität der Punktwolke ab.
Nun wird die Punktwolkensegmentierung (engl.: Point Cloud Segmentation) beschrieben. Diese ist in den Referenzen [54] und [58] - [62] dargestellt. Ziel dieses Schritts ist es, die Punktwolke zu segmentieren, um die Punkte des Objekts von Interesse zu erhalten. Obwohl sich die in den Veröffentlichungen verwendeten Algorithmen geringfügig voneinander unterscheiden, lassen sich die traditionellen Algorithmen, die heute hauptsächlich für die Segmentierung von Punktwolken verwendet werden, in zwei Kategorien einteilen, nämlich in merkmalsbasierte Segmentierungsalgorithmen und modellbasierte Segmentierungsalgorithmen. Merkmalsbasierte Segmentierungsalgorithmen segmentieren eine Punktwolke auf der Grundlage der Merkmale jedes Punktes in der Wolke, indem sie Punkte mit denselben Merkmalen in eine Teilgruppe einteilen. Modell-basierte Segmentierungsalgorithmen segmentieren eine Punktwolke auf der Grundlage eines mathematischen Modells des betrachteten Objekts, wobei das bei der modellbasierten Segmentierung verwendete mathematische Modell in der Regel eine Ebenengleichung ist, die in der Regel mathematisch parametrisierbare Geometrien wie Ebene, Zylinder, Torus usw. sein können.
Schließlich wird Puinktwolkenmodellierung (engl.: Point Cloud Modeling) beschrieben. Diese ist in [56] und [63] dargestellt. Ziel dieses Schritts ist die Erstellung eines geometrischen Modells des betrachteten Objekts unter Verwendung der segmentierten Punktwolkensegmente aus dem vorherigen Schritt. Um ein geometrisches Modell des betreffenden Objekts zu erstellen, sollten die Modellparameter auf der Grundlage der Ergebnisse der Punktwolkensegmentierung ermittelt werden. Die Methode zur Ermittlung der Modellparameter besteht im Allgemeinen darin, die Abmessungen des Objekts zu ermitteln. Der Radius eines zylindrischen Rohrs ist beispielsweise einer seiner Modellparameter und kann durch Berechnung des kürzesten Abstands zwischen der Mittellinie und der Punktwolke des Rohrs, die aus der Punktwolkensegmentierung stammt, ermittelt werden [56], Alternativ senkrecht durch Projektion der Punktwolke der Pipeline auf eine Ebene zur Mittellinie der Pipeline, um einen resultierenden Kreis zu erzeugen und den Radius des Kreises zu berechnen (siehe [46] und [64]). Mit den Modellparametern kann ein geometrisches Modell des Zielobjekts leicht erstellt werden.
Eine Vorrichtung nach Anspruch 1, ein Verfahren nach Anspruch 26 und ein Computerprogramm nach Anspruch 27 werden bereitgestellt.
Eine Vorrichtung zur Erstellung eines digitalen Models eines bestehenden Gebäudes oder einer bestehenden Industrieanlage oder einer bestehenden Infrastruktur gemäß einer Ausführungsform wird bereitgestellt. Die Vorrichtung umfasst eine Eingangseinheit zum Bereitstellen von Punktwolkendaten, die das Gebäude oder die Industrieanlage oder die Infrastruktur repräsentieren. Ferner umfasst die Vorrichtung eine Verarbeitungseinheit, die ein Künstliches-Intelligenz-Modul zur Erstellung des Modells abhängig von den Punktwolkendaten umfasst, wobei das Künstliche-Intelligenz-Modul mittels maschinellem Lernen trainiert ist.
Des Weiteren wird ein Verfahren zur Erstellung eines digitalen Models eines bestehenden Gebäudes oder einer bestehenden Industrieanlage oder einer bestehenden Infrastruktur gemäß einer Ausführungsform bereitgestellt. Das Verfahren umfasst:
Bereitstellen von Punktwolkendaten, die das Gebäude oder die Industrieanlage oder die Infrastruktur repräsentieren. Und:
Erstellen das Modells abhängig von den Punktwolkendaten unter Einsatz einer Verarbeitungseinheit, die ein Künstlichen-Intelligenz-Modul umfasst, wobei das Künstliche-Intelligenz-Modul mittels maschinellem Lernen trainiert ist.
Ferner wird ein Computerprogramm mit einem Programmcode zur Durchführung des oben beschriebenen Verfahrens bereitgestellt. Ausführungsformen zielen darauf ab, die oben genannten Probleme zu lösen, die Automatisierung und Genauigkeit der Konstruktion von bestehenden BIM zu verbessern und eine perfekte Kombination der Vorteile zwischen 3D-Scantechnologie und BIM- Technologie zu erreichen.
Ausführungsformen betreffen hauptsächlich die Phase der Punktwolkenverarbeitung, während der Stand der Technik die Phase der Punktwolkenerzeugung und -anwendung betreffen.
Insbesondere betreffen Ausführungsformen den Prozess der Umwandlung von Punktwolken in geometrische Modelle.
Gemäß Ausführungsformen wird die Effizienz und die Genauigkeit des Prozesses der Umwandlung von Punktwolken in geometrische Modelle erheblich verbessern und es ermöglichen, den Prozess zu automatisieren.
Ausführungsformen stellen eine semantische Segmentierung bereit, um den Einfluss von Umgebungsgeräuschen aus den Punktwolkendaten zu entfernen.
In Ausführungsformen erfolgt eine Segmentierung von Punktwolkenzielen auf Objektebene durch Instanzensegmentierung, um geometrische und Positionsparameter des Zielobjekts zu erhalten, z. B. Räume, Möbel, Wänden.
Gemäß einer Ausführungsform erfolgt eine Erweiterung einer Datenbank durch Umwandlung vorhandener geometrischer Modelle in Punktwolkendaten, um eine bessere Segmentierungsgenauigkeit zu erzielen.
Nachfolgend werden bevorzugte Ausführungsformen der Erfindung unter Bezugnahme auf die Zeichnungen beschrieben.
In den Zeichnungen ist dargestellt:
Fig. 1 zeigt eine Vorrichtung zur Erstellung eines digitalen Models eines bestehenden Gebäudes oder einer bestehenden Industrieanlage oder einer bestehenden Infrastruktur gemäß einer Ausführungsform. Fig. 2 zeigt traditionelle BIM - Konstruktionsmethoden.
Fig. 3 zeigt fortschrittliche BIM-Konstruktionsmethoden in einem Punktwolken- Ablauf.
Fig. 4 eine Ziel-Gebäudeszene mit Punktwolkenrauschen, das Umgebungsinformationen enthält, nach der Punktwolkenregistrierung.
Fig. 5 zeigt verschiedene Methode der Ansätze und Gruppe zur semantischen Segmentierung von Punktwolken.
Fig. 6 zeigt einen Zustand nach der Entfernung von Umgebungsrauschinformationen.
Fig. 7 zeigt das Zielobjekt ohne weitere Gebäude.
Fig. 8 zeigt verschiedene Methode zur Instanz-Segmentierung von Punktwolken.
Fig. 9 zeigt einen Ablauf eines Rückführungsprozesses.
Fig. 10 zeigt eine Extraktion von Boxen einer Punktwolke gemäß einer
Ausführungsform, um Trainingsdaten zu erhalten.
Fig. 11 zeigt eine Visualisierung der Daten-Augmentation gemäß einem ersten ausführungsgemäßem Beispiel.
Fig. 12 zeigt eine Visualisierung der Daten-Augmentation gemäß einem zweiten ausführungsgemäßem Beispiel.
Fig. 1 zeigt eine Vorrichtung zur Erstellung eines digitalen Models eines bestehenden Gebäudes oder einer bestehenden Industrieanlage oder einer bestehenden Infrastruktur gemäß einer Ausführungsform.
Die Vorrichtung umfasst eine Eingangseinheit 110 zum Bereitstellen von Punktwolkendaten, die das Gebäude oder die Industrieanlage oder die Infrastruktur repräsentieren. Des Weiteren umfasst die Vorrichtung eine Verarbeitungseinheit 120, die ein Künstliches- Intelligenz-Modul 125 zur Erstellung des Modells abhängig von den Punktwolkendaten umfasst, wobei das Künstliche-Intelligenz-Modul 125 mittels maschinellem Lernen trainiert ist.
Bei einer Infrastruktur kann es sich beispielsweise oder um einen Bahnhof, oder um einen Bahnsteig, oder um eine Brücke, oder um eine andere Art von Infrastruktur handeln.
Gemäß einer Ausführungsform kann die Eingangseinheit 110 z.B. ausgebildet sein, zwei oder mehr Punktwolken-Teildatensätze zu erhalten, die jeweils einen Teilbereich des Gebäudes oder einen Teilbereich der Industrieanlage oder einen Teilbereich der Infrastruktur repräsentieren. Die Eingangseinheit 110 kann z.B. ausgebildet sein, die Punktwolkendaten, die das Gebäude oder die Industrieanlage oder die Infrastruktur repräsentieren, aus den zwei oder mehr Punktwolkendaten zu erzeugen.
In einer Ausführungsform kann die Eingangseinheit 110 z.B. ausgebildet sein, Sensordaten von ein oder mehreren Kameras und/oder von ein oder mehreren Laserscannern und/oder von ein oder mehreren Tiefenkameras zu erhalten. Die Eingangseinheit 110 kann z.B. ausgebildet sein, die Punktwolkendaten und einen Teil der Punktwolkendaten abhängig von den Sensordaten zu bestimmen; oder wobei die Sensordaten die Punktwolkendaten oder einen Teil der Punktwolkendaten umfassen.
Gemäß einer Ausführungsform kann die Verarbeitungseinheit 120 z.B. ausgebildet sein, die Daten in den Punktwolkendaten zu detektieren, die nicht das Gebäude oder die Industrieanlage oder die Infrastruktur repräsentieren, und/oder die außerhalb des Gebäudes oder der Industrieanlage oder der Infrastruktur liegen. Beispielsweise können diese detektierten Daten, die nicht das Gebäude oder die Industrieanlage oder die Infrastruktur repräsentieren, (z.B. bei Bedarf) in der Folge entfernt werden.
In einer Ausführungsform kann die Verarbeitungseinheit 120 z.B. ausgebildet sein, Grenzen des Gebäudes oder der Industrieanlage oder der Infrastruktur zu bestimmen, um die Daten in den Punktwolkendaten zu detektieren, die außerhalb des Gebäudes oder der Industrieanlage oder der Infrastruktur liegen.
Gemäß einer Ausführungsform kann die Punktwolkendaten Informationen über Oberflächen des Gebäudes oder der Industrieanlage oder der Infrastruktur und Informationen über das Innere des Gebäudes oder der Industrieanlage oder der Infrastruktur umfassen.
In einer Ausführungsform kann die Verarbeitungseinheit 120 z.B. ausgebildet sein, die Punktwolkendaten derart zu verarbeiten, dass ein oder mehrere Teilmengen der Punktwolkendaten derart klassifiziert werden, dass die ein oder mehreren Teilmengen, jeweils einer von ein oder mehreren Objektkategorien zugeordnet werden.
Gemäß einer Ausführungsform können die ein oder mehreren Objektkategorien z.B. ein oder mehrere Gebäudeteiltypen umfassen. Die Verarbeitungseinheit 120 kann z.B. ausgebildet sein, das Klassifizieren derart auszuführen, dass dieses eine erste Instanzsegmentierung umfasst, die mindestens eine Teilmenge der ein oder mehreren Teilmengen der Punktwolkendaten derart klassifiziert, dass diese als einer von den ein oder mehreren Gebäudeteiltypen des Gebäudes oder der Industrieanlage oder der Infrastruktur klassifiziert wird.
Gemäß einer Ausführungsform können die ein oder mehreren Gebäudeteiltypen z.B. durch einen Entwickler frei definierbar sein. Ein Entwickler ist z.B. ein Nutzer, der die Vorrichtung konfiguriert.
In einer Ausführungsform können die ein oder mehreren Gebäudeteiltypen z.B. ein oder mehrere der nachfolgenden Gebäudeteiltypen umfassen: Ein Dach, eine Außenwand, eine Außentür, ein Außenfenster, einen Innenraum, ein Treppenhaus, einen Aufzugsschacht oder eine andere Art von Gebäudeteiltyp.
Gemäß einer Ausführungsform können die ein oder mehreren Objektkategorien z.B. ein oder mehrere Raumstrukturtypen umfassen. Die Verarbeitungseinheit 120 kann z.B. ausgebildet sein, das Klassifizieren derart auszuführen, dass dieses eine zweite Instanzsegmentierung umfasst, die mindestens eine Teilmenge der ein oder mehreren Teilmengen der Punktwolkendaten derart klassifiziert, dass diese als eine Raumstruktur von den ein oder mehreren Raumstrukturtypen eines Raums des Gebäudes oder der Industrieanlage oder der Infrastruktur klassifiziert wird.
In einer Ausführungsform können die die ein oder mehreren Raumstrukturtypen z.B. durch einen Entwickler frei definierbar sein. Ein Entwickler ist z.B. ein Nutzer, der die Vorrichtung konfiguriert. In einer Ausführungsform können die ein oder mehreren Raumstrukturtypen z.B. ein oder mehrere der nachfolgenden Raumstrukturtypen umfassen: Eine Wand, eine Decke, ein Fußboden, eine Tür, ein Fenster, ein Mobiliar oder eine andere Art von Raumstrukturtyp.
Gemäß einer Ausführungsform kann die Verarbeitungseinheit 120 z.B. ausgebildet sein, die ein oder mehreren Teilmengen der Punktwolkendaten derart zu klassifizieren, dass ein Klassifizieren durch Verwendung des Künstlichem-Intelligenz Modul 125 erfolgt, welches mittels dem maschinellem Lernen trainiert ist, und welches ausgebildet ist, die Punktwolkendaten als Eingangsdaten zu erhalten.
In einer Ausführungsform kann das Künstliche-Intelligenz-Modul 125 z.B. mittels überwachtem Tiefenlernen trainiert sein.
Gemäß einer Ausführungsform kann das Künstliche-Intelligenz-Modul 125 z.B. ausgebildet sein, das Klassifizieren z.B. projektionsbasiert und/oder diskretisierungsbasiert und/oder punktbasiert durchzuführen.
In einer Ausführungsform kann das Künstliche-Intelligenz-Modul 125 z.B. ein neuronales Tiefenlern-Netz umfassen, das mindestens zwei versteckte Schichten aufweist (z.B. mindestens zwei innere Schichten, also Schichten, die keine Eingangs- und Ausgangsknoten aufweisen).
Gemäß einer Ausführungsform kann das Künstliche-Intelligenz-Modul 125 z.B. ein rekurrentes neuronales Netz zur Bestimmung von ein oder mehreren Merkmalen eines Teilbereichs der Punktwolkendaten umfassen.
In einer Ausführungsform kann das Künstliche-Intelligenz Modul 125 z.B. mittels dem maschinellem Lernen trainiert sein, indem eine erste Punktwolke einer Objektkategorie der ein oder mehreren Objektkategorien zugeordnet wurde, und wobei die erste Punktwolke und die besagte Objektkategorie als ersten Trainingsdatensatz für das Künstliche-Intelligenz Modul 125 verwendet wurden.
Objektklassen bzw. -kategorien sind gemäß einer Ausführungsform offen bzw. frei definierbar.
Gemäß einer Ausführungsform kann das Künstliche-Intelligenz Modul 125 z.B. mittels dem maschinellem Lernen trainiert sein, indem die erste Punktwolke ein oder mehrmals verändert wurde, um ein oder mehrere veränderte Punktwolken zu erhalten, wobei jeweils eine der ein oder mehreren veränderten Punktwolken und die besagte Objektkategorie als ein weiterer Trainingsdatensatz von ein oder mehreren weiteren Trainingsdatensätzen verwendet wurden.
In einer Ausführungsform kann die erste Punktwolke z.B. derart ein oder mehrmals verändert worden sein, indem ein Translations-Dithering und/oder eine Drehung und/oder eine zufällige Skalierung und/oder eine elastische Verformung der ersten Punktwolke eingesetzt wurde.
Gemäß einer Ausführungsform kann es sich bei den Punktwolkendaten z.B. um dreidimensionale Punktwolkendaten handeln. Die Verarbeitungseinheit 120 kann z.B. ausgebildet sein, die dreidimensionalen Punktwolkendaten auf zweidimensionale Punktwolkendaten abzubilden und die ein oder mehrere Teilmengen der Punktwolkendaten unter Verwendung der zweidimensionalen Punktwolkendaten zu klassifizieren.
In einer Ausführungsform kann es sich bei den Punktwolkendaten z.B. um dreidimensionale Punktwolkendaten handeln. Die Verarbeitungseinheit 120 kann z.B. ausgebildet sein, eine Zuordnung der dreidimensionalen Punktwolkendaten auf eine Mehrzahl von Voxeln durchzuführen und die Punktwolkendaten abhängig von der Zuordnung auf die Mehrzahl von Voxeln durchzuführen.
Gemäß einer Ausführungsform kann die Verarbeitungseinheit 120 z.B. ausgebildet sein, abhängig von dem Klassifizieren der ein oder mehrere Teilmengen der Punktwolkendaten einen virtuellen Bauplan zu erstellen.
In einer Ausführungsform kann die Verarbeitungseinheit 120 z.B. ausgebildet sein, abhängig von dem Klassifizieren der ein oder mehrere Teilmengen der Punktwolkendaten eine dreidimensionale Bauwerksdatenmodellierung zu erstellen.
Nachfolgend werden spezielle Ausführungsformen der Erfindung dargestellt.
Ausführungsformen betreffen eine Vorrichtung und ein Verfahren zur automatisierten Erstellung von digitalen parametrischen geometrischen Modellen für bestehende Gebäude und Industrieanlagen und Infrastrukturen. Ausführungsformen können auf Bauwerksdatenmodellierung (BIM-Modelle), digitale Fabriken, digitale Zwillinge (engl.: digital twin) und weitere, angewendet werden. Die Eingangsdaten für eine erfindungsgemäße Vorrichtung sind Punktwolkendaten einer vollständigen Szene, die das Zielobjekt enthält.
Anschließend werden die Eingangsdaten durch verschiedene Modelle künstlicher Intelligenz verarbeitet, die auf die Situation des Benutzers abgestimmt und auf unterschiedlichen Geräten basierend sind, was zur automatischen Erstellung eines digitalen parametrisierten, geometrischen Modells führt.
Die eingegebenen Punktwolkendaten können ein beliebiges Format haben.
Ein Schwerpunkt mancher Ausführungsformen liegt auf der Verarbeitung von Punktwolkendaten mit Echtzeitcharakter. Diese Punktwolkendaten können mit einer Reihe von umgebungsspezifischen Sensorgeräten erfasst werden, darunter unter anderem hochauflösende Kameras, Laserscanner oder Tiefenkameras usw. Diese Sensoren können auch über verschiedene Medien wie mobile Roboter und Drohnen betrieben und Daten effizient erfasst werden. Bei der Erfassung von Punktwolkendaten (Point Cloud Data) ist es nicht möglich, alle Punktwolken (Point Cloud) eines Objekts auf einmal zu erfassen, da die Sensoren begrenzt sind und es sich bei dem Zielobjekt um eine große Szene wie ein Gebäude oder eine Fabrik handelt. Es ist daher notwendig, Subszenen des Zielobjekts nach Teilbereichen des Zielgebäudes zu erfassen. Die Subszenen sollten dann mehrmals registriert werden (Punktwolkenregistrierung; engl.: Point Cloud Registration), um die vollständige Szene zu erhalten. Diese vollständigen Punktwolkendaten enthalten jedoch noch viele andere Informationen als das Zielobjekt, z.B. Bäume, Fahrzeuge, Fußgänger, Fassaden umliegender Häuser sowie Park- und Straßenszenen, wie in Fig. 4 dargestellt.
Insbesondere zeigt Fig. 4 eine Ziel-Gebäudeszene mit Punktwolkenrauschen, das Umgebungsinformationen enthält, nach der Punktwolkenregistrierung (Point Cloud Registration).
Die anderen Punktwolkendaten als das Zielgebäude sind redundant, d.h. Punktwolkenrauschen (Point Cloud Noise) kann ebenfalls auftreten.
Gemäß der obigen Beschreibung sind alle überflüssigen Punktwolkeninformationen, die außerhalb des Zielobjekts liegen, zu eliminieren, um das parametrisierte, geometrische Modell zu konstruieren, da sie sonst die Genauigkeit der nachfolgenden Schritte wieder erheblich beeinträchtigen. Der Fall der Eingabeszene in Fig. 4 zeigt intuitiv, dass es sich bei der kompletten Szene um eine komplexe Szene mit Auflösungsschwankungen, Rauschstörungen und Objektverdeckungen, Hintergrundeffekten usw. handelt. Die semantischen Informationen innerhalb der Szene sind jedoch auf bestimmte Kategorien beschränkt, nämlich Gebäude, Bäume, Straßen, Autos, Fußgänger usw. Das Zielobjekt, ein Gebäude, wird durch mehrmalige Punktwolkenregistrierung ermittelt und enthält nicht nur Informationen über die Oberfläche des Gebäudes, sondern auch über das Innere des Gebäudes.
Eine vorteilhafte Ausführungsform besteht darin, die Eliminierung von Punktwolkeninformationen, die nicht der Kategorie des Zielobjekts entsprechen, mit Hilfe eines Algorithmus zur Segmentierung von 3D-Punktwolken auf Szenenebene zu erreichen, d. h. einer semantischen Segmentierung (Semantic Segmentation).
Die semantische Segmentierung von Punktwolken (Point Cloud Semantic Segmentation, POSS) erzeugt semantische Informationen für jeden Punkt in den Punktwolkendaten, was durch Methoden des überwachten Lernens erreicht wird, sodass die Klassifizierung von Punktwolkendaten in Teilmengen auf der Grundlage der semantischen Informationen der Punkte und die Klassifizierung verschiedener Zielobjektkategorien erreicht werden können. Die Segmentierung von Punktwolken umfasst sowohl das "regulär" überwachte maschinelle Lernen und das moderne Deep Learning (Tiefenlernen), wobei sich das regulär überwachte maschinelle Lernen auf Algorithmen bezieht, die nicht zum Deep Supervised Learning (überwachtes Tiefenlernen) gehören.
Nach den bisherigen Forschungsergebnissen kann die semantische Segmentierung von Punktwolken (Point Cloud Semantic Segmentation, PCSS) für reguläres überwachtes maschinelles Lernen in zwei Typen unterteilt werden [65], Der eine Typ ist ein individuelle PCSS, das jeden Punkt oder jedes Punktcluster nur anhand seiner individuellen Merkmale klassifiziert, z. B. Maximum Likelihood classifiers based on Gaussian Mixture Models [66], Random Forests [67], AdaBoost [68,69], Support Vector Machines [70,71], a cascade of binary classifiers [72], and Bayesian Discriminant Classifiers [73], Der andere Typ ist PCSS statistisches Kontextmodell, wie Associative and Non-Associative Markov Networks [74-76], Conditional Random Fields [77-81], Simplified Markov Random Fields [82], Mehrstufiges Inferenzverfahren unter Verwendung von Punktwolkenstatistiken und Lernen von relationalen Informationen über feine und grobe Skalen [83], und ein Rahmenwerk für räumliche Inferenzmaschinen, das mid-range and long-range Abhängigkeiten in den Daten modelliert [84], Das allgemeine Verfahren der individuellen Klassifizierung für PCSS ist in vier Schritte unterteilt: Nachbarschaftsauswahl (neighborhood selection), Merkmalsextraktion (feature extraction), Merkmalsauswahl (feature selection) und semantische Segmentierung (semantic segmentation) [85], Da die individuelle PCSS keine kontextuellen Merkmale (mit benachbarten Punkten) von Punkte berücksichtigt, werden einzelne Klassifikatoren, obwohl sie effektiv arbeiten können, unvermeidliches Rauschen erzeugen, was zu ungleichmäßigen PCSS-Ergebnissen führt. Statistische Kontextmodelle können dieses Problem lindern.
Die auf Deep Learning basierende PCSS kann unter Verwendung von mehr als zwei versteckten Schichten verwendet werden, um hochdimensionale Merkmale aus den Trainingsdaten zu erhalten und diese dann zu verarbeiten, während traditionelle handgefertigte Merkmale mit domänenspezifischem Wissen entworfen werden. Bei PCSS für semantische Segmentierung auf der Basis von Deep Learning gibt es insgesamt vier Paradigmen: projektionsbasierte (projection-based) Ansätze, diskretisierungsbasierte (discretization-based) Ansätze, punktbasierte (point-based) Ansätze und hybride Ansätze [86], In diesen verschiedenen Ansätzen gibt es unterschiedliche Verfahren unter verschiedenen Methoden. Bei den verschiedenen Verfahren können die Merkmale der Zielobjektpunktwolke vor allem durch eine Änderung der Struktur des (neuronalen) Deep- Learning-Netzes (Tiefenlern-Netz) auf unterschiedliche Weise identifiziert und für eine relativ korrekte Segmentierung ausgerichtet werden.
Bei projektionsbasierten Ansätzen werden in der Regel eine 3D-Punktwolke auf ein 2D- Bild projiziert, einschließlich Multi-View Bilder und sphärische Bilder umfasst, d. h. Multi- View-Repräsentationsmethode und sphärische Repräsentationsmethode. Es gibt mehrere Verfahren für Multi-View-Repräsentationsmethode, von denen einer es ermöglicht, eine zunächst eine 3D-Punktwolke aus mehreren virtuellen Kameraansichten auf eine 2D- Ebene zu projizieren und dann wird ein Multi-Stream-FCN (Multistream Fully Convolutional Networks) verwendet, um pixelweise Bewertungen auf synthetischen Bildern vorherzusagen. Das endgültige semantische Label für jeden Punkt wird durch die Fusion der reprojizierten Scores über verschiedenen Ansichten erhalten [87], In einem anderen Verfahren werden zunächst mehrere RGB- und Tiefen-Schnappschüsse einer Punktwolke unter Verwendung mehrerer Kamerastandorte erstellt [88], und dann werden eine pixelweise Labeling dieser Schnappschüsse mit 2D-Segmentierungsnetzwerken durchgeführt. Die Scores, die aus den RGB- und Tiefenbildern vorhergesagt wurden, werden mit Hilfe der Residualkorrektur fusioniert [89], Bei dem dritten Verfahren kann die Tangentenfaltung für die Segmentierung dichter Punktwolken eingeführt werden, die auf der Ausgehend der Annahme basiert, dass die Punktwolke von einer lokalen euklidischen Fläche abgetastet wird. Dies Verfahren projiziert zunächst die lokale Oberflächengeometrie um jeden Punkt auf eine virtuelle Tangentialebene. Die Tangentenfaltung wird dann direkt auf die Oberflächengeometrie angewendet. Diese Methode weist eine gute Skalierbarkeit auf und ermöglicht die Verarbeitung großer Mengen von Punktwolken mit Millionen von Punkten [90], Im Allgemeinen ist die Leistung von Multi-View-Segmentierungsmethoden von der Auswahl des Ansichtspunkts und der Verdeckung des Ansichtspunkts abhängig. Außerdem nutzen diese Methoden die zugrundeliegenden geometrischen und strukturellen Informationen nicht vollständig aus, da der Projektionsschritt unweigerlich zu Informationsverlusten führt. Es gibt auch verschiedene Verfahren für die sphärische Repräsentationsmethode, einer davon ist ein End-to-End-Netzwerk auf SqueezeNet [91] und Conditional Random Fields (ORF) basiert
[92], Um die Segmentierungsgenauigkeit weiter zu verbessern, wurde SqueezeSegV2
[93] eingeführt, um das Problem des Domaintransfers zu lösen, indem eine unüberwachte Domänenanpassungspipeline verwendet wird. Ein anderes Verfahren überträgt zunächst die semantischen Labels von 2D-Entfernungsbildern in 3D-Punktwolken, wobei ein effizienter GPU-fähiger KNN-basierter Post-Processing-Schritt verwendet wird, um das Problem von Diskretisierungsfehlern und unscharfen Inferenzergebnissen zu verringern
[94], Im Vergleich zur Einzelansichtsprojektion enthält die sphärische Projektion mehr Informationen und ist für Labeling von Punktwolken geeignet. Allerdings bringt diese Zwischendarstellung unweigerlich mehrere Probleme mit sich, wie Diskretisierungsfehler und Verdeckungen.
Diskretisierungsbasierte Ansätze wandeln in der Regel eine Punktwolke in eine dichte/sparsame diskrete
Repräsentationsmethode um, z. B. in volumetrische und sparsame permutohedrisch Gitter. Bei dichter diskretisierter Repräsentationsmethode (Dense Discretization Representation) besteht ein Verfahren darin, die Punktwolke zunächst in eine Reihe von Belegungsvoxeln aufgeteilt wird und diese zwischengespeicherten Daten dann in ein Voll- 3D-CNN zur voxelweisen Segmentierung eingespeist wird [95], Schließlich werden alle Punktverteilungen innerhalb jedes Voxels zu einem kompakten latenten Bereich zusammengefasst. Schließlich wird allen Punkten innerhalb eines Voxels dasselbe semantische Label zugewiesen wie dem Voxel (Die Leistung dieser Methode wird durch die Granularität der Voxel und die Grenzartefakte aufgrund der Partitionierung der Punktwolke stark eingeschränkt). Ein anderer Verfahren besteht darin, eine deterministische trilineare Interpolation einzuführen, um die von „3D-Fully Convolutional Networks“ (3D-FCNN) [96] generierten groben Voxelvorhersagen zurück auf die Punktwolke abzubilden, und dann eine vollständig verbundene „Conditional Random Field“ (CRF) oder „Fully Connected CRF“ (FCCRF) zu verwenden, um die räumliche Konsistenz dieser abgeleiteten Perpoint-Labels zu erzwingen, was eine feinkörnige und global konsistente semantische Segmentierung ermöglicht [97], Der dritte Ansatz besteht darin, die lokalen geometrischen Strukturen innerhalb jedes Voxels über eine kernelbasiertes interpoliertes Variations-Autoencoder-Architektur (interpolated variational autoencoder architecture) zu kodieren [98], Statt einer binären Belegungsrepräsentation werden RBFs für jedes Voxel verwendet, um eine kontinuierliche Repräsentation zu erhalten und die Verteilung der Punkte in jedem Voxel zu erfassen. „Variational Auto Encoders“ (VAE) wird weiterverwendet, um die Punktverteilung innerhalb jedes Voxels auf einen kompakten latenten Bereich abzubilden. Anschließend werden beide Symmetriegruppen und ein Äquivalenz-CNN verwendet, um ein robustes Merkmalslernen zu erreichen. Ein viertes Verfahren besteht darin, zunächst geometrische Beziehungen auf verschiedenen Ebenen von Punktwolken hierarchisch abzuleiten und dann eine 3D- Faltungen und Gewichtetes Mittelwert-Pooling zu verwenden, um Merkmale zu extrahieren und weitreichende Abhängigkeiten einzubeziehen. Dieser Verfahren kann großen Punktwolken verarbeiten und hat eine gute Skalierbarkeit im Inferenzprozess (Es heißt Fully-Convolutional Point Network FCPN) [99], Das fünfte Verfahren nutzt die Vorteile der Skalierbarkeit der vierten Verfahren (FCPN) und kann sich während des Trainings und der Tests an unterschiedliche Eingangsdatengrößen anpassen. Eine Grob- zu-Fein-Strategie wurde verwendet, um die Auflösung der vorhergesagten Ergebnisse hierarchisch zu verbessern, so dass die 3D-Scans vervollständigt und semantische Labels pro Voxel vorgenommen werden konnten [100], Die ersten drei Verfahren voxelieren die Punktwolke in ein dichtes Gitter und nutzten dann Standard-3D-Faltung. Bei den letzten beiden Verfahren sind volumenbasierte „3D-Convolutional Neural Network“ (3D-CNN), die ebenfalls volumetrische Repräsentationen sind (Der Schritt der Voxelisierung führt jedoch zwangsläufig zu Diskretisierungsartefakten und Informationsverlusten. Eine hohe Auflösung führt zu hohen Speicher- und Rechenkosten, während eine niedrige Auflösung zu einem Verlust an Details führt).
Bei spärlicher diskretisierter Repräsentationsmethode ist die volumetrische Repräsentation von Natur aus spärlich, da die Anzahl der Nicht-Null-Werte nur einen kleinen Prozentsatz ausmacht, wodurch es ineffizient ist, dichte neuronale Faltungsnetze auf räumlich spärliche Daten anzuwenden. Ein Verfahren ist ein spärliches Faltungsnetzwerke mit Submanifold, das auf einer Indexierungsstruktur basiert. Diese Verfahren reduziert die Speicher- und Rechenkosten erheblich, indem es die Ausgabe der Faltung auf die belegten Voxel beschränkt. Außerdem ermöglicht die spärliche Faltung die Kontrolle über die Spärlichkeit der extrahierten Merkmale. Diese spärliche Submanifold- Faltung eignet sich für die effiziente Verarbeitung von hochdimensionalen und räumlich dünnen Daten [101], Ein weiterer Verfahren ist ein räumlich-zeitliches neuronales 4D- Faltungsnetz für die 3D-Videowahrnehmung, bei dem eine verallgemeinerte spärliche Faltung zur effizienten Verarbeitung hochdimensionaler Daten verwendet wird und außerdem ein trilateral-stationär bedingtes Zufallsfeld zur Durchsetzung der Konsistenz verwendet wird [102], Ein dritter Verfahren verwendet das Sparse Lattice Networks (SPLATNet) auf der Grundlage Bilateral Convolution Layers (BCLs), bei dem die ursprüngliche Punktwolke zunächst in ein permutohedrisches spärliches Gitter (permutohedral sparse lattice) interpoliert wird, dann wird BCL angewandt, um den besetzten Teil des spärlich besiedelten Gitter zu falten, und die gefilterte Ausgabe wird dann zurück zur ursprünglichen Punktwolke interpoliert, was eine flexible gemeinsame Verarbeitung von Bildern und Punktwolken mit mehreren Ansichten ermöglicht [103], Der vierte Verfahren verwendet eine schnelle Faltung des Gitters, indem lokale Geometrie in ein permutohedrisches spärliches Gitter eingebettet werden, wobei der Speicherbedarf gering gehalten wird und eine neuartige Interpolationsmodul eingeführt wird, da Daten gelernt werden, um Gittermerkmale zurück in die Punktwolke zu projizieren [104],
Hybride Ansätze werden zum Lernen multimodaler Merkmale aus 3D-Scans mit einer Reihe von Verfahren verwendet. Ein Verfahren verwendet Ein 3D-CNN-Stream und mehrere 2D-Streams werden zur Extraktion von Merkmalen verwendet, und eine differenzierbare Rückprojektionsschicht wird verwendet, um die gelernten 2D- Einbettungen und geometrischen 3D-Merkmale gemeinsam zu verschmelzen. Dabei handelt es sich um gemeinsames 3D- Multi view- Netzwerk, um RGB-Merkmale und geometrische Merkmale zu kombinieren [105], Ein weiterer Verfahren ist ein einheitlicher punktbasierter Rahmen, der 2D-Texturmerkmale, 3D-Strukturen und globale Kontextmerkmale aus Punktwolken lernt und direkt ein punktbasiertes Netzwerk anwendet, um lokale geometrische Merkmale und globale Kontext aus einem spärlich abgetasteten Punktmengen ohne Voxelisierung zu extrahieren [106], Ein anderes Verfahren ist ein Multi-View PointNet, um Erscheinungsmerkmale aus 2D-Multi-View- Bildern und räumliche geometrische Merkmale im kanonischen Punktwolkenraum zu aggregieren [107],
Bei punktbasierten Ansätzen sind Punktwolken ungeordnet und unstrukturiert, sodass die direkte Anwendung von Standard-CNNs nicht möglich ist. Daher wurde die Pionierarbeit PointNet [108] entwickelt, die mit Hilfe von shared Multilayer Perceptron (MLPs) zum Lernen von Merkmalen pro Punkt und mit Hilfe von symmetrische Pooling-Funktionen zum Lernen globaler Merkmale verwendet. Auf der Grundlage von PointNet wird eine Reihe von punktbasierten Netzwerken entwickelt. Im Allgemeinen lassen sich diese Methoden grob in punktweise MLP-Methoden (Pointwise MLP Methods), Punktfaltungsmethoden (Point Convolution Methods), RNN-basierte Methoden (RNN- based Method) und graphbasierte Methoden (Graph-based Methods) einteilen. Punktbasierte punktweise MLP Methods verwenden Shared MLPs als Grundeinheiten ihrer Netzwerke, um eine hohe Effizienz zu erreichen (Punktähnliche Merkmale, die von einem gemeinsamen MLP extrahiert werden, erfassen jedoch nicht die lokale Geometrie und die Interaktionen zwischen Punkten in einer Punktwolke [108]). Um einen breiteren Kontext für jeden Punkt zu erfassen und reichhaltigere lokale Strukturen zu erlernen, wurden mehrere spezielle Netzwerke eingeführt, darunter Methoden, die auf dem Pooling benachbarter Merkmale, der aufmerksamkeitsbasierten Aggregation und der lokaler- globaler Merkmale basieren.
Punktbasierte punktweise MLP-Methoden, die auf aufmerksamkeitsbasierter Aggregation basieren, haben mehrere Verfahren, um lokale geometrische Muster zu erfassen, die ein Merkmal für jeden Punkt lernen, indem sie die Informationen von lokalen Nachbarpunkten aggregieren. Eine davon, PointNet++ gruppiert Punkte hierarchisch in mehreren Maßstäben und die Gruppierung in mehreren Auflösungen, um die durch die Uneinheitlichkeit und unterschiedliche Dichte der Punktwolke verursachten Probleme zu überwinden, und lernt progressiv von größeren lokalen Regionen [109], Außerdem gibt es ein Verfahren, das Informationen aus acht räumlichen Orientierungen durch eine dreistufige geordnete Faltung stapelt und kodiert. Multiscale Merkmale werden verkettet, um eine Anpassungsfähigkeit an verschiedene Skalen für die Orientierungskodierung und das Skalenbewusstsein zu erreichen [110], Ein anderes Verfahren, das sich von der in PointNet++ verwendeten Gruppierungstechnik (d.h. Kugelabfrage) unterscheidet, verwendet K-means clustering und KNN, um zwei Nachbarschaften im Weltraum und im Merkmalsraum getrennt zu definieren. Basierend auf der Annahme, dass Punkte derselben Klasse im Merkmalsraum näher beieinander erwartet wird, werden ein paarweiser Distanzverlust und ein Schwerpunktverlust eingeführt, um das Merkmalslernen weiter zu regularisieren [111], Das vierte Verfahren verwendet ein Modul Adaptive Feature Adjustment (AFA), um den Informationsaustausch und die Merkmalsverfeinerung zu erreichen. Dieser Aggregationsvorgang hilft dem Netz, eine diskriminierende Merkmalsrepräsentation zu erlernen und um die Interaktionen zwischen verschiedenen Punkten zu modellieren und um die Beziehungen zwischen allen Punktpaaren in einer lokalen Region durch die dichte Konstruktion eines lokal vollständig verknüpften Netzes zu untersuchen [112], Das fünfte Verfahren ist eine permutationsinvariante Faltung auf der Grundlage der Statistik konzentrischer Kugelschalen. Bei dieser Verfahren wird zunächst ein Satz konzentrischer Kugeln mit multiscale abgefragt, dann wird die Max-Pooling-Operation innerhalb verschiedener Schalen zur Zusammenfassung der Statistiken verwendet, und MLPs und 1 D-Faltung werden verwendet, um die endgültige Faltungsausgabe zu erhalten [113], Das sechste Verfahren ist ein effizientes, leichtgewichtiges Netzwerk für die Segmentierung großer Punktwolken. Das Netzwerk nutzt random point sampling und erreicht eine erhebliche Effizienz in Bezug auf Speicher und Berechnungen. Außerdem hat dies Netzwerk ein Modul zur Aggregation lokaler Merkmale, um geometrische Merkmale zu erfassen und zu erhalten [114],
Um die Segmentierungsgenauigkeit weiter zu verbessern, die Punktbasierte punktweise MLP-Methoden, die auf aufmerksamkeitsbasierten Aggregation [115] basieren, eingeführt werden. Ein Verfahren besteht darin, die Beziehung zwischen den Punkten durch eine Gruppen-Shuffle-Attention zu modellieren, wobei ein permutationsinvariantes, aufgabenunabhängiges und unterscheidbares Gumbel Subset Sampling (GSS) den weit verbreiteten FPS-Ansatz ersetzt. Dieses Modul ist weniger empfindlich für Ausreißern und ermöglicht die Auswahl einer repräsentativen Teilmenge von Punkten [116], Ein anderes Verfahren besteht darin, die räumliche Verteilung von Punktwolken besser zu erfassen, indem durch eine Local Spatial Aware (LSA)-Schicht auf der Grundlage der räumlichen Anordnung und der lokalen Struktur der Punktwolken Gewichte für das räumliche Bewusstsein gelernt werden [117], Ein anderes Verfahren, der den Conditional Random Fields (CRF) ähnlich ist, verwendet ein Attention-based Score Refinement (ASR) Modul, um die vom Netz erzeugten Segmentierungsergebnisse nachzubearbeiten. Das ursprüngliche Segmentierungsergebnis wird verfeinert, wobei die Scores der benachbarten Punkte mit gelernten Aufmerksamkeitsgewichten zusammengeführt werden. Dieses Modul kann leicht in bestehende Deep Networks integriert werden, um die Segmentierungsleistung zu verbessern [118], Dritte Punktbasierte punktweise MLP- Methoden, die auf lokaler-globaler Merkmale basieren, hat ein Verfahren, , das vier wiederholt gestapelte Encoder verwendet, wobei jeder Encoder zwei grundlegende Komponenten Edgeconv [119] und NetVLAD [120] hat, um lokale Informationen und globale Merkmale auf Szenenebene zu erfassen, um die lokale Struktur und den globalen Kontext der Punktwolke einzubeziehen [121],
Punktbasierte Punktfaltungsmethoden, die dazu tendieren, effektive Faltungsoperatoren für Punktwolken vorzuschlagen. Ein Verfahren kann einen punktweisen Faltungsoperator verwenden, mit dem benachbarte Punkte in Kernelzellen eingeteilt und dann mit Kernelgewichten gefaltet werden können [122], Ein anderer Ansatz kann durch die Verwendung parametrischer Kernel-Funktionen erreicht werden, die den gesamten kontinuierlichen Vektorraum abdecken und eine parametrische kontinuierliche Faltung (parametric continuous convolution, PCCN) ermöglichen, die auf jeder Datenstruktur gelernt werden kann, die Unterstützungsbeziehungen berechenbar sind [123], Ein weiteres Verfahren ist ein Kernel Point Fully Convolutional Network, das auf Kernel Point Convolution (KPConv) basiert [124], Im Speziellen werden die Faltungsgewichte von KPConv durch die euklidischen Abstände zu den Kernpunkten bestimmt, und die Anzahl der Kernpunkte ist nicht festgelegt. Die Positionen der Kernelpunkte werden als Optimierungsproblem der besten Abdeckung in einem Kugelraum formuliert. Zu beachten ist, dass die Radius-Nachbarschaft verwendet wird, um ein konsistentes rezeptives Feld zu erhalten, während die Unterabtastung des Gitters in jeder Schicht verwendet wird, um eine hohe Robustheit bei variierenden Dichten von Punktwolken zu erreichen. Das nächste Verfahren aggregiert dilatierte benachbarte Merkmale anstelle von K-nearest- neighbours mittels einer Dilated Point Convolution (DPC)-Operation. Dieses Verfahren erwies sich als sehr effektiv bei der Vergrößerung des Wahrnehmungsfeldes und kann leicht in bestehende aggregationsbasierte Netze integriert werden [125],
Um inhärente Kontextmerkmale von Punktwolken zu erfassen, werden auch Recurrent Neural Networks (RNN; deutsch: rekurrentes neuronales Netz) zur semantischen Segmentierung von Punktwolken verwendet. Der RNN-basierten Methoden, der auf Punkten basiert, gibt es mehrere Verfahren. Ein solcher Verfahren basiert auf PointNet [108], wobei ein Punktblock zunächst in Multiskalenblöcke und Gitterblöcke transformiert wird, um Kontexte auf der Eingabeebene zu erhalten. Die von PointNet extrahierten blockweisen Merkmale werden dann nacheinander in eine Consolidation Units (CU) oder Recurrent Consolidation Units (RCU) eingespeist, um den Kontext auf der Ausgangsebene zu erhalten, der die Segmentierungsleistung durch Einbeziehung des räumlichen Kontexts durch diese Verfahren verbessern kann [126], Es gibt auch ein Verfahren zur Umwandlung einer ungeordnete Punktmerkmalsätze in eine geordnete Folge von Merkmalsvektoren durch Verwendung einer Slicing-Pool-Schicht (slice pooling layer) und durch ein leichtgewichtiges Modul zur Modellierung lokaler Abhängigkeiten [127], Ein anderer Ansatz besteht darin, die lokale Struktur von der Grob- bis zur Feinstruktur durch ein Pointwise Pyramid Pooling (3P) -Modul zu erfassen und dann hierarchische RNNs in zwei Richtungen zu verwenden, um weitreichende räumliche Abhängigkeiten zu erhalten. RNNs wird dann eingesetzt, um ein durchgängiges Lernen zu erreichen [128] (bei diesen Methoden gehen jedoch die reichhaltigen geometrischen Merkmale und die Dichteverteilung der Punktwolke verloren, wenn lokale Nachbarschaftsmerkmale mit globalen Strukturmerkmalen zusammengefasst werden). Um die durch die starren und statischen Pooling-Operationen verbundenen Probleme zu mildern, gibt es auch einen Verfahren für dynamische Aggregationsnetzwerke, das sowohl die globale Komplexität der Szene und auch lokale geometrische Merkmale berücksichtigt, indem ein selbstanpassendes rezeptives Feld (self-adapted receptive field) und Knoten-Gewichte verwendet werden, um intermediale Merkmale (inter-medium features) zu aggregieren [129], Ein anderes Verfahren besteht darin, die räumliche Verteilung und die Farbmerkmale mit Hilfe eines 3D-CNN-Netzwerks zu erlernen, und (Deep Q-Learning) DQN wird dann zur Lokalisierung von Objekten verwendet, die einer bestimmten Klasse angehören. Der endgültige konkatenierte Merkmalsvektor wird in ein residuales RNN eingespeist, um das endgültige Segmentierungsergebnis zu erhalten [130],
Schließlich gibt es noch einige Verfahren, die Graph-basierte Methode bei punktbasiertem Ansatz, um die zugrunde liegenden Formen und geometrischen Strukturen von 3D- Punktwolken zu erfassen. Ein solcher Verfahren besteht darin, die Punktwolke als eine Menge miteinander verbundener einfacher Formen und Superpunkte darzustellen und einen attributiven gerichteten Graphen (d. h. den Superpunkt-Graphen) zu verwenden, um die Struktur- und Kontextinformationen zu erfassen. Das Problem der Segmentierung großer Punktwolken wird dann in drei Teilprobleme aufgeteilt, nämlich die geometrisch homogene Segmentierung, die Superpunkten-Einbettung und die kontextuelle Segmentierung [131], Ein anderes Verfahren optimiert die Partitionsschritt der vorherigen Verfahren, indem ein überwachtes Rahmen zur Übersegmentierung der Punktwolke in reine Superpunkte verwendet wird. Dieses Problem wird als ein tiefes metrisches Lernproblem formuliert, das durch einen Adjazenz-Graphen strukturiert ist. Darüber hinaus wird ein graphisch-strukturierter kontrastiver Verlust vorgeschlagen, um die Erkennung von Grenzen zwischen Objekten zu unterstützen [132], Das dritte Verfahren ermöglicht eine bessere Erfassung lokaler geometrischer Beziehungen in hochdimensionalen Space durch ein
PyramNet, das auf dem Graph Embedding Module (GEM) und dem Pyramid Attention Network (PAN) basiert [133], Das GEM-Modul formuliert die Punktwolke als gerichteten azyklischen Graphen und verwendet eine Kovarianzmatrix, um den euklidischen Abstand für die Konstruktion der benachbarten Ähnlichkeitsmatrix zu ersetzten, und im PAN-Modul werden vier verschiedene Faltungskerne verwendet, um Merkmale mit unterschiedlichen semantischen Intensitäten zu extrahieren [133], Bei dem vierten Verfahren wird die relevanten Merkmale durch Graph Attention Convolution (GAC) selektiv aus einem lokalen Nachbarschaftssatz gelernt. Dieser Vorgang wird durch die dynamische Zuweisung von Aufmerksamkeitsgewichten an verschiedene benachbarte Punkte und Merkmalskanäle auf der Grundlage der räumlichen Positionen und Merkmalsunterschiede erreicht. GAC kann lernt, diskriminierende Merkmale für die Segmentierung zu erfassen und hat ähnliche Eigenschaften wie das allgemein verwendete CRF (Conditional Random Field)-Modell [134], Das fünfte Verfahren verwendet ein Point Global Context Reasoning (PointGCR)-Modul, das globale Kontextinformationen entlang der Kanaldimension mit Hilfe einer ungerichteten Graphendarstellung erfasst. PointGCR ist ein Plug-and-Play und End-To-End trainierbar Modul und kann leicht in ein bestehendes Segmentierungsnetz integriert werden, um die Leistung zu verbessern [135], Es gibt auch einige Verfahren zur Umsetzung der semantischen Segmentierung von Punktwolken unter schwacher Überwachung, wie ein zweistufiges Vorgehen zum Trainieren eines Segmentierungsnetzes mit Labels auf Teilwolkenebene (subcloud level labels) [136] und ein Netzwerk, das mit teilweise gelabelten Punkten (partially labeled points) (z. B. 10 %) für ein ungenaues überwachtes Verfahren zur semantischen Segmentierung von Punktwolken trainiert werden kann [137],
Fig. 5 zeigt verschiedene Methode der Ansätze und Gruppe zur semantischen Segmentierung von Punktwolken (Point Cloud Semantic Segmentation, PCSS; deutsch: semantische Punktwolkensegmentierung).
Insbesondere zeigt Fig. 5 die verschiedene Methode der Ansätze und Gruppe zur semantischen Segmentierung von Punktwolken. Ausführungsformen umfassen die oben genannten Methoden und Verfahren, ist aber nicht darauf beschränkt, um den ersten Schritt der Entfernung von Umgebungsgeräuschinformationen aus der 3D-Punktwolken zu erreichen, die nicht mit der Kategorie des Zielobjekts übereinstimmen. Fig. 6 zeigt das Ergebnis der Durchführung dieses Schritts gemäß Ausführungsformen.
So zeigt Fig. 6 das Ergebnis nach der Entfernung von Umgebungsrauschinformationen, die nicht die Kategorie des Zielobjekts durch PCSS sind Punktwolken der gleichen Kategorie (Gebäude) können mit der oben beschriebenen Methode ermittelt werden. Manche Ausführungsformen ermöglichen eine automatische Rauschunterdrückung auf der Grundlage der Dichte und der Abstände der Punktwolken mit Hilfe eines Clustering- Algorithmus bei bestimmten Abständen oder einer Histogramm Statistik der x-, y- und z- Achsenkoordinaten der Punktwolken. Nach diesem Schritt sind die Ergebnisse in Fig. 7 zu sehen, wo die Extraktion des Zielgebäudes erreicht wird. So zeigt Fig. 7 das Zielobjekt ohne weitere Gebäude. Nach der Extraktion der Zielgebäude gibt es einen sehr kleinen Genauigkeitsfehler aufgrund der semantischen Segmentierung. Um diesen Genauigkeitsfehler zu vermeiden, besteht eine weitere wirksame Umsetzung mancher Ausführungsformen darin, die Grenzen der verschiedenen Ansichten des Zielgebäudes zu extrahieren und dann die Grenzinformationen zu verwenden, um die ursprünglichen Punktwolkendaten zu segmentieren, so dass die Punktwolkendaten des Zielgebäudes ohne Fehler erhalten werden können.
Eine weitere vorteilhafte Ausführungsform besteht in der Instanz Segmentierung von Punktwolken (Point Cloud Instance Segmentation, PCIS) des ganzen Zielgebäudes oder der Fabrik, wobei die Ziele der Instanz Segmentierung hauptsächlich Treppenhäuser, Aufzugsschächte, Innenräume und Außenwände des Zielgebäudes sowie die Türen und Fenster an den Außenwänden des Zielgebäudes sind. Die ist auch der dritte Schritt einer Ausführunsform. Durch dieses Verfahren wird zunächst der Einfluss von Treppenhäusern und Aufzugsschächten auf die Bestimmung der Geschosshöhen eliminiert, dann werden aus den Höhen der Innenräume die Geschosshöhen und Dachhöhen jeder Etage des gesamten Gebäudes oder der Fabrik ermittelt. Nachfolgend werden die Punktwolken der Fenster und Türen an den Außenwänden verwendet, um die geometrischen Parameter und Positionen der Fenster und Türen zu erhalten.
Um mit hoher Genauigkeit modellieren zu können, ist eine weitere vorteilhafte Ausführungsform die PCIS der verschiedenen Räume eines Hauses oder einer Fabrik, wie Wände, verschiedene Möbelstücke (Stühle, Tische, Schränke, PCs usw.) und Werkzeugmaschinen, Material usw. in der Fabrik. Dies ist der Hauptschritt des vierten Schritts einer Ausführungsform, der dann die Bestimmung der geometrischen Parameter und der Position dieser Objekte mit Hilfe unserer Algorithmen und später mit Hilfe der Algorithmen dieser Ausführunsform ermöglicht die Rekonstruktion eines hochdetaillierten Geometrisches Modell, wie BIM, CAD usw.
Die beiden oben genannten Ausführungsformen beruhen beide auf der Instanz Segmentierung von Punktwolken. Als Segmentierungsmethode auf Objektebene bedeutet dies auch, dass sie eine größere Herausforderung darstellt als die semantische Segmentierung, da sie genauere und feinere Argumentation auf Punkte ziehen sollte. PCIS sollte nicht nur zwischen Punkten mit unterschiedlicher Semantik unterscheiden, sondern auch zwischen Instanzen mit der gleichen semantischen Information. Es gibt zwei Hauptarten der Instanz Segmentierung, vorschlagsbasierte Methoden (Proposalbased Methode) und vorschlagsfreie Methoden (Proposal-free Methode). Bei der vorschlagsbasierten Methode wird zunächst die Kategorie einer Gruppe von Objekten vorhergesagt, d. h. es werden Vorschläge generiert, was eine ähnliche Wirkung wie die Objekterkennung hat, und dann wird in jeder Bounding Box eine Vordergrund- Hintergrund-Segmentierung durchgeführt. Bei der vorschlagsfreien Methode entfällt der Schritt der Vorschlagserstellung.
Wie bereits erwähnt, wandelt die vorschlagsbasierte Methode (Proposal-based Methode) das Problem der Instanz Segmentierung in zwei Teilaufgaben um: 3D-Objekterkennung und Vorhersage der Instanz Maske. Einer Verfahren ist die Verwendung eines 3D fully- convolutional Semantic Instance Segmentation (3D-SIS) zur Durchführung der semantischen Instanzsegmentierung für RGB-D-Scans. Dieses Netzwerk lernt sowohl aus farblichen und geometrischen Merkmalen. Ähnlich wie bei der 3D-Objekterkennung werden ein 3D Region Proposal Network (3DRPN) und eine 3D Region of Interesting (3D- Rol) Schicht zur Vorhersage von Bounding-Box-Positionen, Objektklassenbezeichnungen und Instanz Masken verwendet [138], Ein anderer Verfahren verfolgt die Analyse-durch- Synthese-Strategie (analysis-by-synthesis strategy), mit Hilfe eines Generative Shape Suggestion Network (GSPN) über eine synthetische Analyse 3D-Vorschläge mit hoher Objektivität zu generieren [139], Diese Vorschläge werden durch ein Region-based PointNet (R-PointNet) weiter verfeinert. Die endgültige Bezeichnung wird durch die Vorhersage einer binären Maske pro Punkt für jede Klassenbezeichnung ermittelt. Anders als bei der direkten Regression von 3D Bounding Boxes aus Punktwolken wird bei dieser Methode eine große Menge an bedeutungslosen Vorschlägen entfernt, indem ein geometrisches Verständnis erzwungen wird. Ein weiterer Verfahren ist die Implementierung eines volumetrischen Online-3D-Kartierungssystems durch die Erweiterung der panoptischen 2D-Segmentierung auf die 3D-Kartierung, um gemeinsam eine groß angelegte 3D-Rekonstruktion, semantische Kennzeichnung und Instanz Segmentierung gemeinsam zu erreichen. Der Verfahren verwendet zunächst 2D-Semantik- und Instanz Segmentierung-Netzwerke, um pixelweise panoptische Kennzeichnungen zu erhalten, und integrierten diese Kennzeichnungen dann in die volumetrische Karte. Eine vollständig verknüpfte Conditional Random Fields (CRF) wird weiterverwendet, um eine genaue Segmentierung zu erreichen. Dieses semantische Mapping-System kann eine qualitativ hochwertige semantische Zuordnung und diskriminierende Objekterkennung erreichen [140], Ein vierter Verfahren ist ein einstufiges, ankerfreies und end-to-end trainierbares Netzwerk namens 3D-BoNet vor, um eine Instanz-Segmentierung auf Punktwolken zu erreichen. Dieser Verfahren regressiert direkt grobe 3D Bounding Boxes für alle potenziellen Instanzen und verwendet dann einen binären Klassifikator auf Punktebene, um Instanz Kennzeichnungen zu erhalten. Insbesondere wird die Aufgabe der Generierung von Bounding Boxes als ein optimales Zuordnungsproblem formuliert. Darüber hinaus wird eine multikriterielle Verlustfunktion vorgeschlagen, um die generierten Bounding Boxes zu regulieren. Diese Methode erfordert keine Nachbearbeitung und ist rechnerisch effizient [141], Der fünfte Verfahren ist ein Netzwerk für die Instanz-Segmentierung von großflächigen LiDAR-Punktwolken im Outdoor- Bereich vor. Dieser Verfahren erlernt eine Merkmalsdarstellung in der Vogelperspektive von Punktwolken unter Verwendung von Self-Attention-Blöcken. Die endgültigen Instanz Beschriftungen werden auf der Grundlage des vorhergesagten horizontalen Mittelpunkts und der Höhengrenzen ermittelt [142], Der sechste Verfahren ist die Vorhersage des Layouts eines 3D-Räumen in Innenräumen mit Hilfe eines hierarchiebewussten Variational Denoising Recursive AutoEncoder (VDRAE). Die Objektvorhersagen werden iterativ generiert und durch rekursive Kontextaggregation und Propagation verfeinert [143], Die vorgeschlagenen Methoden [138,139,141,144] sind intuitiv und einfach, und die Ergebnisse der Instanz Segmentierung sind in der Regel von guter Objektivität. Allerdings erfordern diese Verfahren vorgeschlagener Methode ein mehrstufiges Training und das Herausfiltern redundanter Vorschläge. Daher sind sie in der Regel zeitaufwändig und rechenintensiv.
Vorschlagsfreie Methoden (Proposal-free Methode) verfügen nicht über Generierung von Vorschlägen, d.h. kein Modul zu den Objekten Vorhersagen. Stattdessen betrachten sie die Instanz Segmentierung in der Regel als einen nachfolgenden Clustering-Schritt nach der semantischen Segmentierung. Insbesondere basieren die meisten existierenden Methoden auf der Annahme, dass Punkte, die zur selben Instanz gehören, sehr ähnliche Merkmale aufweisen sollten. Daher konzentrieren sich diese Methoden hauptsächlich auf das Erlernen diskriminierender Merkmale und die Gruppierung von Punkten. Insbesondere basieren die meisten existierenden Methoden auf der Annahme, dass Punkte, die zur selben Instanz gehören, sehr ähnliche Merkmale aufweisen sollten. Daher konzentrieren sich diese Methoden hauptsächlich auf das Erlernen diskriminierender Merkmale und die Gruppierung von Punkten. Einer Verfahren ist Similarity Group Proposal Network (SGPN). Diese Methode lernt zunächst ein Merkmal und eine semantische Karte für jeden Punkt und führt dann eine Ähnlichkeitsmatrix ein, um die Ähnlichkeit zwischen jedem Merkmalspaar darzustellen. Um weitere diskriminierende Merkmale zu lernen, wird ein Doppelscharnierverlust verwendet, um die Ähnlichkeitsmatrix und die semantischen Segmentierungsergebnisse gegenseitig anzupassen. Schließlich wird eine heuristische und nichtmaximale Suppressionsmethode eingesetzt, um ähnliche Punkte zu Instanzen zusammenzufassen. Da die Erstellung einer Ähnlichkeitsmatrix einen hohen Speicherbedarf erfordert, ist die Skalierbarkeit dieser Methode begrenzt [145], Der zweite Verfahren verwendet die Sparse Convolution [101] von Submanifolds, um semantische Werte für jedes Voxel und die Affinität zwischen benachbarten Voxeln vorherzusagen. Ein Clustering-Algorithmus wird dann verwendet, um Punkte auf der Grundlage der vorhergesagten Affinitäten und der Netztopologie in Instanzen zu gruppieren [146], Ein anderer Verfahren verwendet einen strukturbewussten Verlust für das Lernen von diskriminierenden Einbettungen. Dieser Verlust berücksichtigt sowohl die Ähnlichkeit der Merkmale als auch die geometrischen Beziehungen zwischen den Punkten. Ein aufmerksamkeitsbasiertes Graphen-CNN wurde außerdem zur adaptiven Verfeinerung der gelernten Merkmale verwendet, indem verschiedene Informationen von Nachbarn zusammengefasst wurden [147], Da die semantische Kategorie und die Instanz Label eines Punktes in der Regel voneinander abhängig sind, wurden mehrere Verfahren vorgeschlagen, um diese beiden Aufgaben zu einer einzigen Aufgabe zu verbinden. Einer Verfahren zubesteht darin, die beiden Aufgaben durch die Einführung eines End-to-End und lernfähigen Moduls zur assoziativen Segmentierung von Instanzen und Semantik (ASIS) integriert. Experimente zeigen, dass semantische Merkmale und Instanz Merkmale sich gegenseitig unterstützen können, um durch dieses ASIS-Modul eine verbesserte Performance zu erzielen [148], Einer andere neuartige kombinierte Verfahren zur Implementierung der Instanz- und semantischen Segmentierung ist JSNet [149], Ein alternativer Verfahren ist die MultiTask Pointwise Network (MT-PNet), um jedem Punkt ein Label zuzuweisen und regularisierten die Einbettungen im Merkmalsraum durch Einführung eines diskriminierenden Verlusts [150], Anschließend fusionierten es die vorhergesagten semantischen Bezeichnungen und Einbettungen mit einem MV-CRF-Modell (Multi-Value Conditional Random Field) zur gemeinsamen Optimierung. Schließlich wird die Variationsinferenz des mittleren Feldes verwendet, um semantische Labels und Instanz- Labels zu erzeugen [151], Ein anderer Verfahren ist mit Hilfe eines Dynamic Region Growing der Punktwolke (DRG) in eine Reihe von unzusammenhängender Flecken aufzuteilen, und verwendeten dann einen unüberwachten Kmeans++ Algorithmus, um alle diese Flecken zu gruppieren. Die mehrstufige Segmentierung der Flecken wird dann mit Hilfe von Kontextinformationen zwischen den Flecken durchgeführt. Schließlich werden diese beschrifteten Flecken auf Objektebene zusammengeführt, um endgültige semantische Labels und Instanz Labels zu erhalten [152], Ein weiterer Verfahren, um eine Instanz Segmentierung in vollständigen 3D-Szenen zu erreichen, ist ein hybrides 2D-3D-Netzwerk, um gemeinsam globale konsistente Instanz Merkmale aus einer BEV-Darstellung und lokale geometrische Merkmale von Punktwolken zu lernen. Die gelernten Merkmale werden dann kombiniert, um eine Semantik und Instanz Segmentierung zu erreichen [153], Ein weiterer Verfahren besteht darin, die abstrakte Merkmalseinbettung der einzelnen Instanzen und die Richtungsinformation des Instanzzentrums für jedes Voxel zu lernen. Der Verlust der Merkmalseinbettung und der Richtungsverlust werden vorgeschlagen, um die erlernten Merkmalseinbettungen im latenten Merkmalsraum anzupassen. Mean-Shift-Clustering und nichtmaximale Unterdrückung werden eingesetzt, um Voxel in Instanzen zu gruppieren [154], Der andere Verfahren besteht aus einem Zweig für die semantische Segmentierungszweig und Offset-Vorhersage-Zweig. Ein Dual-Set-Clustering-Algorithmus und das ScoreNet werden weiter verwendet, um bessere Gruppierungsergebnisse zu erzielen [155], Bei einem anderen Verfahren wird aus den semantischen Merkmalen der gelernten Superpoint ein semantic Superpoint Tree (SST) konstruiert, der dann an den Knoten des Zwischenbaums durchlaufen und segmentiert wird, um Objektinstanzen vorzuschlagen. Dieser Verfahren wird durch ein Verfeinerungsmodul CliqueNet ergänzt, um die Superpoint zu bereinigen, die fälschlicherweise als Instanz Vorschläge klassifiziert werden könnten [156],
Fig. 8 zeigt verschiedene Methode zur Instanz-Segmentierung von Punktwolken (Point Cloud Instance Segmentation, PCIS). Ausführungsformen umfassen die oben genannten Methoden und Verfahren im Zusammenhang mit Algorithmen, die eine Segmentierung von Instanzen auf Objektebene implementieren sollten.
Alle oben genannten semantischen Segmentierungen von Punktwolken und die Instanz Segmentierung von Punktwolkeninstanzen auf der Grundlage von Deep Learning und überwachtem Lernen erfordern eine gute Datenbankunterstützung, um durch Training hervorragende Segmentierungsgenauigkeit und -ergebnisse für den industriellen Einsatz zu erzielen. Da unsere Datenbank ständig erweitert wird und manuell korrigiert werden kann, wird sie mit zunehmender Anzahl von Segmentierungen und Anwendungen immer nützlicher. Darüber hinaus kann die Datenbank des Segmentierungsalgorithmus in verschiedenen Schritten gemäß einer Ausführungsform auch durch den Aufbau einer Punktwolkendatenbank aus vorhandenen geometrischen Modellen erweitert werden, die zur Verbesserung der Segmentierungsgenauigkeit des Algorithmus verwendet werden kann.
Nach diesen Schritten ist der erfindungsgemäße Algorithmus zur Bestimmung der geometrischen Parameter, der Position und der Ausrichtung eines Objekts im Innenraum des Gebäudes sowie der einzelnen Wände, Fenster und Türen des Gebäudes in der Lage, z. B. die Dicke der Wände, die Anfangs- und Endpunkte usw. Mit diesen Parametern ist es möglich, Schnittstellen zu verschiedenen Zeichnungssoftwareprogrammen aufzubauen und dann die Modellierung entsprechend den Verfahren der Zeichnungssoftware zu automatisieren.
Eine rein auf geometrischen Eigenschaften der in der Punktwolke enthaltenen Objekte beruhende Rückführung ist stark wartungsintensiv und der initiale Aufwand alle Objekte regelbasiert zu beschreiben, um sie dann automatisiert erkennen zu können, ist nicht wirtschaftlich. Daher ist es notwendig die geometriebasierten Algorithmen um Kl-basierte Algorithmen zu erweitern und einen hybriden Prozess zu schaffen. Der Ablauf des hybriden Prozesses ist in Fig. 9 dargestellt. So zeigt Fig. 9 einen Ablauf des Rückführungsprozesses.
Es sollte z.B. ein eindeutiges Mapping zwischen den im Autorensystem, zur Modellierung der 3D-Modelle, notwendigen Parametern und den „real“, als virtualisierte Punktwolke, vorliegenden Parametern der Betrachtungsobjekte geben. Nur so ist sichergestellt, dass die notwendigen Parameter bereits vor der Übertragung aus der Punktwolke extrahiert werden. Somit soll es möglich sein einen neutralen „Bauplan“ zur Übertragung zwischen Punktwolke und Autorensystemen zu gewährleisten.
Die Software sollte z.B. Endnutzern zugänglich sein, durch eine einfache Installationsmöglichkeit. Die Randbedingungen, Bibliotheken und Hilfsprogramme sollten ohne Nutzereingaben gesetzt bzw. eingebunden werden können. Die optionalen Schnittstellen zu externen Software-APIs ermöglichen die Integration des Frameworks in bestehende Software-Umgebungen. Um den Bedürfnissen der einzelnen technischen Anwendungen gerecht zu werden, sind verschiedene Implementierungen denkbar. Abhängig von den gegebenen Bedingungen kann es entweder Open-Source-basiert sein oder in einer proprietären Software in einer geeigneten Programmiersprache implementiert werden. Für den vorliegenden Anwendungsfall werden beispielsweise Anbindungen an die proprietären Softwareprodukte Revit und ArchiCAD benötigt, die das gewünschte Frontend für den Endanwender darstellen.
Der Virtuelle Bauplan ist die Grundlage zur automatisierten Modellierung der 3D-BIM Modelle in den Autorensystemen. Er enthält alle notwendigen Parameter und wird über eine Schnittstelle zum Autorensystem übertragen. Die Modellierung läuft nach dem im Bauplan hinterlegten Schema unter Einbeziehung der hinterlegten Parameter ab. Das Ergebnis ist ein 3D-BIM Modell. Dieses stellt die virtuelle Repräsentation der realen Ausgangsszene dar.
Nachfolgend wird Trainings-Daten-Augmentation (englisch: Training Data Augmentation) gemäß einer Ausführungsform beschrieben.
So wird die Punktwolke der angegebenen Boxgröße (z.B. Quadergröße) in der Originalszene wird während des Trainings nacheinander extrahiert (die Boxgröße kann anhand der Hardware verändern werden). Es erfolgt eine Online-Daten-Augmentation der Punktwolken in den Boxen. Beispielsweise kann die Punktwolkenbox z.B: 100 Mal nach dem Zufallsprinzip aus der gesamten Szene extrahiert werden. Hierdurch wird eine Lösung für das Problem des Trainings großer Szenen auf begrenzter Hardware erzielt.
Fig. 10 zeigt eine solche Extraktion von Boxen (quaderförmigen Teilbereichen) der Punktwolke gemäß einer Ausführungsform, um Trainingsdaten zu erhalten.
Zur Online-Daten-Augmentation gemäß einer Ausführungsform kann z.B. ein Downsampling auf der Grundlage verschiedener Kategorien in verschiedenen Gebäuden mit unterschiedlichen Voxelgrößen erfolgen. Größere Voxel können dabei z.B. für Kategorien mit mehr Punkten und kleinere Voxel für Kategorien mit z.B. weniger Punkten festgelegt werden.
Beispielsweise kann (z.B. um eine größere Anzahl von Trainingsdatensätzen zu erzeugen), ein Translations-Dithering für das gesamte Gebäude und/oder eine 360-Grad- Drehung um das gesamte Gebäude und/oder eine zufällige Skalierung für das gesamte Gebäude und/oder eine elastische Verformung des gesamten Gebäudes eingesetzt werden. Und/oder es kann die oben beschriebene Daten-Augmentation und/oder Kreuzkombination eingesetzt werden.
Fig. 11 zeigt eine Visualisierung der Daten-Augmentation gemäß einem ersten ausführungsgemäßem Beispiel.
Fig. 12 zeigt eine Visualisierung der Daten-Augmentation gemäß einem zweiten ausführungsgemäßem Beispiel.
Architektinnen werden aktuell und in den nächsten Jahren mehr und mehr mit Umbauten von Bestandsgebäuden beauftragt. Dabei werden sie aktuell vor zwei Probleme gestellt. Zum einen sollten sie einen möglichst exakten Bestandsplan des umzubauenden Gebäudes erstellen. Zum anderen ist seit dem Jahr 2020 in Deutschland Building Information Model (BIM) erforderlicher Standard für alle öffentlichen Bauprojekte.
Diese Umstellung und eine genaue Gebäudevermessung sowie die zugehörige Datenverarbeitung stellt Architektinnen immer wieder vor große Schwierigkeiten. Dies ist oftmals der Fall, da viele von ihnen noch mit veralteten Techniken und Prinzipien arbeiten, die mit dem neuen BIM-Standard überholt werden. Belegt wird dies mit einer Studie der Architektenkammer NRW, die besagt, dass im Jahr 2018 lediglich 10 % aller Architektinnen mit dem Building Information Model gearbeitet haben.
Ausführungsformen bieten den Architektinnen die Möglichkeit, diese Probleme zu lösen. Durch die automatisierte Gebäudemodellierung können Architektinnen und Projektentwicklerinnen auf Knopfdruck Stunden an Arbeitszeit einsparen und die großen Probleme, zu wenig Zeit und Budget, dadurch verringern. So kann direkt mit der eigentlichen Wertschöpfung, der Planung der Baumaßnahmen begonnen werden. Zusätzlich sollen Ausführungsformen die Möglichkeit bieten, die Genauigkeit des rückgeführten Modells zu prüfen, zu quantifizieren und zu validieren. Im bisherigen manuellen Prozess wird die Positionierung von Gebäudeelementen im virtuellen Modell per Augenmaß durchgeführt. Dies stellt eine mögliche Fehlerquelle in der Qualität des Modells dar, die durch Algorithmen minimiert oder sogar ausgeschlossen werden kann. Eine schnelle visuelle und quantitative Prüfung der Ergebnisse erzeugt ein hohes Vertrauen des Anwenders in die Qualität des Modells, die für weiterführende Planungsprozesse zwingend erforderlich ist.
Technisches Anwendungsgebiete von Ausführungsformen liegen in einer Nutzung für die Erzeugung von 3D-BIM für Gebäude und Industrieanlagen und Infrastrukturen für das serielle Sanieren, Sanieren allgemein, Bauplanung, Bauprozesse allgemein, Versicherungsdienstleistungen, Schadensanalysen und -Vorhersagen, Visualisierungen (XR), etc. Weitere Anwendungsgebiete liegen in der Erzeugung von 3D-BIM des aktuellen Zustandes/Baufortschritts von Gebäuden und Industrieanlagen und Infrastrukturen, des Weiteren in der Erzeugung von 3D-BIM von Infrastruktur, ferner in der Erzeugung von Smart City Modellen. Weitere Anwendungsfälle liegen in der Erzeugung von 3D-BIM von einzelnen Räumen und in der Erzeugung von Innenraummodellen für Häuser oder Wohnungen, um Designern die Gestaltung der Inneneinrichtung zu erleichtern. Ferner liegen Anwendungsfelder in der Erzeugung von 3D-BIM von Fertigungsanlagen, -linien und Fabriken sowie der darin enthaltenen Fertigungs- und Betriebsmittel, in der Erzeugung von entsprechenden FE-Netzen als Input für FE-Analysen der zuvor genannten Modelle und in der Erzeugung von entsprechenden digitalen Zwillingen der zuvor genannten Modelle. Ein weiteres Anwendungsfeld liegt in der Erzeugung von aktuellen 3D-Modellen des Zustands von Gebäuden oder Industrieanlagen oder Infrastrukturen. Auf dieser Grundlage können Algorithmen für Netzabdeckung und - Verluste, Antennenvorhersage und Installationssimulation, loT-Einführung und Energiemanagement eingesetzt werden.
Obwohl manche Aspekte im Zusammenhang mit einer Vorrichtung beschrieben wurden, versteht es sich, dass diese Aspekte auch eine Beschreibung des entsprechenden Verfahrens darstellen, sodass ein Block oder ein Bauelement einer Vorrichtung auch als ein entsprechender Verfahrensschritt oder als ein Merkmal eines Verfahrensschrittes zu verstehen ist. Analog dazu stellen Aspekte, die im Zusammenhang mit einem oder als ein Verfahrensschritt beschrieben wurden, auch eine Beschreibung eines entsprechenden Blocks oder Details oder Merkmals einer entsprechenden Vorrichtung dar. Einige oder alle der Verfahrensschritte können durch einen Hardware-Apparat (oder unter Verwendung eines Hardware-Apparats), wie zum Beispiel einen Mikroprozessor, einen programmierbaren Computer oder einer elektronischen Schaltung durchgeführt werden. Bei einigen Ausführungsbeispielen können einige oder mehrere der wichtigsten Verfahrensschritte durch einen solchen Apparat ausgeführt werden.
Je nach bestimmten Implementierungsanforderungen können Ausführungsbeispiele der Erfindung in Hardware oder in Software oder zumindest teilweise in Hardware oder zumindest teilweise in Software implementiert sein. Die Implementierung kann unter Verwendung eines digitalen Speichermediums, beispielsweise einer Floppy-Disk, einer DVD, einer BluRay Disc, einer CD, eines ROM, eines PROM, eines EPROM, eines EEPROM oder eines FLASH-Speichers, einer Festplatte oder eines anderen magnetischen oder optischen Speichers durchgeführt werden, auf dem elektronisch lesbare Steuersignale gespeichert sind, die mit einem programmierbaren Computersystem derart Zusammenwirken können oder Zusammenwirken, dass das jeweilige Verfahren durchgeführt wird. Deshalb kann das digitale Speichermedium computerlesbar sein.
Manche Ausführungsbeispiele gemäß der Erfindung umfassen also einen Datenträger, der elektronisch lesbare Steuersignale aufweist, die in der Lage sind, mit einem programmierbaren Computersystem derart zusammenzuwirken, dass eines der hierin beschriebenen Verfahren durchgeführt wird.
Allgemein können Ausführungsbeispiele der vorliegenden Erfindung als Computerprogrammprodukt mit einem Programmcode implementiert sein, wobei der Programmcode dahin gehend wirksam ist, eines der Verfahren durchzuführen, wenn das Computerprogrammprodukt auf einem Computer abläuft.
Der Programmcode kann beispielsweise auch auf einem maschinenlesbaren Träger gespeichert sein.
Andere Ausführungsbeispiele umfassen das Computerprogramm zum Durchführen eines der hierin beschriebenen Verfahren, wobei das Computerprogramm auf einem maschinen-lesbaren Träger gespeichert ist. Mit anderen Worten ist ein Ausführungsbeispiel des erfindungsgemäßen Verfahrens somit ein Computerprogramm, das einen Programmcode zum Durchführen eines der hierin beschriebenen Verfahren aufweist, wenn das Computerprogramm auf einem Computer abläuft. Ein weiteres Ausführungsbeispiel der erfindungsgemäßen Verfahren ist somit ein Datenträger (oder ein digitales Speichermedium oder ein computerlesbares Medium), auf dem das Computerprogramm zum Durchführen eines der hierin beschriebenen Verfahren aufgezeichnet ist. Der Datenträger oder das digitale Speichermedium oder das computerlesbare Medium sind typischerweise greifbar und/oder nicht flüchtig.
Ein weiteres Ausführungsbeispiel des erfindungsgemäßen Verfahrens ist somit ein Datenstrom oder eine Sequenz von Signalen, der bzw. die das Computerprogramm zum Durchführen eines der hierin beschriebenen Verfahren darstellt bzw. darstellen. Der Datenstrom oder die Sequenz von Signalen kann bzw. können beispielsweise dahin gehend konfiguriert sein, über eine Datenkommunikationsverbindung, beispielsweise über das Internet, transferiert zu werden.
Ein weiteres Ausführungsbeispiel umfasst eine Verarbeitungseinrichtung, beispielsweise einen Computer oder ein programmierbares Logikbauelement, die dahin gehend konfiguriert oder angepasst ist, eines der hierin beschriebenen Verfahren durchzuführen.
Ein weiteres Ausführungsbeispiel umfasst einen Computer, auf dem das Computerprogramm zum Durchführen eines der hierin beschriebenen Verfahren installiert ist.
Ein weiteres Ausführungsbeispiel gemäß der Erfindung umfasst eine Vorrichtung oder ein System, die bzw. das ausgelegt ist, um ein Computerprogramm zur Durchführung zumindest eines der hierin beschriebenen Verfahren zu einem Empfänger zu übertragen. Die Übertragung kann beispielsweise elektronisch oder optisch erfolgen. Der Empfänger kann beispielsweise ein Computer, ein Mobilgerät, ein Speichergerät oder eine ähnliche Vorrichtung sein. Die Vorrichtung oder das System kann beispielsweise einen Datei- Server zur Übertragung des Computerprogramms zu dem Empfänger umfassen.
Bei manchen Ausführungsbeispielen kann ein programmierbares Logikbauelement (beispielsweise ein feldprogrammierbares Gatterarray, ein FPGA) dazu verwendet werden, manche oder alle Funktionalitäten der hierin beschriebenen Verfahren durchzuführen. Bei manchen Ausführungsbeispielen kann ein feldprogrammierbares Gatterarray mit einem Mikroprozessor Zusammenwirken, um eines der hierin beschriebenen Verfahren durchzuführen. Allgemein werden die Verfahren bei einigen Ausführungsbeispielen seitens einer beliebigen Hardwarevorrichtung durchgeführt. Diese kann eine universell einsetzbare Hardware wie ein Computerprozessor (CPU) sein oder für das Verfahren spezifische Hardware, wie beispielsweise ein ASIC. Die oben beschriebenen Ausführungsbeispiele stellen lediglich eine Veranschaulichung der Prinzipien der vorliegenden Erfindung dar. Es versteht sich, dass Modifikationen und Variationen der hierin beschriebenen Anordnungen und Einzelheiten anderen Fachleuten einleuchten werden. Deshalb ist beabsichtigt, dass die Erfindung lediglich durch den Schutzumfang der nachstehenden Patentansprüche und nicht durch die spezifischen Einzelheiten, die anhand der Beschreibung und der Erläuterung der Ausführungsbeispiele hierin präsentiert wurden, beschränkt sei.
Literatur:
[1] B. Becerik-Gerber, F. Jazizadeh, N. Li, G. Calis, Application Areasand Data Requirements for BIM- Enabled Facilities Management, J. Constr. Eng. Manage. 138 (2012) 431-442.
[2] S. Azhar, Building Information Modeling (BIM): Trends, Benefits, Risks, and Challenges for the AEC Industry, Leadership Manage. Eng. 11 (2011) 241-252.
[3] R. Volk, J. Stengel, F. Schultmann, Building Information Modeling (BIM) for existing buildings — Literature review and future needs, Automation in Construction 38 (2014) 109-127.
[4] Y. Deng, J.C. Cheng, C. Anumba, Mapping between BIM and 3D GIS in different levels of detail using schema mediation and instance comparison, Automation in Construction 67 (2016) 1-21.
[5] X. Xiong, A. Adan, B. Akinci, D. Huber, Automatic creation of semantically rich 3D building models from laser scanner data, Automation in Construction 31 (2013) 325-337.
[6] S.M. Sepasgozar, S. Lim, S. Shirowzhan, Y.M. Kim, Implementation of As-Built Information Modelling Using Mobile and Terrestrial Lidar Systems, in: Q. Ha, X. Shen, A. Akbarnezhad (Eds.), Proceedings of the 31st International Symposium on Automation and Robotics in Construction and Mining (ISARC), International Association for Automation and Robotics in Construction (IAARC), 2014.
[7] S. Ochmann, R. Vock, R. Wessel, R. Klein, Automatic reconstruction of parametric building models from indoor point clouds, Computers & Graphics 54 (2016) 94- 103.
[8] C. Mura, O. Mattausch, A. Jaspe Villanueva, E. Gobbetti, R. Pajarola, Automatic room detection and reconstruction in cluttered indoor environments with complex room layouts, Computers & Graphics 44 (2014) 20-32. [9] C. Mura, O. Mattausch, R. Pajarola, Piecewise-planar Reconstruction of Multiroom Interiors with Arbitrary Wall Arrangements, Computer Graphics Forum 35 (2016) 179-188.
[10] C. So, G. Baciu, H. Sun, Reconstruction of 3D virtual buildings from 2D architectural floor plans, in: J.M. Shieh, S.-N. Yang (Eds.), Proceedings of the ACM symposium on Virtual reality software and technology 1998 -VRST '98, ACM Press, New York, New York, USA, 1998, pp. 17-23.
[11] T. Lu, C.-L. Tai, L. Bao, F. Su, S. Cai, 3D Reconstruction of Detailed Buildings from Architectural Drawings, Computer-Aided Design and Applications 2 (2005) 527-536.
[12] S. Lee, D. Feng, C. Grimm, B. Gooch, A Sketch-Based User Interface for Reconstructing Architectural Drawings, Computer Graphics Forum 27 (2008) SI- 90.
[13] T. Li, B. Shu, X. Qiu, Z. Wang, Efficient reconstruction from architectural drawings, IJCAT 38 (2010) 177.
[14] D.G. Lowe, Distinctive Image Features from Scale-Invariant Keypoints, International Journal of Computer Vision 60 (2004) 91-110.
[15] Y.-F. Liu, S. Cho, B.F. Spencer, J.-S. Fan, Concrete Crack Assessment Using Digital Image Processing and 3D Scene Reconstruction, J. Comput. Civ. Eng. 30 (2016) 4014124.
[16] M. Golparvar-Fard, F. Peha-Mora, S. Savarese, Automated Progress Monitoring Using Unordered Daily Construction Photographs and I FC-Based Building Information Models, J. Comput. Civ. Eng. 29 (2015) 4014025.
[17] A. Khaloo, D. Lattanzi, Hierarchical Dense Structure-from-Motion Reconstructions for Infrastructure Condition Assessment, J. Comput. Civ. Eng. 31 (2017) 4016047.
[18] P. Alcantarilla, J. Nuevo, A. Bartoli, Fast Explicit Diffusion for Accelerated Features in Nonlinear Scale Spaces, in: T. Burghardt, D. Damen, W. Mayol-Cuevas, M. Mirmehdi (Eds.), Procedings of the British Machine Vision Conference 2013, British Machine Vision Association, 2013, 13.1-13.11.
[19] F. Huang, Z. Mao, W. Shi, ICA-ASIFT-Based Multi-Temporal Matching of High- Resolution Remote Sensing Urban Images, Cybernetics and Information Technologies 16 (2016) 34-49.
[20] J.-M. Morel, G. Yu, ASIFT: A New Framework for Fully Affine Invariant Image Comparison, SIAM J. Imaging Sei. 2 (2009) 438-469.
[21] P. Rodriguez-Gonzalvez, D. Gonzalez-Aguilera, G. Lopez-Jimenez, I. Picon- Cabrera, Image-based modeling of built environment from an unmanned aerial system, Automation in Construction 48 (2014) 44-52.
[22] H. Bay, T. Tuytelaars, L. van Gool, SURF: Speeded Up Robust Features, in: A. Leonardis, H. Bischof, A. Pinz (Eds.), Computer Vision -ECCV 2006, Springer Berlin Heidelberg, Berlin, Heidelberg, 2006, pp. 404-417.
[23] H. Bay, A. Ess, T. Tuytelaars, L. van Gool, Speeded-Up Robust Features (SURF), Computer Vision and Image Understanding 110 (2008) 346-359.
[24] G.M. Jog, H. Fathi, I. Brilakis, Automated computation of the fundamental matrix for vision based construction site applications, Advanced Engineering Informatics 25 (2011) 725-735.
[25] C. Harris, M. Stephens, A Combined Corner and Edge Detector, in: C.J. Taylor (Ed.), Procedings of the Alvey Vision Conference 1988, Alvey Vision Club, 1988, 23.1-23.6.
[26] C. Sung, P.Y. Kim, 3D terrain reconstruction of construction sites using a stereo camera, Automation in Construction 64 (2016) 65-77.
[27] E. Rosten, T. Drummond, Machine Learning for High-Speed Corner Detection, in: A. Leonardis, H. Bischof, A. Pinz (Eds.), Computer Vision -ECCV 2006, Springer Berlin Heidelberg, Berlin, Heidelberg, 2006, pp. 430-443. [28] A. Alahi, R. Ortiz, P. Vandergheynst, FREAK: Fast Retina Keypoint, in: 2012 IEEE Conference on Computer Vision and Pattern Recognition, IEEE, 2012, pp. 510- 517.
[29] H. Bae, M. Golparvar-Fard, J. White, High-precision vision-based mobile augmented reality system for context-aware architectural, engineering, construction and facility management (AEC/FM) applications, Vis. in Eng. 1 (2013).
[30] X. Du, Y. Zhu, A flexible method for 3D reconstruction of urban building, in: 2008 9th International Conference on Signal Processing, IEEE, 2008, pp. 1355-1359.
[31] M. Golparvar-Fard, Y. Ham, Automated Diagnostics and Visualization of Potential Energy Performance Problems in Existing Buildings Using Energy Performance Augmented Reality Models, J. Comput. Civ. Eng. 28 (2014) 17-29.
[32] Y. Ham, M. Golparvar-Fard, EPAR: Energy Performance Augmented Reality models for identification of building energy performance deviations between actual measurements and simulation results, Energy and Buildings 63 (2013) 15-28.
[33] A. Rashidi, F. Dai, I. Brilakis, P. Vela, Comparison of Camera Motion Estimation Methods for 3D Reconstruction of Infrastructure, in: Y. Zhu, R.R. Issa (Eds.), Computing in Civil Engineering (2011), American Society of Civil Engineers, Reston, VA, 2011, pp. 363-371.
[34] HYBRID 4-DIMENSIONAL AUGMENTED REALITY - A High-precision Approach to Mobile Augmented Reality, in: Proceedings of the 2nd International Conference on Pervasive Embedded Computing and Communication Systems, SciTePress - Science and and Technology Publications, 2012, pp. 156-161.
[35] H. Bae, M. Golparvar-Fard, J. White, High-Precision and Infrastructure- Independent Mobile Augmented Reality System for Context-Aware Construction and Facility Management Applications, in: I. Brilakis, S. Lee, B. Becerik-Gerber (Eds.), Computing in Civil Engineering, American Society of Civil Engineers, Reston, VA, 2013, pp. 637-644. [36] M. Muja, D.G. Lowe, Scalable Nearest Neighbor Algorithms for High Dimensional Data, IEEE transactions on pattern analysis and machine intelligence 36 (2014) 2227-2240.
[37] J. Cheng, C.Leng, J. Wu, H. Cui, H. Lu, Fast and Accurate Image Matching with Cascade Hashing for 3D Reconstruction, in: 2014 IEEE Conference on Computer Vision and Pattern Recognition, IEEE, 2014, pp. 1-8.
[38] M. Golparvar-Fard, V. Balali, J.M. de La Garza, Segmentation and Recognition of Highway Assets Using Image-Based 3D Point Clouds and Semantic Texton Forests, J. Comput. Civ. Eng. 29 (2015) 4014023.
[39] R. Hartley, A. Zisserman, Multiple View Geometry in Computer Vision, Cambridge University Press, 2011.
[40] D. Nister, An efficient solution to the five-point relative pose problem, IEEE transactions on pattern analysis and machine intelligence 26 (2004) 756-777.
[41] R.l. Hartley, In defense of the eight-point algorithm, IEEE Trans. Pattern Anal. Machine Intell. 19 (1997) 580-593.
[42] W. Zhang, Y. Zhang, Z. Li, Z. Zheng, R. Zhang, J. Chen, A rapid evaluation method of existing building applied photovoltaic (BAPV) potential, Energy and Buildings 135 (2017) 39-49.
[43] M.-D. Yang, C.-F. Chao, K.-S. Huang, L.-Y. Lu, Y.-P. Chen, Image-based 3D scene reconstruction and exploration in augmented reality, Automation in Construction 33 (2013) 48-60.
[44] B. Triggs, P.F. McLauchlan, R.l. Hartley, A.W. Fitzgibbon, Bundle Adjustment — A Modern Synthesis, in: G. Goos, J. Hartmanis, J. van Leeuwen, B. Triggs, A. Zisserman, R. Szeliski (Eds.), Vision Algorithms: Theory and Practice, Springer Berlin Heidelberg, Berlin, Heidelberg, 2000, pp. 298-372. [45] Y. Furukawa, B. Curless, S.M. Seitz, R. Szeliski, Towards Internet-scale multi-view stereo, in: 2010 IEEE Computer Society Conference on Computer Vision and Pattern Recognition, IEEE, 2010, pp. 1434-1441.
[46] M.M. Torok, M. Golparvar-Fard, K.B. Kochersberger, Image-Based Automated 3D Crack Detection for Post-disaster Building Assessment, J. Comput. Civ. Eng. 28 (2014).
[47] Y. Ham, M. Golparvar-Fard, Identification of Potential Areas for Building Retrofit Using Thermal Digital Imagery and CFD Models, in: R.R. Issa, I. Flood (Eds.), Computing in Civil Engineering (2012), American Society of Civil Engineers, Reston, VA, 2012, pp. 642-649.
[48] Y. Ham, M. Golparvar-Fard, Mapping actual thermal properties to building elements in gbXML-based BIM for reliable building energy performance modeling, Automation in Construction 49 (2015) 214-224.
[49] C. Koch, S.G. Paal, A. Rashidi, Z. Zhu, M. König, I. Brilakis, Achievements and Challenges in Machine Vision-Based Inspection of Large Concrete Structures, Advances in Structural Engineering 17 (2014) 303-318.
[50] A. Rashidi, I. Brilakis, P. Vela, Generating Absolute-Scale Point Cloud Data of Built Infrastructure Scenes Using a Monocular Camera Setting, J. Comput. Civ. Eng. 29 (2015) 4014089.
[51] W. Yuan, S. Chen, Y. Zhang, J. Gong, R. Shibasaki, AN AERIAL-IMAGE DENSE MATCHING APPROACH BASED ON OPTICAL FLOW FIELD, Int. Arch. Photogramm. Remote Sens. Spatial Inf. Sei. XLI-B3 (2016) 543-548.
[52] Z. Zhou, J. Gong, M. Guo, Image-Based 3D Reconstruction for Posthurricane Residential Building Damage Assessment, J. Comput. Civ. Eng. 30 (2016) 4015015.
[53] S. Birchfield, Essential and fundamental matrices, 1999, http://ai.stanford.edu/~birch/projective/node20.html, accessed 18 February 2022. [54] M. Nahangi, C.T. Haas, Skeleton-based discrepancy feedback for automated realignment of industrial assemblies, Automation in Construction 61 (2016) 147- 161.
[55] S. Zollmann, C. Hoppe, S. Kluckner, C. Poglitsch, H. Bischof, G. Reitmayr, Augmented Reality for Construction Site Monitoring and Documentation, Proc. IEEE 102 (2014) 137-154.
[56] J. Lee, H. Son, C. Kim, C. Kim, Skeleton-based 3D reconstruction of as-built pipelines from laser-scan data, Automation in Construction 35 (2013) 199-207.
[57] H. Son, C. Kim, C. Kim, Fully Automated As-Built 3D Pipeline Extraction Method from Laser-Scanned Data Based on Curvature Computation, J. Comput. Civ. Eng. 29 (2015).
[58] A. Dimitrov, M. Golparvar-Fard, Segmentation of building point cloud models including detailed architectural/structural features and MEP systems, Automation in Construction 51 (2015) 32-45.
[59] S. Wang, Q. Gou, M. Sun, Simple Building Reconstruction from Lidar Data and Aerial Imagery, in: 2012 2nd International Conference on Remote Sensing, Environment and Transportation Engineering, IEEE, 2012, pp. 1-5.
[60] L. Cheng, Y. Wu, Y. Wang, L. Zhong, Y. Chen, M. Li, Three-Dimensional Reconstruction of Large Multilayer Interchange Bridge Using Airborne LiDAR Data, IEEE J. Sei. Top. Appl. Earth Observations Remote Sensing 8 (2015) 691-708.
[61] A. Adan, D. Huber, 3D Reconstruction of Interior Wall Surfaces under Occlusion and Clutter, in: 2011 International Conference on 3D Imaging, Modeling, Processing, Visualization and Transmission, IEEE, 2011, pp. 275-281.
[62] E. Valero, A. Adän, F. Bosche, Semantic 3D Reconstruction of Furnished Interiors Using Laser Scanning and RFID Technology, J. Comput. Civ. Eng. 30 (2016) 4015053. [63] A.K. Patil, P. Holi, S.K. Lee, Y.H. Chai, An adaptive approach for the reconstruction and modeling of as-built 3D pipelines from point clouds, Automation in Construction 75 (2017) 65-78.
[64] M.M. Torok, M.G. Fard, K.B. Kochersberger, Post-Disaster Robotic Building Assessment: Automated 3D Crack Detection from Image-Based Reconstructions, in: R.R. Issa, I. Flood (Eds.), Computing in Civil Engineering (2012), American Society of Civil Engineers, Reston, VA, 2012, pp. 397-404.
[65] M. Weinmann, A. Schmidt, C. Mallet, S. Hinz, F. Rottensteiner, B. Jutzi, Contextual classification of point cloud data by exploiting individual 3d neigbourhoods, Göttingen Copernicus GmbH, 2015.
[66] J. Lalonde, R. Unnikrishnan, N. Vandapel, M. Hebert, Scale Selection for Classification of Point-Sampled 3-D Surfaces, in: Fifth International Conference on 3-D Digital Imaging and Modeling (3DIM'O5), IEEE, 2005, pp. 285-292.
[67] Nesrine Chehata, Li Guo, Clement Mallet, Airborne lidar feature selection for urban classification using random forests, in: International Archives of Photogrammetry. Remote Sensing and Spatial Information Sciences, pp. 207-212.
[68] S.K. Lodha, D.M. Fitzpatrick, D.P. Helmbold, Aerial Lidar Data Classification using Ada-Boost, in: Sixth International Conference on 3-D Digital Imaging and Modeling (3DIM 2007), IEEE, 2007, pp. 435-442.
[69] Z. Wang, L. Zhang, T. Fang, P.T. Mathiopoulos, X. Tong, H. Qu, Z. Xiao, F. Li, D. Chen, A Multiscaleand Hierarchical Feature Extraction Method for Terrestrial Laser Scanning Point Cloud Classification, IEEE Trans. Geosci. Remote Sensing 53 (2015) 2409-2425.
[70] J. Zhang, X. Lin, X. Ning, SVM-Based Classification of Segmented Airborne LiDAR Point Cloudsin Urban Areas, Remote Sensing 5 (2013) 3749-3775.
[71] Z. Li, L. Zhang, X. Tong, B. Du, Y. Wang, L. Zhang, Z. Zhang, H. Liu, J. Mei, X. Xing, P.T. Mathiopoulos, A Three-Step Approach for TLS Point Cloud Classification, IEEE Trans. Geosci. Remote Sensing 54 (2016) 5412-5424. [72] M. Carlberg, P. Gao, G. Chen, A. Zakhor, Classifying urban landscape in aerial LiDAR using 3D shape analysis, in: 2009 16th IEEE International Conference on Image Processing (ICIP), IEEE, 2009, pp. 1701-1704.
[73] K. Khoshelham, S.O. Elberink, Accuracy and resolution of Kinect depth data for indoor mapping applications, Sensors (Basel, Switzerland) 12 (2012) 1437-1454.
[74] Roman Shapovalov, Er Velizhev, Olga Barinova, Nonassociative markov networks for 3d point cloud classification. The, 2010.
[75] M. Najafi, S. Taghavi Namin, M. Salzmann, L. Petersson, Non-associative Higher- Order Markov Networks for Point Cloud Classification, in: D. Fleet, T. Pajdla, B. Schiele, T. Tuytelaars (Eds.), Computer Vision -ECCV 2014, Springer International Publishing, Cham, 2014, pp. 500-515.
[76] D. Munoz, J. A. Bagnell, N. Vandapel, M. Hebert, Contextual classification with functional Max-Margin Markov Networks, in: 2009 IEEE Conference on Computer Vision and Pattern Recognition, IEEE, 2009, pp. 975-982.
[77] J. Niemeyer, F. Rottensteiner, U. Soergel, CONDITIONAL RANDOM FIELDS FOR LIDAR POINT CLOUD CLASSIFICATION IN COMPLEX URBAN AREAS, ISPRS Ann. Photogramm. Remote Sens. Spatial Inf. Sei. I-3 (2012) 263-268.
[78] J. Niemeyer, F. Rottensteiner, U. Soergel, Contextual classification of lidar data and building object detection in urban areas, ISPRS Journal of Photogrammetry and Remote Sensing 87 (2014) 152-165.
[79] G. Vosselman, M. Coenen, F. Rottensteiner, Contextual segment-based classification of airborne laser scanner data, ISPRS Journal of Photogrammetry and Remote Sensing 128 (2017) 354-371.
[80] E.H. Lim, D. Suter, 3D terrestrial LIDAR classifications with super-voxels and multiscale Conditional Random Fields, Computer-Aided Design 41 (2009) 701-710. [81] A. Schmidt, F. Rottensteiner, II. Sörgel, Classification of airborne laser scanning data in wadden sea areas using conditional random fields, Göttingen Copernicus GmbH, 2012.
[82] Y. Lu, C. Rasmussen, Simplified markov random fields for efficient semantic labeling of 3D point clouds, in: 2012 IEEE/RSJ International Conference on Intelligent Robots and Systems, IEEE, 2012, pp. 2690-2697.
[83] X. Xiong, D. Munoz, J. A. Bagnell, M. Hebert, 3-D scene analysis via sequenced predictions over points and regions, in: 2011 IEEE International Conference on Robotics and Automation, IEEE, 2011, pp. 2609-2616.
[84] R. Shapovalov, D. Vetrov, P. Kohli, Spatial Inference Machines, in: 2013 IEEE Conference on Computer Vision and Pattern Recognition, IEEE, 2013, pp. 2985- 2992.
[85] M. Weinmann, B. Jutzi, S. Hinz, C. Mallet, Semantic point cloud interpretation based on optimal neighborhoods, relevant features and efficient classifiers, ISPRS Journal of Photogrammetry and Remote Sensing 105 (2015) 286-304.
[86] Y. Guo, H. Wang, Q. Hu, H. Liu, L. Liu, M. Bennamoun, Deep Learning for 3D Point Clouds: A Survey, arXiv, 2019.
[87] F.J. Lawin, M. Danelljan, P. Tosteberg, G. Bhat, F.S. Khan, M. Felsberg, Deep Projective 3D Semantic Segmentation, in: M. Felsberg, A. Heyden, N. Krüger (Eds.), Computer Analysis of Images and Patterns, Springer International Publishing, Cham, 2017, pp. 95-107.
[88] A. Boulch, B. Le Saux, N. Audebert, Unstructured Point Cloud Semantic Labeling Using Deep Segmentation Networks, The Eurographics Association, 2017.
[89] N. Audebert, B. Le Saux, S. Lefevre, Semantic Segmentation of Earth Observation Data Using Multimodal and Multiscale Deep Networks, in: S.-H. Lai, V. Lepetit, K. Nishino, Y. Sato (Eds.), Computer Vision -ACCV 2016, Springer International Publishing, Cham, 2017, pp. 180-196. [90] M. Tatarchenko, J. Park, V. Koltun, Q.-Y. Zhou, Tangent Convolutions for Dense Prediction in 3D, arXiv, 2018.
[91] F.N. landola, S. Han, M.W. Moskewicz, K. Ashraf, W.J. Dally, K. Keutzer, SqueezeNet: AlexNet-level accuracy with 50x fewer parameters and <0.5MB model size, arXiv, 2016.
[92] B. Wu, A. Wan, X. Yue, K. Keutzer, SqueezeSeg: Convolutional Neural Nets with Recurrent CRF for Real-Time Road-Object Segmentation from 3D LiDAR Point Cloud, in: 2018 IEEE International Conference on Robotics and Automation (ICRA), IEEE, 2018, pp. 1887-1893.
[93] B. Wu, X. Zhou, S. Zhao, X. Yue, K. Keutzer, SqueezeSegV2: Improved Model Structure and Unsupervised Domain Adaptation for Road-Object Segmentation from a LiDAR Point Cloud, in: 2019 International Conference on Robotics and Automation (ICRA), IEEE, 2019, pp. 4376-4382.
[94] A. Milioto, I. Vizzo, J. Behley, C. Stachniss, RangeNet ++: Fast and Accurate LiDAR Semantic Segmentation, in: 2019 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), IEEE, 2019, pp. 4213-4220.
[95] J. Huang, S. You, Point cloud labeling using 3D Convolutional Neural Network, in: 2016 23rd International Conference on Pattern Recognition (ICPR), IEEE, 2016, pp. 2670-2675.
[96] E. Shelhamer, J. Long, T. Darrell, Fully Convolutional Networks for Semantic Segmentation, IEEE Trans. Pattern Anal. Machine Intell. 39 (2017) 640-651.
[97] L. Tchapmi, C. Choy, I. Armeni, J. Gwak, S. Savarese, SEGCloud: Semantic Segmentation of 3D Point Clouds, in: 2017 International Conference on 3D Vision (3DV), IEEE, 2017, pp. 537-547.
[98] H.-Y. Meng, L. Gao, Y. Lai, D. Manocha, VV-Net: Voxel VAE Net with Group Convolutions for Point Cloud Segmentation, arXiv, 2018. [99] D. Rethage, J. Wald, J. Sturm, N. Navab, F. Tombari, Fully-Convolutional Point Networks for Large-Scale Point Clouds, arXiv, 2018.
[100] A. Dai, D. Ritchie, M. Bokeloh, S. Reed, J. Sturm, M. Nießner, ScanComplete: Large-Scale Scene Completion and Semantic Segmentation for 3D Scans, arXiv, 2017.
[101] B. Graham, M. Engelcke, L. van der Maaten, 3D Semantic Segmentation with Submanifold Sparse Convolutional Networks, 2017.
[102] C. Choy, J. Gwak, S. Savarese, 4D Spatio-Temporal ConvNets: Minkowski Convolutional Neural Networks, 2019.
[103] H. Su, V. Jampani, D. Sun, S. Maji, E. Kalogerakis, M.-H. Yang, J. Kautz, SPLATNet: Sparse Lattice Networks for Point Cloud Processing, 2018.
[104] R.A. Rosu, P. Schütt, J. Quenzel, S. Behnke, LatticeNet: Fast Point Cloud Segmentation Using Permutohedral Lattices, 2019.
[105] A. Dai, M. Nießner, 3DMV: Joint 3D-Multi-View Prediction for 3D Semantic Scene Segmentation, 2018.
[106] H.-Y. Chiang, Y.-L. Lin, Y.-C. Liu, W.H. Hsu, A Unified Point-Based Framework for 3D Segmentation, in: 2019 International Conference on 3D Vision (3DV), IEEE, 2019, pp. 155-163.
[107] M. Jaritz, J. Gu, H. Su, Multi-view PointNet for 3D Scene Understanding, 2019.
[108] C.R. Qi, H. Su, K. Mo, L.J. Guibas, PointNet: Deep Learning on Point Sets for 3D Classification and Segmentation, 2016.
[109] C.R. Qi, L. Yi, H. Su, L.J. Guibas, PointNet++: Deep Hierarchical Feature Learning on Point Sets in a Metric Space, 2017.
[110] M. Jiang, Y. Wu, T. Zhao, Z. Zhao, C. Lu, PointSIFT: A SIFT-like Network Module for 3D Point Cloud Semantic Segmentation, 2018. [111] F. Engelmann, T. Kontogianni, J. Schult, B. Leibe, Know What Your Neighbors Do: 3D Semantic Segmentation of Point Clouds 11131 (2019) 395-409.
[112] H. Zhao, L. Jiang, C.-W. Fu, J. Jia, PointWeb: Enhancing Local Neighborhood Features for Point Cloud Processing, in: 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), IEEE, 2019, pp. 5560-5568.
[113] Z. Zhang, B.-S. Hua, S.-K. Yeung, ShellNet: Efficient Point Cloud Convolutional Neural Networks using Concentric ShellsStatistics, 2019.
[114] Q. Hu, B. Yang, L. Xie, S. Rosa, Y. Guo, Z. Wang, N. Trigoni, A. Markham, RandLA-Net: Efficient Semantic Segmentation of Large-Scale Point Clouds, 2019.
[115] A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A.N. Gomez, L. Kaiser, I. Polosukhin, Attention Is All You Need, 2017.
[116] J. Yang, Q. Zhang, B. Ni, L. Li, J. Liu, M. Zhou, Q. Tian, Modeling Point Clouds with Self-Attention and Gumbel Subset Sampling, 2019.
[117] L.-Z. Chen, X.-Y. Li, D.-P. Fan, K. Wang, S.-P. Lu, M.-M. Cheng, LSANet: Feature Learning on Point Sets by Local Spatial Aware Layer, 2019.
[118] C. Zhao, W. Zhou, L. Lu, Q. Zhao, Pooling Scores of Neighboring Points for Improved 3D Point Cloud Segmentation, in: 2019 IEEE International Conference on Image Processing (ICIP), IEEE, 2019, pp. 1475-1479.
[119] Y. Wang, Y. Sun, Z. Liu, S.E. Sarma, M.M. Bronstein, J.M. Solomon, Dynamic Graph CNN for Learning on Point Clouds, 2018.
[120] R. Arandjelovic , P. Gronat, A. Torii, T. Pajdla, J. Sivic, NetVLAD: CNN architecture for weakly supervised place recognition, 2015.
[121] N. Zhao, T.-S. Chua, G.H. Lee, PSA2-Net: A Locally and Globally Aware Network for Point-Based Semantic Segmentation 12667 (2021). [122] B.-S. Hua, M.-K. Tran, S.-K. Yeung, Pointwise Convolutional Neural Networks, 2017.
[123] S. Wang, S. Suo, W.-C. Ma, A. Pokrovsky, R. Urtasun, Deep Parametric Continuous Convolutional Neural Networks (2018) 2589-2597.
[124] H. Thomas, C.R. Qi, J.-E. Deschaud, B. Marcotegui, F. Goulette, L.J. Guibas, KPConv: Flexible and Deformable Convolution for Point Clouds, 2019.
[125] F. Engelmann, T. Kontogianni, B. Leibe, Dilated Point Convolutions: On the Receptive Field Size of Point Convolutions on 3D Point Clouds, 2019.
[126] F. Engelmann, T. Kontogianni, A. Hermans, B. Leibe, Exploring Spatial Context for 3D Semantic Segmentation of Point Clouds (2017) 716-724.
[127] Q. Huang, W. Wang, U. Neumann, Recurrent Slice Networks for 3D Segmentation of Point Clouds, 2018.
[128] X.Ye, J. Li, H. Huang, L. Du, X. Zhang, 3D Recurrent Neural Networks with Context Fusion for Point Cloud Semantic Segmentation, in: V. Ferrari, M. Hebert, C. Sminchisescu, Y. Weiss (Eds.), Computer Vision -ECCV 2018, Springer International Publishing, Cham, 2018, pp. 415-430.
[129] Z. Zhao, M. Liu, K. Ramani, DAR-Net: Dynamic Aggregation Network for Semantic Scene Segmentation, 2019.
[130] F. Liu, S. Li, L. Zhang, C. Zhou, R. Ye, Y. Wang, J. Lu, 3DCNN-DQN-RNN: A Deep Reinforcement Learning Framework for Semantic Parsing of Large-scale 3D Point Clouds, 2017.
[131] L. Landrieu, M. Simonovsky, Large-scale Point Cloud Semantic Segmentation with Superpoint Graphs, 2017.
[132] L. Landrieu, M. Boussaha, Point Cloud Oversegmentation with Graph-Structured Deep MetricLearning, 2019. [133] K. Zhiheng, L. Ning, PyramNet: Point Cloud Pyramid Attention Network and Graph Embedding Module for Classification and Segmentation, 2019.
[134] L. Wang, Y. Huang, Y. Hou, S. Zhang, J. Shan, Graph Attention Convolution for Point Cloud Semantic Segmentation, in: 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), IEEE, 2019, pp. 10288-10297.
[135] Y. Ma, Y. Guo, H. Liu, Y. Lei, G. Wen, Global Context Reasoning for Semantic Segmentation of 3D Point Clouds, in: 2020 IEEE Winter Conference on Applications of Computer Vision (WACV), IEEE, 2020, pp. 2920-2929.
[136] J. Wei, G. Lin, K.-H. Yap, T.-Y. Hung, L. Xie, Multi-Path Region Mining For Weakly Supervised 3D Semantic Segmentation on Point Clouds, 2020.
[137] X. Xu, G.H. Lee, Weakly Supervised Semantic Point Cloud Segmentation: Towards 10X Fewer Labels, 2020.
[138] J. Hou, A. Dai, M. Nießner, 3D-SIS: 3D Semantic Instance Segmentation of RGB- D Scans, 2018.
[139] L. Yi, W. Zhao, H. Wang, M. Sung, L. Guibas, GSPN: Generative Shape Proposal Network for 3D Instance Segmentation in Point Cloud, 2018.
[140] G. Narita, T. Seno, T. Ishikawa, Y. Kaji, PanopticFusion: Online Volumetric Semantic Mapping at the Level of Stuff and Things, 2019.
[141] B. Yang, J. Wang, R. Clark, Q. Hu, S. Wang, A. Markham, N. Trigoni, Learning Object Bounding Boxes for 3D Instance Segmentation on Point Clouds, 2019.
[142] F. Zhang, C. Guan, J. Fang, S. Bai, R. Yang, P.H. Torr, V. Prisacariu, Instance Segmentation of LiDAR Point Clouds, in: 2020 IEEE International Conference on Robotics and Automation (ICRA), IEEE, 52020, pp. 9448-9455.
[143] Y. Shi, A.X. Chang, Z. Wu, M. Savva, K. Xu, Hierarchy Denoising Recursive Autoencoders for 3D Scene Layout Prediction, 2019. [144] F. Engelmann, M. Bokeloh, A. Fathi, B. Leibe, M. Nießner, 3D-MPA: Multi Proposal Aggregation for 3D Semantic Instance Segmentation, 2020.
[145] W. Wang, R. Yu, Q. Huang, II. Neumann, SGPN: Similarity Group Proposal Network for 3D Point Cloud Instance Segmentation, 2017.
[146] C. Liu, Y. Furukawa, MASC: Multi-scale Affinity with Sparse Convolution for 3D Instance Segmentation, 2019.
[147] Z. Liang, M. Yang, C. Wang, 3D Graph Embedding Learning with a Structure- aware Loss Function for Point Cloud Semantic Instance Segmentation (2019).
[148] X. Wang, S. Liu, X. Shen, C. Shen, J. Jia, Associatively Segmenting Instances and Semantics in Point Clouds, 2019.
[149] L. Zhao, W. Tao, JSNet: Joint Instance and Semantic Segmentation of 3D Point Clouds, 2019.
[150] B.D. Brabandere, D. Neven, L. van Gool, Semantic Instance Segmentation with a Discriminative Loss Function, 2017.
[151] Q.-H. Pham, D.T. Nguyen, B.-S. Hua, G. Roig, S.-K. Yeung, JSIS3D: Joint Semantic-Instance Segmentation of 3D Point Clouds with Multi-Task Pointwise Networks and Multi-Value Conditional Random Fields, 2019.
[152] S.-M. Hu, J.-X. Cai, Y.-K. Lai, Semantic Labeling and Instance Segmentation of 3D Point Clouds Using Patch Context Analysis and Multiscale Processing, IEEE transactions on visualization and computer graphics 26 (2020) 2485-2498.
[153] C. Elich, F. Engelmann, T. Kontogianni, B. Leibe, 3D-BEVIS: Bird's-Eye- iew Instance Segmentation 11824 (2019) 48-61.
[154] J. Lahoud, B. Ghanem, M. Pollefeys, M.R. Oswald, 3D Instance Segmentation via Multi-Task Metric Learning, 2019. [155] L. Jiang, H. Zhao, S. Shi, S. Liu, C.-W. Fu, J. Jia, PointGroup: Dual-Set Point Grouping for 3D Instance Segmentation, 2020.
[156] Z. Liang, Z. Li, S. Xu, M. Tan, K. Jia, Instance Segmentation in 3D Scenes using Semantic Superpoint Tree Networks, 2021.

Claims

Patentansprüche
1. Vorrichtung zur Erstellung eines digitalen Models eines bestehenden Gebäudes oder einer bestehenden Industrieanlage oder einer bestehenden Infrastruktur, wobei die Vorrichtung umfasst: eine Eingangseinheit (110) zum Bereitstellen von Punktwolkendaten, die das Gebäude oder die Industrieanlage oder die Infrastruktur repräsentieren, eine Verarbeitungseinheit (120), die ein Künstliches-Intelligenz-Modul (125) zur Erstellung des Modells abhängig von den Punktwolkendaten umfasst, wobei das Künstliche-Intelligenz-Modul (125) mittels maschinellem Lernen trainiert ist.
2. Vorrichtung nach Anspruch 1 , wobei die Eingangseinheit (110) ausgebildet ist, zwei oder mehr Punktwolken- Teildatensätze zu erhalten, die jeweils einen Teilbereich des Gebäudes oder einen Teilbereich der Industrieanlage oder einen Teilbereich der Infrastruktur repräsentieren, und wobei die Eingangseinheit (110) ausgebildet ist, die Punktwolkendaten, die das Gebäude oder die Industrieanlage oder die Infrastruktur repräsentieren, aus den zwei oder mehr Punktwolkendaten zu erzeugen.
3. Vorrichtung nach Anspruch 1 oder 2, wobei die Eingangseinheit (110) ausgebildet ist, Sensordaten von ein oder mehreren Kameras und/oder von ein oder mehreren Laserscannern und/oder von ein oder mehreren Tiefenkameras zu erhalten; und wobei die Eingangseinheit (110) ausgebildet ist, die Punktwolkendaten und einen Teil der Punktwolkendaten abhängig von den Sensordaten zu bestimmen; oder wobei die Sensordaten die Punktwolkendaten oder einen Teil der Punktwolkendaten umfassen.
4. Vorrichtung nach einem der vorherigen Ansprüche, wobei die Verarbeitungseinheit (120) ausgebildet ist, die Daten in den Punktwolkendaten zu detektieren, die nicht das Gebäude oder die Industrieanlage oder die Infrastruktur repräsentieren, und/oder die außerhalb des Gebäudes oder der Industrieanlage oder der Infrastruktur liegen.
5. Vorrichtung nach Anspruch 4, wobei die Verarbeitungseinheit (120) ausgebildet ist, Grenzen des Gebäudes oder der Industrieanlage oder der Infrastruktur zu bestimmen, um die Daten in den Punktwolkendaten zu detektieren, die außerhalb des Gebäudes oder der Industrieanlage oder der Infrastruktur liegen.
6. Vorrichtung nach einem der vorherigen Ansprüche, wobei die Punktwolkendaten Informationen über Oberflächen des Gebäudes oder der Industrieanlage oder der Infrastruktur und Informationen über das Innere des Gebäudes oder der Industrieanlage oder der Infrastruktur umfassen.
7. Vorrichtung nach einem der vorherigen Ansprüche, wobei die Verarbeitungseinheit (120) ausgebildet ist, die Punktwolkendaten derart zu verarbeiten, dass ein oder mehrere Teilmengen der Punktwolkendaten derart klassifiziert werden, dass die ein oder mehreren Teilmengen, jeweils einer von ein oder mehreren Objektkategorien zugeordnet werden.
8. Vorrichtung nach Anspruch 7, wobei die ein oder mehreren Objektkategorien ein oder mehrere Gebäudeteiltypen umfassen, und wobei die Verarbeitungseinheit (120) ausgebildet ist, das Klassifizieren derart auszuführen, dass dieses eine erste Instanzsegmentierung umfasst, die mindestens eine Teilmenge der ein oder mehreren Teilmengen der Punktwolkendaten derart klassifiziert, dass diese als einer von den ein oder mehreren Gebäudeteiltypen des Gebäudes oder der Industrieanlage oder der Infrastruktur klassifiziert wird.
9. Vorrichtung nach Anspruch 8, wobei die ein oder mehreren Gebäudeteiltypen durch einen Entwickler frei definierbar sind.
10. Vorrichtung nach Anspruch 8, wobei die ein oder mehreren Gebäudeteiltypen ein oder mehrere der nachfolgenden Gebäudeteiltypen umfassen: ein Dach, eine Außenwand, eine Außentür, ein Außenfenster, einen Innenraum, ein Treppenhaus, einen Aufzugsschacht.
11. Vorrichtung nach einem der Ansprüche 8 bis 10, wobei die ein oder mehreren Objektkategorien ein oder mehrere Raumstrukturtypen umfassen, und wobei die Verarbeitungseinheit (120) ausgebildet ist, das Klassifizieren derart auszuführen, dass dieses eine zweite Instanzsegmentierung umfasst, die mindestens eine Teilmenge der ein oder mehreren Teilmengen der Punktwolkendaten derart klassifiziert, dass diese als eine Raumstruktur von den ein oder mehreren Raumstrukturtypen eines Raums des Gebäudes oder der Industrieanlage oder der Infrastruktur klassifiziert wird.
12. Vorrichtung nach Anspruch 11 , wobei die ein oder mehreren Raumstrukturtypen durch einen Entwickler frei definierbar sind.
13. Vorrichtung nach Anspruch 11 , wobei die ein oder mehreren Raumstrukturtypen ein oder mehrere der nachfolgenden Raumstrukturtypen umfassen: eine Wand, eine Decke, ein Fußboden, eine Tür, ein Fenster, ein Mobiliar.
14. Vorrichtung nach einem der Ansprüche 7 bis 13, wobei die Verarbeitungseinheit (120) ausgebildet ist, die ein oder mehreren Teilmengen der Punktwolkendaten derart zu klassifizieren, dass ein Klassifizieren durch Verwendung des Künstlichem-Intelligenz Modul (125) erfolgt, welches mittels dem maschinellem Lernen trainiert ist, und welches ausgebildet ist, die Punktwolkendaten als Eingangsdaten zu erhalten.
15. Vorrichtung nach Anspruch 14, wobei das Künstliche-Intelligenz-Modul (125) mittels überwachtem Tiefenlernen trainiert ist.
16. Vorrichtung nach Anspruch 15, wobei das Künstliche-Intelligenz-Modul (125) ausgebildet ist, das Klassifizieren projektionsbasiert und/oder diskretisierungsbasiert und/oder punktbasiert durchzuführen.
17. Vorrichtung nach einem der Ansprüche 14 bis 16, wobei das Künstliche-Intelligenz-Modul (125) ein neuronales Tiefenlern-Netz umfasst, das mindestens zwei versteckte Schichten aufweist.
18. Vorrichtung nach einem der Ansprüche 14 bis 17, wobei das Künstliche-Intelligenz-Modul (125) ein rekurrentes neuronales Netz zur Bestimmung von ein oder mehreren Merkmalen eines Teilbereichs der Punktwolkendaten umfasst.
19. Vorrichtung nach einem der Ansprüche 14 bis 18, wobei das Künstliche-Intelligenz Modul (125) mittels dem maschinellem Lernen trainiert ist, indem eine erste Punktwolke einer Objektkategorie der ein oder mehreren Objektkategorien zugeordnet wurde, und wobei die erste Punktwolke und die besagte Objektkategorie als ersten Trainingsdatensatz für das Künstliche- Intelligenz Modul (125) verwendet wurden.
20. Vorrichtung nach Anspruch 19, wobei das Künstliche-Intelligenz Modul (125) mittels dem maschinellem Lernen trainiert ist, indem die erste Punktwolke ein oder mehrmals verändert wurde, um ein oder mehrere veränderte Punktwolken zu erhalten, wobei jeweils eine der ein oder mehreren veränderten Punktwolken und die besagte Objektkategorie als ein weiterer Trainingsdatensatz von ein oder mehreren weiteren Trainingsdatensätzen verwendet wurden.
21. Vorrichtung nach Anspruch 20, wobei die erste Punktwolke derart ein oder mehrmals verändert wurde, indem ein Translations-Dithering und/oder eine Drehung und/oder eine zufällige Skalierung und/oder eine elastische Verformung der ersten Punktwolke eingesetzt wurde.
22. Vorrichtung nach einem der Ansprüche 14 bis 21, wobei es sich bei den Punktwolkendaten um dreidimensionale Punktwolkendaten handelt, und wobei die Verarbeitungseinheit (120) ausgebildet ist, die dreidimensionalen Punktwolkendaten auf zweidimensionale Punktwolkendaten abzubilden und die ein oder mehrere Teilmengen der Punktwolkendaten unter Verwendung der zweidimensionalen Punktwolkendaten zu klassifizieren.
23. Vorrichtung nach einem der Ansprüche 7 bis 22, wobei es sich bei den Punktwolkendaten um dreidimensionale Punktwolkendaten handelt, und wobei die Verarbeitungseinheit (120) ausgebildet ist, eine Zuordnung der dreidimensionalen Punktwolkendaten auf eine Mehrzahl von Voxeln durchzuführen und die Punktwolkendaten abhängig von der Zuordnung auf die Mehrzahl von Voxeln durchzuführen.
24. Vorrichtung nach einem der Ansprüche 7 bis 23, wobei die Verarbeitungseinheit (120) ausgebildet ist, abhängig von dem Klassifizieren der ein oder mehrere Teilmengen der Punktwolkendaten einen virtuellen Bauplan zu erstellen.
25. Vorrichtung nach einem der Ansprüche 7 bis 24, wobei die Verarbeitungseinheit (120) ausgebildet ist, abhängig von dem Klassifizieren der ein oder mehrere Teilmengen der Punktwolkendaten eine dreidimensionale Bauwerksdatenmodellierung zu erstellen.
26. Verfahren zur Erstellung eines digitalen Models eines bestehenden Gebäudes oder einer bestehenden Industrieanlage oder einer bestehenden Infrastruktur, wobei das Verfahren umfasst:
Bereitstellen von Punktwolkendaten, die das Gebäude oder die Industrieanlage oder die Infrastruktur repräsentieren, und
Erstellen das Modells abhängig von den Punktwolkendaten unter Einsatz einer Verarbeitungseinheit (120), die ein Künstlichen-Intelligenz-Modul (125) umfasst, wobei das Künstliche-Intelligenz-Modul (125) mittels maschinellem Lernen trainiert ist.
27. Computerprogramm mit einem Programmcode zur Durchführung des Verfahrens nach Anspruch 26.
EP24701692.6A 2023-01-31 2024-01-24 Vorrichtung und verfahren zur automatisierten, dreidimensionalen bauwerksdatenmodellierung Pending EP4659137A1 (de)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
DE102023200780.0A DE102023200780A1 (de) 2023-01-31 2023-01-31 Vorrichtung und Verfahren zur automatisierten, dreidimensionalen Bauwerksdatenmodellierung
PCT/EP2024/051592 WO2024160612A1 (de) 2023-01-31 2024-01-24 Vorrichtung und verfahren zur automatisierten, dreidimensionalen bauwerksdatenmodellierung

Publications (1)

Publication Number Publication Date
EP4659137A1 true EP4659137A1 (de) 2025-12-10

Family

ID=89708088

Family Applications (1)

Application Number Title Priority Date Filing Date
EP24701692.6A Pending EP4659137A1 (de) 2023-01-31 2024-01-24 Vorrichtung und verfahren zur automatisierten, dreidimensionalen bauwerksdatenmodellierung

Country Status (3)

Country Link
EP (1) EP4659137A1 (de)
DE (1) DE102023200780A1 (de)
WO (1) WO2024160612A1 (de)

Families Citing this family (26)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN118820557B (zh) * 2024-09-14 2025-01-10 国网青海省电力公司海东供电公司 基于立体化数字模型的电缆线路精细化监测方法及系统
CN118941614B (zh) * 2024-10-11 2024-12-10 江苏绿和环境科技有限公司 一种建筑垃圾再生骨料体积测量方法及系统
CN119600184B (zh) * 2024-10-12 2025-11-18 人工智能与数字经济广东省实验室(深圳) 古典建筑的三维建模与图像重绘方法、系统、终端及介质
CN118968110B (zh) * 2024-10-15 2025-05-16 山东大学 基于k聚类的特征匹配方法、系统、介质、产品及设备
CN119048692A (zh) * 2024-10-31 2024-11-29 福建省工大工程设计有限公司 一种基于无人机载LiDAR技术的建筑模拟展示装置及方法
CN119167792B (zh) * 2024-11-12 2025-04-18 山东浪潮智慧建筑科技有限公司 一种建筑冷热负荷自适应计算方法、系统、设备及介质
CN119903644B (zh) * 2024-12-18 2025-11-14 武汉大学 一种立体测绘星上任务规划方法及系统
CN119780957A (zh) * 2024-12-30 2025-04-08 北京国标建筑科技有限责任公司 基于激光点云的墙体施工检测方法、装置和电子设备
CN119850425B (zh) * 2025-01-11 2026-02-06 福州大学 基于膨胀特征调制网络的轻量化建筑物图像超分辨率重建方法
CN120125771B (zh) * 2025-01-20 2025-09-12 广西壮族自治区自然资源遥感院 粗细粒度结合的三维建筑模型组织方法、装置、电子设备及存储介质
CN120411456B (zh) * 2025-04-26 2026-01-06 北京智碳寰宇技术有限公司 一种基于林地遥感数据的标注方法及系统
CN120495313B (zh) * 2025-05-09 2026-03-27 中山大学 一种基于点云卷积的渣土点云分割处理方法、系统及平台
CN120124194B (zh) * 2025-05-14 2025-07-15 南京航空航天大学 一种基于深度学习与规则范式的飞机外形测量视点生成方法
CN120259350B (zh) * 2025-05-28 2025-08-08 湖北大学 一种基于超点和深度学习的点云平面分割方法及装置
CN120259572B (zh) * 2025-06-06 2025-08-19 杭州电子科技大学 一种基于动态图卷积网络的稀疏视角多人体联合重建方法
CN120562024A (zh) * 2025-06-10 2025-08-29 中国人民解放军陆军工程大学 一种自动生成bim的预训练人工智能方法、电子设备及存储介质
CN120612622B (zh) * 2025-06-18 2026-01-16 广东电网有限责任公司中山供电局 一种变电站辅助选址方法、系统、设备及介质
CN120808158B (zh) * 2025-07-09 2026-02-24 中国自然资源航空物探遥感中心 一种基于遥感影像和街景图像的多模态特征公共建筑识别方法、系统、电子设备及存储介质
CN120894627B (zh) * 2025-07-22 2026-03-24 润和世联数据科技有限公司 基于ai图像识别的bim模型生成方法
CN120726330B (zh) * 2025-08-18 2025-12-02 人民中科(北京)智能技术有限公司 基于多视图文本监督指导的小样本点云语义分割方法及系统
CN120822909B (zh) * 2025-09-17 2025-12-23 中国极地研究中心(中国极地研究所) 基于人工智能的极地无人仓储货物识别与盘点方法和系统
CN120852601B (zh) * 2025-09-23 2025-12-09 西安文理学院 一种基于bim的智能测绘方法和系统
CN120876741A (zh) * 2025-09-26 2025-10-31 南通鸿翰智能装备有限公司 基于多源数据融合的龙门机床三维建模装置及方法
CN121167866A (zh) * 2025-11-21 2025-12-19 深圳市前海数字城市科技有限公司 基于ai的bim生成方法、计算机设备和计算机程序产品
CN121616929B (zh) * 2026-02-02 2026-03-27 西安建筑科技大学 一种基于深度学习与SfM的焊缝锈蚀特征提取方法及系统
CN121661274A (zh) * 2026-02-05 2026-03-13 四川省公路规划勘察设计研究院有限公司 一种公路工程三维实景模型的轻量化方法、系统及介质

Family Cites Families (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US10650106B2 (en) * 2015-01-28 2020-05-12 Matterport, Inc. Classifying, separating and displaying individual stories of a three-dimensional model of a multi-story structure based on captured image data of the multi-story structure
JP7611648B2 (ja) * 2020-03-05 2025-01-10 株式会社トプコン 情報処理装置、推論モデル構築方法、プログラム、及び記録媒体

Also Published As

Publication number Publication date
WO2024160612A1 (de) 2024-08-08
DE102023200780A1 (de) 2024-08-01

Similar Documents

Publication Publication Date Title
DE102023200780A1 (de) Vorrichtung und Verfahren zur automatisierten, dreidimensionalen Bauwerksdatenmodellierung
Chen et al. Automatic concrete defect detection and reconstruction by aligning aerial images onto semantic‐rich building information model
Zhang et al. A review of deep learning-based semantic segmentation for point cloud
Singh et al. Semantic segmentation of satellite images using deep-unet
Ochmann et al. Automatic reconstruction of fully volumetric 3D building models from oriented point clouds
Alidoost et al. A CNN-based approach for automatic building detection and recognition of roof types using a single aerial image
Chen Non-local scan consolidation for 3D urban scenes
Brilakis et al. Toward automated generation of parametric BIMs based on hybrid video and laser scanning data
CN119904592A (zh) 基于多源遥感数据的新闻场景三维重建与可视化方法
DE112022005645T5 (de) Verfahren und system zur gebäudedatenmodellierungs- (bim) rekonstruktion für ein rohrleitungssystem
Sun et al. A review of point cloud segmentation for understanding 3D indoor scenes
Singh et al. Deep learning-based semantic segmentation of three-dimensional point cloud: a comprehensive review
DE102016005407A1 (de) Gemeinsames Tiefenschätzen und semantisches Bezeichnen eines einzelnen Bildes
CN117237623B (zh) 一种无人机遥感图像语义分割方法及系统
Phalak et al. Scan2plan: Efficient floorplan generation from 3d scans of indoor scenes
CN120726395B (zh) 基于人工智能的三维点云数据分析方法及系统
Shamsollahi et al. Construction progress monitoring and reporting using computer vision techniques–a review
Gao et al. Typical engineering applications of 3d point clouds
CN119206106A (zh) 一种三维建图方法及系统
Yan et al. Evaluating Deep Learning Advances for Point Cloud Semantic Segmentation in Urban Environments
Gou et al. Three-dimensional dynamic uncertainty semantic SLAM method for a production workshop
CN112580442B (zh) 一种基于多维金字塔层次模型的行为识别方法
Chen et al. Farmland extraction from UAV remote sensing images based on improved segformer model
Chen et al. Learning a robust part-aware monocular 3d human pose estimator via neural architecture search
CN120219974A (zh) 基于图像识别的高耐盐水稻种植管理系统

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20250726

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)