WO2025200325A1 - Agv叉取货物方法和agv - Google Patents

Agv叉取货物方法和agv

Info

Publication number
WO2025200325A1
WO2025200325A1 PCT/CN2024/118520 CN2024118520W WO2025200325A1 WO 2025200325 A1 WO2025200325 A1 WO 2025200325A1 CN 2024118520 W CN2024118520 W CN 2024118520W WO 2025200325 A1 WO2025200325 A1 WO 2025200325A1
Authority
WO
WIPO (PCT)
Prior art keywords
coordinate
target
agv
module
attention module
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
PCT/CN2024/118520
Other languages
English (en)
French (fr)
Inventor
杨斌
刘志刚
刘俊杰
涂兆诚
叶青山
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
BYD Co Ltd
Original Assignee
BYD Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by BYD Co Ltd filed Critical BYD Co Ltd
Publication of WO2025200325A1 publication Critical patent/WO2025200325A1/zh
Pending legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • BPERFORMING OPERATIONS; TRANSPORTING
    • B65CONVEYING; PACKING; STORING; HANDLING THIN OR FILAMENTARY MATERIAL
    • B65GTRANSPORT OR STORAGE DEVICES, e.g. CONVEYORS FOR LOADING OR TIPPING, SHOP CONVEYOR SYSTEMS OR PNEUMATIC TUBE CONVEYORS
    • B65G1/00Storing articles, individually or in orderly arrangement, in warehouses or magazines
    • B65G1/02Storage devices
    • B65G1/04Storage devices mechanical
    • B65G1/0492Storage devices mechanical with cars adapted to travel in storage aisles
    • GPHYSICS
    • G08SIGNALLING
    • G08GTRAFFIC CONTROL SYSTEMS
    • G08G1/00Traffic control systems for road vehicles
    • G08G1/09Arrangements for giving variable traffic instructions
    • G08G1/0962Arrangements for giving variable traffic instructions having an indicator mounted inside the vehicle, e.g. giving voice messages
    • G08G1/0967Systems involving transmission of highway information, e.g. weather, speed limits
    • G08G1/096708Systems involving transmission of highway information, e.g. weather, speed limits where the received information might be used to generate an automatic action on the vehicle control
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04NPICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N17/00Diagnosis, testing or measuring for television systems or their details
    • H04N17/02Diagnosis, testing or measuring for television systems or their details for colour television signals
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04NPICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N23/00Cameras or camera modules comprising electronic image sensors; Control thereof
    • H04N23/50Constructional details
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04NPICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N23/00Cameras or camera modules comprising electronic image sensors; Control thereof
    • H04N23/60Control of cameras or camera modules
    • H04N23/64Computer-aided capture of images, e.g. transfer from script file into camera, check of taken image quality, advice or proposal for image composition or decision on when to take image

Definitions

  • AGVs Automatic Guided Vehicles
  • Related technologies use an AGV-following approach to guide the AGV to a designated area, where the goods are then manually transferred to the AGV. This approach is time-consuming and labor-intensive, and has underutilized the AGV's capabilities.
  • the step of respectively identifying the target action and the pallet area of the predetermined target according to the second RGB image and the second depth image comprises: detecting the second RGB image using the recognition detection model trained with the second training set, and outputting the action recognition Results; based on the action recognition result and the second depth image, obtain the target action; use the recognition detection model trained with the third training set to detect the second RGB image, and output the pallet recognition result; based on the pallet recognition result and the second depth image, obtain the pallet area.
  • the target action is a gesture.
  • FIG2 is a schematic diagram of identifying a staff member according to an embodiment of the present disclosure
  • FIG4 is a schematic diagram of the structure of an identification and detection model provided by an embodiment of the present disclosure.
  • FIG5 is a schematic diagram of determining a target stack to be forked according to an embodiment of the present disclosure
  • FIG6 is a schematic structural diagram of an AGV provided in an embodiment of the present disclosure.
  • the AGV can use image processing and machine learning technologies, such as target detection algorithms, to identify the predetermined target in the first RGB image and the first depth image.
  • S3 Acquire a second RGB image and a second depth image captured by the depth camera.
  • the target action of the predetermined target is a gesture.
  • S211 Use the recognition detection model trained with the first training set to recognize the first RGB image and output a target recognition result.
  • the staff can be accurately identified by the depth camera.
  • the position of the predetermined target can be determined more accurately.
  • the target action and the pallet area can be determined more accurately.
  • the recognition and detection model can use YOLOv8n, or other models such as YOLOv7, YOLOv6, etc. can be selected based on the actual application effect. Next, the recognition and detection model including YOLOv8n is explained.
  • the recognition detection model includes: a backbone network configured for feature extraction, a neck network configured for feature fusion, and a head network configured for target detection, which are connected in sequence.
  • the neck network includes a multi-scale weighted fusion attention module (MWFA) and a feature fusion module.
  • MWFA multi-scale weighted fusion attention module
  • the first attention module is connected to the backbone network and is configured to process the first path of features output by the backbone network and output the first feature.
  • the second attention module is connected to the backbone network and is configured to process the second path of features output by the backbone network and output the second feature.
  • the third attention module is connected to the backbone network and is configured to process the third feature output by the backbone network and output the third feature.
  • the weight distribution module is connected to the first attention module, the second attention module and the third attention module respectively, and is configured to perform weighted sum processing on the first feature, the second feature and the third feature, and output the fourth feature.
  • the fourth attention module is connected to the weight distribution module and is configured to process the fourth feature and output information fusion features of different scales.
  • the first attention module includes a first convolutional layer and a first channel attention module; the second attention module includes a second channel attention module; the third attention module includes a third channel attention module. block and upsampling module; the fourth attention module includes the first spatial attention module.
  • the output of the weight distribution module is expressed as follows:
  • X1 represents the first-path feature
  • X2 represents the second-path feature
  • X3 represents the third-path feature
  • Wi represents the weight coefficient
  • i is represented by 1, 2, or 3.
  • the first channel attention module, the second channel attention module and the third channel attention module are each composed of a first average pooling layer, a second convolutional layer, a first activation layer and a first Hadamard product module connected in sequence, wherein the first Hadamard product module is also connected to the second convolutional layer.
  • the outputs of the first channel attention module, the second channel attention module, and the third channel attention module are expressed by the following formula:
  • the first spatial attention module includes a second average pooling layer, a maximum pooling layer, a connection layer, a second activation layer, and a second Hadamard product module.
  • the maximum pooling layer, the connection layer, the second activation layer, and the second Hadamard product module are connected in sequence.
  • the second Hadamard product module is also connected to the weight distribution module.
  • the input end of the second average pooling layer is connected to the weight distribution module, and the output end of the second average pooling layer is connected to the connection layer.
  • the output of the first spatial attention module is expressed by the following formula:
  • the YOLOv8n network containing the multi-scale weighted fusion attention module can be denoted as MWFA-YOLOv8n.
  • the traditional YOLOv8n network uses a simple concatenation layer, failing to distinguish the importance of different features, and the importance of feature channels to recognition varies.
  • a multi-scale weighted fusion attention module weighted information fusion features at different scales are obtained. Feature fusion is then performed in the neck network and finally output to the head network.
  • the step of obtaining a predetermined target based on the target recognition result and the first depth image includes:
  • the recognition result includes the pixel coordinates of the predetermined target, the position coordinates of the predetermined target are in a predetermined relationship with the pixel coordinates, the parameters in the intrinsic parameter matrix and the depth value, and the parameters in the intrinsic parameter matrix include the horizontal coordinate of the focal length, the vertical coordinate of the focal length, the horizontal coordinate of the optical center and the vertical coordinate of the optical center.
  • the position coordinates of the predetermined target are in a predetermined relationship with the pixel coordinates, the parameters in the intrinsic parameter matrix, and the depth value, specifically:
  • the horizontal coordinate of the position coordinate has a predetermined relationship with the vertical coordinate of the position coordinate, the horizontal coordinate of the pixel coordinate, the horizontal coordinate of the optical center and the horizontal coordinate of the focal length;
  • the vertical coordinate of the position coordinate has a predetermined relationship with the vertical coordinate of the position coordinate, the vertical coordinate of the pixel coordinate, the vertical coordinate of the optical center and the vertical coordinate of the focal length;
  • the vertical coordinate of the position coordinate has a predetermined relationship with the depth value.
  • the position coordinates of the predetermined target are in a predetermined relationship with the pixel coordinates, the parameters in the intrinsic parameter matrix, and the depth value, specifically:
  • the horizontal coordinate of the position coordinate and the vertical coordinate of the position coordinate, the difference between the horizontal coordinate of the pixel point coordinate and the horizontal coordinate of the optical center and the horizontal coordinate of the focal length form a predetermined relationship;
  • the vertical coordinate of the position coordinate and the vertical coordinate of the position coordinate, the difference between the vertical coordinate of the pixel point coordinate and the vertical coordinate of the optical center and the vertical coordinate of the focal length form a predetermined relationship;
  • the vertical coordinate of the position coordinate is equal to the depth value.
  • the calculation formula for combining the target recognition result and the first depth image can be expressed as:
  • Puv represents the pixel coordinates of the RGB image
  • K represents the intrinsic parameter matrix of the depth camera
  • P represents the coordinates of the depth image.
  • the position coordinates of the target are calculated by combining the intrinsic parameter matrix and the depth value of the depth camera, which can improve the accuracy, real-time performance and robustness of target recognition.
  • the step of determining a target pallet to be forked based on the target action and the pallet area includes:
  • the motion pointing may be a gesture pointing of a staff member.
  • the action direction is fitted into a ray, as shown in Figure 5.
  • the angle between the action direction and the depth camera plane is ⁇ . It is determined whether the ray passes through the pallet area, and the pallet passing through the pallet area is regarded as the target pallet to be forked.
  • the AGV fork-to-cargo method further includes:
  • the predetermined distance may be set to 2.5-3.5 meters.
  • the depth camera acquires a second RGB image and a second depth image.
  • the safety of the staff can be ensured and the imaging quality of the depth camera is good.
  • the AGV cargo forking method further includes: the AGV moves to the target pallet position to fork the cargo.
  • the AGV after the AGV has finished picking up the goods, it returns to its original position and continues to follow the staff. After reaching the destination, the target action recognition is performed again, and the goods are placed in the designated area, and the AGV is controlled to complete the unloading.
  • the target action is obtained, and the action direction is determined.
  • the position where the action direction coincides with the ground is used as the placement area.
  • the path is generated through short-term path planning, and the AGV is controlled to travel to the placement area according to the planned path to complete unloading.
  • the present disclosure further provides an AGV, as shown in FIG6 , wherein the AGV is provided with a depth camera, and the AGV includes:
  • the image acquisition module 100 is configured to acquire a first RGB image and a first depth image captured by a depth camera.
  • the target detection module 200 is configured to identify a predetermined target based on the first RGB image and the first depth image.
  • the image acquisition module 100 is further configured to acquire a second RGB image and a second depth image captured by the depth camera.
  • the recognition module 300 is configured to recognize a target action and a pallet area of a predetermined target according to the second RGB image and the second depth image, respectively.
  • the pallet determination module 400 is configured to determine a target pallet to be forked according to a target action and a pallet area.
  • the AGV of the embodiment of the present disclosure can respectively identify the predetermined target, target action and pallet area based on the image captured by the depth camera, and determine the target pallet to be forked to automatically fork the goods.
  • the disclosed devices and methods can be implemented in other ways.
  • the device embodiments described above are only illustrative.
  • the division of the units is merely a logical function division, and there may be other division methods in actual implementation, such as multiple units or components can be combined or integrated into another device, or some features can be ignored or not executed.
  • the various component embodiments of the present disclosure may be implemented in hardware, or in software modules running on one or more processors, or in a combination thereof.
  • a microprocessor or digital signal processor may be used in practice to implement some or all of the functions of some modules according to the embodiments of the present disclosure.
  • the present disclosure may also be implemented as a device program (e.g., a computer program and a computer program product) for executing part or all of the methods described herein.
  • a program implementing the present disclosure may be stored on a computer-readable medium, or may have one or more computer programs.
  • Such a signal may be downloaded from an Internet website, or provided on a carrier signal, or in any other form.

Landscapes

  • Engineering & Computer Science (AREA)
  • Multimedia (AREA)
  • Signal Processing (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Atmospheric Sciences (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Health & Medical Sciences (AREA)
  • Biomedical Technology (AREA)
  • General Health & Medical Sciences (AREA)
  • Mechanical Engineering (AREA)
  • Image Analysis (AREA)

Abstract

一种AGV叉取货物方法和AGV,AGV上设有深度相机,AGV叉取货物方法包括:获取深度相机采集的第一RGB图像和第一深度图像(S1);根据第一RGB图像和第一深度图像,识别预定目标(S2);获取深度相机采集的第二RGB图像和第二深度图像(S3);根据第二RGB图像和第二深度图像,分别识别预定目标的目标动作和栈板区域(S4);根据目标动作和栈板区域,确定待叉取的目标栈板(S5)。

Description

AGV叉取货物方法和AGV
相关申请的交叉引用
本公开要求于2024年03月27日提交中国专利局、申请号为202410366345.2、发明名称为“AGV叉取货物方法和AGV”的中国专利申请的优先权,其全部内容通过引用结合在本公开中。
技术领域
本公开涉及但不限于图像检测技术领域,更具体地涉及一种AGV叉取货物方法和一种AGV。
背景技术
在仓库非建图区域或仓库外,AGV(Automated Guided Vehicle,自动导引运输车)难以完成自动导航和叉取货物,需要人工引导。相关技术中采用AGV跟随的方式引导AGV到指定区域,然后通过人工的方式把货物搬运到AGV上,这种方式费时费力,未能充分开发AGV。
公开内容
本公开实施例提供了一种AGV叉取货物方法和一种AGV。
根据本公开第一方面,提供一种AGV叉取货物方法,所述AGV上设有深度相机,所述方法包括:获取所述深度相机采集的第一RGB图像和第一深度图像;根据所述第一RGB图像和所述第一深度图像,识别预定目标;获取所述深度相机采集的第二RGB图像和第二深度图像;根据所述第二RGB图像和所述第二深度图像,分别识别所述预定目标的目标动作和栈板区域;根据所述目标动作和所述栈板区域,确定待叉取的目标栈板。
在本公开的一个实施例中,所述根据所述第一RGB图像和所述第一深度图像,识别预定目标的步骤,包括:利用第一训练集训练好的识别检测模型对所述第一RGB图像进行识别,并输出目标识别结果;根据所述目标识别结果和所述第一深度图像,得到所述预定目标。
在本公开的一个实施例中,所述根据所述第二RGB图像和所述第二深度图像,分别识别所述预定目标的目标动作和栈板区域的步骤,包括:利用第二训练集训练好的识别检测模型对所述第二RGB图像进行检测,输出动作识别 结果;根据所述动作识别结果和所述第二深度图像,得到所述目标动作;利用第三训练集训练好的识别检测模型对所述第二RGB图像进行检测,输出栈板识别结果;根据所述栈板识别结果和所述第二深度图像,得到所述栈板区域。
在本公开的一个实施例中,所述识别检测模型包括:依次连接的被配置为特征提取的主干网络、被配置为特征融合的颈部网络和被配置为目标检测的头部网络;所述颈部网络包括多尺度加权融合注意力模块和特征融合模块;所述多尺度加权融合注意力模块,与所述主干网络连接,被配置为将所述主干网络输出的特征进行信息融合,得到不同尺度的信息融合特征;所述特征融合模块,分别与所述多尺度加权融合注意力模块和所述主干网络连接,被配置为对所述主干网络输出的特征和所述不同尺度的信息融合特征,进行特征融合。
在本公开的一个实施例中,所述多尺度加权融合注意力模块,包括:第一注意力模块,与所述主干网络连接,被配置为对所述主干网络输出的第一路特征进行处理后,输出第一特征;第二注意力模块,与所述主干网络连接,被配置为对所述主干网络输出的第二路特征进行处理后,输出第二特征;第三注意力模块,与所述主干网络连接,被配置为对所述主干网络输出的第三路特征进行处理后,输出第三特征;权重分配模块,分别与所述第一注意力模块、所述第二注意力模块和所述第三注意力模块连接,被配置为对所述第一特征、所述第二特征和所述第三特征,进行加权求和处理,输出第四特征;第四注意力模块,与所述权重分配模块连接,被配置为对所述第四特征进行处理,输出所述不同尺度的信息融合特征。
在本公开的一个实施例中,所述第一注意力模块包括第一卷积层和第一通道注意力模块;所述第二注意力模块包括第二通道注意力模块;所述第三注意力模块包括第三通道注意力模块和上采样模块;所述第四注意力模块包括第一空间注意力模块。
在本公开的一个实施例中,所述第一注意力模块的输出由如下公式表示:
X11=ChannelAttention(Conv(X1))
所述第二注意力模块的输出由如下公式表示:
X21=ChannelAttention(X2)
所述第三注意力模块的输出由如下公式表示:
X31=ChannelAttention(Upsample(X3))
所述权重分配模块的输出由如下公式表示:
所述第四注意力模块的输出由如下公式表示:
Y2=SpatialAttention(Y1)
其中,X1表示第一路特征,X2表示第二路特征,X3表示第三路特征,Wi表示权重系数,i表示为1、2、3。
在本公开的一个实施例中,所述第一通道注意力模块、所述第二通道注意力模块和所述第三通道注意力模块均由依次连接的第一平均池化层、第二卷积层、第一激活层和第一Hadamard乘积模块组成,其中,所述第一Hadamard乘积模块还与所述第二卷积层连接。
在本公开的一个实施例中,所述第一通道注意力模块、所述第二通道注意力模块和所述第三通道注意力模块的输出由如下公式表示:
其中,X表示输入特征。
在本公开的一个实施例中,所述第一空间注意力模块包括第二平均池化层、最大池化层、连接层、第二激活层和第二Hadamard乘积模块;其中,所述最大池化层、连接层、第二激活层和第二Hadamard乘积模块依次连接,所述第二Hadamard乘积模块还与所述权重分配模块连接,所述第二平均池化层的输入端与所述权重分配模块连接,所述第二平均池化层的输出端与所述连接层连接。
在本公开的一个实施例中,所述第一空间注意力模块的输出由如下公式表示:
其中,X表示输入特征。
在本公开的一个实施例中,所述根据所述目标识别结果和所述第一深度图像,得到所述预定目标的步骤,包括:根据像素点坐标、所述深度相机的内参矩阵和所述第一深度图像中的深度值,确定所述预定目标;其中,所述识别结果包括所述预定目标的像素点坐标,所述预定目标的位置坐标与所述像素点坐标、所述内参矩阵中的参数和所述深度值成预定关系,所述内参矩阵中的参数包括焦距横坐标、焦距纵坐标、光心横坐标和光心纵坐标。
在本公开的一个实施例中,所述预定目标的位置坐标与所述像素点坐标、 所述内参矩阵中的参数和所述深度值成预定关系,具体为:所述位置坐标的横坐标与所述位置坐标的垂直坐标、所述像素点坐标的横坐标、所述光心横坐标和所述焦距横坐标成预定关系;所述位置坐标的纵坐标与所述位置坐标的垂直坐标、所述像素点坐标的纵坐标、所述光心纵坐标和所述焦距纵坐标成预定关系;所述位置坐标的垂直坐标与所述深度值成预定关系。
在本公开的一个实施例中,所述预定目标的位置坐标与所述像素点坐标、所述内参矩阵中的参数和所述深度值成预定关系,具体为:所述位置坐标的横坐标与所述位置坐标的垂直坐标、所述像素点坐标的横坐标与所述光心横坐标的差和所述焦距横坐标的商成预定关系;所述位置坐标的纵坐标与所述位置坐标的垂直坐标、所述像素点坐标的纵坐标与所述光心纵坐标的差和所述焦距纵坐标的商成预定关系;所述位置坐标的垂直坐标等于所述深度值。
在本公开的一个实施例中,所述位置坐标的横坐标由以下公式表示:
X=Z(u-cx)/fx
所述位置坐标的纵坐标由以下公式表示:
Y=Z(v-cy)/fy
所述位置坐标的垂直坐标由以下公式表示:
Z=d
其中,X表示所述位置坐标的横坐标,Y表示所述位置坐标的纵坐标,Z表示所述位置坐标的垂直坐标,u表示所述像素点坐标的横坐标,v表示所述像素点坐标的纵坐标,cx表示所述光心横坐标,cy表示所述光心纵坐标,fx表示所述焦距横坐标,fy表示所述焦距纵坐标,d表示所述深度值。
在本公开的一个实施例中,所述根据所述目标动作和所述栈板区域,确定待叉取的目标栈板的步骤包括:根据所述目标动作,确定动作指向;当所述动作指向经过所述栈板区域时,将所述动作指向与所述栈板区域中重合的栈板,作为所述待叉取的目标栈板。
在本公开的一个实施例中,在所述根据所述RGB图像和所述深度图像,识别预定目标之后,所述方法还包括:与所述预定目标保持预定距离,并跟随所述预定目标,到达指定位置;在所述指定位置,所述深度相机采集得到所述第二RGB图像和所述第二深度图像。
在本公开的一个实施例中,在所述根据所述目标动作和所述栈板区域,确定待叉取的目标栈板的步骤之后,所述方法,还包括:所述AGV移动到所述 目标栈板位置,进行货物的叉取。
在本公开的一个实施例中,所述目标动作为手势。
根据本公开第二方面,提供了一种AGV,所述AGV上设有深度相机,所述AGV包括:图像获取模块,被配置为获取所述深度相机采集的第一RGB图像和第一深度图像;目标检测模块,被配置为根据所述第一RGB图像和所述第一深度图像,识别预定目标;所述图像获取模块,还被配置为获取所述深度相机采集的第二RGB图像和第二深度图像;识别模块,被配置为根据所述第二RGB图像和所述第二深度图像,分别识别所述预定目标的目标动作和栈板区域;栈板确定模块,被配置为根据所述目标动作和所述栈板区域,确定待叉取的目标栈板。
根据本公开实施例提供的AGV叉取货物方法和AGV,能够根据深度相机采集的图像,分别识别预定目标、目标动作和栈板区域,并确定待叉取的目标栈板,以进行货物的自动叉取。
附图说明
为了更清楚地说明本公开实施例中的技术方案,下面将对实施例描述中所需要使用的附图作简单地介绍,显而易见地,下面描述中的附图仅仅是本公开的一些实施例,对于本领域普通技术人员来讲,在不付出创造性劳动性的前提下,还可以根据这些附图获得其他的附图。
图1为本公开一实施例提供的AGV叉取货物方法的流程示意图;
图2为本公开一实施例提供的识别工作人员的示意图;
图3为本公开一实施例提供的识别栈板区域的示意图;
图4为本公开一实施例提供的识别检测模型的结构示意图;
图5为本公开一实施例提供的确定待叉取的目标栈板的示意图;
图6为本公开一实施例提供的AGV的结构示意图。
附图标记说明:
1:AGV;2:深度相机;3:AGV货叉;4:工作人员;5:行人检测矩形
框;6:货物;7:栈板;8:栈板识别矩形框;9:手势指向方向。
具体实施方式
下面将参照附图详细描述根据本公开的实施例。显然,所描述的实施例仅 仅是本公开的一部分实施例,而不是本公开的全部实施例,应理解,本公开不受这里描述的实施例的限制。基于本公开中描述的本公开实施例,本领域技术人员在没有付出创造性劳动的情况下所得到的所有其它实施例都应落入本公开的保护范围之内。
在下文的描述中,给出了大量具体的细节以便提供对本公开更为彻底的理解。然而,对于本领域技术人员而言显而易见的是,本公开可以无需一个或多个这些细节而得以实施。在其他的例子中,为了避免与本公开发生混淆,对于本领域公知的一些技术特征未进行描述。
应当理解的是,本公开能够以不同形式实施,而不应当解释为局限于这里提出的实施例。相反地,提供这些实施例将使公开彻底和完全,并且将本公开的范围完全地传递给本领域技术人员。
为了彻底理解本公开,将在下列的描述中提出详细的结构,以便阐释本公开提出的技术方案。本公开的可选实施例详细描述如下,然而除了这些详细描述外,本公开还可以具有其他实施方式。
下面结合附图,对本公开的一些实施方式作详细说明。在不冲突的情况下,下述的实施例及实施例中的特征可以相互组合。
本公开第一方面提供了一种AGV叉取货物方法,如图1所示,AGV上设有深度相机,AGV叉取货物方法包括:
S1,获取深度相机采集的第一RGB图像和第一深度图像。
作为一个实施例,深度相机可设置在AGV的前端或顶部。深度相机采集的RGB图像能够提供物体的颜色信息,采集的深度图像能够提供物体与深度相机之间的距离信息。
S2,根据第一RGB图像和第一深度图像,识别预定目标。
需要说明的是,AGV可利用图像处理和机器学习技术,例如目标检测算法,来识别第一RGB图像和第一深度图像中的预定目标。
作为一个实施例,预定目标可为工作人员。在工作人员下发工作指令后,AGV根据获取的图像,识别出工作人员。
S3,获取深度相机采集的第二RGB图像和第二深度图像。
S4,根据第二RGB图像和第二深度图像,分别识别预定目标的目标动作和 栈板区域。
具体地,预定目标的目标动作为手势。
S5,根据目标动作和栈板区域,确定待叉取的目标栈板。
需要说明的是,栈板区域应包括一个或多个栈板。
本公开实施例的AGV叉取货物方法能够根据深度相机采集的图像,分别识别预定目标、目标动作和栈板区域,并确定待叉取的目标栈板,以进行货物的自动叉取。
在一些实施例中,根据第一RGB图像和第一深度图像,识别预定目标的步骤,包括:
S211,利用第一训练集训练好的识别检测模型对第一RGB图像进行识别,并输出目标识别结果。
需要说明的是,第一训练集可包括带有标签的RGB图像,每个目标都被标记或注释了相应的标签,识别检测模型可为轻量化目标检测模型。
S212,根据目标识别结果和第一深度图像,得到预定目标。
如图2所示,通过深度相机能够准确识别出工作人员。
在该实施例中,通过将从第一RGB图像中获得目标识别结果与第一深度图像相结合,能够更准确地确定预定目标的位置。
在一些实施例中,根据第二RGB图像和第二深度图像,分别识别预定目标的目标动作和栈板区域的步骤,包括:
S41,利用第二训练集训练好的识别检测模型对第二RGB图像进行检测,输出动作识别结果。
需要说明的是,第二训练集可包括带有标签的RGB图像,每个目标的动作都被标记或注释了相应的标签,识别检测模型可为轻量化目标检测模型。
S42,根据动作识别结果和第二深度图像,得到目标动作。
S43,利用第三训练集训练好的识别检测模型对第二RGB图像进行检测,输出栈板识别结果。
需要说明的是,第三训练集可包括带有标签的RGB图像,每个栈板都被标记或注释了相应的标签,识别检测模型可为轻量化目标检测模型。
S44,根据栈板识别结果和第二深度图像,得到栈板区域。
如图3所示,通过深度相机能够准确识别出栈板区域。
在该实施例中,通过将从第二RGB图像中分别获得的动作识别结果和栈板识别结果与第一深度图像相结合,能够更准确地确定目标动作和栈板区域。
识别检测模型可采用YOLOv8n,也可根据实际应用效果选择其他模型,例如YOLOv7、YOLOv6等等。接下来,以识别检测模型包括YOLOv8n进行说明。
在一些实施例中,如图4所示,识别检测模型包括:依次连接的被配置为特征提取的主干网络、被配置为特征融合的颈部网络和被配置为目标检测的头部网络。
颈部网络包括多尺度加权融合注意力模块(Multi-scale Weighted Fusion Attention,MWFA)和特征融合模块。
多尺度加权融合注意力模块,与主干网络连接,被配置为将主干网络输出的特征进行信息融合,得到不同尺度的信息融合特征。
特征融合模块,分别与多尺度加权融合注意力模块和主干网络连接,被配置为对主干网络输出的特征和不同尺度的信息融合特征,进行特征融合。
具体地,多尺度加权融合注意力模块,包括:
第一注意力模块,与主干网络连接,被配置为对主干网络输出的第一路特征进行处理后,输出第一特征。
第二注意力模块,与主干网络连接,被配置为对主干网络输出的第二路特征进行处理后,输出第二特征。
第三注意力模块,与主干网络连接,被配置为对主干网络输出的第三路特征进行处理后,输出第三特征。
权重分配模块,分别与第一注意力模块、第二注意力模块和第三注意力模块连接,被配置为对第一特征、第二特征和第三特征,进行加权求和处理,输出第四特征。
第四注意力模块,与权重分配模块连接,被配置为对第四特征进行处理,输出不同尺度的信息融合特征。
更具体地,第一注意力模块包括第一卷积层和第一通道注意力模块;第二注意力模块包括第二通道注意力模块;第三注意力模块包括第三通道注意力模 块和上采样模块;第四注意力模块包括第一空间注意力模块。
作为一个实施例,第一注意力模块的输出由如下公式表示:
X11=ChannelAttention(Conv(X1))
第二注意力模块的输出由如下公式表示:
X21=ChannelAttention(X2)
第三注意力模块的输出由如下公式表示:
X31=ChannelAttention(Upsample(X3))
权重分配模块的输出由如下公式表示:
第四注意力模块的输出由如下公式表示:
Y2=SpatialAttention(Y1)
其中,X1表示第一路特征,X2表示第二路特征,X3表示第三路特征,Wi表示权重系数,i表示为1、2、3。
更具体地,第一通道注意力模块、第二通道注意力模块和第三通道注意力模块均由依次连接的第一平均池化层、第二卷积层、第一激活层和第一Hadamard乘积模块组成,其中,第一Hadamard乘积模块还与第二卷积层连接。
作为一个实施例,第一通道注意力模块、第二通道注意力模块和第三通道注意力模块的输出由如下公式表示:
其中,X表示输入特征。
更具体地,第一空间注意力模块包括第二平均池化层、最大池化层、连接层、第二激活层和第二Hadamard乘积模块。其中,最大池化层、连接层、第二激活层和第二Hadamard乘积模块依次连接,第二Hadamard乘积模块还与权重分配模块连接,第二平均池化层的输入端与权重分配模块连接,第二平均池化层的输出端与连接层连接。
作为一个实施例,第一空间注意力模块的输出由如下公式表示:
其中,X表示输入特征。
相应地,可将包含多尺度加权融合注意力模块的YOLOv8n网络,记为MWFA-YOLOv8n。
接下来,通过对比YOLOv8n与MWFA-YOLOv8n的实验结果,说明本公开的优势。在网络中少量增加参数量的情况下,实验结果如下:
如表一、二、三所示,在网络中少量增加参数量的情况下,识别精度有了较大的提高,识别效果提升明显。
表一 预定目标检测实验结果
表二 目标动作识别实验结果
表三 栈板区域识别实验结果
在该实施例中,由于传统的YOLOv8n网络,采用简单的拼接层,未能区分不同特征的重要性,并且特征通道间对识别的重要性是不同的。通过增加多尺度加权融合注意力模块,能够得到带权重的不同尺度的信息融合特征,然后继续在颈部网络进行特征融合,最后输出到头部网络。
在一些实施例中,根据目标识别结果和第一深度图像,得到预定目标的步骤,包括:
根据像素点坐标、深度相机的内参矩阵和第一深度图像中的深度值,确定 预定目标。
其中,识别结果包括预定目标的像素点坐标,预定目标的位置坐标与像素点坐标、内参矩阵中的参数和深度值成预定关系,内参矩阵中的参数包括焦距横坐标、焦距纵坐标、光心横坐标和光心纵坐标。
具体地,预定目标的位置坐标与像素点坐标、内参矩阵中的参数和深度值成预定关系,具体为:
位置坐标的横坐标与位置坐标的垂直坐标、像素点坐标的横坐标、光心横坐标和焦距横坐标成预定关系;位置坐标的纵坐标与位置坐标的垂直坐标、像素点坐标的纵坐标、光心纵坐标和焦距纵坐标成预定关系;位置坐标的垂直坐标与深度值成预定关系。
更具体地,预定目标的位置坐标与像素点坐标、内参矩阵中的参数和深度值成预定关系,具体为:
位置坐标的横坐标与位置坐标的垂直坐标、像素点坐标的横坐标与光心横坐标的差和焦距横坐标的商成预定关系;位置坐标的纵坐标与位置坐标的垂直坐标、像素点坐标的纵坐标与光心纵坐标的差和焦距纵坐标的商成预定关系;位置坐标的垂直坐标等于深度值。
更具体地,位置坐标的横坐标由以下公式表示:
X=Z(u-cx)/fx
位置坐标的纵坐标由以下公式表示:
Y=Z(v-cy)/fy
位置坐标的垂直坐标由以下公式表示:
Z=d
其中,X表示位置坐标的横坐标,Y表示位置坐标的纵坐标,Z表示位置坐标的垂直坐标,u表示像素点坐标的横坐标,v表示像素点坐标的纵坐标,cx表示光心横坐标,cy表示光心纵坐标,fx表示焦距横坐标,fy表示焦距纵坐标,d表示深度值。
作为一个实施例,将目标识别结果和第一深度图像进行结合的计算公式可表示为:
其中,Puv表示RGB图像的像素点坐标,K表示深度相机的内参矩阵,P表示深度图像的坐标。
在该实施例中,通过结合深度相机的内参矩阵和深度值,计算目标的位置坐标,能够提高目标识别的精确性、实时性和鲁棒性。
在一些实施例中,根据目标动作和栈板区域,确定待叉取的目标栈板的步骤包括:
S51,根据目标动作,确定动作指向。
作为一个实施例,动作指向可为工作人员的手势指向。
S52,当动作指向经过栈板区域时,将动作指向与栈板区域中重合的栈板,作为待叉取的目标栈板。
作为一个实施例,根据识别的目标动作和栈板区域的点云信息,将动作指向拟合成一条射线,如图5所示,动作指向和深度相机平面的夹角为θ,判断该射线是否经过栈板区域,将经过该栈板区域的栈板视为待叉取的目标栈板。
在一些实施例中,在根据RGB图像和深度图像,识别预定目标之后,AGV叉取货物方法还包括:
S221,与预定目标保持预定距离,并跟随预定目标,到达指定位置。
作为一个实施例,预定距离可设置为2.5-3.5米。
S222,在指定位置,深度相机采集得到第二RGB图像和第二深度图像。
在该实施例中,通过与预定目标保持预定距离,能够保证工作人员的安全且深度相机成像质量较好。
在一些实施例中,在根据目标动作和栈板区域,确定待叉取的目标栈板的步骤之后,AGV叉取货物方法,还包括:AGV移动到目标栈板位置,进行货物的叉取。
作为一个实施例,AGV在叉取货物完成后,返回原来位置,继续跟随工作人员。达到目的地后,重新进行目标动作识别,并将货物放置指定区域,控制AGV完成卸货。
作为另一个实施例,在需要进行货物卸载时,获取目标动作,并确定动作指向,将动作指向与地面重合的位置,作为放置区域,计算得出放置区域坐标信息后,通过短期路径规划实现路径的生成,控制AGV按照规划路径行驶到放置区域完成卸货。
另外,本公开还提供了一种AGV,如图6所示,AGV上设有深度相机,AGV包括:
图像获取模块100,被配置为获取深度相机采集的第一RGB图像和第一深度图像。
目标检测模块200,被配置为根据第一RGB图像和第一深度图像,识别预定目标。
图像获取模块100,还被配置为获取深度相机采集的第二RGB图像和第二深度图像。
识别模块300,被配置为根据第二RGB图像和第二深度图像,分别识别预定目标的目标动作和栈板区域。
栈板确定模块400,被配置为根据目标动作和栈板区域,确定待叉取的目标栈板。
本公开实施例的AGV能够根据深度相机采集的图像,分别识别预定目标、目标动作和栈板区域,并确定待叉取的目标栈板,以进行货物的自动叉取。
尽管这里已经参考附图描述了实施例,应理解上述实施例仅仅是实施例性的,并且不意图将本公开的范围限制于此。本领域普通技术人员可以在其中进行各种改变和修改,而不偏离本公开的范围和精神。所有这些改变和修改意在被包括在所附权利要求所要求的本公开的范围之内。
本领域普通技术人员可以意识到,结合本文中所公开的实施例描述的各实施例的单元及算法步骤,能够以电子硬件、或者计算机软件和电子硬件的结合来实现。这些功能究竟以硬件还是软件方式来执行,取决于技术方案的特定应用和设计约束条件。专业技术人员可以对每个特定的应用来使用不同方法来实现所描述的功能,但是这种实现不应认为超出本公开的范围。
在本公开所提供的几个实施例中,应该理解到,所揭露的设备和方法,可以通过其他的方式实现。例如,以上所描述的设备实施例仅仅是示意性的,例 如,所述单元的划分,仅仅为一种逻辑功能划分,实际实现时可以有另外的划分方式,例如多个单元或组件可以结合或者可以集成到另一个设备,或一些特征可以忽略,或不执行。
在此处所提供的说明书中,说明了大量具体细节。然而,能够理解,本公开的实施例可以在没有这些具体细节的情况下实践。在一些实例中,并未详细示出公知的方法、结构和技术,以便不模糊对本说明书的理解。
类似地,应当理解,为了精简本公开并帮助理解各个发明方面中的一个或多个,在对本公开的实施例性实施例的描述中,本公开的各个特征有时被一起分组到单个实施例、图、或者对其的描述中。然而,并不应将该本公开的方法解释成反映如下意图:即所要求保护的本公开要求比在每个权利要求中所明确记载的特征更多的特征。更确切地说,如相应的权利要求书所反映的那样,其发明点在于可以用少于某个公开的单个实施例的所有特征的特征来解决相应的技术问题。因此,遵循具体实施方式的权利要求书由此明确地并入该具体实施方式,其中每个权利要求本身都作为本公开的单独实施例。
本领域的技术人员可以理解,除了特征之间相互排斥之外,可以采用任何组合对本说明书(包括伴随的权利要求、摘要和附图)中公开的所有特征以及如此公开的任何方法或者设备的所有过程或单元进行组合。除非另外明确陈述,本说明书(包括伴随的权利要求、摘要和附图)中公开的每个特征可以由提供相同、等同或相似目的的替代特征来代替。
此外,本领域的技术人员能够理解,尽管在此所述的一些实施例包括其他实施例中所包括的某些特征而不是其他特征,但是不同实施例的特征的组合意味着处于本公开的范围之内并且形成不同的实施例。例如,在权利要求书中,所要求保护的实施例的任意之一都可以以任意的组合方式来使用。
本公开的各个部件实施例可以以硬件实现,或者以在一个或者多个处理器上运行的软件模块实现,或者以它们的组合实现。本领域的技术人员应当理解,可以在实践中使用微处理器或者数字信号处理器(DSP)来实现根据本公开实施例的一些模块的一些或者全部功能。本公开还可以实现为用于执行这里所描述的方法的一部分或者全部的装置程序(例如,计算机程序和计算机程序产品)。这样的实现本公开的程序可以存储在计算机可读介质上,或者可以具有一个或 者多个信号的形式。这样的信号可以从因特网网站上下载得到,或者在载体信号上提供,或者以任何其他形式提供。
应该注意的是上述实施例对本公开进行说明而不是对本公开进行限制,并且本领域技术人员在不脱离所附权利要求的范围的情况下可设计出替换实施例。在权利要求中,不应将位于括号之间的任何参考符号构造成对权利要求的限制。单词“包含”不排除存在未列在权利要求中的元件或步骤。位于元件之前的单词“一”或“一个”不排除存在多个这样的元件。本公开可以借助于包括有若干不同元件的硬件以及借助于适当编程的计算机来实现。在列举了若干装置的单元权利要求中,这些装置中的若干个可以是通过同一个硬件项来具体体现。单词第一、第二、以及第三等的使用不表示任何顺序。可将这些单词解释为名称。
以上所述,仅为本公开的具体实施方式或对具体实施方式的说明,本公开的保护范围并不局限于此,任何熟悉本技术领域的技术人员在本公开揭露的技术范围内,可轻易想到变化或替换,都应涵盖在本公开的保护范围之内。本公开的保护范围应以权利要求的保护范围为准。

Claims (20)

  1. 一种AGV叉取货物方法,其中,所述AGV上设有深度相机,所述方法包括:
    获取所述深度相机采集的第一RGB图像和第一深度图像;
    根据所述第一RGB图像和所述第一深度图像,识别预定目标;
    获取所述深度相机采集的第二RGB图像和第二深度图像;
    根据所述第二RGB图像和所述第二深度图像,分别识别所述预定目标的目标动作和栈板区域;
    根据所述目标动作和所述栈板区域,确定待叉取的目标栈板。
  2. 如权利要求1所述的AGV叉取货物方法,其中,所述根据所述第一RGB图像和所述第一深度图像,识别预定目标的步骤,包括:
    利用第一训练集训练好的识别检测模型对所述第一RGB图像进行识别,并输出目标识别结果;
    根据所述目标识别结果和所述第一深度图像,得到所述预定目标。
  3. 如权利要求1所述的AGV叉取货物方法,其中,所述根据所述第二RGB图像和所述第二深度图像,分别识别所述预定目标的目标动作和栈板区域的步骤,包括:
    利用第二训练集训练好的识别检测模型对所述第二RGB图像进行检测,输出动作识别结果;
    根据所述动作识别结果和所述第二深度图像,得到所述目标动作;
    利用第三训练集训练好的识别检测模型对所述第二RGB图像进行检测,输出栈板识别结果;
    根据所述栈板识别结果和所述第二深度图像,得到所述栈板区域。
  4. 如权利要求2或3所述的AGV叉取货物方法,其中,所述识别检测模型包括:依次连接的被配置为特征提取的主干网络、被配置为特征融合的颈部网络和被配置为目标检测的头部网络;
    所述颈部网络包括多尺度加权融合注意力模块和特征融合模块;
    所述多尺度加权融合注意力模块,与所述主干网络连接,被配置为将所述主干网络输出的特征进行信息融合,得到不同尺度的信息融合特征;
    所述特征融合模块,分别与所述多尺度加权融合注意力模块和所述主干网络连接,被配置为对所述主干网络输出的特征和所述不同尺度的信息融合特征,进行特征融合。
  5. 如权利要求4所述的AGV叉取货物方法,其中,所述多尺度加权融合注意力模块,包括:
    第一注意力模块,与所述主干网络连接,被配置为对所述主干网络输出的第一路特征进行处理后,输出第一特征;
    第二注意力模块,与所述主干网络连接,被配置为对所述主干网络输出的第二路特征进行处理后,输出第二特征;
    第三注意力模块,与所述主干网络连接,被配置为对所述主干网络输出的第三路特征进行处理后,输出第三特征;
    权重分配模块,分别与所述第一注意力模块、所述第二注意力模块和所述第三注意力模块连接,被配置为对所述第一特征、所述第二特征和所述第三特征,进行加权求和处理,输出第四特征;
    第四注意力模块,与所述权重分配模块连接,被配置为对所述第四特征进行处理,输出所述不同尺度的信息融合特征。
  6. 如权利要求5所述的AGV叉取货物方法,其中,所述第一注意力模块包括第一卷积层和第一通道注意力模块;
    所述第二注意力模块包括第二通道注意力模块;
    所述第三注意力模块包括第三通道注意力模块和上采样模块;
    所述第四注意力模块包括第一空间注意力模块。
  7. 如权利要求6所述的AGV叉取货物方法,其中,所述第一注意力模块的输出由如下公式表示:
    X11=ChannelAttention(Conv(X1))
    所述第二注意力模块的输出由如下公式表示:
    X21=ChannelAttention(X2)
    所述第三注意力模块的输出由如下公式表示:
    X31=ChannelAttention(Upsample(X3))
    所述权重分配模块的输出由如下公式表示:
    所述第四注意力模块的输出由如下公式表示:
    Y2=SpatialAttention(Y1)
    其中,X1表示第一路特征,X2表示第二路特征,X3表示第三路特征,Wi表示权重系数,i表示为1、2、3。
  8. 如权利要求6所述的AGV叉取货物方法,其中,所述第一通道注意力模块、所述第二通道注意力模块和所述第三通道注意力模块均由依次连接的第一平均池化层、第二卷积层、第一激活层和第一Hadamard乘积模块组成,其中,所述第一Hadamard乘积模块还与所述第二卷积层连接。
  9. 如权利要求8所述的AGV叉取货物方法,其中,所述第一通道注意力模块、所述第二通道注意力模块和所述第三通道注意力模块的输出由如下公式表示:
    其中,X表示输入特征。
  10. 如权利要求6所述的AGV叉取货物方法,其中,所述第一空间注意力模块包括第二平均池化层、最大池化层、连接层、第二激活层和第二Hadamard乘积模块;
    其中,所述最大池化层、连接层、第二激活层和第二Hadamard乘积模块依次连接,所述第二Hadamard乘积模块还与所述权重分配模块连接,所述第二平均池化层的输入端与所述权重分配模块连接,所述第二平均池化层的输出端与所述连接层连接。
  11. 如权利要求10所述的AGV叉取货物方法,其中,所述第一空间注意力模块的输出由如下公式表示:
    其中,X表示输入特征。
  12. 如权利要求2所述的AGV叉取货物方法,其中,所述根据所述目标识别结果和所述第一深度图像,得到所述预定目标的步骤,包括:
    根据像素点坐标、所述深度相机的内参矩阵和所述第一深度图像中的深度 值,确定所述预定目标;
    其中,所述识别结果包括所述预定目标的像素点坐标,所述预定目标的位置坐标与所述像素点坐标、所述内参矩阵中的参数和所述深度值成预定关系,所述内参矩阵中的参数包括焦距横坐标、焦距纵坐标、光心横坐标和光心纵坐标。
  13. 如权利要求12所述的AGV叉取货物方法,其中,所述预定目标的位置坐标与所述像素点坐标、所述内参矩阵中的参数和所述深度值成预定关系,具体为:
    所述位置坐标的横坐标与所述位置坐标的垂直坐标、所述像素点坐标的横坐标、所述光心横坐标和所述焦距横坐标成预定关系;
    所述位置坐标的纵坐标与所述位置坐标的垂直坐标、所述像素点坐标的纵坐标、所述光心纵坐标和所述焦距纵坐标成预定关系;
    所述位置坐标的垂直坐标与所述深度值成预定关系。
  14. 如权利要求13所述的AGV叉取货物方法,其中,所述预定目标的位置坐标与所述像素点坐标、所述内参矩阵中的参数和所述深度值成预定关系,具体为:
    所述位置坐标的横坐标与所述位置坐标的垂直坐标、所述像素点坐标的横坐标与所述光心横坐标的差和所述焦距横坐标的商成预定关系;
    所述位置坐标的纵坐标与所述位置坐标的垂直坐标、所述像素点坐标的纵坐标与所述光心纵坐标的差和所述焦距纵坐标的商成预定关系;
    所述位置坐标的垂直坐标等于所述深度值。
  15. 如权利要求12所述的AGV叉取货物方法,其中,所述位置坐标的横坐标由以下公式表示:
    X=Z(u-cx)/fx
    所述位置坐标的纵坐标由以下公式表示:
    Y=Z(v-cy)/fy
    所述位置坐标的垂直坐标由以下公式表示:
    Z=d
    其中,X表示所述位置坐标的横坐标,Y表示所述位置坐标的纵坐标,Z表 示所述位置坐标的垂直坐标,u表示所述像素点坐标的横坐标,v表示所述像素点坐标的纵坐标,cx表示所述光心横坐标,cy表示所述光心纵坐标,fx表示所述焦距横坐标,fy表示所述焦距纵坐标,d表示所述深度值。
  16. 如权利要求1所述的AGV叉取货物方法,其中,所述根据所述目标动作和所述栈板区域,确定待叉取的目标栈板的步骤包括:
    根据所述目标动作,确定动作指向;
    当所述动作指向经过所述栈板区域时,将所述动作指向与所述栈板区域中重合的栈板,作为所述待叉取的目标栈板。
  17. 如权利要求1所述的AGV叉取货物方法,其中,在所述根据所述RGB图像和所述深度图像,识别预定目标之后,所述方法还包括:
    与所述预定目标保持预定距离,并跟随所述预定目标,到达指定位置;
    在所述指定位置,所述深度相机采集得到所述第二RGB图像和所述第二深度图像。
  18. 如权利要求1所述的AGV叉取货物方法,其中,在所述根据所述目标动作和所述栈板区域,确定待叉取的目标栈板的步骤之后,所述方法还包括:
    所述AGV移动到所述目标栈板位置,进行货物的叉取。
  19. 如权利要求1所述的AGV叉取货物方法,其中,所述目标动作为手势。
  20. 一种AGV,其中,所述AGV上设有深度相机,所述AGV包括:
    图像获取模块,被配置为获取所述深度相机采集的第一RGB图像和第一深度图像;
    目标检测模块,被配置为根据所述第一RGB图像和所述第一深度图像,识别预定目标;
    所述图像获取模块,还被配置为获取所述深度相机采集的第二RGB图像和第二深度图像;
    识别模块,被配置为根据所述第二RGB图像和所述第二深度图像,分别识别所述预定目标的目标动作和栈板区域;
    栈板确定模块,被配置为根据所述目标动作和所述栈板区域,确定待叉取的目标栈板。
PCT/CN2024/118520 2024-03-27 2024-09-12 Agv叉取货物方法和agv Pending WO2025200325A1 (zh)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
CN202410366345.2A CN119854608A (zh) 2024-03-27 2024-03-27 Agv叉取货物方法和agv
CN202410366345.2 2024-03-27

Publications (1)

Publication Number Publication Date
WO2025200325A1 true WO2025200325A1 (zh) 2025-10-02

Family

ID=95371480

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/CN2024/118520 Pending WO2025200325A1 (zh) 2024-03-27 2024-09-12 Agv叉取货物方法和agv

Country Status (2)

Country Link
CN (1) CN119854608A (zh)
WO (1) WO2025200325A1 (zh)

Citations (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20200101613A1 (en) * 2018-09-27 2020-04-02 Canon Kabushiki Kaisha Information processing apparatus, information processing method, and system
US20200231185A1 (en) * 2019-01-18 2020-07-23 United States Postal Service Systems and methods for automated guided vehicle control
CN113409397A (zh) * 2021-05-18 2021-09-17 杭州电子科技大学 一种基于rgbd相机的仓储托盘检测与定位方法
CN114670189A (zh) * 2020-12-24 2022-06-28 精工爱普生株式会社 存储介质、以及生成机器人的控制程序的方法及系统
CN115063573A (zh) * 2022-06-14 2022-09-16 湖北工业大学 一种基于注意力机制的多尺度目标检测方法
CN116246297A (zh) * 2021-12-07 2023-06-09 南京大学 一种智能叉车系统
CN117315499A (zh) * 2023-10-16 2023-12-29 中国船舶集团有限公司第七〇九研究所 一种卫星遥感图像目标检测方法及系统
CN117495958A (zh) * 2023-10-18 2024-02-02 中车长江运输设备集团有限公司 基于目标检测网络的仓储箱体图像识别定位方法及系统

Patent Citations (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20200101613A1 (en) * 2018-09-27 2020-04-02 Canon Kabushiki Kaisha Information processing apparatus, information processing method, and system
US20200231185A1 (en) * 2019-01-18 2020-07-23 United States Postal Service Systems and methods for automated guided vehicle control
CN114670189A (zh) * 2020-12-24 2022-06-28 精工爱普生株式会社 存储介质、以及生成机器人的控制程序的方法及系统
CN113409397A (zh) * 2021-05-18 2021-09-17 杭州电子科技大学 一种基于rgbd相机的仓储托盘检测与定位方法
CN116246297A (zh) * 2021-12-07 2023-06-09 南京大学 一种智能叉车系统
CN115063573A (zh) * 2022-06-14 2022-09-16 湖北工业大学 一种基于注意力机制的多尺度目标检测方法
CN117315499A (zh) * 2023-10-16 2023-12-29 中国船舶集团有限公司第七〇九研究所 一种卫星遥感图像目标检测方法及系统
CN117495958A (zh) * 2023-10-18 2024-02-02 中车长江运输设备集团有限公司 基于目标检测网络的仓储箱体图像识别定位方法及系统

Also Published As

Publication number Publication date
CN119854608A (zh) 2025-04-18

Similar Documents

Publication Publication Date Title
US11878433B2 (en) Method for detecting grasping position of robot in grasping object
Yeum et al. Automated region-of-interest localization and classification for vision-based visual assessment of civil infrastructure
CN110411441B (zh) 用于多模态映射和定位的系统和方法
US11017244B2 (en) Obstacle type recognizing method and apparatus, device and storage medium
CN110096059B (zh) 自动驾驶方法、装置、设备及存储介质
WO2022170844A1 (zh) 一种视频标注方法、装置、设备及计算机可读存储介质
CN108288088B (zh) 一种基于端到端全卷积神经网络的场景文本检测方法
CN108734058B (zh) 障碍物类型识别方法、装置、设备及存储介质
CN110334708A (zh) 跨模态目标检测中的差异自动校准方法、系统、装置
JP5262705B2 (ja) 運動推定装置及びプログラム
CN111027381A (zh) 利用单目相机识别障碍物的方法、装置、设备及存储介质
JP2012042396A (ja) 位置姿勢計測装置、位置姿勢計測方法、およびプログラム
CN106030610A (zh) 移动设备的实时3d姿势识别和跟踪系统
US20180260661A1 (en) Image processing apparatus, image processing method, and image processing program
WO2022205614A1 (zh) 模板匹配方法、装置、计算机设备及存储介质
CN114359865A (zh) 一种障碍物的检测方法及相关装置
WO2024130857A1 (zh) 一种物品陈列检测方法、装置、设备及可读存储介质
CN116309882A (zh) 一种面向无人叉车应用的托盘检测和定位方法及系统
JP2015111128A (ja) 位置姿勢計測装置、位置姿勢計測方法、およびプログラム
CN112749664A (zh) 一种手势识别方法、装置、设备、系统及存储介质
CN117437175A (zh) 机械缺陷检测方法、检测装置和计算机存储介质
CN114419451B (zh) 电梯内外识别方法、装置、电子设备及存储介质
CN116071334A (zh) 托盘识别方法、装置、电子设备及存储介质
CN115272417A (zh) 图像数据的处理方法、图像处理设备以及可读存储介质
TWI728655B (zh) 應用於動物的卷積神經網路偵測方法及系統

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 24932125

Country of ref document: EP

Kind code of ref document: A1