JP2018022484A - 画像内の物体を検出する方法及び物体検出システム - Google Patents

画像内の物体を検出する方法及び物体検出システム Download PDF

Info

Publication number
JP2018022484A
JP2018022484A JP2017144325A JP2017144325A JP2018022484A JP 2018022484 A JP2018022484 A JP 2018022484A JP 2017144325 A JP2017144325 A JP 2017144325A JP 2017144325 A JP2017144325 A JP 2017144325A JP 2018022484 A JP2018022484 A JP 2018022484A
Authority
JP
Japan
Prior art keywords
region
image
network
feature vector
sub
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
JP2017144325A
Other languages
English (en)
Other versions
JP6956555B2 (ja
Inventor
ミン−ユ・リウ
Ming-Yu Liu
オンセル・チュゼル
Oncel Tuzel
チェニイ・チェン
Chenyi Chen
ジアンション、シャオ
Jianxiong Xiao
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Mitsubishi Electric Corp
Original Assignee
Mitsubishi Electric Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Mitsubishi Electric Corp filed Critical Mitsubishi Electric Corp
Publication of JP2018022484A publication Critical patent/JP2018022484A/ja
Application granted granted Critical
Publication of JP6956555B2 publication Critical patent/JP6956555B2/ja
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Images

Classifications

    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/82Arrangements for image or video recognition or understanding using pattern recognition or machine learning using neural networks
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/24Classification techniques
    • G06F18/241Classification techniques relating to the classification model, e.g. parametric or non-parametric approaches
    • G06F18/2413Classification techniques relating to the classification model, e.g. parametric or non-parametric approaches based on distances to training or reference patterns
    • G06F18/24133Distances to prototypes
    • G06F18/24143Distances to neighbourhood prototypes, e.g. restricted Coulomb energy networks [RCEN]
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/25Fusion techniques
    • G06F18/253Fusion techniques of extracted features
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/045Combinations of networks
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T3/00Geometric image transformation in the plane of the image
    • G06T3/40Scaling the whole image or part thereof
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/40Extraction of image or video features
    • G06V10/44Local feature extraction by analysis of parts of the pattern, e.g. by detecting edges, contours, loops, corners, strokes or intersections; Connectivity analysis, e.g. of connected components
    • G06V10/443Local feature extraction by analysis of parts of the pattern, e.g. by detecting edges, contours, loops, corners, strokes or intersections; Connectivity analysis, e.g. of connected components by matching or filtering
    • G06V10/449Biologically inspired filters, e.g. difference of Gaussians [DoG] or Gabor filters
    • G06V10/451Biologically inspired filters, e.g. difference of Gaussians [DoG] or Gabor filters with interaction between the filter responses, e.g. cortical complex cells
    • G06V10/454Integrating the filters into a hierarchical structure, e.g. convolutional neural networks [CNN]
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/764Arrangements for image or video recognition or understanding using pattern recognition or machine learning using classification, e.g. of video objects
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/768Arrangements for image or video recognition or understanding using pattern recognition or machine learning using context analysis, e.g. recognition aided by known co-occurring patterns
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/77Processing image or video features in feature spaces; using data integration or data reduction, e.g. principal component analysis [PCA] or independent component analysis [ICA] or self-organising maps [SOM]; Blind source separation
    • G06V10/80Fusion, i.e. combining data from various sources at the sensor level, preprocessing level, feature extraction level or classification level
    • G06V10/806Fusion, i.e. combining data from various sources at the sensor level, preprocessing level, feature extraction level or classification level of extracted features
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2207/00Indexing scheme for image analysis or image enhancement
    • G06T2207/10Image acquisition modality
    • G06T2207/10004Still image; Photographic image
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2207/00Indexing scheme for image analysis or image enhancement
    • G06T2207/20Special algorithmic details
    • G06T2207/20084Artificial neural networks [ANN]

Abstract

【課題】物体検出性能を改善する方法及びシステムを提供する。
【解決手段】画像内の物体を検出する方法は、第1のサブネットワークを用いて、画像の第1の領域から第1の特徴ベクトルを抽出し、第1の領域を固定比にサイズ変更することによって画像の第2の領域を求める。第1の領域のサイズは、第2の領域のサイズよりも小さい。第2のサブネットワークを用いて画像の第2の領域から第2の特徴ベクトルを抽出し、第1の特徴ベクトル及び第2の特徴ベクトルに基づいて第3のサブネットワークを用いて物体のクラスを分類し、分類の結果に従って第1の領域内の物体のクラスを求める。第1のサブネットワーク、第2のサブネットワーク及び第3のサブネットワークは、ニューラルネットワークを形成する。当該方法は、プロセッサによって実行される。
【選択図】図2

Description

本発明は、ニューラルネットワークに関し、より具体的には、ニューラルネットワークを用いた物体検出システム及び方法に関する。
物体検出は、コンピュータービジョンにおける最も基本的な問題のうちの1つである。物体検出の目標は、所与の入力画像について、信頼値を有するバウンディングボックスの形態の既定の物体クラスの全てのインスタンスを検出し、そのロケーションを特定することである。物体検出問題は、スキャンウィンドウ技法によって物体分類問題に変換することができる。しかしながら、スキャンウィンドウ技法は、分類ステップが様々なロケーション、縮尺、及び縦横比の全ての可能な画像領域について実行されるので、非効率的である。
領域ベース畳み込みニューラルネットワーク(R−CNN)は、2段階アプローチを実行するのに用いられる。この2段階アプローチでは、一組の物体提案が、提案ジェネレーターを用いて対象領域(ROI)として生成され、ROIにおける物体の存在及びクラスが、深層ニューラルネットワークを用いて判断される。しかしながら、R−CNNの検出確度は、幾つかの場合には不十分である。
したがって、物体検出性能を更に改善するには、別の手法が必要とされている。
本発明の幾つかの実施の形態は、領域ベース畳み込みニューラルネットワーク(R−CNN)を、異なるサイズの物体を検出するのに用いることができるという認識に基づいている。しかしながら、画像内の小物体(small objects)を検出すること及び/又は画像内の小物体のクラスラベルを予測することは、小物体を表す画像内のピクセルが少数であることに起因して、シーンの理解には困難な問題である。
幾つかの実施の形態は、特定の小物体が、通常、特定のコンテキストに現れているという認識に基づいている。例えば、マウスは、通常、キーボード及びモニターの近くに置かれている。そのコンテキストは、小物体の小解像度を補償するトレーニング及び認識の一部分とすることができる。そのために、幾つかの実施の形態は、物体を含む種々の領域から特徴ベクトルを抽出する。それらの領域は、異なるサイズの領域であり、物体についての異なるコンテキスト情報を提供する。幾つかの実施の形態では、物体は、特徴ベクトルの組み合わせに基づいて検出及び/又は分類される。
様々な実施の形態は、種々のサイズの物体を検出するのに用いることができる。1つの実施の形態では、物体のサイズは、物体を形成する画像のピクセルの数によって管理される。例えば、小物体は、より少ない数のピクセルによって表される。そのために、1つの実施の形態は、十分なコンテキスト情報を収集するために、物体を取り囲む領域を少なくとも7倍にサイズ変更する。
したがって、1つの実施の形態は、コンピューターに物体検出プロセスを実行させるプログラムを記憶する非一時的コンピューター可読記録媒体を開示する。前記物体検出プロセスは、第1のサブネットワークを用いて、画像の第1の領域から第1の特徴ベクトルを抽出することと、前記第1の領域をサイズ変更することによって前記画像の第2の領域を求めることであって、前記第1の領域のサイズは前記第2の領域のサイズと異なることと、前記第1のサブネットワークを用いて、前記画像の第2の領域から第2の特徴ベクトルを抽出することと、前記第1の特徴ベクトル及び前記第2の特徴ベクトルに基づいて第3のサブネットワークを用いて前記物体を検出して、前記物体を取り囲むバウンディングボックス及び前記物体のクラスを生成することと、を含み、前記第1のサブネットワーク、前記第2のサブネットワーク、及び前記第3のサブネットワークは、ニューラルネットワークを形成する。
別の実施の形態は、画像内の物体を検出する方法を開示する。本方法は、第1のサブネットワークを用いて、画像の第1の領域から第1の特徴ベクトルを抽出するステップと、前記第1の領域をサイズ変更することによって前記画像の第2の領域を求めるステップと、第2のサブネットワークを用いて、前記画像の第2の領域から第2の特徴ベクトルを抽出するステップと、前記第1の特徴ベクトル及び前記第2の特徴ベクトルに基づいて、第3のサブネットワークを用いて前記物体のクラスを分類するステップと、前記分類の結果に従って前記第1の領域内の物体の前記クラスを求めるステップと、を含み、前記第1のサブネットワーク、前記第2のサブネットワーク、及び前記第3のサブネットワークは、ニューラルネットワークを形成し、該方法のステップは、プロセッサによって実行される。
別の実施の形態は、物体検出システムを開示する。本システムは、ヒューマンマシンインターフェースと、ニューラルネットワークを含む記憶デバイスと、メモリと、該システムの外部にあるネットワークと接続可能なネットワークインターフェースコントローラーと、撮像デバイスと接続可能な撮像インターフェースと、前記ヒューマンマシンインターフェース、前記記憶デバイス、前記メモリ、前記ネットワークインターフェースコントローラー及び前記撮像インターフェースに接続するように構成されたプロセッサと、を備え、前記プロセッサは、前記記憶デバイスに記憶された前記ニューラルネットワークを用いて画像内の物体を検出する命令を実行し、前記ニューラルネットワークは、第1のサブネットワークを用いて、前記画像の第1の領域から第1の特徴ベクトルを抽出するステップと、第2のサブネットワークを用いて前記第1の特徴ベクトルを処理することによって前記画像の第2の領域を求めるステップであって、前記第1の領域のサイズは前記第2の領域のサイズと異なる、ステップと、前記第1のサブネットワークを用いて、前記画像の第2の領域から第2の特徴ベクトルを抽出するステップと、前記第1の特徴ベクトル及び前記第2の特徴ベクトルに基づいて第3のサブネットワークを用いて前記物体を検出して、前記物体を取り囲むバウンディングボックス及び前記物体のクラスを生成するステップと、を実行し、前記第1のサブネットワーク、前記第2のサブネットワーク、及び前記第3のサブネットワークは、ニューラルネットワークを形成する。
本発明の幾つかの実施形態による画像内の小物体を検出する物体検出システムのブロック図である。 画像内の小物体を検出するプロセスのフローチャートである。 幾つかの実施形態による画像内の小物体を検出するコンピューターで実施される物体検出方法において用いられるニューラルネットワークのブロック図である。 画像内のターゲット領域画像及びコンテキスト領域画像をサイズ変更する手順を示す図である。 画像において提案ボックス及びコンテキストボックスを時計画像に適用する手順の一例を示す図である。 画像内のマウス画像を検出するプロセスのブロック図である。 小物体カテゴリーの統計の一例を示す表である。 カテゴリーごとの物体のメジアンバウンディングボックスサイズ及び対応するアップサンプリング比を示す表である。 種々のネットワークによって行われた平均精度の結果の一例を示す表である。
図1は、本発明の幾つかの実施形態による物体検出システム100のブロック図を示している。物体検出システム100は、キーボード111及びポインティングデバイス/メディア112と接続可能なヒューマンマシンインターフェース(HMI)110と、プロセッサ120と、記憶デバイス130と、メモリ140と、ローカルエリアネットワーク及びインターネットネットワークを含むネットワーク190と接続可能なネットワークインターフェースコントローラー150(NIC)と、ディスプレイインターフェース160と、撮像デバイス175と接続可能な撮像インターフェース170と、印刷デバイス585と接続可能なプリンターインターフェース180とを備える。物体検出システム100は、NIC150に接続されたネットワーク190を介して電子テキスト/撮像文書595を受信することができる。記憶デバイス130は、原画像131、フィルターシステムモジュール132、及びニューラルネットワーク200を含む。ポインティングデバイス/メディア112は、コンピューター可読記録媒体上に記憶されたプログラムを読み出すモジュールを備えることができる。
画像内の物体を検出するために、キーボード111、ポインティングデバイス/メディア112を用いて、又は他のコンピューター(図示せず)に接続されたネットワーク190を介して、命令を物体検出システム100に送信することができる。物体検出システム100は、HMI110を用いてこれらの命令を受信し、記憶デバイス130に記憶されたニューラルネットワーク200を用いるプロセッサ120を用いて、画像内の物体を検出する命令を実行する。プロセッサ120は、1つ以上のグラフィックス処理ユニット(GPU)を含む複数のプロセッサであってもよい。フィルターシステムモジュール132は、画像処理を実行して、命令に関連した所与の画像から所定のフォーマットされた画像を得るように動作可能である。フィルターシステムモジュール132によって処理された画像は、物体を検出するニューラルネットワーク200が用いることができる。ニューラルネットワーク200を用いる物体検出プロセスは、以下で説明される。以下の説明では、グリンプス(glimpse:一見)領域は、グリンプスボックス、バウンディングボックス、グリンプスバウンディングボックス又はバウンディングボックス領域と呼ばれ、これは、画像内のターゲット物体の特徴を検出するために画像内のターゲット上に配置される。
幾つかの実施形態は、画像内の物体を検出する方法が、第1のサブネットワークを用いて、画像の第1の領域から第1の特徴ベクトルを抽出することと、第1の領域を固定比にサイズ変更することによって画像の第2の領域を求めることであって、第1の領域のサイズは第2の領域のサイズよりも小さいことと、第2のサブネットワークを用いて画像の第2の領域から第2の特徴ベクトルを抽出することと、第1の特徴ベクトル及び第2の特徴ベクトルに基づいて第3のサブネットワークを用いて物体のクラスを分類することと、分類の結果に従って第1の領域内の物体のクラスを求めることとを含み、第1のサブネットワーク、第2のサブネットワーク、及び第3のサブネットワークは、ニューラルネットワークを形成し、当該方法のステップは、プロセッサによって実行されるという認識に基づいている。
本発明の幾つかの実施形態は、画像内の小物体を検出すること及び/又は画像内の小物体のクラスラベルを予測することは、小物体を表す画像内のピクセルが少数であることに起因して、シーンの理解には困難な問題であるという認識に基づいている。しかしながら、幾つかの特定の小物体は、通常、特定のコンテキストに現れている。例えば、マウスは、通常、キーボード及びモニターの近くに置かれる。そのコンテキストは、小物体の小解像度を補償するトレーニング及び認識の一部とすることができる。そのために、幾つかの実施形態は、物体を含む種々の領域から特徴ベクトルを抽出する。それらの領域は、異なるサイズの領域であり、物体についての異なるコンテキスト情報を提供する。幾つかの実施形態では、物体は、特徴ベクトルの組み合わせに基づいて検出及び/又は分類される。
図2は、画像内の小物体を検出するプロセスのフローチャートを示している。ステップS1において、第1の特徴ベクトルが、第1のサブネットワークを用いることによって画像内の第1の領域から抽出される。ステップS2において、画像内の第2の領域が、サイズ変更モジュールを用いることによって、第1の領域を所定の比を用いてサイズ変更することによって求められる。ステップS3において、第2の特徴ベクトルが、第2のサブネットワークを用いることによって第2の領域から抽出される。ステップS4において、第3のサブネットワークが、第1の特徴ベクトル及び第2の特徴ベクトルに基づいて物体を分類する。画像内の物体の分類結果は、ステップS5において、第3のサブネットワークによって出力される。この場合、第1のサブネットワーク、第2のサブネットワーク、及び第3のサブネットワークは、ニューラルネットワークを形成し、上記ステップは、プロセッサによって実行される。さらに、第1の領域をサイズ変更するステップは、第1の領域及び第2の領域のそれぞれが物体を含むとともに、第1の領域のサイズが第2の領域のサイズよりも小さくなるように実行される。
図3は、本発明の幾つかの実施形態によるニューラルネットワーク200を用いた物体検出方法のブロック図を示している。ニューラルネットワーク200は、領域提案ネットワーク(RPN)400及びニューラルネットワーク250を備える。ニューラルネットワーク250は、ContexNet(コンテキストネット)250と呼ばれる場合がある。ContextNet250は、コンテキスト領域モジュール12、サイズ変更モジュール13、サイズ変更モジュール14、第1の深層畳み込みニューラルネットワーク(DCNN)210、第2の深層畳み込みニューラルネットワーク(DCNN)220及び第3のニューラルネットワーク300を備える。第3のニューラルネットワーク300は、連結モジュール310、完全接続ニューラルネットワーク311及びソフトマックス関数モジュール312を備える。第1のDCNN210は、第1のサブネットワークと呼ばれる場合があり、第2のDCNN220は、第2のサブネットワークと呼ばれる場合があり、第3のニューラルネットワーク300は、第3のサブネットワークと呼ばれる場合がある。第1のサブネットワーク及び第2のサブネットワークは、同一の構造を有することができる。
命令実行時において、画像10が物体検出システム100に提供されると、領域提案ネットワーク(RPN)400が画像10に適用されて、画像内のターゲット物体画像の領域上に配置される提案ボックス15が生成される。提案ボックス15によって包含される画像10の部分は、ターゲット領域画像と呼ばれる。このターゲット領域画像は、サイズ変更モジュール13を用いて、所定の同一のサイズ及び所定の解像度を有するサイズ変更済み物体画像16にサイズ変更され、サイズ変更済み物体画像16は、ニューラルネットワーク200に送信される。小物体の定義に関して、小物体の閾値サイズが、画像内の物体を小物体カテゴリーに分類するように予め定められる。この閾値サイズは、物体検出のシステム設計に従って選ぶことができ、提案ボックス15を生成するためにRPN400において用いることができる。提案ボックス15は、画像10内のターゲット物体画像のロケーション情報340も提供する。例えば、閾値サイズは、画像内の物体の所定の物理サイズ、画像内の物体のピクセルサイズ又は画像の全体面積に対する物体画像の面積の比に基づいて求めることができる。続いて、コンテキストボックス20が、コンテキスト領域モジュール12を用いて、提案ボックス15をx方向及びy方向(高さの次元及び幅の次元)において7倍に拡大することによって得られる。コンテキストボックス20は、画像10の提案ボックス15上に配置されて、ターゲット領域画像を取り囲む。コンテキストボックス20を配置することによって決まる画像の部分は、コンテキスト領域画像と呼ばれる。この場合、コンテキストボックス20に対応するコンテキスト領域画像は、サイズ変更モジュール13を用いて、所定のサイズを有するサイズ変更済みコンテキスト画像21にサイズ変更され、ContexNet250に送信される。コンテキスト領域画像は、ContexNet250において用いられるデータ構成に従って7倍又は他の値にターゲット領域画像を拡大することによって得ることができる。したがって、提案ボックス15に対応するターゲット領域画像及びコンテキストボックス20に対応するコンテキスト領域画像は、ContexNet250に送信される前にサイズ変更モジュール13及びサイズ変更モジュール14を用いることによってサイズ変更済みターゲット画像16及びサイズ変更済みコンテキスト画像21に変換される。この場合、サイズ変更済みターゲット画像16及びサイズ変更済みコンテキスト画像21は、所定の同一のサイズを有する。例えば、この所定の同一のサイズは、227×227(VGG16の場合は224×224)パッチ(ピクセル)とすることができる。この所定の同一のサイズは、ニューラルネットワークにおいて用いられるデータフォーマットに従って変更することができる。さらに、所定の同一のサイズは、所定のピクセルサイズ又は所定の物理寸法に基づいて規定することができ、ターゲット領域画像及びコンテキスト領域画像の縦横比は、サイズ変更後に維持することができる。
ContexNet250は、サイズ変更済みターゲット画像16及びサイズ変更済みコンテキスト画像21をそれぞれ第1のDCNN210及び第2のDCNN220から受信する。ContexNet250内の第1のDCNN210は、サイズ変更済みターゲット画像16から第1の特徴ベクトル230を抽出し、この第1の特徴ベクトル230を第3のニューラルネットワーク300の連結モジュール310に送信する。さらに、ContexNet250内の第2のDCNN220は、サイズ変更済みコンテキスト画像21から第2の特徴ベクトル240を抽出し、この第2の特徴ベクトル240を第3のニューラルネットワーク300の連結モジュール310に送信する。連結モジュール310は、第1の特徴ベクトル230と第2の特徴ベクトル240とを連結し、連結特徴を生成する。連結特徴は、完全接続ニューラルネットワーク(NN)311に送信され、完全接続NN311は、連結特徴から特徴ベクトルを生成し、連結特徴ベクトルをソフトマックス関数モジュール312に送信する。ソフトマックス関数モジュール312は、完全接続NN312からの連結特徴ベクトルに基づいてターゲット物体画像の分類を実行し、分類結果をカテゴリー出力330として出力する。その結果、提案ボックス15に対応するターゲット物体画像の物体検出が、カテゴリー出力330及びロケーション情報340に基づいて得られる。
提案ボックス及びコンテキストボックス
図4Aは、画像内のターゲット領域画像及びコンテキスト領域画像をサイズ変更する手順を示している。提案ボックス15が画像10に適用されるとき、ニューラルネットワーク200は、提案ボックス15に対応するターゲット領域画像をクロッピングし、このターゲット領域画像をサイズ変更済みターゲット画像16にサイズ変更し、サイズ変更済みターゲット画像16は、第1のDCNN210に送信される。さらに、コンテキスト領域モジュール12は、提案ボックス15をx方向及びy方向の双方において7倍に拡大して、コンテキストボックス20を得る。また、コンテキスト領域モジュール12は、コンテキストボックス20が提案ボックス15に対応するターゲット領域画像を覆うように、コンテキストボックス20を画像10上に配置する。コンテキスト領域モジュール12は、コンテキストボックス20を画像10上に適用して、コンテキスト領域画像を画定する。ニューラルネットワーク200は、コンテキストボックス20に対応するコンテキスト領域画像をクロッピングし、このコンテキスト領域画像を、サイズ変更済みターゲット画像16のサイズと同一の所定のサイズを有するサイズ変更済みコンテキスト画像21にサイズ変更する。サイズ変更済みコンテキスト画像21は、第2のDCNN220に送信される。第2のDCNN220及び第1のDCNN210は同一の構造を有する。この手順は、小物体の検出を改善する。なぜならば、画像内のより大きなエリアから特徴を抽出することは、より良好な弁別動作をもたらすコンテキスト情報を組み込むことに役立つからである。別の実施形態では、コンテキストボックス20の面積と提案ボックス15の面積との間の所定の比に従って所定の距離だけ、コンテキストボックス20の中心を提案ボックス15の中心からシフトすることができる。
幾つかの実施形態では、コンテキストボックス20が提案ボックス15を囲むように、コンテキストボックス20は提案ボックス15よりも大きくなるように設定される。例えば、コンテキストボックス20の側線のそれぞれは、提案ボックス15の側線の7倍以上とすることができる。この場合、提案ボックス15の中心は、コンテキストボックス20の中心と同一になるように配置される。
図4Aは、提案ボックス15からのコンテキストボックス20の生成プロセスも示している。コンテキストボックス20のベクトルは、提案ボックス15のベクトルを変換することによって得られる。提案ボックス15のベクトルは、提案ボックス15の位置(x,y)、幅w、及び高さhによって表される。位置(x,y)は、画像10内のxy座標によって規定される提案ボックス15のコーナーのうちの1つの位置を示す。提案ボックス15のベクトルは、(x,y,w,h)によって表され、左下コーナーは、位置(x,y)によって与えられ、左下コーナーの位置(x,y)に対する対角位置は、(x+w,y+h)によって得られる。提案ボックス15の中心(x,y)は、点(x+w/2,y+h/2)によって表される。提案ボックス15の幅w及び高さhは、コンテキストボックス20を提供するためにc倍に拡大され、コンテキストボックス20のベクトル(x’,y’,w’,h’)は、(x−c・w/2,y−c・h/2,c・w,c・h)によって表される。図4Aでは、提案ボックス15及びコンテキストボックス20は、同一の中心(x,y)を有する。別の実施形態では、コンテキストボックス20の中心は、提案ボックス15の中心から所定の量Δx及びΔyに従ってシフトすることができる。例えば、所定の量Δx及びΔyは、|Δx|≦(c−1)w/2及び|Δy|≦(c−1)h/2の条件を満たすように規定することができる。ここで、提案ボックス15が、コンテキストボックス20を越えて突出することなくコンテキストボックス20に含まれるように、c>1である。
図4Bは、提案ボックス及びコンテキストボックスを画像13内の時計画像に適用する手順の一例を示している。拡大された時計画像が、画像13の右上コーナーに示されている。この時計画像は、家具、窓、暖炉等の他の物体よりもはるかに小さいことに留意すべきである。図4Bでは、提案ボックス17が、画像13内のターゲット画像として時計画像の部分に適用される。その後、提案ボックス17に対応するターゲット画像は、サイズ変更モジュール13を介してサイズ変更済みターゲット画像16に拡大され、第1のDCNN210に送信される。さらに、ニューラルネットワーク200は、提案ボックス17に基づくコンテキストボックス22を提供し、コンテキストボックス22を時計画像に適用する。コンテキストボックス22は、図4Bに示すように、所定のエリアを用いて提案ボックス17を完全に取り囲むように配置される。コンテキストボックス22に対応する画像領域は、画像13からコンテキスト画像としてクロッピングされ、サイズ変更モジュール14は、このコンテキスト画像をサイズ変更済みコンテキスト画像21にサイズ変更する。サイズ変更済みコンテキスト画像21は、第2のDCNN220に送信される。この場合、コンテキスト画像は、図4Bに見られるようにターゲット画像を囲んでいる。この手順によって、ニューラルネットワーク200は、画像内の小物体の非常に重要な情報を得ることが可能になり、その結果、小物体の分類の確度はより高くなる。
図4Cは、画像内のマウス画像を検出するプロセスのブロック図を示している。画像30が提供されると、領域提案ネットワーク400は、デスク上のマウスの背面を示すターゲット物体画像に対応する提案ボックス31を提供し、提案ボックス31を取り囲むコンテキストボックス32を提供する。サイズ変更モジュール13(図示せず)によってサイズ変更された後、ターゲット物体画像のサイズ変更済みターゲット画像が、第1のDCNN210(畳み込み層として示す)に送信される。第1のDCNN210は、サイズ変更済みターゲット画像からターゲット物体画像の第1の特徴ベクトルを抽出し、この第1の特徴ベクトルを連結モジュール310に送信する。さらに、コンテキストボックス32は、画像30に適用され、ターゲット物体画像を囲むコンテキスト領域画像が求められる。サイズ変更モジュール14(図示せず)によってサイズ変更された後、コンテキスト領域画像のサイズ変更済みコンテキスト画像が、第2のDCNN220(畳み込み層として示す)に送信される。第2のDCNN220は、サイズ変更済みコンテキスト画像からコンテキスト領域画像の第2の特徴ベクトルを抽出し、この第2の特徴ベクトルを連結モジュール310に送信する。連結モジュール310は、第1の特徴ベクトル及び第2の特徴ベクトルを得た後、第1の特徴ベクトルと第2の特徴ベクトルとを連結し、連結特徴を生成する。連結特徴は、完全接続NN311(完全接続層として示す)に送信される。完全接続NN311は、特徴ベクトルを生成し、ソフトマックス関数モジュール312に送信する。ソフトマックス関数モジュール312は、完全接続NN312からの特徴ベクトルに基づいてターゲット物体画像の分類を実行し、分類結果を出力する。この分類結果は、ターゲット物体画像のカテゴリーが図4Cに示すような「マウス」であることを示す。
小物体データセット
画像内の小物体に対応する小さな提案ボックスは、低次元の特徴ベクトルをもたらすので、提案ボックスのサイズは、物体検出システム100における提案ボックスのコンテキスト情報に対応する適切なサイズのベクトルを得るように選ばれる。
幾つかの実施形態では、小物体を検出するデータセットは、SUN及びMicrosoft COCOデータセット等の従来のデータセットから所定の小物体を選択することによって構築することができる。例えば、小物体の画像のサブセットが、従来のデータセットから選択され、従来のデータセットにおけるグラウンドトゥルースバウンディングボックスロケーションが、従来のデータセットから大きな物体インスタンスをプルーニングするとともに、小物体を純粋に含む小物体データセットを小さなバウンディングボックスを用いて構成するのに用いられる。小物体データセットは、小物体の統計を計算することによって構築することができる。
図5は、小物体カテゴリーの統計の一例を示している。10個の例示的なカテゴリーが図5に列挙されている。例えば、「マウス」のカテゴリーに関しては、1739個の画像に2137個のインスタンスがあることが分かる。「電話機」、「スイッチ」、「コンセント」、「時計」、「トイレットペーパー」、「ティッシュボックス」、「蛇口」、「皿」、及び「瓶」等の他のカテゴリーも、図5に列挙されている。図5は、各カテゴリーに関するメジアン相対面積(median relative area)も示している。このメジアン相対面積は、同じカテゴリーにおける物体インスタンスの画像全体の面積に対するバウンディングボックスの面積の比に対応する。メジアン相対面積は、0.08%〜0.58%の範囲にある。この相対面積は、VGA画像における16×16ピクセル〜42×42ピクセルのピクセル面積に対応する。このため、この実施形態に従って構築される小物体データセットは、小物体向けにカスタマイズされる。小さなバウンディングボックスのサイズは、上記で説明した小物体データセットに基づいて求めることができる。他方、PASCAL VOCデータセット等の従来のデータセットにおける物体カテゴリーの相対面積のメジアンは、1.38%〜46.40%の範囲にある。したがって、本発明の幾つかの実施形態による小物体データセットによって提供される境界ボックスは、小物体について従来のデータセットによって提供されるバウンディングボックスよりも高い確度のバウンディングボックスを提供することができる。なぜならば、従来のデータセットは、小物体向けにカスタマイズされていない物体カテゴリーに対してはるかに広いバウンディングボックスエリアを提供するからである。
小物体データセットを構築する際、所定のサイズよりも小さな物理寸法を有するインスタンスをカテゴリー化することによって、所定の小物体を決定することができる。例えば、所定のサイズは、30センチメートルとすることができる。別の例では、所定のサイズは、物体検出システム設計に従って50センチメートルとすることができる。
図6は、カテゴリーごとの物体のメジアンバウンディングボックスサイズ及び対応するアップサンプリング比を示している。この実施形態では、アップサンプリング比は、深層畳み込みニューラルネットワークの入力サイズ(この場合、227×227)に整合するために6〜7となるように選ばれる。
ネットワークの構成
幾つかの実施形態では、第1のDCNN210及び第2のDCNN220は、同一の構造を有するように設計され、第1のDCNN210及び第2のDCNN220のそれぞれは、少数の畳み込み層を備える。トレーニングプロセスにおいて、第1のDCNN210及び第2のDCNN220は、ImageNet事前トレーニング済みモデルを用いて初期化される。トレーニングプロセスが継続している間、第1のDCNN210及び第2のDCNN220は、ネットワークの重みを個別に進展させ、重みを共有しない。
第1の特徴ベクトル230及び第2の特徴ベクトル240は、AlexNetの最初の6つの層又はVGG16の最初の6つの層から導出される。提案ボックス15に対応するターゲット物体画像及びコンテキストボックス20に対応するコンテキスト領域画像は、AlexNet画像パッチ用に227×227にサイズ変更され、VGG16画像パッチ用に224×224にサイズ変更される。第1のDCNN210及び第2のDCNN220はそれぞれ、4096次元特徴ベクトルを出力し、これらの4096次元特徴ベクトルは、連結モジュール310と、2つの完全接続層を有する完全接続NN311と、ソフトマックス関数モジュール312とを備える第3のニューラルネットワーク300に送信される。第3のニューラルネットワーク300は、第1のDCNN210及び第2のDCNN220から連結特徴を受信した後、連結モジュール310によって生成された連結特徴ベクトルに基づいて、ターゲット物体画像に対してソフトマックス関数モジュール312を用いて、予測された物体カテゴリーラベルを出力する。この場合、事前トレーニングされた重みは、完全接続NN311における所定の数の最後の層には用いられない。代わりに、畳み込み層が用いられる。
提案ボックス15は、勾配方向ヒストグラム(HOG)特徴に基づく変形可能部分モデル(DPM)モジュールと、潜在的(latent)サポートベクトルモジュールとによって生成することができる。この場合、DPMモジュールは、カテゴリー固有の物体を検出するように設計され、DPMモジュールのルートパートテンプレート(root and part template)のサイズは、小物体サイズに対応するように調整され、その上、DMPモジュールは、所定の異なるクラスについてトレーニングされる。
提案ボックス15は、領域提案ネットワーク(RPN)400によって生成することができる。RPN400によって生成される提案ボックス15は、所定の数のピクセルを有するように設計される。ピクセルの数は、物体検出システム100の構成設計に従って16ピクセル、40ピクセル又は100ピクセルとすることができる。別の例では、物体検出システムのデータセット内の小物体のカテゴリーが、100ピクセルよりも多くなるように規定されたとき、ピクセルの数は、100ピクセルよりも多くすることができる。例えば、VGGネットワークのconv4_3層は、小さなアンカーボックスに関連付けられた特徴マップに用いられる。conv4_3層のそれぞれのフィールドは92×92ピクセルである。
図7は、種々のネットワークによって行われた平均精度結果の一例を示している。この例では、ContextNetは、AlexNetと呼ばれる。第2行(DPM提案(DPM prop.)+AlexNet)は、DPM提案を用いることによって得られ、トレーニング及び試験は、カテゴリーごとに1画像当たり500回実行される。第3行(RPN提案(RPN prop.)+AlexNet)は、幾つかの実施形態に従ってRPNを用いることによって得られ、トレーニングは、1画像当たり2000回実行され、試験は、1画像当たり500回実行される。これらの結果は、AlexNetトレーニングを用いたPRN提案が他のものよりも良好な性能を提供することを示している。
物体を分類する際に、物体ボックスとグラウンドトゥルースバウンディングボックスとの間の重複比が0.5よりも大きいか否かの正しい判断が行われる。この重複比は、インターセクションオーバーユニオン(Intersection over Union)(IoU)測定モジュールによって測定される。
別の実施形態では、重複比は、物体検出システム100において設計される所定の検出確度に従って変更することができる。
幾つかの好ましい実施形態を図示及び説明してきたが、本発明の範囲から逸脱することなく多くの変形及び変更をこれらの実施形態に対して行うことができることが当業者には明らかであろう。本発明の範囲は、添付の特許請求の範囲及びその均等物によって画定される。

Claims (18)

  1. 画像内の物体を検出する方法であって、
    第1のサブネットワークを用いて、画像の第1の領域から第1の特徴ベクトルを抽出することと、
    前記第1の領域をサイズ変更することによって前記画像の第2の領域を求めることと、
    第2のサブネットワークを用いて、前記画像の第2の領域から第2の特徴ベクトルを抽出することと、
    前記第1の特徴ベクトル及び前記第2の特徴ベクトルに基づいて、第3のサブネットワークを用いて前記物体のクラスを分類することと、
    前記分類の結果に従って前記第1の領域内の物体の前記クラスを求めることと、
    を含み、
    前記第1のサブネットワーク、前記第2のサブネットワーク、及び前記第3のサブネットワークは、ニューラルネットワークを形成し、
    前記方法のステップは、プロセッサによって実行される、
    方法。
  2. 前記第1の領域を前記サイズ変更することは、前記第1の領域及び前記第2の領域のそれぞれが前記物体を含むように行われ、
    前記第1の領域のサイズは、前記第2の領域のサイズよりも小さい、
    請求項1に記載の方法。
  3. 前記サイズ変更することは、固定比に従って行われ、
    前記第2のサブネットワークは、深層畳み込みニューラルネットワークである、
    請求項1に記載の方法。
  4. 前記第1のサブネットワーク及び前記第2のサブネットワークのうちの少なくとも一方は、深層畳み込みニューラルネットワークであり、
    前記第3のサブネットワークは、完全接続ニューラルネットワークである、
    請求項1に記載の方法。
  5. 前記第3のサブネットワークは、前記第1の特徴ベクトルと前記第2の特徴ベクトルとの特徴ベクトル連結操作を実行する、
    請求項4に記載の方法。
  6. 前記検出された物体及び前記物体の前記クラスをディスプレイデバイス上にレンダリングすること、又は前記検出された物体及び前記物体の前記クラスを送信することを更に含む、
    請求項1に記載の方法。
  7. 前記第1の領域は、領域提案ネットワークによって得られる、
    請求項1に記載の方法。
  8. 前記領域提案ネットワークは畳み込みニューラルネットワークである、
    請求項7に記載の方法。
  9. 前記第2の領域の幅は、前記第1の領域の幅の7倍の大きさである、
    請求項1に記載の方法。
  10. 前記第2の領域の高さは、前記第1の領域の高さの7倍の大きさである、
    請求項1に記載の方法。
  11. 前記第2の領域の幅は、前記第1の領域の幅の3倍の大きさである、
    請求項1に記載の方法。
  12. 前記第2の領域の高さは、前記第1の領域の高さの3倍の大きさである、
    請求項1に記載の方法。
  13. 前記第2の領域の中心は、前記第1の領域の中心に一致する、
    請求項1に記載の方法。
  14. 前記第1の領域が前記第1のサブネットワークに入力される前に、前記第1の領域は、第1の所定のサイズにサイズ変更される、
    請求項1に記載の方法。
  15. 前記第2の領域が前記第2のサブネットワークに入力される前に、前記第2の領域は、第2の所定のサイズにサイズ変更される、
    請求項1に記載の方法。
  16. 前記第1の領域は、変形可能部分モデル物体検出器を用いることによって得られる、
    請求項1に記載の方法。
  17. コンピューターに物体検出プロセスを実行させるプログラムを記憶する非一時的コンピューター可読記録媒体であって、
    前記物体検出プロセスは、
    第1のサブネットワークを用いて、画像の第1の領域から第1の特徴ベクトルを抽出することと、
    前記第1の領域をサイズ変更することによって前記画像の第2の領域を求めることであって、前記第1の領域のサイズは前記第2の領域のサイズと異なることと、
    前記第1のサブネットワークを用いて、前記画像の第2の領域から第2の特徴ベクトルを抽出することと、
    前記第1の特徴ベクトル及び前記第2の特徴ベクトルに基づいて第3のサブネットワークを用いて前記物体を検出して、前記物体を取り囲むバウンディングボックス及び前記物体のクラスを生成することと、
    を含み、
    前記第1のサブネットワーク、前記第2のサブネットワーク、及び前記第3のサブネットワークは、ニューラルネットワークを形成する、
    非一時的コンピューター可読記録媒体。
  18. 物体検出システムであって、
    ヒューマンマシンインターフェースと、
    ニューラルネットワークを含む記憶デバイスと、
    メモリと、
    前記システムの外部にあるネットワークと接続可能なネットワークインターフェースコントローラーと、
    撮像デバイスと接続可能な撮像インターフェースと、
    前記ヒューマンマシンインターフェース、前記記憶デバイス、前記メモリ、前記ネットワークインターフェースコントローラー及び前記撮像インターフェースに接続するように構成されたプロセッサと、
    を備え、
    前記プロセッサは、前記記憶デバイスに記憶された前記ニューラルネットワークを用いて画像内の物体を検出する命令を実行し、
    前記ニューラルネットワークは、
    第1のサブネットワークを用いて、前記画像の第1の領域から第1の特徴ベクトルを抽出するステップと、
    第2のサブネットワークを用いて前記第1の特徴ベクトルを処理することによって前記画像の第2の領域を求めるステップであって、前記第1の領域のサイズは前記第2の領域のサイズと異なるステップと、
    前記第1のサブネットワークを用いて、前記画像の第2の領域から第2の特徴ベクトルを抽出するステップと、
    前記第1の特徴ベクトル及び前記第2の特徴ベクトルに基づいて第3のサブネットワークを用いて前記物体を検出して、前記物体を取り囲むバウンディングボックス及び前記物体のクラスを生成するステップと、
    を実行し、
    前記第1のサブネットワーク、前記第2のサブネットワーク、及び前記第3のサブネットワークは、ニューラルネットワークを形成する、
    物体検出システム。
JP2017144325A 2016-08-02 2017-07-26 画像内の物体を検出する方法及び物体検出システム Active JP6956555B2 (ja)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
US15/226,088 2016-08-02
US15/226,088 US20180039853A1 (en) 2016-08-02 2016-08-02 Object Detection System and Object Detection Method

Publications (2)

Publication Number Publication Date
JP2018022484A true JP2018022484A (ja) 2018-02-08
JP6956555B2 JP6956555B2 (ja) 2021-11-02

Family

ID=61069325

Family Applications (1)

Application Number Title Priority Date Filing Date
JP2017144325A Active JP6956555B2 (ja) 2016-08-02 2017-07-26 画像内の物体を検出する方法及び物体検出システム

Country Status (2)

Country Link
US (1) US20180039853A1 (ja)
JP (1) JP6956555B2 (ja)

Cited By (10)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN110879955A (zh) * 2018-09-06 2020-03-13 埃森哲环球解决方案有限公司 使用具有深度学习的计算机视觉的数字质量控制
JP2020068797A (ja) * 2018-10-29 2020-05-07 株式会社日立製作所 医用撮像装置、画像処理装置、および、画像処理方法
JP2020095660A (ja) * 2018-12-11 2020-06-18 財團法人工業技術研究院Industrial Technology Research Institute Cnnモデルを用いる物体検出方法及び同様のそれを用いる物体検出装置
CN111476075A (zh) * 2019-01-23 2020-07-31 斯特拉德视觉公司 利用1x1卷积的基于CNN的客体检测方法及装置
JP2020119542A (ja) * 2019-01-23 2020-08-06 株式会社ストラドビジョン ハードウェア最適化に使用されるイメージ認識のための1x1コンボリューションを利用したCNN学習方法及び学習装置、それを利用したテスト方法及びテスト装置{LEARNING METHOD AND LEARNING DEVICE FOR CONVOLUTIONAL NEURAL NETWORK USING 1×1 CONVOLUTION FOR IMAGE RECOGNITION TO BE USED FOR HARDWARE OPTIMIZATION, AND TESTING METHOD AND TESTING DEVICE USING THE SAME}
JP2020119539A (ja) * 2019-01-23 2020-08-06 株式会社ストラドビジョン ハードウェア最適化に使用される1xHコンボリューションを利用したCNN基盤の物体検出器を学習する方法及び学習装置、それを利用したテスト方法及びテスト装置
JP2020119530A (ja) * 2019-01-22 2020-08-06 株式会社ストラドビジョン 重要業績評価指標のようなユーザ要求事項に適したターゲット物体予測ネットワークを用いた、cnn基盤の変動に強い物体検出器を学習する方法及び学習装置、並びにこれを利用したテスティング方法及びテスティング装置
JP2021514512A (ja) * 2018-02-20 2021-06-10 アップリフト ラブズ インコーポレイテッド 動作の識別および動作情報を用いた規範的な分析の生成
CN113168705A (zh) * 2018-10-12 2021-07-23 诺基亚技术有限公司 用于上下文嵌入且基于区域的对象检测的方法和装置
DE102021201031A1 (de) 2020-03-31 2021-09-30 Mitsubishi Heavy Industries, Ltd. Programmerstellungsvorrichtung, Objekterkennungssystem, Ankersetzverfahren und Ankersetzprogramm

Families Citing this family (53)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2018060268A (ja) * 2016-10-03 2018-04-12 株式会社日立製作所 認識装置および学習システム
KR20180060257A (ko) * 2016-11-28 2018-06-07 삼성전자주식회사 객체 인식 방법 및 장치
WO2018121013A1 (en) * 2016-12-29 2018-07-05 Zhejiang Dahua Technology Co., Ltd. Systems and methods for detecting objects in images
WO2018176000A1 (en) 2017-03-23 2018-09-27 DeepScale, Inc. Data synthesis for autonomous control systems
CA3063105A1 (en) 2017-05-23 2018-11-29 Walmart Apollo, Llc Automated inspection system
US10942519B2 (en) * 2017-07-07 2021-03-09 Autox, Inc. System and method for navigating an autonomous driving vehicle
US11409692B2 (en) 2017-07-24 2022-08-09 Tesla, Inc. Vector computational unit
US10671349B2 (en) 2017-07-24 2020-06-02 Tesla, Inc. Accelerated mathematical engine
US11893393B2 (en) 2017-07-24 2024-02-06 Tesla, Inc. Computational array microprocessor system with hardware arbiter managing memory requests
US11157441B2 (en) 2017-07-24 2021-10-26 Tesla, Inc. Computational array microprocessor system using non-consecutive data formatting
KR102425578B1 (ko) * 2017-08-08 2022-07-26 삼성전자주식회사 객체를 인식하는 방법 및 장치
CN108022238B (zh) * 2017-08-09 2020-07-03 深圳科亚医疗科技有限公司 对3d图像中对象进行检测的方法、计算机存储介质和系统
CN110110189A (zh) * 2018-02-01 2019-08-09 北京京东尚科信息技术有限公司 用于生成信息的方法和装置
US11561791B2 (en) 2018-02-01 2023-01-24 Tesla, Inc. Vector computational unit receiving data elements in parallel from a last row of a computational array
US11507800B2 (en) * 2018-03-06 2022-11-22 Adobe Inc. Semantic class localization digital environment
US11448632B2 (en) 2018-03-19 2022-09-20 Walmart Apollo, Llc System and method for the determination of produce shelf life
CN108491795B (zh) * 2018-03-22 2022-05-13 北京航空航天大学 轨道交通场景的行人检测方法与装置
JP7171212B2 (ja) * 2018-04-02 2022-11-15 キヤノン株式会社 情報処理装置、画像表示方法、コンピュータプログラム、及び記憶媒体
CN108681743B (zh) * 2018-04-16 2019-12-06 腾讯科技(深圳)有限公司 图像对象识别方法和装置、存储介质
CN110414541B (zh) * 2018-04-26 2022-09-09 京东方科技集团股份有限公司 用于识别物体的方法、设备和计算机可读存储介质
CN108898145A (zh) * 2018-06-15 2018-11-27 西南交通大学 一种结合深度学习的图像显著目标检测方法
US11215999B2 (en) 2018-06-20 2022-01-04 Tesla, Inc. Data pipeline and deep learning system for autonomous driving
US11361457B2 (en) 2018-07-20 2022-06-14 Tesla, Inc. Annotation cross-labeling for autonomous control systems
US11636333B2 (en) 2018-07-26 2023-04-25 Tesla, Inc. Optimizing neural network structures for embedded systems
WO2020023762A1 (en) * 2018-07-26 2020-01-30 Walmart Apollo, Llc System and method for produce detection and classification
CN109344840B (zh) * 2018-08-07 2022-04-01 深圳市商汤科技有限公司 图像处理方法和装置、电子设备、存储介质、程序产品
WO2020032383A1 (ko) * 2018-08-08 2020-02-13 삼성전자 주식회사 이미지에 대한 인식 정보, 인식 정보와 관련된 유사 인식 정보, 및 계층 정보를 이용하여 외부 객체에 대한 인식 결과를 제공하는 전자 장치 및 그의 동작 방법
KR102565279B1 (ko) 2018-08-23 2023-08-09 삼성전자주식회사 객체 검출 방법, 객체 검출을 위한 학습 방법 및 그 장치들
US11562231B2 (en) 2018-09-03 2023-01-24 Tesla, Inc. Neural networks for embedded devices
JP6695947B2 (ja) * 2018-09-21 2020-05-20 ソニーセミコンダクタソリューションズ株式会社 固体撮像システム、画像処理方法及びプログラム
CN109242801B (zh) * 2018-09-26 2021-07-02 北京字节跳动网络技术有限公司 图像处理方法和装置
US10304009B1 (en) * 2018-10-08 2019-05-28 StradVision, Inc. Learning method and testing method for object detector based on R-CNN, and learning device and testing device using the same
AU2019357615B2 (en) 2018-10-11 2023-09-14 Tesla, Inc. Systems and methods for training machine models with augmented data
US11715059B2 (en) 2018-10-12 2023-08-01 Walmart Apollo, Llc Systems and methods for condition compliance
US11196678B2 (en) 2018-10-25 2021-12-07 Tesla, Inc. QOS manager for system on a chip communications
TWI717655B (zh) * 2018-11-09 2021-02-01 財團法人資訊工業策進會 適應多物件尺寸之特徵決定裝置及方法
WO2020106332A1 (en) 2018-11-20 2020-05-28 Walmart Apollo, Llc Systems and methods for assessing products
US11816585B2 (en) 2018-12-03 2023-11-14 Tesla, Inc. Machine learning models operating at different frequencies for autonomous vehicles
US11537811B2 (en) 2018-12-04 2022-12-27 Tesla, Inc. Enhanced object detection for autonomous vehicles based on field view
US11610117B2 (en) 2018-12-27 2023-03-21 Tesla, Inc. System and method for adapting a neural network model on a hardware platform
US10387752B1 (en) * 2019-01-22 2019-08-20 StradVision, Inc. Learning method and learning device for object detector with hardware optimization based on CNN for detection at distance or military purpose using image concatenation, and testing method and testing device using the same
US10430691B1 (en) * 2019-01-22 2019-10-01 StradVision, Inc. Learning method and learning device for object detector based on CNN, adaptable to customers' requirements such as key performance index, using target object merging network and target region estimating network, and testing method and testing device using the same to be used for multi-camera or surround view monitoring
US10423860B1 (en) * 2019-01-22 2019-09-24 StradVision, Inc. Learning method and learning device for object detector based on CNN to be used for multi-camera or surround view monitoring using image concatenation and target object merging network, and testing method and testing device using the same
US10402695B1 (en) * 2019-01-23 2019-09-03 StradVision, Inc. Learning method and learning device for convolutional neural network using 1×H convolution for image recognition to be used for hardware optimization, and testing method and testing device using the same
US10997461B2 (en) 2019-02-01 2021-05-04 Tesla, Inc. Generating ground truth for machine learning from time series elements
US11567514B2 (en) 2019-02-11 2023-01-31 Tesla, Inc. Autonomous and user controlled vehicle summon to a target
US10956755B2 (en) 2019-02-19 2021-03-23 Tesla, Inc. Estimating object properties using visual image data
US11030774B2 (en) * 2019-03-19 2021-06-08 Ford Global Technologies, Llc Vehicle object tracking
CN110147753A (zh) * 2019-05-17 2019-08-20 电子科技大学 一种检测图像中小物体的方法及装置
US11113822B2 (en) * 2019-08-14 2021-09-07 International Business Machines Corporation Moving object identification from a video stream
US20220083811A1 (en) * 2020-09-14 2022-03-17 Panasonic I-Pro Sensing Solutions Co., Ltd. Monitoring camera, part association method and program
CN112766244B (zh) * 2021-04-07 2021-06-08 腾讯科技(深圳)有限公司 目标对象检测方法、装置、计算机设备和存储介质
CN115546790B (zh) * 2022-11-29 2023-04-07 深圳智能思创科技有限公司 文档版面分割方法、装置、设备及存储介质

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2011137780A (ja) * 2010-01-04 2011-07-14 Nec Corp 画像診断方法、画像診断装置および画像診断プログラム

Family Cites Families (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7127087B2 (en) * 2000-03-27 2006-10-24 Microsoft Corporation Pose-invariant face recognition system and process
KR20130122411A (ko) * 2012-04-30 2013-11-07 삼성전자주식회사 이미지 획득 장치 및 이미지 획득 장치의 동작 방법
US9098741B1 (en) * 2013-03-15 2015-08-04 Google Inc. Discriminitive learning for object detection
WO2015192316A1 (en) * 2014-06-17 2015-12-23 Beijing Kuangshi Technology Co., Ltd. Face hallucination using convolutional neural networks
US9852492B2 (en) * 2015-09-18 2017-12-26 Yahoo Holdings, Inc. Face detection

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2011137780A (ja) * 2010-01-04 2011-07-14 Nec Corp 画像診断方法、画像診断装置および画像診断プログラム

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
SHAOQING REN ET AL.: "Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks", ARXIV, JPN6021019136, 6 January 2016 (2016-01-06), ISSN: 0004513232 *

Cited By (24)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2021514512A (ja) * 2018-02-20 2021-06-10 アップリフト ラブズ インコーポレイテッド 動作の識別および動作情報を用いた規範的な分析の生成
JP7160932B2 (ja) 2018-02-20 2022-10-25 アップリフト ラブズ インコーポレイテッド 動作の識別および動作情報を用いた規範的な分析の生成
JP2020042756A (ja) * 2018-09-06 2020-03-19 アクセンチュア グローバル ソリューションズ リミテッド 深層学習を用いるコンピュータビジョニングを使用したデジタル品質管理
US11373287B2 (en) 2018-09-06 2022-06-28 Accenture Global Solutions Limited Digital quality control using computer visioning with deep learning
CN110879955A (zh) * 2018-09-06 2020-03-13 埃森哲环球解决方案有限公司 使用具有深度学习的计算机视觉的数字质量控制
CN113168705A (zh) * 2018-10-12 2021-07-23 诺基亚技术有限公司 用于上下文嵌入且基于区域的对象检测的方法和装置
JP2022504774A (ja) * 2018-10-12 2022-01-13 ノキア テクノロジーズ オサケユイチア コンテキスト埋め込みおよび領域ベースの物体検出のための方法および装置
US11908160B2 (en) 2018-10-12 2024-02-20 Nokia Technologies Oy Method and apparatus for context-embedding and region-based object detection
JP7192109B2 (ja) 2018-10-12 2022-12-19 ノキア テクノロジーズ オサケユイチア コンテキスト埋め込みおよび領域ベースの物体検出のための方法および装置
JP7193979B2 (ja) 2018-10-29 2022-12-21 富士フイルムヘルスケア株式会社 医用撮像装置、画像処理装置、および、画像処理方法
JP2020068797A (ja) * 2018-10-29 2020-05-07 株式会社日立製作所 医用撮像装置、画像処理装置、および、画像処理方法
US11450003B2 (en) 2018-10-29 2022-09-20 Fujifilm Healthcare Corporation Medical imaging apparatus, image processing apparatus, and image processing method
US10748033B2 (en) 2018-12-11 2020-08-18 Industrial Technology Research Institute Object detection method using CNN model and object detection apparatus using the same
JP2020095660A (ja) * 2018-12-11 2020-06-18 財團法人工業技術研究院Industrial Technology Research Institute Cnnモデルを用いる物体検出方法及び同様のそれを用いる物体検出装置
JP2020119530A (ja) * 2019-01-22 2020-08-06 株式会社ストラドビジョン 重要業績評価指標のようなユーザ要求事項に適したターゲット物体予測ネットワークを用いた、cnn基盤の変動に強い物体検出器を学習する方法及び学習装置、並びにこれを利用したテスティング方法及びテスティング装置
KR102328733B1 (ko) 2019-01-23 2021-11-22 주식회사 스트라드비젼 하드웨어 최적화에 쓰이는 1x1 컨벌루션을 이용한 CNN 기반의 객체 검출기를 학습하는 방법 및 학습 장치, 이를 이용한 테스트 장치 및 테스트 장치
CN111476075A (zh) * 2019-01-23 2020-07-31 斯特拉德视觉公司 利用1x1卷积的基于CNN的客体检测方法及装置
KR20200091791A (ko) * 2019-01-23 2020-07-31 주식회사 스트라드비젼 하드웨어 최적화에 쓰이는 1x1 컨벌루션을 이용한 CNN 기반의 객체 검출기를 학습하는 방법 및 학습 장치, 이를 이용한 테스트 장치 및 테스트 장치
JP2020119542A (ja) * 2019-01-23 2020-08-06 株式会社ストラドビジョン ハードウェア最適化に使用されるイメージ認識のための1x1コンボリューションを利用したCNN学習方法及び学習装置、それを利用したテスト方法及びテスト装置{LEARNING METHOD AND LEARNING DEVICE FOR CONVOLUTIONAL NEURAL NETWORK USING 1×1 CONVOLUTION FOR IMAGE RECOGNITION TO BE USED FOR HARDWARE OPTIMIZATION, AND TESTING METHOD AND TESTING DEVICE USING THE SAME}
JP2020119539A (ja) * 2019-01-23 2020-08-06 株式会社ストラドビジョン ハードウェア最適化に使用される1xHコンボリューションを利用したCNN基盤の物体検出器を学習する方法及び学習装置、それを利用したテスト方法及びテスト装置
CN111476075B (zh) * 2019-01-23 2023-08-18 斯特拉德视觉公司 利用1x1卷积的基于CNN的客体检测方法及装置
JP2020119541A (ja) * 2019-01-23 2020-08-06 株式会社ストラドビジョン ハードウェア最適化に使用される1x1コンボリューションを利用したCNN基盤の物体検出器を学習する方法及び学習装置、これを利用したテスト方法及びテスト装置{LEARNING METHOD AND LEARNING DEVICE FOR OBJECT DETECTOR BASED ON CNN USING 1×1 CONVOLUTION TO BE USED FOR HARDWARE OPTIMIZATION, AND TESTING METHOD AND TESTING DEVICE USING THE SAME}
DE102021201031A1 (de) 2020-03-31 2021-09-30 Mitsubishi Heavy Industries, Ltd. Programmerstellungsvorrichtung, Objekterkennungssystem, Ankersetzverfahren und Ankersetzprogramm
US11769322B2 (en) 2020-03-31 2023-09-26 Mitsubishi Heavy Industries, Ltd. Program creation device, object detection system, anchor setting method, and anchor setting program

Also Published As

Publication number Publication date
JP6956555B2 (ja) 2021-11-02
US20180039853A1 (en) 2018-02-08

Similar Documents

Publication Publication Date Title
JP6956555B2 (ja) 画像内の物体を検出する方法及び物体検出システム
US10803554B2 (en) Image processing method and device
JP6088792B2 (ja) 画像検出装置及び制御プログラム並びに画像検出方法
CN110674804A (zh) 文本图像的检测方法、装置、计算机设备和存储介质
CN110555795A (zh) 高解析度风格迁移
CN110443258B (zh) 文字检测方法、装置、电子设备及存储介质
CN111814905A (zh) 目标检测方法、装置、计算机设备和存储介质
CN111292335B (zh) 一种前景掩模特征图的确定方法、装置及电子设备
JP7337937B2 (ja) 拡大画像の取得およびストレージ
US10475187B2 (en) Apparatus and method for dividing image into regions
JP6542230B2 (ja) 投影ひずみを補正するための方法及びシステム
JP6887154B2 (ja) 画像処理システム、評価モデル構築方法、画像処理方法及びプログラム
CN111476226B (zh) 一种文本定位方法、装置及模型训练方法
US9607398B2 (en) Image processing apparatus and method of controlling the same
JP2010244251A (ja) 顔の特徴部位の座標位置を検出する画像処理装置
JP7238510B2 (ja) 情報処理装置、情報処理方法及びプログラム
KR20150094108A (ko) 배경 영상의 위치를 이용한 관심맵 생성 방법 및 이를 기록한 기록 매체
JP2022182149A (ja) 情報処理装置、画像処理方法
JP7426712B2 (ja) 画像処理装置、画像処理方法、およびプログラム
TWI819438B (zh) 影像辨識裝置及影像辨識方法
CN113312979B (zh) 图像处理方法、装置、电子设备、路侧设备及云控平台
CN116403269B (zh) 一种遮挡人脸解析方法、系统、设备及计算机存储介质
WO2023162132A1 (ja) 画像変換装置、方法およびプログラム
WO2021098861A1 (zh) 识别文本的方法、装置、识别设备和存储介质
CN115761890A (zh) 人体姿态分类方法、设备和存储介质

Legal Events

Date Code Title Description
A621 Written request for application examination

Free format text: JAPANESE INTERMEDIATE CODE: A621

Effective date: 20200401

A977 Report on retrieval

Free format text: JAPANESE INTERMEDIATE CODE: A971007

Effective date: 20210512

A131 Notification of reasons for refusal

Free format text: JAPANESE INTERMEDIATE CODE: A131

Effective date: 20210525

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20210625

TRDD Decision of grant or rejection written
A01 Written decision to grant a patent or to grant a registration (utility model)

Free format text: JAPANESE INTERMEDIATE CODE: A01

Effective date: 20210907

A61 First payment of annual fees (during grant procedure)

Free format text: JAPANESE INTERMEDIATE CODE: A61

Effective date: 20211005

R150 Certificate of patent or registration of utility model

Ref document number: 6956555

Country of ref document: JP

Free format text: JAPANESE INTERMEDIATE CODE: R150