JP7846656B2 - 説明文生成システム、および、説明文データベースの生産方法 - Google Patents

説明文生成システム、および、説明文データベースの生産方法

Info

Publication number
JP7846656B2
JP7846656B2 JP2023162954A JP2023162954A JP7846656B2 JP 7846656 B2 JP7846656 B2 JP 7846656B2 JP 2023162954 A JP2023162954 A JP 2023162954A JP 2023162954 A JP2023162954 A JP 2023162954A JP 7846656 B2 JP7846656 B2 JP 7846656B2
Authority
JP
Japan
Prior art keywords
explanatory text
description
producing
image
prompt
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
JP2023162954A
Other languages
English (en)
Other versions
JP2025053870A (ja
Inventor
健太郎 吉村
晴樹 大石
滋 太田
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Hitachi Ltd
Original Assignee
Hitachi Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Hitachi Ltd filed Critical Hitachi Ltd
Priority to JP2023162954A priority Critical patent/JP7846656B2/ja
Priority to US18/795,614 priority patent/US20250103626A1/en
Priority to CN202411076736.7A priority patent/CN119722858A/zh
Priority to EP24198483.0A priority patent/EP4530886A1/en
Publication of JP2025053870A publication Critical patent/JP2025053870A/ja
Application granted granted Critical
Publication of JP7846656B2 publication Critical patent/JP7846656B2/ja
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/50Information retrieval; Database structures therefor; File system structures therefor of still image data
    • G06F16/55Clustering; Classification
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/30Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
    • G06F16/33Querying
    • G06F16/332Query formulation
    • G06F16/3329Natural language query formulation
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/50Information retrieval; Database structures therefor; File system structures therefor of still image data
    • G06F16/58Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually
    • G06F16/583Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually using metadata automatically derived from the content
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/50Information retrieval; Database structures therefor; File system structures therefor of still image data
    • G06F16/58Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually
    • G06F16/587Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually using geographical or spatial information, e.g. location
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V20/00Scenes; Scene-specific elements
    • G06V20/40Scenes; Scene-specific elements in video content
    • G06V20/41Higher-level, semantic clustering, classification or understanding of video scenes, e.g. detection, labelling or Markovian modelling of sport events or news items
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V20/00Scenes; Scene-specific elements
    • G06V20/50Context or environment of the image
    • G06V20/56Context or environment of the image exterior to a vehicle by using sensors mounted on the vehicle
    • G06V20/58Recognition of moving objects or obstacles, e.g. vehicles or pedestrians; Recognition of traffic objects, e.g. traffic signs, traffic lights or roads
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04WWIRELESS COMMUNICATION NETWORKS
    • H04W4/00Services specially adapted for wireless communication networks; Facilities therefor
    • H04W4/02Services making use of location information
    • H04W4/029Location-based management or tracking services
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04WWIRELESS COMMUNICATION NETWORKS
    • H04W4/00Services specially adapted for wireless communication networks; Facilities therefor
    • H04W4/30Services specially adapted for particular environments, situations or purposes
    • H04W4/40Services specially adapted for particular environments, situations or purposes for vehicles, e.g. vehicle-to-pedestrians [V2P]
    • H04W4/44Services specially adapted for particular environments, situations or purposes for vehicles, e.g. vehicle-to-pedestrians [V2P] for communication between vehicles and infrastructures, e.g. vehicle-to-cloud [V2C] or vehicle-to-home [V2H]

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Data Mining & Analysis (AREA)
  • General Engineering & Computer Science (AREA)
  • Databases & Information Systems (AREA)
  • Library & Information Science (AREA)
  • Multimedia (AREA)
  • Mathematical Physics (AREA)
  • Computational Linguistics (AREA)
  • Computer Networks & Wireless Communication (AREA)
  • Signal Processing (AREA)
  • Artificial Intelligence (AREA)
  • Human Computer Interaction (AREA)
  • Software Systems (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
  • Image Processing (AREA)
  • Two-Way Televisions, Distribution Of Moving Picture Or The Like (AREA)
  • Traffic Control Systems (AREA)
  • Image Analysis (AREA)
  • Processing Or Creating Images (AREA)

Description

本発明は、説明文生成システム、および、説明文データベースの生産方法に関する。
従来、画像や動画を認識し、その画像の説明文を生成する画像キャプション生成という技術が開示されている(例えば特許文献1)。
特許文献1に記載の技術では、車載カメラの画像に移りこんでいる周辺対象物を認識し、車両と周辺対象物の位置関係を含むテキストを出力することで、周辺状況説明文として提供する。
特開2019-214320号公報
しかしながら、特許文献1などの従来の技術では、コネクテッドカーから収集した車両画像をデータベース化し、そのデータベースからユーザによる自然言語の指示条件に合致する画像を検索する用途に適したシステムは提供されていない。このような画像データベースを構築する際には、データベース内の画像ごとに、その画像の説明文をあらかじめ対応付けておき、ユーザが入力する検索文に類似するデータベース内の説明文が付与されていることが望ましい。
一方、特許文献1などの従来の技術では、ユーザが入力する検索文に類似するような、自然な周辺状況説明文を生成することについては特に考慮されていなかった。例えば、単に画像内のオブジェクトを検出し、そのオブジェクトの名称をそのまま説明文にするだけでは、車両の置かれた交通シーンに応じて着目すべき周辺対象物の有無が説明文で言及されないこともあり、その結果、ユーザが入力する検索文に合致されることができなかった。
本発明はこのような事情を考慮してなされたものであり、人間が入力する検索文に合致するような自然な説明文を対応付けた画像をデータベース化することを、主な課題とする。
上記課題を解決するために、本発明の説明文生成システムは、以下の特徴を有する。
本発明は、作業者が自然言語で検索可能なデータベースと、前記データベースへ文章を格納する処理部と、を有し、
前記処理部は、
画像分析及び自然言語での出力が可能な生成モデルがカメラの画像から認識したシーンを示すシーン情報を受け取り、
シーン毎に設定されたオブジェクトの説明要否に基づいて前記シーン情報に応じた画像説明文を生成し、
前記画像説明文を含むプロンプトを生成し、
前記プロンプトを前記生成モデルへ入力し、 前記生成モデルが前記プロンプトに応じて生成した状況説明文を受け取り、
前記状況説明文を前記画像と対応付けて、前記データベースへ格納することを特徴とする。
その他の特徴は、後記する。
本発明によれば、人間が入力する検索文に合致するような自然な説明文を対応付けた画像をデータベース化することができる。
本実施形態に関する画像説明システムの構成図である。 本実施形態に関する走行ログDBの詳細を示す図である。 本実施形態に関する車両走行動画データの一部である静止画データの一例を示す図である。 本実施形態に関する車両画像分析装置の構成図である。 本実施形態に関する要否テーブルの構成図である。 本実施形態に関する認識テーブルの構成図である。 本実施形態に関する説明文生成部のフローチャートである。 本実施形態に関する車両画像分析装置のハードウェア構成図である。 本実施形態に関する画像説明文の生成処理の詳細なフローチャートである。 本実施形態に関する図9で説明した画像説明文の生成処理の具体的な動作の一例を示すフローチャートである。 本実施形態に関する一般道用の画像説明文の生成処理の詳細なフローチャートである。 本実施形態に関する図3の静止画データに対して画像説明文の生成処理を実行した結果の中間データを示すテーブルである。 本実施形態に関する図12の中間データに対して説明文生成部が不要なデータを削除した結果の出力データを示すテーブルである。 本実施形態に関するGPS説明文の生成処理の詳細を示す図である。 本実施形態に関する制御説明文の生成処理の詳細を示す図である。 本実施形態に関する図14および図15で生成された説明文の一例を示すテーブルである。 本実施形態に関する走行状況説明文の生成処理で使用される大規模言語モデル部への指示文を示すテーブルである。 本実施形態に関する図13の画像説明文とは別の画像から生成された一例を示すテーブルである。 本実施形態に関する検索部の処理を示すフローチャートである。 本実施形態に関する入出力部の画像検索インターフェースを示す図である。 本実施形態に関する図20の検索結果(シーンその1)がクリックされたときの再生画面である。 本実施形態に関する図20の検索結果(シーンその2)がクリックされたときの再生画面である。
以下、本発明の一実施形態を図面を用いて説明する。
図1は、画像説明システム100の構成図である。
画像説明システム100では、通信回線8を介して車両画像分析装置1と通信可能な車両(コネクテッドカー)として、各車両91-93が存在する。各車両91-93は、自車で計測した各種の計測データを通信回線8経由で車両画像分析装置1の走行ログDB11に送信する。
各車両91-93には、搭載され画像を撮影する車載カメラが搭載される。車両画像分析装置1は、車載カメラで撮影された画像の状況説明文を生成する。
なお、通信回線8は、有線、無線を問わず一般的な公衆回線網、例えば、「多数同時接続」、「超低遅延」を可能とした第5世代移動通信システム、いわゆる5G(5th Generation)を用いることができる。さらに5G以降の新しい携帯電話システムの特徴を活かすことで、オンライン(走行中のリアルタイム)での説明文生成などの効果も期待できる。
図2は、走行ログDB11の詳細を示す図である。
走行ログDB11は、各車両91-93からの計測データを以下のようにデータの種類別に保管する。
・車両の走行中や停車中に、車載カメラ(図示省略)で撮影した動画データである車両走行動画データ11A。
・車載GPS(Global Positioning System)データである車両走行GPSデータ11B。
・車載ECU(Electronic Control Unit)などから得られた車両走行ログデータとして、速度、加減速度、ステアリング角度などの車両の制御データである車両走行制御データ11C。
なお、GPSは衛星測位システムの一例である。
図3は、車両走行動画データ11Aの一部である静止画データ111の一例を示す図である。
静止画データ111は、高速道路上を走行する各車両91-93で撮影された車両走行動画データ11Aから抽出されるデータの一例である。
図4は、車両画像分析装置1の構成図である。
車両画像分析装置1は、図2で説明した走行ログDB11に加え、説明文生成部12と、大規模言語モデル部13と、説明対象設定部14と、説明文DB(画像データベース)15と、検索部16と、入出力部17とを有する。説明対象設定部14は、要否テーブル14Aと、認識テーブル14Bとを有する。大規模言語モデル部13は、VQA(Visual Question Answer)部13Aと、要約生成部13Bとを有する。
なお、車両画像分析装置1内に記憶される各種データ(走行ログDB11と、要否テーブル14Aと、認識テーブル14B)は、車両画像分析装置1外の記憶装置(図示省略)に格納されており、その記憶装置からネットワークを介して車両画像分析装置1からアクセス可能に構成されていてもよい。
説明文生成部12は、走行ログDB11内のデータに基づいて、大規模言語モデル部13および説明対象設定部14を用いて、各車両の走行状況を分析し、その分析結果に応じて車両の走行状況を説明する自然文を生成する。そのため、説明文生成部12は、車両の走行状況があらかじめ分類された交通シーンのいずれかに該当するかを分析する。
大規模言語モデル部13は、説明文生成部12によって呼び出される。大規模言語モデル部13は、質問文と回答文とのやり取りを行う自然言語の会話方式をインタフェースとするLAVIS(LAnguage VISion)などにより実現され、以下の処理部を有する。
・VQA部13Aは、画像に対する自然文での問い合わせに、自然文で回答する。そのため、VQA部13Aは、CNN(Convolutional Neural Network)などの画像認識モデルをあらかじめ学習データなどを用いて用意しておき、その画像認識モデルに対して問い合わせ文を入力することで、対応する画像の説明文を得る。
・要約生成部13Bは、入力された自然文(プロンプト)の内容を要約(複数の文章を統合)した要約文を、交通状況説明文として回答する。要約生成部13Bは、要約処理や翻訳処理などを行うテキスト生成AIのサービスとして、例えば、GPT-4、CLIP、BLIP、BLIP-2などの既存のサービスを用いてもよい。
説明対象設定部14は、以下のテーブルを参照して、交通シーンに対応した説明対象物を説明文生成部12に設定し、説明文DB15に記憶する。
・要否テーブル14A(図5)は、交通シーンごとに説明対象物を対応付けるとともに、個別の説明対象物についての説明文に言及するか否かの重要度合いを定義する。
・認識テーブル14B(図6)は、個別の説明対象物について、説明文で言及する詳細な内容を定義する。
説明文DB15は、説明文生成部12によって生成された走行状況説明文を保管する。
このように、説明文生成部12は、以下の(処理1)~(処理3)を実行する。
(処理1)カメラから受信した画像に写るシーンを特定し、特定したシーンごとにその画像内の対象物についての認識要否情報を要否テーブル14Aから読み取る。
(処理2)読み取った認識要否情報で認識が必要と指定された対象物を画像内から認識し、その認識結果から対象物ごとの説明文を生成する。
(処理3)特定したシーンと対象物ごとの説明文とをもとに画像の状況説明文を生成し、画像の状況説明文と画像とを対応付けて説明文DB15に記憶する。
図5は、要否テーブル14Aの構成図である。説明対象設定部14は、高速道路、一般道、駐車場などの交通シーンごとの説明対象物を設定する。
例えば、交通シーン「高速道路」と、説明対象物「歩行者」との組み合わせは、「要/要」である。この「要/要」表記の左側の認識要否情報「要」は、画像から説明対象物を認識する必要があることを示す。また「要/要」表記の右側の説明要否情報「要」は、画像から認識した、あるいは認識しなかった説明対象物について、説明文で説明する必要があることを示す。
よって、交通シーン「一般道」では、歩行者の認識は「必要」であり、認識されなかった場合でも説明が「必要」と設定している。一方、交通シーン「一般道」では、横断歩道の認識は「必要」であるが、説明は不要である。
このように、説明文生成部12は、画像内の対象物についての説明要否情報を要否テーブル14Aから読み取り、読み取った説明要否情報で説明が必要と指定された対象物を画像内から認識できない場合には、対象物ごとの説明文として、その対象物が画像内には存在しない旨の説明文を生成する。
これにより、車両が走行している交通シーンに応じて、通常存在しないことが多い対象物については存在する場合のみ説明文を生成し、通常存在することが多い対象物については存在しない場合についても説明文が生成できる。そのため、より自然な交通状況説明文が生成でき、ユーザによる検索文に対する検索精度が向上するという効果がある。
図6は、認識テーブル14Bの構成図である。認識テーブル14Bは、認識された説明対象物に対して、VQA部13Aを用いて分析する項目、および、その分析結果を説明文に含める項目を、詳細項目として定義する。
例えば、VQA部13Aは、歩行者が認識された場合には、その場所、衣服の色、動作について分析する。
このように、説明文生成部12は、画像内の対象物についての詳細項目を認識テーブル14Bから読み取り、画像内から認識内の対象物についての読み取った詳細項目の説明文を、対象物ごとの説明文として生成する。これにより、説明対象物によって追加すべき情報を個別に設定することが可能となり、自然な交通状況説明文が生成できる。そのため、ユーザによる検索文に対する検索精度が向上する。
図7は、説明文生成部12のフローチャートである。
説明文生成部12は、画像説明文の生成処理(S21)として、車両走行動画データ11Aから抽出した静止画データ111に対して、VQA部13Aに画像分析を実行させることで画像説明文を生成する。静止画データ111の抽出処理は、例えば10秒おきなどの一定間隔での連続撮影画像を抽出したり、一動画ファイルから等時間間隔で10枚の画像を抽出したりする処理である。
説明文生成部12は、GPS説明文の生成処理(S22)として、車両走行GPSデータ11Bに基づいてGPS説明文を生成する。この際、対象となるGPSデータ(測位データ)はS21の静止画データ111と同一時刻のGPSデータ、または、最も時刻が近いGPSデータを採用する。
つまり、説明文生成部12は、車両91の車載GPSから読み取ったGPSデータに基づいて、画像撮影時の時間帯の情報、および、画像撮影時の走行位置の情報のうちの少なくとも1つの情報に関する説明文を、画像の状況説明文に追加する。
説明文生成部12は、制御説明文の生成処理(S23)として、車両走行制御データ11Cに基づいて制御説明文を生成する。この際、対象となる制御データはS21の静止画データ111と同一時刻、または最も時刻が近い制御データを採用する。
つまり、説明文生成部12は、車両91の車載ECU(Electronic Control Unit)から読み取った車両走行制御データに基づいて、速度の情報、加減速度の情報、および、ステアリング角度の情報のうちの少なくとも1つの情報に関する説明文を、画像の状況説明文に追加する。
説明文生成部12は、走行状況説明文の生成処理(S24)として、S21で生成された画像説明文と、S22で生成されたGPS説明文と、S23で生成された制御説明文とを、要約生成部13Bに要約させることで、走行状況説明文を生成する。説明文生成部12は、生成した走行状況説明文と、その走行状況説明文の説明対象である静止画データ111とを対応付けて、説明文DB15に保存する。
つまり、要約生成部13Bは、入力されたプロンプトに沿った要約文を生成する。そして、説明文生成部12は、状況説明文に含む情報、状況説明文から除外する情報、および、状況説明文の例文の情報をもとにした状況説明文の生成指示文と、対象物ごとの説明文とを含むプロンプトを要約生成部13Bに入力することで、画像の状況説明文を生成する。
図8は、車両画像分析装置1のハードウェア構成図である。
車両画像分析装置1は、CPU901と、RAM902と、ROM903と、HDD904と、通信I/F905と、入出力I/F906と、メディアI/F907とを有するコンピュータ900として構成される。
通信I/F905は、外部の通信装置915と接続される。入出力I/F906は、入出力装置916と接続される。メディアI/F907は、記録媒体917からデータを読み書きする。さらに、CPU901は、RAM902に読み込んだプログラム(アプリケーションや、その略のアプリとも呼ばれる)を実行することにより、各処理部を改善制御する。そして、このプログラムは、通信回線を介して配布したり、CD-ROM等の記録媒体917に記録して配布したりすることも可能である。
図9は、画像説明文の生成処理(図7のS21)の詳細なフローチャートである。
説明文生成部12は、VQA部13Aに問い合わせることで、静止画データ111に写る交通シーンを分類する(S211)。VQA部13Aは、静止画データ111および交通シーンの問い合わせ文(例えば「このシーンはどこですか? 例えば、道路、高速道路、駐車場でしょうか?」の入力を受け、回答文(例えば、高速道路)を説明文生成部12に応答する(図12の行A01)。なお、説明文生成部12は、事前に管理者によって車両画像分析装置1に設定された交通シーンの問い合わせ文を読み込むので、車両画像分析装置1の利用者は、自身で交通シーンの問い合わせ文を生成する必要は無い。
以下、説明文生成部12は、S212~S217のループ処理について、要否テーブル14Aに登録されている説明対象物を順に選択して(歩行者、自転車、自動車、…)実行する。以下、今回のループ処理で選択された説明対象物を、選択対象物とする。
説明文生成部12は、S221で特定した交通シーンで選択対象物の認識が必要か否かを、要否テーブル14Aを参照して判定する(S212)。S212でYes(必要)ならS213に進み、NoならS217に進む。
説明文生成部12は、選択対象物が静止画データ111内に存在するか否かを、大規模言語モデル部13のVQA部13Aに対して問い合わせる。この問い合わせ文は、例えば、「このシーンに歩行者はいますか?」である(図12の行A02)。説明文生成部12は、この問い合わせ文への回答文(対象物の認識結果)により、認識が必要と指定された対象物を画像内から認識する。この認識結果として、説明文生成部12は、選択対象物が静止画データ111内に存在するか否かを判定する(S213)。S213でYes(存在する)ならS214に進み、NoならS215に進む。
説明文生成部12は、静止画データ111内に存在する選択対象物についての詳細項目を取得する(S214)。そのため、説明文生成部12は、認識テーブル14Bを参照して、選択対象物に対応する詳細項目を取得する。そして、説明文生成部12は、静止画データ111内の選択対象物についての詳細項目を1つずつ、大規模言語モデル部13のVQA部13Aに対して問い合わせる。例えば、説明文生成部12は、選択対象物=自動車であり、認識テーブル14Bの自動車に対応する詳細項目には「色」が含まれているので、「車の色は何色ですか?」という問い合わせ文を生成する。
説明文生成部12は、選択対象物の説明(言及)が必要か否かを、要否テーブル14Aを参照して判定する(S215)。S215でYes(必要)ならS216に進み、NoならS217に進む。
説明文生成部12は、以下のいずれかにより、選択対象物の説明文を生成する(S216)。
・S213でYesの場合、S214で取得した選択対象物についての詳細項目の問い合わせ文およびその回答文の組み合わせから、選択対象物の説明文を生成する。
・S213でNoの場合、選択対象物が静止画データ111内には認識されなかった旨の選択対象物の説明文を生成する(図18の行D07など)。
説明文生成部12は、今回の選択対象物の処理を終えたことで、すべての選択対象物に対する処理を完了したか否かを判定する(S217)。S217でYes(完了した)なら処理を終了し、Noなら未処理の選択対象物に切り替えてS212に戻る。
これにより、車両が走行している交通シーンに応じて注目および確認すべき周辺対象物に対する説明を含んだ自然な交通状況説明文が生成でき、ユーザによる検索文に対する検索精度が向上する。
図10は、図9で説明した画像説明文の生成処理の具体的な動作の一例を示すフローチャートである。
説明文生成部12は、静止画データ111に写る交通シーンを分類する処理(図9のS211)の結果に応じて、以下のように交通シーン別の処理に分岐する(S301)。
・一般道の分類結果なら、一般道用の画像説明文を生成する(S302)。
・高速道路の分類結果なら、高速道路用の画像説明文を生成する(S303)。
・駐車場の分類結果なら、駐車場用の画像説明文を生成する(S304)。
・その他の分類結果なら、その他用として規定された画像説明文を生成する(S305)。
図11は、一般道用の画像説明文の生成処理(図10のS302)の詳細なフローチャートである。
説明文生成部12は、交通シーン質問および回答文と(図9のS211)、信号の有無の質問および回答文を生成する(S311)。
説明文生成部12は、図9の判定処理(S213)として、画像内の歩行者有無を質問し(S312)、有りの時はS313に進み、無しの時はS314に進む。
説明文生成部12は、歩行者の詳細項目についての質問回答として(図9のS214)、歩行者の存在を示す回答文と、歩行者の場所質問および回答文と、歩行者の色質問および回答文と、歩行者の動作質問および回答文を生成する(S313)。
説明文生成部12は、歩行者が存在しないことを示す回答文を生成する(S314)。
説明文生成部12は、図9の判定処理(S213)として、画像内の自動車有無を質問し(S315)、有りの時はS316に進み、無しの時はS317に進む。
説明文生成部12は、自動車の詳細項目についての質問回答として(図9のS214)、自動車の存在を示す回答文と、自動車の場所質問および回答文と、自動車の車種質問および回答文と、自動車の色質問および回答文と、自動車の動作質問および回答文を生成する(S316)。
説明文生成部12は、図9の判定処理(S213)として、画像内の自転車有無を質問し(S317)、有りの時はS318に進み、無しの時はS319に進む。
説明文生成部12は、自転車の詳細項目についての質問回答として(図9のS214)、自転車の存在を示す回答文と、自転車の場所質問および回答文と、自転車の色質問および回答文と、自転車の動作質問および回答文を生成する(S318)。
説明文生成部12は、図9の判定処理(S213)として、画像内の横断歩道有無を質問し(S319)、有りの時はS320に進み、無しの時は処理を終了する。説明文生成部12は、横断歩道の存在を示す回答文を生成する(S320)。
以上、図10では一般道用の画像説明文の生成処理を説明したが、他の交通シーン用の画像説明文を生成する処理(S303~S305)も、同様の処理である。
図12は、図3の静止画データ111に対して画像説明文の生成処理(S21)を実行した結果の中間データを示すテーブルである。
このテーブルは、行ごとに、質問文とその質問文への回答文との組み合わせにより、画像説明文が構成される。
例えば、行A01は、交通シーンを分類する処理(S211)の結果である。
行A02~行A04は、選択対象物が静止画データ111内に存在するか否かを判定する処理(S213)の結果である。
行A05~行A13は、選択対象物についての詳細項目を取得する処理(S214)の結果である。
図13は、図12の中間データに対して説明文生成部12が不要なデータを削除した結果の出力データを示すテーブルである。図12との差異として、説明対象設定部14の要否テーブル14Aにて認識されなかった場合の説明が不要とされた歩行者の説明文(行A02)、自転車の説明文(行A03)、料金所の説明文(行A13)が、図13では削除されている。
図14は、GPS説明文の生成処理(S22)の詳細を示す図である。
説明文生成部12は、車両走行GPSデータ11Bから得られるGPS情報の時間帯に応じて、静止画データ111の撮影時刻を朝、昼、夕、夜などに分類した説明を生成する(S221)。
説明文生成部12は、車両走行GPSデータ11Bから得られるGPS情報の緯度経度に応じて、静止画データ111の撮影場所を、主要幹線道路や、都市名として特定した説明を生成する(S222)。
これにより、車両の走行時間帯および走行場所に関する情報を含んだ交通状況説明文が生成できる。そのため、ユーザによる検索文に対する検索精度が向上する。
図15は、制御説明文の生成処理(S23)の詳細を示す図である。
説明文生成部12は、車両走行制御データ11Cから走行速度制御に関する説明文を生成する(S231)。説明文は、例えば、時速20km以下は低速、20km~60kmは中速、60km以降は高速などである。
説明文生成部12は、車両走行制御データ11Cから加減速制御に関する説明文を生成する(S232)。説明文は、例えば、一定以上の加速度の場合には加速状態、一定以上の減速度の場合は減速状態、それ以外は定速状態などである。
説明文生成部12は、車両走行制御データ11Cからステアリング制御に関する説明文を生成する(S233)。説明文は、例えば、一定以上の舵角の場合に左折状態、右折状態、それ以外の場合に直進状態などである。
これにより、車両の制御状態および挙動に関する説明を含んだ、より自然な交通状況説明文が生成できる。そのため、ユーザによる検索文に対する検索精度が向上するという効果がある。
図16は、図14および図15で生成された説明文の一例を示すテーブルである。
行B01では、S221にて、時間帯の説明文が生成されている。
行B02では、S222にて、走行場所の説明文が生成されている。
行B03では、S231にて、走行速度の説明文が生成されている。
行B04では、S232にて、加減速状態の説明文が生成されている。
行B05では、S233にて、ステアリング状態の説明文が生成されている。
図17は、走行状況説明文の生成処理(S24)で使用される大規模言語モデル部13への指示文を示すテーブルである。
行C01には、交通状況説明文の生成指示が記載される。
行C02には、交通状況説明文に含む情報が記載される。
行C03には、交通状況説明文から除外する情報が記載される。
行C04には、交通状況説明文の例文が記載される。
そして、走行状況説明文の生成処理(S24)では、説明文生成部12は、以下の(項目1)から(項目4)までのテキストを順に結合したプロンプトを生成する。なお、(項目2)および(項目3)の少なくとも1つは、省略してもよい。
(項目1)大規模言語モデル部13への指示文(図17)
(項目2)GPS説明文(図16の行B01、行B02)
(項目3)制御説明文(図16の行B03、行B04、行B05)
(項目4)画像説明文(図13)
説明文生成部12は、この生成されたプロンプトを大規模言語モデル部13に入力することにより、自然文で記述された交通状況説明文を取得する。以下、プロンプトから大規模言語モデル部13が生成した交通状況説明文(後記の図21では状況説明文732に相当)を例示する。
交通状況説明文=「あなたは正午、首都高5号線を猛スピードで減速しながら直進しています。このシーンでは、高速道路にオレンジ色の実線の車線があります。さらに、あなたの前方の道路を白いトラックが前に向かって走っています。」
これにより、使用用途やユーザの好みに応じた自然な交通状況説明文を生成することにより、ユーザによる検索文に対する検索精度が向上する。
図18は、図13の画像説明文とは別の画像から生成された一例を示すテーブルである。
図18の画像説明文は、一般道を走行する車両から撮影された画像を対象とした。そのため、要否テーブル14Aでの一般道と歩行者との組み合わせが説明「要」なので、行D07において、「歩行者が認識されなかった」という情報が記載されている。
この図18の画像説明文を含むプロンプトから、走行状況説明文の生成処理(S24)により大規模言語モデル部13が生成した交通状況説明文は、以下の通りである。
交通状況説明文=「あなたは現在、夜の水戸市の市道を低速で安定した速度で走行し、左折の準備をしています。このシーンには歩行者はいません。」
以上、図18までを参照して、走行状況説明文のデータベース化(説明文DB15に保存するまでの処理)を説明した。以下は、データベース化した情報の活用例を説明する。
図19は、検索部16の処理を示すフローチャートである。
検索部16は、説明文DB15に記憶された画像から、入力された検索文に合致する画像を検索する。具体的には、検索部16は、入力された検索文と、説明文DB15に記憶された状況説明文との類似度が高い画像を検索結果として出力する。
なお、検索部16は、「類似度が高い画像」として、例えば、検索結果の類似度が高い順に画像を列挙してその上位1番目からX番目までを出力としてもよいし(相対的な順位の類似判定)、類似度が事前に設定された基準値(閾値Y)よりも高い検索結果の画像を出力してもよい(絶対的な類似判定)。
以下、検索部16の処理の詳細を説明する。
検索部16は、入出力部17から、ユーザが入力した検索文を受信する(S61)。ここでのユーザは、例えば、高速道路などを管理する交通管制センタの解説員であり、検索文とは、例えば、所定時刻に高速道路の所定場所で発生した事故に類似する状況の画像をデータベースから収集する旨の内容である。解説員は、データベースから取得した画像素材を編集して、発生した事故に関する報道番組を制作する予定である。
検索部16は、ユーザからの検索文と、説明文DB15に格納された説明文との類似度を評価し(S62)、類似度が高い説明文に対応付けられている動画情報(画像情報)を説明文DB15から取得する。類似度評価には、文書ベクトル化に基づくコサイン類似度検索などを用いても良い。
検索部16は、S62で取得した走行動画および走行状況説明文に加え、その走行状況の関連情報(説明文DB15には無いが、気象データベースから走行状況説明文の場所日時を指定して取得可能な天気情報など)を検索して取得し、それらの結果をもとに回答文を生成する(S63)。
つまり、検索部16は、類似度が高い画像に対応する状況説明文に含まれる情報をもとに、説明文DB15とは別のデータベースから取得した関連情報も、検索結果として出力してもよい。
検索部16は、S63の回答文を入出力部17へ送信する(S64)。
これにより、ユーザが入力した自然言語による検索文に類似した交通状況説明文を有する動画データを検索する場合、短時間で目的の動画を検索できる。
図20は、入出力部17の画像検索インターフェース71を示す図である。
画像検索インターフェース71は、S61の検索文の入力欄である検索文入力部72と、S64の回答文の表示欄である検索結果表示部73とで構成される。検索結果表示部73には、複数の検索結果(シーンその1~その4)がアイコンまたはサムネイル画像として表示される。
図21は、図20の検索結果(シーンその1)がクリックされたときの再生画面である。この再生画面には、上から順に以下の情報が表示される。
・検索結果の画像731。
・画像731の状況説明文732は、検索文との類似度が高いものとして抽出されたものである。
・GPS説明文(時刻、場所)、制御説明文(車種、走行速度)、天気などの付加情報733。
図22は、図20の検索結果(シーンその2)がクリックされたときの再生画面である。図21と同様に、この再生画面には、検索結果の画像741と、その状況説明文742と、付加情報743とが図21と同様に表示される。
これにより、ユーザは自然言語にて検索文を入力したうえで、検索文に類似する交通状況説明文および動画、関連情報を参照して動画を検索することによって、検索効率を向上できる。
以上説明した本実施形態によれば、説明文生成部12は、車両画像の説明文を生成する際に、要否テーブル14Aを参照して、車両が置かれた交通シーンに基づいて着目すべき周辺対象物の有無を含んだ自然な説明文を生成する。これにより、必要な周辺対象物の言及はしつつ、不要な周辺対象物は言及されない自然な説明文がデータベース化されるので、人間が入力する検索文からのデータベースの検索精度が向上する。
さらに、本発明は上述した各実施形態に限られるものではなく、特許請求の範囲に記載した本発明の要旨を逸脱しない限りにおいて、その他種々の応用例、変形例を取り得ることは勿論である。例えば、上述した各実施形態は本発明を分かりやすく説明するために車両画像分析装置1の構成を詳細かつ具体的に説明したものであり、必ずしも説明した全ての構成要素を備えるものに限定されない。また、ある実施形態の構成の一部を他の実施形態の構成要素に置き換えることが可能である。また、ある実施形態の構成に他の実施形態の構成要素を加えることも可能である。また、各実施形態の構成の一部について、他の構成要素の追加又は置換、削除をすることも可能である。
また、上記の各構成、機能、処理部等は、それらの一部又は全部を、例えば集積回路で設計するなどによりハードウェアで実現してもよい。ハードウェアとして、FPGA(Field Programmable Gate Array)やASIC(Application Specific Integrated Circuit)などの広義のプロセッサデバイスを用いてもよい。
また、上述した実施形態にかかる車両画像分析装置1の各構成要素は、それぞれのハードウェアがネットワークを介して互いに情報を送受信できるならば、いずれのハードウェアに実装されてもよい。また、ある処理部により実行される処理が、1つのハードウェアにより実現されてもよいし、複数のハードウェアによる分散処理により実現されてもよい。
1 車両画像分析装置
8 通信回線
11 走行ログDB
11A 車両走行動画データ
11B 車両走行GPSデータ
11C 車両走行制御データ
12 説明文生成部
13 大規模言語モデル部
13A VQA部
13B 要約生成部
14 説明対象設定部
14A 要否テーブル
14B 認識テーブル
15 説明文DB(画像データベース)
16 検索部
17 入出力部
91-93 車両
100 画像説明システム
111 静止画データ
732,742 状況説明文

Claims (20)

  1. 作業者が自然言語で検索可能なデータベースと、
    前記データベースへ文章を格納する処理部と、を有し、
    前記処理部は、
    画像分析及び自然言語での出力が可能な生成モデルがカメラの画像から認識したシーンを示すシーン情報を受け取り、
    シーン毎に設定されたオブジェクトの説明要否に基づいて前記シーン情報に応じた画像説明文を生成し、
    前記画像説明文を含むプロンプトを生成し、
    前記プロンプトを前記生成モデルへ入力し、
    前記生成モデルが前記プロンプトに応じて生成した状況説明文を受け取り、
    前記状況説明文を前記画像と対応付けて、前記データベースへ格納することを特徴とする説明文生成システム。
  2. 請求項1に記載の説明文生成システムであって、
    前記生成モデルは、言語モデルを含むことを特徴とする説明文生成システム。
  3. 請求項1に記載の説明文生成システムであって、
    前記プロンプトは、前記説明要否、及び認識要否に基づいて生成されることを特徴とする説明文生成システム。
  4. 請求項1に記載の説明文生成システムであって、
    前記処理部は、前記生成モデルに問い合わせ文を入力することで前記画像説明文を生成することを特徴とする説明文生成システム。
  5. 請求項1に記載の説明文生成システムであって、
    前記プロンプトは、制御説明文を含むことを特徴とする説明文生成システム。
  6. 請求項1に記載の説明文生成システムであって、
    前記プロンプトは、GPS説明文を含むことを特徴とする説明文生成システム。
  7. 請求項2に記載の説明文生成システムであって、
    前記プロンプトは、前記説明要否、及び認識要否に基づいて生成されることを特徴とする説明文生成システム。
  8. 請求項7に記載の説明文生成システムであって、
    前記処理部は、前記生成モデルに問い合わせ文を入力することで前記画像説明文を生成することを特徴とする説明文生成システム。
  9. 請求項8に記載の説明文生成システムであって、
    前記プロンプトは、制御説明文を含むことを特徴とする説明文生成システム。
  10. 請求項9に記載の説明文生成システムであって、
    前記プロンプトは、GPS説明文を含むことを特徴とする説明文生成システム。
  11. 処理部は、
    画像分析及び自然言語での出力が可能な生成モデルがカメラの画像から認識したシーンを示すシーン情報を受け取り、
    シーン毎に設定されたオブジェクトの説明要否に基づいて前記シーン情報に応じた画像説明文を生成し、
    前記画像説明文を含むプロンプトを生成し、
    前記プロンプトを前記生成モデルへ入力し、
    前記生成モデルが前記プロンプトに応じて生成した状況説明文を受け取り、
    前記状況説明文を前記画像と対応付けて、データベースへ格納することを特徴とする説明文データベースの生産方法。
  12. 請求項11に記載の説明文データベースの生産方法であって、
    前記生成モデルは、言語モデルを含むことを特徴とする説明文データベースの生産方法。
  13. 請求項11に記載の説明文データベースの生産方法であって、
    前記プロンプトは、前記説明要否、及び認識要否に基づいて生成されることを特徴とする説明文データベースの生産方法。
  14. 請求項11に記載の説明文データベースの生産方法であって、
    前記処理部は、前記生成モデルに問い合わせ文を入力することで前記画像説明文を生成することを特徴とする説明文データベースの生産方法。
  15. 請求項11に記載の説明文データベースの生産方法であって、
    前記プロンプトは、制御説明文を含むことを特徴とする説明文データベースの生産方法。
  16. 請求項11に記載の説明文データベースの生産方法であって、
    前記プロンプトは、GPS説明文を含むことを特徴とする説明文データベースの生産方法。
  17. 請求項12に記載の説明文データベースの生産方法であって、
    前記プロンプトは、前記説明要否、及び認識要否に基づいて生成されることを特徴とする説明文データベースの生産方法。
  18. 請求項17に記載の説明文データベースの生産方法であって、
    前記処理部は、前記生成モデルに問い合わせ文を入力することで前記画像説明文を生成することを特徴とする説明文データベースの生産方法。
  19. 請求項18に記載の説明文データベースの生産方法であって、
    前記プロンプトは、制御説明文を含むことを特徴とする説明文データベースの生産方法。
  20. 請求項19に記載の説明文データベースの生産方法であって、
    前記プロンプトは、GPS説明文を含むことを特徴とする説明文データベースの生産方法。
JP2023162954A 2023-09-26 2023-09-26 説明文生成システム、および、説明文データベースの生産方法 Active JP7846656B2 (ja)

Priority Applications (4)

Application Number Priority Date Filing Date Title
JP2023162954A JP7846656B2 (ja) 2023-09-26 2023-09-26 説明文生成システム、および、説明文データベースの生産方法
US18/795,614 US20250103626A1 (en) 2023-09-26 2024-08-06 Image explanation system, image analysis device, and image explanation method
CN202411076736.7A CN119722858A (zh) 2023-09-26 2024-08-07 图像说明系统、图像分析装置和图像说明方法
EP24198483.0A EP4530886A1 (en) 2023-09-26 2024-09-04 Image explanation system, image analysis device, and image explanation method

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP2023162954A JP7846656B2 (ja) 2023-09-26 2023-09-26 説明文生成システム、および、説明文データベースの生産方法

Publications (2)

Publication Number Publication Date
JP2025053870A JP2025053870A (ja) 2025-04-07
JP7846656B2 true JP7846656B2 (ja) 2026-04-15

Family

ID=92675824

Family Applications (1)

Application Number Title Priority Date Filing Date
JP2023162954A Active JP7846656B2 (ja) 2023-09-26 2023-09-26 説明文生成システム、および、説明文データベースの生産方法

Country Status (4)

Country Link
US (1) US20250103626A1 (ja)
EP (1) EP4530886A1 (ja)
JP (1) JP7846656B2 (ja)
CN (1) CN119722858A (ja)

Families Citing this family (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP7755363B1 (ja) * 2024-10-18 2025-10-16 株式会社オプティム 情報処理装置、方法、プログラム及びシステム

Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2024158436A (ja) 2023-04-27 2024-11-08 Lineヤフー株式会社 情報処理装置、プログラム、情報処理方法
JP2025038912A (ja) 2023-08-18 2025-03-21 Lineヤフー株式会社 情報処理装置、情報処理方法及び情報処理プログラム
JP2025050370A (ja) 2023-09-22 2025-04-04 Base株式会社 プログラム、情報処理装置、方法及びシステム

Family Cites Families (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP7042167B2 (ja) * 2018-06-13 2022-03-25 本田技研工業株式会社 車両制御装置、車両制御方法、およびプログラム

Patent Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2024158436A (ja) 2023-04-27 2024-11-08 Lineヤフー株式会社 情報処理装置、プログラム、情報処理方法
JP2025038912A (ja) 2023-08-18 2025-03-21 Lineヤフー株式会社 情報処理装置、情報処理方法及び情報処理プログラム
JP2025050370A (ja) 2023-09-22 2025-04-04 Base株式会社 プログラム、情報処理装置、方法及びシステム

Also Published As

Publication number Publication date
CN119722858A (zh) 2025-03-28
JP2025053870A (ja) 2025-04-07
US20250103626A1 (en) 2025-03-27
EP4530886A1 (en) 2025-04-02

Similar Documents

Publication Publication Date Title
KR102043588B1 (ko) 자율 주행 차량 내에서 미디어 콘텐츠를 표시하기 위한 시스템 및 방법
US20210356968A1 (en) Scenario identification for validation and training of machine learning based models for autonomous vehicles
JP6310531B2 (ja) 自律走行車において拡張仮想現実コンテンツを提供するシステム及び方法
CN111582189B (zh) 交通信号灯识别方法、装置、车载控制终端及机动车
DE69933422T2 (de) System und Verfahren zur Routenführung mit einem Navigationsanwendungsprogram
CN106796610A (zh) 信息提示装置、方法和计算机程序产品
JP6956232B2 (ja) 探索システム、探索方法、および探索プログラム
US11521113B2 (en) System and method for unifying heterogenous datasets using primitives
DE112020003963T5 (de) Informationsverarbeitungsvorrichtung, informationsverarbeitungsverfahren und programm
JP7846656B2 (ja) 説明文生成システム、および、説明文データベースの生産方法
Raju et al. Car-following properties of a commercial adaptive cruise control system: A pilot field test
CN118152675A (zh) 基于车辆的信息推送方法、装置、电子设备及存储介质
WO2025177679A1 (ja) 文章生成システム、文章生成プログラム、および、報告書データベースの生産方法
Kiss Manchurian artificial intelligence in autonomous vehicles
Zahraoui et al. Driver profiling: The pathway to deeper personalization
CN117573919A (zh) 车端音乐推荐方法、装置、设备及存储介质
Guo et al. How will humans cut through automated vehicle platoons in mixed traffic environments? A simulation study of drivers’ gaze behaviors based on the dynamic areas of interest
CN113704993B (zh) 一种交通场景数字化方法
DE102023209381A1 (de) Clusteranalyse von objekttrajektorien mit hybridem denken für maschinelles lernen
CN115905468A (zh) 检索方法、装置、计算机设备及存储介质
CN120406796A (zh) 一种基于车载监控影像的任务执行方法、装置及电子设备
CN113954853A (zh) 驾驶策略处理方法及装置
Ran et al. Intelligent driving interface layout and design research
CN121456014A (zh) 基于车辆的can数据处理方法、装置、设备及存储介质
DE102024131831A1 (de) Steuerung eines Kraftfahrzeugs

Legal Events

Date Code Title Description
A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20240229

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20250217

A621 Written request for application examination

Free format text: JAPANESE INTERMEDIATE CODE: A621

Effective date: 20250217

A977 Report on retrieval

Free format text: JAPANESE INTERMEDIATE CODE: A971007

Effective date: 20251223

A131 Notification of reasons for refusal

Free format text: JAPANESE INTERMEDIATE CODE: A131

Effective date: 20260106

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20260225

TRDD Decision of grant or rejection written
A01 Written decision to grant a patent or to grant a registration (utility model)

Free format text: JAPANESE INTERMEDIATE CODE: A01

Effective date: 20260310

A61 First payment of annual fees (during grant procedure)

Free format text: JAPANESE INTERMEDIATE CODE: A61

Effective date: 20260403

R150 Certificate of patent or registration of utility model

Ref document number: 7846656

Country of ref document: JP

Free format text: JAPANESE INTERMEDIATE CODE: R150