JP7846656B2 - 説明文生成システム、および、説明文データベースの生産方法 - Google Patents
説明文生成システム、および、説明文データベースの生産方法Info
- Publication number
- JP7846656B2 JP7846656B2 JP2023162954A JP2023162954A JP7846656B2 JP 7846656 B2 JP7846656 B2 JP 7846656B2 JP 2023162954 A JP2023162954 A JP 2023162954A JP 2023162954 A JP2023162954 A JP 2023162954A JP 7846656 B2 JP7846656 B2 JP 7846656B2
- Authority
- JP
- Japan
- Prior art keywords
- explanatory text
- description
- producing
- image
- prompt
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F16/00—Information retrieval; Database structures therefor; File system structures therefor
- G06F16/50—Information retrieval; Database structures therefor; File system structures therefor of still image data
- G06F16/55—Clustering; Classification
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F16/00—Information retrieval; Database structures therefor; File system structures therefor
- G06F16/30—Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
- G06F16/33—Querying
- G06F16/332—Query formulation
- G06F16/3329—Natural language query formulation
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F16/00—Information retrieval; Database structures therefor; File system structures therefor
- G06F16/50—Information retrieval; Database structures therefor; File system structures therefor of still image data
- G06F16/58—Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually
- G06F16/583—Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually using metadata automatically derived from the content
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F16/00—Information retrieval; Database structures therefor; File system structures therefor
- G06F16/50—Information retrieval; Database structures therefor; File system structures therefor of still image data
- G06F16/58—Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually
- G06F16/587—Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually using geographical or spatial information, e.g. location
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V20/00—Scenes; Scene-specific elements
- G06V20/40—Scenes; Scene-specific elements in video content
- G06V20/41—Higher-level, semantic clustering, classification or understanding of video scenes, e.g. detection, labelling or Markovian modelling of sport events or news items
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V20/00—Scenes; Scene-specific elements
- G06V20/50—Context or environment of the image
- G06V20/56—Context or environment of the image exterior to a vehicle by using sensors mounted on the vehicle
- G06V20/58—Recognition of moving objects or obstacles, e.g. vehicles or pedestrians; Recognition of traffic objects, e.g. traffic signs, traffic lights or roads
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04W—WIRELESS COMMUNICATION NETWORKS
- H04W4/00—Services specially adapted for wireless communication networks; Facilities therefor
- H04W4/02—Services making use of location information
- H04W4/029—Location-based management or tracking services
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04W—WIRELESS COMMUNICATION NETWORKS
- H04W4/00—Services specially adapted for wireless communication networks; Facilities therefor
- H04W4/30—Services specially adapted for particular environments, situations or purposes
- H04W4/40—Services specially adapted for particular environments, situations or purposes for vehicles, e.g. vehicle-to-pedestrians [V2P]
- H04W4/44—Services specially adapted for particular environments, situations or purposes for vehicles, e.g. vehicle-to-pedestrians [V2P] for communication between vehicles and infrastructures, e.g. vehicle-to-cloud [V2C] or vehicle-to-home [V2H]
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- General Physics & Mathematics (AREA)
- Data Mining & Analysis (AREA)
- General Engineering & Computer Science (AREA)
- Databases & Information Systems (AREA)
- Library & Information Science (AREA)
- Multimedia (AREA)
- Mathematical Physics (AREA)
- Computational Linguistics (AREA)
- Computer Networks & Wireless Communication (AREA)
- Signal Processing (AREA)
- Artificial Intelligence (AREA)
- Human Computer Interaction (AREA)
- Software Systems (AREA)
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
- Image Processing (AREA)
- Two-Way Televisions, Distribution Of Moving Picture Or The Like (AREA)
- Traffic Control Systems (AREA)
- Image Analysis (AREA)
- Processing Or Creating Images (AREA)
Description
特許文献1に記載の技術では、車載カメラの画像に移りこんでいる周辺対象物を認識し、車両と周辺対象物の位置関係を含むテキストを出力することで、周辺状況説明文として提供する。
本発明は、作業者が自然言語で検索可能なデータベースと、前記データベースへ文章を格納する処理部と、を有し、
前記処理部は、
画像分析及び自然言語での出力が可能な生成モデルがカメラの画像から認識したシーンを示すシーン情報を受け取り、
シーン毎に設定されたオブジェクトの説明要否に基づいて前記シーン情報に応じた画像説明文を生成し、
前記画像説明文を含むプロンプトを生成し、
前記プロンプトを前記生成モデルへ入力し、 前記生成モデルが前記プロンプトに応じて生成した状況説明文を受け取り、
前記状況説明文を前記画像と対応付けて、前記データベースへ格納することを特徴とする。
その他の特徴は、後記する。
画像説明システム100では、通信回線8を介して車両画像分析装置1と通信可能な車両(コネクテッドカー)として、各車両91-93が存在する。各車両91-93は、自車で計測した各種の計測データを通信回線8経由で車両画像分析装置1の走行ログDB11に送信する。
各車両91-93には、搭載され画像を撮影する車載カメラが搭載される。車両画像分析装置1は、車載カメラで撮影された画像の状況説明文を生成する。
なお、通信回線8は、有線、無線を問わず一般的な公衆回線網、例えば、「多数同時接続」、「超低遅延」を可能とした第5世代移動通信システム、いわゆる5G(5th Generation)を用いることができる。さらに5G以降の新しい携帯電話システムの特徴を活かすことで、オンライン(走行中のリアルタイム)での説明文生成などの効果も期待できる。
走行ログDB11は、各車両91-93からの計測データを以下のようにデータの種類別に保管する。
・車両の走行中や停車中に、車載カメラ(図示省略)で撮影した動画データである車両走行動画データ11A。
・車載GPS(Global Positioning System)データである車両走行GPSデータ11B。
・車載ECU(Electronic Control Unit)などから得られた車両走行ログデータとして、速度、加減速度、ステアリング角度などの車両の制御データである車両走行制御データ11C。
なお、GPSは衛星測位システムの一例である。
静止画データ111は、高速道路上を走行する各車両91-93で撮影された車両走行動画データ11Aから抽出されるデータの一例である。
車両画像分析装置1は、図2で説明した走行ログDB11に加え、説明文生成部12と、大規模言語モデル部13と、説明対象設定部14と、説明文DB(画像データベース)15と、検索部16と、入出力部17とを有する。説明対象設定部14は、要否テーブル14Aと、認識テーブル14Bとを有する。大規模言語モデル部13は、VQA(Visual Question Answer)部13Aと、要約生成部13Bとを有する。
なお、車両画像分析装置1内に記憶される各種データ(走行ログDB11と、要否テーブル14Aと、認識テーブル14B)は、車両画像分析装置1外の記憶装置(図示省略)に格納されており、その記憶装置からネットワークを介して車両画像分析装置1からアクセス可能に構成されていてもよい。
大規模言語モデル部13は、説明文生成部12によって呼び出される。大規模言語モデル部13は、質問文と回答文とのやり取りを行う自然言語の会話方式をインタフェースとするLAVIS(LAnguage VISion)などにより実現され、以下の処理部を有する。
・VQA部13Aは、画像に対する自然文での問い合わせに、自然文で回答する。そのため、VQA部13Aは、CNN(Convolutional Neural Network)などの画像認識モデルをあらかじめ学習データなどを用いて用意しておき、その画像認識モデルに対して問い合わせ文を入力することで、対応する画像の説明文を得る。
・要約生成部13Bは、入力された自然文(プロンプト)の内容を要約(複数の文章を統合)した要約文を、交通状況説明文として回答する。要約生成部13Bは、要約処理や翻訳処理などを行うテキスト生成AIのサービスとして、例えば、GPT-4、CLIP、BLIP、BLIP-2などの既存のサービスを用いてもよい。
・要否テーブル14A(図5)は、交通シーンごとに説明対象物を対応付けるとともに、個別の説明対象物についての説明文に言及するか否かの重要度合いを定義する。
・認識テーブル14B(図6)は、個別の説明対象物について、説明文で言及する詳細な内容を定義する。
説明文DB15は、説明文生成部12によって生成された走行状況説明文を保管する。
(処理1)カメラから受信した画像に写るシーンを特定し、特定したシーンごとにその画像内の対象物についての認識要否情報を要否テーブル14Aから読み取る。
(処理2)読み取った認識要否情報で認識が必要と指定された対象物を画像内から認識し、その認識結果から対象物ごとの説明文を生成する。
(処理3)特定したシーンと対象物ごとの説明文とをもとに画像の状況説明文を生成し、画像の状況説明文と画像とを対応付けて説明文DB15に記憶する。
例えば、交通シーン「高速道路」と、説明対象物「歩行者」との組み合わせは、「要/要」である。この「要/要」表記の左側の認識要否情報「要」は、画像から説明対象物を認識する必要があることを示す。また「要/要」表記の右側の説明要否情報「要」は、画像から認識した、あるいは認識しなかった説明対象物について、説明文で説明する必要があることを示す。
よって、交通シーン「一般道」では、歩行者の認識は「必要」であり、認識されなかった場合でも説明が「必要」と設定している。一方、交通シーン「一般道」では、横断歩道の認識は「必要」であるが、説明は不要である。
これにより、車両が走行している交通シーンに応じて、通常存在しないことが多い対象物については存在する場合のみ説明文を生成し、通常存在することが多い対象物については存在しない場合についても説明文が生成できる。そのため、より自然な交通状況説明文が生成でき、ユーザによる検索文に対する検索精度が向上するという効果がある。
例えば、VQA部13Aは、歩行者が認識された場合には、その場所、衣服の色、動作について分析する。
このように、説明文生成部12は、画像内の対象物についての詳細項目を認識テーブル14Bから読み取り、画像内から認識内の対象物についての読み取った詳細項目の説明文を、対象物ごとの説明文として生成する。これにより、説明対象物によって追加すべき情報を個別に設定することが可能となり、自然な交通状況説明文が生成できる。そのため、ユーザによる検索文に対する検索精度が向上する。
説明文生成部12は、画像説明文の生成処理(S21)として、車両走行動画データ11Aから抽出した静止画データ111に対して、VQA部13Aに画像分析を実行させることで画像説明文を生成する。静止画データ111の抽出処理は、例えば10秒おきなどの一定間隔での連続撮影画像を抽出したり、一動画ファイルから等時間間隔で10枚の画像を抽出したりする処理である。
つまり、説明文生成部12は、車両91の車載GPSから読み取ったGPSデータに基づいて、画像撮影時の時間帯の情報、および、画像撮影時の走行位置の情報のうちの少なくとも1つの情報に関する説明文を、画像の状況説明文に追加する。
つまり、説明文生成部12は、車両91の車載ECU(Electronic Control Unit)から読み取った車両走行制御データに基づいて、速度の情報、加減速度の情報、および、ステアリング角度の情報のうちの少なくとも1つの情報に関する説明文を、画像の状況説明文に追加する。
つまり、要約生成部13Bは、入力されたプロンプトに沿った要約文を生成する。そして、説明文生成部12は、状況説明文に含む情報、状況説明文から除外する情報、および、状況説明文の例文の情報をもとにした状況説明文の生成指示文と、対象物ごとの説明文とを含むプロンプトを要約生成部13Bに入力することで、画像の状況説明文を生成する。
車両画像分析装置1は、CPU901と、RAM902と、ROM903と、HDD904と、通信I/F905と、入出力I/F906と、メディアI/F907とを有するコンピュータ900として構成される。
通信I/F905は、外部の通信装置915と接続される。入出力I/F906は、入出力装置916と接続される。メディアI/F907は、記録媒体917からデータを読み書きする。さらに、CPU901は、RAM902に読み込んだプログラム(アプリケーションや、その略のアプリとも呼ばれる)を実行することにより、各処理部を改善制御する。そして、このプログラムは、通信回線を介して配布したり、CD-ROM等の記録媒体917に記録して配布したりすることも可能である。
説明文生成部12は、VQA部13Aに問い合わせることで、静止画データ111に写る交通シーンを分類する(S211)。VQA部13Aは、静止画データ111および交通シーンの問い合わせ文(例えば「このシーンはどこですか? 例えば、道路、高速道路、駐車場でしょうか?」の入力を受け、回答文(例えば、高速道路)を説明文生成部12に応答する(図12の行A01)。なお、説明文生成部12は、事前に管理者によって車両画像分析装置1に設定された交通シーンの問い合わせ文を読み込むので、車両画像分析装置1の利用者は、自身で交通シーンの問い合わせ文を生成する必要は無い。
以下、説明文生成部12は、S212~S217のループ処理について、要否テーブル14Aに登録されている説明対象物を順に選択して(歩行者、自転車、自動車、…)実行する。以下、今回のループ処理で選択された説明対象物を、選択対象物とする。
説明文生成部12は、選択対象物が静止画データ111内に存在するか否かを、大規模言語モデル部13のVQA部13Aに対して問い合わせる。この問い合わせ文は、例えば、「このシーンに歩行者はいますか?」である(図12の行A02)。説明文生成部12は、この問い合わせ文への回答文(対象物の認識結果)により、認識が必要と指定された対象物を画像内から認識する。この認識結果として、説明文生成部12は、選択対象物が静止画データ111内に存在するか否かを判定する(S213)。S213でYes(存在する)ならS214に進み、NoならS215に進む。
説明文生成部12は、以下のいずれかにより、選択対象物の説明文を生成する(S216)。
・S213でYesの場合、S214で取得した選択対象物についての詳細項目の問い合わせ文およびその回答文の組み合わせから、選択対象物の説明文を生成する。
・S213でNoの場合、選択対象物が静止画データ111内には認識されなかった旨の選択対象物の説明文を生成する(図18の行D07など)。
説明文生成部12は、今回の選択対象物の処理を終えたことで、すべての選択対象物に対する処理を完了したか否かを判定する(S217)。S217でYes(完了した)なら処理を終了し、Noなら未処理の選択対象物に切り替えてS212に戻る。
これにより、車両が走行している交通シーンに応じて注目および確認すべき周辺対象物に対する説明を含んだ自然な交通状況説明文が生成でき、ユーザによる検索文に対する検索精度が向上する。
説明文生成部12は、静止画データ111に写る交通シーンを分類する処理(図9のS211)の結果に応じて、以下のように交通シーン別の処理に分岐する(S301)。
・一般道の分類結果なら、一般道用の画像説明文を生成する(S302)。
・高速道路の分類結果なら、高速道路用の画像説明文を生成する(S303)。
・駐車場の分類結果なら、駐車場用の画像説明文を生成する(S304)。
・その他の分類結果なら、その他用として規定された画像説明文を生成する(S305)。
説明文生成部12は、交通シーン質問および回答文と(図9のS211)、信号の有無の質問および回答文を生成する(S311)。
説明文生成部12は、図9の判定処理(S213)として、画像内の歩行者有無を質問し(S312)、有りの時はS313に進み、無しの時はS314に進む。
説明文生成部12は、歩行者の詳細項目についての質問回答として(図9のS214)、歩行者の存在を示す回答文と、歩行者の場所質問および回答文と、歩行者の色質問および回答文と、歩行者の動作質問および回答文を生成する(S313)。
説明文生成部12は、歩行者が存在しないことを示す回答文を生成する(S314)。
説明文生成部12は、自動車の詳細項目についての質問回答として(図9のS214)、自動車の存在を示す回答文と、自動車の場所質問および回答文と、自動車の車種質問および回答文と、自動車の色質問および回答文と、自動車の動作質問および回答文を生成する(S316)。
説明文生成部12は、図9の判定処理(S213)として、画像内の自転車有無を質問し(S317)、有りの時はS318に進み、無しの時はS319に進む。
説明文生成部12は、自転車の詳細項目についての質問回答として(図9のS214)、自転車の存在を示す回答文と、自転車の場所質問および回答文と、自転車の色質問および回答文と、自転車の動作質問および回答文を生成する(S318)。
以上、図10では一般道用の画像説明文の生成処理を説明したが、他の交通シーン用の画像説明文を生成する処理(S303~S305)も、同様の処理である。
このテーブルは、行ごとに、質問文とその質問文への回答文との組み合わせにより、画像説明文が構成される。
例えば、行A01は、交通シーンを分類する処理(S211)の結果である。
行A02~行A04は、選択対象物が静止画データ111内に存在するか否かを判定する処理(S213)の結果である。
行A05~行A13は、選択対象物についての詳細項目を取得する処理(S214)の結果である。
説明文生成部12は、車両走行GPSデータ11Bから得られるGPS情報の時間帯に応じて、静止画データ111の撮影時刻を朝、昼、夕、夜などに分類した説明を生成する(S221)。
説明文生成部12は、車両走行GPSデータ11Bから得られるGPS情報の緯度経度に応じて、静止画データ111の撮影場所を、主要幹線道路や、都市名として特定した説明を生成する(S222)。
これにより、車両の走行時間帯および走行場所に関する情報を含んだ交通状況説明文が生成できる。そのため、ユーザによる検索文に対する検索精度が向上する。
説明文生成部12は、車両走行制御データ11Cから走行速度制御に関する説明文を生成する(S231)。説明文は、例えば、時速20km以下は低速、20km~60kmは中速、60km以降は高速などである。
説明文生成部12は、車両走行制御データ11Cから加減速制御に関する説明文を生成する(S232)。説明文は、例えば、一定以上の加速度の場合には加速状態、一定以上の減速度の場合は減速状態、それ以外は定速状態などである。
説明文生成部12は、車両走行制御データ11Cからステアリング制御に関する説明文を生成する(S233)。説明文は、例えば、一定以上の舵角の場合に左折状態、右折状態、それ以外の場合に直進状態などである。
これにより、車両の制御状態および挙動に関する説明を含んだ、より自然な交通状況説明文が生成できる。そのため、ユーザによる検索文に対する検索精度が向上するという効果がある。
行B01では、S221にて、時間帯の説明文が生成されている。
行B02では、S222にて、走行場所の説明文が生成されている。
行B03では、S231にて、走行速度の説明文が生成されている。
行B04では、S232にて、加減速状態の説明文が生成されている。
行B05では、S233にて、ステアリング状態の説明文が生成されている。
行C01には、交通状況説明文の生成指示が記載される。
行C02には、交通状況説明文に含む情報が記載される。
行C03には、交通状況説明文から除外する情報が記載される。
行C04には、交通状況説明文の例文が記載される。
(項目1)大規模言語モデル部13への指示文(図17)
(項目2)GPS説明文(図16の行B01、行B02)
(項目3)制御説明文(図16の行B03、行B04、行B05)
(項目4)画像説明文(図13)
交通状況説明文=「あなたは正午、首都高5号線を猛スピードで減速しながら直進しています。このシーンでは、高速道路にオレンジ色の実線の車線があります。さらに、あなたの前方の道路を白いトラックが前に向かって走っています。」
これにより、使用用途やユーザの好みに応じた自然な交通状況説明文を生成することにより、ユーザによる検索文に対する検索精度が向上する。
図18の画像説明文は、一般道を走行する車両から撮影された画像を対象とした。そのため、要否テーブル14Aでの一般道と歩行者との組み合わせが説明「要」なので、行D07において、「歩行者が認識されなかった」という情報が記載されている。
この図18の画像説明文を含むプロンプトから、走行状況説明文の生成処理(S24)により大規模言語モデル部13が生成した交通状況説明文は、以下の通りである。
交通状況説明文=「あなたは現在、夜の水戸市の市道を低速で安定した速度で走行し、左折の準備をしています。このシーンには歩行者はいません。」
図19は、検索部16の処理を示すフローチャートである。
検索部16は、説明文DB15に記憶された画像から、入力された検索文に合致する画像を検索する。具体的には、検索部16は、入力された検索文と、説明文DB15に記憶された状況説明文との類似度が高い画像を検索結果として出力する。
なお、検索部16は、「類似度が高い画像」として、例えば、検索結果の類似度が高い順に画像を列挙してその上位1番目からX番目までを出力としてもよいし(相対的な順位の類似判定)、類似度が事前に設定された基準値(閾値Y)よりも高い検索結果の画像を出力してもよい(絶対的な類似判定)。
以下、検索部16の処理の詳細を説明する。
検索部16は、ユーザからの検索文と、説明文DB15に格納された説明文との類似度を評価し(S62)、類似度が高い説明文に対応付けられている動画情報(画像情報)を説明文DB15から取得する。類似度評価には、文書ベクトル化に基づくコサイン類似度検索などを用いても良い。
つまり、検索部16は、類似度が高い画像に対応する状況説明文に含まれる情報をもとに、説明文DB15とは別のデータベースから取得した関連情報も、検索結果として出力してもよい。
検索部16は、S63の回答文を入出力部17へ送信する(S64)。
これにより、ユーザが入力した自然言語による検索文に類似した交通状況説明文を有する動画データを検索する場合、短時間で目的の動画を検索できる。
画像検索インターフェース71は、S61の検索文の入力欄である検索文入力部72と、S64の回答文の表示欄である検索結果表示部73とで構成される。検索結果表示部73には、複数の検索結果(シーンその1~その4)がアイコンまたはサムネイル画像として表示される。
・検索結果の画像731。
・画像731の状況説明文732は、検索文との類似度が高いものとして抽出されたものである。
・GPS説明文(時刻、場所)、制御説明文(車種、走行速度)、天気などの付加情報733。
これにより、ユーザは自然言語にて検索文を入力したうえで、検索文に類似する交通状況説明文および動画、関連情報を参照して動画を検索することによって、検索効率を向上できる。
また、上述した実施形態にかかる車両画像分析装置1の各構成要素は、それぞれのハードウェアがネットワークを介して互いに情報を送受信できるならば、いずれのハードウェアに実装されてもよい。また、ある処理部により実行される処理が、1つのハードウェアにより実現されてもよいし、複数のハードウェアによる分散処理により実現されてもよい。
8 通信回線
11 走行ログDB
11A 車両走行動画データ
11B 車両走行GPSデータ
11C 車両走行制御データ
12 説明文生成部
13 大規模言語モデル部
13A VQA部
13B 要約生成部
14 説明対象設定部
14A 要否テーブル
14B 認識テーブル
15 説明文DB(画像データベース)
16 検索部
17 入出力部
91-93 車両
100 画像説明システム
111 静止画データ
732,742 状況説明文
Claims (20)
- 作業者が自然言語で検索可能なデータベースと、
前記データベースへ文章を格納する処理部と、を有し、
前記処理部は、
画像分析及び自然言語での出力が可能な生成モデルがカメラの画像から認識したシーンを示すシーン情報を受け取り、
シーン毎に設定されたオブジェクトの説明要否に基づいて前記シーン情報に応じた画像説明文を生成し、
前記画像説明文を含むプロンプトを生成し、
前記プロンプトを前記生成モデルへ入力し、
前記生成モデルが前記プロンプトに応じて生成した状況説明文を受け取り、
前記状況説明文を前記画像と対応付けて、前記データベースへ格納することを特徴とする説明文生成システム。 - 請求項1に記載の説明文生成システムであって、
前記生成モデルは、言語モデルを含むことを特徴とする説明文生成システム。 - 請求項1に記載の説明文生成システムであって、
前記プロンプトは、前記説明要否、及び認識要否に基づいて生成されることを特徴とする説明文生成システム。 - 請求項1に記載の説明文生成システムであって、
前記処理部は、前記生成モデルに問い合わせ文を入力することで前記画像説明文を生成することを特徴とする説明文生成システム。 - 請求項1に記載の説明文生成システムであって、
前記プロンプトは、制御説明文を含むことを特徴とする説明文生成システム。 - 請求項1に記載の説明文生成システムであって、
前記プロンプトは、GPS説明文を含むことを特徴とする説明文生成システム。 - 請求項2に記載の説明文生成システムであって、
前記プロンプトは、前記説明要否、及び認識要否に基づいて生成されることを特徴とする説明文生成システム。 - 請求項7に記載の説明文生成システムであって、
前記処理部は、前記生成モデルに問い合わせ文を入力することで前記画像説明文を生成することを特徴とする説明文生成システム。 - 請求項8に記載の説明文生成システムであって、
前記プロンプトは、制御説明文を含むことを特徴とする説明文生成システム。 - 請求項9に記載の説明文生成システムであって、
前記プロンプトは、GPS説明文を含むことを特徴とする説明文生成システム。 - 処理部は、
画像分析及び自然言語での出力が可能な生成モデルがカメラの画像から認識したシーンを示すシーン情報を受け取り、
シーン毎に設定されたオブジェクトの説明要否に基づいて前記シーン情報に応じた画像説明文を生成し、
前記画像説明文を含むプロンプトを生成し、
前記プロンプトを前記生成モデルへ入力し、
前記生成モデルが前記プロンプトに応じて生成した状況説明文を受け取り、
前記状況説明文を前記画像と対応付けて、データベースへ格納することを特徴とする説明文データベースの生産方法。 - 請求項11に記載の説明文データベースの生産方法であって、
前記生成モデルは、言語モデルを含むことを特徴とする説明文データベースの生産方法。 - 請求項11に記載の説明文データベースの生産方法であって、
前記プロンプトは、前記説明要否、及び認識要否に基づいて生成されることを特徴とする説明文データベースの生産方法。 - 請求項11に記載の説明文データベースの生産方法であって、
前記処理部は、前記生成モデルに問い合わせ文を入力することで前記画像説明文を生成することを特徴とする説明文データベースの生産方法。 - 請求項11に記載の説明文データベースの生産方法であって、
前記プロンプトは、制御説明文を含むことを特徴とする説明文データベースの生産方法。 - 請求項11に記載の説明文データベースの生産方法であって、
前記プロンプトは、GPS説明文を含むことを特徴とする説明文データベースの生産方法。 - 請求項12に記載の説明文データベースの生産方法であって、
前記プロンプトは、前記説明要否、及び認識要否に基づいて生成されることを特徴とする説明文データベースの生産方法。 - 請求項17に記載の説明文データベースの生産方法であって、
前記処理部は、前記生成モデルに問い合わせ文を入力することで前記画像説明文を生成することを特徴とする説明文データベースの生産方法。 - 請求項18に記載の説明文データベースの生産方法であって、
前記プロンプトは、制御説明文を含むことを特徴とする説明文データベースの生産方法。 - 請求項19に記載の説明文データベースの生産方法であって、
前記プロンプトは、GPS説明文を含むことを特徴とする説明文データベースの生産方法。
Priority Applications (4)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP2023162954A JP7846656B2 (ja) | 2023-09-26 | 2023-09-26 | 説明文生成システム、および、説明文データベースの生産方法 |
| US18/795,614 US20250103626A1 (en) | 2023-09-26 | 2024-08-06 | Image explanation system, image analysis device, and image explanation method |
| CN202411076736.7A CN119722858A (zh) | 2023-09-26 | 2024-08-07 | 图像说明系统、图像分析装置和图像说明方法 |
| EP24198483.0A EP4530886A1 (en) | 2023-09-26 | 2024-09-04 | Image explanation system, image analysis device, and image explanation method |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP2023162954A JP7846656B2 (ja) | 2023-09-26 | 2023-09-26 | 説明文生成システム、および、説明文データベースの生産方法 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| JP2025053870A JP2025053870A (ja) | 2025-04-07 |
| JP7846656B2 true JP7846656B2 (ja) | 2026-04-15 |
Family
ID=92675824
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP2023162954A Active JP7846656B2 (ja) | 2023-09-26 | 2023-09-26 | 説明文生成システム、および、説明文データベースの生産方法 |
Country Status (4)
| Country | Link |
|---|---|
| US (1) | US20250103626A1 (ja) |
| EP (1) | EP4530886A1 (ja) |
| JP (1) | JP7846656B2 (ja) |
| CN (1) | CN119722858A (ja) |
Families Citing this family (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP7755363B1 (ja) * | 2024-10-18 | 2025-10-16 | 株式会社オプティム | 情報処理装置、方法、プログラム及びシステム |
Citations (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2024158436A (ja) | 2023-04-27 | 2024-11-08 | Lineヤフー株式会社 | 情報処理装置、プログラム、情報処理方法 |
| JP2025038912A (ja) | 2023-08-18 | 2025-03-21 | Lineヤフー株式会社 | 情報処理装置、情報処理方法及び情報処理プログラム |
| JP2025050370A (ja) | 2023-09-22 | 2025-04-04 | Base株式会社 | プログラム、情報処理装置、方法及びシステム |
Family Cites Families (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP7042167B2 (ja) * | 2018-06-13 | 2022-03-25 | 本田技研工業株式会社 | 車両制御装置、車両制御方法、およびプログラム |
-
2023
- 2023-09-26 JP JP2023162954A patent/JP7846656B2/ja active Active
-
2024
- 2024-08-06 US US18/795,614 patent/US20250103626A1/en active Pending
- 2024-08-07 CN CN202411076736.7A patent/CN119722858A/zh active Pending
- 2024-09-04 EP EP24198483.0A patent/EP4530886A1/en active Pending
Patent Citations (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2024158436A (ja) | 2023-04-27 | 2024-11-08 | Lineヤフー株式会社 | 情報処理装置、プログラム、情報処理方法 |
| JP2025038912A (ja) | 2023-08-18 | 2025-03-21 | Lineヤフー株式会社 | 情報処理装置、情報処理方法及び情報処理プログラム |
| JP2025050370A (ja) | 2023-09-22 | 2025-04-04 | Base株式会社 | プログラム、情報処理装置、方法及びシステム |
Also Published As
| Publication number | Publication date |
|---|---|
| CN119722858A (zh) | 2025-03-28 |
| JP2025053870A (ja) | 2025-04-07 |
| US20250103626A1 (en) | 2025-03-27 |
| EP4530886A1 (en) | 2025-04-02 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| KR102043588B1 (ko) | 자율 주행 차량 내에서 미디어 콘텐츠를 표시하기 위한 시스템 및 방법 | |
| US20210356968A1 (en) | Scenario identification for validation and training of machine learning based models for autonomous vehicles | |
| JP6310531B2 (ja) | 自律走行車において拡張仮想現実コンテンツを提供するシステム及び方法 | |
| CN111582189B (zh) | 交通信号灯识别方法、装置、车载控制终端及机动车 | |
| DE69933422T2 (de) | System und Verfahren zur Routenführung mit einem Navigationsanwendungsprogram | |
| CN106796610A (zh) | 信息提示装置、方法和计算机程序产品 | |
| JP6956232B2 (ja) | 探索システム、探索方法、および探索プログラム | |
| US11521113B2 (en) | System and method for unifying heterogenous datasets using primitives | |
| DE112020003963T5 (de) | Informationsverarbeitungsvorrichtung, informationsverarbeitungsverfahren und programm | |
| JP7846656B2 (ja) | 説明文生成システム、および、説明文データベースの生産方法 | |
| Raju et al. | Car-following properties of a commercial adaptive cruise control system: A pilot field test | |
| CN118152675A (zh) | 基于车辆的信息推送方法、装置、电子设备及存储介质 | |
| WO2025177679A1 (ja) | 文章生成システム、文章生成プログラム、および、報告書データベースの生産方法 | |
| Kiss | Manchurian artificial intelligence in autonomous vehicles | |
| Zahraoui et al. | Driver profiling: The pathway to deeper personalization | |
| CN117573919A (zh) | 车端音乐推荐方法、装置、设备及存储介质 | |
| Guo et al. | How will humans cut through automated vehicle platoons in mixed traffic environments? A simulation study of drivers’ gaze behaviors based on the dynamic areas of interest | |
| CN113704993B (zh) | 一种交通场景数字化方法 | |
| DE102023209381A1 (de) | Clusteranalyse von objekttrajektorien mit hybridem denken für maschinelles lernen | |
| CN115905468A (zh) | 检索方法、装置、计算机设备及存储介质 | |
| CN120406796A (zh) | 一种基于车载监控影像的任务执行方法、装置及电子设备 | |
| CN113954853A (zh) | 驾驶策略处理方法及装置 | |
| Ran et al. | Intelligent driving interface layout and design research | |
| CN121456014A (zh) | 基于车辆的can数据处理方法、装置、设备及存储介质 | |
| DE102024131831A1 (de) | Steuerung eines Kraftfahrzeugs |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20240229 |
|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20250217 |
|
| A621 | Written request for application examination |
Free format text: JAPANESE INTERMEDIATE CODE: A621 Effective date: 20250217 |
|
| A977 | Report on retrieval |
Free format text: JAPANESE INTERMEDIATE CODE: A971007 Effective date: 20251223 |
|
| A131 | Notification of reasons for refusal |
Free format text: JAPANESE INTERMEDIATE CODE: A131 Effective date: 20260106 |
|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20260225 |
|
| TRDD | Decision of grant or rejection written | ||
| A01 | Written decision to grant a patent or to grant a registration (utility model) |
Free format text: JAPANESE INTERMEDIATE CODE: A01 Effective date: 20260310 |
|
| A61 | First payment of annual fees (during grant procedure) |
Free format text: JAPANESE INTERMEDIATE CODE: A61 Effective date: 20260403 |
|
| R150 | Certificate of patent or registration of utility model |
Ref document number: 7846656 Country of ref document: JP Free format text: JAPANESE INTERMEDIATE CODE: R150 |