WO2025257979A1 - 装置及び方法 - Google Patents
装置及び方法Info
- Publication number
- WO2025257979A1 WO2025257979A1 PCT/JP2024/021361 JP2024021361W WO2025257979A1 WO 2025257979 A1 WO2025257979 A1 WO 2025257979A1 JP 2024021361 W JP2024021361 W JP 2024021361W WO 2025257979 A1 WO2025257979 A1 WO 2025257979A1
- Authority
- WO
- WIPO (PCT)
- Prior art keywords
- label
- text information
- site
- content
- information
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06T—IMAGE DATA PROCESSING OR GENERATION, IN GENERAL
- G06T1/00—General purpose image data processing
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06V—IMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
- G06V30/00—Character recognition; Recognising digital ink; Document-oriented image-based pattern recognition
- G06V30/10—Character recognition
Definitions
- Patent Document 1 describes a device that classifies captured images that include a board with information about the construction work.
- the device described in Patent Document 1 uses image recognition processing to obtain text information indicating information about the construction work from the board included in the captured image, and then classifies the captured image into categories corresponding to the information about the construction work based on the obtained text information.
- the purpose of this disclosure is to provide an apparatus and method that can efficiently classify on-site images.
- a device includes a reception unit that receives on-site images, a text acquisition unit that acquires corresponding text information indicating the content of the on-site images, and a prompt generation unit that generates prompts to be input into an assignment model that assigns labels to the on-site images based on at least one of the corresponding text information and corresponding labels that indicate the content of the on-site images generated based on the corresponding text information.
- a method includes the steps of accepting a site image, acquiring corresponding text information indicating the content of the site image, and generating a prompt to be input into an assignment model that assigns a label to the site image based on at least one of the corresponding text information and a corresponding label indicating the content of the site image generated based on the corresponding text information.
- on-site images can be efficiently classified.
- the labeling system receives site images, for example, from a user terminal of a construction worker.
- the labeling system acquires corresponding text information indicating the content of the site image using a text model that generates text information indicating the content of the input image.
- the labeling system also acquires sample labels and generates corresponding labels indicating the content of the site image based on the corresponding text information and the sample labels.
- the labeling system generates prompts based on at least one of the corresponding text information and the corresponding labels to be input into the assignment model that assigns labels to the site images.
- the labeling system according to this embodiment has the function of generating prompts. Therefore, the labeling system also functions as a prompt generation system that generates prompts.
- FIG. 3 is a flowchart showing an example of the operation of the labeling system 1.
- the following mainly describes a case where the labeling system 1 receives one site image and assigns a label to that one site image, but the labeling system 1 may also receive multiple site images and assign a label to each of the multiple site images. In other words, the labeling system 1 may receive at least one or more site images and assign a label to each of the at least one or more site images.
- step S12 the information acquisition unit 12 acquires construction-related information.
- This construction-related information is used when the text acquisition unit 13 acquires corresponding text information indicating the content of the site image in a later process.
- the construction-related information is various information related to the construction, and may be, for example, examples of structures or objects related to the construction, or examples of work or actions related to the construction.
- the construction-related information does not include information unrelated to the construction, such as an individual's posture and appearance characteristics, or landscape descriptions such as weather.
- the construction-related information includes, for example, at least one of information indicating the content of a construction status photo and information indicating the content of an as-built status control photo.
- Information indicating the content of a construction status photo may be, for example, "A gutter has been installed,” “An excavator is digging the soil,” or “An opening exists in the ground.”
- Information indicating the content of an as-built status control photo may be, for example, "A worker is using a tape measure to check dimensions,” “Checking the surface and finish of the concrete structure,” or “Checking the rebar arrangement, such as the number and spacing of assembled rebars.”
- the information acquisition unit 12 acquires construction-related information stored in the database 30.
- the information acquisition unit 12 may also acquire the construction-related information from the user terminal 20.
- the construction-related information is input into the user terminal 20 through an input operation by the user.
- the user terminal 20 transmits the input construction-related information to the device 10.
- the information acquisition unit 12 may acquire one or more pieces of construction-related information. In other words, the information acquisition unit 12 may acquire multiple pieces of construction-related information.
- the text acquisition unit 13 acquires corresponding text information indicating the content of the site image 60.
- the text acquisition unit 13 has a text model 131.
- the text acquisition unit 13 acquires the corresponding text information using the text model 131.
- the text model 131 is a model that generates text information indicating the content of an input image.
- the text model 131 accepts, for example, an image as input information, and outputs text information indicating the content of the image as output information.
- the text model 131 may be, for example, a generative AI model.
- the text acquisition unit 13, for example, inputs a site image to the text model 131, and acquires corresponding text information indicating the content of the site image generated in the text model 131.
- the text acquisition unit 13 acquires corresponding text information that includes not only the characters included in the work site image but also information indicating the content of the non-character parts. For example, when acquiring corresponding text information for the work site image 60 shown in FIG. 4, the text acquisition unit 13 acquires corresponding text information that includes not only the characters written on the blackboard 63 but also information indicating the content of the parts other than the blackboard 63. More specifically, the work site image 60 includes a portion P1 that shows two workers 61 installing a gutter 62. The text model 131 generates text information, for example, "A gutter is being installed," based on these non-character parts, and the text acquisition unit 13 acquires the text information generated by the text model 131 as corresponding text information.
- the text acquisition unit 13 may acquire text information indicating content related to the construction work contained in the site image as corresponding text information based on the construction-related information. For example, the text acquisition unit 13 generates candidate text information indicating the content of the site image, and acquires the candidate text information as corresponding text information based on the relevance between the candidate text information and the construction-related information.
- the text acquisition unit 13 may evaluate the generated candidate text information as text information indicating content related to construction.
- the text acquisition unit 13 may evaluate the relevance using a generative AI model.
- the trained model for evaluating the relevance or the generative AI model may be stored in the device 10, or may be stored in the server device 40 or another device connected to the communication network N.
- the label generation unit 15 sets the sample label as the corresponding label indicating the content of the on-site image.
- the process of setting this sample label as the corresponding label corresponds to the process of generating the corresponding label.
- step S16 the prompt generation unit 16 generates a prompt to be input to the assignment model 41 based on at least one of the corresponding text information and the corresponding label.
- the prompt is input to the assignment model 41 along with the site image to which the label is to be assigned.
- the assignment model 41 assigns a label to the site image based on the input prompt (generating a set of the site image and label).
- the label assigned to the site image by the assignment model 41 may be the corresponding label generated by the label generation unit 15, or may be a label newly generated by the assignment model 41.
- the prompt generation unit 16 generates a prompt so that it satisfies the conditions for a prompt that can be input to the assignment model 41.
- the conditions for the prompt are, for example, at least one of the number of tokens and the format (language, etc.).
- the prompt generation unit 16 includes in the prompt at least one of the corresponding text information acquired by the text acquisition unit 13 and the corresponding label generated by the label generation unit 15.
- the prompt generation unit 16 may include in the prompt an instruction for causing the annotation model 41 to generate a new label indicating the content of the construction site image based on the corresponding text information and to assign the generated label to the construction site image.
- the prompt generation unit 16 may generate a prompt as shown in FIG. 6.
- the prompt includes the instruction "Please assign a label to the input construction site image. Please generate the label based on the corresponding text information," and the corresponding text information "A gutter has been installed.”
- the prompt generation unit 16 may include in the prompt an instruction for causing the annotation model 41 to assign the corresponding text information included in the prompt to the construction site image.
- the prompt generation unit 16 may include in the prompt an instruction for causing the annotation model 41 to perform a process of generating a new label B3 by unifying the corresponding label B1 and the corresponding label B2 and assigning the unified label B3 to each of the on-site images A1 and A2.
- the unified label B3 may be the same as either the corresponding label B1 or the corresponding label B2.
- the annotation model 41 generates the same label as the corresponding label B1 as the unified label B3.
- the unified label may be a label different from the corresponding labels B1 and B2.
- the prompt generation unit 16 may include in the prompt the construction-related information acquired by the information acquisition unit 12.
- the prompt generation unit 16 may include in the prompt an instruction for causing the annotation model 41 to perform processing to assign only labels relevant to the construction-related information to the site image, without assigning labels unrelated to the construction-related information to the site image.
- the prompt generation unit 16 may include in the prompt an instruction for causing the annotation model 41 to perform processing to assign only labels relevant to the construction-related information to the site image, without assigning unrelated labels to the site image.
- the prompt generation unit 16 may include in the prompt an instruction for causing the annotation model 41 to generate a new label indicating the content of the site image based on the construction-related information and assign the generated label to the site image.
- the prompt generation unit 16 may include in the prompt the sample label acquired by the label acquisition unit 14.
- the prompt generation unit 16 may include in the prompt an instruction for causing the assignment model 41 to assign only labels that are relevant to the sample label to the site image, without assigning labels that are unrelated to the sample label to the site image.
- the prompt generation unit 16 may include in the prompt an instruction for causing the assignment model 41 to assign only labels that are relevant to the sample label to the site image, without assigning unrelated labels to the site image. This prevents the assignment of such a corresponding label to the site image, even if the label generation unit 15 generates a corresponding label that is unrelated to the sample label.
- the prompt generation unit 16 may include in the prompt an instruction for causing the assignment model 41 to generate a new label that indicates the content of the site image based on the sample label and assign the generated label to the site image.
- the prompt generation unit 16 may include in the prompt an instruction to cause the assignment model 41 to perform a process of generating a label of a predetermined number of characters (e.g., 15 characters or less).
- the prompt generation unit 16 may include in the prompt an instruction to cause the assignment model 41 to perform a process of determining the number of characters of the label depending on the content of the label to be generated. For example, if the content of the label generated by the assignment model 41 is distinctive compared to the sample labels or corresponding labels included in the prompt, the assignment model 41 may set the number of characters of the label with the distinctive content to a number greater than a predetermined number (e.g., approximately 30 characters).
- the assignment model 41 may determine whether the content of the label is distinctive, for example, based on whether the number of sample labels or corresponding labels with content identical to or similar to the target label is less than a predetermined number. If the number is small, the assignment model 41 may determine that the target label is distinctive.
- step S17 the assignment unit 17 assigns a label to the site image using the assignment model 41.
- the assignment unit 17 inputs the prompt generated by the prompt generation unit 16 and the site image as input information to the assignment model 41.
- the assignment model 41 assigns a label to the site image based on the input prompt and outputs the site image with the label assigned as output information.
- the assignment unit 17 acquires the site image labeled by the assignment model 41.
- the assignment unit 17 may assign a label to one or more site images.
- the assignment unit 17 may assign a label to each site image by inputting multiple site images together with the prompt to the assignment model 41.
- the assignment unit 17 may generate a file name for the site image based on a word or phrase of the label assigned to the site image.
- the assignment unit 17 may include a word or phrase of the label in the file name of the site image.
- the search unit 19 searches for a target site image from among the multiple stored site images.
- the search unit 19 may search for site images when it receives a search instruction from the user terminal 20.
- the search unit 19 searches for the target site image based on the labels assigned to the site images.
- the search unit 19 receives search keywords from the user terminal 20.
- the search unit 19 searches for site images assigned with labels associated with the keywords from among the multiple stored site images.
- the keywords used for the search may be the same as or different from the words in the label.
- the keywords may also be words that indicate the content of the label.
- the search unit 19 may identify labels associated with the keywords, for example, using a generative AI model.
- the search unit 19 may obtain the searched site image from the database 30 and transmit it to the user terminal 20. Multiple site images may be stored in the user terminal 20. In this case, the search unit 19 may transmit information for identifying the searched site image to the user terminal 20.
- the information for identifying the site image may be, for example, the file name of the site image.
- the device 10 includes a reception unit 11 that receives on-site images, a text acquisition unit 13 that acquires corresponding text information indicating the content of the on-site images, and a prompt generation unit 16 that generates prompts to be input to an assignment model 41 that assigns labels to the on-site images, based on at least one of the corresponding text information and the corresponding labels.
- a method for generating a prompt includes the steps of accepting an on-site image, acquiring corresponding text information indicating the content of the on-site image, and generating a prompt to be input into an assignment model that assigns a label to the on-site image based on at least one of the corresponding text information and the corresponding label.
- prompts input into an assignment model that assigns labels to site images are generated based on at least one of the corresponding text information and the corresponding label, and labels are assigned to the site images by inputting the generated prompts into the assignment model.
- the assignment model 41 e.g., a generative AI model
- the prompts input to the annotation model 41 which assigns labels to site images, are generated based on at least one of the corresponding text information and the corresponding labels. Therefore, a prompt that reflects the content of the site image input by the user, for example, is generated without the user having to generate the prompt themselves.
- site images to which labels have been assigned can be easily obtained.
- prompts can be generated efficiently without requiring advanced skills or a large amount of time. From this perspective, according to aspects of the present disclosure, site images can be classified efficiently.
- the text acquisition unit 13 acquires corresponding text information using a text model 131 that generates text information indicating the content of the input image. This allows for efficient acquisition of corresponding text information. As an example, by using the text model 131, it is possible to acquire information indicating the content of parts other than text contained in the on-site image, including it in the corresponding text information.
- the device 10 includes an information acquisition unit 12 that acquires construction-related information.
- the text acquisition unit 13 acquires text information indicating construction-related content contained in the site image as corresponding text information based on the construction-related information.
- the corresponding text information indicating construction-related content is used to generate prompts, making it possible to prevent labels with content unrelated to construction from being assigned to site images, for example.
- the text acquisition unit 13 generates candidate text information indicating the content of the site image and acquires the candidate text information as corresponding text information based on the relevance between the candidate text information and construction-related information. This makes it possible to prevent, for example, acquisition of corresponding text information with content unrelated to construction.
- the text acquisition unit 13 acquires corresponding text information that includes information indicating the content of the non-text parts included in the site image. This makes it possible to generate, for example, a prompt based on the corresponding text information to cause the assignment model 41 to perform a process of assigning labels to the site image relating to the content of the non-text parts included in the site image.
- the device 10 includes a label acquisition unit 14 that acquires sample labels, and a label generation unit 15 that generates corresponding labels based on the corresponding text information and the sample labels. This allows for efficient generation of corresponding labels.
- the label generation unit 15 generates corresponding labels based on the relevance of the corresponding text information and sample labels. This makes it possible to prevent the generation of corresponding labels with content unrelated to construction work, for example.
- the label generation unit 15 determines the number of characters in the corresponding label to be generated depending on the content of the corresponding label. This allows for the generation of a corresponding label with an appropriate number of characters depending on the content.
- the device 10 includes an assignment unit 17 that assigns labels to site images using the assignment model 41, and a storage unit 18 that stores the site images in corresponding directories based on the labels assigned to the site images by the assignment unit 17. This allows for more efficient classification of site images.
- the device and method disclosed herein have the following configuration:
- a reception unit that receives site images; a text acquisition unit that acquires corresponding text information indicating the content of the on-site image; a prompt generation unit that generates a prompt to be input to an assignment model that assigns a label to the on-site image based on at least one of the corresponding text information and a corresponding label that indicates the content of the on-site image and is generated based on the corresponding text information;
- An apparatus comprising:
- the device 10 may be configured to include hardware such as a microprocessor, a digital signal processor (DSP), an application-specific integrated circuit (ASIC), a programmable logic device (PLD), or a field-programmable gate array (FPGA), and some or all of the functional blocks may be realized by this hardware.
- the processor 1001 may be implemented using at least one of these pieces of hardware.
- Software shall be construed broadly to mean instructions, instruction sets, code, code segments, program code, programs, subprograms, software modules, applications, software applications, software packages, routines, subroutines, objects, executable files, threads of execution, procedures, functions, etc., whether referred to as software, firmware, middleware, microcode, hardware description language, or otherwise.
- radio resources may be indicated by an index.
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- General Physics & Mathematics (AREA)
- Theoretical Computer Science (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Multimedia (AREA)
- Processing Or Creating Images (AREA)
Abstract
本開示によれば、現場画像の分類を効率良く行うことができる。本開示の装置10は、現場画像を受け付ける受付部11と、現場画像の内容を示す対応テキスト情報を取得するテキスト取得部13と、現場画像に対してラベルを付与する付与モデル41に入力されるプロンプトを、対応テキスト情報及び対応ラベルの少なくともいずれかに基づいて生成するプロンプト生成部16と、を備える。
Description
本開示の一側面は、プロンプトを生成する装置及び方法に関する。
従来から工事現場を示す画像を分類するための技術が知られている。例えば特許文献1には、工事に関する情報が記載されたボードを含む状態で撮像された撮像画像を分類する装置が記載されている。特許文献1に記載された装置は、撮像画像に含まれるボードから工事に関する情報を示す文字情報を画像認識処理により取得し、取得された文字情報に基づいて、工事に関する情報に応じた区分で撮像画像を分類する。
しかしながら従来の装置は、ボードに記載された文字情報をそのまま利用して画像を分類するため、例えば、ボード間の記載に表記揺れが生じている場合には画像の分類が適切に行われないことがある。そのため、分類を適切に行うためのボードの準備(記載項目の検討、表記の統一等)に多くの時間及び労力が必要になり、効率良く画像を分類することができない場合がある。
本開示は、現場画像の分類を効率良く行うことができる装置及び方法を提供することを目的とする。
本開示の一側面に係る装置は、現場画像を受け付ける受付部と、現場画像の内容を示す対応テキスト情報を取得するテキスト取得部と、現場画像に対してラベルを付与する付与モデルに入力されるプロンプトを、対応テキスト情報及び対応テキスト情報に基づいて生成された現場画像の内容を示す対応ラベルの少なくともいずれかに基づいて生成するプロンプト生成部と、を備える。
本開示の一側面に係る方法は、現場画像を受け付けるステップと、現場画像の内容を示す対応テキスト情報を取得するステップと、現場画像に対してラベルを付与する付与モデルに入力されるプロンプトを、対応テキスト情報及び対応テキスト情報に基づいて生成された現場画像の内容を示す対応ラベルの少なくともいずれかに基づいて生成するステップと、を含む方法。
本開示の一側面によれば、現場画像の分類を効率良く行うことができる。
添付図面を参照しながら本開示の実施形態を説明する。可能な場合には、同一の部分には同一の符号を付して、重複する説明を省略する。
[システムの概要]
本実施形態に係るラベル付与システムは、現場画像に対してラベルを付与するためのコンピュータシステムである。現場画像に対してラベルを付与するとは、現場画像及びラベルのセット(ラベルが対応付けられた現場画像)を生成することである。
本実施形態に係るラベル付与システムは、現場画像に対してラベルを付与するためのコンピュータシステムである。現場画像に対してラベルを付与するとは、現場画像及びラベルのセット(ラベルが対応付けられた現場画像)を生成することである。
図1を参照してラベル付与システムの概要を説明する。以下に示す処理は、ラベル付与システムによって行われる処理の一例である。ラベル付与システムは、現場画像を例えば工事関係者のユーザ端末から受け付ける。ラベル付与システムは、入力された画像の内容を示すテキスト情報を生成する文章化モデルを用いて、現場画像の内容を示す対応テキスト情報を取得する。また、ラベル付与システムは、サンプルラベルを取得し、対応テキスト情報及びサンプルラベルに基づいて、現場画像の内容を示す対応ラベルを生成する。続いて、ラベル付与システムは、現場画像に対してラベルを付与する付与モデルに入力するためのプロンプトを対応テキスト情報及び対応ラベルの少なくともいずれかに基づいて生成する。上述したように、本実施形態に係るラベル付与システムは、プロンプトを生成する機能を有する。したがって、ラベル付与システムは、プロンプトを生成するプロンプト生成システムとしても機能する。
ラベル付与システムは、付与されたラベルに基づいて現場画像を対応するディレクトリに格納する。例えば、ラベル付与システムは、複数の現場画像のうち、同一又は類似のラベルが付された現場画像を同じディレクトリに格納する。
現場画像とは、工事現場又はその他の作業現場に関連する画像である。工事には、土木工事、建築工事、修理工事、改修工事、解体工事及びその他のあらゆる工事が含まれる。現場画像は、工事の進捗、安全管理、品質管理、法令遵守、資材の配置、及び機械の使用状況等の工事現場の状態を確認するために用いられてもよい。
現場画像は、例えば、工事着手前の現場を示す写真(着手前写真)、工事が完成した現場を示す写真(完成写真)、施工状況写真、安全管理写真、使用材料写真、品質管理写真、出来形管理写真、災害写真、事故写真、及びその他工事に関する情報(公害、環境、補償等)を示す写真を含む。現場画像は、国若しくは地域の法律、規制又は契約条件等の各種のルールに従って、国若しくは地方自治体の機関、又は工事の発注者等に提出されることがある。
工事が行われる過程において、複数の現場画像が工事の管理者等によって撮影される。撮影された現場画像のデータは、それぞれの内容に応じて、例えばデータベース又は工事関係者が使用するユーザ端末内に格納されてもよい。一例として、データベース及びユーザ端末には、現場画像を保存するためのディレクトリが用意されており、現場画像はその内容に応じて対応するディレクトリに格納される。ディレクトリは、画像を階層的に管理するための仮想的な場所である。ディレクトリは、例えば国土交通省の定める工事写真の分類に従った分類構造を有していてもよい。
工事関係者は、工事の監督、管理、実施、計画、設計、検査、又はその他の工事に関連する活動に直接的又は間接的に関係する者である。工事関係者は、例えば、工事の監督者、管理者、施工者、発注者、設計者又は検査官であってもよい。工事関係者は、個人、並びに団体、企業及びその他の組織を含む。
ラベルは、現場画像の内容を示す情報であり、現場画像に付与される(対応付けられる)。ラベルは、現場画像に含まれる工事に関連する内容を端的に示す語句又は文章を含んでいてもよい。一例として、ラベルは、例えば「側溝据付状況」、「掘削状況」、「配筋検査状況」及び「資材置場の整理整頓状況」等の工事に関連する語句であってもよい。ラベル付与システムは、1つの現場画像に対して1以上のラベルを付してもよい。すなわち、ラベル付与システムは、1つの現場画像に対して複数のラベルを付してもよい。現場画像に付与されるラベルの数は限定されない。
サンプルラベルは、現場画像に付与されるラベルの例示である。ラベル付与システムは、サンプルラベルに基づいて、対応ラベルを生成してもよい。サンプルラベルは、現場画像の内容を示す情報である。サンプルラベルは、現場画像に含まれる工事に関連する内容を端的に示す語句又は文章を含んでいてもよい。一例として、サンプルラベルは、例えば「側溝据付状況」、「掘削状況」、「配筋検査状況」及び「資材置場の整理整頓状況」等の工事に関連する語句であってもよい。
[システムの構成]
図2は、本実施形態に係るラベル付与システム1の装置構成を示す図である。ラベル付与システム1は、装置10を備えている。本実施形態に係る装置10は、RAG(Retrieval-Augmented Generation)システムである。装置10は、通信ネットワークNを介してユーザ端末20、データベース30及びサーバ装置40と接続する。通信ネットワークNの構成は限定されない。例えば、通信ネットワークNはインターネットを含んで構成されていてもよいし、イントラネットを含んで構成されていてもよい。
図2は、本実施形態に係るラベル付与システム1の装置構成を示す図である。ラベル付与システム1は、装置10を備えている。本実施形態に係る装置10は、RAG(Retrieval-Augmented Generation)システムである。装置10は、通信ネットワークNを介してユーザ端末20、データベース30及びサーバ装置40と接続する。通信ネットワークNの構成は限定されない。例えば、通信ネットワークNはインターネットを含んで構成されていてもよいし、イントラネットを含んで構成されていてもよい。
装置10は、機能的構成要素として受付部11、情報取得部12、テキスト取得部13、ラベル取得部14、ラベル生成部15、プロンプト生成部16、付与部17、格納部18及び検索部19を備えている。
受付部11は、ユーザ端末20において入力されたデータ及び情報等を受け付ける機能要素である。情報取得部12は、データベース30から工事関連情報を取得する機能要素である。工事関連情報は、テキスト取得部13が現場画像の内容を示す対応テキスト情報を取得する際に使用される情報である。工事関連情報の詳細は後述される。テキスト取得部13は、現場画像の内容を示す対応テキスト情報を取得する機能要素である。ラベル取得部14は、データベース30からサンプルラベルを取得する機能要素である。ラベル生成部15は、現場画像の内容を示す対応ラベルを生成する機能要素である。プロンプト生成部16は、付与モデル41に入力されるプロンプトを生成する機能要素である。付与部17は、現場画像に対してラベルを付与する機能要素である。格納部18は、現場画像を対応するディレクトリに格納する機能要素である。検索部19は、格納された複数の現場画像から対象の現場画像を検索する機能要素である。
ユーザ端末20は、ユーザにより用いられるコンピュータである。ユーザは、例えば工事関係者である。ユーザ端末20として用いられるコンピュータの種類は限定されない。ユーザ端末20は、例えば、パーソナルコンピュータ、高機能携帯電話機(スマートフォン)、携帯電話機、携帯情報端末(PDA)、タブレット端末、又はウェアラブル端末等の携帯端末であってもよい。ユーザ端末20の台数は限定されない。
データベース30は、ラベル付与システム1によって用いられるデータ及び情報を記憶する非一時的な記憶装置である。データベース30は、例えば、工事関連情報、サンプルラベル、及びラベルが付与された現場画像を記憶する。データベース30は、単一のデータベースとして構築されてもよいし、複数のデータベースの集合であってもよい。データベース30の設置場所は限定されない。データベース30は、例えば、ラベル付与システム1とは別のコンピュータシステム内に設けられてもよい。
サーバ装置40は、付与モデル41を備えている。本実施形態に係る付与モデル41は、例えば生成AIモデル(Generative Artificial Intelligence)である。生成AIモデルとは、入力情報を含むプロンプトの入力に応じて、プロンプトが示す指示、文脈、質問、及び出力形式のいずれか又は組合せに従ってコンテンツを生成して、そのコンテンツを返答情報として返すことができるモデルである。プロンプトは、生成AIモデルに対して入力される指示又は情報のセットである。このプロンプトは、生成AIモデルが特定のタスクを実行するための初期情報、パラメータ及び質問等を含むことができる。
生成AIモデルには、プロンプトとともに、画像データ、テキストデータ等の様々な種類の入力データを入力することが可能である。生成AIモデルは、例えば、テキスト生成AIモデル又は画像生成AIモデルであってもよい。生成AIモデルは、例えば、大規模言語モデル(LLM:Large Language Model)、及びユーザとの対話用のユーザインタフェース(UI)を含んで構成され、ユーザとテキストによるチャット、あるいは、音声によるチャットを可能にする対話型AIであってよい。このような生成AIモデルの例としては、ChatGPT、GPT(登録商標)-3.5、GPT-4V、PaLM2、等が挙げられる。生成AIモデルは、大規模言語モデルに限らず他のAIモデルを含んで構成されてもよい。
本実施形態に係る付与モデル41は、現場画像に対してラベルを付与する指示を含むプロンプト及び現場画像を入力情報として受け付け、ラベルが付与された現場画像を出力情報として出力することができる。付与モデル41は、装置10又はユーザ端末20に記憶されていてもよいし、装置10にネットワークを介して接続されたサーバ装置40以外の装置に記憶されていてもよい。
[システムの動作]
図3を参照して、ラベル付与システム1の動作の一例を説明する。具体的には、本実施形態に係るプロンプト生成方法、及び当該方法により生成されたプロンプトを用いて行われるラベル付与方法について説明する。プロンプト生成方法のプロセスは、ラベル付与方法のプロセスの一部ということができる。
図3を参照して、ラベル付与システム1の動作の一例を説明する。具体的には、本実施形態に係るプロンプト生成方法、及び当該方法により生成されたプロンプトを用いて行われるラベル付与方法について説明する。プロンプト生成方法のプロセスは、ラベル付与方法のプロセスの一部ということができる。
図3は、ラベル付与システム1の動作の一例を示すフローチャートである。以下、ラベル付与システム1が1枚の現場画像を受け付け、当該1枚の現場画像に対してラベルを付与する場合を主に説明するが、ラベル付与システム1は複数の現場画像を受け付け、複数の現場画像のそれぞれに対してラベルを付与してもよい。すなわち、ラベル付与システム1は、少なくとも1以上の現場画像を受け付け、少なくとも1以上の現場画像のそれぞれにラベルを付与してもよい。
ステップS11では、受付部11が現場画像を受け付ける。一例として、受付部11は、ユーザ端末20から現場画像を取得する。現場画像は、例えばユーザによって予め撮影されてユーザ端末20に記憶されていてもよい。ユーザ端末20は、ユーザの入力操作に基づいて、現場画像を装置10へと送信する。受付部11は、ユーザ端末20から送信された現場画像を受信する。他の例として、現場画像はデータベース30に記憶されており、受付部11はデータベース30から現場画像を取得してもよい。
図4は、現場画像の一例を示す図である。図4に示される現場画像60は、2人の作業員61が側溝62の据付作業を行っている場面を示す画像である。現場画像60には、黒板63が含まれている。黒板63には、工事の内容等が記載されている。黒板63は、例えば現場画像60が撮影される際に工事現場に配置される。図4に示される黒板63には、「工事名 道路改良工事」、「工種 側溝」、「位置 XYZ」、「側溝据付」の文字が記載されている。「位置 XYZ」は作業が行われている位置(測点)を示す情報である。黒板63には、工事に関する他の情報(施工者名等)が記載されていてもよい。現場画像に含まれる黒板は、工事現場に実際に配置された黒板でなくてもよく、現場画像に組み込まれた仮想的な黒板(例えば電子小黒板)の画像であってもよい。
ステップS12では、情報取得部12が工事関連情報を取得する。工事関連情報は、後の工程においてテキスト取得部13が現場画像の内容を示す対応テキスト情報を取得する際に使用される。工事関連情報は、工事に関連する各種の情報であり、例えば工事に関連する構造物若しくは物体、又は工事に関連する作業若しくは動作の例示であってもよい。工事関連情報には、例えば個人の姿勢及び外見の特徴、並びに天候等の風景描写といった工事に関連しない情報は含まれない。工事関連情報は、例えば、施工状況写真の内容を示す情報、及び出来形管理写真の内容を示す情報の少なくともいずれかを含む。施工状況写真の内容を示す情報は、例えば「側溝が据え付けられている」、「ショベルカーが土を掘っている」、又は「地面に開口が存在している」であってもよい。出来形管理写真の内容を示す情報は、例えば「作業員がメジャーを使って寸法を確認している」、「コンクリート構造物の表面や仕上がりを確認している」、又は「組み立てた鉄筋の本数や間隔などの鉄筋配置を確認している」であってもよい。
この例では、情報取得部12は、データベース30に記憶された工事関連情報を取得する。情報取得部12は、ユーザ端末20から工事関連情報を取得してもよい。この場合、ユーザの入力操作によりユーザ端末20において工事関連情報が入力される。ユーザ端末20は、入力された工事関連情報を装置10へと送信する。情報取得部12は、1以上の工事関連情報を取得してもよい。すなわち、情報取得部12は複数の工事関連情報を取得してもよい。
ステップS13では、テキスト取得部13が現場画像60の内容を示す対応テキスト情報を取得する。テキスト取得部13は、文章化モデル131を有する。テキスト取得部13は、文章化モデル131を用いて対応テキスト情報を取得する。文章化モデル131は、入力された画像の内容を示すテキスト情報を生成するモデルである。文章化モデル131は、例えば画像を入力情報として受け付け、画像の内容を示すテキスト情報を出力情報として出力する。文章化モデル131は、例えば生成AIモデルであってもよい。テキスト取得部13は、例えば、文章化モデル131に現場画像を入力し、文章化モデル131において生成された現場画像の内容を示す対応テキスト情報を取得する。
テキスト取得部13は、現場画像に含まれる文字だけではなく、文字以外の部分の内容を示す情報を含む対応テキスト情報を取得する。例えば、図4に示される現場画像60の対応テキスト情報を取得する場合、テキスト取得部13は、黒板63に記載された文字だけではなく、黒板63以外の部分の内容を示す情報を含む対応テキスト情報を取得する。より具体的には、現場画像60は、2人の作業員61が側溝62を据え付けている様子を示す部分P1を含んでいる。文章化モデル131は、このような文字以外の部分に基づいて、例えば「側溝が据え付けられている」というテキスト情報を生成し、テキスト取得部13は、文章化モデル131が生成したテキスト情報を対応テキスト情報として取得する。
ステップS13では、テキスト取得部13は工事関連情報に基づいて、現場画像に含まれる工事に関連する内容を示すテキスト情報を対応テキスト情報として取得してもよい。例えば、テキスト取得部13は、現場画像の内容を示す候補テキスト情報を生成し、候補テキスト情報及び工事関連情報の関連性に基づいて、候補テキスト情報を対応テキスト情報として取得する。
より具体的には、テキスト取得部13は、まず文章化モデル131を用いて現場画像の内容を示すテキスト情報(候補テキスト情報)を取得する。続いて、テキスト取得部13は、候補テキスト情報及び工事関連情報の関連性を評価する。テキスト取得部13は、テキスト情報及び工事関連情報の関連性を学習させた学習済みモデルを用いて、候補テキスト情報及び工事関連情報の関連性を評価してもよい。関連性は、例えば0.0以上1.0以下の数値(例えば尤度)によって示されてもよい。関連性を評価する学習済みモデルは、入力された候補テキスト情報及び工事関連情報の関連性が高い場合には1.0に近い(大きい)数値を算出(出力)し、候補テキスト情報及び工事関連情報の関連性が低い場合には0.0に近い(小さい)数値を算出する。例えば、文章化モデル131が現場画像60を受け付け、候補テキスト情報として「側溝が据え付けられている」という工事に関連する文章と、「作業員は男性である」という工事に関連しない文章とを生成したとする。この場合、関連性を評価する学習済みモデルは、「側溝が据え付けられている」という工事に関連する文章の関連性を示す数値を、「作業員は男性である」という工事に関連しない文章の関連性を示す数値よりも高く算出する。
テキスト取得部13は、候補テキスト情報及び工事関連情報の関連性が高い場合(例えば関連性を示す数値が所定の閾値を超えた場合)に、生成された候補テキスト情報を工事に関連する内容を示すテキスト情報と評価してもよい。テキスト取得部13は、生成AIモデルを用いて関連性を評価してもよい。関連性を評価する学習済みモデル、又は生成AIモデルは、装置10に記憶されていてもよいし、サーバ装置40又は通信ネットワークNに接続された他の装置に記憶されていてもよい。
他の例として、文章化モデル131が工事関連情報との関連性を考慮して工事に関連する内容を示すテキスト情報を生成してもよい。例えば、文章化モデル131は、現場画像及び工事関連情報を入力情報として受け付け、工事に関連する内容を示すテキスト情報(工事関連情報との関連性が高いテキスト情報)を出力情報として生成してもよい。テキスト取得部13は、生成された工事に関連する内容を示すテキスト情報を対応テキスト情報として取得する。
ステップS14では、ラベル取得部14がサンプルラベルを取得する。この例では、ラベル取得部14は、データベース30に記憶されたサンプルラベルを取得する。ラベル取得部14は、ユーザ端末20からサンプルラベルを取得してもよい。この場合、ユーザの入力操作によりユーザ端末20においてサンプルラベルが入力される。ユーザ端末20は、入力されたサンプルラベルを装置10へと送信する。ラベル取得部14は、1以上のサンプルラベルを取得してもよい。すなわち、ラベル取得部14は複数のサンプルラベルを取得してもよい。
ステップS15では、ラベル生成部15が対応テキスト情報及びサンプルラベルに基づいて、現場画像の内容を示す対応ラベルを生成してもよい。ラベル生成部15は、例えば対応テキスト情報及びサンプルラベルの関連性に基づいて対応ラベルを生成する。
より具体的には、ラベル生成部15は、まず対応テキスト情報及びサンプルラベルの関連性を評価する。ラベル生成部15は、テキスト情報及びサンプルラベルの関連性を学習させた学習済みモデルを用いて、対応テキスト情報及びサンプルラベルの関連性を評価してもよい。学習済みモデルは、例えば、入力された情報の意図又は文脈を解釈するモデル(意図解釈AI)であってもよい。関連性は、例えば0.0以上1.0以下の数値(例えば尤度)によって示されてもよい。関連性を評価する学習済みモデルは、入力された対応テキスト情報及びサンプルラベルの関連性が高い場合には1.0に近い(大きい)数値を算出(算出)し、対応テキスト情報及びサンプルラベルの関連性が低い場合には0.0に近い(小さい)数値を算出する。
図5は、対応テキスト情報及びサンプルラベルの関連性の例を示す図である。一例として、図5の上段に示されるように、ラベル生成部15が「側溝が据え付けられている」という対応テキスト情報と、「側溝据付状況」及び「掘削状況」という2つのサンプルラベルとに基づいて、対応ラベルを生成するとする。「側溝据付状況」のサンプルラベルは、側溝を据え付ける作業を示す語句である。そのため、「側溝据付状況」のサンプルラベル及び「側溝が据え付けられている」という対応テキスト情報の関連性は高い。一方で、「掘削状況」のサンプルラベルは、地面又は岩石を掘り進める作業を示す語句である。そのため、「掘削状況」のサンプルラベル及び「側溝が据え付けられている」という対応テキスト情報の関連性は低い。したがって、関連性を評価する学習済みモデルは、「側溝が据え付けられている」という対応テキスト情報及び「側溝据付状況」のサンプルラベルの関連性を示す数値(図5の例では0.70)を、「側溝が据え付けられている」という対応テキスト情報及び「掘削状況」のサンプルラベルの関連性を示す数値(図5の例では0.01)よりも高く算出する。
他の例として、図5の下段に示されるように、ラベル生成部15が「ショベルカーが土を掘っている」という対応テキスト情報と、「側溝据付状況」及び「掘削状況」という2つのサンプルラベルとに基づいて、対応ラベルを生成するとする。「側溝据付状況」のサンプルラベル及び「ショベルカーが土を掘っている」という対応テキスト情報の関連性は低い。一方で、「掘削状況」のサンプルラベルは、「ショベルカーが土を掘っている」という対応テキスト情報との関連性は高い。したがって、関連性を評価する学習済みモデルは、「ショベルカーが土を掘っている」という対応テキスト情報及び「掘削状況」のサンプルラベルの関連性を示す数値(図5の例では0.62)を、「ショベルカーが土を掘っている」という対応テキスト情報及び「側溝据付状況」のサンプルラベルの関連性を示す数値(図5の例では0.01)よりも高く算出する。
ラベル生成部15は、対応テキスト情報及びサンプルラベルの関連性が高い場合(例えば関連性を示す数値が所定の閾値を超えた場合)に、当該サンプルラベルを現場画像の内容を示す対応ラベルとする。このサンプルラベルを対応ラベルとする処理(対応ラベルを決定する処理)は、対応ラベルを生成する処理に対応する。
ラベル生成部15は、生成AIモデルを用いて対応テキスト情報及びサンプルラベルの関連性を評価してもよい。関連性を評価する学習済みモデル、又は生成AIモデルは、装置10に記憶されていてもよいし、サーバ装置40又は通信ネットワークNに接続された他の装置に記憶されていてもよい。
ラベル生成部15は、所定の文字数(例えば15文字以下)の対応ラベルを生成してもよい。ラベル生成部15は、対応ラベルの内容に応じて、生成する対応ラベルの文字数を決定してもよい。例えば、対応ラベルの内容がサンプルラベル又は生成された他の対応ラベルと比較して特徴的である場合、ラベル生成部15は、特徴的な内容の対応ラベルの文字数を所定の文字数よりも多い文字数(例えば30文字程度)にしてもよい。ラベル生成部15は、対象となる対応ラベルの内容が特徴的であるか否かの判断を、例えば、対象となる対応ラベルと同じ又は類似した内容のサンプルラベル又は生成された他の対応ラベルの数が所定の数よりも少ないか否かに基づいて行ってもよい。ラベル生成部15は、その数が少ない場合に、対象となる対応ラベルが特徴的であると判断してもよい。
ステップS16では、プロンプト生成部16が付与モデル41に入力されるプロンプトを対応テキスト情報及び対応ラベルの少なくともいずれかに基づいて生成する。プロンプトは、ラベルが付与される現場画像と共に付与モデル41に入力される。付与モデル41は、入力されたプロンプトに基づいて現場画像に対してラベルを付与する(現場画像及びラベルのセットを生成する)。付与モデル41が現場画像に付与するラベルは、ラベル生成部15が生成した対応ラベルであってもよいし、付与モデル41が新たに生成したラベルであってもよい。プロンプト生成部16は、付与モデル41に入力可能なプロンプトの条件を満たすようにプロンプトを生成する。プロンプトの条件とは、例えば、トークン数及び形式(言語等)の少なくともいずれかである。
プロンプト生成部16は、付与モデル41に対するラベル付与の指示をプロンプトに含める。ラベル付与の指示は、現場画像に対してラベルを付与する処理を付与モデル41に行わせるための指示である。ラベル付与の指示は、例えば「入力した現場画像に対してラベルを付与してください」という指示であってもよい。プロンプト生成部16は、一例として、生成AIモデル、又は他の学習済みモデルを用いてプロンプトを生成してもよい。プロンプト生成部16は、予めデータベース30等に記憶されたプロンプトのフォーマットを取得し、当該フォーマットを用いてプロンプトを生成してもよい。
プロンプト生成部16は、テキスト取得部13が取得した対応テキスト情報及びラベル生成部15が生成した対応ラベルの少なくともいずれかをプロンプトに含める。対応テキスト情報がプロンプトに含まれる場合、プロンプト生成部16は、対応テキスト情報に基づいて現場画像の内容を示す新たなラベルを生成し、生成したラベルを現場画像に付与する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。例えば、プロンプト生成部16は、図6に示されるようなプロンプトを生成してもよい。図6に示される例では、プロンプトは、「入力した工事現場画像に対してラベルを付与してください。ラベルは対応テキスト情報に基づいて生成してください。」という指示、及び「側溝が据え付けられている」という対応テキスト情報を含んでいる。プロンプト生成部16は、プロンプトに含まれる対応テキスト情報を現場画像に付与する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。
対応ラベルがプロンプトに含まれる場合、プロンプト生成部16は、対応ラベルを現場画像に付与する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。例えば、プロンプト生成部16は、図7に示されるようなプロンプトを生成してもよい。図7に示される例では、プロンプトは、「入力した工事現場画像に対して対応ラベルを付与してください。」という指示と、「側溝据付状況」という対応ラベルとを含んでいる。プロンプト生成部16は、対応ラベルに基づいて現場画像の内容を示す新たなラベルを生成し、生成したラベルを現場画像に付与する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。
プロンプトに対応テキスト情報が含まれる場合、プロンプト生成部16は、対応テキスト情報と関連性がないラベルを現場画像に付与することなく、対応テキスト情報と関連性があるラベルのみを現場画像に付与する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。例えば、仮に対応テキスト情報と関連性がないラベルがプロンプトに含まれている場合に、プロンプト生成部16は、関連性がないラベルを現場画像に付与することなく、対応テキスト情報と関連性があるラベルのみを現場画像に付与する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。これにより、仮にラベル生成部15が対応テキスト情報と関連性の無い対応ラベルを生成した場合であっても、そのような対応ラベルが現場画像に付与されることを防止することができる。
プロンプトに複数の対応ラベルが含まれる場合、プロンプト生成部16は、複数の対応ラベル間の表記揺れを考慮して統一した(例えば1つの)対応ラベルを生成し、現場画像に統一した対応ラベルを付与する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。例えば、プロンプトと共に2枚の現場画像(現場画像A1,A2)が付与モデル41に入力されるとする。現場画像A1の対応ラベルは対応ラベルB1であり、現場画像A2の対応ラベルは対応ラベルB2であり、対応ラベルB1,B2がプロンプトに含まれるとする。対応ラベルB1,B2は、互いに同一又は類似の内容を示すが、対応ラベルB1,B2との間に表記揺れがあるとする。例えば、図8に示されるように、対応ラベルB1は「側溝据付状況」であり、対応ラベルB2は「側溝の据え付け」であるとする。このとき、プロンプト生成部16は、対応ラベルB1及び対応ラベルB2を統一した新たなラベルB3を生成し現場画像A1,A2のそれぞれに統一したラベルB3を付与する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。統一したラベルB3は、対応ラベルB1及び対応ラベルB2のいずれかと同じラベルであってもよい。図8に示される例では、付与モデル41は、対応ラベルB1と同じラベルを統一したラベルB3として生成している。統一したラベルは、対応ラベルB1,B2とは異なるラベルであってもよい。
プロンプト生成部16は、情報取得部12が取得した工事関連情報をプロンプトに含めてもよい。プロンプト生成部16は、工事関連情報と関連性がないラベルを現場画像に付与することなく、工事関連情報と関連性があるラベルのみを現場画像に付与する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。例えば、工事関連情報と関連性がないラベルがプロンプトに含まれている場合に、プロンプト生成部16は、関連性がないラベルを現場画像に付与することなく、工事関連情報と関連性があるラベルのみを現場画像に付与する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。これにより、仮にラベル生成部15が工事関連情報と関連性の無い対応ラベルを生成した場合であっても、そのような対応ラベルが現場画像に付与されることを防止することができる。プロンプト生成部16は、工事関連情報に基づいて現場画像の内容を示す新たなラベルを生成し、生成したラベルを現場画像に付与する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。
プロンプト生成部16は、ラベル取得部14が取得したサンプルラベルをプロンプトに含めてもよい。プロンプト生成部16は、サンプルラベルと関連性がないラベルを現場画像に付与することなく、サンプルラベルと関連性があるラベルのみを現場画像に付与する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。例えば、サンプルラベルと関連性がないラベルがプロンプトに含まれている場合に、プロンプト生成部16は、関連性がないラベルを現場画像に付与することなく、サンプルラベルと関連性があるラベルのみを現場画像に付与する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。これにより、仮にラベル生成部15がサンプルラベルと関連性の無い対応ラベルを生成した場合であっても、そのような対応ラベルが現場画像に付与されることを防止することができる。プロンプト生成部16は、サンプルラベルに基づいて現場画像の内容を示す新たなラベルを生成し、生成したラベルを現場画像に付与する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。
プロンプト生成部16は、所定の文字数(例えば15文字以下)のラベルを生成する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。プロンプト生成部16は、生成するラベルの内容に応じて、ラベルの文字数を決定する処理を付与モデル41に行わせるための指示をプロンプトに含めてもよい。例えば、付与モデル41により生成されるラベルの内容がプロンプトに含まれるサンプルラベル又は対応ラベルと比較して特徴的である場合、付与モデル41は、特徴的な内容のラベルの文字数を所定の文字数よりも多い文字数(例えば30文字程度)にしてもよい。付与モデル41は、ラベルの内容が特徴的であるか否かの判断を、例えば、対象となるラベルと同じ又は類似した内容のサンプルラベル又は対応ラベルの数が所定の数よりも少ないか否かに基づいて行ってもよい。付与モデル41は、その数が少ない場合に、対象となるラベルが特徴的であると判断してもよい。
ステップS17では、付与部17が付与モデル41を用いて、現場画像に対してラベルを付与する。具体的には、付与部17は、プロンプト生成部16が生成したプロンプト、及び現場画像を入力情報として付与モデル41に入力する。付与モデル41は、入力されたプロンプトに基づいて現場画像に対してラベルを付与し、ラベルが付与された現場画像を出力情報として出力する。付与部17は、付与モデル41によってラベルが付された現場画像を取得する。付与部17は、1以上の現場画像に対してラベルを付与してもよい。例えば、付与部17は、複数の現場画像をプロンプトと共に付与モデル41に入力することにより、それぞれの現場画像にラベルを付与してもよい。付与部17は、現場画像に付与されたラベルの語句又は文章に基づいて、現場画像のファイル名を生成してもよい。例えば、付与部17は、ラベルの語句又は文章を現場画像のファイル名に含めてもよい。
ステップS18では、格納部18が現場画像に付与されたラベルに基づいて、現場画像を対応するディレクトリに格納する。一例として、データベース30及びユーザ端末20の少なくともいずれかに現場画像を保存するための複数のディレクトリが用意されていてもよい。格納部18は、現場画像に付与されたラベルに基づいて、現場画像を対応するディレクトリに格納する。複数の現場画像が格納される場合、格納部18は、複数の現場画像のうち、同一又は類似のラベルが付された現場画像を同じディレクトリに格納してもよい。例えば、格納部18は、「側溝据付状況」のラベルが付された複数の画像を同じディレクトリに格納する。
格納部18は、ラベル同士の類似性を学習させた学習済みモデル(以下、「判断モデル」という)を用いて、ラベル同士が同一又は類似であるか否かの判断を行ってもよい。判断モデルは、生成AIモデルであってもよい。判断モデルは、ラベルの表記揺れを考慮してラベル同士が同一又は類似であるか否かの判断を行ってもよい。例えば、ラベル同士が互い異なる語句を含んでいても、それぞれのラベルが互いに同一又は類似の内容を示すものである場合には、判断モデルは、これらのラベルを同一又は類似のラベルと判断してもよい。判断モデルは、装置10に記憶されていてもよいし、サーバ装置40又は通信ネットワークNに接続された他の装置に記憶されていてもよい。
ステップS19では、検索部19が格納された複数の現場画像から対象の現場画像を検索する。この例では、ラベルが付与された複数の現場画像が、データベース30に格納されているとする。検索部19は、ユーザ端末20から検索指示を受け付けた場合に、現場画像の検索を行ってもよい。検索部19は、現場画像に付与されたラベルに基づいて、対象の現場画像を検索する。例えば、検索部19は、ユーザ端末20から検索用のキーワードを受け付ける。続いて、検索部19は、キーワードと関連するラベルが付与された現場画像を、格納された複数の現場画像から検索する。検索に使用されるキーワードは、ラベルの語句と同じであってもよいし、異なっていてもよい。キーワードは、ラベルの内容を示す語句であってもよい。検索部19は、例えば生成AIモデルを用いて、キーワードと関連するラベルを特定してもよい。
検索部19は、検索した現場画像をデータベース30から取得し、ユーザ端末20に送信してもよい。複数の現場画像は、ユーザ端末20に格納されていてもよい。この場合、検索部19は、検索した現場画像を特定するための情報をユーザ端末20に送信してもよい。現場画像を特定するための情報は、例えば現場画像のファイル名であってもよい。
以上説明したように、本開示の一側面に係る装置10は、現場画像を受け付ける受付部11と、現場画像の内容を示す対応テキスト情報を取得するテキスト取得部13と、現場画像に対してラベルを付与する付与モデル41に入力されるプロンプトを、対応テキスト情報及び対応ラベルの少なくともいずれかに基づいて生成するプロンプト生成部16と、を備える。
本開示の一側面に係るプロンプトを生成するための方法は、現場画像を受け付けるステップと、現場画像の内容を示す対応テキスト情報を取得するステップと、現場画像に対してラベルを付与する付与モデルに入力されるプロンプトを、対応テキスト情報及び対応ラベルの少なくともいずれかに基づいて生成するステップと、を含む。
上述した本開示の側面においては、現場画像に対してラベルを付与する付与モデルに入力されるプロンプトが対応テキスト情報及び対応ラベルの少なくともいずれかに基づいて生成され、生成されたプロンプトを付与モデルに入力することにより現場画像に対してラベルが付与される。現場画像に対するラベルの付与が付与モデル41(例えば生成AIモデル)により行われることにより、表記揺れを吸収したラベルの付与等を行うことができる。したがって、例えば現場画像に含まれる黒板の事前準備(記載項目の検討、表記の統一等)及びラベル付与作業に、多くの時間及び労力をかけることなく、現場画像の分類を効率良く行うことができる。
また、例えば、生成AIモデル等のモデルを用いて現場画像にラベルを付与する場合において、適切なラベルが付与された現場画像をモデルに出力させるためには、ユーザはモデルに入力するプロンプトを適切に作成する必要がある。しかしながら、プロンプトの生成には高度なスキル及び多くの時間を要する場合がある。また、モデルに入力することができるプロンプトに条件(トークン数及び形式等)が存在していることがあり、それらの条件を踏まえてプロンプトを生成することは容易ではない。
上述した本開示の側面においては、現場画像に対してラベルを付与する付与モデル41に入力されるプロンプトが、対応テキスト情報及び対応ラベルの少なくともいずれかに基づいて生成される。したがって、ユーザ自身がプロンプトを生成することなく、例えばユーザによって入力された現場画像の内容を反映したプロンプトが生成される。生成されたプロンプトを付与モデル41に入力することにより、ラベルが付与された現場画像を容易に取得することができる。換言すると、高度なスキル及び多くの時間を用いることなく、プロンプトの生成を効率的に行うことができる。この観点からも、本開示の側面によれば、現場画像の分類を効率良く行うことができる。
テキスト取得部13は、入力された画像の内容を示すテキスト情報を生成する文章化モデル131を用いて、対応テキスト情報を取得する。これにより、対応テキスト情報を効率良く取得することができる。一例として、文章化モデル131を用いることにより、現場画像に含まれる文字以外の部分の内容を示す情報を対応テキスト情報に含めて取得することができる。
装置10は、工事関連情報を取得する情報取得部12を備える。テキスト取得部13は、工事関連情報に基づいて、現場画像に含まれる工事に関連する内容を示すテキスト情報を対応テキスト情報として取得する。これにより、工事に関連する内容を示す対応テキスト情報がプロンプトの生成に使用されるため、例えば工事に関連しない内容のラベルが現場画像に付与されることを抑制することができる。
テキスト取得部13は、現場画像の内容を示す候補テキスト情報を生成し、候補テキスト情報及び工事関連情報の関連性に基づいて、候補テキスト情報を対応テキスト情報として取得する。これにより、例えば、工事に関連しない内容の対応テキスト情報が取得されることを抑制することができる。
テキスト取得部13は、現場画像に含まれる文字以外の部分の内容を示す情報を含む対応テキスト情報を取得する。これにより、例えば、現場画像に含まれる文字以外の部分の内容に関するラベルを現場画像に付与する処理を付与モデル41に行わせるためのプロンプトを対応テキスト情報に基づいて生成することができる。
装置10は、サンプルラベルを取得するラベル取得部14と、対応テキスト情報及びサンプルラベルに基づいて、対応ラベルを生成するラベル生成部15とを備える。これにより、対応ラベルを効率良く生成することができる。
ラベル生成部15は、対応テキスト情報及びサンプルラベルの関連性に基づいて対応ラベルを生成する。これにより、例えば、工事に関連しない内容の対応ラベルが生成されることを抑制することができる。
ラベル生成部15は、対応ラベルの内容に応じて、生成する対応ラベルの文字数を決定する。これにより、内容に応じた適切な文字数の対応ラベルを生成することができる。
装置10は、付与モデル41を用いて、現場画像に対してラベルを付与する付与部17と、付与部17により現場画像に付与されたラベルに基づいて、現場画像を対応するディレクトリに格納する格納部18とを備える。これにより、現場画像の分類をより効率的に行うことができる。
本開示の装置および方法は、以下の構成を備える。
[1]
現場画像を受け付ける受付部と、
前記現場画像の内容を示す対応テキスト情報を取得するテキスト取得部と、
前記現場画像に対してラベルを付与する付与モデルに入力されるプロンプトを、前記対応テキスト情報及び前記対応テキスト情報に基づいて生成された前記現場画像の内容を示す対応ラベルの少なくともいずれかに基づいて生成するプロンプト生成部と、
を備える装置。
現場画像を受け付ける受付部と、
前記現場画像の内容を示す対応テキスト情報を取得するテキスト取得部と、
前記現場画像に対してラベルを付与する付与モデルに入力されるプロンプトを、前記対応テキスト情報及び前記対応テキスト情報に基づいて生成された前記現場画像の内容を示す対応ラベルの少なくともいずれかに基づいて生成するプロンプト生成部と、
を備える装置。
[2]
前記テキスト取得部は、入力された画像の内容を示すテキスト情報を生成する文章化モデルを用いて、前記対応テキスト情報を取得する、
[1]に記載の装置。
前記テキスト取得部は、入力された画像の内容を示すテキスト情報を生成する文章化モデルを用いて、前記対応テキスト情報を取得する、
[1]に記載の装置。
[3]
工事関連情報を取得する情報取得部を更に備え、
前記テキスト取得部は、前記工事関連情報に基づいて、前記現場画像に含まれる工事に関連する内容を示すテキスト情報を前記対応テキスト情報として取得する、
[1]又は[2]に記載の装置。
工事関連情報を取得する情報取得部を更に備え、
前記テキスト取得部は、前記工事関連情報に基づいて、前記現場画像に含まれる工事に関連する内容を示すテキスト情報を前記対応テキスト情報として取得する、
[1]又は[2]に記載の装置。
[4]
前記テキスト取得部は、前記現場画像の内容を示す候補テキスト情報を生成し、前記候補テキスト情報及び前記工事関連情報の関連性に基づいて、前記候補テキスト情報を前記対応テキスト情報として取得する、
[3]に記載の装置。
前記テキスト取得部は、前記現場画像の内容を示す候補テキスト情報を生成し、前記候補テキスト情報及び前記工事関連情報の関連性に基づいて、前記候補テキスト情報を前記対応テキスト情報として取得する、
[3]に記載の装置。
[5]
前記テキスト取得部は、前記現場画像に含まれる文字以外の部分の内容を示す情報を含む前記対応テキスト情報を取得する、
[1]から[4]のいずれかに記載の装置。
前記テキスト取得部は、前記現場画像に含まれる文字以外の部分の内容を示す情報を含む前記対応テキスト情報を取得する、
[1]から[4]のいずれかに記載の装置。
[6]
前記現場画像に付与されるラベルの例示であるサンプルラベルを取得するラベル取得部と、
前記対応テキスト情報及び前記サンプルラベルに基づいて、前記対応ラベルを生成するラベル生成部と、を更に備える、
[1]から[5]のいずれかに記載の装置。
前記現場画像に付与されるラベルの例示であるサンプルラベルを取得するラベル取得部と、
前記対応テキスト情報及び前記サンプルラベルに基づいて、前記対応ラベルを生成するラベル生成部と、を更に備える、
[1]から[5]のいずれかに記載の装置。
[7]
前記ラベル生成部は、前記対応テキスト情報及び前記サンプルラベルの関連性に基づいて前記対応ラベルを生成する、
[6]に記載の装置。
前記ラベル生成部は、前記対応テキスト情報及び前記サンプルラベルの関連性に基づいて前記対応ラベルを生成する、
[6]に記載の装置。
[8]
前記ラベル生成部は、前記対応ラベルの内容に応じて、生成する前記対応ラベルの文字数を決定する、
[6]又は[7]に記載の装置。
前記ラベル生成部は、前記対応ラベルの内容に応じて、生成する前記対応ラベルの文字数を決定する、
[6]又は[7]に記載の装置。
[9]
前記付与モデルを用いて、前記現場画像に対してラベルを付与する付与部と、
前記付与部により前記現場画像に付与された前記ラベルに基づいて、前記現場画像を対応するディレクトリに格納する格納部と、を更に備える、
[1]から[8]のいずれかに記載の装置。
前記付与モデルを用いて、前記現場画像に対してラベルを付与する付与部と、
前記付与部により前記現場画像に付与された前記ラベルに基づいて、前記現場画像を対応するディレクトリに格納する格納部と、を更に備える、
[1]から[8]のいずれかに記載の装置。
[10]
現場画像を受け付けるステップと、
前記現場画像の内容を示す対応テキスト情報を取得するステップと、
前記現場画像に対してラベルを付与する付与モデルに入力されるプロンプトを、前記対応テキスト情報及び前記対応テキスト情報に基づいて生成された前記現場画像の内容を示す対応ラベルの少なくともいずれかに基づいて生成するステップと、
を含む方法。
現場画像を受け付けるステップと、
前記現場画像の内容を示す対応テキスト情報を取得するステップと、
前記現場画像に対してラベルを付与する付与モデルに入力されるプロンプトを、前記対応テキスト情報及び前記対応テキスト情報に基づいて生成された前記現場画像の内容を示す対応ラベルの少なくともいずれかに基づいて生成するステップと、
を含む方法。
上記実施形態の説明に用いたブロック図は、機能単位のブロックを示している。これらの機能ブロック(構成部)は、ハードウェアおよびソフトウェアの少なくとも一方の任意の組み合わせによって実現される。また、各機能ブロックの実現方法は特に限定されない。すなわち、各機能ブロックは、物理的または論理的に結合した1つの装置を用いて実現されてもよいし、物理的または論理的に分離した2つ以上の装置を直接的または間接的に(例えば、有線、無線などを用いて)接続し、これら複数の装置を用いて実現されてもよい。機能ブロックは、上記1つの装置または上記複数の装置にソフトウェアを組み合わせて実現されてもよい。
機能には、判断、決定、判別、計算、算出、処理、導出、調査、探索、確認、受信、送信、出力、アクセス、解決、選択、選定、確立、比較、想定、期待、見做し、報知(broadcasting)、通知(notifying)、通信(communicating)、転送(forwarding)、構成(configuring)、再構成(reconfiguring)、割り当て(allocating、mapping)、割り振り(assigning)などがあるが、これらに限られない。たとえば、送信を機能させる機能ブロック(構成部)は、送信部(transmitting unit)や送信機(transmitter)と呼称される。いずれも、上述したとおり、実現方法は特に限定されない。
例えば、本開示の一実施の形態における装置10は、本開示のプロンプト生成方法の処理を行うコンピュータとして機能してもよい。図9は、本開示の一実施の形態に係る装置10のハードウェア構成の一例を示す図である。上述の装置10は、物理的には、プロセッサ1001、メモリ1002、ストレージ1003、通信装置1004、入力装置1005、出力装置1006、バス1007などを含むコンピュータ装置として構成されてもよい。
なお、以下の説明では、「装置」という文言は、回路、デバイス、ユニットなどに読み替えることができる。装置10のハードウェア構成は、図に示した各装置を1つまたは複数含むように構成されてもよいし、一部の装置を含まずに構成されてもよい。
装置10における各機能は、プロセッサ1001、メモリ1002などのハードウェア上に所定のソフトウェア(プログラム)を読み込ませることによって、プロセッサ1001が演算を行い、通信装置1004による通信を制御したり、メモリ1002およびストレージ1003におけるデータの読み出しおよび書き込みの少なくとも一方を制御したりすることによって実現される。
プロセッサ1001は、例えば、オペレーティングシステムを動作させてコンピュータ全体を制御する。プロセッサ1001は、周辺装置とのインターフェース、制御装置、演算装置、レジスタなどを含む中央処理装置(CPU:Central Processing Unit)によって構成されてもよい。例えば、上述の装置10の機能部(受付部11、情報取得部12、テキスト取得部13、ラベル取得部14、ラベル生成部15、プロンプト生成部16、付与部17、格納部18、検索部19)の少なくとも1つは、プロセッサ1001によって実現されてもよい。
また、プロセッサ1001は、プログラム(プログラムコード)、ソフトウェアモジュール、データなどを、ストレージ1003および通信装置1004の少なくとも一方からメモリ1002に読み出し、これらに従って各種の処理を実行する。プログラムとしては、上述の実施の形態において説明した動作の少なくとも一部をコンピュータに実行させるプログラムが用いられる。例えば、装置10の機能部の少なくとも1つは、メモリ1002に格納され、プロセッサ1001において動作する制御プログラムによって実現されてもよく、他の機能ブロックについても同様に実現されてもよい。上述の各種処理は、1つのプロセッサ1001によって実行される旨を説明してきたが、2以上のプロセッサ1001により同時または逐次に実行されてもよい。プロセッサ1001は、1以上のチップによって実装されてもよい。なお、プログラムは、電気通信回線を介してネットワークから送信されても良い。
メモリ1002は、コンピュータ読み取り可能な記録媒体であり、例えば、ROM(Read Only Memory)、EPROM(Erasable Programmable ROM)、EEPROM(Electrically Erasable Programmable ROM)、RAM(Random Access Memory)などの少なくとも1つによって構成されてもよい。メモリ1002は、レジスタ、キャッシュ、メインメモリ(主記憶装置)などと呼ばれてもよい。メモリ1002は、本開示の一実施の形態に係る同行判別方法を実施するために実行可能なプログラム(プログラムコード)、ソフトウェアモジュールなどを保存することができる。
ストレージ1003は、コンピュータ読み取り可能な記録媒体であり、例えば、CD-ROM(Compact Disc ROM)などの光ディスク、ハードディスクドライブ、フレキシブルディスク、光磁気ディスク(例えば、コンパクトディスク、デジタル多用途ディスク、Blu-ray(登録商標)ディスク)、スマートカード、フラッシュメモリ(例えば、カード、スティック、キードライブ)、フロッピー(登録商標)ディスク、磁気ストリップなどの少なくとも1つによって構成されてもよい。ストレージ1003は、補助記憶装置と呼ばれてもよい。上述の記憶媒体は、例えば、メモリ1002およびストレージ1003の少なくとも一方を含むデータベース、サーバその他の適切な媒体であってもよい。
通信装置1004は、有線ネットワークおよび無線ネットワークの少なくとも一方を介してコンピュータ間の通信を行うためのハードウェア(送受信デバイス)であり、例えばネットワークデバイス、ネットワークコントローラ、ネットワークカード、通信モジュールなどともいう。通信装置1004は、例えば周波数分割複信(FDD:Frequency Division Duplex)および時分割複信(TDD:Time Division Duplex)の少なくとも一方を実現するために、高周波スイッチ、デュプレクサ、フィルタ、周波数シンセサイザなどを含んで構成されてもよい。例えば、上述の装置10の機能部の少なくとも1つは、通信装置1004によって実現されてもよい。この通信装置1004は、送信部と受信部とで、物理的に、または論理的に分離された実装がなされてもよい。
入力装置1005は、外部からの入力を受け付ける入力デバイス(例えば、キーボード、マウス、マイクロフォン、スイッチ、ボタン、センサなど)である。出力装置1006は、外部への出力を実施する出力デバイス(例えば、ディスプレイ、スピーカー、LEDランプなど)である。なお、入力装置1005および出力装置1006は、一体となった構成(例えば、タッチパネル)であってもよい。
また、プロセッサ1001、メモリ1002などの各装置は、情報を通信するためのバス1007によって接続される。バス1007は、単一のバスを用いて構成されてもよいし、装置間ごとに異なるバスを用いて構成されてもよい。
また、装置10は、マイクロプロセッサ、デジタル信号プロセッサ(DSP:Digital Signal Processor)、ASIC(Application Specific Integrated Circuit)、PLD(Programmable Logic Device)、FPGA(Field Programmable Gate Array)などのハードウェアを含んで構成されてもよく、当該ハードウェアにより、各機能ブロックの一部または全てが実現されてもよい。例えば、プロセッサ1001は、これらのハードウェアの少なくとも1つを用いて実装されてもよい。
情報の通知は、本開示において説明した態様/実施形態に限られず、他の方法を用いて行われてもよい。例えば、情報の通知は、物理レイヤシグナリング(例えば、DCI(Downlink Control Information)、UCI(Uplink Control Information))、上位レイヤシグナリング(例えば、RRC(Radio Resource Control)シグナリング、MAC(Medium Access Control)シグナリング、報知情報(MIB(Master Information Block)、SIB(System Information Block)))、その他の信号またはこれらの組み合わせによって実施されてもよい。また、RRCシグナリングは、RRCメッセージと呼ばれてもよく、例えば、RRC接続セットアップ(RRC Connection Setup)メッセージ、RRC接続再構成(RRC Connection Reconfiguration)メッセージなどであってもよい。
本開示において説明した各態様/実施形態の処理手順、シーケンス、フローチャートなどは、矛盾の無い限り、順序を入れ替えてもよい。例えば、本開示において説明した方法については、例示的な順序を用いて様々なステップの要素を提示しており、提示した特定の順序に限定されない。
入出力された情報等は特定の場所(例えば、メモリ)に保存されてもよいし、管理テーブルを用いて管理してもよい。入出力される情報等は、上書き、更新、または追記され得る。出力された情報等は削除されてもよい。入力された情報等は他の装置へ送信されてもよい。
判別は、1ビットで表される値(0か1か)によって行われてもよいし、真偽値(Boolean:trueまたはfalse)によって行われてもよいし、数値の比較(例えば、所定の値との比較)によって行われてもよい。
本開示において説明した各態様/実施形態は単独で用いてもよいし、組み合わせて用いてもよいし、実行に伴って切り替えて用いてもよい。また、所定の情報の通知(例えば、「Xであること」の通知)は、明示的に行うものに限られず、暗黙的(例えば、当該所定の情報の通知を行わない)ことによって行われてもよい。
以上、本開示について詳細に説明したが、当業者にとっては、本開示が本開示中に説明した実施形態に限定されるものではないということは明らかである。本開示は、請求の範囲の記載により定まる本開示の趣旨および範囲を逸脱することなく修正および変更態様として実施することができる。したがって、本開示の記載は、例示説明を目的とするものであり、本開示に対して何ら制限的な意味を有するものではない。
ソフトウェアは、ソフトウェア、ファームウェア、ミドルウェア、マイクロコード、ハードウェア記述言語と呼ばれるか、他の名称で呼ばれるかを問わず、命令、命令セット、コード、コードセグメント、プログラムコード、プログラム、サブプログラム、ソフトウェアモジュール、アプリケーション、ソフトウェアアプリケーション、ソフトウェアパッケージ、ルーチン、サブルーチン、オブジェクト、実行可能ファイル、実行スレッド、手順、機能などを意味するよう広く解釈されるべきである。
また、ソフトウェア、命令、情報などは、伝送媒体を介して送受信されてもよい。例えば、ソフトウェアが、有線技術(同軸ケーブル、光ファイバケーブル、ツイストペア、デジタル加入者回線(DSL:Digital Subscriber Line)など)および無線技術(赤外線、マイクロ波など)の少なくとも一方を使用してウェブサイト、サーバ、または他のリモートソースから送信される場合、これらの有線技術および無線技術の少なくとも一方は、伝送媒体の定義内に含まれる。
本開示において説明した情報、信号などは、様々な異なる技術のいずれかを使用して表されてもよい。例えば、上記の説明全体に渡って言及され得るデータ、命令、コマンド、情報、信号、ビット、シンボル、チップなどは、電圧、電流、電磁波、磁界若しくは磁性粒子、光場若しくは光子、またはこれらの任意の組み合わせによって表されてもよい。
なお、本開示において説明した用語および本開示の理解に必要な用語については、同一のまたは類似する意味を有する用語と置き換えてもよい。例えば、チャネルおよびシンボルの少なくとも一方は信号(シグナリング)であってもよい。また、信号はメッセージであってもよい。また、コンポーネントキャリア(CC:Component Carrier)は、キャリア周波数、セル、周波数キャリアなどと呼ばれてもよい。
また、本開示において説明した情報、パラメータなどは、絶対値を用いて表されてもよいし、所定の値からの相対値を用いて表されてもよいし、対応する別の情報を用いて表されてもよい。例えば、無線リソースはインデックスによって指示されるものであってもよい。
上述したパラメータに使用する名称はいかなる点においても限定的な名称ではない。さらに、これらのパラメータを使用する数式等は、本開示で明示的に開示したものと異なる場合もある。様々なチャネル(例えば、PUCCH、PDCCHなど)および情報要素は、あらゆる好適な名称によって識別できるので、これらの様々なチャネルおよび情報要素に割り当てている様々な名称は、いかなる点においても限定的な名称ではない。
本開示においては、「移動局(MS:Mobile Station)」、「ユーザ端末(user terminal)」、「ユーザ装置(UE:User Equipment)」、「端末」などの用語は、互換的に使用され得る。
移動局は、当業者によって、加入者局、モバイルユニット、加入者ユニット、ワイヤレスユニット、リモートユニット、モバイルデバイス、ワイヤレスデバイス、ワイヤレス通信デバイス、リモートデバイス、モバイル加入者局、アクセス端末、モバイル端末、ワイヤレス端末、リモート端末、ハンドセット、ユーザエージェント、モバイルクライアント、クライアント、またはいくつかの他の適切な用語で呼ばれる場合もある。
本開示で使用する「判断(determining)」、「決定(determining)」という用語は、多種多様な動作を包含する場合がある。「判断」、「決定」は、例えば、判別(judging)、計算(calculating)、算出(computing)、処理(processing)、導出(deriving)、調査(investigating)、探索(looking up、search、inquiry)(例えば、テーブル、データベースまたは別のデータ構造での探索)、確認(ascertaining)した事を「判断」「決定」したとみなす事などを含み得る。また、「判断」、「決定」は、受信(receiving)(例えば、情報を受信すること)、送信(transmitting)(例えば、情報を送信すること)、入力(input)、出力(output)、アクセス(accessing)(例えば、メモリ中のデータにアクセスすること)した事を「判断」「決定」したとみなす事などを含み得る。また、「判断」、「決定」は、解決(resolving)、選択(selecting)、選定(choosing)、確立(establishing)、比較(comparing)などした事を「判断」「決定」したとみなす事を含み得る。つまり、「判断」「決定」は、何らかの動作を「判断」「決定」したとみなす事を含み得る。また、「判断(決定)」は、「想定する(assuming)」、「期待する(expecting)」、「みなす(considering)」などで読み替えられてもよい。
「接続された(connected)」、「結合された(coupled)」という用語、またはこれらのあらゆる変形は、2またはそれ以上の要素間の直接的または間接的なあらゆる接続または結合を意味し、互いに「接続」または「結合」された2つの要素間に1またはそれ以上の中間要素が存在することを含むことができる。要素間の結合または接続は、物理的なものであっても、論理的なものであっても、或いはこれらの組み合わせであってもよい。例えば、「接続」は「アクセス」で読み替えられてもよい。本開示で使用する場合、2つの要素は、1またはそれ以上の電線、ケーブルおよびプリント電気接続の少なくとも一つを用いて、並びにいくつかの非限定的かつ非包括的な例として、無線周波数領域、マイクロ波領域および光(可視および不可視の両方)領域の波長を有する電磁エネルギーなどを用いて、互いに「接続」または「結合」されると考えることができる。
本開示において使用する「に基づいて」という記載は、別段に明記されていない限り、「のみに基づいて」を意味しない。言い換えれば、「に基づいて」という記載は、「のみに基づいて」と「に少なくとも基づいて」の両方を意味する。
本開示において使用する「第1の」、「第2の」などの呼称を使用した要素へのいかなる参照も、それらの要素の量または順序を全般的に限定しない。これらの呼称は、2つ以上の要素間を区別する便利な方法として本開示において使用され得る。したがって、第1および第2の要素への参照は、2つの要素のみが採用され得ること、または何らかの形で第1の要素が第2の要素に先行しなければならないことを意味しない。
本開示において、「含む(include)」、「含んでいる(including)」およびそれらの変形が使用されている場合、これらの用語は、用語「備える(comprising)」と同様に、包括的であることが意図される。さらに、本開示において使用されている用語「または(or)」は、排他的論理和ではないことが意図される。
本開示において、例えば、英語でのa, anおよびtheのように、翻訳により冠詞が追加された場合、本開示は、これらの冠詞の後に続く名詞が複数形であることを含んでもよい。
本開示において、「AとBが異なる」という用語は、「AとBが互いに異なる」ことを意味してもよい。なお、当該用語は、「AとBがそれぞれCと異なる」ことを意味してもよい。「離れる」、「結合される」などの用語も、「異なる」と同様に解釈されてもよい。
1…ラベル付与システム、10…装置、11…受付部、12…情報取得部、13…テキスト取得部、14…ラベル取得部、15…ラベル生成部、16…プロンプト生成部、17…付与部、18…格納部、19…検索部、20…ユーザ端末、30…データベース、40…サーバ装置、41…付与モデル、60…現場画像、61…作業員、62…側溝、63…黒板、131…文章化モデル、1001…プロセッサ、1002…メモリ、1003…ストレージ、1004…通信装置、1005…入力装置、1006…出力装置、1007…バス、N…通信ネットワーク。
Claims (10)
- 現場画像を受け付ける受付部と、
前記現場画像の内容を示す対応テキスト情報を取得するテキスト取得部と、
前記現場画像に対してラベルを付与する付与モデルに入力されるプロンプトを、前記対応テキスト情報及び前記対応テキスト情報に基づいて生成された前記現場画像の内容を示す対応ラベルの少なくともいずれかに基づいて生成するプロンプト生成部と、
を備える装置。 - 前記テキスト取得部は、入力された画像の内容を示すテキスト情報を生成する文章化モデルを用いて、前記対応テキスト情報を取得する、
請求項1に記載の装置。 - 工事関連情報を取得する情報取得部を更に備え、
前記テキスト取得部は、前記工事関連情報に基づいて、前記現場画像に含まれる工事に関連する内容を示すテキスト情報を前記対応テキスト情報として取得する、
請求項1に記載の装置。 - 前記テキスト取得部は、前記現場画像の内容を示す候補テキスト情報を生成し、前記候補テキスト情報及び前記工事関連情報の関連性に基づいて、前記候補テキスト情報を前記対応テキスト情報として取得する、
請求項3に記載の装置。 - 前記テキスト取得部は、前記現場画像に含まれる文字以外の部分の内容を示す情報を含む前記対応テキスト情報を取得する、
請求項1に記載の装置。 - 前記現場画像に付与されるラベルの例示であるサンプルラベルを取得するラベル取得部と、
前記対応テキスト情報及び前記サンプルラベルに基づいて、前記対応ラベルを生成するラベル生成部と、を更に備える、
請求項1に記載の装置。 - 前記ラベル生成部は、前記対応テキスト情報及び前記サンプルラベルの関連性に基づいて前記対応ラベルを生成する、
請求項6に記載の装置。 - 前記ラベル生成部は、前記対応ラベルの内容に応じて、生成する前記対応ラベルの文字数を決定する、
請求項6に記載の装置。 - 前記付与モデルを用いて、前記現場画像に対してラベルを付与する付与部と、
前記付与部により前記現場画像に付与された前記ラベルに基づいて、前記現場画像を対応するディレクトリに格納する格納部と、を更に備える、
請求項1に記載の装置。 - 現場画像を受け付けるステップと、
前記現場画像の内容を示す対応テキスト情報を取得するステップと、
前記現場画像に対してラベルを付与する付与モデルに入力されるプロンプトを、前記対応テキスト情報及び前記対応テキスト情報に基づいて生成された前記現場画像の内容を示す対応ラベルの少なくともいずれかに基づいて生成するステップと、
を含む方法。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| PCT/JP2024/021361 WO2025257979A1 (ja) | 2024-06-12 | 2024-06-12 | 装置及び方法 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| PCT/JP2024/021361 WO2025257979A1 (ja) | 2024-06-12 | 2024-06-12 | 装置及び方法 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| WO2025257979A1 true WO2025257979A1 (ja) | 2025-12-18 |
Family
ID=98050338
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| PCT/JP2024/021361 Pending WO2025257979A1 (ja) | 2024-06-12 | 2024-06-12 | 装置及び方法 |
Country Status (1)
| Country | Link |
|---|---|
| WO (1) | WO2025257979A1 (ja) |
Citations (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2021140445A (ja) * | 2020-03-05 | 2021-09-16 | 株式会社トプコン | 情報処理装置、推論モデル構築方法、情報処理方法、推論モデル、プログラム、及び記録媒体 |
-
2024
- 2024-06-12 WO PCT/JP2024/021361 patent/WO2025257979A1/ja active Pending
Patent Citations (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2021140445A (ja) * | 2020-03-05 | 2021-09-16 | 株式会社トプコン | 情報処理装置、推論モデル構築方法、情報処理方法、推論モデル、プログラム、及び記録媒体 |
Non-Patent Citations (1)
| Title |
|---|
| HIYOSHI KEI: "AI Challenge Day Participation Report! ! Challenging RAG implementation for image data!", SOFTBANK, 7 June 2024 (2024-06-07), pages 1 - 23, XP093381513, Retrieved from the Internet <URL:https://www.softbank.jp/biz/blog/cloud-technology/articles/202406/image-rag/> DOI: 10.2472/jsms.64.1054 * |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN113204345B (zh) | 页面生成方法、装置、电子设备及存储介质 | |
| CN110109840A (zh) | 基于版本号比较的代码审计方法、审计装置及介质 | |
| US20070112825A1 (en) | Meta-data tags used to describe data behaviors | |
| CN110895534B (zh) | 一种数据拼接方法、装置、介质及电子设备 | |
| CN113872691A (zh) | 光缆自动监测管理系统、方法、计算机设备及存储介质 | |
| US9009652B2 (en) | Method and system for handling software design conflicts | |
| CN111563257A (zh) | 数据检测方法及装置、计算机可读介质及终端设备 | |
| CN111723134A (zh) | 信息处理方法、装置、电子设备及存储介质 | |
| CN110442519A (zh) | 一种崩溃文件处理方法、装置、电子设备及存储介质 | |
| CN109672722B (zh) | 数据部署方法及装置、计算机存储介质和电子设备 | |
| CN108875044B (zh) | 联系人搜索方法、装置、存储介质及电子设备 | |
| CN115309649A (zh) | 测试用例生成方法、装置、计算机设备及存储介质 | |
| CN112948264A (zh) | 测试任务的执行方法及装置、系统、存储介质、电子装置 | |
| CN112052005A (zh) | 界面处理方法、装置、设备及存储介质 | |
| CN110619061A (zh) | 一种视频分类方法、装置、电子设备及可读介质 | |
| KR102004145B1 (ko) | 콘텐츠 추천 방법 및 장치 | |
| CN111488464A (zh) | 实体属性处理方法、装置、设备及介质 | |
| CN115640790A (zh) | 信息处理方法、装置和电子设备 | |
| US11675683B2 (en) | Method, electronic device, and computer program product for monitoring storage system | |
| CN112883127B (zh) | 一种道路数据处理方法、装置、电子设备和介质 | |
| CN104239212A (zh) | 测试用例的查询方法及装置、测试用例的建立方法及装置 | |
| CN111930891A (zh) | 基于知识图谱的检索文本扩展方法及相关装置 | |
| CN119149558A (zh) | 分布式数据库分片键更新方法、装置、设备和介质 | |
| JP7719199B2 (ja) | ドキュメント処理方法、装置、機器及び媒体 | |
| CN106302011A (zh) | 基于多端的测试方法及终端 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| 121 | Ep: the epo has been informed by wipo that ep was designated in this application |
Ref document number: 24943342 Country of ref document: EP Kind code of ref document: A1 |