WO2024134841A1 - 文生成学習装置、文生成装置、文生成学習方法及びプログラム - Google Patents

文生成学習装置、文生成装置、文生成学習方法及びプログラム Download PDF

Info

Publication number
WO2024134841A1
WO2024134841A1 PCT/JP2022/047446 JP2022047446W WO2024134841A1 WO 2024134841 A1 WO2024134841 A1 WO 2024134841A1 JP 2022047446 W JP2022047446 W JP 2022047446W WO 2024134841 A1 WO2024134841 A1 WO 2024134841A1
Authority
WO
WIPO (PCT)
Prior art keywords
sentence
input
information
model
output
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
PCT/JP2022/047446
Other languages
English (en)
French (fr)
Inventor
涼太 田中
京介 西田
邦子 齋藤
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
NTT Inc
Original Assignee
Nippon Telegraph and Telephone Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Nippon Telegraph and Telephone Corp filed Critical Nippon Telegraph and Telephone Corp
Priority to JP2024565512A priority Critical patent/JPWO2024134841A1/ja
Priority to PCT/JP2022/047446 priority patent/WO2024134841A1/ja
Publication of WO2024134841A1 publication Critical patent/WO2024134841A1/ja
Anticipated expiration legal-status Critical
Ceased legal-status Critical Current

Links

Images

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N20/00Machine learning

Definitions

  • the present invention has been made in consideration of the above points, and aims to enable the generation of sentences based on multiple document images.
  • the program that realizes the processing in the sentence generation device 10 is provided by a recording medium 101 such as a CD-ROM.
  • a recording medium 101 such as a CD-ROM.
  • the program is installed from the recording medium 101 via the drive device 100 into the auxiliary storage device 102.
  • the program does not necessarily have to be installed from the recording medium 101, but may be downloaded from another computer via a network.
  • the auxiliary storage device 102 stores the installed program as well as necessary files, data, etc.
  • FIG. 2 is a diagram showing an example of the functional configuration of the sentence generation device 10 (sentence generation learning device) during learning in an embodiment of the present invention.
  • the sentence generation device 10 has a text extraction unit 11, an object extraction unit 12, a learning unit 13, a sentence generation model m1, etc. These units and the sentence generation model m1 are realized by processing in which one or more programs installed in the sentence generation device 10 are executed by the processor 104.
  • the sentence generation device 10 also uses a learning data storage unit 121.
  • the learning data storage unit 121 can be realized, for example, by using the auxiliary storage device 102, or a storage device that can be connected to the sentence generation device 10 via a network, etc.
  • N sets (learning data) of a question sentence, a set of document images, a correct answer sentence (correct answer sentence or correct answer evidence page number sequence), a task name, and a page number sequence are prepared, and two sets of learning data with different task names are prepared for each set.
  • 2 x N pieces of learning data are prepared.
  • the correct answer sentence for the learning data with the task name "Question Answering" is the correct answer sentence
  • the correct answer sentence for the learning data with the task name "Evidence Selection” is the correct answer evidence page number sequence.
  • the document text rectangular area is the top left and bottom right coordinates of the rectangular area for each word recognized by character recognition on the document image.
  • the document text sequence is a sequence of words recognized in (extracted from) a document image.
  • the document text sequence is a sequence of words in which each piece of text has been rearranged in left-to-right, top-to-down order according to the coordinates of the document text rectangular area in which each word was recognized in the document image.
  • Any method may be used to obtain the document text sequence and the document text rectangular area, as long as it is capable of outputting a word sequence and a word rectangular area from a document image.
  • the Google (registered trademark) Vision API in Reference 1 may be used.
  • the bibliographic information for each reference is described below.
  • the text extraction unit 11 detects areas containing text in each document image included in the document image set of the target learning data, recognizes the text in the detected areas, and outputs text information in the document image (S102).
  • e seg k is a D-dimensional vector embedding according to the segments (information indicating which object region the tokens in each page belong to) in the input token sequence x k .
  • the learning unit 13 updates the model parameters of the sentence generation model m1 (encoder unit mE and decoder unit mD) to minimize the loss (S107).
  • Memory at least one processor coupled to the memory; Including, The processor, a model trained based on an estimation result of an output sequence output from a model that receives as input first information extracted from each of a first plurality of document images, first constraint information related to sentence generation based on the first information, and each page number of the first plurality of document images, and a correct output sequence for the input, generates an output sequence according to the second plurality of document images and the second constraint information based on an output from the model when second information extracted from each of a second plurality of document images, second constraint information related to sentence generation based on the second information, and each page number of the second plurality of document images are input;
  • a sentence generation device comprising:

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Software Systems (AREA)
  • Data Mining & Analysis (AREA)
  • Evolutionary Computation (AREA)
  • Medical Informatics (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Physics & Mathematics (AREA)
  • Computing Systems (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Mathematical Physics (AREA)
  • Artificial Intelligence (AREA)
  • Machine Translation (AREA)

Abstract

文生成学習装置は、複数の文書画像のそれぞれが含む情報と、前記情報に基づく文の生成に関する制約情報と、前記複数の文書画像のそれぞれのページ番号とを入力として受け付けたモデルから出力される出力系列の推定結果と、前記入力に対する正解の出力系列とに基づいて前記モデルを学習するように構成されている学習部、を有することで、複数の文書画像に基づく文の生成を可能とする。

Description

文生成学習装置、文生成装置、文生成学習方法及びプログラム
 本発明は、文生成学習装置、文生成装置、文生成学習方法及びプログラムに関する。
 質問テキストと、テキストを含む文書画像とを入力として、当該画像の内容に基づいて当該質問に対する回答テキストを生成する質問応答技術がある(例えば、非特許文献1、非特許文献2)。これらの従来技術では、学習データを{文書画像,質問文,回答文}の3つ組とし、まず、文書画像から、テキスト抽出及び文書領域(Title、Paragraph、Captionなど)が抽出され、テキストと文書画像における文書領域の座標・視覚情報(視覚によって確認できる情報)とが獲得される。そして、獲得された情報及び与えられた質問文を入力とし、回答の生成を行うように学習が行われる。
Powalski Rafal', Borchmann L'ukasz(l'は、lにクレスカを示し、L'は、Lにクレスカを示す。), Jurkiewicz Dawid, Dwojak Tomasz, Pietruszka Michal', Pal'ka Gabriela: Going Full-TILT Boogie on Document Understanding with Text-Image-Layout Transformer. ICDAR21 Ryota Tanaka, Kyosuke Nishida, Sen Yoshida: VisualMRC: Machine Reading Comprehension on Document Images. AAAI21
 例えば、「2013年におけるN社の携帯会社におけるモバイルビジネスシェアはどのくらいですか?」という質問を考える。また、「N社の携帯会社」が「ND社」であることを理解するために必要なページAに対応する文書画像と、「2013年における様々な企業のモバイルビジネスシェア」が記載された、ページAとは別のページBに対応する文書画像があるとする。この例の場合、どちらか一方のページ(文書画像)を参照しても、質問文を理解すること(つまり、質問文に対する回答文を導出すること)は困難であり、これらのページ間(文書画像間)の関係性を考慮する必要がある。しかし、従来技術では、一枚の文書画像が入力されることを想定されており、複数枚の文書画像集合が入力することは考慮されていない。
 本発明は、上記の点に鑑みてなされたものであって、複数の文書画像に基づく文の生成を可能とすることを目的とする。
 そこで上記課題を解決するため、文生成学習装置は、複数の文書画像のそれぞれが含む情報と、前記情報に基づく文の生成に関する制約情報と、前記複数の文書画像のそれぞれのページ番号とを入力として受け付けたモデルから出力される出力系列の推定結果と、前記入力に対する正解の出力系列とに基づいて前記モデルを学習するように構成されている学習部、を有する。
 複数の文書画像に基づく文の生成を可能とすることができる。
本発明の実施の形態における文生成装置10のハードウェア構成例を示す図である。 本発明の実施の形態における学習時の文生成装置10(文生成学習装置)の機能構成例を示す図である。 文書画像集合、質問文、正解文の一例を示す図である。 学習時において文生成装置10が実行する処理手順の一例を説明するためのフローチャートである。 学習時の文生成モデルm1を説明するための図である。 本発明の実施の形態における推論時の文生成装置10の機能構成例を示す図である。 推論時において文生成装置10が実行する処理手順の一例を説明するためのフローチャートである。 推論時の文生成モデルm1を説明するための図である。
 以下、図面に基づいて本発明の実施の形態を説明する。図1は、本発明の実施の形態における文生成装置10のハードウェア構成例を示す図である。図1の文生成装置10は、それぞれバスBで相互に接続されているドライブ装置100、補助記憶装置102、メモリ装置103、プロセッサ104、及びインタフェース装置105等を有する。
 文生成装置10での処理を実現するプログラムは、CD-ROM等の記録媒体101によって提供される。プログラムを記憶した記録媒体101がドライブ装置100にセットされると、プログラムが記録媒体101からドライブ装置100を介して補助記憶装置102にインストールされる。但し、プログラムのインストールは必ずしも記録媒体101より行う必要はなく、ネットワークを介して他のコンピュータよりダウンロードするようにしてもよい。補助記憶装置102は、インストールされたプログラムを格納すると共に、必要なファイルやデータ等を格納する。
 メモリ装置103は、プログラムの起動指示があった場合に、補助記憶装置102からプログラムを読み出して格納する。プロセッサ104は、CPU若しくはGPU(Graphics Processing Unit)、又はCPU及びGPUであり、メモリ装置103に格納されたプログラムに従って文生成装置10に係る機能を実行する。インタフェース装置105は、ネットワークに接続するためのインタフェースとして用いられる。
 図2は、本発明の実施の形態における学習時の文生成装置10(文生成学習装置)の機能構成例を示す図である。図2において、文生成装置10は、テキスト抽出部11、物体抽出部12、学習部13及び文生成モデルm1等を有する。これら各部及び文生成モデルm1は、文生成装置10にインストールされた1以上のプログラムが、プロセッサ104に実行させる処理により実現される。文生成装置10は、また、学習データ記憶部121を利用する。学習データ記憶部121は、例えば、補助記憶装置102、又は文生成装置10にネットワークを介して接続可能な記憶装置等を用いて実現可能である。
 学習データ記憶部121は、文生成モデルm1を学習するための複数の学習データを記憶する。1つの学習データは、質問文、文書画像集合、正解文(回答文又は正解回答根拠ページ番号系列)、タスク名、ページ番号系列の組である。質問文とは、質問を示す文字列(テキスト)である。文書画像集合とは、複数の文書画像の集合である。文書画像とは、テキストや物体の図形又は画像を含む画像である。正解文とは、質問文に対して正解である回答を示す文字列であり、当該文字列の内容はタスクに応じて正解回答文又は正解回答根拠ページ番号系列である。正解回答文とは、質問文に対する回答を示す文である。正解回答根拠ページ番号系列とは、文書画像集合において、正解回答文の根拠となった1以上のページ(文書画像)の識別番号の系列である。タスク名は、タスクの種別を示す情報(種別情報)である。本実施の形態では、タスク名は、「Question Answering」又は「Evidence Selection」である。「Question Answering」は、質問回答タスクのタスク名であり、「Evidence Selection」は、回答根拠選択タスクのタスク名である。但し、これら以外のタスク名が用いられてもよい。質問回答タスクとは、回答文を生成するタスクである。回答根拠選択タスクとは、回答根拠ページ番号系列を選択(又は判定)するタスクである。ページ番号系列は、文書画像集合を構成する各文書画像のページ番号の系列である。
 例えば、質問文、文書画像集合、正解文(正解回答文又は正解回答根拠ページ番号系列)、タスク名及びページ番号系列の組(学習データ)がN通り用意され、各組に対してタスク名が異なる2つの学習データが用意される。つまり、2×N個の学習データが用意される。タスク名が「Question Answering」である学習データの正解文は正解回答文であり、タスク名が「Evidence Selection」である学習データの正解文は正解回答根拠ページ番号系列である。
 図3は、文書画像集合、質問文、正解文の一例を示す図である。図3には、質問文が、「2013年におけるN社の携帯会社におけるモバイルビジネスシェアはどのくらいですか?」であり、タスク名が「Question Answering」である場合の正解文(=正解回答文)と、タスク名が「Evidence Selection」である場合の正解文(正解回答根拠ページ番号系列)の一例が示されている。図3の例では、正解回答文である「45%」は、P4及びP5の文書画像が含む情報から生成されるため、正解回答根拠ページ系列は、「4,5」とされている。
 テキスト抽出部11は、文書画像集合に含まれる文書画像ごとに、当該文書画像において単語の系列を含む領域を検出し、検出された領域内の単語を認識(抽出)して、文書画像中テキスト情報を出力する。文書画像中テキスト情報とは、文書テキスト領域特徴vocr、文書テキスト系列、テキストごとの文書テキスト矩形領域等を含む情報である。
 文書テキスト矩形領域は、文書画像に対する文字認識によって認識された単語ごとの矩形領域の左上座標と右下座標である。
 文書テキスト系列は、文書画像において認識された(文書画像から抽出された)単語の系列である。文書テキスト系列は、文書画像において各単語が認識された文書テキスト矩形領域の座標に応じて各テキストがleft-to-right、top-to-downの順番で並び替えられていた単語の系列である。文書テキスト系列及び文書テキスト矩形領域の取得方法は、文書画像から単語系列、及び、単語の矩形領域を出力できる方法であればどのような方法が採用されてもよい。例えば、参考文献1のGoogle(登録商標) Vision APIが用いられてもよい。なお、各参考文献の文献情報は後述される。
 文書テキスト領域特徴vocrは、文書テキスト矩形領域ごとのベクトルの系列である。1つのベクトルは、2048次元によって1つの文書テキスト矩形領域内の単語の特徴を表す。したがって、文書テキスト領域特徴vocrは、2048×文書テキスト矩形領域数のベクトル系列となる。文書テキスト領域特徴vocrの取得にはどのような方法が用いられてもよい。例えば、参考文献2に記載のFaster-RCNNが用いられてもよい。
 物体抽出部12は、文書画像集合に含まれる文書画像ごとに、当該文書画像に含まれる物体を検出し、当該物体に関する情報(以下、「文書画像中物体情報」という。)を出力する。文書画像中物体情報とは、物体ごとの物体領域特徴vobj、物体ごとの物体領域意味ラベル、物体ごとの物体矩形領域等を含む情報である。
 物体矩形領域は、文書画像に対する物体検出によって認識された物体を含む領域の左上座標及び右下座標である。例えば、物体としては、文書画像中のタイトル、又は表等の図形が物体として検出される。なお、タイトルは、1以上の単語を含む。したがって、タイトルからは、文書画像中テキスト情報及び文書画像中物体情報の双方が抽出される。すなわち、文書画像中の同じ部分に対して、文書画像中テキスト情報及び文書画像中物体情報の双方が抽出される場合が有る。
 物体領域特徴vobjとは、物体矩形領域ごとのベクトルの系列である。1つのベクトルは、2048次元によって1つの物体矩形領域内の特徴を表す。したがって、物体領域特徴vobjは、2048×物体矩形領域数のベクトル系列となる
 物体領域意味ラベルは、物体矩形領域の内容(つまり、物体)の意味(名称)を表す9種類の意味ラベル(「Title」や「Table」など)である。「Title」はタイトルの意味ラベルであり、「Table」は表の意味ラベルである。
 物体領域特徴vobj、物体領域意味ラベル、物体矩形領域を文書画像から取得可能であれば文書画像中物体情報を取得するための処理は所定のものに限定されない。例えば、参考文献2のFaster-RCNNが用いられてもよい。
 学習部13は、文生成モデルm1の学習を制御する。文生成モデルは、エンコーダとしてのエンコード部mEと、デコーダとしてのデコード部mDとを含む。文生成モデルm1の詳細については後述される。
 図4は、学習時において文生成装置10が実行する処理手順の一例を説明するためのフローチャートである。
 ステップS101において、学習部13は、学習データ記憶部121に記憶されている学習データ群のうちの未処理の一つの学習データ(以下、「対象学習データ」という。)を処理対象として選択する。
 続いて、テキスト抽出部11は、対象学習データの文書画像集合に含まれる文書画像ごとに、当該文書画像においてテキストを含む領域を検出し、検出された領域内のテキストを認識して、文書画像中テキスト情報を出力する(S102)。
 続いて、物体抽出部12は、対象学習データの文書画像集合に含まれる文書画像ごとに、当該文書画像に含まれる物体を検出し、物体ごとの文書画像中物体情報を出力する(S103)。
 続いて、学習部13が、文生成モデルm1のエンコード部mEに対して、ステップS102において抽出された各文書画像の文書画像中テキスト情報、ステップS103において抽出された各文書画像の文書画像中物体情報、対象学習データの質問文、タスク名及び文書画像集合のページ数文のページ番号(つまり、各文書画像のページ番号)の系列であるページ番号系列を入力すると、エンコード部mEは、エンコード特徴量を生成する(S104)。
 図5は、学習時の文生成モデルm1を説明するための図である。図5に示されるように、エンコード部mEは、物体特徴受付部mE-1、テキスト情報受付部mE-2、質問文等受付部mE-3及び埋め込み系列生成部mE-4と、M層の変換部層(Transformer)と含む。物体特徴受付部mE-1は、対象学習データの文書画像集合に含まれる各文書画像の文書画像中物体情報(物体領域特徴vobj、物体領域意味ラベル、物体矩形領域)の入力を受け付ける。テキスト情報受付部mE-2は、各文書画像の文書画像中テキスト情報(文書テキスト領域特徴vocr、文書テキスト系列、文書テキスト矩形領域)の入力を受け付ける。質問文等受付部mE-3は、対象学習データのページ番号系列、対象学習データの質問文及びタスク名を受け付ける。
 入力の受け付けに応じ、エンコード部mEは、以下のStep1~4を実行する。
 (Step1)テキスト情報受付部mE-2は、受け付けた各文書テキスト系列を所定の処理単位であるトークンの系列wocrに分割する。質問文等受付部mE-3は、受け付けた質問文を所定の処理単位であるトークンの系列wに分割する。物体特徴受付部mE-1は、受け付けた各物体領域意味ラベルを所定の処理単位であるトークンの系列wobjに分割する。所定の処理単位(トークン)への分割処理の一例として、参考文献3に示されるByte-level BPEが用いられてもよい。なお、(Step1)は、エンコード部mEの外部、例えばテキスト抽出部11や物体抽出部12で予め実施されてもよい。k番目の文書画像について生成されるトークン系列(以下、「文書画像トークン系列」という。)cを以下のように定義する。
=(w_1obj,w_1ocr,w_2obj,w_2ocr,…,w_nobj,w_nocr
 なお、以下の説明では、k番目の文書画像に注目するが、各文書画像について同様の処理が実行される。
 (Step2)
 埋め込み系列生成部mE-4は、対象学習データのタスク名t∈{Question Answering,Evidence Selection}、対象学習データの質問文のトークン系列w、対象学習データのページ番号系列のうちのk番目の文書画像のページ番号p、k番目の文書画像の文書画像トークン系列cを用いて、k番目の文書画像の入力トークン系列を以下のように用意(生成)する。
=(task:name question:w page:p context:c
 ここで、"task:"、"question:"、"page:"、"context:"は、順番にタスク名name、質問文のトークン系列w、ページ番号p、文書画像トークン系列cの先頭に付与されるトークン系列であり、これらを表現するトークン系列であれば他の文字列によって代替されてもよい。また、ページ番号page:pは、cに含めることも可能である。本実施の形態において、xは系列長U=1024のトークン系列であるとする。
 (Step3)埋め込み系列生成部mE-4は、k番目の文書画像における入力埋め込み系列を以下のように生成する。
=LayerNorm(etoken +eseg +evis +eloc
 ここで、LayerNormは、例えば、参考文献4にて示される正規化手法である。また、各入力埋め込み系列はD×L次元のベクトルである。本実施の形態では、D=512、L=200である。
 etoken は、入力トークン系列xを、対応するD次元のベクトルに埋め込む変換である。本実施の形態では、参考文献5により学習済みの埋め込みベクトル(D=512)を初期値とし、学習パラメータとする。また、他のEncoder-Decoder型の事前学習済み言語モデルのパラメータが用いられてもよい。
 eseg は、入力トークン系列x中のセグメント(各ページ内のトークンがどの物体領域に属しているかを表す情報)に応じた、D次元のベクトル埋め込みである。
 evis は、文書テキスト領域特徴vocrと物体領域特徴vobjとを連結したD次元のベクトルに変換する処理である。
 eloc は、k番目の文書画像の文書テキスト矩形領域、物体矩形領域を表すD次元の埋め込みである。例えば、非特許文献2で用いられる手法が用いられてもよい。
 なお、eを算出するためには、線型結合の対象となる各ベクトルの系列長をD次元に揃える必要があるため、evis 及びeloc について、矩形領域を持たない「タスク名、質問文、ページ番号」に対応する部分はD次元のゼロベクトルにされる。
 (Step4)埋め込み系列生成部mE-4は、参考文献6に倣い、各文書画像における入力埋め込み系列eをM層のTransformerに入力する。M層のTransformerは、1つのeに対してe'を生成し、ベクトル連結を行ってエンコード特徴量E=[e',…,e']を出力する。ここで、Kは文書画像の枚数(ページ数)を表す。
 本実施の形態では、K=20であり、参考文献6で示す事前学習済みの6層のTransformerが用いられる。したがって、本実施の形態において、M=6である。但し、他の事前学習済み言語モデルのパラメータが用いられてもよい。
 上記より、図4のステップS104では、エンコード特徴量E=[e',…,e']がエンコード部mEから出力される。
 続いて、文生成モデルm1のデコード部mDは、エンコード特徴量Eと、学習部13から入力される対象学習データのトークナイズ処理済みの正解文(正解回答文又は正解回答根拠ページ番号系列)とに基づいて、出力系列の推定結果である出力系列情報(回答文又は回答根拠ページ番号系列の出力確率分布)を生成する(S105)。すなわち、学習部13は、対象学習データの正解文(正解回答文又は正解回答根拠ページ番号系列)に対してトークナイズ処理を行う。但し、学習部13は、トークナイズ処理済みの正解文を入力としてもよい。例えば、トークナイズ処理として、参考文献3に示されるByte-level BPEが用いられてもよい。
 デコード部mDは、具体的には、以下のStep11~13を実行する。
 (Step11)
 デコード部mDは、出力ステップt毎に学習部13により入力される正解文(正解回答文又は正解回答根拠ページ番号系列)のトークン系列のうちのt-1番目のトークンを入力し、t番目のトークンを生成する。そして、デコード部mDは、これまでに出力された各トークンを結合することで出力ステップtにおける出力系列を生成する。つまり、学習時において、出力ステップtにおける出力系列は、正解文のトークン系列の先頭からt番目のトークンまでのトークン系列である。但し、本実の形態においては,回答根拠ページ番号が一つ以上の場合、「,」を用いてページ番号が連結される。出力ステップとは、1つのトークンがデコード部mDから出力されるステップをいう。なお、学習部13は、正解文のうちデコード部mDに入力されるトークン系列の先頭に開始記号として"<s>Question Answering:"又は"<s>Evidence Selection:"を付与し、当該トークン系列の末尾に終端記号として</s>記号を付与する。つまり、"<s>[タスク名]"が開始記号として付与される。
 なお、出力系列に対するトークナイズ処理の一例として、参考文献3に示されるByte-level BPEが用いることができる。
 (Step12)
 エンコード部mEは、エンコード特徴量と出力ステップtの出力系列をL層の変換部層(Transformer)に入力する。その結果、L層のTransformerから出力ステップtの出力トークンの表現hが出力される。本実施の形態においては、参考文献5で示す事前学習済みのTransformerが用いられる。また、同様に、他の事前学習済み言語モデルのパラメータが用いられてもよい。
 (Step13)
 デコード部mDは、出力トークンの表現hを基に、線形変換とsoftmax関数を通すことで、t番目のトークンの確率分布p(y│y<t)を求める。tは、0≦t≦Tを満たす。Tは、出力トークン系列の長さの上限であり、本実施の形態においては、T=60である。
 (Step11~13)が最大でT回繰り返されると、エンコード部mEは、出力トークンの表現H=[h_1、…、h_T]に基づく確率分布pの系列である出力系列情報を出力する。
 続いて、学習部13は、出力系列情報(出力系列の推定結果)と正解文とに基づいて、以下の損失を算出する(S106)。
Figure JPOXMLDOC01-appb-M000001
但し、y は、出力テキストにおいて、正解文のトークンである。
 続いて、学習部13は、当該損失を最小化するよう文生成モデルm1(エンコード部mE及びデコード部mD)のモデルパラメータを更新する(S107)。
 学習データ記憶部121に記憶されている全ての学習データについてステップS101~S107が実行されると(S108でNo)、図4の処理手順は終了する。
 次に、推論時について説明する。図6は、本発明の実施の形態における推論時の文生成装置10の機能構成例を示す図である。図6中、図2と同一部分には同一符号を付し、その説明は適宜省略する。
 推論時において、文生成装置10は、出力系列生成部14を有する。出力系列生成部14は、文生成装置10にインストールされた1以上のプログラムが、プロセッサ104に実行させる処理により実現される。
 出力系列生成部14は、推論時において文生成モデルm1に入力される質問文等について文生成モデルm1が出力する出力系列情報に基づき、回答文又は回答根拠ページ番号系列を生成する。
 なお、推論時において、文生成装置10は、学習部13及び学習データ記憶部121を有さなくてもよい。また、推論時における文生成装置10と学習時における文生成装置10とは異なるコンピュータを用いて実現されてもよい。
 図7は、推論時において文生成装置10が実行する処理手順の一例を説明するためのフローチャートである。
 ステップS201において、文生成装置10は、入力データの入力を受け付ける。入力データは、文書画像集合、質問文、タスク名及び文書画像集合を構成する各文書画像のページ番号系列等を含む。
 続いて、テキスト抽出部11は、入力データの文書画像集合に含まれる文書画像ごとに、当該文書画像に含まれるテキストの領域を検出し、検出された領域内のテキストを認識(抽出)して、文書画像中テキスト情報を出力する(S202)。
 続いて、物体抽出部12は、入力データの文書画像集合に含まれる文書画像ごとに、当該文書画像に含まれる物体情報を抽出し、文書画像中物体情報を出力する(S203)。
 続いて、文生成モデルm1のエンコード部mEは、ステップS202において抽出された各文書画像の文書画像中テキスト情報、ステップS203において抽出された各文書画像の文書画像中物体情報、入力データの質問文、タスク名及びページ番号系列を入力して、エンコード特徴量Eを生成する(S204)。
 なお、ステップS202~S204は、処理対象のデータが異なるだけで、処理の内容は図4のステップS102~S104と同じである。続くステップS205~S207は、出力ステップごとに実行される。
 ステップS205において、エンコード部mEは、学習時において説明した(Step11)~(Step13)と同様の処理を1回実行して、t番目のトークンの確率分布p(y│y<t)を生成する。
 但し、推論時において、(Step11)の一部が学習時とは異なる。具体的には、図8に示されるように、推論時においては、出力ステップ毎に出力系列生成部14から出力されるトークンがデコード部mDに入力され、当該トークンを結合したものが出力ステップtにおける出力系列とされる。つまり、推論時において出力ステップtにおける出力系列は、出力系列生成部14がtまでに生成した回答文又は回答根拠ページ系列である。なお、出力系列生成部14は、最初のトークンの先頭に開始記号として"<s>Question Answering:"又は"<s>Evidence Selection:"を付与する。
 続いて、出力系列生成部14は、t番目のトークンの確率分布p(y│y<t)に基づいて、確率分布の最大となるトークンを選択することにより、又は確率分布に従ってトークンをサンプリングすることによりt番目のトークンy(回答文又はページ番号系列の一部)を生成し、トークンyを出力する(S206)。
 トークンyが終端記号</s>でなければ(S207でNo)、ステップS205以降が繰り返される。トークンyが終端記号</s>であれば(S207でYes)、図7の処理手順は終了する。それまでの出力されたyの系列が、質問文に対する回答文又は回答根拠ページ系列である。
 上述したように、本実施の形態によれば、文生成モデルm1は、文書画像集合を入力可能なモデル構造を有する。したがって、複数の文書画像に基づく文の生成を可能とすることができる。その結果、例えば、文書画像間の関係を捉えることが可能になり、実世界に多数存在する視覚的に表現された文書(プレゼンテーションスライド、論文、PDF文書、HTML文書など)を知識源として理解し、文生成(質問応答)を行うことが可能となる。
 なお、与えられた文書画像集合に対する回答の生成に適合する文書画像と適合しない文書画像との双方が含まれる場合、回答の生成に適合しない文書画像がノイズとなって正しい回答を出力するのが困難となる場合が有る。各文書画像が回答の生成に適合するか否か(つまり、どのページが回答の生成に必要であるか否か)の判定は、回答文の生成と密接な関係があるが、従来の技術では、回答の生成に必要なページを選択又は判定するタスクと回答を生成するタスクとを同時に学習することは困難であった。
 本実施の形態によれば、質問回答タスクに加えて、回答根拠となるページ番号を選択又は判定するタスクを統一のフォーマット(「Question Answering:」や「Evidence Selection:」といったように「タスク名:」の形でエンコード部mEに入力し、回答文又は回答根拠ページ番号をトークン系列として生成する、というフォーマット(枠組み))で同時に(単一のモデルで)学習する。その結果、質問文に応じて回答に必要となる文書画像(ページ)を特定し、従来技術よりも高い精度で回答文を生成することが可能になる。
 なお、上記では、文書画像集合に基づく文の生成に関する制約情報が質問文であり、当該質問文に応じた出力系列(回答文又は回答根拠ページ系列)が生成される例について説明したが、他の制約情報を入力とし、当該他の制約情報に応じた出力系列が生成されるタスクに対して本実施の形態が適用されてもよい。
 例えば、文書画像集合から抽出される情報についての要約文又はキャプション(見出し又はタイトル等)の生成タスクに対して本実施の形態が適用されてもよい。当該タスクに関しては、クエリ(焦点又は着目点を示す文字列)が文生成に関する制約情報として用いられてもよい。
 クエリ指定型要約の場合、{文書画像集合、クエリ、要約文}の三つ組を学習データとして用意することで実現可能である。また、クエリを必要としない抽出型・生成型要約の場合、{文書画像集合、要約文}の二つ組を用意することで実現可能である。
 なお、本実施形態に係る文生成装置10は、非特許文献1や非特許文献2のような従来手法に対して特定の改善を提供するものであり、自然言語による文生成技術が利用される様々な技術分野の向上を示すものである。
 以下に、本実施の形態において引用した参考文献の文献情報を示す。
[参考文献1]Google Vision API. https://cloud.google.com/vision
[参考文献2]Shaoqing Ren, Kaiming He, Ross B. Girshick, Jian Sun: Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks. NIPS 2015: 91-99
[参考文献3]Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, and Ilya Sutskever: Language models are unsupervised multitask learners. Technical report, OpenAI, 2019
[参考文献4]Jimmy Lei Ba, Jamie Ryan Kiros, Geoffrey E. Hinton: Layer Normalization. Arxiv, 2016
[参考文献5]Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, Peter J. Liu. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. JMLR
[参考文献6]Gautier Izacard and Edouard Grave: Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering. EACL2021
 以上の実施形態に関し、更に以下の付記を開示する。
 (付記項1)
 メモリと、
 前記メモリに接続された少なくとも1つのプロセッサと、
 を含み、
 前記プロセッサは、
 複数の文書画像のそれぞれが含む情報と、前記情報に基づく文の生成に関する制約情報と、前記複数の文書画像のそれぞれのページ番号とを入力として受け付けたモデルから出力される出力系列の推定結果と、前記入力に対する正解の出力系列とに基づいて前記モデルを学習する、
ことを特徴とする文生成学習装置。
 (付記項2)
 メモリと、
 前記メモリに接続された少なくとも1つのプロセッサと、
 を含み、
 前記プロセッサは、
 第1の複数の文書画像のそれぞれから抽出された第1の情報と、前記第1の情報に基づく文の生成に関する第1の制約情報と、前記第1の複数の文書画像のそれぞれのページ番号とを入力として受け付けたモデルから出力される出力系列の推定結果と、前記入力に対する正解の出力系列とに基づいて学習された前記モデルが、第2の複数の文書画像のそれぞれから抽出された第2の情報と、前記第2の情報に基づく文の生成に関する第2の制約情報と、前記第2の複数の文書画像のそれぞれのページ番号とを入力した場合の前記モデルからの出力に基づいて、前記第2の複数の文書画像及び前記第2の制約情報に応じた出力系列を生成する、
ことを特徴とする文生成装置。
 (付記項3)
 複数の文書画像のそれぞれが含む情報と、前記情報に基づく文の生成に関する制約情報と、前記複数の文書画像のそれぞれのページ番号とを入力として受け付けたモデルから出力される出力系列の推定結果と、前記入力に対する正解の出力系列とに基づいて前記モデルを学習する、
処理をコンピュータに実行させるプログラムを記録した記録媒体。
 以上、本発明の実施の形態について詳述したが、本発明は斯かる特定の実施形態に限定されるものではなく、請求の範囲に記載された本発明の要旨の範囲内において、種々の変形・変更が可能である。
10     文生成装置
11     テキスト抽出部
12     物体抽出部
13     学習部
14     出力系列生成部
100    ドライブ装置
101    記録媒体
102    補助記憶装置
103    メモリ装置
104    プロセッサ
105    インタフェース装置
121    学習データ記憶部
B      バス
m1     文生成モデル
mE     エンコード部
mE-1   物体特徴受付部
mE-2   テキスト情報受付部
mE-3   質問文等受付部
mE-4   埋め込み系列生成部
mD     デコード部

Claims (7)

  1.  複数の文書画像のそれぞれが含む情報と、前記情報に基づく文の生成に関する制約情報と、前記複数の文書画像のそれぞれのページ番号とを入力として受け付けたモデルから出力される出力系列の推定結果と、前記入力に対する正解の出力系列とに基づいて前記モデルを学習するように構成されている学習部、
    を有することを特徴とする文生成学習装置。
  2.  前記モデルは更にタスクの種別情報を入力し、
     前記学習部は、
     前記モデルが入力したタスクの種別情報が文の生成に関するタスクを示す場合には、前記モデルから出力される、前記制約情報に応じた文の推定結果と、前記入力に対する正解の文とに基づいて前記モデルを学習し、
     前記モデルが入力したタスクの種別情報が文の生成に必要なページ番号を判定するタスクを示す場合には、前記モデルから出力される、前記制約情報に応じた文の生成に必要なページ番号の系列と、前記入力に対する正解のページ番号の系列とに基づいて前記モデルを学習するように構成されている、
    ことを特徴とする請求項1記載の文生成学習装置。
  3.  前記制約情報は、質問文であり、
     前記学習部は、複数の文書画像のそれぞれから抽出された情報と、前記情報に基づく回答文の生成に関する質問文と、前記複数の文書画像のそれぞれのページ番号とを入力として受け付けたモデルからの前記回答文に関する出力系列の推定結果と、前記入力に対する正解の出力系列とに基づいて前記モデルを学習するように構成されている、
    ことを特徴とする請求項1又は2記載の文生成学習装置。
  4.  前記モデルは、前記入力に対する特徴量を生成するエンコーダと、前記特徴量に基づいて前記推定結果を生成するデコーダとを含む、
    ことを特徴とする請求項1又は2記載の文生成学習装置。
  5.  第1の複数の文書画像のそれぞれから抽出された第1の情報と、前記第1の情報に基づく文の生成に関する第1の制約情報と、前記第1の複数の文書画像のそれぞれのページ番号とを入力として受け付けたモデルから出力される出力系列の推定結果と、前記入力に対する正解の出力系列とに基づいて学習された前記モデルが、第2の複数の文書画像のそれぞれから抽出された第2の情報と、前記第2の情報に基づく文の生成に関する第2の制約情報と、前記第2の複数の文書画像のそれぞれのページ番号とを入力した場合の前記モデルからの出力に基づいて、前記第2の複数の文書画像及び前記第2の制約情報に応じた出力系列を生成するように構成されている出力系列生成部、
    を有することを特徴とする文生成装置。
  6.  複数の文書画像のそれぞれが含む情報と、前記情報に基づく文の生成に関する制約情報と、前記複数の文書画像のそれぞれのページ番号とを入力として受け付けたモデルから出力される出力系列の推定結果と、前記入力に対する正解の出力系列とに基づいて前記モデルを学習する学習手順、
    をコンピュータが実行することを特徴とする文生成学習方法。
  7.  複数の文書画像のそれぞれが含む情報と、前記情報に基づく文の生成に関する制約情報と、前記複数の文書画像のそれぞれのページ番号とを入力として受け付けたモデルから出力される出力系列の推定結果と、前記入力に対する正解の出力系列とに基づいて前記モデルを学習する学習手順、
    をコンピュータに実行させることを特徴とするプログラム。
PCT/JP2022/047446 2022-12-22 2022-12-22 文生成学習装置、文生成装置、文生成学習方法及びプログラム Ceased WO2024134841A1 (ja)

Priority Applications (2)

Application Number Priority Date Filing Date Title
JP2024565512A JPWO2024134841A1 (ja) 2022-12-22 2022-12-22
PCT/JP2022/047446 WO2024134841A1 (ja) 2022-12-22 2022-12-22 文生成学習装置、文生成装置、文生成学習方法及びプログラム

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
PCT/JP2022/047446 WO2024134841A1 (ja) 2022-12-22 2022-12-22 文生成学習装置、文生成装置、文生成学習方法及びプログラム

Publications (1)

Publication Number Publication Date
WO2024134841A1 true WO2024134841A1 (ja) 2024-06-27

Family

ID=91588165

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/JP2022/047446 Ceased WO2024134841A1 (ja) 2022-12-22 2022-12-22 文生成学習装置、文生成装置、文生成学習方法及びプログラム

Country Status (2)

Country Link
JP (1) JPWO2024134841A1 (ja)
WO (1) WO2024134841A1 (ja)

Non-Patent Citations (3)

* Cited by examiner, † Cited by third party
Title
GUO QINGHONG; HU ZIPENG; LI CHAO; LIU KAI; GUO XINZE: "Key-Region and Layout Learning for Contract Intelligent Identification", 2021 IEEE INTERNATIONAL CONFERENCE ON EMERGENCY SCIENCE AND INFORMATION TECHNOLOGY (ICESIT), IEEE, 22 November 2021 (2021-11-22), pages 57 - 61, XP034079889, DOI: 10.1109/ICESIT53460.2021.9696614 *
PRAMANIK SUBHOJEET, MUJUMDAR SHASHANK, PATEL HIMA: "Towards a Multi-modal, Multi-task Learning based Pre-training Framework for Document Representation Learning", ARXIV (CORNELL UNIVERSITY), CORNELL UNIVERSITY LIBRARY, ARXIV.ORG, 5 January 2022 (2022-01-05), XP093184252, Retrieved from the Internet <URL:https://arxiv.org/pdf/2009.14457> DOI: 10.48550/arxiv.2009.14457 *
TITO RUBÈN, KARATZAS DIMOSTHENIS, VALVENY ERNEST: "Hierarchical multimodal transformers for Multipage DocVQA", PATTERN RECOGNITION., ELSEVIER., GB, vol. 144, 1 December 2023 (2023-12-01), GB , pages 109834, XP093184248, ISSN: 0031-3203, DOI: 10.1016/j.patcog.2023.109834 *

Also Published As

Publication number Publication date
JPWO2024134841A1 (ja) 2024-06-27

Similar Documents

Publication Publication Date Title
EP3926531B1 (en) Method and system for visio-linguistic understanding using contextual language model reasoners
CN114596566B (zh) 文本识别方法及相关装置
JP5128629B2 (ja) 品詞タグ付けシステム、品詞タグ付けモデルのトレーニング装置および方法
JP7704190B2 (ja) 学習装置、生成装置、学習方法、生成方法、プログラム、学習済み機械学習モデルの製造方法、学習システム、及び生成システム
US20200159755A1 (en) Summary generating apparatus, summary generating method and computer program
CN110209832B (zh) 上下位关系的判别方法、系统和计算机设备
Kang et al. Generative text steganography based on LSTM network and attention mechanism with keywords
CN112905762B (zh) 一种基于同等注意力图网络的视觉问答方法
CN119474250A (zh) 一种文档切分方法、装置、计算机设备及存储介质
CN117275021B (zh) 基于多模态模型的关键信息提取方法及系统
CN115587184A (zh) 一种关键信息抽取模型的训练方法、装置及其存储介质
CN113255353A (zh) 一种实体标准化方法
CN110968725A (zh) 图像内容描述信息生成方法、电子设备及存储介质
CN118536497A (zh) 一种面向大语言模型的文本切分方法、设备和介质
CN117035064A (zh) 一种检索增强语言模型的联合训练方法及存储介质
Ma et al. E2timt: Efficient and effective modal adapter for text image machine translation
CN118520417A (zh) 一种基于视觉增强实体级交互网络的多模态摘要生成方法
CN117113268A (zh) 多尺度数据融合方法、装置、介质及电子设备
CN110750669B (zh) 一种图像字幕生成的方法及系统
CN111104520B (zh) 一种基于人物身份的人物实体链接方法
CN115116427A (zh) 标注方法、语音合成方法、训练方法及装置
CN118364821B (zh) 基于实体语义和视觉文本化的多模态命名实体识别方法
WO2024134841A1 (ja) 文生成学習装置、文生成装置、文生成学習方法及びプログラム
US20240403627A1 (en) Method and apparatus for characterizing cultural symbols
Selvaraj et al. Enhanced portable text to speech converter for visually impaired

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 22969225

Country of ref document: EP

Kind code of ref document: A1

WWE Wipo information: entry into national phase

Ref document number: 2024565512

Country of ref document: JP

NENP Non-entry into the national phase

Ref country code: DE

122 Ep: pct application non-entry in european phase

Ref document number: 22969225

Country of ref document: EP

Kind code of ref document: A1