WO2025210467A1 - データ処理装置 - Google Patents
データ処理装置Info
- Publication number
- WO2025210467A1 WO2025210467A1 PCT/IB2025/053336 IB2025053336W WO2025210467A1 WO 2025210467 A1 WO2025210467 A1 WO 2025210467A1 IB 2025053336 W IB2025053336 W IB 2025053336W WO 2025210467 A1 WO2025210467 A1 WO 2025210467A1
- Authority
- WO
- WIPO (PCT)
- Prior art keywords
- data
- genre
- summary data
- items
- document
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F16/00—Information retrieval; Database structures therefor; File system structures therefor
- G06F16/30—Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
- G06F16/35—Clustering; Classification
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/20—Natural language analysis
- G06F40/279—Recognition of textual entities
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/40—Processing or translation of natural language
- G06F40/55—Rule-based translation
- G06F40/56—Natural language generation
Definitions
- the present invention relates to a data processing device, data processing system, data processing method, data processing program, etc. that utilizes a large language model (LLM).
- LLM large language model
- the above technical field is one embodiment of the present invention, and the present invention is not limited to the above technical field.
- Other embodiments of the present invention can include, by way of example, semiconductor devices, display devices, light-emitting devices, power storage devices, memory devices, electronic devices, lighting devices, input devices (e.g., touch sensors), input/output devices (e.g., touch panels), driving methods thereof, or manufacturing methods thereof.
- An object of one aspect of the present invention is to provide a novel data processing device, etc. Another object of one aspect of the present invention is to provide a data processing device, etc. that is highly convenient. Another object of one aspect of the present invention is to provide a data processing device, etc. that is highly efficient in search. Another object of one aspect of the present invention is to provide a data processing device, etc. that is highly accurate in search.
- One aspect of the present invention is a data processing device having the following functions: a function for receiving document data and a genre list enumerating multiple genre items and other items; a function for dividing text data of the document data into multiple chunks of data and acquiring multiple first summary data corresponding to the multiple chunks of data by sending a first prompt including one of the multiple chunks of data to a language model; a function for acquiring second summary data that is a summary of the document data by sending a second prompt including the multiple first summary data; a function for acquiring one of the multiple genre items and other items corresponding to the document data and the second summary data by sending a third prompt including the second summary data and the genre list to the language model; a function for vectorizing and clustering the second summary data from which the other items have been acquired; a function for selecting second summary data that is at the center of a cluster from the second summary data from which the other items have been acquired that has been classified into multiple clusters by the clustering; and a function for acquiring a genre item corresponding to the cluster
- a data processing device is preferred in which the text data of the document data is divided into multiple chunks of data according to the upper limit of the number of tokens in the first prompt.
- a data processing device in which the text data of the document data is divided into multiple chunks of data according to paragraphs, chapters, tables of contents, or line breaks in the document data.
- a data processing device which has a first storage unit and a second storage unit, and in which document data and second summary data obtained from multiple genre items are stored in the first storage unit, and second summary data obtained from multiple chunk data, multiple first summary data, and other items are stored in the second storage unit.
- One aspect of the present invention can provide a novel data processing device, etc. Another aspect of the present invention can provide a data processing device, etc. that is highly convenient. Another aspect of the present invention can provide a data processing device, etc. that is highly efficient in searching. Another aspect of the present invention can provide a data processing device, etc. that is highly accurate in searching.
- FIGS. 1A to 1C are block diagrams illustrating a data processing apparatus according to one embodiment of the present invention.
- FIG. 2 is a flowchart illustrating a data processing device according to one embodiment of the present invention.
- 3A and 3B are schematic diagrams illustrating a data processing device according to one embodiment of the present invention.
- FIG. 4 is a flowchart illustrating a data processing device according to one embodiment of the present invention.
- 5A and 5B are schematic diagrams illustrating a data processing device according to one embodiment of the present invention.
- 6A to 6E are schematic diagrams illustrating a data processing device according to one embodiment of the present invention.
- 7A and 7B are schematic diagrams illustrating a data processing device according to one embodiment of the present invention.
- FIG. 8A to 8C are schematic diagrams illustrating a data processing device according to one embodiment of the present invention.
- FIG. 9 is a schematic diagram illustrating a data processing device according to one embodiment of the present invention.
- FIG. 10 is a flowchart illustrating a data processing device according to one embodiment of the present invention.
- 11A and 11B are schematic diagrams illustrating a data processing device according to one embodiment of the present invention.
- 12A and 12B are schematic diagrams illustrating a data processing device according to one embodiment of the present invention.
- FIG. 13A is a flowchart illustrating a data processing device of one embodiment of the present invention
- FIG. 13B is a schematic diagram illustrating a data processing device of one embodiment of the present invention.
- FIG. 14A to 14C are schematic diagrams illustrating a data processing device of one embodiment of the present invention.
- FIG. 15 is a flowchart illustrating a data processing device according to one embodiment of the present invention.
- 16A to 16C are schematic diagrams illustrating a data processing device of one embodiment of the present invention.
- FIG. 17 is a schematic diagram illustrating a data processing device according to one embodiment of the present invention.
- first summary data CAB can be generated multiple times (for example, N-1 times (N is a natural number greater than or equal to 3)) based on prompt PD_2, such as chunk data CHD_1 to CHD_k, first summary data CAB_1 to CAB_k, first summary data CAB_1-5, CAB_6-10 to, CAB_k-4-k, etc., to obtain first summary data CAB_P and first summary data CAB_Q.
- summary data ABD_3 can be obtained via first summary data CAB_P and first summary data CAB_Q.
- the first summary data CAB_1 to CAB_10 can be called primary summary data
- the first summary data CAB_1-5, the first summary data CAB_6-10, and the first summary data CAB_k-4-k can be called secondary summary data
- the first summary data CAB_P and the first summary data CAB_Q can be called (N-1)th summary data
- the summary data ABD_3 can be called Nth summary data.
- Figure 8B is a schematic diagram illustrating prompt PD_2.
- Prompt PD_2 is composed of, for example, "#instruction” and “#sentence.”
- Text data OD2 is written in "#instruction.”
- Multiple pieces of first summary data CAB (for example, first summary data CAB_1 to CAB_5) are written in "#sentence.”
- Text data OD2 is a fixed phrase. Note that the fixed phrase could be, for example, "Please summarize the following text in 400 characters or less. Please try to include as many numerical values that appear in the original text as possible.”
- the summary data ABD will also be in a foreign language. If the language of the summary data ABD stored in the storage unit 20 is a foreign language, it is preferable to translate it into the user's native language. This configuration improves readability when a user accesses the storage unit 20 to search for information.
- a data processing device is configured with a summary data generation unit 41, which allows it to generate summary data based on uniform standards for each of multiple document data DOC.
- This configuration allows summary data for technical documents such as papers and academic conference proceedings to be generated as summary data based on uniform standards. This configuration eliminates variation in the content of summary data, which is important for efficiently understanding the content, and improves readability.
- a preferred configuration is to use the genre generation method described below to generate genres into which the summary data ABD from which genre JD_OTH items have been acquired can be classified, and then sort the data by genre.
- the summary data ABD from which genre JD_OTH items have been acquired is data that is being processed for genre generation, and becomes memory 30 that the user does not access.
- storage unit 20 stores summary data ABD and genre JD items associated with document data.
- Storage unit 30 also stores chunk data CHD, primary summary data, and summary data ABD from which other genre items have been acquired (attached). This configuration allows the user to access storage unit 20, which stores data associated with document data DOC, without accessing storage unit 30, which stores data that is currently being processed.
- One aspect of the present invention is particularly suited to data processing for searching document data that is difficult to search because it is a collection of document data of similar genres, particularly when document data DOC is a mixture of technical documents such as papers in similar genres and conference proceedings in similar genres from different publishers and academic societies. This is because technical documents such as papers and conference proceedings in similar genres are categorized by genre (field) according to different conventions for each publisher and academic society. As in one aspect of the present invention, by re-sorting the genre (field) by technical field according to a set convention, it is possible to categorise by genre (field) by technical field according to a set convention, as with patent documents. As a result, the data that has undergone this data processing can be used to improve search efficiency when searching for desired document data.
- the steps for generating genres include vectorizing and clustering the summary data ABD from which the items of genre JD_OTH have been obtained (step S41), selecting the summary data ABD at the center of cluster CC as summary data CCAB (step S42), and generating genre JD_N based on prompt PD_4 (step S43).
- Figure 13B is a diagram schematically showing multiple clusters CC_1 to CC_3 obtained by vectorizing summary data ABD from which items in the genre JD_OTH have been obtained.
- Summary data ABD from which items in the genre JD_OTH have been obtained can be broadly divided into, for example, three clusters CC_1 to CC_3. In each of clusters CC_1 to CC_3, central summary data CCAB_1 to CCAB_3 are selected.
- FIG. 14A is a schematic diagram showing an example of step S43, in which the data processing device 100 sends a prompt PD_4 having summary data CCAB to the data generation device 70, and a new genre JD_N is generated in accordance with the summary data CCAB.
- Prompt PD_4 is sometimes referred to as the fourth prompt.
- Prompt PD_4 is a prompt that contains an instruction to respond with a new genre JD_N, and the summary data CCAB.
- Figure 14B is a schematic diagram illustrating prompt PD_4.
- Prompt PD_4 is composed of, for example, "#instruction” and “#sentence.”
- Text data OD4 is written in "#instruction.”
- Summary data CCAB selected in step S42 is written in "#sentence.”
- Text data OD4 is a fixed phrase. An example of this fixed phrase could be, "Please tell me the name of the genre based on the content of the following sentence.”
- FIG. 14C is a schematic diagram of a genre list JL_N when the genre list JL shown in FIG. 3B is updated based on the above-mentioned genre generation step, as an example.
- the genre list JL_N is composed of "# genre lists.”
- the "# genre list” also contains an added genre JD_N.
- the added genre item corresponds to "5. Battery.”
- the number assigned to the genre is also updated. Updating the genre list corresponds to step S36 shown in FIG. 10.
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Computational Linguistics (AREA)
- General Health & Medical Sciences (AREA)
- Health & Medical Sciences (AREA)
- Artificial Intelligence (AREA)
- Data Mining & Analysis (AREA)
- Databases & Information Systems (AREA)
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
Abstract
新規なデータ処理装置の提供。文書データと、複数のジャンルの項目およびその他の項目が列挙されたジャンルリストと、を受け付ける機能と、文書データのテキストデータを分割することで複数のチャンクデータとし、複数のチャンクデータの一を含む第1プロンプトを言語モデルに送信することで複数のチャンクデータに対応する複数の第1要約データを取得する機能と、複数の第1要約データを含む第2プロンプトを言語モデルに送信することで文書データの要約である第2要約データを取得する機能と、第2要約データおよびジャンルリストを含む第3プロンプトを言語モデルに送信することで文書データおよび第2要約データに応じた複数のジャンルの項目およびその他の項目のいずれか一を取得する機能と、を有する。
Description
本発明は、大規模言語モデル(LLM:Large Language Model)を利用したデータ処理装置、データ処理システム、データ処理方法、データ処理プログラム、等に関する。
上記技術分野は本発明の一態様であり、本発明は上記技術分野に限定されるものではない。本発明の別態様は、半導体装置、表示装置、発光装置、蓄電装置、記憶装置、電子機器、照明装置、入力装置(例えば、タッチセンサ)、入出力装置(例えば、タッチパネル)、それらの駆動方法、またはそれらの製造方法を一例として挙げることができる。
複数のデータの中からキーワード、ジャンル(分類)などを手掛かりに所望のデータを検索する場合、データをあらかじめ複数のクラスタにクラスタリングする手法がある。近年では、機械学習の手法を取り入れたAI(Artificial Intelligence)技術を利用して、データのクラスタリングを行う手法について提案がされている(例えば特許文献1を参照)。
複数のデータに、例えば論文(学術論文、学位論文、博士論文、小論文、雑誌論文などを含む)、学会予稿集などといった技術文献が含まれる場合、所望のデータを探すためには事前の内容把握が必要となる。例えば複数の技術文献が混在する中から所望のデータを検索する場合、どのようなキーワード、ジャンルなどで検索すればよいかを把握する上で、発行元となる組織による選考基準の把握、または学会の種類による選考基準の把握、が必要となる場合がある。そのため、複数のデータから所望のデータを得るのに時間を要し、検索効率が損なわれる虞があった。
論文、学会予稿集などといった技術文献の場合、要約(アブストラクト)の有無、文字数の量、などといった確認できる情報にばらつきがある。そのため、効率的に内容を把握する上で重要となる要約の内容にばらつきが生じ、検索精度が損なわれる虞がある。
複数のデータのジャンル仕分けを行うために、あらかじめジャンルリストを付与しておき、当該ジャンルリストに応じたジャンル仕分けを行うことが有効である。しかしながら、あらかじめ付与したジャンルリストに適切なジャンルがない場合、ジャンル仕分けがなされないデータ(例えば「その他」のジャンルが付与される場合)が増えることとなる。そのため、ジャンルリストの作成およびジャンル仕分けの利便性が著しく損なわれる虞がある。
本発明の一態様は、新規な、データ処理装置等を提供することを課題の一とする。また本発明の一態様は、利便性に優れた、データ処理装置等を提供することを課題の一とする。また本発明の一態様は、検索効率に優れた、データ処理装置等を提供することを課題の一とする。また本発明の一態様は、検索精度に優れた、データ処理装置等を提供することを課題の一とする。
本発明は、必ずしもこれらの課題の全てを解決する必要はない。またこれらの課題の記載は、本発明の他の課題の存在を妨げるものではない。たとえば明細書、図面、特許請求の範囲に関する記載から、これら以外の課題を抽出することが可能である。
本発明の一態様は、文書データと、複数のジャンルの項目およびその他の項目が列挙されたジャンルリストと、を受け付ける機能と、文書データのテキストデータを分割することで複数のチャンクデータとし、複数のチャンクデータの一を含む第1プロンプトを言語モデルに送信することで複数のチャンクデータに対応する複数の第1要約データを取得する機能と、複数の第1要約データを含む第2プロンプトを言語モデルに送信することで文書データの要約である第2要約データを取得する機能と、第2要約データおよびジャンルリストを含む第3プロンプトを言語モデルに送信することで文書データおよび第2要約データに応じた複数のジャンルの項目およびその他の項目のいずれか一を取得する機能と、を有する、データ処理装置である。
本発明の一態様は、文書データと、複数のジャンルの項目およびその他の項目が列挙されたジャンルリストと、を受け付ける機能と、文書データのテキストデータを分割することで複数のチャンクデータとし、複数のチャンクデータの一を含む第1プロンプトを言語モデルに送信することで複数のチャンクデータに対応する複数の第1要約データを取得する機能と、複数の第1要約データを含む第2プロンプトを言語モデルに送信することで文書データの要約である第2要約データを取得する機能と、第2要約データおよびジャンルリストを含む第3プロンプトを言語モデルに送信することで文書データおよび第2要約データに応じた複数のジャンルの項目およびその他の項目のいずれか一を取得する機能と、その他の項目が取得された第2要約データをベクトル化してクラスタリングする機能と、クラスタリングによって複数のクラスタに分類された、その他の項目が取得された第2要約データにおいて、クラスタの中心にある第2要約データを選出する機能と、選出された第2要約データを含む第4プロンプトを言語モデルに送信することでクラスタに応じたジャンルの項目を取得し、ジャンルリストの更新を行う機能と、を有する、データ処理装置である。
本発明の一態様は、文書データと、複数のジャンルの項目およびその他の項目が列挙されたジャンルリストと、を受け付ける機能と、文書データのテキストデータを分割することで複数のチャンクデータとし、複数のチャンクデータの一を含む第1プロンプトを言語モデルに送信することで複数のチャンクデータに対応する複数の第1要約データを取得する機能と、複数の第1要約データを含む第2プロンプトを言語モデルに送信することで文書データの要約である第2要約データを取得する機能と、第2要約データおよびジャンルリストを含む第3プロンプトを言語モデルに送信することで文書データおよび第2要約データに応じた複数のジャンルの項目およびその他の項目のいずれか一を取得する機能と、その他の項目が取得された第2要約データのいずれか一を含む第5プロンプトを言語モデルに送信することで第2要約データが有する複数のキーワードを抽出し、その他の項目が取得された別の第2要約データ中に存在するキーワードをジャンルの項目として選出し、ジャンルリストの更新を行う機能と、を有する、データ処理装置である。
本発明の一態様において、文書データのテキストデータは、第1プロンプトのトークン数の上限に応じて、複数のチャンクデータに分割される、データ処理装置が好ましい。
本発明の一態様において、文書データのテキストデータは、文書データ中の段落、章立て、目次、または改行に応じて、複数のチャンクデータに分割される、データ処理装置が好ましい。
本発明の一態様において、第1記憶部および第2記憶部を有し、文書データ、複数のジャンルの項目が取得された第2要約データは、第1記憶部に記憶され、複数のチャンクデータ、複数の第1要約データおよびその他の項目が取得された第2要約データは、第2記憶部に記憶される、データ処理装置が好ましい。
本発明の一態様は、新規な、データ処理装置等を提供することができる。また本発明の一態様は、利便性に優れた、データ処理装置等を提供することができる。また本発明の一態様は、検索効率に優れた、データ処理装置等を提供することができる。また本発明の一態様は、検索精度に優れた、データ処理装置等を提供することができる。
本発明は、必ずしもこれらの効果の全てを有する必要はない。またこれらの効果の記載は、本発明の他の効果の存在を妨げるものではない。たとえば明細書、図面、特許請求の範囲に関する記載から、これら以外の効果を抽出することが可能である。
図1A乃至図1Cは、本発明の一態様のデータ処理装置を説明するブロック図である。
図2は、本発明の一態様のデータ処理装置を説明するフローチャートである。
図3Aおよび図3Bは、本発明の一態様のデータ処理装置を説明する模式図である。
図4は、本発明の一態様のデータ処理装置を説明するフローチャートである。
図5Aおよび図5Bは、本発明の一態様のデータ処理装置を説明する模式図である。
図6A乃至図6Eは、本発明の一態様のデータ処理装置を説明する模式図である。
図7Aおよび図7Bは、本発明の一態様のデータ処理装置を説明する模式図である。
図8A乃至図8Cは、本発明の一態様のデータ処理装置を説明する模式図である。
図9は、本発明の一態様のデータ処理装置を説明する模式図である。
図10は、本発明の一態様のデータ処理装置を説明するフローチャートである。
図11Aおよび図11Bは、本発明の一態様のデータ処理装置を説明する模式図である。
図12Aおよび図12Bは、本発明の一態様のデータ処理装置を説明する模式図である。
図13Aは、本発明の一態様のデータ処理装置を説明するフローチャート、図13Bは、本発明の一態様のデータ処理装置を説明する模式図である。
図14A乃至図14Cは、本発明の一態様のデータ処理装置を説明する模式図である。
図15は、本発明の一態様のデータ処理装置を説明するフローチャートである。
図16A乃至図16Cは、本発明の一態様のデータ処理装置を説明する模式図である。
図17は、本発明の一態様のデータ処理装置を説明する模式図である。
図2は、本発明の一態様のデータ処理装置を説明するフローチャートである。
図3Aおよび図3Bは、本発明の一態様のデータ処理装置を説明する模式図である。
図4は、本発明の一態様のデータ処理装置を説明するフローチャートである。
図5Aおよび図5Bは、本発明の一態様のデータ処理装置を説明する模式図である。
図6A乃至図6Eは、本発明の一態様のデータ処理装置を説明する模式図である。
図7Aおよび図7Bは、本発明の一態様のデータ処理装置を説明する模式図である。
図8A乃至図8Cは、本発明の一態様のデータ処理装置を説明する模式図である。
図9は、本発明の一態様のデータ処理装置を説明する模式図である。
図10は、本発明の一態様のデータ処理装置を説明するフローチャートである。
図11Aおよび図11Bは、本発明の一態様のデータ処理装置を説明する模式図である。
図12Aおよび図12Bは、本発明の一態様のデータ処理装置を説明する模式図である。
図13Aは、本発明の一態様のデータ処理装置を説明するフローチャート、図13Bは、本発明の一態様のデータ処理装置を説明する模式図である。
図14A乃至図14Cは、本発明の一態様のデータ処理装置を説明する模式図である。
図15は、本発明の一態様のデータ処理装置を説明するフローチャートである。
図16A乃至図16Cは、本発明の一態様のデータ処理装置を説明する模式図である。
図17は、本発明の一態様のデータ処理装置を説明する模式図である。
本発明の実施の形態について、図面を用いて説明する。但し、本発明は趣旨から逸脱することのない範囲で、形態を様々に変更し得ることは当業者であれば容易に理解される。従って、本発明は以下に示す実施の形態の記載の内容に限定して解釈されるものではない。
本図面等において、各構成要素の位置、大きさ及び範囲などは、実際の各構成要素を正確に表していない場合もある。このため、各構成要素の位置、大きさ及び範囲などは、必ずしも、図面に開示された位置、大きさ及び範囲などに限定されない。
本明細書等において、言語モデルはトランスフォーマーアーキテクチャーをベースとし、会話型(対話型ともいう)モデルとなるよう追加学習したものである。つまり、会話型生成モデルは言語モデルの下位概念に相当する。また言語モデルは一般に大規模言語モデル(LLM)とも呼ばれる。
本明細書等において、「第1」、「第2」という単語を技術的内容の理解の為に便宜上用いる又は各構成要素の識別に使われることもある。このため、「第1」、「第2」という単語が各構成要素の数を限定することはない。また「第1」、「第2」という単語が各構成要素の順序を限定することはない。また、本明細書に用いた「第1」、「第2」という単語又は識別符号が、本特許請求の範囲における単語又は識別符号と一致しない場合がある。
本明細書等において、複数の要素に同じ符号を用いる場合、特に、それらを区別する必要があるときには、符号に、例えば、“A”、“B”、“_1”、“_2”、または“[n]”などの識別用の符号を付して記載する場合がある。また、識別用の符号を付した複数の要素に共通の事柄を説明するとき、または、それらを区別する必要がないときには、識別用の符号を付さずに記載する場合がある。
本明細書等において、文書とは文字又は記号を用いて人の意思を書きあらわしたものを指す。文書には、複数の章または複数の段落に分割した状態も含まれる。また一つの章は、複数の段落から構成される状態も含まれる。
(実施の形態1)
本実施の形態では、本発明の一態様であるデータ処理装置の一例について説明する。本発明の一態様におけるデータ処理は、技術文献、論文、学会予稿集などといった文書データを、ユーザが付与したジャンルに基づいてジャンル分けを行う処理である。データ処理装置は、対象となる構成を入れ替えることで、データ処理システム、データ処理方法、データ処理プログラムと呼ぶことができる。
本実施の形態では、本発明の一態様であるデータ処理装置の一例について説明する。本発明の一態様におけるデータ処理は、技術文献、論文、学会予稿集などといった文書データを、ユーザが付与したジャンルに基づいてジャンル分けを行う処理である。データ処理装置は、対象となる構成を入れ替えることで、データ処理システム、データ処理方法、データ処理プログラムと呼ぶことができる。
<データ処理装置の構成例>
本発明の一態様のデータ処理装置の構成例について説明する。図1Aは、本発明の一態様のデータ処理装置を説明するブロック図である。図1Bは、データ処理装置の外部にある入力装置について説明するブロック図である。図1Cは、データ処理装置の外部にあるデータ生成装置について説明するブロック図である。また図2は、データ処理装置の動作を説明するフローチャートである。図3Aは、データ処理装置に入力される文書データを説明する模式図である。図3Bは、データ処理装置に入力されるジャンルリストを説明する模式図である。
本発明の一態様のデータ処理装置の構成例について説明する。図1Aは、本発明の一態様のデータ処理装置を説明するブロック図である。図1Bは、データ処理装置の外部にある入力装置について説明するブロック図である。図1Cは、データ処理装置の外部にあるデータ生成装置について説明するブロック図である。また図2は、データ処理装置の動作を説明するフローチャートである。図3Aは、データ処理装置に入力される文書データを説明する模式図である。図3Bは、データ処理装置に入力されるジャンルリストを説明する模式図である。
図1Aに示すデータ処理装置100は、一例として入力部10、記憶部20、記憶部30、データ処理部40、出力部60、および伝送部90を有する。
なお本明細書等におけるブロック図では、構成要素を機能毎に分類し、互いに独立したブロックとして示している。しかしながら実際の集積回路等においては、構成要素を機能毎に切り分けることが難しく、一つの集積回路に複数の機能が係わる場合、または複数の集積回路にわたって一つの機能が関わる場合があり得る。例えば、記憶部20および記憶部30は、異なる機能を有する別のブロックの記憶部としているが、異なる機能を有する一つのブロックの記憶部とすることも可能である。
入力部10は、データ処理装置100の外部の入力装置50からのデータを受け付ける機能を有する。入力装置50は、データサーバー、またはデスクトップ型コンピュータ、ノート型コンピュータ、スマートフォン又はタブレット型コンピュータといった情報端末などである。例えば入力装置50に入力されるデータが文書データの場合、入力装置50はデータサーバーであり、入力装置50に入力されるユーザが入力するリストデータの場合、入力装置50はデスクトップ型コンピュータ、ノート型コンピュータ、スマートフォン又はタブレット型コンピュータといった情報端末である。
データ処理装置100と入力装置50とは、例えばデータ処理装置を用いたサービスの提供者と、当該サービスを享受するユーザとが、同じ企業等の組織内に属する場合、データ処理装置100と入力装置50との間で行われるデータの受信は、例えば、当該組織内に構築されたLAN(Local Area Network)などのネットワークを用いて行われることが好ましい。これにより、インターネットを介して行う場合に比べて安全に、データ処理装置100と入力装置50との間でデータを受信することができる。また、組織内の情報が外部へ流出することを防止することができる。または、データ処理装置100と入力装置50との間で行われるデータの送受信は、World Wide Web(WWW)の基盤であるインターネットを用いて行うことができる。
データ処理装置100は、図1Bに図示するように、文書データDOCおよびジャンルリストJLが入力される。入力部10は、文書データDOCおよびジャンルリストJLを受け付ける。入力部10は、伝送部90を介して受け付けたデータを記憶部20に伝送する。
文書データDOCおよびジャンルリストJLを受け付けるステップは、図2に図示するステップS11に相当する。
文書データDOCは、例えば論文、学会予稿集、技術報告書、特許文献、契約書、製品マニュアル、などといった一定の目的をもって収集され、電子化された機械可読なデータである。
文書データDOCは、図3Aに一例として図示する文書データDOC_1乃至DOC_3のように模式的に図示することができる。文書データDOC_1乃至DOC_3ではそれぞれ、データ量が異なる文書データである。文書データDOC_1は、文書データDOC_1_1乃至DOC_1_2で構成される。文書データDOC_2は、文書データDOC_2_1で構成される。文書データDOC_3は、文書データDOC_3_1乃至DOC_3_k(kは3以上の整数)で構成される。図3Aに図示する文書データDOC_1乃至DOC_3のようにデータ量が異なる以外に、論文、学会予稿集などの技術文献では、出版社毎または学会毎に、段落、章立て、目次、または改行といった様式が異なる場合が多く、キーワードなどの単純な検索では所望の文書データを探し得るのに時間を要し、検索効率が損なわれる場合がある。
ジャンルリストJLは、複数のジャンルに関する項目の他、その他の項目が列挙されたデータである。複数のジャンルに関する項目は、複数の技術文献が混在する中から所望のデータを検索して内容を把握するために細分化されたジャンルである。ジャンルリストJLが有する複数のジャンルは、ユーザがあらかじめ付与するデータであることが好ましい。当該構成とすることで、ユーザが発行元となる組織による選考基準、または学会の種類による選考基準などを理解することなく、所望のデータのジャンルが付与された技術文献にアクセスしやすくすることができる。そのため、複数の技術文献が保存された文書データから所望の文書データを得るための時間を短くでき、検索効率を向上させることができる。
ジャンルリストJLは、データ処理装置100で、ジャンルを更新される構成が好ましい。更新されるジャンルリストJLには、あらかじめユーザが想定したジャンルリストJL内のジャンルJD以外の、ジャンル生成によって得られたジャンルが追加される。当該構成とすることで、技術文献内の、ユーザが把握できていないジャンルを把握しやすくすることができる。
ジャンルリストJLは、図3Bに一例として図示することができる。ジャンルリストJLは、「#ジャンルリスト」で構成される。「#ジャンルリスト」は、図3Bの例では「1.Display」、「2.Memory」、「3.Processor」、「4.AI」が相当する。図3Bのジャンルの項目は、ジャンルJD_1乃至JD_4として図示している。
ジャンルリストJLは、その他の項目を有する。その他の項目は、図3Bの例では「5.Other」が相当する。図3Bのその他の項目は、ジャンルJD_OTHとして図示している。複数のジャンルに関する項目の他、その他の項目をジャンルリストJLに用意しておくことで、ユーザが付与する複数のジャンルに対応しない文書データがある場合に、誤ったジャンル分けとなることを低減することができる。
記憶部20および記憶部30は、メモリ領域であり、プログラム及び/又はデータ等を記憶することができる。プログラムとしては、代表的にはデータ処理部40が実行するプログラムがある。記憶部20に記憶されるデータとしては、入力部10より伝送される文書データDOC、ジャンルリストJL、および文書データDOCに応じて生成された要約データがある。記憶部30に記憶されるデータとしては、データ処理部40で処理途中の文書データの一部、要約データなど、が含まれる。当該構成とすることで、ユーザは処理途中のデータがある記憶部30にアクセスすることなく、文書データDOCに関連付けられたデータにアクセスすることができる。
記憶部20および記憶部30は、揮発性メモリ及び不揮発性メモリのうち少なくとも一方を有する。揮発性メモリとしては、DRAM(Dynamic Random Access Memory)、及び、SRAM(Static Random Access Memory)等が挙げられる。不揮発性メモリとしては、ReRAM(Resistive Random Access Memory、抵抗変化型メモリともいう)、PRAM(Phase change Random Access Memory)、FeRAM(Ferroelectric Random Access Memory)、MRAM(Magnetoresistive Random Access Memory、磁気抵抗型メモリともいう)、及びフラッシュメモリ等が挙げられる。
データ処理部40は、演算、解析、及び推論などのデータ処理を行う機能を有する。データ処理部40は、記憶部20および記憶部30からデータを取得する。データ処理部40は、記憶部20および記憶部30のデータを用いて、データ処理装置100の外部に送信する、指示文、文章などが記述されたプロンプト(質問文)を生成する機能を有する。
データ処理部40は、上記機能を発現するために少なくとも演算回路を有する。演算回路として例えば中央演算装置(CPU:Central Processing Unit)を有することができる。またデータ処理部40は、CPUに加えて又はCPUに代えて、GPU(Graphics Processing Unit)を有することも可能である。
データ処理部40は、CPU又はGPUに加えてDSP(Digital Signal Processor)等のマイクロプロセッサを有していてもよい。DSPはデジタル信号処理に特化しているため、CPU又はGPUの周辺回路等を制御するために搭載すると好ましい。マイクロプロセッサは、FPGA(Field Programmable Gate Array)、FPAA(Field Programmable Analog Array)等のハードウェアで動作するPLD(Programmable Logic Device)によって実現された構成とすることも可能である。
データ処理部40は、記憶部20および記憶部30のデータを用いて、複数の処理を行う機能を有する。データ処理部40は、要約データ生成、ジャンル仕分け、およびジャンル生成といった処理を実行するためのプロンプトを生成する機能を有する。図1Aでは、データ処理部40内に、要約データ生成部41、およびジャンル仕分け部42といったプロンプトを生成する構成を図示している。
要約データ生成部41は、複数の文書データDOCのそれぞれに対応する要約データを、データ生成装置70で生成するためのプロンプトの出力、および当該プロンプトのための文書データDOCのデータ処理を行う機能を有する。なお要約データは、データ処理装置100によって複数の文書データDOCごとのデータ処理を行い、データ生成装置70で生成されるデータである。
文書データDOCに基づく要約データABDの生成のステップは、図2に図示するステップS12に相当する。
要約データ生成部を有する構成により、複数の文書データのそれぞれに対し、一様な基準をもとに生成された要約データを生成することができる。当該構成とすることで、論文、学会予稿集などの技術文献の要約データを、一様な基準をもとに生成された要約データとして、文書データに関連付け(紐づけともいう)することができる。当該構成とすることで効率的に文書データ内容を把握する上で重要となる要約データの内容のばらつきをなくし、可読性を高めることができる。
ジャンル仕分け部42は、文書データDOCのそれぞれに対してジャンルリストJLに記述されたジャンルのいずれかを付与するため、文書データDOCに応じたジャンルをデータ生成装置70で生成するためのプロンプトの出力、および当該プロンプトのための要約データ、文書データDOCのデータ処理を行う機能を有する。
要約データABDをもとにユーザが付与したジャンルリストJLに基づくジャンルJDの項目の取得のステップは、図2に図示するステップS13に相当する。
ジャンル仕分け部42を有する構成により、複数の文書データDOCのそれぞれに対し、一様な基準をもとに生成された要約データをもとに、ユーザが付与したジャンルリストJLに基づいたジャンルを付与することができる。その結果、文書データDOCと、一様な基準をもとに生成された要約データと、要約データをもとにユーザがデータ処理装置に与えたジャンルリストJLに記述されたジャンルのいずれかと、を関連付けることができる。そのため、ジャンルを選択することで、一様な基準をもとに生成された要約データから文書データの内容を把握することができ、検索効率を高めることができる。
ステップS12によって文書データDOCに関連付けられた要約データABD、ステップS13によって文書データDOCに関連付けられたジャンルJDは、記憶部20に格納される。当該ステップは、図2に図示するステップS14に相当する。
本発明の一態様は、特に文書データが類似のジャンルの論文、類似のジャンルの学会予稿集などの技術文献で出版社、学会などが異なる文書データが混在している場合に、類似のジャンルの文書データの集合であるが故に、探索が困難な文書データの検索を行うためのデータ処理に好適である。これは論文、類似のジャンルの学会予稿集などの技術文献が出版社、学会毎に異なる取り決めでジャンル(分野)分けしているためである。本発明の一態様のように、一定の取り決めで、技術分野ごとにジャンル(分野)分けを再仕分けすることで、特許文献のように一定の取り決めで技術分野ごとのジャンル(分野)分けを行うことができる。そのため、当該データ処理がなされたデータを用いて、所望の文書データを検索する際の検索効率を高めることができる。
なお図1Aでは、データ処理部40内に、要約データ生成部41、およびジャンル仕分け部42の他、ジャンル生成部43を図示している。データ処理装置100が有するデータ処理部40は、ジャンル生成部43を有することが好ましい。
ジャンル生成部43は、ジャンル仕分け部42のプロンプトによってその他のジャンル(図3BのジャンルJD_OTH)の項目が取得される場合に、最初にユーザが入力したジャンルリストJLにはない新たなジャンルを生成するためのプロンプトの出力、および当該プロンプトのための要約データのデータ処理を行う機能を有する。
ジャンル生成部43を有する構成により、その他のジャンルが付与された要約データのそれぞれに対し、新たなジャンルを生成することができる。一様な基準をもとに生成された要約データをもとに、ジャンルリストを更新する構成とできるため、その他のジャンルが付与される複数の文書データDOCおよび要約データの数を減らすことができるとともに、ジャンルリストの作成およびジャンル仕分けの利便性を向上させることができる。
出力部60は、データ処理装置100の外部にあるデータ生成装置70に送信する、指示文、文章などが記述されたプロンプトを送信する機能を有する。データ処理装置100は、図1Cに図示するように、出力部60よりプロンプトPDが入力される。プロンプトPDは、データ処理部40で付与された指示文の他、データ処理部40で文書データDOCを処理して生成されたテキストデータ、および/またはジャンルリストJLを含むデータである。
出力部60は、データ処理装置100の外部にあるデータ生成装置70で生成されたデータを受信する機能を有する。データ処理装置100は、図1Cに図示するように、出力部60でプロンプトPDの指示文に応じて生成された生成データGD(回答文ともいう)を受信する。出力部60は、生成データGDを取得する。出力部60は、伝送部90を介して、取得したデータをデータ処理部40、記憶部20または記憶部30に伝送する。
データ処理装置100とデータ生成装置70との間で行われるデータの受信は、例えばデータ生成装置70を用いたサービスの提供者と、当該サービスを享受するユーザとが、同じ企業等の組織内に属する場合、当該組織内に構築されたネットワークを用いて行われることが好ましい。これにより、インターネットを介して行う場合に比べて安全に、データ処理装置100とデータ生成装置70との間でデータを受信することができる。また、組織内の情報が外部へ流出することを防止することができる。または、データ処理装置100とデータ生成装置70との間で行われるデータの送受信は、インターネットを用いて行われてもよい。
伝送部90は、データを伝達する機能を有する。入力部10、記憶部20、30、データ処理部40、出力部60の間のデータの送受信は、伝送部90を介して行うことができる。
データ生成装置70は、言語モデルを用いた処理を行うことができる。例えば、BERT(Bidirectional Encoder Representations from Transformer)、T5(Text−to−Text Transfer Transformer)などの自然言語処理モデルを用いた処理を実行することができる。データ生成装置70は、様々な自然言語処理タスクを行うことができる汎用言語処理モデルを用いた処理を実行することができる。データ生成装置70は、言語モデルを用いた処理を行う装置であり、単に言語モデルという場合がある。
また、データ生成装置70は、LLMを利用したモデル(文書生成モデル、対話モデルなど)を用いた処理を行うことができる。例えば、LLMとしてGPT−3、GPT−3.5、GPT−4、LaMDA(Language Model for Dialogue Applications)、PaLM(Pathways Language Model)、Llama2などを用いることができる。勿論LLMには、組織内で構築されたモデルを用いることができる。
データ生成装置70は、言語モデルを用いた処理により、データ処理装置100より出力されるプロンプトPD(質問文)に対する回答文である生成データGDをデータ処理装置100に入力することができる。
データ処理部40で作成されるプロンプトPDについて、図4乃至図17を参照して説明する。以下では、上述したデータ処理部40で行う、要約データ生成、ジャンル仕分け、およびジャンル生成といった処理を実行するためのプロンプト、および文書データDOCのデータ処理について説明する。
<要約データ生成の構成例>
図4は、データ処理部40の要約データ生成部41で行う要約データ生成を説明するフローチャートである。図5Aは、文書データDOCにおけるチャンクデータCHDを説明する模式図である。図5Bは、チャンクデータCHDが格納される記憶部30の模式図である。図6A乃至図6Eは、データ処理装置100からデータ生成装置70に入力されるチャンクデータCHDを含むプロンプトPD_1およびチャンクデータCHDに対応する第1要約データCABの模式図である。図7Aは、チャンクデータCHDに対応する第1要約データCABが格納される記憶部30の模式図である。図7Bは、テキストデータOD1およびチャンクデータCHDを含むプロンプトPD_1の模式図である。図8Aは、データ処理装置100からデータ生成装置70に入力される複数の第1要約データCABを含むプロンプトPD_2、および複数の第1要約データCABに対応する要約データABDの模式図である。図8Bは、テキストデータOD2および複数の第1要約データCABを含むプロンプトPD_2の模式図である。図8Cは、複数の第1要約データCABに対応する要約データABD(第2要約データに相当)が文書データDOCに関連付けられて格納される記憶部20の模式図である。図9は、複数の文書データDOC_1乃至DOC_3ごとに、要約データを得るまでの第1要約データおよび第2要約データを説明する模式図である。
図4は、データ処理部40の要約データ生成部41で行う要約データ生成を説明するフローチャートである。図5Aは、文書データDOCにおけるチャンクデータCHDを説明する模式図である。図5Bは、チャンクデータCHDが格納される記憶部30の模式図である。図6A乃至図6Eは、データ処理装置100からデータ生成装置70に入力されるチャンクデータCHDを含むプロンプトPD_1およびチャンクデータCHDに対応する第1要約データCABの模式図である。図7Aは、チャンクデータCHDに対応する第1要約データCABが格納される記憶部30の模式図である。図7Bは、テキストデータOD1およびチャンクデータCHDを含むプロンプトPD_1の模式図である。図8Aは、データ処理装置100からデータ生成装置70に入力される複数の第1要約データCABを含むプロンプトPD_2、および複数の第1要約データCABに対応する要約データABDの模式図である。図8Bは、テキストデータOD2および複数の第1要約データCABを含むプロンプトPD_2の模式図である。図8Cは、複数の第1要約データCABに対応する要約データABD(第2要約データに相当)が文書データDOCに関連付けられて格納される記憶部20の模式図である。図9は、複数の文書データDOC_1乃至DOC_3ごとに、要約データを得るまでの第1要約データおよび第2要約データを説明する模式図である。
図1Aで説明したデータ処理部40では、図4に図示するように、要約データを生成するためのステップとして、チャンクデータCHDの生成(ステップS21)、チャンクデータCHDの保存(ステップS22)、プロンプトPD_1に基づく第1要約データCABの生成(ステップS23)、第1要約データCABの保存(ステップS24)、プロンプトPD_2に基づく要約データABD(第2要約データ)の生成(ステップS25)、および要約データABDの保存(ステップS26)を有する。
チャンクデータとは、文書データ内のつながりのある部分を一つの塊としたテキストデータである。第1要約データとは、チャンクデータを要約したデータであり、文書データ内の一部分の要約に相当する。第2要約データとは、複数の第1要約データをもとに集約されたデータである。
図5Aは、ステップS21のチャンクデータCHDの一例として、文書データDOCを図示している。文書データDOCは、複数のパラグラフDOC_P1乃至DOC_P6を有する。図5Aに図示するように、文書データDOCが段組みされたテキストデータの場合、同じ見出し(段落、章立て、目次、または改行)にあるパラグラフDOC_P3およびDOC_P4を別の塊としている。
チャンクデータCHDは、同じ見出し(段落、章立て、目次、または改行)にあるパラグラフを文書データDOC内のつながりのある部分とみなして、一つの塊としたテキストデータである。当該構成とすることで、一次要約データを生成する際の内容のばらつきをなくし、可読性を高めることができる。図5Aの文書データDOCでは、パラグラフDOC_P3およびDOC_P4を意味のある固まりとして併合し、チャンクデータCHD_1乃至CHD_5として図示している。チャンクデータCHD_1乃至CHD_5は、文書データDOCを分割して得られるデータといえる。
図5Bは、ステップS22のチャンクデータCHDの保存の一例として、記憶部30に格納されるチャンクデータCHD_1乃至CHD_5を図示している。チャンクデータCHDは、文書データDOCの要約データABDを得るための処理途中のデータである。ユーザがアクセスしない記憶部30と、文書データDOCが記憶された記憶部20と、を分けることでチャンクデータCHDを得る処理を高速化することができる。
図6A乃至図6Eは、ステップS23の一例として、データ処理装置100から、チャンクデータCHD_1乃至CHD_5を有するプロンプトPD_1をデータ生成装置70に送信し、第1要約データCAB_1乃至CAB_5を生成する際の模式図である。プロンプトPD_1は第1プロンプトという場合がある。プロンプトPD_1は、第1要約データCABがデータ生成装置70の回答文となるよう指示文およびチャンクデータCHDが記述されたプロンプトである。
チャンクデータCHD_1乃至CHD_5のいずれか一を有するプロンプトPD_1は、複数回にわたって、データ処理装置100からデータ生成装置70に送信される。当該構成とすることで、プロンプトPD_1がトークン数の上限を超えないようにすることができる。複数のチャンクデータCHD_1乃至CHD_5に対応する第1要約データCAB_1乃至CAB_5はそれぞれ、内容にまとまりのあるテキストデータの要約データとすることができる。
図7Aは、ステップS24の第1要約データCABの保存の一例として、記憶部30に格納される第1要約データCAB_1乃至CAB_5を図示している。第1要約データCABは、文書データDOCの要約データABDを得るための処理途中のデータである。ユーザがアクセスしない記憶部30と、文書データDOCが記憶された記憶部20と、を分けることで第1要約データCABを得る処理を高速化することができる。
図7Bは、プロンプトPD_1を説明する模式図である。プロンプトPD_1は、例えば「#指示文」および「#文章」で構成される。「#指示文」には、テキストデータOD1が記述される。「#文章」にはチャンクデータCHD_1乃至CHD_5のいずれか一が記述される。テキストデータOD1は、定型文である。なお、当該定型文しては、例えば「「以下の文章を400字以内で要約してください。原文に出てくる数値をできるだけ含むようにまとめて下さい」とすることができる。
図8Aは、ステップS25の一例として、データ処理装置100から、第1要約データCAB_1乃至CAB_5(複数の第1要約データCABに相当)を有するプロンプトPD_2をデータ生成装置70に送信し、文書データDOCの要約である要約データABD(第2要約データ)を生成する際の模式図である。プロンプトPD_2は第2プロンプトという場合がある。プロンプトPD_2は、要約データABDがデータ生成装置70の回答文となるよう指示文および複数の第1要約データCABが記述されたプロンプトである。元の文書データDOCの内容を包含するチャンクデータから生成された第1要約データCABの場合、生成された要約データABDは文書データDOCの内容に沿った要約データである。
複数の第1要約データCABを有するプロンプトPD_2は、プロンプトPD_2がトークン数の上限を超えないようにするため、プロンプトPD_2が有する第1要約データCABを複数回にわたって分けてデータ生成装置70に送信することが好ましい。
図9は、複数の文書データDOC_1乃至DOC_3ごとに、チャンクデータCHD、第1要約データCABを経て、要約データABDを得るまでを説明する模式図である。
図9に示す文書データDOC_2では、チャンクデータCHD_1乃至CHD_5、第1要約データCAB_1乃至CAB_5を経て、要約データABD_2が得られる。第1要約データCAB_1乃至CAB_5は、要約データABD_2を得るまでの一次要約データ、要約データABD_2は二次要約データと呼ぶことができる。
また図9に示す文書データDOC_1は、文書データDOC_2よりテキスト量の大きい文書データである。この場合、元の文書データDOC_1のテキストデータは、例えばチャンクデータCHD_1乃至CHD_10に分割され、プロンプトPD_1に基づいて第1要約データCAB_1乃至CAB_10を得ることとなる。第1要約データCAB_1乃至CAB_10は、プロンプトPD_2とともに処理できるトークン数を超える場合、例えば、第1要約データCAB_1乃至CAB_5と、第1要約データCAB_6乃至CAB_10と、に分けて処理する。第1要約データCAB_1乃至CAB_5は、プロンプトPD_2に基づいて第1要約データCAB_1−5を得ることができる。第1要約データCAB_6乃至CAB_10は、プロンプトPD_2に基づいて第1要約データCAB_6−10を得ることができる。文書データDOC_1では、チャンクデータCHD_1乃至CHD_10、第1要約データCAB_1乃至CAB_10、第1要約データCAB_1−5および第1要約データCAB_6−10を経て、要約データABD_1が得られる。この場合、第1要約データCAB_1乃至CAB_10は一次要約データ、第1要約データCAB_1−5および第1要約データCAB_6−10は二次要約データ、要約データABD_1は三次要約データと呼ぶことができる。
また図9に示す文書データDOC_3は、文書データDOC_1、DOC_2よりテキスト量の大きい文書データである。この場合、元の文書データDOC_3のテキストデータは、例えばチャンクデータCHD_1乃至CHD_kに分割され、プロンプトPD_1に基づいて第1要約データCAB_1乃至CAB_kを得ることとなる。第1要約データCAB_1乃至CAB_kは、文書データDOC_1と同様に、プロンプトPD_2とともに処理できるトークン数を超える。この場合、例えば、第1要約データCAB_1乃至CAB_5と、第1要約データCAB_6乃至CAB_10、第1要約データCAB_k−4乃至CAB_kなどのように分けて処理する。第1要約データCAB_1乃至CAB_5は、プロンプトPD_2に基づいて第1要約データCAB_1−5を得ることができる。第1要約データCAB_6乃至CAB_10は、プロンプトPD_2に基づいて第1要約データCAB_6−10を得ることができる。第1要約データCAB_k−4乃至CAB_kは、プロンプトPD_2に基づいて第1要約データCAB_k−4−kを得ることができる。
文書データDOC_3では、チャンクデータCHD_1乃至CHD_k、第1要約データCAB_1乃至CAB_k、第1要約データCAB_1−5、CAB_6−10乃至、CAB_k−4−kなどといった、複数回(例えばN−1回(Nは3以上の自然数))のプロンプトPD_2に基づく第1要約データCABの生成を経て、第1要約データCAB_Pおよび第1要約データCAB_Qを得ることができる。文書データDOC_3では、第1要約データCAB_Pおよび第1要約データCAB_Qを経て、要約データABD_3が得ることができる。この場合、第1要約データCAB_1乃至CAB_10は一次要約データ、第1要約データCAB_1−5、第1要約データCAB_6−10および、第1要約データCAB_k−4−kは二次要約データ、第1要約データCAB_Pおよび第1要約データCAB_Qは(N−1)次要約データ、要約データABD_3はN次要約データと呼ぶことができる。
図9に示す文書データDOC_1乃至DOC_3に図示するように、データ処理装置100で要約データを生成する場合、異なるテキスト量の文書データを処理することとなる。当該文書データから要約データABDを得るためには、文書データごとに分割数の異なるチャンクデータCHDおよび第1要約データCABを複数回にわたって処理する構成となる。このような構成とすることで、一様な基準をもとに生成された要約データを生成することができる。その結果、論文、学会予稿集などの技術文献の要約データを、一様な基準をもとに生成された要約データとすることができる。さらには効率的に内容を把握する上で重要となる要約データの内容のばらつきをなくし、可読性を高めることができる。
図8Bは、プロンプトPD_2を説明する模式図である。プロンプトPD_2は、例えば「#指示文」および「#文章」で構成される。「#指示文」には、テキストデータOD2が記述される。「#文章」には複数の第1要約データCAB(例えば第1要約データCAB_1乃至CAB_5)が記述される。テキストデータOD2は、定型文である。なお、当該定型文しては、例えば「以下の文章を400字以内で要約してください。原文に出てくる数値をできるだけ含むようにまとめて下さい」とすることができる。
図8Cは、ステップS26の要約データABD(第2要約データ)の保存の一例として、記憶部20に格納される要約データABD_1乃至ABD_3を図示している。要約データABD_1乃至ABD_3はそれぞれ、文書データDOC_1乃至DOC_3に対応して記憶することができる。要約データABDは、ユーザが検索時にアクセスするデータである。ユーザがアクセスする記憶部20と、処理途中のデータを記憶する記憶部30と、別の記憶部とすることで、要約データ生成とユーザのアクセスとを分けることができる。要約データ生成による処理の影響によってユーザのアクセスが遅滞することが抑制できるため、要約データABDにアクセスする処理を高速化することができる。
なお文書データDOCの言語は外国語の場合、要約データABDも外国語となる。記憶部20に格納される要約データABDの言語が外国語の場合、母国語に翻訳しておくことが好ましい。当該構成とすることで、ユーザが記憶部20にアクセスして情報検索を行う場合の可読性を高めることができる。
なお文書データDOCを元に要約データを作成する方法としては、上記構成の他、MAP Reduce法、Refine法などの手法を適用することが可能である。要約データを作成する方法は、上記構成に加え、前述の手法を組み合わせることも可能である。
以上説明したように、本発明の一態様のデータ処理装置は要約データ生成部41を有する構成により、複数の文書データDOCのそれぞれに対し、一様な基準をもとに生成された要約データを生成することができる。当該構成とすることで、論文、学会予稿集などの技術文献の要約データを、一様な基準をもとに生成された要約データとすることができる。当該構成とすることで効率的に内容を把握する上で重要となる要約データの内容のばらつきをなくし、可読性を高めることができる。
<ジャンル仕分けの構成例>
図10は、データ処理部40のジャンル仕分け部42が行うジャンル仕分けを説明するフローチャートである。図11Aは、データ処理装置100からデータ生成装置70に入力される要約データABD、ジャンルリストJLを含むプロンプトPD_3および要約データABDに対応するジャンルJDの模式図である。図11Bは、テキストデータOD3、要約データABD、およびジャンルリストJLを含むプロンプトPD_3の模式図である。図12Aは、文書データDOCに関連付けられた要約データABDおよびジャンルJDが格納される記憶部20の模式図である。図12Bは、その他のジャンルが付与された要約データABDが格納される記憶部30の模式図である。
図10は、データ処理部40のジャンル仕分け部42が行うジャンル仕分けを説明するフローチャートである。図11Aは、データ処理装置100からデータ生成装置70に入力される要約データABD、ジャンルリストJLを含むプロンプトPD_3および要約データABDに対応するジャンルJDの模式図である。図11Bは、テキストデータOD3、要約データABD、およびジャンルリストJLを含むプロンプトPD_3の模式図である。図12Aは、文書データDOCに関連付けられた要約データABDおよびジャンルJDが格納される記憶部20の模式図である。図12Bは、その他のジャンルが付与された要約データABDが格納される記憶部30の模式図である。
図1Aで説明したデータ処理部40では、図10に図示するように、ジャンル仕分けを行うためのステップとして、プロンプトPD_3に基づくジャンルJDの取得(ステップS31)、ジャンルJDの保存(ステップS32)、その他のジャンルが付された要約データが複数あるか否かの判断(ステップS33)、ジャンルJDの生成処理(ステップS34)、生成したジャンルJDが妥当か否かの判断(ステップS35)、およびジャンルリストJLの更新(ステップS36)を有する。
図11Aは、ステップS31の一例として、データ処理装置100から、要約データABDおよびジャンルリストJLを有するプロンプトPD_3をデータ生成装置70に送信し、要約データABDに応じたジャンルリストJLに記述されたジャンルJDの項目を選択するデータを生成する際の模式図である。プロンプトPD_3は第3プロンプトという場合がある。プロンプトPD_3は、ジャンルリストJLに記述されたジャンルJDの項目のいずれかがデータ生成装置70の回答文となるよう指示文、要約データABDおよびジャンルリストJLが記述されたプロンプトである。
図11Bは、プロンプトPD_3を説明する模式図である。プロンプトPD_3は、例えば「#指示文」、「#文章」、「#ジャンルリスト」で構成される。「#指示文」には、テキストデータOD3が記述される。「#文章」には文書データDOCに対応する要約データABDが記述される。「#ジャンルリスト」には複数のジャンルJD(ジャンルJD_1乃至JD_4、およびJD_OTHを例示)を含むジャンルリストJLが記述される。テキストデータOD3は、定型文である。なお、当該定型文しては、例えば「以下の文章の内容からジャンル1乃至5のどれに属するか選択してください。回答はジャンルの数字のみとしてください」とすることができる。
図12Aは、ステップS32のジャンルJDの保存の一例として、記憶部20に格納されるジャンルJD_1乃至JD_3を図示している。ジャンルJD_1乃至JD_3はそれぞれ、文書データDOC_1乃至DOC_3および要約データABD_1乃至ABD_3に対応して記憶することができる。ジャンルJD、要約データABD及び文書データDOCは、ユーザが検索時にアクセスするデータである。ユーザがアクセスする記憶部20と、処理途中のデータを記憶する記憶部30と、を分けることでジャンルJDにアクセスする処理を高速化することができる。
図12Bは、ステップS33においてその他のジャンルの項目が取得された要約データが複数ある場合の一例として、要約データABD_4乃至ABD_6に関連付けられたジャンルJD_OTHを図示している。ジャンルJD_OTHの項目が取得された要約データABD_4乃至ABD_6は、記憶部30に記憶することができる。
図12BのようにジャンルJD_OTHの項目が取得された要約データABDが複数ある場合、ジャンルJD_OTHの項目が取得された要約データABDおよび文書データDOCの内容の把握が困難な場合がある。この場合、後述するジャンル生成によって、ジャンルJD_OTHの項目が取得された要約データABDを分類可能なジャンルを生成し、ジャンル仕分けする構成が好ましい。当該構成では、ジャンルJD_OTHの項目が取得された要約データABDは、ジャンル生成を行うための処理途中のデータであり、ユーザがアクセスしない記憶部30となる。ユーザがアクセスしない記憶部30と、文書データDOCが記憶された記憶部20と、を分けることでジャンル生成を行うための処理を高速化することができる。
上述したように記憶部20は、文書データに関連付けられた要約データABDおよびジャンルJDの項目が記憶される。また記憶部30は、チャンクデータCHD、一次要約データ、およびその他のジャンルの項目が取得された(付された)要約データABDが記憶される。当該構成とすることで、ユーザは処理途中のデータがある記憶部30にアクセスすることなく、文書データDOCに関連付けられたデータが記憶された記憶部20にアクセスすることができる。
以上説明したように、本発明の一態様のデータ処理装置はジャンル仕分け部42を有する構成により、複数の文書データDOCのそれぞれに対し、一様な基準をもとに生成された要約データをもとに、ユーザが付与したジャンルリストに基づいたジャンルを生成することができる。一様な基準をもとに生成された要約データをもとに、ジャンル仕分けを行う構成とできるため、検索効率を高めることができる。
本発明の一態様は、特に文書データDOCが類似のジャンルの論文、類似のジャンルの学会予稿集などの技術文献で出版社、学会などが異なる文書データが混在している場合に、類似のジャンルの文書データの集合であるが故に、探索が困難な文書データの検索を行うためのデータ処理に好適である。これは論文、類似のジャンルの学会予稿集などの技術文献が出版社、学会毎に異なる取り決めでジャンル(分野)分けしているためである。本発明の一態様のように、一定の取り決めで、技術分野ごとにジャンル(分野)分けを再仕分けすることで、特許文献のように一定の取り決めで技術分野ごとのジャンル(分野)分けを行うことができる。そのため、当該データ処理がなされたデータを用いて、所望の文書データを検索する際の検索効率を高めることができる。
<ジャンル生成の構成例1>
図13Aは、図10で説明したステップS34に対応する、データ処理部40のジャンル生成部43が行うジャンル生成を説明するフローチャートである。図13Bは、ジャンル生成において用いられるベクトル化に伴うクラスタ、およびクラスタCCの中心にある要約データCCABの模式図である。図14Aは、データ処理装置100からデータ生成装置70に入力される要約データCCABおよび要約データCCABを含むプロンプトPD_4、および生成されたジャンルJD_Nの模式図である。図14Bは、指示文、および要約データCCABを含むプロンプトPD_4の模式図である。図14Cは、図3Bで例示したジャンルリストJLに、生成されたジャンルJD_Nが追加されたジャンルリストJL_Nの模式図である。
図13Aは、図10で説明したステップS34に対応する、データ処理部40のジャンル生成部43が行うジャンル生成を説明するフローチャートである。図13Bは、ジャンル生成において用いられるベクトル化に伴うクラスタ、およびクラスタCCの中心にある要約データCCABの模式図である。図14Aは、データ処理装置100からデータ生成装置70に入力される要約データCCABおよび要約データCCABを含むプロンプトPD_4、および生成されたジャンルJD_Nの模式図である。図14Bは、指示文、および要約データCCABを含むプロンプトPD_4の模式図である。図14Cは、図3Bで例示したジャンルリストJLに、生成されたジャンルJD_Nが追加されたジャンルリストJL_Nの模式図である。
図1Aで説明したデータ処理部40では、図13Aに図示するようにジャンル生成を行うためのステップとして、ジャンルJD_OTHの項目が取得された要約データABDをベクトル化し、クラスタリング(ステップS41)、クラスタCCの中心にある要約データABDを要約データCCABとして選出(ステップS42)、プロンプトPD_4に基づくジャンルJD_Nの生成(ステップS43)を有する。
クラスタCCとは、ジャンルJD_OTHの項目が取得された要約データABDをベクトル化して得られる要約データの集合である。要約データABDをベクトル化する方法には、様々な手法を用いることができる。例えば、Bag−of−Words、BERT等を用いることができる。クラスタCCの中心にある要約データCCABは、ジャンルJD_OTHの項目が取得された要約データABDのクラスタCCの中心点を算出し、当該中心点に近いベクトル座標にある要約データABDを要約データCCABとして選出することができる。
図13Bは、ステップS41およびS42の一例として、ジャンルJD_OTHの項目が取得された要約データABDをベクトル化して得られる複数のクラスタCC_1乃至CC_3を模式的に表した図である。ジャンルJD_OTHの項目が取得された要約データABDは、例えば3つのクラスタCC_1乃至CC_3に大別することができる。クラスタCC_1乃至CC_3のそれぞれにおいて、中心にある要約データCCAB_1乃至CCAB_3が選出される。
図14Aは、ステップS43の一例として、データ処理装置100から、要約データCCABを有するプロンプトPD_4をデータ生成装置70に送信し、要約データCCABに応じた新たなジャンルJD_Nを生成する際の模式図である。プロンプトPD_4は第4プロンプトという場合がある。プロンプトPD_4は、新たなジャンルJD_Nを回答するよう指示文、および要約データCCABが記述されたプロンプトである。
図14Bは、プロンプトPD_4を説明する模式図である。プロンプトPD_4は、例えば「#指示文」、「#文章」で構成される。「#指示文」には、テキストデータOD4が記述される。「#文章」にはステップS42で選出された要約データCCABが記述される。テキストデータOD4は、定型文である。なお、当該定型文しては、例えば「以下の文章の内容からジャンル名を教えてください」とすることができる。
なおプロンプトPD_4に含まれる「#文章」には要約データCCABの他、要約データCCABが属するクラスタCC内で近傍にある別の要約データと併せて新たなジャンルJD_Nを回答するよう指示をすることが好ましい。当該構成とすることで、精度の高い回答を得ることができる。またクラスタCC内で近傍にある別の要約データは、複数回にわたって入れ替えて同じ内容の指示文の回答を得ることで、精度の高い回答を得ることができる。複数回の指示文によって複数の回答が得られた場合、最適解についてデータ生成装置70に問い合わせることも可能である。
図14Cは、一例として図3Bに図示したジャンルリストJLが、上記ジャンル生成のステップに基づいて更新された場合の、ジャンルリストJL_Nの模式図である。ジャンルリストJL_Nは、「#ジャンルリスト」で構成される。「#ジャンルリスト」は、ジャンルリストJLで説明した各ジャンルJDの他、追加されたジャンルJD_Nを有する。追加されたジャンルの項目は、図14Cの例では「5.Battery」が相当する。またジャンルに付した番号が更新される。当該ジャンルリストの更新は、図10に図示したステップS36に相当する。
上記ステップS41乃至S43によって得られたジャンルJD_Nは、妥当か否かをデータ生成装置70に問い合わせることが好ましい。当該ステップは、図10に図示したステップS35に相当する。ステップS35は省略することが可能である。
<ジャンル生成の構成例2>
図15は、図10で説明したステップS34に対応する、データ処理部40のジャンル生成部43が行うジャンル生成を説明する別のフローチャートである。図16Aは、データ処理装置100からデータ生成装置70に入力される要約データABDおよび要約データABDを含むプロンプトPD_5、および生成されたキーワードリストKWLの模式図である。図16Bは、指示文、および要約データABDを含むプロンプトPD_5の模式図である。図16Cは、生成されたキーワードリストKWLの模式図である。図17は、キーワードリストKWLと、別の要約データABD_7と、の照合を説明する模式図である。
図15は、図10で説明したステップS34に対応する、データ処理部40のジャンル生成部43が行うジャンル生成を説明する別のフローチャートである。図16Aは、データ処理装置100からデータ生成装置70に入力される要約データABDおよび要約データABDを含むプロンプトPD_5、および生成されたキーワードリストKWLの模式図である。図16Bは、指示文、および要約データABDを含むプロンプトPD_5の模式図である。図16Cは、生成されたキーワードリストKWLの模式図である。図17は、キーワードリストKWLと、別の要約データABD_7と、の照合を説明する模式図である。
図1Aで説明したデータ処理部40では、図15に図示するように、ジャンル生成を行うためのステップとして、プロンプトPD_5に基づくキーワードKWの抽出(ステップS51)、抽出したキーワードKWを要約データABDに関連付けて保存(ステップS52)、抽出したキーワードKWが他の要約データABD中に存在するか否かの判断(ステップS53)、抽出したキーワードKWをジャンルリストJL_Nに選出(ステップS54)を有する。
図16Aは、ステップS51の一例として、データ処理装置100から、ジャンルJD_OTHの項目が取得された要約データABDを有するプロンプトPD_5をデータ生成装置70に送信し、要約データABDに応じた複数のキーワードKWを有するキーワードリストKWLを生成する際の模式図である。プロンプトPD_5は第5プロンプトという場合がある。プロンプトPD_5は、新たなジャンルJD_Nを回答するよう指示文、および要約データCCABが記述されたプロンプトである。
ステップS51で得られた複数のキーワードKWを有するキーワードリストKWLは、要約データABDに関連付けて保存される。キーワードKWを有するキーワードリストKWLの記憶は、上述したチャンクデータ、一次要約データなどと同様に、記憶部30とすることが好ましい。
図16Bは、プロンプトPD_5を説明する模式図である。プロンプトPD_5は、例えば「#指示文」、「#文章」で構成される。「#指示文」には、テキストデータOD5が記述される。「#文章」にはジャンルJD_OTHの項目が取得された要約データABDのいずれか一が記述される。テキストデータOD5は、定型文である。なお、当該定型文しては、例えば「以下の文章の内容から主要なキーワードを抽出してください。キーワードは重要な順に3つまで提示してください。キーワードのみ回答して下さい」とすることができる。
複数のキーワードKWを有するキーワードリストKWLは、図16Cに一例として図示することができる。キーワードリストKWLは、複数のキーワードKWを有する「#キーワード」で構成される。キーワードKWは、図16Cの例では「1.酸化物」、「2.窒化物」、「3.金属」が相当する。図16CのキーワードKWは、キーワードKW_1乃至KW_3として図示している。
図17は、ステップS53の一例として、キーワードリストKWLと、別の要約データABD_7と、の照合を説明する模式図である。図17に示す模式図において要約データABD_7は、キーワードKW_2と同じ文言「窒化物」を有する。一方で、キーワードKW_1およびKW_3に対応する文言は、要約データABD_7中にない、あるいは少ない。この場合、ステップS54の一例として、キーワードKW_2がジャンルJD_Nとして選出される。要約データABD_7中に、キーワードKW_1乃至KW_3がない場合は、生成したキーワードリストKWLによるジャンル生成が終了となる。
要約データABD_7は、ジャンルJD_OTHの項目が取得された要約データABDの別の要約データABDであればよい。上述したクラスリングによって同じクラスタに属する要約データとすることも可能である。
以上説明したように、本発明の一態様のデータ処理装置はジャンル生成部43を有する構成により、その他のジャンルが付与された要約データのそれぞれに対し、新たなジャンルを生成することができる。一様な基準をもとに生成された要約データをもとに、ジャンルリストを更新する構成とできるため、その他のジャンルが付与される複数の文書データDOCおよび要約データの数を減らすことができるとともに、ジャンルリストの作成およびジャンル仕分けの利便性を向上させることができる。
ABD:要約データ、CAB:第1要約データ、CC:クラスタ、CCAB:要約データ、CHD:チャンクデータ、DOC:文書データ、GD:生成データ、JD:ジャンル、JL:ジャンルリスト、KW:キーワード、KWL:キーワードリスト、PD:プロンプト、10:入力部、20:記憶部、30:記憶部、40:データ処理部、41:要約データ生成部、42:ジャンル仕分け部、43:ジャンル生成部、50:入力装置、60:出力部、70:データ生成装置、90:伝送部、100:データ処理装置
Claims (6)
- 文書データと、複数のジャンルの項目およびその他の項目が列挙されたジャンルリストと、を受け付ける機能と、
前記文書データのテキストデータを分割することで複数のチャンクデータとし、前記複数のチャンクデータの一を含む第1プロンプトを言語モデルに送信することで前記複数のチャンクデータに対応する複数の第1要約データを取得する機能と、
前記複数の第1要約データを含む第2プロンプトを前記言語モデルに送信することで前記文書データの要約である第2要約データを取得する機能と、
前記第2要約データおよび前記ジャンルリストを含む第3プロンプトを前記言語モデルに送信することで前記文書データおよび前記第2要約データに応じた前記複数のジャンルの項目および前記その他の項目のいずれか一を取得する機能と、を有する、
データ処理装置。 - 文書データと、複数のジャンルの項目およびその他の項目が列挙されたジャンルリストと、を受け付ける機能と、
前記文書データのテキストデータを分割することで複数のチャンクデータとし、前記複数のチャンクデータの一を含む第1プロンプトを言語モデルに送信することで前記複数のチャンクデータに対応する複数の第1要約データを取得する機能と、
前記複数の第1要約データを含む第2プロンプトを前記言語モデルに送信することで前記文書データの要約である第2要約データを取得する機能と、
前記第2要約データおよび前記ジャンルリストを含む第3プロンプトを前記言語モデルに送信することで前記文書データおよび前記第2要約データに応じた前記複数のジャンルの項目および前記その他の項目のいずれか一を取得する機能と、
前記その他の項目が取得された前記第2要約データをベクトル化してクラスタリングする機能と、
前記クラスタリングによって複数のクラスタに分類された、前記その他の項目が取得された前記第2要約データにおいて、前記クラスタの中心にある前記第2要約データを選出する機能と、
前記選出された前記第2要約データを含む第4プロンプトを前記言語モデルに送信することで前記クラスタに応じたジャンルの項目を取得し、前記ジャンルリストの更新を行う機能と、を有する、
データ処理装置。 - 文書データと、複数のジャンルの項目およびその他の項目が列挙されたジャンルリストと、を受け付ける機能と、
前記文書データのテキストデータを分割することで複数のチャンクデータとし、前記複数のチャンクデータの一を含む第1プロンプトを言語モデルに送信することで前記複数のチャンクデータに対応する複数の第1要約データを取得する機能と、
前記複数の第1要約データを含む第2プロンプトを前記言語モデルに送信することで前記文書データの要約である第2要約データを取得する機能と、
前記第2要約データおよび前記ジャンルリストを含む第3プロンプトを前記言語モデルに送信することで前記文書データおよび前記第2要約データに応じた前記複数のジャンルの項目および前記その他の項目のいずれか一を取得する機能と、
前記その他の項目が取得された前記第2要約データのいずれか一を含む第5プロンプトを前記言語モデルに送信することで前記第2要約データが有する複数のキーワードを抽出し、前記その他の項目が取得された別の前記第2要約データ中に存在する前記キーワードをジャンルの項目として選出し、前記ジャンルリストの更新を行う機能と、を有する、
データ処理装置。 - 請求項1乃至3のいずれか一において、
前記文書データのテキストデータは、前記第1プロンプトのトークン数の上限に応じて、前記複数のチャンクデータに分割される、
データ処理装置。 - 請求項1乃至3のいずれか一において、
前記文書データのテキストデータは、前記文書データ中の段落、章立て、目次、または改行に応じて、前記複数のチャンクデータに分割される、
データ処理装置。 - 請求項1乃至3のいずれか一において、
第1記憶部および第2記憶部を有し、
前記文書データ、前記複数のジャンルの項目が取得された前記第2要約データは、前記第1記憶部に記憶され、
前記複数のチャンクデータ、前記複数の第1要約データおよび前記その他の項目が取得された前記第2要約データは、前記第2記憶部に記憶される、
データ処理装置。
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP2024061190 | 2024-04-05 | ||
| JP2024-061190 | 2024-04-05 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| WO2025210467A1 true WO2025210467A1 (ja) | 2025-10-09 |
Family
ID=97266621
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| PCT/IB2025/053336 Pending WO2025210467A1 (ja) | 2024-04-05 | 2025-03-31 | データ処理装置 |
Country Status (1)
| Country | Link |
|---|---|
| WO (1) | WO2025210467A1 (ja) |
Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN117150010A (zh) * | 2023-08-22 | 2023-12-01 | 北京百度网讯科技有限公司 | 文档分类方法、装置、电子设备及存储介质 |
| CN117591637A (zh) * | 2023-10-20 | 2024-02-23 | 北京猎户星空科技有限公司 | 一种内容扩展、问题答复方法、装置、系统、设备及介质 |
-
2025
- 2025-03-31 WO PCT/IB2025/053336 patent/WO2025210467A1/ja active Pending
Patent Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN117150010A (zh) * | 2023-08-22 | 2023-12-01 | 北京百度网讯科技有限公司 | 文档分类方法、装置、电子设备及存储介质 |
| CN117591637A (zh) * | 2023-10-20 | 2024-02-23 | 北京猎户星空科技有限公司 | 一种内容扩展、问题答复方法、装置、系统、设备及介质 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| Kula et al. | Application of the bert-based architecture in fake news detection | |
| US11106873B2 (en) | Context-based translation retrieval via multilingual space | |
| Qu et al. | The bag-of-opinions method for review rating prediction from sparse text patterns | |
| Ellaway et al. | Artificial scholarship: LLMs in health professions education research | |
| Chai | Design and implementation of English intelligent communication platform based on similarity algorithm | |
| CN120917439A (zh) | 内容生成系统 | |
| Costello et al. | Patapasco: a Python framework for cross-language information retrieval experiments | |
| WO2026051626A1 (zh) | 面向文档的问答方法、装置、电子设备、存储介质及产品 | |
| Sultana et al. | A review on different question answering system approaches | |
| Oshallah et al. | Cross-language approach for quranic qa | |
| US10318528B2 (en) | Query response using mapping to parameterized report | |
| CN114331932B (zh) | 目标图像生成方法和装置、计算设备以及计算机存储介质 | |
| US10474726B2 (en) | Generation of digital documents | |
| JP2025110612A (ja) | 情報処理装置、情報処理方法及び情報処理プログラム | |
| WO2025238509A1 (ja) | データ処理システム及びその動作方法 | |
| US12625889B2 (en) | AI user intent for actions on a user device | |
| US20260105355A1 (en) | AI Model Bundling and Splitting for Widescale Distribution | |
| US20260105321A1 (en) | Using General-Purpose AI Models as Special Purpose Classifiers | |
| Wang et al. | Open-world knowledge embedding in a low-text resource environment: L. Wang et al. | |
| WO2014188555A1 (ja) | テキスト処理装置、及び、テキスト処理方法 | |
| Christov | YOLOv5 for symbol extraction in P&ID diagrams | |
| Dambhare et al. | Smart map for smart city | |
| Lolli | Semantics and pragmatics in actual software applications and in web search engines: Exploring innovations | |
| Kubek et al. | On Self-Improving Token Embeddings | |
| WO2025142131A1 (ja) | 分析プログラム、情報処理装置、および分析方法 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| 121 | Ep: the epo has been informed by wipo that ep was designated in this application |
Ref document number: 25781939 Country of ref document: EP Kind code of ref document: A1 |