JP2020173784A5

JP2020173784A5 -

Info

Publication number: JP2020173784A5
Application number: JP2020018867A
Authority: JP
Filing date: 2020-02-06
Publication date: 2022-07-28
Anticipated expiration: 2040-02-06

Description

主として、一側面において、本発明は、電子文書（ＥＤ）を処理し、当該ＥＤの構文解析版におけるタイトル及びセクションを推測するためのプログラムを格納した、非一時的なコンピューター読取り可能な媒体（ＣＲＭ）のプログラムに関する。前記プログラムは、コンピューターに、前記電子文書に視覚分析を適用させて、前記電子文書のタイトル候補及びセクション候補を特定させ、前記セクション候補に基づき、前記タイトル候補をフィルタリングさせ、前記フィルタリングされたタイトル候補に基づき、前記セクション候補をフィルタリングさせ、前記電子文書に意味分析を適用させて、前記電子文書の話題及び部分を特定させ、前記特定された話題及び部分に基づき、前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補を絞り込ませ、前記絞り込まれたタイトル候補及び前記絞り込まれたセクション候補を特定した、前記電子文書のマークアップ版を生成させる。

Claims

電子文書（ＥＤ）を処理し、前記電子文書におけるタイトル及びセクションを推測する方法であって、
前記電子文書に視覚分析を適用し、前記電子文書のタイトル候補及びセクション候補を特定する工程と、
前記セクション候補に基づき、前記タイトル候補をフィルタリングする工程と、
前記フィルタリングされたタイトル候補に基づき、前記セクション候補をフィルタリングする工程と、
前記電子文書に意味分析を適用し、前記電子文書の話題及び部分を特定する工程と、
前記特定された話題及び部分に基づき、前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補を絞り込む工程と、
前記絞り込まれたタイトル候補及び前記絞り込まれたセクション候補を特定した、前記電子文書のマークアップ版を生成する工程と、を含む方法。
前記絞り込まれたタイトル候補及び前記絞り込まれたセクション候補に基づき、前記話題及び前記部分を絞り込む工程と、
前記絞り込まれた話題及び前記絞り込まれた部分に基づき、前記絞り込まれたタイトル候補及び前記絞り込まれたセクション候補を更に絞り込む工程と、
前記更に絞り込まれたタイトル候補及び前記更に絞り込まれたセクション候補を特定した、前記電子文書のマークアップ版を生成する工程と、を更に含む請求項１に記載の方法。
前記タイトル候補及び前記セクション候補を絞り込む前記工程は、更に、
前記視覚分析を前記部分のうち第一の部分にのみ再度適用する工程であって、前記第一の部分は前記話題のうち第一の話題に関連している工程と、
前記第一の部分内において特定された、前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補を、前記第一の話題と比較する工程であって、前記第一の部分内にある前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補は、前記話題のうち第二の話題に関連している工程と、
前記第一の話題が前記第二の話題と調和することに基づき、前記第一の部分内にある前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補が、前記第一の部分と関連していると判断する工程と、を含む請求項１又は２に記載の方法。
前記視覚分析及び前記意味分析を前記電子文書の全体に行うことに基づき、前記第一の話題と前記第二の話題との間の潜在的な非一貫性を特定する工程と、
前記潜在的な非一貫性に基づき、前記第一の部分を選択する工程と、を更に含む請求項３に記載の方法。
前記セクション候補はそれぞれ、前記タイトル候補のうち少なくとも一つと関連しており、
前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補を絞り込む前記工程は、更に、
前記フィルタリングされたセクション候補のうち、前記フィルタリングされたタイトル候補のいずれとも関連していない第一のフィルタリングされたセクション候補を特定する工程と、
前記視覚分析を、前記第一のフィルタリングされたセクション候補にのみ再度適用する工程と、
前記第一のフィルタリングされたセクション候補が非テキストオブジェクトを含むと判断する工程と、
前記視覚分析を用いて、前記フィルタリングされたタイトル候補のいずれかが前記非テキストオブジェクトの所定領域内にあるかどうか探す工程と、
前記フィルタリングされたタイトル候補のうち第一のフィルタリングされたタイトル候補を、前記所定領域内において特定することに基づき、前記第一のフィルタリングされたタイトル候補が、前記第一のフィルタリングされたセクション候補のタイトルであると判断する工程と、を含む請求項１から４のいずれか一項に記載の方法。
前記電子文書は複数のページを含み、
前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補を絞り込む前記工程は、更に、
前記話題又は前記部分に基づき、前記電子文書を、前記ページの第一サブセットと、前記第一サブセットと重複しない前記ページの第二サブセットとに分割する工程と、
前記第一サブセット及び前記第二サブセット内において見逃したタイトル候補及びセクション候補を特定するために、前記視覚分析を前記第一サブセット及び前記第二サブセットに対して別々に適用する工程と、を含む請求項１から５のいずれか一項に記載の方法。
前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補を絞り込む前記工程は、更に、
前記話題又は前記部分に基づき、前記電子文書を、第一部と、前記第一部と重複せずかつマスクされた第二部に分割する工程と、
前記第一部内において見逃したタイトル候補及びセクション候補を特定するために、前記視覚分析を前記第一部にのみ再度適用する工程と、を含む請求項１から６のいずれか一項に記載の方法。
前記電子文書の前記タイトル及び前記セクションはタグを含まない、請求項１から７のいずれか一項に記載の方法。
前記視覚分析は、畳み込みニューラルネットワーク（ＣＮＮ）を回帰型ニューラルネットワーク（ＲＮＮ）と組み合わせて用いて適用される、請求項１から８のいずれか一項に記載の方法。
前記意味分析は、自然言語処理（ＮＬＰ）を用いて適用される、請求項１から９のいずれか一項に記載の方法。
電子文書（ＥＤ）を処理して、前記電子文書の構文解析版におけるタイトル及びセクションを推測するためプログラムを格納した、非一時的なコンピューター読取り可能な媒体（ＣＲＭ）において、前記プログラムは、コンピューターに
前記電子文書に視覚分析を適用させて、前記電子文書のタイトル候補及びセクション候補を特定させ、
前記セクション候補に基づき、前記タイトル候補をフィルタリングさせ、
前記フィルタリングされたタイトル候補に基づき、前記セクション候補をフィルタリングさせ、
前記電子文書に意味分析を適用させて、前記電子文書の話題及び部分を特定させ、
前記特定された話題及び部分に基づき、前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補を絞り込ませ、
前記絞り込まれたタイトル候補及び前記絞り込まれたセクション候補を特定した、前記電子文書のマークアップ版を生成させるプログラム。
前記プログラムは、更に、コンピューターに
前記絞り込まれたタイトル候補及び前記絞り込まれたセクション候補に基づき、前記話題及び前記部分を絞り込ませ、
前記絞り込まれた話題及び前記絞り込まれた部分に基づき、前記絞り込まれたタイトル候補及び前記絞り込まれたセクション候補を更に絞り込ませ、
前記更に絞り込まれたタイトル候補及び前記更に絞り込まれたセクション候補を特定した、前記電子文書のマークアップ版を生成させる、請求項１１に記載のプログラム。
前記タイトル候補及び前記セクション候補の前記絞り込みは、更に、
前記視覚分析を、前記部分のうち第一の部分にのみ再度適用する工程であって、前記第一の部分は前記話題のうち第一の話題に関連している工程と、
前記第一の部分内において特定された、前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補を前記第一の話題と比較する工程であって、前記第一の部分内にある前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補は、前記話題のうち第二の話題に関連している工程と、
前記第一の話題が前記第二の話題と調和することに基づき、前記第一の部分内にある前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補が、前記第一の部分と関連していると判断する工程と、を含む、請求項１１又は１２に記載のプログラム。
前記プログラムは、更に、コンピューターに、
前記視覚分析及び前記意味分析を前記電子文書の全体に行うことに基づき、前記第一の話題と前記第二の話題との間の潜在的な非一貫性を特定させ、
前記潜在的な非一貫性に基づき、前記第一の部分を選択させる、請求項１３に記載のプログラム。
前記セクション候補はそれぞれ、前記タイトル候補のうち少なくとも一つと関連しており、
前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補の前記絞り込みは、更に、
前記フィルタリングされたセクション候補のうち、前記フィルタリングされたタイトル候補のいずれとも関連していない第一のフィルタリングされたセクション候補を特定する工程と、
前記視覚分析を、前記第一のフィルタリングされたセクション候補にのみ再度適用する工程と、
前記第一のフィルタリングされたセクション候補が非テキストオブジェクトを含むと判断する工程と、
前記視覚分析を用いて、前記フィルタリングされたタイトル候補のいずれかが前記非テキストオブジェクトの所定領域内にあるかどうか探す工程と、
前記フィルタリングされたタイトル候補のうち第一のフィルタリングされたタイトル候補を、前記所定領域内において特定することに基づき、前記第一のフィルタリングされたタイトル候補が、前記第二のフィルタリングされたセクション候補のタイトルであると判断する工程と、を含む、請求項１１から１４のいずれか一項に記載のプログラム。
電子文書（ＥＤ）を処理して、前記電子文書の構文解析版におけるタイトル及びセクションを推測するためのシステムであって、前記システムは
メモリーと、
前記メモリーと接続されたプロセッサーを備え、前記プロセッサーは、
前記電子文書に視覚分析を適用し、前記電子文書のタイトル候補及びセクション候補を特定し、
前記セクション候補に基づき、前記タイトル候補をフィルタリングし、
前記フィルタリングされたタイトル候補に基づき、前記セクション候補をフィルタリングし、
前記電子文書に意味分析を適用し、前記電子文書の話題及び部分を特定し、
前記特定された話題及び部分に基づき、前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補を絞り込み、
前記絞り込まれたタイトル候補及び前記絞り込まれたセクション候補を特定した、前記電子文書のマークアップ版を生成するシステム。
前記プロセッサーは、更に、
前記絞り込まれたタイトル候補及び前記絞り込まれたセクション候補に基づき、前記話題及び前記部分を絞り込み、
前記絞り込まれた話題及び前記絞り込まれた部分に基づき、前記絞り込まれたタイトル候補及び前記絞り込まれたセクション候補を更に絞り込み、
前記更に絞り込まれたタイトル候補及び前記更に絞り込まれたセクション候補を特定した、前記電子文書のマークアップ版を生成する、請求項１６に記載のシステム。
前記タイトル候補及び前記セクション候補の前記絞り込みは、更に、
前記視覚分析を、前記部分のうち第一の部分にのみ再度適用する工程であって、前記第一の部分は前記話題のうち第一の話題に関連している工程と、
前記第一の部分内において特定された、前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補を前記第一の話題と比較する工程であって、前記第一の部分内にある前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補は、前記話題のうち第二の話題に関連している工程と、
前記第一の話題が前記第二の話題と調和することに基づき、前記第一の部分内にある前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補が、前記第一の部分と関連していると判断する工程と、を含む、請求項１６又は１７に記載のシステム。
前記プロセッサーは、更に、
前記視覚分析及び前記意味分析を前記電子文書の全体に行うことに基づき、前記第一の話題と前記第二の話題との間の潜在的な非一貫性を特定し、
前記潜在的な非一貫性に基づき、前記第一の部分を選択する、請求項１８に記載のシステム。
前記セクション候補はそれぞれ、前記タイトル候補のうち少なくとも一つと関連しており、
前記フィルタリングされたタイトル候補及び前記フィルタリングされたセクション候補の前記絞り込みは、更に、
前記フィルタリングされたセクション候補のうち、前記フィルタリングされたタイトル候補のいずれとも関連していない第一のフィルタリングされたセクション候補を特定する工程と、
前記視覚分析を、前記第一のフィルタリングされたセクション候補にのみ再度適用する工程と、
前記第一のフィルタリングされたセクション候補が非テキストオブジェクトを含むと判断する工程と、
前記視覚分析を用いて、前記フィルタリングされたタイトル候補のいずれかが前記非テキストオブジェクトの所定領域内にあるかどうか探す工程と、
前記フィルタリングされたタイトル候補のうち第一のフィルタリングされたタイトル候補を、前記所定領域内において特定することに基づき、前記第一のフィルタリングされたタイトル候補が、前記第二のフィルタリングされたセクション候補のタイトルであると判断する工程と、を含む、請求項１６から１９のいずれか一項に記載のシステム。