JP3079844B2

JP3079844B2 - 全文データベースシステム

Info

Publication number: JP3079844B2
Application number: JP05204351A
Authority: JP
Inventors: 広実植木; 浩二牧之内; 道彦平澤; 雅人奈良; 群二濱谷
Original assignee: Toppan Inc
Current assignee: Toppan Inc
Priority date: 1993-08-18
Filing date: 1993-08-18
Publication date: 2000-08-21
Anticipated expiration: 2015-08-21
Also published as: JPH0756945A

Description

【発明の詳細な説明】

【０００１】

【産業上の利用分野】本発明は電子出版等に用いて好適
な全文データベースシステムに関する。

【０００２】

【従来の技術】文書データから所定の文字列を検索する
手法には、大別して、キーワード検索と全文検索とがあ
る。キーワード検索では、キーワード登録者が、文書デ
ータを例えば、文章毎に細分化し、各文書データに適合
するキーワードを対応させる。この対応関係はインデッ
クスファイルに記憶され、当該ファイルにおいて、各キ
ーワードは例えば、文字コード順に木構造をなすように
記憶される。

【０００３】このような構成において、検索操作者が抽
出したい文書データに対応するキーワードを入力するこ
とにより検索処理が為される。具体的には、入力キーワ
ードに一致するキーワードがインデックスファイルから
抽出され、このキーワードに対応する文書データが出力
される。

【０００４】一方、全文検索では、文書データはシーケ
ンシャルファイル（全文データベース）として記憶され
る。この文書データに対する検索処理は、検索操作者
が、抽出したい文書データに含まれる文字列を入力する
ことにより為される。具体的には、入力された検索文字
列と文書データに含まれる全ての文字列とが比較され、
一致する文字列が含まれる文書データが出力される。な
お、検索文字列の文字数や適用するパターンマッチング
の手法によっては、文書データに含まれる全ての文字列
を検索文字列と比較する必要はない。各種パターンマッ
チングの手法については、公知であるので、その説明を
省略する。

【０００５】

【発明が解決しようとする課題】一般に、データベース
検索を必要とする電子出版の分野において、取り扱われ
る文書データの容量は、極めて大きなものとなる。例え
ば、ＣＤ−ＲＯＭは数百ＭＢ（メガバイト）の記憶容量
を有しており、通常、数十〜数百ＭＢの文書データが記
憶される。このように、極めて大容量の文書データに対
して、前述した全文検索を適用すると、公知のいかなる
パターンマッチングの手法を用いても、パーソナルコン
ピュータ程度の処理能力では、十分な応答時間を達成す
ることができないという欠点がある。

【０００６】また、前述したキーワード検索を適用しよ
うとしても、ＣＤ−ＲＯＭに記憶される文書データは、
データベース化を前提として作成されていない為に、文
章毎に細分化する作業や、適合するキーワードを作成す
る作業が極めて困難になるという問題がある。さらに、
キーワード登録者と検索操作者は別人であるために、検
索操作者が、作成されたキーワードを有効に活用するこ
とが困難であるという欠点もある。

【０００７】また、使用者が必要とする情報は、「経
済」、「製法」、「演算」等の数文字の文字列により特
定できる場合が多く、これらの文字列の中には、キーワ
ードとして登録しにくいものが含まれることがある。す
なわち、登録されたキーワード以外の文字列による検索
が必要となる場合がある。こうした場合に対応できるよ
うに、例えば、２文字からなる文字列を全てキーワード
とすることも考えられる。

【０００８】しかしながら、日本語の場合、約７千種の
文字が存在するために、２文字の順列は約４千９百万と
いう膨大な数となる。この膨大な数のキーワードから特
定のキーワードを抽出する処理は極めて高負荷となり、
木構造を用いても、パーソナルコンピュータ程度の処理
能力では実用にならない。また、検索の為のインデック
スファイルも巨大（例えば、数百ＭＢ）なものとなり、
文書データの為の記憶領域が狭くなってしまう。

【０００９】本発明は、このような背景に鑑みて為され
たもので、インデックステーブル群のサイズを小とし、
十分な検索速度を得ることができる全文データベースシ
ステムを提供することを目的とする。

【００１０】

【課題を解決するための手段】本発明による全文データ
ベースシステムは、階層構造を有するインデックステー
ブル群を用いて、検索文字列に一致する文字列を文書デ
ータから抽出する全文データベースシステムであって、
前記文書データ中の各文字に連続するアドレスを付与す
るアドレス付与手段と、前記文書データ中の各文字と後
続する文字とで構成される合計ｋ文字（ｋは２以上）の
疑似単語を作成し、各疑似単語の先頭文字列に付与され
る各アドレスを、対応する疑似単語の文字コード順にア
ドレステーブルへ記憶するアドレステーブル作成手段
と、固有の文字コードを有する疑似単語を固有疑似単語
として前記インデックステーブル群中の最下層テーブル
へ文字コード順に記憶するとともに、各固有疑似単語に
前記アドレステーブル中の各アドレスを対応付ける最下
層構築手段と、前記インデックステーブル群中の最上層
テーブルに記憶される固有疑似単語数が所定数以上であ
るか否かを判断する判断手段と、前記判断手段により前
記固有疑似単語数が所定数以上であると判断された場
合、前記最上層テーブルを略均等に分割するように複数
の固有疑似単語を抽出して前記最上層テーブルの上層の
テーブルを作成して新たな最上層テーブルとし、前記判
断手段により、新たに作成された最上層テーブル内の固
有疑似単語数が所定数未満となるまで、前記上層のテー
ブルを繰り返し作成する階層化手段とを具備し、前記イ
ンデックステーブル群は、合計ｋ文字未満の疑似単語に
対応したテーブルをも有することを特徴としている。

【００１１】

【作用】上記構成によれば、アドレス付与手段が、文書
データ中の各文字に連続するアドレスを付与し、アドレ
ステーブル作成手段が、前記文書データ中の各文字と後
続する文字とで構成される合計ｋ文字（ｋは２以上）の
疑似単語を作成し、各疑似単語の先頭文字列に付与され
る各アドレスを、対応する疑似単語の文字コード順にア
ドレステーブルへ記憶する。そして、最下層構築手段
が、固有の文字コードを有する疑似単語を固有疑似単語
として前記インデックステーブル群中の最下層テーブル
へ文字コード順に記憶するとともに、各固有疑似単語に
前記アドレステーブル中の各アドレスを対応付ける。ま
た、判断手段が前記インデックステーブル群中の最上層
テーブルに記憶される固有疑似単語数が所定数以上であ
るか否かを判断し、固有疑似単語数が所定数以上である
判断された場合は、階層化手段が前記最上層テーブルを
略均等に分割するように複数の固有疑似単語を抽出して
前記最上層テーブルの上層のテーブルを作成して新たな
最上層テーブルとする。そして、階層化手段は、判断手
段によって最上層テーブルに記憶される固有疑似単語数
が所定数未満と判断されるまで、上述した新たな最上層
テーブルを繰り返し作成する。さらに、前記インデック
ステーブル群は、合計ｋ文字未満の疑似単語に対応した
テーブルをも有している。インデックステーブル群は、
このような階層構造を有する為に、検索時において、十
分な検索速度が得られる。また、インデックステーブル
群中の各テーブルに記憶される疑似単語は、固有の文字
コードを有する固有疑似単語であるために、インデック
ステーブル群のサイズが小となる。さらに、インデック
ステーブル群が、合計ｋ文字未満の疑似単語に対応した
テーブルをも有しているために、ｋ文字数未満の検索文
字列による検索がなされる場合においても所定の応答速
度で検索処理が可能となる。

【００１２】

【実施例】以下、図面を参照して、本発明の一実施例に
ついて説明する。（１）構築システム１の構成図１は本発明の一実施例による全文データベースシステ
ムの概略構成を示す図であり、図１（ａ）は全文データ
ベースを構築する構築システム１の概略構成を示すブロ
ック図である。この構築システム１は、データベースの
提供者（もしくは編集者）に使用されることが想定され
る。電子出版においては、その提供者が当該システム１
により構築された全文データベースを、ＣＤ−ＲＯＭ等
に記憶させる。

【００１３】図１（ａ）において、２はキーボード等の
入力装置であり、オペレータにより入力される文書デー
タを構築処理装置３（後述する）へ供給する。構築処理
装置３は、入力装置２から供給される文書データに所定
の処理を施して、記憶装置４（後述する）へ供給すると
ともに、当該文書データに対応するインデックスファイ
ルを作成し、全文データベースを構築する。この全文デ
ータベース構築処理の内容については、後に詳述する。

【００１４】記憶装置４は、例えば、数百ＭＢの容量を
有するハードディスクからなり、構築処理装置３から供
給される文書データを実データファイルとして記憶する
とともに、構築処理装置３にて作成されるインデックス
ファイルを記憶する。ここで、実データファイル中の文
書データの一例を図４に示す。この図に示す文書データ
には、キーワード”東京都”および”京都”を識別する
為の位置マーク’＠’が付加されている。

【００１５】また、インデックスファイルに含まれる各
種テーブルの一例を図１２に示す。図１２は図４に示す
文書データの和文範囲ＪＡに対するインデックステーブ
ル（以後、和文テーブルと称す）の構成例を示す図であ
り、この図において、Ｊ２−１は和文最下層テーブル、
Ｊ２−２は和文最下層テーブルＪ２−１の上層テーブル
となる和文最上層テーブル、Ｊ１は１文字テーブルであ
り、和文最下層テーブルＪ２−１の上層テーブルとな
る。また、ＣＡＴはレコードＲ１を複数有する文字アド
レステーブルである。

【００１６】和文最下層テーブルＪ２−１はレコードＲ
２を複数有し、各レコードＲ２には、文書データの和文
範囲ＪＡ（図４参照）中に存在する２文字の文字列（以
後、疑似単語と称す）が格納されている。これらの疑似
単語は、ユニーク（同一綴りのものが無い）であり、文
字コードＣＣ順にソートされている（以後、ユニークな
疑似単語を固有疑似単語と称す）。ここで、疑似単語の
文字コードＣＣは、当該疑似単語の先頭文字の文字コー
ドをＣ１、末尾文字の文字コードをＣ２とすると、例え
ば、以下に示す計算式（１）により算出される。ＣＣ＝Ｃ１ × ｍ＋Ｃ２ …（１）文書データ中に現れる文字種は約７千種であるので、こ
の文字種以上の数「ｍ（例えば、８千）」をＣ１に乗ず
ることにより、ＣＣは疑似単語固有の文字コードとな
る。

【００１７】また、各レコードＲ２は、当該レコードＲ
２に格納される固有疑似単語の文書データ中での存在数
を表す「サイズ」を有し、文字アドレステーブルＣＡＴ
中の所定のレコードＲ１に対応付けられている。ここ
で、レコードＲ２が対応付けられるレコードＲ１は、当
該レコードＲ２が有する固有疑似単語の先頭文字の位置
を表す「文字アドレス」を有する。

【００１８】なお、和文最下層テーブルＪ２−１におい
て、サイズが複数であるレコードＲ２には、複数のレコ
ードＲ１が対応付けられる。具体的には、サイズが複数
であるレコードＲ２に、当該レコードＲ２が有する固有
疑似単語に対応する複数の文字アドレスのうち、最小の
文字アドレスを有するレコードＲ１が対応付けられ、こ
のレコードＲ１に続いて、最小でない文字アドレスを有
するレコードＲ１が昇順に整列される。

【００１９】また、和文最上層テーブルＪ２−２はレコ
ードＲ３を複数有し、各レコードＲ３には、和文最下層
テーブルＪ２−１中の固有疑似単語が格納される。な
お、このレコードＲ３の数は、レコードＲ２に較べて極
めて少ない。また、各レコードＲ３は、固有疑似単語の
文字コード順にソートされており、レコードＲ３が有す
る固有疑似単語と同一の固有疑似単語を有するレコード
Ｒ２に対応付けられる。この際、和文最下層テーブルＪ
２−１において、各レコードＲ３に対応付けられる各レ
コードＲ２間の距離、すなわち、当該レコードＲ２間に
存在するレコードＲ２の数が、予め設定された数（例え
ば、９９）となるように、各レコードＲ３に格納される
固有疑似単語が設定される。

【００２０】１文字テーブルＪ１はレコードＲ４を複数
有し、各レコードＲ４は、文書データの和文範囲ＪＡに
出現する全種類の文字を格納する。これらの文字はユニ
ークであり、各レコードＲ４は文字コード順にソートさ
れている。また、各レコードＲ４は、和文最下層テーブ
ルＪ２−１中の所定のレコードＲ２に対応付けられてお
り、対応付けられるレコードＲ４およびレコードＲ２が
有する文字および固有疑似単語の先頭文字は一致する。
ここで、１つのレコードＲ４が対応付けられるべきレコ
ードＲ２が複数である場合には、当該レコードＲ４は最
も先頭にあるレコードＲ２に対応付けられる。この際、
レコードＲ４が有するサイズは、対応付けるべき固有疑
似単語の数となる。

【００２１】次に、文書データ（図４参照）の欧文範囲
ＥＡに対応するインデックステーブル（以後、欧文テー
ブルと称す）の一例を図７および図９に示す。欧文テー
ブルは、図７に示すようなワードアドレステーブルＷＡ
Ｔ，ワードリストＷＬと、図９に示すような仮想アドレ
ステーブルＶＡＴ，欧文基本テーブルＥＢＴとからな
る。図７に示すように、ワードアドレステーブルＷＡＴ
はレコードＲ５を複数有し、各レコードＲ５には、欧文
範囲ＥＡに存在する全ての「ワード（単語）」に対応す
るワード単位のアドレス（以後、ワードアドレスと称
す）が格納される。

【００２２】また、ワードリストＷＬは、レコードＲ６
を複数有し、各レコードＲ６は、欧文範囲ＥＡに存在す
るユニークなワード（以後、固有ワードと称す）を１つ
ずつ有し、各固有ワードの文字コード順にソートされて
いる。また、各レコードＲ６には、固有の「ユニーク符
号」が割り当てられ、各固有ワードを構成する各文字に
は、固有ワード内の先頭からの位置を示す「ワード内ア
ドレス」が付与される。

【００２３】また、各レコードＲ６は、自身が有する固
有ワードが文書データ中で出現する頻度を表す「サイ
ズ」を有し、ワードアドレステーブルＷＡＴ中の所定の
レコードＲ５に対応付けられる。なお、サイズが複数で
あるレコードＲ６には、複数のレコードＲ５が対応付け
られる。具体的には、サイズが複数であるレコードＲ６
に、当該レコードＲ６が有する固有ワードに対応する複
数のワードアドレスのうち、最小のワードアドレスを有
するレコードＲ５が対応付けられ、このレコードＲ５に
続いて、最小でない文字アドレスを有するレコードＲ５
が昇順に整列される。

【００２４】また、図９に示す欧文基本テーブルＥＢＴ
は、レコードＲ７を複数有し、各レコードＲ７には、ワ
ードリストＷＬ（図７参照）中の各固有ワードに基づい
て生成される２文字単位の固有疑似単語が１つずつ格納
される。各レコードＲ７は、固有疑似単語の文字コード
順にソートされている。各レコードＲ７は、格納された
固有疑似単語のワードリストＷＬ中での出現頻度を表す
「サイズ」を有し、仮想アドレステーブルＶＡＴ中の所
定のレコードＲ８に対応付けられる。

【００２５】仮想アドレステーブルＶＡＴはレコードＲ
８を複数有し、各レコードＲ８には、ユニーク符号とワ
ード内アドレスとの組である「仮想アドレス」が格納さ
れる。この仮想アドレスは、欧文基本テーブルＥＢＴ中
の固有疑似単語に対応するものである。ここで、レコー
ドＲ７のサイズが複数である場合には、当該レコードＲ
７に複数のレコードＲ８が対応付けられる。この対応付
けの具体的内容は、図１２に示す和文最下層テーブルＪ
２−１のレコードＲ２と、文字アドレステーブルＣＡＴ
のレコードＲ１との対応付けと同様であるので、その説
明を省略する。

【００２６】（２）検索システム５の構成一方、図１（ｂ）は構築システム１により構築された全
文データベースに対して、各種の検索処理を行う検索シ
ステム５の構成を示す図である。この検索システム５
は、データベースのユーザーによって用いられることが
想定される。電子出版においては、そのユーザーが当該
システム５を用いて、ＣＤ−ＲＯＭ等に記憶された全文
データベースに対して各種の検索処理を行う。

【００２７】図１（ｂ）において、６はキーボード等の
入力装置であり、ユーザー（使用者）により入力される
指示に応じた指示データを検索処理装置７（後述する）
へ供給する。検索処理装置７は、一般的なパーソナルコ
ンピュータであり、図示せぬＣＰＵ、ＲＯＭ、ＲＡＭお
よび各種Ｉ／Ｏインタフェースを有する。この検索処理
装置７はＲＡＭに記憶される検索プログラムを実行し、
入力装置６から供給される指示データに応じた検索処理
を行う。この検索処理の内容は後に詳述する。

【００２８】８はＣＤ−ＲＯＭドライブであり、検索処
理装置７に制御され、挿入されるＣＤ−ＲＯＭに記憶さ
れた情報を読み取る。９は検索処理装置７から供給され
る表示データに応じて、検索メニューや検索結果等を表
示するディスプレイ、１０はプリンタであり、検索処理
装置７から供給される出力データに応じて、検索結果を
出力する。

【００２９】（３）全文データベース構築処理次に、構築処理装置３（図１（ａ）参照）がＲＡＭに記
憶されたプログラムを実行して行う全文データベース構
築処理について、以下に説明する。ここでは、和文と欧
文が混在した文書データ（図３参照）をデータベース化
する場合について説明する。

【００３０】まず、全文データベース構築に先だって、
図１（ａ）に示す構築システム１において、入力装置２
から文書データが入力される。この文書データは、構築
処理装置３を介して記憶装置４に供給され、ここで記憶
される。以下に説明する各処理は、記憶装置４に記憶さ
れた文書データに対して為される。文書データの入力処
理が終了し、入力装置２から所定の指示データが入力さ
れると、構築処理装置３は、図２のフローチャートに表
されるプログラムを実行する。

【００３１】まず、ステップＳＡ１では、文書データ
（図３参照）に位置マークを付加する。この位置マーク
とは、任意のキーワードの前後に挿入される特定の文字
であり、例えば、’＠’のように、文書データ中に存在
しない記号を用いる。図４は、上述したマーク付加処理
が行われた後の文書データを示す図であり、この図にお
いて、”東京都”および”京都”という文字列（キーワ
ード）の前後には位置マーク’＠’が挿入されている。

【００３２】上述したマーク付加処理を行わない場
合、”京都”という地名を全文検索すると、”京都”は
もちろん、”東京都”まで抽出してしまう。マーク付加
処理は、このような無意味な抽出を避ける為に行われる
処理であり、全文検索において、検索文字列として”＠
京都＠”という文字列を入力すると、”＠京都＠”のみ
が抽出され、”＠東京都＠”は抽出されないという結果
を得ることができる。

【００３３】次に、ステップＳＡ２（図２参照）では、
文書データにアドレスが付与される。図５に示すよう
に、アドレスには文字アドレスとワードアドレスがあ
り、文字アドレスは文書データ全体に付与され、ワード
アドレスはアルファベットや数字等が連続する欧文範囲
ＥＡに付与される。例えば、図５の和文範囲ＪＡにおい
て、先頭文字’多’の文字アドレスは「１」、それに続
く文字’角’の文字アドレスは「２」となり、欧文範囲
ＥＡにおいて、先頭文字’ｗ’の文字アドレスは「３１
７」となる。また、欧文範囲ＥＡにおいて、先頭のワー
ド”ｗｏｒｌｄ”のワードアドレスは「１」、それに続
くワード”ｗｉｄｅ”のワードアドレスは「２」とな
る。

【００３４】後述する各処理において、欧文範囲ＥＡに
はワード単位の処理が行われるため、欧文範囲ＥＡにお
いて、文字アドレスを記憶する必要はない。しかしなが
ら、和文範囲ＪＡとの位置関係を把握するために、欧文
範囲ＥＡの最初および最後の文字アドレスを記憶装置４
（図１（ａ）参照）に記憶する。これらの文字アドレス
間の文書データは、後述する各処理において、欧文範囲
ＥＡとみなされ、ワード単位の処理を施される。

【００３５】次に、ステップＳＡ３（図２参照）では、
欧文範囲ＥＡのワードリストＷＬを作成する。まず、図
５の文書データの欧文範囲ＥＡに出現する全てのワード
を抽出し、図６に示すように、欧文対照テーブルＣＴを
作成する。次に、欧文対照テーブルＣＴ中の各レコード
Ｒ１１を、各ワードの文字コード順およびワードアドレ
ス順にソートする。すると、同一のワード（例えば、図
６中のワード”ｗｏｒｌｄ”参照）を有する複数のレコ
ードＲ１１が隣接する。

【００３６】次に、ソートされた各レコードＲ１１から
ユニークな固有ワードを抽出し、ワードリストＷＬ（図
７参照）の各レコードＲ６に格納するとともに、ワード
アドレスを有するレコードＲ５を複数作成し、ワードア
ドレステーブルＷＡＴを作成する。ワードリストＷＬの
各レコードＲ６に設けられるポインタは、ワードアドレ
ステーブルＷＡＴ中のレコードＲ５を指し示す。

【００３７】この際、ポインタにより対応付けられるレ
コードＲ６の固有ワードとレコードＲ５のワードアドレ
スとは、欧文対照テーブルＣＴにおいて同一レコードＲ
１１内に格納されていたもの同士となる。また、欧文対
照テーブルＣＴにおいて、同一のワードを有するレコー
ドＲ１１が複数存在していた場合、そのワードに一致す
る固有ワードを有するワードリストＷＬ中のレコードＲ
６には、当該ワードの欧文対照テーブルＣＴ内での出現
数がサイズとして格納される。例えば、ワード”ｈｅｌ
ｐ”は、欧文対照テーブルＣＴ（図６参照）中に２つ出
現するので、ワードリストＷＬの固有ワード”ｈｅｌ
ｐ”を有するレコードＲ６のサイズは「２」となる。

【００３８】さらに、ワードリストＷＬの各レコードＲ
６には、固有のユニーク符号「Ａ」，「Ｂ」，「Ｃ」，
・・・が付与され、各レコードＲ６の固有ワードを構成
する文字には、ワード内アドレスが付与される。例え
ば、固有ワード”ｃａｎ”に付与されるユニーク符号は
「Ａ」であり、固有ワードを構成する文字’ｃ’に対す
るワード内アドレスは「１」である。こうして作成され
たワードリストＷＬは、記憶装置４（図１（ａ）参照）
に記憶される。

【００３９】次に、ステップＳＡ４（図２参照）では、
文書データまたはワードリストＷＬから疑似単語を抽出
する。これに続くステップＳＡ５では、抽出された疑似
単語を用いて、和文最下層テーブルＪ２−１および欧文
基本テーブルＥＢＴを作成する。これらの抽出処理およ
び作成処理は、文書データの形式により異なる為、以
下、欧文範囲ＥＡと和文範囲ＪＡとに分けて説明する。

【００４０】Ａ：欧文範囲ＥＡに対する処理欧文範囲ＥＡにおいて、まず、ワードリストＷＬ（図７
参照）から、文字列長が「２」である疑似単語を抽出す
る。この抽出処理は、各固有ワードの先頭から末尾にか
けて行われ、例えば、固有ワード”ｃａｎ”からは、”
ｃａ”，”ａｎ”という疑似単語が抽出される。こうし
て抽出された複数の疑似単語は、図８に示すような構成
の疑似単語テーブルＰＷＴの各レコードＲ９に格納され
る。

【００４１】疑似単語テーブルＰＷＴにおいて、疑似単
語が格納されたレコードＲ９は、当該レコードＲ９が有
する疑似単語の抽出元の固有ワードに付与されたユニー
ク符号と、その疑似単語の先頭文字のワード内アドレス
とから構成される「仮想アドレス」を有する。例えば、
疑似単語”ａｎ”を有するレコードＲ９は、抽出元の固
有ワード”ｃａｎ”に付与されたユニーク符号「Ａ」
と、疑似単語”ａｎ”の先頭文字’ａ’のワード内アド
レス「２」とから構成される仮想アドレス「Ａ−２」を
有する。

【００４２】そして、ワードリストＷＬ作成時と同様
に、疑似単語テーブルＰＷＴ内の各レコードＲ９を各疑
似単語の文字コード順にソートし、ユニークな固有疑似
単語を抽出する。ここで、抽出された固有疑似単語は、
図９に示す欧文基本テーブルＥＢＴに格納される。ま
た、疑似単語テーブルＰＷＴ内の仮想アドレスのみで構
成される仮想アドレステーブルＶＡＴを作成する。図９
に示すように、欧文基本テーブルＥＢＴの各レコードＲ
７に設けられるポインタは、仮想アドレステーブルＶＡ
Ｔ中の対応するレコードＲ８を指し示す。

【００４３】また、ワードリストＷＬ作成時と同様に、
疑似単語テーブルＰＷＴにおいて、同一の疑似単語が複
数存在していた場合、その疑似単語と同一の固有疑似単
語を有するレコードＲ７には、その疑似単語の出現数が
「サイズ」として格納される。こうして、図９に示す欧
文基本テーブルＥＢＴが作成される。

【００４４】Ｂ：和文範囲ＪＡに対する処理和文範囲ＪＡにおいては、まず、文書データ（図５参
照）から、文字列長が「２」である疑似単語を抽出す
る。この抽出処理は、和文範囲ＪＡの先頭から末尾にか
けて行われ、例えば、図５の文書データからは、順に”
多角”，”角経”という疑似単語が抽出される。抽出さ
れた疑似単語は、図１０に示すような和文疑似単語テー
ブルＪＰＴの各レコードＲ１０に格納される。

【００４５】和文疑似単語テーブルＪＰＴにおいて、疑
似単語が格納されたレコードＲ１０は、当該疑似単語の
先頭文字の「文字アドレス」を有する。例えば、疑似単
語”多角”を有するレコードＲ１０は、疑似単語の先頭
文字’多’の文字アドレス「１」を有する。そして、ワ
ードリストＷＬや疑似単語テーブルＰＷＴ作成時と同様
に、各レコードＲ１０を疑似単語の文字コード順にソー
トし、ユニークな固有疑似単語を抽出する。

【００４６】ここで、抽出された固有疑似単語は、図１
１に示す和文最下層テーブルＪ２−１に格納される。ま
た、和文疑似単語テーブルＪＰＴ内の文字アドレスのみ
で構成される文字アドレステーブルＣＡＴを作成する。
図１１に示すように、和文最下層テーブルＪ２−１の各
レコードＲ２に設けられるポインタは、文字アドレステ
ーブルＣＡＴ中の対応するレコードＲ１を指し示す。

【００４７】また、和文疑似単語テーブルＪＰＴ（図１
０参照）において、同一の疑似単語が複数存在していた
場合、その疑似単語に一致する固有疑似単語を有するレ
コードＲ２には、当該疑似単語の文書データ中での出現
数が「サイズ」として格納される。こうして、図１１に
示す和文最下層テーブルＪ２−１が作成される。上述し
たように、欧文基本テーブルＥＢＴおよび和文最下層テ
ーブルＪ２−１が作成されると、処理はステップＳＡ６
へ進む。

【００４８】ステップＳＡ６において、最上層の和文テ
ーブル（最初は和文最下層テーブルＪ２−１）中のレコ
ード数が所定数ｎ（例えば、ｎ＝５００）以上であるか
否かが判断される。この判断が「Ｙｅｓ」であれば、処
理はステップＳＡ７へ進み、「Ｎｏ」であれば、処理は
ステップＳＡ８へ進む。

【００４９】上記ステップＳＡ６での判断により、必要
に応じて、和文テーブルが階層化されるのだが、ここ
で、当該階層化を行う理由を説明する。前述したよう
に、和文に用いられる文字種は約７千種と多く、文書デ
ータから抽出される固有疑似単語の種類、すなわち、和
文最下層テーブルＪ２−１のレコードＲ２の数は極めて
大となる。後述する検索処理は、検索文字列に対応する
固有疑似単語を抽出する処理を繰り返して行われるた
め、検索対象となるテーブル（例えば、和文最下層テー
ブルＪ２−１）のレコードＲ２の数が多いと、所定の時
間内に検索処理を終了することができない。

【００５０】ここで、和文最下層テーブルＪ２−１のレ
コードＲ２の数が多い場合には、図１２に示すように、
上層のテーブル（和文最上層テーブルＪ２−２）を作成
し、上層のテーブルで検索文字列に対応する固有疑似単
語を抽出できなかった場合には、下層テーブル（和文最
下層テーブルＪ２−１）の所定の範囲で、固有疑似単語
を抽出するようにする。すると、比較すべき固有疑似単
語の数が減少し、所定の応答時間で検索処理を行うこと
ができる。

【００５１】なお、欧文基本テーブルＥＢＴに関して上
記階層化を行わないのは、当該テーブルＥＢＴ中の各固
有疑似単語は、文字種の少ないアルファベットや数字等
の組み合わせであるために、そのレコード数は、和文最
下層テーブルＪ２−１のレコード数に較べて極めて少な
く（同一綴りの疑似単語が多い）、欧文基本テーブルＥ
ＢＴのみでも十分な応答時間を得ることができるからで
ある。

【００５２】ステップＳＡ７は、ステップＳＡ６での判
断が「Ｙｅｓ」となった場合の処理であり、ここでは、
既に作成された和文テーブルに対して上層の和文テーブ
ルを作成する。例えば、図１０の和文最下層テーブルＪ
２−１に対して、図１１に示すように、和文最上層テー
ブルＪ２−２を作成する。この和文最上層テーブルＪ２
−２の各レコードＲ３には、”＠東”や”経常”等の和
文最下層テーブルＪ２−１から抽出された固有疑似単語
が格納される。また、各レコードＲ３は「ポインタ」を
有し、和文最下層テーブルＪ２−１中の同一固有疑似単
語を有するレコードＲ２に対応付けられる。

【００５３】なお、各レコードＲ３が有する固有疑似単
語は、隣接するレコードＲ３に対応する各レコードＲ２
間の距離（２つのレコードＲ２に含まれるレコードＲ２
の数）が、例えば、９９となるように抽出される。この
距離は和文最下層テーブルＪ２−１のレコード数に応じ
て設定される。そして、処理はステップＳＡ６に戻る。
こうして、最上層の和文テーブルのレコード数が所定数
ｎ未満となるまで、上述した階層化処理が行われる。図
１２に示す例では、和文最上層テーブルＪ２−２のレコ
ード数は所定数ｎ（例えば、ｎ＝５００）未満となるの
で、和文テーブルの階層は２段となる。

【００５４】ステップＳＡ８は、最上層の和文テーブル
のデータ数が所定数ｎ未満となり、ステップＳＡ６での
判断が「Ｎｏ」となる場合の処理であり、和文最下層テ
ーブルＪ２−１に対する１文字テーブルＪ１が作成され
る。和文には漢字が用いられるため、「山」や「川」等
の１文字の検索文字列による検索が行われる場合があ
る。こうした１文字検索をも所定の応答速度で実現する
為に、１文字テーブルＪ１が作成される。

【００５５】１文字テーブルＪ１の作成過程を以下に説
明する。まず、図１２に示す和文最下層テーブルＪ２−
１から各固有疑似単語の先頭文字をレコード順に抽出す
る。各レコードＲ２は、既に文字コード順にソートされ
ている為、同一の文字が連続して抽出される。次に、抽
出された文字群からユニークな文字を抽出し、抽出元の
文字群に含まれる同一文字の数（サイズ）とともに、１
文字テーブルＪ１の各レコードＲ４に格納する。

【００５６】また、各レコードＲ４はポインタを有し、
和文最下層テーブルＪ２−１内の抽出元レコードＲ２に
対応付けられる。こうして、１文字テーブルＪ１が作成
される。そして、例えば、図７のワードアドレステーブ
ルＷＡＴ，ワードリストＷＬと、図９の仮想アドレステ
ーブルＶＡＴ，欧文基本テーブルＥＢＴと、図１２の文
字アドレステーブルＣＡＴ，和文最下層テーブルＪ２−
１，和文最上層テーブルＪ２−２，１文字テーブルＪ１
と、欧文範囲ＥＡの最初および最後の文字アドレスと
が、インデックスファイルとして、記憶装置４に記憶さ
れる。また、図５に示すような文書データが実データフ
ァイルとして記憶装置４に記憶され、全文データベース
が構築される。

【００５７】（４）全文検索処理次に、上述した過程を経て構築された全文データベース
に対して、検索処理装置７（図１（ｂ）参照）が行う全
文検索処理について、図面を参照して説明する。図１
３，図１４は検索処理装置７のＲＡＭに予め記憶される
全文検索プログラムのフローチャートである。まず、検
索システム５において、ＣＤ−ＲＯＭドライブ８に、全
文データベースが記憶されたＣＤ−ＲＯＭが挿入され、
入力装置６から所定の指示データが供給されと、検索処
理装置７はステップＳＢ１を実行する。

【００５８】ステップＳＢ１では、所定の表示データを
ディスプレイ９へ供給し、例えば、図１５に示す検索メ
ニューを表示させる。ユーザーは、表示された検索メニ
ューに応じて、入力装置６を操作し、後述する検索モー
ド、順位モードおよび指定距離等を設定する。検索モー
ドには１つの検索文字列を検索する通常検索モードの他
に、複数の検索文字列を文脈上の関係を意識して検索す
る文脈意識モードがあり、ユーザーは入力装置６を操作
して入力フィールド１１へ所定の文字を入力し、どちら
かのモードを選択する。

【００５９】文脈意識モードを選択した場合、ユーザー
は複数の検索文字列間の前後関係を意識するか否か（順
位モード）を指定する必要がある。また、文脈意識モー
ドでは、複数の検索文字列間の距離（先頭文字アドレス
の差）の上限を指定する必要がある。したがって、ユー
ザーは入力フィールド１２に順位モードを指定する文字
を入力し、入力フィールド１３に距離の上限を表す数値
（指定距離）を入力する。

【００６０】次に、ステップＳＢ２では、ユーザーが入
力装置６を操作し、図１５の文字列入力フィールド１
４、あるいは文字列入力フィールド１５へ検索文字列を
入力する。そして、入力装置６から所定の指示データが
供給されると、検索処理装置７は、検索メニュー上の各
入力フィールド１１〜１５に入力された各種のデータを
読み取り、これらのデータをＲＡＭに記憶する。そし
て、処理はステップＳＢ３へ進む。

【００６１】ステップＳＢ３では、検索文字列の各文字
に文字アドレスを付与し、検索文字列を２文字単位に分
割して、複数の検索用疑似単語を抽出する。例えば、図
１７に示す”経営危機”という検索文字列からは”経
営”と”危機”という検索用疑似単語が抽出される。検
索文字列が２文字以下の長さであれば、上記抽出処理は
行われない。

【００６２】次に、ステップＳＢ４では、各検索用疑似
単語に一致する固有疑似単語を有するレコードを、記憶
装置４に記憶されたインデックスファイルから検索す
る。この検索処理は各検索用疑似単語の文字コードＳＣ
と、インデックスファイル中の各固有疑似単語の文字コ
ードＶＣとを比較することにより行われる。ここで、検
索処理に使用されるテーブルは、欧文範囲ＥＡでの検索
では欧文基本テーブルＥＢＴ、和文範囲ＪＡでの検索で
は最上層の和文テーブル（例えば、和文最上層テーブル
Ｊ２−２）あるいは１文字テーブルＪ１となる。そし
て、ステップＳＢ５では、上記検索処理が全ての検索用
疑似単語に対して完了したか否かを判断する。この判断
が「Ｎｏ」の場合はステップＳＢ６へ、逆に「Ｙｅｓ」
の場合はステップＳＢ９へ処理が進む。

【００６３】ステップＳＢ６は、検索用疑似単語に対す
る検索処理が完了しなかった場合の処理であり、検索対
象となっている和文テーブルが最下層のテーブル（例え
ば、和文最下層テーブルＪ２−１）であるか否かを判断
する。この判断が「Ｎｏ」の場合はステップＳＢ７へ、
逆に「Ｙｅｓ」の場合はステップＳＢ１８（図１４参
照）へ処理が進む。

【００６４】ステップＳＢ７は、検索対象となっている
和文テーブルが、さらに下層のテーブルを有する場合の
処理である。ここでは、検索対象となっている和文テー
ブル（例えば、和文最上層テーブルＪ２−２）におい
て、検索用疑似単語の文字コードＳＣより小さく、最も
文字コードＳＣに近い文字コードＶＣの固有疑似単語を
有するレコード（以後、近似レコードと称す）を抽出す
る。

【００６５】そして、検索対象とする和文テーブルを１
段下層のテーブル（例えば、和文最下層テーブルＪ２−
１）とし、このテーブルの特定範囲に対して、上層のテ
ーブルに対する場合と同様な検索処理が施される。ここ
で、特定範囲とは、上層のテーブル中の近似レコードに
対応付けられた下層テーブル中のレコード、および、こ
のレコードに後続する９９のレコードからなる。この検
索処理が終了すると、処理はステップＳＢ５へ戻る。ス
テップＳＢ９は、ステップＳＢ５での判断が「Ｙｅｓ」
となる場合の処理であり、検索された各レコードが有す
る各種アドレスを抽出する。

【００６６】検索されたレコードが和文テーブル（例え
ば、和文最上層テーブルＪ２−２）に存在する場合は、
当該レコードに対応付けられた最下層の和文テーブル
（例えば、和文最下層テーブルＪ２−１）中のレコード
を抽出し、当該レコードに対応付けられる文字アドレス
を抽出する。ここで抽出された最下層の和文テーブル中
のレコードが有するサイズが複数である場合は、上記文
字アドレスおよび後続する文字アドレス群から、順に、
サイズの数だけ文字アドレスを抽出する。

【００６７】また、検索文字列が１文字である場合に
は、１文字テーブルＪ１中の抽出されたレコードに対応
付けられる最下層の和文テーブル中のレコードを抽出す
る。この際、１文字テーブルＪ１中の検索されたレコー
ドのサイズが複数であれば、当該レコードに対応付けら
れた和文最下層テーブルＪ２−１のレコードおよびこの
レコードに後続するレコード群から、順に、サイズの数
だけレコードを抽出する。こうして抽出された和文最下
層テーブルＪ２−１中の各レコードに対応する文字アド
レスを抽出し、昇順にソートする。

【００６８】次に、ステップＳＢ１０では、各検索用疑
似単語に対応して抽出された文字アドレス群のうち、各
検索用疑似単語間の距離に相当する差を有する文字アド
レスの組を抽出し、抽出された組の先頭アドレスを抽出
する。例えば、図１７に示すように、検索文字列が”経
営危機”であれば、検索用疑似単語”経営”および”危
機”間の距離は２である。

【００６９】したがって、検索用疑似単語”経営”に対
応して抽出された文字アドレスと、検索用疑似単語”危
機”に対応して抽出された文字アドレスとの差が２とな
る組を抽出する。この際、各検索用疑似単語に対応する
文字アドレス群はソートされている為に、各々のアドレ
ス群から小さい順に文字アドレスを抽出し、これらを比
較することにより、差が２となる文字アドレスの組が容
易に抽出される。そして、抽出された文字アドレスの組
の先頭文字アドレス（”経営危機”の場合は’経’に対
応する文字アドレス）が抽出される。

【００７０】また、検索文字列がアルファベットであ
り、例えば、欧文基本テーブルＥＢＴから１つあるいは
複数のレコードＲ７が抽出された場合には、まず、当該
レコードＲ７に対応付けられた仮想アドレステーブルＶ
ＡＴ中のレコードＲ８を抽出する。そして、抽出された
レコードＲ８において、仮想アドレスのユニーク符号が
同一のレコードＲ８について、ワード内アドレスの差が
例えば、２となる仮想アドレスの組を抽出し、抽出され
た組の先頭文字アドレスを抽出する。

【００７１】ここで、例えば、検索用文字列が”ｗｏｒ
ｌｄ”であれば、検索用疑似単語”ｗｏ”と”ｒｌ”と
の間隔は２、検索用疑似単語”ｒｌ”と”ｌｄ”との間
隔は１である。したがって、検索用疑似単語”ｗｏ”に
対応して抽出された仮想アドレス群と、検索用疑似単
語”ｒｌ”に対応して抽出された仮想アドレス群とか
ら、ユニーク符号が「Ａ」であり、かつ、ワード内アド
レスの差が２となる仮想アドレスの組を抽出し、こうし
て抽出された仮想アドレスと、検索用疑似単語”ｌｄ”
に対応して抽出され、ユニーク符号が「Ａ」である仮想
アドレスとから、ワード内アドレスの差が１となる仮想
アドレスの組を抽出する。

【００７２】そして、抽出された組の仮想アドレスのう
ち、先頭の仮想アドレス中のユニーク符号からワードリ
ストＷＬ中のワードを特定する。特定されたワードに
は、ワードアドレスが対応付けられており、かつ、欧文
範囲ＥＡの先頭ワードには、和文範囲ＪＡから連続する
文字アドレス「３１７」も対応付けられているため、文
書データ中における文字アドレスが得られる。もちろ
ん、検索文字列が１文字である場合には、上述した連続
性判断は行われない。

【００７３】次に、ステップＳＢ１１では、文脈意識検
索か否かが判断される。この判断が「Ｙｅｓ」であれば
ステップＳＢ１２へ、「Ｎｏ」であればステップＳＢ１
３へ処理が進む。ステップＳＢ１２は、文脈意識検索で
ある場合の処理である。文脈意識検索であれば、検索文
字列は複数（ここでは、説明を簡略化するために２つと
する。以後、各検索文字列を第１の検索文字列、第２の
検索文字列と称す）であり、ここでは、第１および第２
の検索文字列に対する検索処理が終了したか否かが判断
される。この判断が「Ｎｏ」であれば、ステップＳＢ３
へ処理が戻り、未処理の検索文字列に対して上述した検
索処理が施される。逆に、「Ｙｅｓ」であればステップ
ＳＢ１３へ処理が進む。

【００７４】ステップＳＢ１３では、第１の検索文字列
に対応して抽出される先頭文字アドレス群と第２の検索
文字列に対応して抽出される先頭文字アドレス群とが比
較され、両者の差が指定距離以下となる文字アドレスの
組（以後、範囲内アドレス組と称す）を抽出する。この
際、２つの文字アドレスで規定される文書データ中に、
キャリッジリターン等の区切り記号が存在する場合に
は、両者の差が指定距離以下であっても、範囲内アドレ
ス組から除外される。

【００７５】次に、ステップＳＢ１４では、範囲内アド
レス組の数が１以上であるか否かが判断される。この判
断が「Ｙｅｓ」であればステップＳＢ１５へ、「Ｎｏ」
であればステップＳＢ１８へ処理が進む。ステップＳＢ
１５では、順位指定があるか否かが判断される。この判
断が「Ｙｅｓ」であればステップＳＢ１６へ、「Ｎｏ」
であればステップＳＢ１７へ処理が進む。

【００７６】ステップＳＢ１６は、順位指定があった場
合の処理であり、範囲内アドレス組内の文字アドレスの
順序が、指定された順序と一致する組（以後、順序一致
アドレス組と称す）を抽出する。ここで抽出される組が
０でない場合には、処理はステップＳＢ１７へ進む。逆
に、当該組が存在しない場合には処理はステップＳＢ１
８へ進む。

【００７７】ステップＳＢ１７では、まず、各検索文字
列に対応した先頭文字アドレス群に含まれる先頭文字ア
ドレスの数に応じた表示データをディスプレイ９へ供給
する。これにより、ディスプレイ９に表示されている検
索メニューの出力フィールド１６に、抽出されたデータ
数が表示される。これを視認したユーザーが、入力装置
６を操作し、所定の指示データを検索処理装置７へ供給
すると、当該装置７は、先頭文字アドレス群中の文字ア
ドレスを有する文書データに応じた表示データをディス
プレイ９へ供給する。

【００７８】こうして、図１６に示すように、検索結果
がディスプレイ９上に表示される。この際、文書データ
中の検索文字列に一致する文字列は、例えば、反転表示
され、他の文字列と区別される。また、文脈意識モード
であった場合には、指定範囲外あるいは順位が一致しな
かった先頭文字アドレスの文字列に下線が付される。こ
こで、ユーザーは、入力装置６を操作し、他の検索結果
等をディスプレイ９上に表示させる。

【００７９】また、ステップＳＢ１８は、ステップＳＢ
６、ステップＳＢ１４、あるいはステップＳＢ１６にお
いて、検索対象文字列に一致する文字列を検索できなか
ったと判断された場合の処理であり、ディスプレイ９へ
所定の表示データを供給し、「指定された条件の検索文
字列は文書中に存在しませんでした」等のメッセージを
表示させる。

【００８０】以上説明したように、本発明の一実施例に
よれば、文字列長が２の固有疑似単語を有する和文テー
ブルを階層的に構築する為に、和文テーブル自体のサイ
ズを大きくすることなく、検索効率に優れた全文検索を
行うことができる。また、１文字テーブルを設けた為
に、文字列長が１の検索文字列に対する検索処理を迅速
に行うことができる。さらに、ワードリストＷＬおよび
欧文基本テーブルＥＢＴを作成した為に、各固有疑似単
語に対応するサイズを適度な大きさとすることができ、
検索効率を向上させることができる。

【００８１】また、欧文範囲ＥＡにおいて、ワード単位
よりも小さな疑似単語単位での検索が可能になるため
に、語尾変化したワードを一度に検索することができ
る。例えば、入力装置６を介して”ｅｃｏｎ”という検
索文字列を入力すると、”ｅｃｏｎｏｍｉｃ”，”ｅｃ
ｏｎｏｍｙ”というワードを抽出することができる。

【００８２】なお、上述した一実施例においては、ＣＤ
−ＲＯＭに全文データベースを記憶させる例を示した
が、十分な記憶容量を有する記憶媒体であれば、ＣＤ−
ＲＯＭでなくともよい。また、検索処理装置７はワーク
ステーション等でも良く、パーソナルコンピュータであ
る必要はない。さらに、１段下層のテーブルを分割する
単位は９９である必要はなく、固有疑似単語の数に応じ
て設定することが望ましい。あるいは、検索作業をその
レコードで終了させるストップレコードを挿入するよう
にしてもよい。

【００８３】また、上述した一実施例においては、疑似
単語の文字数を２文字として説明したが、２文字に限定
されるものではなく、例えば、３文字、４文字、…とい
うように複数文字であればよい。もちろん、疑似単語の
文字数は、データベースの内容や検索処理の特徴等に応
じて設定される。例えば、電子出版において、文書デー
タが一般的な日本文である場合には、２文字程度に設定
される。

【００８４】さらに、上述した一実施例では、電子出版
に適用する例を示した為に、構築システム１が全文デー
タベースの提供者に使用され、検索システム５が全文デ
ータベースのユーザーに使用されるように、それぞれ個
別のシステムとして構成されるが、両者を一体のシステ
ムとして構成し、電子出版以外の分野で用いられる一般
的な全文データベースに対して適用可能であることは言
うまでもない。

【００８５】

【発明の効果】以上説明したように、本発明によれば、
アドレス付与手段が、文書データ中の各文字に連続する
アドレスを付与し、アドレステーブル作成手段が、前記
文書データ中の各文字と後続する文字とで構成される合
計ｋ文字（ｋは２以上）の疑似単語を作成し、各疑似単
語の先頭文字列に付与される各アドレスを、対応する疑
似単語の文字コード順にアドレステーブルへ記憶する。
そして、最下層構築手段が、固有の文字コードを有する
疑似単語を固有疑似単語として前記インデックステーブ
ル群中の最下層テーブルへ文字コード順に記憶するとと
もに、各固有疑似単語に前記アドレステーブル中の各ア
ドレスを対応付ける。また、判断手段が前記インデック
ステーブル群中の最上層テーブルに記憶される固有疑似
単語数が所定数以上であるか否かを判断し、固有疑似単
語数が所定数以上である判断された場合は、階層化手段
が前記最上層テーブルを略均等に分割するように複数の
固有疑似単語を抽出して前記最上層テーブルの上層のテ
ーブルを作成して新たな最上層テーブルとする。そし
て、階層化手段は、判断手段によって最上層テーブルに
記憶される固有疑似単語数が所定数未満と判断されるま
で、上述した新たな最上層テーブルを繰り返し作成す
る。さらに、前記インデックステーブル群は、合計ｋ文
字未満の疑似単語に対応したテーブルをも有している。
インデックステーブル群は、このような階層構造を有す
るので、検索時において、十分な検索速度を得ることが
できるという効果がある。また、インデックステーブル
群中の各テーブルに記憶される疑似単語は、固有の文字
コードを有する固有疑似単語であるので、インデックス
テーブル群のサイズが小となるという効果を得ることが
できる。さらに、インデックステーブル群が、合計ｋ文
字未満の疑似単語に対応したテーブルをも有しているの
で、ｋ文字数未満の検索文字列による検索がなされる場
合においても所定の応答速度で検索処理が可能になると
いう効果を得ることができる。

【図面の簡単な説明】

【図１】本発明の一実施例による全文データベースシス
テムの概略構成を示すブロック図である。

【図２】同実施例による全文データベース構築処理の流
れを示すフローチャートである。

【図３】同実施例で用いられる文書データの一例を示す
図である。

【図４】マーク付加処理が行われた文書データの一例を
示す図である。

【図５】各種アドレスが付与された文書データの一例を
示す図である。

【図６】欧文対照テーブルＣＴの概略構成を示す図であ
る。

【図７】ワードアドレステーブルＷＡＴおよびワードリ
ストＷＬの概略構成を示す図である。

【図８】疑似単語テーブルＰＷＴの概略構成を示す図で
ある。

【図９】仮想アドレステーブルＶＡＴおよび欧文基本テ
ーブルＥＢＴの概略構成を示す図である。

【図１０】和文疑似単語テーブルＪＰＴの概略構成を示
す図である。

【図１１】文字アドレステーブルＣＡＴおよび和文最下
層テーブルＪ２−１の概略構成を示す図である。

【図１２】和文最上層テーブルＪ２−２および１文字テ
ーブルＪ１等の概略構成を示す図である。

【図１３】本発明の一実施例による全文データベースシ
ステムにおける検索処理の流れを示すフローチャートで
ある。

【図１４】同システムにおける検索処理の流れを示すフ
ローチャートである。

【図１５】検索メニューの一例を示す図である。

【図１６】検索結果の一例を示す図である。

【図１７】検索文字列の一例を示す図である。

【符号の説明】

３構築処理装置（アドレス付与手段、アドレス
テーブル作成手段、最下層構築手段、階層化手段）６入力装置（入力手段）７検索処理装置（分割手段、検索手段）ＣＡＴ文字アドレステーブル（アドレステーブル）Ｊ２−１和文最下層テーブル（最下層テーブル）Ｊ２−２和文最上層テーブル（上層テーブル）

───────────────────────────────────────────────────── フロントページの続き (72)発明者奈良雅人東京都台東区台東一丁目５番１号凸版印刷株式会社内 (72)発明者濱谷群二東京都台東区台東一丁目５番１号凸版印刷株式会社内 (56)参考文献特開昭62−197822（ＪＰ，Ａ) 特開平３−118661（ＪＰ，Ａ) 菊池忠一，「日本語文書用高速全文検索の一手法」，電子情報通信学会論文誌（Ｄ−▲Ｉ▼），Ｖｏｌ．Ｊ75−Ｄ−▲ Ｉ▼，Ｎｏ．９，1992年９月25日，ｐ. 836−846 菊地芳秀、小川隆一、高橋恒介、杉本欽一、金田悟，「全文検索の技術動向とシステム事例」，情報処理学会研究報告（92−ＦＩ−25），Ｖｏｌ．92，Ｎｏ. 32，1992年５月12日，ｐ．１−８ (58)調査した分野(Int.Cl.⁷，ＤＢ名) G06F 17/30 G06F 12/00 520 ＪＩＣＳＴファイル（ＪＯＩＳ)

Claims

(57)【特許請求の範囲】

【請求項１】検索文字列に一致する文字列を文書デー
タから抽出する全文データベースシステムであって、連続するアドレスが付与された前記文書データ中の各文
字、および当該各文字に後続する文字から構成される合
成ｋ文字（ｋは２以上）の各疑似単語の先頭文字列に付
与された各アドレスを、対応する疑似単語の文字コード
順に記憶するアドレステーブルと、階層構造を有するテーブル群であって、固有の文字コー
ドを有する疑似単語を固有疑似単語として文字コード順
に記憶するとともに、各固有疑似単語に前記アドレステ
ーブル中の各アドレスが対応付けられる最下層テーブ
ル、この最下層テーブルの上層に構築される複数の上層
テーブルからなり、各上層テーブルは１段下層のテーブ
ルを略均等に分割する位置に記憶された固有疑似単語を
文字コード順に記憶する階層構造をなし、最上層テーブ
ルに記憶された固有疑似単語の数が所定数未満となるよ
う構成されるインデックステーブル群と、検索文字列を入力する入力手段と、該入力手段から供給される前記検索文字列をｋ文字単位
に分割し、複数の検索用疑似単語を生成する分割手段
と、前記各検索用疑似単語と文字コードが同一である固有疑
似単語を前記インデックステーブル群から抽出する抽出
処理を行い、抽出された各固有疑似単語に対応する各ア
ドレスの差から前記文書データ中で連続して存在する固
有疑似単語の組を特定するとともに、前記組に対応する
アドレス群に応じた文書データ中の文字列を出力する検
索手段とを具備し、前記検索手段は、前記検索用疑似単語と文字コードが一
致する固有疑似単語が検索対象となるテーブル中に存在
しない場合には、前記検索用疑似単語より小なる文字コ
ードの固有疑似単語群から最も前記検索用疑似単語に近
い文字コードの最小疑似単語と、この最小疑似単語の直
後に記憶される最大疑似単語とを抽出するとともに、１
段下層のテーブルを検索対象とし、当該１段下層のテー
ブルにおいて、前記最小疑似単語に一致する文字コード
の固有疑似単語と、前記最大疑似単語に一致する文字コ
ードの固有疑似単語とに挟まれる範囲に対して前記抽出
処理を施し、前記インデックステーブル群は、合計ｋ文字未満の疑似
単語に対応したテーブルをも有し、前記検索手段は前記
検索文字列の長さに応じて前記検索対象とするテーブル
を変更することを特徴とする全文データベースシステ
ム。
【請求項２】階層構造を有するインデックステーブル
群を用いて、検索文字列に一致する文字列を文書データ
から抽出する全文データベースシステムであって、前記文書データ中の各文字に連続するアドレスを付与す
るアドレス付与手段と、前記文書データ中の各文字と後続する文字とで構成され
る合計ｋ文字（ｋは２以上）の疑似単語を作成し、各疑
似単語の先頭文字に付与される各アドレスを、対応する
疑似単語の文字コード順にアドレステーブルへ記憶する
アドレステーブル作成手段と、固有の文字コードを有する疑似単語を固有疑似単語とし
て前記インデックステーブル群中の最下層テーブルへ文
字コード順に記憶するとともに、各固有疑似単語に前記
アドレステーブル中の各アドレスを対応付ける最下層構
築手段と、前記インデックステーブル群中の最上層テーブルに記憶
される固有疑似単語数が所定数以上であるか否かを判断
する判断手段と、前記判断手段により前記固有疑似単語数が所定数以上で
あると判断された場合、前記最上層テーブルを略均等に
分割するように複数の固有疑似単語を抽出して前記最上
層テーブルの上層のテーブルを作成して新たな最上層テ
ーブルとし、前記判断手段により、新たに作成された最
上層テーブル内の固有疑似単語数が所定数未満と判断さ
れるまで、前記上層のテーブルを繰り返し作成する階層
化手段と、前記検索文字列を入力する入力手段と、該入力手段から供給される前記検索文字列をｋ文字単位
に分割し、複数の検索用疑似単語を生成する分割手段
と、前記インデックステーブル群から前記検索用疑似単語と
文字コードが同一である固有疑似単語を抽出する抽出処
理を行い、抽出された各固有疑似単語に対応する各アド
レスの差から前記文書データ中で連続して存在する固有
疑似単語の組を特定するとともに、前記組に対応するア
ドレス群に応じた文書データ中の文字列を出力する検索
手段とを具備し、前記検索手段は、前記検索用疑似単語と文字コードが一
致する固有疑似単語が検索対象となるテーブル中に存在
しない場合には、前記検索用疑似単語より小なる文字コ
ードの固有疑似単語群から最も前記検索用疑似単語に近
い文字コードの最小疑似単語と、この最小疑似単語の直
後に記憶される最大疑似単語とを抽出するとともに、１
段下層のテーブルを検索対象とし、当該１段下層のテー
ブルにおいて、前記最小疑似単語に一致する文字コード
の固有疑似単語と、前記最大疑似単語に一致する文字コ
ードの固有疑似単語とに挟まれる範囲に対して前記抽出
処理を施し、前記インデックステーブル群は、合計ｋ文字未満の疑似
単語に対応したテーブルをも有し、前記検索手段は前記
検索文字列の長さに応じて前記検索対象とするテーブル
を変更することを特徴とする全文データベースシステ
ム。