JPH0216640A - デジタルデータ処理システムにおいて複数の構成要素の起こりそうな故障の一つを検出するエキスパートシステム - Google Patents

デジタルデータ処理システムにおいて複数の構成要素の起こりそうな故障の一つを検出するエキスパートシステム

Info

Publication number
JPH0216640A
JPH0216640A JP1080198A JP8019889A JPH0216640A JP H0216640 A JPH0216640 A JP H0216640A JP 1080198 A JP1080198 A JP 1080198A JP 8019889 A JP8019889 A JP 8019889A JP H0216640 A JPH0216640 A JP H0216640A
Authority
JP
Japan
Prior art keywords
error
defect
defective
module
input
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
JP1080198A
Other languages
English (en)
Other versions
JPH0758474B2 (ja
Inventor
Herman Polich
ハーマン ポーリッチ
James Nicholson
ジェイムズ ニコルソン
Larry Emlich
ラリー エムリッチ
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Digital Equipment Corp
Original Assignee
Digital Equipment Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Digital Equipment Corp filed Critical Digital Equipment Corp
Publication of JPH0216640A publication Critical patent/JPH0216640A/ja
Publication of JPH0758474B2 publication Critical patent/JPH0758474B2/ja
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F11/00Error detection; Error correction; Monitoring
    • G06F11/22Detection or location of defective computer hardware by testing during standby operation or during idle time, e.g. start-up testing
    • G06F11/2257Detection or location of defective computer hardware by testing during standby operation or during idle time, e.g. start-up testing using expert systems
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F11/00Error detection; Error correction; Monitoring
    • G06F11/22Detection or location of defective computer hardware by testing during standby operation or during idle time, e.g. start-up testing
    • G06F11/2205Detection or location of defective computer hardware by testing during standby operation or during idle time, e.g. start-up testing using arrangements specific to the hardware being tested

Landscapes

  • Engineering & Computer Science (AREA)
  • General Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Computer Hardware Design (AREA)
  • Quality & Reliability (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Test And Diagnosis Of Digital Computers (AREA)
  • Debugging And Monitoring (AREA)

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 産業上の利用分野 本発明は、一般に、デジタルデータ処理システムの分野
に係り、より詳細には、このようなシステムの欠陥及び
エラーを診断する機構に係る。
従来の技術 過去数年にわたり、政府機関や工業用としてコンピュー
タを利用する重要性が著しく増加した。
コンピュータは、簿記や会計や在庫管理といった全く一
般的な活動分野だけではなく、設計やエンジニアリング
や製造といった奥義のある分野でも利用できるように開
発されそして適応されてきた。
又、コンピュータは、ワードプロセス及びグラフィック
デザインを用いた文書作成のような多数のオフィス業務
においても利用されてきた。又、その場で又は電話線を
介してコンピユータ化データベースにアクセスできるこ
とも、知識を必要とする分野では重要である。
処理容量と、ユーザ間で情報を分担することとの両方に
ついて益々増大する需要を満たす試みとして、個々のコ
ンピュータがより高速に且つ更に複雑に形成されてきて
いると共に、遠隔通信リンクやプリンタ等のデータ及び
リソースをユーザ間で容易に分担できるように多数のコ
ンピュータが群即ちネットワークで接続されている。こ
のようなコンピュータシステムが益々複雑になるにつれ
て、ハードウェア又はソフトウェアにおいて欠陥が生じ
るおそれも増加する。それらの破壊や、欠陥により生じ
る修理費用を最小にするために多数の解決策が案出され
ている。然し乍ら、典型的に、このような解決策は、欠
陥の発生に基づくもので、これは、動作中の故障や或い
は潜在的にもっと大きな損害即ちデータの損失に気付い
たユーザによって指示される。この時点で、通常、サー
ビス技術者がその欠陥部品を識別してそれを修理しよう
とするが、これには、コンピュータのある場所に何回も
修理のために出向いて診断プログラムを広範囲に走らせ
、その欠陥部品を識別することが必要である。従って、
修理工程は、修理料だけでなく、コンピュータが使用で
きないか又は低レベルの性能しか発揮しないという点で
も若干コスト高となる。
発明の+1■成 本発明は、デジタルコンピュータシステムに関連して使
用するための専用システムであって、コンピュータシス
テムの種々の部品の動作を監視して、部品に欠陥が生じ
るおそれのあるときを識別し、その部品を交換できるよ
うにする新規で且つ改良された専用システムを提供する
。従って、この専用システムは、ユーザ又はオペレータ
が欠陥に気付く前にコンピュータシステムにおける欠陥
のおそれのある点を識別する。更に、専用システムは、
部品に欠陥のおそれがあることをコンピュータシステム
のオペレーティングシステムに知らせ、オペレーティン
グシステムがデータの損失又はシステム性能の低下を最
小にする手段をとれるようにする。
要約すれば、専用システムは、コンピュータシステムに
おけるユニットの欠陥のおそれを判断する。コンピュー
タシステムのオペレーティングシステムは、コンピュー
タシステムの各ユニットごとに発生するエラーの記録を
維持する。特定ユニットの記録に所定数のエラーが入力
された場合には、専用システムは、そのユニットに関連
したエラー入力を検索し、それを処理して、欠陥が発生
するおそれがあるかどうか判断する。この場合、専用シ
ステムにより行なわれる処理は、より一般的な部品に関
連したテストの後に、特殊性が増大し且つ一般性が減少
する部品に関連したテストが行なわれるように構成され
る。
本発明は、特許請求の範囲に特に指摘する。
本発明の上記及び更に別の効果は、添付図面に関連した
以下の詳細な説明より良好に理解されよう。
実施例 第1図は、デジタルデータ処理システム即ちコンピュー
タシステムにおいて欠陥のおそれのある点を識別するた
めの専用システムの機能的なブロック図である。この専
用システムは、コンピュータシステムによって処理され
るコンピュータプログラムの形態であることを最初に理
解されたい。
典型的に、コンピュータシステムは、1つ以上のコンピ
ュータな儂えている。コンピュータシステムが複数のコ
ンピュータを含んでいる場合には、それらのコンピュー
タが通信リンクによって相互接続されて、種々のコンピ
ュータ間でデータ及びプログラムを共有することのでき
る群即ちネットワークを形成する。
コンピュータシステムの各コンピュータは、1つ以上の
プロセッサ及びメモリを含む多数のユニットを備えてい
ると共に、ディスク及び/又はテープ記憶システムのよ
うな大量記憶サブシステムをバックアップ及び補助記憶
装置として備えていると共に、ビデオデイスプレィター
ミナルやプリンタや遠隔通信リンクのような入力/出力
システムも備えており、これら全てのユニットはバスに
よって選択的に相互接続されている。専用システムは、
ネットワーク即ち群内のいずれかのコンピュータに関連
して作動し、そこに含まれたいずれかのユニットの欠陥
のおそれを検出する。1つの特定の実施例において、専
用システムは、lっの特定の形式のユニット、特に、デ
ィスク記憶サブシステムの欠陥のおそれを検出するが、
本発明による同様の専用システムを用いて、コンピュー
タシステムに含まれたいかなる形式のユニットの欠陥の
おそれも検出することができる。
第1図を参照すると、専用システムは、システムを構成
する種々のユニットにおける間欠的な又は永久的な欠陥
に関連した欠陥情報を複数のデータ+1り遺体を介して
通信する複数の作動エレメントを備えている。通常そう
であるように、コンピュータシステムに含まれた種々の
ハードウェア及びソフトウェアリソースを管理するコン
ピュータシステムのオペレーティングシステム10は、
コンピュータシステムのユニットの動作によって生じる
種々の欠陥、エラー、等に関連した指示を記録するエラ
ー記録(ログ)11を維持する。
オペレーティングシステム10は、エラー記録11に項
目を記憶すると、専用システムの一部分を形成するモニ
タモジュール12をイネーブルする。このモニタモジュ
ールは、オペレーティングシステム10によってイネー
ブルされると、エラー記録11における種々の入力を分
類し、特定ユニットの欠陥のおそれに関連した入ノJが
それ以降の分析を正しく判断できるに充分なほどあるか
どうかを決定し、そしてもしそうであれば、欠陥待ち行
列13における入力の記録を形成する。ユニット又はそ
の部品の欠陥のおそれは多数の形式のエラーによって予
測され、これらのエラーは、ユニットに直接起因するか
又は関連したものであってもよいしなくてもよい。例え
ば、ユニットのバスインターフェイス部品又はバスワイ
ヤ自体の切迫した欠陥は、バスに取り付けられた種々の
ユニットに対して指示されるエラーを生じる。特定ユニ
ットの欠陥のおそれに対するエラーの関連性は、専用シ
ステムが作動している特定のコンピュータシステムに基
づくものである。
いずれにせよ、モニタモジュール12は、オペレーティ
ングシステム10によってイネーブルされると、エラー
記録11における種々の入力を分類し、そこで指示され
たエラーがランダムなものであるか過渡状態であるか、
或いはコンピュータシステムの特定のユニットに欠陥の
おそれがあることを指示しているかどうかを判断する。
この動作において、モニタモジュール12は、エラー記
録における入力をその特定のユニットに関連させ、そし
てその特定のユニットに関連した入力の数が所定のスレ
ッシュホールドを越えるかどうか判断する。もしそうで
なければ、モニタモジュール12は、オペレーティング
システム10が再びこれをイネーブルするのを待機する
一方、モニタモジュール12が特定ユニットに関連した
入力の数が所定のスレッシュホールドを越えると判断し
た場合には、モニタモジュール12は欠陥入力を発生し
てそれを欠陥待ち行列13に挿入する。欠陥入力は、欠
陥入力の発生を促したユニットに関連したエラー記録l
l内の入力及び特定のユニットを識別する。更に、欠陥
入力が欠陥待ち行列13の第1入力である場合には、モ
ニタモジュールが欠陥管理回路14を作動し、欠陥待ち
行列13の欠陥入力を処理する。
欠陥管理回路14は、2つのモジュール即ち収集モジュ
ール15及び分析モジュール16を備えている。収集モ
ジュールは、モニタモジュールによって最初に作動され
ると、欠陥待ち行列13から欠陥入力を検索し、欠陥入
力の発生を促したコンピュータシステムのユニットを識
別し、そしてそのユニットに関連したエラー記録11の
エラー入力をエラー記録】1から検索する。次いで、収
集モジュール15は、エラー記録サブセット17を形成
し、これは、ユニットに関連したエラー記録11からの
エラー入力を含んでおり、分析モジュール16を作動す
る。
分析モジュール16は、収集モジュール15によって与
えられたエラー記録サブセット17のエラー入力を分析
し、ユニットに欠陥のおそれがあるかどうか判断する。
分析モジュール16は、第2A図ないし第2D図に関連
して詳細に述べるように、ユニットに関連した種々の欠
陥理論について分析を行ない、ユニットの欠陥のおそれ
を判断する。簡単に述べると、各形式のエラーは、lつ
以上の欠陥理論に基づいてユニットの欠陥のおそれの兆
候を構成する。各欠陥理論は、次いで、ユニットに欠陥
が生じる複数のモードの特定の1つに関連しており、各
欠陥モードは、欠陥を生じるユニット内の特定の部品に
向けられる。各欠陥理論において、専用システム、特に
分析モジュール16が欠陥の生じるおそれがあると考え
るためには、その部品に関連した所定数のエラーが生じ
なければならない。
分析モジュール16は、エラー記録サブセット17が種
々の欠陥理論のいずれかに関連した充分なエラー入力を
含むかどうかを判断し、もしそうであれば、そのユニッ
ト及び欠陥理論を識別する欠陥理論入力を発生し、それ
らを理論ファイル20に記憶する。
分析モジュール16は、欠陥理論入力を発生してそれを
理論ファイル20に記憶した後、理論ファイル20を必
要とする通知モジュール21を作動し、これは、そのフ
ァイルに記憶された欠陥理論入力を用いてオペレータ通
知メツセージを発生し、システムオペレータに欠陥のお
それを通知する。オペレータ通知メツセージは、オペレ
ータがそれによって指示される欠陥に関連した復帰手順
を開始できるようにする。又、通知モジュール21は、
欠陥理論を満足させたと共に欠陥が生じるおそれがある
という判断をなしたエラーの形式の指示を含む修理技術
者通知メツセージも発生し、これは、修理作業中に修理
技術者によって用いられる。
又、復帰モジュール22は、分析モジュール16によっ
て作動されると、理論ファイル2oを要求し、そして該
ファイルに記憶された種々の欠陥理論入力に応答して指
示される選択された復帰動作を開始する。特に、コンピ
ュータシステムの種々のディスク記憶ユニットの欠陥の
おそれを判断するために専用システムが使用される1つ
の実施例においては、理論ファイル20の欠陥理論入力
がディスク記憶ユニットの欠陥を指示する場合に、復帰
モジュール22はオペレーティングシステムが別のディ
スク記憶ユニットをシャドウ又はバックアップとして使
用できるようにする。この場合に、オペレーティングシ
ステムは、欠陥のあるディスク記憶ユニットに記憶され
たデータを他のディスク記憶ユニットにも記憶できるよ
うにし、データが失われるおそれを減少する。更に、こ
のように記憶されたデータは、修理動作中には上記能の
ディスク記憶ユニットから使用できる。
上記したように、分析モジュール16は、複数の欠陥理
論に関連してエラー記録サブセット17のエラー入力を
分析し、ユニットに欠陥のおそれがあるかどうかを判断
する。分析モジュール17は、エラー入力が欠陥理論の
いずれも満足しないと判断すると、制御を収集モジュー
ル15に戻し、該モジュールが欠陥待ち行列13の次の
入力を処理する。欠陥管理回路14は、全ての入力が処
理されるまで、モニタモジュール12によって与えられ
た欠陥待ち行列13の入力を繰り返し処理する。コンピ
ュータシステムは、モニタモジュール12と、欠陥管理
回路14を構成するモジュールを同時に作動させ、従っ
て、モニタモジュール12は、欠陥管理回路j4、より
詳細には収集モジュール15によって処理のために取り
出すのと同時に欠陥待ち行列13に入力をロードする。
前記したように、分析モジュール16は、複数の欠陥理
論に関連してエラー記録サブセット17のエラー入力を
用いて分析を行なう。欠陥理論はハイアラーキ形態で送
られる。というのは、オペレーティングシステム10に
よってユニット内の同じ形式の複数の部品に関係付けら
れたエラーが実際上別の部品の欠陥のおそれの兆候を与
えるからである。
例えば、ディスク記憶ユニットにおいて、単一の読み取
り/書き込みヘッドに起因する多数のヘッドはそのヘッ
ドの欠陥のおそれを指示するが、複数の読み取り/書き
込みヘッドに起因するランダムなエラーは、これら全て
のヘッドに接続された別の部品、例えば、書き込みのた
めにヘッドを付勢したり或いはヘッドからの読み取り信
号を受は取ったりする回路の欠陥のおそれを指示する。
全てのヘッドではなくて他の部品が欠陥のおそれのある
ものとして識別されるようにするためには、分析モジュ
ール16が、ヘッドに関連した分析を行なう前に、上記
能の部品に関連した分析を行なう。
1つの実施例においては、欠陥理論が3つのグループに
分割され、即ち、通信欠陥理論、駆動検出非媒体(dr
ive−detected non−media)欠陥
理論及び媒体欠陥理論に分割される。一般に、通信欠陥
理論は、駆動記憶ユニットから受は取った情報に関連し
たエラーに関するもので、これは、選択された時間切れ
インターバル内でコマンドを実行するディスク記憶ユニ
ットの欠陥の指示、ディスク記憶ユニットからのある信
号の欠落の指示、ディスク記憶ユニットからの信号のパ
リチーエラーの指示、等々のエラーを含む。ディスク記
憶ユニットを含む大量記憶サブシステムの制御器は、例
えば、割り込みサービスによるエラー復帰の要求に関連
してこのようなエラーをオペレーティングシステム12
に通知する。
駆動検出非媒体欠陥理論は、一般に、コンピュータシス
テムの他のユニットにより駆動記憶ユニットに情報を送
信することに関連したエラーに関するものである。ディ
スク記憶ユニットは、例えば、割り込みサービスによる
エラー復帰の要求に関連してこのようなエラーをオペレ
ーティングシステム12に通知する。
更に、媒体欠陥理論は、一般に、1つ以上の読み取り/
書き込みヘッドの欠陥のおそれを指示するタイミング、
ヘッド/ディスク移動又はエラー検出/修正回路や、ヘ
ッドを付勢する回路や、サーボ回路によって指示される
ようなエラー、ディスク記憶ユニット内の媒体のスクラ
ッチ等の欠陥、及びエラー検出/修正回路自体の欠陥の
おそれを指示するものに関する。
このような背景により、エラー記録サブセット17のエ
ラー入力に関連して分析モジュール16の一実施例によ
って行なわれる一般的な動作が第2A−1図及び第2A
−2図に示されている。
実行される特定の動作は、専用システム(第1図)を使
用すべき特定のユニットとそれらの部品とに基づくもの
であることを理解されたい。第2A−1図を参照すれば
、分析モジュール16は、先ず、通信欠陥理論に関連し
て分析動作を実行する(ステップ30)。ステップ30
で行なわれる分析動作は、第2B図について以下で述べ
る。分析モジュール16は、通信欠陥理論が満足された
と判断すると(ステップ31)、欠陥理論入力を発生し
てこれを理論ファイル20に記憶する(ステップ32)
。その後、分析モジュール16は、通知モジュール21
を作動してオペレータのための適当なメツセージを発生
すると共に、復帰モジュール22を作動して適当な復帰
動作をとらせるようにする(ステップ33)。
ステップ31において、エラーの指示が通信欠陥理論を
満足しないことを分析モジュール16が判断すると、分
析モジュールはステップ34に進み、駆動検出非媒体欠
陥理論に関連した分析動作を実行する。ステップ34で
行なわれる分析動作は、第2C図を参照して以下で述べ
る。分析モジュール16は、駆動検出非媒体欠陥理論が
満足されないことを判断すると(ステップ35)、欠陥
理論入力を発生し、それを論理ファイル20に記憶する
(ステップ36)。その後、分析モジュール16は、通
知モジュール21を作動してオペレータのための適当な
メツセージを発生すると共に、復帰モジュール22を作
動して適当な復帰動作をとらせるようにする(ステップ
37)。
一方、ステップ35において、エラー指示が駆動検出非
媒体欠陥理論を満足しないと分析モジュール16が決定
すると、分析モジュールはステップ40に進み、媒体欠
陥理論に関連した分析動作を実行する。ステップ34で
実行される分析動作は、第2D図を参照して以下に述べ
る。分析モジュール16は、媒体欠陥理論が満足される
と判断すると(ステップ41)、欠陥理論入力を発生し
てそれを理論ファイル20に記憶する(ステップ42)
。その後、分析モジュール16は、通知モジュール21
を作動してオペレータのための適当なメツセージを発生
すると共に、復帰モジュール22を作動して適当な復帰
動作をとらせるようにする(ステップ43)。
更に、ステップ41において、分析モジュール16は、
エラー指示が媒体欠陥理論を満足しないと判断すると、
ステップ44に進み、手順から出ると共に制御権を収集
モジュール15に復帰する。次いで、収集モジュール1
5は、欠陥待ち行列13におけるモニタモジュール12
からの次の欠陥入力を処理する。上記したように、欠陥
待ち行列13が空である場合には、収集モジュール15
が動作を終了し、モニタモジュール12による再作動を
保留する。
上記したように、通信欠陥理論に関連して分析モジュー
ル16により行なわれる動作は、第2B図を参照して説
明する。このような理論は、ホストコンピュータ又はデ
ィスク記憶ユニットを制御する制御器によって検出され
るエラー、例えば、コマンド時間切れや、幾つかの信号
の送信におけるエラーや、送信におけるパリティ又はプ
ロトコルのエラー、等々に関連したものである。第2B
図を参照すれば、分析モジュール16は、エラー記録サ
ブセット17における少なくとも所定数のエラー入力が
ディスク記憶ユニットを制御する制御器又はホストコン
ピュータによって検出された通信エラーに関連したもの
であるかどうかを判断する(ステップ50)。このよう
なエラー入力の数が不充分な場合には、分析モジュール
16は通信欠陥分析手順を出る(ステップ51)。
一方、分析モジュール16は、エラー記録サブセット1
7が充分な数のこのようなエラー入力を含むと判断する
と、ステップ52へ進み、通(1(エラー及び非媒体駆
動検出エラーに関連したエラー入力の種々の比を与える
(ステップ52)。通信入力を示すエラー入力を生じる
エラーは、非媒体駆動検出エラーを示すエラー入力も生
じるので、ステップ52で与えられる比は、どれがエラ
ーの原因であるかを決定する上で助けとなる。これらの
比がエラーが通信欠陥によるものであることを指示しな
い場合には(ステップ53)、分析モジュール16が手
順から出る(ステップ54)。
一方、上記比がエラーが通信欠陥によるものであること
を指示するとステップ53において分析モジュール16
が判断する場合には、該モジュールが欠陥理論入力を発
生し、理論ファイル20への挿入を指示する(ステップ
55)と共に、手順から出る(ステップ56)。
分析モジュール16がステップ51又は53のいずれか
において手順を出ると、第2C図に示された駆動検出非
媒体欠陥理論(第2A−1図のステップ34)に関連し
た分析を実行するように進む。このような理論は、ディ
スク記憶ユニットによって検出されたエラー、例えば、
幾つかの信号の送信におけるエラー、送信におけるパリ
ティ又はプロトコルエラー、等に関連したものである。
第2C図を参照すると、分析モジュールは、エラー記録
サブセット17が非媒体駆動検出エラーに関連したスレ
ッシュホールド数のエラー入力を含むかどうかを最初に
判断する。エラー記録サブセット17がスレッシュホー
ルド数のこのようなエラー入力を含まない場合には、分
析モジュール16がステップ61へ進み、手順から出る
一方、ステップ60において、分析モジュール16がエ
ラー記録サブセット17がスレッシュホールド数のエラ
ー入力を含むと判断した場合には、次いで、そのほとん
どが特定形式のエラーに関連したものであるかどうかを
判断しくステップ62)、もしそうであれば、エラーの
形式を識別する欠陥理論入力を発生して理論ファイル2
0に挿入しくステップ63)、そして手順を出る(ステ
ップ64)、非媒体駆動検出エラーを識別するエラー入
力の中で1つのエラー形式が顕著なものとなっていない
場合には、分析モジュール16は、最も多数のエラー入
力によって識別されたエラー形式を識別する1つ以上の
欠陥論理入力を理論ファイル20に記憶するために発生
する(ステップ65)。ステップ65に続いて、分析モ
ジュール16が手順から出る(ステップ66)。
分析モジュール16がステップ61において手順から出
る場合には、媒体に関連した欠陥理論(第2A−2図)
に関連した分析を実行するように進み、これらは第2D
−1図ないし第2D−8図に例示されている。簡単に述
べると、媒体に関連した欠陥理論は、2つの一般的なエ
ラーの分類に関連している。その一方の分類、即ちラン
ダムエラーは、一般に、無効ヘッダの検出、データ同期
の損失、エラー検出及び修正回路によって検出された修
正可能又は修正不能なデータエラー、等々を含んでいる
。媒体関連欠陥理論の分類、即ち駆動回路又は他のハー
ドウェア問題に一般的に関連した駆動検出エラーは、探
索エラー トラック外れエラー、及びヘッドやサーボシ
ステム等を含む読み取り/書き込み回路との問題による
エラーを含む。
第2D−1図ないし第2D−8図は、分析モジュール1
6が順次に実行する一連の8つの解説のためのテストを
示している。これらのテストは、ハイアラーキ式に順序
付けされ、後のテストはど特殊性の高い部品の欠陥のお
それに向けられる。
というのは、前記したように、オペレーティングシステ
ム10によってユニット内の同じ形式の複数のより特定
の部品に影響が及ぶエラーが、実際上、より一般的に適
用できる別の部品の欠陥のおそれの兆候を与えるからで
ある。従って、分析モジュール16は、第2D−1図に
示すようにヘッドマトリクスの欠陥のおそれを判断する
テストを実行し、その後、第2D−8図に示すように単
一ヘッドの欠陥のおそれを判断するテストを実行する。
というのは、ヘッドマトリクスが複数のヘッドに関連し
た部品だからである。分析モジュール16がヘッド欠陥
テストを行なってからヘッドマトリクステストを行なう
ようになっている場合には、単一ヘッドに欠陥のおそれ
があることを判断した際にテストを終了することになり
、ヘッドマトリクステストに到達しない。1つのテスト
が満足した場合、即ち、分析モジュール16が第2D−
1図ないし第2D−8図の1つのテストから欠陥のおそ
れがあると判断した場合には、次のテストへと進まない
第2D−1図ないし第2D−8図に示された一連の動作
は、一般に自明であり、詳細には説明しない。各テスト
において、分析モジュールI6は、エラー記録サブセッ
ト17のエラー入力に関連した所定の一連の動作を実行
する。テストに規定された基準を満足する場合には、欠
陥のおそれを示す欠陥理論入力を発生し、それを理論フ
ァイル20に挿入する。さもなくば、分析モジュール1
6は次のテストに進み、或いは最後のテストの場合には
、手順から出て、制御権を収集モジュール15へ戻す。
一般に、第2D−1図に示されたヘッドマトリクス欠陥
テストにおいては、ヘッドマトリクスが4つの読み取り
/書き込みヘッドの動作に関連しているので、分析モジ
ュール16は、先ず一連のステップを実行してエラー記
録サブセット17が2つ以上のヘッドに関連したエラー
入力を含んでいるかどうか判断しくステップ92)、そ
して第2に、はとんどのエラー入力が特定へラドマトリ
クスに関連したヘッドに関するものであるかどうか判断
する(ステップ94.96及び100)。
もしそうならば、欠陥のおそれのあるヘッドマトリクス
を識別する欠陥理論入力を理論ファイル2Oに記憶する
ために発生する(ステップ102)。
分析モジュール16は、第2D−1図に示されたシーケ
ンスにおいて、ベツドマトリクスに欠陥のおそれがない
と判断すると、第2D−2図に示されたテストを開始し
、不良ディスク表面のおそれ、ひいては、一般的に不良
な記憶媒体を判断する。このテストでは、そのディスク
表面に関連して動作する読み取り/書き込みヘッド間に
エラーが一般的に均一に分布されることが必要である。
分析モジュール16は、第2D−2図に示されたシーケ
ンスにおいて不良のディスク表面が指示されないと判断
すると、第2D−3図に示された示されたシーケンスへ
進み、ディスクの1区分が不良であるおそれがあるかど
うか判断するテストを実行する。このようなおそれは、
一般に、「ヘッドスラップ」即ち1つの区分に欠陥を一
般に招くヘッドとディスクとのぶつかりによって発生す
る。各ディスク面ごとに多数の読み取り/書き込みヘッ
ドを有するディスク記憶ユニットにおいては、分析モジ
ュール16は、エラー記録サブセット17にある少なく
とも所定のスレッシュホールド数のエラー入力が同じデ
ィスク面上にある少なくとも若干のヘッドを識別すると
共に、同じ区分に生じるエラーを識別するかどうかを判
断する。
分析モジュール16は、第2D−3図に示されたシーケ
ンスにおいて「ベツドスラップ」が指示されないと判断
すると、第2D−4(a)図及び第2D−4(b)図に
示されたシーケンスへ進み、ディスク記憶ユニットのサ
ーボシステムの欠陥のおそれを判断する。このシーケン
スにおいて、分析モジュール16は、先ず、エラー入力
がサーボエラーを識別するかどうかそしてそれらがディ
スク記憶ユニットの多数のヘッドに関連したものである
かどうかを判断する。次いで、分析モジュール16は、
ディスクのサーボ面に周囲キズのおそれがあるか(ステ
ップ156)又は半径方向のキズのおそれがあるか(ス
テップ161)判断する。
分析モジュール16は、周囲にも半径方向にもキズのお
それがないと判断すると、一般的なサーボ欠陥のおそれ
があるかどうか判断する。
その後、分析モジュール16は、読み取り経路の欠陥テ
ストを行ない(第2D−5図)、一般的な読み取り経路
の欠陥のおそれを判断する。所定数のエラー入力がラン
ダムなエラーを識別して、無効ヘッダの検出、データ同
期の損失、エラー検出及び修正回路によって検出された
修正可能又は修正不能なデータエラー、等を指示する場
合には、分析モジュール16は、一般的な読み取り経路
欠陥のおそれがあることを判断する。
3つの更に別のテストが添付図面に示されている。読み
取り経路の欠陥テスト(第2D−5図)に続いて、分析
モジュール16は、ディスク面に対向している即ち面し
ているヘッドに欠陥のおそれがあるかどうか判断するテ
スト(第2D−6図)を行なってディスク面に半径方向
のキズが存在するかどうか判断する(第2D−7図)と
共に、特定の読み取り/書き込みヘッドに欠陥のおそれ
があるかどうか指示するテスト(第2D−8図)を実行
する。第2D−7図に示されたテストでは、ディスク記
憶ユニットの各ヘッドに関連してテストが繰り返し行わ
れる。
専用システムに関連した特定のテスト及びそれらを行な
う順序は、専用システム(第1図)と共に使用すべき特
定のユニットによって決定されることが明らかであろう
。専用システムをディスク記憶ユニットの制御器及びデ
ィスク記憶ユニット自体と共に使用すべき場合には、専
用システムは、ディスク記憶ユニットに関するテストを
実行する前に制御器に関する付加的なテストを実行する
必要がある。同様に、専用システムが1つ又はそれ以上
の通信リンクを経て通信する複数のコンピュータより成
る群又はネットワークコンピュータシステムと共に使用
される場合には、専用システムがデジタルデータ処理シ
ステムの1つのコンピュータにおいて動作することもで
きるし、プロセッサ、メモリ、及びコンピュータの他の
形式の要素におけるエラーを検出するように適当な追加
を行なって、コンピュータシステムの他のコンピュータ
に生じる欠陥のおそれを検出するのに用いることもでき
る。
以上の説明は、本発明の特定の実施例に限定された。然
し乍ら、本発明に対し種々の変更や修正を加えても本発
明の全ての又は幾つかの効果を達成できることが明らか
であろう。それ故、本発明の真の精神及び範囲内に入る
このような修正や変更は全て特許請求の範囲内に包含さ
れるものとする。
【図面の簡単な説明】
第1図は、本発明によって溝成された専用システムの主
要要素を示す機能ブロック図、そして第2八図ないし第
2D図は、第1図に示された専用システムによって実行
される欠陥分析を示す流れ線図である。 10・・・オペレーティングシステム 11・・・エラー記録 12・・・モニタモジュール 13・・・欠陥待ち行列 14・・・欠陥管理回路 15・・・収集モジュール ・分析モジュール ・エラー記録サブセット 20 ・ ・理論ファイル ・通知モジュール 22 ・ ・復帰モジュール FIG、 2A−1 FIG、2A−2 図面の浄書(内容に変更なし) FIG、1 FIG、 2A−2 退出しそして制御を収集モジュール に戻す FIG、 2B 通信欠陥の分析 退出 FIG、 2D−1 テスト ■ ヘッドマトリクス欠陥テスト FIG、 2C 駆動検出非媒体欠陥分析 FIG、 2D−2 テスト ■ 不良表面テス ト テスト■ FIG。2D−3 ヘッド衝突テス ト ↓ 165退出 FIG、 2D−5 読み取り経路欠陥テスト FIG、 2D−4(a) テスト■ サーボ テスト FIG、2D−4(b) FIG、 2D−6 テスト ■ 対向表面における不良ヘッドのテスト ↓ +87 、!A出 FIG、 2D−8 テスト FIG、 2D−7 半径方向キズのテスト テスト〜■ 不良ヘッドテスト

Claims (1)

  1. 【特許請求の範囲】 デジタルデータ処理システム内のユニットの欠陥のおそ
    れを検出する専用システムにおいて、 a)上記ユニットによるエラーの発生の識別を各々記憶
    する複数のエラー入力を含んだエラー手段を具備し、各
    々のエラー入力は、上記エラーの性質を識別するエラー
    情報を含んでおり、 b)更に、上記エラー入力におけるエラー情報に応答し
    て上記ユニットの欠陥のおそれを判断するよう上記エラ
    ー入力を処理する分析処理手段を具備し、そして c)更に、上記分析処理手段の出力を利用するための利
    用手段を具備したことを特徴とする専用システム。
JP1080198A 1988-03-30 1989-03-30 デジタルデータ処理システムにおいて複数の構成要素の起こりそうな故障の一つを検出するエキスパートシステム Expired - Lifetime JPH0758474B2 (ja)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
US17548588A 1988-03-30 1988-03-30
US175485 1988-03-30

Publications (2)

Publication Number Publication Date
JPH0216640A true JPH0216640A (ja) 1990-01-19
JPH0758474B2 JPH0758474B2 (ja) 1995-06-21

Family

ID=22640402

Family Applications (1)

Application Number Title Priority Date Filing Date
JP1080198A Expired - Lifetime JPH0758474B2 (ja) 1988-03-30 1989-03-30 デジタルデータ処理システムにおいて複数の構成要素の起こりそうな故障の一つを検出するエキスパートシステム

Country Status (5)

Country Link
US (1) US5469463A (ja)
EP (1) EP0335507B1 (ja)
JP (1) JPH0758474B2 (ja)
CA (1) CA1318030C (ja)
DE (1) DE68924923T2 (ja)

Families Citing this family (45)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
DE69228986T2 (de) * 1991-02-05 1999-08-12 Storage Technology Corp., Louisville, Col. Durch hierarchisch verteilte wissenbasierte maschine ausgelöste wartungs-vorrichtung und -verfahren
US5828583A (en) * 1992-08-21 1998-10-27 Compaq Computer Corporation Drive failure prediction techniques for disk drives
US5535335A (en) * 1992-12-22 1996-07-09 International Business Machines Corporation Method and system for reporting the status of an aggregate resource residing in a network of interconnected real resources
US6446224B1 (en) * 1995-03-03 2002-09-03 Fujitsu Limited Method and apparatus for prioritizing and handling errors in a computer system
US6467054B1 (en) 1995-03-13 2002-10-15 Compaq Computer Corporation Self test for storage device
US5761411A (en) * 1995-03-13 1998-06-02 Compaq Computer Corporation Method for performing disk fault prediction operations
US5758057A (en) * 1995-06-21 1998-05-26 Mitsubishi Denki Kabushiki Kaisha Multi-media storage system
US5923876A (en) * 1995-08-24 1999-07-13 Compaq Computer Corp. Disk fault prediction system
US5845064A (en) * 1995-09-11 1998-12-01 Digital Equipment Corporation Method for testing and verification of a CPU using a reference model
US5850388A (en) * 1996-08-02 1998-12-15 Wandel & Goltermann Technologies, Inc. Protocol analyzer for monitoring digital transmission networks
US5850386A (en) * 1996-11-01 1998-12-15 Wandel & Goltermann Technologies, Inc. Protocol analyzer for monitoring digital transmission networks
US6125393A (en) * 1997-03-28 2000-09-26 International Business Machines Corporation System of compressing the tail of a sparse log stream of a multisystem environment
US5920875A (en) * 1997-03-28 1999-07-06 International Business Machines Corporation Tail compression of a sparse log stream of a computer system
US5956735A (en) * 1997-03-28 1999-09-21 International Business Machines Corporation System of compressing the tail of a sparse log stream of a computer system
US5999935A (en) * 1997-03-28 1999-12-07 International Business Machines Corporation Tail compression of a sparse log stream of a multisystem environment
US5983364A (en) * 1997-05-12 1999-11-09 System Soft Corporation System and method for diagnosing computer faults
US6311175B1 (en) 1998-03-06 2001-10-30 Perot Systems Corp. System and method for generating performance models of complex information technology systems
US6393387B1 (en) 1998-03-06 2002-05-21 Perot Systems Corporation System and method for model mining complex information technology systems
US6611877B2 (en) * 1998-06-30 2003-08-26 Sun Microsystems, Inc. System and method for aggregating registration of entities for notifications of events
US6529893B1 (en) 1999-02-26 2003-03-04 Mandel Foner Expert diagnostic system with inference generator
US6412089B1 (en) 1999-02-26 2002-06-25 Compaq Computer Corporation Background read scanning with defect reallocation
US6493656B1 (en) 1999-02-26 2002-12-10 Compaq Computer Corporation, Inc. Drive error logging
US6538453B1 (en) * 2000-03-31 2003-03-25 Nexpress Solutions Llc Detecting erratic resistance in temperature sensors
US6598179B1 (en) * 2000-03-31 2003-07-22 International Business Machines Corporation Table-based error log analysis
US6738928B1 (en) 2000-06-19 2004-05-18 Hewlett-Packard Development Company, L.P. Method and expert system for analysis of crash dumps
US6842806B2 (en) 2001-05-29 2005-01-11 Sun Microsystems, Inc. Method and apparatus for interconnecting wired-AND buses
US20040225814A1 (en) * 2001-05-29 2004-11-11 Ervin Joseph J. Method and apparatus for constructing wired-AND bus systems
US7149838B2 (en) * 2001-05-29 2006-12-12 Sun Microsystems, Inc. Method and apparatus for configuring multiple segment wired-AND bus systems
EP1378827A1 (en) * 2002-07-05 2004-01-07 Alcatel Process for changing the language of a GUI application without exiting and re-entering the application
US7484125B2 (en) * 2003-07-07 2009-01-27 Hewlett-Packard Development Company, L.P. Method and apparatus for providing updated processor polling information
US7437704B2 (en) * 2003-08-28 2008-10-14 Ines Antje Dahne-Steuber Real-time generation of software translation
US7213176B2 (en) * 2003-12-10 2007-05-01 Electronic Data Systems Corporation Adaptive log file scanning utility
US20060026466A1 (en) * 2004-08-02 2006-02-02 Bea Systems, Inc. Support methodology for diagnostic patterns
JP4125274B2 (ja) * 2004-08-26 2008-07-30 キヤノン株式会社 画像入出力装置および情報処理方法およびコンピュータが読み取り可能なプログラムを格納した記憶媒体およびプログラム
US20060100806A1 (en) * 2004-11-10 2006-05-11 Matsushita Electric Industrial Co., Ltd. Enhanced system for electronic storage device calibrations
US7788205B2 (en) 2006-05-12 2010-08-31 International Business Machines Corporation Using stochastic models to diagnose and predict complex system problems
US7349826B2 (en) 2006-05-23 2008-03-25 International Business Machines Corporation Causal ladder mechanism for proactive problem determination, avoidance and recovery
US20090259890A1 (en) * 2008-04-14 2009-10-15 Turin Networks Method & apparatus for hardware fault management
DE102008019983B4 (de) 2008-04-21 2014-12-18 Maschinenbau Heinrich Hajek Gmbh & Co. Verfahren zum Betrieb einer Schneidemaschine mit Gehäuseüberdruck und Vorrichtung
CN103761173A (zh) * 2013-12-28 2014-04-30 华中科技大学 一种基于日志的计算机系统故障诊断方法及装置
US10044556B2 (en) * 2015-06-23 2018-08-07 International Business Machines Corporation Identifying performance-degrading hardware components in computer storage systems
CN105577440B (zh) * 2015-12-24 2019-06-11 华为技术有限公司 一种网络故障时间定位方法和分析设备
US10810103B2 (en) * 2016-12-14 2020-10-20 Vmware, Inc. Method and system for identifying event-message transactions
US11074121B2 (en) 2019-03-20 2021-07-27 International Business Machines Corporation Predicting failure of a magnetic tape head element
CN117591813B (zh) * 2024-01-18 2024-04-19 广东工业大学 基于多维特征的复杂装备故障诊断方法及系统

Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS56137455A (en) * 1980-03-31 1981-10-27 Fujitsu Ltd Maintenance system against failure
JPS6359638A (ja) * 1986-08-25 1988-03-15 Mitsubishi Electric Corp エラ−ログ方式
JPH01118934A (ja) * 1987-10-31 1989-05-11 Nec Corp エラー情報の解析・編集出力方式

Family Cites Families (25)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US3704363A (en) * 1971-06-09 1972-11-28 Ibm Statistical and environmental data logging system for data processing storage subsystem
US3815097A (en) * 1972-08-20 1974-06-04 Memorex Corp Disc drive diagnostic display apparatus
US3928830A (en) * 1974-09-19 1975-12-23 Ibm Diagnostic system for field replaceable units
DE2654389C3 (de) * 1976-12-01 1980-07-31 Ibm Deutschland Gmbh, 7000 Stuttgart Wartungssteuerung mit Prozessor und Speicher zur Fehleranalyse und -diagnose für elektronische Datenverarbeitungsanlagen und Verfahren zu deren Betrieb
JPS5431212A (en) * 1977-08-15 1979-03-08 Nec Corp Monitor circuit for digital signal transmission line
US4242751A (en) * 1978-08-28 1980-12-30 Genrad, Inc. Automatic fault-probing method and apparatus for checking electrical circuits and the like
JPS594054B2 (ja) * 1979-04-17 1984-01-27 株式会社日立製作所 マルチプロセツサ障害検出方式
US4339657A (en) * 1980-02-06 1982-07-13 International Business Machines Corporation Error logging for automatic apparatus
JPS57109061A (en) * 1980-12-26 1982-07-07 Mitsubishi Electric Corp Forecasting method for equipment deterioration of computer system
US4554661A (en) * 1983-10-31 1985-11-19 Burroughs Corporation Generalized fault reporting system
IL74952A0 (en) * 1984-05-04 1985-08-30 Gould Inc Method and system for improving the operational reliability of electronic systems formed of subsystems which perform different functions
US4633467A (en) * 1984-07-26 1986-12-30 At&T Bell Laboratories Computer system fault recovery based on historical analysis
US4644479A (en) * 1984-07-31 1987-02-17 Westinghouse Electric Corp. Diagnostic apparatus
US4754409A (en) * 1985-06-26 1988-06-28 International Business Machines Corporation Method for dynamically collecting current data from specified external processes and procedures for use in an expert system
US4713810A (en) * 1985-09-19 1987-12-15 Gte Sprint Communications Corp. Diagnostic technique for determining fault locations within a digital transmission system
US4710924A (en) * 1985-09-19 1987-12-01 Gte Sprint Communications Corp. Local and remote bit error rate monitoring for early warning of fault location of digital transmission system
WO1987006371A1 (en) * 1986-04-10 1987-10-22 Hewlett Packard Limited Expert system using pattern recognition techniques
US4841456A (en) * 1986-09-09 1989-06-20 The Boeing Company Test system and method using artificial intelligence control
US4769761A (en) * 1986-10-09 1988-09-06 International Business Machines Corporation Apparatus and method for isolating and predicting errors in a local area network
US4847795A (en) * 1987-08-24 1989-07-11 Hughes Aircraft Company System for diagnosing defects in electronic assemblies
US4817092A (en) * 1987-10-05 1989-03-28 International Business Machines Threshold alarms for processing errors in a multiplex communications system
US4866712A (en) * 1988-02-19 1989-09-12 Bell Communications Research, Inc. Methods and apparatus for fault recovery
US5090014A (en) * 1988-03-30 1992-02-18 Digital Equipment Corporation Identifying likely failure points in a digital data processing system
US4932028A (en) * 1988-06-21 1990-06-05 Unisys Corporation Error log system for self-testing in very large scale integrated circuit (VLSI) units
US4922491A (en) * 1988-08-31 1990-05-01 International Business Machines Corporation Input/output device service alert function

Patent Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPS56137455A (en) * 1980-03-31 1981-10-27 Fujitsu Ltd Maintenance system against failure
JPS6359638A (ja) * 1986-08-25 1988-03-15 Mitsubishi Electric Corp エラ−ログ方式
JPH01118934A (ja) * 1987-10-31 1989-05-11 Nec Corp エラー情報の解析・編集出力方式

Also Published As

Publication number Publication date
EP0335507A2 (en) 1989-10-04
EP0335507A3 (en) 1991-06-12
JPH0758474B2 (ja) 1995-06-21
US5469463A (en) 1995-11-21
AU602808B2 (en) 1990-10-25
CA1318030C (en) 1993-05-18
AU3088889A (en) 1989-10-05
DE68924923T2 (de) 1996-07-25
EP0335507B1 (en) 1995-11-29
DE68924923D1 (de) 1996-01-11

Similar Documents

Publication Publication Date Title
US5469463A (en) Expert system for identifying likely failure points in a digital data processing system
US5090014A (en) Identifying likely failure points in a digital data processing system
JP3273254B2 (ja) 二進コンピュータのための、高速で、高性能で、欠陥に対する許容性があり、エラー修正可能な記憶システム
US5088081A (en) Method and apparatus for improved disk access
US6742139B1 (en) Service processor reset/reload
JP2548480B2 (ja) アレイディスク装置のディスク装置診断方法
US6643734B2 (en) Control device and control method for a disk array
JPS6229827B2 (ja)
US6550019B1 (en) Method and apparatus for problem identification during initial program load in a multiprocessor system
JPH05307445A (ja) データ処理システムにおけるミラー化された一対のデータ記憶ユニットの状態を決定する方法及び装置
US7117320B2 (en) Maintaining data access during failure of a controller
CN100363907C (zh) 用于识别局部损坏存储器的自测试方法和装置
US6625728B1 (en) Method and apparatus for locating and displaying a defective component in a data processing system during a system startup using location and progress codes associated with the component
US5210867A (en) Method and apparatus for memory retry
US7624301B2 (en) Method and apparatus for identifying failure module
US7895493B2 (en) Bus failure management method and system
JP2773740B2 (ja) ディスク装置の診断システム
JPH10222999A (ja) 半導体試験方法及び装置
JPH11120154A (ja) コンピュータシステムにおけるアクセス制御装置および方法
JPH07306811A (ja) メモリ故障診断方法
JP3470698B2 (ja) カートリッジライブラリ装置及びそのセル検査方法
JP2878014B2 (ja) Ram試験方式
JP2584466B2 (ja) ディスクコントローラの自己診断方法
CN121050943A (zh) 车载终端人工智能训练的容错管理系统、方法以及设备
JPS62107343A (ja) コンピユ−タ・システムにおけるデ−タの完全性を確保するための方法

Legal Events

Date Code Title Description
R250 Receipt of annual fees

Free format text: JAPANESE INTERMEDIATE CODE: R250

R250 Receipt of annual fees

Free format text: JAPANESE INTERMEDIATE CODE: R250

R250 Receipt of annual fees

Free format text: JAPANESE INTERMEDIATE CODE: R250

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20080621

Year of fee payment: 13

FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20090621

Year of fee payment: 14

EXPY Cancellation because of completion of term
FPAY Renewal fee payment (event date is renewal date of database)

Free format text: PAYMENT UNTIL: 20090621

Year of fee payment: 14