KR20140133515A - 언어 독립적인 확률적 콘텐츠 매칭 기법 - Google Patents

언어 독립적인 확률적 콘텐츠 매칭 기법 Download PDF

Info

Publication number
KR20140133515A
KR20140133515A KR1020147022082A KR20147022082A KR20140133515A KR 20140133515 A KR20140133515 A KR 20140133515A KR 1020147022082 A KR1020147022082 A KR 1020147022082A KR 20147022082 A KR20147022082 A KR 20147022082A KR 20140133515 A KR20140133515 A KR 20140133515A
Authority
KR
South Korea
Prior art keywords
content
document
matching
pattern
segmented
Prior art date
Application number
KR1020147022082A
Other languages
English (en)
Other versions
KR102064623B1 (ko
Inventor
마우티크 간디
찰스 라마나
비디아라만 산카라나라야난
필호 라이문도 폰테스
Original Assignee
마이크로소프트 코포레이션
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by 마이크로소프트 코포레이션 filed Critical 마이크로소프트 코포레이션
Publication of KR20140133515A publication Critical patent/KR20140133515A/ko
Application granted granted Critical
Publication of KR102064623B1 publication Critical patent/KR102064623B1/ko

Links

Images

Classifications

    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/20Natural language analysis
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/20Natural language analysis
    • G06F40/279Recognition of textual entities
    • G06F40/284Lexical analysis, e.g. tokenisation or collocates
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F21/00Security arrangements for protecting computers, components thereof, programs or data against unauthorised activity
    • G06F21/60Protecting data
    • G06F21/62Protecting access to data via a platform, e.g. using keys or access control rules
    • G06F21/6218Protecting access to data via a platform, e.g. using keys or access control rules to a system of files or objects, e.g. local or distributed file system or database
    • G06F21/6245Protecting personal data, e.g. for financial or medical purposes
    • G06F21/6263Protecting personal data, e.g. for financial or medical purposes during internet communication, e.g. revealing personal data from cookies
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/10Text processing
    • G06F40/166Editing, e.g. inserting or deleting
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/20Natural language analysis
    • G06F40/279Recognition of textual entities
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04LTRANSMISSION OF DIGITAL INFORMATION, e.g. TELEGRAPHIC COMMUNICATION
    • H04L63/00Network architectures or network communication protocols for network security
    • H04L63/10Network architectures or network communication protocols for network security for controlling access to devices or network resources

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • General Health & Medical Sciences (AREA)
  • Health & Medical Sciences (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Physics & Mathematics (AREA)
  • Computational Linguistics (AREA)
  • Artificial Intelligence (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Bioethics (AREA)
  • Computer Security & Cryptography (AREA)
  • Computer Hardware Design (AREA)
  • Medical Informatics (AREA)
  • Databases & Information Systems (AREA)
  • Software Systems (AREA)
  • Signal Processing (AREA)
  • Computer Networks & Wireless Communication (AREA)
  • Computing Systems (AREA)
  • Information Transfer Between Computers (AREA)
  • Machine Translation (AREA)
  • Storage Device Security (AREA)

Abstract

콘텐츠가 수신되고 규칙에 대해 비교되어 콘텐츠의 유형을 식별한다. 규칙 각각은 분절 패턴과 비-분절 패턴 모두를 가진다. 상기 콘텐츠는 패턴에 대해 매칭되고 콘텐츠가 분절 패턴에 매칭되는 경우 높은 신뢰도 점수가 할당되고 상기 콘텐츠가 비-분절 패턴에 매칭되는 경우 이보다 낮은 신뢰도 점수가 할당된다.

Description

언어 독립적인 확률적 콘텐츠 매칭 기법{LANGUAGE INDEPENDENT PROBABILISTIC CONTENT MATCHING}
많은 언어, 가령, 영어는 텍스트 내 공백(white space)에 의해 분리되는 단어들을 가진다. 이들 유형의 언어에서는, 텍스트 내에서 단어가 식별될 것을 필요로 하는 기술이 어느 것이나 상당히 간단하다. 공백은 이웃하는 단어들 간 알려진 구분문자(delimiter)이다. 이들 유형의 언어는 공백 구분형 언어 또는 분절 언어(segmented language)라고 지칭된다.
그러나 그 밖의 다른 언어, 가령, 중국어, 일본어, 한국어 및 베트남어는, 예를 들어, 단순히 일정하게 띄어진 문자들의 시퀀스로서 기록된다. 이들 언어는 단어들 간 공백을 갖지 않으므로 단어들 간 분명한 구분을 갖지 않는다. 이들 유형의 언어는 비-분절 언어(non-segmented language)라고 지칭된다. 비-분절 언어에서 알려진 구분문자가 없기 때문에, 가령, 키워드의 정밀한 검출이 꽤 어렵다.
마찬가지로, 비-분절 언어에서, 정확히 동일한 문자가 주변 문맥을 기초로 서로 다른 것을 의미할 수 있다. 예를 들어, 이하의 텍스트,
Figure pct00001
는 이하의 표 1에서와 같이 해석되는 단어 분절을 가진다:
[표 1]
Figure pct00002
그러나 이하의 텍스트,
Figure pct00003
는 이하의 표 2에서 나타나는 바의 해석을 가진다:
[표 2]
Figure pct00004
표 2의 텍스트가 첫 번째 예시에서 "신용 카드"라고 번역된 것과 동일한 문자 시퀀스(강조됨)를 포함하지만 완전히 상이한 의미를 갖고 신용 카드와 관련이 없음을 알 수 있다.
덧붙여, 비-분절 언어의 경우, 줄 바꿈(line break)이 다양한 위치에서 발생할 수 있으며, 이는 문자 시퀀스 내에서 키워드를 식별하는 것을 훨씬 더 어렵게 만든다.
이는 여러 다른 분야에서 문제점일 수 있다. 예를 들어, 현재, 개인 정보의 유포를 통제하는 정책과 규정의 다양한 여러 다른 소스가 존재한다. 특정 유형의 정보를 다루는 기관이 이들 모든 규정을 따르도록 요구된다. 규정은 가령 정부로부터 온 외부 규정 또는 회사 내에서 특정 유형의 정보가 유포될 수 있는 방식을 통제하는 내부 규정일 수 있다.
종종, 이들 규정 및 정책의 대상이 되는 콘텐츠가 방대한 분량의 (내부 및 외부 모두의) 규정 또는 정책을 담고 있는 핸드북을 갖는 정보 노동자에 의해 다뤄지고, 상기 노동자는 이들 모두를 알고 준수하도록 기대된다. 이들 정책을 시행할 때, 일부 시스템은 정보 노동자에 의해 작업 중인 문서에서 민감한 정보를 식별하려 시도한다. 이렇게 할 때, 이들 시스템은 종종 특정 문서가 민감한지 여부를 결정하기 위해, 상기 문서 내에서 단어를 검사하려 시도한다. 예를 들어, 키워드, 가령, "신용 카드"는 민감한 콘텐츠의 지시로 여겨진다. 그러나 앞서 언급한 바와 같이, 비-분절 언어에서 이는 식별하기 매우 어렵다.
상기의 내용은 일반적인 배경 지식으로서 제공된 것에 불과하며, 청구되는 사항의 범위를 결정하는 데 보조하기 위한 것이 아니다.
개요
콘텐츠가 수신되고 규칙에 대해 비교되어 콘텐츠의 유형을 식별한다. 규칙 각각은 분절 패턴과 비-분절 패턴 모두를 가진다. 상기 콘텐츠는 패턴에 대해 매칭되고 콘텐츠가 분절 패턴에 매칭되는 경우 높은 신뢰도 점수가 할당되고 상기 콘텐츠가 비-분절 패턴에 매칭하는 경우 이보다 낮은 신뢰도 점수가 할당된다.
이하의 상세한 설명에서 추가로 기재될 개념들의 모음을 단순화된 형태로 소개하기 위해 이 개요가 제공된다. 이 개요는 청구되는 사항의 핵심 특징 및 필수 특징을 식별하려는 것이 아니고, 청구되는 사항의 범위를 결정하는 것을 돕기 위해 사용되는 것도 아니다. 청구되는 사항은 배경기술에서 언급된 임의의 또는 모든 단점들을 해결하는 구현예에 제한되지는 않는다.
도 1은 언어-독립적 콘텐츠 결정 시스템의 하나의 도시적 실시예의 블록도이다.
도 2는 도 1에 도시된 시스템의 동작을 도시하는 흐름도의 하나의 실시예이다.
도 3은 신뢰도 레벨이 할당되는 방식을 가리키는 더 상세한 블록도이다.
도 4는 콘텐츠 내 신용 카드 데이터를 식별하기 위해 사용될 수 있는 규칙을 정의하는 규칙 트리의 하나의 실시예이다.
도 4a 및 4b는 예시적 사용자 인터페이스이다.
도 5는 저작 시스템에서 언어-독립적 콘텐츠 결정 시스템의 또 다른 실시예를 보여주는 블록도이다.
도 6은 클라우드 기반 아키텍처에서 시스템의 하나의 실시예를 도시한다.
도 7-9는 예시적 모바일 장치이다.
도 10은 예시적 동작 환경의 하나의 실시예이다.
도 1은 콘텐츠 소스 시스템(102), 언어-독립적 콘텐츠 결정 시스템(104) 및 콘텐츠 처리 시스템(106)을 포함하는 콘텐츠 처리 환경(100)의 블록도이다. 도 1에 도시된 실시예에서, 시스템(104)은 소스 시스템(102)으로부터 콘텐츠(108)를 수신하고 콘텐츠(108)의 속성을 결정하고, 콘텐츠(108)의 속성을 나타내는 콘텐츠 결정(110)을 콘텐츠 처리 시스템(106)으로 제공한다. 콘텐츠 처리 시스템(106)은 콘텐츠 결정(110)에 의해 식별되는 바의 콘텐츠 속성을 기초로 하여 콘텐츠를 처리한다.
본 명세서에서, 콘텐츠(108)가 데이터 유포 정책의 대상이 될 수 있는 민감한 콘텐츠인지 여부를 결정할 때 언어-독립적 콘텐츠 결정 시스템(104)이 기재될 것이다. 예를 들어, 콘텐츠(108)가 전자 메일 메시지인 경우, (가령, 상기 콘텐츠가 지적 재산 콘텐츠를 포함하는 경우) 상기 콘텐츠가 회사 밖의 사람에게 전송될 수 있는지 여부를 통제하는 데이터 유포 정책이 존재할 수 있다. 덧붙여, 데이터 유포 정책은 콘텐츠가 개인 정보, 가령, 신용 카드 정보, 사회 보장 번호 등을 포함하는 경우 상기 콘텐츠의 유포를 통제할 수 있다. 그러나 덧붙여, 또한 콘텐츠가 비속어를 포함하는 경우 콘텐츠(108)의 유포를 통제하는 내부 데이터 유포 정책도 존재할 수 있다. 따라서 본 명세서는 시스템(104)과 관련하여 데이터 유포 정책이 적용될 수 있도록 콘텐츠(108)가 민감한지 여부를 결정하는 것으로 시작될 것이다.
그러나 단순히 시스템(104)은 콘텐츠(108)가 민감한지 여부를 결정하는 것으로 기재되기 때문에, 이는 시스템(104)이 사용될 수 있는 방식의 하나의 예시에 불과함을 알아야 한다. 시스템(104)은 콘텐츠(108)가 다른 속성을 갖는지 여부를 식별하기 위해서도 사용될 수 있다. 예를 들어, 시스템(104)은 전자 메일 메시지(콘텐츠(108))의 어조(tone)가 분노인지, 긍정적인지, 또는 부정적인지를 식별할 수 있다. 마찬가지로, 시스템(104)은 콘텐츠(108)가 다른 속성을 갖는지 여부를 결정하기 위해서도 사용될 수 있다. 어느 경우라도, 콘텐츠 처리 시스템(106)은 시스템(104)에 의해 결정된 콘텐츠의 속성을 기초로 하여 콘텐츠를 처리한다.
또한 콘텐츠 소스 시스템(102)과 콘텐츠 처리 시스템(106)은 동일한 시스템일 수 있음을 알아야 한다. 예를 들어, 콘텐츠 소스 시스템(102)은 전자 메일 메시지, 워드 프로세싱 문서, 스프레드시트 문서, 슬라이드 쇼 프리젠테이션 문서, 그리기 문서, 또는 또 다른 유형의 문서를 저작하기 위해 사용되는 저작 애플리케이션(authoring application)일 수 있다. 따라서 콘텐츠(108)는 전자 메일 메시지의 본문, 첨부물, 또는 콘텐츠 소스 시스템(102)에 의해 만들어질 수 있는 그 밖의 다른 임의의 유형의 문서일 수 있다. 콘텐츠 처리 시스템(106)도 콘텐츠 소스 시스템에 포함되어, 콘텐츠 소스 시스템(102)에서 사용자(101)에 의해 생성되는 콘텐츠가 동일한 시스템에 의해 자신에게 적용되는 데이터 유포 정책을 갖도록 할 수 있다.
예를 들어, 콘텐츠 소스 시스템(102)은 전자 메일 시스템이며 콘텐츠(108)를 포함하는 전자 메일 메시지를 생성하기 위해 사용자(101)는 시스템(102)과 상호대화하는 것을 가정한다. 상기 사용자(101)는 사용자 입력 수단, 가령, 키보드, 포인트 앤 클릭 장치(point 및 click device), 음성, 터치 제스처 또는 그 밖의 다른 수단을 이용해 상호대화할 수 있다. 어느 경우라도, 시스템(104)은 메일 메시지가 민감한 내용을 포함하는지 여부를 결정할 수 있으며, 포함하는 경우, 콘텐츠 처리 시스템(106)은 민감한 내용과 관련한 데이터 유포 정책을 구현하기 위해, (콘텐츠 소스 시스템(102)을 포함하는) 전자 메일 시스템으로 포함될 수 있다. 즉, (콘텐츠를 저작하기 위해 사용되는) 전자 메일 시스템은 콘텐츠를 기초로 하여, 또는 수신자를 기초로 하여, 또는 둘 모두를 기초로 하여 특정 전자 메일 메시지를 차단할 수 있다. 마찬가지로, 또 다른 데이터 유포 정책도 역시 사용될 수 있다.
어느 경우라도, 언어-독립적 콘텐츠 결정 시스템(104)이 콘텐츠 결정 구성요소(112) 및 콘텐츠 결정 규칙(117 및 119)의 세트를 포함하는 규칙 저장소(rule store)(115)를 포함한다. 규칙(117, 119) 각각은 특정 유형의 민감한 정보를 식별하도록 사용된다. 예를 들어, 규칙(117)은 콘텐츠(108)에서 신용 카드 번호를 식별하고 규칙(119)은 사회 보장 번호를 식별하도록 사용될 수 있다. 이들은 예시에 불과하다. 예를 들어 각각의 규칙이 패턴을 특정한다. 콘텐츠(108)가 규칙대로 패턴에 매칭된다면, 상기 콘텐츠는 규칙에 대응하는 민감한 정보를 포함한다고 결정된다. 도 1에 도시된 실시예에서, 규칙 각각은 분절된 콘텐츠 결정 패턴(segmented content determination pattern)(114), 및 비-분절 콘텐츠 결정 패턴(unsegmented content determination pattern)(116)을 포함한다. 도 1은 규칙(117)이 비-분절된 콘텐츠 결정 패턴(118)의 또 다른 세트를 갖는 실시예를 도시한다. 상기 도시된 실시예에서, 패턴(114)은 분절 언어에 대해 작용하고 패턴(116 및 118)은 비-분절 언어에 대해 작용한다. 물론, 분절 및 비-분절 언어가 조합될 수도 있다. 예를 들어, 패턴(114)은 영어에 대해서만 작용하거나 모든 분절 언어에 대해서 작용할 수 있다. 마찬가지로, 패턴(116)은 일본어에 대해 작용하고 패턴(118)은 중국어에 대해 작용할 수 있으며, 또 다른 패턴의 세트가 또 다른 분절 언어에 대해 제공될 수 있다. 대안적으로, 비-분절 패턴(116)의 세트가 모든 비-분절 언어에 대해 작용하도록 제공되고 배열될 수 있다. 이는 이하에서 더 상세히 기재된다.
또한 예를 들어 시스템(104)은 프로세서(120)를 포함한다. 예를 들어 상기 프로세서(120)는 연관된 타이밍 및 메모리 회로(도시되지 않음)를 갖는 컴퓨터 프로세서이다. 예를 들어, 프로세서(120)는 시스템(104)의 기능적 구성요소이며, 이들 구성요소의 기능을 촉진시키기 위해 시스템(104)의 다른 구성요소에 의해 활성화된다.
물론, 환경(100)이 다양한 시스템 및 구성요소로 분할되는 것으로 보이지만, 이들 시스템 및 구성요소의 기능이 서로 조합되어 더 적은 시스템 또는 구성요소를 갖거나, 추가로 분할되어 추가 시스템 및 구성요소를 가질 수 있다. 도 1에 도시된 바는 단지 예시에 불과하다.
도 2는 도 1에 도시된 환경의 동작의 하나의 실시예를 도시하는 흐름도이다. 먼저 언어-독립적 콘텐츠 결정 시스템(104)이 분석될 콘텐츠(108)를 수신한다. 이는 도 2의 블록(130)으로 나타난다. 콘텐츠 결정 구성요소(112)가 다양한 규칙(117-119)을 액세스하여 콘텐츠(108)의 속성을 식별하는 정보를 검출할 수 있다. 이는 도 2의 블록(132)으로 나타난다.
예를 들어, 콘텐츠 결정 구성요소(112)는 신용 카드 정보가 콘텐츠(108) 내에 있는지 여부를 알아보기 위해 규칙(117-119)을 액세스할 수 있다. 예를 들어, 이는 "신용 카드(credit card)", "MasterCard", "Visa", 또는 "만료일(expiration date)"라는 단어와 매우 가까운 16자리 숫자를 찾음으로써 이뤄질 수 있다.
예를 들어, 콘텐츠(108)의 언어와 무관하여 콘텐츠 결정 구성요소(112)는 모든 규칙(117-119)을 검색하여, 규칙들 중 임의의 규칙이 콘텐츠(108)의 임의의 부분과 매칭하는지 여부를 결정할 수 있다. 따라서 시스템(104)은, 콘텐츠의 언어와 무관하게, 심지어 콘텐츠(108)가 둘 이상의 언어로 된 내용을 포함하는지 여부와도 무관하게, 콘텐츠(108)의 속성을 식별하도록 사용될 수 있음을 알 수 있다.
어떠한 경우라도, 그 후 콘텐츠 결정 구성요소(112)가 규칙(117-119) 중 임의의 규칙이 콘텐츠(108)와 매칭하는지 여부를 결정한다. 이는 도 2의 블록(134)으로 나타난다. 매칭하지 않는 경우, 상기 시스템(104)은 콘텐츠(108)의 속성을 민감한 것으로 식별할 수 없고 디폴트 콘텐츠 결정, 가령, 콘텐츠가 민감하지 않다는 결정을 출력한다. 이는 도 2의 블록(136)으로 나타난다.
그러나 블록(134)에서 콘텐츠 결정 구성요소(112)가 콘텐츠(108)와 매칭하는 규칙(117-119) 중 적어도 하나를 식별한 경우, 콘텐츠 결정 구성요소(112)가 콘텐츠(108)의 속성을 민감한 것으로 식별할 수 있다. 그 후 콘텐츠 결정 구성요소(112)가 신뢰 레벨을 상기 결정에 할당하며, 이는 도 2의 블록(138)으로 나타난다.
신뢰 레벨은 다양한 방식으로 설정될 수 있다. 예를 들어, 하나의 실시예에서, 먼저, 규칙(117-119)에 의해 콘텐츠 결정 구성요소(112)가 콘텐츠(108)가 16자리 숫자를 포함하는지 여부를 결정할 수 있다. 콘텐츠가 16자리 숫자를 포함한다고 결정한 경우, 콘텐츠(108)가 상기 특정 규칙에 의해 정의된 패턴과 매칭한다. 그러나 규칙은 또한 콘텐츠 결정 구성요소(112)가 확증 증거, 가령, 날짜, "credit card(신용 카드)"라는 단어 등을 찾을 것이라고 정의할 수 있다. 매칭 규칙에서 식별 및 설정된 확증 증거를 기초로 하여, 콘텐츠 결정 구성요소(112)가 콘텐츠가 분절 또는 비-분절 패턴에 매칭하는지 여부를 기초로, 그리고 콘텐츠(108)가 민감한 내용을 담고 있다는 결정을 뒷받침하기 위해, 콘텐츠(108)에서 발견된 확증 데이터의 양을 기초로 하여 신뢰 레벨을 할당할 수 있다.
그 후 콘텐츠 결정 구성요소(112)는 신뢰 레벨과 함께 콘텐츠(108)의 속성을 콘텐츠 결정(110)으로서 출력한다. 이의 신뢰 레벨과 함께 콘텐츠의 속성을 출력하는 것은 도 2의 블록(140)으로 나타난다. 예를 들어, 콘텐츠 결정 구성요소(112)는 콘텐츠(108)가 민감한 내용을 담고 있다는 지시를 90%의 신뢰 레벨과 함께 출력할 수 있다. 물론 이는 예시에 불과하다.
콘텐츠 처리 시스템(106)은 콘텐츠 결정(110)을 수신하면, 콘텐츠(108)의 속성을 기초로 콘텐츠(108)를 처리한다. 이는 도 2의 블록(142)으로 나타난다. 콘텐츠 처리 시스템(106)은 콘텐츠가 민감한지 여부에 따라 서로 다른 규칙을 이용해 콘텐츠(108)를 처리할 수 있다.
예를 들어, 콘텐츠(108)는 전자 메일 메시지이며 메시지의 본문이 민감한 콘텐츠를 포함하거나, 메시지의 첨부물이 민감한 콘텐츠를 포함하는 경우, 콘텐츠 처리 시스템(106)은 단순히, 콘텐츠(108)가 민감한 물질을 담고 있음을 나타내고 (가령, 인가된 사람에게만 전송되어야 함을 가리킴으로써) 사용자(101)에게 어떻게 진행할지를 명령하는 메시지를 디스플레이할 수 있다. 대안적으로, 콘텐츠 처리 시스템(106)은 전자 메일 메시지가 민감한 내용을 포함하기 때문에 차단될 것임을 가리킬 수 있다. 물론, 콘텐츠 처리 시스템(106)은 콘텐츠(108)의 수신자도 분석하여 취할 조치, 가령, 전자 메일 메시지를 차단하기 또는 전송하기 등을 결정할 수 있다. 어떠한 경우라도, 콘텐츠 처리 시스템(106)은 시스템(104)에 의해 출력되는 콘텐츠(108)의 속성을 기초로 하여 콘텐츠(108)를 처리한다.
도 3은 콘텐츠 결정 구성요소(112)가 신뢰 레벨을 콘텐츠 결정(110)에 할당하는 법을 설명하는 더 상세한 블록도이다. 도 3에 도시된 실시예에서, 먼저 콘텐츠 결정 구성요소(112)가 특정 규칙에 매칭하는 패턴이 분절 언어에 대한 것인지 또는 비-분절 언어에 대한 것인지를 결정한다. 이는 도 3의 블록(150)으로 나타난다.
매칭되는 규칙이 분절 언어, 가령, 영어에 대한 것인 경우, 이는 할당된 신뢰 레벨에 영향을 미친다. 예를 들어, 분절 언어들은 (공백에 의해 분리된) 단어들을 명확하게 구분하기 때문에, 규칙의 일부로서 매칭되는 임의의 키워드가 비-분절 언어에서 매칭되는 경우 있을 수 있는 것보다 더 높은 신뢰도로 매칭될 수 있다. 앞서 기재된 바와 같이, 비-분절 언어에서 문자열이 정확하게 매칭되는 경우라도, 상기 문자열이 이의 맥락을 기초로 할 때 완전히 서로 다른 것을 의미할 수 있다. 따라서 구성요소(112)는 문자열이 규칙 및 콘텐츠(108) 내에서 동일한 것을 의미한다고 덜 확신한다.
따라서 그 후 콘텐츠 결정 구성요소(112)가 특정 규칙에 대해 매칭된 패턴을 뒷받침한다고 발견된 확증의 레벨을 결정한다. 이는 블록(152)으로 나타난다. 그 후 구성요소(112)가 매칭된 패턴 및 식별된 확증을 기초로 신뢰도 점수를 할당한다. 이는 블록(154)으로 나타난다.
특정 예를 들면, 매칭된 분절 언어에 대한 규칙이 신용 카드 정보를 찾고 있다고 가정한다. 하나의 실시예에서, 규칙은 콘텐츠(108)가 콘텐츠(108)가 16자리 숫자를 포함해야 한다고 특정하는 메인 패턴과 우선 매칭할 것을 요구한다. 콘텐츠(108)가 16자리 숫자를 포함한다고 추가로 가정한다. 따라서 분절 언어에서의 규칙에 의해 요구되는 패턴이 매칭되었다. 확증 증거를 찾기 위해, 규칙은 16자리 숫자에 추가로 콘텐츠(108)에 역시 존재할 수 있는 특정 키워드를 포함하는 확증 패턴 부분을 포함한다고 가정한다. 이러한 키워드는 "신용 카드", "만료일" 등을 포함할 수 있다. 그 후 콘텐츠 결정 구성요소(112)는 콘텐츠(108)에서 확증 데이터 중 어느 부분이라도 매칭되는지 여부를 결정한다. 매칭된 패턴이 분절 언어에 대응하기 때문에, 콘텐츠 결정 구성요소(112)는 확증 데이터 내 단어가 패턴과 콘텐츠(108) 둘 모두 내에서 동일한 것을 의미한다고 매우 확신할 수 있다. 즉, 규칙에서의 키워드들 중 하나가 "신용 카드"이고 콘텐츠 결정 구성요소(112)가 콘텐츠(108)에서 단어 "신용 카드"를 찾는 경우, 콘텐츠 결정 구성요소(112)는 이전에 매칭된 16자리 숫자가, 사실은 신용 카드 번호라고 매우 확신할 수 있다. 또한 콘텐츠 결정 구성요소(112)가 콘텐츠(108)에서 "만료일"이라는 단어를 찾은 경우, 신뢰 레벨은 훨씬 더 높아진다. 규칙에서의 매칭된 메인 패턴 및 이에 대응하는 확증 패턴을 기초로, 신뢰 레벨이 할당된다.
대안적으로, 블록(150)에서 매칭 규칙에 대한 패턴이 비-분절 언어에 대응한다고 결정된 경우, 콘텐츠 결정 구성요소(112)가 매칭된 패턴을 뒷받침하기 위한 확증 데이터를 다시 찾는다. 이는 도 3의 블록(156)으로 나타난다. 그러나 분절 언어와 달리, 콘텐츠 결정 구성요소(112)가 키워드를 확증 데이터로서 매칭하는 경우라도, 비-분절 언어에서는 키워드가 콘텐츠(108)에서와 규칙에서 동일한 것을 의미하는 것이 확신될 수 없다. 따라서 콘텐츠(108)에서 확증 데이터를 찾는 것이 비-분절 언어의 경우라도 신뢰 레벨을 높이더라도, 분절 언어의 경우에서만큼 높게 신뢰 레벨을 증가시키지 않을 수 있다.
구체적 예를 들면, 비-분절 언어에 대한 패턴이 콘텐츠(108)가 16자리 숫자를 포함할 것도 필요로 한다고 가정한다. 또한 콘텐츠(108)가 16자리 숫자를 포함한다고 더 가정한다. 그 후, 패턴이 콘텐츠 결정 구성요소(112)에게 해석할 때 영어 단어 "신용 카드"에 대응하는 콘텐츠(108) 내 문자열을 찾을 것을 요청한다고 가정한다. 콘텐츠 결정 구성요소(112)가 콘텐츠(108) 내에서 상기 문자열을 찾은 경우라도, 이는 문자열이 "신용 카드"의 의미를 가짐을 의미하진 않는다. 실제로, 콘텐츠(108)의 맥락에서 신용 카드와 아무런 관련이 없는 완전히 다른 의미를 가질 수 있다. 이는 앞서 배경 기술 섹션에서 언급된 바 있다. 따라서 콘텐츠 결정 구성요소(112)가 이의 결정의 신뢰 레벨을 높이지만, 분절 언어의 경우에서만큼 많이 증가시키지는 않을 수 있다. 그러나 어느 경우라도, 규칙에서 매칭되는 패턴 및 식별된 확증 데이터를 기초로 하여 신뢰도 점수가 할당된다. 이는 도 3의 블록(158)으로 나타난다.
도 4는 콘텐츠, 가령, 콘텐츠(108)의 본문 내에서 신용 카드 데이터를 검출하기 위한 규칙을 정의하기 위해 사용되는 계층적 트리 구조(170)를 보여준다. 구조(170)는 규칙이 신용 카드 데이터를 검출하기 위해 사용됨을 가리키는 헤드 노드(1720)를 포함한다. 이름 노드(174)가 특정 규칙을 명명하고(이 경우, "시용 카드"라고 명명됨) 기술 노드(176)가 상기 규칙이 하는 일을 기술한다. 이 경우, 규칙이 신용 카드 정보를 포함하는 콘텐츠를 식별하려 시도한다고 기술하는 텍스트 기술을 포함하고 신용 카드 정보가 검출될 때 이 정보를 보호하는 방식을 또한 기술할 수 있다.
그 후 구조(170)는 3개의 패턴 노드(178, 180 및 182)를 포함한다. 패턴 노드(178)는 분절 언어에서 신용 카드 데이터를 식별하기 위해 사용될 수 있는 패턴과 확증 데이터의 세트를 정의한다. 노드(178)는 패턴을 추가로 정의하는 자식 노드(184, 186 및 188)의 세트를 포함한다. 노드(184)는 매칭될 규칙에 대하여, 16자리 숫자의 형태로 된 정규 표현(regular expression)이 콘텐츠에서 발견될 것임을 보여준다. 정규 표현이 발견된 경우, 확증 노드(188)가 16자리 숫자가 신용 카드 번호라는 결정을 확증하기 위해 사용될 수 있는 선택적 매칭을 식별한다. 하나의 실시예에서, 노드(188)는 신용 카드와 관련되고 노드(178)에 의해 표현되는 하나 이상의 분절 언어(가령, 영어)로 시작하는 키워드의 리스트를 포함한다. 다시, 예를 들어, 키워드는 "신용 카드", "Visa", "Master Card", "만료일" 등을 포함할 수 있다. 신뢰도 노드(186)가 16자리 숫자가 식별되고 선택적 매칭들 중 적어도 하나가 식별된 콘텐츠와 연관되는 신뢰 레벨을 정의한다. 선택적 매칭들(즉 확증 매칭들) 중 둘 이상이 식별된 경우, 신뢰 레벨(186)은 증가하는 신뢰도를 식별하는 추가 신뢰 레벨을 특정할 수 있다. 따라서 노드(186)는 노드(178)에서 주어진 규칙 및 확증 데이터가 매칭된 때 이뤄진 민감 여부 결정에 어느 신뢰 레벨이 할당될 것인지를 콘텐츠 결정 구성요소(112)에게 특정해 준다.
또한 노드(180)는 복수의 자식 노드(190, 192 및 194)를 더 포함한다. 다시, 메인 매칭 노드(190)가 노드(182)에 대응하는 규칙에 대해 매칭될 패턴을 점화로 특정한다. 도 4에 도시된 실시예에서, 상기 패턴은 16자리 숫자를 포함하는 정규 표현이다.
선택적(즉, 확증) 매칭 노드(194)가 매칭된 패턴을 뒷받침한다는 신뢰 레벨에 도달하도록 매칭될 수 있는 확증 증거를 정의한다. 도 4에 도시된 실시예에서, 선택적 매칭(194)은 하나 이상의 비-분절 언어로 된 키워드의 리스트를 포함한다. 물론, 상기 리스트는 단순히, 분석 대상 콘텐츠 내 맥락에 따라 모호한 의미를 가질 수 있는 문자열의 리스트로 구성될 것이다. 따라서, 노드(180)에 대응하는 패턴은, 노드(190)에서의 정규 표현이 매칭되고, 노드(194)에서의 적어도 하나의 키워드가 매칭되는 경우라도, 노드(186)에서 분절 언어 패턴에 대해 90%였던 것에 비해, 신뢰도 노드(192)에서 식별된 신뢰 레벨이 70%에 불과함을 나타낸다. 따라서, 분절 언어와 비-분절 언어에서 동일한 유형의 매칭이 발생했을지라도, 확증 증거가 덜 확실하기 때문에 비-분절 언어에 대응하는 신뢰 레벨이 더 낮다.
또한 노드(182)는 복수의 자식 노드(196, 198 및 200)를 포함한다. 노드(182)에 대응하는 패턴에 의해 정의되는 파라미터가 노드(180)에 대해 나타나는 것과 유사하다. 따라서 규칙이 점화되도록 콘텐츠(108)에서 매칭될 정규 표현을 16자리 숫자로 정의하는 메인 매칭 노드(196)가 존재한다. 그러나 선택적 매칭 노드(200)는 콘텐츠(108) 내에서 찾을 수 있는 2개의 서로 다른 유형의 정보를 포함한다. 첫 번째는 노드(194)에서 나타난 것과 유사하다. 즉, 하나 이상의 비-분절 언어에서의 키워드의 세트가 리스트로 만들어진다. 이들 키워드 중 임의의 것이 콘텐츠(108)에서 찾아지면, 확증 데이터로서 기능한다. 그러나 또한 선택적 매칭 노드(200)는 확증 증거가 날짜를 포함할 수 있다고 서술한다. 예를 들어, 신용 카드 정보에 대해 말할 때 만료일을 포함시키는 것이 매우 흔하다. 따라서, 콘텐츠 내에서 16자리 숫자가 찾아지고, 콘텐츠(108) 내에서 특정 비-분절 키워드가 찾아지며, 상기 콘텐츠 내에서 날짜가 찾아지면, 정보가 신용 카드 정보라는 신뢰도가 증가될 수 있다. 따라서 비-분절 언어의 경우일지라도, 노드(198)에 의해 표현되는 신뢰 레벨이 80%이다. 이는 키워드 매칭이 덜 확실한 경우라도 날짜 매칭에 의해 추가로 확증되기 때문이다.
(도 4의 노드(180 및 182)에 대응하는) 비-분절 언어에 대응하는 두 패턴 모두, 시스템(104)에 의해 어드레싱되는 모두 비-분절 언어로 된 키워드의 리스트를 포함할 수 있다. 즉, 선택적 매칭 노드(194 및 200)에서의 키워드의 세트가 중국어, 일본어, 한국어, 베트남어 등으로부터의 문자열을 포함할 수 있다. 따라서 콘텐츠(108)에서 어느 비-분절 언어가 사용되는지와 관계 없이, 두 패턴(180 및 182) 모두에서 매칭이 이뤄질 수 있다. 마찬가지로, 패턴(178)에 대응하는 분절 언어에서의 선택적 매칭 노드(188)는 시스템이 작용하려 의도한 실질적으로 모든 분절 언어로부터의 단어를 포함할 수 있다. 따라서 노드(188)는 영어, 불어, 독일어, 스페인어 등으로 된 키워드의 리스트를 포함할 수 있다. 따라서 노드(178)는 모든 분절 언어에 작용할 수 있다.
또한 도 4에 제공된 구조(170)는 신용 카드를 식별하기 위해 모든 원하는 언어에 작용하도록 사용될 수 있는 패턴을 갖는 단 하나의 규칙만 보여줌을 알 것이다. 이는 사용될 수 있는 구조의 하나의 유형에 불과하며, 단지 하나의 예시적 규칙을 보여줄 뿐이다. 덧붙여, 개시된 메인 매칭, 선택적 매칭, 및 신뢰 레벨이 예시에 불과하다. 상이한 또는 추가적인 것이 역시 사용될 수 있다.
도 4a 및 4b는 이해를 향상시키기 위해 사용될 수 있는 2개의 특정 사용자 인터페이스 예시를 보여준다. 도 4a는 사용자(101)가 전자 메일 메시지를 콘텐츠(108)로서 생성하는 중인 사용자 인터페이스 디스플레이(300)를 보여준다. 예를 들어, 디스플레이(300)에서의 전자 메일 메시지가 수신자 부분(302), 제목 부분(304), 및 첨부물 부분(306), 전송 버튼(308), 메시지 본문 부분(310), 및 사용자 교육 부분(312)을 가진다. 도 4a에서 나타난 실시예에서, 사용자(101)는 본문 부분(310)에서 짧은 전자 메일 메시지를 생성했고 첨부물 부분(306) 내에 문서를 첨부했다. 전자 메일 메시지에 대한 두 명의 수신자, John Doe 및 Jason Smith가 존재한다.
사용자가 (콘텐츠(108)에 대응하는) 전자 메일 메시지를 생성하는 중일 때, 콘텐츠 결정 구성요소(112)는 콘텐츠(108)를 분석하여 민감한 내용을 담고 있는지 여부를 결정할 수 있다. 스프레드시트 첨부물이 부분(306)에서 첨부될 때, 콘텐츠 결정 구성요소(112)는 상기 첨부물도 분석한다.
도 4a에 도시된 실시예에서, 구성요소(112)는 첨부물 부분(306)을 분석하고 민감한 레코드를 포함함을 발견했다. 따라서 콘텐츠 처리 시스템(106)은 사용자 인터페이스 디스플레이(300) 상에서 부분(312)에서 통지(314)를 생성한다. 통지(314)는 아이콘(316), 제목(318), 기술(description)(320) 및 경고 또는 지시사항(322)을 포함한다. 아이콘(316)은 부분(312)에서 디스플레이되는 준수 노트 또는 팁과 연관될 수 있다. 예를 들어 무언가의 그래픽 이미지를 포함하고 상기 이미지가 부분(312)에서 언급되는 특정 데이터 유포 정책에 따라 달라질 수 있다. 물론, 아이콘(316)은 정적 아이콘일 수도 있다.
제목 노트 부분(318)은 단순히 데이터 유포 정책이 저작되는 전자 메일 메시지 또는 첨부물에 적용될 것임을 가리키는 제목이다. 이 실시예에서, 기술 부분(320)이 "이 전자메일은 민감한 기록을 담고 있다"라고 서술한다. 따라서 기술 부분(320)은 데이터 유포 정책이 이 전자 메일 메시지로 적용될 이유를 기술한다. 경고 또는 지시사항 부분(322)은 "인가받은 수신자에게 전송되게 하라"라고 서술한다. 이 부분은 구현되는 특정 데이터 유포 정책에 어떻게 따르는지를 사용자에게 지시(instruct)한다. 따라서 디스플레이(300) 내 부분(312)에서 부분(318)이 사용자에게 데이터 유포 정책이 구현되는 중임을 통지함을 알 수 있고, 기술 부분(320) 및 경고 또는 지시사항 부분(322)은 데이터 유포 정책이 시행되고 있는 이유와 상기 정책에 어떻게 따르는지에 대해 사용자(101)를 교육한다. 이는 문서가 저작되면서 상기 문서가 사용자(101)에게 디스플레이되는 동안 문서 자체(전자 메일 메시지 및 첨부물)의 맥락에서 모두 이뤄진다.
도 4a에 도시된 실시예에서, 첨부물(324)이 강조됨을 알 수 있다. 하나의 실시예에서, 전자 메일 메시지(콘텐츠(108))의 민감한 부분이 디스플레이(300) 상에서 이를 구별하게 하는 일종의 비주얼 큐(visual cue)에 의해 지시된다. 도 4a에 도시된 실시예에서, 첨부물(324)은 사용자 인터페이스 디스플레이(300)의 나머지 부분과 다른 색상, 가령, 황색으로 강조된다. 이는 첨부물(324)이 전자메일 중 기술 부분(320)에서 언급된 민감한 레코드를 포함하는 부분임을 가리킨다.
도 4b는 생성될 수 있는 또 다른 사용자 인터페이스 디스플레이(330)를 나타낸다. 사용자 인터페이스 디스플레이(330) 상의 복수의 아이템들이 도 4a에서 나타난 것과 유사하며 유사한 번호를 가진다. 그러나 여러 차이점이 언급될 수 있다. 도 4b에서 민감한 정보가 첨부물이 아니라 전자 메일 메시지의 본문(310)에 포함됨을 알 수 있다. 따라서 사용자(101)가 전자 메일 메시지의 본문(310)을 타이핑하는 동안, 콘텐츠 결정 구성요소(112)가 콘텐츠를 분석하고 본문(310)에서 신용 카드 번호를 식별한다. 물론, 이 실시예를 위해, 실제 숫자는 문자 x, y 및 z로 대체되었다. 전자 메일 메시지가 민감한 정보를 포함하기 때문에, 데이터 유포 정책이 상기 전자 메일에 적용된다. 도시된 실시예에서, 부분(312) 내 기술 부분(320)은 데이터 유포 정책이 이 전자 메일과 관련하여 왜 시행되는지뿐 아니라 콘텐츠 처리 시스템(106)에 의해 취해질 조치까지 기술한다. 준수 노트는 "이 전자 메일은 민감한 콘텐츠를 담고 있기 때문에 귀하의 기관에 의해 차단될 것이다"라고 서술한다. 이는 데이터 유포 정책이 왜 시행되는지(전자 메일이 민감한 콘텐츠를 담고 있기 때문)를 가리킬 뿐 아니라 상기 정책 때문에 시스템(106)이 상기 전자 메일을 어떻게 다룰 것인지(차단)에 대해 사용자를 교육하기도 한다.
도 5는 저작 시스템(authoring system)(402) 내에서 실행되는 저작 애플리케이션(authoring application)(400) 내에서 언어-독립적 콘텐츠 결정 시스템(104)이 전개되는 더 구체적인 실시예를 도시하는 블록도이다. 저작 시스템(402)은 사용자(101)가 사용자 장치(406)를 통해 저작 시스템(402)과 상호대화할 수 있도록 저작 애플리케이션을 실행시키도록 사용되는 프로세서(404)를 포함한다. 사용자 장치(406)는 임의의 유형의 사용자 장치, 가령, 데스크톱 컴퓨터, 랩톱 컴퓨터, 팜톱(palmtop) 또는 태블릿 컴퓨터, 모바일 장치, 스마트 폰, 개인 디지털 보조기, 멀티미디어 플레이어 등일 수 있다. 한 가지 구체적 예를 들면, 저작 시스템(402)은 사용자(101)가 애플리케이션(400)을 실행시켜 워드 프로세싱 문서(408)를 생성할 수 있게 하는 워드 프로세싱 저작 애플리케이션(400)을 실행하는 중이라고 가정한다. 도 5에 도시된 실시예에서, 언어-독립적 콘텐츠 결정 시스템(104)과 콘텐츠 처리 구성요소(106) 둘 모두 저작 애플리케이션(400) 내에 임베드(embed)된다. 따라서 사용자(101)가 문서(408)를 저작하는 동안, 시스템(104) 및 구성요소(106)는 문서(408)의 콘텐츠를 분석하여 이의 속성(가령, 민감한지 여부)을 결정하고 적절하게 (가령, 민감한 정보에 대해 데이터 유포 정책을 시행함으로써) 이를 처리한다. 도 5는 시스템(104) 및 구성요소(106)가 콘텐츠를 저작하도록 사용되는 애플리케이션 내에 임베드될 수 있음을 보여주기 위해서 제공된 것에 불과하다.
환경(100)은 다양한 아키텍처로 전개될 수 있음도 알아야 한다. 환경(100)의 여러 다른 부분이 사용자 장치(406) 상에, 또는 서버 상에 전개되거나 하나 이상의 클라이언트 및 하나 이상의 서버 간에 분할될 수 있다. 덧붙여, 환경(100)의 부분들이 클라우드-기반 아키텍처에서 전개되는 클라우드-기반 서비스일 수 있다.
예를 들어 클라우드 컴퓨팅 아키텍처가 인프라구조, 플랫폼 및 애플리케이션을 포함한다. 상기 클라우드 서비스는 그 밖의 다른 장치 또는 시스템, 가령, 클라우드 서버, 데스크톱 컴퓨터, 태블릿 컴퓨터, 랩톱 컴퓨터, 셀룰러 폰 또는 스마트 폰 또는 그 밖의 다른 모바일 장치 또는 개인 디지털 보조기로 연결된다. 클라우드 컴퓨팅은 제품보다는, 물리적 위치 또는 서비스를 전달하는 시스템의 구성에 대한 최종 사용자의 지식을 요하지 않는 계산, 소프트웨어, 데이터 액세스, 및 저장 서비스를 제공한다. 다양한 실시예에서, 클라우드 컴퓨팅은 적절한 프로토콜을 이용해 광역 네트워크, 가령, 인터넷을 통해 서비스를 전달한다. 예를 들어, 클라우드 컴퓨팅 제공자는 광역 네트워크를 통해 애플리케이션을 전달하며, 웹 브라우저 또는 임의의 그 밖의 다른 컴퓨팅 구성요소를 통해 액세스될 수 있다. 환경(100)의 소프트웨어 또는 구성요소 및 대응하는 데이터가 클라우드 내 원격지에 위치하는 서버 상에 저장될 수 있다. 클라우드 컴퓨팅 환경 내 컴퓨팅 자원이 원격 데이터 센터 위치에서 통합되거나 분산될 수 있다. 클라우드 컴퓨팅 인프라구조는 이들이 사용자를 위한 단일 액세스 포인트로서 나타날지라도, 공유 데이터 센터를 통해 서비스를 전달할 수 있다. 따라서, 클라우드 컴퓨팅 아키텍처를 이용해 본 명세서에 기재된 구성요소 및 기능이 원격지에 있는 서비스 제공자로부터 제공될 수 있다. 대안적으로, 이들은 종래의 서버로부터 제공되거나 클라이언트 장치 상에 직접 또는 그 밖의 다른 방식으로 설치될 수 있다.
도 6은 클라우드 컴퓨팅 환경에서 언어-독립적 콘텐츠 결정 시스템(104), 콘텐츠 처리 시스템(106) 및 콘텐츠 소스 시스템(102)을 보여준다. 이들 시스템 모두 클라우드(420)에서 나타난다. 사용자(101)는 사용자 장치(406)를 통해 제공되는 서비스로서 이들을 액세스한다.
도 7은 본 발명의 시스템(또는 이의 일부분)이 전개되는 사용자 장치(또는 클라이언트 장치)(406)로서 사용될 수 있거나 본 발명의 시스템을 액세스하기 위해 사용될 수 있는 핸드헬드 또는 모바일 컴퓨팅 장치의 하나의 대안적 실시예의 단순화된 블록도이다. 도 8 및 9는 핸드헬드 또는 모바일 장치의 예시이다.
도 7은 사용자 장치(406)일 수 있고 환경(100)의 구성요소를 운영할 수 있거나 환경(100)과 상호대화하는 클라이언트 장치(16)의 구성요소의 일반적인 블록도를 제공한다. 장치(16)에서, 핸드헬드 장치가 다른 컴퓨팅 장치와 통신할 수 있게 하고 일부 실시예에서 자동으로, 가령, 스캐닝에 의해 정보를 수신하기 위한 채널을 제공하는 통신 링크(13)가 제공된다. 통신 링크(13)의 예시로는 적외선 포트, 직렬/USB 포트, 케이블 네트워크 포트, 가령, 이더넷 포트, 및 셀룰러 액세스를 네트워크로 제공하도록 사용되는 무선 서비스인 하나 이상의 통신 프로토콜, 가령, GPRS(General Packet Radio Service), 1Xrtt, 및 단문 메시지 서비스, 및 로컬 무선 연결을 네트워크로 제공하는 802.11 및 802.11b(Wi-Fi) 프로토콜, 및 블루투쓰(Bluetooth) 프로토콜을 통한 통신을 가능하게 하는 무선 네트워크 포트를 포함한다.
그 밖의 다른 실시예에 따라, 애플리케이션 또는 시스템(가령, 환경(100))이 SD(Secure Digital) 카드 인터페이스(15)로 연결되는 이동식 SD 카드 상에서 수신된다. SD 카드 인터페이스(15) 및 통신 링크(13)는 메모리(21) 및 입/출력(I/O) 구성요소(23)와 클록(25) 및 측위 시스템(27)으로 더 연결된 버스(19)를 따라 프로세서(17)와 통신한다.
하나의 실시예에서, I/O 구성요소(23)는 입출력 연산을 촉진하도록 제공된다. 장치(16)의 다양한 실시예에 대한 I/O 구성요소(23)는 입력 구성요소, 가령, 버튼, 터치 센서, 터치 스크린, 근접도 센서, 마이크로폰, 틸트 센서 및 중력 스위치와, 출력 구성요소, 가령, 디스플레이 장치, 스피커 및/또는 프린터 포트를 포함할 수 있다. 그 밖의 다른 I/O 구성요소(23)가 역시 사용될 수 있다.
예를 들어 클록(25)은 시각과 날짜를 출력하는 실시간 클록 구성요소를 포함한다. 또한 예를 들어 프로세서(17)를 위한 타이밍 기능을 제공할 수 있다.
예를 들어, 측위 시스템(location system)(27)은 장치(16)의 현재 지리적 위치를 출력하는 구성요소를 포함한다. 예를 들어, 이는 GPS(global positioning system) 수신기, LORAN 시스템, 추측 항법 시스템(dead reckoning system), 셀룰러 삼각측량 시스템, 또는 그 밖의 다른 위치 결정 시스템을 포함할 수 있다. 또한 예를 들어, 이는 원하는 맵, 내비게이션 경로, 및 그 밖의 다른 지리적 기능을 생성하는 매핑 소프트웨어 또는 항법 소프트웨어를 포함할 수 있다.
메모리(21)는 운영 체제(29), 네트워크 설정(31), 애플리케이션(33), 애플리케이션 구성 설정(35), 데이터 저장소(37), 통신 드라이버(39) 및 통신 구성 설정(41)을 저장한다. 메모리(21)는 모든 타입의 유형(tangible) 휘발성 및 비휘발성 컴퓨터 판독형 메모리 장치를 포함할 수 있다. 또한 메모리는 컴퓨터 저장 매체를 더 포함할 수 있다(이하에서 기재됨). 메모리(21)는 프로세서(17)에 의해 실행될 때 프로세서로 하여금 명령에 따라 컴퓨터-구현 단계 또는 기능을 수행하도록 하는 컴퓨터 판독형 명령을 저장한다. 예를 들어, 시스템(100)의 일부분이 메모리(21) 내에 위치할 수 있다. 프로세서(17)는 그들 기능을 촉진하기 위해 다른 구성요소에 의해서도 활성화될 수 있다.
네트워크 설정(31)의 예시는 프록시 정보, 인터넷 연결 정보, 및 맵핑을 포함한다. 애플리케이션 구성 설정(35)은 특정 기업 또는 사용자에게 애플리케이션을 맞춤구성하는 설정을 포함한다. 통신 구성 설정(41)은 그 밖의 다른 컴퓨터와 통신하기 위한 파라미터를 제공하고 아이템, 가령, GPRS 파라미터, SMS 파라미터, 연결 사용자 이름 및 비밀번호를 제공한다.
애플리케이션(33)은 장치(16)에 이전에 저장된 애플리케이션 또는 사용 중에 설치된 애플리케이션일 수 있지만, 이들은 운영 체제(29)의 일부이거나 장치(16) 외부에서 호스팅될 수도 있다.
도 8 및 9는 사용될 수 있는 장치(16)의 예시를 제공하지만, 그 밖의 다른 것도 역시 사용될 수 있다. 도 8에서, 스마트 폰 또는 모바일 폰(45)이 장치(16)로서 제공된다. 폰(45)은 전화 번호를 다이얼링하기 위한 키패드(47), 이미지, 가령, 애플리케이션 이미지, 아이콘, 웹 페이지, 사진, 및 비디오를 디스플레이할 수 있는 디스플레이(49), 및 디스플레이 상에서 나타난 아이템을 선택하기 위한 제어 버튼(51)으로 구성된 세트를 포함한다. 상기 폰은 셀룰러 폰 신호, 가령, GPRS(General Packet Radio Service) 및 1Xrtt, 및 단문 메시지 서비스(는) 신호를 수신하기 위한 안테나(53)를 포함한다. 일부 실시예에서, 폰(45)은 SD 카드(57)를 수용하는 SD(Secure Digital) 카드 슬롯(55)을 더 포함한다.
도 9의 모바일 장치는 개인 디지털 보조기(PDA)(59) 또는 멀티미디어 재생기 또는 태블릿 컴퓨팅 장치 등(이하, PDA(59)로 지칭됨)이다. PDA(59)는 스타일러스(63)가 스크린 위에 놓일 때 상기 스타일러스(63)(또는 또 다른 포인터, 가령, 사용자의 손가락)의 위치를 감지하는 유도성 스크린(61)을 포함한다. 이는 사용자가 스크린 상의 아이템을 선택, 강조, 및 이동시킬 수 있게 할 뿐 아니라 그리고(draw) 쓸(write) 수 있게 한다. 또한 PDA(59)는 디스플레이(61)를 접촉하지 않고, 사용자가 디스플레이(61) 상에 디스플레이되는 메뉴 옵션 또는 그 밖의 다른 디스플레이 옵션을 통해 스크롤할 수 있게 하고 사용자가 애플리케이션을 변경하거나 사용자 입력 기능을 선택할 수 있게 하는 복수의 사용자 입력 키 또는 버튼(가령, 버튼(65))을 포함한다. 도시되지 않았지만, PDA(59)는 다른 컴퓨터와의 무선 통신을 가능하게 하는 내부 안테나 및 적외선 송신기/수신기와 다른 컴퓨팅 장치로의 하드웨어 연결을 가능하게 하는 연결 포트를 포함할 수 있다. 일반적으로 이러한 하드웨어 연결은 직렬 또는 USB 포트를 통해 다른 컴퓨터로 연결되는 크래들(cradle)을 통해 이뤄진다. 따라서 이들 연결은 비-네트워크 연결이다. 하나의 실시예에서, 모바일 장치(59)는 SD 카드(69)를 수용하는 SD 카드 슬롯(67)을 더 포함한다.
그 밖의 다른 형태의 장치(16)가 가능하다. 예를 들면, 태블릿 컴퓨팅 장치, 음악 또는 비디오 재생기, 및 그 밖의 다른 핸드헬드 컴퓨팅 장치가 있다.
도 10은 환경(100)(예를 들어)이 전개될 수 있는 컴퓨팅 환경(800)의 하나의 실시예이다. 도 10을 참조하면, 일부 실시예를 구현하기 위한 예시적 시스템은 컴퓨터(810)의 형태로 된 범용 컴퓨팅 장치를 포함한다. 컴퓨터(810)의 구성요소의 비-제한적 예를 들면, 처리 유닛(820), 시스템 메모리(830), 및 다양한 시스템 구성요소, 가령, 시스템 메모리를 상기 처리 유닛(820)으로 연결하는 시스템 버스(821)가 있다. 상기 시스템 버스(821)는 다양한 버스 아키텍처를 이용하는 몇 가지 유형의 버스 구조, 가령, 메모리 버스 또는 메모리 제어기, 주변기기 버스, 및 로컬 버스 중 임의의 것일 수 있다. 비-제한적 예를 들면, 이러한 아키텍처는 ISA(Industry Standard Architecture) 버스, MCA(Micro Channel Architecture) 버스, EISA(Enhanced ISA) 버스, VESA(Video Electronics Standards Association) 로컬 버스, 및 메자닌 버스(Mezzanine bus)라고도 알려진 PCI(Peripheral Component Interconnect) 버스를 포함한다. 도 1과 관련하여 기재된 메모리 및 프로그램이 도 10의 대응하는 부분에서 배치될 수 있다.
일반적으로 컴퓨터(810)는 다양한 컴퓨터 판독형 매체를 포함한다. 컴퓨터 판독형 매체는 컴퓨터(810)에 의해 액세스될 수 있는 임의의 이용 가능한 매체일 수 있고 휘발성 및 비휘발성 매체, 이동식 및 비-이동식 매체를 모두 포함한다. 비-제한적 예를 들면, 컴퓨터 판독형 매체는 컴퓨터 저장 매체 및 통신 매체를 포함할 수 있다. 컴퓨터 저장 매체는 변조된 데이터 신호 또는 반송파와 상이하며 이를 포함하지 않는다. 컴퓨터 저장 매체는 하드웨어 저장 매체, 가령, 정보, 가령 컴퓨터 판독형 명령, 데이터 구조, 프로그램 모듈 또는 그 밖의 다른 데이터를 저장하기 위한 임의의 방법 또는 기법으로 구현되는 휘발성 및 비휘발성, 이동식 및 비-이동식 매체를 모두 포함한다. 컴퓨터 저장 매체의 비-제한적 예를 들면, RAM, ROM, EEPROM, 플래시 메모리 또는 그 밖의 다른 메모리 기법, CD-ROM, DVD(digital versatile disk) 또는 그 밖의 다른 디스크 저장장치, 자기 카세트, 자기 테이프, 자기 디스크 저장장치 또는 그 밖의 다른 자기 저장 장치 또는 원하는 정보를 저장하기 위해 사용될 수 있고 컴퓨터(810)에 의해 액세스될 수 있는 그 밖의 다른 임의의 매체가 있다. 일반적으로 통신 매체는 컴퓨터 판독형 명령, 데이터 구조, 프로그램 모듈, 또는 그 밖의 다른 데이터를 전송 메커니즘으로 구현하고 임의의 정보 전달 매체를 포함한다. "변조된 데이터 신호"라는 용어는 신호 내 정보를 인코딩하기 위한 방식으로 설정 또는 변경된 하나 이상의 특성을 갖는 신호를 의미한다. 비-제한적 예를 들면, 통신 매체는 유선 매체, 가령, 유선 네트워크 또는 직접 배선 연결, 무선 매체, 가령, 음향, RF, 적외선 및 그 밖의 다른 무선 매체를 포함한다. 이들 중 임의의 것의 조합이 또한 컴퓨터 판독형 매체의 범위 내에 포함되어야 한다.
시스템 메모리(830)는 휘발성 및/또는 비휘발성 메모리의 형태로 된 컴퓨터 저장 매체, 가령, 리드 온리 메모리(ROM)(831) 및 랜덤 액세스 메모리(RAM)(832)를 포함한다. 가령, 시동(start-up) 동안 컴퓨터(810) 내 요소들 간 정보를 전달하는 것을 돕는 기본 루틴을 포함하는 기본 입/출력 시스템(833)(BIOS)이 ROM(831)에 저장되는 것이 일반적이다. 일반적으로 RAM(832)은 처리 유닛(820)에 의해 즉시 액세스 가능하거나 및/또는 현재 동작되는 데이터 및/또는 프로그램 모듈을 포함한다. 도 10은 비-제한적 예를 들어 운영 체제(834), 애플리케이션 프로그램(835), 그 밖의 다른 프로그램 모듈(836) 및 프로그램 데이터(837)를 도시한다.
상기 컴퓨터(810)는 그 밖의 다른 이동식/비-이동식 휘발성/비휘발성 컴퓨터 저장 매체를 더 포함할 수 있다. 도 10은 비-제한적 예를 들어, 비이동식, 비휘발성 자기 매체로부터 읽거나 쓰는 하드 디스크 드라이브(841), 이동식, 비휘발성 자기 디스크(852)로부터 읽거나 쓰는 자기 디스크 드라이브(851), 및 이동식, 비휘발성 광학 디스크(856), 가령, CD ROM 또는 그 밖의 다른 광학 매체로부터 읽거나 쓰는 광학 디스크 드라이브(855)를 도시한다. 예시적 동작 환경에서 사용될 수 있는 그 밖의 다른 이동식/비-이동식, 휘발성/비휘발성 컴퓨터 저장 매체의 비-제한적 예를 들면, 자기 테이프 카세트, 플래시 메모리 카드, 디지털 다목적 디스크, 디지털 비디오 테이프, 솔리드 스테이트 RAM, 솔리드 스테이트 ROM 등이 있다. 하드 디스크 드라이브(841)는 일반적으로 비이동식 메모리 인터페이스, 가령, 인터페이스(840)를 통해 시스템 버스(821)로 연결되고, 및 자기 디스크 드라이브(851) 및 광학 디스크 드라이브(855)는 이동식 메모리 인터페이스, 가령, 인터페이스(850)에 의해 시스템 버스(821)로 연결되는 것이 일반적이다.
앞서 언급되고 도 10에 도시된 드라이브 및 이들의 연관된 컴퓨터 저장 매체는 컴퓨터 판독형 명령, 데이터 구조, 프로그램 모듈 및 그 밖의 다른 컴퓨터(810)를 위한 데이터의 저장을 제공한다. 도 10에서, 예를 들어, 하드 디스크르 드라이브(841)가 운영 체제(844), 애플리케이션 프로그램(845), 그 밖의 다른 프로그램 모듈(846) 및 프로그램 데이터(847)를 저장하는 것으로 도시된다. 이들 구성요소는 운영 체제(834), 애플리케이션 프로그램(835), 그 밖의 다른 프로그램 모듈(836), 및 프로그램 데이터(837)와 동일하거나 상이할 수 있다. 운영 체제(844), 애플리케이션 프로그램(845), 그 밖의 다른 프로그램 모듈(846), 및 프로그램 데이터(847)가 최소한 서로 다른 카피임을 나타내기 위해 본 명세서에서 서로 다른 번호가 부여된다.
사용자는 입력 장치, 가령, 키보드(862), 마이크로폰(863), 및 포인팅 장치(861), 가령, 마우스, 트랙볼 또는 터치 패드를 통해 컴퓨터(810)로 명령어 및 정보를 입력할 수 있다. 그 밖의 다른 입력 장치(도시되지 않음)가 조이스틱, 게임 패드, 위성 접시, 스캐너 등을 포함할 수 있다. 이들 및 그 밖의 다른 입력 장치가 종종 시스템 버스로 연결된 사용자 입력 인터페이스(860)를 통해 처리 유닛(820)으로 연결되지만, 그 밖의 다른 인터페이스 및 버스 구조, 가령, 병렬 포트, 게임 포트 또는 전역 직렬 버스(USB)에 의해 연결될 수 있다. 모니터(891) 또는 그 밖의 다른 유형의 디스플레이 장치가 또한 인터페이스, 가령, 비디오 인터페이스(890)를 통해 시스템 버스(821)로 연결된다. 모니터에 추가로, 컴퓨터가 그 밖의 다른 주변 출력 장치, 가령, 스피커(897) 및 프린터(896)를 더 포함하며, 이들은 출력 주변장치 인터페이스(895)를 통해 연결될 수 있다.
컴퓨터(810)는 하나 이상의 원격 컴퓨터, 가령, 원격 컴퓨터(880)로의 논리적 연결을 이용하는 네트워크 연결된 환경에서 동작한다. 상기 원격 컴퓨터(880)는 개인 컴퓨터, 핸드-헬드 장치, 서버, 라우터, 네트워크 PC, 피어 장치 또는 그 밖의 다른 일반적인 네트워크 노드일 수 있으며, 일반적으로 앞서 컴퓨터(810)와 관련하여 기재된 요소들 중 다수 또는 모두를 포함한다. 도 10에 기재된 논리적 연결은 로컬 영역 네트워크(LAN)(871) 및 광역 네트워크(WAN)(873)를 포함하지만, 그 밖의 다른 네트워크를 더 포함할 수 있다. 이러한 네트워킹 연결은 사무실, 기업별 컴퓨터 네트워크, 인트라넷 및 인터넷에서 일반적이다.
LAN 네트워킹 환경에서 사용될 때, 상기 컴퓨터(810)는 네트워크 인터페이스 또는 어댑터(870)를 통해 LAN(871)으로 연결된다. WAN 네트워킹 환경에서 사용될 때, 일반적으로 상기 컴퓨터(810)는 WAN(873), 가령, 인터넷을 통한 통신을 확립하기 위한 모뎀(872) 또는 그 밖의 다른 수단을 포함한다. 상기 모뎀(872)은 내부형 또는 외부형일 수 있으며, 사용자 입력 인터페이스(860) 또는 또 다른 적절한 메커니즘을 통해 시스템 버스(821)로 연결될 수 있다. 네트워크 연결된 환경에서, 컴퓨터(810)와 관련하여 도시된 프로그램 모듈 또는 이의 일부분이 원격 메모리 저장 장치에 저장될 수 있다. 비-제한적 예를 들면, 도 10은 원격 컴퓨터(880) 상에 위치하는 원격 애플리케이션 프로그램(885)을 도시한다. 도시된 네트워크 연결은 예시에 불과하고 컴퓨터들 간 통신 링크를 확립하는 그 밖의 다른 수단이 사용될 수 있다.
본 발명이 구조적 특징부 및/또는 방법적 동작들에 특정된 언어로 기재되었더라도, 이하의 특허청구범위에서 정의된 사항들은 앞서 기재된 특정 특징부 또는 동작에 반드시 제한되는 것은 아님을 이해해야 한다. 오히려 앞서 기재된 특정 특징부 및 동작들이 청구항을 구현하는 예시적 형태로서 개시된 것이다.

Claims (10)

  1. 컴퓨터로 구현되는, 문서의 콘텐츠를 처리하는 방법으로서,
    콘텐츠를 제 1 유형의 콘텐츠로 식별하기 위해 사용되는 패턴을 정의하는 규칙들의 세트를 액세스하는 단계 - 각각의 규칙은 분절 언어(segmented language)로 기록된 텍스트 콘텐츠 및 비-분절 언어(un-segmented language)로 기록된 텍스트 콘텐츠에 각각 매칭될 수 있는 분절 패턴 및 비-분절 패턴을 가짐 - ,
    상기 문서의 콘텐츠가 상기 제 1 유형의 콘텐츠인지 여부를 결정하기 위해, 상기 문서의 콘텐츠가 분절 언어로 기록된 것인지 또는 비-분절 언어로 기록된 것인지에 무관하게, 문서의 콘텐츠를 각각의 규칙의 패턴에 대해 매칭시키는 단계,
    상기 문서의 콘텐츠가 분절 패턴에 일치하는지 또는 비-분절 패턴에 일치하는지를 기초로 하여, 상기 문서의 콘텐츠가 상기 제 1 유형의 콘텐츠인지 여부에 대한 결정에 대응하는 신뢰도 점수를 생성하는 단계, 및
    상기 문서의 콘텐츠가 제 1 유형의 콘텐츠인지 여부에 대한 결정 및 대응하는 신뢰도 점수를 기초로 하여 상기 문서 내 콘텐츠를 처리하는 단계를 포함하는
    문서 콘텐츠 처리 방법.
  2. 제1항에 있어서,
    상기 신뢰도 점수를 생성하는 단계는
    상기 문서의 콘텐츠가 분절 패턴에 매칭된 경우 보다 높은 신뢰도 점수를 생성하고, 상기 문서의 콘텐츠가 비-분절 패턴에 매칭된 경우 보다 낮은 신뢰도 점수를 생성하는 단계를 포함하는
    문서 콘텐츠 처리 방법.
  3. 제1항에 있어서,
    상기 문서의 콘텐츠를 처리하는 단계는
    상기 문서 내 콘텐츠가 충분히 대응하는 신뢰도 점수를 갖는 제 1 유형의 콘텐츠인 경우, 처리 규칙의 제 1 세트에 따라서 상기 문서 내 콘텐츠를 처리하는 단계, 및
    상기 문서 내 콘텐츠가 충분히 대응하는 신뢰도 점수를 갖는 제 1 유형의 콘텐츠가 아닌 경우, 처리 규칙의 제 2 세트에 따라 상기 문서의 콘텐츠를 처리하는 단계를 포함하는
    문서 콘텐츠 처리 방법.
  4. 제1항에 있어서,
    상기 매칭시키는 단계는
    상기 규칙 각각에서의 비-분절 패턴과 분절 패턴 모두에 대해 상기 문서의 콘텐츠를 매칭시키는 단계를 포함하고,
    상기 패턴 각각은 메인 매칭 패턴(main match pattern) 및 확증 매칭 부분(corroborating match portion)을 포함하고, 상기 매칭시키는 단계는
    상기 문서의 콘텐츠를 소정의 패턴의 상기 메인 매칭 부분에 대해 먼저 매칭시키는 단계,
    상기 문서의 콘텐츠가 상기 소정의 패턴의 상기 메인 매칭 부분에 매칭되는 경우, 상기 문서의 콘텐츠를 상기 확증 매칭 부분에 매칭시키는 단계, 및
    상기 문서의 콘텐츠가 상기 소정의 패턴의 확증 매칭 부분에 매칭되는 경우, 제 1 신뢰도 점수를 상기 매칭에 할당하는 단계를 포함하는
    문서 콘텐츠 처리 방법.
  5. 제4항에 있어서,
    상기 소정의 패턴의 상기 확증 매칭 부분은 복수의 확증 패턴을 가지며, 상기 문서의 콘텐츠를 상기 확증 매칭 부분에 대해 매칭시키는 단계는
    상기 문서의 콘텐츠를 복수의 확증 매칭 패턴의 각각에 대해 매칭시키는 단계, 및
    상기 문서의 콘텐츠가 둘 이상의 확증 매칭 패턴에 매칭되는 경우, 상기 신뢰도 점수를 증가시키는 단계를 포함하는
    문서 콘텐츠 처리 방법.
  6. 제1항에 있어서,
    상기 규칙 각각은 상기 문서의 콘텐츠에 포함될 경우 상기 문서의 콘텐츠를 민감한 콘텐츠로 만드는 서로 다른 유형의 정보를 식별하며,
    상기 문서의 콘텐츠가 민감한 콘텐츠라고 식별되는지 여부를 기초로 상기 문서의 콘텐츠에 데이터 유포 규칙을 적용시키는 단계를 포함하는
    문서 콘텐츠 처리 방법.
  7. 제6항에 있어서,
    상기 매칭시키는 단계는
    상기 문서의 콘텐츠를 신용 카드 정보를 식별하는 규칙에서의 패턴에 대해 매칭시키는 단계,
    사회 보장 번호(social security number) 정보를 식별하는 규칙에서의 패턴에 대해 상기 문서의 콘텐츠를 매칭시키는 단계, 및
    상기 문서의 콘텐츠를 개인 정보를 식별하는 규칙에서의 패턴에 대해 매칭시키는 단계를 포함하는
    문서 콘텐츠 처리 방법.
  8. 콘텐츠 처리 시스템으로서,
    복수의 규칙을 포함하는 규칙 데이터 저장소 - 각각의 규칙은 하나의 유형의 정보에 대응하고 분절 패턴(segmented pattern)의 세트 및 비-분절 패턴(un-segmented pattern)의 세트를 가짐 - ,
    콘텐츠가 각각의 규칙에 대응하는 유형의 정보를 포함하는지 여부를 결정하기 위해, 콘텐츠를 수신하고 콘텐츠를 각각의 규칙에서의 분절 패턴 및 비-분절 패턴에 대해 매칭시키는 콘텐츠 결정 구성요소 - 상기 콘텐츠 결정 구성요소는 상기 콘텐츠가 소정의 규칙에서의 분절 패턴 또는 비-분절 패턴에 매칭되는지 여부를 기초로 하여, 상기 콘텐츠가 소정의 규칙에 대응하는 유형의 정보를 포함하는지 여부에 대한 결정에 신뢰 레벨을 할당함 - ,
    시스템의 기능 구성요소이며 상기 콘텐츠 결정 구성요소에 의해 활성화되어 매칭 및 신뢰 레벨의 할당을 용이하게 하는 컴퓨터 프로세서를 포함하는
    콘텐츠 처리 시스템.
  9. 제8항에 있어서,
    상기 콘텐츠 결정 구성요소는 상기 콘텐츠가 분절 언어로 기록되었는지, 또는 비-분절 언어로 기록되었는지, 또는 분절 언어와 비-분절 언어 모두로 기록되었는지에 관계 없이, 분절 패턴 및 비-분절 패턴에 대해 상기 콘텐츠를 매칭시키며, 상기 콘텐츠 결정 구성요소는 상기 콘텐츠가 비-분절 패턴에 매칭되는 경우보다 분절 패턴에 매칭되는 경우 결정에 더 높은 신뢰 레벨을 할당하는
    콘텐츠 처리 시스템.
  10. 제9항에 있어서,
    규칙에서의 패턴 각각은 메인 매칭 부분과 확증 매칭 부분을 가지며, 상기 콘텐츠 결정 구성요소는 우선 상기 메인 매칭 부분에 대해 상기 콘텐츠를 매칭시키고, 그 후, 상기 콘텐츠가 상기 메인 매칭 부분에 매칭된 경우, 상기 확증 매칭 부분에 대해 매칭시키며, 상기 확증 매칭 부분은 복수의 매칭 패턴을 포함하고, 상기 콘텐츠 결정 구성요소는 상기 콘텐츠 매칭이 확증 매칭 부분 내 복수의 매칭 패턴 중 둘 이상의 매칭 패턴에 매칭되는 경우 증가된 신뢰 레벨을 할당하는
    콘텐츠 처리 시스템.
KR1020147022082A 2012-02-07 2013-02-01 언어 독립적인 확률적 콘텐츠 매칭 기법 KR102064623B1 (ko)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
US13/367,469 2012-02-07
US13/367,469 US9087039B2 (en) 2012-02-07 2012-02-07 Language independent probabilistic content matching
PCT/US2013/024244 WO2013119457A1 (en) 2012-02-07 2013-02-01 Language independent probabilistic content matching

Publications (2)

Publication Number Publication Date
KR20140133515A true KR20140133515A (ko) 2014-11-19
KR102064623B1 KR102064623B1 (ko) 2020-01-09

Family

ID=48903680

Family Applications (1)

Application Number Title Priority Date Filing Date
KR1020147022082A KR102064623B1 (ko) 2012-02-07 2013-02-01 언어 독립적인 확률적 콘텐츠 매칭 기법

Country Status (6)

Country Link
US (2) US9087039B2 (ko)
EP (1) EP2812810A4 (ko)
JP (1) JP6169620B2 (ko)
KR (1) KR102064623B1 (ko)
CN (2) CN104094250B (ko)
WO (1) WO2013119457A1 (ko)

Families Citing this family (7)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US8880989B2 (en) 2012-01-30 2014-11-04 Microsoft Corporation Educating users and enforcing data dissemination policies
US9087039B2 (en) 2012-02-07 2015-07-21 Microsoft Technology Licensing, Llc Language independent probabilistic content matching
US10834027B2 (en) * 2015-06-27 2020-11-10 Mcafee, Llc Protection of sensitive chat data
US10218654B2 (en) 2015-09-29 2019-02-26 International Business Machines Corporation Confidence score-based smart email attachment saver
CN109313894A (zh) * 2016-06-21 2019-02-05 索尼公司 信息处理装置与信息处理方法
US10546154B2 (en) 2017-03-28 2020-01-28 Yodlee, Inc. Layered masking of content
US10915657B2 (en) 2017-07-19 2021-02-09 AVAST Software s.r.o. Identifying and protecting personal sensitive documents

Family Cites Families (95)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6850252B1 (en) 1999-10-05 2005-02-01 Steven M. Hoffberg Intelligent electronic appliance system and method
CA2129075C (en) 1993-10-18 1999-04-20 Joseph J. Daniele Electronic copyright royalty accounting system using glyphs
US6006242A (en) 1996-04-05 1999-12-21 Bankers Systems, Inc. Apparatus and method for dynamically creating a document
US6308148B1 (en) 1996-05-28 2001-10-23 Cisco Technology, Inc. Network flow data export
US6014135A (en) 1997-04-04 2000-01-11 Netscape Communications Corp. Collaboration centric document processing environment using an information centric visual user interface and information presentation method
US5958005A (en) 1997-07-17 1999-09-28 Bell Atlantic Network Services, Inc. Electronic mail security
US6148297A (en) 1998-06-01 2000-11-14 Surgical Safety Products, Inc. Health care information and data tracking system and method
US6104990A (en) 1998-09-28 2000-08-15 Prompt Software, Inc. Language independent phrase extraction
JP2000181916A (ja) * 1998-12-17 2000-06-30 Fujitsu Ltd 文書解析装置および方法ならびに文書解析プログラムを記録したコンピュータ読み取り可能な記録媒体
US6968308B1 (en) * 1999-11-17 2005-11-22 Microsoft Corporation Method for segmenting non-segmented text using syntactic parse
US7610233B1 (en) 1999-12-22 2009-10-27 Accenture, Llp System, method and article of manufacture for initiation of bidding in a virtual trade financial environment
US6629081B1 (en) 1999-12-22 2003-09-30 Accenture Llp Account settlement and financing in an e-commerce environment
US6678409B1 (en) 2000-01-14 2004-01-13 Microsoft Corporation Parameterized word segmentation of unsegmented text
DE60015709T2 (de) 2000-01-19 2005-11-10 Hewlett-Packard Development Co., L.P., Houston Sicherheitspolitik, die auf eine Gemeinschaftsdaten-Sicherheitsarchitektur angewendet wird
US6678698B2 (en) 2000-02-15 2004-01-13 Intralinks, Inc. Computerized method and system for communicating and managing information used in task-oriented projects
US6826609B1 (en) 2000-03-31 2004-11-30 Tumbleweed Communications Corp. Policy enforcement in a secure data file delivery system
AUPQ865700A0 (en) 2000-07-07 2000-08-03 Toneguzzo Group Pty Limited, The Content filtering and management
US6839707B2 (en) 2001-01-17 2005-01-04 General Electric Company Web-based system and method for managing legal information
US7181017B1 (en) 2001-03-23 2007-02-20 David Felsher System and method for secure three-party communications
US6990534B2 (en) 2001-07-20 2006-01-24 Flowfinity Wireless, Inc. Method for a proactive browser system for implementing background frame maintenance and asynchronous frame submissions
US20040205531A1 (en) 2001-08-17 2004-10-14 Innes Bruce Donald Method and application for developing a statement of work
US7725490B2 (en) 2001-11-16 2010-05-25 Crucian Global Services, Inc. Collaborative file access management system
US7260555B2 (en) 2001-12-12 2007-08-21 Guardian Data Storage, Llc Method and architecture for providing pervasive security to digital assets
US7113905B2 (en) 2001-12-20 2006-09-26 Microsoft Corporation Method and apparatus for determining unbounded dependencies during syntactic parsing
US7903549B2 (en) 2002-03-08 2011-03-08 Secure Computing Corporation Content-based policy compliance systems and methods
US9237514B2 (en) 2003-02-28 2016-01-12 Apple Inc. System and method for filtering access points presented to a user and locking onto an access point
US7809698B1 (en) 2002-12-24 2010-10-05 International Business Machines Corporation System and method remapping identifiers to secure files
US9197668B2 (en) 2003-02-28 2015-11-24 Novell, Inc. Access control to files based on source information
US8020192B2 (en) 2003-02-28 2011-09-13 Michael Wright Administration of protection of data accessible by a mobile device
US7493251B2 (en) 2003-05-30 2009-02-17 Microsoft Corporation Using source-channel models for word segmentation
JP4333229B2 (ja) * 2003-06-23 2009-09-16 沖電気工業株式会社 固有表現文字列の評価装置および評価方法
GB2405293B (en) 2003-08-18 2007-04-25 Clearswift Ltd Email policy manager
US20060008256A1 (en) 2003-10-01 2006-01-12 Khedouri Robert K Audio visual player apparatus and system and method of content distribution using the same
WO2005107150A1 (en) 2004-04-30 2005-11-10 Research In Motion Limited Message service indication system and method
EP1762114B1 (en) 2004-05-24 2015-11-04 Google, Inc. Location based access control in a wireless network
US20060048224A1 (en) 2004-08-30 2006-03-02 Encryptx Corporation Method and apparatus for automatically detecting sensitive information, applying policies based on a structured taxonomy and dynamically enforcing and reporting on the protection of sensitive data through a software permission wrapper
US7454778B2 (en) 2004-09-30 2008-11-18 Microsoft Corporation Enforcing rights management through edge email servers
US7634735B2 (en) 2004-11-24 2009-12-15 Mccary David W Collaborative platform
JP4301513B2 (ja) 2004-11-26 2009-07-22 インターナショナル・ビジネス・マシーンズ・コーポレーション ポリシーを用いたアクセス制御効果の判定方法
US7533420B2 (en) 2004-12-09 2009-05-12 Microsoft Corporation System and method for restricting user access to a network document
JP4747591B2 (ja) * 2005-01-31 2011-08-17 日本電気株式会社 機密文書検索システム、機密文書検索方法、および機密文書検索プログラム
EP1853976B1 (en) * 2005-02-14 2018-12-26 Symantec Corporation Method and apparatus for handling messages containing pre-selected data
US8140664B2 (en) 2005-05-09 2012-03-20 Trend Micro Incorporated Graphical user interface based sensitive information and internal information vulnerability management system
US7853472B2 (en) 2005-07-15 2010-12-14 Saudi Arabian Oil Company System, program product, and methods for managing contract procurement
US7925973B2 (en) 2005-08-12 2011-04-12 Brightcove, Inc. Distribution of content
JP4826265B2 (ja) 2006-01-25 2011-11-30 富士ゼロックス株式会社 セキュリティポリシ付与装置、プログラム及び方法
US20070239600A1 (en) 2006-04-10 2007-10-11 Lundberg Steven W System and method for annuity processing
US20070261099A1 (en) 2006-05-02 2007-11-08 Broussard Scott J Confidential content reporting system and method with electronic mail verification functionality
US7984283B2 (en) 2006-05-22 2011-07-19 Hewlett-Packard Development Company, L.P. System and method for secure operating system boot
US7876335B1 (en) 2006-06-02 2011-01-25 Adobe Systems Incorporated Methods and apparatus for redacting content in a document
US20070294428A1 (en) 2006-06-19 2007-12-20 Ido Guy Method and System for Email Messaging
US8001130B2 (en) 2006-07-25 2011-08-16 Microsoft Corporation Web object retrieval based on a language model
CN100423004C (zh) * 2006-10-10 2008-10-01 北京新岸线网络技术有限公司 基于内容的视频搜索调度系统
GB2458087A (en) 2006-10-30 2009-09-09 Cryptometrics Canada Inc Computerized biometric passenger identification system and method
US8539349B1 (en) * 2006-10-31 2013-09-17 Hewlett-Packard Development Company, L.P. Methods and systems for splitting a chinese character sequence into word segments
JP4823022B2 (ja) * 2006-11-07 2011-11-24 キヤノンItソリューションズ株式会社 情報処理装置、情報処理方法、及びコンピュータプログラム
US8752181B2 (en) * 2006-11-09 2014-06-10 Touchnet Information Systems, Inc. System and method for providing identity theft security
US8256006B2 (en) * 2006-11-09 2012-08-28 Touchnet Information Systems, Inc. System and method for providing identity theft security
US7953614B1 (en) 2006-11-22 2011-05-31 Dr Systems, Inc. Smart placement rules
US8117022B2 (en) * 2006-12-07 2012-02-14 Linker Sheldon O Method and system for machine understanding, knowledge, and conversation
US7738900B1 (en) 2007-02-15 2010-06-15 Nextel Communications Inc. Systems and methods of group distribution for latency sensitive applications
US7797010B1 (en) 2007-02-15 2010-09-14 Nextel Communications Inc. Systems and methods for talk group distribution
US20080221882A1 (en) * 2007-03-06 2008-09-11 Bundock Donald S System for excluding unwanted data from a voice recording
JP2008269173A (ja) 2007-04-18 2008-11-06 Hitachi Ltd 計算機システム、ストレージシステムおよびデータ管理方法
US8521511B2 (en) 2007-06-18 2013-08-27 International Business Machines Corporation Information extraction in a natural language understanding system
US20090019121A1 (en) 2007-07-10 2009-01-15 Messagelabs Limited Message processing
US8091138B2 (en) 2007-09-06 2012-01-03 International Business Machines Corporation Method and apparatus for controlling the presentation of confidential content
US8396838B2 (en) 2007-10-17 2013-03-12 Commvault Systems, Inc. Legal compliance, electronic discovery and electronic document handling of online and offline copies of data
US8161526B2 (en) 2007-10-22 2012-04-17 International Business Machines Corporation Protecting sensitive information on a publicly accessed data processing system
US20090119372A1 (en) 2007-11-02 2009-05-07 Sean Callanan System and method for providing email warnings
US8151200B2 (en) 2007-11-15 2012-04-03 Target Brands, Inc. Sensitive information handling on a collaboration system
JP5379155B2 (ja) 2007-12-06 2013-12-25 グーグル・インコーポレーテッド Cjk名前検出
US7913167B2 (en) 2007-12-19 2011-03-22 Microsoft Corporation Selective document redaction
US8707384B2 (en) 2008-02-11 2014-04-22 Oracle International Corporation Change recommendations for compliance policy enforcement
CN101571921B (zh) * 2008-04-28 2012-07-25 富士通株式会社 关键字识别方法和装置
US8423483B2 (en) 2008-05-16 2013-04-16 Carnegie Mellon University User-controllable learning of policies
US8346532B2 (en) 2008-07-11 2013-01-01 International Business Machines Corporation Managing the creation, detection, and maintenance of sensitive information
US8271483B2 (en) 2008-09-10 2012-09-18 Palo Alto Research Center Incorporated Method and apparatus for detecting sensitive content in a document
JP4586913B2 (ja) 2008-09-19 2010-11-24 富士ゼロックス株式会社 文書管理システム、文書利用管理装置、及びプログラム
US8272028B2 (en) 2008-10-15 2012-09-18 Ricoh Company, Ltd. Approach for managing access to electronic documents on network devices using document retention policies and document security policies
WO2010059720A1 (en) 2008-11-19 2010-05-27 Scigen Technologies, S.A. Document creation system and methods
US8234693B2 (en) 2008-12-05 2012-07-31 Raytheon Company Secure document management
US9614924B2 (en) 2008-12-22 2017-04-04 Ctera Networks Ltd. Storage device and method thereof for integrating network attached storage with cloud storage services
US20100169771A1 (en) 2008-12-31 2010-07-01 Cerner Innovation, Inc. User Interface for Managing Patient Care Plans
JP4701292B2 (ja) * 2009-01-05 2011-06-15 インターナショナル・ビジネス・マシーンズ・コーポレーション テキスト・データに含まれる固有表現又は専門用語から用語辞書を作成するためのコンピュータ・システム、並びにその方法及びコンピュータ・プログラム
US8131735B2 (en) 2009-07-02 2012-03-06 Battelle Memorial Institute Rapid automatic keyword extraction for information retrieval and analysis
KR101621481B1 (ko) 2009-12-15 2016-05-16 에스케이 텔레콤주식회사 보안 문서 관리 장치 및 방법
CN101841684B (zh) 2009-12-18 2013-01-23 闪联信息技术工程中心有限公司 显示内容加密系统和方法及观看显示内容的装置
US20110246965A1 (en) 2010-04-01 2011-10-06 International Business Machines Corporation Correcting document generation for policy compliance
CN101943955A (zh) * 2010-09-25 2011-01-12 吴保国 拼音义标直观汉字及多语言文字输入法
US20120084868A1 (en) 2010-09-30 2012-04-05 International Business Machines Corporation Locating documents for providing data leakage prevention within an information security management system
US8806615B2 (en) * 2010-11-04 2014-08-12 Mcafee, Inc. System and method for protecting specified data combinations
US8676187B2 (en) 2011-02-08 2014-03-18 T-Mobile Usa, Inc. Dynamic binding of service on bearer
US8880989B2 (en) 2012-01-30 2014-11-04 Microsoft Corporation Educating users and enforcing data dissemination policies
US9087039B2 (en) 2012-02-07 2015-07-21 Microsoft Technology Licensing, Llc Language independent probabilistic content matching

Also Published As

Publication number Publication date
EP2812810A4 (en) 2015-12-02
US9087039B2 (en) 2015-07-21
CN106021237B (zh) 2019-07-02
KR102064623B1 (ko) 2020-01-09
JP2015511360A (ja) 2015-04-16
CN106021237A (zh) 2016-10-12
EP2812810A1 (en) 2014-12-17
WO2013119457A1 (en) 2013-08-15
JP6169620B2 (ja) 2017-07-26
US20130204609A1 (en) 2013-08-08
CN104094250B (zh) 2017-10-10
US20160012037A1 (en) 2016-01-14
US9633001B2 (en) 2017-04-25
CN104094250A (zh) 2014-10-08

Similar Documents

Publication Publication Date Title
KR102064623B1 (ko) 언어 독립적인 확률적 콘텐츠 매칭 기법
US11025665B2 (en) Detection and identification of targeted attacks on a computing system
US9244610B2 (en) Systems and methods for using entered text to access and process contextual information
CN108140038B (zh) 跨数据中心交互操作和通信
CN107533618B (zh) 保护数据免受未经授权的访问
KR20090127936A (ko) 클라이언트 입력 방식
US20210312040A1 (en) Enhancing security using anomaly detection
CN104980404B (zh) 保护账号信息安全的方法和系统
US11669677B2 (en) Integrating an application for surfacing data on an electronic message pane
KR102082023B1 (ko) 커스텀 rtf 커맨드를 사용하여 채팅 기능을 확장하는 기법
US20160267072A1 (en) Context sensitive phrase identification
CN110799943A (zh) 从图形键盘内访问应用程序功能
US20140351957A1 (en) Blocking Objectionable Content in Service Provider Storage Systems
EP3414651A1 (en) Contextual command bar
WO2022266967A1 (en) Abstractive content transformation
CN109313749B (zh) 电子邮件中的嵌套协作
CN106415626B (zh) 从单个项目发起的组选择
US11636170B1 (en) Normalizing uniform resource locators
KR102413355B1 (ko) 디바이스로의 보안 서비스 제공 방법 및 이를 수행하는 서버
US20230161962A1 (en) System for automatically augmenting a message based on context extracted from the message

Legal Events

Date Code Title Description
N231 Notification of change of applicant
A201 Request for examination
E902 Notification of reason for refusal
E701 Decision to grant or registration of patent right
GRNT Written decision to grant