TH103248A - กระบวนการสำหรับการรู้จำภาพตัวอักษรกึ่งอัตโนมัติ - Google Patents

กระบวนการสำหรับการรู้จำภาพตัวอักษรกึ่งอัตโนมัติ

Info

Publication number
TH103248A
TH103248A TH901003430A TH0901003430A TH103248A TH 103248 A TH103248 A TH 103248A TH 901003430 A TH901003430 A TH 901003430A TH 0901003430 A TH0901003430 A TH 0901003430A TH 103248 A TH103248 A TH 103248A
Authority
TH
Thailand
Prior art keywords
character
image
database
character image
string
Prior art date
Application number
TH901003430A
Other languages
English (en)
Other versions
TH105604A (th
TH105604B (th
Inventor
วัชรบุศราคำ นางสาวศรินทร์
ดูเบ นายเปรมนาถ
สินธุภิญโญ นายวศิน
มฤคทัต นายสรรพฤทธิ์
Original Assignee
นางรัชดา เรืองสิน
นางสาวรัตนากร แสนศักดิ์
นางสาววราภรณ์ นวลแปง
นางสาวสมรลักษณ์ แจ่มแจ้ง
นายสุธางค์ สวัสดี
นายอานนท์ จินดาดวง
สำนักงานพัฒนาวิทยาศาตร์และเทคโนโลยีแห่งชาติ
Filing date
Publication date
Application filed by นางรัชดา เรืองสิน, นางสาวรัตนากร แสนศักดิ์, นางสาววราภรณ์ นวลแปง, นางสาวสมรลักษณ์ แจ่มแจ้ง, นายสุธางค์ สวัสดี, นายอานนท์ จินดาดวง, สำนักงานพัฒนาวิทยาศาตร์และเทคโนโลยีแห่งชาติ filed Critical นางรัชดา เรืองสิน
Publication of TH103248A publication Critical patent/TH103248A/th
Publication of TH105604A publication Critical patent/TH105604A/th
Publication of TH105604B publication Critical patent/TH105604B/th

Links

Abstract

------21/02/2563------(OCR) หน้าที่ 1 ของจำนวน 1 หน้า บทสรุปการประดิษฐ์ การประดิษฐ์นี้นำเสนอระเบียบวิธีการรู้จำภาพตัวอักษรกึ่งอัตโนมัติ ซึ่งเป็นการรู้จำตัวอักษรโดยที่ผู้ใช้ต้องป้อนข้อมูลตัวอักษรก่อนการใช้งาน จากนั้นระบบจะทำการรู้จำภาพตัวอักษร โดยใช้การคำนวณค่าความใกล้เคียงของภาพตัวอักษรที่อินพุตกับตัวอักษรที่ผู้ใช้กำหนดให้ในตอนแรก และถ้าตัวอักษรมีการเชื่อมติดกัน 2 ตัวขึ้นไปหรือ เป็นตัวอักษรที่ไม่สมบูรณ์เนื่องจากการขาดของเส้นตัวอักษร ก็จะใช้ลักษณะเฉพาะของตัวอักษร เช่น ความกว้างของตัวอักษรมาช่วยกำหนดขนาดของตัวอักษรและอาศัยค่าความน่าจะเป็นของคู่ตัวอักษรช่วยคาดเดาตัวอักษรที่ติดกันว่าควรเป็นตัวอักษรใด เพื่อช่วยเพิ่มความถูกต้องในการรู้จำมากขึ้น นอกจากนี้ระเบียบวิธีที่นำเสนอยังสามารถนำไปประยุกต์ใช้กับภาษาใดก็ได้ ------------ DC60 การประดิษฐ์นี้นำเสนอระเบียบวิธีการรู้จำภาพตัวอักษรกึ่งอัตโนมัติ ซึ่งเป็นการรู้จำ ตัวอักษร โดยที่ผู้ใช้ต้องป้อนข้อมูลตัวอักษรก่อนการใช้งาน จากนั้นระบบจะทำการรู้จำภาพ ตัวอักษร โดยใช้การคำนวณค่าความใกล้เคียงของภาพตัวอักษรที่อินพุตกับตัวอักษรที่ผู้ใช้ กำหนดให้ในตอนแรก และถ้าตัวอักษรมีการเชื่อมติดกัน 2 ตัวขึ้นไปหรือ เป็นตัวอักษรที่ไม่สมบูรณ์ เนื่องจากการขาดของเส้นตัวอักษร ก็จะใช้ลักษณะเฉพาะของตัวอักษร เช่น ความกว้างของ ตัวอักษรมาช่วยกำหนดขนาดของตัวอักษรและอาศัยค่าความน่าจะเป็นของคู่ตัวอักษรช่วยคาดเดา ตัวอักษรที่ติดกันว่าควรเป็นตัวอักษรใด เพื่อช่วยเพิ่มความถูกต้องในการรู้จำมากขึ้น นอกจากนี้ ระเบียบวิธีที่นำเสนอยังสามารถนำไปประยุกต์ใช้กับภาษาใดก็ได้

Claims (1)

  1. ------21/02/2563------(OCR) หน้าที่ 1 ของจำนวน 2 หน้า ข้อถือสิทธิ1. วิธีการรู้จำภาพตัวอักษรกึ่งอัตโนมัติเพื่อแปลงภาพตัวอักษรให้เป็นสายตัวอักษร ในระบบที่ ประกอบด้วย ฐานข้อมูล ไบแกรม (2-grams) และฐานข้อมูลรูปแบบตัวอักษร (template) ซึ่งวิธีการดังกล่าวประกอบด้วยขั้นตอนของ i) การรับข้อมูลภาพที่ประกอบด้วยภาพตัวอักษรจำนวนหนึ่ง ii) การเตรียมข้อมูลภาพที่ประกอบด้วย การตัดแบ่งภาพตัวอักษรดังกล่าวออกเป็น สายตัวอักษร โดยที่แต่ละสายตัวอักษรประกอบรวมด้วยตัวอักษรอย่างน้อยหนึ่ง ตัว และที่ซึ่งสายตัวอักษรแต่ละสายจะแยกจากกันด้วยช่องว่าง (space) iii) การตรวจสอบขนาดของสายตัวอักษรตังกล่าว ถ้าขนาดของสายตัวอักษรมีขนาด มากกว่าที่กำหนดไว้ แสดงว่าในสายตัวอักษรดังกล่าวประกอบด้วยตัวอักษร มากกว่าหนึ่งตัว ทำการแบ่งสายตัวอักษรออกเป็นส่วนภาพตัวอักษรที่หนึ่งและ ส่วนภาพตัวอักษรที่สอง iv) ทำการเปรียบเทียบส่วนภาพตัวอักษรตัวที่หนึ่งดังกล่าวของสายตัวอักษรดังกล่าว กับรูปแบบตัวอักษรในฐานข้อมูลรูปแบบตัวอักษร (template) และเลือกตัวอักษรที่ ใกล้เคียงที่สุดเพื่อกำหนดให้เป็นตัวอักษรที่หนึ่ง v) ทำการค้นหาคู่ตัวอักษรตัวที่สองจากฐานข้อมูลไบแกรม (2-grams) ดังกล่าว โดย อยู่บนพื้นฐานของตัวอักษรที่หนึ่งที่เลือกไว้ดังกล่าว โดยเลือกคู่ตัวอักษรที่มีค่า ความน่าจะเป็นสูงที่สุดในฐานข้อมูลไบแกรมก่อน เพื่อนำภาพตัวอักษรจาก ฐานข้อมูลรูปแบบตัวอักษรที่สอดคล้องกันมาเปรียบเทียบกับส่วนภาพตัวอักษรที่ สองดังกล่าว และ vi) ทำซํ้าขั้นตอนที่ (v) โดยใช้คู่ตัวอักษรที่มีค่าความน่าจะเป็นสูงในอันดับถัดไป จาก ฐานข้อมูลไบแกรมดังกล่าว จนกว่าจะพบภาพตัวอักษรที่ตรงกันกับตัวอักษรใน ฐานข้อมูลรูปแบบตัวอักษรดังกล่าว หรือ ตัวอักษรในฐานข้อมูลรูปแบบภาพ ตัวอักษรที่ให้ค่าความเหมือนกันมากที่สุด2. วิธีการตามข้อถือสิทธิ 1 ที่ยังประกอบเพิ่มเติมด้วย ขั้นตอนการคำนวณหาระยะห่างระหว่าง ตัวอักษรเฉลี่ย(space) และความกว้างของตัวอักษรเฉลี่ย3. วิธีการตามข้อถือสิทธิ 1 ที่ซึ่ง ขั้นตอนการรับข้อมูลภาพดังกล่าว ดำเนินการโดยการสแกน ภาพ หน้าที่ 2 ของจำนวน 2 หน้า4. วิธีการตามข้อถือสิทธิ 1 ที่ซึ่ง ขั้นตอนการเตรียมข้อมูลภาพดังกล่าวยังประกอบเพิ่มเติมด้วย ทำการหาเส้นบรรทัดโดยเทคนิคโปรเจคชันในแนวนอน เพื่อแบ่งรูปภาพตัวอักษรออกเป็น แถว จำนวนหนึ่ง5. วิธีการตามข้อถือสิทธิ 1 ที่ซึ่ง ขั้นตอนการคำนวณความใกล้เคียงกันของภาพตัวอักษรกับ รูปแบบตัวอักษร (template) ใช้สมการดังนี้ MAX Mi = (สัญลักษณ์)(Tij-Cij) ซึ่ง Mi หมายถึง ค่าความใกล้เคียง ณ ตำแหน่งแถวนอน i Tij หมายถึง ค่าสีของภาพ Template ณ ตำแหน่ง แถวนอน i และ แถวตั้ง j Cij หมายถึง ค่าสีของภาพตัวอักษรที่ต้องการรู้จำ ณ ตำแหน่ง แถว นอน i และ แถวตั้ง j ------------
TH901003430A 2009-02-26 กระบวนการสำหรับการรู้จำภาพตัวอักษรกึ่งอัตโนมัติ TH105604B (th)

Publications (3)

Publication Number Publication Date
TH103248A true TH103248A (th) 2010-08-11
TH105604A TH105604A (th) 2010-12-30
TH105604B TH105604B (th) 2024-12-18

Family

ID=

Similar Documents

Publication Publication Date Title
CN110114776B (zh) 使用全卷积神经网络的字符识别的系统和方法
Firmani et al. Towards Knowledge Discovery from the Vatican Secret Archives. In Codice Ratio-Episode 1: Machine Transcription of the Manuscripts.
Bai et al. Keyword spotting in document images through word shape coding
US20090304282A1 (en) Recognition of tabular structures
JP2014106961A (ja) アラビア語テキストを自動的に認識するためのコンピュータによって実行される方法、およびコンピュータプログラム
CN111630521A (zh) 图像处理方法和图像处理系统
US20050182760A1 (en) Apparatus and method for searching for digital ink query
Reffle et al. Unsupervised profiling of OCRed historical documents
TWI567569B (zh) Natural language processing systems, natural language processing methods, and natural language processing programs
CN109815452A (zh) 文本比较方法、装置、存储介质及电子设备
Okamoto et al. Performance evaluation of a robust method for mathematical expression recognition
US9934429B2 (en) Storage medium, recognition method, and recognition apparatus
Ramakrishnan et al. Global and local features for recognition of online handwritten numerals and Tamil characters
Springmann et al. Automatic quality evaluation and (semi-) automatic improvement of OCR models for historical printings
US9384304B2 (en) Document search apparatus, document search method, and program product
JP2012043385A (ja) 文字認識装置および文字認識方法
Li et al. A fast keyword-spotting technique
US20150063698A1 (en) Assisted OCR
TH105604B (th) กระบวนการสำหรับการรู้จำภาพตัวอักษรกึ่งอัตโนมัติ
Tariq et al. Softconverter: A novel approach to construct OCR for printed Urdu isolated characters
Madhavaraj et al. Improved recognition of aged Kannada documents by effective segmentation of merged characters
KR20160053544A (ko) 후보 문자의 추출 방법
KR20160053587A (ko) 엔-그램 언어 모델의 데이터베이스 사이즈 최소화 방법
JP5853488B2 (ja) 情報処理装置およびプログラム
US11270153B2 (en) System and method for whole word conversion of text in image