TH105604B - กระบวนการสำหรับการรู้จำภาพตัวอักษรกึ่งอัตโนมัติ - Google Patents
กระบวนการสำหรับการรู้จำภาพตัวอักษรกึ่งอัตโนมัติInfo
- Publication number
- TH105604B TH105604B TH901003430A TH0901003430A TH105604B TH 105604 B TH105604 B TH 105604B TH 901003430 A TH901003430 A TH 901003430A TH 0901003430 A TH0901003430 A TH 0901003430A TH 105604 B TH105604 B TH 105604B
- Authority
- TH
- Thailand
- Prior art keywords
- character
- image
- database
- character image
- string
- Prior art date
Links
Abstract
------21/02/2563------(OCR) หน้าที่ 1 ของจำนวน 1 หน้า บทสรุปการประดิษฐ์ การประดิษฐ์นี้นำเสนอระเบียบวิธีการรู้จำภาพตัวอักษรกึ่งอัตโนมัติ ซึ่งเป็นการรู้จำตัวอักษรโดยที่ผู้ใช้ต้องป้อนข้อมูลตัวอักษรก่อนการใช้งาน จากนั้นระบบจะทำการรู้จำภาพตัวอักษร โดยใช้การคำนวณค่าความใกล้เคียงของภาพตัวอักษรที่อินพุตกับตัวอักษรที่ผู้ใช้กำหนดให้ในตอนแรก และถ้าตัวอักษรมีการเชื่อมติดกัน 2 ตัวขึ้นไปหรือ เป็นตัวอักษรที่ไม่สมบูรณ์เนื่องจากการขาดของเส้นตัวอักษร ก็จะใช้ลักษณะเฉพาะของตัวอักษร เช่น ความกว้างของตัวอักษรมาช่วยกำหนดขนาดของตัวอักษรและอาศัยค่าความน่าจะเป็นของคู่ตัวอักษรช่วยคาดเดาตัวอักษรที่ติดกันว่าควรเป็นตัวอักษรใด เพื่อช่วยเพิ่มความถูกต้องในการรู้จำมากขึ้น นอกจากนี้ระเบียบวิธีที่นำเสนอยังสามารถนำไปประยุกต์ใช้กับภาษาใดก็ได้ ------------ DC60 การประดิษฐ์นี้นำเสนอระเบียบวิธีการรู้จำภาพตัวอักษรกึ่งอัตโนมัติ ซึ่งเป็นการรู้จำ ตัวอักษร โดยที่ผู้ใช้ต้องป้อนข้อมูลตัวอักษรก่อนการใช้งาน จากนั้นระบบจะทำการรู้จำภาพ ตัวอักษร โดยใช้การคำนวณค่าความใกล้เคียงของภาพตัวอักษรที่อินพุตกับตัวอักษรที่ผู้ใช้ กำหนดให้ในตอนแรก และถ้าตัวอักษรมีการเชื่อมติดกัน 2 ตัวขึ้นไปหรือ เป็นตัวอักษรที่ไม่สมบูรณ์ เนื่องจากการขาดของเส้นตัวอักษร ก็จะใช้ลักษณะเฉพาะของตัวอักษร เช่น ความกว้างของ ตัวอักษรมาช่วยกำหนดขนาดของตัวอักษรและอาศัยค่าความน่าจะเป็นของคู่ตัวอักษรช่วยคาดเดา ตัวอักษรที่ติดกันว่าควรเป็นตัวอักษรใด เพื่อช่วยเพิ่มความถูกต้องในการรู้จำมากขึ้น นอกจากนี้ ระเบียบวิธีที่นำเสนอยังสามารถนำไปประยุกต์ใช้กับภาษาใดก็ได้
Claims (1)
- ------21/02/2563------(OCR) หน้าที่ 1 ของจำนวน 2 หน้า ข้อถือสิทธิ1. วิธีการรู้จำภาพตัวอักษรกึ่งอัตโนมัติเพื่อแปลงภาพตัวอักษรให้เป็นสายตัวอักษร ในระบบที่ ประกอบด้วย ฐานข้อมูล ไบแกรม (2-grams) และฐานข้อมูลรูปแบบตัวอักษร (template) ซึ่งวิธีการดังกล่าวประกอบด้วยขั้นตอนของ i) การรับข้อมูลภาพที่ประกอบด้วยภาพตัวอักษรจำนวนหนึ่ง ii) การเตรียมข้อมูลภาพที่ประกอบด้วย การตัดแบ่งภาพตัวอักษรดังกล่าวออกเป็น สายตัวอักษร โดยที่แต่ละสายตัวอักษรประกอบรวมด้วยตัวอักษรอย่างน้อยหนึ่ง ตัว และที่ซึ่งสายตัวอักษรแต่ละสายจะแยกจากกันด้วยช่องว่าง (space) iii) การตรวจสอบขนาดของสายตัวอักษรตังกล่าว ถ้าขนาดของสายตัวอักษรมีขนาด มากกว่าที่กำหนดไว้ แสดงว่าในสายตัวอักษรดังกล่าวประกอบด้วยตัวอักษร มากกว่าหนึ่งตัว ทำการแบ่งสายตัวอักษรออกเป็นส่วนภาพตัวอักษรที่หนึ่งและ ส่วนภาพตัวอักษรที่สอง iv) ทำการเปรียบเทียบส่วนภาพตัวอักษรตัวที่หนึ่งดังกล่าวของสายตัวอักษรดังกล่าว กับรูปแบบตัวอักษรในฐานข้อมูลรูปแบบตัวอักษร (template) และเลือกตัวอักษรที่ ใกล้เคียงที่สุดเพื่อกำหนดให้เป็นตัวอักษรที่หนึ่ง v) ทำการค้นหาคู่ตัวอักษรตัวที่สองจากฐานข้อมูลไบแกรม (2-grams) ดังกล่าว โดย อยู่บนพื้นฐานของตัวอักษรที่หนึ่งที่เลือกไว้ดังกล่าว โดยเลือกคู่ตัวอักษรที่มีค่า ความน่าจะเป็นสูงที่สุดในฐานข้อมูลไบแกรมก่อน เพื่อนำภาพตัวอักษรจาก ฐานข้อมูลรูปแบบตัวอักษรที่สอดคล้องกันมาเปรียบเทียบกับส่วนภาพตัวอักษรที่ สองดังกล่าว และ vi) ทำซํ้าขั้นตอนที่ (v) โดยใช้คู่ตัวอักษรที่มีค่าความน่าจะเป็นสูงในอันดับถัดไป จาก ฐานข้อมูลไบแกรมดังกล่าว จนกว่าจะพบภาพตัวอักษรที่ตรงกันกับตัวอักษรใน ฐานข้อมูลรูปแบบตัวอักษรดังกล่าว หรือ ตัวอักษรในฐานข้อมูลรูปแบบภาพ ตัวอักษรที่ให้ค่าความเหมือนกันมากที่สุด2. วิธีการตามข้อถือสิทธิ 1 ที่ยังประกอบเพิ่มเติมด้วย ขั้นตอนการคำนวณหาระยะห่างระหว่าง ตัวอักษรเฉลี่ย(space) และความกว้างของตัวอักษรเฉลี่ย3. วิธีการตามข้อถือสิทธิ 1 ที่ซึ่ง ขั้นตอนการรับข้อมูลภาพดังกล่าว ดำเนินการโดยการสแกน ภาพ หน้าที่ 2 ของจำนวน 2 หน้า4. วิธีการตามข้อถือสิทธิ 1 ที่ซึ่ง ขั้นตอนการเตรียมข้อมูลภาพดังกล่าวยังประกอบเพิ่มเติมด้วย ทำการหาเส้นบรรทัดโดยเทคนิคโปรเจคชันในแนวนอน เพื่อแบ่งรูปภาพตัวอักษรออกเป็น แถว จำนวนหนึ่ง5. วิธีการตามข้อถือสิทธิ 1 ที่ซึ่ง ขั้นตอนการคำนวณความใกล้เคียงกันของภาพตัวอักษรกับ รูปแบบตัวอักษร (template) ใช้สมการดังนี้ MAX Mi = (สัญลักษณ์)(Tij-Cij) ซึ่ง Mi หมายถึง ค่าความใกล้เคียง ณ ตำแหน่งแถวนอน i Tij หมายถึง ค่าสีของภาพ Template ณ ตำแหน่ง แถวนอน i และ แถวตั้ง j Cij หมายถึง ค่าสีของภาพตัวอักษรที่ต้องการรู้จำ ณ ตำแหน่ง แถว นอน i และ แถวตั้ง j ------------
Publications (3)
| Publication Number | Publication Date |
|---|---|
| TH103248A TH103248A (th) | 2010-08-11 |
| TH105604A TH105604A (th) | 2010-12-30 |
| TH105604B true TH105604B (th) | 2024-12-18 |
Family
ID=
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN110114776B (zh) | 使用全卷积神经网络的字符识别的系统和方法 | |
| Firmani et al. | Towards Knowledge Discovery from the Vatican Secret Archives. In Codice Ratio-Episode 1: Machine Transcription of the Manuscripts. | |
| Bai et al. | Keyword spotting in document images through word shape coding | |
| US20090304282A1 (en) | Recognition of tabular structures | |
| JP2014106961A (ja) | アラビア語テキストを自動的に認識するためのコンピュータによって実行される方法、およびコンピュータプログラム | |
| CN111630521A (zh) | 图像处理方法和图像处理系统 | |
| US20050182760A1 (en) | Apparatus and method for searching for digital ink query | |
| Reffle et al. | Unsupervised profiling of OCRed historical documents | |
| TWI567569B (zh) | Natural language processing systems, natural language processing methods, and natural language processing programs | |
| CN109815452A (zh) | 文本比较方法、装置、存储介质及电子设备 | |
| Okamoto et al. | Performance evaluation of a robust method for mathematical expression recognition | |
| US9934429B2 (en) | Storage medium, recognition method, and recognition apparatus | |
| Ramakrishnan et al. | Global and local features for recognition of online handwritten numerals and Tamil characters | |
| Springmann et al. | Automatic quality evaluation and (semi-) automatic improvement of OCR models for historical printings | |
| US9384304B2 (en) | Document search apparatus, document search method, and program product | |
| JP2012043385A (ja) | 文字認識装置および文字認識方法 | |
| Li et al. | A fast keyword-spotting technique | |
| US20150063698A1 (en) | Assisted OCR | |
| TH103248A (th) | กระบวนการสำหรับการรู้จำภาพตัวอักษรกึ่งอัตโนมัติ | |
| Tariq et al. | Softconverter: A novel approach to construct OCR for printed Urdu isolated characters | |
| Madhavaraj et al. | Improved recognition of aged Kannada documents by effective segmentation of merged characters | |
| KR20160053544A (ko) | 후보 문자의 추출 방법 | |
| KR20160053587A (ko) | 엔-그램 언어 모델의 데이터베이스 사이즈 최소화 방법 | |
| JP5853488B2 (ja) | 情報処理装置およびプログラム | |
| US11270153B2 (en) | System and method for whole word conversion of text in image |