TWM596382U - 手語影像辨識裝置 - Google Patents
手語影像辨識裝置 Download PDFInfo
- Publication number
- TWM596382U TWM596382U TW109204167U TW109204167U TWM596382U TW M596382 U TWM596382 U TW M596382U TW 109204167 U TW109204167 U TW 109204167U TW 109204167 U TW109204167 U TW 109204167U TW M596382 U TWM596382 U TW M596382U
- Authority
- TW
- Taiwan
- Prior art keywords
- sign language
- image
- unit
- recognition device
- image recognition
- Prior art date
Links
Images
Landscapes
- Image Analysis (AREA)
Abstract
一種手語影像辨識裝置,包含一外殼單元、一設置於該外殼單元的影像處理單元,及一設置於該外殼單元內且電連接於該影像處理單元的語音單元。該外殼單元是配戴於一手語人士的胸前,該影像處理單元能由該手語人士的胸前往前拍攝該手語人士的手語影像,並將所拍攝的影像進行辨識並轉換成文字,該語音單元用以將轉換成文字的影像內容以語音播放。以手語人士的視角來拍攝手語,經過翻譯後直接發出語音,使得手語人士能與一般人快速溝通,減少生活人的不便,且整體結構精巧輕盈,配戴與攜帶皆不會造成太大的負擔。
Description
本新型是有關於一種翻譯設備,尤其是一種手語影像辨識裝置。
手語(sign language)是一種不使用語音,而使用手勢、身體動作、臉部表情表達意思的語言。手語的主要使用者是聾啞人士;對一般大眾而言,手語不算通用,但伴隨著學校暨相關社工團體或人士的傳授,使得學會手語這項溝通技能的非聾啞人士,已有逐漸普及的趨勢,但仍嫌不足。尤其是當聾啞人士在日常生活中因外出而需和不懂手語的一般大眾溝通時,倍感無奈。
依目前全世界近有四億四千萬名聽力障礙者。根據台灣衛生福利部統計處,聽覺機能障礙者為近十二萬人,聲音機能或語言機能障礙者為近一萬五千人,總計十三萬五千多人,約占身心障礙者人數的11.7%。為了增加手語人士的生活便利性,能夠開發出一套有用而且方便攜帶的手語翻譯裝置,能夠改善普遍人與手語人士的生活品質。目前手語翻譯裝置分為兩種,第一種是手套穿戴式,容易造成夏天時帶來的悶熱不適感、活動上的不靈巧,且在勤洗手的生活環境下需一直穿脫。第二種是以手機平板影像式,但是攝影鏡頭可能無法跟上手語動作,造成對比度低,導致翻譯失敗,且只能追蹤手掌部分導致所能夠翻譯的手語極少,使用者還需拿出裝置拍攝才能進行辨識。
有鑑於此,本新型之目的,在於提供一種可以即時進行翻譯的手語影像辨識裝置。
本新型手語影像辨識裝置,包含一外殼單元、一設置於該外殼單元的影像處理單元,及一設置於該外殼單元內且電連接於該影像處理單元的語音單元。該外殼單元是配戴於一手語人士的胸前,該影像處理單元能由該手語人士的胸前往前拍攝該手語人士的手語影像,並將所拍攝的影像進行辨識並轉換成文字,該語音單元用以將轉換成文字的影像內容以語音播放。
本新型的另一技術手段,是在於該影像處理單元包括至少一設置於該外殼單元上的鏡頭。
本新型的另一技術手段,是在於該影像處理單元還包括一用以接收該鏡頭所拍攝之影像的影像合併模組。
本新型的另一技術手段,是在於該影像處理單元還包括一用以將合併的影像進行擷取的影像擷取模組,及一用以辨識所擷取之影像的影像辨識模組。
本新型的另一技術手段,是在於該影像處理單元還包括一將辨識後的影像輸出成文字的影像轉換模組,該語音單元將該影像轉換模組所輸出的文字以語音播放。
本新型的另一技術手段,是在於該影像合併模組是採用電腦視覺庫(OpenCV)。
本新型的另一技術手段,是在於該影像擷取模組、該影像辨識模組,及該影像轉換模組是採用卷積循環神經網路(CRNN)。
本新型的另一技術手段,是在於該影像辨識模組是以大量手語樣本進行訓練與調適後產生手語模型,再搭配手語辭典,共同將所擷取的影像進行辨識。
本新型的另一技術手段,是在於該影像轉換模組是以大量的文字語料進行訓練與調商後產生語言模型,再搭配手語辭典,將辨識後的影像輸出成文字。
本新型的另一技術手段,是在於該外殼單元包括一殼體,及複數開設於該殼體上的穿孔,該影像處理單元是設置於該殼體內,該語音單元所播放的語音能由所述穿孔傳出。
本新型的另一技術手段,是在於該語音單元具有一設置於該外殼單元上的開關、一設置於該外殼單元上且電連接於該開關的音量鍵,及一電連接於該音量鍵的揚聲器。
本新型之功效在於:以手語人士的視角來拍攝手語,經過翻譯後直接發出語音,使得手語人士能與一般人快速溝通,減少生活人的不便,且整體結構精巧輕盈,配戴與攜帶皆不會造成太大的負擔。
關本新型之相關申請專利特色與技術內容,在以下配合參考圖式之較佳實施例的詳細說明中,將可清楚地呈現。在進行詳細說明前應注意的是,類似的元件是以相同的編號來做表示。
參閱圖1及圖2,為本新型手語影像辨識裝置之較佳實施例,包含一外殼單元2、一設置於該外殼單元2的影像處理單元3,及一設置於該外殼單元2內且電連接於該影像處理單元3的語音單元4。該外殼單元2包括一殼體21,及複數開設於該殼體21上的穿孔22,該語音單元4所播放的語音能由所述穿孔22傳出,且該語音單元4具有一設置於該外殼單元2上的開關41、一設置於該外殼單元2上且電連接於該開關41的音量鍵42,及一電連接於該音量鍵42的揚聲器43。
參閱圖1及圖3,該影像處理單元3包括兩個設置於該外殼單元2上的鏡頭31、一用以接收該鏡頭31所拍攝之影像的影像合併模組32、一用以將合併的影像進行擷取的影像擷取模組33、一用以辨識所擷取之影像的影像辨識模組34,及一將辨識後的影像輸出成文字的影像轉換模組35,該語音單元4的該揚聲器43將該影像轉換模組35所輸出的文字以語音播放。
於本實施例中,該影像處理單元3是使用兩個廣角攝影鏡頭31進行拍攝,並且是如圖4所示,懸掛於手語人士的胸前位置。由於手語人士一般在比劃手語時,位置大多是集中在胸前的區域,因此本實施例懸掛在手語人士的胸前位置,可以獲得較佳的拍攝效果。當然,不侷限於懸掛方式,只要可以配戴並固定在手語人士的身體前側即可。
所述鏡頭31進行影像的拍攝之後,就由該影像合併模組32接收影像並進行影像拼接處理。於本較佳實施例中,該影像合併模組32是採用電腦視覺庫(OpenCV)。OpenCV的全名為Open Source Computer Vision Library,是一個跨平台的電腦視覺庫,在臉部辨識、手勢辦識、動作辨識、運動跟蹤等領域經常使用。
另外,參閱圖3及圖5,該影像擷取模組33、該影像辨識模組34,及該影像轉換模組35是利用卷積循環神經網路(CRNN)來完成。其中,卷積循環神經網路 CRNN是由兩個神經網路:卷積神經網路(Convolutional Neural Network, CNN)和循環神經網路(Recurrent neural network:RNN)結合。卷積神經網路中包含卷積層(convolution)、池化層(pooling),卷積層主要透過不同卷積核(Filter)在輸入圖上滑動進行卷積運算,此目的是為了萃取出該圖片的特徵(Feature extration)(例如:物體邊界、形狀)。池化層是將卷積後的結果保留區塊內的最大值,池化的主要目的為減少神經網路的計算量並保留特徵,循環神經網路常用於時間、空間序列上有高度相關的訊息,例如:手語動作影像就是一種時序資料,循環神經網路的特點為當前的輸入,將會參照前一個狀態的訊息,讓此網路擁有記憶的特性,並以此技術辨識出使用者所要表達的手語。池化目的只是在將圖片資料量減少並保留重要資訊的方法,把原本的資料做一個最大化或是平均化的降維計算。
要特別說明的是,前述電腦視覺庫(OpenCV)以及卷積循環神經網路(CRNN)僅為本較佳實施例的實施態樣,當然也可以採用其他能達成等效的工具,不以此為限。
參閱圖3及圖6,該影像辨識模組34是以大量手語樣本進行訓練與調適後產生手語模型,再搭配手語辭典,共同將所擷取的影像進行辨識。該影像轉換模組35是以大量的文字語料進行訓練與調適後產生語言模型,再搭配手語辭典,將辨識後的影像輸出成文字。
透過該外殼單元2是掛設於手語人士的胸前,以手語人士的視角對手語動作進行拍攝之後,經由影像處理的流程將手語影像轉換成文字,再經由該語音單元4進行播放,使手語人士能更為即時的與人溝通。
綜上所述,本新型手語影像辨識裝置,藉由上述設計可以達成輕易性、舒適性,能與人快速溝通,減少手語人士生活上的不便,確實能達成本新型之目的。
惟以上所述者,僅為本新型之較佳實施例而已,當不能以此限定本新型實施之範圍,即大凡依本新型申請專利範圍及新型說明內容所作之簡單的等效變化與修飾,皆仍屬本新型專利涵蓋之範圍內。
2:外殼單元
21:殼體
22:穿孔
3:影像處理單元
31:鏡頭
32:影像合併模組
33:影像擷取模組
34:影像辨識模組
35:影像轉換模組
4:語音單元
41:開關
42:音量鍵
43:揚聲器
圖1是一前視示意圖,說明本新型手語影像辨識裝置之較佳實施例;
圖2是一側視示意圖,說明該較佳實施例的拍攝範圍;
圖3是一示意圖,說明該較佳實施例中,一影像處理單元的內部組成;
圖4是一示意圖,說明本新型是懸掛於手語人士的胸前位置;
圖5是一示意圖,說明卷積循環神經網路的運作流程;及
圖6是一示意圖,說明一影像辨識模組與一影像轉換模組的運作流程。
2:外殼單元
21:殼體
3:影像處理單元
31:鏡頭
4:語音單元
41:開關
42:音量鍵
43:揚聲器
Claims (11)
- 一種手語影像辨識裝置,包含: 一外殼單元,配戴於一手語人士的胸前; 一影像處理單元,設置於該外殼單元且能由該手語人士的胸前往前拍攝該手語人士的手語影像,並將所拍攝的影像進行辨識並轉換成文字;及 一語音單元,設置於該外殼單元內且電連接於該影像處理單元,用以將轉換成文字的影像內容以語音播放。
- 如請求項1所述的手語影像辨識裝置,其中,該影像處理單元包括至少一設置於該外殼單元上的鏡頭。
- 如請求項2所述的手語影像辨識裝置,其中,該影像處理單元還包括一用以接收該鏡頭所拍攝之影像的影像合併模組。
- 如請求項3所述的手語影像辨識裝置,其中,該影像處理單元還包括一用以將合併的影像進行擷取的影像擷取模組,及一用以辨識所擷取之影像的影像辨識模組。
- 如請求項4所述的手語影像辨識裝置,其中,該影像處理單元還包括一將辨識後的影像輸出成文字的影像轉換模組,該語音單元將該影像轉換模組所輸出的文字以語音播放。
- 如請求項3所述的手語影像辨識裝置,其中,該影像合併模組是採用電腦視覺庫(OpenCV)。
- 如請求項5所述的手語影像辨識裝置,其中,該影像擷取模組、該影像辨識模組,及該影像轉換模組是採用卷積循環神經網路(CRNN)。
- 如請求項4所述的手語影像辨識裝置,其中,該影像辨識模組是以大量手語樣本進行訓練與調適後產生手語模型,再搭配一手語辭典,共同將所擷取的影像進行辨識。
- 如請求項5所述的手語影像辨識裝置,其中,該影像轉換模組是以大量的文字語料進行訓練與調適後產生語言模型,再搭配一手語辭典,將辨識後的影像輸出成文字。
- 如請求項1所述的手語影像辨識裝置,其中,該外殼單元包括一殼體,及複數開設於該殼體上的穿孔,該影像處理單元是設置於該殼體內,該語音單元所播放的語音能由所述穿孔傳出。
- 如請求項1所述的手語影像辨識裝置,其中,該語音單元具有一設置於該外殼單元上的開關、一設置於該外殼單元上且電連接於該開關的音量鍵,及一電連接於該音量鍵的揚聲器。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| TW109204167U TWM596382U (zh) | 2020-04-09 | 2020-04-09 | 手語影像辨識裝置 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| TW109204167U TWM596382U (zh) | 2020-04-09 | 2020-04-09 | 手語影像辨識裝置 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| TWM596382U true TWM596382U (zh) | 2020-06-01 |
Family
ID=72176624
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| TW109204167U TWM596382U (zh) | 2020-04-09 | 2020-04-09 | 手語影像辨識裝置 |
Country Status (1)
| Country | Link |
|---|---|
| TW (1) | TWM596382U (zh) |
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| TWI795027B (zh) * | 2020-10-13 | 2023-03-01 | 美商谷歌有限責任公司 | 使用多個裝置上之多個分類器之分佈式感測器資料處理 |
| US12057126B2 (en) | 2020-10-13 | 2024-08-06 | Google Llc | Distributed sensor data processing using multiple classifiers on multiple devices |
-
2020
- 2020-04-09 TW TW109204167U patent/TWM596382U/zh not_active IP Right Cessation
Cited By (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| TWI795027B (zh) * | 2020-10-13 | 2023-03-01 | 美商谷歌有限責任公司 | 使用多個裝置上之多個分類器之分佈式感測器資料處理 |
| US12057126B2 (en) | 2020-10-13 | 2024-08-06 | Google Llc | Distributed sensor data processing using multiple classifiers on multiple devices |
| US12505665B2 (en) | 2020-10-13 | 2025-12-23 | Google Llc | Distributed sensor data processing using multiple classifiers on multiple devices |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN105320262A (zh) | 操作虚拟世界里的电脑和手机的方法、装置以及使用其的眼镜 | |
| WO2015125375A1 (ja) | 情報処理装置、制御方法、プログラム、およびシステム | |
| US20170337034A1 (en) | Information processing device, method of information processing, and program | |
| CN109120790A (zh) | 通话控制方法、装置、存储介质及穿戴式设备 | |
| CN106127167A (zh) | 一种增强现实中目标对象的识别方法、装置及移动终端 | |
| CN210166754U (zh) | 一种虚拟现实头戴交流装置及虚拟现实头戴交流系统 | |
| CN112783330A (zh) | 电子设备的操作方法、装置和电子设备 | |
| WO2020228208A1 (zh) | 用户智能设备及其情绪图符处理方法 | |
| KR102529798B1 (ko) | 수화 번역 장치 | |
| CN120977171A (zh) | 一种颈挂式手语传译设备及其手语语义识别传译方法 | |
| CN210109744U (zh) | 一种头戴交流装置及头戴交流系统 | |
| CN209297059U (zh) | 一种辅助老年人阅读以及防走失助读眼镜 | |
| CN210606227U (zh) | 一种增强现实头戴交流装置及增强现实头戴交流系统 | |
| CN113325956A (zh) | 一种基于神经网络的眼动控制系统及实现方法 | |
| TWI848842B (zh) | 手語及口語互動溝通裝置 | |
| JP2019191339A (ja) | 電子機器、制御プログラム、制御装置および制御方法 | |
| KR20250174857A (ko) | 인공지능 수어 번역기 안경 | |
| JP7834821B2 (ja) | システム | |
| TWI839285B (zh) | 影像轉語音之視障輔助裝置 | |
| TWM653973U (zh) | 手語及口語互動溝通裝置 | |
| US20260073162A1 (en) | Device equipped with ai system for assisting individuals with mute and/or deaf disabilities to conquer their communication barriers | |
| CN210574528U (zh) | 一种手语翻译系统 | |
| CN121415465A (zh) | 唇语识别设备 | |
| JP2025048861A (ja) | システム | |
| JP2026038158A (ja) | システム |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| MM4K | Annulment or lapse of a utility model due to non-payment of fees |