KR102922998B1 - 오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템 - Google Patents
오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템Info
- Publication number
- KR102922998B1 KR102922998B1 KR1020230118920A KR20230118920A KR102922998B1 KR 102922998 B1 KR102922998 B1 KR 102922998B1 KR 1020230118920 A KR1020230118920 A KR 1020230118920A KR 20230118920 A KR20230118920 A KR 20230118920A KR 102922998 B1 KR102922998 B1 KR 102922998B1
- Authority
- KR
- South Korea
- Prior art keywords
- audio data
- energy
- sound
- collected
- edge device
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0272—Voice signal separating
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/0464—Convolutional networks [CNN, ConvNet]
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0208—Noise filtering
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/27—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the analysis technique
- G10L25/30—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the analysis technique using neural networks
-
- G—PHYSICS
- G16—INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
- G16Y—INFORMATION AND COMMUNICATION TECHNOLOGY SPECIALLY ADAPTED FOR THE INTERNET OF THINGS [IoT]
- G16Y20/00—Information sensed or collected by the things
- G16Y20/30—Information sensed or collected by the things relating to resources, e.g. consumed power
-
- H—ELECTRICITY
- H02—GENERATION; CONVERSION OR DISTRIBUTION OF ELECTRIC POWER
- H02J—ELECTRIC POWER NETWORKS; CIRCUIT ARRANGEMENTS OR SYSTEMS FOR SUPPLYING OR DISTRIBUTING ELECTRIC POWER; SYSTEMS FOR STORING ELECTRIC ENERGY
- H02J7/00—Circuit arrangements for charging or discharging batteries or for supplying loads from batteries
- H02J7/34—Parallel operation in networks using both storage and other DC sources, e.g. providing buffering
- H02J7/35—Parallel operation in networks using both storage and other DC sources, e.g. providing buffering with light sensitive cells
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Multimedia (AREA)
- Signal Processing (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Acoustics & Sound (AREA)
- Evolutionary Computation (AREA)
- Artificial Intelligence (AREA)
- Computing Systems (AREA)
- Theoretical Computer Science (AREA)
- Quality & Reliability (AREA)
- Biomedical Technology (AREA)
- Life Sciences & Earth Sciences (AREA)
- Biophysics (AREA)
- Data Mining & Analysis (AREA)
- General Health & Medical Sciences (AREA)
- Molecular Biology (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Mathematical Physics (AREA)
- Software Systems (AREA)
- Power Engineering (AREA)
- Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)
Abstract
Description
도 2는 본 발명의 실시예에 따른 오디오 데이터의 전처리 과정의 예를 나타낸 도면,
도 3은 본 발명의 실시예에 따른 엣지 디바이스의 내부 블록을 나타낸 장치도,
도 4는 본 발명의 실시예에 따른 태양에너지 수집형 IoT 디바이스의 에너지 모델링을 나타낸 도면,
도 5는 본 발명의 실시예에 따른 소리 인식 모델의 구조를 나타낸 도면,
도 6은 본 발명의 실시예에 따른 잡음 감소 모델의 구조를 나타낸 도면,
그리고, 도 7은 본 발명의 실시예에 따른 엣지 디바이스의 오디오 데이터를 전처리하는 동작을 나타낸 순서도.
210: 수집부
220: 잉여 에너지 판단부
230: 데이터 전처리부
231: 소리 인식 모듈
233: 잡음 감소 모듈
Claims (13)
- 에너지 수집형 사물 인터넷(IoT: Internet of Things) 엣지 디바이스에서의 오디오 딥 러닝을 위한 오디오 데이터 전처리 방법에 있어서,
오디오 데이터를 수집하는 단계;
상기 엣지 디바이스의 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 잉여(Surplus) 에너지가 존재하는지 여부를 판단하는 단계; 및
상기 잉여 에너지가 존재할 경우, 상기 잉여 에너지를 이용하여 상기 오디오 데이터에 대한 전처리를 수행하는 단계;를 포함하고,
상기 오디오 데이터에 대한 전처리를 수행하는 단계는,
상기 수집된 오디오 데이터가 수집 대상 소리인지 여부를 판단하는 단계; 및
상기 수집 대상 소리로 판단되면, 상기 오디오 데이터의 잡음을 제거하는 단계를 포함하고,
상기 오디오 데이터의 잡음을 제거하는 단계는,
15x15의 필터를 갖는 5개의 인코더(Encoder) 층 및 5개의 디코더(Decoder) 층으로 구성된, 경량화된 AECNN(Auto-Encode Convolution Neural Network) 기반의 잡음 감소 모델에 상기 오디오 데이터를 입력하여 잡음을 제거하는 것인, 오디오 데이터 전처리 방법.
- 제1항에 있어서,
상기 잉여 에너지가 존재하는지 여부를 판단하는 단계는,
상기 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 문턱값(Threshold) 에너지를 계산하는 단계; 및
상기 엣지 디바이스의 잔여(Residual) 에너지가 상기 계산된 문턱값 에너지보다 클 경우 상기 잉여 에너지가 존재하는 것으로 판단하는 단계를 포함하는, 오디오 데이터 전처리 방법.
- 삭제
- 제1항에 있어서,
상기 수집 대상 소리인지 여부를 판단하는 단계는,
사전 학습된 소리 인식 모델을 통해 상기 수집된 오디오 데이터에 대하여 수집 대상 소리인지 여부의 예측값을 출력하는 것이며,
상기 예측값이 미리 정해진 임계값보다 작으면, 상기 수집 대상 소리가 아닌 것으로 판단하여 해당 오디오 데이터를 제거함을 특징으로 하는, 오디오 데이터 전처리 방법.
- 제4항에 있어서,
상기 사전 학습된 소리 인식 모델은,
3x3의 필터를 갖는 4개의 합성곱(Convolution) 층과 2x2의 필터를 갖는 4 개의 최대 풀링(Max-Pooling) 층으로 구성된 경량화된 CNN(Convolution Neural Network) 기반의 모델인, 오디오 데이터 전처리 방법.
- 삭제
- 오디오 딥 러닝을 위한 오디오 데이터를 전처리하는 에너지 수집형 사물 인터넷(IoT: Internet of Things) 엣지 디바이스에 있어서,
오디오 데이터를 수집하는 수집부;
상기 엣지 디바이스의 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 잉여(Surplus) 에너지가 존재하는지 여부를 판단하는 잉여 에너지 판단부; 및
상기 잉여 에너지가 존재할 경우, 상기 잉여 에너지를 이용하여 상기 오디오 데이터에 대한 전처리를 수행하는 데이터 전처리부;를 포함하고,
상기 데이터 전처리부는 소리 인식 모듈 및 잡음 감소 모듈을 포함하며,
상기 소리 인식 모듈은, 상기 수집된 오디오 데이터가 수집 대상 소리인지 여부를 판단하고, 상기 수집 대상 소리로 판단되면,
상기 잡음 감소 모듈은, 상기 오디오 데이터의 잡음을 제거하고,
상기 잡음 감소 모듈은,
15x15의 필터를 갖는 5개의 인코더(Encoder) 층 및 5개의 디코더(Decoder) 층으로 구성된, 경량화된 AECNN(Auto-Encode Convolution Neural Network) 기반의 잡음 감소 모델에 상기 오디오 데이터를 입력하여 잡음을 제거하는, 엣지 디바이스.
- 제7항에 있어서,
상기 잉여 에너지 판단부는,
상기 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 문턱값(Threshold) 에너지를 계산하고, 상기 엣지 디바이스의 잔여(Residual) 에너지가 상기 계산된 문턱값 에너지보다 클 경우 상기 잉여 에너지가 존재하는 것으로 판단하는, 엣지 디바이스.
- 삭제
- 제7항에 있어서,
상기 소리 인식 모듈은,
사전 학습된 소리 인식 모델을 통해 상기 수집된 오디오 데이터에 대하여 수집 대상 소리인지 여부의 예측값을 출력하여 상기 수집 대상 소리인지 여부를 판단하고, 상기 예측값이 미리 정해진 임계값보다 작으면, 상기 수집 대상 소리가 아닌 것으로 판단하여 해당 오디오 데이터를 제거하는, 엣지 디바이스.
- 제10항에 있어서,
상기 사전 학습된 소리 인식 모델은,
3x3의 필터를 갖는 4개의 합성곱(Convolution) 층과 2x2의 필터를 갖는 4 개의 최대 풀링(Max-Pooling) 층으로 구성된 경량화된 CNN(Convolution Neural Network) 기반의 모델인, 엣지 디바이스.
- 삭제
- 오디오 딥 러닝을 위한 오디오 데이터 전처리 시스템에 있어서,
오디오 데이터를 수집하고, 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 잉여(Surplus) 에너지가 존재하는지 여부를 판단하고, 상기 잉여 에너지가 존재할 경우, 상기 잉여 에너지를 이용하여 상기 오디오 데이터에 대한 전처리를 수행하는 에너지 수집형 사물 인터넷(IoT: Internet of Things) 엣지 디바이스; 및
전처리된 오디오 데이터에 대하여 딥 러닝을 수행하는 엣지 서버;를 포함하고,
상기 엣지 디바이스가 상기 오디오 데이터에 대한 전처리를 수행하는 것은,
상기 수집된 오디오 데이터가 수집 대상 소리인지 여부를 판단하고, 상기 수집 대상 소리로 판단되면, 상기 오디오 데이터의 잡음을 제거하되,
15x15의 필터를 갖는 5개의 인코더(Encoder) 층 및 5개의 디코더(Decoder) 층으로 구성된, 경량화된 AECNN(Auto-Encode Convolution Neural Network) 기반의 잡음 감소 모델에 상기 오디오 데이터를 입력하여 잡음을 제거하는 것인, 오디오 데이터 전처리 시스템.
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| KR1020230118920A KR102922998B1 (ko) | 2023-09-07 | 2023-09-07 | 오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| KR1020230118920A KR102922998B1 (ko) | 2023-09-07 | 2023-09-07 | 오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| KR20250036434A KR20250036434A (ko) | 2025-03-14 |
| KR102922998B1 true KR102922998B1 (ko) | 2026-02-04 |
Family
ID=94972157
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| KR1020230118920A Active KR102922998B1 (ko) | 2023-09-07 | 2023-09-07 | 오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템 |
Country Status (1)
| Country | Link |
|---|---|
| KR (1) | KR102922998B1 (ko) |
Citations (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20100191536A1 (en) * | 2009-01-29 | 2010-07-29 | Qualcomm Incorporated | Audio coding selection based on device operating condition |
Family Cites Families (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR20210066334A (ko) | 2019-11-28 | 2021-06-07 | 중앙대학교 산학협력단 | 엣지 게이트웨이와 엣지 서버를 이용한 링크 스케줄링 방법 및 이를 위한 장치 |
-
2023
- 2023-09-07 KR KR1020230118920A patent/KR102922998B1/ko active Active
Patent Citations (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US20100191536A1 (en) * | 2009-01-29 | 2010-07-29 | Qualcomm Incorporated | Audio coding selection based on device operating condition |
Also Published As
| Publication number | Publication date |
|---|---|
| KR20250036434A (ko) | 2025-03-14 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN119808438A (zh) | 一种基于能源条件约束的资源分配动态仿真优化方法 | |
| CN119690673A (zh) | 一种基于边缘计算的ai算法流程以及服务一体机 | |
| CN120016490A (zh) | 一种电表箱智能负载管理与调配方法 | |
| CN120389386A (zh) | 基于蒙特卡洛Dropout的新能源出力预测方法及系统 | |
| CN117595488A (zh) | 一种基于负荷动态匹配的电力调度监控方法及系统 | |
| CN118780449A (zh) | 一种电力负荷预测方法 | |
| CN117931426B (zh) | 一种用于云工作负载预测的生成对抗性方法和系统 | |
| CN110830560A (zh) | 一种基于强化学习的多用户移动边缘计算迁移方法 | |
| CN117650548A (zh) | 一种基于氢储能协同的综合能源运行优化方法及系统 | |
| CN115022893B (zh) | 多任务边缘计算系统中最小化总计算时间的资源分配方法 | |
| CN114759579A (zh) | 一种基于数据驱动的电网有功优化控制系统、方法和介质 | |
| CN120341944B (zh) | 基于能源集群与储能协同虚拟电厂控制方法、系统和装置 | |
| CN119721179B (zh) | 一种用于电力负荷预测的历史数据驱动方法及系统 | |
| KR20250036434A (ko) | 오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템 | |
| CN109301820A (zh) | 一种企业电力控制方法及系统 | |
| CN102156408B (zh) | 一种动态自适应演化最大功率点跟踪控制系统及方法 | |
| CN111325368A (zh) | 一种光储式电动汽车充电站光伏功率预测方法和装置 | |
| CN120066406A (zh) | 基于三方架构的存储网络令牌桶调度算法及其优化方法 | |
| CN119987975A (zh) | 一种基于进化算法的分布式异构任务调度方法及系统 | |
| CN120033663A (zh) | 基于lstm的分布式电源供电功率预测方法、系统及设备 | |
| CN118889478A (zh) | 光伏出力动态场景生成的分布式储能优化配置方法及系统 | |
| KR102886958B1 (ko) | 에너지 수집형 엣지 지능형 사물 인터넷 환경 기반의 분산 학습 시스템, 방법 및 기록 매체 | |
| CN116528160A (zh) | 一种基于能量感知的mwsn轻量级协同定位与导航方法 | |
| Rueb et al. | 6G and the Sustainability Aspect: Exploiting Surplus Renewable Energy for Distributed Learning Clusters in 6G Networks | |
| CN113568865A (zh) | 面向自供能系统的存算一体架构及软件优化方法 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PA0109 | Patent application |
St.27 status event code: A-0-1-A10-A12-nap-PA0109 |
|
| PA0201 | Request for examination |
St.27 status event code: A-1-2-D10-D11-exm-PA0201 |
|
| PG1501 | Laying open of application |
St.27 status event code: A-1-1-Q10-Q12-nap-PG1501 |
|
| E902 | Notification of reason for refusal | ||
| PE0902 | Notice of grounds for rejection |
St.27 status event code: A-1-2-D10-D21-exm-PE0902 |
|
| E13 | Pre-grant limitation requested |
Free format text: ST27 STATUS EVENT CODE: A-2-3-E10-E13-LIM-X000 (AS PROVIDED BY THE NATIONAL OFFICE) |
|
| E13-X000 | Pre-grant limitation requested |
St.27 status event code: A-2-3-E10-E13-lim-X000 |
|
| P11 | Amendment of application requested |
Free format text: ST27 STATUS EVENT CODE: A-2-2-P10-P11-NAP-X000 (AS PROVIDED BY THE NATIONAL OFFICE) |
|
| P11-X000 | Amendment of application requested |
St.27 status event code: A-2-2-P10-P11-nap-X000 |
|
| P13 | Application amended |
Free format text: ST27 STATUS EVENT CODE: A-2-2-P10-P13-NAP-X000 (AS PROVIDED BY THE NATIONAL OFFICE) |
|
| P13-X000 | Application amended |
St.27 status event code: A-2-2-P10-P13-nap-X000 |
|
| D22 | Grant of ip right intended |
Free format text: ST27 STATUS EVENT CODE: A-1-2-D10-D22-EXM-PE0701 (AS PROVIDED BY THE NATIONAL OFFICE) |
|
| PE0701 | Decision of registration |
St.27 status event code: A-1-2-D10-D22-exm-PE0701 |
|
| PR1002 | Payment of registration fee |
St.27 status event code: A-2-2-U10-U11-oth-PR1002 Fee payment year number: 1 |
|
| U11 | Full renewal or maintenance fee paid |
Free format text: ST27 STATUS EVENT CODE: A-2-2-U10-U11-OTH-PR1002 (AS PROVIDED BY THE NATIONAL OFFICE) Year of fee payment: 1 |
|
| PG1601 | Publication of registration |
St.27 status event code: A-4-4-Q10-Q13-nap-PG1601 |
|
| Q13 | Ip right document published |
Free format text: ST27 STATUS EVENT CODE: A-4-4-Q10-Q13-NAP-PG1601 (AS PROVIDED BY THE NATIONAL OFFICE) |