KR102922998B1 - 오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템 - Google Patents

오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템

Info

Publication number
KR102922998B1
KR102922998B1 KR1020230118920A KR20230118920A KR102922998B1 KR 102922998 B1 KR102922998 B1 KR 102922998B1 KR 1020230118920 A KR1020230118920 A KR 1020230118920A KR 20230118920 A KR20230118920 A KR 20230118920A KR 102922998 B1 KR102922998 B1 KR 102922998B1
Authority
KR
South Korea
Prior art keywords
audio data
energy
sound
collected
edge device
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
KR1020230118920A
Other languages
English (en)
Other versions
KR20250036434A (ko
Inventor
노동건
유연태
이찬서
Original Assignee
숭실대학교 산학협력단
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by 숭실대학교 산학협력단 filed Critical 숭실대학교 산학협력단
Priority to KR1020230118920A priority Critical patent/KR102922998B1/ko
Publication of KR20250036434A publication Critical patent/KR20250036434A/ko
Application granted granted Critical
Publication of KR102922998B1 publication Critical patent/KR102922998B1/ko
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0272Voice signal separating
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/0464Convolutional networks [CNN, ConvNet]
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0208Noise filtering
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/27Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the analysis technique
    • G10L25/30Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the analysis technique using neural networks
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16YINFORMATION AND COMMUNICATION TECHNOLOGY SPECIALLY ADAPTED FOR THE INTERNET OF THINGS [IoT]
    • G16Y20/00Information sensed or collected by the things
    • G16Y20/30Information sensed or collected by the things relating to resources, e.g. consumed power
    • HELECTRICITY
    • H02GENERATION; CONVERSION OR DISTRIBUTION OF ELECTRIC POWER
    • H02JELECTRIC POWER NETWORKS; CIRCUIT ARRANGEMENTS OR SYSTEMS FOR SUPPLYING OR DISTRIBUTING ELECTRIC POWER; SYSTEMS FOR STORING ELECTRIC ENERGY
    • H02J7/00Circuit arrangements for charging or discharging batteries or for supplying loads from batteries
    • H02J7/34Parallel operation in networks using both storage and other DC sources, e.g. providing buffering
    • H02J7/35Parallel operation in networks using both storage and other DC sources, e.g. providing buffering with light sensitive cells

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Multimedia (AREA)
  • Signal Processing (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Acoustics & Sound (AREA)
  • Evolutionary Computation (AREA)
  • Artificial Intelligence (AREA)
  • Computing Systems (AREA)
  • Theoretical Computer Science (AREA)
  • Quality & Reliability (AREA)
  • Biomedical Technology (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Biophysics (AREA)
  • Data Mining & Analysis (AREA)
  • General Health & Medical Sciences (AREA)
  • Molecular Biology (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Mathematical Physics (AREA)
  • Software Systems (AREA)
  • Power Engineering (AREA)
  • Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)

Abstract

본 발명은 에너지 수집형 사물 인터넷(IoT: Internet of Things) 엣지 디바이스에서의 오디오 딥 러닝을 위한 오디오 데이터 전처리 방법에 대한 것으로, 오디오 데이터를 수집하는 단계; 상기 엣지 디바이스의 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 잉여(Surplus) 에너지가 존재하는지 여부를 판단하는 단계; 및 상기 잉여 에너지가 존재할 경우, 상기 잉여 에너지를 이용하여 상기 오디오 데이터에 대한 전처리를 수행하는 단계;를 포함한다.

Description

오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템{METHOD, APPARATUS AND SYSTEM FOR PREPROCESSING AUDIO DATA FOR AUDIO DEEP LEARNING}
본 발명은 오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템에 관한 것이다.
사물 인터넷(IoT: Internet of Things) 장치는 일반적으로 배터리를 사용하기 때문에 배터리 교체 등의 유지관리가 어려운 환경이거나 장시간 동작해야 하는 경우 활용에 제약이 따른다. 이러한 문제를 해결하기 위해 최근에는 노드 주변의 자연 환경에서 에너지를 수집하여 노드를 운용하는 에너지 수집형 IoT에 대한 연구가 진행되고 있다. 그 중 태양에너지는 예측 가능성과 고밀도(15mW/cm2) 등의 장점으로 인해 가장 활발히 연구되고 있다.
태양 에너지 수집형 IoT 장치는 에너지를 주기적으로 수집하여 시스템에 공급할 수 있으므로 배너리의 제한적 에너지 문제를 근본적으로 해결할 수 있으나, 계절, 시간, 날씨 등에 따른 에너지 수집량의 변화로 인하여 매우 신중한 에너지 스케줄링이 필요하다.
일반적으로 태양 에너지 수집형 IoT 장치들은 기기가 소모하는 평균 에너지 양을 제공할 수 있는 에너지 수집 서브시스템, 일례로 태양광 패널, 재충전 배터리, AC(Alternating Current)-DC(Direct Current) 컨버터 등을 장착하고 있다. 따라서 맑은 날이 지속되거나 수집할 데이터가 많이 발생하지 않는 경우에는, 노드의 기본동작에 필요한 에너지를 초과하는 여분의 에너지가 존재할 수 있다. 이 경우 태양 에너지는 다음날 또 다시 충전될 것이고, 에너지를 저장할 수 있는 축전기의 용량은 제한되어 있으므로, 배터리 기반 IoT 장치처럼 에너지를 최대한 아껴서 사용하기 보다는 에너지 사용률을 최대화하도록 시스템을 운영하는 것이 유리하다.
한편, 엣지 컴퓨팅은 클라우드 컴퓨팅과 대비되는 개념으로, 데이터 소스의 근거리, 즉 네트워크 구조 관점에서는 네트워크의 가장자리(엣지)에서 데이터를 실시간으로 처리하는 기술을 의미한다. 엣지 컴퓨팅 환경은 일반적으로 IoT 장치들을 일컫는 엣지 디바이스들과 엣지 서버라 불리는 IoT 서버(또는 게이트웨이)로 구성된다. 클라우드 환경에서 컴퓨팅을 수행할 때의 데이터 기밀성, 프라이버시, 응답속도, 비용 등의 문제를 해결하고자 엣지 컴퓨팅 기술이 등장하였는데, 특별히 머신 러닝(Machine learning)을 클라우드 컴퓨팅 환경이 아닌 엣지 컴퓨팅 환경에서 실시간으로 수행하고, 추후 클라우드의 도움으로 학습 결과를 강화하는 기술을 엣지 인공지능(AI: Artificial Intelligence)이라 정의한다.
일반적으로 엣지 AI에서 엣지 디바이스들은 데이터를 수집하고 이를 엣지 서버로 전송하는 역할을 수행하는데, 보통 무선 IoT 센서들이 이에 해당한다. 그리고 엣지 서버에서는 엣지 디바이스들로부터 수신된 데이터의 전처리(Pre-processing) 과정과 머신 러닝 과정을 차례로 수행한다.
그러나 이렇게 모든 과정들을 엣지 서버에서 수행할 경우 엣지 서버의 네트워크 트래픽 부하 및 컴퓨팅 부하가 발생하여, 실시간으로 머신 러닝을 수행하는데 어려움이 발생한다. 이러한 문제점들을 해결하기 위해 데이터 전처리 과정을 엣지 디바이스에서 수행하도록 할 수도 있으나, 이 경우 엣지 디바이스의 에너지가 고갈되어 정전시간이 증가하는 또다른 문제가 발생할 수 있다.
따라서 태양에너지 수집형 IoT 장치의 에너지 특성을 이용하여 엣지 디바이스들의 에너지 부족 문제를 최소화하면서 서버 집중형 엣지 컴퓨팅 환경의 문제를 완화시킬 수 있는 방안에 대한 연구가 필요하다.
한국공개특허공보 제10-2021-0066334호
본 발명은 상기와 같은 문제를 해결하기 위해 안출된 것으로, 본 발명의 목적은 오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템을 제공하는 것이다.
상기 목적을 달성하기 위한 본 발명의 일 실시예에 따른 에너지 수집형 사물 인터넷(IoT) 엣지 디바이스에서의 오디오 딥 러닝을 위한 오디오 데이터 전처리 방법은, 오디오 데이터를 수집하는 단계; 상기 엣지 디바이스의 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 잉여(Surplus) 에너지가 존재하는지 여부를 판단하는 단계; 및 상기 잉여 에너지가 존재할 경우, 상기 잉여 에너지를 이용하여 상기 오디오 데이터에 대한 전처리를 수행하는 단계;를 포함한다.
상기 목적을 달성하기 위한 본 발명의 일 실시예에 따른 오디오 딥 러닝을 위한 오디오 데이터를 전처리하는 에너지 수집형 사물 인터넷(IoT) 엣지 디바이스는, 오디오 데이터를 수집하는 수집부; 상기 엣지 디바이스의 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 잉여(Surplus) 에너지가 존재하는지 여부를 판단하는 잉여 에너지 판단부; 및 상기 잉여 에너지가 존재할 경우, 상기 잉여 에너지를 이용하여 상기 오디오 데이터에 대한 전처리를 수행하는 데이터 전처리부;를 포함한다.
상기 목적을 달성하기 위한 본 발명의 일 실시예에 따른 오디오 딥 러닝을 위한 오디오 데이터 전처리 시스템은, 오디오 데이터를 수집하고, 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 잉여(Surplus) 에너지가 존재하는지 여부를 판단하고, 상기 잉여 에너지가 존재할 경우, 상기 잉여 에너지를 이용하여 상기 오디오 데이터에 대한 전처리를 수행하는 에너지 수집형 사물 인터넷(IoT: Internet of Things) 엣지 디바이스; 및 전처리된 오디오 데이터에 대하여 딥 러닝을 수행하는 엣지 서버;를 포함한다.
상술한 본 발명의 일측면에 따르면, 엣지 디바이스가 잉여 에너지가 존재할 경우에만 오디오 딥러닝을 위한 오디오 데이터를 전처리하여 서버로 전송함으로써, 엣지 디바이스의 정전시간을 최소화할 수 있으며, 엣지 서버의 CPU 점유율이 감소하여 엣지 서버에서 다른 작업에 자원 할당이 가능한 이점이 있다. 뿐만 아니라 엣지 디바이스에서 엣지 서버로 전송하는 데이터 크기가 감소하여 네트워크 사용향을 개선할 수 있다.
도 1은 엣지 컴퓨팅 환경의 구조를 나타낸 도면,
도 2는 본 발명의 실시예에 따른 오디오 데이터의 전처리 과정의 예를 나타낸 도면,
도 3은 본 발명의 실시예에 따른 엣지 디바이스의 내부 블록을 나타낸 장치도,
도 4는 본 발명의 실시예에 따른 태양에너지 수집형 IoT 디바이스의 에너지 모델링을 나타낸 도면,
도 5는 본 발명의 실시예에 따른 소리 인식 모델의 구조를 나타낸 도면,
도 6은 본 발명의 실시예에 따른 잡음 감소 모델의 구조를 나타낸 도면,
그리고, 도 7은 본 발명의 실시예에 따른 엣지 디바이스의 오디오 데이터를 전처리하는 동작을 나타낸 순서도.
후술하는 본 발명에 대한 상세한 설명은, 본 발명이 실시될 수 있는 특정 실시예를 예시로서 도시하는 첨부 도면을 참조한다. 이들 실시예는 당업자가 본 발명을 실시할 수 있기에 충분하도록 상세히 설명된다. 본 발명의 다양한 실시예는 서로 다르지만 상호 배타적일 필요는 없음이 이해되어야 한다. 예를 들어, 여기에 기재되어 있는 특정 형상, 구조 및 특성은 일 실시예와 관련하여 본 발명의 정신 및 범위를 벗어나지 않으면서 다른 실시예로 구현될 수 있다. 또한, 각각의 개시된 실시예 내의 개별 구성요소의 위치 또는 배치는 본 발명의 정신 및 범위를 벗어나지 않으면서 변경될 수 있음이 이해되어야 한다. 따라서, 후술하는 상세한 설명은 한정적인 의미로서 취하려는 것이 아니며, 본 발명의 범위는, 적절하게 설명된다면, 그 청구항들이 주장하는 것과 균등한 모든 범위와 더불어 첨부된 청구항에 의해서만 한정된다. 도면에서 유사한 참조부호는 여러 측면에 걸쳐서 동일하거나 유사한 기능을 지칭한다.
본 발명에 따른 구성요소들은 물리적인 구분이 아니라 기능적인 구분에 의해서 정의되는 구성요소들로써 각각이 수행하는 기능들에 의해서 정의될 수 있다. 각각의 구성요소들은 하드웨어 또는 각각의 기능을 수행하는 프로그램 코드 및 프로세싱 유닛으로 구현될 수 있을 것이며, 두 개 이상의 구성요소의 기능이 하나의 구성요소에 포함되어 구현될 수도 있을 것이다. 따라서 이하의 실시예에서 구성요소에 부여되는 명칭은 각각의 구성요소를 물리적으로 구분하기 위한 것이 아니라 각각의 구성요소가 수행되는 대표적인 기능을 암시하기 위해서 부여된 것이며, 구성요소의 명칭에 의해서 본 발명의 기술적 사상이 한정되지 않는 것임에 유의하여야 한다.
이하에서는 도면들을 참조하여 본 발명의 바람직한 실시예들을 보다 상세하게 설명하기로 한다.
도 1은 엣지 컴퓨팅 환경의 구조를 나타낸 도면이다.
엣지 컴퓨팅 환경은 적어도 하나의 엣지 디바이스(200-1, 200-2, 200-3)와 적어도 하나의 엣지 서버(100)로 구성된다.
엣지 디바이스(200-1, 200-2, 200-3) 각각은 원시 데이터(raw data)를 수집하여 엣지 서버(100)로 전송하고, 엣지 서버(100)는 데이터를 정형화하는 전처리 과정과 머신 러닝 또는 딥 러닝(Deep Learning) 과정을 수행한다.
머신 러닝 또는 딥 러닝의 응용을 위해 다양한 종류의 오디오 데이터가 활용될 수 있으며, 오디오 데이터의 잡음(noise)은 학습의 정확도를 저해할 수 있으므로 데이터 전처리를 통해 오디오 데이터가 수집 대상 데이터인지 판단하여 잡음을 제거하는 것이 중요하다.
이러한 데이터 전처리는 주로 엣지 서버(100)에서 수행되지만, 데이터 전처리 과정을 엣지 서버(100)에서 모두 수행할 경우에는 엣지 서버(100)에 네트워크 트래픽 부하 및 컴퓨팅 부하가 발생하여 엣지 서버(100)에서 수행해야 하는 다른 작업을 수행하는데 어려움이 발생될 수 있다.
따라서 후술할 본 발명의 실시예에서는 잔여 에너지가 충분한 엣지 디바이스(200-1, 200-2, 200-3)가 데이터 전처리를 수행하는 방안을 제안한다.
도 2는 본 발명의 실시예에 따른 오디오 데이터 전처리 과정의 예를 나타낸 도면이다.
엣지 디바이스는 소리와 잡음으로 구성된 오디오 데이터를 수집하여 상기 오디오 데이터에 대한 전처리를 수행하고, 전처리된 데이터를 엣지 서버로 전송한다. 엣지 서버는 전처리된 오디오 데이터를 통해 오디오 딥 러닝을 수행한다.
이와 같이 엣지 디바이스가 전처리 동작을 수행함으로써 네트워크 사용량을 감소시킬 수 있으며, 엣지 서버의 CPU(Central Processing Unit) 사용량 및 전력 사용량의 감소를 통해 컴퓨팅 오버헤드 또한 감소시킬 수 있다.
이하에서는 도 3을 통해 엣지 디바이스의 오디오 데이터에 대한 전처리 동작을 보다 상세히 설명하도록 한다.
도 3은 본 발명의 실시예에 따른 엣지 디바이스의 내부 블록을 나타낸 장치도이고, 도 4는 본 발명의 실시예에 따른 태양에너지 수집형 IoT 디바이스의 에너지 모델링을 나타낸 도면이다.
도시된 엣지 디바이스(200)는 수집부(210), 잉여 에너지 판단부(220) 및 데이터 전처리부(230)를 포함하고, 상기 데이터 전처리부(230)는 소리 인식 모듈(231) 및 잡음 감소 모듈(233)을 포함한다. 여기서 상기 엣지 디바이스(200)는 에너지 수집형 IoT 디바이스를 의미하며, 여기서는 태양 에너지를 수집하는 IoT 디바이스라 가정한다.
수집부(210)는 오디오 데이터를 수집하고, 잉여 에너지 판단부(230)는 엣지 디바이스(200)의 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 잉여(Surplus) 에너지가 존재하는지 여부를 판단한다.
보다 상세하게, 잉여 에너지 판단부(220)는 상기 엣지 디바이스(200)의 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 문턱값(Threshold) 에너지(405)를 계산한다. 여기서 문턱값 에너지라 함은 엣지 디바이스(200)가 정전(blackout)되지 않고 동작하기 위하여 필요한 에너지를 의미하며, 상기 문턱값 에너지(Ethreshold)(405)는 하기 수학식 1을 통해 계산될 수 있다.
수학식 1에서 Psys는 엣지 디바이스(200)의 평균 에너지 소비율을 나타내고, Psolar는 평균 에너지 수집률을 나타내고, C는 배터리 용량(401)을 나타낸다.
도 4에 도시된 재충전 가능한 배터리에서 도면부호 403이 엣지 디바이스(200)의 잔여(Residual) 에너지를 나타낸다고 가정할 때, 잉여 에너지 판단부(230)는 잔여 에너지(403)와 문턱값 에너지(405)를 비교하여 상기 엣지 디바이스(200)에 잉여(Surplus) 에너지(407)가 존재하는지 여부를 판단한다. 즉 잉여 에너지 판단부(230)는 잔여 에너지(403)가 문턱값 에너지(405)보다 클 경우 상기 잉여 에너지(407)가 존재하는 것으로 판단한다. 이때 상기 잉여 에너지(ΔE)는 하기 수학식 2를 통해 계산될 수 있다.
수학식 2에서 Eresidual은 엣지 디바이스(200)의 잔여 에너지(403)를 나타내고, Ethreshold는 문턱값 에너지(405)를 나타낸다.
이렇게 잉여 에너지 판단부(230)가 잉여 에너지(407)가 존재하는 것으로 판단할 경우, 데이터 전처리부(230)는 잉여 에너지(407)를 이용하여 수집부(210)를 통해 수집된 오디오 데이터에 대한 전처리를 수행한다.
한편, 잉여 에너지 판단부(230)는 잔여 에너지(403)가 문턱값 에너지(405)보다 작거나 같을 경우 상기 잉여 에너지(407)가 존재하지 않는 것으로 판단하고, 데이터 전처리부(230)는 수집부(210)를 통해 수집된 오디오 데이터를 별도의 전처리 과정 없이 엣지 서버로 전송한다. 이 경우 오디오 데이터에 대한 전처리 동작은 엣지 서버에서 수행된다.
이하에서는 도 5 및 도 6을 통해 소리 인식 모듈(231)에서 적용되는 소리 인식 모델과 잡음 감소 모듈(233)에서 적용되는 잡음 감소 모델의 구조를 설명하도록 한다.
도 5는 본 발명의 실시예에 따른 소리 인식 모델의 구조를 나타낸 도면이다.
도시된 소리 인식 모델은 CNN(convolution Neural Network) 구조를 경량화한 딥러닝 모델이며, 3x3의 필터를 갖는 4개의 합성곱(convolution) 층과 2x2의 필터를 갖는 4개의 최대 풀링 층(Max-Pooling Layer)으로 구성된다. 또한 활성화 함수는 ReLU(Rectified Linear Unit)를 사용하였으며, 오디오 데이터를 멜-스펙토그램으로 변환하여 입력으로 사용한다.
소리 인식 모듈(231)은 사전 학습된 소리 인식 모델을 통해 수집된 오디오 데이터가 수집 대상 소리인지 여부를 판단하고, 상기 수집 대상 소리로 판단되면 잡음 감소 모듈(233)로 전달한다. 즉 소리 인식 모듈(231)은 수집된 오디오 데이터에 대하여 수집 대상 소리인지 여부의 예측값을 출력하고, 상기 예측값이 미리 정해진 임계값보다 크거나 같으면 상기 수집 대상 소리인 것으로 판단하여 해당 오디오 데이터를 잡음 감소 모듈(233)로 전달하고, 상기 예측값이 미리 정해진 임계값보다 작으면 상기 수집 대상 소리가 아닌 것으로 판단하여 해당 오디오 데이터를 제거한다. 여기서 상기 예측값은 소리 인식 모델의 완전 연결(FC: Fully Connected) 층과 소프트 맥스(softmax) 함수를 이용하여 출력된다.
도 6은 본 발명의 실시예에 따른 잡음 감소 모델의 구조를 나타낸 도면이다.
도시된 잡음 감소 모델은 AECNN(Auto-Encode Convolution Neural Network) CNN(convolution Neural Network) 구조를 경량화한 딥러닝 모델이며, 15x15의 필터를 갖는 5개의 인코더(Encoder) 층 및 5개의 디코더(Decoder) 층으로 구성된다. 또한 활성화 함수는 PReLU(Parametric Rectified Linear Unit)를 사용하였으며, 지연시간은 8ms로 설정되고 256 프레임의 입출력 데이터 크기를 사용한다. 또한 인코더 압축을 통해 하위 수준의 세부 정보 손실을 방지하기 위해 각 인코더 층을 해당 디코더 층에 연결하는 잔차 연결을 사용한다.
잡음 감소 모듈(233)은 사전 학습된 잡음 감소 모델을 통해 소리 인식 모듈(231)로부터 수신되는 오디오 데이터의 잡음을 제거하고, 잡음이 제거된 오디오 데이터를 엣지 서버로 출력한다.
도 7은 본 발명의 실시예에 따른 엣지 디바이스의 오디오 데이터를 전처리하는 동작을 나타낸 순서도이다.
엣지 디바이스는 오디오 데이터를 수집하고,(S702) 상기 엣지 디바이스의 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 엣지 디바이스가 정전되지 않고 동작하기 위하여 필요한 에너지인 문턱 에너지를 계산한다.(S704)
엣지 디바이스는 잔여 에너지가 상기 계산된 문턱값 에너지를 초과하는지 확인하여 잉여 에너지의 존재 여부를 판단한다.(S706)
S706 확인 결과 상기 잔여 에너지가 상기 문턱값 에너지를 초과할 경우, 엣지 디바이스는 잉여 에너지가 존재하는 것으로 판단하여 S708로 진행한다. S708에서 엣지 디바이스는 S702에서 수집된 오디오 데이터에 대한 전처리를 수행하고, 전처리된 오디오 데이터를 엣지 서버로 전송한다.(S710)
한편, S706 확인 결과 상기 잔여 에너지가 상기 문턱값 에너지를 초과하지 않을 경우, 엣지 디바이스는 잉여 에너지가 존재하지 않는 것으로 판단하여 S710로 진행한다. 이 경우 엣지 디바이스는 S702에서 수집된 오디오 데이터에 대한 전처리 과정을 생략하고 상기 수집된 오디오 데이터를 엣지 서버로 전송한다.(S710)
위와 같은 본 발명의 오디오 딥 러닝을 위한 오디오 데이터를 전처리하는 방법은 다양한 컴퓨터 구성요소를 통하여 수행될 수 있는 프로그램 명령어의 형태로 구현되어 컴퓨터 판독 가능한 기록 매체에 기록될 수 있다. 상기 컴퓨터 판독 가능한 기록 매체는 프로그램 명령어, 데이터 파일, 데이터 구조 등을 단독으로 또는 조합하여 포함할 수 있다.
상기 컴퓨터 판독 가능한 기록 매체에 기록되는 프로그램 명령어는 본 발명을 위하여 특별히 설계되고 구성된 것들이거나 컴퓨터 소프트웨어 분야의 당업자에게 공지되어 사용 가능한 것일 수도 있다.
컴퓨터 판독 가능한 기록 매체의 예에는, 하드 디스크, 플로피 디스크 및 자기 테이프와 같은 자기 매체, CD-ROM, DVD 와 같은 광기록 매체, 플롭티컬 디스크(floptical disk)와 같은 자기-광 매체(magneto-optical media), 및 ROM, RAM, 플래시 메모리 등과 같은 프로그램 명령어를 저장하고 수행하도록 특별히 구성된 하드웨어 장치가 포함된다.
프로그램 명령어의 예에는, 컴파일러에 의해 만들어지는 것과 같은 기계어 코드뿐만 아니라 인터프리터 등을 사용해서 컴퓨터에 의해서 실행될 수 있는 고급 언어 코드도 포함된다. 상기 하드웨어 장치는 본 발명에 따른 처리를 수행하기 위해 하나 이상의 소프트웨어 모듈로서 작동하도록 구성될 수 있으며, 그 역도 마찬가지이다.
이상에서는 본 발명의 다양한 실시예에 대하여 도시하고 설명하였지만, 본 발명은 상술한 특정의 실시예에 한정되지 아니하며, 청구범위에서 청구하는 본 발명의 요지를 벗어남이 없이 당해 발명이 속하는 기술분야에서 통상의 지식을 가진 자에 의해 다양한 변형실시가 가능한 것은 물론이고, 이러한 변형실시들은 본 발명의 기술적 사상이나 전망으로부터 개별적으로 이해되어져서는 안될 것이다.
200: 엣지 디바이스
210: 수집부
220: 잉여 에너지 판단부
230: 데이터 전처리부
231: 소리 인식 모듈
233: 잡음 감소 모듈

Claims (13)

  1. 에너지 수집형 사물 인터넷(IoT: Internet of Things) 엣지 디바이스에서의 오디오 딥 러닝을 위한 오디오 데이터 전처리 방법에 있어서,
    오디오 데이터를 수집하는 단계;
    상기 엣지 디바이스의 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 잉여(Surplus) 에너지가 존재하는지 여부를 판단하는 단계; 및
    상기 잉여 에너지가 존재할 경우, 상기 잉여 에너지를 이용하여 상기 오디오 데이터에 대한 전처리를 수행하는 단계;를 포함하고,
    상기 오디오 데이터에 대한 전처리를 수행하는 단계는,
    상기 수집된 오디오 데이터가 수집 대상 소리인지 여부를 판단하는 단계; 및
    상기 수집 대상 소리로 판단되면, 상기 오디오 데이터의 잡음을 제거하는 단계를 포함하고,
    상기 오디오 데이터의 잡음을 제거하는 단계는,
    15x15의 필터를 갖는 5개의 인코더(Encoder) 층 및 5개의 디코더(Decoder) 층으로 구성된, 경량화된 AECNN(Auto-Encode Convolution Neural Network) 기반의 잡음 감소 모델에 상기 오디오 데이터를 입력하여 잡음을 제거하는 것인, 오디오 데이터 전처리 방법.
  2. 제1항에 있어서,
    상기 잉여 에너지가 존재하는지 여부를 판단하는 단계는,
    상기 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 문턱값(Threshold) 에너지를 계산하는 단계; 및
    상기 엣지 디바이스의 잔여(Residual) 에너지가 상기 계산된 문턱값 에너지보다 클 경우 상기 잉여 에너지가 존재하는 것으로 판단하는 단계를 포함하는, 오디오 데이터 전처리 방법.
  3. 삭제
  4. 제1항에 있어서,
    상기 수집 대상 소리인지 여부를 판단하는 단계는,
    사전 학습된 소리 인식 모델을 통해 상기 수집된 오디오 데이터에 대하여 수집 대상 소리인지 여부의 예측값을 출력하는 것이며,
    상기 예측값이 미리 정해진 임계값보다 작으면, 상기 수집 대상 소리가 아닌 것으로 판단하여 해당 오디오 데이터를 제거함을 특징으로 하는, 오디오 데이터 전처리 방법.
  5. 제4항에 있어서,
    상기 사전 학습된 소리 인식 모델은,
    3x3의 필터를 갖는 4개의 합성곱(Convolution) 층과 2x2의 필터를 갖는 4 개의 최대 풀링(Max-Pooling) 층으로 구성된 경량화된 CNN(Convolution Neural Network) 기반의 모델인, 오디오 데이터 전처리 방법.
  6. 삭제
  7. 오디오 딥 러닝을 위한 오디오 데이터를 전처리하는 에너지 수집형 사물 인터넷(IoT: Internet of Things) 엣지 디바이스에 있어서,
    오디오 데이터를 수집하는 수집부;
    상기 엣지 디바이스의 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 잉여(Surplus) 에너지가 존재하는지 여부를 판단하는 잉여 에너지 판단부; 및
    상기 잉여 에너지가 존재할 경우, 상기 잉여 에너지를 이용하여 상기 오디오 데이터에 대한 전처리를 수행하는 데이터 전처리부;를 포함하고,
    상기 데이터 전처리부는 소리 인식 모듈 및 잡음 감소 모듈을 포함하며,
    상기 소리 인식 모듈은, 상기 수집된 오디오 데이터가 수집 대상 소리인지 여부를 판단하고, 상기 수집 대상 소리로 판단되면,
    상기 잡음 감소 모듈은, 상기 오디오 데이터의 잡음을 제거하고,
    상기 잡음 감소 모듈은,
    15x15의 필터를 갖는 5개의 인코더(Encoder) 층 및 5개의 디코더(Decoder) 층으로 구성된, 경량화된 AECNN(Auto-Encode Convolution Neural Network) 기반의 잡음 감소 모델에 상기 오디오 데이터를 입력하여 잡음을 제거하는, 엣지 디바이스.
  8. 제7항에 있어서,
    상기 잉여 에너지 판단부는,
    상기 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 문턱값(Threshold) 에너지를 계산하고, 상기 엣지 디바이스의 잔여(Residual) 에너지가 상기 계산된 문턱값 에너지보다 클 경우 상기 잉여 에너지가 존재하는 것으로 판단하는, 엣지 디바이스.
  9. 삭제
  10. 제7항에 있어서,
    상기 소리 인식 모듈은,
    사전 학습된 소리 인식 모델을 통해 상기 수집된 오디오 데이터에 대하여 수집 대상 소리인지 여부의 예측값을 출력하여 상기 수집 대상 소리인지 여부를 판단하고, 상기 예측값이 미리 정해진 임계값보다 작으면, 상기 수집 대상 소리가 아닌 것으로 판단하여 해당 오디오 데이터를 제거하는, 엣지 디바이스.
  11. 제10항에 있어서,
    상기 사전 학습된 소리 인식 모델은,
    3x3의 필터를 갖는 4개의 합성곱(Convolution) 층과 2x2의 필터를 갖는 4 개의 최대 풀링(Max-Pooling) 층으로 구성된 경량화된 CNN(Convolution Neural Network) 기반의 모델인, 엣지 디바이스.
  12. 삭제
  13. 오디오 딥 러닝을 위한 오디오 데이터 전처리 시스템에 있어서,
    오디오 데이터를 수집하고, 평균 에너지 수집률, 평균 에너지 소비율 및 배터리 용량을 기반으로 잉여(Surplus) 에너지가 존재하는지 여부를 판단하고, 상기 잉여 에너지가 존재할 경우, 상기 잉여 에너지를 이용하여 상기 오디오 데이터에 대한 전처리를 수행하는 에너지 수집형 사물 인터넷(IoT: Internet of Things) 엣지 디바이스; 및
    전처리된 오디오 데이터에 대하여 딥 러닝을 수행하는 엣지 서버;를 포함하고,
    상기 엣지 디바이스가 상기 오디오 데이터에 대한 전처리를 수행하는 것은,
    상기 수집된 오디오 데이터가 수집 대상 소리인지 여부를 판단하고, 상기 수집 대상 소리로 판단되면, 상기 오디오 데이터의 잡음을 제거하되,
    15x15의 필터를 갖는 5개의 인코더(Encoder) 층 및 5개의 디코더(Decoder) 층으로 구성된, 경량화된 AECNN(Auto-Encode Convolution Neural Network) 기반의 잡음 감소 모델에 상기 오디오 데이터를 입력하여 잡음을 제거하는 것인, 오디오 데이터 전처리 시스템.
KR1020230118920A 2023-09-07 2023-09-07 오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템 Active KR102922998B1 (ko)

Priority Applications (1)

Application Number Priority Date Filing Date Title
KR1020230118920A KR102922998B1 (ko) 2023-09-07 2023-09-07 오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
KR1020230118920A KR102922998B1 (ko) 2023-09-07 2023-09-07 오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템

Publications (2)

Publication Number Publication Date
KR20250036434A KR20250036434A (ko) 2025-03-14
KR102922998B1 true KR102922998B1 (ko) 2026-02-04

Family

ID=94972157

Family Applications (1)

Application Number Title Priority Date Filing Date
KR1020230118920A Active KR102922998B1 (ko) 2023-09-07 2023-09-07 오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템

Country Status (1)

Country Link
KR (1) KR102922998B1 (ko)

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20100191536A1 (en) * 2009-01-29 2010-07-29 Qualcomm Incorporated Audio coding selection based on device operating condition

Family Cites Families (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR20210066334A (ko) 2019-11-28 2021-06-07 중앙대학교 산학협력단 엣지 게이트웨이와 엣지 서버를 이용한 링크 스케줄링 방법 및 이를 위한 장치

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20100191536A1 (en) * 2009-01-29 2010-07-29 Qualcomm Incorporated Audio coding selection based on device operating condition

Also Published As

Publication number Publication date
KR20250036434A (ko) 2025-03-14

Similar Documents

Publication Publication Date Title
CN119808438A (zh) 一种基于能源条件约束的资源分配动态仿真优化方法
CN119690673A (zh) 一种基于边缘计算的ai算法流程以及服务一体机
CN120016490A (zh) 一种电表箱智能负载管理与调配方法
CN120389386A (zh) 基于蒙特卡洛Dropout的新能源出力预测方法及系统
CN117595488A (zh) 一种基于负荷动态匹配的电力调度监控方法及系统
CN118780449A (zh) 一种电力负荷预测方法
CN117931426B (zh) 一种用于云工作负载预测的生成对抗性方法和系统
CN110830560A (zh) 一种基于强化学习的多用户移动边缘计算迁移方法
CN117650548A (zh) 一种基于氢储能协同的综合能源运行优化方法及系统
CN115022893B (zh) 多任务边缘计算系统中最小化总计算时间的资源分配方法
CN114759579A (zh) 一种基于数据驱动的电网有功优化控制系统、方法和介质
CN120341944B (zh) 基于能源集群与储能协同虚拟电厂控制方法、系统和装置
CN119721179B (zh) 一种用于电力负荷预测的历史数据驱动方法及系统
KR20250036434A (ko) 오디오 딥러닝을 위한 오디오 데이터 전처리 방법, 장치 및 시스템
CN109301820A (zh) 一种企业电力控制方法及系统
CN102156408B (zh) 一种动态自适应演化最大功率点跟踪控制系统及方法
CN111325368A (zh) 一种光储式电动汽车充电站光伏功率预测方法和装置
CN120066406A (zh) 基于三方架构的存储网络令牌桶调度算法及其优化方法
CN119987975A (zh) 一种基于进化算法的分布式异构任务调度方法及系统
CN120033663A (zh) 基于lstm的分布式电源供电功率预测方法、系统及设备
CN118889478A (zh) 光伏出力动态场景生成的分布式储能优化配置方法及系统
KR102886958B1 (ko) 에너지 수집형 엣지 지능형 사물 인터넷 환경 기반의 분산 학습 시스템, 방법 및 기록 매체
CN116528160A (zh) 一种基于能量感知的mwsn轻量级协同定位与导航方法
Rueb et al. 6G and the Sustainability Aspect: Exploiting Surplus Renewable Energy for Distributed Learning Clusters in 6G Networks
CN113568865A (zh) 面向自供能系统的存算一体架构及软件优化方法

Legal Events

Date Code Title Description
PA0109 Patent application

St.27 status event code: A-0-1-A10-A12-nap-PA0109

PA0201 Request for examination

St.27 status event code: A-1-2-D10-D11-exm-PA0201

PG1501 Laying open of application

St.27 status event code: A-1-1-Q10-Q12-nap-PG1501

E902 Notification of reason for refusal
PE0902 Notice of grounds for rejection

St.27 status event code: A-1-2-D10-D21-exm-PE0902

E13 Pre-grant limitation requested

Free format text: ST27 STATUS EVENT CODE: A-2-3-E10-E13-LIM-X000 (AS PROVIDED BY THE NATIONAL OFFICE)

E13-X000 Pre-grant limitation requested

St.27 status event code: A-2-3-E10-E13-lim-X000

P11 Amendment of application requested

Free format text: ST27 STATUS EVENT CODE: A-2-2-P10-P11-NAP-X000 (AS PROVIDED BY THE NATIONAL OFFICE)

P11-X000 Amendment of application requested

St.27 status event code: A-2-2-P10-P11-nap-X000

P13 Application amended

Free format text: ST27 STATUS EVENT CODE: A-2-2-P10-P13-NAP-X000 (AS PROVIDED BY THE NATIONAL OFFICE)

P13-X000 Application amended

St.27 status event code: A-2-2-P10-P13-nap-X000

D22 Grant of ip right intended

Free format text: ST27 STATUS EVENT CODE: A-1-2-D10-D22-EXM-PE0701 (AS PROVIDED BY THE NATIONAL OFFICE)

PE0701 Decision of registration

St.27 status event code: A-1-2-D10-D22-exm-PE0701

PR1002 Payment of registration fee

St.27 status event code: A-2-2-U10-U11-oth-PR1002

Fee payment year number: 1

U11 Full renewal or maintenance fee paid

Free format text: ST27 STATUS EVENT CODE: A-2-2-U10-U11-OTH-PR1002 (AS PROVIDED BY THE NATIONAL OFFICE)

Year of fee payment: 1

PG1601 Publication of registration

St.27 status event code: A-4-4-Q10-Q13-nap-PG1601

Q13 Ip right document published

Free format text: ST27 STATUS EVENT CODE: A-4-4-Q10-Q13-NAP-PG1601 (AS PROVIDED BY THE NATIONAL OFFICE)