PL220412B1 - Sposób i układ szybkiego równoległego przetwarzania sygnałów - Google Patents
Sposób i układ szybkiego równoległego przetwarzania sygnałówInfo
- Publication number
- PL220412B1 PL220412B1 PL396236A PL39623611A PL220412B1 PL 220412 B1 PL220412 B1 PL 220412B1 PL 396236 A PL396236 A PL 396236A PL 39623611 A PL39623611 A PL 39623611A PL 220412 B1 PL220412 B1 PL 220412B1
- Authority
- PL
- Poland
- Prior art keywords
- signal
- input
- parallel
- output
- accumulator
- Prior art date
Links
Landscapes
- Complex Calculations (AREA)
Description
Przedmiotem wynalazku jest sposób i układ do szybkiego równoległego przetwarzania sygnałów wielowymiarowych.
Z patentu np. US 7395293 i EP 2209071A2 znana jest metoda i układ szybkiej jednowymiarowej transformaty Fouriera z zastosowaniem pamięci wejściowej, gdzie dane wprowadzane i wyprowadzane są w sposób szeregowy, natomiast obliczenia współczynników transformaty wykonywane są równolegle w pętli sprzężenia zwrotnego za pomocą algorytmu FFT. W przypadku użycia tej metody do obliczenia przekształcenia sygnału wielowymiarowego należy zwiększyć ilość układów obliczeniowych FFT połączonych równolegle przedstawionych w wyżej wymienionych zgłoszeniach patentowych, co zwiększa złożoność systemu i ilość operacji obliczeniowych.
Z patentu US 6532484 znany jest układ i metoda równoległego obliczania jednowymiarowej szybkiej transformaty Fouriera w której obliczenia podzielone są na N procesów. Procesy te realizują częściowe obliczenia FFT a wyniki alokują w odpowiednio zorganizowanych pamięciach. Przedstawiona metoda i układ służy do obliczeń FFT sygnałów jednowymiarowych i zawiera wiele złożonych procesorów specjalizowanych co prowadzi do większej złożoności struktury i zmniejszenia szybkości jej działania.
Z patentu GB 2401963 znana jest równoległa metoda szybkiego przetwarzania Fouriera dla sygnałów 3 wymiarowych przy czym metoda ta zakłada zastosowanie znacznej ilości procesorów oraz dzielenie danych wejściowych na bloki w celu obliczenia przekształcenia. Taki podział spowalnia obliczenia równoległe.
Z patentu US 2002/0065862 A1 znana jest metoda równoległego obliczania wielowymiarowego przekształcenia Fouriera przy czym do obliczeń potrzebna jest złożona infrastruktura sieciowa oraz komputery/procesory w których wykonywane są kolejne wątki obliczeń. Takie rozwiązanie nie sprzyja realizacji algorytmów obliczeniowych sygnałów szybkozmiennych w trybie czasu rzeczywistego.
Wszystkie powyżej przedstawione metody i układy są dedykowane dla konkretnego typu przetwarzania (transformat) najczęściej FFT. Takie rozwiązanie ogranicza zastosowanie układów oraz metod tylko do konkretnego typu przekształcenia. Ponadto w większości znanych rozwiązań przekształceń sygnałów jedno i wielowymiarowych, obliczenia współczynników przekształcenia wykonywane są dopiero po wprowadzeniu wszystkich danych wejściowych. W większości znanych rozwiązań równoległość obliczeń opiera się na wykorzystaniu grup procesorów czy dzielenia danych na bloki co spowalnia szybkość obliczeń i wymaga złożonych i często nieekonomicznych zasobów sprzętowych. Nie znaleziono rozwiązań, gdzie w odpowiednio zorganizowanej pamięci umieszczone zostały obliczone części przekształcenia, które są następnie odpowiednio sumowane.
Obliczenie, przekształcenia sygnału wielowymiarowego klasy M-l N—l
Χρ.....q = «ρ -α, .....nf(m,...,n,p,...,q') m=0 η=0 (1) gdzie: Xp, q - wynik przekształcenia sygnału wielowymiarowego dla współczynnika o indeksach p,...,q, ap...aq - współczynniki skalujące, xm.,,n - wartość sygnału wejściowego o indeksach f(m,...,n,p,...,q) - funkcja transformująca, M...N - rozmiar sygnału wejściowego oraz wyjściowego, najczęściej wykonywane jest sekwencyjnie z wykorzystaniem wielu operacji matematycznych w szczególności operacji mnożenia, co istotnie ogranicza jego szybkość działania. Ponadto, każdy typ przekształcenia ma inne funkcje bazowe (przekształcające lub transformacji) f(m,...,n,p,...,q) co zawęża jego zastosowanie i uniemożliwia realizację innych przekształceń za pomocą tego samego układu. Do przekształceń klasy przedstawionej wyrażeniem (1) zaliczyć możemy jednowymiarowe i dwuwymiarowe przekształcenia DFT, DCT, DST, Mellina, Hadamarda, DHT, falkowe oraz wiele innych, w tym o wymiarowości powyżej 2. Dla niektórych z nich współczynniki skalujące mogą być równe 1.
Poniżej został opisany sposób przetwarzania sygnałów dwuwymiarowych według wynalazku. Nie ogranicza to zastosowania tej metody do przetwarzania sygnałów o większej wymiarowości. Ogólna metoda przetwarzania sygnałów dwuwymiarowych może być przedstawiona w następującej postaci:
PL 220 412 B1 (2)
M-l N-l
Xp,q = «p«q xm,n f(™, η, ρ, q) m=0 η=0
Oznaczenia w tym wyrażeniu odpowiadają oznaczeniom w formule (1).
Wyrażenie (2), włączając czynniki ap,aq pod znak sumy zapisać można w następującej postaci:
M-l N-1
Xp,q = Σ n’ Ρ’ m=0 n=0 (3)
Wewnętrzna suma tego wyrażenia może zostać rozwinięta do postaci:
M-l xp,q = (xm,o fi™. 0, p, q)-ap-aq+ xmA f(m, 1, p, q) · ap · aq + ... + xm^N_1 f(m, N - l,p, q) m=0
CCp * CCą').
(4)
Rozwijając sumę
M-l \
Σ· m=0 / otrzymujemy:
xp,q = ko,o · /(0,0, p, q) · ap aq + x0,i · /(0,1, p,q)-ap-aq+ ... + x0,jv-i ’ /(0, N - l,p,q) · ap aq] + + [x0,i · /(1,0, p,q) · ap · aq + χ1 x · f(l,l,p,q) · ap · aq + ... + χ^^ f(l,N - l,p,q) ap aq] + ...+ +[*«-i,o ’ /(M “ i-0- P’ <ł)-ap-aq+ xm-i,i · f(M ~ 1,1, P, q')-ap-aą + - + xm-i,n-i ' f(M -1,N -l,p,q)-ap-aq\.
(5)
Każdy z iloczynów xm,n-f(m,n,p,q)-ap-aq z wyrażenia (5) których ilość dla jednej wartości wyjściowej xp,q przekształcenia wynosi M-N-L, można obliczyć i przedstawić w postaci pamięci zorganizowanej jako sześcian o wymiarach M,N,L. W wyrażeniu tym V xm,„ e R,xmpi - wartość n,m-tej próbki sygnału wejściowego, me0,M-l, n e 0, V - 1, p e [ 0,1 ,. . .,M -1 ] i q e [ 0,1 ,. . .,JV - 1 ] a maksymalna ilość możliwych wartości każdej próbki wynosi . Wartości wszystkich próbek należą do tego samego zbioru wartości. Sytuację tą, dla sygnałów dwuwymiarowych, przedstawia rysunek 2. Wartości próbek wejściowych {xm,n} wraz z ich numerami reprezentowanymi np. jako kolejne takty sygnału zegarowego formują liczby ze zbioru liczb naturalnych (włączając zero), które to wartości wyznaczają odpowiednie adresy komórek pamięci z użyciem np. transkodera. Transkoder tworzy adresy komórek pamięci przedstawione w odpowiedniej formie. Sposób organizacji pamięci dla jednego kanału wyjściowego (jedna wartość wyjściowa xpq) przedstawiony jest na rysunku 3. Polega on na podziale pamięci na M · N bloków komórek w których to blokach umieszczonych jest L komórek zawierających wcześniej obliczone i zapamiętane wartości iloczynów xmn-f(m,n,p,q)-ap-aq. Aby obliczyć wartość jednego współczynnika wyjściowego należy sumować wartości odpowiednich iloczynów xm,nf(m,n,p,q)-ap-aq umieszczonych w pamięci. Adresy komórek wartości wyznaczane są przez transkoder /1/ w dwóch etapach. W pierwszym etapie przekodowuje się wartość bieżącej próbki co określa pierwszą część adresu. Druga część zostaje wyznaczona na podstawie numeru tej próbki. Zawartość komórek odczytanych na podstawie utworzonego w taki sposób adresu, są przesyłane do układu sumacyjnoakumulującego. Stąd, aby obliczyć wszystkie współczynniki wyjściowe xpq przekształcenia ze wzoru (5), należy we wszystkich kanałach jednocześnie sumować i akumulować odpowiednie wartości umieszczone w pamięciach wszystkich równoległych kanałów. Po zsumowaniu M-N takich wartości w każdym kanale, zostaje sformowany sygnał wyjściowy, którego każda składowa jest utworzona w odpowiednim kanale. Wynik ten otrzymujemy natychmiast po podaniu ostatniej próbki xM-i,N-i powodującej ostatnią akumulację odpowiedniego iloczynu, po czym odbywa się odczyt obliczonych w taki
PL 220 412 B1 sposób współczynników transformacji z wyjść sumatorów-akumulujących. Następnie odbywa się zerowanie wszystkich sumatorów akumulujących.
W sposobie wg wynalazku, do szybkiego równoległego przetwarzania sygnałów, wejściowy
M-...-N wymiarowy sygnał {xm -} o zadanej bitowości zamieniany jest na podstawie skanowania na sygnał jednowymiarowy i przesyłany jest szeregowo w postaci wartości próbek na wejście układu formującego adresy komórek pamięci.
Istotą sposobu wg wynalazku jest to, iż w celu zwiększenia szybkości obliczeń przekształcenia klasy
M-l N-1
Xp.....q = «Ρ - «q Σ - Σ Xm.....n f(m’ - ’ n’ P’ - ’ m=0 n=0 gdzie; xp.....ą - wynik przekształcenia sygnału wielowymiarowego dla współczynnika o indeksach p,...,q, ap...aq - współczynniki skalujące, xm,.n - wartość sygnału wejściowego o indeksach m,...,n, f(m,...,n,p,...,q) - funkcja transformująca, M...N - rozmiar sygnału wejściowego oraz wyjściowego, wartości próbek wraz z ich numerami tworzą adresy odpowiednich komórek pamięci, z których to komórek równolegle odczytywane są iloczyny próbek i odpowiednich składowych funkcji transformacji oraz współczynników skalujących {xmnf(m,n,p,q)apaq}. Następnie iloczyny te są sumowane i akumulowane w każdym kanale oddzielnie. Do obliczeń wykorzystuje się równoległe przetwarzanie sygnału w Μ·...·Ν kanałach formujących taką samą ilość składowych sygnału wyjściowego, w rezultacie czego po Μ·...·Ν taktach formowany jest sygnał wyjściowy. W tym sposobie, każdy kanał reprezentuje odpowiednią składową sygnału wejściowego tego przetwarzania.
Układ do szybkiego równoległego przetwarzania sygnałów Μ·...·Ν wymiarowych zawierający Μ·...·Ν pamięci /2.1...2.M...N/, Μ·...·Ν sumatorów-akumulujących /3.1 ...3.M../N/ oraz układ sterowania /4/, według wynalazku charakteryzuje się tym, że sygnał wejściowy o bitowości b oraz sygnał zegarowy CLK podawane są na transkoder /1/, który formuje adresy komórek pamięci o bitowościach c. Adresy te jednocześnie podawane są na odpowiednie wejścia adresowe A wszystkich Μ·...·Ν pamięci /2.1...2.Μ·...·Ν/. Wyjście każdej pamięci /2.1...2. Μ·...·Ν/ jest połączone z wejściem sygnałowym odpowiedniego sumatora-akumulującego /3.1...3.Μ·...·Ν/ za pomocą szyny o bitowości d. Wyjściowe sygnały sumatorów-akumulujących /3.1...3.Μ·...·Ν/ o bitowości e, gdzie e>d, wyznaczają kolejne współczynniki przetwarzania we wszystkich kanałach. Wejściowy sygnał zegarowy CLK przesyłany jest także na wejście układu sterowania /4/. Układ sterowania /4/ posiada trzy wyjścia z których pierwsze (Read) jest połączone równolegle z wejściem RD wszystkich Μ·...·Ν pamięci /2.1...2.Μ·...·Ν/. Sygnał RD steruje odczytem z pamięci. Drugie wyjście układu sterującego /4/ (Add) połączone jest równolegle z wejściami Add układów sumująco-akumulujących /3.1...3.Μ·...·Ν/ wszystkich kanałów. Trzecie wyjście układu sterowania /4/ Reset, jest połączone z odpowiednim wejściem układów sumującoakumulujących /3.1...3.Μ·...·Ν/ i służy do kasowania zawartości sumatorów-akumulujących /3.1...3.Μ·...·Ν/ po ich odczycie.
Sposób według wynalazku przedstawiony został na przykład zie wykonania nie ograniczając jego stosowania.
P r z y k ł a d I
Sposób szybkiego równoległego przetwarzania sygnałów według wynalazku został przedstawiony na przykładzie dwuwymiarowego przekształcenia DCT.
Wejściowy sygnał dwuwymiarowy o rozmiarze MN po skanowaniu wierszy zamieniany jest na sygnał jednowymiarowy i przesyłany jest szeregowo w postaci próbek o wartościach całkowitych np. w ośmiobitowym kodzie PCM. Wartości te wraz z numerami kolejnych próbek służą wyznaczeniu adresów komórek pamięci (rysunek 3). W pamięci umieszczonej w każdym kanale przetwarzania xp,q, gdzie i , przechowywane są wcześniej obliczone i zapamiętane iloczyny xm,n ^f(m,n,p,q)^ap^aq z wyrażenia (5). Dla przekształcenia DCT iloczyn ten przedstawiony jest następująco:
gdzie /π·ρ·(2·7η+1)\ /π·α·(2·η+1)\
- · cos - · av aa
V 2-M J \ 2-N J P q 'i/y/M', ,p = 0 J2/M, 1<P<M -1’ ą = o
[J2/Ń, 1 < q < N (6)
PL 220 412 B1
Podstawiając do wyrażenia (5) iloczyny przedstawione wyrażeniem (6) wyznaczone dla wartości meO,M-l i neO,JV-l jako funkcje transformujące DCT, otrzymujemy następujące sumy iloczynów (dla jednego kanału xp,q):
ίπ·Ρ\ ίπΝ\ ΐο’°'cos IFaU 'cos \?7n) 'αρ'α« + <2 · M/ V2 · N + -^ο,Ν—ι ' fos ίπ'Ρ\ p-q-3\ C°S '-2 2 ' C°\ 2-N 7 (π'Ρ\ ί π q (2 (N - 1) + 1)
V2 · M' ’ C°S \ 2 ·
ĆZp * CCą + ···
CCp · CCą • COS \ 2-M ) \2-N>
ar · aq + X, ! · cos
V 2-M J \2-N / , ίπ · P · 3\ +%i,w-i · cos [ 2-M ) cos π q (2 · (/V - 1) + 1) ΣΟν + ··· +
Ζπ·ρ·(2·(Μ-1) + 1)\ ίπίΐ\
- · cos — · αΌ · aa
V 2-M 7 \2-nJ P “?
Ζπ·ρ·(2·(Μ-1) + 1)\ Ζπ·1/·3\
V 2-M 7 V 2-N 7 P ą
Ζπ·ρ·(2·(Μ-1) + 1)\ Ζπ·ι;·(2·(ίν-1) + 1)\
- · cos - · a„ · a,
V 2-M 7 V 2-N 7 P ' (7)
4-Ύμ—ι * cos Ί -Χ-Μ-Ι,Ν-1 ' COS
Liczba iloczynów zawartych w wyrażeniu (7) dla jednego kanału wynosi M-N-256 uwzględniając, że wartości wejściowe xm,n dla ośmiobitowego kodu PCM mogą przyjmować wartości od 0 do 255, L=256 (rysunek 3). Podstawiając do każdego iloczynu z wyrażenia (7) wartości xm,n z zakresu od 0 do 255 z jednoczesnym określeniem kanału przekształcającego (transformującego) xp,q, gdzie [ O, l ,. . .,M - l] i q e [ O, l ,..,N - l], obliczamy M-A-256 iloczynów a ich wartości alokujemy odpowiednio w pamięci, której organizacja jest przedstawiona na rysunku 3. Po obliczeniu i umieszczeniu w pamięciach wszystkich iloczynów przekształcenia DCT dla wszystkich kanałów, wartości kolejnych próbek sygnału dwuwymiarowego wraz z numerem kolejnym próbki formują adresy komórek pamięci i są podawane równolegle na wejścia adresowe tychże pamięci. Zawartość odczytywanych komórek pamięci podawana jest na wejścia sumatorów-akumulujących. Na wyjściu każdego sumatoraakumulującego po MN taktach formowany jest sygnał wyjściowy, który jest odpowiednią składową całego przetwarzania. Po zsumowaniu ostatnich iloczynów we wszystkich kanałach zostaje sformowany wynik całego przetwarzania, który następnie odczytuje się. Po takim odczycie zawartość akumulatorów zeruje się.
Zaletą wynalazku jest szybkie równoległe przekształcenie M-...-N wymiarowego (w szczególności jedno i dwuwymiarowego) sygnału klasy przedstawionej wyrażeniem (1), realizacja którego nie wymaga czasochłonnych operacji mnożenia. Współczynniki przekształcenia (wynik) otrzymujemy od razu po podaniu ostatniej wartości sygnału wejściowego xM-1,N-1.
Sposób według wynalazku umożliwia różne aplikacje układowe jak i programowe w szczególności umożliwia realizację niniejszego sposobu na szybkich, wydajnych, tanich a także umożliwiających pracę w czasie rzeczywistym, układach pól programowalnych takich jak np. FPGA.
Układ do szybkiego równoległego przetwarzania sygnałów Μ·...·Ν wymiarowych według wynalazku został przedstawiony na przykładzie dwuwymiarowego przekształcenia DCT sygnału o rozmiarze 8x8.
P r z y k ł a d II
Układ według wynalazku został przedstawiony na podanym schemacie blokowym przykładowego wykonania (rysunek 1) nie ograniczając jego stosowania. Na wejście szybkiego równoległego układu dwuwymiarowego przekształcenia DCT podawane są wartości sygnału w postaci wartości ośmiobitowych otrzymanych po skanowaniu kolumn lub wierszy sygnału dwuwymiarowego. Liczba wartości wejściowych dla przetwarzanego sygnału dwuwymiarowego o rozmiarze 8x8 (dla M=8 i N=8) wynosi 64. Kolejne wartości sygnału o bitowości b (w przykładzie b = 8) wraz z kolejnymi taktami sygnału zegarowego CLK są podawane na wejście transkodera /1/. Transkoder formuje i przesyła na wejście A pamięci bieżący adres komórek wszystkich 64 pamięci /2.1 ... 2.64/. Bitowość szyny adresowej Address (c) określa maksymalną adresowalną ilość komórek pamięci. W przykładzie, ilość próbek wejściowych wynosi 64. Rozmiar jednej pamięci zorganizowanej w taki sposób jak przedstawiono na rysunku 3 i opisano w Przykładzie I, dla wartości ośmiobitowych wynosi: 28·64=16384 komórek.
PL 220 412 B1
W pamięci, dla ośmiobitowych sygnałów dwuwymiarowych o rozmiarze 8x8, umieszczone są następujące iloczyny:
(5) gdzie pe[ O , 1 ,. . Ί ] ,qe[ Ο , 1 ,. . ., Ί ] ,m£O , Ί ,η£θ , Ί, αρ
1/λ/8? ρ = Ο ,
Τνϊ1-ρ-7
1/7^ <? = Ο , ^1/4,1 - <7 - 7
Dla iloczynów zapisanych w formacie czterobajtowym (np. IEEE-754 single), jedna komórka pamięci składa się z czterech bajtów. Ostatecznie, pamięć dla jednego kanału ma 65536 bajtów. Sumaryczna pamięć dla wszystkich 64 kanałów wynosi: 4194304 bajty (ok. 4 MB). Po każdym ustaleniu adresu i podaniu go na wejście A pamięci oraz wygenerowaniu przez układ sterowania sygnału Read, który zezwala na odczyt komórki pamięci której wartość przesyłana jest na szynę danych o bitowości d, która w zależności od dokładności obliczeń może przyjmować rozmiar np. 4, 8 lub 10 bajtów. W przykładzie zastosowano szynę o bitowości 4 bajtów. Odczyt wartości ze wszystkich pamięci odbywa się równolegle. Odczytane wartości podawane są na wejścia sumatorów-akumulujących /3.1 ... 3.64/, których działanie wyznaczane jest przez sygnał sterujący Add formowany w układzie sterowania /4/. Po 64 taktach zegarowych wprowadzających dane na wejście układu, na wszystkich 64 wyjściach równoległych układów sumacyjno-akumulujących o bitowościach e, gdzie e>d (np. e=64) otrzymujemy wynik przekształcenia w postaci 64 współczynników przekształcenia DCT {xp,q}. Jednocześnie po odczycie układ sterowania /4/ generuje sygnał Reset powodujący kasowanie zawartości sumatorówakumulujących /3.1 ... 3.64/.
Powyżej opisany przykład realizacji układu może zostać wykonany jako specjalizowany układ do równoległego szybkiego obliczania różnych typów przekształceń sygnałów Μ·...·Ν wymiarowych. Ponadto, jego budowa może opierać się na szybkich, wydajnych, tanich a także umożliwiających pracę w czasie rzeczywistym, układach pól programowalnych takich jak np. FPGA.
Claims (4)
1. Sposób szybkiego równoległego przetwarzania sygnałów, w którym wejściowy Μ·...·Ν wymiarowy sygnał {xm,..,n} o zadanej bitowości zamieniany jest na podstawie skanowania na sygnał jednowymiarowy i przesyłany jest szeregowo w postaci wartości próbek, znamienny tym, że w celu zwiększenia szybkości obliczeń przekształcenia klasy
M-l W-l
Xp.....q = ap -aq^ xm.....„ f(m,... ,n,p,..., q), m=O n=0 gdzie xp.....q - wynik przekształcenia sygnału wielowymiarowego dla współczynnika o indeksach p,...,q, ap...aq - współczynniki skalujące, xm.....n - wartość sygnału wejściowego o indeksach m,...,n, f(m.....n.
p,..,q) - funkcja transformująca, M...N - rozmiar sygnału wejściowego oraz wyjściowego, wartości próbek wraz z ich numerami tworzą adresy odpowiednich komórek pamięci, z których to komórek równolegle odczytywane są iloczyny próbek i odpowiednich składowych funkcji transformacji oraz współczynników skalujących {xmn-f(m,n,p,q)^ap-aq}, które następnie są sumowane i akumulowane w każdym kanale oddzielnie, przy tym do obliczeń wykorzystuje się równoległe przetwarzanie sygnału w M-.-N kanałach formujących taką samą ilość składowych sygnału wyjściowego, w rezultacie czego po M-.-N taktach formowany jest sygnał wyjściowy, przy czym każdy kanał reprezentuje odpowiednią składową sygnału wejściowego tego przetwarzania.
2. Układ do szybkiego równoległego przetwarzania sygnałów M-.-N wymiarowych zawierający M-.-N pamięci /2.1... 2.M-...-N/, sumatorów-akumulujących /3Λ...Μ-...-Ν/ oraz układ sterowania /4/, znamienny tym, że sygnał wejściowy o bitowości b oraz sygnał zegarowy CLK podawane są na transkoder /1/, który formuje adresy komórek pamięci o bitowościach c, adresy te jednocześnie podawane są na odpowiednie wejścia adresowe A wszystkich M-.-N pamięci /2.1... 2.M-...-N/, wyjście każdej
PL 220 412 B1 pamięci /2.1...M-...-N/ jest połączone z wejściem sygnałowym odpowiedniego sumatora-akumulującego /3.1...
3.M-...-N/ za pomocą szyny o bitowości d, natomiast wyjściowe sygnały sumatorówakumulujących /3.1... 3.M-...-N/ o bitowości e, gdzie e>d, wyznaczają kolejne współczynniki przetwarzania we wszystkich kanałach, wejściowy sygnał zegarowy CLK przesyłany jest także na wejście układu sterowania /4/, układ sterowania /4/ posiada trzy wyjścia z których pierwsze (Read) jest połączone równolegle z wejściem RD wszystkich M-...-N pamięci /2.1...M-...-W/, sygnał RD steruje odczytem z pamięci, drugie wyjście układu sterującego /4/ (Add) połączone jest równolegle z wejściami Add układów sumująco-akumulujących /3.1... 3.M-...-N/ wszystkich kanałów, trzecie wyjście układu sterowania
/4/ Reset, jest połączone z odpowiednim wejściem układów sumująco-akumulujących /3.1...M-...-N/ i służy do kasowania zawartości sumatorów-akumulujących /3.1...3.M-...-N/ po ich odczycie.
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| PL396236A PL220412B1 (pl) | 2011-09-05 | 2011-09-05 | Sposób i układ szybkiego równoległego przetwarzania sygnałów |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| PL396236A PL220412B1 (pl) | 2011-09-05 | 2011-09-05 | Sposób i układ szybkiego równoległego przetwarzania sygnałów |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| PL396236A1 PL396236A1 (pl) | 2013-03-18 |
| PL220412B1 true PL220412B1 (pl) | 2015-10-30 |
Family
ID=47846385
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| PL396236A PL220412B1 (pl) | 2011-09-05 | 2011-09-05 | Sposób i układ szybkiego równoległego przetwarzania sygnałów |
Country Status (1)
| Country | Link |
|---|---|
| PL (1) | PL220412B1 (pl) |
-
2011
- 2011-09-05 PL PL396236A patent/PL220412B1/pl unknown
Also Published As
| Publication number | Publication date |
|---|---|
| PL396236A1 (pl) | 2013-03-18 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US11698773B2 (en) | Accelerated mathematical engine | |
| US11989258B2 (en) | Performing matrix multiplication in hardware | |
| US11023801B2 (en) | Data processing method and apparatus | |
| JP5408913B2 (ja) | 高速かつ効率的な行列乗算ハードウェアモジュール | |
| CN114329329B (zh) | 硬件中的稀疏矩阵乘法 | |
| EP3373210B1 (en) | Transposing neural network matrices in hardware | |
| CN103294446A (zh) | 一种定点乘累加器 | |
| CN112446007B (zh) | 一种矩阵运算方法、运算装置以及处理器 | |
| CN108170639A (zh) | 基于分布式环境的张量cp分解实现方法 | |
| CN112286864B (zh) | 加速可重构处理器运行的稀疏化数据处理方法及系统 | |
| Deryabin et al. | High performance parallel computing in residue number system | |
| CN119829005B (zh) | 蝶形计算单元、蝶形计算单元阵列、可重构阵列及芯片 | |
| CN112712461B (zh) | 一种图像反卷积处理方法、装置及终端设备 | |
| CN111178505B (zh) | 卷积神经网络的加速方法和计算机可读存储介质 | |
| CN119337040A (zh) | 计算装置、方法、设备、芯片及系统 | |
| CN116186472A (zh) | 一种矩阵计算方法、装置、系统、雷达和存储介质 | |
| Jain et al. | New Algorithm for DHT and its Verilog Implementation | |
| Bensaali et al. | An FPGA based coprocessor for large matrix product implementation | |
| CN113836481B (zh) | 矩阵计算电路、方法、电子设备及计算机可读存储介质 | |
| Dinkel et al. | Fast median finding on digital images | |
| CN120578364A (zh) | 基于cpu-dsp的稀疏矩阵向量乘异构并行计算方法 | |
| Wang et al. | Synchronous Multi-splitting and Schwarz Methods for Solving Linear Complementarity Problems | |
| Snopce et al. | Research Article Comparison among Performance Measures for Parallel Matrix Multiplication Algorithms |