RNN for speech
Žádný odhad
Žádné hardwarové požadavky pro tento model
Hmotnosti pro tento model nebyly zveřejněny, takže jej nelze stáhnout ani spustit na vlastním hardwaru v žádné velikosti. Je dostupný pouze prostřednictvím svého poskytovatele, a žádná změna grafické karty to nezmění..
Na záznamu
Plná specifikace
Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..
Původ
Kdo vytvořil tento model, kde a kdy byl publikován.
- Organizace
- National Chiao Tung University
- Typ organizace
- Academia
- Země
- Taiwan
- Publikováno
- 15 May 1998
- Autoři
- SH Chen, SH Hwang, YR Wang
Co to dělá
Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.
- Doména
- Speech
- Úkol
- Speech synthesis
Velikost
Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.
- parametry
- 7.5K
- Výcviková data
- tokens
"The RNN generated a total of eigt output prosodic parameters. [...] The numbers of nodes in the first and second hidden layers were determined empirically and set to be 35 and 30, respectively" Figure 1 contains an overview of the architecture. Layer 1: (102 + 35 + 1)*35 parameters Layer 2: (43 + 35 + 1)*30 parameters Output layer: (30+8+1)*8 parameters
The data base was divided into two parts: a training set and an open test set. These two sets consisted of 28 191 and 7051 syllables, respectively. Of the top 10,000 Chinese words, 15% have 1 syllable, 78% have 2 syllables, and 7% have more than two syllables. Assuming 2 syllables per word, the training set is around 14100 words.
Výpočty pro trénink
Aritmetika prováděná k trénování modelu, měřená v operacích s plovoucí desetinnou čárkou. Je to měřítko toho, kolik stál tréninkový běh, ne jak rychle hotový model na vás odpovídá.
- Výpočty pro trénink
- 2.3 × 10¹¹ FLOP
- Jak bylo ustanoveno
- Third-party estimation
Extracted from AI and Compute (https://openai.com/blog/ai-and-compute/) charts by using https://automeris.io/WebPlotDigitizer/.
Jak je to klasifikováno
Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.
- Citace
- 231
Žrovy
Odkud tento záznam pochází a kdy byl naposledy zkontrolován.
- Reference
- An RNN-based prosodic information synthesizer for Mandarin text-to-speech
- Nap poslední aktualizace
- 28 November 2025
Co čísla znamenají
Pozadí
RNN for speech byl zveřejněn National Chiao Tung University, v zemi zaznamenané jako Taiwan, během May 1998. Kategorie, do které vydavatel spadá, je academia.
funguje v oblasti Speech, a je zaznamenán jako vykonávající úkol speech synthesis.
Protože váhy nejsou k dispozici, žádné z hardwarových údajů na tomto webu se na něj nevztahují.
Co bylo zapotřebí k jeho vybudování
Trénování si vyžádalo výpočetní rozpočet přibližně 2.3 × 10¹¹ FLOP. Tato částka měří, kolik stál výroba modelu, a nemá žádný vliv na to, jak rychle odpovídá.
Odpovědi
RNN for speech — běžné otázky
RNN for speech— kolik výpočetního výkonu bylo použito k jeho trénování?
Trénink spotřeboval kolem 2.3 × 10¹¹ FLOP. To měří, co stálo výrobu modelu, a neříká nic o tom, jak rychle odpovídá po natrénování — rychlost inferencí závisí na šířce pásma paměti, nikoli na rozpočtu na trénink.
RNN for speech— Jakou GPU potřebuji k jejímu spuštění?
Žádné. Toto je uzavřený model — jeho váhy nikdy nebyly zveřejněny, takže jej nelze stáhnout nebo spustit na vlastním hardwaru za žádnou cenu. Je dostupný pouze prostřednictvím jeho poskytovatele.
RNN for speech— Je to OPEN SOURCE?
Licencování nikdy nebylo zaznamenáno v našich zdrojových datech. Neuváděné licencování považujeme za uzavřené, protože nezaznamenaná licence není na kterou by se dalo spoléhat.
RNN for speech— kolik má parametrů?
Má počet parametrů 7.5K. "The RNN generated a total of eigt output prosodic parameters. [...] The numbers of nodes in the first and second hidden layers were determined empirically and set to be 35 and 30, respectively" Figure 1 contains an overview of the architecture. Layer 1: (102 + 35 + 1)*35 parameters Layer 2: (43 + 35 + 1)*30 parameters Output layer: (30+8+1)*8 parameters. Tato cifra je celková a rozhoduje o tom, kolik VRAM model potřebuje — přibližně půl gigabajtu na miliardu při kompresi, kterou většina lidí používá.
RNN for speech— Kdo to vytvořil?
Bylo to publikováno společností National Chiao Tung University, zakládající se na Taiwan, organizace zařazená jako academia.
RNN for speech— Kdy byl vydán?
Bylo to zveřejněno v May 1998. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.
RNN for speech— K čemu se to používá?
funguje v oblasti Speech, a je zaznamenáno jako zpracovávající úkol speech synthesis. Toto jsou oblasti, kolem nichž byl navržen; popisují záměr spíše než tvrdou hranici.
Druhý směr
Díváte se na to z druhé strany?
Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.