RNN for speech

Uzavřené váhy National Chiao Tung University 7.5K parametry May 1998

Žádný odhad

Žádné hardwarové požadavky pro tento model

Hmotnosti pro tento model nebyly zveřejněny, takže jej nelze stáhnout ani spustit na vlastním hardwaru v žádné velikosti. Je dostupný pouze prostřednictvím svého poskytovatele, a žádná změna grafické karty to nezmění..

Na záznamu

Plná specifikace

Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..

Původ

Kdo vytvořil tento model, kde a kdy byl publikován.

Organizace
National Chiao Tung University
Typ organizace
Academia
Země
Taiwan
Publikováno
15 May 1998
Autoři
SH Chen, SH Hwang, YR Wang

Co to dělá

Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.

Doména
Speech
Úkol
Speech synthesis

Velikost

Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.

parametry
7.5K

"The RNN generated a total of eigt output prosodic parameters. [...] The numbers of nodes in the first and second hidden layers were determined empirically and set to be 35 and 30, respectively" Figure 1 contains an overview of the architecture. Layer 1: (102 + 35 + 1)*35 parameters Layer 2: (43 + 35 + 1)*30 parameters Output layer: (30+8+1)*8 parameters

Výcviková data
tokens

The data base was divided into two parts: a training set and an open test set. These two sets consisted of 28 191 and 7051 syllables, respectively. Of the top 10,000 Chinese words, 15% have 1 syllable, 78% have 2 syllables, and 7% have more than two syllables. Assuming 2 syllables per word, the training set is around 14100 words.

Výpočty pro trénink

Aritmetika prováděná k trénování modelu, měřená v operacích s plovoucí desetinnou čárkou. Je to měřítko toho, kolik stál tréninkový běh, ne jak rychle hotový model na vás odpovídá.

Výpočty pro trénink
2.3 × 10¹¹ FLOP

Extracted from AI and Compute (https://openai.com/blog/ai-and-compute/) charts by using https://automeris.io/WebPlotDigitizer/.

Jak bylo ustanoveno
Third-party estimation

Jak je to klasifikováno

Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.

Citace
231

Žrovy

Odkud tento záznam pochází a kdy byl naposledy zkontrolován.

Reference
An RNN-based prosodic information synthesizer for Mandarin text-to-speech
Nap poslední aktualizace
28 November 2025

Co čísla znamenají

Pozadí

RNN for speech byl zveřejněn National Chiao Tung University, v zemi zaznamenané jako Taiwan, během May 1998. Kategorie, do které vydavatel spadá, je academia.

funguje v oblasti Speech, a je zaznamenán jako vykonávající úkol speech synthesis.

Protože váhy nejsou k dispozici, žádné z hardwarových údajů na tomto webu se na něj nevztahují.

Co bylo zapotřebí k jeho vybudování

Trénování si vyžádalo výpočetní rozpočet přibližně 2.3 × 10¹¹ FLOP. Tato částka měří, kolik stál výroba modelu, a nemá žádný vliv na to, jak rychle odpovídá.

Odpovědi

RNN for speech — běžné otázky

01

RNN for speech— kolik výpočetního výkonu bylo použito k jeho trénování?

Trénink spotřeboval kolem 2.3 × 10¹¹ FLOP. To měří, co stálo výrobu modelu, a neříká nic o tom, jak rychle odpovídá po natrénování — rychlost inferencí závisí na šířce pásma paměti, nikoli na rozpočtu na trénink.

02

RNN for speech— Jakou GPU potřebuji k jejímu spuštění?

Žádné. Toto je uzavřený model — jeho váhy nikdy nebyly zveřejněny, takže jej nelze stáhnout nebo spustit na vlastním hardwaru za žádnou cenu. Je dostupný pouze prostřednictvím jeho poskytovatele.

03

RNN for speech— Je to OPEN SOURCE?

Licencování nikdy nebylo zaznamenáno v našich zdrojových datech. Neuváděné licencování považujeme za uzavřené, protože nezaznamenaná licence není na kterou by se dalo spoléhat.

04

RNN for speech— kolik má parametrů?

Má počet parametrů 7.5K. "The RNN generated a total of eigt output prosodic parameters. [...] The numbers of nodes in the first and second hidden layers were determined empirically and set to be 35 and 30, respectively" Figure 1 contains an overview of the architecture. Layer 1: (102 + 35 + 1)*35 parameters Layer 2: (43 + 35 + 1)*30 parameters Output layer: (30+8+1)*8 parameters. Tato cifra je celková a rozhoduje o tom, kolik VRAM model potřebuje — přibližně půl gigabajtu na miliardu při kompresi, kterou většina lidí používá.

05

RNN for speech— Kdo to vytvořil?

Bylo to publikováno společností National Chiao Tung University, zakládající se na Taiwan, organizace zařazená jako academia.

06

RNN for speech— Kdy byl vydán?

Bylo to zveřejněno v May 1998. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.

07

RNN for speech— K čemu se to používá?

funguje v oblasti Speech, a je zaznamenáno jako zpracovávající úkol speech synthesis. Toto jsou oblasti, kolem nichž byl navržen; popisují záměr spíše než tvrdou hranici.

Zdroj

Původní publikace

Nahrávka naposledy aktualizována 28 November 2025

Druhý směr

Díváte se na to z druhé strany?

Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.