Discriminator-tuned LSTM
Žádný odhad
Žádné hardwarové požadavky pro tento model
Hmotnosti pro tento model nebyly zveřejněny, takže jej nelze stáhnout ani spustit na vlastním hardwaru v žádné velikosti. Je dostupný pouze prostřednictvím svého poskytovatele, a žádná změna grafické karty to nezmění..
Na záznamu
Plná specifikace
Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..
Původ
Kdo vytvořil tento model, kde a kdy byl publikován.
- Organizace
- Samsung R&D Institute Russia
- Typ organizace
- Industry
- Země
- Russia
- Publikováno
- 12 November 2018
- Autoři
- Vadim Popov, Mikhail Kudinov
Co to dělá
Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.
- Doména
- Language
- Úkol
- Language modeling
- Přístup
- Self-supervised learning
Velikost
Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.
- parametry
- 111.9M
- Výcviková data
- tokens
The largest experiment is the model trained in section 4.3 ("Large scale experiment"). The dataset here has a vocabulary of 100k words. They use a single-layer LSTM with 500 hidden units, with differentiated softmax for the output layer. d_k for distributed softmax varies from 16-150 depending on the relative frequency of the output word. Input layer: 100k * 500 = 50M parameters LSTM: 4 * (500 + 500) * 500 = 2M parameters Output layer: Here we need to assume the structure of differentiated s…
4GB of text * 200M words/GB * (0.75 words/token)^-1 = 1,066,666,667 tokens However, it's unclear whether they train over all of this. They break the data into 20MB chunks and say that each "epoch" corresponds to training on one chunk. Training the discriminator and fine-tuning the language model takes 60 and 30 "epochs" each, i.e. (60 + 30) * 0.02 * 200M * 4/3 = 480M tokens They appear to have pre-trained their own LSTM language model on the same data, but they don't say how many "ep…
Dostupnost
Zda můžete získat model a spustit ho na svém vlastním hardwaru, což rozhoduje o tom, zda se některé z čísel grafických karet na této stránce vztahují.
- Tréninkový kód
- Unreleased
Jak je to klasifikováno
Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.
- Záznam důvěry
- Likely
Žrovy
Odkud tento záznam pochází a kdy byl naposledy zkontrolován.
- Reference
- Fine-tuning of Language Models with Discriminator
- Nap poslední aktualizace
- 28 November 2025
Co čísla znamenají
O tomto modelu
Discriminator-tuned LSTM byl zveřejněn Samsung R&D Institute Russia, v zemi zaznamenané jako Russia, během November 2018. Vychází z organizace, která je kategorizována jako industry.
funguje v oblasti Language, a je zaznamenán jako vykonávající úkol language modeling.
Jeho váhy nikdy nebyly zveřejněny, takže k němu lze přistupovat pouze prostřednictvím jeho poskytovatele. Žádná změna grafické karty to nezmění.
Odpovědi
Discriminator-tuned LSTM — běžné otázky
Discriminator-tuned LSTM— K čemu se to používá?
funguje v oblasti Language, a je zaznamenáno jako zpracovávající úkol language modeling. Model může nést několik z každého, takže to jsou oblasti, pro které byl navržen, spíše než omezení toho, co se pokusí.
Discriminator-tuned LSTM— Jakou GPU potřebuji k jejímu spuštění?
Žádné. Toto je uzavřený model — jeho váhy nikdy nebyly zveřejněny, takže jej nelze stáhnout nebo spustit na vlastním hardwaru za žádnou cenu. Je dostupný pouze prostřednictvím jeho poskytovatele.
Discriminator-tuned LSTM— Je to OPEN SOURCE?
Licencování nikdy nebylo zaznamenáno v našich zdrojových datech. Neuváděné licencování považujeme za uzavřené, protože nezaznamenaná licence není na kterou by se dalo spoléhat.
Discriminator-tuned LSTM— kolik má parametrů?
Má počet parametrů 111.9M. The largest experiment is the model trained in section 4.3 ("Large scale experiment"). The dataset here has a vocabulary of 100k words. They use a single-layer LSTM with 500 hidden units, with differentiated softmax for the output layer. d_k for distributed softmax varies from 16-150 depending on the relative frequency of the output word. Input layer: 100k * 500 = 50M parameters LSTM: 4 * (500 + 500) * 500 = 2M parameters Output layer: Here we need to assume the structure of differentiated softmax. Let's (somewhat arbitrarily) assume the top 10k words get 150-dim embeddings, the middle 30k get 50-dim embeddings, and the bottom 60k get 16-dim embeddings. Then we have: (10k * 150) + (30k * 50) + (60k * 16) = 3.96M parameters So in total, we have 50M + 2M + 3.96M = 55.96M In other experiments, the authors use the same architecture for the discriminator as for the language model. So total parameter count would appear to be 2 x 55.96M = 111.92M. Tato cifra je celková a rozhoduje o tom, kolik VRAM model potřebuje — přibližně půl gigabajtu na miliardu při kompresi, kterou většina lidí používá.
Discriminator-tuned LSTM— Kdo to vytvořil?
Bylo to publikováno společností Samsung R&D Institute Russia, zakládající se na Russia, organizace zařazená jako industry.
Discriminator-tuned LSTM— Kdy byl vydán?
Bylo to zveřejněno v November 2018. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.
Druhý směr
Díváte se na to z druhé strany?
Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.