Megatron-LM (8.3B)
Žádný odhad
Žádné hardwarové požadavky pro tento model
Hmotnosti pro tento model nebyly zveřejněny, takže jej nelze stáhnout ani spustit na vlastním hardwaru v žádné velikosti. Je dostupný pouze prostřednictvím svého poskytovatele, a žádná změna grafické karty to nezmění..
Na záznamu
Plná specifikace
Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..
Původ
Kdo vytvořil tento model, kde a kdy byl publikován.
- Organizace
- NVIDIA
- Typ organizace
- Industry
- Země
- United States of America
- Publikováno
- 17 September 2019
- Autoři
- Mohammad Shoeybi, Mostofa Patwary, Raul Puri, Patrick LeGresley, Jared Casper, Bryan Catanzaro
Co to dělá
Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.
- Doména
- Language
- Úkol
- Language modeling/generation
- Přístup
- Self-supervised learning
- Číselný formát
- FP16
Velikost
Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.
- parametry
- 8.3B
- Výcviková data
- 46,400,000,000 tokens
- Epochy
- 4.4
Source: https://lair.lighton.ai/akronomicon/ Archived source: https://web.archive.org/web/20211220142906/https://lair.lighton.ai/akronomicon/ Data also available on GitHub: https://github.com/lightonai/akronomicon/blob/main/akrodb/NVIDIA/Megatron-LM.json
"The resulting aggregate corpus contains 174 GB of deduplicated text."
Výpočty pro trénink
Aritmetika prováděná k trénování modelu, měřená v operacích s plovoucí desetinnou čárkou. Je to měřítko toho, kolik stál tréninkový běh, ne jak rychle hotový model na vás odpovídá.
- Výpočty pro trénink
- 9.1 × 10²¹ FLOP
- Jak bylo ustanoveno
- Hardware,Operation counting,Third-party estimation
source: https://lair.lighton.ai/akronomicon/ archived: https://github.com/lightonai/akronomicon/tree/main/akrodb other estimates: 8.3B is a GPT-2-based model (Table 2). "For GPT-2 models, all training is performed with sequences of 1024 subword units at a batch size of 512 for 300k iterations" I interpret the above as 1024*512*300k = 157B training tokens 6 * 157 billion * 8.3 billion = 7.8e21 Also, their training setup achieved 15.1 petaFLOPS or 1.5e16 FLOPS. (512 V100s is 512 * 125 ter…
Tréninkový běh
Co fyzicky vyžadovalo trénování: které čipy, kolik, jak dlouho a co to vyžadovalo ze zásuvky.
- Tréninkový hardware
- NVIDIA Tesla V100 DGXS 32 GB
- Používané čipy
- 512
- Čip-hodiny
- 167,424
- Doba reálného času
- 327 hours (13.6 days)
- Využití hardwaru
- HFU 23.6%
- Příkon
- 262.6 kW
- Náklady na výpočet
- $109,288
Reported throughput is 15.1 teraFLOPS per GPU on 512 GPUs Assume total compute is 9.1e21 FLOP. Then training time is 327 hours. https://www.wolframalpha.com/input?i=9.1*10%5E21+FLOP+%2F+%28512*15.1+teraFLOPS%29
Achieved 15.1 PetaFLOP/s on 512 V100s, vs theoretical maximum of 512 * 125e12 = 64 PetaFLOP/s HFU = 15.1 / 64 = 0.2359
Dostupnost
Zda můžete získat model a spustit ho na svém vlastním hardwaru, což rozhoduje o tom, zda se některé z čísel grafických karet na této stránce vztahují.
- Hmotnosti
- Closed — provider access only
- Přístup k modelu
- Unreleased
- Tréninkový kód
- Open source
code (2.5B model is a GPT model): https://github.com/NVIDIA/Megatron-LM?tab=readme-ov-file#megatron-overview open license: https://github.com/NVIDIA/Megatron-LM?tab=License-1-ov-file#readme
Jak je to klasifikováno
Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.
- Frontier model
- Yes
- Proč je to sledováno
- Highly cited,SOTA improvement
- Záznam důvěry
- Likely
- Citace
- 2,766
- Benchmark data
- Megatron-LM (8.3B)
"Using the GPT-2 model we achieve SOTA results on the WikiText103 (10.8 compared to SOTA perplexity of 15.8) and LAMBADA" GPT-2 model here meaning model similar to GPT-2
Žrovy
Odkud tento záznam pochází a kdy byl naposledy zkontrolován.
- Reference
- Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism
- Nap poslední aktualizace
- 25 May 2026
Co čísla znamenají
Odkud to přišlo
Megatron-LM (8.3B) byl zveřejněn NVIDIA, v zemi zaznamenané jako United States of America, během September 2019. Vydavatelská organizace je kategorizována jako industry.
funguje v oblasti Language, a je zaznamenán jako vykonávající úkol language modeling/generation.
Toto je uzavřený model: trénované hodnoty zůstaly u toho, kdo je vyprodukoval, a není k dispozici žádná místní verze k spuštění.
Co bylo zapotřebí k jeho vybudování
Trenovací běh spotřeboval asi 9.1 × 10²¹ FLOP, na hardwaru zaznamenáno jako NVIDIA Tesla V100 DGXS 32 GB. Tato částka měří, kolik stál výroba modelu, a nemá žádný vliv na to, jak rychle odpovídá.
Bylo to trénováno na korpusu asi 46,400,000,000 tokeny textu
Jeho kritérium zahrnutí: highly cited,SOTA improvement.
Odpovědi
Megatron-LM (8.3B) — běžné otázky
Megatron-LM (8.3B)— Kdy byl vydán?
Bylo to zveřejněno v September 2019. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.
Megatron-LM (8.3B)— K čemu se to používá?
funguje v oblasti Language, a je zaznamenáno jako zpracovávající úkol language modeling/generation. Toto jsou oblasti, kolem nichž byl navržen; popisují záměr spíše než tvrdou hranici.
Megatron-LM (8.3B)— kolik výpočetního výkonu bylo použito k jeho trénování?
Trénink spotřeboval kolem 9.1 × 10²¹ FLOP, na hardwaru zaznamenáno jako NVIDIA Tesla V100 DGXS 32 GB. To měří, co stálo výrobu modelu, a neříká nic o tom, jak rychle odpovídá po natrénování — rychlost inferencí závisí na šířce pásma paměti, nikoli na rozpočtu na trénink.
Megatron-LM (8.3B)— Jakou GPU potřebuji k jejímu spuštění?
Žádné. Toto je uzavřený model — jeho váhy nikdy nebyly zveřejněny, takže jej nelze stáhnout nebo spustit na vlastním hardwaru za žádnou cenu. Je dostupný pouze prostřednictvím jeho poskytovatele.
Megatron-LM (8.3B)— Je to OPEN SOURCE?
Ne. Jeho váhy nebyly zveřejněny, takže existuje pouze jako služba řízená jeho vlastníkem.
Megatron-LM (8.3B)— kolik má parametrů?
Má počet parametrů 8.3B. Source: https://lair.lighton.ai/akronomicon/ Archived source: https://web.archive.org/web/20211220142906/https://lair.lighton.ai/akronomicon/ Data also available on GitHub: https://github.com/lightonai/akronomicon/blob/main/akrodb/NVIDIA/Megatron-LM.json. Tato cifra je celková a rozhoduje o tom, kolik VRAM model potřebuje — přibližně půl gigabajtu na miliardu při kompresi, kterou většina lidí používá.
Megatron-LM (8.3B)— Kdo to vytvořil?
Bylo to publikováno společností NVIDIA, zakládající se na United States of America, organizace zařazená jako industry.
Druhý směr
Díváte se na to z druhé strany?
Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.