Big Transformer for Back-Translation
Žádný odhad
Žádné hardwarové požadavky pro tento model
Hmotnosti tohoto modelu jsou otevřené, ale žádný počet parametrů pro něj nebyl zveřejněn. Každé číslo týkající se paměti a rychlosti vychází z této hodnoty, takže bychom raději nic neukázali, než fabrikaovaný odhad..
Na záznamu
Plná specifikace
Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..
Původ
Kdo vytvořil tento model, kde a kdy byl publikován.
- Organizace
- Facebook AI Research,Google Brain
- Typ organizace
- Industry,Industry
- Země
- United States of America, France
- Publikováno
- 28 August 2018
- Autoři
- Sergey Edunov, Myle Ott, Michael Auli, David Grangier
Co to dělá
Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.
- Doména
- Language
- Úkol
- Translation
- Přístup
- Supervised
- Číselný formát
- FP16
Velikost
Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.
- Výcviková data
- 4,520,000,000 tokens
"Finally, for WMT English-German we train on all 226M available monolingual training sentences and perform 250K updates in 22.5 hours on 128 GPUs." We assume that 1 sentence have 15 words
Výpočty pro trénink
Aritmetika prováděná k trénování modelu, měřená v operacích s plovoucí desetinnou čárkou. Je to měřítko toho, kolik stál tréninkový běh, ne jak rychle hotový model na vás odpovídá.
- Výpočty pro trénink
- 4.8 × 10²⁰ FLOP
- Jak bylo ustanoveno
- Hardware
(128) * (1.25e14) * (27*3600 + 40*60) * (0.3) = 4.7808e20 (number of gpus) * (peak flops) * (seconds) * (assumed utilization rate) "We run experiments on DGX-1 machines with 8Nvidia V100 GPUs and machines are interconnected by Infiniband. Experiments are run on 16 machines and we perform 30K synchronous updates." "We also use the NCCL2 library [...] with 16-bit floating point operations" NCCL2 supported tensor core operations at 1.25e14 FLOP/s on a V100 for FP16 in section 5.6 we have "t…
Tréninkový běh
Co fyzicky vyžadovalo trénování: které čipy, kolik, jak dlouho a co to vyžadovalo ze zásuvky.
- Tréninkový hardware
- NVIDIA Tesla V100 DGXS 16 GB
- Používané čipy
- 128
- Čip-hodiny
- 3,541
- Doba reálného času
- 28 hours
- Příkon
- 66.2 kW
- Náklady na výpočet
- $2,442
"training updates in 27h 40min on 128 GPUs"
Dostupnost
Zda můžete získat model a spustit ho na svém vlastním hardwaru, což rozhoduje o tom, zda se některé z čísel grafických karet na této stránce vztahují.
- Hmotnosti
- Open — downloadable
- Přístup k modelu
- Open weights (unrestricted)
- Tréninkový kód
- Open source
Code and weights, MIT license: https://github.com/facebookresearch/fairseq/blob/main/examples/backtranslation/README.md
Jak je to klasifikováno
Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.
- Proč je to sledováno
- Highly cited,SOTA improvement
- Záznam důvěry
- Likely
- Citace
- 1,155
"Finally, we scale to hundreds of millions of monolingual sentences and achieve a new state of the art of 35 BLEU on the WMT'14 English-German test set. "
Žrovy
Odkud tento záznam pochází a kdy byl naposledy zkontrolován.
- Reference
- Understanding Back-Translation at Scale
- Nap poslední aktualizace
- 28 November 2025
Co čísla znamenají
Pozadí
Big Transformer for Back-Translation byl zveřejněn Facebook AI Research,Google Brain, v zemi zaznamenané jako United States of America, během August 2018. Vydavatelská organizace je kategorizována jako industry,Industry.
funguje v oblasti Language, a je zaznamenán jako vykonávající úkol translation.
Zveřejněné váhy znamenají, že model běží na vašem stroji, nikoli na stroji někoho jiného, což činí otázku ohledně hardwaru níže odpovídatelnou.
Co bylo zapotřebí k jeho vybudování
Trénování si vyžádalo výpočetní rozpočet přibližně 4.8 × 10²⁰ FLOP, na hardwaru zaznamenáno jako NVIDIA Tesla V100 DGXS 16 GB. Tato částka měří, kolik stál výroba modelu, a nemá žádný vliv na to, jak rychle odpovídá.
Trénink spotřeboval korpus kolem 4,520,000,000 tokeny textu
Důvod, proč se to v tomto katalogu vůbec objevuje: highly cited,SOTA improvement.
Odpovědi
Big Transformer for Back-Translation — běžné otázky
Big Transformer for Back-Translation— Kdy byl vydán?
Bylo to zveřejněno v August 2018. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.
Big Transformer for Back-Translation— K čemu se to používá?
funguje v oblasti Language, a je zaznamenáno jako zpracovávající úkol translation. Modely často obsahují více než jeden z každého a štítky popisují účel spíše než omezení schopností.
Big Transformer for Back-Translation— kde si to mohu stáhnout?
Váhy jsou zveřejněny, i když nemáme odkaz na repozitář. Tato stránka vypočítává hardwarové požadavky spíše než aby hostila modelové soubory.
Big Transformer for Back-Translation— kolik výpočetního výkonu bylo použito k jeho trénování?
Trénink spotřeboval kolem 4.8 × 10²⁰ FLOP, na hardwaru zaznamenáno jako NVIDIA Tesla V100 DGXS 16 GB. To měří, co stálo výrobu modelu, a neříká nic o tom, jak rychle odpovídá po natrénování — rychlost inferencí závisí na šířce pásma paměti, nikoli na rozpočtu na trénink.
Big Transformer for Back-Translation— Jakou GPU potřebuji k jejímu spuštění?
Nemůžeme říct. Má otevřené váhy, ale žádný počet parametrů pro něj nebyl zveřejněn a každý výpočet paměti a rychlosti začíná od toho čísla. Raději bychom ukázali nic než vykonstruovaný odhad.
Big Transformer for Back-Translation— Je to OPEN SOURCE?
Jeho váhy jsou zveřejněny, takže si je lze stáhnout a spustit na vlastním hardwaru. Všimněte si, že open WEIGHTS není totéž co open SOURCE v plném smyslu — neříká nic o tréninkových datech, tréninkovém kódu nebo obchodních podmínkách připojených.
Big Transformer for Back-Translation— kolik má parametrů?
Pro něj nebyl zveřejněn žádný počet parametrů, a proto se na této stránce neobjevují žádné údaje o paměti nebo rychlosti.
Big Transformer for Back-Translation— Kdo to vytvořil?
Bylo to publikováno společností Facebook AI Research,Google Brain, zakládající se na United States of America, organizace zařazená jako industry,Industry.
Druhý směr
Díváte se na to z druhé strany?
Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.