Big Transformer for Back-Translation

Otevřít váhy Facebook AI Research,Google Brain August 2018

Žádný odhad

Žádné hardwarové požadavky pro tento model

Hmotnosti tohoto modelu jsou otevřené, ale žádný počet parametrů pro něj nebyl zveřejněn. Každé číslo týkající se paměti a rychlosti vychází z této hodnoty, takže bychom raději nic neukázali, než fabrikaovaný odhad..

Na záznamu

Plná specifikace

Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..

Původ

Kdo vytvořil tento model, kde a kdy byl publikován.

Organizace
Facebook AI Research,Google Brain
Typ organizace
Industry,Industry
Země
United States of America, France
Publikováno
28 August 2018
Autoři
Sergey Edunov, Myle Ott, Michael Auli, David Grangier

Co to dělá

Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.

Doména
Language
Úkol
Translation
Přístup
Supervised
Číselný formát
FP16

Velikost

Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.

Výcviková data
4,520,000,000 tokens

"Finally, for WMT English-German we train on all 226M available monolingual training sentences and perform 250K updates in 22.5 hours on 128 GPUs." We assume that 1 sentence have 15 words

Výpočty pro trénink

Aritmetika prováděná k trénování modelu, měřená v operacích s plovoucí desetinnou čárkou. Je to měřítko toho, kolik stál tréninkový běh, ne jak rychle hotový model na vás odpovídá.

Výpočty pro trénink
4.8 × 10²⁰ FLOP

(128) * (1.25e14) * (27*3600 + 40*60) * (0.3) = 4.7808e20 (number of gpus) * (peak flops) * (seconds) * (assumed utilization rate) "We run experiments on DGX-1 machines with 8Nvidia V100 GPUs and machines are interconnected by Infiniband. Experiments are run on 16 machines and we perform 30K synchronous updates." "We also use the NCCL2 library [...] with 16-bit floating point operations" NCCL2 supported tensor core operations at 1.25e14 FLOP/s on a V100 for FP16 in section 5.6 we have "t…

Jak bylo ustanoveno
Hardware

Tréninkový běh

Co fyzicky vyžadovalo trénování: které čipy, kolik, jak dlouho a co to vyžadovalo ze zásuvky.

Tréninkový hardware
NVIDIA Tesla V100 DGXS 16 GB
Používané čipy
128
Čip-hodiny
3,541
Doba reálného času
28 hours

"training updates in 27h 40min on 128 GPUs"

Příkon
66.2 kW
Náklady na výpočet
$2,442

Dostupnost

Zda můžete získat model a spustit ho na svém vlastním hardwaru, což rozhoduje o tom, zda se některé z čísel grafických karet na této stránce vztahují.

Hmotnosti
Open — downloadable
Přístup k modelu
Open weights (unrestricted)
Tréninkový kód
Open source

Code and weights, MIT license: https://github.com/facebookresearch/fairseq/blob/main/examples/backtranslation/README.md

Jak je to klasifikováno

Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.

Proč je to sledováno
Highly cited,SOTA improvement

"Finally, we scale to hundreds of millions of monolingual sentences and achieve a new state of the art of 35 BLEU on the WMT'14 English-German test set. "

Záznam důvěry
Likely
Citace
1,155

Žrovy

Odkud tento záznam pochází a kdy byl naposledy zkontrolován.

Reference
Understanding Back-Translation at Scale
Nap poslední aktualizace
28 November 2025

Co čísla znamenají

Pozadí

Big Transformer for Back-Translation byl zveřejněn Facebook AI Research,Google Brain, v zemi zaznamenané jako United States of America, během August 2018. Vydavatelská organizace je kategorizována jako industry,Industry.

funguje v oblasti Language, a je zaznamenán jako vykonávající úkol translation.

Zveřejněné váhy znamenají, že model běží na vašem stroji, nikoli na stroji někoho jiného, což činí otázku ohledně hardwaru níže odpovídatelnou.

Co bylo zapotřebí k jeho vybudování

Trénování si vyžádalo výpočetní rozpočet přibližně 4.8 × 10²⁰ FLOP, na hardwaru zaznamenáno jako NVIDIA Tesla V100 DGXS 16 GB. Tato částka měří, kolik stál výroba modelu, a nemá žádný vliv na to, jak rychle odpovídá.

Trénink spotřeboval korpus kolem 4,520,000,000 tokeny textu

Důvod, proč se to v tomto katalogu vůbec objevuje: highly cited,SOTA improvement.

Odpovědi

Big Transformer for Back-Translation — běžné otázky

01

Big Transformer for Back-Translation— Kdy byl vydán?

Bylo to zveřejněno v August 2018. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.

02

Big Transformer for Back-Translation— K čemu se to používá?

funguje v oblasti Language, a je zaznamenáno jako zpracovávající úkol translation. Modely často obsahují více než jeden z každého a štítky popisují účel spíše než omezení schopností.

03

Big Transformer for Back-Translation— kde si to mohu stáhnout?

Váhy jsou zveřejněny, i když nemáme odkaz na repozitář. Tato stránka vypočítává hardwarové požadavky spíše než aby hostila modelové soubory.

04

Big Transformer for Back-Translation— kolik výpočetního výkonu bylo použito k jeho trénování?

Trénink spotřeboval kolem 4.8 × 10²⁰ FLOP, na hardwaru zaznamenáno jako NVIDIA Tesla V100 DGXS 16 GB. To měří, co stálo výrobu modelu, a neříká nic o tom, jak rychle odpovídá po natrénování — rychlost inferencí závisí na šířce pásma paměti, nikoli na rozpočtu na trénink.

05

Big Transformer for Back-Translation— Jakou GPU potřebuji k jejímu spuštění?

Nemůžeme říct. Má otevřené váhy, ale žádný počet parametrů pro něj nebyl zveřejněn a každý výpočet paměti a rychlosti začíná od toho čísla. Raději bychom ukázali nic než vykonstruovaný odhad.

06

Big Transformer for Back-Translation— Je to OPEN SOURCE?

Jeho váhy jsou zveřejněny, takže si je lze stáhnout a spustit na vlastním hardwaru. Všimněte si, že open WEIGHTS není totéž co open SOURCE v plném smyslu — neříká nic o tréninkových datech, tréninkovém kódu nebo obchodních podmínkách připojených.

07

Big Transformer for Back-Translation— kolik má parametrů?

Pro něj nebyl zveřejněn žádný počet parametrů, a proto se na této stránce neobjevují žádné údaje o paměti nebo rychlosti.

08

Big Transformer for Back-Translation— Kdo to vytvořil?

Bylo to publikováno společností Facebook AI Research,Google Brain, zakládající se na United States of America, organizace zařazená jako industry,Industry.

Zdroj

Původní publikace

Nahrávka naposledy aktualizována 28 November 2025

Druhý směr

Díváte se na to z druhé strany?

Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.