Big Transformer for Back-Translation
Brak oszacowania
Brak wymagań sprzętowych dla tego modelu
Wagi tego modelu są OPEN, ale nie opublikowano liczby parametrów. Każda figura dotycząca MEMORY i prędkości zaczyna się od tej liczby, więc wolelibyśmy nic nie pokazywać niż wymyśloną estymację..
Na nagranie
Pełna specyfikacja
Wszystko na rekord dla tego modelu. Większość z tego opisuje, jak był trenowany, a nie jak działa — użyteczny kontekst do oceny, ile pracy włożono w to, i jak wypada w porównaniu z modelami budowanymi w innym skali..
Pochodzenie
Kto zbudował ten model, gdzie i kiedy został opublikowany.
- Organizacja
- Facebook AI Research,Google Brain
- Typ organizacji
- Industry,Industry
- Kraj
- United States of America, France
- Opublikowany
- 28 August 2018
- Autorzy
- Sergey Edunov, Myle Ott, Michael Auli, David Grangier
Co to robi
Obszary problemowe, dla których stworzono model. Model może mieć kilka z każdego.
- Domena
- Language
- Zadanie
- Translation
- Podejście
- Supervised
- Format numeryczny
- FP16
Rozmiar
Jak duży jest model i na ile danych był trenowany. Parametry to liczba, która decyduje, czy mieści się na danej karcie graficznej.
- Dane treningowe
- 4,520,000,000 tokens
"Finally, for WMT English-German we train on all 226M available monolingual training sentences and perform 250K updates in 22.5 hours on 128 GPUs." We assume that 1 sentence have 15 words
Obliczenia treningowe
Arytmetyka wykonywana w celu wytrenowania modelu, mierzona w operacjach zmiennoprzecinkowych. Jest to miara kosztów przeprowadzenia treningu, a nie tego, jak szybko gotowy model odpowiada na twoje pytania.
- Obliczenia treningowe
- 4.8 × 10²⁰ FLOP
- Jak to zostało ustalone
- Hardware
(128) * (1.25e14) * (27*3600 + 40*60) * (0.3) = 4.7808e20 (number of gpus) * (peak flops) * (seconds) * (assumed utilization rate) "We run experiments on DGX-1 machines with 8Nvidia V100 GPUs and machines are interconnected by Infiniband. Experiments are run on 16 machines and we perform 30K synchronous updates." "We also use the NCCL2 library [...] with 16-bit floating point operations" NCCL2 supported tensor core operations at 1.25e14 FLOP/s on a V100 for FP16 in section 5.6 we have "t…
Przebieg szkolenia
Co fizycznie było potrzebne do treningu: jakie chipy, ile, na jak długo i co to pobierało z sieci.
- Sprzęt do trenowania
- NVIDIA Tesla V100 DGXS 16 GB
- Zastosowane chipy
- 128
- Czas-chip
- 3,541
- Czas rzeczywisty
- 28 hours
- Pobór mocy
- 66.2 kW
- Koszt obliczeniowy
- $2,442
"training updates in 27h 40min on 128 GPUs"
Dostępność
Czy możesz zdobyć model i uruchomić go na swoim sprzęcie, co decyduje o tym, czy którakolwiek z cyfr karty graficznej na tej stronie ma zastosowanie.
- Wagi
- Open — downloadable
- Dostęp do modelu
- Open weights (unrestricted)
- Kod treningowy
- Open source
Code and weights, MIT license: https://github.com/facebookresearch/fairseq/blob/main/examples/backtranslation/README.md
Jak jest klasyfikowane
Etykiety, które źródłowy zbiór danych stosuje podczas śledzenia znaczących modeli oraz jak pewny jest tego wpisu.
- Dlaczego to jest śledzone
- Highly cited,SOTA improvement
- Zapisz pewność
- Likely
- Cytaty
- 1,155
"Finally, we scale to hundreds of millions of monolingual sentences and achieve a new state of the art of 35 BLEU on the WMT'14 English-German test set. "
Źródła
Skąd pochodzi ten rekord i kiedy był ostatnio sprawdzany.
- Referencja
- Understanding Back-Translation at Scale
- Ostatnio zaktualizowane
- 28 November 2025
Co oznaczają liczby
Tło
Big Transformer for Back-Translation został opublikowany przez Facebook AI Research,Google Brain, w kraju zapisanym jako United States of America, podczas August 2018. Organizacja publikująca jest klasyfikowana jako industry,Industry.
Działa w dziedzinie Language, i jest zapisany jako wykonujący zadanie translation.
Opublikowane wagi oznaczają, że model działa na twojej maszynie, a nie na czyjejś, co sprawia, że poniższe pytanie dotyczące sprzętu jest w ogóle możliwe do odpowiedzi.
Co poszło w budowę tego
Trenowanie zajęło budżet obliczeniowy wynoszący około 4.8 × 10²⁰ FLOP, na sprzęcie zarejestrowanym jako NVIDIA Tesla V100 DGXS 16 GB. Ta liczba mierzy, ile kosztowało wyprodukowanie modelu i nie ma wpływu na to, jak szybko odpowiada.
Trening zużył korpus około 4,520,000,000 Tokeny tekstu.
Powód, dla którego w ogóle pojawia się w tym katalogu: highly cited,SOTA improvement.
Odpowiedzi
Big Transformer for Back-Translation — częste pytania
Big Transformer for Back-Translation— kiedy to zostało wydane?
Zostało opublikowane w August 2018. Możliwość na parametr znacznie się poprawiła, więc nowszy model tej samej wielkości często lepiej wykorzystuje ten sam sprzęt.
Big Transformer for Back-Translation— do czego to służy?
Działa w dziedzinie Language, i jest zarejestrowany jako realizujący zadanie translation. Modele często mają więcej niż jeden z każdego, a etykiety opisują cel, a nie ograniczenia możliwości.
Big Transformer for Back-Translation— Gdzie mogę to pobrać?
Wagi są opublikowane, chociaż nie posiadamy linku do repozytorium. Ta strona oblicza wymagania sprzętowe, a nie hostuje pliki modelu.
Big Transformer for Back-Translation— ile mocy obliczeniowej użyto do jego trenowania?
Szkolenie zajęło około 4.8 × 10²⁰ FLOP, na sprzęcie zarejestrowanym jako NVIDIA Tesla V100 DGXS 16 GB. To mierzy, ile kosztowało wyprodukowanie modelu i nie mówi nic o tym, jak szybko odpowiada po wytrenowaniu — prędkość wnioskowania pochodzi z SZEROKOŚCI PASMA, a nie z budżetu treningowego.
Big Transformer for Back-Translation— Jaką GPU potrzebuję, aby ją uruchomić?
Nie możemy powiedzieć. Ma otwarte wagi, ale nie opublikowano liczby parametrów, a wszelkie obliczenia pamięci i prędkości zaczynają się od tej liczby. Wolimy nie pokazywać niczego niż fałszywą szacunkową wartość.
Big Transformer for Back-Translation— czy jest open weight?
Jego wagi są opublikowane, więc można je pobrać i uruchomić na własnym sprzęcie. Zauważ, że OPEN WEIGHTS nie są tym samym co OPEN SOURCE w pełnym sensie — nie mówi nic o danych treningowych, kodzie treningowym, ani warunkach komercyjnych.
Big Transformer for Back-Translation— ile ma parametrów?
Nie opublikowano liczby parametrów, dlatego na tej stronie nie pojawia się żaden wskaźnik pamięci ani prędkości.
Big Transformer for Back-Translation— kto to stworzył?
Zostało opublikowane przez Facebook AI Research,Google Brain, oparty na United States of America, organizacja sklasyfikowana jako industry,Industry.
Druga strona
Patrząc na to z drugiej strony?
Ta strona zaczyna się od modelu. Jeśli już posiadasz kartę i chcesz wiedzieć, co wszystko będzie działać., Zacznij od sprzętu zamiast.