Big Transformer for Back-Translation
Nincs becslés
Nincs hardver követelmény ennek a modellnek
Ez a modell súlyai nyilvánosak, de a paraméterszámokat nem tették közzé. Minden memória- és sebességszám ebből a számból indul, ezért inkább nem mutatunk semmit, mint egy hamisított becslést..
Nyilvántartásban
Teljes specifikáció
Minden feljegyzett ezzel a modellel kapcsolatban. A legtöbbje azt írja le, hogyan képezték ki, nem pedig azt, hogyan fut — hasznos kontextus annak megítéléséhez, hogy mennyi munka ment bele, és hogyan viszonyul a más méretben épített modellekhez..
Eredet
Ki építette ezt a modellt, hol, és mikor publikálták.
- Szervezet
- Facebook AI Research,Google Brain
- Szervezet típusa
- Industry,Industry
- Ország
- United States of America, France
- Közölt
- 28 August 2018
- Szerzők
- Sergey Edunov, Myle Ott, Michael Auli, David Grangier
Mit csinál
A probléma területek, amelyekre a modell készült. Egy modell több mindegyikből hordozhat.
- Tartomány
- Language
- Feladat
- Translation
- Megközelítés
- Supervised
- Numerikus formátum
- FP16
Méret
Mekkora a modell, és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek eldöntik, hogy az adott grafikus kártyára illeszkedik-e.
- Képzési adatok
- 4,520,000,000 tokens
"Finally, for WMT English-German we train on all 226M available monolingual training sentences and perform 250K updates in 22.5 hours on 128 GPUs." We assume that 1 sentence have 15 words
Képzés számítás
A modell tanításához végrehajtott aritmetika, lebegőpontos műveletekben mérve. Ez a tanítási futás költségének mértéke, nem pedig annak, hogy mennyire gyorsan válaszol a kész modell.
- Képzés számítás
- 4.8 × 10²⁰ FLOP
- Hogyan jött létre
- Hardware
(128) * (1.25e14) * (27*3600 + 40*60) * (0.3) = 4.7808e20 (number of gpus) * (peak flops) * (seconds) * (assumed utilization rate) "We run experiments on DGX-1 machines with 8Nvidia V100 GPUs and machines are interconnected by Infiniband. Experiments are run on 16 machines and we perform 30K synchronous updates." "We also use the NCCL2 library [...] with 16-bit floating point operations" NCCL2 supported tensor core operations at 1.25e14 FLOP/s on a V100 for FP16 in section 5.6 we have "t…
A tréning futás
Ami fizikailag szükséges volt a betanításhoz: mely chipek, hány, mennyi ideig, és ez mit fogyasztott a falból.
- Képzési hardver
- NVIDIA Tesla V100 DGXS 16 GB
- Használt chipek
- 128
- Chip-óra
- 3,541
- Fali óra idő
- 28 hours
- Teljesítményfogyasztás
- 66.2 kW
- Számítási költség
- $2,442
"training updates in 27h 40min on 128 GPUs"
Elérhetőség
Hogy meg tudja-e szerezni a modellt és futtatni a saját hardverén, ez dönt arról, hogy alkalmazhatóak-e a lap ezen oldalán feltüntetett grafikus kártya adatok.
- Súlyok
- Open — downloadable
- Modell hozzáférés
- Open weights (unrestricted)
- Képzés kód
- Open source
Code and weights, MIT license: https://github.com/facebookresearch/fairseq/blob/main/examples/backtranslation/README.md
Hogyan van besorolva
Címkék a forráshalmazra, amelyeket a figyelemre méltó modellek nyomon követésekor alkalmaznak, és hogy mennyire biztos az adatbevitelben.
- Miért követik nyomon
- Highly cited,SOTA improvement
- Nyilvántartási bizalom
- Likely
- Hivatkozások
- 1,155
"Finally, we scale to hundreds of millions of monolingual sentences and achieve a new state of the art of 35 BLEU on the WMT'14 English-German test set. "
Források
Honnan származik ez a felvétel és mikor ellenőrizték utoljára.
- Referencia
- Understanding Back-Translation at Scale
- Utoljára frissítve
- 28 November 2025
Mit jelentenek a számok
Háttér
Big Transformer for Back-Translation ki lett adva által Facebook AI Research,Google Brain, az országban rögzítve mint United States of America, alatt August 2018. A kiadó szervezet a következő kategóriába tartozik industry,Industry.
Működik a területen a Language, és úgy van rögzítve, mint a feladat végrehajtása translation.
A közzétett súlyok azt jelentik, hogy a modell a te gépeden fut, nem pedig valaki másén, ami lehetővé teszi az alábbi hardverkérdés megválaszolását.
Mi került a felépítésébe
A betanításhoz körülbelül egy számítási költségvetés kellett 4.8 × 10²⁰ FLOP, hardveren rögzítve NVIDIA Tesla V100 DGXS 16 GB. Ez a szám azt méri, hogy mennyibe került a modell előállítása, és nincs hatással arra, hogy milyen gyorsan válaszol.
A képzés körülbelül egy korpuszt fogyasztott 4,520,000,000 szöveg tokenjei
Az oka, hogy egyáltalán megjelenik ebben a katalógusban: highly cited,SOTA improvement.
Válaszok
Big Transformer for Back-Translation — gyakori kérdések
Big Transformer for Back-Translation— Mikor adták ki?
Kibocsátották a August 2018. A paraméterenkénti képesség lényegesen javult azóta, így egy újabb, azonos méretű modell gyakran jobb felhasználása a same hardvernek.
Big Transformer for Back-Translation— Mire használják?
Működik a területen a Language, és rögzítve van, hogy kezeli a feladatot translation. A modellek gyakran több mint egyet hordoznak mindegyikből, és a címkék a célra, nem pedig a képességek határaira utalnak.
Big Transformer for Back-Translation— Hol tudom letölteni?
A súlyok közzététele megtörtént, bár nem rendelkezünk tárolólinkkel erre. Ez az oldal a hardverkövetelményeket számítja ki, nem pedig modellfájlokat tárol.
Big Transformer for Back-Translation— mennyi számítási kapacitást használtak annak a betanításához?
A képzés körülbelül elfogyasztott 4.8 × 10²⁰ FLOP, hardveren rögzítve NVIDIA Tesla V100 DGXS 16 GB. Ez azt méri, hogy mennyibe került a modell előállítása, és semmit nem mond arról, hogy milyen gyorsan válaszol, miután betanult — a következtetési sebesség a memória sávszélességéből származik, nem az edzési költségvetésből.
Big Transformer for Back-Translation— Milyen GPU-ra van szükségem, hogy futtathassam?
Nem tudjuk megmondani. Nyílt súlyai vannak, de a paraméterek számát nem tették közzé, és minden memória- és sebességszámítás ebből a számból indul. Inkább nem mutatunk semmit, mint egy hamisított becslést.
Big Transformer for Back-Translation— Nyílt forráskódú?
Súlyai közzétételre kerültek, így letölthető és futtatható a saját hardvereden. Ne feledd, hogy az open weight nem azonos az open source teljes értelmében — nem mond semmit a tanulási adatokkal, a tanulási kóddal vagy a kereskedelmi feltételekkel kapcsolatban.
Big Transformer for Back-Translation— Hány paramétere van?
Nincs közzétéve paraméterszám, ezért ez az oldal nem tartalmaz memóriával vagy sebességgel kapcsolatos adatokat.
Big Transformer for Back-Translation— Ki készítette ezt?
Kiadta Facebook AI Research,Google Brain, alapján United States of America, egy szervezet, amelyet kategorizáltak mint industry,Industry.
A másik irány
Másik oldalról nézve?
Ez az oldal a modellel kezdődik. Ha már van kártyád, és szeretnéd tudni, hogy mindent futtat-e, Kezdj a hardverből..