ConvS2S (ensemble of 8 models)
Geen schatting
Geen hardware-eisen voor dit model
De gewichten voor dit model zijn niet gepubliceerd, dus het kan niet worden gedownload of uitgevoerd op je eigen hardware in welke grootte dan ook. Het is alleen bereikbaar via de aanbieder, en geen enkele grafische kaart verandert dat..
Op record
Volledige specificatie
Alles wat geregistreerd is voor dit model. Het merendeel beschrijft hoe het getraind werd in plaats van hoe het draait - nuttige context om te beoordelen hoeveel werk erin is gestoken, en hoe het zich verhoudt tot modellen die op een andere schaal zijn gebouwd..
Oorsprong
Wie heeft dit model gebouwd, waar, en wanneer het gepubliceerd werd.
- Organisatie
- Meta AI
- Organisatietype
- Industry
- Land
- United States of America
- Gepubliceerd
- 25 July 2017
- Auteurs
- Jonas Gehring, Michael Auli, David Grangier, Denis Yarats, Yann N. Dauphin
Wat het doet
De probleemgebieden waarvoor het model is gebouwd. Een model kan meerdere van elk bevatten.
- Domein
- Language
- Taak
- Translation
Grootte
Hoe groot het model is en hoeveel data het is getraind. Parameters zijn het cijfer dat bepaalt of het past op een gegeven grafische kaart.
- Training gegevens
- 1,183,333,333 tokens
2.8M + 4.5M + 35.5M + 3.8M = 46.6M We consider three major WMT translation tasks as well as a text summarization task. WMT’16 English-Romanian. We use the same data and pre-processing as Sennrich et al. (2016b) but remove sentences with more than 175 words. This results in 2.8M sentence pairs for training and we evaluate on newstest2016.2 WMT’14 English-German. We use the same setup as Luong et al. (2015) which comprises 4.5M sentence pairs for training and we test on newstest2014. WMT’14 En…
Training rekenen
De berekeningen uitgevoerd om het model te trainen, gemeten in drijvende-komma-operaties. Het is een maat voor wat de trainingsrun kostte, niet voor hoe snel het voltooide model je beantwoordt.
- Training rekenen
- 5.6 × 10¹⁹ FLOP
- Hoe het werd opgericht
- Hardware
All models are implemented in Torch (Collobert et al., 2011) and trained on a single Nvidia M40 GPU except for WMT’14 English-French for which we use a multi-GPU setup on a single machine. We train on up to eight GPUs synchronously by maintaining copies of the model on each card and split the batch so that each worker computes 1/8-th of the gradients; at the end we sum the gradients via Nvidia NCCL. 1. English-Romanian: "Training took between 6 and 7.5 days on a single GPU." 7 days * 24 * 3600 …
De trainingsrun
Wat het fysiek kostte om te trainen: welke chips, hoeveel, hoe lang, en wat dat van het stopcontact vroeg.
- Training hardware
- NVIDIA M40
Hoe het is geclassificeerd
Labels van de brondataset die worden toegepast bij het volgen van opmerkelijke modellen, en hoe zeker het is van de invoer.
- Waarom het wordt gevolgd
- Highly cited,SOTA improvement
- Record vertrouwen
- Likely
"We achieve a new state of the art on several public translation benchmark data sets. On the WMT’16 EnglishRomanian task we outperform the previous best result by 1.9 BLEU, on WMT’14 English-French translation we improve over the LSTM model of Wu et al. (2016) by 1.6 BLEU in a comparable setting, and on WMT’14 EnglishGerman translation we ouperform the same model by 0.5 BLEU"
Bronnen
Waar deze record vandaan kwam en wanneer deze voor het laatst is gecontroleerd.
- Referentie
- Convolutional Sequence to Sequence Learning
- Laatst bijgewerkt
- 11 February 2026
Wat de cijfers betekenen
Wat dit model is
ConvS2S (ensemble of 8 models) werd gepubliceerd door Meta AI, in het land geregistreerd als United States of America, tijdens July 2017. De publicerende organisatie is geclassificeerd als industry.
Het werkt in het domein van Language, en wordt geregistreerd als het uitvoeren van de taak van translation.
Dit is een gesloten model: de getrainde waarden zijn bij degene gebleven die ze geproduceerd hebben, en er is geen lokale versie om te draaien.
Training en herkomst
Training kostte een rekensbudget van ongeveer 5.6 × 10¹⁹ FLOP, op hardware vastgelegd als NVIDIA M40. Die figuur meet wat het produceren van het model heeft gekost en heeft geen invloed op hoe snel het antwoord geeft.
De trainingsset liep naar ongeveer 1,183,333,333 tekstokens
Het wordt gevolgd in de onderliggende dataset om één specifieke reden: highly cited,SOTA improvement.
Antwoorden
ConvS2S (ensemble of 8 models) — veelgestelde vragen
ConvS2S (ensemble of 8 models)— wanneer is het uitgebracht?
Het werd gepubliceerd in July 2017. De capaciteit per parameter is aanzienlijk verbeterd sinds, zodat een nieuwere model van dezelfde grootte vaak een betere benutting van dezelfde hardware is.
ConvS2S (ensemble of 8 models)— waarvoor wordt het gebruikt?
Het werkt in het domein van Language, en wordt geregistreerd als het afhandelen van translation. Modellen hebben vaak meer dan één van elk, en de tags beschrijven het doel in plaats van de capaciteitslimieten.
ConvS2S (ensemble of 8 models)— hoeveel rekencapaciteit is gebruikt om het te trainen?
Training verbruikte ongeveer 5.6 × 10¹⁹ FLOP, op hardware vastgelegd als NVIDIA M40. Dat meet wat het kosten om het model te produceren en zegt niets over hoe snel het antwoord geeft zodra het getraind is — inferentie snelheid komt van geheugenbandbreedte, niet van het trainingsbudget.
ConvS2S (ensemble of 8 models)— Welke GPU heb ik nodig om het te draaien?
Dit is een gesloten model — de gewichten zijn nooit gepubliceerd, dus het kan niet gedownload of uitgevoerd worden op je eigen hardware voor eender welke prijs. Het is alleen bereikbaar via de aanbieder.
ConvS2S (ensemble of 8 models)— is het open-source?
De licenties werden nooit vastgelegd in onze brondocumenten. We beschouwen niet-verklaarde licenties als gesloten, omdat een niet-vastgelegde licentie er geen is om op te vertrouwen.
ConvS2S (ensemble of 8 models)— hoeveel parameters heeft het?
Er is geen parameter telling gepubliceerd, daarom verschijnt er geen geheugen of snelheidsfiguur op deze pagina.
ConvS2S (ensemble of 8 models)— wie heeft het gemaakt?
Het werd gepubliceerd door Meta AI, gebaseerd op United States of America, een organisatie geclassificeerd als industry.
De andere richting
Van de andere kant bekijken?
Deze pagina begint met het model. Als je al een kaart bezit en alles wilt weten wat het zal draaien, begin in plaats van de hardware.