ConvS2S (ensemble of 8 models)
Žádný odhad
Žádné hardwarové požadavky pro tento model
Hmotnosti pro tento model nebyly zveřejněny, takže jej nelze stáhnout ani spustit na vlastním hardwaru v žádné velikosti. Je dostupný pouze prostřednictvím svého poskytovatele, a žádná změna grafické karty to nezmění..
Na záznamu
Plná specifikace
Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..
Původ
Kdo vytvořil tento model, kde a kdy byl publikován.
- Organizace
- Meta AI
- Typ organizace
- Industry
- Země
- United States of America
- Publikováno
- 25 July 2017
- Autoři
- Jonas Gehring, Michael Auli, David Grangier, Denis Yarats, Yann N. Dauphin
Co to dělá
Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.
- Doména
- Language
- Úkol
- Translation
Velikost
Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.
- Výcviková data
- 1,183,333,333 tokens
2.8M + 4.5M + 35.5M + 3.8M = 46.6M We consider three major WMT translation tasks as well as a text summarization task. WMT’16 English-Romanian. We use the same data and pre-processing as Sennrich et al. (2016b) but remove sentences with more than 175 words. This results in 2.8M sentence pairs for training and we evaluate on newstest2016.2 WMT’14 English-German. We use the same setup as Luong et al. (2015) which comprises 4.5M sentence pairs for training and we test on newstest2014. WMT’14 En…
Výpočty pro trénink
Aritmetika prováděná k trénování modelu, měřená v operacích s plovoucí desetinnou čárkou. Je to měřítko toho, kolik stál tréninkový běh, ne jak rychle hotový model na vás odpovídá.
- Výpočty pro trénink
- 5.6 × 10¹⁹ FLOP
- Jak bylo ustanoveno
- Hardware
All models are implemented in Torch (Collobert et al., 2011) and trained on a single Nvidia M40 GPU except for WMT’14 English-French for which we use a multi-GPU setup on a single machine. We train on up to eight GPUs synchronously by maintaining copies of the model on each card and split the batch so that each worker computes 1/8-th of the gradients; at the end we sum the gradients via Nvidia NCCL. 1. English-Romanian: "Training took between 6 and 7.5 days on a single GPU." 7 days * 24 * 3600 …
Tréninkový běh
Co fyzicky vyžadovalo trénování: které čipy, kolik, jak dlouho a co to vyžadovalo ze zásuvky.
- Tréninkový hardware
- NVIDIA M40
Jak je to klasifikováno
Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.
- Proč je to sledováno
- Highly cited,SOTA improvement
- Záznam důvěry
- Likely
"We achieve a new state of the art on several public translation benchmark data sets. On the WMT’16 EnglishRomanian task we outperform the previous best result by 1.9 BLEU, on WMT’14 English-French translation we improve over the LSTM model of Wu et al. (2016) by 1.6 BLEU in a comparable setting, and on WMT’14 EnglishGerman translation we ouperform the same model by 0.5 BLEU"
Žrovy
Odkud tento záznam pochází a kdy byl naposledy zkontrolován.
- Reference
- Convolutional Sequence to Sequence Learning
- Nap poslední aktualizace
- 11 February 2026
Co čísla znamenají
Co je tento MODEL
ConvS2S (ensemble of 8 models) byl zveřejněn Meta AI, v zemi zaznamenané jako United States of America, během July 2017. Vydavatelská organizace je kategorizována jako industry.
funguje v oblasti Language, a je zaznamenán jako vykonávající úkol translation.
Toto je uzavřený model: trénované hodnoty zůstaly u toho, kdo je vyprodukoval, a není k dispozici žádná místní verze k spuštění.
Trénink a původ
Trénování si vyžádalo výpočetní rozpočet přibližně 5.6 × 10¹⁹ FLOP, na hardwaru zaznamenáno jako NVIDIA M40. Tato částka měří, kolik stál výroba modelu, a nemá žádný vliv na to, jak rychle odpovídá.
Tréninková sada běžela na přibližně 1,183,333,333 tokeny textu
Je sledováno v základním datasetu z jednoho konkrétního důvodu: highly cited,SOTA improvement.
Odpovědi
ConvS2S (ensemble of 8 models) — běžné otázky
ConvS2S (ensemble of 8 models)— Kdy byl vydán?
Bylo to zveřejněno v July 2017. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.
ConvS2S (ensemble of 8 models)— K čemu se to používá?
funguje v oblasti Language, a je zaznamenáno jako zpracovávající úkol translation. Modely často obsahují více než jeden z každého a štítky popisují účel spíše než omezení schopností.
ConvS2S (ensemble of 8 models)— kolik výpočetního výkonu bylo použito k jeho trénování?
Trénink spotřeboval kolem 5.6 × 10¹⁹ FLOP, na hardwaru zaznamenáno jako NVIDIA M40. To měří, co stálo výrobu modelu, a neříká nic o tom, jak rychle odpovídá po natrénování — rychlost inferencí závisí na šířce pásma paměti, nikoli na rozpočtu na trénink.
ConvS2S (ensemble of 8 models)— Jakou GPU potřebuji k jejímu spuštění?
Žádné. Toto je uzavřený model — jeho váhy nikdy nebyly zveřejněny, takže jej nelze stáhnout nebo spustit na vlastním hardwaru za žádnou cenu. Je dostupný pouze prostřednictvím jeho poskytovatele.
ConvS2S (ensemble of 8 models)— Je to OPEN SOURCE?
Licencování nikdy nebylo zaznamenáno v našich zdrojových datech. Neuváděné licencování považujeme za uzavřené, protože nezaznamenaná licence není na kterou by se dalo spoléhat.
ConvS2S (ensemble of 8 models)— kolik má parametrů?
Pro něj nebyl zveřejněn žádný počet parametrů, a proto se na této stránce neobjevují žádné údaje o paměti nebo rychlosti.
ConvS2S (ensemble of 8 models)— Kdo to vytvořil?
Bylo to publikováno společností Meta AI, zakládající se na United States of America, organizace zařazená jako industry.
Druhý směr
Díváte se na to z druhé strany?
Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.