Seq2Seq LSTM
Nincs becslés
Nincs hardver követelmény ennek a modellnek
A modellhez tartozó súlyokat nem tették közzé, így nem tölthető le vagy futtatható a saját hardverén bármilyen méretben. Csak a szolgáltatóján keresztül érhető el, és egyetlen grafikus kártya sem változtat ezen..
Nyilvántartásban
Teljes specifikáció
Minden feljegyzett ezzel a modellel kapcsolatban. A legtöbbje azt írja le, hogyan képezték ki, nem pedig azt, hogyan fut — hasznos kontextus annak megítéléséhez, hogy mennyi munka ment bele, és hogyan viszonyul a más méretben épített modellekhez..
Eredet
Ki építette ezt a modellt, hol, és mikor publikálták.
- Szervezet
- Szervezet típusa
- Industry
- Ország
- United States of America
- Közölt
- 10 September 2014
- Szerzők
- Ilya Sutskever, Oriol Vinyals, Quoc V. Le
Mit csinál
A probléma területek, amelyekre a modell készült. Egy modell több mindegyikből hordozhat.
- Tartomány
- Language
- Feladat
- Translation
Méret
Mekkora a modell, és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek eldöntik, hogy az adott grafikus kártyára illeszkedik-e.
- Paraméterek
- 1.9B
- Képzési adatok
- 870,000,000 tokens
- Epochok
- 7.5
The resulting LSTM has 384M parameters of which 64M are pure recurrent connections (32M for the “encoder” LSTM and 32M for the “decoder” LSTM). The paper uses an ensemble of 5 LSTMs.
[WORDS] "We used the WMT’14 English to French dataset. We trained our models on a subset of 12M sentences consisting of 348M French words and 304M English words, which is a clean “selected” subset from [29]."
Képzés számítás
A modell tanításához végrehajtott aritmetika, lebegőpontos műveletekben mérve. Ez a tanítási futás költségének mértéke, nem pedig annak, hogy mennyire gyorsan válaszol a kész modell.
- Képzés számítás
- 5.6 × 10¹⁹ FLOP
- Hogyan jött létre
- Operation counting,Hardware,Third-party estimation
384E+6 parameters * 2 FLOP/parameter * (348E+6 + 304E+6 points per epoch) * 7.5 epochs * 3 FLOP/point ~= 1.126656e+19 FLOP Times 5 independent models in ensemble => 5.6E+19 FLOP If we assume NVIDIA K40 (in use at the time): 10 days * 24 * 60 * 60 seconds/day * 8 GPUs * 33% * 5e12 FLOP/s * 5 models in ensemble ~= 5.7E+19 FLOP Authors of "AI and Memory Wall" estimated model's training compute as 11,000 PFLOPS = 1.1*10^19 FLOPS (https://github.com/amirgholami/ai_and_memory_wall)
A tréning futás
Ami fizikailag szükséges volt a betanításhoz: mely chipek, hány, mennyi ideig, és ez mit fogyasztott a falból.
- Fali óra idő
- 240 hours (10 days)
Training took about 10 days
Hogyan van besorolva
Címkék a forráshalmazra, amelyeket a figyelemre méltó modellek nyomon követésekor alkalmaznak, és hogy mennyire biztos az adatbevitelben.
- Határmodell
- Yes
- Miért követik nyomon
- Highly cited
- Nyilvántartási bizalom
- Confident
- Hivatkozások
- 22,025
Források
Honnan származik ez a felvétel és mikor ellenőrizték utoljára.
- Referencia
- Sequence to Sequence Learning with Neural Networks
- Utoljára frissítve
- 25 May 2026
Mit jelentenek a számok
Honnan jött
Seq2Seq LSTM ki lett adva által Google, az országban rögzítve mint United States of America, alatt September 2014. A kiadó kategóriája alá tartozik industry.
Működik a területen a Language, és úgy van rögzítve, mint a feladat végrehajtása translation.
Súlyait soha nem tették közzé, így csak a szolgáltatóján keresztül érhető el. Nincs grafikus kártya, ami ezt megváltoztatná.
Mi került a felépítésébe
A létrehozásához körülbelül összesítő aritmetikára volt szükség. 5.6 × 10¹⁹ FLOP. Ez a szám azt méri, hogy mennyibe került a modell előállítása, és nincs hatással arra, hogy milyen gyorsan válaszol.
A tanító készlet kb. futott 870,000,000 szöveg tokenjei
A kiválasztási kritériuma: highly cited.
Válaszok
Seq2Seq LSTM — gyakori kérdések
Seq2Seq LSTM— Nyílt forráskódú?
A licencálás sosem volt rögzítve a forrásadatainkban. Az állandóan nem megadott licencet zártnak tekintjük, mert a nem rögzített licenc nem egy megbízható.
Seq2Seq LSTM— Hány paramétere van?
Paraméterszáma 1.9B. The resulting LSTM has 384M parameters of which 64M are pure recurrent connections (32M for the “encoder” LSTM and 32M for the “decoder” LSTM). The paper uses an ensemble of 5 LSTMs. Ez a szám a teljes összeg, és ez határozza meg, hogy mennyi VRAM-ra van szüksége a modelleknek — körülbelül fél gigabájt milliárdonként a legtöbb ember által használt tömörítési módban.
Seq2Seq LSTM— Ki készítette ezt?
Kiadta Google, alapján United States of America, egy szervezet, amelyet kategorizáltak mint industry.
Seq2Seq LSTM— Mikor adták ki?
Kibocsátották a September 2014. A paraméterenkénti képesség lényegesen javult azóta, így egy újabb, azonos méretű modell gyakran jobb felhasználása a same hardvernek.
Seq2Seq LSTM— Mire használják?
Működik a területen a Language, és rögzítve van, hogy kezeli a feladatot translation. A modellek gyakran több mint egyet hordoznak mindegyikből, és a címkék a célra, nem pedig a képességek határaira utalnak.
Seq2Seq LSTM— mennyi számítási kapacitást használtak annak a betanításához?
A képzés körülbelül elfogyasztott 5.6 × 10¹⁹ FLOP. Ez azt méri, hogy mennyibe került a modell előállítása, és semmit nem mond arról, hogy milyen gyorsan válaszol, miután betanult — a következtetési sebesség a memória sávszélességéből származik, nem az edzési költségvetésből.
Seq2Seq LSTM— Milyen GPU-ra van szükségem, hogy futtathassam?
Ez egy zárt modell — a súlyait soha nem tették közzé, így nem tölthető le és nem futtatható a saját hardverén semmilyen áron. Csak a szolgáltatóján keresztül érhető el.
A másik irány
Másik oldalról nézve?
Ez az oldal a modellel kezdődik. Ha már van kártyád, és szeretnéd tudni, hogy mindent futtat-e, Kezdj a hardverből..