LSTM (Hebbian, Cache, MbPA)
Nincs becslés
Nincs hardver követelmény ennek a modellnek
A modellhez tartozó súlyokat nem tették közzé, így nem tölthető le vagy futtatható a saját hardverén bármilyen méretben. Csak a szolgáltatóján keresztül érhető el, és egyetlen grafikus kártya sem változtat ezen..
Nyilvántartásban
Teljes specifikáció
Minden feljegyzett ezzel a modellel kapcsolatban. A legtöbbje azt írja le, hogyan képezték ki, nem pedig azt, hogyan fut — hasznos kontextus annak megítéléséhez, hogy mennyi munka ment bele, és hogyan viszonyul a más méretben épített modellekhez..
Eredet
Ki építette ezt a modellt, hol, és mikor publikálták.
- Szervezet
- DeepMind,University College London (UCL)
- Szervezet típusa
- Industry,Academia
- Ország
- United Kingdom of Great Britain and Northern Ireland
- Közölt
- 27 March 2018
- Szerzők
- Jack W Rae, Chris Dyer, Peter Dayan, Timothy P Lillicrap
Mit csinál
A probléma területek, amelyekre a modell készült. Egy modell több mindegyikből hordozhat.
- Tartomány
- Language
- Feladat
- Language modeling
Méret
Mekkora a modell, és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek eldöntik, hogy az adott grafikus kártyára illeszkedik-e.
- Paraméterek
- 530.4M
- Képzési adatok
- 175,181,505 tokens
- Epochok
- 80
- Tételméret
- 51,200
Single layer LSTM with hidden dimension of 2048. Vocabulary for Gutenberg is 242,621; input and output embeddings are tied. Embedding layer (tied): 242,621 * 2048 = 496,887,808 LSTM layer: 4 * (2048 + 2048) * 2048 = 33,554,432 Total: 496,887,808 + 33,554,432 = 530,442,240
Omniglot: 32k images Wikitext-103: "Over 100 million tokens" Gutenberg: 175,181,505 tokens GigaWord v5: 4B tokens Gigaword is the largest dataset, but the largest training run uses Project Gutenberg.
Sequence length of 100, total of 512 batches. Batches are split between 8 GPUs.
Képzés számítás
A modell tanításához végrehajtott aritmetika, lebegőpontos műveletekben mérve. Ez a tanítási futás költségének mértéke, nem pedig annak, hogy mennyire gyorsan válaszol a kész modell.
- Képzés számítás
- 3.3 × 10¹⁹ FLOP
- Hogyan jött létre
- Hardware,Operation counting
They do training runs on a vision task and three language datasets. The largest dataset by size is GigaWord, but the largest training run is on the Gutenberg dataset, at 15B tokens. I assume the input embedding is done with an embedding lookup for efficiency rather than a dense matrix multiplication, so we only count FLOPs on the de-embedding. Ops counting: 6 * 15B * 530,442,240 = 4.774e19 Hardware: (8 * 1.87e13) * (6 * 24 * 3600) * 0.3 = 2.327e19 Geometric mean: sqrt(4.774e19 * 2.327e19) =…
A tréning futás
Ami fizikailag szükséges volt a betanításhoz: mely chipek, hány, mennyi ideig, és ez mit fogyasztott a falból.
- Képzési hardver
- NVIDIA P100
- Használt chipek
- 8
- Fali óra idő
- 144 hours
- Teljesítményfogyasztás
- 4.2 kW
- Számítási költség
- $591
6 days
Elérhetőség
Hogy meg tudja-e szerezni a modellt és futtatni a saját hardverén, ez dönt arról, hogy alkalmazhatóak-e a lap ezen oldalán feltüntetett grafikus kártya adatok.
- Súlyok
- Closed — provider access only
- Modell hozzáférés
- Unreleased
- Képzés kód
- Unreleased
Hogyan van besorolva
Címkék a forráshalmazra, amelyeket a figyelemre méltó modellek nyomon követésekor alkalmaznak, és hogy mennyire biztos az adatbevitelben.
- Nyilvántartási bizalom
- Confident
- Hivatkozások
- 47
- Benchmark adatok
- LSTM (Hebbian, Cache, MbPA)
Források
Honnan származik ez a felvétel és mikor ellenőrizték utoljára.
- Referencia
- Fast Parametric Learning with Activation Memorization
- Utoljára frissítve
- 11 February 2026
Mit jelentenek a számok
Erről a modelről
LSTM (Hebbian, Cache, MbPA) ki lett adva által DeepMind,University College London (UCL), az országban rögzítve mint United Kingdom of Great Britain and Northern Ireland, alatt March 2018. A kiadó szervezet a következő kategóriába tartozik industry,Academia.
Működik a területen a Language, és úgy van rögzítve, mint a feladat végrehajtása language modeling.
Ez egy zárt modell: a betanított értékek azoknál maradtak, akik előállították őket, és nincs helyi verzió a futtatáshoz.
Hogyan lett betanítva
A létrehozásához körülbelül összesítő aritmetikára volt szükség. 3.3 × 10¹⁹ FLOP, hardveren rögzítve NVIDIA P100. Ez a szám azt méri, hogy mennyibe került a modell előállítása, és nincs hatással arra, hogy milyen gyorsan válaszol.
A képzés körülbelül egy korpuszt fogyasztott 175,181,505 szöveg tokenjei
Válaszok
LSTM (Hebbian, Cache, MbPA) — gyakori kérdések
LSTM (Hebbian, Cache, MbPA)— Mire használják?
Működik a területen a Language, és rögzítve van, hogy kezeli a feladatot language modeling. A modell több mindenből is képes cipelni, így ezek azok a területek, amelyekre épült, nem pedig egy korlát arra, amit meg fog próbálni.
LSTM (Hebbian, Cache, MbPA)— mennyi számítási kapacitást használtak annak a betanításához?
A képzés körülbelül elfogyasztott 3.3 × 10¹⁹ FLOP, hardveren rögzítve NVIDIA P100. Ez azt méri, hogy mennyibe került a modell előállítása, és semmit nem mond arról, hogy milyen gyorsan válaszol, miután betanult — a következtetési sebesség a memória sávszélességéből származik, nem az edzési költségvetésből.
LSTM (Hebbian, Cache, MbPA)— Milyen GPU-ra van szükségem, hogy futtathassam?
Ez egy zárt modell — a súlyait soha nem tették közzé, így nem tölthető le és nem futtatható a saját hardverén semmilyen áron. Csak a szolgáltatóján keresztül érhető el.
LSTM (Hebbian, Cache, MbPA)— Nyílt forráskódú?
Nem. A súlyai nincsenek közzétéve, így csak a tulajdonosa által ellenőrzött szolgáltatásként létezik.
LSTM (Hebbian, Cache, MbPA)— Hány paramétere van?
Paraméterszáma 530.4M. Single layer LSTM with hidden dimension of 2048. Vocabulary for Gutenberg is 242,621; input and output embeddings are tied. Embedding layer (tied): 242,621 * 2048 = 496,887,808 LSTM layer: 4 * (2048 + 2048) * 2048 = 33,554,432 Total: 496,887,808 + 33,554,432 = 530,442,240. Ez a szám a teljes összeg, és ez határozza meg, hogy mennyi VRAM-ra van szüksége a modelleknek — körülbelül fél gigabájt milliárdonként a legtöbb ember által használt tömörítési módban.
LSTM (Hebbian, Cache, MbPA)— Ki készítette ezt?
Kiadta DeepMind,University College London (UCL), alapján United Kingdom of Great Britain and Northern Ireland, egy szervezet, amelyet kategorizáltak mint industry,Academia.
LSTM (Hebbian, Cache, MbPA)— Mikor adták ki?
Kibocsátották a March 2018. A paraméterenkénti képesség lényegesen javult azóta, így egy újabb, azonos méretű modell gyakran jobb felhasználása a same hardvernek.
A másik irány
Másik oldalról nézve?
Ez az oldal a modellel kezdődik. Ha már van kártyád, és szeretnéd tudni, hogy mindent futtat-e, Kezdj a hardverből..