LSTM (Hebbian, Cache, MbPA)

Zárt súlyok DeepMind,University College London (UCL) 530.4M Paraméterek March 2018

Nincs becslés

Nincs hardver követelmény ennek a modellnek

A modellhez tartozó súlyokat nem tették közzé, így nem tölthető le vagy futtatható a saját hardverén bármilyen méretben. Csak a szolgáltatóján keresztül érhető el, és egyetlen grafikus kártya sem változtat ezen..

Nyilvántartásban

Teljes specifikáció

Minden feljegyzett ezzel a modellel kapcsolatban. A legtöbbje azt írja le, hogyan képezték ki, nem pedig azt, hogyan fut — hasznos kontextus annak megítéléséhez, hogy mennyi munka ment bele, és hogyan viszonyul a más méretben épített modellekhez..

Eredet

Ki építette ezt a modellt, hol, és mikor publikálták.

Szervezet
DeepMind,University College London (UCL)
Szervezet típusa
Industry,Academia
Ország
United Kingdom of Great Britain and Northern Ireland
Közölt
27 March 2018
Szerzők
Jack W Rae, Chris Dyer, Peter Dayan, Timothy P Lillicrap

Mit csinál

A probléma területek, amelyekre a modell készült. Egy modell több mindegyikből hordozhat.

Tartomány
Language
Feladat
Language modeling

Méret

Mekkora a modell, és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek eldöntik, hogy az adott grafikus kártyára illeszkedik-e.

Paraméterek
530.4M

Single layer LSTM with hidden dimension of 2048. Vocabulary for Gutenberg is 242,621; input and output embeddings are tied. Embedding layer (tied): 242,621 * 2048 = 496,887,808 LSTM layer: 4 * (2048 + 2048) * 2048 = 33,554,432 Total: 496,887,808 + 33,554,432 = 530,442,240

Képzési adatok
175,181,505 tokens

Omniglot: 32k images Wikitext-103: "Over 100 million tokens" Gutenberg: 175,181,505 tokens GigaWord v5: 4B tokens Gigaword is the largest dataset, but the largest training run uses Project Gutenberg.

Epochok
80
Tételméret
51,200

Sequence length of 100, total of 512 batches. Batches are split between 8 GPUs.

Képzés számítás

A modell tanításához végrehajtott aritmetika, lebegőpontos műveletekben mérve. Ez a tanítási futás költségének mértéke, nem pedig annak, hogy mennyire gyorsan válaszol a kész modell.

Képzés számítás
3.3 × 10¹⁹ FLOP

They do training runs on a vision task and three language datasets. The largest dataset by size is GigaWord, but the largest training run is on the Gutenberg dataset, at 15B tokens. I assume the input embedding is done with an embedding lookup for efficiency rather than a dense matrix multiplication, so we only count FLOPs on the de-embedding. Ops counting: 6 * 15B * 530,442,240 = 4.774e19 Hardware: (8 * 1.87e13) * (6 * 24 * 3600) * 0.3 = 2.327e19 Geometric mean: sqrt(4.774e19 * 2.327e19) =…

Hogyan jött létre
Hardware,Operation counting

A tréning futás

Ami fizikailag szükséges volt a betanításhoz: mely chipek, hány, mennyi ideig, és ez mit fogyasztott a falból.

Képzési hardver
NVIDIA P100
Használt chipek
8
Fali óra idő
144 hours

6 days

Teljesítményfogyasztás
4.2 kW
Számítási költség
$591

Elérhetőség

Hogy meg tudja-e szerezni a modellt és futtatni a saját hardverén, ez dönt arról, hogy alkalmazhatóak-e a lap ezen oldalán feltüntetett grafikus kártya adatok.

Súlyok
Closed — provider access only
Modell hozzáférés
Unreleased
Képzés kód
Unreleased

Hogyan van besorolva

Címkék a forráshalmazra, amelyeket a figyelemre méltó modellek nyomon követésekor alkalmaznak, és hogy mennyire biztos az adatbevitelben.

Nyilvántartási bizalom
Confident
Hivatkozások
47
Benchmark adatok
LSTM (Hebbian, Cache, MbPA)

Források

Honnan származik ez a felvétel és mikor ellenőrizték utoljára.

Referencia
Fast Parametric Learning with Activation Memorization
Utoljára frissítve
11 February 2026

Mit jelentenek a számok

Erről a modelről

LSTM (Hebbian, Cache, MbPA) ki lett adva által DeepMind,University College London (UCL), az országban rögzítve mint United Kingdom of Great Britain and Northern Ireland, alatt March 2018. A kiadó szervezet a következő kategóriába tartozik industry,Academia.

Működik a területen a Language, és úgy van rögzítve, mint a feladat végrehajtása language modeling.

Ez egy zárt modell: a betanított értékek azoknál maradtak, akik előállították őket, és nincs helyi verzió a futtatáshoz.

Hogyan lett betanítva

A létrehozásához körülbelül összesítő aritmetikára volt szükség. 3.3 × 10¹⁹ FLOP, hardveren rögzítve NVIDIA P100. Ez a szám azt méri, hogy mennyibe került a modell előállítása, és nincs hatással arra, hogy milyen gyorsan válaszol.

A képzés körülbelül egy korpuszt fogyasztott 175,181,505 szöveg tokenjei

Válaszok

LSTM (Hebbian, Cache, MbPA) — gyakori kérdések

01

LSTM (Hebbian, Cache, MbPA)— Mire használják?

Működik a területen a Language, és rögzítve van, hogy kezeli a feladatot language modeling. A modell több mindenből is képes cipelni, így ezek azok a területek, amelyekre épült, nem pedig egy korlát arra, amit meg fog próbálni.

02

LSTM (Hebbian, Cache, MbPA)— mennyi számítási kapacitást használtak annak a betanításához?

A képzés körülbelül elfogyasztott 3.3 × 10¹⁹ FLOP, hardveren rögzítve NVIDIA P100. Ez azt méri, hogy mennyibe került a modell előállítása, és semmit nem mond arról, hogy milyen gyorsan válaszol, miután betanult — a következtetési sebesség a memória sávszélességéből származik, nem az edzési költségvetésből.

03

LSTM (Hebbian, Cache, MbPA)— Milyen GPU-ra van szükségem, hogy futtathassam?

Ez egy zárt modell — a súlyait soha nem tették közzé, így nem tölthető le és nem futtatható a saját hardverén semmilyen áron. Csak a szolgáltatóján keresztül érhető el.

04

LSTM (Hebbian, Cache, MbPA)— Nyílt forráskódú?

Nem. A súlyai nincsenek közzétéve, így csak a tulajdonosa által ellenőrzött szolgáltatásként létezik.

05

LSTM (Hebbian, Cache, MbPA)— Hány paramétere van?

Paraméterszáma 530.4M. Single layer LSTM with hidden dimension of 2048. Vocabulary for Gutenberg is 242,621; input and output embeddings are tied. Embedding layer (tied): 242,621 * 2048 = 496,887,808 LSTM layer: 4 * (2048 + 2048) * 2048 = 33,554,432 Total: 496,887,808 + 33,554,432 = 530,442,240. Ez a szám a teljes összeg, és ez határozza meg, hogy mennyi VRAM-ra van szüksége a modelleknek — körülbelül fél gigabájt milliárdonként a legtöbb ember által használt tömörítési módban.

06

LSTM (Hebbian, Cache, MbPA)— Ki készítette ezt?

Kiadta DeepMind,University College London (UCL), alapján United Kingdom of Great Britain and Northern Ireland, egy szervezet, amelyet kategorizáltak mint industry,Academia.

07

LSTM (Hebbian, Cache, MbPA)— Mikor adták ki?

Kibocsátották a March 2018. A paraméterenkénti képesség lényegesen javult azóta, így egy újabb, azonos méretű modell gyakran jobb felhasználása a same hardvernek.

Forrás

Eredeti kiadvány

Az utolsó frissítés időpontja 11 February 2026

A másik irány

Másik oldalról nézve?

Ez az oldal a modellel kezdődik. Ha már van kártyád, és szeretnéd tudni, hogy mindent futtat-e, Kezdj a hardverből..