Feedback Transformer

Zárt súlyok LORIA,University of Lorraine,Facebook AI Research 126M Paraméterek February 2020

Nincs becslés

Nincs hardver követelmény ennek a modellnek

A modellhez tartozó súlyokat nem tették közzé, így nem tölthető le vagy futtatható a saját hardverén bármilyen méretben. Csak a szolgáltatóján keresztül érhető el, és egyetlen grafikus kártya sem változtat ezen..

Nyilvántartásban

Teljes specifikáció

Minden feljegyzett ezzel a modellel kapcsolatban. A legtöbbje azt írja le, hogyan képezték ki, nem pedig azt, hogyan fut — hasznos kontextus annak megítéléséhez, hogy mennyi munka ment bele, és hogyan viszonyul a más méretben épített modellekhez..

Eredet

Ki építette ezt a modellt, hol, és mikor publikálták.

Szervezet
LORIA,University of Lorraine,Facebook AI Research
Szervezet típusa
Academia,Academia,Industry
Ország
France, United States of America
Közölt
21 February 2020
Szerzők
Angela Fan, Thibaut Lavril, Edouard Grave, Armand Joulin, Sainbayar Sukhbaatar

Mit csinál

A probléma területek, amelyekre a modell készült. Egy modell több mindegyikből hordozhat.

Tartomány
Language
Feladat
Language modeling

Méret

Mekkora a modell, és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek eldöntik, hogy az adott grafikus kártyára illeszkedik-e.

Paraméterek
126M

Table 3 shows 126M. There is another instance of the Feedback Transformer mentioned in Table 9 with 139M parameters.

Képzési adatok
103,000,000 tokens

"The models are trained for 200k steps and the finetuned for additional 10k steps." from Table 9 (describes 139M model) batch size 512 sequence length 256 256*512*210000 / 103000000 = 267 epochs "speculative" confidence since there is no clear description of the 126M model and numbers are assumed based on 139M model description

Epochok
267.23
Tételméret
131,072

256*512

Képzés számítás

A modell tanításához végrehajtott aritmetika, lebegőpontos műveletekben mérve. Ez a tanítási futás költségének mértéke, nem pedig annak, hogy mennyire gyorsan válaszol a kész modell.

Képzés számítás
7.7 × 10¹⁸ FLOP

6 FLOP / token / parameter * 126*10^6 parameters * 256 tokens per sequences * 512 sequences per batch * 210000 steps = 2.0808991e+19 FLOP assuming V100 GPU fp16: 31330000000000 FLOP/sec/GPU * 1 GPU * 84 hours * 3600 sec / hour * 0.3 [assumed utilization] = 2.8422576e+18 FLOP sqrt(2.0808991e+19*2.8422576e+18) = 7.690547e+18 FLOP ___________ in the Algorithmic progress paper they used estimation of 4.41e+19 FLOP also with low confidence

Hogyan jött létre
Operation counting,Hardware

A tréning futás

Ami fizikailag szükséges volt a betanításhoz: mely chipek, hány, mennyi ideig, és ez mit fogyasztott a falból.

Fali óra idő
84 hours

" Our Feedback architecture takes 3.5 days to train" 3.5*24 = 84 hours

Elérhetőség

Hogy meg tudja-e szerezni a modellt és futtatni a saját hardverén, ez dönt arról, hogy alkalmazhatóak-e a lap ezen oldalán feltüntetett grafikus kártya adatok.

Súlyok
Closed — provider access only
Modell hozzáférés
Unreleased
Képzés kód
Unreleased

Hogyan van besorolva

Címkék a forráshalmazra, amelyeket a figyelemre méltó modellek nyomon követésekor alkalmaznak, és hogy mennyire biztos az adatbevitelben.

Miért követik nyomon
SOTA improvement

"As shown in Table 4, the Feedback Transformer model achieves a new SOTA performance (on Enwiki8) of 0.96 bit-per-byte despite its small size."

Nyilvántartási bizalom
Speculative
Hivatkozások
41
Benchmark adatok
Feedback Transformer

Források

Honnan származik ez a felvétel és mikor ellenőrizték utoljára.

Referencia
Addressing Some Limitations of Transformers with Feedback Memory
Utoljára frissítve
28 November 2025

Mit jelentenek a számok

Háttér

Feedback Transformer ki lett adva által LORIA,University of Lorraine,Facebook AI Research, az országban rögzítve mint France, alatt February 2020. A kiadó kategóriája alá tartozik academia,Academia,Industry.

Működik a területen a Language, és úgy van rögzítve, mint a feladat végrehajtása language modeling.

Súlyait soha nem tették közzé, így csak a szolgáltatóján keresztül érhető el. Nincs grafikus kártya, ami ezt megváltoztatná.

Hogyan lett betanítva

A képzés futás körülbelül 7.7 × 10¹⁸ FLOP. Ez a szám azt méri, hogy mennyibe került a modell előállítása, és nincs hatással arra, hogy milyen gyorsan válaszol.

A tanító készlet kb. futott 103,000,000 szöveg tokenjei

A kiválasztási kritériuma: sOTA improvement.

Válaszok

Feedback Transformer — gyakori kérdések

01

Feedback Transformer— Mire használják?

Működik a területen a Language, és rögzítve van, hogy kezeli a feladatot language modeling. A modell több mindenből is képes cipelni, így ezek azok a területek, amelyekre épült, nem pedig egy korlát arra, amit meg fog próbálni.

02

Feedback Transformer— mennyi számítási kapacitást használtak annak a betanításához?

A képzés körülbelül elfogyasztott 7.7 × 10¹⁸ FLOP. Ez azt méri, hogy mennyibe került a modell előállítása, és semmit nem mond arról, hogy milyen gyorsan válaszol, miután betanult — a következtetési sebesség a memória sávszélességéből származik, nem az edzési költségvetésből.

03

Feedback Transformer— Milyen GPU-ra van szükségem, hogy futtathassam?

Ez egy zárt modell — a súlyait soha nem tették közzé, így nem tölthető le és nem futtatható a saját hardverén semmilyen áron. Csak a szolgáltatóján keresztül érhető el.

04

Feedback Transformer— Nyílt forráskódú?

Nem. A súlyai nincsenek közzétéve, így csak a tulajdonosa által ellenőrzött szolgáltatásként létezik.

05

Feedback Transformer— Hány paramétere van?

Paraméterszáma 126M. Table 3 shows 126M. There is another instance of the Feedback Transformer mentioned in Table 9 with 139M parameters. Ez a szám a teljes összeg, és ez határozza meg, hogy mennyi VRAM-ra van szüksége a modelleknek — körülbelül fél gigabájt milliárdonként a legtöbb ember által használt tömörítési módban.

06

Feedback Transformer— Ki készítette ezt?

Kiadta LORIA,University of Lorraine,Facebook AI Research, alapján France, egy szervezet, amelyet kategorizáltak mint academia,Academia,Industry.

07

Feedback Transformer— Mikor adták ki?

Kibocsátották a February 2020. A paraméterenkénti képesség lényegesen javult azóta, így egy újabb, azonos méretű modell gyakran jobb felhasználása a same hardvernek.

Forrás

Eredeti kiadvány

Az utolsó frissítés időpontja 28 November 2025

A másik irány

Másik oldalról nézve?

Ez az oldal a modellel kezdődik. Ha már van kártyád, és szeretnéd tudni, hogy mindent futtat-e, Kezdj a hardverből..