TransformerXL + spectrum control
Nincs becslés
Nincs hardver követelmény ennek a modellnek
A modellhez tartozó súlyokat nem tették közzé, így nem tölthető le vagy futtatható a saját hardverén bármilyen méretben. Csak a szolgáltatóján keresztül érhető el, és egyetlen grafikus kártya sem változtat ezen..
Nyilvántartásban
Teljes specifikáció
Minden feljegyzett ezzel a modellel kapcsolatban. A legtöbbje azt írja le, hogyan képezték ki, nem pedig azt, hogyan fut — hasznos kontextus annak megítéléséhez, hogy mennyi munka ment bele, és hogyan viszonyul a más méretben épített modellekhez..
Eredet
Ki építette ezt a modellt, hol, és mikor publikálták.
- Szervezet
- University of California Los Angeles (UCLA),JD.com
- Szervezet típusa
- Academia,Industry
- Ország
- United States of America, China
- Közölt
- 11 March 2020
- Szerzők
- Lingxiao Wang, Jing Huang, Kevin Huang, Ziniu Hu, Guangtao Wang, Quanquan Gu
Mit csinál
A probléma területek, amelyekre a modell készült. Egy modell több mindegyikből hordozhat.
- Tartomány
- Language
- Feladat
- Language modeling
Méret
Mekkora a modell, és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek eldöntik, hogy az adott grafikus kártyára illeszkedik-e.
- Paraméterek
- 151M
- Képzési adatok
- 103,000,000 tokens
- Epochok
- 250
- Tételméret
- 61,440
151M (Table 2) " On the large WikiText-103 dataset, we implement our method based on the state-of-the-art Transformer-XL based models (Dai et al., 2019). We follow the same settings reported in (Dai et al., 2019), and our implementation is based on the official code for Transformer-XL."
"For WikiText-103 dataset, we use four NVIDIA Tesla V100 GPU and set the batch size to be 40." unknown amount of epochs and training steps but they say they follow original Transformer-XL setup (400K steps + 16K warmup steps, 128 batch size, 384 sequence length) 400000*4*40*384 / 103000000 = 248 epochs
4*40*384
Képzés számítás
A modell tanításához végrehajtott aritmetika, lebegőpontos műveletekben mérve. Ez a tanítási futás költségének mértéke, nem pedig annak, hogy mennyire gyorsan válaszol a kész modell.
- Képzés számítás
- 2.6 × 10¹⁹ FLOP
- Hogyan jött létre
- Operation counting,Hardware
6 FLOP / parameter / token * 151000000 parameters * 103000000 tokens * 250 epochs = 2.33295e+19 FLOP 31330000000000 FLOP / sec / GPU [fp16] * 4 GPUs * 3152 sec per epoch * 250 epochs * 0.3 [assumed precision] = 2.9625648e+19 FLOP sqrt(2.33295e+19*2.9625648e+19) = 2.6289761e+19 FLOP 'speculative' confidence due to the assumption of the amount of epochs
A tréning futás
Ami fizikailag szükséges volt a betanításhoz: mely chipek, hány, mennyi ideig, és ez mit fogyasztott a falból.
- Képzési hardver
- NVIDIA V100
- Használt chipek
- 4
- Fali óra idő
- 219 hours (9.1 days)
- Teljesítményfogyasztás
- 2.5 kW
3152 sec per epoch (Table 7) * 250 epochs / 3600 sec/hour = 219 hours
Elérhetőség
Hogy meg tudja-e szerezni a modellt és futtatni a saját hardverén, ez dönt arról, hogy alkalmazhatóak-e a lap ezen oldalán feltüntetett grafikus kártya adatok.
- Súlyok
- Closed — provider access only
- Modell hozzáférés
- Unreleased
- Képzés kód
- Unreleased
Hogyan van besorolva
Címkék a forráshalmazra, amelyeket a figyelemre méltó modellek nyomon követésekor alkalmaznak, és hogy mennyire biztos az adatbevitelben.
- Miért követik nyomon
- SOTA improvement
- Nyilvántartási bizalom
- Speculative
- Hivatkozások
- 90
- Benchmark adatok
- TransformerXL + spectrum control
"We demonstrate that our spectrum control method outperforms the state-of-the-art Transformer-XL modeling for language model" " Our spectrum control method outperforms the latest state-of-the-art TransformerXL model on WikiText-103 dataset for language modeling; and obtains close to 1.5 BLEU improvement on IWSLT 2014 German-English translation task compared to the Transformer baseline model."
Források
Honnan származik ez a felvétel és mikor ellenőrizték utoljára.
- Referencia
- Improving Neural Language Generation with Spectrum Control
- Utoljára frissítve
- 1 December 2025
Mit jelentenek a számok
Erről a modelről
TransformerXL + spectrum control ki lett adva által University of California Los Angeles (UCLA),JD.com, az országban rögzítve mint United States of America, alatt March 2020. Egy olyan szervezetből származik, amelyet kategorizálnak mint academia,Industry.
Működik a területen a Language, és úgy van rögzítve, mint a feladat végrehajtása language modeling.
Súlyait soha nem tették közzé, így csak a szolgáltatóján keresztül érhető el. Nincs grafikus kártya, ami ezt megváltoztatná.
Hogyan lett betanítva
A képzés futás körülbelül 2.6 × 10¹⁹ FLOP, hardveren rögzítve NVIDIA V100. Ez a szám azt méri, hogy mennyibe került a modell előállítása, és nincs hatással arra, hogy milyen gyorsan válaszol.
A képzés körülbelül egy korpuszt fogyasztott 103,000,000 szöveg tokenjei
Egy különös okból nyomon követik az alapul szolgáló adatbázisban: sOTA improvement.
Válaszok
TransformerXL + spectrum control — gyakori kérdések
TransformerXL + spectrum control— Ki készítette ezt?
Kiadta University of California Los Angeles (UCLA),JD.com, alapján United States of America, egy szervezet, amelyet kategorizáltak mint academia,Industry.
TransformerXL + spectrum control— Mikor adták ki?
Kibocsátották a March 2020. A paraméterenkénti képesség lényegesen javult azóta, így egy újabb, azonos méretű modell gyakran jobb felhasználása a same hardvernek.
TransformerXL + spectrum control— Mire használják?
Működik a területen a Language, és rögzítve van, hogy kezeli a feladatot language modeling. Ezek azok a területek, amelyek köré tervezték; ezek a szándékot írják le, nem pedig egy szigorú határt.
TransformerXL + spectrum control— mennyi számítási kapacitást használtak annak a betanításához?
A képzés körülbelül elfogyasztott 2.6 × 10¹⁹ FLOP, hardveren rögzítve NVIDIA V100. Ez azt méri, hogy mennyibe került a modell előállítása, és semmit nem mond arról, hogy milyen gyorsan válaszol, miután betanult — a következtetési sebesség a memória sávszélességéből származik, nem az edzési költségvetésből.
TransformerXL + spectrum control— Milyen GPU-ra van szükségem, hogy futtathassam?
Ez egy zárt modell — a súlyait soha nem tették közzé, így nem tölthető le és nem futtatható a saját hardverén semmilyen áron. Csak a szolgáltatóján keresztül érhető el.
TransformerXL + spectrum control— Nyílt forráskódú?
Nem. A súlyai nincsenek közzétéve, így csak a tulajdonosa által ellenőrzött szolgáltatásként létezik.
TransformerXL + spectrum control— Hány paramétere van?
Paraméterszáma 151M. 151M (Table 2) " On the large WikiText-103 dataset, we implement our method based on the state-of-the-art Transformer-XL based models (Dai et al., 2019). We follow the same settings reported in (Dai et al., 2019), and our implementation is based on the official code for Transformer-XL.". Ez a szám a teljes összeg, és ez határozza meg, hogy mennyi VRAM-ra van szüksége a modelleknek — körülbelül fél gigabájt milliárdonként a legtöbb ember által használt tömörítési módban.
A másik irány
Másik oldalról nézve?
Ez az oldal a modellel kezdődik. Ha már van kártyád, és szeretnéd tudni, hogy mindent futtat-e, Kezdj a hardverből..