FLAN 137B
Nincs becslés
Nincs hardver követelmény ennek a modellnek
A modellhez tartozó súlyokat nem tették közzé, így nem tölthető le vagy futtatható a saját hardverén bármilyen méretben. Csak a szolgáltatóján keresztül érhető el, és egyetlen grafikus kártya sem változtat ezen..
Nyilvántartásban
Teljes specifikáció
Minden feljegyzett ezzel a modellel kapcsolatban. A legtöbbje azt írja le, hogyan képezték ki, nem pedig azt, hogyan fut — hasznos kontextus annak megítéléséhez, hogy mennyi munka ment bele, és hogyan viszonyul a más méretben épített modellekhez..
Eredet
Ki építette ezt a modellt, hol, és mikor publikálták.
- Szervezet
- Google Research
- Szervezet típusa
- Industry
- Ország
- United States of America
- Közölt
- 3 September 2021
- Szerzők
- Jason Wei, Maarten Bosma, Vincent Y. Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M. Dai, and Quoc V. Le
Mit csinál
A probléma területek, amelyekre a modell készült. Egy modell több mindegyikből hordozhat.
- Tartomány
- Language
- Feladat
- Language modeling, Question answering, Language modeling/generation
- Megközelítés
- Self-supervised learning
- Alapmodell
- LaMDA
Méret
Mekkora a modell, és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek eldöntik, hogy az adott grafikus kártyára illeszkedik-e.
- Paraméterek
- 137B
- Képzési adatok
- 2,490,000,000,000 tokens
- Epochok
- 1
Abstract: "We take a 137B parameter pretrained language model and instruction tune it on over 60 NLP datasets verbalized via natural language instruction templates. We evaluate this instruction-tuned model, which we call FLAN, on unseen task types." Many models seem to be using the same 137B base transformer model?
"Model architecture and pretraining. In our experiments, we use LaMDA-PT, a dense left-to-right, decoder-only transformer language model of 137B parameters (Thoppilan et al., 2022). This model is pretrained on a collection of web documents (including those with computer code), dialog data, and Wikipedia, tokenized into 2.49T BPE tokens with a 32k vocabulary using the SentencePiece library (Kudo & Richardson, 2018). Around 10% of the pretraining data was non-English. Note that LaMDA-PT only has …
Képzés számítás
A modell tanításához végrehajtott aritmetika, lebegőpontos műveletekben mérve. Ez a tanítási futás költségének mértéke, nem pedig annak, hogy mennyire gyorsan válaszol a kész modell.
- Képzés számítás
- 2 × 10²⁴ FLOP
- Hogyan jött létre
- Operation counting
From section 2.4: Pretraining was done over 2.49T tokens. 6 * 2.49T * 137B = 2.047e24 Also, "instruction tuning takes around 60 hours on a TPUv3 with 128 cores." 128 TPUv3 cores = 64 TPUv3 chips. Environmental considerations section claims this took less than 2% of total time 1.23e14 * 64 * 60 * 3600 * 0.3 = 5.10e20
A tréning futás
Ami fizikailag szükséges volt a betanításhoz: mely chipek, hány, mennyi ideig, és ez mit fogyasztott a falból.
- Képzési hardver
- Google TPU v3
- Chip-óra
- 3,840
Elérhetőség
Hogy meg tudja-e szerezni a modellt és futtatni a saját hardverén, ez dönt arról, hogy alkalmazhatóak-e a lap ezen oldalán feltüntetett grafikus kártya adatok.
- Súlyok
- Closed — provider access only
- Modell hozzáférés
- Unreleased
- Képzés kód
- Unreleased
Hogyan van besorolva
Címkék a forráshalmazra, amelyeket a figyelemre méltó modellek nyomon követésekor alkalmaznak, és hogy mennyire biztos az adatbevitelben.
- Határmodell
- Yes
- Valószínűleg 10²³ FLOP felett
- Yes
- Miért követik nyomon
- Highly cited,SOTA improvement
- Nyilvántartási bizalom
- Confident
- Hivatkozások
- 5,011
Abstract: "FLAN substantially improves the performance of its unmodified counterpart and surpasses zero-shot 175B GPT-3 on 20 of 25 datasets that we evaluate." "FLAN even outperforms few-shot GPT-3 by a large margin on ANLI, RTE, BoolQ, AI2-ARC, OpenbookQA, and StoryCloze" SOTA is reported among unsupervised models
Források
Honnan származik ez a felvétel és mikor ellenőrizték utoljára.
- Referencia
- Finetuned Language Models Are Zero-Shot Learners
- Utoljára frissítve
- 25 May 2026
Mit jelentenek a számok
Honnan jött
FLAN 137B ki lett adva által Google Research, az országban rögzítve mint United States of America, alatt September 2021. Egy olyan szervezetből származik, amelyet kategorizálnak mint industry.
Működik a területen a Language, és úgy van rögzítve, mint a feladat végrehajtása language modeling, Question answering, Language modeling/generation.
Ahelyett, hogy nulláról lenne betanítva, az származik LaMDA. A legtöbb modell ezen a skálán egy meglévő alaphoz van igazítva, ahelyett, hogy semmiből épült volna.
Mivel a súlyok nem elérhetők, ezért ezen az oldalon máshol található hardveradatok egyike sem vonatkozik rá.
Hogyan lett betanítva
A képzés futás körülbelül 2 × 10²⁴ FLOP, hardveren rögzítve Google TPU v3. Ez a szám azt méri, hogy mennyibe került a modell előállítása, és nincs hatással arra, hogy milyen gyorsan válaszol.
A képzés körülbelül egy korpuszt fogyasztott 2,490,000,000,000 szöveg tokenjei
Az oka, hogy egyáltalán megjelenik ebben a katalógusban: highly cited,SOTA improvement.
Válaszok
FLAN 137B — gyakori kérdések
FLAN 137B— Ki készítette ezt?
Kiadta Google Research, alapján United States of America, egy szervezet, amelyet kategorizáltak mint industry.
FLAN 137B— Mikor adták ki?
Kibocsátották a September 2021. A paraméterenkénti képesség lényegesen javult azóta, így egy újabb, azonos méretű modell gyakran jobb felhasználása a same hardvernek.
FLAN 137B— Mire használják?
Működik a területen a Language, és rögzítve van, hogy kezeli a feladatot language modeling, Question answering, Language modeling/generation. A modellek gyakran több mint egyet hordoznak mindegyikből, és a címkék a célra, nem pedig a képességek határaira utalnak.
FLAN 137B— mennyi számítási kapacitást használtak annak a betanításához?
A képzés körülbelül elfogyasztott 2 × 10²⁴ FLOP, hardveren rögzítve Google TPU v3. Ez azt méri, hogy mennyibe került a modell előállítása, és semmit nem mond arról, hogy milyen gyorsan válaszol, miután betanult — a következtetési sebesség a memória sávszélességéből származik, nem az edzési költségvetésből.
FLAN 137B— Milyen GPU-ra van szükségem, hogy futtathassam?
Ez egy zárt modell — a súlyait soha nem tették közzé, így nem tölthető le és nem futtatható a saját hardverén semmilyen áron. Csak a szolgáltatóján keresztül érhető el.
FLAN 137B— Nyílt forráskódú?
Nem. A súlyai nincsenek közzétéve, így csak a tulajdonosa által ellenőrzött szolgáltatásként létezik.
FLAN 137B— Hány paramétere van?
Paraméterszáma 137B. Abstract: "We take a 137B parameter pretrained language model and instruction tune it on over 60 NLP datasets verbalized via natural language instruction templates. We evaluate this instruction-tuned model, which we call FLAN, on unseen task types." Many models seem to be using the same 137B base transformer model?. Ez a szám a teljes összeg, és ez határozza meg, hogy mennyi VRAM-ra van szüksége a modelleknek — körülbelül fél gigabájt milliárdonként a legtöbb ember által használt tömörítési módban.
A másik irány
Másik oldalról nézve?
Ez az oldal a modellel kezdődik. Ha már van kártyád, és szeretnéd tudni, hogy mindent futtat-e, Kezdj a hardverből..