FFN SwiGLU

Uzavřené váhy Google 220M parametry February 2020

Žádný odhad

Žádné hardwarové požadavky pro tento model

Hmotnosti pro tento model nebyly zveřejněny, takže jej nelze stáhnout ani spustit na vlastním hardwaru v žádné velikosti. Je dostupný pouze prostřednictvím svého poskytovatele, a žádná změna grafické karty to nezmění..

Na záznamu

Plná specifikace

Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..

Původ

Kdo vytvořil tento model, kde a kdy byl publikován.

Organizace
Google
Typ organizace
Industry
Země
United States of America
Publikováno
14 February 2020
Autoři
Noam Shazeer

Co to dělá

Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.

Doména
Language
Úkol
Language modeling, Question answering

Velikost

Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.

parametry
220M

"We use the same code base, model architecture, and training task as the base model from [Raffel et al.,2019]. The encoder and decoder each consist of 12 layers, with dmodel = 768. For the attention layers, h = 12 and dk = dv = 64. The FFN layers have hidden size df f = 3072." [Raffel et al.,2019]: "Specifically, both the encoder and decoder consist of 12 blocks (each block comprising self-attention, optional encoder-decoder attention, and a feed-forward network). The feed-forward networks in e…

Výcviková data
50,600,083,456 tokens

pre-training: "Identically to [Raffel et al., 2019], we pre-train for 524,288 steps on the span-filling objective on the C4 dataset. Each training batch consists of 128 examples, each of which has an input of 512 tokens and an output of 114 tokens" 524288*128*(512+114) = 42010148864 fine-tuning: "Fine-tuning consists of 131072 steps <..>, the input sequences for each step have a combined length of approximately 65,536 tokens." 131072*65536 = 8589934592 42010148864+8589934592 = 50600083456

Výpočty pro trénink

Aritmetika prováděná k trénování modelu, měřená v operacích s plovoucí desetinnou čárkou. Je to měřítko toho, kolik stál tréninkový běh, ne jak rychle hotový model na vás odpovídá.

Výpočty pro trénink
3.4 × 10¹⁹ FLOP

6 FLOP/parameter/token * 220000000 parameters * 50600083456 tokens = 66792110161920000000 FLOP (10^19) 45000000000000 FLOP/GPU/sec * 21.85 hours * 3600 sec / hour * 16 GPUs * 0.3 [assumed utilization] = 16990560000000002000 FLOP (10^19) sqrt(66792110161920000000*16990560000000002000) = 3.3687317e+19

Jak bylo ustanoveno
Hardware,Operation counting

Tréninkový běh

Co fyzicky vyžadovalo trénování: které čipy, kolik, jak dlouho a co to vyžadovalo ze zásuvky.

Tréninkový hardware
Google TPU v2
Používané čipy
16
Doba reálného času
22 hours

"Each training step took approximately 0.15 seconds on a 32-core TPUv2 cluster" -> 16 chips "we pre-train for 524,288 steps" 524288*0.15/3600 ~ 21.85 hours

Příkon
9.2 kW

Dostupnost

Zda můžete získat model a spustit ho na svém vlastním hardwaru, což rozhoduje o tom, zda se některé z čísel grafických karet na této stránce vztahují.

Hmotnosti
Closed — provider access only
Přístup k modelu
Unreleased
Tréninkový kód
Unreleased

Jak je to klasifikováno

Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.

Proč je to sledováno
Historical significance

the paper introduced SwiGLU

Záznam důvěry
Confident

Žrovy

Odkud tento záznam pochází a kdy byl naposledy zkontrolován.

Reference
GLU Variants Improve Transformer
Nap poslední aktualizace
28 November 2025

Co čísla znamenají

Co je tento MODEL

FFN SwiGLU byl zveřejněn Google, v zemi zaznamenané jako United States of America, během February 2020. Vychází z organizace, která je kategorizována jako industry.

funguje v oblasti Language, a je zaznamenán jako vykonávající úkol language modeling, Question answering.

Jeho váhy nikdy nebyly zveřejněny, takže k němu lze přistupovat pouze prostřednictvím jeho poskytovatele. Žádná změna grafické karty to nezmění.

Co bylo zapotřebí k jeho vybudování

Trenovací běh spotřeboval asi 3.4 × 10¹⁹ FLOP, na hardwaru zaznamenáno jako Google TPU v2. Tato částka měří, kolik stál výroba modelu, a nemá žádný vliv na to, jak rychle odpovídá.

Trénink spotřeboval korpus kolem 50,600,083,456 tokeny textu

Jeho kritérium zahrnutí: historical significance.

Odpovědi

FFN SwiGLU — běžné otázky

01

FFN SwiGLU— Je to OPEN SOURCE?

Ne. Jeho váhy nebyly zveřejněny, takže existuje pouze jako služba řízená jeho vlastníkem.

02

FFN SwiGLU— kolik má parametrů?

Má počet parametrů 220M. "We use the same code base, model architecture, and training task as the base model from [Raffel et al.,2019]. The encoder and decoder each consist of 12 layers, with dmodel = 768. For the attention layers, h = 12 and dk = dv = 64. The FFN layers have hidden size df f = 3072." [Raffel et al.,2019]: "Specifically, both the encoder and decoder consist of 12 blocks (each block comprising self-attention, optional encoder-decoder attention, and a feed-forward network). The feed-forward networks in each block consist of a dense layer with an output dimensionality of dff = 3072 followed by a ReLU nonlinearity and another dense layer. The “key” and “value” matrices of all attention mechanisms have an inner dimensionality of dkv = 64 and all attention mechanisms have 12 heads. All other sub-layers and embeddings have a dimensionality of dmodel = 768. In total, this results in a model with about 220 million parameters.". Tato cifra je celková a rozhoduje o tom, kolik VRAM model potřebuje — přibližně půl gigabajtu na miliardu při kompresi, kterou většina lidí používá.

03

FFN SwiGLU— Kdo to vytvořil?

Bylo to publikováno společností Google, zakládající se na United States of America, organizace zařazená jako industry.

04

FFN SwiGLU— Kdy byl vydán?

Bylo to zveřejněno v February 2020. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.

05

FFN SwiGLU— K čemu se to používá?

funguje v oblasti Language, a je zaznamenáno jako zpracovávající úkol language modeling, Question answering. Model může nést několik z každého, takže to jsou oblasti, pro které byl navržen, spíše než omezení toho, co se pokusí.

06

FFN SwiGLU— kolik výpočetního výkonu bylo použito k jeho trénování?

Trénink spotřeboval kolem 3.4 × 10¹⁹ FLOP, na hardwaru zaznamenáno jako Google TPU v2. To měří, co stálo výrobu modelu, a neříká nic o tom, jak rychle odpovídá po natrénování — rychlost inferencí závisí na šířce pásma paměti, nikoli na rozpočtu na trénink.

07

FFN SwiGLU— Jakou GPU potřebuji k jejímu spuštění?

Žádné. Toto je uzavřený model — jeho váhy nikdy nebyly zveřejněny, takže jej nelze stáhnout nebo spustit na vlastním hardwaru za žádnou cenu. Je dostupný pouze prostřednictvím jeho poskytovatele.

Zdroj

Původní publikace

Nahrávka naposledy aktualizována 28 November 2025

Druhý směr

Díváte se na to z druhé strany?

Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.