GQA-8-XXL
Žádný odhad
Žádné hardwarové požadavky pro tento model
Hmotnosti pro tento model nebyly zveřejněny, takže jej nelze stáhnout ani spustit na vlastním hardwaru v žádné velikosti. Je dostupný pouze prostřednictvím svého poskytovatele, a žádná změna grafické karty to nezmění..
Na záznamu
Plná specifikace
Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..
Původ
Kdo vytvořil tento model, kde a kdy byl publikován.
- Organizace
- Google Research
- Typ organizace
- Industry
- Země
- United States of America
- Publikováno
- 23 December 2023
- Autoři
- Joshua Ainslie, James Lee-Thorp, Michiel de Jong, Yury Zemlyanskiy, Federico Lebrón, Sumit Sanghai
Co to dělá
Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.
- Doména
- Language
- Úkol
- Text summarization, Language modeling/generation, Translation
- Základní model
- T5-11B
Velikost
Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.
- parametry
- 11B
- Výcviková data
- tokens
same as base model
Výpočty pro trénink
Aritmetika prováděná k trénování modelu, měřená v operacích s plovoucí desetinnou čárkou. Je to měřítko toho, kolik stál tréninkový běh, ne jak rychle hotový model na vás odpovídá.
- Výpočty pro trénink
- 3.5 × 10²² FLOP
- Jak bylo ustanoveno
- Hardware
3.3e+22 FLOP [base model] + 1.912896e+21 FLOP = 3.4912896e+22 FLOP
Tréninkový běh
Co fyzicky vyžadovalo trénování: které čipy, kolik, jak dlouho a co to vyžadovalo ze zásuvky.
- Tréninkový hardware
- Google TPU v3
- Čip-hodiny
- 14,400
Dostupnost
Zda můžete získat model a spustit ho na svém vlastním hardwaru, což rozhoduje o tom, zda se některé z čísel grafických karet na této stránce vztahují.
- Hmotnosti
- Closed — provider access only
- Přístup k modelu
- Unreleased
- Tréninkový kód
- Open source
Apache 2.0 https://github.com/google/flaxformer
Jak je to klasifikováno
Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.
- Proč je to sledováno
- Historical significance
- Záznam důvěry
- Confident
the paper introduced grouped-query attention
Žrovy
Odkud tento záznam pochází a kdy byl naposledy zkontrolován.
- Reference
- GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints
- Nap poslední aktualizace
- 28 November 2025
Co čísla znamenají
Pozadí
GQA-8-XXL byl zveřejněn Google Research, v zemi zaznamenané jako United States of America, během December 2023. Vydavatelská organizace je kategorizována jako industry.
funguje v oblasti Language, a je zaznamenán jako vykonávající úkol text summarization, Language modeling/generation, Translation.
Místo toho, aby byl trénován od nuly, je odvozen z T5-11B. Většina modelů na této úrovni je přizpůsobena z existující základny namísto toho, aby byla vytvořena od nuly.
Toto je uzavřený model: trénované hodnoty zůstaly u toho, kdo je vyprodukoval, a není k dispozici žádná místní verze k spuštění.
Jak bylo trénováno
Produkce toho vyžadovala aritmetiku v celkové výši přibližně 3.5 × 10²² FLOP, na hardwaru zaznamenáno jako Google TPU v3. Tato částka měří, kolik stál výroba modelu, a nemá žádný vliv na to, jak rychle odpovídá.
Je sledováno v základním datasetu z jednoho konkrétního důvodu: historical significance.
Odpovědi
GQA-8-XXL — běžné otázky
GQA-8-XXL— Kdo to vytvořil?
Bylo to publikováno společností Google Research, zakládající se na United States of America, organizace zařazená jako industry.
GQA-8-XXL— Kdy byl vydán?
Bylo to zveřejněno v December 2023. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.
GQA-8-XXL— K čemu se to používá?
funguje v oblasti Language, a je zaznamenáno jako zpracovávající úkol text summarization, Language modeling/generation, Translation. Modely často obsahují více než jeden z každého a štítky popisují účel spíše než omezení schopností.
GQA-8-XXL— kolik výpočetního výkonu bylo použito k jeho trénování?
Trénink spotřeboval kolem 3.5 × 10²² FLOP, na hardwaru zaznamenáno jako Google TPU v3. To měří, co stálo výrobu modelu, a neříká nic o tom, jak rychle odpovídá po natrénování — rychlost inferencí závisí na šířce pásma paměti, nikoli na rozpočtu na trénink.
GQA-8-XXL— Jakou GPU potřebuji k jejímu spuštění?
Žádné. Toto je uzavřený model — jeho váhy nikdy nebyly zveřejněny, takže jej nelze stáhnout nebo spustit na vlastním hardwaru za žádnou cenu. Je dostupný pouze prostřednictvím jeho poskytovatele.
GQA-8-XXL— Je to OPEN SOURCE?
Ne. Jeho váhy nebyly zveřejněny, takže existuje pouze jako služba řízená jeho vlastníkem.
GQA-8-XXL— kolik má parametrů?
Má počet parametrů 11B. same as base model. Tato cifra je celková a rozhoduje o tom, kolik VRAM model potřebuje — přibližně půl gigabajtu na miliardu při kompresi, kterou většina lidí používá.
Druhý směr
Díváte se na to z druhé strany?
Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.