QMoE: compressed SwitchTransformer TPS számológép
Az alábbi kártyát a választott kontextus hossza és minimális minőség alapján értékeljük e modell szerint. A sebesség egyetlen kérés becslése, amely a kártya memória sávszélességéből és a modell méretéből van kiszámítva, miután tömörítették..
Kiszámítva ehhez a modelhez
Melyik GPU képes futtatni QMoE: compressed SwitchTransformer?
Állítsa be a bemeneteket, olvassa el a választ.
Egy hosszabb beszélgetéshez több memória szükséges, ami ezt a modellt kisebb kártyákról lejjebb tolhatja..
Elrejti azokat a kártyákat, amelyek csak a modellt illeszkednének, ha ezt a pontot alá tömörítjük..
0 kártyák illeszkednek
Számítás alatt| Needs | kvantálás | Fitt | |||||
|---|---|---|---|---|---|---|---|
|
A katalógusunkban nincs olyan kártya, ami ezzel a beállítással tudná futtatni ezt a modellt.. |
|||||||
A sebességek egyetlen kérésre vonatkozó becslések — egy beszélgetés egy időben — a memória sávszélessége, a modell mérete és a kvantálás alapján számítva. A valós átvitel az inferencia futási időtől és annak verziójától függően változik. A hardvergyártók által közzétett számok sok párhuzamos kérést mérnek, és sokkal magasabbak..
A nyilvántartásban
Teljes specifikáció
Minden rögzítve van ennek a modellnek a számára. A legtöbb arról szól, hogyan lett betanítva, nem arról, hogyan fut. — Hasznos háttérinformáció annak megítélésére, hogy mennyi munka fektetődött bele, és hogyan viszonyul más, eltérő méretű modellekhez..
Eredet
Ki építette ezt a modellt, hol, és mikor publikálták.
- Szervezés
- Institute of Science and Technology Austria (ISTA),Neural Magic
- Szervezet típus
- Academia,Industry
- Ország
- Austria, United States of America
- Közzétéve
- 25 October 2023
- Szerzők
- Elias Frantar, Dan Alistarh
Mit csinál
A problémás területek, amelyekre a modellt építették. Egy modell többből is eltarthat minden egyesből.
- Domain
- Language
- Fut / futás AI modell. Nem illik / nem fog illeni, szoros = alig futtatható, kényelmes = könnyen fut, van hely. Melyik AI modellt tud futtatni a GPU?
- Language modeling
- Alapmodell
- Switch
Méret
Mekkora a modell és mennyi adaton lett betanítva. A paraméterek határozzák meg, hogy elfér-e egy adott grafikus kártyán.
- paraméterek
- 1.6T
- Tréning adatok
- 576,000,000,000 tokens
"Concretely, QMoE can compress the 1.6 trillion parameter SwitchTransformer-c2048 model to less than 160GB" Same parameter count as base model. This paper compresses the model; there is no learning from data.
In this paper, the authors compress the SwitchTransformer-c2048 model. There is no training dataset used.
Képzés számítás
A modell tréningjéhez végzett aritmetika, lebegőpontos műveletekben mérve. Ez a tréning futás költségének mértéke, nem pedig annak, mennyire gyorsan válaszol a kész modell.
- Finomhangolás számítás
- 1 × 10¹⁸ FLOP
(1) * (38.71 * 10 ** 12) * (0.3) * (24 * 3600) = 1003363200000000000 (num gpu) * (peak flop) * (assumed utilization rate) * (time in seconds) from the paper: "This allows us to apply data-dependent compression to massive MoEs, while preserving the key feature of post-training compression techniques: the ability to perform effective compression using only modest computational resources, e.g., a single NVIDIA A6000 GPU and less than one day of compute." A6000 have 38.71 TFLOPs from https://www.tec…
A tréning futás
A fizikai tréninghez szükséges: milyen chippek, hány, meddig, és mennyi áramot fogyasztott.
- Képzési hardver
- NVIDIA RTX A6000
Elérhetőség
Hogy megszerezheti a modellt és futtathatja saját hardverén, ami meghatározza, hogy az ezen az oldalon szereplő grafikus kártya adatai vonatkoznak-e.
- Súlyok
- Open — downloadable
- Modell hozzáférés
- Open weights (unrestricted)
- Képzés kód
- Open source
apache 2.0 github.com/IST-DASLab/qmoe
Hogyan van besorolva
A forrásadatláncok bejegyzéseinél alkalmazott címkék és a bejegyzés melletti bizalmi szint.
- Confident
- Model/modellek nem illeszkedik a GPU VRAM-ba. Túl szoros = alig futtatható, kényelmes = könnyen fut a tartalékkal.
- 47
Model/modellek mindig AI modellek. Futás/futás azt jelenti, hogy fut egy AI modellt. Ha csak a "fut" szót kapod, az valószínűleg egy megosztott mondatból származik, mint például, hogy milyen AI modellt tud a GPU futtatni. Nem illik / nem fog illeni azt jelenti, hogy az AI modell nem fér el a GPU VRAM-jában. Szűk = alig futtatható, kényelmes = könnyen fut, van tartalék. Rövid összekötő szavak, mint az, a, egy, hogy, számára, vele, normálisan fordítva jelennek meg, mert a szöveg meg van osztva - csak fordítsd le őket. Tartásd meg a technikai kifejezéseket, mint a GPU, AI, TPS, VRAM, CUDA, Tensor, Inference, Quantization, LoRA, GGUF, FP16, INT4, INT8 angolul (vagy az adott nyelv elterjedt formájában). Mindig írj GPU, AI, TPS, VRAM, CUDA nagybetűkkel. Ha megkérdezik egy nyelv nevét (pl. spanyol, angol, nyelv) akkor fordítsd le a szót helyesen (spanyol→Spanyol, angol→Német, nyelv→Nyelv). CSAK a tiszta fordítást add meg magyarul. Nincsenek megjegyzések, nincsenek kérdések, semmi más. Ha üres, válaszolj egyetlen szóközzel: Sources
A GPU milyen AI modellt tud futtatni? Nem illik / nem fog illeni. szoros = alig futtatható, kényelmes = könnyen futtatja, van tartalék.
- Referencia
- QMoE: Practical Sub-1-Bit Compression of Trillion-Parameter Models
- Legutoljára frissítve
- 25 May 2026
Mit jelentenek a számok
The hardware side
At 1.6T parameters, QMoE: compressed SwitchTransformer is beyond what any single graphics card holds. Running it means either splitting it across several cards or renting hardware built for the job — 0 of the cards we track can hold it on their own, and all of them are datacentre parts.
Háttér
QMoE: compressed SwitchTransformer was published by Institute of Science and Technology Austria (ISTA),Neural Magic, in Austria, in October 2023. academia,Industry is the category the publisher falls under.
It works in Language, and is recorded as doing language modeling.
It is derived from Switch rather than trained from scratch, which is the usual way a specialised model is produced.
A súlyok közzététele megtörtént, így letölthető és futtatható a saját hardverén korlátlan ideig, offline, fiók csatolása nélkül.
Mi építette fel ezt
It was trained on about 576,000,000,000 tokens of text.
Lépésről lépésre
Hogyan válasszunk GPU-t a QMoE: compressed SwitchTransformer
A fenti táblázat már értékelte az összes kártyát, aminek a specifikációját ismerjük e modell ellen. A válaszhoz hat lépés vezet..
-
01
Olvasd el a memória adatokat először
The table lists every card that can hold QMoE: compressed SwitchTransformer. That figure, not the card's headline performance, is what decides whether it runs.
-
02
Döntsd el, milyen hosszúak legyenek a beszélgetéseid.
The conversation occupies memory too, and grows as it goes. Set the slider to the length you expect: at long context QMoE: compressed SwitchTransformer can slip off a card that handles short questions easily.
-
03
Állítsa be a minőségi szintet
Each card runs the least-compressed copy it can hold. Setting a floor drops the cards that only manage QMoE: compressed SwitchTransformer by squeezing it further than you would want.
-
04
Rendezés sebesség szerint
The speed ordering for QMoE: compressed SwitchTransformer is effectively an ordering by memory bandwidth.
-
05
Ellenőrizze a megfelelő illeszkedést vásárlás előtt
Tight means QMoE: compressed SwitchTransformer loads and works, with no room to raise the context later. Comfortable means you can. The difference matters more than a few tokens per second.
-
06
Nézd meg, mit futtat még az a kártya
Following a card through to its own page shows every other model it can hold, which is the question that follows once QMoE: compressed SwitchTransformer is settled.
válik / nem fér el
QMoE: compressed SwitchTransformer — Gyakori kérdések
What is QMoE: compressed SwitchTransformer used for?
QMoE: compressed SwitchTransformer works in Language, and is recorded as handling language modeling. These are the areas it was designed around; they describe intent rather than a hard boundary.
Where can I download QMoE: compressed SwitchTransformer?
The weights for QMoE: compressed SwitchTransformer are published, though we do not hold a repository link for it. This site calculates hardware requirements rather than hosting model files.
Can I run QMoE: compressed SwitchTransformer if it does not fit in my GPU?
It can be split between the card and system memory, but QMoE: compressed SwitchTransformer generates painfully slowly that way — the nearest miss we calculate is short by 691.9 GB. Nothing on this page assumes offloading.
Would two GPUs run QMoE: compressed SwitchTransformer faster?
Two cards buy memory rather than speed. That matters for QMoE: compressed SwitchTransformer only if one card cannot hold it — 0 can, so a second adds little.
Why does the quantisation differ between cards for QMoE: compressed SwitchTransformer?
A larger card holds a more accurate copy. Across the cards that run QMoE: compressed SwitchTransformer, 1 compression levels are used; the floor control above pins it to one.
How accurate are these QMoE: compressed SwitchTransformer speed estimates?
Minden érték a memória sávszélességéből és a modell méretből származik, nem tesztelték. Ezért minden egyes érték egy tartományként van közzétéve, például a tartomány, amely az egyes értékek alatt található, nem pedig egyetlen számként.
Is QMoE: compressed SwitchTransformer open source?
Its weights are published, so QMoE: compressed SwitchTransformer can be downloaded and run on your own hardware. Note that open weights is not the same as open source in the full sense — it says nothing about the training data, the training code, or the commercial terms attached.
How many parameters does QMoE: compressed SwitchTransformer have?
QMoE: compressed SwitchTransformer has 1.6T parameters. "Concretely, QMoE can compress the 1.6 trillion parameter SwitchTransformer-c2048 model to less than 160GB" Same parameter count as base model. This paper compresses the model; there is no learning from data. That figure is the total, and it is what decides how much memory the model needs — roughly half a gigabyte per billion at the compression most people use.
Who created QMoE: compressed SwitchTransformer?
QMoE: compressed SwitchTransformer was published by Institute of Science and Technology Austria (ISTA),Neural Magic, based in Austria, categorised as academia,Industry.
When was QMoE: compressed SwitchTransformer released?
QMoE: compressed SwitchTransformer was published in October 2023. Capability per parameter has improved considerably since, so a newer model of the same size is often the better use of the same hardware.
Modell/modelek mindig mesterséges intelligenciát (MI) jelentenek. Futtatás/járás azt jelenti, hogy egy MI modellt futtatunk. Ha csak a run szót kapod, valószínűleg egy felosztott mondatból származik, például: Milyen MI modellt tud futtatni a GPU. Nem illik / nem fog illeni azt jelenti, hogy az MI modell nem fér el a GPU VRAM-jában. Szoros = alig futtatható, kényelmes = könnyen fut, van tartalék. Rövid kapcsolatkozó szavak, mint az, a, egy, -hoz, -t, -val, önállóan jelennek meg, mert a szöveg fel van osztva - csak fordítsd le őket normálisan. Tartsd meg a technikai kifejezéseket, mint GPU, AI, TPS, VRAM, CUDA, Tensor, Inference, Quantization, LoRA, GGUF, FP16, INT4, INT8 angolul (vagy az adott nyelv általános formájában). Mindig írd a GPU, AI, TPS, VRAM, CUDA nagybetűvel. Ha nyelvnevet kérnek lefordítani, fordítsd le helyesen (spanyol→Spanisch, angol→Deutsch, nyelv→Sprache). CSAK a tiszta fordítást add meg magyarul. Nincs megjegyzés, nincs kérdés, semmi más. Ha üres, egyetlen szóközzel válaszolj: A rekord utolsó frissítése. 25 May 2026
Az ellenkező irányban
Egy másik oldalról nézve?
Ez az oldal a modellel kezdődik. Ha már van egy kártyád, és szeretnéd tudni, mit fog futtatni., modell/modellek nem illeszkedik / nem fog illeszkedni szoros = alig futtatható, kényelmes = könnyen fut, van mozgástér..