QMoE: compressed SwitchTransformer TPS számológép

Nyílt súlyok Institute of Science and Technology Austria (ISTA),Neural Magic 1.6T paraméterek October 2023

Az alábbi kártyát a választott kontextus hossza és minimális minőség alapján értékeljük e modell szerint. A sebesség egyetlen kérés becslése, amely a kártya memória sávszélességéből és a modell méretéből van kiszámítva, miután tömörítették..

Kiszámítva ehhez a modelhez

0 a 818 kártyák, amelyek futtathatják

Melyik GPU képes futtatni QMoE: compressed SwitchTransformer?

Állítsa be a bemeneteket, olvassa el a választ.

Egy hosszabb beszélgetéshez több memória szükséges, ami ezt a modellt kisebb kártyákról lejjebb tolhatja..

Elrejti azokat a kártyákat, amelyek csak a modellt illeszkednének, ha ezt a pontot alá tömörítjük..

0 kártyák illeszkednek

Számítás alatt
Needs kvantálás Fitt

A katalógusunkban nincs olyan kártya, ami ezzel a beállítással tudná futtatni ezt a modellt..

A sebességek egyetlen kérésre vonatkozó becslések — egy beszélgetés egy időben — a memória sávszélessége, a modell mérete és a kvantálás alapján számítva. A valós átvitel az inferencia futási időtől és annak verziójától függően változik. A hardvergyártók által közzétett számok sok párhuzamos kérést mérnek, és sokkal magasabbak..

A nyilvántartásban

Teljes specifikáció

Minden rögzítve van ennek a modellnek a számára. A legtöbb arról szól, hogyan lett betanítva, nem arról, hogyan fut. — Hasznos háttérinformáció annak megítélésére, hogy mennyi munka fektetődött bele, és hogyan viszonyul más, eltérő méretű modellekhez..

Eredet

Ki építette ezt a modellt, hol, és mikor publikálták.

Szervezés
Institute of Science and Technology Austria (ISTA),Neural Magic
Szervezet típus
Academia,Industry
Ország
Austria, United States of America
Közzétéve
25 October 2023
Szerzők
Elias Frantar, Dan Alistarh

Mit csinál

A problémás területek, amelyekre a modellt építették. Egy modell többből is eltarthat minden egyesből.

Domain
Language
Fut / futás AI modell. Nem illik / nem fog illeni, szoros = alig futtatható, kényelmes = könnyen fut, van hely. Melyik AI modellt tud futtatni a GPU?
Language modeling
Alapmodell
Switch

Méret

Mekkora a modell és mennyi adaton lett betanítva. A paraméterek határozzák meg, hogy elfér-e egy adott grafikus kártyán.

paraméterek
1.6T

"Concretely, QMoE can compress the 1.6 trillion parameter SwitchTransformer-c2048 model to less than 160GB" Same parameter count as base model. This paper compresses the model; there is no learning from data.

Tréning adatok
576,000,000,000 tokens

In this paper, the authors compress the SwitchTransformer-c2048 model. There is no training dataset used.

Képzés számítás

A modell tréningjéhez végzett aritmetika, lebegőpontos műveletekben mérve. Ez a tréning futás költségének mértéke, nem pedig annak, mennyire gyorsan válaszol a kész modell.

Finomhangolás számítás
1 × 10¹⁸ FLOP

(1) * (38.71 * 10 ** 12) * (0.3) * (24 * 3600) = 1003363200000000000 (num gpu) * (peak flop) * (assumed utilization rate) * (time in seconds) from the paper: "This allows us to apply data-dependent compression to massive MoEs, while preserving the key feature of post-training compression techniques: the ability to perform effective compression using only modest computational resources, e.g., a single NVIDIA A6000 GPU and less than one day of compute." A6000 have 38.71 TFLOPs from https://www.tec…

A tréning futás

A fizikai tréninghez szükséges: milyen chippek, hány, meddig, és mennyi áramot fogyasztott.

Képzési hardver
NVIDIA RTX A6000

Elérhetőség

Hogy megszerezheti a modellt és futtathatja saját hardverén, ami meghatározza, hogy az ezen az oldalon szereplő grafikus kártya adatai vonatkoznak-e.

Súlyok
Open — downloadable
Modell hozzáférés
Open weights (unrestricted)
Képzés kód
Open source

apache 2.0 github.com/IST-DASLab/qmoe

Hogyan van besorolva

A forrásadatláncok bejegyzéseinél alkalmazott címkék és a bejegyzés melletti bizalmi szint.

Confident
Model/modellek nem illeszkedik a GPU VRAM-ba. Túl szoros = alig futtatható, kényelmes = könnyen fut a tartalékkal.
47

Model/modellek mindig AI modellek. Futás/futás azt jelenti, hogy fut egy AI modellt. Ha csak a "fut" szót kapod, az valószínűleg egy megosztott mondatból származik, mint például, hogy milyen AI modellt tud a GPU futtatni. Nem illik / nem fog illeni azt jelenti, hogy az AI modell nem fér el a GPU VRAM-jában. Szűk = alig futtatható, kényelmes = könnyen fut, van tartalék. Rövid összekötő szavak, mint az, a, egy, hogy, számára, vele, normálisan fordítva jelennek meg, mert a szöveg meg van osztva - csak fordítsd le őket. Tartásd meg a technikai kifejezéseket, mint a GPU, AI, TPS, VRAM, CUDA, Tensor, Inference, Quantization, LoRA, GGUF, FP16, INT4, INT8 angolul (vagy az adott nyelv elterjedt formájában). Mindig írj GPU, AI, TPS, VRAM, CUDA nagybetűkkel. Ha megkérdezik egy nyelv nevét (pl. spanyol, angol, nyelv) akkor fordítsd le a szót helyesen (spanyol→Spanyol, angol→Német, nyelv→Nyelv). CSAK a tiszta fordítást add meg magyarul. Nincsenek megjegyzések, nincsenek kérdések, semmi más. Ha üres, válaszolj egyetlen szóközzel: Sources

A GPU milyen AI modellt tud futtatni? Nem illik / nem fog illeni. szoros = alig futtatható, kényelmes = könnyen futtatja, van tartalék.

Referencia
QMoE: Practical Sub-1-Bit Compression of Trillion-Parameter Models
Legutoljára frissítve
25 May 2026

Mit jelentenek a számok

The hardware side

At 1.6T parameters, QMoE: compressed SwitchTransformer is beyond what any single graphics card holds. Running it means either splitting it across several cards or renting hardware built for the job — 0 of the cards we track can hold it on their own, and all of them are datacentre parts.

Háttér

QMoE: compressed SwitchTransformer was published by Institute of Science and Technology Austria (ISTA),Neural Magic, in Austria, in October 2023. academia,Industry is the category the publisher falls under.

It works in Language, and is recorded as doing language modeling.

It is derived from Switch rather than trained from scratch, which is the usual way a specialised model is produced.

A súlyok közzététele megtörtént, így letölthető és futtatható a saját hardverén korlátlan ideig, offline, fiók csatolása nélkül.

Mi építette fel ezt

It was trained on about 576,000,000,000 tokens of text.

Lépésről lépésre

Hogyan válasszunk GPU-t a QMoE: compressed SwitchTransformer

A fenti táblázat már értékelte az összes kártyát, aminek a specifikációját ismerjük e modell ellen. A válaszhoz hat lépés vezet..

  1. 01

    Olvasd el a memória adatokat először

    The table lists every card that can hold QMoE: compressed SwitchTransformer. That figure, not the card's headline performance, is what decides whether it runs.

  2. 02

    Döntsd el, milyen hosszúak legyenek a beszélgetéseid.

    The conversation occupies memory too, and grows as it goes. Set the slider to the length you expect: at long context QMoE: compressed SwitchTransformer can slip off a card that handles short questions easily.

  3. 03

    Állítsa be a minőségi szintet

    Each card runs the least-compressed copy it can hold. Setting a floor drops the cards that only manage QMoE: compressed SwitchTransformer by squeezing it further than you would want.

  4. 04

    Rendezés sebesség szerint

    The speed ordering for QMoE: compressed SwitchTransformer is effectively an ordering by memory bandwidth.

  5. 05

    Ellenőrizze a megfelelő illeszkedést vásárlás előtt

    Tight means QMoE: compressed SwitchTransformer loads and works, with no room to raise the context later. Comfortable means you can. The difference matters more than a few tokens per second.

  6. 06

    Nézd meg, mit futtat még az a kártya

    Following a card through to its own page shows every other model it can hold, which is the question that follows once QMoE: compressed SwitchTransformer is settled.

válik / nem fér el

QMoE: compressed SwitchTransformer — Gyakori kérdések

01

What is QMoE: compressed SwitchTransformer used for?

QMoE: compressed SwitchTransformer works in Language, and is recorded as handling language modeling. These are the areas it was designed around; they describe intent rather than a hard boundary.

02

Where can I download QMoE: compressed SwitchTransformer?

The weights for QMoE: compressed SwitchTransformer are published, though we do not hold a repository link for it. This site calculates hardware requirements rather than hosting model files.

03

Can I run QMoE: compressed SwitchTransformer if it does not fit in my GPU?

It can be split between the card and system memory, but QMoE: compressed SwitchTransformer generates painfully slowly that way — the nearest miss we calculate is short by 691.9 GB. Nothing on this page assumes offloading.

04

Would two GPUs run QMoE: compressed SwitchTransformer faster?

Two cards buy memory rather than speed. That matters for QMoE: compressed SwitchTransformer only if one card cannot hold it — 0 can, so a second adds little.

05

Why does the quantisation differ between cards for QMoE: compressed SwitchTransformer?

A larger card holds a more accurate copy. Across the cards that run QMoE: compressed SwitchTransformer, 1 compression levels are used; the floor control above pins it to one.

06

How accurate are these QMoE: compressed SwitchTransformer speed estimates?

Minden érték a memória sávszélességéből és a modell méretből származik, nem tesztelték. Ezért minden egyes érték egy tartományként van közzétéve, például a tartomány, amely az egyes értékek alatt található, nem pedig egyetlen számként.

07

Is QMoE: compressed SwitchTransformer open source?

Its weights are published, so QMoE: compressed SwitchTransformer can be downloaded and run on your own hardware. Note that open weights is not the same as open source in the full sense — it says nothing about the training data, the training code, or the commercial terms attached.

08

How many parameters does QMoE: compressed SwitchTransformer have?

QMoE: compressed SwitchTransformer has 1.6T parameters. "Concretely, QMoE can compress the 1.6 trillion parameter SwitchTransformer-c2048 model to less than 160GB" Same parameter count as base model. This paper compresses the model; there is no learning from data. That figure is the total, and it is what decides how much memory the model needs — roughly half a gigabyte per billion at the compression most people use.

09

Who created QMoE: compressed SwitchTransformer?

QMoE: compressed SwitchTransformer was published by Institute of Science and Technology Austria (ISTA),Neural Magic, based in Austria, categorised as academia,Industry.

10

When was QMoE: compressed SwitchTransformer released?

QMoE: compressed SwitchTransformer was published in October 2023. Capability per parameter has improved considerably since, so a newer model of the same size is often the better use of the same hardware.

Eredeti kiadás

Modell/modelek mindig mesterséges intelligenciát (MI) jelentenek. Futtatás/járás azt jelenti, hogy egy MI modellt futtatunk. Ha csak a run szót kapod, valószínűleg egy felosztott mondatból származik, például: Milyen MI modellt tud futtatni a GPU. Nem illik / nem fog illeni azt jelenti, hogy az MI modell nem fér el a GPU VRAM-jában. Szoros = alig futtatható, kényelmes = könnyen fut, van tartalék. Rövid kapcsolatkozó szavak, mint az, a, egy, -hoz, -t, -val, önállóan jelennek meg, mert a szöveg fel van osztva - csak fordítsd le őket normálisan. Tartsd meg a technikai kifejezéseket, mint GPU, AI, TPS, VRAM, CUDA, Tensor, Inference, Quantization, LoRA, GGUF, FP16, INT4, INT8 angolul (vagy az adott nyelv általános formájában). Mindig írd a GPU, AI, TPS, VRAM, CUDA nagybetűvel. Ha nyelvnevet kérnek lefordítani, fordítsd le helyesen (spanyol→Spanisch, angol→Deutsch, nyelv→Sprache). CSAK a tiszta fordítást add meg magyarul. Nincs megjegyzés, nincs kérdés, semmi más. Ha üres, egyetlen szóközzel válaszolj: A rekord utolsó frissítése. 25 May 2026

Az ellenkező irányban

Egy másik oldalról nézve?

Ez az oldal a modellel kezdődik. Ha már van egy kártyád, és szeretnéd tudni, mit fog futtatni., modell/modellek nem illeszkedik / nem fog illeszkedni szoros = alig futtatható, kényelmes = könnyen fut, van mozgástér..