Qwen3-8B Calcolatore TPS
Ogni scheda sotto valutata rispetto a questo modello alla lunghezza di contesto e qualità minima da Lei scelta. La velocità è una stima per una singola richiesta, calcolata in base alla larghezza di banda della memoria della scheda e alla dimensione del modello una volta compresso.
Calcolato per questo modello
818 schede di cui abbiamo le specifiche
La scheda più piccola che si adatta
Quadro 6000
6 GB · Q3_K_M · 17.0 tok/s
Scheda più veloce
B200
413 tok/s · 180 GB
Quali GPU possono eseguire Qwen3-8B?
Imposta gli input, leggi la risposta
Una conversazione più lunga richiede più memoria, il che può far sì che questo modello venga eliminato da schede di dimensioni minori.
Nasconde le schede che si adatterebbero solo al modello comprimendole al di sotto di questo punto.
582 schede corrispondenti
Calcolo| Necessità | Quantizzazione | Adatto | |||||
|---|---|---|---|---|---|---|---|
|
413
tok/s
351–496 |
B200 NVIDIA | 180 GB | 8,000 GB/s | Jan 2024 | 10.1 GB | Q8_0 | Confortevole |
|
413
tok/s
351–496 |
B300 NVIDIA | 288 GB | 8,000 GB/s | Sep 2025 | 10.1 GB | Q8_0 | Confortevole |
|
330
tok/s
198–528 · bassa fiducia |
Radeon Instinct MI350X AMD | 288 GB | 8,190 GB/s | Jan 2025 | 10.1 GB | Q8_0 | Confortevole |
|
330
tok/s
198–528 · bassa fiducia |
Radeon Instinct MI355X AMD | 288 GB | 8,190 GB/s | Jan 2025 | 10.1 GB | Q8_0 | Confortevole |
|
264
tok/s
158–422 · bassa fiducia |
Radeon Instinct MI300 AMD | 128 GB | 6,550 GB/s | Jan 2023 | 10.1 GB | Q8_0 | Confortevole |
|
253
tok/s
215–303 |
H200 NVL NVIDIA | 141 GB | 4,890 GB/s | Nov 2024 | 10.1 GB | Q8_0 | Confortevole |
|
253
tok/s
215–303 |
H200 SXM 141 GB NVIDIA | 141 GB | 4,890 GB/s | Nov 2024 | 10.1 GB | Q8_0 | Confortevole |
|
242
tok/s
145–387 · bassa fiducia |
Radeon Instinct MI325X AMD | 256 GB | 6,000 GB/s | Oct 2024 | 10.1 GB | Q8_0 | Confortevole |
|
215
tok/s
129–343 · bassa fiducia |
Radeon Instinct MI300A AMD | 128 GB | 5,325 GB/s | Dec 2023 | 10.1 GB | Q8_0 | Confortevole |
|
215
tok/s
129–343 · bassa fiducia |
Radeon Instinct MI300X AMD | 192 GB | 5,325 GB/s | Dec 2023 | 10.1 GB | Q8_0 | Confortevole |
|
215
tok/s
129–343 · bassa fiducia |
Radeon Instinct MI308X AMD | 192 GB | 5,325 GB/s | Dec 2023 | 10.1 GB | Q8_0 | Confortevole |
|
204
tok/s
173–244 |
H100 NVL 94 GB NVIDIA | 94 GB | 3,940 GB/s | Mar 2023 | 10.1 GB | Q8_0 | Confortevole |
|
178
tok/s
151–213 |
CMP 170HX 8 GB NVIDIA | 8 GB | 1,490 GB/s | Sep 2021 | 6.3 GB | Q4_K_M | Stretto |
|
174
tok/s
148–208 |
H100 PCIe 96 GB NVIDIA | 96 GB | 3,360 GB/s | Mar 2023 | 10.1 GB | Q8_0 | Confortevole |
|
174
tok/s
148–208 |
H100 SXM5 80 GB NVIDIA | 80 GB | 3,360 GB/s | Oct 2022 | 10.1 GB | Q8_0 | Confortevole |
|
174
tok/s
148–208 |
H100 SXM5 94 GB NVIDIA | 94 GB | 3,360 GB/s | Mar 2023 | 10.1 GB | Q8_0 | Confortevole |
|
174
tok/s
148–208 |
H100 SXM5 96 GB NVIDIA | 96 GB | 3,360 GB/s | Mar 2023 | 10.1 GB | Q8_0 | Confortevole |
|
174
tok/s
148–208 |
H800 SXM5 NVIDIA | 80 GB | 3,360 GB/s | Mar 2023 | 10.1 GB | Q8_0 | Confortevole |
|
132
tok/s
79–211 · bassa fiducia |
Radeon Instinct MI250 AMD | 128 GB | 3,280 GB/s | Nov 2021 | 10.1 GB | Q8_0 | Confortevole |
|
132
tok/s
79–211 · bassa fiducia |
Radeon Instinct MI250X AMD | 128 GB | 3,280 GB/s | Nov 2021 | 10.1 GB | Q8_0 | Confortevole |
|
117
tok/s
100–140 |
CMP 170HX 10 GB NVIDIA | 10 GB | 1,560 GB/s | Sep 2021 | 8.2 GB | Q6_K | Stretto |
|
110
tok/s
66–176 · bassa fiducia |
Data Center GPU Max 1550 Intel | 128 GB | 3,280 GB/s | Jan 2023 | 10.1 GB | Q8_0 | Confortevole |
|
108
tok/s
65–172 · bassa fiducia |
Data Center GPU Max Subsystem Intel | 128 GB | 3,210 GB/s | Jan 2023 | 10.1 GB | Q8_0 | Confortevole |
|
105
tok/s
90–126 |
A100 SXM4 80 GB NVIDIA | 80 GB | 2,040 GB/s | Nov 2020 | 10.1 GB | Q8_0 | Confortevole |
|
105
tok/s
90–126 |
A100X NVIDIA | 80 GB | 2,040 GB/s | Jun 2021 | 10.1 GB | Q8_0 | Confortevole |
Le velocità sono stime per una singola richiesta — una conversazione alla volta — calcolate in base alla bandwidth della memoria, alle dimensioni del modello e alla quantizzazione. La reale capacità di throughput varia in base al runtime dell'inferenza e alla sua versione. Le cifre pubblicate dai fornitori di hardware misurano molte richieste contemporaneamente e sono molto più elevate.
In registrazione
Specifiche complete
Tutto ciò che riguarda questo modello. La maggior parte delle informazioni descrive come è stato addestrato piuttosto che come viene eseguito — un contesto utile per valutare la quantità di lavoro impiegata e come si confronta con modelli realizzati su scala diversa.
Origine
Chi ha costruito questo modello, dove e quando è stato pubblicato.
- Organizzazione
- Alibaba
- Tipo di organizzazione
- Industry
- Paese
- China
- Pubblicato
- 29 April 2025
Cosa fa
Le aree problematiche per cui è stato costruito il modello. Un modello può contenere diversi di ciascuno.
- Dominio
- Language
- Compito
- Language modeling/generation, Question answering, Mathematical reasoning, Quantitative reasoning, Code generation, Translation
Dimensione
Quanto è grande il modello e su quanti dati è stato addestrato. I parametri sono il valore che decide se si adatta a una determinata scheda grafica.
- Parametri
- 8.2B
- Dati di addestramento
- tokens
- Epoche
- 1
Number of Parameters: 8.2B Number of Paramaters (Non-Embedding): 6.95B Number of Layers: 36 Number of Attention Heads (GQA): 32 for Q and 8 for KV Context Length: 32,768 natively and 131,072 tokens with YaRN.
36T
Addestramento computazionale
L'aritmetica eseguita per addestrare il modello, misurata in operazioni in virgola mobile. È una misura di quanto costato l'addestramento, non di quanto velocemente il modello finito ti risponde.
- Addestramento computazionale
- 1.8 × 10²⁴ FLOP
- Come è stato stabilito
- Operation counting
6 FLOP / parameter / token * 36 * 10^12 tokens * 8.2 * 10^9 parameters = 1.7712e+24 FLOP
Disponibilità
Se puoi ottenere il modello e eseguirlo sul tuo hardware, il che decide se una delle cifre della scheda grafica su questa pagina si applica.
- Pesi
- Open — downloadable
- Accesso al modello
- Open weights (unrestricted)
- Codice di addestramento
- Unreleased
- Hugging Face
- Qwen
Apache 2.0 https://huggingface.co/Qwen/Qwen3-8B-Base
Come è classificato
Etichette che il dataset sorgente applica quando si monitorano modelli notevoli e quanto è fiducioso nell'entry.
- Probabilmente sopra 10²³ FLOP
- Yes
- Registrare fiducia
- Confident
Fonti
Da dove proviene questo record e quando è stato controllato l'ultima volta.
- Riferimento
- Qwen3: Think Deeper, Act Faster
- Ultimo aggiornamento
- 28 November 2025
Gli estremi
I dieci GPU più veloci che eseguono Qwen3-8B
Classificato per token stimati al secondo, la scheda più recente per prima dove le velocità sono pari. Poiché la generazione è limitata dalla larghezza di banda della memoria, questo ordinamento segue la larghezza di banda piuttosto che un benchmark di gioco..
- 01 B300 288 GB · 8,000 GB/s · Q8_0 413 tok/s
- 02 B200 180 GB · 8,000 GB/s · Q8_0 413 tok/s
- 03 Radeon Instinct MI350X 288 GB · 8,190 GB/s · Q8_0 330 tok/s
- 04 Radeon Instinct MI355X 288 GB · 8,190 GB/s · Q8_0 330 tok/s
- 05 Radeon Instinct MI300 128 GB · 6,550 GB/s · Q8_0 264 tok/s
- 06 H200 NVL 141 GB · 4,890 GB/s · Q8_0 253 tok/s
- 07 H200 SXM 141 GB 141 GB · 4,890 GB/s · Q8_0 253 tok/s
- 08 Radeon Instinct MI325X 256 GB · 6,000 GB/s · Q8_0 242 tok/s
- 09 Radeon Instinct MI300A 128 GB · 5,325 GB/s · Q8_0 215 tok/s
- 10 Radeon Instinct MI300X 192 GB · 5,325 GB/s · Q8_0 215 tok/s
Le GPU più piccole che ancora funzionano Qwen3-8B
La rotta più economica per entrare, in base alla capacità di memoria. Un adattamento stretto esegue il modello ma non lascia nulla in più per una conversazione più lunga..
- 01 RTX 1000 Mobile Ada Generation 6 GB · Necessità 5.3 GB · Q3_K_M · Stretto 26.8 tok/s
- 02 GeForce RTX 3050 6 GB 6 GB · Necessità 5.3 GB · Q3_K_M · Stretto 23.4 tok/s
- 03 Arc A380M 6 GB · Necessità 5.3 GB · Q3_K_M · Stretto 16.9 tok/s
- 04 GeForce RTX 4050 Max-Q 6 GB · Necessità 5.3 GB · Q3_K_M · Stretto 26.8 tok/s
- 05 GeForce RTX 4050 Mobile 6 GB · Necessità 5.3 GB · Q3_K_M · Stretto 26.8 tok/s
- 06 Data Center GPU Flex 140 6 GB · Necessità 5.3 GB · Q3_K_M · Stretto 16.9 tok/s
- 07 Arc Pro A40 6 GB · Necessità 5.3 GB · Q3_K_M · Stretto 17.4 tok/s
- 08 Arc Pro A50 6 GB · Necessità 5.3 GB · Q3_K_M · Stretto 17.4 tok/s
- 09 GeForce RTX 3050 Max-Q Refresh 6 GB 6 GB · Necessità 5.3 GB · Q3_K_M · Stretto 18.4 tok/s
- 10 GeForce RTX 3050 Mobile Refresh 6 GB 6 GB · Necessità 5.3 GB · Q3_K_M · Stretto 23.4 tok/s
Cosa significano i numeri
Il lato hardware
Scheda minima
Quadro 6000
Memoria necessaria
5.3 GB
Più veloce
413 tok/s
Qwen3-8B è abbastanza piccolo con 8,2 miliardi di parametri che l'hardware è raramente l'ostacolo — 582 delle schede che monitoriamo possono eseguirlo, comprese schede di diversi anni fa.
A livello più basso, una Quadro 6000 lo gestisce - 6 GB, a Q3_K_M, per circa 17,0 token al secondo.
Un B200 è il più veloce che calcoliamo per esso: circa 413 token al secondo, da 8.000 GB/s di larghezza di banda della memoria.
Informazioni su questo modello
Qwen3-8B è stato pubblicato da Alibaba, in Cina, ad aprile 2025. Proviene dall'industria.
Funziona in Lingua ed è registrato come attività di modellazione/generazione linguistica, risposta a domande, ragionamento matematico, ragionamento quantitativo, generazione di codice, traduzione.
Poiché i suoi pesi sono stati rilasciati, nulla riguardo l'esecuzione dipende dalla disponibilità di un fornitore — è tuo una volta scaricato. È pubblicato sotto l'organizzazione Qwen su Hugging Face.
Quanto velocemente funziona e perché
Il risultato mediano è di circa 26,0 token al secondo; 554 schede producono testo più velocemente di quanto la maggior parte delle persone lo legga.
Ogni peso partecipa a ogni token qui, quindi la larghezza di banda è tutta la storia: la classifica qui sotto è effettivamente una classifica del throughput di memoria.
Poiché l'architettura è registrata, la colonna della memoria è derivata piuttosto che stimata.
Come è stato addestrato
La produzione ha richiesto circa 1,8 × 10²⁴ FLOP di calcoli aritmetici, che è un'affermazione sul budget di addestramento piuttosto che sull'inferenza.
Passo dopo passo
Come scegliere una GPU per Qwen3-8B
La tabella sopra ha già valutato ogni scheda in nostro possesso rispetto a questo modello. Per arrivare alla sua risposta sono necessari sei passaggi..
-
01
Inizia dalla colonna della memoria
La tabella elenca ogni scheda che può supportare Qwen3-8B - circa 5,3 GB a Q3_K_M. Questa cifra, non le prestazioni di punta della scheda, decide se può essere eseguita.
-
02
Adatta il contesto al tuo utilizzo attuale
Le conversazioni più lunghe consumano memoria oltre a ciò di cui hanno bisogno i pesi. Sposta il cursore sulla tua reale lunghezza di lavoro prima di fidarti di qualsiasi riga per Qwen3-8B.
-
03
Imposta un livello di qualità
Ogni scheda esegue la copia meno compressa che può contenere — Q3_K_M sulla scheda più piccola che si adatta. Impostare un limite esclude le schede che gestiscono solo Qwen3-8B comprimendola ulteriormente di quanto vorresti.
-
04
Confronta i TPS, non le specifiche
La classifica per token al secondo per Qwen3-8B segue la larghezza di banda della memoria, non il numero di core, motivo per cui il B200 la supera a 413 tok/s.
-
05
Guarda lo spazio, non solo il fitting.
Una compatibilità stretta esegue Qwen3-8B ma non lascia nulla in riserva per una conversazione più lunga; comoda ha margine. Se prevedi di ampliare il contesto, acquista per comoda.
-
06
Guarda cos'altro quella scheda esegue
Ogni pagina della scheda ripete questo controllo per ogni modello che abbiamo. Risponde a cosa altro è buono l'hardware, oltre a Qwen3-8B.
Risposte
Qwen3-8B — Domande frequenti
Due GPU eseguiranno Qwen3-8B più velocemente?
Due schede acquistano memoria piuttosto che velocità. Questo è importante per Qwen3-8B solo se una scheda non può contenerla — 582 può, quindi una seconda aggiunge poco.
Perché la quantizzazione differisce tra le schede per Qwen3-8B?
Ogni scheda mostra in esecuzione la copia meno compressa che può contenere e Qwen3-8B appare a 4 diversi livelli di compressione tra le schede che lo supportano. Le schede più grandi ottengono la versione più accurata.
Quanto sono accurate queste stime di velocità Qwen3-8B?
Queste sono stime con barre di errore reali. Il risultato più veloce qui, 351–496 tok/s sul B200, potrebbe ragionevolmente trovarsi ovunque nella sua gamma pubblicata a seconda del runtime che utilizzi.
Quale GPU ho bisogno per eseguire Qwen3-8B?
La scheda più piccola nel nostro catalogo che supporta Qwen3-8B è la Quadro 6000, con 6 GB di memoria. Esegue il modello a Q3_K_M utilizzando circa 5,3 GB e produce circa 17,0 token al secondo. In totale, 582 schede possono eseguirlo.
Quanto è veloce Qwen3-8B su una GPU?
Dipende dalla scheda. La più veloce che calcoliamo è una B200 a circa 413 token al secondo; la più lenta che riesce ancora a farlo gestisce considerevolmente meno. La velocità di lettura è di circa dieci token al secondo, e 554 delle schede che possono eseguire Qwen3-8B chiariscono questo.
Quanta VRAM necessita Qwen3-8B?
Circa 5,3 GB con compressione Q3_K_M, che è ciò che utilizza la scheda più piccola che riesce a eseguirlo. Meno compressione richiede di più: le cifre nella colonna della memoria sopra sono ricalcolate per ogni scheda, poiché ognuna tiene la versione con la compressione minore possibile.
Posso eseguire Qwen3-8B su una GPU da 8 GB?
Sì. Un CMP 170HX 8 GB con 8 GB lo esegue a Q4_K_M, utilizzando circa 6,3 GB e generando circa 178 token al secondo — un adattamento stretto.
Posso eseguire Qwen3-8B su una GPU da 12 GB?
Sì. Una GeForce RTX 3080 Ti con 12 GB lo esegue a Q8_0, usando circa 10,1 GB e generando circa 47,1 token al secondo — un adattamento stretto.
Posso eseguire Qwen3-8B su una GPU da 16 GB?
Sì. Un Tesla V100 SXM2 16 GB con 16 GB lo esegue a Q8_0, utilizzando circa 10,1 GB e generando circa 58,4 token al secondo — un adattamento confortevole.
Posso eseguire Qwen3-8B su una GPU da 24 GB?
Sì. Una GeForce RTX 5090 D V2 con 24 GB la esegue a Q8_0, utilizzando circa 10.1 GB e generando circa 69.2 token al secondo — una soluzione comoda.
Qwen3-8B è open source?
I suoi pesi sono pubblicati, quindi Qwen3-8B può essere scaricato e eseguito sul tuo hardware. Nota che pesi aperti non è la stessa cosa di open source nel senso completo — non dice nulla sui dati di addestramento, sul codice di addestramento o sui termini commerciali allegati.
Quanti parametri ha Qwen3-8B?
Qwen3-8B ha 8,2 miliardi di parametri. Numero di parametri: 8,2 miliardi Numero di parametri (Non-Embedding): 6,95 miliardi Numero di layer: 36 Numero di teste di attenzione (GQA): 32 per Q e 8 per KV Lunghezza del contesto: 32.768 nativamente e 131.072 token con YaRN. Quella cifra è il totale ed è ciò che decide quanta memoria ha bisogno il modello — circa mezzo gigabyte per miliardo con la compressione che la maggior parte delle persone utilizza.
Chi ha creato Qwen3-8B?
Qwen3-8B è stato pubblicato da Alibaba, con sede in Cina, classificato come industria.
Quando è stato rilasciato Qwen3-8B?
Qwen3-8B è stato pubblicato nell'aprile 2025.
A cosa serve Qwen3-8B?
Qwen3-8B funziona in Lingua ed è registrato come gestore di modellazione/generazione linguistica, risposta a domande, ragionamento matematico, ragionamento quantitativo, generazione di codice, traduzione. Questi sono i settori intorno ai quali è stato progettato; descrivono l'intento piuttosto che un confine rigido.
Dove posso scaricare Qwen3-8B?
I suoi pesi sono pubblicati sotto l'organizzazione Qwen su Hugging Face. Non ospitiamo file di modelli — questo sito calcola quale hardware è necessario per eseguirli.
Quanta potenza di calcolo è stata utilizzata per addestrare Qwen3-8B?
Circa 1.8 × 10²⁴ FLOP. Questo misura quanto è costato produrre il modello e non dice nulla su quanto rapidamente risponde una volta addestrato — la velocità di inferenza deriva dalla larghezza di banda della memoria, non dal budget di addestramento.
Posso eseguire Qwen3-8B se non entra nella mia GPU?
Solo attraverso il caricamento, che di solito è un falso risparmio: la parte nella memoria di sistema trascina tutto verso il basso - la più vicina mancanza che calcoliamo è inferiore di 1,8 GB. I nostri dati per Qwen3-8B assumono che sia completamente residente.
L'altra direzione
Guardando la questione dall'altra parte?
Questa pagina inizia dal modello. Se possedete già una scheda e desiderate conoscere tutto ciò che può eseguire, inizia dall'hardware invece.