Qwen3-8B Calcolatore TPS

Open weights Alibaba 8.2B Parametri April 2025

Ogni scheda sotto valutata rispetto a questo modello alla lunghezza di contesto e qualità minima da Lei scelta. La velocità è una stima per una singola richiesta, calcolata in base alla larghezza di banda della memoria della scheda e alla dimensione del modello una volta compresso.

Calcolato per questo modello

582 schede che possono eseguirlo

818 schede di cui abbiamo le specifiche

La scheda più piccola che si adatta

Quadro 6000

6 GB · Q3_K_M · 17.0 tok/s

Scheda più veloce

B200

413 tok/s · 180 GB

Quali GPU possono eseguire Qwen3-8B?

Imposta gli input, leggi la risposta

Una conversazione più lunga richiede più memoria, il che può far sì che questo modello venga eliminato da schede di dimensioni minori.

Nasconde le schede che si adatterebbero solo al modello comprimendole al di sotto di questo punto.

582 schede corrispondenti

Calcolo
Necessità Quantizzazione Adatto
413 tok/s

351–496

B200 NVIDIA 180 GB 8,000 GB/s Jan 2024 10.1 GB Q8_0 Confortevole
413 tok/s

351–496

B300 NVIDIA 288 GB 8,000 GB/s Sep 2025 10.1 GB Q8_0 Confortevole
330 tok/s

198–528 · bassa fiducia

Radeon Instinct MI350X AMD 288 GB 8,190 GB/s Jan 2025 10.1 GB Q8_0 Confortevole
330 tok/s

198–528 · bassa fiducia

Radeon Instinct MI355X AMD 288 GB 8,190 GB/s Jan 2025 10.1 GB Q8_0 Confortevole
264 tok/s

158–422 · bassa fiducia

Radeon Instinct MI300 AMD 128 GB 6,550 GB/s Jan 2023 10.1 GB Q8_0 Confortevole
253 tok/s

215–303

H200 NVL NVIDIA 141 GB 4,890 GB/s Nov 2024 10.1 GB Q8_0 Confortevole
253 tok/s

215–303

H200 SXM 141 GB NVIDIA 141 GB 4,890 GB/s Nov 2024 10.1 GB Q8_0 Confortevole
242 tok/s

145–387 · bassa fiducia

Radeon Instinct MI325X AMD 256 GB 6,000 GB/s Oct 2024 10.1 GB Q8_0 Confortevole
215 tok/s

129–343 · bassa fiducia

Radeon Instinct MI300A AMD 128 GB 5,325 GB/s Dec 2023 10.1 GB Q8_0 Confortevole
215 tok/s

129–343 · bassa fiducia

Radeon Instinct MI300X AMD 192 GB 5,325 GB/s Dec 2023 10.1 GB Q8_0 Confortevole
215 tok/s

129–343 · bassa fiducia

Radeon Instinct MI308X AMD 192 GB 5,325 GB/s Dec 2023 10.1 GB Q8_0 Confortevole
204 tok/s

173–244

H100 NVL 94 GB NVIDIA 94 GB 3,940 GB/s Mar 2023 10.1 GB Q8_0 Confortevole
178 tok/s

151–213

CMP 170HX 8 GB NVIDIA 8 GB 1,490 GB/s Sep 2021 6.3 GB Q4_K_M Stretto
174 tok/s

148–208

H100 PCIe 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 10.1 GB Q8_0 Confortevole
174 tok/s

148–208

H100 SXM5 80 GB NVIDIA 80 GB 3,360 GB/s Oct 2022 10.1 GB Q8_0 Confortevole
174 tok/s

148–208

H100 SXM5 94 GB NVIDIA 94 GB 3,360 GB/s Mar 2023 10.1 GB Q8_0 Confortevole
174 tok/s

148–208

H100 SXM5 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 10.1 GB Q8_0 Confortevole
174 tok/s

148–208

H800 SXM5 NVIDIA 80 GB 3,360 GB/s Mar 2023 10.1 GB Q8_0 Confortevole
132 tok/s

79–211 · bassa fiducia

Radeon Instinct MI250 AMD 128 GB 3,280 GB/s Nov 2021 10.1 GB Q8_0 Confortevole
132 tok/s

79–211 · bassa fiducia

Radeon Instinct MI250X AMD 128 GB 3,280 GB/s Nov 2021 10.1 GB Q8_0 Confortevole
117 tok/s

100–140

CMP 170HX 10 GB NVIDIA 10 GB 1,560 GB/s Sep 2021 8.2 GB Q6_K Stretto
110 tok/s

66–176 · bassa fiducia

Data Center GPU Max 1550 Intel 128 GB 3,280 GB/s Jan 2023 10.1 GB Q8_0 Confortevole
108 tok/s

65–172 · bassa fiducia

Data Center GPU Max Subsystem Intel 128 GB 3,210 GB/s Jan 2023 10.1 GB Q8_0 Confortevole
105 tok/s

90–126

A100 SXM4 80 GB NVIDIA 80 GB 2,040 GB/s Nov 2020 10.1 GB Q8_0 Confortevole
105 tok/s

90–126

A100X NVIDIA 80 GB 2,040 GB/s Jun 2021 10.1 GB Q8_0 Confortevole

Le velocità sono stime per una singola richiesta — una conversazione alla volta — calcolate in base alla bandwidth della memoria, alle dimensioni del modello e alla quantizzazione. La reale capacità di throughput varia in base al runtime dell'inferenza e alla sua versione. Le cifre pubblicate dai fornitori di hardware misurano molte richieste contemporaneamente e sono molto più elevate.

In registrazione

Specifiche complete

Tutto ciò che riguarda questo modello. La maggior parte delle informazioni descrive come è stato addestrato piuttosto che come viene eseguito — un contesto utile per valutare la quantità di lavoro impiegata e come si confronta con modelli realizzati su scala diversa.

Origine

Chi ha costruito questo modello, dove e quando è stato pubblicato.

Organizzazione
Alibaba
Tipo di organizzazione
Industry
Paese
China
Pubblicato
29 April 2025

Cosa fa

Le aree problematiche per cui è stato costruito il modello. Un modello può contenere diversi di ciascuno.

Dominio
Language
Compito
Language modeling/generation, Question answering, Mathematical reasoning, Quantitative reasoning, Code generation, Translation

Dimensione

Quanto è grande il modello e su quanti dati è stato addestrato. I parametri sono il valore che decide se si adatta a una determinata scheda grafica.

Parametri
8.2B

Number of Parameters: 8.2B Number of Paramaters (Non-Embedding): 6.95B Number of Layers: 36 Number of Attention Heads (GQA): 32 for Q and 8 for KV Context Length: 32,768 natively and 131,072 tokens with YaRN.

Dati di addestramento
tokens

36T

Epoche
1

Addestramento computazionale

L'aritmetica eseguita per addestrare il modello, misurata in operazioni in virgola mobile. È una misura di quanto costato l'addestramento, non di quanto velocemente il modello finito ti risponde.

Addestramento computazionale
1.8 × 10²⁴ FLOP

6 FLOP / parameter / token * 36 * 10^12 tokens * 8.2 * 10^9 parameters = 1.7712e+24 FLOP

Come è stato stabilito
Operation counting

Disponibilità

Se puoi ottenere il modello e eseguirlo sul tuo hardware, il che decide se una delle cifre della scheda grafica su questa pagina si applica.

Pesi
Open — downloadable
Accesso al modello
Open weights (unrestricted)
Codice di addestramento
Unreleased

Apache 2.0 https://huggingface.co/Qwen/Qwen3-8B-Base

Hugging Face
Qwen

Come è classificato

Etichette che il dataset sorgente applica quando si monitorano modelli notevoli e quanto è fiducioso nell'entry.

Probabilmente sopra 10²³ FLOP
Yes
Registrare fiducia
Confident

Fonti

Da dove proviene questo record e quando è stato controllato l'ultima volta.

Riferimento
Qwen3: Think Deeper, Act Faster
Ultimo aggiornamento
28 November 2025

Gli estremi

Cosa significano i numeri

Il lato hardware

Scheda minima

Quadro 6000

Memoria necessaria

5.3 GB

Più veloce

413 tok/s

Qwen3-8B è abbastanza piccolo con 8,2 miliardi di parametri che l'hardware è raramente l'ostacolo — 582 delle schede che monitoriamo possono eseguirlo, comprese schede di diversi anni fa.

A livello più basso, una Quadro 6000 lo gestisce - 6 GB, a Q3_K_M, per circa 17,0 token al secondo.

Un B200 è il più veloce che calcoliamo per esso: circa 413 token al secondo, da 8.000 GB/s di larghezza di banda della memoria.

Informazioni su questo modello

Qwen3-8B è stato pubblicato da Alibaba, in Cina, ad aprile 2025. Proviene dall'industria.

Funziona in Lingua ed è registrato come attività di modellazione/generazione linguistica, risposta a domande, ragionamento matematico, ragionamento quantitativo, generazione di codice, traduzione.

Poiché i suoi pesi sono stati rilasciati, nulla riguardo l'esecuzione dipende dalla disponibilità di un fornitore — è tuo una volta scaricato. È pubblicato sotto l'organizzazione Qwen su Hugging Face.

Quanto velocemente funziona e perché

Il risultato mediano è di circa 26,0 token al secondo; 554 schede producono testo più velocemente di quanto la maggior parte delle persone lo legga.

Ogni peso partecipa a ogni token qui, quindi la larghezza di banda è tutta la storia: la classifica qui sotto è effettivamente una classifica del throughput di memoria.

Poiché l'architettura è registrata, la colonna della memoria è derivata piuttosto che stimata.

Come è stato addestrato

La produzione ha richiesto circa 1,8 × 10²⁴ FLOP di calcoli aritmetici, che è un'affermazione sul budget di addestramento piuttosto che sull'inferenza.

Passo dopo passo

Come scegliere una GPU per Qwen3-8B

La tabella sopra ha già valutato ogni scheda in nostro possesso rispetto a questo modello. Per arrivare alla sua risposta sono necessari sei passaggi..

  1. 01

    Inizia dalla colonna della memoria

    La tabella elenca ogni scheda che può supportare Qwen3-8B - circa 5,3 GB a Q3_K_M. Questa cifra, non le prestazioni di punta della scheda, decide se può essere eseguita.

  2. 02

    Adatta il contesto al tuo utilizzo attuale

    Le conversazioni più lunghe consumano memoria oltre a ciò di cui hanno bisogno i pesi. Sposta il cursore sulla tua reale lunghezza di lavoro prima di fidarti di qualsiasi riga per Qwen3-8B.

  3. 03

    Imposta un livello di qualità

    Ogni scheda esegue la copia meno compressa che può contenere — Q3_K_M sulla scheda più piccola che si adatta. Impostare un limite esclude le schede che gestiscono solo Qwen3-8B comprimendola ulteriormente di quanto vorresti.

  4. 04

    Confronta i TPS, non le specifiche

    La classifica per token al secondo per Qwen3-8B segue la larghezza di banda della memoria, non il numero di core, motivo per cui il B200 la supera a 413 tok/s.

  5. 05

    Guarda lo spazio, non solo il fitting.

    Una compatibilità stretta esegue Qwen3-8B ma non lascia nulla in riserva per una conversazione più lunga; comoda ha margine. Se prevedi di ampliare il contesto, acquista per comoda.

  6. 06

    Guarda cos'altro quella scheda esegue

    Ogni pagina della scheda ripete questo controllo per ogni modello che abbiamo. Risponde a cosa altro è buono l'hardware, oltre a Qwen3-8B.

Risposte

Qwen3-8B — Domande frequenti

01

Due GPU eseguiranno Qwen3-8B più velocemente?

Due schede acquistano memoria piuttosto che velocità. Questo è importante per Qwen3-8B solo se una scheda non può contenerla — 582 può, quindi una seconda aggiunge poco.

02

Perché la quantizzazione differisce tra le schede per Qwen3-8B?

Ogni scheda mostra in esecuzione la copia meno compressa che può contenere e Qwen3-8B appare a 4 diversi livelli di compressione tra le schede che lo supportano. Le schede più grandi ottengono la versione più accurata.

03

Quanto sono accurate queste stime di velocità Qwen3-8B?

Queste sono stime con barre di errore reali. Il risultato più veloce qui, 351–496 tok/s sul B200, potrebbe ragionevolmente trovarsi ovunque nella sua gamma pubblicata a seconda del runtime che utilizzi.

04

Quale GPU ho bisogno per eseguire Qwen3-8B?

La scheda più piccola nel nostro catalogo che supporta Qwen3-8B è la Quadro 6000, con 6 GB di memoria. Esegue il modello a Q3_K_M utilizzando circa 5,3 GB e produce circa 17,0 token al secondo. In totale, 582 schede possono eseguirlo.

05

Quanto è veloce Qwen3-8B su una GPU?

Dipende dalla scheda. La più veloce che calcoliamo è una B200 a circa 413 token al secondo; la più lenta che riesce ancora a farlo gestisce considerevolmente meno. La velocità di lettura è di circa dieci token al secondo, e 554 delle schede che possono eseguire Qwen3-8B chiariscono questo.

06

Quanta VRAM necessita Qwen3-8B?

Circa 5,3 GB con compressione Q3_K_M, che è ciò che utilizza la scheda più piccola che riesce a eseguirlo. Meno compressione richiede di più: le cifre nella colonna della memoria sopra sono ricalcolate per ogni scheda, poiché ognuna tiene la versione con la compressione minore possibile.

07

Posso eseguire Qwen3-8B su una GPU da 8 GB?

Sì. Un CMP 170HX 8 GB con 8 GB lo esegue a Q4_K_M, utilizzando circa 6,3 GB e generando circa 178 token al secondo — un adattamento stretto.

08

Posso eseguire Qwen3-8B su una GPU da 12 GB?

Sì. Una GeForce RTX 3080 Ti con 12 GB lo esegue a Q8_0, usando circa 10,1 GB e generando circa 47,1 token al secondo — un adattamento stretto.

09

Posso eseguire Qwen3-8B su una GPU da 16 GB?

Sì. Un Tesla V100 SXM2 16 GB con 16 GB lo esegue a Q8_0, utilizzando circa 10,1 GB e generando circa 58,4 token al secondo — un adattamento confortevole.

10

Posso eseguire Qwen3-8B su una GPU da 24 GB?

Sì. Una GeForce RTX 5090 D V2 con 24 GB la esegue a Q8_0, utilizzando circa 10.1 GB e generando circa 69.2 token al secondo — una soluzione comoda.

11

Qwen3-8B è open source?

I suoi pesi sono pubblicati, quindi Qwen3-8B può essere scaricato e eseguito sul tuo hardware. Nota che pesi aperti non è la stessa cosa di open source nel senso completo — non dice nulla sui dati di addestramento, sul codice di addestramento o sui termini commerciali allegati.

12

Quanti parametri ha Qwen3-8B?

Qwen3-8B ha 8,2 miliardi di parametri. Numero di parametri: 8,2 miliardi Numero di parametri (Non-Embedding): 6,95 miliardi Numero di layer: 36 Numero di teste di attenzione (GQA): 32 per Q e 8 per KV Lunghezza del contesto: 32.768 nativamente e 131.072 token con YaRN. Quella cifra è il totale ed è ciò che decide quanta memoria ha bisogno il modello — circa mezzo gigabyte per miliardo con la compressione che la maggior parte delle persone utilizza.

13

Chi ha creato Qwen3-8B?

Qwen3-8B è stato pubblicato da Alibaba, con sede in Cina, classificato come industria.

14

Quando è stato rilasciato Qwen3-8B?

Qwen3-8B è stato pubblicato nell'aprile 2025.

15

A cosa serve Qwen3-8B?

Qwen3-8B funziona in Lingua ed è registrato come gestore di modellazione/generazione linguistica, risposta a domande, ragionamento matematico, ragionamento quantitativo, generazione di codice, traduzione. Questi sono i settori intorno ai quali è stato progettato; descrivono l'intento piuttosto che un confine rigido.

16

Dove posso scaricare Qwen3-8B?

I suoi pesi sono pubblicati sotto l'organizzazione Qwen su Hugging Face. Non ospitiamo file di modelli — questo sito calcola quale hardware è necessario per eseguirli.

17

Quanta potenza di calcolo è stata utilizzata per addestrare Qwen3-8B?

Circa 1.8 × 10²⁴ FLOP. Questo misura quanto è costato produrre il modello e non dice nulla su quanto rapidamente risponde una volta addestrato — la velocità di inferenza deriva dalla larghezza di banda della memoria, non dal budget di addestramento.

18

Posso eseguire Qwen3-8B se non entra nella mia GPU?

Solo attraverso il caricamento, che di solito è un falso risparmio: la parte nella memoria di sistema trascina tutto verso il basso - la più vicina mancanza che calcoliamo è inferiore di 1,8 GB. I nostri dati per Qwen3-8B assumono che sia completamente residente.

Fonte

Pubblicazione originale

Ultimo aggiornamento del record 28 November 2025

L'altra direzione

Guardando la questione dall'altra parte?

Questa pagina inizia dal modello. Se possedete già una scheda e desiderate conoscere tutto ciò che può eseguire, inizia dall'hardware invece.