Qwen3-Coder-Next calcolatore TPS

Pesi aperti Alibaba 80B parametri February 2026

Ogni scheda qui sotto è valutata rispetto a questo modello alla lunghezza di contesto e alla qualità minima che scegli. La velocità è una stima per una singola richiesta, calcolata dalla larghezza di banda della memoria della scheda e dalla dimensione del modello una volta compresso..

Calcolato per questo modello

61 di 818 schede che possono eseguirlo

La scheda più piccola che si adatta

A100 PCIe 40 GB

40 GB · Q3_K_M · 124 tok/s

Scheda più veloce

B200

235 tok/s · 180 GB

Quali GPU possono eseguire Qwen3-Coder-Next?

Imposta gli input, leggi la risposta

Una conversazione più lunga richiede più memoria, il che può spingere questo modello fuori da schede più piccole..

Nasconde le schede che si adatterebbero solo al modello comprimendole al di sotto di questo punto..

61 le modelli non si adattano al VRAM della GPU

Calcolo
Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. Quantizzazione Modello/modelli non adatti per la VRAM della GPU. Esecuzione non riuscita, richiede meno di TPS. Modello funziona comodamente, ampio margine.
235 tok/s

141–376 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

B200 NVIDIA 180 GB 8,000 GB/s Jan 2024 80.7 GB Q8_0 Confortevole
235 tok/s

141–376 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

B300 NVIDIA 288 GB 8,000 GB/s Sep 2025 80.7 GB Q8_0 Confortevole
188 tok/s

113–301 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

Radeon Instinct MI350X AMD 288 GB 8,190 GB/s Jan 2025 80.7 GB Q8_0 Confortevole
188 tok/s

113–301 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

Radeon Instinct MI355X AMD 288 GB 8,190 GB/s Jan 2025 80.7 GB Q8_0 Confortevole
150 tok/s

90–240 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

Radeon Instinct MI300 AMD 128 GB 6,550 GB/s Jan 2023 80.7 GB Q8_0 Confortevole
144 tok/s

86–230 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H200 NVL NVIDIA 141 GB 4,890 GB/s Nov 2024 80.7 GB Q8_0 Confortevole
144 tok/s

86–230 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H200 SXM 141 GB NVIDIA 141 GB 4,890 GB/s Nov 2024 80.7 GB Q8_0 Confortevole
144 tok/s

86–230 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H100 SXM5 80 GB NVIDIA 80 GB 3,360 GB/s Oct 2022 62.0 GB Q6_K Stretto
144 tok/s

86–230 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H800 SXM5 NVIDIA 80 GB 3,360 GB/s Mar 2023 62.0 GB Q6_K Stretto
138 tok/s

83–220 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

Radeon Instinct MI325X AMD 256 GB 6,000 GB/s Oct 2024 80.7 GB Q8_0 Confortevole
135 tok/s

81–216 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

GRID A100B NVIDIA 48 GB 1,870 GB/s May 2020 38.8 GB IQ4_XS Stretto
124 tok/s

74–198 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

A100 PCIe 40 GB NVIDIA 40 GB 1,560 GB/s Jun 2020 34.1 GB Q3_K_M Stretto
124 tok/s

74–198 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

A100 SXM4 40 GB NVIDIA 40 GB 1,560 GB/s May 2020 34.1 GB Q3_K_M Stretto
124 tok/s

74–198 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

A800 PCIe 40 GB NVIDIA 40 GB 1,560 GB/s Nov 2022 34.1 GB Q3_K_M Stretto
122 tok/s

73–195 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

Radeon Instinct MI300A AMD 128 GB 5,325 GB/s Dec 2023 80.7 GB Q8_0 Confortevole
122 tok/s

73–195 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

Radeon Instinct MI300X AMD 192 GB 5,325 GB/s Dec 2023 80.7 GB Q8_0 Confortevole
122 tok/s

73–195 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

Radeon Instinct MI308X AMD 192 GB 5,325 GB/s Dec 2023 80.7 GB Q8_0 Confortevole
116 tok/s

70–185 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H100 NVL 94 GB NVIDIA 94 GB 3,940 GB/s Mar 2023 80.7 GB Q8_0 Stretto
106 tok/s

64–170 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H100 SXM5 64 GB NVIDIA 64 GB 2,020 GB/s Mar 2023 52.7 GB Q5_K_M Stretto
98.8 tok/s

59–158 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H100 PCIe 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 80.7 GB Q8_0 Stretto
98.8 tok/s

59–158 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H100 SXM5 94 GB NVIDIA 94 GB 3,360 GB/s Mar 2023 80.7 GB Q8_0 Stretto
98.8 tok/s

59–158 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H100 SXM5 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 80.7 GB Q8_0 Stretto
96.8 tok/s

58–155 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

RTX PRO 5000 Blackwell NVIDIA 48 GB 1,340 GB/s Mar 2025 38.8 GB IQ4_XS Stretto
87.2 tok/s

52–139 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

A100 SXM4 80 GB NVIDIA 80 GB 2,040 GB/s Nov 2020 62.0 GB Q6_K Stretto
87.2 tok/s

52–139 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

A100X NVIDIA 80 GB 2,040 GB/s Jun 2021 62.0 GB Q6_K Stretto

Le velocità sono stime per una singola richiesta — una conversazione alla volta — calcolate dalla larghezza di banda della memoria, dalle dimensioni del modello e dalla quantizzazione. Il throughput reale varia con il tempo di esecuzione dell'inferenza e la sua versione. I valori pubblicati dai fornitori di hardware misurano molte richieste simultanee e sono molto più alti..

In registrazione

Specifiche complete

Tutto registrato per questo modello. La maggior parte descrive come è stato addestrato piuttosto che come funziona — contesto utile per valutare quanto lavoro ci sia stato dietro e come si confronta con modelli costruiti su scala differente..

Origine

Chi ha costruito questo modello, dove e quando è stato pubblicato.

Organizzazione
Alibaba
Tipo di organizzazione
Industry
Paese
China
Pubblicato
2 February 2026

Cosa fa

Le aree problematiche per cui il modello è stato creato. Un modello può gestire diversi di ciascuno.

Domini
Language
Spazio
Language modeling/generation, Coding
Modello base
Qwen3-Next-80B-A3B

Dimensione

Quanto è grande il modello e su quanti dati è stato addestrato. I parametri sono la cifra che decide se si adatta a una data scheda grafica.

parametri
80B

Finetune of Qwen3-Next-80B-A3B, which has 80 billion parameters

Dati di addestramento
tokens

Disponibilità

Se puoi ottenere il modello e farlo girare sul tuo hardware, il che decide se alcune delle figure della scheda grafica su questa pagina si applicano.

Pesi
Open — downloadable
Accesso al modello
Open weights (unrestricted)
Hugging Face
Qwen

Come è classificato

Etichette sui dataset di origine applicate per il tracciamento dei modelli notevoli e quanto è fiduciosa nell'entry.

Perché è tracciato
Discretionary
Modello/modelli non si adatta / non si adatterà GPU VRAM. Tight = barely runnable, comodo = runs easily with headroom.
Likely

Modello/modelli GPU/AI che può eseguire. Non si adatta / non starà. Stretto = appena eseguibile, comodo = esegue facilmente con margine.

Dove è stato registrato questo record e quando è stato controllato l'ultima volta.

Modello/modelli GPU può eseguire? Non si adatta / non si adatterà. Limitato = difficilmente eseguibile, comodo = esegue facilmente con margine.
Qwen3-Coder-Next: Pushing Small Hybrid Models on Agentic Coding
Ultimo aggiornamento
8 April 2026

Le estremità

Le GPU più piccole che ancora possono eseguire Qwen3-Coder-Next

Il percorso più economico, per capacità di memoria. Un adattamento stretto esegue il modello ma non lascia nulla in riserva per una conversazione più lunga..

  1. 01 A800 PCIe 40 GB 40 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 34.1 GB · Q3_K_M · Stretto 124 tok/s
  2. 02 A100 PCIe 40 GB 40 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 34.1 GB · Q3_K_M · Stretto 124 tok/s
  3. 03 A100 SXM4 40 GB 40 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 34.1 GB · Q3_K_M · Stretto 124 tok/s
  4. 04 Radeon PRO W7900D 48 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 38.8 GB · IQ4_XS · Stretto 48.7 tok/s
  5. 05 RTX PRO 5000 Blackwell 48 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 38.8 GB · IQ4_XS · Stretto 96.8 tok/s
  6. 06 RTX 5880 Ada Generation 48 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 38.8 GB · IQ4_XS · Stretto 62.4 tok/s
  7. 07 L20 48 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 38.8 GB · IQ4_XS · Stretto 62.4 tok/s
  8. 08 Radeon PRO W7800 48 GB 48 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 38.8 GB · IQ4_XS · Stretto 48.7 tok/s
  9. 09 Radeon PRO W7900 48 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 38.8 GB · IQ4_XS · Stretto 48.7 tok/s
  10. 10 Data Center GPU Max 1100 48 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 38.8 GB · IQ4_XS · Stretto 57.7 tok/s

Cosa significano i numeri

Cosa serve per eseguirlo

SCHEDA MINIMA

A100 PCIe 40 GB

Memoria necessaria

34.1 GB

Più veloce

235 tok/s

Qwen3-Coder-Next ha 80 miliardi di parametri, il che lo colloca al di sopra dell'hardware consumer e nella gamma in cui una scheda è acquistata per questo scopo piuttosto che riutilizzata per esso. 61 delle schede che monitoriamo possono contenerlo.

L'hardware minimo che funziona è un A100 PCIe 40 GB. I suoi 40 GB sono sufficienti con compressione Q3_K_M, fornendo circa 124 token al secondo.

Un B200 è il più veloce che calcoliamo per esso: circa 235 token al secondo, da 8.000 GB/s di larghezza di banda della memoria.

Riguardo a questo modello

Qwen3-Coder-Next è stato pubblicato da Alibaba, in Cina, a febbraio 2026. industria è la categoria a cui appartiene l'editore.

Funziona in Italiano ed è registrato come generazione/modellazione di linguaggio, coding.

È derivato da Qwen3-Next-80B-A3B piuttosto che addestrato da zero, che è il modo usuale di produrre un modello specializzato.

I pesi pubblicati significano che il modello è in esecuzione sulla tua macchina anziché su quella di qualcun altro, il che rende possibile rispondere alla domanda sull'hardware qui sotto. È pubblicato sotto l'organizzazione Qwen su Hugging Face.

Quanto velocemente gira e perché

Metà delle schede che lo supportano gestiscono più di 82,9 token al secondo e 59 superano nettamente la velocità di lettura.

Poiché instrada ogni token attraverso un sottoinsieme dei suoi pesi, produce testo al ritmo di un modello molto più piccolo. Il problema è la memoria: tutto deve ancora adattarsi, quindi la velocità è un bonus piuttosto che uno sconto sull'hardware.

La memoria qui è stimata dalla dimensione piuttosto che calcolata dall'architettura, che non è registrata per questo modello - i numeri sono indicativi piuttosto che esatti.

Addestramento e provenienza

Il suo criterio di inclusione è discrezionale.

Passo dopo passo

Come scegliere una GPU per Qwen3-Coder-Next

La tabella sopra ha già valutato ogni scheda di cui possediamo specifiche rispetto a questo modello. Arrivare alla tua risposta richiede sei passaggi..

  1. 01

    Controlla cosa serve prima di qualsiasi altra cosa

    La tabella elenca ogni scheda che può contenere Qwen3-Coder-Next — circa 34.1 GB a Q3_K_M. Quella cifra, non la performance di punta della scheda, è ciò che decide se può essere eseguita.

  2. 02

    Modello/modelli GPU compatibili: GPU può eseguire modelli: Non va bene / non si adatta Esecuzione leggera: Esecuzione confortevole: Esecuzione intensa: Esecuzione difficile: In seguito: Utilizzo VRAM: Prestazioni TPS: OK Calcoli CUDA: Inferenza Tensor: Quantizzazione: LoRA: GGUF: FP16: INT4: INT8:

    Il modello non si adatta alla VRAM della GPU. Il modello si avvia facilmente con margine. Il modello è difficile da eseguire. Quale modello AI può eseguire la GPU?

  3. 03

    Scegli quanto comprimerlo.

    La compressione è ciò che rende Qwen3-Coder-Next adatto a schede più piccole, a costo di una certa perdita di precisione — Q3_K_M sulla scheda più piccola che si adatta. Una qualità minima rimuove quelle che vanno troppo oltre.

  4. 04

    Confronta TPS, non specifiche

    Il ranking per token al secondo per Qwen3-Coder-Next segue la larghezza di banda della memoria, non il numero di core, motivo per cui il B200 lo supera con 235 tok/s.

  5. 05

    Controlla il verdetto di compatibilità prima di acquistare

    Tight significa che Qwen3-Coder-Next si carica e funziona, senza spazio per aumentare il contesto in seguito. Comfortable significa che puoi. La differenza conta più di qualche token al secondo.

  6. 06

    Apri la scheda su cui hai deciso

    Ogni nome di scheda si collega alla propria pagina, che esegue lo stesso calcolo su tutto il catalogo dei modelli. Vale la pena dare un'occhiata prima di acquistare solo per Qwen3-Coder-Next — una scheda di solito viene acquistata per più di un modello.

Modeli/modelli sempre significa modelli AI. Esegui/Esplora significa eseguire un modello AI. Non si adatta / non si adatterà significa che il modello AI non si adatta alla VRAM della GPU. Stretto = appena eseguibile, comodo = funziona facilmente con margine. Termini tecnici come GPU, AI, TPS, VRAM, CUDA, Tensor, Inference, Quantization, LoRA, GGUF, FP16, INT4, INT8 rimangono in inglese. GPU, AI, TPS, VRAM, CUDA devono sempre essere in maiuscolo. Se viene chiesto di tradurre il nome di una lingua (ad es. spagnolo, inglese, lingua), tradurre la parola correttamente. SOLO output la traduzione pura in italiano. Nessun commento, nessuna domanda, nient'altro. Se vuoto rispondi con un singolo spazio: Risposte.

Qwen3-Coder-Next — modello/modelli può GPU eseguire. non si adatta / non si adatterà. stretto = appena eseguibile, confortevole = esegue facilmente con margine.

01

Due GPU eseguirebbero Qwen3-Coder-Next più velocemente?

Due schede acquistano memoria piuttosto che velocità. Questo conta solo per Qwen3-Coder-Next se una scheda non può contenerlo — 61 può, quindi una seconda aggiunge poco.

02

Perché la quantizzazione differisce tra le schede per Qwen3-Coder-Next?

Una scheda più grande contiene una copia più accurata. Su quelle schede che eseguono Qwen3-Coder-Next, vengono utilizzati 5 livelli di compressione; il controllo del pavimento lo fissa a uno.

03

Quanto sono precisi queste stime di velocità di Qwen3-Coder-Next?

Queste sono stime con barre di errore reali. Il risultato più veloce qui, 141–376 tok/s sulla B200, potrebbe ragionevolmente trovarsi ovunque nel suo intervallo pubblicato a seconda di quale runtime utilizzi.

04

Quale GPU ho bisogno per eseguire Qwen3-Coder-Next?

La scheda più piccola nel nostro catalogo che supporta Qwen3-Coder-Next è la A100 PCIe 40 GB, con 40 GB di memoria. Esegue il modello a Q3_K_M utilizzando circa 34,1 GB e produce circa 124 token al secondo. In totale, 61 schede possono eseguirlo.

05

Quanto è veloce Qwen3-Coder-Next su una GPU?

Dipende dalla scheda. Il più veloce che calcoliamo è un B200 a circa 235 token al secondo; il più lento che ancora corre gestisce notevolmente meno. La velocità di lettura è di circa dieci token al secondo, e 59 delle schede che possono eseguire Qwen3-Coder-Next superano quel limite.

06

Quanta VRAM richiede Qwen3-Coder-Next?

Circa 34,1 GB con compressione Q3_K_M, che è ciò che utilizza la scheda più piccola che la esegue. Meno compressione richiede di più: i numeri nella colonna della memoria sopra sono ricalcolati per ciascuna scheda, poiché ognuna contiene la versione meno compressa possibile.

07

È Qwen3-Coder-Next open source?

I suoi pesi sono pubblicati, quindi Qwen3-Coder-Next può essere scaricato e eseguito sul tuo hardware. Nota che pesi aperti non è la stessa cosa di open source nel senso completo: non dice nulla sui dati di addestramento, sul codice di addestramento, o sui termini commerciali associati.

08

Quanti parametri ha Qwen3-Coder-Next?

Qwen3-Coder-Next ha 80 miliardi di parametri. Finetuning di Qwen3-Next-80B-A3B, che ha 80 miliardi di parametri. Questa cifra è il totale e decide quanta memoria necessita il modello: circa mezzo gigabyte per miliardo alla compressione che la maggior parte delle persone utilizza.

09

Chi ha creato Qwen3-Coder-Next?

Qwen3-Coder-Next è stato pubblicato da Alibaba, con sede in Cina, classificato come industria.

10

Quando è stato rilasciato Qwen3-Coder-Next?

Qwen3-Coder-Next è stato pubblicato a febbraio 2026.

11

A cosa serve Qwen3-Coder-Next?

Qwen3-Coder-Next funziona in Lingua ed è registrato per gestire modellazione/generazione di lingua, codifica. Un modello può gestire diversi di ciascuno, quindi queste sono le aree per cui è stato costruito piuttosto che un limite su ciò che tenterà.

12

Dove posso scaricare Qwen3-Coder-Next?

I suoi pesi sono pubblicati sotto l'organizzazione Qwen su Hugging Face. Non ospitiamo file di modelli — questo sito calcola quale hardware è necessario per eseguirli.

13

Posso eseguire Qwen3-Coder-Next se non si adatta alla mia GPU?

Può essere diviso tra la memoria della scheda e quella di sistema, ma Qwen3-Coder-Next genera incredibilmente lentamente in questo modo — il più vicino mancato che calcoliamo è inferiore di 14,6 GB. Nulla in questa pagina presuppone il trasferimento.

Fonte

Pubblicazione originale

Record last updated 8 April 2026

L'altra direzione

Guardandolo dall'altro lato?

Questa pagina inizia dal modello. Se possiedi già una scheda e vuoi sapere tutto ciò che eseguirà, inizia dall'hardware invece.