Qwen3.5-122B-A10B calcolatore TPS

Pesi aperti Alibaba 122B parametri February 2026

Ogni scheda qui sotto è valutata rispetto a questo modello alla lunghezza di contesto e alla qualità minima che scegli. La velocità è una stima per una singola richiesta, calcolata dalla larghezza di banda della memoria della scheda e dalla dimensione del modello una volta compresso..

Calcolato per questo modello

43 di 818 schede che possono eseguirlo

La scheda più piccola che si adatta

Radeon Instinct MI200

64 GB · Q3_K_M · 66.6 tok/s

Scheda più veloce

B200

154 tok/s · 180 GB

Quali GPU possono eseguire Qwen3.5-122B-A10B?

Imposta gli input, leggi la risposta

Una conversazione più lunga richiede più memoria, il che può spingere questo modello fuori da schede più piccole..

Nasconde le schede che si adatterebbero solo al modello comprimendole al di sotto di questo punto..

43 le modelli non si adattano al VRAM della GPU

Calcolo
Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. Quantizzazione Modello/modelli non adatti per la VRAM della GPU. Esecuzione non riuscita, richiede meno di TPS. Modello funziona comodamente, ampio margine.
154 tok/s

93–247 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

B200 NVIDIA 180 GB 8,000 GB/s Jan 2024 124.1 GB Q8_0 Confortevole
154 tok/s

93–247 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

B300 NVIDIA 288 GB 8,000 GB/s Sep 2025 124.1 GB Q8_0 Confortevole
150 tok/s

90–239 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H100 SXM5 80 GB NVIDIA 80 GB 3,360 GB/s Oct 2022 67.3 GB Q4_K_M Stretto
150 tok/s

90–239 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H800 SXM5 NVIDIA 80 GB 3,360 GB/s Mar 2023 67.3 GB Q4_K_M Stretto
143 tok/s

86–229 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

Radeon Instinct MI300 AMD 128 GB 6,550 GB/s Jan 2023 95.7 GB Q6_K Confortevole
136 tok/s

81–217 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H100 NVL 94 GB NVIDIA 94 GB 3,940 GB/s Mar 2023 81.5 GB Q5_K_M Stretto
123 tok/s

74–197 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

Radeon Instinct MI350X AMD 288 GB 8,190 GB/s Jan 2025 124.1 GB Q8_0 Confortevole
123 tok/s

74–197 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

Radeon Instinct MI355X AMD 288 GB 8,190 GB/s Jan 2025 124.1 GB Q8_0 Confortevole
116 tok/s

70–186 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

Radeon Instinct MI300A AMD 128 GB 5,325 GB/s Dec 2023 95.7 GB Q6_K Confortevole
116 tok/s

69–185 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H100 PCIe 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 81.5 GB Q5_K_M Stretto
116 tok/s

69–185 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H100 SXM5 94 GB NVIDIA 94 GB 3,360 GB/s Mar 2023 81.5 GB Q5_K_M Stretto
116 tok/s

69–185 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H100 SXM5 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 81.5 GB Q5_K_M Stretto
105 tok/s

63–168 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H100 SXM5 64 GB NVIDIA 64 GB 2,020 GB/s Mar 2023 53.1 GB Q3_K_M Stretto
94.3 tok/s

57–151 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H200 NVL NVIDIA 141 GB 4,890 GB/s Nov 2024 124.1 GB Q8_0 Stretto
94.3 tok/s

57–151 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H200 SXM 141 GB NVIDIA 141 GB 4,890 GB/s Nov 2024 124.1 GB Q8_0 Stretto
90.8 tok/s

55–145 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

A100 SXM4 80 GB NVIDIA 80 GB 2,040 GB/s Nov 2020 67.3 GB Q4_K_M Stretto
90.8 tok/s

55–145 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

A100X NVIDIA 80 GB 2,040 GB/s Jun 2021 67.3 GB Q4_K_M Stretto
90.8 tok/s

55–145 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

A800 SXM4 80 GB NVIDIA 80 GB 2,040 GB/s Aug 2022 67.3 GB Q4_K_M Stretto
90.8 tok/s

55–145 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H100 CNX NVIDIA 80 GB 2,040 GB/s Mar 2023 67.3 GB Q4_K_M Stretto
90.8 tok/s

55–145 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H100 PCIe 80 GB NVIDIA 80 GB 2,040 GB/s Oct 2022 67.3 GB Q4_K_M Stretto
90.8 tok/s

55–145 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

H800 PCIe 80 GB NVIDIA 80 GB 2,040 GB/s Mar 2023 67.3 GB Q4_K_M Stretto
90.3 tok/s

54–144 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

Radeon Instinct MI325X AMD 256 GB 6,000 GB/s Oct 2024 124.1 GB Q8_0 Confortevole
86.4 tok/s

52–138 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

A100 PCIe 80 GB NVIDIA 80 GB 1,940 GB/s Jun 2021 67.3 GB Q4_K_M Stretto
86.4 tok/s

52–138 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

A800 PCIe 80 GB NVIDIA 80 GB 1,940 GB/s Nov 2022 67.3 GB Q4_K_M Stretto
80.1 tok/s

48–128 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire.

Radeon Instinct MI300X AMD 192 GB 5,325 GB/s Dec 2023 124.1 GB Q8_0 Confortevole

Le velocità sono stime per una singola richiesta — una conversazione alla volta — calcolate dalla larghezza di banda della memoria, dalle dimensioni del modello e dalla quantizzazione. Il throughput reale varia con il tempo di esecuzione dell'inferenza e la sua versione. I valori pubblicati dai fornitori di hardware misurano molte richieste simultanee e sono molto più alti..

In registrazione

Specifiche complete

Tutto registrato per questo modello. La maggior parte descrive come è stato addestrato piuttosto che come funziona — contesto utile per valutare quanto lavoro ci sia stato dietro e come si confronta con modelli costruiti su scala differente..

Origine

Chi ha costruito questo modello, dove e quando è stato pubblicato.

Organizzazione
Alibaba
Tipo di organizzazione
Industry
Paese
China
Pubblicato
24 February 2026

Cosa fa

Le aree problematiche per cui il modello è stato creato. Un modello può gestire diversi di ciascuno.

Domini
Language
Spazio
Language modeling/generation

Dimensione

Quanto è grande il modello e su quanti dati è stato addestrato. I parametri sono la cifra che decide se si adatta a una data scheda grafica.

parametri
122B
Dati di addestramento
tokens

Disponibilità

Se puoi ottenere il modello e farlo girare sul tuo hardware, il che decide se alcune delle figure della scheda grafica su questa pagina si applicano.

Pesi
Open — downloadable
Accesso al modello
Open weights (restricted use)
Hugging Face
Qwen

Come è classificato

Etichette sui dataset di origine applicate per il tracciamento dei modelli notevoli e quanto è fiduciosa nell'entry.

Perché è tracciato
Discretionary
Modello/modelli non si adatta / non si adatterà GPU VRAM. Tight = barely runnable, comodo = runs easily with headroom.
Likely

Modello/modelli GPU/AI che può eseguire. Non si adatta / non starà. Stretto = appena eseguibile, comodo = esegue facilmente con margine.

Dove è stato registrato questo record e quando è stato controllato l'ultima volta.

Modello/modelli GPU può eseguire? Non si adatta / non si adatterà. Limitato = difficilmente eseguibile, comodo = esegue facilmente con margine.
Qwen3.5: Towards Native Multimodal Agents
Ultimo aggiornamento
8 April 2026

Le estremità

Le GPU più piccole che ancora possono eseguire Qwen3.5-122B-A10B

Il percorso più economico, per capacità di memoria. Un adattamento stretto esegue il modello ma non lascia nulla in riserva per una conversazione più lunga..

  1. 01 Jetson T4000 64 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 53.1 GB · Q3_K_M · Stretto 14.2 tok/s
  2. 02 H100 SXM5 64 GB 64 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 53.1 GB · Q3_K_M · Stretto 105 tok/s
  3. 03 Jetson AGX Orin 64 GB 64 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 53.1 GB · Q3_K_M · Stretto 10.7 tok/s
  4. 04 Radeon Instinct MI200 64 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 53.1 GB · Q3_K_M · Stretto 66.6 tok/s
  5. 05 Radeon Instinct MI210 64 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 53.1 GB · Q3_K_M · Stretto 66.6 tok/s
  6. 06 RTX PRO 5000 72 GB Blackwell 72 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 60.2 GB · IQ4_XS · Stretto 63.5 tok/s
  7. 07 H100 CNX 80 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 67.3 GB · Q4_K_M · Stretto 90.8 tok/s
  8. 08 H800 PCIe 80 GB 80 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 67.3 GB · Q4_K_M · Stretto 90.8 tok/s
  9. 09 H800 SXM5 80 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 67.3 GB · Q4_K_M · Stretto 150 tok/s
  10. 10 A800 PCIe 80 GB 80 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 67.3 GB · Q4_K_M · Stretto 86.4 tok/s

Cosa significano i numeri

Cosa serve per eseguire questo modello

SCHEDA MINIMA

Radeon Instinct MI200

Memoria necessaria

53.1 GB

Più veloce

154 tok/s

Qwen3.5-122B-A10B ha 122 miliardi di parametri, il che lo colloca sopra l'hardware consumer e nella fascia in cui una scheda è acquistata per questo scopo piuttosto che riutilizzata per esso. 43 delle schede che monitoriamo possono contenerlo.

La scheda più piccola che lo contiene è la Radeon Instinct MI200 con 64 GB, che la esegue a Q3_K_M e produce circa 66,6 token al secondo.

Un B200 è il più veloce che calcoliamo per esso: circa 154 token al secondo, da 8.000 GB/s di larghezza di banda della memoria.

Cosa è questo modello

Qwen3.5-122B-A10B è stato pubblicato da Alibaba, in Cina, a febbraio 2026. Proviene dall'industria.

Funziona in lingua ed è registrato come modello/generazione di lingua.

I pesi sono pubblicati, quindi possono essere scaricati e eseguiti sulla propria hardware indefinitamente, offline, senza account associato. È pubblicato sotto l'organizzazione Qwen su Hugging Face.

Cosa decide la velocità

Metà delle schede che lo supportano gestiscono più di 90,3 token al secondo e 41 superano la velocità di lettura.

Questo è un modello misto di esperti, che instrada ogni token solo attraverso una parte di se stesso. Genera quindi molto più velocemente di quanto suggerisca la sua dimensione totale - pur avendo comunque ogni parametro residente in memoria, quindi è veloce senza essere economico da mantenere.

La memoria qui è stimata dalla dimensione piuttosto che calcolata dall'architettura, che non è registrata per questo modello - i numeri sono indicativi piuttosto che esatti.

Cosa è stato necessario per costruirlo

Il suo criterio di inclusione è discrezionale.

Passo dopo passo

Come scegliere una GPU per Qwen3.5-122B-A10B

La tabella sopra ha già valutato ogni scheda di cui possediamo specifiche rispetto a questo modello. Arrivare alla tua risposta richiede sei passaggi..

  1. 01

    Memoria

    La tabella elenca ogni scheda che può contenere Qwen3.5-122B-A10B — circa 53,1 GB a Q3_K_M. Quella cifra, non le prestazioni di punta della scheda, è ciò che determina se può essere eseguita.

  2. 02

    Esegui / eseguendo il modello AI non si adatta / non si adatterà alla VRAM GPU. Modello stretto = appena eseguibile, modello comodo = esegue facilmente con margine.

    Modello / modelli non si adatta / non si adatterà alla VRAM della GPU. La GPU può eseguire un modello AI. Modello stretto = barely runnable, modello confortevole = esegue facilmente con margine.

  3. 03

    Imposta un limite di qualità

    Ogni scheda esegue la copia meno compressa che può contenere — Q3_K_M sulla scheda più piccola che si adatta. Impostare un limite fa cadere le schede che gestiscono solo Qwen3.5-122B-A10B comprimendola ulteriormente di quanto desiderato.

  4. 04

    Confronta TPS, non specifiche

    Ordina per velocità per vedere come si classificano le schede per Qwen3.5-122B-A10B. Non corrisponderà a un ordinamento di gioco — la generazione è limitata dalla larghezza di banda della memoria, motivo per cui il B200 la supera a 154 tok/s.

  5. 05

    Controlla il verdetto di compatibilità prima di acquistare

    Tight significa che Qwen3.5-122B-A10B si carica e funziona, senza margine per aumentare il contesto successivamente. Comfortable significa che puoi. La differenza conta più di pochi token al secondo.

  6. 06

    Vedi quali altri modelli può eseguire quella scheda

    Seguire una scheda fino alla sua pagina mostra ogni altro modello che può contenere, che è la domanda che segue una volta che Qwen3.5-122B-A10B è definito.

Modeli/modelli sempre significa modelli AI. Esegui/Esplora significa eseguire un modello AI. Non si adatta / non si adatterà significa che il modello AI non si adatta alla VRAM della GPU. Stretto = appena eseguibile, comodo = funziona facilmente con margine. Termini tecnici come GPU, AI, TPS, VRAM, CUDA, Tensor, Inference, Quantization, LoRA, GGUF, FP16, INT4, INT8 rimangono in inglese. GPU, AI, TPS, VRAM, CUDA devono sempre essere in maiuscolo. Se viene chiesto di tradurre il nome di una lingua (ad es. spagnolo, inglese, lingua), tradurre la parola correttamente. SOLO output la traduzione pura in italiano. Nessun commento, nessuna domanda, nient'altro. Se vuoto rispondi con un singolo spazio: Risposte.

Qwen3.5-122B-A10B — modello/modelli può GPU eseguire. non si adatta / non si adatterà. stretto = appena eseguibile, confortevole = esegue facilmente con margine.

01

È Qwen3.5-122B-A10B open source?

I suoi pesi sono pubblicati, quindi Qwen3.5-122B-A10B può essere scaricato e eseguito sul proprio hardware. Nota che pesi aperti non sono la stessa cosa di open source nel senso completo - non dice nulla sui dati di addestramento, sul codice di addestramento o sui termini commerciali associati.

02

Quanti parametri ha Qwen3.5-122B-A10B?

Qwen3.5-122B-A10B ha 122B parametri. Questa cifra è il totale, ed è ciò che determina quanta memoria necessita il modello — circa mezzo gigabyte per miliardo alla compressione più comune.

03

Chi ha creato Qwen3.5-122B-A10B?

Qwen3.5-122B-A10B è stato pubblicato da Alibaba, con sede in Cina, classificato come industria.

04

Quando è stato rilasciato Qwen3.5-122B-A10B?

Qwen3.5-122B-A10B è stato pubblicato a febbraio 2026.

05

A cosa serve Qwen3.5-122B-A10B?

Qwen3.5-122B-A10B funziona in Lingua, ed è registrato come gestore di modellazione/generazione del linguaggio. I modelli spesso trasportano più di uno di ciascuno, e i tag descrivono l'obiettivo piuttosto che i limiti di capacità.

06

Dove posso scaricare Qwen3.5-122B-A10B?

I suoi pesi sono pubblicati sotto l'organizzazione Qwen su Hugging Face. Non ospitiamo file di modelli — questo sito calcola quale hardware è necessario per eseguirli.

07

Posso eseguire Qwen3.5-122B-A10B se non si adatta alla mia GPU?

I livelli che non si adattano si trovano nella memoria di sistema e funzionano a una frazione della velocità, quindi un Qwen3.5-122B-A10B per lo più scaricato è raramente conveniente da usare - il miss più vicino che calcoliamo è carente di 24,1 GB. Ogni cifra qui presuppone che l'intero modello sia sulla scheda.

08

Due GPU eseguirebbero Qwen3.5-122B-A10B più velocemente?

La capacità si somma tra le schede; la velocità di elaborazione no. Poiché 43 delle schede che monitoriamo già ospitano Qwen3.5-122B-A10B da sole, una seconda scheda raramente è la soluzione qui.

09

Perché la quantizzazione differisce tra le schede per Qwen3.5-122B-A10B?

Una scheda più grande contiene una copia più accurata. Tra le schede che eseguono Qwen3.5-122B-A10B, vengono utilizzati 6 livelli di compressione; il controllo del pavimento lo fissa a uno.

10

Quanto sono accurate queste stime di velocità di Qwen3.5-122B-A10B?

Queste sono stime con barre di errore reali. Il risultato più veloce qui, 93–247 tok/s sulla B200, potrebbe ragionevolmente trovarsi ovunque nel suo intervallo pubblicato a seconda di quale runtime usi.

11

Quale GPU mi serve per eseguire Qwen3.5-122B-A10B?

La scheda più piccola nel nostro catalogo che supporta Qwen3.5-122B-A10B è la Radeon Instinct MI200, con 64 GB di memoria. Esegue il modello a Q3_K_M utilizzando circa 53.1 GB e produce circa 66.6 token al secondo. In totale, 43 schede possono eseguirlo.

12

Quanto è veloce Qwen3.5-122B-A10B su un GPU?

Dipende dalla scheda. Il più veloce che calcoliamo è un B200 a circa 154 token al secondo; il più lento che riesce a farlo gestisce notevolmente meno. La velocità di lettura è di circa dieci token al secondo, e 41 delle schede che possono eseguire Qwen3.5-122B-A10B superano questo.

13

Quanta VRAM serve a Qwen3.5-122B-A10B?

Circa 53,1 GB con compressione Q3_K_M, che è ciò che utilizza la scheda più piccola che la esegue. Meno compressione richiede di più: i valori nella colonna della memoria sopra sono ricalcolati per ogni scheda, poiché ognuna contiene la versione meno compressa che può.

Fonte

Pubblicazione originale

Record last updated 8 April 2026

L'altra direzione

Guardandolo dall'altro lato?

Questa pagina inizia dal modello. Se possiedi già una scheda e vuoi sapere tutto ciò che eseguirà, inizia dall'hardware invece.