Qwen3.5-122B-A10B calcolatore TPS
Ogni scheda qui sotto è valutata rispetto a questo modello alla lunghezza di contesto e alla qualità minima che scegli. La velocità è una stima per una singola richiesta, calcolata dalla larghezza di banda della memoria della scheda e dalla dimensione del modello una volta compresso..
Calcolato per questo modello
La scheda più piccola che si adatta
Radeon Instinct MI200
64 GB · Q3_K_M · 66.6 tok/s
Scheda più veloce
B200
154 tok/s · 180 GB
Quali GPU possono eseguire Qwen3.5-122B-A10B?
Imposta gli input, leggi la risposta
Una conversazione più lunga richiede più memoria, il che può spingere questo modello fuori da schede più piccole..
Nasconde le schede che si adatterebbero solo al modello comprimendole al di sotto di questo punto..
43 le modelli non si adattano al VRAM della GPU
Calcolo| Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. | Quantizzazione | Modello/modelli non adatti per la VRAM della GPU. Esecuzione non riuscita, richiede meno di TPS. Modello funziona comodamente, ampio margine. | |||||
|---|---|---|---|---|---|---|---|
|
154
tok/s
93–247 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
B200 NVIDIA | 180 GB | 8,000 GB/s | Jan 2024 | 124.1 GB | Q8_0 | Confortevole |
|
154
tok/s
93–247 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
B300 NVIDIA | 288 GB | 8,000 GB/s | Sep 2025 | 124.1 GB | Q8_0 | Confortevole |
|
150
tok/s
90–239 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
H100 SXM5 80 GB NVIDIA | 80 GB | 3,360 GB/s | Oct 2022 | 67.3 GB | Q4_K_M | Stretto |
|
150
tok/s
90–239 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
H800 SXM5 NVIDIA | 80 GB | 3,360 GB/s | Mar 2023 | 67.3 GB | Q4_K_M | Stretto |
|
143
tok/s
86–229 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
Radeon Instinct MI300 AMD | 128 GB | 6,550 GB/s | Jan 2023 | 95.7 GB | Q6_K | Confortevole |
|
136
tok/s
81–217 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
H100 NVL 94 GB NVIDIA | 94 GB | 3,940 GB/s | Mar 2023 | 81.5 GB | Q5_K_M | Stretto |
|
123
tok/s
74–197 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
Radeon Instinct MI350X AMD | 288 GB | 8,190 GB/s | Jan 2025 | 124.1 GB | Q8_0 | Confortevole |
|
123
tok/s
74–197 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
Radeon Instinct MI355X AMD | 288 GB | 8,190 GB/s | Jan 2025 | 124.1 GB | Q8_0 | Confortevole |
|
116
tok/s
70–186 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
Radeon Instinct MI300A AMD | 128 GB | 5,325 GB/s | Dec 2023 | 95.7 GB | Q6_K | Confortevole |
|
116
tok/s
69–185 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
H100 PCIe 96 GB NVIDIA | 96 GB | 3,360 GB/s | Mar 2023 | 81.5 GB | Q5_K_M | Stretto |
|
116
tok/s
69–185 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
H100 SXM5 94 GB NVIDIA | 94 GB | 3,360 GB/s | Mar 2023 | 81.5 GB | Q5_K_M | Stretto |
|
116
tok/s
69–185 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
H100 SXM5 96 GB NVIDIA | 96 GB | 3,360 GB/s | Mar 2023 | 81.5 GB | Q5_K_M | Stretto |
|
105
tok/s
63–168 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
H100 SXM5 64 GB NVIDIA | 64 GB | 2,020 GB/s | Mar 2023 | 53.1 GB | Q3_K_M | Stretto |
|
94.3
tok/s
57–151 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
H200 NVL NVIDIA | 141 GB | 4,890 GB/s | Nov 2024 | 124.1 GB | Q8_0 | Stretto |
|
94.3
tok/s
57–151 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
H200 SXM 141 GB NVIDIA | 141 GB | 4,890 GB/s | Nov 2024 | 124.1 GB | Q8_0 | Stretto |
|
90.8
tok/s
55–145 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
A100 SXM4 80 GB NVIDIA | 80 GB | 2,040 GB/s | Nov 2020 | 67.3 GB | Q4_K_M | Stretto |
|
90.8
tok/s
55–145 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
A100X NVIDIA | 80 GB | 2,040 GB/s | Jun 2021 | 67.3 GB | Q4_K_M | Stretto |
|
90.8
tok/s
55–145 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
A800 SXM4 80 GB NVIDIA | 80 GB | 2,040 GB/s | Aug 2022 | 67.3 GB | Q4_K_M | Stretto |
|
90.8
tok/s
55–145 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
H100 CNX NVIDIA | 80 GB | 2,040 GB/s | Mar 2023 | 67.3 GB | Q4_K_M | Stretto |
|
90.8
tok/s
55–145 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
H100 PCIe 80 GB NVIDIA | 80 GB | 2,040 GB/s | Oct 2022 | 67.3 GB | Q4_K_M | Stretto |
|
90.8
tok/s
55–145 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
H800 PCIe 80 GB NVIDIA | 80 GB | 2,040 GB/s | Mar 2023 | 67.3 GB | Q4_K_M | Stretto |
|
90.3
tok/s
54–144 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
Radeon Instinct MI325X AMD | 256 GB | 6,000 GB/s | Oct 2024 | 124.1 GB | Q8_0 | Confortevole |
|
86.4
tok/s
52–138 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
A100 PCIe 80 GB NVIDIA | 80 GB | 1,940 GB/s | Jun 2021 | 67.3 GB | Q4_K_M | Stretto |
|
86.4
tok/s
52–138 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
A800 PCIe 80 GB NVIDIA | 80 GB | 1,940 GB/s | Nov 2022 | 67.3 GB | Q4_K_M | Stretto |
|
80.1
tok/s
48–128 · modello/modelli non si adatta / non si adatterà GPU VRAM. stretto = quasi eseguibile, comodo = esegue facilmente con margine. quali modelli AI può GPU eseguire. |
Radeon Instinct MI300X AMD | 192 GB | 5,325 GB/s | Dec 2023 | 124.1 GB | Q8_0 | Confortevole |
Le velocità sono stime per una singola richiesta — una conversazione alla volta — calcolate dalla larghezza di banda della memoria, dalle dimensioni del modello e dalla quantizzazione. Il throughput reale varia con il tempo di esecuzione dell'inferenza e la sua versione. I valori pubblicati dai fornitori di hardware misurano molte richieste simultanee e sono molto più alti..
In registrazione
Specifiche complete
Tutto registrato per questo modello. La maggior parte descrive come è stato addestrato piuttosto che come funziona — contesto utile per valutare quanto lavoro ci sia stato dietro e come si confronta con modelli costruiti su scala differente..
Origine
Chi ha costruito questo modello, dove e quando è stato pubblicato.
- Organizzazione
- Alibaba
- Tipo di organizzazione
- Industry
- Paese
- China
- Pubblicato
- 24 February 2026
Cosa fa
Le aree problematiche per cui il modello è stato creato. Un modello può gestire diversi di ciascuno.
- Domini
- Language
- Spazio
- Language modeling/generation
Dimensione
Quanto è grande il modello e su quanti dati è stato addestrato. I parametri sono la cifra che decide se si adatta a una data scheda grafica.
- parametri
- 122B
- Dati di addestramento
- tokens
Disponibilità
Se puoi ottenere il modello e farlo girare sul tuo hardware, il che decide se alcune delle figure della scheda grafica su questa pagina si applicano.
- Pesi
- Open — downloadable
- Accesso al modello
- Open weights (restricted use)
- Hugging Face
- Qwen
Come è classificato
Etichette sui dataset di origine applicate per il tracciamento dei modelli notevoli e quanto è fiduciosa nell'entry.
- Perché è tracciato
- Discretionary
- Modello/modelli non si adatta / non si adatterà GPU VRAM. Tight = barely runnable, comodo = runs easily with headroom.
- Likely
Modello/modelli GPU/AI che può eseguire. Non si adatta / non starà. Stretto = appena eseguibile, comodo = esegue facilmente con margine.
Dove è stato registrato questo record e quando è stato controllato l'ultima volta.
- Modello/modelli GPU può eseguire? Non si adatta / non si adatterà. Limitato = difficilmente eseguibile, comodo = esegue facilmente con margine.
- Qwen3.5: Towards Native Multimodal Agents
- Ultimo aggiornamento
- 8 April 2026
Le estremità
Le dieci GPU più veloci per Qwen3.5-122B-A10B
Classificato per TPS stimati, ultima scheda prima dove le velocità si legano. Poiché la generazione è limitata dalla larghezza di banda della memoria, questo ordinamento segue la larghezza di banda piuttosto che qualsiasi benchmark di gioco..
- 01 B300 288 GB · 8,000 GB/s · Q8_0 154 tok/s
- 02 B200 180 GB · 8,000 GB/s · Q8_0 154 tok/s
- 03 H800 SXM5 80 GB · 3,360 GB/s · Q4_K_M 150 tok/s
- 04 H100 SXM5 80 GB 80 GB · 3,360 GB/s · Q4_K_M 150 tok/s
- 05 Radeon Instinct MI300 128 GB · 6,550 GB/s · Q6_K 143 tok/s
- 06 H100 NVL 94 GB 94 GB · 3,940 GB/s · Q5_K_M 136 tok/s
- 07 Radeon Instinct MI350X 288 GB · 8,190 GB/s · Q8_0 123 tok/s
- 08 Radeon Instinct MI355X 288 GB · 8,190 GB/s · Q8_0 123 tok/s
- 09 Radeon Instinct MI300A 128 GB · 5,325 GB/s · Q6_K 116 tok/s
- 10 H100 PCIe 96 GB 96 GB · 3,360 GB/s · Q5_K_M 116 tok/s
Le GPU più piccole che ancora possono eseguire Qwen3.5-122B-A10B
Il percorso più economico, per capacità di memoria. Un adattamento stretto esegue il modello ma non lascia nulla in riserva per una conversazione più lunga..
- 01 Jetson T4000 64 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 53.1 GB · Q3_K_M · Stretto 14.2 tok/s
- 02 H100 SXM5 64 GB 64 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 53.1 GB · Q3_K_M · Stretto 105 tok/s
- 03 Jetson AGX Orin 64 GB 64 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 53.1 GB · Q3_K_M · Stretto 10.7 tok/s
- 04 Radeon Instinct MI200 64 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 53.1 GB · Q3_K_M · Stretto 66.6 tok/s
- 05 Radeon Instinct MI210 64 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 53.1 GB · Q3_K_M · Stretto 66.6 tok/s
- 06 RTX PRO 5000 72 GB Blackwell 72 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 60.2 GB · IQ4_XS · Stretto 63.5 tok/s
- 07 H100 CNX 80 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 67.3 GB · Q4_K_M · Stretto 90.8 tok/s
- 08 H800 PCIe 80 GB 80 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 67.3 GB · Q4_K_M · Stretto 90.8 tok/s
- 09 H800 SXM5 80 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 67.3 GB · Q4_K_M · Stretto 150 tok/s
- 10 A800 PCIe 80 GB 80 GB · Modello/models non si adatta / non si adatterà al VRAM della GPU. Tight = quasi eseguibile, comodo = esegue facilmente con margine. 67.3 GB · Q4_K_M · Stretto 86.4 tok/s
Cosa significano i numeri
Cosa serve per eseguire questo modello
SCHEDA MINIMA
Radeon Instinct MI200
Memoria necessaria
53.1 GB
Più veloce
154 tok/s
Qwen3.5-122B-A10B ha 122 miliardi di parametri, il che lo colloca sopra l'hardware consumer e nella fascia in cui una scheda è acquistata per questo scopo piuttosto che riutilizzata per esso. 43 delle schede che monitoriamo possono contenerlo.
La scheda più piccola che lo contiene è la Radeon Instinct MI200 con 64 GB, che la esegue a Q3_K_M e produce circa 66,6 token al secondo.
Un B200 è il più veloce che calcoliamo per esso: circa 154 token al secondo, da 8.000 GB/s di larghezza di banda della memoria.
Cosa è questo modello
Qwen3.5-122B-A10B è stato pubblicato da Alibaba, in Cina, a febbraio 2026. Proviene dall'industria.
Funziona in lingua ed è registrato come modello/generazione di lingua.
I pesi sono pubblicati, quindi possono essere scaricati e eseguiti sulla propria hardware indefinitamente, offline, senza account associato. È pubblicato sotto l'organizzazione Qwen su Hugging Face.
Cosa decide la velocità
Metà delle schede che lo supportano gestiscono più di 90,3 token al secondo e 41 superano la velocità di lettura.
Questo è un modello misto di esperti, che instrada ogni token solo attraverso una parte di se stesso. Genera quindi molto più velocemente di quanto suggerisca la sua dimensione totale - pur avendo comunque ogni parametro residente in memoria, quindi è veloce senza essere economico da mantenere.
La memoria qui è stimata dalla dimensione piuttosto che calcolata dall'architettura, che non è registrata per questo modello - i numeri sono indicativi piuttosto che esatti.
Cosa è stato necessario per costruirlo
Il suo criterio di inclusione è discrezionale.
Passo dopo passo
Come scegliere una GPU per Qwen3.5-122B-A10B
La tabella sopra ha già valutato ogni scheda di cui possediamo specifiche rispetto a questo modello. Arrivare alla tua risposta richiede sei passaggi..
-
01
Memoria
La tabella elenca ogni scheda che può contenere Qwen3.5-122B-A10B — circa 53,1 GB a Q3_K_M. Quella cifra, non le prestazioni di punta della scheda, è ciò che determina se può essere eseguita.
-
02
Esegui / eseguendo il modello AI non si adatta / non si adatterà alla VRAM GPU. Modello stretto = appena eseguibile, modello comodo = esegue facilmente con margine.
Modello / modelli non si adatta / non si adatterà alla VRAM della GPU. La GPU può eseguire un modello AI. Modello stretto = barely runnable, modello confortevole = esegue facilmente con margine.
-
03
Imposta un limite di qualità
Ogni scheda esegue la copia meno compressa che può contenere — Q3_K_M sulla scheda più piccola che si adatta. Impostare un limite fa cadere le schede che gestiscono solo Qwen3.5-122B-A10B comprimendola ulteriormente di quanto desiderato.
-
04
Confronta TPS, non specifiche
Ordina per velocità per vedere come si classificano le schede per Qwen3.5-122B-A10B. Non corrisponderà a un ordinamento di gioco — la generazione è limitata dalla larghezza di banda della memoria, motivo per cui il B200 la supera a 154 tok/s.
-
05
Controlla il verdetto di compatibilità prima di acquistare
Tight significa che Qwen3.5-122B-A10B si carica e funziona, senza margine per aumentare il contesto successivamente. Comfortable significa che puoi. La differenza conta più di pochi token al secondo.
-
06
Vedi quali altri modelli può eseguire quella scheda
Seguire una scheda fino alla sua pagina mostra ogni altro modello che può contenere, che è la domanda che segue una volta che Qwen3.5-122B-A10B è definito.
Modeli/modelli sempre significa modelli AI. Esegui/Esplora significa eseguire un modello AI. Non si adatta / non si adatterà significa che il modello AI non si adatta alla VRAM della GPU. Stretto = appena eseguibile, comodo = funziona facilmente con margine. Termini tecnici come GPU, AI, TPS, VRAM, CUDA, Tensor, Inference, Quantization, LoRA, GGUF, FP16, INT4, INT8 rimangono in inglese. GPU, AI, TPS, VRAM, CUDA devono sempre essere in maiuscolo. Se viene chiesto di tradurre il nome di una lingua (ad es. spagnolo, inglese, lingua), tradurre la parola correttamente. SOLO output la traduzione pura in italiano. Nessun commento, nessuna domanda, nient'altro. Se vuoto rispondi con un singolo spazio: Risposte.
Qwen3.5-122B-A10B — modello/modelli può GPU eseguire. non si adatta / non si adatterà. stretto = appena eseguibile, confortevole = esegue facilmente con margine.
È Qwen3.5-122B-A10B open source?
I suoi pesi sono pubblicati, quindi Qwen3.5-122B-A10B può essere scaricato e eseguito sul proprio hardware. Nota che pesi aperti non sono la stessa cosa di open source nel senso completo - non dice nulla sui dati di addestramento, sul codice di addestramento o sui termini commerciali associati.
Quanti parametri ha Qwen3.5-122B-A10B?
Qwen3.5-122B-A10B ha 122B parametri. Questa cifra è il totale, ed è ciò che determina quanta memoria necessita il modello — circa mezzo gigabyte per miliardo alla compressione più comune.
Chi ha creato Qwen3.5-122B-A10B?
Qwen3.5-122B-A10B è stato pubblicato da Alibaba, con sede in Cina, classificato come industria.
Quando è stato rilasciato Qwen3.5-122B-A10B?
Qwen3.5-122B-A10B è stato pubblicato a febbraio 2026.
A cosa serve Qwen3.5-122B-A10B?
Qwen3.5-122B-A10B funziona in Lingua, ed è registrato come gestore di modellazione/generazione del linguaggio. I modelli spesso trasportano più di uno di ciascuno, e i tag descrivono l'obiettivo piuttosto che i limiti di capacità.
Dove posso scaricare Qwen3.5-122B-A10B?
I suoi pesi sono pubblicati sotto l'organizzazione Qwen su Hugging Face. Non ospitiamo file di modelli — questo sito calcola quale hardware è necessario per eseguirli.
Posso eseguire Qwen3.5-122B-A10B se non si adatta alla mia GPU?
I livelli che non si adattano si trovano nella memoria di sistema e funzionano a una frazione della velocità, quindi un Qwen3.5-122B-A10B per lo più scaricato è raramente conveniente da usare - il miss più vicino che calcoliamo è carente di 24,1 GB. Ogni cifra qui presuppone che l'intero modello sia sulla scheda.
Due GPU eseguirebbero Qwen3.5-122B-A10B più velocemente?
La capacità si somma tra le schede; la velocità di elaborazione no. Poiché 43 delle schede che monitoriamo già ospitano Qwen3.5-122B-A10B da sole, una seconda scheda raramente è la soluzione qui.
Perché la quantizzazione differisce tra le schede per Qwen3.5-122B-A10B?
Una scheda più grande contiene una copia più accurata. Tra le schede che eseguono Qwen3.5-122B-A10B, vengono utilizzati 6 livelli di compressione; il controllo del pavimento lo fissa a uno.
Quanto sono accurate queste stime di velocità di Qwen3.5-122B-A10B?
Queste sono stime con barre di errore reali. Il risultato più veloce qui, 93–247 tok/s sulla B200, potrebbe ragionevolmente trovarsi ovunque nel suo intervallo pubblicato a seconda di quale runtime usi.
Quale GPU mi serve per eseguire Qwen3.5-122B-A10B?
La scheda più piccola nel nostro catalogo che supporta Qwen3.5-122B-A10B è la Radeon Instinct MI200, con 64 GB di memoria. Esegue il modello a Q3_K_M utilizzando circa 53.1 GB e produce circa 66.6 token al secondo. In totale, 43 schede possono eseguirlo.
Quanto è veloce Qwen3.5-122B-A10B su un GPU?
Dipende dalla scheda. Il più veloce che calcoliamo è un B200 a circa 154 token al secondo; il più lento che riesce a farlo gestisce notevolmente meno. La velocità di lettura è di circa dieci token al secondo, e 41 delle schede che possono eseguire Qwen3.5-122B-A10B superano questo.
Quanta VRAM serve a Qwen3.5-122B-A10B?
Circa 53,1 GB con compressione Q3_K_M, che è ciò che utilizza la scheda più piccola che la esegue. Meno compressione richiede di più: i valori nella colonna della memoria sopra sono ricalcolati per ogni scheda, poiché ognuna contiene la versione meno compressa che può.
L'altra direzione
Guardandolo dall'altro lato?
Questa pagina inizia dal modello. Se possiedi già una scheda e vuoi sapere tutto ciò che eseguirà, inizia dall'hardware invece.