Calcola le TPS di RTX 6000D sui modelli di AI locali
Ogni modello nel nostro catalogo valutato in base a questa scheda alla lunghezza di contesto e alla qualità minima da Lei scelta. La velocità è una stima per una singola richiesta, calcolata sulla base della larghezza di banda della memoria di questa scheda e della dimensione di ogni modello una volta compresso..
Calcolato per questa scheda
679 modelli nel nostro catalogo complessivamente
Il modello più grande che supporta
dots.llm1
142B · Q3_K_M · 12.6 tok/s
Modello più veloce
Gemma 3 QAT 1B
665 tok/s · 1B
Quali modelli AI possono essere eseguiti su un RTX 6000D?
Imposta gli input, leggi la risposta
Più contesto significa più memoria per la cache della conversazione. La velocità si riferisce a una conversazione nuova e non cambia con questa impostazione.
Nasconde i modelli che si adatterebbero solo comprimendoli al di sotto di questo punto.
609 modelli corrispondenti
Calcolo| Quantizzazione | Adatto | ||||||
|---|---|---|---|---|---|---|---|
|
665
tok/s
565–798 |
Gemma 3 1B | 1B | Mar 2025 | 1.8 GB | 33k tokens | Q8_0 | Confortevole |
|
665
tok/s
565–798 |
Gemma 3 QAT 1B | 1B | Apr 2025 | 1.8 GB | 33k tokens | Q8_0 | Confortevole |
|
665
tok/s
399–1,064 · bassa fiducia |
HGRN 1B (WT 103) ≈ | 1B | Nov 2023 | 1.8 GB | 131k tokens ? | Q8_0 | Confortevole |
|
665
tok/s
399–1,064 · bassa fiducia |
LLama 3..2 Typhoon 2 1B ≈ | 1B | Dec 2024 | 1.8 GB | 131k tokens ? | Q8_0 | Confortevole |
|
665
tok/s
399–1,064 · bassa fiducia |
OLMo-1B ≈ | 1B | Feb 2024 | 1.8 GB | 131k tokens ? | Q8_0 | Confortevole |
|
665
tok/s
399–1,064 · bassa fiducia |
Pythia-1b ≈ | 1B | Apr 2023 | 1.8 GB | 131k tokens ? | Q8_0 | Confortevole |
|
616
tok/s
369–985 · bassa fiducia |
OpenELM-1.1B ≈ | 1.1B | May 2024 | 1.9 GB | 131k tokens ? | Q8_0 | Confortevole |
|
604
tok/s
363–967 · bassa fiducia |
DeciCoder-1B ≈ | 1.1B | Aug 2023 | 1.9 GB | 131k tokens ? | Q8_0 | Confortevole |
|
604
tok/s
363–967 · bassa fiducia |
SantaCoder ≈ | 1.1B | Jan 2023 | 1.9 GB | 131k tokens ? | Q8_0 | Confortevole |
|
604
tok/s
363–967 · bassa fiducia |
TinyLlama-1.1B (1T token checkpoint) ≈ | 1.1B | Oct 2023 | 1.9 GB | 131k tokens ? | Q8_0 | Confortevole |
|
604
tok/s
363–967 · bassa fiducia |
TinyLlama-1.1B (3T token checkpoint) ≈ | 1.1B | Oct 2023 | 1.9 GB | 131k tokens ? | Q8_0 | Confortevole |
|
554
tok/s
332–887 · bassa fiducia |
EXAONE 4.0 (1.2B) ≈ | 1.2B | Jul 2025 | 2.0 GB | 131k tokens ? | Q8_0 | Confortevole |
|
554
tok/s
332–887 · bassa fiducia |
MinerU2.5 ≈ | 1.2B | Sep 2025 | 2.0 GB | 131k tokens ? | Q8_0 | Confortevole |
|
554
tok/s
332–887 · bassa fiducia |
Pleias 1.0 1.2B ≈ | 1.2B | Dec 2024 | 2.0 GB | 131k tokens ? | Q8_0 | Confortevole |
|
554
tok/s
332–887 · bassa fiducia |
Pleias-RAG-1B ≈ | 1.2B | Apr 2025 | 2.0 GB | 131k tokens ? | Q8_0 | Confortevole |
|
541
tok/s
460–649 |
Llama 3.2 1B | 1.2B | Sep 2024 | 2.2 GB | 131k tokens | Q8_0 | Confortevole |
|
533
tok/s
320–853 · bassa fiducia |
MiniCPM-1.2B ≈ | 1.2B | Jun 2024 | 2.0 GB | 131k tokens ? | Q8_0 | Confortevole |
|
511
tok/s
307–818 · bassa fiducia |
DeepSeek Coder 1.3B ≈ | 1.3B | Jan 2024 | 2.1 GB | 131k tokens ? | Q8_0 | Confortevole |
|
511
tok/s
307–818 · bassa fiducia |
DeepSeek-VL-1.3B ≈ | 1.3B | Mar 2024 | 2.1 GB | 131k tokens ? | Q8_0 | Confortevole |
|
511
tok/s
307–818 · bassa fiducia |
DigiRL ≈ | 1.3B | Jun 2024 | 2.1 GB | 131k tokens ? | Q8_0 | Confortevole |
|
511
tok/s
307–818 · bassa fiducia |
GLA Transformer 1.3B ≈ | 1.3B | Aug 2024 | 2.1 GB | 131k tokens ? | Q8_0 | Confortevole |
|
511
tok/s
307–818 · bassa fiducia |
Janus 1.3B ≈ | 1.3B | Oct 2024 | 2.1 GB | 131k tokens ? | Q8_0 | Confortevole |
|
511
tok/s
307–818 · bassa fiducia |
Kosmos-2.5 ≈ | 1.3B | Aug 2024 | 2.1 GB | 131k tokens ? | Q8_0 | Confortevole |
|
511
tok/s
307–818 · bassa fiducia |
Otter ≈ | 1.3B | May 2023 | 2.1 GB | 131k tokens ? | Q8_0 | Confortevole |
|
511
tok/s
307–818 · bassa fiducia |
Phi-1 ≈ | 1.3B | Oct 2023 | 2.1 GB | 131k tokens ? | Q8_0 | Confortevole |
Le velocità sono stime per una singola richiesta — una conversazione alla volta — calcolate in base alla bandwidth della memoria, alle dimensioni del modello e alla quantizzazione. La reale capacità di throughput varia in base al runtime dell'inferenza e alla sua versione. Le cifre pubblicate dai fornitori di hardware misurano molte richieste contemporaneamente e sono molto più elevate.
In registrazione
RTX 6000D Specifiche complete
Tutto ciò che è registrato per questa scheda, ordinato in base all'importanza nel funzionamento di un modello linguistico piuttosto che in base a come esso apparirebbe su una scheda tecnica. La memoria viene prima perché determina il risultato; il resto è contesto.
Memoria
Le due specifiche che decidono cosa può eseguire questa scheda e con quale velocità. La capacità stabilisce quali modelli si adattano; la larghezza di banda stabilisce quanti token al secondo producono una volta che lo fanno.
- Dimensione della memoria
- 84 GB
- Larghezza di banda della memoria
- 1,570 GB/s
- Tipo di memoria
- GDDR7
- Larghezza del bus di memoria
- 448 bit
- Clock di memoria
- 1.75 GHz
Il chip
Quale processore è sulla scheda e come è stato fabbricato. Una dimensione del processo più piccola significa generalmente più prestazioni per la stessa potenza.
- Processore grafico
- GB202
- Architettura
- Blackwell 2.0
- Generazione
- Blackwell PRO W(x000)
- Foundry
- TSMC
- Dimensione del processo
- 5 nm
- Transistor
- 92.2 billion
- Densità dei transistor
- 122,900 K/mm²
- Dimensione del die
- 750 mm²
- Rilasciato
- 18 March 2025
Velocità di clock
Quanto velocemente il processore gira. Vale molto meno qui che in un benchmark di gioco: generare testo è limitato dalla larghezza di banda della memoria, quindi una frequenza più alta muove a malapena il risultato.
- Frequenza di base
- 1.59 GHz
- Boost clock
- 2.43 GHz
Unità di elaborazione
Cosa contiene il chip. Questi influenzano le prestazioni grafiche e sono importanti principalmente per elaborare un lungo prompt piuttosto che per produrre la risposta.
- Unità di ombreggiatura
- 19,968
- Unità di mappatura delle texture
- 624
- Unità di output di rendering
- 192
- Elaboratori a flusso multipli
- 156
- Nuclei tensoriali
- 624
- Core di ray tracing
- 156
- Cache L1
- 128 KB
- Cache L2
- 128 MB
Prestazioni teoriche
Tassi aritmetici di picco pubblicati per la scheda. Questi sono soffitti che nessun carico di lavoro reale raggiunge, e generare testo raggiunge una piccola frazione di essi perché è limitato dalla memoria piuttosto che dall’aritmetica.
- Mezza precisione (FP16)
- 97 TFLOPS
- Precisione singola (FP32)
- 97 TFLOPS
- Doppia precisione (FP64)
- 1.5 TFLOPS
- Frequenza dei pixel
- 467 GPixel/s
- Tasso di texture
- 1,516 GTexel/s
La scheda
Cosa serve per installare fisicamente e alimentare la scheda — i vincoli pratici che decidono se si adatta alla macchina che possiedi già.
- Assorbimento di potenza (TDP)
- 600 W
- Alimentatore suggerito
- 1,000 W
- Connettori di alimentazione
- 1x 16-pin
- Interfaccia bus
- PCIe 5.0 x16
- Larghezza dello slot
- Dual-slot
- Dimensioni
- 304 mm × 40 mm
- Visualizza output
- 4x DisplayPort 2.1b
Supporto software
Quali interfacce grafiche e di calcolo supporta la scheda. La capacità di calcolo CUDA è quella che influisce sull'inferenza: al di sotto di 7.0 non ci sono core tensor, e i moderni software di inferenza ricorrono a percorsi di codice più lenti.
- capacità di calcolo CUDA
- 12.0
- DirectX
- 12.2
- OpenGL
- 4.6
- Vulkan
- 1.4
- OpenCL
- 3.0
- Modello di shader
- 6.8
Inserzioni
Dove acquistare un RTX 6000D
Nessun venditore sta attualmente elencando questa scheda. Gli elenco provengono da venditori che le pubblicano direttamente qui — naviga nell'elenco dei vendor per vedere chi vende cosa.
Cosa significano i numeri
Capacità e larghezza di banda
Memoria
84 GB
banda larga
1,570 GB/s
Modello più grande
dots.llm1
Con 84 GB di GDDR7, la RTX 6000D è nella classe di hardware che ospita i modelli open-weight più grandi senza suddividerli tra macchine. Circa 75,6 GB di questo sono accessibili da un runtime di inferenza una volta che il driver prende la sua parte.
La larghezza di banda è di 1,570 GB/s attraverso un bus a 448 bit. Generare un token significa leggere ogni peso una volta, quindi quella cifra stabilisce il ritmo più di qualsiasi altro numero qui, e a questo livello il testo arriva più velocemente di quanto la maggior parte delle persone legga.
La cifra è il clock della memoria — 1,75 GHz qui — moltiplicato per la larghezza del bus. È il motivo per cui il conteggio dei core predice così male la velocità di generazione.
In pratica, quella combinazione raggiunge un massimo di dots.llm1 — 142B, compresso a Q3_K_M, generando circa 12,6 token al secondo.
Il chip e come è stato costruito
La RTX 6000D è costruita sul processore grafico GB202, utilizzando l'architettura Blackwell 2.0 di NVIDIA, come parte della generazione Blackwell PRO W(x000).
Il chip è prodotto da TSMC, su un processo di 5 nm, con un die che misura 750 mm², contenente 92.2 miliardi di transistor. Un processo più piccolo significa generalmente più prestazioni per la stessa potenza, anche se per i modelli di lingua ha un'importanza molto minore rispetto al sottosistema di memoria.
È stato rilasciato a marzo 2025, circa 1 anno fa. Il supporto software di inferenza tende a seguire l'hardware di un anno o due, quindi una scheda di questa età ha generalmente percorsi di codice maturi e ben ottimizzati disponibili.
Calcolo della larghezza di banda e perché è meno importante di quanto sembri
FP16
97 TFLOPS
FP64
1.5 TFLOPS
Nuclei tensoriali
624
Su carta la RTX 6000D raggiunge 97 TFLOPS a metà precisione e 97 TFLOPS a singola precisione. Questi sono valori di picco che nessun carico di lavoro reale sostiene, e generare testo raggiunge solo una piccola frazione di essi — la decodifica è limitata dalla memoria piuttosto che dall'aritmetica, motivo per cui una scheda può apparire enormemente potente qui e comunque produrre token a un tasso ordinario.
Il throughput in doppia precisione è 1,5 TFLOPS. Non ha influenza sull'esecuzione di un modello di lingua — nessun tempo di esecuzione di inferenza lo usa — ma separa le parti dei data center da quelle dei consumatori, poiché queste ultime lo limitano deliberatamente.
La scheda è dotata di 624 core tensoriali distribuiti su 156 multiprocessori di streaming. Questi accelerano l'aritmetica matriciale al centro di un trasformatore, ed è ciò che rende l'elaborazione dei prompt — leggere un lungo documento prima di rispondere — drammaticamente più veloce di quanto sarebbe altrimenti.
Le frequenze vanno da 1.59 GHz a basso a 2.43 GHz potenziato. Vale molto meno qui che in un benchmark di gioco: aumentare le velocità di clock accelera l'aritmetica, e l'aritmetica non è ciò su cui la generazione sta aspettando.
Cache e unità di elaborazione
La RTX 6000D ha 128 KB di cache L1, supportata da 128 MB di L2. La cache assorbe una parte del traffico di memoria che altrimenti colpirebbe il bus principale, che è l'unico posto in questa pagina dove un numero diverso dalla larghezza di banda influisce silenziosamente sulla velocità di generazione — un grande L2 consente a una maggiore parte del set di lavoro di rimanere vicino ai core.
Ci sono 19.968 unità di ombreggiatura, 624 unità di mappatura delle texture e 192 unità di output di rendering. Queste gestiscono i carichi di lavoro grafici e contribuiscono all'elaborazione dei prompt, ma rimangono inattive per gran parte del tempo che un modello trascorre a generare una risposta.
Potenza, dimensione e installazione
Consumo energetico
600 W
La RTX 6000D è valutata a 600 W, con un'alimentatore da 1.000 W suggerito per l'intero sistema. Eseguire un modello di linguaggio mantiene una scheda occupata a scatti piuttosto che in modo continuo — consuma molto durante la generazione e si ferma tra le richieste — quindi il consumo sostenuto durante una giornata lavorativa è solitamente ben al di sotto del valore nominale.
La scheda occupa uno slot doppio, misura 304 mm di lunghezza e necessita di 1x 16-pin. Vale la pena verificare rispetto al case e all'alimentatore già presenti nella macchina, poiché le schede più grandi richiedono notevolmente di più sia in termini di spazio che di alimentazione rispetto a quanto offre un desktop tipico.
Si connette tramite PCIe 5.0 x16. L'interfaccia regola la velocità con cui un modello viene caricato dal disco nella scheda, non quanto velocemente funziona una volta caricato, quindi un collegamento più stretto costa alcuni secondi all'avvio e nulla dopo.
Gli estremi
I più grandi modelli di AI che funzionano su un RTX 6000D
I modelli più grandi a peso aperto che si adattano a questa scheda, dal più recente al più vecchio. Ognuno è mostrato alla migliore compressione che la scheda può contenere..
I modelli AI più veloci su un RTX 6000D
Dove questa scheda produce i token più velocemente. I modelli più piccoli dominano qui, perché generare ogni token significa leggere l'intero modello dalla memoria una volta..
Passo dopo passo
Come calcolare i token al secondo di un RTX 6000D
Non è necessario calcolare nulla manualmente — il calcolatore di gputps.com su questa pagina l'ha già calcolato per ogni modello che questa scheda può supportare. Per leggere la risposta sono necessari sei passaggi.
-
01
Cerca il modello che desideri
La tabella elenca 609 modelli che questa RTX 6000D può eseguire. Cerca per nome, o per dimensione — digitando 27b corrisponde al conteggio dei parametri anche quando il nome non lo indica mai.
-
02
Abbina il contesto al tuo lavoro
Conversazioni più lunghe costano memoria oltre ai pesi. Con 84 GB a disposizione, questa è frequentemente la differenza tra un modello che si adatta e uno che non si adatta.
-
03
Fissa il confronto a un livello di qualità
Per impostazione predefinita, la tabella seleziona la copia meno compressa che si adatta. Impostare un limite rimuove i modelli che si qualificano solo tramite una compressione pesante.
-
04
Leggi la velocità e la portata
Ogni velocità è una stima per una singola conversazione, con un intervallo sotto di essa — 665 tok/s su Gemma 3 QAT 1B all'estremità superiore qui. La stessa scheda e modello variano dal trenta al cinquanta per cento tra i tempi di esecuzione dell'inferenza.
-
05
Controlla lo spazio disponibile prima di decidere.
La colonna di adattamento separa i modelli che si adattano appena da quelli con spazio extra — vale la pena controllare rispetto agli 84 GB della scheda prima di scegliere uno.
-
06
Controlla lo stesso modello dall'altro lato.
Ogni pagina di modello ripete questo calcolo per l'intero catalogo. Vale la pena dare un'occhiata prima di decidere: mostra cos'altro esegue lo stesso modello e come si confronta l'RTX 6000D.
Risposte
RTX 6000D — Domande frequenti
Qual è la larghezza di banda della memoria di una RTX 6000D?
La RTX 6000D ha 1,570 GB/s di larghezza di banda della memoria, su un bus di memoria a 448 bit. Questo è il miglior indicatore di quanto velocemente genera testo, perché produrre ogni token significa leggere l'intero modello dalla memoria una volta.
Che tipo di memoria utilizza una RTX 6000D?
Utilizza GDDR7 a 1.75 GHz. I tipi di HBM si trovano su acceleratori per datacenter e offrono una larghezza di banda notevolmente superiore a quella della GDDR utilizzata su schede desktop, motivo per cui generano token in modo considerevolmente più veloce alla stessa capacità.
Chi produce l'RTX 6000D?
La RTX 6000D è un prodotto NVIDIA, con il chip prodotto da TSMC, su un processo a 5 nm.
Quando è stata rilasciata la RTX 6000D?
La RTX 6000D è stata rilasciata nel marzo 2025.
Quanta potenza consuma una RTX 6000D?
La RTX 6000D ha una potenza nominale della scheda di 600 W e si suggerisce un'alimentazione di sistema da 1.000 W. Generare testo richiede molta potenza a scatti e rimane inattivo tra le richieste, quindi il consumo medio durante una sessione di lavoro è generalmente ben al di sotto del valore nominale.
Quanta cache ha una RTX 6000D?
La RTX 6000D ha 128 KB di cache L1 e 128 MB di cache L2. La cache assorbe parte del traffico di memoria che altrimenti raggiungerebbe il bus principale, quindi una L2 più grande offre un modesto miglioramento della velocità di generazione oltre a quanto prevederebbe solo la larghezza di banda.
Quali sono i TFLOPS di una RTX 6000D?
La RTX 6000D è valutata a 97 TFLOPS a mezza precisione e 97 TFLOPS a precisione singola. Questi sono tetti aritmetici di picco piuttosto che tassi raggiungibili, e la generazione di testo raggiunge solo una piccola frazione di essi poiché è limitata dalla larghezza di banda della memoria invece.
Quanti tensor core ha una RTX 6000D?
La RTX 6000D ha 624 core tensoriali distribuiti su 156 multiprocessori streaming. Accelerano l'aritmetica delle matrici da cui è costruito un trasformatore, il che velocizza principalmente l'elaborazione di un lungo prompt piuttosto che la produzione della risposta.
La RTX 6000D supporta CUDA?
Sì. La RTX 6000D riporta la capacità di calcolo CUDA 12.0. La capacità 7.0 e superiore ha core tensor, che il software moderno di inferenza utilizza; al di sotto di essa, torna a percorsi di codice più lenti per i modelli quantizzati.
Quale interfaccia bus utilizza l'RTX 6000D?
Utilizza PCIe 5.0 x16. Questo governa quanto velocemente un modello viene caricato sulla scheda piuttosto che quanto velocemente gira una volta caricato, quindi costa qualche secondo all'avvio e nulla durante la generazione.
È la RTX 6000D buona per eseguire modelli AI locali?
La sua memoria è abbastanza grande per modelli che la maggior parte dell'hardware desktop non può gestire e la sua larghezza di banda è abbastanza alta da generare testo più velocemente di quanto la maggior parte delle persone legga. In totale esegue 609 dei modelli che monitoriamo. Se ciò sia sufficiente dipende interamente da quale modello desideri — la tabella sopra risponde a questo direttamente.
Può una RTX 6000D eseguire un modello che non entra nella sua memoria?
Scaricare oltre gli 84 GB della scheda è possibile e di solito è un falso risparmio: la parte di memoria di sistema è abbastanza lenta da predominare sul risultato.
Due schede RTX 6000D sarebbero due volte più veloci?
L'abbinamento delle schede RTX 6000D acquista margine piuttosto che velocità: 168 GB di memoria combinata, alla stessa velocità di generazione di una sola.
Quali modelli di AI può eseguire un RTX 6000D?
609 dei 679 modelli di linguaggio a peso aperto che seguiamo si adattano a una RTX 6000D e possono essere eseguiti localmente su di essa. La tabella in questa pagina elenca ciascuno di essi, con la memoria di cui hanno bisogno, la quantizzazione alla quale vengono eseguiti e una velocità di generazione stimata.
Qual è il modello di AI più grande che una RTX 6000D può eseguire?
Il modello più grande nel nostro catalogo che si adatta a una RTX 6000D è dots.llm1 a 142B parametri, compresso in Q3_K_M. Genera circa 12,6 token al secondo e richiede circa 70,1 GB della memoria della scheda.
Quanti token al secondo produce una RTX 6000D?
Dipende dal modello. Su una RTX 6000D il modello più veloce che monitoriamo è Gemma 3 QAT 1B a circa 665 token al secondo, mentre modelli più grandi funzionano proporzionalmente più lentamente perché ogni token richiede di leggere l'intero modello dalla memoria una volta. Le velocità sono stime per una singola conversazione alla volta.
Può una RTX 6000D eseguire un modello da 7B?
Sì. Ad esempio, una RTX 6000D esegue Multi-Token Prediction 7B a Q8_0, utilizzando circa 7,9 GB di memoria e generando circa 99,2 token al secondo.
Una RTX 6000D può eseguire un modello da 13B?
Sì. Ad esempio, una RTX 6000D esegue DeepSeekMoE-16B a Q8_0, utilizzando circa 17,5 GB di memoria e generando circa 231 token al secondo.
Può una RTX 6000D eseguire un modello da 30B?
Sì. Ad esempio, una RTX 6000D esegue ERNIE-4.5-VL-28B-A3B a Q8_0, utilizzando circa 29,2 GB di memoria e generando circa 132 token al secondo.
Può una RTX 6000D eseguire un modello da 70B?
Sì. Ad esempio una RTX 6000D esegue Qwen3-Coder-Next a Q6_K, utilizzando circa 62.0 GB di memoria e generando circa 67.1 token al secondo.
Quanta memoria ha una RTX 6000D?
Una RTX 6000D ha 84 GB di GDDR7 di memoria. Circa un decimo di quella è riservato dal runtime di inferenza e dal driver, lasciando circa 75,6 GB disponibili per un modello e la sua conversazione.
L'altra direzione
Guardando la questione dall'altra parte?
Questa pagina parte dall'hardware. Se già sa quale modello desidera e ha bisogno di sapere cosa serve per eseguirlo, iniziare dal modello invece.