Il catalogo

Calcolatore TPS GPU

Calcola quanti token al secondo produce qualsiasi scheda grafica su un modello AI locale. Filtra il catalogo qui sotto per le schede da prendere in considerazione, poi aprine una per vedere ogni modello linguistico che può eseguire, quanta memoria ciascuno richiede e quanto è probabile che sia veloce..

818

schede in archivio

4

fabbricanti

4 GB – 288 GB

intervallo di VRAM

8,190 GB/s

massima larghezza di banda

Ogni parola deve corrispondere a qualcosa, quindi più parole restringono l'elenco. Una capacità come 24GB corrisponde alla memoria della scheda anche se nessuna colonna la memorizza come testo..

818 schede corrispondono

Aggiornamento
Tipo di memoria Potenza
B300 NVIDIA · Blackwell Ultra 288 GB 8,000 GB/s 2.03 GHz 1.67 GHz Sep 2025 HBM3e 1,400 W
Radeon Instinct MI350X AMD · CDNA 4.0 288 GB 8,190 GB/s 2.2 GHz 1 GHz Jan 2025 HBM3e 1,000 W
Radeon Instinct MI355X AMD · CDNA 4.0 288 GB 8,190 GB/s 2.4 GHz 1 GHz Jan 2025 HBM3e 1,400 W
Radeon Instinct MI325X AMD · CDNA 3.0 256 GB 6,000 GB/s 2.1 GHz 1 GHz Oct 2024 HBM3e 1,000 W
Radeon Instinct MI300X AMD · CDNA 3.0 192 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
Radeon Instinct MI308X AMD · CDNA 3.0 192 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
B200 NVIDIA · Blackwell 180 GB 8,000 GB/s 1.97 GHz 700 MHz Jan 2024 HBM3e 1,000 W
H200 NVL NVIDIA · Hopper 141 GB 4,890 GB/s 1.79 GHz 1.37 GHz Nov 2024 HBM3e 600 W
H200 SXM 141 GB NVIDIA · Hopper 141 GB 4,890 GB/s 1.98 GHz 1.5 GHz Nov 2024 HBM3e 700 W
Data Center GPU Max 1550 Intel · Generation 12.5 128 GB 3,280 GB/s 1.6 GHz 900 MHz Jan 2023 HBM2e 600 W
Data Center GPU Max Subsystem Intel · Generation 12.5 128 GB 3,210 GB/s 1.6 GHz 900 MHz Jan 2023 HBM2e 2,400 W
GB10 NVIDIA · Blackwell 2.0 128 GB 273 GB/s 2.42 GHz 1.67 GHz Oct 2025 LPDDR5X 140 W
Jetson T5000 NVIDIA · Blackwell 128 GB 273 GB/s 2.53 GHz 1.67 GHz Aug 2025 LPDDR5X 40 W
Radeon Instinct MI250 AMD · CDNA 2.0 128 GB 3,280 GB/s 1.7 GHz 1 GHz Nov 2021 HBM2e 500 W
Radeon Instinct MI250X AMD · CDNA 2.0 128 GB 3,280 GB/s 1.7 GHz 1 GHz Nov 2021 HBM2e 500 W
Radeon Instinct MI300 AMD · CDNA 3.0 128 GB 6,550 GB/s 1.7 GHz 1 GHz Jan 2023 HBM3 600 W
Radeon Instinct MI300A AMD · CDNA 3.0 128 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
Data Center GPU Max 1350 Intel · Generation 12.5 96 GB 2,460 GB/s 1.55 GHz 750 MHz Jan 2023 HBM2e 450 W
H100 PCIe 96 GB NVIDIA · Hopper 96 GB 3,360 GB/s 1.84 GHz 1.67 GHz Mar 2023 HBM3 700 W
H100 SXM5 96 GB NVIDIA · Hopper 96 GB 3,360 GB/s 1.98 GHz 1.35 GHz Mar 2023 HBM3 700 W
RTX PRO 6000 Blackwell NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.62 GHz 1.59 GHz Mar 2025 GDDR7 600 W
RTX PRO 6000 Blackwell Max-Q NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.28 GHz 1.04 GHz Mar 2025 GDDR7 300 W
RTX PRO 6000 Blackwell Server NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.62 GHz 1.59 GHz Mar 2025 GDDR7 600 W
RTX PRO 6000D Blackwell Max-Q NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.29 GHz 1.59 GHz Mar 2025 GDDR7 300 W
H100 NVL 94 GB NVIDIA · Hopper 94 GB 3,940 GB/s 1.79 GHz 1.08 GHz Mar 2023 HBM3 400 W
H100 SXM5 94 GB NVIDIA · Hopper 94 GB 3,360 GB/s 1.98 GHz 1.35 GHz Mar 2023 HBM3 700 W
RTX 6000D NVIDIA · Blackwell 2.0 84 GB 1,570 GB/s 2.43 GHz 1.59 GHz Mar 2025 GDDR7 600 W
A100 PCIe 80 GB NVIDIA · Ampere 80 GB 1,940 GB/s 1.41 GHz 1.07 GHz Jun 2021 HBM2e 300 W
A100 SXM4 80 GB NVIDIA · Ampere 80 GB 2,040 GB/s 1.41 GHz 1.28 GHz Nov 2020 HBM2e 400 W
A100X NVIDIA · Ampere 80 GB 2,040 GB/s 1.44 GHz 795 MHz Jun 2021 HBM2e 300 W

Passo dopo passo

Come calcolare il TPS della tua GPU

Niente qui ha bisogno di essere calcolato a mano. Il catalogo sopra contiene già ogni CARD, e ogni pagina della CARD contiene già ogni MODELLO che può eseguire con un dato di token-per-second. Arrivare alla tua risposta richiede sei passaggi..

  1. 01

    Riduci il catalogo a schede da prendere in considerazione

    Utilizza i filtri sopra per impostare ciò di cui hai veramente bisogno — una dimensione minima della MEMORY, un produttore, un limite di potenza che la tua alimentazione può fornire, o un anno di RELEASE. La MEMORY è il filtro da cui iniziare, perché decide quali modelli sono possibili.

  2. 02

    O cerca una scheda che possiedi già

    Digita il nome nella casella di ricerca. Ogni parola deve corrispondere a qualcosa, quindi più parole ristrettano l'elenco, e una capacità come 24GB si abbina alla memoria della scheda anche se nessuna colonna la memorizza come testo.

  3. 03

    Ordina in base alla specifica che decide il tuo risultato

    Ordina per memoria se la domanda è quali modelli si adattano, o per larghezza di banda se la domanda è quanto velocemente verranno eseguiti. Le velocità di clock e i conteggi dei core sono elencati per completezza ma influenzano appena la generazione di testo.

  4. 04

    Apri la GPU

    Ogni CARD ha la propria pagina che elenca ogni modello di linguaggio che può eseguire, con il numero stimato di TOKEN per secondo, la MEMORY di cui ha bisogno ciascun modello e la compressione a cui viene eseguita.

  5. 05

    Imposta la tua lunghezza di contesto e la qualità minima

    Nella pagina della scheda, imposta la lunghezza della conversazione che ti aspetti di utilizzare e la compressione più bassa che sei disposto ad accettare. Entrambi cambiano la risposta piuttosto che filtrarla — una conversazione più lunga richiede più MEMORY, il che può spingere un modello grande fuori dalla scheda completamente.

  6. 06

    Leggi l'intervallo, non il singolo numero

    Ogni cifra di throughput è pubblicata con un intervallo di fiducia attorno ad essa. Prendi l'intervallo come risposta: la stessa CARD e MODEL variano tra gli engine di inferenza e le versioni in modi che nessuna scheda tecnica prevede, e il numero principale è solo il centro di quella gamma.

Cosa significano i numeri

Cosa è questo catalogo

Questo è un database che contiene 818 schede grafiche, filtrate fino a quelle con sufficiente VRAM per contenere un modello di linguaggio. Ogni scheda ha la propria pagina, e su quella pagina ogni modello che monitoriamo è stato valutato rispetto ad essa — se si adatta, a quale compressione e quanti token al secondo è probabile che produca.

Il calcolo viene eseguito quando apri una CARD piuttosto che essere cercato da una tabella memorizzata, il che consente alla CONTEXT LENGTH e alla qualità minima di essere impostate da te piuttosto che cose che abbiamo assunto per tuo conto. Cambia uno qualsiasi e ogni cifra viene ricalcolata.

Perché i TOKEN PER SECONDO è il numero che conta

Eseguire un modello di linguaggio sul proprio hardware è diventata una cosa ordinaria da fare in poco tempo. I modelli open weight hanno raggiunto un livello sufficiente per essere davvero utili, e gli strumenti per eseguirli hanno smesso di richiedere un background di ricerca. Ciò che non è arrivato insieme a questo è una risposta chiara alla prima domanda che chiunque faccia: funzionerà sulla scheda che ho già e sarà abbastanza veloce da valere la pena di essere utilizzato.

Le schede tecniche non rispondono a questo. Sono scritte per i carichi di lavoro grafici e iniziano con i numeri che decidono i frame rate, che sono quasi completamente sbagliati. I due numeri che decidono realmente l'esito sono la capacità di memoria, che determina se un modello si adatta, e la larghezza di banda della memoria, che stabilisce quanto velocemente genera una volta che lo fa.

I Token al secondo sono il numero che esprime il risultato in qualcosa che puoi percepire. La velocità di lettura è di circa dieci token al secondo, quindi qualsiasi cosa sopra quella arriva più velocemente di quanto tu possa leggerla e qualsiasi cosa ben al di sotto sembra un'attesa. Questa è la cifra che questo sito calcola, per ogni combinazione di card e model che detiene.

Cosa copre il catalogo

intervallo di VRAM

4 GB – 288 GB

massima larghezza di banda

8,190 GB/s

Gamma di potenza

6 – 2,400 W

La memoria nel catalogo inizia a 4 GB e raggiunge 288 GB. Quella gamma è la differenza tra una CARD limitata ai modelli più piccoli utilizzabili e una che contiene modelli che nessuna macchina da desk può toccare — la CAPACITÀ è un gate rigido piuttosto che un compromesso graduale, quindi un MODELLO o si adatta o non viene eseguito.

La larghezza di banda della MEMORIA inizia a 10 GB/s e raggiunge 8,190 GB/s, una figura tenuta da Radeon Instinct MI355X. Poiché generare ogni token significa leggere l'intero modello dalla memoria una volta, quella dispersione si traduce quasi direttamente in una dispersione nella velocità di generazione: una scheda con dieci volte la larghezza di banda produce token circa dieci volte più velocemente sullo stesso modello.

Le schede nel catalogo sono prodotte da AMD, ATI, Intel and NVIDIA. Il produttore conta più di quanto dovrebbe: il software di inferenza ha ricevuto molta più attenzione per il percorso CUDA rispetto a qualsiasi altro, quindi una scheda AMD o Intel di larghezza di banda equivalente raggiunge generalmente una quota inferiore al suo tetto teorico. Le nostre stime applicano una penalità per questo piuttosto che pretendere che l'hardware sia l'unica variabile.

Il consumo di energia inizia a 6 W e raggiunge 2,400 W. L'estremità superiore è l'hardware del datacenter che un'alimentazione desktop non può alimentare, ed è la limitazione che le persone tendono a scoprire per ultime — dopo che la CARD rientra nel budget e il case.

Le date di rilascio iniziano nel 2009 e eseguire a 2025, quindi il catalogo copre l'hardware che le persone possiedono ancora, così come l'hardware che potrebbero acquistare. Una scheda più vecchia non è esclusa per essere vecchia — se ha la MEMORY, può ancora eseguire un AI MODEL, e la pagina dirà quanto è veloce.

Acquistare una scheda

I fornitori possono elencare le schede in vendita contro qualsiasi voce di questo catalogo, quindi una pagina della scheda può mostrare sia ciò che l'hardware può eseguire sia dove può essere acquistato. Gli elenchi sono collegati alla specifica variante della scheda piuttosto che a un nome di modello, che qui è più importante di quanto lo sarebbe normalmente — lo stesso nome copre spesso diverse capacità di memoria, e la capacità è ciò che decide quali modelli possono essere eseguiti.

Leggendo la tabella

Come leggere questo catalogo

Memoria
Quanto può contenere la scheda. Una guida approssimativa è di poco più di mezzo gigabyte per miliardo di parametri con la compressione più utilizzata, più spazio per la conversazione. Non tutto è disponibile — il software di inferenza riserva circa un decimo per il proprio spazio di lavoro.
Larghezza di banda
Quanto velocemente la scheda legge la propria memoria, in gigabyte al secondo. Questo è il singolo miglior indicatore della velocità di generazione in qualsiasi parte di questo sito.
Boost e base clock
Quanto veloce gira il processore. Elencato per completezza, e molto meno predittivo qui rispetto a un benchmark di gioco: la generazione attende sulla memoria, non sull'aritmetica.
Tipo di memoria e interfaccia di bus
La tecnologia della memoria e come la scheda si collega alla macchina. I componenti HBM sono hardware da datacenter con molta più larghezza di banda rispetto al GDDR utilizzato sulle schede desktop. L'interfaccia del bus governa quanto velocemente un modello si carica, non quanto velocemente viene eseguito.
Potenza
Il consumo nominale della scheda in watt. Vale la pena filtrare quando l'alimentatore o il case sono già stati decisi, poiché le schede più grandi necessitano di considerevolmente più di quanto fornisca un desktop tipico.
Perché una card appare più di una volta
Ogni riga è una variante della scheda piuttosto che un chip, quindi lo stesso nome può apparire in diverse capacità di memoria. Quella distinzione è più importante qui che altrove, perché la capacità è ciò che decide se un modello funziona.

Risposte

domande comuni

01

Come calcolo i tokens al secondo della mia GPU?

Non devi. Trova la tua CARD nella tabella sopra — il catalogo contiene 818 di essi — e aprilo. La sua pagina elenca ogni modello di lingua che può eseguire con una cifra stimata di token-per-secondo per ciascuno, calcolata dalla larghezza di banda della memoria della scheda e dalla dimensione del modello una volta compresso.

02

Qual è un buon tokens per secondo per eseguire AI localmente?

La velocità di lettura è di circa dieci token al secondo, quindi qualsiasi cosa sopra produce testo più velocemente di quanto tu possa leggerlo e sembra immediato. Tra cinque e dieci è utilizzabile ma visibilmente lento. Sotto cinque è scomodo per una conversazione, anche se comunque va bene per lavori che lasci in esecuzione.

03

Quale specifica GPU è più importante per l'AI?

Capacità di memoria prima, perché l'intero modello deve essere mantenuto sulla card prima di poter generare qualsiasi cosa, e larghezza di banda seconda, perché generare ogni token significa leggere quel modello dalla memoria una volta. I conteggi dei core e le velocità di clock decidono le prestazioni grafiche e qui registrano appena.

04

Quanta VRAM ho bisogno per eseguire un modello linguistico?

Come guida approssimativa, poco più di mezzo gigabyte per miliardo di parametri con la compressione che la maggior parte delle persone utilizza, più spazio per la conversazione. Questo colloca un modello da otto miliardi di parametri comodamente su otto gigabyte e uno da trenta miliardi su ventiquattro. Le schede in questo catalogo partono da 4 GB e raggiungere 288 GB.

05

Quante schede grafiche ci sono in questo database?

Il catalogo contiene 818 schede realizzato da AMD, ATI, Intel and NVIDIA. Le grafiche integrate sono escluse perché non hanno memoria propria, così come le schede sotto quattro gigabyte, su cui nessun modello nel nostro catalogo si adatta a qualunque compressione.

06

Quale GPU ha la più alta larghezza di banda della memoria?

Quello è Radeon Instinct MI355X, raggiungere 8,190 GB/s. Poiché la velocità di generazione segue quasi direttamente la banda, è anche tra le schede più veloci qui per produrre testo — anche se se ciò sia importante dipende prima di tutto se il tuo modello non si adatta.

07

Quale GPU ha la maggior quantità di memoria?

Quello è Radeon Instinct MI355X, tenere 288 GB. La capacità a quel livello è territorio da datacenter e ciò consente ai modelli open weight più grandi di essere ospitati su una singola card piuttosto che essere suddivisi su più.

08

Una scheda grafica da gioco è sufficientemente buona per l'AI locale?

Per una persona alla volta, di solito sì, e spesso un valore migliore rispetto all'hardware del datacenter. Le schede consumer sacrificano la memoria totale piuttosto che la velocità, quindi il limite è quali modelli si adattano piuttosto che quanto velocemente girano una volta che lo fanno.

09

Il produttore conta per le prestazioni dell'AI?

Più di quanto dovrebbe. Il software di inferenza ha avuto molto più lavoro dedicato al percorso CUDA rispetto alle alternative, quindi una scheda AMD o Intel con larghezza di banda equivalente raggiunge tipicamente una quota più piccola del suo limite teorico. Le nostre stime applicano una penalità per questo, piuttosto che assumere che l'hardware sia l'unica variabile.

10

Posso usare due schede GPU insieme?

Sì, ed è spesso il punto — due CARD tengono modelli che nessuna potrebbe tenere da sola. Non raddoppia la velocità di generazione nel modo in cui raddoppia la MEMORY, e ogni cifra su questo sito descrive una singola CARD da sola.

11

Quanto sono accurati queste stime di TOKEN-PER-SECOND?

Vengono calcolati dalle specifiche piuttosto che misurati, e ognuno è pubblicato con un intervallo piuttosto che come un singolo numero. La stessa card e modello variano dal trenta al cinquanta per cento a seconda del software di inferenza che utilizzi e quale versione di esso, che nessun calcolo dalle schede di specifiche può prevedere. Considera l'intervallo come la risposta onesta.

12

So che quale modello voglio. Posso cercare al contrario?

Sì. La sezione dei modelli AI elenca ogni modello in archivio, e la pagina di ciascun modello nomina le schede grafiche che possono eseguirlo, la più piccola e la più veloce per prima. Questo è lo stesso calcolo affrontato dal lato opposto.

L'altra direzione

Guardandolo dall'altro lato?

Questa pagina inizia dall'hardware. Se già sai quale modello vuoi eseguire e hai bisogno di sapere cosa serve, inizia da lì invece. — elenca ogni modello in archivio, e ciascuno nomina le schede che possono eseguirlo.

Modelli AI