Throughput vincolato alla memoria, calcolato in tempo reale
La tua GPU può eseguire quel AI Model? Il calcolatore TPS della GPU
Scegli una scheda GPU o un modello linguistico e calcoliamo — in tempo reale, non da una tabella di ricerca — se si adatta, a quale compressione e all'incirca quanti token al secondo aspettarsi..
Stima in tempo reale
EntrataFormato
Q8_0
Contesto
13k
Confidenza
high
Esempi Lavorati
Controlla queste potenti combinazioni
Alcuni accoppiamenti a cui consiglieremmo un amico, a diversi budget.
Il grande setup del ragazzo
32 GB01
Confronta GPU
VRAM, larghezza di banda della memoria, core tensor e throughput FP16.
02
Stima dei token al secondo
La velocità di decodifica è vincolata dalla larghezza di banda della GPU, quindi la modelliamo piuttosto che citare i picchi di TFLOPS..
03
Controlla cosa si adatta
Quali modelli girano su una CARD, a quale quantizzazione e con quanto CONTEXT LENGTH.
Il problema
Perché "la mia GPU eseguirà questo?" è una domanda difficile
Una scheda tecnica ti informa della memoria di una card e della sua velocità di clock. Non ti dice se un modello di linguaggio specifico si adatta a quella memoria una volta compressa, quanto della card resta per la conversazione stessa, o quanti token al secondo escono realmente dall'altra parte — e queste tre domande non hanno la stessa risposta per qualsiasi coppia di GPU e modello.
La versione onesta di questo calcolo prende in considerazione il conteggio dei parametri del modello e l'architettura, il formato di compressione in cui è memorizzato, la larghezza di banda della memoria della scheda e quanto è maturo il suo software di inferenza, e la lunghezza della conversazione che intendi avere con esso. Sbagliare uno di questi e il numero che ne deriva appare altrettanto sicuro ed è semplicemente errato.
Non pretendiamo che questo produca un'unica cifra precisa, perché non può. Ciò che facciamo invece è eseguire il calcolo completo per ogni card e ogni modello di cui abbiamo dati, pubblicare il risultato come un intervallo piuttosto che come un valore di precisione falso, e mostrare il nostro lavoro — ogni formula dietro ogni numero su questo sito è scritta in modo aperto, non nascosta dietro la risposta.
Cosa ti offre realmente questo sito
Il dataset più completo che siamo riusciti a mettere insieme: migliaia di GPU e migliaia di modelli di linguaggio, incrociati tra loro piuttosto che analizzati uno alla volta. Inizia da una card che possiedi o stai considerando, e vedi ogni modello che si adatta. Inizia da un modello che vuoi eseguire, e vedi ogni card che può contenerlo.
Questo funziona in entrambe le direzioni perché il calcolo sottostante è simmetrico — la stessa aritmetica di MEMORY e BANDWIDTH, eseguita da qualsiasi lato tu già conosca. Nessuna delle due direzioni è la "reale"; sono la stessa risposta posta in due modi diversi.
Scopri di più su come e perché nel nostro pagina informativa.
Appena rilasciati
Scopri queste potenti nuove GPU
Sfoglia tutte le GPUNVIDIA
Oct 2025
Entrambe le direzioni
Come funziona la calcolatrice
Lo stesso calcolo, utilizzabile da qualsiasi lato della questione da cui si parte..
Partendo da una GPU che possiedi
- 01 Trova la tua GPU . Cerca nel catalogo delle GPU la scheda che possiedi o stai considerando, per nome o per dimensione della memoria.
- 02 Apri la sua pagina . Ogni CARD ha la propria pagina che elenca ogni linguaggio MODEL che possiamo valutare rispetto ad essa, con una stima dei TOKEN-PER-SECOND per ciascuno.
- 03 Imposta la tua lunghezza del contesto e il livello di qualità. . Regola la lunghezza della conversazione che ti aspetti di utilizzare e la compressione più bassa che accetterai. Entrambi modificano la risposta in tempo reale.
- 04 Leggi l'intervallo, non un singolo numero. . Ogni stima è pubblicata con un intervallo di confidenza piuttosto che un'unica cifra di falsa precisione, perché la stessa CARD e MODEL variano tra i motori di inferenza in modi che nessuna scheda tecnica prevede.
Partendo da un modello che vuoi eseguire
- 01 Trova il modello . Cerca nel catalogo dei modelli AI per nome o per dimensione — anche quando il nome stesso non indica il conteggio dei parametri.
- 02 Apri la sua pagina . Un modello con OPEN WEIGHTS elenca ogni scheda GPU contro cui possiamo valutarlo, la più piccola che si adatta e la più veloce per prima.
- 03 Imposta la tua lunghezza del contesto e il livello di qualità. . I due controlli sono gli stessi del percorso GPU-first: una conversazione più lunga richiede più MEMORY, il che può spingere una CARD da "fits" a "does not".
- 04 Confronta le schede in base a cosa noterai realmente . La memoria decide se funziona o meno; la larghezza di banda decide quanto velocemente si sente una volta che funziona. La tabella ordina per token al secondo per default perché è generalmente quello che conta.
Risposte
domande comuni
Come posso calcolare se la mia GPU può eseguire un LLM locale?
Trova la tua card nel catalogo GPU e apri la sua pagina — elenca ogni modello che possiamo valutare rispetto ad essa, se ciascuno si adatta nella memory e una stima dei tokens-per-second. Puoi anche partire da un modello e vedere quali card possono eseguirlo, che è lo stesso calcolo dalla direzione opposta.
La mia GPU può eseguire modelli LLM locali?
Se ha almeno alcuni gigabyte di MEMORY proprio, quasi certamente qualcosa. Le grafiche integrate che condividono la MEMORY di sistema sono l'eccezione principale, poiché non hanno una piscina dedicata per tenere un modello. Oltre a ciò, si tratta di quale MODELLO, a quale compressione - non sì o no.
Cosa determina i TOKENS PER SECOND su una GPU?
Generare un token significa leggere i pesi del modello dalla VRAM una volta, quindi la velocità è limitata dalla larghezza di banda della memoria divisa per quanto deve essere letto per token — che dipende dalle dimensioni del modello, dalla sua architettura e dal formato di compressione in cui è memorizzato. La velocità di clock e il numero di core, i numeri con cui inizia una scheda tecnico, influenzano appena.
Quanto sono accurati le stime su questo sito?
Aspettati che la cifra reale si posizioni all'interno di circa il 20–40% della stima. La stessa GPU e modello variano così tanto tra i motori di inferenza, le versioni dei motori e la configurazione di servizio — nessun calcolo basato solo sulle specifiche può prevedere ciò, motivo per cui ogni cifra qui è pubblicata come un intervallo.
È una GPU più grande e nuova sempre più veloce per l'AI?
Per un modello che già si adatta comodamente a entrambe le schede, la larghezza di banda della memoria decide il vincitore, e una scheda più recente di solito ne ha di più. Ma il collo di bottiglia più comune è la capacità, non la velocità — la domanda più utile per una scheda specifica è di solito "qual è il modello più grande che si adatta", a cui risponde direttamente la pagina di ciascuna scheda.
Devo capire la quantizzazione per usare questo sito?
No — ogni pagina di scheda e modello sceglie la compressione della migliore qualità che si adatta, automaticamente. La quantizzazione è la tecnica che riduce l'occupazione di memoria di un modello a basso costo per la qualità di output, e puoi impostare un limite di qualità tu stesso se lo desideri, ma nulla lo richiede.
Da dove provengono i dataset delle GPU e dei modelli AI?
Specifiche della scheda grafica e registrazioni del modello linguistico che coprono migliaia di modelli open weight e i loro conteggi di parametri, licenze e date di rilascio. Entrambi vengono aggiornati man mano che nuovo hardware e modelli vengono rilasciati — vedere i cataloghi GPU e AI model per una copertura completa.
Vendita hardware
Interessato a diventare un fornitore?
Elenca le tue GPU in vendita proprio accanto alla risposta a cosa possono effettivamente eseguire..
In arrivo
Ricevi notifiche su nuove GPU e modelli
Una newsletter arriverà presto.
Esplora ulteriormente
Sfoglia il catalogo completo delle GPU oppure sfogliare il catalogo completo dei modelli AI. Acquistando hardware? controlla il database dei fornitori. Più domande vengono risposte nel nostro Pagina FAQ, oppure Contattaci direttamente.