Risposte
Domande frequenti
Informazioni sulle stime, cosa significano e come funziona il sito. Le domande su una specifica CARD o MODEL vengono risposte nella pagina della rispettiva CARD o MODEL..
Cosa significa "tokens per second"?
È la velocità con cui un modello linguistico genera testo su una data GPU — quanti token (approssimativamente, pezzi di parole) produce ogni secondo mentre chatta con esso. Un numero più alto significa che le risposte vengono elaborate più velocemente.
Quanto sono accurati le stime?
Aspettati che la cifra reale si collochi entro circa il 20-40% della stima. La stessa GPU e modello variano così tanto tra i motori di inferenza, le versioni dei motori e la configurazione di servizio — nessun foglio delle specifiche prevede ciò, ecco perché ogni cifra su questo sito è pubblicata come un intervallo piuttosto che un numero singolo.
Perché il tuo numero è così tanto più basso del throughput pubblicato da un fornitore di hardware?
Il throughput pubblicato dal venditore è solitamente misurato servendo centinaia di richieste contemporaneamente. La nostra cifra è per una persona che parla al modello, una richiesta alla volta — il numero che descrive effettivamente l'esecuzione di un modello localmente. I due non sono comparabili.
Cosa significa per un modello "adattarsi" a una GPU?
Che i pesi del modello, la sua cache delle conversazioni e l'overhead stesso del runtime si adattino tutti nella memoria usabile della scheda a una data quantizzazione. Un modello può adattarsi in modo stretto, confortevole o per niente — mostriamo quale, insieme a quanto spazio libero rimane.
Cos'è la quantizzazione e perché cambia se qualcosa si adatta?
La quantizzazione comprime i pesi di un modello per risparmiare memoria, a un piccolo costo per la qualità dell'output. Un modello che non si adatta a piena precisione si adatta spesso comodamente a una quantizzazione più bassa — noi riportiamo sempre la migliore qualità che si adatta a una determinata card.
Quali GPU coprite?
Migliaia di CARD di NVIDIA, AMD, Intel e Apple Silicon, dai mini-acceleratori per data-center alle CARD consumer. La copertura e la stima della fiducia sono migliori sull'hardware NVIDIA moderno, dove i motori di inferenza sottostanti sono più maturi.
gputps.com è gratuito da usare?
Sì — navigare tra GPU, modelli e ogni stima sul sito è gratuito, senza necessità di registrazione.
Come posso elencare una GPU in vendita?
Registrati per un account venditore gratuito e aggiungi i tuoi annunci — appaiono direttamente sulla pagina della scheda corrispondente. Consulta la pagina diventa-venditore per capire come funziona e i prezzi attuali.
Ancora in cerca
Non riesci a trovare quello che stai cercando?
Trovato un numero errato, GPU mancante o hai un suggerimento? Vorremmo sentirlo..
Il metodo
Come vengono costruite le stime
Le schede tecniche ti dicono cos'è una GPU. Non ti dicono cosa fa con un modello di linguaggio. Questa è la lacuna che abbiamo costruito questo sito per colmare..