Informazioni su di noi
Informazioni su gputps.com
Le schede tecniche ti dicono cos'è una GPU. Non ti dicono cosa fa con un modello di linguaggio. Questa è la lacuna che abbiamo costruito questo sito per colmare..
Che cosa è
Cosa facciamo
Per ogni GPU stimiamo quanti token al secondo può generare eseguendo un dato modello linguistico open-weight, se quel modello si adatta effettivamente alla sua memoria e a quale quantizzazione. Pubbliciamo questi dati affiancati alle tabelle delle specifiche, in modo che una decisione di acquisto sia basata su una risposta reale piuttosto che su numeri di VRAM e FLOPS che da soli non dicono nulla sulla velocità di inferenza..
Perché una stima, e non un singolo numero
Generare un token significa leggere i pesi di un modello dalla memoria una volta, quindi la velocità di decodifica è vincolata dalla larghezza di banda della memoria divisa per la dimensione del modello — questa è la formula dietro ogni cifra su questo sito. Ma la stessa card e modello variano dal 20 al 40% tra motori di inferenza, versioni del motore e formati di quantizzazione, e nessuna scheda tecnica può prevederlo. Pubblicare un numero dall'aspetto sicuro sarebbe disonesto riguardo alla precisione di questo tipo di stima. Quindi ogni cifra su questo sito è presentata come un intervallo, con il metodo e gli input dietro di esso, piuttosto che un valore puntuale nudo..
Il mercato dei fornitori
Accanto alle stime, i fornitori possono elencare i GPU in vendita direttamente sulla pagina del card — accanto alla risposta a "cosa esegue realmente questo", che è dove viene presa quella decisione..
Inizia qui
Entrambi i sensi, un calcolo
Inizia da una GPU che possiedi o stai considerando, o dal modello che vuoi eseguire..
Contattaci
Trovato qualcosa di sbagliato?
Trovato un numero errato, GPU mancante o hai un suggerimento? Vorremmo sentirlo..
Operato da
GPU AI Benchmark LLC 1209 Mountain Road Pl NE, Ste RAlbuquerque, NM 87110
USA