Antworten
Häufig gestellte Fragen
Über die Schätzungen, was sie bedeuten und wie die Seite funktioniert. Fragen zu einer bestimmten Karte oder einem bestimmten Modell werden auf der Seite dieser Karte oder dieses Modells beantwortet..
Was bedeutet "tokens pro Sekunde"?
Es ist, wie schnell ein Sprachmodell Text auf einer gegebenen GPU generiert – wie viele Tokens (großzügig Wortteile) es jede Sekunde produziert, während Sie mit ihm chatten. Eine höhere Zahl bedeutet, dass Antworten schneller fließen.
Wie genau sind die Schätzungen?
Erwarten Sie, dass die tatsächliche Zahl etwa 20–40 % des Schätzwerts liegt. Dieselbe GPU und dasselbe Modell variieren so stark zwischen Inference-Engines, Engine-Versionen und Serving-Konfigurationen — kein Datenblatt sagt das voraus, weshalb jede Zahl auf dieser Seite als Bereich und nicht als eine einzelne Zahl veröffentlicht wird.
Warum ist Ihre Zahl so viel niedriger als der Durchsatz, den ein Hardware-Anbieter veröffentlicht?
Vom Anbieter veröffentlichter Durchsatz wird normalerweise gemessen, während Hunderte von Anfragen gleichzeitig bedient werden. Unsere Zahl bezieht sich auf eine Person, die mit dem Modell spricht, eine Anfrage zur Zeit - die Zahl, die tatsächlich das Ausführen eines Modells lokal beschreibt. Die beiden sind nicht vergleichbar.
Was bedeutet es, wenn ein Modell auf einer GPU "passt"?
Dass die Gewichte des Modells, sein Gesprächs-Cache und der eigene Overhead der Laufzeit alle in den nutzbaren Speicher der Karte bei einer gegebenen Quantisierung passen. Ein Modell kann eng passen, komfortabel oder gar nicht — wir zeigen, welches, zusammen mit wie viel Spielraum noch bleibt.
Was ist Quantisierung, und warum beeinflusst sie, ob etwas passt?
Quantisierung komprimiert die Gewichte eines Modells, um VRAM zu sparen, bei geringem Verlust der Ausgabequalität. Ein Modell, das bei voller Präzision nicht passt, passt oft komfortabel bei einer niedrigeren Quantisierung — wir berichten immer die beste Qualität, die auf einer bestimmten Karte passt.
Welche GPUs decken Sie ab?
Tausende von CARDS von NVIDIA, AMD, Intel und Apple Silicon, von Datenzentrum-Beschleunigern bis hin zu Konsumenten-CARDS. Die Abdeckung und Schätzvertrauen sind am besten auf moderner NVIDIA-Hardware, wo die zugrunde liegenden Inferenz-ENGINES am ausgereiftesten sind.
Ist gputps.com kostenlos zu nutzen?
Ja — das Durchsuchen von GPUs, Modellen und jeder Schätzung auf der Seite ist kostenlos, ohne dass ein Konto erforderlich ist.
Wie liste ich eine GPU zum Verkauf?
Registrieren Sie ein kostenloses Anbieter-Konto und fügen Sie Ihre Angebote hinzu — diese erscheinen direkt auf der Seite der passenden Karte. Weitere Informationen zur Funktionsweise und zu den aktuellen Preisen finden Sie auf der Seite "Anbieter werden".
Immer noch suchen
Kannst du nicht finden, wonach du suchst?
Haben Sie eine falsche Zahl gefunden, fehlt eine GPU oder haben Sie einen Vorschlag? Wir würden gerne davon hören..
Die Methode
Wie die Schätzungen erstellt werden
Spezifikationen sagen Ihnen, was eine GPU ist. Sie sagen Ihnen nicht, was sie mit einem Sprachmodell macht. Das ist die Lücke, die wir mit dieser Seite schließen wollten..