Speichergebundene Durchsatz, live berechnet
Kann deine GPU dieses AI-Modell ausführen? Der GPU TPS-Rechner
Wählen Sie eine Grafikkarte oder ein Sprachmodell aus und wir berechnen — live, nicht aus einer Nachschlagetabelle — ob es passt, mit welcher Kompression und grob wie viele TPS pro Sekunde zu erwarten sind..
Live-Schätzung
EintragFormat
Q8_0
Kontext
13k
Vertrauen
high
Beispielhafte Arbeiten
Schau dir diese leistungsstarken Kombinationen an.
Einige Kombinationen, auf die wir einem Freund hinweisen würden, bei unterschiedlichen Budgets.
Die große Junge Einrichtung
32 GB01
Vergleichen Sie GPUs
VRAM, Speicherbandbreite, Tensor-Kerne und FP16-Durchsatz nebeneinander.
02
Schätzen Sie Token pro Sekunde
Die Decodierungsgeschwindigkeit ist durch die Speicherbandbreite begrenzt, daher modellieren wir sie eher, als die Spitzen-TFLOPS anzugeben..
03
Überprüfen Sie, was passt
Welche Modelle laufen auf einer Karte, mit welcher Quantisierung und mit wie viel Kontext.
Das Problem
Warum "wird meine GPU das ausführen?" eine schwierige Frage ist
Ein Datenblatt gibt Ihnen den Speicher einer Karte und ihre Taktrate an. Es sagt Ihnen nicht, ob ein spezifisches Sprachmodell in diesen Speicher passt, sobald es komprimiert ist, wie viel von der Karte für das Gespräch selbst übrig bleibt oder wie viele Token pro Sekunde tatsächlich am anderen Ende herauskommen — und diese drei Fragen haben nicht für jedes beliebige Paar aus GPU und Modell die gleiche Antwort.
Die ehrliche Version dieser Berechnung bezieht sich auf die Anzahl der Parameter und die Architektur des Modells, das Komprimierungsformat, in dem es gespeichert ist, die Speicherbandbreite der Karte und wie ausgereift die Inferenzsoftware ist sowie die Länge des Gesprächs, das Sie mit ihm führen möchten. Wenn Sie einen dieser Punkte falsch haben, sieht die herauskommende Zahl ebenso überzeugend aus und ist einfach falsch.
Wir geben nicht vor, dass dies eine einzige präzise Zahl erzeugt, denn das kann es nicht. Stattdessen führen wir die vollständige Berechnung für jede Karte und jedes Modell, für das wir Daten haben, durch, veröffentlichen das Ergebnis als einen Bereich anstatt als einen falschen präzisen Punktwert und zeigen unsere Arbeit — jede Formel hinter jeder Zahl auf dieser Seite ist offen niedergeschrieben, nicht hinter der Antwort verborgen.
Was Ihnen diese Seite tatsächlich bietet
Das umfassendste Dataset, das wir zusammenstellen konnten: Tausende von Grafikkarten und Tausende von Sprachmodellen, die gegeneinander überprüft wurden, anstatt sie einzeln zu betrachten. Beginnen Sie mit einer Karte, die Sie besitzen oder in Betracht ziehen, und sehen Sie jedes Modell, das darauf passt. Beginnen Sie mit einem Modell, das Sie ausführen möchten, und sehen Sie jede Karte, die es halten kann.
Das funktioniert in beide Richtungen, weil die zugrunde liegende Berechnung symmetrisch ist - die gleiche Speicher- und Bandbreitenarithmetik, ausgeführt von welcher Seite auch immer, die Sie bereits kennen. Keine der beiden Richtungen ist die "echte"; sie sind die gleiche Antwort, die auf zwei verschiedene Arten gestellt wird.
Erfahren Sie mehr darüber, wie und warum auf unserer Über Seite.
Neu veröffentlicht
Schau dir diese leistungsstarken neuen Modelle an
Durchsuchen Sie alle AI-ModelleNeu veröffentlicht
Schau dir diese leistungsstarken neuen GPUs an.
Durchsuche alle GPUsNVIDIA
Oct 2025
Beide Richtungen
Wie der Rechner funktioniert
Die gleiche Berechnung, nutzbar von welcher Seite der Frage auch immer Sie starten..
Ausgehend von einer GPU, die Sie besitzen
- 01 Finde deine Grafikkarte . Durchsuchen Sie das GPU-Katalog nach der Karte, die Sie besitzen oder in Betracht ziehen, nach Name oder nach Speicherkapazität.
- 02 Öffne seine Seite . Jede Karte hat ihre eigene Seite, die jedes Sprachmodell auflistet, gegen das wir es bewerten können, mit einer geschätzten TPS-Zahl für jedes Modell.
- 03 Setzen Sie Ihre Kontextlänge und Qualitätsboden . Passen Sie die Gesprächslänge an, die Sie erwarten zu arbeiten, und die niedrigste Kompression, die Sie akzeptieren werden. Beide ändern die Antwort live.
- 04 Lies den Bereich, nicht eine einzelne Zahl . Jede Schätzung wird mit einem Vertrauensbereich veröffentlicht, anstatt mit einer falschen Präzisionszahl, da dieselbe Karte und das Modell zwischen Inferenzeinheiten auf eine Weise variieren, die kein Spezifikationsblatt vorhersagt.
Ausgehend von einem Modell, das Sie ausführen möchten
- 01 Finde das Modell . Durchsuchen Sie den AI-Modellkatalog nach Name oder Größe — selbst wenn der Name selbst die Parameteranzahl nicht angibt.
- 02 Öffne seine Seite . Ein Modell mit offenen Gewichten listet jede Grafikkarte auf, gegen die wir es bewerten können, die kleinste, die passt, und die schnellste zuerst.
- 03 Setzen Sie Ihre Kontextlänge und Qualitätsboden . Die gleichen beiden Kontrollen wie der GPU-erste Pfad — ein längeres Gespräch benötigt mehr Speicher, was eine Karte von "passt" zu "passt nicht" bringen kann.
- 04 Vergleiche Karten nach dem, was du tatsächlich bemerkst. . Der Speicher entscheidet, ob es überhaupt läuft; die Bandbreite entscheidet, wie schnell es sich anfühlt, sobald es läuft. Die Tabelle sortiert standardmäßig nach TPS, da dies normalerweise das ist, was zählt.
Antworten
Häufige Fragen
Wie berechne ich, ob meine GPU ein lokales LLM ausführen kann?
Finde deine Karte im GPU-Katalog und öffne ihre Seite — dort sind alle Modelle aufgelistet, die wir dagegen bewerten können, ob jedes in den Speicher passt, und eine geschätzte TPS-Zahl. Du kannst auch von einem Modell starten und sehen, welche Karten es ausführen können, was die gleiche Berechnung aus der entgegengesetzten Richtung ist.
Kann meine GPU überhaupt lokale LLM-Modelle ausführen?
Wenn es mindestens ein paar Gigabyte eigenen Speicher hat, dann ist es fast sicher etwas. Integrierte Grafiken, die den Systemspeicher teilen, sind die Hauptausnahme, da sie keinen dedizierten Pool haben, um ein Modell zu halten. Darüber hinaus ist es eine Frage, welches Modell, bei welcher Kompression - nicht ja oder nein.
Was bestimmt Tokens pro Sekunde auf einer GPU?
Das Generieren eines Tokens bedeutet, die Gewichte des Modells einmal aus dem Speicher zu lesen, sodass die Geschwindigkeit durch die Speicherbandbreite geteilt durch die Menge, die pro Token gelesen werden muss, begrenzt ist – was von der Größe des Modells, seiner Architektur und dem Kompressionsformat abhängt, in dem es gespeichert ist. Taktrate und Kernanzahl, die Zahlen, mit denen ein Datenblatt wirbt, spielen kaum eine Rolle.
Wie genau sind die Schätzungen auf dieser Seite?
Erwarten Sie, dass die echte Zahl innerhalb von ungefähr 20–40% der Schätzung liegt. Die gleiche GPU und das Modell variieren so sehr zwischen Inferenz-Engines, Engine-Versionen und Bereitstellungskonfigurationen — keine Berechnung nur aus den Spezifikationen kann das vorhersagen, weshalb jede Zahl hier als Bereich veröffentlicht wird.
Ist eine größere, neuere GPU immer schneller für KI?
Für ein Modell, das bereits bequem auf beiden Karten passt, entscheidet die Speicherbandbreite über den Gewinner, und eine neuere Karte hat normalerweise mehr davon. Aber der häufigere Engpass ist die Kapazität, nicht die Geschwindigkeit — die nützlichere Frage für eine bestimmte Karte ist normalerweise "was ist das größte Modell, das passt", was jede Karte direkt auf ihrer Seite beantwortet.
Muss ich Quantisierung verstehen, um diese Seite zu nutzen?
Nein — jede Karte und Modellseite wählt automatisch die bestmögliche Kompression, die tatsächlich passt. Quantisierung ist die Technik, die den Speicherbedarf eines Modells bei geringem Aufwand für die Ausgabequalität verkleinert, und Sie können selbst eine Qualitätsuntergrenze festlegen, wenn Sie möchten, aber es ist nichts erforderlich.
Wo kommen die GPU und AI Modell Datensätze her?
Grafikkarten-spezifikationen und Sprachmodell-Aufzeichnungen, die Tausende von Open-Weight-Modellen und deren Parameteranzahlen, Lizenzen und Veröffentlichungsdaten abdecken. Beide werden aktualisiert, wenn neue Hardware und Modelle veröffentlicht werden – siehe die GPU- und AI-Modellkataloge für eine vollständige Abdeckung.
Hardware verkaufen
Interessiert daran, ein Anbieter zu werden?
Liste deine GPUs zum Verkauf gleich neben der Antwort, was sie tatsächlich ausführen können..
Bald erhältlich
Erhalte Benachrichtigungen über neue GPUs und Modelle
Ein Newsletter kommt bald.
Erforschen Sie weiter
Durchsuchen Sie den vollständigen GPU-Katalog oder Durchsuchen Sie den vollständigen AI-Modellkatalog. Hardware kaufen? Überprüfen Sie das Anbieterverzeichnis. Mehr Fragen werden auf unserem FAQ-Seite, oder Kontaktieren Sie uns direkt.