Speichergebundener Durchsatz, live berechnet
Kann Ihre GPU dieses Modell ausführen? Der GPU TPS-Rechner
Wählen Sie eine Grafikkarte oder ein Sprachmodell und wir berechnen – live, nicht aus einer Lookup-Tabelle – ob es passt, mit welcher Kompression und grob wie viele Tokens pro Sekunde zu erwarten sind..
Live-Schätzung
Ein Modell passt nicht in den GPU VRAM.
Q8_0
Modell/Modelle können die GPU ausführen. Passt nicht / wird nicht passen. Eng = kaum ausführbar, komfortabel = läuft problemlos mit Spielraum.
13k
Vertrauen
high
Modelle passen nicht / werden nicht passen.
Schau dir diese leistungsstarken Kombinationen an
Einige Kombinationen, die wir einem Freund bei unterschiedlichen Budgets empfehlen würden..
Der Einstiegspunkt
12 GBDer Mittelweg
16 GBDie große Jungs-Ausrüstung
32 GB01
Vergleiche GPUs
VRAM, Speichermenge, Tensor-Kerne und FP16-Durchsatz nebeneinander.
02
Schätzen Sie TPS
Die Dekodiergeschwindigkeit ist durch die Speicherbandbreite begrenzt, daher modellieren wir sie anstatt Spitzen-TFLOPS zu zitieren..
03
Überprüfen, was passt
Welche Modelle laufen auf einer Karte, mit welcher Quantisierung und mit wie viel Kontext?.
Das Problem
Warum "wird meine GPU das ausführen?" eine schwierige Frage ist
Ein Spezifikationsblatt sagt Ihnen den Speicher und die Taktrate einer Karte. Es sagt Ihnen nicht, ob ein bestimmtes Sprachmodell in diesen Speicher passt, wenn es komprimiert ist, wie viel von der Karte für das Gespräch selbst übrig bleibt oder wie viele Tokens pro Sekunde tatsächlich am anderen Ende herauskommen - und diese drei Fragen haben nicht die gleiche Antwort für beliebige zwei GPU-und-Modell-Paare.
Die ehrliche Version dieser Berechnung zieht die Anzahl der Parameter und die Architektur des Modells, das Komprimierungsformat, in dem es gespeichert ist, die Speicherbandbreite der Karte und wie ausgereift seine Inference-Software ist, sowie die Länge des Gesprächs, das Sie mit ihm führen möchten, heran. Wenn Sie auch nur eines dieser Elemente falsch haben, sieht die Zahl, die herauskommt, genauso sicher aus und ist einfach falsch.
Wir geben nicht vor, dass dies eine einzelne präzise Zahl erzeugt, weil es das nicht kann. Was wir stattdessen tun, ist die vollständige Berechnung für jede Karte und jedes Modell, für das wir Daten haben, durchzuführen, das Ergebnis als Bereich zu veröffentlichen, anstatt einen falschen Präzisionswert, und unsere Arbeit zu zeigen — jede Formel hinter jeder Zahl auf dieser Seite ist offen geschrieben, nicht versteckt hinter der Antwort.
Was Ihnen diese Seite tatsächlich bietet
Das vollständigste Dataset, das wir zusammenstellen konnten: Tausende von Grafikkarten und Tausende von Sprachmodellen, die miteinander abgeglichen wurden, anstatt sie einzeln zu betrachten. Beginnen Sie mit einer Karte, die Sie besitzen oder in Betracht ziehen, und sehen Sie jedes Modell, das darauf passt. Beginnen Sie mit einem Modell, das Sie ausführen möchten, und sehen Sie jede Karte, die es halten kann.
Das funktioniert in beide Richtungen, da die zugrunde liegende Berechnung symmetrisch ist – die gleiche Speicher- und Bandbreitenarithmetik, von welcher Seite auch immer du bereits weißt. Keine Richtung ist die „echte“; sie sind dieselbe Antwort, die auf zwei verschiedene Arten gefragt wird.
Mehr erfahren über wie und warum auf unserer Über Seite.
Neu veröffentlicht
Schau dir diese leistungsstarken neuen GPUs an
Durchsuche alle GPUsNVIDIA
Oct 2025
AMD
Sep 2025
Beide Richtungen
Wie der Rechner funktioniert
Die gleiche Berechnung, die von welcher Seite der Frage auch immer genutzt werden kann..
Beginnend mit einer GPU, die Sie besitzen
- 01 Finde deine Grafikkarte. Durchsuchen Sie den GPU-Katalog nach der Karte, die Sie besitzen oder in Betracht ziehen, nach Name oder nach Speicherkapazität.
- 02 Öffne seine Seite. Jede Karte hat ihre eigene Seite, die jedes Sprachmodell auflistet, das wir dagegen bewerten können, mit einer geschätzten TPS-Zahl für jedes.
- 03 Setze deine Kontextlänge und Qualitätsgrenze.. Passen Sie die erwartete Gesprächslänge an und die niedrigste Kompression, die Sie akzeptieren. Beide ändern die Antwort live.
- 04 Lese den Bereich, nicht eine einzige Zahl.. Jede Schätzung wird mit einem Vertrauensbereich veröffentlicht, anstatt mit einer falschen Präzisionszahl, da dieselbe Karte und das Modell zwischen Inferenz-Engines auf Weisen variieren, die kein Datenblatt vorhersagt.
Beginnen Sie mit einem Modell, das Sie ausführen möchten.
- 01 Finde das Modell. Durchsuchen Sie den KI-Modellkatalog nach Namen oder nach Größe – auch wenn der Name selbst die Parameteranzahl nicht angibt.
- 02 Öffne seine Seite. Ein Modell mit offenen Gewichten listet jede Grafikkarte auf, gegen die wir es bewerten können, die kleinste, die passt, und die schnellste zuerst.
- 03 Setze deine Kontextlänge und Qualitätsgrenze.. Die gleichen zwei Steuerelemente wie der GPU-erste Pfad – ein längeres Gespräch benötigt mehr Speicher, was eine Karte von "passt" zu "passt nicht" bringen kann.
- 04 Vergleiche Karten anhand dessen, was du tatsächlich bemerken wirst. Speicher entscheidet, ob es überhaupt läuft; Bandbreite bestimmt, wie schnell es sich anfühlt, wenn es läuft. Die Tabelle sortiert standardmäßig nach Token pro Sekunde, da dies normalerweise der relevante Faktor ist.
Antworten
Häufige Fragen
Wie berechne ich, ob meine GPU ein lokales LLM ausführen kann?
Finde deine Karte im GPU-Katalog und öffne ihre Seite - sie zeigt jedes Modell, das wir dagegen bewerten können, ob jedes in den Speicher passt und eine geschätzte Tokens-pro-Sekunde-Zahl. Du kannst auch von einem Modell ausgehen und sehen, welche Karten es laufen können, was die gleiche Berechnung aus der anderen Richtung ist.
Kann meine GPU lokale LLM-Modelle überhaupt ausführen?
Wenn es mindestens ein paar Gigabyte eigenen Speicher hat, ist es fast sicher etwas. Integrierte Grafiken, die sich den Systemspeicher teilen, sind die Hauptausnahme, da sie keinen eigenen Pool haben, um ein Modell zu halten. Darüber hinaus ist es eine Frage, welches Modell, bei welcher Kompression — nicht ja oder nein.
Was bestimmt die TPS auf einer GPU?
Die Generierung eines Tokens bedeutet, das Gewicht des Modells einmal aus dem Speicher zu lesen, wobei die Geschwindigkeit durch die Speicherbandbreite begrenzt ist, geteilt durch das, was pro Token gelesen werden muss – was von der Größe des Modells, seiner Architektur und dem Komprimierungsformat abhängt, in dem es gespeichert ist. Taktgeschwindigkeit und Kernzahlen, die Zahlen, mit denen ein Datenblatt beginnt, spielen kaum eine Rolle.
Wie genau sind die Schätzungen auf dieser Seite?
Erwarten Sie, dass die tatsächliche Zahl innerhalb von ungefähr 20–40% der Schätzung liegt. Dasselbe GPU und Modell variieren so stark zwischen Inferenz-Engines, Engine-Versionen und Bereitstellungskonfigurationen — keine Berechnung aus technischen Daten allein kann das vorhersagen, weshalb jede Zahl hier als Bereich veröffentlicht wird.
Ist eine größere, neuere GPU immer schneller für KI?
Für ein Modell, das bereits bequem auf beiden Karten passt, entscheidet die Speichermobilität über den Gewinner, und eine neuere Karte hat normalerweise mehr davon. Aber das häufigere Engpass ist die Kapazität, nicht die Geschwindigkeit — die nützlichere Frage für eine spezifische Karte ist normalerweise "Was ist das größte Modell, das passt?", was die Seite jeder Karte direkt beantwortet.
Muss ich Quantisierung verstehen, um diese Seite zu nutzen?
Nein — jede Karte und Modellseite wählt automatisch die bestmögliche Kompression, die tatsächlich passt. Quantisierung ist die Technik, die den Speicherbedarf eines Modells mit nur geringem Verlust an Ausgabequalität verringert, und Sie können selbst einen Qualitätsboden festlegen, wenn Sie möchten, aber nichts verlangt das.
Woher kommen die Datensätze für die GPU und die AI-Modelle?
Spezifikationen von Grafikkarten und Aufzeichnungen von Sprachmodellen, die Tausende von Open-Weight-Modellen und deren Parameterzahlen, Lizenzen und Veröffentlichungsdaten abdecken. Beide werden aktualisiert, wenn neue Hardware und Modelle veröffentlicht werden – sehen Sie sich die Kataloge von GPU und AI-Modellen für die vollständige Abdeckung an.
Hardware verkaufen
Interessiert daran, ein Anbieter zu werden?
Liste deiner zum Verkauf stehenden GPUs direkt neben der Antwort, was sie tatsächlich ausführen können..
Bald verfügbar
Erhalte Benachrichtigungen über neue GPUs und Modelle
Ein Newsletter kommt bald..
Erforschen Sie weiter
Durchsuche den vollständigen GPU-Katalog modells / modelle läuft / laufen passt nicht / wird nicht passen eng = kaum ausführbar, komfortabel = läuft leicht mit Spielraum. durchsuchen Sie den gesamten AI-Modellkatalog. Hardware kaufen? überprüfen Sie das Anbieterverzeichnis. FAQ-Seite, modells / modelle läuft / laufen passt nicht / wird nicht passen eng = kaum ausführbar, komfortabel = läuft leicht mit Spielraum. kontaktieren Sie uns .