Speichergebundene Durchsatz, live berechnet

Kann deine GPU dieses AI-Modell ausführen? Der GPU TPS-Rechner

Wählen Sie eine Grafikkarte oder ein Sprachmodell aus und wir berechnen — live, nicht aus einer Nachschlagetabelle — ob es passt, mit welcher Kompression und grob wie viele TPS pro Sekunde zu erwarten sind..

Jedes Paar auf Anfrage berechnet. Veröffentlicht als eine Reihe Formeln im Freien

Live-Schätzung

Eintrag
Qwen3-8B
18.6 tok/s
15.8 erwarteter Bereich 22.3

Format

Q8_0

Kontext

13k

Vertrauen

high

Beispielhafte Arbeiten

Schau dir diese leistungsstarken Kombinationen an.

Einige Kombinationen, auf die wir einem Freund hinweisen würden, bei unterschiedlichen Budgets.

Der Einstiegspunkt

12 GB
GeForce RTX 3060 12 GB
Qwen3-8B
18.6 tok/s
15.8 22.3
Q8_0 13k Kontext

Der Mittelweg

16 GB
GeForce RTX 4080
Qwen3-14B
29.8 tok/s
25.3 35.8
Q6_K 15k Kontext

Die große Junge Einrichtung

32 GB
GeForce RTX 5090
40.8 tok/s
24.5 65.3
Q6_K 35k Kontext

01

Vergleichen Sie GPUs

VRAM, Speicherbandbreite, Tensor-Kerne und FP16-Durchsatz nebeneinander.

02

Schätzen Sie Token pro Sekunde

Die Decodierungsgeschwindigkeit ist durch die Speicherbandbreite begrenzt, daher modellieren wir sie eher, als die Spitzen-TFLOPS anzugeben..

03

Überprüfen Sie, was passt

Welche Modelle laufen auf einer Karte, mit welcher Quantisierung und mit wie viel Kontext.

Das Problem

Warum "wird meine GPU das ausführen?" eine schwierige Frage ist

Ein Datenblatt gibt Ihnen den Speicher einer Karte und ihre Taktrate an. Es sagt Ihnen nicht, ob ein spezifisches Sprachmodell in diesen Speicher passt, sobald es komprimiert ist, wie viel von der Karte für das Gespräch selbst übrig bleibt oder wie viele Token pro Sekunde tatsächlich am anderen Ende herauskommen — und diese drei Fragen haben nicht für jedes beliebige Paar aus GPU und Modell die gleiche Antwort.

Die ehrliche Version dieser Berechnung bezieht sich auf die Anzahl der Parameter und die Architektur des Modells, das Komprimierungsformat, in dem es gespeichert ist, die Speicherbandbreite der Karte und wie ausgereift die Inferenzsoftware ist sowie die Länge des Gesprächs, das Sie mit ihm führen möchten. Wenn Sie einen dieser Punkte falsch haben, sieht die herauskommende Zahl ebenso überzeugend aus und ist einfach falsch.

Wir geben nicht vor, dass dies eine einzige präzise Zahl erzeugt, denn das kann es nicht. Stattdessen führen wir die vollständige Berechnung für jede Karte und jedes Modell, für das wir Daten haben, durch, veröffentlichen das Ergebnis als einen Bereich anstatt als einen falschen präzisen Punktwert und zeigen unsere Arbeit — jede Formel hinter jeder Zahl auf dieser Seite ist offen niedergeschrieben, nicht hinter der Antwort verborgen.

Was Ihnen diese Seite tatsächlich bietet

Das umfassendste Dataset, das wir zusammenstellen konnten: Tausende von Grafikkarten und Tausende von Sprachmodellen, die gegeneinander überprüft wurden, anstatt sie einzeln zu betrachten. Beginnen Sie mit einer Karte, die Sie besitzen oder in Betracht ziehen, und sehen Sie jedes Modell, das darauf passt. Beginnen Sie mit einem Modell, das Sie ausführen möchten, und sehen Sie jede Karte, die es halten kann.

Das funktioniert in beide Richtungen, weil die zugrunde liegende Berechnung symmetrisch ist - die gleiche Speicher- und Bandbreitenarithmetik, ausgeführt von welcher Seite auch immer, die Sie bereits kennen. Keine der beiden Richtungen ist die "echte"; sie sind die gleiche Antwort, die auf zwei verschiedene Arten gestellt wird.

Erfahren Sie mehr darüber, wie und warum auf unserer Über Seite.

Neu veröffentlicht

Schau dir diese leistungsstarken neuen Modelle an

Durchsuchen Sie alle AI-Modelle

NVIDIA

Jun 2026

Nemotron 3 Ultra
550B Parameter

Kompatible GPU

B300

Prime Intellect,Arcee AI

Feb 2026

Arcee Trinity Large
398B Parameter

Kompatible GPU

B300

Alibaba

Feb 2026

Qwen3.5 397B-A17B
397B Parameter

Kompatible GPU

B300

Neu veröffentlicht

Schau dir diese leistungsstarken neuen GPUs an.

Durchsuche alle GPUs

NVIDIA

Oct 2025

Kraftvoll genug, um zu laufen

Laguna S 2.1 · 118B

NVIDIA

Oct 2025

GB10
128 GB Speicher

Kraftvoll genug, um zu laufen

Solar Open2 250B · 250.3B

AMD

Sep 2025

Radeon PRO W7900D
48 GB Speicher

Kraftvoll genug, um zu laufen

Qwen3-Coder-Next · 80B

Beide Richtungen

Wie der Rechner funktioniert

Die gleiche Berechnung, nutzbar von welcher Seite der Frage auch immer Sie starten..

Ausgehend von einer GPU, die Sie besitzen

  1. 01 Finde deine Grafikkarte . Durchsuchen Sie das GPU-Katalog nach der Karte, die Sie besitzen oder in Betracht ziehen, nach Name oder nach Speicherkapazität.
  2. 02 Öffne seine Seite . Jede Karte hat ihre eigene Seite, die jedes Sprachmodell auflistet, gegen das wir es bewerten können, mit einer geschätzten TPS-Zahl für jedes Modell.
  3. 03 Setzen Sie Ihre Kontextlänge und Qualitätsboden . Passen Sie die Gesprächslänge an, die Sie erwarten zu arbeiten, und die niedrigste Kompression, die Sie akzeptieren werden. Beide ändern die Antwort live.
  4. 04 Lies den Bereich, nicht eine einzelne Zahl . Jede Schätzung wird mit einem Vertrauensbereich veröffentlicht, anstatt mit einer falschen Präzisionszahl, da dieselbe Karte und das Modell zwischen Inferenzeinheiten auf eine Weise variieren, die kein Spezifikationsblatt vorhersagt.

Ausgehend von einem Modell, das Sie ausführen möchten

  1. 01 Finde das Modell . Durchsuchen Sie den AI-Modellkatalog nach Name oder Größe — selbst wenn der Name selbst die Parameteranzahl nicht angibt.
  2. 02 Öffne seine Seite . Ein Modell mit offenen Gewichten listet jede Grafikkarte auf, gegen die wir es bewerten können, die kleinste, die passt, und die schnellste zuerst.
  3. 03 Setzen Sie Ihre Kontextlänge und Qualitätsboden . Die gleichen beiden Kontrollen wie der GPU-erste Pfad — ein längeres Gespräch benötigt mehr Speicher, was eine Karte von "passt" zu "passt nicht" bringen kann.
  4. 04 Vergleiche Karten nach dem, was du tatsächlich bemerkst. . Der Speicher entscheidet, ob es überhaupt läuft; die Bandbreite entscheidet, wie schnell es sich anfühlt, sobald es läuft. Die Tabelle sortiert standardmäßig nach TPS, da dies normalerweise das ist, was zählt.

Antworten

Häufige Fragen

01

Wie berechne ich, ob meine GPU ein lokales LLM ausführen kann?

Finde deine Karte im GPU-Katalog und öffne ihre Seite — dort sind alle Modelle aufgelistet, die wir dagegen bewerten können, ob jedes in den Speicher passt, und eine geschätzte TPS-Zahl. Du kannst auch von einem Modell starten und sehen, welche Karten es ausführen können, was die gleiche Berechnung aus der entgegengesetzten Richtung ist.

02

Kann meine GPU überhaupt lokale LLM-Modelle ausführen?

Wenn es mindestens ein paar Gigabyte eigenen Speicher hat, dann ist es fast sicher etwas. Integrierte Grafiken, die den Systemspeicher teilen, sind die Hauptausnahme, da sie keinen dedizierten Pool haben, um ein Modell zu halten. Darüber hinaus ist es eine Frage, welches Modell, bei welcher Kompression - nicht ja oder nein.

03

Was bestimmt Tokens pro Sekunde auf einer GPU?

Das Generieren eines Tokens bedeutet, die Gewichte des Modells einmal aus dem Speicher zu lesen, sodass die Geschwindigkeit durch die Speicherbandbreite geteilt durch die Menge, die pro Token gelesen werden muss, begrenzt ist – was von der Größe des Modells, seiner Architektur und dem Kompressionsformat abhängt, in dem es gespeichert ist. Taktrate und Kernanzahl, die Zahlen, mit denen ein Datenblatt wirbt, spielen kaum eine Rolle.

04

Wie genau sind die Schätzungen auf dieser Seite?

Erwarten Sie, dass die echte Zahl innerhalb von ungefähr 20–40% der Schätzung liegt. Die gleiche GPU und das Modell variieren so sehr zwischen Inferenz-Engines, Engine-Versionen und Bereitstellungskonfigurationen — keine Berechnung nur aus den Spezifikationen kann das vorhersagen, weshalb jede Zahl hier als Bereich veröffentlicht wird.

05

Ist eine größere, neuere GPU immer schneller für KI?

Für ein Modell, das bereits bequem auf beiden Karten passt, entscheidet die Speicherbandbreite über den Gewinner, und eine neuere Karte hat normalerweise mehr davon. Aber der häufigere Engpass ist die Kapazität, nicht die Geschwindigkeit — die nützlichere Frage für eine bestimmte Karte ist normalerweise "was ist das größte Modell, das passt", was jede Karte direkt auf ihrer Seite beantwortet.

06

Muss ich Quantisierung verstehen, um diese Seite zu nutzen?

Nein — jede Karte und Modellseite wählt automatisch die bestmögliche Kompression, die tatsächlich passt. Quantisierung ist die Technik, die den Speicherbedarf eines Modells bei geringem Aufwand für die Ausgabequalität verkleinert, und Sie können selbst eine Qualitätsuntergrenze festlegen, wenn Sie möchten, aber es ist nichts erforderlich.

07

Wo kommen die GPU und AI Modell Datensätze her?

Grafikkarten-spezifikationen und Sprachmodell-Aufzeichnungen, die Tausende von Open-Weight-Modellen und deren Parameteranzahlen, Lizenzen und Veröffentlichungsdaten abdecken. Beide werden aktualisiert, wenn neue Hardware und Modelle veröffentlicht werden – siehe die GPU- und AI-Modellkataloge für eine vollständige Abdeckung.

Hardware verkaufen

Interessiert daran, ein Anbieter zu werden?

Liste deine GPUs zum Verkauf gleich neben der Antwort, was sie tatsächlich ausführen können..

Bald erhältlich

Erhalte Benachrichtigungen über neue GPUs und Modelle

Ein Newsletter kommt bald.

Bald erhältlich