Der Katalog

GPU TPS Rechner

Ermitteln Sie, wie viele Token pro Sekunde eine Grafikkarte bei einem lokalen AI-Modell produziert. Filtern Sie den untenstehenden Katalog nach den Karten, die es wert sind, in Betracht gezogen zu werden, und öffnen Sie dann eine, um jedes Sprachmodell zu sehen, das sie ausführen kann, wie viel Speicher jedes benötigt und wie schnell es wahrscheinlich ist..

818

Karten auf Datei

4

Hersteller

4 GB – 288 GB

Speicherbereich

8,190 GB/s

höchste Bandbreite

Jedes Wort muss etwas matchen, sodass mehr Wörter die Liste eingrenzen. Eine Kapazität wie 24GB passt im Speicher der Karte, obwohl keine Spalte es als Text speichert..

818 Karten passen

Aktualisieren
Speichertype Leistung
B300 NVIDIA · Blackwell Ultra 288 GB 8,000 GB/s 2.03 GHz 1.67 GHz Sep 2025 HBM3e 1,400 W
Radeon Instinct MI350X AMD · CDNA 4.0 288 GB 8,190 GB/s 2.2 GHz 1 GHz Jan 2025 HBM3e 1,000 W
Radeon Instinct MI355X AMD · CDNA 4.0 288 GB 8,190 GB/s 2.4 GHz 1 GHz Jan 2025 HBM3e 1,400 W
Radeon Instinct MI325X AMD · CDNA 3.0 256 GB 6,000 GB/s 2.1 GHz 1 GHz Oct 2024 HBM3e 1,000 W
Radeon Instinct MI300X AMD · CDNA 3.0 192 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
Radeon Instinct MI308X AMD · CDNA 3.0 192 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
B200 NVIDIA · Blackwell 180 GB 8,000 GB/s 1.97 GHz 700 MHz Jan 2024 HBM3e 1,000 W
H200 NVL NVIDIA · Hopper 141 GB 4,890 GB/s 1.79 GHz 1.37 GHz Nov 2024 HBM3e 600 W
H200 SXM 141 GB NVIDIA · Hopper 141 GB 4,890 GB/s 1.98 GHz 1.5 GHz Nov 2024 HBM3e 700 W
Data Center GPU Max 1550 Intel · Generation 12.5 128 GB 3,280 GB/s 1.6 GHz 900 MHz Jan 2023 HBM2e 600 W
Data Center GPU Max Subsystem Intel · Generation 12.5 128 GB 3,210 GB/s 1.6 GHz 900 MHz Jan 2023 HBM2e 2,400 W
GB10 NVIDIA · Blackwell 2.0 128 GB 273 GB/s 2.42 GHz 1.67 GHz Oct 2025 LPDDR5X 140 W
Jetson T5000 NVIDIA · Blackwell 128 GB 273 GB/s 2.53 GHz 1.67 GHz Aug 2025 LPDDR5X 40 W
Radeon Instinct MI250 AMD · CDNA 2.0 128 GB 3,280 GB/s 1.7 GHz 1 GHz Nov 2021 HBM2e 500 W
Radeon Instinct MI250X AMD · CDNA 2.0 128 GB 3,280 GB/s 1.7 GHz 1 GHz Nov 2021 HBM2e 500 W
Radeon Instinct MI300 AMD · CDNA 3.0 128 GB 6,550 GB/s 1.7 GHz 1 GHz Jan 2023 HBM3 600 W
Radeon Instinct MI300A AMD · CDNA 3.0 128 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
Data Center GPU Max 1350 Intel · Generation 12.5 96 GB 2,460 GB/s 1.55 GHz 750 MHz Jan 2023 HBM2e 450 W
H100 PCIe 96 GB NVIDIA · Hopper 96 GB 3,360 GB/s 1.84 GHz 1.67 GHz Mar 2023 HBM3 700 W
H100 SXM5 96 GB NVIDIA · Hopper 96 GB 3,360 GB/s 1.98 GHz 1.35 GHz Mar 2023 HBM3 700 W
RTX PRO 6000 Blackwell NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.62 GHz 1.59 GHz Mar 2025 GDDR7 600 W
RTX PRO 6000 Blackwell Max-Q NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.28 GHz 1.04 GHz Mar 2025 GDDR7 300 W
RTX PRO 6000 Blackwell Server NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.62 GHz 1.59 GHz Mar 2025 GDDR7 600 W
RTX PRO 6000D Blackwell Max-Q NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.29 GHz 1.59 GHz Mar 2025 GDDR7 300 W
H100 NVL 94 GB NVIDIA · Hopper 94 GB 3,940 GB/s 1.79 GHz 1.08 GHz Mar 2023 HBM3 400 W
H100 SXM5 94 GB NVIDIA · Hopper 94 GB 3,360 GB/s 1.98 GHz 1.35 GHz Mar 2023 HBM3 700 W
RTX 6000D NVIDIA · Blackwell 2.0 84 GB 1,570 GB/s 2.43 GHz 1.59 GHz Mar 2025 GDDR7 600 W
A100 PCIe 80 GB NVIDIA · Ampere 80 GB 1,940 GB/s 1.41 GHz 1.07 GHz Jun 2021 HBM2e 300 W
A100 SXM4 80 GB NVIDIA · Ampere 80 GB 2,040 GB/s 1.41 GHz 1.28 GHz Nov 2020 HBM2e 400 W
A100X NVIDIA · Ampere 80 GB 2,040 GB/s 1.44 GHz 795 MHz Jun 2021 HBM2e 300 W

Schritt für Schritt

Wie man die TPS Ihrer GPU berechnet

Nichts hier muss von Hand ausgearbeitet werden. Der obenstehende Katalog enthält bereits jede Karte, und jede Karten-Seite enthält bereits jedes Modell, das es mit einer TPS-Zahl ausführen kann. Zu deiner Antwort gelangen benötigt sechs Schritte.

  1. 01

    Eingrenzen Sie den Katalog auf Karten, die es wert sind, in Betracht gezogen zu werden.

    Verwenden Sie die Filter oben, um festzulegen, was Sie tatsächlich benötigen — eine minimale Speicherkapazität, einen Hersteller, eine Leistungsobergrenze, die Ihr Netzteil liefern kann, oder ein Veröffentlichungsjahr. Speicher ist der Filter, mit dem Sie beginnen sollten, da er entscheidet, welche Modelle überhaupt möglich sind.

  2. 02

    Oder suchen Sie nach einer Karte, die Sie bereits besitzen

    Geben Sie den Namen in das Suchfeld ein. Jedes Wort muss etwas übereinstimmen, sodass mehr Wörter die Liste eingrenzen, und eine Kapazität wie 24GB passt im Speicher der Karte, auch wenn keine Spalte es als Text speichert.

  3. 03

    Nach der Spezifikation sortieren, die Ihr Ergebnis bestimmt.

    Sortiere nach Speicher, wenn die Frage ist, welche Modelle passen, oder nach Bandbreite, wenn die Frage ist, wie schnell sie laufen werden. Taktraten und Kernanzahlen sind zur Vollständigkeit aufgeführt, beeinflussen jedoch kaum die Textgenerierung.

  4. 04

    Karte öffnen

    Jede Karte hat ihre eigene Seite, die jedes Sprachmodell auflistet, das sie ausführen kann, mit geschätzten Tokens pro Sekunde, dem Speicher, den jedes Modell benötigt, und der Kompression, mit der es läuft.

  5. 05

    Stellen Sie Ihre Kontextlänge und Mindestqualität ein

    Auf der Karten-Seite stellen Sie die Gesprächslänge ein, die Sie erwarten zu bearbeiten, und die niedrigste Kompression, die Sie akzeptieren wollen. Beides verändert die Antwort, anstatt sie zu filtern — ein längeres Gespräch benötigt mehr Speicher, was ein großes Modell vollständig von der Karte drängen kann.

  6. 06

    Lies die Spanne, nicht die einzelne Zahl

    Jede Durchsatzgröße wird mit einem Vertrauensbereich veröffentlicht. Nehmen Sie den Bereich als die Antwort: dieselbe Karte und das Modell variieren zwischen Inferenz-Engines und Versionen auf Weisen, die kein Datenblatt vorhersagt, und die Überschriftzahl ist nur die Mitte dieser Spreizung.

Was die Zahlen bedeuten

Was dieser Katalog ist

Dies ist eine Datenbank, die hält 818 Grafikkarten, gefiltert nach denen mit genügend MEMORY, um ein Sprachmodell überhaupt zu halten. Jede CARD hat ihre eigene Seite, und auf dieser Seite wurde jedes Modell, das wir verfolgen, dagegen bewertet — ob es passt, mit welcher Kompression und wie viele TOKENS pro Sekunde es wahrscheinlich produzieren wird.

Die Berechnung läuft, wenn Sie eine Karte öffnen, anstatt aus einer gespeicherten Tabelle nachgeschlagen zu werden, was es ermöglicht, dass die Kontextlänge und die minimale Qualität Dinge sind, die Sie festlegen, anstatt Dinge, die wir in Ihrem Namen angenommen haben. Ändern Sie entweder und jede Zahl wird neu berechnet.

Warum Tokens pro Sekunde die Zahl ist, die zählt

Das Ausführen eines Sprachmodells auf eigener Hardware wurde in kurzer Zeit zu einer gewöhnlichen Sache. Open-Weight-Modelle haben sich weit genug entwickelt, um wirklich nützlich zu sein, und die Tools, um sie auszuführen, erforderten nicht mehr unbedingt einen Forschungs-Hintergrund. Was nicht gleichzeitig kam, war eine klare Antwort auf die erste Frage, die jeder fragt: Wird es auf der Karte, die ich bereits habe, laufen, und wird es schnell genug sein, um es zu nutzen?

Spezifikationsblätter beantworten dies nicht. Sie sind für Grafikarbeitslasten geschrieben und beginnen mit den Zahlen, die die Bildraten bestimmen, die fast vollständig die falschen sind. Die zwei Zahlen, die tatsächlich das Ergebnis bestimmen, sind der Speicherplatz, der festlegt, ob ein Modell passt, und die Speicherbandbreite, die festlegt, wie schnell es einmal generiert wird, sobald es passt.

Tokens pro Sekunde ist die Zahl, die das Ergebnis in etwas ausdrückt, das du fühlen kannst. Die Lesegeschwindigkeit liegt irgendwo bei etwa zehn Tokens pro Sekunde, also kommt alles, was darüber liegt, schneller an, als du es lesen kannst, und alles, was weit darunter liegt, fühlt sich wie Warten an. Das ist die Zahl, die diese Seite berechnet, für jede Kombination aus Karte und Modell, die sie hält.

Was der Katalog abdeckt

Speicherbereich

4 GB – 288 GB

höchste Bandbreite

8,190 GB/s

Leistungsbereich

6 – 2,400 W

Der Speicher im Katalog beginnt bei 4 GB und erreicht 288 GB. Dieser Bereich ist der Unterschied zwischen einer Karte, die auf die kleinsten verwendbaren Modelle beschränkt ist, und einer, die Modelle hält, die keine Desktop-Maschine erreichen kann — die Kapazität ist eine harte Grenze und kein allmählicher Kompromiss, daher passt ein Modell entweder oder es läuft nicht.

Der Speicherbandbreite beginnt bei 10 GB/s und erreicht 8,190 GB/s, eine Figur gehalten von Radeon Instinct MI355X. Da die Generierung jedes Tokens bedeutet, das gesamte Modell einmal aus dem VRAM zu lesen, übersetzt sich diese Verbreitung nahezu direkt in eine Verbreitung der Generierungsgeschwindigkeit: eine Karte mit zehnmal der Bandbreite produziert Tokens ungefähr zehnmal schneller mit demselben Modell.

Karten im Katalog sind hergestellt von AMD, ATI, Intel and NVIDIA. Der Hersteller spielt eine größere Rolle, als er sollte: Die Inferenzsoftware hat dem CUDA-Pfad weitaus mehr Aufmerksamkeit geschenkt als jedem anderen, sodass eine AMD- oder Intel-Karte mit vergleichbarer Bandbreite im Allgemeinen einen kleineren Anteil an ihrem theoretischen Maximum erreicht. Unsere Schätzungen wenden eine Strafe dafür an, anstatt vorzugeben, dass die Hardware die einzige Variable ist.

Die Leistungsaufnahme beginnt bei 6 W und erreicht 2,400 W. Das obere Ende ist Rechenzentrumshardware, die ein Desktop-Netzteil nicht versorgen kann, und es ist das Hindernis, das die Menschen tendenziell zuletzt entdecken — nachdem die Karte ins Budget und das Gehäuse passt.

Veröffentlichungsdaten beginnen am 2009 und führe aus 2025, Der Katalog umfasst sowohl Hardware, die die Menschen noch besitzen, als auch Hardware, die sie möglicherweise kaufen möchten. Eine ältere CARD ist nicht ausgeschlossen, nur weil sie alt ist – wenn sie über den nötigen MEMORY verfügt, kann sie immer noch ein MODEL ausführen, und die Seite wird angeben, wie schnell.

Eine Karte kaufen

Händler können Karten zum Verkauf gegen jeden Eintrag in diesem Katalog auflisten, sodass eine Karten-Seite sowohl zeigt, was die Hardware ausführen kann, als auch wo sie gekauft werden kann. Die Auflistungen sind an die spezifische Platinenvariante und nicht an einen Modellnamen gebunden, was hier mehr zählt als normalerweise — derselbe Name deckt oft mehrere Speicherkapazitäten ab, und die Kapazität ist das, was entscheidet, welche Modelle laufen.

Tabelle lesen

Wie man diesen Katalog liest

Speicher
Wie viel die Karte halten kann. Eine grobe Anleitung ist etwas über ein halbes Gigabyte pro Milliarde Parameter bei der Kompression, die die meisten Leute verwenden, plus Platz für das Gespräch. Nicht alles steht zur Verfügung – Inferenzsoftware reserviert ungefähr ein Zehntel für ihren eigenen Arbeitsraum.
Bandbreite
Wie schnell die Karte ihren eigenen Speicher in Gigabytes pro Sekunde liest. Dies ist der einzige beste Prädiktor der Generationsgeschwindigkeit irgendwo auf dieser Seite.
Boost- und Basistakt
Wie schnell der Prozessor läuft. Aufgelistet der Vollständigkeit halber und hier weit weniger vorhersagbar als bei einem Gaming-Benchmark: Generation wartet auf Speicher, nicht auf Arithmetik.
Speichertyp und Bus-Schnittstelle
Die Speichertechnologie und wie die Karte mit der Maschine verbunden ist. HBM-Teile sind Rechenzentrumshardware mit weit mehr Bandbreite als das GDDR, das auf Desktop-Karten verwendet wird. Die Bus-Schnittstelle bestimmt, wie schnell ein Modell geladen wird, nicht wie schnell es läuft.
Leistung
Die im Watt bewertete Leistung des Boards. Es lohnt sich, darauf zu filtern, wenn das Netzteil oder das Gehäuse bereits entschieden ist, da die größten Karten erheblich mehr benötigen, als ein typischer Desktop bereitstellt.
Warum eine Karte mehrmals erscheint
Jede Zeile ist eine Board-Variante und kein Chip, sodass derselbe Name bei mehreren Speicherkapazitäten erscheinen kann. Diese Unterscheidung ist hier wichtiger als überall sonst, da die Kapazität entscheidet, ob ein Modell läuft.

Antworten

Häufige Fragen

01

Wie berechne ich die Tokens pro Sekunde meiner GPU?

Du musst nicht. Finde deine Karte in der obigen Tabelle — der Katalog hält 818 von ihnen — und öffne es. Seine Seite listet jedes Sprachmodell auf, das es mit einer geschätzten Tokens-pro-Sekunde-Zahl für jedes ausführen kann, berechnet aus der Speicherbandbreite der Karte und der Größe des Modells nach der Kompression.

02

Was ist eine gute TPS für das lokale Ausführen von KI?

Die Lesegeschwindigkeit beträgt ungefähr zehn Tokens pro Sekunde, sodass alles darüber hinaus Text schneller produziert, als man ihn lesen kann, und sich sofort anfühlt. Zwischen fünf und zehn ist nutzbar, aber merklich langsam. Unter fünf ist es unangenehm für Gespräche, eignet sich jedoch weiterhin gut für Arbeiten, die im Hintergrund laufen.

03

Welche GPU-Spezifikation ist am wichtigsten für KI?

Speicherkapazität zuerst, weil das gesamte Modell auf der Karte gehalten werden muss, bevor es etwas generieren kann, und Bandbreite zweiter, weil das Generieren jedes Tokens bedeutet, dass dieses Modell einmal aus dem Speicher gelesen werden muss. Kerneanzahl und Taktraten entscheiden über die Grafikleistung und spielen hier kaum eine Rolle.

04

Wie viel VRAM brauche ich, um ein Sprachmodell auszuführen?

Als grobe Faustregel benötigt man etwas mehr als ein Gigabyte pro Milliarde Parameter bei der Kompression, die die meisten Leute verwenden, plus Platz für den Kontext. Das bedeutet, dass ein Acht-Milliarden-Parameter-Modell bequem auf acht Gigabyte und ein Dreißig-Milliarden-Modell auf vierundzwanzig passt. Karten in diesem Katalog beginnen bei 4 GB und erreichen 288 GB.

05

Wie viele Grafikkarten sind in dieser Datenbank?

Der Katalog enthält 818 Grafikkarten gemacht von AMD, ATI, Intel and NVIDIA. Integrierte Grafiken sind ausgeschlossen, da sie keinen eigenen Speicher haben, und ebenso Karten unter vier Gigabyte, auf denen kein Modell in unserem Katalog bei irgendeiner Kompression passt.

06

Welche GPU hat die höchste Speicherbandbreite?

Das ist Radeon Instinct MI355X, erreichen 8,190 GB/s. Da die Generierungsgeschwindigkeit nahezu direkt von der Bandbreite abhängt, gehört sie hier auch zu den schnellsten Karten für die Textproduktion – ob das jedoch von Bedeutung ist, hängt zunächst davon ab, ob Ihr Modell passt.

07

Welche GPU hat den meisten Speicher?

Das ist Radeon Instinct MI355X, halten 288 GB. Die Kapazität auf diesem Niveau gehört zu Rechenzentren, und sie ermöglicht es, die größten Open-Weight-Modelle auf einer einzigen Karte zu halten, anstatt sie auf mehrere zu verteilen.

08

Ist eine Gaming-Grafikkarte gut genug für lokale KI?

Für eine Person gleichzeitig, normalerweise ja, und oft besseres Preis-Leistungs-Verhältnis als Datacenter-Hardware. Verbraucherkarten geben totalen Speicher auf, um Geschwindigkeit zu erhalten, daher ist die Grenze, welche Modelle passen, anstatt wie schnell sie laufen, sobald sie es tun.

09

Spielt der Hersteller eine Rolle für die AI-Leistung?

Mehr als es sollte. Inferenzsoftware hat weitaus mehr Arbeit in den CUDA-Pfad investiert als in die Alternativen, sodass eine AMD- oder Intel-Karte mit vergleichbarer Bandbreite typischerweise einen kleineren Anteil an ihrem theoretischen Limit erreicht. Unsere Schätzungen wenden eine Strafe dafür an, anstatt anzunehmen, dass die Hardware die einzige Variable ist.

10

Kann ich zwei Grafikkarten zusammen verwenden?

Ja, und es ist oft der Punkt - zwei Karten halten Modelle, die keine von beiden alleine halten könnte. Es verdoppelt nicht die Generierungs Geschwindigkeit, wie es den Speicher verdoppelt, und jede Zahl auf dieser Seite beschreibt eine einzelne Karte für sich.

11

Wie genau sind diese TPS-Schätzungen?

Sie werden aus Spezifikationen berechnet, anstatt gemessen zu werden, und jede wird mit einer Spanne veröffentlicht, anstatt als einzelne Zahl. Dieselbe Karte und das Modell variieren je nach verwendetem Inferenzsoftware und welcher Version davon um dreißig bis fünfzig Prozent, was keine Berechnung aus Spezifikationsblättern vorhersagen kann. Betrachten Sie die Spanne als die ehrliche Antwort.

12

Ich weiß, welches Modell ich möchte. Kann ich die andere Richtung suchen?

Ja. Der Abschnitt über KI-Modelle listet jedes Modell in der Datei auf, und die Seite jedes Modells nennt die Grafikkarten, die es ausführen können, zuerst die kleinsten und schnellsten. Das ist die gleiche Berechnung, die von der anderen Seite angegangen wird.

Die andere Richtung

Von der anderen Seite aus betrachten?

Diese Seite beginnt mit der Hardware. Wenn Sie bereits wissen, welches Modell Sie ausführen möchten und wissen müssen, was dafür erforderlich ist, beginnen Sie stattdessen dort. — Listet jedes Modell in der Datei auf, und jedes benennt die Karten, die es ausführen können..

KI-Modelle