De catalogus
GPU TPS-calculator
Bepaal hoeveel tokens per seconde een grafische kaart produceert op een lokaal AI-model. Filter de catalogus hieronder op de kaarten die het overwegen waard zijn, open er vervolgens één om elk taalmodel te zien dat het kan draaien, hoeveel geheugengebruik elk nodig heeft, en hoe snel het waarschijnlijk zal zijn..
818
kaarten in onze database
4
fabrikanten
4 GB – 288 GB
geheugenbereik
8,190 GB/s
hoogste bandbreedte
Elk woord moet iets overeenkomen, dus meer woorden verkleinen de lijst. Een capaciteit zoals 24GB komt overeen met het geheugen van de kaart, ook al slaat geen enkele kolom het op als tekst..
818 kaarten passen
Bijwerken| Geheugen type | Kracht | ||||||
|---|---|---|---|---|---|---|---|
| B300 NVIDIA · Blackwell Ultra | 288 GB | 8,000 GB/s | 2.03 GHz | 1.67 GHz | Sep 2025 | HBM3e | 1,400 W |
| Radeon Instinct MI350X AMD · CDNA 4.0 | 288 GB | 8,190 GB/s | 2.2 GHz | 1 GHz | Jan 2025 | HBM3e | 1,000 W |
| Radeon Instinct MI355X AMD · CDNA 4.0 | 288 GB | 8,190 GB/s | 2.4 GHz | 1 GHz | Jan 2025 | HBM3e | 1,400 W |
| Radeon Instinct MI325X AMD · CDNA 3.0 | 256 GB | 6,000 GB/s | 2.1 GHz | 1 GHz | Oct 2024 | HBM3e | 1,000 W |
| Radeon Instinct MI300X AMD · CDNA 3.0 | 192 GB | 5,325 GB/s | 2.1 GHz | 1 GHz | Dec 2023 | HBM3 | 750 W |
| Radeon Instinct MI308X AMD · CDNA 3.0 | 192 GB | 5,325 GB/s | 2.1 GHz | 1 GHz | Dec 2023 | HBM3 | 750 W |
| B200 NVIDIA · Blackwell | 180 GB | 8,000 GB/s | 1.97 GHz | 700 MHz | Jan 2024 | HBM3e | 1,000 W |
| H200 NVL NVIDIA · Hopper | 141 GB | 4,890 GB/s | 1.79 GHz | 1.37 GHz | Nov 2024 | HBM3e | 600 W |
| H200 SXM 141 GB NVIDIA · Hopper | 141 GB | 4,890 GB/s | 1.98 GHz | 1.5 GHz | Nov 2024 | HBM3e | 700 W |
| Data Center GPU Max 1550 Intel · Generation 12.5 | 128 GB | 3,280 GB/s | 1.6 GHz | 900 MHz | Jan 2023 | HBM2e | 600 W |
| Data Center GPU Max Subsystem Intel · Generation 12.5 | 128 GB | 3,210 GB/s | 1.6 GHz | 900 MHz | Jan 2023 | HBM2e | 2,400 W |
| GB10 NVIDIA · Blackwell 2.0 | 128 GB | 273 GB/s | 2.42 GHz | 1.67 GHz | Oct 2025 | LPDDR5X | 140 W |
| Jetson T5000 NVIDIA · Blackwell | 128 GB | 273 GB/s | 2.53 GHz | 1.67 GHz | Aug 2025 | LPDDR5X | 40 W |
| Radeon Instinct MI250 AMD · CDNA 2.0 | 128 GB | 3,280 GB/s | 1.7 GHz | 1 GHz | Nov 2021 | HBM2e | 500 W |
| Radeon Instinct MI250X AMD · CDNA 2.0 | 128 GB | 3,280 GB/s | 1.7 GHz | 1 GHz | Nov 2021 | HBM2e | 500 W |
| Radeon Instinct MI300 AMD · CDNA 3.0 | 128 GB | 6,550 GB/s | 1.7 GHz | 1 GHz | Jan 2023 | HBM3 | 600 W |
| Radeon Instinct MI300A AMD · CDNA 3.0 | 128 GB | 5,325 GB/s | 2.1 GHz | 1 GHz | Dec 2023 | HBM3 | 750 W |
| Data Center GPU Max 1350 Intel · Generation 12.5 | 96 GB | 2,460 GB/s | 1.55 GHz | 750 MHz | Jan 2023 | HBM2e | 450 W |
| H100 PCIe 96 GB NVIDIA · Hopper | 96 GB | 3,360 GB/s | 1.84 GHz | 1.67 GHz | Mar 2023 | HBM3 | 700 W |
| H100 SXM5 96 GB NVIDIA · Hopper | 96 GB | 3,360 GB/s | 1.98 GHz | 1.35 GHz | Mar 2023 | HBM3 | 700 W |
| RTX PRO 6000 Blackwell NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.62 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 600 W |
| RTX PRO 6000 Blackwell Max-Q NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.28 GHz | 1.04 GHz | Mar 2025 | GDDR7 | 300 W |
| RTX PRO 6000 Blackwell Server NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.62 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 600 W |
| RTX PRO 6000D Blackwell Max-Q NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.29 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 300 W |
| H100 NVL 94 GB NVIDIA · Hopper | 94 GB | 3,940 GB/s | 1.79 GHz | 1.08 GHz | Mar 2023 | HBM3 | 400 W |
| H100 SXM5 94 GB NVIDIA · Hopper | 94 GB | 3,360 GB/s | 1.98 GHz | 1.35 GHz | Mar 2023 | HBM3 | 700 W |
| RTX 6000D NVIDIA · Blackwell 2.0 | 84 GB | 1,570 GB/s | 2.43 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 600 W |
| A100 PCIe 80 GB NVIDIA · Ampere | 80 GB | 1,940 GB/s | 1.41 GHz | 1.07 GHz | Jun 2021 | HBM2e | 300 W |
| A100 SXM4 80 GB NVIDIA · Ampere | 80 GB | 2,040 GB/s | 1.41 GHz | 1.28 GHz | Nov 2020 | HBM2e | 400 W |
| A100X NVIDIA · Ampere | 80 GB | 2,040 GB/s | 1.44 GHz | 795 MHz | Jun 2021 | HBM2e | 300 W |
Stap voor stap
Hoe de TPS van je GPU te berekenen
Niets hier hoeft met de hand te worden uitgewerkt. De catalogus hierboven bevat al elke CARD, en elke CARD-pagina bevat al elk MODEL dat het kan draaien met een tokens-per-second cijfer eraan vast. Naar je antwoord toe werken neemt zes stappen..
-
01
Beperk de catalogus tot kaarten die het overwegen waard zijn.
Gebruik de filters hierboven om in te stellen wat je daadwerkelijk nodig hebt — een minimale MEMORY-grootte, een fabrikant, een stroomgrens die je voeding kan leveren, of een RELEASE-jaar. MEMORY is de filter om mee te beginnen, omdat het bepaalt welke MODELLEN überhaupt mogelijk zijn.
-
02
Of zoek naar een GPU-kaart die je al bezit
Typ de naam in het zoekvak. Elk woord moet iets overeenkomen, dus meer woorden verminderen de lijst, en een capaciteit van 24GB komt overeen met het geheugen van de kaart, ook al wordt dit niet als tekst in een kolom opgeslagen.
-
03
Sorteer op de specificatie die je uitkomst bepaalt
Sorteer op geheugen als de vraag is welke modellen passen, of op bandbreedte als de vraag is hoe snel ze zullen draaien. Kloksnelheden en kernentellingen worden vermeld voor de volledigheid, maar hebben nauwelijks invloed op tekstgeneratie.
-
04
Open de GPU kaart
Elke card heeft zijn eigen pagina waarop elk taalmodel staat vermeld dat het kan draaien, met geschatte tokens per seconde, het geheugen dat elk model nodig heeft en de compressie waarmee het draait.
-
05
Stel je contextlengte en minimale kwaliteit in
Op de kaartpagina, stel de gesprekslengte in die je verwacht te gebruiken en de laagste compressie die je bereid bent te accepteren. Beide veranderen het antwoord in plaats van het te filteren — een langer gesprek heeft meer geheugen nodig, wat een groot model volledig van de kaart kan duwen.
-
06
Lees het bereik, niet het enkele getal
Elke doorvoercijfer wordt gepubliceerd met een betrouwbaarheidsbereik eromheen. Neem het bereik als het antwoord: dezelfde kaart en model variëren tussen inferentiestelsels en versies op manieren die geen specificatielijst voorspelt, en het kopcijfer is slechts het midden van dat bereik.
Wat de cijfers betekenen
Wat deze catalogus is
Dit is een database die houdt 818 grafische kaarten, gefilterd op de kaarten met voldoende GEHEUGEN om een taalmodel in zijn geheel te bevatten. Elke kaart heeft zijn eigen pagina, en op die pagina is elk model dat we volgen beoordeeld — of het past, bij welke compressie, en hoeveel tokens per seconde het naar verwachting zal produceren.
De berekening draait wanneer je een GPU card opent in plaats van opgezocht te worden in een opgeslagen tabel, wat het mogelijk maakt dat de context length en de minimale kwaliteit dingen zijn die je instelt in plaats van dingen die wij voor jou aannamen. Verander een van beide en elke waarde wordt opnieuw berekend.
Waarom tokens per seconde het aantal is dat ertoe doet
Het draaien van een taalmiddel op je eigen hardware werd in korte tijd een gewone zaak. Open-weight modellen haalden ver genoeg in om werkelijk nuttig te zijn, en de tools om ze uit te voeren vereisten niet langer een onderzoekachtergrond. Wat niet tegelijkertijd arriveerde, was een rechtstreekse antwoord op de eerste vraag die iemand stelt: zal het draaien op de GPU kaart die ik al heb, en zal het snel genoeg zijn om het het waard te maken om te gebruiken.
Specificaties geven hier geen antwoord op. Ze zijn geschreven voor grafische workloads en beginnen met de cijfers die de framesnelheden bepalen, die bijna geheel de verkeerde zijn. De twee cijfers die daadwerkelijk de uitkomst bepalen zijn geheugencapaciteit, die bepaalt of een model past, en geheugendoorvoer, die bepaalt hoe snel het genereert zodra het dat doet.
Tokens per second is het getal dat de uitkomst uitdrukt in iets dat je kunt voelen. Leessnelheid ligt ergens rond de tien tokens per second, dus alles boven dat arriveert sneller dan je het kunt lezen en alles ver beneden voelt als wachten. Dat is het cijfer dat deze site berekent, voor elke combinatie van card en model die het heeft.
Wat de catalogus dekt
geheugenbereik
4 GB – 288 GB
hoogste bandbreedte
8,190 GB/s
Vermogensbereik
6 – 2,400 W
Geheugen in de catalogus begint bij 4 GB en bereikt 288 GB. Die reikwijdte is het verschil tussen een card die beperkt is tot de kleinste bruikbare modellen en een die modellen bevat die geen enkele desktopmachine kan bereiken — capaciteit is een harde beperking in plaats van een geleidelijke afweging, dus een model past of het loopt niet.
Geheugenbandbreedte begint bij 10 GB/s en bereikt 8,190 GB/s, een figuur vastgehouden door Radeon Instinct MI355X. Omdat het genereren van elk token betekent dat het hele model eenmaal uit het geheugen moet worden gelezen, vertaalt die spreiding zich bijna direct in een spreiding in generatie snelheid: een kaart met tien keer de bandbreedte produceert tokens ruwweg tien keer sneller op hetzelfde model.
Kaarten in de catalogus zijn gemaakt door AMD, ATI, Intel and NVIDIA. De fabrikant is belangrijker dan het zou moeten zijn: inferentiesoftware heeft veel meer aandacht gehad voor het CUDA-pad dan voor enig ander, zodat een AMD- of Intel-kaart van equivalente bandbreedte over het algemeen een kleinere aandeel van zijn theoretische plafond bereikt. Onze schattingen passen een straf toe voor dat in plaats van te doen alsof de hardware de enige variabele is.
Het stroomverbruik begint bij 6 W en bereikt 2,400 W. Het hogere segment is datacenterhardware die een desktopvoeding niet kan voeden, en het is de beperking die mensen als laatste ontdekken - nadat de kaart in het budget en de behuizing past.
Releasedata starten in 2009 en run naar 2025, dus de catalogus dekt hardware die mensen nog bezitten evenals hardware die ze mogelijk willen kopen. Een oudere CARD is niet uitgesloten omdat hij oud is - als hij voldoende MEMORY heeft, kan hij nog steeds een model draaien, en de pagina zal zeggen hoe snel.
Een GPU kopen
Leveranciers kunnen kaarten te koop aanbieden tegen elke vermelding in deze catalogus, zodat een kaartpagina zowel kan tonen wat de hardware draait als waar het gekocht kan worden. Lijsten zijn gekoppeld aan de specifieke bordvariant in plaats van aan een modelnaam, wat hier belangrijker is dan normaal - dezelfde naam dekt vaak verschillende geheugencapaciteiten, en capaciteit is hetgeen dat bepaalt welke modellen draaien.
Ranglijsten
Meeste geheugen
Capaciteit bepaalt welke modellen überhaupt passen.
hoogste bandbreedte
Bandenbreedte bepaalt hoe snel ze draaien zodra ze passen.
Meest energie-intensiefe
Controleer deze tegen de voorraad die je al hebt..
Lezen van de tabel
Hoe dit catalogus te lezen
- Geheugen
- Hoeveel de card kan bevatten. Een ruwe gids is iets meer dan een halve gigabyte per miljard parameters bij de compressie die de meeste mensen gebruiken, plus ruimte voor het gesprek. Niet alles is beschikbaar — inferentiesoftware reserveert ongeveer een tiende voor zijn eigen werkruimte.
- Bandbreedte
- Hoe snel de kaart zijn eigen geheugen leest, in gigabytes per seconde. Dit is de enige beste voorspeller van generatie snelheid ergens op deze site.
- Boost- en basissnelheid
- Hoe snel de processor draait. Lijst voor de volledigheid, en veel minder voorspellend hier dan op een gaming benchmark: generatie wacht op GPU VRAM, niet op rekenkunde.
- Geheugentype en businterface
- De geheugen technologie en hoe de kaart verbinding maakt met de machine. HBM onderdelen zijn datacenter hardware met veel meer bandbreedte dan de GDDR die op desktop kaarten wordt gebruikt. De businterface bepaalt hoe snel een model laadt, niet hoe snel het draait.
- Kracht
- De geschatte stroomafname van de kaart in watts. Het is de moeite waard om hierop te filteren wanneer de voeding of behuizing al is besloten, aangezien de grootste kaarten aanzienlijk meer nodig hebben dan een typische desktop biedt.
- Waarom een kaart meer dan eens verschijnt
- Elke rij is een bordvariant in plaats van een chip, zodat dezelfde naam bij verschillende geheugen capaciteiten kan verschijnen. Dat onderscheid is hier belangrijker dan ergens anders, omdat de capaciteit bepaalt of een model draait.
Antwoorden
veelgestelde vragen
Hoe bereken ik de tokens per seconde van mijn GPU?
Je hoeft niet te. Zoek je kaart in de bovenstaande tabel — de catalogus bevat 818 van hen — en open het. De pagina toont elk taalmodel dat het kan draaien met een geschatte tokens-per-seconde waarde voor elk, berekend op basis van de geheugenbandbreedte van de kaart en de grootte van het model eenmaal gecomprimeerd.
Wat is een goed aantal tokens per seconde voor het lokaal draaien van AI?
Leessnelheid is ongeveer tien tokens per seconde, dus alles daarboven produceert tekst sneller dan je het kunt lezen en voelt onmiddellijk. Tussen vijf en tien is bruikbaar maar merkbaar traag. Onder de vijf is ongemakkelijk voor conversatie, hoewel het nog steeds goed is voor werk dat je laat draaien.
Welke GPU-specificatie is het belangrijkst voor AI?
Geheugen capaciteit eerst, omdat het gehele model op de kaart moet worden gehouden voordat het iets kan genereren, en bandbreedte tweede, omdat het genereren van elke token betekent dat dat model eenmaal uit het geheugen moet worden gelezen. Kern tellen en kloksnelheden bepalen de grafische prestaties en registreren hier nauwelijks.
Hoeveel VRAM heb ik nodig om een taalmodel uit te voeren?
Als ruwe richtlijn, iets meer dan een half gigabyte per miljard parameters bij de compressie die de meeste mensen gebruiken, plus ruimte voor het gesprek. Dat plaatst een model van acht miljard parameters comfortabel op acht gigabytes en een van dertig miljard op vierentwintig. Kaarten in deze catalogus beginnen bij 4 GB en bereiken 288 GB.
Hoeveel GPU-kaarten staan er in deze database?
De catalogus bevat 818 kaarten gemaakt door AMD, ATI, Intel and NVIDIA. Geïntegreerde graphics zijn uitgesloten omdat ze geen eigen geheugen hebben, en ook kaarten van minder dan vier gigabyte, waarop geen enkel model in onze catalogus past bij enige compressie.
Welke GPU heeft de hoogste memory-bandbreedte?
Dat is Radeon Instinct MI355X, bereiken 8,190 GB/s. Omdat de generatie snelheid bijna direct de bandbreedte volgt, behoort hij ook tot de snelste kaarten hier voor het genereren van tekst - hoewel of dat ertoe doet, eerst afhangt van of je model past.
Welke GPU heeft het meeste geheugen?
Dat is Radeon Instinct MI355X, houden 288 GB. Capaciteit op dat niveau is datacentrumgebied, en het is wat de grootste open-source AI-modellen mogelijk maakt om op een enkele GPU kaart te worden gehouden in plaats van verdeeld over meerdere.
Is een gaming GPU kaart goed genoeg voor lokale AI?
Voor één persoon tegelijk, meestal wel, en vaak beter waarde dan datacenterhardware. Consumentenkaarten geven totale geheugencapaciteit op in plaats van snelheid, dus de limiet is welke modellen passen in plaats van hoe snel ze draaien zodra ze dat wel doen.
Maakt de fabrikant uit voor de AI-prestaties?
Meer dan het zou moeten. Inference-software heeft veel meer werk gestoken in het CUDA-pad dan in de alternatieven, zodat een AMD- of Intel-kaart met gelijkwaardige bandbreedte meestal een kleinere aandeel van zijn theoretische plafond bereikt. Onze schattingen passen een straf toe voor dat in plaats van aan te nemen dat de hardware de enige variabele is.
Kan ik twee GPU kaarten samen gebruiken?
Ja, en dat is vaak het punt - twee CARDS houden MODELS die geen van beiden alleen kan vasthouden. Het verdubbelt de generatiesnelheid niet op de manier waarop het het geheugen verdubbelt, en iedere FIGUUR op deze SITE beschrijft een enkele CARD op zichzelf.
Hoe nauwkeurig zijn deze tokens-per-seconde schattingen?
Ze worden berekend op basis van specificaties in plaats van gemeten, en elk is gepubliceerd met een bereik in plaats van als een enkel getal. Dezelfde kaart en model variëren met dertig tot vijftig procent, afhankelijk van welke inferentiesoftware je gebruikt en welke versie daarvan, wat geen enkele berekening van specificatiedocumenten kan voorspellen. Behandel het bereik als het eerlijke antwoord.
Ik weet welk model ik wil. Kan ik de andere kant op zoeken?
Ja. De AI-modellen sectie lijst elk model op file, en elke modelpagina noemt de grafische kaarten die het kunnen draaien, van kleinste tot snelste. Dat is dezelfde berekening benaderd vanuit de andere kant.
De andere richting
Van de andere kant bekijken?
Deze pagina begint met de hardware. Als je al weet welk model je wilt runnen en moet weten wat daarvoor nodig is, begin dan daar in plaats. — lijst elke model in ons database en elke een noemt de kaarten die het kunnen draaien.