Geheugengebonden doorvoer, live berekend
Kan je GPU dat AI Model draaien? De GPU TPS calculator
Kies een GPU kaart of een AI model en we berekenen — live, niet vanuit een zoektafel — of het past, met welke compressie, en ruwweg hoeveel tokens per seconde je kunt verwachten..
Live schatting
InvoerFormaat
Q8_0
context
13k
Vertrouwen
high
Werkt voorbeelden
Bekijk deze krachtige combinaties
Een paar combinaties waar we een vriend naar zouden wijzen, met verschillende budgetten.
01
Vergelijk GPU's
VRAM, geheugenbandbreedte, tensor kernen en FP16 doorvoer.
02
Schatting tokens per seconde
Decode-snelheid is gebonden aan geheugenbandbreedte, dus we modelleren het eerder dan het citeren van piek TFLOPS..
03
Controleren wat past
Welke modellen draaien op een GPU, bij welke quantisatie, en met hoeveel context?.
Het probleem
Waarom is "zal mijn GPU dit draaien?" een moeilijke vraag
Een specificatieblad vertelt je de geheugen van een kaart en de kloksnelheid. Het vertelt je niet of een specifiek taalmodel in dat geheugen past eenmaal gecomprimeerd, hoeveel van de kaart overblijft voor het gesprek zelf, of hoeveel tokens per seconde daadwerkelijk aan de andere kant komen — en die drie vragen hebben niet hetzelfde antwoord voor enige twee GPU-en-model paren.
De eerlijke versie van deze berekening omvat het aantal parameters van het model en de architectuur, het compressieformaat waarin het is opgeslagen, de geheugenbandbreedte van de kaart en hoe volwassen de inferentiesoftware is, en de lengte van het gesprek dat je van plan bent met het te hebben. Als je een van deze fouten maakt, ziet het getal dat naar voren komt er net zo zeker uit en is het gewoon onjuist.
We doen niet alsof dit een enkele nauwkeurige waarde produceert, omdat dat niet kan. Wat we in plaats daarvan doen, is de volledige berekening uitvoeren voor elke card en elk model waarvoor we gegevens hebben, het resultaat publiceren als een bereik in plaats van een vals-precisie puntwaarde, en onze berekening laten zien - elke formule achter elk getal op deze site is openbaar geschreven, niet verborgen achter het antwoord.
Wat deze site je eigenlijk biedt
De meest complete dataset die we konden samenstellen: duizenden GPU-kaarten en duizenden taalmateriaal-modellen, kruisgewogen tegen elkaar in plaats van één voor één bekeken te worden. Begin met een kaart die je bezit of overweegt, en zie elk model dat daarop past. Begin met een model dat je wilt draaien, en zie elke kaart die het kan houden.
Dat werkt in beide richtingen omdat de onderliggende berekening symmetrisch is — dezelfde MEMORY-EN-BANDWIDTH-aritmetiek, uitgevoerd vanuit welke kant je ook al kent. Geen van beide richtingen is de "echte"; ze zijn hetzelfde antwoord op twee verschillende manieren gevraagd.
Lees meer over hoe en waarom op onze over pagina.
Onlangs uitgebracht
Bekijk deze krachtige nieuwe GPU's
Blader door alle GPU'sNVIDIA
Oct 2025
Beide richtingen
Hoe de rekenmachine werkt
Dezelfde berekening, bruikbaar vanaf welke kant van de vraag je ook begint..
Beginnend met een GPU die je bezit
- 01 Vind je GPU kaart . Zoek de GPU-catalogus naar de kaart die je bezit of overweegt, op naam of op geheugengrootte.
- 02 Open zijn pagina . Elke kaart heeft zijn eigen pagina waarop elk taalmodel staat vermeld dat we kunnen evalueren, met een geschatte tokens-per-seconde waarde voor elk.
- 03 Stel je contextlengte en kwaliteitsvloer in . Pas de gesprekslengte aan die je verwacht te gebruiken en de laagste compressie die je zult accepteren. Beide veranderen het antwoord live.
- 04 Lees het bereik, niet een enkel getal . Elke schatting wordt gepubliceerd met een betrouwbaarheidsbereik in plaats van één onnauwkeurig getal, omdat dezelfde CARD en MODEL variëren tussen inferentie-engines op manieren die geen specificatiedocument voorspelt.
Startend van een model dat je wilt runnen
- 01 Vind het model . Zoek de AI modelcatalogus op naam of op grootte — zelfs wanneer de naam zelf het aantal parameters niet vermeldt.
- 02 Open zijn pagina . Een model met OPEN WEIGHTS lijsten elke GPU CARD waarmee we het kunnen beoordelen, de kleinste die past en de snelste eerst.
- 03 Stel je contextlengte en kwaliteitsvloer in . Dezelfde twee besturingselementen als het GPU-eerste pad — een langer gesprek heeft meer geheugen nodig, wat een kaart van "past" naar "past niet" kan duwen.
- 04 Vergelijk kaarten op basis van wat je daadwerkelijk zult opmerken . Geheugen bepaalt of het überhaupt draait; bandbreedte bepaalt hoe snel het aanvoelt als het dat doet. De tabel sorteert standaard op tokens per seconde omdat dat meestal is wat ertoe doet.
Antwoorden
veelgestelde vragen
Hoe bereken ik of mijn GPU een lokale LLM kan draaien?
Vind je kaart in de GPU-catalogus en open de pagina ervan - hierop staan elk model dat we tegen het kan beoordelen, of elk model in het memory past, en een geschatte tokens-per-second-waarde. Je kunt ook beginnen met een model en zien welke kaarten het kunnen draaien, wat dezelfde berekening is vanuit de andere richting.
Kan mijn GPU lokaal LLM-modellen draaien?
Als het minstens een paar gigabyte aan eigen MEMORY heeft, is het bijna zeker iets. Geïntegreerde graphics die SYSTEM MEMORY delen zijn de belangrijkste uitzondering, aangezien ze geen toegewijd POOL hebben om een MODEL in te houden. Daarbuiten is het een kwestie van welk MODEL, bij welke compressie — niet ja of nee.
Wat bepaalt tokens per seconde op een GPU?
Het genereren van een token betekent het eenmaal uitlezen van de gewichten van het model uit GPU VRAM, zodat de snelheid wordt beperkt door de geheugensnelheid gedeeld door hoeveel er per token gelezen moet worden — wat afhangt van de grootte van het model, de architectuur en het compressieformaat waarin het is opgeslagen. Kloksnelheid en aantal kernen, de cijfers waar een specificatiesheet mee begint, spelen nauwelijks een rol.
Hoe nauwkeurig zijn de schattingen op deze site?
Verwacht dat de werkelijke waarde binnen ongeveer 20–40% van de schatting ligt. Dezelfde GPU en model variëren zoveel tussen inferentie-engines, engineversies en serverconfiguraties — geen berekening alleen op basis van specificatiebladen kan dat voorspellen, wat de reden is dat elk cijfer hier wordt gepubliceerd als een bereik.
Is een grotere, nieuwere GPU altijd sneller voor AI?
Voor een model dat al comfortabel op beide kaarten past, bepaalt de geheugenbandbreedte de winnaar, en heeft een nieuwere kaart meestal meer daarvan. Maar de meervoorkomende bottleneck is capaciteit, niet snelheid - de nuttigere vraag voor een specifieke kaart is meestal "wat is het grootste model dat past", wat elke kaartpagina direct beantwoordt.
Moet ik kwantisatie begrijpen om deze site te gebruiken?
Nee — elke kaart en modelpagina kiest automatisch de beste kwaliteitscompressie die daadwerkelijk past. Kwantisatie is de techniek die de geheugencapaciteit van een model verkleint tegen een kleine kostprijs voor de outputkwaliteit, en je kunt zelf een kwaliteitsminimum instellen als je dat wilt, maar niets verplicht je hiertoe.
Waar komen de datasets van de GPU en AI model vandaan?
Specificaties van GPU-kaarten en taalmodelrecords die duizenden open-source modellen en hun parameteraantallen, licenties en releasedata dekken. Beide worden vernieuwd wanneer nieuwe hardware en modellen worden uitgebracht — zie de GPU- en AI-modelcatalogi voor volledige dekking.
Verkopen van hardware
Geïnteresseerd in het worden van een verkoper?
Lijst uw GPU's te koop direct naast het antwoord op wat ze daadwerkelijk kunnen draaien.
Binnenkort
Ontvang melding over nieuwe GPUs en modellen
Een nieuwsbrief komt binnenkort.
Verken verder
Blader door de volledige GPU-catalogus of blad de volledige AI model catalogus. Hardware kopen? controleer de leverancierdirectory. Meer vragen worden beantwoord op onze FAQ-pagina, of Neem contact met ons op directly.