Antwoorden

Veelgestelde vragen

Over de schattingen, wat ze betekenen, en hoe de site werkt. Vragen over een specifieke CARD of MODEL worden beantwoord op de pagina van die CARD of MODEL..

01

Wat betekent "tokens per second"?

Het is hoe snel een taalmodel tekst genereert op een gegeven GPU — hoeveel tokens (ruwweg, woordstukken) het elke seconde produceert terwijl je met het chat. Een hoger nummer betekent dat antwoorden sneller stromen.

02

Hoe nauwkeurig zijn de schattingen?

Verwacht dat het werkelijke cijfer binnen ongeveer 20–40% van de schatting zal liggen. Dezelfde GPU en het model variëren zoveel tussen inference-engines, engineversies en serverconfiguraties — geen specificatiedocument voorspelt dat, wat de reden is waarom elk cijfer op deze site wordt gepubliceerd als een bereik in plaats van een enkel nummer.

03

Waarom is uw aantal zoveel lager dan de door een hardwareleverancier gepubliceerde doorvoer?

Door de leverancier gepubliceerde doorvoer wordt meestal gemeten terwijl honderden verzoeken tegelijk worden bediend. Ons cijfer is voor één persoon die met het model praat, één verzoek tegelijk — het aantal dat daadwerkelijk het draaien van een model lokaal beschrijft. De twee zijn niet vergelijkbaar.

04

Wat betekent het voor een model om "te passen" op een GPU?

Dat de gewichten van het model, de conversatiecache en de overhead van de runtime allemaal passen binnen het bruikbare geheugen van de card bij een bepaalde quantisatie. Een model kan krap, comfortabel of helemaal niet passen — we tonen welke, samen met hoeveel ruimte er nog over is.

05

Wat is quantisatie, en waarom verandert het of iets past?

Kwantisatie comprimeert de gewichten van een model om geheugen te besparen, tegen een kleine kost voor de outputkwaliteit. Een model dat niet past op volledige precisie past vaak comfortabel bij een lagere kwantisatie — we rapporteren altijd de beste kwaliteit die past bij een gegeven kaart.

06

Welke GPU's dekken jullie?

Duizenden kaarten van NVIDIA, AMD, Intel en Apple Silicon, van datacenterversnellers tot consumentenkaarten. Dekking en schattingsvertrouwen zijn het beste op moderne NVIDIA-hardware, waar de onderliggende inference-engines het meest volwassen zijn.

07

Is gputps.com gratis te gebruiken?

Ja - het doorbladeren van GPU's, modellen en elke schatting op de site is gratis, zonder dat een account vereist is.

08

Hoe vermeld ik een GPU te koop?

Registreer een gratis verkopersaccount en voeg je vermeldingen toe — ze verschijnen direct op de pagina van de bijpassende CARD. Zie de word-verkoper pagina voor hoe het werkt en de huidige prijzen.

Nog steeds aan het kijken

Kun je niet vinden wat je zoekt?

Heeft u een verkeerd cijfer gevonden, ontbreekt er een GPU of heeft u een suggestie? We horen het graag..

De methode

Hoe de schattingen worden opgebouwd

Specificaties vertellen je wat een GPU is. Ze vertellen je niet wat het doet met een taalmodel. Dat is de kloof die we deze site hebben gebouwd om te dichten..