A katalógus
GPU TPS számológép
Dolgozd ki, hány tokent másodpercenként tud bármelyik grafikus kártya előállítani egy helyi AI modellben. Szűrd le az alábbi katalógust azokra a kártyákra, amelyeket érdemes figyelembe venni, majd nyisd meg az egyiket, hogy lásd, milyen nyelvi modellt tud futtatni, mennyi memória szükséges mindegyikhez, és mennyire valószínű, hogy gyors lesz..
818
kártyák a fájlban
4
gyártók
4 GB – 288 GB
memória tartomány
8,190 GB/s
legmagasabb sávszélesség
Minden szónak illeszkednie kell valamihez, így több szó szűkíti a listát. Egy 24GB-os kapacitás illeszkedik a kártya memóriájához, még ha egy oszlop sem tárolja szövegként..
818 kártyák illeszkednek
Frissítés| Memória típus | Teljesítmény | ||||||
|---|---|---|---|---|---|---|---|
| B300 NVIDIA · Blackwell Ultra | 288 GB | 8,000 GB/s | 2.03 GHz | 1.67 GHz | Sep 2025 | HBM3e | 1,400 W |
| Radeon Instinct MI350X AMD · CDNA 4.0 | 288 GB | 8,190 GB/s | 2.2 GHz | 1 GHz | Jan 2025 | HBM3e | 1,000 W |
| Radeon Instinct MI355X AMD · CDNA 4.0 | 288 GB | 8,190 GB/s | 2.4 GHz | 1 GHz | Jan 2025 | HBM3e | 1,400 W |
| Radeon Instinct MI325X AMD · CDNA 3.0 | 256 GB | 6,000 GB/s | 2.1 GHz | 1 GHz | Oct 2024 | HBM3e | 1,000 W |
| Radeon Instinct MI300X AMD · CDNA 3.0 | 192 GB | 5,325 GB/s | 2.1 GHz | 1 GHz | Dec 2023 | HBM3 | 750 W |
| Radeon Instinct MI308X AMD · CDNA 3.0 | 192 GB | 5,325 GB/s | 2.1 GHz | 1 GHz | Dec 2023 | HBM3 | 750 W |
| B200 NVIDIA · Blackwell | 180 GB | 8,000 GB/s | 1.97 GHz | 700 MHz | Jan 2024 | HBM3e | 1,000 W |
| H200 NVL NVIDIA · Hopper | 141 GB | 4,890 GB/s | 1.79 GHz | 1.37 GHz | Nov 2024 | HBM3e | 600 W |
| H200 SXM 141 GB NVIDIA · Hopper | 141 GB | 4,890 GB/s | 1.98 GHz | 1.5 GHz | Nov 2024 | HBM3e | 700 W |
| Data Center GPU Max 1550 Intel · Generation 12.5 | 128 GB | 3,280 GB/s | 1.6 GHz | 900 MHz | Jan 2023 | HBM2e | 600 W |
| Data Center GPU Max Subsystem Intel · Generation 12.5 | 128 GB | 3,210 GB/s | 1.6 GHz | 900 MHz | Jan 2023 | HBM2e | 2,400 W |
| GB10 NVIDIA · Blackwell 2.0 | 128 GB | 273 GB/s | 2.42 GHz | 1.67 GHz | Oct 2025 | LPDDR5X | 140 W |
| Jetson T5000 NVIDIA · Blackwell | 128 GB | 273 GB/s | 2.53 GHz | 1.67 GHz | Aug 2025 | LPDDR5X | 40 W |
| Radeon Instinct MI250 AMD · CDNA 2.0 | 128 GB | 3,280 GB/s | 1.7 GHz | 1 GHz | Nov 2021 | HBM2e | 500 W |
| Radeon Instinct MI250X AMD · CDNA 2.0 | 128 GB | 3,280 GB/s | 1.7 GHz | 1 GHz | Nov 2021 | HBM2e | 500 W |
| Radeon Instinct MI300 AMD · CDNA 3.0 | 128 GB | 6,550 GB/s | 1.7 GHz | 1 GHz | Jan 2023 | HBM3 | 600 W |
| Radeon Instinct MI300A AMD · CDNA 3.0 | 128 GB | 5,325 GB/s | 2.1 GHz | 1 GHz | Dec 2023 | HBM3 | 750 W |
| Data Center GPU Max 1350 Intel · Generation 12.5 | 96 GB | 2,460 GB/s | 1.55 GHz | 750 MHz | Jan 2023 | HBM2e | 450 W |
| H100 PCIe 96 GB NVIDIA · Hopper | 96 GB | 3,360 GB/s | 1.84 GHz | 1.67 GHz | Mar 2023 | HBM3 | 700 W |
| H100 SXM5 96 GB NVIDIA · Hopper | 96 GB | 3,360 GB/s | 1.98 GHz | 1.35 GHz | Mar 2023 | HBM3 | 700 W |
| RTX PRO 6000 Blackwell NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.62 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 600 W |
| RTX PRO 6000 Blackwell Max-Q NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.28 GHz | 1.04 GHz | Mar 2025 | GDDR7 | 300 W |
| RTX PRO 6000 Blackwell Server NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.62 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 600 W |
| RTX PRO 6000D Blackwell Max-Q NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.29 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 300 W |
| H100 NVL 94 GB NVIDIA · Hopper | 94 GB | 3,940 GB/s | 1.79 GHz | 1.08 GHz | Mar 2023 | HBM3 | 400 W |
| H100 SXM5 94 GB NVIDIA · Hopper | 94 GB | 3,360 GB/s | 1.98 GHz | 1.35 GHz | Mar 2023 | HBM3 | 700 W |
| RTX 6000D NVIDIA · Blackwell 2.0 | 84 GB | 1,570 GB/s | 2.43 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 600 W |
| A100 PCIe 80 GB NVIDIA · Ampere | 80 GB | 1,940 GB/s | 1.41 GHz | 1.07 GHz | Jun 2021 | HBM2e | 300 W |
| A100 SXM4 80 GB NVIDIA · Ampere | 80 GB | 2,040 GB/s | 1.41 GHz | 1.28 GHz | Nov 2020 | HBM2e | 400 W |
| A100X NVIDIA · Ampere | 80 GB | 2,040 GB/s | 1.44 GHz | 795 MHz | Jun 2021 | HBM2e | 300 W |
Lépésről lépésre
Hogyan lehet kiszámítani a GPU TPS-jét
Itt semmit sem kell kézzel megoldani. A fent említett katalógus már tartalmazza az összes kártyát, és minden kártyaoldal már tartalmazza azokat a modelleket, amelyeket a tokens-per-second értékkel képes futtatni. A válaszhoz való eljutáshoz hat lépés szükséges..
-
01
Szűkítse le a katalógust azokra a kártyákra, amelyeket érdemes fontolóra venni.
Használja a szűrőket, hogy beállítsa, amire valóban szüksége van — egy minimális MEMÓRIA méretet, egy gyártót, egy teljesítményhatárt, amit az Ön tápja képes biztosítani, vagy egy kiadási évet. A MEMÓRIA az első szűrő, amivel érdemes kezdeni, mert ez határozza meg, hogy mely modellek lehetségesek egyáltalán.
-
02
Vagy keress egy kártyát, amivel már rendelkezel
Írd be a nevet a keresőmezőbe. Minden szónak egyeznie kell valamivel, így több szó szűkíti a listát, és egy 24GB-os kapacitás egyezik a kártya memóriájával, annak ellenére, hogy egyetlen oszlop sem tárolja azt szövegként.
-
03
Rendezze azokat a specifikációk szerint, amelyek meghatározzák az eredményét
Rendezze a memóriát, ha a kérdés az, hogy mely modellek férnek el, vagy a sávszélesség alapján, ha a kérdés az, hogy milyen gyorsan fognak futni. Az óra sebességek és a magok száma a teljesség kedvéért van felsorolva, de alig befolyásolják a szöveg generálást.
-
04
Nyisd meg a GPU kártyát
Minden kártyának van egy saját oldala, amely felsorolja az összes nyelvi modellt, amit futtatni tud, a becsült tokenek másodpercenkénti számával, a szükséges memóriával minden modell esetében és a használt tömörítéssel.
-
05
Állítsa be a kontextus hosszt és a minimális minőséget
A kártya oldalon állítsa be a várható beszélgetés hosszát és a legalacsonyabb tömörítést, amit elfogad. Mindkettő a választ módosítja, nem pedig szűri — egy hosszabb beszélgetés több memória igényel, ami egy nagy modellt teljesen letolhat a kártyáról.
-
06
Olvasd el a tartományt, ne az egyes számot.
Minden átvitel teljesítmény adatot egy bizalmi tartománnyal együtt publikálnak. Vegye a tartományt válaszként: ugyanaz a kártya és modell a következtetési motorok és verziók között olyan módon változik, amit egy specifikációs lap sem jósol meg, és a címszám csak ennek a szórásnak a közepe.
Mit jelentenek a számok
Mi ez a katalógus
Ez egy adatbázis, amely tárolja 818 grafikus kártyák, amelyek le vannak szűrve azokra, amelyek elég memóriával rendelkeznek egy nyelvi modell tárolásához. Minden kártyának megvan a saját oldala, és azon az oldalon minden modell, amit nyomon követünk, fel van mérve vele szemben — hogy illeszkedik-e, milyen tömörítéssel, és hogy hány tokent valószínű, hogy másodpercenként előállít.
A számítás akkor fut, amikor egy KÁRT nyitsz meg, ahelyett, hogy egy tárolt táblázatból lenne lekérdezve, ami lehetővé teszi, hogy a KONTEXTUS HOSSZA és a minimális minőség olyan dolgok legyenek, amelyeket te állítasz be, ahelyett, hogy olyan dolgok lennének, amelyeket a te nevedben feltételeztünk. Változtasd meg bármelyiket, és minden adat újraszámítódik.
Miért a másodpercenkénti tokenek száma az, ami számít
A nyelvi modell futtatása a saját hardveren gyors időn belül mindennapi dologgá vált. Az open weight modellek eléggé fejlődtek ahhoz, hogy valóban hasznosak legyenek, és a futtatásukhoz szükséges eszközök már nem igényeltek kutatási hátteret. Ami nem érkezett meg ezzel párhuzamosan, az a válasz az első kérdésre, amit bárki feltesz: fog-e futni a már meglévő kártyámon, és elég gyors lesz-e ahhoz, hogy érdemes legyen használni.
A specifikációs lapok nem válaszolnak erre. Grafikai munkaterhelésekhez íródtak, és azokat a számokat tartalmazzák, amelyek a képfrissítési sebességet határozzák meg, amelyek szinte teljesen tévesek. Két szám dönt valóban az eredményről: a memória kapacitás, amely meghatározza, hogy egy modell elfér-e, és a memória sávszélesség, amely meghatározza, hogy milyen gyorsan generál, miután ez megtörténik.
A másodpercenkénti tokenek száma az a szám, amely kifejezi az eredményt valami olyanban, amit érezhetsz. Az olvasási sebesség körülbelül tíz token per másodperc, így bármi, ami fölötte van, gyorsabban érkezik, mint ahogy el tudod olvasni, és bármi, ami jól alatta van, úgy érzed, hogy várakozol. Ez a szám az, amit ez az oldal kiszámít, minden kártya és modell kombinációjára, amit tárol.
Mit tartalmaz a katalógus
memória tartomány
4 GB – 288 GB
legmagasabb sávszélesség
8,190 GB/s
Teljesítmény tartomány
6 – 2,400 W
A katalógusban a memória kezdődik a 4 GB és eléri 288 GB. Ez a tartomány a legkisebb használható modellekre korlátozott kártya és egy olyan kártya közötti különbség, amely olyan modelleket tartalmaz, amelyeket egyetlen asztali gép sem tud elérni — a kapacitás egy kemény korlát, nem pedig fokozatos kompromisszum, így egy modell vagy belefér, vagy nem fut.
A memóriávágási szélesség kezdődik a 10 GB/s és eléri 8,190 GB/s, egy figura által tartva Radeon Instinct MI355X. Mivel minden egyes token előállítása azt jelenti, hogy a teljes modellt egyszer olvassuk ki a memóriából, ez a szélesség szinte közvetlenül lefordítható a generálási sebesség szélességére: egy kártya, amely tízszeres sávszélességgel rendelkezik, körülbelül tízszer gyorsabban állít elő tokeneket ugyanazon a modellen.
A katalógusban szereplő KÁRTYÁK a következő gyártók által készültek: AMD, ATI, Intel and NVIDIA. A gyártó fontosabb, mint kellene: a következtetési szoftver a CUDA útnak sokkal több figyelmet szentelt, mint bármely másiknak, így egy AMD vagy Intel kártya, amelynek sávszélessége egyenértékű, általában kisebb részesedést ér el elméleti plafonjából. A mi becsléseink büntetést alkalmaznak erre, ahelyett hogy azt tettetnék, hogy a hardver az egyetlen változó.
A teljesítményfelvétel kezdődik 6 W és eléri 2,400 W. A felső határ a datacenter hardver, amelyet egy asztali tápegység nem tud ellátni, és ez az a korlátozás, amelyet az emberek hajlamosak utoljára felfedezni — miután a kártya belefér a költségvetésbe és az házba.
A kiadási dátumok kezdődnek 2009 és fut a 2025, Így a katalógus lefedi azokat a hardvereket, amelyeket az emberek még mindig birtokolnak, valamint azokat a hardvereket, amelyeket megvásárolhatnak. Egy régi card nem kerül kizárásra azért, mert régi – ha rendelkezik a MEMORY-val, még mindig képes futtatni egy AI MODÉLT, és az oldal meg fogja mutatni, milyen gyorsan.
Kártya vásárlás
A forgalmazók bármely tétel ellenében listázhatnak kártyákat eladásra ebben a katalógusban, így egy kártyaoldal megmutathatja, hogy a hardver mit fut, és hol vásárolható meg. A listázások a konkrét alaplap-változathoz kapcsolódnak, nem pedig egy modell névhez, ami itt fontosabb, mint általában — a same name gyakran több memória kapacitást fed le, és a kapacitás az, ami eldönti, hogy mely modellek futnak.
Értékelési listák
A legtöbb VRAM
A kapacitás határozza meg, hogy mely modellek illenek egyáltalán..
legmagasabb sávszélesség
A sávszélesség határozza meg, milyen gyorsan futnak, miután illeszkednek..
A legnagyobb energiaigényű
Ellenőrizze ezeket a már meglévő készletével..
A táblázat olvasása
Hogyan olvassuk ezt a katalógust
- VRAM
- Mennyit tud tartani a kártya. Egy durva útmutató szerint egy kicsivel több mint fél gigabájt egymilliárd paraméterenként a legtöbb ember által használt tömörítésnél, plusz hely a beszélgetéshez. Nem minden elérhető — az inferencia szoftver körülbelül tizedet tart fenn a saját munkaterülete számára.
- Sávszélesség
- Hogyan gyorsan olvassa a kártya a saját memóriaját, gigabájt másodpercenként. Ez az egyetlen legjobb előrejelző a generáció sebességére ezen az oldalon.
- Növelő és alap óra
- Mennyire gyorsan fut a processzor. Teljeskörűség érdekében felsorolva, és sokkal kevésbé prediktív itt, mint egy játékbeli teljesítményteszten: a generáció a MEMORY-n vár, nem az aritmetikán.
- Memória típus és busz interfész
- A memória technológia és hogy a kártya hogyan csatlakozik a géphez. Az HBM alkatrészek adatközponti hardverek, amelyek sokkal nagyobb sávszélességgel rendelkeznek, mint a GDDR, amit asztali kártyákon használnak. Az busz interfész határozza meg, hogy milyen gyorsan töltődik be egy modell, nem azt, hogy milyen gyorsan fut.
- Teljesítmény
- A lap értékelt rajzolása wattokban. Érdemes szűrni, ha a tápegység vagy a ház már eldőlt, mivel a legnagyobb kártyák lényegesen többet igényelnek, mint amit egy tipikus asztali számítógép biztosít.
- Miért jelenik meg egy kártya többször?
- Minden sor egy lapváltozat, nem pedig egy chip, így ugyanaz a név több memóriakapacitáson is megjelenhet. Ez a megkülönböztetés itt fontosabb, mint bárhol máshol, mert a kapacitás dönti el, hogy egy modell fut-e.
Válaszok
gyakori kérdések
Hogyan számolom ki a másodpercenkénti tokentéma számot a GPU-m esetében?
Nem kell. Találd meg a kártyádat a fenti táblázatban — a katalógus tartalmazza 818 őket — és nyisd meg. Az oldala felsorolja az összes nyelvi modellt, amelyet futtathat, és becsült token másodpercenkénti számot ad meg mindegyikhez, amelyet a kártya memória sávszélessége és a modell tömörített mérete alapján számítottak ki.
Mi a jó token másodpercenként AI helyi futtatásához?
A olvasási sebesség körülbelül tíz token másodpercenként, így bármi, ami ezen felül van, gyorsabban termel szöveget, mint ahogy el tudod olvasni, és az azonnalinak tűnik. Öt és tíz között használható, de észrevehetően lassú. Öt alatt kényelmetlen a beszélgetéshez, bár még mindig megfelelő az olyan munkához, amit futva hagysz.
Melyik GPU specifikáció a legfontosabb az AI számára?
Memória kapacitás először, mert az egész modellt a kártyán kell tárolni, mielőtt bármit is tudna generálni, és sávszélesség másodszor, mert minden egyes token generálása azt jelenti, hogy a modellt egyszer ki kell olvasni a memóriából. A magok száma és az órajelek döntik el a grafikus teljesítményt, és alig számítanak itt.
Mennyi VRAM-ra van szükségem egy nyelvi modell futtatásához?
Körülbelül egy gigabyte fölött van egy milliárd paraméterre a legtöbb ember által használt tömörítésnél, plusz hely a beszélgetéshez. Ez egy nyolcmilliárd-paraméteres modellt kényelmesen nyolc gigabájt környékére, a harmincmilliárdosat pedig huszonnégyre helyez. Az ebben a katalógusban található kártyák árai a következőnél kezdődnek 4 GB és elérni 288 GB.
Hány GPU kártya van ebben az adatbázisban?
A katalógus tartalmaz 818 kártyák készült általa AMD, ATI, Intel and NVIDIA. Az integrált grafikák kizárásra kerülnek, mert nincs saját memóriájuk, így a négy gigabájt alatti kártyák is, amelyekre egyetlen modell sem illeszkedik a katalógusunkban, semmilyen tömörítés mellett.
Melyik GPU rendelkezik a legmagasabb memória-sávszélességgel?
Az van Radeon Instinct MI355X, elérni 8,190 GB/s. Mivel a generációs sebesség szinte közvetlenül követi a sávszélességet, ezért ez is az egyik leggyorsabb kártya itt a szöveg előállítására — hogy ez számít-e, az először attól függ, hogy a modelled belefér-e.
Melyik GPU-nak van a legtöbb VRAM-ja?
Az van Radeon Instinct MI355X, tartás 288 GB. A kapacitás ezen a szinten adatközponti terület, és ez teszi lehetővé a legnagyobb open weight modellek egyetlen kártyán való tárolását ahelyett, hogy több kártyára lenne elosztva.
Elég jó-e egy gaming GPU kártya a helyi AI-hoz?
Egy időben egy személy számára, általában igen, és gyakran jobb értéket képvisel, mint a datacenter hardver. A fogyasztói kártyák a teljes memóriát feláldozzák a sebesség helyett, így a korlát az, hogy mely modellek férnek el, nem pedig az, hogy milyen gyorsan futnak, miután megtették.
Fontos a gyártó az AI teljesítménye szempontjából?
Több, mint kellene. Az Inferencia szoftverbe sokkal több munkát fektettek a CUDA úton, mint a lehetőségekbe, így egy hasonló sávszélességű AMD vagy Intel kártya jellemzően kisebb arányt ér el a teoretikus plafonjának. A becsléseink büntetést alkalmaznak ezért, ahelyett, hogy azt feltételeznénk, hogy a hardver az egyetlen változó.
Használhatok két grafikus kártyát együtt?
Igen, és ez gyakran a lényeg — két KÁRTYA tart olyan MODELLEKET, amelyeket egyik sem tudna egyedül elviselni. Nem kétszerezi a generálási sebességet úgy, ahogy a MEMÓRIÁT, és az ezen az oldalon található minden szám egyetlen KÁRTYÁT ír le önállóan.
Mennyire pontosak ezek a token/másodperc becslések?
A specifikációkból számolják ki őket, nem pedig mérik, és mindegyik tartományban van közzétéve, nem pedig egyetlen számként. Ugyanez a kártya és modell harminc-harmincöt százalékkal változik attól függően, hogy melyik inferencia szoftvert használja, és annak melyik verzióját, amit a specifikációs lapokból végzett számítások nem tudnak megjósolni. A tartományt tekintse az őszinte válasznak.
Tudom, melyik AI modellt akarom. Kereshetek fordítva?
Igen. Az AI modellek szakasz felsorolja az összes modellt, ami ON FILE van, és minden modell oldalán a grafikus kártyák neve szerepel, amelyek futtatni tudják, legkisebbtől a leggyorsabbig. Ez ugyanaz a számítás, amelyet az ellentétes végéből közelítünk meg.
A másik irány
Másik oldalról nézve?
Ez az oldal a hardverrel kezdődik. Ha már tudod, hogy melyik AI MODEL-t szeretnéd futtatni, és tudni szeretnéd, hogy mi szükséges hozzá, ott kezdj. — felsorolja az adatbázisunkban lévő összes modellt, és mindegyikhez megnevezi azokat a kártyákat, amelyek futtathatják.