Katalog
GPU TPS kalkulátor
Zjistěte, kolik tokenů za sekundu jakákoliv grafická karta produkuje na místním AI modelu. Filtrujte katalog níže na karty, které stojí za zvážení, pak jednu otevřete a zjistěte, jaký jazykový model může provozovat, kolik paměti každý potřebuje a jak rychlá pravděpodobně bude..
818
karty v databázi
4
výrobci
4 GB – 288 GB
rozsah VRAM
8,190 GB/s
nejvyšší šířka pásma
Každé slovo musí něco odpovídat, takže více slov zúží seznam. Kapacita jako 24gb odpovídá paměti na kartě, i když žádný sloupec to neuchovává jako text..
818 karty odpovídají
Aktualizace| Typ paměti | Síla | ||||||
|---|---|---|---|---|---|---|---|
| B300 NVIDIA · Blackwell Ultra | 288 GB | 8,000 GB/s | 2.03 GHz | 1.67 GHz | Sep 2025 | HBM3e | 1,400 W |
| Radeon Instinct MI350X AMD · CDNA 4.0 | 288 GB | 8,190 GB/s | 2.2 GHz | 1 GHz | Jan 2025 | HBM3e | 1,000 W |
| Radeon Instinct MI355X AMD · CDNA 4.0 | 288 GB | 8,190 GB/s | 2.4 GHz | 1 GHz | Jan 2025 | HBM3e | 1,400 W |
| Radeon Instinct MI325X AMD · CDNA 3.0 | 256 GB | 6,000 GB/s | 2.1 GHz | 1 GHz | Oct 2024 | HBM3e | 1,000 W |
| Radeon Instinct MI300X AMD · CDNA 3.0 | 192 GB | 5,325 GB/s | 2.1 GHz | 1 GHz | Dec 2023 | HBM3 | 750 W |
| Radeon Instinct MI308X AMD · CDNA 3.0 | 192 GB | 5,325 GB/s | 2.1 GHz | 1 GHz | Dec 2023 | HBM3 | 750 W |
| B200 NVIDIA · Blackwell | 180 GB | 8,000 GB/s | 1.97 GHz | 700 MHz | Jan 2024 | HBM3e | 1,000 W |
| H200 NVL NVIDIA · Hopper | 141 GB | 4,890 GB/s | 1.79 GHz | 1.37 GHz | Nov 2024 | HBM3e | 600 W |
| H200 SXM 141 GB NVIDIA · Hopper | 141 GB | 4,890 GB/s | 1.98 GHz | 1.5 GHz | Nov 2024 | HBM3e | 700 W |
| Data Center GPU Max 1550 Intel · Generation 12.5 | 128 GB | 3,280 GB/s | 1.6 GHz | 900 MHz | Jan 2023 | HBM2e | 600 W |
| Data Center GPU Max Subsystem Intel · Generation 12.5 | 128 GB | 3,210 GB/s | 1.6 GHz | 900 MHz | Jan 2023 | HBM2e | 2,400 W |
| GB10 NVIDIA · Blackwell 2.0 | 128 GB | 273 GB/s | 2.42 GHz | 1.67 GHz | Oct 2025 | LPDDR5X | 140 W |
| Jetson T5000 NVIDIA · Blackwell | 128 GB | 273 GB/s | 2.53 GHz | 1.67 GHz | Aug 2025 | LPDDR5X | 40 W |
| Radeon Instinct MI250 AMD · CDNA 2.0 | 128 GB | 3,280 GB/s | 1.7 GHz | 1 GHz | Nov 2021 | HBM2e | 500 W |
| Radeon Instinct MI250X AMD · CDNA 2.0 | 128 GB | 3,280 GB/s | 1.7 GHz | 1 GHz | Nov 2021 | HBM2e | 500 W |
| Radeon Instinct MI300 AMD · CDNA 3.0 | 128 GB | 6,550 GB/s | 1.7 GHz | 1 GHz | Jan 2023 | HBM3 | 600 W |
| Radeon Instinct MI300A AMD · CDNA 3.0 | 128 GB | 5,325 GB/s | 2.1 GHz | 1 GHz | Dec 2023 | HBM3 | 750 W |
| Data Center GPU Max 1350 Intel · Generation 12.5 | 96 GB | 2,460 GB/s | 1.55 GHz | 750 MHz | Jan 2023 | HBM2e | 450 W |
| H100 PCIe 96 GB NVIDIA · Hopper | 96 GB | 3,360 GB/s | 1.84 GHz | 1.67 GHz | Mar 2023 | HBM3 | 700 W |
| H100 SXM5 96 GB NVIDIA · Hopper | 96 GB | 3,360 GB/s | 1.98 GHz | 1.35 GHz | Mar 2023 | HBM3 | 700 W |
| RTX PRO 6000 Blackwell NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.62 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 600 W |
| RTX PRO 6000 Blackwell Max-Q NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.28 GHz | 1.04 GHz | Mar 2025 | GDDR7 | 300 W |
| RTX PRO 6000 Blackwell Server NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.62 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 600 W |
| RTX PRO 6000D Blackwell Max-Q NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.29 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 300 W |
| H100 NVL 94 GB NVIDIA · Hopper | 94 GB | 3,940 GB/s | 1.79 GHz | 1.08 GHz | Mar 2023 | HBM3 | 400 W |
| H100 SXM5 94 GB NVIDIA · Hopper | 94 GB | 3,360 GB/s | 1.98 GHz | 1.35 GHz | Mar 2023 | HBM3 | 700 W |
| RTX 6000D NVIDIA · Blackwell 2.0 | 84 GB | 1,570 GB/s | 2.43 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 600 W |
| A100 PCIe 80 GB NVIDIA · Ampere | 80 GB | 1,940 GB/s | 1.41 GHz | 1.07 GHz | Jun 2021 | HBM2e | 300 W |
| A100 SXM4 80 GB NVIDIA · Ampere | 80 GB | 2,040 GB/s | 1.41 GHz | 1.28 GHz | Nov 2020 | HBM2e | 400 W |
| A100X NVIDIA · Ampere | 80 GB | 2,040 GB/s | 1.44 GHz | 795 MHz | Jun 2021 | HBM2e | 300 W |
Krok za krokem
Jak vypočítat TPS vaší GPU
Nic tu není třeba řešit ručně. Výše uvedený katalog již obsahuje každou kartu a každá stránka karty již obsahuje každý model, který může spustit s uvedeným počtem tokenů za sekundu. K dosažení odpovědi potřebujete šest kroků..
-
01
Zúžit katalog na karty, které stojí za zvážení
Použijte filtry výše, abyste nastavili, co skutečně potřebujete — minimální velikost VRAM, výrobce, maximální výkon, který může vaše napájení zpracovat, nebo rok vydání. VRAM je filtr, se kterým je třeba začít, protože rozhoduje, které modely jsou vůbec možné.
-
02
Nebo hledejte GPU, který již vlastníte
Napište název do vyhledávacího pole. Každé slovo musí odpovídat něčemu, takže více slov zúží seznam a kapacita jako 24GB odpovídá na paměti karty, ačkoli žádný sloupec to neukládá jako text.
-
03
Seřadit podle specifikace, která určuje váš výsledek
Seřaďte podle paměti, pokud je otázka, které modely se vejdou, nebo podle šířky pásma, pokud je otázka, jak rychle poběží. Rychlosti hodin a počty jader jsou uvedeny pro úplnost, ale sotva ovlivňují generování textu.
-
04
Otevřete kartu
Každá KARTA má svou vlastní stránku, na které jsou uvedeny všechny jazykové MODELy, které může spustit, odhadovaný počet tokenů za sekundu, paměť, kterou každý MODEL potřebuje, a komprese, na které běží.
-
05
Nastavte svou context length a minimum quality
Na stránce karty nastavte délku konverzace, kterou očekáváte, že budete pracovat, a nejnižší kompresi, kterou jste ochotni přijmout. Oba mění odpověď spíše než ji filtrují — delší konverzace potřebuje více MEMORY, což může celý velký model posunout mimo kartu.
-
06
Přečtěte si rozsah, nejediné číslo
Každé číslo propustnosti je zveřejněno s rozsahem důvěry kolem něj. Berte tento rozsah jako odpověď: stejná karta a model se liší mezi inference enginy a verzemi způsoby, které žádný specifikační list nepředpovídá, a hlavní číslo je pouze uprostřed tohoto spektra.
Co čísla znamenají
Co je tento katalog
Toto je databáze obsahující 818 grafické karty, filtrované na ty, které mají dostatek VRAM pro uložení jazykového modelu. Každý card má svou vlastní stránku a na té stránce je každý model, který sledujeme, posouzen podle toho — zda se vejde, s jakým kompresí a kolik tokenů za sekundu pravděpodobně vyprodukuje.
Výpočet se provádí, když otevřete GPU kartu, místo aby byl vyhledáván ze uložené tabulky, což umožňuje, aby byla délka kontextu a minimální kvalita věci, které nastavíte, místo aby byly věcmi, které jsme předpokládali vaším jménem. Změňte cokoliv a každé číslo se přepočítá.
Proč je počet tokenů za sekundu číslo, které má význam
Spuštění jazykového modelu na vlastním hardwaru se v krátkém čase stalo běžnou záležitostí. Open-weight modely dostihly dostatečně úroveň, aby byly skutečně užitečné, a nástroje k jejich spuštění přestaly vyžadovat výzkumné zázemí. Co nepřišlo spolu s tím, byla přímá odpověď na první otázku, kterou si každý klade: poběží na kartě, kterou už mám, a bude dostatečně rychlé na to, aby stálo za použití.
Specifikace neodpovídají. Jsou psány pro grafické pracovní zátěže a vedou s čísly, která rozhodují o snímkových frekvencích, což jsou téměř úplně nesprávná čísla. Dvě čísla, která skutečně rozhodují o výsledku, jsou kapacita paměti, která určuje, zda model fit, a šířka pásma paměti, která určuje, jak rychle generuje, jakmile tak učiní.
Tokenů za sekundu je číslo, které vyjadřuje výsledek v něčem, co můžete cítit. Rychlost čtení je někde kolem deseti tokenů za sekundu, takže cokoliv nad tím přichází rychleji, než to můžete přečíst, a cokoliv pod tím vypadá jako čekání. To je číslo, které tato stránka počítá pro každou kombinaci karty a modelu, kterou má.
Co katalog pokrývá
rozsah VRAM
4 GB – 288 GB
nejvyšší šířka pásma
8,190 GB/s
Rozsah výkonu
6 – 2,400 W
Paměť v katalogu začíná na 4 GB a dosáhne 288 GB. Ten rozsah je rozdíl mezi kartou omezenou na nejmenší použitelné modely a jednou, která drží modely, na které žádný stolní stroj nedosáhne — kapacita je tvrdá brána spíše než postupný kompromis, takže model buď fits, nebo nerun.
Šířka paměti začíná na 10 GB/s a dosáhne 8,190 GB/s, figura držená Radeon Instinct MI355X. Protože generování každého tokenu znamená přečíst celý model z VRAM najednou, toto rozšíření se téměř přímo promítá do rozšíření v rychlosti generování: karta s desetinásobnou šířkou pásma produkuje tokeny přibližně desetkrát rychleji na stejném modelu.
Karty v katalogu jsou vyrobeny výrobci AMD, ATI, Intel and NVIDIA. Výrobce má větší význam, než by měl: inference software měl mnohem více pozornosti věnované CUDA cestě než jakékoliv jiné, takže karta AMD nebo Intel s ekvivalentní šířkou pásma obvykle dosahuje menší části svého teoretického stropu. Naše odhady uplatňují trest za to, spíše než aby předpokládaly, že hardware je jedinou proměnnou.
Spotřeba energie začíná na 6 W a dosáhne 2,400 W. Horní konec je datacentrový hardware, který desktopový zdroj nedokáže napájet, a je to omezení, které lidé obvykle odhalují jako poslední — poté, co karta vyhovuje rozpočtu a skříni.
Datum vydání začíná na 2009 a spustit na 2025, takže katalog pokrývá hardware, který lidé stále vlastní, stejně jako hardware, který by si mohli koupit. Starší karta není vyloučena jen proto, že je stará — pokud má dostatečné MEMORY, může stále SPUSŤIT model, a stránka uvede, jak rychle.
Koupě karty
Prodejci mohou uvádět karty na prodej proti jakémukoli záznamu v tomto katalogu, takže stránka karty může ukazovat jak hardware poběží, tak kde jej lze zakoupit. Inzeráty jsou připojeny k specifické variantě desky spíše než k názvu modelu, což zde hraje větší roli než obvykle — stejné jméno často pokrývá několik kapacit paměti, a kapacita je to, co rozhoduje, které modely běží.
Žebříčky
Většina paměti
Kapacita rozhoduje, které modely se vůbec vejdou.
nejvyšší šířka pásma
Šířka pásma rozhoduje, jak rychle běží, jakmile se vejdou.
Nejnáročnější
Zkontrolujte je vůči zásobám, které již vlastníte..
Čtení tabulky
Jak číst tento katalog
- Paměť
- Kolik může karta pojmout. Hrubý průvodce je něco málo přes půl gigabajtu na miliardu parametrů při kompresi, kterou většina lidí používá, plus prostor pro konverzaci. Ne všechno je k dispozici — inference software si vyhrazuje přibližně desetinovou část pro svůj vlastní pracovní prostor.
- Šířka pásma
- Jak rychle karta čte svou vlastní MEMORY, v gigabytech za sekundu. Toto je jediný nejlepší prediktor rychlosti generace kdekoli na tomto webu.
- Boost a základní frekvence
- Jak rychle procesor funguje. Uvedeno pro úplnost a zde je mnohem méně prediktivní než na herním benchmarku: generace čeká na MEMORY, ne na aritmetiku.
- Typ paměti a rozhraní sběrnice
- Technologie paměti a jak se karta připojuje k stroji. HBM části jsou hardware v datovém centru s mnohem větší šířkou pásma než GDDR používané na desktopových kartách. Busové rozhraní určuje, jak rychle se model načítá, nikoli jak rychle běží.
- Síla
- Jmenovitý odběr desky ve wattech. Stojí za to filtrovat, když je zdroj energie nebo skříň již rozhodnuta, protože největší karty potřebují výrazně více než nabízí typický desktop.
- Proč se karta objevuje více než jednou
- Každý řádek je variantou desky spíše než čipu, takže stejné jméno se může objevit u několika kapacit paměti. Toto rozlišení je zde důležitější než kdekoli jinde, protože kapacita rozhoduje o tom, zda model běží.
Odpovědi
běžné otázky
Jak vypočítám tokeny za sekundu mého GPU?
Nemusíte. Najděte svou kartu v tabulce výše — katalog obsahuje 818 z nich — a otevřít to. Jeho stránka uvádí každý jazykový model, který může spustit, s odhadovaným počtem tokenů za sekundu pro každý z nich, vypočítaným na základě šířky pásma paměti karty a velikosti modelu po kompresi.
Jaký je dobrý počet tokenů za sekundu pro spuštění AI lokálně?
Rychlost čtení je zhruba deset tokenů za sekundu, takže vše nad tím produkuje text rychleji, než ho můžete přečíst, a působí okamžitě. Mezi pěti a deseti je použitelná, ale znatelně pomalá. Pod pět je nepohodlná pro konverzaci, i když stále v pořádku pro práci, kterou necháváte běžet.
Která specifikace GPU je nejdůležitější pro AI?
Kapacita paměti nejdříve, protože celý model musí být držet na GPU kartě, než může cokoliv generovat, a šířka pásma druhá, protože generování každého tokenu znamená čtení toho modelu z paměti jednou. Počty jader a taktovací rychlosti rozhodují o grafickém výkonu a zde se sotva registrují.
Kolik VRAM potřebuji k spuštění jazykového modelu?
Jako hrubý průvodce, něco přes půl gigabytu na miliardu parametrů při kompresi, kterou většina lidí používá, plus místo pro konverzaci. To umístí model s osmi miliardami parametrů pohodlně na osm gigabytů a model s třiceti miliardami na dvacet čtyři. Karty v tomto katalogu začínají na 4 GB a dosáhnout 288 GB.
Kolik grafických karet je v této databázi?
Katalog obsahuje 818 desky vyrobeno pomocí AMD, ATI, Intel and NVIDIA. Integrované grafiky jsou vyloučeny, protože nemají vlastní paměť, a také karty pod čtyři gigabajty, na které žádný model v našem katalogu nevyhovuje za žádné komprese.
Která GPU má nejvyšší propustnost paměti?
To je Radeon Instinct MI355X, dosahování 8,190 GB/s. Jelikož rychlost generování téměř přímo odpovídá šířce pásma, patří také mezi nejrychlejší karty zde pro produkci textu — ačkoli to, zda je to důležité, závisí nejprve na tom, zda váš model se vejde.
Která GPU má nejvíce VRAM?
To je Radeon Instinct MI355X, držení 288 GB. Kapacita na této úrovni je území datových center a umožňuje držet největší OPEN WEIGHT modely na jediné kartě namísto toho, aby byly rozděleny do několika.
Je herní GPU karta dostatečně dobrá pro lokální AI?
Pro jednu osobu najednou, obvykle ano, a často lepší hodnota než hardware datacentra. Spotřebitelské karty obětují celkovou MEMORY spíše než rychlost, takže limitem je, které modely se vejdou, spíše než jak rychle běží, když se vejdou.
Záleží na výrobci pro výkon AI?
Více než by mělo. Inference software měl daleko více práce vložené do CUDA cesty než do alternativ, takže karta AMD nebo Intel s ekvivalentní šířkou pásma typicky dosahuje menšího podílu svého teoretického stropu. Naše odhady uplatňují penalizaci za to, místo aby předpokládaly, že hardware je jedinou proměnnou.
Mohu používat dvě grafické karty společně?
Ano, a často jde o hlavní důvod - dvě karty drží modely, které by žádná z nich nedokázala držet sama. Nezdvojuje to rychlost generace tak, jak to zdvojuje paměť, a každá číslice na této stránce popisuje jednu kartu samotnou.
Jak přesné jsou tyto odhady tokenů za sekundu?
Jsou vypočítány ze specifikací, spíše než měřeny, a každá je publikována s rozpětím, spíše než jako jedno číslo. Ta samá karta a model se liší o třicet až padesát procent v závislosti na tom, který inference software používáte a kterou jeho verzi, což žádný výpočet ze specifikačních listů nemůže předpovědět. Zacházejte s rozpětím jako s poctivou odpovědí.
Vím, který MODEL chci. Můžu hledat obráceně?
Ano. Sekce AI modelů uvádí každý model na souboru, a stránka každého modelu uvádí grafické karty, které ho mohou spustit, nejmenší a nejrychlejší jako první. To je stejné výpočty přístupované z opačného konce.
Druhý směr
Díváte se na to z druhé strany?
Tato stránka začíná u hardwaru. Pokud již víte, který MODEL chcete RUNIT a potřebujete vědět, co je zapotřebí, začněte tam místo toho. — vypisuje každý model na souboru a každý z nich uvádí karty, které ho mohou spustit.