Katalog

GPU TPS kalkulátor

Zjistěte, kolik tokenů za sekundu jakákoliv grafická karta produkuje na místním AI modelu. Filtrujte katalog níže na karty, které stojí za zvážení, pak jednu otevřete a zjistěte, jaký jazykový model může provozovat, kolik paměti každý potřebuje a jak rychlá pravděpodobně bude..

818

karty v databázi

4

výrobci

4 GB – 288 GB

rozsah VRAM

8,190 GB/s

nejvyšší šířka pásma

Každé slovo musí něco odpovídat, takže více slov zúží seznam. Kapacita jako 24gb odpovídá paměti na kartě, i když žádný sloupec to neuchovává jako text..

818 karty odpovídají

Aktualizace
Typ paměti Síla
B300 NVIDIA · Blackwell Ultra 288 GB 8,000 GB/s 2.03 GHz 1.67 GHz Sep 2025 HBM3e 1,400 W
Radeon Instinct MI350X AMD · CDNA 4.0 288 GB 8,190 GB/s 2.2 GHz 1 GHz Jan 2025 HBM3e 1,000 W
Radeon Instinct MI355X AMD · CDNA 4.0 288 GB 8,190 GB/s 2.4 GHz 1 GHz Jan 2025 HBM3e 1,400 W
Radeon Instinct MI325X AMD · CDNA 3.0 256 GB 6,000 GB/s 2.1 GHz 1 GHz Oct 2024 HBM3e 1,000 W
Radeon Instinct MI300X AMD · CDNA 3.0 192 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
Radeon Instinct MI308X AMD · CDNA 3.0 192 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
B200 NVIDIA · Blackwell 180 GB 8,000 GB/s 1.97 GHz 700 MHz Jan 2024 HBM3e 1,000 W
H200 NVL NVIDIA · Hopper 141 GB 4,890 GB/s 1.79 GHz 1.37 GHz Nov 2024 HBM3e 600 W
H200 SXM 141 GB NVIDIA · Hopper 141 GB 4,890 GB/s 1.98 GHz 1.5 GHz Nov 2024 HBM3e 700 W
Data Center GPU Max 1550 Intel · Generation 12.5 128 GB 3,280 GB/s 1.6 GHz 900 MHz Jan 2023 HBM2e 600 W
Data Center GPU Max Subsystem Intel · Generation 12.5 128 GB 3,210 GB/s 1.6 GHz 900 MHz Jan 2023 HBM2e 2,400 W
GB10 NVIDIA · Blackwell 2.0 128 GB 273 GB/s 2.42 GHz 1.67 GHz Oct 2025 LPDDR5X 140 W
Jetson T5000 NVIDIA · Blackwell 128 GB 273 GB/s 2.53 GHz 1.67 GHz Aug 2025 LPDDR5X 40 W
Radeon Instinct MI250 AMD · CDNA 2.0 128 GB 3,280 GB/s 1.7 GHz 1 GHz Nov 2021 HBM2e 500 W
Radeon Instinct MI250X AMD · CDNA 2.0 128 GB 3,280 GB/s 1.7 GHz 1 GHz Nov 2021 HBM2e 500 W
Radeon Instinct MI300 AMD · CDNA 3.0 128 GB 6,550 GB/s 1.7 GHz 1 GHz Jan 2023 HBM3 600 W
Radeon Instinct MI300A AMD · CDNA 3.0 128 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
Data Center GPU Max 1350 Intel · Generation 12.5 96 GB 2,460 GB/s 1.55 GHz 750 MHz Jan 2023 HBM2e 450 W
H100 PCIe 96 GB NVIDIA · Hopper 96 GB 3,360 GB/s 1.84 GHz 1.67 GHz Mar 2023 HBM3 700 W
H100 SXM5 96 GB NVIDIA · Hopper 96 GB 3,360 GB/s 1.98 GHz 1.35 GHz Mar 2023 HBM3 700 W
RTX PRO 6000 Blackwell NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.62 GHz 1.59 GHz Mar 2025 GDDR7 600 W
RTX PRO 6000 Blackwell Max-Q NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.28 GHz 1.04 GHz Mar 2025 GDDR7 300 W
RTX PRO 6000 Blackwell Server NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.62 GHz 1.59 GHz Mar 2025 GDDR7 600 W
RTX PRO 6000D Blackwell Max-Q NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.29 GHz 1.59 GHz Mar 2025 GDDR7 300 W
H100 NVL 94 GB NVIDIA · Hopper 94 GB 3,940 GB/s 1.79 GHz 1.08 GHz Mar 2023 HBM3 400 W
H100 SXM5 94 GB NVIDIA · Hopper 94 GB 3,360 GB/s 1.98 GHz 1.35 GHz Mar 2023 HBM3 700 W
RTX 6000D NVIDIA · Blackwell 2.0 84 GB 1,570 GB/s 2.43 GHz 1.59 GHz Mar 2025 GDDR7 600 W
A100 PCIe 80 GB NVIDIA · Ampere 80 GB 1,940 GB/s 1.41 GHz 1.07 GHz Jun 2021 HBM2e 300 W
A100 SXM4 80 GB NVIDIA · Ampere 80 GB 2,040 GB/s 1.41 GHz 1.28 GHz Nov 2020 HBM2e 400 W
A100X NVIDIA · Ampere 80 GB 2,040 GB/s 1.44 GHz 795 MHz Jun 2021 HBM2e 300 W

Krok za krokem

Jak vypočítat TPS vaší GPU

Nic tu není třeba řešit ručně. Výše uvedený katalog již obsahuje každou kartu a každá stránka karty již obsahuje každý model, který může spustit s uvedeným počtem tokenů za sekundu. K dosažení odpovědi potřebujete šest kroků..

  1. 01

    Zúžit katalog na karty, které stojí za zvážení

    Použijte filtry výše, abyste nastavili, co skutečně potřebujete — minimální velikost VRAM, výrobce, maximální výkon, který může vaše napájení zpracovat, nebo rok vydání. VRAM je filtr, se kterým je třeba začít, protože rozhoduje, které modely jsou vůbec možné.

  2. 02

    Nebo hledejte GPU, který již vlastníte

    Napište název do vyhledávacího pole. Každé slovo musí odpovídat něčemu, takže více slov zúží seznam a kapacita jako 24GB odpovídá na paměti karty, ačkoli žádný sloupec to neukládá jako text.

  3. 03

    Seřadit podle specifikace, která určuje váš výsledek

    Seřaďte podle paměti, pokud je otázka, které modely se vejdou, nebo podle šířky pásma, pokud je otázka, jak rychle poběží. Rychlosti hodin a počty jader jsou uvedeny pro úplnost, ale sotva ovlivňují generování textu.

  4. 04

    Otevřete kartu

    Každá KARTA má svou vlastní stránku, na které jsou uvedeny všechny jazykové MODELy, které může spustit, odhadovaný počet tokenů za sekundu, paměť, kterou každý MODEL potřebuje, a komprese, na které běží.

  5. 05

    Nastavte svou context length a minimum quality

    Na stránce karty nastavte délku konverzace, kterou očekáváte, že budete pracovat, a nejnižší kompresi, kterou jste ochotni přijmout. Oba mění odpověď spíše než ji filtrují — delší konverzace potřebuje více MEMORY, což může celý velký model posunout mimo kartu.

  6. 06

    Přečtěte si rozsah, nejediné číslo

    Každé číslo propustnosti je zveřejněno s rozsahem důvěry kolem něj. Berte tento rozsah jako odpověď: stejná karta a model se liší mezi inference enginy a verzemi způsoby, které žádný specifikační list nepředpovídá, a hlavní číslo je pouze uprostřed tohoto spektra.

Co čísla znamenají

Co je tento katalog

Toto je databáze obsahující 818 grafické karty, filtrované na ty, které mají dostatek VRAM pro uložení jazykového modelu. Každý card má svou vlastní stránku a na té stránce je každý model, který sledujeme, posouzen podle toho — zda se vejde, s jakým kompresí a kolik tokenů za sekundu pravděpodobně vyprodukuje.

Výpočet se provádí, když otevřete GPU kartu, místo aby byl vyhledáván ze uložené tabulky, což umožňuje, aby byla délka kontextu a minimální kvalita věci, které nastavíte, místo aby byly věcmi, které jsme předpokládali vaším jménem. Změňte cokoliv a každé číslo se přepočítá.

Proč je počet tokenů za sekundu číslo, které má význam

Spuštění jazykového modelu na vlastním hardwaru se v krátkém čase stalo běžnou záležitostí. Open-weight modely dostihly dostatečně úroveň, aby byly skutečně užitečné, a nástroje k jejich spuštění přestaly vyžadovat výzkumné zázemí. Co nepřišlo spolu s tím, byla přímá odpověď na první otázku, kterou si každý klade: poběží na kartě, kterou už mám, a bude dostatečně rychlé na to, aby stálo za použití.

Specifikace neodpovídají. Jsou psány pro grafické pracovní zátěže a vedou s čísly, která rozhodují o snímkových frekvencích, což jsou téměř úplně nesprávná čísla. Dvě čísla, která skutečně rozhodují o výsledku, jsou kapacita paměti, která určuje, zda model fit, a šířka pásma paměti, která určuje, jak rychle generuje, jakmile tak učiní.

Tokenů za sekundu je číslo, které vyjadřuje výsledek v něčem, co můžete cítit. Rychlost čtení je někde kolem deseti tokenů za sekundu, takže cokoliv nad tím přichází rychleji, než to můžete přečíst, a cokoliv pod tím vypadá jako čekání. To je číslo, které tato stránka počítá pro každou kombinaci karty a modelu, kterou má.

Co katalog pokrývá

rozsah VRAM

4 GB – 288 GB

nejvyšší šířka pásma

8,190 GB/s

Rozsah výkonu

6 – 2,400 W

Paměť v katalogu začíná na 4 GB a dosáhne 288 GB. Ten rozsah je rozdíl mezi kartou omezenou na nejmenší použitelné modely a jednou, která drží modely, na které žádný stolní stroj nedosáhne — kapacita je tvrdá brána spíše než postupný kompromis, takže model buď fits, nebo nerun.

Šířka paměti začíná na 10 GB/s a dosáhne 8,190 GB/s, figura držená Radeon Instinct MI355X. Protože generování každého tokenu znamená přečíst celý model z VRAM najednou, toto rozšíření se téměř přímo promítá do rozšíření v rychlosti generování: karta s desetinásobnou šířkou pásma produkuje tokeny přibližně desetkrát rychleji na stejném modelu.

Karty v katalogu jsou vyrobeny výrobci AMD, ATI, Intel and NVIDIA. Výrobce má větší význam, než by měl: inference software měl mnohem více pozornosti věnované CUDA cestě než jakékoliv jiné, takže karta AMD nebo Intel s ekvivalentní šířkou pásma obvykle dosahuje menší části svého teoretického stropu. Naše odhady uplatňují trest za to, spíše než aby předpokládaly, že hardware je jedinou proměnnou.

Spotřeba energie začíná na 6 W a dosáhne 2,400 W. Horní konec je datacentrový hardware, který desktopový zdroj nedokáže napájet, a je to omezení, které lidé obvykle odhalují jako poslední — poté, co karta vyhovuje rozpočtu a skříni.

Datum vydání začíná na 2009 a spustit na 2025, takže katalog pokrývá hardware, který lidé stále vlastní, stejně jako hardware, který by si mohli koupit. Starší karta není vyloučena jen proto, že je stará — pokud má dostatečné MEMORY, může stále SPUSŤIT model, a stránka uvede, jak rychle.

Koupě karty

Prodejci mohou uvádět karty na prodej proti jakémukoli záznamu v tomto katalogu, takže stránka karty může ukazovat jak hardware poběží, tak kde jej lze zakoupit. Inzeráty jsou připojeny k specifické variantě desky spíše než k názvu modelu, což zde hraje větší roli než obvykle — stejné jméno často pokrývá několik kapacit paměti, a kapacita je to, co rozhoduje, které modely běží.

Čtení tabulky

Jak číst tento katalog

Paměť
Kolik může karta pojmout. Hrubý průvodce je něco málo přes půl gigabajtu na miliardu parametrů při kompresi, kterou většina lidí používá, plus prostor pro konverzaci. Ne všechno je k dispozici — inference software si vyhrazuje přibližně desetinovou část pro svůj vlastní pracovní prostor.
Šířka pásma
Jak rychle karta čte svou vlastní MEMORY, v gigabytech za sekundu. Toto je jediný nejlepší prediktor rychlosti generace kdekoli na tomto webu.
Boost a základní frekvence
Jak rychle procesor funguje. Uvedeno pro úplnost a zde je mnohem méně prediktivní než na herním benchmarku: generace čeká na MEMORY, ne na aritmetiku.
Typ paměti a rozhraní sběrnice
Technologie paměti a jak se karta připojuje k stroji. HBM části jsou hardware v datovém centru s mnohem větší šířkou pásma než GDDR používané na desktopových kartách. Busové rozhraní určuje, jak rychle se model načítá, nikoli jak rychle běží.
Síla
Jmenovitý odběr desky ve wattech. Stojí za to filtrovat, když je zdroj energie nebo skříň již rozhodnuta, protože největší karty potřebují výrazně více než nabízí typický desktop.
Proč se karta objevuje více než jednou
Každý řádek je variantou desky spíše než čipu, takže stejné jméno se může objevit u několika kapacit paměti. Toto rozlišení je zde důležitější než kdekoli jinde, protože kapacita rozhoduje o tom, zda model běží.

Odpovědi

běžné otázky

01

Jak vypočítám tokeny za sekundu mého GPU?

Nemusíte. Najděte svou kartu v tabulce výše — katalog obsahuje 818 z nich — a otevřít to. Jeho stránka uvádí každý jazykový model, který může spustit, s odhadovaným počtem tokenů za sekundu pro každý z nich, vypočítaným na základě šířky pásma paměti karty a velikosti modelu po kompresi.

02

Jaký je dobrý počet tokenů za sekundu pro spuštění AI lokálně?

Rychlost čtení je zhruba deset tokenů za sekundu, takže vše nad tím produkuje text rychleji, než ho můžete přečíst, a působí okamžitě. Mezi pěti a deseti je použitelná, ale znatelně pomalá. Pod pět je nepohodlná pro konverzaci, i když stále v pořádku pro práci, kterou necháváte běžet.

03

Která specifikace GPU je nejdůležitější pro AI?

Kapacita paměti nejdříve, protože celý model musí být držet na GPU kartě, než může cokoliv generovat, a šířka pásma druhá, protože generování každého tokenu znamená čtení toho modelu z paměti jednou. Počty jader a taktovací rychlosti rozhodují o grafickém výkonu a zde se sotva registrují.

04

Kolik VRAM potřebuji k spuštění jazykového modelu?

Jako hrubý průvodce, něco přes půl gigabytu na miliardu parametrů při kompresi, kterou většina lidí používá, plus místo pro konverzaci. To umístí model s osmi miliardami parametrů pohodlně na osm gigabytů a model s třiceti miliardami na dvacet čtyři. Karty v tomto katalogu začínají na 4 GB a dosáhnout 288 GB.

05

Kolik grafických karet je v této databázi?

Katalog obsahuje 818 desky vyrobeno pomocí AMD, ATI, Intel and NVIDIA. Integrované grafiky jsou vyloučeny, protože nemají vlastní paměť, a také karty pod čtyři gigabajty, na které žádný model v našem katalogu nevyhovuje za žádné komprese.

06

Která GPU má nejvyšší propustnost paměti?

To je Radeon Instinct MI355X, dosahování 8,190 GB/s. Jelikož rychlost generování téměř přímo odpovídá šířce pásma, patří také mezi nejrychlejší karty zde pro produkci textu — ačkoli to, zda je to důležité, závisí nejprve na tom, zda váš model se vejde.

07

Která GPU má nejvíce VRAM?

To je Radeon Instinct MI355X, držení 288 GB. Kapacita na této úrovni je území datových center a umožňuje držet největší OPEN WEIGHT modely na jediné kartě namísto toho, aby byly rozděleny do několika.

08

Je herní GPU karta dostatečně dobrá pro lokální AI?

Pro jednu osobu najednou, obvykle ano, a často lepší hodnota než hardware datacentra. Spotřebitelské karty obětují celkovou MEMORY spíše než rychlost, takže limitem je, které modely se vejdou, spíše než jak rychle běží, když se vejdou.

09

Záleží na výrobci pro výkon AI?

Více než by mělo. Inference software měl daleko více práce vložené do CUDA cesty než do alternativ, takže karta AMD nebo Intel s ekvivalentní šířkou pásma typicky dosahuje menšího podílu svého teoretického stropu. Naše odhady uplatňují penalizaci za to, místo aby předpokládaly, že hardware je jedinou proměnnou.

10

Mohu používat dvě grafické karty společně?

Ano, a často jde o hlavní důvod - dvě karty drží modely, které by žádná z nich nedokázala držet sama. Nezdvojuje to rychlost generace tak, jak to zdvojuje paměť, a každá číslice na této stránce popisuje jednu kartu samotnou.

11

Jak přesné jsou tyto odhady tokenů za sekundu?

Jsou vypočítány ze specifikací, spíše než měřeny, a každá je publikována s rozpětím, spíše než jako jedno číslo. Ta samá karta a model se liší o třicet až padesát procent v závislosti na tom, který inference software používáte a kterou jeho verzi, což žádný výpočet ze specifikačních listů nemůže předpovědět. Zacházejte s rozpětím jako s poctivou odpovědí.

12

Vím, který MODEL chci. Můžu hledat obráceně?

Ano. Sekce AI modelů uvádí každý model na souboru, a stránka každého modelu uvádí grafické karty, které ho mohou spustit, nejmenší a nejrychlejší jako první. To je stejné výpočty přístupované z opačného konce.

Druhý směr

Díváte se na to z druhé strany?

Tato stránka začíná u hardwaru. Pokud již víte, který MODEL chcete RUNIT a potřebujete vědět, co je zapotřebí, začněte tam místo toho. — vypisuje každý model na souboru a každý z nich uvádí karty, které ho mohou spustit.

AI modely