Paměťově omezený průchod, vypočítaný živě
Může váš GPU spustit ten AI model? Kalkulačka GPU TPS
Vyberte GPU kartu nebo jazykový model a my spočítáme — živě, ne z tabulky — zda se vejdou, s jakou kompresí a přibližně kolik tokenů za sekundu můžeme očekávat..
Živý odhad
VstupFormát
Q8_0
Kontext
13k
Důvěra
high
Pracovní příklady
Podívejte se na tyto výkonné kombinace
Pár kombinací, na které bychom upozornili přítele, s různými rozpočty.
01
Porovnejte GPU
VRAM, šířka pásma paměti, tenzorová jádra a propustnost FP16.
02
Odhad tokenů za sekundu
Rychlost dešifrování je omezena šířkou pásma paměti, takže ji modelujeme spíše než abychom uváděli špičkové TFLOPS..
03
Zkontrolujte, co se vejde
Které modely běží na kartě, s jakou kvantizací a s kolik kontextem.
Problém
Proč "bude moje GPU schopna to spustit?" je těžká otázka
Specifika uvádějí velikost paměti karty a její taktovací frekvenci. Neříká vám, zda konkrétní jazykový model se vejde do této paměti po kompresi, kolik paměti karty zůstává pro samotnou konverzaci, nebo kolik tokenů za sekundu skutečně vychází na druhém konci — a tyto tři otázky nemají stejnou odpověď pro jakékoliv dvě GPU-a-modelové páry.
Odhad z této kalkulace zahrnuje počet parametrů modelu a jeho architekturu, kompresní formát, ve kterém je uložen, šířku pásma paměti karty a to, jak vyspělý je jeho inference software, a délku konverzace, kterou s ním máte v úmyslu mít. Jakékoli jedno z těchto špatně, číslo, které vyjde, vypadá stejně sebevědomě a je jednoduše nesprávné.
Nevyjadřujeme, že to produkuje jedinou přesnou hodnotu, protože to není možné. Místo toho provádíme úplný výpočet pro každou KARTU a každý MODEL, pro který máme údaje, publikujeme výsledek jako rozsah spíše než jako hodnotu s falešnou přesností a ukazujeme naši práci - každá formule za každým číslem na tomto webu je zveřejněna otevřeně, není skryta za odpovědí.
Co vám tato stránka vlastně poskytuje
Nejkompletnější datový soubor, který jsme mohli sestavit: tisíce GPU karet a tisíce jazykových modelů, vzájemně zkontrolovaných místo aby byly prozkoumávány jednu po druhé. Začněte od karty, kterou vlastníte nebo o které uvažujete, a podívejte se na každý model, který se na ni vejde. Začněte od modelu, který chcete spustit, a podívejte se na každou kartu, která ho může pojmout.
To funguje v obou směrech, protože základní výpočet je symetrický — stejné MEMORY-AND-BANDWIDTH aritmetika, provedena z kterékoliv strany, kterou už znáte. Ani jeden směr není ten "skutečný"; jsou to stejné odpovědi, zeptané dvěma různými způsoby.
Přečtěte si více o tom, jak a proč na našem o stránce.
Nově vydané
Podívejte se na tyto výkonné nové GPU.
Procházejte všechny GPUNVIDIA
Oct 2025
Obě směry
Jak funguje kalkulačka
Stejný výpočet, použitelný z jakékoliv strany otázky, ze které začínáte..
Začínající od GPU, které vlastníte
- 01 Najdi svou GPU kartu . Prohledejte katalog GPU pro kartu, kterou vlastníte nebo zvažujete, podle názvu nebo podle velikosti paměti.
- 02 Otevřít jeho stránku . Každá KARTA má svou vlastní stránku, která uvádí každý jazykový MODEL, který můžeme proti ní posoudit, s odhadovaným počtem tokenů za sekundu pro každý.
- 03 Nastavte svou CONTEXT LENGTH a QUALITY FLOOR. . Upravte délku konverzace, kterou očekáváte, že budete pracovat, a nejnižší kompresi, kterou budete akceptovat. Obě mění odpověď živě.
- 04 Přečtěte si rozsah, ne jedno číslo . Každý odhad je zveřejněn s rozsahem důvěry namísto jedné falešné přesnosti, protože stejná karta a model se liší mezi inference enginy způsoby, které žádný technický list nepředpovídá.
Začínající od modelu, který chcete spustit
- 01 Najděte model . Hledejte katalog AI modelů podle názvu nebo podle velikosti — i když název sám o sobě neuvádí počet parametrů.
- 02 Otevřít jeho stránku . Model s otevřenými váhami uvádí každou grafickou kartu, kterou můžeme posoudit, nejmenší, která se vejde, a nejrychlejší první.
- 03 Nastavte svou CONTEXT LENGTH a QUALITY FLOOR. . Ty samé dva ovládací prvky jako cesta s GPU na prvním místě — delší konverzace potřebuje více MEMORY, což může posunout kartu z "fits" na "does not fit".
- 04 Srovnejte karty podle toho, co skutečně zaznamenáte . Paměť rozhoduje, zda vůbec poběží; šířka pásma rozhoduje, jak rychle se cítí, jakmile začne. Tabulka se ve výchozím nastavení řadí podle tokenů za sekundu, protože to je obvykle to, co je důležité.
Odpovědi
běžné otázky
Jak mohu spočítat, zda má moje GPU kapacitu na spuštění lokálního LLM?
Najděte svou kartu v GPU katalogu a otevřete její stránku — obsahuje každý model, který můžeme posoudit vůči ní, zda každý z nich fit v VRAM, a odhadovaný tokeny za sekundu. Můžete také začít od modelu a vidět, které karty jej mohou spustit, což je stejný výpočet z opačného směru.
Může moje GPU vůbec spouštět místní LLM modely?
Pokud má alespoň několik gigabajtů vlastní paměti, téměř jistě něco. Integrované grafiky, které sdílejí systémovou paměť, jsou hlavní výjimkou, protože nemají vyhrazený fond na uložení modelu. Kromě toho je to otázka, který model, při jakém kompresi — ne ano nebo ne.
Co určuje tok tokenů za sekundu na GPU?
Generování tokenu znamená přečíst váhy modelu z VRAM jednou, takže rychlost je omezena šířkou paměti dělenou tím, kolik toho musí být přečteno na token — což závisí na velikosti modelu, jeho architektuře a formátu komprese, v jakém je uložen. Rychlost hodin a počty jader, čísla, kterými specifikace začínají, sotva hrají roli.
Jak přesné jsou odhady na této stránce?
Očekávejte, že skutečné číslo se bude nacházet přibližně v rozmezí 20–40% od odhadu. Stejný GPU a model se mezi různými inference enginy, verzemi enginů a konfiguracemi servírování liší až tolik — žádný výpočet pouze z technických listů nemůže to predikovat, a proto je každé číslo zde uvedeno jako rozsah.
Je větší, novější GPU vždy rychlejší pro AI?
Pro model, který se již pohodlně vejde na obě karty, rozhoduje šířka paměťové sběrnice vítěze, a novější karta obvykle má více z ní. Ale častější úzké hrdlo je kapacita, nikoli rychlost — užitečnější otázka pro konkrétní kartu je obvykle "jaký je největší model, který se vejde", což je to, co každá stránka karty přímo odpovídá.
Potřebuji chápat kvantizaci, abych mohl použít tuto stránku?
Ne — každá karta a stránka modelu vybírá nejlepší kvalitní kompresi, která skutečně vyhovuje, automaticky. Kvantizace je technika, která zmenšuje paměťovou stopu modelu za malou cenu na kvalitě výstupu, a můžete si sami nastavit minimální kvalitu, pokud chcete, ale nic to nevyžaduje.
Odkud pocházejí datové sady GPU a AI modelu?
Specifikace grafických karet a záznamy jazykových modelů pokrývající tisíce open-weight modelů a jejich počty parametrů, licence a data vydání. Oba jsou aktualizovány s novým hardwarem a modely — podívejte se na katalogy GPU a AI modelů pro úplné pokrytí.
Prodej hardwaru
Zajímáte se o to, stát se dodavatelem?
Uveďte své GPU na prodej hned vedle odpovědi, co vlastně mohou spustit..
Brzy dostupné
Získejte upozornění na nové GPU a modely
Časopis brzy přijde.
Prozkoumat dále
Prozkoumat celý GPU katalog nebo procházet celý katalog AI modelů. Kupujete hardware? zkontrolujte adresář dodavatele. Více otázek je zodpovězeno v našem Stránka s častými dotazy, nebo Kontaktujte nás přímo.