Memória-kötött átbocsátás, élőben kiszámítva
El tudja futtatni a GPU azt a modellt? A GPU TPS kalkulátor
Válassz egy grafikus kártyát vagy egy nyelvi modellt, és kiszámoljuk — élőben, nem egy kereső táblázatból — hogy illik-e, milyen tömörítéssel, és körülbelül hány tokent várhatsz másodpercenként..
Élő becslés
Belépés
Q8_0
Modellek nem illeszkednek a GPU VRAM-ba. Túl szoros. Az AI modell könnyen futtatható, van elegendő hely. Melyik AI modellt tudja futtatni a GPU?
13k
Bizonytalanság
high
Model/modelok működtetése, nem illeszkedik, szoros = alig futtatható, kényelmes = könnyen fut, fejlesztési terület: GPU, AI, TPS, VRAM, CUDA, Tensor, Inference, Quantization, LoRA, GGUF, FP16, INT4, INT8.
Nézd meg ezeket az erőteljes kombinációkat
Néhány párosítás, amit egy barátnak ajánlanánk, különböző költségvetések mellett..
A belépési pont
12 GBA középút
16 GBA nagyfiú beállítás
32 GB01
GPU-k összehasonlítása
VRAM, memória sávszélesség, tensor magok és FP16 átvitel oldalt egymás mellett.
02
TPS becslés
A dekódolás sebességét a memória sávszélessége korlátozza, így inkább modellezzük, mintsem a csúcs TFLOPS-ot idéznénk..
03
Ellenőrizd, mi illeszkedik
Milyen modellek futnak egy kártyán, melyik kvantizálással és mennyi kontextussal?.
A probléma
Miért nehéz kérdés az, hogy "futtatni fogja-e a GPU-m ezt?"
A specifikációs lap megmondja egy kártya memóriáját és óra sebességét. Nem mondja el, hogy egy adott nyelvi modell elfér-e abban a memóriában, mi marad a kártyán a beszélgetéshez, vagy hány token másodpercenként jön ki a másik végén - és ezek a három kérdés nem adja meg ugyanazt a választ bármely két GPU- és modellpárra.
Ez a számítás őszinte változata magában foglalja a modell paramétereit és architektúráját, a tárolásra használt tömörítési formát, a kártya memória sávszélességét és azt, hogy mennyire érett az inference szoftvere, valamint a beszélgetés hosszát, amelyet vele tervezel folytatni. Ha bármelyik ezek közül téves, a kimeneti szám ugyanolyan magabiztosnak tűnik, viszont egyszerűen helytelen.
Nem azt állítjuk, hogy ez pontosan egyetlen számot ad, mert nem tud. Amit ehelyett teszünk, az az, hogy végigfuttatjuk a teljes számítást minden kártyára és minden modellre, amiről adatunk van, a találatokat tartományként publikáljuk, nem pedig hamis precizitású pontértékként, és bemutatjuk a munkánkat - az ezen az oldalon található minden szám mögötti képlet nyíltan le van írva, nem rejtve a válasz mögé.
Mit ad valójában ez az oldal?
A lehető legteljesebb adathalmazon, amit össze tudtunk állítani: több ezer grafikus kártya és több ezer nyelvi modell, egymással összehasonlítva, nem pedig egyenként vizsgálva. Kezdj egy általad birtokolt vagy fontolóra vett kártyával, és nézd meg az összes modellt, ami elfér rajta. Kezdj egy modellt, amit futtatni szeretnél, és nézd meg az összes kártyát, ami elbír vele.
Ez mindkét irányban működik, mert az alapul szolgáló számítás szimmetrikus — ugyanaz a memória- és sávszélesség-ármuzás, amelyet bármely oldalról futtathatsz, amit már tudsz. Egyik irány sem a "valódi"; ugyanaz a válasz két különböző módon feltéve.
további információkat olvashat arról, hogyan és miért a mi információs oldal.
Újonnan megjelent
Nézd meg ezeket az új, erőteljes modelleket.
Böngésszen az összes AI modell közöttÚjonnan megjelent
Fedezd fel ezeket az erőteljes új GPU-kat
Böngéssz az összes GPU közöttNVIDIA
Oct 2025
Mindkét irányban
Hogyan működik a számológép
Ugyanaz a számítás, amely bárhonnan indítható, ahonnan a kérdést felteszed..
Egy meglévő GPU-val kezdve
- 01 Találd meg a grafikus kártyádat. Keresd meg a GPU katalógusában a kártyát, amelyet birtokolsz vagy fontolgatsz, név vagy memóriaméret szerint.
- 02 Nyisd meg az oldalát. Minden kártyának megvan a saját oldala, amelyen felsorolják az összes nyelvi modellt, amelyet ellenőrizni tudunk vele, valamint a becsült token-per-másodperc értéket minden egyeshez.
- 03 Állítsa be a kontextus hosszát és a minőségi küszöböt.. Állj meg!
- 04 Olvasd el a tartományt, nem egyetlen számot.. Minden becslést egy megbízhatósági tartománnyal tesznek közzé, nem pedig egy hamis pontosságú számmal, mert ugyanaz a kártya és modell változik az inferencia motorok között olyan módokon, amelyeket egy specifikációs lap nem jósol meg.
Egy modellt szeretnél futtatni.
- 01 Találd meg a modellt. Keresd meg az AI modellek katalógusát név szerint vagy méret szerint - még akkor is, ha a név önmagában nem jelzi a paraméterek számát.
- 02 Nyisd meg az oldalát. Egy modell nyitott súlyokkal felsorolja minden grafikus kártyát, amellyel ellenőrizni tudjuk, a legkisebb, ami illeszkedik, és a leggyorsabb elsőként.
- 03 Állítsa be a kontextus hosszát és a minőségi küszöböt.. Ugyanaz a két vezérlő, mint a GPU-első útvonalon — egy hosszabb beszélgetéshez több memória szükséges, ami egy kártyát „fitting”-ből „nem fitting”-be lökhet.
- 04 Hasonlítsd össze a kártyákat azzal, amit valóban észlelni fogsz.. A memória dönti el, hogy fut-e egyáltalán; a sávszélesség határozza meg, hogy milyen gyorsnak érzi magát, miután elindul. Az asztal alapértelmezés szerint a másodpercenkénti tokenek szerint rendez, mert általában ez az, ami számít.
válik / nem fér el
Gyakori kérdések
Hogyan számoljam ki, hogy a GPU-m képes-e futtatni egy helyi LLM-et?
Találd meg a kártyádat a GPU katalógusban és nyisd meg az oldalát - felsorolja az összes modellt, amelyet ezzel össze tudunk hasonlítani, hogy mindegyik hogyan illeszkedik a memóriába, és egy becsült token-per-másodperc értéket. Lehetőséged van arra is, hogy egy modellből indulj ki és nézd meg, mely kártyák tudják futtatni, ami ugyanaz a számítás az ellentétes irányból.
Futtathatja a GPU-m a helyi LLM modelleket egyáltalán?
Ha van saját memóriája, ami legalább néhány gigabájt, szinte biztos, hogy valami. Az integrált grafikus kártyák, amelyek a rendszermemóriát osztják meg, a fő kivétel, mivel nincs dedikált tartományuk egy modell tárolására. Ezen túlmenően kérdés, hogy melyik modell, milyen tömörítéssel — nem egyszerű igen vagy nem.
Mi határozza meg a TPS-t egy GPU-n?
A token generálása azt jelenti, hogy egyszer elolvassuk a modell súlyait a memóriából, így a sebességet a memória sávszélessége korlátozza, elosztva azzal, hogy mennyit kell olvasni tokenenként — ami a modell méretétől, architektúrájától és a tárolási tömörítési formátumtól függ. Az óra sebessége és a magok száma, amelyekkel egy specifikációs lap kezdődik, alig számítanak.
Mennyire pontosak a becslések ezen az oldalon?
Várj a valódi számra, ami körülbelül a becslés 20–40%-án belül fog megérkezni. Ugyanez a GPU és modell ennyire eltérő lehet az inferencia motorok, motor verziók és szolgáltatási konfigurációk között — egyedül a specifikációs lapokból végzett számítások nem tudják ezt megjósolni, ezért minden itt közzétett adat tartományként van megadva.
Egy nagyobb, újabb GPU mindig gyorsabb az AI számára?
Egy olyan modell esetében, amely már kényelmesen elfér mindkét kártyán, a memória sávszélessége dönti el a győztest, és egy újabb kártya általában többel rendelkezik. De a gyakoribb szűk keresztmetszet a kapacitás, nem a sebesség — a konkrét kártyára vonatkozóan a hasznosabb kérdés általában az, hogy "melyik a legnagyobb modell, ami elfér", amit minden kártya oldala közvetlenül válaszol.
Szükségem van értenem a kvantálást ahhoz, hogy használhassam ezt az oldalt?
Nem — minden kártya és modell oldal a legjobb minőségű tömörítést választja ki, ami valóban illeszkedik, automatikusan. A kvantálás egy olyan technika, amely csökkenti egy modell memória lábnyomát, csekély költséggel a kimeneti minőség kapcsán, és beállíthat egy minőségi alsó határt, ha szeretne, de semmi sem kötelezi erre.
Honnan származnak a GPU és az AI modellek adathalmazai?
Grafikus kártya specifikációk és nyelvi modell nyilvántartások, amelyek ezrek nyílt súlyú modelljét és azok paraméterszámát, licencét és kiadási dátumait tartalmazzák. Mindkettőt frissítjük, ahogy új hardverek és modellek jelennek meg – tekintse meg a GPU és AI modell katalogusokat a teljes lefedettségért.
Hardver értékesítése
Érdeklik az eladóvá válás?
Listázza az eladó GPU-kat közvetlenül az alatt, hogy mit tudnak valójában futtatni..
Hamarosan
Értesüljön az új GPU-król és modellekről
Hamarosan érkezik egy hírlevél.
Fedezze fel tovább
Böngéssze az teljes GPU katalógust böngéssze a teljes AI modell katalógust. Vásárol hardware-t? ellenőrizze a szállítókönyvtárat. FAQ oldal, kapcsolatba lép velünk .