Memória-kötött átbocsátás, élőben kiszámítva

El tudja futtatni a GPU azt a modellt? A GPU TPS kalkulátor

Válassz egy grafikus kártyát vagy egy nyelvi modellt, és kiszámoljuk — élőben, nem egy kereső táblázatból — hogy illik-e, milyen tömörítéssel, és körülbelül hány tokent várhatsz másodpercenként..

Minden pár kiszámítva kérésre Közölt tartományban Formulák a nyíltban

Élő becslés

Belépés
futtatás Qwen3-8B
18.6 tok/s
15.8 elvárt tartomány 22.3

Q8_0

Modellek nem illeszkednek a GPU VRAM-ba. Túl szoros. Az AI modell könnyen futtatható, van elegendő hely. Melyik AI modellt tudja futtatni a GPU?

13k

Bizonytalanság

high

Model/modelok működtetése, nem illeszkedik, szoros = alig futtatható, kényelmes = könnyen fut, fejlesztési terület: GPU, AI, TPS, VRAM, CUDA, Tensor, Inference, Quantization, LoRA, GGUF, FP16, INT4, INT8.

Nézd meg ezeket az erőteljes kombinációkat

Néhány párosítás, amit egy barátnak ajánlanánk, különböző költségvetések mellett..

A belépési pont

12 GB
GeForce RTX 3060 12 GB
Qwen3-8B
18.6 tok/s
15.8 22.3
Q8_0 13k Modellek nem illeszkednek a GPU VRAM-ba. Túl szoros. Az AI modell könnyen futtatható, van elegendő hely. Melyik AI modellt tudja futtatni a GPU?

A középút

16 GB
GeForce RTX 4080
Qwen3-14B
29.8 tok/s
25.3 35.8
Q6_K 15k Modellek nem illeszkednek a GPU VRAM-ba. Túl szoros. Az AI modell könnyen futtatható, van elegendő hely. Melyik AI modellt tudja futtatni a GPU?

A nagyfiú beállítás

32 GB
GeForce RTX 5090
40.8 tok/s
24.5 65.3
Q6_K 35k Modellek nem illeszkednek a GPU VRAM-ba. Túl szoros. Az AI modell könnyen futtatható, van elegendő hely. Melyik AI modellt tudja futtatni a GPU?

01

GPU-k összehasonlítása

VRAM, memória sávszélesség, tensor magok és FP16 átvitel oldalt egymás mellett.

02

TPS becslés

A dekódolás sebességét a memória sávszélessége korlátozza, így inkább modellezzük, mintsem a csúcs TFLOPS-ot idéznénk..

03

Ellenőrizd, mi illeszkedik

Milyen modellek futnak egy kártyán, melyik kvantizálással és mennyi kontextussal?.

A probléma

Miért nehéz kérdés az, hogy "futtatni fogja-e a GPU-m ezt?"

A specifikációs lap megmondja egy kártya memóriáját és óra sebességét. Nem mondja el, hogy egy adott nyelvi modell elfér-e abban a memóriában, mi marad a kártyán a beszélgetéshez, vagy hány token másodpercenként jön ki a másik végén - és ezek a három kérdés nem adja meg ugyanazt a választ bármely két GPU- és modellpárra.

Ez a számítás őszinte változata magában foglalja a modell paramétereit és architektúráját, a tárolásra használt tömörítési formát, a kártya memória sávszélességét és azt, hogy mennyire érett az inference szoftvere, valamint a beszélgetés hosszát, amelyet vele tervezel folytatni. Ha bármelyik ezek közül téves, a kimeneti szám ugyanolyan magabiztosnak tűnik, viszont egyszerűen helytelen.

Nem azt állítjuk, hogy ez pontosan egyetlen számot ad, mert nem tud. Amit ehelyett teszünk, az az, hogy végigfuttatjuk a teljes számítást minden kártyára és minden modellre, amiről adatunk van, a találatokat tartományként publikáljuk, nem pedig hamis precizitású pontértékként, és bemutatjuk a munkánkat - az ezen az oldalon található minden szám mögötti képlet nyíltan le van írva, nem rejtve a válasz mögé.

Mit ad valójában ez az oldal?

A lehető legteljesebb adathalmazon, amit össze tudtunk állítani: több ezer grafikus kártya és több ezer nyelvi modell, egymással összehasonlítva, nem pedig egyenként vizsgálva. Kezdj egy általad birtokolt vagy fontolóra vett kártyával, és nézd meg az összes modellt, ami elfér rajta. Kezdj egy modellt, amit futtatni szeretnél, és nézd meg az összes kártyát, ami elbír vele.

Ez mindkét irányban működik, mert az alapul szolgáló számítás szimmetrikus — ugyanaz a memória- és sávszélesség-ármuzás, amelyet bármely oldalról futtathatsz, amit már tudsz. Egyik irány sem a "valódi"; ugyanaz a válasz két különböző módon feltéve.

további információkat olvashat arról, hogyan és miért a mi információs oldal.

Újonnan megjelent

Nézd meg ezeket az új, erőteljes modelleket.

Böngésszen az összes AI modell között

NVIDIA

Jun 2026

Nemotron 3 Ultra
550B paraméterek

Fut a

B300

Prime Intellect,Arcee AI

Feb 2026

Arcee Trinity Large
398B paraméterek

Fut a

B300

Alibaba

Feb 2026

Qwen3.5 397B-A17B
397B paraméterek

Fut a

B300

Újonnan megjelent

Fedezd fel ezeket az erőteljes új GPU-kat

Böngéssz az összes GPU között

NVIDIA

Oct 2025

Elég erős ahhoz, hogy fusson

Mistral Medium 3.5 · 128B

NVIDIA

Oct 2025

GB10
128 GB memória

Elég erős ahhoz, hogy fusson

Solar Open2 250B · 250.3B

AMD

Sep 2025

Radeon PRO W7900D
48 GB memória

Elég erős ahhoz, hogy fusson

Qwen3-Coder-Next · 80B

Mindkét irányban

Hogyan működik a számológép

Ugyanaz a számítás, amely bárhonnan indítható, ahonnan a kérdést felteszed..

Egy meglévő GPU-val kezdve

  1. 01 Találd meg a grafikus kártyádat. Keresd meg a GPU katalógusában a kártyát, amelyet birtokolsz vagy fontolgatsz, név vagy memóriaméret szerint.
  2. 02 Nyisd meg az oldalát. Minden kártyának megvan a saját oldala, amelyen felsorolják az összes nyelvi modellt, amelyet ellenőrizni tudunk vele, valamint a becsült token-per-másodperc értéket minden egyeshez.
  3. 03 Állítsa be a kontextus hosszát és a minőségi küszöböt.. Állj meg!
  4. 04 Olvasd el a tartományt, nem egyetlen számot.. Minden becslést egy megbízhatósági tartománnyal tesznek közzé, nem pedig egy hamis pontosságú számmal, mert ugyanaz a kártya és modell változik az inferencia motorok között olyan módokon, amelyeket egy specifikációs lap nem jósol meg.

Egy modellt szeretnél futtatni.

  1. 01 Találd meg a modellt. Keresd meg az AI modellek katalógusát név szerint vagy méret szerint - még akkor is, ha a név önmagában nem jelzi a paraméterek számát.
  2. 02 Nyisd meg az oldalát. Egy modell nyitott súlyokkal felsorolja minden grafikus kártyát, amellyel ellenőrizni tudjuk, a legkisebb, ami illeszkedik, és a leggyorsabb elsőként.
  3. 03 Állítsa be a kontextus hosszát és a minőségi küszöböt.. Ugyanaz a két vezérlő, mint a GPU-első útvonalon — egy hosszabb beszélgetéshez több memória szükséges, ami egy kártyát „fitting”-ből „nem fitting”-be lökhet.
  4. 04 Hasonlítsd össze a kártyákat azzal, amit valóban észlelni fogsz.. A memória dönti el, hogy fut-e egyáltalán; a sávszélesség határozza meg, hogy milyen gyorsnak érzi magát, miután elindul. Az asztal alapértelmezés szerint a másodpercenkénti tokenek szerint rendez, mert általában ez az, ami számít.

válik / nem fér el

Gyakori kérdések

01

Hogyan számoljam ki, hogy a GPU-m képes-e futtatni egy helyi LLM-et?

Találd meg a kártyádat a GPU katalógusban és nyisd meg az oldalát - felsorolja az összes modellt, amelyet ezzel össze tudunk hasonlítani, hogy mindegyik hogyan illeszkedik a memóriába, és egy becsült token-per-másodperc értéket. Lehetőséged van arra is, hogy egy modellből indulj ki és nézd meg, mely kártyák tudják futtatni, ami ugyanaz a számítás az ellentétes irányból.

02

Futtathatja a GPU-m a helyi LLM modelleket egyáltalán?

Ha van saját memóriája, ami legalább néhány gigabájt, szinte biztos, hogy valami. Az integrált grafikus kártyák, amelyek a rendszermemóriát osztják meg, a fő kivétel, mivel nincs dedikált tartományuk egy modell tárolására. Ezen túlmenően kérdés, hogy melyik modell, milyen tömörítéssel — nem egyszerű igen vagy nem.

03

Mi határozza meg a TPS-t egy GPU-n?

A token generálása azt jelenti, hogy egyszer elolvassuk a modell súlyait a memóriából, így a sebességet a memória sávszélessége korlátozza, elosztva azzal, hogy mennyit kell olvasni tokenenként — ami a modell méretétől, architektúrájától és a tárolási tömörítési formátumtól függ. Az óra sebessége és a magok száma, amelyekkel egy specifikációs lap kezdődik, alig számítanak.

04

Mennyire pontosak a becslések ezen az oldalon?

Várj a valódi számra, ami körülbelül a becslés 20–40%-án belül fog megérkezni. Ugyanez a GPU és modell ennyire eltérő lehet az inferencia motorok, motor verziók és szolgáltatási konfigurációk között — egyedül a specifikációs lapokból végzett számítások nem tudják ezt megjósolni, ezért minden itt közzétett adat tartományként van megadva.

05

Egy nagyobb, újabb GPU mindig gyorsabb az AI számára?

Egy olyan modell esetében, amely már kényelmesen elfér mindkét kártyán, a memória sávszélessége dönti el a győztest, és egy újabb kártya általában többel rendelkezik. De a gyakoribb szűk keresztmetszet a kapacitás, nem a sebesség — a konkrét kártyára vonatkozóan a hasznosabb kérdés általában az, hogy "melyik a legnagyobb modell, ami elfér", amit minden kártya oldala közvetlenül válaszol.

06

Szükségem van értenem a kvantálást ahhoz, hogy használhassam ezt az oldalt?

Nem — minden kártya és modell oldal a legjobb minőségű tömörítést választja ki, ami valóban illeszkedik, automatikusan. A kvantálás egy olyan technika, amely csökkenti egy modell memória lábnyomát, csekély költséggel a kimeneti minőség kapcsán, és beállíthat egy minőségi alsó határt, ha szeretne, de semmi sem kötelezi erre.

07

Honnan származnak a GPU és az AI modellek adathalmazai?

Grafikus kártya specifikációk és nyelvi modell nyilvántartások, amelyek ezrek nyílt súlyú modelljét és azok paraméterszámát, licencét és kiadási dátumait tartalmazzák. Mindkettőt frissítjük, ahogy új hardverek és modellek jelennek meg – tekintse meg a GPU és AI modell katalogusokat a teljes lefedettségért.

Hardver értékesítése

Érdeklik az eladóvá válás?

Listázza az eladó GPU-kat közvetlenül az alatt, hogy mit tudnak valójában futtatni..

Hamarosan

Értesüljön az új GPU-król és modellekről

Hamarosan érkezik egy hírlevél.

Hamarosan