Memória-kötött áteresztőképesség, élőben számítva

Futtathatja a GPU-ja azt az AI modellt? A GPU TPS kalkulátor

Válassz egy GPU kártyát vagy egy nyelvi modellt, és kiszámítjuk — élőben, nem egy kereső táblázatból — hogy illeszkedik-e, milyen tömörítéssel, és körülbelül hány token per másodpercet várhatsz..

Minden pár kérésre számítva Kibocsátva, mint egy tartomány Formulák az open-ben

Élő becslés

Bejegyzés
Qwen3-8B
18.6 tok/s
15.8 várt tartomány 22.3

Formátum

Q8_0

Környezet

13k

Bizalom

high

Megoldott példák

Nézd meg ezeket az erőteljes kombinációkat

Néhány párosítás, amit egy barátnak ajánlanánk, különböző költségvetéseknél..

A belépési pont

12 GB
GeForce RTX 3060 12 GB
Qwen3-8B
18.6 tok/s
15.8 22.3
Q8_0 13k Környezet

A középút

16 GB
GeForce RTX 4080
Qwen3-14B
29.8 tok/s
25.3 35.8
Q6_K 15k Környezet

A nagyfiú beállítás

32 GB
GeForce RTX 5090
40.8 tok/s
24.5 65.3
Q6_K 35k Környezet

01

GPU-k összehasonlítása

VRAM, memória sávszélesség, tensor magok és FP16 átvitel.

02

Becsült token másodpercenként

A dekódolási sebességet a memória sávszélesség korlátozza, így inkább modellezzük, mintsem a csúcsteljesítményt idéznénk..

03

Ellenőrizze, mi fér el

Mely modellek futnak egy KÁRTYÁN, milyen kvantizáción, és mennyi KONTEKSTUS hosszúsággal?.

A probléma

Miért nehéz kérdés az, hogy "Futtatni fogja-e a GPU-m ezt?"

Egy specifikációs lap megmondja egy kártya VRAM-ját és óra sebességét. Nem mondja meg, hogy egy adott nyelvi modell elfér-e abban a VRAM-ban, mi marad a kártyából magára a beszélgetésre, vagy hány token per másodperc jön ki a másik végén — és ezekre a három kérdésre nem ugyanaz a válasz két GPU- és modellpár esetében.

A számítás őszinte verziója a modell paramétereinek számát és architektúráját, a tárolt tömörítési formátumot, a kártya memória sávszélességét és azt, hogy mennyire érett az inferencia szoftvere, valamint a beszélgetés hosszát, amelyet meg szeretne beszélni vele, összevonja. Ha bármelyikük hibás, a kimeneti szám ugyanolyan magabiztosnak tűnik, és egyszerűen helytelen.

Nem azt állítjuk, hogy ez egyetlen pontos számot produkál, mert nem tud. Amit helyette teszünk, az az, hogy teljes számítást végzünk minden kártyára és minden modellre, amiről adatokat tartunk nyilván, a hasilményt tartományként publikáljuk hamis precizitású pontérték helyett, és bemutatjuk a munkánkat — minden formula, ami minden szám mögött ezen az oldalon áll, nyilvánosan ki van írva, nem rejtett az eredmény mögé.

Mit ad valójában ez az oldal?

A legteljesebb adatállomány, amit össze tudtunk állítani: ezrekkel a GPU kártyákból és ezrekkel a nyelvi modellekből, amelyek egymással összevetve, nem pedig egyesével nézve. Kezdj egy kártyával, amelyet birtokolsz vagy fontolgatsz, és nézd meg minden modellt, ami elfér rajta. Kezdj egy modellel, amit futtatni szeretnél, és nézd meg minden kártyát, ami elbírja.

Ez mindkét irányban működik, mert az alapul szolgáló számítás szimmetrikus - ugyanaz a MEMORY- és BANDWIDTH-aritmetika, függetlenül attól, hogy melyik oldalról indítod, amelyiket már ismered. Egyik irány sem a "valódi"; ugyanazt a választ kérdezik két különböző módon.

Tudjon meg többet arról, hogyan és miért a mi tájékoztató oldal.

Újonnan megjelent

Nézd meg ezeket a hatalmas új modelleket

Böngésszen az összes AI model között

NVIDIA

Jun 2026

Nemotron 3 Ultra
550B Paraméterek

Kompatibilis GPU

B300

Prime Intellect,Arcee AI

Feb 2026

Arcee Trinity Large
398B Paraméterek

Kompatibilis GPU

B300

Alibaba

Feb 2026

Qwen3.5 397B-A17B
397B Paraméterek

Kompatibilis GPU

B300

Újonnan megjelent

Nézd meg ezeket az erőteljes új GPU-kat

Böngéssz az összes GPU között

NVIDIA

Oct 2025

Elég erős ahhoz, hogy futtassa

Laguna S 2.1 · 118B

NVIDIA

Oct 2025

GB10
128 GB VRAM

Elég erős ahhoz, hogy futtassa

Solar Open2 250B · 250.3B

AMD

Sep 2025

Radeon PRO W7900D
48 GB VRAM

Elég erős ahhoz, hogy futtassa

Qwen3-Coder-Next · 80B

Mindkét irány

Hogyan működik a számológép

Ugyanez a számítás, használható attól az oldalról, ahonnan a kérdést kezded..

Egy általad birtokolt GPU-ból indulva

  1. 01 Találd meg a GPU kártyádat . Keresd meg a GPU katalógusban azt a kártyát, amelyet birtokolsz vagy mérlegelsz, név vagy memória méret alapján.
  2. 02 Nyisd meg az oldalát . Minden KÁRTYÁNAK van saját oldala, amely felsorolja az összes NYELV MODELLEKET, amelyeket értékelhetünk vele szemben, és minden egyes modellhez egy becsült TOKEN PER MÁSODPERC szám található.
  3. 03 Állítsa be a kontextushosszát és a minőségi küszöböt . Állítsa be a beszélgetés hosszát, amelyen dolgozni szeretne, és a legalacsonyabb tömörítést, amelyet elfogad. Mindkettő élőben változtatja meg a választ.
  4. 04 Olvasd el a tartományt, ne egyetlen számot . Minden becslés egy bizalmi tartománnyal van közzétéve, nem pedig egy hamis precizitású számmal, mert ugyanaz a kártya és modell a következtetési motorok között olyan módon változik, amit egy specifikációs lap nem jelez előre.

Kezdve egy modellel, amelyet futtatni szeretnél

  1. 01 Találd meg a modellt . Keresd az AI modell katalógust név vagy méret alapján — még akkor is, ha a név önmagában nem jelzi a paraméterek számát.
  2. 02 Nyisd meg az oldalát . Egy open weight model minden GPU kártyát felsorol, amellyel össze tudjuk hasonlítani, legkisebb, ami elfér és leggyorsabb elöl.
  3. 03 Állítsa be a kontextushosszát és a minőségi küszöböt . Ugyanaz a két vezérlő, mint a GPU-első úton — egy hosszabb beszélgetéshez több MEMORY szükséges, ami egy KÁRTYÁT "illik"-ról "nem illik"-ra tolhat.
  4. 04 Hasonlítsa össze a kártyákat az alapján, amit valójában észre fog venni. . A memória dönti el, hogy egyáltalán fut-e; a sávszélesség dönti el, milyen gyorsan működik, miután elindult. Az alapértelmezett táblázat a másodpercenkénti tokenek szerint rendez, mert általában ez az, ami számít.

Válaszok

gyakori kérdések

01

Hogyan számoljam ki, hogy a GPU-m képes-e futtatni egy helyi LLM-et?

Találd meg a kártyádat a GPU katalógusban és nyisd meg az oldalát — itt felsorolják az összes modellt, amelyet össze tudunk hasonlítani vele, hogy mindegyik elfér-e a VRAM-ban, és egy becsült tokens-per-second értéket is megadsz. Azt is megteheted, hogy egy modellel indulsz, és megnézed, mely kártyák tudják futtatni, ami ugyanaz a számítás az ellenkező irányból.

02

Futtathatja a GPU-m a helyi LLM modelleket egyáltalán?

Ha van legalább néhány gigabájt a saját memóriájából, majdnem biztosan valami. Az integrált grafikus kártyák, amelyek megosztják a rendszer memóriáját, a fő kivételek, mivel nincs dedikált készletük egy modell tárolására. Ezen túlmenően az a kérdés, hogy melyik modell, milyen tömörítés — nem igen vagy nem.

03

Mi határozza meg a tokenek számát másodpercenként egy GPU-n?

A token generálása azt jelenti, hogy egyszer kiolvassuk a modell súlyait a MEMÓRIÁBÓL, így a sebességet a MEMÓRIA SÁVSZÉLESSÉGE korlátozza, osztva azzal, hogy mennyit kell kiolvasni tokenenként - ami a modell méretétől, architektúrájától és a tárolási tömörítési formátumtól függ. A óra sebessége és a magok száma, amiket a specifikációs lap hangsúlyoz, alig számít.

04

Hány pontosak a becslések ezen az oldalon?

Várd, hogy a valódi érték körülbelül 20–40%-on belül legyen a becsléshez képest. Ugyanez a GPU és modell ennyire változhat az inferencia motorok, motor verziók és szolgáltatási konfigurációk között — önálló specifikációs lapokból származó számítás nem képes ezt megjósolni, ezért minden itt szereplő érték tartományként van közzétéve.

05

Egy nagyobb, újabb GPU mindig gyorsabb az AI számára?

Egy olyan modell számára, amely már kényelmesen elfér mindkét KÁRTYÁN, a MEMÓRIA SÁVszélesség dönt a győztesről, és egy újabb KÁRTYA általában többel rendelkezik belőle. De a gyakoribb szűk keresztmetszet a kapacitás, nem a sebesség — a konkrét KÁRTYÁRA vonatkozó hasznosabb kérdés általában az, hogy "mi a legnagyobb modell, ami elfér", amire minden KÁRTYA oldala közvetlenül válaszol.

06

Szükséges értenem a kvantálást ahhoz, hogy használhassam ezt az oldalt?

Nem — minden KÁRTYA és MODELL oldal automatikusan a legjobb minőségű tömörítést választja, ami valóban belefér. A kvantizáció az a technika, amely csökkenti egy modell MEMÓRIA méretét, csekély költséggel a kimeneti minőségre, és saját magad is beállíthatod a minőségi határt, ha szeretnéd, de semmi nem kötelez rá.

07

Honnan származnak a GPU és az AI modellek adatállományai?

Grafikus kártya specifikációk és nyelvi modell nyilvántartások, amelyek több ezer OPEN WEIGHT modellt és azok paraméter számát, licencelési és kiadási dátumokat tartalmaznak. Mindkettőt frissítik, amikor új HARDVER és modellek jelennek meg — a teljes lefedettségért lásd a GPU és AI MODEL katalógusokat.

Hardver értékesítése

Érdekli, hogy eladóvá váljon?

Sorolja fel eladó GPU-it közvetlenül a válasz mellé, hogy mit tudnak valóban futtatni..

Hamarosan

Értesítést kap az új GPU-król és modellekről

Hamarosan érkezik egy hírlevél..

Hamarosan

További felfedezés

Böngéssze a teljes GPU katalógust vagy böngéssze a teljes AI modell katalógust. Hardver vásárlás? ellenőrizze a szállítókönyvtárat. További kérdésekre válaszolunk az adatbázisunkban. GYIK oldal, vagy Lépjen kapcsolatba velünk közvetlenül.