Przepustowość ograniczona pamięcią, obliczana na żywo

Czy twoja GPU może uruchomić ten AI Model? Kalkulator TPS GPU

Wybierz kartę graficzną lub model językowy, a my obliczymy — na żywo, nie z tabeli przeszukiwania — czy się nadaje, przy jakiej kompresji i mniej więcej ile tokenów na sekundę można się spodziewać..

Każda para obliczona na żądanie Opublikowane jako zakres Formuły w open

Na żywo oszacowanie

Wejście
Qwen3-8B
18.6 tok/s
15.8 oczekiwany zakres 22.3

Format

Q8_0

Kontekst

13k

Zaufanie

high

Przykłady robocze

Sprawdź te potężne zestawy

Kilka par, które polecilibyśmy przyjacielowi, w różnych przedziałach cenowych..

Punkt wejścia

12 GB
GeForce RTX 3060 12 GB
Qwen3-8B
18.6 tok/s
15.8 22.3
Q8_0 13k Kontekst

Środkowa droga

16 GB
GeForce RTX 4080
Qwen3-14B
29.8 tok/s
25.3 35.8
Q6_K 15k Kontekst

Duża konfiguracja chłopca

32 GB
GeForce RTX 5090
40.8 tok/s
24.5 65.3
Q6_K 35k Kontekst

01

Porównaj Karty GPU

VRAM, szerokość pasma pamięci, rdzenie tensorowe i przepustowość FP16.

02

Oszacuj tokeny na sekundę

Prędkość dekodowania jest ograniczona przez przepustowość pamięci, więc modelujemy ją raczej niż cytujemy szczytowe TFLOPS..

03

Sprawdź, co pasuje

Które modele działają na karcie, w jakiej kwantyzacji i z jakim kontekstem.

Problem

Dlaczego "czy moja GPU uruchomi to?" jest trudnym pytaniem

Karta specyfikacji informuje o pamięci karty i jej prędkości zegara. Nie mówi, czy konkretny model językowy mieści się w tej pamięci po kompresji, ile miejsca na karcie pozostaje na samą rozmowę, ani ile tokenów na sekundę faktycznie wychodzi na drugim końcu — a te trzy pytania nie mają tej samej odpowiedzi dla żadnej pary GPU i modelu.

Szczerą wersję tego obliczenia uwzględnia liczba parametrów modelu i architektura, format kompresji, w jakim jest przechowywany, przepustowość pamięci karty oraz jak rozwinięte jest oprogramowanie do wnioskowania, a także długość rozmowy, którą zamierzasz z nim prowadzić. Źle obliczając którąkolwiek z tych wartości, uzyskany wynik wydaje się równie pewny, a po prostu jest nieprawidłowy.

Nie udajemy, że to produkuje jedną precyzyjną wartość, ponieważ nie może. Zamiast tego uruchamiamy pełne obliczenia dla każdej karty i każdego modelu, dla którego posiadamy dane, publikujemy wynik jako zakres, a nie jako punktową wartość fałszywej precyzji, i pokazujemy nasze obliczenia — każda formuła za każdym numerem na tej stronie jest jasno przedstawiona, a nie ukryta za odpowiedzią.

Co ta strona tak naprawdę daje ci

Najbardziej kompletna baza danych, którą mogliśmy stworzyć: tysiące kart GPU i tysiące modeli językowych, wzajemnie sprawdzanych, a nie rozpatrywanych pojedynczo. Rozpocznij od karty, którą posiadasz lub którą rozważasz, i zobacz każdy model, który na niej działa. Rozpocznij od modelu, który chcesz uruchomić, i zobacz każdą kartę, która może go pomieścić.

To działa w obu kierunkach, ponieważ podstawowe obliczenie jest symetryczne — ta sama arytmetyka pamięci i przepustowości, uruchamiana z dowolnej strony, którą już znasz. Żaden kierunek nie jest "prawdziwy"; to ta sama odpowiedź zadana na dwa różne sposoby.

Przeczytaj więcej o tym, jak i dlaczego w naszej o stronie.

Nowo wydane

Sprawdź te potężne nowe MODELE

Przeglądaj wszystkie modele AI

NVIDIA

Jun 2026

Nemotron 3 Ultra
550B parametry

Kompatybilne GPU

B300

Prime Intellect,Arcee AI

Feb 2026

Arcee Trinity Large
398B parametry

Kompatybilne GPU

B300

Alibaba

Feb 2026

Qwen3.5 397B-A17B
397B parametry

Kompatybilne GPU

B300

Nowo wydane

Sprawdź te potężne nowe GPU

Przeglądaj wszystkie GPU

NVIDIA

Oct 2025

Wystarczająco potężny, aby uruchomić

Mistral Medium 3.5 · 128B

NVIDIA

Oct 2025

GB10
128 GB VRAM

Wystarczająco potężny, aby uruchomić

Solar Open2 250B · 250.3B

AMD

Sep 2025

Radeon PRO W7900D
48 GB VRAM

Wystarczająco potężny, aby uruchomić

Qwen3-Coder-Next · 80B

Oba kierunki

Jak działa kalkulator

Ta sama kalkulacja, użyteczna z każdej strony pytania, od której zaczynasz..

Zaczynając od GPU, które posiadasz

  1. 01 Znajdź swoją kartę GPU . Szukaj w katalogu GPU karty, którą posiadasz lub którą rozważasz, według nazwy lub według rozmiaru pamięci.
  2. 02 Otwórz swoją stronę . Każda KARTA ma swoją stronę, na której znajduje się każdy model językowy, który możemy ocenić w odniesieniu do niej, z oszacowaną liczbą tokenów na sekundę dla każdego.
  3. 03 Ustal długość kontekstu i minimalną jakość . Dostosuj długość rozmowy, którą oczekujesz, aby pracować, oraz najniższy poziom kompresji, jaki zaakceptujesz. Oba zmieniają odpowiedź na żywo.
  4. 04 Przeczytaj zakres, nie pojedynczą liczbę . Każda estymacja jest publikowana z zakresem pewności, a nie z jedną fałszywie precyzyjną cyfrą, ponieważ ta sama KARTA i MODELE różnią się między silnikami wnioskowania w sposób, którego żadna karta specyfikacji nie przewiduje.

Zaczynając od modelu, który chcesz uruchomić

  1. 01 Znajdź model . Szukaj w katalogu modeli AI według nazwy lub rozmiaru — nawet gdy sama nazwa nie podaje liczby parametrów.
  2. 02 Otwórz swoją stronę . Model z otwartymi wagami wymienia każdą kartę graficzną, z którą możemy go ocenić, najmniejsza, która się mieści i najszybsza jako pierwsza.
  3. 03 Ustal długość kontekstu i minimalną jakość . Te same dwa kontrolery co ścieżka GPU-first — dłuższa rozmowa potrzebuje więcej pamięci, co może przesunąć kartę z "pasuje" do "nie pasuje".
  4. 04 Porównaj karty pod kątem tego, co faktycznie zauważysz . Pamięć decyduje, czy w ogóle działa; przepustowość decyduje, jak szybko się odczuwa, gdy już działa. Tabela sortuje według tokenów na sekundę domyślnie, ponieważ to zazwyczaj ma znaczenie.

Odpowiedzi

częste pytania

01

Jak obliczyć, czy moja GPU może uruchomić lokalny LLM?

Znajdź swoją kartę w katalogu GPU i otwórz jej stronę — znajduje się na niej każda wersja, którą możemy ocenić w stosunku do niej, czy każda z nich mieści się w VRAM, oraz szacunkowa liczba tokenów na sekundę. Możesz również zacząć od modelu i zobaczyć, które karty mogą go uruchomić, co jest tym samym obliczeniem z przeciwnego kierunku.

02

Czy moja GPU może w ogóle uruchomić lokalne modele LLM?

Jeśli ma przynajmniej kilka gigabajtów pamięci własnej, to prawie na pewno coś. Zintegrowana grafika, która dzieli pamięć systemową, jest głównym wyjątkiem, ponieważ nie ma dedykowanej puli do przechowywania modelu. Poza tym to pytanie, który model, przy jakim kompresji — nie tak lub nie.

03

Co określa tokeny na sekundę na GPU?

Generowanie tokena oznacza odczytanie wag modelu z pamięci tylko raz, więc prędkość jest ograniczona przez przepustowość pamięci podzieloną przez to, ile musi być odczytane na token — co zależy od rozmiaru modelu, jego architektury i formatu kompresji, w którym jest przechowywany. Częstotliwość zegara i liczby rdzeni, liczby, którymi posługuje się karta specyfikacji, mają niewielki wpływ.

04

Jak dokładne są szacunki na tej stronie?

Spodziewaj się, że rzeczywista wartość będzie mieścić się w przybliżeniu w zakresie 20–40% szacunku. Ten sam GPU i model różnią się tak bardzo między silnikami wnioskowania, wersjami silnika i konfiguracją serwowania — żadna kalkulacja oparta tylko na specyfikacjach nie może tego przewidzieć, dlatego każda wartość tutaj jest publikowana jako zakres.

05

Czy większa, nowsza GPU zawsze jest szybsza dla AI?

Dla modelu, który już mieści się komfortowo na obu kartach, przepustowość pamięci decyduje o zwycięzcy, a nowsza karta zazwyczaj ma jej więcej. Jednak bardziej powszechnym wąskim gardłem jest pojemność, a nie prędkość — bardziej użyteczne pytanie dla konkretnej karty brzmi zazwyczaj "jaki jest największy model, który się mieści", na które każda strona karty odpowiada bezpośrednio.

06

Czy muszę rozumieć kwantyzację, aby korzystać z tej strony?

Nie — każda karta i strona modelu wybiera najlepszą jakość kompresji, która rzeczywiście pasuje, automatycznie. Kwantyzacja to technika, która zmniejsza ślad pamięci modelu przy niewielkim koszcie jakości wyjściowej, i możesz ustawić pułap jakości samodzielnie, jeśli chcesz, ale nic tego nie wymaga.

07

Skąd pochodzą zestawy danych GPU i AI modelu?

Specyfikacje kart graficznych i rejestry modeli językowych obejmujące tysiące modeli open-weight oraz ich liczbę parametrów, licencje i daty wydania. Oba są odświeżane w miarę wydawania nowego sprzętu i modeli — zobacz katalogi GPU i modeli AI, aby uzyskać pełne informacje.

Sprzedaż sprzętu

Zainteresowany zostaniem sprzedawcą?

Wymień swoje GPU na sprzedaż obok odpowiedzi na to, co mogą faktycznie uruchomić..

Już wkrótce

Bądź powiadamiany o nowych GPU i modelach

Newsletter wkrótce nadchodzi.

Już wkrótce

Zgłębić dalej

Przeglądaj pełny katalog GPU lub przeglądaj pełny katalog modeli AI. Kupujesz sprzęt? sprawdź katalog dostawców. Więcej pytań jest odpowiedzianych na naszym Strona FAQ, lub Skontaktuj się z nami bezpośrednio.