Przepustowość ograniczona pamięcią, obliczana na żywo
Czy twoja GPU może uruchomić ten AI Model? Kalkulator TPS GPU
Wybierz kartę graficzną lub model językowy, a my obliczymy — na żywo, nie z tabeli przeszukiwania — czy się nadaje, przy jakiej kompresji i mniej więcej ile tokenów na sekundę można się spodziewać..
Na żywo oszacowanie
WejścieFormat
Q8_0
Kontekst
13k
Zaufanie
high
Przykłady robocze
Sprawdź te potężne zestawy
Kilka par, które polecilibyśmy przyjacielowi, w różnych przedziałach cenowych..
Duża konfiguracja chłopca
32 GB01
Porównaj Karty GPU
VRAM, szerokość pasma pamięci, rdzenie tensorowe i przepustowość FP16.
02
Oszacuj tokeny na sekundę
Prędkość dekodowania jest ograniczona przez przepustowość pamięci, więc modelujemy ją raczej niż cytujemy szczytowe TFLOPS..
03
Sprawdź, co pasuje
Które modele działają na karcie, w jakiej kwantyzacji i z jakim kontekstem.
Problem
Dlaczego "czy moja GPU uruchomi to?" jest trudnym pytaniem
Karta specyfikacji informuje o pamięci karty i jej prędkości zegara. Nie mówi, czy konkretny model językowy mieści się w tej pamięci po kompresji, ile miejsca na karcie pozostaje na samą rozmowę, ani ile tokenów na sekundę faktycznie wychodzi na drugim końcu — a te trzy pytania nie mają tej samej odpowiedzi dla żadnej pary GPU i modelu.
Szczerą wersję tego obliczenia uwzględnia liczba parametrów modelu i architektura, format kompresji, w jakim jest przechowywany, przepustowość pamięci karty oraz jak rozwinięte jest oprogramowanie do wnioskowania, a także długość rozmowy, którą zamierzasz z nim prowadzić. Źle obliczając którąkolwiek z tych wartości, uzyskany wynik wydaje się równie pewny, a po prostu jest nieprawidłowy.
Nie udajemy, że to produkuje jedną precyzyjną wartość, ponieważ nie może. Zamiast tego uruchamiamy pełne obliczenia dla każdej karty i każdego modelu, dla którego posiadamy dane, publikujemy wynik jako zakres, a nie jako punktową wartość fałszywej precyzji, i pokazujemy nasze obliczenia — każda formuła za każdym numerem na tej stronie jest jasno przedstawiona, a nie ukryta za odpowiedzią.
Co ta strona tak naprawdę daje ci
Najbardziej kompletna baza danych, którą mogliśmy stworzyć: tysiące kart GPU i tysiące modeli językowych, wzajemnie sprawdzanych, a nie rozpatrywanych pojedynczo. Rozpocznij od karty, którą posiadasz lub którą rozważasz, i zobacz każdy model, który na niej działa. Rozpocznij od modelu, który chcesz uruchomić, i zobacz każdą kartę, która może go pomieścić.
To działa w obu kierunkach, ponieważ podstawowe obliczenie jest symetryczne — ta sama arytmetyka pamięci i przepustowości, uruchamiana z dowolnej strony, którą już znasz. Żaden kierunek nie jest "prawdziwy"; to ta sama odpowiedź zadana na dwa różne sposoby.
Przeczytaj więcej o tym, jak i dlaczego w naszej o stronie.
Nowo wydane
Sprawdź te potężne nowe GPU
Przeglądaj wszystkie GPUNVIDIA
Oct 2025
AMD
Sep 2025
W naszej bazie danych
Najnowsze wydania modeli AI
Wszystko →Najnowsze modele open-weight w naszej bazie danych.
Najnowsze wydania GPU
Wszystko →Najnowższe karty w naszej bazie danych.
Oba kierunki
Jak działa kalkulator
Ta sama kalkulacja, użyteczna z każdej strony pytania, od której zaczynasz..
Zaczynając od GPU, które posiadasz
- 01 Znajdź swoją kartę GPU . Szukaj w katalogu GPU karty, którą posiadasz lub którą rozważasz, według nazwy lub według rozmiaru pamięci.
- 02 Otwórz swoją stronę . Każda KARTA ma swoją stronę, na której znajduje się każdy model językowy, który możemy ocenić w odniesieniu do niej, z oszacowaną liczbą tokenów na sekundę dla każdego.
- 03 Ustal długość kontekstu i minimalną jakość . Dostosuj długość rozmowy, którą oczekujesz, aby pracować, oraz najniższy poziom kompresji, jaki zaakceptujesz. Oba zmieniają odpowiedź na żywo.
- 04 Przeczytaj zakres, nie pojedynczą liczbę . Każda estymacja jest publikowana z zakresem pewności, a nie z jedną fałszywie precyzyjną cyfrą, ponieważ ta sama KARTA i MODELE różnią się między silnikami wnioskowania w sposób, którego żadna karta specyfikacji nie przewiduje.
Zaczynając od modelu, który chcesz uruchomić
- 01 Znajdź model . Szukaj w katalogu modeli AI według nazwy lub rozmiaru — nawet gdy sama nazwa nie podaje liczby parametrów.
- 02 Otwórz swoją stronę . Model z otwartymi wagami wymienia każdą kartę graficzną, z którą możemy go ocenić, najmniejsza, która się mieści i najszybsza jako pierwsza.
- 03 Ustal długość kontekstu i minimalną jakość . Te same dwa kontrolery co ścieżka GPU-first — dłuższa rozmowa potrzebuje więcej pamięci, co może przesunąć kartę z "pasuje" do "nie pasuje".
- 04 Porównaj karty pod kątem tego, co faktycznie zauważysz . Pamięć decyduje, czy w ogóle działa; przepustowość decyduje, jak szybko się odczuwa, gdy już działa. Tabela sortuje według tokenów na sekundę domyślnie, ponieważ to zazwyczaj ma znaczenie.
Odpowiedzi
częste pytania
Jak obliczyć, czy moja GPU może uruchomić lokalny LLM?
Znajdź swoją kartę w katalogu GPU i otwórz jej stronę — znajduje się na niej każda wersja, którą możemy ocenić w stosunku do niej, czy każda z nich mieści się w VRAM, oraz szacunkowa liczba tokenów na sekundę. Możesz również zacząć od modelu i zobaczyć, które karty mogą go uruchomić, co jest tym samym obliczeniem z przeciwnego kierunku.
Czy moja GPU może w ogóle uruchomić lokalne modele LLM?
Jeśli ma przynajmniej kilka gigabajtów pamięci własnej, to prawie na pewno coś. Zintegrowana grafika, która dzieli pamięć systemową, jest głównym wyjątkiem, ponieważ nie ma dedykowanej puli do przechowywania modelu. Poza tym to pytanie, który model, przy jakim kompresji — nie tak lub nie.
Co określa tokeny na sekundę na GPU?
Generowanie tokena oznacza odczytanie wag modelu z pamięci tylko raz, więc prędkość jest ograniczona przez przepustowość pamięci podzieloną przez to, ile musi być odczytane na token — co zależy od rozmiaru modelu, jego architektury i formatu kompresji, w którym jest przechowywany. Częstotliwość zegara i liczby rdzeni, liczby, którymi posługuje się karta specyfikacji, mają niewielki wpływ.
Jak dokładne są szacunki na tej stronie?
Spodziewaj się, że rzeczywista wartość będzie mieścić się w przybliżeniu w zakresie 20–40% szacunku. Ten sam GPU i model różnią się tak bardzo między silnikami wnioskowania, wersjami silnika i konfiguracją serwowania — żadna kalkulacja oparta tylko na specyfikacjach nie może tego przewidzieć, dlatego każda wartość tutaj jest publikowana jako zakres.
Czy większa, nowsza GPU zawsze jest szybsza dla AI?
Dla modelu, który już mieści się komfortowo na obu kartach, przepustowość pamięci decyduje o zwycięzcy, a nowsza karta zazwyczaj ma jej więcej. Jednak bardziej powszechnym wąskim gardłem jest pojemność, a nie prędkość — bardziej użyteczne pytanie dla konkretnej karty brzmi zazwyczaj "jaki jest największy model, który się mieści", na które każda strona karty odpowiada bezpośrednio.
Czy muszę rozumieć kwantyzację, aby korzystać z tej strony?
Nie — każda karta i strona modelu wybiera najlepszą jakość kompresji, która rzeczywiście pasuje, automatycznie. Kwantyzacja to technika, która zmniejsza ślad pamięci modelu przy niewielkim koszcie jakości wyjściowej, i możesz ustawić pułap jakości samodzielnie, jeśli chcesz, ale nic tego nie wymaga.
Skąd pochodzą zestawy danych GPU i AI modelu?
Specyfikacje kart graficznych i rejestry modeli językowych obejmujące tysiące modeli open-weight oraz ich liczbę parametrów, licencje i daty wydania. Oba są odświeżane w miarę wydawania nowego sprzętu i modeli — zobacz katalogi GPU i modeli AI, aby uzyskać pełne informacje.
Sprzedaż sprzętu
Zainteresowany zostaniem sprzedawcą?
Wymień swoje GPU na sprzedaż obok odpowiedzi na to, co mogą faktycznie uruchomić..
Już wkrótce
Bądź powiadamiany o nowych GPU i modelach
Newsletter wkrótce nadchodzi.
Zgłębić dalej
Przeglądaj pełny katalog GPU lub przeglądaj pełny katalog modeli AI. Kupujesz sprzęt? sprawdź katalog dostawców. Więcej pytań jest odpowiedzianych na naszym Strona FAQ, lub Skontaktuj się z nami bezpośrednio.