Katalog

kalkulator GPU TPS

Oblicz, ile tokenów na sekundę produkuje każda karta graficzna na lokalnym modelu AI. Przefiltruj katalog poniżej, aby znaleźć karty warte rozważenia, a następnie otwórz jedną, aby zobaczyć każdy model językowy, który może uruchomić, ile pamięci każdy z nich potrzebuje i jak szybka będzie prawdopodobnie..

818

karty w bazie danych

4

producenci

4 GB – 288 GB

zakres VRAM

8,190 GB/s

najwyższa przepustowość

Każde słowo musi pasować do czegoś, więc więcej słów zawęża listę. Pojemność taka jak 24gb pasuje do pamięci karty, chociaż żadna kolumna nie przechowuje tego jako tekst..

818 karty pasują

Aktualizacja
Typ pamięci Moc
B300 NVIDIA · Blackwell Ultra 288 GB 8,000 GB/s 2.03 GHz 1.67 GHz Sep 2025 HBM3e 1,400 W
Radeon Instinct MI350X AMD · CDNA 4.0 288 GB 8,190 GB/s 2.2 GHz 1 GHz Jan 2025 HBM3e 1,000 W
Radeon Instinct MI355X AMD · CDNA 4.0 288 GB 8,190 GB/s 2.4 GHz 1 GHz Jan 2025 HBM3e 1,400 W
Radeon Instinct MI325X AMD · CDNA 3.0 256 GB 6,000 GB/s 2.1 GHz 1 GHz Oct 2024 HBM3e 1,000 W
Radeon Instinct MI300X AMD · CDNA 3.0 192 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
Radeon Instinct MI308X AMD · CDNA 3.0 192 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
B200 NVIDIA · Blackwell 180 GB 8,000 GB/s 1.97 GHz 700 MHz Jan 2024 HBM3e 1,000 W
H200 NVL NVIDIA · Hopper 141 GB 4,890 GB/s 1.79 GHz 1.37 GHz Nov 2024 HBM3e 600 W
H200 SXM 141 GB NVIDIA · Hopper 141 GB 4,890 GB/s 1.98 GHz 1.5 GHz Nov 2024 HBM3e 700 W
Data Center GPU Max 1550 Intel · Generation 12.5 128 GB 3,280 GB/s 1.6 GHz 900 MHz Jan 2023 HBM2e 600 W
Data Center GPU Max Subsystem Intel · Generation 12.5 128 GB 3,210 GB/s 1.6 GHz 900 MHz Jan 2023 HBM2e 2,400 W
GB10 NVIDIA · Blackwell 2.0 128 GB 273 GB/s 2.42 GHz 1.67 GHz Oct 2025 LPDDR5X 140 W
Jetson T5000 NVIDIA · Blackwell 128 GB 273 GB/s 2.53 GHz 1.67 GHz Aug 2025 LPDDR5X 40 W
Radeon Instinct MI250 AMD · CDNA 2.0 128 GB 3,280 GB/s 1.7 GHz 1 GHz Nov 2021 HBM2e 500 W
Radeon Instinct MI250X AMD · CDNA 2.0 128 GB 3,280 GB/s 1.7 GHz 1 GHz Nov 2021 HBM2e 500 W
Radeon Instinct MI300 AMD · CDNA 3.0 128 GB 6,550 GB/s 1.7 GHz 1 GHz Jan 2023 HBM3 600 W
Radeon Instinct MI300A AMD · CDNA 3.0 128 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
Data Center GPU Max 1350 Intel · Generation 12.5 96 GB 2,460 GB/s 1.55 GHz 750 MHz Jan 2023 HBM2e 450 W
H100 PCIe 96 GB NVIDIA · Hopper 96 GB 3,360 GB/s 1.84 GHz 1.67 GHz Mar 2023 HBM3 700 W
H100 SXM5 96 GB NVIDIA · Hopper 96 GB 3,360 GB/s 1.98 GHz 1.35 GHz Mar 2023 HBM3 700 W
RTX PRO 6000 Blackwell NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.62 GHz 1.59 GHz Mar 2025 GDDR7 600 W
RTX PRO 6000 Blackwell Max-Q NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.28 GHz 1.04 GHz Mar 2025 GDDR7 300 W
RTX PRO 6000 Blackwell Server NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.62 GHz 1.59 GHz Mar 2025 GDDR7 600 W
RTX PRO 6000D Blackwell Max-Q NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.29 GHz 1.59 GHz Mar 2025 GDDR7 300 W
H100 NVL 94 GB NVIDIA · Hopper 94 GB 3,940 GB/s 1.79 GHz 1.08 GHz Mar 2023 HBM3 400 W
H100 SXM5 94 GB NVIDIA · Hopper 94 GB 3,360 GB/s 1.98 GHz 1.35 GHz Mar 2023 HBM3 700 W
RTX 6000D NVIDIA · Blackwell 2.0 84 GB 1,570 GB/s 2.43 GHz 1.59 GHz Mar 2025 GDDR7 600 W
A100 PCIe 80 GB NVIDIA · Ampere 80 GB 1,940 GB/s 1.41 GHz 1.07 GHz Jun 2021 HBM2e 300 W
A100 SXM4 80 GB NVIDIA · Ampere 80 GB 2,040 GB/s 1.41 GHz 1.28 GHz Nov 2020 HBM2e 400 W
A100X NVIDIA · Ampere 80 GB 2,040 GB/s 1.44 GHz 795 MHz Jun 2021 HBM2e 300 W

Krok po kroku

Jak obliczyć TPS twojego GPU

Nic tu nie wymaga ręcznego rozwiązywania. Katalog powyżej już zawiera każdą KARTĘ, a każda strona KARTY już zawiera każdy MODEL, który może uruchomić z dołączoną liczbą tokenów na sekundę. Dotarcie do twojej odpowiedzi zajmuje sześć kroków..

  1. 01

    Zawęż katalog do kart, które warto rozważyć.

    Użyj filtrów, aby ustawić, co naprawdę potrzebujesz — minimalny rozmiar pamięci, producenta, limit mocy, który twoje zasilanie może dostarczyć, lub rok wydania. Pamięć to filtr, od którego należy zacząć, ponieważ decyduje, które modele są w ogóle możliwe.

  2. 02

    Lub wyszukaj kartę, którą już posiadasz

    Wpisz nazwę w polu wyszukiwania. Każde słowo musi pasować do czegoś, więc więcej słów zawęża listę, a pojemność taka jak 24GB pasuje do pamięci karty, mimo że żaden z kolumn nie przechowuje tego jako tekst.

  3. 03

    Sortuj według specyfikacji, która decyduje o twoim wyniku

    Sortuj według pamięci, jeśli pytanie dotyczy tego, które modele się mieszczą, lub według przepustowości, jeśli pytanie dotyczy tego, jak szybko będą działać. Prędkości zegarów i liczby rdzeni są podane dla pełności, ale mają minimalny wpływ na generowanie tekstu.

  4. 04

    Otwórz kartę

    Każda karta ma swoją stronę, na której znajduje się lista każdego modelu językowego, który może uruchomić, z oszacowaną ilością tokenów na sekundę, pamięcią, której potrzebuje każdy model, oraz kompresją, w jakiej działa.

  5. 05

    Ustaw swoją długość kontekstu i minimalną jakość

    Na stronie karty ustaw długość konwersacji, z którą oczekujesz pracy, oraz najniższy poziom kompresji, który jesteś skłonny zaakceptować. Oba zmieniają odpowiedź, a nie ją filtrują - dłuższa konwersacja wymaga więcej pamięci, co może całkowicie zrzucić duży model z karty.

  6. 06

    Przeczytaj zakres, a nie pojedynczą liczbę

    Każda figura przepustowości jest publikowana z zakresem zaufania wokół niej. Weź zakres jako odpowiedź: ta sama karta i model różnią się między silnikami wnioskowania i wersjami w sposób, którego żadna karta specyfikacji nie przewiduje, a główny numer to tylko środek tego zakresu.

Co oznaczają liczby

Czym jest ten katalog

To jest baza danych przechowująca 818 karty graficzne, przefiltrowane do tych, które mają wystarczającą pamięć, aby pomieścić model językowy. Każda karta ma swoją stronę, a na tej stronie każdy model, który śledzimy, został oceniony w odniesieniu do niej — czy pasuje, przy jakiej kompresji i ile tokenów na sekundę prawdopodobnie wyprodukuje.

Obliczenia są wykonywane, gdy otwierasz kartę, zamiast być wyszukiwane z przechowywanej tabeli, co pozwala na to, że długość kontekstu i minimalna jakość są rzeczami, które ustawiasz, a nie rzeczami, które założyliśmy w Twoim imieniu. Zmień jedno z tych dwóch, a każda wartość jest ponownie obliczana.

Dlaczego TOKENS PER SECOND to liczba, która ma znaczenie

Uruchomienie modelu językowego na własnym sprzęcie stało się zwyczajną rzeczą w krótkim czasie. Modele open-weight nadrobiły na tyle, że stały się naprawdę użyteczne, a narzędzia do ich uruchamiania przestały wymagać tła badawczego. Co nie nadeszło w parze z tym, to jasna odpowiedź na pierwsze pytanie, które każdy zadaje: czy będzie działać na karcie, którą już mam, i czy będzie wystarczająco szybkie, aby warto było z niego korzystać.

Specyfikacje nie odpowiadają na to. Są pisane dla obciążeń graficznych i zaczynają od cyfr, które decydują o liczbie klatek na sekundę, które są prawie całkowicie błędne. Dwie liczby, które faktycznie decydują o wyniku, to pojemność pamięci, która decyduje, czy model się mieści, oraz przepustowość pamięci, która decyduje, jak szybko generuje, gdy już się mieści.

Tokens na sekundę to liczba, która wyraża wynik w czymś, co możesz poczuć. Prędkość czytania wynosi gdzieś w okolicach dziesięciu tokenów na sekundę, więc wszystko powyżej tego przybywa szybciej, niż możesz to przeczytać, a wszystko poniżej wydaje się czekać. To jest liczba, którą ta strona oblicza dla każdej kombinacji karty i modelu, którą posiada.

Co obejmuje katalog

zakres VRAM

4 GB – 288 GB

najwyższa przepustowość

8,190 GB/s

Zakres mocy

6 – 2,400 W

Pamięć w katalogu zaczyna się od 4 GB i osiąga 288 GB. Ten zakres to różnica między kartą ograniczoną do najmniejszych użytecznych modeli a taką, która obsługuje modele, z którymi nie może się zmierzyć żaden komputer stacjonarny — pojemność jest twardą bramą, a nie stopniowym kompromisem, więc model albo mieści się, albo nie działa.

Pasmo pamięci zaczyna się od 10 GB/s i osiąga 8,190 GB/s, figura trzymana przez Radeon Instinct MI355X. Ponieważ generowanie każdego tokenu oznacza odczytanie całego modelu z pamięci jednorazowo, to rozrzut przekłada się prawie bezpośrednio na rozrzut w prędkości generacji: karta z dziesięcioma razy większą przepustowością produkuje tokeny mniej więcej dziesięć razy szybciej na tym samym modelu.

Karty w katalogu są wykonane przez AMD, ATI, Intel and NVIDIA. Producent ma większe znaczenie, niż powinien: oprogramowanie do wnioskowania otrzymało znacznie więcej uwagi na ścieżce CUDA niż na jakiejkolwiek innej, więc karta AMD lub Intel o równoważnej przepustowości zazwyczaj osiąga mniejszy udział w swoim teoretycznym maksimum. Nasze szacunki zastosowują karę za to, zamiast udawać, że sprzęt jest jedyną zmienną.

Pobór mocy zaczyna się od 6 W i osiąga 2,400 W. Górny koniec to sprzęt centrum danych, którego zasilacz komputerowy nie może zasilić, i to jest ograniczenie, które ludzie zazwyczaj odkrywają jako ostatnie — po tym, jak karta mieści się w budżecie i obudowie.

Daty wydania zaczynają się w 2009 i uruchomić do 2025, więc katalog obejmuje sprzęt, który ludzie wciąż posiadają, jak również sprzęt, który mogą kupić. Starsza karta nie jest wykluczona tylko dlatego, że jest stara — jeśli ma pamięć, nadal może uruchomić model, a strona wskaże, jak szybko.

Kupowanie karty

Sprzedawcy mogą umieszczać karty na sprzedaż w odniesieniu do dowolnego wpisu w tym katalogu, więc strona karty może pokazywać zarówno to, co sprzęt będzie uruchamiać, jak i gdzie można go kupić. Ogłoszenia są przypisane do konkretnej odmiany płyty, a nie do nazwy modelu, co ma tutaj większe znaczenie niż zazwyczaj — ta sama nazwa często obejmuje kilka pojemności pamięci, a pojemność to rzecz, która decyduje, które modele uruchamiają.

Czytanie tabeli

Jak czytać ten katalog

VRAM
Ile pamięci może pomieścić karta. Przybliżony przewodnik to nieco ponad pół gigabajta na miliard parametrów przy najczęściej stosowanej kompresji, plus miejsce na konwersację. Nie wszystko jest dostępne — oprogramowanie do inferencji rezerwuje około jednej dziesiątej na swoją własną przestrzeń roboczą.
Szerokość pasma
Jak szybko karta odczytuje swoją własną pamięć, w gigabajtach na sekundę. To jest jedyny najlepszy wskaźnik prędkości generacji gdziekolwiek na tej stronie.
Boost i zegar bazowy
Jak szybko działa procesor. Wymienione dla pełności, a znacznie mniej przewidywalne tutaj niż na benchmarku gier: generacja czeka na pamięć, a nie na arytmetykę.
Typ pamięci i interfejs magistrali
Technologia pamięci i sposób, w jaki karta łączy się z maszyną. Części HBM to sprzęt datacentre z znacznie większą przepustowością niż GDDR używane w kartach desktopowych. Interfejs magistrali decyduje o tym, jak szybko model się ładował, a nie jak szybko działa.
Moc
Maksymalne pobranie mocy płyty w watach. Warto to filtrować, gdy zasilacz lub obudowa są już ustalone, ponieważ największe karty potrzebują znacznie więcej, niż typowy komputer stacjonarny oferuje.
Dlaczego karta pojawia się więcej niż raz
Każdy wiersz jest wariantem płyty, a nie chipem, więc ta sama nazwa może wystąpić w kilku pojemnościach pamięci. Ta różnica ma tutaj większe znaczenie niż gdziekolwiek indziej, ponieważ pojemność decyduje o tym, czy model działa.

Odpowiedzi

częste pytania

01

Jak obliczyć TOKENY na sekundę mojej KARTY GPU?

Nie musisz. Znajdź swoją kartę w tabeli powyżej — katalog zawiera 818 ich — i otwórz to. Jego strona zawiera listę każdego modelu AI, który może uruchomić z szacunkowym wskaźnikiem tokenów na sekundę dla każdego, obliczonym na podstawie przepustowości pamięci karty i rozmiaru modelu po skompresowaniu.

02

Jaka jest dobra liczba tokenów na sekundę do uruchamiania AI lokalnie?

Prędkość odczytu wynosi około dziesięć tokenów na sekundę, więc wszystko powyżej tej wartości generuje tekst szybciej, niż możesz go przeczytać i sprawia wrażenie natychmiastowości. Pomiędzy pięcioma a dziesięcioma jest użyteczne, ale zauważalnie wolne. Poniżej pięciu jest niewygodne dla rozmowy, chociaż wciąż odpowiednie do pracy, którą zostawiasz w tle.

03

Która specyfikacja GPU ma największe znaczenie dla AI?

Pojemność pamięci najpierw, ponieważ cały model musi być przechowywany na karcie zanim będzie mógł wygenerować cokolwiek, a przepustowość na drugim miejscu, ponieważ generowanie każdego tokena oznacza odczytanie tego modelu z pamięci raz. Liczby rdzeni i prędkości zegara decydują o wydajności grafiki i ledwie mają znaczenie w tym kontekście.

04

Ile VRAM potrzebuję, aby uruchomić model językowy?

Jako ogólna zasada, nieco ponad pół gigabajta na miliard parametrów przy kompresji, którą większość ludzi używa, plus miejsce na rozmowę. To sprawia, że model o ośmiu miliardach parametrów działa komfortowo na ośmiu gigabajtach, a model o trzydziestu miliardach na dwudziestu czterech. Karty w tym katalogu zaczynają się od 4 GB i osiągnąć 288 GB.

05

Ile kart graficznych jest w tej bazie danych?

Katalog zawiera 818 karty wykonane przez AMD, ATI, Intel and NVIDIA. Zintegrowane grafiki są wykluczone, ponieważ nie mają własnej pamięci, a także karty poniżej czterech gigabajtów, na których żaden model w naszym katalogu nie pasuje przy żadnej kompresji.

06

Która GPU ma najwyższą przepustowość pamięci?

To jest Radeon Instinct MI355X, osiąganie 8,190 GB/s. Ponieważ prędkość generacji jest niemal bezpośrednio związana z pasmem, jest to również jedna z najszybszych kart tutaj do produkcji tekstu – choć to, czy to ma znaczenie, zależy przede wszystkim od tego, czy twój model mieści się w VRAM.

07

Który GPU ma najwięcej VRAM?

To jest Radeon Instinct MI355X, trzymanie 288 GB. Pojemność na tym poziomie to terytorium centrum danych, i to pozwala największym open-weight modelom być przechowywanym na jednej karcie, zamiast dzielić się na kilka.

08

Czy karta graficzna do gier jest wystarczająco dobra do lokalnego AI?

Dla jednej osoby jednocześnie, zwykle tak, i często lepsza wartość niż sprzęt centrum danych. Karty konsumenckie rezygnują z całkowitej pamięci, a nie prędkości, więc limit to, które modele się mieszczą, a nie jak szybko działają, gdy już się mieszczą.

09

Czy producent ma znaczenie dla wydajności AI?

Więcej niż powinno. Oprogramowanie inferencyjne miało znacznie więcej pracy włożonej w ścieżkę CUDA niż w alternatywy, więc karta AMD lub Intel o ekwiwalentnej przepustowości zazwyczaj osiąga mniejszy udział w swoim teoretycznym suficie. Nasze szacunki nakładają karę za to, zamiast zakładać, że sprzęt jest jedyną zmienną.

10

Czy mogę używać dwóch kart graficznych razem?

Tak, i często to jest kluczowy punkt — dwie KARTY obsługują MODELE, których żadna z nich nie mogłaby obsłużyć samodzielnie. Nie podwaja to prędkości generacji w ten sposób, w jaki podwaja pamięć, a każda liczba na tej stronie opisuje pojedynczą KARTĘ samą w sobie.

11

Jak dokładne są te szacunki tokenów na sekundę?

Są obliczane na podstawie specyfikacji, a nie mierzone, a każdy z nich jest publikowany z zakresem, a nie jako pojedyncza liczba. Ta sama karta i model różnią się o trzydzieści do pięćdziesięciu procent w zależności od tego, jakie oprogramowanie do inferencji używasz i której wersji, co żadne obliczenia z arkuszy specyfikacji nie mogą przewidzieć. Traktuj zakres jako szczerą odpowiedź.

12

Wiem, który model chcę. Czy mogę szukać w odwrotną stronę?

Tak. Sekcja modeli AI wymienia każdy model na pliku, a strona każdego modelu wymienia karty graficzne, które mogą go uruchomić, zaczynając od najmniejszych i najszybszych. To jest to samo obliczenie z podejściem od drugiej strony.

Druga strona

Patrząc na to z drugiej strony?

Ta strona zaczyna się od sprzętu. Jeśli już wiesz, który MODEL chcesz RUNA, i musisz wiedzieć, co to wymaga, zacznij od tego zamiast. — wykazuje każdy model w naszej bazie danych, a każdy z nich wymienia karty, które mogą go uruchomić.

Modele AI