Oblicz TPS modelu PG506-242 na lokalnych modelach AI
Każdy model w naszym katalogu oceniany według tej karty przy długości kontekstu i minimalnej jakości, którą wybierzesz. Prędkość jest szacunkowa dla pojedynczego żądania, obliczona na podstawie przepustowości pamięci tej karty i rozmiaru każdego modelu po skompresowaniu..
Obliczone dla tej karty
679 modele w naszym katalogu razem
Największy model, który obsługuje
Mixtral 8x7B
46.7B · Q3_K_M · 82.7 tok/s
Najszybszy model
Gemma 3 QAT 1B
395 tok/s · 1B
Które modele AI mogą działać na a PG506-242?
Ustaw wejścia, odczytaj odpowiedź.
Więcej kontekstu oznacza więcej VRAM dla pamięci rozmowy. Szybkość dotyczy świeżej rozmowy i nie zmienia się przy tym ustawieniu..
Ukrywa modele, które można by zmieścić tylko przez skompresowanie poniżej tego punktu.
502 modele pasują
Obliczanie| Kwantyzacja | Pasuje | ||||||
|---|---|---|---|---|---|---|---|
|
395
tok/s
336–474 |
Gemma 3 1B | 1B | Mar 2025 | 1.8 GB | 33k tokeny | Q8_0 | Wygodny |
|
395
tok/s
336–474 |
Gemma 3 QAT 1B | 1B | Apr 2025 | 1.8 GB | 33k tokeny | Q8_0 | Wygodny |
|
395
tok/s
237–632 · niska pewność |
HGRN 1B (WT 103) ≈ | 1B | Nov 2023 | 1.8 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
395
tok/s
237–632 · niska pewność |
LLama 3..2 Typhoon 2 1B ≈ | 1B | Dec 2024 | 1.8 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
395
tok/s
237–632 · niska pewność |
OLMo-1B ≈ | 1B | Feb 2024 | 1.8 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
395
tok/s
237–632 · niska pewność |
Pythia-1b ≈ | 1B | Apr 2023 | 1.8 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
366
tok/s
220–585 · niska pewność |
OpenELM-1.1B ≈ | 1.1B | May 2024 | 1.9 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
359
tok/s
216–575 · niska pewność |
DeciCoder-1B ≈ | 1.1B | Aug 2023 | 1.9 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
359
tok/s
216–575 · niska pewność |
SantaCoder ≈ | 1.1B | Jan 2023 | 1.9 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
359
tok/s
216–575 · niska pewność |
TinyLlama-1.1B (1T token checkpoint) ≈ | 1.1B | Oct 2023 | 1.9 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
359
tok/s
216–575 · niska pewność |
TinyLlama-1.1B (3T token checkpoint) ≈ | 1.1B | Oct 2023 | 1.9 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
329
tok/s
198–527 · niska pewność |
EXAONE 4.0 (1.2B) ≈ | 1.2B | Jul 2025 | 2.0 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
329
tok/s
198–527 · niska pewność |
MinerU2.5 ≈ | 1.2B | Sep 2025 | 2.0 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
329
tok/s
198–527 · niska pewność |
Pleias 1.0 1.2B ≈ | 1.2B | Dec 2024 | 2.0 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
329
tok/s
198–527 · niska pewność |
Pleias-RAG-1B ≈ | 1.2B | Apr 2025 | 2.0 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
321
tok/s
273–386 |
Llama 3.2 1B | 1.2B | Sep 2024 | 2.2 GB | 131k tokeny | Q8_0 | Wygodny |
|
317
tok/s
190–507 · niska pewność |
MiniCPM-1.2B ≈ | 1.2B | Jun 2024 | 2.0 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
304
tok/s
182–486 · niska pewność |
DeepSeek Coder 1.3B ≈ | 1.3B | Jan 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
304
tok/s
182–486 · niska pewność |
DeepSeek-VL-1.3B ≈ | 1.3B | Mar 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
304
tok/s
182–486 · niska pewność |
DigiRL ≈ | 1.3B | Jun 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
304
tok/s
182–486 · niska pewność |
GLA Transformer 1.3B ≈ | 1.3B | Aug 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
304
tok/s
182–486 · niska pewność |
Janus 1.3B ≈ | 1.3B | Oct 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
304
tok/s
182–486 · niska pewność |
Kosmos-2.5 ≈ | 1.3B | Aug 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
304
tok/s
182–486 · niska pewność |
Otter ≈ | 1.3B | May 2023 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
304
tok/s
182–486 · niska pewność |
Phi-1 ≈ | 1.3B | Oct 2023 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
Prędkości są szacunkami dla pojedynczego zapytania — jednej konwersacji na raz — obliczonymi na podstawie przepustowości pamięci, rozmiaru MODELu i kwantyzacji. Rzeczywista przepustowość różni się w zależności od czasu uruchamiania inference i jego wersji. Wartości publikowane przez dostawców sprzętu mierzą wiele jednoczesnych zapytań i są znacznie wyższe..
Na nagranie
PG506-242 Pełna specyfikacja
Wszystko w bazie danych dla tej karty, uporządkowane według tego, jak bardzo wpływa na uruchamianie modelu językowego, a nie według tego, jak lista specyfikacji by to opisała. MEMORY jest na pierwszym miejscu, ponieważ decyduje o wyniku; reszta to CONTEXT..
VRAM
Dwie specyfikacje decydują, co ta KARTA może uruchomić i jak szybko. Pojemność określa, które modele mieszczą się w GPU VRAM; przepustowość określa, ile tokenów na sekundę generują, gdy już ją uruchomią.
- Rozmiar pamięci
- 24 GB
- Pasmo pamięci
- 933 GB/s
- Typ pamięci
- HBM2
- Szerokość magistrali pamięci
- 3,072 bit
- Zegar pamięci
- 1.22 GHz
Czip
Jaki procesor jest na płycie i jak został wyprodukowany. Mniejszy rozmiar procesu zazwyczaj oznacza większą wydajność przy tej samej mocy.
- Procesor graficzny
- GA100
- Architektura
- Ampere
- Generacja
- Server Ampere(Axx)
- Odlewnia
- TSMC
- Rozmiar procesu
- 7 nm
- Transistory
- 54.2 billion
- Gęstość tranzystorów
- 65,600 K/mm²
- Rozmiar die
- 826 mm²
- Pakiet
- BGA-2743
- Wydane
- 12 April 2021
Częstotliwości zegara
Jak szybko działa procesor. Warto znacznie mniej tutaj niż w testach wydajności gier: generowanie tekstu jest ograniczone przez przepustowość pamięci, więc wyższa częstotliwość ledwo wpływa na rezultat.
- Zegar bazowy
- 930 MHz
- Zegar zwiększający
- 1.44 GHz
Jednostki przetwarzania
Co zawiera chip. Te elementy napędzają wydajność grafiki i mają znaczenie głównie dla przetwarzania długiego promptu, a nie dla generowania odpowiedzi.
- Jednostki cieniujące
- 3,584
- Jednostki mapowania tekstur
- 224
- Jednostki wyjściowe.Render
- 96
- Procesory strumieniowe
- 56
- Rdzenie tensorowe
- 224
- cache L1
- 192 KB
- pamięć podręczna L2
- 24 MB
Wydajność teoretyczna
Szczytowe współczynniki arytmetyczne opublikowane dla karty. Są to limity, które żadne rzeczywiste obciążenie nie osiąga, a generowanie tekstu osiąga jedynie małą ich część, ponieważ jest ograniczone przez VRAM, a nie arytmetykę.
- Pół precyzja (FP16)
- 10.3 TFLOPS
- Pojedyncza precyzja (FP32)
- 10.3 TFLOPS
- Podwójna precyzja (FP64)
- 5.2 TFLOPS
- Wskaźnik pikseli
- 138 GPixel/s
- Współczynnik tekstury
- 323 GTexel/s
Płyta
Co jest potrzebne do fizycznej instalacji i zasilania karty — praktyczne ograniczenia, które decydują, czy pasuje do maszyny, którą już posiadasz.
- Pobór mocy (TDP)
- 165 W
- Zalecany zasilacz
- 450 W
- Złącza zasilające
- 8-pin EPS
- Interfejs magistrali
- PCIe 4.0 x16
- Szerokość slotu
- Dual-slot
- Wymiary
- 267 mm
Wsparcie oprogramowania
Jakie interfejsy graficzne i obliczeniowe obsługuje karta. Możliwość obliczeniowa CUDA ma znaczenie dla wnioskowania: poniżej 7.0 nie ma rdzeni tensorowych, a nowoczesne oprogramowanie do wnioskowania wraca do wolniejszych ścieżek kodu.
- zdolność obliczeniowa CUDA
- 8.0
- OpenCL
- 3.0
Oferty
Gdzie kupić GPU PG506-242
Żaden dostawca obecnie nie wymienia tej karty. Oferty pochodzą od dostawców, którzy publikują je tutaj bezpośrednio. — przejrzyj katalog dostawców zobaczyć, kto sprzedaje co.
Co oznaczają liczby
Pamięć: specyfikacja, która decyduje o wszystkim
VRAM
24 GB
Szerokość pasma
933 GB/s
Największy model
Mixtral 8x7B
PG506-242 nosi 24 GB z HBM2. To pokrywa modele średniej wielkości, które wiele osób faktycznie uruchamia. Gdy czas działania i sterownik zarezerwują swoją przestrzeń roboczą, mniej więcej tyle zostaje: 21.6 GB.
Przepustowość pamięci osiąga 933 GB/s przez magistralę 3,072 bity. Generowanie tokena oznacza odczytanie każdej wagi raz, więc ta liczba wyznacza tempo bardziej niż jakakolwiek inna liczba tutaj, a na tym poziomie tekst dociera szybciej niż większość ludzi czyta.
Przepustowość to zegar razy szerokość magistrali, a ta KARTA zegaruje swoją pamięć na 1.22 GHz. Poszerzenie magistrali i podniesienie zegara to dwa dźwignie, które ma producent, dlatego karta z nie wybitnymi rdzeniami może nadal generować szybko.
Praktyczny sufit to Mixtral 8x7B, 46.7B, skompresowane do Q3_K_M i generowanie wokół 82.7 tokeny na sekundę
Układ scalony i jak został zbudowany
PG506-242 jest zbudowany na procesorze graficznym GA100, używając architektury Ampere z NVIDIA, jako część generacji Server Ampere(Axx).
Chip jest produkowany przez TSMC, na procesie 7 nm, z kostką o wymiarach 826 mm², trzymanie 54.2 billion Transistory. Mniejszy proces zazwyczaj oznacza lepszą wydajność przy tej samej mocy, chociaż w przypadku modeli językowych ma to znacznie mniejsze znaczenie niż subsystem pamięci.
Został wydany w April 2021, szacunkowo 5.3039502521801 lata temu. Wsparcie oprogramowania do wnioskowania zazwyczaj podąża za sprzętem z opóźnieniem roku lub dwóch, więc karta tego wieku zazwyczaj ma dostępne dojrzałe, dobrze zoptymalizowane ścieżki kodu.
Wydajność obliczeniowa i dlaczego ma mniejsze znaczenie, niż się wydaje
FP16
10.3 TFLOPS
FP64
5.2 TFLOPS
Rdzenie tensorowe
224
Na papierze PG506-242 osiąga 10.3 TFLOPS przy półprecyzji, i 10.3 TFLOPS przy pojedynczej precyzji. To są wartości szczytowe, żaden rzeczywisty obciążenie ich nie utrzymuje, a generowanie tekstu osiąga tylko małą część z nich — dekodowanie jest ograniczone przez pamięć, a nie przez arytmetykę, co jest powodem, dla którego karta może wyglądać na niezwykle potężną tutaj i nadal produkować tokeny w zwykłym tempie.
Przepustowość podwójnej precyzji osiąga 5.2 TFLOPS. Nie ma to wpływu na uruchamianie modelu językowego — żadna sesja inferencyjna tego nie używa — ale oddziela części datacenter od konsumenckich, ponieważ te drugie celowo to ograniczają.
Karta przenosi 224 Rdzenie tensorowe na wzdłuż 56 Procesory strumieniowe. Te przyspieszają obliczenia macierzowe, które są sercem transformatora, i to one sprawiają, że przetwarzanie poleceń — czytanie długiego dokumentu przed udzieleniem odpowiedzi — jest znacznie szybsze, niż byłoby w przeciwnym razie.
Zegary działają od podstawy 930 MHz do zwiększenia 1.44 GHz. Warto tu znacznie mniej niż na benchmarkach gier: podnoszenie szybkości zegara poprawia arytmetykę, a arytmetyka nie jest tym, na co czeka generacja.
Pamięć podręczna i jednostki przetwarzające
PG506-242 ma pamięć podręczną L1 192 KB, wspierany przez pamięć podręczną L2 24 MB. Cache absorbuje część ruchu pamięci, która w przeciwnym razie uderzyłaby w główną magistralę, która jest jednym miejscem na tej stronie, gdzie liczba inna niż przepustowość cicho wpływa na szybkość generacji — duża L2 pozwala większej części zbioru roboczego pozostać blisko rdzeni.
Są 3,584 Jednostki cieniujące, 224 Jednostki mapowania tekstur, i 96 Jednostki wyjściowe.Render. Te napędy obsługują obciążenia graficzne i przyczyniają się do przetwarzania zapytań, ale pozostają bezczynne przez dużą część czasu, gdy model generuje odpowiedź.
Moc, rozmiar i instalacja
Pobór mocy
165 W
PG506-242 jest oceniane na 165 W, i sugerowane zasilanie systemu wynosi 450 W. Uruchamianie modelu językowego zajmuje kartę w krótkich momentach zamiast ciągłego — intensywnie korzysta podczas generowania i jest w uśpieniu między zapytaniami — więc utrzymane obciążenie w ciągu roboczego dnia jest zazwyczaj znacznie poniżej nominalnej wartości.
Płyta zajmuje dual-slot, pomiarowania 267 mm długi, i potrzebuje 8-pin EPS. Warto sprawdzić z zasilaczem oraz obudową w maszynie, ponieważ największe karty potrzebują zdecydowanie więcej obu niż typowy komputer stacjonarny oferuje.
Łączy się przez PCIe 4.0 x16. Interfejs reguluje, jak szybko model jest ładowany z dysku do karty, a nie jak szybko działa po załadowaniu, więc węższe połączenie kosztuje kilka sekund na starcie i nic później.
Ekstremy
Największe modele AI, które działają na a PG506-242
Największe modele open-weight, które mieszczą się na tej karcie, najnowsze najpierw. Każdy jest pokazany w najlepszej kompresji, jaką karta może pomieścić..
Najszybsze modele AI na a PG506-242
Gdzie ta KARTA produkuje tokeny najszybciej. Mniejsze modele dominują tutaj, ponieważ generowanie każdego tokenu oznacza odczytanie całego modelu z pamięci raz..
Krok po kroku
Jak obliczyć liczbę tokenów na sekundę dla a PG506-242
Nie musisz niczego obliczać ręcznie — kalkulator gputps.com na tej stronie już obliczył to dla każdego modelu, który ta karta może pomieścić. Odczytanie odpowiedzi zajmuje sześć kroków..
-
01
Szukaj modelu, którego chcesz
Tabela zawiera 502 modele, które ta karta może uruchomić. Szukaj według nazwy lub rozmiaru — wpisanie 27b pasuje do liczby parametrów, nawet gdy nazwa tego nie stwierdza.
-
02
Zdecyduj, jak długo trwają twoje rozmowy
Dłuższe rozmowy kosztują pamięć oprócz wag. 24 GB często jest to to, co pcha duży model na krawędź.
-
03
Przypnij porównanie do jednego poziomu jakości
Domyślnie tabela wybiera najmniej skompresowaną kopię, która się zmieści. Ustawienie minimum usuwa modele, które kwalifikują się tylko dzięki dużej kompresji.
-
04
Spójrz na zakres, nie tylko na liczbę
Liczby są obliczane, a nie mierzone. Najszybszy wynik na tej karcie to 395 tok/s na Gemma 3 QAT 1B. Ta sama karta i model różnią się od trzydziestu do pięćdziesięciu procent między czasami wykonywania inference.
-
05
Przeczytaj werdykt dopasowania ostatni
Kolumna dopasowania oddziela modele, które tylko mieszczą się, od tych, które mają trochę miejsca zapasowego — warto to sprawdzić przed zdecydowaniem się na jeden, w konfrontacji z dostępnym 24 GB.
-
06
Sprawdź w innych urządzeniach.
Śledzenie modelu na jego stronie pokazuje cały sprzęt, który może go uruchomić, więc możesz zobaczyć, jak wypada w porównaniu do PG506-242.
Odpowiedzi
PG506-242 — częste pytania
PG506-242— Ile rdzeni tensorowych ma?
To ma 224 Rdzenie tensorowe na wzdłuż 56 Procesory strumieniowe. Przyspieszają arytmetykę macierzy, z której zbudowany jest transformator, co głównie przyspiesza przetwarzanie długiego promptu, a nie generowanie odpowiedzi.
PG506-242— czy obsługuje CUDA?
Tak. Raportuje zdolność obliczeniową CUDA. 8.0. Funkcjonalność 7.0 i wyższa ma rdzenie tensorowe, z których korzysta nowoczesne oprogramowanie inferencyjne; poniżej tego korzysta z wolniejszych ścieżek kodu dla modelów kwantyzowanych.
PG506-242— Jakiego interfejsu autobusowego używa?
Używa PCIe 4.0 x16. To reguluje, jak szybko model jest ładowany na kartę, a nie jak szybko działa po załadowaniu, więc kosztuje kilka sekund podczas uruchamiania i nic podczas generacji.
PG506-242— czy jest dobry do uruchamiania lokalnych modeli AI?
Jego pamięć komfortowo pokrywa średniej wielkości modele, które większość ludzi uruchamia lokalnie, a jego przepustowość jest na tyle wysoka, że generuje tekst szybciej niż większość ludzi czyta. W sumie działa 502 modele, które śledzimy. Czy to wystarczy, zależy całkowicie od tego, który model chcesz — tabela powyżej odpowiada na to bezpośrednio.
PG506-242— czy może uruchomić model, który nie mieści się w jego VRAM?
Tylko częściowo. Warstwy poza kartą 24 GB siedzi w pamięci GPU i działa z ułamkową prędkością, więc w dużej mierze zrzucany model rzadko jest wart użycia. Każda wartość tutaj zakłada, że jest w pełni dostępna na karcie.
Czy dwa PG506-242 karty będą dwa razy szybsze?
Nie. Druga karta podwaja pamięć do 48 GB pracować z zamiast dwa razy więcej tokenów na sekundę — każda liczba tutaj dotyczy pojedynczej KARTY.
PG506-242— które modele AI może uruchomić?
502 z 679 modele językowe open-weight, które śledzimy, mieszczą się na tej karcie i mogą być uruchamiane lokalnie. Tabela na tej stronie zawiera każdy z nich, z wymaganą pamięcią, poziomem kwantyzacji oraz szacowaną prędkością generacji.
PG506-242— jaki jest największy model AI, który może uruchomić?
Największy model w naszym katalogu, który pasuje, to Mixtral 8x7B w 46.7B parametry, skompresowane do Q3_K_M. Generuje mniej więcej 82.7 tokenów na sekundę i potrzebuje około 21.0 GB pamięci karty.
PG506-242— Ile tokenów na sekundę produkuje?
To zależy od modelu. Najszybszy model, który śledzimy tutaj, to Gemma 3 QAT 1B około 395 tokenów na sekundę, podczas gdy większe modele działają proporcjonalnie wolniej, ponieważ każdy token wymaga odczytania całego modelu z pamięci za każdym razem. Prędkości są szacunkami dla jednej rozmowy na raz.
PG506-242— czy może działać 7B modele?
Tak. Na przykład działa Multi-Token Prediction 7B w Q8_0, używając około 7.9 GB pamięci i generowanie około 59.0 tokeny na sekundę
PG506-242— czy może działać 13B modele?
Tak. Na przykład działa DeepSeekMoE-16B w Q8_0, używając około 17.5 GB pamięci i generowanie około 137 tokeny na sekundę
PG506-242— czy może działać 30B modele?
Tak. Na przykład działa Nemotron 3-Nano-30B-A3B w Q4_K_M, używając około 18.1 GB pamięci i generowanie około 160 tokeny na sekundę
PG506-242— Ile ma pamięci?
Ta karta ma 24 GB z HBM2. Około jedna dziesiąta jest zarezerwowana przez czas wykonywania wnioskowania i sterownik, pozostawiając mniej więcej 21.6 GB dostępny dla modelu i jego rozmowy
PG506-242— jaka jest jej przepustowość VRAM?
Przepustowość pamięci osiąga 933 GB/s przez magistralę 3,072 bity. To jest jedyny najlepszy wskaźnik tego, jak szybko generuje tekst, ponieważ produkcja każdego tokena oznacza odczytanie całego modelu z pamięci jednocześnie.
PG506-242— Jakiego typu pamięci używa?
Używa HBM2 prędkość zegara na 1.22 GHz. Typy HBM znajdują się na akceleratorach w centrum danych i mają znacznie większą przepustowość niż GDDR używane na kartach stacjonarnych, dlatego generują tokeny znacznie szybciej przy tej samej pojemności.
PG506-242— kto to robi?
To jest produkt NVIDIA, z chipem wyprodukowanym przez TSMC, na procesie 7 nm.
PG506-242— kiedy to zostało wydane?
Został wydany w April 2021.
PG506-242— ile mocy zużywa?
Moc nominalna karty graficznej wynosi 165 W, i sugerowane zasilanie systemu wynosi 450 W. Generowanie tekstu bardzo obciąża w krótkich szczytach i idle'uje między żądaniami, więc średnie zużycie podczas sesji roboczej jest zazwyczaj znacznie poniżej określonej wartości.
PG506-242— ile pamięci podręcznej ma?
Pamięć podręczna L1 jest 192 KB, i pamięć podręczna L2 jest 24 MB. Cache absorbuje część ruchu pamięci, który w przeciwnym razie dotarłby do głównej magistrali, więc większy L2 daje skromny wzrost prędkości generacji ponad to, co przewiduje sama szerokość pasma.
PG506-242— jakie są jego TFLOPS?
Jest oceniane na 10.3 TFLOPS przy połowicznej precyzji i 10.3 TFLOPS przy pojedynczej precyzji. Są to najwyższe sufity arytmetyczne, a nie osiągalne stawki, a generacja tekstu osiąga tylko małą część z nich, ponieważ jest ograniczona przez przepustowość pamięci.
Druga strona
Patrząc na to z drugiej strony?
Ta strona zaczyna się od sprzętu. Jeśli już wiesz, jaki model chcesz i potrzebujesz wiedzieć, co jest potrzebne do jego uruchomienia, Zacznij od modelu zamiast.