O nas
O gputps.com
Karty katalogowe mówią, czym jest GPU. Nie mówią, co robi z modelem językowym. To jest luką, którą zbudowaliśmy, aby zamknąć tę stronę..
Co to jest
Co robimy
Dla każdego GPU szacujemy, ile tokenów na sekundę może wygenerować, uruchamiając dany model językowy open-weight, czy ten model rzeczywiście mieści się w jego pamięci oraz przy której kwantyzacji. Publikujemy te informacje obok tabel specyfikacji, aby decyzja zakupowa była oparta na rzeczywistej odpowiedzi, a nie jedynie na liczbach VRAM i FLOPS, które same w sobie nie mówią nic o prędkości wnioskowania..
Dlaczego oszacowanie, a nie jedna liczba
Generowanie tokena oznacza odczytanie wag modelu z pamięci raz, więc szybkość dekodowania jest ograniczona przez przepustowość pamięci podzieloną przez rozmiar modelu — to obliczenie leży u podstaw każdej wartości na tej stronie. Ale ta sama karta i model różnią się o 20–40% między silnikami wnioskowania, wersjami silników i formatami kwantyzacji, a żaden arkusz specyfikacji tego nie przewiduje. Publikowanie jednej liczby, która wygląda na pewną, byłoby nieuczciwe wobec tego, jak precyzyjnie można oszacować tego typu wartość. Dlatego każda liczba na tej stronie jest przedstawiana jako zakres, z metodą i danymi wejściowymi stojącymi za nią, zamiast surowej wartości punktowej..
Rynek dostawców
Obok szacunków, dostawcy mogą wystawiać GPU na sprzedaż bezpośrednio na stronie karty — obok odpowiedzi na "co to właściwie uruchamia", co jest miejscem, gdzie zapada ta decyzja..
Zacznij tutaj
Oba kierunki, jedno obliczenie
Zacznij od karty, którą posiadasz lub rozważasz, lub od modelu, który chcesz uruchomić..
Skontaktuj się
Znalazłeś coś nie tak?
Znalazłeś błędną cyfrę, brakuje GPU lub masz sugestię? Chcielibyśmy o tym usłyszeć..
Obsługiwane przez
GPU AI Benchmark LLC 1209 Mountain Road Pl NE, Ste RAlbuquerque, NM 87110
USA