O nás
O gputps.com
Specifika vám říkají, co je GPU. Neříkají vám, co dělá s jazykovým modelem. To je mezera, kterou jsme vytvořili, abychom ji zaplnili..
Co to je
Co děláme
Pro každé GPU odhadujeme, kolik tokenů za sekundu může generovat při spuštění daného open-weight jazykového modelu, zda tento model skutečně vejde do jeho paměti, a při jaké kvantizaci. Tyto informace publikujeme vedle specifikačních tabulek, takže rozhodnutí o koupi je založeno na skutečné odpovědi, spíše než na surových VRAM a FLOPS číslech, které samy o sobě nic neříkají o rychlosti inference..
Proč odhad, a ne jedno číslo
Generování tokenu znamená přečíst váhy modelu z paměti jednou, takže rychlost dekódování je omezena šířkou pásma paměti dělenou velikostí modelu — to je výpočet za každým číslem na této stránce. Ale stejná KARTA a model se liší o 20–40 % mezi inference enginy, verzemi engine a formáty kvantizace, a žádný technický list to nepředpovídá. Publikace jednoho důvěryhodně vypadajícího čísla by byla nepoctivá vzhledem k tomu, jak přesný tento typ odhadu může skutečně být. Takže každé číslo na této stránce je prezentováno jako rozsah, spolu s metodou a vstupy za ním, spíše než jako holá bodová hodnota..
Tržiště pro prodejce
Vedle odhadů mohou prodejci uvádět GPU na prodej přímo na vlastní stránce karty — vedle odpovědi na "co to vlastně spouští", což je místo, kde se toto rozhodnutí dělá..
Začít zde
Obě směry, jeden výpočet
Začněte od GPU karty, kterou vlastníte nebo zvažujete, nebo od modelu, který chcete spustit..
Spojte se.
Našli jste něco špatného?
Našli jste špatnou hodnotu, chybějící GPU, nebo máte návrh? Rádi bychom to slyšeli..
Ovládáno pomocí
GPU AI Benchmark LLC 1209 Mountain Road Pl NE, Ste RAlbuquerque, NM 87110
USA