Sobre nosotros
Sobre gputps.com
Las especificaciones te dicen qué es una GPU. No te dicen qué hace con un modelo de lenguaje. Esa es la brecha que construimos este sitio para cerrar..
Lo que esto es
Lo que hacemos
Para cualquier GPU, estimamos cuántos tokens por segundo puede generar ejecutando un dado modelo de lenguaje de peso abierto, si ese modelo realmente cabe en su memoria y en qué cuantización. Publicamos esto junto con las tablas de especificaciones, de modo que una decisión de compra se base en una respuesta real en lugar de números de VRAM y FLOPS que, por sí mismos, no dicen nada sobre la velocidad de inferencia..
¿Por qué una estimación, y no un solo número?
Generar un token significa leer los pesos de un modelo de la memoria una vez, por lo que la velocidad de decodificación está limitada por el ancho de banda de memoria dividido por el tamaño del modelo — esa es la cálculo detrás de cada cifra en este sitio. Pero la misma tarjeta y modelo varían entre 20–40% entre motores de inferencia, versiones de motores y formatos de cuantización, y ninguna ficha técnica predice eso. Publicar un número que parezca seguro sería deshonesto sobre cuán preciso puede ser realmente este tipo de estimación. Así que cada cifra en este sitio se envía como un rango, con el método y los datos detrás de ello, en lugar de un valor puntual..
El mercado de proveedores
Junto a las estimaciones, los proveedores pueden listar GPUs a la venta directamente en la página de la tarjeta — al lado de la respuesta a "qué es lo que realmente ejecuta", que es donde se toma esa decisión..
Empieza aquí
Ambas direcciones, un cálculo
Empieza desde una tarjeta que posees o estás considerando, o desde el modelo que quieres ejecutar..
Póngase en contacto
¿Encontraste algo malo?
¿Encontraste una cifra incorrecta, faltante GPU, o tienes una sugerencia? Nos gustaría saberlo..
Operado por
GPU AI Benchmark LLC 1209 Mountain Road Pl NE, Ste RAlbuquerque, NM 87110
USA