Sobre nosotros

Sobre gputps.com

Las especificaciones te dicen qué es una GPU. No te dicen qué hace con un modelo de lenguaje. Esa es la brecha que construimos este sitio para cerrar..

Lo que esto es

Lo que hacemos

Para cualquier GPU, estimamos cuántos tokens por segundo puede generar ejecutando un dado modelo de lenguaje de peso abierto, si ese modelo realmente cabe en su memoria y en qué cuantización. Publicamos esto junto con las tablas de especificaciones, de modo que una decisión de compra se base en una respuesta real en lugar de números de VRAM y FLOPS que, por sí mismos, no dicen nada sobre la velocidad de inferencia..

¿Por qué una estimación, y no un solo número?

Generar un token significa leer los pesos de un modelo de la memoria una vez, por lo que la velocidad de decodificación está limitada por el ancho de banda de memoria dividido por el tamaño del modelo — esa es la cálculo detrás de cada cifra en este sitio. Pero la misma tarjeta y modelo varían entre 20–40% entre motores de inferencia, versiones de motores y formatos de cuantización, y ninguna ficha técnica predice eso. Publicar un número que parezca seguro sería deshonesto sobre cuán preciso puede ser realmente este tipo de estimación. Así que cada cifra en este sitio se envía como un rango, con el método y los datos detrás de ello, en lugar de un valor puntual..

El mercado de proveedores

Junto a las estimaciones, los proveedores pueden listar GPUs a la venta directamente en la página de la tarjeta — al lado de la respuesta a "qué es lo que realmente ejecuta", que es donde se toma esa decisión..

Aprende sobre cómo convertirte en un vendedor.

Empieza aquí

Ambas direcciones, un cálculo

Empieza desde una tarjeta que posees o estás considerando, o desde el modelo que quieres ejecutar..

Póngase en contacto

¿Encontraste algo malo?

¿Encontraste una cifra incorrecta, faltante GPU, o tienes una sugerencia? Nos gustaría saberlo..

Operado por

GPU AI Benchmark LLC 1209 Mountain Road Pl NE, Ste R
Albuquerque, NM 87110
USA