Respuestas
Preguntas frecuentes
Sobre las estimaciones, lo que significan y cómo funciona el sitio. Las preguntas sobre una tarjeta o modelo específico se responden en la página de esa tarjeta o modelo..
¿Qué significa "tokens por segundo"?
Es cuán rápido un modelo de lenguaje genera texto en una GPU dada — cuántos tokens (aproximadamente, piezas de palabras) produce cada segundo mientras chateas con él. Un número más alto significa que las respuestas fluyen más rápido.
¿Qué tan precisas son las estimaciones?
Espere que la cifra real se sitúe dentro de aproximadamente el 20-40% de la estimación. La misma GPU y modelo varían tanto entre motores de inferencia, versiones de motor y configuración de servicio — ninguna hoja de especificaciones predice eso, por lo que cada cifra en este sitio se publica como un rango en lugar de un solo número.
¿Por qué es tu número mucho más bajo que el rendimiento que publica un vendedor de hardware?
El rendimiento publicado por el vendedor normalmente se mide sirviendo cientos de solicitudes a la vez. Nuestra cifra es para una persona hablando con el modelo, una solicitud a la vez — el número que realmente describe ejecutar un modelo localmente. Los dos no son comparables.
¿Qué significa que un modelo "encaje" en una GPU?
Que los pesos del modelo, su caché de conversación y los propios costos de ejecución encajen dentro de la memoria utilizable de la tarjeta en una cuantización dada. Un modelo puede ajustarse ligeramente, cómodamente, o no ajustarse en absoluto — mostramos cuál, junto con cuánta holgura queda.
¿Qué es la cuantización y por qué cambia si algo cabe?
La cuantización comprime los pesos de un modelo para ahorrar VRAM, a un pequeño costo en la calidad de salida. Un modelo que no cabe a plena precisión a menudo se ajusta cómodamente a una cuantización más baja — siempre reportamos la mejor calidad que se ajusta a una tarjeta dada.
¿Qué GPUs cubres?
Miles de tarjetas de NVIDIA, AMD, Intel y Apple Silicon, desde aceleradores de centros de datos hasta tarjetas de consumo. La cobertura y la confianza en la estimación son mejores en hardware moderno de NVIDIA, donde los motores de inferencia subyacentes son más maduros.
¿Es gputps.com gratis para usar?
Sí — navegar por GPU, modelos y cada estimación en el sitio es gratis, sin necesidad de cuenta.
¿Cómo enumero una GPU para la venta?
Registra una cuenta de vendedor gratuita y añade tus listados — aparecen directamente en la página de la tarjeta que coincide. Consulta la página de convertirte en vendedor para saber cómo funciona y los precios actuales.
Aún buscando
¿No puedes encontrar lo que estás buscando?
¿Encontraste una cifra incorrecta, faltante GPU, o tienes una sugerencia? Nos gustaría saberlo..
El método
Cómo se construyen las estimaciones
Las especificaciones te dicen qué es una GPU. No te dicen qué hace con un modelo de lenguaje. Esa es la brecha que construimos este sitio para cerrar..