Rendimiento limitado por memoria, calculado en vivo

¿Puede tu GPU ejecutar ese modelo de IA? La calculadora TPS de GPU

Elige una tarjeta gráfica o un modelo de lenguaje y calculamos — en vivo, no desde una tabla de búsqueda — si cabe, con qué compresión y aproximadamente cuántos tokens por segundo esperar..

Cada par calculado bajo demanda Publicada como un rango Fórmulas en el open

Estimación en vivo

Entrada
Qwen3-8B
18.6 tok/s
15.8 rango esperado 22.3

Formato

Q8_0

Contexto

13k

Confianza

high

Ejemplos trabajados

Descubre estas potentes combinaciones

Unas pocas combinaciones a las que señalaríamos a un amigo, en diferentes presupuestos..

El punto de entrada

12 GB
GeForce RTX 3060 12 GB
Qwen3-8B
18.6 tok/s
15.8 22.3
Q8_0 13k Contexto

El término medio

16 GB
GeForce RTX 4080
Qwen3-14B
29.8 tok/s
25.3 35.8
Q6_K 15k Contexto

La gran configuración

32 GB
GeForce RTX 5090
40.8 tok/s
24.5 65.3
Q6_K 35k Contexto

01

Comparar GPUS

VRAM, ancho de banda de la memoria, núcleos tensor y rendimiento FP16.

02

Estimar tokens por segundo

La velocidad de decodificación está limitada por el ancho de banda de la memoria, por lo que la modelamos en lugar de citar los TFLOPS máximos..

03

Verifica lo que encaja

Qué modelos se ejecutan en una tarjeta, en qué cuantización y con cuánto contexto.

El problema

Por qué "¿mi GPU ejecutará esto?" es una pregunta difícil

Una hoja de especificaciones te dice la memoria de una tarjeta y su velocidad de reloj. No te dice si un modelo de lenguaje específico cabe en esa memoria una vez comprimido, cuánto de la tarjeta queda disponible para la conversación en sí, o cuántos tokens por segundo realmente salen por el otro lado — y esas tres preguntas no tienen la misma respuesta para cualquier par de GPU y modelo.

La versión honesta de este cálculo toma en cuenta el conteo de parámetros del modelo y su arquitectura, el formato de compresión en el que se almacena, el ancho de banda de memoria de la tarjeta y cuán madura es su software de inferencia, y la longitud de la conversación que planeas tener con él. Obtener cualquiera de esos mal y el número que resulta se ve igual de seguro y es simplemente incorrecto.

No pretendemos que esto produzca una sola cifra precisa, porque no puede. Lo que hacemos en su lugar es ejecutar el cálculo completo para cada tarjeta y cada modelo que tenemos en nuestra base de datos, publicar el resultado como un rango en lugar de un valor puntual de falsa precisión, y mostrar nuestro trabajo: cada fórmula detrás de cada número en este sitio está escrita abiertamente, no oculta detrás de la respuesta.

Lo que este sitio realmente te ofrece

El conjunto de datos más completo que pudimos reunir: miles de tarjetas gráficas y miles de modelos de lenguaje, verificados entre sí en lugar de mirarlos uno por uno. Comienza con una tarjeta que posees o que estás considerando, y ve cada modelo que se adapta a ella. Comienza con un modelo que quieres ejecutar, y ve cada tarjeta que puede soportarlo.

Eso funciona en ambas direcciones porque el cálculo subyacente es simétrico — la misma aritmética de VRAM y ancho de banda, ejecutada desde cualquier lado que ya conozcas. Ninguna de las direcciones es la "real"; son la misma respuesta formulada de dos maneras diferentes.

Lee más sobre cómo y por qué en nuestro sobre página.

Nuevas versiones

Echa un vistazo a estos potentes modelos nuevos

Buscar todos los modelos de IA

NVIDIA

Jun 2026

Nemotron 3 Ultra
550B parámetros

GPU Compatible

B300

Prime Intellect,Arcee AI

Feb 2026

Arcee Trinity Large
398B parámetros

GPU Compatible

B300

Alibaba

Feb 2026

Qwen3.5 397B-A17B
397B parámetros

GPU Compatible

B300

Nuevas versiones

Consulta estas potentes nuevas GPU.

Buscar todas las GPU

NVIDIA

Oct 2025

Lo suficientemente potente para ejecutar

Mistral Medium 3.5 · 128B

NVIDIA

Oct 2025

GB10
128 GB Memoria

Lo suficientemente potente para ejecutar

Solar Open2 250B · 250.3B

AMD

Sep 2025

Radeon PRO W7900D
48 GB Memoria

Lo suficientemente potente para ejecutar

Qwen3-Coder-Next · 80B

Ambas direcciones

Cómo funciona la calculadora

El mismo cálculo, utilizable desde cualquier lado de la pregunta desde la que estés comenzando..

Partiendo de una GPU que posees

  1. 01 Encuentra tu tarjeta GPU . Busca en el catálogo de GPU la card que posees o estás considerando, por nombre o por tamaño de memory.
  2. 02 Abre su página . Cada CARD tiene su propia página que lista cada modelo de lenguaje que podemos evaluar contra él, con una cifra estimada de TOKENS-POR-SEGUNDO para cada uno.
  3. 03 Establece tu longitud de contexto y el umbral de calidad . Ajusta la longitud de la conversación que esperas trabajar y la menor compresión que aceptarás. Ambos cambian la respuesta en vivo.
  4. 04 Lee el rango, no un solo número. . Cada estimación se publica con un rango de confianza en lugar de una figura de falsa precisión, porque la misma tarjeta y modelo varían entre motores de inferencia de maneras que ninguna hoja de especificaciones predice.

Partiendo de un modelo que deseas ejecutar

  1. 01 Encuentra el modelo . Buscar en el catálogo de modelos de IA por nombre o por tamaño — incluso cuando el nombre en sí no indica el conteo de parámetros.
  2. 02 Abre su página . Un modelo con PESOS ABIERTOS enumera cada tarjeta gráfica contra la que podemos evaluarlo, la más pequeña que se ajusta y la más rápida primero.
  3. 03 Establece tu longitud de contexto y el umbral de calidad . Los mismos dos controles que el camino GPU-principal: una conversación más larga necesita más MEMORY, lo que puede hacer que una CARD pase de "encaja" a "no encaja".
  4. 04 Compara tarjetas por lo que realmente notarás . La MEMORY decide si se ejecuta o no; la bandwidth decide qué tan rápido se siente una vez que lo hace. La tabla se ordena por tokens por segundo por defecto porque eso es lo que generalmente importa.

Respuestas

preguntas comunes

01

¿Cómo calculo si mi GPU puede ejecutar un LLM local?

Encuentra tu tarjeta en el catálogo de GPU y abre su página — lista cada modelo que podemos evaluar en comparación con ella, si cada uno se ajusta en la memoria, y una cifra estimada de tokens-por-segundo. También puedes comenzar desde un modelo y ver qué tarjetas pueden ejecutarlo, que es el mismo cálculo desde la dirección opuesta.

02

¿Puede mi GPU ejecutar modelos LLM locales en absoluto?

Si tiene al menos unos pocos gigabytes de memoria propia, casi con certeza algo. Las gráficas integradas que comparten memoria del sistema son la principal excepción, ya que no tienen un grupo dedicado para contener un modelo. Más allá de eso, es una cuestión de qué modelo, a qué compresión — no sí o no.

03

¿Qué determina los tokens por segundo en una GPU?

Generar un token significa leer los pesos del modelo de la VRAM una vez, por lo que la velocidad está limitada por el ancho de banda de la memoria dividido por cuánto tiene que ser leído por token — lo que depende del tamaño del modelo, su arquitectura y el formato de compresión en el que está almacenado. La velocidad del reloj y el número de núcleos, los números con los que comienza una hoja de especificaciones, apenas influyen.

04

¿Cuán precisas son las estimaciones en este sitio?

Se espera que la cifra real se encuentre dentro de aproximadamente un 20–40% de la estimación. La misma GPU y modelo varían tanto entre motores de inferencia, versiones de motor y configuraciones de servicio — ningún cálculo de las hojas de especificaciones por sí solo puede predecir eso, por lo que cada cifra aquí se publica como un rango.

05

¿Es una GPU más grande y nueva siempre más rápida para IA?

Para un modelo que ya se adapta cómodamente en ambas tarjetas, el ancho de banda de memoria decide el ganador, y una tarjeta más nueva suele tener más de esto. Pero el cuello de botella más común es la capacidad, no la velocidad — la pregunta más útil para una tarjeta específica suele ser "¿cuál es el modelo más grande que se adapta?", que es lo que cada página de tarjeta responde directamente.

06

¿Necesito entender la cuantización para usar este sitio?

No — cada página de tarjeta y modelo elige la compresión de mejor calidad que realmente se ajusta, automáticamente. La cuantización es la técnica que reduce la huella de memoria de un modelo a un bajo costo para la calidad de salida, y puedes establecer un límite de calidad tú mismo si lo deseas, pero nada lo requiere.

07

¿De dónde provienen los conjuntos de datos de GPU y AI model?

Especificaciones de tarjetas gráficas y registros de modelos de lenguaje que cubren miles de modelos de peso abierto y sus recuentos de parámetros, licencias y fechas de lanzamiento. Ambos se actualizan a medida que se lanzan nuevo hardware y modelos; consulte los catálogos de GPU y modelos de IA para obtener una cobertura completa.

Vendiendo hardware

¿Interesado en convertirte en un proveedor?

Enumera tus GPU a la venta justo al lado de la respuesta a lo que realmente pueden ejecutar..

Próximamente

Recibe notificaciones sobre nuevas GPUs y modelos

Una boletín llegará pronto..

Próximamente