El catálogo
Calculadora TPS de GPU
Calcula cuántos tokens por segundo produce cualquier tarjeta gráfica en un modelo de IA local. Filtra el catálogo a continuación para las tarjetas que valgan la pena considerar, luego abre una para ver cada modelo de lenguaje que puede ejecutar, cuánta memoria necesita cada uno y qué tan rápido es probable que sea..
818
tarjetas en archivo
4
fabricantes
4 GB – 288 GB
rango de VRAM
8,190 GB/s
mayor ancho de banda
Cada palabra tiene que coincidir con algo, así que más palabras reducen la lista. Una capacidad como 24GB coincide en la memoria de la tarjeta, aunque ninguna columna la almacena como texto..
818 las tarjetas coinciden
Actualizando| Tipo de memoria | Potencia | ||||||
|---|---|---|---|---|---|---|---|
| B300 NVIDIA · Blackwell Ultra | 288 GB | 8,000 GB/s | 2.03 GHz | 1.67 GHz | Sep 2025 | HBM3e | 1,400 W |
| Radeon Instinct MI350X AMD · CDNA 4.0 | 288 GB | 8,190 GB/s | 2.2 GHz | 1 GHz | Jan 2025 | HBM3e | 1,000 W |
| Radeon Instinct MI355X AMD · CDNA 4.0 | 288 GB | 8,190 GB/s | 2.4 GHz | 1 GHz | Jan 2025 | HBM3e | 1,400 W |
| Radeon Instinct MI325X AMD · CDNA 3.0 | 256 GB | 6,000 GB/s | 2.1 GHz | 1 GHz | Oct 2024 | HBM3e | 1,000 W |
| Radeon Instinct MI300X AMD · CDNA 3.0 | 192 GB | 5,325 GB/s | 2.1 GHz | 1 GHz | Dec 2023 | HBM3 | 750 W |
| Radeon Instinct MI308X AMD · CDNA 3.0 | 192 GB | 5,325 GB/s | 2.1 GHz | 1 GHz | Dec 2023 | HBM3 | 750 W |
| B200 NVIDIA · Blackwell | 180 GB | 8,000 GB/s | 1.97 GHz | 700 MHz | Jan 2024 | HBM3e | 1,000 W |
| H200 NVL NVIDIA · Hopper | 141 GB | 4,890 GB/s | 1.79 GHz | 1.37 GHz | Nov 2024 | HBM3e | 600 W |
| H200 SXM 141 GB NVIDIA · Hopper | 141 GB | 4,890 GB/s | 1.98 GHz | 1.5 GHz | Nov 2024 | HBM3e | 700 W |
| Data Center GPU Max 1550 Intel · Generation 12.5 | 128 GB | 3,280 GB/s | 1.6 GHz | 900 MHz | Jan 2023 | HBM2e | 600 W |
| Data Center GPU Max Subsystem Intel · Generation 12.5 | 128 GB | 3,210 GB/s | 1.6 GHz | 900 MHz | Jan 2023 | HBM2e | 2,400 W |
| GB10 NVIDIA · Blackwell 2.0 | 128 GB | 273 GB/s | 2.42 GHz | 1.67 GHz | Oct 2025 | LPDDR5X | 140 W |
| Jetson T5000 NVIDIA · Blackwell | 128 GB | 273 GB/s | 2.53 GHz | 1.67 GHz | Aug 2025 | LPDDR5X | 40 W |
| Radeon Instinct MI250 AMD · CDNA 2.0 | 128 GB | 3,280 GB/s | 1.7 GHz | 1 GHz | Nov 2021 | HBM2e | 500 W |
| Radeon Instinct MI250X AMD · CDNA 2.0 | 128 GB | 3,280 GB/s | 1.7 GHz | 1 GHz | Nov 2021 | HBM2e | 500 W |
| Radeon Instinct MI300 AMD · CDNA 3.0 | 128 GB | 6,550 GB/s | 1.7 GHz | 1 GHz | Jan 2023 | HBM3 | 600 W |
| Radeon Instinct MI300A AMD · CDNA 3.0 | 128 GB | 5,325 GB/s | 2.1 GHz | 1 GHz | Dec 2023 | HBM3 | 750 W |
| Data Center GPU Max 1350 Intel · Generation 12.5 | 96 GB | 2,460 GB/s | 1.55 GHz | 750 MHz | Jan 2023 | HBM2e | 450 W |
| H100 PCIe 96 GB NVIDIA · Hopper | 96 GB | 3,360 GB/s | 1.84 GHz | 1.67 GHz | Mar 2023 | HBM3 | 700 W |
| H100 SXM5 96 GB NVIDIA · Hopper | 96 GB | 3,360 GB/s | 1.98 GHz | 1.35 GHz | Mar 2023 | HBM3 | 700 W |
| RTX PRO 6000 Blackwell NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.62 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 600 W |
| RTX PRO 6000 Blackwell Max-Q NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.28 GHz | 1.04 GHz | Mar 2025 | GDDR7 | 300 W |
| RTX PRO 6000 Blackwell Server NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.62 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 600 W |
| RTX PRO 6000D Blackwell Max-Q NVIDIA · Blackwell 2.0 | 96 GB | 1,790 GB/s | 2.29 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 300 W |
| H100 NVL 94 GB NVIDIA · Hopper | 94 GB | 3,940 GB/s | 1.79 GHz | 1.08 GHz | Mar 2023 | HBM3 | 400 W |
| H100 SXM5 94 GB NVIDIA · Hopper | 94 GB | 3,360 GB/s | 1.98 GHz | 1.35 GHz | Mar 2023 | HBM3 | 700 W |
| RTX 6000D NVIDIA · Blackwell 2.0 | 84 GB | 1,570 GB/s | 2.43 GHz | 1.59 GHz | Mar 2025 | GDDR7 | 600 W |
| A100 PCIe 80 GB NVIDIA · Ampere | 80 GB | 1,940 GB/s | 1.41 GHz | 1.07 GHz | Jun 2021 | HBM2e | 300 W |
| A100 SXM4 80 GB NVIDIA · Ampere | 80 GB | 2,040 GB/s | 1.41 GHz | 1.28 GHz | Nov 2020 | HBM2e | 400 W |
| A100X NVIDIA · Ampere | 80 GB | 2,040 GB/s | 1.44 GHz | 795 MHz | Jun 2021 | HBM2e | 300 W |
Paso a paso
Cómo calcular el TPS de tu GPU
Nada aquí necesita resolverse a mano. El catálogo anterior ya contiene cada tarjeta, y cada página de tarjeta ya tiene cada modelo que puede ejecutar con una cifra de tokens por segundo adjunta. Llegar a tu respuesta toma seis pasos..
-
01
Reduce el catálogo a tarjetas que valga la pena considerar.
Utiliza los filtros anteriores para establecer lo que realmente necesitas: un tamaño mínimo de MEMORY, un fabricante, un límite de potencia que tu alimentación puede proporcionar, o un año de RELEASE. MEMORY es el filtro con el que comenzar, porque decide qué modelos son posibles.
-
02
O busca una tarjeta que ya posees
Escribe el nombre en el cuadro de búsqueda. Cada palabra debe coincidir con algo, así que más palabras reducen la lista, y una capacidad como 24GB coincide con la memoria de la tarjeta, aunque ninguna columna la almacene como texto.
-
03
Ordenar por la especificación que decide tu resultado
Ordenar por memoria si la pregunta es qué modelos caben, o por ancho de banda si la pregunta es cuán rápido se ejecutarán. Las velocidades de reloj y las cuentas de núcleos se enumeran para completar, pero apenas afectan la generación de texto.
-
04
Abre la tarjeta
Cada tarjeta tiene su propia página que lista cada modelo de lenguaje que puede ejecutar, con tokens estimados por segundo, la memoria que necesita cada modelo y la compresión a la que se ejecuta.
-
05
Establece tu longitud de contexto y calidad mínima
En la página de la tarjeta, establece la longitud de conversación que esperas trabajar y la menor compresión que estás dispuesto a aceptar. Ambos cambian la respuesta en lugar de filtrarla; una conversación más larga necesita más memoria, lo que puede sacar a un modelo grande de la tarjeta por completo.
-
06
Lee el rango, no el solo número
Cada cifra de rendimiento se publica con un rango de confianza alrededor de ella. Toma el rango como la respuesta: la misma CARTA y MODELO varían entre motores de inferencia y versiones de maneras que ninguna hoja de especificaciones predice, y el número principal es solo el medio de esa distribución.
Qué significan los números
Qué es este catálogo
Esta es una base de datos que contiene 818 tarjetas gráficas, filtradas hasta las que tienen suficiente memoria para contener un modelo de lenguaje. Cada tarjeta tiene su propia página, y en esa página cada modelo que rastreamos ha sido evaluado en relación con ella — si se ajusta, con qué compresión, y cuántos tokens por segundo es probable que produzca.
El cálculo se ejecuta cuando abres una tarjeta en lugar de ser consultado desde una tabla almacenada, lo que permite que la longitud del contexto y la calidad mínima sean cosas que estableces en lugar de cosas que asumimos en tu nombre. Cambia cualquiera y cada cifra se vuelve a calcular.
Por qué los TOKENS por SEGUNDO son el número que importa
Ejecutar un modelo de lenguaje en tu propio hardware se convirtió en algo ordinario en poco tiempo. Los modelos de peso abierto alcanzaron un nivel suficiente para ser realmente útiles, y las herramientas para ejecutarlos dejaron de requerir un fondo de investigación. Lo que no llegó junto con eso fue una respuesta directa a la primera pregunta que cualquiera se hace: ¿se ejecutará en la tarjeta que ya tengo y será lo suficientemente rápido como para valer la pena usarlo?
Las hojas de especificaciones no responden a esto. Están escritas para cargas de trabajo gráficas y se centran en las cifras que deciden las tasas de cuadros, que son casi en su totalidad las incorrectas. Los dos números que realmente deciden el resultado son la capacidad de memoria, que determina si un modelo cabe, y el ancho de banda de memoria, que establece qué tan rápido genera una vez que lo hace.
Los Tokens por segundo es el número que expresa el resultado en algo que puedes sentir. La velocidad de lectura está en algún lugar alrededor de diez tokens por segundo, así que cualquier cosa por encima de eso llega más rápido de lo que puedes leer y cualquier cosa muy por debajo se siente como esperar. Esa es la cifra que este sitio calcula, para cada combinación de tarjeta y modelo que tiene.
Qué cubre el catálogo
rango de VRAM
4 GB – 288 GB
mayor ancho de banda
8,190 GB/s
Rango de potencia
6 – 2,400 W
La memoria a través del catálogo comienza en 4 GB y alcanza 288 GB. Ese rango es la diferencia entre una tarjeta limitada a los modelos más pequeños utilizables y una que sostiene modelos que ninguna máquina de escritorio puede tocar — la capacidad es una puerta dura en lugar de un compromiso gradual, así que un modelo o se ajusta o no se ejecuta.
El ancho de banda de VRAM comienza en 10 GB/s y alcanza 8,190 GB/s, una figura sostenida por Radeon Instinct MI355X. Porque generar cada token significa leer todo el modelo de la memoria una vez, esa dispersión se traduce casi directamente en una dispersión en la velocidad de generación: una tarjeta con diez veces el ancho de banda produce tokens aproximadamente diez veces más rápido en el mismo modelo.
Las tarjetas en el catálogo son fabricadas por AMD, ATI, Intel and NVIDIA. El fabricante importa más de lo que debería: el software de inferencia ha recibido mucha más atención en el camino de CUDA que en cualquier otro, por lo que una tarjeta de AMD o Intel de ancho de banda equivalente generalmente alcanza una menor parte de su techo teórico. Nuestras estimaciones aplican una penalización por eso en lugar de pretender que el hardware es la única variable.
El consumo de energía comienza en 6 W y alcanza 2,400 W. El extremo superior es hardware de centro de datos que una fuente de escritorio no puede alimentar, y es la restricción que las personas tienden a descubrir por último — después de que la card encaja en el presupuesto y el case.
Las fechas de lanzamiento comienzan en 2009 y ejecutar a 2025, así que el catálogo cubre hardware que la gente aún posee así como hardware que podría comprar. Una tarjeta más antigua no está excluida por ser vieja: si tiene la MEMORY, aún puede ejecutar un modelo, y la página dirá qué tan rápido.
Comprar una tarjeta
Los vendedores pueden listar tarjetas a la venta contra cualquier entrada en este catálogo, por lo que una página de tarjeta puede mostrar tanto lo que el hardware ejecutará como dónde se puede comprar. Las listas están adjuntas a la variante de placa específica en lugar de a un nombre de modelo, lo que aquí importa más de lo habitual: el mismo nombre a menudo cubre varias capacidades de memoria, y la capacidad es lo que decide qué modelos se ejecutan.
Clasificaciones
Más memoria
La capacidad decide qué modelos encajan..
mayor ancho de banda
El ancho de banda decide cuán rápido funcionan una vez que se ajustan..
Más exigente en términos de energía
Revisa estos en comparación con el suministro que ya posees..
Leyendo la tabla
Cómo leer este catálogo
- Memoria
- Cuánto puede contener la tarjeta. Una guía aproximada es un poco más de medio gigabyte por mil millones de parámetros en la compresión que la mayoría de la gente utiliza, más espacio para la conversación. No todo está disponible; el software de inferencia reserva aproximadamente un décimo para su propio espacio de trabajo.
- Ancho de banda
- Qué tan rápido la tarjeta lee su propia memoria, en gigabytes por segundo. Este es el mejor predictor de velocidad de generación en este sitio.
- Reloj base y reloj de impulso
- Qué tan rápido funciona el procesador. Listado para completitud, y mucho menos predictivo aquí que en un benchmark de juegos: la generación espera en la memoria, no en la aritmética.
- Tipo de memoria e interfaz de bus
- La tecnología de memoria y cómo la CARD se conecta a la máquina. Las partes HBM son hardware de centro de datos con mucho más ancho de banda que el GDDR utilizado en las CARD de escritorio. La interfaz del bus determina la rapidez con la que un modelo se carga, no la rapidez con la que se ejecuta.
- Potencia
- La potencia nominal de la tarjeta en vatios. Vale la pena filtrarlo cuando la fuente de alimentación o la caja ya están decididas, ya que las tarjetas más grandes necesitan considerablemente más de lo que proporciona un escritorio típico.
- Por qué una tarjeta aparece más de una vez
- Cada fila es una variante de placa en lugar de un chip, por lo que el mismo nombre puede aparecer en varias capacidades de memoria. Esa distinción importa aquí más que en ningún otro lugar, porque la capacidad es lo que decide si un modelo se ejecuta.
Respuestas
preguntas comunes
¿Cómo calculo los tokens por segundo de mi GPU?
No tienes que. Encuentra tu tarjeta en la tabla de arriba — el catálogo contiene 818 de ellos — y ábrelo. Su página lista cada modelo de lenguaje que puede ejecutar con una cifra estimada de tokens-por-segundo para cada uno, calculada a partir del ancho de banda de memoria de la tarjeta y el tamaño del modelo una vez comprimido.
¿Qué es un buen tokens por segundo para ejecutar IA localmente?
La velocidad de lectura es de aproximadamente diez tokens por segundo, así que cualquier cosa por encima de eso produce texto más rápido de lo que puedes leer y se siente inmediato. Entre cinco y diez es utilizable pero visiblemente lento. Debajo de cinco es incómodo para la conversación, aunque sigue siendo aceptable para el trabajo que dejas en ejecución.
¿Cuál especificación de GPU importa más para AI?
Capacidad de memoria primero, porque todo el modelo tiene que estar en la tarjeta antes de que pueda generar algo, y ancho de banda segundo, porque generar cada token significa leer ese modelo de la memoria una vez. Los conteos de núcleos y las velocidades de reloj deciden el rendimiento gráfico y apenas se registran aquí.
¿Cuánta VRAM necesito para ejecutar un modelo de lenguaje?
Como guía aproximada, un poco más de medio gigabyte por mil millones de parámetros con la compresión que la mayoría de la gente usa, más espacio para la conversación. Eso coloca un modelo de ocho mil millones de parámetros cómodamente en ocho gigabytes y uno de treinta mil millones en veinticuatro. Las tarjetas de este catálogo comienzan en 4 GB y alcanzar 288 GB.
¿Cuántas tarjetas gráficas hay en nuestra base de datos?
El catálogo contiene 818 tarjetas hecho por AMD, ATI, Intel and NVIDIA. Las gráficas integradas están excluidas porque no tienen memoria propia, al igual que las tarjetas de menos de cuatro gigabytes, en las que ningún modelo en nuestro catálogo cabe en ninguna compresión.
¿Cuál GPU tiene el mayor ancho de banda de VRAM?
Eso es Radeon Instinct MI355X, alcanzando 8,190 GB/s. Dado que la velocidad de generación sigue casi directamente al ancho de banda, también se encuentra entre las tarjetas más rápidas aquí para producir texto — aunque si eso importa depende primero de si tu modelo se ajusta.
¿Qué GPU tiene la mayor memoria?
Eso es Radeon Instinct MI355X, sosteniendo 288 GB. La capacidad a ese nivel es territorio de centro de datos, y es lo que permite que los modelos de open weight más grandes se mantengan en una sola card en lugar de dividirse en varias.
¿Es una tarjeta gráfica de juegos lo suficientemente buena para AI local?
Para una persona a la vez, usualmente sí, y a menudo mejor relación calidad-precio que el hardware de centro de datos. Las tarjetas de consumo sacrifican memoria total en lugar de velocidad, por lo que el límite es qué modelos encajan en lugar de cuán rápido funcionan una vez que lo hacen.
¿Importa el fabricante para el rendimiento de la IA?
Más de lo que debería. El software de inferencia ha tenido mucho más trabajo en la ruta CUDA que en las alternativas, así que una tarjeta AMD o Intel de ancho de banda equivalente generalmente alcanza una parte menor de su límite teórico. Nuestras estimaciones aplican una penalización por eso en lugar de asumir que el hardware es la única variable.
¿Puedo usar dos tarjetas gráficas juntas?
Sí, y a menudo es el punto: dos tarjetas sostienen modelos que ninguna podría sostener sola. No duplica la velocidad de generación de la manera en que duplica la memoria, y cada cifra en este sitio describe una tarjeta sola.
¿Qué tan precisas son estas estimaciones de TOKENS-PER-SECOND?
Se calculan a partir de especificaciones en lugar de medirse, y cada uno se publica con un rango en lugar de como un solo número. La misma CARD y modelo varían entre un treinta y un cincuenta por ciento dependiendo del software de inferencia que uses y qué versión de este, lo cual ningún cálculo a partir de las hojas de especificaciones puede predecir. Trata el rango como la respuesta honesta.
Sé qué modelo quiero. ¿Puedo buscar al revés?
Sí. La sección de modelos de IA lista cada modelo en nuestra base de datos, y la página de cada modelo nombra las GPU que pueden ejecutarlo, comenzando por la más pequeña y rápida. Ese es el mismo cálculo abordado desde el extremo opuesto.
La otra dirección
¿Mirándolo desde el otro lado?
Esta página comienza desde el hardware. Si ya sabes qué modelo quieres ejecutar y necesitas saber lo que se necesita, comienza ahí en su lugar. — lista cada modelo en nuestro archivo, y cada uno nombra las tarjetas que pueden ejecutarlo.