Qwen3.5-27B Calculadora TPS
Cada tarjeta a continuación se evalúa con respecto a este modelo en la longitud del contexto y la calidad mínima que usted elija. La velocidad es una estimación para una sola solicitud, calculada a partir del ancho de banda de memoria de la tarjeta y el tamaño del modelo una vez comprimido.
Calculado para este modelo
818 tarjetas para las cuales tenemos especificaciones
La tarjeta más pequeña que cabe
Xeon Phi 7120P
16 GB · Q3_K_M · 9.7 tok/s
Tarjeta más rápida
B200
125 tok/s · 180 GB
¿Qué GPUs pueden ejecutar Qwen3.5-27B?
Configure las entradas, lea la respuesta
Una conversación más larga requiere más memoria, lo que puede hacer que este modelo quede fuera de las tarjetas más pequeñas.
Oculta las tarjetas que solo cabrían en el modelo comprimiéndolo por debajo de este punto.
241 tarjetas coinciden
Cálculo| Necesidades | Cuantización | Ajuste | |||||
|---|---|---|---|---|---|---|---|
|
125
tok/s
75–201 · confianza baja |
B200 NVIDIA | 180 GB | 8,000 GB/s | Jan 2024 | 29.6 GB | Q8_0 | Cómodo |
|
125
tok/s
75–201 · confianza baja |
B300 NVIDIA | 288 GB | 8,000 GB/s | Sep 2025 | 29.6 GB | Q8_0 | Cómodo |
|
100
tok/s
60–160 · confianza baja |
Radeon Instinct MI350X AMD | 288 GB | 8,190 GB/s | Jan 2025 | 29.6 GB | Q8_0 | Cómodo |
|
100
tok/s
60–160 · confianza baja |
Radeon Instinct MI355X AMD | 288 GB | 8,190 GB/s | Jan 2025 | 29.6 GB | Q8_0 | Cómodo |
|
80.1
tok/s
48–128 · confianza baja |
Radeon Instinct MI300 AMD | 128 GB | 6,550 GB/s | Jan 2023 | 29.6 GB | Q8_0 | Cómodo |
|
76.7
tok/s
46–123 · confianza baja |
H200 NVL NVIDIA | 141 GB | 4,890 GB/s | Nov 2024 | 29.6 GB | Q8_0 | Cómodo |
|
76.7
tok/s
46–123 · confianza baja |
H200 SXM 141 GB NVIDIA | 141 GB | 4,890 GB/s | Nov 2024 | 29.6 GB | Q8_0 | Cómodo |
|
73.4
tok/s
44–117 · confianza baja |
Radeon Instinct MI325X AMD | 256 GB | 6,000 GB/s | Oct 2024 | 29.6 GB | Q8_0 | Cómodo |
|
65.2
tok/s
39–104 · confianza baja |
Radeon Instinct MI300A AMD | 128 GB | 5,325 GB/s | Dec 2023 | 29.6 GB | Q8_0 | Cómodo |
|
65.2
tok/s
39–104 · confianza baja |
Radeon Instinct MI300X AMD | 192 GB | 5,325 GB/s | Dec 2023 | 29.6 GB | Q8_0 | Cómodo |
|
65.2
tok/s
39–104 · confianza baja |
Radeon Instinct MI308X AMD | 192 GB | 5,325 GB/s | Dec 2023 | 29.6 GB | Q8_0 | Cómodo |
|
61.8
tok/s
37–99 · confianza baja |
H100 NVL 94 GB NVIDIA | 94 GB | 3,940 GB/s | Mar 2023 | 29.6 GB | Q8_0 | Cómodo |
|
52.7
tok/s
32–84 · confianza baja |
H100 PCIe 96 GB NVIDIA | 96 GB | 3,360 GB/s | Mar 2023 | 29.6 GB | Q8_0 | Cómodo |
|
52.7
tok/s
32–84 · confianza baja |
H100 SXM5 80 GB NVIDIA | 80 GB | 3,360 GB/s | Oct 2022 | 29.6 GB | Q8_0 | Cómodo |
|
52.7
tok/s
32–84 · confianza baja |
H100 SXM5 94 GB NVIDIA | 94 GB | 3,360 GB/s | Mar 2023 | 29.6 GB | Q8_0 | Cómodo |
|
52.7
tok/s
32–84 · confianza baja |
H100 SXM5 96 GB NVIDIA | 96 GB | 3,360 GB/s | Mar 2023 | 29.6 GB | Q8_0 | Cómodo |
|
52.7
tok/s
32–84 · confianza baja |
H800 SXM5 NVIDIA | 80 GB | 3,360 GB/s | Mar 2023 | 29.6 GB | Q8_0 | Cómodo |
|
47.8
tok/s
29–77 · confianza baja |
Tesla V100 SXM2 16 GB NVIDIA | 16 GB | 1,130 GB/s | Nov 2019 | 13.9 GB | Q3_K_M | Estricto |
|
42.6
tok/s
26–68 · confianza baja |
DRIVE A100 PROD NVIDIA | 32 GB | 1,870 GB/s | May 2020 | 23.3 GB | Q6_K | Cómodo |
|
42.6
tok/s
26–68 · confianza baja |
GRID A100A NVIDIA | 32 GB | 1,870 GB/s | May 2020 | 23.3 GB | Q6_K | Cómodo |
|
40.8
tok/s
24–65 · confianza baja |
GeForce RTX 5090 NVIDIA | 32 GB | 1,790 GB/s | Jan 2025 | 23.3 GB | Q6_K | Cómodo |
|
40.8
tok/s
24–65 · confianza baja |
GeForce RTX 5090 D NVIDIA | 32 GB | 1,790 GB/s | Jan 2025 | 23.3 GB | Q6_K | Cómodo |
|
40.6
tok/s
24–65 · confianza baja |
GeForce RTX 5080 NVIDIA | 16 GB | 960 GB/s | Jan 2025 | 13.9 GB | Q3_K_M | Estricto |
|
40.1
tok/s
24–64 · confianza baja |
Radeon Instinct MI250 AMD | 128 GB | 3,280 GB/s | Nov 2021 | 29.6 GB | Q8_0 | Cómodo |
|
40.1
tok/s
24–64 · confianza baja |
Radeon Instinct MI250X AMD | 128 GB | 3,280 GB/s | Nov 2021 | 29.6 GB | Q8_0 | Cómodo |
Las velocidades son estimaciones para una sola solicitud, una conversación a la vez, calculadas a partir del ancho de banda de memoria, el tamaño del modelo y la cuantificación. El rendimiento real varía según el tiempo de inferencia y su versión. Las cifras publicadas por los proveedores de hardware miden muchas solicitudes simultáneas y son mucho más altas.
En registro
Especificación completa
Todo lo registrado para este modelo. La mayoría de ello describe cómo fue entrenado en lugar de cómo se ejecuta — contexto útil para juzgar cuánto trabajo se dedicó a ello y cómo se compara con modelos construidos a una escala diferente.
Origen
¿Quién construyó este modelo, dónde y cuándo fue publicado?
- Organización
- Alibaba
- Tipo de organización
- Industry
- País
- China
- Publicado
- 24 February 2026
Lo que hace
Las áreas problemáticas para las que se construyó el modelo. Un modelo puede llevar varios de cada uno.
- Dominio
- Language
- Tarea
- Language modeling/generation
Tamaño
Qué tan grande es el modelo y cuántos datos se utilizaron para entrenarlo. Los parámetros son la cifra que decide si se ajusta en una tarjeta gráfica dada.
- Parámetros
- 27B
- Datos de entrenamiento
- tokens
Disponibilidad
Si puedes obtener el modelo y ejecutarlo en tu propio hardware, lo cual es lo que decide si alguna de las cifras de la tarjeta gráfica en esta página aplica.
- Pesos
- Open — downloadable
- Acceso al modelo
- Open weights (restricted use)
- Hugging Face
- Qwen
Cómo se clasifica
Etiquetas que aplica el conjunto de datos de origen al rastrear modelos notables y cuán seguro está de la entrada.
- Registrar confianza
- Confident
Fuentes
De dónde proviene este registro y cuándo fue revisado por última vez.
- Referencia
- Qwen3.5: Towards Native Multimodal Agents
- Última actualización
- 19 June 2026
Los extremos
Los diez GPU más rápidos que ejecutan Qwen3.5-27B
Clasificado por tokens estimados por segundo, la tarjeta más nueva primero donde las velocidades empatan. Debido a que la generación está limitada por el ancho de banda de memoria, este orden sigue el ancho de banda en lugar de cualquier referencia de juego..
- 01 B300 288 GB · 8,000 GB/s · Q8_0 125 tok/s
- 02 B200 180 GB · 8,000 GB/s · Q8_0 125 tok/s
- 03 Radeon Instinct MI350X 288 GB · 8,190 GB/s · Q8_0 100 tok/s
- 04 Radeon Instinct MI355X 288 GB · 8,190 GB/s · Q8_0 100 tok/s
- 05 Radeon Instinct MI300 128 GB · 6,550 GB/s · Q8_0 80.1 tok/s
- 06 H200 NVL 141 GB · 4,890 GB/s · Q8_0 76.7 tok/s
- 07 H200 SXM 141 GB 141 GB · 4,890 GB/s · Q8_0 76.7 tok/s
- 08 Radeon Instinct MI325X 256 GB · 6,000 GB/s · Q8_0 73.4 tok/s
- 09 Radeon Instinct MI300A 128 GB · 5,325 GB/s · Q8_0 65.2 tok/s
- 10 Radeon Instinct MI300X 192 GB · 5,325 GB/s · Q8_0 65.2 tok/s
Las GPUs más pequeñas que aún funcionan Qwen3.5-27B
La ruta más barata para entrar, por capacidad de memoria. Un ajuste apretado ejecuta el modelo pero no deja nada de sobra para una conversación más larga..
- 01 Ryzen AI Z2 Extreme GPU 16 GB · Necesidades 13.9 GB · Q3_K_M · Estricto 8.5 tok/s
- 02 Radeon RX 7700 16 GB · Necesidades 13.9 GB · Q3_K_M · Estricto 20.5 tok/s
- 03 Arc Pro B50 16 GB · Necesidades 13.9 GB · Q3_K_M · Estricto 6.2 tok/s
- 04 RTX PRO 2000 Blackwell 16 GB · Necesidades 13.9 GB · Q3_K_M · Estricto 12.2 tok/s
- 05 Ryzen Z2 Extreme GPU 16 GB · Necesidades 13.9 GB · Q3_K_M · Estricto 4.2 tok/s
- 06 Radeon RX 9060 XT 16 GB 16 GB · Necesidades 13.9 GB · Q3_K_M · Estricto 10.6 tok/s
- 07 GeForce RTX 5060 Ti 16 GB 16 GB · Necesidades 13.9 GB · Q3_K_M · Estricto 19.0 tok/s
- 08 GeForce RTX 5080 Mobile 16 GB · Necesidades 13.9 GB · Q3_K_M · Estricto 37.9 tok/s
- 09 Radeon RX 9070 16 GB · Necesidades 13.9 GB · Q3_K_M · Estricto 21.3 tok/s
- 10 Radeon RX 9070 XT 16 GB · Necesidades 13.9 GB · Q3_K_M · Estricto 21.3 tok/s
Qué significan los números
Requisitos de hardware en la práctica
Tarjeta mínima
Xeon Phi 7120P
Memoria necesaria
13.9 GB
Más rápido
125 tok/s
Con 27B parámetros, Qwen3.5-27B se encuentra en el rango que una tarjeta de escritorio seria puede manejar una vez que los pesos están comprimidos. 241 de las tarjetas que seguimos pueden ejecutarlo.
El punto de entrada es el Xeon Phi 7120P: 16 GB de memoria, compresión Q3_K_M, aproximadamente 9.7 tokens por segundo.
El resultado más rápido proviene de un B200 a alrededor de 125 tokens por segundo; sus 8,000 GB/s de ancho de banda es lo que lo permite.
Qué es este modelo
Qwen3.5-27B fue publicado por Alibaba, en China, en febrero de 2026. La industria es la categoría en la que se encuentra el publicador.
Funciona en Sprache, y se registra como haciendo modelado/generación de Sprache.
Los pesos están publicados, por lo que se pueden descargar y ejecutar en su propio hardware indefinidamente, sin conexión, sin cuenta asociada. Está publicado bajo la organización Qwen en Hugging Face.
¿Qué decide la velocidad?
La mitad de las tarjetas que lo sostienen gestionan más de 19.0 tokens por segundo, y 196 superan la velocidad de lectura sin lugar a dudas.
Cada peso participa en cada token aquí, así que el ancho de banda es toda la historia: el ranking a continuación es efectivamente un ranking de la capacidad de memoria.
Su arquitectura interna no está registrada, por lo que la memoria se aproxima a partir del conteo de parámetros y se marca en consecuencia. Espere que la cifra real difiera, más aún en contextos largos.
Paso a paso
Cómo elegir una GPU para Qwen3.5-27B
La tabla anterior ya ha evaluado cada tarjeta para la cual tenemos especificaciones contra este modelo. Para llegar a su respuesta, se requieren seis pasos.
-
01
Lee primero la figura de memoria
Mira lo que Qwen3.5-27B realmente necesita: alrededor de 13.9 GB en Q3_K_M. Ninguna cantidad de potencia de procesamiento compensa una tarjeta que no puede contenerlo.
-
02
Ajusta el contexto a tu uso actual
Las conversaciones más largas cuestan memoria además de lo que necesitan los pesos. Mueve el control deslizante a tu longitud de trabajo real antes de confiar en cualquier fila para Qwen3.5-27B.
-
03
Establecer un umbral de calidad
Cada tarjeta ejecuta la copia menos comprimida que puede contener — Q3_K_M en la tarjeta más pequeña que cabe. Configurar un umbral elimina las tarjetas que solo manejan Qwen3.5-27B al comprimirlo más de lo que desearías.
-
04
Clasificar por rendimiento en lugar de especificaciones
El ranking por tokens por segundo para Qwen3.5-27B sigue el ancho de banda de memoria, no el número de núcleos, que es la razón por la que el B200 lo supera con 125 tok/s.
-
05
Mira el margen, no solo el ajuste
Un ajuste apretado ejecuta Qwen3.5-27B pero no deja nada de sobra para una conversación más larga; cómodo tiene margen. Si esperas hacer crecer el contexto, compra para cómodo.
-
06
Ve qué más puede ejecutar esa tarjeta.
Seguir una tarjeta hasta su propia página muestra cada otro modelo que puede contener, que es la pregunta que sigue una vez que se resuelve Qwen3.5-27B.
Respuestas
Qwen3.5-27B — Preguntas frecuentes
¿Cuántos parámetros tiene Qwen3.5-27B?
Qwen3.5-27B tiene 27 mil millones de parámetros. Esa cifra es el total, y es lo que decide cuánta memoria necesita el modelo — aproximadamente medio gigabyte por cada mil millones en la compresión que la mayoría de las personas utiliza.
¿Quién creó Qwen3.5-27B?
Qwen3.5-27B fue publicado por Alibaba, con sede en China, categorizado como industria.
¿Cuándo se lanzó Qwen3.5-27B?
Qwen3.5-27B fue publicado en febrero de 2026.
¿Para qué se utiliza Qwen3.5-27B?
Qwen3.5-27B trabaja en Lenguaje y se registra como capaz de manejar modelado/generación de lenguaje. Un modelo puede manejar varios de cada uno, por lo que estas son las áreas para las que fue construido en lugar de ser un límite en lo que intentará.
¿Dónde puedo descargar Qwen3.5-27B?
Sus pesos están publicados bajo la organización Qwen en Hugging Face. No alojamos archivos de modelos; este sitio calcula qué hardware se necesita para ejecutarlos.
¿Puedo ejecutar Qwen3.5-27B si no cabe en mi GPU?
Solo al descargar, que suele ser una falsa economía: la parte en la memoria del sistema arrastra todo — la falta más cercana que calculamos es corta en 6.2 GB. Nuestras cifras para Qwen3.5-27B asumen que está completamente residente.
¿Correrían dos GPUS Qwen3.5-27B más rápido?
La capacidad se suma entre tarjetas; el rendimiento no. Dado que 241 de las tarjetas que rastreamos ya sostienen Qwen3.5-27B por sí solas, una segunda tarjeta rara vez es la respuesta aquí.
¿Por qué difiere la cuantización entre tarjetas para Qwen3.5-27B?
Debido a que la capacidad varía, también lo hace la dificultad con la que Qwen3.5-27B tiene que ser comprimido — aparecen 5 niveles distintos en la tabla anterior. Establezca una calidad mínima para comparar en uno.
¿Qué tan precisas son estas estimaciones de velocidad de Qwen3.5-27B?
Se calculan a partir de especificaciones en lugar de ser medidos, y cada uno tiene un rango: 75–201 tok/s en el B200, por ejemplo. El mismo modelo y tarjeta varían entre el treinta y el cincuenta por ciento dependiendo del software de inferencia y su versión.
¿Qué GPU necesito para ejecutar Qwen3.5-27B?
La tarjeta más pequeña en nuestro catálogo que soporta Qwen3.5-27B es la Xeon Phi 7120P, con 16 GB de memoria. Ejecuta el modelo en Q3_K_M usando aproximadamente 13.9 GB, y produce aproximadamente 9.7 tokens por segundo. 241 tarjetas en total pueden ejecutarlo.
¿Qué tan rápido es Qwen3.5-27B en una GPU?
Depende de la tarjeta. El más rápido que calculamos es un B200 a aproximadamente 125 tokens por segundo; el más lento que aún funciona logra considerablemente menos. La velocidad de lectura es de alrededor de diez tokens por segundo, y 196 de las tarjetas que pueden ejecutar Qwen3.5-27B superan eso.
¿Cuánta VRAM necesita Qwen3.5-27B?
Acerca de 13.9 GB con compresión Q3_K_M, que es lo que utiliza la tarjeta más pequeña que lo ejecuta. Menos compresión necesita más: las cifras en la columna de memoria anterior se recalculan para cada tarjeta, porque cada una sostiene la versión menos comprimida que puede.
¿Puedo ejecutar Qwen3.5-27B en una GPU de 16 GB?
Sí. Una Tesla V100 SXM2 de 16 GB con 16 GB lo ejecuta en Q3_K_M, usando aproximadamente 13.9 GB y generando aproximadamente 47.8 tokens por segundo — un ajuste justo.
¿Puedo ejecutar Qwen3.5-27B en una GPU de 24 GB?
Sí. Una GeForce RTX 5090 D V2 con 24 GB lo ejecuta en Q5_K_M, utilizando aproximadamente 20.2 GB y generando aproximadamente 37.5 tokens por segundo — un ajuste justo.
¿Es Qwen3.5-27B de código abierto?
Sus pesos están publicados, por lo que Qwen3.5-27B se puede descargar y ejecutar en su propio hardware. Tenga en cuenta que los pesos abiertos no son lo mismo que el código abierto en el sentido completo; no dice nada sobre los datos de entrenamiento, el código de entrenamiento o los términos comerciales adjuntos.
La otra dirección
¿Mirándolo desde el otro lado?
Esta página comienza desde el modelo. Si ya posee una tarjeta y desea saber todo lo que podrá ejecutar, empiece por el hardware en su lugar.