Qwen3.5-27B Calculadora TPS

Abrir pesos Alibaba 27B Parámetros February 2026

Cada tarjeta a continuación se evalúa con respecto a este modelo en la longitud del contexto y la calidad mínima que usted elija. La velocidad es una estimación para una sola solicitud, calculada a partir del ancho de banda de memoria de la tarjeta y el tamaño del modelo una vez comprimido.

Calculado para este modelo

241 tarjetas que pueden ejecutarlo

818 tarjetas para las cuales tenemos especificaciones

La tarjeta más pequeña que cabe

Xeon Phi 7120P

16 GB · Q3_K_M · 9.7 tok/s

Tarjeta más rápida

B200

125 tok/s · 180 GB

¿Qué GPUs pueden ejecutar Qwen3.5-27B?

Configure las entradas, lea la respuesta

Una conversación más larga requiere más memoria, lo que puede hacer que este modelo quede fuera de las tarjetas más pequeñas.

Oculta las tarjetas que solo cabrían en el modelo comprimiéndolo por debajo de este punto.

241 tarjetas coinciden

Cálculo
Necesidades Cuantización Ajuste
125 tok/s

75–201 · confianza baja

B200 NVIDIA 180 GB 8,000 GB/s Jan 2024 29.6 GB Q8_0 Cómodo
125 tok/s

75–201 · confianza baja

B300 NVIDIA 288 GB 8,000 GB/s Sep 2025 29.6 GB Q8_0 Cómodo
100 tok/s

60–160 · confianza baja

Radeon Instinct MI350X AMD 288 GB 8,190 GB/s Jan 2025 29.6 GB Q8_0 Cómodo
100 tok/s

60–160 · confianza baja

Radeon Instinct MI355X AMD 288 GB 8,190 GB/s Jan 2025 29.6 GB Q8_0 Cómodo
80.1 tok/s

48–128 · confianza baja

Radeon Instinct MI300 AMD 128 GB 6,550 GB/s Jan 2023 29.6 GB Q8_0 Cómodo
76.7 tok/s

46–123 · confianza baja

H200 NVL NVIDIA 141 GB 4,890 GB/s Nov 2024 29.6 GB Q8_0 Cómodo
76.7 tok/s

46–123 · confianza baja

H200 SXM 141 GB NVIDIA 141 GB 4,890 GB/s Nov 2024 29.6 GB Q8_0 Cómodo
73.4 tok/s

44–117 · confianza baja

Radeon Instinct MI325X AMD 256 GB 6,000 GB/s Oct 2024 29.6 GB Q8_0 Cómodo
65.2 tok/s

39–104 · confianza baja

Radeon Instinct MI300A AMD 128 GB 5,325 GB/s Dec 2023 29.6 GB Q8_0 Cómodo
65.2 tok/s

39–104 · confianza baja

Radeon Instinct MI300X AMD 192 GB 5,325 GB/s Dec 2023 29.6 GB Q8_0 Cómodo
65.2 tok/s

39–104 · confianza baja

Radeon Instinct MI308X AMD 192 GB 5,325 GB/s Dec 2023 29.6 GB Q8_0 Cómodo
61.8 tok/s

37–99 · confianza baja

H100 NVL 94 GB NVIDIA 94 GB 3,940 GB/s Mar 2023 29.6 GB Q8_0 Cómodo
52.7 tok/s

32–84 · confianza baja

H100 PCIe 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 29.6 GB Q8_0 Cómodo
52.7 tok/s

32–84 · confianza baja

H100 SXM5 80 GB NVIDIA 80 GB 3,360 GB/s Oct 2022 29.6 GB Q8_0 Cómodo
52.7 tok/s

32–84 · confianza baja

H100 SXM5 94 GB NVIDIA 94 GB 3,360 GB/s Mar 2023 29.6 GB Q8_0 Cómodo
52.7 tok/s

32–84 · confianza baja

H100 SXM5 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 29.6 GB Q8_0 Cómodo
52.7 tok/s

32–84 · confianza baja

H800 SXM5 NVIDIA 80 GB 3,360 GB/s Mar 2023 29.6 GB Q8_0 Cómodo
47.8 tok/s

29–77 · confianza baja

Tesla V100 SXM2 16 GB NVIDIA 16 GB 1,130 GB/s Nov 2019 13.9 GB Q3_K_M Estricto
42.6 tok/s

26–68 · confianza baja

DRIVE A100 PROD NVIDIA 32 GB 1,870 GB/s May 2020 23.3 GB Q6_K Cómodo
42.6 tok/s

26–68 · confianza baja

GRID A100A NVIDIA 32 GB 1,870 GB/s May 2020 23.3 GB Q6_K Cómodo
40.8 tok/s

24–65 · confianza baja

GeForce RTX 5090 NVIDIA 32 GB 1,790 GB/s Jan 2025 23.3 GB Q6_K Cómodo
40.8 tok/s

24–65 · confianza baja

GeForce RTX 5090 D NVIDIA 32 GB 1,790 GB/s Jan 2025 23.3 GB Q6_K Cómodo
40.6 tok/s

24–65 · confianza baja

GeForce RTX 5080 NVIDIA 16 GB 960 GB/s Jan 2025 13.9 GB Q3_K_M Estricto
40.1 tok/s

24–64 · confianza baja

Radeon Instinct MI250 AMD 128 GB 3,280 GB/s Nov 2021 29.6 GB Q8_0 Cómodo
40.1 tok/s

24–64 · confianza baja

Radeon Instinct MI250X AMD 128 GB 3,280 GB/s Nov 2021 29.6 GB Q8_0 Cómodo

Las velocidades son estimaciones para una sola solicitud, una conversación a la vez, calculadas a partir del ancho de banda de memoria, el tamaño del modelo y la cuantificación. El rendimiento real varía según el tiempo de inferencia y su versión. Las cifras publicadas por los proveedores de hardware miden muchas solicitudes simultáneas y son mucho más altas.

En registro

Especificación completa

Todo lo registrado para este modelo. La mayoría de ello describe cómo fue entrenado en lugar de cómo se ejecuta — contexto útil para juzgar cuánto trabajo se dedicó a ello y cómo se compara con modelos construidos a una escala diferente.

Origen

¿Quién construyó este modelo, dónde y cuándo fue publicado?

Organización
Alibaba
Tipo de organización
Industry
País
China
Publicado
24 February 2026

Lo que hace

Las áreas problemáticas para las que se construyó el modelo. Un modelo puede llevar varios de cada uno.

Dominio
Language
Tarea
Language modeling/generation

Tamaño

Qué tan grande es el modelo y cuántos datos se utilizaron para entrenarlo. Los parámetros son la cifra que decide si se ajusta en una tarjeta gráfica dada.

Parámetros
27B
Datos de entrenamiento
tokens

Disponibilidad

Si puedes obtener el modelo y ejecutarlo en tu propio hardware, lo cual es lo que decide si alguna de las cifras de la tarjeta gráfica en esta página aplica.

Pesos
Open — downloadable
Acceso al modelo
Open weights (restricted use)
Hugging Face
Qwen

Cómo se clasifica

Etiquetas que aplica el conjunto de datos de origen al rastrear modelos notables y cuán seguro está de la entrada.

Registrar confianza
Confident

Fuentes

De dónde proviene este registro y cuándo fue revisado por última vez.

Referencia
Qwen3.5: Towards Native Multimodal Agents
Última actualización
19 June 2026

Los extremos

Qué significan los números

Requisitos de hardware en la práctica

Tarjeta mínima

Xeon Phi 7120P

Memoria necesaria

13.9 GB

Más rápido

125 tok/s

Con 27B parámetros, Qwen3.5-27B se encuentra en el rango que una tarjeta de escritorio seria puede manejar una vez que los pesos están comprimidos. 241 de las tarjetas que seguimos pueden ejecutarlo.

El punto de entrada es el Xeon Phi 7120P: 16 GB de memoria, compresión Q3_K_M, aproximadamente 9.7 tokens por segundo.

El resultado más rápido proviene de un B200 a alrededor de 125 tokens por segundo; sus 8,000 GB/s de ancho de banda es lo que lo permite.

Qué es este modelo

Qwen3.5-27B fue publicado por Alibaba, en China, en febrero de 2026. La industria es la categoría en la que se encuentra el publicador.

Funciona en Sprache, y se registra como haciendo modelado/generación de Sprache.

Los pesos están publicados, por lo que se pueden descargar y ejecutar en su propio hardware indefinidamente, sin conexión, sin cuenta asociada. Está publicado bajo la organización Qwen en Hugging Face.

¿Qué decide la velocidad?

La mitad de las tarjetas que lo sostienen gestionan más de 19.0 tokens por segundo, y 196 superan la velocidad de lectura sin lugar a dudas.

Cada peso participa en cada token aquí, así que el ancho de banda es toda la historia: el ranking a continuación es efectivamente un ranking de la capacidad de memoria.

Su arquitectura interna no está registrada, por lo que la memoria se aproxima a partir del conteo de parámetros y se marca en consecuencia. Espere que la cifra real difiera, más aún en contextos largos.

Paso a paso

Cómo elegir una GPU para Qwen3.5-27B

La tabla anterior ya ha evaluado cada tarjeta para la cual tenemos especificaciones contra este modelo. Para llegar a su respuesta, se requieren seis pasos.

  1. 01

    Lee primero la figura de memoria

    Mira lo que Qwen3.5-27B realmente necesita: alrededor de 13.9 GB en Q3_K_M. Ninguna cantidad de potencia de procesamiento compensa una tarjeta que no puede contenerlo.

  2. 02

    Ajusta el contexto a tu uso actual

    Las conversaciones más largas cuestan memoria además de lo que necesitan los pesos. Mueve el control deslizante a tu longitud de trabajo real antes de confiar en cualquier fila para Qwen3.5-27B.

  3. 03

    Establecer un umbral de calidad

    Cada tarjeta ejecuta la copia menos comprimida que puede contener — Q3_K_M en la tarjeta más pequeña que cabe. Configurar un umbral elimina las tarjetas que solo manejan Qwen3.5-27B al comprimirlo más de lo que desearías.

  4. 04

    Clasificar por rendimiento en lugar de especificaciones

    El ranking por tokens por segundo para Qwen3.5-27B sigue el ancho de banda de memoria, no el número de núcleos, que es la razón por la que el B200 lo supera con 125 tok/s.

  5. 05

    Mira el margen, no solo el ajuste

    Un ajuste apretado ejecuta Qwen3.5-27B pero no deja nada de sobra para una conversación más larga; cómodo tiene margen. Si esperas hacer crecer el contexto, compra para cómodo.

  6. 06

    Ve qué más puede ejecutar esa tarjeta.

    Seguir una tarjeta hasta su propia página muestra cada otro modelo que puede contener, que es la pregunta que sigue una vez que se resuelve Qwen3.5-27B.

Respuestas

Qwen3.5-27B — Preguntas frecuentes

01

¿Cuántos parámetros tiene Qwen3.5-27B?

Qwen3.5-27B tiene 27 mil millones de parámetros. Esa cifra es el total, y es lo que decide cuánta memoria necesita el modelo — aproximadamente medio gigabyte por cada mil millones en la compresión que la mayoría de las personas utiliza.

02

¿Quién creó Qwen3.5-27B?

Qwen3.5-27B fue publicado por Alibaba, con sede en China, categorizado como industria.

03

¿Cuándo se lanzó Qwen3.5-27B?

Qwen3.5-27B fue publicado en febrero de 2026.

04

¿Para qué se utiliza Qwen3.5-27B?

Qwen3.5-27B trabaja en Lenguaje y se registra como capaz de manejar modelado/generación de lenguaje. Un modelo puede manejar varios de cada uno, por lo que estas son las áreas para las que fue construido en lugar de ser un límite en lo que intentará.

05

¿Dónde puedo descargar Qwen3.5-27B?

Sus pesos están publicados bajo la organización Qwen en Hugging Face. No alojamos archivos de modelos; este sitio calcula qué hardware se necesita para ejecutarlos.

06

¿Puedo ejecutar Qwen3.5-27B si no cabe en mi GPU?

Solo al descargar, que suele ser una falsa economía: la parte en la memoria del sistema arrastra todo — la falta más cercana que calculamos es corta en 6.2 GB. Nuestras cifras para Qwen3.5-27B asumen que está completamente residente.

07

¿Correrían dos GPUS Qwen3.5-27B más rápido?

La capacidad se suma entre tarjetas; el rendimiento no. Dado que 241 de las tarjetas que rastreamos ya sostienen Qwen3.5-27B por sí solas, una segunda tarjeta rara vez es la respuesta aquí.

08

¿Por qué difiere la cuantización entre tarjetas para Qwen3.5-27B?

Debido a que la capacidad varía, también lo hace la dificultad con la que Qwen3.5-27B tiene que ser comprimido — aparecen 5 niveles distintos en la tabla anterior. Establezca una calidad mínima para comparar en uno.

09

¿Qué tan precisas son estas estimaciones de velocidad de Qwen3.5-27B?

Se calculan a partir de especificaciones en lugar de ser medidos, y cada uno tiene un rango: 75–201 tok/s en el B200, por ejemplo. El mismo modelo y tarjeta varían entre el treinta y el cincuenta por ciento dependiendo del software de inferencia y su versión.

10

¿Qué GPU necesito para ejecutar Qwen3.5-27B?

La tarjeta más pequeña en nuestro catálogo que soporta Qwen3.5-27B es la Xeon Phi 7120P, con 16 GB de memoria. Ejecuta el modelo en Q3_K_M usando aproximadamente 13.9 GB, y produce aproximadamente 9.7 tokens por segundo. 241 tarjetas en total pueden ejecutarlo.

11

¿Qué tan rápido es Qwen3.5-27B en una GPU?

Depende de la tarjeta. El más rápido que calculamos es un B200 a aproximadamente 125 tokens por segundo; el más lento que aún funciona logra considerablemente menos. La velocidad de lectura es de alrededor de diez tokens por segundo, y 196 de las tarjetas que pueden ejecutar Qwen3.5-27B superan eso.

12

¿Cuánta VRAM necesita Qwen3.5-27B?

Acerca de 13.9 GB con compresión Q3_K_M, que es lo que utiliza la tarjeta más pequeña que lo ejecuta. Menos compresión necesita más: las cifras en la columna de memoria anterior se recalculan para cada tarjeta, porque cada una sostiene la versión menos comprimida que puede.

13

¿Puedo ejecutar Qwen3.5-27B en una GPU de 16 GB?

Sí. Una Tesla V100 SXM2 de 16 GB con 16 GB lo ejecuta en Q3_K_M, usando aproximadamente 13.9 GB y generando aproximadamente 47.8 tokens por segundo — un ajuste justo.

14

¿Puedo ejecutar Qwen3.5-27B en una GPU de 24 GB?

Sí. Una GeForce RTX 5090 D V2 con 24 GB lo ejecuta en Q5_K_M, utilizando aproximadamente 20.2 GB y generando aproximadamente 37.5 tokens por segundo — un ajuste justo.

15

¿Es Qwen3.5-27B de código abierto?

Sus pesos están publicados, por lo que Qwen3.5-27B se puede descargar y ejecutar en su propio hardware. Tenga en cuenta que los pesos abiertos no son lo mismo que el código abierto en el sentido completo; no dice nada sobre los datos de entrenamiento, el código de entrenamiento o los términos comerciales adjuntos.

Fuente

Publicación original

Registro de la última actualización 19 June 2026

La otra dirección

¿Mirándolo desde el otro lado?

Esta página comienza desde el modelo. Si ya posee una tarjeta y desea saber todo lo que podrá ejecutar, empiece por el hardware en su lugar.