Qwen3-14B Calculateur TPS

Poids ouverts Alibaba 14.8B Paramètres April 2025

Chaque carte ci-dessous est évaluée avec ce modèle à la longueur de contexte et à la qualité minimale que vous choisissez. La vitesse est une estimation pour une seule demande, calculée à partir de la bande passante mémoire de la carte et de la taille du modèle une fois compressé..

Calculé pour ce modèle

306 cartes pouvant l'exécuter

818 cartes pour lesquelles nous détenons des spécifications

La plus petite carte qui s'adapte

P102-101

10 GB · Q3_K_M · 21.0 tok/s

Carte la plus rapide

B200

229 tok/s · 180 GB

Quels GPU peuvent exécuter Qwen3-14B?

Définissez les entrées, lisez la réponse

Une conversation plus longue nécessite plus de mémoire, ce qui peut faire dévier ce modèle des cartes de taille inférieure.

Cache les cartes qui ne rentreraient que dans le modèle en le comprimant en dessous de ce point.

306 cartes compatibles

Calcul en cours
Besoins Quantification Adapté
229 tok/s

195–275

B200 NVIDIA 180 GB 8,000 GB/s Jan 2024 16.9 GB Q8_0 Confortable
229 tok/s

195–275

B300 NVIDIA 288 GB 8,000 GB/s Sep 2025 16.9 GB Q8_0 Confortable
183 tok/s

110–293 · faible confiance

Radeon Instinct MI350X AMD 288 GB 8,190 GB/s Jan 2025 16.9 GB Q8_0 Confortable
183 tok/s

110–293 · faible confiance

Radeon Instinct MI355X AMD 288 GB 8,190 GB/s Jan 2025 16.9 GB Q8_0 Confortable
146 tok/s

88–234 · faible confiance

Radeon Instinct MI300 AMD 128 GB 6,550 GB/s Jan 2023 16.9 GB Q8_0 Confortable
140 tok/s

119–168

H200 NVL NVIDIA 141 GB 4,890 GB/s Nov 2024 16.9 GB Q8_0 Confortable
140 tok/s

119–168

H200 SXM 141 GB NVIDIA 141 GB 4,890 GB/s Nov 2024 16.9 GB Q8_0 Confortable
134 tok/s

80–214 · faible confiance

Radeon Instinct MI325X AMD 256 GB 6,000 GB/s Oct 2024 16.9 GB Q8_0 Confortable
120 tok/s

102–145

CMP 170HX 10 GB NVIDIA 10 GB 1,560 GB/s Sep 2021 8.3 GB Q3_K_M serré
119 tok/s

71–190 · faible confiance

Radeon Instinct MI300A AMD 128 GB 5,325 GB/s Dec 2023 16.9 GB Q8_0 Confortable
119 tok/s

71–190 · faible confiance

Radeon Instinct MI300X AMD 192 GB 5,325 GB/s Dec 2023 16.9 GB Q8_0 Confortable
119 tok/s

71–190 · faible confiance

Radeon Instinct MI308X AMD 192 GB 5,325 GB/s Dec 2023 16.9 GB Q8_0 Confortable
113 tok/s

96–135

H100 NVL 94 GB NVIDIA 94 GB 3,940 GB/s Mar 2023 16.9 GB Q8_0 Confortable
96.2 tok/s

82–115

H100 PCIe 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 16.9 GB Q8_0 Confortable
96.2 tok/s

82–115

H100 SXM5 80 GB NVIDIA 80 GB 3,360 GB/s Oct 2022 16.9 GB Q8_0 Confortable
96.2 tok/s

82–115

H100 SXM5 94 GB NVIDIA 94 GB 3,360 GB/s Mar 2023 16.9 GB Q8_0 Confortable
96.2 tok/s

82–115

H100 SXM5 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 16.9 GB Q8_0 Confortable
96.2 tok/s

82–115

H800 SXM5 NVIDIA 80 GB 3,360 GB/s Mar 2023 16.9 GB Q8_0 Confortable
73.2 tok/s

44–117 · faible confiance

Radeon Instinct MI250 AMD 128 GB 3,280 GB/s Nov 2021 16.9 GB Q8_0 Confortable
73.2 tok/s

44–117 · faible confiance

Radeon Instinct MI250X AMD 128 GB 3,280 GB/s Nov 2021 16.9 GB Q8_0 Confortable
61.0 tok/s

37–98 · faible confiance

Data Center GPU Max 1550 Intel 128 GB 3,280 GB/s Jan 2023 16.9 GB Q8_0 Confortable
60.3 tok/s

51–72

GeForce RTX 3080 12 GB NVIDIA 12 GB 912 GB/s Jan 2022 10.0 GB Q4_K_M serré
60.3 tok/s

51–72

GeForce RTX 3080 Ti NVIDIA 12 GB 912 GB/s May 2021 10.0 GB Q4_K_M serré
59.7 tok/s

36–96 · faible confiance

Data Center GPU Max Subsystem Intel 128 GB 3,210 GB/s Jan 2023 16.9 GB Q8_0 Confortable
58.7 tok/s

50–70

CMP 90HX NVIDIA 10 GB 760 GB/s Jul 2021 8.3 GB Q3_K_M serré

Les vitesses sont des estimations pour une seule requête — une conversation à la fois — calculées à partir de la bande passante mémoire, de la taille du modèle et de la quantification. Le débit réel varie en fonction du temps d'inférence et de sa version. Les chiffres publiés par les fabricants de matériel mesurent de nombreuses requêtes simultanées et sont bien plus élevés.

Enregistrement terminé

Spécification complète

Tout ce qui concerne ce modèle. La plupart décrit comment il a été entraîné plutôt que comment il fonctionne — contexte utile pour évaluer le travail fourni et sa comparaison avec des modèles construits à une échelle différente.

Origine

Qui a construit ce modèle, où et quand il a été publié.

Organisation
Alibaba
Type d'organisation
Industry
Pays
China
Publié
29 April 2025

Ce qu'il fait

Les domaines problématiques pour lesquels le modèle a été conçu. Un modèle peut en porter plusieurs de chacun.

Domaine
Language
Tâche
Language modeling/generation, Question answering, Mathematical reasoning, Quantitative reasoning, Code generation, Translation

Taille

Quelle est la taille du modèle et combien de données il a été formé. Les paramètres sont le chiffre qui détermine s'il tient sur une carte graphique donnée.

Paramètres
14.8B

Number of Parameters: 14.8B Number of Paramaters (Non-Embedding): 13.2B Number of Layers: 40 Number of Attention Heads (GQA): 40 for Q and 8 for KV Context Length: 32,768 natively and 131,072 tokens with YaRN.

Données d'entraînement
tokens

36T

Époques
1

Calcul de formation

L'arithmétique effectuée pour entraîner le modèle, mesurée en opérations à virgule flottante. C'est une mesure du coût de l'exécution de l'entraînement, et non de la rapidité avec laquelle le modèle fini vous répond.

Calcul de formation
3.2 × 10²⁴ FLOP

6 FLOP / parameter / token * 36 * 10^12 tokens * 14.8 * 10^9 parameters = 3.1968e+24 FLOP

Comment cela a été établi
Operation counting

Disponibilité

Que vous puissiez obtenir le modèle et l'exécuter sur votre propre matériel, ce qui décide si l'une des chiffres de carte graphique sur cette page s'applique.

Poids
Open — downloadable
Accès au modèle
Open weights (unrestricted)
Code d'entraînement
Unreleased

Apache 2.0 https://huggingface.co/Qwen/Qwen3-14B-Base

Hugging Face
Qwen

Comment il est classé

Étiquettes que le jeu de données source applique lors du suivi des modèles notables, et à quel point il est confiant dans l'entrée.

Probablement au-dessus de 10²³ FLOP
Yes
Confiance d'enregistrement
Confident

Sources

D'où provient cet enregistrement et quand a-t-il été vérifié pour la dernière fois.

Référence
Qwen3: Think Deeper, Act Faster
Dernière mise à jour
28 November 2025

Les extrêmes

Ce que signifient les chiffres

Ce dont vous avez besoin pour le faire fonctionner

Carte minimale

P102-101

Mémoire requise

8.3 GB

Le plus rapide

229 tok/s

Qwen3-14B est suffisamment petit avec 14,8 milliards de paramètres pour que le matériel soit rarement l'obstacle — 306 des cartes que nous suivons peuvent le faire fonctionner, y compris des cartes de plusieurs années.

Le matériel minimum qui fonctionne est un P102-101. Ses 10 Go suffisent avec une compression Q3_K_M, fournissant environ 21,0 jetons par seconde.

Le haut de gamme est le B200, à environ 229 jetons par seconde grâce à 8 000 Go/s de bande passante.

À propos de ce modèle

Qwen3-14B a été publié par Alibaba, en Chine, en avril 2025. Il provient de l'industrie.

Cela fonctionne dans la Sprache et est enregistré comme effectuant la modélisation/génération de langue, la réponse à des questions, le raisonnement mathématique, le raisonnement quantitatif, la génération de code, la traduction.

Les poids sont publiés, donc ils peuvent être téléchargés et exécutés sur votre propre matériel indéfiniment, hors ligne, sans compte associé. Ils sont publiés sous l'organisation Qwen sur Hugging Face.

À quelle vitesse il fonctionne, et pourquoi

À travers chaque carte qui peut le faire, le milieu de la gamme est d'environ 21,4 tokens par seconde, et 266 d'entre elles dépassent les dix tokens par seconde, ce qui correspond à peu près à la vitesse de lecture.

Étant dense, il lit tout de lui-même par jeton, c'est pourquoi l'ordre par vitesse ci-dessous suit si étroitement l'ordre par bande passante mémoire.

Parce que l'architecture est enregistrée, la colonne de mémoire est dérivée plutôt qu'estimée.

Entraînement et provenance

L'entraînement a pris environ 3.2 × 10²⁴ FLOP de calcul — une mesure du coût de production du modèle, pas de sa rapidité de réponse.

Étape par étape

Comment choisir un GPU pour Qwen3-14B

Le tableau ci-dessus a déjà évalué chaque carte dont nous détenons les spécifications pour ce modèle. Obtenir votre réponse nécessite six étapes..

  1. 01

    Vérifiez ce dont cela a besoin avant toute autre chose.

    Regardez ce dont Qwen3-14B a réellement besoin — environ 8,3 Go à Q3_K_M. Aucune puissance de traitement ne compense une carte qui ne peut pas le contenir.

  2. 02

    Ajustez le contexte à votre utilisation réelle

    Définissez le contexte en fonction de ce que vous allez réellement utiliser. Le cache augmente avec la conversation, et c'est la raison habituelle pour laquelle Qwen3-14B cesse de s'adapter à une carte qui semblait correcte.

  3. 03

    Choisissez jusqu'où vous allez le compresser

    La colonne de quantification varie selon la carte, car une carte plus grande contient une copie plus précise de Qwen3-14B — Q3_K_M sur la plus petite carte qui convient. Établir un plancher pour maintenir la comparaison à un niveau.

  4. 04

    Classez par débit plutôt que par fiche technique

    Le classement par tokens par seconde pour Qwen3-14B suit la bande passante de mémoire, et non le nombre de cœurs, c'est pourquoi le B200 se classe en tête à 229 tok/s.

  5. 05

    Lisez la colonne ajustement en dernier

    Tight signifie que Qwen3-14B se charge et fonctionne, sans possibilité d'augmenter le contexte plus tard. Comfortable signifie que vous pouvez. La différence compte plus que quelques tokens par seconde.

  6. 06

    Vérifiez la carte de l'autre côté

    Suivre une carte jusqu'à sa propre page montre chaque autre modèle qu'elle peut contenir, ce qui est la question qui suit une fois que Qwen3-14B est réglé.

Réponses

Qwen3-14B — Questions fréquentes

01

Quelle est la rapidité de Qwen3-14B sur un GPU ?

Cela dépend de la carte. La plus rapide que nous calculons est une B200 à environ 229 jetons par seconde; la plus lente qui fonctionne encore gère considérablement moins. La vitesse de lecture est d'environ dix jetons par seconde, et 266 des cartes qui peuvent exécuter Qwen3-14B dépassent cela.

02

Combien de VRAM Qwen3-14B nécessite-t-il ?

Environ 8,3 Go à compression Q3_K_M, qui est ce que la plus petite carte qui le fait utilise. Moins de compression nécessite plus : les chiffres dans la colonne mémoire ci-dessus sont recalculés pour chaque carte, car chacune conserve la version la moins compressée qu'elle peut.

03

Puis-je exécuter Qwen3-14B sur un GPU de 12 Go ?

Oui. Une GeForce RTX 3080 Ti avec 12 Go le fait tourner à Q4_K_M, utilisant environ 10,0 Go et générant environ 60,3 jetons par seconde — un ajustement serré.

04

Puis-je exécuter Qwen3-14B sur un GPU de 16 Go ?

Oui. Un Tesla V100 SXM2 16 Go avec 16 Go le fait fonctionner à Q6_K, utilisant environ 13,4 Go et générant environ 47,0 jetons par seconde — un ajustement serré.

05

Puis-je exécuter Qwen3-14B sur un GPU de 24 Go ?

Oui. Une GeForce RTX 5090 D V2 avec 24 Go le fait fonctionner à Q8_0, utilisant environ 16,9 Go et générant environ 38,4 jetons par seconde — un ajustement confortable.

06

Qwen3-14B est-il open source ?

Ses poids sont publiés, donc Qwen3-14B peut être téléchargé et exécuté sur votre propre matériel. Notez que les poids ouverts ne sont pas la même chose que le code source ouvert au sens complet - cela ne dit rien sur les données d'entraînement, le code d'entraînement, ou les conditions commerciales attachées.

07

Combien de paramètres Qwen3-14B a-t-il ?

Qwen3-14B a 14,8 milliards de paramètres. Nombre de paramètres : 14,8 milliards Nombre de paramètres (non-embedding) : 13,2 milliards Nombre de couches : 40 Nombre de têtes d'attention (GQA) : 40 pour Q et 8 pour KV Longueur de contexte : 32 768 de manière native et 131 072 tokens avec YaRN. Ce chiffre est le total, et c'est ce qui décide combien de mémoire le modèle nécessite - environ un demi-gigaoctet par milliard à la compression que la plupart des gens utilisent.

08

Qui a créé Qwen3-14B ?

Qwen3-14B a été publié par Alibaba, basé en Chine, catégorisé comme industrie.

09

Quand Qwen3-14B a-t-il été publié ?

Qwen3-14B a été publié en avril 2025.

10

À quoi sert Qwen3-14B ?

Qwen3-14B fonctionne en LANGUE et est enregistré comme capable de gérer la modélisation/génération de LANGUE, la réponse à des questions, le raisonnement mathématique, le raisonnement quantitatif, la génération de code, la traduction. Un modèle peut gérer plusieurs de chaque, donc ce sont les domaines pour lesquels il a été construit plutôt qu'une limite sur ce qu'il tentera.

11

Où puis-je télécharger Qwen3-14B ?

Ses poids sont publiés sous l'organisation Qwen sur Hugging Face. Nous n'hébergeons pas de fichiers de modèle — ce site calcule le matériel nécessaire pour les exécuter.

12

Combien de calculs ont été utilisés pour entraîner Qwen3-14B ?

Environ 3,2 × 10²⁴ FLOP. Cela mesure le coût de production du modèle et ne dit rien sur la rapidité avec laquelle il répond une fois entraîné — la vitesse d'inférence dépend de la bande passante mémoire, pas du budget de formation.

13

Puis-je exécuter Qwen3-14B s'il ne tient pas dans ma GPU ?

Il peut être réparti entre la mémoire de la carte et la mémoire système, mais Qwen3-14B génère douloureusement lentement de cette façon — la plus proche défaillance que nous calculons est inférieure de 2,8 Go. Rien sur cette page n'assume le déchargement.

14

Deux GPU feraient-ils fonctionner Qwen3-14B plus rapidement ?

Une seconde carte double à peu près la mémoire disponible mais pas le taux de génération. Avec 306 cartes déjà capables de faire fonctionner Qwen3-14B seules, l'argument en faveur de l'association est faible.

15

Pourquoi la quantification diffère-t-elle entre les cartes pour Qwen3-14B ?

Chaque carte est montrée utilisant la copie la moins compressée qu'elle peut contenir, et Qwen3-14B apparaît à 5 niveaux de compression différents sur les cartes qui l'acceptent. Les cartes plus grandes obtiennent la version la plus précise.

16

Quelle est la précision de ces estimations de vitesse Qwen3-14B ?

Ils sont calculés à partir de spécifications plutôt que mesurés, et chacun a une plage — 195–275 tok/s sur le B200, par exemple. Le même modèle et la même carte varient de trente à cinquante pour cent selon le logiciel d'inférence et sa version.

17

Quelle GPU ai-je besoin pour exécuter Qwen3-14B ?

La plus petite carte de notre catalogue qui supporte Qwen3-14B est la P102-101, avec 10 Go de mémoire. Elle exécute le modèle à Q3_K_M en utilisant environ 8,3 Go, et produit environ 21,0 jetons par seconde. 306 cartes au total peuvent l'exécuter.

Source

Publication originale

Dernière mise à jour de l'enregistrement 28 November 2025

Dans l'autre sens

Regardez-la de l'autre côté ?

Cette page commence par le modèle. Si vous possédez déjà une carte et souhaitez connaître tout ce qu'elle pourra exécuter, commencez plutôt par le matériel.