Qwen3-14B Calculateur TPS
Chaque carte ci-dessous est évaluée avec ce modèle à la longueur de contexte et à la qualité minimale que vous choisissez. La vitesse est une estimation pour une seule demande, calculée à partir de la bande passante mémoire de la carte et de la taille du modèle une fois compressé..
Calculé pour ce modèle
818 cartes pour lesquelles nous détenons des spécifications
La plus petite carte qui s'adapte
P102-101
10 GB · Q3_K_M · 21.0 tok/s
Carte la plus rapide
B200
229 tok/s · 180 GB
Quels GPU peuvent exécuter Qwen3-14B?
Définissez les entrées, lisez la réponse
Une conversation plus longue nécessite plus de mémoire, ce qui peut faire dévier ce modèle des cartes de taille inférieure.
Cache les cartes qui ne rentreraient que dans le modèle en le comprimant en dessous de ce point.
306 cartes compatibles
Calcul en cours| Besoins | Quantification | Adapté | |||||
|---|---|---|---|---|---|---|---|
|
229
tok/s
195–275 |
B200 NVIDIA | 180 GB | 8,000 GB/s | Jan 2024 | 16.9 GB | Q8_0 | Confortable |
|
229
tok/s
195–275 |
B300 NVIDIA | 288 GB | 8,000 GB/s | Sep 2025 | 16.9 GB | Q8_0 | Confortable |
|
183
tok/s
110–293 · faible confiance |
Radeon Instinct MI350X AMD | 288 GB | 8,190 GB/s | Jan 2025 | 16.9 GB | Q8_0 | Confortable |
|
183
tok/s
110–293 · faible confiance |
Radeon Instinct MI355X AMD | 288 GB | 8,190 GB/s | Jan 2025 | 16.9 GB | Q8_0 | Confortable |
|
146
tok/s
88–234 · faible confiance |
Radeon Instinct MI300 AMD | 128 GB | 6,550 GB/s | Jan 2023 | 16.9 GB | Q8_0 | Confortable |
|
140
tok/s
119–168 |
H200 NVL NVIDIA | 141 GB | 4,890 GB/s | Nov 2024 | 16.9 GB | Q8_0 | Confortable |
|
140
tok/s
119–168 |
H200 SXM 141 GB NVIDIA | 141 GB | 4,890 GB/s | Nov 2024 | 16.9 GB | Q8_0 | Confortable |
|
134
tok/s
80–214 · faible confiance |
Radeon Instinct MI325X AMD | 256 GB | 6,000 GB/s | Oct 2024 | 16.9 GB | Q8_0 | Confortable |
|
120
tok/s
102–145 |
CMP 170HX 10 GB NVIDIA | 10 GB | 1,560 GB/s | Sep 2021 | 8.3 GB | Q3_K_M | serré |
|
119
tok/s
71–190 · faible confiance |
Radeon Instinct MI300A AMD | 128 GB | 5,325 GB/s | Dec 2023 | 16.9 GB | Q8_0 | Confortable |
|
119
tok/s
71–190 · faible confiance |
Radeon Instinct MI300X AMD | 192 GB | 5,325 GB/s | Dec 2023 | 16.9 GB | Q8_0 | Confortable |
|
119
tok/s
71–190 · faible confiance |
Radeon Instinct MI308X AMD | 192 GB | 5,325 GB/s | Dec 2023 | 16.9 GB | Q8_0 | Confortable |
|
113
tok/s
96–135 |
H100 NVL 94 GB NVIDIA | 94 GB | 3,940 GB/s | Mar 2023 | 16.9 GB | Q8_0 | Confortable |
|
96.2
tok/s
82–115 |
H100 PCIe 96 GB NVIDIA | 96 GB | 3,360 GB/s | Mar 2023 | 16.9 GB | Q8_0 | Confortable |
|
96.2
tok/s
82–115 |
H100 SXM5 80 GB NVIDIA | 80 GB | 3,360 GB/s | Oct 2022 | 16.9 GB | Q8_0 | Confortable |
|
96.2
tok/s
82–115 |
H100 SXM5 94 GB NVIDIA | 94 GB | 3,360 GB/s | Mar 2023 | 16.9 GB | Q8_0 | Confortable |
|
96.2
tok/s
82–115 |
H100 SXM5 96 GB NVIDIA | 96 GB | 3,360 GB/s | Mar 2023 | 16.9 GB | Q8_0 | Confortable |
|
96.2
tok/s
82–115 |
H800 SXM5 NVIDIA | 80 GB | 3,360 GB/s | Mar 2023 | 16.9 GB | Q8_0 | Confortable |
|
73.2
tok/s
44–117 · faible confiance |
Radeon Instinct MI250 AMD | 128 GB | 3,280 GB/s | Nov 2021 | 16.9 GB | Q8_0 | Confortable |
|
73.2
tok/s
44–117 · faible confiance |
Radeon Instinct MI250X AMD | 128 GB | 3,280 GB/s | Nov 2021 | 16.9 GB | Q8_0 | Confortable |
|
61.0
tok/s
37–98 · faible confiance |
Data Center GPU Max 1550 Intel | 128 GB | 3,280 GB/s | Jan 2023 | 16.9 GB | Q8_0 | Confortable |
|
60.3
tok/s
51–72 |
GeForce RTX 3080 12 GB NVIDIA | 12 GB | 912 GB/s | Jan 2022 | 10.0 GB | Q4_K_M | serré |
|
60.3
tok/s
51–72 |
GeForce RTX 3080 Ti NVIDIA | 12 GB | 912 GB/s | May 2021 | 10.0 GB | Q4_K_M | serré |
|
59.7
tok/s
36–96 · faible confiance |
Data Center GPU Max Subsystem Intel | 128 GB | 3,210 GB/s | Jan 2023 | 16.9 GB | Q8_0 | Confortable |
|
58.7
tok/s
50–70 |
CMP 90HX NVIDIA | 10 GB | 760 GB/s | Jul 2021 | 8.3 GB | Q3_K_M | serré |
Les vitesses sont des estimations pour une seule requête — une conversation à la fois — calculées à partir de la bande passante mémoire, de la taille du modèle et de la quantification. Le débit réel varie en fonction du temps d'inférence et de sa version. Les chiffres publiés par les fabricants de matériel mesurent de nombreuses requêtes simultanées et sont bien plus élevés.
Enregistrement terminé
Spécification complète
Tout ce qui concerne ce modèle. La plupart décrit comment il a été entraîné plutôt que comment il fonctionne — contexte utile pour évaluer le travail fourni et sa comparaison avec des modèles construits à une échelle différente.
Origine
Qui a construit ce modèle, où et quand il a été publié.
- Organisation
- Alibaba
- Type d'organisation
- Industry
- Pays
- China
- Publié
- 29 April 2025
Ce qu'il fait
Les domaines problématiques pour lesquels le modèle a été conçu. Un modèle peut en porter plusieurs de chacun.
- Domaine
- Language
- Tâche
- Language modeling/generation, Question answering, Mathematical reasoning, Quantitative reasoning, Code generation, Translation
Taille
Quelle est la taille du modèle et combien de données il a été formé. Les paramètres sont le chiffre qui détermine s'il tient sur une carte graphique donnée.
- Paramètres
- 14.8B
- Données d'entraînement
- tokens
- Époques
- 1
Number of Parameters: 14.8B Number of Paramaters (Non-Embedding): 13.2B Number of Layers: 40 Number of Attention Heads (GQA): 40 for Q and 8 for KV Context Length: 32,768 natively and 131,072 tokens with YaRN.
36T
Calcul de formation
L'arithmétique effectuée pour entraîner le modèle, mesurée en opérations à virgule flottante. C'est une mesure du coût de l'exécution de l'entraînement, et non de la rapidité avec laquelle le modèle fini vous répond.
- Calcul de formation
- 3.2 × 10²⁴ FLOP
- Comment cela a été établi
- Operation counting
6 FLOP / parameter / token * 36 * 10^12 tokens * 14.8 * 10^9 parameters = 3.1968e+24 FLOP
Disponibilité
Que vous puissiez obtenir le modèle et l'exécuter sur votre propre matériel, ce qui décide si l'une des chiffres de carte graphique sur cette page s'applique.
- Poids
- Open — downloadable
- Accès au modèle
- Open weights (unrestricted)
- Code d'entraînement
- Unreleased
- Hugging Face
- Qwen
Apache 2.0 https://huggingface.co/Qwen/Qwen3-14B-Base
Comment il est classé
Étiquettes que le jeu de données source applique lors du suivi des modèles notables, et à quel point il est confiant dans l'entrée.
- Probablement au-dessus de 10²³ FLOP
- Yes
- Confiance d'enregistrement
- Confident
Sources
D'où provient cet enregistrement et quand a-t-il été vérifié pour la dernière fois.
- Référence
- Qwen3: Think Deeper, Act Faster
- Dernière mise à jour
- 28 November 2025
Les extrêmes
Les dix GPU les plus rapides qui fonctionnent Qwen3-14B
Classé par les tokens estimés par seconde, la carte la plus récente en premier lorsque les vitesses sont égales. Comme la génération est limitée par la bande passante de la mémoire, cet ordre suit la bande passante plutôt que tout benchmark de jeu..
- 01 B300 288 GB · 8,000 GB/s · Q8_0 229 tok/s
- 02 B200 180 GB · 8,000 GB/s · Q8_0 229 tok/s
- 03 Radeon Instinct MI350X 288 GB · 8,190 GB/s · Q8_0 183 tok/s
- 04 Radeon Instinct MI355X 288 GB · 8,190 GB/s · Q8_0 183 tok/s
- 05 Radeon Instinct MI300 128 GB · 6,550 GB/s · Q8_0 146 tok/s
- 06 H200 NVL 141 GB · 4,890 GB/s · Q8_0 140 tok/s
- 07 H200 SXM 141 GB 141 GB · 4,890 GB/s · Q8_0 140 tok/s
- 08 Radeon Instinct MI325X 256 GB · 6,000 GB/s · Q8_0 134 tok/s
- 09 CMP 170HX 10 GB 10 GB · 1,560 GB/s · Q3_K_M 120 tok/s
- 10 Radeon Instinct MI300A 128 GB · 5,325 GB/s · Q8_0 119 tok/s
Les plus petits GPU qui fonctionnent encore Qwen3-14B
Le chemin le moins cher, par capacité de mémoire. Un ajustement serré exécute le modèle mais ne laisse rien de côté pour une conversation plus longue..
- 01 Arc B570 10 GB · Besoins 8.3 GB · Q3_K_M · serré 19.1 tok/s
- 02 Xbox Series X 6nm GPU 10 GB · Besoins 8.3 GB · Q3_K_M · serré 33.7 tok/s
- 03 Radeon RX 6750 GRE 10 GB 10 GB · Besoins 8.3 GB · Q3_K_M · serré 19.3 tok/s
- 04 CMP 170HX 10 GB 10 GB · Besoins 8.3 GB · Q3_K_M · serré 120 tok/s
- 05 CMP 90HX 10 GB · Besoins 8.3 GB · Q3_K_M · serré 58.7 tok/s
- 06 CMP 50HX 10 GB · Besoins 8.3 GB · Q3_K_M · serré 43.2 tok/s
- 07 Radeon RX 6700 10 GB · Besoins 8.3 GB · Q3_K_M · serré 19.3 tok/s
- 08 Radeon RX 6700M 10 GB · Besoins 8.3 GB · Q3_K_M · serré 19.3 tok/s
- 09 Xbox Series X GPU 10 GB · Besoins 8.3 GB · Q3_K_M · serré 33.7 tok/s
- 10 GeForce RTX 3080 10 GB · Besoins 8.3 GB · Q3_K_M · serré 58.7 tok/s
Ce que signifient les chiffres
Ce dont vous avez besoin pour le faire fonctionner
Carte minimale
P102-101
Mémoire requise
8.3 GB
Le plus rapide
229 tok/s
Qwen3-14B est suffisamment petit avec 14,8 milliards de paramètres pour que le matériel soit rarement l'obstacle — 306 des cartes que nous suivons peuvent le faire fonctionner, y compris des cartes de plusieurs années.
Le matériel minimum qui fonctionne est un P102-101. Ses 10 Go suffisent avec une compression Q3_K_M, fournissant environ 21,0 jetons par seconde.
Le haut de gamme est le B200, à environ 229 jetons par seconde grâce à 8 000 Go/s de bande passante.
À propos de ce modèle
Qwen3-14B a été publié par Alibaba, en Chine, en avril 2025. Il provient de l'industrie.
Cela fonctionne dans la Sprache et est enregistré comme effectuant la modélisation/génération de langue, la réponse à des questions, le raisonnement mathématique, le raisonnement quantitatif, la génération de code, la traduction.
Les poids sont publiés, donc ils peuvent être téléchargés et exécutés sur votre propre matériel indéfiniment, hors ligne, sans compte associé. Ils sont publiés sous l'organisation Qwen sur Hugging Face.
À quelle vitesse il fonctionne, et pourquoi
À travers chaque carte qui peut le faire, le milieu de la gamme est d'environ 21,4 tokens par seconde, et 266 d'entre elles dépassent les dix tokens par seconde, ce qui correspond à peu près à la vitesse de lecture.
Étant dense, il lit tout de lui-même par jeton, c'est pourquoi l'ordre par vitesse ci-dessous suit si étroitement l'ordre par bande passante mémoire.
Parce que l'architecture est enregistrée, la colonne de mémoire est dérivée plutôt qu'estimée.
Entraînement et provenance
L'entraînement a pris environ 3.2 × 10²⁴ FLOP de calcul — une mesure du coût de production du modèle, pas de sa rapidité de réponse.
Étape par étape
Comment choisir un GPU pour Qwen3-14B
Le tableau ci-dessus a déjà évalué chaque carte dont nous détenons les spécifications pour ce modèle. Obtenir votre réponse nécessite six étapes..
-
01
Vérifiez ce dont cela a besoin avant toute autre chose.
Regardez ce dont Qwen3-14B a réellement besoin — environ 8,3 Go à Q3_K_M. Aucune puissance de traitement ne compense une carte qui ne peut pas le contenir.
-
02
Ajustez le contexte à votre utilisation réelle
Définissez le contexte en fonction de ce que vous allez réellement utiliser. Le cache augmente avec la conversation, et c'est la raison habituelle pour laquelle Qwen3-14B cesse de s'adapter à une carte qui semblait correcte.
-
03
Choisissez jusqu'où vous allez le compresser
La colonne de quantification varie selon la carte, car une carte plus grande contient une copie plus précise de Qwen3-14B — Q3_K_M sur la plus petite carte qui convient. Établir un plancher pour maintenir la comparaison à un niveau.
-
04
Classez par débit plutôt que par fiche technique
Le classement par tokens par seconde pour Qwen3-14B suit la bande passante de mémoire, et non le nombre de cœurs, c'est pourquoi le B200 se classe en tête à 229 tok/s.
-
05
Lisez la colonne ajustement en dernier
Tight signifie que Qwen3-14B se charge et fonctionne, sans possibilité d'augmenter le contexte plus tard. Comfortable signifie que vous pouvez. La différence compte plus que quelques tokens par seconde.
-
06
Vérifiez la carte de l'autre côté
Suivre une carte jusqu'à sa propre page montre chaque autre modèle qu'elle peut contenir, ce qui est la question qui suit une fois que Qwen3-14B est réglé.
Réponses
Qwen3-14B — Questions fréquentes
Quelle est la rapidité de Qwen3-14B sur un GPU ?
Cela dépend de la carte. La plus rapide que nous calculons est une B200 à environ 229 jetons par seconde; la plus lente qui fonctionne encore gère considérablement moins. La vitesse de lecture est d'environ dix jetons par seconde, et 266 des cartes qui peuvent exécuter Qwen3-14B dépassent cela.
Combien de VRAM Qwen3-14B nécessite-t-il ?
Environ 8,3 Go à compression Q3_K_M, qui est ce que la plus petite carte qui le fait utilise. Moins de compression nécessite plus : les chiffres dans la colonne mémoire ci-dessus sont recalculés pour chaque carte, car chacune conserve la version la moins compressée qu'elle peut.
Puis-je exécuter Qwen3-14B sur un GPU de 12 Go ?
Oui. Une GeForce RTX 3080 Ti avec 12 Go le fait tourner à Q4_K_M, utilisant environ 10,0 Go et générant environ 60,3 jetons par seconde — un ajustement serré.
Puis-je exécuter Qwen3-14B sur un GPU de 16 Go ?
Oui. Un Tesla V100 SXM2 16 Go avec 16 Go le fait fonctionner à Q6_K, utilisant environ 13,4 Go et générant environ 47,0 jetons par seconde — un ajustement serré.
Puis-je exécuter Qwen3-14B sur un GPU de 24 Go ?
Oui. Une GeForce RTX 5090 D V2 avec 24 Go le fait fonctionner à Q8_0, utilisant environ 16,9 Go et générant environ 38,4 jetons par seconde — un ajustement confortable.
Qwen3-14B est-il open source ?
Ses poids sont publiés, donc Qwen3-14B peut être téléchargé et exécuté sur votre propre matériel. Notez que les poids ouverts ne sont pas la même chose que le code source ouvert au sens complet - cela ne dit rien sur les données d'entraînement, le code d'entraînement, ou les conditions commerciales attachées.
Combien de paramètres Qwen3-14B a-t-il ?
Qwen3-14B a 14,8 milliards de paramètres. Nombre de paramètres : 14,8 milliards Nombre de paramètres (non-embedding) : 13,2 milliards Nombre de couches : 40 Nombre de têtes d'attention (GQA) : 40 pour Q et 8 pour KV Longueur de contexte : 32 768 de manière native et 131 072 tokens avec YaRN. Ce chiffre est le total, et c'est ce qui décide combien de mémoire le modèle nécessite - environ un demi-gigaoctet par milliard à la compression que la plupart des gens utilisent.
Qui a créé Qwen3-14B ?
Qwen3-14B a été publié par Alibaba, basé en Chine, catégorisé comme industrie.
Quand Qwen3-14B a-t-il été publié ?
Qwen3-14B a été publié en avril 2025.
À quoi sert Qwen3-14B ?
Qwen3-14B fonctionne en LANGUE et est enregistré comme capable de gérer la modélisation/génération de LANGUE, la réponse à des questions, le raisonnement mathématique, le raisonnement quantitatif, la génération de code, la traduction. Un modèle peut gérer plusieurs de chaque, donc ce sont les domaines pour lesquels il a été construit plutôt qu'une limite sur ce qu'il tentera.
Où puis-je télécharger Qwen3-14B ?
Ses poids sont publiés sous l'organisation Qwen sur Hugging Face. Nous n'hébergeons pas de fichiers de modèle — ce site calcule le matériel nécessaire pour les exécuter.
Combien de calculs ont été utilisés pour entraîner Qwen3-14B ?
Environ 3,2 × 10²⁴ FLOP. Cela mesure le coût de production du modèle et ne dit rien sur la rapidité avec laquelle il répond une fois entraîné — la vitesse d'inférence dépend de la bande passante mémoire, pas du budget de formation.
Puis-je exécuter Qwen3-14B s'il ne tient pas dans ma GPU ?
Il peut être réparti entre la mémoire de la carte et la mémoire système, mais Qwen3-14B génère douloureusement lentement de cette façon — la plus proche défaillance que nous calculons est inférieure de 2,8 Go. Rien sur cette page n'assume le déchargement.
Deux GPU feraient-ils fonctionner Qwen3-14B plus rapidement ?
Une seconde carte double à peu près la mémoire disponible mais pas le taux de génération. Avec 306 cartes déjà capables de faire fonctionner Qwen3-14B seules, l'argument en faveur de l'association est faible.
Pourquoi la quantification diffère-t-elle entre les cartes pour Qwen3-14B ?
Chaque carte est montrée utilisant la copie la moins compressée qu'elle peut contenir, et Qwen3-14B apparaît à 5 niveaux de compression différents sur les cartes qui l'acceptent. Les cartes plus grandes obtiennent la version la plus précise.
Quelle est la précision de ces estimations de vitesse Qwen3-14B ?
Ils sont calculés à partir de spécifications plutôt que mesurés, et chacun a une plage — 195–275 tok/s sur le B200, par exemple. Le même modèle et la même carte varient de trente à cinquante pour cent selon le logiciel d'inférence et sa version.
Quelle GPU ai-je besoin pour exécuter Qwen3-14B ?
La plus petite carte de notre catalogue qui supporte Qwen3-14B est la P102-101, avec 10 Go de mémoire. Elle exécute le modèle à Q3_K_M en utilisant environ 8,3 Go, et produit environ 21,0 jetons par seconde. 306 cartes au total peuvent l'exécuter.
Dans l'autre sens
Regardez-la de l'autre côté ?
Cette page commence par le modèle. Si vous possédez déjà une carte et souhaitez connaître tout ce qu'elle pourra exécuter, commencez plutôt par le matériel.