Calculez le TPS du RTX 6000D sur des modèles d'IA locaux
Chaque modèle de notre catalogue évalué selon cette fiche dans la longueur de contexte et la qualité minimale que vous choisissez. La vitesse est une estimation pour une seule requête, calculée à partir de la bande passante mémoire de cette fiche et de la taille de chaque modèle une fois compressé.
Calculé pour cette carte
679 modèles dans notre catalogue dans leur ensemble
Plus grand modèle qu'il supporte
dots.llm1
142B · Q3_K_M · 12.6 tok/s
Modèle le plus rapide
Gemma 3 QAT 1B
665 tok/s · 1B
Quels modèles d'IA peuvent fonctionner sur un RTX 6000D?
Définissez les entrées, lisez la réponse
Plus de contexte signifie plus de mémoire pour le cache de la conversation. La vitesse concerne une conversation nouvelle et ne change pas avec ce paramètre.
Masque les modèles qui ne pourraient être adaptés qu'en étant compressés au-dessous de ce point.
609 modèles correspondent
Calcul en cours| Quantification | Adapté | ||||||
|---|---|---|---|---|---|---|---|
|
665
tok/s
565–798 |
Gemma 3 1B | 1B | Mar 2025 | 1.8 GB | 33k tokens | Q8_0 | Confortable |
|
665
tok/s
565–798 |
Gemma 3 QAT 1B | 1B | Apr 2025 | 1.8 GB | 33k tokens | Q8_0 | Confortable |
|
665
tok/s
399–1,064 · faible confiance |
HGRN 1B (WT 103) ≈ | 1B | Nov 2023 | 1.8 GB | 131k tokens ? | Q8_0 | Confortable |
|
665
tok/s
399–1,064 · faible confiance |
LLama 3..2 Typhoon 2 1B ≈ | 1B | Dec 2024 | 1.8 GB | 131k tokens ? | Q8_0 | Confortable |
|
665
tok/s
399–1,064 · faible confiance |
OLMo-1B ≈ | 1B | Feb 2024 | 1.8 GB | 131k tokens ? | Q8_0 | Confortable |
|
665
tok/s
399–1,064 · faible confiance |
Pythia-1b ≈ | 1B | Apr 2023 | 1.8 GB | 131k tokens ? | Q8_0 | Confortable |
|
616
tok/s
369–985 · faible confiance |
OpenELM-1.1B ≈ | 1.1B | May 2024 | 1.9 GB | 131k tokens ? | Q8_0 | Confortable |
|
604
tok/s
363–967 · faible confiance |
DeciCoder-1B ≈ | 1.1B | Aug 2023 | 1.9 GB | 131k tokens ? | Q8_0 | Confortable |
|
604
tok/s
363–967 · faible confiance |
SantaCoder ≈ | 1.1B | Jan 2023 | 1.9 GB | 131k tokens ? | Q8_0 | Confortable |
|
604
tok/s
363–967 · faible confiance |
TinyLlama-1.1B (1T token checkpoint) ≈ | 1.1B | Oct 2023 | 1.9 GB | 131k tokens ? | Q8_0 | Confortable |
|
604
tok/s
363–967 · faible confiance |
TinyLlama-1.1B (3T token checkpoint) ≈ | 1.1B | Oct 2023 | 1.9 GB | 131k tokens ? | Q8_0 | Confortable |
|
554
tok/s
332–887 · faible confiance |
EXAONE 4.0 (1.2B) ≈ | 1.2B | Jul 2025 | 2.0 GB | 131k tokens ? | Q8_0 | Confortable |
|
554
tok/s
332–887 · faible confiance |
MinerU2.5 ≈ | 1.2B | Sep 2025 | 2.0 GB | 131k tokens ? | Q8_0 | Confortable |
|
554
tok/s
332–887 · faible confiance |
Pleias 1.0 1.2B ≈ | 1.2B | Dec 2024 | 2.0 GB | 131k tokens ? | Q8_0 | Confortable |
|
554
tok/s
332–887 · faible confiance |
Pleias-RAG-1B ≈ | 1.2B | Apr 2025 | 2.0 GB | 131k tokens ? | Q8_0 | Confortable |
|
541
tok/s
460–649 |
Llama 3.2 1B | 1.2B | Sep 2024 | 2.2 GB | 131k tokens | Q8_0 | Confortable |
|
533
tok/s
320–853 · faible confiance |
MiniCPM-1.2B ≈ | 1.2B | Jun 2024 | 2.0 GB | 131k tokens ? | Q8_0 | Confortable |
|
511
tok/s
307–818 · faible confiance |
DeepSeek Coder 1.3B ≈ | 1.3B | Jan 2024 | 2.1 GB | 131k tokens ? | Q8_0 | Confortable |
|
511
tok/s
307–818 · faible confiance |
DeepSeek-VL-1.3B ≈ | 1.3B | Mar 2024 | 2.1 GB | 131k tokens ? | Q8_0 | Confortable |
|
511
tok/s
307–818 · faible confiance |
DigiRL ≈ | 1.3B | Jun 2024 | 2.1 GB | 131k tokens ? | Q8_0 | Confortable |
|
511
tok/s
307–818 · faible confiance |
GLA Transformer 1.3B ≈ | 1.3B | Aug 2024 | 2.1 GB | 131k tokens ? | Q8_0 | Confortable |
|
511
tok/s
307–818 · faible confiance |
Janus 1.3B ≈ | 1.3B | Oct 2024 | 2.1 GB | 131k tokens ? | Q8_0 | Confortable |
|
511
tok/s
307–818 · faible confiance |
Kosmos-2.5 ≈ | 1.3B | Aug 2024 | 2.1 GB | 131k tokens ? | Q8_0 | Confortable |
|
511
tok/s
307–818 · faible confiance |
Otter ≈ | 1.3B | May 2023 | 2.1 GB | 131k tokens ? | Q8_0 | Confortable |
|
511
tok/s
307–818 · faible confiance |
Phi-1 ≈ | 1.3B | Oct 2023 | 2.1 GB | 131k tokens ? | Q8_0 | Confortable |
Les vitesses sont des estimations pour une seule requête — une conversation à la fois — calculées à partir de la bande passante mémoire, de la taille du modèle et de la quantification. Le débit réel varie en fonction du temps d'inférence et de sa version. Les chiffres publiés par les fabricants de matériel mesurent de nombreuses requêtes simultanées et sont bien plus élevés.
Enregistrement terminé
RTX 6000D Spécification complète
Tout est enregistré pour cette carte, classé selon son importance pour l'exécution d'un modèle linguistique plutôt que selon la façon dont une fiche technique le présenterait. La mémoire vient en premier car elle détermine le résultat ; le reste constitue le contexte.
Mémoire
Les deux spécifications qui décident ce que cette carte peut exécuter et à quelle vitesse. La capacité détermine quels modèles s'adaptent ; la bande passante détermine combien de tokens par seconde ils produisent une fois qu'ils s'adaptent.
- Taille de la mémoire
- 84 GB
- Bande passante mémoire
- 1,570 GB/s
- Type de mémoire
- GDDR7
- largeur de bus de mémoire
- 448 bit
- Horloge mémoire
- 1.75 GHz
La puce
Quel processeur est sur la carte et comment il a été fabriqué. Un plus petit processus signifie généralement plus de performance pour la même puissance.
- Processeur graphique
- GB202
- Architecture
- Blackwell 2.0
- Génération
- Blackwell PRO W(x000)
- Fonderie
- TSMC
- Taille du processus
- 5 nm
- Transistors
- 92.2 billion
- Densité des transistors
- 122,900 K/mm²
- La taille
- 750 mm²
- Publié
- 18 March 2025
Vitesses d'horloge
À quelle vitesse le processeur fonctionne. Cela vaut beaucoup moins ici que sur un benchmark de jeu : générer du texte est limité par la bande passante mémoire, donc une horloge plus élevée ne fait guère avancer le résultat.
- Fréquence de base
- 1.59 GHz
- Vitesse d'augmentation
- 2.43 GHz
Unités de traitement
Ce que la puce contient. Ceux-ci déterminent la performance graphique et importent principalement pour le traitement d'un long prompt plutôt que pour la production de la réponse.
- Unités d'ombrage
- 19,968
- Unités de mappage de texture
- 624
- Unité de sortie de rendu
- 192
- Multiprocesseurs de streaming
- 156
- Cœurs Tensor
- 624
- Cœurs de ray tracing
- 156
- Cache L1
- 128 KB
- Cache L2
- 128 MB
Performance théorique
Taux d'arithmétique de pointe publiés pour la carte. Ce sont des plafonds que aucune charge de travail réelle n'atteint, et la génération de texte n'atteint qu'une petite fraction de ceux-ci car elle est limitée par la mémoire plutôt que par l'arithmétique.
- Demi-précision (FP16)
- 97 TFLOPS
- Précision simple (FP32)
- 97 TFLOPS
- Double précision (FP64)
- 1.5 TFLOPS
- Taux de pixel
- 467 GPixel/s
- Taux de texture
- 1,516 GTexel/s
Le conseil
Ce qu'il faut pour installer physiquement et alimenter la carte - les contraintes pratiques qui décident si elle s'adapte à la machine que vous possédez déjà.
- Consommation d'énergie (TDP)
- 600 W
- Alimentation recommandée
- 1,000 W
- Connecteurs d'alimentation
- 1x 16-pin
- Interface bus
- PCIe 5.0 x16
- Largeur de fente
- Dual-slot
- Dimensions
- 304 mm × 40 mm
- Afficher les sorties
- 4x DisplayPort 2.1b
Support logiciel
Quelles interfaces graphiques et de calcul la carte prend en charge. La capacité de calcul CUDA est celle qui concerne l'inférence : en dessous de 7.0, il n'y a pas de cœurs de tenseur, et les logiciels d'inférence modernes reviennent à des chemins de code plus lents.
- capacité de calcul CUDA
- 12.0
- DirectX
- 12.2
- OpenGL
- 4.6
- Vulkan
- 1.4
- OpenCL
- 3.0
- Modèle de shader
- 6.8
Annonces
Où acheter un RTX 6000D
Aucun fournisseur ne propose actuellement cette carte. Les annonces proviennent de fournisseurs qui les publient directement ici. — parcourir le répertoire des fournisseurs pour voir qui vend quoi.
Ce que signifient les chiffres
Capacité et bande passante
Mémoire
84 GB
bande passante
1,570 GB/s
Modèle le plus grand
dots.llm1
Avec 84 Go de GDDR7, le RTX 6000D est dans la classe de matériel qui supporte les plus grands modèles à poids ouverts sans les diviser entre les machines. Environ 75,6 Go de cela est accessible par un runtime d'inférence une fois que le pilote a pris sa part.
La bande passante est de 1,570 Go/s sur un bus de 448 bits. Générer un jeton signifie lire chaque poids une fois, donc ce chiffre fixe le rythme plus que tout autre nombre ici, et à ce niveau le texte arrive plus vite que la plupart des gens ne lisent.
La figure est l'horloge de mémoire — 1,75 GHz ici — multipliée par la largeur du bus. C'est pourquoi le nombre de cœurs prédit si mal la vitesse de génération.
Dans la pratique, cette combinaison atteint un maximum de dots.llm1 — 142B, compressé en Q3_K_M, générant environ 12,6 jetons par seconde.
La puce et comment elle a été construite
La RTX 6000D est construite sur le processeur graphique GB202, utilisant l'architecture Blackwell 2.0 de NVIDIA, dans le cadre de la génération Blackwell PRO W(x000).
La puce est fabriquée par TSMC, sur un processus de 5 nm, avec une puce mesurant 750 mm², contenant 92,2 milliards de transistors. Un processus plus petit signifie généralement plus de performances pour la même puissance, bien que pour les modèles de langage, cela importe beaucoup moins que le sous-système de mémoire.
Il a été publié en mars 2025, il y a environ 1 an. Le support des logiciels d'inférence a tendance à suivre le matériel d'un an ou deux, donc une carte de cet âge dispose généralement de chemins de code matures et bien optimisés.
Débit de calcul, et pourquoi cela compte moins qu'il n'y paraît
FP16
97 TFLOPS
FP64
1.5 TFLOPS
Cœurs Tensor
624
Sur le papier, la RTX 6000D atteint 97 TFLOPS à demi-précision et 97 TFLOPS à précision simple. Ce sont des chiffres de pointe qu'aucune charge de travail réelle ne soutient, et la génération de texte n'atteint qu'une petite fraction d'entre eux - le décodage est limité par la mémoire plutôt que par l'arithmétique, ce qui explique pourquoi une carte peut sembler extrêmement puissante ici et produire néanmoins des tokens à un rythme ordinaire.
Le débit en double précision est de 1,5 TFLOPS. Cela n'a aucune incidence sur l'exécution d'un modèle de Sprache — aucun temps d'inférence ne l'utilise — mais cela sépare les parties de datacentre de celles des consommateurs, puisque ces dernières le limitent délibérément.
La carte possède 624 cœurs tensoriels répartis sur 156 multiprocesseurs de flux. Ceux-ci accélèrent l'arithmétique matricielle au cœur d'un transformeur, et c'est ce qui rend le traitement des invites — lire un long document avant de répondre — de manière nettement plus rapide qu'il ne le serait autrement.
Les horloges fonctionnent de 1,59 GHz à la base à 2,43 GHz en mode boost. Vaut bien moins ici que sur une référence de jeu : augmenter les vitesses d'horloge améliore l'arithmétique, et l'arithmétique n'est pas ce que la génération attend.
Cache et unités de traitement
Le RTX 6000D a 128 Ko de cache L1, soutenu par 128 Mo de L2. Le cache absorbe une part du trafic mémoire qui frapperait autrement le bus principal, qui est le seul endroit sur cette page où un nombre autre que la bande passante affecte silencieusement la vitesse de génération — un grand L2 permet à une plus grande partie de l'ensemble de travail de rester proche des cœurs.
Il y a 19 968 unités d'ombrage, 624 unités de mappage de textures et 192 unités de sortie de rendu. Celles-ci alimentent les charges de travail graphiques et contribuent au traitement des requêtes, mais elles restent inactives pendant une grande partie du temps qu'un modèle passe à générer une réponse.
Puissance, taille et installation
Consommation d'énergie
600 W
La RTX 6000D est évaluée à 600 W, avec une alimentation de 1 000 W suggérée pour l'ensemble du système. Exécuter un modèle de langage occupe une carte par intermittence plutôt que de manière continue — elle consomme beaucoup lors de la génération et se repose entre les requêtes — donc la consommation soutenue pendant une journée de travail est généralement bien inférieure à la valeur nominale.
La carte occupe un emplacement double, mesurant 304 mm de long, et nécessite 1x 16 broches. Il vaut la peine de vérifier par rapport au boîtier et à l'alimentation déjà dans la machine, car les cartes les plus grosses nécessitent considérablement plus de chacun que ce qu'un ordinateur de bureau typique fournit.
Il se connecte via PCIe 5.0 x16. L'interface régit la vitesse à laquelle un modèle est chargé du disque dans la carte, pas la rapidité avec laquelle il fonctionne une fois là, donc un lien plus étroit coûte quelques secondes au démarrage et rien par la suite.
Les extrêmes
Les plus grands modèles d'IA qui fonctionnent sur un RTX 6000D
Les plus grands modèles à poids ouverts qui tiennent sur cette carte, les plus récents en premier. Chacun est présenté à la meilleure compression que la carte peut supporter..
Les modèles d'IA les plus rapides sur un RTX 6000D
Où cette carte produit des jetons le plus rapidement. Les modèles plus petits dominent ici, car générer chaque jeton signifie lire l'intégralité du modèle depuis la mémoire en une seule fois..
Étape par étape
Comment calculer le nombre de tokens par seconde d'un RTX 6000D
Vous n'avez pas besoin de faire le calcul à la main — le calculateur de gputps.com sur cette page l'a déjà effectué pour chaque modèle que cette carte peut accueillir. Lire la réponse nécessite six étapes.
-
01
Recherchez le modèle que vous souhaitez
La table répertorie 609 modèles que ce RTX 6000D peut exécuter. Recherchez par nom ou par taille — taper 27b correspond au nombre de paramètres même lorsque le nom ne le mentionne jamais.
-
02
Associez le contexte à votre travail
Des conversations plus longues coûtent de la mémoire en plus des poids. Avec 84 Go à disposition, c'est souvent la différence entre un modèle qui s'adapte et un qui ne s'adapte pas.
-
03
Épingler la comparaison à un niveau de qualité
Par défaut, la table choisit la copie la moins compressée qui s'adapte. Fixer un seuil supprime les modèles qui ne se qualifient que par une compression importante.
-
04
Lisez la vitesse et la portée
Chaque vitesse est une estimation pour une seule conversation, avec une plage en dessous — 665 tok/s sur Gemma 3 QAT 1B à l'extrémité supérieure ici. La même carte et le même modèle varient de trente à cinquante pour cent entre les temps d'inférence.
-
05
Vérifiez la marge de manœuvre avant de décider
La colonne d'adéquation sépare les modèles qui s'adaptent juste de ceux qui ont de la place en plus — il vaut la peine de vérifier par rapport aux 84 Go de la carte avant de se décider pour un.
-
06
Vérifiez le même modèle de l'autre côté
Chaque page de modèle répète ce calcul pour l'ensemble du catalogue. Ça vaut le coup d'œil avant de décider : cela montre quoi d'autre utilise le même modèle, et comment le RTX 6000D se compare.
Réponses
RTX 6000D — Questions fréquentes
Quelle est la bande passante mémoire d'un RTX 6000D ?
La RTX 6000D a une bande passante mémoire de 1,570 Go/s, sur un bus mémoire de 448 bits. C'est le meilleur prédicteur unique de la rapidité avec laquelle elle génère du texte, car produire chaque jeton implique de lire l'ensemble du modèle en mémoire une fois.
Quel type de mémoire utilise une RTX 6000D ?
Il utilise de la GDDR7 cadencée à 1,75 GHz. Les types HBM se trouvent sur des accélérateurs de datacenter et offrent une bande passante bien supérieure à celle de la GDDR utilisée sur les cartes de bureau, ce qui explique pourquoi ils génèrent des jetons considérablement plus rapidement à la même capacité.
Qui fabrique le RTX 6000D ?
La RTX 6000D est un produit NVIDIA, avec le chip fabriqué par TSMC, sur un processus de 5 nm.
Quand le RTX 6000D a-t-il été publié ?
La RTX 6000D a été publiée en mars 2025.
Quelle puissance consomme une RTX 6000D ?
La RTX 6000D a une puissance de carte nominale de 600 W, et une alimentation système de 1 000 W est suggérée. La génération de texte consomme intensément par rafales et reste inoccupée entre les requêtes, donc la consommation moyenne sur une session de travail est normalement bien en dessous de la valeur nominale.
Combien de cache a une RTX 6000D ?
La RTX 6000D dispose de 128 Ko de cache L1 et de 128 Mo de cache L2. Le cache absorbe une partie du trafic mémoire qui atteindrait autrement le bus principal, donc un L2 plus grand donne un léger boost à la vitesse de génération au-delà de ce que la bande passante seule prédit.
Quels sont les TFLOPS d'un RTX 6000D ?
Le RTX 6000D est évalué à 97 TFLOPS en demi-précision et 97 TFLOPS en précision simple. Ce sont des plafonds arithmétiques maximaux plutôt que des taux réalisables, et la génération de texte n'atteint qu'une petite fraction d'entre eux car elle est limitée par la bande passante de la mémoire.
Combien de cœurs tensoriels a une RTX 6000D ?
La RTX 6000D a 624 cœurs tensoriels répartis sur 156 multiprocesseurs de flux. Ils accélèrent l'arithmétique matricielle à partir de laquelle un transformateur est construit, ce qui accélère principalement le traitement d'un long prompt plutôt que la production de la réponse.
La RTX 6000D prend-elle en charge CUDA ?
Oui. La RTX 6000D rapporte une capacité de calcul CUDA 12.0. La capacité 7.0 et au-dessus a des cœurs tensoriels, que le logiciel d'inférence moderne utilise ; en dessous, il revient à des chemins de code plus lents pour les modèles quantifiés.
Quel bus d'interface utilise le RTX 6000D ?
Il utilise PCIe 5.0 x16. Cela détermine la vitesse à laquelle un modèle est chargé sur la carte plutôt que la vitesse à laquelle il fonctionne une fois chargé, donc cela coûte quelques secondes au démarrage et rien pendant la génération.
Est-ce que la RTX 6000D est bonne pour exécuter des modèles d'IA locaux ?
Sa mémoire est suffisamment grande pour des modèles que la plupart des matériels de bureau ne peuvent pas toucher et sa bande passante est suffisamment élevée pour générer du texte plus rapidement que la plupart des gens ne lisent. Au total, il exécute 609 des modèles que nous suivons. Que cela soit suffisant dépend entièrement du modèle que vous souhaitez — le tableau ci-dessus répond directement à cela.
Un RTX 6000D peut-il exécuter un modèle qui ne s'intègre pas dans sa mémoire ?
Décharger au-delà des 84 Go de la carte est possible et constitue généralement une fausse économie : la partie mémoire système est suffisamment lente pour dominer le résultat.
Deux cartes RTX 6000D seraient-elles deux fois plus rapides ?
L'apairage de cartes RTX 6000D achète de la marge de manœuvre plutôt que de la vitesse : 168 Go de mémoire combinée, à peu près à la même vitesse de génération qu'une seule.
Quels modèles d'IA un RTX 6000D peut-il exécuter ?
609 des 679 modèles linguistiques à poids ouverts que nous suivons s'adaptent sur une RTX 6000D et peuvent être exécutés localement dessus. Le tableau de cette page répertorie chacun d'eux, avec la mémoire dont il a besoin, la quantification à laquelle il fonctionne et une vitesse de génération estimée.
Quel est le plus grand modèle AI qu'un RTX 6000D peut exécuter ?
Le plus grand modèle de notre catalogue qui s'adapte sur une RTX 6000D est dots.llm1 avec 142 milliards de paramètres, compressé à Q3_K_M. Il génère environ 12,6 tokens par seconde et nécessite environ 70,1 Go de la mémoire de la carte.
Combien de jetons par seconde une RTX 6000D produit-elle ?
Cela dépend du modèle. Sur un RTX 6000D, le modèle le plus rapide que nous suivons est Gemma 3 QAT 1B à environ 665 jetons par seconde, tandis que les modèles plus grands fonctionnent proportionnellement plus lentement car chaque jeton nécessite de lire l'ensemble du modèle depuis la mémoire une fois. Les vitesses sont des estimations pour une seule conversation à la fois.
Une RTX 6000D peut-elle exécuter un modèle de 7B ?
Oui. Par exemple, une RTX 6000D exécute la Prédiction Multi-Token 7B à Q8_0, utilisant environ 7,9 Go de mémoire et générant environ 99,2 tokens par seconde.
Un RTX 6000D peut-il exécuter un modèle 13B ?
Oui. Par exemple, une RTX 6000D exécute DeepSeekMoE-16B à Q8_0, utilisant environ 17,5 Go de mémoire et générant environ 231 jetons par seconde.
Une RTX 6000D peut-elle exécuter un modèle de 30B ?
Oui. Par exemple, un RTX 6000D exécute ERNIE-4.5-VL-28B-A3B à Q8_0, utilisant environ 29,2 Go de mémoire et générant environ 132 tokens par seconde.
Un RTX 6000D peut-il faire fonctionner un modèle de 70B ?
Oui. Par exemple, une RTX 6000D exécute Qwen3-Coder-Next à Q6_K, utilisant environ 62,0 Go de mémoire et générant environ 67,1 jetons par seconde.
Combien de mémoire a une RTX 6000D ?
Un RTX 6000D a 84 Go de mémoire GDDR7. Environ un dixième de cela est réservé par le runtime d'inférence et le pilote, laissant environ 75,6 Go disponibles pour un modèle et sa conversation.
Dans l'autre sens
Regardez-la de l'autre côté ?
Cette page commence par le matériel. Si vous savez déjà quel modèle vous souhaitez et que vous devez connaître ce qu'il faut pour le faire fonctionner, commence plutôt par le modèle.