Calculez le TPS du RTX 6000D sur des modèles d'IA locaux

NVIDIA 84 GB GDDR7 1,570 GB/s March 2025

Chaque modèle de notre catalogue évalué selon cette fiche dans la longueur de contexte et la qualité minimale que vous choisissez. La vitesse est une estimation pour une seule requête, calculée à partir de la bande passante mémoire de cette fiche et de la taille de chaque modèle une fois compressé.

Calculé pour cette carte

609 modèles qu'il peut exécuter

679 modèles dans notre catalogue dans leur ensemble

Plus grand modèle qu'il supporte

dots.llm1

142B · Q3_K_M · 12.6 tok/s

Modèle le plus rapide

Gemma 3 QAT 1B

665 tok/s · 1B

Quels modèles d'IA peuvent fonctionner sur un RTX 6000D?

Définissez les entrées, lisez la réponse

Plus de contexte signifie plus de mémoire pour le cache de la conversation. La vitesse concerne une conversation nouvelle et ne change pas avec ce paramètre.

Masque les modèles qui ne pourraient être adaptés qu'en étant compressés au-dessous de ce point.

609 modèles correspondent

Calcul en cours
Quantification Adapté
665 tok/s

565–798

Gemma 3 1B 1B Mar 2025 1.8 GB 33k tokens Q8_0 Confortable
665 tok/s

565–798

Gemma 3 QAT 1B 1B Apr 2025 1.8 GB 33k tokens Q8_0 Confortable
665 tok/s

399–1,064 · faible confiance

HGRN 1B (WT 103) 1B Nov 2023 1.8 GB 131k tokens ? Q8_0 Confortable
665 tok/s

399–1,064 · faible confiance

LLama 3..2 Typhoon 2 1B 1B Dec 2024 1.8 GB 131k tokens ? Q8_0 Confortable
665 tok/s

399–1,064 · faible confiance

OLMo-1B 1B Feb 2024 1.8 GB 131k tokens ? Q8_0 Confortable
665 tok/s

399–1,064 · faible confiance

Pythia-1b 1B Apr 2023 1.8 GB 131k tokens ? Q8_0 Confortable
616 tok/s

369–985 · faible confiance

OpenELM-1.1B 1.1B May 2024 1.9 GB 131k tokens ? Q8_0 Confortable
604 tok/s

363–967 · faible confiance

DeciCoder-1B 1.1B Aug 2023 1.9 GB 131k tokens ? Q8_0 Confortable
604 tok/s

363–967 · faible confiance

SantaCoder 1.1B Jan 2023 1.9 GB 131k tokens ? Q8_0 Confortable
604 tok/s

363–967 · faible confiance

TinyLlama-1.1B (1T token checkpoint) 1.1B Oct 2023 1.9 GB 131k tokens ? Q8_0 Confortable
604 tok/s

363–967 · faible confiance

TinyLlama-1.1B (3T token checkpoint) 1.1B Oct 2023 1.9 GB 131k tokens ? Q8_0 Confortable
554 tok/s

332–887 · faible confiance

EXAONE 4.0 (1.2B) 1.2B Jul 2025 2.0 GB 131k tokens ? Q8_0 Confortable
554 tok/s

332–887 · faible confiance

MinerU2.5 1.2B Sep 2025 2.0 GB 131k tokens ? Q8_0 Confortable
554 tok/s

332–887 · faible confiance

Pleias 1.0 1.2B 1.2B Dec 2024 2.0 GB 131k tokens ? Q8_0 Confortable
554 tok/s

332–887 · faible confiance

Pleias-RAG-1B 1.2B Apr 2025 2.0 GB 131k tokens ? Q8_0 Confortable
541 tok/s

460–649

Llama 3.2 1B 1.2B Sep 2024 2.2 GB 131k tokens Q8_0 Confortable
533 tok/s

320–853 · faible confiance

MiniCPM-1.2B 1.2B Jun 2024 2.0 GB 131k tokens ? Q8_0 Confortable
511 tok/s

307–818 · faible confiance

DeepSeek Coder 1.3B 1.3B Jan 2024 2.1 GB 131k tokens ? Q8_0 Confortable
511 tok/s

307–818 · faible confiance

DeepSeek-VL-1.3B 1.3B Mar 2024 2.1 GB 131k tokens ? Q8_0 Confortable
511 tok/s

307–818 · faible confiance

DigiRL 1.3B Jun 2024 2.1 GB 131k tokens ? Q8_0 Confortable
511 tok/s

307–818 · faible confiance

GLA Transformer 1.3B 1.3B Aug 2024 2.1 GB 131k tokens ? Q8_0 Confortable
511 tok/s

307–818 · faible confiance

Janus 1.3B 1.3B Oct 2024 2.1 GB 131k tokens ? Q8_0 Confortable
511 tok/s

307–818 · faible confiance

Kosmos-2.5 1.3B Aug 2024 2.1 GB 131k tokens ? Q8_0 Confortable
511 tok/s

307–818 · faible confiance

Otter 1.3B May 2023 2.1 GB 131k tokens ? Q8_0 Confortable
511 tok/s

307–818 · faible confiance

Phi-1 1.3B Oct 2023 2.1 GB 131k tokens ? Q8_0 Confortable

Les vitesses sont des estimations pour une seule requête — une conversation à la fois — calculées à partir de la bande passante mémoire, de la taille du modèle et de la quantification. Le débit réel varie en fonction du temps d'inférence et de sa version. Les chiffres publiés par les fabricants de matériel mesurent de nombreuses requêtes simultanées et sont bien plus élevés.

Enregistrement terminé

RTX 6000D Spécification complète

Tout est enregistré pour cette carte, classé selon son importance pour l'exécution d'un modèle linguistique plutôt que selon la façon dont une fiche technique le présenterait. La mémoire vient en premier car elle détermine le résultat ; le reste constitue le contexte.

Mémoire

Les deux spécifications qui décident ce que cette carte peut exécuter et à quelle vitesse. La capacité détermine quels modèles s'adaptent ; la bande passante détermine combien de tokens par seconde ils produisent une fois qu'ils s'adaptent.

Taille de la mémoire
84 GB
Bande passante mémoire
1,570 GB/s
Type de mémoire
GDDR7
largeur de bus de mémoire
448 bit
Horloge mémoire
1.75 GHz

La puce

Quel processeur est sur la carte et comment il a été fabriqué. Un plus petit processus signifie généralement plus de performance pour la même puissance.

Processeur graphique
GB202
Architecture
Blackwell 2.0
Génération
Blackwell PRO W(x000)
Fonderie
TSMC
Taille du processus
5 nm
Transistors
92.2 billion
Densité des transistors
122,900 K/mm²
La taille
750 mm²
Publié
18 March 2025

Vitesses d'horloge

À quelle vitesse le processeur fonctionne. Cela vaut beaucoup moins ici que sur un benchmark de jeu : générer du texte est limité par la bande passante mémoire, donc une horloge plus élevée ne fait guère avancer le résultat.

Fréquence de base
1.59 GHz
Vitesse d'augmentation
2.43 GHz

Unités de traitement

Ce que la puce contient. Ceux-ci déterminent la performance graphique et importent principalement pour le traitement d'un long prompt plutôt que pour la production de la réponse.

Unités d'ombrage
19,968
Unités de mappage de texture
624
Unité de sortie de rendu
192
Multiprocesseurs de streaming
156
Cœurs Tensor
624
Cœurs de ray tracing
156
Cache L1
128 KB
Cache L2
128 MB

Performance théorique

Taux d'arithmétique de pointe publiés pour la carte. Ce sont des plafonds que aucune charge de travail réelle n'atteint, et la génération de texte n'atteint qu'une petite fraction de ceux-ci car elle est limitée par la mémoire plutôt que par l'arithmétique.

Demi-précision (FP16)
97 TFLOPS
Précision simple (FP32)
97 TFLOPS
Double précision (FP64)
1.5 TFLOPS
Taux de pixel
467 GPixel/s
Taux de texture
1,516 GTexel/s

Le conseil

Ce qu'il faut pour installer physiquement et alimenter la carte - les contraintes pratiques qui décident si elle s'adapte à la machine que vous possédez déjà.

Consommation d'énergie (TDP)
600 W
Alimentation recommandée
1,000 W
Connecteurs d'alimentation
1x 16-pin
Interface bus
PCIe 5.0 x16
Largeur de fente
Dual-slot
Dimensions
304 mm × 40 mm
Afficher les sorties
4x DisplayPort 2.1b

Support logiciel

Quelles interfaces graphiques et de calcul la carte prend en charge. La capacité de calcul CUDA est celle qui concerne l'inférence : en dessous de 7.0, il n'y a pas de cœurs de tenseur, et les logiciels d'inférence modernes reviennent à des chemins de code plus lents.

capacité de calcul CUDA
12.0
DirectX
12.2
OpenGL
4.6
Vulkan
1.4
OpenCL
3.0
Modèle de shader
6.8

Annonces

Où acheter un RTX 6000D

Aucun fournisseur ne propose actuellement cette carte. Les annonces proviennent de fournisseurs qui les publient directement ici. — parcourir le répertoire des fournisseurs pour voir qui vend quoi.

Ce que signifient les chiffres

Capacité et bande passante

Mémoire

84 GB

bande passante

1,570 GB/s

Modèle le plus grand

dots.llm1

Avec 84 Go de GDDR7, le RTX 6000D est dans la classe de matériel qui supporte les plus grands modèles à poids ouverts sans les diviser entre les machines. Environ 75,6 Go de cela est accessible par un runtime d'inférence une fois que le pilote a pris sa part.

La bande passante est de 1,570 Go/s sur un bus de 448 bits. Générer un jeton signifie lire chaque poids une fois, donc ce chiffre fixe le rythme plus que tout autre nombre ici, et à ce niveau le texte arrive plus vite que la plupart des gens ne lisent.

La figure est l'horloge de mémoire — 1,75 GHz ici — multipliée par la largeur du bus. C'est pourquoi le nombre de cœurs prédit si mal la vitesse de génération.

Dans la pratique, cette combinaison atteint un maximum de dots.llm1 — 142B, compressé en Q3_K_M, générant environ 12,6 jetons par seconde.

La puce et comment elle a été construite

La RTX 6000D est construite sur le processeur graphique GB202, utilisant l'architecture Blackwell 2.0 de NVIDIA, dans le cadre de la génération Blackwell PRO W(x000).

La puce est fabriquée par TSMC, sur un processus de 5 nm, avec une puce mesurant 750 mm², contenant 92,2 milliards de transistors. Un processus plus petit signifie généralement plus de performances pour la même puissance, bien que pour les modèles de langage, cela importe beaucoup moins que le sous-système de mémoire.

Il a été publié en mars 2025, il y a environ 1 an. Le support des logiciels d'inférence a tendance à suivre le matériel d'un an ou deux, donc une carte de cet âge dispose généralement de chemins de code matures et bien optimisés.

Débit de calcul, et pourquoi cela compte moins qu'il n'y paraît

FP16

97 TFLOPS

FP64

1.5 TFLOPS

Cœurs Tensor

624

Sur le papier, la RTX 6000D atteint 97 TFLOPS à demi-précision et 97 TFLOPS à précision simple. Ce sont des chiffres de pointe qu'aucune charge de travail réelle ne soutient, et la génération de texte n'atteint qu'une petite fraction d'entre eux - le décodage est limité par la mémoire plutôt que par l'arithmétique, ce qui explique pourquoi une carte peut sembler extrêmement puissante ici et produire néanmoins des tokens à un rythme ordinaire.

Le débit en double précision est de 1,5 TFLOPS. Cela n'a aucune incidence sur l'exécution d'un modèle de Sprache — aucun temps d'inférence ne l'utilise — mais cela sépare les parties de datacentre de celles des consommateurs, puisque ces dernières le limitent délibérément.

La carte possède 624 cœurs tensoriels répartis sur 156 multiprocesseurs de flux. Ceux-ci accélèrent l'arithmétique matricielle au cœur d'un transformeur, et c'est ce qui rend le traitement des invites — lire un long document avant de répondre — de manière nettement plus rapide qu'il ne le serait autrement.

Les horloges fonctionnent de 1,59 GHz à la base à 2,43 GHz en mode boost. Vaut bien moins ici que sur une référence de jeu : augmenter les vitesses d'horloge améliore l'arithmétique, et l'arithmétique n'est pas ce que la génération attend.

Cache et unités de traitement

Le RTX 6000D a 128 Ko de cache L1, soutenu par 128 Mo de L2. Le cache absorbe une part du trafic mémoire qui frapperait autrement le bus principal, qui est le seul endroit sur cette page où un nombre autre que la bande passante affecte silencieusement la vitesse de génération — un grand L2 permet à une plus grande partie de l'ensemble de travail de rester proche des cœurs.

Il y a 19 968 unités d'ombrage, 624 unités de mappage de textures et 192 unités de sortie de rendu. Celles-ci alimentent les charges de travail graphiques et contribuent au traitement des requêtes, mais elles restent inactives pendant une grande partie du temps qu'un modèle passe à générer une réponse.

Puissance, taille et installation

Consommation d'énergie

600 W

La RTX 6000D est évaluée à 600 W, avec une alimentation de 1 000 W suggérée pour l'ensemble du système. Exécuter un modèle de langage occupe une carte par intermittence plutôt que de manière continue — elle consomme beaucoup lors de la génération et se repose entre les requêtes — donc la consommation soutenue pendant une journée de travail est généralement bien inférieure à la valeur nominale.

La carte occupe un emplacement double, mesurant 304 mm de long, et nécessite 1x 16 broches. Il vaut la peine de vérifier par rapport au boîtier et à l'alimentation déjà dans la machine, car les cartes les plus grosses nécessitent considérablement plus de chacun que ce qu'un ordinateur de bureau typique fournit.

Il se connecte via PCIe 5.0 x16. L'interface régit la vitesse à laquelle un modèle est chargé du disque dans la carte, pas la rapidité avec laquelle il fonctionne une fois là, donc un lien plus étroit coûte quelques secondes au démarrage et rien par la suite.

Les extrêmes

Les plus grands modèles d'IA qui fonctionnent sur un RTX 6000D

Les plus grands modèles à poids ouverts qui tiennent sur cette carte, les plus récents en premier. Chacun est présenté à la meilleure compression que la carte peut supporter..

  1. 01 Mistral Medium 3.5 128B · IQ4_XS · Apr 2026 12.8 tok/s
  2. 02 dots.llm1 142B · Q3_K_M · Jul 2025 12.6 tok/s
  3. 03 Pixtral Large 124B · IQ4_XS · Nov 2024 13.2 tok/s
  4. 04 xLAM-8x22B 141B · Q3_K_M · Sep 2024 12.7 tok/s
  5. 05 SaulLM-large 141B · Q3_K_M · Jul 2024 12.7 tok/s
  6. 06 Mixtral 8x22B 141B · Q3_K_M · Apr 2024 46.0 tok/s
  7. 07 WizardLM-2 8x22B 141B · Q3_K_M · Apr 2024 12.7 tok/s
  8. 08 Zephyr 141B-A39B 141B · Q3_K_M · Apr 2024 46.0 tok/s
  9. 09 APUS-xDAN-4.0(MoE) 136B · IQ4_XS · Apr 2024 12.0 tok/s
  10. 10 DBRX 132B · IQ4_XS · Mar 2024 45.4 tok/s

Les modèles d'IA les plus rapides sur un RTX 6000D

Où cette carte produit des jetons le plus rapidement. Les modèles plus petits dominent ici, car générer chaque jeton signifie lire l'intégralité du modèle depuis la mémoire en une seule fois..

  1. 01 Gemma 3 QAT 1B 1B · Q8_0 · 1.8 GB 665 tok/s
  2. 02 Gemma 3 1B 1B · Q8_0 · 1.8 GB 665 tok/s
  3. 03 LLama 3..2 Typhoon 2 1B 1B · Q8_0 · 1.8 GB 665 tok/s
  4. 04 OLMo-1B 1B · Q8_0 · 1.8 GB 665 tok/s
  5. 05 HGRN 1B (WT 103) 1B · Q8_0 · 1.8 GB 665 tok/s
  6. 06 Pythia-1b 1B · Q8_0 · 1.8 GB 665 tok/s
  7. 07 OpenELM-1.1B 1.1B · Q8_0 · 1.9 GB 616 tok/s
  8. 08 TinyLlama-1.1B (1T token checkpoint) 1.1B · Q8_0 · 1.9 GB 604 tok/s
  9. 09 TinyLlama-1.1B (3T token checkpoint) 1.1B · Q8_0 · 1.9 GB 604 tok/s
  10. 10 DeciCoder-1B 1.1B · Q8_0 · 1.9 GB 604 tok/s

Étape par étape

Comment calculer le nombre de tokens par seconde d'un RTX 6000D

Vous n'avez pas besoin de faire le calcul à la main — le calculateur de gputps.com sur cette page l'a déjà effectué pour chaque modèle que cette carte peut accueillir. Lire la réponse nécessite six étapes.

  1. 01

    Recherchez le modèle que vous souhaitez

    La table répertorie 609 modèles que ce RTX 6000D peut exécuter. Recherchez par nom ou par taille — taper 27b correspond au nombre de paramètres même lorsque le nom ne le mentionne jamais.

  2. 02

    Associez le contexte à votre travail

    Des conversations plus longues coûtent de la mémoire en plus des poids. Avec 84 Go à disposition, c'est souvent la différence entre un modèle qui s'adapte et un qui ne s'adapte pas.

  3. 03

    Épingler la comparaison à un niveau de qualité

    Par défaut, la table choisit la copie la moins compressée qui s'adapte. Fixer un seuil supprime les modèles qui ne se qualifient que par une compression importante.

  4. 04

    Lisez la vitesse et la portée

    Chaque vitesse est une estimation pour une seule conversation, avec une plage en dessous — 665 tok/s sur Gemma 3 QAT 1B à l'extrémité supérieure ici. La même carte et le même modèle varient de trente à cinquante pour cent entre les temps d'inférence.

  5. 05

    Vérifiez la marge de manœuvre avant de décider

    La colonne d'adéquation sépare les modèles qui s'adaptent juste de ceux qui ont de la place en plus — il vaut la peine de vérifier par rapport aux 84 Go de la carte avant de se décider pour un.

  6. 06

    Vérifiez le même modèle de l'autre côté

    Chaque page de modèle répète ce calcul pour l'ensemble du catalogue. Ça vaut le coup d'œil avant de décider : cela montre quoi d'autre utilise le même modèle, et comment le RTX 6000D se compare.

Réponses

RTX 6000D — Questions fréquentes

01

Quelle est la bande passante mémoire d'un RTX 6000D ?

La RTX 6000D a une bande passante mémoire de 1,570 Go/s, sur un bus mémoire de 448 bits. C'est le meilleur prédicteur unique de la rapidité avec laquelle elle génère du texte, car produire chaque jeton implique de lire l'ensemble du modèle en mémoire une fois.

02

Quel type de mémoire utilise une RTX 6000D ?

Il utilise de la GDDR7 cadencée à 1,75 GHz. Les types HBM se trouvent sur des accélérateurs de datacenter et offrent une bande passante bien supérieure à celle de la GDDR utilisée sur les cartes de bureau, ce qui explique pourquoi ils génèrent des jetons considérablement plus rapidement à la même capacité.

03

Qui fabrique le RTX 6000D ?

La RTX 6000D est un produit NVIDIA, avec le chip fabriqué par TSMC, sur un processus de 5 nm.

04

Quand le RTX 6000D a-t-il été publié ?

La RTX 6000D a été publiée en mars 2025.

05

Quelle puissance consomme une RTX 6000D ?

La RTX 6000D a une puissance de carte nominale de 600 W, et une alimentation système de 1 000 W est suggérée. La génération de texte consomme intensément par rafales et reste inoccupée entre les requêtes, donc la consommation moyenne sur une session de travail est normalement bien en dessous de la valeur nominale.

06

Combien de cache a une RTX 6000D ?

La RTX 6000D dispose de 128 Ko de cache L1 et de 128 Mo de cache L2. Le cache absorbe une partie du trafic mémoire qui atteindrait autrement le bus principal, donc un L2 plus grand donne un léger boost à la vitesse de génération au-delà de ce que la bande passante seule prédit.

07

Quels sont les TFLOPS d'un RTX 6000D ?

Le RTX 6000D est évalué à 97 TFLOPS en demi-précision et 97 TFLOPS en précision simple. Ce sont des plafonds arithmétiques maximaux plutôt que des taux réalisables, et la génération de texte n'atteint qu'une petite fraction d'entre eux car elle est limitée par la bande passante de la mémoire.

08

Combien de cœurs tensoriels a une RTX 6000D ?

La RTX 6000D a 624 cœurs tensoriels répartis sur 156 multiprocesseurs de flux. Ils accélèrent l'arithmétique matricielle à partir de laquelle un transformateur est construit, ce qui accélère principalement le traitement d'un long prompt plutôt que la production de la réponse.

09

La RTX 6000D prend-elle en charge CUDA ?

Oui. La RTX 6000D rapporte une capacité de calcul CUDA 12.0. La capacité 7.0 et au-dessus a des cœurs tensoriels, que le logiciel d'inférence moderne utilise ; en dessous, il revient à des chemins de code plus lents pour les modèles quantifiés.

10

Quel bus d'interface utilise le RTX 6000D ?

Il utilise PCIe 5.0 x16. Cela détermine la vitesse à laquelle un modèle est chargé sur la carte plutôt que la vitesse à laquelle il fonctionne une fois chargé, donc cela coûte quelques secondes au démarrage et rien pendant la génération.

11

Est-ce que la RTX 6000D est bonne pour exécuter des modèles d'IA locaux ?

Sa mémoire est suffisamment grande pour des modèles que la plupart des matériels de bureau ne peuvent pas toucher et sa bande passante est suffisamment élevée pour générer du texte plus rapidement que la plupart des gens ne lisent. Au total, il exécute 609 des modèles que nous suivons. Que cela soit suffisant dépend entièrement du modèle que vous souhaitez — le tableau ci-dessus répond directement à cela.

12

Un RTX 6000D peut-il exécuter un modèle qui ne s'intègre pas dans sa mémoire ?

Décharger au-delà des 84 Go de la carte est possible et constitue généralement une fausse économie : la partie mémoire système est suffisamment lente pour dominer le résultat.

13

Deux cartes RTX 6000D seraient-elles deux fois plus rapides ?

L'apairage de cartes RTX 6000D achète de la marge de manœuvre plutôt que de la vitesse : 168 Go de mémoire combinée, à peu près à la même vitesse de génération qu'une seule.

14

Quels modèles d'IA un RTX 6000D peut-il exécuter ?

609 des 679 modèles linguistiques à poids ouverts que nous suivons s'adaptent sur une RTX 6000D et peuvent être exécutés localement dessus. Le tableau de cette page répertorie chacun d'eux, avec la mémoire dont il a besoin, la quantification à laquelle il fonctionne et une vitesse de génération estimée.

15

Quel est le plus grand modèle AI qu'un RTX 6000D peut exécuter ?

Le plus grand modèle de notre catalogue qui s'adapte sur une RTX 6000D est dots.llm1 avec 142 milliards de paramètres, compressé à Q3_K_M. Il génère environ 12,6 tokens par seconde et nécessite environ 70,1 Go de la mémoire de la carte.

16

Combien de jetons par seconde une RTX 6000D produit-elle ?

Cela dépend du modèle. Sur un RTX 6000D, le modèle le plus rapide que nous suivons est Gemma 3 QAT 1B à environ 665 jetons par seconde, tandis que les modèles plus grands fonctionnent proportionnellement plus lentement car chaque jeton nécessite de lire l'ensemble du modèle depuis la mémoire une fois. Les vitesses sont des estimations pour une seule conversation à la fois.

17

Une RTX 6000D peut-elle exécuter un modèle de 7B ?

Oui. Par exemple, une RTX 6000D exécute la Prédiction Multi-Token 7B à Q8_0, utilisant environ 7,9 Go de mémoire et générant environ 99,2 tokens par seconde.

18

Un RTX 6000D peut-il exécuter un modèle 13B ?

Oui. Par exemple, une RTX 6000D exécute DeepSeekMoE-16B à Q8_0, utilisant environ 17,5 Go de mémoire et générant environ 231 jetons par seconde.

19

Une RTX 6000D peut-elle exécuter un modèle de 30B ?

Oui. Par exemple, un RTX 6000D exécute ERNIE-4.5-VL-28B-A3B à Q8_0, utilisant environ 29,2 Go de mémoire et générant environ 132 tokens par seconde.

20

Un RTX 6000D peut-il faire fonctionner un modèle de 70B ?

Oui. Par exemple, une RTX 6000D exécute Qwen3-Coder-Next à Q6_K, utilisant environ 62,0 Go de mémoire et générant environ 67,1 jetons par seconde.

21

Combien de mémoire a une RTX 6000D ?

Un RTX 6000D a 84 Go de mémoire GDDR7. Environ un dixième de cela est réservé par le runtime d'inférence et le pilote, laissant environ 75,6 Go disponibles pour un modèle et sa conversation.

Dans l'autre sens

Regardez-la de l'autre côté ?

Cette page commence par le matériel. Si vous savez déjà quel modèle vous souhaitez et que vous devez connaître ce qu'il faut pour le faire fonctionner, commence plutôt par le modèle.

Tous les GPU