Débit mémoire-bound, calculé en direct

Votre GPU peut-il exécuter ce modèle AI ? Le calculateur TPS de GPU

Choisissez une carte GPU ou un modèle linguistique et nous calculons — en direct, pas depuis une table de consultation — s'il s'adapte, à quelle compression, et environ combien de jetons par seconde vous pouvez attendre..

Chaque paire calculée sur demande Publiée en tant que gamme Formules dans l'open

Estimation en direct

Entrée
Qwen3-8B
18.6 tok/s
15.8 plage attendue 22.3

Format

Q8_0

Contexte

13k

Confiance

high

Exemples travaillés

Découvrez ces combinaisons puissantes

Quelques associations que nous recommanderions à un ami, à différents budgets.

Le point d'entrée

12 GB
GeForce RTX 3060 12 GB
Qwen3-8B
18.6 tok/s
15.8 22.3
Q8_0 13k Contexte

Le juste milieu

16 GB
GeForce RTX 4080
Qwen3-14B
29.8 tok/s
25.3 35.8
Q6_K 15k Contexte

La grande configuration garçon

32 GB
GeForce RTX 5090
40.8 tok/s
24.5 65.3
Q6_K 35k Contexte

01

Comparer les GPU

VRAM, bande passante de mémoire, cœurs tensoriels et débit FP16.

02

Estimer des jetons par seconde

La vitesse de décodage est limitée par la bande passante de la mémoire, donc nous la modélisons plutôt que de citer le pic de TFLOPS..

03

Vérifiez ce qui s'adapte

Quels modèles fonctionnent sur une carte, à quelle quantification et avec combien de contexte.

Le problème

Pourquoi "mon GPU fera-t-il fonctionner ça ?" est une question difficile

Une fiche technique vous indique la mémoire d'une carte et sa fréquence d'horloge. Elle ne vous dit pas si un modèle de langue spécifique tient dans cette mémoire une fois compressé, combien de la carte reste disponible pour la conversation elle-même, ou combien de tokens par seconde sortent réellement de l'autre côté — et ces trois questions n'ont pas la même réponse pour chaque paire GPU-et-modèle.

La version honnête de ce calcul prend en compte le nombre de paramètres du modèle et son architecture, le format de compression dans lequel il est stocké, la bande passante de la mémoire de la carte et la maturité de son logiciel d'inférence, ainsi que la longueur de la conversation que vous prévoyez d'avoir avec lui. Avoir l'un de ces éléments incorrects et le nombre qui en ressort semble tout aussi confiant et est simplement incorrect.

Nous ne prétendons pas que cela produise un seul chiffre précis, car ce n'est pas possible. Ce que nous faisons plutôt, c'est exécuter le calcul complet pour chaque CARD et chaque MODEL pour lesquels nous avons des données, publier le résultat sous forme d'une plage plutôt qu'une valeur d'un point de fausse précision, et montrer notre travail - chaque formule derrière chaque nombre sur ce site est écrite à découvert, pas cachée derrière la réponse.

Ce que ce site vous offre réellement

L'ensemble de données le plus complet que nous puissions rassembler : des milliers de GPU et des milliers de modèles de langue, vérifiés les uns contre les autres plutôt que regardés un par un. Commencez par une carte que vous possédez ou envisagez, et voyez chaque modèle qui s'y adapte. Commencez par un modèle que vous souhaitez exécuter, et voyez chaque carte qui peut le supporter.

Cela fonctionne dans les deux sens car le calcul sous-jacent est symétrique - la même arithmétique de mémoire et de bande passante, exécutée de chaque côté que vous connaissez déjà. Aucun des deux sens n'est le "réel" ; ils sont la même réponse posée de deux manières différentes.

En savoir plus sur comment et pourquoi sur notre page à propos.

Nouveaux lancements

Découvrez ces nouveaux modèles puissants

Parcourir tous les modèles d'IA

NVIDIA

Jun 2026

Nemotron 3 Ultra
550B paramètres

GPU Compatible

B300

Prime Intellect,Arcee AI

Feb 2026

Arcee Trinity Large
398B paramètres

GPU Compatible

B300

Alibaba

Feb 2026

Qwen3.5 397B-A17B
397B paramètres

GPU Compatible

B300

Nouveaux lancements

Découvrez ces nouveaux GPU puissants.

Parcourez tous les GPU

NVIDIA

Oct 2025

Assez puissant pour exécuter

Mistral Medium 3.5 · 128B

NVIDIA

Oct 2025

GB10
128 GB Mémoire

Assez puissant pour exécuter

Solar Open2 250B · 250.3B

AMD

Sep 2025

Radeon PRO W7900D
48 GB Mémoire

Assez puissant pour exécuter

Qwen3-Coder-Next · 80B

Les deux directions

Comment fonctionne la calculatrice

Le même calcul, utilisable de n'importe quel côté de la question à partir duquel vous commencez..

En partant d'un GPU que vous possédez

  1. 01 Trouvez votre carte GPU . Recherchez dans le catalogue GPU la carte que vous possédez ou envisagez, par nom ou par taille de mémoire.
  2. 02 Ouvrez sa page . Chaque CARTE a sa propre page répertoriant chaque modèle de langue que nous pouvons évaluer par rapport à elle, avec un chiffre estimé de TOKENS-PAR-SECONDE pour chacun.
  3. 03 Définissez votre longueur de contexte et votre seuil de qualité . Ajustez la longueur de conversation que vous attendez de travailler et la compression la plus basse que vous accepterez. Les deux changent la réponse en direct.
  4. 04 Lisez la plage, pas un seul nombre . Chaque estimation est publiée avec une plage de confiance plutôt qu'un chiffre de fausse précision, car la même CARTE et le même MODÈLE varient entre les moteurs d'inférence de manière que aucune fiche technique ne prédit.

À partir d'un modèle que vous souhaitez exécuter

  1. 01 Trouver le modèle . Recherche dans le catalogue des modèles AI par nom ou par taille — même lorsque le nom lui-même ne précise pas le nombre de paramètres.
  2. 02 Ouvrez sa page . Un modèle avec des poids ouverts énumère chaque carte graphique contre laquelle nous pouvons l'évaluer, la plus petite qui s'adapte et la plus rapide en premier.
  3. 03 Définissez votre longueur de contexte et votre seuil de qualité . Les mêmes deux contrôles que le chemin GPU-first — une conversation plus longue nécessite plus de MEMORY, ce qui peut pousser une CARD de "fits" à "does not".
  4. 04 Comparez les cartes par ce que vous remarquerez réellement . La MÉMOIRE détermine si elle fonctionne ou pas ; la bande passante détermine à quelle vitesse elle se sent une fois qu'elle fonctionne. Le tableau trie par tokens par seconde par défaut car c'est généralement celui qui compte.

Réponses

questions courantes

01

Comment puis-je calculer si ma GPU peut exécuter un LLM local ?

Trouvez votre carte dans le catalogue GPU et ouvrez sa page - elle liste chaque modèle que nous pouvons évaluer par rapport à elle, si chacun s'adapte dans la mémoire, et une estimation du nombre de jetons par seconde. Vous pouvez également partir d'un modèle et voir quelles cartes peuvent l'exécuter, ce qui est le même calcul dans la direction opposée.

02

Mon GPU peut-il exécuter des modèles LLM locaux ?

S'il a au moins quelques gigaoctets de mémoire propre, presque certainement quelque chose. Les graphiques intégrés qui partagent la mémoire système sont l'exception principale, car ils n'ont pas de pool dédié pour contenir un modèle. Au-delà de cela, c'est une question de quel modèle, à quelle compression — pas oui ou non.

03

Qu'est-ce qui détermine les tokens par seconde sur un GPU ?

Générer un jeton signifie lire les poids du modèle depuis la VRAM une fois, donc la vitesse est limitée par la bande passante de la mémoire divisée par la quantité à lire par jeton — ce qui dépend de la taille du modèle, de son architecture et du format de compression dans lequel il est stocké. La vitesse d'horloge et le nombre de cœurs, les chiffres avec lesquels une fiche technique commence, n'ont pratiquement pas d'impact.

04

Quelle est la précision des estimations sur ce site ?

Attendez-vous à ce que le chiffre réel se situe dans une fourchette d'environ 20 à 40 % de l'estimation. Le même GPU et modèle varient autant entre les moteurs d'inférence, les versions de moteur et les configurations de service — aucun calcul à partir des fiches techniques seules ne peut prédire cela, c'est pourquoi chaque chiffre ici est publié sous forme de plage.

05

Un GPU plus grand et plus récent est-il toujours plus rapide pour l'IA ?

Pour un modèle qui s'adapte déjà confortablement sur les deux cartes, la bande passante mémoire décide du gagnant, et une carte plus récente en a généralement plus. Mais le goulet d'étranglement le plus courant est la capacité, pas la vitesse — la question la plus utile pour une carte spécifique est généralement "quel est le plus grand modèle qui s'adapte", ce à quoi la page de chaque carte répond directement.

06

Ai-je besoin de comprendre la quantification pour utiliser ce site ?

Non — chaque page de carte et de modèle choisit la compression de meilleure qualité qui s'adapte réellement, automatiquement. La quantification est la technique qui réduit l'empreinte mémoire d'un modèle à un petit coût pour la qualité de sortie, et vous pouvez définir un seuil de qualité vous-même si vous le souhaitez, mais rien ne l'exige.

07

D'où viennent les jeux de données des GPU et des modèles AI ?

Spécifications de carte graphique et dossiers de modèles linguistiques couvrant des milliers de modèles open-weight et leurs comptes de paramètres, licences et dates de sortie. Les deux sont mis à jour au fur et à mesure que le nouveau matériel et les modèles sont publiés — voir les catalogues de GPU et de modèles AI pour une couverture complète.

Vente de matériel

Intéressé à devenir un vendeur ?

Listez vos GPU à vendre juste à côté de la réponse à ce qu'ils peuvent réellement exécuter.

Bientôt disponible

Recevez des notifications sur les nouveaux GPU et modèles

Une newsletter arrive bientôt.

Bientôt disponible

Explorer davantage

Parcourir le catalogue complet des GPU ou parcourir le catalogue complet des modèles d'IA. Acheter du matériel ? vérifier le répertoire des vendeurs. Plus de questions sont répondues sur notre page FAQ, ou Contactez-nous directement.