Débit mémoire-bound, calculé en direct
Votre GPU peut-il exécuter ce modèle AI ? Le calculateur TPS de GPU
Choisissez une carte GPU ou un modèle linguistique et nous calculons — en direct, pas depuis une table de consultation — s'il s'adapte, à quelle compression, et environ combien de jetons par seconde vous pouvez attendre..
Estimation en direct
EntréeFormat
Q8_0
Contexte
13k
Confiance
high
Exemples travaillés
Découvrez ces combinaisons puissantes
Quelques associations que nous recommanderions à un ami, à différents budgets.
La grande configuration garçon
32 GB01
Comparer les GPU
VRAM, bande passante de mémoire, cœurs tensoriels et débit FP16.
02
Estimer des jetons par seconde
La vitesse de décodage est limitée par la bande passante de la mémoire, donc nous la modélisons plutôt que de citer le pic de TFLOPS..
03
Vérifiez ce qui s'adapte
Quels modèles fonctionnent sur une carte, à quelle quantification et avec combien de contexte.
Le problème
Pourquoi "mon GPU fera-t-il fonctionner ça ?" est une question difficile
Une fiche technique vous indique la mémoire d'une carte et sa fréquence d'horloge. Elle ne vous dit pas si un modèle de langue spécifique tient dans cette mémoire une fois compressé, combien de la carte reste disponible pour la conversation elle-même, ou combien de tokens par seconde sortent réellement de l'autre côté — et ces trois questions n'ont pas la même réponse pour chaque paire GPU-et-modèle.
La version honnête de ce calcul prend en compte le nombre de paramètres du modèle et son architecture, le format de compression dans lequel il est stocké, la bande passante de la mémoire de la carte et la maturité de son logiciel d'inférence, ainsi que la longueur de la conversation que vous prévoyez d'avoir avec lui. Avoir l'un de ces éléments incorrects et le nombre qui en ressort semble tout aussi confiant et est simplement incorrect.
Nous ne prétendons pas que cela produise un seul chiffre précis, car ce n'est pas possible. Ce que nous faisons plutôt, c'est exécuter le calcul complet pour chaque CARD et chaque MODEL pour lesquels nous avons des données, publier le résultat sous forme d'une plage plutôt qu'une valeur d'un point de fausse précision, et montrer notre travail - chaque formule derrière chaque nombre sur ce site est écrite à découvert, pas cachée derrière la réponse.
Ce que ce site vous offre réellement
L'ensemble de données le plus complet que nous puissions rassembler : des milliers de GPU et des milliers de modèles de langue, vérifiés les uns contre les autres plutôt que regardés un par un. Commencez par une carte que vous possédez ou envisagez, et voyez chaque modèle qui s'y adapte. Commencez par un modèle que vous souhaitez exécuter, et voyez chaque carte qui peut le supporter.
Cela fonctionne dans les deux sens car le calcul sous-jacent est symétrique - la même arithmétique de mémoire et de bande passante, exécutée de chaque côté que vous connaissez déjà. Aucun des deux sens n'est le "réel" ; ils sont la même réponse posée de deux manières différentes.
En savoir plus sur comment et pourquoi sur notre page à propos.
Nouveaux lancements
Découvrez ces nouveaux GPU puissants.
Parcourez tous les GPUNVIDIA
Oct 2025
Les deux directions
Comment fonctionne la calculatrice
Le même calcul, utilisable de n'importe quel côté de la question à partir duquel vous commencez..
En partant d'un GPU que vous possédez
- 01 Trouvez votre carte GPU . Recherchez dans le catalogue GPU la carte que vous possédez ou envisagez, par nom ou par taille de mémoire.
- 02 Ouvrez sa page . Chaque CARTE a sa propre page répertoriant chaque modèle de langue que nous pouvons évaluer par rapport à elle, avec un chiffre estimé de TOKENS-PAR-SECONDE pour chacun.
- 03 Définissez votre longueur de contexte et votre seuil de qualité . Ajustez la longueur de conversation que vous attendez de travailler et la compression la plus basse que vous accepterez. Les deux changent la réponse en direct.
- 04 Lisez la plage, pas un seul nombre . Chaque estimation est publiée avec une plage de confiance plutôt qu'un chiffre de fausse précision, car la même CARTE et le même MODÈLE varient entre les moteurs d'inférence de manière que aucune fiche technique ne prédit.
À partir d'un modèle que vous souhaitez exécuter
- 01 Trouver le modèle . Recherche dans le catalogue des modèles AI par nom ou par taille — même lorsque le nom lui-même ne précise pas le nombre de paramètres.
- 02 Ouvrez sa page . Un modèle avec des poids ouverts énumère chaque carte graphique contre laquelle nous pouvons l'évaluer, la plus petite qui s'adapte et la plus rapide en premier.
- 03 Définissez votre longueur de contexte et votre seuil de qualité . Les mêmes deux contrôles que le chemin GPU-first — une conversation plus longue nécessite plus de MEMORY, ce qui peut pousser une CARD de "fits" à "does not".
- 04 Comparez les cartes par ce que vous remarquerez réellement . La MÉMOIRE détermine si elle fonctionne ou pas ; la bande passante détermine à quelle vitesse elle se sent une fois qu'elle fonctionne. Le tableau trie par tokens par seconde par défaut car c'est généralement celui qui compte.
Réponses
questions courantes
Comment puis-je calculer si ma GPU peut exécuter un LLM local ?
Trouvez votre carte dans le catalogue GPU et ouvrez sa page - elle liste chaque modèle que nous pouvons évaluer par rapport à elle, si chacun s'adapte dans la mémoire, et une estimation du nombre de jetons par seconde. Vous pouvez également partir d'un modèle et voir quelles cartes peuvent l'exécuter, ce qui est le même calcul dans la direction opposée.
Mon GPU peut-il exécuter des modèles LLM locaux ?
S'il a au moins quelques gigaoctets de mémoire propre, presque certainement quelque chose. Les graphiques intégrés qui partagent la mémoire système sont l'exception principale, car ils n'ont pas de pool dédié pour contenir un modèle. Au-delà de cela, c'est une question de quel modèle, à quelle compression — pas oui ou non.
Qu'est-ce qui détermine les tokens par seconde sur un GPU ?
Générer un jeton signifie lire les poids du modèle depuis la VRAM une fois, donc la vitesse est limitée par la bande passante de la mémoire divisée par la quantité à lire par jeton — ce qui dépend de la taille du modèle, de son architecture et du format de compression dans lequel il est stocké. La vitesse d'horloge et le nombre de cœurs, les chiffres avec lesquels une fiche technique commence, n'ont pratiquement pas d'impact.
Quelle est la précision des estimations sur ce site ?
Attendez-vous à ce que le chiffre réel se situe dans une fourchette d'environ 20 à 40 % de l'estimation. Le même GPU et modèle varient autant entre les moteurs d'inférence, les versions de moteur et les configurations de service — aucun calcul à partir des fiches techniques seules ne peut prédire cela, c'est pourquoi chaque chiffre ici est publié sous forme de plage.
Un GPU plus grand et plus récent est-il toujours plus rapide pour l'IA ?
Pour un modèle qui s'adapte déjà confortablement sur les deux cartes, la bande passante mémoire décide du gagnant, et une carte plus récente en a généralement plus. Mais le goulet d'étranglement le plus courant est la capacité, pas la vitesse — la question la plus utile pour une carte spécifique est généralement "quel est le plus grand modèle qui s'adapte", ce à quoi la page de chaque carte répond directement.
Ai-je besoin de comprendre la quantification pour utiliser ce site ?
Non — chaque page de carte et de modèle choisit la compression de meilleure qualité qui s'adapte réellement, automatiquement. La quantification est la technique qui réduit l'empreinte mémoire d'un modèle à un petit coût pour la qualité de sortie, et vous pouvez définir un seuil de qualité vous-même si vous le souhaitez, mais rien ne l'exige.
D'où viennent les jeux de données des GPU et des modèles AI ?
Spécifications de carte graphique et dossiers de modèles linguistiques couvrant des milliers de modèles open-weight et leurs comptes de paramètres, licences et dates de sortie. Les deux sont mis à jour au fur et à mesure que le nouveau matériel et les modèles sont publiés — voir les catalogues de GPU et de modèles AI pour une couverture complète.
Vente de matériel
Intéressé à devenir un vendeur ?
Listez vos GPU à vendre juste à côté de la réponse à ce qu'ils peuvent réellement exécuter.
Bientôt disponible
Recevez des notifications sur les nouveaux GPU et modèles
Une newsletter arrive bientôt.
Explorer davantage
Parcourir le catalogue complet des GPU ou parcourir le catalogue complet des modèles d'IA. Acheter du matériel ? vérifier le répertoire des vendeurs. Plus de questions sont répondues sur notre page FAQ, ou Contactez-nous directement.