Le catalogue

Calculateur TPS GPU

Déterminez combien de TOKENS par seconde chaque carte graphique produit sur un modèle AI local. Filtrez le catalogue ci-dessous pour les cartes qui valent la peine d'être considérées, puis ouvrez-en une pour voir chaque modèle de langue qu'elle peut exécuter, combien de mémoire chacun nécessite et à quelle vitesse il est susceptible d'être..

818

cartes sur fichier

4

fabricants

4 GB – 288 GB

plage de VRAM

8,190 GB/s

la plus haute bande passante

Chaque mot doit correspondre à quelque chose, donc plus de mots réduisent la liste. Une capacité telle que 24 Go correspond à la mémoire de la carte même si aucune colonne ne l'enregistre sous forme de texte..

818 cartes correspondent

Mise à jour
Type de mémoire Puissance
B300 NVIDIA · Blackwell Ultra 288 GB 8,000 GB/s 2.03 GHz 1.67 GHz Sep 2025 HBM3e 1,400 W
Radeon Instinct MI350X AMD · CDNA 4.0 288 GB 8,190 GB/s 2.2 GHz 1 GHz Jan 2025 HBM3e 1,000 W
Radeon Instinct MI355X AMD · CDNA 4.0 288 GB 8,190 GB/s 2.4 GHz 1 GHz Jan 2025 HBM3e 1,400 W
Radeon Instinct MI325X AMD · CDNA 3.0 256 GB 6,000 GB/s 2.1 GHz 1 GHz Oct 2024 HBM3e 1,000 W
Radeon Instinct MI300X AMD · CDNA 3.0 192 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
Radeon Instinct MI308X AMD · CDNA 3.0 192 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
B200 NVIDIA · Blackwell 180 GB 8,000 GB/s 1.97 GHz 700 MHz Jan 2024 HBM3e 1,000 W
H200 NVL NVIDIA · Hopper 141 GB 4,890 GB/s 1.79 GHz 1.37 GHz Nov 2024 HBM3e 600 W
H200 SXM 141 GB NVIDIA · Hopper 141 GB 4,890 GB/s 1.98 GHz 1.5 GHz Nov 2024 HBM3e 700 W
Data Center GPU Max 1550 Intel · Generation 12.5 128 GB 3,280 GB/s 1.6 GHz 900 MHz Jan 2023 HBM2e 600 W
Data Center GPU Max Subsystem Intel · Generation 12.5 128 GB 3,210 GB/s 1.6 GHz 900 MHz Jan 2023 HBM2e 2,400 W
GB10 NVIDIA · Blackwell 2.0 128 GB 273 GB/s 2.42 GHz 1.67 GHz Oct 2025 LPDDR5X 140 W
Jetson T5000 NVIDIA · Blackwell 128 GB 273 GB/s 2.53 GHz 1.67 GHz Aug 2025 LPDDR5X 40 W
Radeon Instinct MI250 AMD · CDNA 2.0 128 GB 3,280 GB/s 1.7 GHz 1 GHz Nov 2021 HBM2e 500 W
Radeon Instinct MI250X AMD · CDNA 2.0 128 GB 3,280 GB/s 1.7 GHz 1 GHz Nov 2021 HBM2e 500 W
Radeon Instinct MI300 AMD · CDNA 3.0 128 GB 6,550 GB/s 1.7 GHz 1 GHz Jan 2023 HBM3 600 W
Radeon Instinct MI300A AMD · CDNA 3.0 128 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
Data Center GPU Max 1350 Intel · Generation 12.5 96 GB 2,460 GB/s 1.55 GHz 750 MHz Jan 2023 HBM2e 450 W
H100 PCIe 96 GB NVIDIA · Hopper 96 GB 3,360 GB/s 1.84 GHz 1.67 GHz Mar 2023 HBM3 700 W
H100 SXM5 96 GB NVIDIA · Hopper 96 GB 3,360 GB/s 1.98 GHz 1.35 GHz Mar 2023 HBM3 700 W
RTX PRO 6000 Blackwell NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.62 GHz 1.59 GHz Mar 2025 GDDR7 600 W
RTX PRO 6000 Blackwell Max-Q NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.28 GHz 1.04 GHz Mar 2025 GDDR7 300 W
RTX PRO 6000 Blackwell Server NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.62 GHz 1.59 GHz Mar 2025 GDDR7 600 W
RTX PRO 6000D Blackwell Max-Q NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.29 GHz 1.59 GHz Mar 2025 GDDR7 300 W
H100 NVL 94 GB NVIDIA · Hopper 94 GB 3,940 GB/s 1.79 GHz 1.08 GHz Mar 2023 HBM3 400 W
H100 SXM5 94 GB NVIDIA · Hopper 94 GB 3,360 GB/s 1.98 GHz 1.35 GHz Mar 2023 HBM3 700 W
RTX 6000D NVIDIA · Blackwell 2.0 84 GB 1,570 GB/s 2.43 GHz 1.59 GHz Mar 2025 GDDR7 600 W
A100 PCIe 80 GB NVIDIA · Ampere 80 GB 1,940 GB/s 1.41 GHz 1.07 GHz Jun 2021 HBM2e 300 W
A100 SXM4 80 GB NVIDIA · Ampere 80 GB 2,040 GB/s 1.41 GHz 1.28 GHz Nov 2020 HBM2e 400 W
A100X NVIDIA · Ampere 80 GB 2,040 GB/s 1.44 GHz 795 MHz Jun 2021 HBM2e 300 W

Étape par étape

Comment calculer le TPS de votre GPU

Rien ici n'a besoin d'être résolu à la main. Le catalogue ci-dessus contient déjà chaque carte, et chaque page de carte contient déjà chaque modèle qu'elle peut exécuter avec un chiffre de tokens-par-seconde attaché. Pour arriver à votre réponse, il faut six étapes..

  1. 01

    Réduire le catalogue aux cartes à considérer

    Utilisez les filtres ci-dessus pour définir ce dont vous avez réellement besoin : une taille de mémoire minimum, un fabricant, un plafond de puissance que votre alimentation peut fournir, ou une année de sortie. La mémoire est le filtre avec lequel commencer, car elle détermine quels modèles sont possibles.

  2. 02

    Ou cherchez une carte que vous possédez déjà

    Tapez le nom dans la boîte de recherche. Chaque mot doit correspondre à quelque chose, donc plus de mots restreignent la liste, et une capacité telle que 24 Go correspond à la mémoire de la carte même si aucune colonne ne l'enregistre en tant que texte.

  3. 03

    Trier par la spécification qui détermine votre résultat

    Trier par mémoire si la question est quels modèles s'adaptent, ou par bande passante si la question est à quelle vitesse ils fonctionneront. Les fréquences d'horloge et le nombre de cœurs sont listés pour des raisons de complétude mais affectent à peine la génération de texte.

  4. 04

    Ouvrir la carte

    Chaque carte a sa propre page répertoriant chaque modèle de langage qu'elle peut exécuter, avec les jetons estimés par seconde, la mémoire dont chaque modèle a besoin et la compression à laquelle il fonctionne.

  5. 05

    Définissez votre context length et la qualité minimale

    Sur la page de la carte, définissez la longueur de conversation que vous attendez de travailler et la compression la plus basse que vous êtes prêt à accepter. Les deux modifient la réponse plutôt que de la filtrer — une conversation plus longue nécessite plus de MEMORY, ce qui peut pousser un grand modèle hors de la carte entièrement.

  6. 06

    Lisez la plage, pas le seul nombre

    Chaque chiffre de performance est publié avec une plage de confiance autour de lui. Prenez la plage comme réponse : la même carte et le même modèle varient entre les moteurs d'inférence et les versions de manières qu'aucune fiche technique ne prédit, et le chiffre principal n'est que le milieu de cette fourchette.

Ce que les chiffres signifient

À quoi sert ce catalogue

Ceci est une base de données contenant 818 cartes graphiques, filtrées pour ne garder que celles disposant de suffisamment de mémoire pour contenir un modèle de langue. Chaque carte a sa propre page, et sur cette page, chaque modèle que nous suivons a été évalué par rapport à elle — s'il s'adapte, avec quel degré de compression, et combien de tokens par seconde il est susceptible de produire.

Le calcul s'exécute lorsque vous ouvrez une CARTE plutôt que d'être consulté à partir d'une table stockée, ce qui permet à la LONGUEUR DE CONTEXTE et à la QUALITÉ MINIMALE d'être des éléments que vous définissez plutôt que des éléments que nous avons supposés en votre nom. Changer l'un ou l'autre et chaque chiffre est recalculé.

Pourquoi le nombre de tokens par seconde est-ce qui compte

Faire fonctionner un modèle linguistique sur votre propre matériel est devenu une chose ordinaire à faire en peu de temps. Les modèles open weight ont rattrapé leur retard au point d'être réellement utiles, et les outils pour les exécuter n'ont plus besoin d'une formation en recherche. Ce qui n'est pas arrivé en même temps, c'est une réponse claire à la première question que tout le monde pose : fonctionnera-t-il sur la carte que j'ai déjà, et sera-t-il assez rapide pour valoir la peine d'être utilisé.

Les fiches techniques ne le répondent pas. Elles sont écrites pour les charges de travail graphiques et commencent par les chiffres qui décident des taux de trame, qui sont presque entièrement les mauvais. Les deux chiffres qui décident réellement du résultat sont la capacité de mémoire, qui détermine si un modèle s'adapte, et la bande passante de mémoire, qui détermine à quelle vitesse il génère une fois qu'il le fait.

Les tokens par seconde est le nombre qui exprime le résultat en quelque chose que vous pouvez ressentir. La vitesse de lecture est d'environ dix tokens par seconde, donc tout ce qui dépasse ce chiffre arrive plus vite que vous ne pouvez le lire et tout ce qui est bien en dessous donne l'impression d'attendre. C'est la valeur que ce site calcule, pour chaque combinaison de carte et de modèle qu'il contient.

Ce que le catalogue couvre

plage de VRAM

4 GB – 288 GB

la plus haute bande passante

8,190 GB/s

Plage de puissance

6 – 2,400 W

La mémoire dans le catalogue commence à 4 GB et atteint 288 GB. Cette plage est la différence entre une CARTE limitée aux plus petits modèles utilisables et une qui peut contenir des modèles qu'aucune machine de bureau ne peut toucher — la capacité est un seuil strict plutôt qu'un compromis graduel, donc un modèle soit s'ajuste, soit ne fonctionne pas.

La bande passante de la mémoire commence à 10 GB/s et atteint 8,190 GB/s, une figure détenue par Radeon Instinct MI355X. Parce que générer chaque jeton signifie lire l'ensemble du modèle hors de la mémoire une fois, cette dispersion se traduit presque directement par une dispersion dans la vitesse de génération : une CARTE avec dix fois la BANDE PASSANTE produit des jetons environ dix fois plus rapidement sur le même modèle.

Les cartes dans le catalogue sont fabriquées par AMD, ATI, Intel and NVIDIA. Le fabricant compte plus qu'il ne le devrait : le logiciel d'inférence a reçu beaucoup plus d'attention sur le chemin CUDA que sur tout autre, donc une carte AMD ou Intel d'une bande passante équivalente atteint généralement une part plus petite de son plafond théorique. Nos estimations appliquent une pénalité pour cela plutôt que de prétendre que le matériel est la seule variable.

La consommation d'énergie commence à 6 W et atteint 2,400 W. La limite supérieure est le matériel de datacentre qu'une alimentation de bureau ne peut pas alimenter, et c'est la contrainte que les gens ont tendance à découvrir en dernier — après que la carte rentre dans le budget et le boîtier.

Les dates de sortie commencent le 2009 et exécutez pour 2025, Donc, le catalogue couvre le matériel que les gens possèdent encore ainsi que le matériel qu'ils pourraient acheter. Une carte plus ancienne n'est pas exclue pour être vieille — si elle a la MEMORY, elle peut toujours exécuter un modèle, et la page indiquera à quelle vitesse.

Acheter une carte

Les fournisseurs peuvent listé des cartes à vendre contre n'importe quelle entrée de ce catalogue, donc une page de carte peut montrer à la fois ce que le matériel peut exécuter et où il peut être acheté. Les annonces sont attachées à la variante de carte spécifique plutôt qu'à un nom de modèle, ce qui est ici plus important que d'habitude — le même nom couvre souvent plusieurs capacités de mémoire, et la capacité est ce qui décide quels modèles fonctionnent.

Tableaux de classement

Lecture du tableau

Comment lire ce catalogue

Mémoire
Combien la carte peut-elle contenir. Un guide approximatif est un peu plus de la moitié d'un gigaoctet par milliard de paramètres avec la compression que la plupart des gens utilisent, plus de la place pour la conversation. Tout n'est pas disponible — le logiciel d'inférence réserve environ un dixième pour son propre espace de travail.
Bande passante
À quelle vitesse la carte lit sa propre mémoire, en gigaoctets par seconde. C'est le meilleur prédicteur de la vitesse de génération sur ce site.
Fréquence de Boost et fréquence de base
À quelle vitesse le processeur fonctionne. Liste pour complétude, et bien moins prédictif ici que sur un benchmark de jeu : la génération attend sur la MÉMOIRE, pas sur l'arithmétique.
Type de mémoire et interface de bus
La technologie de mémoire et comment la carte se connecte à la machine. Les composants HBM sont du matériel de datacentre avec beaucoup plus de bande passante que le GDDR utilisé sur les cartes de bureau. L'interface de bus détermine la rapidité avec laquelle un modèle se charge, et non la rapidité avec laquelle il s'exécute.
Puissance
La consommation nominale de la carte en watts. Il vaut la peine de filtrer lorsque l'alimentation ou le boîtier est déjà décidé, car les cartes les plus grandes ont besoin de considérablement plus que ce qu'un bureau typique fournit.
Pourquoi une carte apparaît plus d'une fois
Chaque ligne est une variante de carte plutôt qu'une puce, donc le même nom peut apparaître à plusieurs capacités de mémoire. Cette distinction est plus importante ici qu'ailleurs, car la capacité décide si un modèle fonctionne.

Réponses

questions courantes

01

Comment puis-je calculer les TOKENS par seconde de ma GPU ?

Vous n'avez pas à le faire. Trouvez votre carte dans le tableau ci-dessus — le catalogue contient 818 d'eux — et ouvrez-le. Sa page répertorie chaque modèle de langue qu'il peut exécuter avec un chiffre estimé de tokens par seconde pour chacun, calculé à partir de la bande passante de mémoire de la carte et de la taille du modèle une fois compressé.

02

Quel est un bon nombre de tokens par seconde pour exécuter de l'IA localement ?

La vitesse de lecture est d'environ dix tokens par seconde, donc tout ce qui est au-dessus produit du texte plus rapidement que vous ne pouvez le lire et donne une impression d'immédiateté. Entre cinq et dix est utilisable mais noticeably lent. En dessous de cinq est inconfortable pour la conversation, bien que convenable pour le travail que vous laissez en cours d'exécution.

03

Quelle spécification de GPU est la plus importante pour l'IA ?

Capacité de mémoire d'abord, car l'ensemble du modèle doit être maintenu sur la carte avant qu'il puisse générer quoi que ce soit, et bande passante ensuite, car générer chaque token signifie lire ce modèle de la mémoire une fois. Les nombres de cœurs et les vitesses d'horloge décident des performances graphiques et sont à peine pertinents ici.

04

Combien de VRAM ai-je besoin pour faire fonctionner un modèle de langue ?

Environ un peu plus de la moitié d'un gigaoctet par milliard de paramètres avec la compression que la plupart des gens utilisent, plus de la place pour la conversation. Cela permet à un modèle de huit milliards de paramètres de fonctionner facilement sur huit gigaoctets et à un modèle de trente milliards sur vingt-quatre. Les CARTES de ce catalogue commencent à 4 GB et atteindre 288 GB.

05

Combien de cartes graphiques sont dans cette base de données ?

Le catalogue contient 818 cartes fait par AMD, ATI, Intel and NVIDIA. Les graphiques intégrés sont exclus car ils n'ont pas de mémoire propre, tout comme les cartes de moins de quatre gigaoctets, sur lesquelles aucun modèle de notre catalogue ne fait fit à aucune compression.

06

Quelle GPU a la plus haute bande passante de mémoire ?

Cela est Radeon Instinct MI355X, atteindre 8,190 GB/s. Puisque la vitesse de génération suit presque directement la bande passante, elle fait également partie des cartes les plus rapides ici pour produire du texte — bien que cela dépende d'abord de savoir si votre modèle s'adapte.

07

Quelle GPU a le plus de mémoire ?

Cela est Radeon Instinct MI355X, tenue 288 GB. La capacité à ce niveau appartient au territoire des centres de données, et c'est ce qui permet aux plus grands modèles open weight d'être hébergés sur une seule carte plutôt que d'être répartis sur plusieurs.

08

Une carte graphique de jeu est-elle suffisamment bonne pour l'IA locale ?

Pour une personne à la fois, généralement oui, et souvent un meilleur rapport qualité-prix que le matériel de datacentre. Les cartes grand public abandonnent de la mémoire totale plutôt que de la vitesse, donc la limite est quels modèles s'intègrent plutôt que la rapidité avec laquelle ils fonctionnent une fois qu'ils le font.

09

Le fabricant a-t-il de l'importance pour les performances de l'IA ?

Plus qu'il ne le devrait. Le logiciel d'inférence a eu beaucoup plus de travail investi dans le chemin CUDA que dans les alternatives, donc une carte AMD ou Intel de bande passante équivalente atteint généralement une part plus petite de son plafond théorique. Nos estimations appliquent une pénalité pour cela plutôt que de supposer que le matériel est la seule variable.

10

Puis-je utiliser deux cartes graphiques ensemble ?

Oui, et c'est souvent le point — deux CARDS détiennent des modèles que aucune ne pourrait tenir seule. Cela ne double pas la vitesse de génération comme cela double la mémoire, et chaque chiffre sur ce site décrit une seule CARD à elle seule.

11

Quelle est la précision de ces estimations de TPS ?

Ils sont calculés à partir des spécifications plutôt que mesurés, et chacun est publié avec une plage plutôt qu'un seul nombre. La même CARTE et le même MODÈLE varient de trente à cinquante pour cent selon le logiciel d'inférence que vous utilisez et quelle version de celui-ci, ce qu'aucun calcul à partir des fiches techniques ne peut prédire. Considérez la plage comme la réponse honnête.

12

Je sais quel modèle je veux. Puis-je chercher l'autre sens ?

Oui. La section des modèles d'IA répertorie chaque modèle sur le fichier, et la page de chaque modèle nomme les cartes graphiques qui peuvent le faire fonctionner, des plus petites aux plus rapides. C'est le même calcul abordé par l'autre bout.

L'autre direction

Regardez-le de l'autre côté ?

Cette page commence par le matériel. Si vous savez déjà quel modèle vous voulez exécuter et avez besoin de savoir ce qu'il faut, commencez plutôt par là. — liste tous les modèles dans notre base de données, et chacun d'eux nomme les cartes qui peuvent les exécuter.

Modèles d'IA