Le catalogue

Modèles d'IA et les GPU qui les exécutent

Chaque grand modèle de langage que nous avons dans notre base de données, avec son nombre de paramètres, qui l'a construit, et si les poids sont suffisamment ouverts pour le télécharger et l'exécuter vous-même. Ouvrez n'importe quel modèle pour voir quels GPU peuvent le supporter, à quelle quantification, et combien de tokens par seconde vous pouvez attendre..

C'est l'inverse de commencer par le matériel. Si vous savez déjà quel modèle vous voulez, c'est ici que vous découvrez ce qu'il faut pour le faire fonctionner. — le catalogue GPU fonctionne à l'inverse, en partant d'une carte que vous possédez déjà.

3,567

modèles en base

1,335

avec des poids ouverts

2,232

fermé ou non déclaré

1,314

organisations

50

pays

Chaque mot doit correspondre à quelque chose, donc plus de mots réduisent la liste. Une taille comme 27b correspond au nombre de paramètres même lorsque le nom ne le mentionne pas..

paramètres N'importe – N'importe

3,567 les modèles correspondent

Mise à jour
Poids Domaine
Claude Opus 5 Anthropic United States of America Jul 2026 Fermé Language, Vision, Multimodal
Gemini 3.5 Flash Cyber Google DeepMind United States of America Jul 2026 Fermé Language, Multimodal, Vision
Gemini 3.5 Flash-Lite Google DeepMind United States of America Jul 2026 Fermé Language, Multimodal, Vision
Gemini 3.6 Flash Google DeepMind United States of America Jul 2026 Fermé Language, Multimodal, Vision
Kimi K3 Moonshot China 2.8T Jul 2026 Fermé Language, Multimodal, Vision
Inkling Thinking Machines United States of America 975B Jul 2026 Ouvert Language, Multimodal, Audio, Video, Vision
Inkling-Small Thinking Machines United States of America 276B Jul 2026 Fermé Language, Multimodal, Audio, Video, Vision
GPT-5.6 Luna OpenAI United States of America Jul 2026 Fermé Multimodal, Language, Vision
GPT-5.6 Sol OpenAI United States of America Jul 2026 Fermé Multimodal, Language, Vision
GPT-5.6 Terra OpenAI United States of America Jul 2026 Fermé Multimodal, Language, Vision
Muse Spark 1.1 Meta AI United States of America Jul 2026 Fermé Language
Grok 4.5 xAI United States of America 1.5T Jul 2026 Fermé Language
Muse Image Meta AI United States of America Jul 2026 Fermé Image generation
GPT-Realtime-2.1-Mini OpenAI United States of America Jul 2026 Fermé
Claude Sonnet 5 Anthropic United States of America Jun 2026 Fermé Language, Multimodal
Solar Open2 250B Upstage Korea (Republic of) 250.3B Jun 2026 Ouvert Language
GLM-5.2 Z.ai (Zhipu AI) China 744B Jun 2026 Ouvert Language
Kimi K2.7 Code Moonshot China 1T Jun 2026 Ouvert Language, Multimodal, Vision
Claude Fable 5 Anthropic United States of America Jun 2026 Fermé Language, Multimodal
Claude Mythos 5 Anthropic United States of America Jun 2026 Fermé Language, Multimodal
North Mini Code Cohere Canada 30B Jun 2026 Ouvert Language
Nemotron 3 Ultra NVIDIA United States of America 550B Jun 2026 Ouvert Language
Gemma 4 12B Google DeepMind United States of America 12B Jun 2026 Ouvert Language, Multimodal, Audio
MAI-Image-2.5 Microsoft United States of America Jun 2026 Fermé Image generation
MAI-Thinking-1 Microsoft United States of America 962B Jun 2026 Fermé Language
MiniMax-M3 MiniMax China Jun 2026 Fermé Language, Multimodal
Claude Opus 4.8 Anthropic United States of America May 2026 Fermé Language
Qwen 3.7 Max Alibaba China May 2026 Fermé Language
Qwen3.7-Max Alibaba China May 2026 Fermé Language
Composer 2.5 Cursor United States of America 1T May 2026 Fermé Language

Étape par étape

Comment découvrir quelle GPU exécute un modèle d'IA

Chaque modèle open-weight ici a déjà été évalué par rapport à chaque carte graphique pour laquelle nous avons des spécifications. Obtenir la réponse prend six étapes..

  1. 01

    Trouver le modèle

    Recherche par nom, ou par taille — taper 27b correspond au compte de paramètres même lorsque le nom ne le mentionne pas. Chaque mot doit correspondre à quelque chose, donc plus de mots affinent encore la liste.

  2. 02

    Resserrez aux modèles que vous pouvez réellement exécuter

    Réglez la disponibilité uniquement aux open weights. Un modèle fermé ne peut pas être téléchargé ou exécuté sur votre propre matériel à aucun prix, donc les filtrer laisse uniquement les modèles pour lesquels une réponse matérielle existe.

  3. 03

    Définissez une plage de taille qui convient à votre matériel

    Utilisez le curseur de paramètres. En gros, un modèle nécessite un peu plus de la moitié d'un gigaoctet par milliard de paramètres au niveau de compression le plus utilisé — donc une carte avec 24 Go de mémoire est confortable jusqu'à environ trente milliards de paramètres.

  4. 04

    Ouvrez le modèle

    Sa page répertorie chaque carte graphique capable de le faire fonctionner, avec la plus petite carte qui convient, la plus rapide, et une estimation du nombre de tokens par seconde pour chacune. C'est l'opposé de partir du matériel, et c'est généralement la direction la plus utile lorsque vous savez déjà quel modèle vous voulez.

  5. 05

    Ajustez la longueur de contexte et la qualité

    Sur la page du modèle, définissez la longueur de conversation à laquelle vous vous attendez à travailler et la compression la plus basse que vous accepterez. Les deux modifient la réponse plutôt que de la filtrer — une longue conversation nécessite considérablement plus de MEMORY qu'une courte, et peut rendre un modèle inaccessible à une CARD qui pourrait autrement le contenir.

  6. 06

    Lisez la plage, pas le seul nombre

    Chaque chiffre de débit comporte une plage de confiance, et la plage est la réponse. Le même modèle sur la même carte varie entre les moteurs d'inférence et entre les versions d'un moteur, de plus que la plupart des différences que vous comparez.

Ce que les chiffres signifient

À quoi sert ce catalogue

Un enregistrement couvrant 3,567 modèles d'apprentissage automatique — qui a construit chacun, où, quand, quelle est sa taille, et si ses poids ont été publiés. C'est plus large qu'une liste de choses que vous pouvez exécuter : un modèle que personne ne peut télécharger a toujours une spécification qui mérite d'être lue, et savoir ce qui existe fait partie de l'évaluation de ce qui vaut la peine d'être exécuté.

Ce qui rend ce catalogue différent d'un index classique, c'est qu'il est associé à un calculateur matériel. Chaque modèle dont les poids sont OPEN et dont la taille est EN REGISTRE a été évalué par rapport à chaque carte graphique pour laquelle nous avons des spécifications. Ouvrez-en un et il vous indique quelles cartes peuvent le faire fonctionner, combien de MÉMOIRE chacune nécessite, et combien de TOKENS par seconde vous pouvez attendre.

Poids ouverts et modèles fermés

Ouvrir les poids

1,335

fermé ou non déclaré

2,232

organisations

1,314

Le fait le plus conséquent concernant un modèle est de savoir si ses poids ont été publiés. Les poids d'un modèle sont les valeurs entraînées qui en font ce qu'il est — des centaines de milliards de nombres obtenus après des mois de calcul. Les publier signifie que quiconque peut télécharger le modèle et l'exécuter sur son propre matériel, de manière permanente, sans compte et sans connexion réseau. Ne pas les publier signifie que le modèle existe uniquement en tant que service, accessible par une interface contrôlée par son propriétaire.

Cette distinction décide de tout le reste sur ce site. Un modèle fermé ne peut être exécuté localement à aucun prix, donc aucun changement de carte GPU ne change la réponse et aucun chiffre de mémoire ne s'applique à cela. Un modèle open weight peut être exécuté par quiconque a un matériel suffisamment grand pour le contenir, ce qui transforme "quel modèle devrais-je utiliser" en une question avec une réponse matérielle.

« Poids ouverts » n'est pas le même que logiciel libre dans le sens que le terme porte habituellement. Le fait que les poids soient téléchargeables ne dit rien sur les données d'entraînement, le code d'entraînement, ou la licence attachée au résultat — certains modèles publiés permettent l'utilisation commerciale librement, d'autres la restreignent. Ce qui est cohérent, c'est que le modèle s'exécute sur votre machine plutôt que sur celle de quelqu'un d'autre.

Ce catalogue contient 3,567 modèles. Parmi ceux-ci, 1,335 avoir des poids ouverts et 2,232 ne pas — à peu près 37 Dans chaque centaine, il y a quelque chose que vous pourriez télécharger aujourd'hui. Là où la licence n'a jamais été enregistrée, nous la comptons comme fermée, sur le principe qu'une licence non déclarée n'est pas une sur laquelle on peut compter.

Que vous dit réellement un compte de paramètres

Les paramètres sont les valeurs apprises à l'intérieur d'un modèle — les nombres ajustés pendant l'entraînement qui codent tout ce qu'il sait. Un modèle décrit comme 8B en a environ huit milliards, et chacun occupe de l'espace dans la mémoire. C'est pourquoi le nombre de paramètres est la colonne qui compte le plus ici : c'est la chose la plus proche d'une déclaration directe de la quantité de matériel dont un modèle a besoin.

La relation est proche de linéaire, mais la constante dépend de la façon dont le modèle est stocké. À pleine précision, chaque paramètre prend deux octets, donc un modèle de huit milliards de paramètres nécessite seize gigaoctets avant que quoi que ce soit d'autre ne soit pris en compte. Comprimé à environ quatre bits — ce que la plupart des gens exécutant des modèles localement utilisent en réalité — le même modèle nécessite plutôt cinq, à un coût modeste et généralement acceptable en précision.

Deux choses compliquent cela. Les modèles de mélange d'experts acheminent chaque jeton à travers seulement une fraction d'eux-mêmes, de sorte qu'ils génèrent du texte à la vitesse de quelque chose de bien plus petit tout en nécessitant chaque paramètre résidant en mémoire — rapide, mais pas bon marché à maintenir. Et la conversation elle-même prend de la mémoire qui grandit à mesure que la conversation se développe, ce qui explique pourquoi un modèle qui s'adapte confortablement aux questions courtes peut échouer sur un long document.

Plus grand n'est pas automatiquement mieux, et de plus en plus cela ne l'est pas. La capacité par paramètre s'est améliorée assez fortement pour qu'un modèle récent à huit milliards de paramètres surpasse régulièrement un ancien modèle plusieurs fois plus grand, tout en tenant sur un matériel que l'ancien modèle n'aurait jamais pu supporter. Trier ce catalogue par date de sortie est généralement un meilleur guide que de le trier par taille.

Comment les modèles de langue sont arrivés ici

Presque tous les modèles de ce catalogue descendent d'une idée architecturale unique publiée en 2017, dans un document intitulé "Attention Is All You Need". Il a introduit le transformeur, qui traite une séquence entière à la fois et apprend quelles parties de celle-ci ont un rapport avec lesquelles — remplaçant les conceptions récurrentes étape par étape qui ont précédé, et se scalant bien mieux qu'elles ne le faisaient. Chaque modèle énuméré ici qui génère du texte est un transformeur ou un proche parent de celui-ci.

Ce qui a suivi était principalement une démonstration que l'architecture continuait à s'améliorer avec l'échelle. Les modèles successifs ont augmenté de plusieurs ordres de grandeur et ont gagné en capacités correspondantes, ce qui a établi le schéma pendant plusieurs années : plus de paramètres, plus de données d'entraînement, plus de calcul. En 2020, les plus grands modèles étaient suffisamment capables pour être commercialement sérieux, et ils n'étaient accessibles que sous forme de services payants — les poids restaient avec ceux qui les avaient entraînés.

Le tournant est venu en 2023, quand plusieurs organisations ont commencé à publier des poids pour des modèles suffisamment bons pour valoir la peine d'être exécutés. Cela a changé la question de "à quel service dois-je m'abonner" à "que peut faire mon propre matériel", et c'est la raison pour laquelle un site comme celui-ci existe. Avant cela, la question matérielle n'avait pas de réponse significative pour la plupart des gens.

Les années qui ont suivi ont été moins axées sur l'échelle et plus sur l'efficacité. De meilleures méthodes d'entraînement, de meilleures données et des travaux architecturaux tels que le routage de mélange d'experts ont tous poussé la capacité par paramètre vers le haut, tandis que la quantification — stocker chaque poids en quatre ou cinq bits au lieu de seize — a réduit la mémoire dont un modèle donné a besoin d'environ trois quarts. Entre eux, des modèles qui nécessitaient autrefois un centre de données fonctionnent désormais sur une carte graphique de bureau, ce qui constitue le développement pratique sur lequel repose tout ce catalogue.

Le catalogue tel qu'il est

Modèle le plus grand

173.9T

pays

50

Le plus grand modèle dans notre base de données est BaGuaLu, atteindre 173.9T paramètres. À cette échelle, un modèle est une infrastructure de centre de données plutôt que quelque chose qu'un poste de travail détient, et la figure est plus utile comme un marqueur de l'emplacement de la frontière que comme une décision d'achat.

Le catalogue couvre le travail de 1,314 organisations, réparties sur 50 pays. Cette répartition mérite d'être remarquée à elle seule : le développement de modèles a cessé d'être concentré dans une poignée de laboratoires il y a quelque temps, et plusieurs des modèles open weight les plus largement utilisés proviennent d'organisations qui n'existaient pas quelques années auparavant.

Les comptes de paramètres sont enregistrés pour 2,315 entrées, hors d'un catalogue contenant 3,567. Les lacunes sont principalement des modèles dont les propriétaires n'ont jamais publié de taille, et occasionnellement des modèles ouverts que personne n'a mesurés. Un modèle sans ce chiffre est répertorié mais ne peut pas se voir attribuer une estimation de mémoire ou de vitesse, puisque chacun de ces calculs commence à partir de cela.

Les entrées commencent dans 1950 et exécutez pour 2026, donc le catalogue est un enregistrement du domaine plutôt qu'un instantané de ce qui est actuel. Filtrer par année de sortie est le moyen le plus rapide de le réduire à des modèles qui valent réellement la peine d'être considérés.

La frontière

Les dix plus grands modèles d'IA à poids ouvert

Les plus grands modèles que quiconque peut réellement télécharger, les plus récents d'abord lorsque les tailles se lient. Ce sont les limites supérieures de ce qui est exécutable sur votre propre matériel — bien qu'à cette échelle, cela signifie généralement plusieurs CARDS plutôt qu'une seule..

  1. 01 DeepSeek-V4-Pro DeepSeek · Apr 2026 1.6T
  2. 02 QMoE: compressed SwitchTransformer Institute of Science and Technology Austria (ISTA),Neural Magic · Oct 2023 1.6T
  3. 03 Switch Google · Jan 2021 1.6T
  4. 04 MoE-1.1T Meta AI · Dec 2021 1.1T
  5. 05 Kimi K2.7 Code Moonshot · Jun 2026 1T
  6. 06 Kimi K2.6 Moonshot · Apr 2026 1T
  7. 07 Kimi K2.5 Moonshot · Feb 2026 1T
  8. 08 MiMo-V2.5-Pro Xiaomi Corp · Apr 2026 1T
  9. 09 Kimi K2 Thinking Moonshot · Nov 2025 1T
  10. 10 Ring-1T Ant Group · Oct 2025 1T

Les sorties open-weight les plus récentes

Les dernières additions avec des poids publiés. La capacité par paramètre s'est améliorée régulièrement, donc un modèle récent est généralement une meilleure utilisation de la même mémoire qu'un modèle plus ancien et plus grand..

  1. Inkling 975B Jul 2026
  2. Solar Open2 250B 250.3B Jun 2026
  3. GLM-5.2 744B Jun 2026
  4. Kimi K2.7 Code 1T Jun 2026
  5. North Mini Code 30B Jun 2026
  6. Nemotron 3 Ultra 550B Jun 2026
  7. Gemma 4 12B 12B Jun 2026
  8. Mistral Medium 3.5 128B Apr 2026
  9. DeepSeek-V4-Pro 1.6T Apr 2026
  10. DeepSeek-V4-Flash 284B Apr 2026

Lecture du tableau

Comment lire ce catalogue

paramètres
Le nombre total de valeurs apprises, écrit de la manière dont le domaine l'écrit : 8B est huit milliards, 1.6T est 1.6 trillion. C'est le total, pas le nombre utilisé par mot — les modèles mixture-of-experts utilisent seulement une fraction par token mais doivent toujours garder tout cela dans la mémoire.
Ouvrir les poids
Que les valeurs entraînées peuvent être téléchargées et exécutées sur votre propre matériel. Un modèle fermé n'est accessible que par son fournisseur, donc aucune carte graphique ne le rend exécutable localement. Lorsque la licence n'a jamais été enregistrée, nous le considérons comme fermé plutôt que de supposer le contraire.
Domaine et tâche
Ce à quoi le modèle a été conçu pour fonctionner. Un modèle peut en porter plusieurs de chaque, c'est pourquoi choisir un domaine réduit la liste des tâches plutôt que de la remplacer.
Organisation et pays
Qui a publié le modèle et où ils sont basés. Utile lorsque un déploiement doit satisfaire une règle concernant l'origine d'un modèle.
Nouvelles versions
Lorsque le modèle a été publié. Généralement un meilleur indicateur de qualité que la taille, car la capacité par paramètre s'est améliorée si rapidement.

Réponses

questions courantes

01

Comment savoir quelle GPU peut exécuter un modèle AI donné ?

Trouvez le modèle dans le tableau ci-dessus et ouvrez-le. Sa page répertorie chaque GPU CARTE dans notre catalogue qui peut le contenir, avec la MÉMOIRE dont chacun a besoin, la compression à laquelle il fonctionnerait et une estimation du nombre de jetons par seconde. Vous pouvez également l'aborder dans l'autre sens et partir d'une carte que vous possédez déjà.

02

Combien de modèles AI sont dans cette base de données ?

Le catalogue contient 3,567 modèles. Poids ouverts, téléchargeables et exécutables sur votre propre matériel, couvrent 1,335 d'eux. 2,232 sont fermés, ou leur licence n'a jamais été enregistrée.

03

Quelle est la différence entre un modèle open weight et un modèle fermé ?

Un modèle à poids ouvert a publié ses valeurs entraînées, de sorte que quiconque peut le télécharger et l'exécuter sur sa propre machine, indéfiniment et hors ligne. Un modèle fermé n'existe que comme un service contrôlé par son propriétaire. Seuls les modèles à poids ouvert ont une exigence matérielle significative, c'est pourquoi les modèles fermés sur ce site portent une spécification mais pas de tableau de carte GPU.

04

Les poids ouverts sont-ils les mêmes que le code source ouvert ?

Pas tout à fait. Les poids publiés ne disent rien sur les données d'entraînement, le code d'entraînement ou la licence attachée au résultat — certains permettent l'utilisation commerciale librement, d'autres la restreignent. Ce qu'ils garantissent, c'est que le modèle fonctionne sur votre matériel plutôt que sur celui de quelqu'un d'autre, ce qui est la partie qui compte pour ce site.

05

Qui construit ces modèles d'IA ?

Le catalogue couvre 1,314 organisations, réparties sur 50 pays — groupes universitaires, laboratoires indépendants et les branches de recherche des grandes entreprises technologiques. Le développement de modèles a cessé d'être concentré dans quelques endroits il y a quelque temps, et plusieurs modèles open weight largement utilisés proviennent d'organisations qui n'ont que quelques années.

06

Quel est le plus grand modèle d'IA ?

Le plus grand dans notre base de données est BaGuaLu, atteindre 173.9T Paramètres. À cette taille, un modèle est une infrastructure de datacentre plutôt que quelque chose qu'une seule carte graphique détient — les plus grands modèles open-weight qui tiennent sur une carte sont considérablement plus petits et sont répertoriés plus bas sur cette page.

07

Que signifient les paramètres ?

Les paramètres sont les valeurs apprises à l'intérieur d'un modèle, et leur nombre est la chose la plus proche d'une déclaration directe de la quantité de mémoire dont il a besoin. Une estimation approximative est un peu plus de la moitié d'un gigaoctet par milliard de paramètres avec la compression que la plupart des gens utilisent — donc un modèle à huit milliards de paramètres est confortable sur huit gigaoctets, et trente milliards ont besoin d'environ vingt-quatre.

08

Un plus grand modèle AI est-il toujours meilleur ?

Non, et de plus en plus non. La capacité par paramètre s'est considérablement améliorée, donc un modèle récent à huit milliards de paramètres surpasse souvent un ancien plusieurs fois plus grand tout en s'adaptant à du matériel que l'ancien ne pourrait jamais. Trier par date de sortie est généralement un meilleur indicateur que trier par taille.

09

Qu'est-ce qu'un modèle de mélange d'experts ?

Un modèle qui fait passer chaque jeton uniquement par une fraction de lui-même plutôt que par chaque paramètre. Cela lui permet de générer du texte à la vitesse d'un modèle beaucoup plus petit — mais chaque expert doit toujours être présent en mémoire, donc il est rapide sans être bon marché à maintenir. Le catalogue indique le nombre total de paramètres, qui est le chiffre déterminant s'il s'adapte.

10

Pourquoi certains modèles n'ont-ils pas de comptage de paramètres ?

Parce que l'organisation n'en a jamais publié. C'est courant pour les modèles fermés et cela arrive parfois avec les ouverts. Les décomptes sont enregistrés pour 2,315 entrées, hors d'un catalogue contenant 3,567. Nous listons le reste plutôt que de les cacher, mais aucun chiffre de mémoire ou de vitesse ne peut être produit sans ce nombre.

11

Puis-je exécuter ces modèles sans connexion Internet ?

Tout modèle OPEN WEIGHT, oui — c'est le but des poids publiés. Une fois téléchargé, il fonctionne entièrement sur votre propre machine sans compte ni réseau. Les modèles fermés ne peuvent pas être exécutés hors ligne du tout, car vous ne détenez jamais le modèle lui-même.

12

Quelle est la précision des estimations matérielles sur ce site ?

Ils sont calculés à partir des spécifications plutôt que mesurés, et chaque chiffre est publié sous forme d'une plage plutôt qu'un seul nombre. Le même modèle et la même carte varient de trente à cinquante pour cent selon le logiciel d'inférence utilisé et quelle version de celui-ci, ce qu'aucun calcul à partir des spécifications ne peut prédire. Considérez la plage comme la réponse honnête.

13

J'ai déjà une carte graphique. Puis-je chercher à l'envers ?

Oui. Le catalogue GPU liste chaque carte pour laquelle nous avons des spécifications, et la page de chaque carte nomme chaque modèle qu'elle peut exécuter, du plus rapide au plus lent. C'est le même calcul considéré du côté matériel.

L'autre direction

Regardez-le de l'autre côté ?

Cette page commence par le modèle et demande quel matériel il nécessite. Si vous possédez déjà une carte et souhaitez savoir ce qu'elle fera tourner, commencez par là à la place. — liste chaque carte dans notre base de données, et chacune nomme les modèles qu'elle peut exécuter, les plus rapides en premier.

GPUs